横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论有点意外

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论有点意外

最近 V2EX 上有个帖子问"程序需要用 API 在哪里买",下面一堆人在讨论价格和稳定性。正好我最近在做模型选型,就把手头的测试整理出来,顺便把成本算清楚。

测试对象:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3。Gemini 2.5 Pro 和 Grok 4 也跑了部分场景,会在对应位置提到。


测试方法

统一用 OpenAI 格式的 API 调用,temperature 固定 0.2,每个场景跑 3 次取中位结果。测试时间:2025 年 7 月初。


场景一:代码补全与 Bug 定位

测试题:一段 Python 异步代码,有一个经典的 asyncio.gather 异常吞噬问题,外加一个隐藏的竞态条件。


async def fetch_all(urls):

    results = await asyncio.gather(*[fetch(u) for u in urls])

    return results

问题是 gather 默认 return_exceptions=False,任意一个 task 抛异常会取消其他 task,但调用方没有处理这个情况。

结果:

  • DeepSeek V3:直接定位到 return_exceptions 参数问题,给出了修复方案,还顺带提了 asyncio.TaskGroup(Python 3.11+)的替代写法。速度最快,响应约 2 秒。
  • Claude Sonnet 4.5:定位准确,解释最详细,把竞态条件也单独拎出来分析了,给了两种修复思路并说明了各自的 trade-off。
  • GPT-4.1:也找到了主要问题,但对竞态条件的描述比较模糊,需要追问才展开。

小结:代码 debug 场景,三者都能用,DeepSeek V3 速度优势明显,Claude 4.5 解释质量最高。


场景二:长文档理解(RAG 前置处理)

测试题:喂入一份 12000 token 的技术文档(某开源项目的架构设计文档),要求提取关键决策点、识别潜在风险、输出结构化摘要。

结果:

  • Claude Sonnet 4.5:输出结构最清晰,对"潜在风险"的识别有几条是文档里没有明说但可以推断出来的,属于真正的理解而不是复述。
  • GPT-4.1:摘要质量不错,但风险识别基本停留在文档显式提到的内容,推断能力弱一些。
  • DeepSeek V3:在长文档场景下偶尔会漏掉文档后半段的内容,跑了 3 次有 1 次出现这个问题。

Gemini 2.5 Pro 补充:这个场景 Gemini 表现很好,100 万 token 上下文是真实优势,处理超长文档时比其他模型稳定。


场景三:数学推理

测试题:一道组合数学题 + 一道需要建模的概率题(不贴原题了,难度大概是竞赛入门级)。

结果:

  • Claude Sonnet 4.5:两道都对,推理链路清晰,中间步骤有验证。
  • GPT-4.1:组合题对,概率题建模思路正确但最后计算出了小错误。
  • DeepSeek V3:两道都对,推理步骤比 Claude 简洁,但结论可靠。

Grok 4 补充:数学推理是 Grok 4 的强项,这两道题也都答对了,推理过程最详细。


场景四:成本计算(这才是重点)

光看能力不够,API 成本直接决定项目能不能跑起来。

以下是官方价格 vs 通过无量Api(SVIP 7.7 折)的实际价格对比:

| 模型 | 官方输入价(/M tokens) | 官方输出价(/M tokens) | 无量Api SVIP 输入价 | 无量Api SVIP 输出价 |

|------|------------------------|------------------------|--------------------|--------------------|

| Claude Sonnet 4.5 | ¥21 | ¥105 | ¥7.5 | ¥37.5 |

| GPT-4.1 | ¥14 | ¥56 | ¥5.1 | ¥20.4 |

| DeepSeek V3 | ¥2 | ¥8 | ¥0.7 | ¥2.9 |

| Gemini 2.5 Pro | ¥18 | ¥72 | ¥6.5 | ¥26 |

| Grok 4 | ¥42 | ¥168 | ¥15.3 | ¥61.3 |

实际场景估算:假设你在做一个 RAG 应用,每天处理 500 次查询,平均每次 2000 token 输入 + 500 token 输出:

  • 用 Claude Sonnet 4.5 官方:每月约 ¥1,890
  • 用无量Api SVIP:每月约 ¥675,省了 ¥1,215

如果用 DeepSeek V3 做同样的事:每月官方约 ¥180,无量Api 约 ¥63。DeepSeek 本来就便宜,再打折之后几乎可以忽略不计。


综合对比表

| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |

|------|------------------|---------|-------------|

| 代码 Debug | ★★★★☆ | ★★★☆☆ | ★★★★☆ |

| 长文理解 | ★★★★★ | ★★★★☆ | ★★★☆☆ |

| 数学推理 | ★★★★★ | ★★★★☆ | ★★★★☆ |

| 响应速度 | ★★★☆☆ | ★★★★☆ | ★★★★★ |

| 性价比(官方) | ★★☆☆☆ | ★★★☆☆ | ★★★★★ |

| 性价比(无量Api) | ★★★★☆ | ★★★★☆ | ★★★★★ |


结论

没有"最好的模型",只有"最适合场景的模型":

  • 日常代码辅助、快速迭代:DeepSeek V3,速度快、成本低,够用。
  • 需要深度理解和推理的任务:Claude Sonnet 4.5,贵但值,用无量Api 打完折之后接受度高很多。
  • 通用场景、不想折腾:GPT-4.1,生态最成熟,工具调用稳定。
  • 超长上下文:Gemini 2.5 Pro,100 万 token 窗口是真实优势。

国内直连这些模型一直是个麻烦事,我现在用的是 无量Api,300+ 模型统一 OpenAI 格式,改一行 base_url 就能切换,注册送 ¥1 余额可以先试试手感。SVIP 是 7.7 折,上面的价格表就是按这个算的,余额永久有效不用担心过期浪费。


数据基于 2025 年 7 月初测试,模型版本和价格可能随时更新,以官方和平台实时为准。