横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

最近 V2EX 上关于 Codex、GPT-5、Claude 的讨论明显多了起来,尤其是有人问"回国之后怎么用"、"5.5 pro deepresearch 效果如何"这类问题。正好我这段时间在做项目,顺手用同一批测试任务跑了三个模型,把结果整理出来。

测试模型:Claude Sonnet 4.5 / GPT-5 / DeepSeek V3(Gemini 2.5 Pro 和 Grok 4 作为参照)


测试场景设计

我选了四个日常开发和研究中最常遇到的场景,每个场景用完全相同的 prompt 跑三遍取中位结果。


场景一:定位一个真实 Bug

任务:给一段 Python 异步代码,里面有一个 asyncio.gather 的竞态条件,让模型找出问题并修复。

| 模型 | 是否定位到根因 | 修复质量 | 解释清晰度 |

|------|------------|--------|---------|

| Claude Sonnet 4.5 | ✅ 精准 | 给出了两种修复方案,并说明了各自的适用场景 | ⭐⭐⭐⭐⭐ |

| GPT-5 | ✅ 精准 | 修复正确,但只给了一种方案 | ⭐⭐⭐⭐ |

| DeepSeek V3 | ⚠️ 找到了表层问题,漏掉了深层竞态 | 修复不完整 | ⭐⭐⭐ |

小结:这类需要理解异步执行上下文的 bug,Claude 4.5 的表现最稳,GPT-5 紧随其后。DeepSeek V3 在这个场景有点吃亏,可能和训练数据里异步并发的复杂案例偏少有关。


场景二:长文档理解(40k token 合同)

任务:上传一份 40k token 的英文采购合同,提取所有违约条款,并按严重程度排序。

| 模型 | 上下文窗口 | 提取完整度 | 排序逻辑 |

|------|---------|---------|--------|

| Claude Sonnet 4.5 | 200k | 98%,漏了 1 条嵌套条款 | 逻辑清晰,给出了依据 |

| GPT-5 | 128k | 95%,漏了 2 条 | 排序合理,但依据较简略 |

| DeepSeek V3 | 64k | 文档超出窗口,需要分段处理 | — |

小结:长文档场景 Claude 4.5 的 200k 窗口优势明显。DeepSeek V3 的 64k 窗口在这个任务上直接受限,需要额外的分段逻辑,工程成本上去了。


场景三:数学推理(竞赛级别)

任务:AMC 12 难度的组合数学题,5 道,要求给出完整推导过程。

| 模型 | 正确率 | 推导过程 | 是否有错误步骤但结论对 |

|------|------|--------|-----------------|

| Claude Sonnet 4.5 | 3/5 | 详细,步骤可追溯 | 1 题 |

| GPT-5 | 4/5 | 详细,偶尔跳步 | 0 题 |

| DeepSeek V3 | 4/5 | 简洁,中文推导更自然 | 1 题 |

小结:纯数学推理上 GPT-5 和 DeepSeek V3 打平,Claude 4.5 略弱一点。如果你的主要场景是数学/科学计算,DeepSeek V3 的性价比在这里体现得最明显。


场景四:代码补全(IDE 场景模拟)

任务:给一个 React + TypeScript 项目的半成品组件,让模型补全剩余逻辑,要求符合项目已有的代码风格。

| 模型 | 风格一致性 | 类型安全 | 是否引入不必要依赖 |

|------|---------|--------|--------------|

| Claude Sonnet 4.5 | ⭐⭐⭐⭐⭐ | 严格 | 无 |

| GPT-5 | ⭐⭐⭐⭐ | 严格 | 引入了一个可选的 lodash 方法 |

| DeepSeek V3 | ⭐⭐⭐⭐ | 基本严格,有 1 处 any | 无 |

小结:代码补全场景 Claude 4.5 对上下文风格的感知最好,这也是为什么很多人在 Cursor 里默认用 Claude 的原因。


成本对比(这才是很多人真正关心的)

测完性能,来算算钱。以下是各模型的官方定价 vs 通过无量Api(SVIP 7.7 折)的实际价格:

| 模型 | 官方价(输入/M tokens) | 官方价(输出/M tokens) | 无量Api SVIP 价 |

|------|-------------------|-------------------|--------------|

| Claude Sonnet 4.5 | ¥21 | ¥105 | 输入 ¥7.5 / 输出 ¥37.5 |

| GPT-5 | ¥54 | ¥216 | 输入 ¥19.4 / 输出 ¥77.8 |

| DeepSeek V3 | ¥2 | ¥8 | 输入 ¥0.7 / 输出 ¥2.9 |

实际场景估算:假设你每天跑 100 次代码审查,平均每次消耗 2k input + 1k output tokens:

  • 用 Claude Sonnet 4.5 官方:月成本约 ¥1,386
  • 用无量Api SVIP:月成本约 ¥495,省了将近 ¥900

DeepSeek V3 本身就便宜,但如果你的任务需要长上下文或者代码质量要求高,切换到 Claude 4.5 的成本差距在 SVIP 折扣下其实没那么大。


综合结论

| 场景 | 推荐模型 | 理由 |

|------|--------|------|

| 复杂 Bug 定位 | Claude Sonnet 4.5 | 上下文理解深,解释清晰 |

| 长文档处理 | Claude Sonnet 4.5 | 200k 窗口,提取完整 |

| 数学/科学推理 | GPT-5 / DeepSeek V3 | 准确率更高,DeepSeek 更省钱 |

| 代码补全 | Claude Sonnet 4.5 | 风格感知最好 |

| 日常问答/低成本场景 | DeepSeek V3 | 性价比无敌 |

没有哪个模型全场景碾压,选模型本质上是在任务需求和成本之间找平衡点。


关于国内访问的问题

V2EX 上有人问留学生回国后怎么继续用这些模型,这确实是个实际问题。官方 API 在国内直连不稳定,而且汇率换算之后价格也不划算。

我现在用的是 无量Api,支持国内直连,覆盖 OpenAI / Claude / Gemini / DeepSeek 等 300+ 模型,接入方式就是改一个 Base URL,其他代码不用动:


from openai import OpenAI



client = OpenAI(

    api_key="你的无量Api Key",

    base_url="https://api2everything.xyz/v1"

)

注册就送 ¥1 余额,余额永久有效,可以先试试效果再决定要不要充值。SVIP 是 7.7 折,按上面的成本计算,用量稍微大一点就回本了。

→ https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb