Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
最近 V2EX 上关于 Codex、GPT-5、Claude 的讨论明显多了起来,尤其是有人问"回国之后怎么用"、"5.5 pro deepresearch 效果如何"这类问题。正好我这段时间在做项目,顺手用同一批测试任务跑了三个模型,把结果整理出来。
测试模型:Claude Sonnet 4.5 / GPT-5 / DeepSeek V3(Gemini 2.5 Pro 和 Grok 4 作为参照)
测试场景设计
我选了四个日常开发和研究中最常遇到的场景,每个场景用完全相同的 prompt 跑三遍取中位结果。
场景一:定位一个真实 Bug
任务:给一段 Python 异步代码,里面有一个 asyncio.gather 的竞态条件,让模型找出问题并修复。
| 模型 | 是否定位到根因 | 修复质量 | 解释清晰度 |
|------|------------|--------|---------|
| Claude Sonnet 4.5 | ✅ 精准 | 给出了两种修复方案,并说明了各自的适用场景 | ⭐⭐⭐⭐⭐ |
| GPT-5 | ✅ 精准 | 修复正确,但只给了一种方案 | ⭐⭐⭐⭐ |
| DeepSeek V3 | ⚠️ 找到了表层问题,漏掉了深层竞态 | 修复不完整 | ⭐⭐⭐ |
小结:这类需要理解异步执行上下文的 bug,Claude 4.5 的表现最稳,GPT-5 紧随其后。DeepSeek V3 在这个场景有点吃亏,可能和训练数据里异步并发的复杂案例偏少有关。
场景二:长文档理解(40k token 合同)
任务:上传一份 40k token 的英文采购合同,提取所有违约条款,并按严重程度排序。
| 模型 | 上下文窗口 | 提取完整度 | 排序逻辑 |
|------|---------|---------|--------|
| Claude Sonnet 4.5 | 200k | 98%,漏了 1 条嵌套条款 | 逻辑清晰,给出了依据 |
| GPT-5 | 128k | 95%,漏了 2 条 | 排序合理,但依据较简略 |
| DeepSeek V3 | 64k | 文档超出窗口,需要分段处理 | — |
小结:长文档场景 Claude 4.5 的 200k 窗口优势明显。DeepSeek V3 的 64k 窗口在这个任务上直接受限,需要额外的分段逻辑,工程成本上去了。
场景三:数学推理(竞赛级别)
任务:AMC 12 难度的组合数学题,5 道,要求给出完整推导过程。
| 模型 | 正确率 | 推导过程 | 是否有错误步骤但结论对 |
|------|------|--------|-----------------|
| Claude Sonnet 4.5 | 3/5 | 详细,步骤可追溯 | 1 题 |
| GPT-5 | 4/5 | 详细,偶尔跳步 | 0 题 |
| DeepSeek V3 | 4/5 | 简洁,中文推导更自然 | 1 题 |
小结:纯数学推理上 GPT-5 和 DeepSeek V3 打平,Claude 4.5 略弱一点。如果你的主要场景是数学/科学计算,DeepSeek V3 的性价比在这里体现得最明显。
场景四:代码补全(IDE 场景模拟)
任务:给一个 React + TypeScript 项目的半成品组件,让模型补全剩余逻辑,要求符合项目已有的代码风格。
| 模型 | 风格一致性 | 类型安全 | 是否引入不必要依赖 |
|------|---------|--------|--------------|
| Claude Sonnet 4.5 | ⭐⭐⭐⭐⭐ | 严格 | 无 |
| GPT-5 | ⭐⭐⭐⭐ | 严格 | 引入了一个可选的 lodash 方法 |
| DeepSeek V3 | ⭐⭐⭐⭐ | 基本严格,有 1 处 any | 无 |
小结:代码补全场景 Claude 4.5 对上下文风格的感知最好,这也是为什么很多人在 Cursor 里默认用 Claude 的原因。
成本对比(这才是很多人真正关心的)
测完性能,来算算钱。以下是各模型的官方定价 vs 通过无量Api(SVIP 7.7 折)的实际价格:
| 模型 | 官方价(输入/M tokens) | 官方价(输出/M tokens) | 无量Api SVIP 价 |
|------|-------------------|-------------------|--------------|
| Claude Sonnet 4.5 | ¥21 | ¥105 | 输入 ¥7.5 / 输出 ¥37.5 |
| GPT-5 | ¥54 | ¥216 | 输入 ¥19.4 / 输出 ¥77.8 |
| DeepSeek V3 | ¥2 | ¥8 | 输入 ¥0.7 / 输出 ¥2.9 |
实际场景估算:假设你每天跑 100 次代码审查,平均每次消耗 2k input + 1k output tokens:
- 用 Claude Sonnet 4.5 官方:月成本约 ¥1,386
- 用无量Api SVIP:月成本约 ¥495,省了将近 ¥900
DeepSeek V3 本身就便宜,但如果你的任务需要长上下文或者代码质量要求高,切换到 Claude 4.5 的成本差距在 SVIP 折扣下其实没那么大。
综合结论
| 场景 | 推荐模型 | 理由 |
|------|--------|------|
| 复杂 Bug 定位 | Claude Sonnet 4.5 | 上下文理解深,解释清晰 |
| 长文档处理 | Claude Sonnet 4.5 | 200k 窗口,提取完整 |
| 数学/科学推理 | GPT-5 / DeepSeek V3 | 准确率更高,DeepSeek 更省钱 |
| 代码补全 | Claude Sonnet 4.5 | 风格感知最好 |
| 日常问答/低成本场景 | DeepSeek V3 | 性价比无敌 |
没有哪个模型全场景碾压,选模型本质上是在任务需求和成本之间找平衡点。
关于国内访问的问题
V2EX 上有人问留学生回国后怎么继续用这些模型,这确实是个实际问题。官方 API 在国内直连不稳定,而且汇率换算之后价格也不划算。
我现在用的是 无量Api,支持国内直连,覆盖 OpenAI / Claude / Gemini / DeepSeek 等 300+ 模型,接入方式就是改一个 Base URL,其他代码不用动:
from openai import OpenAI
client = OpenAI(
api_key="你的无量Api Key",
base_url="https://api2everything.xyz/v1"
)
注册就送 ¥1 余额,余额永久有效,可以先试试效果再决定要不要充值。SVIP 是 7.7 折,按上面的成本计算,用量稍微大一点就回本了。
→ https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb