横评对比 · 阅读约 6 分钟

Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一组任务测了三天

Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一组任务测了三天

最近 HN 上 Claude Sonnet 5 的讨论很热,V2EX 也有人在聊 OpenAI 订阅制的问题。趁这个机会,我把手边几个真实项目里的任务拿出来,对着 Claude Sonnet 4.5、GPT-4.1、DeepSeek V3 跑了一遍,记录下来供参考。

没有赞助,结论跟着数据走。


测试方法

  • 同一组 prompt,通过 API 调用,温度统一设 0.3
  • 测试时间:2025 年 7 月某三天,各跑 3 次取代表性结果
  • 计费按 token 实际消耗,不是估算

测试场景:

1. 代码 debug(一个真实的 async/await 竞态条件 bug)

2. 长文档理解(一份 8000 字的合同,提取关键条款)

3. 数学推理(概率题 + 线性代数混合题组)

4. 成本模拟(按实际用量算各模型月账单)


场景一:代码 Debug

任务:一段 Node.js 代码,多个 async 函数并发写入同一个对象,偶发数据丢失。

| 模型 | 定位耗时 | 是否找到根因 | 修复方案质量 |

|------|----------|--------------|--------------|

| Claude Sonnet 4.5 | 直接指出 | ✅ 竞态条件 + 锁机制建议 | 给了 3 种方案,分析了取舍 |

| GPT-4.1 | 直接指出 | ✅ 竞态条件 | 给了 1 种方案,简洁但够用 |

| DeepSeek V3 | 直接指出 | ✅ 竞态条件 | 给了 2 种方案,有中文注释习惯 |

三个模型都找到了根因,差异在方案深度。Claude 的回答最长,把 mutex、队列、immutable 三种思路都写了,还分析了各自的性能影响。GPT-4.1 最简洁,直接给可运行代码。DeepSeek 居中,代码风格带点中文注释,本地项目用倒是顺手。

结论:这类明确 bug,三者差距不大。Claude 适合需要深入理解的场景,GPT-4.1 适合快速出代码。


场景二:长文档理解

任务:8000 字合同,提取所有违约条款、赔偿上限、争议解决方式,输出结构化列表。

| 模型 | 遗漏条款数 | 结构化程度 | 幻觉问题 |

|------|------------|------------|----------|

| Claude Sonnet 4.5 | 0 | ⭐⭐⭐⭐⭐ | 未发现 |

| GPT-4.1 | 1 处轻微 | ⭐⭐⭐⭐ | 未发现 |

| DeepSeek V3 | 2 处遗漏 | ⭐⭐⭐⭐ | 1 处轻微混淆 |

这个场景 Claude 明显好一点。它输出的结构非常清晰,每条都标了原文出处段落,方便核对。GPT-4.1 遗漏了一个嵌套在附件里的条款。DeepSeek 遗漏了两处,且对一个模糊条款的解读稍有偏差。

结论:长文档精读,Claude > GPT-4.1 > DeepSeek V3。


场景三:数学推理

任务:4 道题混合,包括条件概率(贝叶斯)、矩阵求逆、一道组合计数、一道简单微分。

| 模型 | 答对数 | 过程展示 | 出错类型 |

|------|--------|----------|----------|

| Claude Sonnet 4.5 | 4/4 | 详细 | — |

| GPT-4.1 | 3/4 | 详细 | 组合计数计算错误 |

| DeepSeek V3 | 4/4 | 详细 | — |

数学推理上 Claude 和 DeepSeek 都拿了满分,GPT-4.1 在组合计数上出了个算术错误(思路对,最后一步算错了)。DeepSeek 在数学类任务上一直表现稳定,这次也没让人失望。

结论:数学推理,Claude ≈ DeepSeek V3 > GPT-4.1(GPT-4.1 偶有粗心)。


场景四:实际成本对比

这是最现实的问题。用 API 的人都知道,模型能力差不多的情况下,价格差一倍就是另一个选择了。

按我自己的月用量估算:输入 2M tokens + 输出 500K tokens。

Claude Sonnet 4.5

| 渠道 | 输入价格 | 输出价格 | 月费用估算 |

|------|----------|----------|------------|

| 官方 API | ¥21 / M tokens | ¥105 / M tokens | ¥42 + ¥52.5 = ¥94.5 |

| 无量Api SVIP | ¥7.5 / M tokens | 按比例折 | 约 ¥33 |

GPT-4.1

| 渠道 | 输入价格 | 输出价格 | 月费用估算 |

|------|----------|----------|------------|

| 官方 API | ¥14.4 / M tokens | ¥57.6 / M tokens | ¥28.8 + ¥28.8 = ¥57.6 |

| 无量Api SVIP | 约 ¥5.5 / M tokens | 按比例折 | 约 ¥21 |

DeepSeek V3

| 渠道 | 输入价格 | 输出价格 | 月费用估算 |

|------|----------|----------|------------|

| 官方 API | ¥4 / M tokens(缓存命中 ¥1) | ¥16 / M tokens | 约 ¥16 |

| 无量Api | ¥1.4 / M tokens | 按比例折 | 约 ¥6 |

DeepSeek 本身就便宜,所以绝对值差距不大,但 Claude 的价差最显眼——官方 ¥94.5 vs 三方 SVIP ¥33,省了将近六成。如果你的主力模型是 Claude,这个差价是真实的。


综合对比一览

| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |

|------|-------------------|---------|-------------|

| 代码 debug | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 长文档理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |

| 官方月费(按我的用量) | ¥94.5 | ¥57.6 | ¥16 |

| 三方 SVIP 月费 | ¥33 | ¥21 | ¥6 |

| 中文场景友好度 | 好 | 好 | 非常好 |


我的选法

  • 主力跑代码和文档:Claude Sonnet 4.5,能力上限最高,但用官方的话成本压力大
  • 快速出代码、对话流:GPT-4.1,响应快,输出简洁
  • 数学/推理/中文内容/预算有限:DeepSeek V3,性价比最好,国内直连不用担心延迟

三个模型没有绝对的好坏,主要看你的用量结构和任务类型。


关于 API 成本

上面的价格对比里,三方平台的数字来自 无量Api(api2everything.xyz)。它支持 Claude / GPT / Gemini / DeepSeek 等 300+ 模型,OpenAI 格式兼容,换 Base URL 就能用,不需要改其他代码。

对于重度用 Claude 的人来说,官方价 ¥21/M 和这边 SVIP ¥7.5/M 的差距还是比较实在的。注册有 ¥1 体验额度,余额不过期,可以先跑跑自己的用量看合不合适。

国内直连这点对我来说也挺重要,不用再套代理跑 API 了。


数据基于个人测试,模型版本和定价随时可能变化,以实际为准。