Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一组任务测了三天
Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一组任务测了三天
最近 HN 上 Claude Sonnet 5 的讨论很热,V2EX 也有人在聊 OpenAI 订阅制的问题。趁这个机会,我把手边几个真实项目里的任务拿出来,对着 Claude Sonnet 4.5、GPT-4.1、DeepSeek V3 跑了一遍,记录下来供参考。
没有赞助,结论跟着数据走。
测试方法
- 同一组 prompt,通过 API 调用,温度统一设 0.3
- 测试时间:2025 年 7 月某三天,各跑 3 次取代表性结果
- 计费按 token 实际消耗,不是估算
测试场景:
1. 代码 debug(一个真实的 async/await 竞态条件 bug)
2. 长文档理解(一份 8000 字的合同,提取关键条款)
3. 数学推理(概率题 + 线性代数混合题组)
4. 成本模拟(按实际用量算各模型月账单)
场景一:代码 Debug
任务:一段 Node.js 代码,多个 async 函数并发写入同一个对象,偶发数据丢失。
| 模型 | 定位耗时 | 是否找到根因 | 修复方案质量 |
|------|----------|--------------|--------------|
| Claude Sonnet 4.5 | 直接指出 | ✅ 竞态条件 + 锁机制建议 | 给了 3 种方案,分析了取舍 |
| GPT-4.1 | 直接指出 | ✅ 竞态条件 | 给了 1 种方案,简洁但够用 |
| DeepSeek V3 | 直接指出 | ✅ 竞态条件 | 给了 2 种方案,有中文注释习惯 |
三个模型都找到了根因,差异在方案深度。Claude 的回答最长,把 mutex、队列、immutable 三种思路都写了,还分析了各自的性能影响。GPT-4.1 最简洁,直接给可运行代码。DeepSeek 居中,代码风格带点中文注释,本地项目用倒是顺手。
结论:这类明确 bug,三者差距不大。Claude 适合需要深入理解的场景,GPT-4.1 适合快速出代码。
场景二:长文档理解
任务:8000 字合同,提取所有违约条款、赔偿上限、争议解决方式,输出结构化列表。
| 模型 | 遗漏条款数 | 结构化程度 | 幻觉问题 |
|------|------------|------------|----------|
| Claude Sonnet 4.5 | 0 | ⭐⭐⭐⭐⭐ | 未发现 |
| GPT-4.1 | 1 处轻微 | ⭐⭐⭐⭐ | 未发现 |
| DeepSeek V3 | 2 处遗漏 | ⭐⭐⭐⭐ | 1 处轻微混淆 |
这个场景 Claude 明显好一点。它输出的结构非常清晰,每条都标了原文出处段落,方便核对。GPT-4.1 遗漏了一个嵌套在附件里的条款。DeepSeek 遗漏了两处,且对一个模糊条款的解读稍有偏差。
结论:长文档精读,Claude > GPT-4.1 > DeepSeek V3。
场景三:数学推理
任务:4 道题混合,包括条件概率(贝叶斯)、矩阵求逆、一道组合计数、一道简单微分。
| 模型 | 答对数 | 过程展示 | 出错类型 |
|------|--------|----------|----------|
| Claude Sonnet 4.5 | 4/4 | 详细 | — |
| GPT-4.1 | 3/4 | 详细 | 组合计数计算错误 |
| DeepSeek V3 | 4/4 | 详细 | — |
数学推理上 Claude 和 DeepSeek 都拿了满分,GPT-4.1 在组合计数上出了个算术错误(思路对,最后一步算错了)。DeepSeek 在数学类任务上一直表现稳定,这次也没让人失望。
结论:数学推理,Claude ≈ DeepSeek V3 > GPT-4.1(GPT-4.1 偶有粗心)。
场景四:实际成本对比
这是最现实的问题。用 API 的人都知道,模型能力差不多的情况下,价格差一倍就是另一个选择了。
按我自己的月用量估算:输入 2M tokens + 输出 500K tokens。
Claude Sonnet 4.5
| 渠道 | 输入价格 | 输出价格 | 月费用估算 |
|------|----------|----------|------------|
| 官方 API | ¥21 / M tokens | ¥105 / M tokens | ¥42 + ¥52.5 = ¥94.5 |
| 无量Api SVIP | ¥7.5 / M tokens | 按比例折 | 约 ¥33 |
GPT-4.1
| 渠道 | 输入价格 | 输出价格 | 月费用估算 |
|------|----------|----------|------------|
| 官方 API | ¥14.4 / M tokens | ¥57.6 / M tokens | ¥28.8 + ¥28.8 = ¥57.6 |
| 无量Api SVIP | 约 ¥5.5 / M tokens | 按比例折 | 约 ¥21 |
DeepSeek V3
| 渠道 | 输入价格 | 输出价格 | 月费用估算 |
|------|----------|----------|------------|
| 官方 API | ¥4 / M tokens(缓存命中 ¥1) | ¥16 / M tokens | 约 ¥16 |
| 无量Api | ¥1.4 / M tokens | 按比例折 | 约 ¥6 |
DeepSeek 本身就便宜,所以绝对值差距不大,但 Claude 的价差最显眼——官方 ¥94.5 vs 三方 SVIP ¥33,省了将近六成。如果你的主力模型是 Claude,这个差价是真实的。
综合对比一览
| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |
|------|-------------------|---------|-------------|
| 代码 debug | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 长文档理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 官方月费(按我的用量) | ¥94.5 | ¥57.6 | ¥16 |
| 三方 SVIP 月费 | ¥33 | ¥21 | ¥6 |
| 中文场景友好度 | 好 | 好 | 非常好 |
我的选法
- 主力跑代码和文档:Claude Sonnet 4.5,能力上限最高,但用官方的话成本压力大
- 快速出代码、对话流:GPT-4.1,响应快,输出简洁
- 数学/推理/中文内容/预算有限:DeepSeek V3,性价比最好,国内直连不用担心延迟
三个模型没有绝对的好坏,主要看你的用量结构和任务类型。
关于 API 成本
上面的价格对比里,三方平台的数字来自 无量Api(api2everything.xyz)。它支持 Claude / GPT / Gemini / DeepSeek 等 300+ 模型,OpenAI 格式兼容,换 Base URL 就能用,不需要改其他代码。
对于重度用 Claude 的人来说,官方价 ¥21/M 和这边 SVIP ¥7.5/M 的差距还是比较实在的。注册有 ¥1 体验额度,余额不过期,可以先跑跑自己的用量看合不合适。
国内直连这点对我来说也挺重要,不用再套代理跑 API 了。
数据基于个人测试,模型版本和定价随时可能变化,以实际为准。