横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批 prompt 测了三天,结论有点意外

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批 prompt 测了三天,结论有点意外

最近几个模型都在密集更新,社区里讨论最热的无非是 Claude 4.5、GPT-5、DeepSeek V3 这三个。与其看各家的发布会 PPT,不如自己动手测。

我用同一套 prompt 集跑了三天,测了代码调试、长文理解、数学推理、日常对话四个场景,顺手也算了一下实际用下来的成本差异。结论写在最后,先说测试过程。


测试说明

  • 所有 prompt 固定,不针对某个模型调整措辞
  • 代码测试用的是真实项目里遇到的 bug,不是 LeetCode 玩具题
  • 长文理解塞了一篇 18000 token 的技术文档
  • 数学推理用了竞赛级别的组合数学题(AMC/AIME 难度)
  • 每个场景各跑 10 次取平均,避免随机性干扰

场景一:代码调试

测试内容:一个 Python async 并发 bug,race condition 导致的偶发性数据覆盖,加上一段有内存泄漏的 Rust 代码。

| 模型 | 定位准确率 | 修复质量 | 解释清晰度 |

|------|-----------|---------|-----------|

| Claude 4.5 | ✅ 10/10 | 给了 2 种方案,分析了 tradeoff | ⭐⭐⭐⭐⭐ |

| GPT-5 | ✅ 9/10 | 直接给修复代码,少解释 | ⭐⭐⭐⭐ |

| DeepSeek V3 | ✅ 8/10 | 偶发漏掉边界情况 | ⭐⭐⭐⭐ |

Claude 4.5 在代码场景里确实更"像高级工程师",不只是改代码,会主动问你这段的上下文意图。GPT-5 效率更高,直接给答案,适合你已经知道方向只需要它动手的场景。DeepSeek V3 表现稳定,偶尔在复杂并发场景里漏细节。


场景二:长文理解

测试内容:18000 token 的技术规范文档(真实的 RFC 草稿),问三类问题:事实抽取、跨段落推理、潜在矛盾识别。

| 模型 | 事实抽取 | 跨段落推理 | 矛盾识别 |

|------|---------|-----------|---------|

| Claude 4.5 | 准确 | 强,能串联远距离段落 | 发现 2/3 处矛盾 |

| GPT-5 | 准确 | 中等,偶尔混淆段落归属 | 发现 1/3 处矛盾 |

| DeepSeek V3 | 准确 | 中等 | 发现 1/3 处矛盾 |

长文理解是 Claude 的传统强项,这次没有意外。GPT-5 和 DeepSeek V3 在事实抽取上旗鼓相当,但涉及到需要把文档第 3 页和第 47 页联系起来分析的题目,Claude 的优势就拉开了。


场景三:数学推理

测试内容:5 道 AIME 级别组合数学题,要求写出完整推理过程。

| 模型 | 解题正确数 | 推理过程完整性 | 有无中途放弃 |

|------|-----------|-------------|------------|

| Claude 4.5 | 3/5 | 完整,步骤清晰 | 无 |

| GPT-5 | 4/5 | 完整,偶有跳步 | 无 |

| DeepSeek V3 | 4/5 | 完整 | 无 |

这个场景有点意外——GPT-5 和 DeepSeek V3 反超了 Claude。GPT-5 在数学推理上确实有明显提升,DeepSeek V3 一直是数学强项,基本符合预期。Claude 4.5 不差,但在纯符号推理上不是最强选项。


场景四:代码补全 + 文档生成

测试内容:给一个没有注释的 700 行 TypeScript 文件,要求补全函数实现 + 生成 JSDoc + 写单测。

| 模型 | 补全质量 | 文档规范性 | 单测覆盖率 |

|------|---------|-----------|---------|

| Claude 4.5 | ⭐⭐⭐⭐⭐ | 标准 JSDoc,考虑了边缘 case | 高,有 mock |

| GPT-5 | ⭐⭐⭐⭐ | 规范,偶尔过于简洁 | 中等 |

| DeepSeek V3 | ⭐⭐⭐⭐ | 规范 | 中等 |

工程向任务 Claude 依然稳。


成本:这才是大多数人绕不开的问题

测完能力,算钱。以下是主流用法下的真实价格对比(输入 token 价格,每百万 token):

| 模型 | 官方价(¥/M token) | 无量Api SVIP价(¥/M token) | 节省 |

|------|-------------------|--------------------------|-----|

| Claude Sonnet 4.5 | ¥21 | ¥7.5 | 64% |

| GPT-5 | ¥72 | ¥25 | 65% |

| DeepSeek V3 | ¥2 | ¥1.4 | 30% |

| Gemini 2.5 Pro | ¥22 | ¥8 | 64% |

拿 Claude Sonnet 4.5 举例:如果你每天跑 200 次 API 调用,每次平均 2000 token 输入,一个月下来:

  • 官方直连:约 ¥252/月
  • 无量Api SVIP:约 ¥90/月

差价直接能买一张好一点的机械键盘。如果是团队用量,差距会更明显。


综合结论

说实话没有"绝对最强",适合的才是最好的:

  • 工程代码、长文档处理:Claude 4.5 首选,推理过程透明,适合需要理解而不只是结果的场景
  • 数学 / 逻辑推理、快速问答:GPT-5 或 DeepSeek V3,两者旗鼓相当,后者便宜很多
  • 成本敏感的高频调用:DeepSeek V3 性价比极高,能力也不弱
  • 需要同时调多模型做 fallback:统一接口最省心

如果你只用一个模型,按上面场景对号入座。如果你的项目需要多模型混用,接口统一是个实际问题——每个官方 API 的鉴权方式和格式都有差异,维护成本不低。


关于 API 接入

这次测试用的是 无量Api,国内直连,不需要科学上网,支持上面所有模型,格式完全兼容 OpenAI SDK,改一行 base_url 就能切。注册有 ¥1 余额可以直接试,永久不过期。

对于 V2EX 读者:这是 V2EX 专属链接

价格差这么多的原因不复杂:量大批发价加上运营成本摊薄,官方对个人开发者没有这种优惠通道。如果你在认真做项目,API 成本值得认真算一算。