Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组 bug 测了 3 天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组 bug 测了 3 天
最近 V2EX 上有个帖子说"奥特曼老是重置,这是给程序员送上瘾的毒药吗"——评论区炸了,有人说 GPT-5 真的香,有人说 DeepSeek V3 够用还省钱,有人转投 Claude。
趁着这波讨论,我花了三天,用同一批测试用例把这三个模型捋了一遍。测试维度:代码调试、长文理解、数学推理、上下文保持。不喝彩,不踩踏,只说数字。
测试环境说明
- 所有模型统一走 API,避免网页端的差异干扰
- 每个场景 3 次独立调用取中位结果
- 费用按实际 token 计算,不做估算
- 时间:2025 年 7 月
场景一:代码调试(一个真实线上 Bug)
背景:一段 Python 异步代码,在高并发下偶发死锁,本地难以复现。贴入代码(约 300 行)+ 错误日志。
| 模型 | 定位准确性 | 给出可运行的修复方案 | 解释质量 |
|---|---|---|---|
| Claude Sonnet 4.5 | ✅ 准确定位到 asyncio.Lock 嵌套问题 | ✅ 附完整重构代码 | 高,逐行注释 |
| GPT-5 | ✅ 定位准确,但给了两种可能原因 | ✅ 方案可用 | 中,有点啰嗦 |
| DeepSeek V3 | ⚠️ 定位到相邻位置,差一步 | ⚠️ 需要追问 | 中,够用 |
小结:Claude 4.5 这次直接给出了可部署的代码,GPT-5 略显保守(给了 A/B 两个方案让你选),DeepSeek V3 需要一轮追问才到位。
场景二:长文理解(PDF 研报 + 提问)
输入一篇 18000 字的行业研报(芯片供应链),要求:总结核心逻辑、找出数据前后矛盾处、提炼 3 个可操作结论。
| 模型 | 摘要质量 | 找出矛盾 | 结论可操作性 |
|---|---|---|---|
| Claude Sonnet 4.5 | 高,结构清晰 | ✅ 找到 2 处 | 强,有具体建议 |
| GPT-5 | 高,但倾向于面面俱到 | ✅ 找到 1 处 | 中,偏宏观 |
| DeepSeek V3 | 中,有遗漏 | ⚠️ 未主动指出 | 中 |
小结:长文理解是 Claude 的传统强项,这次依然稳。GPT-5 有点"什么都说但什么都不深",DeepSeek V3 在超长上下文场景下表现有明显差距。
场景三:数学推理(竞赛级别)
题目:一道 AMC 12 级别的组合数学题,需要逐步推导。
| 模型 | 最终答案 | 推导过程 | 是否有中间错误 |
|---|---|---|---|
| Claude Sonnet 4.5 | ✅ 正确 | 完整,5 步 | 无 |
| GPT-5 | ✅ 正确 | 完整,4 步 | 无 |
| DeepSeek V3 | ✅ 正确 | 完整,6 步 | 第 3 步有小错但自纠 |
小结:数学推理三家都过关,GPT-5 路径最简洁,DeepSeek V3 会自我纠错是个亮点。这个场景分不出高下。
场景四:多轮对话上下文保持
在一次对话里设定一个架构约束("所有服务必须无状态"),后续 15 轮对话里提各种设计问题,看模型是否始终遵守约束。
| 模型 | 约束保持轮数 | 第一次违反约束 |
|---|---|---|
| Claude Sonnet 4.5 | 15/15 | 未违反 |
| GPT-5 | 13/15 | 第 11 轮建议用 session 存储 |
| DeepSeek V3 | 9/15 | 第 8 轮开始忘记约束 |
小结:这个测试比较残酷,Claude 4.5 全程没失忆,GPT-5 在长对话后期有漂移,DeepSeek V3 上下文保持是明显短板。
综合对比表
| 维度 | Claude Sonnet 4.5 | GPT-5 | DeepSeek V3 |
|---|---|---|---|
| 代码调试 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 上下文保持 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 官方价(输入/M tokens) | ¥21 | ¥37.5 | ¥2 |
| 无量Api SVIP 价 | ¥7.5 | ¥14 | ¥0.7 |
| 省多少 | 64% | 63% | 65% |
价格以人民币计,M = 百万 tokens,SVIP 7.7 折基础上叠加活动价,实时以官网为准。
成本测算:一个实际项目的账单
假设你在做一个代码审查工具,每天处理 500 个 PR,平均每次请求输入 2000 tokens、输出 500 tokens:
每月 token 消耗:约 37.5M 输入 + 9.4M 输出
| 方案 | 月费用(Claude Sonnet 4.5) |
|---|---|
| 直接走 Anthropic 官方 | ≈ ¥1,050 |
| 无量Api SVIP | ≈ ¥375 |
| 差价 | ¥675/月 |
三个月下来就是两千块,够续好几年土区 Plus 了(前提是土区续费别再涨价)。
结论
不存在"最好的模型",只有"最适合你任务的模型":
- 需要长上下文、代码重构、文档理解:首选 Claude Sonnet 4.5,准确且有耐心
- 数学、逻辑推理、简洁回答:GPT-5 在这块表现最稳
- 预算敏感、高并发、对上下文要求不高:DeepSeek V3 的性价比无可替代
三家都值得在项目里根据场景混用,别绑死在一家身上。
关于访问门槛
国内直接调这几家官方 API,网络问题是第一道坎,其次是汇率换算和 key 管理。最近在用无量Api,支持 Claude / GPT / Gemini / DeepSeek 等 300+ 模型,OpenAI 格式兼容,改一行 base_url 就切过去了,国内直连不需要额外折腾。注册送 ¥1,余额永久不过期,先试再说。
- 知乎读者:api2everything.xyz
- V2EX 读者:api2everything.xyz