横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

最近几个月主流模型更新频率加快,Claude 4.5、GPT-5、DeepSeek V3 同时在讨论区刷屏。与其看各家宣传,不如直接拿真实任务跑一遍。

测试时间:连续三天,每天相同 prompt,取稳定表现。测试环境统一走 API,避免对话历史干扰。


测试场景设计

选了四个日常开发和研究中最常遇到的场景:

1. 代码 Debug:一段有隐藏并发问题的 Python 异步代码

2. 长文档理解:一份 12000 token 的技术文档,问细节问题

3. 数学推理:AMC 难度的组合数学题,要求写出完整推导

4. 多轮对话上下文保持:10 轮连续追问,考察指令遵循连贯性


场景一:代码 Debug(异步并发 bug)

给三个模型的 prompt 完全一致——一段 asyncio + aiohttp 混用导致 event loop 关闭的问题代码,不加任何提示,让模型自己定位 bug。

Claude 4.5:直接定位到 loop.run_until_complete 在 async 函数内嵌套调用的根因,给出了 asyncio.get_event_loop() 的替换方案,还主动提到了 Python 3.10+ 之后的废弃警告。附了可运行的修复代码。

GPT-5:同样找到了 bug,解释更偏教学风格,会类比解释 event loop 的生命周期。给的修复方案多了一个,但有一个方案在某些边缘情况下不适用,需要追问才补充说明。

DeepSeek V3:找到了 bug,但把一个无关的 await 位置也标记为"可能问题",有轻微误报。修复代码可用,解释简洁。

这一轮:Claude 4.5 > GPT-5 > DeepSeek V3

场景二:长文档理解(12000 token 技术文档)

文档是一份内部 API 设计文档,藏了三处前后矛盾的描述,提问时故意问这三处的具体细节。

Claude 4.5:三处矛盾全部找出,并主动标注了页码(章节号),没有编造内容。

GPT-5:找出两处,第三处给了一个"综合两种说法"的答案,表面上没说错,但实际上回避了矛盾。

DeepSeek V3:找出两处,第三处直接给了文档中靠前的那个版本,把矛盾忽略了。

长文档的"不编造"这一点 Claude 目前确实有优势,这不是偏袒,是多次测试的一致结论。

这一轮:Claude 4.5 > GPT-5 > DeepSeek V3

场景三:数学推理(AMC 组合题)

题目:从 1 到 20 中随机选 5 个不同整数,恰好包含至少两个质数的概率是多少?

Claude 4.5:列出质数集合,用补集思路分 0 个质数和 1 个质数两种情况,计算正确,过程清晰。

GPT-5:同样用补集,计算过程更详细,最终答案一致,但多走了一步验证,这个习惯挺好。

DeepSeek V3:答案正确,推导路径略有不同(直接枚举),对于这道题没有问题,但换成更复杂的题目这个路径容易出错。

三个都答对了,差别在推理的严谨性和可扩展性。

这一轮:GPT-5 ≈ Claude 4.5 > DeepSeek V3

场景四:多轮指令遵循(10 轮追问)

设定角色:扮演一个只用 SQL 回答问题的数据库助手,任何问题都用 SQL 表达。测试 10 轮是否漂移。

Claude 4.5:10 轮全程保持,第 8 轮我故意问了一个无法用 SQL 表达的哲学问题,它用 SELECT 'this question exceeds SQL expressiveness' 回答,没破戒,挺有意思。

GPT-5:第 6 轮开始出现自然语言解释混入 SQL 的情况,第 9 轮基本恢复文字回答模式。

DeepSeek V3:第 4 轮就开始混入中文解释,指令遵循连贯性最弱。

这一轮:Claude 4.5 > GPT-5 > DeepSeek V3

综合评分

| 维度 | Claude 4.5 | GPT-5 | DeepSeek V3 |

|------|-----------|-------|-------------|

| 代码 Debug | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 长文档理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 多轮指令遵循 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ |

| 综合 | 4.75 | 4.0 | 3.0 |


价格对比:这才是重点

测试跑下来,Claude 4.5 表现最稳定。但官方价格确实是门槛。

| 模型 | 官方价(输入/M tokens) | 无量Api SVIP 价 | 节省 |

|------|----------------------|----------------|------|

| Claude Sonnet 4.5 | ¥21 | ¥7.5 | 64% |

| GPT-5 | ¥70 | ¥24.5 | 65% |

| DeepSeek V3 | ¥2 | ¥0.7 | 65% |

| Gemini 2.5 Pro | ¥18.9 | ¥6.6 | 65% |

SVIP 折扣为 7.7 折,以上为近似值,实际以平台页面为准。

举个实际例子:如果你每天跑 10 个长文档任务,每次平均消耗 15000 tokens,一个月下来:

  • 官方 Claude Sonnet 4.5:约 ¥94.5/月
  • 无量Api SVIP:约 ¥33.75/月

差价可以再买一个月。


结论

适合用 Claude 4.5 的场景:需要精准遵循指令、长文档分析、代码审查。性能最稳,但官方价格偏高,走 API 中转服务性价比更好。

适合用 GPT-5 的场景:数学推理、需要"教学式"解释的场合、对话风格要求自然。

适合用 DeepSeek V3 的场景:成本极度敏感、任务相对简单、中文场景为主。官方价格本就便宜,加上折扣后几乎是主流模型里最低的。

三个模型都不是"完美答案",根据任务类型选择才是正解。如果需要同时接入多个模型做 fallback 或者 A/B 测试,统一走一个兼容 OpenAI 格式的接口会省很多配置工作。


如果你也想自己跑这套测试,可以试试 无量Api——国内直连,300+ 模型统一接口,改一行 base_url 就能切换,注册送 ¥1 余额,先跑几个 case 感受一下再决定要不要充值。

V2EX 版链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb