Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了 3 天,结论有点意外
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了 3 天,结论有点意外
最近 V2EX 上关于 GPT-5 发没发布的帖子吵得很热,加上 Claude 4.5 出来后有人说"比 4 强但没想象中强那么多",正好趁这个机会把手头几个常用任务拿出来做一次横评。
测试模型:Claude Sonnet 4.5 / GPT-5 / DeepSeek V3(2501)
测试周期:3 天,每个任务跑 3 次取平均印象
评分标准:实用性,不是跑 Benchmark
场景一:修一个真实的并发 Bug
用的是一段 Go 写的 worker pool,有经典的 goroutine 泄漏 + 竞态条件,没有加任何注释。
Claude Sonnet 4.5
直接定位到 sync.WaitGroup 调用顺序问题,同时指出 channel 没有 close 导致 goroutine 阻塞。给出的修复代码干净,还顺手加了 context.WithCancel 的建议。用时感受最流畅,像在和一个有经验的同事 pair。
GPT-5
也找到了主要问题,但解释更偏教程风,代码里加了很多注释。对 channel close 的处理稍微绕了一圈,不如 Claude 直接。好处是如果你想顺便学原理,它讲得更细。
DeepSeek V3
找到了竞态,但对 goroutine 泄漏的判断不够准确,给出的修复方案可以跑但不是最优解。价格优势明显(后面算钱),适合作为初步排查工具。
场景二:理解一份 8000 字的技术文档并提炼决策点
扔了一份内部 RFC,要求输出"三个最重要的架构决策"和"潜在风险点"。
Claude Sonnet 4.5
提炼质量最高,识别出一个文档里隐含但没明说的依赖关系,这个点我自己读的时候也没注意到。结构输出非常适合直接复制进会议记录。
GPT-5
总结准确,但倾向于把文档里已经明确写出的内容再复述一遍,"发现"能力弱于 Claude。如果你只是想要一个结构化摘要,GPT-5 够用。
DeepSeek V3
摘要能力不错,但在识别"隐含依赖"这类需要推理的点上明显弱一截。中文文档处理反而更顺滑。
场景三:数学推理(竞赛级别的组合数学题)
题目是 AIME 2024 的一道计数题,有陷阱。
GPT-5
这一轮最强。推理过程清晰,分步骤列出,最终答案正确。整个解题路径接近人类竞赛选手的写法。
Claude Sonnet 4.5
过程也对,但中间有一步跳跃,如果你想学解法需要追问一下。答案正确。
DeepSeek V3
在这道题上翻车了,中间一步计数出现了错误,最终答案错误。数学推理不是它的强项,至少在 V3 这个版本上。
场景四:代码补全速度与上下文保持
在一个 ~3000 行的 Python 项目里,让模型续写一个新模块,要求风格和已有代码保持一致。
Claude Sonnet 4.5
上下文保持最好,变量命名风格、错误处理方式几乎和原项目一致,几乎不需要人工调整。
GPT-5
风格有点飘,会引入一些原项目没用过的 pattern,比如突然加了装饰器。功能上没问题,但代码审查要多看几眼。
DeepSeek V3
速度最快,风格保持中等,适合快速原型,后期还是得人工 review。
成本对比:这才是很多人最关心的
下面用 100 万 token 输入 + 200 万 token 输出 的常见工作负载来算(单位:人民币)。
| 模型 | 官方定价(输入/输出 per M) | 官方总价 | 无量Api SVIP 价 | 节省 |
|---|---|---|---|---|
| Claude Sonnet 4.5 | ¥21 / ¥105 | ¥231 | 输入¥7.5 / 输出¥37.8,约¥83 | ↓64% |
| GPT-5 | ¥53 / ¥212 | ¥477 | 约¥172 | ↓64% |
| DeepSeek V3 | ¥1 / ¥4 | ¥9 | 约¥7 | ↓22% |
说明:无量Api SVIP 为 7.7 折,普通用户也有折扣只是稍低。DeepSeek 本身价格极低,折扣的绝对值就小。官方价格以截稿时汇率换算为参考,以实际为准。
DeepSeek 这里有个隐含逻辑:它便宜,但如果用它做质量不达标的任务,你要花更多时间人工修,时间成本要算进去。
综合评分
| 维度 | Claude Sonnet 4.5 | GPT-5 | DeepSeek V3 |
|---|---|---|---|
| 代码调试 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐ |
| 代码风格保持 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| 性价比(官方价) | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐⭐⭐ |
| 性价比(无量Api) | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
结论
没有一个模型能赢全场,这是实话。
- 日常代码工作:Claude Sonnet 4.5 是目前最顺手的,上下文理解和输出风格都接近"有经验的同事"
- 数学/推理密集任务:GPT-5 更稳
- 高频低精度任务、预算有限:DeepSeek V3 够用,但要接受偶尔需要 review
真正影响选择的往往不是模型本身,而是价格。Claude Sonnet 4.5 官方的¥21/M 输入对个人开发者来说还是偏高,这也是为什么很多人在找替代访问方式。
如果你经常用 API 做开发,可以看看无量Api(api2everything.xyz)——支持国内直连,不需要魔法,Claude / GPT / Gemini / DeepSeek 300+ 模型一个 Key 搞定,改一下 base_url 就能用。注册送 ¥1,余额不过期,SVIP 折扣到 7.7 折,上面成本表里的数字就是按这个算的。
Zhihu 版链接:https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb
V2EX 版链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb