Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天
Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天
最近社区里关于"哪个模型最值得用"的讨论越来越多,HN 上也有人说 Anthropic 和 OpenAI 终于找到了 PMF。正好手头有几个真实项目,就拿同一批任务把几个主流模型跑了一遍,记录下来给大家参考。
测试模型:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3 / Gemini 2.5 Pro
测试周期:3 天,每个场景各跑 5 次取平均印象
测试原则:同一个 prompt,不做任何针对性调优
测试场景一:定位一个真实 Bug
任务描述: 给一段 300 行的 Python 异步代码,里面有一个竞态条件导致偶发性死锁,让模型定位问题并给出修复方案。
这是最能区分模型"真懂代码"还是"在猜"的场景。
| 模型 | 定位准确性 | 解释质量 | 修复方案可用性 |
|------|-----------|---------|--------------|
| Claude Sonnet 4.5 | ✅ 直接指出竞态条件位置 | 详细,解释了 asyncio 锁的原理 | 可直接用,附了测试用例 |
| GPT-4.1 | ✅ 定位正确 | 清晰,但略显模板化 | 可用,没有测试用例 |
| DeepSeek V3 | ⚠️ 定位到附近但不精确 | 解释偏泛化 | 需要二次修改 |
| Gemini 2.5 Pro | ✅ 定位正确 | 解释详细,引用了文档 | 可用,风格偏保守 |
小结: Claude 和 GPT-4.1 在代码理解上旗鼓相当,Claude 给的测试用例是加分项。DeepSeek V3 在这类细粒度 bug 上稍弱,但价格差距很大,要看你的容忍度。
测试场景二:长文档理解与提取
任务描述: 喂入一份 40 页的英文技术规范 PDF(约 60k tokens),要求提取所有"安全相关约束"并按优先级排序。
| 模型 | 上下文窗口 | 提取完整度 | 排序逻辑 | 幻觉情况 |
|------|-----------|-----------|---------|---------|
| Claude Sonnet 4.5 | 200k | 高,漏掉 1 条 | 逻辑清晰 | 极少 |
| GPT-4.1 | 128k | 中,漏掉 3-4 条 | 逻辑清晰 | 偶发 |
| DeepSeek V3 | 64k | 受限于窗口,截断 | — | — |
| Gemini 2.5 Pro | 1M | 高,基本完整 | 逻辑清晰 | 偶发 |
小结: 长文档场景 Gemini 2.5 Pro 的百万 token 窗口优势明显,Claude 次之。DeepSeek V3 在这个场景直接被窗口限制卡住,不适合超长文档任务。
测试场景三:数学推理
任务描述: 一道竞赛级组合数学题(需要多步推导),以及一道概率论应用题。
| 模型 | 组合数学 | 概率题 | 推导过程可读性 |
|------|---------|-------|--------------|
| Claude Sonnet 4.5 | ✅ 正确 | ✅ 正确 | 步骤清晰,有验证 |
| GPT-4.1 | ✅ 正确 | ✅ 正确 | 步骤清晰 |
| DeepSeek V3 | ✅ 正确 | ⚠️ 过程对但最后算错 | 步骤详细 |
| Gemini 2.5 Pro | ✅ 正确 | ✅ 正确 | 步骤详细,有多种解法 |
小结: 数学推理四个模型整体都不错,Gemini 2.5 Pro 给出多种解法的习惯在教学场景很有用。DeepSeek V3 在最后一步计算上出了小差错,但推导思路是对的。
测试场景四:代码补全(IDE 场景模拟)
任务描述: 给一个 TypeScript React 组件的前半段,让模型补全后半段,包括状态管理和事件处理。
| 模型 | 风格一致性 | 类型安全 | 是否引入多余依赖 | 响应速度 |
|------|-----------|---------|----------------|---------|
| Claude Sonnet 4.5 | 高 | 严格 | 无 | 中 |
| GPT-4.1 | 高 | 严格 | 无 | 快 |
| DeepSeek V3 | 中 | 一般 | 偶尔 | 快 |
| Gemini 2.5 Pro | 高 | 严格 | 无 | 中 |
小结: 代码补全场景 GPT-4.1 的响应速度有优势,适合对延迟敏感的 IDE 插件场景。Claude 和 Gemini 质量相近。
最关键的部分:成本对比
测了三天,最后还是要算钱。以下是各模型官方价格 vs 通过无量Api(api2everything.xyz)调用的价格对比:
| 模型 | 官方价(输入/输出,每百万 token) | 无量Api 普通价 | 无量Api SVIP 价(7.7折) |
|------|-------------------------------|--------------|------------------------|
| Claude Sonnet 4.5 | 输入 ¥21 / 输出 ¥105 | 输入 ¥10.5 / 输出 ¥52.5 | 输入 ¥7.5 / 输出 ¥37.5 |
| GPT-4.1 | 输入 ¥14 / 输出 ¥56 | 输入 ¥7 / 输出 ¥28 | 输入 ¥5.4 / 输出 ¥21.6 |
| Gemini 2.5 Pro | 输入 ¥9 / 输出 ¥35 | 输入 ¥4.5 / 输出 ¥17.5 | 输入 ¥3.5 / 输出 ¥13.5 |
| DeepSeek V3 | 输入 ¥2 / 输出 ¥8 | 输入 ¥1 / 输出 ¥4 | 输入 ¥0.77 / 输出 ¥3.1 |
以一个中等规模的 Agent 项目为例,每天大约消耗 5M 输入 + 2M 输出 token(Claude Sonnet 4.5):
- 官方直接调用: 5×21 + 2×105 = ¥315/天,约 ¥9450/月
- 无量Api SVIP: 5×7.5 + 2×37.5 = ¥112.5/天,约 ¥3375/月
一个月省下 ¥6000+,这个差距在项目规模上去之后非常可观。
综合结论
没有"最好的模型",只有"最适合场景的模型":
- 代码 debug / 复杂推理:Claude Sonnet 4.5 和 GPT-4.1 都很稳,Claude 在解释质量上略胜
- 超长文档处理:Gemini 2.5 Pro 的百万 token 窗口是真实优势
- 成本敏感型项目:DeepSeek V3 在大多数任务上够用,价格是其他模型的 1/10
- IDE 代码补全:GPT-4.1 响应速度快,体验更流畅
如果你在国内访问这些模型有网络问题,或者官方价格让预算吃紧,可以看看 无量Api——支持 300+ 模型国内直连,OpenAI 格式兼容,改一行 Base URL 就能切换,注册还送 ¥1 余额(永久有效,不是限时券)。
- Zhihu 读者:api2everything.xyz
- V2EX 读者:api2everything.xyz