横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论有点意外

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论有点意外

背景:最近 V2EX 上关于 Codex、Plus 续费的讨论很多,说明大家对模型选型和成本都很在意。我用三个场景把这几个模型跑了一遍,尽量给出有参考价值的横评。

测试说明

模型:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3

时间:2025 年 7 月,连续三天

接入方式:统一用 OpenAI 兼容格式调用(Base URL 换一行,其余代码不动)

测试维度:代码 debug、长文理解、数学推理、实际成本


场景一:代码 Debug(一个真实 bug)

题目:一段 Python 异步爬虫,并发请求偶发 RuntimeError: Session is closed,附上约 80 行代码。

| 模型 | 定位准确性 | 修复方案质量 | 响应耗时 |

|------|-----------|-------------|---------|

| Claude Sonnet 4.5 | ✅ 直接定位到 aiohttp.ClientSession 生命周期问题 | 给出了上下文管理器重构方案,附解释 | ~4s |

| GPT-4.1 | ✅ 也找到了,但先给了一个较浅的"加 try/except"建议 | 追问后才给出正确重构 | ~3s |

| DeepSeek V3 | ✅ 定位准确 | 方案和 Claude 基本一致,中文注释更详细 | ~5s |

小结:三者都能找到根因,Claude 4.5 第一次回复就给出最完整的方案,省了来回追问的时间。DeepSeek V3 的中文注释对国内团队友好。


场景二:长文理解(一份 12000 字技术文档)

题目:把一份英文 API 设计文档贴进去,问"这个系统的限流策略在哪些边界条件下会失效,给出具体章节和原文依据"。

| 模型 | 找到关键段落 | 分析边界条件 | 有无幻觉 |

|------|------------|-------------|---------|

| Claude Sonnet 4.5 | ✅ 引用了 3 处原文 | 分析了 2 个真实边界,1 个推断边界(标注了是推断) | 无明显幻觉 |

| GPT-4.1 | ✅ 引用了 2 处 | 分析到位,但漏了一个竞态条件场景 | 无明显幻觉 |

| DeepSeek V3 | ⚠️ 引用了 2 处,但有 1 处章节号对不上 | 分析方向正确,细节不够 | 轻微幻觉(章节定位偏移) |

小结:长文引用精度上,Claude 4.5 > GPT-4.1 > DeepSeek V3。如果你的工作流依赖模型精确引用原文,这个差距值得注意。


场景三:数学推理(竞赛级别题目)

题目:一道组合数学证明题(AMC 12 难度),要求给出完整证明步骤。

| 模型 | 解题路径 | 步骤完整性 | 最终结论 |

|------|---------|-----------|---------|

| Claude Sonnet 4.5 | 容斥原理 | 完整,每步有推导 | ✅ 正确 |

| GPT-4.1 | 同上 | 完整 | ✅ 正确 |

| DeepSeek V3 | 母函数方法(不同路径) | 完整 | ✅ 正确 |

小结:三者在这个难度上都过关,DeepSeek V3 给出了不同的证明路径,反而更有参考价值。数学推理场景下,DeepSeek V3 的性价比极高。


场景四:成本计算(这才是重点)

假设每天调用量:输入 2M tokens,输出 500K tokens。

官方价格(美元转人民币按当前汇率约 7.25)

| 模型 | 输入价(/M tokens) | 输出价(/M tokens) | 日成本估算 |

|------|-------------------|-------------------|-----------|

| Claude Sonnet 4.5 | ¥21.75 | ¥108.75 | ¥97.875 |

| GPT-4.1 | ¥14.50 | ¥58.00 | ¥57.9 |

| DeepSeek V3 | ¥1.97 | ¥7.25 | ¥7.565 |

无量Api SVIP 价格

| 模型 | 输入价(/M tokens) | 输出价(/M tokens) | 日成本估算 | 比官方省 |

|------|-------------------|-------------------|-----------|---------|

| Claude Sonnet 4.5 | ¥7.5 | ¥37.5 | ¥33.75 | 约 65% |

| GPT-4.1 | ¥5.1 | ¥20.4 | ¥20.4 | 约 65% |

| DeepSeek V3 | ¥0.69 | ¥2.76 | ¥2.76 | 约 65% |

月下来,仅 Claude Sonnet 4.5 一个模型就能省 ¥1900+。

综合结论

按场景推荐,不按价格推荐:

  • 代码 debug / 需要一次性给出完整方案 → Claude Sonnet 4.5,减少来回对话成本
  • 长文档分析、需要精确引用 → Claude Sonnet 4.5 > GPT-4.1,DeepSeek V3 慎用于强依赖原文定位的场景
  • 数学/逻辑推理、成本敏感 → DeepSeek V3,性能差距极小但价格是量级差距
  • 平衡型日常工作流 → GPT-4.1,响应快,价格居中,兼容性最好

没有"最强"模型,只有最适合你场景的模型。


关于国内访问和成本问题

V2EX 上这两天有不少人在聊土区续费、HK 节点 TLS 报错的问题——这些基本都是直连稳定性导致的。如果你需要在国内稳定调用上面这些模型,可以考虑用聚合 API 的方案:改一行 Base URL,不用折腾节点,也不用担心汇率和续费问题。

無量Api(api2everything.xyz) 支持 Claude / GPT / Gemini / DeepSeek 等 300+ 模型国内直连,SVIP 价格是官方的 7.7 折,注册即送 ¥1 余额,余额永久不过期,可以先试试看。

Zhihu 版链接:https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb

数据基于个人测试,模型版本和价格随时可能更新,以官方及服务商最新公告为准。