Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结果有点意外
Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结果有点意外
最近 V2EX 上有人问回国后怎么用 Codex 和 Claude,也有人在找便宜的 GPT Business 方案。趁这个机会,我把手头最常用的三个模型做了一次横评——不是跑 benchmark,是用真实工作任务测的。
测试模型:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3
测试周期:三天,每天换场景
调用方式:统一用 API,排除 UI 差异
测试场景一:代码 Debug(真实 Bug)
用的是一段 Python 异步爬虫,有一个经典的 asyncio 事件循环嵌套问题,加上一个隐藏的竞态条件。
Claude Sonnet 4.5
直接定位到两个问题,给出了 nest_asyncio 的临时方案和正确的重构方案,还主动说明了为什么临时方案在生产环境有风险。回答结构清晰,代码可以直接跑。
GPT-4.1
也找到了主要问题,修复代码正确,但对竞态条件只是一笔带过,没有深入解释。如果你不知道有这个坑,很容易忽略。
DeepSeek V3
找到了事件循环问题,竞态条件没提。代码修复是对的,解释比较简短。速度明显快于前两者。
小结: Claude > GPT-4.1 > DeepSeek V3(深度);DeepSeek > Claude ≈ GPT-4.1(速度)
测试场景二:长文理解(40k token 合同)
把一份英文 SaaS 合同(约 38k token)丢进去,问三个问题:自动续费条款在哪、违约金怎么算、数据主权归属。
Claude Sonnet 4.5
三个问题全部准确定位,引用了原文段落,还主动标注了一个"容易被忽略的第 12.3 条"——那条确实有坑。
GPT-4.1
两个问题回答准确,数据主权那条给出了模糊答案,说"需要结合附件 B",但没有进一步分析附件 B 的内容(附件 B 在文档里是有的)。
DeepSeek V3
在长上下文任务上表现明显弱一些,违约金计算公式有一处理解偏差。对于 40k 以内的文档建议谨慎。
小结: Claude > GPT-4.1 > DeepSeek V3(长文理解)
测试场景三:数学推理(竞赛级别)
用了三道题:一道组合数学、一道数论、一道概率论(AMC/AIME 难度)。
Claude Sonnet 4.5
组合和概率全对,数论那道在最后一步推导上出了错,但过程写得很清楚,错在哪一步一眼能看出来。
GPT-4.1
三道全对,推导步骤完整,格式最整洁。数学推理是 GPT-4.1 的强项,这次测试印证了这一点。
DeepSeek V3
组合题全对,另外两道有计算错误。但考虑到它的价格,性价比依然很高。
小结: GPT-4.1 > Claude ≈ DeepSeek V3(数学推理)
测试场景四:中文创作(技术博客润色)
给了一篇 2000 字的技术博客草稿,要求在保留技术准确性的前提下提升可读性。
Claude Sonnet 4.5
改动幅度适中,保留了原文的技术细节,语言更流畅,没有过度"美化"。
GPT-4.1
改得比较激进,有几处把技术术语换成了更通俗的说法,反而损失了精确性。
DeepSeek V3
改动保守,基本是句式微调,整体提升有限,但不会出错。
小结: Claude > DeepSeek V3 > GPT-4.1(中文技术写作)
成本对比:这才是很多人真正关心的
| 模型 | 官方输入价 | 官方输出价 | 无量Api SVIP 输入 | 无量Api SVIP 输出 |
|------|-----------|-----------|-----------------|-----------------|
| Claude Sonnet 4.5 | ¥21/M tokens | ¥105/M tokens | ¥7.5/M | ¥37/M |
| GPT-4.1 | ¥14/M tokens | ¥56/M tokens | ¥5/M | ¥20/M |
| DeepSeek V3 | ¥2/M tokens | ¥8/M tokens | ¥0.8/M | ¥3.2/M |
价格单位:人民币 / 百万 tokens。官方价按当前汇率折算,SVIP 为 7.7 折基础上的实际价格。
以一个中等规模的 API 使用场景为例(每月约 10M input + 5M output tokens,主要用 Claude Sonnet 4.5):
- 官方直接调用:10×21 + 5×105 = ¥735/月
- 无量Api SVIP:10×7.5 + 5×37 = ¥260/月
差价 ¥475,一年省下来快 ¥6000。
综合评分
| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |
|------|:-----------------:|:-------:|:-----------:|
| 代码 Debug | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
| 中文写作 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| 响应速度 | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 性价比 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
结论
没有哪个模型是全场最强的,这是测了三天最诚实的感受。
- 日常代码 + 长文档处理:Claude Sonnet 4.5 是首选,贵但值
- 数学/逻辑推理密集型任务:GPT-4.1 更稳
- 高频调用、成本敏感、速度优先:DeepSeek V3 没有对手
- 混合使用:按任务类型路由,成本和效果都能兼顾
关于国内访问的问题
V2EX 上最近有不少人问回国后怎么继续用这些模型,或者怎么找便宜的访问方式。
如果你需要稳定的 API 访问(不用梯子、国内直连),可以看看 无量Api(api2everything.xyz)。支持 OpenAI 格式,改一行 base_url 就能切换,300+ 模型都在一个账号里,注册送 ¥1 余额可以先试试手感,余额永久有效不会过期。
👉 https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb