横评对比 · 阅读约 6 分钟

Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了 3 天

Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了 3 天

最近几个模型同台竞技的讨论很多,与其争来争去,不如实测说话。我选了 4 个日常高频场景,用同样的 prompt 喂给三个模型,记录下真实结果和成本。

测试说明

  • 测试时间:2025 年 7 月
  • 模型版本:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3(0324)
  • 调用方式:API,temperature 统一 0.7,没有特别的系统提示
  • 成本单位:人民币,按 token 实际消耗折算

场景一:找 Bug + 修复建议

任务描述:给一段 300 行的 Python 异步爬虫,里面藏了 3 个 bug(一个并发锁问题、一个 session 未关闭、一个异常吞掉了导致静默失败)。

| 模型 | 找出 bug 数 | 修复质量 | 解释清晰度 |

|------|------------|---------|-----------|

| Claude Sonnet 4.5 | 3/3 | ★★★★★ | 逐行解释,指出根因 |

| GPT-4.1 | 3/3 | ★★★★☆ | 修复正确,解释略简 |

| DeepSeek V3 | 2/3 | ★★★☆☆ | 并发锁问题漏了 |

Claude 这次表现最稳,特别是对并发问题的描述很到位,直接点出了 asyncio.Lock 的作用域不对。GPT-4.1 修复也没问题,就是解释不如 Claude 细致。DeepSeek V3 在这个场景稍弱,但考虑到价格差距,漏一个 bug 也情有可原。


场景二:长文理解 + 信息抽取

任务描述:一篇 8000 字的技术文档(英文),要求:① 提炼核心观点 3 条;② 找出所有数字结论;③ 指出作者没有支撑的论断。

| 模型 | 核心观点准确性 | 数字抽取完整性 | 识别无支撑论断 |

|------|--------------|--------------|--------------|

| Claude Sonnet 4.5 | 准确,有层次 | 完整(12/12) | 找到 4 处 |

| GPT-4.1 | 准确 | 完整(12/12) | 找到 3 处 |

| DeepSeek V3 | 基本准确 | 略有遗漏(10/12)| 找到 2 处 |

长文场景是 Claude 的传统强项,这次继续稳。GPT-4.1 差距不大,两者都能做到"读完全文再说话"。DeepSeek V3 漏了 2 个数字,可能是上下文处理上还有差距。


场景三:数学推理(竞赛级)

任务描述:3 道 AMC 12 难度题 + 1 道概率论应用题(贝叶斯更新,条件比较绕)。

| 模型 | 答对题数 | 过程是否完整 | 有无"假装自信"错误 |

|------|---------|------------|-----------------|

| Claude Sonnet 4.5 | 3/4 | 完整 | 1 处 |

| GPT-4.1 | 3/4 | 完整 | 0 处 |

| DeepSeek V3 | 4/4 | 完整 | 0 处 |

这个场景 DeepSeek V3 赢了,而且是全对。数学推理一直是 DeepSeek 系列的强项,这次再次印证。GPT-4.1 答对 3 题但没有出现"自信地给出错误答案"的情况,相对稳健。Claude 有一处明显的计算失误。


场景四:代码生成(从需求到可跑)

任务描述:用 FastAPI 写一个带 JWT 鉴权的文件上传接口,要求支持断点续传,返回上传进度。

| 模型 | 代码能否直接跑 | 功能完整性 | 代码风格 |

|------|-------------|----------|---------|

| Claude Sonnet 4.5 | ✅ | 断点续传完整实现 | 整洁,注释到位 |

| GPT-4.1 | ✅ | 断点续传完整实现 | 整洁 |

| DeepSeek V3 | ⚠️ 小改动后可跑 | 断点逻辑有简化 | 中规中矩 |

Claude 和 GPT-4.1 打了个平手,生成的代码质量都很高。DeepSeek V3 的断点续传逻辑做了简化(没有 chunk 校验),需要自己补。


成本对比(这才是重点)

光看能力不看价格没意义,API 调用是长期成本。

官方定价 vs 无量Api

| 模型 | 官方输入价 | 官方输出价 | 无量Api SVIP 输入 | 无量Api SVIP 输出 |

|------|----------|----------|----------------|----------------|

| Claude Sonnet 4.5 | ¥21/M tokens | ¥105/M tokens | ¥7.5/M | ¥37.5/M |

| GPT-4.1 | ¥14/M tokens | ¥56/M tokens | ¥5.0/M | ¥20/M |

| DeepSeek V3 | ¥1.33/M tokens | ¥5.32/M tokens | ¥0.5/M | ¥2.0/M |

注:官方价格按美元汇率 7.2 折算,无量Api SVIP 为 7.7 折,普通用户也有折扣。

实测这 4 个场景总 token 消耗

每个场景约 2000 input + 800 output tokens,4 个场景合计约 8000 input + 3200 output。

| 模型 | 官方费用 | 无量Api SVIP 费用 | 节省 |

|------|---------|----------------|-----|

| Claude Sonnet 4.5 | ¥0.50 | ¥0.18 | 64% |

| GPT-4.1 | ¥0.29 | ¥0.10 | 65% |

| DeepSeek V3 | ¥0.028 | ¥0.010 | 64% |

单次测试费用差距看起来小,但如果是每天跑几百次调用的项目,月度成本差距会非常显著。


总结

不绕弯子,直接说结论:

选 Claude Sonnet 4.5:如果你的核心场景是代码审查、长文档分析、需要详细解释的任务,Claude 4.5 目前仍然是综合体验最好的,特别是"解释为什么"这件事做得很扎实。

选 GPT-4.1:如果你在意稳健性,不想出现"自信地给错误答案"的情况,GPT-4.1 在这点上表现得很克制。工具调用的生态也最成熟。

选 DeepSeek V3:数学、逻辑推理场景优先选它,而且价格是三者中最低的,性价比无敌。对于预算有限的个人开发者,DeepSeek V3 基本够用。

没有一个模型在所有场景都碾压其他两个,按场景选模型是更务实的做法。


关于访问和成本

上面成本表里的无量Api价格来自 api2everything.xyz。国内直连,不需要代理,支持 OpenAI 格式,只改一行 base_url 就能切换。注册送 ¥1 余额,够跑不少测试了,余额也不会过期。

如果你在做模型选型,先用送的余额把自己的核心 prompt 跑一遍,比看任何评测都准。