Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论有点意外
Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论有点意外
最近 Codex 登陆 ChatGPT 移动端的消息让不少人重新关注起"到底哪个模型更适合日常开发"这个问题。V2EX 上也有人在讨论 GPT 网页版不稳定、代充号被封的问题——这些都在提醒我们:选对模型、用对渠道,比盲目追新重要得多。
我花了三天时间,用同一批任务跑了 Claude Sonnet 4.5、GPT-4.1、DeepSeek V3 三个模型,记录下真实感受。
测试方法说明
- 每个场景同一 prompt,不做任何针对性调优
- 多次运行取平均表现,不挑最好的一次
- 成本按实际 token 消耗计算
- 测试时间:2025 年 7 月
场景一:代码补全与 Bug 修复
测试 prompt: 给一段有竞态条件的 Go 并发代码,要求找出问题并修复。
| 模型 | 是否定位到竞态 | 修复方案质量 | 有无解释 |
|------|--------------|------------|--------|
| Claude Sonnet 4.5 | ✅ 准确 | 用 sync.Mutex,附加了 sync.RWMutex 的优化建议 | 详细 |
| GPT-4.1 | ✅ 准确 | 用 channel 方案,思路不同但可行 | 中等 |
| DeepSeek V3 | ✅ 准确 | 直接给 Mutex,无额外建议 | 简洁 |
三个都找到了问题。Claude 的回答最"啰嗦",但啰嗦得有价值——它主动提到了读写锁在读多写少场景下的性能差异,这是另外两个没说的。GPT-4.1 给了一个 channel 方案,风格更"Go 味",但对新手来说理解成本稍高。DeepSeek V3 最简洁,适合直接复制用。
小结: 代码场景三者差距不大,Claude 适合需要理解原理的场景,DeepSeek 适合快速出活。
场景二:长文理解与信息提取
测试材料: 一份 8000 字的技术规范文档(英文),要求提取所有 breaking change 并按影响程度排序。
| 模型 | 提取完整度 | 排序逻辑 | 遗漏项 |
|------|----------|--------|------|
| Claude Sonnet 4.5 | 高 | 清晰,有说明依据 | 1 处次要项 |
| GPT-4.1 | 中 | 有排序但依据模糊 | 3 处 |
| DeepSeek V3 | 中 | 基本按顺序,无排序逻辑 | 2 处 |
这个场景 Claude 明显领先。它不只是提取,还会说"这个 breaking change 影响所有使用默认配置的用户,优先级最高"——这种判断力在处理复杂文档时很有价值。GPT-4.1 遗漏了几处散落在文档中间的变更,DeepSeek 基本按原文顺序输出,没有做重新排序。
小结: 长文理解 Claude > GPT-4.1 > DeepSeek V3。
场景三:数学推理
测试题: 一道组合数学题(计算带约束条件的排列数),以及一道概率题(贝叶斯更新)。
| 模型 | 组合题 | 概率题 | 过程展示 |
|------|------|------|--------|
| Claude Sonnet 4.5 | ✅ 正确 | ✅ 正确 | 步骤清晰 |
| GPT-4.1 | ✅ 正确 | ✅ 正确 | 步骤清晰 |
| DeepSeek V3 | ✅ 正确 | ⚠️ 过程有误但结果碰巧对 | 过程有跳步 |
数学推理上 Claude 和 GPT-4.1 旗鼓相当,过程都写得很清楚。DeepSeek V3 在概率题上出现了推导跳步,中间有一步逻辑不严谨,虽然最终答案对了,但如果是更复杂的题目,这种跳步很可能导致错误。
小结: 严肃数学场景推荐 Claude 或 GPT-4.1,DeepSeek 适合简单计算。
场景四:成本计算(这才是重点)
这是很多人忽略的维度。模型能力差距有时候没那么大,但价格差距可以很大。
以下是三个模型的官方定价 vs 通过无量Api(SVIP 7.7折)的实际价格:
| 模型 | 官方输入价 | 官方输出价 | 无量Api SVIP 输入 | 无量Api SVIP 输出 |
|------|----------|----------|----------------|----------------|
| Claude Sonnet 4.5 | ¥21/M tokens | ¥105/M tokens | ¥7.5/M | ≈¥38/M |
| GPT-4.1 | ¥14/M tokens | ¥56/M tokens | ≈¥5/M | ≈¥20/M |
| DeepSeek V3 | ¥2/M tokens | ¥8/M tokens | ¥0.7/M | ≈¥2.8/M |
价格以人民币计,M = 百万 tokens,SVIP 折扣约 7.7 折,普通用户约 65% off 官方价。
实际场景换算: 假设你每天处理 100 个中等复杂度的任务,每个任务平均消耗 2000 input + 1000 output tokens:
- 用 Claude Sonnet 4.5 官方:每月约 ¥945
- 用无量Api SVIP:每月约 ¥338,省了 ¥607
- 用 DeepSeek V3(无量Api):每月约 ¥25,适合高频低复杂度任务
如果你的任务不需要 Claude 的长文理解优势,DeepSeek V3 的性价比几乎无敌。
综合对比表
| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |
|------|-----------------|---------|------------|
| 代码能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
| 回答详细度 | 高(有时过多) | 中 | 低(简洁) |
| 官方月均成本 | 高 | 中 | 极低 |
| 无量Api 成本 | 中 | 中低 | 极低 |
| 国内直连 | 需代理 | 需代理 | 需代理 |
结论
测了三天,说几个真实感受:
1. Claude Sonnet 4.5 确实是综合能力最强的,尤其是长文档处理和代码解释,但价格也最贵,适合对质量要求高、任务复杂度高的场景。
2. GPT-4.1 是最均衡的选择,代码和推理都不差,价格比 Claude 低,如果你已经习惯了 OpenAI 的风格,没必要强行切换。
3. DeepSeek V3 是性价比之王,简单任务、高频调用、预算有限的场景首选。不要因为它便宜就低估它,代码补全和日常问答完全够用。
4. 不要为了追新而追新。Codex 移动端刚出来,很多人跃跃欲试,但对大多数开发者来说,现有模型已经够用,选一个稳定的调用渠道比换模型更重要。
关于国内访问
这三个模型官方都需要代理,而且最近 GPT 网页版和 App 不稳定的问题不少人都遇到了。如果你需要稳定的国内直连、支持 300+ 模型、OpenAI 格式兼容(改一行 Base URL 就能用),可以看看 无量Api。
注册送 ¥1,余额永久不过期,SVIP 7.7 折,普通用户也比官方便宜 65%。
以上测试为个人实测,模型版本和表现可能随时间变化,仅供参考。