横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组任务测了三天

最近几个主力模型都在密集更新,Claude Sonnet 4.5、GPT-5、DeepSeek V3 各有拥趸,争论从没停过。与其看跑分,不如拿真实工作场景测一遍。

测试周期:3 天,每个场景同 prompt、同温度参数,多轮采样取中位表现。


测试场景一:代码调试(Bug Reproduction)

任务:给一段有竞态条件的 Go 协程代码,要求定位问题、给出修复方案、写单元测试。


// 原始代码(简化)

var counter int

for i := 0; i < 100; i++ {

    go func() { counter++ }()

}

fmt.Println(counter)

| 模型 | 定位准确率 | 修复质量 | 测试覆盖度 | 响应速度 |

|---|---|---|---|---|

| Claude Sonnet 4.5 | ✅ 精准指出 data race | ✅ sync/atomic + mutex 两套方案 | ✅ 含 race detector 测试 | 中等 |

| GPT-5 | ✅ 精准 | ✅ 给出 channel 方案更优雅 | ⚠️ 测试略简单 | 快 |

| DeepSeek V3 | ✅ 精准 | ✅ 方案正确 | ⚠️ 未主动加 -race flag 说明 | 最快 |

小结:三者都能准确定位竞态问题。GPT-5 给出的 channel 方案在 Go 惯用法上更地道;Claude 4.5 的解释最详细,适合教学场景;DeepSeek V3 速度最快,适合快速迭代。


测试场景二:长文理解与信息提取

任务:输入一份 8000 字的英文技术 RFC 文档,要求提取关键设计决策、列出 trade-off、用中文写摘要。

| 模型 | 关键信息覆盖 | Trade-off 理解 | 中文表达 | 幻觉风险 |

|---|---|---|---|---|

| Claude Sonnet 4.5 | ⭐⭐⭐⭐⭐ | 深入,能识别隐含假设 | 流畅自然 | 低 |

| GPT-5 | ⭐⭐⭐⭐ | 准确但较表面 | 流畅 | 中 |

| DeepSeek V3 | ⭐⭐⭐⭐ | 准确 | 更偏直译腔 | 低 |

小结:长文理解是 Claude 4.5 的强项,对 RFC 这类结构化文档的隐含逻辑把握明显更好。DeepSeek V3 的中文摘要有时偏机翻风格,但事实准确性不差。


测试场景三:数学推理

任务:一道组合数学证明题(鸽巢原理变体),要求给出严格证明步骤。

| 模型 | 证明正确性 | 步骤严谨度 | 能否自我纠错 |

|---|---|---|---|

| Claude Sonnet 4.5 | ✅ 正确 | ⭐⭐⭐⭐ | 是,会主动检验边界 |

| GPT-5 | ✅ 正确 | ⭐⭐⭐⭐⭐ | 是,步骤最规范 |

| DeepSeek V3 | ⚠️ 首次有小跳步 | ⭐⭐⭐ | 追问后能补全 |

小结:GPT-5 在数学证明的形式化程度上最强,步骤接近教材写法。DeepSeek V3 在纯推理题上偶有跳步,需要追问确认。值得注意的是,最近 HN 上有人声称 GPT-5.6 Sol Ultra 产出了「Cycle Double Cover 猜想」的证明草稿,数学推理能力的天花板还在快速上移。


测试场景四:成本对比(最关键的部分)

说完能力,说钱。API 调用成本在实际生产里往往比能力差异更影响决策。

以下价格以每百万 token(M tokens)计,输入+输出混合估算,官方价折算为人民币(汇率 ≈ 7.25)。

| 模型 | 官方价(¥/M) | 无量Api 普通价 | 无量Api SVIP价 | 省多少 |

|---|---|---|---|---|

| Claude Sonnet 4.5 | ¥21.0 | ¥10.5 | ¥7.5 | 节省 64% |

| GPT-5 | ¥108.0 | ¥54.0 | ¥38.5 | 节省 64% |

| DeepSeek V3 | ¥4.0(官方) | ¥2.0 | ¥1.4 | 节省 65% |

| Gemini 2.5 Pro | ¥18.0 | ¥9.0 | ¥6.4 | 节省 64% |

举个实际例子:一个中等规模的 RAG 应用,每天约消耗 500M tokens 的 Claude Sonnet 4.5,官方 API 月成本约 ¥315,000,SVIP 价下降到 ¥112,500——每月能省将近 20 万。


综合评分

| 维度 | Claude Sonnet 4.5 | GPT-5 | DeepSeek V3 |

|---|---|---|---|

| 代码调试 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |

| 中文表达 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 性价比 | 中 | 低 | 极高 |

| 响应速度 | 中 | 快 | 最快 |


我的实际选用策略

不同场景用不同模型才是成熟做法,没有哪个"全场最强":

  • 文档分析、长上下文对话:Claude Sonnet 4.5,理解深度和中文质量值回票价
  • 严谨数学/复杂推理:GPT-5,但成本高,按需调用
  • 日常代码补全、高频调用场景:DeepSeek V3,速度快、成本低,够用就是最好
  • 多模态任务:Gemini 2.5 Pro,这块没在上面详测,但图像理解体验不错

这个策略的前提是:三个模型都能用同一套 API Key 管理,不用分别注册账号、分别管理额度。


关于国内直连访问

测试过程中用的是 无量Api,主要原因是:

1. 国内直连,不用挂代理,延迟稳定,不会在关键时刻断线

2. OpenAI 格式统一,切换模型只改 model 参数,不改调用逻辑

3. 300+ 模型一个平台管理,Claude / GPT / Gemini / DeepSeek / Grok 全有

4. 注册就送 ¥1 余额,余额永久有效,可以先试试再决定充值档位

对于 V2EX 上经常讨论的「绑卡失败」「额度重置」「账号关联混乱」这些问题,用 API 中转平台是最省心的解法——账号安全和额度管理都不用自己操心。

如果你也在做模型横评或者需要批量测试,欢迎直接用:

👉 api2everything.xyz