Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批 prompt 测了三天,结论有点意外
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批 prompt 测了三天,结论有点意外
最近几个模型都在密集更新,社区里讨论最热的无非是 Claude 4.5、GPT-5、DeepSeek V3 这三个。与其看各家的发布会 PPT,不如自己动手测。
我用同一套 prompt 集跑了三天,测了代码调试、长文理解、数学推理、日常对话四个场景,顺手也算了一下实际用下来的成本差异。结论写在最后,先说测试过程。
测试说明
- 所有 prompt 固定,不针对某个模型调整措辞
- 代码测试用的是真实项目里遇到的 bug,不是 LeetCode 玩具题
- 长文理解塞了一篇 18000 token 的技术文档
- 数学推理用了竞赛级别的组合数学题(AMC/AIME 难度)
- 每个场景各跑 10 次取平均,避免随机性干扰
场景一:代码调试
测试内容:一个 Python async 并发 bug,race condition 导致的偶发性数据覆盖,加上一段有内存泄漏的 Rust 代码。
| 模型 | 定位准确率 | 修复质量 | 解释清晰度 |
|------|-----------|---------|-----------|
| Claude 4.5 | ✅ 10/10 | 给了 2 种方案,分析了 tradeoff | ⭐⭐⭐⭐⭐ |
| GPT-5 | ✅ 9/10 | 直接给修复代码,少解释 | ⭐⭐⭐⭐ |
| DeepSeek V3 | ✅ 8/10 | 偶发漏掉边界情况 | ⭐⭐⭐⭐ |
Claude 4.5 在代码场景里确实更"像高级工程师",不只是改代码,会主动问你这段的上下文意图。GPT-5 效率更高,直接给答案,适合你已经知道方向只需要它动手的场景。DeepSeek V3 表现稳定,偶尔在复杂并发场景里漏细节。
场景二:长文理解
测试内容:18000 token 的技术规范文档(真实的 RFC 草稿),问三类问题:事实抽取、跨段落推理、潜在矛盾识别。
| 模型 | 事实抽取 | 跨段落推理 | 矛盾识别 |
|------|---------|-----------|---------|
| Claude 4.5 | 准确 | 强,能串联远距离段落 | 发现 2/3 处矛盾 |
| GPT-5 | 准确 | 中等,偶尔混淆段落归属 | 发现 1/3 处矛盾 |
| DeepSeek V3 | 准确 | 中等 | 发现 1/3 处矛盾 |
长文理解是 Claude 的传统强项,这次没有意外。GPT-5 和 DeepSeek V3 在事实抽取上旗鼓相当,但涉及到需要把文档第 3 页和第 47 页联系起来分析的题目,Claude 的优势就拉开了。
场景三:数学推理
测试内容:5 道 AIME 级别组合数学题,要求写出完整推理过程。
| 模型 | 解题正确数 | 推理过程完整性 | 有无中途放弃 |
|------|-----------|-------------|------------|
| Claude 4.5 | 3/5 | 完整,步骤清晰 | 无 |
| GPT-5 | 4/5 | 完整,偶有跳步 | 无 |
| DeepSeek V3 | 4/5 | 完整 | 无 |
这个场景有点意外——GPT-5 和 DeepSeek V3 反超了 Claude。GPT-5 在数学推理上确实有明显提升,DeepSeek V3 一直是数学强项,基本符合预期。Claude 4.5 不差,但在纯符号推理上不是最强选项。
场景四:代码补全 + 文档生成
测试内容:给一个没有注释的 700 行 TypeScript 文件,要求补全函数实现 + 生成 JSDoc + 写单测。
| 模型 | 补全质量 | 文档规范性 | 单测覆盖率 |
|------|---------|-----------|---------|
| Claude 4.5 | ⭐⭐⭐⭐⭐ | 标准 JSDoc,考虑了边缘 case | 高,有 mock |
| GPT-5 | ⭐⭐⭐⭐ | 规范,偶尔过于简洁 | 中等 |
| DeepSeek V3 | ⭐⭐⭐⭐ | 规范 | 中等 |
工程向任务 Claude 依然稳。
成本:这才是大多数人绕不开的问题
测完能力,算钱。以下是主流用法下的真实价格对比(输入 token 价格,每百万 token):
| 模型 | 官方价(¥/M token) | 无量Api SVIP价(¥/M token) | 节省 |
|------|-------------------|--------------------------|-----|
| Claude Sonnet 4.5 | ¥21 | ¥7.5 | 64% |
| GPT-5 | ¥72 | ¥25 | 65% |
| DeepSeek V3 | ¥2 | ¥1.4 | 30% |
| Gemini 2.5 Pro | ¥22 | ¥8 | 64% |
拿 Claude Sonnet 4.5 举例:如果你每天跑 200 次 API 调用,每次平均 2000 token 输入,一个月下来:
- 官方直连:约 ¥252/月
- 无量Api SVIP:约 ¥90/月
差价直接能买一张好一点的机械键盘。如果是团队用量,差距会更明显。
综合结论
说实话没有"绝对最强",适合的才是最好的:
- 工程代码、长文档处理:Claude 4.5 首选,推理过程透明,适合需要理解而不只是结果的场景
- 数学 / 逻辑推理、快速问答:GPT-5 或 DeepSeek V3,两者旗鼓相当,后者便宜很多
- 成本敏感的高频调用:DeepSeek V3 性价比极高,能力也不弱
- 需要同时调多模型做 fallback:统一接口最省心
如果你只用一个模型,按上面场景对号入座。如果你的项目需要多模型混用,接口统一是个实际问题——每个官方 API 的鉴权方式和格式都有差异,维护成本不低。
关于 API 接入
这次测试用的是 无量Api,国内直连,不需要科学上网,支持上面所有模型,格式完全兼容 OpenAI SDK,改一行 base_url 就能切。注册有 ¥1 余额可以直接试,永久不过期。
对于 V2EX 读者:这是 V2EX 专属链接
价格差这么多的原因不复杂:量大批发价加上运营成本摊薄,官方对个人开发者没有这种优惠通道。如果你在认真做项目,API 成本值得认真算一算。