横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组 Bug 测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组 Bug 测了三天

最近 V2EX 上有人聊到「让 AI 写出三个月后还能看懂的代码」,我顺着这个方向做了一轮横评。选了当前讨论最热的三个模型:Claude Sonnet 4.5、GPT-5(目前 API 可用版本)、DeepSeek V3,用相同的 prompt、相同的测试用例,连续跑了三天,记录下来。

没有赞助,结论不保证你满意。


测试环境说明

  • 均通过 OpenAI 兼容格式调用(Base URL 统一,方便切换)
  • 温度统一 temperature=0.2,保证复现性
  • 每个场景各跑 3 次取中位表现
  • 成本按实际 token 消耗计算

场景一:代码补全与可读性

Prompt:给一段 150 行、有两处潜在竞态条件的 Python 异步爬虫,要求找出问题、修复、并写出「三个月后同事能看懂」的注释。

| 模型 | 找出竞态 | 修复质量 | 注释可读性 | 响应速度 |

|------|----------|----------|------------|----------|

| Claude Sonnet 4.5 | ✅ 两处全中 | 使用 asyncio.Lock,逻辑清晰 | ⭐⭐⭐⭐⭐ 解释了「为什么」 | 中等 |

| GPT-5 | ✅ 两处全中 | 修复正确,加了额外防御性代码 | ⭐⭐⭐⭐ 解释偏「是什么」 | 较快 |

| DeepSeek V3 | ✅ 找出一处,另一处给出提示 | 修复基本可用 | ⭐⭐⭐ 注释偏简略 | 很快 |

Claude 4.5 在注释风格上明显更接近「给人读的代码」,会写「这里加锁是因为多个协程可能同时写入缓存,不是因为担心性能」这类解释性语句。GPT-5 修复质量同样优秀,但注释倾向于描述操作而非意图。


场景二:长文理解与结构提取

Prompt:一份 12000 token 的技术 RFC 文档(英文),要求提取所有「决策点」及其背后的 tradeoff,输出结构化 JSON。

| 模型 | 提取准确率 | JSON 格式合规 | 遗漏关键决策 |

|------|------------|---------------|-------------|

| Claude Sonnet 4.5 | 约 91% | ✅ 一次通过 | 遗漏 1 处 |

| GPT-5 | 约 88% | ✅ 一次通过 | 遗漏 2 处 |

| DeepSeek V3 | 约 79% | ⚠️ 需要二次修正 | 遗漏 3 处 |

长上下文是 Claude 系列的传统优势,这次也没例外。DeepSeek V3 在超长文档上表现有所下滑,但考虑到价格差距,仍然值得用于对准确率要求没那么苛刻的场景。


场景三:数学推理

Prompt:一道竞赛级别的组合数学证明题(需要归纳法 + 容斥原理),要求给出完整证明过程。

| 模型 | 证明路径 | 是否自洽 | 中间步骤清晰度 |

|------|----------|----------|----------------|

| Claude Sonnet 4.5 | 归纳 + 容斥,路径正确 | ✅ | 高,分步标注 |

| GPT-5 | 直接容斥,更简洁 | ✅ | 高,但跳步较多 |

| DeepSeek V3 | 归纳法,有一步推导存疑 | ⚠️ 部分步骤需验证 | 中等 |

GPT-5 这次给出了更优雅的解法,步骤更少。Claude 4.5 的解法路径更长但每步都有交代,适合教学场景。DeepSeek V3 有一步推导我验证后发现结论正确但过程写得不够严谨。


场景四:成本计算(这才是重点)

用场景二的 RFC 测试为例,实际消耗约:输入 12000 tokens + 输出 800 tokens。

官方价格 vs 无量Api价格对比:

| 模型 | 官方输入价 | 官方输出价 | 无量Api SVIP 输入 | 无量Api SVIP 输出 | 单次调用成本(官方) | 单次调用成本(无量) |

|------|------------|------------|------------------|------------------|---------------------|---------------------|

| Claude Sonnet 4.5 | ¥21.6/M | ¥108/M | ¥7.5/M | ¥37.7/M | ¥0.346 | ¥0.120 |

| GPT-5 | ¥54/M | ¥216/M | ¥18.9/M | ¥75.6/M | ¥0.821 | ¥0.287 |

| DeepSeek V3 | ¥2/M | ¥8/M | ¥0.8/M | ¥3.1/M | ¥0.030 | ¥0.012 |

跑 1000 次 RFC 分析任务的成本差距:

  • Claude Sonnet 4.5:官方 ¥346 vs 无量 ¥120,省 ¥226
  • GPT-5:官方 ¥821 vs 无量 ¥287,省 ¥534
  • DeepSeek V3:本来就便宜,无量再打折后几乎可以忽略不计

对于个人开发者来说,这个差距在跑量上来之后很明显。


综合结论

| 维度 | Claude Sonnet 4.5 | GPT-5 | DeepSeek V3 |

|------|-------------------|-------|-------------|

| 代码理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 长文处理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |

| 性价比 | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ |

| 响应速度 | 中 | 快 | 很快 |

怎么选

  • 写代码、做代码审查、处理长文档 → Claude Sonnet 4.5
  • 数学、逻辑推理、需要更简洁输出 → GPT-5
  • 高频调用、成本敏感、对准确率要求适中 → DeepSeek V3

没有哪个模型全面碾压,根据任务类型混用才是实际项目中的常规操作。


关于国内访问的实际问题

这三天测试过程中,直连官方 API 中间断了两次,换 Base URL 是省心的办法。我目前用的是无量Api,支持上面三个模型以及 Gemini 2.5、Grok 4 等 300+ 模型,OpenAI 格式兼容,改一行 base_url 就能切过去,国内直连不需要额外配置。

注册有 ¥1 体验额度,余额不过期,可以先跑几个场景试试看。

https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb