横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

最近 V2EX 上关于 Codex 的讨论很多,有人在 Mac OS X 10.4 Tiger 上跑起来了,有人在抱怨额度莫名消耗,还有人发现 GPT-5.5 的上下文缩水到 258K。趁着这波热度,我用同一套测试任务把目前最热的几个模型跑了一遍,结果有点出乎意料。


测试对象 & 基本信息

| 模型 | 厂商 | 上下文窗口 | 官方输入价(/M tokens) | 官方输出价(/M tokens) |

|------|------|-----------|----------------------|----------------------|

| Claude Sonnet 4.5 | Anthropic | 200K | ¥21 | ¥105 |

| GPT-5 | OpenAI | 128K | ¥54 | ¥216 |

| Gemini 2.5 Pro | Google | 1M | ¥9 | ¥72 |

| DeepSeek V3 | DeepSeek | 64K | ¥2 | ¥8 |

| Grok 4 | xAI | 256K | ¥54 | ¥216 |

汇率按 1 USD = 7.2 CNY 换算,官方价格取各家 API 文档当前标价。

测试场景一:代码 Debug(真实 Bug)

任务:给一段 Python 异步爬虫,里面藏了三个 bug:一个 race condition、一个 session 未关闭的资源泄漏、一个正则边界错误。要求找出全部并修复,附解释。

结果

  • Claude Sonnet 4.5:三个 bug 全中,解释清晰,还额外指出了一个潜在的编码问题。输出格式干净,diff 风格呈现,直接可用。
  • GPT-5:三个 bug 全中,解释更偏教学风格,适合新手理解,但代码块有一处缩进错误需要手动修。
  • Gemini 2.5 Pro:找到两个,race condition 漏掉了,给出的修复方案有效但略显保守。
  • DeepSeek V3:三个 bug 全中,速度最快,解释简洁,适合老手。中文解释质量很高。
  • Grok 4:三个 bug 全中,风格偏 verbose,解释里夹了不少背景知识,篇幅最长。

小结:代码 debug 场景,Claude 4.5 和 DeepSeek V3 体验最顺手,一个胜在格式,一个胜在速度。


测试场景二:长文理解(40K tokens 技术文档)

任务:喂入一份 40K tokens 的 Kubernetes 源码注释文档,提问 5 个散落在不同位置的细节问题,要求引用原文段落作答。

结果

  • Claude Sonnet 4.5:5/5 全对,引用位置精准,没有幻觉。
  • GPT-5:4/5,有一题引用了相近但不完全正确的段落,答案方向对但细节偏差。
  • Gemini 2.5 Pro:5/5 全对,得益于 1M 上下文,处理这个任务最从容,速度也快。
  • DeepSeek V3:上下文 64K,文档截断后只能回答前半部分的问题,3/5。
  • Grok 4:4/5,表现稳定,但引用格式不统一。

小结:长文理解首选 Gemini 2.5 Pro,上下文优势明显。DeepSeek V3 在这个场景有硬伤。


测试场景三:数学推理(竞赛题)

任务:5 道 AMC 12 级别的数学题,要求给出完整推导过程。

| 模型 | 正确数 | 推导完整性 |

|------|--------|-----------|

| Claude Sonnet 4.5 | 4/5 | 高,步骤清晰 |

| GPT-5 | 5/5 | 高,偶有跳步 |

| Gemini 2.5 Pro | 5/5 | 高,格式最规整 |

| DeepSeek V3 | 4/5 | 中,有一题推导跳跃 |

| Grok 4 | 3/5 | 中,两题答案错误但过程看起来合理 |

小结:数学推理 GPT-5 和 Gemini 2.5 Pro 并列第一,Grok 4 这次表现低于预期。


测试场景四:成本计算(实际项目估算)

假设一个中等规模的 RAG 项目,每天处理:

  • 输入:500 万 tokens
  • 输出:100 万 tokens

每日成本对比(官方价 vs 无量Api SVIP 价)

| 模型 | 官方每日成本 | 无量Api SVIP 每日成本 | 节省 |

|------|------------|---------------------|------|

| Claude Sonnet 4.5 | ¥210 | ¥75 | 64% |

| GPT-5 | ¥486 | ¥175 | 64% |

| Gemini 2.5 Pro | ¥117 | ¥42 | 64% |

| DeepSeek V3 | ¥18 | ¥6.5 | 64% |

无量Api SVIP 折扣约 7.7 折,叠加本身比官方低的基础价,综合下来大约便宜 65%。

一个月下来,光 Claude Sonnet 4.5 就能省 ¥4000+,GPT-5 能省 ¥9000+。对于有稳定调用量的项目,这个差距很实在。


综合评分

| 维度 | Claude 4.5 | GPT-5 | Gemini 2.5 Pro | DeepSeek V3 | Grok 4 |

|------|-----------|-------|---------------|------------|--------|

| 代码能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 性价比 | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐ |

| 响应速度 | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |


结论

没有一个模型在所有场景都碾压其他人,这才是真实情况:

  • 日常代码开发:Claude 4.5 或 DeepSeek V3,前者格式好,后者便宜快。
  • 长文档处理:Gemini 2.5 Pro,1M 上下文不是噱头。
  • 数学/逻辑推理:GPT-5 或 Gemini 2.5 Pro。
  • 预算有限的项目:DeepSeek V3 性价比无敌,能用就用。
  • Grok 4:目前还不是首选,等后续版本。

关于访问成本

国内直连这几个模型一直是个麻烦事,官方 API 要么需要境外信用卡,要么延迟高,要么干脆访问不了。

我最近在用无量Api(api2everything.xyz),支持上面所有模型,国内直连,OpenAI 格式兼容,换个 base_url 就能用,不用改其他代码。注册送 ¥1 余额,可以先跑跑上面的测试场景感受一下。SVIP 价格大约是官方的 7.7 折,算下来比官方便宜 65% 左右,余额永久有效不过期。