Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
最近 V2EX 上关于 Codex 的讨论很多,有人在 Mac OS X 10.4 Tiger 上跑起来了,有人在抱怨额度莫名消耗,还有人发现 GPT-5.5 的上下文缩水到 258K。趁着这波热度,我用同一套测试任务把目前最热的几个模型跑了一遍,结果有点出乎意料。
测试对象 & 基本信息
| 模型 | 厂商 | 上下文窗口 | 官方输入价(/M tokens) | 官方输出价(/M tokens) |
|------|------|-----------|----------------------|----------------------|
| Claude Sonnet 4.5 | Anthropic | 200K | ¥21 | ¥105 |
| GPT-5 | OpenAI | 128K | ¥54 | ¥216 |
| Gemini 2.5 Pro | Google | 1M | ¥9 | ¥72 |
| DeepSeek V3 | DeepSeek | 64K | ¥2 | ¥8 |
| Grok 4 | xAI | 256K | ¥54 | ¥216 |
汇率按 1 USD = 7.2 CNY 换算,官方价格取各家 API 文档当前标价。
测试场景一:代码 Debug(真实 Bug)
任务:给一段 Python 异步爬虫,里面藏了三个 bug:一个 race condition、一个 session 未关闭的资源泄漏、一个正则边界错误。要求找出全部并修复,附解释。
结果:
- Claude Sonnet 4.5:三个 bug 全中,解释清晰,还额外指出了一个潜在的编码问题。输出格式干净,diff 风格呈现,直接可用。
- GPT-5:三个 bug 全中,解释更偏教学风格,适合新手理解,但代码块有一处缩进错误需要手动修。
- Gemini 2.5 Pro:找到两个,race condition 漏掉了,给出的修复方案有效但略显保守。
- DeepSeek V3:三个 bug 全中,速度最快,解释简洁,适合老手。中文解释质量很高。
- Grok 4:三个 bug 全中,风格偏 verbose,解释里夹了不少背景知识,篇幅最长。
小结:代码 debug 场景,Claude 4.5 和 DeepSeek V3 体验最顺手,一个胜在格式,一个胜在速度。
测试场景二:长文理解(40K tokens 技术文档)
任务:喂入一份 40K tokens 的 Kubernetes 源码注释文档,提问 5 个散落在不同位置的细节问题,要求引用原文段落作答。
结果:
- Claude Sonnet 4.5:5/5 全对,引用位置精准,没有幻觉。
- GPT-5:4/5,有一题引用了相近但不完全正确的段落,答案方向对但细节偏差。
- Gemini 2.5 Pro:5/5 全对,得益于 1M 上下文,处理这个任务最从容,速度也快。
- DeepSeek V3:上下文 64K,文档截断后只能回答前半部分的问题,3/5。
- Grok 4:4/5,表现稳定,但引用格式不统一。
小结:长文理解首选 Gemini 2.5 Pro,上下文优势明显。DeepSeek V3 在这个场景有硬伤。
测试场景三:数学推理(竞赛题)
任务:5 道 AMC 12 级别的数学题,要求给出完整推导过程。
| 模型 | 正确数 | 推导完整性 |
|------|--------|-----------|
| Claude Sonnet 4.5 | 4/5 | 高,步骤清晰 |
| GPT-5 | 5/5 | 高,偶有跳步 |
| Gemini 2.5 Pro | 5/5 | 高,格式最规整 |
| DeepSeek V3 | 4/5 | 中,有一题推导跳跃 |
| Grok 4 | 3/5 | 中,两题答案错误但过程看起来合理 |
小结:数学推理 GPT-5 和 Gemini 2.5 Pro 并列第一,Grok 4 这次表现低于预期。
测试场景四:成本计算(实际项目估算)
假设一个中等规模的 RAG 项目,每天处理:
- 输入:500 万 tokens
- 输出:100 万 tokens
每日成本对比(官方价 vs 无量Api SVIP 价):
| 模型 | 官方每日成本 | 无量Api SVIP 每日成本 | 节省 |
|------|------------|---------------------|------|
| Claude Sonnet 4.5 | ¥210 | ¥75 | 64% |
| GPT-5 | ¥486 | ¥175 | 64% |
| Gemini 2.5 Pro | ¥117 | ¥42 | 64% |
| DeepSeek V3 | ¥18 | ¥6.5 | 64% |
无量Api SVIP 折扣约 7.7 折,叠加本身比官方低的基础价,综合下来大约便宜 65%。
一个月下来,光 Claude Sonnet 4.5 就能省 ¥4000+,GPT-5 能省 ¥9000+。对于有稳定调用量的项目,这个差距很实在。
综合评分
| 维度 | Claude 4.5 | GPT-5 | Gemini 2.5 Pro | DeepSeek V3 | Grok 4 |
|------|-----------|-------|---------------|------------|--------|
| 代码能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 性价比 | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐ |
| 响应速度 | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
结论
没有一个模型在所有场景都碾压其他人,这才是真实情况:
- 日常代码开发:Claude 4.5 或 DeepSeek V3,前者格式好,后者便宜快。
- 长文档处理:Gemini 2.5 Pro,1M 上下文不是噱头。
- 数学/逻辑推理:GPT-5 或 Gemini 2.5 Pro。
- 预算有限的项目:DeepSeek V3 性价比无敌,能用就用。
- Grok 4:目前还不是首选,等后续版本。
关于访问成本
国内直连这几个模型一直是个麻烦事,官方 API 要么需要境外信用卡,要么延迟高,要么干脆访问不了。
我最近在用无量Api(api2everything.xyz),支持上面所有模型,国内直连,OpenAI 格式兼容,换个 base_url 就能用,不用改其他代码。注册送 ¥1 余额,可以先跑跑上面的测试场景感受一下。SVIP 价格大约是官方的 7.7 折,算下来比官方便宜 65% 左右,余额永久有效不过期。