Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
最近 V2EX 上关于 GPT 订阅、Codex 使用的讨论很多,HN 上也有人在聊 DeepClaude 用 DeepSeek 跑 Claude Code 循环省了 17 倍成本。趁这个机会,我用同一套测试任务把目前最热的几个模型跑了一遍,结果有些出乎意料。
测试说明
测试模型:Claude Sonnet 4.5 / GPT-5 / Gemini 2.5 Pro / DeepSeek V3 / Grok 4
测试时间:连续三天,每个场景重复 3 次取中位结果
评分维度:准确性、响应质量、速度、成本
场景一:代码 Debug(真实 Bug)
用一段有竞态条件的 Python 异步代码,不给任何提示,直接让模型定位问题。
async def fetch_all(urls):
results = []
async with aiohttp.ClientSession() as session:
for url in urls:
resp = await session.get(url)
results.append(await resp.json())
return results
# 问题:session 在循环内被复用但异常处理缺失,高并发下会静默失败
| 模型 | 是否定位核心问题 | 给出修复方案 | 解释质量 |
|------|----------------|------------|--------|
| Claude Sonnet 4.5 | ✅ 精准 | ✅ asyncio.gather + 异常捕获 | ⭐⭐⭐⭐⭐ |
| GPT-5 | ✅ 精准 | ✅ 同上,额外提了超时设置 | ⭐⭐⭐⭐⭐ |
| Gemini 2.5 Pro | ✅ 定位到 | ⚠️ 修复方案不完整 | ⭐⭐⭐⭐ |
| DeepSeek V3 | ✅ 精准 | ✅ 方案完整 | ⭐⭐⭐⭐ |
| Grok 4 | ⚠️ 部分定位 | ⚠️ 只修了表面 | ⭐⭐⭐ |
小结:Claude 4.5 和 GPT-5 在代码理解上旗鼓相当,DeepSeek V3 性价比突出,Grok 4 在这个场景表现偏弱。
场景二:长文理解(8000 字技术文档)
喂入一篇 8000 字的 Kubernetes 网络策略文档,提问 5 个需要跨段落推理的问题。
| 模型 | 答题准确率 | 引用原文 | 幻觉情况 |
|------|----------|--------|--------|
| Claude Sonnet 4.5 | 5/5 | ✅ 精确引用 | 无 |
| GPT-5 | 4/5 | ✅ 引用准确 | 1 处轻微 |
| Gemini 2.5 Pro | 5/5 | ✅ 引用准确 | 无 |
| DeepSeek V3 | 4/5 | ⚠️ 引用偶有偏差 | 1 处 |
| Grok 4 | 3/5 | ⚠️ 部分引用 | 2 处 |
小结:长文理解上 Claude 4.5 和 Gemini 2.5 Pro 并列第一,这两个模型的上下文处理能力确实有代差。
场景三:数学推理(竞赛级别)
选了 3 道 AMC 12 难度题 + 1 道需要分步证明的数论题。
| 模型 | AMC 正确数 | 数论证明 | 过程严谨性 |
|------|----------|--------|---------|
| GPT-5 | 3/3 | ✅ 完整 | ⭐⭐⭐⭐⭐ |
| Claude Sonnet 4.5 | 3/3 | ✅ 完整 | ⭐⭐⭐⭐⭐ |
| Gemini 2.5 Pro | 3/3 | ✅ 完整 | ⭐⭐⭐⭐⭐ |
| DeepSeek V3 | 2/3 | ⚠️ 证明有跳步 | ⭐⭐⭐⭐ |
| Grok 4 | 2/3 | ❌ 结论错误 | ⭐⭐⭐ |
小结:顶层三家在数学推理上已经很接近,DeepSeek V3 略逊但差距不大,Grok 4 在严格证明上还有差距。
场景四:成本计算(这才是关键)
实际项目场景:每天处理 500 篇文章摘要,平均每次 2000 token 输入 + 500 token 输出,一个月下来的费用。
官方价格(美元转人民币按 7.2)
| 模型 | 输入价 | 输出价 | 月成本估算 |
|------|------|------|---------|
| Claude Sonnet 4.5 | ¥21/M token | ¥63/M token | ¥约 1,260 |
| GPT-5 | ¥54/M token | ¥216/M token | ¥约 3,510 |
| Gemini 2.5 Pro | ¥9/M token | ¥27/M token | ¥约 540 |
| DeepSeek V3 | ¥1.3/M token | ¥5.3/M token | ¥约 90 |
通过无量Api(SVIP 7.7 折,普通用户约 3.5 折)
| 模型 | 无量Api 输入价 | 无量Api 输出价 | 月成本(SVIP) |
|------|------------|------------|------------|
| Claude Sonnet 4.5 | ¥7.5/M token | ¥22.5/M token | ¥约 450 |
| GPT-5 | ¥19/M token | ¥76/M token | ¥约 1,235 |
| Gemini 2.5 Pro | ¥3.2/M token | ¥9.5/M token | ¥约 192 |
| DeepSeek V3 | ¥0.5/M token | ¥2/M token | ¥约 33 |
同样跑 Claude Sonnet 4.5,官方 ¥1,260 vs 无量Api SVIP ¥450,省下来的钱够再跑两个月。
综合横评
| 维度 | Claude 4.5 | GPT-5 | Gemini 2.5 Pro | DeepSeek V3 | Grok 4 |
|------|-----------|-------|---------------|------------|--------|
| 代码能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 官方成本 | 中 | 高 | 低 | 极低 | 中 |
| 国内直连 | ❌ | ❌ | ❌ | ✅ | ❌ |
| 综合推荐 | 代码/写作首选 | 全能但贵 | 长文/多模态 | 日常高频首选 | 暂不推荐 |
我的实际用法
测完之后我自己的工作流是这样的:
- 日常代码辅助:DeepSeek V3,成本极低,够用
- 复杂 Bug 分析 / 长文档处理:Claude Sonnet 4.5,质量有保证
- 多模态任务(图表理解):Gemini 2.5 Pro
- GPT-5:偶尔用,但价格让我很难把它设为默认
这套组合在国内直接用的话,网络是个问题。我现在统一走 无量Api,300+ 模型国内直连,OpenAI 格式兼容,换模型只改一个 model 参数,Base URL 改一行就接入。注册送 ¥1 余额,可以先把上面几个模型都试一遍再决定用哪个。
SVIP 价格是官方的 7.7 折,普通用户也有折扣,余额永久有效不会过期,适合不是每天高频使用的场景。
价格数据截至发文时,以实际页面为准。测试结果基于特定任务,不同场景可能有差异。