横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

最近 V2EX 上关于 GPT 订阅、Codex 使用的讨论很多,HN 上也有人在聊 DeepClaude 用 DeepSeek 跑 Claude Code 循环省了 17 倍成本。趁这个机会,我用同一套测试任务把目前最热的几个模型跑了一遍,结果有些出乎意料。


测试说明

测试模型:Claude Sonnet 4.5 / GPT-5 / Gemini 2.5 Pro / DeepSeek V3 / Grok 4

测试时间:连续三天,每个场景重复 3 次取中位结果

评分维度:准确性、响应质量、速度、成本


场景一:代码 Debug(真实 Bug)

用一段有竞态条件的 Python 异步代码,不给任何提示,直接让模型定位问题。


async def fetch_all(urls):

    results = []

    async with aiohttp.ClientSession() as session:

        for url in urls:

            resp = await session.get(url)

            results.append(await resp.json())

    return results

# 问题:session 在循环内被复用但异常处理缺失,高并发下会静默失败

| 模型 | 是否定位核心问题 | 给出修复方案 | 解释质量 |

|------|----------------|------------|--------|

| Claude Sonnet 4.5 | ✅ 精准 | ✅ asyncio.gather + 异常捕获 | ⭐⭐⭐⭐⭐ |

| GPT-5 | ✅ 精准 | ✅ 同上,额外提了超时设置 | ⭐⭐⭐⭐⭐ |

| Gemini 2.5 Pro | ✅ 定位到 | ⚠️ 修复方案不完整 | ⭐⭐⭐⭐ |

| DeepSeek V3 | ✅ 精准 | ✅ 方案完整 | ⭐⭐⭐⭐ |

| Grok 4 | ⚠️ 部分定位 | ⚠️ 只修了表面 | ⭐⭐⭐ |

小结:Claude 4.5 和 GPT-5 在代码理解上旗鼓相当,DeepSeek V3 性价比突出,Grok 4 在这个场景表现偏弱。


场景二:长文理解(8000 字技术文档)

喂入一篇 8000 字的 Kubernetes 网络策略文档,提问 5 个需要跨段落推理的问题。

| 模型 | 答题准确率 | 引用原文 | 幻觉情况 |

|------|----------|--------|--------|

| Claude Sonnet 4.5 | 5/5 | ✅ 精确引用 | 无 |

| GPT-5 | 4/5 | ✅ 引用准确 | 1 处轻微 |

| Gemini 2.5 Pro | 5/5 | ✅ 引用准确 | 无 |

| DeepSeek V3 | 4/5 | ⚠️ 引用偶有偏差 | 1 处 |

| Grok 4 | 3/5 | ⚠️ 部分引用 | 2 处 |

小结:长文理解上 Claude 4.5 和 Gemini 2.5 Pro 并列第一,这两个模型的上下文处理能力确实有代差。


场景三:数学推理(竞赛级别)

选了 3 道 AMC 12 难度题 + 1 道需要分步证明的数论题。

| 模型 | AMC 正确数 | 数论证明 | 过程严谨性 |

|------|----------|--------|---------|

| GPT-5 | 3/3 | ✅ 完整 | ⭐⭐⭐⭐⭐ |

| Claude Sonnet 4.5 | 3/3 | ✅ 完整 | ⭐⭐⭐⭐⭐ |

| Gemini 2.5 Pro | 3/3 | ✅ 完整 | ⭐⭐⭐⭐⭐ |

| DeepSeek V3 | 2/3 | ⚠️ 证明有跳步 | ⭐⭐⭐⭐ |

| Grok 4 | 2/3 | ❌ 结论错误 | ⭐⭐⭐ |

小结:顶层三家在数学推理上已经很接近,DeepSeek V3 略逊但差距不大,Grok 4 在严格证明上还有差距。


场景四:成本计算(这才是关键)

实际项目场景:每天处理 500 篇文章摘要,平均每次 2000 token 输入 + 500 token 输出,一个月下来的费用。

官方价格(美元转人民币按 7.2)

| 模型 | 输入价 | 输出价 | 月成本估算 |

|------|------|------|---------|

| Claude Sonnet 4.5 | ¥21/M token | ¥63/M token | ¥约 1,260 |

| GPT-5 | ¥54/M token | ¥216/M token | ¥约 3,510 |

| Gemini 2.5 Pro | ¥9/M token | ¥27/M token | ¥约 540 |

| DeepSeek V3 | ¥1.3/M token | ¥5.3/M token | ¥约 90 |

通过无量Api(SVIP 7.7 折,普通用户约 3.5 折)

| 模型 | 无量Api 输入价 | 无量Api 输出价 | 月成本(SVIP) |

|------|------------|------------|------------|

| Claude Sonnet 4.5 | ¥7.5/M token | ¥22.5/M token | ¥约 450 |

| GPT-5 | ¥19/M token | ¥76/M token | ¥约 1,235 |

| Gemini 2.5 Pro | ¥3.2/M token | ¥9.5/M token | ¥约 192 |

| DeepSeek V3 | ¥0.5/M token | ¥2/M token | ¥约 33 |

同样跑 Claude Sonnet 4.5,官方 ¥1,260 vs 无量Api SVIP ¥450,省下来的钱够再跑两个月。


综合横评

| 维度 | Claude 4.5 | GPT-5 | Gemini 2.5 Pro | DeepSeek V3 | Grok 4 |

|------|-----------|-------|---------------|------------|--------|

| 代码能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 官方成本 | 中 | 高 | 低 | 极低 | 中 |

| 国内直连 | ❌ | ❌ | ❌ | ✅ | ❌ |

| 综合推荐 | 代码/写作首选 | 全能但贵 | 长文/多模态 | 日常高频首选 | 暂不推荐 |


我的实际用法

测完之后我自己的工作流是这样的:

  • 日常代码辅助:DeepSeek V3,成本极低,够用
  • 复杂 Bug 分析 / 长文档处理:Claude Sonnet 4.5,质量有保证
  • 多模态任务(图表理解):Gemini 2.5 Pro
  • GPT-5:偶尔用,但价格让我很难把它设为默认

这套组合在国内直接用的话,网络是个问题。我现在统一走 无量Api,300+ 模型国内直连,OpenAI 格式兼容,换模型只改一个 model 参数,Base URL 改一行就接入。注册送 ¥1 余额,可以先把上面几个模型都试一遍再决定用哪个。

SVIP 价格是官方的 7.7 折,普通用户也有折扣,余额永久有效不会过期,适合不是每天高频使用的场景。


价格数据截至发文时,以实际页面为准。测试结果基于特定任务,不同场景可能有差异。