Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组任务测了三天
最近 HN 上有篇文章挺有意思:有人把生产环境的 AI agent 从 GPT-4 迁移到 GPT-5.6,速度提升 2.2x,成本降了 27%。这让我想起手头攒了一段时间的测试数据——正好借这个机会整理出来。
测试周期:三天,同一套 prompt,同一组任务,轮流跑。模型:Claude Sonnet 4.5 / GPT-5 / DeepSeek V3。Gemini 2.5 Pro 和 Grok 4 作为参照组。
测试场景设计
场景一:Bug 定位与修复(代码补全)
给出一段约 150 行的 Python 异步代码,里面埋了两个 bug:一个是 asyncio.gather 异常未捕获导致静默失败,另一个是数据库连接池未释放。只给代码,不给任何提示,要求找出问题并给出修复方案。
结果:
| 模型 | 是否找到两个 bug | 修复方案质量 | 额外发现 |
|------|--------------|------------|--------|
| Claude Sonnet 4.5 | ✅ 全找到 | 清晰,附解释 | 指出了一处潜在竞争条件 |
| GPT-5 | ✅ 全找到 | 直接给出修复代码 | 无 |
| DeepSeek V3 | ✅ 全找到 | 中文注释详细 | 建议了连接池配置参数 |
三个都找到了核心问题,差异在风格上。Claude 的解释更偏"教学向",GPT-5 更"工具向"直接给代码,DeepSeek V3 在中文场景下注释质量最高。
场景二:长文理解与摘要(50k token 文档)
给一份 4 万词的技术规范文档(英文),要求提炼出 5 个关键决策点,并指出文档内部的矛盾之处。
结果:
| 模型 | 摘要准确性 | 矛盾识别 | 响应速度 |
|------|----------|--------|--------|
| Claude Sonnet 4.5 | ⭐⭐⭐⭐⭐ | 找出 3 处 | 中等 |
| GPT-5 | ⭐⭐⭐⭐ | 找出 2 处 | 快 |
| DeepSeek V3 | ⭐⭐⭐⭐ | 找出 2 处 | 快 |
| Gemini 2.5 Pro | ⭐⭐⭐⭐⭐ | 找出 3 处 | 最快 |
长文理解这块 Claude 和 Gemini 表现更稳定,对细节的把握明显好一些。GPT-5 和 DeepSeek 会偶尔遗漏段落级别的细节。
场景三:数学推理(竞赛题级别)
5 道 AMC/AIME 难度的数学题,要求给出完整推导过程,不能只写答案。
结果:
| 模型 | 正确题数(/5) | 推导完整性 | 是否有错误步骤 |
|------|------------|---------|------------|
| Claude Sonnet 4.5 | 4 | 高 | 1 题有跳步 |
| GPT-5 | 5 | 高 | 无 |
| DeepSeek V3 | 4 | 高 | 1 题计算错误 |
| Grok 4 | 5 | 中 | 推导不够严谨 |
数学推理这项 GPT-5 表现最稳,5 题全对且步骤完整。Grok 4 也全对但过程写得比较跳跃,实际使用中可信度打折扣。
场景四:企业应用场景——快速接入新模型
这个场景来自最近讨论:GPT-5.6 出来了,企业怎么快速切换?
测试方式:给三个模型同一段业务逻辑代码(调用 OpenAI SDK),要求改写成支持多模型热切换的结构,最好兼容 OpenAI 格式的第三方接口。
这里三个模型给出的方案差异最大。Claude 设计了一套带 fallback 的 provider 抽象层,考虑了 retry 逻辑;GPT-5 给了更简洁的工厂模式;DeepSeek V3 直接建议用 base_url 参数注入,切换成本最低:
from openai import OpenAI
# 只改这两行,其余代码不动
client = OpenAI(
api_key="your-key",
base_url="https://api.api2everything.xyz/v1" # 替换即可
)
这个建议实际上挺实用的——如果用的是兼容 OpenAI 格式的聚合 API,确实只需要改 base_url。
成本对比(这才是重点)
测完三天,Token 消耗加起来不小,正好对比一下实际费用。
按 100 万 Token(输入)计算:
| 模型 | 官方价(人民币/M) | 无量Api 普通价 | 无量Api SVIP 价(7.7折) | 节省比例 |
|------|--------------|------------|---------------------|--------|
| Claude Sonnet 4.5 | ¥21.6 | ¥9.5 | ¥7.5 | -65% |
| GPT-5(估算) | ¥72.0 | ¥29.0 | ¥22.4 | -69% |
| DeepSeek V3 | ¥2.0 | ¥1.0 | ¥0.8 | -60% |
| Gemini 2.5 Pro | ¥18.0 | ¥8.0 | ¥6.2 | -66% |
官方价格以 2025 年 7 月公开定价为准,汇率按 7.2 换算。输出 Token 通常是输入的 3-4 倍价格,实际总费用差距更大。
三天测试下来,如果走官方接口大概要花 ¥180 左右(我的场景偏 Claude 重度使用),通过聚合 API 实际花了不到 ¥65。
结论:怎么选?
没有绝对最好的模型,看场景:
- 代码调试、架构设计:Claude Sonnet 4.5,解释质量高,适合需要"讲清楚为什么"的场景
- 数学 / 逻辑推理、精确任务:GPT-5,准确率最稳
- 中文场景、成本敏感:DeepSeek V3,性价比极高,中文注释质量一流
- 长文档处理:Gemini 2.5 Pro 或 Claude,上下文窗口大且细节把握好
实际工程项目里,建议把上面几个模型按任务类型做路由,而不是一个模型包打天下。
附:接入方式
如果想低成本把这几个模型都跑通,可以试试无量Api——国内直连,OpenAI 格式兼容,300+ 模型统一接口,注册送 ¥1 余额。切换成本就是改一行 base_url,其他代码不用动。