横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组测试跑了 3 天,结论有点意外

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组测试跑了 3 天,结论有点意外

最近这几个模型在 V2EX 和各种群里都被翻来覆去讨论。正好手头有几个真实场景的测试用例,就系统跑了一遍,把结果整理出来。

没有赞助,没有立场,就是纯用。


测试说明

  • 测试时间:2025 年 7 月
  • 接入方式:统一用 OpenAI 格式 API,Base URL 切换到同一个中转服务,保证网络条件一致
  • 计费方式:按实际 token 消耗记录,不用官网 Playground(网页版有缓存和系统 prompt 干扰)
  • 模型版本:claude-sonnet-4-5、gpt-5、deepseek-v3(最新版)、gemini-2.5-pro、grok-4

场景一:代码调试(真实 Bug)

用了一段生产环境里遇到的 Python 并发问题,涉及 asyncio 事件循环嵌套,加上一个 SQLAlchemy session 线程安全的隐藏 bug。直接贴代码,不给任何提示,让模型自己找问题。

DeepSeek V3 最快定位到了 asyncio.run() 嵌套问题,但对 SQLAlchemy session 的说明只提到"建议用 scoped_session",没有解释为什么当前写法在多线程下会出问题。

Claude Sonnet 4.5 找到了两个 bug,对 session 的线程安全解释很完整,还给出了用 contextvars 的替代方案,顺手提了一句 async 场景下用 AsyncSession 更合适。答案最长,但信息密度高。

GPT-5 找到了主要问题,代码修复建议干净,解释比较简洁。给的 fix 是直接可用的,但没有像 Claude 那样展开讲背后的原理。

Gemini 2.5 Pro 找到了两个 bug,解释清晰,代码给的也对,整体和 GPT-5 差不多,在这个场景没有特别突出。

Grok 4 找到了主 bug,修复方向正确,但对 SQLAlchemy 那个问题分析有点浅,建议比较模板化。


场景二:长文档理解(40K token 合同)

输入一份 40K token 的英文商业合同,要求:提取所有违约条款、列出甲方义务、找出隐含风险点。

| 模型 | 违约条款提取完整度 | 隐含风险识别 | 上下文一致性 |

|---|---|---|---|

| Claude Sonnet 4.5 | ★★★★★ | 发现 3 处非显性风险 | 前后引用准确 |

| GPT-5 | ★★★★☆ | 发现 2 处 | 偶有遗漏 |

| Gemini 2.5 Pro | ★★★★★ | 发现 3 处 | 准确,速度最快 |

| DeepSeek V3 | ★★★☆☆ | 发现 1 处 | 中段内容有丢失 |

| Grok 4 | ★★★★☆ | 发现 2 处 | 整体稳定 |

长上下文这块 Claude 和 Gemini 明显更强,DeepSeek V3 在超长文本场景下表现有明显下滑,这个要注意。


场景三:数学推理(竞赛题)

选了 3 道 AMC/AIME 级别的题目,要求给出完整推导过程,不只是答案。

  • GPT-5 全对,推导步骤清晰,符号使用规范
  • Gemini 2.5 Pro 全对,推导过程更详细,适合用来做解题辅助
  • Claude Sonnet 4.5 2/3,有一道题在最后一步出了计算错误,但中间过程是对的
  • Grok 4 2/3,和 Claude 类似
  • DeepSeek V3 3/3,推导过程稍显跳步,但答案全对

数学推理上 GPT-5 和 Gemini 2.5 Pro 这次表现最稳,DeepSeek V3 答案正确但不适合当做学习用的解题示范。


场景四:成本(这才是大多数人最关心的)

跑完上面的测试,我把 token 消耗记下来算了一下实际花费。这里用官方定价和无量 API 的 SVIP 价格做对比:

| 模型 | 官方输入价(/M token) | 官方输出价(/M token) | 无量 SVIP 输入价 | 无量 SVIP 输出价 |

|---|---|---|---|---|

| Claude Sonnet 4.5 | ¥21 | ¥105 | ¥7.5 | 约¥37 |

| GPT-5 | ¥54 | ¥216 | 约¥19 | 约¥76 |

| Gemini 2.5 Pro | ¥9 | ¥54 | 约¥3.2 | 约¥19 |

| DeepSeek V3 | ¥1.33 | ¥5.32 | ¥0.5 | 约¥1.9 |

| Grok 4 | 约¥72 | 约¥216 | 约¥25 | 约¥76 |

这次三天测试,全部走官方 API 大概要花 ¥80 左右;走无量 SVIP 实际花了不到 ¥30。对于日常开发调试来说,差距很明显,尤其是 Claude 和 GPT-5 这种高单价模型。


综合结论

没有哪个模型在所有场景都是第一,这是真实情况:

  • 代码调试、长上下文分析:Claude Sonnet 4.5 和 Gemini 2.5 Pro 是首选
  • 数学推理、逻辑题:GPT-5 和 Gemini 2.5 Pro 更稳
  • 日常开发、成本敏感场景:DeepSeek V3 性价比碾压,够用就好
  • Grok 4:整体中规中矩,在 X 平台相关数据任务上可能有额外优势,但通用场景没有明显理由优先选它

我的日常工作流基本是:先用 DeepSeek V3 做草稿和快速验证,复杂问题切到 Claude 或 Gemini,偶尔数学相关用 GPT-5 复核。多模型切换的成本主要是 Base URL 和 API Key 管理,如果用同一个聚合服务会方便很多。


关于 API 接入成本

国内直连这几个模型一直是个麻烦事,官方线路不稳定、付款方式受限、价格也不便宜。我目前用的是 无量 API,支持 300+ 模型,格式完全兼容 OpenAI,改一行 Base URL 就能切过去,注册就送 ¥1 余额,余额永久不过期。

SVIP 折扣是 7.7 折,算下来 Claude Sonnet 4.5 输入价 ¥7.5/M,比官方便宜将近 65%,长期跑的话省的不是小数。

V2EX 版本推广链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb