Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
最近社区里有人吐槽 GPT-5 降智、有人在研究 Claude Code 共享记忆、有人问 Codex 手机端的 bug……这些讨论背后,其实是一个更底层的问题:现在这些旗舰模型,到底谁更值得日常用?
我用五个场景连续测了三天,把结果整理成这篇横评。数据不一定完美,但都是真实跑出来的。
测试对象
| 模型 | 版本 | 官方输入价(/M tokens) | 官方输出价(/M tokens) |
|------|------|------------------------|------------------------|
| Claude Sonnet 4.5 | claude-sonnet-4-5 | $3 ≈ ¥21 | $15 ≈ ¥108 |
| GPT-5 | gpt-5 | $10 ≈ ¥72 | $40 ≈ ¥288 |
| DeepSeek V3 | deepseek-v3 | ¥0.5 | ¥2 |
| Gemini 2.5 Pro | gemini-2.5-pro | $1.25 ≈ ¥9 | $10 ≈ ¥72 |
| Grok 4 | grok-4 | $3 ≈ ¥21 | $15 ≈ ¥108 |
汇率按 1 USD = 7.2 CNY 估算。
场景一:代码调试(同一个 bug)
给了一段 Python 异步并发代码,里面藏了三个问题:一个 asyncio.gather 没有正确处理异常、一个竞态条件、一个内存泄漏。
结果:
- Claude Sonnet 4.5:三个问题全部识别,解释清晰,给出了可直接运行的修复版本,还额外提示了一个潜在的超时问题。
- GPT-5:识别了两个,漏掉了竞态条件。解释质量高,修复代码可用。
- DeepSeek V3:识别了三个,但修复代码需要小调整才能跑通,解释偏简洁。
- Gemini 2.5 Pro:三个都找到了,输出格式很规整,但修复方案比 Claude 保守一些。
- Grok 4:识别了两个,输出风格略带口语化,代码质量中等。
代码场景小结: Claude 4.5 > Gemini 2.5 Pro ≈ DeepSeek V3 > GPT-5 > Grok 4
场景二:长文理解与摘要
输入一篇 18000 字的技术报告(关于 LLM 推理优化),要求:提炼核心论点、找出作者观点的逻辑漏洞、给出三个可落地的建议。
结果:
- Gemini 2.5 Pro:表现最稳,长文处理是它的强项,逻辑漏洞的识别最准确,建议也比较务实。
- Claude Sonnet 4.5:整体质量接近,建议部分更有创意,但有一个逻辑漏洞没抓到。
- GPT-5:摘要质量高,但建议偏泛化,感觉是"放之四海皆准"那种。
- DeepSeek V3:摘要准确,但对逻辑漏洞的分析深度不够。
- Grok 4:对长文的结构把握一般,输出有些散。
长文理解小结: Gemini 2.5 Pro > Claude 4.5 > GPT-5 > DeepSeek V3 > Grok 4
场景三:数学推理
用了三道题:一道竞赛级数论题、一道统计推断题、一道需要建模的应用题。
结果:
- GPT-5:数学是它明显的优势,三道全对,推导步骤清晰,中间没有跳步。
- Gemini 2.5 Pro:两道全对,统计那道过程有小错但最终结论正确。
- Claude 4.5:两道全对,建模那道给出了一个比较优雅的解法。
- DeepSeek V3:两道对,但数论那道有一步推导存疑。
- Grok 4:一道全对,其余有明显计算失误。
数学推理小结: GPT-5 > Gemini 2.5 Pro ≈ Claude 4.5 > DeepSeek V3 > Grok 4
场景四:中文写作与逻辑组织
写一篇 2000 字的产品分析文章,要求有清晰结构、真实数据引用、结论有说服力。
结果:
- DeepSeek V3:中文写作的天花板,语感自然,逻辑清晰,引用数据的方式最符合中文阅读习惯。
- Claude 4.5:中文质量比上一代明显提升,结构很好,但偶尔有翻译腔。
- GPT-5:结构严谨,但读起来稍显刻板。
- Gemini 2.5 Pro:中规中矩,没有明显短板但也没有亮点。
- Grok 4:中文写作偏弱,用词有时不自然。
中文写作小结: DeepSeek V3 > Claude 4.5 > GPT-5 > Gemini 2.5 Pro > Grok 4
场景五:成本计算(这才是大多数人真正关心的)
假设一个中等规模的应用,每天处理 100 万 tokens 输入 + 200 万 tokens 输出,按月计算:
官方价格(月费用)
| 模型 | 月输入成本 | 月输出成本 | 月合计 |
|------|-----------|-----------|--------|
| GPT-5 | ¥2,160 | ¥17,280 | ¥19,440 |
| Claude Sonnet 4.5 | ¥630 | ¥6,480 | ¥7,110 |
| Gemini 2.5 Pro | ¥270 | ¥4,320 | ¥4,590 |
| Grok 4 | ¥630 | ¥6,480 | ¥7,110 |
| DeepSeek V3 | ¥15 | ¥120 | ¥135 |
通过无量Api(SVIP 7.7折,部分模型更低)
以 Claude Sonnet 4.5 为例,无量Api 价格:输入 ¥7.5/M,输出 ¥30/M
| 渠道 | Claude Sonnet 4.5 月合计 |
|------|--------------------------|
| 官方 | ¥7,110 |
| 无量Api SVIP | 约 ¥2,475 |
| 节省 | ¥4,635 / 月 |
DeepSeek V3 本身价格就很低,这个场景下差价有限。GPT-5 节省的绝对金额更可观。
总结:怎么选?
| 场景 | 推荐 |
|------|------|
| 日常代码开发 | Claude Sonnet 4.5 |
| 长文档处理 / RAG | Gemini 2.5 Pro |
| 数学 / 科学推理 | GPT-5 |
| 中文内容生成 | DeepSeek V3 |
| 成本敏感的大规模调用 | DeepSeek V3 或打折后的 Claude 4.5 |
说句实话:没有一个模型在所有场景都赢。实际选型时,建议按主要用途选主力模型,用 API 接入多个模型做 fallback,成本和效果可以同时兼顾。
关于访问和成本的一点补充
上面说的官方价格,很多国内用户还面临一个更实际的问题:直连不稳定,或者根本没有海外支付方式。
我最近在用无量Api,支持国内直连 Claude、GPT-5、Gemini、DeepSeek 等 300+ 模型,完全兼容 OpenAI 格式,只改一行 base_url 就能接入现有项目。SVIP 折扣下来比官方便宜 65% 左右,上面 Claude 4.5 的算例用的就是他们的价格。注册送 ¥1,余额永久有效,可以先拿来跑跑上面几个测试场景对比一下。
V2EX 版传送门:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb