横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

最近 V2EX 上关于 Codex、GPT-5.5 降智的讨论很多,加上 Claude 4.5 和 DeepSeek V3 的更新,正好趁这个机会做一次横评。

测试方法很简单:同一批任务,同一套 prompt,三个模型各跑一遍,记录输出质量和耗时。不做主观打分,尽量用可复现的结论。


测试阵容

| 模型 | 版本 | 官方定价(输入/输出,每百万 token) |

|------|------|--------------------------------------|

| Claude Sonnet 4.5 | 2025-06 | ¥21 / ¥105 |

| GPT-5 | 2025-06 | ¥54 / ¥216 |

| DeepSeek V3 | 0324 | ¥2 / ¥8 |

| Gemini 2.5 Pro | 2025-06 | ¥9 / ¥36 |

价格按官方美元汇率换算,仅供参考,以实际结算为准。

场景一:修一个真实 Bug

任务:给一段 Python 异步代码,里面有一个 asyncio.gather 的异常处理问题,会导致部分任务静默失败。不给任何提示,让模型自己找问题。


async def fetch_all(urls):

    tasks = [fetch(url) for url in urls]

    results = await asyncio.gather(*tasks)

    return results

结果:

  • Claude 4.5:直接定位到 return_exceptions=False 的默认行为,给出了加 return_exceptions=True 并逐个检查结果的完整方案,还顺带提了 asyncio.TaskGroup(Python 3.11+)的替代写法。解释清晰,代码可直接用。
  • GPT-5:也找到了问题,但给的方案更偏"教科书",把三种写法都列出来了,反而需要自己判断用哪个。对于明确的 bug 修复场景,信息密度有点高。
  • DeepSeek V3:找到了问题,方案正确,但没有提 TaskGroup,对 Python 版本的适配说明也少一些。对于日常 bug 修复完全够用。

小结:代码理解三者都过关,Claude 4.5 在"给出最优解"这件事上更直接。


场景二:长文档理解

任务:给一份 8000 字的技术规范文档(英文),问其中关于错误码定义的具体细节,以及文档里有没有自相矛盾的地方。

结果:

  • Claude 4.5:准确提取了错误码部分,并找到了文档第 3 节和第 7 节对同一错误码描述不一致的地方。这个矛盾确实存在,是故意埋进去的。
  • GPT-5:提取错误码准确,但没有主动发现矛盾,需要追问才给出。
  • DeepSeek V3:提取准确,矛盾没找到,追问后也只是说"可能存在歧义",没有明确指出。
  • Gemini 2.5 Pro:表现和 Claude 4.5 接近,也找到了矛盾,但定位到的段落有一处偏差。

小结:长文档的主动分析能力,Claude 4.5 和 Gemini 2.5 Pro 领先一档。


场景三:数学推理

任务:一道组合数学题,需要用容斥原理,中间步骤容易出错。

结果:

  • GPT-5:步骤完整,答案正确,过程写得很清楚。
  • Claude 4.5:答案正确,但中间有一步跳跃,需要追问才补全。
  • DeepSeek V3:答案正确,步骤详细,性价比最高的选择。
  • Gemini 2.5 Pro:答案正确,步骤清晰,和 GPT-5 差不多。

小结:数学推理四者都能过,GPT-5 和 Gemini 2.5 Pro 的过程更完整。


场景四:代码补全(Copilot 式场景)

任务:给半段 TypeScript 函数签名,让模型补全实现,要求处理边界情况。

这个场景更接近日常开发中的实际用法。

结果:

  • Claude 4.5:补全质量高,边界情况处理全面,类型标注准确。
  • GPT-5:补全质量相当,但有时会过度注释,实际粘贴进去还要删。
  • DeepSeek V3:补全速度快,质量稳定,偶尔会漏掉一两个边界情况。
  • Gemini 2.5 Pro:补全质量好,但响应延迟在四者中最高。

成本对比:同样的任务跑下来花多少钱

按照上面四个场景,每个场景平均消耗约 2000 token 输入 + 1000 token 输出,跑 100 次的成本:

| 模型 | 官方价(100次) | 无量Api 普通价 | 无量Api SVIP(7.7折) |

|------|----------------|----------------|----------------------|

| Claude Sonnet 4.5 | ¥14.7 | ¥7.5 左右 | ¥5.8 |

| GPT-5 | ¥37.8 | ¥18 左右 | ¥13.9 |

| DeepSeek V3 | ¥1.4 | ¥0.7 左右 | ¥0.5 |

| Gemini 2.5 Pro | ¥6.3 | ¥3 左右 | ¥2.3 |

无量Api 支持国内直连,不需要代理,注册送 ¥1 余额,余额永久有效。

对于高频调用场景(比如跑 CI 里的代码审查、批量文档处理),Claude 4.5 的官方价格确实压力不小,SVIP 价格能省下来的钱很实在。


综合结论

不想偏袒任何一家,直接说适用场景:

  • Claude 4.5:长文档分析、需要主动发现问题的场景,首选。代码质量也很稳。
  • GPT-5:数学推理、需要完整步骤的场景表现好,但价格是四者中最高的,要想清楚值不值。
  • DeepSeek V3:日常代码任务、成本敏感场景,性价比无敌。国内团队,中文理解也更自然。
  • Gemini 2.5 Pro:长上下文任务的备选,延迟稍高,但质量稳定。

没有哪个模型在所有场景都是第一,根据任务选模型才是正确姿势。


关于调用成本

如果你在做个人项目或者小团队开发,模型调用成本是绕不开的话题。上面的价格对比里用的是 无量Api 的数据——国内直连,OpenAI 格式兼容,改一行 base_url 就能接入,支持 300+ 模型。注册有 ¥1 体验额度,可以先跑跑看实际效果再决定要不要充值。

V2EX 版本推广链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb