Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组任务测了三天,结论有点意外
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组任务测了三天,结论有点意外
最近 V2EX 上讨论模型选型的帖子越来越多,有人说 GPT-5 出来之后其他都可以退休了,有人说 DeepSeek V3 性价比无敌。我花了三天时间,用同一套任务跑了一遍,结果确实有点出乎意料。
测试说明
测试模型:
- Claude Sonnet 4.5(Anthropic,2025 年主力)
- GPT-5(OpenAI,当前旗舰)
- DeepSeek V3(深度求索,国产新版)
测试方式:相同 prompt,相同参数(temperature=0.7,无 system prompt 干预),每个场景跑 3 次取中位结果。不做主观打分,尽量用可量化的维度。
场景一:代码补全与 Bug 定位
任务描述: 给一段 React + TypeScript 的组件代码,其中藏了一个 useEffect 依赖数组缺失导致的 stale closure bug,让模型自由定位并修复。
| 模型 | 是否定位到 bug | 修复是否正确 | 额外建议质量 |
|------|--------------|------------|------------|
| Claude Sonnet 4.5 | ✅ 精准定位 | ✅ 一次通过 | 顺带指出另一处潜在的竞态条件 |
| GPT-5 | ✅ 精准定位 | ✅ 一次通过 | 给出了 useCallback 的替代方案 |
| DeepSeek V3 | ✅ 定位到 | ⚠️ 修复逻辑正确但破坏了原有接口设计 | 建议较少 |
小结: Claude 和 GPT-5 旗鼓相当,DeepSeek V3 在代码风格保留上略逊,修复过于"暴力"。
场景二:长文档理解与信息抽取
任务描述: 喂入一份 8000 token 的英文技术报告,要求提取 5 个关键数据点并判断报告的核心结论是否自洽。
| 模型 | 数据抽取准确率 | 逻辑自洽性判断 | 幻觉情况 |
|------|-------------|-------------|--------|
| Claude Sonnet 4.5 | 5/5 | 正确识别出一处数据矛盾 | 无 |
| GPT-5 | 4/5(一处数字误读) | 未识别矛盾,认为自洽 | 轻微 |
| DeepSeek V3 | 5/5 | 识别矛盾但理由不准确 | 无 |
小结: 长文理解这个场景 Claude 4.5 表现最稳,GPT-5 出现了一次数字误读,DeepSeek 找到了问题但说不清楚为什么。
场景三:数学与逻辑推理
任务描述: 一道组合数学应用题(竞赛难度,需要容斥原理),外加一道需要反事实推理的逻辑题。
| 模型 | 数学题 | 逻辑题 | 过程是否可追溯 |
|------|-------|-------|-------------|
| Claude Sonnet 4.5 | ✅ 正确 | ✅ 正确 | 步骤清晰,有中间验证 |
| GPT-5 | ✅ 正确 | ✅ 正确 | 步骤清晰,更简洁 |
| DeepSeek V3 | ❌ 数值计算出错 | ✅ 正确 | 过程可读 |
小结: 数学推理上 Claude 和 GPT-5 都过关,DeepSeek V3 在这道具体题目上翻车了——不是方法错,是算术出错,挺典型的问题。
场景四:中文写作与风格把控
任务描述: 写一篇 500 字的技术产品发布公告,要求专业但不失亲切,风格参考 Notion 的中文文案。
这个维度主观性强,我只说个人感受:
- Claude 4.5:语感最自然,节奏好,但偶尔句子稍长
- GPT-5:干净利落,格式感强,有点像 PR 稿
- DeepSeek V3:中文母语感最强,但"亲切"拿捏得有些过,读起来像客服话术
最重要的部分:成本对比
性能差距在某些场景确实存在,但对大多数日常任务来说,这点差距远不如成本差距显眼。
以下是官方价格和通过无量Api使用的价格对比(SVIP 7.7 折,基础用户约 65% 折扣):
| 模型 | 官方输入价(/M token) | 官方输出价(/M token) | 无量Api SVIP 价(约) |
|------|---------------------|---------------------|-------------------|
| Claude Sonnet 4.5 | ¥21 | ¥105 | 输入 ¥7.5 / 输出 ¥37.8 |
| GPT-5 | ¥54 | ¥216 | 输入 ¥19.4 / 输出 ¥77.8 |
| DeepSeek V3 | ¥1 | ¥4 | 折扣后更低 |
以一个月处理 500 万 token 输入 + 200 万 token 输出 的中等用量为例:
| 方案 | Claude Sonnet 4.5 月成本 | GPT-5 月成本 |
|------|------------------------|------------|
| 官方直接购买 | ¥315 | ¥702 |
| 无量Api SVIP | ¥113 | ¥252 |
| 节省 | ¥202 | ¥450 |
这个差距在 API 用量上去之后会非常明显。V2EX 上有人晒出两个月 135 亿 token 的用量,96% 缓存命中——如果那个量级走官方,成本是天文数字。
综合结论
不偏袒地说:
- 日常代码任务:三者差距不大,DeepSeek V3 成本极低,够用
- 复杂推理/长文档:Claude Sonnet 4.5 当前略占优,稳定性好
- 快速迭代/函数生成:GPT-5 格式输出质量高,上下文跟随好
- 中文内容生产:DeepSeek V3 母语优势明显,成本几乎可以忽略
没有绝对最强的模型,只有最适合你场景的模型。 真正理性的做法是按场景路由——复杂任务上 Claude 或 GPT-5,批量处理走 DeepSeek,而不是押注在单一模型上。
关于接入成本
上面所有测试,我都是通过同一个 API 端点切换模型的,改的只是 model 参数。这类聚合平台的核心价值就在这里:不用管理多套密钥,不用处理国内访问的网络问题,成本还比官方低。
无量Api(api2everything.xyz) 支持 300+ 模型国内直连,OpenAI 格式兼容,换 Base URL 就能用,注册送 ¥1 余额,余额永久不过期。如果你在做模型选型或者有固定 API 用量,可以去算一下自己的场景能省多少。