横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组任务测了三天,结论有点意外

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一组任务测了三天,结论有点意外

最近 V2EX 上讨论模型选型的帖子越来越多,有人说 GPT-5 出来之后其他都可以退休了,有人说 DeepSeek V3 性价比无敌。我花了三天时间,用同一套任务跑了一遍,结果确实有点出乎意料。

测试说明

测试模型:

  • Claude Sonnet 4.5(Anthropic,2025 年主力)
  • GPT-5(OpenAI,当前旗舰)
  • DeepSeek V3(深度求索,国产新版)

测试方式:相同 prompt,相同参数(temperature=0.7,无 system prompt 干预),每个场景跑 3 次取中位结果。不做主观打分,尽量用可量化的维度。


场景一:代码补全与 Bug 定位

任务描述: 给一段 React + TypeScript 的组件代码,其中藏了一个 useEffect 依赖数组缺失导致的 stale closure bug,让模型自由定位并修复。

| 模型 | 是否定位到 bug | 修复是否正确 | 额外建议质量 |

|------|--------------|------------|------------|

| Claude Sonnet 4.5 | ✅ 精准定位 | ✅ 一次通过 | 顺带指出另一处潜在的竞态条件 |

| GPT-5 | ✅ 精准定位 | ✅ 一次通过 | 给出了 useCallback 的替代方案 |

| DeepSeek V3 | ✅ 定位到 | ⚠️ 修复逻辑正确但破坏了原有接口设计 | 建议较少 |

小结: Claude 和 GPT-5 旗鼓相当,DeepSeek V3 在代码风格保留上略逊,修复过于"暴力"。


场景二:长文档理解与信息抽取

任务描述: 喂入一份 8000 token 的英文技术报告,要求提取 5 个关键数据点并判断报告的核心结论是否自洽。

| 模型 | 数据抽取准确率 | 逻辑自洽性判断 | 幻觉情况 |

|------|-------------|-------------|--------|

| Claude Sonnet 4.5 | 5/5 | 正确识别出一处数据矛盾 | 无 |

| GPT-5 | 4/5(一处数字误读) | 未识别矛盾,认为自洽 | 轻微 |

| DeepSeek V3 | 5/5 | 识别矛盾但理由不准确 | 无 |

小结: 长文理解这个场景 Claude 4.5 表现最稳,GPT-5 出现了一次数字误读,DeepSeek 找到了问题但说不清楚为什么。


场景三:数学与逻辑推理

任务描述: 一道组合数学应用题(竞赛难度,需要容斥原理),外加一道需要反事实推理的逻辑题。

| 模型 | 数学题 | 逻辑题 | 过程是否可追溯 |

|------|-------|-------|-------------|

| Claude Sonnet 4.5 | ✅ 正确 | ✅ 正确 | 步骤清晰,有中间验证 |

| GPT-5 | ✅ 正确 | ✅ 正确 | 步骤清晰,更简洁 |

| DeepSeek V3 | ❌ 数值计算出错 | ✅ 正确 | 过程可读 |

小结: 数学推理上 Claude 和 GPT-5 都过关,DeepSeek V3 在这道具体题目上翻车了——不是方法错,是算术出错,挺典型的问题。


场景四:中文写作与风格把控

任务描述: 写一篇 500 字的技术产品发布公告,要求专业但不失亲切,风格参考 Notion 的中文文案。

这个维度主观性强,我只说个人感受:

  • Claude 4.5:语感最自然,节奏好,但偶尔句子稍长
  • GPT-5:干净利落,格式感强,有点像 PR 稿
  • DeepSeek V3:中文母语感最强,但"亲切"拿捏得有些过,读起来像客服话术

最重要的部分:成本对比

性能差距在某些场景确实存在,但对大多数日常任务来说,这点差距远不如成本差距显眼。

以下是官方价格和通过无量Api使用的价格对比(SVIP 7.7 折,基础用户约 65% 折扣):

| 模型 | 官方输入价(/M token) | 官方输出价(/M token) | 无量Api SVIP 价(约) |

|------|---------------------|---------------------|-------------------|

| Claude Sonnet 4.5 | ¥21 | ¥105 | 输入 ¥7.5 / 输出 ¥37.8 |

| GPT-5 | ¥54 | ¥216 | 输入 ¥19.4 / 输出 ¥77.8 |

| DeepSeek V3 | ¥1 | ¥4 | 折扣后更低 |

以一个月处理 500 万 token 输入 + 200 万 token 输出 的中等用量为例:

| 方案 | Claude Sonnet 4.5 月成本 | GPT-5 月成本 |

|------|------------------------|------------|

| 官方直接购买 | ¥315 | ¥702 |

| 无量Api SVIP | ¥113 | ¥252 |

| 节省 | ¥202 | ¥450 |

这个差距在 API 用量上去之后会非常明显。V2EX 上有人晒出两个月 135 亿 token 的用量,96% 缓存命中——如果那个量级走官方,成本是天文数字。


综合结论

不偏袒地说:

  • 日常代码任务:三者差距不大,DeepSeek V3 成本极低,够用
  • 复杂推理/长文档:Claude Sonnet 4.5 当前略占优,稳定性好
  • 快速迭代/函数生成:GPT-5 格式输出质量高,上下文跟随好
  • 中文内容生产:DeepSeek V3 母语优势明显,成本几乎可以忽略

没有绝对最强的模型,只有最适合你场景的模型。 真正理性的做法是按场景路由——复杂任务上 Claude 或 GPT-5,批量处理走 DeepSeek,而不是押注在单一模型上。


关于接入成本

上面所有测试,我都是通过同一个 API 端点切换模型的,改的只是 model 参数。这类聚合平台的核心价值就在这里:不用管理多套密钥,不用处理国内访问的网络问题,成本还比官方低。

无量Api(api2everything.xyz) 支持 300+ 模型国内直连,OpenAI 格式兼容,换 Base URL 就能用,注册送 ¥1 余额,余额永久不过期。如果你在做模型选型或者有固定 API 用量,可以去算一下自己的场景能省多少。