横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

最近 V2EX 上关于 Codex、GPT 订阅、模型速度的讨论很多,正好我这边也在做模型选型,就把测试过程整理出来。

测试方法:同一批 prompt,分别跑三个模型,记录输出质量、速度、token 消耗。没有刻意挑对某个模型有利的题目,尽量覆盖日常开发和内容场景。


测试场景一:代码 Debug

任务:给一段有并发竞态条件的 Python 代码,要求找出 bug 并修复。


import threading



counter = 0



def increment():

    global counter

    for _ in range(100000):

        counter += 1



threads = [threading.Thread(target=increment) for _ in range(10)]

for t in threads: t.start()

for t in threads: t.join()

print(counter)  # 期望 1000000,实际每次不同

| 模型 | 是否定位到竞态 | 修复方案 | 额外建议 |

|------|--------------|---------|---------|

| Claude 4.5 Sonnet | ✅ 准确 | Lock + atomic 两种方案都给了 | 提到了 GIL 的误解,解释很到位 |

| GPT-5 | ✅ 准确 | 给了 Lock 方案 | 补充了 threading.local 的适用场景 |

| DeepSeek V3 | ✅ 准确 | Lock 方案 | 解释简洁,没有多余废话 |

三个都答对了,差异在深度。Claude 4.5 主动纠正了"Python 有 GIL 所以不用加锁"这个常见误区,这个细节加分。GPT-5 的回答结构最清晰,适合直接复制进文档。DeepSeek V3 最简洁,适合已经懂原理只需要代码的场景。


测试场景二:长文理解 + 信息抽取

任务:给一份 8000 字的技术文档(某开源项目的 CHANGELOG),要求提取所有 breaking change,并按影响范围分类。

| 模型 | 遗漏数量 | 分类准确度 | 格式 |

|------|---------|-----------|------|

| Claude 4.5 Sonnet | 0 条遗漏 | 高,主动区分了 API/CLI/配置三类 | Markdown 表格,直接可用 |

| GPT-5 | 1 条遗漏 | 高 | 列表格式,清晰 |

| DeepSeek V3 | 2 条遗漏 | 中,部分分类有歧义 | 纯文本,需要二次整理 |

长文理解这块 Claude 4.5 表现最稳,200K 上下文窗口在这种场景下优势明显。GPT-5 漏了一条影响较小的配置项变更,DeepSeek V3 在超长文档上稍弱一些。


测试场景三:数学推理

任务:一道组合数学题,要求给出完整推导过程。

从 1 到 100 中随机选 5 个不同的数,恰好有 3 个偶数的概率是多少?

| 模型 | 答案正确 | 推导过程 | 是否验算 |

|------|---------|---------|---------|

| Claude 4.5 Sonnet | ✅ | 步骤完整,符号规范 | 主动给了数值验证 |

| GPT-5 | ✅ | 步骤完整 | 没有主动验算 |

| DeepSeek V3 | ✅ | 步骤完整,更简洁 | 没有主动验算 |

三个都答对(C(50,3)×C(50,2)/C(100,5)),差异不大。Claude 4.5 多做了一步数值验算,对于需要向别人解释过程的场景更友好。


测试场景四:中文写作润色

任务:把一段口语化的产品说明改写成正式的商务文案,保留核心信息,控制在 200 字以内。

| 模型 | 是否超字数 | 语言自然度 | 是否保留核心信息 |

|------|----------|-----------|---------------|

| Claude 4.5 Sonnet | 198 字 ✅ | 高,读起来流畅 | 完整保留 |

| GPT-5 | 215 字,略超 | 高 | 完整保留 |

| DeepSeek V3 | 193 字 ✅ | 中,略显模板化 | 完整保留 |

中文写作上 Claude 4.5 和 GPT-5 差距不大,DeepSeek V3 稍微模板感强一点,但对于 B 端文案来说也够用。


成本对比(这才是选型的关键)

测试下来三个模型各有擅长,但实际落地时成本差异很大。以下是官方价格 vs 通过无量Api(api2everything.xyz)使用的价格对比:

| 模型 | 官方价(输入/M tokens) | 无量Api 普通价 | 无量Api SVIP 价(7.7折) |

|------|----------------------|--------------|------------------------|

| Claude Sonnet 4.5 | ¥21.6 | ¥13.5 | ¥7.5 |

| GPT-5 | ¥54.0 | ¥33.0 | ¥18.9 |

| DeepSeek V3 | ¥4.0 | ¥2.5 | ¥1.8 |

价格以人民币计,汇率波动会有小幅变化,以实际结算为准。

一个实际场景算一下:假设每天调用 Claude Sonnet 4.5 处理文档,平均消耗 500K input tokens:

  • 官方直接用:500K × ¥21.6/M = ¥10.8/天,一个月 ¥324
  • 无量Api SVIP:500K × ¥7.5/M = ¥3.75/天,一个月 ¥112.5

一个月省下 ¥211,一年就是 ¥2500+。对个人开发者来说不是小数目。


综合结论

不想绕弯子,直接说:

  • 代码 Debug / 技术解释:Claude 4.5 > GPT-5 ≈ DeepSeek V3,Claude 更愿意主动纠正前提假设
  • 长文档处理:Claude 4.5 最稳,上下文窗口大且遗漏少
  • 数学推理:三者差距不大,都能用
  • 中文写作:Claude 4.5 ≈ GPT-5 > DeepSeek V3
  • 成本敏感场景:DeepSeek V3 性价比最高,Claude/GPT 通过第三方 API 能大幅降低门槛

没有哪个模型全面碾压,选型还是要看具体场景和预算。如果是个人项目或小团队,成本是绕不开的因素。


关于访问问题

V2EX 上有不少人在问怎么订阅 GPT Pro、怎么解决网络配置问题。其实对于 API 调用场景,这些问题可以绕开——用国内直连的 API 中转服务,不需要折腾网络,OpenAI 格式兼容,改一行 base_url 就能切换。

我用的是 无量Api(api2everything.xyz),支持 Claude / GPT / Gemini / DeepSeek 等 300+ 模型,注册送 ¥1 余额,余额永久不过期,可以先试试再决定要不要充值。