横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-4o vs DeepSeek V3:用同一批任务测了三天,结论有点意外

Claude 4.5 vs GPT-4o vs DeepSeek V3:用同一批任务测了三天,结论有点意外

最近 V2EX 上关于 ChatGPT 封号的帖子刷屏,不少人开始重新考虑"到底用哪个模型"。趁这个机会,我用同一套测试任务跑了三天,把目前最常用的三个模型做了一次横评。

测试对象:Claude Sonnet 4.5 / GPT-4o / DeepSeek V3


测试方法说明

  • 所有请求通过 OpenAI 兼容接口发送,Base URL 统一,参数一致
  • 每个场景重复 3 次取中位结果,避免偶发性波动
  • 不测"谁更聪明"这种玄学,只测实际工作中会遇到的场景
  • 价格以当前官方定价和无量Api SVIP 价格为准

场景一:代码补全与 Bug 定位

任务:给一段有竞态条件的 Python 异步代码,要求找出问题并给出修复方案。


async def fetch_all(urls):

    results = []

    for url in urls:

        result = await fetch(url)

        results.append(result)

    return results

# 问题:这里其实没有并发,但调用方以为是并发的

| 模型 | 是否识别出问题 | 修复质量 | 额外建议 |

|------|--------------|---------|---------|

| Claude Sonnet 4.5 | ✅ 准确识别 | 给出 asyncio.gather 方案,并解释了为什么原写法是串行 | 主动提示了异常处理和超时控制 |

| GPT-4o | ✅ 准确识别 | 同样给出 gather,代码可直接运行 | 没有额外补充 |

| DeepSeek V3 | ✅ 准确识别 | 给出了 gather 和 TaskGroup 两种方案 | 附带了 Python 版本兼容性说明 |

小结:三个模型都过关,DeepSeek V3 给了两种方案反而更实用,Claude 的主动补充也有价值。GPT-4o 最简洁,适合直接复制用。


场景二:长文档理解与信息提取

任务:输入一份 8000 字的技术规范文档(英文),要求提取所有"MUST"级别的约束条件,并整理成中文清单。

| 模型 | 提取准确率(人工核对) | 格式整洁度 | 漏项 |

|------|-------------------|---------|-----|

| Claude Sonnet 4.5 | ~96% | 分类清晰,有编号 | 漏了 1 条嵌套在表格里的约束 |

| GPT-4o | ~91% | 平铺列表,无分类 | 漏了 3 条,集中在文档后半段 |

| DeepSeek V3 | ~93% | 有分类,格式略乱 | 漏了 2 条 |

小结:长文档理解 Claude 4.5 明显更稳,GPT-4o 在文档后半段注意力有所下降,这个现象在多次测试中重复出现。


场景三:数学推理(应用题)

任务:一道需要多步推导的概率题,涉及条件概率和贝叶斯更新。

| 模型 | 最终答案 | 推导过程 | 是否自我检验 |

|------|---------|---------|------------|

| Claude Sonnet 4.5 | ✅ 正确 | 步骤清晰,符号规范 | 有,主动验算了一步 |

| GPT-4o | ✅ 正确 | 步骤完整 | 无 |

| DeepSeek V3 | ✅ 正确 | 步骤最详细,有中间变量说明 | 有 |

三个都答对了,DeepSeek V3 的推导过程最适合用来学习,Claude 的自我检验习惯在复杂题目里会更有价值。


场景四:中文写作润色

任务:一段技术博客草稿,要求在保留技术准确性的前提下提升可读性。

这个场景主观性强,我只记录几个观察:

  • Claude 4.5:改动克制,保留了原文的技术术语,语感自然
  • GPT-4o:倾向于把句子改得更"正式",有时会过度润色
  • DeepSeek V3:中文语感最地道,改出来的文章读起来像中文母语者写的

如果是写给中文读者的技术内容,DeepSeek V3 在这个场景里表现最好。


成本对比:这才是很多人真正关心的

以每百万 token 计价(输入+输出混合估算,输出权重更高):

| 模型 | 官方价(¥/M tokens) | 无量Api SVIP 价(¥/M tokens) | 节省比例 |

|------|-------------------|---------------------------|---------|

| Claude Sonnet 4.5 | ¥21 | ¥7.5 | ~64% |

| GPT-4o | ¥17.5 | ¥6.3 | ~64% |

| DeepSeek V3 | ¥4 | ¥1.4 | ~65% |

如果你每天的用量在 2M tokens 左右(中等强度开发者),一个月下来:

  • 用 Claude Sonnet 4.5 官方:约 ¥1260/月
  • 用无量Api SVIP:约 ¥450/月

差价够买好几顿饭了。DeepSeek V3 本身就便宜,SVIP 之后更是几乎没有心理负担地随便用。


综合结论

| 场景 | 推荐模型 |

|------|---------|

| 代码 Debug / 补全 | 三者相当,DeepSeek V3 方案更全面 |

| 长文档处理 | Claude Sonnet 4.5 |

| 数学推理 | DeepSeek V3(过程最详细) |

| 中文写作 | DeepSeek V3 |

| 英文写作 / 通用对话 | GPT-4o |

| 成本敏感场景 | DeepSeek V3 |

没有哪个模型在所有场景都碾压其他两个。实际使用中,按场景切换模型才是最优解——而这正好是 API 接入方式的优势:改一个参数就换模型,不用重新登录账号、不用担心封号。


关于封号这件事

最近 V2EX 上好几个帖子都在聊 ChatGPT 封号,有代充的号被封,有 iOS 美区订阅的号被封,有过了 Cyber 认证的号也没逃过。账号风险这个问题,用 API 方式基本可以绕开——没有账号,自然没有封号。

如果你还在用网页版或者 App,可以考虑迁移到 API 接入,稳定性会好很多。


国内直连、OpenAI 格式兼容、注册送 ¥1 余额永久有效,可以先用免费额度把上面的测试自己跑一遍验证一下:

改 Base URL 一行代码的事,试试没什么损失。