Claude 4.5 vs GPT-4o vs DeepSeek V3:用同一批任务测了三天,结论有点意外
Claude 4.5 vs GPT-4o vs DeepSeek V3:用同一批任务测了三天,结论有点意外
最近 V2EX 上关于 ChatGPT 封号的帖子刷屏,不少人开始重新考虑"到底用哪个模型"。趁这个机会,我用同一套测试任务跑了三天,把目前最常用的三个模型做了一次横评。
测试对象:Claude Sonnet 4.5 / GPT-4o / DeepSeek V3
测试方法说明
- 所有请求通过 OpenAI 兼容接口发送,Base URL 统一,参数一致
- 每个场景重复 3 次取中位结果,避免偶发性波动
- 不测"谁更聪明"这种玄学,只测实际工作中会遇到的场景
- 价格以当前官方定价和无量Api SVIP 价格为准
场景一:代码补全与 Bug 定位
任务:给一段有竞态条件的 Python 异步代码,要求找出问题并给出修复方案。
async def fetch_all(urls):
results = []
for url in urls:
result = await fetch(url)
results.append(result)
return results
# 问题:这里其实没有并发,但调用方以为是并发的
| 模型 | 是否识别出问题 | 修复质量 | 额外建议 |
|------|--------------|---------|---------|
| Claude Sonnet 4.5 | ✅ 准确识别 | 给出 asyncio.gather 方案,并解释了为什么原写法是串行 | 主动提示了异常处理和超时控制 |
| GPT-4o | ✅ 准确识别 | 同样给出 gather,代码可直接运行 | 没有额外补充 |
| DeepSeek V3 | ✅ 准确识别 | 给出了 gather 和 TaskGroup 两种方案 | 附带了 Python 版本兼容性说明 |
小结:三个模型都过关,DeepSeek V3 给了两种方案反而更实用,Claude 的主动补充也有价值。GPT-4o 最简洁,适合直接复制用。
场景二:长文档理解与信息提取
任务:输入一份 8000 字的技术规范文档(英文),要求提取所有"MUST"级别的约束条件,并整理成中文清单。
| 模型 | 提取准确率(人工核对) | 格式整洁度 | 漏项 |
|------|-------------------|---------|-----|
| Claude Sonnet 4.5 | ~96% | 分类清晰,有编号 | 漏了 1 条嵌套在表格里的约束 |
| GPT-4o | ~91% | 平铺列表,无分类 | 漏了 3 条,集中在文档后半段 |
| DeepSeek V3 | ~93% | 有分类,格式略乱 | 漏了 2 条 |
小结:长文档理解 Claude 4.5 明显更稳,GPT-4o 在文档后半段注意力有所下降,这个现象在多次测试中重复出现。
场景三:数学推理(应用题)
任务:一道需要多步推导的概率题,涉及条件概率和贝叶斯更新。
| 模型 | 最终答案 | 推导过程 | 是否自我检验 |
|------|---------|---------|------------|
| Claude Sonnet 4.5 | ✅ 正确 | 步骤清晰,符号规范 | 有,主动验算了一步 |
| GPT-4o | ✅ 正确 | 步骤完整 | 无 |
| DeepSeek V3 | ✅ 正确 | 步骤最详细,有中间变量说明 | 有 |
三个都答对了,DeepSeek V3 的推导过程最适合用来学习,Claude 的自我检验习惯在复杂题目里会更有价值。
场景四:中文写作润色
任务:一段技术博客草稿,要求在保留技术准确性的前提下提升可读性。
这个场景主观性强,我只记录几个观察:
- Claude 4.5:改动克制,保留了原文的技术术语,语感自然
- GPT-4o:倾向于把句子改得更"正式",有时会过度润色
- DeepSeek V3:中文语感最地道,改出来的文章读起来像中文母语者写的
如果是写给中文读者的技术内容,DeepSeek V3 在这个场景里表现最好。
成本对比:这才是很多人真正关心的
以每百万 token 计价(输入+输出混合估算,输出权重更高):
| 模型 | 官方价(¥/M tokens) | 无量Api SVIP 价(¥/M tokens) | 节省比例 |
|------|-------------------|---------------------------|---------|
| Claude Sonnet 4.5 | ¥21 | ¥7.5 | ~64% |
| GPT-4o | ¥17.5 | ¥6.3 | ~64% |
| DeepSeek V3 | ¥4 | ¥1.4 | ~65% |
如果你每天的用量在 2M tokens 左右(中等强度开发者),一个月下来:
- 用 Claude Sonnet 4.5 官方:约 ¥1260/月
- 用无量Api SVIP:约 ¥450/月
差价够买好几顿饭了。DeepSeek V3 本身就便宜,SVIP 之后更是几乎没有心理负担地随便用。
综合结论
| 场景 | 推荐模型 |
|------|---------|
| 代码 Debug / 补全 | 三者相当,DeepSeek V3 方案更全面 |
| 长文档处理 | Claude Sonnet 4.5 |
| 数学推理 | DeepSeek V3(过程最详细) |
| 中文写作 | DeepSeek V3 |
| 英文写作 / 通用对话 | GPT-4o |
| 成本敏感场景 | DeepSeek V3 |
没有哪个模型在所有场景都碾压其他两个。实际使用中,按场景切换模型才是最优解——而这正好是 API 接入方式的优势:改一个参数就换模型,不用重新登录账号、不用担心封号。
关于封号这件事
最近 V2EX 上好几个帖子都在聊 ChatGPT 封号,有代充的号被封,有 iOS 美区订阅的号被封,有过了 Cyber 认证的号也没逃过。账号风险这个问题,用 API 方式基本可以绕开——没有账号,自然没有封号。
如果你还在用网页版或者 App,可以考虑迁移到 API 接入,稳定性会好很多。
国内直连、OpenAI 格式兼容、注册送 ¥1 余额永久有效,可以先用免费额度把上面的测试自己跑一遍验证一下:
- Zhihu 读者:api2everything.xyz
- V2EX 读者:api2everything.xyz
改 Base URL 一行代码的事,试试没什么损失。