横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一组任务测了三天,结论有点意外

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一组任务测了三天,结论有点意外

最近主流模型更新密集,群里有人问"现在该用哪个"。与其嘴炮,不如实测。

我选了三个当前实际可用且讨论度最高的模型:Claude Sonnet 4.5、GPT-4.1、DeepSeek V3(0324),用同一批任务跑了三天,把过程和结论都写在这里。


测试前说明

  • 三个模型均通过 API 调用,temperature 统一 0.7,除非特定场景另注
  • 测试时间:2025年7月
  • 评分维度:准确性、代码可运行率、回答完整度、"废话率"
  • 不做主观感受打分,尽量用可验证的指标

场景一:Debug 一段有多层嵌套问题的 Python 代码

给出一段 120 行的 FastAPI 路由代码,里面埋了三个 bug:

1. 异步函数里误用了同步 DB 调用

2. Pydantic v2 的 model_validator 使用姿势是 v1 写法

3. 一个边界条件导致 KeyError 在特定请求体下触发

结果:

| 模型 | 找到 bug 数 | 代码可直接运行 | 解释清晰度 |

|------|------------|--------------|-----------|

| Claude Sonnet 4.5 | 3/3 | ✅ | 高,逐个说明了根因 |

| GPT-4.1 | 3/3 | ✅ | 高,但解释略啰嗦 |

| DeepSeek V3 | 2/3 | ✅ | 中,漏掉了 Pydantic 那个 |

Claude 在这里的表现让我有点意外,对 Pydantic v1/v2 迁移的细节掌握很扎实。DeepSeek 漏掉那个 bug 不是能力问题,更像是上下文权重分配的问题——代码越长,它越容易忽略"看起来没报错"的部分。


场景二:长文档理解(40K token 技术文档问答)

给一份 38K token 的内部架构文档,问五个分散在不同章节的细节问题,其中一个问题的正确答案只出现了一次、埋在第 27 页。

结果:

| 模型 | 5题答对数 | 第27页那题 | 幻觉情况 |

|------|----------|-----------|---------|

| Claude Sonnet 4.5 | 5/5 | ✅ | 无 |

| GPT-4.1 | 4/5 | ❌ | 1处轻微(编了一个不存在的章节名) |

| DeepSeek V3 | 4/5 | ✅ | 无 |

长文理解这块 Claude 表现最稳,GPT-4.1 出现了一次轻微幻觉,DeepSeek 超出预期——它找到了那个埋得很深的答案,但在另一题上推理链断了。


场景三:数学推理(竞赛级组合数学)

取了三道 AMC 12 难度的组合题,要求给出完整推导过程。

结果:

| 模型 | 答对数 | 推导过程完整 | 有无错误步骤 |

|------|-------|------------|------------|

| Claude Sonnet 4.5 | 2/3 | ✅ | 第3题中间步骤跳跃 |

| GPT-4.1 | 3/3 | ✅ | 无 |

| DeepSeek V3 | 3/3 | ✅ | 无 |

数学这块 GPT-4.1 和 DeepSeek V3 表现更好。Claude 答对了 2 道,第 3 道的中间有个步骤跳跃导致结论偶然正确——如果不看过程只看答案会误判。


场景四:代码补全(TypeScript + 复杂类型体操)

给一个半成品的工具函数,要求补全泛型约束和重载签名,要求通过 tsc --strict。

结果:

| 模型 | 编译通过 | 类型推断正确 | 边界情况处理 |

|------|---------|------------|------------|

| Claude Sonnet 4.5 | ✅ | ✅ | 主动补充了 2 个未提及的边界 |

| GPT-4.1 | ✅ | ✅ | 按要求做,不多不少 |

| DeepSeek V3 | ⚠️ 需一次修改 | 基本正确 | 有 1 处类型收窄缺失 |

TypeScript 类型体操这块 Claude 发挥最好,主动考虑了我没提到的情况。DeepSeek 一次没过,但提示后秒改,最终结果也没问题。


成本对比(这才是很多人的真实痛点)

跑这些测试,Token 消耗不低。来算一下:

| 模型 | 官方定价(输入/输出,$/M tokens) | 折算人民币 | 无量Api SVIP 价 |

|------|--------------------------------|----------|----------------|

| Claude Sonnet 4.5 | $3 / $15 | 约 ¥21/M(输出) | ¥7.5/M |

| GPT-4.1 | $2 / $8 | 约 ¥11/M(输出) | ¥4.0/M |

| DeepSeek V3 | $0.28 / $1.1 | 约 ¥1.6/M(输出) | ¥0.9/M |

以上官方价格为撰文时数据,汇率按 7.3 计算。

如果你是个人开发者,每天 API 消耗在 5M-20M token 之间,以 Claude Sonnet 4.5 为例:

  • 官方渠道:20M × ¥21 = ¥420/天
  • 无量Api SVIP:20M × ¥7.5 = ¥150/天

一个月就是 ¥8100 vs ¥2900,省的那部分已经够买一个季度的咖啡了。


综合结论

说结论之前先说一句:这三个模型现在都很强,用哪个都不会错。差异更多体现在任务类型的匹配度上。

| 使用场景 | 推荐 |

|---------|------|

| 代码 Debug / 复杂类型推断 | Claude Sonnet 4.5 |

| 数学 / 逻辑推理 | GPT-4.1 或 DeepSeek V3 |

| 长文档分析 | Claude Sonnet 4.5 |

| 成本敏感、高并发调用 | DeepSeek V3 |

| 均衡通用 | GPT-4.1 |

DeepSeek V3 的性价比依然离谱,在成本只有前两者 1/10 的情况下,多数任务差距没想象中大。如果你的业务对延迟不敏感、任务相对标准,它是最值钱的选择。


关于国内访问和成本的一点补充

这次测试我全程走的是 無量Api,国内直连,没有网络问题,OpenAI 格式兼容,把 base_url 改一行就能切过去。支持 300+ 模型,上面这三个都有。

注册送 ¥1 余额,够跑十几次测试了。余额永久有效,不用担心月底清零。SVIP 是 7.7 折,上面价格表里的 SVIP 价就是按这个算的。

如果你在犹豫要不要测测哪个模型更适合自己的场景,先注册个账号把那 ¥1 用掉再说——传送门在这。