Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一组任务测了三天,结论有点意外
Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一组任务测了三天,结论有点意外
最近主流模型更新密集,群里有人问"现在该用哪个"。与其嘴炮,不如实测。
我选了三个当前实际可用且讨论度最高的模型:Claude Sonnet 4.5、GPT-4.1、DeepSeek V3(0324),用同一批任务跑了三天,把过程和结论都写在这里。
测试前说明
- 三个模型均通过 API 调用,temperature 统一 0.7,除非特定场景另注
- 测试时间:2025年7月
- 评分维度:准确性、代码可运行率、回答完整度、"废话率"
- 不做主观感受打分,尽量用可验证的指标
场景一:Debug 一段有多层嵌套问题的 Python 代码
给出一段 120 行的 FastAPI 路由代码,里面埋了三个 bug:
1. 异步函数里误用了同步 DB 调用
2. Pydantic v2 的 model_validator 使用姿势是 v1 写法
3. 一个边界条件导致 KeyError 在特定请求体下触发
结果:
| 模型 | 找到 bug 数 | 代码可直接运行 | 解释清晰度 |
|------|------------|--------------|-----------|
| Claude Sonnet 4.5 | 3/3 | ✅ | 高,逐个说明了根因 |
| GPT-4.1 | 3/3 | ✅ | 高,但解释略啰嗦 |
| DeepSeek V3 | 2/3 | ✅ | 中,漏掉了 Pydantic 那个 |
Claude 在这里的表现让我有点意外,对 Pydantic v1/v2 迁移的细节掌握很扎实。DeepSeek 漏掉那个 bug 不是能力问题,更像是上下文权重分配的问题——代码越长,它越容易忽略"看起来没报错"的部分。
场景二:长文档理解(40K token 技术文档问答)
给一份 38K token 的内部架构文档,问五个分散在不同章节的细节问题,其中一个问题的正确答案只出现了一次、埋在第 27 页。
结果:
| 模型 | 5题答对数 | 第27页那题 | 幻觉情况 |
|------|----------|-----------|---------|
| Claude Sonnet 4.5 | 5/5 | ✅ | 无 |
| GPT-4.1 | 4/5 | ❌ | 1处轻微(编了一个不存在的章节名) |
| DeepSeek V3 | 4/5 | ✅ | 无 |
长文理解这块 Claude 表现最稳,GPT-4.1 出现了一次轻微幻觉,DeepSeek 超出预期——它找到了那个埋得很深的答案,但在另一题上推理链断了。
场景三:数学推理(竞赛级组合数学)
取了三道 AMC 12 难度的组合题,要求给出完整推导过程。
结果:
| 模型 | 答对数 | 推导过程完整 | 有无错误步骤 |
|------|-------|------------|------------|
| Claude Sonnet 4.5 | 2/3 | ✅ | 第3题中间步骤跳跃 |
| GPT-4.1 | 3/3 | ✅ | 无 |
| DeepSeek V3 | 3/3 | ✅ | 无 |
数学这块 GPT-4.1 和 DeepSeek V3 表现更好。Claude 答对了 2 道,第 3 道的中间有个步骤跳跃导致结论偶然正确——如果不看过程只看答案会误判。
场景四:代码补全(TypeScript + 复杂类型体操)
给一个半成品的工具函数,要求补全泛型约束和重载签名,要求通过 tsc --strict。
结果:
| 模型 | 编译通过 | 类型推断正确 | 边界情况处理 |
|------|---------|------------|------------|
| Claude Sonnet 4.5 | ✅ | ✅ | 主动补充了 2 个未提及的边界 |
| GPT-4.1 | ✅ | ✅ | 按要求做,不多不少 |
| DeepSeek V3 | ⚠️ 需一次修改 | 基本正确 | 有 1 处类型收窄缺失 |
TypeScript 类型体操这块 Claude 发挥最好,主动考虑了我没提到的情况。DeepSeek 一次没过,但提示后秒改,最终结果也没问题。
成本对比(这才是很多人的真实痛点)
跑这些测试,Token 消耗不低。来算一下:
| 模型 | 官方定价(输入/输出,$/M tokens) | 折算人民币 | 无量Api SVIP 价 |
|------|--------------------------------|----------|----------------|
| Claude Sonnet 4.5 | $3 / $15 | 约 ¥21/M(输出) | ¥7.5/M |
| GPT-4.1 | $2 / $8 | 约 ¥11/M(输出) | ¥4.0/M |
| DeepSeek V3 | $0.28 / $1.1 | 约 ¥1.6/M(输出) | ¥0.9/M |
以上官方价格为撰文时数据,汇率按 7.3 计算。
如果你是个人开发者,每天 API 消耗在 5M-20M token 之间,以 Claude Sonnet 4.5 为例:
- 官方渠道:20M × ¥21 = ¥420/天
- 无量Api SVIP:20M × ¥7.5 = ¥150/天
一个月就是 ¥8100 vs ¥2900,省的那部分已经够买一个季度的咖啡了。
综合结论
说结论之前先说一句:这三个模型现在都很强,用哪个都不会错。差异更多体现在任务类型的匹配度上。
| 使用场景 | 推荐 |
|---------|------|
| 代码 Debug / 复杂类型推断 | Claude Sonnet 4.5 |
| 数学 / 逻辑推理 | GPT-4.1 或 DeepSeek V3 |
| 长文档分析 | Claude Sonnet 4.5 |
| 成本敏感、高并发调用 | DeepSeek V3 |
| 均衡通用 | GPT-4.1 |
DeepSeek V3 的性价比依然离谱,在成本只有前两者 1/10 的情况下,多数任务差距没想象中大。如果你的业务对延迟不敏感、任务相对标准,它是最值钱的选择。
关于国内访问和成本的一点补充
这次测试我全程走的是 無量Api,国内直连,没有网络问题,OpenAI 格式兼容,把 base_url 改一行就能切过去。支持 300+ 模型,上面这三个都有。
注册送 ¥1 余额,够跑十几次测试了。余额永久有效,不用担心月底清零。SVIP 是 7.7 折,上面价格表里的 SVIP 价就是按这个算的。
如果你在犹豫要不要测测哪个模型更适合自己的场景,先注册个账号把那 ¥1 用掉再说——传送门在这。