横评对比 · 阅读约 7 分钟

Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天

Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天

最近 V2EX 上关于 Codex、ChatGPT Business 踩坑的帖子越来越多,说明大家真的在生产环境里用这些模型了,不是玩具。正好趁这个机会,我把手头几个真实任务拿出来,对着三个主流模型跑了一遍,记录一下结果。

测试对象 & 版本

| 模型 | 版本 | 测试时间 |

|------|------|----------|

| Claude | Sonnet 4.5 | 2025-07 |

| GPT | GPT-4.1 | 2025-07 |

| DeepSeek | V3(0324) | 2025-07 |

Gemini 2.5 Pro 和 Grok 4 也跑了部分场景,会在对应位置补充。


场景一:定位一个真实 Bug

任务描述:给一段 Python 异步代码,里面有一个竞态条件(race condition),不会直接报错,只在高并发下偶发数据错乱。代码约 120 行。


# 简化版问题代码

async def update_counter(key):

    val = await redis.get(key)

    val = int(val or 0) + 1

    await redis.set(key, val)  # 非原子操作,并发下会丢失更新

结果:

  • Claude Sonnet 4.5:直接定位到 get → set 非原子操作,给出了 INCR 命令替换方案,还额外提示了 Lua 脚本方案用于更复杂场景。解释清晰,没有废话。
  • GPT-4.1:也找到了问题,但解释绕了一圈,先讲了一堆并发理论,最后才给方案。方案本身是对的。
  • DeepSeek V3:找到了问题,给出了 INCR 方案,但没有主动提 Lua 脚本的扩展思路。够用,不惊艳。

小结:Claude 在代码诊断的"顺手程度"上略胜,GPT 话多但准确,DeepSeek 简洁实用。


场景二:长文档理解(合同条款提取)

任务描述:一份 8000 字的 SaaS 服务合同(英文),要求提取所有涉及"数据所有权"和"服务终止"的条款,并用中文总结。

结果:

  • Claude Sonnet 4.5:提取完整,中文总结结构清晰,还主动标注了"第 12.3 条措辞模糊,建议律师确认"——这个主动风险提示很有价值。
  • GPT-4.1:提取准确,但总结偏流水账,没有结构化分类。
  • DeepSeek V3:提取有遗漏(漏了一处嵌套在附录里的条款),总结质量中等。
  • Gemini 2.5 Pro(补充测试):表现接近 Claude,长文处理是 Gemini 的强项,提取完整,但中文表达略生硬。

小结:长文理解 Claude ≈ Gemini 2.5 Pro > GPT-4.1 > DeepSeek V3。


场景三:数学推理(竞赛级别)

任务描述:AMC 12 难度的组合数学题,要求给出完整推导过程。

从 1 到 100 中随机选 5 个不同整数,恰好有 3 个偶数的概率是多少?

结果:

  • Claude Sonnet 4.5:过程正确,答案正确,排列组合写得很规范。
  • GPT-4.1:过程正确,答案正确,步骤更详细,适合教学场景。
  • DeepSeek V3:答案正确,过程简洁,速度最快。
  • Grok 4(补充测试):答案正确,但中间有一步跳跃,没有完整展开。

换成更难的数论题(需要模运算和归纳法),DeepSeek V3 出现了一次推导跳步导致答案错误,Claude 和 GPT-4.1 均正确。

小结:数学推理 GPT-4.1 ≈ Claude Sonnet 4.5 > DeepSeek V3 > Grok 4(复杂题)。


场景四:代码补全(实际开发场景)

任务描述:给一个 FastAPI 项目骨架,要求补全一个带分页、过滤、排序的 /users 查询接口,使用 SQLAlchemy 2.0 异步风格。

结果:

  • Claude Sonnet 4.5:生成代码直接可运行,用了 select() 的新式写法,分页逻辑正确,还加了 total_count 的子查询。
  • GPT-4.1:生成代码可运行,但混用了 SQLAlchemy 1.x 的旧式 query() 写法,需要手动修正。
  • DeepSeek V3:生成代码可运行,风格正确,但没有 total_count,需要自己补。

小结:代码补全 Claude Sonnet 4.5 > DeepSeek V3 > GPT-4.1(在 SQLAlchemy 2.0 这个细节上)。


成本对比:这才是生产环境最关心的

测完效果,聊聊钱。以上四个场景,我估算了一下 token 消耗,折算成每百万 token 的费用:

| 模型 | 官方价(输入/输出,¥/M token) | 无量Api 普通价 | 无量Api SVIP 价(7.7折) |

|------|-------------------------------|----------------|--------------------------|

| Claude Sonnet 4.5 | ¥21 / ¥105 | ¥10.5 / ¥52.5 | ¥8.1 / ¥40.4 |

| GPT-4.1 | ¥14 / ¥56 | ¥7 / ¥28 | ¥5.4 / ¥21.6 |

| DeepSeek V3 | ¥2 / ¥8 | ¥1 / ¥4 | ¥0.77 / ¥3.1 |

| Gemini 2.5 Pro | ¥18 / ¥72 | ¥9 / ¥36 | ¥6.9 / ¥27.7 |

价格来源:官方定价截至 2025-07,中转价格来自无量Api 实测。

一个实际例子:假设你每天调用 Claude Sonnet 4.5 处理文档,消耗 10M input token + 2M output token:

  • 官方直连:10×21 + 2×105 = ¥420/天
  • 无量Api SVIP:10×8.1 + 2×40.4 = ¥162/天
  • 一个月省下:(420-162)×30 = ¥7,740

DeepSeek V3 本来就便宜,但如果你的任务对质量要求高,用 Claude 配合中转价格,性价比其实不差。


综合评分

| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |

|------|:-----------------:|:-------:|:-----------:|

| 代码质量 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 响应速度 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |

| 官方价格 | 贵 | 中等 | 便宜 |

| 中转后性价比 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |


结论

没有"最好的模型",只有"最适合场景的模型":

  • 日常代码开发、文档处理:Claude Sonnet 4.5 综合体验最顺手,但要配合中转价格用,否则成本压力大。
  • 需要详细解释、教学场景:GPT-4.1 的啰嗦在这里反而是优点。
  • 高频调用、成本敏感、对质量要求不极致:DeepSeek V3 是最优解,便宜且够用。
  • 长上下文处理:Gemini 2.5 Pro 值得考虑,窗口大、价格合理。

三个模型我现在都在用,根据任务切换。关键是 API 调用方式统一,换模型只改一个参数的事。


附:我现在的调用方案

国内直连这几个模型一直是个麻烦事,我目前用的是 无量Api,支持 OpenAI 格式,改一行 base_url 就能切换,300+ 模型统一入口,注册送 ¥1 可以直接试。


from openai import OpenAI



client = OpenAI(

    api_key="your-key",

    base_url="https://api2everything.xyz/v1"  # 改这一行

)



# 其他代码完全不用动

response = client.chat.completions.create(

    model="claude-sonnet-4-5",  # 或 gpt-4.1 / deepseek-v3

    messages=[{"role": "user", "content": "你好"}]

)

余额永久有效,不用担心月底清零。SVIP 是 7.7 折,上面成本表里的 SVIP 价格是真实数字,不是估算。

👉 https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb


如果你也在做类似的横评,欢迎评论区交流,特别是 Grok 4 的使用体验,我测的场景还不够多。