Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天
Claude Sonnet 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天
最近 V2EX 上关于 Codex 失败率、GPT Plus 开通方式的讨论很多,说明大家对"用哪个模型、怎么用得起"这两个问题都很在意。我花了三天时间,用同一套测试任务跑了 Claude Sonnet 4.5、GPT-4.1、DeepSeek V3 三个模型,把结果整理出来。
测试设计
测试场景选了四个,覆盖日常开发和内容工作的主要需求:
1. 代码 Debug:给一段有隐藏并发问题的 Python 异步代码,看能不能定位根因
2. 长文理解:喂一篇 8000 字的技术文档,问 5 个细节问题
3. 数学推理:AMC 12 难度的组合数学题,要求给出完整推导过程
4. 成本估算:按实际 token 用量算三个月的 API 账单
每个场景重复跑 5 次,取中位数结果。
场景一:代码 Debug(并发竞态条件)
测试代码是一个用 asyncio 写的任务队列,存在 race condition,症状是偶发性数据丢失。
| 模型 | 是否定位根因 | 给出修复方案 | 解释质量 |
|------|------------|------------|--------|
| Claude Sonnet 4.5 | ✅ 准确 | ✅ 完整 | 详细,指出了 asyncio.Lock 的具体加锁位置 |
| GPT-4.1 | ✅ 准确 | ✅ 完整 | 简洁,给了两种方案但没说优劣 |
| DeepSeek V3 | ⚠️ 部分准确 | ✅ 可用 | 找到了症状但把根因归结错了,修复方案能跑但不够优雅 |
Claude 在这个场景表现最稳,连续 5 次都能准确定位。GPT-4.1 有 1 次给出了错误方向。DeepSeek V3 有 2 次完全没找到竞态问题。
场景二:长文理解(8000 字技术文档)
文档是一篇关于 LSM-Tree 存储引擎的设计文章,5 个问题里有 2 个需要跨段落综合推理。
| 模型 | 5 题正确数(中位数) | 跨段落推理 | 幻觉情况 |
|------|------------------|----------|--------|
| Claude Sonnet 4.5 | 4.5 | 较好 | 偶发,1 次引用了文中没有的数字 |
| GPT-4.1 | 4 | 一般 | 有 2 次把相似概念混淆 |
| DeepSeek V3 | 4 | 一般 | 较少,但有 1 次直接跳过了问题 |
三个模型在长文理解上差距不大,Claude 略好,但没有压倒性优势。
场景三:数学推理(AMC 12 组合数学)
题目是一道计数问题,需要用容斥原理,过程有 4 步。
| 模型 | 最终答案正确率 | 推导过程完整性 | 错误类型 |
|------|-------------|-------------|--------|
| Claude Sonnet 4.5 | 4/5 | 完整 | 1 次在第 3 步符号处理出错 |
| GPT-4.1 | 3/5 | 完整 | 2 次在边界条件上犯错 |
| DeepSeek V3 | 5/5 | 完整 | 无 |
这个场景 DeepSeek V3 反而最稳,5 次全对。Claude 和 GPT-4.1 都有失误。数学推理不是 Claude 的强项,DeepSeek 在这类结构化推理上训练数据质量明显更好。
场景四:成本对比(这才是很多人最关心的)
按一个中等规模的使用场景估算:每天 200 次调用,平均每次 input 1000 tokens + output 500 tokens,跑一个月。
官方价格(美元转人民币按 7.2 汇率):
| 模型 | Input 价格 | Output 价格 | 月成本估算 |
|------|-----------|-----------|---------|
| Claude Sonnet 4.5 | ¥21/M tokens | ¥105/M tokens | ≈ ¥220 |
| GPT-4.1 | ¥14.4/M tokens | ¥57.6/M tokens | ≈ ¥130 |
| DeepSeek V3 | ¥1.6/M tokens | ¥8/M tokens | ≈ ¥14 |
通过无量Api(SVIP 7.7 折):
| 模型 | Input 价格 | Output 价格 | 月成本估算 |
|------|-----------|-----------|---------|
| Claude Sonnet 4.5 | ¥7.5/M tokens | ¥37.5/M tokens | ≈ ¥79 |
| GPT-4.1 | ¥5.2/M tokens | ¥20.8/M tokens | ≈ ¥47 |
| DeepSeek V3 | ¥0.6/M tokens | ¥3/M tokens | ≈ ¥5 |
Claude Sonnet 4.5 通过中转节省了将近 ¥140/月,如果是重度用户或者跑批量任务,差距会更明显。
综合结论
不想偏袒任何一个,直接说适用场景:
- 代码相关任务:Claude Sonnet 4.5 最稳,GPT-4.1 次之。如果预算有限,DeepSeek V3 的代码能力也够用,只是偶尔需要多问一次。
- 数学 / 逻辑推理:DeepSeek V3 意外地最好,而且价格是三者里最低的,性价比极高。
- 长文档处理:三者差距不大,选便宜的就行。
- 成本敏感场景:DeepSeek V3 几乎没有对手,月成本个位数。
如果你的工作流混合了代码和推理,一个实用的策略是:用 DeepSeek V3 处理数学/逻辑类任务,用 Claude Sonnet 4.5 处理需要高质量代码解释的场景,两个模型都接在同一个 API 端点上,按需切换。
关于接入成本
三个模型都支持 OpenAI 格式,换 Base URL 就能用,不需要改任何其他代码:
client = OpenAI(
api_key="your_key",
base_url="https://api2everything.xyz/v1" # 改这一行
)
国内直连,不需要代理,延迟比绕路低不少。注册有 ¥1 余额可以先跑几个测试,余额不会过期。
300+ 模型在同一个 key 下,Gemini 2.5、Grok 4 也都在,不用管多个账号。
数据基于 2025 年 5 月测试,模型版本和价格可能随时更新,以官方为准。