Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论有点意外
Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论有点意外
最近 V2EX 上有个帖子问"程序需要用 API 在哪里买",下面一堆人在讨论价格和稳定性。正好我最近在做模型选型,就把手头的测试整理出来,顺便把成本算清楚。
测试对象:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3。Gemini 2.5 Pro 和 Grok 4 也跑了部分场景,会在对应位置提到。
测试方法
统一用 OpenAI 格式的 API 调用,temperature 固定 0.2,每个场景跑 3 次取中位结果。测试时间:2025 年 7 月初。
场景一:代码补全与 Bug 定位
测试题:一段 Python 异步代码,有一个经典的 asyncio.gather 异常吞噬问题,外加一个隐藏的竞态条件。
async def fetch_all(urls):
results = await asyncio.gather(*[fetch(u) for u in urls])
return results
问题是 gather 默认 return_exceptions=False,任意一个 task 抛异常会取消其他 task,但调用方没有处理这个情况。
结果:
- DeepSeek V3:直接定位到
return_exceptions参数问题,给出了修复方案,还顺带提了asyncio.TaskGroup(Python 3.11+)的替代写法。速度最快,响应约 2 秒。 - Claude Sonnet 4.5:定位准确,解释最详细,把竞态条件也单独拎出来分析了,给了两种修复思路并说明了各自的 trade-off。
- GPT-4.1:也找到了主要问题,但对竞态条件的描述比较模糊,需要追问才展开。
小结:代码 debug 场景,三者都能用,DeepSeek V3 速度优势明显,Claude 4.5 解释质量最高。
场景二:长文档理解(RAG 前置处理)
测试题:喂入一份 12000 token 的技术文档(某开源项目的架构设计文档),要求提取关键决策点、识别潜在风险、输出结构化摘要。
结果:
- Claude Sonnet 4.5:输出结构最清晰,对"潜在风险"的识别有几条是文档里没有明说但可以推断出来的,属于真正的理解而不是复述。
- GPT-4.1:摘要质量不错,但风险识别基本停留在文档显式提到的内容,推断能力弱一些。
- DeepSeek V3:在长文档场景下偶尔会漏掉文档后半段的内容,跑了 3 次有 1 次出现这个问题。
Gemini 2.5 Pro 补充:这个场景 Gemini 表现很好,100 万 token 上下文是真实优势,处理超长文档时比其他模型稳定。
场景三:数学推理
测试题:一道组合数学题 + 一道需要建模的概率题(不贴原题了,难度大概是竞赛入门级)。
结果:
- Claude Sonnet 4.5:两道都对,推理链路清晰,中间步骤有验证。
- GPT-4.1:组合题对,概率题建模思路正确但最后计算出了小错误。
- DeepSeek V3:两道都对,推理步骤比 Claude 简洁,但结论可靠。
Grok 4 补充:数学推理是 Grok 4 的强项,这两道题也都答对了,推理过程最详细。
场景四:成本计算(这才是重点)
光看能力不够,API 成本直接决定项目能不能跑起来。
以下是官方价格 vs 通过无量Api(SVIP 7.7 折)的实际价格对比:
| 模型 | 官方输入价(/M tokens) | 官方输出价(/M tokens) | 无量Api SVIP 输入价 | 无量Api SVIP 输出价 |
|------|------------------------|------------------------|--------------------|--------------------|
| Claude Sonnet 4.5 | ¥21 | ¥105 | ¥7.5 | ¥37.5 |
| GPT-4.1 | ¥14 | ¥56 | ¥5.1 | ¥20.4 |
| DeepSeek V3 | ¥2 | ¥8 | ¥0.7 | ¥2.9 |
| Gemini 2.5 Pro | ¥18 | ¥72 | ¥6.5 | ¥26 |
| Grok 4 | ¥42 | ¥168 | ¥15.3 | ¥61.3 |
实际场景估算:假设你在做一个 RAG 应用,每天处理 500 次查询,平均每次 2000 token 输入 + 500 token 输出:
- 用 Claude Sonnet 4.5 官方:每月约 ¥1,890
- 用无量Api SVIP:每月约 ¥675,省了 ¥1,215
如果用 DeepSeek V3 做同样的事:每月官方约 ¥180,无量Api 约 ¥63。DeepSeek 本来就便宜,再打折之后几乎可以忽略不计。
综合对比表
| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |
|------|------------------|---------|-------------|
| 代码 Debug | ★★★★☆ | ★★★☆☆ | ★★★★☆ |
| 长文理解 | ★★★★★ | ★★★★☆ | ★★★☆☆ |
| 数学推理 | ★★★★★ | ★★★★☆ | ★★★★☆ |
| 响应速度 | ★★★☆☆ | ★★★★☆ | ★★★★★ |
| 性价比(官方) | ★★☆☆☆ | ★★★☆☆ | ★★★★★ |
| 性价比(无量Api) | ★★★★☆ | ★★★★☆ | ★★★★★ |
结论
没有"最好的模型",只有"最适合场景的模型":
- 日常代码辅助、快速迭代:DeepSeek V3,速度快、成本低,够用。
- 需要深度理解和推理的任务:Claude Sonnet 4.5,贵但值,用无量Api 打完折之后接受度高很多。
- 通用场景、不想折腾:GPT-4.1,生态最成熟,工具调用稳定。
- 超长上下文:Gemini 2.5 Pro,100 万 token 窗口是真实优势。
国内直连这些模型一直是个麻烦事,我现在用的是 无量Api,300+ 模型统一 OpenAI 格式,改一行 base_url 就能切换,注册送 ¥1 余额可以先试试手感。SVIP 是 7.7 折,上面的价格表就是按这个算的,余额永久有效不用担心过期浪费。
数据基于 2025 年 7 月初测试,模型版本和价格可能随时更新,以官方和平台实时为准。