Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天
最近几个月模型更新太快,群里每天都有人问"现在用哪个最划算"。与其靠感觉,不如实测。
我选了三个当前讨论度最高、定位最接近的模型:Claude Sonnet 4.5、GPT-4.1、DeepSeek V3 0324,用同一套任务跑了三天,把结果整理出来。
测试说明
- 每个场景同一 prompt,三个模型各跑 3 次,取中位结果
- 不追求"谁最强",追求"同等成本下谁更适合哪类任务"
- 价格数据截至本文写作时,官方汇率按 7.2 计算
场景一:代码补全与 Bug 定位
任务:给一段 Python 异步爬虫代码,里面藏了两个 bug——一个是 asyncio.gather 没有正确处理异常导致静默失败,另一个是 session 没有复用造成连接泄漏。
| 模型 | 找到 bug 数 | 解释质量 | 给出修复方案 |
|------|------------|---------|------------|
| Claude Sonnet 4.5 | 2/2 | 详细,指出了根因 | 完整,附单元测试 |
| GPT-4.1 | 2/2 | 准确,稍简洁 | 完整 |
| DeepSeek V3 | 1/2 | 找到连接泄漏,漏了异常处理 | 部分 |
Claude 在这个场景表现最稳,会主动解释"为什么这样写会出问题",而不只是给 patch。GPT-4.1 结果同样正确,风格更直接。DeepSeek 漏掉了那个更隐蔽的异常处理 bug,但对于简单 bug 定位完全够用。
场景二:长文档理解与信息抽取
任务:喂入一份 18000 token 的技术规范文档(英文),要求:① 提取所有 API 接口的入参出参;② 找出文档中前后矛盾的描述;③ 用中文写一份给非技术同事看的摘要。
| 模型 | 接口抽取准确率 | 矛盾识别 | 摘要可读性 |
|------|-------------|---------|----------|
| Claude Sonnet 4.5 | 高,格式整齐 | 找到 2 处 | 自然,层次清晰 |
| GPT-4.1 | 高 | 找到 1 处 | 略显机械 |
| DeepSeek V3 | 中,有遗漏 | 未识别 | 可用 |
长上下文理解是 Claude 的传统强项,这次依然如此。GPT-4.1 在接口抽取上不输,但对文档内部逻辑矛盾的感知弱一些。DeepSeek 在超长文档上有明显遗漏,更适合中短文本。
场景三:数学推理与逻辑题
任务:混合了 3 道竞赛级数学题(组合数学、概率、数论各一道)+ 2 道逻辑推理题。
| 模型 | 数学正确率 | 逻辑题正确率 | 解题过程 |
|------|----------|-----------|---------|
| Claude Sonnet 4.5 | 2/3 | 2/2 | 步骤清晰,偶有跳步 |
| GPT-4.1 | 3/3 | 2/2 | 严谨,过程完整 |
| DeepSeek V3 | 3/3 | 1/2 | 数学强,逻辑题有失误 |
数学推理上 GPT-4.1 和 DeepSeek V3 表现更稳,Claude 在竞赛数学上偶尔会在最后一步出错。如果你的场景以数学/科学计算为主,GPT-4.1 或 DeepSeek 更可靠。
场景四:中文创作与指令遵循
任务:写一篇 800 字的产品发布公告,要求:正式但不生硬,包含 5 个指定关键词,结尾有 CTA,不能出现"赋能""生态"等词。
| 模型 | 关键词覆盖 | 禁用词 | 文风 |
|------|----------|-------|-----|
| Claude Sonnet 4.5 | 5/5 | 无违规 | 自然,有节奏感 |
| GPT-4.1 | 5/5 | 无违规 | 规整,略平 |
| DeepSeek V3 | 4/5 | 出现"赋能"一次 | 流畅,有时过于口语 |
指令遵循上 Claude 最严格,对"不能出现某词"这类负向约束执行得最好。DeepSeep 在中文写作上很流畅,但对细节约束的遵守稍差。
成本对比:这才是很多人真正关心的
同样的任务量,价格差距相当大。以下是各模型官方定价 vs 通过无量Api(SVIP 7.7 折)的实际成本:
| 模型 | 官方输入价(/M token) | 官方输出价(/M token) | 无量Api SVIP 输入 | 无量Api SVIP 输出 |
|------|---------------------|---------------------|-----------------|-----------------|
| Claude Sonnet 4.5 | ¥21.6 | ¥108 | ¥7.5 | ¥37.4 |
| GPT-4.1 | ¥14.4 | ¥57.6 | ¥5.0 | ¥20.0 |
| DeepSeek V3 | ¥1.0 | ¥4.0 | ¥0.7 | ¥2.8 |
如果你每天调用量在 10M token 左右,用 Claude Sonnet 4.5:
- 官方直连:约 ¥216/天(仅输入)
- 无量Api SVIP:约 ¥75/天
一个月下来差价超过 ¥4000,这还只算输入 token。
DeepSeek V3 本身就便宜,但如果你在国内访问官方 API 需要解决网络问题,无量Api 直连也省去了这部分麻烦。
综合结论
没有"最强",只有"最适合":
- 代码审查 / 长文档处理:Claude Sonnet 4.5,贵但值,尤其是对细节和逻辑一致性要求高的场景
- 数学 / 科学推理:GPT-4.1 或 DeepSeek V3,准确率更稳
- 高频调用 / 成本敏感:DeepSeek V3,性价比无对手,日常任务完全够用
- 中文指令遵循:Claude > GPT-4.1 > DeepSeek,差距不大但存在
如果你在做产品,建议按场景路由:简单任务走 DeepSeek,复杂推理走 GPT-4.1,文档/代码审查走 Claude。混合调用比单一模型更经济。
关于访问问题
国内直连这三个模型的官方 API 都有不同程度的障碍,尤其是 OpenAI 和 Anthropic。我目前用的是 无量Api(api2everything.xyz),支持 300+ 模型,OpenAI 格式兼容,改一行 base_url 就能切换,注册送 ¥1 余额可以先试试手感。
SVIP 价格是官方的 7.7 折,上面表格里的价格就是实际跑出来的数字,不是估算。
👉 https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb