横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批测试题打了三天,结果出乎意料

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批测试题打了三天,结果出乎意料

最近 V2EX 上关于 GPT Pro 订阅、图片生成质量的讨论很多,也有不少人在问"现在到底用哪个模型最划算"。我花了三天时间,用同一套测试场景跑了 Claude Sonnet 4.5、GPT-4.1、DeepSeek V3 三个模型,把结果整理出来,希望对你有参考价值。

测试说明

  • 测试时间:2025 年 7 月
  • 测试方式:统一通过 API 调用,temperature 默认,不做 system prompt 干预
  • 计费口径:均按 input + output token 实际消耗计算
  • 模型版本:claude-sonnet-4-5、gpt-4.1、deepseek-v3(最新快照)

场景一:代码调试(Bug 定位)

测试题:给一段 Python 异步代码,里面藏了一个 asyncio.gather 的异常吞噬问题,外加一个 race condition,要求找出所有问题并给出修复方案。

| 模型 | 是否找出全部问题 | 修复方案质量 | 响应速度 |

|------|----------------|-------------|---------|

| Claude Sonnet 4.5 | ✅ 两个都找到 | 详细,给出了 return_exceptions 的权衡分析 | 中等 |

| GPT-4.1 | ✅ 两个都找到 | 简洁,直接给 patch,没有多余解释 | 快 |

| DeepSeek V3 | ⚠️ 找到一个,race condition 漏掉 | 修复了已发现的问题 | 快 |

小结:代码调试场景 Claude 和 GPT-4.1 旗鼓相当,Claude 更倾向于解释"为什么",GPT-4.1 更倾向于直接给答案。DeepSeek V3 在这个场景有一定差距,但考虑到价格,仍然值得用于初筛。


场景二:长文理解(合同审查)

测试题:一份 8000 字的 SaaS 服务协议(英文),要求提取所有对用户不利的条款,并按风险等级排序。

| 模型 | 提取完整度 | 风险判断准确性 | 格式整洁度 |

|------|-----------|--------------|-----------|

| Claude Sonnet 4.5 | ⭐⭐⭐⭐⭐ | 高,有几处细节判断很到位 | 结构清晰,分级明确 |

| GPT-4.1 | ⭐⭐⭐⭐ | 高,但漏掉了一条仲裁地条款 | 清晰 |

| DeepSeek V3 | ⭐⭐⭐ | 中,主要条款都有,细节不足 | 一般 |

小结:长文理解是 Claude 的传统强项,这次测试也印证了这一点。如果你的工作涉及大量文档处理,Claude 在这个场景的优势比较明显。


场景三:数学推理(竞赛题)

测试题:两道 AMC 12 难度的组合数学题,要求给出完整推导过程。

| 模型 | 正确率 | 推导过程 | 是否有错误步骤 |

|------|--------|---------|--------------|

| Claude Sonnet 4.5 | 1/2 | 详细 | 第二题中间步骤有跳跃 |

| GPT-4.1 | 2/2 | 详细 | 无明显错误 |

| DeepSeek V3 | 2/2 | 非常详细 | 无明显错误 |

小结:数学推理这个场景 DeepSeek V3 和 GPT-4.1 表现更稳,Claude 在这类题目上偶尔会出现推导跳步。如果你的场景以数学/逻辑推理为主,DeepSeek V3 的性价比在这里体现得最明显。


场景四:创意写作(技术博客)

测试题:以"为什么你的 Kubernetes 集群在凌晨三点总是出问题"为题,写一篇 800 字技术博客,要求有真实感、有干货、不能是 AI 味十足的套话。

这个场景主观性强,我找了三个同事盲测打分(1-10 分):

| 模型 | 平均分 | 主要评价 |

|------|--------|---------|

| Claude Sonnet 4.5 | 8.2 | "有点像真人写的,细节到位" |

| GPT-4.1 | 7.1 | "结构好,但读起来还是有点模板感" |

| DeepSeek V3 | 6.8 | "内容准确,但语感偏平" |

小结:创意写作 Claude 的优势比较突出,语感更自然,细节更有说服力。


成本对比:这才是很多人最关心的

以上四个场景,我统计了实际 token 消耗,换算成每百万 token 的费用:

| 模型 | 官方价(¥/M token) | 无量Api SVIP 价(¥/M token) | 节省比例 |

|------|-------------------|---------------------------|---------|

| Claude Sonnet 4.5 | ¥21.0 | ¥7.5 | 约 64% |

| GPT-4.1 | ¥14.0 | ¥5.0 | 约 64% |

| DeepSeek V3 | ¥4.0 | ¥1.4 | 约 65% |

如果你每天调用量在 10M token 左右(中等规模的个人项目或小团队),以 Claude Sonnet 4.5 为例:

  • 官方直接用:¥210/天,¥6300/月
  • 通过无量Api SVIP:¥75/天,¥2250/月
  • 每月省下约 ¥4050

这个差距在项目规模变大之后会非常显著。


综合结论

说实话,没有一个模型在所有场景都是第一。

  • 代码调试:Claude 4.5 和 GPT-4.1 并列,看你更喜欢"解释型"还是"直给型"
  • 长文理解:Claude 4.5 领先,文档处理首选
  • 数学推理:DeepSeek V3 和 GPT-4.1 更稳
  • 创意写作:Claude 4.5 明显更自然
  • 成本敏感场景:DeepSeek V3 是最优解,性能够用且价格极低

我自己的实际用法是:日常代码和文档用 Claude,数学/逻辑密集型任务用 DeepSeek V3,需要快速出结果时用 GPT-4.1。三个模型混用,按场景切换,成本和效果都能兼顾。


关于 API 接入

三个模型我都是通过 无量Api(api2everything.xyz)接入的,国内直连不需要代理,Base URL 换一行就能用,兼容 OpenAI 格式,现有代码基本不用改。注册有 ¥1 余额可以先试试手感,余额永久有效不会过期。

对于上面提到的成本数字,SVIP 折扣是 7.7 折,300+ 模型统一入口,不用到处管 API Key。

如果你也在做类似的模型选型,可以直接去跑一遍自己的业务场景,比看别人的测评更准:

👉 https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb


以上测试结果基于特定 prompt 和特定时间点的模型快照,模型会持续更新,仅供参考。