横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一套题测了三天,结论有点意外

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一套题测了三天,结论有点意外

最近 V2EX 上不少人在讨论 OpenAI 账号问题、codex 工作流,也有人问 DeepSeek 在 flash 场景下的表现。干脆整一篇横评,把几个当下最热门的模型放在同一套测试场景下跑一遍,数据说话。

测试说明

测试时间:2025 年 7 月

测试模型:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3 / Gemini 2.5 Flash

测试维度:代码调试、长文理解、数学推理、中文创作、成本估算

评分标准:准确性(40%)+ 输出质量(30%)+ 响应速度(30%),满分 10 分


场景一:代码调试(一个真实 bug)

用了一段 Python 异步代码,存在 asyncio.gather 和异常捕获配合不当的问题,外加一个隐藏的竞争条件。

| 模型 | 是否找到竞争条件 | 修复质量 | 解释清晰度 | 综合评分 |

|------|:---:|:---:|:---:|:---:|

| Claude Sonnet 4.5 | ✅ | 优 | 优 | 9.2 |

| GPT-4.1 | ✅ | 优 | 良 | 8.8 |

| DeepSeek V3 | ✅ | 良 | 优 | 8.6 |

| Gemini 2.5 Flash | ❌(漏掉) | 中 | 良 | 6.9 |

Claude 4.5 在这个场景下确实更细心,不只给修复代码,还主动指出了两处"虽然现在没报错但未来可能出问题"的地方。GPT-4.1 修复准确但解释略显模板化。DeepSeek V3 的中文注释写得很地道,适合团队里有非英语母语成员的场景。


场景二:长文理解(10000 字技术文档问答)

喂入一篇 Kubernetes 网络策略的长篇英文文档,提 8 个问题,其中 3 个答案需要跨段落推理。

| 模型 | 8 题答对数 | 跨段落推理 | 幻觉次数 | 综合评分 |

|------|:---:|:---:|:---:|:---:|

| Claude Sonnet 4.5 | 8/8 | 3/3 | 0 | 9.5 |

| Gemini 2.5 Flash | 7/8 | 2/3 | 1 | 8.4 |

| GPT-4.1 | 7/8 | 2/3 | 0 | 8.2 |

| DeepSeek V3 | 6/8 | 2/3 | 2 | 7.3 |

长文理解是 Claude 4.5 的强项,这个结论没什么争议。Gemini 2.5 Flash 速度快、上下文窗口大,性价比很高。DeepSeek V3 在英文专业文档场景下幻觉稍多,换成中文技术文档则表现好很多。


场景三:数学推理(AMC/竞赛级题目)

选了 5 道 AMC 10/12 难度的题目,要求给出完整解题过程。

| 模型 | 5 题答对数 | 解题过程完整性 | 综合评分 |

|------|:---:|:---:|:---:|

| GPT-4.1 | 5/5 | 优 | 9.4 |

| Gemini 2.5 Flash | 4/5 | 优 | 8.8 |

| Claude Sonnet 4.5 | 4/5 | 良 | 8.3 |

| DeepSeek V3 | 4/5 | 良 | 8.1 |

数学场景 GPT-4.1 反超,步骤拆解尤其清晰,适合拿来做数学教学或辅助刷题。DeepSeek V3 在这个维度和 Claude 差距不大,但价格便宜很多。


场景四:中文创作(产品文案 + 技术博客开头)

各给一个产品描述需求和一个技术博客题目,让四个模型各写一版。

| 模型 | 语言自然度 | 创意度 | 符合需求程度 | 综合评分 |

|------|:---:|:---:|:---:|:---:|

| DeepSeek V3 | 优 | 优 | 优 | 9.3 |

| Claude Sonnet 4.5 | 优 | 良 | 优 | 8.7 |

| GPT-4.1 | 良 | 良 | 优 | 8.0 |

| Gemini 2.5 Flash | 中 | 中 | 良 | 7.1 |

中文创作 DeepSeek V3 明显占优,语感更接近中文母语写作者,不会出现那种机翻腔。这个场景强烈推荐优先考虑 DeepSeek。


场景五:成本估算(月均 100 万 token 使用量)

这里用一个典型场景:每月输入 70 万 token + 输出 30 万 token,算一下各平台的实际花费。

官方价格(美元转人民币按当前汇率)

| 模型 | 输入价 | 输出价 | 月费用估算 |

|------|:---:|:---:|:---:|

| Claude Sonnet 4.5 | ¥21/M | ¥105/M | ¥46.2 |

| GPT-4.1 | ¥14/M | ¥56/M | ¥26.6 |

| Gemini 2.5 Flash | ¥2.7/M | ¥10.5/M | ¥5.0 |

| DeepSeek V3 | ¥2.8/M | ¥11.2/M | ¥5.3 |

通过无量Api(SVIP 7.7 折,国内直连)

| 模型 | 输入价 | 输出价 | 月费用估算 | 节省 |

|------|:---:|:---:|:---:|:---:|

| Claude Sonnet 4.5 | ¥7.5/M | ¥37/M | ¥16.2 | 节省 65% |

| GPT-4.1 | ¥5.4/M | ¥21.6/M | ¥10.3 | 节省 61% |

| Gemini 2.5 Flash | ¥1.0/M | ¥4.0/M | ¥1.9 | 节省 62% |

| DeepSeek V3 | ¥1.0/M | ¥4.2/M | ¥1.96 | 节省 63% |

对于高频调用场景,Claude Sonnet 4.5 的官方价格压力比较大,通过聚合 API 走量的话每月能省几十到几百块,积累下来相当可观。


总结:选哪个?

说实话没有一个全场最强的选手,要看你的用途:

  • 代码调试 / 长文理解:Claude Sonnet 4.5 目前综合最稳,但价格是短板
  • 数学推理 / 逻辑题:GPT-4.1 更可靠
  • 中文内容生产:DeepSeek V3 性价比无对手
  • 高并发低成本场景:Gemini 2.5 Flash 是真香选项
  • 需要频繁切换多个模型:用一个聚合 API 会方便很多,不用管每家的账号和网络问题

关于访问和成本

测试过程中用了国内直连的聚合接口,体验上没有 timeout 和 502 的困扰,对于在 V2EX 上看到有人吐槽"手机上登录不了 ChatGPT"这类情况,一个稳定的 API 接口确实能省不少麻烦。

目前在用的是 无量Api,支持 300+ 模型,OpenAI 格式兼容,改一行 base_url 就能接入,注册有 ¥1 体验额度,余额不过期。SVIP 价格是官方的 7.7 折左右,Claude Sonnet 4.5 跑下来 ¥7.5/M tokens,比自己开官方账号便宜不少。

有在用 opencode、cursor 或者自己搭工作流的同学可以看看,接入成本很低。