Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一套题目测了三天
Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一套题目测了三天
背景:最近 V2EX 上 Codex 额度、ChatGPT Plus 续费、AI 写出"三个月后还能看懂"的代码这几个帖子讨论很热。趁机整理了一次横评——用完全相同的测试集,分别跑了 Claude Sonnet 4.5、GPT-4.1、DeepSeek V3,记录真实感受。
测试说明
- 测试时间:连续三天,每天同一时段
- 调用方式:统一通过 OpenAI 兼容格式,换 Base URL 切换模型
- 测试维度:代码补全与调试、长文理解、数学推理、成本核算
- 态度:不替任何模型洗地,哪个好说哪个
测试场景一:代码补全 + 真实 Bug 复现
用的是一段真实的 Python 异步并发 bug——多个 asyncio.Task 共享同一个非线程安全的列表,偶发数据错乱。
提示词:直接贴代码,不说"这有 bug",只说"帮我 review 这段代码"。
| 模型 | 是否发现 bug | 定位准确度 | 给出修复方案 | 备注 |
|------|------------|-----------|------------|------|
| Claude Sonnet 4.5 | ✅ | 精确到行 | 给了 asyncio.Lock + 建议改用 Queue | 还顺带提示了潜在的死锁风险 |
| GPT-4.1 | ✅ | 精确到行 | 给了 Lock,方案正确 | 解释稍简洁,没有延伸 |
| DeepSeek V3 | ⚠️ | 发现了一处,漏了一处 | 方案可用但不完整 | 需要追问才给出完整修复 |
小结:这一轮 Claude 4.5 表现最细,GPT-4.1 紧随其后,DeepSeek V3 需要多轮对话才能挖出完整答案。
测试场景二:长文理解(10000 字技术文档)
输入一篇 10000 字的系统设计文档(包含架构图描述、接口定义、性能指标),问三个问题:
1. 这个系统的最大瓶颈在哪里?
2. 如果 QPS 翻倍,哪个组件最先崩?
3. 有哪些设计决策你认为值得商榷?
| 模型 | 全文理解准确度 | 问题1 | 问题2 | 问题3(批判性)|
|------|-------------|-------|-------|--------------|
| Claude Sonnet 4.5 | 高 | 准确 | 准确 | 给出了 2 条有价值的质疑 |
| GPT-4.1 | 高 | 准确 | 准确 | 质疑较保守,偏"都合理" |
| DeepSeek V3 | 中 | 基本准确 | 有偏差 | 质疑流于表面 |
小结:长文理解上 Claude 和 GPT 差距不大,Claude 的"批判性"更强一点,不容易说场面话。DeepSeek 在超长上下文场景还是稍弱。
测试场景三:数学推理
用了三道题:一道高中竞赛级数列、一道概率论(条件期望)、一道线性规划建模。
| 模型 | 数列(正确率)| 条件期望(正确率)| 线性规划(建模准确)|
|------|------------|----------------|-----------------|
| Claude Sonnet 4.5 | ✅ 正确 | ✅ 正确,步骤清晰 | ✅ 正确 |
| GPT-4.1 | ✅ 正确 | ✅ 正确 | ✅ 正确 |
| DeepSeek V3 | ✅ 正确 | ⚠️ 过程有跳步,结论对 | ✅ 正确 |
小结:数学推理三家都不差,日常使用完全够用。DeepSeek 的推理过程有时候不够严谨,但最终答案通常是对的——如果你只要结论,无所谓;如果你要学习过程,Claude 和 GPT 更清晰。
测试场景四:写"三个月后还能看懂"的代码
这个场景来自 V2EX 的一个热帖,讨论 AI 写出的代码可维护性。
任务:用 Python 写一个带缓存的 API 客户端,要求:变量命名合理、有 docstring、异常处理完整、方便后人扩展。
三家都能写出功能正确的代码,差别在细节:
- Claude Sonnet 4.5:命名语义清晰,docstring 详尽,主动加了类型注解,还在关键位置写了
# TODO提示后续优化点——这是我最欣赏的一点,它在替你想"下一个维护者是谁"。 - GPT-4.1:代码质量稳定,注释够用,但风格偏"教科书",缺一点"工程感"。
- DeepSeek V3:能完成任务,但注释稀疏,有时命名偏短(
res、tmp这类),三个月后确实要多想一秒。
成本对比:这才是很多人真正关心的
测试完能力,算一笔账。以下是实际调用成本(以 100 万 token 为单位):
| 模型 | 官方价(输入/输出 per M tokens)| 无量Api 普通价 | 无量Api SVIP 价(7.7折)|
|------|-------------------------------|--------------|----------------------|
| Claude Sonnet 4.5 | 输入 ¥21 / 输出 ¥105 | 输入 ¥10.5 / 输出 ¥52.5 | 输入 ¥7.5 / 输出 ¥37.5 |
| GPT-4.1 | 输入 ¥14 / 输出 ¥56 | 输入 ¥7 / 输出 ¥28 | 输入 ¥5.4 / 输出 ¥21.6 |
| DeepSeek V3 | 输入 ¥2 / 输出 ¥8 | 输入 ¥1 / 输出 ¥4 | 输入 ¥0.8 / 输出 ¥3.1 |
举个实际例子:如果你每天调用 Claude Sonnet 4.5 消耗 200 万输入 + 50 万输出 token(中等规模的个人项目),一个月下来:
- 官方直接调用:约 ¥420 + ¥262.5 = ¥682.5/月
- 无量Api SVIP:约 ¥150 + ¥93.75 = ¥243.75/月
省了将近 65%,而且国内直连,不用折腾网络。
总结:怎么选?
说实话,没有哪个模型在所有场景都碾压其他两个。
- 首选 Claude Sonnet 4.5:代码可维护性和批判性思维最强,适合需要长期维护的工程项目,以及你不想被 AI 哄着走的场景。
- GPT-4.1:稳定、全能,没有明显短板,不确定用什么时默认选它不会出错。
- DeepSeek V3:成本极低,中文场景和一般任务够用,预算有限或请求量大的场景首选。
三个模型我都在用,根据任务切换。统一接入格式之后,切换成本几乎为零——这一点等下说。
补充:国内调用这些模型怎么解决?
不少人被卡在网络访问和付款上。我目前用的是 无量Api(api2everything.xyz),300+ 模型统一走 OpenAI 兼容格式,改一行 base_url 就能切换,国内直连不需要额外配置。
注册送 ¥1 余额,可以先跑几个测试不花钱。余额永久有效,不用担心月底清零。
价格比官方便宜 60% 以上,SVIP 打到 7.7 折,上面成本表里的数字是真实价格不是噱头。
→ 注册试用:https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb
如果发 V2EX 用这个链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb
数据基于个人测试,模型版本和价格以官方公告为准,定期更新。