Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批 prompt 测了三天
Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批 prompt 测了三天
最近 V2EX 上关于 ChatGPT Plus 额度不够用的帖子刷屏了,有人说「两天就完」,有人在研究 Codex 续费后 reset usage 的问题。趁这个机会,我系统测了一下目前最主流的三个模型,场景都是日常开发和写作中真实遇到的,不是那种专门为了让某个模型表现好而设计的 benchmark。
测试环境说明
- 所有请求通过同一个 API key,避免不同账号权重差异
- 每个场景同一个 prompt 发三遍取中位数
- 测试时间:2025 年 7 月
- 模型版本:Claude Sonnet 4.5、GPT-4.1、DeepSeek V3(0324)
场景一:定位一个真实 bug
这是一段 Python 异步代码,有一个不容易发现的竞态条件。我直接把代码粘进去,不加任何提示,让模型自己找问题。
async def process_items(items):
results = []
async def handle(item):
result = await fetch(item)
results.append(result) # 问题在这
await asyncio.gather(*[handle(i) for i in items])
return results
Claude Sonnet 4.5:直接指出 asyncio.gather 并发执行时 results.append 虽然在 CPython 中因为 GIL 大概率安全,但在某些情况下(比如 append 触发列表扩容)仍有潜在问题,建议改用 asyncio.Queue 或收集返回值。解释路径清晰,没有废话。
GPT-4.1:同样找到了问题,解释也准确,但给了三种修改方案,其中一种用了 threading.Lock,在纯异步场景下有点跑偏。
DeepSeek V3:找到了问题,建议直接用 return await asyncio.gather(*[fetch(i) for i in items]),最简洁,但没有解释为什么原来的写法存在隐患。
小结:这个场景 Claude 4.5 的解释质量最高,DeepSeek 给的方案最实用,GPT-4.1 稍显啰嗦。
场景二:长上下文理解(8000 字技术文档)
把一份内部架构文档(约 8000 字,中英混杂)丢进去,问三个具体问题:某个服务的依赖关系、一个配置项的默认行为、以及文档中一处前后矛盾的地方。
| 模型 | 依赖关系 | 默认行为 | 找出矛盾 |
|------|----------|----------|----------|
| Claude Sonnet 4.5 | ✅ 准确 | ✅ 准确 | ✅ 找到了,并指出了页码 |
| GPT-4.1 | ✅ 准确 | ✅ 准确 | ⚠️ 找到了但描述模糊 |
| DeepSeek V3 | ✅ 准确 | ❌ 漏掉了一个边界条件 | ❌ 没有找到 |
长文档理解这个场景,Claude 4.5 明显更稳。DeepSeek V3 在长上下文里的细节召回率差一些,日常用 8k 以内问题不大,超过这个范围要小心。
场景三:数学推理(竞赛难度)
用了一道需要组合数学推导的题目,不是简单的算术。
三个模型都给出了过程,但:
- Claude 4.5 推导步骤最规整,最终答案正确
- GPT-4.1 过程有一步跳跃,但答案也对
- DeepSeek V3 推导过程有一处符号错误,但最终算出了正确答案(可能靠直觉补救了)
数学推理三个都能过,差异主要在过程严谨性,如果你在做数学辅助工具或者需要展示推导步骤,Claude 4.5 更靠谱。
场景四:代码补全(TypeScript + 复杂类型)
给了一个带泛型约束的 TypeScript 接口,让三个模型补全一个工具函数。
GPT-4.1 在复杂泛型上的表现一直不错,这次也是,类型推断完全正确。Claude 4.5 也给出了正确实现,但用了一个更保守的写法(显式类型断言),略繁琐。DeepSeek V3 的类型推断出现了一处错误,运行时没问题但 tsc 会报 warning。
纯 TypeScript 类型体操,GPT-4.1 略胜。
成本对比(这才是大多数人最关心的)
测完功能,算一下钱。下面是基于官方定价和无量 Api SVIP 价格的对比:
| 模型 | 官方输入价(/M tokens) | 官方输出价(/M tokens) | 无量 Api SVIP 输入 | 无量 Api SVIP 输出 |
|------|------------------------|------------------------|--------------------|--------------------|
| Claude Sonnet 4.5 | ¥21 | ¥105 | ¥7.5 | ¥37.5 |
| GPT-4.1 | ¥14 | ¥56 | ¥5.0 | ¥20.0 |
| DeepSeek V3 | ¥2 | ¥8 | ¥0.7 | ¥2.8 |
假设一个中等强度的开发者每月消耗 5M 输入 + 2M 输出:
| 模型 | 官方月费 | 无量 Api SVIP 月费 | 节省 |
|------|----------|--------------------|------|
| Claude Sonnet 4.5 | ¥315 | ¥112.5 | ¥202.5 |
| GPT-4.1 | ¥182 | ¥65 | ¥117 |
| DeepSeek V3 | ¥26 | ¥9.1 | ¥16.9 |
DeepSeek 本身就便宜,差价不大。但 Claude 和 GPT 的差价相当可观,用量越大越明显。
综合结论
| 场景 | 推荐模型 |
|------|----------|
| 代码 debug + 解释 | Claude Sonnet 4.5 |
| TypeScript 类型推断 | GPT-4.1 |
| 长文档理解 | Claude Sonnet 4.5 |
| 数学推理(展示过程) | Claude Sonnet 4.5 |
| 高频低成本任务 | DeepSeek V3 |
| 综合性价比 | DeepSeek V3(便宜)或 Claude 4.5(通过 API 中转降价后) |
没有哪个模型全赢,也没有哪个全输。DeepSeek V3 在成本敏感场景下几乎无敌,Claude 4.5 在需要解释和长文本的场景里最可靠,GPT-4.1 在复杂类型系统里有优势。
实际使用建议:主力用 DeepSeek V3 跑量,遇到 DeepSeek 搞不定的再切 Claude 4.5,不要无脑只用一个模型。
关于访问问题
国内直连 OpenAI / Claude / Gemini 是个老大难问题,自己搭代理不稳定,而且 Claude 的 API 本来就限制国内 IP。
我现在用的是无量 Api,300+ 模型国内直连,改一行 base_url 就行,OpenAI SDK 格式完全兼容,注册还送 ¥1 余额(永久有效,不是限时)。价格是官方的 7.7 折起,Claude Sonnet 4.5 的 SVIP 价比上面算的还要低。
Zhihu 看到这篇的:https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb
V2EX 看到这篇的:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb