横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论出乎意料

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了三天,结论出乎意料

最近 V2EX 上关于 Codex 额度、日区订阅、中转站的讨论很多,大家都在想一个问题:手头的 API 预算怎么花才值?

趁这个机会,我用同一套测试任务,把目前最热的三个模型跑了一遍:Claude Sonnet 4.5、GPT-4.1、DeepSeek V3。不谈玄学,只看实际表现和真实成本。


测试设计

五个场景,尽量贴近日常开发和内容工作:

1. Bug 定位:一段有隐藏竞态条件的 Python 异步代码

2. 代码补全:给半截 React Hook 续写,要求类型完整、有边界处理

3. 长文理解:一份 8000 字的技术文档,问 5 个细节问题

4. 数学推理:组合数学题 + 一道需要构造反例的证明题

5. 成本估算:按实际 token 消耗算一个月 API 账单


场景 1:Bug 定位(竞态条件)

测试代码是一个 asyncio + aiofiles 混用的文件写入逻辑,问题藏在锁的作用域外有一次隐式读取。

Claude Sonnet 4.5:直接指出竞态窗口在第 17 行和第 23 行之间,给出了加锁范围的修改建议,还顺手提了一句"如果用 asyncio.Lock 替代 threading.Lock 会更安全"。定位准确,解释清楚。

GPT-4.1:找到了主要问题,但给的修复方案把锁的粒度搞太粗了,会导致性能下降。需要追问一次才给出更精细的版本。

DeepSeek V3:第一次回答漏掉了竞态窗口,指出的是一个不相关的变量命名问题。追问后找到了,但解释不如 Claude 清晰。

小结:代码调试场景,Claude 4.5 > GPT-4.1 > DeepSeek V3

场景 2:React Hook 补全

给了一个半成品 useDebounce Hook,要求补全泛型、处理 cleanup、加 TypeScript 类型。

GPT-4.1:补出来的代码直接能用,泛型约束合理,cleanup 用 useEffect 返回函数处理得很干净。

Claude Sonnet 4.5:代码质量差不多,但多给了一个使用示例,还提示了一个常见误用场景(在渲染函数内直接传匿名函数导致 debounce 失效)。

DeepSeek V3:基本功能完整,但泛型写得比较宽松,没有约束到 unknown 以上,生产环境用可能有隐患。

小结:日常代码补全,三者都够用。GPT-4.1 和 Claude 4.5 更适合生产级代码。

场景 3:长文理解(8000 字技术文档)

文档是一份 Kubernetes 网络策略的设计文档,5 个问题里有两个答案藏在不显眼的脚注里。

Claude Sonnet 4.5:5 题全对,脚注里的细节也没漏。回答引用了原文段落,方便核对。

GPT-4.1:4 题对,脚注里的一个细节答错了,把默认值说反了。

DeepSeek V3:3 题对,有两个问题给出了听起来合理但实际不准确的答案,属于典型的"自信地错"。长文档场景需要多做核对。

小结:长文理解,Claude 4.5 明显更稳。DeepSeek V3 在长上下文准确性上还有差距。

场景 4:数学推理

两道题:一道排列组合(难度中等),一道需要构造反例的图论命题。

DeepSeek V3:排列组合题秒出,步骤清晰;图论反例构造也给出了正确答案,是三个里面数学最强的。

Claude Sonnet 4.5:两题都对,但图论那题绕了一点,中间有一步化简不够简洁。

GPT-4.1:排列组合正确,图论反例的构造思路对但写法有歧义,需要澄清。

小结:纯数学推理,DeepSeek V3 > Claude 4.5 ≈ GPT-4.1

场景 5:成本对比(这才是重点)

按中等使用量估算:每天 200 次调用,平均每次输入 1000 token、输出 500 token,跑满一个月(30 天)。

官方价格

| 模型 | 输入价格 | 输出价格 | 月成本估算 |

|------|----------|----------|------------|

| Claude Sonnet 4.5 | $3 / M token | $15 / M token | ≈ ¥162 |

| GPT-4.1 | $2 / M token | $8 / M token | ≈ ¥105 |

| DeepSeek V3 | $0.27 / M token | $1.1 / M token | ≈ ¥13 |

汇率按 7.3,官方价格截至写稿时。

DeepSeek V3 的价格优势是碾压级的,这也是它能出现在这篇横评里的核心原因。

通过无量Api(SVIP 7.7折)

| 模型 | 无量Api 输入价 | 无量Api 输出价 | 月成本估算 |

|------|----------------|----------------|------------|

| Claude Sonnet 4.5 | ¥21 / M → SVIP ¥7.5/M | 同比例折扣 | ≈ ¥49 |

| GPT-4.1 | 官方折扣约 65% off | 同比例 | ≈ ¥37 |

| DeepSeek V3 | 本身已很低 | — | ≈ ¥9 |

国内直连,不用折腾代理,注册送 ¥1 可以直接跑几百次测试,余额永久不过期。


综合评分

| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |

|------|:-----------------:|:-------:|:-----------:|

| 代码调试 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 代码补全 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |

| 性价比 | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |


结论:怎么选?

  • 主力用 Claude Sonnet 4.5:如果你的场景是代码审查、技术文档、复杂指令跟随,Claude 4.5 目前是质量天花板,在无量Api上的 SVIP 价格让它的性价比从"用不起"变成了"可以日常用"。
  • GPT-4.1 适合工程化场景:工具调用、结构化输出、函数调用稳定性上 GPT-4.1 体验更可预测,适合做 agent 底座。
  • DeepSeek V3 是预算首选:数学、代码初稿、批量处理,在价格面前大部分差距都可以接受。如果你在做成本敏感的产品,DeepSeek V3 + 偶尔用 Claude 核对是个合理策略。

没有绝对的"最好",只有最合适当前任务和预算的那个。


附:国内访问这三个模型的方式

直接调官方 API 在国内需要代理,而且 Claude 的官方渠道对国内账号限制越来越严。

我现在用的是无量Api,300+ 模型国内直连,格式和 OpenAI 完全兼容,改一行 base_url 就能切过去。注册有 ¥1 余额可以先跑测试,余额没有有效期,不用担心过期浪费。

V2EX 版链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb