Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
最近 AI 社区讨论度最高的几个模型同期在线,正好花了三天用相同的任务集跑了一遍横评。测试场景覆盖日常开发中最高频的几类需求,结论写在最后,先看数据。
测试模型
| 模型 | 版本 | 备注 |
|------|------|------|
| Claude Sonnet 4.5 | 2025-06 | Anthropic 最新主力 |
| GPT-5 | 2025-05 | OpenAI 旗舰 |
| DeepSeek V3 | 0324 | 国产开源最强 |
场景一:代码 Bug 定位与修复
任务:给一段 300 行的 Python 异步爬虫,里面藏了三个 bug:一个竞态条件、一个内存泄漏、一个错误的异常处理逻辑。要求模型找出并修复。
Claude 4.5:三个 bug 全找到。对竞态条件的解释最清楚,直接给出了加锁的具体位置和原因,还顺带指出一个潜在的 session 复用问题(题目里没有的)。修复后的代码可以直接跑。
GPT-5:找到了竞态和异常处理两个,内存泄漏漏掉了。代码风格改动比较大,加了不少类型注解,有人喜欢有人不喜欢。
DeepSeek V3:三个都找到了,解释稍短,但修复方案是三者里最保守(改动最小)的,对存量代码友好。
小结:代码理解深度 Claude 4.5 ≥ DeepSeek V3 > GPT-5,这一场。
场景二:长文档理解(10 万字技术文档问答)
任务:上传一份约 10 万 token 的英文 API 文档,连问 10 个问题,包括细节查找、跨章节推理、矛盾点识别。
Claude 4.5:全部 10 个问题回答准确,其中两个矛盾点都找出来了,并且给出了页码定位(章节号)。长文档是 Claude 系列的传统强项,这次没让人失望。
GPT-5:9/10,有一个跨章节推理题答偏了,把两个相似的 API 参数混淆了。总体来说 GPT-5 在长上下文上比 GPT-4o 有明显进步。
DeepSeek V3:7/10,在超长上下文下注意力有些衰减,靠近文档末尾的细节问题容易答错。但考虑到它的价格,这个表现已经很能打了。
小结:长文理解 Claude 4.5 > GPT-5 > DeepSeek V3。
场景三:数学推理(竞赛级别)
任务:10 道题,混合高中竞赛数学和基础数论,要求给出完整推导过程。
| 模型 | 正确题数 | 推导完整性 |
|------|----------|------------|
| GPT-5 | 9/10 | 步骤最详细,接近教材风格 |
| Claude 4.5 | 8/10 | 过程清晰,偶有跳步 |
| DeepSeek V3 | 8/10 | 中文数学术语准确,对国内用户友好 |
小结:数学推理 GPT-5 略领先,Claude 4.5 和 DeepSeek V3 基本持平。
场景四:多轮对话上下文保持
任务:模拟一个 20 轮的需求讨论,中间故意修改早期决策,测试模型是否能一致地跟踪变化。
Claude 4.5:对上下文变更最敏感,会主动确认"你在第 5 轮提到的 X,现在改成 Y 了对吗",减少了很多隐性错误。
GPT-5:总体稳定,但在第 15 轮之后对早期细节的引用开始出现一两处不一致。
DeepSeek V3:10 轮以内表现很好,超过 15 轮后有明显的上下文漂移。
小结:多轮一致性 Claude 4.5 > GPT-5 > DeepSeek V3。
最重要的一张表:实际成本对比
测了三天,最后算了一下不同使用量下的费用差异。以下是官方渠道 vs 无量Api(SVIP 7.7 折)的真实价格对比:
| 模型 | 官方输入价(/M token) | 官方输出价(/M token) | 无量Api SVIP 输入 | 无量Api SVIP 输出 |
|------|------------------------|------------------------|-------------------|-------------------|
| Claude Sonnet 4.5 | ¥21 | ¥105 | ¥7.5 | ¥37.8 |
| GPT-5 | ¥54 | ¥216 | ¥19.4 | ¥77.8 |
| DeepSeek V3 | ¥2 | ¥8 | ¥0.72 | ¥2.88 |
以一个中等规模的开发团队为例,每天消耗约 5M token(Claude Sonnet 4.5 为主),一个月下来:
- 官方渠道:5M × 30 × (¥21 + ¥105) / 2 ≈ ¥9,450(按输入输出各半估算)
- 无量Api SVIP:同等用量 ≈ ¥3,402
差价直接拿去买服务器了。
综合评分
| 维度 | Claude 4.5 | GPT-5 | DeepSeek V3 |
|------|-----------|-------|-------------|
| 代码理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 长文档 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 多轮对话 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 性价比 | 中 | 低 | 高 |
结论
没有全能冠军。
如果你的业务是长文档处理、代码审查、复杂多轮对话,Claude 4.5 目前是最稳的选择。如果是数学推理或需要 OpenAI 生态深度集成,GPT-5 更合适。如果预算有限但需求量大,DeepSeek V3 的性价比目前没有对手。
实际生产中,很多团队是混用的——大模型做规划和审查,DeepSeek 跑批量任务,成本能压下来不少。
以上测试全程通过 无量Api 调用,国内直连无需代理,三个模型切换只需要改 model 参数,Base URL 统一,账单也统一。注册送 ¥1 余额,拿来跑跑上面这几个测试场景刚好够,余额永久有效不用担心过期。
V2EX 版推广链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb