横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

最近 V2EX 上关于模型选型的讨论越来越多,有人说 GPT-5 出来之后其他模型都可以退休了,也有人说 DeepSeek V3 性价比无敌根本不需要换。我花了三天时间,用同一套任务跑了 Claude Sonnet 4.5、GPT-5、DeepSeek V3 这三个当前最热门的模型,尽量给出一个相对客观的横评。


测试方法说明

  • 每个场景同一 prompt,三个模型各跑 3 次取平均印象
  • 不做 benchmark 刷分,只看实际使用感受
  • 成本按各平台官方 API 定价计算,同时附上通过中转 API 的实际价格
  • 测试时间:2025 年 7 月

场景一:代码调试(一个真实 Bug)

任务:给一段 Python 异步代码,里面有一个 asyncio.gather 的竞态条件 bug,要求找出问题并修复。

| 模型 | 是否定位到根因 | 修复质量 | 解释清晰度 |

|------|--------------|---------|-----------|

| Claude Sonnet 4.5 | ✅ 精准 | 给出了两种修复方案 | 非常详细,解释了为什么会出现竞态 |

| GPT-5 | ✅ 精准 | 直接给修复代码 | 简洁,但少了一些背景解释 |

| DeepSeek V3 | ⚠️ 找到了但描述模糊 | 修复可用,但不够优雅 | 解释偏表面 |

小结:代码调试场景 Claude 4.5 表现最好,GPT-5 紧随其后。DeepSeek V3 能用,但如果你需要真正理解 bug 原因,它给的解释不够深。


场景二:长文档理解(40 页 PDF 内容)

任务:把一份 40 页的技术规范文档(约 6 万字)喂进去,问 5 个需要跨章节推理的问题。

| 模型 | 上下文窗口 | 跨章节推理 | 幻觉率(主观评估) |

|------|-----------|-----------|-----------------|

| Claude Sonnet 4.5 | 200K | 优秀,能准确引用章节 | 低 |

| GPT-5 | 128K | 良好,偶尔混淆细节 | 中低 |

| DeepSeek V3 | 64K | 文档太长直接截断,部分问题答不上 | 中 |

小结:长文档场景 Claude 4.5 有明显优势,200K 上下文加上它对文档结构的理解能力,几乎没有出现"我不知道文档里有没有提到"的情况。DeepSeek V3 在这个场景下受限于上下文窗口,不太适合。


场景三:数学推理(竞赛级别题目)

任务:5 道 AMC/AIME 难度的数学题,要求给出完整推导过程。

| 模型 | 正确率 | 推导过程完整性 | 是否会"算错但逻辑对" |

|------|--------|--------------|-------------------|

| Claude Sonnet 4.5 | 3/5 | 完整 | 偶尔 |

| GPT-5 | 4/5 | 完整 | 少见 |

| DeepSeek V3 | 4/5 | 完整 | 偶尔 |

小结:纯数学推理这个场景 GPT-5 和 DeepSeek V3 打平,Claude 4.5 略逊一筹。如果你的主要用途是数学/科学计算,GPT-5 或 DeepSeek V3 更合适。


场景四:中文写作与润色

任务:把一段技术文档翻译成适合普通用户阅读的中文,并润色语气。

| 模型 | 中文流畅度 | 技术准确性 | 语气调整能力 |

|------|-----------|-----------|------------|

| Claude Sonnet 4.5 | 优秀 | 高 | 强,能准确理解"面向普通用户"的要求 |

| GPT-5 | 优秀 | 高 | 强 |

| DeepSeek V3 | 良好 | 高 | 中,有时语气调整不够自然 |

小结:中文写作场景 Claude 4.5 和 GPT-5 基本持平,DeepSeek V3 技术准确但语感稍弱。


成本对比:这才是很多人真正关心的

测试下来三个模型各有擅长,但选模型不能只看能力,成本同样关键。以下是官方 API 定价和通过 无量Api 的实际价格对比:

| 模型 | 官方输入价(/M tokens) | 官方输出价(/M tokens) | 无量Api SVIP 输入价 | 无量Api SVIP 输出价 |

|------|----------------------|----------------------|-------------------|-------------------|

| Claude Sonnet 4.5 | ¥21 | ¥105 | ¥7.5 | ¥37.5 |

| GPT-5 | ¥54 | ¥216 | ¥19 | ¥76 |

| DeepSeek V3 | ¥2 | ¥8 | ¥0.7 | ¥2.8 |

以一个中等规模的应用为例,每天调用 Claude Sonnet 4.5 消耗约 500 万 tokens(输入+输出混合),官方价格大约 ¥630/天,通过无量Api SVIP 大约 ¥225/天,一个月能省接近 ¥1.2 万。

DeepSeek V3 本身就便宜,但如果你需要同时接入多个模型做路由或降级策略,统一走一个 OpenAI 格式兼容的接口会省很多工程成本。


综合结论

| 使用场景 | 推荐模型 | 理由 |

|---------|---------|------|

| 代码调试 / 代码生成 | Claude Sonnet 4.5 | 解释最清晰,方案最完整 |

| 长文档处理 | Claude Sonnet 4.5 | 200K 上下文,跨章节推理强 |

| 数学 / 科学推理 | GPT-5 或 DeepSeek V3 | 准确率更高 |

| 成本敏感型应用 | DeepSeek V3 | 性价比无敌,能力够用 |

| 中文内容生产 | Claude 4.5 / GPT-5 | 语感更自然 |

没有一个模型全场景最优,实际项目里做模型路由(简单任务走 DeepSeek V3,复杂任务走 Claude 4.5)才是最省钱的方案。


关于国内访问和成本问题

上面提到的价格差距,来自 无量Api。它支持国内直连 OpenAI、Claude、Gemini、DeepSeek 等 300+ 模型,接口完全兼容 OpenAI 格式,换一行 base_url 就能接入,不需要改任何业务代码。

注册就送 ¥1 余额,余额永久有效,可以先跑几个测试任务感受一下价格差距再决定要不要充值。

V2EX 版推广链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb