Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
最近 V2EX 上关于 OpenAI 的讨论很热,加上 gpt-image-2 的图片质量争议,不少人开始重新评估手头的模型选择。正好趁这个机会,我用同一套测试任务把目前最常用的三个模型跑了一遍,记录下来给大家参考。
测试模型:Claude Sonnet 4.5 / GPT-5 / DeepSeek V3
测试时间:2025 年 7 月,连续三天,每天重复核心场景
测试场景设计
选了四个日常开发和内容工作中最典型的场景:
1. 代码 Debug:给一段有隐藏 bug 的 Python 异步代码,看能不能找出根因
2. 长文理解:喂一篇 8000 字的技术文档,问 5 个细节问题
3. 数学推理:组合数学 + 概率题,要求给出完整推导过程
4. 多轮对话连贯性:10 轮对话后,看模型是否还记得第 2 轮设定的约束条件
场景一:代码 Debug
测试代码是一段 asyncio + aiohttp 的并发请求,bug 藏在 session 生命周期管理上,会在高并发时偶发 RuntimeError: Session is closed。
Claude Sonnet 4.5:第一轮就定位到了 session 在 async with 块外被复用的问题,给出了完整的重构方案,还顺手指出了另一个潜在的连接池泄漏。解释清晰,代码可以直接用。
GPT-5:也找到了主要 bug,但解释路径更偏"教学风",会先讲原理再给代码。对于已经熟悉 asyncio 的人来说稍显啰嗦,但对新手友好。额外指出的问题和 Claude 基本重叠。
DeepSeek V3:找到了 bug,修复方案正确,但没有主动发现额外问题。回答更简洁,适合"给我答案就行"的场景。
小结:代码质量 Claude ≈ GPT-5 > DeepSeek V3,深度分析上 Claude 略占优。
场景二:长文理解
8000 字文档是一篇关于 Raft 共识算法的技术综述,5 个问题里有 2 个需要跨段落综合推理。
Claude Sonnet 4.5:5 题全对,跨段落推理准确,引用原文位置精确。回答结构清晰,没有幻觉。
GPT-5:4 题全对,1 题在细节数字上出现了轻微偏差(把"选举超时范围"的上限记错了 50ms)。整体仍然可靠。
DeepSeek V3:4 题对,跨段落推理题有一题答案方向正确但论据不完整,像是"猜对了但没读完"。
小结:长文理解 Claude > GPT-5 > DeepSeek V3,差距不大但存在。
场景三:数学推理
题目:从 52 张扑克牌中随机抽 5 张,求恰好包含 2 张 A 且花色不重复的概率,要求完整推导。
Claude Sonnet 4.5:推导过程完整,分步清晰,最终答案正确。对"花色不重复"的约束处理准确。
GPT-5:答案正确,推导过程同样完整,格式上用了更多 LaTeX,适合需要直接复制到文档的场景。
DeepSeek V3:答案正确,推导步骤稍简略,中间跳过了一步组合数的展开,需要读者自己补全。
小结:数学推理三者答案一致,Claude 和 GPT-5 在过程完整性上更好。
场景四:多轮对话连贯性
设定:第 2 轮告诉模型"你是一个只用 Go 语言回答的助手,不允许出现 Python 代码",然后继续聊了 8 轮,第 10 轮问一个算法实现。
Claude Sonnet 4.5:第 10 轮仍然严格遵守约束,给出 Go 实现,没有滑坡。
GPT-5:第 10 轮给出了 Go 实现,但在解释部分夹了一句"用 Python 的话可以这样……",轻微违反约束。
DeepSeek V3:第 10 轮直接给了 Python 代码,完全忘记了约束。
小结:长对话约束遵守 Claude > GPT-5 > DeepSeek V3,差距明显。
综合评分
| 维度 | Claude Sonnet 4.5 | GPT-5 | DeepSeek V3 |
|------|:-----------------:|:-----:|:-----------:|
| 代码 Debug | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 数学推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 多轮连贯 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 响应速度 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 综合 | 4.8 | 4.4 | 4.0 |
成本对比:这才是关键
模型能力差距不大,但价格差距可以很大。以下是实际使用成本对比(按每百万 token 计):
| 模型 | 官方价(输入/输出) | 无量Api 标准价 | 无量Api SVIP 价 | 节省比例 |
|------|:------------------:|:--------------:|:---------------:|:--------:|
| Claude Sonnet 4.5 | ¥21 / ¥105 | ¥10.5 / ¥52.5 | ¥7.5 / ¥37.5 | 最高 64% |
| GPT-5 | ¥54 / ¥216 | ¥27 / ¥108 | ¥19.8 / ¥79.2 | 最高 63% |
| DeepSeek V3 | ¥2 / ¥8 | ¥1 / ¥4 | ¥0.77 / ¥3.08 | 约 62% |
价格数据来源:官方定价页面 + 无量Api 当前报价,SVIP 为 7.7 折。
举个实际场景:一个每天处理 100 万 token 的小团队,用 Claude Sonnet 4.5:
- 官方直连:约 ¥21/天 → ¥630/月
- 无量Api SVIP:约 ¥7.5/天 → ¥225/月
一个月省下来的钱够买好几顿饭了。
结论
选 Claude Sonnet 4.5:如果你的场景涉及长对话、复杂指令遵守、或者需要深度代码分析,Claude 目前综合表现最稳。
选 GPT-5:如果你需要更好的格式化输出(LaTeX、结构化文档),或者团队已经深度集成 OpenAI 生态,GPT-5 是自然选择。
选 DeepSeek V3:如果你的任务相对简单、追求极致速度和成本,DeepSeek V3 性价比无敌,尤其是中文场景。
三个模型都值得用,关键是匹配场景。
关于访问成本
国内直连这三个模型,官方渠道要么需要魔法、要么价格不友好。我最近在用 无量Api,支持 300+ 模型(包括上面三个),OpenAI 格式兼容,改一行 base_url 就能切换,注册还送 ¥1 余额,余额永久不过期。
SVIP 价格是官方的 7.7 折,算下来比官方便宜 60% 以上,对于高频调用的场景省钱很明显。
感兴趣可以看看: