Claude 4.5 vs GPT-5 vs Gemini 2.5 Flash:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs Gemini 2.5 Flash:用同一批任务测了三天
最近 V2EX 上有人问 Claude 降智的事,也有人在讨论 GPT-5 的表现,Gemini 2.5 Flash 在 HN 上也刚刚引发了一波讨论。正好手头有几个真实项目场景,就系统测了一轮,把结果整理出来。
测试时间:2025 年 7 月,模型版本以当时 API 返回为准。
测试阵容
| 模型 | 定位 | 官方输入价(/M tokens) | 官方输出价(/M tokens) |
|------|------|------------------------|------------------------|
| Claude Sonnet 4.5 | 综合旗舰 | $3(约 ¥21) | $15(约 ¥108) |
| GPT-5 | OpenAI 旗舰 | $10(约 ¥72) | $40(约 ¥288) |
| Gemini 2.5 Flash | 速度/价格均衡 | $0.15(约 ¥1.1) | $0.60(约 ¥4.3) |
价格以官方公开定价为准,汇率按 7.2 折算。
场景一:复杂 Bug 定位
任务描述:给一段 Python 异步代码,里面有一个 race condition,表现为偶发性数据丢失,没有明显报错。
# 简化版问题代码
async def process_batch(items):
results = []
async def worker(item):
result = await fetch_data(item)
results.append(result) # 问题在这里
await asyncio.gather(*[worker(i) for i in items])
return results
结果对比:
| 模型 | 是否定位到 race condition | 给出修复方案 | 解释质量 |
|------|--------------------------|-------------|---------|
| Claude Sonnet 4.5 | ✅ 直接指出 list.append 非线程安全 | 给出 asyncio.Queue 和锁两种方案 | 详细,解释了 GIL 在异步场景下的局限 |
| GPT-5 | ✅ 定位准确 | 给出 asyncio.Lock 方案 | 清晰,但没有主动提供备选方案 |
| Gemini 2.5 Flash | ⚠️ 提到了并发问题,但描述不够精准 | 给出了修复,但解释偏浅 | 够用,不够深 |
小结:代码调试场景,Claude 和 GPT-5 旗鼓相当,Gemini Flash 作为轻量模型有明显差距,但速度快很多。
场景二:长文档理解(40k tokens)
任务描述:上传一份 40k tokens 的技术规范文档,提问其中三处相互矛盾的条款,要求模型找出矛盾并给出建议。
| 模型 | 找出矛盾数量 | 建议质量 | 响应速度 |
|------|------------|---------|---------|
| Claude Sonnet 4.5 | 3/3 | 逻辑清晰,给出了修订建议 | 中等 |
| GPT-5 | 2/3 | 找到两处,第三处漏掉了 | 较快 |
| Gemini 2.5 Flash | 3/3 | 找全了,但建议较简略 | 最快 |
小结:长文理解上 Claude 和 Gemini 表现更稳,GPT-5 有漏检。Gemini 的长上下文处理速度优势明显。
场景三:数学推理(竞赛级)
任务描述:一道组合数学题,需要分步推导,最终给出证明过程。
| 模型 | 最终答案 | 推导过程 | 是否有跳步 |
|------|---------|---------|----------|
| Claude Sonnet 4.5 | ✅ 正确 | 完整,分步清晰 | 无 |
| GPT-5 | ✅ 正确 | 完整 | 有一处轻微跳步 |
| Gemini 2.5 Flash | ❌ 答案错误 | 过程有逻辑漏洞 | 有 |
小结:严肃数学推理不要用 Flash 系列,旗舰模型差距明显。
场景四:代码补全(日常开发)
任务描述:给一个 React 组件的骨架,要求补全带防抖的搜索功能,包含 loading 状态和错误处理。
这个场景三个模型都能完成,差异主要在:
- Claude 4.5:代码风格最接近现代 React 实践,自动用了
useCallback优化,没有多余注释 - GPT-5:功能完整,但加了很多防御性注释,有点啰嗦
- Gemini 2.5 Flash:代码可用,但没有主动处理竞态条件(快速连续输入时的请求取消)
成本对比:同样的任务,花多少钱
假设每天调用 API 处理 100 个上述复杂任务,每次平均消耗 2000 tokens 输入 + 1000 tokens 输出:
月成本估算(100次/天 × 30天):
| 模型 | 官方价(月) | 无量Api SVIP 价(月) | 节省 |
|------|------------|---------------------|------|
| Claude Sonnet 4.5 | 输入 ¥126 + 输出 ¥324 = ¥450 | 输入 ¥45 + 输出 ¥116 = ¥161 | ¥289 |
| GPT-5 | 输入 ¥432 + 输出 ¥1728 = ¥2160 | 约 ¥770 | ¥1390 |
| Gemini 2.5 Flash | 输入 ¥6.5 + 输出 ¥19.4 = ¥26 | 约 ¥9 | ¥17 |
无量Api SVIP 价:Claude Sonnet 4.5 输入 ¥7.5/M、输出 ¥26/M;GPT-5 按 7.7 折计算。
Gemini Flash 本来就便宜,节省绝对值不大;但 Claude 和 GPT-5 的差距非常显著,尤其是 GPT-5 输出价格极高,长对话场景下费用会快速累积。
综合结论
选 Claude Sonnet 4.5:代码调试、长文档分析、需要细致解释的场景。上下文理解和表达质量目前仍是最均衡的。
选 GPT-5:对 OpenAI 生态有依赖(Assistants API、Function Calling 等),或者需要最新工具集成的场景。但要注意输出成本,长对话会很贵。
选 Gemini 2.5 Flash:高并发、对延迟敏感、预算有限的场景。长上下文处理速度是真的快,适合做文档处理流水线。
没有哪个模型在所有场景都碾压其他,根据任务选模型比死守一个更实际。
关于 API 成本
国内直连这几个模型,官方渠道要么需要境外信用卡,要么延迟高,要么价格没有优势。
我目前用的是 无量Api,支持 300+ 模型,OpenAI 格式兼容,改一行 Base URL 就能切换,注册送 ¥1 可以直接试。SVIP 价格是官方的 7.7 折,Claude Sonnet 4.5 输入只要 ¥7.5/M,余额永久有效不会过期。
如果你在做 API 成本优化,可以先注册试试,对比一下实际出账。
以上测试基于真实任务场景,模型表现会随版本更新变化,仅供参考。