Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
最近 V2EX 上关于 Codex 额度莫名缩水、GPT-5.5 上下文突然变 258K 的帖子刷屏,加上 Grok 4 横空出世,大家对"到底用哪个模型"的讨论越来越多。
我花了三天时间,用同一批测试任务跑了 Claude Sonnet 4.5、GPT-5、DeepSeek V3 这三个当前最具代表性的模型,尽量给出一个不偏袒的横评。
测试环境说明
- 统一用 API 调用,排除 UI 差异
- 每个场景跑 3 次取中位结果
- 温度统一设 0.3,保证可复现性
- 成本按 token 实际消耗计算
场景一:代码补全与 Bug 定位
测试任务:给一段有竞态条件的 Python 异步代码,要求找出 bug 并给出修复方案。
# 有问题的代码(简化版)
async def fetch_all(urls):
results = []
for url in urls:
result = await fetch(url)
results.append(result) # 竞态隐患在更复杂的版本里
return results
实际测试用的是更复杂的版本,涉及共享状态和锁的误用。
| 模型 | 是否定位到根因 | 修复方案质量 | 响应速度 |
|------|--------------|------------|--------|
| Claude Sonnet 4.5 | ✅ 精准 | 给出了 3 种方案并分析取舍 | 中等 |
| GPT-5 | ✅ 精准 | 给出 2 种方案,解释详细 | 较快 |
| DeepSeek V3 | ⚠️ 找到了但描述模糊 | 1 种方案,可用 | 最快 |
小结:代码理解上 Claude 4.5 和 GPT-5 旗鼓相当,Claude 的方案更有"工程师视角",会主动讨论方案的适用场景。DeepSeek V3 速度快但深度稍欠。
场景二:长文理解与信息抽取
测试任务:喂入一份 60 页的技术规范 PDF(转文本约 80K tokens),要求抽取所有接口定义并整理成表格。
| 模型 | 上下文窗口 | 抽取准确率 | 遗漏数量(共 47 个接口) |
|------|----------|----------|----------------------|
| Claude Sonnet 4.5 | 200K | 97.8% | 遗漏 1 个 |
| GPT-5 | 128K(实测) | 95.7% | 遗漏 2 个 |
| DeepSeek V3 | 64K | 文档超限,分段处理 | 遗漏 4 个 |
注:GPT-5.5 最近被反映上下文缩到 258K,GPT-5 这里实测有效处理约 128K,长文场景下 Claude 4.5 的 200K 窗口优势明显。
场景三:数学推理
测试任务:一道竞赛级组合数学题 + 一道需要多步推导的概率题。
| 模型 | 组合题(满分 10) | 概率题(满分 10) | 推导过程可读性 |
|------|----------------|----------------|-------------|
| Claude Sonnet 4.5 | 9 | 8 | 高,步骤清晰 |
| GPT-5 | 10 | 9 | 高,但有时跳步 |
| DeepSeek V3 | 8 | 7 | 中,偶有逻辑跳跃 |
数学推理 GPT-5 略占优,但差距不大。DeepSeek V3 在这个维度上和前两者有可感知的差距。
场景四:中文长文写作
测试任务:写一篇 2000 字的技术博客,主题是"微服务拆分的时机判断",要求有观点、有案例、不能是 AI 味的废话。
这个场景主观性强,我找了 3 个同事盲测打分(1-10 分):
| 模型 | 平均分 | 主要评价 |
|------|------|--------|
| Claude Sonnet 4.5 | 8.2 | 结构好,观点有层次,案例真实 |
| GPT-5 | 7.8 | 内容扎实,但偶有"AI 腔" |
| DeepSeek V3 | 7.1 | 中规中矩,缺少锐度 |
中文写作 Claude 4.5 表现最好,这和它训练数据的特点有关。
成本对比:这才是关键
跑完这些测试,我把 token 消耗和价格算了一遍。以下是官方价格 vs 通过无量Api(SVIP)的实际价格:
| 模型 | 官方输入价 | 官方输出价 | 无量Api SVIP 输入 | 无量Api SVIP 输出 |
|------|----------|----------|-----------------|-----------------|
| Claude Sonnet 4.5 | ¥21/M tokens | ¥105/M tokens | ¥7.5/M | ≈¥37/M |
| GPT-5 | ¥54/M tokens | ¥216/M tokens | ≈¥19/M | ≈¥76/M |
| DeepSeek V3 | ¥2/M tokens | ¥8/M tokens | ¥0.7/M | ≈¥2.8/M |
以我这次测试的实际消耗(约 500K input + 100K output tokens)为例:
| 模型 | 官方总费用 | 无量Api SVIP 总费用 | 节省 |
|------|----------|-------------------|-----|
| Claude Sonnet 4.5 | ≈¥21 | ≈¥7.5 | 64% |
| GPT-5 | ≈¥49 | ≈¥17 | 65% |
| DeepSeek V3 | ≈¥1.8 | ≈¥0.65 | 64% |
如果你是重度 API 用户,每月消耗在 50M tokens 以上,这个差价相当可观。
综合结论
没有"最好的模型",只有"最适合场景的模型":
- 代码 + 工程任务:Claude Sonnet 4.5 和 GPT-5 都很强,Claude 更擅长分析取舍,GPT-5 速度更快
- 超长文档处理:Claude Sonnet 4.5,200K 上下文是实打实的优势
- 数学推理:GPT-5 略优
- 中文写作:Claude Sonnet 4.5
- 成本敏感 / 高并发:DeepSeek V3,性价比无敌,够用就好
如果让我选一个日常主力:Claude Sonnet 4.5,综合表现最均衡,中文理解也好。GPT-5 作为备用,数学和代码场景切换过去。DeepSeek V3 跑批量任务、做数据处理,省钱省心。
关于 API 接入成本
上面的价格对比基于无量Api的 SVIP 档位(7.7 折)。它支持国内直连,OpenAI 格式兼容,换个 Base URL 就能用,300+ 模型统一入口。注册送 ¥1,余额永久不过期,适合先试试再决定要不要充值。
V2EX 版推广链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb