横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天

最近 V2EX 上关于 Codex 额度莫名缩水、GPT-5.5 上下文突然变 258K 的帖子刷屏,加上 Grok 4 横空出世,大家对"到底用哪个模型"的讨论越来越多。

我花了三天时间,用同一批测试任务跑了 Claude Sonnet 4.5、GPT-5、DeepSeek V3 这三个当前最具代表性的模型,尽量给出一个不偏袒的横评。


测试环境说明

  • 统一用 API 调用,排除 UI 差异
  • 每个场景跑 3 次取中位结果
  • 温度统一设 0.3,保证可复现性
  • 成本按 token 实际消耗计算

场景一:代码补全与 Bug 定位

测试任务:给一段有竞态条件的 Python 异步代码,要求找出 bug 并给出修复方案。


# 有问题的代码(简化版)

async def fetch_all(urls):

    results = []

    for url in urls:

        result = await fetch(url)

        results.append(result)  # 竞态隐患在更复杂的版本里

    return results

实际测试用的是更复杂的版本,涉及共享状态和锁的误用。

| 模型 | 是否定位到根因 | 修复方案质量 | 响应速度 |

|------|--------------|------------|--------|

| Claude Sonnet 4.5 | ✅ 精准 | 给出了 3 种方案并分析取舍 | 中等 |

| GPT-5 | ✅ 精准 | 给出 2 种方案,解释详细 | 较快 |

| DeepSeek V3 | ⚠️ 找到了但描述模糊 | 1 种方案,可用 | 最快 |

小结:代码理解上 Claude 4.5 和 GPT-5 旗鼓相当,Claude 的方案更有"工程师视角",会主动讨论方案的适用场景。DeepSeek V3 速度快但深度稍欠。


场景二:长文理解与信息抽取

测试任务:喂入一份 60 页的技术规范 PDF(转文本约 80K tokens),要求抽取所有接口定义并整理成表格。

| 模型 | 上下文窗口 | 抽取准确率 | 遗漏数量(共 47 个接口) |

|------|----------|----------|----------------------|

| Claude Sonnet 4.5 | 200K | 97.8% | 遗漏 1 个 |

| GPT-5 | 128K(实测) | 95.7% | 遗漏 2 个 |

| DeepSeek V3 | 64K | 文档超限,分段处理 | 遗漏 4 个 |

注:GPT-5.5 最近被反映上下文缩到 258K,GPT-5 这里实测有效处理约 128K,长文场景下 Claude 4.5 的 200K 窗口优势明显。


场景三:数学推理

测试任务:一道竞赛级组合数学题 + 一道需要多步推导的概率题。

| 模型 | 组合题(满分 10) | 概率题(满分 10) | 推导过程可读性 |

|------|----------------|----------------|-------------|

| Claude Sonnet 4.5 | 9 | 8 | 高,步骤清晰 |

| GPT-5 | 10 | 9 | 高,但有时跳步 |

| DeepSeek V3 | 8 | 7 | 中,偶有逻辑跳跃 |

数学推理 GPT-5 略占优,但差距不大。DeepSeek V3 在这个维度上和前两者有可感知的差距。


场景四:中文长文写作

测试任务:写一篇 2000 字的技术博客,主题是"微服务拆分的时机判断",要求有观点、有案例、不能是 AI 味的废话。

这个场景主观性强,我找了 3 个同事盲测打分(1-10 分):

| 模型 | 平均分 | 主要评价 |

|------|------|--------|

| Claude Sonnet 4.5 | 8.2 | 结构好,观点有层次,案例真实 |

| GPT-5 | 7.8 | 内容扎实,但偶有"AI 腔" |

| DeepSeek V3 | 7.1 | 中规中矩,缺少锐度 |

中文写作 Claude 4.5 表现最好,这和它训练数据的特点有关。


成本对比:这才是关键

跑完这些测试,我把 token 消耗和价格算了一遍。以下是官方价格 vs 通过无量Api(SVIP)的实际价格

| 模型 | 官方输入价 | 官方输出价 | 无量Api SVIP 输入 | 无量Api SVIP 输出 |

|------|----------|----------|-----------------|-----------------|

| Claude Sonnet 4.5 | ¥21/M tokens | ¥105/M tokens | ¥7.5/M | ≈¥37/M |

| GPT-5 | ¥54/M tokens | ¥216/M tokens | ≈¥19/M | ≈¥76/M |

| DeepSeek V3 | ¥2/M tokens | ¥8/M tokens | ¥0.7/M | ≈¥2.8/M |

以我这次测试的实际消耗(约 500K input + 100K output tokens)为例:

| 模型 | 官方总费用 | 无量Api SVIP 总费用 | 节省 |

|------|----------|-------------------|-----|

| Claude Sonnet 4.5 | ≈¥21 | ≈¥7.5 | 64% |

| GPT-5 | ≈¥49 | ≈¥17 | 65% |

| DeepSeek V3 | ≈¥1.8 | ≈¥0.65 | 64% |

如果你是重度 API 用户,每月消耗在 50M tokens 以上,这个差价相当可观。


综合结论

没有"最好的模型",只有"最适合场景的模型":

  • 代码 + 工程任务:Claude Sonnet 4.5 和 GPT-5 都很强,Claude 更擅长分析取舍,GPT-5 速度更快
  • 超长文档处理:Claude Sonnet 4.5,200K 上下文是实打实的优势
  • 数学推理:GPT-5 略优
  • 中文写作:Claude Sonnet 4.5
  • 成本敏感 / 高并发:DeepSeek V3,性价比无敌,够用就好

如果让我选一个日常主力:Claude Sonnet 4.5,综合表现最均衡,中文理解也好。GPT-5 作为备用,数学和代码场景切换过去。DeepSeek V3 跑批量任务、做数据处理,省钱省心。


关于 API 接入成本

上面的价格对比基于无量Api的 SVIP 档位(7.7 折)。它支持国内直连,OpenAI 格式兼容,换个 Base URL 就能用,300+ 模型统一入口。注册送 ¥1,余额永久不过期,适合先试试再决定要不要充值。

V2EX 版推广链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb