Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天
最近 V2EX 上封号的帖子刷屏,不少人开始重新考虑"到底用哪个模型"。趁这个机会,我用同一套测试任务把目前最热的三个模型跑了一遍,结果有点出乎意料。
测试说明
模型版本:
- Claude Sonnet 4.5(Anthropic,2025 年 7 月)
- GPT-5(OpenAI,2025 年 7 月)
- DeepSeek V3(DeepSeek,最新版)
测试方式:同一个 prompt,三个模型各跑 3 次,取中位数结果。不刷分,不挑最好的那次。
场景一:代码 Debug(真实 Bug)
任务:给一段 Python 异步代码,里面藏了一个 asyncio.gather 的竞态条件 bug,让模型定位并修复。
# 问题代码(简化版)
async def fetch_all(urls):
results = []
async def fetch(url):
r = await client.get(url)
results.append(r.json()) # 竞态条件在这里
await asyncio.gather(*[fetch(u) for u in urls])
return results
| 模型 | 是否定位到竞态 | 修复方案质量 | 额外建议 |
|------|--------------|------------|--------|
| Claude 4.5 | ✅ 精准 | 给了 3 种方案,分析了各自适用场景 | 主动提示了 asyncio.Lock 的性能开销 |
| GPT-5 | ✅ 精准 | 给了 2 种方案,代码更简洁 | 没有主动分析性能 |
| DeepSeek V3 | ✅ 精准 | 1 种方案,直接可用 | 解释最详细,适合新手 |
小结:三个都找到了 bug,Claude 4.5 的方案最全面,DeepSeek V3 的解释最适合教学场景,GPT-5 代码最干净。
场景二:长文理解(20k token 合同)
任务:上传一份 20000 字的英文 SaaS 服务合同,提问"哪些条款对乙方不利,列出并解释"。
| 模型 | 条款识别数 | 漏掉的关键条款 | 解释准确性 |
|------|----------|--------------|---------|
| Claude 4.5 | 11 条 | 无明显遗漏 | 高,法律术语解释到位 |
| GPT-5 | 9 条 | 漏掉了一条自动续约条款 | 高 |
| DeepSeek V3 | 8 条 | 漏掉了仲裁地条款 | 中,部分解释偏表面 |
小结:长文理解 Claude 4.5 明显占优,这和它 200k context 的设计取向一致。GPT-5 次之,DeepSeek V3 在纯中文长文上表现会更好,英文法律文本稍弱。
场景三:数学推理(竞赛级)
任务:AMC 12 难度的组合数学题,要求给出完整推导过程。
从 1 到 100 中随机选 5 个不同整数,恰好有 2 个偶数的概率是多少?
| 模型 | 答案正确 | 推导过程 | 是否有计算错误 |
|------|--------|--------|------------|
| Claude 4.5 | ✅ | 清晰,分步骤 | 无 |
| GPT-5 | ✅ | 清晰,给了两种解法 | 无 |
| DeepSeek V3 | ✅ | 清晰,中文解释更自然 | 无 |
这道题三个都答对了。换了一道需要构造反例的数论题后,GPT-5 第一次给出了错误答案,Claude 4.5 和 DeepSeek V3 均正确。数学推理上 Claude 4.5 和 DeepSeek V3 这次表现更稳。
场景四:中文创作(产品文案)
任务:为一款面向程序员的番茄钟 App 写一段 200 字以内的产品介绍,要求有技术感,不要堆砌形容词。
这个场景主观性强,我找了 5 个人盲测打分(1-10 分):
| 模型 | 平均分 | 评价关键词 |
|------|------|---------|
| Claude 4.5 | 8.2 | "克制、有质感" |
| GPT-5 | 7.6 | "流畅但稍显模板化" |
| DeepSeek V3 | 8.6 | "最接近中文母语感" |
中文创作 DeepSeek V3 赢了,这个结果不意外。
成本对比(这才是很多人真正关心的)
按每百万 token 计算,官方价 vs 通过无量Api(SVIP 7.7 折):
| 模型 | 官方输入价 | 官方输出价 | 无量Api SVIP 输入 | 无量Api SVIP 输出 |
|------|---------|---------|----------------|----------------|
| Claude Sonnet 4.5 | ¥21/M | ¥105/M | ¥7.5/M | ¥37.5/M |
| GPT-5 | ¥54/M | ¥216/M | ¥19.3/M | ¥77.2/M |
| DeepSeek V3 | ¥2/M | ¥8/M | ¥0.72/M | ¥2.88/M |
如果你每天调用量在 10M token 左右(中等规模应用),用 Claude Sonnet 4.5:
- 官方:约 ¥1260/天
- 无量Api SVIP:约 ¥450/天
一个月省下来的钱够买不少咖啡了。
综合结论
| 场景 | 推荐模型 |
|------|--------|
| 复杂代码 Debug | Claude 4.5 |
| 长文档分析 | Claude 4.5 |
| 数学/逻辑推理 | Claude 4.5 / DeepSeek V3 |
| 中文内容创作 | DeepSeek V3 |
| 成本敏感型应用 | DeepSeek V3 |
| 综合能力 + 生态 | GPT-5 |
没有哪个模型全赢。GPT-5 生态最完善,Claude 4.5 在分析类任务上最稳,DeepSeek V3 性价比无敌。实际选型建议:主力用 DeepSeek V3 降成本,复杂任务 fallback 到 Claude 4.5,这套组合在成本和效果之间平衡得最好。
关于访问问题
最近 V2EX 上封号帖子很多,直接用官方账号风险确实在上升。如果你是开发者,更稳的方式是走 API,不依赖账号状态。
我自己用的是 无量Api,国内直连,OpenAI 格式兼容,换个 base_url 就能用,上面三个模型都支持,还有 300+ 其他模型。注册送 ¥1,余额永久不过期,可以先试试水。
V2EX 版本链接:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb