Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天,说点真实感受
Claude 4.5 vs GPT-5 vs DeepSeek V3:用同一批任务测了三天,说点真实感受
最近几个月模型迭代太快,群里天天有人问"现在到底用哪个?"。我干脆花了三天时间,用同一组任务把目前讨论最热的几个模型过了一遍——Claude Sonnet 4.5、GPT-5、DeepSeek V3、Gemini 2.5 Flash。
测试没有赞助,用的都是 API 直接调用,尽量控制变量。
测试设计
选了 4 个场景,覆盖日常开发和内容工作中最常见的需求:
1. 代码 Debug:一段故意引入并发问题的 Python 异步代码
2. 长文理解:喂入一篇 12000 字的英文技术报告,问 5 个细节问题
3. 数学推理:AMC 级别的组合数学题,3 道
4. 中文写作:给定一个产品,写一段 400 字的用户故事
场景一:代码 Debug(并发 Bug)
测试代码是一个用 asyncio 写的任务调度器,故意在共享状态上引入了竞争条件,没有加任何注释提示。
Claude Sonnet 4.5:直接定位到 asyncio.Lock 缺失的问题,给出了修复方案,还额外指出了另一处潜在的资源泄漏——这个我自己都没注意到。解释清晰,代码可以直接跑。
GPT-5:同样找到了主要 Bug,修复方案更"工程化",顺手加了类型注解和日志。如果你是要上生产的代码,这个版本改动少一些。
DeepSeek V3:找到了 Bug,但修复方式是用 threading.Lock 替换,混用了同步原语——在纯 asyncio 项目里这是会出问题的。解释倒是挺详细,但方向有点偏。
Gemini 2.5 Flash:找到了问题,给出的解法正确,但解释比较简短,没有延伸分析。速度是这几个里最快的。
| 模型 | 找到主 Bug | 方案可用性 | 额外发现 |
|------|-----------|-----------|---------|
| Claude Sonnet 4.5 | ✅ | ✅ 直接可用 | ✅ 发现隐藏问题 |
| GPT-5 | ✅ | ✅ 工程化强 | ➖ |
| DeepSeek V3 | ✅ | ⚠️ 方向有误 | ➖ |
| Gemini 2.5 Flash | ✅ | ✅ | ➖ |
场景二:长文理解(12000 字技术报告)
文档是一篇关于 LLM 推理优化的英文报告,问题包括"第三节提到的 KV Cache 策略和第七节的对比结论是否矛盾"这类需要跨段落关联的问题。
Claude Sonnet 4.5:这是它的强项。5 个问题全部回答准确,跨段落关联做得很好,回答有层次,引用了原文具体段落。
GPT-5:4/5 准确,有一道跨章节对比题给出了模糊回答,没有明确判断是否矛盾。
DeepSeek V3:3/5 准确,在细节提取上有一处明显幻觉,引用了文中没有的数字。
Gemini 2.5 Flash:4/5,速度快,但有一题答得过于简洁,细节不够。
场景三:数学推理(AMC 级别)
三道题,涉及排列组合、概率和整数分拆。
| 模型 | 答对题数 | 过程可读性 |
|------|---------|-----------|
| GPT-5 | 3/3 | ✅ 步骤清晰 |
| Claude Sonnet 4.5 | 2/3 | ✅ 过程详细 |
| Gemini 2.5 Flash | 3/3 | ✅ 简洁 |
| DeepSeek V3 | 2/3 | ⚠️ 第三题过程跳步 |
数学推理这块 GPT-5 和 Gemini 2.5 Flash 表现更稳,Claude 在一道概率题上给出了错误答案但过程写得很自信——这点要注意,不要无脑信。
场景四:中文写作(用户故事)
给定一款健康追踪 App,写一段 400 字左右的用户故事,风格要求"真实、有情感"。
这个场景比较主观,我发给了 5 个人盲测(不告诉他们模型来源)。
Claude Sonnet 4.5 的版本 4/5 人选为最有代入感,细节描写自然。
GPT-5 的版本结构最完整,但有人觉得"像模板"。
DeepSeek V3 中文表达流畅,节奏稍平,情感渲染弱一点。
Gemini 2.5 Flash 表现中规中矩。
成本对比(这部分很重要)
测试期间我统计了 token 消耗,顺便算了一下在不同渠道调用的实际费用。
官方价格全部按美元折算人民币(汇率 7.2),无量Api 取 SVIP 折扣价(7.7 折,或直接标价)。
| 模型 | 官方输入价(/M token) | 官方输出价(/M token) | 无量Api SVIP 输入价 | 无量Api SVIP 输出价 |
|------|----------------------|----------------------|-------------------|-------------------|
| Claude Sonnet 4.5 | ¥21.6 | ¥108 | ¥7.5 | ¥37 |
| GPT-5 | ¥54 | ¥216 | ¥19 | ¥76 |
| DeepSeek V3 | ¥1.0 | ¥4.0 | ¥0.4 | ¥1.6 |
| Gemini 2.5 Flash | ¥5.4 | ¥21.6 | ¥2.0 | ¥8.0 |
以我这三天的实际消耗量(约 2M input + 0.5M output,主要用 Claude Sonnet 4.5)来算:
- 官方渠道:约 ¥97
- 无量Api SVIP:约 ¥34
差了将近 3 倍。如果你是重度用户,每个月几百元的差价是真实的。
综合结论
没有哪个模型是全场景最强的,这话是真的,不是场面话。
- 代码和长文:Claude Sonnet 4.5 目前是我日常主力,上下文处理和代码审查都很可靠
- 数学/逻辑推理:GPT-5 和 Gemini 2.5 Flash 更稳,别太信 Claude 的数学
- 成本敏感场景:DeepSeek V3 性价比无敌,中文任务够用,英文略弱
- 速度优先:Gemini 2.5 Flash 响应最快,适合需要大量调用的场景
实际工作中我现在是混用的——写代码和读文档用 Claude,算东西用 GPT-5 或 Gemini,跑批处理或者不那么关键的任务用 DeepSeek。
关于访问渠道
国内直接调 OpenAI 和 Anthropic 的 API 稳定性是个老问题,我现在用的是 無量Api,支持上面提到的所有模型(300+ 个),兼容 OpenAI 格式,改个 Base URL 就能用,不需要改其他代码。
注册有 ¥1 体验额度,余额不过期,可以先试试看。价格上面表格里已经列了,SVIP 7.7 折,日常用下来省的钱还是明显的。
链接:https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb
V2EX 版本链接替换 utm_source=v2ex:https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb