横评对比 · 阅读约 5 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:我用同一批 Bug 测了三天

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:我用同一批 Bug 测了三天

最近几个模型的讨论热度都上来了,V2EX 上也有人在推中转、聊思考深度。干脆做一次认真的横评——同样的测试集,同样的提示词,看看这三个模型在实际开发场景里的差距到底有多大。

测试模型:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3
测试时间:2025 年 7 月
接入方式:统一用 OpenAI 格式 API,通过无量Api调用

测试场景设计

选了四个日常开发里最容易踩坑的场景:

1. 代码 Bug 定位:给一段有隐式类型转换问题的 JavaScript

2. 长文档理解:20000 字的技术规范,问具体章节的细节

3. 数学推理:一道概率论 + 组合数学混合题

4. 代码补全与风格一致性:在已有代码风格下续写功能模块


场景一:代码 Bug 定位

测试用例:一段 Node.js 代码,0 == "" 导致的鉴权逻辑绕过,加上一个异步竞态条件。

Claude Sonnet 4.5

直接定位到两个问题,先说竞态条件,再说类型转换,还主动提醒"这个模式在高并发下会有 TOCTOU 问题"。给出的修复方案用了 === + mutex lock,没有过度设计。

GPT-4.1

找到了类型转换的 bug,竞态条件只是轻描淡写提了一句"可能存在并发问题",没有给具体复现路径。修复建议是对的,但没有主动扩展安全视角。

DeepSeek V3

两个 bug 都找到了,解释比较详细,但修复方案偏保守——建议加锁的方式用了全局变量,在实际项目里不太可行。需要追问一轮才给出更合理的实现。

小结:Claude 4.5 在安全意识和代码质量上略优,DeepSeek V3 需要多轮引导。


场景二:长文档理解(20k tokens)

测试用例:一份 OpenAPI 规范文档,问"第 7 章 rate limiting 策略里,针对 burst 流量的处理逻辑是什么"。

Claude Sonnet 4.5

准确回答,引用了原文的具体字段名和数值,没有幻觉。

GPT-4.1

答对了主要逻辑,但把两个不同端点的限流参数混在一起说了,需要确认。

DeepSeek V3

回答框架正确,但有一处数值是自己"补"的,原文没有这个字段。需要反复核对。

小结:长文档场景下 Claude 4.5 的忠实度最高,DeepSeek V3 有轻微幻觉风险。


场景三:数学推理

测试用例:从 52 张牌里抽 5 张,求恰好包含 2 张 A 且至少 1 张红心的概率(排除重叠)。

| 模型 | 最终答案 | 过程是否正确 |

|---|---|---|

| Claude Sonnet 4.5 | ✅ 正确 | 容斥原理步骤清晰 |

| GPT-4.1 | ✅ 正确 | 分类讨论,步骤稍繁但结果对 |

| DeepSeek V3 | ❌ 错误 | 漏了一种 A 的组合情况 |

这道题 DeepSeek V3 翻车了,Claude 和 GPT-4.1 都过了。


场景四:代码补全与风格一致性

测试用例:已有一个用 Zod + tRPC + Prisma 写的 Next.js 项目,让模型续写一个新的 router 模块。

Claude Sonnet 4.5

自动识别了项目的命名规范、错误处理模式、日志格式,生成的代码几乎不需要修改就能用。

GPT-4.1

结构正确,但错误处理用了通用的 try/catch 而不是项目里已有的 TRPCError 封装,需要手动对齐。

DeepSeek V3

生成的代码质量不错,风格一致性一般,但胜在速度快、价格低,轻量补全任务完全够用。


综合评分

| 维度 | Claude Sonnet 4.5 | GPT-4.1 | DeepSeek V3 |

|---|---|---|---|

| Bug 定位 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 长文理解 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |

| 数学推理 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |

| 代码风格一致性 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |

| 性价比 | 中(官方贵) | 中 | |


价格对比:这才是关键

模型再好,长期用下来价格也是核心变量。以下是官方价 vs 无量Api的实际对比:

| 模型 | 官方价(输入/输出,每百万 token) | 无量Api 普通价 | 无量Api SVIP(7.7折) |

|---|---|---|---|

| Claude Sonnet 4.5 | 约 ¥21 / ¥105 | ¥15 / ¥75 | ¥11.5 / ¥57.7 |

| GPT-4.1 | 约 ¥14 / ¥56 | ¥10 / ¥40 | ¥7.7 / ¥30.8 |

| DeepSeek V3 | 约 ¥2 / ¥8 | ¥1.4 / ¥5.6 | ¥1.1 / ¥4.3 |

用 Claude Sonnet 4.5 做代码 Review,每月处理 5M tokens,官方要花 ¥630,无量Api SVIP 只需 ¥220 左右。一年省下来能买不少书。

另外,无量Api 支持国内直连,不需要代理,对公司内网环境很友好。接入也极简单:


from openai import OpenAI



client = OpenAI(

    api_key="your_key",

    base_url="https://api.api2everything.xyz/v1"  # 改这一行就够了

)


结论

Claude Sonnet 4.5 在代码质量、长文理解、安全意识上综合最强,适合对准确性要求高的任务。

GPT-4.1 均衡,数学推理和代码生成都在线,适合通用 agent 场景。

DeepSeek V3 性价比最高,轻量任务完全胜任,但复杂推理需要多轮引导,中文任务表现稳定。

实际工程里,没必要只用一个模型——用 DeepSeek V3 跑初稿和简单补全,用 Claude 4.5 做 Code Review 和复杂分析,是目前比较省钱又不降质量的组合方式。


三个模型都可以通过无量Api直连访问,注册送 ¥1 余额,可以先把上面几个测试跑一遍自己感受一下:

知乎版https://api2everything.xyz/?utm_source=zhihu&utm_medium=article&utm_campaign=daily&aff=wqUb

V2EX 版https://api2everything.xyz/?utm_source=v2ex&utm_medium=article&utm_campaign=daily&aff=wqUb