横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批 prompt 测了三天

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批 prompt 测了三天

最近 V2EX 上关于 Codex 的讨论很多,有人用它远程 SSH 救服务器,有人说它毛病不少。趁这个机会,我系统测了一下目前几个主流模型在实际开发场景下的表现,顺便算了一下真实使用成本。

测试说明

模型:Claude Sonnet 4.5 / GPT-4.1 / DeepSeek V3

测试时间:2025年7月,连续三天

场景:代码调试、长文理解、数学推理、多轮对话

调用方式:统一用 OpenAI 格式 API,换 Base URL 切模型

不做主观"感觉好用"的评价,只看输出质量和成本。


场景一:代码调试(Bug 定位)

任务:给一段有竞态条件的 Python 异步代码,要求定位 bug 并给出修复方案。


async def fetch_all(urls):

    results = []

    for url in urls:

        r = await fetch(url)

        results.append(r)

    return results

# 实际 bug:共享状态在并发场景下被覆盖

| 模型 | 是否定位到根因 | 修复方案质量 | 有无解释并发原理 |

|------|-------------|-------------|----------------|

| Claude Sonnet 4.5 | ✅ 精准 | asyncio.gather 改写,完整 | ✅ 有,清晰 |

| GPT-4.1 | ✅ 精准 | 给了两种方案 | ✅ 有 |

| DeepSeek V3 | ✅ 精准 | 基础修复,够用 | ⚠️ 简略 |

三个模型都找到了问题,但 Claude 4.5 的解释最完整,GPT-4.1 给出了备选方案,DeepSeek V3 干脆但不够深。


场景二:长文理解(8000 字技术文档问答)

任务:喂入一份 8000 字的系统架构文档,问 5 个细节问题,包括两个文档中没有直接写明需要推断的问题。

| 模型 | 显式问题准确率 | 推断问题准确率 | 是否出现幻觉 |

|------|-------------|-------------|------------|

| Claude Sonnet 4.5 | 5/5 | 2/2 | ❌ 无 |

| GPT-4.1 | 5/5 | 1/2 | ⚠️ 一处轻微 |

| DeepSeek V3 | 4/5 | 1/2 | ⚠️ 一处明显 |

这个场景差距最明显。Claude 4.5 在需要跨段落推断的问题上表现稳定,DeepSeek V3 有一次把文档里没写的内容说得很确定,需要注意。


场景三:数学推理(竞赛级应用题)

任务:AMC 12 难度的概率题和组合题各一道。

| 模型 | 概率题 | 组合题 | 解题过程是否可追溯 |

|------|-------|-------|-----------------|

| Claude Sonnet 4.5 | ✅ | ✅ | ✅ 步骤清晰 |

| GPT-4.1 | ✅ | ❌ 最后一步出错 | ✅ 过程对但结论错 |

| DeepSeek V3 | ✅ | ✅ | ⚠️ 跳步较多 |

GPT-4.1 这次踩了一个坑:推理过程看起来没问题,但最后计算步骤出了错,容易让人觉得答案是对的。DeepSeek V3 跳步多,适合有基础的人 review,不适合直接用于教学。


场景四:多轮对话连贯性

任务:用 10 轮对话做一个功能需求的渐进式拆解,测试模型是否能记住前几轮的约束。

| 模型 | 第 5 轮约束保持 | 第 10 轮约束保持 | 主动引用前文 |

|------|--------------|--------------|-----------|

| Claude Sonnet 4.5 | ✅ | ✅ | ✅ 频繁 |

| GPT-4.1 | ✅ | ⚠️ 有遗漏 | ⚠️ 偶尔 |

| DeepSeek V3 | ✅ | ❌ 明显漂移 | ❌ 基本不主动 |

长对话场景 Claude 4.5 领先较多,DeepSeek V3 在第 8 轮之后开始忘掉早期的约束条件,适合单轮或短对话任务。


成本对比(这部分很关键)

按每月调用 5M tokens 估算(个人开发者 / 小团队常见用量):

| 模型 | 官方价(输入/M) | 无量Api SVIP 价 | 月省金额 |

|------|--------------|--------------|--------|

| Claude Sonnet 4.5 | ¥21 | ¥7.5 | ¥67.5 |

| GPT-4.1 | ¥14 | ¥5.5 | ¥42.5 |

| DeepSeek V3 | ¥2 | ¥0.9 | ¥5.5 |

价格来源:官方文档 + 无量Api 实测报价,2025年7月数据,以实际结算为准。

DeepSeek V3 本来就便宜,差价有限。但 Claude 4.5 这档差价就很可观——如果你每天跑 batch 任务或者接了付费项目,一个月节省的钱能出去吃几顿好的。

无量Api 还有一点值得说:国内直连,延迟低,不用挂梯子,账号也不会因为"异常访问"被封。对于需要稳定跑任务的场景,这个比单纯省钱更实际。


综合结论

| 场景 | 推荐模型 |

|------|--------|

| 复杂代码调试 + 需要解释 | Claude Sonnet 4.5 |

| 需要备选方案的工程任务 | GPT-4.1 |

| 高频调用 / 成本敏感 | DeepSeek V3 |

| 长文档理解 / 长对话 | Claude Sonnet 4.5 |

| 数学推理(要验证过程) | Claude Sonnet 4.5 / DeepSeek V3 |

没有哪个模型在所有场景完胜。DeepSeek V3 的性价比在简单任务上确实没对手,但精度要求高的场景还是要上 Claude 4.5 或 GPT-4.1。


一行切换模型的方式

如果你已经在用 OpenAI SDK,换模型只需要改 base_url:


from openai import OpenAI



client = OpenAI(

    api_key="your_key",

    base_url="https://api2everything.xyz/v1"  # 改这一行

)



# 然后 model 参数直接写 "claude-sonnet-4-5" / "gpt-4.1" / "deepseek-v3"

response = client.chat.completions.create(

    model="claude-sonnet-4-5",

    messages=[{"role": "user", "content": "帮我 review 这段代码"}]

)

注册就送 ¥1 余额,够你把上面四个场景都跑一遍对比看看。


无量Api:300+ 模型国内直连,比官方便宜 65%,余额永久不过期。