横评对比 · 阅读约 6 分钟

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了 3 天,结果有点意外

Claude 4.5 vs GPT-4.1 vs DeepSeek V3:用同一批任务测了 3 天,结果有点意外

最近群里有人问"现在主力用哪个模型最划算",我就干脆系统测了一遍。测试周期 3 天,同一套 prompt,跑了代码补全、长文理解、数学推理、多轮对话四个场景。

先说结论:没有全能冠军,但有明显适合场景。


测试模型

| 模型 | 版本 | 定位 |

|------|------|------|

| Claude Sonnet 4.5 | Anthropic 最新 | 代码 + 长文综合 |

| GPT-4.1 | OpenAI 主力 | 通用指令跟随 |

| DeepSeek V3 | 深度求索 0324 | 性价比首选 |

| Gemini 2.5 Pro | Google | 超长上下文 |

Grok 4 目前 API 访问限制较多,本次未纳入。


场景一:代码补全 + Bug 修复

测试任务:给一段有 3 个隐性 bug 的 Python 异步爬虫代码,让模型识别并修复,同时补全缺失的错误处理逻辑。


# 原始代码(故意埋了竞态条件 + 未处理 timeout + session 未关闭)

async def fetch_all(urls):

    results = []

    async with aiohttp.ClientSession() as session:

        tasks = [fetch(session, url) for url in urls]

        results = await asyncio.gather(*tasks)

    return results

结果:

| 模型 | 识别 bug 数 | 修复质量 | 额外补全 |

|------|------------|---------|---------|

| Claude Sonnet 4.5 | 3/3 | ⭐⭐⭐⭐⭐ | 主动加了 semaphore 限流 |

| GPT-4.1 | 2/3 | ⭐⭐⭐⭐ | 修复扎实,少了竞态说明 |

| DeepSeek V3 | 3/3 | ⭐⭐⭐⭐ | 识别准,注释写得很细 |

| Gemini 2.5 Pro | 2/3 | ⭐⭐⭐ | 漏了 session 未关闭 |

Claude 这次确实表现最好,会主动考虑生产环境需求,不只是"修哪儿指哪儿"。DeepSeek V3 以明显更低的成本打出了接近的效果。


场景二:长文理解 + 信息抽取

测试任务:输入一份 40 页 PDF 转换的文本(约 60k tokens),要求提取关键数据点、识别矛盾表述、生成摘要。

| 模型 | 上下文窗口 | 信息抽取准确率 | 矛盾识别 | 摘要质量 |

|------|-----------|--------------|---------|---------|

| Claude Sonnet 4.5 | 200k | 94% | 发现 2 处 | ⭐⭐⭐⭐⭐ |

| GPT-4.1 | 1M | 91% | 发现 1 处 | ⭐⭐⭐⭐ |

| DeepSeek V3 | 128k | 88% | 发现 1 处 | ⭐⭐⭐⭐ |

| Gemini 2.5 Pro | 1M | 96% | 发现 2 处 | ⭐⭐⭐⭐⭐ |

长文场景 Gemini 2.5 Pro 是真的强,百万上下文不是噱头。Claude 紧随其后。DeepSeek 在 128k 以内表现稳定,超出后需要手动分块。


场景三:数学推理

测试任务:一道竞赛级组合数学题 + 一道统计学证明题,要求给出完整推导过程。

| 模型 | 组合题得分 | 统计证明 | 推导过程完整性 |

|------|-----------|---------|-------------|

| Claude Sonnet 4.5 | 85/100 | 正确 | 步骤清晰 |

| GPT-4.1 | 90/100 | 正确 | 偶有跳步 |

| DeepSeek V3 | 88/100 | 正确 | 非常详细 |

| Gemini 2.5 Pro | 92/100 | 正确 | 最强 |

数学推理 Gemini 2.5 Pro 表现最突出,GPT-4.1 和 DeepSeek V3 旗鼓相当,Claude 相对弱一点但也在可用范围。


场景四:多轮对话一致性

测试任务:模拟产品设计讨论,20 轮对话,中途故意修改需求,看模型是否能保持上下文一致、识别需求冲突。

| 模型 | 上下文保持 | 需求冲突识别 | 主动追问 |

|------|-----------|------------|---------|

| Claude Sonnet 4.5 | ⭐⭐⭐⭐⭐ | 主动指出 | 会问 |

| GPT-4.1 | ⭐⭐⭐⭐ | 部分识别 | 偶尔 |

| DeepSeek V3 | ⭐⭐⭐⭐ | 部分识别 | 较少 |

| Gemini 2.5 Pro | ⭐⭐⭐ | 较弱 | 几乎不问 |

多轮对话 Claude 是最像"在认真协作"的,会主动说"这和你第 7 轮说的有冲突"。


成本对比:这才是关键

性能差距不大的情况下,成本就是决策主因。以下是官方价 vs 无量Api SVIP 价的真实对比:

| 模型 | 官方价(输入/M tokens) | 无量Api SVIP 价 | 节省 |

|------|----------------------|----------------|------|

| Claude Sonnet 4.5 | ¥21 | ¥7.5 | 64% |

| GPT-4.1 | ¥14 | ¥5.2 | 63% |

| DeepSeek V3 | ¥4(官方人民币) | ¥1.5 | 62% |

| Gemini 2.5 Pro | ¥18 | ¥6.5 | 64% |

以一个中型项目月均 500M tokens 消耗为例,Claude Sonnet 4.5:官方月费约 ¥10,500,无量Api SVIP 约 ¥3,750,一年省下来能买台 MacBook。

综合推荐

按场景选模型,别信"一个模型包打天下":

  • 日常代码开发、多轮协作:Claude Sonnet 4.5,上下文追踪最稳
  • 长文档处理、RAG 应用:Gemini 2.5 Pro,超长窗口是真优势
  • 数学/逻辑推理:Gemini 2.5 Pro > GPT-4.1 ≈ DeepSeek V3
  • 预算敏感场景:DeepSeek V3,性价比无对手,九成场景够用
  • 通用应用、指令跟随:GPT-4.1,生态最成熟,第三方工具支持最好

接入成本

如果你已经在用 OpenAI SDK,切换到无量Api 的改动量大概是:


# 改这一行

client = OpenAI(

    api_key="your_key",

    base_url="https://api2everything.xyz/v1"  # 只改这里

)

上面四个模型都能直接用,不需要分别对接 Anthropic、Google、DeepSeek 各家 SDK。


国内直连、无需魔法、300+ 模型统一接口,注册还送 ¥1 余额(永久不过期,用来试手够了)。

👉 api2everything.xyz