全球动态2026.09.16

中美开源与闭源 AI 模型能力差距缩至 4.4 个月,企业选型逻辑生变

Mozilla 第二版《开源 AI 现状》报告将中美模型能力差距从综合性能百分比转为任务时长衡量,最新数据显示差距已缩至 4.4 个月。开源模型在 8 小时以内的日常任务中具备足够能力且成本显著更低,企业 AI 部署正从追逐最强模型转向按任务分工选型。

朋克君
发布者朋克君
预计阅读 3 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

中美开源与闭源 AI 模型能力差距缩至 4.4 个月。

02

开源模型成本仅为闭源模型的约五分之一到三成。

03

企业开始依据任务时长分工,日常任务转向开源模型。

本摘要由 AI 辅助整理,请以正文内容为准。

01评估方式转向实际工作能力

2026 年 9 月 15 日,Mozilla 发布第二版《开源 AI 现状》报告,指出中国公司最佳开放权重模型与美国科技公司前沿闭源模型的能力差距已缩短至 4.4 个月。这一结论基于模型可靠完成任务的时长衡量,可靠成功率标准为 50%。

与 7 月首版报告采用的综合性能百分比不同,第二版报告将评估方式从抽象分数转向实际工作能力。首版报告曾指出顶级开放模型与 ChatGPT、Claude 等专有模型的性能差距为 3%,但这一指标难以直接转化为企业的任务决策依据。新采用的任务时长衡量方式由 METR 提供方法论支持,使企业能够更直观地判断特定任务应选用开源还是闭源模型。

关键数据

4.4 个月能力差距中美模型对比
1.7 倍任务时长倍数闭源 vs 开源
~30%Kimi K3 成本占比对比 Anthropic Fable 5

02成本优势与企业部署实践

报告数据显示,目前最佳闭源模型可完成的任务时长是最佳开放模型的 1.7 倍——开放模型可处理约 7 小时的任务,闭源模型则可处理约 12 小时的任务。Mozilla 首席技术官 Raffi Krikorian 表示,闭源模型的溢价主要体现在需要 8 到 12 小时才能完成的专业型任务上,而开源模型能以极低价格处理日常工作。

具体模型的成本对比进一步印证了这一判断。月之暗面 Kimi K3 模型在 Artificial Analysis 智能指数上得分仅比 Anthropic Fable 5 低三分,成本却仅为后者的约 30%。另一项来自 Vals AI 的 Terminal-Bench 2.1 测试显示,Z.ai 的 GLM 5.2 与 Anthropic 的 Claude Opus 4.7 和 4.8 仅相差 1 分,单项任务成本约为闭源模型的五分之一。

企业部署实践已开始反映这种分工逻辑。DoorDash 已采用 Kimi 处理日常任务,同时将 Fable 保留用于更复杂的工作。Raffi Krikorian 预计,4 个月后开放模型可处理 12 小时任务,闭源模型则可处理约 20 小时任务,差距将继续存在但动态演进。

03使用量与收入的结构性反差

开源模型在实际使用量上已占据主导地位。2026 年 8 月 OpenRouter 按令牌量排名前 10 的模型中,8 个提供开放权重。然而收入结构呈现明显反差:2025 年 5 月至 9 月期间,开放模型收入占比仅为 4%,闭源模型占比高达 96%。这一数据揭示开源模型虽然使用量大,但商业化路径与闭源模型存在本质差异。

报告同时指出,主流开源模型中相当一部分具有中国背景,这也是报告特别关注中美模型对比的原因之一。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签