最新消息:关注人工智能 AI赋能新媒体运营

美企AI"合规税":本土大模型性能不及DeepSeek,却靠合规刚需卖出高价

科技资讯 admin 浏览

OpenAI前CTO穆拉蒂首作Inkling:中美大模型角色反转

OpenAI前首席技术官穆拉蒂(Mira Murati)离开老东家后的首款作品,意外地将中美大模型的角色关系颠倒了过来。7月15日,她创办的Thinking Machines Lab发布首款模型Inkling,采用混合专家架构,主要沿用DeepSeek-V3设计,后训练阶段还借助了月之暗面Kimi K2.5等开放模型生成的合成数据。然而结果颇为微妙:在多项基准评测中,Inkling落后于Kimi和GLM,调用价格反而更高。

硬件配置撑得起排面

单看参数,Inkling确实具备明星实验室的实力。该模型总参数量达9750亿,每处理一个Token激活410亿参数;预训练消耗45万亿Token,数据涵盖文本、图像、音频与视频;最长支持100万Token上下文,能理解文字、图片和音频,以文字形式输出,还可通过调节思考强度在性能、速度与成本之间取舍。模型采用Apache 2.0许可证开放权重,开发者既能下载自行部署,也可通过Tinker平台微调。公司定位明确:Inkling更适合充当企业开发AI应用的底座,而非直接与ChatGPT争夺普通用户。

技术路线引关注:中国模型成关键参考

真正引人注意的藏在技术报告后半段。Thinking Machines明确写道,Inkling的混合专家设计主要沿用了DeepSeek-V3,设置大量专家模块、每个Token只调用其中一小部分,并采用其无辅助损失负载均衡设计。中国模型的影响还延伸至训练阶段:为启动后训练,公司先用开放权重模型生成的合成数据做监督微调,其中明确提到了Kimi K2.5。

一条完整路线由此浮现——一家由OpenAI前CTO创办的美国实验室,首款模型沿用DeepSeek架构,又借助Kimi的数据完成后训练起步。Thinking Machines也坦然承认:Inkling并非目前表现最强的模型,无论开放模型还是闭源模型。

Benchmark数据:性能落后,价格更高

具体数字对比鲜明。在人类最后的考试(Humanity's Last Exam)纯文本评测中,Inkling得29.7%,Kimi K2.6和GLM 5.2分别达到35.9%与40.1%;加上工具后Inkling升至46%,仍低于Kimi K2.6的54%和GLM 5.2的54.7%。在考察真实软件工程能力的SWE-Bench Pro中,Inkling为54.3%,Kimi K2.6是58.6%,GLM 5.2达到62.1%。差距在Terminal Bench 2.1上最刺眼:Inkling仅63.8%,Kimi K2.6和GLM 5.2分别有71.3%和82.7%。

价格方面同样未给惊喜。Tinker平台上64K版本每100万Prefill Token收费1.87美元、每100万Sample Token收费4.68美元,且已是限时五折价;256K版本分别涨至3.74和9.36美元。对比Kimi K2.6官方API输入0.95美元、输出4美元,GLM 5.2为1.4和4.4美元,Inkling的预填充价格接近Kimi K2.6的两倍。

OpenAI校友会的特殊身世

Thinking Machines几乎堪称OpenAI校友会。2025年2月亮相时团队约30人,三分之二来自OpenAI,其余主要来自Meta和Mistral,创始阵容包括John Schulman、Barret Zoph、Lilian Weng等人,路透社称穆拉蒂从前东家挖走至少20名研究人员。穆拉蒂本人2018年加入OpenAI,参与过DALL-E、Codex、ChatGPT和Sora,2022年升任CTO,2023年11月董事会罢免Altman后还短暂出任临时CEO。

这样一群最懂OpenAI的人离开后,外界本期待一条带着OpenAI印记的路线,结果最明确的技术来源却指向中国模型。但需注意:OpenAI近年前沿模型全部闭源,外界拿不到权重,也不了解完整架构与训练方案;DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究复用。Inkling本身也是开放权重模型,从DeepSeek、Kimi等开放模型吸收成熟方案,是顺理成章的工程选择。

贵替背后的商业计算

真正的问题是:为何Thinking Machines吸收了现成架构和训练经验,做出的Inkling却性能更弱、价格更高?

按公司拿到的待遇,这本不该只是一款"够用"的模型。2025年7月,公司尚未推出任何产品,就完成20亿美元种子轮、估值120亿美元,投资方包括a16z、英伟达、AMD和简街;四个月后新一轮谈判目标估值一度高达500亿美元。但从商业角度看,穆拉蒂可能从一开始就没打算用它争基准第一。

公司强调的是开放权重、多模态与可定制性,希望企业经Tinker微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准第一并不执着,企业更在意模型能否私有部署、能否掌握数据、能否按自己的业务继续训练。

政策东风创造的"贵替"市场

此前这类需求很大程度上被中国开放模型承接。OpenRouter数据显示,2026年2月以来,中国模型在美国企业经该平台调用的Token中每周占比都超过30%,最高一度达46%,而2025年上半年平均仅4.5%。Cursor开发Composer2时选了Kimi K2.5,桥水基金通过Tinker微调阿里Qwen,以更低成本超过部分顶级闭源模型。

但美国对中国AI模型的监管氛围正在收紧。相关部门已围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业受到调查。政策不确定性足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。

这正是Inkling的市场空间:它是一款美国公司开发、采用Apache 2.0、支持私有部署和定制的开放权重模型。美国企业选它,不必担心使用中国模型引发的政治争议,也更容易通过合规审查。Inkling真正的价值来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果,转化成一款由美国公司提供的模型。它不需要在基准里击败中国模型,只需成为那些不敢继续用中国模型的美国企业可以接受的选择。

这也解释了它为何敢定更高价:政策替它缩小了竞争范围,性能与价格的差距便没那么致命。对一些美国企业来说,一款稍弱、稍贵但风险低的模型,已经足够。

结构性代价谁来承担

从这个角度看,Inkling反而证明了穆拉蒂懂做生意。但这套生意成立的代价,可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek,在更强更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品,基础模型的能力差距会继续传递到微调后的产品,最终形成结构性竞争劣势。

华盛顿原本想用限制保护美国AI公司,结果可能先替Inkling这样的"贵替"创造了市场。对穆拉蒂来说,一般般已经够了;对美国AI产业来说,这份"够用"意味着成本升高与竞争力下降。