Kimi算力告急,杨植麟也“冲高”

K3突然走红,却让Kimi不得不按下暂停键。

7月19日深夜,月之暗面Kimi团队发布公告,称Kimi K3上线48小时内,用户量远超预期,由于算力紧张,暂停了新用户订阅,并将有限算力优先分配给现有订阅用户。

会员制度随之调整,分为Kimi主权益与Code权益,以更合理地分配资源。官方之后解释,没有调整会员体系,只是在有限算力下平衡用户体验。

也就是说,K3火到导致算力“熔断”,Kimi只能拒绝新用户,专注服务老用户。

Kimi的“韬定律”

当前,许多模型厂商都在努力扩大用户规模,通过免费、降价等手段吸引新用户。相比之下,Kimi的反向操作显得特别。

不过,模型越强、上下文越长、用户调用越频繁,对推理算力的需求就越高。在“K3请求量已接近现有算力集群的极限”时,Kimi也遇到了“豆包式”的烦恼:C端用户虽多,但收入贡献不明显,但对GPU的压力持续增大。

作为月之暗面首款3万亿参数级MoE模型,K3总参数规模达2.8万亿。按常规理解,此规模模型每次运算都会消耗巨大算力。但凭借其独特核心架构,K3达成了华为在芯片领域提出的“韬定律”效果。

这个架构被视为强大引擎,落地了三项关键技术创新:KDA(Kimi Delta Attention)混合线性注意力、注意力残差技术,及高稀疏度MoE设计,将每一分算力转化为模型效果的效率推向新高度。

长期以来,芯片行业依赖摩尔定律,靠缩小晶体管尺寸提升性能。但随着先进制程逼近物理极限、成本飙升,单纯堆叠硬件的增长模式已显疲态。

华为近期提出的“韬定律”,跳出“空间压缩”的传统思路,转向“时间压缩”全新路径:通过逻辑折叠、三维结构堆叠、全链路架构优化,缩短信号传输延迟、减少数据搬运冗余,使得在成熟制程上也能达到媲美先进制程的能效提升。

其核心方法论是:在硬件受限或成本控制下,通过体系级架构创新实现性能突破。

笔者认为,K3采用的KDA混合线性注意力技术,正是AI领域的“韬定律”具体实践。

要知道,Transformer架构的注意力计算部分最吃算力。传统注意力计算复杂度与序列长度呈平方关系变化,百万级上下文任务中,大量算力被用于维护长序列的注意力矩阵。KDA机制通过混合线性与标准注意力比例,将计算复杂度从平方级降至线性级。

月之暗面此前发布的技术报告显示,实验模型上采用KDA与MLA混合方式后,KV缓存占用可最高削减75%。上下文长度达100万时,解码吞吐量是基准的6倍。配合注意力残差与高稀疏度MoE技术,训练效率可提升约25%,追加成本不足2%。

这是对“模型生产效率”的全新定义。若说硅谷主流的Transformer路线是依靠“高投入带来高回报”的燃油车模式,KDA技术则更像是追求“极致热效率”的混合动力引擎。

SemiAnalysis的分析报告显示,KDA技术使推理速度提升300%,同时长上下文处理性能仍接近标准Transformer。这意味着同等算力下,K3能产生更多高质量智能输出结果。

开发者社群的实测反馈进一步印证,K3在长流程Agent任务和代码生成应用中表现出色,具备了同国际顶尖模型竞争的实力。

从根本上讲,K3依然遵循缩放定律,但打法已根本性改变——瞄准了原有算法中的浪费环节。当硅谷AI企业仍在持续采购GPU、盲目堆叠算力时,Kimi通过重构算法脉络、消除计算冗余,在有限算力资源下实现了性能与效率的平衡,开创了“每瓦特智能产出比”最大化的发展路径。

这一创新令华尔街观察家和专业投资人感到意外。他们像看待DeepSeek那样,再次发问:硅谷数万亿美元AI投资真的能获得预期收益吗?美国AI技术的领先优势是否正在被削弱?

与此同时,企业应用开发者开始关注AI使用成本。部分开发者已经开始采用“模型路由”(Model Routing)服务,由系统自动匹配各任务场景下成本最低、性能最优的AI模型,这其中自然也包括Kimi。

杨植麟的“摸高”战略

回顾来看,Kimi算力资源紧张实则是技术成功引发的后果:模型效率提升导致单次使用成本降低,反而刺激了用户需求的暴涨。

7月11日,智谱创始人唐杰公布了“Touch High摸高计划”,明确表态“未能登顶即视为失败”,并承诺未来两年将摒弃短期商业化考量,集中投入AGI四大核心技术方向,并打算筹集百亿级资金以突破机械可解释性技术的研究瓶颈。

可以说,智谱“摸高”是上市后的关键抉择。其目标是通过对技术极限的冲击,夯实“全球大模型第一股”的市场叙事,以此缓解现实发展中的焦虑情绪。

从杨植麟的决策中,也能看出Kimi在三个维度上的“摸高”尝试:

首先是在算力思维上实现突破,从流量导向转向价值导向。公开资料显示,Kimi的API业务占比已经超过70%,与此前主要依赖C端订阅的用户模式形成鲜明对比。暂缓新用户引入、优先服务老用户,本质上是将有限算力向高价值场景倾斜,避免泛C端流量挤压已转为收入支柱的B端业务配额。

但这个策略代价同样明显。“优先保障存量用户”的执行标准存有不确定性,哪些请求会被优先响应、哪些会被降级处理,一旦操作不当都可能损害用户信任度。

长远来看,Kimi若要完成从技术新秀到成熟AI头部企业的蜕变,就必须加强弹性算力池建设、完善分级响应机制、提升动态调度能力等基础设施能力。

其次是定价层面的突破,Kimi正在进行从基础自助服务到价值分层体系的压力测试。公告中提及的“拆分Kimi主权益与Code权益”举措,既是解决当前算力短缺的临时方案,也可能预示着其定价体系重构的序幕拉开。

过去无论用户进行代码编写、资料查询还是闲聊互动,均按照相同标准收费、占用相同算力资源。随着高算力消耗的Code用户比例攀升,这种模式必然会造成结构性失衡。

Kimi借机将会员权益拆分,实质是基于使用场景的差异化定价策略:轻度用户享受基础服务,重度用户需为高阶能力支付额外费用。

这是通过价值用户分层的方式,在积极探索模型产品的定价主动权。目前,K3收费标准已达到每百万Token 2.3美元,虽低于海外顶级模型,但已创国产大模型价格新高。

或许,Kimi也希望借此机会宣告:高性能模型同样具备市场定价能力。未来大模型市场竞争将更多地转向基础设施构建和成本控制能力的比拼。

这一步比抢占技术榜单排名更难,也离商业本质更近。

第三维度是位置跃迁,Kimi从区域变量演变为行业定价参考点。K3发布后迅速引发全球范围关注。在权威AI模型评测机构Artificial Analysis最新发布的“智能指数(Intelligence Index)”中,K3综合得分57分,位列全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),超越Claude Opus 4.8(56分)。

这一成绩也打破了“开源模型落后闭源模型半代”的行业通说。

同时,K3的影响力已跨出技术圈层。美国科技投资界视其为AI发展的关键转折点,认为高质量开源模型正在加速技术扩散进程;加州大学伯克利分校计算机科学教授更宣称,K3将中国开源模型与美国顶尖模型的差距缩短至2-3个月。

资本市场反应同样剧烈,K3发布首日,英伟达单日市值蒸发约1111亿美元;摩根大通策略师在研报中直接将K3称为“DeepSeek 2.0”。

这个速度变化才是改变定价逻辑的关键因素。

此外,月之暗面ARR(年化收入)到6月已达3亿美元量级,海外市场增速400%,在提价60%后收入仍持续增长,这三组数据均表明Kimi的“开源+效率”模态具备规模化变现潜力。

最新披露消息显示,月之暗面正计划最快在半年内于香港上市,估值同期从43亿美元跃升至315亿美元,涨幅超过7倍。

这些都是资本市场给予非硅谷主流发展路线的“官方认证”。投资机构为“能实现单位经济模型的SOTA”下注时,也意味着Kimi建立了独立估值逻辑,无需再以OpenAI或Anthropic为参照物来证明自身价值。

但K3距离AGI目标仍相距甚远。比如基准测试显示,K3与Fable 5仅相差3分,背后仍存在明显差距。

另外,Kimi在技术白皮书中也披露了两个部署层面的不足:其一,K3训练过程中会完整保存思考历史(thinking history),若调用者未能正确传递前序推理过程,或在会话中切换模型,输出质量会显著劣化;其二,K3在任务定义模糊时会表现出过度主动倾向,更倾向于替用户做决策。这种“自作主张”特性在需要精确执行的工程应用场景中,易引发连锁错误反应。

还有个容易被忽视但至关重要的隐患:幻觉问题。Artificial Analysis在测评时特别指出,K3的幻觉率较上一代K2.6反而有所增长。

某种程度上,K3的亮眼成绩与潜在隐忧,映射出整个行业算力供需失衡的现实情况,也折射出中国AI产业在算力硬件瓶颈、商业化闭环不完善、用户期待值过高等多重压力下的发展阵痛。

这些AI企业每次遭遇算力超载后的“熔断”现象,都是中国AI产业在“摸高”道路上必须跨越的门槛。可以预见的是,新一轮竞争将围绕算力展开,从单纯比拼模型能力转向比拼算力基础设施与成本控制能力。

谁能在算法、算力储备等基础领域构建出领先优势,谁才能最终胜出,并重新定义下一代AI公司的生存标准。

参考资料:

字母榜,《K3发布48小时》

锦缎,《都怪Kimi》

我是唐辰同学,专注互联网科技及AI新经济领域。本内容为原创,未经许可请勿转载。

「唐辰同学」

钛媒体、36氪、老虎财经热榜

澎湃新闻2024年度最澎湃创作者

老虎财经2024优秀专栏

河南日报·顶端新闻2024年度影响力作者

界面新闻优质内容榜单

腾讯新闻年度优秀热问答主

2023搜狐新闻年度优质创作者

人人都是产品经理2023年度优秀作者

2023网易新闻年度内容合伙人

界面、36氪、钛媒体、澎湃、21财经、蓝鲸等平台专栏签约作者