17611538698
webmaster@21cto.com

月之暗面 Kimi-K3 正式发布,第一个 3 万亿参数的开放权重模型

Open Source AI Model Kimi K3 Challenges Closed AI Systems

21CTO导读:月之暗面发布Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA和AgentEnv。

7 月 28 日,月之暗面在 HuggingFace 上正式开放Kimi-K3权重。

这款 3 万亿参数大模型,是全球首款迈入 3T 量级的开源基座,一举拉高了开源模型的规模天花板。

全新架构登场,瞄准仓库级代码与复杂智能体


Kimi   K3总参数规模达2.8万亿,激活参数1040亿,是全球首个迈入3万亿参数级别的开源模型。模型基于混合专家(MoE)架构,在896个路由专家中每个Token仅激活16个。

架构上采用自研Kimi  Delta Attention(KDA)混合线性注意力机制与Attention  Residuals(注意力残差)技术,原生支持视觉理解,上下文窗口达100万Token。相比上一代Kimi K2,整体扩展效率提升约2.5倍。

图片

技术报告披露,Kimi  K3在编程、智能体、推理与视觉等数十项基准测试中超越所有开源模型及多数闭源模型。在Arena Intelligence的WebDev  Arena中,Kimi K3以1679 Elo登顶,成为首个在该榜单夺冠的开源模型;Artificial Analysis  Intelligence Index v4.1得分57.1,排名全球第四。报告同时指出,其整体性能仍略逊于Claude Fable  5和GPT-5.6 Sol。

此次开源尤为值得关注的是Kimi K3在GPU与芯片算力层面展现的自主工程能力。

技术报告显示,在GPU内核优化测试中,Kimi  K3在24小时内独立完成了AttnRes、DeepSeek Sparse  Attention、KDA和MLA四种代表性内核的优化。其中AttnRes延迟从283.6毫秒降至114.4毫秒,DSA和KDA运行时间分别减少55.1%和73.6%,MLA接近峰值TFLOPS。该表现与Claude  Fable 5持平,显著优于Claude Opus 4.8、GPT-5.6 Sol和GPT-5.5。

需注意的是,测试环境同时覆盖了NVIDIA H200与来自其他供应商的GPGPU,意味着Kimi K3的部署能力已不局限于英伟达生态。

报告还显示,Kimi K3自主开发了名为MiniTriton的紧凑型GPU编译器,从Python前端到PTX代码生成全链路均由模型完成,在NVIDIA L20上性能超越PyTorch eager、torch.compile和标准Triton实现。

在预发布之前,消息已经速卷海外开发者社区,Hacker News 评论区反复出现同一个词:historic(历史性)

有用户 davidkunz 写下具有代表性的判断:

“这是历史上第一次,一款开放权重大语言模型站上行业性能顶端。”

极高硬件门槛:普通人无缘本地运行,云厂商成为主力玩家


技术层面最受行业关注的焦点,是高昂的推理部署成本。模型原生采用 FP4 精度存储,仅权重本身就需要约 1.5TB 显存承载。想要稳定生产级部署,至少需要 16 块 B200 加速卡组成集群。这道硬件门槛直接将个人开发者挡在门外,只有具备大规模算力储备的云服务商才有能力落地运行。

开发者 NitpickLawyer 完成详细测算后点评:本次开源将提供一份关键第三方基准数据,用来核算 3T 规模模型真实推理成本。借此市场可以清晰判断,各大厂商对外的 API 定价,究竟是正常营收,还是依靠资本补贴抢占市场。

基准评测数据目前仍相对有限。现有 AISI 网络安全赛道测试显示,Kimi-K3 性能超越 GLM 5.2,但和全球第一梯队闭源模型仍存在差距。

即便如此,开源本身已经改写赛道规则。

用户 m00dy 一语点破后续走向:“围绕这个基座将会掀起激烈竞争,拭目以待 AI 服务商能把 Token 价格压到多低。”

价格战提前打响,开源基座搅动整条产业链


事实上,大模型 API 价格战早已拉开序幕。

网友 gorgmah 观察到,自 6 月 16 日 GLM 5.2 开源发布以来,市场竞争推动其 API 报价下调大约 45%,降价趋势仍在持续。他预判:很快会出现服务商以低于电费、硬件折旧的成本价对外售卖 Token。

社区同样存在理性的担忧。用户 torginus 提醒风险:部分厂商可能在用户不知情的情况下,采用劣质量化版本压缩成本,牺牲模型原生能力换取低价。开发者 woctordho 则聚焦微调工程实践:LoRA + bnb 4-bit 方案正逐步被 GGUF 取代,但面对 Kimi-K3 这种体量,单卡微调完全不具备可行性,多 GPU、多节点分布式训练才是最低准入底线。

从 K2 系列到 K3:中国 AI 厂商全力押注开源路线


月之暗面此前依靠 Kimi-K2.5、K2.6、K2.7-Code 系列,在代码理解、长程推理赛道积累扎实口碑。本次 K3 直接跃升至 3 万亿参数级别,从产品定位到开源策略,释放出清晰信号:中国 AI 企业正在开源赛道重兵投入。

过往顶尖超大基座长期掌握在闭源巨头手中,如今开源阵营拿到同量级选手,全球 AI 产业链的博弈天平迎来变动。

权重下载通道即将开启,接下来最大看点,就是各家云厂商谁能率先完成适配、上线 Kimi-K3 对外服务了。

作者:万能的大雄

评论

我要赞赏作者

请扫描二维码,使用微信支付哦。

分享到微信