Kimi K3模型发布及其技术特性

月之暗面近日发布新一代开源模型Kimi K3,其参数规模达到2.8万亿,成为目前全球参数规模最大的开源模型。在技术架构上,Kimi K3基于Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 构建,旨在优化信息在深层模型和长序列中的流动。此外,模型扩大了Mixture of Experts (MoE) 的稀疏度,在结合Stable LatentMoE框架后,可从896个专家中高效激活16个。这些结构性改进使Kimi K3相比K2的整体扩展效率提升约2.5倍。

在能力表现方面,Kimi K3具备较强的长程编码能力,能够处理大型代码库并协调使用终端工具。在内核优化竞技场的测试中,Kimi K3在最大思考强度下的表现接近Fable-5,并明显领先于Opus 4.8、GPT-5.6 Sol和GPT 5.5。同时,该模型能够从零构建类Triton编译器MiniTriton,在部分工作负载性能上优于Triton。

核心技术研究与团队贡献

支撑K3的重要技术Attention Residuals于今年3月以论文形式公开。该论文的共同一作包括Kimi核心成员苏剑林、Kimi Linear架构第一作者张宇,以及一名17岁的实习生陈广宇。苏剑林表示,张宇和陈广宇在初步实验结果后参与验证,并共同提出了Block Attention Residuals设计,该方案通过将层划分为多个区块并压缩信息,在保留效果的同时降低了计算和通信成本。

市场反应与行业争议

Kimi K3上线后引发了显著的市场波动。7月19日,月之暗面公告称因用户请求量大幅超出预估导致算力资源紧张,暂停开放新用户订阅以保障现有用户。在定价上,Kimi K3的输出价格为每百万Token 15美元,低于Fable 5的50美元。

该模型的发布在硅谷引起讨论。英伟达创始人兼CEO黄仁勋在X平台发布联名公开信《开放权重与美国AI领导力》,与微软、Meta等20多家机构共同支持开源AI,认为开源能增强竞争并提升安全性。然而,OpenAI和Anthropic则指控中国公司利用“模型蒸馏”技术窃取知识产权,并游说美国官员,美国财政部也表示将进行调查与制裁。

用户应用与交互建议

针对Kimi K3的使用,有分析指出其相比K2更像一个“能自己多想三步的协作者”。建议用户采用“三明治提问法”,通过提供明确的目标、背景和约束来触发其更强的推理模式。