Kimi K3开源及其技术突破
月之暗面公司于7月27日正式开源Kimi K3模型,并发布模型权重、技术报告及MoonEP、FlashKDA和AgentEnv三项关键基础设施技术。Kimi K3是一款总参数规模达2.8万亿、激活参数1040亿的MoE(专家混合)架构模型,是全球首个突破3万亿参数门槛的AI系统。该模型采用自研的Kimi Delta Attention混合线性注意力机制与注意力残差技术,上下文窗口支持100万Token。
在性能表现方面,Kimi K3在Arena Intelligence的WebDev Arena榜单中以1679 Elo登顶,在编程能力测评中超越了Claude Fable 5和GPT-5.6 Sol等闭源模型,成为首个夺冠的开源模型。此外,Kimi K3在硬件优化上展现出自主工程能力,在NVIDIA H200及非英伟达生态的GPGPU上均取得成效。其研发的MiniTriton编译器在NVIDIA L20测试中性能超越了PyTorch eager、torch.compile及标准Triton实现。
DeepSeek V4进展与市场动态
DeepSeek V4系列模型此前已推出预览版,包括总参数1.6T的V4-Pro和总参数284B的V4-Flash,全系支持100万token超长上下文,并深度适配华为昇腾系列芯片。在开发者选型中,DeepSeek V4 Pro被认为在推理能力和代码生成方面具有优势。
然而,据7月28日报道,DeepSeek V4正式版(V4 GA)的发布时间可能推迟至8月10日至20日之间。在融资方面,DeepSeek已口头通知部分潜在投资者,未来几天将暂停按原计划签署第二轮融资协议,而该轮融资原计划拟募集至少100亿元人民币,目标投前估值超过4800亿元人民币。
万亿参数MoE模型对比
目前,Kimi K3、DeepSeek V4 Pro和GLM-5.2均属于万亿参数级别的MoE模型。MoE架构通过路由器将输入分配给部分专家子网络,从而在提升参数规模的同时保持推理效率。
- Kimi K3:总参数2.8万亿,在处理200万字以上长文档时具有上下文长度优势。
- DeepSeek V4 Pro:总参数1.6万亿,在极致推理能力和代码生成方面表现突出。
- GLM-5.2:参数规模为7440亿,在中文场景优化和响应速度方面具有关注价值。
评论区
已通过 0 条 · 审核通过后展示