鹤啸九天 自律更自由,平凡不平庸 Less is More

月之暗面 Kimi 大模型

2026-07-16
阅读量

Notes(温馨提示):

  1. ★ 首次阅读建议浏览:导航指南, 或划到本页末尾, 或直接点击跳转, 查看全站导航图
  2. 右上角工具条搜索文章,右下角二维码关注微信公众号(鹤啸九天),底栏分享、赞赏、评论
  3. ★ 转载请注明文章来源,知识点积累起来不容易,水滴石穿,绳锯木断,谢谢理解
  4. ★ 如有疑问,邮件讨论,欢迎贡献优质资料


月之暗面 Kimi 大模型

Kimi(月之暗面 Moonshot‑AI)

总结

Kimi全系列大模型

正式发布时间 模型名称 参数规格 上下文窗口 核心定位&关键特性 官方仓库 & 技术报告链接
2023‑10 初代Kimi‑Chat(初代基座) 未公开 初始8K,后续升级至20万汉字 首款C端对话助手,依靠超长文档读取出圈 早期闭源、无公开技术文档
2025‑01 Kimi‑k1.5 未披露 128K 搭载Long‑CoT长思维链,强化数学、代码、多模态推理 闭源,仅博客官宣资料
2025‑04 Kimi‑VL(Moonlight‑16B‑A3B) 16B‑MoE、激活3B 128K 轻量化开源图文多模态模型 GitHub开源仓库
2025‑07‑11 Kimi K2(Base基座 / Instruct‑0905) 总1T、激活32B MoE 128K,后续升级至256K 国内首个万亿参数开源基座,包含基座、指令微调版本 仓库:https://github.com/MoonshotAI/Kimi‑K2
技术报告PDF:https://github.com/MoonshotAI/Kimi‑K2/blob/main/tech_report.pdf
2025‑10 Kimi‑Linear 48B‑MoE、激活3B 128K 低延迟轻量化推理专用模型 内部工程版,无独立公开报告
2025‑11 Kimi K2‑Thinking 继承K2‑1T MoE 256K 深度推理、工具调用、长思维链专项版本 依附K2仓库、增量文档
2026‑01 Kimi K2.5 万亿级MoE 256K 原生多模态视觉、Agent智能体集群、代码能力优化 仓库:https://github.com/MoonshotAI/kimi‑k2.5
2026‑04 Kimi K2.6 万亿级MoE 256K 旗舰通用模型,思考/普通双模式、图文输入、Agent任务 依附K2.5仓库更新日志
2026‑06 Kimi‑K2.7‑Code / K2.7‑Code‑highspeed 万亿级MoE 256K 专业代码模型,高速版峰值260 token/s Hugging‑Face模型卡片公开资料
2026‑07‑16 Kimi K3(当前最新旗舰) 总2.8万亿参数MoE、激活约104B 100万token 顶级原生多模态旗舰、超长上下文、工程深度推理、完整权重开源 GitHub仓库内置k3‑tech_report.pdf技术报告

备注

  1. K2 开始月之暗面正式对外发布完整PDF官方技术报告;前代k1.5、初代Kimi‑Chat、Kimi‑Linear只存在产品官宣博文,没有独立正式技术文档。
  2. K2.5 / K2.6 / K2.7‑Code 均属于K2基座的迭代衍生版本,技术文档继承主仓库、发布更新说明,无独立完整版报告。
  3. K3为全新一代原生多模态MoE架构,配套独立完整的架构、训练系统、基准评测工程报告。

需要我单独整理K2‑K3两代技术报告要点对比清单吗?

苏剑林

【2026-8-1】苏剑林的时代

  • 2026年7月17日凌晨,上海,世界人工智能大会开幕前夜,月之暗面放出了Kimi K3——2.8万亿参数,迄今全球最大的开源模型。几个小时后,它登顶国际代码评测榜单
  • 架构创新—— KDA 与 Attention Residuals

2025年11月,Kimi Linear 问世:其核心 KDA(Kimi Delta Attention)首次在公平比较下,让线性注意力在短上下文、长上下文、强化学习三种场景中全面超越全注意力,KV缓存减少75%,百万级上下文解码吞吐提升6倍。苏剑林名列作者之中。

Kimi Linear采用「NoPE」设计——没有位置编码。KDA 门控机制本身就对序列的顺序和远近天然敏感,可以内在地、自适应地学习位置信息,「其通道级的多样性甚至比RoPE更灵活」,还能天然解决RoPE在长上下文外推时的烦恼。

媒体的标题写得很直白:「革了自家RoPE的命。」

2026年3月,Attention Residuals(AttnRes)发布:用层间注意力替代统治深度学习十余年的残差连接,跑通了48B模型、1.4万亿token的预训练,马斯克转发赞叹。37位署名作者中,苏剑林与陈广宇、张宇三人位列最前的共同一作。

苏剑林从未留过洋,从未读过博,本科和硕士都在离「AI中心」很远的地方。他没有履历上的任何一条捷径,他的武器只有一样:从15岁起,十八年如一日,把每一个想不明白的问题写成博客,推到不能再推为止。

  • 1993年,苏剑林出生在广东云浮的小村庄。
  • 2006年9月,13岁第一次接触电脑
  • 2007年1月第一次上网,4月就泡进了BBS论坛,还自己动手搭过一个IT论坛——然后,他发现IT让自己「疏远了科学」。
  • 2008年9月,15岁的他做决定:重新专注科学。「科学空间」博客诞生了
  • 2012年,高中毕业时,他在自述里写道:「以前我很内向、腼腆,现在相对来说开朗了很多……数学依然是我的核心,我爱好物理,陶醉于天文。」
  • 2012年10月,刚进大学(华南师范大学数学科学学院), 苏剑林读到孟岩的《理解矩阵》。悬念:相似矩阵公式有一个非常直观的证明,「可是就没有后文了」。「我没有跟他联系过,但是我一直也在寻求这方面的直观理解。」苏剑林写道。最后给他答案的,不是数学书,而是一本物理书——《群论与量子力学的对称性》。于是他写下《新理解矩阵》系列:从「矩阵是什么」,到行列式,再到相似矩阵。他不满意教材「从解方程组引入行列式」的讲法,因为那会「让读者走进一个误区,认为线性代数就是研究解方程组的」, 博客里的系列文章,在此后十几年里被无数中国大学生疯转、引用、打印,成为中文互联网上线性代数的经典启蒙。
  • 中山大学研二,苏剑林「不务正业」,把大量时间投进了机器学习,尤其是自然语言处理。自述里自嘲:「明明要学基础数学,偏偏不务正业,沉溺神经网络,妄想人工智能。」当大多数工程师把深度学习当作调参的手艺时,这个数学系的学生看到的是另一层东西:注意力机制里的内积几何、优化器里的微分方程、概率模型里的对称与守恒。
  • 2019年7月,苏剑林硕士毕业,加入深圳的追一科技。那一年他开源了bert4keras——一个让无数中文NLP工程师如获至宝的框架;第二年,他发布了词粒度的中文预训练模型WoBERT和WoNEZHA
  • 2020年初,追一科技开始伤筋动骨的收缩:算法团队从五十多人精简到十几人,核心骨干纷纷离开。商业化的紧迫压过了研究的浪漫,这家曾经星光熠熠的公司,在GPT狂潮到来之前提前退场了。
  • 博客叫《Transformer升级之路:2、博采众长的旋转式位置编码》,提出的方法叫RoPE(旋转位置编码),随后论文RoFormer挂上arXiv。RoPE 是数学家的思想:「通过绝对位置编码的方式实现相对位置编码」。借用复数相乘的几何特性,让每个位置对应旋转——绝对位置被编码为旋转矩阵,而在注意力的内积中,相对位置又自然浮现。旋转带来一组优美的性质:序列长度灵活、token间依赖随距离衰减,还是当时唯一能用于线性Attention的相对位置编码。
  • 2023年,Meta的LLaMA采用了RoPE;随后是Qwen、DeepSeek……今天,几乎每一个主流大语言模型的体内都运行着这组旋转矩阵。Qwen2.5的技术报告里,引用的甚至是苏剑林的博客文章。RoFormer论文被引超过6800次,正式发表于期刊Neurocomputing。

数学成果的命运与诗相似:写出的时刻无人喝彩,流传开来又无人署名

K3

2026年7月16日,发布 Kimi K3

模型

Kimi‑K3 核心参数

  • 总参数:2.8 万亿 MoE,激活约 104B
  • 上下文窗口:100 万 Token
  • 原生多模态视觉、全新 KDA‑Delta‑Attention 架构

Kimi K3 技术报告信息量非常大,内容横跨模型架构、pre-training、post-training、训练系统和在线 serving。

总体来看,Kimi K3 同时推进三件事:

  • 把开源模型的 pre-training scale推到 3T 量级;
  • context window扩展到 1M token;
  • Agentic RL rollout延长到数百、数千次 tool call。

这三件事会互相影响。

  • 模型更大以后,MoE 的负载和显存更难控制;
  • context 更长以后,attention、KV cache和通信都会变重;
  • RL的trajectory 变长以后,模型 state、sandbox state 又必须跨多个 RL iteration 保存。

K2 vs K3

K3 的 total parameters 增长了 167%,activated parameters 增长了 220%。

hidden dimension 仍为 7,168,扩展主要发生在 layer 数、attention heads、expert 数量和每个 token 激活的 experts 数量上。

架构图:

  • sequence 方向由 KDA 和 MLA 做token-mix;
  • depth 方向引入 Attention Residuals;channel 方向使用 Stable LatentMoE。
  • MoonViT-V2 支持原生多模态输入,同时处理图片和视频。视觉 features经过 projector后,与文本进入同一个backbone。
项目 Kimi K2 Kimi K3
Total parameters 1.04T 2.78T
Activated parameters 32.6B 104.2B
Layers 61 93
Routed experts 384 896
Active experts / token 8 16
Attention MLA 69 KDA + 24 MLA
Training context 128K 1M

问题

为什么Kimi K3 做到 2.8T 的模型参数规模?

2.8T规模:窗口大、专家多

(1)上下文窗口扩展到百万级 → 注意力效果/性能如何改进?MoE

  • 注意力效果:KDA混合注意力、NoPE的Gated MLA
  • 注意力性能:计算量大、显存占用大→AttnRes 残差注意力

(2)专家多→负载均衡问题

  • Stable LatentMoE、改进SiTU-GLM、QB分位数路由

总结

  • 1️⃣ 使用 KDA 混合注意力机制,搭配NoPE的Gated MLA,模型无需任何插值、缩放改造,原生直接外推至 100 万上下文;
  • 2️⃣ 通过 AttnRes,将完整网络进行分块,在块与块之间做跨层注意力聚合,块内部沿用轻量化计算,大幅减少显存占用;
  • 3️⃣ 采用Stable LatentMoE,通过改进的SiTU-GLU 激活函数和QB 分位数均衡路由,可以大幅增加专家数量,并保证专家负载均衡

AttnRes和SiTU‑GLU解决什么数值问题

AttnRes 注意力残差改造、SiTU‑GLU激活,二者分别解决深层模型训练里的哪一类数值问题?

  • AttnRes:改造注意力残差传递路径,缓解深度堆叠后信号衰减、梯度消失,保障深层网络不会遗忘早期上下文信息。
  • SiTU‑GLU:改进门控激活,兼顾近似线性区间与数值边界约束,解决深层激活值无界漂移、训练不稳定。

二者分别从残差通路、激活数值两个维度提升深度模型训练稳定性

NoPE

Kimi K3 的 MLA layer 没有显式做 position encoding,这样设计有2点考虑:

  • KDA 的 recurrent gate 和 decay 已经提供了顺序、距离衰减等位置信号。
  • 对于causal attention的causal mask本身就蕴含位置信息。
  • 因此MLA 层可以集中处理 global content interaction,也简化了 context extension

苏剑林科学空间解答

为什么 Kimi‑K3 属于原生多模态

定论:

  • 嫁接式多模态 = 现成文本大模型外接独立 ViT;
  • K3 原生多模态 = 图文、视频从零一起训练、共用一套 Transformer 主干、共享嵌入空间
  • 1、视觉编码器从头训练,不借用外部预训练权重
    • 上代 Kimi‑K2.5 的 MoonViT 依赖 SigLIP 对比学习权重初始化;
    • K3‑MoonViT‑V2 从零开始、使用「下一词预测(语言建模目标)」联合预训练,视觉特征天生适配主干网络表征空间,不再需要后期费力对齐图文特征。
    • 普通外接式 VL(LLaVA、旧 Qwen‑VL):ViT 单独对比预训练 → 固定权重 → 对接语言大模型,两套特征空间。
  • 2、所有模态共用唯一主干网络(最关键区别)
    • 文本 token、图像 patch‑token、视频帧 token,经过轻量化投影层之后,送入同一套 KDA+Gated‑MLA 混合注意力主干;
    • 93 层 Transformer 每一层,文本、图片、视频特征全程做跨模态注意力交互;
    • 不存在 “独立视觉编码器、独立语言主干” 两套割裂网络。
    • 外接式多模态:ViT 提取图片特征之后,只在最浅层拼入 LLM,深层主干只做文本运算,深层很难进行精细跨模态推理。
  • 3、预训练阶段图文视频数据永久混合
    • K3 在整体超大混合预训练流程里面,固定配比持续投喂文本、图片、视频样本;
    • 视觉知识和语言知识同步塑造主干网络权重,不是先训完纯文本大模型,后期硬插上视觉模块36氪。
  • 4、支持模态闭环的 Agent 原生链路
    • 图文、代码、截图、视频处在同一个 token 流:
    • 模型可以编写绘图代码、读取输出截图、观察视频结果、迭代修改代码。
    • 嫁接式多模态,视觉模块和语言模块相互隔离,很难流畅完成这种多模态闭环任务。
  • 5、整套架构原生适配 NoPE 无位置编码
    • 主干 KDA 线性注意力、NoPE 时序机制同时服务文本、图像、视频 token,位置表征机制为多模态整体统一设计,不是文本模块专属配置

结束


支付宝打赏 微信打赏

~ 海内存知已,天涯若比邻 ~

Share

Related Posts

标题:Loop Engineering 循环工程

摘要:硅谷新兴概念,新一代Agent框架 Loop Agent实现

标题:Graph Engineering 图工程

摘要:新兴概念,Graph Engineering

站内可视化导航

文章可视化导读:鼠标划过图形块时,如果出现蓝色光环, 点击即可跳转到对应主题

Comments

--disqus--

    Content
    My Moment ( 微信公众号 )
    欢迎关注鹤啸九天