People knowledge base
杨植麟
月之暗面创始人 · 材料数 12 · 由 AI 人物知识库生成,旧观点不删只追加
杨植麟
- 身份:月之暗面(Moonshot AI)创始人;Transformer-XL 二作、XLNet 一作
- 一句话主张:把能源更高效地转成智能——竞争不在"谁卡多",在单位算力/单位 token 产出多少智能
- 利益位置:月之暗面创始人;在算力受限约束下,"效率路线优于堆卡"既是技术判断也是生存叙事,需按利益相关方降权
- 材料数:12(A 类本人 5,B 类公司报告 7)
- 最后更新:2026-08-07
本档分类纪律:Kimi Team 署名的技术报告不是杨植麟个人观点(K2 报告署名 199 人)。A/B 两类严格隔开:A=本人表达,B="他的公司实际在做什么"的行为证据。另一个信息本身就是信息:2019 年学术论文之后,仍未找到他任何署名书面材料——他的公开表达全部通过演讲与访谈。
观点账本
| 日期 | 观点 | 来源状态 | 观点类型 | 现实状态 | 材料编号 |
|---|---|---|---|---|---|
| 2019-01 | 上下文长度是智能的独立 scaling 轴(segment-level recurrence+相对位置编码) | A 一级·本人二作 | 技术主张 | 已成行业共识;本人路线连续七年未变 | Y-09 |
| 2019-06 | 预训练目标函数设计本身决定能力上限,非只堆数据 | A 一级·本人一作 | 技术主张 | XLNet 路线已被取代;但方法论延续至 MuonClip/KDA | Y-08 |
| 2026-03-20 | "token efficiency is not just about efficiency, it is actually also about improving the upper bound of intelligence"——高质量数据总量近似常数,提升 token 效率=等效扩大数据量 | A 半一级·本人原音,ASR 转写 | 技术主张 | K3 报告用 scaling-law 拟合给出 2.5× 效率增益,口径为验证损失,非端到端能力 | Y-01 |
| 2026-03-20 | 三条 scaling 维度:token 效率/长上下文/agent 数量(swarm) | A 半一级 | 技术主张 | K2.5 已上线 Agent Swarm | Y-01 |
| 2026-03-20 | "we're going to mix linear attention layers with full attention layers using a one to three ratio" | A 半一级 | 技术主张 | K3 实测 69 KDA + 24 MLA(约 2.9:1),与所述吻合 | Y-01, Y-10 |
| 2026-03-20 | swarm 可扩到 100 甚至 1000 个 sub-agent | A 半一级 | 预测,未验证 | K2.5 官方仅公布 sub-agent 最多 100 步,未公布并发 100 个 agent——媒体把本人展望和产品实测参数混成了一句话 | Y-01 vs Y-06 |
| 2026-03-26 | 大模型本质是"能源向智能的有效规模化转化";"2027 年 AI 将主导研究" | 半一级(知乎第三方整理,待核) | 技术主张/预测 | GTC 英文转写全文未出现 energy 与 2027——两条仅见于中关村论坛整理稿,未获第二独立信源 | Y-02 |
材料库(精选)
- Y-01|GTC 2026 主题演讲(2026-03,39 分 32 秒)|A 半一级:音频为本人原音,字幕为 YouTube 自动 ASR(31,742 字符转写)|https://www.youtube.com/watch?v=5CkCW1P-g88 (⚠️ 第三方搬运频道 Neural Intel Media,非官方)|可核原话:"one of our major pursuits is to build better open models…democratizing intelligence";"suppose you have 50 trillion high quality tokens…all of a sudden you have a two times token efficiency…it's almost like magic that you get equivalently 100 trillion tokens"|结构性发现:他本人从未主张纯线性注意力,明说是 1:3 混合。
- Y-02|2026 中关村论坛演讲(2026-03-26)|视频一级/知乎文字稿半一级|"能源转智能"与"2027 AI 主导研究"均未在 GTC 场合重复,维持"待核"。
- Y-08|XLNet(2019-06,一作)、Y-09|Transformer-XL(2019-01,二作)|一级|Y-09(2019)→Kimi Linear(2025)→K3 KDA+AttnRes(2026)构成七年不变的长上下文主线——比任何演讲更能说明其真实押注。
- Y-04|Kimi K2 报告(2025-07,署名 199 人)|B 级|1T/32B MoE;15.5T token;MuonClip 零 loss spike。他在 GTC 亲口讲了 QK-Clip 动机,报告与本人表述直接对应。
- Y-05|Kimi Linear/KDA(2025-10,署名 60 人)|B 级|48B/3B;自报 KV cache 省约 75%、1M 解码提速约 6×;"超过 full attention"指混合架构(1:3)超过全 full attention,不是纯线性打赢全注意力。
- Y-06|Kimi K2.5(2026-01)|B 级|README 直核:三条媒体说法证伪/纠错——无"MoonViT-3D";59.3 是分数不是提升幅度;100 是 sub-agent 步数不是 agent 数。
- Y-10|Kimi K3 技术报告(2026-07,47 页已全文抽取)|B 级|2.78T 总参/104.2B 激活(较 K2 +220%);69 KDA+24 MLA;1M 上下文;2.5× 是拟合 scaling-law 曲线上"同一验证损失所需 FLOPs 之比",不是端到端能力/成本比——媒体当后者讲是错的;Swarm Bench 等为公司自建基准,分数不可外部复现。
- Y-11|开源组件矩阵|Kimi-K3 8,153★、Attention-Residuals 3,449★、Kimi-Linear 1,558★、FlashKDA 1,172★等|行为含义:把架构组件单独开源而不只发权重,使"效率路线"具备外部可验证性。
隐含假设
- 高质量数据(而非算力)是当前稀缺项——token 效率主张的前提,本人原话已确认("we're hitting the data wall")。
- 上下文长度是智能的独立 scaling 轴(七年未变)。
- 复杂任务依赖图足够稀疏可并行——Agent Swarm 的成立前提,最脆弱的一条:他自己举的例子全是检索/汇总型,恰是依赖图最稀疏的一类。
- 线性注意力的表达力损失可靠混合 full attention 层补偿——是"混合"假设,不是"纯线性"假设。
- scaling-law 拟合上的效率增益可外推到端到端产品价值——未被证明,且被激活参数 +220% 反向拉扯。
反证条件 / 待验证清单
- [ ] 独立第三方在同 FLOPs 下复现 Kimi Linear 混合架构优于全 full attention
- [x] K3 的 2.5× 是否端到端口径——已解决:不是,是 FLOPs–验证损失口径
- [ ] K3 激活参数 +220% 后,端到端单位智能推理成本是升是降——本档当前最关键反证点
- [ ] Agent Swarm 在强依赖长任务(非检索型)上的收益是否为正
- [ ] GTC keynote 官方逐字稿;"能源转智能"与"2027 AI 主导研究"是否原话
与其他人的真实分歧
| 对手方 | 分歧点 | 状态 |
|---|---|---|
| 闫俊杰/MiniMax | 如何降低长上下文注意力成本:杨=混合线性(KDA:MLA≈1:3);闫=M2 退回全注意力→M3 改块稀疏(MSA) | 分歧比外界说的窄:双方共识是 1M 上下文下 full attention 不可持续,分歧只在降本机制;双方都没押纯线性 |
| 闫俊杰/MiniMax(更硬的一条) | 稀疏性放注意力还是放 MoE 激活:杨=大激活(104.2B)+混合注意力;闫=极小激活(M2 9.8B/M3 ~23B)+稀疏注意力 | 方向相反、可量化、可追踪——两家真正的成本结构分歧;检验点:同等能力下的 API 实际定价与毛利率 |
| 梁文锋/DeepSeek | 世界模型/多模态是否属于通往智能上限的路径:梁明确排除;杨 K2.5/K3 走原生多模态 | 路线判断分歧 |
更新日志
| 日期 | 动作 |
|---|---|
| 2026-08-07 | 建档→12 条材料。取得 GTC 完整 ASR 转写(首次获得本人连续可核表达);抽取 K3 报告 47 页,解决 2.5× 口径;K2.5 README 直核证伪三条媒体说法;重写与 MiniMax 的分歧(1:3 混合非纯线性,识别 MoE 激活为新分歧轴)。 |
本页由「AI 人物知识库」canonical 生成(呈现层)。一级/二级/三级只表示来源距离,不表示观点正确概率;本人亲口说过也只是观点,正确与否只看后续现实状态。