People knowledge base

杨植麟

月之暗面创始人 · 材料数 12 · 由 AI 人物知识库生成,旧观点不删只追加

杨植麟

  • 身份:月之暗面(Moonshot AI)创始人;Transformer-XL 二作、XLNet 一作
  • 一句话主张:把能源更高效地转成智能——竞争不在"谁卡多",在单位算力/单位 token 产出多少智能
  • 利益位置:月之暗面创始人;在算力受限约束下,"效率路线优于堆卡"既是技术判断也是生存叙事,需按利益相关方降权
  • 材料数:12(A 类本人 5,B 类公司报告 7)
  • 最后更新:2026-08-07

本档分类纪律:Kimi Team 署名的技术报告不是杨植麟个人观点(K2 报告署名 199 人)。A/B 两类严格隔开:A=本人表达,B="他的公司实际在做什么"的行为证据。另一个信息本身就是信息:2019 年学术论文之后,仍未找到他任何署名书面材料——他的公开表达全部通过演讲与访谈。


观点账本

日期 观点 来源状态 观点类型 现实状态 材料编号
2019-01 上下文长度是智能的独立 scaling 轴(segment-level recurrence+相对位置编码) A 一级·本人二作 技术主张 已成行业共识;本人路线连续七年未变 Y-09
2019-06 预训练目标函数设计本身决定能力上限,非只堆数据 A 一级·本人一作 技术主张 XLNet 路线已被取代;但方法论延续至 MuonClip/KDA Y-08
2026-03-20 "token efficiency is not just about efficiency, it is actually also about improving the upper bound of intelligence"——高质量数据总量近似常数,提升 token 效率=等效扩大数据量 A 半一级·本人原音,ASR 转写 技术主张 K3 报告用 scaling-law 拟合给出 2.5× 效率增益,口径为验证损失,非端到端能力 Y-01
2026-03-20 三条 scaling 维度:token 效率/长上下文/agent 数量(swarm) A 半一级 技术主张 K2.5 已上线 Agent Swarm Y-01
2026-03-20 "we're going to mix linear attention layers with full attention layers using a one to three ratio" A 半一级 技术主张 K3 实测 69 KDA + 24 MLA(约 2.9:1),与所述吻合 Y-01, Y-10
2026-03-20 swarm 可扩到 100 甚至 1000 个 sub-agent A 半一级 预测,未验证 K2.5 官方仅公布 sub-agent 最多 100 ,未公布并发 100 个 agent——媒体把本人展望和产品实测参数混成了一句话 Y-01 vs Y-06
2026-03-26 大模型本质是"能源向智能的有效规模化转化";"2027 年 AI 将主导研究" 半一级(知乎第三方整理,待核) 技术主张/预测 GTC 英文转写全文未出现 energy 与 2027——两条仅见于中关村论坛整理稿,未获第二独立信源 Y-02

材料库(精选)

  • Y-01|GTC 2026 主题演讲(2026-03,39 分 32 秒)|A 半一级:音频为本人原音,字幕为 YouTube 自动 ASR(31,742 字符转写)|https://www.youtube.com/watch?v=5CkCW1P-g88 (⚠️ 第三方搬运频道 Neural Intel Media,非官方)|可核原话:"one of our major pursuits is to build better open models…democratizing intelligence";"suppose you have 50 trillion high quality tokens…all of a sudden you have a two times token efficiency…it's almost like magic that you get equivalently 100 trillion tokens"|结构性发现:他本人从未主张纯线性注意力,明说是 1:3 混合。
  • Y-02|2026 中关村论坛演讲(2026-03-26)|视频一级/知乎文字稿半一级|"能源转智能"与"2027 AI 主导研究"均未在 GTC 场合重复,维持"待核"。
  • Y-08|XLNet(2019-06,一作)、Y-09|Transformer-XL(2019-01,二作)|一级|Y-09(2019)→Kimi Linear(2025)→K3 KDA+AttnRes(2026)构成七年不变的长上下文主线——比任何演讲更能说明其真实押注。
  • Y-04|Kimi K2 报告(2025-07,署名 199 人)|B 级|1T/32B MoE;15.5T token;MuonClip 零 loss spike。他在 GTC 亲口讲了 QK-Clip 动机,报告与本人表述直接对应。
  • Y-05|Kimi Linear/KDA(2025-10,署名 60 人)|B 级|48B/3B;自报 KV cache 省约 75%、1M 解码提速约 6×;"超过 full attention"指混合架构(1:3)超过全 full attention,不是纯线性打赢全注意力
  • Y-06|Kimi K2.5(2026-01)|B 级|README 直核:三条媒体说法证伪/纠错——无"MoonViT-3D";59.3 是分数不是提升幅度;100 是 sub-agent 步数不是 agent 数。
  • Y-10|Kimi K3 技术报告(2026-07,47 页已全文抽取)|B 级|2.78T 总参/104.2B 激活(较 K2 +220%);69 KDA+24 MLA;1M 上下文;2.5× 是拟合 scaling-law 曲线上"同一验证损失所需 FLOPs 之比",不是端到端能力/成本比——媒体当后者讲是错的;Swarm Bench 等为公司自建基准,分数不可外部复现。
  • Y-11|开源组件矩阵|Kimi-K3 8,153★、Attention-Residuals 3,449★、Kimi-Linear 1,558★、FlashKDA 1,172★等|行为含义:把架构组件单独开源而不只发权重,使"效率路线"具备外部可验证性。

隐含假设

  1. 高质量数据(而非算力)是当前稀缺项——token 效率主张的前提,本人原话已确认("we're hitting the data wall")。
  2. 上下文长度是智能的独立 scaling 轴(七年未变)。
  3. 复杂任务依赖图足够稀疏可并行——Agent Swarm 的成立前提,最脆弱的一条:他自己举的例子全是检索/汇总型,恰是依赖图最稀疏的一类。
  4. 线性注意力的表达力损失可靠混合 full attention 层补偿——是"混合"假设,不是"纯线性"假设。
  5. scaling-law 拟合上的效率增益可外推到端到端产品价值——未被证明,且被激活参数 +220% 反向拉扯。

反证条件 / 待验证清单

  • [ ] 独立第三方在同 FLOPs 下复现 Kimi Linear 混合架构优于全 full attention
  • [x] K3 的 2.5× 是否端到端口径——已解决:不是,是 FLOPs–验证损失口径
  • [ ] K3 激活参数 +220% 后,端到端单位智能推理成本是升是降——本档当前最关键反证点
  • [ ] Agent Swarm 在强依赖长任务(非检索型)上的收益是否为正
  • [ ] GTC keynote 官方逐字稿;"能源转智能"与"2027 AI 主导研究"是否原话

与其他人的真实分歧

对手方 分歧点 状态
闫俊杰/MiniMax 如何降低长上下文注意力成本:杨=混合线性(KDA:MLA≈1:3);闫=M2 退回全注意力→M3 改块稀疏(MSA) 分歧比外界说的窄:双方共识是 1M 上下文下 full attention 不可持续,分歧只在降本机制;双方都没押纯线性
闫俊杰/MiniMax(更硬的一条) 稀疏性放注意力还是放 MoE 激活:杨=大激活(104.2B)+混合注意力;闫=极小激活(M2 9.8B/M3 ~23B)+稀疏注意力 方向相反、可量化、可追踪——两家真正的成本结构分歧;检验点:同等能力下的 API 实际定价与毛利率
梁文锋/DeepSeek 世界模型/多模态是否属于通往智能上限的路径:梁明确排除;杨 K2.5/K3 走原生多模态 路线判断分歧

更新日志

日期 动作
2026-08-07 建档→12 条材料。取得 GTC 完整 ASR 转写(首次获得本人连续可核表达);抽取 K3 报告 47 页,解决 2.5× 口径;K2.5 README 直核证伪三条媒体说法;重写与 MiniMax 的分歧(1:3 混合非纯线性,识别 MoE 激活为新分歧轴)。

本页由「AI 人物知识库」canonical 生成(呈现层)。一级/二级/三级只表示来源距离,不表示观点正确概率;本人亲口说过也只是观点,正确与否只看后续现实状态。