People knowledge base

姚顺雨

腾讯首席 AI 科学家 · 材料数 13 · 由 AI 人物知识库生成,旧观点不删只追加

姚顺雨

  • 身份:腾讯"CEO/总裁办公室"首席AI科学家(向总裁刘炽平汇报),兼 TEG 大语言模型部、AI Infra 部负责人(2025-12-17 官宣)。前 OpenAI 研究员(约 2024-08 至 2025-08/09,参与 Operator、Deep Research 相关方向);普林斯顿计算机博士,清华姚班本科。ReAct、Tree of Thoughts、SWE-bench、τ-bench、CoALA、WebShop 等语言智能体核心工作的(共同)第一作者。
  • 一句话主张:AI 进入"下半场"——训练方法论已趋标准化("RL finally generalizes"),稀缺的不再是能力而是问题定义与评估;benchmark 分数与真实经济效用脱节,谁能用真实环境、真实用户数据定义并评估任务,谁就拿走下半场的价值
  • 利益位置:腾讯 AI 一号位,其"真实场景数据+产品闭环重于刷榜"的判断与腾讯"产品矩阵多、自研模型曾落后"的处境高度耦合——该论述同时是其学术信念与腾讯的最优叙事,需区分。其独立性资产是学术声誉(多篇顶会 oral+被全行业采用的 benchmark);若混元长期不及预期,该资产将被消耗。
  • jaiv1 页面:姚顺雨
  • 材料数:13(一级 7,二级 6)
  • 最后更新:2026-08-09

观点账本

旧观点不删,只追加。观点转向本身就是最重要的信号。

日期 观点 来源状态 观点类型 现实状态 材料编号
2022-10 ReAct:推理与行动应交织进行——推理帮助制定/调整计划,行动从外部环境获取信息,协同优于单独使用 一级(署名论文) 技术框架 成为 Agent 领域事实范式 M-002
2023-05 Tree of Thoughts:让 LLM 对"想法"做显式探索、前瞻与回溯(24 点成功率从 CoT 的 4% 提至 74%) 一级 技术框架 广泛引用 M-003
2023-10 SWE-bench:用真实 GitHub issue 修复作评估——真实软件工程远难于代码补全类 benchmark 一级 评估框架 成为全行业代码智能体事实标准 M-004
2024-06 τ-bench:真实部署需要在多轮用户交互中保持一致、可靠(当时 GPT-4o 在 retail 域 pass^8 不足 25%) 一级 评估框架 被各前沿实验室引用 M-005
2025-04-10 "The Second Half":"RL finally works. More precisely: RL finally generalizes";"The second half of AI — starting now — will shift focus from solving problems to defining problems";"In this new era, evaluation becomes more important than training";AI 屡破 benchmark"But the world hasn't changed much, at least judged by economics and GDP" 一级(本人博客) 纲领判断 "评估重于训练"正被行业逐步接受;经济效用脱节仍是公认现象 M-001
2025-09-11 张小珺访谈:语言(而非动作空间)是智能体泛化的关键;下半场核心是任务定义、交互方式与数据流转 一级(本人原音) 技术判断 进行中 M-007
2026-01-10 AGI-Next 圆桌:"To C 和 To B 发生了明显的分化……大部分人大部分时候不需要那么强的智能";"在 To B,智能越高,就代表生产力越高,能赚的钱越多";"强模型和弱模型的分化会越来越明显" 二级(现场实录转写) 商业判断 进行中 M-006
2026-01-10 To C 垂直整合成立(模型与产品紧耦合),"但 To B 正好相反,模型越强,应用层的机会反而越大" 二级 商业判断 与其前雇主 OpenAI 的垂直整合战略方向相反 M-006
2026-01-10 论自主学习:"自主学习不是一个方法论,而是数据或者任务";"这个事情其实已经在发生了……Cursor 每几个小时都会用最新的用户数据去学习";"是渐变,不是突变";瓶颈"不是技术,是想象力" 二级 技术判断 进行中 M-006
2026-01-10 论中国:"任何一个事情一旦被发现,在中国就能够很快的复现";但"我们太爱确定性了","能不能引领新范式,可能是今天中国唯一要解决的问题" 二级 结构判断 待验证 M-006
2026-06-05 对谈汤道生回应"腾讯慢了":"如果下半场才刚开始,那就不存在'晚了'的说法";"基于真实世界数据的评测能够发现模型的很多底线问题";加入腾讯原因:"腾讯拥有海量的产品和丰富的真实问题场景,这一点在 AI 下半场会愈发重要" 二级(腾讯官方对谈实录) 公司叙事 待验证(混元 Hy3 系列为其答卷) M-011

材料库

  • M-001|一级|博客《The Second Half》|2025-04-10|https://ysymyth.github.io/The-Second-Half/ |下半场宣言,原文引句已核实
  • M-002|一级|ReAct: Synergizing Reasoning and Acting in Language Models|2022-10,ICLR 2023 oral|https://arxiv.org/abs/2210.03629
  • M-003|一级|Tree of Thoughts|2023-05,NeurIPS 2023 oral|https://arxiv.org/abs/2305.10601
  • M-004|一级|SWE-bench|2023-10,ICLR 2024 oral|https://arxiv.org/abs/2310.06770
  • M-005|一级|τ-bench|2024-06,ICLR 2025|https://arxiv.org/abs/2406.12045
  • M-006|二级|AGI-Next 前沿峰会圆桌实录|2026-01-10,清华基础模型重点实验室主办,主持李广密,同台唐杰、林俊旸、杨植麟(杨强另场)|https://36kr.com/p/3633816041735171 ;宝玉整理版 https://baoyu.io/blog/2026/01/10/china-ai-roundtable |两版转写措辞略异,引用前注意
  • M-007|一级|张小珺《商业访谈录》115 期(3 小时,时任 OpenAI)|2025-09-11|https://www.xiaoyuzhoufm.com/episode/68c29ca12c82c9dccadba127 |逐句引文待补录
  • M-008|二级|澎湃新闻:职位官宣|2025-12-17|https://www.thepaper.cn/newsDetail_forward_32195162
  • M-009|二级|SCMP: Tencent restructures AI operations|2025-12-17|https://www.scmp.com/tech/big-tech/article/3336811/
  • M-010|二级|36氪英文版:离开 OpenAI 确认与"亿元入腾讯"传闻及腾讯辟谣("辟谣内容含糊")|2025-09-12|https://eu.36kr.com/en/p/3463115376956806
  • M-011|二级|汤道生×姚顺雨对谈实录(腾讯官方内容)|2026-06-05|https://www.163.com/dy/article/KULKH4UP05119FMA.html ;虎嗅 https://www.huxiu.com/article/4864721.html |注:本知识库 2026-06-05 曾按当时报道将对话对象记为"姚顺雨"(见 ai-xuexi MEMORY),此处为同一材料线
  • M-012|二级|量子位/澎湃:腾讯混元 Hy3 preview"姚顺雨首次交卷"(295B 总参/21B 激活,主打 Agent+Coding 实用性)|2026-04-23|https://m.thepaper.cn/newsDetail_forward_33052328 |发布期媒体稿宣传色彩重,只当信号
  • M-013|一级|个人主页与 X:https://ysymyth.github.io/ ;https://x.com/ShunyuYao12 |2026-08-09 抓取主页自述仍为"I am a researcher at OpenAI"(未更新或缓存);X 原帖逐条待补录

他人对他的判断

  • SCMP(2025-12-17):腾讯"high-profile recruit",架构升级即围绕他重组。
  • Rohan Paul(X,2025-09):"a leading name in language agents"。
  • 中文媒体(2025-12 至 2026-01):"腾讯 28 岁首席 AI 科学家""大厂最年轻 AI 一号位"——年龄+职级本身成为叙事。
  • 量子位(2026-04-23):Hy3 preview 是其"首张答卷","Operator 和 Deep Research 背后都有他"(媒体归因,无一级证据)。
  • 行业采用即背书:SWE-bench 成为全行业事实标准、τ-bench 被各前沿实验室引用——比任何评语更硬的判断。

隐含假设

  1. RL 泛化已成立且方法论收敛——若被新范式(新架构、世界模型路线)打破,下半场论述的前提动摇。
  2. 评估/任务定义是可持续的护城河——假设定义问题的能力比解决问题的能力更稀缺、更难复制。
  3. 真实用户数据回流→模型变强的飞轮成立——即腾讯产品矩阵能转化为模型优势,而非只是分发渠道。
  4. To B 按智能分层付费——"智能越高=赚钱越多"假设企业愿为智能增量线性付费,忽略采购摩擦、合规、集成成本。
  5. 大组织能容纳研究品味——假设腾讯给他的组织授权可持续。

反证条件 / 待验证清单

反证条件(出现即降档) - [ ] 混元 Hy3 系列在真实使用(开发者留存、token 收入、元宝/WorkBuddy DAU)上持续落后→"真实场景飞轮"在腾讯不成立 - [ ] 腾讯 AI 组织再次调整、其职权收缩或离任 - [ ] benchmark 进步持续直接转化为经济效用(即"脱节"论被证伪) - [ ] 自主学习/真实数据回流被证明存在未预见的硬瓶颈(隐私、数据质量、灾难性遗忘),"已经在发生了"沦为过度外推

待验证清单 - [ ] X(@ShunyuYao12)原帖逐条采录 - [ ] AGI-Next 圆桌官方完整视频/原音,核对 36氪与宝玉两版转写差异 - [ ] "亿元年薪"传闻的真实薪酬结构 - [ ] 张小珺 115 期原音逐段引句补录 - [ ] 其在 OpenAI 期间对 Operator/Deep Research 的具体贡献边界


与其他人的真实分歧

  • vs 主流 benchmark 竞赛路线:他(最重要 benchmark 的作者)主张分数≠效用——用自己的学术资产反对其滥用,这是他最独特的位置。
  • vs 垂直整合论(OpenAI/Anthropic 式"模型即产品"):他认为该逻辑只在 To C 成立;To B"模型越强,应用层的机会反而越大"——与前雇主战略相反,与腾讯生态利益一致(需打折)。
  • vs 自主学习"突变论"(同场唐杰/杨植麟更多谈范式突破):他坚持"是渐变不是突变","已经在发生了"——把 self-improvement 还原为工程与数据问题。
  • vs 中国"快速复现"路线的自满:"我们太爱确定性了","能不能引领新范式,可能是今天中国唯一要解决的问题"——对本土主流工程文化的公开批评。

更新日志

日期 动作
2026-08-09 建档。核实《The Second Half》原文引句(一级);核实腾讯职位 title(澎湃/SCMP 双源);采录 AGI-Next 圆桌、汤道生对谈、离职 OpenAI 时间线;四篇核心论文锚定 arXiv 编号。X 原帖与张小珺访谈逐句引文列入待验证。

本页由「AI 人物知识库」canonical 生成(呈现层)。一级/二级/三级只表示来源距离,不表示观点正确概率;本人亲口说过也只是观点,正确与否只看后续现实状态。