People knowledge base
姚顺雨
腾讯首席 AI 科学家 · 材料数 13 · 由 AI 人物知识库生成,旧观点不删只追加
姚顺雨
- 身份:腾讯"CEO/总裁办公室"首席AI科学家(向总裁刘炽平汇报),兼 TEG 大语言模型部、AI Infra 部负责人(2025-12-17 官宣)。前 OpenAI 研究员(约 2024-08 至 2025-08/09,参与 Operator、Deep Research 相关方向);普林斯顿计算机博士,清华姚班本科。ReAct、Tree of Thoughts、SWE-bench、τ-bench、CoALA、WebShop 等语言智能体核心工作的(共同)第一作者。
- 一句话主张:AI 进入"下半场"——训练方法论已趋标准化("RL finally generalizes"),稀缺的不再是能力而是问题定义与评估;benchmark 分数与真实经济效用脱节,谁能用真实环境、真实用户数据定义并评估任务,谁就拿走下半场的价值
- 利益位置:腾讯 AI 一号位,其"真实场景数据+产品闭环重于刷榜"的判断与腾讯"产品矩阵多、自研模型曾落后"的处境高度耦合——该论述同时是其学术信念与腾讯的最优叙事,需区分。其独立性资产是学术声誉(多篇顶会 oral+被全行业采用的 benchmark);若混元长期不及预期,该资产将被消耗。
- jaiv1 页面:姚顺雨
- 材料数:13(一级 7,二级 6)
- 最后更新:2026-08-09
观点账本
旧观点不删,只追加。观点转向本身就是最重要的信号。
| 日期 | 观点 | 来源状态 | 观点类型 | 现实状态 | 材料编号 |
|---|---|---|---|---|---|
| 2022-10 | ReAct:推理与行动应交织进行——推理帮助制定/调整计划,行动从外部环境获取信息,协同优于单独使用 | 一级(署名论文) | 技术框架 | 成为 Agent 领域事实范式 | M-002 |
| 2023-05 | Tree of Thoughts:让 LLM 对"想法"做显式探索、前瞻与回溯(24 点成功率从 CoT 的 4% 提至 74%) | 一级 | 技术框架 | 广泛引用 | M-003 |
| 2023-10 | SWE-bench:用真实 GitHub issue 修复作评估——真实软件工程远难于代码补全类 benchmark | 一级 | 评估框架 | 成为全行业代码智能体事实标准 | M-004 |
| 2024-06 | τ-bench:真实部署需要在多轮用户交互中保持一致、可靠(当时 GPT-4o 在 retail 域 pass^8 不足 25%) | 一级 | 评估框架 | 被各前沿实验室引用 | M-005 |
| 2025-04-10 | "The Second Half":"RL finally works. More precisely: RL finally generalizes";"The second half of AI — starting now — will shift focus from solving problems to defining problems";"In this new era, evaluation becomes more important than training";AI 屡破 benchmark"But the world hasn't changed much, at least judged by economics and GDP" | 一级(本人博客) | 纲领判断 | "评估重于训练"正被行业逐步接受;经济效用脱节仍是公认现象 | M-001 |
| 2025-09-11 | 张小珺访谈:语言(而非动作空间)是智能体泛化的关键;下半场核心是任务定义、交互方式与数据流转 | 一级(本人原音) | 技术判断 | 进行中 | M-007 |
| 2026-01-10 | AGI-Next 圆桌:"To C 和 To B 发生了明显的分化……大部分人大部分时候不需要那么强的智能";"在 To B,智能越高,就代表生产力越高,能赚的钱越多";"强模型和弱模型的分化会越来越明显" | 二级(现场实录转写) | 商业判断 | 进行中 | M-006 |
| 2026-01-10 | To C 垂直整合成立(模型与产品紧耦合),"但 To B 正好相反,模型越强,应用层的机会反而越大" | 二级 | 商业判断 | 与其前雇主 OpenAI 的垂直整合战略方向相反 | M-006 |
| 2026-01-10 | 论自主学习:"自主学习不是一个方法论,而是数据或者任务";"这个事情其实已经在发生了……Cursor 每几个小时都会用最新的用户数据去学习";"是渐变,不是突变";瓶颈"不是技术,是想象力" | 二级 | 技术判断 | 进行中 | M-006 |
| 2026-01-10 | 论中国:"任何一个事情一旦被发现,在中国就能够很快的复现";但"我们太爱确定性了","能不能引领新范式,可能是今天中国唯一要解决的问题" | 二级 | 结构判断 | 待验证 | M-006 |
| 2026-06-05 | 对谈汤道生回应"腾讯慢了":"如果下半场才刚开始,那就不存在'晚了'的说法";"基于真实世界数据的评测能够发现模型的很多底线问题";加入腾讯原因:"腾讯拥有海量的产品和丰富的真实问题场景,这一点在 AI 下半场会愈发重要" | 二级(腾讯官方对谈实录) | 公司叙事 | 待验证(混元 Hy3 系列为其答卷) | M-011 |
材料库
- M-001|一级|博客《The Second Half》|2025-04-10|https://ysymyth.github.io/The-Second-Half/ |下半场宣言,原文引句已核实
- M-002|一级|ReAct: Synergizing Reasoning and Acting in Language Models|2022-10,ICLR 2023 oral|https://arxiv.org/abs/2210.03629
- M-003|一级|Tree of Thoughts|2023-05,NeurIPS 2023 oral|https://arxiv.org/abs/2305.10601
- M-004|一级|SWE-bench|2023-10,ICLR 2024 oral|https://arxiv.org/abs/2310.06770
- M-005|一级|τ-bench|2024-06,ICLR 2025|https://arxiv.org/abs/2406.12045
- M-006|二级|AGI-Next 前沿峰会圆桌实录|2026-01-10,清华基础模型重点实验室主办,主持李广密,同台唐杰、林俊旸、杨植麟(杨强另场)|https://36kr.com/p/3633816041735171 ;宝玉整理版 https://baoyu.io/blog/2026/01/10/china-ai-roundtable |两版转写措辞略异,引用前注意
- M-007|一级|张小珺《商业访谈录》115 期(3 小时,时任 OpenAI)|2025-09-11|https://www.xiaoyuzhoufm.com/episode/68c29ca12c82c9dccadba127 |逐句引文待补录
- M-008|二级|澎湃新闻:职位官宣|2025-12-17|https://www.thepaper.cn/newsDetail_forward_32195162
- M-009|二级|SCMP: Tencent restructures AI operations|2025-12-17|https://www.scmp.com/tech/big-tech/article/3336811/
- M-010|二级|36氪英文版:离开 OpenAI 确认与"亿元入腾讯"传闻及腾讯辟谣("辟谣内容含糊")|2025-09-12|https://eu.36kr.com/en/p/3463115376956806
- M-011|二级|汤道生×姚顺雨对谈实录(腾讯官方内容)|2026-06-05|https://www.163.com/dy/article/KULKH4UP05119FMA.html ;虎嗅 https://www.huxiu.com/article/4864721.html |注:本知识库 2026-06-05 曾按当时报道将对话对象记为"姚顺雨"(见 ai-xuexi MEMORY),此处为同一材料线
- M-012|二级|量子位/澎湃:腾讯混元 Hy3 preview"姚顺雨首次交卷"(295B 总参/21B 激活,主打 Agent+Coding 实用性)|2026-04-23|https://m.thepaper.cn/newsDetail_forward_33052328 |发布期媒体稿宣传色彩重,只当信号
- M-013|一级|个人主页与 X:https://ysymyth.github.io/ ;https://x.com/ShunyuYao12 |2026-08-09 抓取主页自述仍为"I am a researcher at OpenAI"(未更新或缓存);X 原帖逐条待补录
他人对他的判断
- SCMP(2025-12-17):腾讯"high-profile recruit",架构升级即围绕他重组。
- Rohan Paul(X,2025-09):"a leading name in language agents"。
- 中文媒体(2025-12 至 2026-01):"腾讯 28 岁首席 AI 科学家""大厂最年轻 AI 一号位"——年龄+职级本身成为叙事。
- 量子位(2026-04-23):Hy3 preview 是其"首张答卷","Operator 和 Deep Research 背后都有他"(媒体归因,无一级证据)。
- 行业采用即背书:SWE-bench 成为全行业事实标准、τ-bench 被各前沿实验室引用——比任何评语更硬的判断。
隐含假设
- RL 泛化已成立且方法论收敛——若被新范式(新架构、世界模型路线)打破,下半场论述的前提动摇。
- 评估/任务定义是可持续的护城河——假设定义问题的能力比解决问题的能力更稀缺、更难复制。
- 真实用户数据回流→模型变强的飞轮成立——即腾讯产品矩阵能转化为模型优势,而非只是分发渠道。
- To B 按智能分层付费——"智能越高=赚钱越多"假设企业愿为智能增量线性付费,忽略采购摩擦、合规、集成成本。
- 大组织能容纳研究品味——假设腾讯给他的组织授权可持续。
反证条件 / 待验证清单
反证条件(出现即降档) - [ ] 混元 Hy3 系列在真实使用(开发者留存、token 收入、元宝/WorkBuddy DAU)上持续落后→"真实场景飞轮"在腾讯不成立 - [ ] 腾讯 AI 组织再次调整、其职权收缩或离任 - [ ] benchmark 进步持续直接转化为经济效用(即"脱节"论被证伪) - [ ] 自主学习/真实数据回流被证明存在未预见的硬瓶颈(隐私、数据质量、灾难性遗忘),"已经在发生了"沦为过度外推
待验证清单 - [ ] X(@ShunyuYao12)原帖逐条采录 - [ ] AGI-Next 圆桌官方完整视频/原音,核对 36氪与宝玉两版转写差异 - [ ] "亿元年薪"传闻的真实薪酬结构 - [ ] 张小珺 115 期原音逐段引句补录 - [ ] 其在 OpenAI 期间对 Operator/Deep Research 的具体贡献边界
与其他人的真实分歧
- vs 主流 benchmark 竞赛路线:他(最重要 benchmark 的作者)主张分数≠效用——用自己的学术资产反对其滥用,这是他最独特的位置。
- vs 垂直整合论(OpenAI/Anthropic 式"模型即产品"):他认为该逻辑只在 To C 成立;To B"模型越强,应用层的机会反而越大"——与前雇主战略相反,与腾讯生态利益一致(需打折)。
- vs 自主学习"突变论"(同场唐杰/杨植麟更多谈范式突破):他坚持"是渐变不是突变","已经在发生了"——把 self-improvement 还原为工程与数据问题。
- vs 中国"快速复现"路线的自满:"我们太爱确定性了","能不能引领新范式,可能是今天中国唯一要解决的问题"——对本土主流工程文化的公开批评。
更新日志
| 日期 | 动作 |
|---|---|
| 2026-08-09 | 建档。核实《The Second Half》原文引句(一级);核实腾讯职位 title(澎湃/SCMP 双源);采录 AGI-Next 圆桌、汤道生对谈、离职 OpenAI 时间线;四篇核心论文锚定 arXiv 编号。X 原帖与张小珺访谈逐句引文列入待验证。 |
本页由「AI 人物知识库」canonical 生成(呈现层)。一级/二级/三级只表示来源距离,不表示观点正确概率;本人亲口说过也只是观点,正确与否只看后续现实状态。