Tech星球 2小时前
90后站上C位:姚顺雨、罗福莉、刘大一恒、陈宇森、周畅们接管国产大模型
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

2026 年 9 月,国产大模型公司密集交出了一份成绩单。

9 月 21 日,阿里巴巴在云栖大会开幕前一天确认,1993 年出生的刘大一恒担任 ATH 事业群 TokenFoundry Qwen 大语言模型项目负责人,主论坛演讲排序仅在阿里集团主席蔡崇信、CEO 吴泳铭之后。

9 月 22 日,同一场大会上,1992 年出生的陈宇森以阿里巴巴集团副总裁、千问办公 CEO 身份首次公开亮相。

此前,他从长亭科技创始人变成钉钉 CEO,再变成千问办公事业部负责人,职级从 P10 升到 P11(M6)。

同一天,小米也在这天发布 MiMo-V2.6 系列,同时内部晋升名单传出:1995 年出生的罗福莉升到 22 级,小米职级体系的最高点。她负责的 MiMo-V2.6-Pro 在 Artificial Analysis 综合智能指数拿到 46 分,成为该榜单全球开源权重模型第一。

另一端,1990 年出生的周畅从阿里离开后,加入字节,负责着 Seedream、Seedance 和世界模型。

两代人在同一张组织图上交替出现。一边是用十年、二十年才爬到一号位的技术老兵,一边是把履历压缩到五年,甚至十年的 90 后们。

" 在 Transformer(AI 大模型的底层架构)问世不到十年、ChatGPT 爆发不到五年 " 这个技术周期里," 论资排辈 " 这个运行了几十年的变量,似乎失去了约束力。

但 90 后真正接管的,不只是职位,还有尚未解决的技术债、商业化压力和追赶风险。交棒已经发生,考试才刚刚开始。

01

刘大一恒和陈宇森:一条通向底座,一条通向生意

把刘大一恒和陈宇森放在同一场云栖大会的两天里,正好能看出两种截然不同的 90 后主管大模型的路径。

刘大一恒 2012 年进四川大学计算机学院,2015 年以综合排名第一保送连读,2020 年拿到博士学位。

他第一次进入公众视野是 2019 年在 ACL 上发了一篇论文,成为川大在读研究生首次在 ACL 发表成果。

同年他参加谷歌 Natural Questions 全球长期公开竞赛,同场竞争者包括谷歌 AI 和 IBM Research,他所在的团队提交时取得世界第一并保持三个月。

2020 年他成为华为 " 天才少年计划 " 第一档中西南地区唯一入选者,2021 年 1 月加入阿里达摩院。

2026 年 3 月 9 日,他负责手 Qwen 预训练,同时代管后训练和 Coding 团队,向代管 Qwen 一号位的阿里云 CTO 周靖人汇报。这个任命在阿里内部半年前就开始流传,直到 9 月才对外明确。

他公布的技术路线里,递归式自我改进(RSI)最激进:让模型从真实任务中发现不足、构造训练数据,再评价和修正结果。

陈宇森走到千问办公负责人的位置,路径是先技术,再做产品。

1992 年生,本科毕业于浙江大学竺可桢学院求是科学班计算机专业,联合创办企业级网络安全公司长亭科技,2017 年入选福布斯中国 30 岁以下精英榜。2019 年长亭科技被阿里云全资收购,他随之进入阿里;后来离开创业,项目停止后又重返阿里云。

今年 6 月 11 日陈宇森接任钉钉 CEO,成为阿里历史上最年轻的事业部 CEO;7 月,三条原本分散的 Agent 产品线整合为 " 千问办公 " 事业部,他兼任 CEO。

两人都是明星负责人的继任者。刘大一恒接棒林俊旸留下的 Qwen 底座负责人空位,陈宇森则接过无招(陈航)的接力棒, 后者 2010 年便加入阿里,是钉钉初代掌舵人。

但他们承接的命题完全不同。

刘大一恒要解决的,是基础大模型的能力上限问题。底座研发的核心挑战,是持续压缩模型的能力天花板与成本之间的矛盾。

陈宇森的课题,则落在大模型的商业化落地与整合。把大模型能力嵌入钉钉原有工作流,找到企业客户愿意买单的价值点,完成从技术能力到规模化业务收入的转化。

一个通向底座,一个通向生意。这两条线共同构成了阿里大模型体系的一体两面。

02

三张硬成绩单:开源、多模态与智能体

罗福莉、周畅和姚顺雨,分别站在开源大模型、多模态生成和 AI Agent 三个方向上。他们的履历证明,在一个技术范式快速变化的行业里,一次足够关键的成果,可能比多年按部就班的晋升更有说服力。

罗福莉的故事,最直接地体现了大模型行业的晋升速度。

2025 年 11 月她正式加盟小米,全面负责 MiMo 大模型业务。约 10 个月后,即 2026 年 9 月,她晋升至小米 22 级,也就是小米职级体系的最高点。小米 13 至 22 级共 10 档,副总裁对应 21 至 22 级,雷军本人不在这个体系内。

这次晋升并非只靠传闻和头衔。

毕业后,罗福莉曾进入阿里达摩院,主导多语言预训练模型 VECO;2022 年进入幻方量化,随后加入 DeepSeek 担任深度学习研究员,成为 MoE 大模型 DeepSeek-V2 的核心开发者之一。

到了小米,她的成绩单更加直接:MiMo-V2-Pro 总参数超 1 万亿,在 Artificial Analysis 榜单上按品牌排名全球第五,反超 xAI 的 Grok;MiMo-V2.6-Pro 拿到 46 分,成为全球开源权重模型第一。

周畅的故事则更像一次跨公司的能力迁移。

2017 年 7 月,他校招进入阿里达摩院,花名 " 钟煌 "。在阿里最初几年,他做的是电商推荐算法,与大模型无关。

后来,他主导了 " 通义 -M6"" 通义千问 " 的模型架构设计。离职前夕发布的 Qwen2,两小时就冲上 Hugging Face 开源榜首,超过 Llama 3-70B,也超过当时国内一众闭源模型。

后来,阿里随后以违反竞业协议为由提起劳动争议仲裁,这起纠纷一度让 " 竞业墙 " 成为行业公共话题。

2024 年下半年,周畅低调加入字节 Seed,职级 4-2。入职不到一年,他接管 Seedream、Seedance 和世界模型团队,后来周畅的管理边界进一步延伸至具身智能领域。

真正让他进入公众视野的,是 2026 年 2 月的 Seedance 2.0。该产品 2 月 7 日内测,2 月 12 日正式发布;其间,A 股短剧概念股曾在集体涨停。

周畅用一个多模态产品,为字节的追赶叙事打开了突破口。

姚顺雨则是先在学术阶段定义了 Agent 时代的关键方法,再进入顶级 AI 公司参与产品落地,最后加入腾讯,同时掌管模型与基础设施。

从普林斯顿毕业后,姚顺雨在 2024 年加入 OpenAI,参与 AI Agent 和任务执行系统方向开发。2025 年 12 月,腾讯升级大模型研发架构,姚顺雨出 CEO/ 总裁办公室首席 AI 科学家,同时兼任 AI Infra 部和大语言模型部负责人。

AI Infra 决定大模型如何训练、如何推理、如何提高效率;大语言模型部决定混元的能力上限和迭代方向。腾讯把这两部分同时交给姚顺雨,意味着他既要负责前沿模型能力,也要负责支撑模型能力的工程底座。

加入腾讯后,姚顺雨用 Hy3 完成了一场反击。这款总参数只有 300B、激活参数 21B 的中型模型,在多项能力上表现出了优于 GLM5.1 的表现。

而 Hy3 上线后,腾讯的 WorkBuddy 上主动选择 Hy3 的用户数增长了 6 倍,日均文字处理量较预览版增长 20 倍。

罗福莉、周畅和姚顺雨的共同之处在于,他们是在一个新范式里先做出结果,再被组织赋予更大的权限。

03

交棒已完成,大考才开始

"90 后接管 " 在 2026 年大模型市场被反复提及,但它并不是一个已经完成的结果。

已经完成的是职位交接:刘大一恒管 Qwen 模型,陈宇森管千问办公,罗福莉管 MiMo,周畅管字节多模态,姚顺雨管腾讯大语言模型和 AI Infra。

还没有完成的是能力验证。

刘大一恒面对的,是基础模型的能力上限与成本约束。底座研发的难点,不只是把参数继续做大,而是在长文本、推理、代码、智能体能力上持续突破,同时控制预训练和后训练所需的巨大算力与数据成本。

陈宇森面对的,是商业化落地和组织整合。千问办公要把分散的 Agent 能力、钉钉生态和 Qwen 底座能力打包成用户可感知的产品。

真正的难点不是演示一个会对话、会调用工具的 Agent,而是让它进入会议、文档、审批、协同等真实工作流,解决 " 演示惊艳、日常难用 " 的问题,并找到企业客户愿意持续付费的价值点。

罗福莉面对的,是开源成绩能否转化为可持续范式。

她完整展示强化学习训练全过程,并公开成本:MiMo-V2.6-Pro 后训练用时 6 天,使用约 75 万条真实任务轨迹,总训练成本 347 万美元,每天约合 400 万元人民币。

这个数字引发讨论。同济大学电子与信息工程学院副教授李王明卉对媒体表示,关键不是 " 便宜 ",而是它把强化学习后训练变成了一种可计量的服务能力;但这取决于环境搭建、工具执行、结果验证的边际成本能否被摊薄。

如果这些异构环境能够被工程化、标准化、复用化,它可能成为一种新的服务定价范式;否则,347 万美元只是一次漂亮的标杆。

周畅和字节面对的,则是追赶者如何补基础能力的课。

Seedance 2.0 让周畅负责的多模态业务打出了声量,但这并不意味着追赶已经结束。视频生成之后,还有世界模型、实时交互、成本控制、规模化商用等一系列难题。

姚顺雨面对的,是能力走向组织体系的考验。腾讯并不缺少场景:社交、内容、会议、文档、云、企业服务,但场景本身不会自动变成能力,必须通过工具接入、数据回流、真实评估和基础设施建设,把它们转化为模型可理解、可执行、可迭代的系统。

这正是 90 后接管的另一面:他们进入的是更快的决策循环、更大的资源盘子,也是更高的风险敞口。职位可以在一次组织调整中完成交接,但能力必须通过一轮又一轮的模型、产品、收入和成本来验证。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里 小米 谷歌 90后 ceo
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论