开场0:00
欢迎收听 《 晚点聊 》, 我是曼祺 。 加根一起 , 简短地来说一下阿里 Qwen,也就是千问团队最近的变动 。
我录这期节目的时间是 3 月 4 日晚上, 所以今天指的是 3 月 4 日周三 , 昨天指的是周二 。 今天早上我晚点发布了关于 Qwen,也就是千问团队负责人林俊旸提出离职的独家报道 。
是我的同事陈嘉慧和我撰写的 :" 林俊旸提出离职 ,Qwen 多位负责人离开 。" 这之前 Qwen 还有 2 个技术领导离职 : 一是节前已经离职的原 Qwen Code 的负责人惠彬元 , 二是刚好在昨天 ,也就是周二是 last day 的 Qwen 的后训练负责人郁博文 。
误读澄清0:43
我先总结一下这两天发生的事情 。 首先 , 根据我们得到的信息 , 我觉得有几个从逻辑和事实上都缺乏证据 、 但广为传播的事情 , 可以先澄清一下 。
第一个是说 , 我看有社交媒体上一些信息说林俊旸是被通知离职的 。 据我们了解 ,他是自己主动提了离职 。
今天白天我陆续了解更多信息之后, 我觉得在很长一段时间里 , 林俊旸是为了他想追求的目标 , 知其不可为而为之 , 努力到了最后一步 。
到了某个瞬间 ,他是有点道心破碎了 , 所以宣布自己要离开的方式确实很突然 ,也没有给阿里管理层太多的反应时间 。
那最后大家看到的结果 , 就是我们在 3 月 4 日的凌晨看到林俊旸在推特上发的那条动态 : "Me setting down, by my beloved Qwen."
另一个广为传播的信息是 , 说 Qwen 团队改变了考核方式 , 要在考核中纳入千问 App 的日活 。 这个目前是没有什么事实证据的 ,而且逻辑上它也说不通 。
因为技术还在快速地变化 , 各个公司的模型团队的核心目标 , 肯定还是要确保模型在性能和效率上的领先 。
Qwen 还是一个一整套的开源模型 , 它还要满足不同开发者对不同尺寸 、 不同特性的模型的需求 。 而产品 DAU 的这个目标 , 它还是直接和产品团队相关的 。
千问 App 这个产品 , 它也并不在 Qwen 团队所在的整个阿里云的体系里面 ,而是在无家管理的智能信息社群 。
第三个需要澄清的是 ,26 年 1 月新加入的周浩 , 据我们了解并不是来接替林俊旸的 。 今天早上也有朋友问我 , 说是不是阿里给俊旸空降了一个 leader, 所以他才想走 。
这个不符合事实 。 目前的情况是周浩是接替郁博文来负责后训练团队 ,他直接汇报给 Qwen 所在的通义实验室的整体负责人周婧仁 。
婧仁也是阿里云的 CTO, 她刚在 25 年的下半年晋升成了阿里最新的一位合伙人。 但确实 ,Qwen 的大部分团队成员之前是不知道周浩已经加入了 ,也不知道他要接手后训练 。
所以这对一线的干活的同学来说 ,也是一个突然有点被通知的感觉 。 然后来简单说一下整个事情的大致经过 。
事发经过2:52
据我们了解 ,3 月 3 日周二的下午 , 俊旸是在 Qwen 的钉钉群里告诉了大家 ,他决定要离开了 , 无颜面对大家 。
随后是第二天凌晨 ,他发了那条说自己 setting down 的推特的动态 。 整个过程很快 。 为什么他会感到无颜面对大家了 ?
综合现在得到的信息 , 这个背后的情况就是晚点在今天早上发的独家报道里提到的 , 整个 Qwen 团队正在经历组织调整 。
具体的方向就是拆成不同的部分 。 在这之前 ,Qwen 一直以来的一个做法 ,是把预训练和后训练做非常紧密的结合 。
这两个 team 的核心人员 , 刘大一横 、 郁博文等 ,也都是长期共事 、 相互很信任的同事 。 刘大一横是应该是 21 年就加入阿里的 ,他之前在华为短暂工作了一段时间 。
郁博文是阿里自己培养的硬件生 ,他是 22 年到 23 年左右加入的 。 预训练和后训练的紧密的结合 , 本身也是一些 Qwen 的成员认为 Qwen 的训练效率比较高的重要原因 。
然后到后面 , 随着原生混合多模态成为一个越来越明显的趋势 ,Qwen 在大语言模型之上也做了更多的模态探索 。
比如做纹身图的 Qwen-image, 还有语音模型 Qwen-audio。 而这次的调整计划 , 首先是把模态给拆出来 , 语音可能会并到同在通义实验室的另一个专门做语音的团队 ,也就是百灵 。
纹身图可能并到通义实验室专门做多模态生成的通义 - 万象 。 预训练和后训练实际上也分开了 。
因为前面提到了 , 郁博文他作为后训练负责人离职之后, 接替他的是周浩 。 周浩是直接汇报给通义实验室的整体负责人婧仁的 。
所以这个团队就不在林俊旸的管理范围了 。 就是从 Qwen 成员的角度来看 ,他们会认为预训练和后训练也给分开了 。
而关于从 25 年年中开始 , 中间的中,Qwen 陆续招募的一些自己来做 infrastructure 的团队 , 会怎么调整 , 这个目前还不太明确 。
所以总体来说 , 千问就是从之前预训练和后训练密切沟通整合 、infrastructure 和预训练垂直整合 , 然后不同模态也在一个 team 的状态 , 变成了按照不同模态和训练环节来划分的一个一个分开的水平的团队 。
这个变动是让林俊旸最终决定离开的一个比较主要的原因 。 而且这个调整对林俊旸和 Qwen 的技术团队来说也比较突然 。
它发生在 Qwen 3.5 系列刚刚训练完的时刻 。 整个团队在这之前其实也加班比较久了 , 比较疲惫 , 然后突然遇到了这样一个挺大的变化 。
全员会5:34
这件事情的后续是 , 今天也就是 3 月 4 日的下午 , 整个千问团队召开了全员会 。 阿里参与的高层包括阿里集团 CEO,也是阿里云的 CEO 吴永明吴妈 , 阿里云 CTO 和通义实验室的负责人周婧仁 , 阿里的首席人才关蒋芳 。
总结一下我们获得的全员会的信息 。 一是关于团队调整的回应 。 管理层的说法是这个调整不是要收缩 Qwen,而是要扩大对机模的投入 。
把 Qwen 做好是集团的事情 ,而不只是机模团队的事情 。 所以要引入更多的厉害的人才 , 这必然会涉及到阵型和组织的变化 。
整个调整是完全没有考虑公司内的政治因素的 ,但可能在沟通形式和节奏上没有处理得很好 。 这里需要补充的是 , 这个全员会上其实没有特别详细地提到接下来 Qwen 这个团队会具体怎么调整 。
我前面提到的这个调整方向 ,是这一周林俊旸还有 Qwen 的一些成员得到的信息 。 从流程上它还不是一个正式的决定 。
现在发生了这么大的变化之后, 具体 Qwen 的阵型会怎么变 , 接下来可能还有变化 。 二是关于 Qwen 团队认为阿里云内部给到他们的 infrastructure 的支持不够的这个问题 。
婧仁的回应说这是历史原因 。 这里稍微展开解释一下这个背景 。 就是在 25 年 Qwen 开始自己建立 infrastructure 能力和招这方面的人之前 ,Qwen 的训练部分的 infrastructure 是 Py 这个团队来支持的 , 就是阿里云人工智能平台 。
然后推理的部分是阿里云百练团队来支持的 。 阿里云也对外部的客户 , 比如说像 Kimi、Jeep 这样的大模型厂商提供训练和推理的 infrastructure 的服务 。
Qwen 团队自己的感受是认为阿里其实在服务外部客户上的效果是好于对 Qwen 这个机模团队的支持的 。 三是关于林俊旸离开这件事情是否还有转圜的余地 。
这也是 Qwen 团队成员当前最关心的问题 。 管理层的回应是不能把个人推上神坛 ,也不能不计代价地来挽留 。
如果我们把时间线拉长去总结 , 从 23 年大模型热潮到现在 , 整个千问的核心模型研发团队和阿里这个大环境的一些变化 , 大概是这样一个时间脉络 。
历史脉络7:33
其中的一个关键核心就是全员会上团队成员也专门提到的 infrastructure 能力的问题 。 最开始其实在 ChatGPT 之前 , 阿里就在做大模型 ,是中国非常早开始投入大模型的公司之一 。
尽管与百度 2020 年的时候就相关投入 。 因为大模型本身当时就在探索各个前沿方向 。 Transformer 这个方法是 2017 年 Google 提出的 , 到 20 年 GPT-3 发布 ,在 AI 从业者里还是引起了不少的关注 。
到 21 年的时候 , 阿里就对外发布了 M6 还有 Plug 这两个大模型 。 然后是到 23 年初这轮热潮开始之后, 阿里当时做大模型的主要是两个团队 。
一个就是 M6 团队 , 之前是杨洪霞负责 。 到 22 年 9 月前后, 杨洪霞离职加入字节 , 就是周畅在负责 。
这个团队是在周婧仁当时负责的智能计算实验室之下, 周畅向周婧仁汇报 。 第二个是大模型的 NLP 团队 , 当时是由黄飞来负责 。
在 23 年早期的时候 , 这两个团队处于一种赛马的状态 。 最终是 M6 这个团队取得了比较好的成果 , 之后资源和人也都集中到了智能计算实验室的 M6 的团队 。
这前后大模型也进行了重组 ,以智能实验室为主体合并了视觉 、 语音等团队 , 组成了后来的通义实验室 。
婧仁成为了整个通义实验室的负责人。 早期千问团队在资源相对有限的情况下训练的成功率比较高 , 这和团队的数据能力很强有关 。
其中的一个核心人物是刘大一横 。 也是从那时 Qwen 这个团队一直沿袭的做法 , 就是预训练和后训练要非常紧密地结合和沟通 ,而不是说出了问题相互甩锅 。
因为这些 leader、 这些核心成员之间也都共事很久 , 信任比较深 。 然后从当时开始 , 后训练的负责人就是最近刚离职的郁博文 。
郁博文此前是黄飞负责的就是 NLP 团队的 。他是在 23 年之后转岗到了通义 。 再往后, 通义在组织上的一个比较大的变化是 24 年夏天周畅离职 ,也带走了一些做多模态的比较核心的人员 。
周畅离职9:44
为什么当时周畅想走 ? 据我们了解有两个原因 。 一个是周畅自己的兴趣和技术判断 ,在多模态模型 、 视觉模型这个方向 。
而当时大部分公司里能给到最多资源的还是大语言模型 。 因为在整个 24 年, 中国大模型公司 , 包括大厂和创业公司的核心目标 , 还是去追赶语言模型全球最领先的水平 。
另一个原因是周畅认为当时整个千问团队的待遇没有和市场特别匹配 。 这一点其实在周畅离职之后是有比较大的改善的 。
下一个变化的节点是到了 24 年 9 月前后, 就是 OpenAI 发布 O1 之后 。 整个业界也看到了 ,OpenAI 验证了在后训练强化学习上投入更多的资源 , 包括算力 , 包括时间 , 会取得很不错的成果 。
O1 之后10:17
这个技术也带来了一个变化 , 就是对 infrastructure 提出了更高的要求 。 而这又带来了组织上的变化 。 我会讲一下这是怎么发生的 。
在 O1 之后 ,其实千问的团队也做了很多强化学习后训练的尝试 ,但最开始的效果都不是特别好 。 团队归因花了一段时间 ,他们最开始认为可能是算法的问题 ,但后来对这个事情的定位是 infrastructure 的问题 。
做出这个判断的比较直观的原因是 , 最开始 Qwen 是用阿里的 Py 支持的 infrastructure 来跑强化学习后训练 。 然后中间有一段时间 , 应该是在 25 年春节前后, 团队用了字节开源的强化学习框架 。
这也是现在业界比较主流的一个框架 , 就是 Veril 来做训练 。 发现效果有了比较明显的提升 。 相当于是通过控制变量确定是 infrastructure 需要优化 。
这之后 Py 来支持 Qwen 的 infrastructure 的团队也确实人员上有些调整 ,也有些扩充 。 接着是到了 25 年的年中 。 这个时候 Qwen 在 infrastructure 上又遇到了瓶颈 。
因为他们当时在更新新一代的核心模型时, 已经度过了之前在小规模的模型上做实验的阶段 。
要开始训练更大的模型 , 比如几百 B size 的这种模型 。 这个时候就会发现 , 基于之前字节的那个框架 ,Veril, 然后加 Py 的团队的一些改动 , 没有那么大的优化的 infrastructure 已经不够用了 。
基建自建11:51
它比较难支持更大规模的训练 。 差不多也是从同期开始 , 千问团队比较努力地想去自己招一些 infrastructure 的人员 。
一个是他们就已有的人可能会去学一学 infrastructure 怎么做 , 就大概知道你招什么样的人能合适 , 然后就是去扩充人。
这个变化我们在之前的几篇报道和去年春节发的年终播客总结里都有提到 。 但是在寻求这个新的 high-com 的过程中间 , 遇到了一些阻力 。
因为从婧仁的角度 , 她要从整个通义实验室乃至整个阿里云来考虑组织的布局 。 她其实不太倾向组织上的这种变化 ,而是希望继续让 Py 来支持通义实验室的各个模型团队的 infrastructure 的工作 。
而林俊旸认为这样会影响整个模型的训练效果 。 最后他为了实现自己能自建 infrastructure 的这个目标 ,其实是绕过了婧仁 , 向吴妈去争取了在招人上的一些支持 。
据我们了解是这样 。 这在公司组织里其实就是越级汇报了嘛 。 这也为之后千问面临的一些组织上的调整和变化埋下了伏笔 。
推演12:55
最后预测和推演一下接下来团队可能会面临的一些变化 。 在周三下午这个全员会之后 ,其实整个 Qwen 的团队对高层的一些解释和表态 ,他们是感觉比较失望的 。
依然处于一个士气相对低落的状态 。 在内部感到灰心的同时, 这种非常公开的变化也导致外界有很多人向 Qwen 的团队伸出橄榄枝 。
今天白天我和同事就感受到了很多这种连锁反应 。 比如说有其他公司的高招人员 ,3 月 3 日这天晚上也是整夜没有睡 。
挨个在给自己认识的 Qwen 的团队的人发信息 , 沟通一些工作机会 。 有猎头想联系林俊旸 , 说哪些哪些公司都有岗位找他 。
也有不少投资人在寻求 Qwen 的一些核心人员的联系方式 。 因为他们认为近期可能会有不少人陆续地离职 。
那其中可能也会有一些人想创业 。 甚至也有一些技术 leader 做好了准备 , 说接下来一段时间可能自己得花精力想想怎么帮手下去推荐好的去处 。
以下不是一个事实 , 只是我主观的一个推测 。 就是我看到林俊旸在今天下午的时候 ,他其实发了一条朋友圈 。他说 Qwen 的兄弟们按照原来安排继续干没问题的 。
我觉得他可能从心里会认为 ,他不想因为自己决定离职这个原因 , 让整个团队分崩离析 。 但接下来这个事情会怎么发展 , 现在确实有比较多的变数 。
这可能是 Qwen 团队迄今为止面临的最大一次组织上和团队上的危机 。 它背后有一个老生常谈的问题 , 就是个人和小团队的目标与更大的组织的目标之间的对齐 。
这个在越大的公司 、 曾经越多的公司里面 , 就会越明显 ,也越难解决 。 具体到 Qwen 这个团队 , 它首先是在通义实验室里 , 然后通义实验室又在阿里云 , 阿里云又在整个阿里集团里 。
那一方面 Qwen 在全球的开源社区确实有很高的声誉 ,有大量的开发者拥趸 。其实在美国最知名的中国的模型就是 DeepSeek 和 Qwen。
而且相比 DeepSeek 的话 ,Qwen 确实有更多的尺寸 , 它是受到很多中小创业公司的喜爱的 。 比如说像 Cursor 这种很知名的公司 ,也会基于 Qwen 的系列模型去做一些微调和后训练 。
然后 Qwen 的多模开源系列 ,也是很多中国巨型智能公司选择的机模 。 这个其实你从巨型智能公司发的一些技术论文 , 中间都是可以找到非常直接的这种事实的 。
价值评估15:10
另一方面 , 阿里内部也在持续评估 Qwen 的成果和价值 。其中有一些是对开源模型商业化效率的追问 。
因为开源模型它理论上所带来的这个整个生态的繁荣 , 肯定对 AI 云这个业务是有帮助的 。 但它的转化又没有这么直接 , 它不是特别好量化 。
反而是可以明显地看到 ,因为开源 , 你会影响就是直接通过卖模型 API 获得收入 。 整个阿里内部也有对 Qwen 的一些具体产出的评价 。
比如说我们了解到 , 阿里内也有一些技术高管对除夕夜亮相发布的 Qwen 3.5 并不完全满意 , 认为这是一个半成品 。
当然 Qwen 团队自己可能也没有那么满意 。 这个和前面提到的 ,他们觉得在后面训练更大 size 的模型的时候 , 比如说包括 infrastructure, 然后包括一些其他的优化并没有做得那么极致有关 。
从整个阿里的角度考虑 , 技术影响力和开源社区的声望 , 你对开源的贡献并不是目的本身 ,而是要达成 AI 云还有超级 AI App 等战略和商业目标的手段 。
在 AI 云上, 现在阿里云是面临火山引擎非常激进的追赶 。 而字节其实走的是闭源的模型 。在超级 App 上, 豆包确实是领先国内其他大公司的 。
那刚刚结束的春节补贴大战上, 千问 App 也没有明显缩小与豆包的差距 。 当然这里有一个背景 , 就是千问 App, 它其实是在去年底才又被阿里视为最主打的 AI 应用 。
所以它的这个发展的周期 ,以及它之前获得的资源 , 可能和豆包相比本身也是有差距的 。 所以现在不到一个说判断 AI App 胜负的最终的时间点 。其实在 23 年的 AI 热潮之前 , 就已经开始开发大模型的 Qwen 这个团队 , 它曾经有一个相对独立于阿里大环境的小环境 。
小环境16:37
它成长于一个少有人注意的角落 , 少被打断 , 少被拉扯 。他们可以把更多精力用在模型本身的迭代上 。
Qwen 确实也是阿里内一个很特别的团队 。 它的两任直接的团队一号位 , 周畅和林俊旸 , 都在一个大公司的环境里给这个小团队注入了自己的个人印记 。
这包括这个团队之间的密集的协作 , 相对稳定的核心成员 ,他们之间长期一起共事 , 一起奋战获得的信任和默契 ,以及他们对开源的坚持 。
其实 Qwen Max 系列 , 就它最大的那个旗舰模型 ,是没有开源的 。 不过林俊旸在 1 月的 AGI Next 上, 我记得他是说过 1T 的这个模型 , 就是万亿参数的模型 ,他也想推动开源 。
但是现在整个 AI 已经成了所有大型科技公司输不起的全局战争 。 这种不被打扰的 、 相对边缘地带的小环境 ,是很难持续存在的 。
AI 的商业化和应用竞争也变得更激烈了 。在强调组织目标 、 集体目标 、 指哪打哪的大公司的运行惯例 , 和那些最聪明的 、 自驱的 、 有创造力的一个个个体之间 , 本身就存在冲突和张力 。
一个大公司愿意在多大程度上去包容一个小团队的这种个性 , 或者说个色 , 你可以说它是一个原则问题 ,也可以是一个选择问题 。
阿里后续会继续如何处理这件事情 ? 管理层的态度还是会和现在全员会上一样吗 ? 我觉得这可能需要更长的时间来观察 。
我们也会尽我们的努力来持续报道和跟踪 。 也欢迎各位听友在评论区留下更多讨论 。 今天的节目就到这里 。
各位拜拜
。






