晚点晚点聊 LateTalk2026年4月6日· 30:44

158: V4发布前的DeepSeek:人才竞争、组织特点和独特的AGI目标|Solo

梁文锋领导的DeepSeek正因人才竞争、期权定价模糊和AGI目标分歧而经历人员变动,但这家不到200人的实验室仍保持不加班、重原创的独特氛围。主播程曼祺在节目中梳理了近期核心研究员离职:王炳轩被腾讯姚顺雨挖走,魏昊然、郭达雅可能加入大厂,阮冲去了自动驾驶公司元荣启行;直接诱因包括腾讯实习日薪被曝达5500元、字节Seed曾开出4000元,而DeepSeek无明确估值使期权价值难预期,MiniMax和智谱上市后股价翻五六倍也形成财富效应对比。更底层的张力是目标分歧:梁文锋重视国产生态(如换用Tailon算子库)和原创探索(GENIUS、Prover、OCR等),不单纯卷性能,这与他“每天高质量输出难超6~8小时、反对加班”的理念一致,却与外界期待其每次出手都像R1一样惊艳并不匹配。组织上,DeepSeek保持扁平,梁文锋直接带基模架构团队,周会向其他组开放,小团队可自发立项;产品端仅小几十人,至今未涉及AI编程、OpenClaw等热门方向,但梁文锋从2025年秋起强调产品化和商业化,3月招聘已首次提到要招agent产品经理。关于V4,节目称其或于4月开源,至少包括接近300B和500~600B的版本;但同时DeepSeek在OpenClaw模型消耗量中整体排第12(剔除免费模型后进前十),迭代频率低于智谱、MiniMax和Kimi。梁文锋本人几乎不融资、不见投资人,曾长期住酒店、现在租房,也不参与团建,被熟悉的人评价为“特别能抵抗噪音”;节目最后呼吁以平常心看待这家公司。

  1. 0:00开场
  2. 1:37人才变动
  3. 3:44V4 动态
  4. 4:27人才争夺
  5. 7:55深层原因
  6. 11:02AGI 目标
  7. 14:30Agent 缺席
  8. 18:34算力差距
  9. 19:31留下的人
  10. 20:55梁文锋
  11. 22:33组织风格
  12. 27:30生活侧写

PodHood 提供支持

文字稿

开场0:00

曼祺0:05

欢迎收听 《 晚点聊 》, 我是曼祺 。 今天这期节目又是一期 solo, 来聊一聊 DeepSeek 这家公司和它近期的变化 。

上周四 ,《 晚点 LatePost》 发布了一篇关于 DeepSeek 的报道 :V4 发布前的 DeepSeek 特质 、 组织和梁文锋的独特目标 。 我在那篇文章里写了我认为非常确切的 、 可以公开表达的关于 DeepSeek 的情况 ,以及这家公司过去的历史和它的一些特质 , 还有梁文锋这个人对 AGI 以及如何实现 AGI 目标的独特理解 。

如果你已经看过这篇文章 ,其实播客本身并不会有太多新增信息 ,但是会有一些个人感受和观察 ,以及文章发布后的一些反馈与补充 。

首先 ,DeepSeek 给我的综合感受就是 : 这是一朵 AI 界的奇葩 。 这里的 " 奇葩 " 是它原本的意思 : 阆苑仙葩 , 怎落凡家 ?

在中国这个非常追求效率 、 追求投入的性价比 、 追求用实力说话的市场环境里 ,DeepSeek 的目标和风格都非常独特 , 找不到第二家 。

比如它有一个显著的特点 , 就是不怎么加班 。 如果没有特殊情况 , 平日里大部分员工会在 6 点到 7 点左右离开公司 。

这和梁文锋的一个理念有关 : 他认为一个人每天能高质量输出和工作的时间 , 很难超过 6 到 8 个小时 。

超长工作带来的疲劳和昏庸判断 , 反而会浪费宝贵的算力 , 得不偿失 。 这造就了它的不平凡和传奇 ,而某种程度上 ,也是它如今的一些内外部变化的源头之一 。

那我们就来聊一聊 DeepSeek 从去年底到今年的一些具体的变化 。 目前这家公司是不到 200 人 ,其中大概有 100 小几十人是研发团队 , 包含了数据和 Infra 团队 , 另外有小几十人是产品团队 。

人才变动1:37

曼祺1:53

近期一个明显的变化就是 , 研发团队里有数人集中在春节前后离开 。 这包括 2025 年底被腾讯的姚顺雨挖走的王炳轩 ,他是 DeepSeek LLM,也就是 DeepSeek 的第一代大语言模型的核心作者 , 此后参与了历代模型的训练 。

约在春节前后离开的魏昊然 ,他是 DeepSeek OCR 系列的核心作者 ,他可能会加入某大厂 。 第三位是近期正式离职的郭达雅 ,他是 DeepSeek R1 的核心作者 ,他可能也会加入某个大厂 。此外还有一位 , 阮冲 ,他是在 26 年 1 月官宣加入了一家自动驾驶创业公司 " 元荣启行 "。Oh by the way, 就是元荣和 DeepSeek 在北京的办公室还在一个楼里面 , 都在融科 。

不过阮冲其实离职的时间比较早 , 据我了解应该是在 2025 年的上半年, 离职后他退休休息了一段时间 。

阮冲是从幻方时期就加入的老成员 ,是 JailOps Pro 等 DeepSeek 多模态成果的核心贡献者 。其实在 100 多人的研发团队里 ,有 3 个人离职真的不多 ,但为什么它比较受外界关注了 ?

是因为对比来看 ,DeepSeek 之前其实没有什么全职员工离开 。 据我所知 , 之前离职的就是 2024 年 3 月 , 当时比较早就离开的张博 ,他是 DeepSeek VL,也就是 DeepSeek 的一个开源多模态大模型的负责人。

他现在是回到了浙大 ,在担任教授 。 下一个是 2025 年初离开的罗弗利 , 这位应该是市场比较关注的 , 后来是加入了小米 。

还有前后脚的阮冲 。 不过之前的这 3 个人里面 , 除了罗弗利 ,其实张博和阮冲都没有加入别的 AI 公司 。

张博应该是同时也在创业 。 而这次的人员变动 , 首先大家都直接加入了 , 可以说是同行或者进队吧 。

然后另一个比较受关注的关键的背景就是 DeepSeek V4 到现在还没有发布 。 我们在那篇文章里也提到 ,其实春节前的 26 年 1 月左右 ,V4 的一个小参数版本已经给到了一些开源框架社区开始做适配 。

V4 动态3:44

曼祺4:00

按此前相对乐观的预期 , 更大参数版本的 V4 原本是有可能在 2 月中旬的春节前后发布和开源的 ,但是确实到现在大家一直在等 , 一直在问 DeepSeek V4 在哪 。

据我了解 ,V4 应该会在 4 月开源 , 至少会开源其中的几个版本 。 从社区的信息看 , 至少会有一个接近 300B 的版本和一个 500 到 600B 的版本 , 更晚可能还会有一些新的成果释放 。

人才争夺4:27

曼祺4:27

这轮人员变动的直接外部原因 , 当然是所有人都看到的日趋激烈的 AI 人才争夺战 。 最近离职的这 3 位都是加入了中国的大型科技公司 。

中国公司里 , 就我个人的观察 , 对 DeepSeek 的人员 , 或者说对所有的 AI 研究者来说 , 最有吸引力的应该是两个团队 : 自己的 Seed, 还有腾讯的 AI 团队 。

自己的 Seed 虽然已经有 1500 人, 以往被诟病这里的不同小团队之间会有很多 overlap 和赛马 ,但其实在全球来看 , 像 DeepMind, 就是 Google 的 AI 研发团队 , 已经超过了 7000 人, 快接近 8000 人。

所以也会有人认为 Seed 的人数并不多 。 面对现在越来越多的值得探索的 AI 方向 , 一个组织是可以容纳更多研究员的 , 相应的就需要更多的算力来支持大家做研究 。

字节在这方面肯定有优势 。 腾讯现在比较吸引研究员的一点是 , 去年下半年他们招募了姚顺雨来领军 AI 研发 , 新帅到岗肯定就得建立自己的团队 。

所以腾讯一方面在比较激进的广泛去接触和招募优秀的人才 , 另一方面 , 这个时期加入腾讯的人也更有可能获得核心的和重要的位置 。

比较有意思的一个小插曲是 , 我们发布 DeepSeek 这篇报道之后的第二天 , 又发了一篇关于 Kimi 的报道 , 提到了 Kimi 开始给实习生发期权 , 想提前锁定这些人才 。

这篇文章发布后 ,在 《 晚点聊 》 的播客讨论群里 ,有人贴出了清华姚班的同学在腾讯的实习信息 , 上面的薪资描述是每天 5500 元 ( 税前 )。

下面还有一条评论说 , 同在清华姚班 ,在千问实习只有每天 4200 元 。其实这两个价格都刷新了我自己了解的记录 。

我之前知道的最贵的实习工资是去年 Seed 团队给一些 Top 实习生开的 4000 元每天 。 如果 5500 元一天是真的话 , 假如这个实习生他每天都去上班 , 上班一个月 , 那月薪就超过了 10 万人民币 。

这么高额的实习工资也侧面说明了现在 AI 人才的竞争有多激烈 。 从这个直接的外部原因往下看 , 就涉及到 DeepSeek 自身的一个特殊情况 , 这让它在人才竞争中处于相对弱势 ,也就是期权定价问题 。

大部分公司给的总包都是包含现金 , 还有股份或者期权部分的 ,但 DeepSeek 目前没有一个明确的公司估值和定价 。 所以 DeepSeek 的员工虽然签了期权协议 ,但他们对这些期权到底值多少钱是感到比较疑惑的 。

而从去年底开始 ,有一个外部变化会让 DeepSeek 成员对期权这个问题感到更加的急迫或者说疑惑吧 , 就是 MiniMax 和智谱这两家第一批大模型公司上市 。

上市之后 ,他们股价涨得非常好 , 到现在已经翻了五六倍 , 两家公司的市值都来到了 2500 到 3000 亿人民币左右 。

而到了春节之后, 借月星辰和 Kimi 也都传出了要 IPO 的计划 。 因为 AI 研究圈其实很小 , 大家都是同学 、 师兄弟姐妹 、 室友或者以前是同事 , 这种财富效应的对比多多少少还是会对各个公司里的人都产生一些影响 。

这也是 DeepSeek 或者说梁文锋最近在求变的地方 。他正在行动起来 , 想办法给公司一个更明确的估值 , 从而给团队成员提供更明确的预期 。

深层原因7:55

曼祺7:55

变化的最底层 、 最长期的原因 , 则是一个目标和共识的问题 。 这就触及梁文锋自己对 DeepSeek 要做成什么样式 、 怎么想的 ,他怎么理解 AGI 这个目标 ,而他的理解和拆解能否让 DeepSeek 一直保持竞争力 , 能否被团队的其他成员所认可和接纳 。

要解释清楚这个问题 , 我们可以往回倒一点 。 如文章里所写 ,其实梁文锋不是从 2023 年 DeepSeek 成立时才开始关注 AI 的 。

这里有一个有意思的对比 , 或者说一种双向交错 。在马拉比的新书 《The Infinity Machine》,也就是哈萨比斯谷歌 AI 大脑里写到 ,16 年的时候 ,AGI 的提出者 、DeepMind 的创始人德米斯· 哈萨比斯其实想把 DeepMind 从 Google 里给独立出来 。

当时他试了一些方法去自己造血赚钱 ,其中之一就是组建了一个小团队做量化交易 。 马拉比后来问哈萨比斯这件事结果如何 ,他说没有赚到钱 , 团队解散了 。

而差不多同时, 梁文锋是在 2015 年创立了幻方这家量化基金 。 当时 1985 年出生的梁文锋是 30 岁 ,他已经做量化投资 7 年了 。他是浙大的本科和硕士 ,也就是上学的时候他就在自己做量化交易 ,在炒股赚钱 。

正式创立幻方之后,2016 年, 幻方就开始用 GPU 跑深度学习算法的实盘交易 。 幻方的官网里特别提到 , 当时行业里的大部分交易都是用 CPU 来做的 。

到 2017 年底 , 幻方实现了几乎所有交易策略 AI 化 。在 2019 年, 幻方开始建立第一个算力集群 ,有 1100 张 GPU 的英火一号 。

也是在 2019 年, 幻方 AI 这家公司正式注册 。 当时梁文锋招人面试时就会提到 AI, 后面幻方又建了英火二号 。

所以到 2021 年时, 幻方已经拥有了 1 万张 GPU。23 年 5 月 , 梁文锋接受当时在 36 课的暗涌的余丽里和刘京的采访时, 描述过在 AI 热潮之前购买 GPU 的这个过程 。他说其实如果只做量化投资 ,不需要这么多卡 。

当时建英火一号和英火二号更多是想满足一种好奇心 ,因为 2020 年他看到 GPT-3 之后, 认为方向是很明确的 , 就是扩大算力 。

当时幻方想扩大算力去研究的方向 ,是看有没有什么方式能够更完整地描述金融市场 , 不同范式的能力边界在哪 ,在金融里的这些方法和范式有没有更广泛的用途 。他把买 GPU 的这种花钱烧钱行为形容为就像家里买钢琴 , 一来买得起 , 二是因为有一群急于在上面弹奏音乐的人。

这里指的就是要用 GPU 来做研究的研究员 。 那继续往下说梁文锋自己的目标 ,其实他说的满足好奇心和弹钢琴的比喻 , 我觉得都挺反映他和 DeepSeek 这家公司的特质的 。DeepSeek 并不是一个典型的创业公司 , 它从最开始并没有迫在眉睫的生存问题 。

所以对梁文锋和他招募的这个小型而精简的研发团队来说 ,他们的目标和做事风格从一开始就非常独特和纯粹 。

据我们了解 , 梁文锋自己对 AGI 的目标 , 或者说他对当前事项优先级的理解 ,并不是一味追求模型的性能 。

AGI 目标11:02

曼祺11:10

除了追求大模型的智能上限 ,他认为还有两个很重要的工作 , 一是基于国产生态来做大模型 , 比如他们去年 8 月更新 v3.1 之后, 就采用了 UEM80FP8 这样一种数据压缩格式 。

当时在留言区 ,DeepSeek 自己回复到 , 这种数据格式是针对下一代国产芯片设计的 。在 25 年 9 月底更新了 DeepSeek v3.2 时, 我们还可以从技术报告里看到 , 当时 DeepSeek 甚至把底层的算子库从主流的 CUDA 和 Triton 换成了 Tailon。CUDA 是英伟达提供的最底层的 , 可以去操控 GPU 的语言 ,Triton 是 OpenAI 早年开源的一个语言 , 它是在 CUDA 上又抽象了一层 。

而 Tailon 则是一个国产的开源项目 ,是由北京大学的杨志老师的团队发起的 。 第二个他认为很重要的方向是原创式的创新 , 做一些大厂或其他的创业公司可能不会去试的方向 。

比如 24 年下半年,DeepSeek 就开始了 GENIUS 系列 , 这是一个比较早的开始做统一多模态的理解和生成的尝试 。 我们最近访谈过的另一家公司 , 质检动力 , 这是一家具身智能公司 ,他们发布的具身模型 Lust0 的底层的机模就是 DeepSeek 的开源的 GENIUS Pro。DeepSeek 也做过 Prover 系列探索形式化证明 , 还有 25 年连续发了两篇的 OCR。OCR 其实就是把文字序列转成图片再输入给模型 , 这个思路是让模

型按更接近人类看文字的方式去理解段落与层级 , 提升对复杂文档的理解力 。 梁文锋还在 2025 年招募了一些神经科学和脑科学背景的顾问 , 想探索更接近人脑的学习机制 。

有接近 DeepSeek 的人士告诉我们 , 梁文锋觉得在提升模型效率和性能的主线之外, 需要做一些当下回报不明确的方向 。

因为国外那些算力更多的公司 , 比如说 Google、OpenAI,他们内部肯定在试各种各样的方向 。 而如果只是卷性能 , 靠中国其他的公司 , 比如说 Seed、MiniMax、Kimi、 智谱 , 大家也可以做得非常好 。

但梁文锋自己的这个目标和外界 , 甚至和团队内部的部分成员都有一定的分歧 ,因为他的目标并不是简单的追求最强卷性能碾压 。

这与外界现在对 DeepSeek 的部分期待是不匹配的 。 一些人希望 DeepSeek 每次出手都能像 R1 那样石破天惊 。 说实话 , 这有些强人所难 , 某种程度上我觉得也造成了 DeepSeek 团队现在的一些压力 。在 DeepSeek 内部 , 或者说对绝大多数年轻的 AI 研究员来说 ,他们比较看重的事情就是自己能持续的参与业界最强的模型 ,在那些被关注的技术报告上署名 ,以及能有丰富的 GPU 资

源来做他们想做的实验 。 而 DeepSeek 在这两点上, 就是持续最强和充沛算力资源 , 这两点上并不是满足所有人需求的 。

持续最强更多还是我觉得它不是一个问题吧 , 是一个现象 。 因为它想做很多更原创的探索 , 那这个里面确实有一些方向的回报就是非常不确定的 。

前沿研究本来就应该承担这种不确定 ,但这对习惯了看成绩 、 看分数 、 看排行比拼的整个环境来说 , 可能有些水土不服 。

然后是强这件事的标准 ,在 AI 领域本来就变得越来越模糊和主观了 。 比如说现在我们如果一个模型发了之后, 只去看 benchmark 的话 ,其实已经看不出来这个模型到底有多强 。

Agent 缺席14:30

曼祺14:43

尤其是进入 agentic 模型 , 就是智能体模型的竞争之后, 很多人会发现体感和实际的使用体验是更重要的 。

也许两个模型的跑分差不多 ,但是用起来感觉就是不一样 。 我觉得其中一个原因是因为产品出手 ,以及产品出手带来的长尾使用案例和多样化的数据变得更重要了 。

而这恰恰是之前专注于模型研发 、 做产品投入比较少的 DeepSeek 相对短板的地方 。 即将发布的 V4 大概率仍然是开源的最强的模型 ,但是现在对不同场景的不同开发者和不同的用户来说 , 强的标准和体感本来就越来越多样 。

同时客观上 ,在去年下半年到今年如火如荼的 agent 应用竞争上,DeepSeek 是相对缺席的 。DeepSeek v3.2 确实强化了 agent 的能力 ,但整个 DeepSeek 的模型迭代频次是远低于其他小虎的 。

从 2025 年初至今 , 智谱 、MiniMax、Kimi 分别已更新了 5 版 、4 版和 3 版模型 。 像 MiniMax 从今年 1 月到现在就已经更新了三次 ,MiniMax M2.1、2.5, 还有最新的 2.7。

而智谱的话则是直接推出了面向 OpenClaw 专门优化的模型 GLM5 Turbo。 我们可以从 OpenRouter 的数据来看看 ,在个人和中小开发者中, 大家使用 OpenClaw 就是小龙虾这种应用时, 消耗了哪些底层的模型 。

这张图我们当时也用在了文章里 , 统计的是 2 月 24 号到 3 月 26 号这 30 天的 OpenClaw 的模型消耗量 , 排在前十的模型里面有 6 个都来自中国公司 ,而 DeepSeek v3.2 是排在第 12 的 。

这里我补充说明一下, 发了文章之后我获得的更具体的信息 ,在这个排名里面 , 排在第一的用量远远超过其他模型的 Step3.5 Flash, 来自借月星辰的这个模型 , 它是免费的 , 所以它的排名非常高 。

当然它应该也相对比较好用 。 同样还有排在第五的 Trility Large Preview, 这是一家美国公司 Acre AI 发布的模型 , 它排得很靠前 ,也是因为在 Preview 阶段这个模型是免费的 。

那如果把这免费的不算单排付费模型的话 ,DeepSeek v3.2 在 OpenClaw 里面是排在前十的 。 我觉得这个排名一方面说明在 agent 相关的模型消耗上,DeepSeek 其实至少在中小开发者里吧 , 它相对来说比较靠后 。

当然 OpenRouter 也只能是做个参考 ,不代表每家公司完整的量 。 然后另一方面也说明什么了 ,也说明其实 v3.2 是个挺老的模型了 , 就别的模型都已经更新了好几轮了 。

那 v3.2 以一个这么老的模型还能排在前面 , 你也可以侧面说 DeepSeek 挺厉害的 , 看你怎么理解这个事吧 。

那如果来比应用的话 , 智谱 、MiniMax、Kimi、 借月等等 , 包括字节的飞书 ,他们都做了龙虾相关的应用 ,DeepSeek 更是没有什么这方面的投入 。

前面我也提到说 DeepSeek 其实有一个小数十人的产品团队 ,但是到目前为止他们是没有涉足 AI 编程 、 通用 agent、OpenClaw 小龙虾这些热门方向的 。DeepSeek 在 C 端的产品仍然是一个典型的 chatbot, 相应的变化和调整是从 2025 年秋天起 , 梁文锋也开始更多的在公司里去提要做产品化和商业化 。DeepSeek 确实也会更多的投入产品 , 这个从招聘信息里已经有反应 。

比如说在 3 月中旬的最新招聘中,DeepSeek 就第一次在招聘启事里提到了其他具体产品的名称 , 说是要招募 agent 方向的模型策略产品经理 , 要求包含持续跟踪行业前沿 、 熟悉并深度使用过 Claude Code、OpenClaw、Manus 等知名 agent。

然后是算力资源的问题 ,其实三年前梁文锋讲的那个比喻 , 买卡就像买钢琴 , 一是买得起 , 二是因为有一群要在上面弹奏音乐的人, 后半句现在仍然是成立的 。

算力差距18:34

曼祺18:46

而且急于弹琴的人更多了 , 能弹的曲子也更多了 ,也就是研究方向更多了 。在语言模型的主线之外, 我们可以看到世界模型 、 持续学习 、 在线学习 、 新的更像人脑的学习机制等等 , 这都需要算力资源去支持实验 。

但是买得起这件事情已经在变化 ,因为在全球过去几年大幅扩张的算力资源军备竞赛中,DeepSeek 并不占优势 。

它和全球乃至中国的一些核心大公司的差距可能是在拉大的 。 结合上面的多重原因 , 我们现在可以理解为什么以往很难挖洞的 DeepSeek 的人有了松动的迹象 ,有人离开 , 更多人选择留下 。

留下的人19:31

曼祺19:31

可以澄清一下, 近期外界的有一些传闻是不准确的 , 比如说 DeepSeek 有成组流失的情况 , 这并没有发生 。 留下的人中 ,他们大多数认可梁文锋追求 AGI 的方式 ,他们想去做那些并非由于竞争驱动的探索 ,他们也比较习惯 DeepSeek 相对宽松从容的研究氛围 。

这是 DeepSeek 相对不变的部分 , 至少到目前为止没有看到明显的变化 。 这些不变的部分来自梁文锋的特质 , 一个小型创业组织的氛围其实很大程度上就是创始人特点的外溢和外化 。

这些特点包括我前面提到的不加班 , 梁文锋确实认为一个人一天能高质量工作和输出的时间就是在 6 到 8 个小时左右 , 尤其是做 AI。

如果长期疲劳 , 做出一些昏庸的糟糕的判断 , 反而会浪费宝贵的算力资源 。 这个想法看着挺平常 ,但在全球 AI 核心公司里 ,不加班少加班真的极为罕见 。

别说本来就以卷著称的中国公司 ,其实在美国核心 AI 研究人员也常常需要高强度的工作 , 哪怕是在提倡给工程师 20% 自由时间的 Google。DeepMind 的核心 AI 团队也是非常忙碌的 , 还有以高强度工作著称的马斯克带领的 xAI,有些研究员的周工作时间甚至可以达到 80 小时 。

梁文锋20:55

曼祺20:55

梁文锋自己是一个只做少数事 , 会把它做到极致 、 做得细致的人。 比如作为公司 CEO,他以往并没有花特别多的时间融资 。

我们文章里也写到 23 年的时候 ,他其实见过一些投资人 ,但当时他提了一个类似于微软和 OpenAI 早期投资协议的方式 , 就是他希望投资方能接受一个固定的回报上限 , 这对 VC 来说其实没什么道理 。

所以那一轮见完之后没有人投 DeepSeek。 到 25 年 21 爆火之后, 梁文锋其实就不再见投资人了 , 甚至不建立新的联系 ,不认识新的机构 。

对大多数 CEO 来说 , 即使不在融资窗口期 ,也不会拒绝去认识一下一线机构的合伙人。 但我确实就知道有些合伙人 ,他们当时通过各种途径想办法想去和梁文锋建立联系 ,但他拒绝了大多数这样的请求 。

这并不是说梁文锋是个很自闭的人, 据我所知他跟 AI 从业者的交流还是挺多的 。 所以说梁文锋只是选择了花最多的时间在他认为最重要的事情上, 那就是模型的研发 。在具体的技术判断上, 梁文锋之前认为语言推理逻辑这条线才是智能的主线 。DeepSeek 其实没有花太多精力去做多模态生成 ,但这并不是说他们没有做多模态 ,因为多模态还包括多模态

的理解 、 多模态的推理 。 比如说张博之前在 DeepSeek 做的 DeepSeek VL,以及理解与生成的统一 。 比如说我前面提到的 GENUS, 与梁文锋的风格相应 ,DeepSeek 的组织是非常扁平的 ,而且形成了各团队之间交叉分工的状态 。

创立幻方的时候 , 梁文锋是有合伙人的 ,但是在 DeepSeek 没有二把手 , 尤其是在研究团队 , 只有梁文锋和其他的研究员两个层级 。

组织风格22:33

曼祺22:41

这部分的团队就像一个大型的实验室 , 大家会习惯称梁文锋为梁老板 , 这个老板的角色更接近导师 。他会组织研发 、 协调资源 ,也自己做一些具体的研究 。

比如我们可以看到梁文锋会在 DeepSeek 的有一些论文里面署名 , 会当通讯作者 。他自己直接带的是基模架构这个团队 , 这个 team 有小几十人 ,他们是预训练的主力 。

梁文锋会和这个团队深入的讨论 , 确定每一代基模的架构定版 , 然后是跟基模架构合作比较密切的数据和 infrastructure 的团队 。

因为在定版的过程中就需要考虑数据的选择和 infrastructure 怎么实现 。 之前在千问的那期播客里面也提到过 ,其实这种 infrastructure 和数据和基模紧密合作的方式 , 对研究员来说是一种最自然的方式 。

这也是当时为什么从 25 年的年终开始 , 林俊洋带领的千问的这个小团队其实是想自己招一些 infrastructure 的人呢 , 想不再依赖于当时支持他们的阿里的 Pi PAI 这个团队 。

但是这件事情在更大的公司里它可能更难实现 ,而 DeepSeek 是非常自然的就保持了这种状态 。在有一些公司里面 ,infrastructure 它会有一些像一个内部的乙方 , 就是模型团队会给你提一些要求 ,而且大公司里的 infrastructure 的人可能会很多 , 比如说有个小几百人也是很正常了 。

然后你作为这个小几百人的其实已经不小的一个团队里的成员 , 可能很难跟算法和模型之间有非常密切的交流 。

但在 DeepSeek, 很多人都是会有一些交叉学习的机会 。 梁文锋自己就是串起这些不同的模块的一个探测器和粘合剂 ,他会参加每一个团队各自的周会 , 去了解全局的进度和卡点 。DeepSeek 大部分团队的周会也是向其他组的人开放的 , 大家可以跨组去参会 、 去讨论 。

所以至今 DeepSeek 依然可以做到自然分工 ,有时开始一个新的方向 , 就是因为有三五个人都觉得有一个 idea 不错 , 这三五个人甚至可能都不是一个组的 , 然后他们就一起去做了 。

如果公司层面也觉得这个方向不错 , 那可能就会在小规模的实验之后给到更多的资源去验证这个方向的潜力 。

所以这次在做这篇报道的过程中间 ,有接近 DeepSeek 的人士告诉我 , 非常发自真心的说 ,DeepSeek 是一个真心想做研究的人 ,在国内甚至是全球能找到的最好的地方 。DeepSeek 之前的人员主要是以应届生和实习生留任为主 , 这里推荐大家去看 2025 年初晚点做的一期关于 DeepSeek 人才画像的视频 , 我会把链接贴在 shownotes 里 。

抱歉 , 这个微信的视频好像是贴不了链接的 , 就大家可以去晚点的视频号上去搜吧 , 可以搜 DeepSeek 能搜到 。

当时我们是梳理了 DeepSeek 的三代模型 GLM、V2 以及 V3 和 V1 的 172 名研究者 , 这是包括实习生的 。 然后我们找到了其中 84 个人的履历 , 做了一些数据的分析 , 可以看到这些能找到履历的人中间 ,有超七成的人是本科和硕士生 。其实 DeepSeek 的博士比例并没有那么高 , 这和当年四小龙 , 比如说商汤他们当年讲博士军团还不太一样 。

然后有超七成的人年龄是小于 30 岁的 , 这个也 call back 了我们前不久和 DINQ, 就是做 AI 招聘人才的那家公司的创始人, 之前在达摩院做研究的 Sam 高岱恒的播客 。

当时他列举了很多很多 , 如数家珍了好几个 AI 成果 , 然后他说当时做出这些成果的人年龄都是小于 30 岁 。

回到 DeepSeek, 就前面提到 DeepSeek 现在是不到 200 人 ,在 2025 年初的时候人更少 , 字节的团队 Seed 现在是 1500 人, 去年夏天前后的高峰期应该是有 2000 多人。

所以在 V3 和 V1 之前 ,DeepSeek 其实是以大厂约十分之一的人数 , 约三分之一到二分之一的人均工作时间 , 做到了全球大模型的第一梯队 。

我们可以继续观察在越来越激烈的竞争中,DeepSeek 这样的研发方式和组织氛围是否会调整 。 我想对研究员来说 ,他们想追求的是一种成就和投入的平衡 , 没有人想被竞争或者完全被落后的恐惧驱策着去做研究 。

这种情况大概率也做不出好的研究 ,但另一方面 , 这群非常自驱的 AI 人才也真的希望自己能一直产出强的 、 厉害的 、 有影响力的成果 。

当然每个人对强和厉害的标准 , 如前面所说 , 已经变得越来越多元了 。 有的人可能会更看重外部反馈 ,也有人会有自己内心的衡量坐标 。

最后来说一说梁文锋这个人, 准确说是我们从各种渠道了解到的梁文锋这个人, 作为一个不到 30 岁就财富自由的人, 梁文锋的生活是简单而神秘的 。他不是特别在意穿着和用度 ,他在杭州的时候曾长期住在酒店里 ,而在多数 DeepSeek 的研发人员所在的北京 ,他现在应该是租房住 。

生活侧写27:30

曼祺27:52

之前和智检的贾鹏那期播客里 , 我们会聊到在英伟达全球有几千人的时候 , 黄仁勋还会邀请一些员工去自己家里做客 、 喝酒 、 聊天 、 聊家常 、 展示自己的跑车 。

而梁文锋是不怎么参与 DeepSeek 的团建活动的 , 很少和成员聚餐 , 连底大团建也只在讲话时露面 ,不会参与全程 。

一个关于他的流传甚广的轶事 , 就是 2022 年的时候 , 幻方有一位员工化名一只平凡的小猪 ,他个人向慈善机构捐助了 1.38 亿元 。

后来很多人猜这只小猪就是梁文锋 , 幻方工作人员的回复是员工捐款都是匿名 , 公司内部也不知道小猪的真实身份 。

接触梁文锋的人曾经向我们评价 ,他是一个特别能抵抗噪音的人。 我觉得最恼人的噪音往往出现在两种情形 , 一种就是高峰期的追捧 , 还有一种就是焦灼期的质疑 。在 2025 年 V1 爆火之后, 梁文锋已经显示了对追捧的淡然 ,而现在他面临的是另一种情形 ,是外部竞争加剧时如何分辨噪音与信号 。

坚持该坚持的 , 改变要改变的 , 怎么做这个判断 , 这是属于梁文锋和 DeepSeek 的工作 。 而曾被这家公司震动过的更多人, 能做得很简单 , 卸下爽文叙事 , 用更多平常心去看待一家公司和技术创新 。

这次了解 DeepSeek 的过程中, 有一位从业者是这么评价这家公司的 : 低头做事的人也许不一定能在浮躁的市场洪流里笑到最后 ,但是只有更多 DeepSeek 这样的公司出现 , 中国科技才有从复刻到宁跑的可能 。

很多人觉得 2025 年初的 V1 是一个奇迹 , 奇迹之所以是奇迹 , 就是因为它不常发生 ,是小概率事件 。在中国这个崇尚竞争和结果说话的环境里 , 敢于追求独特目标的 DeepSeek 的存在本身 , 就是一个令人惊喜的小概率事件 , 它真的不一定会发生 。

最后附上转发这篇文章到朋友圈时我的想法 , 我当时写的是 :" 不用成为全村的希望 ,DeepSeek 就是 DeepSeek,其实每家公司最后都会是它自己 。"

期待 V4 发布 ,但我内心也祈祷希望 V4 能在 4 月篇中上旬发布 , 离五一假期远一点 , 拜托 。

本期节目就到这里 , 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。 下期再见