晚点晚点聊 LateTalk2026年7月1日· 1:39:42

171: 与Henry的「AI季报 26Q2」:从 coding 到 RSI,强者愈强的未来?

本期季报中,程曼祺与MoE Capital创始合伙人Henry Yin判断,行业正同时推进智能前沿(编码代理、RSI、物理AI)与智能扩散(企业自建模型、交互创新),强者愈强但开源追赶也在加速。OpenAI与Anthropic分别发布GPT-5.6和Fable 5,Anthropic因安全护栏与静默降智引发争议,OpenAI以免费抢客,Anthropic年收入预计达620亿美元,OpenAI约400亿美元。RSI成为热土:Anthropic长文称80%合并代码由Claude编写,Richard Socher、田渊栋的Recursive在三个benchmark取得SOTA,Mirendil、Core Automation等新团队涌现。物理AI上OpenAI官宣机器人团队,Anthropic考虑布局;MoE资本统计约100亿美元流向世界模型相关公司。智能扩散上,Harvey联合Applied Compute用GLM 5.1后训练出法律模型并超越前沿模型,GLM 5.2因低成本与兼容Claude Code在硅谷走红。交互创新包括Claude Tag、Record and Replay和Thinking Machines的边听边说模型;Meta推出Musespark但反响平平,Google以Gemini Omni展示多模态,xAI转向算力租赁并收购Cursor,Midjourney发布超声波CT扫描仪。

  1. 0:00开场
  2. 4:20上季回顾
  3. 6:05季报框架
  4. 8:21前沿竞争
  5. 28:04递归自进化
  6. 43:14具身智能
  7. 51:39智能扩散
  8. 1:06:00新交互
  9. 1:16:07多模态
  10. 1:23:25大厂近况
  11. 1:34:28彩蛋

PodHood 提供支持

文字稿

开场0:00

Henry Yin0:06

Anthropic 这边首先发布了它吊了大家胃口很久的这个 Mythos, 那么发布了名称以后呢 ,是 Fable, 可以说是实时记能力但是灾难级发布的一个反面教材 。

RSI 呢 , 我觉得和上一期我们聊到的这个 AutoResearch 这个概念是紧密相关的 。 那么 AutoResearch 呢 ,也就是说我们的 AI 像一个研究员一样工作 。RSI 的话 , 它是在 AutoResearch 的基础上往前更进一步 , 就是说这个研究员会在研究的过程中不断地改进自己 , 使得自己在下一次做研究的时候能力会变得更强 。

因为这个事情如果一旦做到了的话 , 它最大的意义就是说 , 那我们之后人可以从这个 loop 中抽离出来 , 只要不断地给这个 AI 系统去喂算力 , 它就会不断地去提升它的智能 。

曼祺0:53

这一季度 , 两家最厉害的公司 OpenAI 和 Anthropic 在智能前沿上还有一个不约而同的举动 , 就是它们都在加码 Robotics。

Henry Yin1:03

Anthropic 的话 ,他们在 《When AI builds itself》 这篇博文里面也提到 , 就是他们认为在 Recursive Intelligence 的下一步就是 Robotics 和 Physical Intelligence。 当这个 AI 模型它 work 的时候 , 它比我做得又快 , 做得比我又好 , 我感觉我自己没有什么价值 。

当这个 AI 模型它不工作的时候 , 那我更惨了 ,因为我完全不知道就是它为什么不工作 。 所以 AI 能力变强了 ,但是这个 AI 研究员的幸福感不一定会比之前更强 。

曼祺1:37

欢迎收听 《 晚点聊 》, 我是曼祺 , 本期继续带来 2026 年 Q2 的 AI 季报 。 嘉宾仍然是 MoE Capital 的创始合伙人 Henry Yin。

这个季度我们沿两条脉络来看 AI 的进展 : 一是推进智能前沿 , 我们聊了三个话题 , 首先是 OpenAI 和 Anthropic 之间的竞争 ; 然后是 RSI(Recursive Self-Improvement), 递归自进化 。

这延续了 Q1 我们重点讨论的一个话题 AutoResearch。Anthropic 这个季度专门写了 RSI 的长文 , 更多新的创业公司正在涌现 。

就在上周 , 我就新知道了四五个在这个方向创业的团队 ,有的已经官宣 , 更多在水下 。 三是物理 AI,OpenAI 官宣 Robotics Team, 更新鲜的非公开信息是 Anthropic 也在考虑这个方向 。

第二条线是智能如何扩散 , 我们看到更多企业客户想要自己的模型 , 这如何成为 Fireworks 等科技公司和中国开源模型的机会 。

二是交互创新 ,OpenAI 带来了 Record and Replay,Claude 终于接入了 Slack 群协作 。 最后我们补充聊了 Google、Meta、xAI 的近况 , 还有很久没上头条的 Midjourney, 它居然做起了超声波医学影像设备 。

一个小说明是我们录这期时是 6 月 27 日, 这之后又有重要变化 , 如 Fable 5 恢复了全量上线 。 所以节目里的这部分内容有之后, 我们正式进入本期的讨论吧 。

欢迎收听 《 晚点聊 》,2026 年 Q2 的 AI 季报 。 这次我们继续来和 Henry Yin,MoE Capital 的创始合伙人, 聊这个季度他的观察和他看到的进展 。

那正式开始之前 , 首先恭喜一下 MoE Capital, 你们已经正式的 announce 了 , 现在你们是有两位合伙人, 你还有 Naomi, 你可以简单讲讲你们的近况 ,有什么好消息可以分享呢 ?

Henry Yin3:18

谢谢曼祺 , 大家好 , 我是 Henry, 很高兴回到 《 晚点聊 》, 跟大家聊 Q2 的进展 。MoE Capital 最近正式 launch 了 , 然后我们希望能够做离 AI 前沿最近的早期基金 。MoE 背后呢 ,其实也有一个前沿的 AI 社区 , 我们的成员包括在 OpenAI、Anthropic、Google DeepMind 等前沿实验室工作的研究员 ,也包括很多正在做创业的 founder。

学术界这边的话 , 我们也有 Princeton 和 Stanford 的教授作为我们的 founding advisor, 我们会一起来讨论很多新的技术进展 。

我们最近已经投资了 10 家公司 , 然后这个季度也有几家公司陆续公开了 , 比如 Recursive 是 Richard Socher、 施天麟 、 田元栋等人一起创办的 Neo Lab, 专注做递归自我改进 ; 还有 Elorion 是 Gemini Data Code Lead 安柱戴创办的视觉推理 Neo Lab, 最近 xAI 的 post-training lead 的 Dustin Chuan 也加入了他们 。

最后一家是 DreamLabs, 来自 Nvidia 的 GEAR Team,他们是 DreamDojo、DreamZero 团队的四位研究员创办的机器人公司 。 如果大家对前沿 AI 研究或者这些研究如何变成下一代创业公司的机会感兴趣 , 欢迎来找我们聊一聊 。

上季回顾4:20

曼祺4:20

OK, 你提到这些公司 , 正好有一些也在我们这个季度要展开聊的一些话题 , 比如说最近非常火的 RSI, 还有同样在国内也非常火的世界模型 , 这个我们到后面可以展开 。

那首先我觉得可以先回顾一下上个季度的一些话题 , 哪些到这个季度是在持续发生的 , 哪些可能是有变化的 ,以及你觉得就比如说如果我们展开第二季度的观察 , 从哪几个角度去看 、 去梳理 , 能帮大家抓到大的脉络 。

Henry Yin4:47

上个季度我觉得有几个方向性的判断 , 这个季度其实都变得更清晰了 。 第一的话就是 OpenAI 在 coding 上的反扑基本上已经被验证了 。

上个季度我们说 Anthropic 最大的风险就是 OpenAI 如果重新聚焦的话 , 战斗力会非常强 。 那么这个季度我们可以看到就是 Codex 的势头明显起来了 ,有很多开发者从 Claude Code 切回 Codex, 尤其是在 Anthropic 自己出现了一些限流 、 价格 、 模型口碑的波动以后,OpenAI 其实抓住了这个窗口期 。

第二的话就是上季度咱们聊过 Andrej Karpathy 的这个 AutoResearch 项目 , 那么 AutoResearch RSI 在这个季度从比较前沿科幻变成了一个我觉得比较明确的一个研究和创业方向 , 这个是第二个进展 。

第三个的话就是 computer use 我觉得也往前走了一步 , 上季度我们说 computer use 非常值得期待 ,因为它本质上是数字世界里面的机器人。

那么这个季度的话 , 我们看到 OpenAI 出现了一个很有意思的 Codex 的一个新 feature, 后面的话我们可以展开聊一聊 , 它就是基于 computer use 在模型能力上面的进展 。

最后的话就是 OpenClaw, 这个上季度最火的这个话题 , 当时我们说它是一个灯塔效应 , 它可能自己不是终点 , 它可能会指明方向 。

我觉得确实这个季度它自己的热度降下来了 ,但它其实很多它有一些前沿的想法都被 Codex 和 Claude Code 吸收到他们的这个产品的功能里面去了 。

季报框架6:05

曼祺6:05

OK, 那我们如果要来看 Q2 的话 , 你会以一个什么脉络和框架来看 ?

Henry Yin6:10

我觉得 Q2 我们可以用一个框架来看 , 这个框架呢有两部分 , 第一部分就是如何继续推进前沿智能 , 第二部分是如何把我们现在已经有的智能加速在社会里面的扩散 。

对 , 所以第一条线的话呢 , 我觉得最重要的这个能力就是两个 , 一个是 coding, 另外一个是这个长程的 agentic 能力 。

那 coding 现在它已经不是一个就是应用场景了 , 它现在既是当下最重要的事情 ,因为它代表了收入 , 它也是未来 ,因为我觉得 coding 是很多接下来前沿继续往前推进的一个基础能力 。

长程的这个 agentic 能力的话呢 , 则决定了 AI 是不是能继续完成更长更复杂的任务 , 像这两种能力组合起来的话 , 才能真正实现就是 AutoResearch 乃至未来的这个 RSI。

所以在前沿的这块 , 我觉得最重要的就是这几个事情 , 包括就是 OpenAI、Anthropic 在发力 , 然后以及有一些新的比如说 Recursive 呀 、Mirendil 啊 、Core Automation 这些的新的公司都在往这个方向就是去做探索 。

曼祺7:07

他们都是在做就是自动化研究或者 RSI 就是递归自进化的这个方向 。

Henry Yin7:12

第二条线的话就是前沿智能的扩散 , 就是我觉得 Frontier Lab 他们创造出这些新的这些智能能力 , 然后这些能力呢会通过他们的产品 、API、 开源模型 、 企业的这些 workflow, 然后这个 UI/UX 乃至于就是硬件来一层一层扩散到这些社会里面 。

那么这个季度的话 , 我们可以看到 Frontier Lab 在想各种方法来加速这个扩散的过程 , 一方面呢是让这个 AI 更加深入进入企业 , 那么企业也会开始考虑就是我应该用什么样的模型 , 我应该继续用 OpenAI、Anthropic 的模型吗 , 还是应该去就是用开源模型 , 或者说我自己的模型 。

另外的话就是如何让 AI 更自然地进入人的工作和生活 , 这会带来很多就是 UI/UX 和产品形态上面的创新 , 比如 Claude 这边有 Claude Tag,OpenAI 那边的话有这个 Record and Replay, 那这些的话我觉得都是 Q2 如何让智能进行扩散的新进展 。

所以就是接下来的话就是两件事情同时发生 , 一件事情的话就是如何在前沿继续把智能往上推 , 然后第二件事情的话就是如何努力地去把已有的智能往整个社会去扩散 , 前者会决定 AI 的能力的天花板 , 后者会决定就是 AI 真正改变世界的速度 。

前沿竞争8:21

曼祺8:21

那我们就从第一条线推进前沿智能开始 , 第一个话题还是延续上季度的话题 ,也就是两大 Frontier Lab,OpenAI 和 Anthropic 之间的竞争 。

我们可以先从他们这个季度的新的模型开始说 ,因为这仍然是一切后续的竞争的原点 , 刚好在第二季度两家都有非常重磅的发布 。Henry, 你可以和大家简单地讲一讲 。

Henry Yin8:44

这个季度真的非常的这个 exciting, 首先是 Anthropic 这边首先发布了它吊了大家胃口很久的这个 Mythos, 那么发布了名称以后呢是 Fable, 这两个他们的基模是一样的 , 主要区别就在于就是 Mythos 是面向可信任的这个客户 , 所以他们没有一些安全的这个护栏 , 然后 Fable 的话是面向所有人, 它加上了一些安全护栏 , 能力非常的强 , 我觉得大家还是觉得它的能力是非常惊艳的 ,

比如说它在 SWE-bench Pro 上面是一个 80.3% 的成绩 , 那相比它自己的上一代的这个顶尖模型 4.8 的话 ,69.2 有一个大概 11 分的一个这个提升 , 然后在 Terminal-bench 上面也做到了 88 分 ,但是整体的发布下来是一个可以说是实时级能力 ,但是灾难级发布的一个反面教材 。

有几个问题这个反馈的会比较凶 , 一个的话就是过度封锁 ,因为它加了安全护栏嘛 , 所以如果在有一些问题它觉得不太合适的时候 , 它会就是拒绝回答 , 然后有的时候会退回到这个 4.8, 那么它自己的公布是说大概在小于 5% 的任务上面我会进行回退 ,但实际网友去用了以后发现会有很多问题 , 比如说当聊癌症的时候 , 它会把这个认为是一个

生物安全问题而拒绝回答你的问题 , 或者有的人问就是说这个心脏是怎么回事 , 然后它也会拒绝回答 , 所以就是有点过于神经质了这个安全护栏 。

然后第二个问题其实可能更严重 , 当然这个问题就是比较快速地被修复了 , 就是他们在系统卡里面说 , 当这个任务涉及到前沿的 LLM 或者 ML 研究的时候 , 那么我们是有可能在不告知用户的情况下静默地进行降智 , 通过改写 prompt 或者 steering vector 的方法把这个能力降下来 。

那么这个事情就是最典型的 , 如果有什么事情是 misalignment, 这个就是定义级别的这个错误 , 所以被大量的这个 AI 的研究员就是吐槽这个问题 。

曼祺10:29

Misalignment 如果翻成中文是什么 ?

Henry Yin10:32

就是非对齐 。

曼祺10:33

非对齐 , 就我们的目标本来应该是对齐 。

Henry Yin10:35

对齐的一个基础的一个假设就是当人让 AI 完成一个任务的时候 ,AI 会忠实地尽自己最大能力去完成这个任务 ,而这个恰恰就是 Fable, 它就是在不告知人的情况下不尽力去完成这个任务 。

曼祺10:47

这件事我记得第一时间在推特上就掀起了轩然大波 ,有很多人讨论 , 很多人吐槽 。

Henry Yin10:53

对 ,因为 Anthropic 一向是以这个做最 aligned 的模型的这个 Frontier Lab 著称的 , 这也是他们自豪的点 ,但他们在几个小时以后就做出了修正 , 然后现在的话应该是如果要是拒绝回答的话 , 应该是会主动告诉你我在降智到 4.8。

然后在 OpenAI 这边的话就是刚刚发布的 GPT-5.6, 那么他们这个没有 report SWE-bench 分数 ,但是他们 report 了 Terminal-bench 上面 SOW-ultr 能够达到 91.9%, 这个是历史上就是第一个应该是超过 90% 的模型 。

曼祺11:27

因为 SWE-bench 就之前聊到过很多次 , 都是一个 coding 的 benchmark,SOW-ultr 去打这个 Terminal-bench, 第一次上 90 意味着什么 ?

Henry Yin11:34

Terminal-bench 的话它是一个就是测试在 Terminal 也就是终端里面完成一些任务 , 一些多步然后需要使用工具的任务的这么一个 benchmark, 所以它可以认为是它能够测试这个偏长程的 agentic 能力的一个 benchmark。

曼祺11:49

你说的偏长程就是还没有那么长程 。

Henry Yin11:51

对 , 我觉得它可能没有就是达到比如说几个小时或者超过一天的这种任务在这个 benchmark 里面 ,但至少是一个多步的 。

曼祺11:59

然后就 GPT-5.6 在 Agent's Last Exam 也是一个 benchmark, 然后它的表现也比较惊艳 ,是目前的模型里面唯一一个超过 50% 的 。

Henry Yin12:08

对 , 这个也是一个比较不错的一个分数 , 除了这两个 benchmark 以外 ,他们还 report 在生物然后以及这个网络安全上面能够匹敌这个 Mythos preview 的这个成果 。

曼祺12:21

为什么这次它没有去公布 SWE-bench Pro 上的分数 , 这在以往模型发布都是一个惯常的操作 。

Henry Yin12:27

OpenAI 在今年 2 月份的时候其实发布了一篇文章就说 SWE-bench verified 现在已经不是一个很好的就是测量 coding 能力的一个 benchmark 了 ,因为它已经持续地被污染了 ,他们会推荐就是 SWE-bench Pro,但是为什么他们这次没有发布在 SWE-bench Pro 上面的这个分数 , 可能外界也不知道具体的情况 。

曼祺12:44

因为现在 GPT-5.6 它和 Fable 类似 , 它也都是限量使用的 , 就是它开了一个安全可信的名单 , 这些人才能来用这个最先进的模型 , 所以今天也有很多人在讨论说是不是美国政府的这种监管以后会变得常态化 。

Henry Yin12:59

这块补充一下就是这两个模型发布以后, 一个另外一个非常大的变化就是现在不是所有人都能够使用最前沿的模型了 , 这个 Fable 发布在三天以后, 美国政府就一直禁令就是说不允许 Anthropic 给外国人提供 Fable 这个模型 , 然后因为 Anthropic 又无法判断这个用户是否是外国人, 所以它直接就全球用户下线了 Fable。

那么在我们现在录制节目的时候 , 刚刚就是限量地重新上线了 Fable, 然后在 GPT-5.6 发布的时候也是同样的是美国政府要求 , 只能对美国政府批准的实体开放这个 5.6 的这个能力 , 所以目前的话应该是只有大概 20 家像这个 Nvidia、Amazon 啊这样的客户能够 access 5.6。

曼祺13:44

那总结而言的话 ,在第二季度的新的模型上, 一边是 Fable 5, 一边是 GPT-5.6, 你觉得两家的对比怎么样 ?

Henry Yin13:53

如果我们要是看 Fable 5 和 GPT-5.6 的 benchmark 上, 我觉得是各有千秋 ,但是实际的使用体验上来说 ,5.6 刚刚发布 , 还没有太多的用户能够使用 ,Fable 5 的话也就发布了三天 , 所以总体反馈不多 ,但是 Fable 5 我们可以看到在网络上有一些这个 demo, 比如说能够 one-shot《 我的世界 》 或者 one-shot《 像红色警戒 》 这种级别的游戏 , 所以能力上面应该还是比之前是一个大版本的一个跃进 。

曼祺14:21

那我们接下来就是进入更产品化和商业层面的竞争 ,也就是现在这两个公司的主线 coding 相关的产品以及和这个相关的通用 agent 的产品的竞争 ,其实上个季度我们就聊到说 Anthropic 的隐忧就是 Codex,OpenAI 的 coding agent 可能会强势反扑 , 最开始你也提到这件事情在本季度是已经有苗头的 , 确实你能感觉到周围有很多人在迁移 , 你可以讲讲一个是你感受到的这种迁移的

状态 , 就一些事实 , 然后背后的原因 ,以及比如说宏观上我们能看到势头的反转 。

Henry Yin14:57

我先从我身边的感受说一下, 我觉得就是最大的一波迁移潮可能是 Claude 4.7 的时候 ,4.7 是一个明显大家都不太喜欢的模型 ,4.8 我觉得口碑是有回升的 , 那 4.7 的话呢 , 应该是主要目的发布 4.7 就是为了降本 ,但是 4.7 的时候就是有大量的这个用户因为不满意 4.7 模型的表现 , 所以从这个 Claude Code 迁移到了这个 Codex。

另一个的话呢 , 就是 Anthropic 在 5 月份的时候定价上面有一些变化 ,他们就是不想再让第三方的 harness 能够按照 subscription 的价格来去用它这个 token,而是要用按照 API 的价格来算 , 所以这一波又让有很多用户就是流失掉了 。

然后 OpenAI 的话也是很好的就是抓住了这个机会 , 就是说 Sam 在 X 上说所有最近 30 天愿意从 Claude Code 迁移到 Codex 的企业用户 , 我给你两个月免费 , 然后这一波又拿了一波客户 。

所以从宏观上来讲的话 , 我们可以看到就是 Codex 应该这个 usage 应该是比较大幅地上升 , 当然这个 Anthropic 现在最近几个月的这个 revenue 增长还是非常的猛 , 对 ,并且好像在 Q2 出现了这个首度的这个盈利 。

曼祺16:09

就是有好几个媒体 , 包括华尔街日报 , 然后像这个路透他们报道说出现了二季度的盈利 , 这不算是公司官方放出来的 ,但因为这几个都是比较权威的财经媒体 , 应该相对靠谱 , 大概是说它二季度有 5.6 亿美元的营业利润 。

Henry Yin16:25

还有一个也是非官方的一个营收数据 , 就是 Anthropic 大概的这个增长是 5 月早期的时候大概是年收入 , 预期的年收入大概是在 470 亿美元 , 然后到这个 5 月底的时候就增长到了 540 亿美元 , 到 6 月中的时候增长到了 620 亿美元 , 所以这个增速还是非常可怕的 。

对比一下 OpenAI 的话就是 6 月中的时候大概在 400 亿美元 。

曼祺16:50

然后 Anthropic 的 6 月中是 620 亿美元 , 对吧 ?

Henry Yin16:54

对 。

曼祺16:55

有 1.5 倍的差距 。

Henry Yin16:56

对对对 , 这差距其实如果你对比第一季度应该是拉大了 ,Anthropic 的增长更快了 ,不过这里面我觉得有一个就和前面说的事实结合起来看 , 它可能就是用量上的差距也许没有这么大 ,是因为你说到其实 Codex 送了很多免费的东西 , 对吧 ?

就是它的价格占比较激进嘛 ,因为它是相对落后的一方 , 所以它有一些用户的增长可能没有等量的反映在它的收入上 。

因为现在 Codex 很多人是 20 刀每个月就能用饱的 ,但是 Anthropic 他们可能如果要用的话 , 可能是至少是 100 刀或者 200 刀的这个 。

曼祺17:30

那就相当于相同的用量你就差了 5 到 10 倍的收入 ,OpenAI 还是挺激进的 , 挺狠的 , 就是在争夺这个份额上 。

你自己投的一些公司 ,他们有全员去用 Codex 的这种现象吗 ? 比如之前在用 Claude Code, 现在用 Codex。

Henry Yin17:44

都有 , 我当前投的公司用 Devin 的也有 , 然后用 Claude Code 的也有 ,Codex 都有 。

曼祺17:48

哦 , 现在还有人用 Devin。

Henry Yin17:49

还有人用 Devin, 对 ,而且用 Devin 的原因就是因为 Devin 的和 Slack 的那个合作做得好 。

曼祺17:54

那和我们后面可能要讲的一个事有关 , 就是 Devin 和 Slack 的合作做得好 ,但是这个季度 Anthropic 也推了一个打通 Slack 的新的功能 , 就是 Claude Tag, 就相当于它可能也会去吃 Devin 的这方面的需求 。

Henry Yin18:08

Devin 是最先推出就是 AI coder 或者 AI soft engineer 和人在 Slack 里面合作的 , 当然现在是一个所有人都有的功能了 ,但 Anthropic 现在加上了以后呢 , 我觉得还是因为它体量比较大吧 ,并不是一个非常新的东西 。

曼祺18:22

然后这两家公司的竞争还有一点 , 就是虽然这个季度还没发生 ,但正在进行中就是 IPO 的竞争 , 目前来看应该是 Anthropic 更快 , 对吧 ?

它递文件的时间是更早的 。

Henry Yin18:33

应该是的 , 对 。

曼祺18:34

你觉得他们谁先上市影响大吗 ? 这两家公司 。

Henry Yin18:37

我觉得影响不会很大 。

曼祺18:39

因为差不了太多时间 。

Henry Yin18:40

差不了太多 。

曼祺18:41

你觉得 OpenAI 如今如此激进地做价格战 , 你觉得会怎么影响它的 IPO? 因为很有可能这会在财务上反映成比如说你的毛利相比 Anthropic 就会有差距 , 对吧 ?

然后你的收入体量现在已经有比较大的差距了 。

Henry Yin18:54

我觉得他们可能还是相信现在用户和数据应该是很重要的事情吧 , 如果要是能够通过一些这种手段能够把更多的用户拉回来 , 然后给他们收集更多的数据 , 我觉得对于他们的模型再进一步就是提升和赶超应该是有帮助的 。其实我还是觉得他们的做法也挺有魄力的 , 就一方面我在准备登陆二级市场 ,但另一方面从长远考虑它还是采用了一

种比较激进的竞争手段 , 没有说因为要上市就考虑说让这个财务数字更好看 。 关于这两家的竞争还有一个相关的第三方 , 就是 Cursor 的退场 ,其实上季度我们就聊到 Cursor 是比较危的 , 就当时看起来在 Anthropic Claude Code 的压力之下, 那到了第二季度它已经不再是一个独立的公司了 , 被 SpaceX AI 就是合并了 xAI 之后的 SpaceX 这个新的主体给 600 亿美元收购了 。

你可以讲讲这件事就是在行业里引起的涟漪和变化是什么 ?

曼祺19:51

首先 Cursor 包括 Cursor 在内所有做 coding 的公司就是短期和长期我觉得分两方面来看 , 就是大家短期的这些营收的增长都是非常强劲的 ,但是长期的话就是在这个 Claude Code 和 Codex 这种双重的这个打压之下, 公司的这个前景在哪里 ?

我觉得 Cursor 可能也是主要是这方面有一些问题 。 收购的价格的话呢 , 我觉得其实是一个非常好的退出 ,600 亿美金 , 对吧 ?

这个应该是历史上就是最大的创业公司被收购的价格 。 那么如果尤其是和它的这个竞争对手 Windsurf 仅 20 多亿美金被 Google DeepMind 收购的话 , 大概有一个接近 30 倍的一个差价 。

那如果大家用过 Windsurf 的话 ,其实在 Windsurf 在被收购之前 , 我觉得它的这个用户体验几乎是和 Cursor 完全一样的 , 所以我觉得 Cursor 的话就是做到这个行业第一 , 我觉得还是以这个价格被收购是一个非常好的一个退出结果 。

我觉得它刚好赶在一个很好的时间点 , 就是 xAI 自己出了比较大的波动和问题 ,他们有需求去要这样一个团队 , 同时 SpaceX 刚上市嘛 , 上市其实它对就是我去做一些更完整的布局 , 或者说我去讲一些故事吧 , 它也是有需求的 , 就刚好卡在这个点是挺好的 。

Henry Yin21:03

准确地击中了老马的需求 ,因为老马从去年年底开始就是非常看重 coding 这一块 , 然后就给了 xAI 内部团队非常大的压力来做 coding,也因为这个原因就是导致 xAI 这个团队重要的人都离职了 , 所以它现在的话它也非常急需的去收一支团队 , 然后能把 coding 这个故事接着讲下去 。

曼祺21:21

你觉得还有什么买家接下来可能会需要这一类的公司 ?Google 有可能做类似的动作吗 ?

Henry Yin21:28

我觉得 Google 的话现在是这个季度从战略上来讲应该是在给它之前传统强项多模态降级 , 然后给 coding 继续升级 ,不过它之前已经收购了这个 Windsurf 团队了 , 所以它应该有很大的需求 ,但我不知道它是不是还会继续就是 。

曼祺21:46

通过买团队的方式 。

Henry Yin21:47

买团队的方式再收购 。

曼祺21:48

Meta 呢 ?

Henry Yin21:49

Meta 已经招了太多人了 。

曼祺21:51

招了太多人 ,但它也裁了很多人。

Henry Yin21:53

对 ,但是它的这个 TBD 已经招了很多很好的 researcher。

曼祺21:57

所以你觉得他们应该大概就是用自己的团队去追这件事 。

Henry Yin22:00

对对对 。

曼祺22:01

那如果总结一下这两家公司的竞争 , 你觉得他们现在核心比拼的是什么 ?

Henry Yin22:06

我觉得比拼的话是一个比较系统性的比拼了 , 当然模型的能力的话 , 两家现在又达到了一个旗鼓相当的水平 , 当然还要去看 5.6 真实使用起来的这个反馈怎么样 ,但是另外就是在他们产品 , 然后这个以及变现 , 然后以及就是整个生态系统上面 , 我觉得应该现在是一个系统化的一个竞争 。

曼祺22:27

你觉得模型即产品这件事还在多大程度上成立 ? 因为他们其实也有很多我觉得产品的创新和产品上做得很好 , 然后去提升体验的部分 , 就我不知道这一部分的努力是被怎么评估和认识的 。

Henry Yin22:40

我觉得模型即产品在他们两个人的竞争中不完全成立 ,因为我感觉在和很多 OpenAI 研究员的对话当中有一种情绪 , 就是他们觉得他们的研究和模型做的是很好的 , 和 Anthropic 是同一个 level 的 ,但是在产品和这个推向市场方面是一团糟 , 所以我觉得这两个不完全划等号 。他觉得至少有一些 OpenAI 研究员的观点是说这个是现在我们的收入各方面做得没有 Anthropic 好 ,是这个产品和走

向推向市场的锅 。

曼祺23:11

这个想法还挺有意思的 ,因为一般来说大家对这两个公司的印象会觉得 Anthropic 是一个更精简的团队 ,他们更 focus 在少数的方向上, 给人的印象是它研究做得更多 , 然后 OpenAI 已经 7000 多人了 , 然后它的职能是相对更齐全的 , 包括它最近也招了很多 FDE, 就是前向部署工程师 , 就 Tobe 的那块它也在做 ,但是反而他们内部的研究人员还认为他们的产品和 go to market 走向市场

做得不够好 。 你首先你觉得这个评价它客观吗 ? 你就说如果说它做得不够好的话 ,因为它其实是更早意识到要做这个也投入得比较多 , 为什么它还做得不够好 ?

Henry Yin23:46

我们可以看到 OpenAI 的在这方面的这个管理层也经常在换 ,也不是非常的稳定 。 对 , 当然 OpenAI 是个很大的公司 ,但我这应该是听到不止有一个就是 OpenAI 的这个研究员有这方面的看法 。

曼祺23:58

就你觉得他们说的这个对吗 ?

Henry Yin24:00

我觉得 Q1 或者 Q2 早期的时候确实是这样的 , 就是你如果在这个 X 上面你看的话 , 就是 Claude Code 这个声量会比这个 Codex 就是大很多 。

我觉得就是在这个产品的这个宣传 , 然后这个社区的构建上面是要比 Codex 好很多的 。 就是现在这个 Claude Code 在这个 X 上面有几个大的 influencer, 比如说它的这个 Claude Code 之父 Boris, 然后还有就是他们那个 Catherine Wu, 然后还有 Tarik 等等几个人, 就是在 X 上面都有大量的这个关注者 , 然后他们的就有很大的流量 。

对 , 所以他们所有的新的功能发布的时候 , 就是应该会以更快的速度触达到用户 。

曼祺24:44

所以他们产品团队也相对稳定 , 然后这些人也在社区里很有影响力 。

Henry Yin24:48

对 。

曼祺24:48

对这两家公司来说 ,因为他们模型的能力是相对旗鼓相当的 , 所以他们的竞争是一个更加综合的系统的竞争 。

你提到就其中有一个点是比如说产品和走向市场的能力 , 那如果更完整来说这系统里还包括什么呀 ?

包括这个系统最后就是一个系统可能会越来越好 , 或者说保持在一个比较好的状态 , 一个系统可能会竞争力差一点会是什么导致的 ?

Henry Yin25:10

我觉得有一个点 , 就是 Anthropic 他们的这个人的 retention 一直做得很好 , 就是从 Anthropic 离职的人的数量应该是远小于其他的这个 Frontier Labs 的 。

这个原因的话呢 ,有人说是因为 Anthropic 现在已经邪教化了 , 然后这个洗脑非常成功 ,有人说是因为他们的这个 option 太贵了 , 所以得留在那儿 , 就是要不然走了以后付不起钱买那个 option。

但是我觉得这其实是一个人我觉得是一个很重要的因素 。

曼祺25:38

从来就是如此 , 还是最近它变得越来越强之后会更明显 ?

Henry Yin25:42

我觉得 Anthropic 一直是它的 retention 都是非常好的 , 包括你可以直接去看它的创始团队还有多少人在 Anthropic。

曼祺25:49

你说的第一种就是猜想 , 就说它是一个有点宗教化的组织 ,是因为就这个组织的愿景是比较独特和强烈 , 然后它可能本来吸引来的人最开始就比较信这个 , 走的人也比较少是吗 ?

Henry Yin26:02

对 , 我觉得它应该是愿景是非常强烈的 , 然后非常另外的话就是这个小道消息 , 就是面试的时候它的这个价值面都是非常的严格的 。

曼祺26:13

挺有意思的 。 历史上有什么这样的公司吗 ?

Henry Yin26:16

我觉得还真不多 ,但我觉得他们是非常的认真的看待自己做这个事情 , 所以他们也会去找和教皇合作 , 然后发表一些这个宗教怎么和 AI 结合这些事情 。

对 ,他们是真的是在思考就是未来这个 AI 世界应该怎么构建 。

曼祺26:30

因为现在有一些人由于 Anthropic 一些反人设的行为出现 , 就类似于你刚才提到的我默默的给你降职这些做法 , 然后对这个公司有很多的非议和争议吧 , 就是会不太相信它所宣称的一些它的理念 , 比如说我们要做非常安全的 AI, 比如说这个我们把对齐视为非常高的优先级 , 然后从你的角度 , 包括你和他们的一些人接触角度 , 你还是觉得他们确实

是在信这些东西的 。

Henry Yin26:57

我觉得硅谷这边的氛围的话 , 对于 Anthropic 在对齐上面的投入应该还是比较认可的 ,不能代表所有人 ,但是我即使聊到那些 OpenAI 的研究员也是认为这个 Claude 在对齐上面做的是比 OpenAI 强的 。

曼祺27:12

这个东西如果反映在体验上 ,是不是它也会带来更好的体验 ? 大家用的时候能感觉出这个区别吗 ?

Henry Yin27:19

这个地方我可以举一个例子 , 就是 OpenAI 最近这个发了一个研究 , 就是说人其实并不太喜欢听到真实的一些反馈 , 就是说如果这个模型它的谄媚程度上升的话 ,其实人是会更喜欢的 。

所以如果要是你往这个方向去做优化的话 ,其实会增加你这个模型的谄媚程度 。 我想大家如果同时用过 Claude 和 ChatGPT 的人也可能会感觉到就是 OpenAI 的 ChatGPT 更会提供情绪价值 ,而 Claude 有的时候会给你当头一棒 , 就是会更说实话一些 。

对 , 我觉得这个可能也是就是在 training 的这个目标上面和对齐的目标上面可能会有一些两个公司会有一些不一样的价值观 。

曼祺28:04

OK, 那我们进入就是推进前沿智能的第二部分 , 就是 RSI 递归自进化 。 它的全称英文的全称是 Recursive Self-Improvement。Henry, 你可以先说一下就是这是个什么意思 ,以及为什么最近就大概四五月份开始 , 我觉得这个方向其实是越来越多人讨论的 。

递归自进化28:04

Henry Yin28:21

Recursive Self-Improvement 翻译成中文的话就是递归自进化 , 这个事情听起来很复杂 ,但其实它本质很简单 , 就是我们都想要一个能够自我改进 、 不断自我提升的一个 AI 系统 。

那么这个事情的话 , 它在 AI 里面我觉得可以算是一个圣杯一样的概念 。 那么他们在过去几十年已经被反反复复的拿出来做尝试了 。

那么最近一波的话呢 , 就是因为这个 coding 能力和这个长程的 agent 能力变强了 , 所以我们又看到了希望 , 所以又开始进行新一轮的尝试 。RSI 呢 , 我觉得和上一期我们聊到的这个 AutoResearch 这个概念是紧密相关的 。

那么 AutoResearch 呢 ,也就是说自主研究 , 它是说我们有一个我们的 AI 像一个研究员一样工作 , 能够去读这个论文 , 然后提假设 , 写代码 , 然后跑实验 , 然后分析结果 , 然后最终的话得出一些这个新的这个技术结论 。

那么这个的话是 AutoResearch, 就是 AI 自动化这个研究流程 。 但是 RSI 的话 , 我觉得它是在 AutoResearch 的基础上往前更进一步 , 就是说这个研究员不光是产生新的知识 ,而是说这个研究员会在研究的过程中不断的改进自己 , 使得自己在下一次做研究的时候能力会变得更强 。

那这样的话就达成了 RSI 的这个能力 。

曼祺29:36

就是它是自己产出了更好的东西来帮助自己变得更好 , 然后又能产出更好的东西 , 又能帮助自己变得更好 , 就这样一个循环的一个 loop 往上的 , 螺旋上升 , 对吧 ?

Henry Yin29:46

左脚踩右脚 , 螺旋上升 。 因为这个事情如果一旦做到了的话 , 它最大的意义就是说那我们之后人可以从这个 loop 中抽离出来 , 只要不断的给这个 AI 系统去喂算力 , 它就会不断的去提升它的智能 , 那我们就真正实现这个 ASI 了 。

曼祺30:04

这也是我想讨论的一个问题 , 就是在递归自进化这个里面 , 自动化就是人是否在这个循环里面和递归就是这个它是以一个相似的结构在比较快的往前推进 , 这两件事哪个是更第一性的 , 哪个是更重要的 ?

Henry Yin30:20

我觉得得先自动 。

曼祺30:21

你觉得得先自动 ? 挺有意思的 。 我今天跟那个田渊栋也稍微聊了一下这个问题 ,他觉得可能递归是会先发生的 , 递归可以说已经发生了 。

Henry Yin30:30

但是自动也发生了 。

曼祺30:31

自动 , 对 , 自动也发生了 , 只不过自动不是全自动 , 就这个自动是一个阶段性的 , 它会一点一点的就是人参与的更少 。

比如说回到十年前 ,其实 Google 做 AutoML 的时候 , 它也是 AI 自己可以做一些事 , 就做 ,但是它能做的事是比较机械的搜索 , 搜索的空间啊方向都是人要深入参与去给它规定好的 。

Henry Yin30:55

我觉得我们可以看到一个趋势 , 就是 AI 能够改进的这个系统的部分会越来越大 。 就是最早期的时候呢 ,AI 呢是做超参数的优化 ,AI 来帮我们做超参数的搜索 , 然后后来的话呢 ,Google 做了刚才 Manjit 提到的这个 Neural Architecture Search 或者这个 AutoML, 就是 AI 能够帮助我们去搜索一个网络最好的架构是什么样的 , 这个是 2017 年的事情 。

再往后的话呢 , 就是我觉得最近 AI 可以去帮我们做 harness 的优化 , 这个 harness optimization 是有很多公司在 , 还有包括 Frontier Lab 在做的 。

曼祺31:31

就当时也在做 , 然后也有专门的创业公司在做是吗 ?

Henry Yin31:34

有很多创业公司在做这个事情 , 然后包括就是 AI 帮我们能搜索这个 training recipe 训练的配方 。

曼祺31:41

这个配方指的是 ?

Henry Yin31:42

比如说这个 , 包括就是这个 learning rate schedule 啊 , 然后这个具体用什么 optimizer 啊等等之类的 。 然后我觉得再往后的话 , 就是说 AI 可能能够刚才是一点一点升级嘛 , 能够最后把整个系统都纳入它优化的范围以内 , 上述所有事情它都可以做 , 那就实现完全的 RSI 了 。

曼祺32:00

所以从局部的自动来说 , 它已经发生了 , 对吧 ? 就你刚刚说的这些是已经出现的 , 然后那个把整个系统放进来就可能是大家未来追求的目标 。在 RSI 上大的公司还有一些新的公司 , 这个季度有什么具体的进展 ?

Henry Yin32:15

这个季度我觉得有两家公司在 RSI 上面有比较大的进展 。 第一家公司的话就是 Anthropic,他们在 6 月 4 日的时候发布了一篇文章 , 叫做 《When AI builds itself》, 就是当 AI 开始构建自己 。

那么这里面他们分享了很多他们内部的实践 ,以及他们对未来的展望 。 第二家公司的话是 Recursive,他们也在 6 月份发布了他们的第一个成果 , 展示了就是 RSI 早期未来的一个缩影 。Anthropic 这篇 《When AI builds itself》 里面有几个关键数字 , 第一个数字的话是截至 5 月 ,Anthropic 代码库里面合并的超过 80% 的代码都是由 Claude 来写的 。

第二个的话是 2026 年 Q2 开始 , 工程师人均每天合并的代码量是 2025 年之前的 8 倍 。 第三个的数字的话是 。

然后 4 月有一个案例是他们让他们的 AI agent 端到端的完成一项 AI 安全研究 , 然后这个 AI agent 累计工作了 800 个小时, 然后比人类研究员做一周的这个效果还要好不少 。

最后一个数字的话是他们在一个让 AI 来优化一段代码 performance 的测试里面 , 发现这个 Mythos Preview 能够做到大概 52 倍的加速 ,而 Opus 4 系列呢只能做到就是 3 倍 , 一个熟练的人类研究员 4 到 8 小时可以做到就是 4 倍 , 所以有一个非常大的一个提升 。

曼祺33:32

你前面还提到就这个报告还描绘了比较有意思的未来 , 这个具体来说是什么 ?

Henry Yin33:37

Anthropic 设想的未来世界有三种 , 第一个世界的话就是模型能力不会再变强了 , 那么我们现在就是如何利用已经有的模型能力来服务全人类 。

第二个世界的话是模型能力还会继续变强 ,但可能不会指数级的变强 ,而是现在这些拥有比较强的模型公司 ,他们利用这些模型来开发下一代模型 , 会有一个复利的效果 。

第三种可能性的话呢 , 就是 RSI 完全实现 , 这样的话就是人类在未来训练 AI 的这个流程中的角色会大幅的缩小 , 然后进度的话就完全只是受算力的这个限制 。

那么这在这三种世界里面的话 ,Anthropic 认为第一种世界的可能性应该是非常小的 ,因为它认为我们现在基本上根据他们自己的进度 , 我们已经达到了第二世界 。

那么第一世界唯一的可能性就是突然我们这个世界发生了一些什么变故 , 使得比如说电力突然没有了 , 或者说算力突然没有了 , 那么可能才是第一个世界的情况 。

对 , 那么第二个世界的话 , 它认为是我们现在处于的这个世界 , 基本上你可以认为它是一个 AutoResearch 实现 ,但是 RSI 还没有实现的一个世界 。

曼祺34:40

就类似于他们自己说的 , 我的什么人均产出代码变成了 8 倍 , 就我效率在提升 ,但它不是指数级的提升 。

Henry Yin34:48

就目前如果是从研究员他们自己的表达上来说 , 就是他们可以给一个想法 , 然后 AI 可以就是以数量级别数量级别提升的这个速度来帮他们完成这个想法 , 从头到尾 。

曼祺35:01

但是他们自己其实会是那个卡点 。

Henry Yin35:03

对 ,他们自己还是卡点 , 就是 AI 现在的研究品位还是不太行的 。

曼祺35:07

就还是需要人给它提供 ,但人的脑力 、 人的时间是有限的 。

Henry Yin35:11

对 , 那么第三个世界的话呢 , 就是 AI 能够不断的去 train 下一代 AI, 相当于自然繁衍一样 , 就很快就比如说就是未来不是一个月 、 两个月发一个新模型 , 可能不断的每天都会有 , 或者说每小时都会有新的模型被 AI 就是自己 train 出来 。

那么他们觉得这个未来最大的风险还是回到了对齐上面 ,因为现在我们比如说机模有一点对齐的这个瑕疵的话 , 那么这个瑕疵在 AI 不断繁衍和自进化的过程中可能会不断的放大 。

那么当 AI 又比我们更聪明的时候 , 我们就有更大的这个失控的可能性 。 所以也是基于这个第三个世界的这个设想 ,他们现在提出我们是不是应该有意的放缓研究 RSI 或者进一步推进前沿智能的这个速度 , 这样的话我们可以给这个社会更多的准备的时间 。

我觉得他们也非常矛盾 ,因为他们一方面就是觉得为了全人类 , 我们应该放缓这个进度 ,但另外一方面又觉得我们放缓了这个进度 , 我们的竞争对手不一定会放缓这个进度 , 所以可能还是得往前走 。

曼祺36:11

对 ,他这个文章的标题就是叫 《Our Progress Toward RSI》, 那讲的也是他自己的进展 ,但他里面又说他觉得最好大家别一起进展太快了 。

Henry Yin36:21

对 。

曼祺36:22

你觉得他的这种矛盾是真实的 , 对吧 ? 就结合我们前面说的 , 你说这个公司还是有非常独特的愿景的 。

Henry Yin36:27

我觉得是真实的 ,但我觉得现在可能除非发生比如说全世界的人民联合起来说我们都把这个速度放缓 , 要不然的话就是还是大家会竞争往前 , 先看谁先能达到 。

曼祺36:39

因为你平时也接触大量的研究员 ,他们自己对制造一个 AI 来把人剔除这个 AI 进化的 loop 是怎么想的 ?

Henry Yin36:47

我觉得也是一个非常矛盾的心态 , 一方面的话 , 如果 RSI 实现了 , 相当于是他们把 AI 的这个圣杯做出来了 , 那是一个非常大的成就 ,但另外一方面这个日常生活中并不是很开心 , 虽然 AI 现在能力变强了 。

这篇文章里面也有一个研究员说的一句话 , 就是当我的工作就是这个 AI 模型它 work 的时候 , 它比我做的又快 , 做的比我又好 , 我感觉我自己没有什么价值 。

当这个 AI 模型它不工作的时候 , 那我更惨了 ,因为我完全不知道就是它为什么不工作 , 然后我还得去弄明白到底发生了什么 。

所以现在我觉得也是 AI 能力变强了 , 做的研究的速度变快了 ,但是这个 AI 研究员的幸福感不一定会比之前更强 。

曼祺37:32

就是价值感和成就感在经历新的拷问和定位 。

Henry Yin37:36

对 。

曼祺37:36

我早些时候和田渊栋聊 ,他有一个想法挺有意思的 ,他觉得很重要的一件事还是去解释 AI, 就让 AI 真的变成一个科学 ,因为过去也是从第谷到开普勒到牛顿的 ,他认为 AI 也会经历这个状态 。

那现在可能更多还是在我理解啊 , 那可能还是在第谷的阶段吧 , 就大家有很多经验 ,但是你很难解释为什么这个经验是有效的 , 那个经验就没效 , 就它可能都还不到一个我们以前定义的那种科学的程度 。

Henry Yin38:03

我觉得如果要是能做到 ASI 的话 ,ASI 应该是能够理解自己的 。

曼祺38:07

你觉得 RSI 能够理解自己 ?

Henry Yin38:10

对 。

曼祺38:11

自进化和理解自己 , 你觉得这就会同时发生吗 ? 这一定会同时发生吗 ?

Henry Yin38:15

ASI 我觉得是能够理解自己的 。

曼祺38:17

你说超级智能是会理解自己 , 你觉得人理解自己吗 ?

Henry Yin38:21

部分理解 。

曼祺38:23

对 , 它可能也不是一个 0 和 1 的关系 , 人在不断的加深对自己的理解 , 智能如人类这种生物 , 它也没有完全的理解自己 , 还是有很多东西是不知道的 。

还有一个关于就是它设想的第三种未来的 , 我有一个想补充的问题啊 , 就你前面提到说 Anthropic 认为这件事的最大的风险是对齐 , 那另一方面如果说模型进化这么快的话 ,他们不认为有一种风险是就是智能泛滥吗 ?

就有可能没有这么多对智能的需求 。 我不知道这个文章提到这件事没有 , 或者说你们平时的一些讨论里面大家是怎么看这件事情 。

Henry Yin38:54

好像很少讨论这个问题 ,因为就是默认现在有大量的问题需要解决 , 比如说人类如何长生不老啊 , 然后这些问题的话都需要这个更强大的 AI 来解决 。

曼祺39:04

所以默认对智能的需求是不太会有上限的 。

Henry Yin39:07

我感觉现在在硅谷 ,在至少 Frontier Lab 就是认为是对智能的需求和对算力的需求都是没有上限的 。

曼祺39:15

那在那个新的公司里面 , 你提到说 Recursive Superintelligence 在 RSI 上这个季度也释放了一些具体的成果 , 这个可以展开讲讲 。

Henry Yin39:24

我觉得 Recursive 可能是这个季度最值得关注的 New Lab 之一 , 刚才我们提到它的这个创始团队非常的强 ,有这个 Richard Socher 啊 , 然后施天麟啊 , 田渊栋啊 ,他做的事情就是做 RSI, 让这个 AI 系统能够自我改进 。

那么他们放出的第一个成果呢 , 就是做了三个 benchmark 上的改进 , 第一个的话就是 Andrew Karpathy 的这个 NanoChat AutoResearch, 那么他们是偏这个算法 , 就是在固有的 budget 的情况下怎么去把这个事情做得更好 。

曼祺39:55

就是算力相对固定的情况下, 算力资源固定的时候怎么把这个性能弄得更好 。

Henry Yin39:59

对 , 然后第二个的话是 NanoGPT 的 Speedrun, 就是说大家的终点是一样的 , 就要 train 到一个 performance, 把模型 train 到一个程度 ,但看谁能 train 的时间更短 。

然后第三个的话是一个这个 kernel GPU kernel 的一个 benchmark, 叫做 So Exact Bench, 那么这个是比谁的算子写得好 , 然后谁的算子的这个效率更高 。

所以他们在这三个 benchmark 上面都取得了 SOTA 的结果 , 通过把他们做的这个 RSI 的系统应用在这三个 benchmark 上面 , 这其实就覆盖了就是 AI 进步的三个杠杆 , 就是说这更好的算法 , 然后更快的训练 , 然后更高效的这个硬件的利用程度 。

我觉得可能这个意义可能不光在于就是说这个 benchmark 它具体提升了这个数字的大小 , 可能更多的是它展示了这么一套通用的研究闭环 , 能够把这个东西跑通 , 我觉得它是它的这个工作的意义的所在 。

曼祺40:51

它是同一个系统去做了这三个测试 , 就是一套通用的东西 。 然后同时这个季度就除了你刚才提到的 Recursive 这家公司 ,因为他们其实是水下了一段时间 ,在这个季度正式宣布的 ,并不是这个季度成立 ,但这个季度也有一些新的公司出来 , 一个就是刚刚在 6 月 25 号的时候正式 launch 的 Mirendil, 它也是一成立就有 10 亿美元的估值 , 还有另一家公司是 Core Automation, 你可以这样就是现在这些不同

的新的团队啊都在出现 , 然后都看到觉得这是一个机会 ,是为什么大家觉得可能有新公司来做这件事情的机会 。

Henry Yin41:27

我可以先简单介绍一下这两家公司的创始人的背景 , 首先是 Core Automation, 那么它的创始人 Jerry Tworek 是 OpenAI O 系列的负责人, 所以是在推理方面做出了很多贡献的 。

然后 Mirendil 的创始人是 Behman,是 Anthropic 的 , 之前在 Anthropic 应该是负责他们的 AI for Science 团队 , 所以这两家公司现在都是在 RSI 的这个方向上面去做探索 。

我觉得 RSI 这个事情之所以我觉得还有创业公司的机会 , 首先它是我觉得技术上它还没有完全收敛 , 就是可能在除了 coding 和长程的 agent 能力以外, 我们可能还有一些别的东西是目前还缺失的 , 所以我们还没有完全达到 RSI。

那么这样的话 , 它不完全是一个堆算力的游戏 , 可能还是需要一些新的 idea 才能让这个领域达到下一阶段 。

曼祺42:17

一般来说创业你要找一个现在的主流公司主线不会去做的事 , 你觉得 Anthropic 和 OpenAI 他们继续往后推的话 ,RSI 会在他们的主线上吗 ?

其实从 Anthropic 发这篇文章 , 包括 OpenAI 也会去说一些目标 , 说他们到今年 9 月的时候要实现 AI 研究实习生 , 说 28 年 3 月的时候要实现自动化的 AI 研究员 。

我自己觉得有一种可能性是 Frontier 也会比较重视这个事 , 这就是你说的为什么它火的其中一个原因 , 就是大家设想如果你做到了这件事情之后, 你的加速度可能会越来越快 , 这可能是帮你在竞争中把其他人甩得更远的方式之一 。

就看起来他们可能也会往那个方向去做 , 这和创业公司之间会形成一个什么样的竞争关系 ?

Henry Yin42:56

我觉得就是 Anthropic 他们自己也提到了 , 就是现在的这个 AI 研究员他的这个 bottleneck 还其实在这个研究的品位上面 , 人类现在依然是这个瓶颈 , 所以我觉得 Frontier Lab 来做这个事情并不一定会和现在新的这个 startup 做这件事情拉开无限的差距 。

曼祺43:14

这一季度两家最厉害的公司 OpenAI 和 Anthropic 在智能前沿上还有一个不约而同的举动 , 就是他们都在加码 Robotics。OpenAI 这个事是相对公开的 ,Anthropic 这个事是就业内大家慢慢的在流传吧 , 它应该确实是有这个意向要去尝试做 Robotics。Henry 你可以讲讲就是两个公司在具身智能或者说在物理 AI 上的一些情况 。

具身智能43:14

Henry Yin43:38

OpenAI 的话其实是这个季度 Sam 还有 Greg 就是亲自在 Twitter 上公开他们在做机器人 ,并且开始招人 ,但他们的这个尝试其实应该是从很早以前 , 可能 2024 年开始就开始在做机器人这件事情 , 然后他们在湾区的 Fremont 现在也有一个机器人的一个 warehouse, 然后现在有一个几十人的机器人团队在做这方面的探索 。Anthropic 的话 ,他们现在应该团队规模比较早 , 让机器人尝试在早期 ,但是他们

在 《When AI builds itself》 这篇博文里面也提到 , 就是他们认为在 Recursive Intelligence 的下一步就是 Robotics 和 Physical Intelligence, 所以他们应该也开始在这边提前布局了 。

曼祺44:19

机器人理论上也可以 RSI 对吧 ? 首先机器人比较强之后, 它部署到真实的环境之后就可以获得很多数据嘛 ,其实机器人发展它本身也是需要数据 , 就具身的模型的这一部分 。

然后另外就是更科幻的情况 , 就是机器人可以造机器人, 现在看起来有点难想象的事情 ,但是之前其实也发生过 , 比如说工业革命的时候就是机器造机器嘛 , 母机出现之后机器就可以造机器了 , 一直到现在其实工业母机都是非常重要的领域 。

那我们可以稍微多讲讲 OpenAI,因为它的这个公开信息了要更多一点 ,因为在 Sam Altman 自己就是去官宣这个团队以及招人的信息里面 ,他还是透露了一些信息的 。

首先我觉得有几个关键词 , 就是他说在人上他要找优秀的全栈工程师 , 全栈后面它包括硬件 、 运营系统 、 机器学习 , 然后他还提到就是他们第一个可能会用的场景是服务于自己的基础设施 , 这个应该就是他们自己的算力设施 , 然后再往后的话 ,他也是想做能够服务普通人的机器人, 这也是一个比较有共识的愿景 , 就是做家庭机器人, 包括马斯克自

身也说过他觉得城市状态下 Optimus 可能会有 200 亿台 。 还有就是他讲了这个团队的负责人, 这个负责人是 Aditya Ramesh, 从这些信息里面你觉得有什么可以更多去解读吗 ?

就比如说他们可能会怎么去做这个事 。

Henry Yin45:43

我觉得 OpenAI 和 Anthropic 这些模型公司 ,他们应该会发挥自己的长项 , 然后把这个问题的模型的训练部分就是做好 。

然后我觉得他们的招聘里面说到他们要招全栈的这个 Roboticist,但也不完全代表他们一定会就是有自己会去造自己的硬件 。

曼祺45:59

就是说不一定会推硬件的产品 , 跟 Optimus 那种逻辑可能不太一样 。

Henry Yin46:02

对 。

曼祺46:03

这个我们可以往后观察看会怎么发展 ,因为现在比较主流的大公司来做这件事情就两种方式 , 一种就是 Optimus 那样 , 它最后要做的这个产品 , 它是一个完整的软件系统 、 硬件系统都有的这样一个机器人的东西 。

然后还有一类就是 Google 还有英伟达 ,其实他们都想做这个领域的安卓 , 就是比较偏大脑和智能的那一层 。

然后创业公司里面其实派也是这个方向的 。 和具身和 Physical AI 相关的一个最近反而火的话题是世界模型 , 虽然就是我们刚才讨论这两家公司在这方面的有什么成果 , 就是现在不是很明显 ,但整个领域是出现了很多变化的 。

正好在 5 月的时候 ,MoE Capital 就是你们自己的这家机构也写了一个世界模型的研究报告 , 你可以讲讲你们在梳理世界模型的发展的过程中间一些核心的总结和观察吗 ?

Henry Yin46:51

我可以先简单说一下, 就是说为什么这个世界模型这个事情就是大家觉得这么重要 , 就是想象现在有一个机器人对吧 , 它可能从来没有见过就是鞋带 , 或者说从来没有人通过 TallyUp 的方式教过这个机器人去解鞋带 ,但这个机器人呢 , 它因为已经就是足够对这个世界有了解 , 所以它就可以就是说弯下腰 , 然后抓住这个鞋带 , 然后把它拉开 , 然后解开 , 做

这个事情 。 我觉得就是这个的话是世界模型想要去解决的一个问题 。 然后世界模型呢 , 这个词呢 , 我觉得就是被用的很多 , 然后我觉得最近的话之所以这个火起来 , 那它主要是之前有两个独立的研究的分支 ,在 2024 年和 2025 年做了一个合并 。

那么有一个分支的话呢 , 就是这个 RL World Models 这个系列 , 那么可能比较有名的是这个之前 Google DeepMind 他们做的这个 Dreamer 系列 ,他们这个 idea 就是说在真实世界里面去收集数据非常的昂贵 , 那我不如去学一个这个真实世界的模型 , 然后在这个模型里面呢 , 就相当于做梦一样去 simulate 这个真实世界里面发生变化是什么样的 , 然后让这个机器人在这个虚拟的世界里面

去学习 , 这是一条路线 。 但是这条路线呢 , 之前的问题就在于就是说它每一个这个环境都是单独去学习的 , 所以比较难以 generalize。

另一条线路的话就是大家比较熟悉的这个视频生成这个线路 , 包括就是 Sora、Veo 啊 , 或者 Cedance 这样我们比较熟知的这个模型 。

那么这一条线路的话呢 , 就是说我们其实是从这些人类这种拍的这种 video 数据里面是能够学到大量关于这个世界的知识的 , 包括这个世界的物理是怎么工作的 。

但是他们这个系列的话 , 这些模型的话呢 , 它是只能就是说生成这个视频 ,但不能说我如果在这个当前这一帧 , 然后我做了一些 take 了一个行动 , 下一帧会发生什么样的变化 。

曼祺48:48

这个就是 action condition 的 world model。

Henry Yin48:51

这个就是 action condition。 所以现在的话就是把这两者结合在一起了 , 前者的话就是说我能在这个一个虚拟的世界里面让这个 robots 或者 agent 去进行学习 , 后者是说我能够通过大量的这个视频数据去学出这个世界的一些信息 。

如果把这两者结合在一起的话 , 就是我们现在说的这些 world action model 这些这个系列 , 包括就是我们投的这家公司 Dream Labs,他们的一个经典的工作就是 DreamDojo 和 DreamZero, 就是这个方向的这个 2026 年可能 2 月份发布的新工作 。

曼祺49:23

你刚才就是在解释说为什么现在这个领域变得比较火对吧 , 它其实还是和 Robotics 的热潮也是相关联的 。

你们当时这个世界模型的报告里面还有一个观察 , 就是在统计过去这 18 个月里世界模型获得的 100 亿美元都去了一些什么公司 , 你这个可以讲讲讲讲 。

Henry Yin49:41

我觉得这个大概有几个层次吧 , 一个是就是纯做世界模型的这个公司 , 或者说这个做模拟器的这个公司 , 包括这个 AMI Labs,他们融了这个 1.03 billion, 然后 World Labs 融了这个 1.23 billion, 然后 Runway 他们是从做视频模型起家的 , 现在应该是融了超过 860 million, 然后 Roda 450, 然后 Descartes 153, 还有最新的这个 Danny 这儿做的这个 Amble, 然后也是超过了 1 亿美金 , 这是一层 。

另一层的话就是做这个 robot foundation model 或者说做机器人大脑的这些公司 , 那包括比如说 Skilled, 然后 Physical Intelligence,Figure,Mind Robotics 就属于这个类别 。

第三个类别的话就是说做整体的这个平台型的这个公司 , 包括像 Nvidia 啊 , 然后 Google DeepMind, 然后以及就是现在可能要加入这个机器人战团的 OpenAI Anthropic。

然后我们看到一个比较有意思的这个 pattern, 就是说这些现在使用数据这个世界模型的公司 , 比如说这些 Robotic Brain 的这些公司 ,他们的融资规模其实是要比做世界模型的公司是要大不少的 , 可能还是大家可能会比较相信就是说做 Robot Brain 的公司最后可能会 capture 就是在如果哪天机器人实现了 , 这个经济价值最大的这个 capture 可能是被这些公司拿到 。

曼祺51:09

你们这个统计是全球范围的对吧 ?

Henry Yin51:11

这个统计主要还可能是偏向是这个欧美这边的公司 。

曼祺51:15

偏向欧美哦 , 那你如果把中国算进去 , 你会看到就是做这个机器人这块整个融资规模可能会更大 。

我还以为这是算上中国的 , 所以中国之外也有 100 亿美元过去这 8 个月 ,其实也不少 。 但是和 Anthropic 和 OpenAI 这个最主线的战场相比 , 它的吸金体量还是 。

Henry Yin51:35

太小了 。

曼祺51:36

差了很多量级 。

Henry Yin51:37

所以那一轮就融了几百亿美元 。

曼祺51:39

那我们接下来进入第二个大的板块 , 就是关于智能的扩散 , 已经可以帮我们干很多事情的智能 , 怎么通过更多新的产品的设计和一些新的商业模式的设计 , 让更多人更多企业可以用起来 。

智能扩散51:39

曼祺51:53

前面你提到就是有一个新的趋势或者说机会 ,是很多企业在考虑我到底应该用什么样的模型 ,是继续用最贵的 Frontier Lab 的模型 , 还是我自己要来有自己的模型 。

你可以讲讲这个趋势在第二季度是怎么发展怎么变化吗 ?

Henry Yin52:10

这个领域我觉得我们可以看到几件事情 。 第一件事情的话就是越来越多的公司在和后训练公司合作 , 然后来 train 他们自己的专有模型 。

一个例子的话就是 Harvey 和这个 Applied Compute 合作 , 基于这个 GLM 5.1 train 了一个他们自己的模型 , 然后在他们的 Legal Agent Benchmark 上面击败了 Anthropic 和 OpenAI。

那么这个事情很有意思 ,因为 Harvey 他们自己本身就是 Anthropic 的用户 , 所以这也是一个风向标吧 , 就是现在公司他们会考虑就是不光是使用 Frontier Lab 的模型 ,而是说真正去开始去 post train 他们自己的模型 。

那么之前的例子的话 , 上个季度的话这个例子应该是就是 Cursor,Cursor 是基于这个 Kimi 2.5, 然后 post train 他们一个自己的一个 composer。

曼祺52:56

那我觉得这个季度的例子和上个季度的例子它的模式还不太一样 ,因为 Cursor 是自己基于一个开源模型 , 然后后训练了一个模型自己来用 。

你刚才讲到的这个例子里面 , 它其实有三方 , 就 Harvey 是一个做法律 AI 的垂直的 AI 的公司 , 面向行业的 , 然后是 Applied Compute 又用了 GLM 5.1, 那就是中国的开源模型厂商的模型 , 然后来帮 Harvey 去训了 Harvey 要用的模型 。

Henry Yin53:21

对 ,Applied Compute 是一个由 OpenAI 研究员出来做的一家公司 ,他们的主要业务呢就是 post training as a service,也就是把后训练作为一项服务提供给他的客户 。

那么为什么现在有更多的像 Harvey 这样的公司 ,他愿意去做 post training, 然后拥有自己的模型呢 ? 我觉得可能有多个原因 。

第一个原因的话就是成本 , 就是 Claude 它这个前沿模型它性能很好 ,但它实在是太贵了 。 比如 Palo Alto Networks 的 CEO 在 X 上发了个帖 , 就是呼吁 Claude 立马降价 ,因为我现在客户已经用不起你的模型了 , 如果你再不降价的话 , 那么我们只能就是说把这个生意给开源模型或者更便宜的模型 。

曼祺54:02

这个发帖的 CEO 他们的公司的业务就是一边用 Anthropic 的模型 , 然后去一边服务下游其他的企业客户是吧 ?

Henry Yin54:10

对 , 就是 Palo Alto Networks 是他们是一家做网络安全的公司 , 所以他们也是这个和 Anthropic 在他们叫做 Project Glasswing, 就是用这个 Claude 去找网络安全漏洞的这个项目上面一个深度的合作方 , 所以他们也会用这个 Anthropic 的模型去做各方面的安全的业务 , 包括这个 prevention, 就比如说做代码扫描啊 , 或者说实时的这个 detection,他们都会去用 Anthropic 的模型 , 所以他们现在自己也觉得这个模型实在是太贵了

曼祺54:39

这是第一点 , 太贵了 。

Henry Yin54:41

那第二点的话呢 , 就是说稳定性 , 那这个稳定性指的是说我能不能期待这个模型我一直能有 access,因为现在的话一个问题就是说那有可能你在用前沿模型的时候 , 政府一纸禁令 , 你突然你就没有这个模型的 access 了 , 那你如果要是产品基于这个模型去构建的话 , 那就相当于是你的产品构建在没有这个 。

曼祺55:03

保障的 。

Henry Yin55:03

保障的沙子上面 。

曼祺55:05

其实 Fable 已经发生了 , 还好它只上线了三天 , 如果它上线了一个月 , 美国政府再来这么一遭的话 , 那确实有些公司可能已经基于它开发了很多东西了 。

Henry Yin55:14

然后第三个点的话就是护城河的一个问题 , 就是因为现在大家越来越觉得 Anthropic 这个公司竞争能力太强了 , 对吧 , 它会把各种数据都 train 到它的模型里面 , 模型能力会不断的变强 。

大家也会担心就是说如果我不拥有模型的话 , 那么 Anthropic 会不会就是逐渐的把这些所有的能力都内化 , 那么未来的话大家直接去找 Anthropic 就行了 , 可以跳过我 。

另一方面的话就是说那我和我的竞争对手都用同样的机模 , 那我的这个竞争优势在哪里 ? 所以我觉得从竞争优势的角度上来讲 , 大家也会更加的倾向于去现在去拥有自己的模型 。

曼祺55:49

就是有的企业客户会担心自己变成下一个 Cursor,Anthropic 确实也有意往这个方向拓展 , 它之前和黑石成立了合资的公司 , 然后有这种大的 PE 方其实是可以给它链接很多大型企业客户 ,而且大的 PE 其实自己就拥有很多企业类的资产 , 它可能也能用起来 , 就是在 to be 的这种场景里面 。

Henry Yin56:11

对 , 然后在竞争和护城河这块我还想补充一点的就是 , 对于像 Harvey 这样就是有高价值场景 , 然后自己有大量这个有价值的数据的公司 ,他们其实非常希望自己能够通过把数据能够利用起来 , 然后不断的加强自己的这个竞争能力 。

那么如果要是自己有一套这个后序链的这个 pipeline 的话 , 它实际上是可以不断的有越多的用户 , 越多的数据 , 它可以加强自己的这个产品的竞争力的 。

但如果要是没有的话 , 它可能只能依赖于就是 Anthropic 的机模 。

曼祺56:44

就是在我们刚才讲的 Harvey 和 Applied Compute, 再加上 GLM 5.1 这个三方都在的这种模式的合作里面 , 后续的 pipeline 它是由 Applied Compute 这家公司来掌握的 , 还是说 Harvey 自己之后就能掌握了 ?

Henry Yin56:59

Harvey 这个公司他们自己也是有人在做后训练的 ,不过在他们这个合作里面的话 ,他们是使用了 Applied Compute 的这个平台 , 应该叫做 The Lab, 那么在这个平台上面完成了就是整个后训练的这个过程 。

曼祺57:13

所以这个 pipeline 其实是在 Applied Compute 这儿 , 就只有在这个合作里是这样 。

Henry Yin57:17

所以通过 Harvey 给 Applied Compute 就是付费 , 然后使用它的这个平台 ,但是最终的话 Harvey 它自己拥有就是这个模型和数据 。

曼祺57:25

就是它拥有了一个自己的模型 , 你前面也提到他们用来做后训练的这个基础的模型是 GLM 5.1, 为什么选这个模型 ?

Henry Yin57:34

其实他们试了就是市面上可能所有的这些开源模型 , 可能大部分都是中国的 , 然后他们最后发现在这个 baseline 上面是 GLM 5.1 的效果最好 , 然后他们就基于就是 GLM 5.1 它继续去做 post train。

曼祺57:46

就是智谱的这个模型 , 所以现在从大家就是在这边的一些使用体验 ,不管是企业来使用还是个人来使用 , 智谱的模型在中国的开源模型里面确实是最强的吗 ?

可以这么说吗 ?

Henry Yin57:56

我觉得智谱的模型 , 尤其是在 5.2 发布以后 ,在硅谷这边呼声非常的高 。 一方面的话呢是真实的去看这个数字的话 , 它是 Terminal bench 首一个开源破 80 的模型 ,并且有多项这个长程编码任务能够超过 GPT 5.5, 然后成本只有 1/6。

但是更重要的是 , 我觉得有很多人在 X 上就是说这是第一个他们觉得编程手感对的模型 , 就不光是 benchmark 跑得好 , 然后实际完成任务确实效果不错 , 尤其是智谱非常明智的支持了 Anthropic 的 API, 所以你现在可以直接就是接着用 Claude Code 的 harness,但是把后面的这个 API 替换成这个 GLM 5.2, 然后有人就是说可以几乎无痛的替换就是 Opus 4.8, 这个我觉得还是非常非常厉害的

。 还有一个我观察到比较有意思的现象 , 就是除了 Harvey 除了和 Applied Compute 合作 , 它和 Fireworks 也在 6 月初合作 , 然后 train 了一个模型 ,也是基于这个 GLM 5.1 的 。

曼祺58:53

所以就是从大家的用脚投票里面也能看出这个模型只有在现在这个阶段是表现比较好的 。

Henry Yin58:58

是的 。

曼祺58:58

我觉得可以稍微延展聊一下就是中国开源模型的一些情况 ,因为其实我们刚才聊的这种合作里面 , 我觉得它事实上是美国的一些有一定能力做模型服务的公司 , 就比如说 Fireworks, 比如说 Applied Compute, 然后再结合上中国的开源模型生态 ,他们一起来服务一个客户 , 这个客户可能很有可能最开始第一批也还是一个硅谷的 , 或者说一个美国的客户 , 就算是某种意义上的中美合作在 AI 领

域的 , 然后他们共同的另一面看起来就是越来越强的 , 似乎无所不能 , 什么都想干的 Frontier Lab, 你怎么看这种对局的强弱呀 ?

Henry Yin59:37

我觉得从过去三年回看一下历史的话 , 就是历史告诉我们这个模型能力都是你方唱罢我登场 , 然后很少有人能够一直领先的这么一个态势 。

曼祺59:50

但是过去三年币源也一直没有让开源追上, 没有真正的追上 。

Henry Yin59:55

没有真正的追上, 对 。

曼祺59:56

它看起来有逼近的趋势 。

Henry Yin59:58

有逼近的趋势 ,但可能现在币源比开源 Frontier 还是能领先几个月半年的水平 。

曼祺1:00:03

而且币源的 Lab 它有一些东西它是没有展露出来的 , 就有可能它内部还有更厉害的东西 , 所以这个差距有时候确实很难动态的去判断 , 就有一种对现在这种趋势能否持续 , 就是说是不是大家都想要自己的模型 ,有一种质疑就是在 24 年前年的时候 ,其实也有一波微调的红利 ,但是最后随着就是基础模型能力的提升 ,其实这些工作的红利都被覆盖

掉了 。 你觉得在今天这个时刻 , 你看到比如像 Harvey 这种公司 , 它去找一些人来帮它做后训练 , 又或者其实微软也有一个相似的厂商 , 微软是说它要去服务更多就其他的大的企业客户去做这件事 , 去帮他们训练他们自己的模型 , 它还能持续吗 ?

Henry Yin1:00:45

我觉得这个里面可能有几个变化 , 一个变化的话呢就是现在就是所有做这些后训练作为服务的公司 ,他们都要去做一个事情 , 就是去做 FDE, 就他们需要去让一些这个 Forward Deploy Engineer, 然后去到他们服务的企业里面 , 然后去帮他们去做这个后训练 。

曼祺1:01:05

前向部署工程师 。

Henry Yin1:01:06

前向部署工程师 。

曼祺1:01:07

这个也是最近特别火的一个新的职业角色吧 。

Henry Yin1:01:11

对 , 然后这个前向部署的这个成本应该和就是两年前相比应该是有所下降的 。

曼祺1:01:18

所以这是一个变化 。

Henry Yin1:01:19

这是一个变化 。

曼祺1:01:20

也是因为 AI coding 本身变得更强了 。

Henry Yin1:01:22

对 , 然后第二个变化的话呢 , 就是这个模型能力和任务的这个相对难度 , 我觉得有一些变化 , 就是之前的话就是模型在我们比如说 Legal 这个场景 , 它这个前进的速度可能太快了 , 比如说从 GPT 3.5 到 GPT 4 这个提升非常大 , 那你在这个老版本的模型上面去做 post train 以后, 你可能根本赶不上新模型的这么一个改进 ,但我觉得现在可能不太一样了 , 就

是现在的话是你在一个 Frontier 的开源模型上面 , 加上你的私有数据 , 很可能是能够超过就是 Frontier 模型 ,并且可能 Frontier 模型短期内都不会反超的这么一个变化 。

曼祺1:01:56

其实之前你说到的 Applied Compute 和 Harvey 的例子就是这样的 ,他们就是基于 GLM 5.1 做的这个整个的后训练之后的东西 , 你刚刚说是超过就是我直接拿 OpenAI 或者 Anthropic 的模型来做的效果 , 所以你觉得这个趋势在这一次有可能是一个更持续的趋势 ?

Henry Yin1:02:13

我觉得会比上一次强一些 ,但这个我觉得也是一个此消彼长的一个过程 , 当 Frontier 模型就是说触顶的时候 , 受到各种各方面的阻力 , 比如说包括监管在内 , 那么开源模型就会迎来一波增长 。

另外我觉得还有一个点补充一下, 就是说这个事情可能也不适合所有公司 , 比如说我觉得初创公司可能就不应该做这个事情 , 它可能应该先用这个 OpenAI Anthropic 的模型去把他们的这个产品跑通 , 然后拿到市场的验证 。

曼祺1:02:41

你说的是不适合初创公司去有一个自己的模型 , 你是指这件事是吧 ?

Henry Yin1:02:46

对 。

曼祺1:02:46

初创公司倒是可以去帮别人拥有自己的模型 , 这是一个创业方向 。

Henry Yin1:02:50

对 , 所以我觉得就是说比较适合的公司 , 我觉得可能有几种特征 , 一种的话就是说你得有高质量的专有数据 , 要不然你没有必要去做后训练 。

第二个的话就是你还得有一个比较明确的这个评估系统 , 能够知道你这个模型是不是变好 , 比如说 Harvey 他们就有一个 Legal Agent 的 benchmark。

曼祺1:03:09

它自己有一个法律场景的这种测评指标 。

Henry Yin1:03:11

测评指标 。 第三个的话就是说你真的得有高频和高价值的业务 , 这样的话你这个模型比如说稍微提升几个点 , 你能带来你这个经济价值 , 我觉得这三个条件满足的话 , 就可能能够适合来做一些后训练 , 然后拥有自己的模型 。

曼祺1:03:28

那其实也能明显的看到几个大的行业是适合做这件事的 , 比如说 Harvey 所在的法律是的 , 医疗健康可能也是 , 金融肯定也是 。

Henry Yin1:03:37

可能咨询也算是 。

曼祺1:03:38

咨询也算是 。 这几个确实也是 Anthropic 和 OpenAI 会去做的方向 ,他们也在就是搞一些这种 , 比如说 healthcare 什么什么的这方面的 , 一个是他们会有这方面的一些专有的模型 , 一个是也有些商业上的合作 , 然后这部分可以补充聊聊就是中国开源模型的一些情况 ,因为前面也是提到的两个合作都是用了智谱的 GLM 5.1 这个模型 , 整体上来说在第二季度中国的这么多开源模型 , 它的一个发

展 , 包括就是比如说被全球的科技公司采用是一个什么样的情况 , 你怎么看这几家厂商陆续出的新模型 ?

Henry Yin1:04:11

DeepSeek 基本符合咱们之前的预期吧 , 就是说这个还是有一些小的 , 尤其是 infra 做得非常 solid 的有一些改进 ,但是却也没有惊艳到大家了 。

像我之前和那个 SGLAN 的人他们聊 , 就是他们 SGLAN 这个项目起飞就是 V3 代的 ,因为他们当时就是优先支持了 V3, 然后大量的人就想用 V3, 然后就是都会去问就是你们能不能帮我们把这个我们这个 MoE 部署做一做 。

曼祺1:04:37

对 ,其实在 SGLAN 之前还有一个存在更久的这种框架的社区 , 就是对 VLM, 我上次听朱邦华的采访也挺有意思的 ,因为他之前不在 SGLAN 这个社区吗 ?

他就是 Redis Arc 这个公司成立之后他一起加入去做微联创 ,他就说最开始其实他不是特别看好 SGLAN 的发展 ,因为他觉得你起步相对晚 ,而行业里面已经有一个其他的开源社区做得很好了 , 所以你说 V3 其实对他们来说是一个很大的助益 , 对吧 ?

Henry Yin1:05:04

对 。

曼祺1:05:05

那比如说从这些开源框架的角度来说 ,他们现在觉得我应该抓住哪个开源模型的机会好好的增长发展一波 ?

Henry Yin1:05:13

V4 他们其实投入了很多时间精力去做 ,但 V4 当然就是没有 V3 给他们带来那么大的 ROI 了 。

曼祺1:05:21

那像 Kimi, 像 Minimax, 包括像小米 、 千问 , 你觉得这个季度有什么亮眼的进展吗 ?

Henry Yin1:05:27

如果我们总结一下这个季度中国开源模型的进展的话 , 就是中国开源模型四杀 ,在过去的这个八周内 , 先是 Kimi 2.6, 然后是 DeepSeek V4, 然后是 Kimi 2.7, 再然后是 GLM 5.2, 四次易主全球最强开源 , 基本上就是在编码和成本上已经快要这个追平前沿的这个比如说 5.5 和 Opus 4.8 级别的模型 , 然后这个最强的这个币源可能还要领先就是大概半年的水平 ,但是差距还

我觉得目前还没有继续拉大的趋势 。

曼祺1:06:00

这是我们聊到的智能的扩散的第一部分 , 就是观察到一种神奇的中国开源模型和美国的公司之间的这种合作 , 然后是第二个想展开的和智能的扩散相关的话题 , 就是一些新的交互的尝试 , 这个更多是在产品创新上的 , 前面其实也聊到说 OpenAI 的一些人也觉得自己的模型是很强的 ,但是在产品在走向市场上不如 Anthropic, 那我们可以先从 Anthropic 这个季度的进展开始讲 ,他们最

新交互1:06:00

曼祺1:06:26

近推了一个还挺受关注的新的产品功能 , 就是 Cloud Tag,也是我们前面稍微提到的 , 就是说类似于 Devin 之前做的那件事和 Slack 打通 , 你可以讲讲就这个新的功能带来的一些变化和讨论是什么 ?

Henry Yin1:06:40

Cloud Tag 其实是一个非常直观的一个功能 , 它就是允许你能够在 Slack 里面用 add Cloud 的方式来把任务提交给 Cloud, 然后 Cloud 就会把这个任务做好了以后, 然后呢再把结果返回到这个群聊里面 , 所以我觉得它的这个交互方式就是说从每个人自己开一个独立的聊天机器人, 对吧 , 相当于是你有一个你自己的个人助理 , 变成了你现在团队有一个 24 小时一直在监听你的这

个需求和有所有上下文的一个同事 , 这个我觉得可能是一个比较大的变化 。Android 的话呢在加入了 Anthropic 以后也是开始疯狂的这个灌水 ,他说这个是 AI UI/UX 的第三次大改 , 那他是这么想的 , 就第一次的话是有一个网页 chatbot 让所有人去网页聊天 , 第二次的话呢就是所有人下载一个 app 到自己的手机和电脑上面 , 然后能够和 AI 进行各种交互 , 那么第三次的话就是 AI 来到你的协作空

间里面 , 企业协作空间里面 , 然后能够和人比较深度的去协作 , 所以就是这个我觉得是 Anthropic 他们这个季度自己非常兴奋的一个功能 ,他们比如说他们的这个 Cloud Code 的团队的产品经理 Catherine 就说他们现在产品团队大概有 65% 的代码都是通过 Cloud Tag 的形式来完成的 。

曼祺1:08:00

它的这个好处就是我们可以群体来协作是吧 , 就它可以在一个群里共享上下文 , 然后和很多证人一起来合作 ,而不光是专门属于一个人的 ,其实这个想法本身并不是很新 , 我觉得国内和国外都有很多比这更早的尝试 , 为什么 Cloud Code 做这一步比较晚 ?

Henry Yin1:08:16

我觉得他们可能之前的话是在自己最擅长的产品形态上面就是下功夫 , 就在 Cloud Code 上面花了大量的时间 , 那么现在的话他们想要进一步的去拓展他们的这个产品战线 , 所以 Slack 的话我知道他们之前已经做了 , 内部其实做了挺久的 , 应该是比较深入的打磨了这个产品体验 。

曼祺1:08:37

那我觉得可能也跟它的产品策略有关 , 就是它希望推出市场的时候就已经是一个体验上各方面比较丝滑比较成熟的东西 , 这个也有利于就是让用户能持续的觉得你是一个能给我带来高品质高体验产品的公司的这么一个形象吧 , 我觉得 Cloud Code 确实它这方面的口碑是不错的 。

Henry Yin1:08:54

之前我问过一个 Anthropic 的朋友 ,Cloud 进 Slack 这件事情难道不是这种程度的集成 ,以你们的编程能力不是直接 vibe code 一下就完了吗 ?

他说这个在这个用户体验上面如何能够就是尽可能有效的利用上下文 , 然后能够不光是被动的接收信息 ,而是包括主动的去 propose 一些任务上面 ,他们是下了很多功夫的 。

曼祺1:09:17

对 , 这也是它其中的一个功能 , 就是它会在一些合适的时机跳出来来提醒团队 , 你不要遗忘一些任务 ,不要遗漏一些事 ,以及它还要设置一个权限的管理 , 这个也是协作类的 agent 需要去考虑的事情 , 就是不同的员工可以看到什么类型的数据 , 可以访问什么不同的频道 , 我觉得这个也是一个挺有意思 ,有点张力的地方 , 就一方面就你刚刚说这个 Catherine Wu 她自己说我们的

很多代码就是用 Cloud 来写的 , 尤其是 Cloud Tag 这个功能 ,但另一方面他们自己在推出一个产品的时候 ,其实我能感觉到它还是做了很多细致的打磨 , 你光靠 vibe coding 是肯定不够的 , 就一方面我觉得它把这个用 Cloud Tag 来提升效率的这种前景描绘的很诱人, 另一方面自己又在默默的 。

Henry Yin1:10:01

默默的失利 。

曼祺1:10:02

对 , 默默的有些地方还是 。

Henry Yin1:10:03

打磨细节 。

曼祺1:10:04

还是得靠人, 得靠团队来实力 , 所以这不算一个很大的新的东西 ,但是有可能会是对 Cloud 的用户来说一个更好用的东西 。

Henry Yin1:10:13

我觉得从概念上来讲它并不新 , 没有 Android 说的那么新 。

曼祺1:10:17

那就是看它执行的好不好 ,是不是第一个执行的很好的 。

Henry Yin1:10:20

可能实际对于用户的这个影响上来说应该可能是比较大的 ,因为我身边的用 Devin 的团队 ,他们最喜欢 Devin 的点就是和 Devin 的 Slack 里面的协作体验 , 那么现在如果 Cloud 又有了 Slack 的这个集成的话 , 我会更加担心就是 Devin 的这个用户群体 。

曼祺1:10:40

Devin 现在什么近况 ?

Henry Yin1:10:41

Devin 的 revenue 增长应该挺好的 ,因为他们有两部分业务 , 第一部分业务的话是卖他们这个工具 , 就类似于 Anthropic 卖 Cloud Code, 另外一方面他们还卖服务 , 就是说比如说你有一个 , 你是一个银行 , 你有一个什么 Fortune 写的一个代码仓库 , 然后我要给你 migrate 成一个 Python 代码仓库 , 你这个可能几十万行代码 , 然后那你就直接把这个东西交给我来 , 我给你从头做到尾 。其实就是之前

洪珊说的就是下次不再是给你交付一个工具 , 我不再是按用量来获得价值 , 我是按我给你的服务 , 我给你带来的价值来获得我的价值 。

相当于是 AI empowered 咨询 。

曼祺1:11:17

或者你也可以说是 AI empowered 的外包 , 只不过里面可能人参与的没那么重了 。

Henry Yin1:11:21

对对对 。

曼祺1:11:22

这是 Anthropic 在这个季度的一个功能上的变化 。OpenAI 有一个新的功能是 Record and Replay, 这是一个挺不一样的思路 , 你可以讲讲这个新功能是干嘛用的 ?

Henry Yin1:11:33

这个新功能呢 , 它做的事情是它叫做 Record and Replay, 就是它有两部分 , 第一步是 Record, 就是你可以让 Codex 去录制你做一个任务的过程 , 那么你点完录制以后它就会开始观察你 , 你是怎么一步一步完成你电脑上的一个任务的 , 那么录制完成以后呢 , 它会把这个东西固化成一个 skill, 就是技能 , 那么当未来你想 replay 就是重播的时候呢 , 它就会根据这个 skill 的记录 , 然后

来自动的通过 computer use 的方式来完成这个任务 , 所以这个我觉得是一个非常好的把一个技能从人 transfer 到 AI 的一个方式 , 那么这个事情呢它其实概念上也不新 ,在之前的话 Meta 内部就有一个项目叫做 MCI, 就是专门做这个事情 , 就是在员工的电脑上安装了软件 , 然后录屏 , 然后希望能够通过这些数据让 AI 学会这些任务 , 然后最终达到一个把员工蒸馏掉的效果 。

曼祺1:12:33

不过这也是这个季度发生的 ,MCI 也是这个季度 , 差不多的时间 。

Henry Yin1:12:36

差不多的时间 。 那好像这个项目是不是已经在 Meta 内部被叫停了 ?

曼祺1:12:39

对对对 , 这肯定会引起很大的反弹嘛 , 所以对 OpenAI 来说 , 它相当于他们都看到了这个方向 , 就认为这个方向还是有价值的 , 只不过 Meta 那个推的方式大部分人不能接受 。

Henry Yin1:12:49

对 。

曼祺1:12:49

它是强制性的 。

Henry Yin1:12:50

然后 OpenAI 已经抢先在 ChatGPT 里面产品化了 , 所以应该在时间线上面也是更加领先的 。

曼祺1:12:56

它这个其实有点像什么 ,有点像机器人的摇操 , 就早期机器人摇操也是你去摇操一个同构的机器人, 然后你把人类的这个操作的能力给迁移到一个机器上 。

Henry Yin1:13:07

然后在模型的进展上面的话 , 我们可以看到就是现在御三家在这个 OS World Verify 上面已经全部超过了人类的基线 ,也就是 72%, 大概 Opus 在 83%, 然后 GPT 5.5 也是在这个接近 80% 的水平 。

曼祺1:13:21

OS World 就是一个 computer use 的 benchmark, 对吧 ?

Henry Yin1:13:25

对 。

曼祺1:13:25

就其实也是它主打的这个功能要去做的那个东西 。

Henry Yin1:13:29

对 。

曼祺1:13:29

你觉得 OpenAI 推出的这个 Record and Replay, 还有 Anthropic 推出的 Cloud Tag, 哪个可能会是更引领方向性的 , 会有更多人来跟进的东西 ,以及如果你自己用过的话 , 你觉得哪个对你来说更有用 ?

Henry Yin1:13:44

我觉得从概念上来说的话 , 应该是 Record and Play 更能代表一个未来大家前进的方向 , 我相信后面会有更多的厂商去追随 OpenAI 的这个脚步 ,但是在 Record and Play 的话 , 它非常依赖于现在 computer use 模型各方面的能力 , 包括它多步任务的这个准确性 , 包括它这个延迟 , 都还有在提升 , 所以我觉得可能 Cloud Tag 会在短期的这个用户的 impact 上面 , 影响上面可能影响力可能会更大

一些 。

曼祺1:14:14

就会有很多人用 , 会有很多人实际能用起来 。

Henry Yin1:14:16

对对对 。

曼祺1:14:16

而且也会冲击到 Devin 这一类公司 ,有可能 。

Henry Yin1:14:19

对 , 我觉得很有可能 。

曼祺1:14:20

然后回到就是 Record and Replay, 你说它现在是一个比较早期的状态 ,有些地方可能不是很好用 , 理论上来说它这个功能推出去之后, 它也可以获得相关的数据 。

Henry Yin1:14:29

它可以获得大量的数据 。

曼祺1:14:30

就有人用它就能有大量真实的数据 。

Henry Yin1:14:32

但可能也要看它的这个对数据的应用 , 就是条款能不能 。

曼祺1:14:37

能不能用于模型的 。

Henry Yin1:14:38

能不能用于模型的训练 。

曼祺1:14:39

这个还挺涉及隐私的 ,因为 。

Henry Yin1:14:41

对 。

曼祺1:14:41

因为这个数据里是应该能看到你的 , 就是有些系统的这个界面 , 然后里面就有些比如说截图 , 或者你在用的一些你个人的信息都有可能会被看到 。

Henry Yin1:14:51

这个数据应该比之前的这种文本数据会更加的丰富 。

曼祺1:14:56

我觉得这是个很好的提醒 , 如果有人想要试这个东西的话 , 可以仔细看一看它的隐私协议是怎么来规定的 , 如果能用上的话 , 我觉得对它提升自己的 OS World 的类似于这种就是 computer use 的 benchmark 的能力应该是会有挺大的帮助 。

Henry Yin1:15:10

对 , 我觉得 OS World 或者 computer use 的 benchmark 好像一直没有特别大规模的 benchmark, 所以他们这个东西如果一旦 launch 并且有大量用户使用的话 ,他们应该可以比较快速的去拿到这个可能市面上最大的 computer use 的数据集 。

曼祺1:15:26

也许他们自己就能编制一个更好的这种评测指标了 。 说到这个挺有意思的 , 这个也是和机器人挺不一样的地方 , 你看 OpenAI 推了这样一个新功能 , 那就会有人来用 , 当然这个数据能不能直接用来做训练就我不知道 , 然后在机器人在物理世界里它就不是这个逻辑 ,因为你得造一个机器人, 然后你才能放到一个地方 , 它才会有真实的数据 ,而且就算你

免费把一个机器人放到一个地方 , 对方也不见得想要这个东西 , 它的链路就是没有这么通畅 , 成本没有这么低 。

Henry Yin1:15:55

更难 。 然后另外我觉得就是大家在数字世界里面放弃自己的隐私这个事情 , 干了这么多年已经干习惯了 ,但是在物理世界要放弃自己的隐私可能 。

曼祺1:16:05

还是有个心理的门槛 。

Henry Yin1:16:06

还有个心理门槛 。

多模态1:16:07

曼祺1:16:07

得适应一下 。 除了我们前面说这两个功能之外 ,在新的交互上, 二季度还有一个进展 , 就是 OpenAI 在继续发布它的一些多模态的系列 , 包括 Realtime 这是一个流式语音的系列 , 它是一整套 API, 然后还有 Image2, 就是他们纹身图的这个系列 , 同时我觉得可以稍带讲讲就是 TML 这家公司 ,Thinking Machines Lab 一家 LeoLab,他们也是在二季度发布了自己的首个模型 Interaction Model, 它也是一个这种语音交互类的模型 ,

就可以讲讲这一块的进展吧 , 一个是为什么大家觉得这个方向还是很重要 , 就比如说语音 , 另外一个就是这些新的成果里面有什么相比之前不一样 , 或者说有进步的地方 。

Henry Yin1:16:49

我觉得首先语音呢 , 它并不是一个普通的多模态能力 , 我觉得语音它是一个人和 AI 交处的这个基础设施 , 刚才咱们提到第二个主线是 AI 在社会里面的扩散 , 我觉得就是让人能够在各种场景随时随地的和 AI 进行交流 , 用上 AI 这个事情还是非常重要的 , 这是为什么我觉得语音这个事情特别重要 , 然后 Thinking Machines Lab 这个发布 , 我还是非常 , 我个人

觉得非常有意思 , 就这个模型我先给大家介绍一下, 它叫做 Interaction Model, 它是一个 276B MoE 模型 , 然后有这个 12B 的激活 ,是他们自己从零开始训练的 , 这个模型最有意思的点就是它是一个能边听边说 , 然后还能看 , 然后能够看你的动作这个即时反应 , 然后能够打断人的这么一个模型 , 就在以前这个是从来没有过的 。

曼祺1:17:41

就像一个采访模型 。

Henry Yin1:17:42

采访模型 。

曼祺1:17:43

边听边说 , 还要打断人, 对吧 ? 还要看 , 对吧 ? 你采访也要看对方的反应吗 ?

Henry Yin1:17:50

那这个模型就是万机可以立马用起来 。

曼祺1:17:54

对 。

Henry Yin1:17:54

然后它不仅可以就做这些事情 , 它并且它后台还配了一个异步的一个推理模型 , 就是说在做这些实时反馈的同时, 它后面一个还有一个模型在做长思考 , 然后可以把这些深度思考再插回这个对话里面 ,但它在网上就是发了一篇博客 , 然后和一些这个 demo 的录制视频 ,但是目前的话呢 , 就只是还是没有开放 API 和大规模使用 , 所以其实没有太多的这个用户能

够用上, 然后给出真实的反馈 ,但是我觉得这个东西它的意义在于什么呢 ? 就是在之前的话 , 最好的模型在语音方面就是实时交互 , 应该是这个 OpenAI 的 GPT Realtime,但 GPT Realtime 它其实是一个对讲机 , 就是它是还是 turn based, 你说完了以后, 然后你摁了以后, 然后对方说话 , 然后它摁了以后, 你之所以感觉是 realtime 的 ,是它上面包装了一层 , 它上面包装了一层这个 VAD, 就

是这个 voice activity detection, 它会知道就是说你这边大概是应该是说完了 , 然后我就该我这边说了 ,但它其实还是本质上还是一个轮流说话的这个对讲机 。

曼祺1:18:55

它包装的这一层并不是在模型层是吗 ?

Henry Yin1:18:57

不是在模型层 。

曼祺1:18:58

是加在上面的 。

Henry Yin1:18:59

是外围包装的 。 而这个 Thinking Machines 的这个新模型 , 它的交互模式呢 , 就是从对讲机变成了真正的打电话 , 所以它是一直在听你说什么 , 然后并且可以同时说话的 , 所以这个叫做 full duplex。

曼祺1:19:11

它没有去全量的开放这个 API,是因为这种新的方式可能会非常贵吗 ?

Henry Yin1:19:16

这个呢 , 我就不太确定是说它这个效果还需要打磨 , 还是因为他们觉得现在成本太高 , 自己的这个 infrastructure 没有做好 , 还是因为什么原因了 。

曼祺1:19:26

而且它这个东西是不是不好直接变成一个 to C 的产品 ? 就像你说的语音 , 它是交互的一种基础方式 , 对吧 ?

它其实是这个生态里的一个基础设施 , 包括我们第一次录节目就聊这个 agent 这个 infra 的创业机会的时候 , 你是单独把语音列成一层的 , 你是把它列成和推理和 coding 和 computer use 都是平行的 , 那从这个角度来说 , 它就得加在一个什么上面 , 它才是一个完整的产品 。

Henry Yin1:19:50

我觉得这其实是个很有可能性的一个推断 , 就是他们可能最终是要推出一个个人助手的一个 to C 的一个产品 , 然后这个模型呢 ,是它这个个人助手交互的 。

曼祺1:20:03

方式 。

Henry Yin1:20:04

Interface, 对 , 所以它现在先把这个模型放出来 , 它可能最终是想 release 那个个人助手 。

曼祺1:20:09

我们叠个假 , 这都是我们推测的 , 就有可能它想在自己的产品出来之后它才放 API, 再给别人用 , 当然也不排除就是说成本各方面综合的考量 。

Henry Yin1:20:18

还有一个就是能突出它这个架构和以前是完全不一样的 , 就是它自己在发布这个模型的时候还做了两个 benchmark, 一个 benchmark 叫做 time speak, 就是按照指定时间精确开口 , 比如说每 4 秒提醒一下我呼吸 , 然后这个模型就会比如说这个按准时说话 , 然后另外一个的话就是叫 cue speak, 就是监听用户这个语音 , 然后在内容这个里面出现线索 , 就是该你说话的

时候你就要说话 , 所以他们内部做了两个 benchmark 来衡量这个模型在这个实时语音这方面的能力是不是够强 , 那么在这两个 benchmark 上面 ,他们和 OpenAI 做了一个对比 ,在指定时间精确开口这上面 ,他们是 64.7%, 然后 OpenAI 的这个 Realtime 2.0 是 4.3%。

曼祺1:21:01

差这么多 。

Henry Yin1:21:02

差了很多倍 , 就这个都是有点我感觉有点欺负小朋友 , 就主要是因为它这个架构就做不了这个事情 , 所以他们才 ,他们这个新架构才这么高 。

曼祺1:21:10

所以那 4.3% 就基本上就蒙的 , 随机的 。

Henry Yin1:21:13

对 , 然后在这个 cue speak 上面 ,他们是 81.7%, 然后 OpenAI 是 2.9%。

曼祺1:21:20

2.9%。

Henry Yin1:21:20

2.9%, 所以都是 , 就几乎这个基线几乎是零了 ,但他们应该测的就是 Realtime 2.0。

曼祺1:21:26

那你觉得 Realtime 2.0 表现如何 ? 它也是二季度 OpenAI 发的一个新的东西 , 就是 Realtime 这个系列的一个最新的东西 。

Henry Yin1:21:33

我觉得 Realtime 2.0 的实际使用体验还是不错的 ,但是我这个地方不完全确定 , 我在 ChatGPT 里面 advance voice mode 现在用到的是不是已经是 Realtime 2.0 了 , 对 , 我记得好像刚发布的时候是后面应该是那个 advance voice mode 还没有更新成 Realtime 2.0。

曼祺1:21:51

我觉得它这个东西不一样 , 它是一个比较成熟的产品 ,因为它 API 也就是到 6 月十几号的时候它就全量可用了 , 然后很多就是开发者这些都可以用起来 , 这个是跟 interaction model 不一样的地方 , 确实一个我觉得是个还更前沿的尝试吧 , 然后一个是它已经相对成熟一个系列的新的一代 ,也可以稍微再说讲讲这个 Image2, 就继续就纹身图的这一块 , 就是在 Sora 关停之后, 纹

身图 OpenAI 现在看起来还在继续 。

Henry Yin1:22:17

我觉得 Image2 的效果是非常好的 , 然后它在这个 image arena 上面应该是断层式的领先 , 就是应该是 yellow score 应该是 1500 多分 , 然后比第二名可能高了就是 200 分 , 然后它呢 , 就是在这个视觉生产力的各个方面都非常强 , 比如说我们应该可以看到就是社交媒体上有大量的用 Image2 来生成那个电影海报或者的那些 , 就生成的效果非常非常的好 , 所以能够实际的

就是我觉得在一些有经济价值的这个任务里面 ,是比上一代纹身图的模型要强很多 。

曼祺1:22:52

所以它和 Sora 的区别就是它没有那么花钱 ,以及它比较能算过来这个回报 。

Henry Yin1:22:57

我觉得历史上我们能看到的就是说像 Nano Banana 还有这种纹身图 ,他们其实对于 to C 产品其实还是有很大的帮助的 , 当时 Nano Banana、Google Nano Banana 发布的时候 ,他们的那个 Gemini 的下载量有大幅的这个上升 ,并且还有一些 startup 他们自己想要把自己的流量做上去 , 就是通过免费提供 Nano Banana 给用户使用来吸引用户 , 所以这样的功能其实对于 to C 产品的增长还是很有帮助的 。

曼祺1:23:25

OK, 那我们再聊完前面的推进智能前沿和现在已经有的智能怎么更好的扩散之后, 我觉得最后可以补充来聊一聊一些在前面的话题里没有提到的重点公司的进展 。

大厂近况1:23:25

曼祺1:23:38

首先我觉得就是 Meta,因为 Meta 在这一季度其实还是有一个挺重要的变化 , 就是 TBD 他们的核心 AI 部门是放出了重组之后的第一炮 ,也就是 Musespark 这个模型 , 就是 4 月初发的 , 行业里是怎么讨论这件事情的 , 就这个模型反响如何 ?

Henry Yin1:23:56

行业里的讨论就是讨论不多 , 就是这个模型应该是这个接近前沿能力 ,但应该是还是处于一个追赶的态势 , 还没有达到真正达到就是前沿 。

曼祺1:24:06

而且能用的人也比较少 , 对吧 ? 因为它没有完全开放 API。

Henry Yin1:24:10

对 , 我身边没有听说有人就是用过 Musespark。

曼祺1:24:14

那有可能这个季度围绕 Meta 更大的新闻依然是裁员 ,是我们上次讨论的 , 就是它当时不是说要计划裁员吗 ?

现在是开始裁员了 。

Henry Yin1:24:23

我觉得小扎的计划就是持续的裁员 , 然后把这些裁员用的钱来进一步投到这个 AI 的开发上面 ,但只不过现在可能内部比较动荡 , 所以受到了一些内部的阻力 。

曼祺1:24:34

我们在最开始回顾上一季度和这一季度的变化的时候 , 你也提到有一个事是没有在这一季度延续的 , 就是我们之前讨论 Meta 的 token 消耗的竞赛 , 然后更广泛的来说其实是当时在一季度的时候有一种 token maxing 的风潮 , 就很多公司都争先恐后的希望自己的员工能更多的去用 AI, 你怎么看这个风潮好像比较快的就趋于平息和平了 。

Henry Yin1:25:00

我觉得所有的这些技术趋势都应该 follow 一个三部曲吧 , 先是 frenzy 狂热 , 然后下一步可能就是 crash, 就是崩盘 , 最后的话是这个 stabilization, 就是稳定 。

我觉得 token maxing 基本上也是这三个阶段 , 我觉得可能 Q1 的话就是一个狂热的一个阶段 , 那么这个狂热阶段就是大家会看到就是钱花了这个上亿美元 , 对吧 ?

但是最后并没有就太多的这个产出 , 那么接下来就可能会进入现在第二个阶段 ,但我相信接下来马上可能就会进入就是第三个阶段 ,他们内部之前会有一个 leaderboard, 就是看谁的 token 用的最多 , 现在这个 leaderboard 也已经被取缔了 , 所以然后给每个人也加上了这个使用 token 的 quota, 就是有一个上限 , 限额 , 所以这个事情应该就是相当于是进入新的阶段 。

曼祺1:25:47

这边大公司的人均限额一般是多少 ?

Henry Yin1:25:49

我觉得 Meta 限额应该是一个比较高的 , 我们之前听说 Uber 在四个月就用完了它全年的 coding 的这个 budget, 那它应该是大概是每个工程师每个月平均是 500 到 2000 美元的限额 。

曼祺1:26:04

500 到 2000 美元 , 国内差不多也是这个量级 , 国内我知道有一些公司是 5000 人民币 ,700 美元 , 就在你刚刚说的 Uber 的这个范围里面 , 当然就是 2000 美元就是属于还比较高了 ,他们还有一个有意思的事是我们前面聊到过的这个 MCI, 就有点类似于 OpenAI 推的那个新功能 Record and Replay, 只不过在 Meta 他们是强制所有员工都要去做的 , 然后后面又出现了比较大的安全问题 ,

数据泄露的问题又叫停了 。

Henry Yin1:26:31

所以强制和自动开启的区别还是挺大的 , 自愿开启 。

曼祺1:26:35

因为对 OpenAI 来说这是我给了你一个新的服务 , 你可以用 , 你也可以不用 , 然后 Meta 是要所有的在美国的员工都要在电脑上去安装一个追踪软件 , 然后去看你是怎么移动鼠标 , 你怎么点击 , 你怎么键盘输入 ,但这样也有一个好处 ,因为刚才我们在讨论 OpenAI 的这个新功能的时候 , 就在说这个数据能否被用来去训练更好的 computer use 模型 ,其实是不知道的 , 大

概率是不能直接用的 , 那我觉得在 Meta 的算盘里它肯定是拿来直接用的 , 它和员工之间就没有这种问题 。

Henry Yin1:27:04

它毕竟是自己的数据嘛 。

曼祺1:27:06

但是这个如意算盘就没敲响 , 反正现在被叫停了 , 然后我们来聊聊 Google 和业已不是独立公司的 xAI 吧 ,在二季度的一些情况 。

Henry Yin1:27:17

Google 呢 ,在这次的 I/O 大会发布了他们的新模型 Gemini Omni, 就是对于视频的剪辑能力应该还是让大家非常惊艳的 。

曼祺1:27:27

看起来还是多模态上的进展 。

Henry Yin1:27:28

对 , 主要 Google 的话就是这个季度可能还是多模态的进展比较多 ,但是内部的话他们应该也充分的意识到了就是代码能力对于未来不管是营收还是未来竞争的重要性 , 所以他们也在加码代码这方面 。

曼祺1:27:43

然后 xAI 这个季度有巨大的变化 , 就是我刚才提到的 ,他们已经不是一个独立的公司了 。

Henry Yin1:27:49

xAI 的话现在是有一个从 NeoLab 到 NeoClaw 的一个转变 , 当然在自己这个放弃这个 train 模型以后 ,他们赚钱就赚得非常多了 ,他们这个集群租出去以后, 现在每个月的租金是 1.25 billion 美金 , 就是 12.5 亿美金的这个收入 , 然后 Elon 现在又要去这个太空里面去建这个太空算力中心 , 相当于 SpaceX 我觉得应该是朝这个算力的方向走了 。

曼祺1:28:15

所以有一件事他至少做对了 , 就是建特别大的算力 , 这是一个从现在这个时间点你倒回到过去三年去看 , 一个很聪明的投资 , 然后另一方面你刚才说他放弃了训练模型 , 这件事已经板上钉钉了吗 ?

Henry Yin1:28:28

他对外肯定就是不是说他要放弃这个模型 ,但他目前的话实质上他没有这个训练模型之前的那个人才团队了 。

曼祺1:28:36

你觉得他收购 Cursor 之后能多大程度的去改变这件事情 ?

Henry Yin1:28:40

我觉得 Cursor 的团队可能并不能完全填充他之前的那个窟窿 。

曼祺1:28:46

Cursor 团队应该有一些人是做过模型的 , 至少做过后训练 , 对吧 ?

Henry Yin1:28:50

对 , 至少他们做过后训练 ,但我觉得 Cursor 可能比如说没有预训练的人才 。

曼祺1:28:53

所以我们还会看到 Grok 模型吗 ?

Henry Yin1:28:56

我觉得可能会 , 至少会需要一段时间 。

曼祺1:28:58

其实 5 月的时候 ,5 月底的时候 , 马斯克自己在 X 上说 Grok V2 已经完成了预训练 , 说两到三周之后要公布 ,但是到现在还没有发布 。

Henry Yin1:29:09

我觉得 Elon is alwaysright, except the timing。

曼祺1:29:13

你周围的人有人收到 xAI 的 offer 吗 ? 补充新团队的 。

Henry Yin1:29:17

好像没听说 。

曼祺1:29:18

没听说 , 所以也没有听说他们 。

Henry Yin1:29:20

我听说的都是离开 xAI 去别的地方找工作了 。

曼祺1:29:23

就也没听说他们在补充人才是吗 ? 没有这种 。

Henry Yin1:29:26

他们招的人 ,但听说招的人是做那些什么 harness 那些的 , 就是并不是 train 模型的 , 就做 agent 的 harness 那些东西的 。

曼祺1:29:34

你觉得马斯克还有可能再追上吗 ? 他还有可能再抓住模型的这个机会吗 ? 其实当年 OpenAI 它是最早的支持者和创始团队之一 , 如果带入下马斯克 , 我觉得他错过这个机会应该还挺恼火的 , 你觉得他还有可能赶上吗 ?

Henry Yin1:29:49

我觉得比较难 。

曼祺1:29:50

你觉得比较难 ?

Henry Yin1:29:51

我觉得比较难 , 对 ,但他如果要是就 you never bet against Elon, 对吧 ? 他如果真的想做的话 , 我觉得说明他还有希望 。

曼祺1:29:58

因为他这里面有一个更大的问题 , 就是其实到 25 年还是有一些新的团队在出现 , 就考虑做预训练的 ,其实国内也有 , 比如说像米哈游 ,他们也说要用 1000 亿来做这件事情 , 当然米哈游的蔡浩宇之前其实他更早的时候就组了一个公司在做 AI 游戏 , 这个公司存在比较早了 ,但是他想去做预训练这件事情可能是更晚才发生的 , 就他也类似于现在这种要

重建地基的状态 , 就我想知道有比较大的资源 ,有这种抱负的团队 ,他有没有可能在现在这个时间点赶上这个窗口 , 还是说这个事情在 23 年、24 年可能就已经结束了 。

Henry Yin1:30:34

我觉得已经结束了 。

曼祺1:30:35

除非说之后技术又会有比较大的变化 ,有一个大的瓶颈期 , 然后再有大的变化 。

Henry Yin1:30:40

有可能 ,但是那样的话就是说应该也是要去解决新的瓶颈 ,而不是把原来老路再走一遍吧 。

曼祺1:30:47

那样的话可能又会有更新的公司 ,有更新的组织出现了 。 那你觉得 Google 和 Meta 还有可能赶上来吗 ? 就他们和 xAI 的情况又不太一样 ,他没有完全散掉 。

Henry Yin1:30:57

我觉得 Google 和 Meta 是有机会赶上来的 ,Google 的可能性会更大一些 。

曼祺1:31:02

一方面现在确实大家觉得 Google 是落后了 ,是吗 ? 相比于去年三季度 Google is back 的强势回归的状态 。

Henry Yin1:31:08

我觉得去年年底的时候 Gemini 3 然后发布的时候 ,Google 有短暂的就是有那种重回第一的感觉 。

曼祺1:31:15

短暂的重回第一 。

Henry Yin1:31:17

对 , 然后现在到今年的话肯定就是落后于 OpenAI 和 Anthropic。

曼祺1:31:22

它当时短暂的重回第一是不是也和多模态本身带来的传播比较多有关 ? 我们之前也讨论过这个问题 ,有一期节目里面 。

Henry Yin1:31:29

我觉得一方面是它多模态能力确实做得不错 , 另外一方面是当时它应该是同时发布了 Gemini 3 和 Antigravity, 就是他们那个 Windsurf 收购了以后做的新的 agent IDE, 然后就是 Gemini 3 当时的就 12 月底的时候 ,他们当时的 coding 能力和 Anthropic OpenAI 还没有差那么多 ,但是今年的话就是 Anthropic OpenAI 在 coding 这边就是有长足的进步 ,而 Gemini 那边并没有太大的进步 ,并且就是还有一个 Google 非常擅长的是他们的

这个 cost 做得非常低 , 就之前的话如果我们看那个 Pareto Frontier 那张图 , 就是纵轴横轴分别是 cost 和模型能力 , 基本上这个在 Pareto Frontier 就是给定一个这个模型能力 , 然后 cost 最便宜的 , 基本上都是 Google 的模型 , 然后到今年的话好像这个优势好像也不在了 , 就是这个新的 Gemini 3.5 Flash 好像比之前贵了好几倍 , 所以在 Pareto Frontier 上面 Google 也不是就是一直都是在领先的

状态 , 所以就几方面的因素加一起 , 我觉得现在 Google 肯定是大家会觉得会落后一些 ,但我觉得就是然后再加上最近 Google 的这个 Noam Shazeer 也离开 Google 然后加入了这个 OpenAI。

曼祺1:32:41

他是 Transformer 的八位作者之一 。

Henry Yin1:32:44

然后所以我觉得大家可能会比较担心 Google 的状况 ,但我觉得 Google 还是有一个很好的底子在那里的 。

曼祺1:32:51

这个底子是来自于 ?

Henry Yin1:32:52

这个底子我觉得关于几方面吧 , 一个是他们研究人才的储备 , 除了 Noam Shazeer 还有很多很好的研究员 , 然后另外的话就是他们的这个算力基础也在 。

对 , 然后我觉得 TPU 的话他们有很大的这个算力上面的一些优势 。

曼祺1:33:07

你觉得 Meta 也是有可能赶上的原因是什么了 ? 其实我这几天和不少人交流 , 我觉得大家对 Meta 的整体态度还是比较悲观的 。

Henry Yin1:33:17

我觉得 Meta 最大的风险就是说出现那个类似于 xAI 的那种团队解散的那种风险 。

曼祺1:33:24

之前是御三家 , 然后现在是两大 Frontier Lab, 你觉得再往后未来会只有一个公司持续领先吗 ?

Henry Yin1:33:32

我觉得应该不会是一家公司持续领先的状况 ,因为我觉得举一个例子的话 , 就是 2023 年 GPT-4 刚发布的时候 , 大家都觉得非常惊艳 , 那个时候就是 OpenAI 领先其他 Lab 的这个身位 , 应该大于现在最领先的 Frontier Labs 领先第二名的身位 ,但是这么大的这个优势 OpenAI 也后来被追上了 , 所以我觉得应该是一个交替领先的一个态势 , 除非是这个有某一个 Lab 提前把比如说达到

在 RSI 上面有一些进展 , 然后使得他们加速度大幅超过其他的 Lab, 那我觉得可能会出现就是有一家独大的情况 。

曼祺1:34:16

你刚刚讲前面那一半的时候我也是想到了 RSI, 就如果你说你真的实现递归自进化的话 , 那你可能加速度会变快 ,但同时也有可能两家公司差不多时间实现 ,也有可能 , 这个也是我们之后会持续关注的话题 。

彩蛋1:34:28

曼祺1:34:28

那最后来一点轻松的话题 , 就是之前你跟我讲到就是这个季度在硅谷有一家可能之前已经不是风口浪尖的公司也发生了很有意思的变化 , 就是 Midjourney, 之前我们有聊到过 , 就是它其实还是一直比较赚钱的 , 只不过它不在大家讨论的这个前沿 , 你可以讲讲二季度它做了些什么事 ?

Henry Yin1:34:48

Midjourney 这家公司大家都比较熟悉 ,但可能就是最近一段时间没有出现在大家的视野里面了 ,他们是做最早可能做文生图比较有影响力的公司 。

那么 6 月中的时候呢 ,Midjourney 突然宣布他们这个新的产品和部门 , 就是 Midjourney Medical,他们首个新的硬件产品叫做 Midjourney Scanner, 就是号称是这个 50 年来第一个全新的全身医学影像方法 。

曼祺1:35:14

50 年来第一个 。

Henry Yin1:35:16

50 年来第一个 , 然后他们的工作原理呢 , 就是人这个站在一个潜水池的平台上面 , 然后周围环绕着大概 40 万个这个超声波的这个换能器 , 然后声波呢就会从全方位的这个穿过你的身体 , 然后每秒会生成 TB 这个级别的这个数据 , 然后他们会有他们的这个计算集群 , 然后重建你的这个肌肉 、 脂肪 、 骨骼 、 器官的 3D 横截面图像 ,他们

管这个方法叫做 Ultrasonic CT, 就一个 CT 的超级升级版 。

曼祺1:35:45

超声波 CT。

Henry Yin1:35:46

对 , 超声波 CT。

曼祺1:35:47

怎么突然搞这个 , 就一般人看到这件事情都会觉得跟他之前的主业好像八竿子打不着 。

Henry Yin1:35:52

Midjourney 这个 founder David 他实际上是一个非常有想象力的一个人,Midjourney 这个公司他从来不向 VC 融钱 ,因为 David 不想受到就是投资人的控制 ,他希望能够完全以自己的意愿来 run 这个公司 , 所以他利用这个 Midjourney 在文生图方面的这个收入 , 然后养了一个大概 50 人的一个团队 , 做各种硬件项目应该已经做了超过一年多的时间 , 然后他现在可能同时做 8 个项目 , 可能一半是硬件 , 然后一半

是软件 , 然后短期的话可能想把两个硬件产品推向市场 , 那么我们看到的这个 Midjourney Medical 可能是其中的一个 。

曼祺1:36:24

所以他另一个硬件或者说他其他的硬件都还不一定是跟健康医疗相关的 , 可能什么各种方向都有可能 。

Henry Yin1:36:30

对 。

曼祺1:36:30

就是很天马行空的 。

Henry Yin1:36:32

非常天马行空 。

曼祺1:36:32

David Holz 这个人, 就 Midjourney 的创始人 ,他以前是什么背景的呀 ?

Henry Yin1:36:35

David 之前的话他最早是在 NASA 工作过 , 然后做过激光雷达相关的工作 , 然后后来的话他自己创办了一家公司叫做 Libmotion,是做手势识别的 , 然后后面的话是被他竞争对手收购了 , 所以他其实就有很多丰富的这个硬件的经验 , 然后他后来又成功转行做这个 AI 多模态模型 , 然后也做得非常好 , 然后他涉猎非常的广 ,在他家里面他经常会办一些就是各行各

业的活动 , 比如说诗歌朗诵 , 或者说这个音乐即兴 , 或者说 AI 和人一起创作音乐 , 像这种活动他都办过很多 , 然后有很多的研究员和这个旧金山的创业者会去他家参加这些活动 。

曼祺1:37:17

所以他是住在城里的 ,他不在硅谷这边 。 我觉得这还是让我挺意外的一个事 , 就是在硅谷在湾区鼓捣这种新的智能硬件 ,他可能都不能算是一个 AI 硬件 , 对吧 ?

它里面也许还没有那么多用到 AI。

Henry Yin1:37:30

它不是纯 AI 呢 。

曼祺1:37:31

所以最后的这个 one more thing 是关于一家 AI 公司做了一件跟 AI 没有那么直接相关的事 , 我觉得以此作为二季度的总结挺好的 ,因为我们这个季报当然主要是聊 AI 的 , 然后科技行业确实很多的话题也是被 AI 占据的 ,但另一方面在 AI 之外也有很多事物 , 然后也有很多新的进展 。

那今天非常感谢 Henry 再次做客 《 晚点聊 》, 和我们一起来讨论了 2026 年第二季度 AI 领域的一些大事件 , 我们分两条脉络 , 一个是智能前沿是如何推进的 , 另一个是已经存在的智能是怎么更好地扩散到全社会 , 被企业被个人使用的 。

那在第一个部分有之前已经非常明显的 coding 和 agent 的竞争 , 那在二季度它也变得更加激烈 , 包括出现了各种发布的波折 , 还有价格战 , 然后另一个是我们上次有聊到过的 AutoResearch 之后变得更明确 , 然后也更活跃的一个趋势 , 就是 RSI 递归自进化 。

第三个是从虚拟世界到物理世界 , 大家对物理 AI 的探索也在加码 ,OpenAI 官宣了 Robotics 的 team,Anthropic 也被传闻说要去做机器人相关的探索 , 然后是在智能扩散的这条线 , 我们讨论了新的交互 ,Anthropic 和 OpenAI 都在二季度推出了一些新的功能 , 我们也讨论了中国的开源模型和美国的企业客户之间怎么形成了一种生态上的良性合作 , 一起去替代和对抗特别特别贵的 Frontier Lab 的模型

。 那最后的补充部分 , 我们聊了前面的框架里可能没有特别多涉及到的 Google、xAI 还有 Meta 的一些情况 ,以及特别有意思的 Midjourney 这家公司的新的尝试 。

那今天节目就到这里 , 各位拜拜 。

Henry Yin1:39:11

谢谢 。

曼祺1:39:14

本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。

下期再见