开场0:00
所有人都感受到了 , 就是 Coding Agents 啊 ,General Agents。 AI 的自我进化变得更加的贴近现实了 。Andre Kapadki 最近在推特上讨论他的 AutoResearch 实验 , 就是让 AI 自动优化自己的训练代码 。
OpenClaw 的开发者 , 就是之前在 Audible 的 Peter Steinberg。 为什么这样一个应用形态是来自一个个人开发者的 ?
可以参考一下之前的 Devin。 有的时候一个灯塔效应 , 或者说给大家指一个方向这个事情 , 它可能要稍微跳得远一点 。
Dylan Patel 开玩笑说 ,Codex 像是一个弱智 ,但是它在编程这个事情上就是花了很多时间去学习 , 然后出现得特别好 。
但是 Opus 感觉像是 AGI, 相当于现在是主人是 Claude Code, 奴隶是这个 Codex 在那干活 。 那主人是和用户直接这个交互的 , 这个奴隶到底用谁他可以去改 , 对吧 ?
所以这个 OpenAI 也在想怎么翻身这个做主人。
Meta 这公司特别有意思 , 它就是前几周吧 , 大概有一周的时间 , 就是让全员停下来 , 管理层会看每一个人的这个 Token 消耗量 , 作为团队效率指标 。
所以就有我知道的朋友 , 让这个 Claude Code 在那跑一个 loop, 疯狂输出没有意义的这个 Token。 最近 Anthropic 这个几个 billion 那个 revenue 增长里面 , 搞不好也有 Meta 这边贡献 。
欢迎收听 《 晚点聊 》, 我是曼祺 。 从 26 年 Q1 开始 ,《 晚点聊 》 推出季度总结系列 , 会分为 AI 季报和具身季报 。其中 AI 季报的嘉宾是身在硅谷的 MoE capital 创始合伙人 Henry Yin。他此前已经两次做客晚点聊 , 分享过 Agentic 工具链的创新机会和 Gemini 3 之后的一些新进展 , 分别是 137 期和 146 期 。
本期节目我们从 OpenClaw 开始聊一季度的进展 , 进而延展到 Anthropic 和 Cloud Code,以及 Cowork 产品的强劲增长 。Anthropic 应用形态与 OpenClaw 的相向而行 ,以及在这背后的 OpenAI 与 Anthropic 两家公司 , 它们的 coding 产品 Codex 和 Cloud Code, 和最新模型 Opus 4.6 与 ChatGPT-5.4 之间的三重对阵 。
所有这一切的快速进展 , 都发生在过去三个月 。在 Coding 到通用 Agent 和个人 Agent 这条主线之外, 我们也讨论了 AutoResearch 等项目的 AI 自进化能力 , 和仍处于探索中的其他方向 , 如持续学习和世界模型 。Henry 也分享了他在硅谷这个 AI 密度最高的地方感受到的科技带来的社会变化 , 科技大裁员 。
而我则补充了我了解到的一些中国公司的情况 。 不管是 Agent 主战场的快速发展 , 还是自进化开发方式端倪出现 ,26 年前三个月的变化显示 ,AI 越来越不只和科技圈相关 。
下面我们正式进入本期节目吧 。
今天非常高兴邀请到老朋友 ,MoE Capital 的创始合伙人 Henry Yin。Henry, 你可以和我们的听友简单打个招呼 。
嗯 , 大家好 , 我是 Henry。 我之前的背景的话呢 , 自己做过 AI Research, 然后也创过业 。 现在呢 , 我是 MoE Capital 的合伙人。MoE Capital 是三个月前在硅谷成立的早期 AI 基金 , 我们现在已经完成了首关 , 投资了六家公司 。
投资的方向的话 , 主要是三个 : 第一个是 AI for Science, 第二个的话是 B2B 和 consumer 的 application, 第三个的话是 software infrastructure。 那么如果有做这三个方向的创业者 , 非常欢迎来和我们交流 。
嗯 , 之前我也介绍过 ,Henry 是姚班毕业 , 然后去 Berkeley 读博士 , 期间创过业 , 卖过公司 , 现在在硅谷做投资的一位资深从业者 。
之前他也运营 AGI house, 所以和硅谷的很多 AI 研究员有很多交流 。 从这个季度开始 , 我想约 Henry 每期来做一期 AI 季度的回顾 , 范围主要可能会涉及到美国的一些公司 , 然后我这边也会聊一聊中国我了解的一些情况 。
嗯 , 那我们还是先从 AI 现在变革的源头和驱动力开始聊 , 就是技术的进化 , 还有应用的变化 。
嗯 ,Henry, 你可以讲讲就整个 26 年 Q1 的话 , 你看到的几个最大的变化 , 或者说 AI 领域的一些你觉得比较有意思的现象是什么 ?
Q1 综述4:31
好的 , 我觉得 Q1 还是发生了特别多 exciting 的事情啊 。 我觉得可能可以分成三件大事吧 。 第一的话是 OpenClaw 异常火爆啊 , 就 OpenClaw 可能大家都熟 , 如果要是之前不知道的话 , 它是一个开源的 , 相当于一个个人的 agent 的框架 , 然后它可以接入啊大家平时使用的这些聊天软件 , 比如说飞书呀 、WhatsApp 呀 、Telegram, 然后帮你去执行各种任务 。
我觉得它是让就是 AI 从聊天开始真正变成这个干活 。 所以我看到有人戏称说 " 牛马们终于有了自己的牛马 ", 然后它这个成长的曲线非常的快 , 就过去可能 60 天吧 ,GitHub 的这个 star 数量超过了 React 十年以来的积累 。
呃 , 所以我觉得可能是 Q1 就是毫无疑问可能是最火的项目 。 第二件事的话 , 我觉得可能是这个头部的模型厂商的竞争呢 , 比如尤其是 OpenAI 和 Anthropic 啊 , 这两家现在都特别重视他们的 coding 产品 , 就是 Claude Code 和 Codex。Anthropic 的现在的收入增长呢 , 很大程度上我觉得是 Claude Code 驱动的 , 所以这个竞争的焦点可能不再是谁的这个 benchmark 跑分更高 ,而是说这个谁的产品生态
会更深一些 。 呃 , 第三点我觉得可能是这个 AI 的自我进化变得更加的贴近现实了 , 就是 Andrej Kapadki 最近他们在推特上讨论这个他的 AutoResearch 实验 , 就是让 AI 自动优化自己的训练代码 。
呃 , 像 MiniMax 最近刚发布的 M2.7 这个模型 , 它的这个副标题也是 "Early Echoes of Self-Evolution", 就是自我进化的早期吧 。
所以大概他们有 30% 到 50% 的这个强化学习的研究的工作流是由模型自己完成的 。 然后最近也看到了就是有顶级的研究员从 OpenAI、Anthropic 这些 lab 出来 , 然后创业做相关的方向 。
所以我觉得这个 AI 自我改进就是简写可能叫 RSI 吧 , 我觉得它可能会让这个模型和 agent 能力接下来会进一步的加速 。
对 , 我觉得 Q1 可能就是这三件事 。
OpenClaw 热潮6:43
OK, 那正好我们可以就我让你说这几个事 , 我们可以展开聊一聊 。OpenClaw 也是我一开始就想聊的事 ,因为它确实在全球 AI 圈都很火 , 尤其是在中国 , 它是非常出圈的 , 是一个国民级的现象 。
之前晚点也发了一篇文章 , 讲了小龙虾的狂潮 , 什么小学生 、 退休的老师都在用这个东西 。
从你和周围人的观察和使用体验来看的话 , 就你觉得 OpenClaw 因为它也是个 agent 嘛 , 那之前其实也有很多 agent, 包括你提到的 Claude Code, 还有后来 Anthropic 出的 Claude Cowork。
那小龙虾和这之前的 agent 的核心区别 , 或者说它的特性是什么 ?
好 , 我觉得 OpenClaw 应该不是一个技术上的突破 , 我觉得它还是一个交互范式的突破 。 类比一下的话 , 我觉得它是 AI agent 的一个 iPhone 时刻 , 类似于这个触摸屏之前就有了 , 对吧 ?
但是 iPhone 把它放进了一个所有人都想用的一个产品里面 。 呃 ,OpenClaw 的话其实技术上没有什么新东西 , 像每一个组件呢 , 独立的组件都是之前已经存在的 , 包括这个 LLM 循环调用啊 、tool use 呀 、 记忆呀 , 像 Claude Code 呀 、Manus 都能做 。
但我觉得 OpenClaw 呢 , 它做对了几件事情 。 第一件事的话 , 它跑在你的本地电脑上面 , 嗯 , 这意味着它能访问你的文件 , 它有你所有的这个系统权限 , 你所有的本地的这些东西它都能看得见 。
那像 Manus 这种 Cloud agent, 它其实只能看到你给它的东西 , 这个东西是非常有限的 。 但 OpenClaw 的话 , 它能碰到你电脑上的一切 。其实这个呢 , 我觉得就是双刃剑 , 对吧 ?
这个既是它的这个超能力 , 它能够帮你端到端的完成这些任务 , 呃 , 相对来说也是它那个最大的一个安全风险 。
呃 , 它做的第二件事做对的 , 我觉得就是它接入了就是所有人已经在用的这些聊天 app, 像这个 WhatsApp 呀 、Telegram 呀 、 这个飞书啊 , 它不需要你去学一个这个新的界面 , 更像是说这个 AI 来到你的生活 ,而不是你去找这个 AI。
我们看交互方式的话 ,Claude Code 它是在 terminal 里面跑 , 对吧 ? 所以它一开始是非常面向开发者的 , 可能非技术人员 ,他可能不会一开始去自己想到会去体验一下这个 Claude Code。
然后 Manus 的话呢 , 它我觉得是一个 Cloud agent 啊 , 它可能面向的是很多这种数字工作或者知识工作者 。 我觉得 OpenClaw 的话 , 它通过这个呃聊天软件的分发 , 真正把这个 AI 可能带到了所有人身边吧 。
然后再加上呢 , 还有几个小东西我觉得也很重要 , 像这个定时任务 , 然后像长期记忆 , 这样你越用越懂你 , 然后循环调用 LLM 呀 , 然后使用工具直到完成这个任务 , 我觉得都是相当于给它的加分项吧 。
我觉得如果再类比像 iPhone 的话 , 就是像触摸屏 、app、 移动互联网这些东西都有了 。 然后呢 ,iPhone 的话呢 , 就是把这些东西就是组合在一起 , 放进一个所有人都想用的产品里面 。
我觉得 OpenClaw 就是这个组合 。
因为 OpenClaw 的开发者就是之前在 Audible 的 Peter Steinberg, 我不知道大家有没有讨论 , 就是说为什么这样一个挺创新的应用形态是来自一个个人开发者的 ,而不是之前可能做 agent 的挺久的一些公司 。
比如说为什么不是 Manus 或者 Anthropic 先做出这个形态了 ?
哦 , 这个我觉得可以参考一下之前的一个例子 , 就是说 Devin。 那 Devin 的话 , 我觉得他可能最大的一个贡献就是提出了 AI soft engineer 这个概念 ,在他刚发布的时候 。
啊 , 当然他刚发布的时候 ,他其实自己不太好用 ,但是这个概念一下就在深入人心了 。 所以这个概念其实一开始也不是像这个 OpenAI 啊或者 Anthropic 他们提出的 。
所以有的时候的话呢 , 就是说可能一个灯塔效应 , 或者说给大家指一个方向这个事情 , 它可能要稍微跳得远一点 , 可能不是说立马能够实用 , 或者说给大家提供很好的用户体验 。
我觉得 OpenClaw 现在也是这样 , 像这些事情有的时候可能反而是说没有那些历史包袱的一些个人啊或者 startup 他们来提出的 。
但是我觉得大公司的优势是 ,他们的产品其实在快速的朝着这个灯塔去前进 , 像 Claude Code 最近 ship 了很多的新 feature, 像这个 OpenClaw Code。
嗯 , 你自己会用 OpenClaw 来做什么呀 ? 包括你周围的朋友 , 或者说你们投的一些创始人, 一些公司 ,他们会用 OpenClaw 吗 ?
还是说 , 呃 ,因为这个东西确实如你所说有比较多安全风险 ,其实在硅谷也没有那么多人用 。
我自己试用了 OpenClaw 大概一周以后呢 , 然后我是把它就卸载了 。 那这个我觉得就主要是我的主要工作流还是基本上都在 Claude Code 上面 。
嗯 ,但是我身边也有朋友就特别喜欢 OpenClaw, 然后有一个朋友其实写了一篇文章来记录它的使用 ,他一开始我觉得也是比较怀疑的 ,但是用了之后呢 , 发现你完全放手的这个回报它不是 10%,而是 10 倍 。
啊 ,他给我举了几个他做的例子 , 一个的话就是说这些消息的管理 ,他的话呢 , 会每 15 分钟 OpenClaw 来扫描一下他收到的所有消息 , 包括他的短信呀 , 然后他 Slack 里发的这些消息啊 , 然后一旦发现他比如说承诺和别人要去某天某时某地见一个面 , 就会自动创建这些日历的这个事件 , 然后就会让他回复的这个更及时, 就很少会忘事情 , 就不像以前 。
另外的话呢 ,他自己也在这个很多什么 WhatsApp 呀 、Signal 群里面 , 每天都是上百条消息 , 可能对于咱们国内大家来说可能是微信群更多 , 然后他就用这个 OpenClaw 呢 , 每天给他生成这个群里面的摘要 , 这样他就可以把这些吵闹的群啊静音啊 ,但是也不 miss 这个重要的消息 。
然后他还有几个有意思的生活里面的 use case, 比如说价格监控啊 ,他之前同时追踪 30 多个这个商品的价格 , 然后他现在都可以用 OpenClaw 帮他完成 , 还能帮他去做旅行规划呀 , 判断一下这个酒店通过酒店的照片 ,以及他的个人偏好 , 看看哪个酒店应该去订啊 , 包括还有一些餐厅定位啊 , 然后拍一个冰箱的照片 , 整理一下里面还有什么东西 , 更新他的购物
清单 , 像这些东西他基本上都用这个 OpenClaw 搭起来了 。 不过他也是确实投资了很多的时间在把这些工作流都跑起来上面 , 所以我觉得可能呃普通人日常就是装起来 OpenClaw 的话 , 可能也没有办法很快的实现刚才我说的上面这些的应用场景的用得特别的舒服 。
哦 , 我觉得你这个深度使用 OpenClaw 的朋友 ,他讲的一些场景可能确实 Claude Code 没有那么方便做 , 或者说之前的 agent 吧 。
比如说冰箱照片 , 那就得用手机拍一下, 对吧 ? 就我觉得它得是和你的移动端结合的比较紧的一个交互方式 , 比如说我用手机拍一下, 我猜的啊 ,他可能发到自己的某个聊天软件里面 , 就他用这种方式喂给那个小龙虾 。
那如果你是一个电脑本地端的 , 或者一个 web 端的产品 , 这么干都不是特别方便 , 就你得用手机拍 , 然后再传 , 再干嘛干嘛呢 。
嗯 , 完全同意 。 对 , 对于一个 Claude Code 用户来说 , 这个就很烦了 , 对吧 ? 你得先手机拍照 , 如果你是电脑 terminal 的话 , 你先在 AirDrop 到电脑上, 电脑上再扔到那个 terminal 里面 , 这个步数就很多 , 你可能就不太会去用 。
所以这个确实 OpenClaw 会更方便 。
对 , 所以 OpenClaw 自己 GitHub 上它官方里面给自己说的那个定位也是叫 personal AI assistant, 个人 AI 助理 。 嗯 , 我觉得它有点那种跨工作和生活的趋势 。
嗯 , 嗯 , 你自己用了一周之后你就你就不用了 ,是是因为你没有啥生活上的需求是吗 ? 你主要就是在工作 , 所以你觉得用电脑就够了 。
这么一说 , 我觉得可能确实是这样的 。
哦 , 之前我们也交流过一个事了 , 就是说 OpenClaw 在中国特别火 , 然后在美国其实没有那么出圈 , 就它的中美热度是有差异的 。
包括前段时间哈萨比斯的传记作者 , 就是马拉比 ,他来中国推广他的新书嘛 , 然后在一个圆桌上他也参加了 ,他就提到说美国的十次对话里面有九次都是不会提到小龙虾的 ,但他来了中国之后, 每个人都在问他小龙虾 。
你可以讲讲你就你在那边的感受是什么 , 包括你觉得为什么两边其实热度上会有这样一种差异 。
嗯 , 我觉得在硅谷的话 ,OpenClaw 当然也是非常火热的 。 我觉得 Peter 有成为新一代这个教主的趋势 ,不过我感觉硅谷的这些 researcher 们确实不太提 OpenClaw,因为可能对他们来说技术上没有什么新东西 。
我觉得硅谷的话呢 , 就是像这种 indie 的 hacker, 然后像创业者社区的话呢 , 我觉得可能会更关注 OpenClaw 一些 ,因为它可能代表了一种新的这个分发方式 。
啊 , 我个人觉得中国热度可能更高 , 可能有几个可能性啊 , 一个是中国用户本身对这种聊天优先的产品可能天然有感觉吧 ,因为我们都被这个微信生态培养出来这个习惯 。
第二的话 , 我觉得可能也是国内像 Claude Code 呀 、Claude Cowork 呀这些软件可能疯得比较厉害 , 所以大家可能平时用起来会比较费劲 , 可能所以这样开源的这个选项可能就会更火一些 。
另外我觉得还有一个就是性价比这个问题 , 就是说中国用户可能还是对比如说这个成本啊会可能更敏感一些 , 所以刚好这个中国的模型又便宜又好用 , 开源模型 , 所以像这个 OpenClaw 呢和这个国产模型呢 , 就形成了一个很好的天然组合 。
最后我觉得还有一个原因就是本身这个名字起的很好 , 对吧 ? 就是龙虾这个词可能非常对中国人的这个胃口 。
嗯 ,因为这边其实有很多普通人也是非常想用小龙虾的啊 , 包括我之前给你讲过一个新闻嘛 , 就是说在闲鱼上你可以 500 块 、1,000 块找到人来帮你上门安装小龙虾 , 就是它是非常扩散的 , 它不仅是搞 AI 和什么搞技术的人在讨论这个事情 。
我想知道就是在你那边的感受是什么 , 就比如说一个设计师或者一个销售人员 ,他们会用小龙虾吗 ?
会知道这个东西吗 ?
我觉得我听到的比如说设计师的话呢 ,他们现在可能用的更多的还是说 Figma Make 呀 , 然后 Google Stitch 呀 , 然后有一些设计师自己开始用 Claude Code, 然后像这个销售或者做 go-to-market 的人 ,他们现在就是 Claude Cowork 用的比较多 。
我听说有公司比较离谱 ,是他们要求自己的非技术人员也开始搞这个 hackathon 了 , 就这个黑客马拉松 , 然后就是用这个 Claude Cowork 来自动化他们内部的这些销售啊这些流程 ,但是用 OpenClaw 的会比较少 。
所以在美国可能就是它扩散到更多工作群体的是 Anthropic 的产品 。
对 ,Anthropic 呀 , 然后呃像设计师的话可能会更垂直领域一些 , 就是 Google Stitch 还有这个 Figma Make。
嗯 , 对 , 你刚刚也提到说那个 OpenClaw 和中国的开源模型有很多结合 , 这个确实有一些数据上的反应 , 就是我看 OpenRouter 上最近一个月的数据 , 就大概是从 2 月二十几号到 3 月二十几号吧 ,因为它是专门有不同的应用对模型的消耗的 , 然后在 OpenClaw 这个应用里面 , 还在前十的大部分都是中国的公司 。
嗯 , 最多的是街越 , 街越 3.5 Flash, 然后是 MiniMax M2.5, 呃 , 后面有 Kimi K2.5, 还有 Jeep 的 GLM5, 包括小米的新模型最近也上搒了 。
嗯 , 我觉得可能便宜还是核心原因吧 ,但我觉得背后可能也可以多给大家讲讲后面的故事 , 就是 Peter 最早他用的也是 Claude,但是被 Anthropic 封了 , 然后他就转向了这个 MiniMax, 然后发现这个成本只有这个 Claude 的 5%, 然后他就开始公开安利 MiniMax, 相当于带动了整个生态 ,因为他最早的项目也叫 Claude Bot 嘛 , 就是基于 Claude 做的 , 然后但是 Anthropic 他就是水火不容 , 就先给他发了一个这
个商标侵权的律师函 , 然后在 1 月 9 号的时候呢 , 又直接从这个服务器端然后封掉了 ,他通过这个 Claude 订阅跑 OpenClaw 的这条路 。
所以呢 ,Peter 就在 1 月 12 号的时候就公开发帖说这个 , 哦 , 我现在开始正式向大家推荐这个 MiniMax over Anthropic, 然后只有这个 Anthropic 5% 的 cost, 然后后面他 2 月份他自己就加入 OpenAI 了 。
就这个 MiniMax 的 M2.5、M2.7 大概呢 , 输入 Token 是 0.2 美金 , 然后输出是 1.2 美金 per 100 万 Token, 然后 Claude Open 4.6 的话大概是 5.25, 基本上就是一个 20 倍的差距 。
所以啊 , 大家算了一下以后发现基本上之前是如果用 Claude 这个订阅 200 刀 , 基本上换成 MiniMax 以后每个月变成 15 刀 。
我觉得这个 agent 的场景还是对成本是非常敏感的 ,因为一个复杂的任务的话 , 动辄就调用这个模型几十次上百次 ,而不是说一次简单的对话 。
所以成本差 20 倍乘以这个调用次数 , 我觉得差距还是非常大的 。
而且我觉得 OpenClaw 这个产品就是我自己的一个观察 , 我觉得这个形态本身不是特别符合 Anthropic 的审美 ,因为它显然看起来安全风险比较大 , 然后 Anthropic 它不管做什么 , 就它会一直强调说就这个组织这个公司是很在意安全的嘛 。
所以我觉得这可能是也是为什么就是 Claude Code 其实已经推出很长时间了 ,因为从 25 年 2 月就开始测试嘛 , 然后大概应该是 5 月左右吧正式推出来的 ,但他们一直没有卖到就是我直接比如说进入你的手机 , 然后可以让你给他很多权限的这一步 。
当然我觉得小龙虾的热潮之后 ,其实那个 Anthropic 有些变化 , 这个我们之后可以展开聊 。 嗯 , 嗯 , 然后就说到你刚刚说的这个模型 ,其实在这个 OpenRouter 上的排行里面 , 前面确实大部分都是中国公司 , 然后也会有 Claude Ops 4.6,也有 Gemini 3 等等 ,但有一个还挺新的面孔 , 这个模型叫 Trinity Large Preview。其实我之前不知道这个模型 , 然后我后来查一下这个背后是个美国公司叫 Accra AI, 我不知
道你知不知道这个公司的情况 , 如果如果你了解的话你可以稍微讲讲 , 这是个新的公司吗 ?
呃 , 这个公司其实在美国的讨论度不是特别高 , 然后他们大概融资呢 , 融了这个 50 个 million 啊 ,5,000 万美金 , 然后从零训练了一个 400 币的系数的 MoE 的这个模型 , 然后大概有 13 币的这个激活参数 ,是开源 2.0 的一个 license, 大概花了 20 个 million 训练这个模型吧 ,但其实它好像冲上这个 OpenRouter 排行搒的原因很简单 , 就是它在 preview 期间是完全免费的 , 所以相当于是 0 块
钱 per million Token, 所以它的这个用量很大 ,但是不代表它的质量很好 。 我看就是社区的这个投票里面 , 好像还是 Kimi 的这个 2.5, 还有这个 GLM 其实排名好像都要比它的那个 Trinity Large Preview 要高一些 ,其实感觉变成了一个模型厂商的一个战场吧 , 就是谁的模型在这个 agent 的场景下跑得好 , 然后又便宜 , 谁就能吃到这一波巨大的流量 。
嗯 , 对 , 包括中国的一些公司动作会非常快嘛 , 像智谱它甚至就刚刚推了一个新的模型 , 它叫 GLM5 Turbo, 然后他们说这个模型就是专门面向 OpenClaw 这个场景去优化的 。
对 , 我身边看到了已经不少朋友开始在这方面就是想这个创业的点子 , 就是有没有一些啊小模型或者说专用模型可以服务这个 OpenClaw 整个这个生态闭环里面的某一个小部分吧 。
你觉得这种创业点子或者说这种创业想法它会比较持续吗 ? 因为我也跟人讨论这个问题啊 , 比如说有的人就会认为那些拥有最强的大模型的公司 , 它也没有理由没有最强的小模型 ,因为你有大的模型其实你也可以做小参数的版本 。
嗯 , 啊 , 我觉得这个做这些创业的人呢 , 可能每个人想法也不一样啊 ,但是我觉得可能有一个思路的话呢 , 就是说这里面因为现在啊每个公司其实也他这些大公司也在收购这些啊小公司 , 所以其实如果你要是能有一个地方能够啊打出自己的品牌 , 然后能够吃到这波流量的话 , 啊其实也有很好的退出的这个机制 。
嗯 , 那我觉得这是挺硅谷的一种创业的想法 , 我觉得至少在中国被收购退出不是一个特别多或者特别通畅的一个路吧 。
嗯 , 对 , 可能大家的支付意愿还是会低一些 。
前面讲的是 OpenClaw 比较火和它一些创新的地方嘛 ,也稍微讲到了一些就是它不太成熟的地方 。 如果更完整的描述的话 , 你觉得它现在比较不足的有什么呀 ?
短板与影响22:28
我觉得可能三个点 , 嗯 , 第一个点呢就是贵 , 第二个点的话呢就是有的时候不太稳定 , 尤其是长任务 , 第三个的话呢就是安全还是一个很大的问题 。
贵的话呢 , 我可以举个例子啊 , 就是我有一个同事嘛 , 然后他用这个 OpenClaw 帮他注册了一个新的 LinkedIn 账号 , 然后过程中呢可能是调用了 Opus 的这个 computer use 的能力啊 , 然后最后就花了 20 美金 , 那这个只是注册一个账号的这么一个任务而已 。
所以可以看到就这个成本堆的还是非常快的 , 所以现在这个日常的高频实验 , 尤其是你要是追求这个效果 , 然后用好模型的话 , 然后就成本还是非常吓人。
安全的话 , 我觉得还有一个很有意思的故事啊 , 最近就是 Meta 的这个 MSL 他们的超级智能实验室的做 alignment 对齐的这个负责人 ,他呢在 Twitter 上 share 了他的一个恐怖片故事吧 , 我觉得他的工作就是他给 OpenClaw 的任务是接入了他的真实的 Gmail 邮箱 , 然后告诉这个 OpenClaw 呢 , 你来帮我整理我的邮箱 ,因为他有大量的邮件他自己都没有看 ,但是呢你在做任何操作之前呢要先跟我确认
啊 , 这个看起来是非常的这个安全的对吧 ,但是这个 agent 呢在处理他的这个邮箱的时候呢 ,因为邮件实在是太多 , 所以这个 context window 这个上下文呢就爆炸了 , 然后这个上下文一旦被塞满了以后, 这些 agent 现在都会做一个事情 , 就是自动压缩上下文 , 然后呢把这个上下文塞满了变成一个简短的总结 , 然后这样他可以继续去工作 。在总结的过程中呢 ,他就
把做任何操作前要先和我确认的这个安全指令给默默的丢掉 。 嗯 , 然后呢这个 agent 就开始疯狂的删除他的没有读过的这些邮件 , 然后他就在这个手机上疯狂的给这个 OpenClaw 打字 , 就是说立马停止 ,不要这么做 ,但是这个 agent 他这个 agent loop 里面完全无视 , 所以他只能冲到自己的 Mac mini 那去 , 然后就拔网线 , 像这个拆炸弹一样 , 那最后他还是有大概可能
几百封邮件被删除了 , 然后事后他还和 OpenClaw 对话复盘这件事情 , 然后 OpenClaw 还非常坦率的就是承认了自己的这个失误 , 就是 that was not okay, 哈哈 , 对吧 , 这个是我觉得这个非常有意思 , 尤其是一个就是说你看这个在 MSL 做安全和对齐的负责人, 然后自己也会遇到这样的这个安全问题 , 我觉得还是一个很有意思的一个事情 。
嗯 , 我觉得你描述的这个场景特别有意思 ,因为它有很多那种动作片的要素 , 就像一个赛博版本的生死时速 , 就是纪录里维斯演的 , 我不知道你看过那个没 ,在那个公交车上 。
嗯 , 就最后你得去争分夺秒的解决这个危机 , 对吧 , 我又得在手机上打字 , 然后又得冲到电脑面前 , 所以最后这就给他捅了个挺大的娄子了 。
对 , 挺大的娄子 ,但我觉得我还挺敬佩他 , 就是说作为这个安全负责人, 然后能把自己重招的故事分享出来 , 还是挺有勇气的 。
但我觉得他的这个案例也说明一个问题啊 , 就是说现在 AI 呢在长时间工作中反而会变笨 , 这个我觉得是个很大的问题 。
当然现在目前是因为这个 context 上下文有限啊 , 这样这个长任务中上下文被压缩 , 重要指令被丢弃 , 这样有的时候你跟他合作越久呢 , 你会觉得他反而越不可靠 ,因为他的这个记忆其实可能有的时候没有人的记忆好 。
所以这也是为什么就是后面我们可能可以聊到 , 就是说这个啊持续学习 , 我觉得还是一个非常重要的一个研究方向 。
当前的模型的话 ,其实它没有真正的这个长期记忆 , 只有这个不断被压缩和遗忘的这个短期上下文 。
嗯 , 那从现在就是他的这些不足来看的话 , 业界有什么去完善他的这个体验的努力吗 ?
呃 , 我觉得 OpenClaw 呢 , 它从 3 月份开始就是自己发了挺多新版本吧 , 然后 3 月 22 号的时候其实也是一个相对比较大的一个版本更新 , 然后呢主要还是可能几个方面吧 , 一个方面的话呢 , 我觉得他做了一些安全上面的加固 ,他做了新的做了执行的 sandbox 来防止 agent 执行一些比较危险的代码 , 包括就是在这个下面的运行环境里面去插入一些安全环境变量啊 , 然后包括去验证这
个 webhook 的签名啊 , 然后还有完整的密码的管理的 CLI 啊 , 像这些我觉得都是之前一些大家实实在在被安全性坑过以后遇到的一些问题 ,他们在解决 。
所以安全是一个方面 。 第二个方面的话呢 , 咱们刚才提到的这个例子里面 , 就是这个上下文压缩也出现一些问题吧 , 所以他现在也把这个上下文压缩做成了一个插件 , 相当于可以替换第三方的这个上下文这个压缩策略 。
所以现在社区也有叫做 looseless clone 像这样的无损的压缩的插件 , 然后另外的话就是多 agent 协作呀 , 然后他的自己的这个插件的这个这个或者 skill 的这个 marketplace 呀 ,他叫 Claude Hub 啊 , 都做了一些改进 。
呃 , 关于 OpenClaw 的更多影响 ,有一个讨论很多的话题 , 就是新的这种 agent 的应用对传统的 SaaS 就是云端软件的冲击 。
比如说有一种比较极端的说法 , 就是觉得 SaaS 可能已死 , 嗯 , 就会被完全替代掉了 。 你可以讲讲就是你是怎么看就是 SaaS 接下来的变化的 , 包括你之前自己创业你做的那个应该也是一个 SaaS, 对吧 ?
对 , 对 , 对 , 我觉得这个大家很多创业的人其实国内创业的都知道 , 就是在国内做 SaaS 是一个非常难的事情 。
那这个逻辑的话呢 , 就是因为大厂呢 ,他其实有钱去招这个程序员 , 可能工资也不是特别高 , 对吧 , 相相对成本来说 , 那我就可以我自己需要什么软件我自己去写就好了 。
那这是之前的 , 我觉得可能国内做 SaaS 啊 , 可能最后都会做成一个咨询公司 , 或者说一个外包公司 , 然后做很多这个定制化的开发 , 对吧 , 那现在的话就是同样的事情可能会发生在全球范围 ,也就是说现在大量的这个 AI 的 coding agent 其实起到了就是相当于一个怎么说廉价程序员的这么一个角色 。
那么如果要是这个事情在全球范围内发生的话 , 那可能当时中国 SaaS 比较难的这个逻辑可能会应用到全球范围内 , 对吧 , 就是相当于美国现在其实相当于也出现了廉价的 AI 劳动力嘛 , 然后呢现在的话就是大家都可以去自己 vibe code 或者去你需要什么软件 , 我为什么要花几万或者几十万一年我去购买 , 你我直接这个 Claude Code 我给我自己 vibe code 出来一个 ,
对吧 , 省下来未年我未来所有年的价格 。 所以这个事情我觉得逻辑上是能说得通的啊 , 未来的话呢 , 像这些传统的这个 SaaS 公司 ,他们的 margin 可能会可能他们不会消失 , 对吧 ,但他们的 margin 可能会下降到就是说用户对比一下我自己 vibe code 的这个成本可能是相当的 , 或者说略高一点 , 那我可能会选择你的服务 , 那就不再会是以前那样一个大家都认为 SaaS 是一
个很好的一个商业模式 , 可能能够达到百分之八九十的这种 margin, 可能未来就不会是这样的一个格局了 。
哎 , 你刚才那个总结挺有意思的 , 呃 ,AI coding agent 让工程师红利从中国蔓延向全世界是吗 ? 然后把全球信息市场都都中国化 。
对 , 全球信息软件市场中国化 。
嗯 , 好吧 , 就大家都进入 hard 模式啊 。 你觉得 OpenClaw 打开的这个方向 , 就类似于你前面说的 , 就 Devin 他指了一个方向 ,也就是个人 AI 助手啊 , 或者说是这种更灵活的 agent 吧 ,他接下来会进入一个什么样的局面 ?
因为我们现在看到不少大公司也在进场 , 包括最近英伟达在 GTC 上, 黄仁勋也是说 26 年是 agent 的元年, 然后他们自己搞了一个 Nemo Claude 的企业 AI agent 的平台 , 然后 Cloud Cowork 最近也是有一些 , 我觉得你可以说它变得更像 OpenClaw 的一些更新版 。
大厂入场29:58
对 , 我觉得 OpenClaw 就是是一个灯塔 , 那它绝对不是终点 , 就像曼奇说的 , 就是大公司基本上已经全面进场了 ,并且我觉得他们就是各有各的打法了啊 , 像 GTC 这个老黄说这个 OpenClaw 是一个下一个 ChatGPT, 对吧 , 然后 Nemo Claude 的话呢 , 本质上呢就是 OpenClaw, 然后加上他说的企业级的这个安全层 , 就他们也有这个 open shell 的这个啊沙箱啊 , 然后你可以通过写这个 YAML 文件来控
制 agent 能碰哪些数据 , 能碰哪些 API, 能 access 什么样的网络 , 然后包括他还有一些审计追踪的这些企业级的功能 。
对 , 像这个我觉得是啊 Nvidia 他们的这个一个策略 。 那像 Anthropic 的话呢 , 我觉得基本上啊 ,他们应该还是受到了很多 OpenClaw 的启发 , 你可以观察一下他最近的产品的这些 Claude Code 的这些更新 , 基本上我觉得是走在抄袭这个 OpenClaw 的这个路上吧 。
可以举几个例子啊 , 就是像 Channels 他们首先加入了 , 就是你也现在可以通过这个 Telegram 呀 ,Discord 呀 , 来给 Claude Code 这个发消息下指令 , 然后像这个 remote control, 你可以就手机远程操控你电脑上跑的这个 Claude Code, 然后呢 ,computer use 也是最近新加的 , 就他能现在 Claude 他能控制你的鼠标键盘屏幕 , 然后呢 , 这样的话就不光是写代码 , 还可以浏览网页 , 打开 app 做任意的这个桌面操
作 , 然后包括他的定时任务呀 ,也是他 3 月份新加的功能 , 还有这个 dispatch 呀 , 就相当于一个常驻的这个 AI 管家 , 能够自主启动和协调多个 Claude Code work 干活 , 那这些基本上都是我们在 OpenClaw 之前看到的这些功能 。
所以过去我数了一下 52 天 ,他们发了这个 74 个功能 , 基本上大部分是朝着这个 OpenClaw 这个方向在走 , 这个我觉得是 Anthropic。
像 OpenAI 的话 , 那就是直接下手就把 Peter 这个给买下来了 , 虽然目前加入以后还没有公开他们的产品啊 ,但我觉得他应该是啊明显就是后面的话应该会有一个 OpenAI 版本的和他们自己的这些啊之前的这个 agent ChatGPT agent team 相结合的这么一个产品出来 , 我觉得应该是可以预期的 。
为什么没有这么快呢 ? 就你刚说你看 Anthropic 52 天 74 个功能 , 那我觉得迭代速度非常快 。OpenAI 确实 Peter 加入以 AI 行业的这个时间来说 , 我觉得也算不短的时间了 , 可能有不到两个月吧 ,但我没看到什么动静啊 。
嗯 , 这块我个人的感觉哈 , 啊 , 还是 OpenAI 的经历现在稍微有点分散啊 , 我感觉他们自己可能也意识到这个问题 。
对 ,因为其实和 OpenClaw 这个热潮相关的一个是 , 就刚才您讲到的 Claude Code, 它有很多更新 , 对吧 ,有人会认为其实 Anthropic 它在杀死这个比赛 ,也许它最后会获得这个竞争胜利的成果 , 然后 Anthropic 能做到这个 ,也跟他之前将近一年的时间 Claude Code 它慢慢的一个积累和发展是很有关系的 , 然后这又影响了 Anthropic 和 OpenAI 的一个竞争的格局 。
呃 , 我觉得可以先讲一讲就是 Claude Code,Claude Cowork 和 OpenClaw 的对比吧 , 比如说它的用户分布会有什么差异 , 然后因为现在两边都更新的比较多嘛 , 那实际上就是呃 , 你觉得谁可能在体验上是更胜一筹的 ?
嗯 , 我觉得对于开箱即用的体验来说 , 啊 ,Claude Code 和 Claude Cowork 肯定是要比 OpenClaw 就是好用了 ,但我觉得现在可能就是他们还是针对不同的这个用户群吧 。
像 Claude Code 呢 , 我觉得它的初始客群呢 ,是专业程序员的一个深水区工具 ,OpenClaw 的话呢 , 可能是面向大众的一个潜水区入口 。
我觉得 Claude Cowork 呢 , 相当于是介于两者之间 , 啊 , 可能是连接这个深水区潜水区的 , 我觉得 Anthropic 的一个桥梁 。
所以我感觉这个 Anthropic is killing the game 这个说法 , 我觉得还是啊有一些道理的 。
嗯 , 哎 , 那他们有种相向而行的感觉啊 ,Anthropic 是先从就是比较专业的人群 , 然后比较难的一些场景开始做 , 对吧 , 然后你从 Claude Code 然后到 Claude Cowork,其实它的面是在扩大的嘛 , 然后 OpenClaw 因为它一开始就能放到什么 WhatsApp、Signal 里面 ,其实它一开始的打击面就挺广的 。
嗯 , 交互上的打击面挺广的 ,但是我我知道就是它这个东西 , 如果你要装原始版本挺麻烦的啊 , 比如说我自己可能就是也是感谢中国公司的努力和勤奋啊 , 就比如像 MiniMax 和 Kimi,他们都搞了很多那种云端的 Claude 版本 , 那个装起来还是比较方便啊 , 就我自己有去试那个 ,但我试过人中间也发现它也有很多问题 , 比如说我上周跟他聊过的事情 , 这周他
可能就不记得了 , 就他的记忆是有些问题的啊 。
嗯 , 对 , 我觉得云的版本我觉得可能有一个问题是很多这个 OpenClaw 的价值可能还是说啊 ,他有你所有的这些信息 , 然后他能 access,他能访问整个生态 , 对吧 ,因为我觉得像我自己是个苹果用户吧 , 我是 iPhone, 然后我是 Mac, 那么这他如果要是 OpenClaw 装在我自己的这个电脑或者 Mac mini 上的话呢 ,他可以 access 我的 iMessage 啊 , 然后像我的 Notes, 像这些苹果封闭生态里面没有 API 的这些东西 ,他
都可以访问 。 我觉得这个其实当时在我自己试用的那一周里面 , 对我来说还是一个很好的一个用户体验 。
哎 , 那我可以提供另一个视角的用户体验 , 就比如说因为我的工作是很多都是文档类的工作 , 文案类的工作 , 所以我有很多东西我确实就是在飞书上 ,而且反而就如果我装一个本地版的 , 就是他要去看我飞书里的一些东西 , 我觉得也很麻烦啊 , 就飞书里已经能解决我很多工作场景要干的事了 ,但是可能就做程序做开发 , 然后做产品就每个人又不一
样啊 。
对 , 对 , 对 。
所以我觉得飞书这种 all in one 的一个办公平台和小龙虾结合 , 和这种形态结合还是挺有潜力的 。
嗯 , 确实 。
巨头对决36:16
这个话题再延伸一下的话 ,其实就是 Anthropic 和 OpenAI 的一个对比啊 ,因为 Q1 的话 , 我觉得也正好是这两家公司的市场预期发生比较大变化的时间 。
我自己的感受是现在挺多人是挺看好 Anthropic 的发展的 , 你你的整体观察是什么 ?
我觉得这是个关键节点吧 , 可能是一个就是说 Anthropic 从以前是大家认为是技术上受尊敬的一个挑战者 , 变成一个真正威胁 OpenAI 的这个同等甚至是更强的一个对手的一个季度 。
我觉得可能核心的驱动力并不是说模型上 Anthropic 大幅领先 OpenAI, 还是说而是说产品力上的这个领先 。 过去这个季度的话 ,Anthropic 的收入的增长其实非常疯狂的 , 它大概是以每个月 5 个 billion 的这个速度在增长 。
对 , 像 OpenAI 的话 , 可能就是去年从 210 亿啊 , 然后增加到了这个 250 亿 , 这是过去可能从去年年底到现在 , 所以它的增长其实是相对 Anthropic 它是在放缓的啊 。
我觉得一个关键的一个差异呢 , 就是能够看到 Anthropic 大概 70% 到 75% 的收入呢 , 都来自于它这个 B2B 啊 , 然后这个 API 这边的收入 。
而 OpenAI 的话呢 , 它可能会更加的多元化 , 可能有的时候会更依赖这个消费者的订阅 。Claude Code 的话呢 , 我觉得是一个啊 Anthropic 的这个杀手级应用吧 , 现在大概是一个 2.5 billion 的一个 AR, 然后超过了这个 Cursor 的两个 billion, 基本上现在已经是可能开发者界的这个老大哥了 。
对 , 这也是一个 Anthropic 的一个核心的啊增长的这个引擎 。
嗯 , 对 , 就我可以补充一下, 就你刚说的那个 Anthropic 的收入 , 就它的绝对数字的话 ,在 25 年 12 月 Anthropic 它这个算的都是 AR 的口径啊 ,是 90 亿美元 , 然后到 26 年 3 月初的时候就是 190 亿美元了 , 就相当于不到三个月的时间有 100 亿美元的增长 。
然后 OpenAI 这边的话 , 它 25 年底是 214 亿美元 , 然后 26 年 2 月是 250 亿 , 所以从绝对值上之前是 90 亿和 214 亿 , 对吧 , 然后现在就大概 2 月 3 月的时候 ,Anthropic 是 190 亿和 OpenAI 的 250 亿 , 就直观上它就已经体量上就差不多了 , 就它的增长追的是很快的 。
你刚才提到 Cursor, 我觉得这个也是一个值得展开下的话题 。 我最近就是见一些比如说编程工作比较多的一些人啊 , 然后就会有人跟我提到说可能自己一年前是 Cursor 的很深度的用户 , 就是会买 200 美元那一档 , 会给他付很多钱 ,但是最近已经很久没有打开 Cursor 了 , 就已经完全转投 Claude Code 了 。
而且我也知道就 Cursor 可能在 25 年上半年的时候应该是硅谷非常火的一个雇主 , 就是很多人都想去这个公司工作 , 对吧 , 就大家觉得它很有前景啊 ,但现在看起来就是这个产品的竞争力 , 我觉得还是受到 Claude Code 很大的挑战啊 。
你可以讲讲就是你的感受是什么 ?
嗯 , 我我觉得那短期可能对 Cursor 的 revenue 影响不大 ,因为大量的美国开发者还在从 GitHub Copilot 迁移过来 ,但我觉得长期来看的话 ,Cursor 的窗口应该是在收窄的 。
而短期 revenue 影响不大的原因是像很多这个美国的大企业哈 , 就像什么 MiniMax 呀 , 像这种银行呀 , 像 Citi 呀 ,Citi Bank 呀 , 然后 Capital One 啊 ,他们这些开发者我知道他们还在用这个 GitHub Copilot。
那么他们的迁移路线呢 , 我觉得大概率是先迁移到比如说像 Cursor 这样和 Copilot 比较接近的这个用户体验 , 那是更好的用户体验 , 然后再往这个 Claude Code 或者 CodeX 这边去啊迁移 。
所以我觉得 Cursor 短期的话还是有很大的这个增量市场 ,但是 Claude Code 它这个增速这么快 , 所以它长期的话呢 , 我觉得 Cursor 它最大的价值还是它的这个数据 , 就它这个海量的这个高质量的工程的这个轨迹啊 。
所以它实际上是说能不能利用它的这个数据之前的数据优势能够提升他们自己的模型的这个 coding 能力 , 然后呢去做更多的这个 continue 的这个 pre-training 啊 。
但是目前来看的话呢 , 就是它这个时间窗口啊 , 可能已经快要关闭了 ,因为这 Claude Code 它自己的这个 revenue 和这个上面都已经追上来了 。
所以我觉得长期来看 ,Cursor 确实是会比较危险 , 它的自己的数据护城河也在被侵蚀 。
按照你刚才说的美国大公司的编程人员的这种迁移路线 ,因为 Copilot 是微软的产品嘛 , 所以微软就是确定的在这块是一个收缩的状态 , 示威的状态 。
基本上是这样的 , 就是前应该这个事情应该发生挺久的 , 可能去年还是什么时候的一个时间点 ,他们好像大幅的降低了这 GitHub Copilot 的这个定价 , 那个时候开始我觉得他们就已经意识到自己的产品竞争力不行了 。
嗯 , 然后因为以前 OpenAI 和微软是有很多合作嘛 , 包括 Copilot 也有很多 OpenAI 的支持 ,但是现在显然两家已经有点渐行渐远的感觉了 , 然后 OpenAI 也是主推了自己的编程产品 , 就是 CodeX, 然后 CodeX 对比 Claude Code 的话 , 你觉得它有竞争力吗 ?
包括这背后的两个最新的模型 , 一个是 OpenAI 的 GPT-5.4, 这是 3 月出发的啊 , 然后是 Anthropic 的 Opus 4.6, 这是 2 月出发的 。
嗯 , 这个在就是用编程非常多的程序员群体里 , 大家是怎么去使用 , 怎么去讨论的 ?
我可以先简单说一下就是 Opus 4.6 和 GPT-5.4 这两个模型 , 然后再来对比一下 Claude Code 和 CodeX。Opus 4.6 的话 , 它是这个 one million 的上下文 , 然后呢它当时一个比较大的一个噱头呢 , 就是它能连续的工作大概 15 个小时啊 , 然后不崩溃啊 , 就是指这个模型能够保持连贯的这种目标导向的任务执行 , 就长达就是大概 15 个小时 。
那之前的模型的话 , 可能跑几个小时就会这个丢失上下文 , 然后就远离这个目标方向了 。 然后它当时的这个 Terminal Bench 2.0 的这个也是拿到了最高分 , 然后啊 Andrew Karpathy 他这个比较火的这个 AutoResearch 项目也是优选这个 Opus 4.6 来执行啊 ,因为这个 OpenAI 那边他们在这个长任务执行的时候会有一些问题 。
然后 GPT-5.4 的话呢 , 它是几个亮点吧 , 一个的话是它这个 OS World 这个 benchmark 上面它达到了 75%, 然后超过了这个人类的 72.4%。
OS World 是个什么 benchmark? 就它是考察什么什么的 ?
对 ,OS World 考察的是这个就是 computer use 的能力 , 对 , 就是给你一个桌面吧 , 然后你一些这个任务 , 然后你去点呀点鼠标啊 , 然后各种操作 , 然后完成这个任务的能力 , 相当于是个比较啊模拟人类使用电脑的这么一个 benchmark。
然后 GPT-5.4 呢 , 它有原生的这个 computer use 能力 , 就是模型自己它能够看屏幕动鼠标 , 然后打字 , 然后啊不需要这些 web 工具的包装 。
然后呢它也把 coding 合并到它 GPT 的这个主线模型里面了 , 然后在 SpeedBench Pro 上面也是拿到了很高的这个分数 , 应该是啊 57.7%。
所以这个是两个模型大概的一个对比 。 那么对于 Claude Code 和 CodeX 的这个实际使用下来的体感差异的话呢 , 我觉得其实很多人都觉得其实 CodeX 在纯写代码能力上会更强一些 ,但是 Opus 和这个 Claude Code 它会和用户交流起来会更舒服 , 然后理解这个用户的意图更强 。
就是 Dylan Patel 在这个推特上开玩笑说啊 ,CodeX 像是一个 retarded kid supertrained on coding, 就像一个弱智 ,但是他在编程这个事情上就是花了很多时间去学习 , 然后出现特别好 。
哦 ,但是 Opus 感觉像是 AGI, 就是 Opus 才是一个比较 all around 的 , 然后你交流起来就是说感觉非常聪明的一个模型 ,但可能在编程能力上面这个方向可能略弱于 CodeX。
所以 CodeX 是达斯汀 · 霍夫曼的愚人, 编程版的愚人。
哈哈哈 , 这是个很好的比喻 。 嗯 ,其实包括我自己在内的话 , 就是很多开发者他的做法现在是我看到的哈 ,是给 Claude Code 写一个 skill, 这个 skill 呢就是说当我需要去写代码或者我需要去 review 的时候 , 我调用 CodeX 的那个 exec 来执行写代码和 review 这些代码的任务 , 然后呢用 Opus 或者 Claude Code 做这个思考和规划 。
然后我当时和这个 OpenAI 的人交流的时候 ,他们自己也发现这个也知道这个事情 , 所以他们其实也在想就是说改进这个用户交互体验 , 毕竟还是做上层对吧 , 就是相当于现在是主人是 Claude Code, 奴隶是这个 CodeX 在干活 , 那主人实际上是和用户直接这个交互的 。
呃 , 那它这个下面这个奴隶到底用谁 , 它后面它可以看谁厉害 , 它可以去改对吧 , 那主人的这个 traction 还是更强 。
所以这个 OpenAI 也在想怎么翻身这个做主人, 然后让 CodeX 这个交流能力各方面和用户的实际工作体验会更强一些 。
嗯 , 所以他们也觉得就是这是一个问题 ,是需要改进的 。
对 , 我觉得是 , 我觉得现在 coding 的核心就是不光是写代码更好 ,而是说能做这个完整的工程任务啊 , 就是这个循环 , 改 bug 跑测试 , 读日志 , 提 PR, 这整个循环它能够用户体验更好 。
我觉得这个是就是比较重要的 。
你觉得这个体验差异是怎么造成的呀 ? 是因为他们两个模型的优化方向不一样吗 ?
我觉得 Anthropic 可能在这方面呢 , 就是整个的积累可能还是啊更深一些 ,因为像这种用户体验的问题 , 它很多时候不会被一个 benchmark 就是完整的来描述 。
这里面可能有个不太恰当的例子 , 就让人感觉有点像是这个苹果生态和这个安卓的对比 , 就苹果经常你看它的这个跑分啊 , 或者它的硬件的参数啊 , 就是远远不如安卓机的这个啊硬件或者跑分 ,但是它的这个实际用户体验可能有很多人喜欢 。
所以我觉得现在有点像是这个 , 就 benchmark 有点像你的实际的硬件这些参数啊 , 那么它能部分描述你这个东西怎么样 ,但是真正的话就是大家开发者实际用起来感觉怎么样 ,其实是更重要的 。
然后我觉得这方面的话 ,Anthropic 他们做了很多 , 可能有更全面的啊优化和更好的这个数据来 train 他们的模型 。
从两家公司的发展来看 ,Anthropic 肯定是更早更聚焦在 coding 和代码上的 ,而且 Claude Code 这个产品 , 它从内测到正式推出 , 整个都会比 CodeX 要早嘛 , 所以它接触用户也会更早 。
就它可能那边积累的更多 , 比如说用户的一些使用习惯 , 一些场景 , 一些长尾的需求 , 还有一些多样化的数据可能都是更多的 。
对 , 我觉得 OpenAI 的问题呢 , 就它不是模型不行 , 我觉得他们的这个 research team 还是非常非常强的 。 我觉得他们的产品感觉上面 , 尤其是 to be 这方面 , 我觉得稍微差了一点 。
我觉得就是 Peter 加入 OpenAI 可能也是一个信号 , 就是他们觉得也自己需要去补一补 , 就是产品力这个方向吧 。
我觉得 OpenAI 的这个如果稍微对比一下哈 , 就是他们的优劣势 , 我觉得 OpenAI 的优势的话呢 , 就是一个这个更大的这个 consumer 啊用户基础 , 然后呢 ChatGPT 有非常强的这个分发能力 , 然后他们可能资金上面可能也稍微现在还是更充足一些啊 。
那我觉得 OpenAI 的劣势的话 , 就是他们这个注意力实在是太分散了 , 啥都做啊 ,ChatGPT 也做 ,API 也做 , 然后各个 vertical 的 enterprise, 然后还有是比如说 Sora,但是他们前两天刚刚把 Sora 给关闭了 。
是的 。
然后还有这个 OpenAI for Science, 那我觉得 Anthropic 的话 ,他们就聚焦的多了 , 基本上就是编程加这个企业用户 。
所以在这方面我觉得他们摸索的时间更长 , 更有心得吧 。
产品的一些感受力 , 然后这方面的一些积累 , 它是一个呃很难逾越的竞争优势吗 ?OpenAI 有什么可能能赶上来吗 ?
我觉得 OpenAI 的风险 ,他们其实内部可能已经在反思了吧 , 就是 3 月中的时候 , 应该是他们的应用的一个负责人叫 Fiji,其实他们全员会上明确说他的原话就是 "We cannot miss this moment because we are distracted by side quests."
就他们自己感觉自己有点被分心了 ,但现在是处于一个非常重要的时间节点 ,他们需要更多的去聚焦在和 Anthropic 的竞争上面 。他们自己内部也说 , 就是他们像这个 Atlas 浏览器啊 , 然后这些什么啊打广告 , 然后电商集成啊 , 然后这些东西 ,他们其实应该也是在往下砍 , 然后往这个 coding 和这个生产力的企业服务的这方面去聚焦 。
我觉得其实反过来看的话 , 我觉得 Anthropic 的风险其实就是 OpenAI 的反扑吧 ,因为我觉得 OpenAI 如果能砍掉这些 side quests 真的聚焦的话 , 我觉得战斗力还是非常强的 。
我觉得 Anthropic 另外一个风险就是我觉得 Google,其实咱们今天第一次提到的 Google,但我觉得 Google 真的是进步也是很大的 , 就 Google 在做很多把这些 AI 给集成进 Google Suite, 就是什么 Gmail 啊 ,Google Docs 呀 ,Google Drive 呀 , 然后这些啊 Google 这个 spreadsheets 呀的尝试 , 就 Google 的分发能力有可能是这几家里面最强的 。
前面说到了 OpenAI 和 Anthropic 的竞争 ,在美国的话 ,其实 xAI 还有 Google 也是大家比较关注的公司 , 可以讲讲这个季度他们有些什么变化 ?
嗯啊 , 我觉得这个季度可能对于 xAI 来说是一个灾难性的季度吧 , 啊可能因为他们有大量的这个 co-founder 离职 ,而且有一些是非常重要的 co-founder 可能是走了以后, 然后大家可能会真的会对公司的前景有一些啊失去信心的感觉的这个级别的重要的人去啊离职了 。
例如呢 ?
比如说像张国栋啊 , 然后戴子航啊 , 都是这个季度就是离职的 ,但是还有很多其他的这个人都走了 。
他们的去向确定了吗 ?
现在可能不是所有人都确定了 ,不过确实有不少人就是可能大部分人都会去其他的 lab 吧 , 然后 TBD 的话可能是吸收的数量可能最多的 。他们没有人要自己创业吗 ?
离开的人中也有人自己在创业 ,他们现在可能还在 Stealth Mode 啊 , 就是在水下期对吧 ?Stealth Mode。 嗯 , 对 , 然后这个原因的话呢 ,是去年 12 月份的时候 , 然后这个 Opus 的新的模型发布 , 然后 coding 能力大幅的增强 , 然后以及 coding agents 在整个生态中地位的提升 , 尤其是包括 Grok 自己这个模型 train 的不是很顺利 , 应该是大幅刺激到了老马 , 然后老马的话呢 , 就把这个气反正
是撒到了团队的身上吧 , 对 , 然后可能造成了这一波这个离职潮 。 所以 xAI 最近也是疯狂的招人嘛 , 然后他们各种手段 , 包括这个其他 lab 挖 , 然后收购创业公司啊 ,不过新招的这个团队的话 , 可能也是需要一些时间 , 然后磨合 , 然后来提升他们的这个啊生产力 。
所以我觉得 xAI 可能接下来追逐其他的这个 frontier labs 可能会有一些难度 。
嗯 ,Google 一季度的呃声量 , 我觉得相比它去年下半年就 90 月 11 月的时候要相对少一点啊 。 它有一个模型更新 , 就 Gemini 3.1,在 3.0 的基础上有一个新的更新啊 , 还有些什么别的动向和变化吗 ?
呃 ,Google 的模型的这个动向好像不太多 ,但他们可能在这个其他生成式模型像 Gemini 啊 , 然后这个 Veo 啊都有一些更新啊 , 就可能 Google 现在还是在是在憋大招吧 。
啊 ,不过就是他们最近这个 top quarter 也是个非常有影响力的工作啊啊 ,但我觉得我看到产品上面啊 , 就是还是有很多的进展 , 对 , 像不管是 Chrome 里面 , 现在可以很容易的去调用这个 Gemini 啊 , 然后在网页里面不管是去获取信息 , 更方便的获取信息 , 还是做一些自动化 ,他们都做的不错 。
然后整个产品线里面 , 像这个之前提到 Gmail 啊啊 ,Google Spreadsheets 呀 , 然后 Google 这个 Slice 呀 , 都集成了 AI, 所以我觉得在 Google 的产品上的尝试 , 我还是非常有信心的 。
你看好 OpenAI 的聚焦和反扑吗 ? 你觉得它会取得一个比较明显的效果吗 ?
我觉得大家开玩笑说这个 Sam 是一个 portfolio manager,他的干的活作为 CEO 呢 , 就是说他有一笔钱 , 然后我有一堆可以投的项目 , 我把这些钱投在哪里 , 然后大家说这个 Sam 是一个很好的资产管理的人啊 , 所以我觉得 Sam 如果他能够意识到这个问题 , 然后重新分配资源的话 , 我觉得应该还是啊很有希望的 。
嗯 , 所以总结下的话 , 就是在 OpenAI、Anthropic, 包括 Google 这些美国的核心 AI lab 和 AI 公司之间 ,他们现在的竞争焦点可能已经不是模型能力本身了 , 就这几家其实模型都挺强的 , 那竞争的焦点会比较转向于整个你刚刚说的应用和生态 。
嗯 , 我觉得下一个阶段竞争的话呢 , 可能关键确实不再是谁的模型更聪明 ,而是说谁的这个产品生态更深 , 然后可能会从一个模型竞争变成一个平台竞争 。
有几个点吧 , 第一的话就是说模型能力我觉得收敛 , 就这个 GPT 5.4 啊 ,Opus 4.6 啊 ,Gemini 3.1 啊 ,他们的差距呢其实是在缩小 , 然后呢 benchmark 呢也不再是这个差异化的这个来源啊 。
第二个的话呢 , 就是真正的这个竞争维度可能会到这个开发者生态 , 比如说我们之前讨论的 Claude Code 和 Codex 竞争 , 然后像这个企业的这个信任 , 就是是否安全呀 , 合规呀 , 可靠啊 , 然后以及可能还有成本的问题 , 就这个推理成本谁比较低 , 这个可能 Google 那边可能做的会更更好一些 。
所以我觉得 Google 可能也是就是不能忽略的 ,因为这个 Google 啊优势可能不在现在它的模型能力上面 ,而是在它的这个拥有的数据 , 它的这个分发 , 然后它的这个 TPU 的这个计算 , 我觉得还是很厉害 。
我觉得最后一个他们竞争的这个维度的话 , 就是除了在现有的这个范式下面去做产品上面的竞争 , 或者说生态上面竞争 , 还有就是谁能够再去突破下一个范式 , 比如说现在大家比较关注的这个持续学习呀 , 或者说递归自我改进 recursive self-improvement 呀 , 那如果哪家 lab 能够在这方面去产生一个突破的话 , 那我觉得还是可能会引领下一个时代的 。
嗯嗯 ,因为你现在说的是全球的情况 , 就你说的模型在收敛 ,是被称为御三家 , 或者说最强的那三个公司 ,他们的模型可能是在收敛 。
全球竞争54:37
那如果考虑到全球更多地方 , 比如说中国 , 现在很多模型公司也在发新的模型 ,QE 也有很多新的模型啊 ,以及一个没有发的模型 , 就是 DeepSeek-V4, 它虽然没有发 ,但是当然也都在讨论啊 。
你觉得就是把全球都放进来一起看的话 , 你觉得下一个阶段的模型竞争 , 或者说 AI 的竞争啊 , 会有什么值得关注的地方 ?
我觉得可能可以先聊一下这个现状是什么样 , 就是现状呢 , 我觉得就是所有人都感受到了 , 就是 coding agents are general agents, 就你这个模型如果 coding 不行的话 , 你是没有办法做这种个人助理这种事情的 。
所以我觉得就是可以看到这个全行业 all in 这个 coding 的这个趋势 , 然后 benchmark 的差距在缩小 ,但是实用实际使用的差距还是比较大 。
然后像这个 Kimi 啊 ,MiniMax 呀啊 ,其实他们都是在这这个 all in coding, 对吧 ? 对 , 所以然后另外的话就是啊 , 长上下文基本上现在变成标配了 , 这个 one million 上下文 , 我觉得好像之前 Gemini 刚推出的时候 , 还大家还觉得比较大 , 现在基本上所有人都已经是这个 one million 上下文 , 然后所有人呢都在做这个啊 , 就是长 long horizon, 就是这种比较长流程的这种任务的能力
, 大家都是比较比较关注的 。 我觉得这个是就是 Q1 的这么一个现状 。
嗯 , 那这些改进其实也都是为了 agent 这个最主流的场景的改进 。
对 , 我觉得很多其实都是来服务这个 OpenClaw 这个 use case。
嗯嗯 , 你觉得如果一个公司没有自己的产品触手 , 你觉得它能做好这种面向场景的改进吗 ? 比如说像 Kimi、MiniMax、 智谱 、 阙月 , 对吧 ?
他们肯定都在做自己的应用啊 , 包括自己这些都是在做自己的应用 , 当然就是用的人多不多少 , 这个可能每个公司有区别啊 。
那有的公司它是比较聚焦于做模型的 , 比如 DeepSeek, 就是它目前没有特别明显的产品动作 ,但是它也在招这方面的人, 接下来肯定会有啊 。
就是我在想 , 嗯 , 现在这个 agent 的应用变得更深入的这个阶段 ,是不是说你做模型还是就是得自己有产品出手 ?
其实很多人之前问一个问题嘛 , 就是说我们回看一下 2000 年那个互联网泡沫那个时候 , 就是当时觉得互联网这个事情要来了 , 所以就是 Cisco 这个公司应该是个非常好的公司 , 对吧 ?
然后它但是它最后就是被这个 commoditized 了嘛 。 我不知道这个的中文应该是怎么说比较好 , 被商品化了 , 就是它变成一个没有差别的商品了 , 你是这个意思对吧 ?
对 , 就是它可能很难做出差异化 , 然后它可能也很难有超额的利润 。
对 , 我举 Cisco 这个例子的话呢 , 我想说的是 , 就是现在我觉得模型厂商啊 ,他们也会担心 , 就是说如果我自己只做模型层的话 , 那我之后也面临被商品化的这个风险 。
所以我们可以看到 , 就是现在这些模型厂商 ,他们也不是说自己只做模型啊 , 大家所有人都是垂直整合的 , 从模型然后到这个开发者 , 然后到这个上面的应用 ,他们所有的东西都做 。
所以我觉得这个应该是对于模型厂商的未来的一个趋势 。
嗯 , 这个其实在在中国倒是一开始特别典型的 , 创业公司都是这么干的 , 双轮驱动嘛 ,因为大家觉得得有一个产品 , 得有商业化的 , 那个时候是认为得有商业化的方法和触手啊 。
但我觉得现在主要是你做产品这件事 , 可能本身对你模型迭代是很有用的 ,以及就是你刚刚说的 , 它从模型的竞争到一个平台 , 到一个系统 , 到生态的竞争 , 就你需要知道这些用你模型的人在想什么 。
对 , 我觉得还补充一个点的话 , 就是说因为刚才说到现在 benchmark 不再重要了嘛 ,也不是说不再重要 , 就是可能没有之前那么能代表实际用户体验 。
所以你现在如果没有 benchmark 作为你的目标的话 , 你朝着什么方向优化呢 ? 那你有如果有你有自己的这个应用 , 你有自己的产品的话 , 那其实你是有一个优化的方向的嘛 。
那你这样可以你从用户实际使用你的产品中去收集这个啊信号 , 那如果你要是没有的话 , 那就会比较难 。
嗯 , 用户实际使用产品的这个信号 , 对模型真正有用的是不是非常的稀疏啊 ? 是不是很少啊 ?
就是我想知道它是一个什么样的流程 , 可以比较高效的从用户真的这种实际的使用中提炼出一些有用的东西 。
因为也经常会有模型研发的人说 ,其实现在绝大部分人的提问都无法触及这个模型的真正的那个智能的上限的水平 , 就大家根本都提不出那么难的问题啊 。
第一个点的话 , 我觉得确实是模型在很多日常生活 , 或者说一些数字工作者的这个任务中 ,其实它的智能已经溢出了啊 , 就是其实不需要那么强的能力啊 。
我可以举个例子 , 就之前咱们上期可能也聊过这个 benchmark, 叫做 Office QA, 它是这个 Databricks 做的一个这个 benchmark, 它相当于就是啊一大堆文一大堆文档 , 然后呢它针对这些文档然后提一些问题 , 它测试三个能力 。
第一个是你解析这些文档的能力 ,因为这些文档里面这些 PDF 里面还有一些比较复杂的一些表格呀 , 然后图啊什么之类的 。
第二个的话就是你做这个召回 , 就 retrieval 的能力 。 第三个的话是基于这些信息去做推理的能力 。 那么其实模型真正负责的话呢 ,是推理 , 或者说这个 reasoning 这部分 。
那么他们发现就是实际上这部分模型已经做得很好了 , 大部分的这个失败都发生在这个解析文件和召回这些上面 。
所以相当于在这个 benchmark 上面 , 就是模型的这种推理 , 或者说这种智能 , 它已经溢出了 。 你现在需要的是解决很多其他的那个问题 , 让这个工作流能够做得比较好 。
然后回到咱们刚才的这个点 , 就是说那现在怎么能够再去让模型的这个不管是编程能力还是其他能力去提升呢 ?
啊 ,其实最近网上也比较火的 , 就是说这个 Claude 的指责 , 一些其他模型厂商去去从他们这做这个蒸馏嘛 , 蒸馏 , 对 , 所以其实他们还是说再去买这些用户实际使用啊 Claude 的数据 , 然后呢去 filter 出来里面这些比较好的用户的使用轨迹吧 , 叫 trajectory, 对 , 然后呢再去用这些轨迹再去做这个 continue 的 pre-training。
然后也有的时候的话呢 , 比如说如果我自己有一个产品 , 对吧 ? 然后我自己有一个 coding 产品 , 然后别人会用 , 或者会用我的产品 , 或者用我的 API, 那么我从这些用户的这个任务里面 , 我可以收集到一些比较好的 、 比较难的一些任务 , 然后我可以再去把这些任务喂给 Claude, 让 Claude 来做一遍 , 然后我再从这个轨迹里面我再去做蒸馏 , 或者说来提升我的
这个自己的模型 。 对 , 像这些都是一些比较常见的办法 。
这里还想补充一个和 Cursor 相关的话题 , 我觉得它也可以侧面反映模型和应用之间的关系 , 就是一季度有一个比较有意思的事 , 大家发现 Cursor 这个新模型的背后 ,其实是用了 Kimi 的 K2.5,而且他们最开始没有去宣告这个事情 ,因为按照行业惯例 , 如果你用了一个开源的模型 ,在上面再来做自研 , 应该是要说一下的 , 对吧 ?
你可以讲讲大家是怎么讨论这个事情的 , 包括这意味着什么呢 ?
我觉得首先第一点 , 我觉得这个是一个对于就是说中国的开源模型一个非常好的一个认可啊 。 我觉得对于所有的这个中国的 AI 从业者来说 , 都是一个非常值得这个高兴和骄傲的一个事情啊 。
因为像美国相当于是啊顶级的这个 agent 的产品公司 , 那么他们会去说优先去在一个中国的一个开源机模上面去做 fine tune, 然后来让他们的主产品啊基于这么样一个模型 。
第二点的话呢 , 就是说双方对于这个事情的处理 , 我觉得也是很有意思的 。 首先是啊 , 作为这个 Cursor 这么大的一个公司 , 马上就是要在 55B 链的这个估值去融资 , 然后在开源模型使用和 license 上面犯这种低级的错误 , 我觉得还是一个很让我比较吃惊的一个事情 。
像这种时候 , 难道不是应该在开始 train 这个模型之前 , 就考虑好了这种 PR 或者 compliance 或者法律上面应该怎么去处理 ?
最后在这个公布的时候 , 都没有提到这个 Kimi 的这个名字 。 我觉得这个是怎么说 ,有的时候世界确实是一个草台单子 。
这是会是因为它是一个美国公司 , 然后在主力产品上用这个模型 , 它有一些地缘政治的 concern 吗 ? 虽然 Kimi K2.5 是个开源的模型啊 , 就理论上我觉得是 , 技术上和数据上肯定都没有这个问题啊 。
我觉得地缘政治可能会小于大家担心它的这个自研能力啊 ,因为其实很多大公司都已经之前明确说了 , 我们在使用中国的模型 , 包括这个 Airbnb 的这个 CEO Brian Chesky。
对 , 所以我感觉就是说美国公司使用中国模型这个事情 , 好像也没有那么大的引起就是美国人民的反感啊 。
但是我觉得就是他们比较担心 , 可能大家觉得就是说啊 , 那你们其实没有做太多的工作嘛 , 就是你们没有什么实际的这个自自己的这个核心竞争力嘛 , 你们去用一个中国的模型 , 然后自己在上面啊稍微这个做做 RL 啊之类的 。
就是我个人感觉哈 ,他们可能有更多这方面的这个担心 , 所以啊在他们这个发布的时候 , 可能会想更加强调一下这个自己这方面的工作 , 可能就会相对少了想去强调这个 Kimi 在其中的这个作用 。
所以 Cursor,Cursor 是旧金山孩子要脸啊 。
要脸 , 对 , 要脸 。 对 , 那后来被发现以后呢 , 我觉得啊两方的处理都是相对来说非常的体面的 , 体面的 。
对 , 一方面是我觉得 Kimi 我觉得真的是做得非常好 , 就是整个没有任何说对于这个 Cursor 的指责 , 它的官方的发布非常的正面 , 都是说哦 , 我们非常这个骄傲 , 就是说 Cursor 选择了这个我们这个开源的模型来做他们核心的这个产品嘛 , 然后也希望就是未来有更多的这种开源上面的这种合作和生态上面的这种发展 。
我觉得这个真的是非常大气啊 。 然后 Cursor 那边的话呢 , 啊也是相对来说比较快速的承认了自己的错误 , 然后非常坦诚的讲了他们是怎么去选择 Kimi 这个模型的一个过程 , 然后后面他们在 Kimi 的模型上做了什么样的工作 。
我觉得大家相对来说对他们后面的这个坦率的这个啊沟通还是比较认可的 。 所以后面的话 , 我相信他们也在下面自己去聊怎么去做这个 revenue sharing, 未来合作怎么做 。
所以啊总体来说啊是一个比较好的一个收场吧 。 啊但我觉得啊总体来说还是回到第一点 , 我觉得中国的模型真的还是做得非常的棒 。
你说到这个处理啊 , 我在想如果 Anthropic 开源了一个模型 , 然后 Cursor 用了它的开源模型 , 又没有说我用了 Anthropic, 你觉得 Daryl 会怎么反应 ?
我觉得 Daryl 肯定很难 ,不好说哈 。Daryl 的性格来说 , 可能还是会这个 , 我觉得 Daryl 还是有些脾气的吧 , 对吧 ?
对吧 , 像他之前和 Sam 在印度的时候吧 , 应该是印度的一个 AI 大会 , 我觉得大家可能还记得那个推特上非常好笑的那个桥段 , 就是那个 Moe 和拉起了 Sam 的手 , 然后所有人都要拉手 , 就是最后致谢嘛 , 啊然后结束那个会议 , 然后 Daryl 就是不和 Sam 拉手 , 全场只有他们俩不拉手 , 就把手举起来 , 然后这个大会的主办方还让他们俩站在一起 。
我觉得这个人真是太会了 , 就是想看戏 。 所以我觉得 Daryl 还是很有脾气的一个人。 如果要是这个事情发生在他的身上的话 , 我觉得可能不会像这个 Kimi 这么宽容 。
我们前面讨论的就从 OpenClaw 开始的这个讨论 , 到后面去聊 OpenClaw 和 Cloud Code,以及 Cloud Code 和 Codex, 然后这背后的 OpenAI 和 Anthropic 两家公司 , 包括模型的相关的进展 , 我觉得它都是在一个现在大家已经看到的很清晰的主线上, 就是从 coding 到 general agent 这样一个非常主流的应用 ,以及围绕它的模型和生态的建设 。
AI 自进化1:06:38
我觉得下面可以聊的就是你前面提到的另一个你觉得 Q1 很有意思的进展 , 就是 AutoResearch 软件自己的进化 , 或者说自我递归的这种迭代吧 。
因为这是一个相对比较新的方向 , 可以先简单讲讲这是个什么东西 。 你说最开始是 Andrzej Karpacki, 对他 3 月发起了这么一个讨论 。
对 , 我可以先解释一下这个 AutoResearch 的背景 , 就是 Andrzej 呢之前先做了一个偏向一个主要是教学目的的一个项目 , 叫做 NanoChat。他相当于是一个极简版的 , 就是几百行 Python 代码 , 能够训练出一个 GPT-2 级别的小模型啊 。
那他主要还是一个就给大家去学习这个从 pre-train 然后到 RL 整个流程 , 你想要 train 一个这个大语言模型是什么样的 。他做这个 NanoChat 目的是什么呢 ?
是因为他假设很多人都需要自己去模型吗 ? 我怎么感觉这个项目的受众非常窄啊 。
哎 ,但其实他非常火 , 哈哈 , 就是我觉得 Andrzej 还是一个对搞这个教育这个事情还是非常有热情的一个人吧 。
之前的话当然我觉得他有两个原因 , 一方面是他确实对把这些 AI 这些事情 , 然后让普罗大众所有人都能够弄明白是怎么回事这个事情有热情 。
第二个的话 ,他之前在一次访谈里面提到 , 就是把这些东西以最简单的方式来实现的时候 ,也能让他理解到这这些东西的本质到底是什么 。
哦 ,但是有点费曼教学法的感觉了啊 。
有一点 , 然后他在这个 NanoChat 的基础上做了一个 AutoResearch 啊 , 相当于是说让一个 AI agent, 然后比如说 Claude Code 来反复修改这个 NanoChat 其中的训练部分的代码 , 目的呢就是让这个训练出来的模型能够更好 。
那他的这个实验呢 ,其实整个系统呢主要有三个主要的文件 , 然后呢有一个文件叫做 program.md, 然后就是说人类写的这个实验指导方针 , 就是告诉这个 AI 啊 , 你的目的呢就是去修改另外是两个 Python 文件 , 修改其中的一个 Python 文件 , 然后呢想出来怎么去改进我的这个训练流程 , 降低我的这个 bits per byte,是它的这个 evaluation metric。
然后你这个流程呢 ,是你先读一下我这个 train.py 这个文件和之前的这些结果 , 然后想一个改进 , 然后把这个改进用代码实现 , 然后跑 5 分钟的训练看一下结果 , 再重复这个过程 。
所以大概的话呢 , 这一次呢大概就是你 5 分钟训练吧 , 然后再加上你写代码呀 , 应该思考这些时间大概是 15 分钟一次 , 一个小时呢就能跑 4 个实验 , 一个晚上呢就能跑大概 100 个这样的实验 , 就像一个永不疲倦的 PhD, 对吧 ?
博士生 , 然后呢你这个两天呢你就能跑几百次 , 自主的去看实验结果 , 然后想新 idea, 然后去做修改 , 然后这样的一个流程 。
然后他最后的话呢 , 大概是找到了就是 20 多个有效的这个改进吧 , 然后最后使得他这个 GPT-2 级别的小模型呢 , 从训练时间从大概之前是两小时出个头 , 然后降到了一点几个小时, 大概有一个百分之十几到百分之二十的一个提升啊 。
所以这是相当于是 AI 在没有人类指导的情况下, 自己跑实验优化自己 ,但这个事情居然能 work, 所以还是一个让大家非常兴奋的一个事情 。
感觉就是这个之前感觉有点科幻的 AI 的自我改进的这个流程 , 感觉快要能够工作了 。
不过他最开始是有一个人类指导的 , 对吧 ? 就是那个 program.md 这个文件是人类写的文档 ,不过它过程中没有人类的指导啊 。
对 , 这个 program.md 现在还是人类写的 ,但未来的话呢 ,也有可能是 AI 会来改进这个 program.md。
嗯 , 为什么这个项目很火呀 ? 我大概理解就是说它是 AI 参与 , 然后就能自己把一个 GPT-2 这样的一个模型给它呃训练时间给压缩 , 对吧 ?
对 。
这个东西如果它更广泛来说 , 未来可能会带来什么改变 ?
我觉得首先第一点 , 就这不是一个什么全新的想法啊 ,不是说这个 AutoResearch 这个想法是今天才出来的 ,但我觉得更多的是说大家惊讶于现在以前的这种梦想吧 , 快要变成这个现实了 。
因为很多人其实觉得这种 AI 自我优化 ,其实是 AGI 路上的一个圣杯嘛 。其实很多人, 包括很多公司都很早在开始探索 。
像一年前的时候 , 我当时和一个 Nano Banana Team 的一个核心 researcher 然后交流的时候 ,他就提到就 Google 内部其实就在做类似的尝试 。他们有一个东西叫做他们的 model lineage map, 就是模型祖先的这个图谱 , 它相当于是一个有向无环图 。
这个图里面的每条边上呢 , 就是每一个节点是一个模型 , 每条边上就记录了从一个模型到另外一个模型 , 或者说一个一个版本到另外一个版本 , 它做了什么样的改进 。他们的目标呢 , 就是说让这个 AI 啊能够分析这个图 , 然后呢来预测下一条边和下一个节点应该在哪 ,也就是说自己发现就是下一个最有价值的研究方向 。
但当时呢 , 可能是这个 AI 的能力还不够吧 , 就实际还不太成熟啊 ,也可能是这个模型这个 coding 的能力还不够强 。
但是现在的话呢 , 可能一年多以后呢 , 这个 Opus 呀 ,Codex 呀 ,Cloud Code 呀变强了 , 然后再加上 Andrzej 做的这个 AutoResearch 的实验 , 所以我觉得大家看到了更多的这个验证吧 。
像之前的话 ,Google 他们之前发的那个 AlphaEvolve 的 paper, 当时就是他们用 Gemini 来优化 Gemini 它自己的 kernel, 然后提升了 23% 的 performance, 然后 GPT-5.3 Codex 也是有参与自己调试自己的过程 , 包括最近这个 MiniMax 发布的这个 M2.7。
所以其实就是多个数据点在最近这几个月同时出现 , 包括 Andrzej 的这个 AutoResearch 实验 , 我觉得确实是让大家重新开始考虑这个事情是不是就是马上要发生了 。
嗯 , 那这个事发生意味着什么呢 ? 首先看起来是对人类研究员的依赖会减少 , 对吧 ? 然后刚才你也提到 , 就是他做实验的次数是可以可以大幅提升的 , 那就是说 AI 进化的越来越快 。
对 , 我觉得一句话就是说这个是加速度的加速度 , 就这个 AI 研究本身被自动化了 。
加速度 , 加速度 , 加速度的平方 。
对 。
嗯 ,但是它并不解决方向的问题 , 对不对 ? 就是跟我们前面讨论那个相关 , 就往什么方向优化的这个问题 , 或者说这也是它应该去解决的问题 。
我觉得它应该会逐渐的往这个方向走 ,但目前的话可能大家是说啊 ,在一个搜索空间里面 ,他们可能会实现非常有效的搜索 ,但是是哪个搜索空间 , 可能现在是由这种比较厉害的人类研究员来决定的 ,但未来的话它肯定是能力会逐渐变强 。
对 ,因为你刚才举的这个例子里 , 我理解就是它的一个大的目标 ,不管是压缩训练的时间 , 还是我去改一些 kernel, 然后我让它提升某些方面的能力吧 , 啊或者说我强化学习 , 我用多少是这个 AI 自己来做的 , 这我觉得它的目标还是人设定 ,而且它还是个比较具体的目标啊 , 它不是一个比较笼统的目标 。
对 , 我觉得它好像也试验了一下, 就是说这个目标如果不够具体 , 或者它修改的哪怕是修改的范围变大 , 就它这个搜索空间变大 , 现在的 AI 好像也还差点意思 。
所以如果搜索空间变大了 ,有的时候改着改着 , 然后就全部改烂了 , 然后自己都改不回去了 , 这个也是会发生现在目前这个阶段 。
哦 , 就是在那个 AutoResearch 的这个发布之后, 我看就是有些人把它用到开发软件上, 比如说这个 Spotify 的 CEO Toby,他就说把类似的方法用在模板引擎上, 然后这个模型是做了 93 次自动提交 , 然后渲染速度提升了 53%。
像 AutoResearch 这种应用 ,是不是它接下来其实对那种特别具体的软件工程会有比较多的应用前景啊 , 就在这个方面 。
对 , 我觉得就是像现在你扔给 Agent 的 Agent 自己去做优化能不能行 , 我觉得有一个重要的指标 , 就是它有没有一个清晰的可量化的优化目标 , 比如说 Shopify 这个 case, 它可能是渲染速度 , 然后它有一个快速的这个反馈的一个循环 , 比如说我每次改完一次 , 我跑一个这个测试啊 , 然后我就可以知道我是不是成功了 。
那我觉得这个在很多其他问题上的障碍呢 , 就是说可能大多数工程问题 , 它没有这么干净的一个优化目标 , 或者说第二个的话 , 就是说呃安全审查 , 这个东西它如果直接进生产环境 , 谁来审查 , 能够确保这个东西它是能工作的啊 。
第三个的话 , 就有的时候它还有一个可解释性的问题 , 就是 AI 做了一个改进 ,但是人他得理解这个改进它为什么是这么错的 , 然后它为什么有效 。
所以我觉得他觉得最适合的这个场景呢 , 还是说什么性能优化呀 , 写更好的 kernel 啊 , 然后什么数据库查询啊 , 基础设施调优啊 , 那这些有这种明确指标 ,并且可以自动验证的领域 , 我觉得扔给 AI 去做还是比较有效果的 。
我可以举一个反面例子 , 这个是 actually 是我最近室友给我讲的一个事情 , 就是他的自己的公司呢 ,他要给自己的网站加一个黑夜模式吧 ,Dark Mode, 然后他就试了这个 Devin 和 Cloud Code 两个 agent 啊 , 基本上都是运行大概一个多小时吧 , 然后每个人跑了一个多小时都没搞定 。
这个就是现在因为这个视觉这个效果验证起来还是比较难 , 这个 AI 这个模型有的时候在验证一些视觉效果的时候 , 这个性能不是特别好 , 所以它就没有办法说去判断这个改完了以后这个按钮或者文字的颜色对不对呀 , 然后在这个黑夜模式下面是不是这个按钮还有这些文字都看起来比较舒服呀 。
它这些需要人眼判断的事情 , 这个 AI 自动化循环流程它就跑不起来 。
嗯 , 就是那种验证比较主观的它就跑不起来 。
对 。
啊 , 就是 AutoResearch 这一套方法 ,因为我觉得 Andrzej Karpacki 还是给他定义的挺清楚的 ,他其实可以直接用到一些现在就现成的开发任务上 。
持续学习1:16:14
然后另一方面 ,其实从去年开始 , 整个 AI 领域也在讨论很多一些新的学习方法 , 然后它这个听起来跟自进化也比较相似 ,有很多 buzzword, 包括在线学习 、 持续学习 、 元学习 , 嗯 , 然后 AI 的自我进化 , 嗯 , 可以讲讲就是这些概念上, 或者说这些方向上现在有什么进展吗 ?
它可能是就更偏模型或者更底层的一些东西呢 。
嗯 , 我觉得可以把持续学习可能和自进化这两个现在大家可能最关注的方向可以分开来说一下, 就是说持续学习说的是什么意思呢 ?
很简单 , 大部分的 AI 模型在部署以后 ,他们的这些权重就不会再发生变化了 , 呃 , 所以他们就相当于是就定死了 。
不管说他们和用户啊做多少这个推理 , 和用户有多少交互 ,他们都不会在之后再获得新的知识或者新的技能 。
所以持续学习想要解决的问题呢 , 就是说能不能是说在部署以后, 这个模型还能够持续的获得新的知识 、 新的能力 , 或者说更了解这个用户的喜好啊 , 这个是持续学习要解决的问题 。
嗯 ,而且是要更新到权重里是吧 ? 就是它得更新到参数里才算 。
这个其实不一定 , 就这个持续学习的话呢 , 我觉得现在可能大致要有两个方向 , 一个方向的话呢 , 就是说基于这种文本的持续学习 , 比如说大家都特别熟悉的这个就是记忆机制 , 可能就是穷人版的这个持续学习吧 , 我觉得啊 , 然后还有的话就是说现在也有人在尝试 , 就是怎么是通过更新一部分权重啊 , 一般来说是一小部分权重 , 然后来
实现这个持续学习啊 。 像这方面的话 , 就是最近这个 Stanford 然后孙宇他们这个 lab 做的这些 test time training 这些工作 , 就是应该是一个比较前沿的一个探索领域 。
呃 , 你刚刚说用记忆的方式不去更新权重 ,是穷人版的持续学习 , 然后斯坦福孙宇他们做的这个一些新的尝试 , 就是更新小部分权重的是另一个方向 。
为什么前者是穷人版啊 ? 前者成本低是吗 ?
因为我们可以看到 , 就是说像现在大家写这个 skills 呀 , 然后去做这个呃 memory 啊 , 现在就是他们的好处呢 , 很明显就是一个是很容易理解 , 然后人类都可以去看这些文件是 skill 文件是什么样的 , 我的记忆文件是什么样的 , 然后很容易去做调整 , 大家用起来也比较简单容易 。
所以现在很多人, 或者说很多项目 、 很多产品都在用这样的方式来提升自己 AI 的能力 ,但也能看到它有一些啊非常明显的一些限制 , 比如说这个上下文完了以后, 上下文完了以后我要去做这个压缩 , 然后会损失信息等等等等。
所以这个的话是为什么可能管它叫穷人版的这个持续学习啊 , 就是它还是存在一些问题 。
嗯 , 就是它比较亲民 , 大家都可以用 ,但是它有它的缺陷 。
对 , 如果大家希望的话呢 ,是有一个更好的方式来做这个事情啊 , 那么就是可能会想一些手段 , 比如说能不能把这些新的知识 、 新的能力把它做到这个模型的 weights 里面 。
那么其实之前的话呢 , 呃 , 这个 test time training 这个名字听起来比较 fancy, 比较高大上啊 ,其实它也没那么复杂 。
那之前的话呢 , 可能我们已经是说做一些像这个 LoRA 这样东西去把改一小部分这个模型的权重 , 然后把一些新的知识或者能力放进来 , 对吧 ?
然后现在的话呢 , 它是说可能是我不光是说针对一些数据去做这个事情 ,而是说我可以针对用户的一个特定输入 ,在这个特定输入上面我去做一些根据这个特定输入的调整 。
所以它相当于是在这个叫做 lifecycle 上面 , 可能会和以前这种做 LoRA 呀有一些这个区别 。 对 ,但它现在相对来说呢 , 它整个运行起来也比较复杂 ,因为它相当于是在每一次去做推理的时候 , 它要去更新一小部分权重 。
那么这个对于下面的基础设施还是有一些比较大的要求 。其次的话呢 ,他们现在也只是在一些几个 billion 的小模型上面去验证了它的可行性 。
那么这个东西它能不能 scale up 到一个大模型 , 现在的模型都是几百亿或者上 trillion, 那也是一个比较验证的事情 。
嗯 , 那如果一个模型是这种机制的话 , 用的人越多 , 难道每个使用每个请求的推理它都得自己去更新一遍权重吗 ?
这个我觉得可能就是最后会看一下这个实际的应用场景 ,以及这个投资产出比是不是合算 。 比如说像 Thinking Machines Lab 他们的这个 Tinker 其实就做了这个 multi LoRA 的啊这个呃基础设施啊 , 所以当时我看他们就 Tinker 支持 multi LoRA 的时候 , 我当时就怀疑他们是想做非常大规模的一个可能是定制化 , 就是个性化的一个尝试 。
所以我觉得可能最后还是会看一下具体的应用场景需要什么样的这种定制化 , 然后需要就是是不是说需要每个人都有自己的模型可能来决定的 , 或者说有自己的模型有多大的一个价值和意义 。
嗯嗯 , 就是持续学习 。 那自进化咯 , 自进化跟这个的区别和联系你可以讲讲啊 。
我觉得自进化的话其实是和 AutoResearch 联系可能是更加紧密的 。 对 , 就是这个自进化 , 它就是说这个 AI 它能不能去啊改进自己吧 。
像这方面的话 , 最近也有啊很多的工作 , 包括这个 AlphaEvolve 呀 , 然后 Sacana 的这个 DarwinGo Machine 呀啊 ,他们都是去说形成一个循环 , 然后这个 AI 能够去想到就是说如何去改进自己 , 然后去实现 , 然后再重复这个循环 。
所以我觉得 AutoResearch 其实是应该放在这个自进化的这个框架下面 。 这也是为什么我们可能会看到一些在这种基础设施做的比较好的 lab 里面 ,其实核心的 researcher 他们其实工作量有的时候反而变小了 ,因为他们可能现在自己执行的时间可能越来越少 , 然后更多的可能是想一些更 high level 的更高级别的这个前进方向应该是什么 , 然后交给一种有自进化能力的这种
系统去做实际的执行 。
像这种方向上有出现什么新的创业机会吗 ? 你有看到吗 ? 比如新的公司 。
持续学习和自进化方面的创业公司其实最近还挺多的 ,不过很多的话呢 , 成立时间也不长啊 。 刚才咱们讨论里面提到就是 Thinking Machines Lab 他们的这个 Tinker 的 training 的这个产品 , 就是它有这个 multi LoRA 的这个准备 , 可能会为大规模的这种用户自定义来铺路啊 。
那么可以再举几个 , 就是现在可能还在 Stealth Mode 的这个创业公司的例子啊 , 比如说有一家公司在做一个很有意思的方向 ,他们想做这种学习能力特别强的小模型 ,他们的思路的话呢 ,是说现在的大模型里面有大量的参数存储的是知识和各种能力 ,但其实比如说 M1 架构吧 , 可能学习能力本身呢是少数几个专家他们来负责的 , 所以他们就想说我们能
不能精炼出一个专门负责学习能力的这种小模型 , 然后把其他那些知识没有用的东西这个扔掉 , 然后把这个学习这个能力本身抽取出来 。
然后这个模型的话呢 , 可能又特别适合用于去做这种个人助理的 , 像 OpenClaw 这样的这个下面的这个啊机模啊 ,因为它可能会非常会做去学习这个人类的学习 , 它的这个主人的偏好可能会非常厉害 。
还有一个公司的话呢 , 就是说相当于在这个当然不止一家了 ,在 scale up 就是把这个 Android 的这个 AutoResearch 这个事情以更大的规模来来实现啊 , 比如说把这个单 agent 实现这扩展成多 agent 的并行协作呀 , 然后像 Android 自己的这个下一轮的计划里面提到了很多 。
这个模型领域现在应该还有一个大的进展方向 , 就是世界模型 , 这个也是大语言模型之外很多公司在探索的一个方向 。
嗯 ,也有一些新的创业公司 。
对 , 这个方向其实创业公司也挺多的 , 然后大家可能之前嗯比较熟悉的有比如说啊李飞飞老师的 WordLab 啊 , 那他们的话呢 ,他们自己可能更偏向于 3D 世界的建模 , 然后再比如说最近这个赛宁还有 Yann LeCun 他们出来新做的这个 AIMI 公司 ,他们可能是可能会是延续之前 Yann LeCun 他在这个 JEPA 模型上面啊这个前进的方向啊 。
再比如说啊 , 现在 Google 之前 Dreamer 团队啊 ,他们的负责人这个 Daniel 啊 ,他也出来新做了一个公司 , 那他可能会更偏向就是 policy, 就是我看了这个视频 , 然后我应该去 take 什么样的这个 action, 可能会和这个 robotics 有一个比较好的一个结合 , 然后包括还有另外一家也是新出来的 , 然后这个这家的这个 founder 之前的话是这个 AutoRegressive DIT 的这个作者 , 还有 Self-Forcing 的这个作者 , 那他们的话可能
会更偏向这个环境的模拟 , 就是说我给定这个视频 , 然后它相当于 interactive video model, 给定这个视频 , 然后以及一个动作 , 那么下一步会发生什么 。
所以相当于其实是和刚才我们说的 Daniel 做的这个 policy 可能互成镜像的这么一个关系 , 然后还有别的路数 , 比如说 Nvidia 他们一直在做的 , 还有和一些物理引擎的这个结合呀 , 就是都是各个这种不同的对于世界模型也好 , 还是这个视频模型也好 , 这个探索方向吧 。
嗯 , 像这块的探索方向 , 它未来更多是用在机器人和具身智能上吗 ?
哦 , 我觉得这些模型可能接下来可能要主要可能 target 主要针对两个应用吧 。 啊 , 一个应用的话呢 , 就是这种他们叫做交互式的媒体啊 , 对吧 ?
比如说现在有人他们可能是想新的游戏范式应该是什么样的 ,是不是应该是实时生成的世界 , 然后能够根据人类或者说玩家的这个行为来生成他们的下一帧 , 或者说啊影响他们这些 NPC 啊 , 或者游戏的这个剧情啊 , 我觉得这种交互式媒体可能是他们的一个应用方向 。
还有一个应用方向的话呢 , 那就主要就是具身了啊 ,不管是说去做这个机器人的 policy, 还是说去做这个机器人模拟的这个环境 , 能够让这个机器人改进的这个 loop 跑起来 , 那么我觉得它都是呃对具身有很大的这个影响的 。
算力变化1:26:46
嗯 , 那接下来我们可以聊一下算力的变化 。 正好每年 Q1 是英伟达会召开 GTC 大会 , 然后他们会推一堆新的产品 ,也会讲一讲他们在算力 infra 层的一些新的想法和思路 。
这次 GTC 或者说最近整个 Q1 的算力层的一些变化 , 你觉得比较值得关注的动向有什么 ?
嗯 , 我觉得这个 GTC 可能大家所有人都看到的就是主题嘛 , 就是从这个训练到推理的一个转折吧 , 然后 Layer Rubin 的这个推理性能呢 , 提升了这个 3-5 倍 , 然后推理这个 token 的成本可能降了 10 倍 , 所以是非常利好这些对 token 消耗量很大的这种个人助理的大规模部署 。
然后另外的话呢 , 这个 Nvidia 去年 12 月份收购的 Grok 呢 ,也派上用场了 , 这个 Grok 的这个 LPU 相当于被集成到这个 V2 Rubin 里面了 。
然后我觉得最近就是其实非常新哈 , 这个前两天刚发生一个事情 , 就是 Google 它新做了一个工作 ,是相当于是对 KV cache 的一个改进 , 能够通过这个 quantization 能够压缩这个 KV cache, 能够降低对存储的要求 , 可能变从原来变成 1/6。
所以我个人的判断是 , 就是在推理的优化上面 , 我觉得可能还有很大的空间 。 我觉得就是如果大家被逼到这个程度的话 , 我觉得我们还能想出很多很好的办法去优化这些推理的算法啊 。
当然我觉得就是啊 , 基础设施的建设也会同步进行啊 ,但是我觉得可能像推理的这个成本性能的进一步下降 , 通过这些新的 idea, 新的这个算法 , 我觉得我们是可以预期到的 。
嗯 ,其实这又回到了就是现在竞争的主线 , 就还是和 agent 相关的 , 就是从训练到推理的转折 。 因为 agent 本身肯定会带来很多推理阶段 ,其实也就是使用模型的阶段的算力的消耗 。
我觉得就是整个推理的上下游吧 ,不管是从芯片还是上面的 infra, 还是啊 , 比如说大家说现在可能今年不是 GPU 了 , 现在今年这个 agent 要跑起来 , 然后推理这些东西要跑起来 , 相应的 CPU 可能也会出现短缺 。
所以我觉得整个生态系统应该是还有很大的空间 。
CPU 主要在这个流程里做什么呀 ?
大家现在可以看到一个趋势吧 , 就是 everything is becoming computer, 所有东西都变成一台电脑 。 以前可能是一个对话 , 现在变成一个 agent 活在一个电脑里面 , 然后这个 agent 自己还能开不同的 sandbox 去跑各种其他的任务 。
那这些东西其实都是很多时候是需要 CPU 嘛 , 就是你这个不光是模型需要去做 inference, 你还要呃你模型写了代码 , 然后去执行任务 , 你跑这些代码其实都是 CPU 来干的活 。
所以啊 ,CPU 其实最近的这个也是有一个很大的一个增长曲线 。 我看到一些做投资的朋友现在在看 , 就是怎么能够啊比较干净的去买到这个 CPU 的这个金融资产吧 。
对 ,因为很多公司它都自己做 CPU,但还有一些其他的东西 。 然后所以现在有的朋友的结论是我们应该买 ARM,因为 ARM 反正就是给各种其他人厂商他们去卖 license。
最后想聊聊 Q1 一个和技术和模型并不是直接相关 ,但也确实是被技术的发展所影响的一个现象 , 就是大裁员 。
科技裁员1:29:56
那这个事情我觉得可能在硅谷更明显 , 中国这边我觉得公司还是会更多顾虑就业吧 。 嗯 , 你可以讲讲就是你现在在美国感受到的一些情况 。
我知道 Meta、Amazon, 对 , 包括 Oracle 都有挺激进的裁员计划 。
嗯 , 我觉得这个事情应该是今年是一个我觉得可能比较可怕的一个事情 。 像最近的三个数据点吧 , 第一个数据点的话 , 就是今年年初的时候 , 亚马逊裁了 16,000 人, 对 , 然后其中有很多是工程师 。
但是亚马逊就是敲不溜的 ,也没说什么话 , 然后就裁了 。 所以可能新闻上面大家提到的就不是特别多 ,但是可能大家就是都知道的 Blox 的这个 CEO Jack Dorsey,他宣布 Blox 公司裁员 40%,并且他说大多数公司可能一年内会做出同样的事情啊 , 这 40% 里面有很多是这个啊开发者和技术人员啊 。
那么他也明确说了这个原因并不是因为我们公司的财务状况或者业务不好 , 那就是因为这个 AI 的原因 。
所以我们现在可以就是减员 40%, 做到和之前同样的或者说更高的 output。 第三个数据点的话就是 Meta 啊 ,Meta 这公司特别有意思啊 , 它就是前几周吧 , 大概有一周的时间 , 就是让全员停下来 , 然后学 AI, 然后管理层会看每一个人的这个 token 消耗量 , 作为一个团队这个效率指标 , 相当于是一个文化层面的一个变化吧 。
对 , 然后相应的就是既然你会有人看这个指标 , 就一定会有人优化这个指标 。 所以就有我知道的朋友就是让这个 Cloud Code 在那跑一个 loop, 然后疯狂输出没有意义的这个 token 啊 。
所以我觉得最近 Anthropic 这个几个 billion 那个 revenue 增长里面 , 搞不好有几十个 million 可能都是 Meta 这边贡献啊 。 然后他们内部学习完了这个怎么去很好的使用 AI 以后, 然后啊小扎就说哎 , 我们要裁员 20%, 然后这个大概是 15,000 人, 把这个省裁员剩下的钱再投到这个 AI 的 CapEx 里面啊 , 要把这个 AI 投资翻倍到大概是我记得是 65 个 billion。
所以这是我觉得今年可能 Q1 的三个数据点 ,但这肯定是一个开始啊 ,而不是一个结束啊 。 而且我觉得它影响范围之广 , 可能已经不是说疫情那个时候美国科技公司大裁员 , 我觉得现在裁的人可能找工作的难度也比上一轮裁员潮可能要难很多 。
接下来大家可以怎么办呢 ? 怎么应对呢 ? 提前干干什么呢 ?
我觉得大家可以考虑一下创业 , 对吧 ? 然后如果有好的创业想法的话 ,也欢迎联系我们 。 我觉得可能之后的话 , 可能真的是大家都要考虑一下自己作为个体户的这个这条路线了 。
因为它毕竟 AI 它加强了这些公司的这个能力 , 它其实也加强了每一个个体嘛 。 所以其实很多时候说以前我一个人, 我自己的技能树对吧 , 点的不齐 , 我自己没有办法去做一个产品 , 那这个东西它现在都不存在了 。
所以我觉得对于个体的机会来说 , 就是每个人可能都能当自己的老板 , 然后做这个个体户 , 然后自己去做产品 , 根据自己结合自己的优势 , 可能能够自己做一个 business 养活自己 。
加入创业公司是不是也不能保证工作呀 ? 创业公司是不是裁员也挺狠的 ? 当然你刚说是自己当老板啊 , 我就说如果加入小团队的话 , 小团队现在是不是也挺依靠 AI 来替代人工的 ?
对 , 我觉得现在就是小团队其实也是大家想明白了 , 就是我只要有五个厉害的人或前五个人特别厉害 , 我这个创业公司呢 , 就是可能再配上一些 agents, 可能技术方面可能就差不多了 。
对 , 当然也也看这个它的做什么了 。
嗯 , 比如你最近和你们的一些备投交流啊 , 你有看到一些什么啊 , 使用 AI 或者说由于 AI 的发展而带来的对用人和组织的变化吗 ?
呃 , 我觉得比较明显的一个感受的话呢 , 就是之前提到的就是全员 AI native, 就是不管你是什么方向 , 你是程序员还是不是程序员 , 你对这个 AI 工具的使用都是所有人面试中的一个重点吧 。
然后其次的话呢 , 就是说我觉得对于成长快的创业公司 ,他们还是呃愿意去招人的 ,因为他们这个时间窗口可能比他们的这个就是人效可能更重要 。
但是我觉得总体来说 , 相对以前来说更偏向是这个质量而不是数量 ,因为一个厉害的人加一个 agent 还是比你对人要有效率多了 。
嗯 , 我可以分享一些中国的情况 。 我觉得中国的很多创业公司的 CEO, 就是我接触的一些人, 大家其实明面上肯定是不会特别多去讨论因为 AI 减员的事情的 ,但实际上很多 CEO 还是很受冲击的 , 就觉得 AI 确实能干很多之前可能我要雇几个人才能干的事 。
我觉得比较受影响的包括一些什么设计了 、 前端了 , 就一些比较简单的开发 。 嗯 , 然后我听到了一个思路 , 我觉得挺有意思 , 就是说对很多创业公司来说 ,其实他们很难就是我花钱让整个组织全部是市场上最贵的 、 最厉害的人。
所以以往可能就是根据我的业务会有一个搭配 , 对吧 ? 我有一些一流的人, 然后加上一些啊二流的人 、 一些三流的人 ,他去完成不同的任务 。
而现在可能这个思路会变成我花更多的钱请一些更好的人 、 一些一流甚至超一流的人才 ,而一些二流三流的人他可能就不需要了 。他就变成以前是一流和二流搭配 , 现在是超一流和 agent 和 AI 搭配 , 然后整个公司的人变少 ,但不一定说他的用人成本真的变少 , 就不是跟着这个人变少这样线性变少的 ,因为他可能会花更多钱去招更好的人, 去招那种比如说你
能把 AI 用得更好 , 或者说你有更多想法啊 , 就你有想法 , 你你知道怎么去用工具 , 你怎么去发挥工具的价值 。
对 , 我觉得这个非常像这个电影 《2012》 里面这个洪水的场景 , 对吧 ? 就是你所处的海拔 , 就是你的技能的这个高度 , 你越高越安全嘛 。
你要是被淹过去了 , 那就是你就相当于被 AI 取代了 , 对吧 ?
你最近周围有什么 , 就是让你感觉这个事发生得很快的一些具体的故事吗 ? 有什么你觉得其实可能还挺厉害的人也会被这种裁员波及吗 ?
举个例子吧 , 我觉得可能比如说律师 , 就最近这个看了一篇文章叫做 《Cloud Native Lawfer》, 就是这个原生 Claude 的律所 , 然后他就讲了一个例子 , 就是说他的一个客户啊 , 应该是个甲方吧 , 临时的要求他们当天修改一个合同里面 1234567 条点 , 然后第二天早上把这个修改好的东西交回去 , 要不然这个合同他就不做 。
那么以前的话呢 , 这个事情他们就要奋战一整晚 , 还非常难以就是说在这么短的时间内要那么多的法律文件 , 然后要确保每一个条款之间没有这个冲突 , 对吧 ?
然后他们用了 Claude 来做这个事情 , 然后就发现首先第一甲方的要求有很多点自己是互相冲突的 , 所以他的要求本身就不合理 。
然后呢 ,他们用 Claude 来帮助分析以后, 就是分析出来哪些东西他们是可以接受的 , 哪些东西他们是有冲突的 ,是可以去做这个 pushback, 就是反对对方的这个提议 。
然后呢 , 把这个新的文档做出来 , 然后再包括一个说明 , 就是说为什么原因是这样的 , 哪些东西 pushback 是因为你们自己没有发现你们条款里面有冲突 。
所有的事情能够在两到三个小时以内 , 然后两三个人去在 Claude 合作来完成 。 所以就可以看到 , 就是说稍微有一些 AI 的这个实力的这个小的这个法律的这个律师团队 , 已经能够超过他的这个甲方的这个律所的这个能力了 ,而且非常短的时间内能够发生对方的这些错误 。
所以就是用 AI 和不用 AI 的这个差距其实已经非常非常大了 。
哎 ,但你说这个例子给了我一个启发哎 , 我感觉律师不太好被取代 ,因为除了你说的这种工作之外, 我当然就我的我对美国律师的印象都来自于美国电影啊 , 什么电视剧什么的 。
我感觉他们得有点别的能力 , 对吧 ? 比如说我和检查系统的关系了 , 比如说我的人脉了 。
对 , 我觉得就是未来可能搞人的工作是最安全的 , 我觉得搞人的工作是最安全的 。
嗯 , 我还可以分享一下, 就是中国这边我最近我遇到比较好玩的事 , 就是有一个反正你可以理解是一个大中型公司吧 , 就是他们有一个部门 , 大概可能管了大几千的这种开发人员 , 然后就是说他们想去找一些中小企业的或者 AI 创业公司的 CEO, 或者说这种技术 leader 来去聊一聊 , 就是 AI 怎么去改变研发组织和研发流程 。
然后我了解到这个需求之后, 我就在想哎 ,他们是不是觉得他们团队的人有点多啊 , 哈哈哈 , 那确实那是个很大的研发团队啊 , 就觉得可能怎么能用 AI 来提效吧 。
我觉得这也许是背后潜在的一个想法啊 。
我们都持续关注一下 ,在我们下一个季度交流的时候 , 我们看一看他们现在团队的这个减员到什么程度 。
对 , 哎 , 关于那个 Meta 的 20% 裁员 ,他们现在已经开始了吗 ? 内部开始有什么风吹草动了吗 ?
这个事情宣布了 ,但具体现在执行到哪里了啊 , 我确实还没有这个第一手的这个信息呢 。
嗯 , 我猜想啊 , 那总不能按照 token 量来排吧 , 哈哈哈 。 那那那如果真的你们有这一条的话 , 那我觉得会挺好玩的 。
你还真别说 , 我觉得 Meta 之前是历史上就是干过类似的事情了 ,他们之前是啊 , 少数就是这种技术大家认为比较强 ,但是之前就是衡量 performance 的时候用过这个代码行数的公司 。
所以我不太意外他们有可能同样的事情再干一次 ,在 AI 时代这个代码行数变成这个 token 量 , 然后来用作裁员的指标 。
Token 用的最少的 20% 的人直接自动离开 。 我们可以观察一下他之后具体是怎么去裁这 20% 的啊 ,因为你现在自己也做投资嘛 , 然后周围你也有很多大公司或者创业者的朋友 , 你们也回去交流 。
你觉得最近这一段时间大家比较共同关心的问题还有什么 ?
啊 , 说个题外话哈 , 大家比较关心这个湾区房价会怎么变化 。
哦 , 那我觉得这也跟 AI 相关 , 应该也是 AI 热潮带来的吧 。
因为我觉得湾区房价的话 , 还是说是一直被说最近有很多高薪的这个软件开发工程师撑着嘛 。 但如果说今年或者说明年这连续的裁员潮来了以后, 房价会怎么变化 , 可能大家会觉得是嗯 , 会变 barbell 啊 。
就是说这个第一的房价 , 比如说 1 million、2 million 或者 3 million,他们可能因为大家都失业了 , 对吧 ? 然后可能就大家直接可能就付不起了 , 然后他们可能会降价 。
但另外一方面的话呢 ,也有现在很多这个啊 , 厉害的这个 AI 研究员 , 然后又挣得特别多啊 ,他们在像 OpenAI、Therealpic 这些 XAI、Meta 也 package 很大 , 然后赚很多钱 , 然后尤其这些公司马上要上市了 。
所以可能就是会不会是说 10 million 以上那些供应比较少的房子反而要涨价 ,但是这个比较便宜的房子因为这个大部分人都失业了 , 所以要往下降 。
所以现在大家在猜测这个未来湾区这个房价会发生什么样的变化 。其实这个和 AI 挺相关的 , 我觉得它刚好折射了就是你说的两种情况 , 对吧 ?
有人可能拿到了 1 亿美元 、2 亿美元的年包 , 或者两年的这种总的 package, 然后又有更多人可能在担心自己的工作还能持续多久啊 。
对 , 非常赛博朋克 ,也就是摩天大楼下面就是贫民窟 。
对 , 我我觉得确实也是我们觉得所有 AI 从业者可能需要去思考关注的一个问题吧 , 就是 AI 现在确实还是一个非常中心化的一个事情 。
它会使得有算力啊 , 然后有资源啊 , 然后能力强的人得到很强的这个增幅效果啊 ,但是它可能会也会逐渐增大这个社会里面的这种不平等啊 。
所以未来社会问题上面怎么去解决这些问题 , 我觉得还是很有意思的一个课题 。 呃 , 我最近听到一个 , 当然以前大家会聊说我们要发 UBI 嘛 , 就是所有人管理公共工作 , 对吧 ?
每个月先发你 1,000 美元 。 嗯 , 然后现在的话 , 另外一个新的一个思路的话是说我们要在这个 token 上面收税 , 你不能无限制的去投钱造数据中心 , 然后搞更多推理 , 然后你把人都裁掉 。
你如果要是 run 更多的 token, 你每 token 可能要交一些 ,不管你这个每个 token 除了你自己成本以外, 你还可能要交点税 。
那那这样的话 , 你可能要考虑一下你是不是能不限制的去增加你这个啊 token 的这个消耗 。 所以我觉得可能未来啊 , 还是说社会机制上面可能也需要一些相应的适应 AI 时代的这个变化 。
我觉得给 token 收税的话是让这个 AI 更像人了 ,因为其实你招人是要公司是要交一些税费的 , 对吧 ? 所以人是有它的这种跟每个人头相关的成本的啊 。
对 ,其实这个逻辑很容易理解吧 ,因为你看美国这帮就是说啊 , 支持 MAGA 的人, 或者说对这个啊 , 现在的工作分配不满意的人, 就是说啊 , 我们的这个制造业都转移到中国了 , 然后中国的人他们抢了我们的工作 ,但他们不交税 , 对吧 ?
那未来的话呢 , 就不是说中国人抢美国人工作 ,是说 AI 抢了所有人类的工作 ,他们又不交税 , 那怎么办呢 ?
那你就是给他上关税 , 对吧 ? 你给他上关税 , 你给他加税 , 你让他交税就好了 。 所以我觉得这个应该是可能未来自然的一个进化方向 。
Q2 展望1:43:44
嗯 , 下个季度到半年, 你认为比较确定会发生的事情是什么 ?
我觉得下个季度到半年呢 , 我觉得可能有小有大吧 。 第一个的话 , 我觉得其实啊 , 今天我们还没有提到的一个名字 ,DeepSeek-V4, 哈哈 , 应该是要在下一个季度发布了 , 然后我觉得它也是啊 , 众心瞩目吧 。
希望就看看它这次有没有一个 , 那是不是憋出来一个大招 , 能够然后再次震惊这个全世界 。 我觉得还是非常期待这个新模型的发布 。
你觉得让 V4 震惊全世界 ,是不是对他们要求太高的一个期待 ? 你觉得一个公司能连续震惊全世界吗 ? 何况它的资源相对来说其实是比较有限的 , 就和比如说全球最核心的 AI lab 来比的话 。
我觉得应该也是 , 确实他们之前做了很多不错的工作 , 然后这个 V4 大家等的时间也比较久 , 所以我觉得现在期待拉的比较高啊 。
所以目前来看的话 , 可能确实是压力比较大的 , 就是如果想要去满足或者说超出大家现在对 V4 的一个期待啊 , 从最近发的这些工作和 paper 来看 , 可能还差了那么一点啊 。
不过我觉得我们可以等一等 , 看一看结果怎么样 。
你说从最近发的工作 , 你是指其他家发的工作太强了 , 还是指去年底到今年初 DeepSeek 陆续释放的一些成果 ?
你记得是 MHC 和 Ingram 这些吗 ?
MHC 啊 ,Ingram 呀 , 然后其实这些工作有不少也是基于就是字节 seed 的工作嘛 。 所以啊 , 可能我现在也听到一些声音 , 就认为就是说啊 , 这个啊 ,在这些基础的工作上面 , 可能有的时候可能 DeepSeek 它领先的程度可能比之前可能缩小了 , 那现在字节可能在这个 seed 的创造力上面可能会更强一些 。
我我聊到 seed 的人也会说 , 反正就是说其他人的一些工作是基于 seed 的工作啊 。 好吧 , 嗯 , 这是一个你觉得对 , 我觉得比较确定 。
我下季度应该 V4 肯定是会发了啊 。
对 , 然后我觉得还有一个比较期待的就是说啊 , 我们可以看到那个 computer use benchmark, 就 CUB, 现在的话还非常低 , 好像我看了一下现在最新的模型 , 可能 performance 也只有百分之十几 。
所以我们又看到现在这种 Cloud code 操作电脑的这些功能的上线 , 我觉得还是非常期待 , 就是在 computer use 上面可能会有一些新的突破 , 然后使得这个整个跨不同的应用 , 然后又在没有 API 的情况下, 这种工作流能够更好的被自动化 。
那我觉得在很多这个企业里面 , 应该还是有很好的落地场景 。
那有什么你还不太确定 ,但是很想验证的事情吗 ?
我觉得不太确定的事情就是说这个持续学习 , 还有这个递归自我改进 , 这些事情能有多快的速度去落地吧 。
因为啊 , 前一段时间我也写了一个这方面的一个博客 ,在发了这个博客以后啊 ,也有很多这个研究员参与了讨论 , 然后我们 MoE Labs 呢 ,也办了一次这个主题的讨论 。
我觉得大家可能还是都觉得现在的方法还是有这个 over engineering 的嫌疑 ,也就是说过于复杂了 。 可能大家还是会期待一个就是在机制上面和 skills 或者啊 memory 同样简单 ,但是效果更好的这么一个机制 。
但目前来看的话 , 就是可能还没有人说已经完全掌握了这个配方是什么样的 。 所以啊 ,也是希望能够看看啊 , 今年 Q2 的时候啊 ,有没有一些突破性的进展吧 。
嗯 , 你说的现在方法大家觉得有点过于复杂 , 太工程化了 , 指的就是 。
指的是说像啊 ,Test and training 啊 , 像这样的方法可能还是比较重 。
嗯 , 一些希望就是说在那个使用模型训推理模型的阶段 , 然后模型的这个权重也小部分的更新呢 , 这种就是大家理解的更原生的持续学习 ,但是搞得太复杂了现在 。
对对对 。
OK, 那今天非常感谢 Henry 做客晚点聊 , 分享了 Q1 的一些观察 。其实我觉得聊下来能明显能感受到 , 目前已经被大范围使用 , 然后也是核心的模型厂商在竞争追逐的主线 ,其实就是从 coding 到 agent 这一条模型进展 ,以及与之相关的应用 , 还有整个开发者生态 。
然后在这个领域 , 我们也看到了像这一季度有 Ops 4.6, 应该是目前为止很多人认为的最强的代码和 agent 的模型 , 然后也有 GPT 发了 GPT 5.4,以及 Anthropic Cloud Cowork Cloud Code 的收入的快速的增长 , 还有 OpenAI 正在收敛一些芝芝曼曼的投入 , 它也在重新更聚焦到生产力这个场景 。
接下来我觉得在第二季度可能也是一个会发生 , 然后也是值得去验证结果的 , 就是 OpenAI 和 Anthropic 之间的新的竞争 。
然后我们也讨论了在目前的这个主线之外, 可能一些更远期的方向 , 包括持续学习 , 包括用 AI 来改进 AI 的自进化啊 。
最后我们也延展聊到了 AI 对大家的生活工作的一些影响 , 包括已经在硅谷发生的科技公司大裁员 ,以及中国的大小公司可能也会因为 AI 有很多人员思路和组织的调整 。
那今天的节目就到这里 , 感谢各位的收听 , 大家拜拜 。
拜拜 。
本期连点呈现补充更多中国正在发生的情况和我的一些整体感受和观察 。 如果从这期提到的 24 年下半年初露锋芒的 Devin 开始算起 ,coding 到 agent 的酝酿和蜕变已经经过了整整一年半的时间 , 期间出现了 Cloud Code、Metalus、Jens Park、Cloud Cowork 等诸多探索 。
到 25 年底 , 一个越来越成为共识的观察是 coding agent 就是通用 agent。 我在 157 年末 AI 回顾的单口节目里 , 从模型和应用两个角度详细分享了相关的事实和观察 。
而到今年一季度 , 几个事情汇聚 , 进一步让更多人看到了 agent 的价值 , 这包括 Cloud Code 逐渐积累的用户和体验 ,以及最重要的是实打实的收入 。
这个产品在 26 年 2 月的最新 AR 已经达到了 25 亿美元 , 超过了同期 Cursor 的 20 亿美元 , 还有把 agent 放到聊天对话框里 , 带来新的交互体验的 OpenClaw 小龙虾 。
它在中国的全民出圈 , 让 agent 变成了更多老板和工作者会认真考虑的提效手段 。 不考虑 AI 领域仍在发生的诸多其他探索 , 仅仅是接下来围绕 agent 的效率优化 、 降本的努力和体验与交互方式的创新 , 就有巨大的创新和业务空间 ,而且这是一个足够大的空间 。
对我个人来说 , 到此时此刻 , 那种此轮 AI 绝对不会进入寒冬和低谷的乐观宣言 , 才有了让人安心的能切实踩上去的地面 。
这意味着很多改变 , 大公司肯定会有更明确的动作 , 比如向来慢一步的腾讯 , 看到 OpenClaw 后难得展现了一次速度 , 一众 AI 公司也需要再次思考模型研发和打造强应用之间的平衡与兼顾 。
我们会看到一些像实验室的公司也开始更多考虑产品化 , 比如在招聘上已经有所动作的 DeepSeek。 我们也会看到以往国产 AI 效率工具收不到钱的论断正在动摇 。在 agent 这种对效率和成本比较敏感的场景 , 便宜够用 , 甚至在某些功能和体验上比欧美产品更好用的中国产品的收入在快速的增长 , 还有更多人的工作方式和整个劳动市场也会发生改变 。
这期是我们第一次长时季度总结 , 录完之后我发现仍有一些角度和方面没有展开讲到 , 希望各位听友在评论区多多留下意见和建议 ,也分享你的 AI 观察 。
下季度再见 。
本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 LatePost。
下期再见
。




