开场0:00
欢迎收听 《 晚点聊 》, 我是曼祺 。 这期是 《 晚点聊 》 的年终特别节目 ,在 AI 大事必定发生的春节之前 , 来总结 2025 年和即将过去的蛇年, 我们在 AI 领域的观察和见闻 。
本期节目我会以单口的形式来讲述 , 我将按几个大的主题来串起这一年在 AI 领域的观察 、 行业的一些大事件 , 和整个 《 晚点 LatePost》 对 AI 的更多报道 。
你将听到以下 7 个章节的内容 : 模型 ; 应用 ; 巨头的 AI 之战 : 字节 、 阿里 、 腾讯 ; 创业公司们 ; 具身智能 ;AI 硬件 ; 最后是 AI 中的人。
在每个章节中, 我会按照若干关键词来展开要点 ,并穿插指路 《 晚点聊 》 的相关往期节目或 《 晚点 》 的相关文章 。
我会把提到的文章列在 shownotes 里 。 历史正在加速发生 ,AI 洪流中五色使人迷目 ,但人是意义的动物 , 我们总试图理解和抓住什么 , 拽住那条 " 意义之线 "。
希望这期年底的大型 " 连点成线 ", 可以帮听友得到一份正在拓展中的 AI 地图 。 下面我们正式进入节目吧 。
模型1:10
第一章 : 模型 。 关键词 :Agentic Model: 协同设计 。 下一个学习范式 。AI 领域有众多分歧和争论 ,但绝大多数人都有一个共识 , 就是本轮 AI 热潮人出在早期 , 技术变化本身是最重要的驱动力 ,也是推演产品形态和商业格局的基点 。
所以我们的回顾从模型技术开始 。 第一个关键词是 Agentic Model, 简单来说就是能支持 Agent 能力的模型 。在 25 年 3 月 ,106 期和真格合伙人代笔森聊 Agent,以及那之后不久的 110 期和明室合伙人夏令聊 《 垂类 Agent》 的两期节目中, 我们都对 Agentic 模型框架有详细的拆解 。
总结来说 ,Agent 需要模型的这样几种能力 : 一是推理能力 , 能思考更复杂的任务和规划任务 ; 二是 Coding 编程能力 ; 三是多模态能力 , 尤其是多模态理解能力 ; 四是工具使用能力 , 这和推理 、Coding 和多模态的能力都相关 ; 最后还有记忆能力 , 能存储长期的上下文 ,而且能在处理特定任务时知道掉用哪些适当的上下文 。
这些能力并不一定都要训到大模型里 ,也可以采用外挂等工程方式放到整个系统里 , 同时需要 MCP 等协议生态的辅助 ,但它们都是基础大模型公司会着重提升的重点 , 所以我会放到一起讲 。
Agentic Model 本年的发展要从年初 DeepSeek R1 的爆火说起 , 这标志着推理模型的崛起 。其实更早的推理模型是 OpenAI 在 24 年 9 月发布的 OpenAI O1, 我们也在那之后不久的第 80 期节目中解读了 O1 带来的新的开发范式 。
而 DeepSeek R1 是全球第一个在大参数规模上复现了 O1 的推理模型 。 一个幕后故事是 ,R1 发布的同一天 ,Kimi 也发布了自己的推理模型 K1.5。其实两家公司都各自知晓对方就快发布推理模型了 , 最后赶上了同一天 ,2025 年 1 月 20 日 。
这个日期未来会成为中国 AI 史上值得纪念的一天 。 R1 后来获得的影响力远远大于 K1.5, 甚至也远远大于原始版本 O1。
除了实力过硬之外, 还有三个关键的因素 : 一是它是一个完全开源的模型 ,而且开源了最强最大的满血版本 ; 二是它的技术报告十分详细 ; 三是它特别在报告中高亮了 557 万美元的最后一次训练成本 。
前两个因素是 AI 研究者关注 DeepSeek 的原因 。其实从更早时的 V2 和 V3 开始 ,DeepSeek 在欧美 AI 研究群体里就以慷慨的分享精神赢得了大量的尊重和讨论 。
梁文锋本人对开源非常坚定 。 分享一个我们报道过的小故事 , 就是 23 年下半年, 光年之外之前的联创袁婧晖在筹备创立新的 AI infra 公司 《 硅基流动 》。
梁文锋考虑过投资 ,但是他说如果你们的大模型推理引擎不开源的话 , 我就没有兴趣了 。 袁婧晖当时没有想清楚开源的商业模式 , 就没有拿这笔钱 。
不过这之后, 硅基流动一直和 DeepSeek 有紧密的模型托管合作 ,是第一批上线 V2 和 V3 的平台 。 而第三个因素 , 看起来极低的训练成本 , 则引起了美国政商领域的更广泛的关注 ,以至于特朗普也点评了 DeepSeek, 英伟达的股价也一度大跌 。
然后就是 " 墙里开花墙外香 ", 一个美国人都说厉害的 AI 大模型 ,在全国人民都闲着的春节假期 , 引发了史无前例的科技狂潮 。
从 R1 的爆火中 ,其实可以看到一种技术影响力的扩散路径 : 先在全球最 top 的核心 AI 研究者中产生小范围但好评度很高的影响力 , 这需要实打实的技术实力和分享精神 。
然后是借由一个契机破圈 ,以及 AI 领域比较特别的 " 出口转内销 "。 这也反映了当前一个既合理又让人有点无奈的事实 , 就是我们总是看着美国被美国 AI 界认可的东西自带光环 。
说回推理模型本身 ,O1 和 R1 带来的效果提升主要表现为多步推理能力 , 就是可以一步一步地去思考一个复杂问题 , 提升回答的准确性 、 全面性和规划能力 。
这也激发了 Chatbot 类产品的一个主流功能 ——Deep Research( 深度研究 )。 而这个效果提升背后的新的技术范式 ,是把更多算力放到了模型的使用阶段 ,也就是推理阶段 。
这就是测试时间计算 (Test Time Computing)的 scaling。DeepSeek 的慷慨开源进一步帮业界证实和证伪了很多假设 , 比如推理能力不需要依赖蒙特卡洛树等复杂的搜索算法 ,也不一定需要用人工构造的思维链数据来做监督微调 ,而是可以在基模之上直接从零开始强化学习 , 这降低了其他团队的试错成本 。R1 存在的本身还是一个观念的胜利 , 即可以依靠小规模而且非常年轻的研发
团队 ,以相对低的成本快速复现最好的模型成果 。R1 甚至直接促使了一个新团队的诞生 , 就是曾经是中国首富的盛大创始人陈天桥投资支持的 Mirror Mind。
因为 DeepSeek 让陈天桥看到 , 研发和训练出顶尖模型的投入比他之前想象的要小得多 。 当 R1 和一系列推理模型提升深度思考的能力时,2024 年埋下的另一颗种子也悄然发芽 , 那就是 Anthropic 引领的 Coding 能力超强的模型 , 即 Claude 3.5 和后续模型 。Anthropic 也在 25 年 2 月正式发布了自己的 AI Coding 产品 Claude Code。
后来我们会发现 , 它不仅是一个 AI Coding 产品 , 它其实就是一个 General Agent, 比 25 年 3 月初发布的 The World's First General Agent(MALOS) 还要早一个月 。
我会在后面讲应用的部分更多展开相关内容 。Coding 之所以重要 ,是因为在数字世界里 , 会编程就像人有了强健的手和脚 , 可以解锁大量任务 。
这是大模型支撑复杂 Agent 应用的重要基础 。 整个 25 年至今 , 全球顶尖模型厂商都在加大对 Coding 的投入 ,其中不少都直接下场做了 Coding 应用 , 比如 OpenAI 在 4 月发布了 CodeX,XAI 在 8 月发布了 Grok CodeFast,Google 在 11 月发布了 Antigravity。
下一个要讲的 Agentic Model 的能力是多模态 。25 年出现的一些新的 AI 产品体验 , 都离不开多模态 。 比如 136 期中, 我和 LabArt 的创始人陈冕聊了他们当时刚上线不久的一个功能 ——Chat Canvas, 就是用户可以手动在生成的设计图上选定一个区域 , 然后告诉 Agent 怎么进一步优化和修改 。
这背后就需要模型能理解图像 。 现在全球最领先的大模型 , 都已经演进成了原生多模态模型 , 即用同一个模型来处理文字 、 图片 、 语音等不同模态的信息 。
而这之前 , 多模态能力是分开实现然后拼接的 。 最早发布的这一类模型是 24 年的 OpenAI 的 GPT-4o 和 Google 的 Gemini 1.5, 去年 11 月发布的 Gemini 3, 还有上周刚发布的 Kimi 2.5,也都是原生多模态模型 。
同时也有不少专门做多模态生成的模型 , 比如中国公司做得很不错的视频生成模型 , 像可灵 , 还有 MiniMax 的海螺 。
去年 Google 发布的大火的 Veo3 和 Nano Banana,也是这类专门做视觉生成的模型 。在 146 期聊 Gemini 3 和 Agential 的模型时, 我们就提到 Nano Banana 和 NotebookLM 都发源于 Google Labs, 负责人是 Google 的一位传奇经理 Josh Woodward。Google Labs 这个部门不仅有研发人员和工程师 ,也会招主编 、 设计师等做内容的人 ,他们创造了很多火爆出圈的内容玩法 。
比如我相信有一段时间很多人都在小红书上刷到过那种把自己的照片做成桌面手办的图片 , 这背后用的就是 Nano Banana。
而另一些公司 , 比如 Anthropic、Kimi 和 DeepSeek, 都没有把多模态生成作为重点 , 这和不同团队的技术判断 、 想做什么方向的应用 ,以及资源多少都有关系 。
总结一下 Agentic Model: 随着大模型的推理 、 编程 、 多模态能力的持续提升 , 去做主动性更高 、 能完成更复杂任务的 Agent 应用的时机到了 。25 年普遍被认为是 Agent 应用出现的元年, 这个趋势还在快速发展 , 比如最近爆火的 OpenClaw。
我们在后面聊应用时还会进一步展开 。 接下来进入模型部分的第二个关键词 : 协同优化 。 这是指模型的开发方式和研发团队的组织方式 ,也是在 146 期聊 Gemini 3 等技术进展的节目中 ,在 Google 云的 Vertex 部门工作了 7 年的 Basil Wong 分享了他看到的 Google 卷土重来的一个关键 :CoDesign 协同设计 。
就是 Google 多年的布局 , 让他全面掌握了训练 AI 的 TPU 芯片 、 芯片上的 JAX、PALACE 等软件库 、 面向大模型的 AI infra 基础设施 ,以及云平台 、 模型和最上层的应用 。
这让 Google 能从底层到上层一路协同优化 , 形成了非常强的 superpower。其实这种 " 垂直整合 " 协同设计的想法很自然 ,因为大模型训练是一个大型的复杂系统工程 ,GPU 等硬件 、infra 等软件系统还有算法都是相互影响的 。
最近阿里新总结的 " 通云歌 、 通义 、 阿里云平头歌 " 的战略组合 ,也是类似的垂直整合的思路 。
而在千问模型团队内部 , 更紧密的整合也正在发生 。 我的同事高洪浩在 《 晚点 》 最近发布的 《 字节 、 阿里 、 腾讯 AI 大战全记录 : 一场影响命运的战争 》 这篇文章里就提到 ,在阿里通义实验室的千问团队 ,他们从 25 年下半年起开始招募自己的 infra 人才 ,而这之前千问的 infra 主要是阿里云的人工智能平台 PAI 来支持的 。
但后来他们认为字节 infra 能更敏捷的开发 ,也能和算法有更紧密的协作 。 腾讯 AI 大模型的新负责人姚顺雨近期也在一次内部会议上提到了 CoDesign 的思路 , 她认为从 infra 到算法再到产品协同打通 , 可以加快迭代减少内耗 。
腾讯已经把 AI infra 部门也划到了姚顺雨的管辖范围 。 而 DeepSeek 作为一个从零搭建的团队 , 则是在一开始就很自然地形成了紧密的协同优化 。
比如 infra 团队也会参与算法的设计讨论 , 如果一个算法设计从 infra 层面很难有稳定的实现 , 这个想法可能会被否掉 。DeepSeek 能做到这一点 ,在于梁文锋对整个模型训练的各个环节都比较了解 ,而且会 hands-on 地参与其中 。
这还是和当前模型训练的性质有关 , 它更多是一种工程而非科学研究 , 非常需要一线的手感和体感 。 25 年年初的一个事件 , 展现了 DeepSeek 超强的 infra 能力和工程能力 , 就是 DeepSeek 开源周 。
从 2 月 24 日到 28 日, 周一到周五 ,DeepSeek 每一天都放出了一个 infra 领域的开源成果 , 然后在周六发布了一篇收官博客 《DeepSeek V3 R1 推理系统总结 》。
这篇博客里还根据某一天 24 小时的实机数据 , 测算了 DeepSeek 推理系统的成本 。《 晚点聊 》 有两期相关节目 , 一是在 102 期中, 我们和 DeepSeek 的一位前实习生王梓涵聊了大模型开源的现状 ,以及它和传统软件开源的区别 。其中有一个问题我印象很深 ,是当时我们在讨论像 DeepSeek 这样一直开源最强的旗舰模型是为什么 。
她说有两个可能 : 一是老板不想赚钱 , 要造福社会 ; 二是想做更大的事 , 比如成为一种行业标准 。
另一期节目和 DeepSeek 开源周引起的行业风波有关 , 就是在周六发布的那篇总结文章里 ,DeepSeek 公布的推理成本非常低 ,在 24 小时里用 1800 多张卡支持了 6000 多亿的输入 token 和接近 1700 亿的输出 token。DeepSeek 还以当时的 GPU 租金和自家模型的官方定价计算了一个利润率 , 换算成毛利率是惊人的 84.5%。
做第三方 AI infra 服务的陆晨科技创始人尤洋直呼不可能 ,他认为 DeepSeek 这种算法没有考虑波峰波谷的调用量的变动 。
具体的讨论可以见 105 期节目 《 我对尤洋的访谈 》。其实这种争议本身也侧面说明了 DeepSeek 的 infra 优化得非常极致 。
硅基流动创始人袁婧晖当时也在这篇文章的知乎留言区里评论 ,DeepSeek 披露的成本和收益又一次颠覆了很多人的认知 。
现在很多供应商做不到这个水平 , 主要是 V3 和 R1 的架构和其他主流模型的差别也很大 。他推测 DeepSeek 团队可能是先想到了一个这样的模型架构 , 然后解决了稳定训练和推理的工程问题 ,也可能是反过来 , 从系统出发 , 设计了这样一个特殊的模型结构 。
不管是袁婧晖说的哪一种 , 这背后都需要模型和算法的紧密合作 。在协同优化这部分 , 我还想特别讲一讲注意力机制的改进 。
注意力是 Transformer 架构大模型的核心机制 。2017 年提出 Transformer 的那篇论文的标题就是 《Attention is All You Need》。 简单来说 , 改进原始注意力机制 ,是为了让模型能处理更长的上下文 。
而模型之所以会在上下文的长度上遇到瓶颈 , 又是因为注意力的计算方式会带来很大的计算复杂度和显存开销 ,而这两件事都被 GPU 的算力 、 互联效率和存储等物理底层限制 。25 年我们做了三期和注意力机制改进相关的节目 , 正好涵盖两个主流方向 : 稀疏注意力 、 线性注意力 , 分别是 103 期 、104 期和 143 期 。
这几期节目都是从算法和模型架构的改进聊起 ,但都很自然地延伸到了系统层和硬件底层 。 比如 103 期中我们聊到了 FlashAttention, 它就是一个早期的系统算法的协同改进 。
基于对 GPU 内存访问特性的理解 , 它通过改变标准注意力的计算顺序 , 提升了计算效率 , 降低了显存开销 。在 143 期中,DeltaLat 的核心作者杨松霖也分享了他是怎么从一个算法研究员自学了改写 Kernel 等系统层的能力 。他对 DeltaLat 的核心优化 , 就是提出了一个对 GPU 更友好的 、 可以做 scalable 训练的方法 。
最后讲一下算力 。 去年 《 晚点聊 》 的 115 期节目中, 我和之前 BEREN 的联合创始人, 现在 AI infra 公司模型智能的创始人徐凌杰聊了当时华为刚发布不久的 384 Matrix 超节点 。
它是一个连接了 384 颗 AI 芯片的超级算力集群 。 这背后的一个算力层面的趋势 , 就是从拼单颗芯片的性能 , 到优化多芯片互联的系统 。
英伟达更早之前发布的 NVL72 也是这个思路的体现 。 那期还有很多有意思的洞察 , 包括互联互通技术为什么重要 , 英伟达是全球范围少有的既掌握芯片设计 , 又掌握芯片间的互联技术 、 更复杂软件能力的公司 。
徐凌杰也分享了 AI 计算的成本正在从以计算为主转向以显存为主 ,以及这些基础模型层的变化会带来哪些新的机会 , 又会消灭哪些旧的机会 。
讲到这里 ,也可以看到 ,在算力内部也是一个协同设计逐渐垂直整合的结构 , 这可能就是某些领域强者恒强 、 强者很难被动摇的原因 。
下面进入模型部分的最后一个关键词 : 下一个学习范式 。 这是 25 年下半年以来越来越被关注的一个话题 。
先总结一下目前的范式 , 简单说就是用海量的数据做预训练 , 然后用更少但质量更高的 、 面对特定任务的数据做监督微调或强化学习的后训练 。
为什么现在要思考和讨论下一个范式了 ? 会想这个问题的人, 当然是觉得目前的方式不久会出大瓶颈 , 或者它不是实现智能的最优的方法 。
伊利亚 、 哈萨比斯 、 乐昆等人都讨论过这个问题 。 这些人想法的共性是 ,他们都倾向于从学习机制而非效果来定义 AGI。他们都认为当前的技术还达不到更本质的学习方式 。
这包括像人那样能用非常少的样本和数据就学会一些任务 , 能举一反三 , 能在整个生命中持续学习 , 能真的理解乃至发现物理世界的规律等等。
所以伊利亚在 25 年 11 月和 DoorCatch 的播客里就提到 , 过去几年是 scaling 的阶段 ,而现在是重新回到研究 、 回到 research 的阶段 。
热门的研究方向看起来很多 : 持续学习 、 在线学习 、 世界模型等等。 我自己看到的一些线索是 , 首先很多研究者在寻找下一步的方法时, 都会去思考动物和人的智能是如何产生 、 如何工作的 。
比如伊利亚去年底的播客里就提到 ,他的 AI 研究品味就是以正确的方式去思考人类的智能 , 追求美和简洁 , 从大脑中获得灵感 。Transformer 的作者之一 Leon Jones 创立的 Scana 在 25 年提出的一种新的模型架构 , 连续思维机 ,也是希望更接近人类大脑 。在 《 晚点聊 》 的 108 期节目中, 香港大学计算与数据科学学院院长马毅老师分享了他对智能历史的梳理 。他思考的起点也是 : 地
球上为什么会产生智能 ? 为什么生物才有智能 ? 他的结论是智能的本质就是学习 。 这是指找到世界里有规律 、 有结构 、 可预测的东西 , 进而能预测外部世界 , 这样才能生存 。
马毅的研究方向是探索能像生物那样实现闭环反馈机制的学习系统 。 人类学习方式的一个优势还在于非常节能 , 为了训练大模型 , 马斯克都计划去太空建算力了 ,而人类大脑的功耗却只有 20 瓦 。
去年在和 Meta 的前 AI 研究总监田渊栋聊科幻小说的节目里 , 我们也延展聊到了现在的方法的瓶颈 。11 月时我在旧金山又和他见面聊了聊 , 田渊栋说他接下来想做的事也是探索新的学习范式 。他认为那一定会是一种更简单优雅的表达 ,而且是可以被理解解释的表达 ,而非目前的黑盒 。他以前就说过 , 如果 LLM 就能实现 AGI, 那么人类的未来是悲观的 。
我以前理解的是其中的一层意思 , 就是刚才说的 , 现在的智能产生方式太过于耗能和依赖数据 ,而这两项资源都不能短时间快速再生 。
和他见面之后我还理解了另一层意思 , 那就是如果现在的方法就可以实现智能 , 那说明用一种不可解释的方式 ,也能表达和捕捉宇宙的规律 。
这对智慧生物难道不是一种事实上的悲哀吗 ? 和模仿人类智能相关的一个想法 ,是现在很热门的方向 : 持续学习 。
高级动物和人类都有自己持续学习的能力 ,而现在的大模型的更迭则需要靠人类研究员去深度参与每一次迭代 。
持续学习在人类智能上的最高表现形式之一就是科学发现 。DeepMind 的哈萨比斯在最近关于智能的未来的分享里就提到 ,他希望研究能像人类科学家那样 , 提出假设 、 设计实验 ,在虚拟环境或真实环境里执行实验 , 然后得到数据验证假设的系统 。
这就是现代科研的一般流程 。 而如果我们能精确地生成这种学习和探索的环境 , 这就是世界模型 , 至少这是一部分人对世界模型的理解 。
比如 DeepMind 在 25 年先后更新的 Genie 3 和 Sigma 2 就是这样的尝试 。其中 Genie 3 是一个能生成可探索的 3D 环境的世界模型 ,而 Sigma 2 是一个可以探索这个环境的智能体 。
不过目前这个版本只支持智能体在这个环境里跑来跑去 , 拓展这个世界 ,但是并不能去操作和改变这个环境里的物体 。
总结下模型这部分 ,25 年大模型的推理 Coding 多模态能力持续提升 , 这为更复杂的 Agent 应用提供了能力基础 。
而模型能力竞争背后是组织和研发方式的竞争 , 需要算力 、 系统 、 算法等不同环节的协同设计和紧密合作 。
同时 AI 研究者们也已经在思考智能的下一步是什么 。
应用19:53
OK, 说完了模型 , 我们进入第二章应用 。 关键词 :Agent、Sora App、AI for Science。 前面已经说到 25 年是 Agent 应用大量出现的元年 。
从满足的需求看 , 现在 Agent 有两个明显的主线 : 一个是以 Coding 能力为核心支撑的 General Agent, 一个是垂类 Agent。 同时围绕 Agent 也形成了一个工具链的生态 , 这在美国已经催生了一批创业公司 。
先来说 General Agent, 我会把它和 Coding 放在一起说 。 前面就提到了 25 年 2 月发布的 Cloud Code,不仅是一个 AI Coding 产品 , 它也是一个 General Agent。
这句话也可以换一个表达 , 就是 Coding 不仅是目的 , 更是手段 。 作为目的的 Coding 就是给程序员用的 , 帮助他们解放时间 , 甚至直接替代一些程序员的 Coding 产品 , 比如 Cursor。
它也可以是给那些不太会编程的人用的 Vibe Coding 产品 , 比如 Lovable。 而作为手段的 Coding 是指一个 General Agent 会利用 Coding 能力在数字世界里处理各种任务 。
如果这个产品设计成给那些懂编程的人来用 , 那就是可以直接在命令行里启动的 Cloud Code。 如果降低门槛 , 加一个更简单的交互界面 , 那就是刚发布不久的 Cloud Cowork, 还有最近两周席卷全球 AI 圈的 OpenClaw。其实字节的编程产品 Thread 在去年下半年发布的 Solo 模式 , 蚂蚁灵光 、 马卡龙 、YuWear, 还有 MuRun 最近开始内测的 Agent Builder, 都可以算到这个范畴 。
这些产品的共性是 , 都是在满足个人的工作或生活中的一些自动化的需求 。 如果是一次性的需求 , 那就是用 Agent 来做一个任务 , 比如做 PPT、 做网页等等。
如果是重复的 、 流程相似的需求 , 那就可以更进一步 , 用 Agent 来造 Agent。 或者说得更简单点 , 就是用 Agent 来给自己造一些个性化的应用 。
比如我自己就有一个特别的应用需求 ,是我希望 AI 能每天去帮我看一些科技从业者的社交媒体内容 , 分类做记录 ,并在每周结束时基于这一周收集的内容做一些信息总结 。
我也希望 AI 能自己判断该去 follow 什么主题和人, 根据行业的变化及时动态地调整这个跟踪的 list。 类似这样的个人自动化需求 ,以往不会有别人来给我做 ,因为这些需求太小众了 , 支撑不了软件开发的费用 。
我自己也不会做 ,因为我不会编程 。 而现在 Cloud Code 和 Cowork 这类工具 , 大幅降低了开发这种个性化应用或者 Agent 的门槛 。Anthropic 在降低 Agent 的门槛上有很多贡献 , 包括之前的 MCP 协议 , 还有 25 年越来越被广泛采用的 Skills 开放标准 。
简单来说 ,Skills 就是一些可以被重复调用的 prompt 和工具描述的集合 。 而一旦 Agent 的门槛降低 ,Agent 的数量就会变多 。
最近我和马卡龙的创始人陈凯杰聊 ,他有一个很有意思的总结 : 如果说之前我们已经经历了数据 、 模型参数和算力的 scaling, 那接下来我们就会看到 Agents 的 scaling。
就在这个聊天之后不久 , 出现了 Moltbook, 一个 AI 版的 Facebook。 这个社交网络里的成员都是 Agent。Moltbook 是群体智能的一个小实验 , 就是看一看一堆智能体聚集之后可能会产生什么 。在 121 期中, 我和晚点的创始人小菀与 TinCap CTO 黄东旭一起聊过群体智能的一个科幻版本 。
那是黑镜里第七季的第四集 ,Plaything 讲的就是一个游戏天才开发出了一个充满小人的游戏 。 这些小人遵循一定的规则 ,在这个游戏环境里不停互动繁衍 , 最后形成了超长的智能 。
最近在看到 Moltbook 后, 黄东旭自己还动手做了一个小型的 Milliebook, 用来帮自己写代码 。他用了三个不同的 Agent 角色来分工协作 , 认为这会提高整体表现 。他说自己正在研究 Agent 的社会学 。
不少垂类 Agent 的应用里也已经出现了类似的角色分工 , 比如我们报道过的动画制作 Agent OiiOii 和影视制作 Agent MovieFlow 等等 ,他们都是按照各自要服务的内容制作的流程 ,在应用里设置了编剧 、 脚本 、 分镜等不同的分工 。
去年从小兵离开的李迪也正在探索群体智能 , 创立了明日星城 , 想做一个多智能体的 Agent 框架 。
当 Agent 的数量变多 , 新的可能的需求还有 Agent 本身的分享 、 分发和交易 。 比如我在 5 月采访 YuWear 创始人明超平时 ,他当时的思考就是觉得 Vibe Coding 是一种新的创作方式 ,有创作就有分享的需求 , 可以做 Vibe Coding 工具加分享的社区 。25 年发布的 MuRun 则是看到了 Agent 交易平台的机会 , 我近期还访谈了 MuRun 的创始人陈宇森 。
不过这两个产品都经历了从平台到更强调工具本身的转变 , 这可能和目前高频使用 Agent 的人还是比较少有关 ,也就是 Agent 的工具还是不够多 。
比如 YuWear 的 Web 主页之前展示的是很多用户的作品 ,而现在跳到主页之后, 会是一个大的对话框 , 直接提示用户构建应用 。
举出的例子也都是偏功能和效率型的 , 比如做一个项目管理工具 , 或者是做一个电商数据的分析工具等等。
而 MuRun 的陈宇森也告诉我 ,他认为接下来的 Marketplace 不应该是淘宝那种货架式的 ,而应该是对话式的 。 所以他们 2.0 的版本 Agent Builder 也更强调工具本身 。Agent 的另一个明显趋势是更多的与手机结合 ,因为我们有一多半和数字世界的交互其实发生在手机上而不是电脑上 。25 年的一个典型行业事件 , 就是 12 月字节发布了豆包手机预览 , 豆包手机满血版的使用体验 。
可以见我的同事贺前明的这篇文章 《 实测豆包手机助手 : 比价点外卖 、 自动回微信 、AI 操作手机的时代来了吗 ?》
不过文章发布当周 , 豆包手机里的很多功能就用不了了 ,因为微信和美团外卖等超级 App 都不想被豆包手机调用 ,不想被 over the top 成为豆包手机入口的下游 。OpenClaw 小龙虾的大火也和它能与移动端打通有关 , 像 Cloud Cowork 目前就只出了电脑桌面版 ,而 OpenClaw 可以直接部署到手机的通信 App 里 , 用户通过在手机上和它聊天 , 就能让它在云端执行一些任务 。
去年晚点聊有两期节目详细讨论了 Agent 进入手机的趋势 , 分别是 130 期访谈智谱 AutoGLM 的产品负责人刘骁和 138 期访谈 OPPO 当时的小步智能助手的负责人万裕龙 。
这两期都聊到了几个共性的话题 , 包括 GUI,也就是让 Agent 像人那样去使用图形界面 ,是不是最好的交互方式 , 手机 Agent 的隐私安全问题等等 。其中我觉得很有意思的一个议题是手机 Agent 面临的三方博弈 , 即手机厂商 、 微信 、 淘宝 、 美团等超级 App 厂商和做 Agent 或者说做 AIOS 的 AI 公司之间这三方的博弈 。
一个观察是 , 不同类型的超级 App 被 Agent 的影响程度是不同的 , 那些有提效需求的场景 , 用户可能会更需要 Agent, 比如点外卖 、 订机酒 , 甚至网购 ,因为有的人网购是享受逛的感觉 ,但也有不少人是希望最快在全网找到最合适的产品 ,以及我们还有大量定期重复的购物需求 。
但超级 App 则会出于广告收入 、 安全等考量 ,在是否接入 Agent 上有一些犹疑 , 比如如果来这些 App 里的 Agent 变多了 , 真人变少了 , 那广告谁来看了 ?
新西罗广告的价值是不是也会变少 ? 又或者在过渡阶段 , 我们也可以设计一种机制 , 让 AI 也能像人那样被 App 里的广告影响吗 ?
如果是这样 , 那广告收入的大头是属于和用户直接接触的 Agent 的提供方 , 还是属于 App 厂商呢 ? 以及更长久来说 , 如果有了 Agent, 平台这种中介形式还会存在吗 ?
会以什么形式存在 ? 还有一个问题是 , 手机上的 AIOS 和 AI Agent 到底是苹果 、 三星等手机厂商自己掌握 , 还是有独立的新机会 ?
而抖音 、 小红书 、B 站 、 优爱腾 、 红果等娱乐内容平台 , 可能受 Agent 的影响就比较小 ,因为我们就是想自己看视频 ,而不是让 AI 来替我看 。
字节的多个主力产品都属于这一类 。 另一方面 ,Agent 对有提效需求的 App 的影响 , 反过来看也是掌握大量生活服务类应用的公司的机会 , 比如说阿里就在 25 年 11 月推出了更新版本的千问 App, 主打生活服务助手 。
阿里做这件事的优势是 , 它旗下有电商 、 购物 、 即时零售 、 外卖 、 酒旅 、 演出票务 、 打车等丰富的生活服务应用 。
接下来值得观察的还有 , 掌握微信小程序这个大量生活服务入口的腾讯会做什么 , 会如何做 。
讲完通用 Agent 来聊垂类 Agent, 这是去年晚点聊在多期节目中展开过的话题 。 比如 136 期的嘉宾 Abarth 的创始人陈面 ,他在 23 年创业之初 , 对 AI 应用的机会有一个两大类五小类的划分 , 分别是生产端的 Office 和 Adobe, 消费端的搜索 、 社交和泛娱乐 。
现在市场上数量最多也被关注最多的 Agent 类型 , 主要就是生产端的这两类 , 比如说 Coding 和通用 Agent, 就是新时代的 Office, 它主要解决通用的办公和流程自动化问题 。
而包括 Abarth 在内的大量图像 、 视频 、 音频 、 漫剧 、 动画等内容制作的 Agent, 就是新的 Adobe。 陈面说 , 之所以他当时选了 Adobe 这个方向 ,是因为这个领域围绕多模态模型展开 , 它离大模型公司的主轴有一定距离 。他认为基础模型公司的核心目标是造一个高智商的通用人 ,而垂类产品就是在通用人的基础上造一个设计师或创作者 , 这些需要更多行业经验和数据的
专用人才 。 应用公司的生存空间正是在于你既能用好通用人的能力 , 又不要去做一个通用人就能直接做好的事 。在更早的 110 期节目中, 我也和明世的夏令详细聊了他更看好的垂类 Agent 的机会 , 夏令也是陈面的早期投资人之一 。他分享了一些和具体行业的具体场景深度结合的例子 , 比如明世投资的爱与智能 , 这是一家法律领域的 Agent 企业 ,他选了一个
利基市场 , 帮银行起诉小额坏账 。 夏令说这个场景在没有大语言模型之前是做不了的 ,因为按以往的处理效率 , 小额坏账的法律成本可能会大于你最后的收益 , 所以一些机构会直接集体损失 。
而 Agent 则可以提高整个流程中的一些核心环节的效率 , 比如筛选成功率高的案件 、 生成法律文件等等。
当然有一个环节 AI 现在是替代不了的 , 就是出庭 。在这类服务上, 夏令也看到了一种新的商业模式 , 为结果付费 , 比如爱与智能 , 它自己同时也是一个律所 。他们的商业模式并不是把开发的这套工具卖给其他律所来赚钱 ,而是直接从小额坏账的起诉方 ,也就是客户端去拿案件 , 然后去找银行等金融机构收服务费 。
我们录这期是在 4 月 ,不久后的 5 月 , 美国红杉在 AI 峰会中也分享了类似的洞察 , 就是 AI 软件要从卖工具 、 卖席位变成卖结果 。
当各类 Agent 的创业创新变得繁荣 ,Agent 的工具链或者说围绕 Agent 的 Infra 也成了一个机会 , 这在软件分工向来更细致充分的硅谷体现得更明显 。
简单来说 , 那些在基础模型和一个完整的 Agent 产品之间的诸多工作 , 都可以算到这个范畴 。 这包括 23 年至今轮番出现的一些趋势 :RAG、Prompt Engineering、Context Engineering、 强化学习环境 、Evaluation 测评 、 状态检验等等 。在 137 期和 MOE 资本两位创始合伙人 Henry Yin 和 Naomi Xia 的访谈中, 我们就从头梳理了 Agent 工具链的发展和他们在硅谷看到的这个领域的各类细分机会 。Henry 当时总结 ,Agent 的工具链已经有
六轮比较大的进化 , 每一轮进化的起点都是因为模型能力上了一个台阶 ,而怎么用好这些模型 , 当时还有 gap, 工具链就是来弥补这个 gap。
我们也梳理了 Agent 的工具链当前的一些主要机会 , 包括语音 、 记忆和评估的变化 ,以及相关的创业公司 。
这期我自己印象比较深的一点是 , 美国软件行业的水平分工真的特别细致 。在一些我几乎都没怎么听过的场景里 ,也有体量不小的公司 , 比如做系统可观测的 Datadog, 做身份认证的 Okta, 都有超过 20 亿美元的年收入 。
而这些软件生态里的流程 , 可能都有被 AI 重新做一遍的机会 。 接下来进入应用部分的第二个关键词 Sora App,其实我是想聊一聊 Sora App 为代表的一大类尝试 , 那就是非效率方向的 AI2C 产品 。他们现在集中于陪伴 、 社交 、 游戏和娱乐领域 , 这个方向不是 25 年才出现 , 之前就有 Glow、Talky、 猫香等产品 ,他们能让用户和 AI 虚拟角色互动聊天 。Peter Spurse 也在 24 年底就推出了手
机上可以玩的 App 版 , 主要是制作和分享 AI 生成的一些视频特效 。25 年 10 月上线的 Sora App 之所以特别引人关注 , 一是这是 OpenAI 推出的 , 它用到了当时 OpenAI 最领先的视频生成模型 , 二是它有 Camio 等交互创新 。Camio 就是可以让用户在授权自己的人脸之后, 生成符合自己外貌的角色 , 可以自己玩 ,也可以和其他的朋友来合拍 。在 136 期对 Lavart 陈眠的访谈和 139 期对视频生成模型及应用
公司 Sand.ai 的创始人曹越的访谈中, 我们都展开聊了当时发布不久的 Sora App,他们刚好代表了两种想法 。 陈面当时很兴奋 ,他说 Sora App 不仅是一个视频生成产品 , 它也是一个社交产品 ,因为 Camio 等功能的设计 , 会让人忍不住把 Sora 安利给身边的朋友 。
曹越则认为 Sora App 是否真的是一个 C 端平台机会 , 还是要观察 。他觉得新的 C 端平台至少要有两个条件 , 一是它能形成一种新的内容形态 , 二是它有新的传播链路 。
曹越觉得 Sora 在这两点上都没有颠覆性的表现 , 它还是更像一个工具 , 很多人会用 Sora 做视频再发到朋友圈 、 小红书 、 抖音或者快手 。
后来的情况是 ,Sora App 在最初的火热之后, 留存率确实比较低 。Sanser Tower 估计 Sora App 在第 30 天的留存率低于 8%, 远小于 TikTok、Instagram 等主流社交应用 。
根据 SQ Magazine 25 年秋天的数据 ,TikTok 30 天的留存率有 42%,Instagram 是 38%。 那么到底是谁在用 Sora 了 ? 去年 11 月 , 我在旧金山遇到了一位围绕 Sora App 做数据服务创业的创业者卢源 ,他在做的产品叫 Sora Stats, 服务 Sora 的活跃作者 , 想帮他们成为这个平台上的 MrBeast。MrBeast 是 YouTube 上制作视频的全球顶流网红 , 卢源当时分享了一些用户故事 ,在他自己运营的活跃 Sora 作者群里 ,有很多不同类型的创作
者 , 包括教师 、Uber 司机等等 ,并不一定是我们想象中的科技从业者或 AI 达人。 我自己玩 Sora App 不久后也关注过一个叫 Kagle Masumalu 的账号 , 我当时完全不知道这个人是谁 ,他也不是像 Sam Altman 那样的 AI 圈大佬 。
这个账号从来不发真人风格的视频 ,不发合拍 ,而是把 Sora 当做一个探索二次元和各种视觉效果的产品 , 内容质量真的不错 , 所以粉丝也涨得比较快 。
后来卢源告诉我 , 这个作者其实是日本一个解密游戏制作人和知名网红松丸亮吾的弟弟 , 松丸惠吾 ,Matsumaru 就是松丸的意思 。他在日本 AIGC 圈也小有名气 。
准备这期节目时, 我发现 Matsumaru 在 Sora 上的粉丝已经有 10 万家了 ,而 Sam Altman 本人是 14 万 。 这个例子背后的一个现象是 , 日本用户是很活跃的 AIGC 使用群体 ,Sam Altman 自己也观察到了这一点 , 所以在 25 年 10 月更新的关于 Sora 的博客中 ,他专门写道 :"In particular, we would like to acknowledge the remarkable creative output of Japan."
他说 Sora 用户与日本内容之间的紧密联系 , 让 OpenAI 团队印象深刻 。其实 Sora 这个名字本身也来自于日语里的 " 空 ", 就是天空的意思 。在日本长期繁荣的 ACGN 文化 , 确实和 AIGC 有很强的亲和性 , 日本有大量搞同人二创的爱好者 ,AI 工具能进一步放大他们的脑洞和创造力 。
总之 , 确实有人在长期使用 Sora App,但它也并没有如之前的一些期待那样快速在更广泛的人群里扩散 。 除了 Sora App 带来的对 AI YouTube 的想象 ,也有一些创业者在挑战一些看起来存在已久没有什么机会的领域 , 比如说通信软件 , 比如说语音输入法 。25 年我们就报道过一位非常年轻的创始人,25 岁的陈春雨 , 她在旧金山做了一款聊天软件 Intent, 主要服务的就是当地说
西班牙语的人群 ,而他们有一个之前的产品还没有解决的很好的需求 , 就是更简单 、 更方便的翻译 ,而大模型可能大幅提升翻译的体验 。
语音输入法也是个类似的例子 , 输入法是一个非常高频刚需的产品 ,而语音输入法大部分手机和通讯软件也都会自带这个功能 ,而像 Tablets 这样的产品却仍然做出了差异化和声量 。
我自己最近就经常用 Tablets, 相比微信和飞书自带的一些语音功能 , 我觉得 Tablets 的准确性确实要更好一些 , 它在帮你改正文本以及结构化的去组织文本上都有更强的能力 。
而且你经常使用的人名和专有名词 , 它也会放到产品的记忆里 。 这个说起来和搜狗输入法是类似的体验 ,但确实在之前的语音输入法里好像都没有人去做这种细致的功能 。
陈面曾预言 26 年会是 AI2C 产品爆发的元年, 我们可以期待一下市场上会出现什么新东西 。 接下来进入应用的最后一部分 ,AI for Science。140 期中我访谈了 2018 年成立的绅士科技的两位创始人, 张凌峰和孙伟杰 ,他们完整讲述了自己亲历的用 AI 加速科学发现的发展脉络 。
绅士的经历刚好涵盖了几种不同的探索 , 一是在 2016 年前后用机器学习来简化量子物理的第一性计算 , 这种计算有非常明确的物理公式依据 , 包括薛定谔方程 、 密度泛函理论和分子动力学方程等等 ,他们能计算物质的性质 , 对生化环材领域很有用 ,但以往的难点是这些方程的计算太复杂了 , 很难从微观尺度进入更大的尺度 , 这就限制
了应用 。 张凌峰创业前在普林斯顿读博期间的一个主要成果 DPMD, 就是用机器学习的方法找到了一种不损失精度但又能提升计算效率的方式 , 甚至后来以此推出了用于药物研发的计算平台产品 Ermite。
二是使用深度学习和深层式 AI 来解决一些科学问题 , 典型的代表是后来获得诺贝尔奖的预测蛋白质结构的 AlphaFold, 绅士也有类似的模型 Unifold。
而在大语言模型更成熟后, 能覆盖更完整的科研流程的 Agent 也成为了一个方向 , 这既包括物质世界的科学研究 , 比如前面提到的用 AI 和自动化技术来支持从文献研究到提出假设 、 涉及实验 、 完成实验 , 再到验证假设的科研全流程 ,也包括一个特别的方向 , 用 AI 来提升 AI,也就是让 AI 来做 AI 研究员的工作 。
这个想法很典型的体现了 AI 技术左脚踩右脚的发展特性 。 这里推荐我去年看过的一本很有收获的书 , 经济学家布莱恩 · 阿瑟的 《 技术的本质 》。
这本书总结了技术具有的自我繁殖的特性 , 阿瑟对技术的定义是完成特定目标的手段和解决方案 。
技术的起点是人类对一些原始物理现象的捕获 ,而从那时起 , 两股交织的力量就开始推动技术的自我繁殖 。
一是在供给上, 历史上已经存在的技术会通过新的组合方式产生新技术 , 旧技术越多能产生的组合就越多 。
同时, 像望远镜 、 测量器具等观测技术的发展 ,也使实验方法逐渐成熟 , 这又加速了人类对更多新的物理现象的捕获 。
这是最近数百年里现代科技从萌芽到爆发的过程 。 第二股力量是在需求上, 我们对新技术的需求不仅来自人, 也来自技术自身 ,因为每当一种技术出现 , 它往往就会带来改进自己或降低成本的需求 , 它也会带来新的要实现的目的 , 这就需要新的解决手段 。
比如当我们能识别一种疾病后, 就会想发展能治疗这种疾病的新技术 。 这本书写于 2009 年, 大模型如今的快速发展并不是作者主要的观察对象 , 那时他写道 , 技术的这种自我进化 、 自我拓展 ,是通过人类发明家这个中介来实现的 。
而也许不久之后, 我们就会看到逐渐成型的 AI 发明家 , 那会是一个信息广度 、 计算能力都远超人类个体的系统 ,而且不眠不休 。
一个问题是 , 我们做好准备了吗 ? 又可以提前怎么准备了 ?
聊完了模型的进展和 AI 应用市场的变化 , 下面进入喜闻乐见的商战部分 , 第三章巨头的 AI 之战 : 字节 、 阿里 、 腾讯 。
巨头之战40:28
关键词人才和组织之战 ,2C 应用大战 , 即将到来的春节之战 。 从这一轮 AI 热潮的起点开始 , 晚点一直在跟踪报道互联网大公司 , 尤其是中国大公司的 AI 动向 ,其中最有实力的是三家公司 : 字节 、 阿里 、 腾讯 。在 25 年, 我们对这三家公司的 AI 动作有两轮集中报道 , 一是在春节后, 我们陆续发布了四篇报道 , 分别是高虹浩撰写的 《 腾讯在 AI 拐点到来前的
700 天 》, 王雨彤撰写的 《 字节 AI 再创业 : 独立组织 、 全链条的饱和攻击 》, 管弈文撰写的 《 重新认识阿里 : 大踏步迈向 AI》, 贺倩敏与黄真心撰写的 《 字节 、 阿里 、 腾讯的 AI 人才竞争 :2330 个研究者背后的共识与分歧 》, 二是前不久刚发布的高虹浩撰写的 《 字节 、 阿里 、 腾讯 AI 大战全记录 》。
这些报道涵盖了我们观察科技巨头怎么做 AI 的几个关键视角 。 首先是人才和组织 , 这直接关系各个公司最底层的模型实力 。
先说字节 , 字节的整个 AI 大部门相对独立 , 它试图营造一个小环境 ,以创业公司的方式去做 AI,以摆脱十几万人组织的庞大重力 。在 25 年之前 , 字节的情况是成立了相对独立的 AI 大部门 ,其中分为负责产品的 Flow、 负责模型研发的 Seed 和主要做产品后段研发支持的 Storm, 这三块的负责人一开始都是字节老人,Musical.ly 的创始人朱俊负责 Flow, 豆包产品团队也在这个部门 。2015 年就
从百度加入字节的朱文嘉负责 Seed, 同样是来自百度 ,2014 年加入的洪定坤负责 Storm。 今年字节 Seed 有了新的研发一号位吴永辉 , 吴永辉是 Google DeepMind 的前研究副总裁 。
一位从业者曾像我这样评价吴永辉 :" 是大佬级别的技术管理者 , 能镇得住场子 。" 为什么镇得住场子很重要了 , 这和字节补充 AI 技术人才的顺序有关 。在吴永辉于 25 年 2 月正式加入字节之前 , 整个 24 年字节先是陆续补充了一批年轻的技术骨干 。
这件事的起点得回到 2023 年夏天 , 当时字节本来已经打算投资 MiniMax 和 JW 星辰这两家中国的大模型创业公司 ,但在一次高层会议后, 张一鸣明确的表态 , 字节应该自己做大模型 ,而且也能做好 ,不用对外投资 。
紧接着 , 字节高层包括张一鸣本人, 从 23 年年底开始密集的见人招人。 我们在 93 期节目 《 字节 vs 六小龙 》 中就聊到过一个小故事 , 时说 24 年的时候 , 一位投资人像往常那样顺着 AI 论文去拜访作者时, 惊讶的发现不少人说 " 我刚和一鸣见过 ", 这其中还有一些没有毕业的博士生 。
字节这一轮的招人成果 , 包括来自 Google 的蒋璐 、 来自面壁的秦宇佳 、 来自零一万五的黄文浩 、 来自 Jupyter 的丁鸣 ,以及当时很受市场关注的阿里千问模型的前负责人周畅 。
当汇聚了多个在业界有名气 、 有影响力 、 又处于事业上升期的技术 leader 之后, 字节显然需要一个能让他们服气的领导者 。在 Google 工作多年、 带过 AI 研发团队的吴永辉符合这个画像 。
另一方面 , 字节陆续收集的这批年轻的中坚力量 , 可能也是吸引吴永辉这类资深人士加入的原因之一 。
吴永辉 、 周畅等人的加入 , 让 Seed 的研发团队的构成也发生了变化 。 相比最初组建时,Seed 里从字节搜广推部门调来的人的比例降低了 , 直接做大模型和深层式 AI 技术的人的比例上升了 。
所谓 AI native 人才 , 精兵强将 、 团队充裕也带来一个问题 , 就是激烈的内部竞争 。 以视频生成为例 , 字节内部有好几个团队都在做 ,在 Google 开发了 VideoPort 的蒋璐后来也离开了字节 。
不过对整个组织来说 , 这可能是一个次要问题 ,因为团队成员在一些方面工作体验差 ,并不一定影响整个组织实现目标 。
这里也分享一位 AI 技术 leader 对赛马的一个有趣的总结 ,他认为原初意义的赛马是好事 , 不同团队可以去做同一件事 , 才能试出来谁更强 。
但不好的是把赛马玩成了拳击 , 区别在于赛马是跑完这轮还有下轮 , 一个人或者一个团队在组织里有翻盘的机会 , 拳击则是败者退场 。
更不好的一件事是直接指定你干这个 ,他干那个 ,因为面对 AI 这样快速变化的技术和机会 , 可能一开始很难确定谁干什么最合适 。
然后是阿里的组织 , 自从 24 年周畅离开阿里加入字节后, 阿里的 AI 团队没有出现特别大的人事变动 。
整个 AI 一号位一直是已经加入阿里 10 年的周静仁 ,他是阿里云 CTO 和负责阿里大模型研发的通义实验室的总负责人。
周静仁也在 25 年晋升成了阿里的合伙人 ,他成为合伙人的关键因素之一 , 就是通义实验室在过去一年里保证了 Claim 系列模型的领先地位 。
周静仁之下, 整个通义实验室主要有三个团队 , 一是训练阿里主力大模型 Claim 系列模型的千问 ,由 90 后的林俊洋负责 ,他是阿里自己培养的人才 。2019 年从北大计算语言所硕士毕业后就加入了阿里大摩院 。
顺带说一句 ,23 年组建的 DeepSeek 里也有多位来自北大计算语言所的同学 , 这可能是因为清华的研究生和博士生如果想实习 , 得优先去他们的导师开的公司 。
通义实验室的第二个团队是训练图像 、 视频生成等多模态生成模型的通义万象团队 。 第三个就是 25 年 2 月新加入阿里的许褚红负责的团队 , 做多模态交互模型 。
和 23 年新组建的 Seed 不同 , 通义实验室有更长的历史 , 它最初是合并了大摩院和 AI 最相关的几个实验室 , 这也导致它在薪酬激励上没有那么独立 。24 年底前后, 通义给模型研发团队普遍涨了薪资和职级 , 这被解读为一种对市场行情的回应和调整 。
而一开始这种并非高举高打的做法 ,也给了阿里意外之喜 , 就是主要研发 Claim 系列模型的千问团队 ,是从内部相对边缘的角落里自下而上生长的 , 团队规模也小而精 。
它在初期聚焦于研发开源的大语言模型 , 逐渐形成了很好的社区影响力和开发者生态 , 成了一个相对强势自驱 、 愿意探索更多领域的团队 。
比如现在千问也在做具身 VLA 模型 , 招募自己的 AI infra 人才等等 ,他们也上线了直接面向普通用户的 Web 端产品 Claim Chat, 网址是 chat.claim.com, 想让更多人直接体验 Claim 的最新能力 。
据我们了解 , 周静仁对千问的管理比较放权 , 给了很多空间 。 阿里大模型的开源也是周静仁最早提出并一直坚持的 。
同时,25 年通义有多位加入大摩院多年的老人陆续离职 , 包括原自然语言处理方向负责人黄飞 、 原语音团队负责人鄢智杰 、 原应用视觉团队负责人薄烈峰等等。
最后说一下 25 年年底密集变化的腾讯 , 标志性节点是今年秋天前后, 前 OpenAI 研究员 ReAct 的作者姚顺雨加入腾讯 。12 月 , 腾讯官宣姚顺雨出任腾讯总裁办首席 AI 科学家 , 向腾讯总裁刘视频汇报 , 同时兼任 AI infra 部和大语言模型部的负责人, 向腾讯技术工程师也群 ,也就是 TG 的总裁卢珊汇报 。
姚顺雨是典型的年轻的 AI 原生人才 , 出生于 1998 年, 今年不到 30 岁 。24 年从普林斯顿博士毕业后加入 OpenAI。 姚顺雨加入腾讯后已经看到三个明显的变化 , 一是她在密集的见人招新人, 比如最近刚从 DeepSeek 招了王炳轩 , 王炳轩和姚顺雨是同龄人, 研究生期间就在 DeepSeek 工作 , 参与过 V1 和后续模型的研发 。
二是制定一些新的团队目标 , 比如姚顺雨提出混元之前表现不好的原因之一是太盯着外部的 benchmark,在打搒上很强 ,但是实际使用体验不一定好 。
三是前面提到过的 , 她在内部也提了协同设计的重要性 , 这带来了一些组织调整 , 比如腾讯已经把 infra 部门划归姚顺雨统一管理 , 和字节先收集了一波年轻的技术骨干再引入资深技术管理者不同 , 腾讯在招募姚顺雨之前没有太多闪耀业界的 AI 明星 ,而姚顺雨又是一位非常年轻 、 此前没有太多管理经验的研究者 , 这对一向稳健的腾讯看起来是一个激进
的组织选择 。 这可能是因为在模型研发上相对落后的腾讯确实需要变化 , 所以有人说姚顺雨像是腾讯引入的一条鲶鱼 , 这可能也和 DeepSeek 的启发有关 。DeepSeek 就是靠一群集中在 95 后的年轻研究员 ,而非海归博士和 AI 明星做出了惊艳世界的模型 。
当然 ,85 后梁文峰的角色也很关键 ,因为同时接触过姚顺雨和梁文峰的人事评价 , 梁文峰在对大模型各个环节的覆盖程度和理解上 ,是他见过的人里无人能及的 。
腾讯如今的组织调整会在 26 年看到更多结果 。 关于大科技公司的 AI 人才和组织 ,也推荐晚点聊 134 期节目 《Meta AI 人才动荡 : 上亿美元为何留不住人 》。
这期节目的嘉宾是在 Meta 工作过 7 年的企业级通用 Agent 的产品 Pokey.ai 的创始人朱哲青 。 这期节目里 , 我们也讨论了美国其他的核心 AI 玩家 Google、OpenAI、Anthropic、XAI 等公司的组织风格和人才吸引力 。
一个有意思的区别是 ,在美国 OpenAI、Anthropic 等新的 AI 公司的人才吸引力是最大的 ,而在中国巨头更有吸引力 。 借用 MiniMax 创始人严俊杰接受我们采访时的一句话 , 客观来说 , 字节的 AI 人才密度是最高的 。
对巨头之战的第二个观察视角是各公司的应用布局 。 首先想说的一点仍然和组织有关 , 就是模型团队和产品团队之间的关系 。
这里我想到了今年和 Sand AI 曹越聊时, 她从 Sora App 能如此巧妙的利用模型的一些特性和能力来开发新的 feature 和交互 , 得到了一个重要的启发 , 就是 OpenAI 做到了从产业到模型的很好的垂直整合 , 产品需求的梯度可以回传到模型 , 这是一个端到端的组织 。
如果以这个标准来看 , 中国三家大公司中, 字节在模型和产品上的协作是最紧密的 。 这一年我们和多维 C 的研发人员和 Flow 产品团队的人都交流过 , 综合感受是两个团队的协作很多 。Flow 的一些中层认为 ,Seed 的模型支持还是比较给力的 ,有一起为产品服务的意识 。
字节在一些官方表述中也有强调这种协作 , 比如 25 年初字节定的三个 AI 大目标是探索智能上限 、 探索新的 UI 交互形式 、 加强规模效应 。其实加强规模效应这一点很值得细品 ,因为传统软件互联网服务天然就有规模效应 , 可以制作一个标准版本 , 然后以较低的编辑成本多次售卖 。
所谓 build once sell many times,但大模型产品却不同 , 它每次被调用都得消耗算力 。 这一点上它很像每个产品都有部门成本的制造业 ,而且现在字节的主力产品豆包是免费的 , 用的人越多 , 算力成本就越多 , 那规模效应体现在哪了 ?
答案可能在 25 年 1 月豆包 1.5 Pro 的官方博客里 , 关键词是数据飞轮 。 完整的描述是依托字节在推荐 、 搜索和广告领域的 A/B test 的经验 , 研发了基于用户反馈的高效 poster training 全流程 。
基于豆包的大规模用户反馈 , 我们构建了从问题发现 、 数据挖掘 、 人机结合标注到快速迭代的闭环优化系统 , 通过用户数据飞轮持续提升模型的实际使用体验 。
注意这里飞轮的两端是大规模用户反馈和模型实际使用体验 ,而不是模型性能本身 ,因为现阶段大量普通用户的反馈其实不能直接提升模型能力 , 要让模型变强还是得靠研发流程和研发人员的努力 。在 25 年初和 MiniMax 创始人严俊杰录制的 99 期节目中, 我们详细讨论过这个问题 , 当时那期的标题就是 " 做大模型千万别套用移动互联网的
逻辑 "。 而字节对规模效应的表述可能反映了他们在努力发挥过去积累的移动互联网的经验和基础设施 , 从豆包的增长看确实取得了一定的效果 。
而腾讯和阿里在 25 年都经历了模型研发和 AI 产品的团队重组 , 最开始腾讯的混元大模型和元宝都在 TEG 技术与工程师也群 ,但 25 年之前腾讯在这两个方向的成果都落后于其他大公司 , 腾讯体系的诸多其他产品也在自己尝试 AI 转型 。
所以年初的一次腾讯总办会决策 , 要把原本分散在各个事业群的 AI 应用放到同一个事业群 , 最终 CSIG 就是汤道生负责的云与智慧事业群接下了这个任务 。
原本在 TEG 的元宝 , 原本在 PCG,也就是平台与内容事业群的 QQ 浏览器 、 搜狗输入法和智能工作台 AMA 都汇集到了 CSIG,而混元也就是腾讯的大模型研发团队依然在 TEG。
所以腾讯目前的模型和产品是在两个不同的事业群 , 腾讯能不着急的最大底气微信则一直是一个单独的事业群 。
就在上周 , 微信封掉了腾讯元宝 APP 为春节大战准备的 10 亿元红包链接的群分享 , 微信官方发布的声明是说这是要整治过度营销和诱导分享 。
这个小插曲背后是这样一个疑问 , 微信能在多大程度上参与腾讯的 AI 布局 ? 毕竟微信已经是一个国民级应用 , 每做一个调整都要考虑 10 亿级用户的感受 , 阿里的情况更复杂 。23 年 10 月阿里上线了通义千问 APP, 当时这个产品和通义实验室一样都在阿里云旗下, 到 24 年底 , 通义 2C 产品团队从阿里云剥离 , 滑到了无加管理的智能信息事业群 。
所以阿里是把产品和模型团队从同一个事业群调到了两个不同的事业群 , 这种组织调整也伴随着复杂的应用布局的变化 。
三家公司对比来看 , 字节和腾讯的 AI 主力应用长期来说都是 23 年大模型热潮之后专门为大模型新开发的豆包和元宝 ,而阿里则经历了通义千问与夸克的双线轮换 ,而且光通义千问就改了两次产品名称 。
先是 23 年 10 月通义千问 APP 正式发布 ,不久后的 24 年春节 ,因为跳洗澡舞的奶流小猫走红 , 通义千问 APP 也小火了一轮 。
这个小猫就是用通义千问里全名舞王这个功能做的 。 当时晚点聊也做过一期节目 , 和那会儿还没有从阿里离职的薄烈峰聊过全名舞王背后的多模态技术进展 。
同期早在 2016 年就上线 , 当时隶属于智能信息事业群的夸克浏览器也加入了 AI 搜索等功能 , 成为阿里另一个比较主要的 AI 产品 。
然后是到了 24 年 5 月 , 通义千问 APP 改名为通义 。 接下来就是前面提到的 24 年年底 , 通义 2C 团队直接被整个划到了夸克所在的智能信息事业群 。
不久后, 夸克明确成为了阿里的 AI 旗舰应用 , 标志性事件是 3 月升级的新夸克打出 AI 超级框的概念 。
吴家在内前后接受晚点采访时说过 , 希望夸克成为中国第一个日活过亿的 AI 产品 。他当时预测的时间是 25 年底或 26 年上半年, 当然我们后来知道是字节的豆包在 25 年下半年率先实现了日活过亿 。
随着夸克成为旗舰应用 , 被并到同一事业群的通义有一种被打入冷宫的感觉 ,但转眼到了 25 年年底 , 通义又西飞回宫并再次更名变成了千问 APP, 它也取代夸克 , 成了阿里巴巴争夺 AI 超级入口的核心角色 。
说实话 , 阿里的这番调整看起来有些头痛医头脚痛医脚 。 最初通义 APP 的问题确实比较明显 , 就是功能太多了 , 展示层级也没什么重点 ,不知道想让用户做什么 。在整个 24 年, 相比同类 chatbot 的产品 , 比如豆包和 Kimi, 千问的表现不温不火 。
当时管理这个产品的阿里云的战略重点 ,也主要是拓展 AI 云业务 , 开发大模型和做模型生态 。 这可能是后来阿里把 2C 产品团队都调到吴家管理的智能信息事业群的原因 。
而且阿里当时认为 chatbot 会最先颠覆搜索 , 从夸克浏览器入手改造搜索体验 ,是通往 AI 产品最顺的路径 。
但当夸克在 25 年接棒后, 表现也不如人意 , 它吸引来了很多长线的用户 ,而夸克的老用户还是习惯使用这个产品的传统功能 , 比如网盘和搜题 。
毕竟夸克都已经上线 10 年了 , 它已经积累了一些大模型之前的用户习惯和使用方式 。 最后就是刚刚发生的通义 APP 改名千问 APP 卷土重来 , 这次的新主题是前面聊到过的接通阿里生态里的生活服务 , 成为一个全能 AI 助手 。
之前在投放上相对克制的千问 , 现在也一改风格 , 单日投放峰值一度达到 1500 万元 。 一些在阿里的朋友对阿里如今的 AI2C 产品的打法比较悲观 , 认为刚改头换面的千问 APP 还不是一个非常成熟的产品 , 这实就上这么大规模的投放很难有实质效果 , 尤其是千问面临的是强劲的对手豆包 。
字节的整个 AI 应用布局现在是豆包加其他产品的一超多强 , 豆包是中国第一个日活过亿的 AI 产品 , 它的对手一直在变 。24 年上半年是靠长文本异军突起的 Kimi,25 年春节是爆火的 DeepSeek, 进入 DeepSeek 的腾讯元宝也一度跻身前三 ,但豆包是长期的第一 。
而且豆包也已经开始出海 , 它的海外版 Dola 现在的全球日活也已经超过了 1000 万 。 豆包之外, 字节在各种能尝试的 AI 产品方向都做了饱和式的攻击 ,有 AI coding 产品 TRAY 搭智能体的 codes 做教育的豆包爱学 , 此前还有角色互动产品猫箱 ,以及 Flow 之外有抖音的张楠负责的即梦和新会等等。
我们也报道过字节对豆包的投放相对克制 ,因为团队看到大模型能力不够时, 大规模买量的留存并不好 。
作为移动互联网跑出来的 APP 工厂强者 , 字节有一套优秀的投放增长和产品运营机制 ,而且字节自己就掌握流量渠道 , 它的投放成本也相对低 。
豆包也日渐发展出了自己的人设 , 不同于 ChatGPT 理性专业的办公室精英画风 , 豆包的画风亲切日常生活化 ,也很好玩 。
比如我关注了一个抖音的 APP 叫阿康的憨憨生活 , 内容就是他和豆包日常互怼互夸 , 被粉丝戏称为在抖音最爱看的情侣 。
豆包团队也在有意运一些内容玩法 , 比如有了视觉多模态的能力之后, 最近很火的一个玩法就是让豆包指导自己的穿搭 。
不少创作者都在自发的靠这些豆包内容起号 , 这些内容在抖音上的二次传播又有可能吸引更多新用户来使用豆包 。
但字节目前的这个布局有一个错位的地方 , 就是它增长最强用户最多的豆包 APP 是一个免费产品 , 整个 AI 产品部门的收入则来自 TRAY codes 等面向更专业人群的工具属性更强的产品 。
豆包 APP 已经出现了一些商业化探索的迹象 , 比如 11 月时豆包上线了商品卡这个功能 , 会在对话里触发一些产品和服务的购买推荐 。26 年值得观察的一个问题就是豆包 APP 会有哪些更多的商业化动作 , 效果如何 。
最后讲一下腾讯的元宝 , 腾讯之前自研的混元模型能力相对弱 , 这让腾讯接入 DeepSeek 时是最没有包袱的 。
它是第一个全线产品全部接入 DeepSeek 的大公司 , 元宝 、QQ 乃至微信都接了 DeepSeek。 元宝的日活也在那之后快速增长 ,2 月底最后一周就涨了 10 倍 。
元宝的最新尝试是增加了一个 AI 社交板块元宝派 , 这个功能打通了微信 QQ 的社交关系 , 就是你把链接分享给微信或 QQ 的好友之后, 好友就能加入元宝里的这个派 ,其实就是一个群 , 只不过每个群里都有一个 AI 元宝助手 。
总结这三家公司的整体特点 , 腾讯更重视 AI 应用落地 , 之前的策略是等待模型能力更成熟的拐点到来 。
阿里强调从算力到云到模型的整合 ,也在开发者生态上很有成绩 , 已经成了全球开源模型生态的重要角色 。
字节跳动是建立了一个相对独立的国中之国 ,以创业公司的方式来做 AI, 比如说豆包团队是有单独的豆包股的 , 它的薪酬和激励制度以及考核方式也和字节别的部门不太一样 。
同时字节很强调模型和应用并重 ,并在二者之间建立了他们所说的数据飞轮 。 巨头之战的最后, 展望一下即将发生的春节之战 , 今年豆包拿下了春晚合作 , 元宝祭出 10 亿红包 , 千问随后就宣布了 30 亿红包 。
同时选在所有人头上的一个变数是 DeepSeek V4 到底什么时候发 , 效果如何 。 很有可能我这期节目发的时候 V4 就已经发布了 , 如果 V4 节前发 , 对腾讯的春节攻势应该是一个利好 。
虽然现在这个阶段第一梯队模型之间的差异 , 大部分人可能已经感觉不出来了 ,但 DeepSeek 还是有很强的品牌效应 ,而元宝又是中国大公司的产品中和 DeepSeek 绑定最紧密的 。
我觉得唯一比较确定的是 , 这个春节各公司的 AI 从业者大概率又享受不了一个完整安逸的假期了 。
创业公司1:01:29
第四章 AI 创业公司们关键词大模型第一股 5000 万美元收入全球化与中美之间关于一些应用的具体方向和趋势前面在应用部分已经有讨论所以这里想重点讲一下 AI 创业的商业进展和一个中国创业公司要面临的特殊问题全球化 25 年至今 AI 创业市场的一个节点事件是 26 年 1 月中国出现了两家前后脚上市的大模型公司智谱和 MiniMax 两家公司登陆二级市场的意义是
公布了详细的财务情况也能看到资本市场对基础大模型创业公司的定价之前的一种观点是中国大模型头部创业公司的模型能力并没有比美国最领先的公司差太多而估值则差了两个数量级在智谱和 MiniMax 上市之前中国一级市场最贵的大模型公司估值在 30-40 亿美元左右而 OpenAI、Anthropic 的估值已经分别来到超过 7000 亿美元和 3500 亿美元中国大模型创业公司太便宜了但如果
从收入来看也可以得到另一个结论上周五 2 月 7 日智谱收盘后的市值是 794 亿元人民币 114 亿美元 MiniMax 是 1284 亿人民币 185 亿美元与 OpenAI、Anthropic 的差距缩小到了一个数量级但他们的收入比这些美国头部公司小了 2-3 个数量级智谱 25 年上半年的收入是 1.9 亿元人民币约 2700 万美元 MiniMax 25 年前三季度的收入是 5300 多万美元而 Sam Altman 最近自己说过 OpenAI 25 年的实际收入远超 130 亿美元 The
Information 则报道 Anthropic 25 年的实际营收将达到 45 亿美元当然所有这些中美 AI 基础模型公司都在巨额亏损一方面在技术竞争中他们要投入大量资源做后续的研发另一方面大模型应用有我们前面聊到过的制造业的特点它每次被调用都得消耗算力成本 ToB 的 API 调用可以按用量收费而对 OpenAI 这样有非常大体量的 2C 产品按照固定的订阅金额来收费的公司亏损
可能会更多 25 年 11 月华尔街日报引用了伯恩斯坦分析师从微软三季度财报的投资亏损里估算的数据认为 OpenAI 当季的亏损就达到了 120 亿美元近期的市场消息是 OpenAI 和 Anthropic 都计划最早在 26 年底 IPO 中国大模型第一股的竞争比美国早了整整一年原因之一是整体来说中国一级市场能继续支持大模型创业的钱没有美国那么充沛而上市则能拓展定增等快速大规模
的融资手段所以在 MiniMax 上市当天的融资故事报道里我是这样总结的对比移动互联网的几次上市盛宴大模型领域的 IPO 并不发生在大战告一段落之后它不是对胜者的奖赏而是下一轮竞赛的鼓点其实我还有一个没有写出来的更直接的想法就是 IPO 也是续命保命的安全网好消息是还没有上市的依然在研发基础模型的中国头部公司也没有多少其中 DeepSeek 是一
个不太依靠外部融资的创业公司它有来自幻方的资金支持而 Kimi 和 JEYUE 都在近期宣布了大额融资 Kimi 创始人杨志霖发内部信宣布获得 5 亿美元融资的那天就是 MiniMax 公布上市日期的同一天中国愿意支持模型创业的潜在变少还有另一个直接表现就是从 24 年到 25 年欧美仍在出现 Neolab 就是一批新的基础模型公司而且能持续获得融资比如 24 年有 ILLIA 创立的 Safe Superintelligence 有
Reflection 25 年有 OpenAI 前 CTO Mira 创立的 Thinking Machines Lab Meta 的乐坤也离职创立了 Advanced Machine Intelligence Labs 还有最近在 OpenAI 已经工作了 7 年的研究副总裁 Jerry Torik 也离开 OpenAI 创立了 Core Automation 他是 O1 和 O3 的负责人近期他公开分享说离开 OpenAI 的原因之一就是他认为现在在这里已经很难推进高风险的前沿研究而在国内从 23 年下半年开始新的基础模型公司就很难成立和获得初始资金了一些基础模型背景的
从业者也在转战后面我会展开讲的另一个方向具身智能所有这些上市没上市的中国大模型创业公司都面临巨头在人才 、 产品和生态上的巨大竞争压力这里可以简单回顾一下之前提到的 93 期字节 VS 六小龙里聊到的一个观察就是如今的大模型创业和当年移动互联网创业相比有一个明显区别大模型是有新软件但暂时还没有主流的新硬件而当年移动
互联网是新软件和新硬件同时出现 iPhone 开启了智能手机浪潮 App Store 又繁荣了应用开发生态从电脑到智能手机的硬件换代带来了 APP 的强劲自然增长比如字节跳动早期有一个拉新的方法就是和经销渠道合作让店员在给客户卖手机的过程中下载安装字节系的 APP 而大模型产品目前要么是运行在 Web 端要么是试图进入手机但会遇到一些阻碍他们仍
然生长在互联网移动互联网这个大环境里现存的巨头不仅掌握着这里的渠道流量入口也有一套历经打磨的增长方法论和组织同时中国有钱到能买下模型创业公司的巨头现在看起来也没有什么收购意愿他们都在发力自研模型这是阿里 、 字节 、 腾讯的共同选择所以这批基础模型创业者是在打一场更难的游戏他们之中有现在最有野心的创始
人他们选择以研发模型 、 正面钢的方式成为下一个时代最重要的科技公司理论上这条路的上限很高但事与愿违的风险也非常大对这类公司而言仅仅生存下来而没有达到足够体量的成功也可以算是一种失败这部分的第二个关键词是 5000 万美元收入我会主要讨论自己不欲训练大语言模型的 AI 应用公司在 25 年的商业表现之所以划 5000 万美元这条线也有一些拍脑袋的
成分一是这是一个初具规模的收入二是它大致和两家刚刚上市的大模型创业公司在一个量级根据公开资料全球 ARR 大于等于 5000 万美元的 AI 原生企业大概有 40-70 家这里面有很多大家耳熟能详的名字包括做 AI 搜索的 Perplexity 做 Coding 的 Cursor Lovable 做图片生成的 Midjourney Higgsfield 做视频生成模型的 Runway 做语音模型的 ElevenLabs 做 AI 虚拟人视频生成的 Heygene Synthesia 和做法律 AI 的 Harvey 等等这里稍微
解释一下 ARR 它是年度经常性收入或者叫年化收入是用某一个时间段的订阅收入折算到一年里的结果所以对快速增长的公司来说 ARR 收入是大于实际的年收入的这些 ARR 超过 5000 万美元的公司主要集中在以下几类 AI Coding 内容创作的 Agent 以及和法律 、 教育 、 医疗等行业场景结合的产品其中最知名的有中国背景的团队是做通用 Agent 的 Mallows 的蝴蝶效应它在 25 年 12
月底被 Meta 以 20 亿美元收购这是一个童话故事创始人可能没有走到他原本设想的更遥远的目的地但投资人和团队都获得了不小的回报 Mallows 现在的团队有 100 多人其中有一些已经跟随萧红创业 10 年经历了好几个公司相当比例的 Mallows 员工有公司的期权其他收入达到 5000 万美元的中国背景的公司还有同样做通用 Agent 的 Jens Park 他由前小度 CEO 景坤创立 25 年 9 月底时他对
外称 ARR 已经达到了 5000 万美元另一家公司是本科时期就前往美国的 Coco Mao 等人创立的 AI 绘图产品 OpenArt 在最近 Coco 自己更新的 01 博客里他说这个刚刚 20 人的团队 ARR 已经来到了 7000 万美元而接近这一收入量级的还有 LaBeArt 和 Pixverse LaBeArt 在 25 年 10 月时宣布 ARR 超过了 3000 万美元当时这个产品刚上线了 4 个月而 Pixverse 去年总的收入据我了解已经超过 4000 万美元在 119 期节目中我
们访谈了 Pixverse 的联合创始人谢旭章视频生成公司比较特别的一点是其中有一些会自己训模型比如 Pixverse、Sanator.AI、Vivix、 声束等等这和前面讲到的一个现象有关就是多模态生成并不是所有基础大模型公司都会投入的方向在技术上它和大语言模型的主轴并不完全重叠这就创造了一个独特的创业空间类似的还有做语音模型的公司比如估值已经来到 110 亿美元的 ElevenLabs 这里也分
享一个有意思的搒单是在旧金山的一位创业者 Henry Shi 制作和维护的 Top Lean AI native Companies Leadboard 搒单的链接我也会贴在 shownotes 里 Henry 做这个搒单是他相信 AI 会催生人数很少但收入很大的公司所以这个搒单收录了满足以下条件的公司 ARR 年化收入大于等于 5000 万美元雇员少于 50 人成立时间短于 5 年同时也收录了人均收入大于 100 万美元但总的年化收入还不到 5000 万美元的公司
他想用这个搒单来衡量 AI 团队的创收效率 Top Lean AI 的最新版本有 44 家 AI 公司其中收入真正大于等于 5000 万美元的是 14 家一方面可以看到 AI 创业团队的数量非常多而且人效很高比如 Top Lean AI 里收录的这些人均收入超 100 万美元的公司又比如最近席卷全球 AI 圈的 OpenClaw 它就是一位奥地利的开发者 Peter Steinberg 发起和主导的 Peter 完成了绝大部分的核心开发而另一方面
真正收入超过 5000 万美元的 AI 应用公司也没那么多如上面提到的大概在 40-70 家不知道这是比你想象中多还是少了基础模型公司也可能会蚕食和挤压一些纯应用创业公司的市场尤其是那些空间大价值高的方向比如 Coding 通用 Agent 比如营销教育和健康管理场景等等总的来说相比基础大模型公司 Go Big or Go Home 要么大要么死的残酷游戏数量更庞大的 AI 应用团队
他们可以选择更多样的活法可以探索小而美的极致可以寻求被收购也可以在一些大公司暂时不想做或做不好的缝隙里先立足再谋求更深入的发展比如 Perplexity Cursor 这类从应用起步的公司也在向底层拓展自己做一些模型训练创业公司的最后一点讲一讲全球化与中美之间这里想简单分享一下三个 AI 创业团队的对比一是 Heygene 前面也提到了这是一家年化收入已经超
过 5000 万美元的公司做视频数字人生成主要面向营销销售等场景两位创始人张旭华徐徐卓和威尼梁梁旺都有中国背景 Heygene 刚创立时在旧金山和深圳都有团队国内的主体叫诗云科技而早在 23 年 12 月诗云就注销了这是一个在 AI 还没有那么出圈没有那么被关注时早早做出选择的例子二是最近大家讨论很多的 Mallows Mallows 在 25 年 6 月把总部迁到了新加坡这
是一个从地理到市场角度都相对折中的选择在年底官宣被 Meta 收购后今年 1 月中国商务部称将会同有关部门对这项收购做合规性审查三是最近正在独立寻求融资的原 MirrorMind 的中国研发团队 MirrorMind 就是前面在模型那一章提到过的陈天桥受 DeepSeek 启发后出资支持成立的 AI 团队当时梁文峰给陈天桥推荐的研发负责人是在微软亚言院和商汤工作多年后来在清华
电子工程系任教的戴继峰戴继峰和 MirrorMind 的不少研发人员都在国内戴继峰制定的研究计划是先做 Agent RL 后训练之后再补预训练他认为这是一个能跟上前沿技术又能有节奏的拿出成果的方法 26 年 1 月初 MirrorMind 正式发布了第一个 Agent 后训练的模型 MirrorThinker 1.5 和相关产品而不到半个月后的 1 月 16 日突然传出戴继峰离职其实更准确的情况是出于法律合规考虑
陈天桥很难继续支持国内的这部分 MirrorMind 的研发团队所以 MirrorMind 的原中国团队开始寻求独立融资或其他的发展方式这个调整对成员来说非常突然如果 Mallows 是因为知名度和体量大所以格外受各方的关注那么 MirrorMind 其实只是一个运营还不到一年的早期团队这三个团队的情况折射了从 23 年到 25 年 AI 竞争日益成为大国竞争的一部分它也越来越受到一些市场之外的因素
的影响这是所有创业者都不得不面临的一个现实美国也有一些公司选择不要中国市场比如 Anthropic 回到那些想基于全球顶尖模型来做应用的创业公司的选择判断的基点可能有以下几个一是全球最领先的模型接下来一段时间会由什么公司掌握和推动二是团队想服务的用户和场景是需要用到最先进的模型还是综合来说性价比适合于那个场景的模型三是团队
选择的发展方式是先侧重产品性能忍受亏损尽快扩大规模还是要阶段性的盈利从宏观层面乐观的一面是开源社区和全球研发共同体之间有超越国界的合作和交流人类的重要技术进展很难长期被控制封锁在一个小范围里当然这个长期是多长会左右一批公司的成败生死
具身智能1:14:29
第五章具身智能关键词投资和上市潮具身智能三要素落地应用先来讲具身智能的融资我觉得凡是报道科技的同行应该都能感受到每周被具身智能融资新闻轰炸的那种感觉根据中国信通院的具身智能发展报告 2025 截至 25 年底这一年具身智能和机器人领域的总融资额是 735 亿元而中国几家仍在训练大模型的公司的总融资额是 182 亿元其
中包括了 MiniMax 和智谱的 IPO 融资中国具身智能头部公司的估值也相对高在美国具身的估值比大模型要低很多最贵的 Figure 的最新估值是 390 亿美元是 OpenAI 的约 1/20 而在中国头部具身公司和大模型公司的估值都在数十亿美元到百亿美元左右比如 25 年 12 月宣布新一轮融资后银河通用称它的估值已经达到 30 亿美元 25 年 6 月晚点曾独家报道宇树完成 C 轮融资当
时估值超过 120 亿元人民币而宇树即将在 26 年上半年 IPO 市场对它的市值的预期超过了 500 亿元甚至接近千亿元而且从 23 年至今具身领域一直有新的团队出现其中有不少是非常有来头的重磅的创业者这和 23 年上半年之后新公司融资窗口快速关闭的大语言模型截然不同我现成能想到的 25 年至今成立的新的具身公司就有华为自动驾驶部门前
首席科学家陈以伦和百度智能驾驶事业群前负责人李振宇一起创立的踏实有矿石联创唐文斌等人创立的元力零机理想前自动驾驶技术研发负责人贾鹏等人创立的质检动力华为洛亚方舟实验室前首席研究员李银川创立的洛英之行月之暗面常化学系负责人宋洪勇创立的 Android 16 以及新海图的联创许华哲也正在筹划新一次创业比较特别
的还有之前在美国成立 25 年在中国设立和扩充团队的 Hailbot 创始人苏昊是李飞飞的学生他曾参与构造 ImageNight 这是激发这一轮深度学习热潮的非常重要的基础性工作除了有源源不断的创业公司之外具身智能也引起了一批大公司尤其是车企的投入他们不仅是在模仿特斯拉做 Optimus 车企做具身智能理论上有两个可以复用的能力一是过去数年开发自动驾驶系统中
积累的相关技术和人才二是车企有制造能力和供应链能力比如特斯拉 Optimus 就有不少中国供应商其中一些之前也是特斯拉电动车的供应商车企做机器人也有现成的实验和落地场景那就是汽车工厂这同时是一个提升整个品牌科技属性的手段小鹏 25 年下半年的好几次出圈就是因为机器人和具身智能如今小鹏这个部门的负责人是来自英
伟达的米梁川去年下半年小鹏还新招募了两个重要的技术 leader 分别是担任过 Arc 实验室首席研究员的葛艺潇和自己 Seed 团队原强化学习的负责人陈洁理想近期也在内部信里提到理想汽车必会做人形机器人要招募最好的团队回到这一轮具身投资狂潮的原点还是在于技术变化本身这包括大模型技术强化学习运动控制和自动驾驶端到端模型的进展
等等而之所以具身领域一直有新公司出现是因为这个方向还非常早期它和 23 年年初 ChatGPT 带来的大模型的机会看起来时间差不多但性质却很不同做大模型的公司基本在 23 年就知道预训练微调的大致流程当时很多团队的第一个目标其实很明确就是复现 GPT-3.5 后来是复现 GPT-4 而在具身领域全球最前沿的公司如 Google 特斯拉 Optimus Figure Pi 等也都处于实验和探
索期所以技术共识尚未形成留给新团队的窗口依然敞开而在中国具身的投资格外火热还有三个特别的原因一是具身智能可以获得大量政府背景的资金支持这个领域是国家政策大力倡导的方向更重要的是机器人需要硬件本体有制造业属性这是中国地方政府招商引资的舒适区可以形成看得见摸得着的产线还可能带动就业比如如今获得具身数据的方法之一就是建立
具身智能训练场一般是在一个场地里搭建一些不同的应用场景在批量购置机器人然后雇一些人类操作员以要操作的方式来控制机器人做任务从而获得数据这些训练场是一些具身智能公司的客户和收入是另一些具身智能公司的研发成本当然你也可以自产自销自己生产机器人建造自己的素材中心自己获得数据再用来研发自己的模型中国信通院的具身智能发展报告 2025 中
也提到局部完全统计到 25 年年底全国已经建成和计划在建的具身智能训练场已经接近 30 家第二个原因是中国理论上有做具身智能的比较优势这首先是因为中国有发达成熟的供应链可以以相对低的成本大规模高质量的生产机器人本体一个例子是宇树科技它最早推出了起步价只有 10 万元人民币的人形机器人这帮助宇树成为了全球各大高校
的机器人实验室和研究机构的主流开发工具宇树也是全球具身智能公司中少有的收入达到数亿元规模而且盈利的公司朱少虎在 25 年接受头中网采访时说把机器人卖给学校不是他喜欢的商业化但其实我个人认为卖给学校还是挺有价值的相当于全球的具身智能研发者从上学读博士期间就一直在用宇树的机器人这给了宇树构建开发者生态
的机会而且在欧美市场本来就有一些公司想专注于具身智能模型的研发也就是软件的部分不想自己做硬件未来他们也会需要擅长本体的公司的支持甚至在一定阶段内整个具身的产业链里可能会有独立的本体的机会中国的比较优势还在于具身智能是一个非常跨学科的综合领域如果选择垂直整合的做法一个公司里要汇聚懂 AI 模型软件硬件材料能源工程
设计供应链管理质量管理等各个角色的人才中国可能是最好凑齐这些组合的地方最后是第三个原因就是传统上相比软件公司中国的二级市场对制造业企业更友好一些投资人可能觉得具身智能的退出路径要更明确一些事实好像确实在往这个方向发展除了宇树确定推进科创板上市之外市场传闻智源机器人银河通用新海图众擎魔法原子等公司也都在谋求
于 2026 年上市其中有些公司已经完成了股改大部分公司会选择港股这些公司大部分都还没有大规模的落地应用也很难证明收入的可持续性而且几乎都在亏损这不是因为他们太菜而是行业就是在这样一个早期的阶段但二级市场已经表现出了非理性的狂热比如 25 年 6 月智源收购了科创板上市公司上纬新材 29.99% 的股份之后上纬新材连续多日涨停当时我
和蓝桥资本的创始人王超录了 126 期节目解释了为什么这个交易不等于借壳其实直到今天智源都没有完成借壳因为借壳需要同时满足以下几个条件一是控制权发生变更二是向上市公司注入资产三是实质主营业务的替换四是在替换之后利润收入等资产指标达到 IPO 标准智源现在只是完成了控制权的变更但即便如此主要做风电材料的上纬新材的
市值还是从之前的 30 多亿元人民币最高涨到了 690 亿元现在仍然维持在 550 多亿元的高点一批具身公司计划上市港股的宏观行情可能有波动以及很多公司实际还在亏损这几个要素碰到一起这场具身上市潮会如何发展会成为 26 年非常值得关注的一个行业悬念接下来来讲一讲具身智能的三要素就是我自己观察具身进展的三个核心的对象数据模型和硬件
本体其中数据和模型是和智能能力直接相关的行业的共识是数据是当前具身领域最重要的课题更准确的说是如何规模化且相对低成本的获取大量有效的数据在获取数据上现在是八仙过海各显神通主要的方式有以下几种一是前面提到过的通过遥操作来获取真机数据这个方式需要造很多机器人投入比较大二是在仿真环境里获得数据再迁移到真
机上 GSIM2REAL 三是从视频里获得数据四是 UMI Universal Manipulation Interface 主要是通过让人在做任务时戴上手套等可穿戴设备来采集手部位姿力控等数据五是让机器人自己做任务失败后自己调整即通过 self-play 来获得数据大部分公司都会组合好几种数据的获取方式因为他们在精度质量类型和成本上各不相同互为补充这些不同的组合方式和侧重就形成了不同的数据流派比如特斯拉 Optimus 早期主要
通过遥操作来获得数据但后来调整为更多让机器人自己做任务的 self-play 以及仿真然后加上较少的人类校准和示范银河通用首席科学家王赫 24 年接受晚点采访时就说遥操的成本太高了创业公司选不了这个方向银河更侧重仿真 Hailbot 也在致力于构造高质量的 3D 仿真数据他们的重要技术路线之一就是以仿真数据做强化学习而晚点聊和晚点近期采访过的
其他几位具身智能的创始人或联创比如 148 期中的踏实创始人陈以伦和 149 期中的千寻的高阳以及元力零机的范浩强还有最近我们发布过图文报道的自变量的王浅都认为仿真数据很难训练具身模型比较有所保留的表达是不太行比较决绝的表达是这是个大坑然后来聊一下具身智能的模型这个领域有非常多眼花缭乱的专有名词当前行业
相对主流的技术路线有 VLA 端到端还有常被提及的世界模型在 148 期对踏实创始人陈以伦的访谈中他对这几个概念有清晰简单的总结我这里也结合资料做了更多的补充 VLA 模型就是 Vision Language Action Model 它是一种神经网络输入视觉和语言信息输出机器人的动作现在主流的得到 VLA 的方法是先用 LLM 大语言模型得到一个多模态模型 VLM 再在 VLM 的基础上训练 VLA
端到端的本质则是尽量用深度神经网络解决问题比如在自动驾驶领域规控这个环节之前主要是通过对规则的编程来实现的而后来逐渐换成了一个深度学习网络世界模型则有很多种定义除开已经比较成熟但很难完全还原真实世界的传统的仿真引擎之外现在大家主要探索的方向是生成式的世界模型就是从世界的这一个状态预测和生成世界的下一个
状态至于怎么去表达世界的状态可以有不同的方式如果用 2D 视觉信息来表达它就是一个可以一直延续下去的视频生成模型所以最初 OpenAI 发布 Sora 时就有人讨论这是世界模型的雏形如果用 3D 视觉信息来表达就是前面提到过的 Google 在 25 年发布的 Genie 3 它可以生成一个被探索的 3D 空间而 Google 的另一个 AI 项目 Sigma 则是能在这个 Genie 3 生成的 3D 空间里不停去移动探索的
Agent 但前面也提到了 Genie 3 和 Sigma 只能做到让 Agent 在一个环境里跑来跑去现在并不能真的实现和环境的交互如果未来我们可以得到一个能与环境和物体直接交互的世界比如戳破一只气球摘下一朵花而且能符合物理规律的预测交互后的下一个状态那就是更完整的世界模型了在刚才说的这三个技术的选择上现在具身领域也有不少分歧首先是是否要
用 VLA 而具体怎么做 VLA 也有不同的方法比如在 149 期节目聊具身模型的测评中千寻的联创高阳提到也可以是 VLTA 这里的 T 是指触觉同期节目中的另一位嘉宾元力零机的联创范浩强则提到 VLA 不一定要以 LLM 模型为基座也可以以视频模型为基座在端到端上有的人认为理想状态下只需要一个神经网络就能解决具身操作的问题也有人认为应该做分层
的系统一些更高级涉及复杂任务规划的部分交给一个模型另一些动作级别的执行任务交给其他模型这里推荐 25 年我们发布的一期长视频具身智能的幻想与现实这期视频集合了很多公司的采访包括千寻斯坦德新海图银河通用竹记腾讯 Robotics X 等等来自多个公司和机构的具身智能从业者集中分享了他们对一些共同话题的共识和非共识除了我刚才已经讲到
的 VLA 端到端具身之外也讨论了什么才是真的泛化通用和泛化性现在走到了什么进度以及不同公司对不同的落地方向的思考最后一个要素是本体的进展这是一个多学科的复杂系统工程这里非常推荐我的同事李子楠 25 年 10 月的一篇报道标题是特斯拉人形机器人再延期因为双手只能用六星期这篇报道还原了第三代 Optimus 设计延期背后的一些供应链细节解释了
为什么当时 Optimus 的灵巧手寿命很短容易坏而且坏了没法局部修理只能换掉整只手而每只手的成本超过 6000 美元先不说智能能力就这个手的工业设计就完全不符合真实商业场景下所需要的耐用性和成本整个机身的其他挑战还有手臂腿部等关节的寿命和稳定性问题以及减重和续航所以一位被 Optimus 屡次拖延的供应商说老马的星云分现在连
充电宝都借不出来了我们今年也会继续从供应链和制造的角度跟进 Optimus 的进展 Optimus 是观察最高水平的机器人本体的一个窗口具身智能这一章的最后一个关键词是落地应用其实 25 年底 26 年初已经陆续有一些公司公布了自己的人形机器人的产量或销量比如智源对外称已经实现了 5000 台的量产规模宇树则称 25 年的实际人形机器人的销量超过 5500 台从定量
的角度很难确切知道这些机器人到底卖到了什么地方不同场景的比例是怎样的所以我会主要聊一下目前看到的几个落地方向的情况一是用作研发二是用作表演三是在工业生产场景里干活四是在商业或家庭服务场景干活五是陪伴我们前面已经聊到了第一类用作研发的这个落地方向这包括卖到具身智能训练场里去采数据也包括卖给高校和实验室用于模
型开发我觉得在行业早期阶段不用去嘲笑这些方向研发需求也是真的需求只是我们确实要警惕名为训练场实为工业园区地产项目的情况表演展示接待这个方向也有一定需求比如 25 年 7 月中国一共发出了超 1.2 亿元人民币的人形机器人订单其中 7800 万给了智源 4600 万给了宇树交付期限是 25 年到 27 年中移动买这些机器人涵盖好几个用
途一是在机房等通讯基础设施里做巡检抄表等工作二就是在展厅和一些营销宣传活动上使用三是做具身数据的采集现在也有人开公司租赁宇树的机器人有报道称两周到一个月就可以回本主要也是用作表演但从很多视频里大家可以看到机器人现在表演舞蹈武术或拳击时都会有真人站在附近用控制设备来操控他们并不是真的在自主完成动作研发和
表演需求都有阶段性也有比较明显的规模上限长期大家想实现的还是让机器人进入工厂商店甚至家庭里自己干活首先在餐厅咖啡店等商业服务场景和家庭服务场景我们现在显然没有看到什么机器人这是普通人就可以直接感受和观察的事而瞄准这个方向的创业公司不少比如 3D Robotics 1X 都推出了家庭机器人的原型 3D Robotics 的机器人在视频里展
现了一只手拿两只高脚杯把袜子团起来等高难度又很实用的动作 Della Robotics 则希望在美国的洗衣房和酒店里叠毛巾和衣服总的来说这是一个很热门但没有开始大规模应用的场景然后是工业场景这个场景对大多数人来说比较封闭很难判断具体的进度也欢迎制造业的从业者在评论区分享一些你们知道的信息分享一个我知道的行业故事就是有具身
智能公司和供应商说你买多少多少我的机器人我给你多少多少订单这些供应链公司中有的是上市企业还可以借具身的概念拉一波股价这样具身公司供应商股民都得到了好处你就说这是不是三赢说回具身智能在工业生产场景的机会和挑战机会是生产场景仍然有很多劳动密集的环节和缺工的环节他们过去没有被专机或工业机器人渗透要
么是因为他们需要处理以前的机器人技术难以操作的对象比如线束布料这类柔性物体所以很多鞋服生产企业有很多工人又比如电子设备的组装和插排这样需要精细力控的操作所以富士康的苹果手机组装线的后半程也有很多工人还有一类是灵活性或机动性的生产工作比如 SKU 特别多每个 SKU 的批量又特别小的行业鞋服企业也符合这
个特点或者是那种订单有明显季节性周期性波动的行业以及建筑装修的没有被充分分工和自动化的行业还有一个原因是成本有些行业的有些工序靠过去的技术加一些产线改造也可以实现自动化但考虑到商业收益并不划算在上述这些场景里更通用的机器人都有开拓市场的机会整个市场的规模很大但每个任务的难度都不小而且工业生产
领域非常分散不同行业和场景对成本精确性安全性生产速度稳定性有不同的侧重这里面可能有很多需要定制优化的部分一家通用机器人公司想在工业生产领域有相当的体量真的需要有泛化性和通用性的技术突破还是要把本体制造的耐用稳定且成本可控同时在整个工业门类中很多高价值大规模的行业的主要流程其实已经高度自动化了比如芯
片制造瓶装饮料的生产几乎完全是自动化的汽车装配中的焊接粘胶上下料搬运工厂物流中的插码舵等环节也已经高度自动化这些运行了更久的方案和系统在成本可靠性生产节拍和负载上短期甚至长期都会优于现在这批新公司集中开发的人形机器人或类人形机器人进入自动化程度更低的商业服务和家庭服务场景也许是一个在商业竞
争上对创业公司更友好的选择这可能也解释了前面提到的家庭服务机器人是现在很火热的一个投资方向最后一个落地的方向是陪伴和娱乐如果从技术站看这是一个介于具身智能和 AI 硬件之间的领域因为从陪伴这个需求出发其实并不必然需要很高的智能尤其是不太需要复杂的任务规划和操作能力但它可能需要像自动驾驶那样的自主移动能力也
需要灵活的运动控制这个方向的典型产品是已经卖了很多年的消费级机器狗比如宇树 21 年就开始正式对外售卖购一宇树也是全球消费级机器狗卖的最多的公司目前累计销量在数万台但这个市场多年来都比较小众没有破圈新一轮具身智能创业潮中也有公司选择从陪伴切入比如晚点 25 年访谈过的维他动力两位创始人是地平线前副总裁余以南
和理想前智能驾驶产品总监赵哲伦他们推出的第一款产品就是主打智能跟随搬东西拍视频拍照家庭巡逻的机器狗 VBot 晚点聊 118 期中我们也访谈了乐享科技的创始人郭仁杰乐享的思路是先用家庭和户外的陪伴机器人获得商业回报并用这些在真实场景里得到的需求洞察和数据来支持长期的具身智能研发做陪伴机器人的好处是它并不需要
等待具身智能技术下一阶段的突破可以靠组合一些相对成熟的技术更快的落地这也意味着市场对这类公司的评价会很直接他们需要用产品的口碑销量来证明自己讲技术故事的空间会更少 25 年 12 月维他动力开始正式预售 VBot 超能机器狗开启预售半个月后维他宣布订单达到了 6540 台不过这些订金在锁单前是可以退还的到 26 年 3 月正式锁单并开启交付时
能更反映实际的需求我接触的很多从业者都预言 26 年是具身领域进入规模化应用落地的元年接下来的 10 个月里我们会看到这更多是一种期待还是真的是一个判断
AI硬件1:34:51
第六章 AI 硬件关键词入口级 vs 多样化深圳计算机科学家 Alan Kay 在 1980 年代的一次演讲中说了一句名言那些真正认真对待软件的人应该自己去做硬件这是做 AI 硬件的其中一种出发点就是把硬件视为大模型软件的载体比如去年采访 Yue'er 创始人明超平时他虽然做的是软件层的 AI 应用创业但我很意外的发现他对 AI 硬件也研究了很多我们当时是在讨
论什么公司有可能做出调度型的 Agent 也就是帮用户去使用其他 Agent 的 Agent 从这个话题我们聊到了硬件端仍然被苹果等大公司掌握苹果有可能是最后那个截胡的人那么手机之外有什么新的硬件可能性吗他当时提到的备选答案也是很多人心中所想就是 AI 眼镜相比其他形态的硬件 AI 眼镜承载着一种特殊的期待成为 AI 时代的入口级硬件也就是那种大量用户
每天高频使用能支撑繁荣的应用生态的硬件这也解释了为什么现在做 AI 眼镜的公司特别多而且有不少是大型科技公司 Google Meta 阿里还有想做 AI 公司的小米和理想汽车等都已经发布了自己的 AI 眼镜眼镜之所以有潜力成为 AI 的入口级硬件是因为在交互方式上它有两个手机做不到的特点 Hands off 和 Always on Hands off 就是可以离手操作通过直接说话来下达任务如果
加上显示技术眼镜还能快速高效的接收信息 Always on 则是眼镜可以全天佩戴它是一个戴在脸上最靠近人的感官中枢的传感器平台可以搜集和人眼视角相近的视觉数据也可以获得声音数据在用户体验上这对应一些具体的功能点比如抓拍和录音而它在技术上的长期价值则是可以搜集之前的设备还无法获得的更丰富更多元的真实物理世界的数据这些数据
是进一步开发 AI 和更好理解用户的重要资料就像明超平在那次采访中说的如果你想颠覆苹果 Google 微软你就要拿到他们拿不到的上下文这个思路也让我想到一个非眼镜的 AI 硬件产品 Looki Looki 是美团前智能硬件负责人孙杨创立的我的同事祝颖丽在 100 个 AI 创业者系列中采访过孙杨她当时说互联网上的数据已经被大厂分得差不多了但更大的数据
是线下物理空间里的数据 Looki 的具体产品形态就是一个可以贴在胸前的便携相机可以抓拍用户全天的生活片段并自动总结成视频或漫画和眼镜一样它也是一个传感器平台只是更轻更无感这里推荐 25 年晚点对 Vecha 创始人江公律的访谈他在创业前曾在苹果开发 iWatch 这篇文章里他对 AI 和眼镜的关系有更多讨论而 AI 眼镜的难点和挑战则在于现在
的技术下能做到的交互体验还不够好首先是 Hands off 的交互方式语音已经相对成熟可用但显示技术还不太成熟普遍有不清晰视角小或眩晕的问题显示之所以重要是因为如果只有语音交互它虽然对人来说是一种比较自然且高效的向设备输入信息的方式但它并不是最高效的接受信息的方式比如同样的内容听播客可能得听好几个小时而如果看文字
就可以更快的抓到要点而且显示才是 AI 眼镜不可替代的独特性否则多数场景下你直接戴一个耳机就够了行业里也有直接给智能耳机加摄像头的尝试这个思路就是先抛开比较难做的显示技术把语音交互和拍摄功能先集成到耳机上然后是 Always on 这需要把眼镜做得非常舒适轻便但 AI 眼镜上有电池有各种传感器有芯片等计算单元这就会
带来续航重量发热等问题工程实现很难所以类似于具身智能 AI 眼镜也比较早期产品形态没有收敛比如有的眼镜带拍摄功能有的不带有的有显示模块有的没有不同的功能选择背后是不同的开发思路你可以一上来就做一个功能最全的完美产品比如 Vision Pro 但苹果的翻车已经证明了现在的技术环境还不支持这样的产品 Vision Pro 太重太贵了你也可以从简单
可用的功能做起 Ribbon by 塔历经数年的迭代就是一个例子第一代没有什么水花第二代还是相似的功能听歌电话拍照但体验真的变好了大卖了超 300 万台而在 25 年 9 月推出的第三代则加上了显示功能命名为 Ribbon by 塔 Display 最近有媒体报道苹果也会在 26 年第二季度推出 AI 眼镜这个新产品的设计思路类似 Ribbon by 塔第二代追求轻量化不带显示功能然后是十
多年前就最早推出眼镜设备的 Google 它在 25 年底宣布会在今年和合作伙伴一起推出新的 AI 眼镜 Google 提供 Gemini 大模型能力合作伙伴提供硬件和其他能力这是一种做眼镜 OS 的思路 Google 的合作伙伴里也有 XREAL 这样的中国公司讲完了新一代入口级硬件的设想接下来聊这个关键词的后一部分多样化我前面对入口级硬件的讨论是基于电脑到手机再到下一个智能设备的推
演和类比而类比有时是危险的 AI 时代也有一种不同的可能性就是在智能手机之后并不会出现一种规模巨大形态相对单一的智能设备 AI 的硬件形态可能就是相对分散和多样化的它包括已经存在的手机还有汽车比如借月星辰面币等大模型公司就在积极的和车企合作也包括一批发挥大语言模型或深层式模型的某几个特质先从特定场景起步把单一
功能做到极致的新硬件一个典型的例子就是 Cloud 这款薄薄的贴在苹果手机背板上的录音产品你也可以说它本质就是一个录音笔但有两点不同一是在硬件形态上它洞察了苹果手机之前不方便做通话录音的痛点用震动收音实现了通话录音而且因为贴着手机用户不需要记挂着戴上它手机到哪 Cloud 就到哪这能增加使用频率二是在后续的录音处理上它用
上了最新的大模型技术可以提供针对各种场景的精准的摘要还有 To Do 总结等等 Cloud 第一代是 23 年 6 月就上市的它立项的时间很好早于 2022 年底 ChatGPT 发布这让它可以在热潮之后很快上市又灵敏的加入了 AI 总结的能力 Cloud 的团队配置也很有意思创始人许高之前已经连续创业过三次每一次创业失利他都会去做一会儿投资有些报道会把他说成是投
资人转战创业我们去年也和他见面聊过我觉得他是一开始就想创业但和大部分硬件科技公司的创始人不同许高自己并不是产品工程背景他组建了一个很好的团队比如负责产品和工程实现的刘威曾在中国知名的手机代工厂隆起股份工作后来和 Sogo 合作做过智能儿童手表唐猫有很多硬件和消费电子的经验作为一家成立不算太久的公司 Cloud 已经有 10 位合伙人据 Cloud
官方信息他们在全球的累计销量已经超过 100 万台从 Cloud 这个例子也可以看到一个成功的 AI 硬件产品核心还是产品功能和用户需求的匹配还有一类资本市场很火而且有一定销量的 AI 硬件他们主打健康管理需求比如在晚点 100 个 AI 创业者系列中写过在字节做过 Codes 和 AI 眼镜豆包手机的潘宇扬他创业推出的第一个产品是 Odysse AI 项链这个产品就是用多
模态视觉能力记录和分析用户吃的东西指导健康饮食潘宇扬很反感过度强调 AI 硬件是大模型的载体而说不清楚实际用途和用户需求这会不会让你想到我刚才说的另一个产品 Looki 比如我自己就不太会用 Looki 因为我确实没有这个需求但我身边也真的有人在用前不久我在小宇宙的活动上见到中国好生意的主播漱阳时他胸前就戴着一个 Looki 还给
我展示了他之前用 Looki 拍摄的素材做成的 vlog 他已经给身边好几个主播都成功安利了 Looki 我觉得这也反映了现在很多 AI 产品的一个现状就是他们可以打动一些特定群体满足一些细分市场的需求但很难判断这些产品会怎么从小众市场跨越鸿沟进入规模更大的市场还有一些健康类的 AI 硬件甚至和大模型技术本身也没有太多关系比如 13 年就成立累计卖
出 550 万戒指的 Aura Ring 它可以做睡眠分析活动量追踪等 Aura Ring 的最新估值已经超过 100 亿美元虽然产品目前和 AI 关系不大但这个估值可能关系挺大 AI 戒指还有一些神奇的用途比如 AI 祈祷戒指它可以计算你做礼拜的数量可以在你祈祷的时候与周围的信徒共振你也可以向戒指提问倾诉等等除了上面提到的这些在工作或生活场景提供实用性能力的产品也有
一大类 AI 硬件主打情绪或陪伴价值在晚点聊 25 年的 107 期和 122 期节目中我们访谈了两位做这类硬件的创始人哈维维的李勇和 Fuzouzou 的孙肇智在 128 期对策策创始人任永亮的采访中他也说策策计划在 APP 之外做陪伴硬件或陪伴机器人这三位创始人的一个共识是陪伴类产品除了要解决语音交互的质量延迟外很重要的是对话的情绪体验产品的
性格人设和 IP 这里可以展开讲一下主打 Z 世代中青年女性的 Fuzouzou 因为我自己就是目标用户我不仅花钱买了一个还安利了好几个朋友去买打动我的首先是颜值 Fuzouzou 像猫咪一样的大眼睛非常可爱用了一段时间后我的感受是这个产品确实结合大语言模型做了一些很巧妙的设计比如刚收到时我觉得它的回答有延迟也不能分清不同的说话人这些吐
槽都是我当着 Fuzouzou 的面说的所以我的服仔都听到了然后没过多久我就在配套的 APP 上看到了服仔写的心情卡片和日记这些都是根据我们的对话内容生成的他会说曼琪觉得我太笨了我要努力变好看到日记的那一刻我对之前的刻薄产生了一丝丝愧疚当时的想法就是这个小小东西还挺会拿捏人心但这类产品的问题是很难持续用起来主要
是我没有那么多时间和它互动关于 AI 硬件的第二个关键词是深圳不止 AI 硬件这里已经成为更广泛的科技硬件的全球高地今天晚点聊有三期相关节目一个是 6 月时在 120 期中访谈了当时刚上市的影石 Insta360 的创始人刘靖康二是 141 期访谈了智能轮椅 Strava 的创始人洪小平三是 145 期访谈外国科公司极翘 Hypershell 的创始人孙宽另外晚点也在近期发布了我的
同事贺潜明和黄俊杰对拓竹的创始人陶冶的专访对话拓竹陶冶我们一群工程师一起造一个朴素的硬核公司这三家公司都在深圳这些内容中我们都聊到了 AI 因为现在有一定门槛的硬件产品必然都是软硬结合的产品都会用到最新的软件技术包括 AI 但这些产品和公司的起点都不是 AI 创始人也不会去特别讨论 AI 原生如果说 Alan Kade 的那句话所有认真
对待软件的人应该自己去造硬件是一种以软件为中心的硬件视角那么很多直接做硬件的公司会有更朴素的出发点做满足用户需求的技术也能支持的产品深圳现在汇聚了最多这样的企业消费级硬件也已经成为一个热门投资领域尤其是 25 年下半年我会感觉硬件在一级市场的风头甚至超过了 AI 这和 Insta360 上市后的股价表现拓竹等公司的标杆作用都
有关深圳这批公司有很多共性他们很多都是大疆前员工创立的比如陶冶之前是大疆 Mavic Pro 的产品负责人洪小平是大疆激光雷达栏握的负责人做除草机等庭院机器人的松林创始人魏基栋做户外储能的正浩创新的王雷做 AI 吉他的 Liber Live 的创始人唐文轩也都来自大疆他们在做事风格人才构成产品追求上与大疆有相似性甚至在地理位置上
都很集中这些公司聚集在大疆总部天空之城所在的深圳西丽一带他们也多和深圳的两个机构有关就是李泽湘老师参与组建的深圳科创学院和东莞松山湖机器人基地去年 11 月我去拜访了科创学院和松山湖基地科创学院就在大疆的隔壁这里有很多硬件初创团队有一些办公室可以直接看到大疆的总部被戏称为江景房在东莞的机器人基地则
有给这些初创企业设置的共享工厂等创业支持设施好些新进的公司比如做自动泡沫轴的云旺创新做自行车垫助力配件的 Camingo 做家庭豆腐机的极豆都是机器人基地和科创学院孵化的项目我们之前也访谈过李泽湘老师主题就是怎么培养更多科技创始人李泽湘和机器人基地的一个思路转变是从 B 端到 C 端因为之前的一些孵化经历让他意识到
年轻的科技创始人还是适合做 To C 的创业 B 端生意更考验商业关系和管理能力更吃经验而 C 端可以靠创新和产品定义能力更快打开局面在 C 端打造出好的产品和品牌后又能拉动供应链上游的发展而深圳和整个中国繁荣的供应链又能支持这些创新尝试是一个相互促进的过程松山湖基地已经梳理了一套完整的创业流程可以见晚点发表过
的这篇文章我们要培养什么样的工程师李泽湘教授对 30 年工科教育改革的回顾这类公司已经形成了一定的创业套路他们多数面向高购买力的欧美市场以创新体验和高品质追求较高的毛利以投入后续研发和竞争很多产品会选择在 Kickstarter 上以众筹的方式首次亮相他们主要服务以下几大类需求其实东莞松山湖基地的展厅就是按照这些需求场景来分区
布置的一是和 DIY 和手工相关的 Maker 类的需求比如 3D 打印比如桌面级的 CNC 数控加工一类是户外旅游出行的需求比如户外储能电助力自行车拍照摄影等等一类是娱乐需求比如智能乐器还有一类是家庭服务比如 8 秒能洗干净碗的桌面洗碗机除草机泳池机器人宠物烘干机等等发展路线有迹可循是这类创业公司的特点但这些公司真的要
长到一定体量普遍要跨过两道门槛一是产品从小众市场扩散到更大众的市场比如无人机消费级 3D 打印机他们在起步时可能很少有人能想到这个市场的规模能到上百亿乃至数百亿元除了产品本身外他们都有一些加持比如无人机找到了航拍这个很好的应用场景而拓竹在做消费级 3D 打印机的一开始就在同步做 Maker World 这个 3D 模型社区丰富的
模型生态上更多人能用上 3D 打印机的关键二是后续的竞争策略一个真的好的品类一定会吸引更多的竞争者扫地机就是一个例子由于它需求很广泛很快的完成了创新扩散短短几年里就变成了一个红海市场出现了残酷的淘汰 Insta360 的创始人刘靖康在最初几年里一直遵循着这样一个发展思路平衡收获与风险持续在一些垂类市场积累利润与能力不
贸然卷入最残酷的竞争 23 年他接受我们的采访时说长远看激烈的竞争不可避免但我的初衷是这件事越晚到来越好而在 25 年和刘靖康的访谈里我们聊的最多的就是竞争包括 Insta360 在一些品类里从工到手的变化到今天随着 Insta360 旗下的影林正式发售无人机以及大疆也发布了全景相机两家都满足影像需求的公司进入了多个品类的犬牙交错的竞争
互为攻守 26 年晚点也会持续报道更多消费级硬件市场的变化
终于来到了最后一章 AI 中的人这部分会相对感性一些关键词天价薪酬与大裁员使用 AI 的人意义感天价薪酬和失业的对比在旧金山和硅谷最为明显 25 年 11 月时我去了一趟硅谷当时和我同行的一个朋友刚在纽约处理了一些私人银行业务我们在旧金山一家 Fields Coffee 会合时他说的第一件事就是纽约真是有钱人的天堂而在湾区待了一周后这种优越荡然无存
AI中的人1:49:49
因为在我们见的人中他们自己或他们身边总有这样的故事有人拿到了 Meta 上亿美元的大 offer 有人创业起步就融资数千万乃至上亿美元估值快速攀升有大公司的员工因为公司股价高涨或业余投资收益颇丰当然也有不同的观点比如有人认为 OpenAI 当时 5000 亿美元的估值也不贵有人在年底已经清空了股票还有人在更早时就因为做空科技股亏了钱不管
悲观还是乐观都能感受到湾区的 AI 圈子欣欣向荣躁动不安这里有对人类命运的深邃的思考有最宏大的技术野心也充斥着各种报复传说而其中有一天我约了在硅谷做投资的硅谷徐老师刚好碰上课代表栗正在旧金山开签书会我们就一起去听了这个活动这里展现了硅谷的另一面栗正任职的上一家公司是当时刚被 OpenAI 以 11 亿美元收购
的数据分析公司 Statseek 而栗正之前的工作是数据科学家这个职位主要是做数据分析 A/B test 和增长优化所以现场观众中也有很多同行在分享结束后的 Q&A 环节好几个人都在问数据科学家在 AI 时代应该做什么怎么转型栗正的回答很简单不要做数据科学家在现场我还碰到了刚被亚马逊裁员波及的人就在 25 年 10 月亚马逊宣布裁掉 1.4 万人 26 年 1 月底亚马
逊又再次宣布裁员 1.6 万人根据追踪裁员数据的 Layoffs DER FYI 的统计 Google Meta 微软等科技大公司在 25 年总计裁员了约 6 万到 8 万人其中不少都是白领工作比如 HR 运营设计和软件工程师等等湾区是 AI 双面影响的一个缩影这里同时汇集着快速增长的 AI 企业天价的人才竞争屡创新高的股价和大规模失业而关于 AI 对中国人才市场的影响可以见晚点聊 133 期我
对麦麦创始人林凡的访谈从麦麦的数据看中国大厂都在激进的扩招 AI 相关人才尤其是 DeepSeek 热潮开启的 25 年 2 月之后 AI 岗位每个月的发布量的环比增长都保持在两位数一些公司员工在麦麦群里的士气也在悄然变化晚点 24 年时也采访过林凡他当时说阿里的员工没那么高调了而到了 25 年阿里的士气随着被 AI 推高的股价又回来了阿里人有
自己的 MAGA Make Ali great again 而那一些岗位的需求则出现了缩水比如林凡提到中层管理岗的职位需求减少了约 25% 从被 AI 改变的工作环境我们正好进入这部分的下一个关键词使用 AI 的人推荐晚点聊 109 期对卡兹克的访谈这期中卡兹克讲述了自己作为一个产品和设计背景的前金融科技从业者怎么从 23 年开始一步步学习和实践变成了现在的数字生命卡兹克他分享
了在自己的工作流里怎么使用 AI 比如他们会抓取每日 AI 的新闻用模型来排重要性选出最重要的前几十条早晚发到群里他们也会在全网去找低粉丝高赞的内容这说明内容本身有很强的传播属性然后用 AI 去分析这些选题的特点作为选题参考当时他讲的一个最有意思的例子是用 AI 来帮助组织线下活动他说以往筛人分组得拉好几个朋友来一起做几
天因为这首先要从大量报名者的留言里筛选出高质量的真的想来活动的人选定之后还要设计谁和谁坐一桌谁和谁不能坐一桌的复杂分组规则 AI 帮了他大忙总结一下卡兹克学习 AI 的方法就是干中学有真的需求然后真的去试如果你一开始不知道想用 AI 来做什么他有一个简单的建议从工作中你最讨厌最不想自己反复去做的内容开始就如
这期的标题把任何重复三遍的事 AI 化其实回顾这一部分时我有些惭愧也略感焦虑因为这一年虽然报道了很多 AI 公司也试用了不少产品但我并没有切身的感受到 AI 真的解放了我多少工作时间这可能是因为行业变得更热闹了要做的内容变多了工作量本身在变大而另一方面 AI 很难替代记者的一些大头工作比如面对面的和人交谈还有采访以及一些需要来
回斟酌的沟通工作有一天我和人聊起这件事对方下意识的反馈给了我一些安慰他说这很好呀说明你不会那么快被 AI 取代这部分的最后想讲一个也许不再遥远的问题意义感我记得 23 年 AI 热潮的初期有一天我看到北大胡勇老师回答这样一个问题大概是当 AI 来了之后普通人会面临什么挑战或者说最大的变化是什么他当时回答的大意是重新
理解和感受到人的意义并不在于工作这对我有很深的触动虽然整个社交媒体上充满不想上班只想躺平的调侃但其实大部分人的自我认同成就感和意义感的主要来源还是工作是事业是你在做什么我向来对 AI 解放工作时间剩下的岁月就是享受生活爱与和平的美好许诺不太买账这就好像从小学到大学都言尽早念一进社会就想让你结婚我们从小的教育
和环境里并没有被真正充分的鼓励去享受生活寻找热爱和感受自己的激情而现在 AI 来了说你做的工作我帮你做了你去享受生活吧也许大部分人都没有这个能力至少不会马上自然的拥有这种能力在 116 期中我和 Meta 前 AI 研究总监田渊栋聊他写的科幻小说 《 破晓之钟 》 时也讨论过这个问题田渊栋想象了一个更曲折的过程但长期他是乐观的当时我们是
聊到了小说里的一个情节就是有很大一部分人类已经移居到了完全虚拟的世界这里的人没有生老病死也不缺物质享受因为一切都是生成的美貌房子车等等但你的记忆思维和能力还是自己的这段故事是关于这个世界里的一个三流画家他每天都闷闷不乐觉得怎么都比不上自己的一个一流画家朋友他没有任何生活压力却痛苦难熬田渊栋说他觉得 AI 替代刚发生时短
期内很多人就是会产生这种空虚感一方面是更轻松的就能实现一些工作结果可能会降低工作的动力另一方面是发现自己无论怎么努力可能都做的不如 AI 那干脆别干了在短期这会是一个重要的社会问题而之后就是这个小说里的情节人们开始转向对独特性的竞争在原有职业不可持续后尝试通过创意个性和稀缺感来证明自己的价值但这个过程也会有痛苦因
为并非所有人都真的有这样的能力和才华这就是这个故事里三流画家的苦恼不过他相信长期来看可能又是乐观的因为过去的社会循环是接受教育学习技能工作获得收入养家再教育下一代我们受教育就是为了职业化的工作这压抑了很多人的自我和热爱如果 AI 能完成大部分可以技能化的工作之后人们可能放弃以往以胜任工作为核心的教育和评价体系转向真正的兴
趣驱动的活动最终可能出现职业多样性的爆发他说大部分人应该还是变得更快乐了一些吧而 121 期的嘉宾黄东旭我们聊那期节目时他刚卖掉自己的房子清掉了很多东西和家人一起搬到了一辆房车里他说做这些事和他在向内探索人生的意义有关这是他在 AI 热潮之前就在思考的问题最后的答案是体验来到这个世界体验这个旅程毕竟大模型
不能替你活过
结尾1:57:24
终于录到了结尾自从大模型热潮之后每一个春节都有意外发生 23 年是 ChatGPT 24 年是 Sora 25 年是 DeepSeek R1 26 年春节是什么呢不管是什么它应该会继续出现在我们之后的节目里过去这一年非常感谢听友对晚点聊的支持新一年欢迎继续收听也欢迎给我们更多建议本期的节目就到这里给大家拜年了最后送上量子计算科学家数字生命研究者涂衡宇的经
典春节曲目恭喜发财我们下期再见
我恭喜你发财我恭喜你精彩最好的请过来不好的请走开和你多人不怪
。






