开场0:00
欢迎收听 《 晚点聊 》, 我是曼祺 。 今天的嘉宾是 106 期曾做客 《 晚点聊 》 的真格基金管理合伙人戴雨森 。
这一期的主题是 2025 年年终时刻的 AI 复盘和展望 , 我们分两次录制 : 一次是在上周 , 随着 Kimi K2 的发布以及一批 Agent 应用的持续进步 , 我们重新聊了 AI 应用普及这条主线的变化 ; 一次是在今天下午 , 我们补充聊了刚刚发生的新进展 :OpenAI 在上周五发布了 ChatGPT Agent。
更重要的是 , 这个周末 OpenAI 又宣布用一个未公开的通用大语言模型 , 第一次达到了 IMO 国际奥赛金牌的水准 。
这之前只有 Google DeepMind 针对数学专门做优化的模型达到过银牌的水平 。 已持续两年多的 AI 竞速没有放缓 , 模型能力与应用创新交替上升 ,而两者的进化速度可能都在被低估 。
下面我们就正式进入本期的讨论吧 。
在上周和雨森聊了 2025 年的 AI 复盘和展望之后, 刚好上周五和周末这个行业又有很多新的事发生 , 所以我们又约了一个 " 补录 ", 去聊聊一些新的进展 。
我觉得可以还是从我们最开始的那个话题给它补充一下, 就是你觉得行业里最重要的几件事情 , 结合新的进展 , 可以在场也说一说 。
IMO金牌1:26
好的 。 确实刚才过去的这个周末还是发生了很多事情 。 我觉得最重要的一件事是 OpenAI 它的一个新的模型在 IMO 的 2025 年比赛中获得了金牌级别的成绩 , 具体来说是 6 道题做对了 5 道题 。
这个事情为什么很重要呢 ? 因为按照 OpenAI 的描述 , 这是一个没有联网的大语言模型 ,并且没有专门针对数学去优化 ,也没有使用其他的工具 , 如 Coding Taper 这些工具 。
它完成了 IMO 的证明题 ,并且 OpenAI 找了 3 个 IMO 的金牌得主来进行交叉验证 , 认为这个证明是对的 。 当然这个结果也引起了一些争议 , 比如说 Google 就说这个并没有得到官方的认证 , 所以它还不一定是有效的 。
陶哲轩也说 IMO 的题目它的解答过程可能会有很多不一样的情况下, 那么得分会不一样 。 但是不管如何 , 这是一个语言模型没有经过特别的数学优化 , 单纯是在离线的环境中解出了 IMO 级别的这种证明题 , 这个其实还是比较划时代的 。
因为之前 Google 在用 AlphaSolver 这里面去做的话 ,其实是一个专门为数学准备的模型 , 或者用形式化验证的方式去做 , 这种模型它是没有泛化能力的 。
它刚好是一年之前 ,是在去年的 7 月 ,Google 的 AlphaProof 还有 AlphaGeometry 是得到了 IMO 银牌的水准 , 当时是差一点到金牌 ,但它不是一个通用的大语言模型 。
然后这一次 OpenAI 说这是一个通用的大语言模型 。
对 ,因为每年这个时候都是 IMO 的考试嘛 , 所以这次就是在这个题目出来之后, 机器人就做了 , 所以也没有这个提前训练题目的能力 , 对吧 ?
就是它不太会说是因为漏了题 , 然后我去针对性地优化 。
因为之前虽然说这一年多语言模型发生了很多进展 , 对吧 ,但是这里面 Coding 和数学计算 , 大家都属于结果比较容易验证的问题 。
如果你做对了 , 那么程序就能跑起来 , 或者数据能带进去验算 。IMO 的题目呢 , 这些证明题是属于比较难以验证的题目 ,hard to verify。
这一直以来就是被认为当前 LLM 难以解决的问题类型 ,并且显然世界上大部分的问题事先是不知道答案步骤的 。
所以当一个语言模型能够不经过特殊的调教去解答这样的问题 , 达到了人类中比较顶尖的水平的时候 , 这也意味着语言模型的思考能力进一步提高了 。
并且这里面 OpenAI 提到 , 可以通过增加思考的时间来提高模型的表现 , 这个也进一步验证了 inference scaling law 这样一个非常重要的 scaling law。
因为我们之前聊到除了这个 pre-training 之外, 又出现了 post-training 和 inference 的 scaling law, 对吧 ? 然后第二 , 这说明 LLM 的泛化能力很强 , 能够解决很多我们原来以为解决不了的问题 。
那根据我们之前聊到的 , 模型能力越来越强 , 它可以接受的场景越来越多 , 带来的应用机会和创造的价值就可能越来越多 。
第三呢 , 我也在想 , 一道 IMO 的证明题和一个比如说尚未被证明的数学上的小的定理 ,在形式上是很类似的 , 你都是要去证明一个比较难去验证的问题 。
那么显然很多时候人类在做的开创性的新工作 , 就是想尝试去证明一些没有被证明的问题 。 当然它现在去证明一些大的问题 , 或者大的猜想 , 肯定还比较难 , 比如戈德巴赫的猜想 , 这肯定很难 。
但是显然在人类发现新知识的工作中, 也有一些小定理 、 小证明是需要去做的 。 那这个时候 , 当语言模型能够解决 IMO 的题目的时候 , 实际上也说明发现了一颗新知识 , 这件事情已经不再是一个对未来的预期 ,而是可能已经是一步之遥 , 甚至说已经可以发现一些小的新知识的情况了 。
并且还有一个八卦就是说 , 据说 OpenAI 现在的模型 , 它基于的 Base model 和 4o 其实是一样的 。
你就说拿到 IMO 金牌的这个 ?
至少说现在的这些跑的这些模型吧 。 那么也有人认为有理由认为 , 可能也都是一个最基础的 Base model, 或者说它并不是在 Base model 上有那么大的提升 ,而是说这样的结果体现得更多的是通过 post-training、 通过 inference 这些在预训练之后的过程去实现的 。
这就说明这个在预训练 , 虽然大家认为赚钱了 , 对吧 ,在这里面有很多的问题需要解决 ,但是 post-training 以及 inference 上的优化还可以走很远 。
这个其实也是带来了一个对于 AI 发展的这个空间的很大的一个畅想 。
就结合一些公开信息和你和一些人交流 , 它们怎么做到这一点的 ? 就你刚刚大概说了 , 就是可能是 inference scaling 之外, 还有什么别的信息吗 ?
因为我看到在 Twitter 上, 就是 OpenAI 自己的人会分享这个东西和 Multi Agent 有关 。 然后我最开始看到的时候 , 我是有点困惑的 ,因为它一开始说这是一个通用的大语言模型 , 又说是 Multi Agent。Multi Agent 好像一般人可能会理解 , 它是不是用了不同的模型的组合 , 或者说工具的组合 。
当然现在还非常早 , 所以怎么做的 , 我觉得现在大家众说纷纭 。 但我相信 , 比如说几个月之后, 可能我们就会很了解是怎么去实现的 。
这里面的 Agent 应该并不是指说用工具去规划了我们说的这种 Agent,而更多的是像是这个在模型中多个角色去进行相互合作 , 去进行更强的推理 。
这可能是初步了解到的一些反演吧 。
就是有一些技术人员这么描述的是吗 ?
反正就打听了一下吧 ,因为也就是 24 个小时以内的事情 。 我其实有个很强的一个感受是 ,2023 年的 3 月 ,有一篇 paper 叫做 《Sparks of AGI》, 它就是说 《Agent 的火花 》。
因为当时是他们测试了 GPT-4 的预先发布版之后, 感叹说从 GPT-4 的能力看到了很多 《AGI 的火花 》 的例子 。
那个是两年半以前 , 两年半其实在很多科技进步史里面是很短的时间 , 甚至我们头一家公司可能两年半之后产品才发布 。
但是我们现在再去看那篇文章 , 当时这些研究员非常激动地说 , 看到了 《AGI 的火花 》,在现在看来就是非常非常简单的事情 。
从当时的那些 《AGI 的火花 》, 比如说解一些简单的题 , 到现在能解 IMO 级别的题 ,其实只过了两年半的时间 。
我的想法是说 , 智能从一两年半以前 , 当年的表现就让人很惊讶 , 到现在其实提升了非常非常多 ,并且这个时间非常非常短 。
两年半在很多进步史上其实是很短的时间 , 那十年之后会怎么样 , 对吧 ? 这个其实曲线是非常非常陡峭的 。
所以当然这个文章的作者后来就加入了 OpenAI,Sébastien Bubeck, 然后他就说这个事件的重要性再怎么说可能都不为过 。他说这可能是一个 moving landing moment for AI, 就是登月时刻 。
他说这一次 IMO 金牌的这件事有多重要 ?
对 ,他说 IMO 金牌这个事情是 AI 的登月时刻 。他就说一个只是预测下一个词的一个模型 , 没有工具 , 没有这些 , 然后做出来一个真正的有创造性的证明 , 这个证明在人类中只有很少数极少数的天才才能做 。
那这个其实就充分说明了 AI 已经到了什么样的水平 。 所以我想起我们在年初录的时候 ,其实讲到一点 , 就是今年会带来的很多震撼 ,其实是越来越多的行业会见到李世石时刻 。
那么李世石时刻其实我们当时定义就是 AI 超过人类第一名 , 或者说人类中最顶尖的那群人时刻 。
那我们在这个过程中其实看到 Coding, 看到数学 , 对吧 , 我们看到越来越多的领域出现了这样的这个情况 。
所以可能在接下来的这一段时间 ,有更多的这样的时刻会等待着我们 。 原来我们觉得还很难被解决 , 或者很远的事情被解决了 。
而且还有一个情报 , 就是有可能不光 OpenAI 做到了这一点 ,因为 Google 其实在 OpenAI 发了这个信息之后, 有一个 Google 的研究员也在 Twitter 上, 大概意思是说 OpenAI 提前发了这个进展 。
所以我们也在拭目以待 , 对吧 ? 因为听他的意思好像就是说 Google 也 DeepMind 也得了金牌 ,但不知道是不是也是一个通用型模型去做的 。
因为之前的这个 AlphaGeometry 这样的模型 , 它还是一个专用模型嘛 。 那如果是个通用模型能做 , 那就说明这个技术不只是能做到 ,并且已经不只是一家有了 , 对吧 ?
那就说明技术的扩散也要开始了 。 那这样的话 ,其实不管哪家的模型 , 可能都能够从中受益 , 大幅度提高推理能力 。
就你交流的这些从业者里面 , 比如说中国的从业者 , 会对这个成果是感到很吃惊 , 还是基本上也是能想到的 ?
我觉得这个方向肯定是大家知道大家在做的 , 就是更强的 reasoning 能力带来了 , 比如说更强的思考 , 那么就能够证明更难的题目嘛 。
但现在我们就能立刻把它拿到这个结果 ,其实我聊了一些可能中国最顶级的 researcher 都是表示也很震惊的 。
那我觉得这也是个好的信号吧 , 说明行业又有进步的方向 。
对 , 当你知道原子弹能爆炸的时候 , 离做出来它就不是很远了 。 所以我相信这个事情肯定大家会逐步地去了解怎么做 ,并且能够提高大家模型的性能 。
然后还想追问的一个问题是说 , 从这个技术进展到应用的一些变化 , 你刚才就是讲李世石时刻 ,其实历史上已经出现了比较典型的 , 我觉得有三个吧 , 一个就是在围棋上超越了最顶尖的人类 , 然后是 Coding, 然后是数学推理 。
数学推理这个其实比 Coding 更难 ,因为 Coding 其实是一个好验证的问题 。 之前为什么说强化学习在 Coding 上比较适用 ,也是因为 Coding 的结果 , 它的 reward 比较清楚 ,因为你的代码写出来了 , 能跑 , 能实现这个对应的效果 ,test case 都过了 , 那你这个结果就被验证了 。
但一个证明题有没有针对 , 像现在其实 IMO 解答的判卷也是很复杂的一件事情 。 所以当这种难以被验证的问题也被攻破的时候 , 我觉得它的泛化的意义其实是比这个 Coding 要更强的 。其实你看围棋是一个非常具体的 case, 然后围棋的信息是完备的 , 围棋的胜负是明确的 。
所以在这过程中, 它首先强化学习起到了很大的作用 , 然后 Coding 呢 , 它也是相对来说比较成结构的 , 对吧 , 容易验证的 ,并且 Coding 你可以认为是另外一种形式的语言 , 所以它是一个语言类的任务 。
很多时候大量的代码其实别人已经写过 , 你只是要把它拼装起来 。 所以在这过程中, 它的推理产生新知识的过程 , 我感觉是没有那么多的 。
但是数学其实是大家说到是理工科的一个基础 , 对吧 ? 那数学能解决其实很多理科 , 就不牵涉到自然世界去实验的 ,而是说靠思考推理能够去进步的学科 , 那可能都能够得到很多的进步 。
那这样的话带来的生产力进步 , 我觉得从科学的角度是比这个 Coding 要更大的 。
对 , 我刚刚其实想问的就是这个 , 就是它应用的影响 , 你觉得是会更大的 ?
我觉得有可能 ,并且如果说 Coding 现在因为替代的是很多比较年轻的程序员的工作 , 很多时候这种工作呢 , 还是属于我们之前讲的叫做复制 , 叫做说复制粘贴型的 。
代码小子的工作 。
是的 , 就是比如说我这个前端的这个界面 , 肯定有人写过类似的 , 我把它弄过来改一改 。 但是现在这种真正的思考带来的新知识 , 带来的解难题的能力 , 那肯定就是更值钱的那一部分 , 对吧 ?
其实我觉得 AI 就不断地在把人类比较简单的任务给替代 , 然后人类就往更加难 、 更加有价值的任务去走 ,但 AI 又去追着人去解决更有价值 、 更难的问题 。
所以这里边我认为它对于接下来应用的发展 ,AI 价值的提升都有很大的意义 。 这也是为什么我觉得确实这次其实让我更加看到了 AGI 的这个即将到来 , 对吧 ?
如果原来说 AGI 是一个火车 , 你远远地就看到了冒烟 , 现在已经听到声音了 。
你刚才讲的就是这个点 , 就是说它 IMO 的是否正对了 ,其实验证是很难的 。 我觉得这个也让我想到 , 就是他们 Twitter 上已经发的一些信息里面 ,也讲到说这一次的一个大的进展 , 就是在于它用强化学习其实也可以做这种看起来好像正负反馈不是那么直接的领域 。
就是 reward 不是那么清楚嘛 。
就它的奖励模型就好像看起来更复杂 、 更难设计 ,但它们也能做到不错的效果 。 就是有些 OpenAI 研究员说这是背后一个很大的进展 。
然后另外这个也让我想到 , 就是最近从 OpenAI 去 Meta 的一个研究员 , 叫 Jason Wei, 然后他那篇文章里就讲了有一个他的观察 , 叫做验证的非对称性 。
就他认为有很多任务是你做它的时间是少于你验证的时间的 。其实这种非常难的数学题就是 ,因为它验证的时候 , 就也许它可能比你做题花的精力都还多 。
之前的很多任务是属于 hard to produce but easy to verify, 对 , 就那种是之前比较容易验证的嘛 。 就是你写出一个代码比较难 ,但是验证代码能不能跑起来 ,其实试一试就知道 。
但现在的就有点像 hard to produce、hard to verify。
不过他总体认为就是这种我很难验证 , 或者说我验证的时间是大于它做出来的这个时间的这种任务 。他觉得在这种任务上你还是很难完全替代人的 ,因为你最后还是得需要有人来给它做一个判别 。
有可能 ,但是能够给出来证明 ,其实就已经是进来一大步了 。
技术上我觉得它肯定是一个一大步 , 然后智能能力上也是一大步 。
当然我们现在还不知道很多的细节 , 我们也期待能够有更多的分享和解密也好 , 对吧 , 或者是其他的模型公司尝试去复刻这样的成果 。
我相信这个也不会太远 ,因为按照现在 AI 的进展 , 基本上我觉得当一个事情能被做到的时候 , 意味着它就不再是一个真正的大秘密 。
抢人大战14:38
就相当于内层纸就被捅破了 。 然后刚才说到就 Jason Wei 这些人, 正好也是有一个想补充的话题 , 就是你上次其实也提到了 , 就你认为这半年有一个很重要的事情 ,也是最近才发生的 , 就是抢人大战 。
然后你其实跟我说你又新获得了一些信息 , 对吧 ? 这个可以补充一下吗 ? 关于抢人大战的信息 。
当然就是确实有很多人被抢了 ,也有人接到电话但没去 , 对吧 ? 我其实还是觉得大量的优秀人才以这样英文叫 disruptive, 中文叫颠覆性的薪资被挖走 ,其实不管从被挖的团队还是从 Meta 自己的团队 , 比如原来 Jen AI 这块的人 ,其实都会产生很大的冲击 。
听说这样的组织动荡其实在硅谷的每个主要的这些公司都在发生 。 被挖的人这边军心可能会动摇 , 对吧 ?
有人说为什么 , 那我是不是应该涨薪啊 ? 然后其实 Meta 已有的 AI 团队其实听说也还是有很多的冲击 。
我感觉高薪挖人肯定是非常对人才价值的一个体现 ,因为现在确实最后就是顶级人才的竞争 , 那么顶级人才的经验 knowhow 其实很重要 。
但我觉得同时呢 , 越是优秀的人才也越需要磨合 , 这个磨合是需要时间 、 需要环境的 。 能这么多厉害的人能不能和谐地一起去合作 , 形成合力 , 我觉得这个也是需要去观察 。
历史上也有很多失败的例子 , 所以我觉得这里面对于 Meta 的组织也会是个很大的挑战吧 。
你觉得什么时候在中国会发生如此激烈的抢人大战 ?
听说中国的大厂现在抢人也很厉害啊 。 据说腾讯现在就在花很大的代价抢人。
就据我所知 , 腾讯从通义和字节的 Seed 都挖了一些人。
目前看到挖人最猛的就是腾讯 。
所以字节是已经过了它挖人最猛的 , 就至少上一波已经过了 ,是吗 ? 现在是腾讯接过了这个挖人的接力棒 。
那我没有那么全局的视角 。
就你观察你感受到的视角 。 然后这个周末还有一个新的进展 ,其实在周五 , 北京时间的凌晨 ,OpenAI 发了它的 ChatGPT Agent,但是这个和 IMO 我觉得是引起了完全不同的反响 。
Agent 与壳16:32
就是这个 Agent 发出来之后 ,其实很多人是会觉得有点失望的 , 就是没有那么惊艳 。
对 , 首先我觉得这体现了 OpenAI 现在作为 AI 的领头羊以及最大的 AI 应用公司 , 它看到的这个机会的方向 。
就是像我们在年初就开始说的 , 这种能够理解目标 、 拆解 、 规划 、 去编程和使用工具 、 对结果进行 reveal 和进行反思的 Agent 的这个产品 ,其实从一开始的一个构想 , 然后到比如说像 Devin、Manus 等第一波产品作为先行者 , 然后到现在在 GPT 里面发布了 , 我觉得它是逐渐成为共识 , 成为大家聚焦的一个过程 。
就是这个 Agent 发了之后, 有的人总结是说 OpenAI 发了一个 Manus。
我们不会这么去想这个事情 。
不会这么去想这个 。
虽然我们有很多理由也许可以这么去想 ,但我认为首先完全不要低估 OpenAI, 对吧 ? 它有最多的人 、 最多的卡和这个最多的 AI 产品的用户 ,并且它确实在安全性上做了很多考量 , 然后也额外加了很多安全的约束 。
就是其实 ChatGPT Agent 它的能力是被限制得很死的 , 这是一个负责任的表现 。 这个在他们的对于 AI 的安全性的能力上是第一个被列为 high, 就是高危险级别的产品 。
这个是一个对 AI 安全性负责的表现 ,因为他们也很担心 , 比如说这里面遇到钓鱼网站怎么办 , 然后去进行什么寻找生物武器信息怎么办之类的 。
但我觉得这同时呢 , 这就使当公司变大之后就会变得更谨慎一点 。 这可能也是说明创业公司行动力快 , 这个敢于突破的机会所在 。
对 , 我就是有人总结说是 OpenAI 发了个 Manus, 我觉得倒不是说这个效果 , 或者就是方方面面的这样去比较 , 主要可能还是指的这个产品的形态上 ,因为它其实是把 operator 就像你之前总结的 , 你觉得这是一些写的操作 , 对吧 ?
然后还有就是 deep research, 就是它是研究的 ,是读的操作 , 它把这两个结合起来了 。 就形态上这一点是和之前 Manus 或者 Genspark 这些是比较像的 。
是 ,因为 Manus 它们确实探索出来的这样一个让 AI 它在做什么能够被比较直观地看到 , 让人理解 Agent 的正在发生什么 。
否则的话 , 你如果完全只是说出来一个结果 , 那可能我们中间就会很困扰 , 对吧 ? 所以其实我们也看到这个 Manus、Genspark、Kimi, 包括还有 MiniMax 应该等中国的几家 AI 公司们都陆续针对 OpenAI 它们的 task, 然后用自己的线上的 Agent 的产品去做了对比 。
不得不说啊 , 这几家公司从线上产品给出来的结果在很多维度上, 比如说有做 PPT 的任务 , 它做的 PPT 确实是比这个 ChatGPT Agent 产生的结果要更好 。
就是 ChatGPT Agent 的那个 PPT 真的真的是有点丑啊 。
但我觉得这里面给我几个启发吧 。 我觉得第一个肯定就是说说明中国公司做产品的产品力是不错的 。
这个当然我们从移动互联网已经看到了很多这样的例子 , 对吧 ? 那不管是 Digitalog、 适应 、 积木 、 剪映等一系列中国公司做的移动互联网产品确实都很不错 。
第二呢 , 我觉得就说明所谓的套壳 , 所谓的这种应用 ,DevPi 的应用并不是就会被 Model Native 的产品吊打 。
因为之前大家想法是说 , 哎 , 你等 OpenAI 下场 , 下场它模型能够端端去训练去吊打你 。 但我发现其实好像并没有那么简单 , 尤其是在之前 Chatbot 很多时候其实用户就是在和模型直接沟通 。
所以这个时候其实没有多少 Context,也没有什么工具 。 这个时候当模型变强之后, 那确实可能吊打一个 Chatbot 的第三方产品 。
但是在现在 Agent 其实是需要更多的 Context, 需要更多的工具 。 那么这个时候其实这些 Context 和工具 , 所谓的环境其实很多都是由壳或者应用本身来提供的 。
所以 Manus 呢 ,也分享了他们怎么做 Context Engineering 这样的事情的文章 ,其实很多人是很好评的 。 因为这就是一个大家现在都在解决的问题 , 这里面有很多实践其实是需要时间和经验的 。
哦 , 对 , 说起来这也是周末新发的一个东西 。 这个文章的链接我到时候也可以找到 , 放在 show notes 里面 。
其实我会在想 Context Engineering 其实它可能最早是来自于 Prompt Engineering, 对吧 ? 但是 Prompt Engineering 呢 ,其实就是说你给 AI 一个命令 , 一个任务 , 然后 AI 自己去做事情 。
我当时开玩笑说这个很像很多公司的管理方式 , 老板说要做什么 , 员工就去做 。 但是好像比如字节这样先进的公司 , 它其实强调叫 Context not control, 它其实想说的是说我要给员工更多的是上下文 , 更多的授权 , 这样员工能够更好地去完成任务 。
那么现在 Context Engineering 我的初显理解也是说 , 那么模型它能够用的是这些 Context, 那我怎么样 , 比如说把更好的内容以更加适合模型去操作的方式去给它 , 从而提高它的表现 。
那这里面可能比如说第一 , 我每个单独的 session, 那么我怎么有更好的 Context, 怎么有更好的数据以更好的格式去进行处理 , 这样我单个 session 我可以做得更好 。
第二个呢 ,是如果我有多个 session, 比如说我今天做了什么 , 明天我还做个对应的事情 , 后天我还做个对应的事情 ,以及所谓的个性化和记忆 , 那么我们怎么通过一个跨 session 的更好的 Context 来持续提高 AI 为我工作的质量 。
这个长期可能是成为我的护城河的 ,因为我在我这儿我拥有更好的 Context, 所以同样的模型更了解我 。 那这个可能叫所谓的用户偏好或者个性化 , 甚至是我工作积累下来的工作经验 。
那么第三呢 , 就是说我觉得好的产品设计是可以提供模型以前获取不到的 Context。 比如说大家经常举的一个想象中的产品 , 虽然现在没有做出来 , 就是假设我戴个眼镜 , 我能够时时刻刻看到我的周围 , 那这种 Context 肯定是需要通过好的产品设计 , 当然这里面包括硬件和软件去提供给模型的 , 模型自己不可能产生这样的 Context。
那么这也说明了就是产品层的价值 。
就是你说的那个例子 , 眼镜看到的数据是现在的互联网巨头都没有的数据 。
所以我想说的是说 , 从 ChatGPT Agent 的发布 , 首先我们看到了 Agent 这个方向的共识化 。 第二呢 , 看到了创业公司在面对模型巨头的时候 , 仍然是有它的灵活性 ,有它的先发的优势的一些竞争优势的 。
第三呢 , 我觉得也是进一步的体现了我们之前说到的什么被低估了 。 我觉得模型进步的速度被低估了 ,并且壳的价值也被低估了 。
那么我觉得这个周末发生了两个事情 , 对吧 ? 一个是模型获得了 IMO 金牌 , 说明模型的进步速度其实还是很快的 。
就是这个进步速度可能还是在被低估的 。 但同时 OpenAI 自己做的 ChatGPT Agent, 它还是有很多可以被提高的空间 。 这也说明了产品本身壳的价值也是在被低估了 。
所以其实我觉得可以同时两个事情在被低估 , 对吧 ? 模型可以 , 模型和应用都在被低估 ,也就是说 AI 可能整体还是在被低估 。
而且你刚才那个总结很好 , 就是应用或者说壳的有一层价值来自于特别的 Context, 就是上下文 。 而且就是你刚刚说的那个 Context no control, 它其实是和管理学 , 就那应该是奈飞工作法的那本书里最开始 , 对 , 最开始提到的嘛 。
它和这个我觉得它给打通了 , 挺有意思的 。 因为 AI 确实在生产力上, 它是比较像一个人的 。 就是如果你把它作为一个人去理解 ,其实你可能能更好地使用它 , 就是你是要教它的 。
然后你给它上下文 , 可能是一种更好的教它的方式 , 就相比于给具体的指令 。
因为第一波大家想的就是怎么写更好的 Prompt。
就是给更好的指令 。
对 , 老板怎么写更好的 Brief。 因为最开始我们人类可能是说我要一个大气的什么东西 , 然后后来说啊 , 这个具体应该是怎么去做 。
但是在进一步的来说 ,是你可能有比如说更多的视力 , 更好的外部的环境所带来的 Context 等一系列的 , 它还有很多具体的技巧 , 对吧 ?
那个 Manus 的文章里面分享了很多 。 但我想说的是说更多的 Context 让模型能力进步的提升 , 这个其实就反映了说我们对于 AI 模型用的程度更深 , 产品本身的进化程度也越来越完善 。
原来可能就是一句句话输进去 , 模型就自己去跑了 。 那现在其实产品可以做更多的事情 。在这个过程中, 我觉得产品公司的价值可能就这样能够更好地体现出来 。
你觉得这一层的应用的价值 , 什么时候才有可能会被模型也做掉啊 ? 那就是得等在线学习出现的时候吗 ?
我可以不断吸收 , 就模型本身可以不断吸收新的上下文的时候 。
在其中, 比如说你还要获得这些上下文 , 比如说你产品有没有用户的 input, 那如果你没有这样的 input, 那你再怎么学习也学不到呀 。
那从这个角度的话 , 我觉得它好像又回到了之前曾经被大家就是讨论过说会否认的一个逻辑 。 就因为以前移动互联网是你用户越多 ,其实你的这个数据反馈越多 , 然后你去做推荐的精准度就会越好 。
它是有一个正循环的 , 它是一个自动能转起来的数据飞轮 。 然后后来就大家又觉得说 ,在大模型就是 Chatbot 这种应用里面 , 你用户给的很多输入其实对我模型智能能力的提升是没有直接的帮助的 。
但你刚刚说的就是用户的输入 , 它对上下文应该是有直接的帮助 。
我觉得这是两个问题 。 之前大家说数据飞轮不存在 ,其实指的核心意思是说用户本身的这些聊天记录 , 它没法提高模型的智能 。
这个我是同意的 。 因为模型的智能其实它现在已经超越了普通人的水平 , 所以我日常跟它聊天的这些东西其实对它的智能没太大帮助 。
因为最开始的时候 , 模型通过 ILHF 来提高模型的表现嘛 。 就是但是现在普通人的 preference 已经没啥用了 , 比如说我都能解 IMO 的题目了 , 那我干嘛在乎普通人觉得我这个好还是那个好 。
所以对于这种有标准答案的东西 , 普通人大部分人的输入其实是没什么价值的 。 但这个不妨碍说 , 当我要完成一件工作的时候 , 比如说在 Agent 的这个场景 , 我应该怎么去做这个工作 , 我有什么样的这个反馈 , 然后我怎么样能够完成用户的目标 , 这个角度 , 那用户的数据肯定是有帮助的 。
所以这是两个事情 。
就是说用户数据对其实体验是有帮助的 , 对产品本身的体验是有帮助 ,但它不一定对模型能力的提升是直接有帮助的 。
对智能或者对这种有标准答案的这种 ground choice,其实这个可能确实意义比较小了 。 因为最开始模型等于是大量的人类平均智能的压缩嘛 。
当时那个 Ted Jiang 不就说语言模型是一个互联网的模糊压缩嘛 。 但是现在显然它已经超越普通人了 , 那它已经是一个超人水平了 。
那这个时候简单数据分类就不是那么有用了 。
对 ,因为我想这点是在想 , 就是现在这个时间点 , 可能你越早来做 Agent, 你积累的这些用户 , 还有上面的这么多上下文 , 还是非常有价值的 。
就它是会随着时间 , 你这个价值是会越来越明显的 。 因为之前大家可能会担心说你有什么新的更强的模型出来 , 然后之前的很多产品就被淹没掉 。
如果你没有 Context,也没有环境 , 你就是要模型 , 模型给你什么你就出什么 , 那可能确实是 。
以上是 7 月 21 日新补充部分 。 接下来的内容是上周我们的录制 , 我们复盘了 Agent 等 AI 应用的普及主线和值得关注的技术变化方向
上半年复盘27:40
。 相比我们上次聊的是 2 月份 ,2 月初的时候 ,其实到现在有小五个月 , 今年也过了一年过半了 。
那总结一下的话 , 你觉得 25 年上半年在 AI 这个领域 , 你自己认为发生的最重要的几件事是什么 ?
其实都属于说 AI 在很多领域已经从一个研究 , 或者叫做说很创新但可能用途还不大的产品 , 或者说技术 , 它进入到了主流市场 。
比如说 Coding 肯定是现在重中之重 ,并且我今天听说 OpenAI 单独了一个 Coding 的部门 。 就是现在 OpenAI 有三个业务线 , 一个是 GPT, 一个是 API, 一个是 Coding。Coding 肯定是现在就大家发现 AI 最有用 , 大家最愿意为它付钱 , 成长非常快的事情 。
那这个的代表呢 , 我觉得就是 Cursor 或者说 AI Coding 工具 , 然后 Claude Code,有人说它是 L3 或者 Agentic 的这种 , 就更加 Agentic 的 Coding 的产品 。
它能够比人就是效率更高 , 写的代码效率更高 , 代码这个更加优美 , 能处理更大的 Codebase, 对吧 ?
所以 AI 在 Coding 领域正是跨越鸿沟 , 进入主流市场 , 这个是我觉得上半年最重要一件事情之一 。 第二呢 , 就是我觉得 O3 是在 4 月份正式发布的 。
它其实同时伴随的是 ChatGPT 的用户高速增长 , 对吧 ? 去年我们下半年看到 O1 的发布 , 然后看到年初看到 R1 的发布 , 然后看到 O3 的发布 。
就这几个 reasoning model 的进步呢 , 实际上代表着说就是 AI 在推理问答 ,在答题解答问题这个领域 ,也是从一个很惊艳的科研 , 真的到了一个大家都能用到的产品 。
所以它也是一个跨越鸿沟的这样一个过程 。ChatGPT 的用户增数还在上升 , 很多是通过被 Deep Research 啊 、O3 啊这样的进一步的推理能力所带动的 。
那么我们也看到 R1 当然是在年初 , 我们对于中国公司对于 reasoning 很重要的一个突破 。 然后 Kimi Research 也是国内可能第一个广泛可用的 Deep Research 类的产品 , 我们看到也获得了很好的用户的反馈 。
那么我觉得这个领域 AI 也已经正式比大部分的人要做得更好了 。 所以这也是一个跨越鸿沟的过程 。
那么第三 , 用户一直说 David 是一个非常先行者 , 对吧 ? 他第一个我们看到一个什么叫 L3 级别的 Agent 的 Prototype 的雏形 。
然后 Manus 在 3 月份的发布 ,Genspark 也是在 3 月份的发布 , 然后 Claude Code, 当然还有更多的 , 比如 LLaMA 这样的产品市面上 。
我觉得大家陆续看到了说随着模型的三大能力 , 推理 、Coding、Tool Use 三大能力的提升 , 带来了说第一批能够去人们给它一个模糊的目标 , 然后它自己去使用工具寻找解法 , 评估自己的这个解决的程度怎么样 , 然后去完成任务 , 这样的 Agent 的形态的应用的出现 ,并且它证明了在一些领域确实用户是喜欢用 ,是愿意使用它的 。
那么这个我觉得它应该还不是说进入了特别主流的市场 ,但是我觉得已经在早期市场 , 就是 Early Adopter 里面 , 这种 Agent 形态的应用确实在得到广泛的普及 。
它有很多问题 ,但是我们已经看到它变得很有用 。 所以我觉得这个是 AI 在应用这个领域发生的可能最重要的这件事情 。
然后第四呢 , 我觉得多模态领域其实进展也是从一个像玩具一样的应用场景 , 到了一个越来越主流的场景 。
这里面一个是 4O 的图片生成 ,因为 4O 图片生成对语义的这个跟随非常好 , 大家会发现你用 4O 去生成的图片能够很准确地反映你的意图 。
所以我们看到越来越多的人, 不管是吉卜力时刻 , 还是有人拿到画漫画 , 还是有人拿到画流生图 , 这种图片生成的能力是更加有用了 。
而且它也可以去帮助一些 Agent 的应用去做就是更丰富的内容的输出 , 或者说交互之类的 。
对 ,因为本质上讲 , 它的指令跟随变得越来越好 , 所以它能够更满足你的要求 , 对吧 ? 因为原来就像抽卡嘛 ,但是现在它已经越来越好了 。
直播来讲 , 越来越多人头像变成 AI 产生的了 , 对吧 ?
很多微信公众号文章的头图我一看也是 GPT-4O 生成的 。
对 , 然后 Veo3 我觉得是非常厉害的一个模型 , 就是它把声音配上去之后, 对吧 ? 我之前发过那个朋友圈 , 就是说其实我们看到的这样 Veo3 生成的世界已经有点像是一个真假难辨的虚拟世界了 。
我觉得这个也是突破了一大步 。Veo3 第一次让我有了一种跨越恐怖谷 , 又有点真假难辨的感觉 。 我觉得这个也是在上半年发生的 。
第五 , 抢人大战 。 不管是说 Meta 的抢人, 还是说一些创业公司这种很多钱 , 包括我最近 Winther 这个收购的这些 drama, 对吧 ?
这些八卦 , 我觉得其实都反映就是说在硅谷对于人才的争夺 , 对于公司的融资的竞争进入到了一个新的激烈程度 。其实我们在中国去看早期投资界也是感觉到市场今年变得很热 ,因为很多项目的这个融资额也上来了 , 然后抢项目的情况又出现了 , 对吧 ?
跟几年前我们说硬要去抢项目了 , 然后也出现了一个月融好几轮的这个情况 。 所以我觉得大家的这个热度情绪是在提高的 。
就这些也都是因为大家确确实实看到了 AI 它的落地 , 很多事情已经不再是概念 , 已经是实实在在的升值收入了 。
所以我觉得你最关注的主线都是跟它应用普及 , 然后渗透到更多人相关的 。 它的原动力还是技术的变化是吗 ?
我们认为模型基础能力的提升会解锁更多的应用场景 , 然后模型的能力配合好的应用 ,其实它会让大家能够真正的把这个能力用起来 , 给用户创造价值 。
一个真的能给用户创造价值的应用 ,他们是能够从用户那以各种方式收到钱的 , 可能最直接的是订阅 , 那可能以后比如说以交付工作去收钱的各种方式 , 就是它的商业化是会被逐渐证实的 。
所以我们在这个里面呢 , 我们最关注的还是 AI 对于生产力的提升 。 那么在数字世界和物理世界里面 , 我们更关注的是 AI 在数字世界的能力 。
所以可以看到我们投的很多应用 , 主要是 AI Agent 或者是 AI 生产力相关的 。 这也是我们觉得目前最能够实际给用户带来价值的一个场景 。
因为其实除了你刚说你们关注这个主线之外, 包括像 AI 硬件 , 像具身 ,其实它也算是大的这个 AI 范畴里的 。
具身我们一直还是觉得目前当然非常火热 ,但是实际上我认为今年有一个被高估或者被证伪的事情其实是什么 ?
是特斯拉最近下调了对 Optimus 的生产预期 。 这个事情我在去年的时候 , 我在 23 年的时候 , 我其实就认为大家对 Optimus 进工厂打螺丝的预期是太高了 。
因为当时大家好像普遍觉得是说 25 年有 1 万个机器人要进工厂打螺丝 , 我觉得大家是完全低估了对于机器人的 manipulation 这件事情的难度 。
到目前来看 , 当然我们看到大的 Demo 在 getting better,在越来越好 ,但是你实际上像刚才我给你做了杯咖啡 , 你要机器人去做一个咖啡这样的事情还是非常非常难 。
当然我觉得很有可能 , 比如说突破就在这几年会发生 ,但是大家如果觉得 25 年就会有实际落地 , 我觉得那个肯定是高估了 。
你刚说的那个 Optimus 下调它的生产预期 , 这个还是晚点报道的一个独家 。 然后在那之前我们还写了一篇文章 , 就是讲这个整个具身智能的产业链的 , 里面很多其实也是特链的公司了 。
就是从这个产业链去捋一遍 , 你就会发现它里面有很多地方确实都还是在一个比较早期 ,不是很成熟的状态 。
这件事情不能拔苗助长 , 就是它技术的发展会经历一个方向逐渐确定 , 到 scale up, 到技术变成产品落地 , 到广泛铺开的过程 , 它很难跳过这个过程 。
所以我是觉得之前大家对于机器人的这个预期是肯定是比较高的 。
另一方面 , 你觉得这半年有没有一些被低估的事儿 、 公司或者现象 ?
低估与高估35:25
我觉得首先应用的价值还是在被低估的 。 因为在一年以前 , 我觉得大家讲的叙事是说模型公司会吊打应用公司 , 说这个应用公司会套壳 , 对吧 ?
所以当时我觉得不管是像 Manus、Monica, 还是我们投的其他的很多公司 ,其实经历了很多质疑 。 大家说你是一个套壳 , 你有没有这个长期价值 ,是不是模型一升级你就完蛋了 ?
那我觉得从现在来看 , 就当然这个 debate 还在继续 ,但是我认为显然不是说模型一升级应用公司就完蛋 , 相反好的应用公司是期待模型升级来让他们的用户得到更强大的应用的 。
所以我觉得应用的价值 , 或者我们调侃一点说壳的价值 ,其实还是在被低估的 。 第二呢 , 我觉得被低估的就是优秀团队的价值还在被低估 。
当然我想说 Kimi,但是我想说 Kimi 也不是像只有一个 Kimi, 对吧 ? 我们投 Manus、 投 Kimi、 投所有的 , 我们都是投人。 所以其实显然大家之前没有预料到 , 比如说小红会做出一个世界级的 General Agent 的应用 , 对吧 ?
另外比如说 Kimi 在几天前发的 K2, 确实在现在此时此刻 7 月 15 号 , 它就是全世界最好的开源大模型 。
没有之一 。
没有之一 。 它确实在 Coding,在这个 Agentic work, 包括在中文写作能力上, 确实是比 R1、 比 Grok4 要更好的 。 当然 R1 是一个在年初发布的模型嘛 ,在 AI 里面 6 个月就是过了很久 , 对吧 ?Grok4 我觉得它的侧重可能也不只是在 Coding 或者这些方面 ,但整体来讲 , 我们从用户使用的反馈来看到 , 包括从 benchmark,因为大家现在都不信打搒了 , 对吧 ?
那我们就看用户的反馈嘛 。 我觉得确实我们看到的是非常非常正面的全球的反馈 。 所以就可以说确实他们也交出了一个阶段性的答卷 , 对吧 ?
大家会问 DeepSeek 之后 Kimi 在做什么 , 这个我们在上一次播客时候我们也讨论过这个问题 , 就是他们确实也做了很多的复盘 , 然后把精力聚焦在下一代的模型 , 聚焦在技术本身上 。
但是我觉得我们很容易在很早的时候就去有一些这个过早的判断 。 第一步的优秀团队 ,他们去调整自己转型的过程 , 大家就好像说 DeepSeek 出来 , 你们这几小龙是不是都不行了 。
我觉得其实并不是这样的 。 我觉得当你团队够稳定 ,并且你还是有很多优秀的人才 , 还是有很多资源 , 团队又在很努力的去往前突破的时候 , 那其实团队的主观能动性和腾挪空间还是远远被低估了 。
对 , 我可以补充一下 ,因为昨天就是我们也在讨论一个数据嘛 , 就 OpenRouter 上, 它是一个可以去调各种模型的一个路由器 , 就很多开发者会用这个 。
就是在 OpenRouter 上的统计 ,K2 其实刚发了没几天 , 它昨天我看是在编程这个类目里 , 它的调用量是排在 13 的 。
我这会儿在看 , 今天的话它已经到第 10 了 。
对啊 ,因为前面都是那些闭源模型嘛 。
前面是 Claude、Gemini、GPT, 它前面还是有一个开源模型的 , 结果排在第八的是 DeepSeek V3。
坦率来讲 , 我觉得实际用的人肯定会意识到 K2 比 V3 好 ,但因为 V3 出来时间很长嘛 , 所以肯定你有很多应用是已经架构在 V3 上的 , 我相信这个用量还会变化 。
对 , 我觉得它作为一个新模型 , 它的上升还是很正常 , 非常快的 。 这个还是一个用户的反馈 , 它不是 benchmark 之类的 。
确实现在看 benchmark 大家已经看得麻木了 。
对 ,因为 Coding 和 Agentic 的 workflow 确实大家用的 , 应用开发者他就是在用这个 build 的 。 所以如果你有一个跟 Claude 相比也很好 , 同时呢成本又很低 ,并且还开源的模型 , 那其实很多人是有动力去使用的 。
那你使用下来 , 大家的评价我觉得是最真实的 。 你其实你看 , 比如 Popularity 的那个创始人 ,他就发了一个推特嘛 ,他就说我们已经在开始尝试调研这个 K2 在 Popularity 的使用了 。他就说 Kimi 做了非常好的工作 。
当然有人调笑说 OpenAI 是不是本来说要发个开源模型 , 结果 delay 了 , 当然我自己并不认为这个是事实 。
我觉得这可能应该也是个巧合吧 。
因为他之前是说 7 月的时候 ,他们要发一个开源权重的模型 。
他们确实 delay,因为 Sam Altman 发了这个推特 。
但是我觉得它反映了一个现象 , 就是现在模型的竞争还是理追我赶非常的激烈的 。 就你不能说谁这会儿厉害了 , 你就觉得其他人不行 。
所以总结下来就是说 , 我觉得优秀团队的价值是在被低估的 。
一个是应用的价值被低估 , 一个是优秀团队的价值被低估 。
还有一个是模型的能力进化速度可能也被低估了 。 比如说听说 GPT-5 很快就要发了 ,在这里面可能它是一个多模态 native, 推理能力非常强 ,Agentic 能力也非常强的模型 。
实际上我们发现好的应用公司其实都是在针对 6 到 12 个月以后的模型去做设计 。 比如说 Cursor 刚出来的时候 , 当时的模型是跑不动它的想要的那个 vision 的 。
但是直到说 Net3.5 出来 ,Cursor 才真正的成为一个好用的产品 。Manus 其实在设计的时候只有 Sonnet 的 3.5,但是 Manus 发布的时候 ,Sonnet 3.7 已经发布了 。
所以当时 Manus 本身的能力得到提高 。 那么 Claude 4 啊 ,Gemini 2.5 啊 , 这些新模型出来之后, 对 Manus 的能力也是提升的 。
那现在我们其实也看到模型的能力提升速度还是很快 , 可能很快就会有让大家震惊的这种发布出现 。
那么在这个过程中, 我觉得可能出现的情况是模型增长也超预期 , 应用的价值也超预期 , 从而导致整个 AI 可能从这两方面的进展其实都是超过大家预期的 。
其实这半年有一个我之前没有想到的新变化 , 跟 AI 本身没关系 , 就是最近非常激烈的外卖大战 。
巨头与模型40:54
因为外卖大战这件事情 , 它还是牵扯了好几个巨头的精力和资源嘛 , 包括阿里 、 美团和京东 。
你觉得这个会怎么影响就是中国的 AI 的格局 , 或者说对创业公司来说 , 它可能会有什么影响 ?
现在感觉这还是两个战场吧 。 长期可能有影响 , 对资源的投入我觉得是有影响 。
我觉得对资源投入是有影响的 。
对资源投入 。 但是我看比如说其实阿里云的增速预期还是挺高的 , 对吧 ? 包括你看今天英伟达也宣布可以重新卖给中国 H20 嘛 。
我觉得我们在看的就是说美国其实这 IDC 或者云计算云服务的 capacity 涨得是很快的 。 因为当你的这个模型能力到了一定程度之后, 应用落地 , 大家就会用这些应用 。
所以你要很多的推理成本 。 这个事情肯定首先发生在美国 ,因为他们先搞出来了这个 Sonnet 3.7 或者 4 这个级别的模型 。
但中国对吧 , 比如说 Kimi 或者字节或者 DeepSeek, 它都会有同等类型的模型 , 大家就是隔了几个月的时间追赶 。
那么我认为大概率中国的这样需求也会起来 。 因为在 knowledge worker 就是知识工作者上面 , 中国美国是很像的 。他们也用 Office, 我们也用 Office,他们也用搜索查找 deep research, 我们其实也用 , 对吧 ?
所以那这个需求起来我觉得是很确定的事情 。 当然这个跟外卖大战没什么关系啊 。 我只是说比如像阿里云啊 , 火星云啊 , 这些中国云服务 , 包括这些数据中心数据公司 ,其实他们可能也会有一个美国那边出现过的事情 , 再次出现的这样一个模式吧 。
确实没有什么直接关系 。 不过我看了一下, 就是大家深称的要在这个外卖上投入的资源 , 我觉得还是挺多的 , 比投 AI 好像要多很多 。
是 。其实我觉得与其免费喝奶茶 ,不如训先进的模型 。
那我们接下来可以就是我让我一些具体的分块展开说说 。 你觉得为什么 R2 还没有发 ?DeepSeek R2。
那现在 DeepSeek 那都是很神秘啊 。
很神秘 。
也只能说通过各种外围信息去了解了 。 听说那个还是在 V4, 还是在训练阶段嘛 。 因为首先它是先发了 V3 再发 R1 嘛 , 那现在 V4 还没出来 , 对吧 ?
所以你觉得 R2 它肯定是要在一个新的基模上 。
我听说就是 V4 还在训练 , 那么 R2 那就可能要等待 V4 之后 。I don't know, 这个那我相信他们肯定有很多很有意思创新 , 比较聊过一些里面的人。
对 ,他们的创新能力肯定是很强的 。 但同时我觉得也会受到算力这些限制 ,因为本身卡相对也是总数也有限的嘛 。他们火了之后其实也有很多算力要去做 inference, 对吧 ?
对 , 我觉得他们可能也会有一些变化吧 , 就是对模型或者说对智能这个接下来怎么演进 。 因为我见过就是去年秋天跟梁文峰有一些交流的人 ,他那个时候还是非常笃定就是就是要做大语言 。
虽然他们也发了一些多模态的东西 ,但他其实他们基本上是不做多模态的 。
他们做现在的投入了很多 。
对 ,他们后来就是有变化了 。
对 , 我觉得这也是一个比较现实的情况 , 就是他们的资源没有多到能够全面去对标 , 对吧 ? 所以他必须像 Claude 一样 , 我有一些我的判断 , 就我认为这个东西在现在比较重要 , 且比较能够出结果 。
以及在另外一方面 , 我可以等一等 , 等到大家的思路更加清楚之后, 我以我的工程能力的优势和我团队的人员就更努力 , 更有创新精神 , 对吧 ?
我去赶上 。 比如说像字节现在可能是比较全面 , 对吧 ? 它有这个 Edge 要去做最领先的 ,有这个 Focus 要去做 Solta 的 , 然后也有这个 Base,以及说要去服务应用的 。
就字节我感觉是一个我在各个领域 ,不管是 Coding 啊 , 推理啊 , 多模态 , 我都要全面突破 。 那像 DeepSeek 可能就是重点突破 , 对吧 ?
就我在比如说这个智能上面我要去突破 。 我觉得确实你资源没有那么多的时候 , 你可能就得做一些选择 。
就是 Seed 上面有 Edge、Focus 和 Base 三个组织嘛 。
就他们现在有这样的一个明确的分工 , 你去探索前沿 , 你去干嘛 , 你去干嘛 。
我理解是的吧 。 就是比如说 Edge 就周畅在那里嘛 , 下面应该有十几个项目是吧 ?
最开始他们是列了五个方向 , 五大方向 Edge 是吗 ? 那可能现在它扩展到十几个项目了 。
确实很厉害 。 字节这个组织调整 , 我觉得把应用和研究分开 , 把研究里面的 Solta 和 Frontier 这些分开 , 反正我感觉是比较对的 。
他们是学习了什么其他公司的方法吗 ?
OpenAI 之前也是分 Frontier 和 Apply, 对吧 ? 但我觉得其实就是当你资源有充足的时候 , 你确实应该把组织的职责变得更明确一些 。
因为我觉得之前大家普遍遇到的问题是 , 你如果又要模型团队去做前沿的研究 , 追赶 Solta, 甚至要超越 Solta, 一方面它要应对你有一个 App 对应的需求 , 那这个事情是很容易打架的 。其实我觉得 Kimi 在过去的半年其实也是总结了很多这样的反思吧 。
就比如说对 K1 完全就没有投什么精力 , 对吧 ? 主要就是在做下一代的模型 ,以及通过 L 去提升模型智能的边界 。
因为原来其实你有一个应用在这的时候 , 你是要花很多精力去维护这个应用的 , 对吧 ? 这里面有些什么 corner case 你要解决啊 ,有些 bug 你要修掉 。
但是我觉得很多这些工作呢 , 实际上对于你冲击下一代的模型去挑战 Solta 其实没有那么多帮助 。
他们以前是没有分开的是吗 ?
之前很多公司其实都会有这种模型团队要做需求的情况 。 这是两个完全不一样的优化目标嘛 。
是的 。 这其实是以前我们经常会反复去问大模型创业公司创始人的一个问题 , 就是你又做模型 , 你又做产品 , 中间的精力你怎么去分配 ?
目前来看 , 我觉得你可能还是先得把一个轮子做得很好 。 比如说如果你就要做应用 , 那你可能就得假定你要用最好的模型 。
这个模型不一定是你自己 。
对啊 , 那比如 Manus 对吧 ? 那我就是谁最好 , 谁最适合我就用谁 。 那么如果你是要做模型 , 那你可能就是想我怎么样去让我的模型能保持 Solta, 具备一个某个领域最好的能力 。
你包括 OpenAI, 它之前的 Coding 也不是做得最好嘛 。 就是强如 OpenAI, 你也不能说全面都领先 , 对吧 ?
那我可以聊一下那个 K2, 你应该是比较了解的 , 就 Kimi 的这个 K2。 因为其实在今年年初的时候吧 , 就 DeepSeek 的热潮之后没多久 , 当时是有一个信息 , 就是说 Kimi 重新有一个内部更加明确我们的目标 , 就是要追求 Solta, 对吧 ?
然后可能我们现在看到的 K2 应该是它这样一个调整之后, 包括它投放也少了很多 , 拿出的第一个比较重磅的成果 。
你对这个过程是怎么了解的 ? 其实我第一眼看到 K2 的名字的时候 , 我觉得还挺有寓意的 。
山嘛 。
对对对 , 乔戈里峰 , 就是出名攀爬的山 。
对对对 。 这个也首先我想讲的就是说 , 前几天那个暗涌在良渚有一个 panel, 就他把投了 Kimi 和 MiniMax 的投资人放在一起 , 又搞了个 panel。
对 , 你们这是第二次相聚了 。 去年, 前一年也是 。
前一年, 前一年是他就吉祥龙大概 。 反正那个 panel 我就开玩笑说 , 我说怎么这搞得好像大家都很同情我们 , 说你们怎么投了吉祥龙啊 。
但我觉得就是说其实你会发现 , 遇到挑战的时候 , 一个团队怎么去回应这样的挑战 , 对吧 ? 怎么去坚持自己的路线 , 去做创新 , 创造价值 , 这是反映一个团队能力 。
因为顺风有顺风的打法 , 逆风有逆风的打法 。 比如 MiniMax,他们有他们的专注的领域 ,他们一些启动上市的流程 , 所以这是就他们的一个应对答案 。
那当然也有一些吉祥龙公司可能出现了更多的内部的团队变化或者业务的调整 。 我觉得 Kimi 其实他们很重要一点就是说团队是很稳定的 。
确实如果你看这个创始人团队或者说核心团队 ,其实是没有什么大的变化的 。
对 , 这就是我第一个好奇的问题 。 因为其实不少公司就到联创这个层面 , 或者说到某个板块的负责人这个层面吧 , 都是有一些变化的 。
都是变化 。
Kimi 是没有怎么变 。
对 , 我觉得这个与他们团队的基因有关 。 因为确实这个团队一直零为核心 , 大家其实都认识合作很久了 。
这不是说因为我要做这么一个大模型公司 , 我才穿起来这么个团队 。
他们有些是以前在清华就是同学 。
对 ,有些是有啊 , 一起玩乐队的呀 。
而且有一个事挺有意思的 ,以前我也找了很多院的资料啊 , 就看到当年杨钧霖去评特奖的时候 ,有一个照片 , 大概就是他们系的一些同学做了一个横幅在支持他 。
我也遇到过一些就是摇班那上下级的一些同学嘛 。 就我会觉得就是在清华的这个氛围里面 , 就比如像杨钧霖这种当年在学校里学术 , 或者说他的一些行为和事迹让大家觉得很牛的人 ,他在这群人里还是非常有号召力的 。
当然 , 这是我们从一开始从循环开始投他的核心原因啊 。 就是这种是毫无疑问的 , 就是我们识别出来的不管是技术还是组织的领袖嘛 。
所以我想说的是说 , 这个团队一开始的构成其实不只是说因为这件事 ,而是因为大家有共同的交情 , 共同的信任 。
合起来团队在遇到挑战的时候 , 这个稳定性很重要 。 第二点呢 , 我觉得还是 Kimi 他们其实一直在专注的做一个方向 ,也就是提高智能 , 对吧 ?
你去看他的这个官网 ,他一直以来的使命就是说探索把能源转化为智能的最优解 。 当然他们也会有些各种探索 ,但是整体来讲 ,他们一直是在关注生产力 , 关注智能这个方向 。
比如像多模态啊 , 像这种情感陪伴这些 , 确实他们就反正是也反正没有说上线一个什么产品去做 , 对吧 ?
我不是说这就是对的或者错的 ,是说至少他是很 focused 的 。 因为尤其在面对挑战的时候 , 你肯定要团队稳定 , 方向聚焦 ,并且呢 ,其实 Kimi 这个团队 ,他一上来就是以技术的基因以及技术的 vision 作为他的核心的能力的 。其实因为 AI 变化太快了 , 可能大家很多都忘记了 。在 23 年的时候 , 当年其实跟后来 DeepSeek 有点像 , 对吧 ?
也是一个出圈的 AI 的应用 。他当时其实对长文本这样一个技术的方向做了一个很重要的判断 , 对吧 ? 所以他去做了一个长文本的这样一个模型 ,并且基于这个拿出了带搜索的 Kimi 的第一个版本 。
因为那个时候大量的 AI chatbot 是不带搜索的 。 你不带搜索 , 你肯定你的这个用途就局限了很多 , 对吧 ?
你问个美国总统都不知道是谁 。 所以在这个过程中 ,其实他对于长文本的技术性判断体现了团队的技术 vision 的能力 。
那么到 2025 年, 当你需要做更加 agentic 的工作 , 更多的 coding task 或者更大的 codebase 的时候 , 大家发现哦 , 原来 Context Lens 真的很重要 。
这个其实我觉得也是印证了当时之林这样一个 , 或者说这个 Kimi 这个团队对于这个技术方向的判断是很强的 , 对吧 ?
长文本这件事其实一直到现在可能都还是在一个逐渐 , 就是大家意识到其实比大家原来觉得还要重要的一个过程 , 对吧 ?
原来大家想的只是说哎呀 , 我把三体丢进去会怎么样 ? 现在大家发现哦 , 原来你做 agent 的任务 , 你 agent 你不能说 100 步就歇了呀 。
推理对那个长文本的要求也很多 ,因为它生成长思维链什么的 。
对 , 所以我觉得上面几点吧 , 就是说第一 , 团队的稳定 。 而且团队稳定是因为他们有长期的渊源和信任 。
第二就是说坚持自己看准的这个大的技术方向 ,而不是说一会儿这个陪伴火了去做个陪伴 , 一会儿多模态火了 , 一会儿 2G 火了 , 对吧 ?
就很多事情都可以做 ,但是你一个团队做的事情都是有积累的 。 第三就是团队本身的技术基因和技术的洞察是一直很在线的 。
但是呢 , 我觉得确实 R1 的成功带来了很多的启发 , 这个也是毫无疑问的 。 我觉得其实很多人当时看到这个 R1 的时候 , 我觉得当时有一个说法是说 Pre-training 不重要 , 说 Post-training 很重要 , 对吧 ?
如果你还记得 ,在年初很多人讨论这个 ,但实际上 R1 的成功离不开 V3。 你没有一个好的基模 。
对 , 你没有一个好的基模 ,其实你后面做 R1 的这种 , 就是 zero, 就是他那个左脚踩右脚型的这种 reinforcement learning 的这样训练 ,Post-training 其实离不开一个好的基模 。
就其实你还是要在 Pre-training 上拿出一个好的 base model, 然后再去做这个 reinforcement learning。 因为 Kimi 他们做 reinforcement learning 的这个团队是很强的 , 所以之前确实基模比较拉胯 , 反正圈内也都知道 。
所以在这个事情上, 我觉得过去的这几个月 ,其实一方面他们在 RL 上做了很多工作 , 所以像 Kimi 的 researcher 这个产品 ,其实上基于的这个 base model 还是原来的 base model。
是 K1 是吗 ?
就是 1.5 吧 。
1.5,K1.5。
但是在这个过程中 ,其实你通过 RL 带来了这样一个模型的 deep research 能力的提升 。 那另外一方面 ,在 Pre-training 上训练了一个 T 的总参数 , 对吧 ?
这个很大的 K2。 这个好的基础模型 , 我觉得是一方面证明了这个你 Pre-training 当然也不止 Pre-training, 包括 Post-training 整体做得好之后, 你的模型能力会提升 。
因为它现在还是个 non-reasoning model。
对 , 它也没有发推理版本 。
对 , 你的推理版本 , 你的多模态版本 ,其实这些肯定都会做嘛 。 那你就会有一个很好的开始 。 所以我觉得这些其实也是就是说把精力回归到关注技术本身的这个进展 。
我觉得这个其实确实 DeepSeek 带来了很多的启示 。 然后我觉得还有一点就是说开源也很重要 , 对吧 ?
因为核心来讲的话 , 你给社区提供价值 ,其实在现在全球的 AI 社区都是一个 early adopter, 早期采用者的时候 ,其实他们会很热心的回报你 。其实我们在 DeepSeek, 我们在 Manus, 我们在 Genspark 这一系列都看到了说 , 你拿出好的产品 , 你对用户以这种开放的交流的态度的时候 , 实际上大家对你是不管是全世界哪里的用户 , 欣赏或者支持 , 甚至会主动帮你去改进问题 。
但是开源我觉得核心点是说你要开源一个好东西 ,不是说开源是一个灵丹妙药 , 什么东西开源就好了 。
核心还是说你开源的东西别人觉得好不好 。
说到开源的话 ,因为 K2 是一个以 T 参数的模型 , 就是 1 万亿的参数 , 这样其实开源社区里真的能部署的人很少吧 。
但你看 OpenRouter 的数据 , 就是它不是说让你部署在本地 。
对 , 它也有很多人用的 API。
对 , 它不是让你部署在本地的一台机器上嘛 。其实你要本地部署满血 R1 也不是一件那么简单的事情 , 对吧 ?
它是 670 亿 EB 嘛 , 它这个一个 T 也没有 50% 多的增长嘛 。 所以你本来定位开源不是说我要部署 72B 的 , 咱先在我的电脑上跑起来 ,并没有 , 这个并不是核心重点 , 对吧 ?
我觉得重点还是说让大家对于模型能有更多的自己的把控 。 已经有很多的 propensity 是大家看得到的 , 对吧 ?
他说哎 , 我要对它做 Post-training。 就我觉得其实是你让这个社区 , 让大家整体变得更好了 ,并且他们像提说这个 Moon 的这个 Moon Clip 这样一个 optimizer, 很多这些技术上的思路的创新 ,其实我觉得也是给大家带来很多启发 。
所以这点我觉得确实 DeepSeek 一个非常好的榜样 , 对吧 ? 你通过开源 , 通过开放给社区提供价值 , 然后大家会通过他的这个热爱来反哺你 。
这个我觉得也是确实 DeepSeek 的很多启发 。
就是你刚刚也提到 , 就是他之前的基模从一个不太好的状态到现在 , 你觉得他基本上是开源里最好的模型 ,他这个变化是怎么发生的 ?
那你肯定要有算力 , 要有投入 , 对吧 ? 要有时间 。 因为整个 Kimi 他们拿到大的算力的时间其实也相对是比较晚的 ,因为他 23 年才做嘛 , 做了之后阿里投资 , 投资那里你有整个这个算力的 deploy。
所以那确实他其实在 24 年的时候才能够开始去做一个足够大的这个 base model 的这个 pre-training, 对吧 ? 这个其实就是说那没办法呀 , 这个就是事实情况 。
而且 V3,DeepSeek V3 应该也是给了他们不少技术上的启发 。
我觉得大家都互相启发 , 对吧 ? 我相信比如他们这个 Moon Optimizer 也会带来的 。 就就我觉得这个是 。
因为他那个开源的代码里其实你可以看到一些 。
Of course, 比如他们也用了 MLA 的这个架构嘛 。 我觉得这些其实都很正常 。 但是呢 , 当你自己把这个 pre-training 的 pipeline 搭建起来 ,并且为了搭建 pipeline,其实比如说对 Moon 做升级嘛 , 做 Moon, 做 Moon Clip 这些进步 , 实际上让你的团队的技术能力提升 ,并且让你对模型有更多的可控的这个能力 , 对吧 ?
所以我觉得做完后其实也真正让他们在技术上是进步的去升级的 , 去迭代的 。
就你刚总结了一些逻辑上的点啊 , 就为什么他们有 K2 这样一个成果 ,在现实的过程中间遇到了一些什么样的过程啊 ?
因为在一个公司 , 就如果外部舆论对他的讨论是把他置于一个比较低谷的状态的时候 , 我觉得一个比较大的压力可能是人的流失 。
我指的不光是核心层 , 我指就比如说像一线的工程师这些啊 。
肯定有人流失啊 , 这毫无疑问吧 。 那我们只是说第一 , 核心层的稳定性 ; 第二 , 就 Kimi 的很多的年轻的同事 ,不只是因为 Kimi 发了多少工资 ,而且还是因为大家觉得这个核心团队对技术这件事情是真正的重视 ,是真正能学到东西 , 再做一些牛的事情的 。
当然因为正好智库上 K2 可以做出来之后, 有好几位他们的研究员也写了自己的感想嘛 。
而且你们有一些研究员我知道就是还待了挺久的 。
是啊 , 就是说他们每个人都有很多选择 , 优秀的人永远有很多选择 , 对吧 ? 这个也许还可以去 Meta 呢 ,但是就是说 。
对 , 这个是一个可能性 , 就是有没有可能 , 比如国外公司甚至跑到中国本土来玩 。
有可能啊 , 这个完全有可能 。 我只是想说大家待在你这儿 , 肯定不只是说因为你给了多少钱 ,而是说大家觉得跟着你第一能学到东西 ; 第二 , 可能真的能干成一件自己觉得很厉害的事情 。
我就说我觉得这个也是符合 Kimi 的核心团队的他的这个基因的 。 所以我其实觉得确实之前投放 , 当时我们也讨论过 , 确实那个并不是他们最擅长的事情 。
比如说跟字节比谁广告投的好 , 这个我觉得确实比较难 。 但我觉得现在反而是回到了这个团队 , 回归他能力最强 ,也最有初心 ,他也最认可的地方 。
所以我觉得这个是很重要的 , 就是还是那个观点 , 你面对外面的压力的时候 , 市场的压力的时候 , 你首先自己不要乱 , 你自己要 focus, 自己要聚焦在这个自己最擅长且能做好且有意义的事情上 。
K2 发布之后, 杨钧霖你们交流了什么 ?
我们没有交流太多直接的 , 我们可能跟研究员有一些更多细节的讨论 , 包括我跟雨桐聊了很多 。 我觉得对之林来说 , 这可能也是一个就是他的技术愿景 , 加上他要带领这个团队打的第一个 , 我们不说胜仗 ,不是因为好像没有一个敌人啊 , 更多是说交出了一个我觉得很重要的阶段性的答卷 。
对 , 我觉得是在压力之下交出了一个阶段性的答卷 。
对 ,其实我本来跟他说要不要录一期播客 ,但是 。
去说杨钧霖是吗 ?
对 ,但是就是太忙了吧 。
太忙了 。 哦 , 我以为他是因为太爱了 , 所以不想录 。
当然也有很重要的这个原因啊 。 但其实我挺想也拉他就聊一聊这个 K2 的过程 。
我觉得推理版也发了之后, 可以拉他一起聊一聊 。 我觉得他可能现在在忙 ,因为他或许还要发一些不同的版本出来 。
我觉得肯定我们还是以创业者的这个 。
就看他自己的节奏 。
他的形象吧 。 但我想说的就是说 , 包括我们看到这些研究员 ,他们写的这些文章 , 对吧 ? 我其实觉得是蛮感人的 ,但是你有很多技术细节 , 我说实话 , 我们作为投资人, 我们其实也不那么了解 。
技术主线58:32
比如说在技术领域的话 , 你会比较关注哪些变化 ?
对 , 之前我们聊到的三大主线 , 我认为解锁 AI 生产力的三大主线是 reasoning、coding 和 tool use, 对吧 ? 那 reasoning 我们看到 O3, 然后 O4 mini 的出来 , 还有 O3 pro, 对吧 ?
这几个虽然它在榜单上面的那个进展没那么大 ,但我认为这其实说明榜单本身已经像高考 , 对吧 ?
就是有人高考考 150 分是因为卷子只有 150 分 ,有人考 140 是因为 140, 就实际上它的差距可能是很大的 。
我们自己使用下来的话 , 确实 O3 相比 O1 又上了一个大台阶 , 然后 O3 pro 其实它的推理这个时长长度会更长 , 得到的结果是一步一步的越来越好 。
现在我觉得是模型的在这种 ,因为在 reasoning 的很多细节上, 就是你大面是对的 ,但是你的很多细节幻觉的减少 , 推理的这个结果更加严谨 , 对吧 ?
这些领域我觉得还是有很大的提高 。 同时也发现就是小一点的模型 ,其实也能够做到很好的 , 像 GPT-4 啊 , 或者这样的这个指标 , 它很好的这个分数啊 , 包括你像 Kimi 最近的 AI-ME、GPT-4 啊 , 这些得分都非常高 。
所以我觉得就是越来越小的模型 ,其实也能够解决很好 reasoning 的 。
你说小的模型 , 你指 Kimi 的哪个小的模型啊 ?
Kimi 的其实它的激活是小的嘛 , 激活是 32B 嘛 。
你是从这个角度是吧 ? 因为它 K2 的整个参数倒是挺大的 。
对 ,但是你的激活比较小嘛 。 就你说你本地部署会难一点 ,但是你每次推理的成本其实还好 。 当然他们现在推理有很多需要优化的地方 , 现在普遍看到说推理有可能有一点慢啊 ,但是我觉得这都是可以被优化的 。
对 , 包括我们之前和一些人交流 , 比如说像阿里云的周京人 CTO,他甚至不觉得像 O1、O 系列这种出现 , 这算一个特别大的范式变化 。他觉得可能这还是在就是大模型这个大的方法下的 , 就一个比较自然而然 , 它会延展到这个方向 。
对 , 这个我同意啊 。 比如说如果他们都还是 Transformer 嘛 , 比如简单来讲 , 那我觉得大家可能现在就期待下个 Transformer 是什么 。
但我想说的是 ,也许 Transformer 就能走很远 , 对吧 ? 就跟大家说高速公路也带大家走了很远 , 铁路也走了很远 ,并不是说我今年又要一个非常不一样的 。
所以我想说的 , 今年至少我们看到能用上的技术的变化 , 当然实验室里面可能有些 , 比如说新的这模型架构啊这些东西 ,但是我们能用到的产业能用到的变化 ,其实都我觉得已经不是从 0 到 1 的变化 ,而且主要是从 1 到 10 的变化 。
我觉得 reasoning 是一个可能是从 5 到 10, 或者从 5 到 8 的一个变化 , 它已经是从很好到非常好 , 对吧 ? 然后 coding 呢 , 我觉得 Sonnet 3.5 是不错的 ,但是 Sonnet 3.5 其实还是 Context 也不够长 , 它的很多自我纠错能力这些其实可能也没那么好 。
那么 Sonnet 的 3.7 和 4, 尤其是这个 4 的 Opus,因为大家发现在这个 Cloud Coding 里面 ,Opus 去跑效果非常非常好 , 对于非常大的 codebase, 然后非常复杂的代码 , 它能可能一步就 get itright, 一步就把它做对 , 对吧 ?
这其实也是一个不是从 0 到 1 的变化 ,是从 1 到 8 到 9, 从 1 到 10 的这么一个质量大幅提高 ,Context 变长 , 错误减少这样变化 。
像他们这些从好到更好的变化 , 它都是靠一些工程来解决的吗 ?
从我们了解到的这种信息来看 , 肯定在比如说 pre-training、post-training、 数据 、RL 这些领域 , 它都有很多的进步 ,但目前来看可能不是一个说完全新范式的变化 。
就它的最底层的这套逻辑 , 或者说训练的方式 , 可能还是相对来说就还是有延续性的 。 当然你在具体怎么做这个里面 ,有太多的具体的 technique, 我们也不是技术专家 , 对吧 ?
我们也不想去这个 comment 或者去揣测 。
那作为投资人, 你们去看一个团队能不能在从好到更好的这个过程中比较有竞争力 , 主要是看什么 ?
因为我们本来就投应用嘛 , 我们也不会再投一个模型公司 , 对吧 ? 所以我们说实话 , 我们更多的是观察模型的进步速度 。
我要能判断那个 , 我就去拿 1 亿美金一年的 , 开玩笑 , 应该也拿不到 。
就我觉得在这个基础技术模型的竞争上, 今年也有一个比较明显的 , 大家能看到的就是 Google 的这个势头又再起来 。
因为 23 年就是刚开始 OpenAI 出来这样横空出世的一段时间里 , 大家就会觉得 Google 有点被打蒙的状态 。 但是现在就是 Gemini 2.5 这些 ,其实它的口碑啊 , 使用的情况也都是很好的 。
对 , 确实 Google 的技术积累非常深 , 它的人才密度很高 , 同时它非常有钱 ,而且它的这个算力也很充沛 ,因为有自己的 TPU。
所以确实我们今年觉得 Google 的边际变化是很大的 。 因为 Gemini 2.5 这系列模型很好 , 然后 GCP 的 serving 其实也是挺好的 。
跟 AWS 相比 , 实际上比如同样假如 serve cloud API,GCP 其实做的挺好的 。 然后同时这后面也 powered by TPU, 对吧 ? 因为 TPU 本身也是 Google 它自己花了很长时间去做的这样一个架构嘛 。
所以我觉得 Google 确实它这个实力很强啊 , 就是它肯定是现在模型前三家里面非常有竞争力的一家嘛 。
但是现在可能大家就是也担心它对搜索主业的影响 , 所以它的股价其实一直在那震荡啊 。 我觉得这是一个典型的 , 就是说你有款老业务受损 , 你的新的追的很快 ,但是到底怎么样呢 ?
我觉得可能一两年之后大家会比较清楚 。 包括这个 Veo3, 对吧 ? 我觉得他们在多模态这个领域 ,其实在之前 Gemini 2 甚至上一代的时候 , 大家就会意识到 Google 的多模态的积累是很深的 。
所以 Veo3 一下子成为这个整个视频生成里面毫无疑问的 soda。 我觉得这个也是与它多模态的积累是分不开的 。
而且 Google 还做了很多 VLA, 就是跟具身相关的模型的探索 。
对 ,他们的 Gemini 和他们的机器人那一块的这个结合 , 对吧 ? 我们有些朋友在做这样的事情 。 当然我觉得 VLA 这里面 , 包括那个 Pi 也提出了这样的这个模型的框架之类 , 我觉得还是在一个比较早的阶段 。
就它还是非常全的 , 它的布局非常全 。 它有很多东西它是好到更好的 ,也有一些它可能是在一个比较从 0 到 1 的状态 ,Google 也在探索 。
对 ,其实 Gemini 的 deep research 这也都挺好用的 。 同时它的成本上其实也有一些优势 , 对吧 ? 但我确实觉得现在就是比如 OpenAI、Google, 然后 Anthropic 这三家还是各有特点 , 对吧 ?
其实对于 OpenAI 来讲 , 它其实越来越变成一家这个应用公司 。 它非常强调 ChatGPT 这个应用本身的这个帧数 ,以及推出更多的功能 。
比如说它现在推出了会议记号功能 , 这种很具体的一个功能的迭代 。
之前 Sam Altman 不是在十亿用户和 AGI 之间 , 对吧 ? 好像是这两个选择之间 ,他还是选了十亿用户 。
对 , 我觉得这个目前来看也是比较清楚的一个路径 。Claude 目前还是在专注 coding agentic 这个 , 然后它通过这个去驱动这个应用 ,但是它本身也做了 cloud code, 对吧 ?
但既然我觉得很有意思 , 就是它接下来会对 cloud code 这样的应用做到什么程度 。 因为本来是他们内部的开发工具 , 然后他说我就用 cloud code 来 build cloud, 然后我现在把它拿出来让大家去用 。
对 ,其实这个也又回了你之前说到的一个主题 , 就是大家现在正在辩论 , 然后或者说在变化之中的 , 就是模型和上面那一层应用的关系 。
对 ,因为如果你看一个应用的话 , 简单来讲 , 我觉得它的应用的价值可以分为三层 。 第一层就是里面这个模型本身带来的这个价值 , 对吧 ?
这个确实是模型厂商提供的 ,并且是已经固定在权重里面的 。 比如这个模型是个更好的模型 , 它的推理能力 、 代码能力就更强 。
但是显然一个模型它的权重固定之后, 它的内容是死的 , 对吧 ? 所以我们需要 Context。 那 Context 呢 , 我觉得可以分为三层 。
第一层就是这种公寓的这些 Context, 就是今天是天气怎么样 , 对吧 ? 这个模型你肯定没有 , 所以它需要去通过搜索 , 通过这个去获得 。
当然这个现在也有 , 就模型本身会做这样搜索的这个工作 , 做这样处理 ,但这个其实就需要我给模型这样的工具去做 。
那么第二层呢 ,其实是这个组织里边呢 , 比如说我在一个公司里面部署了这样模型 , 我公司有什么样的这个本身的流程 , 对吧 ?
我公司有什么样的这些已有的文档 、 已有的知识积累 , 这个是模型本身不知道的 , 这个是需要通过应用程跟模型进行合作 , 让模型知道并且去调用的 。
第三层我觉得是个人, 对吧 ? 就哪怕一个组织里面 , 每个人跟 AI 聊的内容是什么样的 , 每个人的喜好是什么 ,他的对话历史是什么 ,他的个人情况是什么 , 这些我觉得也是完全模型它本身不具备的 , 就也是需要应用程去提供的 , 对吧 ?
所以中间 Context 这一层 ,其实有很多是就必须要应用程去提供的 。 而且应用程的提供的好坏 , 内容会带来巨大的差别 。
那么第三层我觉得是环境 , 就是你 AI 不是说最后只是一个问答机器 , 你最后还帮我去做事情 。 那你在做事情的时候 , 你能调用什么样的工具 , 你能影响什么样的结果 , 这个其实也是应用公司来去提供的 , 对吧 ?
比如说你提供了哪些公有的和私有的 MCP 的这个工具啊 , 然后或者说你最后你能够把你的结果反映在我的比如什么文档上, 还是 Codebase 上, 还是什么样的产出上, 对吧 ?
所以我觉得这里面模型只是最底层的那一环 。 只是说我们一开始 ChatGPT 出现的时候 , 我们大部分的场景就是在问模型 , 就是只是在把模型里面已经通过压缩的这些知识把它提取出来 , 比如说问一个事实性问题 。
那这个时候确实主要就是靠模型 。 当事实这些模型的智力更多的需要配合 Context 和配合 Environment 去使用的时候 , 那这个我觉得就是应用也好 , 或者上面这个壳的价值 。
那你觉得像 Anthropic 这样 , 它本来它是主要需要在做模型的 , 然后 Cloud Code 这个东西它还是个产品嘛 , 它应该还是要套上面那些东西的 。
它现在两边都来做的话 , 你觉得它未来会怎么样 ?
因为其实你会发现 , 如果当你有一个好的模型的时候 , 你是希望你还有一个好的应用去配合它的 。
这个应用也许是你的 ,也许是别人的 ,但是你需要一个好的获得 Context 和影响 Environment 的这样一个地方嘛 , 对吧 ? 所以 OpenAI 有自己的 ChatGPT,Google 当然有 Gemini 这个应用本身 , 对吧 ?
那 Cloud 它全都去 power 这个 Windows Server 或者 Cursor。 就当我不是说它怎么想这个事情 ,但如果它有一个更加自己 native 的一个应用的话 ,其实能够更好的展示出 Cloud 可能百分百的这样一个能力 , 对吧 ?
我觉得这个可能也是一个对它会更有价值的事情 。
所以你觉得这个也是很自然的选择 ?
我觉得是很自然 。
就是它没有必要说为了强化我的特性 , 我就是要做比如 ToB 啊 , 或者说我就是去教做模型 。
模型做好肯定是个非常重要的事情 , 对吧 ? 但是 again 就是说 , 只用模型本身可能不足以把模型价值全部发挥出来 。
你觉得 DeepSeek 什么时候可能会到这个阶段 ? 它现在虽然有一个应用啊 ,但它那个应用我觉得基本上就是在模型上面没做什么 。
我觉得也是看他们怎么去想这件事情 , 对吧 ? 我目前听说他们还是主要 focus 在模型上, 反正我的 argument 就是说你只做模型 , 当然这也很有价值 , 对吧 ?
就像做发动机一样 , 一个车的发动机是不是很有价值 ? 是的 ,但是你卖车是不是只卖发动机 ? 其实也不是的 。
可能汽车一开始发动机占绝大多数 ,因为你要车走起来就行 ,但是后面可能下面还要冰箱 、 彩电 、 沙发呢 。
所以其实我觉得如果你是要完整的模型的能力 , 可能第一放的应用 , 或者说一个紧密结合的应用还是很必要的 。
一年前大家对 Google 的定位也不是这样的 。
一年前大家对 Google 的定位是什么 ? 是失意者 。
大家肯定觉得那时候 Google 有点落后嘛 , 就是人都被挖走了什么的 ,但好像比如说 Noam 回去之后带来了很大的变化 。
就 CloudGirl AI 的创始人。
坊间传说是他什么改了一个 bug, 立刻让模型性能提升很多 。 这个反正不知道啊 , 这个也听说 ,但是关键人才可能带来的进步确实挺大 。
所以就是一个这种关键人才 , 大家协作的方式的变化 , 可能是 Google bike 的一个比较重要的背后的因素是吧 ?
还是他们真的对这个事情很重视 。 就比如说我听说他们其实 Gemini 团队加班很严重的 , 原来大家觉得 Google 是个养老的公司 ,其实发现他们也很拼 , 对吧 ?
因为你在那边接触比较多嘛 , 你也认识就是硅谷的挺多朋友的 。 现在就是硅谷这些公司其实也都是挺卷的是吧 ?
对啊 , 给了这么多钱 , 总得卷起来 。 开玩笑 , 那你看 XAI 不是那照片 ,他们都睡帐篷里边嘛 。 但是他们一方面这个利益也很大 , 另外一方面事情做好之后带来的成就感也很大 , 对吧 ?
所以我觉得完全可以理解啊 。
我觉得这个挺好 , 就模型竞争把这个领域的聪明人都给炸起来干活了 。 它还是在追求这个成就感吧 , 我觉得 。
这几家其实都是创始人自己在这个拼命的下场重视这件事情嘛 。 我觉得这个也是大家都意识到这个事 。
所以我觉得这个大的背景就是 , 如果说前两年大家还是说 AI 到底什么时候能落地什么的 ,但是在今年我觉得这事已经是毫无疑问的事情了 。
那么对于这些顶级的创始人, 不管是 Zuckerberg 还是 Larry Page、Sergey Brin 或者 Elon Musk, 就所有的人 ,他们都意识到这个事情是不能输 , 必须要赢的 , 或者必须要跟上的事情 , 对吧 ?
所以愿意花钱 、 愿意投入这些 , 我觉得都是很自然的 。 因为这未来已经到来了 , 就不已经在来的过程了 。
你看最近 YC 他的创业营上有个演讲 ,他有一个很重要的标题就是说 , 你现在做任何公司 , 你要以 AGI 会在两年内实现作为一个你的前提假设 。
就你的基础假设是这样 , 那么你的公司要怎么做 ?
27 年是吧 ? 那就是 。
对 ,但我觉得这个就 AGI 到底是什么 , 当然有很多 debate 这样 ,但是毫无疑问就是说变化正在发生 。 所以现在就硅谷的这个学计算机的学生找工作都变难了 ,因为大家不需要一个初级程序员 , 你没有 cursor 写的好呀 。
所以这个因为很多变化实在在在发生的 。
因为我们刚刚讲的是 , 就是你关注的技术里的三条线中的两个 , 一个是这个推理的能力 , 一个是编程 , 对吧 ?
然后还有第三个是工具使用 。 对 , 工具使用我自己观察到一个变化 , 就是现在大家在说一些模型 , 包括 Kimi 的 K2, 包括最近的 Grok 4, 大家都会说在模型的训练过程中间 , 我就去训练了它一些使用工具的能力 。
这个其实可以展开讲讲 , 这好像是至少大家之前讲预训练的时候不太会讲到这一部分 。
因为现在比如说 MCP 实现形成一个很大的生态 , 对吧 ? 就是有越来越多的为 AI 搭建的工具变得可用了 。
第二来说的话 , 大家也都意识到这个事情非常重要 ,因为 AI 能使用人的工具去完成很多任务嘛 。 所以大家在训练的时候就会收集采集更多的这种人类操作软件使用功能的这种轨迹 , 对吧 ?
所以现在可能有两条路线 , 一种是像 MCP 这种 , 比如说有点类似于像 API, 对吧 ? 就我通过这个接口去进行这个能力的调用 。
另一种就是说通过视觉 , 像让 AI 去模拟人类去使用一个已有的软件 。 这两条路线其实都有很多人在做 ,并且因为之前大家其实都没怎么做嘛 。
所以你看比如说像 OpenAI 的 operator, 对吧 ? 包括 Manus 他用的这个沙盒里的浏览器 , 沙盒里的虚拟机 ,其实都是在通过模拟人类使用的方式在使用这个软件 。
然后包括像 MCP,其实这些都是在想搭建一个 AI 能够更好的把这些人类已有的这些应用的功能啊 、API 给用起来的过程 。
所以这个我觉得是让 AI 变得更有用的非常重要的一件事情 。
为什么它这个趋势是直接在训的时候做 ,而不是在后面做了 ? 在直接训在模型里它是更好吗 ? 因为我理解比如说 MCP 它其实就是个协议嘛 , 你可以接这个协议 , 对吧 ?
或者你也可以就是有了一个基础的 、 有通识的模型之后, 你在这个基模的基础上, 你给它加一些工程的手段 , 它其实也可以做到去用工具 。
那我觉得你很多能力肯定是在模型端 native 会使用起来更加低成本 ,并且更容易把这个能力通过 , 尤其像 RL 这样的过程做得更好 。
因为使用一个软件有没有完成的任务 ,其实是有明确的 reward 的 , 对吧 ? 比如说你下单买个奶茶 , 你有没有点上 ?
这些其实都是可以通过强化学习 、 通过少量的数据 , 然后进行强化学习进行提高的嘛 。 所以那这个肯定在模型端做 , 让我们模型天生的具备使用工具的能力是更有价值的呀 。
它这种做任务的场景可能还挺适合强化学习来训 。
对啊 , 它是有明确的一个 reward 的嘛 。 它有没有完成这个任务 ,是很多时候可以很好的去定义嘛 。
所以基本上在技术上, 你还是沿着之前你看到的这三个比较大的线 , 对吧 ?
加上一个多模态内容的生成 。
多模态内容的生成 。
我觉得视频是很重要的 ,但视频现在确实主要还是这些大公司在做 , 对吧 ? 但 MiniMax 做得很好啊 , 我觉得 。
海螺 , 对 , 海螺做得还挺好 。 应该是叫海螺 02, 对吧 ? 它发了之后有一个特别火的 ,有点类似于 VEO3 切一切的那个东西 。
小猫跳水 。
对 , 就是各种东西跳水 ,有小猫 、 小狗 、 大象什么的 。
对 ,但其实 Midjourney 那个视频模型很牛逼 。
Midjourney 啊 。
对 , 那个模型效果很好 ,并且成本是很低的 。 就我是觉得这个事情 , 它反正也是个虚模型的战争 , 反正还挺激烈的 。
就 VEO3 确实也是一个很领先的结果嘛 。 我觉得这个上包括字节也做得很好啊 。 所以我是觉得 , 或者这个也是生产力的一种 ,但是这个比较在某个 vertical。
然后还有一个就是 , 当然现在我们也在讨论 , 就是 Voice 这个事情变得越来越就跨过了那个以假乱真的那条线 , 对吧 ?
就是当然我一直觉得 Voice 呢很重要 ,但是呢 , 它的带宽还是有限的 。 就是我们通过语音沟通的内容 , 它没有那么多 。
所以我是觉得它可能不如视觉上以及编程和任务完成这个事情上那么的大 。 但是我认为它还是一个挺重要的领域 。
对 。
但我觉得可能最大的机会还是在我们前面说的那几个 。
就是你说的推理 。
推理 、 编程 、 工具使用 , 然后在视觉的多模态上的这个进展 。
然后刚刚讲的是一些技术上的竞争 。 应用上你觉得这半年有 , 除了就我们现在已经看到的 , 讲了很多的 , 包括你们投的像 Manus、 像 Jaspar 这些 , 你现在自己用的最多应用是什么 ?
应用与订阅1:15:24
ChatGPT。
还是 ChatGPT?
其实我在想 ,因为我们是可以在用全球的产品嘛 , 对吧 ? 但如果说我们就是限定在中国这个网络环境下用的产品 , 那实际上我觉得 Kimi Researcher 其实是很适合我自己使用场景的产品 。
因为我就做很多研究工作嘛 , 对吧 ? 包括它也能生成一个好的研究报告 ,其实以未来会加入更多的这个工具使用的功能 。
那我自己用的最多的 , 我觉得还是 ChatGPT。 确实它的 O3 应该是整体最平衡的一个模型 ,但其实比如说当我要用去生成 PPT、 做 PPT 的结构稿子的时候 , 我可能会用 Genspark,因为它的这个 slide 的能力确实是非常强 。在做一些需要把这个比如说模型生成的结果 , 把它做成网站或者这些展示的时候 , 就 Manus 我觉得它定义的这个功能也是挺好用的 。
所以我其实可能都会尝试吧 。
你有算过你现在一个月在 AI 产品订阅上花了多少钱吗 ?
应该接近 1000 美金 ,因为 Manus 200 美金 ,Genspark 200 美金 , 自己投的当然 。
你这都是顶格的版本了 。
然后 GPT 也是 200 美金 ,Gemini 也是 , 然后 Grok 也是 。 就基本这些我都是买的最高级版本 。 因为我一直有个理念 , 就是说新产品你得多试 ,而且很多时候你花钱试一试 , 当然相对来说可能也不算有那么多吧 。
但是我觉得当你如果能看到一个未来的时候 ,其实你会产生很多的灵感 。其实我最近在跟二级市场的朋友讨论 , 就是其实我们在 3 月份 , 我们已经非常明确的看到 Manus 上线之后, 推理的用量暴涨 。
就是 Agent 它会用多了多的 token, 这个当时其实我们也聊过 。
对 , 聊过 。
然后张涛也分享过 , 对吧 ? 好像那个时候其实在二级市场对于英伟达是有很多质疑的 。 大家说 DeepSeek 是不是大家用的卡就少了呀 ?
大家就是拿 Chatbot 的那个需求去算嘛 。 大家说假设所有人都用 Chatbot, 好像也用不了那么多的推理的用量 , 所以那是不是卡卖多了 ?
但实际上这个就跟当时播号上网的时候 , 你说所有人都聊 QQQ, 那怎么需要那么多的这个带宽呢 ? 实际上大家还看 4K 视频呢 。
对吧 ? 所以其实你模型的能力接受更多的场景 , 你的 token 使用就会多很多 。 所以在那个时候 , 我们其实是看到了像 Manus 这样的应用 , 它普及之后, 用的 token 会多了很多 。
对算力的需求 ,不管是对于下一代模型的需求 , 还是对于算力推理的需求 , 会越来越大 。 所以大家发现英伟达现在又行高了 , 对吧 ?
对 , 超过 4 万亿了 。
超过 4 万亿了 。 所以这个在我们看来 ,其实是我们在那边就已经看到了 。 因为我们已经看到 Manus 这样 Agent 的应用 , 它的用户的 token 用量是 1000 倍以上 。
你说到这个事 , 我突然想起来 , 应该是 23 年还是哪一年, 就是有一次黄仁勋在内部讲话 , 那会儿英伟达刚刚是到 1 万亿美元左右吧 ?
然后他说英伟达的目标市值是 2 万亿 。 当时我们同事还讨论说 , 哇 , 黄仁勋这口气很大啊 。
结果他今年已经 4 万亿美元了 。
他很快可能就会到 5 万亿 。
你觉得他还会到 5 万亿 ?
因为这个 token 转化为生产力的趋势刚开始 。 就它像一个火车一样 , 火车开动了 , 你会不会突然一下停下来 ?
而且我们还在发现越来越多的使用场景 。其实你会发现 , 原来大家假设是说我写这么多代码 ,但是你发现有了这个 Cursor,有了这个 Cloud Code 之后, 你写的代码会多了很多 , 对吧 ?
有了 ChatGPT,有了 Manus 之后, 你会问的问题会多很多 。 以前很多问题我其实不知道该问谁 , 我就不会问 。
但现在当我有一个帮我做 research 非常好的一个工具来说 , 那我就可以去问更多 、 多很多的问题 , 获得很多的答案 。
这个给我带来生产力 , 反过头去会让我更愿意对 AI 付钱 。
对 ,其实我听上有一个方式能算一下, 就是现在不同的场景里面 token 的消耗 。 比如说像 OpenRouter 这个它可以看到 ,但是我觉得它会有一些开发者的偏好 。
它那个里面编程的 token 调用量是这种偏生产力的场景 , 它是远远多于比如像 RolePlay 之类的陪伴或者游戏类的场景的 。
但我觉得是因为这里面本来就有很多开发者才会用这种东西 。
当然 。
他可能用它就是来编程 , 所以它编程的量会非常大 。
而且那个里面是没有计算像 Manus、Genspark 这样的 。
对 , 它没有计算那些就是比较大的产品 ,因为比较大的产品它不会用这种公开的路由 , 它直接可能就官方 API 就去用模型了 。
所以我觉得可能没有一个特别全量的数据能看到说在比如生产力或者说陪伴这些不同的目前的大模型 , 或者说 AIGC 就生成式 AI 能用的地方 , 到底 token 是怎么分布的 。
没有公开的数据 。 现在这个只有去跟各家云厂商 、 模型厂商去了解 、 去调研 。 但我觉得 OpenRouter 它的趋势你可以去 ,因为它的绝对数 , 对吧 ?
比如说百分之多少多少 , 那个我觉得不是很靠谱 ,因为那些大的都没算进去嘛 。 但比如说这边其实在搒上往前走 , 对吧 ?
就你可以反映出相对强弱 , 我觉得可以这么去考虑 。 因为它等于是一些中小开发者投票选出来的嘛 。
对 。
所以你说绝对量上, 那可能比如说 Manus 一个就比他们所有人加起来大 ,但是就是这里面肯定还是看大家投票的变化情况 。
对 , 就目前看确实生产力上对 token 的消耗是非常多的 。
因为生产力它可以成 10 倍的去增长啊 。 比如说你说杀时间 、 陪聊 , 一个人就那么多时间 , 这也是我们一直讲的嘛 。
就是字节这些公司他们的逻辑是 Attention is all you need, 对吧 ? 它消耗的是你的时间 ,而你的时间是有限的 。 但生产力你问一个问题 , 问 100 个问题 , 你是可以涨 100 倍的 。
但是我在一秒内能消耗的 token 也许也能无限增长 。
可以啊 。
因为我一秒内可能我要看的东西 , 我要消费的内容会变得非常复杂在未来 。
你可以问非常复杂的问题 。 我给你举个很简单的例子 , 比如说我们那些二级市场的朋友们 , 到美股到业绩期的时候 , 可能一天他们关注的一个领域 , 比如说 SaaS, 可能有五六家公司要发业绩 ,他们发业绩都是我们的这个凌晨 4 点钟 。
然后他们要看业绩 , 把这个业绩的数量带入到他们的模型 , 然后做对比 , 然后快速做出一个判断 。
然后他们还要两个小时之后打进那个电话会议 , 听那个 CEO 怎么讲他们的业务展望 ,他们自己会有一些业务的问题 , 然后他们会去看 CEO 怎么讲 。
就原来他们得干嘛 ? 他们得 4 点钟起床 ,他们得看那个业绩去听那个电话 。 如果是覆盖几只股票的话 ,他不可能同时听几个业绩会吧 。
所以这个问题以前就只有靠招更多的人或者重点去选择 。 但是现在有了 AI, 当然现在可能还不能完全把这个流程跑通 , 对吧 ?
但我觉得在接下来 6 到 12 个月里面 , 它完全可以我覆盖 50 个股票 , 那我可以同时我的 AI 去帮我去看 , 就我朋友把今天晚上的这个业绩会议 , 然后记笔记 , 把我可以提前准备好我想问的问题 , 然后我的 AI 可以去帮我去总结出来他的这个 CEO 是怎么回答这些问题的 , 然后给我写报告 。
就这些事情 , 它原来不在那个 TEM 里面 ,是因为你都做不到 。 就跟飞机发明之前 , 没有人有从中国今天要去美国的需求 ,因为你就没有这样的条件 。
但你有了这个跨国飞机之后, 对吧 ? 大家就突然说 , 哎 , 我有今天要去美国出差的需求 。 所以我觉得这个是一样的 。
就比如说现在我们可能还是觉得我哪有那么多问题要问呢 ? 但实际上当你的能力提升之后, 你就有很多这样的工作 , 原来你都不会想要去做的 , 现在你会发现你可以用 AI 去做了 。
这种需求的增长是远远超过比如说你每天有多少闲暇时间 , 你要用 AI 去打发的 。
这我是有点怀疑太多 ,因为你特别想工作啊 。
不是我特别想工作 ,而是说如果我这个工作能够赚钱 。
对 , 我觉得你说的前面一个我是同意的 。 我就说就你闲暇时间用 AI 打发的方式 , 我觉得可能也会有非常大的变化 。
那也有可能 , 对 ,是有可能 。 但我说你的时间是有限的 。
对对 , 时间是有限的 ,但是你可能在单位时间里的 , 你能出现的那种娱乐形式的复杂程度 , 然后它给你带来的这种感官刺激的这种强烈 , 可能会是现在也很难想象了 。
对 ,也有可能 。 但我想说的就是说 ,因为生产力如果你能够产生价值的话 , 那我是愿意为它付钱嘛 。
就付钱的是很直接的嘛 。 你给我赚 100 块钱 , 我给你付 1 块钱 , 对吧 ? 或者付 10 块钱 。其实我们看到很有意思的就是说 , 当 AI 变成按用量付费之后 ,其实很多人他是想用更多的这个 AI 的 。
因为它确实能完成你的工作 , 确实帮你写了更多代码 。 这代码原来我要写 , 我就要花时间花钱嘛 。
所以这个价值很直接 。
对 ,其实你一个月花在 AI 上的钱 , 你差不多算是雇了一个人了 。
对啊 。
就如果 7000 多的话 , 七八千 。
对 , 那我雇个分析师还比这要贵呢 。
Agent 趋势1:23:20
在应用上, 你有看到什么新的应用的趋势出来吗 ?
Agent 我觉得是巨大的趋势 。
Agent, 那如果细化下来 ?
我觉得 Agent 当然这个词是非常的宽泛的哈 。 我自己觉得有几个定义 , 第一个就是说 , 你要能够根据人类给出了一个大的目标去选择工具 , 去规划这个执行的路径 ,并且在过程中评估你做得怎么样 。其实就跟一个人一样 , 最后交付到一个合理的结果 。
我这是一个大的定义 ,但是这里面其实有很多 , 比如说具体的做法不一样 。 比如 Kimi 现在提出了叫模型 G Agent, 对吧 ?
就是当你有很强的训模型的能力的时候 , 你其实会想在模型的训练中加入到更多的工具使用的能力 , 去做这样的一个产品 , 对吧 ?
对 ,其实在 OpenAI 最开始规划的五个阶段里面 , 它到第三个阶段 , 就是在推理者之后, 就是 Agent。
对 , 之前张翔宇讲得特别好 , 我很认同他说的那个理念 , 就是说因为第一个是 Chatbot 嘛 , 对应的是 ChatGPT, 第二个是 Reasoner, 对应的是 O 系列的这个 Reasoning, 对吧 ?
那对应第三个阶段 Agent 的 , 就是 Agent 的 Native 的模型是什么 , 对吧 ? 就现在好像还没有出来 。 就是他说那个反映的其实是一个不同的模型训练阶段 , 我是挺赞同的 。
因为在 Agent 的定义里面 ,其实目标也是 Agent 去找的 ,但是现在其实目标还是人给定的 。 然后 Agent 更像是说 , 我给了你这个目标之后, 它去预测一个使用工具的序列 , 用什么工具去完成这个任务 。
它可能还没有到那种 , 就比如说我们给一个员工 , 对吧 , 去完成个任务 , 它其实做这个任务的拆分 , 做这个任务目标的定义 ,是要做很多这个工作的 。
那现在 Agent 目前做这个 , 我觉得还处在比较早期的阶段 。 但这个因为反正 Agent 的产品 , 如果你从 Manus 算 , 才出来几个月嘛 , 对吧 ?
所以我觉得在一年之后, 半年之后, 我们看到的这个 Agent 的产品的能力 , 会随着模型的能力提升而大幅提升 。
我只是想说的是说 , 同样怎么解 Agent 的这个题 ,其实不同的公司 ,因为它的资源禀赋不一样 ,其实会有很多的不同的解法 。
我觉得很多这些解法 ,其实目前看来 , 我们并不是说一定要认为我们能够未卜先知去知道未来一定的样子对 。
对吧 ? 比如说我觉得 Kimi 其实在通过模型训练中, 就加入很多端到端的 IL, 对吧 ? 加入对于工具使用的数据进行训练 。
所以它模型本身就具备了很强的 Agent 这个能力 。
所以他们肯定有一个目标 , 就是要探索对应到第三阶段的 Agent 的 Native 的原生模型是怎样的 。
就是模型公司你会从模型训练的角度去花很多精力去探索 。 但对于 Manus 这样的公司 , 它不是模型 , 所以它肯定就会说 , 我怎么样基于模型公司他们做的工作 ,并且我跟他们去交流 , 去了解他们未来会往什么方向去走 , 然后我的产品怎么能够让模型的能力更好发挥出来 。
就包括其实我们有一个 takeaway,有一个学习 , 就是说这个时候还是要比较灵活 , 对吧 ? 比如说 Manus 它讲的这个 Less Structure, More Intelligence 这样一个理念 ,但实际上有的时候 , 可能你有些 structure 也会让你的工作变得更加的好用 。
比如像 Genspark 当时, 它就专门针对 Slide 这样一个场景 , 对吧 ? 专门做了 PPT, 就是展示这个功能 。 那这个其实是引入了一系列的 , 就是在这个里面怎么做更好的 workflow。其实很多做研究的人对 workflow, 或者不叫 workflow 吧 , 叫做工具的选择吧 ,其实他是觉得有点没有让模型自己去探索了 。
但是很多时候 ,其实你是已经有一个 best practice 怎么去做这件事情的情况下 ,其实我觉得有一些结构可能也是好的 。
对 , 这两种不同的角度 。 因为对用户来说 , 可能有些用户的场景 , 它就是有一个大概的流程 , 对用户来说我的结果是更可控的 。其实成本也会更低 。
因为用户要的是结果 , 对吧 ? 其实你怎么到这个结果 , 你可能有各种走法 ,但是在不同的场景下 ,有的是更灵活 ,但是更加成本更高的 ; 有的是更加固定 ,但成本相对比较低的 , 对吧 ?
所以我觉得这里面其实很有意思 。 可能大家解的题可能都是一道题 ,但大家去用了不同的解法 。
对 , 包括今天 Meta 也发了一个 Deep Research 的产品 , 它的交互又特别不一样 。
对 , 所以我觉得这里面就是要保持开放心态吧 。 因为被打脸太多次了 , 对吧 ? 所以就要保持谦虚 , 保持开放 , 就是很多东西都有可能的 。
对 , 所以你说最大的趋势无疑还是 Agent 嘛 。
就是 AI 生产力 。AI 生产力这里面 , 你要把生产力真的提高 , 就得 AI 承担更多的事情 。其实我们看 Cloud Code, 或者包括 Manus 这些 ,其实它有一个核心理念是人不要干事情 ,AI 干事情 , 对吧 ?
所以有人把它说是 L3 嘛 。 因为这个自动驾驶里面 , 这个 Level 3 就是说人可以不动方向盘 , 车来动 。
因为其实你发现 , 喜欢写代码的人就比较喜欢 Cursor,因为它还是让你写代码 , 一进去主要的就是这个写代码的界面 。
但 Manus 当时就发现 , 这些产品经理们 ,他们其实用 Cursor 的时候是不看中间的 ,因为他们不会写代码 , 所以那个东西看了白看 ,他们只是在看右边的对话框 。
但是你看 Cloud Code 就变得更加极致了 。Cloud Code 是你不能写代码 , 就是你只能跟 AI 讲你要做什么 ,AI 去弄 。
人你就只能看着和给命令 。 所以这个其实我觉得就是说 , 你真的说这个 Level 3 也好 , 这个 Agent 也好 , 就是说 AI 去唱主角 。
你这个人你要想去改一改什么的 , 没有必要 。 你就当好你的老板 。 所以其实我前两天的一个文章里面也谈到就是说 , 我们确实要学会当 AI 的老板 , 对吧 ?
我们当老板就是要放权嘛 , 要提供资源嘛 , 要给出对应的这些目标 , 对吧 ? 但具体怎么做这个事情 , 你可能要让 AI 员工去干 。
这个其实对很多人来说也挺难的 。 这也是个门槛 。
对 ,因为原来所有事情都我自己干 。
而且你有时候让 AI 干 , 你会觉得让它干一次 , 它就是干得不好 。 你让它干几次它都干不好 。
我自己以前创业的时候也是这种感觉 , 就是下属已经什么这个都没干好 , 我来干给你看 。 那后来我意识到我这不是个好的管理者 , 对吧 ?
我就应该赋能下属 , 让他们更多的知道我要什么 , 或者他们能够有主观的能力 , 对吧 ? 所以这是一个人类历史上可能第一次 , 人们说我要培养一个工具 。
原来说我要培养一个人 ,但是很少有人有能力或者有机会培养一个人, 对吧 ? 大部分人是被培养的 。 但现在每个人都要培养你对 AI 怎么使用的时候 , 就是很不一样 。
你刚才提到的像 Manus 和 Genspark, 你们投的这些 , 它都是我理解偏通用的 Agent, 就它的人群还是比较泛的 。
你们怎么去观察一些用在具体场景里的垂直类的 Agent?
我觉得他们通用是因为现在这些模型能力也比较通用 ,但是肯定你逐渐逐渐就会有 , 比如某个应用更擅长做这个 , 某个应用更擅长做那个 , 它会有这种垂直产生 。
就我们 , 我觉得最后你肯定还是要在某些领域你是绝对的第一名 , 你才有这个长期存在的价值嘛 。
或者说我们目标不是要追求通用 ,而是说在一开始发展中收敛到一些核心的最重要的场景 。 这个其实我觉得 。
你就说先试很多场景 , 然后收敛到一些重要的场景 。
之前都没有这个能力 , 你也不知道去试着干嘛 , 对吧 ? 蒸汽机发明的时候 , 那大家也都是试了各种 , 最后发现火车是最好的 。
最开始是抽那个煤矿里的水 。
对 , 最开始抽煤矿里的水 , 然后后来发现做小火车 , 对吧 ? 然后后来说这个做这个纺织机 。 蒸汽机也很通用 , 对吧 ?
但是你最后最大的价值来源于几个具体的领域和场景 。 我觉得大家现在正在 , 就 Coding 肯定是毫无疑问是一个 , 做 PPT 这种就是 office work 也是一个 , 然后做 Deep Research 也是一个 。
以后可能比如说我们在想 ,也许像我刚才说的那种 , 就是帮你去打电话会议 , 帮你记笔记 ,也是一个很重要的场景 。
就有很多这样的比较有意思的东西 。
还有一个我觉得也是大家讨论的挺有意思 , 你上次跟我讲过 , 就是在国内我们一讨论其实这种相对通用的产品 , 包括你刚刚说的 office work、Deep Research, 大家都会觉得说那大公司肯定要做嘛 , 就听起来这是大公司的必争之地 。
然后去和国外的一些投资人聊 , 然后对方的想法反而是反过来的 。 就他们反而会比较为这种 super app 的可能性感到比较兴奋 。他关心的是你怎么去打败 OpenAI 或者 Google 这样的大公司 。
我觉得你有机会去挑战大公司 , 那总是一个好事嘛 , 对吧 ? 你至少参与奥运会 , 那比不参与要好的 。其实我觉得很有意思 ,因为 Manus 出现之后有几种说法 。
第一种说法是说这东西没壁垒 , 我一个周末给你搞一个出来 。 但是现在过了这么久 , 你都没看到有任何一个应用 。
就可能有很多形式很像的 ,但是从实际使用体验这角度来讲 , 还没有一个接近它的 , 对吧 ? 另外一句 , 这东西没壁垒 , 大公司会做 ,但你发现现在好像没有任何一个大公司去 , 就是海外大公司 , 中国大公司做了很多 。
对 , 我觉得在全球市场上, 我觉得大类创新还是比较尊重的 , 就是不太会有一个跟你长得一模一样的东西给你去 。
当然大家或多或少我觉得会借鉴 , 比如它的交互上的一些呈现上的一些思路 , 比如说它的这个 AI 在干活的这么一种这个呈现 。
但是我其实觉得在出海的这个竞争中的话 , 你先发你是有很多口碑的优势 、 传播的优势 ,以及也不是大家会抄你一模一样的 。Publicity 现在也没有一个一模一样去抄的 。
你说海外大公司不去一模一样的抄 , 这主要是一个文化氛围 , 是一个同辈约束导致的是吗 ?
我觉得有点像这种文化 。 就是大可以 , 比如说其实可能是借鉴的 , 或者说学习 ,但你说超过一模一样界面上像素级复制的 , 我觉得这个事情确实在全球范围内不是一个那么 decent 的行为 。
那这个在硅谷之前从来没发生过吗 ?
像素级抄袭真没发生过 。 只是比如说当时 Facebook 抄了那个 Snapchat 的 story 功能 。
我正想问 , 难道连小扎都没干过这种事 ?
小扎他没有像素级抄袭啊 。他只说 story, 对吧 ? 你每个人在上面有那么一条圆圈在那点 , 这个 yes, 对吧 ?
但是他也没有说我跟 Snapchat 长得一样 。
因为他已经算是硅谷比较狠的人了 。
对 , 所以他也得了很多诟病啊 。 那确实你就会 。
就会有些代价 。
对啊 , 所以我就觉得就是说这还是一个就是更加良性的竞争环境 , 对吧 ?
那你觉得现在抢人这个竞争算良性吗 ?
Again, 又是小扎 , 对吧 ?
又是对小扎挑起的吧 ? 或者说他是这个里面表现得比较极致的一个 。
我觉得这也是体现他的这种 founder 的精神吧 。 就是他要把这样的发言就不惜一切代价去打嘛 。 那我如果是花钱能办的事 , 那我就办嘛 。
我觉得这也体现出人才确实很重要 , 对吧 ?
因为他现在从 OpenAI 挖来了很多人, 对吧 ? 然后 OpenAI 之前想 30 亿美元收 Windsurf 这事又吹了 , 告吹了 , 被谷歌给从中间截胡了 。
你觉得接下来就是 OpenAI, 就它会有一些什么样的后续 ?
我只是想说 ,因为 Windsurf 这个地位我们也不知道 , 就我们也在吃瓜哈 , 就看这个具体发生什么 。 但我觉得有一件事情很明显的就是说 , 对创业公司来讲 ,其实这个战争的强度在加大 。
因为你要面对的是大公司有很多补贴的竞争 ,有很多挖人的竞争 ,并且你要吸引优秀的人才 ,他们的机会成本也在变大 。
你说的对创业公司压力增大 , 你说的是在硅谷吗 ?
在硅谷啊 。
在硅谷 ,但我看起来好像对创业公司来说也是提供了很不错的退出的方式 。
但因为这种退出 , 你相对如果你要出现特别大的事情 , 你可能也还不满足嘛 。 有的人觉得比如说卖个几亿美金挺好 ,但有人是想做 1000 亿美金的公司的嘛 。
就比如说如果你是 Cursor, 你现在要面对的是 , 比如说你要有更多的钱去补贴大家使用你的 token, 然后你招人, 你也要花更多的成本 。
所以你要融更多的钱 。其实我们之前看比如说 Cursor 说融了好多钱 , 对吧 ? 当时想 , 哎 , 为什么要融这么多钱 ?
但你想现在的竞争 ,不管是从 token 的补贴还是从人才 , 确实都上了一个台阶嘛 。 确实顶级人才 , 那他可以去 Meta 拿几十个 million 一年, 他买理账 , 那怎么着也得不能太差吧 ,是吧 ?
所以这个对于很多创业公司来讲确实门槛 , 就水位在提升嘛 。
而且我觉得最近就是硅谷这么激烈的抢人, 尤其是 Windsurf 最开始传出来的这个方案 , 就是 24 亿美元 , 主要是给创始人和核心的几十人的团队以及投资人, 然后剩下的公司股份 Google 是不收购的 。
就这个方案 , 我觉得对硅谷的创业生态也会有些影响 。 就是一线的工程师如果去加入这种创业公司 ,其实你是牺牲了一部分现金的收入 , 然后你有一个股票或者说期权的权益 。
就你可能期待说跟这个公司一起成长 , 对吧 ? 那这种收购的情况下, 好像感觉一线工程师得到了很少 。
细节我确实他们怎么决策的 , 包括为什么今天 Cognition 又跑出来 。 就这些确实不知道 。 我觉得不好说 。
那这个 case by case 的评价 , 我觉得可能只能说明在这个里面谁的 bugging power 比较强 。 就如果被收购方的 bugging power 很强 , 大家都很想买它 , 那肯定比如说我的员工也要跟着我一起赚大钱 , 对吧 ?
但如果大家可能说 , 我其实主要想要你的这个核心的人, 可能都是不一样的情况吧 。
因为确实在就是硅谷这种叫买人式收购 , 或者说叫 acquire hire 比较流行 ,是因为它也要绕过反垄断之类的 。
这些收购可能流程比较慢 。其实这个我觉得也反映了竞争很激烈 , 就大家想加快这个速度 。
因为这公司太有钱了 。 就是你想几家 Mega, 对吧 ? 他们账上非常多的钱 , 然后这些 OpenAI 这些也融了很多钱 。
如果能用钱换来时间和竞争优势 , 对他们来说其实是个简单题 。
最后这一部分我想问一些你的感受性的东西 。 就是从 23 年到现在也是有了两年半的时间 , 你目前对什么事还是特别好奇的呀 ?
未来之问1:35:36
好奇的我觉得始终还是有很多的 。 就第一我觉得是如何衡量智能的边界 。 因为你想 ChatGPT 刚出来的时候 , 我们人类还能说 , 哎 , 你看这里有个问题 , 那里有个问题 。
现在它大量的不管是它的就是数理上的东西 , 还是它文笔上的东西 ,其实你已经越来越难找到它的问题了 , 对吧 ?
就当人类的智能在被接近的时候 , 你怎么样去衡量一个也许很多时候比你更聪明 、 比你更思考得更深 、 比你记忆力更好的这样一个存在 ?
就如何衡量智能 。其实现在大家也看到姚顺也是好朋友啊 , 写的那个下半场那篇文章 , 对吧 ?
他就说下半场就 benchmark 会很重要啊 。 你怎么去 evaluate 一个新的智能 , 对吧 ? 因为现在的 benchmark 已经钝化了 。
对 , 所以大家也觉得就是你一个模型发出来 benchmark 很厉害不能说明什么 。
对 ,而且 85 分和 86 分真的能反映这两个模型的区别吗 ? 对吧 ? 比如说其实 Kimi 这次它内部的很多 benchmark 也很重要 。
因为你做 IL 的话 , 你重要的是你怎么去衡量你这个结果嘛 。 所以这个东西你不能肯定不只是说外部的 , 对吧 ?
你肯定内部的 benchmark 的水平质量 。
而且我觉得这是团队的竞争力之一 , 对吧 ? 就你一个公司你怎么去做这样一套内部的指标 。
大家都考高考 , 你的高考提出了好不好 ,是吧 ? 所以我是觉得如何衡量智能 ,以及如何探索智能的边界 , 智能边界我觉得这个仍然是非常非常重要的 。
因为现在我们还明明想想说一个模型出来 , 我能用起来能感受到 , 对吧 ? 但是再过几年你可能它都比你聪明 , 就是前五名的产品都比你聪明 。
你怎么去评估谁更好 ?
对 ,而且模型现在在这个 HLE, 就是 Humanities Mastery 这样子 。
这些问题我肯定一个都答不来啊 。
对 , 它的进步很快的 。 就从年初到现在 。
不是得拿了 20 多分了吗 ? 对吧 ? 所以 。
年初只有几分应该是 。
去年我们就看到这个趋势啊 。 去年 GPQA, 对吧 ? 在 24 年年初的时候 ,SOTA 模型就拿几分 , 现在都是 80 多分 。
然后 Swabbank 也是一开始它 GPT-4 拿 5 分 , 现在也是 70、80 分 。 就是我们一次又一次看到 , 只要这个 benchmark 出来能够被衡量 ,AI 其实就进展得很快 。
所以那这个时候什么是好的 evaluate, 什么是好的 benchmark? 不管是对于 AI 的研开发者来讲 , 还是说对于我们普通用户来讲 , 甚至作为人类来讲 , 地球上存在的一个东西比你还聪明很多的时候 , 你不难不对外很好奇吗 ?
对吧 ?
所以这是一个智能的边界 , 怎么去衡量智能 。
对 , 第二个我觉得就是因为我反复想到生产力这个逻辑 。 就是当每个人拥有大量的生产力之后, 对于世界 , 就对于个人, 对于组织 , 对于世界产生什么样的影响 。
比如对于个人, 就我们讲超级个人, 对吧 ? 这个已经讲得很 , 就是也许我们也看到了 , 一个人能做的事越来越多 。
从一个人做个什么小猫补光灯 , 到一个人可能开发一个游戏 , 可能到三胞胎买预言的一个人的度假社公司 。 我觉得这些是完全可以实现的 。
因为当时 Instagram 被收购的时候是 13 个人, 那 13 个人到一两个人, 那我觉得这个压缩是完全可能实现的 。
所以这对一个个人也意味着人和人差别会很大 。 因为当每个人都拥有了这个一个无限聪明的助手 ,以及说像 Manus 这种可以日夜无休帮你打工的赛博牛马的时候 , 那有的人能把它用好 , 产生很大的价值 ; 那有的人可能就相对来说就可能还没有产生那么大价值嘛 。
所以这个每个人的成长速度又会变得不一样 。 那么对于组织来讲 ,其实我也一直在想 , 就是第一是小组织也可以变得很强大 , 第二个是大组织它能够通过先进的技术去管理更大 、 更复杂 、 更多元化的业务 。
就比如说现在的美团管理几百万骑手 , 字节管理这么复杂的业务 , 它没有先进的互联网的通讯技术和管理技术是无法实现的 。
但有了 AI 之后 ,是不是你管理的人数 、 管理的业务复杂程度以及深度都可以再上一个台阶 ? 只因为世界是被各种组织驱动的 , 所以组织的能力的边界的提升 , 对这个世界会产生很大的影响 。
然后进一步来说 , 世界就是当你生产力总量得到大幅提升 ,但同时人与人之间 、 组织与组织之间差距变得很大的时候 , 如何在效率和公平中寻求一个平衡 , 对吧 ?
因为我们第一步其实 AI 是最聪明的人造了一些工具给头部的这些人用 ,但是这些产生的价值你怎么能反哺到普罗大众 ?
就哪怕他不是一个很努力学习 AI 的这个人类 ,他怎么能从中获益 ? 以及说我们怎么把 AI 产品变得越来越易用 , 让普通人也能从中受益 , 对吧 ?
我觉得这都是非常重要的 。 已经不是从 10 年角度 ,而是从三五年, 甚至更短的角度就会实实在在需要去解答的问题 ,以及包括 AI 的安全 , 对吧 ?
现在其实不管是说坏人拿 AI 做坏事 , 还是说 AI 自身 ,因为它已经有太多代码是 AI 自动写出来的 。
你想 Claude Code 现在写的大量代码 , 人可能都没有 review, 人也没法 review,因为它已经远超人能理解的这个速度了 。
那只是说可能这些测试都过了 ,但是以后如果里面有问题 ,有 bug,有后门 , 那你怎么去应对 ? 我觉得这些其实都是非常已经迫在眉睫的问题 。
对 , 还有 AI 也会带来很多隐私的暴露 , 或者说比如说一些虚假的东西吧 。 就真实的界限也变得很模糊了 。
对啊 , 就是说你现在已经很难区分什么是真实的 , 一篇文章 , 就现在我可能还能读出 DeepSeek 那个味道来 , 那过一年可能就读不出来了 。
而且 AI 又会引用虚假的内容 。 但关于什么是虚假呢 ? 对吧 ? 比如说你说它是假的就是假的吗 ?
也许那个才是真的呢 , 对吧 ? 所以这些变得越来越难 。 像晚点又变得还是很重要 , 对吧 ?
反正我觉得有一种很荒诞的情境 , 就是它可能在某种程度上会给大家带来一个压力上的解放 。 就是以后不管有什么事爆出来 , 我都可以说这 AI, 这什么视频照片都假的 , 都是 AI 生成的 。
就你很难区分真实了 。
其实我一直在想人类最大的限制是什么 。 我认为有一个限制是你的大脑就只有这个功率 , 对吧 ?
我们的大脑的功率就是 20 瓦左右 。 所以所有人类有 81 个大脑 , 这 81 个大脑它的最高功率就是这么多 。
这是一个人类智能的上限 。 但是实际上 AI 是可以接近和突破这个上限的 ,是吧 ? 所以当你多了这么多的智能之后, 用它来做什么 ,以及在这里面人和 AI 的这个角色分工是什么 , 我觉得其实这都是我们很快就会面对需要去调整的问题 。
所以我有时候觉得有点可怕或者有点恐怖 ,是因为我觉得大的变化已经到来 , 只是说大家还在逐渐感受到它 。
但比如说你说对于一个程序员来讲 , 这样的影响是非常直接的 。 你很难想象现在的普通初级程序员如果不用 AI, 或者说他自己的编程能力 ,在两年之后才能找到什么工作 , 对吧 ?
因为一年前你去看 AI 写的代码就那样 , 一年后已经非常好了 。 就一年的时间 , 人是很难做出改变的 , 对吧 ?
那你会对什么事感到疲倦吗 ? 你刚说的是还在好奇的一些事啊 。
我觉得第一个就是说 , 就是很激动的这种营销 , 对吧 ? 因为因为确实过去这几年就很震惊题很多嘛 。
就是一会儿人类又被颠覆了 , 当然确实有在颠覆人类的事情发生 ,但大部分的其实也没有那么大的颠覆 , 对吧 ?
其实挺有意思 , 就是比如说 Manus 其实在营销上花了 0,是没有花钱的 ,但它总觉得好像营销了很多 。 所以其实我觉得现在当 AI 可以落地的时候 ,因为可能在比如 23 年以后大家说虚模型 , 模型是什么 , 反正很神秘 , 那就反正就好像 AI 科学家是一群很神秘的 , 我当时说像巫师一样 。
但是现在模型已经可以变成应用落地的时候 , 所以我那时候在 GitHub 我也发了一条 , 就是说 "Talk is cheap, show me the product"。
现在也不是 "show me the code",code 也是 AI 写的 ,但你要 AI 的这些能力做到变成一个产品 , 用起来用起来 。 所以我就觉得很多时候与其去讲故事啊 , 去营销什么的 , 你不如就产品拿出来用 , 对吧 ?
你这个你的使用者 , 你的开发者用起来大家觉得好 , 那就是有生命力的 。 所以我觉得现在目前看发展比较好的这些公司 , 我觉得大部分还是把这一点给做到了 。
就是你拿出了一个对用户 、 对客户真的有价值的产品 ,而且我觉得现在已经到了看这样的产品的这个阶段了 。
所以我觉得应该是少一点营销 , 少一点这种就比较空洞的东西 , 应该是更多实实在在的这个产品和应用 。
你现在此刻在思考的一个想在今后的几个月 , 比如说今年内吧 , 验证的问题是什么 ?
我觉得一个就是说你这种全交给 AI L3 级别的这种 AI 应用 , 它能不能快速提高到能够真正的去完成很多实际工作的程度 。
因为比如说 Manus 虽然我们都在用 ,并且看到有很多用户也付钱 ,但确实有的时候它一个事情可能干到七八十分 , 对吧 ?
你后面可能还得人去进行一些补充和做完 。 我们看 Claude Code 其实逐渐也形成了说它一次做完 , 然后可能就不用怎么修改就可以上线的程度 。
我觉得这是现在 。 那么接下来几个月到年底 , 我觉得大家都会有很大的提升 , 对吧 ? 到那个时候可能真的就变成说我给 AI 一个要求 , 然后它就吭哧吭哧干 , 然后很多时候它它就一次干好了 。在这种情况下, 就第一这个能不能做到 , 第二做到之后, 我觉得对于工作产生的影响是很大的 。
你说到这个 , 我想起来你上次说的一句话 , 就是未来以来单是分布不均 。 我觉得它可能对每个用户不一样 。
比如说你现在就在用 Manus 或者 Jenspark 或者 Deep Research 用的比较多的人, 也许到年底你可能有个什么任务给他 ,他一次能干完 。
因为这个和你和 AI 之间的磨合是有关系的 。
那肯定是 。 互联网当时也是这样嘛 。
对 , 反正就是我现在用 AI 一个很切身的感受 。 就我觉得我有的时候我得刻意让自己多用它 。 因为你确实初次用的有些比较复杂任务 , 你给它的时候 , 你会觉得它完成得不完美 。
对 , 对 , 这个其实是我们反复看到的情况 。 就是好的产品是为了未来的 AI 设计的 。 所以如果一个 AI 产品要上线的时候 , 已经这事干得很好了 , 那肯定你做完了 。
因为 Cursor 上线的时候也是 23 年就有了 ,但是一直是在 Sonet 3.5, 尤其 3.7 出来之后, 它才进入爆发式增长嘛 。 因为你肯定你要为未来的模型设计啊 。
所以 Manus 其实是一样的 。Manus 上线的时候很多事情确实也干不太好 ,但是没关系 ,因为 6 个月之后 、12 个月之后, 新一代的模型会让它这个事情干得很好 。
所以我觉得你一定要是为未来设计 ,而不是为现在立刻就能获得的东西设计 。
你这个直接说出来 , 可能对一般用户来说有点反直觉 ,但我理解这个语境 。 因为现在是一个快速发展的阶段 ,其实你如果真的到了一个普及到很主流的用户层的时候 , 大家还是要追求说你就是一个一上来比较好用的东西 。
其实也不一定啊 。 比如说你看上次我们也发了一篇 YouTube 创始人 ,他上次就坐这儿 , 就是那个 Steve Chen, 我们跟他聊天 。
就是 YouTube 一出来的时候 ,也是为未来的宽带网设计的 。 那个时候 YouTube 出来的时候 , 美国刚刚开始普及宽带网 。
对啊 ,但是 YouTube 刚出来的时候 , 我觉得它还没到就是普及到主流人群的那个阶段 。
你知道 , 所以它是为了三五年之后的网络 。
对 , 我就说它到了之后, 它可能是会变得就更好用了 。
你包括说短视频 , 可能抖音 、 易先上线 , 或者快手那时候上线 ,其实也是为了一两年、 三五年之后的这个智能手机加司机去设计的 。
就你永远要往时代前走一步嘛 。 所以现在的很多这些 Agentic 的产品 ,其实它设计的 , 它使用的也是为了可能几个月 、 一年之后的模型能力去做设计 。
所以你想去验证的一个就是到年底的时候 , 看这些产品能不能真的非常高度自动化的帮你完成一个事情 , 几乎不要人参与了 。
比如说你现在成功率 , 我不知道 20% 或多少 , 你能不能到百分之七八十 , 对吧 ? 那样的话 , 可能你对于工作的定义 , 照说比较前沿的这群人, 对于工作的定义怎么去使用 AI, 就会发生很大的变化 。
另一个我觉得还是我想好奇一下, 记忆会带来多大的变化 。 因为始终我们在想 , 你 AI 的应用长期的壁垒是什么 。
我觉得肯定很重要一点是记忆 , 或者说个性化 。 现在记忆个性化对于 AI 产生的结果带来的影响相对有限 。
它可能它知道你是个投资人, 或者知道你在中国 ,是吧 , 这些 。 但是我觉得应该长期来看 , 我们希望实现的还是说它像是你的员工 , 或者你的助手 , 跟你的时间越长越了解你 , 所以变得越来越可替代 , 对吧 ?
我觉得这个始终是我们想看到是否在这方面有很大的进步的 。
这个进步是不是不能光靠模型啊 ? 因为其实记忆的话 , 你可能需要不停的互动 , 然后给它一些你的 , 就是你刚说的个人层面的 Context。
对 , 一方面比如说大家可能在考虑像 Online Learning 这种模型 , 线上学习的技巧 , 对吧 ? 因为员工也是在工作中学习嘛 , 你模型会越来越跟你的权重变化 。
那第二也是需要你给它更多的这个数据 , 给它更多的文件 , 给它更多的上下文 。 所以这里面对于应用怎么巧妙的设计也很重要 。
所以我觉得这里面其实模型啊 、 应用啊 ,其实都要去共同一起协作的 。 我只是觉得就是说我们对于创新未来要有更多的期待和更宽容一些 , 对大家对于中国人的创新都更多的信心 , 对于这个中国的创新能力 , 对大家有更多的这个支持 。
你们现在特别关注的团队 , 比如人的类型或者什么 , 现在还有什么地方有新创始人在出现啊 ? 我的意思是说 ,他们比如说还是从学校 、 大厂这些地方出来什么 。
我们今年看到想出来的人又多了很多 , 对吧 ?
又多了很多 。
一两年前大家是要相信未来应用会落地 , 现在已经看到有 Manus、Jenspark, 一堆的金玉在前 , 对吧 ? 那大家肯定就是想 , 那我也也许也可以嘛 。
这一定是一个更多的过程 。 所以我们看到很多不管是研究员 、 大厂里面的这个年轻人什么都在蠢蠢欲动啊 。
你觉得应用创业现在都是不晚的 , 对吧 ? 如果你能找到一个比较好的方向 。
我觉得肯定不晚 。 因为如果一个趋势很大 , 你也不可能一年走完嘛 。
你最近在看什么比较好玩的书或者作品吗 ? 你想分享吗 ?
游戏推荐1:48:35
我想推荐 《33 号远征队 》。
《33 号远征队 》 啊 。
是一个游戏 , 是一个法国创业公司做的游戏 。《33 号远征队 》 它讲的是一个故事 , 就是在一个虚拟世界里面 , 然后有一个神 ,他每年在天边的一个石头上, 那个石头叫 Moloness,by the way, 然后会写下一个数字 , 就是倒计时 。
你在曹兴应该去玩这个游戏 。
曹兴 , 对 , 我给他肯定推荐过 。 就是他是从 100 写起 ,他每写一个数字 , 那个对应年龄满了那个岁数的人就死了 , 就会全部消失 。
然后他第一年写 100, 第二年写 99, 这样 98, 就是倒计时, 属于一波一波人就死去嘛 。 所以这个人类就要反抗 ,他就每年都组织还差一年的那些人形成一个远征队 , 就是想要去挑战这个神啊 , 打破这个魔咒 ,但是一直都没有成功 。
所以现在他写下了 33, 就是说今年 33 岁的人会死 。 所以第 33 号远征队出发了 。 然后我就在前两天是萧红的 33 岁生日, 我就说你可以玩一下这个游戏 ,因为它讲了一个满 33 岁的人如何去挑战天命的这个故事 。
它这个游戏 , 它是个 33 岁的创业者 ,33 个人做的 。 它是一个创业者 ,他是在以前育碧 ,在育碧做的 , 反正育碧是个大公司嘛 ,他干的比较无聊 , 所以他就出来了 ,他就做了这款游戏 。
用的人很少 , 还没有育碧里面做 Micro Payment 的人多 , 就是做支付的人多 , 都比他的团队人多 。 但是呢 ,他们这个用了 UE5 的技术 , 画面美轮美奂 , 音乐非常非常的动听 , 然后它有点像法国黑神话 ,因为它是个法国游戏 , 它里面非常艺术 。
所以我现在想就是说 , 比如黑神话其实是一个中国的大 IP, 中国的艺术积淀 , 加上先进的技术带来的好的作品 , 用心之作 。《33 号远征队 》 也是一个就是说 ,但是也不是说法国什么本来有 IP,而是说一个法国浪漫主义设定 , 对吧 ?
艺术气息加上先进技术带来的好的作品 , 今年最畅销的游戏之一 。 这不是本书 , 是一个今年我非常非常喜欢的游戏 。
感谢推荐啊 。 这是个单机 ?
对 , 它在 Steam 或者是 PS 这些上面 。
法国的电话区号也是 33。
哦 ,是吗 ?
然后我刚查了一下,33 是共济会里最高等级的象征 , 就是跟 42 一样 。 有些这种组织认为 33 是最高等级的终极数字 。
所以你可以看萧红也推荐这个游戏 , 虽然还没还没玩 ,因为我告诉他这个 《33 号挑战天命 》 的故事太适合你了 。
行 , 那今天非常感谢雨森做客 《 晚点聊 》 分享了他最近这半年看到的一些变化和思考 。 从技术的角度 ,其实还是沿着我们之前讨论过的那三条主线 , 就是推理能力 、Coding, 还有工具使用 , 再往前演进 ,是有很多从好到非常好的进展 , 到更好的进展 。
然后另一方面就是在应用上面 , 我们看到了很多的普及 。
本期的连点呈现分享三个与以往播客有关的内容 。 一是关于 Agent 应用所需要的模型能力 。 之前在 106 期与戴雨森长聊 Agent 的节目中 ,他提到促进 Agent 能力的三个技术变化是推理 、 编程和工具使用能力的提升 。
这次他还提到了多模态能力也非常重要 。 而在具体的实现方式上, 近期的一些新模型 , 从 X.AI 的 Grok 到 Kimi 的 K2, 都强调直接在训练阶段就去获得使用工具的能力 。
这似乎代表了模型对 Agent 能力的进一步的吞食 。 但另一方面 ,在获取个性化的 Context,也就是上下文的这个过程中, 仍然是离不开产品的 。
这是隔阂应用的体现 。 一个好的产品可以引导用户创建更多的 Context, 这包括组织的上下文 、 个人的上下文 , 还有环境的上下文 。
这也是近期的一个热门讨论话题 , 本期中有简单提到 , 就是 Context Engineering。 正好近期 Manus 的联创记忆超 Peak 也写了一篇相关的文章 , 叫做 《Context Engineering for AI Agents: Lessons from Building Manus》。
链接我贴在了 show notes 里 。 二是关于 L3 模型 ,其实也就是 OpenAI 此前定义的 AGI 的五个阶段中的第三个阶段 ,Agent 这个阶段应该对应的模型 。
我们之前在 110 期和明视的合伙人夏令的节目中也有讨论到 , 刚好雨森是 Kimi 的早期投资人, 夏令是 Linux 的早期投资人。
这两家公司现在是中国大模型创业公司里的两家头部公司 。 我聊下来的一个感受是 ,Kimi 和 Minimax 都想率先做出和定义对应 Agent 阶段的 L3 模型 ,但 L3 模型到底要有一些什么样的能力 ,其实在整个业界现在都没有那么的清晰 。O3 算什么 ?
也许算 。OpenAI 这个未公开的拿到了 IMO 金牌的模型 , 应该也会带来关于 L3 阶段模型的更多的启发 。 这可能是一个渐进进化的过程 ,而不是一个非常明显的里程碑 , 又或者说一些里程碑在它刚出现时 ,不会如多年后我们回头再去看时那么显眼和清晰 。
第三是这次 OpenAI 拿 IMO 的进展让我想到了年初的 103, 让我想到了年初的 103 期节目中与清华的两位博士生萧朝军和傅天宇聊注意力机制的改进 。
最后我们聊到了一种 AI 相对终极的应用 , 科学发现和创新 。 比如 AI 能像一个博士生一样完成一个全新的课题吗 ?
这中间可能需要数月乃至数年的思考 , 是一个超级复杂的任务 。 拿 IMO 金牌还不是一个完整的科学发现 ,但它离更长更深的思考都更近了一步 。在辅助人来做科研上, 应该也会有更强的能力 。
第一批把 AI 用得非常好的博士生和科研人员会如何加速科学发现 ? 再过几年, 我们会看到真正的 AI 博士生吗 ?
本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。
下期再见
。





