开场0:00
欢迎收听本期 《 晚点聊 》。 今天的主播是曼琪 , 本期的出场人物还有真格管理合伙人戴雨森 , 和 《 晚点 》 的创始人小绾 。
这期节目也会发布在真格基金的播客 《 此话当真 》 中 。 这次聊是在 2 月下旬 , 当时雨森就提到了真格投资的 Monica 即将会发布一款 Agent 产品 , 那时候我们还很难想象上周开始内测的 Manus 将会席卷社交媒体 。
当我们开始测试 Manus, 把一个任务交给它 , 过了十几分钟就收到完整的结果时, 似乎真的感受到了一点 "Attention is not all you need"。
这里的 Attention 不再是我们前几期讨论的 " 烧脑的大模型 " 概念了 ,而是指人类的注意力 。Agent 将解放更多人类的注意力 , 让你不再用盯着一切工作 。
这些变化的起点 ,是去年至今的两个重要节点 :o1 和 R1。 这期节目中我们从 o1 和 R1 开始聊 ,o1、R1 带来的推理能力的提升 、 成本的下降 , 和同期模型编程能力与工具使用能力的提升 , 一起开启了 Agent 在 2025 年的应用前景 。
雨森详细分享了他对 Agent 机会的当前观察 ,以及在 DeepSeek 带来的开源生态的变化中, 大小 AI 公司的新动作和调整 。
下面我们就正式进入本期节目吧 。
今天我还有 《 晚点 》 的创始人小绾 , 我们都来戴雨森工作室再拜访他 。 之前我和雨森商量 " 我们来聊什么 " 的时候 , 当时我们定的一个主题就是 " 从 o1 到 R1, 看 AI 这 4 个多月 , 将近小半年的时间 , 一个大的变化 "。
我们可以从这两个最重要的事开始聊 。 你可以先讲讲你怎么看 o1 和 R1 的分别的意义 。
o1 与 R11:32
我觉得 o1 首先是让大家看到了 Reinforcement Learning 在 Post-training 这个领域进行应用之后带来的智能提升 。 因为当时大家都在想在 GPT-4o 之后下一个是什么 , 那么 o1 出来确实在 Reasoning、 在很多智能的表现上得到了很大的提高 。
然后 o3 的发布又证明在 o 这条线上 ,其实是可以持续地把能力提高 , 它的边际还很远 , 它的空间还很大 。
所以听说 o4 Mini 也训练完成了 , 那么我们在这里面既看到了在 Post-training 上用 Reinforcement Learning 实现了 Post-training 的 Scaling Law, 同时又看到了当模型推理时间越来越长 、 它想的时间越来越长 , 形成的回答质量越来越好的 , 叫做 Test-Time-Compute Scaling Law, 或者叫推理时间的 Scaling Law。
所以这两条新的 Scaling Law 其实在之前 Pretraining 的基础上, 让 AI 的模型能够进一步的提升 。 并且大家全世界同行 , 虽然之前或多或少头部的几家公司都已经了解到 Reinforcement Learning 是很有用的 , 能够提高很多的表现 ,但是 o1 的出现也让大家看到这条路是可以走得通的 。
并且 o 系列这样的模型带来的推理能力提升 , 我觉得是解锁 Agent 这样一个产品形态的关键 。 因为模型的思考能力不够强的话 , 它就没办法自主地去使用工具 、 制定计划 、 检查自己的工作有没有完成 , 这些都是 Agent 这样产品它必备的点 。
所以先得有 o 系列带来的思考能力提升 , 才能够解锁新的产品形态 。
你提到 o4 和 o3 大概它的区别 , 或者它主要优化迭代的是什么 ?
有一些八卦吧 ,但据说比如说 o4 Mini 可能说它推理的时间能够到几个小时的级别 。其实我们一直在想 , 比如说优秀的人类跟一般的人类的区别是什么 , 比如说为什么博士论文要写 5 年 。
因为一个博士他可以通过 5 年的时间得到一个更好的 、 更高价值的工作 , 对吧 ? 但可能给一个普通人 10 年也写不出来一篇博士论文 。
所以首先这个人基础数据要好 , 第二你要给他更多的时间 。 所以之前我们说训练模型 , 就有点像是说培养一个更聪明的人 ,但是聪明的人需要更多时间来传递更好的工作 , 这个就是推理时间的 Scaling Law。
那么现在一个模型能够思考更长的时间 , 得到更好的结果 , 这一点其实是似乎在 o 系列上, 包括 o3、o4 可能越来越能够达到的一个目标 。
对 , 那刚刚讲的是 o1, 总结一下就是它证明了强化学习在后训练 、 在测试时间计算的 Scaling Law 的一个潜力 , 这个事还可以走很远 。
这是 o 系列的 。
这是 o 系列的价值 。
然后接下来可以说说 R1, 这个肯定也是影响力非常广 , 甚至我觉得某种程度它是超过 o 系列的 ,因为它是一个全民都在讨论的一个事情 。
我觉得 R 系列确实是一个世界级的工作 ,并且这里面给了我们其实非常多的启发 。 我觉得第一个就是开源 vs 闭源 , 对吧 ?
当它选择开源的时候 , 第一它能够让大家知道这里面是怎么训练的 。其实在 R1 的训练论文 , 包括 v3 的训练论文里面 , 我们看到了大量可能其实 OpenAI 已经知道 ,但是对公众还不知道的结果 。
这里面有几个我觉得非常精彩的例子 , 比如说 R1-zero, 它证明了在不用 SFT 的情况下, 仅在基础模型 v3 的基础上做 Reinforcement Learning, 就可以持续地获得模型输出更长的长度 , 获得更好的智能 , 这样一个推理的 Scaling Law。
所以不用 SFT, 这是一个很重要的创新 。 然后 gRPO, 对吧 ? 这也是听说 OpenAI 之前已经知道 ,但不管怎么样 ,是 DeepSeek 的这篇文章先让大家意识到 gRPO 这条路可以工作 。
然后之前有很多人在探讨 o1 的时候 , 会去想是不是通过 MCETS 这种搜索的方式去实现的 ,以及包括说是不是用了像 PRM 这种按照步骤去进行标注 、 进行 Reinforcement Learning 办法 。
但是 DeepSeek 非常慷慨地说 " 我们试过了 , 这条路不通 "。其实很多时候知道一条路不通就很重要 , 对吧 ?
其实最近我学了一个词 , 我觉得挺有意思的 , 叫做一比特信息 , 就是有的信息很关键 , 一个比特就够了 。
比如说 R1 这条路 , 或者 o1 这条路能不能往前走 , 一个比特就够了 。 那么我觉得 DeepSeek 这篇论文确实很厉害的一点 , 就是告诉大家一些一比特信息 , 比如说 MCETS 此路不通 , 或者至少我试出来此路不通 , 那你这条路可以先不用走了 , 对吧 ?
这种一比特信息 , 一方面是 DeepSeek 它做了很慷慨的分享 , 对吧 ? 另外一方面 ,有的可能也是比如说硅谷和现在我们中国的差距 , 就是硅谷可能还有一些一比特信息是我们还不知道的 。
比如说对于前沿的研究员 ,其实包括我们去年做的这些了解来看 ,在 24 年年中在硅谷 ,RL 这条路线走得通的 , 这个信息就已经成为一线 Lab 的共识 。
但是这个事情要逐步地比如传达到中国 , 传达到这边来 , 可能在 o1 出来 ,R1 出来之后大家说 " 确定了 , 这个事情是可以走通的 ", 对吧 ?
所以前沿的探索很多时候 , 它还是隐藏在这些一比特信息里边的 。 所以开源的这种分享精神 , 一方面是让模型的这些同行训练者们 ,他们学到了很多 。
同时第二方面 , 大家也看到最近微信也接入了 DeepSeek, 然后百度也接入了 DeepSeek, 这些本来自己有模型的公司 ,他们其实也是因为 DeepSeek 的这种开源特点 , 所以他们才有可能去使用 。
同时这样让更多的人能够用上一个好的模型 。 比如说我们投的 Monica,他们最近也上了一个国内版 ,也用了 R1。
因为在之前很多时候 , 国内的应用开发者 ,他们首先在海外去做应用 ,也是因为海外有 GPT-4o,有 Claude 3.5 这样的好的模型 , 所以他们能做出好的产品 。
但现在国内有了 R1 这样好的模型之后, 我觉得确实它会让国内应用开发者 ,他们手中的武器变多了 。
并且我觉得开源其实也是让行业变得更快 , 对吧 ? 它会让大家都能够互相学习 , 互相进步 。
所以我觉得开源 vs 闭源 ,在这个事情上其实是非常重要的一点 。 第二就是 OpenAI 并没有公布 o1 训练的这些细节 ,但 R1 的公布 , 所以让大家看到 Reinforcement Learning 强化学习这条路确实能够走很远 。
那么指出了一条大家值得一直往下走的路 , 这点我觉得是 RL 的胜利 。 刚才说第一点是开源的胜利 , 第二点我觉得是 RL 的胜利 。
第三点我觉得 R1 包括 v3, 包括整个 DeepSeek, 证明了说团队的专注很重要 。在资源的限制情况下, 反而大家能够想到更加有创造性解决问题的办法 。其实比如说用 MoE, 这本来就是一个省资源的过程 ,因为如果你用一个 Dense Model,其实你需要的推理成本和训练成本都大很多 。
用 MoE,并且在比如说芯片这些遇到卡脖子的问题上, 怎么样在一个合法合规的基础上, 通过像 MLA 这样的技术创新 , 然后让不管是训练还是推理能够跑起来 , 能够获得很好的效果 。
我觉得这个其实就是资源限制 , 很多时候反而是创新的源泉 。 同时 DeepSeek 也是一家在研究方向上做了很多选择的公司 , 比如说他们没有去做多模态的生成 ,他们没有去做类似于情感那个方向 ,因为 23 年很多人都在做 AI 虚拟女友 ,他们也没有去做 2C 的产品 , 直到在 R1 发布之后才上线了他们 APP。
我觉得所有的这些都是让他们其实他们已经有很多卡 、 很多钱 、 很优秀的人 ,但是仍然需要专注在提高智能 、 提高模型的基础能力这个条件下, 然后把力量集中在一个专注的方向上, 获得这样的结果 。
我觉得这个其实也是体现了对技术的 Vision, 对做什么方向的坚定选择 , 然后再坚决的投入带来的好的结果 。
然后我觉得这里面其实也反映了在现在对于年轻的很 AI Native 的团队 ,是能够去跟规模更大 、 有更多资源 、 甚至有更多用户的大厂去 PK 的 。
因为之前大家一直会觉得大厂有钱 、 有人 、 有卡 , 还有很多用户 , 那小公司怎么跟他们竞争 ?
当然 DeepSeek 不是一般意义上的小公司 ,但仍然它是一个相对比较小 、 比较年轻的团队 , 这里面很多的成员其实都不是海归 , 对吧 ?
是中国本土培养的研究生 、 博士生 。 之前有很多人觉得可能最优秀的人才都在硅谷 , 我们就要去从硅谷找来洋和尚才会念经 。
现在大家发现中国其实已经有最优秀的 AI 的人才 , 甚至有人说现在 AI 就是中国的中国人和美国的中国人之间的竞争 。
那么在这个过程中, 我觉得让大家对中国的人才体系其实有了很强的信心 ,其实这个也很关键 。 而且我觉得还有一个对我来说很重要的启示是 ,DeepSeek 证明了在技术革命的早期 , 如果你能够通过技术进步给用户带来一个全新的像魔法一般的体验 。
我相信很多人看到 DeepSeek, 它 R1 模型是他们第一次用到一个叫做 Reasoning Model 或者叫做推理模型 , 看到它输出的结果 , 用户会觉得很棒 。
所以这样会引发自发的传播 , 它就带来很多自然水 , 几千万 DAU, 这个没有花一分钱广告费 。 然后同时它的 API 也供不应求 , 很多人都想去付钱使用它的 API, 甚至有人说能不能给我一个 DeepSeek 付费版 , 我能够稳定地用 R1, 我愿意付钱 。
这样也意味着说技术进步带来产品体验的变革 , 产品体验的重大变革带来用户的自发传播 、 自然流量 , 同时也会涌现出商业模式 。
所以我觉得这里面可能我们还是在技术革命的早期 , 要坚持技术的突破 ,在智能上的领先 ,而不是说在已有的智能上去进行很多产品运营的雕花 。
你觉得这个已经是共识了吗 ?
我觉得其实这一点在之前有很多人去提 ,其实之前 23 年、24 年其实也有不少 Researcher, 尤其是他们会说智能很重要 ,不要在已有的技术上雕花 。
但是我觉得大家需要一个鲜活的例子 ,因为我觉得在 24 年 DeepSeek、R1 横空出世之前 ,其实大家或多或少还是陷入了一种对于你有多少 DAU、 你有多少留存 、 你有多少时长这种互联网时代指标的关注 。
所以在这种关注下, 举个例子 , 比如说为什么那么多人喜欢当时做 AI 虚拟女友 , 为什么有很多人要做 AI 打电话这样的功能 ,是因为他看到好像确实这样的产品流程会比较高 , 用户聊的时间很长 。
因为你跟打电话当然时间长了 ,但是这个是不是智能 ? 我至少自己认为它并不是来自于智能的提升 ,而是在于说满足用户的情感需求 , 对吧 ?
那如果你把时长 、DAU 作为优化指标 , 你可能就会去做那样的事情 , 你可能就不会去做 DeepSeek 这样的提高智能的产品 。
但是之前其实我觉得在中国互联网其实大家也有很多争议 , 就是说既然大家企业服务的土壤比较少 , 大家好像都愿意为杀时间付费 ,不为省时间付费 , 那提高智能是省时间的 , 对吧 ?
那 AI 女友可能是杀时间的 , 所以大家还是在习惯性地寻找下一个字节跳动 。 所以我在 24 年给我们 LP 的一个汇报上, 就是 10 月份 , 我其实就讲了一点 , 就是未来的字节跳动可能不会延续字节跳动的公式 ,因为字节跳动是通过占用用户时间去赚钱的 ,但是用户时间只有这么多 , 抖音 、 王者荣耀等大量的已经占了这么多了 。
那接下来的杀手应用也好 , 或者大的创新 , 可能就是在于说帮用户省时间 , 或者说在用户这 8 小时 、16 个小时以外去给用户创造价值 ,而不是说我一定要把他刷抖音的时间抢过来 ,因为那是很难抢的 , 对吧 ?
抖音很厉害 。 所以我觉得这个需要一个例子证明这一点 。 我觉得 DeepSeek 其实给大家看到了一个很好的榜样 。
所以总结一下你刚刚说了开源的胜利 ,RL 就是强化学习的胜利 , 专注的胜利 , 还有本土年轻团队 、AI Native 团队的胜利 ,以及所有这些最后加起来 , 可能是你带来一个魔法般的体验 , 它会帮你去产生一个很大的影响力 。
就是要技术往前推进 , 推进技术的前沿 。
我们刚才是讲了就是 o 系列 , 还有 DeepSeek 的 R 系列 ,以及 DeepSeek 整个的全球大出圈这么一个变化 。 那接下来我觉得可以延展 , 就是说说这些变化带来的后续的连锁反应 。
Agent 起点13:30
有一个其实你刚才已经提到了 , 就是说这个推理能力的提升 , 它可能大家觉得它会指向 Agent, 就智能体的这个应用 , 这也是从去年底开始到现在 , 我觉得频繁在讨论的一个点 。
对 , 我们可以先讲讲就是 o1 带来的这个推理能力的提升 , 可能会导致一些什么新的变化 。
是 , 首先如果按照我们刚才讲的这个框架 , 就是技术进步解锁新的产品形态 , 那我们可以看到 GPT, 然后 GPT 的 Scale Up 到 GPT-3.0, 然后到对齐成对话模式的 Instructor GPT, 然后出来 GPT-3.5 的模型 , 解锁了 Chatbot 这样一种产品形态 。
然后 Sonnet 为代表的 Coding 能力很强的这些模型 ,其实解锁了像 Cursor 这种帮助你编程的编程助手的产品形态 ,其实它是一个互相成就的 , 没有 Sonnet,Cursor 就不可能火 。
然后我觉得从 Sonnet 3.5 开始 , 模型具备了一定的推理能力 , 然后 o1 以及 o1 之后的 o 系列的进展 , 让模型的推理能力变得很强 , 这个其实解锁对应的产品形态 , 我认为可能就是 Agent。
首先什么叫 Agent? 那么在英文里面 Agency 这个词有个意思叫主观能动性 , 就是以前地球上具备主观能动性的可能只有人, 就人能够去知道自己要干什么 , 人能做计划 , 人能使用工具 , 人能评估自己工作的结果 , 所以我们统治世界 。
但是现在逐渐的 AI 的能力到达了一个突破点 , 使得 AI 能够扮演 Agent,也就是具备了 Agency 主观能动性 。 这个在我看来是由三个技术的进步导致的 , 或者解锁的 。
第一个就是 Reasoning, 就是推理能力 ,因为它如果推理能力 , 或者说基础的智能不够强的时候 , 第一你不知道要做什么 , 第二你无法列出一个切实可行的计划去完成对应的步骤 , 同时你也无法去检查自己是不是完成了这个任务 , 对吧 ?
所以这是个基础的智能 。 第二个就是 Coding 的能力 ,因为在数字世界 , 理解 Code、 写 Code 去完成任务是一个最基础的能力 , 这是整个赛博世界的语言 , 对吧 ?
所以在这个过程中能看得懂代码 , 能够写代码 ,其实这是一个最基础的能力 。 第三就是工具使用能力 ,因为在数字世界 , 人已经为自己造了这么多的工具 , 这么多的软件 , 那 AI 首先得适应人类用的这些工具 , 比如说 AI 也要通过使用人的浏览器 , 使用人的网站去获取信息 , 所以工具使用能力也很重要 。
那我们看到这三个能力就是 Reasoning、Coding 和 Tool Use, 就是工具使用能力 ,在过去的 12 个月里面都发生了翻天覆地的变化 , 进入到了一种指数增长的阶段 。
那这里面其实有一些不同的 Benchmark 可以去衡量 , 对吧 ? 比如说推理能力 , 假设我们用所谓的 GPQA,也就是它其实是一个要人类博士生入学资格的这么一个级别的问题 , 基本上普通人类能够得 20 多分 , 人类的博士生能得 60 分 。
然后 AI 最好的前沿模型在 24 年年初大概是一个几分 , 或者是十来分 , 十几分 , 对 ,但现在前沿的模型 , 比如说 o3 应该是 70 多分 , 如果没记错的话 。
24 年底到了 70 多分 。
到了 70 多分 , 所以这个涨得非常快 。 然后编程能力 , 大家一般用 Sweb Bench 这个用得比较多 , 它是抽取了一系列 GitHub 上真实存在的人类编程任务 , 可以认为人类也要干这些事情 。
那 4o 在 24 年年初是得个位数 , 好像是 5 分还是多少分 , 反正就属于基本不可用的状态 。 但是在现在 o3 mini 或者说 o3 应该已经到了七八十分的程度 ,也就是认为百分之七八十的人类编程任务都可以被解答 。
然后比如说像工具使用 , 对吧 ? 那 Tao Bench 也是一个订机票 、 电商这些的 Benchmark, 之前在 24 年年初一年以前 , 基本上前沿模型也就是个位数的得分 , 现在大概能做到比如说三四十 、 四五十 , 或者甚至六十 。
所以我们看到现在其实有个问题是 , 我们已经不知道考 AI 什么题目了 ,因为前一阵子比如说陶哲轩做了一个叫 Frontier Math, 就说这是非常难的数学问题 ,是证明最简单的题都是 IMO 的难题 。他就说这个能够挡住 AI 几年的时间 , 结果现在 Frontier 也变成 25 分了 , 就是在 o3 的那个里面 , 那 o4 可能又更好 , 对吧 ?
我想问 o3 的金牌 , 如果做这个 Frontier 的这个 Math 能得多少分大概 ?
应该是比较难的 ,因为这里面它起步就是 IMO 的难题 , 相当于数学前沿科研的水平 , 就当时说可以挡住 AI 一段时间 。
但是你会发现 , 当 Reinforcement Learning 在一个领域能够得到使用的时候 , 这个成长的曲线往往就是指数的 。其实我们在之前 AlphaGo 看到了 , 后来 DeepMind 做了一个 AlphaStar, 就让 AI 去玩星际争霸 , 很快就超过了人类的顶级玩家 。
然后自动驾驶其实已经比人要安全很多倍了 , 只是因为很多监管原因没上, 对吧 ? 所以 Reinforcement Learning 进来的地方 , 往往就会导致 AI 迅速超过人的能力 。
所以我把这个叫做李世石时刻 ,因为李世石当时跟 AI 下五盘输了四盘 , 对吧 ? 那个很多人当时都看了 , 反正我不会下围棋 ,但是我们都知道围棋很难 ,以前都觉得 AI 解决不了围棋 。
但是那时候发现 AI 原来比最强的人类都能轻松打败 , 所以那一刻其实很多人, 第一是信仰破灭的时刻 , 对人类智力信仰破灭 ,但第二同时也是很多人投入 AI 研究的时刻 , 说 AI 这么牛 , 我要去做 AI。
但是它是在围棋 , 对吧 ? 那我们其实会越来越多的在各自的领域看到李世石时刻 。 再举个例子 , 就是 CodeForce 其实是一个 Competitive Coding, 对吧 ?
这个是在 o3 的 Benchmark 里面 , 它是拿了 2703 分 , 应该是 , 它其实已经超过了人类 9.9% 的水平 , 可能已经到了全人类前 200 名的水平 。
那这个就意味着说它就是形成了超人的智能 , 这些其实很多时候都是 RL 这个范式解锁之后带来的结果 。
当然我觉得 AI 里面有一个特别有意思的地方 , 就是往往一个东西实现之后, 大家就说这个不算 , 我们再来一个 ,因为如果按照以前图灵测试的标准 , 现在 AI 早就已经达到了 , 现在都没人提图灵测试了 , 对吧 ?
人类是不是很快就没有能够评价 AI 能力的能力了 ?
我觉得现在已经很缺乏了 , 现在 Alexandra Wang 搞了一个 Humanity Last Stand, 对吧 ? 就人类最后的堡垒的问题 , 现在好像也到 20 分了 , 就是那个一出来也是 0 分 。
100% 吗 ?
它 100%, 现在也已经 20 分了 ,但现在问题是说从 20 分到 80 分可能很快的 ,而且关键是你想人类要想出难题来 , 那对人类是个很大的挑战 , 对吧 ?
但如果 AI 它是靠花算力 , 靠 RL, 靠更强的 Inference 就能实现的话 , 那这个其实你是很难赶上的 。
对 , 就你刚才说的这个李世石时刻 ,其实李世石时刻最开始的开端肯定是它超过了人类 , 这是个很直观的 。
当然我跟一些下围棋的人聊 , 比如说像罗天成 ,他自己就下围棋 ,他会怎么来理解这个事情 , 就说当这个 AlphaGo Zero 出来之后 ,他不仅是说他超越了人类 ,而是说人类的智能其实不能理解他 。他说他下围棋和做自动驾驶都是这种感觉 , 就自动驾驶做到后面 ,他说我自己去车上去试乘 ,是试不出来什么东西的 。
然后下围棋也是 , 就是现在人类可能积累了比如说上千年的一些定式 ,AI 就给它打翻了 。
对 , 当然 。
然后你也理解不了 ,但是它就比你高 。
我觉得可理解性和可解释性其实并不一定会存在的 , 对吧 ?
对 ,因为按照第一性原理 , 就人类现在是根本没有办法掌握世界上所有的真理和规律的 , 大量的规律被掌握 。
也不要说别人, 比如说我们可能也无法理解爱因斯坦怎么想出来的 ,但并不妨碍我们去跟他合作 。 但如果你进一步来想 , 比如说猫猫狗狗 , 它也不理解人类为什么做这个事情 , 对吧 ?
所以可能很快就会变成了一个小学生如何考核一个博士生 , 可能我们现在就在逐渐会面临这样的情况 , 小学生想出自己认为很难的题 , 考考博士生会怎么样 ,其实可能就变得越来越难 。
所以这是一个我觉得对于 AI 安全现在很至关重要的问题 , 对吧 ? 就是你现在可能都无法评价了 ,因为现在很多人类已有的测试都被刷到了 95 分以上 。
像我们在清华读书 , 经常就有人讲说你考 100 分是因为你能得 100 分 ,他考 100 分是因为只有 100 分 , 确实有 1000 分他也可以得 1000 分 ,是吧 ?
现在已经到了这个阶段吗 ? 就我们已经无法评价 AI 的能力了 。
我觉得还不是无法评价 ,但是我觉得已经可以在很可以预见的未来 , 可能就是小几年的时间内你就很难去评价了 。
那个时候会带来什么呢 ?
其实我觉得现在大家已经看到了很多苗头 , 比如说春节期间有一篇文章 , 据说梁文峰发在知乎上的回应非常火 , 对吧 ?
后来大家发现那就是 DeepSeek 的写 。
那很 DeepSeek 风 。
因为我们经常看 DeepSeek, 所以我们能 get 到 ,但是我想 90% 的人 get 不到 ,因为我朋友圈很多人转 , 我朋友圈还是很多人是水平还不错的 。
我最近一直在用 OpenAI 的 DeepResearch,其实给我很大的帮助 , 很多的震撼 ,因为我们刚才聊 Agent,其实 Agent 的第一个应用场景就是帮我做研究 , 然后我问他一个问题 ,他得去想我怎么去解答这个问题 , 列出研究计划 , 寻找资料 , 进行总结 , 进行对比 , 对吧 ?
然后我们去看 , 比如说从原来的 4o, 它没有 Reasoning 的能力 , 然后到 o1, 后来 o1 出了 o1 Pro, 就是想更长的时间 , 对吧 ?
然后 o1 Pro, 然后又进入到下一个叫 o1 mini,o3 mini 的 Hi, 就是用 o3 mini 想更长的时间 , 然后又到了这个 DeepResearch。 那么整个这个过程也就是发生在三到六个月的时间 ,但我已经明确感觉到它的水平提升是指数级的 。
我昨天其实就在想 , 假设我们从大街上随便找 10 个人, 这里面我认为至少有 9 个人 ,他的能力就是已经不如这个 DeepResearch 了 ,因为 DeepResearch 可以对任何你需要的话题在几分钟内给出一个我目前看来认为是一个工作一两年, 而且还是在一个比较好的公司工作一两年的白领的水平的研究报告 。
那我可以想象很多人类 ,其实你给他再多的时间 ,他也没法具备一样的思考 、 推理能力 、 信息获取能力 、 总结能力 。
所以我觉得 AGI 已经不是一个说科幻概念 ,因为如果两年前大家谈 AGI, 大家还觉得是很遥远的事情 ,而是在一些这样的任务 , 比如说收集信息 、 整理信息的任务上, 已经超过了大多数人类 。
像我们这样的人, 比特进比特出的信息工作者 。
所以这里面 , 比如我们今天这样的聊天对话 AI 做不到 ,因为这是我们的专有信息 ,在我们今天聊之前这个信息不存在 。
但是如果这个信息已经存在在地球上某个地方 , 它没有一个专有的信息的话 , 那么 AI 一定是比绝大部分人绝对要做得更好的 。
我觉得这个是很确定的事情了 。 所以我确实觉得增长速度很快 , 我们看到了这个指数增长 , 同时也会看到很多刚才说的这个李世石时刻的到来 。
注意力之后23:29
但这些我觉得回到开始的话题 , 就是我觉得会解锁 Agent 带来的一个重要意义是什么呢 ? 我觉得过去我们互联网看到了所有产品模式 , 我可以把它总结成为一句著名的话 , 叫 "Attention is all you need"。
因为我们去想 , 比如说不管是说当时这个腾讯还是说字节 , 对吧 ? 其实核心都是你有多少用户 , 用户在你身上花多少时间 , 它其实可以理解成为一个公式 , 就是时长乘以用户数 , 然后乘以变现率 , 对吧 ?
那么所以大家想的都是我要有更多用户 , 用户花更多的时间 , 然后我的 up 更高 。 但是这件事一定是有个尽头的 , 对不对 ?
总共就这么多人, 每个人睡觉 8 小时, 醒来的时间最多 16 个小时 。 我们现在看手机的 screen time 已经是 80 个小时了 , 你还得吃饭工作 , 你还得干一些不能看手机的事情 , 对吧 ?
所以这个你很难提高一倍了 。 所以大家就在提高变现率 , 对吧 ? 同样的一个小时, 我怎么样从你这获取更多的价值 , 可能就变成了抖音的视频广告 、 直播 , 对吧 ?
那么这条路它肯定是有尽头的 。 但是人类历史上所有的事情目前都需要人的 attention, 无一例外, 只有一种不需要 , 就是所谓的自动化 。
就以前所谓机械自动化机床 , 人把这个事情给自动化建设起来之后, 它可以自行运转 ,但那个事情它是没有 agency, 它是没有主观能动性的 。
所以人类以前要不然是要人类的注意力 , 要不然就是简单重复 。 目前 AI 的技术进步带来了说 , 第一不需要人类的注意力 , 第二又能自主执行任务的可能 。
我觉得这个是不夸张的说是人类这个物种 , 它从诞生以来最大的进步 。 因为如果我们认为人类跟其他动物的区别是人可以使用工具 ,其他动物不行 , 那以前人类用的所有工具都需要 attention, 直到现在 Agent 出来了一个不需要 attention 的工具 。
比如说当我把一个问题丢给 DeepResearch, 它会自己研究 5 分钟 , 这过程中不需要我的 attention。 当我去年用到 Devin 的时候 , 我发现我给它一个任务 , 它就自己去干了 。
这个过程中我可以去打断它 , 我可以说我有个新需求 , 或者我可以看看它做得怎么样了 ,但如果我不去打扰它 , 它就会自己去做 。
所以我想提出一个新的一句话 , 叫 "Attention is not all you need"。在 Agent 的时代 , 那么这个会导致什么 ? 这个会解锁人类无限的潜能 。
因为刚才说到人类的 attention 就这么多 ,但人类如果你的 attention 不需要再被使用的话 , 那它的理论倍数是无限的 。
但这个就有点像什么 , 比如说从一个老板的角度 , 你让员工去干一件事 , 就不需要你的 attention 了 , 对吧 ?
那但是这是老板的好处 。 所以我们以前大部分的人其实都在执行别人 attention 的结果 , 对吧 ? 那只有少数人是老板 。
但现在 AI 越来越强大的时候 , 每个人都会做 AI 的老板 , 那你让 AI 做什么 ? 这个其实是一个很重要的问题 。
因为很多时候大家发现这个助手很聪明 ,但我拿它干嘛呢 ? 那除了大家经常讲的订机票 、 订外卖这种简单事情之外, 你有什么事情可以让 AI 做的 ?
我觉得这个对社会 、 对大家教育会有重大的影响 。 但是我相信如果大家适应了这种范式之后 ,其实你会发现你有更多的事情是可以让 AI 去做的 。
所以这个我进一步的延展 , 就我觉得我们可能会看到一个叫做工作的 Scaling Law。其实现在工作或者生产力是不太能被简单的 scale 的 。
比如说一家大厂 , 它有 100 个亿 、1000 亿 , 它不能简单的把 1000 亿变成生产力 , 它也得招人, 也得培训 , 然后人多了之后还会有内部的政治 , 它还会内斗 。
所以有钱并不一定有生产力 。 但是如果 AI 的模型越来越强 ,并且模型的推理能力越来越强 , 那你就发现你有钱 , 钱等于算力 , 算力越多 , 你就能够让 AI 产生更多的生产力 。
这其实就是一个钱变成生产力的 Scaling Law。
这个里面的几个维度就是钱 、 算力和生产力 。
钱可以等于算力 , 或者可以近似等于 。
还有模型的性能 , 对吧 ? 模型的能力 , 然后算力 , 然后更大的生产力 。
对 , 就第一个是模型性能要越来越强 , 第二是它要有 Inference Scaling Law, 就是它想一天就比想一个小时好 , 想一年就比想一天好 。
当然这个对模型有持续的要求 ,因为现在可能比如说模型想 5 分钟比想 1 秒钟好 ,但是想一个小时可能也不比想 5 分钟好 , 对吧 ?
所以我们能让模型有增量的 Performance 的想多久 , 这个会很重要 。 就跟我开始说的 , 康德在那想了几十年, 想出来几大批判 , 说明他能够持续的提高他的 Inference 的能力 , 对吧 ?
但普通人你想再久可能也想不出来一个有意义的结果 , 这个就是区别 , 这就是你的基础模型能力的差异 , 对吧 ?
但是世界上需要这么多的生产力吗 ?
这个就跟当汽车飞机发明之前 , 大家说我们要动得那么快 , 那我去隔壁村我走路就行了 , 为什么我要坐飞机呢 ?
就你觉得它会创造新的需求 。
我至少觉得历史上大量的技术已经重复的验证了这一点 , 对吧 ? 我们为什么要跑得那么快 , 我们为什么要有那么多的电力 , 对吧 ?
我们为什么要那么多算力 ,其实这个 pattern 是一直在出现的 。
但其实人类的技术爆炸的时间很短 ,也就四五百年, 就你相比人类物种和长期的古代历史的话 , 它其实很短的时间 。
这个其实是一个更有意思的点 , 就是说原来人类的技术爆炸是以 generation 为单位的 ,是以一代人为单位的 , 然后逐渐的就变成了说一代人他生命周期中可以发生几次技术爆炸 , 比如说我爷爷奶奶都 90 多岁了 , 那他们这辈子经历的技术爆炸太多了 , 对吧 ?
但现在变成了说 10 年之内就能够经历技术爆炸 ,AlexNet 到现在才多久 ? 才 13 年时间 。
对 ,12 年的时候 。
12 年时间 。 所以如果当 10 年 ChatGPT 到现在才多久 , 对吧 ? 你还记得 ChatGPT 刚出来的时候它的能力吗 ?
那个时候我们觉得很牛 ,但是现在想就很差 , 对不对 ? 如果当这么快的变化的时候 , 人可能就很难真的去适应了 。
所以这个里面我觉得会产生很多的社会上的影响 。 但这个抛开之外的话 , 指数增长本来是世界的常态 ,但是指数增长在最后陡峭的曲线之前 , 它看上去很像线性增长 。
对 , 它是突然 。
对 ,有句话叫 "gradually then suddenly", 对吧 ? 就是当它进入到那个快速上扬的时候 , 它之前其实好像没啥 。 所以这个其实也是为什么我觉得像一些关注 AI 安全的人 ,他们会很关注 ,因为大家觉得已经进入到一个指数增长的阶段了 。
那这个时候你就得不叫未雨绸缪了 , 已经开始打雷了 , 快下雨了 。 但这个可能有点说远了 ,但是我觉得生产力的大幅提高 , 这个是一个很重要的变量 。
因为如果你认为生产力最后带来的是经济价值的话 , 对吧 ? 当然这里面就变成说生产力是什么 , 怎么样为大家去产生这样价值 。
但可以想象这里边我觉得一方面 , 比如说 Sam Altman 说一个人的公司会变得很强大 ,因为如果一个人他能够很有效的指挥 AI, 然后他甚至通过 AI 指挥 Agent,他可能能创造很大的价值 , 这是一方面 。
但另外一方面 , 现在我们说我们投创业者 , 创业者为什么有的时候能打败大厂 ,也是因为创业者他具备更高效的把同样的资金变成更多生产力的可能 ,因为他有更好的 vision,他更加努力 , 怎么怎么样 , 对吧 ?
他没有什么组织的主力 。 但假设大厂也能够花一大笔钱去雇佣很厉害的创业 Agent, 那也许普通的创业者是打不过大厂能雇佣的 Agent 的 , 那可能只有顶级创业者能够打败大厂 。
那一般的创业者就被大厂花钱请的 AI 给干掉了 , 这也是说不好的事情 , 对吧 ? 所以也有人认为这个会导致富人更牛 ,因为富人能买来更多生产力了 。
原来你固然有钱 , 那你也比不过一个很聪明的年轻人, 对吧 ? 也许以后不一样了 。 所以我觉得会发生很多这个两方面 。
对 , 这两个方向 , 一个是其实是超级个人嘛 , 一个是像那种很多科幻乌托邦里的 , 我会遇到一个更厉害的公司 。
所以我觉得它带来的变化 ,不管是生产力的角度 , 社会结构的角度都是很大的 。 但这些我觉得解锁的前提条件都是在于说模型能力要提高 。
所以这里面我其实觉得有的时候在技术革命的早期找到第一个 PMF,有的时候是一种甜蜜的陷阱 , 或者是一个诅咒 。
比如说咱们说移动互联网 , 第一个找到 PMF 的可以说是黑莓 ,因为他用当时的技术 ,他说我这个处理器很弱 , 网络很慢 , 所以我只能发邮件 , 发黑莓 message,so push。
所以他为了做好这个 PMF,他就做了黑莓手机 , 上面有键盘 ,并且他一直以键盘为傲 。 但是当这个技术进一步进步 , 处理器更强 , 网络更快 , 屏幕更大的时候 , 苹果说不要键盘 , 苹果就做了一个全键盘手机 。
那个时候黑莓其实说他没有键盘 ,他打字发邮件肯定不好用 。 但这就是你找到第一个 PMF 的诅咒 ,因为当后面的技术升级的时候 , 你会被你自己的 PMF 给困住 。其实互联网也出现过这样的情况 , 雅虎是互联网第一个 PMF 的公司 , 可以算是吧 ?
那就是门户类 。
它就是门户 , 它就说我信息列在那给你看 , 对吧 ? 所以当后来搜索引擎 Google 出现的时候 ,其实对雅虎来说也是个巨大的冲击 ,因为原来雅虎是很复杂的 , 上面有大量的这个内容 , 你要去点击去看 ,Google 就是一个框 , 直接进去输就行了 。
当时雅虎其实曾经尝试买过 Google,但它出的价不够高 , 对吧 ? 而后来 Google 就把雅虎这些又颠覆掉了 , 对吧 ?
对 , 所以我想说的是 , 比如说 Chatbot 可能也是一个甜蜜的陷阱 。 比如说当你有这么多 Chatbot 的时候 , 你可能就想说怎么在这个基础上去进行这样的优化 。
但是我其实一直觉得 Chatbot 可能会限制前沿 AI 模型的能力 。 为什么这么说呢 ? 比如说你现在跟 ChatGPT 或者 Kimi 或者豆包聊天 , 你会不会有一个习惯是说你跟他进行的是很多类似于在微信上的短对话 ?
就是比如说经常有人说我有个问题 , 然后 AI 说你说吧 , 我想做什么什么 , 然后 AI 再反问你 。
就是我们的对话是很碎片化的 ,但是如果当你需要给一个 Agent 一个指令的时候 , 很多时候你其实更需要写一个更重要的 proposal。
比如说就好像你去申请一个国家自然基金计划的时候 , 你要写一个我要做什么事情 , 我的目标是什么 , 我的条件是什么 , 你是要做一个完整的沟通 , 对吧 ?
但是这个你就发现在 Chatbot 那个有点像微信的语境里面 ,其实你可能做的就是碎片化沟通 。 这个时候模型的智能其实不一定能体现出来 。
我之前其实就跟 OpenAI 的同学聊 ,他们就说他们其实发现先进的模型在用户聊天的时候 ,其实并没有让用户的满意度提高太多 。
这个其实就有点像如果你是跟人聊微信 , 那可能一个普通大学生和一个科学家聊微信的感觉没那么大不一样 。
但是你如果说让他写个博士论文 , 那可能就是完全 0 和 1 的区别 。 所以 Chatbot 这样一个比较早期 、 比较容易让人接受的产品形态 ,其实并不一定是能走到最后的产品形态 。
而如果你现在在这个上面去进行短期指标的优化 , 比如说我怎么让大家在 Chatbot 上停留的时间更长呢 ?
也许就说那我要做个打电话功能 。 但打电话这件事情跟智能的提升是不是一致的 , 甚至也许不一致 。
因为要把电话打好 ,其实可能跟智能没关系 , 可能跟说话的语气 、 情商这些有关系 ,但它对于你产生生产力可能没关系 。
所以我在想历史上其实往往有这样的情况 , 就是先找到第一个 PMF 的人 ,他如果不去进一步的去探索 , 可能会被那个 PMF 给困住 。
这其实历史上也是发生过很多次的 。
Agent 形态34:09
因为我们刚才做了很多关于 Agent 的展望 , 可能已经到比较远的 ,也许几年后的事吧 。 那比如说如果在 25 年的话 , 你看到的这种 Agent 的形态 , 就在你说的这个工作 Scaling Law 的这个逻辑下, 它可能会是什么 ?
第一批 。
我觉得第一批像现在 , 为什么现在最火的叫 DeepResearch, 对吧 ? 你看 OpenAI 出了 DeepResearch,但是这个最早是 Google 出的 。Google 出了 DeepResearch,OpenAI 出了 DeepResearch, 然后 Perplexity 出了 DeepResearch,Grok 刚发布的也有这个 DeepSearch, 然后我也知道好几家创业公司什么的都要发这个方向 。
因为大家都发现让 AI 更深度的去研究一个信息 , 获取更多的资源 , 然后根据获取的内容进一步的决定获取什么样的信息 , 形成这样一个循环的过程 , 最后给你个研究报告 。
这个其实也是我们经常让我们分析师这些去干的事情 , 对吧 ? 比如说研究一下晚点这个企业是怎么回事 , 给我个研究报告 。
但是大家就发现这个事情我同样的推理时间 , 或者我稍微花点时间 , 我能够得到更好的结果 。
这个我们把它叫做 Read Only Agent, 就是它做的事情是 Read Only, 它只读 , 它没有做写的操作 , 它是做读取的操作 , 对吧 ?
这个我觉得是目前看 PMF 已经很明确了 。 就我发现我的这个 DeepResearch 确实比我的实习生干得好了 。 所以这个我认为是一个付费意愿很明确 , 场景很明确的 , 就针对我们这些叫知识工作者 , 需要做这种在电脑前面研究一个话题 , 看一堆网站 , 最后得到一个报告这样的人。
那么第二步就是从读到写 。 那么 OpenAI 出了这个 Operator, 对吧 ? 然后 Anthropic 出了 MCP,其实都是关于说 AI 怎么使用我们的这个工具 。
这个其实它会带来很多的安全隐患 ,因为大家都不希望它乱搞 。 但是显然在一个可控的情况下, 给 AI 一个能够去做写操作 , 能够对外发布信息的 , 这个其实是一个非常重要的能力 。
我们投的这个 Monica 其实他们在做一个类似的这样产品 ,他们昨天跟我分享 ,他们在这个开发产品的过程中遇到了很多很有意思的事情 。
比如说其中有一个他们测试的问题 ,是要获得美国某个城市 , 可能凤凰城或者哪 ,他们的一个地铁时刻表 。 然后这个模型首先就去官网上去看 , 然后发现那个地铁时间表已经打不开了 , 那个链接已经打不开了 。
这个时候模型干了一个什么事情呢 ? 直接调起了一个邮件客户端 , 开始给那个凤凰城的市政府写邮件 , 然后最后到了是否发送 , 就是说它完全可以做这样的事情 , 对吧 ?
这是他们的产品吗 ?
对 , 就是他们的产品其实是一个可以去调动工具 、 调动浏览器的这么一个产品 。 它有点像 Devin,但它是一个就是说可能更加便宜 , 然后加入了一些专有数据和专有模型的版本 。其实 Devin 为什么我觉得很激动 , 虽然我觉得 Devin 本身可能它不是一个最后的形态 , 它可能是一个先驱吧 。
但是这里面提到了很多很有意思的特点 , 比如说 AI 主动的使用工具 , 然后 AI 有一台自己的电脑 , 这个也很有意思 。
因为很多人之前觉得 , 比如说包括可能像一些国内的像 AutoGLM 这样的工作 , 它是用 AI 来控制我的手机 , 就 AI 在我的手机上点外卖 。
但是仔细想一想 , 你的助理是用你的手机还是用他的手机 ? 应该是用他的手机 , 对不对 ? 所以应该是说我的 AI 助理生活在云端 ,有一台他的手机或者一台他的电脑 ,他去用他的电脑给我点外卖 ,而不是说他用我的手机点外卖 ,因为我还得刷抖音呢 , 我还得聊微信 , 对吧 ?
其实这个就叫虚拟化技术 , 这个在 Devin 里面其实得到了很好的体现 。
那在权限上, 它的这套云端的电脑用的还是你的账户体系 , 对吧 ?
不一定啊 ,也可能它有它的电脑 。 比如说假设你现在订了一个很贵的什么 Bloomberg,也许你的助理说老板把你的账号借我用一下, 然后你在上面输入你的账户 ,他去用 。
那另外的情况可能是你给你的助理也买了一个 LinkedIn 的一个 Premium, 对吧 ? 他去用都有可能 。其实你会发现当 AI 能够使用工具的时候 , 它可以做很多事情 。
因为其实大部分的软件工具无非就是第一调 API, 第二去使用那个界面本身 。 所以为什么其实 Kimi K1.5 这个工作 , 它里面是一个多模态推理 。其实多模态推理如果你要在使用软件界面的时候 ,其实很重要 。
因为你要看网页 。
你要看懂这个网页 。 像现在大家说世界模型去理解世界 , 理解世界其实还是有蛮多难度的 。 比如说简单的例子 , 现在 AI 就看这个深度信息 ,其实不太能够看出来 。
比如我们看一个东西 , 我们是知道它是有深度的 ,有前后的 。 现在 AI 对这个深度区分一般 ,但是如果你只是看电脑和手机的界面 , 这个其实是可以做很多很多的事情 。
所以这是第二种 , 就是也帮你去做一些操作去写 。
就是既读又可以写 。 你想它可以写的话 ,其实这边有很多很有意思的例子 。 我随便再举一个 , 当它遇到个问题的时候 , 它理论上可以发帖去求助的 。
它甚至可以说我悬赏 ,因为我已经跟我的什么支付商绑定了 , 哪个人类帮我把这事干了 , 我给他 100 美金 。
这个事就并不是科幻 ,是完全可以做到的 , 对吧 ? 那在这个里边 AI 做件事情的效率和它的解法 ,而且现在我们发现强大的 AI 模型 , 它能想出很多人类想不到的解决问题的思路 。
比如说人类说这个问题解不出来 , 它可以说我能不能换个问题 , 我能不能需求我原来没有的权限 。
所以这里面是 AI 研究非常多研究安全所需要做的事情 。 它可能为了解题 , 它真的去做了一些有伤害性的事情 。
我自己遇到个很典型的例子是我用那个 Windsurf,也是一个就是能够在我本地进行操作的 。 就当时我让它做了一个我的个人网站的示例 , 然后它为了部署这个网站 , 它说你这里面有两个进程占用了我的这个端口 , 我要把它杀掉 。
我当时就说 OK, 杀掉吧 。 后来我一想 , 那万一杀了这个系统进程把我搞崩溃了怎么办 ? 就是它只是为了部署那个 demo 网站 ,但是它没要这个东西可能对我产生影响 。
当然这个东西是可能去对齐的 , 对吧 ? 就在这里面有非常多的可能的风险 。 所以这种能够写的 Agent 能做好了之后, 它的能力很大 ,但同时它肯定会部署更慢 ,因为它可能带来的后果也很大 。
它需要很多的这个监控 , 对它的这个训练 , 对它对齐 , 还防止它被滥用 。 所以我觉得读会比较快 , 写 Operator 其实是个例子 。
但是如果你用 Operator 的话 , 你就会发现它还不如你自己订机票订的快 。
它现在好像很慢 。
很慢 ,因为它每一步都要你确认 。 但是 AI 里面慢这个事其实总可以变快的 , 就是从慢变快 , 从贵变便宜 , 这是一直 AI 都在发生的事情 。
所以可以想象 , 如果现在你需要你的助理干 30 分钟的事情 ,AI 一秒钟就干了 , 你可以每天多干多少事情 。
你空出来的事情 , 你可以想干别的更多的事情 , 对吧 ? 所以这个对大家产生的冲击也是会很大 。
那这个进阶路程是不是就是 OpenAI 之前定义的五个技术级别 ?Agent 下面就是创新者 , 再下面就是组织者 。
对 ,其实这里面又会衍生出来几个问题 。 比如说最简单的问题就是现在是人指挥 Agent, 那能不能 Agent 指挥 Agent?
假设你每个任务都一秒钟完成 , 那人提问题就来不及了 , 对吧 ? 那肯定得 AI 去做 。
那传统题单以后就是你的 Agent, 然后对接雨森的 Agent,他们就写好了已经 。
对 , 我觉得是完全有可能的 。 但是要实现这一点 ,有个重要的就是要 memory。 因为你现在用的 ChatGPT 和我用的 ChatGPT, 你回答同一个问题差不多 , 对吧 ?
但实际上肯定应该除了公有的那部分之外, 那我的假设跟我在一起待了几年的助手 , 肯定会回答不同的问题 , 对吧 ?
这样才能导致说咱俩的 Agent 能聊 ,因为我们都有我们自己的 memory。 现在这个 memory 其实还非常初级 。
对 , 今天早上在讨论 Attention 的时候也是有讲到这个记忆 。
对 , 所以我记忆是一个非常重要的一个 , 就是说大家也都在做 ,但是还没有做得特别好 。 因为现在如果你看 ChatGPT, 它的记忆其实是它跟你形成一个系统的 prompt, 说这个人有一条狗 , 这个人是一个大学生什么的 , 那都很简单 , 对吧 ?
真正的记忆其实非常长 ,而且这个记忆又牵涉到有的是你跟它对话主动灌给它的 ,但有的可能是比如我看到了这些东西 , 对吧 ?
所以有人说是不是在眼睛或者在什么地方 ,但是记忆肯定是一个非常重要的点 。 然后还有就是 online learning, 这个其实也是一个非常重要的点 。
因为想一想 , 人有一个很独特的本事 , 现在 AI 还不具备 。 比如说 AI 的模型现在还得发版 , 就是你得发一个新的模型来改变这个模型的权重 。
但人其实在日常生活中不断的通过自己的学习 ,不管是读书还是社会 , 人可以主动改变自己大脑的权重 。 这点其实是生物的一个特点 , 对吧 ?
生物可以改变自己大脑的权重 , 使得它去输出原来它不会输出的内容 。 但是 AI 现在还得训一次 , 就还得有一个训练过程 。
这个 online learning 其实也是一个非常重要的点 。 而且上面还有很多很有意思的前沿探索的话题 。 比如说现在 Agent 是在使用这个人的工具 ,但是显然它如果比人聪明十倍 、 快十倍 , 它为什么要用一个人类的工具呢 ?
就跟我们不会用小孩子的餐具吃饭一样 , 对不对 ? 我们用大人的餐具 。 所以可能会有一系列的工具是为 AI 专门设计的 。
就是你为一个超人设计的工具 , 肯定跟咱们普通人的工具不一样啊 。 它可以一目一百行啊 , 我们一目只能一行啊 , 对吧 ?
所以在这个里边 AI 专用的工具 ,以及 AI 怎么去迭代自己的工具 , 可能它的工具我们就不会用了 , 就跟我们也不会用 EDA 一样 , 对吧 ?
而且有可能这个工具它自己能设计 ,AI 可能会设计一些自己的工具 。
有点像它觉得你的太不好用了 , 我来改一改 。 所以这个里面的迭代速度其实再往下想就到科幻领域了 。
但是我们现在发现很多这些已经不是说一个纯科幻概念了 , 已经是一个你可以想象这事可以做到 , 只要模型再往前走一走 , 就可以做到的事情 。
所以为什么我觉得这里边带来的是智能的进步 , 会解锁新的产品形态 ,而且新的这个产品形态可能就会非常的厉害 , 就比原来的 Chatbot 这些在这个原来的基础上去做雕花也好 , 或者做这些细节也好 , 可能你回头就被颠覆了 。
其实我们两三个月前聊 Agent 的时候 , 当时你还会提 coding, 就刚才其实你没有提到 coding。
你就是说像就是用来 coding 的 Agent 是吧 ? 我觉得 Agent 和 coding 的关系 , 第一步就是去做 coding 的 Agent, 对吧 ? 比如说像 Cursor 或者 Windsurf 这样 , 这个其实是 Agent 的一个目前比较容易落地的场景 ,但我觉得进一步来讲是 Agent that can code, 就是可以写代码的 Agent。
就比如如果你的助理 , 或者你的助理也许是个文科生 , 对吧 ? 但如果你的助理经过自己学习 , 学会了写代码 , 比如它可以做什么 , 它可以写个爬虫帮你去爬更多的信息 , 这样你采访的时候你就知道要采访谁 , 对不对 ?
就是你的 Agent 学了门新技能叫 code, 我觉得这个是接下来更大的一个范式 。 原来第一步是说你的 Agent 它主要用来写代码 ,但是毕竟需要写代码的人没那么多嘛 ,并且确实像 Cursor、Windsurf、Devin 其实都是在针对程序员 , 对吧 ?
但是地球上程序员毕竟只有那么多 , 对吧 ? 那更多的非程序员这种 knowledge worker, 就普通白领知识工作者 ,他用 Agent 干什么 ?
那么他的 Agent 我觉得写代码是必备能力 ,因为他只有靠写代码才能够在这个赛博世界去行动自如嘛 。
说到这个 , 想到这个我也是感叹我觉得行业发展很快 。 因为可能几个月前大家来聊这个 Agent, 还是会想到就是 coding 是一个方向 ,而且也有很多人在这个方向创业 。
那其实今天来聊这个就是对 , 我觉得你刚刚那个总结挺好的 , 就是是一个能写代码的 Agent, 然后它去干更多事 。
原来 Agent 是个专门写代码的 Agent, 现在是一个 Agent 它可以写代码 。
但是我顺便问一下 ,是不是名超频的新研一娃 ,他可能会是这个方向 , 就是一个能写代码的 Agent。
他还在就是探索 PMF 的阶段 , 我们投他也是因为他过去在 Kimi 检验的经历嘛 。 所以我觉得现在 AI 确实 PMF 变得很快 , 就是很多时候大家都需要探索 。
所以我们一般不会说他是做什么什么什么的 , 我觉得那样的话其实容易大家都陷入到一个把自己给束缚住了 。
你觉得做好 Agent 还需要哪些能力 ? 刚才我们其实已经聊到推理肯定是很重要的 , 还有更长期的可能是记忆的东西你怎么解决 , 还需要哪些 ?
对 , 我梳理一下, 就是我刚刚说到现在三大能力 : 推理 、 代码 、 工具使用 , 对吧 ? 然后再接下来记忆 , 然后 online learning, 就是怎么样能够持续的学习 , 学到新东西 , 对吧 ?
然后这里面其实这几个我觉得都是非常重要还没有解决的问题 。
记忆和那个 online learning 是还没有解决的 , 对吧 ?
就目前没有看到什么 , 至少没有看到一个指数级增长的 benchmark 的提高 , 对吧 ?
就是在 2025 年大家来做 Agent 这件事情 , 你觉得它更多是一个应用公司来做 , 还是本身我模型能力特别强的公司 , 像 OpenAI 做 Operator, 还有 Anthropic 推出这个 ComputerUse,是这种方式来做 ?
Agent 落地45:46
我觉得目前来看模型公司确实它自己能够去用 RL 去提升模型的能力 ,并且它能够用自己更强大的模型去对自己的模型做 Fine-tuning 的话 , 可能确实是有一定的优势 。
但是应用公司我觉得也有几个好处 , 第一个就是它可以用多种模型去混合 , 对吧 ? 用各个模型不同的长处 。
第二个我觉得还是一个用户心智 , 比如说你看 Perplexity 其实它一开始做 AI 搜索 ,其实它是占住了一个用户的心智 , 它其实用的模型在不断的升级 , 对吧 ?
你不断的推出新的模型 , 它就越来越好 。 都是用户认为它就是 AI 搜索的代名词 ,其实它反而可能比 ChatGPT 的搜索功能有更多的这个拥趸 。
然后 Cursor 我觉得也是个很好的例子 , 就是因为 Cursor 一开始大家也觉得你就是套壳嘛 , 你就是用这个模型嘛 。
但是它跟模型其实是个互相成就的过程 , 就是没有 Sonnet 3.5 的出现 ,Cursor 就不会那么火 , 它也没有实现它的能实现到预测下一步写什么代码的功能 。
但是如果没有 Cursor 的话 ,Sonnet 3.5 可能也没有一个好的载体变得那么火 。 因为你模型公司对于具体程序员怎么用这个模型 , 它不一定有足够多的时间精力去做这个具体场景的研究 。
所以我觉得确实现在出现了模型公司到应用公司的这个分隔 。 但是你会发现可能跟这个类比不一定恰当 ,但是比如说 Windows 是微软开发的 , 它同时也开发了 Windows 上最重要的应用之一 Office,但是 Adobe 就是另外一家公司 , 对吧 ?
对 , 它还有很多别的应用 。
对 , 所以你可能比如说 OpenAI 有模型 , 然后同时有这个 ChatGPT,但是还有别人在他们去开发 , 这可能也是一个 Office 部门和 Adobe 部门的这个关系 。
你刚才提到像 Monica 也是你们投的公司 ,他们做一些 Agent 的探索 ,他们就是基于别的模型或者开源都来做的是吗 ?
因为他们不做自己模型训练嘛 ,但是他们下周应该如果不 delay 的话 , 会发一个很有意思的 Agent 的产品 。
我们就觉得看到在这个里边 , 当你能够去使用模型 , 用模型去使用工具 , 然后通过一系列很巧妙的产品设计的时候 ,其实能够带来一些很不一样的体验 。
你刚才提到就是 Chatbot 这种形式 ,其实对第一个发现这个 PMF 的人是一种甜蜜的陷阱 。 那在 Agent 这种形态的应用上, 它可能会有陷阱的部分 , 我就是指它会分心你或者拖慢你去极致逼近 AGI 的那部分可能是什么 ?
好问题 ,Agent 我还没有想得太清楚 。Chatbot 我觉得也可能是 , 我觉得不一定是 。Agent 因为目前还处在探索的阶段 , 我觉得目前可能还不好说 ,但我有一个感觉就是如果你现在有个 AI 产品的用户量很大 , 那么如果你为了把这么大量的用户服务好 , 可能在模型的尺寸 ,在模型的能力上就会有一些妥协 。
简单来讲 , 比如说如果你现在用户特别多 , 那你模型比如说就不能很大 , 对吧 ? 或者至少说在中国因为大家觉得收费也比较难嘛 。
如果你免费给大量的用户提供一个比如说花很多推理成本的模型 , 那你可能就不划算 。 那这个时候可能你就会觉得模型我要做得更轻便一点 , 那更轻便的模型适不适合 AGI, 这个就是有冲突的 , 或者说是有阻碍的 , 对吧 ?
所以其实我觉得当 DeepSeek 有这么多用户的时候 ,其实很多人也在讨论是不是应该把这个用户给留住 。
我其实自己认为那个也是个甜蜜的陷阱 , 对吧 ? 那几千万 DAU 全世界各地各有各的场景 , 你要把它服务好 , 我觉得那个需要花大量的时间精力 ,不管从算力上 、 从产品设计上 、 从运营上 ,其实我觉得也会影响探索 AGI 的这个资源 ,因为毕竟资源不是无限的 , 对吧 ?
现在看起来他们好像并没有有意的去留住 。
我认为这是正确的 ,而且这样才能跟微信合作嘛 , 对吧 ? 如果他也想借助这个机会也做成个超级 App, 那微信估计很难跟他合作吧 。
其实我刚刚自己想到的有一个点 , 可能是多模态 ,但是我相信可能做 Agent 更相关的还是多模态的理解 ,而不是生成的那一部分 。
我觉得多模态其实肯定是很重要的 ,但是确实多模态现在对智能的提升没有那么快 , 就是因为语言是一个非常浓缩的智能 。
你把语言放在一起 , 肯定它先是一个智能提高最快的路径 。 如果语言被弄得差不多了 , 那一个图像 , 图像其实信息量很大 , 比如拍张照片 , 对吧 ?
就有很多信息 ,但这里面带来的智能其实很少 。 你得看好多视频才能形成智能 ,但如果你理解了这个牛顿定律 , 对吧 ?
你可能就几句话你就知道了这个定律 ,但是你看多少视频才能总结牛顿定律出来 , 对吧 ? 所以视频的话我觉得它很多时候会在具体使用上面 ,但是对于智能的产生 , 这个就是说现在可能它的压缩率还不够高 。
那那一段时间为什么大家都在训多模态的模型 ?
也分两种吧 , 第一种是像 Sora 那个路线 , 就是比如像多模态生成 , 我觉得这个它是有很明确的 PMF 的 ,因为全世界有这么多 , 比如说视频广告 , 现在有我们看到很多游戏的广告什么的 , 现在最近不是很火的什么做饭大橘猫 ,是吧 ?
一个橘猫在那做饭 , 挺搞笑 。 你会发现很多这些视频做到还 OK 就可以去变现了 。 那所以你有这样的一个商业模式 , 包括当时 Midjourney 也是嘛 ,Midjourney 都没有融钱 , 对吧 ?
它其实就实现了一个初步的 PMF。 所以这个东西它既然有 PMF,并且也有一些很 impressive 的效果 , 就会有人去做 。
现在 Midjourney 和 Sora 的 DAU 怎么样了 ? 掉了吗 ?
Midjourney 就是说可能应该还是挺不错的 ,但是应该肯定不是说第一批用户已经用上了嘛 。Midjourney 本来就没有了 ,他们本来就是自带干量嘛 。
然后 Sora 我觉得其实把可灵 、 海螺这些大家都按照它的技术方案都做得很不错 , 对吧 ? 现在反而看 Sora 就有点好像起了个大招 ,但是出来之后没有觉得很惊艳 。
但是昨天 Google 发的 VEO2, 我看还是挺惊艳的 , 应该是目前至少在单镜头的情况下是最好的视频生成模型 。
但是我觉得现在大家普遍也认为 , 就是视频生成好像在智能上并不是那么最重要的一个方向 , 可能目前还是在这个 reasoning 这个方向先去卷 。
但我觉得可能这也是一个 , 就是你目前看到有条路可以往前走的时候 , 可能很多人就会选择先走这条路 , 对吧 ?
所以我觉得在 AI 里面 , 我们反复会经历一个探索和奔跑交替的过程 , 就是当你遇到瓶颈的时候 , 你会发现之前可能一些分支的探索 , 看似没有目标的探索 , 可能会带来新的突破 。
但是如果现在一个很明确的方向 , 比如说两年前可能是 Pretraining, 大家越来越多的语料去 Pretrain, 然后现在可能是 RL, 就是更多的去做 Reinforcement Learning, 那你肯定是你要先提高这一方面的智能 。
所以我觉得在一个公司的角度来讲 , 一方面要有这种在直道狂奔 , 就是你这个大家都在这里赛跑 , 你要赛跑 , 同时可能也要有这种 Frontier 的探索 , 就是短时间不知道会发生什么 。
所以还是说大公司搞 , 美国就是 Google, 中国就是子界 。
对 , 或者美国有 OpenAI 嘛 , 就他们有些 Frontier。
所以创业公司根本没有资源支持这样这件事情 ?
我觉得也不能这么讲 , 就是说我觉得得看我们现在在哪个阶段 ,以及这个阶段会持续多久 。 就比如说如果现在这个阶段就是一个需要创新的阶段 , 那也许创业公司是有可能通过想一个不同的 vision 去避开大厂去停工 。
但如果现在就是直道狂奔 , 那谁有钱谁有卡 , 对吧 ? 那可能就会它就会更容易去往前冲 。 所以我觉得其实一直创业公司的长项都在于说做大公司没看到的事情嘛 。
但如果都已经明牌了 , 那肯定大公司就更有优势 , 对吧 ?
我们刚才在讨论 Agent 在 25 年可能会普及的时候 ,其实没有特别讲到成本这个维度 。 就成本降低是不是也是去推动 Agent 一个很重要的点 ?
当然 ,而且我相信成本降低一定会发生嘛 。 所以我有个基础假设就是我们先让它能做 , 再把它变得便宜 , 对吧 ?
因为变便宜这件事我认为肯定会发生 。 然后能力变强 , 当然也有人, 包括我也觉得肯定会持续变强 ,但是中间遇到瓶颈 , 遇到卡点也是完全可能的事情 。
所以我觉得还是得先有 , 然后再变便宜 , 或者说先能用 , 再变得好用 , 然后再变得便宜 , 对吧 ?
那如果你能用都还没做到 , 那可能便宜就还谈不上 。 并且我觉得在中美确实这个落地的难度也不一样 ,因为美国现在确实人工成本很贵 , 对吧 ?
大家天天看到它的就业就很紧嘛 , 大家都是很多职位招不到人。 所以对他们来讲 , 比如说 Devin 当时的定价是一个小时的工作大概是几美金 , 咱们可能觉得贵 , 对吧 ?
我用它就要花钱 。 但是对于一个美国公司来讲 , 美国加州的平均最低工资是 16 美金 , 就是你找个人去麦当劳工作都得 16 美金一个小时 。
时薪 ?
时薪 16 美金 , 对吧 ? 那我一个 AI Agent 一个小时才 6 美金 、8 美金 。 第一 , 很便宜 ; 第二 , 它一年之后会变得更强大 , 同样的价格会变得更便宜 , 对吧 ?
所以这个事在美国这种习惯了为企业服务付费的环境下是合理的 , 我觉得 。 包括我现在我也是 GPT Pro 200 美金一个月的订户 , 我觉得太划算了 ,因为它可以让你做 100 次 Deep Research, 每次 2 美金 。2 美金我让我的实习生做 , 我不能半夜 2 点让他 5 分钟之内给我一个报告 ,他给的报告质量基本上就没他好 。
所以我天天跟我们实习生讲 , 我说你们如果只是收集信息 , 搞一个似是而非的报告出来 , 可能真的不如人家 2 美金一次 , 对吧 ?
这个比你干得好很多了已经 。 这个 William Gibson 说过一句话嘛 , 就是未来已来 , 对吧 ? 它只是没有均匀分布 。
我觉得现在用到前沿 AI 或者去用好的人 ,他对于这个未来的想象和可能很多人还是第一次用到 Chatbot, 甚至还没用过 Chatbot, 我觉得这个分布是非常的不均匀的 。
所以可能我确实就觉得在这种文书工作 , 或者我们大量的同学做的就是这种在电脑前面咔嚓咔嚓去查个什么东西的这样的工作 , 确实 AI 替代人不是一个想象的已经在发生了 。
那你觉得在 RL 之后, 就是带来这个解锁 Agent 的这个强化学习之后的下一个的技术范式可能会是什么 ?
再往下的话 。
我觉得首先我觉得 RL 可以走很远 ; 第二 , 我觉得接下来可能有一个很重要的是发现新知识 。 就是其实在 Anthropic 它的创始人 Daryl 写了一篇文章叫 《Grease Machine》, 全称是不是这个 ?
就是他提到说接下来进一步就是 AI 怎么样能够发现新的科学发现或者新的知识 , 对吧 ? 这个好像也是在那个 OpenAI 的 5 级分类里边最高级的一级吧 , 还是哪一级来着 ?
第四级吧 , 它第四级是 Innovator, 就是创新者 。
创新者 , 对 ,因为大量的科学发现其实都是先去想 , 然后去做实验去验证 , 对吧 ? 现在想这个方向 , 那其实 AI 可能已经做得很好了 。在验证端 ,有的时候需要去观察 ,有的时候要去做一个物理实验 、 化学实验或者是医疗实验 , 所以这个上面可能会有一些限制 。
但是如果我们能找到一个方法 , 大规模的去并行进行实验 , 去验证一个 AI 提出的假想是不是正确 , 对吧 ?
包括说这里面可能也有一些像数学定理什么的 ,是可以通过纯思考去产生新知识的 。 那么在这一步上来的话 , 那其实可能 AI 就进入到了一个我们俗称左脚踩右脚 , 对吧 ?
它产生了新知识 , 它用新知识去改变 , 又学到更多的知识 , 可能就形成一个迭代自我进化的过程 。
但我觉得那个时候可能它诞生的产品形态可能又不一样 , 比如可能真的很多大佬就问我什么时候能发明长生不老药 , 然后我说这可能都是大家赚很多钱之后的共同目标 , 可能都不是说要 Agent 干更多活 ,而是说给我来个长生不老药 。
但是这里边肯定会解决人类很多大的问题 , 比如说你癌症的 cure 是什么 , 类似于这样的问题 。
还可以帮 AI 自己解决能源问题 ,是不是 ?
对 , 能源肯定也是一个重要的 boundary, 对吧 ? 比如现在大家就开始探索核能 ,其实原来大家对能源没有这么高的需求 ,因为算力是有指数增长的 , 电力其实没有 ,但算力跟电力挂钩之后, 然后你就发现它也要指数增长了 。
所以大家就开始找各种的液冷 、 供电 、 核能这些东西 。
对 , 我觉得在想 AI 它变得更聪明之后, 它自己可能也能发现一些更高效的利用能源 , 甚至去解决了 50 年还没解决的可控核聚变的这种问题 , 它闭环了 。
对 , 就是完成人类能完成的任务 ,但很快就到了人类解决不了任务的时候 。其实就跟李世石当时不是有一个叫做 Move 37, 第三十七首 , 神之一首 , 就是人类不知道怎么想出来的 , 对吧 ?
但是你只要人类能去 verify 这个结果 , 就是我不知道怎么来的 ,但是我发现这 it works, 这个东西可用 , 那可能就会带来很多新的进步 。
那你觉得就是你刚才说的下一个阶段 , 就是怎么去发现新知识 , 这个现在业界或者学术界有一些苗头吗 ?
比如 AlphaFold 肯定是一个这样的工作嘛 , 就有一些已经有的成果 , 它是这个方向上的 。AI for Science, 比如我们之前投的金泰也上市了 , 就是 AI 找新药 , 这肯定是一个大家都在用的 。
蛋白质怎么折叠 , 这个靶点 ,但是这个其实也后来在你找到了一个新的潜在的靶点 , 你还得把它做成药去做临床实验 , 对吧 ?
就这个过程目前看怎么加速 ,但可能还是需要有一系列的合规 、 这个实验的 。
开源格局58:19
刚才我们主要讲的就是这个推理能力的提升 , 包括使用工具能力提升 , 这些带来的 Agent 这个变化 。 然后我觉得还有一个肯定对现在的格局影响很大的 , 就是 DeepSeek 的大出圈这件事本身也带来一个很大的影响 , 还有它就是非常彻底和一贯的这么一种开源的方式吧 。
对 。
这个我觉得我们可以分几个层面来讲 , 一个就是大的科技公司 , 首先有那些本来就闭源的大的科技公司 , 现在也是有很多动作嘛 , 比如像腾讯 , 像百度它是接了 DeepSeek 的 ,而且腾讯是接了很多产品 , 它 AI 主力产品元宝也接了 , 然后最大的国民级的产品微信也接了 , 它大概有十几个产品都接了 , 然后百度可能是文心接了 , 然后阿里像字节是
没有接 。 那三羽桑你觉得豆包什么时候会接 DeepSeek?
我觉得首先我跟字节没有任何关系
,但我会觉得很意外如果豆包选择接 DeepSeek,因为我的理解是字节它是非常想要去探索智能前沿的 , 它会非常注重自己技术模型的研发 。
所以如果接入 DeepSeek 的话 , 可能不管是从对外形象和对内士气上, 可能都是一个挺大的变化 。 但我觉得从另外一个角度来讲 , 如果豆包的用户觉得 DeepSeek 更好用 , 对吧 ?
那也许从豆包用户的价值来看 , 可能这也是合理的 ,但我想这肯定不是字节做 AI 这件事情它的初衷吧 。
据我所知 ,他们还是要做 AGI, 想要实现 AI 的全面领先 ,并且他们的人资源这些确实还是非常非常丰富的 。
那腾讯呢 ?
我们这都是小道消息 , 毕竟我们作为一个天使投资人也没有办法获得他们决策层的这些想法 。 但因为之前有人说腾讯做视频也是后发先至 , 对吧 ?
那让你先跑三年, 我这个微信的用户这么多 , 我始终能把它调动出来 。 那么之前就听说腾讯好像在模型上确实也是一种后发制人的想法 ,因为我有用户的关系 , 我有用户的数据 , 我的微信你始终要用 。
那么当模型这里面出现一些技术的收敛或者说技术成熟之后, 我再接入 ,并且它确实是一个用户的基础设施产品 , 所以它也不能够做特别大的调整 , 对吧 ?
这肯定也会带给用户带来很多影响 。 所以我倒是觉得腾讯接 DeepSeek 这件事 , 让我觉得是要给腾讯点赞 ,因为我听说是 AI 搜索这个事其实已经是在去年就开始推了 ,但是接 DeepSeek 这个决定肯定是来自于最高层 , 甚至 Pony 自己的决定 , 对吧 ?
但我觉得这个对于它的用户来讲是好事 ,因为听说接了 DeepSeek 之后, 它的很多产品的那个数据都涨得很好 , 可能是两位数 。
我觉得从 DAU 的角度 ,again,因为它现在很多人点微信的搜索 , 下面就出来一个下载使用了 DeepSeek R1 的元宝 , 那这个导量肯定是无与伦比的 , 对吧 ?
所以元宝现在是 APP Store 第二名 , 我觉得明天可能就第一名 , 这个非常正常 。
所以我觉得腾讯真的特别聪明 , 它节奏感真的太好了 。 而且元宝用 DeepSeek 是比较稳定的 , 它不会你问几次它就服务器繁忙了 。
因为他们之前买了很多卡 , 之前还真的不知道卡用来干嘛 , 现在突然发现这些 inference 都可以做了 。
当然听说最近也都在加单 , 所以腾讯具备这样的基础设施能力 , 对吧 ?
所以你觉得这是腾讯的选择吗 ? 它选择在自研大模型上不那么激进 , 它略慢一筹 ,但是它知道有人会做出更好的模型 。
那时候我只要激进的去接 ,因为我有微信这样的大杀器 。 你觉得这是一个它当年就设定好的主动战略路线吗 ?
我听说是一个主动选择的战略吧 ,但我同时也听说凡能混元也在大幅招兵买马去扩展自己的团队 。
所以从过去中国互联网的经验来看 , 很少出现这种大厂完全依靠第三方来提供自己关键基础设施 ,而不是自己做的 。
所以一方面我觉得腾讯现在这个决定非常的厉害 ,也许是一个新时代的开启 ,因为在美国有很多这样的例子 , 对吧 ?
比如说 Netflix 一直用 AWS, 虽然亚马逊有 Prime Video 是它的直接竞品 ,但是 Netflix 仍然是觉得 AWS 是它商业上 、 技术上最好选择 。
但中国以前其实都是你有支付宝我就要有微信支付嘛 , 所以一直是我要有一个我自己的东西 。 现在 DeepSeek 我觉得肯定是一个很中立的选择 ,因为他们团队也不是要发展一个超级 App,也没有想要去做 QC。
我觉得这是 McConn,他知道梁文锋他对于做一个大 DAU 的产品没那么有兴趣 。
是的 , 所以我觉得他们至少现在目标是很确定的 , 所以大家合作也是有这个基础的 。 但腾讯会不会一直不想要一个自己的大模型 , 我觉得这个都很难说 ,因为技术的变化很快嘛 。
就像之前大家说微软就靠 OpenAI, 后面好像说微软也得想自己熏一下, 甚至微软也去投资 Anthropic, 对吧 ? 所以这其实我觉得都有可能发生变化 。
但我觉得这边最核心的还是说 , 谁能够持续的保持在 Frontier。 我觉得其实我们在过去这两年多时间内看到已经有很多说要做基础模型 , 又要挑战智能的已经逐渐在掉队 , 这也合理 ,因为这件事情就是需要人才 、 钱 , 然后很多的这个创新 。
所以你刚刚说有资格做这件事的大公司只有字节 ,有资格做这件事的创业公司现在只有月之暗面 。
如果说从拿 VC 钱的创业公司 , 我觉得原来说的 AI 六小虎 , 对吧 ? 这里面我们看下来确实目前只有 Kimi 在人才 、 在团队 、 资金和用户上具备持续冲击 Scaling Law 的能力 。其实包括最近 OpenAI 最新发表了一篇 paper 里面也是同时 refer 了这个 R1 和 K1.5 的工作嘛 。
包括今天中午你们来的路上,Kimi 又发了 Moonlight 一个最新的开源小模型 , 就是我觉得这里边能够持续的对这个技术社区做出贡献 ,其实这是一个对团队本身的能力以及团队的方向都要求挺高的事情 。
就说到 OpenAI 的论文同时 refer 了 K1.5 和 R1,其实这两个成果发的时间也非常接近 。
同一天 。
同一天 , 对 , 就是在同一天 ,1 月 20 号左右吧 。 你怎么看 , 就是实际上我当时刚发之后, 我去找一些技术社区的人聊 , 我觉得那会儿大家给我的反馈 K1.5 和 R1 之间它的认可度没有差别那么大 ,但是最后它实际上的整个影响力的差别是非常大的 。
对 , 我觉得这面开源还是一个关键差异 , 对吧 ? 确实 DeepSeek 的 R1 它有些工作 , 包括像 Zero, 确实它的这个意义很大 ,并且当它开源 , 同时大家都可以使用之后, 确实尤其在西方引起了很多的这个反响 。
本来我觉得硅谷在过去的几年持续大家在质疑说 Pre-training 花了这么多钱是不是值当 , 然后在去年年底 , 如果大家记得的话 ,Ilya 其实也提出来说 Pre-training 撞墙了 。
所以大家其实至少从二级市场投资人这边陆续就有在担心是不是我们花的钱太多了 , 结果突然横空出世说咱 5 个 million,500 万美金就能训一个这个 O1 级别的模型 。
当然这是个误读 , 对吧 ? 因为那是它最后一次训练的结果 , 论文里写得很明确 , 对吧 ? 但是就是有人要搞个大新闻 , 所以在美国首先引爆了大家的担心 , 导致 1 月 27 号英伟达暴跌 16 个点什么的 。
所以当这个事情变成了一个全球新闻的时候 , 那这个影响力肯定就不是 Kimi 这种单纯的一篇 paper 或者是一个技术创新能比的 , 对吧 ?
其实有反正跟 DeepSeek 很熟的同学就跟我说 ,他们其实认为美国 OpenAI 或者 Anthropic,他们去训一个 V3 这样级别的模型 ,他们甚至都不需要花 500 万美金 ,因为人家有更大的集群 , 更多的训练经验 。
但是确实这个叙事当时很多不是那么懂行的人就变成了说 500 万跟别人融了 10 亿美金去比 ,但是现在大家陆续都知道了这个事好像不是那么比的 。
所以你看英伟达股价又快修复了 , 对吧 ? 也最后引发特朗普来评论的这件事情 , 那确实就出圈了嘛 。
但是第一方面就是说在训练这个成本上, 真的行内人并没有觉得 500 万那个数有多么的吓人, 对吧 ? 大家可能更多关注的是比如说像当时 MLA 这种降低推理成本的创新 。
第二 , 模型的智能提升和模型训练与推理的成本下降 , 这个是始终在发生的事情 。其实我们看到比如说 GPT-4 的 API 出来之后, 已经下降了 90% 多的成本 , 这件事情在今年肯定又会降 90% 多 , 这件事情是肯定会发生的 。
芯片会变得更强大 , 大家会找出来更多可用的降低成本的优化方式 。 所以我觉得现在大家首先关注的还是说你智能能不能往前走 , 只要你智能能往前走 , 成本一定会下降 ,而且是一个非常快的速度下降 , 可能每年降到原来的 1/20, 甚至是 1/10 的速度 。
所以我觉得对降成本大家并不是那么担心 , 至少在美国大家相信这个曲线一定会发生的 。
所以降成本其实是在一个轨迹里的 。其实后来 Anthropic 的创始人 David 他不是写了一篇非常长的文章吗 ? 他虽然后面最后的他的落点是说我们要那个进 GPU 什么的 ,但他前面的分析还是挺充分的 , 就是说他其实这个降本是在一个大的行业的曲线上 。
对的 , 对的 , 包括说智能提升嘛 。 当然那篇文章后来就有点气急败坏了 ,但是我觉得他对前面技术的分析是挺对的 ,因为他们对于 Sonnet 的对齐 , 从他的说法来讲是经历了很长时间的 ,因为他们很强调安全 , 强调这些 , 对吧 ?
那么确实 Sonnet 甚至都不是个 reasoning model, 所以他们确实还是挺厉害的 。 听说他们马上也要发 Claude 4 了 ,但我觉得这也是 DeepSeek 带来的好处 , 就是链鱼效应 , 对吧 ?
来了一个又很厉害 , 然后又要这个开源的选手 , 所以大家就不得不动得更快了 。 我觉得这确实是一个好处 。
而且我觉得 DeepSeek 其实回过头来想还是有一个很好的点 , 就是它是一个全新的应用 , 所以它一上来其实就是一个 R1 加搜索的结合 。
所以确实 DeepSeek 它是从一个白纸去做一个新的产品 , 这其实也是很大的一个特点 。 然后还有一个特点我后来也才意识到 , 就是大家在训推理模型的时候 ,reasoning model 的时候 ,其实对标的都是数学和编程能力 。
包括我们看大家发的 paper,不管是 DeepSeek、OpenAI 还是 Kimi, 都是拿的 AIME、Math、LangCode、Bench 这些去对标 。 但是 DeepSeek 出来之后出圈的反而是它的文笔 。
是的 。
它的这个文笔听说也是 DeepSeek 做了一些专门的对齐工作 , 甚至有说找了一些北大中文系的人去做这些标注什么的 。
因为当时我们看到之后第一反应就说 , 它说的话好像有点特别天马行空的想象 , 对吧 ? 大家现在可能也知道的就是动辄量子力学 , 然后上升到非常天马行空的角度 。其实这个对于 OpenAI、 对于 Kimi, 包括豆包来讲 , 我觉得他们反而可能在之前是要避免的 ,因为大家训模型就是怕模型胡说八道 , 对吧 ?
就是怕 hallucination。 但是我觉得 DeepSeek 一方面它可能有意的去做了文本上的对齐 , 另外一方面它毕竟它之前的定位是一个 research lab, 所以它其实并没有可能对于所谓的中立性这些 truthfulness 进行很多的微调 。
所以它发出来 ,但是大家就直接去用了 。 所以这个特性反而变成了一个好的特性 。 我们看到很多传播其实都是来源于大家发现它的那个回答特别有创意 , 或者它的思考过程特别有创意 。
所以我不知道这是不是阴差阳错 ,但是这个在事实上也会导致它传播力更强 。
你跟圈内人聊 ,他们觉得这是阴差阳错吗 ? 就他们是有意训的写作能力吗 ?
我听一些人说他们可能确实在上面是有加强 ,但也有人认为可能这是一种对齐不够充分的结果 。
是无心插柳导致的 。
对 , 所以我觉得这两种都有可能 。 确实我这个没有确切的答案 ,但是我觉得从结果来看 , 这个其实是让出圈一个很重要的原因 。
因为真拿它做数学题的人其实也没那么多 , 对吧 ? 大部分人其实还是我看有人拿它算命 , 可能就发现它说出来的结果让大家觉得好有道理 。
还有就是 MBTI 测试 。
MBTI, 对 ,其实这些都不是大家觉得一个什么冲击 AGI 的这么一个前沿模型需要做的事情 , 对吧 ?
你跟字节或者 Kimi 的人聊过吗 ? 他们怎么理解这个问题的 ?
对 , 我刚才说的就是有一些人认为这是一个刻意追求的结果 ,也有一些人认为这是一种对 , 就是因为大家也都是从观察的角度去推嘛 。
包括有一些各种各样的信息 ,但可能也不是一手的 , 或者说不是确切的 , 对吧 ?
相当于它的一个可能由于没有充分对齐导致的 , 你可以叫不足吧 , 它变成了一种 feature, 就大家反而觉得那个东西非常好用 , 非常喜欢 。
当然这个也不是为 Kimi 打广告 ,但是确实我跟驰霖最近在聊 ,他就说其实 Kimi 的用户也一直在涨 , 现在也一直是新高 。
因为有人就发现好像在工作中, 尤其你需要有一些准确性的时候 , 好像 Kimi 它还是更加准确一点 ,因为做了更多的这个防止胡说八道的措施 , 对吧 ?
所以他们就说好像干活用 Kimi, 然后如果要聊 MBTI 或者算命这种需要创造力的 , 那可能 DeepSeek 它的确实天马行空 。
我自己也这么觉得 , 所以我今年写新年祝福都用 DeepSeek 写的 , 就感觉 Kimi 的写的新年祝福就是一个理工男 , 那 DeepSeek 那个可能就有点脑洞大开的感觉 。
我觉得再往下大家关于 DeepSeek 比较好奇的也是它到底怎么赚钱的这个事情 。 包括刚才我们也聊到像腾讯还有百度 , 还有很多大小公司都接了 DeepSeek。
不过我理解它实际上是不会直接从这个动作里赚钱的 , 对吧 ?
如果你只是用它的模型 , 它已经开源了嘛 。 但是 DeepSeek 显然现在直接能赚钱的就是卖 API。 它的 API 我听说是有毛利的 ,因为本身他们的自己在推理上做了很多 infer 的创新 , 所以他们去 serve 自己的模型 , 可能就比另外一家公司去 serve 自己的模型 , 它要成本更低 。
现在很多人都想用它的 API, 它现在其实面临的是它的算力不够的问题 ,因为它还要去做训练 。 所以它目前好像我不知道现在会不会恢复 , 前一阵子它其实关掉了它的 API 充值入口 , 就是说你都不要给我给钱了 , 我服务不过来 , 对吧 ?
那这个那不就是商业模式的体现嘛 。 不少人就说能不能我付钱给我个稳定的版本 , 这个就有点像 GPT Plus, 对吧 ?
这种所谓订阅制 。 所以其实我一直认为技术革命的早期 ,不要太快的去用成熟期的标准去要求商业模式 ,而是首先用技术给用户和客户创造价值 , 然后从这个价值中提取一部分作为你的收入 。
这个事情我认为迟早会发生 ,但是要有一些耐心 。
这个事情你是在 2024 年就有一个很清楚的认知 , 还是 DeepSeek 这个叫冲击波也好 , 叫这个启示也好 , 之后有了一个更清楚的或者更坚定的这样一个想法 ?
我觉得也是不断的去学习吧 。 因为我们 80 后其实我入行的时候已经是移动互联网逐渐在开始 , 或者互联网的已经开始下半场了 。
所以在最早期 , 比如说 90 年代那个时候 , 我那时候也是互联网的用户 ,但那个时候没有思考那个商业模式的问题嘛 。
所以但我觉得就要经常以史为鉴去想想看 , 当时为什么很多互联网的早期公司 , 它其实都是技术很强 ,在当时的角度看技术很强做出来的 。其实复盘一下, 当时 Google 遇到的第一个问题也是它用 PageRank 这个新技术打造了体验好 10 倍的搜索引擎 , 所以用户非常的自发传播 , 用户很喜欢 。
但是那个时候它其实不知道怎么赚钱 ,因为一开始 Google 就是说我没有广告 , 我很清爽嘛 。 所以当它 98 年上线 ,02 年纽约时报有篇文章 , 就说 Google 最难搜索的是它自己的商业模式 , 就是批评它没有商业模式 。
但是后面大家也知道了 , 它在 02 年开始逐渐的发现了 AD Word 和 AD Sense 这两个商业模式 , 就是它 04 年上市 , 成为了现在最好的印钞机嘛 。
所以这是个很好的例子 , 就是你要上来问它商业模式是什么 , 它其实也不知道的 。 但是它首先是来源于一个技术突破 ,有这个技术突破打造了好的产品 , 然后好的产品最后把这个价值给变现 。
所有的技术突破都会有这样一个水到渠成的过程吗 ? 还是我们是幸存者偏差 , 我们只是看到了那些后来取得了很大商业成就的技术突破 ?
那当然不可能所有的技术突破都能最后导致赚钱 , 对吧 ? 但是我是觉得我们要看技术突破在哪个周期 。
我还是那个观点 , 就是现在是一个技术变化斜率很陡峭的时候 , 那这个时候如果你要拿现有的技术逼它去变现 , 就是我经常打个比方 , 让一个天资非常出名的高中生去赚钱 ,他可能就是赚不了什么钱 ,他也只有去搬砖 。
但是你多培养他 , 等他成为一个博士生的时候 ,他就可以赚大钱 , 对吧 ? 所以我觉得如果技术已经到了平缓期 , 比如说可能移动互联网 5 年前的技术跟现在没有特别大的区别的时候 , 那这个时候就是商业模式百花齐放的时候了 。
我再举个例子 ,不只是 Google,Facebook 在出来的时候 ,其实也是它提出了一个非常前沿的产品 , 所以引发病毒传播 。
但是那个时候大家也不知道 Facebook 怎么赚钱 , 它尝试过放一些 banner 的广告 , 尝试过一些本地的广告 , 后来它又做了一个它们的游戏中的广告 ,其实这些都没赚什么钱 。
直到 2012 年, 它把这个 news feed 从时间排序 , 就是微信那样的排序 , 改成了按照推荐排序 , 形成了所谓的信息流推荐 。
你只有做推荐的信息流排序 , 你才能抄广告 , 对不对 ? 所以它 12 年上的 news feed ads, 就信息流广告 , 同年上市 。
当然信息流广告现在也是超级硬超级字节的核心商业模式 ,但 Facebook 是在 05 年上线的 , 它信息流是在 07 年上线的 , 然后它的推荐信息流是 12 年上线 , 同时找到它的真正商业模式 , 这也花了 6-8 年的时间 。
那个时候它一直是一个用户很喜欢 ,但是商业模式不清晰的公司 。 所以伟大公司往往都经历过这个阶段 。
你觉得字节会开源吗 ?
首先我觉得开源是不是每个人都要做的 。 我觉得首先你要领先 , 你开源可能才有价值 , 对吧 ?
你开源一个不咋地的东西 , 那只是为了开源而开源 , 那没啥用 , 对吧 ? 所以我觉得首先要领先 , 或者至少要搜塔 , 要有对世界有增量 , 你开源才有意义 。
第二我觉得可能开源的一个弱一点的形式就是免费 , 对吧 ? 就是免费加领先 , 我觉得其实就很厉害 。
是不是一定要开源 ? 我觉得这次其实可能 DeepSeek 有一个很重要的甜头 , 就是开源导致西方很关注 , 美国很关注 , 美国很关注 ,在美国引起大新闻之后, 那回国大家就更加觉得好 , 对吧 ?
因为让美国人破防了 。 但是这个是不是大家都想需要这样一个效果 , 对吧 ? 当然开源比如说也有很好跟微信合作 , 这肯定也是一个开源 。
但是我想这个事情还不只是开源 ,是你这公司得坚持做这件事情 。 比如说假设豆包现在开源 , 微信会接吗 ?
我估计也不会接 。
对 ,因为 DeepSeek 最开始的 LLM 那个版本就是开源的 。
对 , 所以这个不只是开不开源的问题 。 假设豆包现在跟 DeepSeek 一样厉害 , 然后开源了 , 微信也不会接 , 千问我估计也不会 , 对吧 ?
不是说他们能力不行 ,是说你在阿里和字节里边 。 所以我觉得梁文锋他们 DeepSeek 不只是因为开源 ,而是他们坚持开源 。他们这个市场定位是一个对大家没有感到威胁的定位 。
对 , 坚持开源 ,而且它是中立的 , 没有拿过某个大厂的特别多的投资 , 或者说它其实就没有什么外部投资 。
没有投资 。
然后最近有一个变化 , 就是 OpenAI 它也在考虑开源嘛 。Sam Altman 他发了一个推特 ,他就是给了大家两个选项 , 一个是说可以开源 o3 mini, 还有一个是可以开源一个 phone size 的 model, 就是一个在手机端侧上可以用的模型 。
你比较期待它开源哪个 ?
当然我觉得开源哪个都很好 ,但是我肯定是对 o3 mini 更加感兴趣 。 因为我觉得目前在端侧的模型呢 , 可能它的用途还不是那么大 。
目前大家更需要的是在智能的前沿进行突破 。 那么 o3 mini 是一个很强大的模型 ,o3 mini 在经过比较长的推理时间 ,也就是现在 ChatGPT 里面的 o3 mini pro,o3 mini high 模式下 ,其实它的表现是很好的 。
那么如果一个这种级别的模型能够开源 , 大家能够知道它是怎么做出来的 ,以及它的一些特点 , 我觉得对大家会有非常好的一个价值 。
并且听说这个模型也不大 , 所以这可能对大家在模型训练和应用中也会有很多借鉴意义 。
你听说它是多大 ?
听说它是 3.7B 的大小 , 这个确实让我觉得有点震惊 ,因为好像确实有点太小了 。 我的意思是它每次激活是 3.7B, 这个还是几个也是比较靠谱的来源吧 。
但是这个尺寸的话 , 意味着说他们确实能把一个很大的 o3,o3 应该是挺大的 ,但把很大的 o3 变成一个很小的 o3 mini, 然后在 o3 mini 经过更多的思考时间 , 然后得到很好的结果 , 这个其实是蛮厉害的一个工作 。
它激活是 3.7B, 所以 o3 mini 本身也是个 MoE。
应该是 , 对 。
他们之前其实分享过自己不开源的顾虑 ,他们认为开源会削弱竞争优势 , 比如说给 Google 可乘之机 。
所以我觉得梁文锋很伟大呀 ,他确实把很多秘密告诉大家 , 大家都可以变得更好嘛 。 但这个确实可能从一个纯商业公司的角度就会有很多担心 。
毕竟他们之前还有一个担心 , 就是我说 OpenAI 的担心是担心强大的 AI 被坏人利用嘛 , 这可能也是一个很合理的担心 。
对 , 所以其实我觉得并不是开源就一定是正确的胜利的 。
我觉得 DeepSeek 开源的这个热度 , 如果字节你问它 , 它会希望这样吗 ? 我觉得可能也不一定吧 。
太热了 。
因为比如说你会变成美国加强 。
而且对于我们来说 , 它顾虑的东西要远远多于 DeepSeek。
是的 , 所以我觉得 DeepSeek 一方面它确实定位就是开源 , 第二确实我就问它之前肯定也没有想到自己会这么火嘛 。
就是它现在肯定处在一个非常敏感且重要的位置 , 对吧 ? 不管是中国 、 美国还是行业 。
你觉得 DeepSeek 对那种本来就在开源生态里面想去主导的 , 像 Meta、 像阿里这样的公司 ,因为他们一直也都是开源的 , 它会有什么影响 ?
我觉得肯定是一个激励吧 , 就是大家发现来了个更卷的人。 原来其实开源社区我觉得还是一个 ,他们开玩笑叫赛博佛祖嘛 , 对吧 ?
就是你真的是对大家去做一个有点像做慈善哈 。其实原来不管是阿里还是 Meta,其实都是大公司把算力拿出来给大家 , 迅速模型给大家用 , 对吧 ?
带动整个行业的发展 。 但是现在来了个进步更快 、 更开放的 , 那肯定对大家都是一个压力和激励吧 。
但确实我觉得 DeepSeek 的这个中立性是一个比较独特的位置 。 所以 Perplexity 也可以用 , 那腾讯也可以用 , 那其实千问 Perplexity 也没用 , 对吧 ?
这还不只是因为它的能力问题 ,是它的这个屁股坐在哪的问题 。
我插一个问题 , 就苹果在大模型领域做了啥吗 ?
他们的团队人也挺优秀 ,并且也做了挺多的模型的训练这些 。 但我听说就是他们想做端云混合的 Agent,但确实他们有点像微信哈 , 它也是我反正用户都在我这 , 我的这个入口都在我这 , 所以我可以慢一点 。
但我这用户量这么大 , 品牌价值这么高 , 所以我不能轻举妄动 。
没有任何新闻报道它在做大模型吗 ?
他们有在训大模型 。
有做机器人吗 ?
据我所知 。
他有做一个桌面的 。
对啊 , 据说有做一个桌面 ,但人形的据我所知应该没有 。 当然微信 Pro 打破了这个啊 。 我认为苹果之前很擅长的是它做一个技术周期已经相对验证完善 , 就它不做那种技术验证型的产品 。
因为它做的产品都是那种这个技术本身已经逐渐完善 ,但是我通过极致的设计 、 极致的体验 , 把它的那个成熟期的全占掉 。
包括耳机也是 ,iPad 也是 , 对吧 ? 这个 iPhone 也是 ,但微信 Pro 确实不是 。 微信 Pro 确实是有一种很探索性的产品 , 包括 Apple Watch 也是 , 之前有一些各种 Watch。
所以我觉得苹果它确实是一个后发制人的公司 ,在过去 。 所以跟腾讯有点像嘛 , 我说 ,并且确实它的用户对它有非常强的稳定性的需求和品牌的信任 。
就我买一个苹果的东西 , 我希望它是用户体验非常成熟完善的 ,不会很 bagging 一会这样一会那样 , 对吧 ?
所以我觉得每个公司有自己的定位 。他们显然是从 Google 应该是还是有很多其他的人才 , 反正去了苹果 , 然后他们显然也有很多算力能够去模型 。
但对他们来讲 , 发布一个我的模型目的是什么 ? 他们肯定端侧上是有一些自己的这个小模型的这个事 。
对 , 苹果最近不是也和当然最后选择阿里啊 , 就和 DeepSeek 也是有沟通合作什么的 。
他聊了很多 ,Kimi 也聊过 , 对 。 我觉得从苹果的角度选阿里也很好理解吧 。他肯定要选择一个服务能稳定 , 能够很好的应对大规模用户量 , 能够有不管是 infra 还是服务还是技术业经验的 。
对 ,其实阿里在这一轮中还是比较开放的 。
千问确实做得非常好呀 。其实千问因为它跟 Llama 也挺兼容的 ,并且它的这个产品模型也很好 , 更新也很频繁 , 所以其实很多开发者还是用千问的 。DeepSeek 其实 R1 在用的时候因为有很多幻觉 , 所以用它做应用的话 ,其实很多时候并不一定是最好的选择 , 说实话 。
就是在 DeepSeek 这么这么全民爆火之前 ,其实在海外的技术圈 , 我觉得 Kimi 就是千问和 DeepSeek 它的这个影响力是比较相当的 ,因为他们两个也都是开源的系列 。
确实我们一个复盘就是 , 当你 Kimi 你不管你 Benchmark 再好 , 如果你对别人不开放 , 你不能开源使用 , 然后你也不提供海外的这个应用服务的时候 , 那确实海外确实没人能做 。
这个你们之前怎么讨论的 ? 为什么 Kimi 不开源 ?
我觉得哪怕在现在 , 我也不认为开源是一个必须要做的事情 。 像我刚才说的一样 , 就是我觉得开源是某些情况下公司的一种选择 , 比如说这可能是说你没有保密竞争压力 , 你没有融资压力的情况下 ,并且现在你是看到了一个事后的结果 ,因为开源再加上一系列因缘际会导致 。
对 , 它有些偶然性因素也在 。
完全有另外 100 个平行世界是 DeepSeek 开源了 ,也很多人喜欢 ,但没爆 。
对 ,其实我觉得这里面有几个偶然性事件 , 包括年底的时候一堆人在那开达沃斯会议 , 对吧 ? 然后那些人聚在那被采访了 , 然后后面又是春节 , 春节又是一个本来就比较容易在中国就是会爆的一个东西 , 然后国外也是同步差不多关注到这个东西 , 还有英伟达的那个大跌 。
对 , 所以我觉得开源其实不是这里面必备项 。 当然我觉得开源人很厉害 , 我觉得非常值得尊敬 ,但是一家商业公司其实核心点还是说你能不能创造用户价值 , 最后把用户价值变成商业价值 , 对吧 ?
所以我觉得开源不是这里面必经路径 , 这是一条很有意思 , 一条很创新的路径 。
但今天所有探索 AGI 的公司都不会以用户价值作为核心的 。
我觉得不会 , 都是技术价值 。 我只是说在技术增长期的时候 , 技术价值的提升才能带来用户价值 。
所以我觉得这里面搞技术的前沿的探索是非常关键的 。 这个可能在过去我觉得因为大模型出来之后, 大家可能就涌现了一批所谓比较务实的投资人或者是创业者 ,他们说我就拿现在的技术去赚钱 。
但是我觉得 Kimi 肯定是在另外一波里面 , 就是说我要让技术的 frontier 去提升 , 然后通过这个还是回到我们开头那句话 , 打造出来魔法般的让人惊叹的产品体验 , 同时最后来获得商业价值 。其实 Kimi 是 23 年火的呀 , 它为什么那个时候火 , 很重要的原因是因为它是第一个把 Chat 和搜索和长文本结合起来的 。
大家如果去想 , 当时其实 ChatGPT 是不能搜索的 , 然后 ChatGPT 对于长文本 、 多文本的多文件的处理其实也不够好 。
所以 Kimi 其实当年, 不叫当年, 就两年前 ,23 年其实就是因为技术上他们通过长文本的技术 vision, 通过把搜索和 Chat 结合起来的 vision, 带来了一个用户的体验不一样 , 从而出圈的一个例子 。
只是 DeepSeek 这次当然会火得多得多得多 。
我会想一个小白问题啊 , 就是当年选择长文本是一个非共识吗 ? 那是个很难的决策吗 ?
当时其实长文本肯定是大家在技术选择中的一个选项 ,但是你是不是把它放到最重要的那个角度去做 , 我觉得这个不是共识 。
当时有个段子不知道是不是真的 , 就说百度后来在 Kimi 火了之后, 就说为什么他们做了长文本我们没做 , 那好像说那个优先级没有排在第一批要做的优先级里边 。
因为当时你可以想 ,有很多其他的优先级是可能去做的 , 比如说也有很多人做 Carefree AI, 做那种情商方向的对齐 , 对吧 ?
也有可能你去做别的 。 就是这个时候长文本坚定选择 , 然后去把它做得很极致 。 因为长文本能解锁两个关键场景 , 一个是看多个文件 , 第二个就是搜索 , 看 100 个网页 , 然后总结 , 对吧 ?
这两个你没有长文本是做不出来的 。 而且尤其是在当时 Kimi 也是刚刚成立的公司 , 没有融到那么多钱 , 所以它也是年轻人小团队 , 资源很受限 , 必须 focus 在一件事情上, 选择一个正确的方向 。
所以其实 DeepSeek 现在火的很多因素 , 你放到 23 年的 Kimi 是一样成立的 。 当我资源有限的时候 , 我就要在一个关键领域突破 , 达到一个用户体验非常 wow 的感觉 , 所以我出圈了 , 对吧 ?
所以其实我去总结 , 我会感到很多有相似的地方 ,不叫我自己两个贴金哈 ,但是我确实觉得是有一些相似之处的 。
对 ,而且它当时其实也是占据了长文本的这个心智 。 长文本对他们今天做这个事情有帮助吗 ?
比如说同样的去做 retrieval, 那 Kimi 的很多在 truthfulness 在准确度上其实还是更好的 。 当然普通用户不会那么去对比 , 说实话现在很多用户用 DeepSeek, 它对于产生的幻觉它是没感觉的 。
但是说不定你交一个报告 , 回头你就被坑了呢 。 我真的遇到这样的情况啊 , 昨天我在一个群里面 , 那时候群里面都还是比较有水平的一些人哈 ,有人发了篇文章 , 里面就反正引用一些数据 , 我一看这个 DeepSeek 味道怎么这么浓啊 。
再回到 23 年, 你觉得 Kimi 他们应该就也不走长文本这条路线吗 ?
我觉得长文本是当时选择正确的路线 。
我觉得不是一个弯路 。其实今天早上就是在聊那个注意力机制的时候 ,也是聊到说为什么大家都很看重注意力机制 ,其实其中一个原因还是后面的长文本 。
对啊 , 对啊 。
然后长文本其实在那个强化学习里面 ,其实长思维链也是很需要长文本的能力的 。
而且记忆也需要呀 。
对 , 记忆也需要 。
而且你长的推理过程也需要 , 就长的思维链嘛 。 因为如果你的模型想 5 分钟后必须要停止 , 那你肯定这个怎么 scale up 呢 , 对吧 ?
所以长的 context window length, 对吧 ? 这个整个是一个很底层的技术 。 而且当你在资源有限的时候 , 你选择做走哪条路可能很关键 。
比如说如果有人选择我从 Sora 再走事件模型 ,maybe 那条路走得通 ,但也许不是你现在能走通的 , 那可能你就挂了 , 对吧 ?
对 , 刚才说的是一些大公司 , 现在可能因为 DeepSeek 的中立 ,以及它现在有很大的流量引流的作用 ,在跟它合作有些接入 。
你觉得 DeepSeek 大出圈之后, 对之前这段时间经常被拿来和它比较的大模型 , 六小虎的直接冲击会是什么 ?
六小虎与生态1:27:43
我觉得确实起到了个清场的作用 , 实话实说啊 。 就是因为这里面有几家在 R1 出圈之前 ,也就已经不做自己的基础模型训练 ,也不做冲击 Sulta 的准备 , 对吧 ?
然后我觉得 R1 出来之后, 确实也让大家意识到 , 如果你不能够有做到 Sulta 的可能的话 , 那确实还不如做一个垂直领域的 , 或者做应用 。
他们放弃是因为什么 ?
有资金原因 ,也有团队原因 ,也有自己的定位原因吧 。 因为显然我们作为 Kimi 的天使投资人, 肯定也馒头屁股决定脑袋的指责 。
但是我觉得说实际来讲 , 就是包括说 K1.5 这个模型的表现 ,以及他们接下来还要发的模型 ,其实在我们刚才说 Max 啊 ,Coding 方面也会有进一步的表现 。
然后说从这个学术上起到的这个贡献 , 对吧 ? 至少那从 reasoning,其实 K1.5 开始也说到这个里面提到的 Long-term shot 的这些评价也是很好的 ,并且今年发的 Moonlight, 然后前两天发的 Moba, 这些还是能保持 Kimi 团队具备持续向技术同行进行交流输出的能力 。
同时 Kimi 现在的用户其实也是到了千万 DAU 的级别 ,其实它是持续上涨的 ,并且说实话还是有不少人在用了 DeepSeek 和 Kimi 之后 ,在很多场景还是更喜欢 Kimi, 比如说它的幻觉更少 ,在一些工作场景中其实表现是更好的 , 包括在一些多模态推理上, 对吧 ?
像 Kimi 这些拍照收题呀 , 这些场景其实目前 DeepSeek 也是没有做的嘛 。 所以我是觉得从团队 、 资金 、 技术能力 、 用户产品的角度 , 可能有私心的一种表达 ,但是我确实认为 Kimi 是现在六小虎里边 , 或者极小虎里边 , 可能唯一一个能够去持续在 Sulta 模型这个竞争上去竞 。
当然这个路很难哈 , 就是需要钱 , 需要人, 需要各种 ,但是我觉得至少值得一试嘛 。
那 Kimi 接下来会更专注吗 ? 会砍掉一些东西吗 ?
他们已经砍掉很多东西 。 为什么小明去创业了 ? 因为他们海外砍了 , 对吧 ? 我想说的就是 ,其实他们现在是要继续冲击 Sulta 的 。
他们视频生成正式不做了吗 ? 还是 ?
至少你看 , 反正正好有些内测也没有去发布嘛 。 我觉得有所不为很重要呀 。
比如说他们冲击 Sulta 是不是意味着 , 就比如说更聚焦的话 ,是不是更聚焦只做代言模型 ?
那倒不一定 。 我觉得就是智能嘛 , 就是什么东西对提高智能最有价值 。 当然因为这具体路线 , 你可能会发现这里面 , 比如说也许有一天你发现多模态对提高智能很 ,其实多模态对于工具使用很重要 , 对吧 ?
工具使用智能很重要一环 。 所以你看 K1.5 也是一个多模态推理模型 , 对吧 ? 就是每家肯定不是说专注就要做跟它一样的事情 , 那反而又肯定又没戏 , 对吧 ?
所以肯定还是每家有要自己的一个选择 。
就六小龙多数在 DeepSeek 出来之前就已经放弃了 。在你的预期中吗 ?
我们其实在去年年中感觉到就是这样个结果 。
24 年年中 ?
因为那个时候有几家就很明显就是说 ,不管从意愿和资源的角度 , 已经很难继续这样做下去嘛 。
然后我觉得 Kimi 还有一点我觉得挺好的 , 就是它团队非常稳定 ,因为这与他们团队的构成也有关系嘛 。
就是几位联合创始人都是有长期合作 , 甚至就是室友关系 , 对吧 ? 所以大家可以看到现在各家模型公司的人员变化什么都挺大的 。其实很多时候创业就意味着说 , 它像个平衡木 , 走着走着你同行的人越来越少 , 你就掉到平衡木下面去了 。
就很多时候你是能够持续留在牌桌上, 往往就很厉害了 。
刚才我们主要讲的是对模型公司的一些影响 , 包括大的公司 ,不管开源的闭源的 , 然后一些创业公司 。 然后接下来我觉得还有一些其他的这个生态里的很多别的公司 , 就比如说在 DeepSeek 带来的这种更开源的风潮里面 , 可能会有什么影响 。
比如说有一类我想到的就是 AI 云平台 ,因为马上 DeepSeek 它接下来的这一周的开源周 , 按它的预告来说 , 我觉得它是要开源 Infra 层的一些推理优化的一些东西 。
那比如说它对这一类公司 , 像硅基流动啊什么的 , 无问星穹啊 , 这些可能会有什么影响 ? 创业上 。
对 , 我们是无问星穹的天使投资人, 所以他们量长得很大 。其实他们收到了很多的需求 , 包括尤其是各地国资啊 , 政府啊 , 都在拼命想部署 DeepSeek 吧 。
我觉得这个需求确实暴涨 , 那他们能不能持接得住 ? 金辉老师他们现在应该也是做了很多的这个创新 , 对吧 ?
包括在华为的卡上做推理 , 好像他们现在也很火 ,因为有很多人也要用他们 。 我觉得开源模型的火呢 , 确实让 AI Infra 公司出现了一个很好的机会 ,因为原来这些公司你要 serve 什么模型呢 ?
如果都是闭源的私有的模型 , 如果都是豆包 Kimi 这样的 , 那确实他们就起不到什么作用嘛 。
对 ,因为自己自己会做 。
自己做 server, 对 。 但是呢 , 我觉得长期可能也要看 , 就是它能不能持续的服务好客户 , 对吧 ? 因为固有云确实腾讯云也好 , 阿里也好 , 火山也好 , 确实具备更多钱 、 更多的 Infra 的能力 、 资源 knowhow, 所以包括客户服务能力 , 对吧 ?
所以对客户来讲 , 它肯定也不是做慈善 , 它肯定是说谁能服务好 , 价廉物美 , 谁才使用 。 所以我觉得对创业公司来讲 , 这还是有很多挑战的 。
到底是不是因为你技术很厉害 , 所以你就能做到哪怕腾讯云 、 阿里云你也做不好的事情 , 导致说我用户还是要用你 。
我觉得这个都是需要去挺努力的 。 因为中国公有云公司还是挺卷的 , 所以在这个事情上可能面对挑战 , 这些创业公司还是不小 。
并且好像 DeepSeek 因为它要开源这些黑科技嘛 ,也意味着说它原来在 service 上其实也还是有很多的自己的 knowhow, 这个可能也是导致它同样服务的成本就比别人低 。
这可能也是导致它有官方下场的服务提供商 , 对吧 ? 因为短期内它的算力需求激增 , 这肯定谁也没想到 。
所以短期内它扛不住 , 所以别人来承担 , 这也很正常 。 但是如果你进入到一个稳态 , 那是不是这些创业公司面对大的公有云 , 面对 DeepSeek 第一方 , 它仍然有优势 , 这个就还得去看看 。
但整体来讲 , 我觉得肯定是创造了很多机会的空间 。
对 ,其实 AI 云平台是夹在这两个中间 , 对吧 ? 它是在云和模型中间的这个部分 , 就它有可能会受两边挤压 ,但也有可能因为这个生态的变化 , 它会有一些机会 。
对 , 就如果开源的中间这一层的选择变多了 , 对吧 ? 比如说不同的框架 、 不同的模型可选的多了 , 那中间这一块就变得越来越好 。
但如果最后收敛到我就是用一个 , 比如说收敛到我就是 iOS 或者安卓 , 那可能最后就还是系统提供商去提供 。
你觉得对广大只做应用的公司 , 它的影响会是什么 ?
我觉得肯定还是正面的 , 就是你多了更好的且开源的 , 你可以去做自己微调的模型去用 。在这个过程中, 我觉得你如果去做 Office 的事情是比较难的 , 就是在模型的主航道上 。
但是如果你做的事情是给模型的生态丰富 , 对吧 ? 所以我一直打比方 ,在技术革命的早期 ,其实我们叫黑莓时代 。
黑莓时代因为它的技术能力有限 , 所以你有的 PMF 是很少的 。 黑莓时代就是发邮件 、 发信息 。在黑莓时代 , 哪怕张一鸣再世 , 当然他那时候就再世 , 就是哪怕张一鸣回到那个时代说要做抖音 ,他也做不出来 ,因为黑莓就不具备那个条件 。
但是为什么后来移动互联网这么蓬勃发展 ? 首先是因为有了 iPhone,iPhone 的实力足够强 , 它解锁了很多场景 , 它有好的摄像头 、 好的屏幕 、 好的网络 、 好的芯片 , 所以它才能解锁像短视频啊 , 像移动电商啊 , 像社交网络这样的场景 。
然后 iPhone 之后就是安卓 , 安卓又把它变得更加开放 , 所以进来了小米啊 ,OPPO、vivo 等更多的手机厂商 , 进一步的把智能手机给铺开 。
比如说 Sonet 和 4O、O1, 它有点像是 iPhone 时刻 , 就是闭源的技术进步 , 导致很多人能够在它上面构造应用 。
然后 DeepSeek 可能是安卓时刻 , 就是它从闭源变成了开源 , 同时也具备足够强的实力 , 使得大家去做应用就有了更多的选择 。
所以技术进步一方面能带来更加好的产品体验 , 导致出现杀手应用 ; 另外一方面也会让这个生态变得更加旺盛 ,因为原来你只能做那几件事 , 现在你有了 iPhone,有了安卓 , 你才能做抖音 。
然后我还想聊的是 O1 和 R1 对一个大家都很关注的领域 , 就是基础设施算力的需求的影响 。其实 DeepSeek 和 R1 有一段时间它特别火 , 就是跟刚才我们说的英伟达大跌有关系嘛 。
算力变局1:35:47
就有一种观点是会觉得它是不是因为训练成本很低 , 所以会减少对算力的需求 。 包括我看你也发了一些朋友圈 , 后面很多人也都是一个不一样的观点的 。
这个可以讲讲 。
我认为首先算力需求它有不同的结构 。 原来就是说训练和推理 ,在过去 23 年、24 年军备竞赛的时候 , 大家把它简单总结成了一句话叫 " 大力出奇迹 "。
好像觉得我只要买足够多的卡 , 我就能出更好的结果 。 当然那时候在预训练没有撞墙 , 或者大家没有意识到撞墙的时候 ,其实这样做也能成立 。
所以那个时候大量去是一种 formal 的 , 为了竞争军备竞赛去买卡 。 所以现在我们却发现 Pretraining 确实你短期的大量投入编辑效益是有限的 。
比如 Grok 3, 它是 20 万张卡训的 ,但是这里面的进展是第一也是有进展的 ,但第二编辑效应在递减 。 所以你也不能说大力出奇迹是错的 , 只是说它的奇迹的编辑效应在递减 。
那么在这种情况下, 确实 Pretraining 的算力需求会下降 。 但是我们现在看到的 , 我认为会发生的事情是 ,由于模型的能力已经达到了做 Agent 产品的临界点 ,并且还在往前突破 。
所以当 Agent 这个产品的形态能够落地之后, 它使用的 Token、 使用的 Inference 的算力会大幅增加 。 因为如果只是 Chatbot 的话 , 你想你跟 ChatGPT 也好 ,Kimi、 豆包也好 , 你没有那么多聊的 , 你甚至都没有那么多 Intention。
所以你跟它如果只是要 Chatbot, 那花不了多少 Token。 只有当它帮你做事情 、 做更多的事情 、 做更复杂的事情的时候 , 它会用更多工具 、 有更多思考 。
这个时候它带来的这个 Inference 算力的需求 , 可能它不是 10 倍的提高 ,是 100 倍 、1000 倍的提高 。 那这个事情之前可能无法发生 ,因为技术没有到达那个程度 。
但是现在技术可能我认为到了这个转折点的话 , 那可能就会发生对推理需求大幅提高 。 所以 Pretraining 还在那 , 可能提高的速度变慢了 。
然后推理当然也包括 Post-training,Post-training R1 的算力现在消耗量也是在快速变大的 ,因为现在这是模型能力提升最重要的地方 。
然后推理的长度会大幅增长 。 所以我是觉得我们对算力的需求整体来讲还是大幅提高的 。
这个大幅提高是 25 年就会发生吗 ? 百倍千倍的推理算力的需求的增长 ?
首先我认为如果你从一个技术发展史的角度来讲 ,25 年发生还是 26 年发生 , 还是 27 年发生 , 一点都不重要 。
那可能对炒股有点意吧 。
对炒股是吧 ? 因为可能 25 年大跌 , 然后 26 年涨上去了 , 对吧 ? 因为你现在看自动驾驶 , 最后发生的最重要 , 对吧 ?
你到底是哪一年发生 ,其实不是那么重要的 。 但我认为现在 Agent 的产品 , 至少我是感觉到已经到了这个出圈的呼之欲出的地步 。
比如说 DeepResearch,其实它需要的 Token 肯定要多很多 。 所以为什么 Sam Altman 说那个 GPT Pro 虽然付了 200 美金一个月 ,但它是亏钱的 ,因为那个时候肯定就是 Inference 多了很多嘛 。
但是我觉得这里面第一个是 Pretraining、Post-training、Inference, 它花的那个占比会发生变化 。 第二个就是说确实对英伟达 , 它很多时候它是一个格局的变化 。
因为现在 25 年的 2 月 , 英伟达在推理在训练上肯定还是性能最强且效率最高的选择 。 但是确实我们也看到 , 当 R1 具体火了之后, 那国产芯片就针对 R1 做优化 , 那这种定点优化其实它还是一个效果更好 。
其实它已经在用了 。
已经在用升腾嘛 。
对 。
就他们已经看到升腾的 910B。
而且这是用英伟达 , 可以用 P4 这种 。
是的 。 我觉得这是始终出现一个就是说 , 当你的技术没有收敛的时候 ,GPU 具备很强的通用性 。 或者我们说为什么有英伟达 ?
因为最早都是 CPU,CPU 是最通用的 。 然后后来发现 , 哎 , 咱要玩游戏 , 游戏这个事情是个非常具体的需求 。
所以他们做了 GPU,GPU 专门去加速游戏 。 当然后来 GPU 可以做 AI,但是现在也是 GPU 对于 AI 的这个通用训练和推理是最通用的 。
但是如果你具体就 serve 一个具体的模型 , 那第一种是比如说像这个升腾 , 我可以专门做优化 ; 第二种做 ASIC, 对吧 ?
像 Marvell 啊 , 或者博通的去做 。
或者像谷歌做 TPU, 它就是针对自己的 。
是的 。 做它 TensorFlow 嘛 。其实它也是种专有化 , 就是一旦你的架构稳定下来 , 那在芯片里面往往就是可以通过做专有化来去实现更好的效率 。
所以那这个里面就牵涉到到底这个架构它会不会固化下来 。 我认为现在也是处在一个大家在 debate 的点 。
目前来看 O1、O 系列这个能走很远 , 对吧 ? 这条路能走很远 , 那可能 ASIC 就能逐渐的 work。 但另外一个角度 , 假设明年后年发生了什么架构的基础变化 ,Transformer 都不 work 了 , 都得换一个 , 那可能你 ASIC 就白做了 , 可能就还得 GPU。
所以我觉得这里面有很多不确定性 。 但是呢 , 英伟达确实有个问题 , 就是说它现在就市场份额太高了 , 它已经很难 go up。
对 , 它好像已经到了一个顶点了 。
对 , 它已经 90% 多市占率了 。 那所以它有可能往下走 。 这种往下走的可能其实就让很多人很担心 。
因为现在一方面是对未来的算力需求的预期比较高 , 一方面是对它格局 ,而且格局带来的是它的毛利率 , 它的预期比较高 。
一旦格局出问题 , 可能它的毛利率会出问题 。 所以这个是大家比较担心的 。 但如果你说现在此时此刻大家干的事情 , 包括 DeepSeek 现在最想获得的是什么 ?
肯定还是英伟达嘛 。 你肯定还是能买多少买多少 , 可以买的 , 想办法能买到的全都得买啊 。
对 ,其实这一波最稳的还是博通 。
博通或者 Marvell 其实这两个都出现了很多 。 但是呢 , 你要说 ASIC, 第一 , 它基本上还是得 27 年才能用得上 ; 第二 , 这里面到底比如说会不会出现一些架构变化 , 导致 ASIC 这条路就不 work 了 。
并且 ASIC 其实你要做出来 , 真要用上 ,也有很多产能上的 、 良率上的 、 效率上的问题 , 对吧 ? 也不是那么一帆风顺的 。
这不是说我想要设计就能做 。 所以这里面还是有很多的 。 当然英伟达也出现了 , 比如说这个液冷的问题 , 对吧 ?
整个这个良率的问题 ,其实也有很多问题 。 所以反正对于算力肯定是整体利好 。 大家现在也都学到了 , 对吧 ?
就是这个杰文斯悖论 。 但是呢 , 英伟达是不是格局变化 , 只能说这里面确实产生了一些新的可能性 。
所以当然对于炒股票的人来讲 , 肯定第一反应出现那个新闻 , 先卖了再说 。 现在发现好像问题不大呀 , 又加回来 , 对吧 ?
AI 主题成了整个二级期间讨论的最火的一个主题吗 ?
中国资产1:42:01
现在我觉得就是所有人都在问老外什么时候回来 , 对吧 ?
已经回来了 。 港股交易量是去年同期的 5 倍啊 。
我觉得老外也分不同的老外 。
对 , 我最近采了一个人 ,他的总结就是说 , 先回来的老外是在上一波赚中国钱里赚到钱的 。 比如说当年中唐阿里 、 腾讯的人 ,他们是最先回来的 。
就当年他已经买中国股票赚到钱的那群人。
我觉得这里面确实分不同类型的人。 挺有意思的 , 就是我们反正聊了有两拨人的观点不一样 。 有一拨人是他们原来对中国 AI 他们看不上 ,他们觉得中国 AI 不行 ,因为中国 AI 缺卡 、 缺人 、 缺钱 。
现在他们突然发现 , 哇 , 中国有 AI,而且是很厉害的 AI。 然后又发现 , 哇 , 原来阿里的阿里云都没给估值的 , 都只算了电商 。
那这太好了 , 对吧 ? 赶紧买 。 另一部分人是他们对中国比较了解 ,他们知道中国有腾讯 、 字节有这些很厉害的公司 ,他们对中国有 AI 这件事他们并不怀疑 。他们担心的是比如说经济刺激啊 ,是这些政策 。
所以他们在想 , 哎 , 政策怎么样 ? 所以这个民营经济座谈会确实非常振奋人心嘛 。 所以不同人看的东西不一样 。其实有的时候我们的 LP,他们是觉得中国创业公司很厉害 , 创新很厉害 , 我们早就知道了 , 否则我们也不会投你们 。
但他们就关注的是营商环境这些的变化 。 所以每个人看的点不一样 。 但是我倾向于认为 , 真正的长线外资还是需要一些时间的 。
因为他们做决策不是像咱们一样 , 今天点击买 , 明天点击卖 。 你想他们肯定也是按季度开投资策略会 , 然后刚刚去年讨论完中国的这个投资策略 , 现在要改 , 为什么要改 ?
有些什么数据 , 对吧 ?
对 ,其实有一个宏观背景 , 就是美国指数连涨 32%, 就是拉高了这个 Benchmark 嘛 。 但是对于一些大资金 , 它必须全国布局 。
那中国没有成为危险之后, 中国是一个必选项 。
当然了 。
对 ,其实跟 DeepSeek 当然没有必然关系 ,但 DeepSeek 刚好也促成了整个大家对 AI 的乐观嘛 。
我认为二级市场很多时候像个弹簧一样 , 就你弹簧被压得很紧了 , 这个时候你稍微有个释放 , 立刻它就弹很高 。
那我问个问题啊 , 就是那个中国资产重估 , 这是教父提的 , 你觉得 。
我觉得 。
实现了吗 ?
恐惧都是跌出来的 , 信心都是涨出来的 。 越涨得多 , 信心就越多 。 现在想 21 年的时候 , 中国 PE 比美国还高 , 那个时候难道又合理吗 ?
对吧 ? 所以其实很 high 的时候不合理 , 很悲观的时候也不合理 。 去年字节 5 倍 PE 合理吗 ? 肯定也不合理 。
现在字节多少 ?
据说已经被 re-rate 了 400 个 billion 了 , 对吧 ?
哦 , 对 , 我也听到这个 , 这个数字有 4000。
对 , 所以我觉得就是很多东西是边际变化 。 但是 re-rate 这个事情 , 尤其在不同的人心中也不一样 。
我觉得这个过程肯定还是很早期 ,因为一个事情都需要时间嘛 , 对吧 ?
嗯 。 那我看大家已经在狂欢了 。 那刚刚出的那个新的政策 , 就是那个美国优先投资的一个政策 。
我们还在研判 , 这个我们还没有什么 comment。 但我觉得肯定这几年也是宏观大年嘛 。 也有很多人说今年开年两个月 , 那各种政策的变化 , 主要是海外的哈 , 这个应接不暇 , 根本就感觉无法理解 , 对吧 ?
因为我们无法 timing 宏观 , 所以我们肯定还是关注技术创新本身嘛 。
嗯 ,因为我们刚才讲了很多一些展望 ,有些可能是今年就会发生 ,有些可能是比较久以后啊 。 就总结而言 , 你觉得 25 年我们大概率会看到什么 ?
我觉得我们会看到更多的李世石时刻 , 就是在一些任务上 AI 超过 99% 的人类 , 我觉得其实已经在陆续发生 。
比如说写代码可能就是这样的 。AI 现在写代码应该比 99% 的人类好 。
99% 的程序员吗 ? 还是 99% 的人类 ?
我现在说的是人类 ,但是我觉得 99% 的程序员可能也很快了 。 因为 CodeForce 上, 它在这个竞赛级别的编程已经超过 99% 的程序员了 。
但是竞赛级编程和日常产出不一样 , 它可能需要更多的 context 去读 , 更多代码库去做嘛 。 但是我觉得这个过程发生很多 。
所以我们会看到更多惊叹的这种 AI 在这个能力上打败人类 , 或者是打败精英人类的这个新闻 。
然后我觉得我们会看到进一步的有这种 Agent 的产品 ,以一种大家用起来更加方便 , 然后更加实用的形式 , 成为一个现象级产品 。
可能不会说几亿人用吧 ,但是我觉得可能能够进一步的破圈 , 像 Cursor 这种 , 这个级别的破圈 。
Cursor 现在是多少日活了 ?
日活我不知道 ,但它的 AR 大概 1 亿美金左右吧 。 那是程序员的日活很难衡量 。 所以不要用日活去衡量 AI 产品 。
我觉得 AR 就是一个 , 就是你给用户提供多少价值 , 我因为成本原因给你多少钱嘛 , 这可能是一个 。 然后我觉得可能模型的进展会变快 , 大家会开源或者分享会变多 。
我觉得这个确实是一个挺有意思的 。 然后我其实觉得在中国 ,其实我们刚刚经历了可能在美国 ChatGPT 时刻的那种感觉 , 对吧 ?
因为确实现在我看各地政府都要用 DeepSeek 了 , 然后大家都在接入 DeepSeek。 我觉得这个对 AI 的感知度会是很重要的一点 。
因为大家都意识到 , 啊 , 原来 AI 这么厉害 。 之前 Kimi 啊 、 豆包啊 , 这些加起来几千万 DAU, 可能比如说一两亿月活 , 可能都没有两亿吧 。
我觉得这也是让大概十分之一的人用到了 AI。 但是就是说比较先进的模型 , 对吧 ? 但如果说能够百分之几十的人都试用过了一个比较先进的模型 , 感受到 AI 确实很强大 。
那这里边不管是从创业者的角度 , 从用户的角度 , 还是新产品的角度 , 还是从投入这里面资源 、 钱 、 算力的角度 , 我觉得都会是一个对行业很大的一个寒火机爆发的生态 。
对 , 这是 25 年嘛 。 包括你也说 25 年可能在有些领域的李世石时刻 , 就是超过 99% 的人类 , 甚至是精英人类 。
AGI 之后1:47:03
然后我觉得 DeepSeek 这个事也是让整个行业我觉得就加速度变得更快的这样一个感觉 。 那你觉得如果我们更快的达到 AGI, 或者说更多领域解锁李世石时刻 , 然后了 , 我现在有点想象不出那个变化 , 包括人去干什么 , 结构怎么变啊 ?
我其实觉得我们在一个人的历史上非常有意思的时间是 , 指数增长其实是世界的常态 。 因为其实我们每年都是在前一年的基础上增长 , 对吧 ?
但是亲眼见证并体验指数增长是一个很罕见的事情 。
你指什么的指数增长是常态 ? 经济总量还是指什么 ?
对啊 ,GDP 如果你每年涨两个点 、 三个点 , 这不就是一个指数增长嘛 , 对吧 ? 但一般来说这种指数增长都得是我们用一生去体验的 。
比如说你可能今年和明年比不会太大的变化 , 对吧 ? 但是我们现在在 AI 上, 我其实在比如说具体的讲 O1、O1 Pro, 再到 DeepResearch, 这个上面我感受到的是 , 几个月的时间内你就明显感觉到在指数增长 。
这种体验就很特别 ,并且我觉得这个就让我们对未来的预计会发生很大的变化 。 所以现在很多人都在问 AGI 是什么 ,以及 AGI 实现之后会怎么样 。
我自己的看法是说 ,AGI 确实对于生产力 、 社会 , 甚至对于政治 、 对于文化都会产生很大的影响 。 但是具体它来了之后的影响 , 我觉得可能我们需要有对冲击的应对 。
因为包括安全 , 包括新技术来了之后怎么解决社会福利这些 , 我认为都是发生了之后大家才会真的去重视的 。
嗯 ,而且这个能力掌握在谁手里 ,其实是影响世界格局的 。
所以加速主义就认为 AI 肯定会发展 , 坏人会用 AI 去做坏事 , 所以好人应该更快的发展 AI。 所以以子之矛攻子之盾嘛 , 对吧 ?
谁是坏人 ? 各种坏人。
你是认为对面的人就是坏人 ?
也许有什么搞金融诈骗的 , 包括像韩国之前那种 DeepFake AI 色情什么的 。
所以那你就得有更强的去侦探 DeepFake,因为人是已经没有精力去看了 , 对吧 ? 所以我觉得这个肯定是一个巨大的影响 。
那么我其实觉得这里面一方面大家谈的很多了 , 什么很多人会失业 , 我觉得应该会发生 。 因为现在大家对 AGI 的定义就是它能够替代多少人的工作 。
如果你的定义 AGI 就是替代人工作 , 那 AGI 实现那不就等价于很多人会失业吗 ? 当然这是一个可能说从社会角度 ,因为也有人说那个时候物质极大丰富 , 先发 UBI, 每个人都发钱了 , 对吧 ?
那这个我不知道会发生什么事情 ,但我觉得会有很多的冲击 。 但另外一个角度我觉得就是我们人眼中的真实会发生巨大的变化 。
因为不管是从视频生成 、 图片生成 , 还是内容生成 ,其实我是 86 年的 。 我出生的时候 , 一个人能读到的信息全部是经过权威认证的 。
因为要不然你就出版不了 , 要么是书 , 要么是报纸 。 后来互联网的巨大意义是 , 让任何一个普通人写的东西能被看到 。
然后现在 AI 变成了说 , 你想要啥给你生成啥 。 嗯 , 那这个其实我发现 , 包括我自己一样的 , 就是很多时候你就没有判断力了 , 你就没有对它的这个甄别能力 。
这个时候怎么在这样的环境中去进一步的适应 , 建立起自己的认知体系 , 我觉得这个其实非常重要的问题 。
嗯 ,有一个网络流行语 , 它现在越来越有生意了 , 就是大家意思就是视频是 P 不了的 , 所以它是真的 。
那现在视频 。
对 , 现在就可以生成了 。
对啊 , 嗯 。 所以我觉得这个其实对我们整个人的社交意义或者认知世界的方式都会发生很大的变化 。
当然我觉得每次科技发展有一个这样的规律 , 就是第一波呢 , 往往都是最厉害的人创造最强大的技术 , 然后第二波就是强大的技术为最厉害的人打造最强的工具 。
比如说计算机一开始就是为了解决核爆炸的问题 , 或者是破译密码的问题 。 然后这样的给超人设计的超级工具 , 它会逐渐的民主化 , 普及普通人, 然后小型化进入到家庭 , 然后移动化可能到处都存在 。
所以我们现在还处在说最厉害的一群人, 然后为精英人群打造超级工具的这个阶段 。 但是我想这个东西一定是会普惠 。
所以当时我们投王慧雯光年之外的这个口号就是加速 AGI 普惠人类嘛 。 就普惠我觉得肯定还是最后结果 ,但是中间肯定开始说到的像 William Gibson 说的 , 未来以来单步平均分布 , 现在确实挺不平均分布的 。
所以我觉得不管是 DeepSeek 这种开源也好 , 还是像 Kimi、 豆包这种大用户的产品也好 ,其实都是加速未来的均匀分布 。
我觉得这都是非常有重要的意义 。 因为新技术我觉得最后是普惠大众的 ,是普惠全人类的 。 这个是它最后真有价值 ,而不是掌握在少数有钱人或者是少数公司的手里边 。
我觉得这整体来说还是一个我希望看到的结果 。
你觉得工业革命的成果普惠全人类了吗 ?
那当然 , 我们现在做的车 , 所有的这些机械 , 包括电气革命 , 对吧 ? 我们一眼看去可能有 100 个要用电的东西 。
那为什么没有普惠到非洲 ?
那非洲显然也比之前要强大了很多呀 。 就是公平和平等不是一回事啊 。 就是你完全可以做到下限 , 大家都提高了 。
比如说 21 世纪资本论和西方很多新的这个经济学里面在研究的问题嘛 。 比如说当以前的皇帝也没有抽水马桶 ,他也没有这个智能手机 , 对不对 ?
也没有空调 。
对啊 , 对啊 ,of course。 但是那确实绝对的差异在变大 , 对吧 ? 但是所以社会到底要的是什么 ? 比如说或者以什么样的机制让这些富人, 比如说可能在美国这边又讨论出来的 , 那通过什么税的制度啊 , 还是通过慈善的制度去回馈 。
但是你不可否认的是说 , 那肯定这个基础的水平是提高了非常多 。
所以你觉得 AI 大概率还是提升所有人的这个绝对的下限呢 ? 但是它到底是造成比如说更平等 , 或者是要更平均也行 , 还是造成更大差距 , 这个其实现在不太好看出来 。
我觉得如果利用不当的话 , 或者是很有可能会导致贫富差距进一步拉大 。 因为刚才说到的 , 如果当你的钱能够有效的变成算力 , 算力变成生产力的时候 ,因为原来富人也只有 24 小时, 现在富人可以通过这个 attention is not all you need 去同时 hire 10000 个 AI agent 去做事情 , 对吧 ?
这理论上是可以发生的 。 那假设这种事情发生了 , 那岂不就变成了说有资源的人更有资源 ?
那可能新的生产力诞生 , 会诞生很多就业机会 ,也许 。
我觉得每次技术都是这样的 。 比如说原来大家都用马车 , 后来汽车 , 那马车夫的工作是没了 ,但是多了大量的运输型的工作呀 。
所以这个也是就是加速主义说我就是要加速 ,因为生产力提高就会有更多工作 。 但是确实对于每个身在其中的人 ,因为马车夫和汽车司机可能不是一个人。
但是如果你技术发展带来的是生产力提高 , 带来 GDP 提升 , 那提升了 GDP, 你其实可以反过头来为这些人去提供福利 , 或者去寻找他的这个出路嘛 。
嗯 ,但是你不能因为马车夫会失业 , 所以你说咱们就不要发展汽车 。
主要是它也阻挡不了 , 就你没有办法去让大家来减速这个技术的竞争 。
但比如说你说像欧洲的一些 GDPR 这种政策 , 或者对 AI 一上来过分管制 , 可能就会导致这样的这个诞生 , 对吧 ?
那当时工业革命的时候也是有那个卢德主义嘛 , 就砸那些机器 。其实人类我觉得最后进步的原因还是因为当时的这些政府什么的 ,其实最后还是选择了说允许新技术存在一些瑕疵 , 让技术发展的逻辑 。
如果当时说啊 , 那汽车刚发明的时候 ,其实有很多交通事故 ,因为那个时候城市也不是为了汽车设计的 ,并且也没有红绿灯 , 都没有交通规则 。
所以那个时候其实死亡率比它高很多 。 但如果那时候第一反应是说啊 ,因为这个会撞死人, 所以咱就别搞了 , 或者说限制汽车只能跑 25 英里每小时, 那可能你就现在就都没有现在这些进步 , 对吧 ?
包括电也会电死人嘛 。 所以我一直觉得就是新技术出现的时候 ,其实应该不要让它具备太多的自我审核责任 。
应该是说先用 ,有问题再改 ,而不是你先证明你没问题 , 然后再用 。 但在 AI 这个里面 ,其实是有很多国家去执行的是说你先证明你没问题 ,因为听说你很厉害 , 听说你会毁灭人类 , 所以你先证明你没问题 , 你才能用 。
那这个时候可能就会出现很多这样的阻碍进步的情况发生 。 当然每个人视角不一样啊 , 我自己还是觉得要鼓励创新 , 就是事后审核比事前自证清白要更适合我觉得 。
嗯 , 我比较好奇你个人在为可能更快到来的 AGI 做些什么准备 。
锻炼身体 。 我觉得投资这里面优秀的创业团队其实就很重要啊 。 因为我觉得你有了更多的技术创新之后, 创业者其实 , 当然梁文峰他其实一开始也是创业者 , 只是他太厉害了 ,他能够自己炒股 , 自己量化赚钱赚到钱 。
但是还有很多可能成为梁文峰的人 ,他也许就缺乏启动资金啊 。 所以我觉得这个时候 VC 其实很重要 , 尤其早期投资很重要 。
因为早期投资理论上承担最多的风险嘛 。 如果很多事情都很确定了 , 那也不需要我们了 。 但我觉得现在又重新回到了一个很不确定的时候 。
不是每个人都能像梁文峰这样自带 100 亿干粮的 , 对吧 ?
嗯 , 你觉得下一代怎么教育啊 ? 你看他们学习什么了 ? 我觉得这是现在很多人很困惑的问题 。
我觉得重要是提出问题的能力 。 比如说我现在经常面临这个情况 , 面对一个很强大的 DeepResearch, 我要问他啥 ?
我要指挥他干啥 ? 对吧 ? 我作为 AI 的老板 , 你今天干嘛 ? 当然这个小婉也管公司啊 。 你说有的时候就是我得告诉大家今年干嘛 , 这个月干嘛 ,其实是很需要我动脑子的 , 对吧 ?
因为这事不会自己跑出来 , 我需要去想干什么 。 但很多时候我觉得我们现有的教育体系还是在告诉一个学生你会干什么 , 让他学技能嘛 。
但是如果很多时候技能已经是可以被 AI 去做 , 或者你可以指挥 AI 去做的时候 , 那你要做什么 ? 你有很强大的可能性 , 你要做什么 ?
这个就变得非常重要 。 第二个就是说大量我们现在做的工作 ,其实还是一种叫做缝合怪的工作 , 就是把这些从这里拷过来 , 那里拷过来 , 这里拷过来 , 然后把它缝在一起给个报告 。
那这样的工作 AI 已经干的比人好得多了 。 那很多时候就是你的这个内容能不能够为人类 , 或者为人类的总体知识增加一些独有的特点 。
比如咱们在这聊天 , 可能也都是缝合粘贴啊 , 反正 ,但至少可能诞生一些 unique data, 对吧 ? 那我们的什么工作能诞生一些独特的数据 ,是 AI 模型里没有的 , 还是说我们其实只是在把 AI 模型的东西把它吐出来 ?
我觉得这里边其实对于教育也好 , 对于工作的本质也好 , 都会产生很大的影响 。
我觉得那句话特别好 , 就马斯克说的 , 三人成忠 , 就是我想在佛心上死去 ,但是别在登录的时候 。
就是别撞死 。
别撞死 , 对 ,不要在登录撞机的时候 。 嗯 , 我有个个人很好奇的问题啊 , 就是关于你最近自己也做投资 , 你也自己要学习 AGI, 然后你还对整个第二次市场都要研究 , 你这个经历怎么分配啊 ?
就是你怎么保证你的学习效率 , 你怎么保证你就是学习的速度比别人更快呢 ?
也没有更快啊 , 否则应该更快学习到 DeepSeek。 没有 , 开玩笑 ,其实我们在 V3 发布的第二天 , 就是 12 月 27 号 , 我就在我家这儿组织了一个讨论会 。
就是当时我也拉了十几个朋友 ,有字节的 ,有各个 AI research 的朋友 。 当时我就发了这个邀请 , 你们说今晚来我家讨论这个 AI, 最近既有 Devin 这个新产品的突破 , 又有昨天发布的 DeepSeek V3, 非常振奋人心 , 很多新东西啊 。
说明咱们学习能力还是可以的 。 包括当时 MLA 发布的第二天 , 我当时就说 MLA 这个看上去非常的厉害 。
那时候我正好也在美国 , 所以跟我朋友同学也在聊这个事 。 我觉得其实第一就是说 , 就是感兴趣很重要 , 你确实要真感兴趣这件事情 。
然后我自己感觉是要多试 。 我自己是在 ChatGPT 出来的当天晚上, 我用到凌晨 4 点 , 我就觉得这个东西非常的不一样 。
我的这个习惯呢 ,其实可能源自于我最早上网是 98 年开始上网 , 还很记得我第一次用到 Google 的时候 ,99 年左右吧 。
那个时候觉得这个搜索引擎也跟原来的一切东西都不一样 。 因为它之前的搜索引擎是非常弱智的 , 你搜东西都搜不出来什么东西 ,Google 一上来结果完全不一样 。
但是后来又有很多 , 比如说校内网 , 我也是他们上线第二天 , 就昨天正好吃饭遇到了王兴 、 郭安怀 , 就是我说这个 20 年前就是校内网 , 第一天我就去使用 , 后来我就等于也是对于内部互联网创业的大潮就有很深刻的印象 。
包括 ChatGPT 我是出来的第一天用上, 我觉得很革命 , 所以我就立刻开始组织整个去研究 。 然后比如说 Devin,其实我也是出来的第一天 , 然后我就觉得这个东西特别好 , 所以我也组织讨论会 。
我其实觉得因为你看互联网第一波的从业者 , 很多时候是第一波上网的人, 然后移动互联网的第一波从业者 , 很多时候是因为他们最早买了 iPhone, 包括很多时候买特斯拉赚钱的人 ,其实也是因为他们最早买了特斯拉 。
所以我觉得现在花一点小钱 , 或者甚至不花钱 , 现在有大量免费的东西 , 对吧 ? 你去体验未来很重要 。
所以我当时发了个朋友圈 , 我说虽然 Devin 500 美金一个月充值 ,其实它是最小充值金额 , 看上去很贵 ,但对于朋友圈的各位大佬来讲 , 就是喝瓶茅台的价格 , 那你一瓶茅台的价格可以看看未来的产品长啥样 , 这也挺好的 , 对吧 ?
确实 。
所以就是自己多动手去试一试 , 自己多去看一看 paper, 看一看这些最厉害的人。 因为其实不管是比如说 Angel Capacity, 对吧 ?
还是 OpenAI 的这些研究员 , 还是当然 DeepSeek 的这些 paper,有大量的高质量的信息是免费的 , 你可以去学习去获得 。
去年年初的时候 ,因为当时很多二级市场的分析师就觉得英伟达需求会遇到瓶颈 , 觉得 25 年就要下跌 。
那我在行业看到的是 , 我认为绝对不可能 。 我认为大家全部还是在以军备竞赛的 FOMO 去做这个训练 , 去买卡 。
所以那个时候我其实就是一个还是比较 non-consensus 的人。
那你买博通用吗 ?
博通我去年下半年开始买了 , 就是讲 ASIC 这个故事的时候啊 。 但我觉得这个目前兑现度其实没那么高的 。
因为 ASIC 的道理 ,因为现在还是说未来可能很牛 。 因为每次对英伟达 ,其实当年也说 AMD 可能很牛 , 对吧 ?
现在说 ASIC 可能很牛 ,因为大家都喜欢这种老大被挑战 , 老二崛起的故事 。
ASIC 已经冲击它好几次了 , 就当年寒武纪那批公司就是 ASIC 嘛 。
就每次其实冲击最后好像还是有限 ,但是没关系 , 这个故事二级市场很多时候先吵着再说 , 对吧 ?
你最后兑现的时候也不一定 。 但是我想说的是说 , 二级市场其实是个很有意思的 , 你有一些认知 , 你能够去 bet。其实我们很早就知道 DeepSeek 很牛 ,但是确实人家也不要我们的钱 , 对吧 ?
那就是说你有一个想法 , 你没法去 validate。 但是二级市场是一个 , 就跟你训模型一样 , 你需要有一个 result reward, 你需要有能够 verify 你的 thinking 的过程 。
所以我觉得二级市场其实赚钱不是重要的 , 重要的是说 , 虽然不一定它是对的 ,但是呢 , 它总会给你个信号去 verify 你的 thinking。
我觉得这个是一个挺有意思的事情 。
嗯 , 那你现在用这些工具呢 , 知道你在二级市场上投资吗 ?
DeepResearch 给我一个很实际的例子 , 就是前阵子特朗普不是每周五都要发一个加 tariff 的一个 PR 吗 ? 当时我正好在看美国国债的这个交易 , 所以我就问了 DeepResearch 这个问题 , 就是说请帮我看一看 2018 年的时候特朗普打贸易战 ,他宣布做这些加关税的决定的时候 , 美国国债的长期国家利率是怎么反应的 。
因为第一种思路是 , 那如果加了关税会导致我的通胀上涨 , 我的通胀上涨 , 那我的长期通胀会抬头 , 那么这个国债利率会上涨 , 所以国债会跌 , 对吧 ?
第二种思考是说局势变紧张 , 所以大家会卖出股票去买入国债避险 。 同样一个事情可能有两种解读 。
所以呢 , 我就当时去问了 DeepResearch, 然后他就给我咔咔咔做了一堆分析 , 就说 2018 年每次特朗普宣布新的关税政策的时候 , 美国国债其实都是涨的 ,也就是说国债利率会跌 , 大家会买入国债避险 。
所以我根据那个 , 当然也不只是根据这个 , 我还是看了很多历史的数据 , 所以我做了当时买入美国国债的这样的操作 , 最后证明是对的 。
所以我是真的感觉到这么个问题 , 我问他 5 分钟给我一个答案 , 那我问我任何助理也不可能 5 分钟给我一个答案 , 对吧 ?
嗯 ,因为当时我也问了我一些二级市场很厉害的朋友 , 当然有人第二天告诉我说会涨 。
你是当天晚上就买了 ?
没有 , 开玩笑 , 就是说随时响应这点就很重要呀 。 嗯 , 刚才也说到学习 ,其实我很喜欢读书嘛 。 为什么我天天吹这个 Agent 啊 ?
当然吹的是 OpenAI 的 Agent,但我确实觉得这个给我的生活改变很多 。 读书的时候我经常遇到个情况 , 就是这个东西我觉得挺有意思 ,但我如果去研究一下的话 , 那第一花很多时间 , 可能你看各种各样的时间就过去了 ; 第二来说你书就读不下去了嘛 。
这次我有个很明确的例子 ,是那个 Reagan Hoffman 的新书叫 《Super Agency》,他里面就写了一个例子 , 就是美国当年 GPS 刚出现的时候 , 美国担心 GPS 的这个精度太精确了 , 影响国家安全 , 所以一开始先对 GPS 给了一个 100 倍的误差 , 就导致这玩意儿只能够做很粗放的 。
然后后来就发现这样把 GPS 这个技术就限制住了 , 它就没有带来什么商业价值 。 所以美国后来克林顿政府就宣布 , 最后还是把这个限制打开 , 就是说所有的人, 包括咱们的手机 , 都可以获得最精确的 GPS 定位 , 这样才会有美团外卖啊 、 滴滴打车啊 , 所有的这些应用 , 对不对 ?
那我就看到书上有这个例子 , 我说这个例子很好啊 ,因为这个也可以反映一种 , 就是到底对 AI 这个技术 , 你到底是抱有一种国家安全 , 所以不能搞 , 还是说开放共赢做生态 。
所以我就给 DeepResearch, 我就说好 , 你帮我去研究一下 2018 年这个 GPS 政策这个事情前因后果 , 重点研究当时为什么从不开放到开放的 , 然后你给我做一个和现在 LM 的政策的一个对比分析什么的 。
就这种东西 , 如果我读到这 , 我想去做个研究 , 一个小时可能过去了 。 那我就说 , 哎 , 那你先帮我做着 , 对吧 ?
我继续读书 。 读着读着好 ,他做完了 , 我说哦 , 原来这里面有一些很具体的 , 比如说当时美国是发明了 , 或者说搞出来这种定向屏蔽 GPS 信号的技术之后 。
他有些地方应该是可以给你屏蔽的 。
对 ,因为他就说 , 哎 , 这里打仗了 , 对吧 ? 虽然对我不利的情况 , 我给你暂时屏蔽了 。 我具备这种收放自如的开关之后 ,他才发现 , 那我平时我也打开 。
所以突然结果是说他开放了这个 ,但是他具体怎么解决这个安全担心的 ,因为他肯定有这样的担心嘛 。
所以这种是一个典型的说我读了一本书 , 我要继续去研究 , 原来我得花一个小时自己去得到这个结论 。
现在反正 DeepResearch 帮我搞啊 。 所以我自己为什么就觉得这个事情我是真的愿意为它付费的 ,因为这个时间价值对我来说肯定是划算的 。
嗯 , 你觉得 200 美元是完全值得的 。
200 美金这么一次研究 ,2 美金 , 那肯定是值得的呀 。
对 , 你有什么最近觉得很有意思的 , 你想和我们听我推荐的书吗 ?
推荐书目2:04:23
我给人工智能的从业者 , 或者比较稍微愿意去思考的更深刻一些的读者的话 , 推荐这本书还没有中文版 , 叫 《A Brief History of Intelligence》, 可能就翻译成 《 智能简史 》。
它其实是一个创业者写的 , 它是一个科技创业者 。 这是我去年的年度推荐书 ,2024 年 。 它从地球生命的开始到 GPT-4, 它把整个智能在地球的演进这 21 年的时间 , 总结成 5 次智能的大突破 ,并且把每次突破的驱动的原因 、 发生的变化 ,以及这个变化带来的结果解释得非常好 。
包括我也推荐给 OpenAI 的研究员 ,他们读了之后都觉得非常的好 。 所以我觉得是一个让我们对智能这件事情怎么来的 ,其实会多很多的启发 。
同时读完之后也觉得我们现在就在第六次大爆发的前夜 , 或者已经开始了 , 所以也很激动 。 这个是我觉得对于比较专业性读者的一个推荐 。
是叫 Max Bennet 那个人吗 ?
对 ,Max, 应该是 Max, 对 , 后面是一个大脑 。 然后另外一本书好像也是有点专业的 ,是我最近读了一本觉得很有意思的 , 叫 《 第一只眼 》。
它是讲寒武纪生物大爆炸的 , 就是在寒武纪之前 , 地球上已经出现了 20 亿年生命 ,但是 20 亿年生命一直是鼻涕虫的形状 , 就是一个软体动物在海里漂着 。
但是寒武纪内短短的几百万年的时间 , 生命突然爆炸成十几种不同的门类 , 然后产生了很多的进化 。
为什么 ? 当然有很多理论 ,有的说因为地球上的空气含量发生了变化 ,有人说因为这个海水这个成分发生了变化之类的 ,但是他提出的叫做光变假说 。
当然后来李飞飞在他的新书里面也引用了这个光变假说 , 我觉得还挺有道理的 , 就是在某一个时点 , 一个原始的山叶虫的身上出现了一个感光的斑点 , 它对光线的感受能力出来了 。
一开始所有的生命都是瞎子 , 所以它们就自己在那漂着 , 然后偶然撞到另一个把对方吃掉了 , 对吧 ?
当第一个感光点出现之后, 就发现它就获得很多优势 ,因为它能去到亮的地方 , 它能去回避暗的地方 。 然后所以它就开始越来越多的感光细胞 , 形成越来越大的感光面积 , 它就越来越能看到这个世界 , 直到有一天 ,其实这一天就过了 100 万年 ,在进化史上是非常快的时间 , 第一个眼睛出现了 。
第一个眼睛出现 , 使得大家都是瞎子的世界出现了一个有眼睛的生物 , 所以它立刻获得了巨大的生存优势 , 它开始捕食 , 然后被捕食的人开始进化出甲壳 , 然后也开始进化出眼睛 , 所以地球开始了这个生命进化的竞赛 。
那这个其实让我想到现在 AI 其实也是有点这个感觉啊 , 包括 DeepSeek 的发布或者这些 , 就是当我们开始竞争的时候 , 那在那个 《 爱丽丝漫游仙境 》 里面有一句很著名的话 , 叫红皇后假说 , 就是你必须全力奔跑才能留在原地 , 或者不被消灭 。
所以那生物圈的进化就是大家都拼命的奔跑 , 所以进化出来这么多的生物 。 那么 AI 这个里面其实也是 , 对吧 ?
不管是说模型要不停的奔跑 , 还是这些公司要不停的奔跑 , 还是以后可能发现的这个 AI 的公寓房啊 , 这些不断的这个奔跑 , 那这种奔跑让我们获得了更好的技术 , 让世界变得发展啊 。
那同时这都是生存竞争也好 , 或者要进化也罢 ,其实这是生命的特点 , 这是智能的特点 , 这也是进化的原因 , 进步的原因 。
所以我觉得这本书也给我很多的启发 。
对 , 你刚说第一只眼 , 这个我觉得还挺有意思的 , 就是你如果你想智能这件事情 ,其实语言是比较后才出现 , 就它是比较高级的一种智能形态 。
所以语言模型一开始用语言去压缩肯定是对的 ,因为这是智能含量最高的东西 。 所以想到的点就是 , 显然有很多智能是没有用语言表达出来的 。
那么用语言去训智能 ,是否就会受到语言本身的限制 ,以及说如果 AI 非常非常的聪明 , 它要重新发明一个语言 , 它可能不跟我们现在说成这个样子 。
对 , 之前刘慈欣有一本科幻小说 ,不就是外星人在想象 , 就认为人类靠语言交流是一种非常低效率的方式 。
所以我就说我们从语言模型开始 ,但最后也许我们会超越语言模型 。 如果让 AI 去用语言去沟通 , 它的思维速度比我们快 1 万倍 , 它的智能比我们高很多 , 它的语言就不会跟我们一样 。
所以我觉得为什么现在回头去看智能怎么产生的很重要 ,是因为我们现在看到的是智能经过几十亿年之后的那个结果 , 叫语言 。
但是再走一遍未必是这样的 , 对不对 ? 所以回到源头去探索它的那个原动力和它的每一次变化的原因 。其实那本书很有意思 , 就是它里面也提到了 , 比如 Reinforcement Learning 怎么来的 , 它里面其实有很多进化学上的例子啊 。
所以我是觉得读了给我很多启发 。
嗯 , 那今天非常感谢余森做客 《 晚点聊 》, 和我们从 O1 还有 R1 的这两个进展 ,也是改变了整个 AI 格局的事情聊起 , 然后聊到它后面带来的一系列的涟漪和变化 。
那今年 2025 年, 我们可能又会期待看到很多新的东西 , 包括 Agent 的这个 PMF 的出现和出圈 ,以及再往下一个更强的 、 更多的理事实时刻的总结 。
嗯 , 那今天的节目就到这里 , 谢谢各位的收听 。
好的 , 非常荣幸能够和 《 晚点 》 畅聊 AI。 我也相信 25 年我们会看到更多的惊喜 , 理事实时刻会有更多的出现 。
现在我们还在 AI 智能革命大爆发的第一天吧 。
嗯 ,Day one 啊 。
好 。
本期的零点呈现环节 , 这期信息量很大 , 余森讲到的很多事和洞察 , 都与我们之前的其他 AI 访谈有呼应 , 或者是对同一个问题的不同视角的思考 。
第一个是我们中间花最多时间讨论的 Agent,99 期 MiniMax 严俊杰的访谈中, 当时我们聊的就是 MiniMax01 这个新模型为何会被定义为面向 Agent 的模型 , 做好 Agent 需要什么能力 。
两期节目其实有总结一些共性 , 这包括更强的推理和规划能力 、 处理更长文本的能力和更长的记忆能力 , 这也是我们在最近两期注意力机制改进的节目中提及的大背景 。
还有多 Agent 的协同能力 ,Agent 带着 Agent 干活 ,以及从读到写的 Agent 编程和调用工具的能力 。 第二个想分享的是 , 这次我们提到 DeepSeek 会新开源一批 AI infra 的成果 , 这可能会怎么冲击 AI 创业生态 。
那在这期节目录制后的一周 ,也确实发生了一些关于 AI infra 和 MaaS 服务及 Model as a Service 的商业模式是否成立的讨论 。
详情可见我们第 105 期节目 《 路程科技 》 的尤洋聊了为何他不再做 MaaS。 第三个是我每次都很好奇 , 不同人会怎么看 AGI 更快到来后会发生什么 。
第二期节目中,00 后的王子涵说人的价值是人的存在本身 ,而余森有一个从社会结构角度的洞察 , 警惕 AI 的不当使用会带来更大的贫富差距 。
比如这一期中我们设想的一种情形 , 如果富人可以有很多很多的 Agents 帮他提升效率 , 我们从算力资本到结果的转化 , 可以以更自动化 、 能处理更复杂任务的 Agent 为桥梁 , 那资源可能会向本身有资源的人和组织集中 。
本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。
下期再见
。






