开场0:00
欢迎收听 《 晚点聊 》, 我是曼祺 。 今天的嘉宾是明势创投合伙人夏令 ,在 2022 年初 , 夏令在 AI 热潮之前投资了大模型创业公司 MiniMax 的天使轮 。
明势创始合伙人黄明明后来有一次和 MiniMax 的创始人闫俊杰一起回忆了最初的投资故事 。在米哈游联创刘伟的介绍下, 明势第一次见了闫俊杰 , 那会儿其实大家都没太 get 到闫俊杰要做什么 , 好在夏令听懂了 , 回来后说 " 这个项目一定要投 "。
夏令同时也是文生图应用 LibLib.ai 和具身智能明星公司逐际动力的早期投资人。 这期我和夏令聊了 Agent 行业的竞争形势推演 。在他的认知里 ,Agent 是一个横跨软硬件的新机会 , 除了 DeepResearch、Devin 这些主要在云端的 Agent,以及接下来可能会进入白热化竞争的与手机结合的 Agent, 和车结合的自动驾驶 、 和机器人结合的具身智能 , 都是 Agent。
它们各自处于不同的成熟阶段和竞争形势中 。 夏令的一个判断是 , 到今年下半年开始 , 围绕通用入口级 Agent 的大战就会拉开 。
最为焦灼的战场会是以手机为终端的通用 Agent 产品 , 主要玩家是掌握超级 APP 或流量的大厂 , 和自己掌握模型迭代能力的头部大模型公司 。OpenAI、Google、Meta、 字节 、 阿里 、 腾讯都不会放过这个机会 , 美团 、 小红书乃至汽车智能领域的理想也都跃跃欲试 。
而在早期投资的视野里 , 大多数创业公司的机会可能在垂直和专业的 Agent。 更通用的 Agent 很可能会因为处在模型公司的主航道上而备受挑战 , 模型公司主航道的边界在哪儿 ?
今年 2 月 Google 的一份白皮书有一个比较清晰的框架 , 我们在节目中有展开 , 相关图示我也贴到了 shownotes 里 。
夏令已经投资和观察到了一些不同的垂直 Agent 的商业模式 , 这也是中美差异所在 。在中国 , 一些新公司不再用 " 做工具 " 的思路做 Agent 来赚订阅的钱 ,而是用 Agent 直接做服务 , 获取收入分成 。
因为中国的客户更愿意为效果本身付费 ,而不是为效率付费 。 至于近期被朱啸虎的言论推到风口浪尖的具身智能 , 夏令既投资了这个行业 ,也从他的角度讲了风险 。他认为具身最大的危险并不是朱啸虎提到的目前没有商业化的 PMF, 机器人不能去工厂和商店打工 ,而是具身模型的技术还没有收敛 , 机器人大脑还没有来到它的 GPT-3 时刻 。
下面我们就正式进入本期节目吧 。
今天 《 晚点聊 》 非常开心又邀请到了一位从来没有录过播客的嘉宾 , 明势的合伙人夏令 , 来做客我们的节目 。
夏令他一直是在关注科技和 AI 的投资 ,他是 MiniMax 和 LibLib 的早期投资人, 明势同时也是理想的早期投资人。
所以整个明势其实是有跨软件和硬件的 AI 的综合视角的 。 夏令你可以和我们的听友打个招呼 ,也可以介绍一下自己 。
谢谢曼祺 。 大家好 , 我是明势合伙人夏令 , 很高兴今天参加 《 晚点 》 的播客 。 我也可以快速先把明势和我这边的情况给大家快速做个介绍 。
明示我们是 2014 年成立 , 到现在 10 年的一家早期 VC。 过去 10 年里面 , 我们还是比较有幸一直专注在科技赛道的早期投资 。
所以因为这种专注 , 就像前面曼祺所说 , 我觉得过去 10 年里面一些比较大的这些技术创新的机会 , 包括智能电动汽车 , 包括 AI, 我们都还是抓到了一批有代表性的头部公司 , 包括理想 、MiniMax、 具身里面的逐际 、 文生图里的 LibLib, 还有包括像虚拟角色平台的造梦 ,以及今天也会提到的 Agent 的爱与智能 ,以及包括硬件里面的像智能眼镜的 Vitre, 包括 AIDC 里面的渗透一体的芯
片 , 然后光芯片 , 还有光 IO 等等一系列的项目 。 在过去的十几年的风险投资的生涯里面来讲的话 , 我自己比较擅长的一点还是能够在不同的技术领域里面通过交叉融合 , 然后发现一些早期的一些机会 。
就这次 AI 的这波浪潮而言的话 , 我觉得我们可以把不同的受 AI 影响或 AI 驱动的行业打通来去看 , 这里面包括把自动驾驶 、 大语言模型 、 具身 、AI for Science 打通来看 , 然后从大语言模型的视角 , 从模型公司的视角去理解自动驾驶 , 去理解具身 ,其实都是有一些非常不一样的这些认知 。
第二个点来讲的话 , 就是我比较喜欢把产业链打穿来看 , 就产业链上下游一起去看 。 这样来讲的话 , 就是从模型的视角你去看 AI 的应用 , 去看 AI 底层的 AIDC, 包括芯片 、 通信等等这些 , 你也会有一些新的一些认知 。
因为我们今天的主题其实是重点去聊 Agent, 对于 Agent 这一点的认知跟理解来说的话 ,其实模型公司它的认知的理解 , 或者说它格局的高度是远高于应用型公司 ,也远高于具身公司 。
因为在我看来 ,不管是自动驾驶公司还是具身公司 ,其实它本质也是一家 Agent 的公司 。
其实那个就是你刚才讲了一部分你对 Agent 的理解 , 就是你认为是可以跨领域来看的 , 就偏软件的这种有一些 Agent 对吧 ?
Agent 定义4:58
然后像自动驾驶 、 像机器人其实它也是一个 Agent。 如果更完整的来说 , 你会怎么来定义 Agent? 因为这个词非常热 , 大家都一直在讨论 ,但我想可能目前这个阶段每个人对它的理解都会有一些不一样的地方 。
对 , 我觉得 Agent 其实现在来说确实是一个名牌 。 我觉得很多人关注 Agent 是因为 Manus 的火了 , 就是 3 月份的事情 。
但是其实对我来说的话 , 我觉得一个是来讲我们投资 Agent 其实是从去年的下半年开始的 。 第二点来讲的话 , 我觉得 Agent 从一个大家关注的技术趋势变成了一个我们所有背头企业 ,不管是应用公司还是具身公司 , 都必须高度重视 ,而且是列为一个明确日程上研发方向的一个事情 ,其实是从 DeepSeek 之后 。
为什么这么去说呢 ? 就是因为其实 Agent 这个概念并不是说这几个月刚有的概念 , 对吧 ? 其实最开始提这个概念其实比较早的 , 我觉得就是影响比较大的应该是 OpenAI。
它其实把整个 AI 的这个能力 , 它从 L1 到 L5 其实列了五级 , 对吧 ? 这里面来讲的话 , 就是 L1 级其实是一个 Chatbots, 对吧 ?
就是最开始的这种 ChatGPT 的形态 、DeepSeek 的形态 、Kimi 的形态 。 第二级来讲的话 ,其实说白了就是一个有推理能力的 AI 的一个 。
这个来讲的话 , 就是最典型的代表其实就是 DeepSeek。其实为什么我说 DeepSeek 之后让我对这个事情有比较大的一个触动呢 ?
是在于就是当一个 L2 的一个产品它推出来的时候 , 我们发现它其实对于 L1 的产品是一个降维的 。 就是你在 L1 产品里面积累的众多的 DAU, 然后众多的这个用户 , 当一个 L2 的产品出现的时候来讲的话 , 是一个降维的 。
那这个事情引起来的下一步就是说 ,在这个五级分类里面 ,L3 是 Agent,L2 它只是说我能够解决问题 ,有很强的推理能力去解决问题 。
但是 L3 Agent 指的是说它是一个系统了 , 它能够去解决一个任务 , 这个任务可能是通过完成一系列复杂的问题 , 最后构成了一个任务的一个解决 。
那当一个 L2 的产品出来 , 对一个 L1 产品是一个降维打击的时候 , 那自然而然我们肯定想到就是说 L3 的产品如果一旦出来 , 那是不是又是一次降维打击 ?
那这个就变成一个很有意思的问题 ,L3 的产品 , 就 L3 就是 Agent, 就 OpenAI 描述的 Agent 的这个 timing 是什么时间 ?
所以你刚才的逻辑是说 ,因为 DeepSeek 的出现让大家看到了 L2 对 L1 的降维打击 , 所以在 L2 这个阶段 , 大家已经提前在想我下一个降维打击的东西是什么 。
然后一个大的共识就是它是智能体类的东西 。
对 , 它应该是一个 Agent, 它应该是一个能够解决一个完整任务的一个系统 。 对 , 所以其实今天来讲就是说什么叫 Agent,其实坦率来讲的话 , 一个完整精确的定义是没有的 。
但是我觉得大概它有一个雏形 , 雏形就是说它应该能够去调用很多外部的工具 , 与外部世界产生交互 , 然后执行一系列的动作 , 然后中间可能跟人也会有交互 ,但最后完成一个人指定的任务 。
对 , 那这个其实是跟之前的 L1 或 L2 来讲的话 , 就是它其实它是囊括了之前的能力的 ,但是它从维度上来讲又是超越之前的能力的 。
对 , 所以它是统一了其实自动驾驶 、 机器人和一些软件应用的 。 因为如果你交互的环境是物理世界的 ,其实就我前面说的那些 。
如果你是只在一个虚拟世界在网上或者在电脑上活动 , 就是大家现在可能狭义的比较讨论多的这种 Agent。
是的 ,是的 ,是的 。 所以在我们的视角里面来讲的话 , 一个对 Agent 的这个理解 ,其实它不仅仅是对于 AI 应用或者说是 AI 模型它有帮助 ,其实它同样其实对于自动驾驶 、 对于具身智能这些公司其实也一样是有帮助的 。
对 , 它可以让这些公司提前看到一些下一个阶段它必然会发生的事情 。 因为你所交互的环境不一样 , 你所需要的这个软硬件技术不一样 ,但是你的内核其实是本质上是一样的 。
所以为什么我们说其实跨领域去看其实是会有很大的一些收获 。 对 ,其实也是这个 。 但反过来说其实就是因为 timing, 就是大家很关心 L3 什么时候到 。
就是 Manus 其实这次它在评测自己能力的时候 , 它也讲了一个 GAIA 的评测体系 , 对吧 ? 其实如果大家细看的话 , 这个 GAIA 的评测体系里面是分成三级的 。
第一级来讲的话 , 就是我基本上可能只调用一个工具 , 对吧 ? 甚至不用工具 , 然后我只做可能有限的 , 可能五步以内的这样的一个推理 , 最后解决一个任务 , 对吧 ?L2 级来说的话 , 我可能调用若干工具了 ,但是是小于十步的这样的一个步骤去解决一个任务 。
但 L3 来讲就是调用非常多的工具 , 然后很复杂的一套任务体系 , 最后完成这个任务 。 那在 L3 这个层级上 ,其实 Manus 的这个评测指标 , 它的完成率大概是只有 50% 多 。
那从这个指标体系上来说 , 或我包括我也跟一些做模型大模型公司的同事去碰过 , 我们觉得比如说可以设一个初步的一个直觉的一个时间节点 ,Agent 可能可以达到的一个效果 , 那就是有可能在一年之内 , 甚至有可能更激进的人可能会说是在今年年内 , 对吧 ?
那就是无非就是今年就是 12 月份还是明年的这个时间点 ,AI Agent 或者说是大模型公司推出来的这一套 AI Agent 这套技术框架 , 这套技术体系和一个初步的一个产品 , 它应该是有可能是可以做到把 GAIA 至少可以做到 80% 以上这个样子 。
你就说 GAIA 最难的那一档 ,L3 那一档做到 80%。
80% 的水平的 , 或者说有些可能说的更加简单粗暴 , 就是说可能 80% 人类的工作它都可以去做 。 那或者我把这个事情拆解下来 , 就是说这个 80% 有可能是 80% 人的岗位 , 然后也有可能是这个岗位里面的 80% 的工作任务可能靠大模型公司它推出来的这套基于 Agent 的这套能力 ,其实就已经可以完成了 。
而这个时间点以多家公司的这个预估来看的话 ,其实就是在一年之内 。 那其实这个事情会对于所有相关的不管是模型公司还是应用型公司 , 甚至是对于将来的具身公司来说 , 我觉得都是有启发的 。
说的再残酷些 , 如果今天不站在 L3 Agent 实现的基础上去思考自己的业务的话 , 或者如果不能尽早的去思考和储备自己 Agent 形态的产品的话 , 我觉得很有可能一年内就会被别人的 L3 Agent 类的产品降维打击 。
技术框架11:14
那接下来我们可以沿着你观察到的这个现象 , 就是大家已经开始思考的 L3,也就是 Agent 智能体的技术和产品形态 , 来聊聊已经在萌芽的 , 或者说我们很快会看到的一些变化 。
我觉得还是可以先从技术的角度开始聊 ,因为模型能力我理解它是产品和应用能进阶到帮你完成复杂任务的智能体的一个基础 。
首先最积极的方面是整个技术进步的这个斜率还是非常陡峭的 , 它还是在持续拉动着整个 AI 和包括 AI Agent 的这个能力的提升 。
我觉得如果我们去具体去探讨这里面的技术趋势的话 , 我觉得其实我们不妨回到一个更有框架性的体系里面去探讨 。
我其实比较喜欢就是还是 Google 在今年年初其实发布了一个 Agent 的一个白皮书 , 它在那个里面来讲的话 , 我觉得它其实对 Agent 的 , 尤其是 AI Agent 这个能力 ,其实提出了一个非常清晰的一个框架 。
那具体的来说的话 , 我觉得这个框架它其实分成三层 。 如果一个 AI Agent 来讲 , 它肯定是内核 , 它的内核是一个 model,也就是我们熟悉的这些大模型公司 , 它们原来的这个最核心的这些模型的这个能力 。
但是如果想完成一个任务 ,其实是你需要有一个编排层的 。 那这个编排层首先需要告诉这个 Agent 你要干什么 , 给它一些明确的一些指示目标 ,以及这个 Agent 它需要 memory, 需要记忆 , 包括长短时的这个不同的这个记忆和数据 。
以及还有很重要一点来讲 , 它要干成一件事情 , 它要完成一系列的复杂的推理的这个任务 , 所以其实它是需要有一定的这个规划和推理能力的 。
然后还有一个很重要一点 , 既然是一个 Agent, 它需要跟外界环境做交互 , 那就它一定需要使用大量的这个工具 。
所以在 Google 的这个白皮书里面 , 一个 AI Agent 它其实包括模型 、 一个编排层和一个工具这三大部分构成的 。 那如果我们去细看这块的话 , 首先这个 model 这一层 , 我们可以能够看到持续的预训练 ,post-training 其实持续的在做快速的提升 ,以及包括它们有很强的融合的趋势 。
还有一点值得关注的就是整个多模态的这块的进展其实非常快的 , 尤其是比如说声音 , 可能大家对于多模态的理解关注比较多 ,但其实声音其实提升的也非常明显 , 尤其在这近半年, 我已经听到了很多在生产场景 ,不是 demo 场景里面 , 非常接近于人的 , 带有人的情绪 、 口音 , 然后甚至是方言这种非常好的这种交互的这种语音的这种模型
, 延迟也非常的低 。 那所以整个模型层其实是没有放缓任何技术迭代的脚步的 。 那我们重心我们可以看一下这个编排层相关的 , 这里面一个是其实它就是它的记忆 。
记忆这块来讲 ,其实坦率来讲 , 今天模型提供的原生的 long context 的这个能力是不够的 ,因为不管是 OpenAI 提供的大概 128K、64K 的这个 context 长度 , 还是这个 DeepSeek 提供的 OpenAI 一样的这个 long context 的长度 ,其实对于很多想去解决不管是通用还是垂直的这个场景里面的 Agent 来说的话 ,其实都是不够用的 。
所以我们也看到其实 OpenAI 最近也是在发力这个 memory。
它们刚上了这个功能 ,4 月 11 号的时候 , 全局记忆功能 。
对 , 包括 Sam Altman 在 Twitter 里面也是说 , 那有可能记忆功能会是一个下一个新的一个 screen layer。 所以整个 memory, 包括我们自己的这个 MiniMax, 它其实也是在这个 long context 这块来讲 , 它想提出来基于 linear attention 的方式做 400 万 token 的 , 还是海底捞针可以命中率特别高的一个新的这个模型 ,其实一定程度上也是想解决这块的面向 Agent 这块 memory 的相关的一些问题 。
不过 OpenAI 最近发的这个全局记忆功能 , 它是不是并不是基于一个新的模型 , 就理论上它那个模型的上下文大小应该没有变化 。
对 , 所以大家其实都还是在猜测它到底是怎么实现的 ,因为如果是传统的 RAG, 它肯定命中率是不够的 。
对 ,而且我们也能够看到 RAG 在从静态的这种 RAG 变向就是 Agent 的 RAG, 那其实一定程度上来说的话 , 它到底是一个什么样的机制 , 是一个 context 机制 , 还是一个 RAG 的机制 , 还是一个什么样的机制 , 我们也很好奇 , 我们也很想了解 。
就是它并没有对外去讲它怎么做到的 。
我感觉到了 , 就是众多的行业里面的人其实都还是在猜 , 然后在用自己的方式再去做尝试 。
你被灰度到这个功能了吗 ?
我没有 。
你还没有是吧 ?
但是我有一个创业者被灰度了 ,而且他应该是被感动到 。
被感动到 ?
对 。
他被记忆功能的什么东西感动到 ?
他被这个记忆功能对他的职业和性格的描述 , 然后我觉得还是应该触及到他的内心 。
就是他直接问他 , 就基于你以前我们俩的对话 , 你对我的一些理解 , 然后他觉得对方说的很在他的心窝子上是吗 ?
对 ,是 ,他识别到他是一个 CEO,也识别到了他的管理风格和人性上面一些闪光的地方 , 可能是我自己作为一个他的投资人也是很认可他的一些地方 。
我觉得可能从一个工具提出来了一个对他过往使用的记忆 , 最后做出一个对这个人的总结 , 我觉得这一点其实是应该是一个 wow 的时刻 。
那除了记忆之外的话 ,在整个编排层里面 , 前面也提到其实有非常重要的一块 ,其实就是这个的规划和推理能力 , 只有它具备规划跟推理能力 , 它才能真正的去自主的去完成一个任务嘛 。
那在这块来讲的话 , 我们可以看到现状是 , 如果一个任务它是非常明确的 , 那其实对于 Agent 来说的话 , 它甚至可能不需要具备那么强的推理能力的模型 , 它就可以基于 workflow 的方式 , 然后去做它的规划和推理 。
那就是工作流的方式 , 这个也可以给大家解释一下 ,因为 workflow 最近也是一个被频繁提到的高频词 。
是 , 我可以快速的说一下, 就是 workflow 肯定是跟大家日常去完成一个人日常去完成一个任务的工作流是不完全一样的 ,因为 workflow 它本质上来讲其实是基于对于人的任务完成一个任务的工作流的理解 , 把它拆解成为更细的 、 更多步的推理的串并联 。
如果一个人在他的工作手册上去完成一个任务是有若干步的话 , 那其实每一个人因为他具有这样人是具有智能的 , 所以很多隐藏信息 、 隐藏的这个知识 , 包括隐藏的任务 ,其实人可以自主的去完成 。
但是因为毕竟现在 Agent 的能力 , 尤其是模型能力 、 推理的能力 、 规划能力还不够 , 那所以对于一个明确任务的情况下的话 , 我们可以把它扩展成非常细颗粒度的 , 然后这样的一个连续的推理的串并联 , 从而的话去规避掉现在模型不具备的这些隐藏的这种认知能力和隐藏的这种推理能力 , 从而大大的提升整个任务实现的这种可能性 ,以
及把目标人群服务的更好 。
所以简单来说就是它是基于模型现在的边界和能力做的一套比对人更细的那个 SOP。
对 , 可以这么理解 , 然后甚至是可能不止一个 Agent 在这一个环节里面 , 所以大家会有时候会遇到一个 multi-agent 的机制 , 就是说可能因为还是因为现在这个 model 的能力不够 , 所以可能一个 Agent 它是负责把握整体的这个进度 , 一个 Agent 可能负责情感输出 , 一个 Agent 可能负责后面的一些数值的计算 , 可能都是有可能的 。
最后大家综合在一起 , 然后去通过一个串并联的方式 , 最后实现了这样一个任务的规划和推理 。
就是它也有可能是不同的模型来支持的 。
这个是目前来看的话就确实是这样 , 比如说可能推理能力大家可能会用 DeepSeek 或者是用 Anthropic 的 Claude, 然后可能在这个情感输出上大家可能会去用 Dolby 的模型或者说用 OpenAI 的模型等等 ,其实是一个多模型 multi-agents, 然后串并联混用的一个 workflow。
那理论上来说 , 如果模型能力变得越来越强 ,也很有可能就是不需要这么多步骤了 , 或者说不需要这么多 Agent 一起来协作了 , 就有可能一个模型它就能搞定 。
对 , 理论上来讲的话就是说 Agent 能力越来越强 , 那你基于 workflow 的应该就由单一的这个来去做嘛 。
对 ,但是就是你越往垂直领域去走的话 , 那你肯定这个就前咱们前面说过的就是这个壁垒其实还是存在的 。
这是第一点 , 就是垂直领域想做好其实还是不容易的 。 对 , 第二点来讲就是前面说的就是那你这个壁垒到底应该在什么地方 。
你今天来讲你先发 , 然后摸索出来一套 workflow 可以做 ,其实一定程度上来讲这是一个产品定义的壁垒 , 或者说是一个工程壁垒 。
这个东西来讲随着 Agent 的门槛持续下降 , 这个壁垒肯定是会被削减的 。 所以那它的这个壁垒一定会又会建立在别的地方 , 这个别的地方可能是平台效应 , 可能是一个新的组织或新的这种业务流 ,而不是仅仅就是说这个现有的这个工程本身 。
那刚才是说了推理还有编排的能力 , 还有一个是记忆的能力 。 最后可以讲讲就是 Agent 这个框架里面工具使用能力的大概一个提升趋势是怎样的 ?
你们有看到什么变化吗 ?
我觉得工具的变化其实在最近这几个月应该还是非常显著 ,而且也是得到了很多人的关注 。 但是工具其实并不仅仅是工具本身 , 还有包括它整个工具的一个生态 。其实大家能够看到就是说各家其实也都在做自己的工具 , 然后最典型的其实就是 MCP。MCP 其实就是一定程度上来讲的话 ,在去极大的扩展了整个这样的一个工具的生态 , 让这个 Agent 可以触达的边界
显著的去扩大嘛 。 但其实如果你回过头来你去说 , 就 MCP 它 Anthropic 推的初心 , 它并不是说是为了其他的 Agent 发展的更好 , 它推的初心是它为了让它的自己的 Agent 能够用得更好 。
然后因为 MCP 确实是具有行业意义的 , 然后逐步又被 OpenAI 能够也能够接受 , 所以慢慢这个生态形成了 。
那问题是一个 MCP 生态形成之后最大的受益者是谁 ? 那其实还是这些 Anthropic、OpenAI。
就你觉得还是做模型的公司 ?
还是这些公司 。
为什么它们是最大的受益者 ? 其实做 Agent 应用的公司不也是受益吗 ?
也是受益者 ,但是其实最大的受益者是它 ,因为本身来讲的话就是最需要各行各业的 API 接口的 ,其实就是做通用的人嘛 , 对吧 ?
举个例子 , 比如说对于 Meta 来说的话 , 它其实是把 29 个工具 , 据说是 29 个工具它自己做了集成在里面了 。
因为 MCP 是一种协议嘛 , 就相当于比如说我是一个工具 A, 对吧 ? 然后我支持了 MCP 之后,Meta 作为一个 Agent 应用 , 它就可以比较方便的来调我 。
对 , 我大概是这么理解的 。 但这个事情就比如说从 29 个到 290 个 , 对吧 ? 那这个之前是有大量的开发的工程量 。
Meta 这 29 个里面你知道有多少它们是本来就支持了 MCP,其实 Meta 可以比较简单的调的吗 ? 还是它都是 Meta 自己写了一遍 ?
它自己在那个 Twitter 里面说 , 它其实当时做的时候其实没有 MCP, 应该还是用 Function Call 等等这些方式去工程化开发的 。
那现在其实 MCP 这个生态变得更繁荣之后, 对 Meta 这种公司来说 , 它就可以更方便的调更多工具 。
对 ,但是问题是这个事情对于 Anthropic、 对于 OpenAI 来讲也是一样的 。
我最近跟一些做 Agent 的人聊 ,他们也讲到现在有一个瓶颈 , 就是其实你一个 Agent 调很多工具 , 比如超过 50 个或者更多之后 ,其实你这个完成一个任务的质量也是会大打打折的 。
对 。
就现在它的问题可能是在于说 , 就算有很多工具支持了 MCP,但现在的这个模型的能力不支持它去用那么多工具 。
因为 MCP 其实它还是 Function Call 的机制嘛 。 对 , 那其实当 MCP 多了之后, 就 MCP Server 多了之后 ,因为还是模型要去做选择 , 那模型该选择谁 , 它选择对不对 ,其实反过来说其实就是你说的这个模型能力的一个考验嘛 。
就今天这个问题肯定是没有解决的 ,但我觉得这个模型能力的提升它会一步步解决的 。 但这个就是 MCP 这个事情 , 就是你能够看到整个我们前面讲整个框架里面各个环节能力都在快速的提升 , 然后同时呢 ,MCP 又把整个 Tools 的这个生态又搭建了 。
那这个时候来讲的话又会变成那个问题 , 就是谁去做这个通用入口 。 就是今天来讲的话 , 就是尤其是在中国 , 对吧 ?
所有的这些互联网大厂都想成为通用入口 。
入口之争22:57
那这个观察其实已经从一个技术趋势到了商业竞争的变化 。 我们可以展开讲讲就是 Agent 作为一个通用入口可能带来的变化 , 或者说你已经看到哪些公司已经有什么动作了吗 ?
对 , 就是比如说从海外来看的话 ,Anthropic、OpenAI、Google 都想成为那个通用入口 , 对吧 ? 都想借助这个 MCP 这个生态去做 。在国内 , 阿里 、 字节 、 理想 、 腾讯 、 美团 , 当然也不排除将来可能包括小红书 、 滴滴之类的都想做通用入口 。
我说通用入口意思不是说它们只做一个自己原来核心业务的一个 Agent,而是这个 Agent 是通用 Agent, 就是也可以回答问题 ,也可以写个邮件 ,也可以做个画 ,也可以识别一些这个图片 , 都是往通用的 Agent 的方向去定位的 。
理想 、 美团和小红书也有这样的野心吗 ?
小红书我这个不确定 ,但是至少从理想和美团 , 我觉得这个是已经是公司在公开场合明确说了的 。
那我觉得对于阿里 、 字节 、 腾讯来说的话是不可能放弃的 。 但是我们需要这么多入口嘛 。
因为你的注意力是有限的 , 就你会用的东西是人会用的东西是有限的 。其实腾讯的微信现在它其实是类似于你刚刚说的这个入口 。其实如果我觉得可以做个比较简单的类比 , 就比较形象的 , 大家可能比较好理解的 , 就有点类似于就是腾讯的微信是这样一个 , 如果你把它看作为一个 Agent 的话 , 上面又不是很多小程序嘛 , 这些小程序其实就是你
可以去用的那些工具 。
它的小程序可能将来就是它的各个 MCP 的 Server。
对 , 就是你在微信上点到那些小程序 , 它就是一个图形界面的方式自己去调了这些工具 。
对 ,但问题是就是说美团 、 拼多多 、 滴滴这些就是从以前腾讯的微信的生态里面 , 微信的九宫格里面逃离的 , 终于有了自己独立的流量的 。
它应该从内心里是极度的不愿意它去回归到其他家的所谓的通用 Agent 之下的九宫格里面 , 对吧 ?
别人成为流量入口 , 它成为一个被分配调动的资源 。
对 , 所以有的人可能是因为比如像腾讯或者字节这样的 , 阿里这样的公司 , 它本来就是在这个 Top 的这个生态位 , 对吧 ?
然后有的可能是即使野心不上线 , 它其实也是一种防守 ,因为如果你不做这个事的话 , 你可能在新的比如说 AI 的 Agent 的这个生态里面 , 你可能就被盖掉了 。
对 。
就是 over the top 的下面的那个 。
是的 ,是的 。 因为我在想滴滴它应该不太愿意自己的积累的司机 , 美团积累的商家和外卖骑手是可以被其他家这些公司可以随意的被去调度的 , 对吧 ?
不过对它们来说其实它们不是也很好防守吗 ? 就是我其实比如滴滴它可能也不用自己成为这个入口 。
如果别人想调就别的 Agent, 别的 AI Agent, 比如想实现说我通过这个 Agent, 我人跟它自然语言交互 , 我就能打滴滴的车这件事情 , 那滴滴不支持不就完了吗 ?
我觉得一段时间它肯定是不太会去愿意支持的 。 对 , 那问题是也可能会有别家会来去支持嘛 。
我想想 , 比如好 , 那我就换个例子可能比较典型 , 比如说美团和饿了么 , 比如说可能你的意思是说 , 比如说美团如果不支持的话 , 然后行业第二饿了么 , 它如果去支持 , 然后让它的比如说单量变多 , 这可能会逼迫美团去介入这个 Agent 的生态 。
对 ,但对于美团来说 , 它肯定自己希望还是掌控这个流量 , 掌控这个入口嘛 。 对 ,因为大家都知道入口的价值 。
它在上个时代其实从别人的入口那获得流量成长起来 , 它已经变成了一个几百亿美金 、 千亿美金的公司 , 它不太会希望自己又很快变成一个依附于别人的供应链整合的这样的公司嘛 。
你觉得我们什么时候会看到 Agent 入口之争的非常显现化的表现 ?
从时间角度上来讲的话 , 可能大家比较激进的是可能是今年下半年, 一定程度来讲你看又跟前面说的 Agent 那个时间点是在匹配上 。
因为我们前面讲的模型能力一直讲的是模型会直接首先它先会助推自己的就是通用的 Agent 的这个应用嘛 。
那你现在从公开信息上, 就我前面讲的这个里面的部分互联网巨头讲了自己的要去推出 Agent 的时间点 ,也是跟这个时间点是匹配的 。
你大概知道比如说某些公司会是什么形态的 Agent?
通用 Agent, 就是通用 Agent 的一个产品 , 可能是放在就是放在手机上这个一个 App,但它是一个通用 Agent。
就你觉得大厂的这个竞争是会放在手机上而不是在电脑端是吧 ? 因为像 Meta 这种我感觉它好像是更包括 DeepResearch 还有那个 Computer Use 都是更偏云端的 。
那还是因为人群嘛 。 对 , 就因为你使用美团的服务的 , 或者使用滴滴服务的 , 那你这群人群绝大多数还是在手机端它在去使用 。
所以它这个人群更广 。
或者说它适用的场景它就是在手机端 。
就是移动场景 。
对 ,因为今天咱们还看不到一个下一个智能硬件终端嘛 。
对 ,因为移动场景的网民我觉得还是比云端的更广的 。
对 。
因为它是深入到你的生活的嘛 , 它不光是在一个办公和生产的场景 。
对 , 所以这里面还有另外一个问题就是说如果将来下一代硬件出来了 , 如果说下一代的智能硬件假设是以眼镜的这个形态出来了 , 这个硬件一定是一个以 AI 为核心的硬件 , 对吧 ?
那这个以 AI 为核心的硬件它的操作系统应该是一个 AI Agent。 这样一个硬件可穿戴设备上因为它的空间 、 续航 、 性能都是有限的 , 对吧 ?
所以大家大概率会觉得我在这上面可能大概就放一个 3B 或者说是 7B 这样的一个模型 ,而且你只能放一个模型 , 常驻内存 。
那请问这是不是一个入口 ? 因为如果这是一个入口 , 那其实这个入口的可选择性其实是更小的 。
但这个未来是不是比较远 ? 就眼镜离真的能变成下一个终端 , 这时间很不确定吧 ?
我觉得很有可能大概率是也是两三年要发生的事情 。
那你这算可能还比较乐观的估计 。
对 。
不过另一方面确实我们看到大厂都在布局眼镜这种新的终端 ,因为阿里像天猫 、 静灵现在也在做眼镜 ,而且它是放到就是信息智能事业群 , 就阿里 ToC 那边吴家整个在一起管 , 然后字节其实也是在做眼镜 。
还有另外一个我觉得有意思的问题就是 , 如果这个 Agent 这个东西出来了 ,其实它会对整个现在的这个商业模式 , 包括各个大厂 , 就又会有一个很大的挑战 。
我觉得首先比如说最突出的其实就是广告 , 对吧 ? 因为广告是过去相当长一段时间内我觉得是个非常成功的一个商业模式 , 尤其是互联网整个广告变现的这一套 。
对 , 那问题现在是就是我现在都是让 Agent 去工作了 , 对吧 ? 至少是对于 save time 的效率工具型的 , 我让 Agent 去工作 , 我人其实是不会去浏览那些信息了 , 我的广告是不是触及的就少了 。
你看 Perplexity 你看那个豆包来说 , 它的那个结果排序肯定不是 Google 或百度给它的 API 的结果排序 。
搜索这个比较典型 。
对 。
因为比如它用了谷歌的 API 或者它用了百度的 API 之后 ,但它展示的并不是竞价排序的那个原始的排序 , 所以它这一部分的广告收入可能就会少了 。
我觉得对于那种搜索推荐本身这一套是面向人的 ,其实是跟面向 Agent 肯定是不一样的 。 那对于原来的你的商业模式其实是有挑战的 。
我刚才还想到一个问题 , 那就是说对抖音这种我本来就是需要人看 , 我看本身我是从内容 。
那就 Kill time。 我们前面讲的比如说它去搜索 , 或者说我不管是找的是我的工作上要去看的信息 , 还是我要找我买东西的信息 , 这些东西其实一定程度上来讲的话 , 提高你匹配效率一定程度上还是带有 save time 的属性的 。
对 , 然后抖音这种它一定程度上它是 Kill time 的东西 。 我觉得广告模式有可能会被放大的 ,因为它一定程度上来讲的话 , 它的植入到上下文里面 , 它的至少我看已经看到有一些公司它们把广告植入到 AI 生成式内容 , 我指的是偏文艺的生成 。
对对对 , 它的 ROI 的转化效率是比传统转化效率是要大数倍的 。 那跟它聊天的这个人, 这个人类能感觉到这是个广告吗 ?
就是那你就要看你在里面贴合的有多自然 , 对吧 ? 其实一定程度上广告这种商业东西 , 包括你在 Google 里面这些东西其实不都是在体验和商业价值之间的一个 trade off 吗 ?
你在 Kill time 这种偏文娱的这个比如说虚拟角色这个等等这个里面来讲去做一些广告的这些植入 , 至少目前来看看到的效果是其实 ROI 还是显著高的 。
那模型公司自己做这个东西获得收益的方式就是订阅什么主要就是 ?
对 , 今天模型公司就是在 save time 这一侧 , 今天它的收入方式其实就是通过订阅 。在国内其实连订阅都没有 , 几乎约等于现在约等于就是免费 , 对吧 ?
面向通用的就是 save time, 通用的在国内现在约等于免费 ,在海外是订阅 ,但订阅是一个好的商业模式吗 ?
或者订阅是一个下个时代 AI 时代的真正的就是高效变现的商业模式吗 ? 这个我觉得这个是打个问号的 。
我想说就是它的商业化变现的效率其实是肯定是没有之前广告的方式变现效率高的 。
因为广告里其实你可以调的维度更多 。
那当然也不是说我们今天当前就是一定在一个行业的初期就一定就会能够找到那么快的找到就是下个时代的商业化变现方式 ,但我是说这肯定是一个潜在的遗留的一个问题 。
因为至少在中国来讲的话 , 通用的 save time 的大概率约等于是免费的 , 那它一定会用通过别的商业化变现的方式去变现 。
但咱们前面又讨论了说广告可能是并不是一个那么好变现的一个 , 至少在这个领域不是那么好变现的方式 。
其实你刚刚提到很多大公司 、 中型的互联网公司都是想做这个方向 , 你觉得谁的机会大了 ? 其实上次我们聊过一个你的推演 , 对吧 ?
你当时是有些具体的 , 就是你觉得谁更有希望的 , 这个可以讲讲 。 比如分云端 、 移动端 , 然后新的硬件 。
对 , 我觉得这里面来讲首先就是现有的其实比如说字节 、 阿里 、 腾讯 , 甚至包括小红书 , 我觉得它们其实是今天很重要的流量入口 , 所以一定程度上来讲的话不会去放弃这样的机会 , 大概率的还会努力的去争取在这个牌桌上 。
如果放在全球的话 , 我觉得就是在于还是谁能够在模型层面上能够拿到一线的模型 , 然后同时又有比较好的现在的身位的公司 。
如果这两者结合 , 就一线的模型加上一线的身位 , 那肯定是有比较好的机会的 。
在海外公司里可以说是谷歌 、 微软 、Meta 这些吗 ?
我觉得谷歌首先它会自己会去争 。 我觉得微软它本身它之前想去搞 AI PC,其实一定程度上来讲也是想争这个入口 ,Meta 也是想争这个入口的 。
对 ,Meta 因为它自己有现有的这个生态 , 我觉得 Meta 其实手里面一直是有一系列的好牌的 , 当然这个 Meta 这一直是一个很神奇的公司 , 就是这些牌它到底能不能打好一直是一个谜 。
对 , 我觉得 Meta 来说它有些很多先天的优势 , 包括过往的投入积累下来的一个势能 。 本身来讲的话它有最好的社交的这个平台 Facebook, 包括这个 Instagram, 然后本身来讲在模型层来讲其实它一直以来之前一直以来是一个开源的领导者 。
而且虽然说最近这个 Llama 4 受到诟病 ,但是从它之前的投入上来看的话 , 一直能够感觉到这个公司其实对于小模型 , 大概就是对于 7B 的模型一直投入是非常巨大的 。其实比如说之前在 Llama 3 的时候 , 它训练它自己的 7B 的模型 , 大概我记得应该是用了可能 15T 左右的这样的一个训练的数据量 ,但是它去训练自己的 70B 的时候 , 反而用到的更小的一个训练
的一个数据量 。其实我一直在想就是说 Meta 是不是它对于就是小的模型来讲的话 , 它会不会有一些格外的偏好 。
如果我自己大胆的去揣测 , 就是我觉得可能这个是跟它在眼镜端的一些布局可能是有关的 。 为什么呢 ?
就是因为 Meta Ray-Ban 是火了 ,但虽然说 Meta Ray-Ban 的火跟 AI 没有直接的关系 ,但是明眼人都已经很清楚 Meta Ray-Ban 会变成一个非常重要的有可能的潜在的一个端 。
新的硬件终端 。
对 , 咱们也聊过就是说在新的这个端上因为资源是很有限的 , 所以也很有可能会形成一个新的入口 。
那这个端上大概率从苹果那边看到的信息 , 包括 Meta 看到的信息 , 大概率可能就还是一个 3B 或 7B 这样的一个模型 。
对 , 所以那如果说把结合 Meta 本身自己在模型层面上的投入 , 尤其是偏重在 7B 这块的投入串在一起的话 , 它似乎还是在偏向于自己可能最有势能的这样的一个端侧的这样的一个场景 。
而且端侧就是你刚才也提到嘛 , 端侧上它的通用的 Agent 可能就是一个 OS 了 , 就是个操作系统了 。
对 。
它是要常驻内存的 。
而且 Meta 其实为了让这个眼镜能够更好的去真正能够变成一个下一代的终端 , 它希望能够脱离手机对手机的依赖 。
因为我们今天看到几乎所有的这个眼镜其实都是依附于手机的 , 这也就变成肯定手机的主导地位 , 或者说占据手机这个端侧的通用 Agent 的这块的公司就会更有优势 。
但是 Meta 其实是有很大的野心 , 它其实是想会单独绕开手机 , 它会单独再去做一个盒子 , 然后会绕开手机 , 然后去成为一个独立于手机的一个新的一个终端 。
第二点来讲的话呢 , 就是 Meta 在硬件本身上来讲 , 我们看到很多信号 , 比如说它做了很多可能包括 CS, 包括就是摄像头感知芯片 , 然后甚至包括它可能眼镜里面的主控芯片都是定制的 。
对 , 所以这个让我们感觉到就是说其实 Meta 它在瞄准着怎么把眼镜推成下一代 AI 的终端 , 从软硬件层面上来讲都做了大量投入 ,而且这个投入是超前的 。
然后像比如说模型很强的公司 Anthropic、OpenAI, 包括国内的这些模型公司 ,其实一定程度上来讲还是希望能够包括 DeepSeek, 这些一定程度上还是希望借助是模型能力 , 对 , 模型能力尽快能够推出下一代的模型 , 引领模型的发展 , 然后用这个然后推出时代的产品 , 然后去抢这个身位 。
对 , 然后反而对于腾讯 , 对于字节跟阿里来说的话 ,因为它本身它的身位就在这个地方 ,是不是比如说它稍晚几个月推出 , 对它来说有没有那么实质的影响 , 我觉得这个可能要打个问号 。
我觉得整个这个云端的这个云端或者说现有的手机端这个竞争 , 我觉得是会最激烈的 。
对 , 我觉得如果说它真的这个趋势显现出来之后, 应该会非常激烈 。
对 。
应该会非常有意思 。
对 。
其实在中国我觉得有一个问题 , 就是如果阿里也想做这件事 , 腾讯也想做这件事 , 字节也想做这件事 , 那它们相互之间的生态很封闭 , 那岂不是我就我作为一个字节的 Agent, 我能去阿里上买东西吗 ?
我能做到吗 ?
其实现在来讲 , 国家不是在反垄断法在鼓励大家放开嘛 ,但我觉得一定程度上来讲就像我们也讨论过的 , 就是那美团愿不愿意把它的骑手跟外卖给别人用 , 给阿里用 , 给字节用 , 滴滴愿不愿意把它的这个车的调度这个资源给到比如说阿里用 。
我觉得这可能在一段时间内可能都是打问号的一个时间 。
刚才其实我们讨论了一定的可能性 , 就是说有可能它最开始不愿意 ,但如果说这个市场里有一个别的玩家 , 它愿意开放 , 然后开放给它带来好的效果 , 可能会逼迫第一名有一些调整 。
对 ,不排除 。
上次我和戴宇森聊 ,他有一个想法有点意思 , 就是他认为在某一个技术革命的早期出现的第一个 PMF 的产品有可能是甜蜜的诅咒 , 是一个陷阱 , 比如说 Chatbot 就有可能是一个 ,但是没有定论 。
你觉得如果说谁能真的把 Agent 的入口这件事做成 , 它还会是一个甜蜜的陷阱吗 ? 还是说它就基本上就可以说它是 。
我觉得有点中举 。
就已经比较中举了 。
我觉得有点偏中举了 。
那所以今年下半年我们就会看到中举的序幕的拉开这么快 ?
我觉得是很有可能会这么快 。
那它的最大的变量还是取决于模型的能力是不是进化的这么快 ?
对 。
可以这么说 。
以及谁掌握了这个模型的能力 。 甚至很有可能会比我们前面说的更激进一些 。To say 通用 Agent 的诱惑 , 我觉得对于大厂跟模型公司来说还是太大了 。在模型能力甚至还没有完全突破的时候 , 可能咱们说到的这个竞争的序幕 , 大厂跟模型公司之间就可能已经拉开了 。
主航道37:45
接下来想聊一下创业公司和创投领域的 Agent 的变化 ,因为你如果判断通用 Agent 的入口的竞争会很快到来 , 那这个会怎么影响一批新的和更小的创业公司的生存空间了 ?
其实最近大家讨论比较多的一个问题就是做模型的大公司和头部的大模型创业公司 , 包括刚才我们提到的 Google、Meta、OpenAI、 字节 、 阿里 , 还有那些不做模型只做 Agent 应用的公司之间的关系和边界问题 。
我觉得最近引起这个讨论的一个具体的事就是 GPT-4o 释放了文生图的功能 , 然后也确实特别惊艳 , 包括它文字处理的一致性等等。
那大家就开始讨论像之前的 Midjourney 还有 Stable Diffusion, 大家可能已经基于这些东西做了一些工作流的 Agent, 包括你们投资的 LibLib, 它也是一个应用 。
那这种东西是不是就会因为 GPT 模型能力本身的提升而价值会小了很多 ?
看这个问题我觉得肯定是就先看就是说今天 Agent 的这个能力是在什么地方 ,以及就是模型公司 , 咱们前面说了模型公司 , 它其实是至少它的直觉是说它在一年之内它要把这个 Agent 能力提出来 , 就是模型公司能力的边界到底在什么地方 , 对吧 ?
那其实是不管是说 Deep Research 出来之后的话 , 你怎么去看 Perplexity 和 4o 出来之后怎么去看 Midjourney, 怎么去看 LibLib,其实是相似的这些问题 。
那个时候的模型其实是一个打引号的 , 比如说我们还是回到比如说 Google 的这样的一个技术框架里面 ,Google 它那个白皮书提出了一个很好的一个 Agent 的一个技术框架 , 对吧 ?
那这个技术框架其实有助于我们去理解模型公司会干什么 ,以及今天的这个 Agent 的产品能力边界是在哪 。
我觉得这个框架其实是非常清晰的 。
OK, 就是我们前面讨论的模型本身的能力 , 包括推理 、 记忆 , 还有目标理解的编排层的能力 , 再就是一些工具使用的能力 , 这些可能大模型公司都会自己做了 。
其实 Anthropic 也发过类似的一个白皮书 , 包括 Anthropic 去年的时候它不管是推 Computer Use 也好 , 还是推这个 MCP 也好 ,其实你可以看到就是说在这个框架里面 , 模型公司其实已经不仅仅只是做这个 Agent model 本身了 , 那它其实在做的事情是包括模型肯定在持续的去改善提升 , 对吧 ?
然后推理 , 我这个推理模型在今年年初的时候 , 哦哇 , 去年年底今年年初巨大的突破 , 本身对这块是有帮助的 ,以及如果是一个垂直领域的公司 , 我可能我用 workflow 的方式去实现 ,但是现在 workflow 里面可能很多环节我可以直接就用 AI 来去实现 。
记忆本身你能够看到就是说 MiniMax 也好 , 还有包括其他一些公司也好 ,其实都是就是努力的在去把记忆的能力在做提升 , 对吧 ?
你也访谈过 MiniMax, 它其实本身通过这个 linear attention 的方式 , 对吧 ? 它可以支持 400 万的 token, 然后同时可以支持非常精准的命中 。
然后在 Tools 这个层面来讲 , 模型公司也没有闲着呀 , 就是 MCP 是一个典型的 , 对吧 ?Computer Use MCP, 然后包括 Google 自己也在做一些这个 extension, 对吧 ?
包括最开始的 OpenAI 做 Function Call,其实它也都在 Tools 这个层面来讲的话 , 就是工具层面来讲做很多工作 。 所以对于模型公司来说的话 , 它的 L3 阶段的模型 , 打引号的模型 ,其实是包括整个框架的 。
其实是一个模型加一些别的东西 。
对 。
它的边界本来就扩展了 。
对 , 对 。 所以我觉得它推出来的其实就是可能就是一个博士毕业的一个应届生 , 它其实已经有丰富的知识储备 , 然后呢 , 它有处理常识任务的能力 , 比如说让它去查一些信息 , 做一些日常的一些任务 , 只要是基于这个通用的这些工具的 , 它都可以去做 。
但是一个应届生和一个专业人士是有差别的 。 专业人士在这套框架里面 , 你想一个专业人士跟一个应届生核心差别是在于 , 专业人士可能这个智商 , 可能这个 model 这一层 , 它不一定有这个博士这么高 ,但是它有这个行业里面的专属的一些思维方式 、 思维方法和工作流 , 这是一个应届生不具备的 。
第二个来讲的话 , 它有这个行业里面的很多的数据跟知识 , 对吧 ? 包括过往的经验 , 就类似于长短时的记忆 , 对吧 ?
还有个来讲 , 它会用这个领域专属的一些工具 , 就这些是专业人士和一个应届生的一个区别 。 所以我觉得就是对于模型公司来说的话 , 就是如果我们去看 AI, 通常来讲我们会有两个 XY 轴来去表述 , 一个是泛化性 , 一个是精确性 。
泛化性对应就是通用 , 精确性对应的就是专业 , 对吧 ? 那其实一定程度来讲的话 , 就是今天模型公司它推出来的是一个越来越强的具有知识 、 推理和常识任务的这样的一个泛化能力的一个应届生 。
但是这个应届生它是 , 这就是前面说的 , 就是模型公司有可能希望就是说一个岗位里面 80% 任务都去做了 ,但是那 20% 其实就是偏专业领域的 。
一定程度上来讲的话 , 就是模型公司今天在往通用去走 , 它留下来的机会其实都是通用里往专业去走的 。
如果我们再去看 , 比如说 4o 这个事情来讲也是一样的 , 就是 4o 它也一定要是去做通用的 , 它不是去往专业去走的 。
因为我觉得其实有一点很明确 , 就是通用的人或者说业余人士 , 比如像你我这种 , 我们对于图片生成的要求恨不得是一步到位 , 只有专业人士才知道就是成果是需要一步步来的 , 对吧 ?
我们是其实是对于很多细节我们是不在意的 , 我们对质量其实没有那么高的要求 ,但其实是专业领域的人士其实对于这些细节 , 对于质量其实是有非常高的要求的 。
那我可不可以这么认为 , 就是在你这个逻辑里面 ,其实 4o 出来之后, 它可能对即梦的冲击会比对 LibLib 这种冲击更大 。
因为 LibLib 我理解它是给一些比如说做广告设计的 , 就是你说 。
专业人士 。
对 , 偏更专业的人士来用的 。 即梦可能就是一个 ToC 的一个文生图的应用 。
就是如果你的比如说做文生图 , 你的目标是其实是希望是偏向于 。
大众吗 ?
大众的 。 那你今天一样就是会受到模型厂 ,因为模型厂商的公司会从 L1 升级到 L2, 升级到 L3, 那一定程度来讲的话 , 那它其实一定是在引领着这个事情 , 那它又是面向通用的去做 , 你受到的冲击肯定是最大的 。
而且就具体到 OpenAI 这个例子里 , 它自己是有产品的 。
对 。
就它本来就是个 ToC 的产品 。
对 。
而且 4o 放了这个文生图的功能之后,OpenAI 这一次其实没有放 API, 就相当于你想去套我的壳 , 我都不给你这个机会 。
但我觉得它后面是会放 API 的 。
它后面可能会放吧 。 但它这个阶段它肯定是要让这个功能是市场上的独一份来帮它增长它的 C 端客户 , 我觉得这是它的策略 。
对 , 对 。 但是这个事情 , 这个产品其实对于专业人士来说 , 就对质量要求高的人士来说的话 , 它还是不足以满足要求的 。
所以我觉得这个其实是从产品本身上来讲的话 , 就是你要不然去服务专业人士去提供工具 , 或者说你服务于垂直场景去做 Agent, 一定程度上来讲它都是规避了与模型大厂自己从 L1 到 L2 到 L3 发展 ,不管是语言还是图片还是视频 , 就发展的主航道的 。
所以就在我看来来讲的话 , 就是说你距离大厂的主航道太近 , 肯定是不利于创业公司的 。
你怎么看 4o 发布之后 Adobe 的股价大跌 ? 你觉得这是市场恐慌吗 ? 还是什么 ?
其实这反映了其实大家对于我觉得资本市场其实对于 Adobe 未来前景的一个看法 。 首先 Adobe 自己在 AI 这一波表现的 , 它要积极的去追赶 AI, 加 AI,但实际上从它的实际的产品上来说的话 , 我觉得其实加 AI 的效果是很差的 。
资本市场对这个事情的反应 , 我觉得可能背后有两层 。 一层来说是长期来看 , 大家还是认为文生图这个新的 workflow 应该会对 Adobe 之前的那套 workflow 和基于这套 workflow 的所有的软件应该会有比较大的一个影响 , 甚至是颠覆 。
那第二层来讲的话呢 , 就是实际上 4o 其实并不是真正直接影响 Adobe,因为我们如果看一下这个整个图像编辑市场 ,其实图像编辑市场最开始的鼻祖肯定就是离不开 Adobe 的 Photoshop, 那它其实最开始是从专业人群起家 , 然后逐步逐步的泛化的 。
然后大家比较熟悉的另外两家公司或两类公司 , 一类就是比如说以 Canva 为代表的 , 那它是因为当年随着社媒起来之后, 那更多的市场人员 , 哎 , 它需要用到图像编辑工具 , 它又不会用 Photoshop, 所以它需要降门槛 。
所以来讲的话呢 , 就有了 Canva 这个产品的机会 。 那还有另外一个就是说随着整个手机 、 整个这个消费电子起来之后, 那普通的 C 的用户需要对于图像有编辑的需求 , 最典型就是美颜 , 所以像美图秀秀这些公司也起来了 。
可以看到这个产品是一个从专业人士逐步泛化的过程 ,以及还有一点就是只要你在某一个具体的需求层面上来讲做的足够深 , 你是有机会能够拓出一片市场的 。
还有一个很有意思的点 , 就是这三块市场 , 或者说这三家公司的 , 我们看一下这个月活的情况 ,Photoshop 大概 , 或者说它整个这个创意的套件的月活大概就是全球可能 1 亿多人,Canva 大概是 2 亿多人。
我记如果没记错的话 , 美图秀秀它全线的产品线应该是 2 亿多人 ,但是它的价格这三者之间是差很多的 。
就是 Adobe 最贵 ,Adobe 大概可能一个月是 50 多美金 。
正版的情况下 。
对 , 对 , 正版的情况下是 50 多美金 , 对 , 一个月 。 然后 Canva 大概可能是 10 到 15 美金 , 然后美图秀秀就很便宜了 , 对吧 , 可能两三美金 。
还有一点就是说付费率 , 对吧 , 专业人士付费率是最高 , 然后 Canva 其次 , 那美图秀秀付费率是最低的 ,因为越是泛 C 用户 , 大家越想还是用免费的这个产品嘛 。
其实 AI 热潮来了之后, 当然是在 4o 之前的事 , 美图秀秀还是因为 AI 这个事情 , 它的付费是增加了很多的 。
对 , 所以我们回过头来看 , 就是说 4o 其实真正冲击的是谁呢 ? 我不认为它当前冲击的是 Photoshop, 我认为它其实当前冲击可能最多的还是对于图像质量要求没那么高的 , 可能用美图秀秀或手机上的一些图像编辑的 ,以及包括用 Canva 里面一些对图像质量要求没那么高的这些人群 。
一定程度上来讲的话 , 还是偏泛 C 用户多一些 。 对于泛 C 用户来说的话 , 大家还是希望从体验上是一步到位 ,但是对于专业用户来说的话 , 我们也知道一个能够满足高质量要求的产品的呈现一定是一步步来的 。
对 , 那说回到 Adobe 这个事情 , 就是我前面的观点就是在于 Adobe 的这个 workflow 是很有可能会被文生图颠覆掉的 。
这个大家对它的信心 , 基于 4o 之后大家的信心是越来越强的 。 因为原因是因为 Adobe 它起来是因为 , 尤其是 Photoshop 它起来 , 一定程度来讲它是开创了整个图层这样的一个编辑模式 , 基于图层 , 你想想很多滤镜啊等等工具的使用 , 确定了就是说你的图像编辑的一个标准的一个范本 , 一个标准的一个 workflow。
但是咱们都知道文生图里面来讲已经没有图层了 。 我对 LibLib 这个公司怎么看呢 ? 就是或者我其实觉得 4o 这个产品 , 这个基模它的起兴之后, 我觉得其实是利好 LibLib 这类主要瞄准服务专业用户的这种文生图的公司去进一步蚕食 Adobe 市场的 。
因为 LibLib 的用户里面超过一半用户都是专业人士的用户 , 那这类用户来讲 , 它首先它需要基于 LoRA 的生态去选择一个审美或一个风格 , 那这块来讲是 LibLib 很强的一个平台的一个壁垒 , 就是风格跟审美其实是很难被 4o 这种 AI 所取代的 。
就 4o 不能去取代 LoRA 的生态吗 ?
是的 ,是的 。
你觉得不能 ?
是不能 ,因为审美是由人自己来决定的 , 它只能去学习和借鉴一个审美和风格 。
哦 , 比如说吉卜力那个很火 。
对 , 对 , 对 ,但它是不能自己原创出一个所谓的审美 , 或者说 AI 可能可以原创一个审美跟风格 ,但是有可能人也不一定能够理解 AI 的所谓的审美 。
所以一定程度上来讲 , 审美跟风格还是要从现有的里面去学习 、 借鉴和引导 。 那所以其实整个 LoRA 的这个生态 , 高质量的参考图的这样的一个生态其实是非常重要的 。
这个生态其实对于专业人士来讲的话是不可或缺的 ,并不是 4o 它所能提供的 。 但是基于 4o 的能力 ,以及基于 4o 之上很大量的产品层的创新 , 这里面包括很多交互的 prompt 等等很多 , 还包括 control net 等等很多交互层上的一些创新 ,是可以帮助专业人士然后更好的去利用文生图的工具 , 去能够从而能够更好更快的达到 Photoshop 的这样的一个效果的 。
它可能可以帮助一个专业的设计师更快的拿出他的一个产品 ,也可能可以帮助一个以前用 Photoshop 他也就是做到 5 分 6 分 ,但是可能基于文生图可以更快更好的做到一个 8 分 9 分这样的一个效果 。
那所以在我眼中, 我觉得 4o 出来之后, 我眼中的 LibLib 的话 , 我觉得它可能会更快的变成一家 Agent 的公司 。 就是 Photoshop 可能是它 tools 里面的一环 , 它还是基于文生图重构了整个 workflow, 前面需要 LoRA 生态 , 然后需要 Agent 与人之间的这个交互跟反馈 , 当然是基于更强的这样的一个基模 。
然后这里面来讲可能会调用各种各样的工具 , 可能也包括 Photoshop。 所以在我看来讲的话 ,其实就是 LibLib 大概率会发展成一个 Agent 的形态 , 那这个形态的逐步的完善 , 它一定会逐步的去蚕食今天 Photoshop 最核心的专业人群 。
所以你刚才就是关于我们回到就这一部分的最开始的问题 , 就是 Agent 的能力边界 , 它到底是模型公司和只做 Agent 应用的这个公司 , 它这个线划在哪 ?
你觉得有一条线它就是在于人群的区分 , 就是模型公司可能它就会针对的是更通用的人群 。
我觉得那根线是在于模型公司 , 它其实都是有一个做服务泛 C 用户的野心的 。 它会把这个 Agent 的能力做到就是说可能 80% 的这个任务我都可以去做 。
如果是一个通用的任务 , 这个对于模型公司来说它肯定它会去干了 。 但是对于如果是对于专业的垂直的 , 它会把这个相当于你应用 Agent 的门槛降低 。
因为可能 80% 的任务或 80% 的这些业务流程 , 我直接 Agent 模型直接包掉了 ,但是它不会下手去做自己又去做律师 , 自己又去做一个专业的设计师 , 它不会做这样的事情 。
因为就是前面说从那个框架里面来讲 , 你越烦想去做越专业的事情 , 对吧 , 你所需要的 workflow、 推理能力 、 工具 、 数据就会变得越垂直越长尾 , 对吧 , 对于模型公司来说它就是越长尾 。
那这样来讲对于它的成本来说就是会变得越来越高 。 对它来说它其实说白了是基于一个能力 , 然后它的泛化让它的整个边际成本是很小的 , 这个是它的这个整个这个产品的核心特点嘛 。
如果用以前比较流行的话说 , 就是解决最后一公里的问题是吧 ? 就各行各业最后一公里 。
对 , 就最后一公里的问题 , 模型公司不会去 。
因为那不是它的优先级 。
对 , 对 , 它是想去服务的是泛 C 用户 。 所以我是觉得就是专业人群的工具 ,以及垂直行业的 Agent, 我其实觉得其实都是这些模型公司它不会碰 ,但是会去赋能的 。
那在你这个逻辑里面 , 像 Melissa 这种它主打通用 Agent 的产品 , 未来的机会是多少了 ? 它是不是很可能就是在模型公司的主航道上 ?
Perplexity 和 Melissa 一定程度来讲 , 我觉得其实都是距离模型公司的主航道非常近的 。 所以我挺关心 Perplexity, 包括国内的类似于其他的像比如说 Kimi 啊等等这些公司数据的增长 。
你关心它是因为你想去验证你的这个想法对不对 ?
我想去验证的就是说 , 第一个来讲的话 , 我很关心距离主航道的公司会活得怎么样 。 第二个来讲的话 , 它们本身来讲的话会有什么样的一些调整 。
就不管 Perplexity 和 Kimi, 至少在 2 月份来看 ,2 月份应该还是 DeepSeek 冲击最大的一个月 , 就是 Kimi 也好和 Perplexity 都还是增长的 。
那当然不排除这里面其实是有营销投放的一些因素在 ,但是呢 , 市场盘子肯定是变得更大了 。 当然来讲就是说这个市场最大的受益者肯定还是 DeepSeek, 肯定还是吸收 DeepSeek 流量的元宝和纳米 。
然后因为海外来讲其实没有像国内这么的去卷嘛 , 所以至少从目前来看的话 , 就是说这些公司首先还是增长的 。
那我们的核心观点肯定还是说 , 距离模型公司主航道太近的这些企业 , 肯定还是有比较大的风险的 , 肯定还是要去找到它自己差异化的地方 , 甚至是说是不是要往专业性人群去走 。
因为还是前面那个观点 , 就是产品层面上, 往专业人群的产品层面上来走 , 还是有挺大的机会跟空间的 。
这个包括 Perplexity 的自己的创始人其实在很多次访谈里面来讲 ,他其实也是挺在意这个的 。 就是他讲的所谓的产品其实一定程度上来讲也都还是说怎么去让他所更细分的人群或他更瞄准的目标人群 、 专业人群能够更好的去用这个产品 。
就是产品型公司你指望在技术本身建立壁垒 ,其实是确实是不太现实的 。 坦率来讲 , 今天所有这些公司最开始建立的是基于产品定位 , 然后前期的工程投入是有一个时间差的 。
包括像 Melissa 也好 ,Cursor 也好 ,Perplexity 也好 ,其实都是在模型 ready 之前就在做这个事情 。 一定程度上来讲还是靠的是它的产品有创意 , 产品定位还是有一定的精准性 。
我觉得产品公司一直以来还是就是深度是比广度重要的 。 我其实我是其实希望的是所有这些做 AI 应用产品公司 ,不管是我们说距离似乎今天距离主航道比较近的 Perplexity、Melissa, 还是说本身就是专注在专业人群领域的这些公司 , 我其实希望他们都还是在深度上去下功夫 ,而不是就是今天在广度上去下功夫 , 服务的目标人群更精准 。
垂直 Agent54:52
那接下来我们可以再比较详细的来聊一下垂直 Agent, 你们已经看到甚至已经投资了一些机会 。 因为我理解在你的逻辑里面 ,其实你认为通用 Agent 它还是更适合大公司或者自己掌握模型能力的公司来做 ,而对大多数单纯做应用的 Agent 的创业公司 , 还是垂直领域的成功概率可能会更高一点 。
回过头来我们说就是我们可能比较关注的机会 , 我觉得其实就核心是两个嘛 , 就一个是来讲还是 save time,但是你是要往专业人士或垂直场景去走的 。
然后另外一块来讲其实就是 Queue time,Queue time 其实就是偏文娱类 , 偏新的内容类 、 体验向 , 就是这两块是我们比较看好的 。
那其实我们前面不管是探讨比如说 Perplexity 还是探讨 LibLib 等等 , 我们这个其实是专业工具 ,其实我们聊了很多 。
对 , 这些都是偏帮你节省时间 , 帮你提升效率的 。
对 ,但是它是面向专业人群 、 专业场景的 。 今天垂直领域的 Agent 其实今天现在大家也开始比较关注嘛 , 尤其是 DeepSeek 火了之后, 有部分的原因是因为老板的技术焦虑 。
所以老板的技术焦虑会导致的是 ,其实最大的受益者我觉得其实是 RPA。 因为老板他其实他也分不清这个到底是 AI 还是 RPA。
对 , 大家只是觉得 。
就是流程自动化 。
这个东西就自动化了 , 提效了 , 对吧 , 就有帮助了 , 缓解了一些老板的技术焦虑 。 对 , 这是比较直接的 。
因为我们看到很多 SaaS 公司开始在里面加一些 RPA, 就可以比较能够去获更好的获客 。 第二块当然就是说现有的一些 SaaS 公司和一些做企业信息化的公司 ,他们基于模型的能力在打补丁 , 就是它以前它其实就是由软件已经在服务这些企业了 , 它把 AI 作为一个打补丁的工具叠加上去 。
但是其实这都不是创业公司的机会 , 对吧 ?
这些其实是成长期公司 , 你刚举的这种其实是成长期公司 。
对 , 就我觉得就比如说我们自己投的 SaaS 公司代表性的 ,不管是库加勒还是神策还是一块豹等等这些公司 ,其实今天都有 AI 团队 , 都在把 AI 的能力和它现有的产品去做结合 。
它其实就是打补丁 ,但它本质上来讲打补丁 ,因为它没有改变原来的它的这个产品的业务逻辑或工作流 。
所以呢 , 就是我觉得这些都不是创业公司的机会 。 还有一点就是说我们看到美国有非常多的就是 Agent 创业的公司瞄准垂直行业的 ,但是我觉得就是中美之间其实也还是有蛮大不同的 。
对 , 就是所以如果回归到就是说我们眼中看觉得就是说垂直领域的这个 Agent 的创业公司到底是在哪 ,其实是有一些关键的一些原则我们可以先明确的 。
那这些关键的原则其实是跟之前上一波整个产业互联网垂直 SaaS 其实是这个的过往的这些经验和教训其实是相关的 。
就是在中国大家都知道中国 SaaS 不好做 , 垂直领域的 SaaS 更难做 , 一个是中国真正愿意能够为 SaaS 付费的企业非常少 , 付费数量少 , 付费能力有限 。
第二点来讲的话就是说其实中国企业它通常来讲它愿意为效果付费 ,而不是为效率付费 。 就中国企业它能够接受的效果其实就是两个 , 第一个你把信息给到它 ,不管是粒子的信息 、 销售粒子的信息 、 销售线索信息 , 还是什么招聘的信息 , 还是什么货物的这些信息 , 你把信息给到它 , 它自己去做后续的完成 。
第二种来讲就是你把整段全部给我拿走 , 你直接交付一个结果 。 所以这个就导致了就是说 , 一 , 你做了这个创业 , 你大概率应该是去交付结果的 ,而不是像美国一样或者走 SaaS 逻辑是卖一个工具的 。
那你怎么样去交付一个结果 , 还是要有创业公司机会的 。 基本上来讲的话就这么几条 。 一条来讲的话就是说你肯定要重塑之前的业务流程 ,因为不重塑流程的 , 大概率都是现有的公司直接加 AI 就能干了 。
就是 SaaS 公司加 AI,而不是一个新的 AI 原生的公司 。
对 , 你肯定是要重塑原来流程 。 第二个种来讲的话就是比较讨巧的一些地方 , 比如说你这个领域是比较小散的 , 你的对手很弱 。
那你要反过来你要想的话就是说这个领域为什么之前一直小散 , 小散的原因其实核心原因其实就是因为它非标嘛 , 很难结构化嘛 , 导致它很难规模化嘛 。
那你要想的是 , 那你 AI 是不是这波 AI 能够把以前那些不能标准化 、 不能结构化的东西 , 你用 AI 可以这次可以把它结构化标准化 , 然后从而能够规模化 。
那这样的话你的竞争对手其实都是以前很传统的小散的 , 对吧 ? 那他们肯定也没有那个工程能力 、 研发能力 、 产品能力说去做你这个事情 。
第三点来讲的话 , 我觉得就是还是要去做那些尽可能低垂的果实 。 对 , 就是不要对于 AI Agent 的这个能力太高的期待 。
就比如说就像比如说上一波互联网 、 移动互联网时期 , 就一个例子我觉得其实就是垂直领域啊 , 我觉得其实就是一个是满帮 , 对吧 ?
你说满帮其实做了一个什么事情 , 它其实就是把信息部的小黑板变成了一个撮合平台 。 它就做了这一件事 , 这是最低垂的果实 , 上个时代最低垂的果实 。
然后它后面也折腾很多别的事情 ,但其实都有非常大的挑战 , 就是失败了很多 。 但是就是这个打底的这个事情 , 就是我觉得特别典型的低垂果实的事情 , 然后交付的就是一个信息的例子嘛 。
它就是那个货运信息的例子 。
对 , 就是车货匹配的信息 , 这个车你想临时去找个货 , 或货想临时找个车 , 那在这种情况来讲的话 , 那这个信息就是你要的结果 ,因为它也不触及整个货物的运输这些事情 。
然后我觉得第二个例子来讲就是举个例子 , 比如说服装行业一直是一个很大的行业 ,其实我们我记得我们当时很多投资人都看过非常多的做服装信息化 、 服装产业互联网的公司 , 怎么样把工厂去做数字化改造 , 然后怎么样去让它信息化能够去提升的公司 。
但其实你会发现就是说让工厂去接受数字化 、 接受信息化这个事情是一个特别苦的生意 , 特别差的生意 。
这个行业里面谁真的把这个行业的数字化信息化做好呢 ? 不是任何一个做服装行业信息化 、 数字化或 SaaS 的公司 ,而是 Shein 这个公司 。Shein 就是用它的货撬动了它的上游供应商 , 一步一步的接受它的信息化改造 。
而且它合作的很多工厂都是通常从信息化的角度 、 从 SaaS 角度来讲 , 最难卖的工厂都是百人工厂 , 工厂老板初中学历 、 高中学历 。
但是 Shein 这个公司我想说它的核心的逻辑是在于 , 它其实本质上来讲它重塑了这个流程 。 你任何一个服装工厂你去上信息化 、 上 SaaS, 你干不了 Shein 这个事情 。
你之前任何一个大麦抓住那一波红利 , 你也干不成 Shein 那个事情 ,是因为只有 Shein 把供应链跟前端营销用数字化的方式整合起来 。
就一定程度上来讲的话 , 它改变了原来整个服装产业的业务流程 , 它是一个新的组织 。
然后它的出发点其实并不是要做服装信息化本身 , 它不是为了做这个 。
对 , 它是为了更好的卖它的货 , 对吧 ? 它为了卖衣服的时候 , 它希望小单快反 ,不希望有库存 。
那它这样来讲 , 它希望它的供应链能够支撑 。 它发现它的供应链如果不信息化的话 , 没法支撑 。
它需要把它的前端的这个促销信息和供应链上的现在加工的进度信息匹配起来 。 所以它自己在推动了这个事情的信息化 。
所以我想讲的例子就是说 , 我们其实觉得真正其实有机会的公司 , 或者说是真正壁垒的公司 ,其实它还是在于就是你能不能真的重塑整个业务流 , 甚至是重塑这个组织 。
这其实是一个最有价值 、 最高壁垒的 。 然后如果说你切的这个时候 , 这个行业你的周边玩家是小散的 , 然后是个低垂的果实 , 你可能更容易去起牌 。
对 , 或者说这个切入口可能会更有利于创业公司去做 。
你看到这些方向 , 你现在能看到一些具体的例子吗 ?
我觉得比如我觉得举两个例子 , 我觉得一个例子比如说是律师 , 一个例子比如说是销售 。 我觉得中美这两边其实差距都非常大 。
就是服务律师和服务销售的 Agent。
对 , 我去把它做一个对比 。 对 , 比如说在美国 ,不管是 Harvey 还是做 SDR, 就是销售 Agent 的公司 , 它的都是按照席位去收费 , 一个席位大概是 2,000 多美金一个月 。
它其实提供的客户用户价值其实就是说白了我帮你节省时间 。 它服务的对象其实都是主流市场 , 比如说法律这个业务行业里面的合同审查 , 或者说销售这个业务里面的 SaaS 软件销售 。
它做的是主流市场 、 主流业务 , 然后它是辅助人的 。 它就把这个当做一个席位费 , 比如说你可能要布置一个 AI SDR, 对吧 ?
那这个 AI SDR 的话 , 它是按调用量去收的 , 超过一定的调用量之后再额外加钱 。 但是一个 SDR 大概一个月 2,500 美金 , 或者说一个 Harvey 帮你去做合同审查 , 或者说包括合同的一些问题的确认啊 , 或者什么之类的 。
所以它跟这个律所我做这个合同审查的 team 有多少人没关系 ,是吧 ? 它还是跟你的量有关系 。 你在一个量内就比如说 2,000 美元 , 超过就在 。
对 ,但你可能比如说聘请它之后, 你可能会降低你在这个岗位上的人员招聘的数量 , 对吧 ? 因为你提效嘛 。
所以它本质来讲它就是一个提效 。 你看可以看到美国那边是一个很典型的 , 还是一个延续 SaaS 工具的提效辅助人。
我不是为结果负责 。
我是为效率负责 。
我是为效率负责 , 对吧 ? 中国不一样啊 , 中国是它是把整个业务环节拿走 , 它是交付的是完整的结果 , 收的是 take rate 的这样的一个抽成 。
这个 take rate 的抽成可能大概是从 10% 可能到 30%,anyway 看不同的公司或不同的业务 。 但是我想说我们看到的类比的 , 比如说都是法律行业 , 都是销售行业 , 这些在中国发生这些事情都是找的是利基市场 , 都是挑选的是一个很有意思的品类 , 然后干的都是整个环节完整外包 , 然后收 take rate。
还有一点 ,不是辅助人。
它就是替代人。
它就是替代人, 或者说是指导人。 它不是帮助一个专业人士干得更高效 , 它是让一个小白可以干专业人士的事 。
这是在中美之间非常大的差别 。
我不知道这个利基市场是不是涉及你们被投的机遇啊 , 就这个它能讲得更具体吗 ? 比如说什么事是现在 AI 能干 , 然后又可以完全代替人赚到钱的 。
对 , 比如说咱们前面讲 Harvey, 它其实是核心做的事情是帮助律师去审合同 。 那 Harvey 去说我有 700 家律所的客户 , 那我们去年年底投的爱与智能这家公司 , 它自己就是个律所 。
它这家 AI Agent 的公司 , 它自己就是一家律所 , 它不是服务律所 , 它自己就是一家律所 。 就是它找了一个利基市场 , 它又服务金融机构 , 它把金融机构里面对私和对公的批量诉讼的案子拿出来去做 。
因为这里面有大量的案子是以前是一堆传统律所堆人去做的 ,但是因为人是有成本的 , 所以有大量的比如说小额的案子 , 或者说是已经是很陈旧的案子 ,是没有人去做的 。
就银行就也懒得去找律所帮他们去打这些官司 。
对 ,因为律所也不会接 ,因为律所是有成本的 。
这个主要是追账类的官司是吗 ?
各种追账 、 违约 , 对这种 。 对 , 然后那结果是爱语它 3 月份它一个月它立案了 1.5 万起 , 中国最大的律所可能一个月也就是可能是一个小几百起 , 就是诉讼 ,因为它都是诉讼 。
对 , 批量诉讼 。
这是不是对法院造成了冲击啊 ?
国家在鼓励通过法律的形式去解决这些问题嘛 。
那我感觉法院应该搞个 Agent, 要不这案子审不过来了就 。
对 , 那是将来下一步吧 。 就是你可以看到就是说它是一个独立的律所 。 对 , 然后它的律所相比于传统的律所来说 , 它可能是一个 100 倍甚至更高的这样的一个提升 。
然后它是为结果负责 , 就是最后不管是对私还是对公 , 它还了款 , 然后这个里面还款里面的 30% 它去作为它自己的 take rate。
对 , 它其实就是一个律所的商业模式 ,其实就是律所找银行最后收的那个钱 。
那以前的这些小律所的话 , 可能就是一个十来号人, 然后它只能服务一个客户 , 然后它只能服务比如说客单价 , 比如 20 万 、30 万以上这种案子 , 可能一年可能就做一个几百起 , 甚至小千起 , 可能是一年可能是到头了 。
因为它的人就人力成本跟人效就摆在这个地方 。
这个公司是本来是一个律所 , 然后它孵化出来的这个科技业务 , 还是它就是成立的时候它就想好了这个思路啊 ?
这思路还挺神奇的 。
就是它这里面很重要的点就是第一 , 它是交付结果 , 它是个律所 ; 第二来讲它交付结果 ; 第三个来讲的话 ,不是让那些资深的诉讼律师来去做这个业务 ,而是 AI 去指导那些小白 , 甚至是有可能都没有去 , 都不是法本的人来去做这块业务 。
所以这个创始团队里有职业律师 , 对吧 ?
因为只有职业律师才能出庭嘛 ,因为你还是有出庭那个环节 。 然后我觉得像 SDR 这个也是 ,SDR 其实是一个在海外的销售流程里面是更常见的概念嘛 ,因为它更多的其实是判断商机 , 然后把这个客户引导到后续的销售流程里面 。
但这个事情来讲 ,其实它并不直接产生销售结果 , 对吧 ? 它并没有直接把那货卖出去 。 所以海外的那些 SDR 的公司 , 它只是做了这一个环节的 Agent, 然后最后的结果是它也只能收作息费 。
它没有办法说我从这个商品最后卖出的销售额里面抽成 ,因为它只是前面的一段 。 但是我们看到的公司 , 比如说不管是服务酒店 ,在抖音上全 Agent 去做代运营的公司 , 还是说是做一些线上课这种线上产品的 , 直接就是线上销售的这种 AI Agent 的公司 , 它们其实说白了就是切掉整个销售环节了 。
对 , 它相当于某一种渠道代理了 。
你可以认为它就是个代运营 , 然后它收的钱其实就是整个销售额的 take rate。 一个正常这类公司可能销售成本大概比如占 20%, 那它现在只是说需要把 10% 的钱给到这样的一个类似于一个 AI Agent 的这个代运营的公司 , 就去做了 。
那我觉得你刚刚说的这两个例子都是比较典型的 。 你刚才讲的在国内你去看垂直 Agent 里的前面两个原则 , 对吧 ?
就是它要么是重塑了这个流程 , 要么是这个行业里做这些流程的本身是一些小型的不能大规模扩展的服务型的公司 。
它们现在的模式是我相当于成立了我也是一个服务型公司 ,但是我是用 Agent 的服务型公司 , 然后我的效率非常高 , 我可以规模化的做很多这种渠道的代理 , 或者说做很多这种案件的代理 。
对 ,其实咱们如果说抽象一下, 就是咱们想技术对于这些行业的本质是什么 ,其实技术它只是一种手段 , 就是帮你把之前非标的 、 非结构化的事情可以标准化 、 结构化 , 从而可以规模化 , 就是这个事情 。
我们可以再沿着这个往下设想啊 。 我本来就是个比较大的律所 , 我如果把 Agent 用得很好 , 我能达到相似的效果吗 ?
就我不自己开发 Agent, 我就把 Agent 用得很好 , 我能达到相似的效果吗 ?
因为国内的律所绝大多数从事这类业务的这些律所 , 就理论上确实是可以 ,但实际上它们的技术能力 、 工程能力 , 让它从一个靠专业知识和销售关系驱动型的公司变成一家技术驱动型的公司 , 这个转型是挺难的 。
就是还是因为我前面说这个它的同行是小散 。 对 ,因为你想你做的是一个利基市场嘛 。
因为你刚刚举的那个例子也是诉讼里的一个细分的市场 。
对 ,但是其实这些行业本身来讲 ,其实单个行业其实体量都挺大的 。 咱们也不能忽视说其实当年满帮就是把信息布的小黑板数字化一样 ,其实这个也是背后也都是挺大的生意 。
那比如说到电商这个领域吧 , 电商代运营的公司可能有些推测了 , 我不是特别了解这个行业 ,也许它的数字化程度比较高 。
比如说因为淘宝这个生态里其实有很多电商代运营的 。
是的 ,是的 。
而且很多人以前其实是阿里的人, 然后出来做的 。 这种领域是不是可能还是本来就存在于这个领域的专业服务型的公司 , 然后加上 Agent, 它可能就能达到一个比较好的效果 , 倒不一定说会有一个新的公司来做这件事 。
我觉得还是会出来一批新的公司 ,也不排除说之前的公司它也会转型 , 然后继续加这个能力 。 对 ,但我觉得这个里面来讲就是一个咱们前面说了壁垒嘛 , 最高的壁垒其实还是你能不能重塑整个业务流程 , 甚至重塑组织 , 对吧 ?
你是一个完全新型的律所 , 还是说我只是原来的环节 , 单一个环节我只是做了一个升级 。其实这个差别是挺大的 。
就是比如说对于代运营公司来说 , 那它比较大的一个挑战是在于货和流量其实都是别人的 。 对 , 所以一定程度来讲的话 , 它长期发展它会面临这个挑战 , 就是它到底能做多大 。
就是因为货和流量都是别人的 , 你做太大之后别人就会来卡你嘛 。 另外一点来讲的话 , 就是说这些公司它也想做的事情就是 ,因为大家现在都开始比较关注 PostStream, 那这些公司大家在想的是这个 AI Agent 能力能不能做到自由化 。
可能我用一个 Agent, 它是可以很容易比如说做到 10% 的转化率 ,但是因为我有自由化这个能力 , 我能不能在模型提供的 Agent 做到 10% 转化率的时候 , 就或者很低门槛就可以做到 10% 转化率的时候 , 我那个时候已经做到 13%、15% 的转化率 , 对吧 ?
我能不能持续迭代 ,以及这个事情的上限有多高 。 这是它们在思考的事情 ,但是我觉得那个挑战还是依然还是存在的 。
我觉得现在看下来还有另外一点还比较有意思的点是在于有一些人间法则比较重的地方 ,Agent 不一定适合做 。
我前面其实前面讲了就是说 Agent 最好干什么 , 对吧 ? 其实还有一些就是 Agent 最好它不要去碰或者不一定能做成的 。
比如说海外在美国 , 比如说财务领域来讲 ,有很多 AI Agent 帮助你做代记账 、 自动关账 。 那这请问这个事情来讲的话 , 就是在国内财务的这个里面的要不要用 Agent 去做 。
你 Agent 在单某些环节去打补丁是可以的 ,但是在中国有一个很重要的一个人间法则 , 就是说很多企业它需要两套账 。
对 , 那你 AI 要不要去做另外一套账 。
所以人间法则是潜规则的意思吗 ?
我觉得人间法则是那种潜规则也好 , 或者主观也好 , 就是这些它不是一个单纯的技术驱动 , 或者说是靠技术就可以解决的一个问题 。
我觉得技术还是尽可能还是放在那些可以标准化 、 可以结构化的问题上 。 如果说就财务这个里面来讲 , 财务这个环节有一个默认的一个人间法则 ,其实就是它会有可能会有两套账 , 要不要让 AI 去对账 、 关账 , 然后做账 。
这个事情在美国是 OK 的 , 美国有挺多创业公司在做 ,但是在中国来讲的话 ,因为中国还是有很多企业需要两套账的 。
那你如果是一个 Agent 的话 , 你难道要帮助这个企业去做两套账 ? 那这个事情背后的比如说法律风险 , 或者说是业务风险 , 我觉得其实并不一定适合真正的中国公司去做尝试嘛 。
那这岂不是那个段子成真吗 ? 最开始 AI 特别火的时候 , 大家就有说什么 AI 不能替代律师 ,AI 不能替代会计 ,因为 AI 不能替代人去坐牢 。
所以我觉得还是要挑一些利基场景 , 然后这些场景里面现在来看的话 , 就是说最好来讲它能够重塑业务流程 , 甚至重塑组织 。其次来讲的话 , 你的进队是比较弱的 , 是一些小散的 , 对吧 ?
你能用技术解决问题 。
你刚才讲到就是像比如说你们投过的在法律里的这种案例 , 还有销售里的一些案例 , 就是它直接其实就是自己做一个服务公司 , 然后自己用 Agent 来服务这个行业 。
像这种公司的创始团队的创始人, 它是什么样的画像啊 ? 他们是不是比如说在法律行业或者销售领域还有挺深的积累的 ?
对 ,其实一定程度上来讲还是懂这个行业的 ,有这个行业经验的 , 懂 AI 的人。
这种人是算很稀缺吗 ? 你们怎么找到的 ?
我觉得还是在这个垂直行业里面 , 还是会有一些人对 AI、 对技术的变化比较敏感 , 然后同时又有对这个行业的很多生意是比较懂的 。
那比如说像你们投的爱语这个公司 , 假如说这个创始团队里有一个人可能他是法律行业出身的 , 然后他又了解一些技术 , 那他另外的比如说就真正能做开发的这些人 ,他是怎么吸引到的了 ?
我们看到这个创始人首先他自己学习能力还挺强的 ,他自己读 paper, 自己在学 , 同时他也有一个这样的一个核心的技术团队 , 然后同时跟包括千问这种模型公司有非常紧密的一些合作 。
就是一个会编程的律师 ,他本来就是个懂计算机的律师 。
他其实是金融行业的 。
金融行业 , 就是他的那个律所所服务的那个客户场景他是比较了解的 。
对 ,他非常了解的 。 对 ,他是懂需求 , 懂业务的 ,但是他是一个 AI 武装的新的律所 。
像这种垂直 Agent 的机会 , 你觉得你们能成批量的找到 , 还是可以怎么找到 ? 就你怎么 source 到这种机会 ?
我觉得还是有机会能够成批的出一些机会的 。 就是能够看到 , 就是还是对于各个垂直行业还是有生产力的很大的提高跟带动的 。
但是只是对于创业公司来说 , 它需要找到这样的一个适合它的 niche 的场景 。 对 , 它要挑 。 就是这个我觉得是会有批量的一批 ,但是我觉得就是前面说的每一波 ,其实这种公司最后跑出来大成的公司其实不多 。
最后做的会大家会发现其实都是做的是低垂的果实 。 所以我觉得还是有时间的紧迫性的 。
先做的还是重要的 , 对吧 ? 你觉得这种公司能长多大 ? 就在一个利基市场里 , 它通过自己其实我就掌握 Agent 的方式 , 我最后是通过结果来获得抽成的收入 ,在中国能长多大 ?
我觉得还是有机会百亿美金的 。 因为之前上一波的还是有很多代表性的公司 ,不管是满帮这种公司 , 还是 Shein 这种公司 ,其实我觉得都是其实你从另外一个视角上来看 ,其实都是上一个时代的产业互联网的公司 。
对 , 那我其实觉得这都是百亿美金级的公司 。 所以我觉得其实这个时代依然还是有机会能够产生百亿美金级公司 。
你现在是更看好这种直接收抽成的公司 ?
Agent 这个概念本身其实不就是代理完成任务吗 ? 这个词的本源不就是这个意思 ? 所以加上又看到我们有一批代表性的企业 ,其实初创虽然是初创企业 ,但其实是跑得还不错 , 然后也初步能够验证 , 会说让我对就是能够以交付结果垂直领域的 Agent 的公司其实是抱有挺大期待的 。
娱乐 Agent1:15:11
对 , 你刚刚讲那个就是垂直 Agent 其实都还是帮你提升效率的那部分 。 就你刚刚说的到现在可能还是行之有效的分类的方式的里面的 save time 的部分 。
那 Kill time 的 Agent 是什么 ? 其实我觉得大家好像比较少讨论一些帮你消遣或者说消费的时间的这种 Agent。
你现在看到的它的形态或者说趋势是什么 ?
在 Kill time 这个领域来讲的话 , 我们是觉得就是说 AI 还是有挺大机会的 。 因为我们能够看到就是说比如说以星野 、 造梦这个为代表的 , 它其实是一个虚拟角色的互动平台 。其实一定程度来讲的话 ,其实每个虚拟角色其实都是一个 Agent,但是可能它 Agent 的内涵跟咱们前面讲的建立在就是 OpenAI 提出来的建立在 save time 这个基础之上 。
讲的这个 Agent 的内涵其实是有一些差别 。 它更多的它是不是像人一样能有没有可能能够去陪伴你 , 给你提供一些情绪价值 。
它其实更多是以一个人的这个视角 ,而不是以一个任务的视角在去看这些 Agent。
就类似于比如说可能以前没有那么多 AI 含量的时候 , 你的陪伴你的东西也许是个布偶 , 它其实不会动的 , 它也没有什么自己的反应 。
那可能现在是个猫咪 ,是个宠物 , 那未来可能是个就是真的像人一样能真的和你让你有这种情感交流的感觉的 。
对 ,但是在我们的视角下呢 , 就是说我们其实觉得它不是陪伴 , 它其实是只是一个新形态的内容 。
因为在比如说在现有的这些 Kill time 的这些产品里面 ,是会有很多 Agent 的 。 每一个角色就是用户也会觉得这是一个 Agent。
那我们想说的是今天这个里面的 Kill time 里面的这些 Agent, 它今天它能做的事情更多是提供情绪价值 ,而不是能够真的能够提供情感关系 。
我觉得它今天的技术的边界在这个地方 。 因为你要想陪伴 , 一定程度来讲它是要能够提供情感关系的 。
但我觉得这个东西其实对于人的本身的情绪的把握 , 对于你的了解 ,其实这个东西要求包括记忆等等要求非常非常高 。
所以今天更多的是就是用户来到这个平台找一个像人的 Agent, 然后即时的获得一些情感的诉求 。
就是情绪价值是更片段性的 , 可以这么说吗 ? 更短期的 。
是的 , 一个是情绪价值 , 第二个来讲的话 , 这个情绪价值可能很多是通过角色扮演的方式来去获得的 。
对 , 你刚说这是一种新型的内容 。
对 , 所以我为什么觉得它是一个新型的内容呢 ? 是因为这类的内容形态或这类 Agent, 它其实有一个很大的特点是在于它有非常高的参与性 。
就一定程度来讲的话 , 就是这可能也是少有的创作者也是消费者 , 消费者也是内容的创作者 。
之前比如说不管是抖音 、 小说 、 音乐 ,其实说白了都是创作者创作完之后你去消费的 。 那这一次来讲的话 , 你是参与到创作的过程中, 你的每一次交互其实都是创作的一部分 。
之前看到有一些雏形 , 就比如说像类似于什么 《 完蛋我被美女包围了 》, 什么 《 底特律变人 》 等等 , 就是说你可以通过选择题引导故事的主线有一定的参与度 。
但是那个里面来讲的话 , 核心其实它的自由度还是受限的 ,以及它是还是有一条非常非常明确的故事主线和边际范围的 。
但是其实今天这个这些 Agent 高参与度 、 高自由度其实是非常强的 。 我觉得这是这一类的内容 ,因为有了这样一个非常显著的特征 , 所以它有机会可以成为一个新的内容形态 。
但是这个内容它今天的问题是在什么地方呢 ? 就是因为大家都是都知道觉得它的渗透率 , 它的留存度是不高的 。
原因是因为就是今天看一个消费的内容 , 大家喜欢的是一是高沉浸度的 ,不管是多模态的方式 , 还是说是剧情化的方式 ,是高沉浸度的 。
就是你用文字的方式和用视频的方式 , 肯定视频比文字更更吸引人。 然后你用比如非常好的剧本和弱剧本 , 肯定大家更喜欢剧情化的内容 。
就是所以大家喜欢的内容一定是高沉浸感的 。 第二点来讲 , 大家喜欢的内容其实是低参与门槛的 。
就是因为毕竟你要现在要输一堆字进去 ,其实坦率来讲 , 你要去想象你输入这个字其实是高消耗能量的 , 对吧 ?
其实大家已经习惯了 , 就是说我是来去直接去消费的 。
大家习惯了休息的时候打开抖音 , 你啥也不用干 , 你就看 。
对 , 所以其实今天来讲的话 , 就是说因为它的高参与度 , 所以它是一个非常显著的新的内容形态 。
但它的问题是在于它的沉浸感不够 ,以及它的参与门槛是高的 , 导致它只会在一些核心人群 , 比较 niche 的人群里面有比较好的留存 。
对于绝大多数人来说 , 对于你我这些绝大多数人来说 ,其实都不是它的今天的核心人群 。 但是这个模型的技术是在往前发展的 , 自然而然的它会变成一个多模态的形象 , 它会变成一个多模态的交互 , 剧情化也一定会逐步逐步加进来 。
这个是和推理能力相关还是 ?
一定相关啊 。 所以本身来讲它的沉浸感就是它一定会去提升的 。 这是一个模型能力进步一定会必然发生的事情 。
第二点来讲的话 , 就是大家能看到一定会去降低用户的输入门槛 。 大家不会再去输入了 ,有可能是通过选择 ,有可能是通过说话 。
但是选择的问题是怎么样能够让你更好的去做选择 。 你又不想被固定的线路给框住 , 又想发挥一定的高参与度 。
所以这里面来讲 ,其实对于推理能力其实要求是非常高的 。 所以等这个模型整体的能力提升之后, 这个它短板的就是沉浸度不够和参与门槛比较高这个问题是一定是能够看到在持续解决的 。
随着这个问题的解决 , 它的渗透率是必然它是会逐步提升的 。 我觉得就是说模型能力提升 , 它还是会让 Kill time 的这些 Agent, 它的体验还是会显著提升 , 从而会持续的会把那个渗透率拉升的 。
这个这样的一个新形态的一个内容 , 它是有机会变成一个新的内容平台的 。 如果你用 AI 生成的是现有的内容形态 , 比如说生成的是个短视频 , 生成的是个小说 , 那你大概率你其实你还是逃不过现有的分发平台 。
你还是会去抖音上, 会去番茄上, 会去起点中文网上 。 但是你只有是一个新的内容形态 , 你才有可能会去诞生一个新的内容平台 。
那它会是个平台吗 ? 我听你刚才的描述 , 似乎其实就是我和这个 Agent 之间的关系 。
因为今天来讲 , 大家其实是在做的就是不同公司对事情有不同的理解 。 一种公司来说的话 , 就是因为它意识到今天的技术的边界 , 所以我更多其实是做一个新型的一个内容 。
所以我为了满足供给方不同的需求 , 所以我就是有不同的 Agent。
我可以选 ,其实星野就是这样的 。
星野 、 造梦其实都有非常非常多的这些 Agent, 对吧 ? 那这些 Agent 多了之后, 这些 Agent 的创建者也有消费者 , 那其实就是它现在其实都是内容平台 。
然后有另外一种来讲 , 它其实是它就只有一个 Agent, 会有限的 。 它希望这一个 Agent 能够去千人千面的去服务不同的人。
对 ,因为我觉得你刚才描述的那种比较远期的形态 ,其实我想象中它好像是只有一个 ,但这一个可能它的外形不一定要是固定的 , 它的性格可能也不一定是固定的 。其实你最终生成的那个结果 , 就是你和它之间的交往和记忆 。
就是你要把它做成千人千面嘛 。
对 ,其实就是这个关系本身 。
对 。
就如果对一个用户来说 ,其实我是在这个上面投注了我自己的时间和心情和情感 , 我生成的内容是这段关系本身 。
对 ,但是其实这个是你今天的技术挑战是更大的 。
对 ,但现在技术可能达不到 。
对 , 就是我前面说的就是让它就是说快速的去给你带来一些情绪价值是可以的 ,但是你让它给你带来情感关系是难的 。
对 , 我说的那个其实有点接近 Her 的那种状态 。
对对对 , 那个是难的 , 那个是今天技术其实很难达到的 。
如果你想得远一点的话 , 那其实这两种 Agent 我觉得会合并 。 就如果说我有一个类似于 Her 这种 ,其实我对它还挺信任的 , 然后我跟它关系也很深的一个 Agent, 对吧 ?
好像理论上生活上的很多节省时间的事 , 我可能也会让它和我一起干 , 比如说逛街买东西 。
因为如果你要招一个秘书的话 , 一定需要这个秘书 , 你对它有极其的信任嘛 。
那这岂不是也是一个入口吗 ? 也是个巨头必争之地吗 ? 还是巨头也许最开始会不认为这是它主航道上的东西 。
我觉得这个的技术挑战就是可能会比从 save time 这边切过来的技术挑战可能会更大一些 。
就因为其实要技术到一个比较完备的状态才能到我们刚才 。
对 , 如果你变成就是说你要需要它跟你先建立情感关系 , 建立极其深厚的信任关系 , 这个事情的难度和我现在就可以明确告诉你我可以做哪些通用的任务 , 这相比来说我觉得前者难度还是挑战还是更大的 。
那我现在帮你做通用任务的 Agent,是不是至少我觉得移动端上, 就手机上这种能帮我做通用任务的 Agent,其实未来也有潜力可能发展成跟你有深度关系的 Agent, 就随着模型能力提升 。
但前提是你可能要先和一些用户先建立连接 , 就也许最开始你跟这个用户的关系就是个无情打工人的关系 。
对 。
你就帮这个用户干活的关系 ,但随着模型能力提升 , 可能你跟它是一个更深入的关系 。
对对对 , 我们其实那个想的其实是一个偏终极的情况嘛 。
然后平台的就是要渗透率提升 , 就是你刚才说的就模型能力的就往下一代迭代 , 包括它的推理记忆 , 然后使用工具都提升 。
这个事情的用户体验其实是一个强技术驱动的 , 这是第一点 。 第二点来讲的话 , 就是说基于模型能力的提升带来的体验的提升 , 这个事情的优先级其实是比你在内容平台上持续去提高低智能水平的供给更重要的 。其实这又回归回到到前面那个逻辑 。
对 , 就是在一个 AI 模型能力今天在持续快速的往前发展的阶段情况下的话 , 首先要先要确保的是你的产品能力是建立在最新的模型能力基础之上 ,以及不要在下一代模型能力出来之后, 你的模型能力代表的产品体验是存在着降维差异的 。
接下来我们可以讨论一下具身的 Agent。其实在很多人的语境里没有把具身算成是狭义的 Agent,不过明视是比较有跨软硬件的视角的 。
具身智能1:24:36
关于具身近期也有挺多热门的讨论 , 比如最近朱啸虎有一篇访谈是在讨论 AI 投资的 , 那里面很重要的一点也是说他们之前投的一些具身的公司 ,他们现在已经在退出了 ,因为他们特别不看好具身智能这个方向 , 觉得它离商业化还非常远 。
因为你们其实也投了一些具身的公司 , 比如逐际 , 那你是怎么去看具身这类 Agent 的成熟度的 ? 如果内比我们最开始讨论大语言模型的能力 ,也就是从聊天机器人 L1 到推理者 L2, 再到 Agent L3, 那具身离所谓的 Agent L3 到来的时刻大概还有多远 ?
会是一个什么样的节奏表 ?
我觉得因为朱老板一直是一个就是投资业绩凛然 , 同时这个又一直以来颇有争议的一个人物 , 对 ,也是我们投资行业的大佬 。
我觉得我看过他的这个采访之后呢 , 我觉得其实他对于整个具身智能里面现在一些商业化现实的描述是符合一定现实的 。
但是他对于具身智能或者说人形智能机器人这个不看好这个结论 , 那我肯定是跟他持一些相反的这个意见的 。
那我们可以先看现状 , 就对于具身智能来说 ,在过去几年肯定是受益于 AI 在快速的发展 ,但是今天具身智能它的智能化的水平坦率来讲 , 它其实都没有到类比大语言模型的 GPT-3 那个 moment。
为什么呢 ? 就是大家为什么会把 GPT-3 moment 作为一个当时大语言模型发展一个标志性的一个 milestone, 一个里程碑 ? 那原因是在于那一刻让大家能够看到了智能的泛化性 , 可以通过 skinning law 的方式去实现 。
但是你今天对于具身智能来说 , 预训练部分其实今天来讲是没有收敛的 。
就是怎么做预训练能让你比如说有更多数据就让它效果更好 , 这件事情是没有被验证的 , 没有找到那个方法 。
对 , 预训练没有收敛的意思就是说我该从哪些地方获得海量的数据 , 然后用什么样的方法去做加工 , 然后或用什么样的算法体系 , 然后能够让它实现泛化性 ,而且可以 skinning law。
所以具身你认为具身的真正问题并不是说它现在表象上的这个阶段看起来它没法商业化 , 这不是它最本质的问题 。
最本质的问题是它还没有找到一个可以去 scale, 可以去泛化的东西 。
对 ,因为今天的具身呢 , 过去几年的发展 , 一呢 , 比如说在硬件层面来讲 , 肯定是往前迈进了一大步 , 尤其是工程化的成熟度迈进了一大步 , 对吧 ?
不管是这个四足双足 , 包括可能今年的话灵巧手也会迈进一大步 。 然后从算法角度来讲的话 , 它不管是从模仿学习还是强化学习的结合 ,其实也是让它相比于之前的工业机器人也好 , 服务机器人也好 ,其实都有一些智能化水平的提升 。
但是泛化性这个 , 尤其是大规模场景的泛化性上 ,其实还是没有本质得到解决的 。
就这才是这个行业最大的危险 。
对 , 就是我们不希望我们做出来的下一代的机器人跟上一代的机器人一样 , 就变成一个一个垂直行业的集成商 。
至少在中国这个市场环境下, 做集成商是一个挺苦的一个生意 , 或者说它本身从商业角度来讲的话 , 就会遇到比较大的挑战 。
对 , 那所以其实今天不是说市场上没有需求 ,而是说今天的技术成熟度 , 它可以去实现的商业价值 , 我觉得其实是跟大家的预期其实可能是还是有一定的差距的 。
那你觉得具身这种 Agent 解决这个问题的出路你们看到了吗 ? 包括你们也投了这类公司 , 如果解决不了的话能怎么办 ?
我觉得现在其实是个信心的问题 。 今天来讲的话 , 就在整个具身而言 , 我不排除基于现在的硬件 , 基于现在的这个模仿学习跟强化学习 ,是可以找到一些利基市场的 PMF 点的 。
但是这个肯定是因为今天的技术水平 , 咱们前面分析到整个的智能化水平摆在这个地方 , 肯定跟大家的预期是有差的 。
所以在朱老板的眼中, 它今天确实没有到 PMF, 或绝大多数的场景下都没有 PMF。 所以我觉得更适合的是在我们自己的口径中, 我们觉得它今天是一个如果从一个技术 , 从最开始的科学发现 、 技术突破 、 工程化的复制 , 最后到一个产品的一个落地 ,是有四个阶段的话 , 我觉得对朱老板来讲 ,他可能喜欢找的是从工程转产品的阶段 , 或者是产品已经是 ready 的阶段 。
但今天来讲的话 , 对于整个具身来说的话 , 它是一个技术转工程的阶段 , 或者对于大家期待的来看 , 且不论说是是不是进家庭 , 就是即使是去工厂还是说去服务业 , 是一个技术转工程的阶段 。
它其实是一个 technology 跟 problem fit 的阶段 ,而不是一个 product 跟 market fit 的一个阶段 。 所以这就导致来说的话 , 那你想找 PMF 的公司 , 市场上绝大多数讲的故事可能是朱老板不 buy in 的 。
我觉得这个也正常 , 这个所以我觉得这个事情就是相当于是今天是一个半杯水的状态 , 对吧 ?
那你如果说是对于你今天是希望就是以 PMF 为导向找 , 那确实找不到 。 但是如果是你是对这个事情长期有一个预期 , 你觉得我今天投的投资其实是一个 TPF 的一个状态 , 我投资就是一个早期科技项目 , 我对于它将来的技术能够实现突破我有信心 , 我同时有那个耐心愿意去陪它在它的商业化 , 真正的商业化可能需要三年、 五年甚至更长的时间
, 那我觉得今天也是有很多企业是值得去做投资的 。
那回到我那个问题 , 就是从这个你刚刚说的技术到工程的阶段 , 实际上它能否转化是有一定未知数的 。
然后你们愿意投是因为你们相信它有可能能转化 ,但是如果它不能转化了 , 就如或者说它在一个时间段能不能转化吧 , 比如说三年到五年它都没有走完从 T 到 P, 这个行业会怎么样了 ?
具身这种 Agent 会怎么样 ?
因为我投逐际的时候其实也是 2022 年的 8 月份 ,其实那个时候也是因为看到了 MiniMax 的第二代的就是端到端数据驱动的模型 ,在文本领域来讲的话效果是非常不错的 。
所以你就在自动驾驶领域看过 ,在大语言模型领域看过 , 你自然而然的话就会类推说那下一个领域是什么 。
于是我就从 AI 驱动的角度找到了逐际 , 就这是我当时最朴素的方法和逻辑 。 对 , 所以一定程度来讲的话 , 我们肯定是 believe 说这个事情它是可以在未来两三年之内走到那个类似于 ChatGPT-3 那个 moment 的 。
这个事情的依据坦率来讲是跟前面咱们说对于大语言模型公司来说 , 它今天看到了 L2, 大家都在追 L2, 大家会预计一年之内实现 L3 一样 ,其实都是业内的这些人的直觉 。
我坦率来讲是直觉 。
就是你跟这些从业者 , 跟这些真的在技术一线的人的交流之后 ,他们的直觉传递给你 。
他们的直觉和他们的信仰认为到 GPT-3 moment 找到了预训练的可以 skinning law 的方法这个时间点 ,他们觉得在两到三年之内是可以找到的 。
那问题是就是如果找不到 , 那确实具身就是就会变成真的会变成一个巨大的一个泡沫 。 那确实是有一个泡沫破裂的一个巨大风险的 。
我前面讲就是说这是个半杯水在这 , 对吧 ? 它确实有可能到不了满水 , 那你要不要去赌一个 。 所以这个就是也包括另外一个层来讲 , 就是你的投资风格跟投资喜好的问题 。
那比如说我们投这个项目 , 一定程度来讲还觉得这是一个特别巨大的一个机会 , 我们在特别早期的时候出手想去搏一个这样大的一个机会 , 一定程度来讲的话 , 从我们的投资的思路跟理念上来讲的话 ,其实是符合的 ,是可以承受这个风险的 。
尾声1:31:42
然后那个最后的话 , 就是想那个你可以分享一下你最近看到比较有意思的东西 , 包括比如说项目啊 、 书啊或者作品啊都可以 。
我觉得看 AI 应用其实确实是看的重心比较多 , 然后我觉得软硬件的应用其实是都在看 。 软的层面上就像前面说的 , 确实是偏 to C 的 ,是非常 open 的心态在去看 。在 to B 领域来讲的话 , 我觉得就是更偏重那种专业人群和垂直领域 Agent。
我觉得其实一直是有很多新的项目能够去涌现出来 。 我还是对于高潜力的创业者 , 我还是抱有非常大的期待和耐心的 。
过去这一年多时间里面 , 还是看到挺多回溯互联网跟移动互联网的这些书 , 包括什么沸腾 15 年啊 , 然后也包括可能讲美团的类似于什么九百一胜啊等等这些 , 就我觉得都是非常有启发 。
这个其实这个点是在于还是要对于年轻人是要有信心的 , 尤其是高成长性的年轻人, 就会有抱有更大的这个期待和信心 , 所以会在他们的身上花更多的时间 。
年轻是以什么来识别的 ?
我觉得还是成长速度 , 就是 AI 这么快的发展速度情况下, 这个创业者一定是比这个 AI 本身行业的成长速度还是要更快的 。
所以如果三个月之后你跟他聊 , 这个人没有什么显著的变化 ,其实一定意味着就是说这个人其实成长速度是不快的 。
我觉得另外还有一个就是 ,因为我们其实今天这个市场上发生的很多事情 ,其实历史就是有一些重复的 。
那比如说开源的事情很热的时候 , 那我觉得比较受启发的还是去回顾一下之前安卓的开源和上一波数据库的开源 。
对 , 所以我觉得看类似于这些类似于安卓传奇啊和包括 Pinecone 也是我们被投企业自己写的 ,Pinecone 写的与开源同行这些书 ,其实是你看过之前的一些开源的那一波开源的企业和开源背后成功的原因 ,以开源真正的价值 , 你再就会看到今天比如说 DeepSeek 干的开源的事情 ,其实都是有启发的 。
具体的启发是什么呀 ? 就开源这块你得到的具体启发是什么 ?
不是开源就一定会赢 , 赢的原因其实都是在开源的水下 ,以及开源的意义到底是什么 , 目的是什么 。
对于那些数据库公司来说 , 它开源的目的是因为它是一个整个公司业务系统非常核心的一个环节 , 它的上游跟下游其实都是非常复杂的 , 所以它需要用开源这个方式去把上下游所相关的这些环节的这个生态全部融合在一起 , 降低客户部署成本 。
它背后成功和推动的原因其实是整个这个事情的在云化 , 然后屏蔽到很多硬件底层 。 对于安卓来说的话 , 它也不是说它开源 , 即使是它是在 Google 收购之后开源的 ,也不是开源就成 。
因为它最开始 Google 讲开源这个事情的时候 , 没有手机厂商响应的 。 它最后它能够成 ,其实也是后面是因为 Google 是一家互联网企业 。
第二个来讲 ,Google 有那个时代互联网企业里面非常核心的一些关键的应用 ,以及最重要的事情是 Google 有这套基于广告的商业化变现方式在扶持着这个生态 。
当时有很多人也想去做操作系统 ,但是你怎么样吸引开发者 , 苹果靠的是先发 , 靠的是硬件的领先 ,但是只有 Google 有方法 , 就是用它更好的商业化激励的手段 , 就是广告这套变现的手段 , 才吸引了整个这个平台的生态嘛 。
苹果是直到 2013 年它才跟进了这套广告的这套体系 。 所以其实对于开源来说 ,其实它一定程度来讲还是为了能够我基于开源的这个产品能不能形成自己的一个飞轮效应 。
对于数据库开源来说 , 它的飞轮效应是在于我的开源软件 , 然后我丰富的应用场景 , 让我自己这个产品的实际的可靠性更强 , 适配成本更低 , 产品体验更好 , 形成这样一个飞轮 。
然后对于安卓来说 , 开源之后建立了应用者开发生态和应用及客户体验之间的这样一个飞轮 ,但它的飞轮之间离不开背后 Google 的整个商业化的依托 。
所以对于我们今天去评估任何一个开源 , 包括 DeepSeek 开源 ,其实核心在于它的价值是在于它能不能形成这样的一个生态的飞轮 。
单纯模型开源来说的话 ,其实是有挑战的 , 就是因为其实模型和实际的使用来说的话 ,其实是中间差了一层产品 。
中国还有另外一层复杂是在于中国的基础设施是易购的 , 那模型的开源其实是有助于易购的这些基础设施 , 这个生态对于这个模型的兼容 , 这块其实是有比较大的作用的 。
也就是说 , 就是你怎么去看待 DeepSeek 开源的意义 ,以及是不是它开源之后, 就是什么样的地方可能对于现有模型公司是有影响的 ,但其实哪些地方其实是并没有实质影响 。
就有一个我觉得比较明显的影响 , 可能是开源本身带来的一些影响力 。
技术影响力是实质的影响 。
对 , 招人。
有助于人才的吸引 。 对 ,其实没有实质影响的意思就是说 , 它并不会说因为这个模型它开源了 ,而给新建领先 。
更多的人去用开源模型 , 就一定会意味着这个开源模型就会得到更好的飞轮的反馈 , 从而自然推导出说它会有下一代更好的模型 。
对 ,因为这个其实在大模型的开源本来就不太成立 。
对 。
因为社区的反馈不太可能帮你把这个模型训得更好 。
对 。
那今天非常感谢夏令做客 , 晚点聊跟我们分享了他关于 Agent 的一些观察和洞察 。 总结来说的话 , 我觉得夏令是比较看好垂直的 Agent,因为你认为就是在做通用大模型公司的主航道上, 就是我把模型的通用能力推得更高这个方向上去做新的创业公司其实是比较危险的 。
那可能在垂直的领域 , 你做最后一公里 , 你把结合这个行业里的专业数据和一些 know-how 去做产品 ,是更有壁垒和护城河的 。
那我们也推演了一个可能下半年会发生的让人觉得有意思和兴奋的场景 , 就是各个大公司都会来争夺 Agent 的入口 。
那这件事情的一个比较大的变量就取决于模型的能力能提升到什么程度 ,是不是像大家说的 , 可能在今年底或者到明年初的时间 , 就能真的达到 Agent 所需要的模型能力的状态 。
今天谢谢大家的收听 , 各位拜拜 , 再见 。
好 , 再见 。
本期连点呈现继续讨论一下和之前一些节目相呼应的点 。 一是 Agent 的核心能力 。在 107 期与戴宇森聊 Agent 的那期节目中 ,他总结了三个核心的能力 : 推理 、 编程 , 还有工具使用 。
这期我们从 Google 提出的 Agents 框架对 Agents 所需的能力做了更多的补充 。 除了推理之外,Google Agents 白皮书里还提到了很重要的一个能力是记忆 。
最近 OpenAI 也刚刚发布了全局记忆功能 , 这可能是 AI 助手从工具到与人建立更深的关系的重要一步 。 而更深的关系本身有可能成为一种壁垒 。
理论上你用一个 AI 越多 , 它关于你的记忆越多 , 它越了解你 , 你用它也就会越顺手 , 越离不开它 。在工具使用的部分 , 除了模型本身的能力提升之外, 这期我们也比较多的讨论了 MCP 等工具调用协议的生态变化 。Anthropic 最初提出 MCP,是为了让它自己的模型能够更好的去使用更多的工具 ,而目前 MCP 已经是一种相对主流的工具调用方式 。OpenAI 也在近期宣布了未来会支持
MCP 生态 。 二是关于下一代硬件终端 。在 109 期和卡茨克聊他使用 AI 的体验时, 我们最后聊到的一个话题就是现在还看不到新的硬件终端 。
如果还是以手机为终端 ,AI 应用创业可能很难逃出大厂的阴影 。 而这次夏令讲了他对 Meta 的一些观察 ,Meta Ribbon 的产品更新 、 定制芯片的一系列动作 ,以及在 7B 等小模型上的格外着力 , 似乎都寄托着 Meta 对眼镜成为下一代终端的更大野心 。其实在中国的大公司里 , 阿里 、 字节也都在模型和眼镜一起做 , 尤其是阿里的开源模型系列里也有很多小尺寸的模型 。
眼镜是否有望成为独立于手机之外的终端 ,是个分歧很大的问题 。 从目前的体验看 , 它似乎很难接班手机 ,但另一方面 , 这个领域的创业公司也层出不穷 , 大厂也都在发力 。在黑莓时代可能很难想象 iPhone,而在 iPhone 之前 , 苹果也有不成功的掌上电脑产品刘顿 。
如果真的有新终端 , 属于新公司的 AI 机会会被大幅扩展 ,但它到底是什么 , 答案还在迷雾之中 。
本期节目就到这里 , 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。
你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 LatePost。 下期再见
。





