开场0:00
ChatGPT 的最终目标是 WeChatGPT。 比如说 OpenAI 现在内部成立了一个新的 , 叫做 "Future of Work" 的一个 team, 开始就是加速 AI 在各种商业场景下面的落地 。
我觉得一个批评的声音就是 , 这次 Agent Builder 其实就是和比如说 AGI 的这个路线 , 可能是有分歧的 。
欢迎收听 《 晚点聊 》, 我是曼祺 。 今天我邀请了两位常驻硅谷的朋友 ,AGI house 的合伙人 Henry Yin 和 Naomi Xia, 来一起聊 Agent 工具链的发展趋势和这个领域在美国的创业实践 。
我们第一次录制是在 11 之前 ,而不久前的 10 月 6 日,OpenAI 举办了第 3 次 DevDay, 即开发者日, 发布了一系列与 Agent 相关的新工具 , 包括 AgenticKit、New Evals,也就是新的一套评估工具 。
这次 OpenAI 也带来了 Apps in ChatGPT 和 Apps SDK, 这是 ChatGPT 试图变成操作系统的再一次尝试 。 所以本期节目也是分为两部分 : 前面我们讨论了刚结束的开发者日的一些亮点 , 第二部分则是对 Agentic Tooling 即 Agent 工具链的发展脉络和当前热门环节的一些梳理 。
两部分有一些呼应 , 比如在 DevDay 之前 , 我们就重点讨论了 Evals 即 Evaluation( 评估 ) 这个环节 , 这也是 OpenAI 此次的更新之一 。
下面我们正式进入节目吧 。
两位可以和我们的听友简单打一个招呼 , 自我介绍一下 。
谢谢曼祺的邀请 。 大家好 , 我是 Henry, 我是 AGI house 的联合创始人兼 CTO。 我之前本科的时候毕业于清华姚班 , 后来来伯克利读博 , 研究方向是 AI 系统和程序分析 。
读到第 3 年的时候 , 我选择了辍学创业 , 做了我第一家公司 , 叫做思码逸 , 专注是用 AI 来提升开发者效率 。
然后做工具的那几年呢 , 让我对于就是 Agent 的开发工作流 , 还有开发者的这个生态有了比较直接的体感 。
在 AGI house 呢 , 我们聚集了一群就是顶尖的 AI 的创业者和研究者 , 包括像 OpenAI 的 co-founder Andrej Karpathy, 然后像谷歌的创始人 Sergey Brin, 还有首席科学家 Jeff Dean, 还有 Anthropic 的联合创始人 Ben Mann。
然后通过构建这个社区的过程呢 , 让我更早和更深地看到了这一波 AI 的这个演化的流程 , 尤其是从这个模型到应用 , 然后再到如今这个 Agent 工具链的爆发 。
所以目前的话 , 我会更多地专注于思考和投资 Agent 方向的工具层和应用层 。 非常高兴今天有机会和大家分享一下我们看到的一些新趋势和一些有意思的新项目 。
Hello 大家好 , 我是 Naomi。 然后我之前是在沃顿商学院毕业之后, 就加入了 JP Morgan 的旧金山办公室 , 然后主要是他第一个 hire for 我们的 AI 的这个主要负责的这个 team。
然后之前也负责早期投资 , 然后也负责一些大型的公司的一些 fundraising 啊 , 就是融资的项目 , 比如说 OpenAI 的 fundraising 也之前是我在负责 。
然后现在呢 , 就是加入了 AGI house, 主要负责他早期投资的业务 , 然后现在也已经投资了大概 20 多家公司 , 然后包括 Composio、Cartesia、LiveKit, 还有 LlamaIndex。
然后今天我们也会就是比较深入地聊到其中的几家公司 。
开发者日3:11
接下来的一部分是我和 Henry 在 10 月 6 号之后, 补充聊了 OpenAI 开发者日的一些新的进展 , 包括这个 Agent 的工具是由什么构成的 , 对创业生态的可能的影响 ,以及从 GPTs 到这一次的 Apps in ChatGPT,OpenAI 是怎么试图去变成一个操作系统的 。
10 月 6 号的时候 ,OpenAI 他办了第三届的开发者日, 有很多发布 ,其中有一个比较重磅的发布 , 就是 AgenticKit。 这个和我们节前就是在讨论的 Agentic Tooling 的趋势是很相关的 , 所以正好趁这个机会我们可以补充再聊一聊 。
包括我们也可以延展地聊一下就是 OpenAI 10 月 6 号的这一整个 ,是他第三次办 DevDay, 就开发者日, 他有一些什么样的进展和动作 。
我们可以先从 AgenticKit, 就他这个跟 Agent 打造相关的一套工具开始聊 。
我觉得这次发布 AgentKit 给我的感觉其实是 OpenAI 自己练出了一身武功 , 然后呢 , 现在想把它传授给广大的开发者 。
这个 AgentKit 呢 , 这次涵盖了就是整个 Agent 的开发的这个生命周期 , 首先是从构建 Agent 开始 。 那么他这次出了一个叫做 Agent Builder, 实际上就是一个视觉化 , 通过拖拽这些小方块 , 然后能够构建 Agent 的一个快速的一个方式 。
发布的时候呢 , 这个现场也有一个就是 8 分钟以内的一个 Christina 做了一个 demo, 就是很快速地通过拖拽拉 , 然后从 0 开始完成一个 production 级别的这个 Agent, 还是非常好用的 。
然后第二个部分的话就是 , 你 build 好了 Agent 以后, 你需要把它部署给客户 。 那这次的话他们推出了这个 ChatKit, 它 ChatKit 主要解决的就是前端的问题 , 终于有了一个这个前端的 UI 的这个 SDK, 然后可以很容易地去把这些 ChatKit 的 component embed 到这个比如说 ChatGPT、ChatGPT 这个生态里面 。
这个也是对于用户体验非常重要的一件事情 。 最后的话就是 , 当你部署给用户以后, 那你需要去持续地去监控 、 去评估 , 然后以及优化 。
所以这块的话他们在 Evals 上面出了好几个新功能 , 包括就是 datasets, 包括 trace grading, 然后包括就是自动化的这个 prompt 的优化 , 然后以及后续真正去改进这个模型 。
那么就是他们新功能就是 reinforcement fine-tuning。 所以整个相当于流程都跑通了 , 这个对开发者来说还是一个非常非常 exciting 的事情 。
比如说他最开始做的这个造的这个部分 , 就 builder 那个部分 ,他是不是有点像之前的 DeFi 还有自己做的 code。
我觉得其实是非常类似的 。 这也是为什么有一些人可能对这次发布可能会比较失望 ,因为感觉这已经是一个就是非常成熟的市场 。
那么 OpenAI 的话呢 , 只是他们自己可能确实在一些细节方面 ,UI 这个 UI/UX 做得比较好 ,但是可能确实并没有说和 DeFi 啊或者 n8n 啊或者这个 Zapier 做出足够多的差异化 。
所以他的那个核心逻辑也是一个 workflow 是吗 ? 就他是有一个工作流 , 然后你去拖拖拽拽做成那个工作流 , 然后变成一个 Agent。
对 , 比如说那个 demo 的时候 ,他第一步就是先做了一个 classifier, 把这个 prompt 分一个类 , 然后有一个 if else, 后面接一个 if else。
如果是 if 的话 call 一个 Agent, 如果是 else call 另外一个 Agent。 所以其实是一个完全人类手工来 craft 这种工作流的一个形式 。
然后我觉得你刚说第三部分 , 就是这个持续优化的部分 ,他上了一些评估的功能 , 这个和我们上次聊的也挺相关的 。
因为我们上次聊了有一些公司他首先是专门做这个的 , 同时 OpenAI 就前段时间也有一个收购嘛 ,他 11 亿美元收了一个公司叫 SetSeed, 那个公司做的也是一些相关的事啊 。
这个就大家也可以听我们后面的内容 , 这个我们有详细展开来聊 。
那么这个事情的话 , 我之前觉得是某一些 Agent 公司他们的护城河 , 使得他们的 Agent 比别的公司做得更好 。
但现在来看的话 , 就是这些会东西会逐渐地标准化 。 像 OpenAI 现在就推出了就是 datasets、trace grading 和 reinforcement fine-tuning, 联合起来一起用的话 , 我觉得可能会产生类似的效果 。
Trace grading 你可以解释一下, 就是他他具体是做什么呀 ?
一个 trace 就是一次完整用户和这个 Agent 交互的流程 , 比如说用户想让 Booking.com 帮助他去订一张机票 , 那么从用户开始表达说我从哪年哪月哪日从哪个城市飞到哪开始 , 到最后完成这次订票或者订票失败结束 , 是一个 trace。
然后这个 trace grading 就是通过比如说写一个 grading 函数 , 然后能够去判断就是这一次和用户和 Agent 的交互哪里做得好 , 哪里做得不好 , 然后可以给他打一些 label, 打一些分数 。
所以这个现在是用函数实现的 , 还不需要用模型来去给他打分是吗 ?
这个中间是可以用模型的 , 就这个是用户来决定的 。 如果要是你不需要模型就能打分的话 , 那更简单 ,但是他是可以用 LLMs 的 jobs 来打分的 。
对 , 你刚才就提到他这个东西发了之后, 就有一种反馈是觉得这个比较失望 。 那有什么比较好的反馈吗 ?
我觉得我身边硅谷很多朋友其实他们自己平时都是比如说 cloud coding、codecs 呀来 build Agent, 所以这种拖拉拽的形式可能对他们的这个工作流的改变并不大 。
但我觉得可能会对于很多企业里面可能平时不是用 cloud code 的 , 或者说不是那么 technical 的这些工作人员的话 , 会有比较大的意义 。
业务人员的对吧 ? 因为我看他这次确实他也找了一些公司来给他合作站台吧 , 算是 。 都是一些还比较大的公司 ,Canva、Figma 之类的 。
对 , 我觉得这次他们和前两年 GPTs 做得比较好的一个点就是在于可能这次有更多的这个 launching partner, 就有更多更好的这个初始的应用 , 能够把这个应用的 bar 拉得稍微高一点 。
因为要不然的话 , 就可能会出现两年前 GPT 这个雷声大雨点小 , 最后大量的这个 GPT store 里面的 GPT 都质量比较低下的这种情况 。
这个本来也是我想问的 ,因为他 23 年就是他第一次开这个开发者日的时候 ,他当时推了一个市场还挺关注的东西 , 就你刚说的 GPTs, 还有 ChatGPT store。
就那会儿大家想象中他好像就是说大家可以在这个 ChatGPT 上把它作为一个平台 , 我们去开发不同的应用 。
但实际上这个后面发展的不是特别成功 , 就他不算一个很繁荣的生态 。 你觉得这一次他会有什么不一样吗 ?
我觉得这次变化还是比较大的 。其实就是 ChatGPT 作为一个操作系统这个事情已经不是第一次 hive 了 。 真正的第一次 hive 就是两年前他们 launch 这个 GPT、custom GPTs 的时候 。
然后那个时候的话 , 我觉得他的主要问题在于 , 首先这些 GPT 他最后大部分都变成了一个就是 prompt 的一个模板 , 加上一个自定义的 logo。
原因是在于这些 GPT 他们不能就是比较
可靠的 , 比如说去调用第三方的服务 , 然后他们也不能存储状态 , 然后他们也不能比如说发送通知 ,也不能去 run 一些工作流 。
像这些事情都是上一代做不了的 。 那么这一次的话呢 , 我觉得真正有了这些 AgentKit 啊 , 然后 Apps in ChatGPT 啊 ,Agent Apps SDK 啊 , 现在有一个真正的平台了 ,而不是只是一个就是这个 prompt 的包装 。
比如说这个 Apps SDK 提供了真正的 OAuth style 的这种授权 , 然后呢他也可以去调用外部的工具 , 然后他也有了 eval,也有了这个 versioning, 包括他这个 ChatKit 提供的这个 UI 的这个 building blocks, 相当于是给开发者提供了构建一个完整应用体验的所有工具箱 。
所以我比较期待这次真正的这个 App Store 这个生态能够做起来 。
有什么你印象比较深的这种初始应用吗 ?
其实可以对比一下 Canva, 两年前和 Canva 这一次的这个应用 ,其实我觉得用户体验就好了不少 。 这个是比较能对比的 。
像其他的一些 , 比如 Booking.com 可能是新做出来的 。 我觉得 Canva 的话可能之前和现在 , 可能现在是 UI 更好一点 ,但之前的话呢 ,他也能够就是给你生成一张图 ,但现在的话他会直接和你的 Canva 账号去做一个绑定和一个授权 , 然后把你之前的 Canva 这些账号里面的信息就是用到你这次的生成中 。
这个是一个点 。 另外的话就是我觉得两年前可能像 Canva 这样的比较高质量的 GPTs 是非常少的 。 他虽然发布的时候说 GPTs 他可以去调用外部的服务 , 然后读取外部的数据库 ,但其实大部分的 GPT 他都本质上就是一个 prompt。
那么就会出现非常良有不奇的这些应用的这个情况 。 那这次的话 , 我觉得这个工具链的成熟 , 会使得可能广大的开发者们都能够在不费太多时间和精力的情况下, 能够开发出在质量上面和这些 launch 的合作伙伴像 Canva 同等质量或者说更好的这些应用 。
就你刚才讲的 , 就是你觉得这一次和 23 年那一次的不同啊 ,也是讲到就是 Apps in ChatGPT 还有 Apps SDK, 这个也是他们这一次的比较重磅的 。
因为在 MaltaMind 一上来就是先发的 Apps SDK, 包括后面就是这个活动结束之后,ChatGPT 的负责人 Nick Trulli 他是接受了美国媒体的一些采访的 。他自己也直接说了 ,他说 ChatGPT 是有潜力变成一个操作系统的 。
那可以把这部分也延展地讲讲 , 就比如说这个 Apps SDK 还有 Apps in ChatGPT, 它都是一些什么东西啊 ? 就比如开发者可以怎么用起来 。
我觉得这个事情其实非常好理解 。 它本质上就类比之前我们 iOS 的这个 SDK。 这次的 Apps SDK 呢 , 它其实是基于 MCP 协议构建的 。
那它除了 MCP 提供这些第三方的服务以外呢 , 它还加上了这个 UI 的元素 。 就是除了文字回复 , 现在还可以就是展示一个 interactive 交互式的这个组件 , 然后来呈现一个类似原生 app 的这么一种用户体验 , 全部都发生在 ChatGPT 里面 。
所以我觉得这个是这次 Apps SDK 比较厉害的地方 。 我觉得它对于现在这些应用的开发者来说 , 最大的这个意义就是这个分发的这个红利 , 对吧 ?
因为这次也公布现在 ChatGPT 他们大概有 8 亿的周活 。 那么现在你只要 build 一个一个好的一个 app 在 ChatGPT 里面的话 , 一下可能就会 , 比如说把你的这个应用带给大量的这个用户 , 然后你就不需要再去这个解决这一些冷启动的一些问题 。
我觉得还有意义比较大的是还解决一个信任背书的问题 。 比如说你要初创公司去服务一些比较在乎安全合规的这些企业 , 那么现在通过有这么一个 ChatGPT 这个平台 , 可能更容易让这些初创企业接入到这些 enterprise 的这些客户的这个流程中去 。
所以其实它相比 23 年有两个点 , 一个就是刚才我们已经提到的 ,他在技术上 ,他以前可能就是你只能搞搞 prompt 的模板 , 现在是可以做一个完整的应用 。
另外一个就是你刚刚说的 ,其实在分发或者说你的商业触达上,ChatGPT 已经有这么多的用户了嘛 ,他其实是可以给开发者更直接的激励的 。
就你可以帮他们赚钱 , 说白了 。
对 ,因为上次两年前的话是说 ,其实最后可能也没有几家真正从那里面赚到钱 。 但我觉得这次应该是会有一些变化的 。
对 ,不过我看他的那个博客和发布会 , 就是到底怎么赚钱这个事 , 我觉得他也说的比较模糊 。 比如说像具体的怎么分成啊什么的 , 或者广告什么 ,他现在这个还是比较模糊的 。
对 , 现在应该还处于实验期 ,但我觉得未来可能就比如说抽 30% 这种模式 。 iOS 应该是抽 30%, 如果没有记错的话 。
我们想象一下现在就是软件市场的 30%, 应该还是一个很大的一个饼 。
你觉得为什么 OpenAI 在这个时间点开始在开发者市场有更多动作 ? 我觉得我平时可能看到比较多的是 OpenAI 在 to C 上是更激进的 , 然后像 Google 和 Anthropic 可能在 to B 上是更激进的 。
包括 24 年当时有一个数据嘛 ,是说 Anthropic 其实是抢了不少 OpenAI to B 的一些份额 。
我觉得 OpenAI 是不会放弃 to B 的 。 然后这次这个动作的话 , 可能有几方面的原因 。 一方面是用户规模 , 就 ChatGPT 这个 8 亿的周活已经是操作系统级别的这个用户入口 。
然后其次的话 , 我觉得也有生态上面的压力 , 像 Anthropic、Google 都是疯狂的往这个 enterprise 还有开发者上面去推 。
我觉得 OpenAI 的话肯定不会以后只靠这个 to C 的 。 这个我们也能从 OpenAI 内部团队的变化看见 。 就比如说 OpenAI 现在内部成立了一个新的叫做 Future of Work 的一个 team, 开始就是加速 AI 在各种商业场景下面的落地 。
比如说客服 , 比如说这个合同的这个审核 , 再比如说数据分析 , 再比如说这个商业线索的转化 。
像这些他们都在自己内部做 。 OpenAI 在自己的频道上面也发布了一系列就是 OpenAI on OpenAI 的这个视频 , 大家可以去看一下, 大概覆盖了刚才我说的那几个场景 。
就是用 OpenAI 自己的这个 AI 的这些能力去相当于这些 B2B 的这个全流程 , 包括就是你去做销售啊 , 然后去卖单啊 , 然后包括你后面去做这个客服啊 , 做 customer success 啊 , 所有东西用 AI 来做 ,OpenAI 自己在那做了一遍 。
所以他在 build 这些 agent 的过程中, 这些经验我觉得他们把他们转化成了这个 agent kit, 现在把它分享给其他的这些开发者 。
可以举一个例子 , 就是他们做这个商业线索转化 ,OpenAI 的话每个月现在大概有 13,000 个就是英镑的这种销售的线索 。
那么他们之前的话 , 人力可能只能比如说对其中的 1,000 个提供相对比较个性化的这种回复 。 那么现在的话有了 AI 以后 ,他们这个效率就大幅度的提升了 。
然后另外的话 , 比如说客服 , 现在比如说所有的这个 ChatGPT 的这些客服都是 AI 来 power。 那么这个 AI 的话 , 它就会和他们内部的这个知识库啊 ,以及他们的这个政策库去交互 , 然后服务这个用户 。
同时的话呢 ,他们在这个服务的过程中 ,他们也在不断的做这个 eval,也在不断做这个改进 。 所以他们其实这个 agent 的这些 trace grading 的结果 , 可能反过来会反补他们的知识库和他们的这个政策库 。
所以我觉得他们自己 build 的 agent 多了 ,他们自然而然的他们的工具也打磨的更好了 。 所以最后就是呈现出来的形式就是这么个 agent kit, 然后给我们所有开发者 。
就是你开头说的 ,他练了一身武功 , 然后放出来给大家用 。
对 。
然后你刚说第一个原因 , 就是你说他不会放弃这个 to B 和 to 开发者 to 企业的市场 。 这个事如果从商业上推演的话 , 如果他这块做的不好 , 对他来说会是个很大的危险吗 ?
就除了我赚不到这一部分的钱之外 。
我觉得数据对于模型的这个提升还是非常重要的 。 因为他可能需要 cover 像他们认为这个模型的 intelligence multi-dimensional, 对吧 ?
你在某一个 dimension 你想要改进的话 , 你只有它的数据上来了才可以 。 我觉得就是他如果放弃 to B 的话 , 最终的话这些缺少的那些数据可能也会影响模型整体的效果 , 然后导致就是比如说 to C,其实很多 ChatGPT 的用户还是 productivity use case, 最终也会影响这边模型的效果 。
因为就是 OpenAI 现在其实感觉他做的事越来越多了 ,而且他做的很多事都是要非常大的投入的 。 包括就是他 9 月 29 号发的这个 Sora 2, 对应的 app 这个也会烧很多算力 , 然后他又在做基础模型的研发 , 对吧 ?
肯定得往前推 , 然后还有很多这种开发者的东西 。 你觉得他同时干这么多事 , 你觉得会影响他追求 AGI 的速度吗 ?
我觉得他们的野心是非常大的 , 当然 OpenAI 扩张的速度也是非常大的 , 现在已经有好几千人了 。
但我觉得确实 , 我觉得一个批评的声音就是这次 agent builder 其实就是和比如说 AGI 的这个路线可能是有分歧的 。
因为比如说 AGI 的路线追求的是说把这些人手工写的死流程吃到模型里面 , 这样的话中长期的话可能会这个改进的速度会更快一些 。
那么 agent kit 的话实际上是一个非常务实的一次转身 , 可以说是 。 它实际上目的是先把现在的这开发者和企业的这个需求先吃住 。
因为我觉得大部分人可以就是说同意的是 , 可能真正的终局是一个高度的 autonomous, 然后能够执行非常多步的任务 , 然后能够持续使用工具的这种有状态的智能体 。
但它和实际上 agent builder 想要做的 , 把流程画成图 , 再塞给模型跑的这种 agentic workflow,其实是两条路 , 甚至是有点就是相反的 。
那么我们可以看到就是 Anthropic 他们这个 cloud code 的这个思路 ,其实就是那种通用 agent 思路 , 核心就是让智能尽量让智能体自己跑 , 然后少画这些流程图 。
这条路的好处的话就是说底模只要 base model 只要一升级的话 , 智能体会直接受益 。 那么 agent kit 的话呢 , 它更多的还是说我现在可能等不到未来模型更好 , 我现在就要在企业里面落地 。
那么这个其实对于追求 AGI 的这个 researcher 来说 ,他这个产品并不 sexy,但对于比如说大客户来说 , 那它其实很安全 , 好理解 , 能落地 。
所以我觉得他最后应该能卖单 。
那我觉得他其实相当于都做了 。 因为他在那个 build agent 这个环节 ,他其实给了你两种选择的 。 一种就是他这次发的这个 builder 是个可视化可拖拽的 , 然后他之前就发过那个 agent SDK。
对 , 我觉得 Sam 可能现在想的是我什么都要 。 人多了以后可能会有一些分叉 ,而且可能为了支撑这个越来越大的估值 , 可能这个商业化和 revenue 的压力可能也是越来越大的 。
就是对 OpenAI 这个公司来说 ,他也有支撑估值的压力吗 ? 还有一种观点是认为他已经裹挟了太多的投资 , 包括他比如说又采购了英伟达很多东西 , 采购了甲骨文 , 采购了 AMD, 这些大的公司之间 , 这些投资方之间就相互纠缠的很深 。
就他已经到了一个就大而不能倒的状态 。
我觉得他确实现在可能已经达到了一个 too big to fail 的状态 ,但是他可能野心还是非常大 。 现在可能是 5,000 亿 ,但是我想这个 Sam 可能肯定是不止 5,000 亿的 , 对吧 ?
可能还要往上走一个数量级 。 那我觉得还是需要一定的这个实际的商业价值的支撑的 。
然后这一次的这个开发者发布之后, 你觉得就是在你周围感受到的 , 包括你们 AGI house 社区里的这些创业公司 ,他们是怎么来看这个事带来的机会和可能的压力的 ?
我觉得大部分人可能看到的还是机会 。 我觉得有一个新的平台能够让这个开发者和用户离得更近 , 我觉得总体来说对于开发者和创业者来说是一个很让人兴奋的事情 。
压力上面可能也有几个方面 , 比如说一个方面的话是我觉得存在一个数据和留存的一个不对称 。 因为现在比如说 apps 的上下文和这些数据 , 它还是主要托管在 ChatGPT 的这个环境内 。
那么初创公司的话 , 或者说这些开发者拿到的可能只是有限的上下文调用 ,而不是完整的用户行为或者分析数据 。
这个我觉得会让开发者比较难以真正的建立一些用户关系 , 或者优化这个留存 。 换句话说 ,有点像是你在别人家的地基上建房 , 可能这个根基不是很稳 。
第二个的话 , 我觉得还存在一个这个平台自己来做一件事情的这种可能性 。 因为像 OpenAI 现在他们自己这个 OpenAI、OpenAI series, 对吧 ?
已经 cover 这个 B2B 整个流程了 , 包括就是销售啊 , 然后转化呀 , 这个客服呀 , 这个平台上的一些 ,他们又有这个完整的这个数据和用户的这个对话历史 。
那么一些平台上面比较大的机会 ,也有可能存在 OpenAI 自己内建或者吃掉内层的可能性 。
你说到这个 , 就是我上次和 Bill Drew,Poke AI 的创始人, 然后他在讲 Google 的时候 ,他讲了一个跟你刚才说的类似的想法 。
就因为 Google 也是做开发者做的比较多嘛 ,他就说可能存在一种对开发者的危险 , 就是 Google 他看着觉得哪个应用不错 ,他可能会自己做 。
但我感觉大家对 Google 就没那么担心 。 感觉 Google 就是自己做产品 , 可能速度呀 , 或者说各方面可能追不上 startup,但是可能 OpenAI 的速度可能还是可能会感觉会更快一些 。
但其实这个反过来对 OpenAI 想做平台也是一个不利的因素 , 就大家更忌惮他 。
这要看他后面怎么去抉择了 。 对 ,是把自己的定位放在哪里 。 我想现在所有这些 agent kit 呀 , 都你都只能使用这个 OpenAI 的模型 。
那么如果 OpenAI 真正是说把 App SDK 或者说 Apps in ChatGPT 作为他未来的这个主要平台 , 作为他的商业模式的话 , 那我想可能很多这种 agent building 过程中使用什么样的工具 , 使用什么样的模型 , 可能应该把他就是放开 , 然后呢把自己更多的定位在一个平台的这个角色上面 。
但目前的话就是可能还是在这个实验的这个过程中 。
他这一次就哪一部分是可以用第三方的模型 , 哪一部分是一定要用他自己的 ?
应该是就是 eval 的时候是可以用第三方模型的 ,但其他时候比如说 agent builder 里面应该是都只能用 OpenAI 的模型目前 。
就是他优化评估的那个环节 ,他可以引入第三方的模型 。
对 , 可能是让你比一比就是 OpenAI 的模型比其他的模型可能更好 。
那你觉得就这种平台的机会 , 可能会最后会有几家有可能能做成 , 可能最后这个市场如果比较稳定之后, 大概能容纳多少这种平台 ?
我觉得就看有几个大的这个流量入口了 。 目前来看的话 , 确实也就是可能最大的就是 Gemini 和 ChatGPT。
那在这两个之间的话 , 现在他们是一个什么样的态势啊 ? 就比如说谁会在开发者这块会强一点 ?
前些天 Gemini 就是已经是如果他们是全平台都计算在内的话 ,他们的用户量好像已经超过 ChatGPT 了 。 但是他们这个基数中可能也算了 , 比如说 Gmail 里面你打开了 Gemini 写邮件 , 这可能也算是他们的用户 。
所以就是 Gemini 的这个追赶的势头还是比较猛的 。 然后在开发者上面 , 我觉得两边前进的速度都很快 。
像这个 Gemini 的 AI studio 各种功能越来越完善 , 然后当然这次 DevDay,OpenAI 这边也发布了很多面向 agent 的这个开发者的功能 。
Anthropic 就是他之前因为 MCP 这个生态 , 可能现在是工具调用里比较主流的嘛 。 那他在这个形式里面处于什么位置了 ?
Anthropic 我觉得比较有意思 , 一个是他可能现在 cloud 并不是像 Gemini 和 ChatGPT 那样比较大的这个流量入口 。 第二个的话 , 我觉得就是 MCP 他这个标准还是一个开放的标准嘛 , 就大家都可以用 , 所有人都可以从中受益 。
所以我觉得其实 MCP 并没有说给 Anthropic 他有一个很强的 competitive advantage。
OK, 那今天非常感谢就是 Henry 的分享 , 就是关于 OpenAI 的这个 DevDay 开发者日, 我们做了一个补充 。 接下来是 9 月下旬 , 我与 Henry 和 Naomi 一起讨论他们观察到的 agent 工具链的一些趋势 。
Agent 工具链25:51
我们也分享了他们自己投资的一些公司在美国的创业实践 。 这一部分中我们提及了一些创业公司 , 如 Composio、LiveKit、Braintrust 等等 , 也提到了美国 to B 领域的一些上市公司 , 如 Okta、DataDog。
这些公司的简单介绍可以看 show notes 的附录部分 。 这一次也是第一次邀请 AGI house 的两位来分享 。 我觉得以后我们也还有机会可以定期的来聊一聊在硅谷在美国 AI 最核心的区域在发生一些什么样的新的变化 。
那 Henry 刚才也是有聊到 , 就是你现在最关注的其实是这个智能体应用爆发之后带来的工具链的一些机会 。
那我们今天的主题也是来聊一聊这个智能体的工具链 , 或者可以叫 agentic tooling。 我觉得你可以先讲讲就是这个 agentic tooling 是什么 , 比如说大家哪些比较熟悉的公司产品或者服务 , 它是属于这个 agent 工具链或者说工具箱的 。
简单说 , 我觉得 agentic tooling 其实就是构建虚拟数字人需要用到的工具和身体部件 。 就因为现在的大模型公司其实都建制了 AGI, 对吧 ?
那到底什么是 AGI 呢 ? 我觉得其实一种定义就是一个虚拟数字人。 因为过去的话 , 计算机其实是工具 ,但是是人来去适应这些机器 。
我们得去学 , 比如说如何打字 , 如何用鼠标 。 但现在其实发生了一些变化 , 随着这个 AI 的发展呢 , 计算机会越来越像人。
就变成反过来 , 计算机来适应我们 , 人机交互会逐渐变成人人交互 。 我们会用就是最自然的这种对话的方式和计算机沟通 。
但是如果要想实现这一点呢 , 只有大模型这个聪明的大脑是不够的 。 它必须要有能听 、 能说 、 能行动的身体 。
我觉得这个就是 agentic tooling 其实要解决的问题 。 就具体来说的话 , 这个数字人的身体呢 , 可能对应着大家一些比较熟悉的公司和技术 。
比如说骨架 ,其实就是 agent 的框架 。 这块最有名的公司的话就是 LangChain, 它其实起到一个负责协调 , 还有调度各种 agent 能力的一个作用 。
然后 agent 的左右手 , 我觉得左手可能是比如说 MCP 使用这些工具 , 然后右手的话可能是 browser use, 就是像人一样去使用浏览器获取信息 , 然后交互操作 。
像眼 、 耳 、 口这些器官呢 ,其实就是 agent 的这个感知和交流的这个部件 。 比如说公司像 ElevenLabs,他们提供高质量的这个语音合成 , 相当于是数字人的嘴巴 。
然后像 LiveKit 这样做实时的音频视频交互的基础设施呢 ,是让 agent 有这个眼睛和耳朵 , 然后能够看和能够听 , 然后实现这种实时的这种交互 。
除了组成身体的部位以外, 就是还有一块是单独出来的 , 相当于是 agent 的这个教练 。 就是这个数字人他如何表现 ,其实是表现的好不好 , 需要持续的这个评估和优化 。
像这一方面就有像 Braintrust、Galileo 这样的公司 , 专门去做这个 agent 的这个评估 , 然后监督他的这个表现 , 保证他的可靠性 。
那最近有什么就是跟这个 agentic tooling 相关的一些事件 , 能反映就是这个事的一些新的变化吗 ? 因为我知道确实有一些投融资的事件 , 包括收购啊 , 包括大公司可能有些业务的动作 。
对 , 确实最近关于 agent tooling 还是挺多事情发生的吧 。 我觉得可能有三个我个人觉得比较标志性的事件 , 然后也是在比较最近三个月发生的 。
就第一个刚才就是 Henry 提到的 ElevenLabs, 就是这个做 AI 语音合成非常火的这家公司 。 然后他们有一个员工的 secondary sale, 那 1 亿美元左右 , 然后大概是估值在 66 亿美元 。
然后这其实距离他们 sailor 的融资时候 , 就是才几个月时间嘛 , 就是已经翻了一倍 。 所以说我觉得就是像这种作为就是智能体的这种嘴巴的这种底层的声音设施 , 然后其实可以看到它不仅是 adoption, 就是它的增长非常快 ,而且它的商业化也是在有一个非常明显的加速 。
然后像比如说像 LangChain, 刚刚就是 Henry 也提到 , 就很多做 AI 应用的同学应该也用过他们的就是框架 。
然后他们也刚刚 closing, 就正在 closing out 一个融资 1 亿美元的这个新融新的融资嘛 , 然后被 IVP 在领头 , 然后差不多估值也是在 11 亿左右 。
然后像这种代理框架呀 、 工具链呀这一层的开发者技术设施 , 我觉得是持续在被一些基金在 double down,在被资本持续加注的 。
然后最近 recently 我觉得可能还有一个大家也就比较很多人在讨论的 , 就是 OpenAI 它全股收购了这个 11 亿美元 , 全国收购了 Stasic。
那 Stasic 它是做什么的呢 ? 它其实它做包括像 A/B testing, 就是功能会不会发布啊 , 然后一些数据指标的闭环呀 。其实说白了就是说去评测这个模型 , 就逐步去放量 , 然后去看它的效果 。
所以其实相当于 OpenAI 是就直接把这类能力从一个外挂的工具直接变成了一个他们自己内置的组件 。 那如果我们把就是这三个事件放在一块看 ,其实就可以看到一个相对比较就是清晰的节奏 , 比如说就是在运行时的大规模落地的这种 agent, 然后包括工具链的一些核心的组件被资本持续加注 ,而且也有一些巨头的这种战略布局嘛 。
所以其实现在 agent tooling 它已经不能说算是一个非常就是早期的概念了 。
刚才如果提到了 Stasic 这个点的话 , 比较有意思的就是说我们看到很多之前做 A/B test 的人, 现在都来立的 eval 这件事情 。
对 , 那我们可以回到就是这个东西 ,agent 的工具链 ,agentic tooling 它发展的一个开端 , 就是它是怎么慢慢形成的 。 因为就是从 ChatGPT 开始火之后 ,其实陆陆续续的就围绕就是大模型 , 就刚才 Henry 说的 , 就可能除了大脑之外, 给它提供的一些别的辅助的东西 ,有好多好多概念出现 , 对吧 ?
六次进化31:25
包括最开始的这个 prompt engineering, 然后后面大家又讲这个上下文工程等等等等。 就可以讲讲这个脉络大概是怎么发生的 。
我觉得 agentic tooling 的发展其实是非常的围绕着大模型能力的跃迁而发展的 。 就像回到我们之前刚才用的那个比喻吧 , 就是 AGI 的话 , 我觉得它是一个虚拟的数字人。
那么过去这两三年呢 ,其实我们都在看着这个数字人的大脑在进行一次又一次的升级 。 而每次大脑升级 ,其实会暴露出他身体的残缺 , 从而催生出就是一波波的这个新的工具生态 , 来为他补全这个身体的部件 。
就这个过程大概有六次主要的升级 。 第一次的话呢 , 我觉得就是 ChatGPT 和 GPT-3.5 的发布 , 时间点上就是 2022 年的这个年底 。
那个时候其实是就是全世界意义上第一次真正认识到就这个 LLM 的这个强大 , 然后大家都想用它来去构建这个应用 。
但其实很快就会发现 , 你光有会聊天的脑子还不够 , 你还需要连接比如说外部数据 , 你需要去做上下文的管理 , 然后你需要去把多次这个 LLM 调用组合起来处理更复杂的问题 。
所以这个时候就是 LangChain 这样的框架就出现了 , 它提供的就是脚手架 , 帮助开发者能够更快更容易的去构建这个大模型的这个应用 。
那个时候我们还不管它叫 agent 呢 , 那个时候还是就是大模型应用 , 那后面就很快就变成 agent 了 。
然后第二次我觉得重要的升级的话是 function calling, 这个时间点大概是 2023 年可能 6 月份 ,也可以叫做就是工具使用 。
然后这个时候是 OpenAI 当时的 API 首次官方支持了 function calling,也就这个时候 LLM 终于可以是根据上下文的需要去调用外部工具了 。
然后这个时候点开始后面 , 会有越来越多的人去专门为 LLM 写工具 。其实在很长一段时间 , 我觉得写一个 agent 百分之可能夸张一点的话 , 八九十的时间你是去写一个好的工具 。
然后另外一个重要的时间点呢 ,是 2024 年的 11 月份 , 这个时候是 Anthropic 发布了这个 MCP 的这个协议 , 使得就是工具更容易的在不同的模型之间去复用 。
然后大部分之前的那些工具提供商呢 ,也都顺势转型成了 MCP server 的提供商 。 对 , 第三次升级我觉得是在语音的方面 。
对 , 然后这个关键节点是 2024 年 5 月份 , 就是 GPT-4o 的这个 advanced voice mode 的推出 , 让大家看到了就是这种非常高质量像人的语音交互的这个雏形 。
然后也带起了对这种实时的语音传输技术的需求 。 LiveKit 当时就是因为它是 GPT-4o 背后使用的这个基础设施 , 所以它有一大波这个爆发性的这个增长 。
第四次升级呢 , 我觉得就是 coding 了 。其实就是 3.5 和 GPT-4 已经让开发者很兴奋了 ,但我觉得这个历史性的节点的话 , 可能是 2024 年 Claude Sonnet 3.5 的发布 , 让这个 AI 编程彻底起飞 。
我觉得 Cursor 的成功应该和 Claude Sonnet 3.5 以及后面整个 Claude family 系列的更新是分不开的 。 因为这个 AI 写代码的能力大幅增强了 , 能够通过写代码去完成像是数据分析这样的任务 , 所以其实产生了对这种安全执行代码的沙盒环境的需求 。
像这个领域的代表公司呢 , 比如说像 B2B 啊 、Daytona。 第五次升级呢 , 就是推理能力的突破 。 像这个代表性的话 , 大家都很熟 , 就是 2024 年 9 月份 OpenAI 发布这个 O1 Preview。
像 reasoning 能力的提升呢 , 使得 agent 终于可以自己做更多的规划了 ,而不是说像之前那样开发者写死第一步做什么 , 第二步做什么 。
它现在会就是根据这个大家给的这个任务 , 自己去规划第一步做什么 , 第二步做什么 , 中间应该使用什么样的工具 。
那么这个转变呢 , 催生出了两类工具吧 。 第一类是这个 reasoning 是能力是怎么来的呢 ? 是大家这个做在模型的基础上做 reinforcement learning, 强化学习做出来的 。
所以大家看到了强化学习的这个好处 , 对吧 ? 所以现在有像 OpenAI 啊 、Fireworks 呀 , 就提供了这种用强化学习来微调模型的这种工具 , 然后大家都会去用 ,因为想让自己的这个 agent 和模型更强大 。
第二类的话就是因为现在 agent 自己会去做更复杂的这个更复杂更长的这种任务 , 所以就更加需要的有更好的评估的工具 , 来针对这种越来越复杂的任务做更好的监督 。
所以像 Braintrust 啊 、Galileo 这样的 eval 的或者做评估的公司 , 就变得更重要了 。 我觉得最后一次升级呢 ,是计算机使用和 browser use 能力的出现 。
就这个关键节点是 2024 年 10 月份 , 就 Anthropic 率先发布了 computer use 的模型 , 后面的话 OpenAI 也发布了它的 operator。 这些模型呢 , 让 agent 真正具备了就是使用浏览器完成任务的能力 , 然后也催生出了整个就是使用浏览器的这个生态系统 。
有包括就是想提供这个云端浏览器基础设施的像 BrowserBase 呀 、Anchor Browser 这样的公司 ,也有就是更上层直接给开发者提供这个 API, 自然语言的 API, 比如说帮我订个外卖 , 像这样的公司 。
我就有几个补充想问的 。 就刚才你提到这个 to use 的这个脉络 ,其实 23 年 6 月最开始是 OpenAI 的 function calling,是它最开始提出来的 。
那现在我们看到其实 Anthropic 做的这个 MCP 的协议 , 它是更晚出现 ,但它发展的更主流 。 为什么 OpenAI 它更早做这件事情 , 它想到了这个事情 ,但是它没有 Anthropic 做得好 ?
我觉得 Anthropic 的 Claude Code 它有的时候可能在 benchmark 上不是最领先的 , 或者说在 LLM arena 上面不是最领先的 ,但是开发者都很喜欢使用 Anthropic 的模型来编程 。
我觉得这和 Anthropic 的能力 , 就是 to use 的能力很强是分不开的 。 他们其实花了很多时间去提升 to use, 让这个 agentic 的这个能力更强 。
我觉得他们在自己弄明白怎么让 to use 这个能力变得更强的过程中 ,其实进行了很多这方面的思考 。 然后 MCP 其实我认为是他们给社区或者说整个这个 AI ecosystem 的一份礼物和慈善 。
对 。
所以就有可能是 OpenAI 虽然想到了这个 ,但是它没有那个 Anthropic 在这个上面花的精力多 。
我觉得可以这么说 。
对 , 然后你刚才说的这个六次 , 我可以再就帮听友总结一下 。 最开始是 22 年 12 月 ChatGPT 还有 GPT-3.5, 然后下一个节点是就跟这个工具使用相关的 ,是 23 年 6 月最开始的有 function calling, 然后是到了 24 年 11 月的时候 , 这个 MCP 的协议是这条工具使用脉络上的一些发展 。
然后第三个点就是语音 , 这个是在 24 年 5 月就是 GPT-4o 之后的一个变化 。 第四个是 coding, 一个标志性的时间是 24 年 6 月 Solid 3.5 发布 。
然后第五个讲到的是推理 , 这个标志的模型上的节点是 24 年 9 月 , 就是 OpenAI 发布 O 系列推理能力的一个大幅提升 。
然后第六个节点是你刚刚讲到的 computer use 还有 browser use, 这个是在 24 年的 10 月 。 就我觉得看这些时间点也挺有意思的 ,因为最开始 22 年的 12 月到 23 年 6 月 , 就这个会比较稀疏嘛 。
然后后面的那些事其实都是在 24 年就是交错发生的 , 就你感觉这个事越来越快了 。
对 , 这个非常这个 exciting time。
你觉得接下来它可能会怎么发展 ?
现在这个时候预测未来会非常非常的难 ,因为很难有人就是说接下来能够知道三个月六个月发生什么 。
但我觉得相对确定性比较高的部分是 agentic 的能力一定是所有大模型厂商在加强下注的 。 这个主要就是分成两部分 , 一部分就是推理能力 , 另外一部分就是使用工具的能力 。
另外我觉得语音这块也是所有大模型厂商现在在继续就是加注的地方 。 然后再有的话就是所有的这个模态融合在一起 , 像我们最近看到就是 image model 和这个 LLM 结合在一起 ,有像这种 Nano Banana 这样的很好的 image 编辑的模型 。
就我觉得接下来我们可以通过一些具体的公司 , 包括就是比较大的这种核心的 AI 公司 ,他们在做什么 。 也包括就是其实这个领域就工具链本身出现了很多第三方的单独的创业公司 ,他们在做什么 。
我觉得这样可能给大家会有一个更直观的感受 。 那如果从现在这个时间点看的话 , 就是你自己会比较关注的重点的工具链的方向有哪些啊 ?
包括这个里面可能有哪些公司 , 可以讲一讲 。
工具调用40:25
我觉得可能对应刚才我们说的模型能力可能增强的这几个方向 , 可能会关注就是首先如果要是 agentic 能力增强了 , 对吧 ?
那我觉得就是相应的它要使用的工具应该质量也会要更加的提高 ,并且能够支持更细和更复杂的操作 。
因为现在我们看到的话 ,MCP server 它更多的还是很多是 read only。 就 MCP server 现在比如说大家会用 Reddit 啊 、Twitter 啊 ,他们这些 MCP server 去做一些像 deep research 这样的 use case。
但比如说真正去做一些写操作的 MCP server, 它的使用频率是比较低的 。 但如果说模型的 reasoning 和 to use 能力越强的话 , 会避免就这种小孩挥大刀的情况 。
就它可以 actually 去做一些风险的一些带写操作的事情 。 所以我觉得就是 MCP server 这块是我会比较关注的一个领域 。
这块的公司的话 , 我觉得有一家非常有意思的公司就是 Composio。
对 ,Composio 是我们最近投了一家公司 , 然后它其实就是一个 MCP 的一个 , 可以说是一个集成商 ,也是一个 marketplace 的感觉 。其实一个 underlying 的一个趋势是我们可以看到就是我们正在从一个工具调用的时代吧 , 到一个就是任务完成 , 就 task completion 的时代 。
像 Composio 它就是提供一个高质量的这个 MCP server, 然后它其实不仅仅就是可以去调用工具 , 更多的是去保证这个他们可以更可靠的去执行这个任务 。
就相当于给这个 agent 去提供了一套比较完整的这种操作系统 。 可能要解释一下就是这个 MCP server 或者说 MCP 集成商 , 它大概是做什么的 ?
MCP 集成商就感觉就像一个 API 接口一样 , 就有点像一个 marketplace 去选择上面有哪些工具 , 你需要去连接 。
就 Composio 呢 , 它的产品上呢又分为两个部分 。 一个部分呢是平台 , 就是说开发者通过编程的方式去使用这些 MCP server 在他们的 agent 里面 。
然后还有一个偏 prosumer 的一个产品 , 叫做 Rube。 这个 Rube 呢最近它的这个用户增长非常的好 ,因为它解决了一个问题 , 就是比如说你在 Cursor 里面使用 MCP server 的话 , 你能用的 MCP server 是有数量限制的 。
这个也是因为上下文的限制 。 对 , 大概你可能只能一次点亮三个 MCP server,但你如果要是用很多 MCP server 同时使用 , 你是用不了的 。
所以他们有一个就是有点像那个魔戒那个概念 , 叫 one ring to rule them all, 它是 one MCP server to rule them all。 就它提供了一个 meta MCP server, 然后可以帮助你根据你的任务去选择使用正确的 MCP server。
所以现在大家都在这个 Cursor 里面去用 Rube 来接就是那几百个 MCP server。
所以一个 MCP server 这是个比较小白的问题啊 。 就是一个 MCP server 它是对应一个工具 , 还是它是可能对应好几个工具的 ?
一个 MCP server 下面可能会暴露多个工具 。
有几百个就相当于那个几百个还要再乘以一个数字 , 对吧 ? 就是它上面实际上能调的总工具数 。
对对对 , 这是为什么就是 Cursor 现在应该是具体的数字可能需要确认一下 。 但是我记得好像只允许你同时打开三个 MCP server,因为你每个 server 下面有可能有暴露多个工具 , 然后你每个工具有好多参数 , 所以它们还是很吃 token 的 。
现在一个 MCP server 里面能有多少工具 , 这个事它会受一些什么技术上的限制吗 ? 它会有瓶颈吗 ?
MCP server 你设计作为设计者下面有多少个工具 ,其实完全就是看你 。 比如说你做一个 Gmail 的 MCP server, 对吧 ? 那和 Gmail 这个产品的复杂度是相关的 。
如果你想暴露 Gmail 的所有的功能的话 , 那想必你可能需要的 MCP 的这个工具 , 这下面的 tool 可能也比较多 ,因为这个产品可能比较复杂 。
所以是看你的意图是什么 。 但如果你设计得太复杂 , 可能它执行的成功率上是会有一些影响的是吗 ?
对对对 , 这个是有 trade off 的 。 比如说你有两个非常接近的工具 , 那模型就可能会感觉很疑惑 , 应该到底调用哪个 , 对吧 ?
它们区别是啥 。
那 Naomi 你可以继续讲一讲 。 那比如说你们最开始是怎么看到这个项目的 ? 它成立多久了 ? 然后就为什么你们当时觉得这个方向还挺有机会的 ?
以及我自己可能会有一个很自然的疑问 ,Anthropic 它为啥不自己干这个事 ? 对吧 ? 就好像比如说一个非常简单的联想 ,但可能这个类比不恰当 , 就苹果的这个 App Store 它就是自己干的 。
当时这个因为我们在 Agent House 会 run 很多大型的 hackathon 嘛 , 然后其实我们有时候很多是 AI agent build day, 所以其实做 AI agent 的话 ,其实你需要调用不同的工具 。
然后当时就在想说 , 如果是要做一个比如集合的 agent, 它同时调用或者是去 complete 它 task 的时候 ,其实需要一个同时去使用不同的 MCP server。
然后当时我们就从这个 community 里面收集到的反馈 , 就是一手的信息 , 就是说 Composio 是一个比较 reliable 的这样的一个平台 。
我觉得 Composio 最有意思的是 , 它一开始是做 agent 的公司 , 然后它后来变成了 agentic tooling 的公司 。 但它之所以它是 agentic tooling 公司 , 我们觉得最有意思的是因为它 agent 的 build 得好 。
它既然 agent 的 build 得好 , 它为啥不把 agent 的继续做好了 ?
它现在就在接着做 agent 的 。 但它后面它之所以它有这么多 high quality 的 agentic tooling, 就是 MCP server,是因为它整个写 server 的过程是 agent 自动在写 , 自动写 , 自动改进 。
所以它的 agent 是一个写 MCP 的 server 的 agent。
对 。
对 , 就是我们是比较后来他们转型之后然后见到他们的 。 他们一开始就是一个在印度 , 然后他也不是做这个 MCP 的 server 提供商 。
他其实是在 2023 年的 7 月份时候成立 。 当时他们其实是想做一个就是集成的这样的一个 Devon, 然后就是用 AI 自动生成就是第三方 API 的这种集成代码 。
但当时那个大模型能力还不够嘛 , 所以就是其实生成代码的准确率它达不到要求 。 然后慢慢他们在就是迭代的过程中发现了一个就是更底层的问题 , 就其实 agent 不是不会写代码 ,而是就不会特别稳定的调用和使用这个工具 。
所以他们当时就是做了一个决定去 pivot, 就是不是在做这个集成自动化 ,而是去构建一个 AI agent 的一个技能层 , 就是把这些通用工具就是封装成一个 LLM 能够直接调用的这样的一个技能 。
所以其实这个 pivot 时间点其实发生在就是 MCP 协议 ,Anthropic MCP 协议的之前 。 所以它其实很早的时候其实就摸到了就这个 AI agent 就是工具化的一个痛点 。
然后而且他们其实是个非常 scrappy 的团队嘛 , 就当时其实还在印度 ,也没有什么资源嘛 ,也没有什么声量 。
创始人就是疯狂在推特上发视频呀 , 然后包括去演示这个 Composio 怎么去调用工具 , 然后处理错误 。
这些视频就是在这个 AI 的就是开发者的社区就传开了 。 而他们整个团队就是泡在各个社交媒体里 , 就比如说什么 Reddit 呀 、Discord, 然后去看收集用户的反馈 , 就帮他们去亲手去调试他们的一些集成的需求 。
所以就是一个很小的这样的一个印度的团队 , 拿到了这个美国 LightSpeed 的就是领头的 Series A 的这样融资 , 攒下了一批包括很多 YC 的团队呀 , 就是 ClickUp 呀 、Glean 这样比较知名的用户 。
然后当时我们也是就是办了很多场就是这种 hackathon, 然后当时也是听到很多的这个 developer 去反馈这个名字 , 见到了这些就是这些 founder, 然后去慢慢去 build up 我们的 conviction。
你以为投他们的时候 ,他们公司有多少人啊 ?
他们其实现在团队也不大吧 , 好像现在是 30 个人。
那还挺精简的 。 那他们这些人现在因为他们之前在印度嘛 ,他们是人在印度的时候就已经获得了美国这个机构的就刚刚说的 A 轮的领投 , 对吧 ?
他们现在是团队也来到了美国 ?
嗯 ,他们整个团队都搬过来了 。他们整体的这个团队我还没有见过一个非印度人哎 。 Henry, 你有见过他们团队非印度人吗 ?
好像全部都是印度人。
我好像没见过他们不是印度人的同事 。
他们没有说啊 , 我们要来美国 , 我们就要 hire 美国人这样子的概念 。他们就觉得啊 , 我们就想要 work with 最 scrappy 的 people。
那比如他们觉得他们当下的印度团队最 hungry, 然后他们就把那些印度的人才来到硅谷再创业 。
就他们现在在硅谷的什么地方啊 ?
他们是在旧金山 ,他们 office 在旧金山市里 。 对 ,他们搬过来主要是因为想要跟更加 close 的去跟这些 AI agent 的团队去进行交流嘛 ,因为这是他们的客户 。
然后也非常深入的去做 bottom up adoption, 就是所以我们也在 Agent House 有很多次 hackathon 的合作 , 然后才慢慢建立了信任 。
你们现在就 Agent House 也是 based 在旧金山的是吗 ?
我们是在半岛 , 就是说在硅谷和旧金山市中心的中间位置 。
对 , 我感觉好像现在旧金山挺活跃的 。 因为之前其实很多公司还是在硅谷表动嘛 , 硅谷和旧金山还是有一点距离 。
那现在有很多这种一切孵化器啊 , 包括这种社区活动 , 包括一些公司的办公室 ,其实很多就是在旧金山市区的 。
嗯 ,Anthropic OpenAI 的办公室都是在旧金山 。 Definitely SF is coming back。 而且它的 rent 好像涨了 20%,20% 到 30% 今年 。
那还有刚才我说的那个问题 , 就是 Anthropic 为啥不自己做这个事儿啊 ?
就是我们不觉得 Anthropic 它自己会做一个完整的 Composio。 我觉得可能主要的一个原因在于它做这个事情并不会加强它自己核心的一个竞争力 。
因为 Anthropic 它是一个大模型公司嘛 , 然后它的主要的护城河还是在它的模型的 advancement 和它的比如说 safety, 那它不太会去想要把它的人力投入到这个第三方 API 的这个维护啊 , 非常分散它的资源 。
我觉得而且它其实作为一个就是底层平台嘛 , 它是希望相对中立的 。
然后就是你们觉得整体上 MCP 这个生态会怎么发展啊 ? 因为就是刚才我们也聊到嘛 ,其实那六波里面就是就对人来说 , 就广义上来说使用工具 ,其实 browser use, 包括现在大家也做到手机上 phone use,也是一种方法 。
那前段时间其实我们有和这个智谱 , 就中国的一家大模型公司 ,他们有做了一个在手机上可以去运行的 agent, 就帮你在手机上比如说点一些外卖或者买些东西什么的 。
当然这个现在成功率可能没有那么高 ,但他的那个思路就是他们认为其实在手机上你的 GUI 就图形界面 phone use 是要长期存在的 。
有一个原因就是有一些工具它其实不想被你调用 , 就甚至可能在网页端也会有一些工具它不想被你调用 , 对吧 ?
它不想就是被人家在上面盖了一层 。 所以长期来说 , 比如说这个 MCP 它最后能渗透到多少工具了 ?
它真的能让这个 agent 作为一个虚拟的数字人在虚拟世界畅通无阻吗 ?
我觉得第一个角度是现在 browser use、computer use 或者 phone use 它的这个可靠性的问题 。 像现在的最 popular 的 benchmark, 像台式就是 desktop 的话是 OSworld, 然后如果要是 browser 的话现在是 WebArena。
然后我们能看到现在最好的模型在这些 benchmark 上面大概就是 60%、70%。 那你想象一下, 如果像一些很关键的工作流 , 对吧 ?
比如说这个在美国 healthcare 这个场景 , 我要给一个病人就是做 onboarding, 那你说我只有 70% 的成功概率 , 你这个事情就是可行吗 ?
我觉得是完全不可行的 。 所以我觉得就是说在短期如果 browser use 这个准确率上不去的话 , 我觉得像一些关键的工作流它必须得依赖于成功率更高的这个 tool use。
但是我觉得 browser use 的话 , 它肯定是有它的这个价值的 ,因为肯定会有很多的这个服务和网站是不能被 MCP cover 的 。
像之前我听说过的一个 browser use 的 use case, 就是大家去喜欢去日本旅游的人可能知道日本有很多 boutique 的酒店 , 预订网站是都没有接入那些 OTA 的 。
所以就有专门的人去用 browser use 的方法去把他的这个哪些日子有空房 , 用所有试所有的这个组合把这个数据拉下来 , 然后把它给这种搜索引擎 , 然后搜索引擎的话就可以就是能搜到这些日本的这些精品酒店 。
所以像这些长尾的 use case, 我觉得可能 browser use 应该还是更好的选择 。
那一些特别大的这种超级应用了 , 比如说在移动生态里面 ,其实 app 之间是相对要封闭一点的 。 你觉得长期来说这些他们也会愿意融入 MCP 的生态吗 ?
我觉得有一个有意思的观点就是 ChatGPT 的最终目标是 WeChatGPT, 就是它在 build 一个 super app。 就因为大家想一想就是因为 AI 越来越像数字人,AGI 是数字人, 那我们出门办各种事情的话 , 交个费啊啥你都是和人沟通嘛 。
这其实本质上就是现在其实 WeChat 大家对吧 , 微信大家里面已经可以干这种各种各样的事情了 。 所以我觉得就是 OpenAI 的这个 ChatGPT 的产品的最终形态可能就是 WeChatGPT。
然后所有提供那些服务的人他们被迫需要就是提供一个给 LLM 交互的接口 , 才能接入到这个生态里面 。
所以这个不是一个你愿不愿意的问题是吗 ? 就是你觉得这是个趋势 。
对 , 我觉得这是难以抗衡的大潮流 。
那刚才我们讲的就是是这个工具使用 , 还有就是 browser use、phone use 这些图形界面的交互的 agent tooling 的能力 。 你可以再讲讲就其他还有哪些你比较关注的方向 ?
语音53:10
其实在最开始梳理这个脉络的时候你提到了好几个方向 , 还包括有记忆啊 、 评估呀 。
我们还比较看好的方向就是语音 , 几个数据吧 。 一个是就是目前全世界每天有 one trillion 的风口 ,one trillion 应该是 100 亿的级别 。
然后这其中有很大一部分是那种就商业的电话 , 像那些东西很多都可以 , 比如说客服呀之类的 , 都可以被这个 AI 打电话来取代 。
所以我们觉得就是说语音这块的话 , 像 B2B 这样的机会是很多的 。 然后第二个的话就是像 personal assistant 或者这种情感陪伴类的 ,也是一个增长比较快的一个领域 。
所以我觉得语音主要分为这两个部分都增长潜力都很大 。 我们比较关注的一家公司呢 , 之前可能也提到了叫 Livekit, 可能这家公司在国内可能用的还不是特别多 ,但它的增长速度也是非常快 。
像现在的话 , 它一天会 power 20 million, 就是 2000 万的风口 。在一年前这个数字是 100 万 ,也就是说它这一年里面成长了 20 day。
可以讲一下 Livekit 它主要是提供什么能力吗 ? 就是它提供语音上的一个什么能力 , 或者说它的业务 , 它的产品服务是一个什么形态 ?
Livekit 是从疫情时间开始做的 。 它当时其实可能最开始和 AI 是关系不大的 。 它是做的这个语音和视频的实时传输 , 用 WebRTC。
当时疫情期间呢 ,是就是大家这个都有这个 remote 工作的需求 , 对吧 ? 但是它的第一次就是 AI 方向的爆发 , 就是我们刚才梳理脉络的时候提到的 GPT-4o, 当时用它去做了后面语音传输的这一层 。
然后后面的话呢 ,他们就开始从底层往上去加强他们的这个产品的丰富度 。 所以现在的话 ,其实已经可以很方便的用它的这个 SDK 去创建一个语音的 agent。
那么他们会帮你做好像这个 turn detection 啊 , 这些 orchestration 的工作 。
所以它的里面其实是可以调不同的语音模型是吗 ? 就它不是 ElevenLabs 那种 , 它自己做一个语音模型然后生成 , 它不是这种业务 。
对 , 像语音公司这块的话应该可以分为两个大类 。 一个的话就是模型厂商 , 像 ElevenLabs 它其实可能一开始是模型厂商 , 现在可能做的更广了 ,因为公司变大了 。
像 OpenAI 的话它也是就是偏模型厂商 。 然后像 Livekit 它其实更偏的是就是基础设施 。
你刚刚说的 Livekit 最开始那个业务听着有点像声网的业务 。
对 ,是有很大的相似性的 。 除了像这个 OpenAI 的这个 advanced voice mode 是后面是 Livekit 以外, 国外可能最火的这种偏情感陪伴的像 Character.AI, 它背后还有就是 Elon Musk 的 Grok, 背后语音其实也都是 powered by Livekit。
但我觉得这个故事非常有意思 , 这也是当时为什么我们决定投资它 ,是因为它讲就是它 power 25% 91% 的 traffic, 然后大概每周能抢救一条人命回来 。
它为什么就打 911 会需要 Livekit 呢 ? 是因为你打过去了以后, 然后它会发一条短信到你手机上, 然后你点开以后就可以实时的你用你的手机 stream 你当时看到的情况和你的声音 。
所以像那个 911 的那边的那个就是它的那个工作人员就能看到你现场的情况是什么样的 。 有的时候你需要心肺复苏 , 它还能给你搞一个心肺复苏的教练过来 , 当场教你 , 看着现场的情况当场教你怎么去做心肺复苏 。
所以你说的这个就是抢救一条人命 , 指的是一些这种特别紧急的情况下, 它是远程给你有些指导这种 。
对 。
那你刚才提到就比如说 Grok 这些 , 它的 powered by 这个 Livekit 的意思就是它的基础设施的部分 , 语音的基础设施部分是这个 Livekit 提供的 。
然后模型是 Grok 自己的语音模型的意思 。
对 , 接下来马上会宣布的一个合作就是 Salesforce, 美国最大的这个 CRM 公司 , 它的这个 Agentforce 的客服马上就是这个 agent voice agent 会是在 Livekit 这个 agent 平台上面的 。
那这个平台上现在用的最多的模型还是 ElevenLabs 是吗 ?
这个上面有好几家模型 , 像 OpenAI 的模型啊 ,ElevenLabs 的模型啊 , 还有 Cartesian 的模型 ,也是之前 Naomi 提到我们的投资的一家公司 , 都会在用 。
模型这块可以稍微讲一下,Livekit 平台上面大概有两个范式 。 一种呢是 Cascade voice agent,也就是说这个 voice agent 它是拆成几个环节的 。
首先先是做 STT, 就是 speech to text, 先把语音转成文本 , 然后文本去过大模型 , 然后输出再过文本转语音 。
这是一种方式 , 你可以 build 这样的 agent 跑在 Livekit 的平台上面 。 第二种方式的话就是 speech to speech,也就是 OpenAI 他们的这个 GPT real time, 就是它是直接从语音然后返回给你语音 。
所以它两种都是支持的 。
两种都有用户来用 ,是不是因为前一种它其实比如说在有些场景它综合成本是更好的 , 反正它也够用了 。
对 ,其实这两种的话我们可以看到 , 首先大的判断是终局一定是 speech to speech。
对 ,因为大家觉得这是更新的技术 , 然后也效果更好 。
效果更好 , 对 , 它能 pick up 就比如说你的笑声啊 , 你的情绪啊 , 全部都在这个模型的 context 里面 。
但是现在还是有很多人会去使用前者 , 就是这种 cascade model 拆成三个部分 。 有几个原因 , 第一个原因是这种方式的可控性目前更好 。
比如说你要想加入一些这种 guardrails, 就是这种保护的这种机制 , 那你可以在它变成文字的那个阶段你去写一些判断 , 对吧 ?
因为它毕竟是字符串 , 你是没有办法在语音信号上面写这些判断的 。 然后其次的话呢 , 就是可能有一些场景你也不需要它那么像人。
比如说有的时候你去医院 , 你打一个电话 , 然后你需要提供一些信息 , 你知道你和 AI 在聊 ,不那么像人 ,其实有的时候反而可能更好 。
所以就是基于这些原因的话 , 就是 cascade 这个方式还是有它自己的优势的 。
然后我想补充问一下那个 voice 的一些相关的 ,其实之前我们有聊到过 , 你们有观察到美国的一些核心的 AI 的 top labs 都在加大对 voice 的这个能力的投入 。
就我理解的你说的 top labs 应该指的是 Google, 然后 OpenAI 这些 , 对吧 ?
我觉得可能有两个信号吧 。 第一个信号的话是从现在有一类公司是专门给这些 top AI labs 提供声音的语音的数据 。
这类公司就是最近成长得不错 , 融资也不错 。 有一个公司叫做 David AI, 它应该是最近几个月内融的 Series A,2500 万美元吧 。
投资这边是一个 signal, 另外一个 signal 就是 OpenAI 最近也可能是上周的事情 , 然后它发布了 GPT real time API 的正式版 。其实正式它的这个是去年 10 月份发布的 , 所以大概过了快整整一年的时间 , 然后发布了现在的这个 2.0 版本 。
然后它的主要的改进呢 , 可能分为几个方面吧 。 第一个方面的话就是更加的这个像人了 , 像它的这个说话的语音语调啊 , 然后表达的这个丰富程度啊 , 然后以及就是它能够很好的去执行开发者给的这个提示 。
比如说你要更温情 , 或者你更职业化 , 它都可以有很好的这种 instruction follow 的能力 。 这是第一 。 然后第二的话呢 , 它也可以就是更好的去理解 , 就比如说人的笑声啊 , 然后人的情绪啊 , 然后以及它在说一半的时候 , 比如说去换语言 , 它也有更好的效果 。
现在是不是像那个 Anthropic 其实是不怎么参与这方面的竞争了 , 多模态的好像做的比较少 。
对 , 我觉得这块的话可能 Anthropic 没有在牌桌上面吧 , 还是 Grok、OpenAI、Google 大玩家 。 我觉得 Anthropic 反正已经就是 all in coding 了 。
对 , 我觉得语音这块确实国内有很多开发者也用语音的模型比较多 , 像 Minimax, 像豆包的语音 , 应该是国内开发者用的比较多的 。
因为今年其实在中国的话也出现了挺多 , 就是有点类似于那种播客生成或者语音生成的这种 agent 的应用 。
包括豆包自己也做了一个 , 就你电脑豆包里面它也可以直接你给它一篇文章 , 然后它给你生成一个三五分钟的播客 。
对 , 我觉得这块咱们其实国内的模型在语音生成这块其实是处于领先地位的 。 比如说 Minimax 新发的这个语音模型 , 像在 artificial analysis 的搒单上面应该都是排名非常靠前 , 可能在 ElevenLabs 之前的 。
所以这块的话可能在海外需要再更多的宣传一下 。
那我们接下来可以讲讲就是记忆这块的一些进展 。 就是你之前也提到你觉得记忆是 agentic tooling 很重要的一个方向 , 然后这个领域可能也会有一些机会 , 或者说有些自己做 agent 或者做大模型的公司 ,他们有这方面的动作和进展 。
记忆1:01:58
我觉得我们可以从就几种记忆的类型 , 然后它们是什么 , 然后它们怎么能够帮助就是 agent 更好的完成它们的任务开始 。
常见的记忆可能可以分为下面几种 。 一种的话就是说情景记忆 , 举个例子就是说这个客服机器人, 它能记得就是上周你们俩聊过 , 然后尝试过这个解决方案 X。
那么如果它记得住这个事的话 , 作用就是它能避免比如说重复操作呀 , 然后保持你们这个对话有连续性啊 。
这个是情景记忆 。 然后第二种的话就是说流程记忆 。 那么它这个是能够记得住比如说搞定一个任务 , 它需要完成步骤 12345。
那它其实能够获得让这个 agent 获得这个新的技能 , 比如说这个做 DevOps 的 agent 记得就是说上周部署的时候在第三步失败了 。
它就能够避免比如说重复执行这个错误步骤啊 , 然后学习有效的路径是啥 。 它这个就比较适用于在自动化呀 , 或者这个企业工作流这种多步智能体来学习怎么完成一个工作 。
第三种的话就是偏这种知识性的记忆 , 它能存储一些这个事实 。 比如说有一个 agent 它需要去查用户这个购物的时候 , 它有哪些这个打折能够 apply, 对吧 ?
它就需要去这个打折这个规则库里面去查东西 。 那它去有这个规则库的话 , 它其实能够其实是它的记忆的一部分 , 对吧 ?
它能够减少它比如说有些幻觉 , 想出来一个不存在的这个打折的这个规则 。 最后一种的话就是偏这种角色记忆或者人格记忆 , 它能够记录就比如说一种人格或者说一种风格设定 。
那这种的话就对于这种情感陪伴就很重要了 。 就是你比如说你设定一个这个 AI 男朋友 ,AI 女朋友 , 对吧 ?
它有一个它不能 out of character, 它得保持它的这种交流的这个风格 ,有这种长期的这种关系的感觉 。 所以就是说像刚才这四种记忆的话就是理性选择 , 合理的应用在你的这个 agent 里面 。
你有可能你是比如说你就做 business, 你不需要这种人格记忆 。 你可能就需要比如说工作流记忆啊 , 然后这个知识记忆 。
所以记忆的话我觉得对于提升 agent 在特定的这种应用场景下的能力是起到一个很大很大的作用 。
提到这个公司的话 , 我们接触比较多的一家 , 然后也是最近成长比较快的一家 , 叫做 Letta。 然后它的这个两个创始人呢 ,也是伯克利的两个 PhD 毕业以后然后创立的 。
那么他们的现在的这个产品的话呢 , 就是专门帮助 agent 的开发者开发这种他们叫做 stateful agent, 就是有状态的智能体 。
然后他们还有一个很有意思的概念呢 , 就叫做 sleep time compute。 因为可能大家都很熟悉就是这个 test time compute, 就是说你在做推理的时候 , 你多写一些 token, 这样能够干得更好 。
他们这个不是推理的时候多出 token,而是他们说是在你的 AI 整个系统没有用户来查询你或者说和你交互的时候 , 它来花一些 token 做一些之前的这些理解 。
比如说你可能举个例子哈 , 你白天开了好多会 , 然后你晚上夜深人静的时候 ,sleep time 的时候 , 你来回忆一下, 来 process 一下你白天开的那些会 , 然后把这些东西就是变成你的这个一些学习的一些内容 , 对吧 ?
或者说一些你的这些 insights。 所以它本质上是在睡觉的时候去花 token, 然后去把一些之前的一些记忆整理成最有用的这些东西知识 , 然后存下来 。
所以我觉得这个是 Letta 比较有意思的地方 。
这个公司是怎么拼的 ?
L-E-T-T-A,Letta。
我本来以为这种东西是没有单独的公司做的 , 我以为是做 agent 的公司会自己做记忆的部分 。 这个是不是会更主流一点 ?
比如说 Miles 他可能会自己做 , 比如说 Devon 他可能会自己做这个记忆的部分 , 包括一些陪伴类的 agent。
我觉得这个是所有的时候 , 比如说早期的时候 , 我觉得大家都会有一个探索的过程 。 就是没有人知道比如说这个记忆到底怎么做比较好 , 这个时候就会八仙过海 , 各显其能 。
每个人就是会按照自己的这个场景去 build 自己的记忆的这个模块 。 但我觉得随着大家对于记忆的哪种记忆应该怎么用摸索的比较清楚以后, 我觉得可能会有一个相对标准化的产品 , 像 Letta 这样的产品出来 , 然后帮大家把这些脏活累活都干了 。
这样这个 agent 的这个开发者能够真正聚焦在就自己的 agent 它的核心竞争力上面 。
那像 Letta 这种它试图去提供一个记忆的标准化的这种技术的模块 , 它这个会涉及到数据的问题吗 ?
就是比如说 Letta 去服务一个 agent 公司吧 , 然后这个 agent 公司的用户给到这个 agent 的一些数据 。 如果 Letta 要去优化就是它的记忆表现的话 , 那这个 agent 公司应该把这个数据给 Letta 还是不给了 ?
它是需要能够读取这个对话内容的 。 因为它的这个交互方式是这样的 , 就是它会有单独的一个模型 , 用户需要定义一下你的这个记忆的 schema 是什么样的 。
比如说我是谁 , 我的偏好是什么 , 我的生日是什么 , 然后你需要定义这么样一个格式 。 然后这样的话你在对话的时候呢 , 它就会自动的去更新你定义的这些信息 , 然后并且自动的就是说在你需要这些的时候把它塞到上下文里面 。
那我觉得这个如果它长期就往下去发展 , 它可能会被涉及到就是一个数据的我到底给多少我给不给的问题 。
就我想到了一个例子 , 就是在中国之前有很多科技创业公司是做高级智能辅助驾驶的 。 那他们的客户就是车企 , 然后他们想要去持续的帮车企优化他们给车企的智能驾驶的方案 , 它其实需要一些这个司机的数据的 。
但是在以前就是这个问题就是行业里的一个比较老大难的问题 , 就是到底给多少以及怎么给 。 就可能你去服务每个车企的时候你都得单独谈 。
当然车企是非常大的客户了 , 它不是那种分散的下游客户 。 就可能它也和就是你最后这个生态里面你每一层它的集中度有关 。
对 , 我这就可能又回到了上下文工程这个问题 。 因为刚才曼琪提到就是说给不给 , 给多少 。 就上下文工程本质上就是说弄明白这个什么东西应该进入这个上下文 , 什么样的信息应该进入这个上下文 。
那你说这个还是一个技术上的考虑 。 我刚说那些车企给不给 , 给多少 。 就车企会觉得这个数据我给你了之后, 你优化了这个方案 , 然后因为你的客户又不仅我 , 对吧 ?
你还服务别的车企 。 因为车企是很大的企业 , 所以他们是这种强竞争的角度去思考的 。 然后还有一些是会觉得这个数据会有些敏感的问题 。
我觉得还好 ,因为他们可能不太会遇到那种竞争关系 。
我觉得可能就是跟现在 agent 的整个应用市场本身它比较分散有关 ,也比较多样化 。
是这样 。
那你看到大公司在这方面的一些动作是什么呀 ? 因为其实像 OpenAI 它今年不就是有上一个这种记忆功能吗 ?
我觉得 OpenAI 的这个记忆的功能其实有一个比较长足的改进吧 。 对 , 可以举个例子 , 比如说今天我的妈妈给我做了我最喜欢的甜点提拉米苏 。
以前的话可能是它直接把这整句话塞到这个 ChatGPT 的记忆里面 。 现在的话好像会拆一拆 , 比如说它不会直接说我 , 对吧 ?
它可能会说就 Henry 的生日是 9 月 18 号 , 这第一句记忆 。 第二句记忆的话就是说 Henry 喜欢吃提拉米苏 。
第三个记忆的话就是说 Henry 的妈妈在 Henry 的生日那天给他做了他喜欢的提拉米苏 。 它就会就你看这样的话 , 它这个记忆的可用度在后面再去做查询的时候 , 就会比直接把那一句话扔进去要好很多 。
因为你直接把那话扔进去的时候 , 首先不知道我是谁 ,其次不知道我的生日是哪天 。
大模型它随着自己的能力进化 , 它能自己解决记忆的问题吗 ? 就模型本身 。
我觉得现在的大模型自己前进的方向其实和记忆是两条单独的线 。 现在大模型如果说能力上和记忆比较相关的就是上下文长度的提升 。
我们可能可以看到就上下文还在不断的加大 。 但是我觉得对于上下文的使用的话 , 即使上下文长度在不断加大还是要非常的谨慎 。
因为它不是免费的午餐 。 因为这个不管是 cost 还有它的这个性能 ,其实都会随着你上下文长度增加而下降 。
对 , 刚才你也提到了一下这个上下文工程 。 这个最开始就是也是你们 AGI House, 就是你说你们有连接的成员 , 这个 Andrew Karpathy 他带火的一个概念嘛 。
因为他之前有自己写了一篇长文就是在讲这个 context engineering。 像这个和记忆的关系是什么呀 ? 我可以理解成记忆是 context engineering 其中要做的一件事情吗 ?
对 ,因为记忆最终要使用的话它也得塞到上下文里面 。 所以可以认为就是说记忆的话是上下文工程的一部分 。
我觉得上下文工程的话就是它的本质就是什么东西什么信息应该进入上下文 , 什么不应该 。 那么它的话有两个循环 ,有一个内循环 , 一个外循环 。
内循环的话就是说这一次生成的时候什么信息应该进入上下文 。 然后外循环就是说长期来说我们如何逐渐的去改进我们把正确的信息塞进上下文的能力 。
那像这些努力现在其实也都是工具链的公司在做 , 或者说它不是模型直接相关的 。
对 , 它不是模型直接相关的 。
补全它的残缺身体的部分 , 对吧 ? 因为模型是跟大脑相关的嘛 。
对对对 , 这种 long term memory 和怎么使用这些都是属于就是其实对人来说它是大脑的一部分 。 但现在对于大模型来说 , 它其实是和大模型是本身是分开的 。
相当于是一个外接的硬盘那种感觉 。
评估1:11:50
那接下来还想跟你就展开聊一下就是你刚才提到的这个评估的部分 。 而且评估的部分确实也发生了最近就是比较受关注的交易 。
最开始 Naomi 提到的 OpenAI 11 亿美元收购了 StatSigma。 这个公司的创始人也是个印度人好像 , 反正是个印度裔吧 。 这个可以讲讲 。
就比如说就评估相关的工具 , 这个我觉得它是比较容易被第三方或者标准化的 。 应该是有一些创业的机会是吧 ?
评估是一个很有意思的 , 很有这个争议度的一个话题 。 就是这个是个矛盾点是在于说大部分人都会认为评估或者说 eval 这个事情很重要 。
但是大部分公司现在都不会好好的去做 eval。 那这是个矛盾所在 。 我可以举个例子 。 这个其实是来自于就是我们和 Livekit 合作的过程中获得的一个例子 。
他们一个比较大的客户 , 这里就不说名字了 。 然后他们是做一个 voice agent 做客服 。 他们就发现这个客服呢 ,他这个打电话的时候呢 , 很容易提前挂电话 。
然后这个用户体验就很差 。 所以他们就在 prompt 里面加了一句你不要那么早挂电话 。 他加完这句话以后 ,他是离发布之前他做了啥啥事呢 ?
当然他的工程师就照着这个新版本打了三四个电话 。 哎 , 感觉好像就是比之前挂的是要晚那么一点了 。
哦 , 就发布 , 然后就部署了 , 就到 production 了 。 所以你可以看到就这个公司其实还蛮大的 。 它不是个这个创业团队就是 。
它其实开发这个 agent 的时候都是这种的一个这样的一个状态 。 它没有一个说很严格的然后科学的做评价的这么一个环节 。
对吧 ? 比如说至少跑几百次 , 对吧 ? 然后再去部署 。 它很就是 。 所以这个事情很普遍 。 可以看到的是不光是有专门做 eval 的公司 , 包括像其他的 , 比如说像是 Livekit 这样的 voice agent 的平台 。
它自己就是接下来加入这个 eval 的这个组件 , 对他们来说也是非常重要的 。 这个组件大概干什么样的事情呢 ?
就是说我如果有一个新的版本的这个 voice agent 想要上线 , 对吧 ? 上线之前我先有可能各种各样的情景 , 然后各种各样的这个数据集 。
你先让我跑个几百次电话 , 然后呢 , 看你这些 log 下来了以后, 你帮我分析一下到底改进的情况怎么样 。
你告诉我改进了没有以后, 我再有信心的去上线这个新的功能 。
你刚才说就是大家觉得重要但是不做的原因是因为它很难做 。 它这个主要难在什么地方呀 ?
因为你要做评估就需要数据 , 对吧 ? 你需要可能是人工去标注一个数据集 。 那么这个你越复杂的任务 , 这个成本越高 。
另外一个就你这个团队 , 开发团队对于你 build 出来的这个数据集有没有共识 。 还有一个很搞笑的情况就是说有的人他花了很长时间去做了一个数据集 , 然后最后 eval 说我变好了或者变差了 ,他自己不信 。
他会说哎 , 虽然我们的数据集说我变好了 ,但我感觉它变差了 。
你说到这个就是哪些任务会相对更好评估 , 哪些任务会不好评估 。 大语言模型的一些任务的就是非对称性 。
就有的你是生成一个东西很难 ,但你评估它是比较容易的 。 但有的任务就属于你评估它可能比你做出这个任务花的时间还多 。
举个例子哈 , 就比如说我们可以看到 OpenAI、DeepSeek 他们做强化学习用的任务是啥 ? 就是 coding 和数学 , 对吧 ?
编程和数学 。 之所以用这些任务就是因为他们有很好的评估的信号 。 这样的话模型能够最大程度的从这些任务的评估中去学习 。
像这些任务就属于相对来说比较容易评估的 。 比较难评估的比如说主观性比较高的任务 , 或者任务本身复杂度比较高的 , 都会相对来说更难评估一些 。
那接下来就是想讨论一下就是你们看到这个 Agent Tooling 的它的整个商业的情况 。 比如包括市场规模呀 , 然后未来可能会是一个什么样的生态格局 。
市场规模1:15:28
我们可以先说说市场规模吧 , 就它未来可能会是个多大的市场 。
大概我们算了一下, 就是一般如果我们看全球的软件市场的话 , 它一年大概能卖 6500 亿美元 。 相对来说 DevTools 它可能就是分走其中的一块嘛 。
那根据我们看的一些上市的一些公司 , 然后看到这个行业 standard 大概是中低个位数的百分比 。 那如果我们从 ballpark 大概差不多就是 200 到 300 亿美元的一个规模 。
然后 AI agent 这一波呢 , 它其实整个游戏规则其实有点改变 。 之前我们看一个红杉的预测就是说它 AI 会把就软件市场的天花板就是有一个推高 , 然后会把它从 6000 多亿到推到一个 10 万亿美元的级别 。
它主要的原因是因为它可以 tackle 就是切入一些这个服务业的这个蛋糕 。 然后它会把原来就是靠人力的这种服务转化成一个可以靠软件的一个服务 。
然后如果这个判断这个方向是对的话 , 那如果我们去看就是为 AI agent 提供这个武器装备的这个 Agent Tooling 的这个市场 , 它也会有一个大的一个 step up。
如果我们 apply 一个类似的这样的一个 percentage 的话 , 那可能比如说占到这个新市场的 5%。 这样算的话可能是长期的市场规模可能会达到 2000 亿到 5000 亿美元 。
那跟现在两三百亿的开发者工具相比呢 , 大概正好是一个 10 到 15 倍的一个增长 。 所以我们其实觉得就是 AI 这一波它不是一个瓜分一个存量市场 , 更多是在创造一个增量市场的一个过程 。
那这个市场里会出现那种特别大的公司吗 ? 因为有的市场它是很大 ,但是里面可能没有就是不是每个公司都很大 。
比如说会有年收入到 100 亿美元的公司吗 ?
对 , 我觉得其实是已经在发生的事情 。 然后我们其实可以从三个角度来看吧 。 然后比如说就是第一个就是说这个市场到底有多大 。
那我们刚刚也用了这个开发者就 DevTools 公司做一个参考 。 就比如说做身份认证的这个公司 Okta, 它最近一年的收入大概是在 20 亿美元 。
然后 Twilio 它是一个云通信巨头嘛 , 它高峰时的收入大概去年大概是在 40 亿左右 。 那我们觉得就是 AI agent 的经济可能会是一个实体经济的十几倍 。
那服务于这个新经济的这些 infra, 比如说就是智能体的验证啊 , 然后它的市场空间也像我刚才说的嘛 , 可能会十倍以上或者更多 。
那如果说 Okta 能到个 200 亿的话 , 那 AI agent 身份与调度可能就是一个数百亿级别的市场 。 相对这个方向的产品是 Composio, 就是现在比较 AI native 的公司 。
然后第二的话就是说可能也不是说所有的巨头都会被颠覆嘛 ,也是在看这个 paradigm shift, 它这个范式的转移发生在哪里 。
那可能我们觉得真正的机会是来自于一些 AI agent 带来的一些全新的需求 。 比如说 observability, 就是 AI agent 的可观测性 。
传统的这个看的是 CPU 内存 ,但 agent 可能更多的是看一个角色的链路 。 那 Datadog 大概是年收入超过 20 亿美元 , 它就是做这个系统可观测嘛 。
那将来比如说面向 agent 的观测平台可能也可能要更大 。 然后比如说就是 Braintrust 他们做的就是把智能体的就是执行过程去做一个拆开 。
就它不仅仅是看就是这个服务器的指标 , 更多是可以让你看这个回放调试 AI 的行为 。 然后另外一个就是比如说 agent 的一个实时通信 。
然后 Twilio 它其实做人和人之间的通讯嘛 , 它的收入大概是 40 亿 。 那 AI agent 就是人和 agent 然后和系统之间的交互 。
它对就是 latency 的要求会更高 , 然后对它的可能会话就会话的状态会更复杂 。 然后就这个领域就是像刚刚提到的就是 Livekit 这样的公司就是在做 。
然后它其实本质也是在构建下一代的这个专用的一个通信层 。 然后还有比如说像 Claude Code 就这种自主编码的 autonomous 的 coding agent。
就是有点像这个 GitHub 加 Vercel 的一个模式嘛 。 它主要是面向是自主写代码的一个就是这种的 AI agent。 它自己不会去替代 GitHub,但它会拉动一系列的就是新工具新工具链 。
就比如说代码怎么去做审计啊 , 怎么去做回锅测试啊 , 然后做安全执行之类的 。 然后像 Codian 他们也在做这种可以组装的这种 agent 模块和一个集成 。
就是可以让就是企业像拼乐高一样把 AI 去装进他们 existing 的现有的工作流 。 这样子去看的话 , 那什么样的公司可能最有可能去做成百亿美金呢 ?
他们一般应该不会是做这个工具的拼凑 , 然后更多的是能不能形成一个网络的效应和数据的壁垒 。
就比如说它有没有去有一个自就是自己 self-involving 的这样的一个数据的闭环 。 就越用越好 , 就是越用通过率越高 , 成本越低 。
然后它有没有去卡住一个 workflow 的一个关键节点 。 就比如说 Livekit 它是做这个实时通信 , 那 Braintrust 做这个 observability。 然后它调用量越大的话 , 它的数据可能是越值钱的 , 就越容易长出一个就是百亿的公司 。
那你说这个我觉得其实它有两类机会 。 一个就是你刚才提到的一些已经存在挺久的公司 , 就是或者说它是在这一轮 AI 热潮之前的 。
比如说做这个身份验证的 Okta, 对吧 ? 还有做通信的 Twilio, 做观测的 Datadog。 其实理论上他们也可以在自己本身的这种客户关系的基础上它可以加 AI。
之前二级市场有一些比较火的标的也是类似这种吧 , 比如 Photoshop。 然后另一类可能就是 AI 原生的新的公司 。
比如说做 agent 的状态观测的 , 然后做跟 agent 相关的身份认证的 , 做 agent 的通信的 。
对 。
最后是想请 Henry 和 Naomi 来分享一下, 就是在硅谷的 AI 创业社区的一些情况 。 比如说大家是一个什么样的氛围 ,是怎么运转的 。
硅谷创业1:21:24
因为就是类似于你们刚刚说的 Composio 这种公司 ,他们是从印度去了美国 。 那现在其实也有很多中国的 AI 团队 , 它一开始就是一个全球化的定位 。
像硅谷旧金山肯定是大家会去的比较多的地方 。 你们自己也接触了比较多的国内的创始人。 你们可以讲讲就是在湾区这个创业生态是怎么互动起来的 。
对 , 就我觉得其实分成几个部分吧 。 它其实是我们有会 host 各种不同的活动 。 那一部分就是我们比较大的受众是在 researcher 和 engineers。
然后针对于一些 researcher 的活动 , 比如说像 Henry 他将会办一些比较 technical discussions, 会把这所有的 AI lab 的一些 top researcher 召集起来 , 就会做进行一个讨论 。
那它承载的形式可能是 paper reading。 然后还有我们像办的一些大的 hackathon 这种的话 , 就是会跟 other 那种大的 AI lab 去合办 。
要不然就是去和一些比较有意思的创业公司 , 然后尤其是像做这种 dev tool、agent tool 的公司 。 这样一个是有一个 marketing 的一个作用 , 然后同时他们也可以去收集一些一线的这种对他们产品的反馈 。
然后当然我们其实也跟非常多就是优秀的华人创创业者有很多的合作 。 就是之前 LaVer 然后 Melvin, 就是我觉得他是一个非常有梦想 , 然后产品 sense 非常好的这样的一个创业者 。
当时他们在就是在旧金山做他们的 launch 的时候 , 我们团队也去给他们就是支持 , 然后帮他们带了一些比如说当地的比如说 designer 啊 , 一些 local 的 user, 然后去收集一些 feedback。
那基本上从国内来到美国的一些公司呢 ,其实都是相对来说就比较成长期的一个阶段 , 就已经有一些比较好的数据可以去看 。
像 Opus Clean 也是我们经常去合作的一个公司嘛 ,他们就是做长视频剪短的 。 然后我们自己本身 AGI house 的团队 , 所有的媒体剪辑也都是用 Opus Clean 在做 。
因为我们跟就是一些本地的 influencer community 也是有一些合作 , 所以呢也是可以在不同的角度吧 。 不仅仅是说 developer,也跟一些 application 的 users 和这些 opinion leaders 也有一些比较深度的交流 。
嗯 , 我想问一下就是 23 年的这个 ChatGPT 热潮来了之后, 从什么时候开始你们会感觉到国内去的团队会变多了呀 ?
我觉得今年明显感觉是很多的 。
很多是吧 ?
对 , 非常多 。
我觉得可能还看到一个趋势 , 就越来越多的中国创业者可能就是来美国创业 。 就尤其是他们做如果是做一个 application 的产品 , 中国的创业者他其实是非常有产品 sense 和 application 的触觉的 。
那比如说如果我们去看 HFZero,也是三藩这边比较有名的一个 accelerator program 嘛 。 过去三四届我觉得大概至少都有 30%,20% 到 30% 的就是他们的 funding team 是中国背景的 。
就是说不是 ABC, 就是中国中国背景 。 而且他们的就是 revenue number 增长的都很不错 。 然后通过就是这种比较美国的一个孵化器 , 然后实现一个转型 。
就是他们有一些也是在中国之前创过业 , 然后但是重新就是通过这个孵化器的这种途径去实现一个在美国去建立它的 connection, 然后去增长的这样的一个一个打法吧 。
嗯 , 我们前几期聊过有一个创始人, 就是 Michael Guan 是 FellowRound 的创始人。 他就参加过这个 HFZero。 嗯嗯 , 包括国内有一个公司叫 ACE Studio,他也参加过 。
嗯 , 我看他也分享过 。 而且就是我后来发现这个孵化器比较特别的一点是 , 就是你从公开信息里是查不到谁参加过这个孵化器的 。
它的历史的就是参与者的名单是非公开的 。 但是它会定上告诉一些硅谷的投资人, 包括国内的一些投资人。
它会定上邀请 , 就是最后那个 demo day 的时候 。
他们因为每一届其实也只有 10 个公司 ,而且他们就是只收这种 serial entrepreneur, 就是之前创过业的 。 所以本身他们的估值啊 , 就是产品团队方面比较相对于那种 YC 这种会更加 ready 一些 , 就是更更 experience 一些 。
我想说的是 , 我感觉这一波 AI 创业就是华人创业者还是有很大的优势的 。 一个的话就是 Naomi 刚才提到的 , 我觉得 to C 的产品力其实比很多美国团队都要强 。
第二个的话我觉得就是执行力 。 因为现在大部分的这些 agent startup 他们的这个护城河来自于两方面吧 。
一方面是如果你是一个垂直的 agent, 那么你在这个垂直领域里面有没有这个专家的知识 。 这是一方面 。 另外一方面就是纯执行力 。
所以这方面我觉得历史上咱们还是比较强的 。
其实我跟就是去过那边的一些人, 包括在那边的一些团队交流 , 我有一个模糊的印象 , 我不知道对不对啊 。
就是我感觉在美国的大部分主流的团队 , 可能还是在 to B 领域做 AI 创业的创业公司是最多的 。 而且他们可能会有一些相对明确的退出路径 。
就不一定是我要自己发展到多大 ,其实我可以到一定程度被一个大公司收购 。 而中国的一些野心勃勃的创始人 ,他们其实提供了就是对投资机构来说的一个比较稀缺的类型吧 。
就是真的想做的挺大的那种 to C 的应用 。 我觉得 minus 就有点这个意思啊 。
我觉得中美这边是有互补的 。 对 , 就是硅谷这边做 to B 实在是生存环境实在是太好了 。 所以就是做 to B 的人会非常多 , 然后做 to C 的人会少很多 。
做 to C 硬件的人就是非常非常非常少 。 像国内的话就完全可能会反过来 。
那像 Henry 这边 ,因为你就是组织一些技术的讨论比较多嘛 。 最近有什么你自己觉得比较好玩的 , 或者说比较新颖的这种技术趋势吗 ?
几个方向吧 。 可能也不能算是新颖了 。 因为我觉得这个趋势是从可能去年 9 月份或者说去年 DeepSeek 发布以后开始的 。
就是这个 RL 的第二春 。 对 , 然后现在大家就是有很多创业公司 , 可能可以分为两大类 。 第一大类的话就是在去做这种 RL 的环境 , 然后卖给这些在训练基础大模型的公司 。
然后还有一方 , 还有另外一类的话就是他们做一个叫做 RL as a Service。他们去帮那些大企业去改进大模型在他们内部的那些应用场景 。
然后通过 RL 的方式来改进他们的这个不管是模型的能力啊 , 还是他们 agent 的能力 。 所以我们也在这边做了很多相关的技术讨论 。
也许我们下次可以展开聊聊这个 。 那今天非常感谢 Henry 和 Naomi 做客 《 晚点聊 》, 分享了他们在硅谷怎么去组织这种技术人员 、 创始人的社区以及看到的一些趋势 。
那我们今天是比较详细的聊了 Agentic Tooling,也就是智能体的工具链和工具箱的机会 。 这个领域有非常多的核心的大公司在投入 , 然后也有很多新的第三方的创业的机会 。
然后我们讲了很多硅谷的一些公司 , 准独角兽 、 独角兽 。 那虽然 infra 这个创业目前来看在国内可能并没有那么好的去复制的方法 ,但另一方面现在整个 AI 创业的氛围是非常全球化的 。
那也有可能大家能去硅谷 、 去美国做一些交流和创业 。 然后我觉得 AGI house 可能到时候大家也可以合作和交流起来 。
今天谢谢两位 , 各位拜拜 。
谢谢万琪 。
谢谢 。
本期节目就到这里 , 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 。
这也会成为我们节目的一部分 , 让整个讨论更完整 。 你也可以把我们的节目分享给对这个话题感兴趣的朋友 。
欢迎推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》。 也欢迎关注我们的公众号 《 晚点 LatePost》。
下期再见
。




