晚点晚点聊 LateTalk2025年8月21日· 1:36:46

130: 手机Agent大幕拉开!从刚上线的AutoGLM 2.0聊起,大模型如何改造手机|Agent#4

本期《晚点聊》邀请智谱AutoGLM算法、工程和产品负责人刘潇,聊刚上线的手机通用Agent AutoGLM 2.0及其研发历程。该产品免费、无需邀请码,在iOS、安卓和网页端可用,通过云手机和云电脑异步执行任务、不占用户屏幕,关键支付环节交还用户确认;刘潇认为点外卖和找美食会成为最高频场景。他对比了GUI和API两种调用App的方式,认为二者长期并存,也说明了与荣耀、三星等厂商的To B合作和自研To C产品的区别。回顾近30个月,他从GPT-4发布后转向Agent研究,做出全球首个智能体评估基准Agent Bench,再从离线强化学习转向在线强化学习,用结果而非过程监督模型,让AutoGLM学会自主纠错。他提出强化学习的关键是环境和激励;目前AutoGLM在OSWorld评测约48分,人类约70分,单个任务成本约0.2美元,下一步每1-2周迭代新功能。

  1. 0:00开场
  2. 1:57AutoGLM 速览
  3. 9:06高频场景
  4. 14:14三方竞合
  5. 28:44手机厂商
  6. 37:17Agent 起源
  7. 47:25数据构造
  8. 53:44离线强化学习
  9. 1:04:02环境与激励
  10. 1:11:12在线强化学习
  11. 1:18:11提升方向
  12. 1:32:14连点成线

PodHood 提供支持

文字稿

开场0:00

曼祺0:04

欢迎收听 《 晚点聊 》, 我是曼祺 。 今天的话题是手机 Agent。 就在昨天 , 智谱 AI 的 AutoGLM 2.0 正式上线 , 这是首个为手机端打造的通用 Agent, 能帮你点外卖 、 买票 、 订餐 , 无需邀请码 , 所有人可以直接使用 。

从市场规模看 , 手机端的 Agent 会比 Deep Research、Devin 这些网页端和电脑端的 Agent 大得多 。在中国 , 每天用手机的人几乎等于总人口 ,而每天要用电脑的人则少很多 。

这会是一个兵家必争之地 , 大模型公司 、 移动互联网巨头和手机公司都跃跃欲试 。 除了智谱刚刚发布的 AutoGLM 2.0, 我们看到字节正在酝酿豆包手机 , 美团王莆中亲自带队做生活服务助手 , 苹果 、 华米 OV 也一定不会缺席手机 Agent 的竞争 。

这期我们就邀请了 AutoGLM 2.0 的算法和工程产品负责人刘潇 , 来和我们分享开发 AutoGLM 的故事 、 他的技术洞察 、 他对竞争和生态的思考 。

1999 年出生的刘潇 , 今年 26 岁 , 本科毕业于清华大学计算机系 。 制作这期时我算了一下, 这是我们第 4 期专门来聊 Agent 了 , 之后也会有更多相关内容 。

所以我给这 4 期的标题都加上了 Agent 的标识和编号 , 方便大家检索往期内容 。 最后打一个我们自己的小广告 :《 晚点 》 发起了一份亲行小问卷 , 只有 10+ 个选择题 。

我们想了解 :AI 应用产品在 " 模型调用 " 方面的真实现状 ; 到底在不同场景中, 哪些模型被用得最多 、 最受欢迎 ; 问题不涉及产品名称等敏感信息 ; 问卷的链接和详情见 Show notes。

欢迎 《 晚点聊 》 听友中的 AI 产品开发者和创造者来填写 ! 感谢 ! 下面我们就正式进入节目吧 。

刘潇 , 你可以和我们的听友打个招呼 , 然后简单地自我介绍一下 。

刘潇1:50

嗨 , 大家好 , 我是刘潇 。 现在是智谱 AI 的算法研究员 , 同时也在领导和负责 AutoGLM 这个团队的算法和工程产品 。

AutoGLM 速览1:57

曼祺1:58

我们第一部分可以先聊聊 AutoGLM 这个产品本身 ,因为这也是一个新的产品 , 它可能会有很多新的特性 。 我自己的第一个好奇其实是 , 智谱的人和我沟通说你们有这个产品上线的时候 , 我第一反应是 :" 哎 , 这个东西不是去年 10 月已经上线过了吗 ?

怎么它又要上线一次 ?" 但是确实 , 从去年 10 月到现在 , 我觉得并没有那么多人用到 。 你可以讲讲它这一次上线 , 它有什么变化 ,以及它是一个什么状态吗 ?

刘潇2:21

AutoGLM 其实去年 10 月底就和一部分内测的用户进行过一个见面 。 当时的 AutoGLM 和现在最大的一个差别其实就在于 , 当时的 AutoGLM 它是一个首先主要是在手机本地端进行执行的这样的一个 Agent。

我们观察到一个很大的问题是 , 它会跟用户争抢你的屏幕使用权 。 如果 Agent 在运行 , 用户就不能操作 , 那这件事情其实会让很多深度使用的用户感到痛苦 。

然后另一方面的话 , 就是在手机上, 对于我们中国用户的使用习惯来说 , 可能更多还是偏生活场景和服务类的场景居多 。

但是 AI 的另一类很重要的场景 ,其实是帮助我们工作提效 ,并且去完成一些更复杂的任务 。 那么我们认为去实现一个对云电脑的这样的一个完整的操控和一个异步的执行也非常重要 。

所以说这次我们是一个双端协同 , 既可以操作这个云手机 ,也可以操作云电脑的这样的一个通用的这样的一个手机端可以运行的智能体 。

然后我们希望在两端都能给大家带来一些全新的智能体体验 。

曼祺3:13

所以总结一下的话 , 第一个不一样的地方是它可以不抢占你的屏幕 ,在后台去运行 。

刘潇3:20

对 。

曼祺3:20

然后第二个不一样的地方就是这一次不仅是手机上 ,因为你们去年 10 月是出来的时候 , 那个讲的是 Phone use 嘛 , 就是用手机 。

这一次是手机和电脑两个端都可以用 。

刘潇3:30

对对对 ,是的 。

曼祺3:31

还有一个其实挺不一样的点就是它不是一个内测状态了 。

刘潇3:34

对 , 它这次是以一个全端上线的这样一个方式 , 大家可以在 iOS、 安卓和网页端都能体验到我们的 AutoGLM 的能力 。

曼祺3:40

它到手体验的时候是我直接下载 、 我直接注册就可以用 , 还是需要邀请码还是怎样 ?

刘潇3:45

这次我们是完全全面上线 , 大家无需邀请码 , 然后也不需要这个收现 , 大家可以直接上来使用 。

曼祺3:51

那这个怎么收钱了现在 ? 是要调用还是还是什么 ?

刘潇3:55

我们现阶段可能还没有这方面的计划 , 我们希望大家都能够率先 , 让大家都能感受到 AI 现在的进展 , 然后让大家体验到真正的自动驾驶的这样的一种 AI 的能力是什么样的 。

曼祺4:05

就是免费用的 ?

刘潇4:06

对 , 就让大家来免费使用 。

曼祺4:07

你可以简单描述一下它有哪些比较代表性的功能吧 , 就是它能做到什么 。

刘潇4:11

好的 , 那比如说像在手机端 , 大家现在在手机上你可以想象到的任何的这样的一些应用 , 它都可以由 AutoGLM 来操作使用 。

比如说它可以帮你去美团上 、 去点外卖 , 帮你去寻找你想要的店铺 , 然后它可以去帮你叫保洁 , 帮你去叫这个水电维修 , 然后它还能去小红书上或者去其他一些应用上帮你查找最新的一些你身边的一些资讯 , 然后帮助你告诉你一些你最喜欢吃的东西是什么 , 然后给你找到一些最及时的一些 、 可能也最贴近你个人个性化推荐的这样一些内容 。

那如果在电脑端的话 , 它可以去完成深度调研 , 可以去帮你做 PPT, 可以去通过代码的方式帮你完成一些复杂的网页创建 , 还有一些这种卡片设计 , 然后还帮我写一些数据分析 。

然后最关键 , 它还能够一键帮你去生成播客 、 生成视频 , 然后生成图片 , 然后这样一些多媒体内容 , 还能直接帮你发布到你的社交媒体上 。

那么这个都是通过网页端和对电脑的这样一个操作来实现的 。

曼祺5:05

然后我今天早上自己也试了一下, 就是用这个 AutoGLM 来点外卖 。 我是用美团来点外卖吗 ? 当我真的作为一个用户代入去用的时候 , 我第一个会去想的问题就是安全还有隐私的问题 。

因为我第一次用的时候 , 它是需要我登录一次的 , 就是需要我在这个上面输我的电话号码或者我的账户 , 然后它还要输验证码什么的 。

这块你们是怎么去处理的 ? 就怎么保证大家在上面去做各种操作 , 包括还涉及到付款 、 交易 , 然后让它整个流程其实是比较有安全保障的 ?

刘潇5:34

首先这台设备它是一个在云端的一台真正的这样的一台手机 , 所以说它就像你去配置一台你的新手机一样 。

这个设备它是一个 , 就是比如说你在配置你的新手机 ,在你的新手机上登录和注册的时候 , 这台手机它也并不会去记住你的用户名和密码 , 它实际上只是记住了你的登录状态 , 通过跟这个云厂商的这个设备的合作的方式 , 把你的这个登录状态保留了下来 。

我们并不会去记录任何用户在这个过程当中的账号或者密码 , 我们都是不知道的 。 然后其次的话 , 像你刚才提到的像这些敏感的这些支付操作 , 想必你今天早上体验的时候可能也感觉到了 , 它在关键的这些支付 , 然后还有这样的一些登录的这些环节 , 它都会完全把这个设备的这个权限 、 接管权限完全交到用户手上, 然后包括平常你

自己就算不发起任务的时候 , 你也可以接管这个设备上去 , 对这个设备做任何 , 比如说你想退出账号 , 这些都是可以做到的 。

曼祺6:23

对 , 就是它有一个接管手机的选项 。

刘潇6:24

对对对 。

曼祺6:25

但是这个又会给我带来一个问题 , 就是我会觉得如果是这种方式来点外卖的话 , 至少在目前 , 它好像没有比我自己点外卖更快 。

因为我最后比如说我要付费什么的 , 我还是得我自己去确认一下 ,而且有可能比如说我后台开了这个功能 , 对吧 , 我过一会儿我也许忘了 , 我去干别的 。

然后后来过了 30 分钟之后, 我再想为什么我点的外卖还没有来 , 哦 , 原来是我自己没有确认 。

刘潇6:47

对 , 这个我觉得是我们产品上接下来迭代的一个很重要的地方 。 我们现在给大家这个版本还是一个相对比较初步的一个这样的一个版本 。

那么这个版本比如说 , 打个比方 , 我们还没有来得及直接来在关键步骤的时候去弹一个 , 就当你把这应用置为后台的时候 , 给你弹一个通知提示 , 告诉你说我现在需要你来帮我支付一下类似于 , 或者说甚至以后我可能不需要你真的点进来 , 我只需要你比如说语音就会弹个气泡 , 然后只要说一句 " 帮我付了 ", 那它就再帮你点一下确认就

可以了 。

曼祺7:16

如果我语音同意 , 它就可以帮我付 ?

刘潇7:18

对对对 , 像这些 , 或者说甚至比如说以后, 比如说你可以设置说 , 比如说 30 块钱以下的订单你就不要找我了 , 你就直接付就行 。

类似于这样 , 我们会有一些记忆的机制 , 这种方式你可以设一些限制 。 然后当然我们觉得可能以后更有想象力的是像这种智能体支付的基础设施 , 如果建得更加完善的话 , 就类似于像你用第三方支付的方式 。

那么我们能够类似于说给智能体一个自己单独的钱包 , 然后你可以给这个钱包一些更多的限制 , 比如说像这个额度的限制 、 次数的限制 ,以及什么类型的商品你可以付什么类型商品你必须问我 。

类似于这样 , 我们觉得这个可能是接下来一个很重要的 , 我们也会希望和致富的这些朋友们一起来做的事情 。

曼祺7:58

你说这个体验挺有意思的 , 我觉得这是让一般人体验了当老板的感觉 。 因为当老板就会有比如说多少钱以下的预算 , 我是不批的 。

多少钱以上我可能才会看 。

刘潇8:07

对对对 , 包括如果以后像 Agent 有自己的支付的话 , 你甚至可以比如说 Agent 的支付可能就是更容易撤回一些 , 比如说像人的支付 ,因为是人确认过的嘛 。

那比如 Agent 的支付 , 它可能就是从支付厂商那儿 , 我们就更容易来一起来配合说 , 比如说这种 Agent 支付 , 那只要用户想要退款 , 那就是可以一键退的 。

类似于这样的机制 ,但具体什么机制不确定 。

曼祺8:26

就是在使用 AutoGLM 的过程中, 它会截我的屏吗 ?

刘潇8:30

它是通过在你发起任务的时候 ,在它自动驾驶的阶段 , 它是会要去阅读你的屏幕 。

曼祺8:35

它会读我的屏幕 ?

刘潇8:36

对对 ,但是当你接管的时候 , 它是或任务结束之后的任何时间 , 它都不会去阅读你的屏幕 。

曼祺8:41

那它读我屏幕的那些信息 , 我觉得这也是有些人可能会担忧的点 。 就它读我屏幕的时候那些信息 , 就你们会怎么去给它做安全和隐私上的处理了 ?

刘潇8:49

对 , 这块可以去 , 我们有非常详细的脱敏的这个 , 包括数据入库之前都会做很严格的脱敏 , 然后有一些具体的 ,但具体的实现方式可以参考我们的那个隐私协议 , 我们都有 。

但总的来说 , 就是我们做了非常严格的这个数据的清洗和脱敏 , 然后并且做了很严格的加密的这样一些处理 。

高频场景9:06

曼祺9:07

现在有什么就是手机上非常高频的场景 ,但是 AutoGLM 还不能做的 ?

刘潇9:12

我觉得这是个很好的问题 。 我觉得一类非常典型的高频场景就是 , 比如说像我个人, 我自己最希望做的事情就是 , 我晚上一般工作比较晚嘛 , 程序员你懂的 , 然后但是我早上要赶着来公司喝咖啡 ,但是我经常一忙要赶着打卡 , 然后就忘了 , 或者说我睡过头了 。

那么我其实非常希望它比如说每天早上 9 点我还没醒 , 或者说我把闹钟给自己关了 , 它就先给我点上, 然后等我 9 点半到公司 , 我就可以直接拿我公司楼下的咖啡店里的咖啡 。

就算不去给它直接发执行任务 , 它也能在固定的时间按照我的要求去替我完成这样的一些动作 。

这个是现在还不能做的 , 就是类似于定时任务 , 或者说一种更主动式的这种 Agent 的行为 ,但这种也是在我们接下来的这个迭代计划当中的 。

曼祺9:53

所以智谱是要打卡的 ?

刘潇9:55

当然要打卡 。

曼祺9:56

你们是要打卡的是吗 ? 因为有很多那个新的科技公司 , 它是可能就你自己想什么时候来就什么时候来 。

刘潇10:02

打卡还是得打的嘛 。

曼祺10:04

其实我自己想到有一个挺高频的场景 , 就是发微信信息 , 就是这种通信类的 , 这个现在是还不能做的 ?

刘潇10:11

其实从技术上来实现其实也是可以实现的 。 然后它因为本身像这种基于操作手机 , 还有操作电脑这种设备 , 它都是通过这种智能体 , 它其实是通过这个阅读屏幕 ,并且模拟人类点击和输入的方式来实现代理人类意图来进行执行的这样一种能力嘛 。

所以说其实理论上是所有装在设备上应用都可以完成的 。 之所以我们可能这次并没有太多去强调 , 或者说去展示这方面的一个原因 ,其实主要是微信上确实还是个人体验的视角来看 , 它的这个隐私的信息可能会更多 ,而且还更难去脱敏一些 。

而且说实话 , 对我个人来说 , 发微信这件事情不是一件很需要 Agent 的长时间执行的事情 。 我可能更希望 Agent 帮我去解决一些 , 比如说我要反复找信息 , 或者说去做一些重复繁琐的事情 。

但是我发消息每次其实我的意图和我的这个内容都是不一样的 。 我觉得这件事情可能我自己打字几秒钟能够解决的事 , 还是我自己来做比较好 。

我觉得我目前对于 Agent 的理解 , 包括设备操作 Agent 的理解也是这样 。 如果一个动作是我可以快速几秒钟或者 10 秒钟就能搞定的事 , 那我确实觉得并没有什么很实际的必要 , 或者说在我手方便的时候可以做这个事情的话 , 那我自己做当然会快很多 。

如果这个事情是比如说我手不方便的时候 , 我在开车 , 我在做家务 , 我在洗澡 , 我在跑步 , 这个是很典型的 , 就是你手不方便的时候 。

还有一些时候是属于我手方便 ,但是我人忙 , 我在忙着干别的事 , 我在回消息 , 我在打游戏 , 然后你这个时候突然来个事 , 让我要赶快怎么去点个东西 , 或者说我要去查一个什么资讯 。

曼祺11:39

或要买个票 , 或者要干嘛 。

刘潇11:40

对 , 买个票 , 要订个出差行程 , 对吧 ? 那这种事情 , 然后以及说有一些我就是要周末给我的一家人出去玩 , 找个地方 , 然后顺便把这个行程 , 还有什么酒店这些安排好 , 然后我也不知道去哪玩 , 我自己刷小红书 , 刷各种攻略 , 可能看一两个小时, 看下一篇就忘了前一篇的内容了 。

那这种时候我就会觉得有一个 AI 先帮我把这些事情 , 这种长时间的 , 或者说我不方便用手做的这些事情都给做了 , 那我的话就会方便很多 。

曼祺12:06

你们自己预测什么功能可能会小小的引爆一下大家的需求 ?

刘潇12:10

我觉得首先肯定是每天你都会想要做的事情 , 肯定是会让大家都有印象的 。 我觉得吃的吧 。

曼祺12:16

是点外卖 ?

刘潇12:17

一般点外卖二方面我觉得是找吃的 。

曼祺12:19

找美食 。

刘潇12:19

对对 , 比如说包括跟朋友出去聚餐 , 我们今天吃哪呢 ? 然后你可能经常性的 , 比如说像我一到周末 , 很多时候我就很痛苦 , 周六下午醒来躺在床上, 不知道晚上吃啥 , 床上可能刷两个小时, 最后也没有一个结论 。

曼祺12:31

所以你们智谱周六不上班的 ? 你们是双休 ?

刘潇12:35

我们当然是双休 。 对对对 , 所以说就是像这种时候 , 就是我觉得存在很多场景属于是高频 ,但是它其实做起来并不是很容易 , 或者说很多时候我们之所以很容易的做它 ,是因为真要认真做会很麻烦 。

然后这种时候我觉得很适合让 Agent 来帮你做 。

曼祺12:51

对 , 我自己的个人体验也是 , 我觉得点外卖对我来说倒是挺快的 。 不过有时候你要找一个聚餐的地方 , 确实会刷得比较久 。

刘潇12:57

对 , 或者晚上, 比如打个比方 , 你有个时候想换个口味了 , 比如说你像我就天天吃什么黄焖鸡 , 对吧 ?

那我实在不想吃了 ,但是你让我去刷推荐 , 我也不知道周边有什么 , 然后我刷来刷去可能也都点过了 , 然后我还经常忘了说这家菜哪个我吃过 , 哪个我没吃过 。

那么让 Agent 帮我来全部扫一遍 , 给我一个最具体的这样一些推荐 , 然后我可以告诉它一些要求 , 它来帮我找到一个好的 , 然后帮我筛选出来 。

它甚至不只是就点外卖这件事情 ,也不一定非得是在外卖应用里面做 , 对吧 ? 你也可以去社交媒体上搜 , 你可以去朋友圈里面看一看 , 说朋友最近在吃什么 。

曼祺13:31

就是你也可以给它一个指令 ,是说你帮我去小红书上去找一个什么什么类型的美食 。

刘潇13:36

然后再去美团上帮我下单 , 这也是可以的 。

曼祺13:38

这也可以 。 那它可以去看我的朋友圈吗 ? 微信朋友圈可以吗 ?

刘潇13:41

如果你自己想下的话是可以用的 。

曼祺13:43

我给它指令说看我朋友圈 , 它能看吗 ?

刘潇13:45

它也能看 。

曼祺13:46

它也能看 。

刘潇13:46

对 ,但是在你给出这个指令的情况下, 它会去做这个事情 。

曼祺13:49

但这不是你们强调的功能 。

刘潇13:50

对对对 。

曼祺13:51

你们自己预测的可能会有比较多需求的 , 就是跟吃相关 、 外卖 , 还有找美食 。

刘潇13:56

对 , 我觉得其实就是衣食住行嘛 。 举例来说是很多选项 ,由于原本的推荐系统 , 我觉得它不能够很充分的去 cover 我的想法 。

我现在去选择吃黄焖鸡 ,并不是我真的喜欢吃黄焖鸡 ,而是我实在是懒得去找 , 或者说你给我推的可能不是很满意 ,但是我也无可奈何了 。

我觉得这种情况会比较多 。

三方竞合14:14

曼祺14:14

因为你说到这个 , 我觉得挺有意思的 , 就是你们这是外卖大战和 AI 竞争的真正的一个交汇点吧 , 可能 。

但这就又涉及到另一个问题 , 那些 APP 厂商会怎么想 ? 因为其实你们也是一个 App, 对吧 ? 然后我如果用了 AutoGLM 在云手机上, 我去点美团的一些东西 , 或者我去饿了么上点东西 , 那其实不是我这个人在看这些信息 , 那可能对这些 App 厂商来说 , 它就失去了吸引人的流量来他们的 App 的这个作用 。

就是你们有想过 , 就是你们这个东西发了之后, 比如美团的人饿了么会怎么看这一类产品 ? 包括美团自己也在做这个东西 。

刘潇14:48

对对对 。

曼祺14:49

他们也想做一个这种生活的 AI 助手 , 那个代号应该是叫 beam, 就王莆中自己在负责 。

刘潇14:54

是的 , 我的感觉是这样 , 这两个信息并不矛盾 ,而且甚至很多时候我觉得这两个信息它是相互促进的 。

首先第一的话 , 这件事情并没有减少对这些应用的访问 , 事实上甚至是访问的更多了 。

曼祺15:06

但是没有人在看广告 。

刘潇15:08

但是我会把我看到的所有信息如实的告诉用户 , 就是我本质上是做了信息的搬运工 。 我其实是把它要是它在对话流里面有广告 , 那我还是也会把它的广告搬过来告诉用户说美团给你推荐的这家店 , 你要不要试一试 。

就这件事情就是我的信息源还是它 , 所以说并不会减少对它的广告的浏览和它推荐的这个内容 。

只是说我可能会根据我对用户的了解 , 比如说当然现在还没有这样的机制 , 比如说以后我会更了解你的一些 , 比如说你昨天点了什么 , 今天点了什么 , 那我可能会有一些根据你个人的一些特质 , 会做一些对接信息 , 做一些筛选的 。

但我获得的信息还是应用本身给的信息 , 所以这个我认为其实是不会减少的 。 实际上反而会让应用有更多的机会把他们的想推荐的东西推荐进来 。

我觉得这个是一个点 。 然后第二个点就是 , 事实上我们这次也并不是只有通过 GUI 的方式来操作手机的这样一种方式 , 事实上我们也和一些这个第三方的应用 , 我们现在已经有直接官方的合作 ,在推进一些 API 和 MCP 层面的这样一些合作 。

当然这件事情其实坦率的说 ,API 我首先第一觉得 API 和 GUI 这两者完全没有任何矛盾 。

曼祺16:12

对 , 你可能要稍微解释一下, 就是 GUI 就是通过图形界面你去操作一个 App 和你通过 API 去操作一个 App 的区别是什么 ?

刘潇16:19

对对对 ,GUI 的话 , 它最大的特点是它就是像人类一样去阅读屏幕和理解屏幕 , 然后并且去操作这些应用 。

那么所以说它获得的信息和你人类在浏览这些应用时获得的信息其实是完全等价的 。 那么包括它去做操作 ,其实也是像人一样去做 。

我觉得它比较好的一个点在于 , 它特别擅长去解决一些长尾的 ,并且比较多样性的这样一些问题 。 比如打个比方 , 一个应用厂商通过 API 的方式当然会有它的好处 ,但它也会有它的坏处 。

但是通过 GUI 的方式至少对应用厂商来说 , 它没有任何自己去适配 API 的成本和维护 API 的成本 。 它向普通用户提供什么样的服务 , 它就能够向 AI 代理的这个人类的用户去提供什么样的服务 。

曼祺16:59

所以就是对比如说美团 、 饿了么这样的 App 厂商来说 , 如果你们用 GUI 的方式去调用他们的话 , 它就是没有区分是在服务一个人, 还是在服务一个 AI Agent 的 。

刘潇17:08

对对对 。

曼祺17:08

就没有额外的工作 。

刘潇17:09

对对对 , 它没有任何额外的工作需要去完成 。 所以说对他们来说其实这件事情是非常低负担的去介入 , 让 AI 来给他们带来更大流量的这样一种方式 。

曼祺17:19

那 GUI 的代价是什么 ?

刘潇17:20

GUI 的代价我觉得其实主要是在于 , 实际上是在我们做 Agent 的人这里 , 就是我们需要让大模型真的学会怎么去操作 GUI, 然后以及去给它配上一个这个虚拟的设备 , 让它去做这件事情 。

曼祺17:34

它会比就是 API 的方式更消耗 Token 吗 ?

刘潇17:36

对 , 它当然也会消耗更多 Token。

曼祺17:38

因为它要看这个图是吧 ?

刘潇17:39

对 , 它要看这个图 。 对 , 然后像 API 的方式的话 ,其实像 Anthropic 的 MCP 就是一个很典型的对 API 做集成的这样一个方案 。

然后事实上我们也和很多这个第三方的这个厂商现在在推动这个 API 层面的这样的一个合作 。 但 API 它的好处就是它确实会非常快 ,而且它非常准确 ,因为是直接官方提供出来的这个信息 。

那它的缺点也很明显 。 首先第一 , 基于 API 的健全 , 这件事情其实现在是没有太做的 。 假设某家应用给了我他们的购物的搜索的 API, 我搜了之后, 那我要怎么直接下单呢 ?

就是我到底是怎么绑定我的用户在 AI 这儿的这个账号 , 绑定到你的购物软件的账号呢 ? 以及这个支付流程要怎么走 ?

这件事情其实是没有打通的 。 就现在的基于 API 的方式 ,其实更多感觉还是偏给了一个搜索的接口 , 类似于这样的感觉 。其实后面的链路是断的 ,因为现有的所有的支付 , 还有用户账号信息 , 它都是跟 GUI 的这种应用绑定在一起的 。其实这个链路完全是断的 , 完全走不通 。

曼祺18:37

就相当于如果是 API 的话 , 就是要为 AI Agent 去重新构造一个这个链路 。

刘潇18:41

对对对 , 你需要重建用户系统 , 重建支付链路 , 这件事情说实话门槛非常高 ,而且我觉得不是哪一家应用能很简单的把这个事情给建成的 。

然后第二的话 ,其实也有很多厂商会反馈说 ,他们很担心这样的 API 被滥用 ,因为其实现有的基于应用的这种对用户账号的这种风控 , 就像因为我们用 GUI, 就相当于完全复用了现有所有的移动互联网的基础设施 , 所有事都不需要重新被构建 , 它一切都是现成的 , 然后不需要任何策略就可以接入 AI。

但是你要是 API 的话 , 那你比如打个比方 , 像比如说像地图类应用 ,他们肯定会担心说 , 那你会不会把我的 POI 信息全部疯狂搜索 , 全部扒拉走了呀 ?

或者说像美食类应用 , 它可以说你我的商家信息和我的菜品信息会不会全部被你给截走了 , 对吧 ?

如果我不把健全和这种问题做好 ,而且就他们会有这种数据泄露风险 。 所以有很多应用 ,他们甚至自己是 ,他们其实会很矛盾 , 就是说他们又想通过 API 的方式 , 让 AI 更好的给他们带来更多的用户和使用的场景 ,但另一方面他们又很担心 API 会对自己的这块的风控和支付完全就是不通的一个状态 , 既没有风控也没有支付 ,而且 API 本身的维护也是个巨大的成

本 。 比如说我的接口变了 , 我多了一种产品属性 , 那我就得改 API。

曼祺19:50

就比如说我本身这个 App, 我新上了一个功能 , 我的 API 就要改 。

刘潇19:53

对 , 我就得新增一个 API, 然后这个可能最后一个 App 会有成百上千上万个 API, 哪些 API 过期了 , 哪些 API 没过期 , 要实时跟我的应用能力如果要保持对齐的话 , 这个事情我觉得可能不比开发一个新的 App 要简单 。

曼祺20:09

确实它听起来有这么多麻烦的事情 , 为什么你们和第三方的 App 厂商去沟通的时候 , 还是有人愿意用 API 的方式来合作 ?

刘潇20:16

因为这样首先效率会更高嘛 , 就他们能够更快的把他们的信息喂给我们嘛 。 另外一方面就是准确来说 ,也能给他们带来更多的服务上的这样的一些机会嘛 。

曼祺20:25

就是他觉得有可能潜在能给他更多流量的用户 。

刘潇20:28

对对对 , 比如打个比方 , 可能以前你在 AI 应用里面 , 你只是比如说你家马桶坏了 , 你可能是去 AI 上搜索 , 那我要怎么 , 我马桶坏了该怎么办 ?

但现在的话 , 可能我不但会告诉你怎么办 , 我还告诉你说如果你懒得自己修的话 , 我可以帮你叫谁家的这个 。

曼祺20:43

就推荐某个应用 。

刘潇20:43

对 , 推荐某个应用直接来服务 , 你只要一点 , 它就会立刻打电话来给你 , 问你说要我怎么来上门帮你搞这个事 。

那么这个也是一个很重要的潜在的这样一个入口 。

曼祺20:53

就所以说可能对 App 厂商来说 , 就是看它怎么去考虑这个机会 , 怎么能用起来 , 就他觉得也许对它是有潜在好处的 。

刘潇21:00

对对对 。

曼祺21:00

会存在越大的 APP 在这件事情上, 它考虑的就是越多吗 ? 我就只和你们这种第三方的来合作 。

刘潇21:07

如果是从 API 本身的事情上 ,其实越大的 APP,他们内部越有人力来做这件事情 ,其实他们其实都会搭一些这样的内部的开发的做这个事情 。

但是可能确实越大的应用 , 最大的特点是他们会有很多自己内部业务的考虑 , 所以说可能不会第一时间来做这样一个事情 。

曼祺21:24

就不会第一时间和外面合作 。

刘潇21:25

对 。

曼祺21:26

他可能会先考虑我自己内部研发 , 我试一试 。

刘潇21:28

对对对 , 所以我还是那话 , 我也觉得就 API 和 GUI 肯定会长期共存 , 就像道路上的自动驾驶一样 , 自动驾驶不可能把所有人类司机给消灭掉 。GUI 和 API 的关系也是这样 , 就是 API 肯定会有 , 然后而且很多人也会尝试做 API,但是肯定也会有很多人出于各种各样的考虑不去做 API, 或者说没有能力去维持一个稳定的 API。

这种情况下 GUI 还是一个必要的 ,而且也给用户带来更多安全感 , 至少它是以一种用户能理解的方式在完成这个任务 ,而不是 API 你都不知道发生什么了 , 啪的一下完蛋了 , 你也不知道它是怎么就给你选了这个东西 。

所以说我是觉得这两个东西它其实能很好的互补的 。

曼祺22:06

那你怎么看未来 , 就是比如说像你们做的 AutoGLM 这种 , 它就是一个 AI Agent 的 App, 和美团它可能自己会搞一个生活服务的助理 , 包括高德最近也是上了一个 , 就跟地图相关的这种 , 它可能也是叫智能体吧 ?

就你怎么看这些智能体之间的关系 ?

刘潇22:23

我觉得是这样的 , 首先对 AutoGLM 这样的这种智能体产品来说 , 我们可能更追求一个通用的这样的一个场景 , 就是说我们希望去尽量好好的去服务用户的上下文 , 然后能够去就是站在用户这一边来完成一些事情 。

对于垂直类的厂商做的这种 Agent, 我觉得也是非常有价值的 , 特别是对于一些已经形成了高度习惯的这样一些用户 , 比如说我现在就是很明确的 , 我就是要用你的应用来做这个事情 。

那么我觉得这类 Agent 其实是非常有效的 , 能够去激活一些此前可能很难激活 , 或者说不是很好做的一些场景的 。

然后当然这中间还会存在一个更好的机会 ,也是我们其实也是在探索 ,并且也有一些合作伙伴一起在做的 , 就是说 Agent to Agent 这种方案 。

打个比方 , 如果我要使用某个应用的 Agent, 前提是用户真的打开了你的应用 , 你才能去使用这个 Agent, 对吧 ?

那其实这种方式坦白说 , 它可能并不会给你带来更大的流量 , 它只是帮助你更好的消化和这个提升了现有流量的这个质量 , 或者说消费意图 。

对 , 它其实并没有给你带来更多机会 ,但是通过通用智能体这种方式 , 我不是直接到你应用里去操作 ,而是我找到你应用里的 , 跟你的 Agent 说 , 我这儿有个我的用户 , 我的主人, 它要干个啥事 , 你来给我一个你做完任务之后的结果给我 , 然后我再把这个结果拿回来 。

类似于我们是用户的 personal 的助理 , 然后对方是对方的服务的这个类似于前台 , 然后我们的助理来替用户去跟对方的前台打交道 , 然后完成这样的一个事情 。

曼祺23:50

对 , 我觉得这个问题确实可以关注一下, 就是说未来到底谁可能是离用户最近的这个 Agent,因为我感觉大家都最想当离用户最近的这个 Agent。

我是这样觉得的 , 比如说我作为一个用户 ,其实我想到一个很好的场景 , 就可以用 AutoGLM 来帮我做一件事情 , 比如说我要点奶茶 , 我可以在京东 、 饿了么和美团上, 我就说你去帮我看一看附近的奶茶 , 这三家平台上到底哪个最便宜 , 哪个优惠券给我最多 , 对吧 ?

我就选一个最划算的 。 这样对我当然是最好的 。

刘潇24:17

这种事有可能 。

曼祺24:17

但是这样的话 , 就是那三家就会处于一个被竞争 、 被比较的这么一个 , 我觉得有点对他们来说可能是不利的状态 。

刘潇24:24

这确实是一个好问题 ,但是我觉得从实际用户 , 比如说如果当用户真的问出这样一句话的时候 , 我觉得就算没有这样的 Agent, 用户自己可能也会点开三家去比较一下 。

就是我觉得其实这种比较的需求是原本就存在于用户当中的 , 只是说它是以一种 Agent 形式被表现出来 , 还是说以用户自己去操作的方式去体现出来 。

曼祺24:42

我觉得这个确实可以以后看看 , 到底会是一个什么样的生态 。

刘潇24:46

是 , 我是觉得就是像我刚才说 , 就是说首先第一 , 垂直应用的 App 的这种 Agent 肯定是很有价值的 , 然后但是我觉得有一个站在用户这一边的 Agent, 然后帮助你去管理你整体的 ,并且永远为了你的个性化和你的价值去考虑这个问题 , 我认为这两种需求是并行不悖的 ,其实是能够很好的去沟通和共存起来 。

理论上确实除了个人有该有 Agent 的企业和应用也该有自己的 Agent,以后就是相当于在我们真实的人类的社交网络之外, 还会有一个隐藏的 Agent 的网络 , 可能甚至以后不只是 Agent 去跟服务商打交道 , 比如说我要跟你约一个播客 , 那是我的 Agent 来跟你的 Agent, 或者说我们来查一下我们两边主人的这个日程表 , 看哪个时间比较好 , 我们选好一个时间 , 再各自问

自己的这个主人, 问他们说 match 了一下你们的时间表 , 发现就这个时间你们俩都有空 , 要不然就定这个时间 , 就类似这样 。

我是觉得以后应该会有一个 Agent 的 service network, 然后很多事情就像是每个人都有一个自己的助理 , 每个应用也有自己的助理 , 然后他们会自己去 negotiate, 自己去找信息来帮助人类来完成一些准备的工作 , 然后人类只需要说我觉得这个好 , 或者说 no, 你帮我再找个另一个方案就可以了 。

曼祺25:53

因为现在这个方向其实大家也在做一些基础设施的建设嘛 , 比如说 Google 就有推这个 A2A, 就 Agent to Agent 的这种协议 。

刘潇25:59

对对对 。

曼祺26:00

就是在移动端 , 现在它有一个类似于之前 Web 端 , 就大家用 MCP 这种方式去调用工具的一个生态吗 ?

刘潇26:07

移动端确实是没有的 , 像目前可能有的一些尝试是像苹果据称在想做这样的事情吧 , 常听说是 App Intent 想做一些这种事情 ,但其实还是那句话 , 就是为什么我们最终会发展出触控屏和 GUI 的这样一种方案 , 本质上是因为这种方案其实它本身就是一种统一的接口了 , 就通过视觉的方式和人类对 UI 的理解的这种方式 , 本质上就是一种接口 。

为什么叫 GUI, 就是 Graphic User Interface。 所以说在这个接口基础上再去发展出一套接口 , 可以是可以 ,但就是说需要时间 ,也需要成本 ,以及看实际上大家愿不愿意去迁移这件事情 。

曼祺26:44

那你们在做这个工作吗 ? 比如说类似于 Anthropic 那样去搞出一个 MCP 的生态 , 然后你们有想过 , 比如在移动端去做这种接口的协议的生态吗 ?

刘潇26:53

我觉得这是一个很好的问题 ,其实现阶段坦率说我还没有太去考虑这个问题 ,因为我觉得现阶段其实最大的问题是用户还没有产生这样一种 Agent 的心智 , 特别是虽然 Agent 这个东西在 AI 圈子里面我们已经发展了可能大半年, 甚至一年, 大家都有所认知 ,但是我觉得普通用户 ,Agent 这个词很多人还会问我说 Agent 是什么东西 , 你们总是偶尔看到你们说这个词

,但是比如说我要给我父母去解释这件事情 , 我要给我圈外的朋友去解释这件事情 ,因为他们缺少直观的感受 。

曼祺27:23

那你被这么问的时候 , 你是怎么跟他们解释的 ?

刘潇27:25

我就是说 Agent 就是以后是一个你的另一个助理 , 然后它能够 24 小时为你工作 , 然后你只要给它发指令 , 然后你来当老板 , 它来当你的员工 。

曼祺27:35

当你说这些话之后, 然后问你的人是什么反应 ?

刘潇27:38

他说那你拿出来给我用用啊 。

曼祺27:41

就是他还是会 , 大家还是会觉得有点抽象是吧 ?

刘潇27:44

对 , 大家当然觉得很抽象 ,但完全没有实感 。 因为坦率说真的 , 大部分人都是本质上就是只是做好自己的事情 , 很少有机会去指挥其他人做事情 。

但是我认为 Agent 本质上是给让所有人都必须得 ,以后这可能就是真的是我们人类从小学就得学习的技能 , 就是怎么使唤 Agent 帮自己干活 。

如果学不会这一点 , 可能以后啥事都做不了 。

曼祺28:04

我觉得这确实是一个使用 AI 的心智 , 或者说思维上你需要去越过的东西 。

刘潇28:10

对对对 。

曼祺28:10

因为经常很多事你会觉得我自己干 , 比我去指使 Agent 干可能会更快 , 尤其是你干熟了那些事 。

刘潇28:17

但是你自己干的再熟 , 就像刚才说的 , 你的能力你的一天就只有 24 个小时, 你没有办法把自己一天变成 48 个小时来 ,但你拥有一个 Agent, 特别是如果是一个能 24 小时稳定工作的 Agent, 那其实相当于你自己的时间就翻了一倍 , 你一天有 48 个小时了 。

如果你 hire 更多的 Agent,并且你能有效的让他们 work 起来 , 那你可能你一天的时间是以成数的方式去扩大的 ,而不是像现在这种 Copilot 的方式 , 它是可能只是把你的一部分 , 比如说你的某一个小时变成两个小时, 性质是完全不一样的 , 我认为 。

手机厂商28:44

曼祺28:45

对 , 我们刚才是讨论了一下, 就是 AutoGLM 这种 Agent 和一些手机上已经存在的 App, 包括超级 App 的一些关系 。 然后还有一个我觉得比较有意思的 ,在做手机 Agent 的角色 , 就是手机厂商自己 , 比如说像华为 、 小米 、 苹果 、OPPO, 对吧 ?

他们其实都是有这方面的动作的 。 而且我印象中就是智谱之前也是和手机厂商有合作 , 你们和荣耀和三星都是有合作的 。

刘潇29:09

对对对 。

曼祺29:10

所以你们现在是这两条线都在推什么 ? 就 To B 和手机厂商合作 , 然后你们直接 To C 做这种大家都可以用的产品 ,是都在做吗 ?

刘潇29:17

对对对 , 我们两边都在同步推进 。

曼祺29:18

就你们这两条线的区别是什么 ?

刘潇29:20

我们跟这些厂商合作的方式更多是通过 To B 的方式 , 我们来把能力给到他们 , 让他们来构建自己 , 基于这种比如 AutoGLM 的能力来构建他们的智能助手的这样一种产品 。

然后 To C 的话 , 我们这边可能更关心的就像现在这样 , 我们会更关心这种更加面向 AGI, 或者说面向这种更复杂 、 更艰难的这种长时间运行 , 或者说更有挑战性的这种任务 , 然后以及可能是更适合我们算法迭代的这样的一些场景吧 。

曼祺29:47

更适合你们算法迭代的一些场景 。

刘潇29:49

对对对 。

曼祺29:50

怎么讲 ?

刘潇29:50

因为我们算法需要做更难的任务嘛 , 所以说我们希望引导用户来尝试使用一些更加困难的这样任务 , 来给我们一些启发 , 让我们来更好的做出更好的 AI。

曼祺29:59

就是他要去做一些可能他现在能够到 ,但是做得还没有那么好的场景 , 去牵引你们的算法往前去进步 , 你是这个意思是吗 ?

刘潇30:06

对对对 。

曼祺30:06

然后你们给手机厂商的是更成熟的一些东西 。

刘潇30:09

对对对 , 就更偏产品级的这样的 , 就是稳定性的这样一个东西嘛 。

曼祺30:12

你们给手机厂商合作所用的这个机模 , 和你们在 To C 的 AutoGLM 上的这个机模是一样的吗 ? 还是有区别 ?

刘潇30:20

肯定是从同源发展而来的 ,但是肯定是因为你为了稳定性 , 你版本固定了之后你就不能随便动了嘛 。

但是 To C 的话 , 我们肯定会不断的做迭代调整 , 包括根据用户最新的反馈 , 我们来优化 , 来让用户能立刻得到满足嘛 。

对 , 这个肯定是有区别的 。

曼祺30:35

就是你们和三星或荣耀合作的这个 AI 的一些能力 , 它比如说它具体反映在功能上可能是一些什么东西 ?

刘潇30:42

可能就是会去帮助他们去做一些本地的端侧的这样一些执行 , 就像刚才举例 , 比如说发消息 , 或者说去点个单子 , 或者去帮你叫个出租车 。

曼祺30:52

而且它也是可以帮我做一些服务的 。

刘潇30:53

对对对 ,但是可能都是一些不可能花太长时间的 ,因为我在就还是那句话 ,在本地执行最大的局限性就是它会抢占你的屏幕 , 它在做你就不能动 。

曼祺31:01

所以你们和手机厂商合作的 , 首先它是不是云端的 , 它是用了本地的算力做出来的初跑吧 ?

刘潇31:07

对对对 , 它的模型还是在云端 ,但是就是这个应用操作是你本地的手机 。

曼祺31:11

明白 , 就是它是要占你的屏幕的 , 就是它在用的时候 , 你这个人你自己就不能动 。

刘潇31:16

你只能看着 。

曼祺31:17

明白 , 所以相当于你们现在和手机合作的还是你们去年 10 月份那会儿推出来的那个形态 。

刘潇31:22

对 , 那个形态 。

曼祺31:23

然后你们 To C 这个是已经到就是 。

刘潇31:25

一个新的 。

曼祺31:26

有一个虚拟手机的这种形态了 。

刘潇31:28

对对对 , 事实上我觉得其实这种形态也是可以之后随着它逐渐成熟 ,也可以去做一些更多合作 , 比如说打个比方 ,在我设想当中, 像现在很多 AI 硬件 , 包括我们的各种智能家居 ,其实你说他们不需要一个手机级的能力吗 ?

或者他们不需要一个系统级的 , 比如说打个比方 , 冰箱没可乐 , 它能不能自己给自己补货呀 , 对吧 ? 然后比如说打个比方 , 你戴着智能 AI 眼镜的时候 , 它能不能看到一个漂亮的一个衣服 , 然后它就能够直接说你帮我去淘宝找个同款 , 然后帮我 。

曼祺31:57

这个挺好用的 。

刘潇31:57

对 , 帮我下单 , 对吧 ? 就类似这种 , 就是这种 ,其实这些场景我觉得是一些非常好的这样一些场景 。

然后但是受制于以前的这种端侧的算力 , 还有再怎么努力也不可能把一块手机真的绑到你的眼镜上, 对吧 ?

那么但是其实大家都希望在自己的穿戴设备上, 或者说智能家居里面 , 或者各种各样的终端上去使用这样的一些更加丰富的移动互联网的能力 。

这件事情其实是我们希望通过 AutoGLM, 我们现在的一些开发者计划 , 然后以及我们的一些之后后续的商业化合作 , 我们希望来赋能这样的各种各样的应用 , 然后真正让 Agent 去连接我们用户身边的一切的这些终端 , 还有这种设备 , 然后真的去不只是说在停留在一个网页对话框里面 , 我只能打开电脑 , 打开网页 , 然后敲一个话 , 它才会开始干活 ,而是它

不处不在 , 它在我的身边 , 能够帮我在任何地方我都能把它唤起来 , 帮我做我想要做的事情 , 这个才是我理想中的 AI。

曼祺32:51

你觉得为什么是智谱有可能做成这件事 , 或者说是比如说智谱这一类大模型的创业公司有可能做成这件事 ,而不是华为或者小米去做这件事 ?

他们本来就有很多各种设备 。

刘潇33:02

我觉得他们当然也可以做 , 我从来没有觉得说只有我们能做这件事情 , 我觉得 。 只是说我们可能在这个事情上我们会更关心算法 , 然后更关心 AGI 这件事情 ,因为这是我们公司的目标 , 然后我们相信如果真的你想要达到那一天 ,并不是通过简单的工程堆砌能够完成的 , 它一定是需要算法的内核来驱动 。

我们是真的有一个更聪明的大脑 , 然后我们有一个真正的不仅仅是懂得做题 ,不仅仅是懂得写一点网页 , 然后它是真的理解我们各种物理世界的接口 , 理解各种应用 , 理解各种 Web page 怎么去使用 , 各种网站使用方法 ,并且甚至也是了解每个用户自己的习惯 , 还有我的偏好 ,以及我的工作的内容 , 只有一个一方面又很有广度的去连接一切 , 然后另一

方面又很有深度 , 它的智慧也是非常高的这样的一个模型 , 或者说一个这样的智能的系统 , 我认为我们才能真正达到那一天 。

曼祺33:55

你们有想过自己做硬件吗 ?

刘潇33:57

设想过 ,但是不是我们现在的 。

曼祺33:59

不是重点 。

刘潇34:00

不是重点 , 所以我们没有去考虑这个问题 。 畅想过吧 。

曼祺34:04

畅想过 , 畅想过 , 你在什么场合畅想过 ? 自己上还是说公司 ?

刘潇34:09

就吃完饭大家吹牛逼的时候畅想过 。

曼祺34:12

OK, 你们对未来的竞争态势是怎么去想的呀 ? 有可能这个领域的竞争会挺激烈的 , 我觉得有很多不同角度的厂商都有可能往这个方向走 。

刘潇34:23

对 , 我其实觉得这是一个非常好的事情 , 事实上包括我们为什么愿意在这个阶段把这样的一个其实我们觉得还有非常多打磨空间的这样的一个产品放出来 , 让大家来用 ,其实因为我们觉得就是任何东西它都不是说完全准备好了 , 然后市场就会立刻接纳你的东西 。

就像 iPhone, 它也不是说 iPhone 1 一出来大家就全部都就位置着迷 , 然后立刻就开始用起来 。 从 iPhone 1 到真正 iPhone 4 被大家广泛接受 , 中间也经历了三年的这样一个版本的这样一个迭代嘛 。

所以说我是觉得 Agent 这个事情就像我刚才讲的 , 从我身边圈外的朋友们的这个感受来看 , 对相当多 , 或者说甚至对我觉得这个世界上 99% 的人来说 , 这个概念都还是一个非常抽象的概念 。Chatbot 多少可能 10%、20% 的人接触过 ,但是 Agent 我觉得可能真的不完全 1% 或者千分之一的人才真正上手用过这个东西 。

它是存在一个巨大的教育市场的这样的一个过程的 , 就教育 , 包括教育用户 , 让用户能够理解说原来我以后需要这样使用 AI,有这样一种 AI, 然后它是这样来 work 的 , 然后它能够给我带来远远超出我原本想象的价值 。

这件事情我觉得它其实绝对也不只是说我们团队 , 或者说智谱能够一个人能搞定的 ,也甚至不是说 OpenAI 或者 Anthropic 自己能够一己之做的 。

我觉得这个事情是有在这个过程当中, 所有从硬件到软件 , 再到算法 , 再到模型厂商 , 大家在这过程中都因为这个蛋糕变大了而获得好处 , 那我们才能一起把这么多方案给串联起来 , 然后真正的去使得我们的这个信息革命迈向下一个阶段 。

所以我是非常欢迎大家一起来在这个领域一起努力的 , 我觉得只有这样我们才能真的把这个事情做成 ,而不只是一个就是现阶段一个偏 demo 性质 , 或者很多人的 Agent 现在都是个 demo 性质的东西 。

我觉得这个事情是非常在我看来是对整个行业非常重要的一件事情 。

曼祺36:10

你觉得下半年能做到你们类似程度的厂商还会有谁啊 ? 而且有可能会发出来的 , 会有产品发出来的 ,因为肯定这个方向我觉得大家多多少少会看到 。

刘潇36:19

其实我主要是我也不太了解 ,因为我也不是其他公司的人嘛 。

曼祺36:24

那你们有什么行业信息吗 ?

刘潇36:26

我比较肯定的是像 OpenAI 肯定是在做这样的事情的嘛 。 对 , 大家也看到其实像 OpenAI 作为模型厂商 ,他们也推出他们的 ChatGPT Agent, 对吧 ?

曼祺36:36

目前是 Web 端 。

刘潇36:37

对对 , 目前是 Web 端的 。 对 , 然后至少但可以肯定是在电脑端肯定大家还会继续激烈的去竞争做这样的一些相关的事情 。

然后手机端我也不太了解 , 然后但是我觉得肯定大家很多人会对这个事情比较感兴趣 , 非常欢迎大家一起来做这个事情吧 。

曼祺36:50

我觉得字节这些肯定是会想做的 , 可能就是说他发的时间是在一个什么时机 。

刘潇36:55

对对 , 我们也非常希望字节也能给大家带来一些更多的参考和灵感 。

曼祺37:01

就是看看他是怎么一个做法是吗 ?

刘潇37:03

对对对 ,因为这个事情我觉得就还是那句话 , 我觉得它是一个必然的未来 ,但是就像强化学习一样 , 知道最终会有奖励 ,但是到底要通过什么方法才拿到这个奖励 , 这件事情其实是一个很痛苦的过程 。

我觉得是需要投入 , 需要大家一起来发挥聪明才智来努力才能解决的 。

Agent 起源37:17

曼祺37:18

这把 Agent 这种能力从 Web 端然后拿到移动端 , 会带来更广泛的人群扩散和渗透 , 我觉得这是一个挺显而易见的思路吧 。

刘潇37:27

对对对 。

曼祺37:27

但是为什么好像实际上目前做到的人并不多 , 就它之前是卡在哪 ? 这个也是想聊一聊 , 就是你们的这个过程是怎样的 ,因为其实你们从内测到现在真的就是敢开放给所有人用 , 这中间也有 10 个月的时间 , 对吧 ?

从去年 10 月到现在 8 月 。

刘潇37:43

对对对 。

曼祺37:44

它也是一个很漫长的过程 , 中间是比如说哪些地方会比较难导致之前一直不能是一个直接给大家去用的这种移动端的 Agent 的状态 ?

刘潇37:53

我觉得首先肯定还是算法上的问题会比较大 。 你想想算法上和模型上的能力 ,其实在去年只能说是完成一些短距离的任务 , 或者说完成一些单应用的任务呢 , 还能相对比较稳定的完成 。

但是一旦要跨应用 , 或者说涉及到一些更复杂的意图理解 , 或者说多轮的任务发起 , 这件事情其实在去年模型层面是很难去有有效的方法来做这件事情的 。

但是今年以来的话呢 , 你像强化学习的发展 , 包括端到端强化学习 , 尤其是端到端在线强化学习的发展 ,在这个过程当中我们也付出了非常大的努力在探索说我们要怎么通过端到端的在线强化学习 , 加上这种大规模的这种容器化的这种环境的这种仿真 , 然后来让模型真的学习 , 就是像人类一样 , 像人类探索应用和探索设备的

方式去学习使用电脑 、 使用手机 、 使用浏览器 , 通过这种方式我们才在算法上做好了准备 。

曼祺38:42

可以完整讲一下这个过程 , 就比如说在智谱 , 你们最开始怎么关注到 Agent 的这个方向的 , 然后你们最开始做了什么 , 后来又做了什么 ?

刘潇38:49

其实最早就像我一开始的时候介绍那样 ,在 23 年 3 月之前 ,其实我自己的重心一直像之前的 GLM 130B, 然后还有像这个 ChatGLM 的前几代版本 ,其实我都是比较主要的算法研发人员之一 , 然后当时我的整个重心是在预训练和后对齐的训练上的 。

但是呢 , 当 GPT-4 在 23 年 3 月份几乎跟我们 ChatGLM 是前后脚发布的 , 我原本对语言模型理解是它只能去说话 , 它只能够写文章 。

但是从我试用到 GPT-4 开始 , 我就意识到它在完全当时没有人关心 Agent 任务的情况下, 它就能够去比如说去 Reddit 上面去帮我搜一个帖子 , 然后它能去 Amazon 上帮我去筛选一个特定分类的商品 。

虽然成功率并不是很高 , 可能只有一半一半这样的情况 ,但是我就意识到语言模型终将跳出网页对话框 , 从简单的文字变成在现实世界采取行动 。

从那个时候开始 , 我个人的研究的这样一个兴趣和重心就完全转到了这个智能体方向上 。

曼祺39:47

就可能对一般人来说 , 当时那个 GPT-4 出来的时候 , 会感觉就好像就是在大语言模型上加了个搜索 , 就为什么在你看来那会是一个还挺大的变化 。

刘潇39:55

比如说之前我们做很多工作 , 它可能都是单步的去完成的 , 比如说我说我要你帮我写篇文章 , 好 , 你就给我写就好了 , 它可能会写很长 ,但是无论如何它都只是用一个所谓的 single step 或者 single turn 的方式去完成的 。

但是网络世界和真实世界它是不断动态变化的 , 你像 Reddit 上的帖子 , 它首页长的内容每次都会刷新 , 对吧 ?

它每次打开它都给你推一些不同的帖子 , 你这周它是这个 UI, 下周它 UI 就改了 。 但是呢 ,在这过程中我们发现模型体现出了一种非常出色的能力 , 就是它能够动态的根据环境给它的观察和反馈来动态的决策下一步要怎么做 。

比如说今天 Reddit 它的搜索框的像素是这个 , 然后明天我把我浏览器拖大了一点 , 它的位置就变了 ,但是没有关系 , 我们发现模型它还是知道要找到那个元素 , 然后它不会因为多了一些元素或少了一些元素干扰它的这个决策 , 它是能够在混乱当中找到那个确定性 , 然后去完成这样的一个动作 。

而且不只是完成一次 ,因为这个任务你要去搜索 , 你至少要做个四五步 、 五六步 , 它能够以一个相当出色的这样的一个思考的过程和最终决策的动作去完成这件事情 。

那这个里面最重要最重要的一个事情就是 , 它一定是一个多步交互的一个决策过程 。 比如说像传统我们也有像这种什么 RPA, 它就是我预设好了它就在那个位置 , 所以我就点它 , 动态性是比较弱的这样一个能力 。

但是模型它真正具备了 , 它甚至是一种很自发的方式 , 就是在当时都没有什么人关注 Agent 的情况下, 它就能够很好的去根据观察到的动态变化的环境来调整自己的决策 , 比如说远处的位置从这变到这了 , 哎 , 没关系 , 我知道 。

曼祺41:29

那是因为 GPT-4 那会它就可以读网页吗 ?

刘潇41:32

肯定是通过工程的方式 , 比如通过 playwright, 然后让它能够把网页的 HTML 信息抓回来 。

曼祺41:37

它读的还是文字信息还是 ?

刘潇41:39

也有截图 , 当时 GPT-4 不是也有图片能力吗 ? 它是截图和 HTML 相当于共同去做的这样一个阅读 , 然后它能够最后定位到说是哪个位置的元素 。

而且有个时候它点错了 , 没关系 , 它自己知道要退回来 。 当然这种成功率当年不是很高 , 当现在通过强化学习 , 你已经能让这种试错的能力变得非常非常的这个显著了 。

曼祺41:59

在 GPT-4 刚发布的时候 , 你看到它有这样一种能力 , 你当时对这个事是怎么实现的 ? 你是怎么理解的 ?

刘潇42:04

我觉得是模型自己泛化出来的 。

曼祺42:06

你觉得是模型就是靠参数变大自己涌现的 ?

刘潇42:09

对 , 模型自己泛化出来的 。 它可能在网上它学习了一些步骤类的信息 , 然后比如说会有什么那种什么 , 比如说 Wiki,有个叫 WikiHow 的网站 , 它就是教你做各种事情 , 对吧 ?

类似于 。

曼祺42:19

百度也有很多这种东西 。

刘潇42:20

百度经验 , 对吧 ? 对对 , 就类似于这种东西 ,因为它就是广泛的去学习人类互联网嘛 , 然后你互联网上什么东西都有 ,但是这种信息 , 这种步骤类操作类的信息可能比较少 ,但是它随着参数变大 , 它能记住的细节越来越多 , 然后它 somehow 就把这个事情给理解了 ,并且通过它掌握的其他知识泛化了这种能力 , 比如说我要怎么去搜索这个事情

曼祺42:40

那你有了这个想法之后, 这个后来验证了吗 ? 你们自己是不是可以通过做实验来验证这个 ?

刘潇42:44

对对对 , 那肯定是的 。 当时大家通过这种简单的调用 API 的方式 , 我们只是去验证了一下说 OK, 它能做这件事 ,但我们其实包括整个学界当时大家也都并不知道说这件事情到底大模型多大程度上能做这件事情 , 就是没有一个量化的结论说比如说它现在能 40% 的准确率去做这个事情 。

当时完全 。

曼祺43:04

就也没有 benchmark 呢 ?

刘潇43:05

没有 benchmark 来做这件事情 。 所以我们当时做的第一件事情就是从 23 年的 4 月到 8 月这四个月时间 , 我就带着团队的小伙伴们 , 当时主要都是算法同学 , 然后一起做了这个叫 Agent Bench, 这个应该是全球第一个这个全面的这个大模型智能体评估的这样的一个基准 。

然后在当时我们就设计了 8 个动态的环境 , 然后来评估模型去完成这些任务准确率 。 然后我们当时就发现真正训得好的模型 , 它已经其实在这些任务上的表现已经相当可观了 , 就是比如说至少不是 0 分了 , 它能够有个三四十 , 甚至是就是只是通过 prompting 的方式就能有个三四十的准确率 ,其实还是非常 impressive。

曼祺43:41

当时表现最好的是谁啊 ?

刘潇43:42

当时表现最好就是 GPT-4。

曼祺43:43

就是 GPT-4。

刘潇43:44

对对 , 然后而且当时我们观察到一个特点就是 ,其实在当时那个时间点就已经有很多模型 , 特别是开源模型会 claim 自己的 performance 跟 GPT 什么 ChatGPT 一样 。

对 ,但是坦率说在我们 Agent Bench 上, 你可以去看我们当时测出来的结果 , 即使是最好的几百亿参数的模型 , 都打不过最差的 Google 当时的 TextBison 002 那个模型 , 就是 001 吧 , 应该是 002.01, 我记不得了 。

对 ,但是最差的模型都打不过 , 就是最好的开源模型打不过最差的开源模型 。

曼祺44:13

闭源 。

刘潇44:14

闭源模型 , 对对 。 所以说你就会发现 , 所以当时这也是让我们就是我们就意识到真正要实现 AGI, 我们是需要真的是需要从预训练到 post training 到算法 , 真的像一个 big team, 像用一种重工业的方式来做大模型 , 你才能够真的去做出一个泛化的 , 然后并且让大家能够真正即插即用的这样的一个东西 。

曼祺44:35

那我也比较好奇 , 就是你们智谱怎么开始一个新项目的过程 ,因为你说在那之前 , 你的主要的工作是在做智谱本身的基础模型的预训练 。

刘潇44:43

对对对 。

曼祺44:44

那你后来跑来去做这个 Agent 的 Bench, 那你岂不是这个精力就分到别的事上了 ?

刘潇44:48

对 , 所以后面我在这个一开始这个其实是一个纯粹的算法上的研究 ,因为在智谱内部我们也是非常鼓励大家去做一些算法上的探索 ,因为我们觉得你要实现 AGI 的话 , 你算法上的问题还非常非常多 。

曼祺45:00

就说在那四个月里 , 你主要的工作还是在做预训练 。

刘潇45:02

对对对 。

曼祺45:02

那么这个工作是你的自由前期的工作 。

刘潇45:05

自由前期的工作 , 对对对 。 但是做完这个工作之后, 我自己的重心基本上就完全从基础模型的训练 , 基本上大头的精力就都转移到做 Agent 相关的这个问题上来了 。

曼祺45:17

这个东西是需要谁来同意了 ? 就是在组织结构上, 比如是你这个事是要跟张鹏说一下, 然后张鹏说好 , 可以 , 你不用在那个时间 。

刘潇45:25

对 , 肯定内部我们会需要有一些集体的讨论 , 包括因为大家内部也会有一些分工嘛 , 所以说肯定也是我们一方面是有 AI 院的这个 leader, 然后另一方面也是大家各个方向的同学 , 我们一起讨论之后决定说那这个事情就由你来搞定了 , 那你就来去研究这个事情吧 , 然后我就来研究这个事情了 。

曼祺45:43

就是在那之前你是不带团队的 ?

刘潇45:45

在那之前其实我们规模很小了 。

曼祺45:47

OK, 对对对 。

刘潇45:48

因为那个 23 年 。

曼祺45:49

对 ,23 年 。

刘潇45:49

那时候还没什么人呢 。 对 , 然后但是从那个时候开始 , 可能就会带一些实习的同学啊 , 然后也会有一些全职的同学 ,但是数量还很少 ,也就是几个人的水平 , 然后先来开开荒 , 看看这个这条路要怎么走 。

曼祺46:03

你就说从 23 年 8 月的时候开始 。

刘潇46:04

对对对 。

曼祺46:05

相当于那会你就是这个小 team 的一个负责人。

刘潇46:08

对对对 , 然后再看这个事情要怎么做吧 。

曼祺46:11

你现在管多少人啊 ?

刘潇46:12

我现在可能有个几十个人吧 。

曼祺46:14

因为你很年轻嘛 , 你是 99 年的 。

刘潇46:15

嗯 , 对对 。

曼祺46:16

你现在团队里的人也是都这样年轻 , 都非常年轻 , 还是也会有一些资深一些的了 ?

刘潇46:21

有资深的同事 , 肯定也会有年轻的同事 ,有比我大的 ,有比我小的 。

曼祺46:25

就是需要你来带一个 team 的时候 , 你会对这个事有点疑虑或者说 。

刘潇46:30

哦 , 那可疑虑了 。

曼祺46:31

哈哈哈 。

刘潇46:32

那能不疑虑嘛 。 对 ,但是我觉得这也是一个由小到大的过程吧 , 就是一开始比如说这个方向 , 一开始大家也不确定能不能做好 , 那肯定一开始就是几个人你先摸一摸喽 。

我觉得像很多 AI 公司基本上可能都是这样吧 , 就是出现了一个新的方向 , 大家也都不确定说该不该做 , 然后或者做了之后会不会有成果 , 那就先派一个先锋去开开路 , 然后看看这个事情好不好做 , 能不能大家对这事情感不感兴趣 ,有没有结果嘛 。

对 , 然后但是做着做着可能你会有些中间的 milestone, 你会拿一些 demo, 你会在一些搒单上取得一些出乎意料的结果的时候 , 大家也就会觉得说你这个东西可能确实有点意思啊 , 可以更支持你来做这件事情 , 然后当你取得一些更好的市场上反响 , 包括商业化的一些确定性能够被敲定下来的时候 , 那肯定公司就会给你有更多的产品和工程的人来支持你完成这件事情 。

曼祺47:20

就给更多资源 , 然后大家觉得这个方向是值得花更多精力去探索了 。

刘潇47:24

对对对 ,是的 。

数据构造47:25

曼祺47:25

你可以继续讲 , 就是你们 23 年 4 月到 8 月是做了这个 Bench。

刘潇47:29

对 , 然后 8 月之后其实就当我们 Benchmark 出去结果之后, 我们自己也很惊讶 , 然后并且我们也意识到我们真的要去对标国际的领先水平 , 我们需要做非常多的事情 。

虽然当时我们也已经初步做了一些优化 , 然后但是当时的开源模型当中, 我们当时的 ChatGLM 的系列的开源模型也已经是能够占到闭源模型的可能就是中游的这样的一个水平了 ,在 Agent 这个任务上 。

但是我们觉得还远远不够 ,而且实话说确实也没有能够达到 OpenAI GPT-4 的水平 , 还是差了不少的 , 这个可以坦白说 。

曼祺47:58

我想问一下当时国内的那个模型最好啊 ,在你们的 Bench。

刘潇48:01

当然是我们的模型最好 。

曼祺48:04

确实就是你们的最好 。

刘潇48:05

对对 ,在我们的事上面 ,因为就是我觉得就是很多事情确实就是就你没有关注到这件事情的话 , 你肯定就 。

曼祺48:12

没有往那个方向优化 。

刘潇48:13

对 , 你就不会往这方面去考虑这件事情啊 , 包括像你像现在像 GLM 4.5, 我们最近发 4.5, 为什么 Agent 能力很强 ,是因为我们现在大家都非常 , 大家上下都非常笃定说 Agent 是一个必须要完成的事情 。

所以说不只是说在 post training 阶段去做这件事情 , 我们甚至从预训练要开始做的第一天 , 我们就在准备说怎么在预训练阶段就让模型更擅长去做 Agent 的任务 。

所以这个事情是我是觉得是我们大家的一个共识 ,并且一起全公司上下所有 team 从模型到 application 到从 pre-training 到 post-training 都一起来努力的这样一个结果 。

曼祺48:46

对 , 你可以继续讲后面那个过程 。

刘潇48:48

对对对 ,是 。 然后我们 8 月完成 Agent Bench 之后, 当时就意识到这个问题了嘛 , 所以接下来就要开始探索怎么去优化这个事情 。

然后预训练当时完全反正还摸不着头脑 , 就是都没搞清楚 Agent 能力到底从哪 , 从预训练里面什么语料来的 , 反正也做了非常多实验 , 像什么 coding 啊 , 这些很多都做过 ,有些有效 ,有些没效 。

但是在当时看来 , 大家可能觉得短期内 , 包括当然像合成数据啊 , 这样的一些策略也都会去尝试 , 然后呢 ,但是短期内大家觉得特别是像合成数据这种路径 , 你自己没有一个好的 Agent, 你怎么合数据呢 , 你根本合不出来 。

所以说当时的想法是说 , 那可能还是得就像我们现在去谈所谓的 model as agent 这样一个概念 , 就是说为什么 model 能 as agent, 那是因为你先有了 Agent, 然后你 Agent 能力通过得到合成数据的方式慢慢向 model 迁移 ,model 它就它的预训练过程中, 它可能就 experience 了很多 , 它学习了很多 Agent 的数据 , 然后它就会了 。

对 ,因为 Agent 数据它在互联网中的比例还是非常非常低的 。

曼祺49:38

你的这个意思就是说我先用 AI 做了一个 Agent, 然后它这个东西在运行的时候有一些真实的数据 。

刘潇49:44

对对对 。

曼祺49:44

我再为一个模型去训练 。

刘潇49:46

对对对 ,是 。

曼祺49:47

那这岂不是鸡生蛋 , 蛋生鸡了 ?

刘潇49:49

是 , 我觉得现在 AI 的发展本质上就是这样 , 就是说我们不断的就是所谓的合成数据的策略嘛 , 就是说但是你中间会有个筛选的过程 , 肯定不是这个 Agent 肯定不是啥数据都做得好 , 你得选出里面做得好的数据 。

曼祺50:00

那最开始你们还没有这个 Agent 能力的时候 , 就相当于你无法获得这个合成的数据的时候 。

刘潇50:05

对 , 所以最开始 。

曼祺50:06

你的数据是怎么 ?

刘潇50:07

所以最开始是你需要让它模仿人类 , 对 , 你就需要所谓的冷启动的这样的一个阶段 , 就这个阶段 。 所以说你可以认为从 23 年的 8 月到 24 年初这段时间 , 我们当时重点是在一个叫 AutoWebGLM 的工作上, 然后你可以认为是 AutoGLM 的一个前身 。

对 , 就当时就是想先从浏览器这个场景 ,Browser Use 这个场景来下手 , 来看这件事情好不好做嘛 。 当时因为一开始确实这种数据特别少 , 就即使即使是 GPT-4, 它也就三四十的正确率 , 它不是很高 , 基本上没太难一点任务马上就歇菜 。

所以这个阶段你没有别的选择 , 你只能让 AI 先来模仿人类专家去浏览网页的这种动作 , 然后去说比如说如果让人去做一个什么事 , 比如让人去亚马逊上找一双红色的鞋 , 然后并且产地是哪的 , 这件事要怎么做 , 然后让人先做了之后, 让 AI 先模仿人类去做这些行为 。

曼祺50:57

就是人构造一些数据 。

刘潇50:58

对对对 , 就是让人去标注一些数据 。

曼祺51:00

这个过程中就我们刚才提到的什么 WikiHow 啊 , 百度经验的数据有用吗 ?

刘潇51:04

不是很有用 , 就是因为那都是静态的 , 就是或者说简单来说 , 人类语言是一些非常高度浓缩的原则性的东西 ,但是实际上在真实世界当中, 它的这个变化很多端 , 然后那么三两句指导性的话 , 人类能够 get 到 ,但是 AI 完全 get 不到要怎么去实际应用这些原则 。

所以你只能给它一些非常细粒度的比喻 。 我就告诉你就这一步 , 你就要点这个按钮 , 你也别管为啥 , 你反正先点了再说 , 你就先通过这种方式先让它去产生一种认知 , 就是说到底就是或者说简单说这里面存在一个所谓的 planning 和 execution 的矛盾 , 就是你刚才讲的那些像经验啊 ,WikiHow 啊这些 , 它其实是一种很 high level 的 planning。

我告诉你 , 反正第一步总得是搜索 , 第二步你要找到分类去点击它 ,但是具体要在哪搜索 , 搜索是怎么搜 , 对吧 , 你是点哪个按钮才能触发搜索 , 你的分类你要去哪展开才能找到你想要的分类 , 这件事情这些经验里面是不会有的 。

曼祺51:58

因为对人来说 , 你写到那个程度基本上是能找到的 。

刘潇52:00

对对对 ,但对于 AI 来说 , 它理解不够 , 所以说相当大一部分努力其实当时都是在执行层面 , 就是你怎么教会 AI 去准确的在一块屏幕上我给你一个截图 , 或者说给你一个 HTML 代码 , 然后你能找到那个 exactly, 屏幕那么大 , 你只要稍微点偏一点 , 点出那个区域了 , 你不就没法用了嘛 , 对吧 。

所以说这件事情一开始只能靠人类来教它 ,但人类教这种东西很麻烦 , 首先第一 , 人标这种数据不是很好标 , 对吧 ,也没有现成的工具可以标 , 然后另一方面的话 , 就是它实际训练的 , 它数据量要求就是肯定也还是比较大 ,而且对多样性要求也比较高 , 那你怎么去构建这种高质量的 、 又多样的人类标注数据 , 对吧 。

那么这个事情其实从实践上来说是非常困难的一件事情 。 那这个就可以参考我们的论文了 。

曼祺52:47

你们论文你写得够详细吗 ?

刘潇52:49

我们写得可详细了 。 对 , 我们采用了一种这种半自动和自动化融合的方式吧 , 就是我们会有一些数据是通过 AI 方式反向合成的 , 然后有一些是让 AI 和人交替 , 然后或者说 AI 辅助人来 , 比如 AI 给出一些候选点 , 然后人就只要做选择题了 。

曼祺53:05

我设想中你们应该是要自己开发一个系统去提高这个标的效率和产量 。

刘潇53:09

对对对 , 肯定是要有的 。 所以这个事情就是一个很 heavy 的事情 , 它就不是一个很简单说你就能够做到的事情 。

曼祺53:17

像你们就是在智谱啊 , 做这些工具链的人 ,是算法的人自己就顺手干了 , 还是有专门的人在做这些 ?

刘潇53:23

那一开始当然只能自己干 , 然后一开始我都写过标注系统了 。 就是因为主要是不做算法的人, 你又怎么知道模型需要什么样的数据呢 。

所以一开始都是算法的人自己来 , 又管工程上的事情 , 又做算法上的事情 , 只有你先验证完之后才会有工程师来协助你去 scale up 这个事情嘛 。

所以它其实都是一个从原型到成熟的工具链的这样一个过程 。

离线强化学习53:44

曼祺53:45

对 , 你可以继续说 , 就是你们最开始做那个 AutoWebGLM 的时候 。

刘潇53:48

对对对 , 然后当时也用了一些强化学习的策略 ,但是就是用的比较简单 , 可能就是 DPO 啊 , 然后或者说就是一些偏离线的强化学习策略 ,不是在线的这些策略 。

当时其实结果已经很 impressive 了 , 当时我们应该是第一个模型 , 就是基于开源模型做的模型 , 它能够几乎所有的当时任务上就已经超过 GPT-4 的这个 prompting 在这些网页浏览上的这样的一些表现了 。

曼祺54:11

你说的超过是指在你们自己构造的这个 Bench 上超过 ?

刘潇54:15

有我们自己的 Bench,也有一些 public Benchmark, 像 Min2Web, 然后还有像 MiniWeb。

曼祺54:19

所以到 24 年初的时候就已经有一些各种各样的这个跟 Agent 相关的 Benchmark 在出来了 。

刘潇54:25

对对对 , 就是差不多 23 年下半年就陆陆续续出现了一些比较早期的 Agent 的 Benchmark。

曼祺54:30

你们当时的强化学习是在后训练阶段做的吗 ?

刘潇54:32

对 , 就是后训练阶段 。 强化学习基本上目前还是主要后训练为主吧 ,但现在大家也会谈说 pre-training 的强化学习和 mid-training 强化学习 , 当然这个就比较我觉得现在还没有形成一个共识吧 , 就现在都是大家都在做一些初步的探索 。

曼祺54:44

但你们现在强化学习是在预训练阶段就做了是吗 ?

刘潇54:47

现阶段预训练阶段还是暂时没有涉及到的 , 主要还是在 mid-training 和 post-training 阶段会用到 。 我先接着说吧 。 所以当时我们发现其实表现已经挺出乎意料 , 就说明我们通过好的这种 data collection 以及一些离线的 offline 的 RL 的方法 , 它已经能够至少比 prompting 的 GPT-4 的效果表现好 。

曼祺55:04

对 , 你可以解释一下在线的强化学习和离线的强化学习的区别 。

刘潇55:08

在线强化学习的意思就是在于你是一边做我一边教你 ,而离线强化学习是你全部做完了 , 然后我在一些标准的这种 , 比如说打个比方像 behavior cloning, 它其实像行为克隆 , 它就是一个典型的 offline 的强化学习的这样一种策略 。

然后它就是说我这个数据已经是死的了 ,是个静态的了 , 它不会随着环境的变化而变化了 ,但在线的话就是我每次给你的环境都不一样 , 然后它会不断的变 ,而且你可以不断的在这过程当中自己产生出新的数据 ,而不是一个固定的数据集 。

这个就是 offline 和 online 的差别 。 就这种 offline 方法本质上就是说只是说我们更好的教会模型去 fit 人类的轨迹 。

比如说为什么需要 RL 来 fit 这件事情呢 , 本质上是因为比如说我们人类在操作一个东西的过程当中, 它每个步骤的重要性肯定是不一样的 , 对吧 。

有的步骤可能你就是比如你要不要滚动一下你的滚轮 , 这件事情其实意义可能没有那么显著 ,但是如果你只是通过 SFT 的方式去学习它的话 , 那你其实是在所有的步骤上都是给了相同的权重去学习 , 那这显然不对 , 对吧 。

有的步骤会更重要 ,有的步骤会更不重要 , 那你需要去有个动态的权重 , 那你怎么 learn 这个动态的权重 , 那这个其实就是所谓的 offline reinforcement learning 解决的问题 , 就是我要更好的所谓因为专业术语就是 advantage, 你怎么去估计一个每个步骤的 advantage, 然后并且是一个动态的权重 。

那么这个事情你需要下 offline RL 的策略来做这件事情 。 但是呢 , 这件事情你做得再好 , 本质上你都只是让 AI 在模仿人类行为 ,在模仿过程当中它对的也学了 , 它错的也学了 , 你没有以结果的方式去监督它 。

这就导致一件事情就是虽然当时在很多 Benchmark 上我们的表现已经比 GPT-4 好了 ,但是呢 , 唯独在有个 Benchmark 上虽然也比 GPT-4 好 , 远逊于人类 , 然后这个 Benchmark 就是 Weberina 这个 Benchmark。

然后这个 Benchmark 它最大的特点就是刚才讲的 Min2Web 啊 , 还有 MiniWeb 啊 , 还有我们自己内部构建的 Benchmark 都是静态的 Benchmark, 就是说都是有人类轨迹 , 然后我本质上是比较的 AI 的预测和人类轨迹的 。

曼祺56:57

接近性 。

刘潇56:57

是接近性有多高 ,但是呢 , 我并不是以它最终是不是如果我不给它轨迹 , 它就自己去做 , 它最终做出来是不是做对了 。

我不是以这个结果为导向的方式来评估它 。

曼祺57:06

所以是评估的过程是否相似 , 步骤是否相似 ,而不是结果成功与否 。

刘潇57:10

对对对 , 所以这种评估方式就问题很大 。 你都可以想象说一个人能够跟你工作方式很相像 , 对 , 一定能取得跟你一样的工作成果吗 ?

曼祺57:17

对 ,他可能每一步就是差一点 。

刘潇57:18

都差一点 , 最后就差很多 。 对对 , 最后就差很多嘛 。 所以说我们就发现在真正的以结果为导向的评估上来看的话 , 就是表现跟人类相比的表现会差很多 。

曼祺57:28

Web Arena 是怎么测这个事情的 ?

刘潇57:29

对 ,Web Arena 它就很有意思 , 它就是把一些网站直接做成镜像 , 可以离线部署在你的服务器里面 , 然后呢 , 比如说打个比方 , 像我刚才举的例子说 , 它让你去一个购物网站上去选一双红色的鞋 , 它评估方式并不是看你是不是每一步都像人类一样去操作 ,因为做这件事情有很多步骤 , 你可以直接搜 , 你也可以去打开鞋的这个分类 , 然后去里面

挑一双红色的鞋 , 对吧 , 这两个都能成功 。 它的评估方式很简单 , 它就最后检测你在下单的订单 、 已支付订单里面是不是有一双红色的鞋 , 它就是完全以这种方式来评估你 ,而不是你中间的步骤来评估你 。

曼祺58:00

对 , 这个其实是跟人的使用的直觉是最像的 。

刘潇58:03

对对对 。

曼祺58:04

最后用户其实肯定还是要用这个来评判嘛 。

刘潇58:06

对对对 , 所以说这个事情其实就有点像 A/B test 的感觉 , 就是说我也不管你中间是怎么搞的 , 反正我就看你最终结果有没有达到我的预期 。

曼祺58:14

所以当时在这个评测上, 就是模型都是和人差很多的 。

刘潇58:17

对 , 和人差非常多 , 可能当时模型就基本上都是 20 分左右 , 人可能是七八十分的水平 。 所以说我们就当时就意识到一件事情 ,在去年大概四五月份的时候 , 我们就意识到我们必须得在在线的环境当中用在线的方式训练 Agent,因为其实如果你看那些离线的数据集 , 你会发现即使是我们人类在面对一个陌生的网站的时候 , 它的单步正确率可能

也到不了 100。

曼祺58:38

你知道就我最抓狂的一个场景是什么吗 ? 就我经常苹果出了些问题 , 我就跑去苹果官网上看那个步骤 , 它那个步骤写得很烂很烂 , 就是你经常按照苹果的步骤就是操作不出来那个东西 。

刘潇58:48

对 , 你就得反复左右横跳 , 然后做很多尝试 。 就是所以说你就会发现即使是很甚至很专业的人类在做一些事情的时候 , 你也不能保证它每一步都不出错 , 对吧 , 你出个 typo 那也算错了 。

但是人类为什么最终基本上还是能顺利的完成我们生活中各种任务呢 ,因为我们人类有很好的纠错能力 , 我做错了 , 我会自己发现我做错了 , 然后我会回退 , 然后我再去尝试其他的 solution, 直到我找到一种比较好的解决方式 。

但是如果只是在人类专家轨迹上学习的话呢 , 它不但学了人类对的行为 , 它也学了人类错的行为 , 所以它会一错再错 , 然后它就很难 ,因为你没有给它机会让它犯错之后自己纠正自己 , 或者说给它信号告诉它你错了 , 你这个时候换一个别的方式 , 你没有给它试错的机会 , 你要么永远让它在对的上面学 , 要么永远在让它在错的上面学 , 你

没有给它一个中间态的去探索的选择 。

曼祺59:33

没法把错的数据给它不行吗 ?

刘潇59:34

那它就会认为自己做的每一步它就会高度 confident, 它会认为因为我历史上见过我做的所有步骤都是对的 , 所以说我做错了也是对的 。

曼祺59:41

就是本来就是训练的时候就是要给正反例 。

刘潇59:43

对对对 , 训练的时候本来就是要给正反例 ,但是就很难 。

曼祺59:45

但它也可能会借助一些反例 , 然后它会弄混 。

刘潇59:49

对对对 , 它会弄混 。 对对对 , 所以就是你既不能只让它见对的 , 就是打个比方 , 一个人如果你只让他跟好人相处 , 从来不让他见坏人, 它以后就分辨不了好人和坏人, 它以后认为所有人都是好人。

曼祺1:00:00

其实我觉得强化学习这个东西很有意思的一点就是 , 它有一些在哲学或者说做人的道理上的迁移性 。

刘潇1:00:07

对 ,因为其实像我们人类 , 你可以理解我们人类本质上也是一种智能体 , 只不过我们是在地球这么漫长的演化当中 ,在地球这个高度复杂的环境当中, 我们先被付出了很多生命 , 就是做强化学习失败了 。

曼祺1:00:19

对 , 我之前今年早些的时候去访谈那个马诣老师 , 她说其实以前就是从这个单细胞生物到就可能智能生物出现之前 , 你这样靠物竞天择在环境里面 DNA 的进化就是一种强化学习 。

刘潇1:00:32

对对对 ,是 , 我觉得进化本质上就是一种很强化的一种东西 , 我们人类其实也是付出了很多代价的 ,在历史上才慢慢走到今天的 。

对 , 所以说对 Agent 来说 , 如果你不经过这个步骤 , 我也很难想象它真的能够像我们人类一样去搞定一些复杂的问题 。

对 , 所以说就在线强化学习这件事情就变得非常非常的重要 。 然后当时我们在探索这件事情的时候 ,其实当时在去年下半年的时候 ,其实像 OpenAI 的 o1, 然后还有包括像 DeepSeek 就出来了 ,其实大家就发现说即使对于推理类的任务 , 你也因为当时一开始大家有一种信念说我是不是应该用什么过程监督 , 然后去教模型一步步像人类一样做 ,但其实你

现在看来就跟 Agent 这个事情一样 , 这是不对的 ,因为模型它就是会 , 人也会犯错 , 模型也会犯错 , 你不能试图强制要求它每一步都是做得对的 。

应该教会 Agent 和包括教会人类也是一样 , 就是你应该教会它犯错了之后怎么改正 ,而不是让它永远不犯错 。

曼祺1:01:23

所以 o1 和 Deep Research 的启发是 , 就是在推理任务上也是可以用强化学习来做的 。

刘潇1:01:28

对对对 , 就是在单步的这种像数学代码这种封闭域的任务 ,但它跟 Agent 任务最大的区别在于 Agent 像我说它是个天然多步的这样的一个任务 , 它的决策比如说像数学 , 那些定理那些公理都是很亘古不变的 , 它不会说今天这个样明天那个样 , 对吧 , 数学这个东西教你学会了它就是那样 。

然后 coding 也是 , 这编译器 , 这个版本的编译器 , 它就是会固定写成这个样子的语法 , 它就会抛一些什么样的错误 。

说白了就是很多数学性的东西和代码性的东西 , 你可以很容易自己看出来做没做对 ,但是对于 Agent, 它在一个复杂的真实环境当中, 比如说打个比方 , 你把你丢到一个你从来没见过的网站上, 让你去干一件事 , 那你哪知道要点哪个按钮进去呢 , 你肯定得先点开看一看 , 然后看一眼说嗯 , 你得达到那个真实的点开的页面之后你才知道说我靠

我这是对了还是错了 。

曼祺1:02:13

我有一个理解 ,不知道对不对啊 , 就是因为我觉得强化学习好像本来就比较适合去解决这种封闭规则的问题吧 , 比如最开始下围棋 , 它其实就是个封闭规则的问题 。

刘潇1:02:21

对对对 。

曼祺1:02:21

所以用强化学习去做代码和数学 ,不是一个更理所当然的想法吗 ?

刘潇1:02:25

是 ,但当时大家没想好要怎么做嘛 , 大家没想好是要用结果的方式直接来监督它 ,因为当时大家都觉得这种方式信号会很稀疏 ,而且当时都觉得说不应该推理什么几十 K 以上的 token, 大家都觉得你应该很简练优雅的像我们教和书上的定理那样干净利落的证明出来 ,而不是涂涂改改 , 然后试一下然后又再退回去 。

就大家一开始会有这种可能有些错误的估计 ,但其实当时很多人也已经意识到这件事情了 ,其实我觉得这件事情大家迟早会收敛到这件事情上去 , 看谁先把这事情做出来而已 。

所以说 o1 先把这事情试出来之后, 然后 DeepSeek 最早把这事情公布出来了 , 大家就立刻 get 到说 OK, 那这件事情本质是什么 。

曼祺1:03:00

它本质是 ?

刘潇1:03:01

本质上就是说你需要用结果来 supervise 这个模型 ,而不是通过过程来 supervise 这个模型 。

曼祺1:03:07

然后这件事是你们之前在做 Agent 训练的时候 ,其实你们已经意识到 , 你们就是用结果来 。

刘潇1:03:12

对对对 , 然后只是在 Agent 上这个事情会更困难一些 ,因为它不是一个封闭域的任务 , 所以说它没有现成的数学规则或者编译器可以供它使用 , 它只能在真实的环境里面去 , 比如说真实的电脑上跑了 , 跑了一遍之后它才知道实际上长啥样 , 对吧 , 然后或者说它只能在真实的网页上跑了一遍之后, 你才知道它到底做得对还是不对 。

所以说这件事情就导致它的工程门槛和它的算法上的这种多步优化的难度要远远大于单步的推理的这样那些 , 无论是工程上还是算法上的挑战 。

曼祺1:03:42

所以就这件事做到什么程度 , 可能是大家什么时候推出 , 就是在网页和手机上去运行的 Agent 的时间点的区别 。

刘潇1:03:50

对对对 , 我觉得是的 , 这个事情其实以及你下多大决心要做这件事情 , 就是你有多相信这件事情必须是 AGI 路上必须要解决的问题吧 , 当然它也有很多难点 , 就是说不一定是谁都能解决这些问题的 。

环境与激励1:04:02

曼祺1:04:03

你觉得这个事的关键是什么呀 ? 其实你早上演讲里提到两个 , 就是你说任何一个东西如果你能构建一个环境 , 然后你能构建一个合适的激励 , 就是 environment 和 reward,其实你都是可以用强化学习给它解决到一定程度的 , 就让它效果到比较好的状态 。

刘潇1:04:17

对对对 ,是的 , 所以其实说白了我觉得核心就其实还是我说的 。

曼祺1:04:21

就是这两个 。

刘潇1:04:21

对 , 就是这两个 , 就是说第一你得有一个真实的去让你的智能体去演练的场景 , 就像我们参加 12 年这个教育 , 你得不停的参加考试 , 那些出那么多题 , 就是不停的给你环境让你实战去演练 。

曼祺1:04:34

对 , 就比如说在 AutoGLM 这种产品上, 去构造一个互联网的电脑的还有手机的这种环境 , 这个事是有技术门槛吗 ?

还是说它非常细碎 ?

刘潇1:04:44

我觉得既有技术门槛又细碎吧 , 比如说技术门槛其实最大的挑战就在于 ,因为实际 RL 训练的时候 , 你不可能就只用一台电脑让它训练 , 就是因为它失败的概率很高 ,因为它一开始啥都不会嘛 , 你只能说通过一些很稀疏的奖励来引导它 , 那你就要把你的采样的数量要扩大 , 比如说你一次要采样 1000 个轨迹 , 或者一次要采样 5000 个轨迹 , 如果

你只有一台电脑 , 那你一个任务跑 10 分钟 , 那你采样一次轨迹你就要 5 万分钟 , 那你基本上一个月就没了 。

曼祺1:05:11

那我需要做到 1000 台电脑一起采样的话 , 这个是既有算法上的一些难度 ,也有系统 Infra 上的一些难度 。

刘潇1:05:17

对对对 ,有很大的 Infra 上的难度 , 这也是为什么虚拟机方案也很重要 ,因为虚拟机对于做这样的训练也很必要 ,因为你不可能真的搬 100 台 、1000 台物理电脑来同时帮你做这个事情 。

曼祺1:05:27

做虚拟机方案的这些人现在是也在你的团队里 , 还是他们是在你的 Infra 团队里 ?

刘潇1:05:32

有我们团队的同学 ,也有 Infra 团队的同学 , 当然也有我们外部合作的伙伴 , 就是这事情其实是一个很坦率说哈 , 它其实需要一些比较好的云能力的一个 。

曼祺1:05:41

所以你们电脑端是和阿里云合作的 ?

刘潇1:05:43

对对对 ,因为阿里云做这个云电脑确实好多年了 , 那无影都已经发了很多年了 。 对对对 , 这块我们其实跟他们是有很好的合作的 ,因为这个事情确实从一开始它 AI 做一个 chatbot 它很简单 , 你就只要有个模型 ,有个网页就可以用 ,但现在你既然希望它串联起你更多生活 , 带来真正的更大的社会上的价值的话 , 我觉得工程上的事情和产品上的事情确实会越来

越 matter, 当然模型上并不是说就不重要了 , 模型上还是很重要 ,但是光模型上的进步可能不足以推动你去达成 AGI 这样一个目标 。

曼祺1:06:14

那就是环境上的 , 那在那个构造一个比较合适的激励上的难度是什么 ?

刘潇1:06:18

对 , 我觉得这个主要就是需要很专业的 expertise, 就是你会需要一些专业能力 , 比如打个比方 , 我让你去淘宝上买东西 , 我是肯定拿不到淘宝的数据库的 , 对吧 , 那我就只能通过轨迹来判断说我这个做得对不对 , 那你的模型是不是强大到光看轨迹就知道你自己能做对这件事情 , 这是一方面 , 然后另一方面比如说打个比方 , 还有一些更加专业的场景 ,

比如说做 Deep Research, 或者说我去做这种行业研究 , 或者还有包括像做 PPT 的场景 , 那你画的 PPT 到底好不好看呢 , 然后以及你做的这个研究到底信息密度高不高 , 你有没有找到对的信息 , 你的这些找到的答案对不对 , 这些事情如果你只是用一些很简单泛泛的这种问题的话 , 现在的 AI 随便一搜就知道答案了 , 很多问题网上甚至一搜就有了 , 那你

要找一些什么样真正的不太好随便一搞就搞出来的事情来挑战它的智商 , 让它来学习 , 这件事情其实就是一个很大的挑战 。

曼祺1:07:06

那这种场景的数据你们从哪来的 ? 也是构造的吗 ? 还是合成的 ? 还是 ?

刘潇1:07:10

对 ,有合成的 , 当然也会找很多人类的协助来提供这样的一些知识 , 比如说对于一些特定问题 , 一些很复杂的问题的答案应该是什么 , 类似这样 。

曼祺1:07:20

可以举些例子吗 ?

刘潇1:07:21

就比如说 ,其实这个过程中也还是一个 AI 和人类协同构建的一个过程吧 , 比如打个比方像 Deep Research 的问题 , 一个比较重要的策略就是说 , 我们可能会去利用一些这个网上的网页啊 , 还有一些这种知识图谱啊 , 然后呢去反向构造出一个复杂的 query, 就相当于我先有个答案 , 比如打个比方我说 XX 球队在哪年哪月哪日, 到底是以什么几比几的分数来击败谁的 , 然

后这个东西它可能网上你自己正儿八经去找其实挺难找的 ,但是你可以通过反向的方式 , 比如说我先找到一个网页上面记载的这样一个事情 , 然后呢并且你确认说这个事情不是随便搜索引擎里面随便搜一搜就能搜出来的 , 好 , 然后你反向的去根据这个网页信息去然后去标注这件事情 , 就是说去把它变成一个人类可以理解的 query, 就是说 XX 球队在

哪年哪月哪日, 然后是在哪个地方的什么比赛当中以一个什么样的分数干掉了谁 。

曼祺1:08:12

这个会很复杂吗 ? 这听起来就是个事实性的搜索呀 。

刘潇1:08:15

对 ,但是你不知道哪个网页上记载这个东西 , 就是你得找到对的网站 , 然后你还要去翻到那个日期 , 就是很多这种信息它是通过 JavaScript 的方式 , 比如说你要选日期这件事情 , 它不是说你随便搜索引擎一搜 , 你 type 几月几日就有这个结果 , 你得进到那个网站里面 。

曼祺1:08:30

那个网站可能是个数据库之类的什么 。

刘潇1:08:32

对对对 , 然后你得去操作它 , 然后而且可能还有很多个网站都有类似的功能 ,但有的网站有这个信息 ,有的网站没这个信息 , 你可能也要 try 很多次 , 然后但是反正我最后就是有个答案 , 然后你瞎猜的话是很难猜中这个答案的 , 你必须得正儿八经的看到那个页面 , 你可能才能答出这个答案 , 然后通过这种方式你就可以去很有效的训练模型

去做这种复杂的任务 。

曼祺1:08:51

所以构造合适激励的 , 首先肯定中间有个关键就是你还是得有很多各种各样的数据 。

刘潇1:08:55

对对对 ,是的 , 然后其次的话 , 确实我认为人类现阶段对于提供 reward 这件事情还是非常重要的 , 就是说 。

曼祺1:09:02

人参与其中 。

刘潇1:09:03

对对对 ,因为就是我们人类的一大特点就是虽然有的时候我们不知道怎么做 ,但是它你做得好不好我们还是看得出来的 , 你可能不知道怎么做产品 ,但是这个产品好不好用你还是能给出一个评判的 。

曼祺1:09:12

对 , 就是你不会做菜 ,但是好不好吃你能吃出来 。

刘潇1:09:15

对对 , 你能吃出来 , 所以说人类现在能提这种信号其实是对 AI 来说 , 人类能提供这种信号是很重要的 , 就是说 AI 反正它来负责学怎么做 , 然后自己做得好不好以及怎么改进 , 就你来告诉它就好了 。

曼祺1:09:26

那你们是什么人在给它提供判断啊 ?

刘潇1:09:28

我们当然会有很多我们的数据的同学 , 然后还有当然还有很多外部的合作的一些人一起来做 。

曼祺1:09:34

外部合作的人, 那做这个工作可以有收入吗 ?

刘潇1:09:37

那当然会有收入了 。

曼祺1:09:38

那怎么可以变成 ?

刘潇1:09:40

当然这个事情就比较复杂 , 这也是套很复杂的机制 , 你想想也不只是我们吧 , 你想 。

曼祺1:09:44

我觉得可能有很多人会有这个兴趣 , 对吧 , 就是我能不能来评判评判我赚点外快什么的 。

刘潇1:09:49

对对对 , 所以其实就是去评判嘛 。

曼祺1:09:51

那怎么可以成为这种人了 ?

刘潇1:09:53

好问题 , 这个可能得问我们公司数据团队的同学了 。

曼祺1:09:57

就总之他们就现在市场上会有这种服务什么 , 就你可以去和一些公司联系 , 然后这些公司里有很多人在做评判 。

刘潇1:10:03

其实没有很现成的这种服务 , 就是基本上都是你自己去找一些人, 然后你问他们说你们有这个兴趣 ,他们说啊你们居然还有这种事 , 然后说好 , 那你给我个规则我要怎么评判 , 对 , 类似于这种 。其实我觉得数据标注一直以来都大差不差吧 , 只不过现在标的任务越来越困难了 , 可能你如果自己没有一些专业知识 , 或者说比如说你不是球迷 , 你

要你就不知道要去那个数据库上找这个东西 , 可能有些问题也许也超出了普通人类对这件事情的评判能力 , 可能也需要一些专业的 , 比如我让你写一篇古文 , 让模型写一篇古文 , 对吧 , 当然这个可能跟 Agent 无关哈 , 我只举个例子 , 正常人看古文都觉得啊好像写挺好的 , 挺古色古香的 ,但你可能找个研究古代中文的博士生来看一眼 , 说你这写

的狗屁不同 , 这根本就不是那个题材 。 就坦白来说 , 现在的模型确实在每个人自己的专业方向上可能它没有达到 ,但是它想要在其他方面吊打我们人类应该还是足够的 , 就是类似于乒乓球里面可能最会拉小提琴和小提琴里面最会拉乒乓球的 ,他可能大概是这种 , 就是在你会的领域里面他可能不太行 ,但是在你不会的领域他绝对随随便便吊打你 , 对 ,

所以大概就是这样的一个情况 。

曼祺1:11:04

所以这是两个关键 , 对吧 , 就环境和那个激励 。

刘潇1:11:07

对对对 ,是的 。

曼祺1:11:08

我们可以先把那个过程讲完啊 , 应该是说到 24 年, 已经到 24 年 9 月了 , 对吧 , 就是 OE Deep Research。

在线强化学习1:11:12

刘潇1:11:13

对 , 所以那个之后我们就我们就很确信说接下来我们重点就应该放在在线强化学习上 ,并且要解决刚才讲的环境和 reward 的问题 。

那么所以说在 24 年 10 月底的时候 ,其实是当时我们就是初步做了一些验证 ,但是那个时候规模还很小 , 就像我说可能实际同事能并发做的环境可能也就个位数吧 , 对 , 然后所以说当时采用的算法也是虽然也是在线的算法 ,但是总的来说它的更新速度也比较慢 , 然后它的效率也很低 , 它实际上虽然能学一点东西 ,但是就是只能在一些单应用

上啊 , 做一些简单的一些这种事情 , 它不能做更复杂的事情 。

曼祺1:11:48

其实那个阶段你们 AutoGLM 就发布了 。

刘潇1:11:50

对 , 内测版本其实就已经出现了 , 对 , 然后在当时其实已经大家已经觉得挺有意思的了 , 就是说做一个能够操控手机的这样的一个智能体 , 然后但是在那之后我们接下来一方面就是公司会有一些商业化的计划 , 然后我们开始包括看看有没有更多的人愿意来使用 , 从硬件厂商的还有主机厂商的视角来看 , 能不能帮助到他们 , 对 。

曼祺1:12:11

和荣耀合作就是在那会儿吧 ?

刘潇1:12:12

对对对 ,其实也就是在发布前的时候开始跟他们有一些接触 , 然后后面包括还有反正也会有更多其他的一些合作也还在推进当中, 然后另一方面的话就是我们自己肯定接下来就更希望关心怎么把算法还有这个东西变成一个真正大规模可用的东西 ,因为就是这个东西我觉得其实还是我最早说的那句话 , 就是 Agent 的东西还是很新 ,其实市场教育还是需要时间 ,而

且本身技术也不能说是完全成熟的一个技术 ,但是它需要更多用户 , 然后更多的这个合作伙伴一起来推进这件事情 , 让大家从无论从工程的稳定性 、 算法的可靠性 , 再到用户的对这件事情理解的这个理解的程度以及便利性的角度一起来做优化 , 所以说就慢慢的走到今天这一步 , 就是首先第一在工程上比较好的去实现了不抢占你手机屏幕 ,也

不抢占你电脑屏幕的这样一种异步的 ,并且全天候的能够为你长时间运行的这样的一个工程的这样一套策略 , 然后另一方面就是我们在算法上实现了一个更加这个大规模并且能够适配这种大规模的模拟的这种在线的强化学习算法 , 然后让它真的去取得了非常显著的这样的一个提升 。

你现在如果使用我们的那个手机应用 , 你会发现去年那个版本它万一点错了 , 它就会一直不停的点错下去 , 它就回不了头了 , 它也不会停下来 ,但是今年这个版本你现在会非常普遍的发现 , 比如说它不小心一开始点错了 , 比如它要点外卖 , 结果它点到小杨超市或者点到别的入口去了 , 自己会知道要退回来 ,因为它发现哎这好像不

是我要去的那个地方 , 然后它就会自己回退 , 然后再去重新做尝试 , 或者它点了之后有个时候网络原因它没有加载出来 , 没关系 , 它会自己再试一遍 , 它说怎么我这次看到图跟上次一样 , 然后它就会再尝试一次 , 你会发现这次的应用当中出现了非常多模型的这种自我纠错的这样的一种能力 , 这个真的非常重要 ,因为没有这个的话你会发

现就去年那个版本虽然在理想情况下它能很好的运行 ,但是现实中由于网络波动 ,由于各种各样的因素导致它没有办法去实际向用户交付一个非常好的一个稳定的体验 , 所以这也是我们花了非常长时间通过在线强化学习的方法去迭代和改善的这样的一个问题 。

曼祺1:14:19

对 ,因为其实我觉得在国内最早讲 Agent 的其实是智谱 ,但是你们没有出圈 ,因为你们 24 年 10 月份就讲这个事情嘛 , 然后真正出圈是在那个 3 月份 , 就今年 3 月份 Manus 的那一波 。

你们当时看到心里会着急吗 ?

刘潇1:14:34

也不能说着急吧 , 就是说觉得挺好的 。

曼祺1:14:37

觉得挺好的 , 真的 。

刘潇1:14:38

因为其实当时自己其实做 Agent 这个事情也觉得说就是说因为我自己本人算法出身嘛 , 我会觉得产品上缺乏一些想法 , 然后而且可能也并没有很好的想好说这个事情要怎么去告诉用户说哎我们这东西能用了 , 对 , 然后但是我觉得他们很率先的去做了一些这样的事情 , 然后给整个行业也有一些很好的一些带动作用 , 然后并且也让大家就是更多人

理解了 , 就至少以前是属于听都没听过 , 现在是听过但是不知道 , 对吧 。

曼祺1:15:03

就以前根本就不会有人问你这是什么 。

刘潇1:15:05

对 , 就不会有人来问我说哎你们圈子是不是最近在搞一个什么 Agent 这个东西 , 对吧 , 现在会有人来问 , 就这个事情在慢慢的就是在成熟 , 然后并且大家一起来做出一些好的这样的一些努力 , 我觉得这个事情是比较好的 。

曼祺1:15:17

你们觉得长期来看 Agent 这个市场会是个什么格局 ? 我的意思是说 , 比如说可能实际上大家真的在用的 Agent 会有多少了 ?

刘潇1:15:25

其实又回到刚才说的问题 , 我觉得就是到时候会分几类吧 , 就是说像我说的首先第一 , 我觉得会有我个人会觉得会有像 personal 的 Agent 这种东西 , 就是说它会是站在用户这一边 , 然后替用户 manage 他自己的生活和工作的这样的一个这样的一个纯 personal 的这样的一个属于你的这样的一个 Agent, 甚至不只是一个哈 , 你要是可以的话可能以后你可以有三四个 , 你想让他们每个人负责

不同的事都可以 , 然后另一方面的话就是像应用啊 , 还有像服务啊 , 这些垂直的应用他们也会有自己的应用 ,他们来更好的帮助他们完成他们自己用户的使用 , 然后甚至并且来和用户的这种 personal Agent 进行交互 , 然后来简化这个交互流程 , 比如说你像我们去操作肯定还是会有一点慢的 , 我坦率说哈 , 速度肯定还是依然是个问题 , 完了刷了就给你

完成 , 那你肯定天天用这个东西 , 那如果我能通过 A2A 的方式我 Agent 来 call 你的 Agent, 然后我们两边都能简化对方的沟通的成本和这个时间 , 那当然是一件非常好的事情 , 大家都很乐意做这件事情 , 然后当然第三就是很多的设备啊 , 硬件啊也都会有 Agent, 只不过这可能就看实际的硬件算力的发展啊 ,以及也有可能他们会选择去接入一个现成的个人 Agent, 或者

接入一个垂直的 Agent, 这些都有可能啊 , 这个就看各个公司或者说各个团体自己的业务范围和自己的一些决策 ,但是我觉得就是总而言之这些东西最后都会串联起来 , 然后大家会每个人以后都会是一个 boss, 会有很多的 assistant, 然后来围绕着你很多 Agent 的 assistant, 然后他们来帮你跟其他的 Agent 来沟通 , 然后来完成你想要的事情 。

曼祺1:16:56

对 ,因为其实从人的使用习惯的角度 , 你比如说一个公司的老板吧 , 从管理学上以前其实就有一个理论嘛 , 就说一个人直接管的人不要超过 8 个人。

刘潇1:17:05

对对对 。

曼祺1:17:05

就你得是有一个管理的范围的 。

刘潇1:17:06

对对对 。

曼祺1:17:07

所以我觉得可能未来 Agent 就你真的经常用的 ,也许它也是有一个数量限制的 。

刘潇1:17:11

对 , 就像你平常会常用的应用也不会特别多嘛 。

曼祺1:17:14

对 , 所以我觉得这个竞争会很激烈 ,因为大家都还是想要这个新的入口嘛 。

刘潇1:17:18

对 , 我觉得这个事情可能更偏实际商业和产品化的事情了 , 从我自己个人视角来看 , 我觉得真的想要谈论这件事情的话 , 前提是我们真的在模型和工程上真的做到很聪明的水平和很便捷的水平 , 我认为这件事情现在还只能说是达到了一个初步的 milestone,但是其实还是有很长的路要走的 ,而且我认为这件事情本质上我们刚才讲这件事情哈 , 我

觉得归根结底都是 AGI 这个果实的副产品 , 就是说如果我们 achieve 了 AGI, 这些事情都会变得 rather simple,而且最终可能其决定性意义的只是谁的 AGI 更强 ,因为用户永远会用那个更聪明 、 更厉害 , 然后更智慧的那个东西 , 我觉得这个是 fundamentally 大家其实应该更加关心的事情 , 就是说我们到底怎么通过这个过程让我们的 AI 更 smart, 然后真正的去 fundamentally 的推动我们人

类社会的生产力水平和整个这个这个这个生活的质量和水平 。

提升方向1:18:11

曼祺1:18:12

你觉得从现在的这个 Agent 的能力 , 到有可能到我刚才说的那种 , 就是它到了一个相对更好用的状态 , 然后也许入口竞争变得更激烈了 , 这个中间还差什么呀 ?

就是它还有哪些具体的指标上是需要去做提升的 ?

刘潇1:18:25

对 , 我觉得首先肯定是模型能力上还差距比较大嘛 , 就是说比如打个比方 , 它现在其实你像我们在 OSWorld 的那个 complete use benchmark 上, 虽然我们已经是应该是 single model 里面最好的模型了 , 就是 48 分的成功率 ,但其实人类差不多有个 70 分的成功率 。

曼祺1:18:41

你可以说一下这个东西是测什么的 ?

刘潇1:18:43

它就是测你使用电脑上各种应用的能力 , 比如说使用 Office, 使用 Chrome, 然后使用你的邮箱管理系统 , 然后包括去浏览网页 , 然后又把东西给弄到一个 cell 上, 然后再帮你怎么 whatever 去整理一番 , 我们应该是将近 50 分的水平 。

曼祺1:18:56

48?

刘潇1:18:57

对 ,48, 然后人类是 70,70 多一点点的水平 , 对 , 所以这个你会发现这还是有 gap, 然后并且这个 benchmark 也不能说是一个特别有特别 challenging 的 benchmark, 它其实还是相对来说比较 elementary 的一个 benchmark, 然后接下来肯定大家还会随着这个搒单被大家攻克 , 肯定接下来还会有更加 challenging 的 ,而且更加 。

曼祺1:19:15

更难的 。

刘潇1:19:16

对 , 更难的一些 benchmark, 然后肯定我觉得在这方面还需要大家一起努力再迭一段时间 , 然后各家都会有些进展 。

曼祺1:19:22

然后你觉得这个更聪明就是靠在线的强化学习 , 你觉得是能去做提升的 ?

刘潇1:19:25

对对 , 就像我刚才说的 , 我觉得现在阻碍我们去让 AI 学会一件事情的只有环境和 reward 这两个东西 。

曼祺1:19:31

你的这个想法是算是业界的一种共识吗 ? 还是你们自己的一种想法 ?

刘潇1:19:36

我觉得其实还挺共识的吧 , 你像 OpenAI 最近的几个研究员 ,他们不也是经常出来说 , 就是说觉得本质上是我们要找那种非对称的 verified 的任务嘛 。

曼祺1:19:45

对 ,Jason Wei 写的那个博客 。

刘潇1:19:47

对对对 。

曼祺1:19:48

他现在还在 OpenAI 吗 ? 他不是去 。

刘潇1:19:49

他去 Meta 了 。

曼祺1:19:50

对 ,他去 Meta 了 。

刘潇1:19:51

对对对 ,是 ,但是就这件事情 , 所以你会意识到其实大家 somehow 都有这个 sense, 就是说就 RL 这个事情确实非常好 , 包括你像那个 Murati 他出来创业做 Thinking Machine, 对 ,Thinking Machine 它本身就是不是重点就是关心 RL2B 嘛 , 就是说为什么关心 RL2B,因为就是我觉得 OpenAI 圈子的人应该都很清楚 , 就是 RL 加上就为什么 2B 就是要找一个现成的 environment, 然后并且找到 expertise, 然后把 RL apply 进去 ,pardon, 所有事

情就都 get done 了 。

曼祺1:20:16

所以 RL2B 它背后的本质你认为其实就是环境还有奖励 。

刘潇1:20:21

对对对对 。

曼祺1:20:22

出一个具体场景它好好解决这两个问题 。

刘潇1:20:23

对对对 , 就解决这两个问题应该就解决了这个问题 ,但这两个看上去很简单哈 ,其实没有那么简单 , 就是它不是一个很机械的一个事情 , 就是至少现阶段可能还没有一个 SOP 的方式去构建这个事情嘛 , 对 。

曼祺1:20:35

你今天还提到了端到端的强化学习 。

刘潇1:20:37

当我强调端到端的时候其实就是说我不希望过程结果 。

曼祺1:20:39

不希望结果去验证 。

刘潇1:20:40

对对 , 直接用结果来 final result 来验证这个事情 。

曼祺1:20:43

这是一个就模型的性能 。

刘潇1:20:45

嗯嗯 , 对对对 。

曼祺1:20:46

还有什么要提升 ? 就到那种入口竞争级别的状态 。

刘潇1:20:50

对 , 我觉得还有还有 Infra 吧 , 就是说现阶段很显然像这种带宽啊 , 然后还有整个运营商的基建啊 , 然后还有云虚拟设备的这种鲁棒性啊 , 然后当然还有一些我觉得还有很多规范和标准层面的东西 , 就这个东西肯定不可能这样 , 我说我觉得这是一个大家需要共建的事情 , 它不是说我们把这个设备搞好之后应用厂商就不会做任何事情

, 我觉得肯定不是这样的 , 肯定大家比如说打个比方 , 很多手机也会跟这个应用商去通报说这个是我的设备 , 对吧 , 那我们肯定也希望去跟应用厂商去做这样的事情 , 就是我可以告诉你 , 我可以很明确告诉你这个就是个 Agent, 然后呢你可以对这个 Agent 有更多的行为管控 , 避免它干出你不希望的事情 ,但是呢你也应该去允许它去做一些能

给你带来好处的事情 , 这样的话我们对大家都好 , 就是能够给你带来更好的订单或者说流量 , 然后也能给用户带来更好的体验 。

曼祺1:21:37

对 , 正好我想补充问一下就是因为你们也在和一些 App 去聊这种 API 的合作 , 然后你也提到说 API 它中间有一些问题 , 就比如说我从这个搜索到绑定个人账号 , 后面的链路支付这些都是断的 。

刘潇1:21:48

对对对 。

曼祺1:21:49

这些部分在你们就是去谈那些合作里面 ,是你们在做这部分去解决这部分 , 还是他们去做 , 还是一起 ?

刘潇1:21:55

对 , 我觉得这个事情可能需要一起来做 , 就没有那么简单 ,而且实话说我觉得还在一个早期的阶段 , 就是说包括像我们也跟一些支付的伙伴会交流这件事情 , 大家都很感兴趣 ,但是大家都没有头绪 , 就是因为没有一个样板工程可以对着去验证说到底用户会用什么样的 , 希望用什么样的方式来做这个事情 ,以及用户到底在这个场景下会使用哪些场景 , 对 ,

所以说我是觉得其实还挺多涉及到各种行业各种各方的这个问题需要大家一起来推动啊 ,但我还是很乐观的 ,因为这个事情我觉得就是大家都会觉得它有些非常 reasonable 的场景和一些非常大家一想就会觉得确实非常痛 ,而且现阶段其实能力上从技术的角度来讲是已经 ready 的一些事情 , 那么我觉得通过这种方式来 driven 各方一起来推动这件事情 , 来创

造一些价值 , 我觉得应该还是会相对来说是会比较顺畅的 。

曼祺1:22:45

对 , 然后所以第二个是这个 Infra 这块的吧 。

刘潇1:22:48

对对对对 。

曼祺1:22:48

我这一票关心的有一个 , 还有个是成本 。 你们现在就是说完成单个任务是 0.2 美元 , 对吧 ?

刘潇1:22:55

对对对 。

曼祺1:22:55

但是你们这一次是免费给大家用的 。

刘潇1:22:58

对对对 。

曼祺1:22:58

那你们有想过就是它一旦比如说开放之后万一很多人来用你们这个 , 就你们有一个预算的上限吗 ?

刘潇1:23:05

实话说我们现阶段其实暂时还没有 , 对 ,因为我们觉得首先第一 , 当然因为实际上之后可能实际还是会被你的资源量给绑得住的 , 就是说你 。

曼祺1:23:16

就有可能会服务器非常繁忙或者怎么样 。

刘潇1:23:18

对对对 。

曼祺1:23:18

如果说用的人很多的话 。

刘潇1:23:19

对对对 , 可能会出现这样的情况 , 然后但是我觉得就是但从我自己的想法来讲 , 我觉得我们希望这次为大家带来的就是让更多人把 Agent 从一个指纹齐声 、 不见其物的东西变成一个切切实实每个人都能体验到并且被它所触动的这样的一个东西 , 然后这件事情在我们看来是我觉得是我们希望给整个行业做出的一个贡献 , 就是让大家都能够人人

都能用上 Agent, 然后这件事情很重要 。

曼祺1:23:46

在你们的测算里面就是它单个任务到多少成本的时候 , 可能才是商业上比较合理的时候 ?

刘潇1:23:52

其实我没有仔细做过测算 ,但是就像我们就是说比如打个比方 , 如果它的这对大模型整体的产品我觉得都是这样 , 就是说首先搜索是一个已经被验证的是一个能带来商业化的一个场景嘛 , 对吧 , 那搜索的成本是差不多 , 当然这个口径可能不是对齐的 ,但是根据外网的测算可能是 0.02 美元一次像谷歌搜索的成本 , 对吧 , 如果你能到谷歌搜索的

成本 , 那毫无疑问你 Agent 创造价值肯定比单次谷歌搜索的价值创造的高嘛 , 这个事情我觉得是大家应该没有什么疑问的 。

曼祺1:24:20

只是说这个价值到底这个钱怎么付 , 现在不是很清楚 。

刘潇1:24:23

对对对对对 , 现在不太很清楚这件事情 。

曼祺1:24:25

就是你是订阅还是广告还是什么不清楚 。

刘潇1:24:26

对对对 , 你不太确定这件事情到底是怎么完成这个闭环 , 然后第二的话就是当然它我觉得它你说它要完全等同于一次搜索成本 , 我觉得可能性也不大 , 它可能还是会比一次搜索成本会要高一些的 ,但是呢这个我感觉也取决于市场的程度 ,因为它是有一个规模效应的 , 你用的人越多 , 我单次成本就能压得越低 , 对 , 那到底我能压低到多少

程度 , 然后这个事情其实是需要一些市场上的跑一跑检验一下才会有一些观察和结论 , 我现在也我也很难预测 , 就是因为我觉得 AI 这个东西就是总是给我们带来很大的惊喜 , 就是大家现在都很难想象 AI 这两三年就跑了 , 之前非常多就是直接从原来一开始连句话都说不出来 , 跑到现在这个样子才能帮你做这么多事情 , 对吧 , 我觉得

这个行业还是在一个光速发展的阶段 , 然后很多事情它我觉得它还是会继续给大家持续带来各种各样的惊喜的 ,而且很多时候其实在外界看来的大跃进其实是在 AI 行业内部大家其实是心知肚明 , 就是累积到这个点就该出一个这样的东西了 , 大家其实内部自己心里是对这个 roadmap 是有一个大概的一个估计的 。

曼祺1:25:31

其实你们现在做到单个任务的成本 0.2 美元已经比较低了 , 就是因为你们后面就是支撑 AutoGLM 的模型是个比较小的模型吗 ?

刘潇1:25:40

肯定有模型上的这个 size 上的这个减小 ,也会有整个工程 team 的优化 , 你像我们公司的这个 inference team 非常给力 , 就是能把事情做得非常非常超出我们想象 , 对 ,是 , 包括像 4.5 其实你也看到它价格也非常非常低 , 一个 Claude 4 Sonnet 水平的这样一个模型 , 它成本居然能做到百万 token input 才 2 块钱 , 对 , 还是 4 块钱 , 我不记得了 。

曼祺1:26:02

你们这个定价肯定对你们来说是有利润的 。

刘潇1:26:04

对 , 肯定还是有的 , 对公司来说应该肯定不会做亏本的生意 , 对 , 所以说这件事情肯定是甚至还会有更加进一步去优化的空间吧 , 对 , 我觉得 。

曼祺1:26:12

你们这个产品还有三天就要和所有的这个国内的 C 端的用户见面了 , 你现在自己比较忐忑和或者说会有点担忧的事情是什么 ?

刘潇1:26:21

我自己肯定最担心的还是工程稳定性吧 。

曼祺1:26:23

工程稳定性 。

刘潇1:26:24

对对 ,因为确实这个链路也比较新 , 实话说真的去把这个链路跑通的全世界也没有也没有几家公司在做这件事情吧 , 可能就一只手数得过来 , 像这个 OpenAI 肯定是在做嘛 , 像它的 ChatGPT Agent, 对吧 , 然后呢其次的话像海外也听说有一些海外的 startup 在做相关的事情 , 然后但是可能比较有名的偏 Infra 层面的就是 E2B 嘛 ,他们其实做得非常好 , 包括也服务了很多 startup, 除此

之外确实其他的 Google 内部应该也在做类似的事情 ,但是基本上还处于纯水下的研究的这样一个状态 , 对 , 我目前能听到的应该也就只有这些在推进这件事情 , 我觉得还是非常有挑战的一个事情 , 所以说当我们把这个东西端出来我们也非常忐忑 。

曼祺1:27:09

比较期待和兴奋的是什么 ?

刘潇1:27:10

首先第一我觉得这个东西极大的降低了大家使用它的门槛 , 比如说以前那次版本一方面是有邀请码 , 然后另一方面是它会索要你的很多很复杂的权限 , 说实话 90% 或者 99% 的用户应该都不知道怎么去开那些权限 ,而且不同的设备这些权限开启方式也都不一样 , 所以说很多人对 AutoGLM 的理解也可能就停留在视频里面的表现 , 它可能没有能够真的在自己手

机上去用 , 然后另一方面可能我觉得比较好的点就是它这次确实是全端上线的 , 解决了之前就是只能在安卓手机上而且是特定版本的安卓手机才能够去使用的问题 , 大家可以在所有端上都能够去使用它 , 然后当然最后我最兴奋的是我还是希望看到更多的各种神奇的 AI 硬件能够接入到 AutoGLM 里面 ,因为我也用 AI 智能眼镜 , 我就特别希望用 AI

智能眼镜来玩手机 , 我特别希望看到这件事情能尽快的走入千家万户 , 让大家都用上这样的一个能力 。

曼祺1:28:04

那你有期待收到什么具体的反馈吗 ?

刘潇1:28:06

具体的反馈首先第一我肯定很关心的点是大家就会希望用我们的产品来做一些什么样的事情 ,因为我觉得现阶段的这些产品包括移动互联网时代也有这样一个特点 , 就是在你把东西做出来之前 , 用户是根本不知道自己想要一个什么样的东西的 , 这件事情是普遍存在的 , 所以我们之所以想把这样一个可能确实还存在一些缺陷的 ,而且也事实上也确实存在

很多缺陷的这样一个东西端出来也是因为我们希望收到大家的反馈 , 我们希望知道大家希望用这个东西来怎么改造自己的生活和工作 , 这个事情是我们对我们来说最有价值的 ,也是我们认为对实现 AGI 最有价值的一件事情 。

第二的话就是当然就是我们也希望能够通过我们的发声让能看到更多的愿意来和我们一起来努力的合作伙伴 , 就是各个方面的 , 然后我们一起来探索说怎么真的把 Agent 这个事情从一个技术的东西变成一个产品的东西 , 最后变成一个能给整个社会带来巨大效益的东西 。

曼祺1:28:56

你们接下来一段时间的计划是什么 ?

刘潇1:28:58

接下来计划就是我们希望因为我们这次是正式上线 , 然后我们也希望继续推动 Agent 这块的发展嘛 , 所以说第一是我们希望把我们接下来希望能够实现一个定期的一个迭代 , 比如说每一到两周我们能够不断的持续给我们的用户带来一些新的 feature, 让大家体验 ,并且能够去真正的去给用户创造更多日常上的价值 , 让大家从 Agent 上面获得更大的这样的一个收

获 , 我觉得这个事情是我们很特别特别关心的事情 , 然后第二个事情其实就是我们也希望去与更多的开发者 , 还有更多的应用 , 还有更多的厂商 , 还有更多合作伙伴一起看这样一个东西它不只是说从这个直接是面向消费者来提供服务 , 然后它能不能从更多的合作伙伴那来直接为他们创造一些价值 , 然后或者说我们可以怎么一起来做这

件事情 , 把这个事情做得更好 , 这个 , 然后当然第三就是算法上我们希望持续迭代 , 我们希望真正的我们的目标最核心最核心的目标还是 AGI,因为我们觉得只要实现了 AGI 或者说实现了一个真正 really smart 的这样一个 intelligent system 的话 , 这一切其实都是就只是 a matter of time, 就是去解决这些工程上的问题 。

曼祺1:30:06

你怎么理解现在你们做的事就是 AutoGLM 和 AGI 的关系 ?

刘潇1:30:09

就像我说的 , 我觉得就是 Agent 在很多不论是 AutoGLM 自己的 roadmap 还是在我们公司自己的 AGI 的 roadmap 里面都是重要的一环 , 就是我们只有把这个台阶踩实了 , 然后我们才能够迈向下一个阶段 , 所以说这个其实是我们现在必须得去做成的一件事情 ,而且在我理解当中 AGI 是一个范围性的概念 ,因为这个事情确实比较模糊 。

曼祺1:30:31

就是它不是一个点 。

刘潇1:30:32

对对 , 它不是一个点 , 它是一种感知在我看来 , 就是说从有一部分人 feel 的 AGI 到所有人都 ensure 或者说 make sure 所有人都认为现在就是 AGI, 这个过程中会有一个会有一个范围 , 然后这个范围当中模型能力会不断的去提升 , 那么我认为当我们实现了一个能 24 小时自主稳定运行并且能够去搞定这个你生活和工作当中的这个就是以一个普通同事的水平去完成你工作和生活

当中的问题的 , 或者说一个你普通助理的水平去完成这件事情的这样一个 Agent 的时候 , 我认为它已经完全达到了 AGI 的下限 , 怎么才能推动到 AGI 上限这个事情就是我觉得还需要更多的努力才能让更多人认可说这个就是我们想象中的 AGI。

曼祺1:31:12

所以一个好用的 24 小时可以服务你的 Agent, 你觉得是触到了 AGI 的下限 。

刘潇1:31:17

对 , 我认为是触到了 AGI 的下限 。

曼祺1:31:18

你们这次那个云端电脑那个 UI 设计我觉得挺有意思的 ,因为它是在黑暗之中有橙黄色的光蔓延开来的感觉 , 就很像那个曙光初照地面的这种感觉 ,也很像你刚刚说的就是慢慢蔓延到一些人可能这些人就开始被光照到了 ,他觉得我感觉到 AGI 来了 , 然后是更多人了 。

刘潇1:31:36

对对对 , 包括像很多 community 的人也会说嘛 , 就是说很多时候 AGI 已经来临只是没有平均的 evenly distributed, 就没有平均 。

曼祺1:31:43

就是没有平均分布 。

刘潇1:31:44

对对对 , 所以说我们希望做的事情也是让这个未来被更多人看见 , 然后并且一起来为这个未来一起努力 , 然后我们来真正推动这件事情的这个诞生 。

曼祺1:31:54

好 , 那今天非常谢谢刘潇做客 《 晚点聊 》 分享了 AutoGLM 的整个开发的过程 ,他们中间思路的变换 ,以及现在马上就要跟所有人见面的 AutoGLM 在云端和手机端都可以用的这个 AI Agent 它可以做到什么 , 它接下来可能会怎么进化 。

那今天的节目就到这里 , 谢谢各位的收听 , 大家拜拜 。

刘潇1:32:12

谢谢大家 。

连点成线1:32:14

曼祺1:32:15

本期 《 零点呈现 》 分享两个内容 , 一是 Agent 的入口竞争 , 二是强化学习的威力 。在 117 中, 明视合伙人夏令和我们详细讨论了他看到的 AI 通用入口大战 , 可以从不同的终端和场景来看竞争格局 。在 Web 端 , 对应的硬件是电脑 ,OpenAI 做 Deep Research 和 Agent,Anthropic 主攻 Coding Agent,Devon、Manus、Jens Park 等创业公司也有一席之地 。

这些 Agent 主要是帮助我们完成一些知识生产的工作 , 或提升白领的工作效率 , 这是大模型技术目前更好覆盖的领域 。

到了移动端 , 首先之前并没有非常成型的产品 , 移动端通用 Agent 的技术难度更高 ,因为手机上的很多任务不是知识生产 ,而是要调用各种 APP 乃至线下服务 , 还会涉及到付款和交易的环节 , 对安全的要求也更高 。

移动端 Agent 能使用的算力 、 存储和网络性能也非常受限于手机硬件的限制 。在移动端 , 商业博弈也更复杂 , 比如当时夏令在 117 中就提到像美团 、 滴滴这样的公司 ,他们初期可能会对接入其他的 Agent 有疑虑 ,因为他们当年就是从试图打造通用入口的微信九宫格里成长并逃离的 ,他们不会想再回到九宫格里 。在手机这个兵家必争之地 , 接下来会有

一些有意思的变化 , 比如开头也提到了字节在酝酿自己的豆包手机 , 我觉得这个意义在于三位一体 , 字节包圆了大模型 、 超级 APP 和硬件的能力 , 这确实能带来一些更深入的整合 , 比如说像苹果和 OPPO 那样 , 可以直接在手机上给 AI 分配一个物理按键 。

如果未来我们会看到豆包手机的话 ,也许就会发现这个上面很可能也有给豆包大模型单独留的实体交互按键 。

再往下, 移动端还会有一些新的硬件载体 , 一个热门候选是智能眼镜 , 这里有更多的空白 , 它没有已经成气候的硬件厂商 ,也没有已经非常成型的超级 APP, 当然也有更多的不确定性 , 当然什么地方都会有大公司的触角 , 比如说字节也在探索自己的智能眼镜 ,而小米 、 华为这些本身就是做硬件的厂商 , 本来在这个领域就有一些相关的产品 。

夏令当时有一个判断 ,他认为从 Web 端到手机再到眼镜 ,Agent 的数量是会越来越少的 , 比如说对眼镜这样的新硬件来说 , 它可以从零开始把操作系统直接做成一个 Agent, 所以对大部分用户来说 , 至少在一个设备上, 它只会需要一个直接与之交互的 Agent, 这就是所谓的 AI 的入口 。

总之 , 当 Agent 有了从 Web 端到移动端的能力之后, 更激烈和不同方式的竞争即将拉开帷幕 , 这是一个很有看点的商业戏剧 , 这也是会切实改变我们日常生活的变化 。

第二是想再聊一下强化学习 , 这是去年到今年我们在多期节目中反复聊到的话题 。在去年底的第 96 期中, 小马智行的 CTO 楼天成分享了为什么在 L4 级别的自动驾驶中模仿学习有重大的瓶颈 , 必须从 learning by watching 到 learning by practicing。108 期中, 香港大学的马毅老师把地球上初级生命的进化过程视为一种强化学习 ,DNA 在环境中接受正负反馈 , 靠生生死死来迭代 ,

如果类比一下, 这也许比较像本期聊到的离线强化学习 。117 中我们和 Pokee.ai 的创始人朱哲清 Beel 专门聊了怎么用强化学习来做 Agent,他的思路是用强化学习来做 Agent 的后端 , 用大语言模型来做与人交互的前端 。GIP 接下来也会继续用强化学习来增强 AutoGLM 的能力 , 大模型架构与强化学习方法的结合能把互联网 、 汽车 、 机器人上的智能推到多远 , 对这

个问题的回答会决定很多人的动作 。 最后再重复一下问卷征集信息 ,《 晚点 》 发起了一份轻型小问卷 , 只有 10 加个选择题 , 我们想了解 AI 应用产品在模型调用方面的真实现状 , 到底在不同场景中哪些模型被用得最多 、 最受欢迎 , 问题不涉及产品的名称等敏感信息 , 问卷链接和详情见 Show Notes 说明 , 欢迎 《 晚点聊 》 听友中的 AI 产品开发者

和创造者来填写 。 感谢

。 本期节目就到这里 , 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。 下期再见