晚点晚点聊 LateTalk2025年10月23日· 1:34:09

138: 从你用手机到它更懂你,OPPO的手机AI实践 |与小布负责人万玉龙聊端侧AI|Agent#7

本期《晚点聊》中,主持人程曼祺与OPPO ColorOS智能助理部总经理万玉龙对谈,核心观点是:手机厂商做AI的关键不在于预训练大模型,而在于以新计算(端云协同降本提速)、新感知(结合传感器与屏幕内容理解用户)、新生态(以Agent接入第三方服务)重塑体验。万玉龙介绍小布助手将上线一键闪记(可记录视频要点、语音待办、账单并提取取餐码)、视频问答(结合声纹抗噪、哪里不会点哪里)、个性化简报等功能,并坦言渗透率低于预期:月活近1.7亿(四个月前1.5亿),但手机AI助手日活比不高,原因是过去语音助手的负面心智和手机助手需同时解决通用问答、本机上千条控制指令、三方应用执行等更复杂任务。产品方法论上,他认为AI产品是"by use"而非"by design",需通过圆点之旅等用户访谈和线上日志迭代;OPPO已转向更敏捷的研发,最快一周发一版。关于生态,他认为服务正从APP转向Agent,能力原子化后供模型调度比GUI Agent更符合直觉;OPPO正与支付宝等以A2A协议合作,但移动端尚无统一标准,日活、时长、广告等商业指标将被重塑。万玉龙判断用户最终只需要一个贴身管家来协调各类专家顾问,手机作为多设备中枢仍是管家最佳载体;他期待明年AI渗透率大幅提升,并认为真正的AIOS须从底层重构而非在安卓上叠加AI,新生态需要爆品催化,可能出现新玩家。

  1. 0:00开场
  2. 2:00新体验
  3. 11:56行业与渗透
  4. 31:12三大场景
  5. 38:17产品方法
  6. 48:00卖点与粘性
  7. 52:33AI人才
  8. 59:41生态竞合
  9. 1:04:41指标重塑
  10. 1:11:28协议与入口
  11. 1:20:46新交互
  12. 1:25:02未来AIOS

PodHood 提供支持

文字稿

开场0:00

就是当年 Siri 做得太早了 , 反而搞了些负反馈出来了 ,是吧 ?

万玉龙0:06

也不是因为 Siri 了 , 我们自己也没有做好 。 我们经常举例说 , 软件产品就是 "by design", 设计成什么样 , 用户就知道它能做什么 。

但是 AI 类的产品就是 , 一开始很难是 "by design" 的 , 你很多时候是要去观察用户怎么用它的 。 现在大家习惯性地认为说 , 我是不是直接通过理解那个 APP 内容去操控它就行了 。

但这个我自己觉得还不够 AI native。AI native 应该是一个把能力原子化 , 然后通过某种方式提供给模型 。

曼祺0:36

欢迎收听 《 晚点聊 》, 我是曼祺 。 手机作为最主流 、 最有想象力的智能硬件载体 ,是 AI 入口的必争之地 。在 130 期节目中, 我们聊了智谱这样的大模型公司怎么做手机 Agent。

本期我们换一个视角 , 邀请了 OPPO ColorOS 智能助理部总经理万玉龙博士 。 相比电脑 , 手机的保有量和使用时长都大得多 。AI 在这里能做什么 ?

手机厂商是怎么思考和怎么实践的 ? 我们正式进入本期节目吧 。 万博你可以和我们的听友简单地打一个招呼 , 简单自我介绍一下 。

万玉龙1:10

哈喽哈喽 , 大家好 ! 今天特别开心能够跟曼祺一块来交流一下 AI 相关的一些事情 。 我是万玉龙 , 然后我是从 2008 年开始就在做 AI 相关的事情 。

现在是在 OPPO 负责我们的智能助理 , 小布助手 。 简单介绍一下小布助手吧 。 小布助手是搭载在我们 OPPO 全系的设备上, 包括手机 、 手表 、 平板 , 甚至耳机这样的一些设备上的智能助手 。

目前小布其实月活营到将近 1.7 个亿 ,在整个安卓手机里面应该是排名比较靠前的一个 , 或者说活跃度比较靠前的一个运营助手 。

随着大模型在过去两年多的时间里面的发展 , 然后小布助手也在结合大模型的一些技术发展 ,在不断地在变革 ,在体验上 ,在交互上 ,在一些功能上在做一些升级 。

曼祺2:00

我们可以先从 OPPO 最近的一些新的动作开始聊 。 因为马上 10 月 15 号 ,OPPO 就是会开 2025 年的 ODC,OPPO 的开发者大会 。

新体验2:00

曼祺2:08

然后在你们的 ColorOS, 就是操作系统上,AI 也是一个越来越重要的角色 。 你可以讲讲这一次你们大概会有些什么样的更新吗 ?

可能会给你们的用户带来哪些新的体验 ?

万玉龙2:19

整个我们这次会发布 , 我们叫做个人化 AIOS。 首先我们会发布新的一些战略 。 我们认为 AI 在终端厂商去做的话 , 一共会分为三个方向 : 一个叫新计算 、 新感知 、 新生态 。

所谓新计算就是 , 大模型刚出现的时候 ,其实大家会说大模型参数量很多 , 消耗的算力很大 , 需要在做云端部署 。

最近两年的时间会发现 , 模型变得越来越强大 , 然后同时模型的尺寸也越来越小 , 然后能够通过很小的模型就能达成尺寸很大模型的一些能力 。

模型的推理的计算 , 慢慢从云端能够下放到端上, 然后我们作为终端厂商 , 可以结合端云的这种混合的一些协同 , 能够使得我们的体验能够变得更好 。

所以新计算就意味着说 , 我们要用端上芯片和云端芯片的一些能力 , 去使得模型的推理成本变得更低 , 然后反应速度变得更快 。

这是第一个 。 另一方面就是新感知 。 首先模型本身很强大 , 与此同时模型也需要很多的信息输入 , 这个信息输入一定是来自于各种信息采集的 , 这个信息采集包括了硬件的 , 包括了软件的 。

因此我们通过手机上的一些新的传感器 , 硬件的传感器 、 软件的传感器 , 能够获取到更多的信息 , 作为 context 给到模型去做上下文的理解 , 能够给到用户更个性化的一些体验 。

曼祺3:40

这个可以举些例子吗 ? 比如说摄像头 , 或者说扬声器 、 收音的这些东西 , 这是比较常见的 。 还会有什么 ?

万玉龙3:46

最常见的就是传感器带来的一些感知信号 。其实作为手机的智能助理 , 系统级的 AI,其实它可以获取到更多的一些信息 , 比如说用户此时此刻正在看小红书或者某个媒体上的一些信息 , 它遇到了不会的问题 , 它可以直接去问这个屏幕 。

这个时候其实是我们直接把屏幕的信息给到大模型去做理解 。 用户有时候会看到一些自己喜欢的一些文章 , 包括喜欢的一些攻略 , 它需要去收藏 。

这个时候其实我们可以通过一个按键 , 就可以让系统级的 AI 去获取到这个屏幕上的一些内容 , 帮它去理解 , 帮它去结构化信息 , 帮它去形成一些待办项 。

这个其实是我们认为硬件加软件的一些传感信息 , 能够带给模型更多的输入 , 然后同时带来更个性化的一些体验 。

曼祺4:35

对 , 就是 OPPO 的一键闪记的功能 。

万玉龙4:37

对 , 一键闪记和一键问题 ,其实都是增加了更多的感知信息给到大模型去做多元化的一些理解的 。

曼祺4:45

这是新感知 , 还有一个是新生态 。

万玉龙4:46

然后还有一个新生态 。 过去一两年其实大家谈得比较多的一个词就是智能体 , 就 Agent。其实会发现原先以 APP 这个形态的服务载体 , 慢慢在往以智能体为载体的这样一个方式在转变 。

现在你可以看到 , 包括十一期间发布的 ChatGPT 新的一些能力 , 都是把更多的服务通过 Agent 的方式 , 然后集成到超级智能体里面 , 然后让智能体去调度 。其实在小布助手过去一两年的发展中也有这样类似的趋势 , 就是我们也会把一些三方的一些能力 , 通过 Agent 的方式接入到我们的生态里面来 , 然后让用户能够通过简单的一个对话 , 就能完成很多服务的触达 。

举个例子 , 比如说用户说帮我生成一个新能源汽车的一个调研报告 , 我们其实是通过一个 Agent 去完成整个调研报告的输出 。

然后以及像用户会问说附近有没有一些好吃的 ,其实我们背后是通过意图理解 , 再加智能体调度 , 让一个生活服务相关的智能体去为用户去提供这样一个服务的 。

曼祺5:56

那在你说的第二个例子里面 ,其实你们是接了地图 , 或者说接了比如像美团 、 饿了么这种生活服务平台的一些信息的 ?

万玉龙6:04

对 ,是的 。 它们提供给我们服务的方式就是以 Agent 的方式提供给我们 , 然后我们通过 A2A 的这样一些协议 , 来把相应的所需要的一些信息传达过去 , 这样完成相应的 Agent 之间的一个通信 。

曼祺6:18

它不是个 API 给你们的是吗 ? 你说它是 Agent 给你和以前比如说 API 给你的区别是什么 ?

万玉龙6:23

其实 API 是 Agent 之间通信的一种接口方式 , 它并不是一个互斥的一个概念 。A2A 就是在这个基础上会有一些标准化的协议 , 来完成这样通信之间的一些信息的传达 。

曼祺6:39

这个我们之后可以展开 , 就生态这一块 。 这也是我自己比较感兴趣的 。 因为其实在 Web 端的话 , 可以看到 MCP 这种生态 , 它已经比较主流了 。

但是在移动端可能就是我觉得是一个正在形成的过程 。

万玉龙6:50

对 , 然后刚才说的是我们这一次会发布的三大战略 。 与此同时, 这次也会给用户带来一些新的功能特性 , 就刚才您提到的一键闪记 。在上一代 1.0 版本的时候 , 我们只完成了像屏幕上的一些信息的理解 , 图片的一些理解 。在这一次会带来更多模态 、 更多元化的一些闪记的内容 , 比如说用户诉求比较多的视频机 ,他在看一个视频 , 这个视频很长 ,他

自己可能没有那么多时间能够看完 ,以及他看完这个视频之后 ,他需要记很多信息 。 我们现在通过一键闪记 , 就能把整个视频的信息能够记录下来 ,并且结构化地去帮他梳理出来一些关键的内容 , 然后包括里面可能会涉及到一些待办项 , 或者说一些关键的信息 、 日程什么的 , 都可以帮他记下来 。

还有就是语音记 , 用户经常会脑袋里面会想到一个好的 idea, 家人等他出门的时候要给他嘱咐一些事情 ,他突然记不住了 。

这个时候其实就通过一键闪记 , 能够快速地记录下来一段音频 , 然后这个音频能够通过大模型去转化成一些关键的信息和关键的一些待办项等等。

还有就是我们还有很多用户会有记账的习惯 ,他在各个 APP 里面都有很多这种记账的信息 。 以前他可能通过一个 Excel 或者手动输入到一个记账 APP 里面去完成 , 现在一键闪记就能快速帮他去把他的一些账单信息汇总起来 , 然后去做一些账单的一些分析 。

还有就是我们日常现在喜欢点外卖 , 这个外卖里面会有很多的点餐码 , 经常我们要去取餐的时候 , 忘记取餐码是多少了 。其实通过一键闪记 , 就能够快速地把取餐码给记下来 , 流体云上就会有相应的展示 。

你也可以左击右问 , 记下来信息也可以通过小布助手去问 , 说我的取餐码是多少 , 或者说我之前看过那个视频里面主要讲了什么 , 然后还有里面关键的一些信息都可以问 。

这是第一大类 , 就是我们在新感知上做的一些新的特性 。 第二大类就是我们在小布助手上其实也做了一些新的有意思的功能 , 比如说视频问答 , 就有点类似于 Google 之前推出的那个 Oscar。

原先一键问题只能问静态的一些信息 , 比如说屏幕上的 , 或者说一个照片上的 。 实际问答就基本上是进入了一个能够随时陪伴你去问物理世界里面任何事情的一个状态 。

曼祺9:15

就相当于你是把摄像头开着 , 然后摄像头看见的画面 , 你就可以去问智能体 , 对吧 ?

万玉龙9:21

对 ,是的 。 这里面有两个我们认为比较有竞争力的点 。 第一个就是我们结合了声纹 ,因为我们还原到用户真实使用这个产品的场景是 , 它可能是在博物馆 , 它可能是在一个嘈杂的街道上 。

这个时候旁边随便一个人的说话 , 可能就按照以前的产品都可能把它给打断了 。其实我们结合声纹就可以在用户发起请求的时候 , 就记住用户的声音 , 然后能够在嘈杂的博物馆里面只去响应用户的声音 。

第二个就是我们做了一个哪里不会点哪里 , 就是我们有点类似于以前那个步步高 , 给大家点读机那种感觉 , 看到屏幕上任何一个你不懂的 , 你直接点一下就行了 。

点一下它就会结合大模型去回答说你点的这个东西到底是什么 。 第三个就是我们做了一个叫做个性化简报 ,Morning Brief, 或者说 AI Brief, 就是能够结合用户的日程 、 当天的天气 ,以及用户收藏的一些记忆 , 能够给用户一个简报 。

这个简报里面会帮用户去总结当天他需要关心的一些日程信息 ,他可能记下来的一些关键的内容 , 包括可能遇到一些突发的情况 、 天气什么的 , 给他一些温馨的提醒 , 就是我们的个性化简报 。

整个这三个加在一起 , 我们叫做系统级 AI 助理 , 我们能把左击右问打通 , 能结合记忆去给用户个性化的推荐 , 能结合记忆去支持用户去随时随地去搜到一些内容 , 这个是系统级 AI。

与此同时, 我们在相册里面也做了一些用 AI 去帮用户提高创作的一些功能 , 比如说用户在拍照的时候 , 可能光线不是很好 , 所以我们做了一个功能叫做 AI 补光 ,在后期的时候通过 AI 的方式去生成一些能够帮助用户把这个图片做得更美化的一些功能 。

曼祺11:09

对 ,因为我觉得有些功能挺实用的 。 我想追问一下, 比如说你提到记账的功能 , 这个你们怎么去解决它隐私的问题 ?

虽然我是按了一下, 就是我发起这个请求 , 它才记我的东西 ,但是因为它涉及到一些财务信息 ,也可能有你的 , 比如说支付的一些信息 , 这个你们是全部都放在端侧吗 ?

还是怎么去解决 ?

万玉龙11:28

对 , 这个其实就是刚才提到的新计算 。 新计算我们认为终端厂商本身有一个很强的优势 , 就是它端上有算力 , 然后我们端上可以部署一个小模型 , 去完成很多您刚关心的隐私相关的一些数据的处理 , 确保说用户很多敏感的信息都可以在本地做相应的处理 。

曼祺11:50

所以这些都是本地的 ?

万玉龙11:52

这些就是一些脱敏的一些处理 , 都是在本地做的 。

行业与渗透11:56

曼祺11:56

你们现在做的这些事情 , 就是在行业里面 , 我觉得正好可以把整个行业都讲一讲 ,因为包括像苹果 、 三星 , 甚至 Google, 对吧 ?

最近都是在手机和 AI 上都是有些发力的 。 比如说你们现在做的这个事情 ,有特点的地方是什么 ? 以及整个行业里面就能看到的比较主流的一些共识性的趋势是什么 ?

万玉龙12:14

我先谈共识 ,在秋天同意 。 对于终端厂商来说 , 做 AI 其实整个大的战略方向应该是类似的 ,因为终端厂商拥有算力 , 所以它会有新的一些算力的一些策略 , 然后终端厂商会有端侧的一些个性化的一些数据 , 它可以做一些类似于刚才说新感知的一些事情 。

终端厂商拥有离用户最近的入口 , 所以它会做一些服务生态 , 所以在大的战略上应该是类似的 。

但在战术上或者说具体的策略上可能会有一些差异 , 比如说我们可以看到说大家都在做记忆这个事情 ,其实我们的友商很多厂商也在做记忆这个事情 ,但是我们应该是第一家结合硬件给记忆单独添加了一个硬件去做这个事情的 。

曼祺12:58

就是它有一个实体案件可以一键唤起这个功能 ?

万玉龙13:02

一键触发记忆这个动作 , 能够帮助用户更便捷地去使用记忆这个功能 。 所以这件事情我觉得是在战略方向一致的情况下, 战术上不太一样的地方 , 或者说我们选择的策略不太一样的地方 ,因为我们认为这个动作本身能够降低用户使用记忆的门槛 , 然后并且形成一个肌肉记忆 , 随时随地都可以记 。

这个我觉得是一个对于我们来说 , 我们做个性化这件事情更有差异化的一个点 。 实际上在做这件事情的时候 , 考虑的是整个要完全要打通 , 就是记什么 , 我们叫做记得你才更懂你 。

我们希望通过记忆这个事情来更好地去理解用户 , 使得用户在任何时候想去问的时候 , 你都能问出来 , 然后以及在合适的时机能够推出来 。

这件事情我觉得是我们在做个性化这件事情上另外一个比较不太一样的 , 就是我们把记的东西跟问的东西和搜的东西和推荐的东西都给串起来了 。

这件事情我觉得是我们做个性化这件事情不太一样的地方 。 当然行业其实大家也都知道个性化很重要 , 包括 ChatGPT 在做很多事情的时候 , 都是围绕着 memory 去做的 。

包括前两天我看国外的一个播客里面讲到 Sam Altman 在讲说 ,他认为去年做的比较让他有惊喜的一点 , 就是他发现 memory 这件事情对 ChatGPT 来说比他想象的要重要得多 ,因为很多用户会因为有 memory 这个事情越来越爱用 ChatGPT。

曼祺14:32

而且它今年其实上了全局记忆的功能 ,而且我发现 ChatGPT 它是可以管理你的记忆的 。

万玉龙14:37

对 ,是的 。

曼祺14:38

你可以把有些记忆你可以给它删掉 。

万玉龙14:40

对 ,其实我们也有这个功能 。 这次 16.0 上也发布了这样的一个个性化问答的功能 。 这个个性化问答首先要结合用户跟小布聊过的聊天记录 , 就是 chat history, 就你的 history 肯定是一个输入源 , 然后以及刚才说记下来的内容也会做一个记忆源 , 然后以及用户手机里面很多的文件 、 照片其实也是一个来源 。

因此我们认为的 memory 可能更泛一点 ,不只是 chat history,不只是聊天记录 。 像 ChatGPT 它的 memory 更多强调的是我跟你聊过的内容 , 叫做 memory。

我们认为的 memory 包括了 history, 包括了用户强制让 AI 或者说主动让 AI 去记住的一些内容 。memory 还有一个中文翻译叫做内存 , 就是你手机存储里面已经存下的文件 、 照片等等这样一些内容 。

所以这三个内容加起来我们认为是用户的 memory。 这个时候用户问的时候 , 比如说我的体检报告里面我的血脂有多高 , 我上一次体检体重有多重 , 这些信息其实都是我们认为都是用户在手机上这个设备上的一个 memory。

曼祺15:53

对 , 所以就是新感知 , 就是相比 Web 端它其实可以获得的输入会更多 。

万玉龙15:59

对 ,是的 。 而且这个从符合直觉的角度应该也属于用户比较关心的 memory 的内容在 。

曼祺16:05

不过像照片这种信息是要用户授权它才会去记忆什么 ? 就你们新的版本上面 。

万玉龙16:12

首先照片是你可以认为照片是已经用户通过摄像头记录下来的记忆 。 只是说我们在实现这个过程中通过了一些搜索再加 RAG 的方式去让用户能够问出来 。

比如说他问说我跟我小孩合影的照片 , 理论上其实这件事情用户的视角他是想照片里面的记忆给搜出来 。

实现的逻辑上我们就是通过端侧的一个搜索 , 再加上 RAG 去帮用户给搜出来 。

曼祺16:45

然后今年我觉得确实也是大家就是在 AI 和手机结合 , 或者说大家探索端侧 AI 上是一个加速的过程 。

你觉得这个背后的驱动力是什么 ? 为什么现在变快了 ?

万玉龙16:57

首先模型越来越强肯定是一个大的趋势 , 就是你能做的事情越来越多了 。 还有一个趋势是模型越来越强的同时, 它的 context 长度越来越长 。context 越来越长其实意味着说你给模型输入的东西越来越多 , 或者越多样化之后, 它能够给你的体验是越来越好的 。

去年其实过去半年吧 , 过去半年其实一直在讲 context engineering,以前叫 prompt engineering, 现在讲 context engineering,而且大家也认为说 context 越来越重要 。其实你可以认为模型本身还是一个信息处理单元 , 这个处理单元怎么处理得好 , 很多时候依赖你给它的信息 , 这个信息包括 query,query 本身就是那句话 ,也包括你在 query 基础上给它一些 context。

我们经常举例子说我们在做一键问题的时候 , 我们的 context 有什么 ?context 有可能是首先用户此刻打开的 APP 是什么 , 比如说同样问一个问题 , 怎么做 ,query 叫怎么做 ,但怎么做这件事情 , 如果你的前台应用展示的是一道菜 , 用户一定问的是这道菜怎么做 , 然后如果前台应用展示的是一道题 , 用户应该是问的是这道题怎么做 。

所以一道菜和一道题这个 context 非常重要 。 所以这件事情对于我们来说 , 我觉得模型的 context 越来越长 , 然后它能够处理的信息越来越多样化之后, 它的应用的多样化就越来越好了 。

曼祺18:26

对 , 你说这个我有实感 ,因为我有时候就会把多邻国的题截图了 , 我会发给一些大模型 , 我会问得很简单 , 我就说你怎么做 。

万玉龙18:33

对 ,是的 。

曼祺18:34

它是能理解你的意图的 , 就是它知道你是在做这个题 。

万玉龙18:38

对 ,是的 。 还有一个趋势我觉得是这样的 , 就是从整个生态的角度 ,在 23 年的时候我们可以看到百魔大战 , 对吧 ?

然后那个时候基本上好像四家 AI 公司都要自己 pre-train 一个模型 。

曼祺18:52

从头预训练一个 。

万玉龙18:53

对 , 都要尝试去 pre-train 一个模型 , 然后少数公司可能去做一些 SFT 去微调 。 但是从去年开始可以看到一个现象 , 就是模型的成本越来越低 , 基本上每年按照几十倍 、 上百倍的在降低成本 。

模型成本越来越低同时其实怎么把模型用好变成了很重要的一个问题 。 所以去年可以看到应用的创新在不断加速 , 很多公司都放弃 pre-train 了 , 很多公司都在想说怎么把模型用好 , 所以应用的创新会变得越来越重要 , 包括国内外一些现在比较热门的一些创业公司 ,不管是 AI 硬件的创业公司还是 AI 软件的创业公司 , 大家可以看到背后的模型都是那几家 。

曼祺19:38

就模型在几种 ?

万玉龙19:39

对 , 模型在收敛 , 第一是模型的数量在收敛 , 第二是模型的成本在降低 , 使得其实更多的应用创新更多围绕着说你怎么把交互做好 , 你怎么把模型的 context engineering 做好 , 你怎么把用户场景的痛点需求理解好 。

这件事情我觉得是过去一年多发生的比较重要的事情 。

曼祺20:01

因为我觉得其实你把模型做到手机端 , 这肯定是一个很自然的趋势 ,因为手机用的人应该说是比 Web 端是要更多的 。

万玉龙20:11

是的 。

曼祺20:11

它的想象空间是非常大的 。 然后刚才说的是驱动力 ,但另一方面其实可能每天真的就是用手机 AI 能力的人在人群里的占比还是相对小的 。

你觉得它渗透的情况是高于你的预期还是低于你的预期的 ? 包括实际上哪些事是做不到的 , 可能是现在大家会有点高估的部分 。

万玉龙20:35

刚才一开始我们其实有跟大家分享我们的月活 。

曼祺20:38

是 1.7 亿 。

万玉龙20:40

是 1.7 亿 , 将近 1.7 亿 。

曼祺20:40

而且我之前其实我看公开报道 , 就你们 6 月的数据是 1.5 亿 , 对吧 ?1.5 亿到 1.7 亿 ,6 月到现在 4 个月 , 这算是一个很快的增长吗 ?

万玉龙20:50

客观地说这个数据其实是低于我的预期的 。 原因是其实我们很多 , 比如 ChatGPT 或者国内的一些头部的一些 AI 应用 ,其实本身的我们叫做日活比还是蛮高的 。

所谓日活比就是活跃的人群比上激活的人群 。

曼祺21:11

激活 , 激活是什么 ?

万玉龙21:12

一共它安装了 1 亿台 , 然后它每天假设有 1000 万的活跃 , 那就是 10% 的日活比 。其实整个手机厂商的日活比相对来说是没有那么好的 。

曼祺21:26

手机厂商激活比的分布就是所有买了手机的人都算吗 ?

万玉龙21:30

理论上算的 。 所以这件事情其实我觉得还没有达到我的预期 , 我觉得还有很大的增长空间 。 我在分析背后的原因 , 一方面就刚才说其实 Siri 从 2011 年出来 , 然后小布是在 2018 年发布第一版本 。

过去 10 年的时间里面 , 用户对于语音助手或者叫传统语音助手的认知 , 可能是因为受过去十几年的体验影响 , 很容易觉得好像语音助手没有那么聪明 , 体验没有那么好 。

所以习惯性地就可能上来就觉得你不好我就不用 。 然后虽然过去两年多时间其实我们跟友商大家都在努力 , 都在努力通过大模型去改变我们的语音助手 。其实现在客观地说体验上我们跟头部厂商的这些 AI 应用其实体验很接近或者基本上一致了 。

曼祺22:23

你说的头部厂商你指的是豆包这些纯软件的一些 APP。

万玉龙22:26

对 , 就是跟这些大家口味比较好的一些厂商相比 ,其实体验基本上很接近了 。 但是为什么渗透率其实还没有达到我的预期 , 我觉得很多的是用户习惯的培养 。

曼祺22:38

就是当年 Siri 做得太早了 , 反而搞了些负反馈出来 。

万玉龙22:41

也不是因为 Siri, 我们自己也没有做好 , 说实话 。 过去 10 年时间我觉得整个厂商在做 , 或者说整个智能助手这个赛道在大模型出现之前 ,其实都是处于一个没有做得那么好的一个状态 。

你经常会说比较智障什么的 , 我觉得也确实是这个问题 。 但是大模型出现之后其实我们已经让智能助手变得很聪明了 , 然后当然还会因为大模型的幻觉或者说一些其他的一些问题 , 导致它现在有些答案的问题还是没有那么准的 。

但是整体的体验应该是比上一个时代的要好很多 。 然后渗透率我觉得还有很大的增长空间 , 还是有很多用户习惯性地安装一个 APP, 然后再打开一个 APP 去使用大模型 。

很多用户都忘记说原来我手机自带了一个智能助手 , 我觉得这是第一个 。

曼祺23:34

所以这是个心智的惯性的问题 。

万玉龙23:36

我觉得心智惯性还需要去解决 。 第二个是手机智能助手要解决的问题其实要比单独一个 APP 要解决的问题要复杂 。

我举几个典型的 case, 就是第一个手机智能助手要控制好手机的很多内容 , 比如说用户今天说帮我设个闹钟 , 明天说帮我设个日程 , 然后帮我打开蓝牙 。在我们盘点下来可能有上千个这样的手机上的控制指令要去实现 , 这个是单独的 APP 不需要去考虑的 。

第二个就是刚才提到的我们这种像左击右问这种跟手机里面系统级的一些能力强相关的一些问题 , 比如说用户问说成都住哪 , 如果用户曾经已经用左击记下来他在成都的旅程里面有一个酒店 ,他问的问题肯定大概率是我成都住哪 。

曼祺24:30

就是一个特定的地方 。

万玉龙24:31

对 , 如果你直接问大模型的话 , 大模型直接会告诉你说多少家酒店 , 推荐你住哪些酒店 。 所以它是一个通用的问答 。

所以这件事情上实际上是我们做智能助手要去解决的另外一大类问题 , 就是跟用户设备上很重要的一些信息强相关的一些问答 。

第三大类可能是跟三方 APP 相关的 , 比如说用户说导航回家 , 这件事情对智能助手来说一定是我要去调取高德或者百度 , 要去把用户的地址输给它 , 然后去触发一个导航指令 。

这件事情其实是我们相较于一个 APP 而言 , 我们要解决的更复杂的一些执行类的问题 。 四大类问题都要解决 , 通用问答的 , 然后个性化的问题 , 本机的一些控制指令问题 , 还有全局的三方的一些执行类的问题 , 这加在一起可能整体的复杂度就会高很多 。

曼祺25:25

所以是因为复杂度很高 , 就是它的晚辈还需要时间 , 会影响它的渗透 。

万玉龙25:31

对 , 我觉得整体体验就是用户肯定是因为你既然是手机智能助手 , 所以你要解决的问题应该是都要解决好的 。

你解决不好就认为你很蠢 , 这件事情可能是需要就能力提升方面还是需要挺多的 。

曼祺25:47

所以就是它的 bar, 它的门槛是更高的 , 就大家达到一个相对满意 , 或者说用户觉得它是到一个及格线的门槛是更高的 。

万玉龙25:56

对 , 我觉得 AI 产品的确是跟软件产品会有挺大的一个区别的 。 我们经常举例说软件产品就是 by design, 设计成什么样 , 用户就知道它能做什么 , 然后以及用的过程中它的评价预期是多高 , 然后你得分是多高 。

我举个例子 , 比如说日程这个 APP,其实设计完之后用户就知道它应该实现什么功能 , 它能添加日程 , 能删除日程 。

你做的好与坏其实是评价指标是非常简单的 。 但是 AI 类的产品就是一开始很难是 by design 的 , 你很多时候是要去观察用户怎么用它的 。

大模型刚出来的时候 , 就有一个很经典的案例 , 就是用户会问你说林黛玉到吧垂杨柳 , 这个是一个怎么样的一个故事呢 ?

大模型就会认为说既然你给我这样一个命题 , 我就可以去回答你 ,但其实背后有可能用户希望你创作一个小说 ,有可能用户希望你回答一个事实 ,有可能用户只是调侃你 , 跟你聊天 。

这个我觉得是你在不断地去跟用户对话或者说交互过程中, 你才能发现用户背后的预期诉求到底是什么 , 然后不断地去完善它的 。

它需要形成一个 feedback loop 的一个迭代的一个产品 。

曼祺27:13

然后另一方面就是你刚说的你们能做的一些这种系统级的任务 , 如果一个三方的 APP 的公司想来做 ,是不是也做不了 ?

一般手机厂商能开放这个东西吗 ?

万玉龙27:25

我觉得它倒不是开不开放的问题 。 过去一年多有很多厂商其实也在做 GUI Agent。

曼祺27:33

图形界面的 , 然后我可以去调一些三方应用 。

万玉龙27:35

对 , 这个其实也是一种实现操控界面的一种手段 , 对吧 ? 然后很多厂商在演示自己的 demo 的时候 , 它也不需要获取什么特殊的权限 , 它能够去完成界面的操控 。

但这件事情我自己觉得它不是那么符合直觉 。 符合直觉的话就是你操控什么 , 它背后它只要能够直接调起一个接口 , 或者说调起一个指令它就可以实现 , 它没必要非要去理解屏幕上的很多的元素 。

曼祺28:07

那是因为有些第三方的 APP 它没有开放调的接口 , 它不想被人调 。

万玉龙28:12

对 , 一个是因为当前的所有的生态和服务其实是建立在各个 APP 内的 , 所以使得现在大家习惯性地认为说我是不是直接通过理解 APP 内容去操控它就行了 。

但这个我自己觉得还不够 AI native。AI native 的话更多它应该是一个把能力原子化 , 然后把能力原子化之后通过某种方式提供给模型 , 让模型能够理解并且去调度的一个事情 , 就是模型天然地具备 function call 或者 tool learning 的一些能力 。

这个一个一个能力应该是作为 function 或者 tool 去给模型去调度的 ,而不是说让模型反向去理解这个界面 , 然后再去点击那个界面 。

我觉得这个还不太符合直觉 。

曼祺29:00

其实我们之前做了一期节目 , 就是智谱的 AutoGLM, 它在手机端就是你刚才说的 GUI 这种方式去实现的 。其实它两种都有 , 它有一些是 API, 然后它也有一些是 GUI。

万玉龙29:11

对 ,是的 。

曼祺29:11

以现在这个模型在手机上的表现 , 包括因为它 GUI 的话 , 相当于你得有一个云手机 , 一个云账号去接管你的屏幕 。

这个体验确实很多用户会反馈觉得一个是会比较卡 , 然后另外就是如果比较复杂的操作 , 大家会觉得我直接在 APP 里我人点的比大模型快多了 。

万玉龙29:31

对 , 我觉得是这样的 , 的确它会带来两个问题 。 第一个问题就是它会阻塞用户使用手机的过程 。

曼祺29:40

它其实倒是你可以把它放到后台 。

万玉龙29:43

但是放在后台这件事情就是进入到另外一个问题 , 你如何去继续去理解 , 就持有界面的一些信息 , 这件事情是比较其实三方 APP 是很难的 。

所以这个时候其实反倒是刚才您提到的就是系统级的 AI 应该要去做的事情 。 如果放在后台去理解运行执行过程 , 理论上很多的界面的获取或者服务的一些调度其实是需要系统级的一些权限的 。

否则的话 , 一个三方 APP 调度另外一个三方 APP 在后台也很奇怪 。 然后第二个问题就是现在很多的 GUI Agent 其实是不断地要去在端上去执行的 。

它有一个小模型去在端上去跑 , 整体的功耗 , 然后包括一些发热什么的 , 可能都是一个问题 。

曼祺30:37

对 , 我觉得就是从系统层面去做一些控制 , 这个确实是手机厂商或者比如说 Google 这种 , 就是它自己是手机操作系统的一个比较主导的生态的主导者 。

这一类公司可能做这个事是更有优势的 。

万玉龙30:51

对 , 这个是更有优势的 。 以及我还是认为如果真的让用户觉得比较丝滑的体验 , 应该是通过一些能力原子化之后, 让模型去调度它就 OK,而不需要去实时地去理解屏幕到底有哪些操控元素 , 然后去操控它 , 这个还是有点中间态的 。

三大场景31:12

曼祺31:13

对 , 我觉得接下来正好可以展开地再讲讲 OPPO 自己的实践 ,因为你们现在其实有一个比较清晰的战略 , 就你刚刚提的新计算 、 新感知 , 还有新生态 。

万玉龙31:24

新生态 。

曼祺31:24

对 ,而且你也提到了你设想中的你觉得在手机上的 AI 它应该有的一些特性 , 比如说刚才提到的有个性化 , 还有服务的原子化 , 还有比如说你们做的简报这种其实是一个主动的 AI, 这也是包括海外也都讨论比较热门的一些话题 。

我们可以展开讲讲你们这些思考是怎么形成的 , 你们最开始的起点是什么 ? 这一轮 AI 热潮来了之后 。

万玉龙31:48

首先是这样的 , 我觉得 AI 只是技术 ,AI 只是技术 , 所以它要解决的核心还是用户的场景问题 。

所以我们一开始其实还是在大模型这一波 AI 出现之后, 我们去识别了一下用户在手机上到底哪些是真正可以用 AI 去改变或者提升的一些场景体验 。

曼祺32:10

这是 23 年的时候 。

万玉龙32:11

过去一两年其实我们不断在一直在反思或者分析这个事情 。 我们整体分析下来 , 我们认为手机上用户用 AI 或者说可以用 AI 去改变的场景体验主要会分为三大类 。

第一大类就是生产力场景 , 就是用户会拿手机去学习 、 去办公 , 这是一大类很重要的需求 。 而且 AI 作为生成式 AI, 就 Generative AI 其实能够很好地把生产力的效率和质量能够提升起来 。

曼祺32:41

对 , 这也是它最开始引爆的那个点 ,其实 ChatGPT 它就是一个比较典型的可以帮你提升生产力的一个工具 。

万玉龙32:47

对 , 所以这第一大类我们认为一定要做好的就是生产力场景 。 第二大类就是生活场景 , 就是用户在手机上一定会希望完成很多的 , 比如说信息的获取 、 服务的获取等等这样一些事情 。

这件事情实际上对用户来说是生活类的场景 , 所以生活类的场景也是一个很重要的 。 第三大类就是影像类的场景 。

我们现在基本上出门很少有人会带相机出去 , 都是直接用手机拍 , 拍完之后在手机相册里面去做相应的编辑 。

所以影像类的场景我们认为在手机上是一个很重要的场景 。 所以在识别到这三个很重要的场景之后, 我们对整个 OPPO AI 的定位就会去做三个关键的赛道 , 或者说三个关键的定位 。

第一个叫做生产力助手 , 就是我们要成为用户在生产力场景的一个很高效的助手 , 能够帮用户去完成很多生产力的一些任务 。

第二大类就是生活管家 , 能够帮用户去处理好很多生活上的一些琐事 , 包括日程的管理 、 信息的管理和服务的管理 。

曼祺33:52

包括记账这种应该也算 。

万玉龙33:53

记账也算是生活管家的一部分 。 第三大类就是影像搭子 , 我们认为 AI 能够很好地去帮用户拍好照片 、 管理好照片 ,以及在照片的一些编辑过程中也能够帮用户去提效 , 降低用户使用图像编辑的一些门槛 。

以前可能需要 Photoshop 这样一些很专业的软件 , 现在你只要一句话就可以帮它完成去反光 、 去路人等等这样一些操作 。

所以这三个关键的场景是我们认为回到用户本身去识别到的需求 。 第二个就是一定是双向奔赴的 , 技术的发展趋势也会去匹配场景的需求 。

像刚才你聊到的 ,ChatGPT 引爆实际上本质上是因为模型具备了很强的一个生成创作的能力 , 它能够服务好生产力助手 。

与此同时 ,在模型出来之后, 很长一段时间都是在讲 RAG, 就是搜索增强 。 搜索增强能够帮用户去完成很多信息的获取 。

现在其实很多公司做 AI 类的产品 , 包括 Perplexity, 本质上是在颠覆原先用户获取信息的一种方式 , 就是原先可能得靠搜索 , 现在我不需要去搜 ,不需要去看我搜索结果 , 只要问就行了 。其实问这件事情因为有 RAG,有 Context Engineering, 使得生活管家这类的任务能够做得很好 。

第三个就是多模态大模型的发展 。 多模态大模型 , 包括 Sora2,其实可以看到能够引爆的话 ,是因为大家觉得以前我要编辑一个视频 、 编辑一个图片 , 需要很强的专业能力 。

但是我发现现在模型具备这个能力 , 我能很快地通过模型结合一张图和一个 query, 就能完成一个图片和视频的编辑 , 刚好匹配到了影像搭子 。

整个模型的发展和我们手机上的需求的场景的定义其实很匹配 , 然后这件事情就刚好是比较 match 的 。

曼祺36:01

对 ,其实我觉得 Sora2 它也反映了这个 AI 再从 Web 端到移动端的这样一个变化 ,因为其实你用视频生成这个模型 ,因为包括之前可灵海螺 24 年的时候在网页端它就已经是相对是可用的 ,但是 Sora2 它是一个手机的 APP,而且从 OpenAI 的角度 , 我觉得他们就是在主推移动端的 。

因为你现在去看它的技术博客 , 它第一个部分也是引导你去下载它的手机的 APP。

万玉龙36:30

因为我觉得手机首先它肯定有一个趋势 , 就是手机的算力会越来越强 , 然后以及用户使用手机的频次肯定是越来越高的 , 然后用户在手机上完成的很多任务也会越来越多元化的 。

从一开始可能只是打电话 , 到后面我可以拍照 , 再到后面我可以浏览网页 , 我可以安装很多 APP 去处理很多信息 。

到现在因为有大模型的增持 , 我可以在手机上随时随地都可以问问题 , 然后我可以随便拍一个东西 , 我就可以完成一个创作 。其实现在手机能够承载的任务会越来越多 。

曼祺37:11

对 ,因为其实手机早就比 Web 端要更全方位地进入我们的生活 。其实在 Web 端干的很多事它都是跟你工作相关的 ,但是在手机端你是有很多消费相关的事情 、 泛娱乐相关的事情 。

这个我觉得可能是大模型这一波热潮在之前没有那么多涉及的地方 ,但是 Sora2 我觉得它打开了一个这样的潜力 , 就消费端泛娱乐端 , 它也会因为大模型带来有可能挺大的变化的 。

万玉龙37:37

对 ,是的 , 多模态大模型本身其实带来了更多可能性 。 首先原先 ChatGPT 或者 GPT4 以前更多是处理用户的文本信息 ,但多模态大模型使得你看 Sora2 它不仅能够生成视频 , 它还能够配音 , 然后它的里面的不管是声音还是音效 ,其实都是很匹配那个场景的 。

这个我觉得是现在手机能够降首先它降低创作门槛 ,其次对于用户来说 , 它手机就是天然的一个很容易去触达服务的一个设备 , 它能够把这个东西给做得更好 。

产品方法38:17

曼祺38:17

对 , 你刚刚讲的是你们大的思路 , 就是你们对需求是怎么甄别的 , 然后你们觉得技术上可以怎么去实现 。

然后这次我看你们有些我觉得非常细致和贴心的一些更新 , 包括比如说我点了一个瑞幸或者点了一个什么蜜雪之后, 它会有一个码 , 然后这个码会浮在手机的导台上, 还有记账这些功能 。

这些特别细的需求你们是怎么去发掘的 ?

万玉龙38:43

首先像我拿记账来举例 ,在去年年初开始 ,其实我们公司组织了一些叫走入一线 、 深入一线的一些活动 , 我们叫圆点之旅 , 就是会召集很多园林用户以及我们的导购一起坐在一起去聊说这些用户到底会怎么使用手机 , 然后在手机上会遇到哪些痛点 , 然后使用 AI 的时候遇到哪些问题 ,以及他们日常使用 AI 到底最高频的场景是什么 , 然后还有哪些问题

没有得到解决 。 这个是用户的 , 然后也会问一些导购说你在跟用户去推荐手机的时候 , 用户最关心的到底是哪些特性 , 然后有没有一些用户会到店里面去咨询一些问题 。

这一系列活动其实会帮我们去完成对用户场景的一些识别 。 然后刚才说的记账 ,其实我们在用户访谈的时候就会有很多用户 , 尤其是年轻的一些用户会说他们有一些记账的习惯 ,但是没有很好的工具去把这个东西能够实现 。

曼祺39:51

你说的年轻用户是多年轻 ?00 后吗 ?

万玉龙39:54

大学生群体 , 还有刚步入职场的一些职场新人。

曼祺39:58

我感觉以前好像不是很流行记账 。

万玉龙40:00

对 , 这个其实也是我觉得跟我的就一开始我听到记账这个需求的时候 , 首先我不是一个记账的用户 , 所以我是不太理解的 。

但是这就是我觉得圆点之旅带给我的一个或者一个冲击或者一种改观 。 我们会发现你去实地地去跟一些真实的用户去接触的时候去了解 , 尤其是过了几场之后, 你会发现有一些共性的需求是你作为用户你未必是需要的 ,但是他们是很需要的 。

然后这类需求你作为一个需求实现方一定是要去满足的 。 所以这个我觉得是挺有触动的 , 就是你去聊一聊 , 你会发现原来你只是其中一个个体 , 还有很多用户其实是有这个需求的 。

然后以及我们会发现在我们会对外有一些发言人, 比如说陈曦或谁 ,他们的微博下面也会有一些用户天天会评论说你们什么时候推出记账功能 , 什么时候推出什么什么功能 。

这类功能反馈越来越多之后, 我们会发现原来用户真的有这样的一些诉求 。 然后我们就会去跟用户去共创说你们日常是怎么记账的 , 你们日常记账的时候到底遇到了哪些痛点 , 然后再去帮他们去看说我们如果这么实现的话 , 你们觉得 O 不 OK, 需不需要有一些其他的一些更好的一些方式来满足你们的需求 。

这个过程一定是反复跟用户需要去共创才能去发掘 , 然后去满足好的 。

曼祺41:37

因为现在来做 AI 类的应用或者说功能 , 它有一个比较难的地方 , 就你的技术发展得特别快 。 因为以前其实我觉得大家更多做产品的方式是技术它是相对定型的或者说相对稳定的 , 然后我根据需求 , 我去从技术的工具箱里找一些可以匹配的满足需求的东西 。

现在可能你要非常有节奏感地去做这件事 , 它是比较难的 。 而且手机又对你的各种稳定性 、 成熟度要求比较高 , 你们会怎么解决这个问题 ?

你们在流程上有些什么变化 ?

万玉龙42:09

对 , 我觉得这是一个很有意思的一个问题 。 的确以前的软件产品很多时候是 by design 的 , 基本上是先识别到用户需求 , 然后去设计这个需求 , 然后技术只是去实现这个需求的一种手段 。

尤其是过去两年, 我们也跟行业里面很多头部的一些厂商 , 就 AI 厂商的核心人才也交流过 。 现在 AI 的很多产品是你先发布 , 然后再看用户到底怎么用它 , 然后再结合用户高频的一些需求去给它更好的一些交互设计和体验的闭环 , 去完成更好的一个功能的升级 。

然后背后的核心逻辑在于说我们可以认为说模型现在很多是无所不能的 ,并不是等于无所不好 。

比如说 ChatGPT 刚出来的时候 ,有些用户会拿它去写文章 ,有些用户会拿它去问问题 ,有些用户会拿它去聊天 。

它基本上只是提供了一个很简单的一个交互界面 , 剩下的所有的功能其实都是用户自己去 。

曼祺43:14

你当时自己是怎么用它的 ? 刚出来的时候 。

万玉龙43:16

我刚出来的时候 , 第一我肯定是结合我们自己的产品遇到一些痛点去看看它答得好不好 。 比如说以前我们很多以前做对话系统的时候 , 很多是先通过一个意图识别 , 然后再做对话管理 , 然后等等的 。

然后很多时候 , 比如说多轮对话 , 很多都解决不是特别好 。 然后 ChatGPT 刚出来的时候 , 我们就会去试说以前那些问题是不是现在能解决好 。

发现原来可以解决好的时候 , 我们就要思考说怎么把它用好 。 这个我觉得是一个跟以前产品不太一样的 。

以前产品真的是 by design, 然后后来去实现就 OK 了 , 甚至有时候靠堆代码写规则就可以完成的 。 现在的话 , 大模型很厉害 , 然后不管是文本大模型还是多模态大模型 , 就是你丢给它一张图 , 然后丢给它一个音频 , 丢给它一个文本 , 它可能就能把很多的问题回答好 。

这个时候其实更多需要的是你要去识别用户怎么用它 , 然后用户在使用它的时候 , 哪些是高频的痛点的问题 , 然后你再去通过一些更好的策略去给它更好的交互体验 , 更好的视觉表现 , 更好的一个定制的一些方案 。

曼祺44:35

你们的部门需要调整吗 ? 包括你们的流程合作需要调整吗 ?

万玉龙44:39

研发流程肯定会有一些调整 。

曼祺44:41

比如说像以前你们的需求识别 , 我理解那是有比如说一些市场调研的部门 , 对吧 ? 然后可能也有硬件工程的部门 ,也有软件研发的部门 。

它现在是需要比如说把有些人会要怎么合在一起 ?

万玉龙44:53

现在其实我们会认为 , 比如说以前的产品经理更多是用户产品经理 。

曼祺44:58

用户产品经理 。

万玉龙45:00

它更多是自己去理解或者说想需求 , 然后去设计需求 , 去给研发提需求 。 现在一方面用户产品也会需要 ,因为它还是有很多跟用户直接交互的一些界面什么的需要去设计 。

还有一部分我们定义为叫做策略产品经理 。 策略产品经理就是不断地去看或者去识别用户到底是怎么用它的 , 通过比如说分析线上的日志 , 然后去看用户的一些反馈信息 。

比如说我们上线之后, 用户有点赞 、 点踩 、 转发 、 复制等等这样一些行为 , 这些行为背后其实是一种反馈机制 。

曼祺45:41

所以这一些是比较数据驱动的是吗 ?

万玉龙45:43

对 , 这些就是我们要去看说有哪些方式能够让用户更愿意去转发 ,有哪些策略能够让用户更愿意去长期地跟你对话 , 多轮的 ,以及用户他可能会问哪一系列的问题 。

曼祺46:01

对 ,因为我以前就是访谈过一个 AI 创始人 ,他以前是在 OPPO 做过产品的 , 就是 Uweir 的创始人名超平 。 然后他当时回顾他在 OPPO 的那段岁月 ,他就讲得非常浪漫 。他说 OPPO 有很多很古典的产品的方法 , 比如说他们可能会去在早高峰的时候坐地铁 , 然后看这些人是怎么用手机的 , 手机的电量是怎么样的 , 戴耳机还是不戴耳机等等等等。

然后后来他去字节剪映也是在做产品 , 然后他说那边可能就是 。

万玉龙46:29

数据驱动 。

曼祺46:30

对 , 数据驱动 , 然后迭代得非常快 。他可能一年里就要更新很多很多版本 。

万玉龙46:34

现在其实我们也是 , 最早的时候我们刚 21 年左右的时候 ,其实我们发版基本上是一个多月发一个版本 , 然后到今年年初的时候 , 我们最快的时候一周可能就得发一个版本 。

因为真的变化很快 , 尤其是 DeepSeek 出来之后, 我们应该是最早一批接入 DeepSeek R1 的 , 然后很快地就通过 R1 去重构了我们线上的对话体验 , 包括多模态的一些问答体验 , 就很快地要去适应这个事情 。

整体的研发节奏就要更敏捷一些 。

曼祺47:08

你们这个工作变得更多 , 然后发版更密集 , 你们是靠扩充人来解决 , 还是用什么别的方式来提升效率 ?

万玉龙47:16

客观地讲 , 资源永远是紧缺的 , 永远是有限的 。 所以更多时候去调整一些 , 比如说把需求拆得更细 , 把版本排得更紧一点 , 然后可能当然也离不开就加班加点去攻坚什么的 。

曼祺47:34

现在中国的主流手机厂商 , 就是 AI 的这种部门 , 一般在一个什么量级的规模 ?

万玉龙47:41

大几百人。

曼祺47:42

大几百人 ?

万玉龙47:42

嗯 。

曼祺47:43

如果和影像比了 , 就行业的一个整体情况 。

万玉龙47:47

当然现在整个 AI 其实还是属于一个探索再加创新的一个阶段 , 应该还跟影像基本上也是在追齐的过程 ,但是这不存在一个对比的一个问题 。

曼祺48:00

因为之前可能大家会觉得就是手机智能手机可能在最近的至少有五六年的时间 , 就曾经认为没有那么多的更新 , 然后大家觉得很多的就是影像 , 觉得会帮你去卖手机才是有作用的 , 就影像是个比较明显的刺激 。

卖点与粘性48:00

曼祺48:18

比如说像 AI 它现在在帮手机厂商去卖手机这件事上, 它有多大的作用 ?

万玉龙48:24

首先它是因人而异的 , 整个大的趋势上目前来看还不够成构机的因子 。AI 本身并不是一个就是因为有了它 , 它一定能够带来销售量的 , 这是一个客观事实 。

至少现在很多用户不会说你的 AI 好 , 所以我要买你的手机 , 这个是很难的 。 我觉得 AI 更多是一个有点类似于售后体验 , 就是你买了之后, 你觉得这个手机特别好用 , 然后它能够形成口碑 , 能够形成粘性 , 然后进而增加用户对这个品牌的好感度和复购的意愿 。

我觉得这个是一个更重要的一个因素 。 我们在做 AI 的时候 , 更多是看更长期的 , 就它面向未来更长期的一个发展 , 用户对这个品牌 , 用户对这个生态 , 用户对这个设备本身 , 它到底能不能形成一个很好的口碑 、 粘性和

使用的习惯 。

曼祺49:23

然后因为整个手机端的 AI 的链条其实很长 , 你们现在哪些部分是你们自己来做 , 哪些部分是你们和合作伙伴来做 , 你们是怎么去划分的 ?

因为其实 OPPO 它是也和一些大模型公司有合作 , 包括像 DeepSeek 你刚才提到的 , 还有借阅星辰 , 还有通义千问等等。

万玉龙49:41

我们有一句话叫做 " 独行快 , 众行远 ", 就是我们认为就在上一个时代做手机的时候 , 它本来也是一个集大成者 , 就把芯片 、 摄像头 、 很多电池什么的要集成在一起 , 为用户去提供一个很好的完整的一个产品 。在 AI 时代其实也是这样一个逻辑 , 你没必要把所有事情自己做了 , 然后你需要的是怎么考虑把这个市场上最好的合作方的方案 ,以及自己的一些能

力 、 自研的一些能力结合起来去提供一个更好的体验给到用户 。 然后这第一个就是从手机厂商本身的集大成者的定位来说 , 它本来就不需要所有事情都做了 。

然后第二个就是每个公司自己的定位来说 , 它本来就各自有自己擅长的地方 。 就像 22 年底 ChatGPT 出来之后,23 年其实有一个百模大战 , 那个时候大家都好像都觉得自己要 pre-shine 一个模型 , 然后都搞一个百亿千亿的模型去训训看看 。

但是你会发现到现在为止 , 整个大模型的玩家 , 就模型本身的玩家其实在收敛 , 国内可能现在可能不到 10 家在 pre-shine 模型 。

曼祺50:54

OPPO 当时考虑过自己去预训练吗 ?

万玉龙50:56

考虑过 。

曼祺50:57

考虑过 。

万玉龙50:57

对 , 就是我觉得基本上那个时候还是大家都有考虑的 。 但是到现在的话 ,其实我们认为是不是自己一定要 pre-shine 并不是一个关键因素 。

曼祺51:08

后来是什么时候觉得其实没必要这样 ?

万玉龙51:11

基本上到去年上半年的时候 , 我们认为 pre-shine 这件事情对手机厂商来说不是一个关键控制点 。 我们认为关键控制点是你如何去把模型用好 , 然后在一些更能打出长版的一些特性上去做好你的自研模型 , 然后更通用的一些模型上 ,其实直接可以复用行业最好的供应商的方案就可以了 。

曼祺51:37

所以模型自研这部分 , 你们现在可能是做一些后训练和强化学习 。

万玉龙51:41

三部分都会做 。 第一部分就是基于开源的模型去做一些强化学习 SFT 的一些微调的工作 。 第二部分就是刚才反复提到的 context engineering 的工作 。

曼祺51:54

上下文工程的部分 。

万玉龙51:55

上下文工程的工作 。 第三个就是我们会在一些偏感知类的模型上, 然后小的模型上会去做自研 。 背后的思考逻辑在于说 ,有一些模型其实是你能够结合用户的反馈闭环 , 结合真实的线上数据 , 能够去做得比通用方案更好 。

这个模型我们一定会考虑自研 。

曼祺52:21

而且这个你们有数据优势 , 对吧 ? 因为你有 。

万玉龙52:23

对 ,有数据优势 , 然后以及它的闭环 。 它的训练成本其实也没有那么高 ,而且长期做的话其实是能形成比较好的壁垒的 。

曼祺52:33

OPPO 现在 AI 的人才主要是从什么地方招募 ? 来源主要是什么 ?

AI人才52:33

万玉龙52:38

其实还挺多的 。 海外的话其实也有从海外引进的一些人才 , 然后国内的话其实大家熟知的一些大厂其实都会 。

然后我自己其实在 15 年到 21 年是在大模院 , 然后也经历了通义实验室之前的很长一段时间 , 比如说 IDST 和大模院的一个过程 。

曼祺53:00

你当时在大模院是在哪个实验室 ?

万玉龙53:02

我在语音实验室 。

曼祺53:03

语音实验室 。 然后 21 年你当时想从阿里来到 OPPO 这边 , 你当时看到的想做的事情就是把比如说一些智能的能力和硬件做更多的结合是吗 ?

万玉龙53:14

对 , 首先我自己在 15 年到 21 年的时候其实做了很多设备 , 包括 15 年的时候我们那时候在做阿里 OS 手机 , 那个时候在做语音的助手 。

那个时候做语音助手跟现在肯定是方法论上或者说很多技术战场其实差距还挺大的 。 然后后来也做了车 , 智能座舱也做过 , 然后机器人也做过 。在 16、17 年的时候 , 就是阿里机器人做 Pepper, 跟软银合资那家公司上面的语音助手其实我当时也在负责 。

然后到后面也去做了像原厂电视 , 那时候还考虑说不用遥控器 , 坐在沙发上直接可以跟电视对话 。

曼祺53:57

原厂就距离比较远的这种语音的交互 。

万玉龙53:59

对 , 就不需要任何遥控器直接跟它对话 。 然后到 18 年的时候 , 当时我在负责高德地图的语音助手 。

那个时候其实各种设备都做过 , 然后到 20 年底 , 然后 21 年初的时候 ,因为那个时候基本上你什么设备都做过之后, 你就在想说 AI 这个东西其实很依赖用户反馈 , 很依赖去尝破后续的去建立很多体验升级的策略 ,而不是做完之后可能就放在那 。

它不是一个软件产品 , 所以可能需要说你找到一个用户规模足够大 , 然后并且能够持续地演进的一个场景 , 能够持续地去做 , 可能才能把这个体验做得越来越高 。

它一开始可能是六七十分 , 慢慢慢慢随着你数据的闭环 , 然后以及用户的反馈 , 你可能慢慢做到八十分 、 九十分 , 然后可能离用户期望的那个一百分永远有一定的 gap。

但这也是我觉得做 AI 这件事情比较有趣的地方 , 就是你永远离用户的那个预期有一些 gap。

曼祺55:04

对 , 就像你在追逐一个地平线一样 。

万玉龙55:06

对 , 就你无限逼近那个体验极限 , 这个过程我觉得是比较有意思的 。 很多产品其实你做完之后, 用户他的预期就到那了 ,但是 AI 是你做成什么样 ,他都觉得你有进步空间 。

我觉得这件事情比较有意思 。

曼祺55:22

对 ,因为其实你刚才就是讲的你之前做的那些设备 , 它都算是 IoT 里的各种各样的设备 ,不过手机才是 IoT 这个领域里真正就是量最大 , 然后用户基数最多 , 你想要的这种数据反馈和闭环也最强的一个地方 。

万玉龙55:37

对 , 手机跟其他几个设备相比 , 它有几个特性 。 第一个特性是它真的离人最近 , 然后它能够陪伴人的时间是最长的 。

从算力的角度其实也是比较靠前的 , 它能够处理很多用户的一些信息 , 用户在上面完成的事情也是最多的 ,不管是拍照 , 然后创作 , 然后包括刚才提到的影像什么的 ,其实有很多事情它都会在这个设备上完成 。AI 能在上面发挥的作用其实也是最大的 。

然后这是第一个 。 第二个是它其实是这些 IoT 设备的一个中枢 ,不管你今天戴表还是戴耳机 , 还是拿个 Pad,其实你很多信息还是会回答手机上, 你还是会在手机上去看你的睡眠数据 , 你还是会在手机上去听你的音乐 , 还是会在手机上去同步你的很多的内容 。

很多的车也支持手机钥匙 , 你拿手机就可以开锁 。 然后我觉得手机本身是一个多设备的一个中枢 , 这个事情是对 AI 来说是非常重要的 。

因为 AI 除了完成单一设备上的体验升级以外, 它还要去完成跨设备的一些 cross device 的一些智能的协同 , 这件事情也很重要 。

第三个就是手机里面的很多复杂的一些传感器 , 然后系统 , 包括集成的一些策略 ,其实是可以赋能到更多的设备上的 。

它从手机衍生出一个新的设备是更容易的 。 所以有很多我觉得在 AI 时代的更多的可能性其实是可以从手机出发去做的 。

曼祺57:11

因为刚才是从人才吸引讲到这 , 讲到您当时自己就是想去一个手机公司是怎么决策的 。 现在你们从大厂吸引一些人 ,因为 AI 人才的竞争非常激烈 , 你们吸引他们的点是什么 ?

万玉龙57:23

首先我觉得一定是要志同道合的 。AI 这个赛道很大 , 对吧 ? 很大就意味着你可以做很多很多不同的事情 。

你可以去 pre-shine 模型 ,也可以去做产品化 ,也可以去做 infrastructure,有很多事情可以去做 。 手机厂商本来做 AI 的站位 , 它选的赛道就跟你做一个模型预训练肯定是不一样的 。

所以我们去跟我们的同学去交流的时候 , 一般会聊几个问题 。 第一个问题是你到底对什么事情更富有激情 ?

做纯技术的模型训练更有激情 , 还是你需要去做一个产品 ,并且一发布就能影响上亿人更有激情 ?

曼祺58:04

这个确实是 。

万玉龙58:05

这个东西我觉得是一个很关键的一个因素 , 这是第一个 。 第二个就是组织文化 。OPPO 是一家在组织文化里面讲求所谓本分的一家公司 , 所以它很多时候就是它做很多事情是比如说刚才讲到的原点之旅 , 它会回到本质去思考说做这件事情为什么要做 , 到底做什么东西用户才能满意 , 这一类回归本源去思考问题 。

第二个就是团队内去合作的时候 , 它很多讲究本分 , 就是你要做很多事情要求责于己 , 然后你要去把很多事情要突破自我的局限去做很多可能正确的事情 , 应该做的事情 , 把事情做对 。

这件事情我觉得是挺吸引人的一个点 。 因为我待过的公司比较少 ,其实我就待过两家公司 , 一个是阿里 , 一个是 OPPO。

我觉得文化底色是很相似 。 阿里的价值观叫做客户第一 , 员工第二 , 股东第三 。 然后 OPPO 其实本分背后其实也是类似的 , 就是用户一定是第一的 。

你做很多事情一定要站在用户的视角去思考 , 到底为什么做 , 怎么才能把它做对 。OPPO 还有一个很经典的案例就是一定要让自己的合作方不受损 ,不能因为一些事情影响了你的合作伙伴的一些利益 。

这个我觉得其实跟刚才讲到阿里的客户第一是很相似的 。 我觉得伟大的公司它背后的除了事情本身之外的文化都是很相似的 。

曼祺59:41

对 , 我觉得就是从文化 , 从很多公司的一些做法上, 我们可以聊聊最后一个部分 , 就是整个行业未来的生态可能会怎么演变 , 然后行业未来会怎么变化 。

生态竞合59:41

曼祺59:51

因为现在确实有一个客观存在的 , 我觉得你可以叫竞争 , 就是很多不同类型的公司其实都想来做离用户最近的 ,在端侧的或者说一个移动端可以跟你每天在一起的一个智能助理的入口 。

包括比如说像字节这样的公司 , 它也在考虑造手机 , 这有点像 10 年前阿里那会儿也想做手机 OS, 对吧 ?

然后很多 APP 的厂商 , 就这种超级 APP 的厂商 , 像美团 、 高德他们也都在推出跟自己的服务和应用相关的一些智能助手 。

你会怎么去看这些不同类型的公司 ? 我觉得至少有三类 ,有超级厂商 ,有手机厂商 ,有一些大模型的新的公司 ,他们其实都想做这个方向 。

你觉得大家是一个什么样的竞合关系 ?

万玉龙1:00:37

我觉得很多是这个行业足够大的时候 , 每家都有自己的可以玩的游戏 。 就像移动互联网时代 , 一开始在应用生态没有起来之前 , 可能大家都是卖手机 , 那时候手机品牌也很多 。

手机品牌收敛了 ,但手机里面应用生态起来了 , 每个 APP 都可能成为一个千亿级 、 万亿级的市值的一个公司 。

并不是说一个 APP 市值就做不好 , 或者说产生的价值就不大 , 它也可以产生很大的价值 。 所以我只是拿移动互联网时代的例子来说 , 就是市场足够大的时候 ,其实每一家的定位和玩的赛道其实都可以有差异化的 。

回到 AI 时代 , 我觉得 AI 的赛道一定不止移动互联网时代那么大的赛道 ,AI 的赛道一定还会更大 。

这里面可以玩的内容也会很多 , 很多公司也在尝试做一些硬件 , 包括你刚刚提到字节做手机 , 我觉得它做这件事情背后的思考是什么 , 可能可以再去了解一下 。

它未必是真的要做手机 。

曼祺1:01:48

它可能要去什么 ?

万玉龙1:01:49

它可能要去用这个东西去探索一些新的硬件 。 就像我刚才说 , 手机是一个很复杂的一个把硬件 、 软件 、 然后 AI 整合在一起的一个设备 。

它能做好这个就意味着它能做好更多的 AI 的一些硬件 。

曼祺1:02:06

衍生的逻辑不是它手机得做好吗 ?

万玉龙1:02:09

未必 。 它可以用这个去做 , 比如说一些里面的一些 OS 的探索 。

曼祺1:02:16

你就说也是一个练兵 , 或者说我去锻炼这个能力的 。

万玉龙1:02:20

我觉得是一个练兵场 , 就是未必说真的一定要做出一个什么手机 。

曼祺1:02:26

因为其实你经历过就是阿里当时做手机 OS, 就是一个这种互联网的公司 。 那会儿我觉得阿里应该算是一个互联网公司 , 来做一个这种新的领域 , 就是这种硬件科技 。

你觉得就这一类公司来做手机 , 它的难点或者说卡点会在哪 ?

万玉龙1:02:44

阿里那时候做阿里 OS 不是说我要做一个阿里手机 , 它做的是阿里 OS,并且赋能当时的很多的手机厂商去做系统的移植 。

曼祺1:02:56

它是想做安卓类似的事情是吗 ?

万玉龙1:02:58

对 ,是的 。 我觉得每家厂商做一件事情的背后的 why 是不太一样的 。 可能大家更容易看到 how 的部分 , 或者 what 的部分 ,但是 why 的部分其实是差异很大的 。

就像我们做 AI, 我们的 why 一定不是说我要成为一个 AI 模型公司 , 我们做 AI 的 why 一定是我们怎么能够让手机服务用户的体验变得更好 , 如何让我们多设备的跨设备的体验能够变得更好 。

字节做 AI 的 why 大概率是围绕着它想去做的赛道 , 比如说整个的服务生态 , 或者它内部的一些应用生态能够变得更好 。

比如说它做多模态大模型 , 大概率有可能是想让它的剪映的视频编辑能力变得更好 , 然后让它的内容生成能力变得更好 。

它要去做跟美团做 AI 的 why 肯定是不太一样的 。ChatGPT 和 DeepSeek, 就 OpenAI 和 DeepSeek 做 AI 的 why 肯定也跟这几家厂商也不太一样 。

就像大家很难看到 DeepSeek 主动出来说我的 APP 做得多好多好的 。

曼祺1:04:12

它本来也没怎么做过 。

万玉龙1:04:13

对 , 它本来也没有怎么做 APP 这个事情 。 所以这件事情我觉得是每家公司做 AI 所不一样的 。 就像您刚刚提到的三大类玩家 ,AI 模型公司 、 互联网巨头公司 、 智能终端公司 , 每家其实做 AI 背后的 why 不一样的时候 , 即使你看到的 what 可能有一些相似 , 背后的 why 还是不太一样的 。

它本来想去做这件事情 , 背后更长期的思考还是不太一样的 。

曼祺1:04:41

因为移动端的生态其实本来就比网页端要封闭一些 , 比如说在 ChatGPT 里面 ,其实你可以搜到很多公开网页里的信息 ,但是如果你在手机上, 有时候你想跨 APP 去搜信息是很难的 。

指标重塑1:04:41

曼祺1:04:54

比如说我在微信里肯定搜不到小红书里的东西 , 我在小红书又搜不到比如说微博上的东西 。 这个生态你觉得以后会怎么演变 ?

因为现在确实可能会出现一种你想给用户提供非常好的打通的这种智能的体验 ,但是一些三方 APP 它不见得会给手机厂商开放那么多的权限 , 对吧 ?

它可能有自己的 , 比如说它的广告 、 安全 , 然后我是不是和用户距离足够近 , 它有很多考虑 。

万玉龙1:05:19

我们从历史来推演一下 ,在没有手机之前 , 大家买东西是每一个每一个商店自己去 , 你到店里面去买 , 这个商店跟另外一个商店是不互通的 , 你也不知道另外一个商店有什么 , 对吧 ?

好 ,有了移动互联网时代之后, 有了淘宝 ,有了天猫 , 然后所有的店都上云了 , 然后也就是说你可以在一个网页上看到所有的人, 所有店里面的东西 , 你可以对比了 。

以前是很难对比的 ,有了移动互联网时代 , 每一个 APP,APP 里面可以把所有的内容都集成上来 ,APP 又在哪里 ?APP 在手机里 。

从以前到现在基本上是不断在突破边界 ,在让大家看到更多信息的 。 我觉得在 AI 时代也是一样的 , 就是我们的服务会离用户越来越近 。AI 时代可能用户只需要一句话就能获取到服务 ,但这个服务的供给方有可能还是那些现在的服务供给方 ,也可能是一些新型的服务供给方 ,但是它触达用户的界面可能会发生变化 , 然后变得更浅了 。

但是合作模式我觉得并没有发生太多的 。

曼祺1:06:28

但是利益分配是有可能会变的 。

万玉龙1:06:30

利益分配肯定是会有变化的 , 只是说现在其实大家都在探索 。

曼祺1:06:35

就这个没有定性 。

万玉龙1:06:36

我觉得还远远没有定性 ,而且这件事情的探索还变化挺快的 。 就像去年年初的时候 , 应该是 OpenAI 发布了 GPTs, 那个时候 OpenAI 应该是希望说让更多的服务能够通过 plugin 的方式集成到 GPT 里面 。

然后今年开始它不再通过 GPTs 了 , 它可能就是说我构建一个开发者生态 , 然后你通过一些你自己开发一些应用 , 然后能够进来 。

我觉得这个就像我们一开始的时候 , 我们做开发者生态的时候其实也是 , 我们建了一个技能平台 , 然后每一个

开发者 , 比如说天气的开发者或者小游戏的开发者 , 到我们技能平台上开发一个小游戏 , 然后我们通过分流分给他 。

到去年开始 , 我们就是开始跟一些生态伙伴去通过 Agent 的方式在接入 , 比如说我们最近跟支付宝也有合作 , 生活类的 Agent,他们把他们生态内的一些服务通过 Agent 的方式包装起来 , 然后我们通过一些用户的意图理解 , 然后把对应的服务调给他 , 然后他去完成 , 然后再返回来 。

曼祺1:07:52

在你们和支付宝的合作里面 , 用户是直接和小布来沟通的是吗 ?

万玉龙1:07:56

对 ,是的 。

曼祺1:07:57

小布有可能会根据用户的意图和习惯推一些支付宝的服务 。

万玉龙1:08:01

我经常举一个例子 , 就是你有一个助理 , 然后你想吃火锅 , 然后你只要告诉你的助理说我想吃火锅 , 然后他去火锅店去把外卖叫过来 , 或者帮你订个餐就 OK 了 。

你的助理不需要一定会做火锅 , 对吧 ? 就是这样一个逻辑 。

曼祺1:08:20

比如说像支付宝 , 它愿意和你们做这样的合作的原因是什么了 ?

万玉龙1:08:24

我觉得两个原因 。 第一个原因是大家都在探索 AI 时代的服务生态到底长成什么样 , 所以每家都希望通过某种方式去探索这个事情 。

然后第二个是小布天然的就是离用户最近的入口 , 所以我们去主动去跟他们去建立这种合作 ,其实也是一种双向奔赴的一种方式 。

曼祺1:08:49

我有个好奇的问题 , 比如说在你刚刚说的流程里面 , 我通过小布的方式 , 我去接受了支付宝的服务 , 这个在以前 APP 的口径里面 , 它算支付宝的日活吗 ?

就算我去了一次支付宝 , 用了一次吗 ?

万玉龙1:09:04

以前的逻辑是用户点击图标 , 然后进入一个 APP,在 APP 里面获取服务 。 现在是用户发起一个请求 , 然后直接在小布的对话界面上, 通过一个卡片的方式去跟用户交互 。

你说一定要算不算日活 , 我觉得日活这个统计逻辑在 Agent 的时代可能也会不太一样 。

曼祺1:09:27

对 , 我觉得这个就是变化的地方 。 因为以前可能你看一个 APP 的表现怎么样 , 你会看它的日活 , 包括使用时间等等 ,以及比如说你通过小布去用一些 APP, 我也在想使用时间它可能会怎么去算 。

因为有的广告商是会看这个的 , 对吧 ? 它会看比如说一个应用的使用时长 、 停留什么的 。

万玉龙1:09:49

我觉得在新的 AI 时代 , 可能您刚提到的商业模式也会发生变化 。 它是不是一定通过这种显性的广告去触发 ?

未必 。

曼祺1:10:02

但是这些现在都还没有特别清楚的答案是吗 ?

万玉龙1:10:04

我觉得没有那么清楚 。 我举个例子 ,DeepSeek 今年刚出来的时候 ,其实朋友圈里面就有人在发一些内容是什么呢 ?

有些店家它就会在它的门口摆一个牌子 , 叫做本店是由 DeepSeek 推荐的 。 什么意思呢 ? 当用户习惯性的去问一个智能助理一些问题的时候 ,并且信任那个答案的时候 , 答案本身其实就是一种广告 。

曼祺1:10:32

对 ,因为以前大家会针对搜索引擎的结果去做一些优化 , 就营销上 。 现在其实也有一些新的东西 , 就是在针对大模型的问答的结果去做一些优化 。

万玉龙1:10:41

对 , 我觉得这是一种可能大家还在探索的一种新的商业模式 , 本质上还是要建立在用户体验的基础上 。

如果你发现这个东西会影响用户体验 ,并且用户越来越不信任你的时候 ,其实这个也不成立 。 本质上还是用户真的愿意问你问题 。

举个例子 , 比如说用户现在买手机 、 买车 、 买很多商品 ,他愿意去问 AI 的时候 , 你天然的就应该可以给用户更好的一个答案 。

答案一定是建立在质量基础上的 。 如果用户问你说买个车 , 然后你推荐一个车 , 然后这个车可能买了之后就有问题 ,其实他也会越来越不信任你 。

协议与入口1:11:28

曼祺1:11:28

现在手机上的这种不同应用之间的打通 , 实际上靠的是什么协议 ? 因为在网页端 ,其实比如说 MCP, 包括 Google 在推 A2A, 会有一些协议出现 。

手机端是每个手机厂商自己做吗 ? 还是有什么共通的 ?

万玉龙1:11:43

现在基本上是每个手机厂商自己做 ,但是大家应该还是都希望 follow 一套标准 。 所以比如说我们跟合作方去对接的时候 , 合作方也会按照比如说 A2A 的方式去写这个协议 。

曼祺1:11:57

你说每个手机厂商自己做 , 这个是在中国市场的情况 , 还是全球市场都是这种情况 ?

万玉龙1:12:03

现在基本上还没有形成共识 。 大家还是我举个例子 , 苹果它会有自己的 APP intent framework, 然后它定一套意图框架 、 应用意图框架 , 然后每个应用基于应用意图框架去定义自己的 action 是什么 。

然后 Google 的话 ,其实 Google 自己也有两三套协议 , 比如说它也有自己的应用意图框架 , 然后也有自己的 A2A 的协议 。

这个面向不同的开发者 , 它会去提供不同的协议 。

曼祺1:12:35

像 Google 的安卓的意图应用框架 , 它没有在安卓的手机厂商里面变得很通用是吗 ? 现在 。

万玉龙1:12:43

它在开发者的网页上会把这个公开出来 , 希望开发者去接入 ,但是不是所有的应用开发者都会去 follow 这套协议 。

曼祺1:12:52

OK, 所以现在没有一个看起来相对主流的这种交互的协议 。

万玉龙1:12:58

相对主流 , 对 , 没有 。 移动应用这块还没有相对主流的 , 大家还都是几套都在跑 。

曼祺1:13:07

你觉得未来这个东西会怎么发展 ? 比如说这个领域的一些比较标准化的东西 , 它以后可能是手机厂商自己来实现 , 还是说还是跟之前的时期表象 , 它是 iOS, 然后安卓比较少的阵营 ?

万玉龙1:13:21

我觉得至少安卓阵营应该会形成一套统一的协议 , 大家会就像在小程序那个时代 , 就跨应用那个时代 , 会形成跨应用联盟这种方式 , 然后几家厂商坐在一起把这个事情给聊通 , 政策方面也会去拉通一些标准 。

曼祺1:13:41

你觉得手机智能体 , 或者说你的个人的智能助理 , 未来它会是一个多集中的市场吗 ? 如果讲得更远期的话 。

万玉龙1:13:52

我觉得智能助理它还是会分为两大类 , 从大的逻辑上分为两大类 。 一类就是管家类的 , 一类就是专家顾问类的 。

管家类的就是离用户最近 、 最了解用户 , 然后陪伴用户最长 , 它能够清晰的理解用户的意图 , 然后把所有的分发做好 , 就是管家类的 。

然后专家跟顾问类的 , 它能够把很多垂的事情做得很扎实 , 比如说法律类的 、 医疗类的 , 然后包括出行旅游类的 , 它能做得很扎实 。

然后这两类应该会形成协同 , 就像刚才说你只需要跟你的助理说我要吃火锅 , 火锅这件事情它有专家去做 ,但是你的助理是最懂你的 ,他知道你不吃香菜 ,他知道你不吃麻 , 它只要把这些东西通过某种方式交给专家和顾问去完成就行了 。

曼祺1:14:58

对 , 我觉得对单个用户的体验来说 , 这个是相对好想象的 。 对一般人来说 , 我觉得它只需要一个管家 , 你管家多了你就也很乱了 。

万玉龙1:15:07

对 , 理论上是的 。 从中距来看 , 我自己认为如果用户常用的设备只需要存在一个管家 , 跟很多个他希望订阅的顾问其实就 OK 了 。

曼祺1:15:16

对 , 然后是管家去和那些顾问沟通 。

万玉龙1:15:18

对 ,是的 。

曼祺1:15:18

但我刚想问的其实是说 , 跟我最接近的管家 , 贴身的助理 , 它的供给方有多集中 ? 就是说它是有很多公司可能都来做这件事情 , 比如说每一个主流的终端厂商可能自己有一个这样的东西 , 还是说它在系统层面会有一个更集中的玩家能把这个事做了 , 比如说 Google 可能把安卓的这种事情都做了 。

万玉龙1:15:41

我觉得不太会 ,不太会有一个大一统叫一个管家 , 它可能是跟设备强相关的 , 可能是每个品牌 , 品牌手机它有一个 , 然后或者品牌的终端有一个 , 比如说理想汽车它有自己的理想同学 , 然后 OPPO 手机它有小布助手 , 类似于这种感觉的可能会更切实一些 。

曼祺1:16:08

一个人如果又有手机又有车 , 岂不是得有两个管家吗 ?

万玉龙1:16:11

对 , 这种情况就比较特殊 。 首先每个用户的车可能是不一样的 , 每个用户的手机可能是不一样的 。

首先这两个管家可能需要去在某些事情上去协同 ,其实我们现在其实也跟一些车厂的助手已经有一些协同了 。

曼祺1:16:27

对 ,因为在我的想象中, 我觉得从人的很自然的一个体验上, 好像你还是得有一个比较主导的 , 一个离你最近的入口 。

万玉龙1:16:35

对 ,是的 。

曼祺1:16:36

那个可能数量是非常有限的 。

万玉龙1:16:37

对 ,是的 。 理论上刚才说手机这个设备很特殊 , 一方面它自己能够闭环很多服务 , 另一方面它是很多设备的中枢 。

所以这件事情上我觉得是终局的话应该是比较重要的一个刚才说的管家的一个载体 。

曼祺1:16:53

因为放到广义的端侧 AI 上, 现在有很多新的硬件在出现 , 你们有看到挑战手机地位的新的硬件吗 ?

万玉龙1:17:00

我觉得目前挑战手机的没有看到 。

曼祺1:17:04

都是配合手机的 。

万玉龙1:17:05

对 , 增强生态的还是挺多的 。

曼祺1:17:08

你们怎么看眼镜 ? 因为其实 OPPO 也是也有做眼镜 。

万玉龙1:17:13

我觉得眼镜还是手机的一个外延设备 , 它还是去增强用户触达数字世界跟物理世界的一个很重要的感官设备 ,但是受限于不管是它的应用生态还是它的算力 , 包括它的其他的一些续航等等 , 它很难跟手机现在所承载的这些功能能够去对齐 。

用户在手机上重度的几个场景 , 一类是这种内容消费 , 比如说刷抖音 、 刷视频 、 看各种朋友圈什么的 , 这是很重的一些场景 。

还有很重的场景就是玩游戏 , 这些东西本身其实还是挺需要 , 比如说你的显示设备要足够清晰 , 然后你的算力要足够强 , 然后同时你的功耗要足够低 , 续航要足够久 。

这些东西我决定了短期眼镜更多还是手机的一个增强的一个感官设备 。

曼祺1:18:17

而且我觉得手机上还有一个很刚需的东西 , 就是你要和人交流 , 就通信 。 通信的话你就得输入 , 就眼镜硬件输入起来好像 。

万玉龙1:18:26

对 , 我觉得这个是 。

曼祺1:18:27

不是很方便 , 就是人给机器输入东西不是很方便 。

万玉龙1:18:29

尤其是我们说可能做语音助手或者语音交互 , 更多是面向更长远的用户习惯的 。 你现在是很不习惯在一个公共场合用语音的 , 对吧 ?

一个人很多地方 , 你更习惯用打字去跟对方交流 。 但是你观察一下小朋友 , 小朋友是的 , 小朋友现在看电视都是用语音 , 然后很多对一些搜索什么他都用语音 。

所以我觉得 。

曼祺1:19:01

所以他们是 AI 原生的一代 。

万玉龙1:19:03

对 ,他们这一代人可能长大之后 ,他们对于设备的使用习惯可能是建立在更自然的表达基础上的 。

曼祺1:19:09

你说到这个 , 我又想到当年老罗开发布会发 TNT, 就是对着电脑用嘴改 PPT 什么的 。

万玉龙1:19:17

其实 TNT 有点类似于 2013 年左右电影 《Her》。 电影 《Her》 里面男主角其实他的工作性质就是每天对着电脑用语音去写邮件 、 写内容什么的 。

曼祺1:19:32

但是可能在没有 AI 之前生长那一代 , 觉得这是个很奇怪的交互方式 。

万玉龙1:19:39

我甚至有时候在 。 比你两个场景 。 第一个场景是你在地铁或者说路上打电话 , 给人打电话 。其实你那时候不是很不习惯的 , 你也不觉得尴尬 , 反正你觉得是跟人在打电话 , 所以一直会很自然的表达 。

但是如果这个时候你在跟一个 AI 在聊天或者下达指令 , 你就会觉得尴尬 ,但其实旁边人都没有听见 , 对吧 ?

曼祺1:20:06

旁边人听不出来 。

万玉龙1:20:07

其实旁边都没有听见 , 只是我觉得是一个使用习惯的问题 ,并没有形成那种心态说我其实是可以随意的去跟一个 AI 对话的 ,在公共场合 。

曼祺1:20:18

你说有道理 ,因为其实你跟 AI 聊天还是跟真人聊天 ,其实在其他人听起来可能他没有什么 。

万玉龙1:20:24

听不出来 。 比如说我现在跟我家人打电话 , 我开着功放我也可以打电话 , 我戴着耳机我也可以打电话 ,但是我也不觉得尴尬 。

但是这时候如果我跟一个 AI 在下达指令 , 或者我在跟他聊天 ,有人会觉得很奇怪 。 但是这是一个心态问题 。

我觉得在下一代人里面可能会慢慢慢慢形成一种很自然的一种方式 。

新交互1:20:46

曼祺1:20:46

整个智能手机时代的开启 ,其实是苹果当时有一些一系列的创新 , 包括这种触控的交互 , 包括 App Store 等等。

你觉得这一波 AI 大模型的热潮 , 它给手机带来的变革 , 如果和当时从功能机到智能机的跳跃相比 , 它是一个什么样的程度 ?

以及你觉得未来会发展到一个什么样远期的状态 ?

万玉龙1:21:09

其实当时第一代 iPhone 出来的时候 , 它有两个很关键的点 。 第一个点就是交互方式 , 就像乔布斯在发布会上他的背板上写的叫 Revolutionary UI, 就革命性的人机交互 。

多点触控使得人跟手机的交互只需要通过点触就可以完成 ,不需要通过实体键盘 。 这是很重要的一个变革 。 第二个很重要的变革就是应用生态 , 原先手机上完成不了的很多的服务的触达 , 能够通过应用的方式完成 。在 AI 这一波里面其实两个变化都有 。

第一个变化就是交互方式 , 原先你看我们就像刚才说很多现在 AI APP 其实背后的定位有可能是搜索引擎 ,有可能是创作工具 。

你看交互方式发生了根本性的变化 , 你只需要通过一句话就能完成内容的获取 , 信息的获取 , 内容的创作和服务的触达 。

交互方式是一个很大的变化 。 第二个就是应用的生态其实也在逐渐发生变化 , 包括 11 期间发布的 SORA2,其实它也在慢慢重构应用的生态 。

原先用户可能是人创作内容 , 人消费内容 , 现在 SORA2 是自己创作内容 , 自己消费内容 。 内容可以是非常非常个性化的 。

今天我想跟 Sam Altman 一起开个会 , 想去模拟那个场景 , 我就要在 SORA2 上去 post 一个照片 , 然后写一个 prompt 就 OK 了 。

包括刚才说的 Agent 这种服务生态也在发生变化 。 所以 AI 时代至少有两个跟上一个时代类似的东西 , 一个是交互界面 , 交互方式的根本性变化 , 一个是服务生态的变化 ,以及应用实现逻辑的变化 。

以前是 coding, 所有的软件都是 coding 完之后上架 , 现在可能就是一个 prompt, 然后它内容就已经上架了 。 所以我觉得这个是一个很大的变化 。

只是说在这三个点发生变化的同时, 用户的使用习惯和更低的使用门槛 ,以及更好的服务质量 , 这个变化可能还需要一定的周期 。

曼祺1:23:27

而且应用生态的变化 , 我觉得还没有到当年 App Store 出来的那个状态 。

万玉龙1:23:30

对 , 这个还一定是更多的一些爆发点 , 比如说微信的爆发是因为红包 , 淘宝的变化是因为低价 , 这些东西得出来 。

曼祺1:23:42

尤其是它这个机制 , 就协作的机制 。

万玉龙1:23:44

对 。

曼祺1:23:45

因为 App 其实它相当于以前的网页 , 它肯定是一种新的提供服务的方式 ,在移动端的 App。 但是你刚才说的从 App 到 Agent 这个路径 , 我觉得现在是大家在探索 ,但最终它是一个什么样子好像不是特别清楚 。

包括我们刚才讨论到的 , 比如说你的使用时长 , 你的广告这些会怎么变 。

万玉龙1:24:05

对 , 我觉得这一定是需要有一些爆品出来之后, 才能引发更多的开发者愿意投入进去 。 然后开发者跟消费者一定是彼此互相促进的 。

你开发者开发出来一个爆品 , 然后有消费者不断的去用 , 然后产生流量 , 然后慢慢慢慢才能出来这个东西 。

我觉得这是需要一定时间的 ,而且这个其实还蛮依赖用户习惯的 。 就像我经常拿输入法来举例 , 我们父母那一代人其实到现在为止 , 即使有全键盘 ,有九宫格 ,他还是喜欢用手写 。

即使到手机上 ,他还是喜欢用手写 。 然后我们这一代人习惯用全键盘或者九宫格 ,但是你看下一代人他就喜欢用语音 。

这个一定是使用习惯是很难改变的 。 我现在我也知道手写也很方便 ,但是我不会手写 。

未来AIOS1:25:02

曼祺1:25:02

最后我想请您讲一讲 , 比如说明年你最希望看到的事情是什么 ,以及你觉得明年一个你还没有思考清楚 ,但你觉得很重要的悬而未决的问题可能是什么 ?

万玉龙1:25:15

最希望看到的一个事情肯定是每个用户每天都在用 AI 去完成他的事情 。 因为现在 AI 的渗透率其实不是那么高 。

曼祺1:25:24

你说的是每个 OPPO 的用户吗 ? 还是 ?

万玉龙1:25:27

所有的用户 , 当然 OPPO 的用户是第一步了 。 我觉得现在虽然大家 AI 很火 ,但是其实你真正去看数据 , 它整体的渗透率还没有那么高 ,并不是说所有人每天都在用 AI。

可能有一些人是高频用户 ,但是很多用户可能试一下就没有了 。 所以我挺希望看到的是大家就像用抖音 、 微信一样 , 每天都用 AI。

曼祺1:25:56

你希望它更普及 。

万玉龙1:25:58

更普及 ,而且用户在这个上面能创造的价值或者说享受的价值更多 。

曼祺1:26:04

这个在明年就有可能发生吗 ?

万玉龙1:26:07

我希望是发生的 , 至少我身边人如果每个人都在用 , 我现在家人其实很多人会用 , 包括小朋友也会用 。

所以明年希望看到是至少从数据表现上来说 , 整个 AI 的渗透率是非常高的 , 然后大家对这件事情的期望会越来越好 , 然后这才能引发刚才我们聊到的说应用生态的或者说服务生态的变化 。

然后悬而未决的事情 , 我觉得对我们来说是一个到底真正的或者说更符合长期发展的 AIOS 到底是怎么样子的 。

因为现在几乎所有家的 AI 还是建立在传统的 OS 基础上去做出来的 。

曼祺1:26:55

你说的传统 OS 你指的是比如说安卓本身的 。

万玉龙1:26:58

对 , 安卓或者包括现在其实做的很多 Agent 的一些产品 ,Browser Use 或者说 Mobile Use 其实都是基于上一个时代的操作系统做出来的 。

然后我觉得 AI 时代的 OS 应该是不太一样的 。

曼祺1:27:17

你指的是它 OS 底层的架构这些就不太一样 , 内核什么的不太一样 。

万玉龙1:27:21

我理解它应该是从底层开始就不太一样 , 才能够长出更不一样的产品生态 。 否则的话 , 就像咱们聊 Mobile Agent 或者 GUI Agent, 它还是建立在说我用大模型去理解现有的应用界面 , 去操作现有的应用元素 , 然后完成现有应用的 。

这是一个没有打破底层的最本质的东西去做的一种方式 。 我理解如果真的 OS 能够发生变化 , 从底层发生变化 ,其实很多的 AI 体验应该能发生质的变化 。

曼祺1:28:03

手机厂商可以参与这个变化是吗 ?

万玉龙1:28:05

参与肯定是可以参与的 ,但是其实更需要更多的人去类似于当年安卓退出一样 , 去把这一层的东西给做好 。

曼祺1:28:15

你觉得像 Google 和苹果还会在系统层面 , 新的系统层面维持它的优势吗 ? 还是有可能也会有一个我们现在还想不到的类型的公司去做你说的新的端上的原生于 AI 的 OS?

万玉龙1:28:30

我希望是有新的出来 。

曼祺1:28:33

你希望有新的 。

万玉龙1:28:34

对 ,因为我自己觉得它需要以一些新的思路去做这个事情 , 然后理论上应该是结合大模型的发展长出来的一个东西 。

曼祺1:28:46

这个行业里有看到什么苗头吗 ?

万玉龙1:28:48

就像大家都在讲说 Agent 实际上是大模型加上 Profile, 再加上 Memory, 再加上执行层的一个集成的一个系统 。 我觉得我没有看到苗头 ,但是可以看到今年 OpenAI 在做的一些改变 。

以前都在讲单模型 , 每个模型发出来都是一个单独的产品 。 但是 Sam Altman 其实有说他们现在希望不再推出单模型 ,而是推出一个系统 , 甚至他认为这个超级系统应该是有很多模型搭配的使用的 。他们现在新一代的 GPT-5 其实是一个 Router, 一个路由 。

曼祺1:29:34

它会自己帮你判断 。

万玉龙1:29:35

对 , 即使短期会有一些降质的现象出现 ,但是它背后的思考还是说希望能够构建一个新一代的系统 。

曼祺1:29:45

对 , 它会根据你的提问 , 它会帮你判断说我是用什么样的模式来服务你的需求 。

万玉龙1:29:51

对 ,其实 Router 本身就是类似于刚才咱们聊到的管家的感觉 , 只是说后面的大的 Expert 或者顾问的模型 , 它是自己挂载了一些 。

曼祺1:30:04

对 , 你说到这个的话 ,其实它下一个 OS 可能都不叫 OS 了 ,因为 OS 是操作系统 。

万玉龙1:30:09

对 ,Operating System。

曼祺1:30:10

但可能 AI 的那个东西它就不是操作的 , 它的核心也许不是在于操作这个概念了 。

万玉龙1:30:16

对 , 具体它的命名是什么 , 我觉得都 OK。 只是说我希望看到的是一个更新一代的类似于 OS Operating System 的一个东西 。

那个东西应该是可以长出更多 ,因为你的 Application 其实是在 OS 基础上长出来的 。 我觉得新一代的 Application, 它具体叫 Application 还是叫什么 , 反正它应该是在新一代的 OS 基础上长出来的 。

曼祺1:30:43

好 , 今天非常感谢万博做客 《 晚点 》 的访谈 。

万玉龙1:30:46

感谢曼琪 。

曼祺1:30:47

和我们分享了 OPPO 在 AI 上的一些新的战略 , 包括新计算 、 新感知 , 还有新生态 ,以及我们也回顾了 OPPO 在这一轮大模型的热潮之中, 是怎么一步一步去实践 、 去思考 , 去从用户的角度为用户提供更好的体验 , 然后把这些技术给落到实处 。

我们也去推演了一下行业未来可能会怎么发展 。 现在其实在生态上 、 在服务上 、 在体验上, 可能都还有很多没有定型的 、 有未来空间的地方 。

我觉得这也是接下来大家可以去期待的部分 。 好 , 我们今天节目就到这里 。

万玉龙1:31:19

好 , 谢谢 。

曼祺1:31:20

好 , 拜拜 。 感谢收听 , 本期节目由 OPPO 支持播出 。在最后的连点呈现环节 , 推荐过往的两期关联节目 。

一是开头提到的 130 期我们和智谱的刘骁聊 AutoGLM 和手机 Agent; 二是 110 期和明视的合伙人夏令聊 Agent 入口大战从 Web 端到移动端的演进 。

这几期都讨论了几个共同的话题 , 一个是新一轮的入口竞争 , 就是这期提到的谁能成为用户身边的个人 AI 管家 。

手机公司 、 超级 App 厂商 、OpenAI 等大模型公司都会去争取这个机会 , 这带来了一些微妙的博弈 。 比如在 110 期中我们就提到不少超级 App 厂商当年就是从微信的九宫格里逃离的 ,他们现在不想回到重新被人调度的状态 , 所以对接入 Agent 有一些疑虑 。

另一方面 , 我们也看到 OPPO 作为手机公司 , 它确实也在和一些超级 App, 比如说支付宝合作 ,而支付宝之前也自己做过 AI 助手支小宝 , 大家都在各种尝试 。

再往下, 力链条也可能被重塑 , 比如我们这次讨论的日活 、 月活使用时长要怎么去计算 , 过去在 App 体系里的那一套广告收入的系统要怎么去变化 。

二是什么时候会有更成熟的移动端的 Agent 生态 ,因为我们现在可以看到在 Web 端 ,MCP 已经相对主流了 , 可以帮大语言模型去调用一些应用和服务 ,但是在移动端今天的情况还不是如此 。

三是端侧隐私 ,Web 端更多与工作相关 ,而手机可是有很多个人隐私信息 , 这块确实是手机厂商的优势 ,因为手机公司可以在计算存储上做更多端侧的优化 ,也可以把小模型部署在端侧 ,而不用把一些敏感的信息和流程上云 。

最后是更底层的一个变化 , 就是移动端新的 AIOS 可能会长什么样 ,由谁来构建 。 万玉龙这次讲了他心中理想的移动端 AI 能力的特点 : 服务原子化 、 个性化 , 还有主动化 。他提到这可能需要从系统层做一些新的设计 , 比如在交互上, 万玉龙就不太看好长期会延续 GUI 的交互方式 ,因为图形界面交互还是基于人在使用 App 的逻辑来构建的 。

当新的移动端的 AIOS 真的出现时, 还是苹果和 Google 两分天下吗 ? 本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。 下期再见