# 80: OpenAI o1 来了！与硅流袁进辉聊 o1 新范式和开发者生态

晚点聊 LateTalk · 2024-09-16

<https://latetalk.podhood.com/63750082-9bcb-4bd0-bf69-9888e5e37ea0>

本期《晚点聊》邀请硅基流动创始人袁进辉解读OpenAI o1：o1以强化学习、思维链与test-time compute的组合，突破了大语言模型在逻辑推理上的瓶颈，数学、编程和科学任务能力大幅提升。袁进辉认为这三项技术单独看都不是新idea，OpenAI把Alpha家族验证过的强化学习方法搬到大语言模型上，胜在组合，并验证了从train scaling law到inference scaling law的新范式；训练端用合成数据、推理端多次调用模型都会增加算力需求，但国内基础模型训练收缩，GPU短期有冗余、租金下降。从API定价看，o1每百万token约数十到上百美元，是4o的数倍到十倍，目前还不支持函数调用、流式传输，推理时间也长，但这些都可优化；而推理能力的提升让Agent范式更有望跑通。袁进辉还以硅基流动的一线数据反驳“AI应用降温”：大量小微企业和个人开发者正基于开源模型做应用，只是不在传统VC视野里，他称已有应用每天调用数亿至十亿token、每周活跃数十万；海外调用最多的是Meta的Llama，国内是阿里通义千问和幻方DeepSeek，千问胜在版本齐全，DeepSeek编程能力突出。他也不认为o1会改变大模型公司持续收敛的趋势，因为技术扩散和边际收益递减的逻辑未变。

## Questions this episode answers

### OpenAI o1 是如何提升推理能力的？

袁进辉解释，大模型是统计学习，数据里有什么才能学到什么。强化学习通过 self-play 合成专业领域数据，弥补网上专业语料不足；思维链补充宏观策略数据；test-time compute 在推理端把一次推理变成多次反思。它们单独看都不新，但 OpenAI 把它们组合起来，显著提升了推理能力。

[10:45](https://latetalk.podhood.com/63750082-9bcb-4bd0-bf69-9888e5e37ea0?t=645000)

### o1 的发布意味着需要更多 GPU 和算力吗？

袁进辉认为，o1 在训练和推理两端都意味着更多算力：强化学习 self-play 能合成更多训练数据，使训练计算量继续增加；test-time compute 让推理从单次变成多次，比如调十次大模型就是十倍的推理算力。他也提到，当前国内部分公司暂缓训练，算力价格仍在下降。

[36:50](https://latetalk.podhood.com/63750082-9bcb-4bd0-bf69-9888e5e37ea0?t=2210000)

### AI 应用开发的热潮冷却了吗？袁进辉观察到哪些变化？

袁进辉表示，在技术使用和应用探索端，他没有感觉到变冷；大量中小企业和个人开发者用自有资金坚持做应用，覆盖教育、玩具、陪伴、老人关怀等场景。只是他们不在传统 VC 视野里，所以投资市场觉得应用爆发不如预期，而实际调用量在快速增长。

[13:56](https://latetalk.podhood.com/63750082-9bcb-4bd0-bf69-9888e5e37ea0?t=836000)

### 硅基流动客户调用最多的开源模型是哪些？

袁进辉说，硅基流动客户调用最多的开源模型是阿里巴巴的通义千问和幻方的 DeepSeek；通义千问从 7B 到 70B 各规模版本齐全，DeepSeek 在编程能力上非常突出。GLM 4 也有调用，但更高级模型未开源；Llama 在国内调用量不大，在海外有量。

[26:47](https://latetalk.podhood.com/63750082-9bcb-4bd0-bf69-9888e5e37ea0?t=1607000)

## Key moments

- **[0:00] 开场**
- **[2:56] o1初印象**
  - [2:56] 袁进辉：o1 发布当天早晨看到铺天盖地消息，由于提前泄露和 PR，预期已支出一部分
  - [3:19] 袁进辉：o1 兑现了此前在 reasoning 能力上的突破承诺，但很难说超过预期
  - [3:48] 袁进辉：大模型能力分语言、常识、推理三层，o1 首次把推理这层往上推了一个台阶
  - [5:26] 袁进辉实测 o1：能答对 9.1 和 9.8 谁大的数学题，但磁悬浮材料老鹰问题答错
- **[6:41] 技术拆解**
  - [6:41] Q: 同样是强化学习，为什么 AlphaGeometry 的 IMO 金牌成就没有 o1 轰动？袁进辉：Alpha 家族的 Wow 时刻早已发生过，o1 是把这套方法论叠加在 ChatGPT 上
  - [11:06] 袁进辉：数据里有什么模型才可能学到什么；强化学习和思维链都是在补数据缺陷——RL 补专业数据，CoT 补宏观策略数据
  - [13:23] 袁进辉：强化学习适合规则清晰、容易构造仿真环境的问题，越模糊的环境越难用
  - [17:18] 袁进辉：语言模型最擅长微观/细粒度 pattern，网上缺少宏观策略数据，所以做不了复杂决策
  - [21:11] 袁进辉猜测 o1 可能用强化学习和工具生成了思维链数据，因此获得宏观解题能力
  - [23:55] 袁进辉：强化学习和思维链是正交的，结合方式可以是用强化学习生成思维链分步数据
- **[25:08] 思维链**
  - [27:26] 程曼祺转述中科院张俊林：o1 的关键意义在于把思维链的构造过程自动化了
- **[29:19] 推理时计算**
  - [29:19] 袁进辉：test-time compute 不是补训练数据，而是把原本做一次的 inference 变成做 N 次，像人深思琢磨
  - [31:18] 袁进辉：“每一个单独的 idea 都不是石破天惊的”——RL、思维链、test-time compute 组合起来才有意义
  - [34:36] 英伟达 Jim Fan 说 o1 的推理 scaling law 图可能是 2022 年以来大模型研究最重要的一张图
- **[34:48] 缩放定律**
- **[36:50] 算力与成本**
  - [36:50] 袁进辉：o1 让训练和推理两端算力需求都上升——RL 合成数据缓解数据枯竭，多次 inference 推高推理算力
  - [39:24] 袁进辉猜测 o1 训练是把合成数据与自然数据合并 pre-train 或 continue train，具体方式未知
  - [41:37] 袁进辉：承担思维链/推理核的模型参数未必很大，未来可能与基座模型组成复合架构
  - [43:33] o1 API 定价每百万 token 约大几十到上百美元，是 GPT-4o 的数倍到十倍，反映推理算力增加
  - [45:23] 贺前民和袁进辉：o1 更像组件而非完整 GPT-5，下一代 GPT-5 可能是 OpenAI 当前技术的集合体
- **[47:06] 应用与智能体**
  - [47:16] 袁进辉：o1 最大想象空间是 Agent/AI 工人，reasoning 能力提升让 Agent 范式更可行
  - [48:45] 袁进辉：辅助程序员在 o1 之前就已经效果很好，o1 又解锁了数学、科学、工程等更多专业场景
  - [50:13] 袁进辉：用 AlphaMath 式搜索解决有结构问题，未来有可能找到人找不到的数学证明
- **[54:29] 短板与优化**
  - [54:37] Q: o1 那么慢，是能被优化掉的短板吗？袁进辉：测试中 o1 preview 回答简单问题要32秒，但延迟可以优化，效果优先
  - [58:38] Q: o1 API 调用有哪些限制？袁进辉：暂不支持函数调用、流式传输和系统消息，每分钟限20次请求
- **[1:00:14] 基建机会**
  - [1:00:14] 硅基流动针对 o1 式 reflection 做 inference 优化：把子任务并行计算，缩短用户体感时间
  - [1:01:10] 袁进辉：分析子任务依赖图可去掉冗余的 inference 调用，既省算力又加快响应
  - [1:03:48] 袁进辉：开源社区 Llama、DeepSeek 等都会跟进 o1 的强化学习+思维链方法论
  - [1:04:36] 袁进辉：o1 会让手工 prompt engineering 和手写 chain of thought 变得没必要
  - [1:06:06] 贺前民：今年年中起很多中国公司暂缓基础大模型投入，因为 GPU 卖出去是收入、训练只是成本
  - [1:07:33] 袁进辉打比方：Meta 开源 Llama 相当于免费送梯子，重金再造一个基座模型在经济上不划算
- **[1:13:14] 开发者生态**
  - [1:13:14] Q: AI 应用开发热潮冷却了吗？袁进辉：从硅基流动看没有冷，只是开发者变成小微企业/个人，不在传统 VC 视野里
  - [1:15:29] 袁进辉举例：小到儿童教育、玩具，大到老人关怀甚至 AI 写遗嘱，各领域都在涌现 AI 应用
  - [1:17:34] 袁进辉：现在做 AI 应用不需要完整 AI 团队，有领域洞察和基本开发能力就能调用模型做产品
  - [1:18:34] 袁进辉：草根 SMB 做应用已能每月收几万块，但规模还没到 VC 的投资门槛，投资冷和调用热并存
  - [1:20:01] 硅基流动推出 MaaS 云服务后，注册用户、调用用户和每日 token 量增长非常快
  - [1:21:13] 袁进辉举例：二次元陪伴产品“捏他”是硅基流动客户，用户留存和反馈都很好
- **[1:34:17] 浪潮与展望**
  - [1:34:17] 昆仑万维方瀚的“巨头递减”：AI 更多是原场景效率提升，很难再造移动互联网式新场景
  - [1:36:02] 程曼祺 vs 方瀚的“巨头递减”论：铁路替代马车后也长出希尔斯百货，AI 可能会衍生新场景；袁进辉表示同意
  - [1:38:02] 程曼祺：OpenAI 可能像改良蒸汽机的瓦特/刘可门，AI 真正的“瓦特时刻”或许还没到

## Speakers

- **曼祺** (host)
- **袁进辉** (guest)

## Topics

AI模型团队动态, 模型自进化

## Mentioned

DeepMind (company), OpenAI (company), 硅基流动 (company), 苹果 (company), AlphaCode (product), AlphaGeometry (product), AlphaGo (product), Claude (product), Cursor (product), DeepSeek (product), GLM (product), Llama (product), o1 (product), 通义千问 (product), 钉钉 (product)

## Transcript

### 开场

**曼祺** [0:08]
欢迎收听本期 《 晚点聊 》， 这是由 " 晚点 LatePost" 推出的科技商业播客 。 我是曼琪 ， 今天的节目是一期加更 ： 我们在 OpenAI 最新模型 o1 发布后的第二天 ， 邀请了硅基流动创始人袁进辉与我们分享讨论了 o1 这一新进展 ，也讨论了今年 1 月至今袁进辉观察到的 AI 开发者社区的变化 。

总结而言 ，o1 打破了一个预期 ： 就是过去人们发现在大语言模型范式下， 模型在解决推理逻辑问题时遇到了瓶颈 ，而 o1 通过 3 个主要技术方法显著提升了模型的逻辑推理能力 ， 包括强化学习 ，也就是 RL；chain of thought，也就是思维链 ； 还有 test-time compute， 或者 inference time compute，也就是在推理阶段 （ 即大模型的使用阶段 ） 分配更多计算资源 。

所以 o1 在科学 、 数学和编程等需要更多逻辑能力的任务上都有很大提升 。 袁老师也在这期播客里比较通俗地解释了强化学习 、 思维链 ， 还有 test-time compute 是怎么发挥作用的 ； 我们也讨论了 o1 的这些新技术特性对算力消耗量 、 行业应用 、 还有其他 AI 公司的动作可能会有什么影响 。在这期节目的后半部分 ， 我们讨论了 AI 开发者生态这一年的变化 ：

硅基流动做的是推理优化和加速等 AI Infra 中间层软件 ， 直接服务大量开发者 。 与很多人的观察不同 ， 袁进辉说在应用开发端 ，他没有感受到 AI 热潮的冷却 ， 只是现在涌现出的很多开发者是小微企业甚至是个人开发者 ，他们不在传统 VC 的视野里 。

所以一方面创投市场会觉得 AI 应用的爆发不如预期 ， 另一方面实际调用量也在快速增长 。他还分享了一些有意思的一手数据 ： 比如硅基流动自己的客户 ， 调用最多的开源模型国外当然是 Meta 的 Llama； 在中国则有阿里巴巴的通义千问和幻方的 DeepSeek。

千问的优势是不同规模的模型版本特别齐全 ，而 DeepSeek 则在编程能力上非常突出 。 下面我们就正式进入节目吧 。

现在是北京时间 9 月 14 号的早上， 昨天是 OpenAI 刚刚发了它最新的模型 OpenAI o1 系列 。 今天我们非常高兴地邀请到了袁老师 ， 硅基流动的创始人袁进辉 。

今年初的时候他也有做客 《 晚点聊 》， 来和我们聊一聊当时自己做学术还有创业的经历 ，也给大家科普了什么是 AI Infra。

今天我们就想请袁老师和我们一起聊一下刚刚发布的 o1， 昨天刚刚出炉的 ，以及他这大半年在开发者社区看到了 AI 行业的一些什么变化 。

那我们直接开始吧 。 今天跟我在一起的是我们的科技组的同事 ， 贺老师 ， 贺前民 。

**Guest** [2:42]
大家好 ， 大家好 。

**曼祺** [2:43]
袁老师可以给听众打个招呼 。

**袁进辉** [2:44]
大家好 ， 我是袁进辉 。

**Guest** [2:46]
对 ， 袁老师 ， 那我们就直接切入正题 ， 就先聊聊您当时看到 o1 发布的一个感觉吧 。 您是 13 号凌晨第一时间就看到了这个事情吗 ？

### o1初印象

**袁进辉** [2:56]
不是 ，他不是说发了一个公告说两周之内发布吗 ？ 但是我也不知道它哪天发布 ， 然后是早晨起来之后看到的铺天盖地的消息 。

这个其实也是他们提前做了很多次提前的什么消息的泄露 ， 还有一些 PR 什么的 ， 所以有一些预期已经支出过了 。

**曼祺** [3:17]
所以这次没有那么惊人的感觉是吗 ？

**袁进辉** [3:19]
总体上感觉就是 o1 还是兑现了之前的一些承诺 ， 就是它在这个 reasoning 能力这些方面的突破 ， 用合成数据 、 用强化学习等等 ， 一会儿我们也可以聊一些细节 。

应该是之前有一些消息放出来 ， 然后说它在推理能力 、 数理能力 、 编程能力等等都有比较好的提升 ， 这个确实是已经做到了 。

只能说之前预期也挺高的 ， 然后它是兑现了这个预期 ， 所以很难说超过预期 。

**曼祺** [3:48]
那您觉得总结而言这是个什么量级的变化了 ？ 比如说有的人会把它形容为什么新范式 、 新阶段 ，其实 OpenAI 自己也把这个东西叫新阶段 。

**袁进辉** [3:57]
是 ， 基本上我们经常会从这个大模型的能力角度来说 ， 就是第一个是对语言的掌握 ， 语言说得理不理解 ， 然后说得流畅不流畅 ， 地道不地道 。

第二个是对这些常识或者叫世界知识的掌握 ， 比如说我们一些交通规则 ， 或者什么经常说吃饭就会变饱 ， 就是这种常识的掌握 。

这些在之前的版本的大模型里面 ，不管是 GPT 也好 ， 还是其他开源模型也好 ， 都做得非常好了 。 但是大家觉得说还有一层就是考验它智商的那一部分 ， 我们叫逻辑推理或者 reasoning 那一块 ，也是公认的那一块还做得不够好 ， 所以也有人说它限制了 Agent 的发展等等。

但是这次新的版本在这块从方法论来说 ， 用一套 work 的方法论能把 reasoning 的能力提高一大步 ，而且能解决相当多的问题 。

确实是在我们说这个能力阶梯上， 就是语言能力 、 世界知识的能力到 reasoning 的能力 ， 它确实是往上迈了一个台阶 。

**曼祺** [5:01]
嗯 ，reasoning 的能力就是推理逻辑 ， 对吧 ？

**袁进辉** [5:03]
对 ， 逻辑推理这块 ， 解题的能力等等这块 。

**曼祺** [5:07]
您昨天自己用过了吗 ？

**袁进辉** [5:08]
我是通过我们是一个合作伙伴提供了一个 API 访问 ， 我也用了一下 。 但是我发现你要问一些简单问题的话 ， 跟以前是一样的 。

如果是一些比较偏门的 ， 平常生活中不太用得到的 ， 或者当然就是它确实那个 reasoning 能力提升挺高的 。

**曼祺** [5:26]
你问了它一个什么偏门的问题 ？

**袁进辉** [5:28]
比如说像大家找到的那些像偏物理的 ， 我用了一下一个网友提出来的一个问题 ， 这个问题好像他回答得还不够好 ， 说一个实验室里面做那个磁悬浮的实验的 。

**Guest** [5:41]
哦 ， 我知道 ， 老鼠吃了那个磁悬浮材料 ， 然后它飘在空中 。

**袁进辉** [5:45]
磁悬浮材料它可以飘了 ， 这个是可以 ， 然后老鼠吃了之后后面是蛇 。

**Guest** [5:50]
蛇吃了老鼠 。

**袁进辉** [5:51]
老鼠又可以 ， 那时候我又看到一个老鹰在空中飞着 。

**Guest** [5:55]
那它飞为什么 ？

**袁进辉** [5:56]
然后这个好像它并没有回答对 。

**曼祺** [5:58]
对 ， 它回答的是因为老鹰吃了老鼠的蛇 ， 然后老鼠吃了那个磁悬浮材料 ， 所以老鹰会飞 。

**袁进辉** [6:06]
是 ， 它还有一些数学的 ， 你比如说像 9.1、9.8 这种什么的 ， 它都能回答对的 。

**曼祺** [6:11]
其实第一个算是个老星急转弯 ， 就那个磁悬浮实验室里的那个问题 。

**袁进辉** [6:15]
还有一些人测了一些弱智吧的 ， 好像也确实那个对弱智吧的反馈也一般 。

**Guest** [6:21]
对 ，其实那个数学 9.1 跟 9.2 到底谁大 ， 它还是会出错 ， 它还是像原来那样有一些概率上的一些东西的 。

**曼祺** [6:30]
看来弱智吧是大模型的试金石 。 那主要是弱智吧那些问题 ， 它可能不能算严谨的推理的问题 ， 对不对 ？

它里面有很多是那种老星急转弯的问题 。

**袁进辉** [6:40]
是 。

**曼祺** [6:41]
对 ， 我们接下来可以展开讲讲就您刚才说到的一些具体的技术方法 。 就在这之前 ， 我自己有一个好奇的问题 ， 就是今年 7 月的时候 ， 谷歌 DeepMind 它其实更新了之前他们的一个模型叫 AlphaGeometry， 它也是使用了一些强化学习方法的 ，而且它在这个 IMO 就是国际数学奥赛里 ， 它是差一分就可以拿到金牌的 。

### 技术拆解

**曼祺** [7:02]
但好像这个怎么没有那么多人讨论和关注这个事情 ， 就相比于 o1 的声量 ，是因为他们确实是有比较大的差距了 ， 还是说 OpenAI 现在就是最吸引大家关注的 ？

**袁进辉** [7:13]
就刚才前一个问题 ， 就是应该说大模型对这个我们简单来分就是对文科 ， 相当于文科生的这种能力做到了 ， 然后 o1 它可以做到了这种理科生的一些专业的能力这一块 ， 所以是一个阶梯的迈进 。

然后刚才提到 AlphaGeometry 这些 ， 我们或者说把它称为 Alpha 家族吧 ， 就是 AlphaCode、AlphaGo 等等这些东西 ， 实际上在大模型之前的几年都已经发生过了 。

就是说用这种强化学习的能力 ， 让它解决某一个专用领域或者叫封闭世界或者规则非常清晰的这种领域的问题 ， 它已经能验证出来能比人做得好得多了 。

像 AlphaGo、AlphaCode， 还有那个 AlphaFold 等等 ，AlphaProof、AlphaGeometry 等等 ， 它实际上都是一个方法论 ， 一个套路 。 这个的突破在大模型之前 ， 比如说以 DeepMind 为代表的这些机构那儿 ， 实际上已经发生过了 。

就说那个 "Wow" 那种时刻 ，在 AlphaGo、AlphaCode 那时候 ， 就这个方法论的那个效果或者奇迹已经发生过了 。 然后是大模型这个 "Wow"， 就是 GPT-3，GPT-3 还没有 "Wow"，但是 ChatGPT 是 "Wow" 一下， 就是说这个大模型能解决这个大家觉得比解决专业问题更难的那种语言以及常识的这种问题 ，也能解得非常漂亮 。

这是 ChatGPT 的 "Wow"。 只不过现在这个 o1 又在这个 ChatGPT 基础上把 Alpha 家族那一套方法论把它叠加上来了 ， 然后使得这种大模型不仅能解决通用的常识的这种东西 ，也使大模型能解这种专业问题了 ， 比如说特别是数理的 、 工程的等等。

所以就是 AlphaGeometry 那个 ， 它那个的效果或者那个预期之前已经释放过一次了 ， 然后这次让这个原来擅长解决通识或者是常识问题的这种大模型 ，也有解这种专业问题的能力了 。

所以这个部分它解决大家对大模型的一个就是说原来在这种推理能力或者解专业问题能力上的一个突破 ， 就是把原来已经存在的一个方法论用在了一个大家以为就是在大模型的范式下非常难解决的问题 ， 它给解决掉了 ， 就是或者是往前推进了一步 ， 至少在大模型这个范式下有这样一种预期存在 ， 就是说让大模型来解决这些数理的 、 推理的或者

这些问题要更困难 。 然后把之前在 Alpha 家族那一套方法论拿过来之后， 发现能往前推进一步 。

**曼祺** [9:55]
所以 o1 是打破了之前的一个预期的 。

**袁进辉** [9:57]
应该是打破了一个预期 。 就刚才提到这个大模型三层能力来说 ， 大家一直说也讨论这个从价值 ， 从应用价值这个角度 ， 预期说 Agent 这种范式的应用会成为一个价值很大的一种场景 。

但是大家回头又看说 Agent 一直盼望 ， 一直预期 ，但是受限于模型的能力 。 那受限于什么能力呢 ？

就是 reasoning 能力 。 那现在相当于是比如说把这个 reasoning 能力往前推进了一步 ， 使得原来的一种期待能够满足了 ， 能够实现了 。

**曼祺** [10:30]
那正好顺着这个话题就可以聊聊技术 ，因为现在大家来聊起这个 o1 用到的一些新的技术 ， 可能对不是专门的从业者就会对一些词比较有印象 ， 比如说强化学习 ， 比如说思维链 ， 还有什么 test-time compute， 对吧 ？

但是您刚才其实也提到了像 Alpha 家族它之前也是用强化学习的 ， 所以这两个东西其实是有区别的 。

**Guest** [10:51]
就是我们的这个思维链 ， 它跟我们一般强化学习就是像 AlphaGo 里面 ，以及后续的 AlphaZero 他们用的一种蒙特卡洛树那种搜索的方法 ， 它这种思维链跟那种搜索方法区别是什么 ？

**袁进辉** [11:06]
就是说从最基础的问题说起 ， 就是说我们是知道这个无论大模型 、 强化学习这些东西 ， 我们都叫统计学习 ， 就是说数据里面有什么东西 ， 这个模型才有可能学到什么样的能力 。

数据里面没有的 ， 它是学不到的 。 数据里面不充分的 ， 或者是数据是不够 ， 或者某一种规律或者某种 pattern 它出现的频率不够高 ， 可能这模型也学不到 。

所以这是一个基础的前提 。 那我觉得是像强化学习也好 ， 还是思维链也好 ，以及 inference 叫 test-time compute 那个方式也好 ，其实都是基于前面这一条规则 、 一条原理衍生的 ， 就是它们都是解决那个里面的缺陷的 。

为什么呢 ？ 比如说专业的数据 、 专业的能力 ， 我们在网上搜罗到的这些自然语言的这些语料里面 ， 可能是不充分的 。

比如说我们大量的可能在网上搜到的这些语料都是消费向的 ， 或者是通识的 ， 或者什么没有非常专业的 ， 即使有一些专业的期刊书籍 ， 仍然对训练专业能力是不够的 。

那强化学习它在这里头会帮助生成 ， 比如说至少生成专业的数据 。 假如说我们还是以 AlphaGo 为例 ， 就是下棋的 ， 可能在全世界的语料里面关于如何下棋 ， 这个数据在语料里面也是不充分的 。

我们纯从这个自然语言里面可能很难训练出能打败世界冠军的下棋的一个 AI。 但是假如说就像 AlphaGo 那种 self-play 一样 ， 就是让这个构造一个环境 ， 让 AI 自己和自己下， 然后中间会形成很多博弈的数据 ， 叫 trace 或者是博弈的轨迹 ， 这些数据可以拿来训练 ， 来把这些数据补充到训练数据里面 ， 然后基于这个数据训练出的模型 ， 可能就要比直从网上收集到的自然数据

训练出的模型 ， 这个下棋能力要好 ， 或者换一个领域就是数学能力要好 ， 或者物理能力要好等等。

所以强化学习 、self-play 这些主要是用来构造这些专业领域或者专业能力的数据的 ， 使得原来不存在的 ， 然后有了 ， 或者是原来不够的 ， 现在充分了 ， 然后这个模型就有机会 、 有可能训练出在这个领域或者这个方向能力很强的这种能力 。

**曼祺** [13:23]
就是自我博弈的强化学习 ， 就您刚说的这个 self-play RL， 它比较擅长什么领域 ？ 您刚才描述的这些领域听起来好像都是要规则非常明确的 ， 对吧 ？

比如说它符合一个物理规律 ， 或者数学它是一个逻辑的结构 ， 或者下棋它也是一个封闭的规则 。

**袁进辉** [13:39]
的确 ， 就是在强化学习里面有一些基本的环节 ， 就是说我这个 AI 要和环境交互 ， 然后这个环境要给我这个 AI 反馈 ， 我对环境做了什么 ， 这个动作产生了什么后果 ， 这个后果是正向的还是反向的 ， 环境要给我个激励 ， 要个反馈 ， 这些是强化学习从这个和环境交互过程中获取这些数据的基本的原理 。

那如果是一个规则清晰的问题 ， 那构造这个环境就会更加容易 。 比如说下棋就是一个非常清晰的 ， 它胜和负 ， 什么情况下是胜 ， 什么是负 ， 每一个下棋的步骤它产生什么后果 ， 这都非常容易用一个计算机的程序来表述这个环境 。

那我就从计算机构造的这个环境获取反馈就非常容易 。 所以这个规则越清晰 ， 构造强化学习这样一个 setting， 这么一个设置就越容易 。

比如说像那个 AlphaGeometry， 就是说我这个或者是像证明数学题 ， 这个证明到底能不能走得通 ， 最终这个证明结果是错的还是对的 ，在数学上也经常有一些办法能够非常清晰的给它一个答案 ， 就是是正确的 ， 那就是奖励这个 AI，是错误的就有一些 。

但是另外一些环境可能就很难构造这种反馈 。 要构造强化学习的话 ， 一定要有一个能够低成本 、 能够更快速的 ， 就是需要一个仿真环境 。

但是在很多场景里面用强化学习的时候是缺这个仿真环境 ， 或者这个仿真环境的构造极其昂贵或者极其困难 ， 或者是我这个仿真环境和真实环境差别太大 ， 总有一些 corner case， 我没法在这个仿真环境里面去把它覆盖了 。

比如说像之前讨论那个自动驾驶 ， 自动驾驶肯定有个仿真环境 ，但是总有真实的那些情况在仿真环境里面构造不出来 。

构造不出来 ， 那我从这个仿真环境里面取得的反馈可能就不够真实 ， 或者是有些真实环境里面的情况在这个仿真环境里面根本没有刻画 ， 那我训练出的 AI 也不会有这个能力 。

所以在规则清晰的这种问题里面 ， 最容易用强化学习 ， 越那种通用的 ， 越不知道怎么描述这个胜负的 ，不清楚怎么描述 ， 比如说这个 AI 做一个什么动作 ， 做一个什么决策 ， 对这个环境产生什么影响等等 ， 像这种环境构造这个强化学习的 ， 用强化学习来解这个问题就越困难 。

所以你像 AlphaGo， 像那个 Geometry， 像那个 AlphaFold 还不是强化学习 ， 像这个 。

**曼祺** [16:13]
Proof 应该是 。

**袁进辉** [16:13]
对对 ， 像这种封闭环境里面 ， 规则清晰的仿真环境 ， 或者叫 reward model 等等 ， 就更容易搞 ， 就更容易使用这一套方法论 ， 成本非常低的就能够解这个问题 。

但是越模糊的 ， 越没有清晰规则的 ， 你越难构造这个 reward model， 就解不了这个东西 。 所以在现在 ， 相当于把那个比如说规则清晰设置下走通的一套方法论 ， 拿到了这个语言模型里面 ， 然后语言模型还能解决这些相对来说比 AlphaGo、AlphaCode 这种更泛化的一些问题 ， 这也算一个进步 。

总结下来就是说 ， 强化学习 self-play 还是来生成数据的 ， 来构造数据的 ， 让原来自然数据里面不存在的这些 pattern 或者是数据 ， 通过强化学习的一个设置 ， 然后能生成这样的数据 ， 再把这些数据放进训练数据里面 ， 使得我后面 train 出来的模型有这块能力 。

这是所以强化学习解决这个数据问题的 。 那那个 chain of thought 像这种东西 ， 第二个是 chain of thought，其实也是解这个问题的 。

你会发现就是说在训练这个 AI 模型的时候 ， 我们刚才讲了就是说 ， 如果数据里面某一种 pattern 越充分 ， 我训练出的模型在这方面的能力就越扎实 、 越靠谱 。

但是这个数据如果越不充分 ， 那你就不可能无中生有 ， 这个模型不可能有这个能力 。 那数据里面一般什么样的 pattern 或者什么样的东西充分的呢 ？

就是我们可以粗略的讲就是这些微观的东西 ， 那种细粒度的东西在这些原始的自然数据里面 ，不管是语言也好 ， 图像也好 ，是最充分的 。

但是那些宏观的东西 ， 或者是更 high level 的那种 ， 就像我们人讲的这些智慧的东西 ， 或者道的东西 ， 或者什么的 ， 这些通常在这个自然语料里面 ， 它是我们叫稀缺的或者是匮乏的 。

图像里面 ， 比如说我们可以讲这种像素级的这种数据绝对是非常充分的 。 比如说我收集多少张图片 ， 到底一个像素旁边另外一个像素是什么 ，因为这种例子在整个数据中实在是太多了 ，因为这种相邻的非常细粒度的是极其充分的 。

训练出的 AI 模型对这种细节 pattern 的刻画一定是非常充分的 。 但是比如说有的时候我们说让文生图生成一个需要符合我们语义的 ，有一个结构的 ， 一个构造的 ， 说图片里面有个什么样的布局 ， 比如说什么地方有个人， 什么地方有个洞 ， 或者什么地方写了一个字 ， 或者什么的 。

像这种更粗略的这种结构或者构造 ， 说我们在训练集里面找出来有反映这种粗略的构造的这种数据 ， 可能就少多了 ， 对吧 ？

你像语言也一样 ， 语言的话 ， 一个词后面跟着另外一个词 ， 这种我们在机器学里面叫 diagram， 就是相邻两个词间的统计的属性是最多的 。

但是如果说我在语料里面要找到更宏观 、 更粗略的一些那种策略性的东西 ， 换一个比方 ， 比如说我想训练一个搞投资的 AI， 投资人的 AI， 那我想在这个自然语料里面找出来这种关于投资逻辑的 ， 或者我做个一级市场投资的 ， 我到底某一家公司该投不该投什么的 ， 关于反馈这个里面决策逻辑的这种数据 ，在整个训练数据里面肯定是极其匮乏

的 ， 非常少 。 就像有的人说这个一级市场 ， 之前有一种说法是一级市场的投资人是很难训练出来的 ，因为每个机构多少年也就投几十个案例 ， 只能从这几十个案例获得一个成败的 ， 或者一个人像今天这种情况下也出不了几次手 ， 就很难获得一手的这个反馈 ， 这个东西成败 。

所以那你很难通过实操过程中去获得这种投资技能的提升 。 这一样的 ， 那只能怎么搞呢 ？ 就通过观察别人的投资案例 ， 或者做一些虚拟的投资 ，是吧 ？

比如说我这个公司我并没有投 ，但是我写一个投资报告 ， 几年之后看一下， 然后中间不断跟踪这个公司的发展情况 。

像这种非常专业的高层次的东西 ，在这些数据里面是非常匮乏的 。 所以这种像语言模型 ， 它可能做那种局部的微观的 ， 你让它做一个决策或者一个认知 ， 一个小推理 ，以前的语言模型是胜任的 ，是 OK 的 。

但是你要做一个非常宏观的复杂的一个大问题 ， 中间包括很多步骤的 ， 确实是超出原来语言模型的能力 。

就是因为原来语言模型它见过的语料里面这种东西就很少 ， 那怎么办呢 ？ 那好像 chain of thought 就提出来说 ， 既然你这个语言模型你自己做不太好 ，但是我给它一些提示 ， 让它把一个大的问题 、 宏观的问题分解成小步骤 ，但是每个小步骤是原来那个模型妥妥做得挺好的 ， 那就总体上是 chain of thought 的思路就做了嘛 。

但是像 o1 它实际上在 chain of thought 的基础上还做了一点东西 ， 就是有可能 ，有可能 ，但这一点没有确认 ， 就是训练语料在 self-play 那个在强化学习那个架构下， 它可能也构造了一些这种宏观的 chain of thought 的数据 。

**曼祺** [21:28]
构造的意思是指它们自己生成的的意思是吗 ？

**袁进辉** [21:30]
对 。

**曼祺** [21:30]
就不是从语料里直接来的 。

**袁进辉** [21:32]
语料里面没有 ，但是可能工程师用领域知识 ， 用一些工具软件去生成一些这种反应 ， 这种宏观或者是思维步骤 、 思维策略的数据放进这个语料里面 ，有可能训练出来的模型就能提高这种处理宏观策略的 ，以及说解决问题过程中这种有套路 、 有步骤的这种能力 。

**曼祺** [21:56]
为什么有这个猜测 ？ 从什么迹象看到的 ？

**袁进辉** [21:59]
就是刚才讲的做这个 AI 算法的这些人， 就是最开头我们说那个有基本的出发点和基石 ， 就是说我数据里面有什么 ， 我模型可能有什么能力 。

如果模型什么能力不行 ， 我又想让它自动学会 ， 我一定要在数据层面去解决这问题 ， 那就要去构造这个数据 。

刚才说的强化学习构造专业数据 ，有可能 chain of thought 也用一些强化学习东西去构造这些宏观策略的数据 ， 它就有可能获得这个能力 。

这是 chain of thought 这种东西 ，是吧 ？

**Guest 2** [22:29]
其实 DeepMind 一月份他们发第一代那个数学模型的时候 ， 就提到他们一个技术特征 ， 就是说我们自己生成了一条的数据 ， 然后教我们这个模型学会了怎么去更好地解答一个数学题 ，但是当时他没有提所谓的我们又没有用强化学习 ， 当那篇文章还发在 Nature 上面 。

**曼祺** [22:48]
但它 7 月更新的时候就是明确说了自己用强化学习 ， 就是 AlphaGeometry。

**Guest 2** [22:52]
对 ，其实刚才袁老师在提这个的事情的时候 ， 结合着我昨天看的他们的资料 ， 比如像强化学习和思维链 ，在这个让这个模型学会一些编程数学这些问题上面 ， 感觉是一个很难分割的一个事情 。

比如说我们就类比就是 AlphaGo、AlphaZero 他们去下棋的时候 ，他们所说的那个强化学习就是我知道这个棋局 ， 我从第一个棋子开始下， 然后一直到我获胜 ， 它其实中间是非常大量的步骤的 ，他们也需要这样的步骤 ， 每一步我怎么去找到一种最优解 ， 然后保证我的胜率是最高的 。

但是在我们去学所谓的解数学题也好 ， 编程题也好 ， 它也有一些步骤 ，但这个步骤没有像下棋那么的明显 。

那就是刚才袁老师所说的 ， 就是我们给它构造了一个思维链 ， 就是让模型强制的就是一步一步一步一步去解题 ，不要跳跃 。

那我每一步都正确 ， 那我最后得到正确答案的概率就会大幅度提高 ， 那它其实也有一点暗合我们所谓的下棋的那套强化学习的逻辑嘛 。

**袁进辉** [23:55]
对 ， 刚才我说那个强化学习和思维链这个 ， 它是一定程度上是正交的 ， 就是强化学习那个它可以引入这些领域的这些数据 ， 创造合成这些领域的数据 ， 然后思维链是说从这些问题的这个细致程度或者局部和粗略和宏观这个角度 ， 这个思维链它能解决一些更宏观的 ， 就是说原来的模型或者是在专业的能力或者数据上有匮乏 ， 另一个

角度是说原来的模型在解决这些宏观的策略层面的这些问题能力有匮乏 。 所以它是从这两个角度有这两个套路 ， 一个是强化学习 ， 一个是思维链 ，但是其实这两个也可以结合 ， 就是在解决思维链这里面也可以引入强化学习 。

**曼祺** [24:45]
来生成一些思维链 。

**袁进辉** [24:46]
来生成一些来提高它思维链这种 ， 或者是把问题分解的这种能力 。 然后在强化学习里面肯定也有这种所谓的思维链的这种成分 ，因为原来我们让这个 AI 比如说训练下围棋或者什么的 ， 那本身就是一些步骤型的东西 ， 那里面也有这个问题分解什么的这种求解的过程的元素了 。

**曼祺** [25:08]
就是在做思维链的时候怎么去给它分步骤 ？ 就因为你刚才说其实大模型比较擅长处理那种比较细节的问题 ， 就你已经给它分成一小步一小步之后， 它可能里面去处理每个一小步 ， 它会处理得比较好 ，但是这个步骤怎么分的这个策略是怎么定下来的 ？

### 思维链

**袁进辉** [25:24]
最早的思维链是人给它通过 prompt 去提供问题的分解 ， 就是 AI 做不了 。 但是现在一定程度上应该是有一些通用的 ， 比如说有一些问题有通用的求解策略 ，有可能在这些宏观的策略上又做了最直观的情况下， 这些策略通过人工构造模板去构造 。

比如说我们在计算机里面有一些基本的所谓的算法 ， 比如说分置算法 ，有个大问题我要把它分解成小问题 ， 然后还有一些是我们讲那个术语里面有什么坍心算法有什么的 ，有一系列 ，其实那些算法总共的数量也不多 ， 就那么可能是十几个 ，但是它能解决绝大部分我们在计算里面用计算机来解问题的 。

所以它是有规则的 ，有少数的一些套路能够解 。 那最简单的做法就是我把每个套路都在这个手工或者规则的实现了 ， 然后那在碰到一个问题的时候 ， 再有个策略去选到底用哪个套路 ， 用哪个思维链的分解方式 ， 这是一种办法 。

还有一种办法有可能就可以训练一个 model 去把这些少数的这些问题求解的策略和套路自动解决了 。 也许这个模型不需要太大 ，因为总体上宏观的这种问题求解办法可能数量并不多 。

刚才有提到是计算机术语里面 ， 比如说解一个物理问题里面 ， 它可能就是有一些基本的步骤 ， 比如说是一个力学问题 ， 那力学问题里面有一些基础的公式 ， 比如说计算加速度至少要知道力 ， 力的大小 ，以及花的时间 ， 还有那个质量 ，有这样基本的几个要素 ， 它可以根据那个领域知识一分解 ， 分解成基本的几个套路 ， 然后每个问题那再去

求那个力 ， 再求时间 ， 再求质量等等 ， 然后这个问题可能就求解了 。 所以在这种宏观层面 ， 它这个思维链有可能有一种简单的办法 ， 就是用规则的方式 ， 可能那个规则也不会太多 。

还有一种办法就是当然更优雅 ， 泛化能力更好的就可能那个层面也训练一些模型 。

**曼祺** [27:26]
也有一个模型来挑选筛选思维链 。 这让我想到就是您昨天给我们分享的中科院的研究员张俊林 ，他不是写了一个关于 o1 的评价吗 ？

他说他觉得这个事情很重要的一个点就是自动化了思维链的过程 。

**袁进辉** [27:40]
对 。

**曼祺** [27:40]
就是你刚刚说的可能最开始这个东西是人给他的 ， 之后你可能是一些规则 ，因为也没有那么多的套路 ， 对吧 ？

然后最后可能是一个更优雅的方式就是我用模型来找这个思维链 。

**袁进辉** [27:52]
这现在都是猜测 。 我觉得像这个 o1 训练的时候应该是加入了这种叫思维链层面的这种数据的合成 、 训练这些一些东西 。

但是在 inference 的时候有可能这个思维链可能我怀疑还是规则的 ， 就是说并没有用一个模型 ， 或者是那个思维链的构造有可能不是一个模型 ，而是一个规则的系统 ， 就是一个问题怎么分解 ，但是是有一个就是一个稍微复杂一点的规则系统 ， 或者叫什么决策树什么的 ， 它不会去试探再回退 ， 就是说我如果试错了 ， 一般模型会比如说像下棋一样会去演化 ， 然后如果

说往前走了一步或者想了一步不对 ， 它再回退到前面想错那个东西 ， 再从上一个步骤状态再往下推演 。

我怀疑在推理的时候还没做到这个 。

**曼祺** [28:42]
这说到一个点是这一次 OpenAI 它发布的版本里是没有向用户直接去展示原始的思维链的 。 它还专门提到了这个 ， 说为什么他们在几经考虑之后认为我们现在不要去展示这个思维链的过程 。

**袁进辉** [28:55]
对 ，其实如果展示了 ， 这个其实是相当于技术秘密 ， 比如说我们就可以更好地去分析它到底怎么做的 。

**曼祺** [29:02]
你觉得主要是这个原因是吧 ？

**袁进辉** [29:04]
对 。

**曼祺** [29:04]
它自己倒不是这么解释的 。

**Guest 2** [29:06]
它说这是因为安全的考虑 。

**袁进辉** [29:09]
那也是 ， 就是说如果它放出来之后， 你能够更好地去 hack 它 ， 就是一方面可以 reproduce 它 ， 还有一种是就是你可以做越狱的东西什么的 。

### 推理时计算

**曼祺** [29:19]
对 ， 那可以继续说到你刚刚说的第三个 ，因为前面两个 ， 一个是强化学习 ， 一个是思维链 ，其实都是在基于大模型是一个统计学习的原理上， 我去弥补数据的缺陷 ， 对吧 ？

强化学习弥补的是专业数据的缺陷 ， 思维链弥补的是可能抽象层次没有那么高的那些数据比较少的一个缺陷 。

那说到最后一个点就是 test-time compute， 或者也有人把它叫什么 inference time compute， 这个是发挥一个什么作用 ？

**袁进辉** [29:45]
它其实也是解决 ， 就是我直接让模型计算一次它搞不定的事情 。 它为什么搞不定呢 ？ 也在于说原来这个模型里面就没有 ， 就像刚才说它也是思维链嘛 ， 就原来这个模型并不擅长解决那些综合的问题 ， 或者是宏观决策的问题 。

那通过在 inference 的时候引入这个 ， 你不管是 AI 方式也好 ， 还是规则方式也好 ， 把问题分解再去求解 ， 然后分解成每一个步骤 ， 每个步骤都是大模型非常擅长解决的 ， 然后最终把整个端到端的问题解决了 ， 大概是这样 。

所以它仍然是弥补说原来大模型不太擅长解决那些比较综合的 、 步骤非常多的 ， 或者复杂性非常高的这些推理问题 ， 这是 reasoning 的问题 。

所以它倒不像那个前两个是补充训练数据 ，在训练端做工作 ， 把这个问题去搞定 ， 它是在推理端做工作 ， 就是模型已经定了之后， 它仍然可以在推理的时候做一些 ， 就是把思维链用上等等 ， 多步来解这个问题 ， 综合来说给用户更好的体验 。

这个方法其实在 Agent 里面 ，在一些这个 RAG 像这种 workflow， 国内我们知道还有上海人工智能实验室还做了个 mind search， 就是说做搜索的时候其实人也是做了很多反思 ， 琢磨这个怎么搜得更好 ， 怎么用更好的关键词去搜索什么的 。mind search 就做了这样的工作 ，也就是说提高这个模型的能力 ， 既可以在训练端做一些工作 ，也可以在推理端做一些工作 。

它这一次其实一个比较大的意义是说它把 o1 中说在推理端多花一些算力或者多花一些时间 ， 然后最终表现出来这个能力也非常有效 ， 提高非常多 。

所以这几个综合来说 ， 像强化学习也好 ，chain of thought 也好 ， 还有这个 inference time compute 或者 test-time compute 等等 ， 每一个单独的 idea 来看都不是说石破天惊的 ， 每一个单独的 idea 应该在前面都找到了 ，但是它把这几个 idea 综合在一起 ，有的在训练端 ，有的在推理端 ， 都用来提升这个 reasoning 能力 ， 都来解决这些原来单个大模型做不好的问题 ， 单次推理做不好的问题 。

**Guest 2** [31:58]
对 ， 所以这一次 o1 发布之后， 大家还有一个讨论的事比较多 ， 就是系统 2。 然后类比人的话 ， 系统 1 就是没有经过思考 ， 就是你的一个本能的反应的一个过程 。

比如说我们学开车学得久了之后， 路上遇到什么人， 遇到什么车 ， 我们就会自动的身体就会反应操作方向盘或者是油门 、 刹车什么的这些东西 。

但是系统 2 的话就是我解题的过程 ， 我一定要深思熟虑去下一个判断 ， 做一个决定的时候 ，其实大家会在讨论的这个点 ， 包括 OpenAI 自己也提到 ， 那他们的 o1 就是具备系统 2 能力的这个过程 。

所以这里面是不是说我们的 test-time compute， 它就是一个我让它在推理的过程中强制按照系统 2 的逻辑来去解答问题的过程呢 ？

**袁进辉** [32:41]
可以这么理解 ， 就是原来大模型 inference 是怎么做呢 ？ 就是单次 ， 就是来一个 input 或者 prompt， 我这个大模型神经网络只推理一次 ，inference 推理一次就出结果返回给用户了 。

现在是这个问题过来 ，inference 做一次 ， 它然后把这个结果结合 chain of thought 再处理一下， 再喂进大模型 ， 让大模型再基于它上一次结果 ， 或者再加上那些 prompt， 或者叫加上这个 chain of thought 的提示 ， 让它有一个琢磨的过程或者反思的过程 ， 叫 reflection。

经过这么几次 ， 它中间可能是一个逐渐 refine 的过程 ， 就像刚才说的 ，不会把中间的这些状态返回一个用户 ， 它会把最终反思之后前思后想的结果再返回一个用户 。

现在确实就像人的这个所谓的就是 system 2 这种 ， 就是中间一些叫慢思考的 ， 前面那个是一个直觉的 ， 就是大模型不管这个问题容易还是简单 ， 就是一次 inference， 然后这个时间是固定的 。

但是这次 o1 它相当于说简单的问题可能是一次或者少数几次 inference 就一次就返回给用户了 。 如果很难的问题 ， 它可能在中间反刍或者什么好几次 ， 最终才返回给用户 。

**曼祺** [33:55]
对 ， 我补充一下， 就 inference 就是推理 。

**袁进辉** [33:58]
对对对 ， 推理有两个词 ， 一个是 reasoning， 一个 inference。reasoning 是逻辑推理 ， 逻辑推理就是刚才我们一直讲的 ， 就是像解数学问题或者中间的 reasoning， 就是逻辑上的 ，因为一个前提条件有个什么结果 ， 类似这个的 。

还有个推理是 inference，inference 是指和 training 相对的 ， 就是 training 是训练模型 ， 前向反向训练 ，inference 是使用模型过程中， 它只有一个前向计算过程 ， 就来一个输入 ， 它这个神经网络处理之后有个输出 。

所以这次我们后面讲的推理是指 inference， 所以我们后面可以都用英文 。

**曼祺** [34:37]
你觉得这样比较准对吧 ？

**袁进辉** [34:38]
对 。

**曼祺** [34:38]
对对对 ， 我补充一下只是因为我怕有的听友可能他对这个英文不是那么熟悉 ，他对不上这个中文 。inference 指的就是模型使用过程中间的这个推理 。

### 缩放定律

**曼祺** [34:48]
然后这次你也说到一个很大的变化 ， 就是 o1 它展示出了我们在推理上去放更多的计算资源 ， 模型的性能也会有一个提升 。

然后在 OpenAI 自己的博客里 ， 它是放了一张图的 ， 这个图其实就是两个点连起来 ， 大概是斜率向上的图 ， 然后一边是之前大家已经比较理解的这个 scaling law， 就是它下面是训练时间的规模 ， 然后纵坐标是你的性能 ， 它是这样上升的 。

然后另一张图就是下面是 test-time compute，也就是你推理时间的这个计算的规模 ， 然后纵坐标是性能 ， 它也是这样提升的 。

比如说这个英伟达的资深的 AI 科学家 Jim Fan 就说这可能是 2022 年以来在大模型研究领域最重要的一张图 。 你会怎么看这个问题 ？

就是为什么说我们发现在推理上我去铺更多资源 ， 这个性能能提升 ， 它会有这么大一个重要性 。

**袁进辉** [35:39]
我觉得它更大意义是在说这个原来有一个矿 ， 原来没挖 ， 现在是就是发现这个地方也有挺丰富的资源 ， 又发现了推理上比如说边际收益比较大 。

**曼祺** [35:51]
对 ，因为这两个斜率也是不一样 ， 它推理的那个斜率就会比较陡 。

**袁进辉** [35:56]
对 ， 像训练的时候那个所谓的 scaling law， 就是在训练上要多放计算资源等等 ， 这个是过去的一个共识了 。

当然每一个办法我们都知道 ， 就是说它不可能永无止境的 ， 就像大家讨论 ， 它肯定是所谓的边际收益衰减或者递减的 ， 只能说在训练上它更接近后面递减的那个 ， 就是说平缓那个状态 。

**曼祺** [36:17]
就是训练的矿挖得快 。

**袁进辉** [36:19]
对对对 ， 反正就是收益率没有那么高了 。 但是推理上面它实际上就像刚才说的 ，在推理时候做 reflection 做这些肯定是对 chain of thought 的这种或者高层次逻辑或者综合的这种很有效的 ，但是以前没怎么做 ， 或者没有人把它喊出来 。

现在只不过把这个事实展示出来了 ， 就是在原来没怎么做的地方还有很大的收益可以做 。 它刚开始做的时候收益率肯定很高 ，但是肯定到一定阶段之后也会变成那种衰减的 。

### 算力与成本

**曼祺** [36:50]
我有个很直接的问题 ， 就是这事对英伟达的股价会有什么影响 ？ 就这意味着会需要更多的算力吗 ？

总的算力规模上我是这样 。

**袁进辉** [36:57]
是 ，o1 总体上无论是在训练和推理上都意味着更多的算力 。 像刚才我们说的那个强化学习 self-play 这个 ，因为它主要解决的是合成数据这个问题 ， 就是原来说大家说 scaling law， 训练的 scaling law 到底了 ，因为这互联网上的数据都用完了 ，而这个训模型它的计算力是和数据是成正比的 。

如果那个数据用完了 ， 那你肯定后面的计算可能量也就到顶了 。 但是现在比如说用强化学习这种 self-play 或者这种方式能够合成更多的数据 ， 就意味着这个数据又开始无穷无尽有这个可能性了 。

那训练的时候肯定计算力的需求也是会持续增加的 。 这是一方面 ， 这是训练的一端的 。 那刚才说的这个 test-time compute， 它实际上也引入了更多的计算 。

原来 inference 的时候只做一次 ， 我们叫 not inference 吧 ， 就只做一次 。 现在我要加入这个 reflection 之后， 我可能要多次调用大模型的 inference 前向计算 ， 最后多次的 inference 的结果综合出来才呈现给用户 。

所以一下子平均下来我们拍一下， 比如说现在要调十次大模型的 inference 的话 ， 那就是十倍的 inference 的算力 。

**曼祺** [38:12]
您刚说的原始那种只用一次 inference， 叫 naive inference， 这是一个术语是吗 ？

**袁进辉** [38:18]
我是为了把它和今天 o1 的这个 reflection 这种区分 ， 可以说 o1 之前的那个 ， 比如说 4o、GPT-3.5 等等都是一次 。

**曼祺** [38:28]
这是你发明的一个词是吗 ？

**袁进辉** [38:30]
我随便给它附的一个代号 ，但是这个大家都知道 ， 就是只做一次 inference 就返回结果的 ，以前就是这么做的 。

现在是要做多次 inference 综合的结果才返回给用户 ， 所以那肯定这个计算的数量就增加了 。 所以无论是训练还是推理 ， 它的计算力的需求都是有很大提升的 。

**Guest 2** [38:52]
有一个点就是其实 OpenAI 他们在他们的博客里面其实写得不是很清楚 ， 就是 o1 的训练的过程到底是怎么样的 。

它只说他们用了强化学习训练 ，但是从一些大家讨论来看 ，以及隐藏在它系统卡里面的一些介绍来看 ， 我会觉得他们其实在原始上他们训练 GPT-4 这种模型的预训练 ，他们是跑不掉的 。他们在这个基础上增加了一些强化学习的 ， 这是一个大家的猜测 ，不知道袁老师觉得这种猜测是合理的吗 ？

还是它是真的就是这么做的 ？

**袁进辉** [39:24]
对 ， 基本上我猜测也是这样 ， 就是说原来训练大模型的时候是从网上收集自然数据 ， 然后做 pre-training， 然后再做 post-training， 比如说 alignment 什么的 ， 原来是这么做的 。

现在是我收集了自然数据 ， 同时还有通过 self-play、 强化学习获得的一些合成的数据 ， 这些数据和自然数据放在一起去做这个模型的训练 ， 然后这个模型肯定训练出来之后继续有原来那个通识的那种能力 ，也在这些数理 、 工程这方面也有很强的能力 。

那就训练的时候我猜测简单理解来说就是这样 ， 就是它把合成的数据和自然的数据弄在一起 ， 然后去训练这个模型 。

**Guest 2** [40:07]
对 ， 所以也有人说这个叫 middle train， 就是属于中间的一个 pro， 一个前的一个预训练 ， 一个是中训练 ， 一个是后训练 。

**袁进辉** [40:16]
也有可能 ， 这是这个也是猜测 ， 它有可能把合成的数据和自然数据放在一起 training from scratch， 就是从头训练这个基座模型 ， 这是一种可能性 。

还有一种可能性是用自然数据去训练了基座模型之后， 然后再把合成数据和一部分自然数据放在一起做所谓的 continue training，也有可能 。

但是这个要通过做实验是看这个把合成数据一开头就放进去 ， 还是在中间那个叫 continue training 的阶段放进去 ， 乃至说在做 fine-tuning 的时候放进去 。

这个就是我现在有无从得知 ，但是有机会做这种实验的可以做一些去尝试一下 。

**曼祺** [40:56]
就是您刚才说这个训练阶段的算力需求会变大 ， 您说的一个原因是因为有了更多的数据 。

**袁进辉** [41:02]
对 。

**曼祺** [41:02]
那它和模型规模有关吗 ？ 就是我算力的需求是不是也和模型参数量有关 ， 对吧 ？

**袁进辉** [41:08]
对 ， 一般来说有个公式 ， 就是训练时候的计算的力的需求等于模型大小一个比例 ， 六倍的模型大小乘以训练模型时候见过的 token 的数量 。

所以既和模型大小有关 ， 我们假设这个模型大小不变的话 ， 那就只和这个数据大小有正比了 。

**曼祺** [41:28]
对 ， 我就是想知道这个算力需求 ， 那它肯定也跟参数量的变化有关系吗 ？ 就现在也有人猜测说这个 o1 它可能不是一个参数那么大的模型 。

**袁进辉** [41:37]
就是它有可能有一种做法是 ， 比如说 chain of thought 或者是做那个就是宏观决策那一部分 ， 做 chain of thought 的那一部分的 model， 它并不需要太大 ， 或者做 reasoning 那部分的 model 可能不需要太大 。

比如说就像 AlphaGo 那种模型 ，AlphaCode 那种模型 ，以前都是千万级或者亿级参数就能做得非常好了 ，因为它取决于说我大模型通识来说我要知道方方面面的知识 ， 那可能需要确实参数量要比较大 ，但是我只提升某一个方面的能力的话 ，也许那个问题的容量或者是空间并没有那么大 。在做 chain of thought 那个层次的策略分解或者是问题求解这个过程 ， 那个部分的模型也

许不需要太多参数 ，也有可能大家会讲那个叫 compound， 就是复合模式 ， 就是有小一点的模型和一个更大的模型配合 ，也有可能 。

**曼祺** [42:35]
我看这个 Jim Fan 也在推特上分享 ，他说未来的模型可能会分离成有一个小的推理核心的部分 ， 然后再有一个大的部分 ， 它会记忆很多知识 ，以便它在一些就是尝试性的琐碎性的问题上它可以回答得比较好 。

**袁进辉** [42:50]
是 ，有这个可能 ， 对 。

**曼祺** [42:52]
但是这个和您刚刚说的就是训练阶段 ，其实我的绝对算力也需要扩大是不矛盾的 ， 对吧 ？ 因为其实参数非常大的那种模型大家也会往前训 ， 然后新的突破在于我可能也有了一个相对小一点的这种推理的核心的东西 。

**袁进辉** [43:05]
对 ， 这两种都有可能 。 有一种可能性是我们不改变模型的大小 ， 我只是增加了合成的数据 。 还有一种可能性就是说它对那个合成数据的训练是在一个更小容量的模型上实现的 ， 然后这个小一点的这个 policy 的网络也好或者什么 ， 它是和那个基座模型是配合的 。

就是这个也是不知道 OpenAI 他们具体怎么做的 ，但是有这种可能性 。

**曼祺** [43:33]
然后我从现在的收费情况看的话 ， 肯定在推理端我觉得您说的那个应该是很靠谱的 ， 就是它的推理成本 ， 计算的成本至少是数量级的提升 。

因为现在它给 Plus 会员开的限制是 o1 的 preview 每周是 30 次 ， 然后 o1 mini 每周是 50 次 。 那之前 4o 的话它的限制是每三小时 80 次 ， 那中间差了差不多有大几十倍吧 ， 到 100 倍的样子 。

这可以反推出它的推理成本的差异是吗 ？

**袁进辉** [44:00]
一定程度上我们从那个使用它的时间来说能感受到 ， 就是说用这个 o1 的话它通常会提示思考了几秒钟 ， 最长时可能是几十秒钟到一分钟 。

从这个时间上感觉后面发生的计算也更多了 ， 它这个次数还不是特别直接 。 我怀疑就是说它之所以限制次数 ， 可能的原因一个是说这个技术还没有那么 ready， 就是说它反正给大家试用的机会 ，并不希望就是说完全 release 或者完全放开给大家去试 。

还有一种可能就是确实它需要资源很多 ， 那这个资源的准备可能还不够 ， 然后做一些限制 。 但总体上就是说从这个次数来说还不是最直接反馈它计算消耗量或者成本的指标 ， 就从它定价可以直接看出来 ，因为它的定价是会和计算力的消耗是比较相关的 ， 比较成正比的 。

反正看那个定价的话是原来 4o 的几倍到十倍吧 ， 差不多是这种 ， 它可以是几十美金 ， 一百万 token 吧 。

**曼祺** [45:00]
你说 API 的那个定价 。

**袁进辉** [45:01]
API 的定价就从百万 token 多少钱是更直接的能看出来它是原来的多少倍 。

**曼祺** [45:07]
API 的定价现在是 4o 的 ， 您刚刚说是多少倍 ？

**袁进辉** [45:09]
有一张图 ，他们那个博客里面现在百万 token 是大几十美金到百美金 ，以前是百万 token 十美金平均 。 从这个价格是能直接反馈出来它那个计算力的增加的 。

**Guest 2** [45:23]
对 ，其实昨天我们在看他们的资料的时候也关注到有一个细节 ， 就是说他们还特意在 o1 的这个介绍文章下面加了一句 " 我们还在开发 GPT 系列的模型 "。

然后其实当时我们就有一个判断 ，其实 o1 它就只是说我为了展示我在逻辑推理这方面能力的一个模型而已 ， 那我接下来它是不是会作为一个组件成为我们后续比如说下一代的 GPT-5 的一个一部分 。

那 GPT-5 是不是说真正的就是 o1， 或者就是换一种说法来说就是我们当前 OpenAI 所有技术的一个集合体 ， 那就会显得它的参数量会爆炸 ， 然后基于知识的参数量会爆炸 ， 然后 o1 也会更是一个完全体的状态 ， 那它的一个成本呀 ， 那它的一个推理成本也会有巨大的提升 。

**袁进辉** [46:11]
现在应该是说在像数理 、 工程 、 科技这一块有比较直接的反应 ， 就是相当于说这套方法论验证了是 work 的 ， 这条路能走通 ， 然后它可以再把这套方法论复制到更多领域去 ， 比如说甚至说像大家讲那个法律 、 金融等等这些 ， 它可能已经做了金融的 ， 像很多领域它可以都用这种方法论去构造这些数据 ， 然后提升那个领域的专业能力 ，

综合来说这个能力肯定就会更好 。 同时它也可以在原来做得好的 ， 比如说数理这些 ， 让它这个效果更好 。

总体上它是一个确实像最开头我们讨论的对那些 reasoning 能力的一个提升 ， 基本上我们说这个所谓的模型的智商的话或者能力来说 ， 大的分类就是这么几个层次 。

**曼祺** [47:06]
对 ， 那正好讲到这个可以讲一下这个模型的应用 ，o1 的应用 。 就现在我们能看到的 o1 很快在什么场景可以被大家用起来 ， 或者说它会比较快地有商业价值 ？

### 应用与智能体

**袁进辉** [47:16]
最大的想象力还是这个 Agent， 就是大家一直原来说的是 Agent 受限于 reasoning 能力 ， 即使水平最高的 GPT-4o 等等这些 ， 还是有很多那个 Agent 走不通 ， 或者那个错误率累积是吧 。

那现在这个在 reasoning 能力上的提升 ， 一定程度上有望解锁 ， 或者让 Agent 的这个范式能更实际 、 更 practical、 更可行 。

**曼祺** [47:41]
对 ， 你可以用比较简单的话为我们的听友就是讲一下你理解的 Agent， 或者我们叫智能体它是什么 。

**袁进辉** [47:49]
其实最终的话这个 Agent 是希望实现叫 AI 工人， 就是让它解决任务 ， 解决我们人的这个生产力环节 ， 比如说我们平常工作过程中这些所有的工作 ， 比如说我 HR 岗位 ， 或者我这些程序员岗位 ， 我有程序员的 Agent， 或者是各种各样的工种 ， 它是每个工种都是来解决这些实际的任务或者具体的问题的 。

那 Agent 是希望借助大模型 ， 让终极情况下， 就是说每一种工种都有一个 Agent 可以替代 ， 就好像大家在想象一种叫数字员工 ，以及我们的这种公司里面各种岗位有很多虚拟的这种工人等等 ， 最终是要解决这个问题的 。

**曼祺** [48:32]
那您说这个 Agent 其实它主要做的是偏虚拟的和白领的工作吧 ， 就是它不是在工厂里的那种对吧 ？ 因为它不和物理世界交互 。

**袁进辉** [48:41]
还不是物理世界那个 ， 物理世界那个还需要加上机器人， 加上具身智能等等那些 。

**曼祺** [48:46]
它这个还是和比特世界交互的这些东西 。

**袁进辉** [48:49]
是 。

**曼祺** [48:50]
明白 。 您刚才也说到嘛 ， 就是之前的 Agent 大家跑不通 ， 就是觉得其实你处理分布的这种能力是比较差的 。

那如果按行业分的话 ，因为你刚才说了很多工种嘛 ， 那在什么工种 o1 可能最先用起来了 ？ 因为 OpenAI 它自己优化的这个 o1 mini 它是面向 Steam 方向的 ，也就是数学 、 编程 、 科学这些问题 。

就是我们可以认为说 OpenAI 自己也觉得比如说 coding 代替程序员会是一个最快爆发的方向吗 ？

**袁进辉** [49:16]
对 ， 代替程序员这个可能在 o1 之前 ， 比如说大家已经看到了 ， 就做得非常好了 ， 就是它还不能完全代替一些水平非常高的程序员 ，但是已经能看到非常 promising 了 。

之前其实像 AlphaCode 的阶段 ， 它已经能写一些代码了 ， 到后面像最近这个 Cursor 等等这些编程工具 ， 自动编程这些方式的出现 ， 使得说这个大模型实际上在 o1 之前就已经在编程领域或者说辅助代码生成这些方向已经效果非常好了 。

所以 o1 是在代码之外 ，在更泛的这些数理 、 工程 、 科技这些方向又解锁了一些 ， 就不光是编程 。

**曼祺** [50:00]
所以一方面它可能在应用上可以在编程这个领域继续的去深入的应用 ， 另一方面就是您说的它解锁了一些别的场景 。

**袁进辉** [50:07]
是 。

**曼祺** [50:08]
但这些场景目前看都不是普通人用上的场景 ， 对不对 ？ 它好像比较偏科学研究 。

**袁进辉** [50:13]
是 ， 所以它是对那个智商要求更高 ， 或者是这种专业能力要求更高这些 ， 就是智商密度或者智力密度更高的这些问题能做得更好 。

但是我们在日常生活和工作过程中确实遇到的问题也有很多层次 ， 对吧 ？ 有的问题我直觉反馈一下就能解得非常好了 ，有的是需要专业训练 、 专业素养才能解好的 。

反正这些问题会有一个谱系 ， 然后这些问题它的价值密度也不一样 ， 对吧 ？ 你如果是解决生产力中的问题的话 ， 通常它的价值会更高一些 。

甚至说我看网上有人想让它解决那个黎曼猜想嘛 ， 如果它真的能把这个问题搞定 ， 就说即使让它花一个月去计算 ， 去解这个问题能搞定 ， 那价值也足够大 。

**曼祺** [51:01]
一个月多短呀 ？ 当年大家去破解费马大定律 ， 那不是用了两百多年吗 ？

**袁进辉** [51:06]
对对对 ， 所以就是说这种非常重要的 、 非常高价值的问题 ， 它并不是在生活中频度非常高的 ， 它解的不是那种常见的问题 ，但是它相当于代表了这个大模型的能力的天花板或者是极限 ， 往这个极限去探索更近的一种 。

**Guest 2** [51:23]
其实这点也是刚才我们在聊的时候一直在想的一个问题 ， 就是我们用强化学习带给它的这种能力 ， 它在围棋上面我可以击败世界冠军 ，但是在这种数学问题上， 它能做到人做不到的事情吗 ？

**曼祺** [51:40]
其实我刚才也在想 ， 它能证明比如说费马大定理吗 ？ 因为那个是比如 250 多年， 然后数代科学家接力 ， 对吧 ？

然后最后怀尔斯是他又借鉴了一些前人的研究 ， 包括当时日本那些数学家研究什么椭圆方程的什么成果 ， 然后最后它是一个非常复杂的证明 ， 把一个很简单的 、 题面的这个问题给回答了 。

当然数学它也算是一个封闭空间吧 ， 可能它会有一套严谨的逻辑什么的 ， 然后如果用了 o1 的这种范式 ， 它有可能会在这些领域有什么比较惊人的发现吗 ？

**袁进辉** [52:11]
我觉得有可能 ，有可能不是 o1，有可能有一个就是原来用 AlphaGo 那种套路就可以 ，不一定是用 o1 这种大模型 ， 我可以做一个 AlphaMath 或者什么 。

**曼祺** [52:23]
就是非常针对这个领域去优化的 。

**袁进辉** [52:26]
对 ， 就像 AlphaGeometry 那个 ， 它其实就是平面几何里面的 ， 就是数学当然领域非常广泛 ， 它 AlphaGeometry 或者 AlphaProof 等等只是更细分的一个领域里面 。

那它借助的实际上是计算机的这种搜索能力 ，其实像那个围棋 AlphaGo 也是搜索 、 尝试 ， 然后会有一些反馈 ， 然后在这个问题的空间里面去探索 。

当然这个空间非常大 ， 就像下棋那个空间也非常大 。 如果我们真的去把这个空间中每一点都便利到今天所有的算力加起来都不够 ， 就是真的每一点都去探索到都不够 。

但是本身像这些下棋的问题也好 ， 数学的问题也好 ， 现实中我们遇到问题也好 ， 它都是有结构的 ， 它在它问题那个解空间里面不是均匀分布的 。

比如我们想象假如咱这间屋子 ， 它里面有多少个空气的或者什么分子 ， 太多了 。 如果每个分子都去数一下或者是去看一看 ， 它需要的那个计算的能力就非常大 ， 需要消耗的时间也非常长 。

但是像下棋这种或者是数学的这种问题 ， 它通常我们讲它有结构 ， 就是说它真正那个解在它那个空间里面的分布是不均匀的 ，不是平摊到每个位置的 。

它是在有的地方密度高 ，有的地方密度低 ， 就是有的地方是出现的可能性大 ，有的地方出现的可能性低 。 就像 AlphaGo 一样 ， 它通过一种试和反馈 ， 然后再去训练这个模型 ， 这个模型会捕捉住这个解在这些解空间里面它的一些规律 ， 就是在什么地方出现的可能性大 ，在什么地方出现的可能性低 ， 它就不需要每个点都去试了 ， 然后使得它就花更少的这种算力 ， 就能更

高的可能性找到那个解 。 我相信数学这个问题也是有结构的 。 所以就像刚才你讲的 ， 就是能不能找到人找不到那个解 ， 我觉得是很有可能的 ， 就是它借助这一套方法论 。

**曼祺** [54:29]
刚才就说的是 o1 的一些可能很有价值的应用 ， 然后同时它现在其实也有一些明显的实际使用时的短板 。

### 短板与优化

**Guest 2** [54:37]
对 ， 就是我们去看他们列举的一个 demo 的时候 ， 就是说给他一个问题 ， 就列举五个名字里第三个字母是 A 的国家 ， 然后结果 GPT-4o 回答这个问题就 3 秒 ， 然后 o1 mini 就是 9 秒 ， 然后 o1 Preview 它是 32 秒 ， 就超过了一个广告的时长了 ， 然后就这么简单一个问题 。

那所以说我们昨天的一个报道里面也提了一个事情 ， 就是说它对响应速度比较高要求的场景 ， 或者是一些相对简单的问题 ，o1 其实是不适应的 。

您觉得这是一个可以突破的限制吗 ？ 或者是就是未来会把这个速度给节省掉吗 ？

**袁进辉** [55:19]
o1 之前刚才我们提到就是它只 inference 一次 ， 任何一个问题过来 ，不管是它是简单的还是难的 ， 它生成结果的时间是固定的 ，因为 inference 那一次的时间是固定的 ， 只跟那个我 output 的 token 序列的长度相关 。

如果这个序列长度相同 ， 它生成这个序列的时间是一模一样的 。 但是 o1 之后， 我说从概率上， 对于简单的问题 ， 它可能更快的输出结果 ， 它可能思考少数几步就出结果了 。

对于比较复杂的问题 ， 它可能需要反复思索 ， 需要更多的调用这个底层的 inference 才能生成一个比较好的结果 。

我相信从概率上来说 ， 简单的问题更快的出结果 ， 难的问题需要思考的时间更长 ，但是也不排除出现像刚才你说的那种 ， 它一个简单的问题反而思考了多步 ， 就是超出了我们直观上想象的这个时间 。

就说明它这个 train-of-thought 也好 ， 还有这个 test-time compute 也好 ， 就是说它仍然有需要完善的地方 。

**曼祺** [56:21]
就是你觉得这个是可以优化的 。

**袁进辉** [56:23]
可以优化的 。

**曼祺** [56:24]
所以它可能不是一个长期会存在的应用时的短板 。

**袁进辉** [56:28]
对 。

**曼祺** [56:28]
以及那种特别需要复杂思考 ， 然后响应速度要求又比较高的场景可能会有什么呀 ？ 我们昨天还在想 ， 就它又需要比较复杂的推理能力 ， 然后同时它也对你的响应速度要求也比较高 。

**袁进辉** [56:39]
就是说我们在应用场景里面对这些模型的需求 ， 第一位的是效果 ， 第一位是这个模型输出的质量怎么样 。

如果这个效果够好 ，其实就像刚才我们提到那些不是那么高频但是价值巨高的那些场景或者问题也是可以用的 。

**曼祺** [56:58]
对 ， 这肯定是它最合适的一种嘛 。

**袁进辉** [57:00]
是 ，是 ， 就是效果是第一位的 ， 然后在满足效果的前提下， 那当然时间越短越好 ，但一般从过去这些技术的范本规律来说 ， 首先是要看效果能不能做到 。在效果能做到的情况下， 那个效率或者那个计算时间的长短是确定性的会被解决的 。

**曼祺** [57:20]
确定性会被解决 。

**袁进辉** [57:21]
对 。

**曼祺** [57:21]
对 ， 比如说如果未来把这种东西用到物理世界 ， 比如说用到具身智能上 ，其实机器人对节拍的要求就很高 。

它在有些场景 ， 就是它对你去操作的这个速率 ， 比如说你在一个生产线上， 或者你处理某个特定任务 ， 它就是对你的节奏有一个很严格的要求的 。

**袁进辉** [57:37]
是 ， 那这个的时候可能绝大部分那个需要 real time 那种反应的场景就用 system one 就解决了 。 所以这个时候我相信这个 o1 这里面肯定也做了这种划分 ， 就是有的问题过来它就根本不会触发那个 reflection 的过程 ， 这就是要做一个这么区分就好了 。

有的问题就是及时响应反馈的 ，有的问题就是可能像我们人遇到一个 ， 比如说我们公司里面或者一个战略问题 ， 那要反复讨论很多天 ， 最终才会出一个结果 ， 甚至也不一定几天之后就能出一个结果 。

像这种问题 ， 那无论时间多长 ， 可能都是可以接受的 ， 只要它最后输出的是靠谱的 。

**曼祺** [58:16]
除了这个时间之外， 就是您现在看到的 o1 在使用上的还有哪些短板 ， 或者说可以优化的空间 ？ 比如说硅基就是直接服务开发者的嘛 ， 那现在 OpenAI 在 o1 的 API 的调用上它就有一些限制 ， 比如说你每分钟只能是 20 次的请求 ，有个速率的限制 ， 然后它也不包括函数调用 、 流式传输 ， 还有系统消息支持这些功能 。

就现在这个会对开发者来说是带来比较大的不方便吗 ？

**袁进辉** [58:42]
会有一些 ， 就像刚才说的很多东西还不支持 ，在于说 o1 它这个能力就是 reflection 这个能力 ， 它是把多个基础的单元 ， 就是多个基础的 inference 组合起来的 ， 然后组合起来实现了一个在某些领域实现了一些很强的这个效果提升 。

但是这种组合方式 ， 就是说现在开放给所有的用户去使用 ，在更广泛的场景里面到底怎么能够更好的发挥 ，以及它中间这个组合体中到底把什么接口开放给开发者 ， 把这个组合体中什么部分允许用户 DIY， 这些部分 ， 这些尝试应该说都还不是那么的成熟 。

所以它需要一个逐步释放的一个过程 。

**曼祺** [59:27]
明白 。其实我们昨天讨论过这个问题嘛 ，因为我最开始看到这个限制的时候 ， 我还在想是不是 OpenAI 它非常希望赶上现在这个发布节奏 ， 所以它有一些看起来好像并不是跟模型性能本身相关的功能 ， 它并没有做得特别完善就上线了 。

我当时可能是这么去推测的 ， 然后您说的这个角度我觉得也很有道理 ， 就是您说其实大家到底怎么去用它也没有那么清楚 。

**袁进辉** [59:49]
是 ， 即使它是不是那么仓促上线的 ， 即使是它非常有准备 、 非常就绪的一个上线 ，也还是有很多东西 ， 即使是 OpenAI 的工程师或者是这些科学家也没有完全充分实验的 。

就像这个 Preview 一样 ， 就是它这个标题就叫 Preview， 然后在和用户和更多人使用的这个过程中逐渐的去做完善 。

### 基建机会

**Guest 2** [1:00:14]
那其实我们硅基流动作为一个 AI Infra 的公司 ， 很重要的一个环节就是帮助大模型靠的是推理 ， 那我们是不是也要开始针对 o1 这一类的模型要做一些准备的工作和产品了呢 ？

**袁进辉** [1:00:27]
当然现在那个我们是依赖于业内的开源模型 ， 那现在的开源模型现在还没有做 o1 这样的事情 。

那我们至少可以做一件事情 ， 就是在叫 test-time compute， 就是 inference 阶段去为此需求做准备 ， 就是说当这个来一个问题之后需要调多次模型 ， 最后才出一个结果的这种情况下， 确确实实在 inference 层面也有挺多优化机会的 。

比如说像解一个复杂的问题 ， 它可能分解成多个步骤 ， 比如说这几个步骤可以并行计算 ， 可以并行开展 ， 比如说分解成子任务 123， 这 123 并没有依赖关系 ， 我可以同时并行的对它做这个 inference。

那这种情况下就比我做了 1 再做 2 再做 3， 这个在用户体验上就要好 ， 对吧 ？

**曼祺** [1:01:17]
它这个就可以缩短我们刚才说的那个时间的 。

**袁进辉** [1:01:20]
就是缩短用户体感 。

**曼祺** [1:01:21]
的时间的那个部分 ， 对吧 ？

**袁进辉** [1:01:23]
对 ， 对 。 还有一些比如说这个 reflection 的过程中， 这个问题分解成一系列步骤 ， 这些步骤之间还有一定的依赖关系 ， 比如说这个前提条件 2 是依赖于 1 的 ， 要先做 1 再做 2， 可能中间还有一些尝试 ， 比如说这个尝试可能要极端情况下尝试几十次 ， 这几十次中也许有的尝试是不需要做的 。

就是我们如果能提前得到这么一个我们计算机里面叫这个 graph， 这些尝试之间的依赖关系的话 ， 可以对这个问题求解这个依赖的关系做一些分析 ， 可能会发现某些调用是冗余的 ，是多余的 ， 那这次调用可能 inference 就根本不需要做 ， 这也能减少这个在用户使用的时候的体感 、 这个时间等等。

**曼祺** [1:02:08]
你这一个优化 ， 就相比于你刚说的并行的那个优化之外， 它也可以实际减少的计算力 。

**袁进辉** [1:02:13]
实际减少计算的量 ， 对吧 ？ 这是举个例子 ， 像这个层面其实可以做很多工作的 。 另外就是还可能要做的一个机会是说 ， 基于这些开源模型 ， 如果说我面向某个领域 ， 想提高某个领域的专业能力的话 ， 它那一部分的训练的就是门槛或者是计算力的门槛 ， 就是说可能比原来 training from scratch train 一个基座模型要小很多 ， 可能会有很多很多的垂类模型会使用就

是 self-play、 强化学习这种策略去提高它某一方面的专业能力 ， 那可能会出现很多很多这样的垂类模型或者领域模型 。

那这些模型在更多的领域去爆发的时候 ，也会比如说在 chain of thought、 在叫 inference scaling law 这些层面 ，也会带来一些更多的需求 。

所以像这种 Infra 怎么促进训练阶段 ， 怎么更好的用这种强化学习 、 用 self-play 这种方式提高专业能力 ， 这块也有一些文章可做 。

还有就是刚才咱提到的这个推理的时候 。

**曼祺** [1:03:15]
的优化的变化 。

**袁进辉** [1:03:16]
优化的部分 ， 对 。

**曼祺** [1:03:17]
你刚才说你们是基于开源模型 ， 所以你们硅基流动这边是要等开源大模型跟进 o1 的这种方法之后， 你们可能会有更多实际的工作是吗 ？

**袁进辉** [1:03:27]
就刚才说的是在 reflection 这个阶段 ，有一部分是系统的工作是不依赖于开源大模型 ， 它是不是做这些事情 ， 就是说都可以开展的 。

还有一部分是和模型训练的时候阶段是相关的 ， 要依赖于前面的训练阶段的工作的 ， 这个时候就需要等社区这么一个节奏 。

**曼祺** [1:03:48]
社区现在有什么讨论吗 ？ 虽然这事可能也过了没多久了 ， 就比如说开源社区对我们去做 o1 这个方向有什么态度 ？

**袁进辉** [1:03:56]
就像刚才咱最开头讨论的 ， 就是说 o1 它确实是开启了一个范式 ， 这个范式一定会被其他大模型公司跟进 ，也就包括这些做开源模型的 ， 就包括 Llama， 包括像 DeepSeek， 我相信都会去使用上这个工作方法论 。

就是说从社区来说 ， 无论是就是这些基座模型的这些厂商 provider 一定会去跟进的 。

**曼祺** [1:04:21]
您刚才说了一下这个新的变化到来之后， 中间层的一些机会 ， 总结一下的话 ， 包括推理层面就是有了 reflection 之后， 我怎么做更多的优化 ， 包括在训练的层面结合强化学习 ， 可能会有更多的垂直模型训练的需求出来 ， 都是有机会的 。

那我也想问一问 ， 就反过来说的话 ，o1 这种新的方法来之后， 它会消灭掉一些什么之前一段时间可能大家觉得还挺火的方向 ， 然后这些方向可能会被证明成是一个中间性和过渡性的机会吗 ？

比如说之前是不是有人专门做 prompt 工程的一些工具 ， 那这个东西在 o1 之后是不是就没有那么有必要了 ？

**袁进辉** [1:04:57]
它可能就是把一些 prompt， 还有那个原来手工做 chain of thought 这些 ， 可能就变得没必要了 。 所以像 o1 它那个文档里面其实是提了一些写 prompt 的建议 ， 就是说有些东西我这个系统或者这个模型本身就做了 ， 你不要在 prompt 里面再提了 。

比如说 chain of thought 本来我就做了 ， 你就不要在 prompt 里面再提这个 chain of thought 了 ， 你不要在 prompt 里面做过于复杂的东西了 。

有些部分相当于它是一种改进 ， 确实就使得原来某些部分工作变得没必要了 。

**曼祺** [1:05:31]
但是之前在 prompt 这一层倒也没有说出现公司的那种地步 ， 对吧 ？ 只是说可能有段时间大家讨论使用 prompt 的工程师还挺火的 。

**袁进辉** [1:05:40]
其实原来使用大模型的时候 ，其实大家经常讲的就是几板斧嘛 。 第一板斧是模型就不动 ， 完全用 prompt 来做 ， 然后后面是做 fine-tuning。

如果 prompt 不够再做 fine-tuning，fine-tuning 不够可能要做 continue training 或者完全做 pre-training。 那现在相当于说 prompt 这一块有一部分是被自动化了 。

我相信还是有相当多的应用场景用 prompt engineering 就够了的 。

**Guest 2** [1:06:06]
对 ， 那我们就是在讨论这个 o1 对中国市场的 ， 就是大模型投资会带来什么变化的时候 ，其实我们昨天看到了一个观点 ， 就是说现在他们来活了 ， 你再不好好干点正事 ， 就是你就不在这个局里了 。

**曼祺** [1:06:22]
因为你刚才也说所有公司肯定都会跟进这个方向嘛 。 那之前比如说贺老师他可能跟行业里的人交流比较多 ，也是了解到说中国有一些公司 ， 可能今年年中开始吧 ， 大家其实是有些暂缓了之前对基础大模型的投入的 。

**Guest 2** [1:06:36]
对 ， 比如说一些大公司 ，他们有云的 ， 然后自己就训练基础模型的 ， 这一类他们的摇摆的情况是很严重的 。他就是觉得我的 GPU 卖出去 ，他就是收入 。

我训练这一个基础大模型 ， 现在我的收益变得越来越少了 ， 它只能是一个成本 ， 我看不到一个更好的回报 ， 然后他就停下来了这个事情 。

就是还有一些创业公司 ， 本身就是基于开源模型做嘛 ， 然后后面也就自己开源模型的性能 ，他们可能做得比它还快了一步 ， 当大家看到这个进展没那么多的时候 ， 那它也停下来了 。

**袁进辉** [1:07:10]
的确就是 ， 比如说海外来说 ，其实大模型的这种整合前一段时间也发生了 ， 对吧 ？ 有好多又回归大厂了 ， 就是基座模型更加收敛了 。

另外就是开源模型确实能力还是很不错的 ， 如果投入重金搞一个模型出来 ，在市场上又没有竞争优势的话 ， 这个投入确实算不过来账什么的 。

打个比方就像大家摘果时， 都想摘那个树上的苹果 ， 大模型就像造一个梯子 ， 对吧 ？ 原来大家的期望是说这个业内也没有多少人造这个梯子 ， 我造出梯子我自己去摘这个果实 ，是吧 ？

突然来了个 Meta，他说他造了一个梯子 ， 你们可以随便用 ，而且这个梯子还挺好的 。他放出来之后， 很多人都可以基于这个梯子去摘水果了 ，而我还在造这个梯子 ，而且造出来还不一定比 Meta 的好 ， 那肯定当我造出来的时候 ， 水果已经被人摘了 ，是吧 ？

所以从理性角度来说 ，有很多公司会发生这个调整 ， 就是要做这个决策 ， 需要把资源投入到 ROI 更高的地方去 。

所以在这个大的这样一个情况变化下， 理性角度来说 ， 就是很多大模型公司要做一些调整 ， 就是要么是真的有特别有理想主义 ， 我一定要实现 AGI， 我要取莫高 ， 要探索极限 ， 或者是没有这个后顾之忧 ， 像一些大厂资源非常充沛 ， 没有后顾之忧 ， 还可以继续做这种技术探索的 ， 一定要追求基座模型的极限 ， 最高水平 。

客观来说 ， 大部分创业公司可能是比较缺少这个条件的 。

**曼祺** [1:08:43]
那 o1 来了会改变这种氛围吗 ？ 是不是大家又会在至少接下来的一个阶段里 ， 可能是会加大对这个东西的投入 ？

**袁进辉** [1:08:51]
我不觉得会改变这个 ，o1 只是为大家提供了一个思路 ， 就是一个方向 ， 想继续追求这个技术极限的 ， 那也有工作方向了 ，但并不会改变就是说 。

**曼祺** [1:09:04]
就是做大模型的人会越来越收敛的这个大的趋势 ， 对吧 ？

**袁进辉** [1:09:07]
因为原来基座模型的时候 ， 大家会说原来以为它只有少数公司能做 ，但是没有想到技术扩散这么快 ，以及它后面那个边际收益越来越小 ， 这个事情发生的话 ， 就使得说在这个 o1 之前就已经有很多模型公司在做调整了 。

就是因为这个技术扩散比较快 ， 然后以及它边际收益继续做 scaling law， 那个边际收益会变小了 ， 这是在这个逻辑下决定的就是说做调整 。

但是 o1 出来之后， 这个情况也不会改变 ，因为即使是 o1， 像强化学习 chain of thought， 它也是技术会扩散 ， 然后它那个边际收益 ， 就是刚才我们说的 ， 刚开始肯定边际收益是比较大的 ，也一定会遇到那个变缓的阶段 ， 任何技术都是这样的 ， 这个逻辑不会改变 。

所以 o1 的发布不会改变这个模型公司的这种决策逻辑 ， 或者做转型 。

**Guest 2** [1:10:03]
而且 Meta 在强化学习上也有基础 ， 当年 AlphaGo、AlphaZero 之后 ，他们很快就开源了一个强化学习的运行模型 。

**袁进辉** [1:10:11]
是 。

**Guest 2** [1:10:12]
所以那些韩国比较厉害的棋手 ，他们就是全部用那个模型来自己学会的 。

**袁进辉** [1:10:18]
是 ， 所以像这种探索技术极限 ， 还有持续投入这个大模型训练 ， 某种程度上我们在讲就是说它是为人类做贡献 。

那能做这件事情的 ， 比如说像科研机构 ， 像就是利润非常好的大公司 ， 它有非常好的现金流 ，是吧 ？

前面说的科研机构或者是政府从战略角度来说 ， 这事情就是为全行业 、 为全人类做贡献的 。 但是从每个公司自身利益出发 ， 它不一定是最合适的 。

**曼祺** [1:10:49]
就是刚才我们讲到中国的公司暂缓了对基础模型的训练 ， 它带来的可能的一个后果是不是说 ， 至少暂时中国有很多 GPU 的算力是会有一些冗余的 ？

**袁进辉** [1:11:00]
就是原来很多公司想训练自己的基础模型 ， 担心算力不够 ， 或者没有那个条件去训练 ， 就提前做了一些算力的投资 、 租赁 、 建设等等。

现在如果重心发生转换的话 ，其实原来拿在手里的这些算力可能就会成为烫手一点 、 快速一点 。

**曼祺** [1:11:21]
就会往外去租 。

**袁进辉** [1:11:22]
怎么去把它 ， 就是把这个成本砍掉 、 收回来等等 ， 就是所以也会想办法再把这些算力成本转嫁出去 ， 就会再去 ， 就是释放到这个算力市场上去流转 。

**Guest 2** [1:11:36]
所以我们看到一些报道就提到 ， 就是中国的 GPU 的租金比美国的还要便宜 。

**曼祺** [1:11:43]
就是在降价 ， 对吧 ？

**袁进辉** [1:11:44]
算力的价格是比前一段时间再低一些 ，在下降的过程中 。

**曼祺** [1:11:50]
前一段时间是指什么时候 ？ 就比如几个月之前 ？

**袁进辉** [1:11:53]
半年之前 。

**曼祺** [1:11:53]
半年之前 。

**袁进辉** [1:11:54]
去年， 就是下降是比较明显的 。

**Guest 2** [1:11:57]
就是国内的 GPU 其实比国外的便宜很多 ， 就是原因会是什么 ？

**袁进辉** [1:12:02]
这个呢 ，有几方面吧 ， 一个是确实训练模型的没那么多了 ， 另外一方面呢 ，有这个国内的电费更便宜 ， 还有一个就是国内的这个算力的供给方比较分散 ， 更加多元 ， 大家所以就是竞争更加激烈一些 。

总体上就是这么讲 ， 就是国内能训练的一些超大型模型的算力集群还是少的 ，但是问题就是现在有决心继续投入这种规模的训练的公司确实也不多了 。

然后推理方面的这个算力需求啊 ， 它还没有到那个预期的那么高 ， 就是它有个过程 。

**曼祺** [1:12:42]
所以就是在 o1 这种范式里面 ，其实长期来说我们可以看到它推理需求的算力是会有个大的提升的 ，因为它不只做一次嘛 。

**袁进辉** [1:12:50]
对 。

**曼祺** [1:12:51]
那只是说就在现在这个阶段 ，有一些公司也在转型 ， 对吧 ？ 就可能会导致至少这一个阶段里是会有一些 GPU 的算力的冗余的 。

**袁进辉** [1:12:59]
对 ， 就是它需要这个技术有一个成熟啊 ， 或者释放的过程 ， 应用有一个起来的过程 。

**曼祺** [1:13:05]
对 ， 当然这些都不构成投资建议啊 ， 反正大家可以听一听 ， 就是可以听一听在这个一线的从业者就看到的算力的一些使用情况 。

**Guest 2** [1:13:14]
其实从您这个硅基流动的位置 ，在这个行业里面也是挺特殊的呀 。 我们硅基流动也是每天就是服务 AI 开发者 。

### 开发者生态

**Guest 2** [1:13:22]
从您做这个公司的创始人出发 ， 您看到的一个大家的热情的变化会是怎么样的呢 ？

**曼祺** [1:13:29]
因为我们上一次聊是今年 1 月份左右 ， 那个时候其实 AI 还是一个很热的时候 ， 然后后来到 2 月 ，OpenAI 又发了 Sora， 又把大家的情绪往上推 ， 对吧 ？

但之后的几个月里面 ，其实就是刚才贺老师说的 ， 你会看到很多东西都是跳票和期货的状态 。

因为你们是每天接触开发者嘛 ， 所以你们看到的这个实际的情况是什么 ？ 就你也会感到说这个热情热潮在冷却吗 ？

还是你会有一些不一样的观察 ？

**袁进辉** [1:13:56]
就是从这个技术端 ， 比如说像 Sora 主要是多模态的进展 ， 另一个就是说像这个 GPT o1 呢 ， 就是对 reasoning 能力的提升 ， 这些都是非常大的一些技术进展 。

这是从技术供给端这一块 ， 技术供给端这个技术进步仍在继续 ， 然后呢 ， 我们也看到了这些整合 ， 对吧 ？

或者是有些模型公司在做这个调整 ， 这一端呢确实受到了一些影响 ，但是在技术的使用方 ， 比如说在做应用的探索这一块 ， 我没有感觉到变冷 。

大家对这个技术的价值判断是没有变化的 ， 就是它是一个大事情 ，而且是迟早是无处不在的 ， 迟早在很多场景会非常有价值 、 非常有用的 。

这些判断我没有看到有什么怀疑 ，而且随着这些开源模型啊 ， 这些的出现 ， 使得说这个所谓的平权啊 ， 就是这些有条件去做这些模型使用 ， 或者基于这些模型做应用的人会越来越多 。

**曼祺** [1:14:58]
因为你们的开发者客户有海外的 ，也有国内的 ， 然后可能有一些比较大或者中型的公司 ， 可能也会有些个人。

就你自己看到的情况 ， 就是您说这个热情它没有冷却 ， 它在这个不同的地区和不同类型的开发者里会有区别吗 ？

**袁进辉** [1:15:13]
对 ，有一些变化 ， 就是说之前感觉到说 ， 首先是非常热情投入这方向做应用探索的 ，是怕掉队的或者怕淘汰的一些大公司 ，有 FOMO 心态的这些公司 ， 都毅然决然的投入在这里面了 。

然后最近能看到非常强的趋势是 ， 这些开发者 、 产品经理 、 叫中小企业 ， 这种涌现出来的越来越多 ， 就是各个领域这种毛细血管啊 ， 或者是什么 ， 几乎在任何一个场景下， 任何一个工作环节里面 ， 或者娱乐环节里面 ， 都在看到一些案例在涌现 。

**曼祺** [1:15:48]
这个方面举一些例子吗 ？

**袁进辉** [1:15:50]
就以人的这个成长的过程为例 ， 从小到大这个环节 ， 我们就会看到有挺多做小孩教育的 、 小孩玩具的 ， 这种还挺多的 。

做小孩学习的 、 学习语言的在使用 ， 给小孩讲故事 、 做绘本的 ， 都挺多例子的 。 再大一些像这个工作环节里面 ， 刚才我们提到的这些 ，不管是写作也好 、coding 也好 、 娱乐是吧 ， 再大一些 ， 比如说面向特定领域的这些 ， 特别是这个就不用提了 ， 就是陪伴这领域的 ， 对吧 ？

就很多了 。 甚至比如说像前一段时间 ， 我们还有一些社区的开发者在做什么呢 ？ 做那个老人的关怀的 ，其中有一个例子是那个 AI 帮人写遗嘱的 ， 这种东西也都出来了 。

就是从这个人从小到大啊 ， 就是在所有的无论生活还是工作环节里面都有出现 。

**曼祺** [1:16:37]
而且现在就很多像您说的是中小企业 ， 或者甚至是个人开发者 ， 对吧 ？

**袁进辉** [1:16:42]
是 ， 特别是在现在这个 ， 大家知道这个融资环境非常不好 ，有很多这种个人开发者或者创业者呢 ，他实际上在没有融到资的情况下， 用自己的资金还在坚持做这样的事情 ， 这种还挺多的 。

**曼祺** [1:16:58]
而且您说的里面也有很多 ， 比如说做玩具或者做教育的 ，他可能以前他不算是 IT 或者信息技术这个行业里的公司或者人。

**袁进辉** [1:17:08]
对 ，有的是从传统玩具过来的 ，也有一些是从这个技术方 ， 或者在 IT 公司 、 互联网公司做产品经理的去出发的 。

**曼祺** [1:17:17]
所以它会有一个扩散的这个状态 ， 就是它从可能之前肯定还是有点开发背景的人最熟悉这个嘛 ， 然后它可能慢慢也有一些别的行业里的 ，因为有了开源 ， 包括有你们这种一些做工具的公司 ， 它可能比较方便的能用一些模型的能力 ， 然后接到它以前的产品或者它的领域里去 。

**袁进辉** [1:17:34]
是 ， 就是相当于是最开始大家以为 ， 就是说你只有像大模型公司一样有完善的这个 AI 能力 ， 才有机会做这种产品探索 ， 那能做这种产品探索的就局限在少数几个公司里面 。

但是现在呢 ， 相当于说我想用那个模型 ， 或者是比较高水平的模型啊 ，也都能拿到 ，而且还有非常容易使用的方式 ， 比如说用 API 的方式来调用什么的 。

所以你要做这样一个应用探索 ，也不一定需要像一些公司一样搭一个完善的 AI 团队了 ， 只要它有某个领域的特长 ， 或者是产品的洞察 、 需求的洞察 ，有这个基本的开发能力 ， 比如说前端或者后端开发能力 ， 它不需要做底下这一大块东西了 ， 比如说模型的训练啊 、 调优啊 ， 还有模型的 serving 这种 infra 啊 ， 都不需要做了 ， 它就有条件 、 有机会先做这

个产品的探索 ， 或者一直走到这个所谓的 PMF 这种状态 ， 就使得能参与这个 AI 应用的探索的人群就大大的扩大了 。

**曼祺** [1:18:34]
您一方面说您自己并没有感觉到开发者社区热情的冷却 ， 然后也看到有更多的人开发应用 ，但另一方面 ， 比如说我们和这个投资市场去接触 ， 包括我们去观察一些新的公司 ， 好像又会觉得之前大家所期待的那种 AI 应用爆发的场面并没有出现 。

**袁进辉** [1:18:52]
这都是真实的一种体感 。 对 ， 我观察到的就是说这种草根的 SMB 的 ，在从非常小事情开始做起 ， 然后也看到一些 promising 的结果 ， 就是他们有的也开始收钱了 ， 比如说每个月收几万块钱或者这种 ，但是它并没有到投资机构投资它的那个门槛 ， 特别是现在投资机构的资金也比较匮乏 ， 所以这两个都是现实 。

但是当这些有足够量大的这样的小的种子发芽啊 ， 或者探索成长的 ， 总有一些就进入到这个 ， 就是我们传统的这些 VC 的它的范围 ， 就是它开枪的那个 ， 或者是它要去捕捉的那个投资机会那个范围内 。

所以像投资机构这边 ，他们在观察 、 在等待也是一个事实 ， 然后同时有很多很多的主动的探索这方面这些商机 ， 或者是产品机会的这些团队 ， 或者个人开发者也非常多 ， 这都是个现实 。

**曼祺** [1:19:52]
我不知道您方不方便讲啊 ， 就是从 1 月到现在的话 ， 你们自己的用户的客户的数量 ， 包括你们的使用量 ， 它会是一个什么样的增长情况 ？

**袁进辉** [1:20:01]
其实我们最初是用那个引擎 ， 就是推理引擎 ， 原来就是一种软件的消失 ， 就只能卖给那些有一定量的 ， 或者说跑通 PMF 的那样的一些企业客户 。

到两三个月之前 ， 我们不是推出了一个云服务 ， 就是把这个引擎加上算力 ， 加上知名的这些开源模型 ， 构成一个比如说用 OpenAI 的平替 ， 就是这种 API 形式 ， 就是叫 MaaS（Model as a Service）。

这个出来之后， 它就让更多的人有更容易去使用 。 那这几个月其实在这个比如说注册用户啊 、 调用用户啊 ，以及每天生成这种 token 量来说 ， 增长都是非常快的 ， 特别是能发掘出来有大量的 ， 就刚才提到的这些个人的开发者也好 ，SMB 也好 ， 都来去使用 。

所以在这一块其实如果是每天能和这些开发者去打交道 ， 你会感觉不到说这个行业在停滞 ， 或者在变冷 ， 或者什么的 ， 就会感觉到这一块还是非常蓬勃的 。

**曼祺** [1:20:57]
对 。

**袁进辉** [1:20:58]
但是它每个东西都还是非常小 ， 还没有到那种足以让我们传统的 VC 那个投资标准可能还没到 ，但是也有少部分会到 ， 比如说像有一个产品叫捏他 ， 就是胡先生捏他 。

对 ，他们的留存啊 ，他们的用户的反馈都是非常好的 ， 那他也是我们的客户 。

**曼祺** [1:21:18]
这是做什么的 ？

**袁进辉** [1:21:19]
他是在做面向二次元的这种陪伴 ， 或者是形象塑造 ， 比如说他可以在上面给用户提供了一些你按照自己想象的去塑造一个人物的形象 ， 这个人物的个性 ， 这个人物和我交互 ， 就像做朋友 ， 这些人物之间还可以有 social。

**曼祺** [1:21:38]
它都是用开源模型做的是吗 ？

**袁进辉** [1:21:40]
是开源模型 。

**曼祺** [1:21:41]
他们主要自己做应用 。

**袁进辉** [1:21:42]
对 。

**曼祺** [1:21:42]
就是您刚才说到的你们上线云服务这个变化 ， 确实我也有感受到 ，因为我前段时间在刷朋友圈的时候 ， 就我看到我一个朋友 Koji，他自己也做一个博客叫十字路口 ，他就说他在 Cursor 上是只用 10 分钟就写了一个 emoji 的 AI 翻译器 ，他应该也是用你们的这个云服务去做的 ， 然后这 10 分钟还包括他去到你们那注册了一个用户 。

**袁进辉** [1:22:05]
是 ， 刚才我提到的那个 AI 遗嘱也是和 Koji 合作的 。

**曼祺** [1:22:09]
哦 ，OK，OK。

**袁进辉** [1:22:10]
也是他策划的 。

**曼祺** [1:22:11]
哦 ， 所以他的想法还蛮多 。

**袁进辉** [1:22:13]
对 ， 对 ， 就是那个像编程这一块也是 ， 比如说最近那个 Cursor 很火 ，但是大家知道这个编程能力最强的是 Anthropic 的 Claude 3.5，不过还有很多开发者也在找那个平替 ， 那基本上就是说能够接近或者是离这个 Claude 3.5 水平编程能力比较接近的 ， 就是那个 DeepSeek 的 model 了 。

那 DeepSeek 我们在那个云上也提供了这个服务 ，而且那个生成速度确实应该是业内最快的 ， 就有很多开发者就把 Cursor 那个背后的 API 调用就改成我们那上面的 DeepSeek 接口 ， 它就也能完成很多很多的任务 。

**曼祺** [1:22:51]
DeepSeek 就是幻方做的那个模型 。

**袁进辉** [1:22:54]
就幻方做的那个模型 。

**曼祺** [1:22:54]
他们也是挺神奇的啊 ， 一个做量化交易的公司 ， 现在开辟出了一个新的业务 。

**袁进辉** [1:22:58]
是 ，他那个模型在 coding 这领域还是生意非常好的 。

**曼祺** [1:23:03]
其实前不久我们在讨论这个应用的时候 ， 您当时也说您觉得之前一段时间其实就是 coding 是用的比较多的 ， 然后您感觉现在行业开始关注应用了 。

这个苗头就是您刚才说的那些变化吗 ？ 还有什么新的苗头啊 ？

**袁进辉** [1:23:15]
还是回到那个 ， 就是说刚才我们说的那个模型能力啊 ，有三个境界 ， 三个水平 ， 一个是语言能力 ， 一个是常识的能力 ， 再一个是 reasoning 能力 。reasoning 能力主要是服务于这些专业生产力啊 ， 或者 agent 这些环节 ，但是前面两个能力 ， 像语言和常识 、 世界知识这个能力 ，在主要的大模型里面都已经很不错了 。

如果我有一个产品只需要前面这两个层次的能力 ， 那是完全够的 。 最简单的我们说做翻译 ，其实现在这些大模型做这些翻译都能做得非常好 ， 帮助我们做一些写作 、 创作 、 对话 ， 包括多模态的一些 ， 像现在也出现 Flux 这种文生图能和 Midjourney 一样做得好 ， 只要这个现在常见的模型已经能满足的能力 ， 基于它就会有很多很多的应用出来 。

像翻译里面 、 写作里面 ， 像陪伴 ， 陪伴也基本上对模型能力 、 对 reasoning 能力要求并不是那么高 ， 像 coding 这些 ， 只要说这个能力到了 ， 然后场景又足够大 ，其实都能看到一些比较有意思的应用 。

**Guest** [1:24:20]
那接下来我们的整体规划会有再一步的调整吗 ？ 比如说前不久你说就是硅基流动一定要做全球化的 ， 然后说你们要是能帮他们解决一个问题 ，他们出多少钱都愿意 。

**曼祺** [1:24:33]
海外用户不是给你们发邮件的数 。

**Guest** [1:24:35]
是 ，是 ，是 。

**曼祺** [1:24:35]
就好像他们的付费意愿会更好吗 ？

**袁进辉** [1:24:37]
是 ， 这个事其实有两个 ， 就是说现在对基于 AI 去做应用呢 ，在不同的领域 、 不同的行业 ， 节奏是不一样的 ，在不同的地域节奏也是不一样的 。

比如说就以国内为例的话 ， 就是这些科技领域的公司 ， 或者创业公司 ， 就是 AI 方面的创业公司 、 娱乐方面的公司 ，他们对这个 AI 能力的使用啊 ，是更靠前的 ，而更大的 、 更传统的一行业可能会更靠后一点 。

所以呢 ， 作为一个说 ， 比如说以 ToB 的公司 ， 或者说要提供这种 AI infra， 要降低这个模型的使用门槛 、 使用成本这样的一个定位的公司来说 ， 它其实是跟着这个需求走的 ， 跟着应用探索的节奏来走的 。

不同行业它的进展节奏不一样 ， 不同地域也一样 。 就是客观来说 ， 现在海外探索的也比国内的要更靠前一些 ， 甚至说很多国内的公司也在做出海 ， 所以偏市场化需求的这样的客户群体在海外是比国内要多的 。

**曼祺** [1:25:39]
你们自己的客户分布也是海外比国内多是吗 ？

**袁进辉** [1:25:42]
就目前来说是这样的 。 所以像对这个 AI 技术落地 、 应用探索更靠前的 ， 客观来说就是海外比国内要多一些 ， 再加上就是海外的付费意愿要比国内多一些 。

所以呢 ， 就是比如说做市场的策略也是个动态的 ， 比如说现阶段我就要主抓那些市场化的需求 ，因为它是对产品有真正有需求 ，而且要求很高的 ， 它能帮我们打磨 ， 帮我们树立品牌口碑 ， 所以像这种是首先要抓的 。

而这部分呢 ， 又是以海外和出海的这种企业居多 ， 随着这个技术的渗透呢 ， 就会有更多的 ， 比如说国内也逐渐跟上， 更多的包括传统行业 ， 包括我们的政企这种需求也越来越大 、 越来越真实的时候 ， 那做市场的策略也会做一些调整 ， 主要是看矿在哪里 。

**Guest** [1:26:33]
其实我看我们硅基流动的服务里面 ， 基本上国内外很多 ， 主要看大模型我们都有 。 那许志林您方便分享一下， 就是我们调用量最多的开源模型是哪个吗 ？

**曼祺** [1:26:45]
这挺好奇的啊 。

**袁进辉** [1:26:47]
最多的是几个 ， 通义千问 、DeepSeek。 通义千问主要是它那个从小到大 ， 从 7B 到 70B 的都有 。DeepSeek 主要是那个 coding 能力很强 ， 还有一些是从海外来调国内的 DeepSeek 的 。

还有一个是 GLM 4，GLM 4 呢 ， 能力也挺好的 ， 客观来说我们没有 GLM 更高级的模型 ，因为那个是没有开源的 ， 主要是这几个模型调用量是最大的 。Llama 呢 ， 现在是这样 ， 就是国内的 ，因为反正它那个没有微调的 ，在国内的调用量并不大 ，但是在海外， 我们也服务一些出海的企业 ， 海外的话是 Llama 是有量的 。

**曼祺** [1:27:27]
挺有意思的 ， 这个是非常一线的数据啊 。 因为您之前也做过这个中间层的软件的创业 ， 总体来说的话 ， 您觉得现在在这一波热潮里创业 ， 相比于之前 ， 您觉得会是一个更好的状态吗 ？

**袁进辉** [1:27:39]
应该说现在的做这种 ， 比如说面向模型使用环节的 infra 产品 ， 会比以前做面向训练场景的 infra 产品 ， 走向市场是更加容易的 ， 然后能更容易的得到用户的这个采纳呀 ， 或者反馈啊等等这些方面 。

**曼祺** [1:27:56]
就说现在硅流相比当初一流的时候 ， 对吧 ？

**袁进辉** [1:28:00]
是 ，是 。 一个比较深的体会就是说 ， 还是要分析这个市场的大小 ， 包括客户集中度 ， 就是训练集中度还是客户还太少了 ， 太集中了 。

推理呢 ， 就是一个市场更大 ， 然后呢 ，也比较分散 ，而且还有就是时机 ， 时机就是总体上应该说从现在开始 ， 这种对使用模型的需求还是非常旺盛的 ， 很多大到小小的公司都在做这个模型的应用 ，是吧 ？

那这个时候所谓的叫 ， 就是需求在这边的时候 ， 就会谁都来帮你的忙 。 就是说当那个需求不存在的时候 ， 就得我们特别费劲的去推 ， 对吧 ？

但是人家需求在那的时候 ， 你会发现整个行业都会形成一种助力啊 。

**曼祺** [1:28:42]
所以现在有一种顺势而为的感觉是吗 ？

**袁进辉** [1:28:45]
有一种 ，有一种就是你会发现每天涌过来的这种需求 ， 当然我们不一定每个需求都接 ，但是这种需求特别多 ， 就不是像以前那种 ， 就是我要去主动去找 ，而且要做非常多工作去说服什么的 ， 你会发现我们就是被推着走那种感觉 。

**Guest** [1:29:02]
其实我们这两天也在跟一些投资人去聊 ， 就刚才您说现在有很多的开发者的需求啊 ， 或者他们开发一个产品的需求出现 ，但是他们看到的事情就是市面上好像用户超过 10 万的大模型应用就没那么多 。其实我们这边也对接了很多开发者 ， 那我们对接的这些开发者 ，他们的应用的一个用户的分布大概是怎么样的 ？

就是他用户体量的分布 ， 就调用量 。

**袁进辉** [1:29:27]
我们并不能看到用户 ，但是我们能观察到那个调用量 、token 量 ， 总体上你比如说像这种能每天超过几亿 token 或者十亿 token 的 ， 还是有一些的 。

这些呢 ， 就意味着它每周的活跃度是几十万 ， 应该是有的 。 类似的这种应用企业还是有一批的 ， 所以我相信就是说还有很多它还没到这个量级 ，但是你像最近这个汉语新解 ， 就是我们刚做那个 ， 就是李吉刚做那个 prompt 的 ， 就是每个词它能给你用比较幽默辛辣的语言 ， 像这种也属于一个有意思的应用 ，是吧 ？

所以像这种它每天的调用量也会比较显著 。 就是总体上我承认一些统计数字说 ， 我们所谓的国内前三的应用 ， 日活加起来不到 1000 万 ，但同时呢 ， 就是说我觉得是这些应用的起来也是有一个节奏的 ，也有个过程 ， 就是现在的确还没满足大家的预期 。

我最近看了一个钉钉的总裁有个访谈 。

**曼祺** [1:30:27]
叶军 。

**袁进辉** [1:30:27]
叶军有个访谈 ，他其实说了一个蛮有意思的一个现象 ，因为钉钉是作为一个 all in one 的那种企业级软件 ， 里面它也开放了很多很多的模型的接口啊 ， 应用的接口 ， 它在钉钉呢也是一个生态 ，有很多人在钉钉里面做那个 AI 相关的能力的供给啊 ， 使用啊 ， 模块啊等等。

它有一个思路或者观察是说 ， 就是他们发现啊 ， 你如果一开头就想做一个什么大应用 ，而且是基于 AI 的 ， 然后有特别多人来使用 ， 或者特别多的这个资金收入啊 ， 这个方式可能这种预期不一定是对路的 。他们觉得说他们观察发现了 ， 即使在钉钉的生态下， 存在那种大量的那种看上去不大 ， 然后它也不是一个完整的软件 、 完整的功能 ，但是它只

提供了某一项的 AI 的能力 ，但是这种 AI 能力可以被一个他们所谓的钉钉里面的工作流使用 ， 然后呢 ， 这些使用者呢也是个人， 也是消费者 ， 甚至去下单采买的也不是企业 ，是这些消费者 。他临时我发现我出了一个文档 ， 需要某个能力 ， 比如说简单来说一个 OCR 能力 ，也许里面一个 API 调用 ， 这个付费决策 ， 这个个人就很快就做了 。

像这种看上去不大 ，但是非常普遍的 ，有很多很多这种能力项的累加起来 ， 可能是比较显著的 。 比如说他们说他们做了就几个面向消费者的这样的一个 AI 能力 ， 一个月就能收到 500 万以上 ， 就是纯粹像这种 。

所以有两种猜测 ， 一种猜测是 ， 就是说我们现在这种阶段性的 AI 可能就处在现在这样一种状态 ， 它阶段性的就是这种象战一样 ， 就是它的无处不在 ，但是每一处呢又没有我们期待的那种那么大 significant 的 。

**曼祺** [1:32:19]
就是你看不到一个很高耸的山头 。

**袁进辉** [1:32:22]
是 。

**曼祺** [1:32:22]
但是它其实是有很多山丘的 。

**袁进辉** [1:32:24]
对 ， 对 。 但是这些累积起来是非常庞大的 。 还有一种可能性就是说 ， 当这个每一个地方它有个发育或者成长的过程 ， 到一定程度之后， 中间的这种小应用或者这种能力足够多之后， 有些就会逐渐成长成我们所期待的那些更大的所谓的 killer app 或者 super app， 它需要个过程 。

**曼祺** [1:32:46]
现在看起来苹果或者说手机的智能助手吧 ，有可能会是这样一个入口或者载体 。 比如说苹果的 Siri 结合了这个 OpenAI 的能力之后， 它其实上面它可以把很多 APP 的能力给嵌入到助手里 ，而且它可以让用户就你不用在 APP 里再这样跳来跳去了 。

**袁进辉** [1:33:03]
对 ， 像苹果这种公司啊 ， 像腾讯 、 微信啊 ， 今天巨大的这种入口级的产品 ， 看上去是就希望发展成这种 ， 就是但是它不是一个全新的 。

**曼祺** [1:33:15]
生态 。

**袁进辉** [1:33:16]
一个 player 出现 ， 它还是原来的这个场景的这个霸主 ， 它用 AI 继续夯实了它的位置 。 但是也可能会出现因为用 AI 而出现新的这个 player，也有可能 ， 只不过今天大家都在期待还没看到 。

**曼祺** [1:33:30]
OpenAI 不算一个新的 player 吗 ？

**袁进辉** [1:33:32]
对 ，OpenAI 如果按它那个日活啊什么的 ， 它和这个今天的这些像 Facebook 啊 ， 像 TikTok 啊 ， 像微信啊相比 ， 还不是一个量级 。

然后它和苹果相比 ， 它还处在一个就是还是被苹果的产品去集成和整合的一个角色吧 。

**曼祺** [1:33:52]
但它至少看起来是有潜力成为一个新的大的玩家的 。

**袁进辉** [1:33:56]
是 ，是有潜力 。 不过大家也有另一种猜测 ， 就是说有可能最终还是像微软啊 、 苹果啊 、 微信啊 、 抖音啊 ， 它去因为他们雪条比较长 ，他们的模型能力也有可能会逐渐追上像这种最好的模型 。

**曼祺** [1:34:12]
这是另一个话题了 ， 就是从这几次技术热潮里到底能诞生多少新公司 。

**袁进辉** [1:34:17]
对 。

**曼祺** [1:34:17]
之前我们跟昆仑万维的 CEO 方瀚聊 ，他说他总结了一个规律叫巨头递减 。

### 浪潮与展望

**袁进辉** [1:34:22]
巨头递减 。

**曼祺** [1:34:23]
就是说在互联网的时候出来一批新的公司 ， 成长为很多巨头 ， 对吧 ？ 然后移动互联网的时候 ，他说其实你观察一下美国其实是没有什么新的巨头出现的 ， 它出现了一些中等体量的公司 ， 很多后来也被比如说谷歌 、Meta 这些上一代的公司收到体内了 。

那当然中国是出现了一批移动互联网的巨头 。 反正他的意思就是说其实在新的浪潮里 ， 你要出现一个新的崛起的公司越来越难 ，但是这只是一种历史的推演了 ， 就是你是根据过往的经验这样去归纳的 ， 你不是演绎出来的一个东西 。

**袁进辉** [1:34:54]
是 ， 就是这个呢也可以回溯一下， 就是说它那个技术的本质 ， 就像这个 PC 移动互联网其实主要是做那个信息化还有线上化的这么一个过程 。

那之前的这些巨头呢都是在这个线上化或者网络化这个过程中呢抢住了一些场景 ，但是现在呢可能这种新的场景的机会不多了 。

上一波是占住了场景就占住了那个位置 ， 那现在可能很难再想象出来有个什么场景原来的人没做过 。

更多是 AI 这一回呢 ， 它好像不是说创造了新的场景 ， 它还是在原来的场景下去做这种效率的提升或者工具属性的提升 。

所以它可能说我们再期待那种像移动互联网那样的在发掘出来新的场景的话 ， 这个目前希望不是特别大 ， 更多是原有场景下的再造 。

**Guest** [1:35:50]
就是流程的重新塑造嘛 。

**袁进辉** [1:35:52]
对 ， 对 ， 对 。

**曼祺** [1:35:52]
我觉得是因为我们身处其中， 所以你看到的是一个渐变的过程 。 你就比如说铁路当年替代马车 ，其实你也可以说它是同一个场景 ， 它还是一个出行和运输的场景 。

**袁进辉** [1:36:02]
是 ， 同意 。

**曼祺** [1:36:03]
但是一旦当你的围绕铁路的这些技术构建出来之后， 它其实又会在这个基础上生长出一些新的场景 ， 比如说当时美国的希尔斯百货 ， 它就有这种邮寄卖什么手表这种 ， 那可能在以前就没有这样一种零售场景 。

就它又会衍生出一些它这个体系里的场景 ， 只是这个过程对于在这个进程中的人来说 ， 你是逐渐逐渐看到的 ， 就是你很难在一个很远的历史的角度去观察到这个东西 。

**袁进辉** [1:36:31]
是 ，是 ，是 。

**曼祺** [1:36:32]
对 ， 我觉得现在是有可能出现很大的变化 ， 这个可能取决于说最后这个技术 ， 我是指 AI 的技术啊 ， 相比于之前的互联网技术 ， 它可能能有多大的这种颠覆性的差别吧 。

当然它也是逐渐发生的 ， 所以现在看也不是很明朗 。

**Guest** [1:36:47]
或者有一个技术迁移的收益值吧 ， 我就想到了 Capacity 原来提到一个点 ， 到底我们需要的是一个什么样的东西 ， 比如软件 1.0 时代 ， 它可以帮我们很好的解决了很多问题 ，但它的一个能力的上限没那么高 。

然后软件 2.0 的时候 ， 我的上限会更高了 ，但是我的投入也变得更大 ， 那我从软件 1.0 到迁移到 2.0 的时候 ， 那我带来的收益是不是比我的投入更大 ， 那它就会考虑我要不要迁移这个东西 ， 更多的感觉会有这样的一个情况 。

**曼祺** [1:37:19]
我觉得总的来说 ， 现在还是在一个非常波澜壮阔 、 令人有很多畅想的时代 。 今天袁老师也提供了一个特别好的视角 ， 就是他说从他们做这个业务去观察开发者 ，其实大家开发应用的热情是没有消减的 。

**袁进辉** [1:37:33]
对 ， 就是对这种机会的信心我觉得是足够的 。

**曼祺** [1:37:37]
只是说这些主体的类型可能有变化 ， 比如说它变得更小更分散 ， 至少在目前阶段是这样的 ， 所以可能被以往的商业创业领域去关注到还没有那么明显 ，但实际上它是草色遥看尽却无的那种感觉 ，其实是有很多的 。

**袁进辉** [1:37:53]
就是原来大家的注意力其实更多的放在最大的公司身上了 ， 就是包括这些最著名的大模型公司身上了等等。

**曼祺** [1:38:02]
昨天我们发了这个文章之后， 我不是发了朋友圈吗 ？ 我就有一个很有意思的讨论 ，因为我们最开始不是也说谷歌它提出了很多想法 ， 包括这个思维链 ， 还有强化学习 ， 然后最后在 OpenAI 就被组合得很好 ， 它拿出一个更好的效果 。

对 ， 然后我就在想 OpenAI 是不是有点像现在这个时代的瓦特 ， 就是它是一个蒸汽机的改良者 ， 它大大提升了它的效率 ， 最后历史记住的是瓦特 ， 然后大家可能记不住瓦特之前发明蒸汽机的人是谁 。

就是有人留言说 ，他说如果再类比下的话 ，他觉得可能现在 OpenAI 更像是刘可门 ， 就是瓦特之前的一个蒸汽机的发明的人 ，而 DeepMind 更像更早的塞维利蒸汽机 。

就是说其实真正到瓦特那么通用的效率那么高的蒸汽机 ， 如果类比到 AI 里面还没有到来 ， 所以未来还有可以期待的很大的一个空间 。

**袁进辉** [1:38:52]
是 ， 我对那个蒸汽机的那段历史不是特别熟悉 ，但确实就是说从这个原创的 idea 来说 ，在这个 OpenAI ChatGPT 之前有好多技术在别的地方是探索过的 ， 或者是也接近 ChatGPT 那种效果 。

不过呢 ， 就是 OpenAI 是做的最极致的 ， 就是它把这些算法对这个方向的这种信念 、 信心 ， 然后这个工程规模 ， 然后以一个非常爆炸的一个效果让世人吧 ， 就是认识到了这个东西的重要性 、 潜力等等。

就是说也一定程度上把这个门打开了 ， 或者是临门一脚 ， 或者是这种 。 对 ， 所以它就是确实吸引到了最多的这个关注度 、 注意力 。

**曼祺** [1:39:35]
我觉得今天也很感谢袁老师的时间 ， 然后您分享你们自己观察到的这种应用的情况 ， 给我们注入了一些信心 ，也期待之后我们可以定期来聊一聊 AI 领域的进展和你们看到的 ， 尤其是应用开发层面的一些变化 。

**袁进辉** [1:39:48]
是 ，是 。

**曼祺** [1:39:49]
那今天的节目就到这 ， 各位再见 ， 拜拜 。

**袁进辉** [1:39:51]
好 ， 谢谢 。

**Guest** [1:39:53]
谢谢 ， 谢谢 。

**曼祺** [1:39:54]
本期节目就到这里 ， 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 ， 欢迎在评论区分享想法 ， 这也会成为我们节目的一部分 ， 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 ， 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 》《LateTalk》，也欢迎关注我们的公众号 《 晚点 LatePost》。 下期再见

。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
