# 139: ICCV最佳论文、光年之外、Sand.ai：曹越十年AI之旅，从研究者到CEO

晚点聊 LateTalk · 2025-10-31

<https://latetalk.podhood.com/ae1cd047-38d4-4a77-ac1c-3922648294b8>

本期对谈 Sand.ai 创始人兼 CEO 曹越——ICCV 最佳论文（Swin Transformer）得主、光年之外联创——讲他从研究者到 CEO 的十年。曹越在 ChatGPT 之前就从 OpenAI 的 CLIP/DALL·E 中读出“设计 scalable 系统最大化压榨算力”的方法论，为此离开微软亚研院加入当时国内最早做大模型的智源研究院；他说在微软亚研院学到的是关注最重要且有提升空间的 topic，并用足够资源做到极致。2023 年初他与王慧文一拍即合共创光年之外，也见过梁文锋；他记得王慧文对“中国为何没出现 OpenAI”的回答是“不够富”。他选择视频生成创业，因为技术天花板和商业天花板都高、又处在极早期。创办 Sand.ai 后，他复盘首个模型 Magi-1 因低估自回归路线难度花了一年多，之后转向“垂直整合”：让不同背景的人对齐上下文、让产品与模型互相放大。新模型 Gaga-1 以音画同出聚焦人物说话与表演，成本大幅下降，瞄准 AI 短剧、广告和 C 端“逗视频”。对 Sora 2，他最惊艳的是模型端到端直接生成有基础叙事的 10 秒短片，而非用 agent 拼接，并认为 OpenAI 是“端到端组织”，自己也正把 Sand.ai 调整成同样的组织。他还用“是否有新内容形态和新传播渠道”两个指标判断 Sora 能否成为 C 端平台。

## Questions this episode answers

### 王慧文为什么认为中国没有出现OpenAI这样的组织？

曹越回忆，他问王慧文这个问题时，王慧文很快回答是“不够富”。曹越的理解是中国长期处于追赶阶段，更需要效率创新和模式创新；随着越来越接近前沿，创投、社会心态与创业者能力都要转向支持原创创新。

[28:06](https://latetalk.podhood.com/ae1cd047-38d4-4a77-ac1c-3922648294b8?t=1686000)

### Sora 2最让曹越惊艳的能力是什么？

曹越说Sora 2有音画同出、保持人物ID、大约10秒内有基础叙事（能切镜头）三个特点，最惊艳的是第三点。此前行业普遍认为叙事要靠agent方案，而OpenAI端到端地用模型直出叙事短片，体现了产品与模型垂直整合的组织能力。

[53:10](https://latetalk.podhood.com/ae1cd047-38d4-4a77-ac1c-3922648294b8?t=3190000)

### Sand.ai为什么把新模型Gaga-1聚焦在人物表演上？

曹越表示，这个能音画同出的新模型重点解决人物说话和表演。他发现多数AI生成内容中人物很假、没有表演，这是短剧等叙事创作者反馈的最大卡点；从需求出发先做好人物，同时生成成本比较低。

[1:08:22](https://latetalk.podhood.com/ae1cd047-38d4-4a77-ac1c-3922648294b8?t=4102000)

## Key moments

- **[0:00] 开场**
- **[2:10] 早年研究**
  - [2:33] 2014 年大四时，曹越决定转做深度学习；当时国内深度学习不火，甚至有教授公开写“我不做超过两层的神经网络”。
  - [4:05] 曹越在微软亚研院学到：要选最受关注、且明确仍有巨大提升空间的 topic，不要做已收敛的方向。
- **[5:09] Swin Transformer**
  - [5:22] Swin Transformer 的出发点，是设计一个基于 Transformer 宏观结构、适配大多数视觉任务的网络，替代 ResNet 那套卷积体系。
  - [6:48] 曹越解释 Transformer 在视觉方向普及的第一阶段：大家只是把 attention block 塞进卷积网络，还没有用 Transformer 整体结构替代卷积。
  - [9:52] 看到 Google ViT 后，曹越意识到网络结构是被最多人关注的基础 topic，Swin 团队于是投入组内全部可参与资源把项目做到极致。
  - [11:26] 曹越复盘 Swin Transformer 的教训：判断机会和执行到极致同样关键，有些人只追逐热点做不 solid，有些人大扎实又错过时机。
- **[13:18] OpenAI启示**
  - [13:41] 21 年看到 OpenAI 的 DALL-E 1 和 CLIP 后，曹越产生 mindset shift：他不满足于拿 best paper，开始研究 OpenAI 为什么能做出更伟大的成果。
  - [16:31] 曹越总结 OpenAI 的方法论：“你怎么样设计一个 scalable 的 system，使得它可以最大化地压榨算力。”
  - [17:59] 曹越认为 OpenAI 的本质是创业公司：需要爬数据、洗数据、训练、评测和 PR 的多样人才，不是小作坊式论文组织。
  - [20:42] 曹越加入智源研究院，因为它是当时国内最像 OpenAI 的组织；2022 年中智源已有约 1500 张 A100 组成的集群。
- **[21:31] 光年之外**
  - [22:49] ChatGPT 出现后曹越判断大模型是巨大的早期机会，但单靠自己创业复杂度太高，需要算力、资金、产品化和组织能力。
  - [25:47] 王慧文发英雄帖后靠“你推荐两三个最该聊的人”快速遍历国内研究者；曹越见梁文锋时已经答应加入光年之外，梁当时也在遍访研究者。
  - [27:59] Q: 为什么中国没有出现像 OpenAI 这样的组织？王慧文给曹越的答案是不够富；曹越理解为追赶阶段靠效率创新，接近前沿需要原创创新。
  - [30:51] 曹越认为过去两年中国正在出现向原创创新的 transition，代表包括哪吒、黑神话悟空、DeepSeek 和宇树。
  - [33:21] 光年之外早期的算法人才画像：招毕业 3-5 年或即将毕业、仍在一线 hands-on 的 PhD，不介意之前方向是 NLP 还是通信。
  - [34:35] 曹越从光年之外学到 CEO 压力很大、要照顾身体；他缓解焦虑的方法是思考死亡等人生层面的大问题。
- **[37:16] 创业抉择**
  - [37:16] 光年之外结束后，曹越到 2023 年 8 月才空下来；他广泛看方向，最终决定自己创业做 AI 视频。
  - [38:28] 曹越选择 AI 视频的原因：技术上处于非常早期、upside 大，商业天花板高，且当时连好模型都没有，适合模型背景的人切入。
  - [41:02] 曹越说自己是很不典型的研究者，更关注领域发展和组织；意识到自己本质是 ambitious 的人后，发现创业让他“什么都对了”。
  - [43:20] 曹越描述自己的驱动力：“当你看到跟你 skill set 比较接近的人，他们能做成非常伟大的事情的时候，你的感受就是‘为什么我们做不了’。”
  - [44:33] 曹越回看自己没有更早创业或去 OpenAI：当时认知达不到，ChatGPT 之后共识形成，但光年之外给他的判断和招人方法影响至今。
- **[46:57] 自回归路线**
  - [47:12] Q: 为什么 Sand.ai 第一个模型 Magi-1 花了一年多？曹越说核心是低估自回归路线：视频天然顺序播放，但算法、infra、数据到后训练都要从 0 到 1 做。
  - [52:00] 曹越认为纯画面视频生成已卷到相对收敛，正在发生的窗口是音画同出；Sora 2 有音画同出、保人物 ID、10 秒叙事三个特点，他最惊艳的是叙事。
- **[52:37] Sora 2**
  - [55:51] 曹越的认知迭代：OpenAI 没有用脚本、分镜、生图、配音的 agent 系统做叙事，而是把叙事端到端做进模型；音画同出也让生成视频第一次有 C 端消费属性。
  - [58:29] Sora 2 端到端叙事的背后是 OpenAI 垂直整合的组织能力：产品需求直接回传模型团队，这种机制比单个功能更让曹越惊讶。
  - [1:00:12] Q: Sora 2 用的还是 DiT 架构吗？曹越判断基础大概率是 diffusion 模型，是单向还是双向 diffusion 现在还没有定论。
  - [1:01:12] 曹越说切镜头本身不是不可能实现，Sora 2 的进步是把 10 秒内 3-5 个镜头切得更有叙事性、更让普通人想消费。
  - [1:02:28] 曹越最惊讶的不是 Sora 2 的某个具体功能，而是 OpenAI 从产品需求到模型迭代之间端到端优化的组织机制。
  - [1:04:34] Meta 的 Vibes vs OpenAI 的 Sora 2：曹越认为 Vibes 像垂直缝合，把现有能力拼成产品；Sora 2 则是有机整合模型与产品，价值主张清晰。
- **[1:06:54] Gaga-1**
  - [1:07:00] Sand.ai 新模型 Gaga-1 聚焦“人物说话和表演”，目标解决人物不一致、表演假这两个内容制作中的最大痛点。
  - [1:07:45] 曹越用 B 肉和 A 肉区分视频：之前模型主要满足空镜转场等 B 肉，A 肉里人物说话和情绪表演一多，模型就过不了恐怖谷。
  - [1:08:41] 曹越说做 AI 短剧的从业者反馈最大卡点是“人物太假、演员没有表演”，这是 Gaga-1 从需求出发的起点。
  - [1:10:07] 曹越认为从需求出发时，只要技术判断知道什么可实现，就更容易找到需求与模型的 fit；Gaga-1 是先锁定高频人物说话场景。
  - [1:10:35] Gaga-1 因场景聚焦所以生成成本较低；曹越给出实拍短剧约 10 万到 30-40 万一部、AI 每分钟 2000-5000 元，但 AI 短剧仍没过消费门槛。
  - [1:12:12] 曹越承认 Sora 2 之前没意识到要把叙事做进端到端模型；他判断从 10 秒扩到二三十秒技术不难，并猜测 Sora 2 可能为 C 端定制了 360P 模型。
- **[1:15:27] 用户与C端**
  - [1:16:48] 曹越说公司内部用音画同出模型玩“逗视频”比赛：给一张图和一句台词就能生成有情绪、有表演的视频，天然适合社交传播。
  - [1:18:57] 曹越考虑做 C 端产品时会把分辨率降到 270P 或 360P，因为微信等社交传播不需要高分辨率，可以大幅降成本。
  - [1:19:52] 曹越认为 Sora 2 会让所有大厂都来卷视频生成，但大公司投入大动作未必快；小公司仍有空间。
  - [1:20:56] 曹越判断能否出现新的 C 端平台，要看两点：是不是新内容形态，以及有没有新渠道；目前 Sora 2 还更像工具。
  - [1:22:13] 曹越认为判断 Sora 2 能否成为 C 端平台最关键的指标是留存，早期不需要太多用户，要找到适合的长期刚需人群。
- **[1:23:11] 垂直整合**
  - [1:25:22] 曹越说 PMF 难在技术驱动时代：做产品的人要补模型认知，做模型的人要补业务 know-how，两边一起往中间走。
  - [1:28:08] 曹越把 Sand.ai 从模型侧组织变成垂直整合组织：产品和模型的人频繁 one-on-one 和交流，对齐上下文来创造独特体验。
  - [1:31:53] 曹越用 Cameo 说明垂直整合：产品想要一个功能，模型侧直接为这个能力迭代模型，产品与模型互相放大，而不是简单提需求交付。
  - [1:34:47] Gaga-1 的技术目标不是为创新而创新，而是被“生成逼真的人物说话和表演”这个目标驱动，优先做保 ID 和音色一致性。
  - [1:36:36] 曹越说 Gaga-1 的第一个产品会是 web 端，10 月发布让用户先体验；C 端 app 形态也有计划，但定位需要更多时间打磨。
  - [1:38:04] 曹越透露 Gaga-1 内测反馈：人物说话和表演的真实度非常高，人物部分至少与 Sora 2 差不多，有机会更好。
- **[1:38:54] CEO与未来**
  - [1:38:59] 曹越认为过去两三年变化最大的是当 CEO 之后：他要学习产品、商业、业务，以及如何做一个专业的 CEO。
  - [1:39:35] 曹越学习理想汽车《如何做一个专业的 CEO》框架：先想清行业趋势和痛点，再定方案、融资、节奏和机会。
  - [1:41:14] 曹越应对突发事件的章法：先识别是否噪音，再把事件对行业和公司的影响写下来，向多人求证后基于上下文做下一步动作。
  - [1:42:27] 曹越分享 vibe research 时刻：今年五六月与 Gemini 2.5 Pro 讨论算法问题，模型补全了他们没注意到的部分并给出靠谱方案。
  - [1:43:53] 曹越发现语言模型特别擅长梳理两个类比的相似与不同以及背后原因，比大多数人讲得更有道理；他自称常叫 Gemini 老师。
  - [1:45:21] 曹越说更信任 Gemini 而不是人的原因不是信任本身，而是人和人之间对齐上下文极难，语言模型能快速补齐对方观点背后的上下文。

## Speakers

- **曼祺** (host)
- **曹越** (guest)

## Topics

AI模型团队动态, 模型自进化

## Mentioned

DeepSeek (company), OpenAI (company), Sand.ai (company), 光年之外 (company), 微软亚研院 (company), 智源研究院 (company), 皮克斯 (company), Claude (product), Cursor (product), Gaga-1 (product), Gemini (product), Magi-1 (product), Sora (product), Swin Transformer (product), Vibes (product)

## Transcript

### 开场

**曼祺** [0:05]
OpenAI 它展现出来的方法论 ， 一句话表达就是 ： 你怎么样设计一个 scalable 的 system， 使得它可以最大化地压榨算力 。

为什么中国没有出现像 OpenAI 这样的组织 ？ 我见老王的时候 ， 我也问他这个问题 ，他很快就给我了一个答案 ， 就是 ： 当你看到跟你 skill set 比较接近的人 ，他们能做成非常伟大的事情的时候 ， 你的感受就是 " 为什么我们做不了 "。

**Guest** [0:30]
而且你知道 ， 答案肯定不是你不行 ， 肯定不是你菜 。

**曼祺** [0:36]
欢迎收听 《 晚点聊 》， 我是曼祺 。 今天的嘉宾是 AI 视频生成公司 Sand.ai 的创始人曹越 ，他之前也是 " 光年之外 " 的联创 。

曹越是少数在 ChatGPT 之前就遇见到大模型浪潮的人 ：2021 年他拿下 ICCV 最佳论文后， 开始研究 OpenAI； 这促使他从微软亚研院的视觉组加入了智源研究院 ， 这是国内最早专注大模型的 AI 机构 。

这期中， 曹越从头分享了他的 AI 历程 ： 我们聊了那篇 ICCV 论文的诞生 ， 曹越从研究员到创业者的转变 、 他对 Sora 的观察 ，以及 Sand.ai 在开发新一代模型 Gaga-1 的过程中的思考和实践 。

让我有些意外的是 ， 曹越做研究员时就格外关注组织与机制 。他说当真正开始创业 ， 感觉一切都对了 。

本期节目感谢飞书特别支持播出 ，《 晚点聊 》 的不少听众都是飞书的用户或合作伙伴 ， 我们访谈过的许多创始人和公司也是飞书客户 。

今天重点给大家安利飞书的 " 智能会议纪要 " 功能 ： 它不仅能精准地完成基础的录音转文字 ， 还可以由 AI 提供强大的总结 。

以我们自己的工作流为例 ： 在处理长访谈时， 智能会议纪要可以生成框架参考 、 分段归纳要点 ； 在选题会这样的多人讨论中， 智能会议纪要则能按照发言者总结要点 ，并归纳出清晰的 to-do list。

而且除了文字总结 ，也能生成框架图 。 这次我们就用飞书的智能会议纪要 ， 生成了本期节目内容的纪要全览 ， 大家可以在 show notes 里查看 。

下面我们正式进入本期节目吧 。

我想回到比较开始的时候 ， 来聊聊你整个的经历 。 因为其实你之前也很少接受采访 ， 所以我觉得这是一个很好的机会 ， 可以从头聊一聊 。其实就在每一个时间点 ， 我觉得你做的事和一些选择都是挺有代表性的 。

### 早年研究

**曼祺** [2:22]
回顾一下这几年的历程 ， 如果要让你去讲一下你自己在人工智能领域的探索的话 ， 你第一个就在脑海中出现的场景或者说时刻是什么 ？

**曹越** [2:33]
我觉得第一个场景应该还是说 ， 就决定做 AI， 或者在那个时候可能还更偏积极学习 ， 到后来比较幸运 ， 然后去做深度学习的那个 moment。

**曼祺** [2:45]
那很早吧 ？ 那是不是上本科的时候 ？

**曹越** [2:47]
对对对 ， 就大概是 14 年左右吧 。 然后我觉得那个时候 ， 坦率地说是比较幸运的 。 实际上在国内 ， 那个时候深度学习是不怎么火的 ，而且还有一批很有代表性的国内的老教授们 ， 就当年他们是做积极学习的 ， 甚至还有教授就在自己的主业上直接去写 ， 说 " 我不做超过两层的神经网络 "。

**曼祺** [3:07]
14 年你是大几啊 ？

**曹越** [3:08]
我大四 ， 对 ， 大四 。 其实现在是读 PhD 阶段 ， 就刚好遇到了可以做深度学习的这个时代 。 然后当时我的 mentor 他去 Berkeley visit， 就发现在硅谷所有人都在讨论深度学习 ，但还没有那么多 legacy， 说 "OK， 我不应该做太深的这个神经网络 " 之类的 。

所以当时我在的研究组应该也算是国内最早一批买了 GPU， 然后在但是那个时候卡很少 ， 然后在做深度学习的组 。

后来我大概 17、18 年的时候就去了 MSI 的视觉组 ， 那当然这个组是一个我觉得在国内非常有代表性的 。

**曼祺** [3:41]
对 ， 这是个非常传奇的组 。

**曹越** [3:42]
是的是的是的 。 就包括他们从 14、15、16 年后来做出来 ResNet， 当然那批人他们可能在 16、17 年也就陆陆续续都出来 ， 然后有创业啊之类的 。

然后再到后来 ， 我大概是 17 到 18 年加入那个组 ， 然后在那个组先实习 ， 然后后来留下来 ， 然后也是继续去做这个计算机视觉 ， 还有多模态 ， 然后预训练这方面的一些工作 。

我觉得这个组坦率地说 ， 我觉得的确是有一些传承了 。 从我自己的视角 ， 我觉得我最受益的有几点 ： 第一点就是 ， 你要去做最受关注的 topic， 这个 topic 最好还是一个就是你明确感受到还有很大机会的 topic，但不是一个已经收敛的 topic。

**曼祺** [4:27]
但这个东西有点微妙的地方在于什么 ？ 就一个东西如果最受关注 ， 它就非常火 ， 对吧 ？

**曹越** [4:31]
对 。

**曼祺** [4:32]
那非常火的东西 ， 它有可能就已经有些后继了 。

**曹越** [4:35]
所以第一点要 ， 第二点要联合起来看 。 我觉得最受关注的另外一面是 ， 它可能就是最重要 ， 它可能就是这个领域里最重要的 topic，但是这个 topic 它还有没有前进空间 ， 这是一个需要提前做判断的点 。

**曼祺** [4:50]
那你们怎么判断 ？

**曹越** [4:52]
我觉得这个还真的是有一些直觉吧 。 就是你可以认为它是 ， 当你真的在一个行业里做了一段时间 ， 你思考过很多关于这个行业的问题 ， 你就知道 ， 哎 ， 那这个方向就是它可能只有一些非常微妙的基础信号 ，但是在你这里就已经是就非常剧烈的信号了 。

### Swin Transformer

**曼祺** [5:09]
我们可以讲一个具体的例子 ， 就是你们当时 21 年拿到 ICCV 最佳论文的 Swin Transformer， 当时你们应该是有个 idea，是说把 Transformer 用到视觉领域 ， 对吧 ？

**曹越** [5:19]
对对对 。

**曼祺** [5:20]
那像这种想法你是怎么来的呢 ？

**曹越** [5:22]
对 ， 它是这样的 ， 就是实际上 Transformer 大概是 2017 年就出现了嘛 。 然后在我看来 ，Transformer 的普及 ， 就是至少在整个视觉多模态方向 ，有两个阶段 。

第一个阶段是 ， 就计算机视觉因为发展了很多年， 卷积神经网络是在那个阶段非常就 dominate 整个领域的一个网络结构 。

所以在 17 年刚刚出现的时候 ，其实我在那个研究组 ，他们就是最早把 Transformer 应用到计算机视觉方向的组 。

但那个时候大家对 Transformer 这个结构的认知还比较浅 ， 大家就会去看说 Transformer 里面有哪个设计是之前我们没见过的 ， 我们把它借用到现有的这个卷积神经网络里面 。

就是包括 17 年那篇文章的 title 也叫做 《Attention is all you need》， 包括我刚进组的时候也是在做这个方向 ， 就是把里面的 attention block 应用到卷积神经网络里面 。

**曼祺** [6:15]
就是把注意力的这个 。

**曹越** [6:16]
对 ， 这个模块 。 就相当于是 Transformer 是整个网络结构 ， 它里面可能有注意力模块 ，也有 FFN 等等 ， 然后就把这个 attention block 应用到卷积神经网络里面 。

然后那解决问题也比较简单 ，因为卷积神经网络它天然就是局部的 ， 所以它的感受也你可以认为就每个地方能够看多远 ， 这个地方是有限制的 。

但是 attention 它就提供了一种你可以比较低成本就可以扩大感受野的这么一种方案 。 所以在最早的时候 ， 大家探索的都还是说怎么用 attention 来弥补卷积神经网络里面的一些缺陷 。

那当然还有另外一条 ， 另外一条 line 做的人更少 ， 就是能不能用 attention block 直接替代卷积 。其实在 18 年、19 年的时候 ， 当时我在研究组就已经在做这样的工作 ，但是那个时候大家都还是说 "OK， 我应该还是 follow 之前比如 ResNet 的整个结构 ， 我只是把里面的卷积替换成 attention block"。

所以这个是第一个阶段 。 然后第二个阶段 ， 我觉得最重要的应该是 20 年下半年有两篇工作 。 第一篇工作是 Image GPT，其实还是 OpenAI 做的 ， 就是他们在做完 GPT-3 之后， 就非常暴力地把 GPT 应用在了计算机视觉里面 。

但是因为这个工作过于暴力 ，而且它的效果没有那么好 ， 所以大家可能看过那个 paper，但是我觉得大多数人没有搞明白就是它为什么要这么做 。

然后这是第一篇 ， 我没记错应该是 20 年 6 月 。 然后第二篇工作应该是 ViT， 就 Vision Transformer， 然后这是 Google 的一个组做的 ， 它大概是 20 年 10 月份出来的 。

然后 ViT 就是它把 IGPT 里面一个不太 work 的部分 ， 就是 IGPT 它是直接在像素上去做 self-attention， 然后这里面它的计算效率是很低的 ， 然后它把这个像素变成一个 patch， 就是可以认为有点像是一个词 ， 就是一个比如说 16×16 的像素块 。

**曼祺** [7:59]
就是一组像素 。

**曹越** [8:01]
一组像素 ， 对 ， 一个局部的像素块 。 就它核心功能现在是这个 。 但是它做完这个之后呢 ， 它就把这个应用在了图像分类这个任务上， 比如在 ImageNet 图像分类上， 然后取得了不错的效果 。

然后大概在 20 年 10 月份就出了这么一个工作 ， 然后我们也是最早关注到这个工作的 。 我觉得在那个时间点 ， 对于视觉方向来说 ， 这里最核心的一个认知的迭代就是说 ， 我们不应该再拘泥于之前卷积神经网络迭代出来的这个结构了 ，而看看能不能把 Transformer 的整个结构应用到计算机视觉里 。

所以 ViT 它相当于证明了说 ， 我在图像分类里可以这么做 ， 那别的任务能不能 ， 我不知道 ，但是图像分类可以 。

所以就当时我们的第一个判断就是 ， 如果我们能基于 Transformer 的宏观结构 ， 设计出来一个对大多数计算机视觉任务都比较适配的一种网络结构 ， 如果它的效果还比较好 ， 那它可能就直接可以替代之前的这种基于就是相当于 ResNet 的一整套基于卷积神经网络的这个网络结构 。

**曼祺** [9:05]
OK， 所以 Swin Transformer 的出发点就是 ， 我不仅把这种 Transformer 的结构用来做分类 ， 我还能做别的常见的视觉的任务 。

**曹越** [9:14]
对 ， 就包括目标检测啊 ， 还有语义分割等等 ， 就是一些更细颗粒度的任务 ，并且图像分类它的结果能不能做得更好 。

因为计算机视觉的任务的复杂度还比较高的 ， 就是在那个时候 ， 你可以认为不同的任务它可能从网络结构来看 ， 它都是一个系统 ， 它都不是一个简单的 、 大家比较易于理解的一个网络结构 。

所以你怎么样能够把这个最基础的做表征学习的这个网络结构 ， 能够替代成一个下一代网络结构 。

我们本身也是最早去研究 Transformer 这个结构的 ， 然后对计算机视觉里最关键的 topic， 包括图像分类 、 目标检测这些任务 ， 包括预训练 ， 都是非常熟悉的 。

所以在这个阶段 ， 我们最早就在看到 ViT 之后， 就看到了有这么一个机会 。 我觉得那个时间点 ， 就当你发现这个机会的时候 ， 你能明确地感受到这是一个非常大的机会 。

因为首先网络结构是一个被大家可能在深度学习领域最受关注的 topic， 第二就是说它是一个非常基础的单元 ， 就如果你真的做了一个非常好的网络结构 ， 那可能对所有的视觉 task 都能有比较大的效果的提升 。

然后第三点就是 ， 的确是有机会 design 出来一个打破大家之前对于计算机视觉必须用卷积的这种思想返礼 ， 然后设计出来一个以 Transformer 结构为核心的这么一个网络结构 ， 然后最终就被用到各个视觉任务 。

所以就当时的确是看到了有这么个机会 ， 然后我们就在组里面投入了很多资源 ， 最终就把这个事情做成了 。其实在同期 ， 除了我们之外 ，也有一些组也看到了类似的机会 。

我个人认为这里最关键的还是说 ， 我们当时意识到这是一个非常大的机会 ， 然后并且在当时我们把组里能够参与到这个项目里的人都拉进来 ， 然后大家一起去把这个项目做到极致 ， 就在各个维度上做到极致 。

就是你可能比同期的工作在最终的展现出来的这个效果上， 各个维度上都有显著的提升 ， 就有点像是质量完全不同 。

**曼祺** [11:16]
所以一方面就是你看到一个想法这件事上， 大家有判断力的竞争的 ， 就你认为什么问题重要 ，其次就是你给它做出来的效果 ， 你执行到什么程度 ， 资源是不是给够了 。

**曹越** [11:26]
是的是的是的 。 我觉得这件事情里学到最重要的点就是这两者都足够重要 。 你要有能力嗅到这个机会 ， 第二点是你要有组织能力真的能抓住这个机会 ， 这两者缺一不可 。

你不能说 "OK， 就是 "，其实是有很多人， 哪怕在科研领域也是这样 ， 就每天都去看什么 topic 火热 ， 我就进去做一波 ，但是他可能在第二步里做得并不好 ，但是这群人他们依然可以 leverage 到注意力资源 。

因为只要你在这一个阶段做出来一个大家感兴趣的东西 ， 大家都会关注 ，但如果你做得不 solid， 你做得不极致 ， 那可能你就很难经得起时间考验 ， 你很难 test of time。

所以如果你真的想就看到很大的机会 ，并且抓住这个机会 ， 就是这两者都缺一不可 ，但这两者有的时候还挺打架的 ，有的时候也的确是不同类型的人。

**曼祺** [12:16]
对 ，因为你总在看机会 ， 你可能就不能把一个事做得特别 solid， 你老在看新的东西 。

**曹越** [12:21]
是的是的是的 。 但是我认识一些朋友 ， 很属于第二类人 ，他也挺逗的 ，有点像是他每做一个 topic 都会把这个 topic 做得特别扎实 ， 然后他就会出现那种 ， 就当他钻到一个 topic 里面 ， 就把这个 topic 花很多时间去研究 ， 然后最后做得很好 ，但是等他做出来的时候 ， 发现这波风已经过去了 。

因为他做事情本身太过扎实了 ， 所以他老是很难在机会出现的第一时间就把握住机会 。 所以从做事的维度上 ，有的时候反而不敢趟 。

但是如果他真的有的时候比较幸运 ， 对吧 ， 就是碰到了说 "OK， 我看到了这个机会 ， 然后并且我抓住了 "，他也能做出来非常出色的工作 。

但是你看他的大多数工作可能都是反而没赶上趟的 ，但是那个工作可能质量都不错 。

**曼祺** [13:03]
其实就是现代 AI 的研究 ， 我觉得在这个研究的机构和组织里 ， 它其实也有点像公司运营的 ，有一些共通的部分 ， 对吧 ？

它其实涉及到就很多人的协作 ，以及我们到底选什么方向 ， 我们在不同方向上投入多少 。

**曹越** [13:18]
对对对 ，是的是的 。 不过这个我觉得也更像是在至少 20 年、21 年， 我觉得在 OpenAI 出现前 OpenAI 时代 ， 大家的一些做事的方法论 。

### OpenAI启示

**曹越** [13:29]
就对我自己来说 ， 就是我大概 21 年左右就有一个比较大的 mindset shift， 那个也是促使我从 MSI 离开 ， 然后加入了智源研究院 。

**曼祺** [13:40]
可以讲讲 。

**曹越** [13:41]
对对对 ， 就是我认为之前的那种做事方法论 ， 天花板还是比较明显的 ， 就即使你可以做出来很出色的 paper， 可能也可以拿 best paper 之类的 ，但是就我当时的第一感受是 ， 就是我们去看 OpenAI 的工作 ， 你去看 DeepMind 的工作 ，他们是能够做非常非常牛的东西的 ， 对吧 ？

他们可以就是比如 DeepMind，他们做 AlphaFold， 最后可以拿诺奖 。其实我感觉那里面 AI 部分还是非常重的 ， 对吧 ？ 大家同样都是做 AI 的 ， 就为什么他们能拿诺奖 。

**曼祺** [14:08]
拿的是化学奖 ，AlphaFold 是诺贝尔化学奖 。

**曹越** [14:11]
对对对 ，是的是的 。 所以这样的话就会激发你去想 ， 就是为什么他们能做出来这样的工作 。 我觉得 AlphaFold 是一个例子 ， 然后我觉得另外一个例子是 ，因为当时我在 MSI 的时候 ， 主要还是做计算机视觉和多模态比较多 ， 然后在 21 年初的时候 ， 当时 OpenAI 放出来两个工作 ， 就是 DALL-E 1 和 CLIP， 对 ，21 年初 。

然后我觉得那两篇工作已经非常能说明问题了 ，但是我身边的人真的在研究为什么 OpenAI 能做出来这样的工作 ，以及给这样的工作以符合他们的这个影响力的评价的人是没有那么多的 。

就可能大多数人第一反应都是 " 哎 ， 这个工作我好像 touch 不到 "， 或者就比如他要的算力太多了 ， 对吧 ？OpenAI 他们有足够多算力 ， 我们没算力 ， 所以这个 topic 跟我们没什么关系 ，他就不怎么花时间去研究他们 。

但是当时至少对我自己来说 ， 就是当我看到 DALL-E 1 和 CLIP 的时候 ， 我还是非常的惊讶的 ， 我还是非常惊讶的 。

就是如果你能放下自己的 ego， 真的去仔细研究他们这两篇工作 ， 我觉得就像刚才说 ， 它是非常能说明问题的 。

就他们的做事方法论 、mindset 和组织形态 ， 都和当时至少我们在做 paper 的感觉是非常不一样的 。

**曼祺** [15:25]
你可以总结一下你当时看到的他们的组织方法论和 mindset 是什么 ？

**曹越** [15:29]
有几点吧 。 第一点是我觉得当时大多数国内的研究组还是以 paper driven， 就是我最后能不能做一个 paper， 然后能不能发表 ， 把这个当做核心的驱动力了 。

我觉得这个本身就会带来很多问题 ， 比如说 paper 它就有作者列表 ， 对吧 ？ 谁是一作 ， 谁是二作 ， 谁是三作 。

那这个时候它本质上就没有那么鼓励合作 。其实我们当时在 MSI 的那个研究组 ， 我觉得一定程度上已经意识到这方面有问题 ， 然后就在努力地去变 ， 就是做一些组织上的变化调整 ， 就 mindset 上调整 ，但我觉得这个也没有那么快 。

所以第一点就是大多数国内研究组还是 paper driven， 这个就体现在第二点 ， 就当你很关注 paper 的时候 ，有的时候你就会受审稿人的 taste 的影响 ， 比如审稿人他总会去问你这个 paper 有什么 novelty， 创新 ， 对 ，有什么创新性 ， 你在方法上有什么类型的创新 ， 然后这个是大家最容易问的 。

那这个时候你肯定想 optimize 这个事情 ， 对吧 ？ 我是不是应该提一个新的东西 ， 然后把这个故事讲得新一点 ， 让别人觉得 " 哎 ， 这个东西好像挺有意思 "。

但是 OpenAI 他们反而方法上看起来都非常简单 ，他们的工作很多时候不是坐在说 "OK， 我在方法侧有一个什么样的 trick" 这种维度 。

我觉得这有点像是当你的基础的方法论和目标不同的时候 ， 你思考问题的方式也不一样 。 然后在这个过程中， 所以很多人就有点像是他们解决问题的方式更像是你能不能设计出来一个 scalable 的 ， 能最大化利用算力的系统来解决这个问题 ，而不是说我能不能在方法上搞一些 trick 来解决这个问题 。

这是第二个我觉得很大的不同 。 然后第三个不同就是组织上不同 ， 我觉得这都是一脉相承的 。 就组织上不同就会使得 ， 比如说你是个 paper driven 的组织 ， 那你大概率这个组织就要比较小 ， 然后很多时候学生是跟你的主要合作对象 ， 当然体力学生也挺好的 ，因为他们可能也很有主动性 ， 希望能够博士毕业 ， 对吧 ？

然后类似这样 。 但是你很难让他们合作 ，而且如果你真的要打造一个 scalable system 的时候 ， 这个时候实际上你需要的人是很多样的 ， 比如说有的人要去爬数据 ，有的人要去洗数据 ，有的人要去 train model，有的人要去看这个 model 怎么 train 起来高效 ， 对吧 ？

然后有的人要去看这个 model 怎么评测 ， 包括最后怎么 PR， 对吧 ？ 一整套他需要的人和就是刚才那种小作坊式的组织是完全不一样的 。

而且你需要这群人大家都是有类似的 mindset， 说 " 我希望把这个 system 做好 "，而不是说 " 我希望在最后发表的这个 paper 里我是什么 first author 或者 second author"。

所以这使得大家的组织形态也很不一样 。 但那个时间点 ， 就至少 21 年的时候 ， 我还不知道这个组织形态是怎么构建的 ，但后来我就发现这就是创业公司 ， 对吧 ？

本质上就是创业公司 。

**曼祺** [18:11]
所以你当时心里想的是 ， 你想做更厉害的成果出来 ， 然后你关注的是怎么做成这个事的背后的组织形态和做事方法 。

**曹越** [18:20]
对 ， 就是为什么 OpenAI 能做出来这么牛的东西 ， 为什么 DeepMind 能做出来这么牛的东西 ，在我当时的组织里 ， 或者我身边看到的组织里和他们之间的差别到底是什么 。

然后我觉得在那个时间点还有一个很大的 barrier， 就是可能大家都不一定记得 ， 就是疫情 。 我觉得那几年， 大概从 20 年到 ChatGPT 出来之前 ， 大概两年多的时间里 ， 疫情其实是一个就很大的这个 barrier， 然后使得国内和比如说硅谷之间的 communication 其实没有那么多 。

就当时我们在微软研究院嘛 ，但是我们和比如说 Random 那边有一些交流 ，但是也就限于远程了 。 大家其实当面的交流这种活动其实都少了很多 ， 包括当时的很多学术会议其实都远程开了好几年了 。

我觉得这也促成了说实际上从 20 年开始 ，OpenAI 已经展现出来了非常不一样的成果 ，但是因为大家之间的交流受到一些影响 ， 使得如果一个人你没有办法放下自己的 ego 充分去研究他们 ，也没有更多信息促使你去做这个事 ， 你可能更容易被自己的知识茧房所限制 。

所以对我来说 ， 当时最关键就是说为什么他们能做出来这么牛的东西 ， 然后我们到底应该打造一个什么样的组织 ， 身边有什么样的人能够一起做成这样的事情 。

所以这个是我在去智源之前 ， 就大概从 21 年到 22 年花最多时间去研究和思考的问题 。

**曼祺** [19:46]
但是你当时并没有想要去创业 ， 你当时想的其实还是一种新型的研究机构的 。

**曹越** [19:52]
对 ， 我觉得那个时间点我也对创业这个事情的认知和理解也没有那么深吧 ， 就是身边也没有很多人创业 。

**曼祺** [20:00]
那你可以讲讲就是智源当时是一个什么状态 ， 让你觉得就是你从微软亚研院去智源更能实现你想达到的那种做事的方式 。

**曹越** [20:09]
对 ， 我觉得智源是国内最早一批拥抱 OpenAI 方法论和拥抱大模型的组织 ， 然后它也是一个新型研发机构 。

所以它本质上你也可以认为它可以不以发论文作为核心指标 。 就在我那个时间点的认知里 ， 我认为它是国内最像 OpenAI 的组织 。

那个相似度可能没有那么高 ，但是已经是最像了 。 所以这个是为什么我加入智源的核心原因 。 这里就包括了说首先他们的自由度是比较高的 ， 然后智源在那个阶段也是很早 ，他们就 propose 要有比较大的算力集群 。

可能在 22 年中的时候 ， 智源就有一个 1500 张 A100 的集群连在一起的 ， 然后在国内在那个时间点可能超过 1000 卡的集群都是非常非常少的 。

所以首先它是一个比较宽松的科研环境 ， 然后你可以筛选出有这种有点像创业 mindset 的一些人， 跟你一起去做一些更前沿的项目的探索 。

但这个时候它并不是以你要提出更先进的方法作为目标 ，而是大家构建一个 system， 这个 system 就像 DALL·E， 像 CLIP 这样的 system， 然后最后取得很不错的成果 。在那个时候 ， 智源还有另外一个目标 ， 就是开源开放 ， 对吧 ？

就是我们可以把模型开源出去 ， 然后让更多人用到这些模型 。 对 ， 所以我觉得在那个阶段对我来说 ， 智源是一个非常符合我当时对 OpenAI 想象 ， 就是很好的去做探索的一个组织 。

**曼祺** [21:31]
后来王慧文是怎么认识你的 ？ 再后来就是你光年之外那个创业 。

### 光年之外

**曹越** [21:35]
我加入智源因为在 ChatGPT 出来之前嘛 ， 加入智源一段时间之后 ChatGPT 就出来了 。 我觉得国内的形势就瞬间发生了巨大的变化 。

之前可能大家都也没有觉得说 OpenAI， 甚至可能有些人他会觉得 " 哎 ， 比如说我加入智源 ， 这到底是不是一个正确选项 "， 对吧 ？

就 MSI 看起来是一个很有传承 ， 然后很有 impact 的组织 ，但是智源那个时候还是一个相对早期的一个状态 。 但 ChatGPT 出来之后， 大家都认为 " 哦 ， 原来 OpenAI 这么牛 "，因为中美之间交流变少 ， 就是各方面原因吧 ， 导致它之前积累的势能在那一刻突然被释放出来 。

所以我觉得在大家看到 ChatGPT 之后， 都处在一个非常非常兴奋的状态里 。 后来王慧文他们就发了朋友圈嘛 。

**曼祺** [22:18]
英雄帖 。

**曹越** [22:19]
是是是 ， 就本来国内热度已经很不错了 ，但是那个就是真正的一个事件 ， 就是点燃了国内对于大模型这一波的热潮 。

**曼祺** [22:28]
因为你们是校友嘛 ， 你们之前并不认识是吗 ？

**曹越** [22:31]
对对对 ，是的 。

**曼祺** [22:31]
王慧文在清华也开过课 ，是和创业有关的 。 那个你也没去听过 。

**曹越** [22:35]
是的是的是的 ， 我都是后来学习的 。 对 ， 所以在那个阶段就是在 ChatGPT 出来之后， 到认识老王之前 ， 那对我自己来说 ， 我一直在思考就是这样的一个事件对国内到底会带来什么样的变化 。

我觉得还是比较明确的 ， 就是这是一个巨大的机会 ， 然后还在一个机会的非常早期的阶段 ， 对吧 ？23 年初那个时候 ， 微软有一篇文章就是什么 Sparks of AGI， 就是大家看到了最早 AGI 的这个火花 ，但实际上大家都认为在那个阶段距离后面的就是它还是有很多问题的 ， 还是有很大的提升空间的 。

那也就意味着这是一个会给这个世界带来巨大变革的技术 ，但是这个技术本身还在一个早期阶段 。 而且在那个时间点 ， 我的认知也是 ， 我认为就是它并没有那么强烈的说 "OK， 你到底之前是一个做计算机视觉的 ， 还是一个做多模态的 ， 还是一个做语言模型的人， 做 NLP 的 ， 就该去做什么 task"。

因为我研究 OpenAI 研究了一段时间 ， 我认为 OpenAI 它展现出来的方法论和传统的这几个领域都是不一样的 。

一句话表达就是你怎么样设计一个 scalable 的 system， 使得它可以最大化的压榨算力 。 但是之前其实你哪怕在 NLP 领域 ， 可能你也是对着一个任务去猛做的 。

那对着这个任务其实有的时候你会加一些人为的先验 ， 对这个任务有用 ，但它并不本质的 。 但是 OpenAI 至少在那个阶段 ， 我的认知是他们的方法论还是很不一样的 。

所以我自己当时的感觉就是这应该是一个巨大的变量和机会 。 那我也在想我自己能够以什么样的形态参与到这个事情里 。

那它可能就需要首先拥有做模型的能力 ，而且这个做模型不只是 reproduce， 你可能还需要一些前沿探索的能力 。 因为就哪怕那个时候你要去 reproduce， 你也是需要探索的 。

**曼祺** [24:25]
对 ，因为它是闭源的模型 。

**曹越** [24:27]
对对对 。

**曼祺** [24:27]
它后面就是闭源了 。OpenAI 很早的时候有一些开源的东西 。

**曹越** [24:30]
对 ，是的 。 那即使它开源了模型和你怎么 reproduce 这个模型还是有很大 gap。

**曼祺** [24:36]
因为还有数据啊 ， 训练方法什么的 。

**曹越** [24:37]
对对对 ，是的 。 所以你要怎么搞定模型 ， 然后包括你要做一家公司的话 ， 你的钱从哪里来 ， 对吧 ？

看起来这是一个需要巨大算力投入的事 。 那你的算力从哪里来 ？ 那后续你的产品化应该怎么做 ？

那可能如果是一家创业公司 ， 它的战略应该怎么做 ？ 你的组织应该怎么组织 ， 对吧 ？ 我觉得这都是可能在那个时间点感觉这个事情应该还是复杂度非常高 ，但是它明确是一个非常大机会的这么一个 。

**曼祺** [25:03]
你说那个时间点是 22 年 11 月到 23 年的 9 月份 。

**曹越** [25:07]
对对对 ，3 月份吧 ， 到 3 月份 。

**曼祺** [25:09]
对 ， 所以你是想过自己创业的 。

**曹越** [25:11]
有琢磨过这个事情吧 。 当时琢磨之后觉得这个事情本质上还是一个复杂度比较高的事情 。 对 ， 然后那我自己在那个阶段拥有的能力还是说构建起来一个比如说能够 train model 的组织 ，并且知道说这个模型侧怎么 train model 这件事情 ， 实际上缺少的东西还是非常多的 。

但是当老王他自己发了英雄帖之后， 然后跟老王聊了之后 ，其实我我个人的感受是还是有点一拍即合的感觉的 。

**曼祺** [25:39]
所以是他发了帖子之后， 有人介绍你们认识的 。

**曹越** [25:41]
对对对 ，是的是的 。他应该还是在国内非常广泛的去聊各种各样的人。

**曼祺** [25:46]
聊了很多人。

**曹越** [25:47]
我觉得他在那个时候的一些动作还是非常厉害的 ， 就是包括他通过人和人之间的 connection， 把国内在那个阶段在深度学习做的相对比较好的一批人， 我觉得那个阶段他应该都 touch 过了 。

比如说他聊一个人 ，他就问说如果你觉得在你的领域或者相关的领域里面 ， 你最推荐还要跟谁聊 ，他就让你推荐两到三个人。

然后通过这种方式 ，其实很快就把国内的相对来说比较 solid 的一批人就都聊过了 。

**曼祺** [26:16]
我有个比较好奇的问题啊 ， 那个时候他有聊到梁文锋吗 ？

**曹越** [26:19]
好像是有的 ，但是我有点记得不那么清楚了 。 因为那个时候我跟梁文锋聊过 ， 我 23 年 3 月份其实只跟老王和梁文锋聊过 。

**曼祺** [26:27]
你当时跟梁文锋聊是什么契机啊 ？

**曹越** [26:29]
就是他找过来的 。

**曼祺** [26:30]
他自己找过来的 。

**曹越** [26:31]
对对对 ，也是他找过来的 。

**曼祺** [26:32]
我想那个时候 DeepSeek 还没有正式成立 。

**曹越** [26:34]
就是他在想他怎么参与这件事情 ， 然后他在国内应该也把很多 researcher 在那个阶段比较适合的人都聊了一遍 ， 然后我他也聊了一次 。

但是我见他的时候 ， 实际上我已经答应老王了 。 就是我见他的那一刻 ，其实我已经答应老王了 。

**曼祺** [26:51]
所以这是缘分是吗 ？

**曹越** [26:52]
对对对 ， 我觉得肯定是有缘分的部分的 。 所以那个时间点就还是跟老王很快的达成共识 ， 然后后来就一起做了 。

**曼祺** [26:58]
你说跟老王聊是一拍即合 ，是你们觉得什么方面比较契合 ？

**曹越** [27:02]
首先这个决策的时间并不久 ， 对我来说 。

**曼祺** [27:06]
应该就是 3 月份吧 ， 我印象中就是 。

**曹越** [27:08]
对对对 ， 前前后后从我第一次检查到最终决策可能就几周吧 。 所以这个时间还是比较快的 。 我觉得第一点是我之前其实对整个就创业圈还是没有那么了解的嘛 ， 所以第一次见老王的时候 ， 我觉得还是有非常多收获的 。

你也能感觉到这个人非常强 ， 然后能从他身上学到很多东西 ，他的认知是很深的 。 然后很多时候他讲的一些东西明显感觉到是蕴含了很深的道理的 ，但是你可能还需要花时间去仔细琢磨 。

对 ， 所以这个就是当时的第一感觉 。

**曼祺** [27:39]
比如说什么呢 ？

**曹越** [27:40]
我可以说一个我到现在为止还印象比较深刻的问题吧 ， 就当时因为我自己的这个思考过程 ， 或者说在很长一段时间我都在思考的一个问题是 ， 为什么中国没有出现像 OpenAI 这样的组织 ， 甚至我在国内都找了一圈 ， 我觉得也只有相似度有一些这个智源 ， 对吧 ？

然后那对我来说我就很困惑 ， 就为什么没有 。 但是我对整个就比如互联网行业当时的理解程度肯定没有那么高的 。

然后见老王的时候 ， 我也问他这个问题 ，他很快就给我了一个答案 。 我觉得这是一个非常有深度的答案 。他就说是因为国内这些互联网公司 ， 或者说我们的发展阶段导致我们不够富 。

这个问题我还是花了很长时间去想 。 我现在只能努力的表达我自己的认知 ， 就是当我们本身发展阶段就是在追赶的阶段的时候 ， 实际上你前面都还是有目标的 。

你能看到说 OK， 谁谁做了什么 ， 然后他就比较明确的在前面 。 然后这个时候你只需要以更快的速度追上他 。

所以你最关键的是效率创新 ， 就你做的这个事情其实确定性是相对高的 ， 你主要需要效率创新 。在很长一段时间 ， 我们的发展阶段都是这样的 。

但是当你在各种各样的行业中越来越接近前沿的时候 ， 这个时候你前面 almost 没人了 ， 没有谁比你做的显著更靠前 。

就有点像是你距离他越远 ， 那个方向感越强 ， 对吧 ？ 但你距离他越近 ， 这个方向感变得越弱了 。

因为如果他是领先 ，他可能本来就在做 exploration，他也不知道哪个方向更对 。 所以当我们在追赶阶段 ，他有很多现象吧 ， 就包括我们不够富 ， 我觉得这是一种 。

然后另外一种就是这个时候 ROI 最高的还是效率创新 ， 模式创新 ，而不是原创的创新 。 但是当你的发展阶段变得越来越接近前沿的时候 ， 可能这个时候各个维度上的 mindset 都需要发生变化 。

比如说创投圈 、 投资圈 ， 大家的 mindset 是不是也要有变化 ？ 之前大家非常追求说这个事我已经看明白了 ， 我只需要通过模式创新把它做成 ， 或者 copy to China， 那未来是不是这个事会变得越来越少 ？

当你有一个原创的 idea 的时候 ，他愿不愿意投资 ， 愿不愿意支持 ？ 我觉得这整个从这个部分的结构也会发生变化 。

然后那对于创业者来说 ， 那这个要求也会发生变化 。 就是当你真的站在最前沿的时候 ， 你所需要的能力和当你比较靠后去追赶的时候需要的能力也是很不一样的 。

很多时候就是会有很多失败的 case，但是最终有可能会就是从失败里面涌现出来成功的例子 。 我觉得这就会使得大家 ， 包括社会对于失败的容忍度是不是也会发生变化 ？

那包括一些失败的公司该怎么退出 ， 对吧 ？ 这方面是不是也会发生变化 ？ 它有点像是这整个链路都需要发生变化 。

就当我们越来越接近最前沿的这个时候 ， 当时老王我可能表达的不一定那么精准 ，但是我记得就是不够富 。

单论这个观点 ， 我在今年年初再回头去看的时候 ， 我个人觉得已经有一些变化了 ， 对吧 ？ 就是我在 23 年的时候 ， 当然也可能那个时候我对整个行业了解没有那么丰富了 ，但那个时候我就觉得举目望去 ， 我也没有看到哪家公司真的那么原创的创新 。

但是等到 25 年的时候 ， 我觉得有很多事情都慢慢开始发生变化 ， 就包括有像哪吒这样的片子 ， 对吧 ？

然后还有悟空黑神话 ， 对吧 ？ 还有 DeepSeek， 还有宇树 。 我觉得都是有很多有代表性的 moment 正在出现 。 这刚刚过去两年， 如果再过去五年， 再过去十年， 会发生什么样的事情 ？

我自己对于就是未来会发生事情还是非常乐观 ，但是我明确的感受到我们是在这么一个 transition 的过程里 。在这个过程里 ， 可能这些事件会越来越多的发生 。

**曼祺** [31:23]
你在 23 年 3 月的时候问过梁文锋这个问题吗 ？ 就是为什么中国没有出现像 OpenAI 这样的组织 。

**曹越** [31:28]
这个我的确有点记不得 。 因为我如果没记错的话 ， 梁老板当时的想法就是希望能够在国内做一个这样的机构嘛 。在相当长一段时间 ， 可能对于商业化的要求 ， 至少在这个组织内部对商业化的要求没有那么高的这么一个状态 。

**曼祺** [31:47]
哎 ， 现在回头看这个事情很有意思 。 就是你跟老王聊 ， 老王说没有出现是因为不够富 ， 然后你跟梁文锋聊 ， 梁文锋刚好就是一个在他之前就换方这件事情上， 我觉得他们是积累了一定的财富 。

**曹越** [32:01]
对对 。

**曼祺** [32:01]
让他可以去 。

**曹越** [32:02]
第一曲线 。

**曼祺** [32:03]
对 ，他没有商业化的压力去做这件事 。

**曹越** [32:06]
是这样的 。 因为我看就包括梁老板他自己的访谈里 ，他其实也会说他认为中国需要越来越多的原创式的创新 。

所以大概 23 年 3 月份的时候 ， 当时见到老王 ， 当时的感受就是这样 ， 就是老王还是非常强 ， 然后认知很深刻 ， 比我之前接触到的任何人吧 。

我觉得就至少在那个阶段 ， 我接触到的绝大多数人认知都要深得多 。 而且我明显的感觉到他是一个就是一方面有很多实战经验 ，但另一方面又抽象出来很多方法论 。

而且对于他而言 ，他对很多方法论他是真的有自己的理解 ， 就是他又不太像是比如说一个人可能他背过了孙子兵法 ，但他并不知道这个东西该怎么用 ，在什么情况下 work。

对 ，但他实际上可能也在很多实战过程中已经有过这方面的 practice。

**曼祺** [32:54]
你觉得光年之外这段经历 ， 你最大的收获和你学到的东西是什么 ？ 包括后来对你自己创业的影响是什么 ？

**曹越** [33:01]
我觉得对我来说最大的收获肯定是在就像老王这样非常强的一个企业家身边 ， 然后我们一起非常 close 的合作了这么一段时间 ，并且我们在这个阶段也有很多在那个阶段的判断 ， 然后以及很多动作吧 ， 就包括比如说你要招什么样的算法的同学 。

我觉得在那个阶段实际上是就我们当时最看重的一些算法的同学和我们就抢着抢着最厉害的其实是 DeepSeek。

当时的方法论就是要去招比如说毕业 3 到 5 年内或者即将毕业的 PhD 这样的一群人， 就他本身还非常 hands-on 在一线 ，并且能力也非常出色的一群人 ，但是并没有那么在意他之前到底是做比如说到底是做 NLP 还是做 communication 还是做什么 。

因为对就有点像是他的素质和状态都在一个比较巅峰的状态 。他学习 language model 可能是很快的事 ， 可能几个月就能学到很不错的水平了 。

所以当时我们想要 hire 的核心的 candidates 就差不多是这样的画像 。

**曼祺** [34:03]
那你可以讲讲就是哪些是比如从那个时候一脉相承到现在 ， 你觉得还是很对的判断 ， 你还是这样做的 。

有哪些可能是比如说经过上一次之后 ，其实它作为一种经验 ， 你是会去调整做法的 。

**曹越** [34:14]
对 ， 我觉得对于人的判断上， 我觉得基本上是非常 aligned。 就我觉得不同的组织可能意识到这一点 ， 时间是不太一样的 。

就可能有些组织他在 23 年的时候 ，他就已经在这种 mindset 在招人了 ，但是有些组织可能在 24 年或者更晚 ， 哪怕时至今日可能还有一些公司他并不是在以这种 mindset 在吸引人才 。

对 ， 我觉得这个部分还是一脉相承 。 另外一个我觉得 lesson 就是 CEO 压力还是非常非常大的 ， 所以要照顾好自己的身体 。

对 ， 这个还是非常重要的 。

**曼祺** [34:46]
这有什么方法吗 ？

**曹越** [34:47]
我觉得 CEO 是比较容易焦虑的 ， 我觉得这肯定是有一些方法的 。 对我来说最 work 的一个方式就是你去思考一些人生层面的大问题 ， 就比如说死亡 ， 对吧 ？

这样的问题 ， 然后你就会去想哦 ， 再牛的人他可能非常非常牛 ，但是他到七八十岁 ， 可能他可以再多活一点了 。

就是他最终都会面对这样的 topic。 所以在这个过程中你到底焦虑的是什么 ？ 就这些焦虑到底是不是真的有意义 ？

然后它其实能促使你去关注在这过程中最重要的一些问题 ，而不是就是这些情绪上的能够让你很焦虑的东西 。

**曼祺** [35:21]
你之前说就今年 3 月 ，25 年 3 月 ， 你和梁文锋又聊了一下， 然后你们见过之后， 你是感觉焦虑是相对缓解的 。

这个是因为什么呀 ？

**曹越** [35:29]
我觉得是这样的 ，他是不怎么受到外界情绪面影响 。 因为在整个 25 年 12 月份的时候 ，DeepSeek 突然爆火 ， 然后在这个阶段是大家都很亢奋 ， 对吧 ？

也很兴奋 。 但我见他的时候我觉得他还挺平静的 ，但是有可能他本身就是个很 AI 的人 ，但是反正他很平静 。

我感受就是他并没有太受到外界的这些事情影响 ， 虽然他一定受到了一些影响 ， 这个当时是给我很大的震撼 。

因为他们在那个阶段的确这个外界的影响力是巨大的 ， 对吧 ？ 还能保持一个非常平稳的坚持本心的一种状态 。

对 ， 我觉得这个是超级难的 。 能做到这件事情还是有很多要素的 。 就比如说我回来就把这个什么朋友圈呀 ， 或者一些这种有可能会给你输入信息 noise 的渠道 ， 平时就比较少关注了 。

因为你如果就有一些时间会花费在这些渠道上， 你自然而然就会受到这些情绪面的影响 ，而不去关注最本质的东西 。

**曼祺** [36:26]
就回到光年之外这个事 ， 当它结束的那个时候 ，其实至少对外界来说是非常突然的 。 就是你当时是什么感受 ？

**曹越** [36:33]
对我来说肯定没有那么突然吧 。

**曼祺** [36:35]
那你有什么心情吗 ？ 有什么情绪吗 ？

**曹越** [36:38]
其实有点想不起来了 。

**曼祺** [36:39]
想不起来了 。 你会因为这种事情会有比较大的情绪波动吗 ？

**曹越** [36:43]
我觉得在那个阶段没有能继续往前走 ， 肯定还是会有失落的吧 ， 就是这种类型的情绪 。 但是整体还是能稳得住的吧 。

而且那个过程也得就我和袁老师也有很多 responsibility， 对吧 ？ 就是包括组织里面的同学怎么能够更好的把这个事情就是后续过程是一个比较 smooth 的一个 transition 的过程 。

对 ， 然后所以就是在很长一段时间还是需要把这些事情都处理好 。其实在那前后其实你们是很忙的 ， 就很多事是要处理的 。

对对对 ，他可能都有很多事情层面的事情还是 drive 着你要把对大家的责任履行好 。

### 创业抉择

**曼祺** [37:16]
当你自己相对空下来 ， 可以静下来想很多事情的时候 ， 那是在 23 年的什么时间 ？

**曹越** [37:22]
8 月份了吧 。

**曼祺** [37:23]
以及你当时想什么 ，以及创业这个想法是什么时候产生和成形 ？

**曹越** [37:27]
我觉得那个时间点就是在想下个阶段应该去做什么 。 所以就在广泛的去看说 OK， 这个阶段应该自己出来创业 ， 还是比如说我应该再加入一家公司 。

但是后来还是决定说 OK， 还是想看看是不是可以自己出来创业 。 然后所以就在看不同的方向 。 就那个时间点的确也看了一些方向 ，但是最终还是决定去做 AI 视频这个方向 。

**曼祺** [37:49]
你可以讲一下当时整个的逻辑吗 ？ 一个就是为什么选择创业的这个逻辑 ， 另一个就是在不同的方向里面做了视频生成这个方向的逻辑 。

**曹越** [37:58]
我觉得在那个阶段还是在看就是有什么样的事情会让自己觉得比较兴奋吧 ，以及在做这个事情的有没有合适的团队可以支撑自己去做 。

有点像是先去考虑说到底有哪些事情可以做 。 那有一些事情包括比如说你可以加入一家大模型公司 ， 然后去 train language model， 然后还有更多的方向可以去考虑 。

那个阶段其实也有包括 carrier AI 这种类型的方向也比较热 ，有很多人都在看 ， 包括 agent 这个方向 ，AI 视频这个方向 。

当你去看这个方向的时候 ， 我觉得像 AI 视频这个方向就一下子是一个明显对比其他的方向相对更有意思的一个方向 。

**曼祺** [38:36]
对你来说 。

**曹越** [38:37]
对对我来说 。

**曼祺** [38:38]
为什么 ？

**曹越** [38:38]
我觉得有几点吧 。 第一点是首先它还在一个比较早期的阶段 。

**曼祺** [38:42]
23 年 8 月的时候 。

**曹越** [38:43]
对对对 ， 它还是一个非常早期的阶段 ， 就是萌芽阶段吧 。

**曼祺** [38:47]
对 ，因为那个时候 Sora 还没有出现 。

**曹越** [38:49]
对对对 ，是的 。 但是我自己还是明确知道说 OK，因为那个时候包括语言模型也做了一段时间嘛 ， 我觉得视频模型还是有很大的发展空间的一个方向 ，但是还在一个非常非常早期的阶段 。

**曼祺** [39:02]
哎 ， 它符合你之前选择这个研究方向的那个逻辑吗 ？

**曹越** [39:05]
我觉得是符合的 。

**曼祺** [39:07]
受关注的 ， 然后有很大空间的 。

**曹越** [39:09]
对对对 ， 首先它的 upside 肯定是非常大的 。 就哪怕只看技术侧 ， 它 upside 也是非常大的 。 然后另外一点就是它在一个相对比较早期的阶段 ， 然后所以就是从技术侧来讲 ， 就是它属于一个不错的切入的时间 。

那另外一侧就是它在商业侧也是一个这个商业天花板非常高的方向 ，而且也是一个怎么说呢 ， 就是你在解锁了不同的能力 ， 就能够解锁不同场景和需求的一个方向 ，而且也是能够持续很长时间的 。

就有点像是你看有些方向 ，在这些方向里面去琢磨的时候 ， 你就还是比较明显能感觉到 ， 就是 AI 视频对我来说在那个时间点感觉比较兴奋的一个方向 。

**曼祺** [39:49]
你当时不想加入别的公司的原因是什么 ？

**曹越** [39:51]
我觉得在那个阶段接触了一些公司之后， 就可能在那个时间点还是感受光年还是一个很好的组织的 。 但是大多数公司至少在那个阶段我去接触的时候 ， 我觉得还是不如当时在光年那个组织形态 。

我也不知道这心态对不对 ， 就是你很难决定加入一家 。 因为老王我觉得当时最早传的那个事情还是就非常低性原理的 ，而且是一个可以支撑很长时间的一个组织 ，但在早期一定会经历相当长一段时间的比较混乱的阶段 。

就我觉得最关键的就是他当时找的人都是非常对的 ， 包括找产品的人， 我觉得也都是就是非常有他自己的品味和找人的方法论的 。

然后技术侧的人， 就现在是我们在各个维度上不输任何一家公司 。

**曼祺** [40:36]
那光年之外其实当时 infra， 然后包括模型的这边 ， 然后产品商业化 ， 融资资本各方面 。

**曹越** [40:42]
就是非常完整的 。 所以我觉得就最早的这个盘子看起来是非常非常 solid，但是对老王来说他身体上没法坚持 ， 所以就但是我再去看其他公司的时候 ， 你就会觉得这家公司感觉差好多东西 。

**曼祺** [40:54]
那这一方面是你觉得没有办法下决心加入一个公司 ， 那创业这个事本身对你来说 ， 它的这种吸引力是一种什么感觉 ？

**曹越** [41:02]
我觉得当你去思考创业这件事情的时候 ， 就你会有一种好像自己终于找到了非常适合自己的一个赛道的感觉 。

就是我在很长一段时间 ， 我觉得之前的经历对我来说也是非常好的 practice， 就包括比如做科研这方面的经历 。其实我是一个非常不典型的 researcher， 我觉得应该能感觉到 。

就是我觉得有很多 researcher 他反而是那种就他能把一件事情钻深钻透 ， 能把一个事情搞明白了 ，但是我反而是那种相对而言更关注事 ， 关注这个领域发展啊之类这方面的一个 researcher。

**曼祺** [41:35]
而且你比较关注人和团队 。

**曹越** [41:37]
对对对 ，是的 。 但是很多 researcher 他都是一个人做很长时间 。 虽然后来也比较幸运 ， 就 research 做的也还不错 ，但是我也并没有一个很强烈的冲动说我是不是要去比如清华北大拿个教职 。

就是我也在一直在思考就是说我自己到底是一个什么样的人。 我觉得这里我个人后来最核心的自我觉察是 ， 就我发现我是一个比较 ambitious 的人， 这个应该是一个我自己非常底层的驱动力 。

**曼祺** [42:05]
如果更完整的描述 ，有野心指的是什么 ？ 是想做成一件事 ， 还是想赢 ， 还是想什么 ？

**曹越** [42:11]
雄心壮志就是希望能够做成一件有影响力的事情 。其实是不是我自己立的倒无所谓 ，但是我就希望自己能越来越接近做成一件对这个世界产生很大影响力的事情 。

那这个事情的另外一面 ， 就至少在那个时间点 ， 我自己的认知是去极致的追求个人成长 。 因为芒格说过一句话 ， 就是如果你想要取得很大的成绩 ， 你努力的方向是让自己配得上这个成绩 。

对 ， 所以那另外一面就是当你能够对事物建立起深刻的认知 ， 对自己的能力做非常充分的训练 ， 从而使得你能够有能力给这个世界做出有巨大价值的这个事情 。

但是 ambitious 这件事情 ， 我个人的感觉是 ， 就是当我去回溯我自己 ， 比如过去 5 到 10 年的各种决策 ， 就我就发现原来是因为 ambitious 驱动着我 。

比如说我们 Swin Transformer 做的也很不错 ，但是当我去看到 OpenAI 的 CLIP 和 DALL·E 的时候 ， 就是有一些人可能他很直接的就是说 OK， 这个事我好像做不了 ， 那我就说他不好 。

但是我反而第一感觉是 ， 就为什么我们做不了 ， 就为什么我们不行 ，是因为真的我们比较菜吗 ？

还是不够聪明 ？ 还是怎么样 ？ 还是有什么别的原因 ？ 那换一个视角就是 ， 当你看到跟你 skill set 比较接近的人 ，他们能做成非常伟大的事情的时候 ， 你的感受就是为什么我们做不了 。

**曼祺** [43:32]
而且你的答案肯定不是你不行 ， 肯定不是你菜 ，而是因为你觉得你应该找一个更好的方式去做它 。

**曹越** [43:39]
是这样 ，但是我也不觉得我是一个特别聪明的人。 但是我会觉得就这个东西看起来应该不是它的最主要因素 ， 对吧 ？

就它肯定是因为某些因素导致的 ， 对吧 ？ 然后那换一个视角就是你肯定是希望你能不能 build up 一个组织 ， 最终能做成这样的事 。

就我举个例子 ， 比如说刚才其实也讲到说从 MSI 去智源 ， 就更像是我能不能 build up 一个像 OpenAI 一样的组织 ， 做成这样的事 。

但是其实你在国内是没有任何 reference 的 ， 就因为之前国内没有这样的组织 ， 然后你也不知道到底缺啥 。

但是当了解创业这个事情的时候 ， 它就有点像是你突然感觉这个事情好像什么都对了 ， 就各个方面都对了 。

就它首先需要一个人相对比较全面的能力 ， 然后它真正的天花板是非常高的 ， 然后它能做成的事情也是非常多样化的 。

对 ， 然后它对一个人的考验也是地狱模式吧 。 对 ， 所以它也会促使你进行极致的个人成长 。

**曼祺** [44:29]
你有想过为什么你没有更早想到创业吗 ？ 就是你在自我觉察那段时间 。

**曹越** [44:33]
我有想过为什么当时从 MSI 我没有直接去 OpenAI。

**曼祺** [44:38]
你可以直接去 。

**曹越** [44:39]
对 ，但是我觉得首先就是在那个时间点的认知是达不到这个水平 。

**曼祺** [44:43]
那你当时是有一个机会去吗 ？ 还是说 。

**曹越** [44:46]
也没有直接的机会去 。

**曼祺** [44:47]
但是你没有去尝试 ， 就你当时没想过去尝试这个事情 。

**曹越** [44:50]
是的是的是的 。 对 ， 我觉得就有点像是你在那样的一个认知水平下还是没办法做出这种决策的 。

**曼祺** [44:56]
就是当时那个 Swin Transformer 你们还有一个作者 ， 就是刘泽 。

**曹越** [45:00]
他后来去 XAI 了 。

**曼祺** [45:01]
对 ，他去 XAI 了 。 那他这个路径是因为他出过留学 ， 所以他自然去了吗 ？ 还是 。

**曹越** [45:06]
也没有 。 首先我觉得跟阶段也有点不一样 ， 就是在 22 年的那个阶段 ， 就是我觉得这个事情要更非共识一些 。

但是当 ChatGPT 出来之后， 这件事其实没那么非共识了 。 就如果你从国内有能力去 ， 那我觉得也有很多人去 ， 就包括之前还有直接从国内 ， 就比如清华读完 PhD 之后去 OpenAI。

当然我自己也有很多学生在 OpenAI 或者 XAI。 我觉得其实本质上就是 ChatGPT 出来之后， 这件事情其实已经很共识了 ，但是也可以加入 ， 我觉得是没有问题的 。

但是我在那个阶段的从过程来讲 ， 就相当于是更大程度上的进入到了是不是要去就是被创业这件事情本身所吸引 。

所以有没有更早意识到创业 ， 我觉得它就有点像是当你在一个事里的时候 ， 你可能也很难那么抽象出来去看这个问题 。

比如说我读 PhD，PhD 毕业已经 19 年了 ， 然后呢在 MSI 其实也没待几年， 然后又去了智源研究院 。 然后其实在那个阶段 ， 从清华去 MSI 也是因为 MSI 那个组之前做过非常有影响力的 research。其实每次决策的时候都还是源于就底层对于 impact 或者说本身是一个 ambitious 的人而做出的决策 。

**曼祺** [46:16]
当你正式开始做站在 AI 这个时候 ， 然后你选了就是 AI 视频这个方向 ， 这个和它不是在就是核心的大语言模型公司的最主要的主轴上有关系吗 ？

就是它可能比如说竞争上或者商业上生存的概率更大 ， 跟这个有关吗 ？

**曹越** [46:32]
竞争肯定是一个维度 ，但是我觉得竞争其实并不是创业里的主轴 。 坦率说我觉得它本质上还是说其实最开始聊到的 ， 就是我觉得 AI 视频这个方向是一个技术天花板和商业天花板都非常高的一个方向 。

而且它在那个阶段你甚至连好的模型都没有 ， 所以很适合比如说作为一个模型背景的人切入这个方向去做 。

**曼祺** [46:53]
而当时如果你觉得直接做大语言模型 ， 做一个新公司有点晚了是吧 ？

**曹越** [46:57]
对 ， 我觉得那个时间点肯定是比较晚了 。

### 自回归路线

**曼祺** [46:59]
然后当你们就是正式成立 ， 应该是在 24 年的年初 。

**曹越** [47:03]
对对对 ，是 。

**曼祺** [47:04]
然后到你们发第一个模型 Meta 是在 25 年的 ， 就今年的 4 月份左右 。 就为什么花了一年多的时间 ？

**曹越** [47:12]
这里可以整体来看 ， 就因为当时我们选择了自回归这个路线 ， 做这个路线的选择 ，并且最后做这个事情的过程中， 我觉得最开始在做决策的时候还是低估了这个路线本身的难度的 。

**曼祺** [47:24]
自回归 ， 那你可以解释一下吗 ？ 因为刚刚你不是讲了其实就是 Transformer 用到这个视觉里的有几个阶段吗 ？

**曹越** [47:30]
对对对 。

**曼祺** [47:31]
自回归应该是更后面 ， 或者说它之前就出现了 ，但是最近大家又来讨论它 ， 你可以讲这个脉络吗 ？

**曹越** [47:37]
对 ， 如果完全去看自回归和 diffusion model， 我觉得之前最早的时候大家去做自回归的时候还是希望把图像和视频生成和语言模型紧密的做在一起 ， 对吧 ？

端到端的做到这一点 。

**曼祺** [47:51]
最早那是什么时候大家在尝试 ？

**曹越** [47:53]
这个就更早了 ， 可能我觉得 20 年、21 年那个时候在 GPT 出现之后， 很多人其实是这么做的 。 但是我觉得那个时候大家的探索都非常的浅层 ，而且因为它要跟语言模型做在一起 ， 导致那个时候在这个方向的探索效果都不够好 。

**曼祺** [48:08]
所以自回归的一个出发点 ， 它其实是想在一个模型的结构里面 ， 它同时处理语言 、 图像还有视频 。

**曹越** [48:15]
我觉得在那个阶段大家对自回归模型的理解是这样 。 然后在我们 24 年用自回归模型来做视频生成的时候 ， 当时我们的思路是就是视频这个数据类型 ， 它天然就是一个持续顺序播放的 。

这就跟语言其实是有类似的特点的 ， 对吧 ？ 语言也天然是就人是顺着去看的 ， 对吧 ？ 所以最终能够最大化压缩 language 的训练方式就是预测下一个 token。

所以对这个问题有一些理解之后， 你会意识到说 OK， 那对于视频而言 ， 能够最大化压缩视频里信息的是不是也是持续顺序的去做预测 。

哪怕时至今日， 我认为就这个直觉应该也还是比较对的 。 但是呢 ， 它有点像是就当你要去做这件事情的时候 ，其实你并没有一个好的 reference， 就这个事情应该怎么做 。

所以在这个过程中， 哪怕你在算法侧和不只是算法到 infra 的 code design 里 ， 都需要做非常多的从 0 到 1 的工作 。

那对于一个刚刚搭建的团队而言 ，其实你要在这个方面做的非常的 heavy 的话 ， 它可能会使得比如说你可能整个公司里最关键的人都得投入到这个方向 ， 才能把这个方向做得不错 。

但实际上你真的要把自回归这个方面的能力发展到极致 ， 可能你还有很多方面需要去投入足量的人， 比如说数据 ， 对吧 ？

然后包括这个训练过程本身 ， 包括评测 ， 包括后训练 。 但如果说就是你把主要的人都投入在这个跟自回归相关的这个部分 ， 那实际上你在其他部分可能就会出现人手的短缺 。

但如果你想要最大化发挥自回归的优势 ， 实际上你是要在各个维度上都做到足够好 ， 你才能够训出来一个足够好的自回归模型 。

所以它有点像是我有点至少在那个时间段里低估了一个刚开始组织的团队做一个过于创新的工作这个过程中的一个拦路 。

**曼祺** [50:16]
你们在 25 年发 Batch One 之前 ， 实际上你们组织大概当时是多少人 ？

**曹越** [50:20]
应该就是三四十人吧 。

**曼祺** [50:23]
因为这里面就是从你们成立 ， 然后到发出来差不多有十三十四个月左右的时间 ， 这里面有几个什么决策点吗 ？

就如果你来复盘的话 ， 中间是不是有一些时间其实比如说你们可以选另一种做法 ， 我就不用这么新的模型 ，但是我可能更快拿出一个东西了 。

**曹越** [50:38]
如果你认为我们比如时间窗口就是半年， 必须拿出来一个很不错的模型 ， 那其实你可能做事的 mindset 会变得不太一样 。

我觉得在那个阶段就是对业务侧没有足够深刻的认知 ， 还是这个是另外一个原因吧 。 就有点像是你比如说我们在 Magic One 发布之后 ，其实我们后续不是也做了一定程度上调整 ， 然后更 focus 在从业务需求出发 ， 然后去看我们应该迭代一个什么样的模型去 deliver 业务侧的需求 。

但是组织里依然沉淀出来 ， 比如说我们依然有能 train 出来很不错自回归模型的能力 。 但在这个阶段就是比如说我们希望就是能够做好首先以人为中心的视频 ， 然后包括人物的说话表演这方面的能力 。

然后呢在这个维度上， 就是你怎么能够更快速的达成这个目标 ， 算法侧它也可以更快速的去迭代去达成这个目标 。

所以这就是一个和至少我们在做 Magic One 的时候不太一样的一个 mindset。

**曼祺** [51:32]
你觉得视频生成这个领域之前已经有一些时间窗口关闭了吗 ？ 某些具体的方向上 。

**曹越** [51:38]
我觉得还好吧 。 我觉得纯画面的生成在之前的阶段里就已经卷到就相对收敛的一个阶段了 。 就看起来是这样 ，但是事实上比如说单个素材片段的生成 ，而且是一个纯画面的 ， 纯 video 的单个素材生成 ， 我觉得在这个方面可能之前已经就卷到一定阶段了 。

对 ，但是你包括今年其实大家涌现出来的是说音画同出 ，并且音画同出带来的新的可能性 ， 包括叙事 ， 对吧 ？

我觉得这都是在之前的所有视频模型里都不拥有的能力 。

**曼祺** [52:13]
所以你们现在就可以去赶下一趟 ， 对吧 ？ 你们新的模型就是音画同出的 。

**曹越** [52:18]
是的 ， 音画同出的 ，并且它就天然是对于 PAI 创作者端 ，他们可以去生成有非常真实感的人物的视频 ， 对吧 ？

对创作者而言是这样 ， 对 C 端而言就是它能够比较低门槛的去生成一个可被他人 ，他的比如朋友们消费的一个视频 。

**曼祺** [52:37]
因为刚好我们约的这个时间点 ， 就是在前几天 OpenAI 刚发了 Sora app， 那 Sora 2 和 Sora app 就具备你刚才说的一些特点 ， 包括音画同出 ， 还有 C 端的用户是可以玩起来的 。

### Sora 2

**曼祺** [52:49]
然后你也是第一时间有用这个产品 ， 你可以讲讲你用完之后的最大的感受吗 ？

**曹越** [52:54]
对 ， 首先我认为它是一个不管从模型效果层面还是产品层面 ， 一个比较端到端的一个产品 。 首先它发布了一个新的模型 ， 然后这个模型同时拥有音画同出的能力 ，并且能够保人物 ID 去生成视频的能力 。

并且第三点我觉得是非常关键的 ， 就是它在一个大约 10 秒的时长里 ， 可以有一个基础的叙事 ，因为它本身拥有切镜头的能力 ， 从而使得最终生成的视频有一个基础的叙事的感觉吧 。

我觉得对我来说最惊艳的部分还是第三点 。 前两点比如说音画同出 ， 可能在今年 5 月份 Google Vio 3 发布的时候 ， 就已经拥有了类似的能力 。

然后对于保人物 ID， 我觉得这个是不管从更早的生图模型还是到生视频模型 ，其实都是一个非常重要 ，但是也已经被广泛研究过的一个问题 。

**曼祺** [53:45]
你可以稍微展开说一下， 就保人物 ID 指的是人物的一致性是吧 ？

**曹越** [53:49]
保人物 ID 指的是比如说如果对一个人物拍一个他的照片 ， 对吧 ？ 或者他的多个角度的照片 ，并且你可以录制他的音色 ， 然后在生成的视频里 ， 首先你出现这个人物的时候 ，他就会以这个人物的形象出现 。

那另外就是说如果这个人物说话 ， 那么说话也是根据你给定的这个音色说话的 。

**曼祺** [54:11]
所以它在能力上和你刚说第一点是结合在一起的 。其实你音画同出之后， 就是你有声音 ，有音色 ， 然后有这个视频 ， 它才是一个完整的人物的 ID。

**曹越** [54:21]
是的是的是的 ， 我觉得这是一个非常准确的表述 ， 就是我只能出视频的画面 。 那这个时候保人物 ID 实际上只是保人物的形象 ， 还没有人物的音色 。

但是当一个模型它可以同时出画面和声音的时候 ， 那这个时候就是你不仅需要去保他的形象 ，也需要保他的音色 。

对 ， 所以这一点就是我觉得还是一个之前没有的 ， 就至少同时保形象和音色之前是没有的 ，但是它也的确是在模型有音画同出的能力之后 ，其实你才需要一个人物同时就是 given 他的形象和音色 。

**曼祺** [54:53]
然后最让你惊艳的就是你说的第三点 ， 它在 10 秒里有一个叙事的能力 ，有分镜 。

**曹越** [54:58]
是的是的 。

**曼祺** [54:59]
这个是之前的模型没有做得很好的是吗 ？

**曹越** [55:02]
我觉得之前有一些模型 ， 它可以在大约 10 秒的视频里有多个镜头 ，但是这多个镜头之间的叙事关系 ， 我觉得它并不是一个就是能被那么好控制 ，并且远没有现在这么惊艳 。

可以简单理解为就之前大家认为或许我要生成一个 10 秒有叙事的视频 ， 需要用 agent 的这种技术方案来去解决我在一段视频里面有叙事的这个能力 ，而单个视频模型可能我只需要渲染某一个镜头的画面 ， 最多加上声音 。

对 ， 所以之前大家可能认为就是我觉得至少有非常多这个领域里面的人， 大家认为说有点像是叙事的能力需要用一个 agent 来解决 。

但是 OpenAI 我觉得他们在这一点是非常创新性的 ， 相当于是端到端的解决了模型可以直出一个叙事短片的这个能力 。

我觉得这个是一个哪怕对我自己来说也是一个认知的迭代 。

**曼祺** [55:54]
你觉得这个认知的迭代是在于就是它技术上做到这一点让你觉得比较新 ， 还是说它把这个事情当做一个目标让你觉得比较新 ， 或者说可以分开多说一说吗 ？

**曹越** [56:04]
对 ， 我觉得让一个系统能够生成一段有叙事的短片 ， 我觉得这本身一定是一个目标 。 但是这个目标是通过比如说产品研发来实现 ， 还是我直接用一个模型端到端去实现 。

**曼祺** [56:21]
对 ， 我记得就是它用模型端到端 ， 它把这个作为一个目标 。

**曹越** [56:24]
是的 。

**曼祺** [56:24]
这个对你来说也你觉得这是它表现的一个地方 。

**曹越** [56:27]
对 ， 我觉得这个是一个非常新的点 。 但是我觉得这也是有很多前置条件的 。 第一个前置条件是当视频模型本身不出声音的时候 ， 它生成出来的内容是不直接拥有 C 端的消费属性 。

就是你生成一段 5 秒的 clip 没有声音 ， 这个时候对一个普通人而言 ，他可能他没有办法消费这段视频 ，他其实是个半成品 。

但是当这个模型同时可以出视频画面和声音的时候 ，其实它生成出来的这个视频 clip 就已经有消费属性了 ， 普通人可以看了 ， 可以玩了 。

我觉得这是第一个 ， 就是当你真的做出来这样能力之后， 你才会意识到说哦 ， 原来我可以让模型直出一个让怎么说呢 ， 就 C 端可以直接消费的视频 。

如果还停留在上一个阶段 ， 就假如你手里没有一个可以音画同出的模型 ，在这个阶段可能最直接的去思考的就是说我这个视频模型只是整个流程里的一小部分 ， 对吧 ？

然后我还是需要非常重度的人的参与 ， 比如说人来做最早的脚本设计 ， 然后人做分镜设计 ， 然后再去生图 ， 然后同成视频 ， 然后再配音配乐等等 ， 通过人来去完成整个过程 。

这也是过去的可能从最早去年年初 Sora 出现之后， 大家在这段时间里大多数的工作流程 。 那如果是从这个工作流程衍生过来 ， 你非常自然的会去觉得说 OK， 那我能不能有一个 agent 去替代这个过程里的人 ？

那就是说我还是有一个语言模型负责脚本 ， 然后有个分镜模型负责分镜 ， 生图模型负责生图 ， 然后图生视频 ， 然后再有配音配乐的相应模型 。

它是一个模型系统 ， 最终能够生成一个比如说几十秒的叙事短片的这么一个目标 。 我觉得这是一个如果你去观察现有的 workflow 是什么样 ， 你是比较容易用这种方案去解的 。

对 ，但是 OpenAI 他们相当于是是说 OK， 我这个叙事能力为什么不能让模型直接端到端直出 ， 然后我觉得这是一个挺大的变化 。

对我来说其实也是的 。

**曼祺** [58:23]
你觉得 OpenAI 是怎么做到这一点的 ？ 就是它可以把很多人认为我应该用 agent 做的事 ， 它用一个模型就端到端的做了 。

**曹越** [58:29]
如果从我自己的视角 ， 我认为这就是他们组织能力的一种体现 。 我觉得这是他们本身是一个从产研到模型 ， 从我个人视角就是一个垂直整合做的比较好的一个组织展现出来的结果 。

就有点像是当我产品侧想要完成一个什么能力的时候 ， 像传统意义上来讲 ， 就是我的第一反应是说我能不能通过一些模型的组合 ， 通过研发的这个解决方案最终达到这个目标 ，而是说我能不能把这个东西直接做到模型里 ， 我能不能串一个 model 直接端到端的去解决这个问题 。

我觉得这是一个可能 OpenAI 从我不确定是不是成立之初 ， 或者说他们在组织里非常多人都拥有的一种方法论和做事或者解决问题的哲学 。

就是如果这个问题可以端到端解决 ， 我们就更倾向于用一种端到端的方案来去解决这个问题 。

那这个假设变成了说首先我们需不需要一个最终能有一个系统 ， 它直出一个比如说 10 秒 、20 秒或者 30 秒的有叙事能力的短片 ， 首先这件事是需要的 。

那第二件事情就是说这个方案是我阶段性的用一个模型的组合来去实现 ， 还是我有没有可能让模型直接用这个能力 。

如果有机会 ， 那他们就可以有一条分支 ，有人专门去做这个方面探索 ， 然后如果探索出来了一些结果之后， 那么自然而然就可以把这种能力释放出来 。

我觉得更像是按照这种方式来迭代出来的 。

**曼祺** [59:56]
所以你说的这是一个大的组织逻辑 。 那如果具体到就是 Sora 2， 就是它这个新的模型 ， 就是你们从业者大概觉得它可能是用什么技术方式实现的 ？

就它还是以前的这种 DIT 的架构吗 ？ 还是它可能有一些模型结构上的新的变化了 ？

**曹越** [1:00:12]
对 ， 首先他们的报告里肯定写的是非常模糊的 ， 对吧 ？ 就是它不像 Sora 1 里至少还说 OK， 我用一个 diffusion 加 transformer 的结构来实现 ， 它现在已经不怎么说了 ， 它只说它实现了什么样的效果 。

我自己的感受是现在还挺难判断说它是一个纯 diffusion 模型还是个最规模型等等 ，但是我觉得本身它这个基础应该是一个 diffusion 模型 ， 我觉得这个应该是相对比较确定的 。

但是它是一个双向的 diffusion 模型还是一个单向的 ， 我觉得这个现在暂时还没有定论吧 。 然后对于这个技术方案来讲 ， 我个人觉得就是如果从一个比较技术的视角去看他们的结果的话 ， 我觉得它能生成一个有叙事能力的短片 ， 我觉得这件事情在现有的技术条件下应该也是可行的 。

就是它也并不是一个说怎么讲呢 ， 就是他们可能内部有一些石破天惊的 idea， 然后并没有给外部展现 。 这里原因是这样的 ， 就是实际上在 Sora 2 出来之前 ，其实也有模型它拥有了可以切镜头的能力 ， 对吧 ？

那所以这更像是把我在一个 10 秒的视频里本身可以做 3-5 个镜头或者更多的镜头 ， 变得让它更有叙事性一些 。

就是切镜头本身是一种能力 ，但是你要把它切得很好 ， 切得普通人更想消费 。 我觉得这是一个就是从模型侧的优化方向 ，而让一个模型本身具有切镜头能力 ， 我觉得这并不是一个不可实现的 。

所以可以简单理解为这个部分其实从模型能力的视角 ， 我觉得都是还挺可预期的 。 对我来说最本质的就是认知迭代 ， 还是说他们从产品侧有这个需求之后， 最终是用模型的迭代来去实现这个需求的 。

就有点像是我就是要一个叙事短片 ，而这个梯度是可以回传到模型团队 ， 然后模型团队说 OK， 我们先对齐什么叫叙事短片 ， 对吧 ？

然后我的模型他们就说 OK， 那我们可能要定一个 benchmark， 就最终你想要实现什么样的能力 ， 然后我通过模型侧不管是数据训练模型 ， 优化过程最终真的让一个模型拥有了这个能力 。

我觉得这个是他们组织能力一种体现吧 。

**曼祺** [1:02:16]
所以你看到这个东西之后， 它其实最让你惊艳的 ， 或者说让你认知上有变化的 ， 还不是它一个具体的功能 ， 或者说它产品形态 ，而是你推测的就是它怎么去实现这种产品创新的背后的一个组织上的机制 。

**曹越** [1:02:28]
对 ，是的 。 我觉得这个是一个让我个人最惊讶的一点 。 我并不知道他们是怎么实现的 ，但是这个就跟当我们回看大语言模型这个时代的时候 ，其实是他们出现过类似的情况 。

就是在 2020 年 6 月份的时候 ，GPT-3 就出现了 ， 然后 GPT-3 出现 ， 事实上真正理解 GPT-3 到底意味着什么的人 ，他们对于这个模型大概的能力边界还是有一个相对比较明确的预期的 ，但是大多数人是没有的 。

那他们后半部分 ， 就当他们有了 GPT-3 这个模型之后， 那后面做的是什么呢 ？ 是让这个模型变得普通人可用 ， 就把它 align 到普通人更善于使用的 interface 上 。

这个过程其实也有点像是一种垂直整合的能力 ， 对吧 ？ 它更像是说从需求层面 ， 我们到底怎么用这个模型呢 ？

所以这个时候有了 Infrastructure GPT， 对吧 ？ 然后有了整个 post training 的过程 ， 包括 SFT 和 RL， 然后那这个过程就是一个就是从一个本身你拥有一个基础模型 ， 到这个基础模型让大多数人更方便使用的这么一个过程 。

我觉得这个过程其实可能也是比较早期体现他们这个团队拥有一种产品 sense， 或者说从模型到产品的端到端优化的能力 ， 或者也可以理解为这是一种从组织上垂直整合的能力的体现 。

而这次在 Sora 2 的时候 ， 我觉得他们再次证明了他们组织里是拥有这方面能力的 。 这个是一个我觉得挺 impressive 的一个组织上的能力 。

**曼祺** [1:03:58]
对 ，因为其实你说到这个模型的能力 ， 我觉得它应该是 OpenAI 没有甩开其他的同样是在第一梯队的公司 。 就包括你刚才也提到其实 Google 的 V3， 它之前就已经可以音画同出 ， 还有 Meta 在 9 月 25 号 ， 就是 Sora app 上线的四天前 ， 它在 Meta AI 里也发了一个 AI 短视频的功能叫 Vibes，但那个就完全没有人讨论 。

**曹越** [1:04:20]
对对 ，是 。

**曼祺** [1:04:20]
就它可能是那个产品上 ，因为它没有比如说 Cameo 这些比较好玩的 ， 就是大家能传起来的这种功能 。

**曹越** [1:04:27]
坦率说 Vibes 这个东西 ， 它事实上也并没有吸收大多数人的注意力 。 我们去看 Vibes 更像是一个垂直缝合的能力 。

垂直缝合就是说我去看组织里面到底有哪些能力 ， 然后老板可能认为说我们要做一个这样的东西 ， 那我们就把这些能力缝合成一个产品来让大家使用 。

它看起来什么都有 ，但是却并没有真正意义上他们的价值主张和让大家有印象的 sell point。 但是像 OpenAI 他们就是更有机的把模型侧的能力和产品结合起来 。

我觉得最关键的几个点就是首先就刚才其实提到了音画同出 ， 让本身出的视频就具有可消费性 ， 这个是问题的基础 。

然后第二点是它可以保 ID 去做生视频 ， 然后这就会让大家可以更低门槛的去生成 ，因为让大家大多数人玩起来最关键的就是门槛降低 。

然后那他们就就着这样的能力去设计了 Cameo 这样的产品侧的 feature。

**曼祺** [1:05:22]
对 ，而且 ID 是有社交属性的 ， 就比如说你认识一个人， 你就可以和他合拍 。 所以最开始其实上面最多的都是 Sam Altman 的 ，因为他是大家都认识的人， 渐渐的你就会拉一些你的真实的朋友进来了 。

**曹越** [1:05:34]
是的是的 。 我觉得这里他做熟人关系还是有 ， 我觉得他们很担心 deepfake 风险的 。

**曼祺** [1:05:40]
不过我觉得 OpenAI 在这个上面它也是有一些取舍的 。 就开始之前我们也聊到过 ， 它上面其实比如说你说我让肯尼迪总统怎么怎么样 ， 我让马丁 · 路德 · 金怎么样 ， 它一些名人的脸它还是可以用的 ， 它并没有去禁止这个事 。

我觉得它是发现这类内容它会非常火 ，也确实这种内容也非常火 。

**曹越** [1:05:58]
我觉得这个部分就更像是他们在训练模型过程中不可避免的使用了一些 ， 比如说版权类型的数据 。

那这个时候如果这个多模态大模型能够准确的标注说 OK， 这里面的人到底是谁 ， 那实际上最终模型拥有了即使你不上传这个人物的 ID 和音色 ， 它依然可以比较准确的生成这个人物和角色的这个能力 。

就这个部分相当于是他们可能在发现了有这样的情况之后并没有大力的禁止 。

**曼祺** [1:06:27]
对 ， 它就没有禁止 ，因为这种内容它是很有传播性的 。

**曹越** [1:06:31]
另外一点就是说如果你只是 10 秒生成一个单个镜头的话 ， 它可能可消费性还不够强 。 当这个 10 秒还有叙事属性的时候 ， 本身的这个内容就更具可消费性 ， 然后它的门槛又很低 ， 然后也可以 Cameo， 可以跟你的好朋友一起玩 ， 然后本身生成出来的视频质量也是很不错的 。

对 ， 所以这个就构成了它这次这么大的一个传播事件的基础 。

**曼祺** [1:06:54]
因为你们刚好就是在 11 之后也会发你们的新的模型嘛 。

### Gaga-1

**曹越** [1:06:57]
对 。

**曼祺** [1:06:57]
你可以讲讲就是你们的这个新的模型的特点是什么吗 ？

**曹越** [1:07:00]
我们这个新的模型就是首先它是可以拥有音画同出的能力 。 音画同出我们主要 focus 在人物的这个说话和表演上 。

那为什么 focus 在这个场景也比较直接 ， 就是因为其实我们去看在就模型有音画同出能力之前 ， 大多数模型都只有画面 ， 对吧 ？

然后那这个时候有几个观察 。 第一个观察是它在这个阶段主要能够满足的场景还是如果我们去看一个叙事片子的制作 ， 它主要是能满足包括一些空镜啊 ， 然后就是传统意义上大家理解的那些 B 肉 ， 就是那些场景 ， 就是空镜转场 ， 就类似这样的场景 。

当然它本身也还可以满足一些 ， 比如说 for 视觉向的画面生成 ， 那这个是非常直接的利用场景 。 但是对这些叙事场景里 ， 它本质上只能满足 B 肉 。

那为什么 A 肉不行呢 ？ 是因为首先 A 肉里有非常多画面都是人物 ， 第二就是人物在里面出现的时候 ， 很多时候就是有情绪表演和说话 ，有非常大比例是这样的 。

但是当你只生成画面的时候 ， 你的人物其实是整体看起来非常假的 ， 特别是如果你先去生成一段画面 ， 然后再用后置的这种 lip sync 去对口型 ， 对 ， 你就看起来它很怪 ， 很假 。其实很多时候大家也说不上来它到底有什么问题 ，但是它就是很难跨越普通人对一段视频的那个消费门槛 ， 很难跨越那个恐怖谷 。

就基于这样的观察 ， 就是也包括我们和很多做叙事内容的行业的从业者 ， 包括一些短剧公司做 AI 短剧的人， 就是你去问他们 ， 比如说你们觉得现在整个模型侧最大的卡点是什么 ， 大家非常大比例第一个回答这个问题的都是说人物太假 ， 演员没有表演 。

所以基于这样的观察 ， 我们就觉得首先从需求出发 ， 就是大家消费的绝大多数视频里 ， 超过一半的画面可能更多都是人。

但是现有的视频生成模型里 ， 人物的表现力也是非常差的 。 那所以怎么样能够解决这个问题 ， 我们就从这个需求点出发去思考说 OK， 那我们应该把人做好 。

那怎么把人做好 ， 你就要去思考说 OK， 大多数出现人的场景里 ， 可能人物都是有说话的 ， 那我们就把这个最高频的场景先预结好 。

所以这个作为我们最开始的出发点 。

**曼祺** [1:09:14]
这个在 9 月份的时候 ， 就是把这个作为你们这一代模型的出发点 。

**曹越** [1:09:18]
对 ， 今年年中的时候吧 。

**曼祺** [1:09:19]
年中 。 那其实这个和现在 Sora 2 呈现的这点上， 我觉得是挺相似的 。

**曹越** [1:09:23]
对对对 。

**曼祺** [1:09:24]
它那个 Cameo 的核心就是人物 ， 然后说话 。

**曹越** [1:09:28]
是的是的是的 。 对 ， 所以这个部分是我们觉得在那个时间点一个非常关键的洞察吧 。

**曼祺** [1:09:34]
你觉得在那个时间点这个洞察是行业里其实大家都大概是能看见 ， 还是说那会儿这是一个选择 ，是个判断 ，不一定大家都把这个当重点 ？

**曹越** [1:09:42]
首先就是现在从结果来看 ，并不是大家都把这个当重点 ， 我觉得这个肯定是 。 那我觉得这个一定程度上也体现了说你到底是一个从需求出发去思考问题 ， 还是绝对的以技术出发去思考问题的一个视角 。

我觉得在那个阶段我们还是认为说 OK， 我们应该更多的从需求出发去思考 。 这个时候你就去看这些需求点里哪些是最刚性 ，并且有可能可以被解的 。

对于我们这样组织来说 ， 最核心的点就是说只要我们真的能够跟用户在一起 ， 然后去了解他的需求 ， 那么这个时候其实如果你本身拥有这个技术判断 ， 对吧 ？

你知道什么是可实现的 ， 什么是不可实现的 ， 什么实现起来更难 ， 那在这个阶段你就相对而言更容易找到需求和 model 的 fit。

**曼祺** [1:10:27]
所以这是一个点 ， 就是你们也是一个音画同出的 ，而且是比较聚焦在就人物的这个说话上 。

**曹越** [1:10:32]
对对对 ，是的 。

**曼祺** [1:10:33]
还有其他的特点吗 ？ 你们这个新的模型 。

**曹越** [1:10:35]
对 ， 还有一个特点就是因为我们的场景比较聚焦 ， 所以这个模型本身就是生成视频的价格是比较便宜的 。

**曼祺** [1:10:42]
成本 。

**曹越** [1:10:42]
成本是比较低的 。 因为我们觉得现在在很多场景里 ， 实际上如果你做一部短剧 ， 就是 AI 短剧 ， 即使现在表现还不太好的情况下， 它可能在国内啊和实拍之间的那个成本差距并没有那么大 。

**曼祺** [1:10:54]
你肯定知道这个行业的一些情况吧 ？ 比如说如果实拍一集是多少钱 ， 如果用 AI 做一集的话 ， 就之前成本比较高的情况下是多少费用 。

**曹越** [1:11:03]
这里大概的情况就是之前实拍最早的时候可能比如说 10 万左右一部 。

**曼祺** [1:11:08]
一部的话是多长时间啊 ？

**曹越** [1:11:10]
可能 60 到 100 分钟吧 。 后来这个成本就卷起来了 。 我说这个 10 万左右可能都是 21 年左右的那个价格了 ， 然后到 23 年的时候这个成本其实就卷起来 ， 大概就在三四十万一部了 。

中间可能还有更高的时候 ，但是现在好像也回落一些 ， 就大概在这个区间 。 现在如果用 AI 去做的话 ， 可能单分钟是在 2000 到 5000 这个区间 。

所以实际上它如果是 60 到 100 分钟 ， 可能也在 20 万人民币左右的这个区间 。 但是这里最大的挑战就是它现在即使你的成本是这样 ，但是它生成出来的质量并没有办法和实拍真的 compete。

可以理解为就相当于是 AI 短剧 ， 特别是这种偏实拍类型的短剧 ， 还没有迈过一个用户的消费门槛 。

那这里可能的前置的原因就是包括刚才提到的它的人物的表演是不够好的 ， 然后其实还有一些别的类似的需求 ，但是我们觉得人物表演可能是这里面最关键的一个需求 ， 所以我们要率先把这个问题解好 。

**曼祺** [1:12:06]
那在你们当时做的时候 ， 你们的思路倒还并没有是说在模型里直接把分镜和叙事做进去是吗 ？

**曹越** [1:12:12]
对 ，是的 。 坦率的说 ， 我觉得在看到 Sora 2 之前 ， 对我来说我并没有意识到实际上你应该把叙事做到端到端的模型里 ， 或者说我并没有意识到应该在这个阶段做 ， 可能还需要更长时间 。

我觉得之前的认知是如果你要做一个 C 端的视频类型的产品 ， 可能在那个阶段还是会考虑叙事这个部分是不是应该用一个额外的 agent 模型来去帮助它解 。

所以这个至少是在之前的思考锚点 。 但是 OpenAI 它相当于是至少在 10 秒的这个尺度下 ，但是我的感觉是从 10 秒扩到二三十秒 ， 它并不是一个就技术上多难的事 。

所以在这个尺度下， 它真的让一个模型可以直出叙事的内容 ，但也有可能它前置有一个 language model 先把 script 写好 ， 完全有这种可能性 。

因为就至少现在大家使用体验是有时候你写细了反而效果不好 。

**曼祺** [1:13:03]
是的 。 对 ， 我就有这个感觉 。

**曹越** [1:13:05]
反而你让模型自己发挥 ， 可能效果会更好一点 。 这个还是有可能它内部至少有点像是可能那个 script 写得好坏 ， 可能它还是有一个类似 language model 去发挥的 ，但这个具体他们怎么实现的就不知道了 。

本质上我觉得首先是他们最强的模型可能大家还没有使用吧 。 因为从我自己的视角 ， 就是他们真的是为这个 C 端产品去定制化了一个模型 ， 比如说在很长一段时间大家都只能生成 360P 的视频 ， 对吧 ？

这个对于专业创作者来说可能是不能想象的 。 就是大家可能你低于 1080P 我都不想用 ，但是如果是 for C 端 ， 那最大的一个困难就是你怎么能 cover 成本 。

所以如果你这个模型本身不是那么大 ， 然后能够让很多人都玩起来 ， 那可能它就要去思考 C 端的需求是什么 。

可能大多数 C 端需求是 for fun， 我并不需要它清晰度那么高 。 而且这里还有一个我觉得大家容易忽略的点 ， 就是说当模型可以音画同出的时候 ， 你是 360P 的视频还是 1080P 的视频 ， 只是画面有质量下降 ， 声音并没有 。

它的声音可能和 1080P 的声音是一样的 。 那这个时候一旦它可以音画同出 ， 这个时候它的声音质量其实是保得非常好的 。

那换一个视角就是如果声音是你沉浸感里非常重要的一部分 ， 这个部分其实没有那么大幅度的被削弱 。

**曼祺** [1:14:21]
而且我觉得它为了这个 C 端定制的速度也很重要 。

**曹越** [1:14:24]
对 ，是的 。

**曼祺** [1:14:25]
其实它现在这个速度作为用户我是觉得有点慢的 ， 比之前的一些产品要快 ，但我还是觉得有点慢 。

**曹越** [1:14:30]
是的是的 。 它大概生的一个视频可能在小几分钟 ， 一分钟到三分钟这个区间 。 所以这个部分应该也是对 C 端而言是一个还挺痛的一个点 ， 就是大家能不能玩起来 ， 可能对分辨率要求没那么高 ，但是越高越好 ， 然后你的生成速度要足够快 。

如果你能够 10 秒的生成一个 ， 那肯定和一分钟的体验是完全不一样的 。

**曼祺** [1:14:49]
我觉得它要是 10 秒能生成一个 ， 我可以多做 10 倍了 。

**曹越** [1:14:52]
不过他们现在也已经卡了单日的生成 budget， 从一开始的每个人生成 100 条 ， 到现在降到每个人一天只能生成 30 条了 。

**曼祺** [1:15:00]
因为它现在这个产品是完全免费的 ， 就它自己一直在花钱补贴相当于 。

**曹越** [1:15:04]
但是这个部分我觉得成本可能还不是最大的问题吧 。 我觉得换一个视角就是如果它真的能留住用户 ， 对吧 ？

就它留存真的能做得不错 ， 那后续就是这个成本问题还是有很多办法可以解的 。 有很多大的 C 端产品在早期阶段都是非常花钱 ， 非常烧钱的 。

对 ，但是后期的商业化其实最终大家都找到了合适的这个路径 。

### 用户与C端

**曼祺** [1:15:27]
因为就是你们做第二代模型的时候 ， 你也讲到就是你觉得你们要更多从需求出发 。 那你们这个模型 ， 你们想服务的人是谁 ？

**曹越** [1:15:35]
我觉得现在这个模型实际上就有两类可以服务的人群 。其实我们最开始去思考这个问题的就是说我们去看整个视频创作链条里还有什么问题没被解好的 。

所以它天然就对于这些叙事场景 ， 就是需要人物表演的场景的这些创作者 ， 我觉得这个就是它天然最适合服务的场景 ， 就包括 AI 短剧的公司 ， 对吧 ？

这个是第一个大的品类 。

**曼祺** [1:16:01]
这是一些比较专业的创作者 ， 相对专业的 。

**曹越** [1:16:04]
对 ， 相对专业的 。 然后实际上可能就虽然说人物拥有了 ， 就有点像当你的视频里人物的表演是非常强的 ， 它可能不止在叙事场景下有用 ， 它可能对于很多投放素材 ， 比如说即使你要去做一个事物的讲解 ， 那这个人有表现力肯定也比没表现力要好 。

**曼祺** [1:16:22]
对 ， 它所以有些广告啊 ， 什么宣传片也是会用到 。

**曹越** [1:16:25]
对 ，其实也是可以有用的 。 就所有出现人物的视频片段都是有可能可以用这个模型产生出来更有表现力的人物 ， 包括他的说话和表演的视频的 。

对 ， 所以这个肯定是第一个比较大的品类 。 那第二个比较大的品类 ， 刚才其实也讨论到了 ， 就是 Sora 2 它其实 to C 嘛 ， 就是我们的模型出来之后 ，其实我们在公司内部已经玩了一段时间了 。

因为当你发现这个视频可以音画同出的时候 ， 它对普通人而言还真的是挺有趣的一个 for fun 的工具 。

就有点像要在群里面 ， 都是大家在聊天的时候 ， 就是我说一句你说一句 ， 对吧 ？ 然后很多时候就更进一步偏娱乐化场景 ， 就是我们可以去发表情包 。

但是你在那个阶段也挺难定制一个表情包的 。 很多时候就是你兜里面可能有 20 个常用表情包 ，有的时候在更新它 ， 然后这个时候你在这个场域下就可以用一些表情包 ， 然后让大家觉得很有趣 。

但是当你真的可以生成出来一个人物音画同出的这么一个视频内容的时候 ， 实际上在这个场域下你就可以逗视频了 。

对 ， 就是可能之前你需要一段话来去表达的 ，但是话有的时候你的情感表达没有那么充沛 ， 对吧 ？ 然后这个时候你就可以去生成一个视频片段 ， 然后跟它在这个过程中来 play。

这个过程就我们发现对普通人而言是很容易玩起来的 。 所以这个天然就是一个 for 社交传播的场景 。

**曼祺** [1:17:45]
那你们要做相应的产品吗 ？

**曹越** [1:17:47]
这个的确也是我们在考虑的 。

**曼祺** [1:17:49]
因为你们其实这个新的模型的发的时间是你们之前就定好的嘛 ， 然后刚好赶上就是在 Sora 之后 。

你觉得这个整体来说对你们是一个好的影响还是不好的影响 ？

**曹越** [1:18:00]
我觉得整体来讲还是一个比较好的影响 。 就是我的感觉是让大家真正意义上意识到音画同出这个能力对于视频生成这个方向的重要性 。

我觉得这个就相当于是对这个方向和行业都还是有很大帮助的 。

**曼祺** [1:18:13]
那对你们的决策一些具体影响了 。 你刚才说到一个就是你们在考虑要不要做一个比如说给普通人用的这样的产品 ， 甚至它有可能会是一个 app 的形态 。

**曹越** [1:18:22]
对 ， 我自己的感觉就是说其实在 Sora 2 出来之前 ， 我们就在讨论这个事情 ，因为它真的太自然了 。 我们在内部还举办了一些什么逗视频大赛 ， 然后就在这个地方给大家颁奖 。

就是它的可玩性真的比较高 。

**曼祺** [1:18:35]
我想知道得了冠军的人是做了一些什么样的视频 。

**曹越** [1:18:37]
我们有不同类型的奖项 ，有什么最具电影感奖 ， 还有这个一定火奖之类的这种类型的不同的奖项 。 主要是它的门槛的确是非常低的 ， 就是你只需要给一张图片 ， 然后这个时候你只要输入一段台词 ， 然后给它说这段台词的情绪啊什么的 ， 它就能够真的非常具有表现力的表达 。

所以当时我们在考虑这个是不是应该把它作为一个 C 端玩法让大家玩起来 。 而且当时我们也考虑如果要做 C 端 ， 肯定要降分辨率 ， 就你做 270P 或者 360P 可能就够了 。

因为比如说在微信里做传播的时候 ，其实也不需要那么高分辨率的视频 。 所以这个是在 Sora 2 出来之前 ，其实我们就在讨论的 。

**曼祺** [1:19:15]
那你们现在的结论是什么 ？

**曹越** [1:19:17]
就是这个的确是 in plan 的 。 但是我们在 10 月 11 号发布的这个产品 ， 本身就是我们先去把这个模型能力展现出来 ， 让大家可以比较充分的试用和体验的这么一个产品 。

然后更到 C 端 ， 它本质上就是它很有可能是个 app， 对吧 ？ 但我觉得这个定位就需要花更多时间去把它打磨清楚 。

然后很多时候它也是一个从模型到产品的端到端设计 。 我觉得 OpenAI 还是给大家提供了很多思路的 。

**曼祺** [1:19:42]
因为我觉得 OpenAI 来做这件事 ， 它可能还有一个影响 ， 就是我觉得会让特别大的公司也来做这件事 。 就我指的是这些在这个领域投入比较多的超级巨头 。

你觉得这个会对你们有影响吗 ？ 比如说如果你们最开始就没有 Sora 2， 随便乱说啊 ， 比如说你们的可以用来逗视频的这个 app， 它可以先自己为所发意一段时间 ， 那现在可能所有的巨头都会跑来卷这个东西了 。

**曹越** [1:20:05]
我觉得整个视频方向还是非常受大家重视的 ，其实还挺难为所发意的 。 但是我坦率说 ， 我觉得大公司也看起来投入是比较大的 ，但是动作也没有那么快 。

我觉得这里还是有很多机会和空间的 。 对 ， 然后但是换一个视角就是到底 Sora 2 展现出来的是不是一个真的 C 端平台机会 。

我觉得这本身也是一个非常值得思考的问题 。 当然可能对于大多数特别有钱的大公司而言 ， 它可能不需要思考这个问题 ， 对吧 ？

我看到机会我就砸钱就行了 。

**曼祺** [1:20:33]
对 ，因为刚好前段时间我跟 Lavart 的圈媒也聊了下嘛 ， 然后 Sora 2 出来之后我又跟他聊了一下 。他的一个逻辑就是这个东西哪怕只有 10% 和 20% 的机会 ，但是对大厂来说他会觉得我如果不投入的话 。

**曹越** [1:20:46]
他会 FOMO。

**曼祺** [1:20:46]
对 ， 我错过的代价是会特别大的 。

**曹越** [1:20:49]
对对 ，因为他们本身是很有钱的嘛 ，他们的资金成本很低 ， 所以对他们来说就是看到机会就冲就完事了 。

但是我自己的感觉是能不能出现新的 C 端平台 ， 可能还是有两个比较直接的条件 ， 一个是到底是不是一种新的内容形态 ， 另外一个就是到底有没有新的这个渠道 ， 就是这个传播链路 。

所以我自己的感觉是现在看还是有苗头 ，但是距离真的这个 C 端平台长什么样 ， 我觉得看起来还是有挺大的不确定性的 。

**曼祺** [1:21:21]
那用你刚刚说这两个条件来看 Sora 的话 ， 你是怎么看的了 ？ 一个是内容形态 ， 一个是渠道上 。

**曹越** [1:21:26]
我觉得现在还没有看到它在这两个部分有非常大颠覆的可能 。 就是到现在为止吧 ， 现在 Sora 2 可能还是更像一个工具 ， 对吧 ？

就是我做好视频之后， 它大多数人还是会把这些视频发布到朋友圈 、 小红书 、 抖音 、 视频号 ， 对吧 ？

就快手或者这些地方 。 所以有点像是它能不能真的立足成为一个平台 ， 还是跟就是本质上当你不是一个新内容的时候 ， 我做好这个内容就可以去这些平台发 。

那这个时候它存在的价值还是工具属性更强 ， 还没有看到它是一个 C 端消费级平台的这么一个体现吧 。

就有点像是当你做出来还是一个 10 秒的视频的时候 ， 那我为什么不去这些平台发 。

**曼祺** [1:22:07]
那你会观察哪几个指标的变化去看它未来有没有可能真的就是立住成为一个 C 端的平台 ？

**曹越** [1:22:13]
我觉得这里最关键的还是留存吧 ， 就是它实际上到底满足了哪一部分人的相对长期的刚需 。 那我觉得留存这个指标还是最关键的 。

然后特别是在早期 ， 可能你也不一定真的要那么多用户 ， 或者说短期来了很多用户 ， 还是帮助你可以更快的找到你这个形态里适合的那群人。

我觉得这个是比较重要 。 但是它能不能成为一个 C 端的大平台 ， 我觉得这个现在应该没有人有答案 。

**曼祺** [1:22:42]
它现在还是一个非常天然的社区的状态 ， 就是它对创作者其实也没有什么激励 ， 除了点赞和有人 remix 你的东西 。

你会收到一个通知这种 。

**曹越** [1:22:50]
对对对 ，是 。 我觉得对他们来说就是还是有挺多问题要解的嘛 ， 就包括他们现在去 limit 你的每天的创作的个数 ， 对吧 ？

我觉得还是本身就跟它现在成本还是高度相关的 。 对 ， 就是视频 ， 视频哪怕你是一个 10 秒的视频 ， 实际上它生成成本也是非常贵的 。

它其实比语言模型可能还要更贵一些 。

**曼祺** [1:23:11]
就是从 Meta 我理解它是比较一个创新技术驱动的方法 ， 然后到你说你们现在是非常去强调我从需求去出发 ， 然后我需求和模型的训练做更深的结合 。

### 垂直整合

**曼祺** [1:23:23]
你可以讲下这个转变是怎么发生的吗 ？

**曹越** [1:23:25]
我觉得这个转变的核心 ， 我们自己的感受是相当于对创业公司来说比较重要的还是你要跑通这个 PMF， 对吧 ？

就你要跑通第一曲线 。 然后如果你过于强调技术驱动的话 ，有可能你很难做到技术和需求的 fit。 对 ， 所以这里怎么去平衡好技术侧的迭代和就是你从需求出发去满足需求 ， 我觉得这个部分是最困难的部分 。

就是如果你完完全全只从需求出发去做迭代的话 ， 那么有可能你的技术是落后 。 有点像是你既要在技术侧保持一定程度上的先进性 ， 又要做出来的东西是在这个阶段有业务意义的 。

这个是实际上你在 balance 这件事情的核心的优化的这个方向 。

**曼祺** [1:24:13]
你对 Meta 本来的期待是什么呀 ？

**曹越** [1:24:15]
我觉得在那个阶段 ， 我们一开始去做这个事情 ， 肯定还是希望它能够给公司带来业务上的价值的 。

但是因为它发布的相对比较晚 。

**曼祺** [1:24:23]
就是说有用户是吗 ？

**曹越** [1:24:25]
对 ， 最终能带来商业化价值吧 。 我觉得在那个阶段它因为本身还是个非常新颖的这个技术路线 ， 一方面在技术侧还是有很多好评的 ， 包括在那个阶段刚好是 iClear 开会期间 ， 虽然我没去啊 ，但是就是后来了解到他们其实在开会期间还是有非常多关于 Meta 的讨论的 ， 就大家在线下的时候 。

所以在技术圈肯定有很多传播 ， 包括我们的 GitHub 上其实也有很多 stuff。 对 ， 那另外一侧就是因为有很多人受到这个吸引 ， 所以他们关注到了这个方向 。

所以最开始还是整个用户侧有个几十万的这个注册用户吧 ，但是在那个阶段没有带来明确的商业化的数字 。

**曼祺** [1:25:04]
这个跟你开始想的是不一样的是吗 ？

**曹越** [1:25:06]
我觉得最开始那个时间点对这个部分的认知也还是不够明确的 ， 就是还是不够闭环的 。

**曼祺** [1:25:11]
所以其实这个东西的反馈 ， 它是会让你更深的去思考你刚说那个 PMF 到底怎么实现的问题 。

**曹越** [1:25:16]
是的是的是的 ， 就这个 feedback。

**曼祺** [1:25:18]
对 ，因为 PMF 这个事就大家老是讲 ， 就从 23 年开始就是一直在讲 。

**曹越** [1:25:22]
这里其实有一个很大的难题 ，是因为在这个阶段本质上是技术驱动的一个时代 ， 然后真正懂 PMF 那群人， 大家都是就比如说他是产品经理 ， 或者反正之前是做产品或者商业的这群人， 然后他们也要花时间去理解模型到底是怎么回事 ， 模型能力边界 ， 模型到底往哪个方向发展 。

那对于做模型的人而言 ， 那可能他之前不一定花过那么多时间去做业务和理解业务 ， 特别是最 top 的那批人。

然后呢 ，在这个阶段 ，他们也需要去花时间去学习怎么做好产品 ， 怎么做好商业 ，有这么一个过程 。 所以有点像是两边都得去弥补另外一边的那部分 know-how， 这样才能帮助一家公司就跑得更好 。

那对我们来说就是我自己还是要花很多时间去跟各种样的人交流 ， 去学习说到底产品化 、 商业化 ， 然后包括组织怎么做 。

那到现在为止 ， 我自己的认知就是我觉得这里就是需要有一个更端到端优化的一个组织 ， 就是一个垂直整合的组织 。

**曼祺** [1:26:19]
你比较密集去学习这个在什么阶段呢 ？

**曹越** [1:26:22]
我觉得创业之后就是在非常密集的学习 。 就当比如 Meta 发布 ， 它其实还是有个非常明确的 feedback， 对吧 ？

然后你知道说 OK， 这个部分里哪一部分做得不错 ， 哪一部分做得不够好 ， 然后你怎么样能够在这个部分就你学到了什么 ， 下个阶段你该怎么调整 ， 然后调整之后你再进行下一次的动作决策 ， 然后再得到 feedback。

对 ， 我觉得就是它有两个层面的 。 就一个层面是当你跟人去交流的时候 ， 它能给你带来很多 ， 比如框架层面的就是产品大概应该要怎么做这些东西 ，但是具体到你当前公司侧应该去怎么做 ， 我觉得这个部分其实你还挺难直接从谁那学到的 。

**曼祺** [1:27:02]
因为这个得要你自己体验 ， 这是体感的东西啊 。

**曹越** [1:27:05]
是的是的 ， 所以就是框架侧的东西其实还是可以相对快的去学到 ，但是更细颗粒度的东西 ， 我觉得这些东西就是真的要花时间一点点去学 。

那当然这里就包含了就是你可以跟比如说比较厉害的成功的 founder 向他们学习 ， 然后也可以和跟自己差不多的就现在在这个大方向上还一直在训练和打磨的这群人向他们学习 。

然后还有最直接的就是比如 AI 视频这个领域到底是和哪些产业有高度的结合的这个可能性 ， 要和这些产业里面的人做很深度的交流 ， 然后持续性的跟他们交流 。

然后这样的话你能知道说 OK， 比如说短剧赛道到底是怎么回事 ， 短视频赛道怎么回事 ， 广告行业怎么回事 ， 然后 C 端到底是怎么回事 ， 然后你在这个阶段到底是应该往哪个方向去做 ， 比如说 Sora 2 出来 ， 那社交到底是怎么回事 。

你可能之前都已经对这个东西有相对比较深刻的理解了 ， 只不过这个事情出来之后， 你就明确的能快速 get 到这个链路到底是怎么回事 。

**曼祺** [1:28:08]
那可以讲讲你们具体的变化 ， 比如说你自己是怎么变的 ， 然后你们团队是怎么变的 。 就是从之前的状态到现在这个你说的更端到端的产品到模型打通的这个状态啊 。

**曹越** [1:28:19]
这个变化它最核心的还是组织侧的 ， 就是相当于是你从组织侧搭建起来这个从首先模型侧的体系 ， 然后到产品研发体系 、 运营体系等等 ， 然后就把大家 remix 起来 。

**曼祺** [1:28:32]
你们以前是怎么样的 ， 你们现在是怎么样 ？

**曹越** [1:28:34]
我觉得最开始肯定是在产运侧认知是比较不足的嘛 ， 那后续就是把这个部分的首先是团队搭建起来 ， 然后另外就是说它和模型侧有更深度的交流 ， 对吧 ？

就是首先你要在组织里面告诉大家说这种交流是非常有必要的 ，也让大家有一些更多交流吧 。 比如说你认为最关键的一些人， 可以直接让他们去 organize 一些他们之间的 one-on-one， 让他们之间平时就有更多的交流 。

另外就是说可以有一些相应的会 ， 就是让比如说产品的同学和模型的同学有机会一起交流 。 那另外一点就是我自己本身也可以成为一个很重要的分发中心 ， 对吧 ？

就是因为我可能是作为一个算法背景出身的人 ，但是我自己绝大多数时间可能都花在产品运营这个部分 。

**曼祺** [1:29:20]
你说的就是四五月之后的情况是吗 ？

**曹越** [1:29:22]
就今年吧 ， 我觉得今年基本都是这样 。

**曼祺** [1:29:24]
产品运营啊 。

**曹越** [1:29:24]
对对对 ， 然后在这个部分就花更多的时间去跟大家对齐上下文 ， 然后就有点像是这些人至少跟我的上下文是非常对齐的 。

对 ， 然后呢 ， 组织里有更多的算法同学也可以和他们对齐 ， 然后呢 ，他们也需要花时间去和算法同学去对齐 ， 去理解各种各样的模型到底是怎么回事 。

我觉得这个是一个从组织里最核心的 ， 就是让大家的认知可以更容易的对齐 ， 然后把不同背景的人放在一起 ， 然后让大家去 remix。

**曼祺** [1:29:54]
这个倒并不涉及什么组织结构上的调整是吗 ？ 因为你们其实可能本身人也相对比较少 ， 现在几十人的体量 。

**曹越** [1:30:00]
是的是的 ， 从组织结构层面我觉得就还好一点 。

**曼祺** [1:30:05]
主要是反正你们都在北京办公 ， 就是这个氛围 ， 就是创造一个大家要密集交流 ， 然后在一起的这个氛围 。

**曹越** [1:30:10]
是的 ， 我自己理解的垂直整合就是说组织里有更多的人， 就越来越多的人。 他能够比如说做模型的人 ，他理解产品和运营 ， 那做产品的人 ，他理解模型和模型未来的发展趋势 。

对 ， 我觉得这个就是大家就最关键的要对齐的部分 。 然后它有的时候就变成了说 ， 就当大家之间的交流非常密集的时候 ，因为如果它就是两个组织 ， 那其实大家的那个交流带宽是非常非常小的 。

那如果大家可以就非常自由的去交换信息的时候 ， 那么这个时候可能从产品侧他说我可能有 ABCDE 这各种各样的需求 ， 哪些需求是模型侧好做的 ， 哪些需求是模型侧没那么好做的 ， 它是需要下一代模型才能实现的 ， 还是我们只需要做一些迭代就可以实现的 。

我觉得这些方面都是因为你的组织里大家的这个 context 比较容易对齐 ， 然后大家的 context 对齐效率更高 ， 使得大家本质上虽然是不同层级的人 ，但是大家之间的合作是被更紧密的整合在一起的 。

所以这个是我们在学习和迭代的这个组织能力 。

**曼祺** [1:31:17]
在你这个新思路下， 你怎么看模型级产品啊 ？

**曹越** [1:31:19]
我觉得最早大家去说模型级产品的时候 ，其实是想说就传统意义上的产品运营侧不要雕花 。

**曼祺** [1:31:25]
我觉得它很容易被理解成就是产品运营你不要做一些太多的事 ，但我不知道这个理解对不对啊 。

**曹越** [1:31:31]
对对对 ，有点这种感觉吧 ， 就是产品的运营要听模型的 ， 稍微有点这种感觉 。 然后我自己的感觉是的确有一点点比例层面的影响 ， 就是在特别早期的时候 ， 它可能这个产品就是为了展现模型能力了 。

对 ， 然后你怎么样能够最大化的展现模型的能力 ，而不是我要在这个过程中加入很多产品侧的先验 。

我们就以比如 Sora 2 里 Cameo 这个能力为例 ， 我觉得这就是一个非常好的垂直整合的案例 ， 就是它是一个首先能够做出 C 端可消费内容 ， 另外就是说你可以把人植入进去 ， 对吧 ？

那下一步变成这个人植入进去怎么做成一个 C 端的 feature， 这里就一整套围绕 Cameo 的 C 端的打法 。 我可以做熟人之间的关系 ， 你可以把熟人之间的这个 add 的功能做进去 ， 非常低门槛 ，并且通过邀请码来建立熟人之间的关系 ， 对吧 ？

就是因为你的邀请码可能就分发给你的朋友们 ，他通过你的邀请码去进入到这个 app 的时候 ， 你们之间天然就有一个关注关系了 。

所以在这个维度上， 它就相当于围绕 Cameo 这个能力做了很多产品的迭代 。 我觉得这就是一个很明确的 ， 首先你模型侧可以展示这个能力 ， 然后产品侧也需要最大化的去放大这个能力 ，他们之间是一个互相放大的关系 。

**曼祺** [1:32:49]
嗯 ，但这就不是最开始一些人理解的模型级产品的那个感觉了 ， 已经往前又进了一步了 。

**曹越** [1:32:55]
对对对 ，是的 ， 我觉得这个还是跟阶段有关的 。 就在那个阶段 ， 大家可能还是最大化的在去做模型侧的迭代 ， 然后这个时候产品侧可能总想比如说 drive 着这个模型去走啊或者什么的 ，但实际上可能模型还在一个基础迭代的阶段 。

然后呢 ，在这个阶段 ， 实际上产品过多参与其实对模型不一定是好事吧 。 但是我觉得到一定阶段 ， 包括语言模型到现在这个阶段 ， 我觉得实际上你的产品做的到底是不是好用 ， 这也是有很多可以迭代的部分的 。

**曼祺** [1:33:24]
嗯 ， 包括你是不是有一些新的交互方式 ， 就像你刚刚说的 ， 就 Cameo 这种新的交互方式 ， 它能放大模型的能力 。

**曹越** [1:33:31]
这个就是我认为实际上垂直整合能够带来的特点吧 。 有点像是我产品侧想做一个什么 feature， 这个 feature 它可能和我现在这个产品的定位是非常高度相关了 ， 那模型侧到底能不能做到这一点 ， 通过什么样的方式能做到这一点 。

这个时候大家之间可能并不是一个说 OK， 就是我提个 proposal 你去实现 ，而是说大家多次碰撞 ， 最后碰撞出来的一个结果 。

那这个多次碰撞其实就是垂直整合 ， 可能就是有很懂产品的人 ，他也能大概明白模型到底怎么回事 ， 很懂模型的人 ，他也知道产品大概怎么回事 ， 然后大家就在充分的讨论和交流 ， 最后拿出来这么一个方案 。

**曼祺** [1:34:06]
那当你们有了这个新的做事的方法之后， 就是在你们这个新的模型 ，而且它肯定也会有一个对应的新的产品嘛 。

就是在你们这个新的这一代的模型和产品上， 比如说技术和产品都分别有什么变化呀 ？

**曹越** [1:34:18]
最主要还是组织侧的 ， 就是说你对外的变化是组织变化带来的产品侧的体现 。 对 ， 就有点像是假设比如说模型侧 ， 产品侧告诉你说我们现在最高优的是什么 feature， 对吧 ？

那模型侧就应该第一时间的去跟他对齐这个 feature 的重要性 。

**曼祺** [1:34:34]
就我理解这个根源是组织变化 。 我想问的就是它表象 ， 就是说它体现上的这种变化 ， 比如说技术上， 你们之前 Meta 它是一个自回归的模型嘛 ， 那现在这个新的模型它还是这个方向吗 ？

还是说它是有一些变化的 ？

**曹越** [1:34:47]
新的模型的核心就是我们觉得首先它是去解决能够生成对于人物说话和表演表现非常逼真的这个视频内容的这么一个模型 。

**曼祺** [1:34:56]
就是这是它的目标 ，不是说我搞个什么新的技术是它的目标 。

**曹越** [1:34:59]
大家是被这个目标 drive 着的 。 那另外一点就是当这个目标出现的时候 ，有什么样的 feature 是特别重要 。

我举个例子 ， 实际上在很多场景里 ， 大家非常需要的就是保 ID 的能力 。 就当 VEO 3 出现之后， 大家最需要的就是说你怎么把这个人物的音色可以保持的比较好 。

因为假设他要在一个短剧里去做内容 ，他可能在比如说 60 集或者 100 集这个主角出现的时候 ，他音色要保得非常好 。

这个样貌和声音的 ID 这个能力 。 对 ， 所以我觉得这就是一种垂直整合的体现 ， 就是大家之间能够对齐优先级 。

**曼祺** [1:35:34]
对 ， 如果更细一点的话 ， 我觉得还有身形啊 、 身材啊这种 。 因为我自己用 Sora 的一个体验 ， 就是因为上面有些我的朋友嘛 ， 然后有的时候他是五官还是比较像的 ，但这个人的身高和这个体型就因为我认识这个人 ，但是就是就不像 。

**曹越** [1:35:48]
是的是的是的 ， 那这个也会导致它可能在不同的场景里会出现 ， 它可能和这个人本质上是不 align。

**曼祺** [1:35:54]
嗯 ， 尤其是这个没有两个我认识的人的时候 ， 就它的这个身高和体型关系就也跟真实的不一样 。

**曹越** [1:36:01]
是的是的是的 ， 这个还是挺 make sense 的 。 所以这个就是一种 ， 就是你在组织里当你要去对齐某个需求的时候 ， 那这个需求里到底它重要的是什么 ，不重要的是什么 ， 然后大家怎么在组织里更核心的对齐这个目标 ，并且实现这个目标 。

如果它是一个纯产品公司 ， 它只能通过调 API 无法实现 ， 我觉得这个是就是垂直整合的最关键的要素 。其实我们去看 Claude， 对吧 ，Claude Code 可能对比 Cursor 就是一个更垂直整合的 model， 就 model 也在他们手里 ， 然后产品本身也在他们手里 ，他们就可以 for 产品去迭代优化他们的模型 。

那模型本身有它的迭代优化方向 ，但是他们也可以为产品做一些设计 ， 对吧 ？ 在这个产品 feature 下， 我到底是要用最好的模型 ， 还是我可以在中间有一些能力上的衰减 ， 对吧 ？

然后这个时候它的成本就可以更低 。 那另外一点就是它真的有可能可以迭代出来独特的用户体验 ，而这个用户体验你在其他产品中是体验不到的 。

**曼祺** [1:36:56]
嗯 ， 那具体到你们这次模型之后要发的产品上面 ， 刚才已经讲到就是 C 端的产品也是在计划里的 ， 那你们第一个会发的是一个什么产品 ？

**曹越** [1:37:04]
对 ， 我们第一个会先发一个 web 端的产品 。

**曼祺** [1:37:07]
就是 10 月份就会发是吗 ？

**曹越** [1:37:08]
对对对 ， 然后大家就可以体验了 。

**曼祺** [1:37:10]
那个主要是给更专业的制作者吗 ？ 还是都可以 ？

**曹越** [1:37:14]
我觉得都是可以用的 ，因为它本来就是一个 C 端产品 。

**曼祺** [1:37:17]
那你们最优先的目标用户是谁了 ？ 就这个 web 端的 。

**曹越** [1:37:20]
我们在这个阶段就最开始的目标还是希望有更多人进来使用 。 我觉得它很多时候也是一个 fit，有很多产品都是你可能一开始认为你的用户是 A，但实际上你来了之后发现它可能是 A 和 B 之间区间的一些人群 。

所以我觉得最开始的目标还是让尽可能多的人来体验这个产品 ， 那我们去观察它留存的用户到底是哪些人， 再去往前迭代 。

但是明显有一些场景它是可以落地的 ， 就包括比如说 AI 短剧这些方向 ， 然后还有 C 端的玩梗的这些需求 ， 我觉得这也是一些明显可以直接落地的场景 。

**曼祺** [1:37:53]
嗯 ， 除了就是你们公司内部的人有试用以外， 你们有和一些这种潜在的客户或者用户就是让他们试用吗 ？

在这个试用过程中间有些什么比较有意思的反馈 ？

**曹越** [1:38:04]
我们才刚刚开始内测嘛 ， 内测了之后， 就是我觉得大家的直接反馈都还是说他在这个人物的说话和表演里还是真实度是非常非常高的 。在这个维度上应该就是比较明确的现在 Sora 的模型 。

**曼祺** [1:38:16]
如果说是现在 Sora 模型 ， 那它的权限可能跟 Sora 至少是差不多的 。

**曹越** [1:38:20]
我觉得就是有一些能力的呈现上是差不多的 ， 就是刚才说的音画同出的这方面能力它差不多 ，但是 Sora 它是一个在 10 秒内可以叙事的这么一个 case。

对 ， 它有分镜这些 ， 然后这个我们在这个阶段是还没有的 。

**曼祺** [1:38:34]
我指的就是人的那部分 。

**曹越** [1:38:35]
人的那个部分应该表现我觉得至少是差不多的吧 ， 还是有机会表现更好一些 。

**曼祺** [1:38:40]
有机会表现更好是吗 ？

**曹越** [1:38:41]
对对对 。

**曼祺** [1:38:41]
那最后就是想聊聊就是你自己的一些变化 ，其实刚才也聊你的经历也是聊到了一部分 。 你自己其实相当于是从一个研究员 ， 然后到联创 ， 然后再到自己一号位来做 CEO。

### CEO与未来

**曼祺** [1:38:54]
你会觉得就是在这整个过程中间 ， 你什么阶段的变化是最大的 ？

**曹越** [1:38:59]
坦率说我觉得过去两三年的变化都是非常非常非常大的 ， 每个阶段都有每个阶段的变化 。 如果说变化最大的 ， 我觉得还是就当你承担了最大的责任的时候 ， 可能还是变化最大的 。

**曼祺** [1:39:11]
嗯 ， 就还是当 CEO。

**曹越** [1:39:12]
对我来说成长最多的还是就首先向很多人去学习怎么做一个专业的 CEO。 我觉得 CEO 也是有很多专业能力上面的要求的 ， 可能有很多人他不一定感受到 ， 然后我也是在这个过程中逐渐的去学习和迭代的 。

**曼祺** [1:39:29]
那可以讲讲你觉得做到什么才叫专业的 CEO， 或者说哪些素质是一个专业的 CEO 应该具备的 ？

**曹越** [1:39:35]
这个其实我 reference 了之前理想的一个 talk， 大概在应该是 20 年左右吧 ， 它那个 talk 的 title 就叫做 《 如何做一个专业的 CEO》。

那我觉得它也并没有说你应该怎么做什么事情 ， 它就只讲了它在做理想的过程中是怎么思考问题和做事情的 。

就比如说最开始你要先想清楚你做这家公司到底在什么行业 ， 然后这个行业有什么样的趋势 ， 就它的发展趋势和发展节奏是什么样的 。

就比如说我们在 AI 视频这个行业 ， 那现在到底在 AI 视频这个行业里的什么发展阶段 ， 然后在这个阶段里行业的最核心痛点是什么 ， 它可能在不同的阶段痛点是不一样的 ， 你用什么样的方案去解决这个痛点 ， 那这个方案就变成了说它可能是一个整体的方案 ， 就你如果要用这个方案去做的话 ， 你要融多少钱 ， 然后你要做多久 ， 然后

什么时候解决 ， 满足谁的什么需求 ， 对吧 ？ 再往下就变成了说 OK， 当你有了这个方案之后， 你应该怎么去实现它 ， 对吧 ？

那就变成了说公司的战略到底是什么样 ， 当你有前面的这些 context 之后， 我用哪些方法去解决这些痛点 ， 然后在这个阶段抓住什么样的机会 ， 就不同的时间点你应该去抓住什么样的机会 。

**曼祺** [1:40:43]
嗯 ， 那我觉得在这个语境之下， 专业的 CEO 应该是指 CEO 这件事是有方法的 ，是有章法的 ，而不是凭着你的直觉或者热情 ， 或者你觉得你能做到什么去横冲直撞 。

**曹越** [1:40:56]
这个对我来说还是非常有启发的一个框架 ， 它就定义清楚了它这个业务到底是个什么业务 ，以及怎么实现这个业务 。

**曼祺** [1:41:03]
那在有章法的过程中， 因为创业有很多就是你不能预料的事情 ， 包括整个行业或者你们公司内部都有很多就是你无法计划的事情 ， 你怎么去应对这些事情 ？

**曹越** [1:41:14]
我觉得首先肯定要先识别就是它到底是不是噪音 ， 还是努力不要被噪音所干扰 。 但是如果这个行业里的确发生了一些事件 ， 那你需要仔细去思考这个事件到底对这家公司带来了什么样的影响 ， 然后可能你还需要比如说把它就写下来 ， 然后你可能也要去问不同的人， 你觉得他们认为这个事情到底对行业产生什么样的影响 ， 然后最后把这个事件对

公司这个阶段产生的影响可能写到纸上， 最后再基于这样的一些上下文再去做下一步的动作 。 我觉得这也是一种我自己努力在去学习和迭代的方法吧 。

我觉得大多数情况下就有点像是比如 Sora 2 突然就冒出来 ， 这个是一个事件 ， 对吧 ？ 然后呢 ， 这个事件到底对这个行业产生什么影响 ， 那从 24 年 2 月份就是 Sora 出现 ， 到底对这个世界产生了什么样的影响 ， 我觉得是类似的 。

**曼祺** [1:42:04]
我知道除了和人聊之外， 你还很喜欢和大语言模型聊 ， 比如说你和 Gemini 聊的挺多的 。

**曹越** [1:42:09]
对对对 。

**曼祺** [1:42:10]
你和大语言模型聊 ， 就这个过程你怎么学习 ， 或者说你从里面是得到什么 ？

**曹越** [1:42:15]
我觉得我接触了很多人， 好像对于现在世界范围内最强的模型到底达到了什么水平是没有认知和概念的 ， 你可以认为这也算是一种认知差 。

那我最近一次明确的感受到语言模型的强大大概是在今年五六月份 ， 然后当时我们内部在讨论一个 research 问题 ， 就是一个算法问题 ， 然后讨论讨论讨论之后呢 ， 我们内部可能就再做一些讨论 。

当时团队里面就有个同学也跟 Gemini 进行了讨论 ， 就当时 Gemini 2.5 Pro， 然后它甚至能够沿着这个讨论里帮我们补全一些我们自己没有关注到的东西 ，并且最终提出来了一个就真的还算靠谱的方案 。

我觉得那一刻你的感受是非常不一样的 。 就是我们当时开玩笑不是大家都说 vibe coding 吗 ？ 我们那个叫 vibe research， 就它真的像一个 partner 一样 ， 帮你补全了你视野里的局限的一些 context，并且最终真的提出来一个还算靠谱的方案 ，而且它真的在一些数学问题上本身就比大多数人都强 。

所以在那一刻 ， 首先它是一个 aha moment， 对吧 ？ 你明确感觉到比如说世界范围内最强的模型已经非常强了 ， 那这个时候就变成了说你怎么样激发它的这方面的能力 。

首先我自己就开始更多的跟它做一些讨论 。 我发现有几点吧 ， 第一点是人有的时候会做很多联想的思考 ， 比如说你想到了一个事件 A， 然后你去类比事件 B，但是这个时候有个非常关键的就是说类比其实总是很危险的 ， 就它能帮助你去理解一个东西 ，但它总是很危险的 ，因为这两者之间它总是有相似的或不相似的部分 。

我就发现这个语言模型它非常非常擅长帮你梳理两个事件之间的相关的东西和不相关的东西 ，以及它背后的原因 。

它在这方面非常强 ， 比我见过的大多数人都要强得多 。 那在对于这些问题而言 ， 它就能给你非常好的 ， 就有点像是你模糊认为这个事情好像跟另外一件事情有关 ， 它就真的能帮你把这件事情的关系建立起来 ， 然后并且说的很有道理 。

对不对另说 ，但是它一定可以说的很有道理 。 所以在这个过程中， 它就能非常好的帮助你去做很多问题的梳理 ， 比如说我想要去思考一个什么问题 ， 这个时候我基于这个问题有很多散的点 ， 然后我就可以把这些散的点全部都 type 下来 ， 然后 type 下来之后就把它一股脑全部都扔给语言模型 ， 然后让它去帮我结构化的梳理关于这个点 ， 围

绕这个点我能够想到的这些散的点都是什么 ， 然后它就真的可以帮你梳理的非常好 。 这个过程其实它就天然是一个你的思考伙伴 ， 对吧 ？

就你思考一些问题的时候 ， 你发现我们天天开玩笑叫 Gemini 老师 ， 就 Gemini 老师真的能给你很多关于问题一些问题里非常深度的见解 。

那这样的话就意味着你可能每天都需要跟它做非常多的讨论了 。 我没有算过特别平均的时间 ， 可能有一两个小时， 你思考任何问题你都可以跟它进行相对比较深度的讨论 。

**曼祺** [1:45:11]
你是不是信任大模型更甚于信任人啊 ？ 你有测试过比如说同一个观点 ， 如果是一个人跟你讲的 ， 或者是 Gemini 跟你讲的 ， 你会更信后者吗 ？

**曹越** [1:45:21]
我认为有很多人他给你讲的观点也是很有道理的 ，但是呢 ， 这里最麻烦的一点 ， 就我觉得人和人之间最麻烦的是对齐上下文 。

就是当我说出来一个观点的时候 ， 实际上我可能是有非常多的上下文和信息 ，但是我把它压缩到了几十个字说出来 ， 这个时候另外一个接收信息的人他只能收到这几十个字 ，他所有的上下文他都获得不了 。

那这个时候一种方案是我可以让这个人他给我讲半个小时， 讲一个小时， 把这个事情的上下文全部都补齐 ， 对吧 ？

然后对他来说也非常辛苦 ， 那对我来说我可能也会有些压力 ， 对吧 ？ 只是就这个问题光对齐上下文就得花这么多时间 。

但是你会发现语言模型在对齐上下文里是超级强的 ， 就它能够帮助你去补齐 ， 就你可以说哎 ， 这个人他是一个什么背景的人， 然后他说出来一个什么观点 ， 那你就让他去帮你补齐 ， 你觉得他这个观点里背后他是什么原因 ，他能够帮你非常好的快速的补齐这个上下文 ， 然后你能快速 get 到这些信息 。

所以这个并不是说你相信人或者不相信人 ，而是就是它能够大幅度的帮助你降低人和人之间交流的摩擦和帮助两个人快速的去做对齐 。

**曼祺** [1:46:35]
你就说这两个人同时和大语言模型聊 ， 然后同时补齐一些上下文 ，有一些共同的上下文 ，他们再来讨论问题 。

**曹越** [1:46:41]
对 ， 效率会高非常多 。

**曼祺** [1:46:43]
你们就是这么实践的是吗 ？ 你们组织里 。

**曹越** [1:46:45]
实际上是的 。

**曼祺** [1:46:46]
你们是做了一个应用 ， 可以两个人对着 Gemini 问同样的问题 ， 然后它给你 。

**曹越** [1:46:50]
这个倒没有 ，但是因为有点像是你在组织里会告诉大家说它在这个方面非常强 ， 然后实际上大家在工作环境里这种困扰是非常多的 。

可能如果大家是背景相似的人在一起工作还好 ，但如果比如说你要做垂直整合 ， 对吧 ？ 就是你算法的同学和产品同学怎么交流呢 ？

产品同学给你说了一段话 ，但这段话里面可能需要三四个概念 ， 都是需要有背景知识的 ，但是你就是不知道 。

然后这个时候这个产品同学他可能给你打超长的一段才能帮你补齐 ，而且你光看这段文字你还不一定能理解 ， 对吧 ？

然后呢 ， 这个时候最好的方式就把这段截图发给一个语言模型 ， 然后让它去解释这个人到底是什么意思 。

我觉得这个应该在组织里面有非常多人都用这种方法来 bridge 人和人之间的交流的 gap，而且它在这个方面是真的非常出色的 。

**曼祺** [1:47:37]
嗯 ， 反正在你们公司这是很常见的 ， 大家都慢慢有这个习惯 。

**曹越** [1:47:41]
是的 ，是带头的 。 对 ， 大家甚至有时候会开玩笑 ， 就是会说比如说谁谁谁说话大家老看不明白 ， 大家就说哎 ， 看不明白就把它截图发给 Gemini 去想这个人到底啥意思 。

我觉得大多数人可能都没有意识到这个现象有多普遍 ， 就有点像是任何人和人之间的交流 ， 这种 context gap 都是非常大的 。

但是就大多数人没有意识到 ， 实际上是因为你不知道它的上下文 。

**曼祺** [1:48:05]
对 ， 就最近我在看那个 《 不能承受的生命之情 》， 它里面有两章就是讲这个的 ， 里面有两个角色 ， 一个是一个瑞士人， 另外一个人是个捷克斯洛伐克人。

因为他们生长的这个体制是不一样的 ， 所以他们对很多很基础的词的理解就完全不一样 ，但是背后有非常长的 。

**曹越** [1:48:23]
上下文 。

**曼祺** [1:48:23]
对 ， 上下文 。

**曹越** [1:48:24]
是的是的是的 。 我觉得这个是一个就是我现在观察到的其实非常底层的变革 ，但是大多数人可能都还没有意识到 。

大多数人可能就是现在的用法还是比如说我有个问题我跟他讨论 ，但事实上是人和人之间的交流摩擦是巨大的 ， 它能够非常大幅度的提升人和人之间的交流效率 。

我没有看到有很多人就至少意识到说在这个部分时间上有巨大的影响 。

**曼祺** [1:48:50]
那这个部分它也是一个就是有产品化的空间吗 ？

**曹越** [1:48:55]
这个部分我没有 ， 我也认识一些朋友他就比较直接的对它做了产品化 。其实现在有很多产品它是和这个 mindset 是有一些相关性的 ， 比如说有很多做 AI dating app， 就比如说男生可能在 dating 里有一些诉求 ， 对吧 ？

他就把那个截屏发给他说哎 ， 这个女生到底什么意思 ， 对吧 ？ 然后女生可能截一个图然后发给语言模型 ， 然后语言模型帮他解释这个男生什么意思 。

因为可能在这个场合下大家是有明确的对齐诉求的 ，其实还是有挺多产品做 ， 哪怕这个子类都有挺多产品在做的 。

但实际上你放宽了去看 ， 它就是在 bridge 人和人之间的交流 gap。 但是这个跟几件事情有关 ， 首先是跟这两个人的实际上之前的上下文有关 ， 就他到底是比如说他是个算法背景的人， 还是个产品背景的人， 还是个运营背景的人， 对吧 ？

然后是个男生还是个女生 ，他很多人可能有差别的 ，他是一个在中国生长的还是在北美长大 。 然后第二个是跟 topic 本身有关 ， 就是这两个人到底在讨论一个什么问题 。

比如一个算法和一个产品同学 ，他们在讨论算法问题的时候 ， 那可能这个产品同学他听起来是非常晦涩的 ， 那对于产品同学在讨论产品问题的时候 ， 算法同学听起来很晦涩 ，他需要补全 context。

但是当他们两个在讨论随便一个什么新的问题的时候 ， 对吧 ？ 那这个时候他们可能都不知道对于这件事情大家的上下文到底是什么 。

但是语言模型最强的就是它拥有这个世界上几乎所有的知识 ， 所以当它现在足够聪明的时候 ， 当它看到这句话的时候 ， 本质上它比大多数人都更理解这句话背后到底是什么意思 ，因为它拥有所有 context。

我觉得这是一个至少我平时在工作里非常频繁会使用的一个能力 。

**曼祺** [1:50:27]
你最近和一些就是真人交流啊 ， 和人交流你有什么特别有收获和启发的瞬间吗 ？

**曹越** [1:50:33]
现在应该能体会到和人交流的启发没有和 Gemini 大 。 我觉得和人交流一般来说启发比较大的就首先大家之间是没有利益冲突的 ，并且它真的能够在某些方面给你提供帮助的 。

**曼祺** [1:50:49]
我觉得有些反馈可能对你来说比较直接 ， 比如说来自用户或者潜在客户的 。

**曹越** [1:50:53]
对对 ，其实我刚脑子里面想到的最直接的就是来自潜在客户的一些需求 。其实我们在做人物表演这里就是来自于比如说做叙事这种片子的客户 。

我想到了一个就是和一个在我觉得影视行业非常厉害的一个人交流 ，他当时说的一个观点我觉得对我来说还是非常有帮助的 。他的观点是他认为所有内容的终局都是叙事 ， 就包括比如大家一开始在做短视频 ， 那最开始短视频真的是记录美好生活 ， 到变成了说 OK， 实际上你要把它变成一个哪怕只有 15 秒也是一个非常充分优化观看人体验的这么一个内容 ， 再到短

剧 ， 对吧 ？ 最终以叙事的形式 ，但是以这种方式展现出来的一种内容 。 我觉得这个部分还是挺有启发的 ， 哪怕你要作为 up 主 ， 你可能也有你的叙事 。

我觉得这还是一个挺通用的 ， 就是叙事对于各种各样内容的关键影响 。 对 ，他也是一个影视行业非常强的一个前辈吧 ， 所以给我很大的启发 。

**曼祺** [1:51:50]
嗯 ， 对 ， 这次你也提到说 Sora 发布之后 ，其实最让你惊艳的就是它端到端的做了叙事的能力 。

**曹越** [1:51:56]
对 ，是的 。

**曼祺** [1:51:57]
有什么企业家或者说创始人是你学习的对象吗 ？

**曹越** [1:52:01]
我觉得还是挺多的吧 。 我觉得这里有另外一个 mindset 也不知道对不对 ， 就是我发现就是向人学习比从事里面学习是要容易很多的 。

当你跟人去交流的时候 ， 你能更明确的感受到他强的地方和他自己可能的边界 ， 然后他也会去讲说当时他是怎么做事情的 。

所以你在跟人交流过程中还是能够更容易从他们身上学到东西的 。 或者换一个视角 ， 就是当你以人作为榜样的时候 ， 这个目标锚点还是相对更清晰一些的 。

**曼祺** [1:52:29]
嗯 ， 当时你和王慧文沟通非常密集 ， 就你们在关联出来创业的时候 ， 你从她身上学到了什么 ？

**曹越** [1:52:35]
我从老王身上还是学到非常非常多东西的 。 我能想到有几点吧 ， 就是包括创业过程中有很多细节的这个点 ， 就对各种各样的认知的理解 。

就我举个例子 ， 比如说我在想做 AI 视频这个方向的时候 ， 我第一次去找他的时候 ， 然后我跟他聊 ， 就说感觉 AI 视频这个方向还是挺令人兴奋的 ， 准备想搞这个方向 。

然后他就给我了一个 comment，他说如果你要做这个方向的话 ， 你可以去研究一下皮克斯这家公司 ， 然后他又说皮克斯的商业模式还是非常好的 。

我觉得这是一个非常 sharp 的一个 insight。

**曼祺** [1:53:08]
那皮克斯的商业模式是什么 ？ 因为可能对很多人来说会认为它是个制片公司 ， 然后它卖一些周边 。

**曹越** [1:53:14]
我们就类比一些行业就可以了 。 就比如说皮克斯 ， 首先它通过这种 graphics 技术来做一个电影的片子 ， 对吧 ？

然后你最后可以有票房 ， 然后但是电影发布之后， 这个电影里面的角色 IP 是被 maintain 到皮克斯这家公司里面的 。

然后所以你可以长期通过 IP 做变现 。 所以你可以理解为一方面它又是有影视行业的特点 ，但另一方面它又有 IP 行业的特点 ，但是它又是一个最开始源于有了新技术而产生的一个方向 。

所以在这个维度上还是有挺多可以琢磨的东西的 。 什么叫皮克斯的商业模式是很好的 ？ 比如说类比真人影视行业 ， 你可以认为影视公司很多时候我要做一部电影 ， 然后上市之后我就做票房分账就可以了 ，但它没有长期收入 。

那为什么它没有长期收入 ，而皮克斯有呢 ？ 是因为影视当一个电影火了之后， 这个角色 IP 其实是被演员拿走 ，而不是 maintain 到了比如说做这个电影的公司里 。

所以这会使得他们之间的商业价值产生了比较大的一个差异吧 。 但是皮克斯就是因为整个过程都是我自己做的 ， 所以导致这个角色如果真的是一个广泛传播的角色 ， 它可以立住 ， 这就会使得这个角色我可以通过周边去再做更长期的收入 。

这个部分这是我当前的理解 ， 就是但是他当时就给了这么一个很直接的 comment， 对吧 ？ 你就要花很多时间去研究那皮克斯到底是一家什么样的公司 ， 它为什么商业模式好 ， 这个好是对比谁的 。

我觉得这里面还是有非常非常多启发的 。

**曼祺** [1:54:42]
你现在有什么榜样或者 role model 吗 ？ 我印象中有一段时间你的微信签名是 " 想想 Ilya 怎么想 "。

**曹越** [1:54:48]
那段时间就是我自己本身在研究 OpenAI 研究比较多的那几年吧 。 我觉得那几年本身就是花很多时间去研究就 OpenAI 这个组织到底是怎么做成现在这样的 。

然后其实也有 OpenAI DeepMind， 对 ，但是 OpenAI 可能研究更多一些 。

**曼祺** [1:55:02]
那你现在会想想谁怎么想了 ？

**曹越** [1:55:04]
还挺多人的吧 ， 就是你可以都想想 ， 想想老王怎么想 ， 想想一鸣怎么想 ， 想想这个李想怎么想 ， 雷军怎么想 ， 段永平怎么想 。

我觉得一方面你可以去看他们之前的一些演讲啊之类的 ， 就能学到很多 ， 包括比如说雷军他总结出来的七字诀 ， 就是这个专注 、 极致 、 口碑 、 快 ， 然后我觉得这些都是很深的道理 。

但是这个时候可能你能琢磨出来的也只是这些含义里面的一小部分 。 然后在这个过程中你也可以做很多 practice， 然后我觉得就有点像是你要从他们抽象出来这些东西里去想 ， 就站在他们的视角去看你这个事情应该怎么写 。

但这个的前提也是你能够一定程度上有机会跟他们做交流 。 看传记也有点这个意思 ， 对吧 ？

就是想想乔布斯怎么想 。

**曼祺** [1:55:46]
所以你学习的对象 ， 或者说我觉得也可以是你自我的投射一部分 。 我觉得 Ilya 他还是一个偏研究型的人， 然后你现在学习的这些对象 ，他是更综合的角色 ， 就是他是一个企业经营者 ， 一个创始人的角色 。

**曹越** [1:56:00]
是的是的是的 。 就是我在创业之后， 实际上更多的时间都还是花在就是怎么把公司做好的这个维度 。

**曼祺** [1:56:07]
在这个转变中间 ， 哪些部分是你喜欢的 ， 哪些部分是你不喜欢 ？ 就你可能开始没有那么喜欢 ，但当然你肯定是得接受的 。

**曹越** [1:56:14]
这个倒也没有喜欢不喜欢 ， 更像是就这个和我自己在一段时间内 ， 比如 researcher 的这个角色肯定还是有夹角的 。

我觉得这个部分是你要花更多时间去打磨和迭代的 ， 包括你要想清楚产品 、 商业 、 业务 ， 对吧 ？

这些东西 。 我觉得这些东西的在学习的过程中， 实际上和比如说你一开始在去琢磨什么样的技术是影响力更大的 ， 你做个什么样的 system 是影响力更大的 ， 这个肯定还是有不同的 。

你还要更多的去关注它的产品价值 、 商业价值 。

**曼祺** [1:56:45]
你觉得创业有什么部分是比较反你的本性的吗 ？ 现在有体验到过吗 ？ 也不一定要到本性那么深的层次啊 ，有可能是就是它跟你以前的一些倾向不太一样 。

我知道有一些 ，有一些可能是那种就特别细的一些东西 ， 比如说有的人其实不喜欢接受采访 ，不喜欢跟人说话 ，但创业之后你在某些阶段你肯定还是要对外有些表达之类的 。

**曹越** [1:57:05]
我自己好像的确也没有那么喜欢做公开场合的演讲 ，但是我单独和人交流是完全没有问题了 。 但是我就没有那么享受在公开场合给大家讲东西的那种感觉 。

**曼祺** [1:57:18]
你说这公开场合包括全员会议 。

**曹越** [1:57:20]
对 ，也包括 。 我觉得这个对我来说本身就还是有一点点挑战的 ，但这个也在琢磨 ， 就是反推回来就是为什么你不享受 ， 对吧 ？

就是因为有些人， 包括比如马云 ，他可能非常擅长在这种场合进行讲话 ，但是你要做一个公司 CEO，其实你在很多场合你的确是要充分的表达人自己的想法和观念 。

对 ， 然后让大家能充分理解到这个公司的发展方向 。

**曼祺** [1:57:43]
嗯 ， 这也是你说的对齐上下文的一部分 。

**曹越** [1:57:46]
对 ，是的是的 。 但是我觉得对我来说有个很大的挑战就是 ， 我可能非常的关注跟一个人交流的过程中 ，他是不是能够充分理解我到底在说什么 。

但是当你对着一群人的时候 ， 实际上这个时候你很难表达 ，因为这群人的上下文可能是差异巨大的 。

所以你到底在这个时候你的 system prompt 是啥 ？ 你怎么样能够让这群人更充分的理解你到底在表达什么 ？

**曼祺** [1:58:12]
我觉得有的时候对着一群人表达 ， 它除了说是要让对方理解之外， 它有一些别的作用 ， 它有一些仪式性的作用 ，但它在一个组织里可能也是需要的 。

**曹越** [1:58:21]
肯定是需要的 。 就这个部分至少不是一个我特别 enjoy 的部分吧 。

**曼祺** [1:58:24]
你现在最优先级的工作是什么呀 ？

**曹越** [1:58:26]
我觉得优先级最高的就是理解清楚在 AI 视频这个方向未来一段时间内比较大的机会是什么 ， 然后以及我们打造 Sand.ai 这个组织 ， 然后能够在未来的一段时间内抓住相对比较大的机会 。

**曼祺** [1:58:42]
就是识别这个最大的机会和我们在行动上去抓住这个机会 。

**曹越** [1:58:46]
对 ，是的 。

**曼祺** [1:58:47]
你对识别这个机会 ， 你应该是已经看到一些眉目了是吗 ？

**曹越** [1:58:50]
对 ， 我觉得肯定是的 。

**曼祺** [1:58:52]
嗯 ， 那你现在方便描述吗 ？

**曹越** [1:58:54]
我觉得可以从行业趋势来简单的我讲一下， 就是有点像是未来一段时间那个行业机会 。其实在刚才说那个专业的 CEO 框架里 ， 对吧 ？

最开始你要理解行业的发展趋势 。AI 视频这个行业最关键的就是最开始实际上是源于比如说语言模型 、 图像模型 、 视频模型 、 声音模型这些模型的迭代而产生出来的能力 。

模型展现出来的能力能够对一些行业带来生产力的变革 。 所以在相对短时间之内 ， 它还更像是一个工具类型的机会 ， 对吧 ？

就是你怎么样生产力提升带来的 。 那可能有偏创作者端 ，也可能有偏 C 端的 。 你怎么去看这些机会 ， 对这些人的需求到底是一个 for use 的长期的需求 、 刚性的需求 ， 还只是一个短期玩一下的需求 。

然后随着模型能力变得越来越这个鲁棒 ， 越来越靠谱 ， 质量越来越高 ， 它可能就有更偏 C 端的机会出现 。

所以我觉得这就是未来一段时间内的这个变化 。 我觉得这些变化应该就如果他真的有人仔细思考过这个行业 ， 我觉得还是比较共识的 。

这里最不共识的是 timing， 这个部分就没法讲太多了 ，但是本质上就是你要判断清楚什么时间点什么样的机会会出现 ， 然后你要提前去为那个方向做一些准备 。

我觉得 timing 是最重要的 ，timing 是最难判断的 。 实际上大概这个领域会怎么发展 ， 这个事情是好判断的 ，timing 是最难判断的 。

**曼祺** [2:00:22]
而且你如果要抓这个 timing， 你的节奏感也要很好 ， 包括行动能力快 、 速度 。

**曹越** [2:00:27]
是的 ， 包括组织 。 有点像是假如这个机会出现了 ，但是你的组织没有能力抓住这个机会 ， 那就意味着你的节奏其实没抓好 。

这个节奏感它就体现在就是你觉得在什么时间点它是一个什么样的机会 ， 然后你在这个阶段里打造了一个什么样的组织 ， 然后能够帮助你在那个时间点抓住那个机会 。

所以这个是对这个方向的一些思考 。 从公司层面来讲 ， 就是从最开始的一个更偏模型侧的到更垂直整合的一个组织 ， 我觉得是在这个大方向上还是有很多不同类型的机会可以去抓的 。

**曼祺** [2:01:01]
嗯 ， 最后一个问题是想让你说一个就是你在思考的问题 ， 或者说你认为重要的问题 ，因为我们这个系列就是叫 Next Question 嘛 ， 下一个问题 。

或者你想问其他人的问题 。

**曹越** [2:01:12]
我觉得有一个还比较有意思的问题 ，但是非常开放的 。 然后我们有的时候在组织里也会做一些讨论 ， 就是 ASI 就超级智能到底什么时候会出现 ，以及它到底会对这个世界带来什么样的影响 。

**曼祺** [2:01:27]
你想象中的 ASI 是什么 ？

**曹越** [2:01:31]
可以简单的从某些维度去讲一讲 。 就是我觉得假如我们就只看智能这一个维度 ， 智能这个维度就有点像是你去看语言模型 ， 它在随着时间的推移 ， 它的智力水平在逐年提高 。

那我们按照智商来去 rank， 对吧 ？ 从几十到 100 到 120 到 150， 对吧 ？ 假如它 5 年之后这个智商是 1000， 那它到底意味着什么 ？

就我们可以简单的从这个可理度 ，因为人我觉得可能在相当长一段时间可能都还在这个 range 里 ， 应该不会有什么本质变化 。

**曼祺** [2:02:04]
我觉得智商 1000 主要是就应该那现有的这个智商评测体系它可能都测不出来 1000。

**曹越** [2:02:09]
这是一个可能绝大多数人类难以理解的一个数字 ， 就大家也不知道它意味着什么 。 那它到底会有什么样的影响呢 ？

就是比如说人和猴子的差别 ， 就哪怕大人和小孩的差别 ， 可能在他的大脑没有完全发育的时候 ，他可能智力水平就是几十 。

这个时候大人是还是比较容易糊弄小孩的 ， 对吧 ？ 那如果有一个真的这个智商 500 或者 1000 的智能体出现 ， 它到底对这个世界会产生什么样的影响 ？

我觉得这是一些往前去延展的方向吧 。 就是有很多硅谷的公司 ， 大家觉得我们做 superintelligence 需要 safe， 对吧 ？ 就是是不是真的需要 safe？

可能大家有不同的观点 ，但是我的感觉就是说 ， 就是当你真的沿着这个方向去往前去想的话 ， 还是挺有意思的 。

**曼祺** [2:02:51]
好 ， 那今天非常感谢曹越做客我们的节目 ， 分享了他从一个顶尖的研究员 ， 然后一路来创业的这整个的心路历程 ，以及 Sand.ai 在这一年多的一个变化 。

从你们之前是更侧重模型来驱动 ， 然后到现在是更加的垂直整合 ， 包括你们组织上的一些变化 。 今天非常感谢 。

**曹越** [2:03:10]
谢谢 。

**曼祺** [2:03:13]
本期 《 连点呈现 》 推荐 136 期和 Navart 创始人陈冕的访谈 。Sand.ai 和 Navart 是两类典型的 AI 创业公司 ， 它们的区别在于你是否自己训模型 。

如曹越所说 ，他希望把 Sand.ai 打造成一个垂直整合的组织 ， 既自己掌握模型 ，也做基于模型的应用 。 这个理论上的好处是你可以根据市场的需求来优化特定的方向 ， 同时你再基于自己的模型去打造产品 。

理论上它可以让产品和模型互相放大 ， 这有点类似于 OpenAI 它既做 Sora 2， 同时还有做 Sora app。 那另一类只做应用的公司 ，其实也有很多跑得不错的案例 ， 比如说 Perplexity 还有 Cursor， 它的特点可能是要非常快的迭代 。Navart 自己就是一个迭代很快的公司 ，9 月 30 号 Sora 2 发布 ， 十一假期还没结束时，Navart 上就已经可以用 Sora 2 的最新模型了 。

这两位创始人也是两类典型的 AI 创始人， 曹越他有很深的技术背景 ，而且从他的个人经历你就可以看到 ，他确实比较早的预判了大语言模型这样一个机会 。他也是在 23 年初这个浪潮到来的第一时间 ， 就加入了当时大家非常看好的一家公司 ， 光年之外作为联创 。

陈冕在 23 年的创业选择也非常果断 ，其实那个时候更主流的是模型背景的人来创业 ，而陈冕是马上从字节离开 ， 开始了创业 。

就像曹越提到的 ， 现在 AI 创业的特性和难点就是产品和模型技术两边的人要各自补另一边的东西 ， 一起往中间走 。

所以曹越现在会花大量时间了解和学习产品还有运营 。 陈冕也提到他会和 Navart 的技术合伙人密切的交流 ， 快速去理解模型的方向 。

两家公司同处于多模态相关的 AI 领域 ， 两位也都看到了一个共同的趋势 ， 就是 2C 产品的可能性正在被打开 。

陈冕认为 2026 年会是泛娱乐消费的 AI 2C 应用的元年， 他们也在筹划相应的产品 。 这期中曹越也告诉我们 ，Sand.ai 的 2C 产品也正在计划之中 。

当然现在还是一个相对早期的状态 ， 所以两位创始人都没有详细的透露他们的产品可能会是什么形态和方向 。

我也非常期待在之后能看到更具体的产品雏形 ， 期待 26 年这个市场会有更多的变化 。

最后再次感谢飞书支持本期晚点聊 。 如果你也急需摆脱长文本总结 、 会议整理的 dirty work， 用更多的时间去做更多有意思 、 有挑战的工作 ， 或更多的享受生活 ， 都推荐试试飞书的智能会议纪要 。

本期节目就到这里 ， 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 ， 欢迎在评论区分享想法 ， 这也会成为我们节目的一部分 ， 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 ， 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk，也欢迎关注我们的公众号晚点 LatePost。

下期再见

。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
