开场0:00
欢迎收听 《 晚点聊 》, 我是曼祺 。 今天的嘉宾是清华大学的刘知远和肖朝军 , 刘知远是清华计算机系副教授和面壁智能的首席科学家 。
肖朝军现在在清华做博士后, 也是面壁 MiniCPM 系列的文本模型负责人。 他们的团队刚在 11 月的 《 自然 》 杂志 《 机器学习 》 子刊上发表了封面文章 《Densing Law of LLMs》( 大模型的密度法则 )。
所谓密度 , 就是用更少的算力和数据 , 获得相当乃至更多的智能 。 我们讨论了密度法则研究的源起 ——
虽然你说高效是不言自明的 ,但是从事实上来讲 ,2022 年 ChatGPT 兴起以后 ,其实在全球范围内 , 大的话语体系其实是 Scaling Law。
就是在 23 年初的时候 , 曾经有过一些巨头说这个世界上不需要超过几个大模型 。1943 年的时候 ,IBM 的董事长曾经说全球不需要超过 5 台主机 ——
也展开聊了业界提升模型能力密度的具体做法 。
因为这个架构 、 数据 、 然后学习算法 、 然后软硬一体 , 就是 InfLLM 四个层面 。其实围绕这四个方面 , 我们应该可以看到现在市面上有很多相关的工作 。
而再往后, 更大的密度提升可能需要一些全新方法 。
强化学习做到现在 ,其实大家还没有解决的一个问题是强化学习的 Scaling 的问题 。 它现在有两种技术路线 。
在刘知远的设想中, 未来更高密度的模型会支持每个人在端侧拥有专属大模型 , 智能会分布式地存在 。
比如说你的眼镜也好 , 甚至你的耳机 、 你的手表 , 各种各样的这种智能的硬件 , 它完全是可以有一个共同的提供智能服务的终端 。
就有点像家庭里面的 NAS, 只是说你是一个便携的 、 可以跟着你走的这么一个 NAS。
他是一个典型的技术乐观主义者 。
关于未来 , 你有什么担心的地方吗 ?
我担心的地方是 , 我们人类自己会束缚我们自己的前进的步伐 。
相关文章和讨论的链接我会贴在 show notes 里 。 下面我们正式进入本期节目吧 。
今天很高兴地邀请到了清华计算机系的刘知远老师和他之前的博士生 、 现在清华的博士后肖朝军 。
朝军今年初也做客了 《 晚点聊 》, 和汪誉老师的学生傅天宇一起分享了注意力机制 , 尤其是稀疏注意力的改进 。
这个也和今天的话题有关 , 我们之后可以展开 。 两位可以先和我们的听友简单打个招呼 。
大家好 , 我是刘知远 。
大家好 , 我是肖朝军 , 然后现在做文本架构方面的研究 。
新模型趋势2:29
讨论密度法则之前 ,因为最近正好赶上行业里有很多新的模型 , 包括 GPT-5.1、Grok 4.1、Gemini 3, 还有最近也刚发了 CloudOps 4.5。
我们可以先从这些行业动向来聊 。 两位最近在这些新的模型上, 就是你们看到的比较有意思的部分 , 或者说亮点是什么 ?
我其实感觉上其实它这些东西 , 我觉得至少有两个很明显的趋势 。 第一个趋势就还是大家今年应该是所有大模型从业者都关注到了一个智能体化 。其实你看到其实所有的这些模型 , 它在智能体任务上都有了非常出色的表现 。
所以直观体现就是大家这些模型所有发布完之后, 大家都会在代码任务上去测试说它能帮我解决多少 bug 了 。
这是第一个大家很明显的趋势 。 然后第二个趋势 , 我其实是从 Nano Banana 和 NotebookLM, 就是 Gemini 支持的这些任务上, 然后观察到的 。
就是你可以看到它相比于其他模型不同的一个点在于 , 它现在生成图片 , 就生成文字会非常的精准 。 这是在之前的 diffusion model 然后一直看不到的 。
然后在 4o, 就是 OpenAI 今年发的 4o 模型上看到一些曙光 , 然后 Nano Banana 它把它进一步发扬光大了 。 那为什么我觉得这件事情会很有意思呢 ?
就是它会让我们看到了一个新的 Scaling 的方向 。 就我们之前一直在说 Scaling, 然后文本模型的数据枯竭 , 然后但是一直大家都会提 , 那是不是我们可以用更多模态的数据 。
但其实这件事情一直没做成 , 就是大家用更多模态的数据 , 它没有办法让这个模型真的就智能水平又再一步的跃升 。
当然我现在感觉上, 假设通过这种图像生成 , 然后统一的自回归式的方式 ,是不是有可能能实现这件事情 。
但这件事情也还没有办法确定 ,因为没有记录细节 。
对 ,因为不知道 Gemini 3 这个是怎么实现的 , 对吧 ?
对对对 。
然后它是比如说是一种产品上的优化 , 还是说它是真的就是一体化模型上的优化 。 可能这个得等待一个两一到两个月 , 我们可以再看看 。
我会觉得就是最近这 6 年的时间 ,其实是一个高速发展的这么一个阶段 。 就基本上我现在会看到的就是 , 咱们几乎每周的进展 , 顶得上我大概我读研究生的时候一年的进展 。
每天都会有各种头条 。 那我想就是这里面在我来看 , 就是大致可以划分为两个大的方面 。 就一个方面其实我把它总结为就是能力更强 , 就是要让这个模型它的能力变得越来越强 。
因为我们其实可以看到 , 就是从 2018 年预训练模型出现之后 ,其实大概是每过几年的时间 , 就会让这个模型的能力有一个飞跃 。
那从 2022 年底 ChatGPT 出现 , 那它通过 instruction tuning 让这个模型能听懂人的指令 。 那 2024 年底 、2025 年初 , 通过这种大规模强化学习 , 能够让这个模型学会深度思考 。
那么其实我们会看到这样的一条非常清晰的主线 , 就是这个模型在变得越来越通用 、 越来越接近 , 甚至是超越我们人类的智能的水平 。
那同时的话 , 就是我和朝军我们团队所发表的这篇论文 ,其实是想给大家呈现另外一条主线 ,其实就是能效更高 。
也就是说我们会看到过去 6 年的时间 , 就是大家经常提大模型 , 它的发展的逻辑是规模法则 。
那么其实规模法则我理解 , 就是它背后其实是告诉我们 , 我们能够找到一条这种基于大数据加大算力 , 然后加大参数 , 这样的一条通用的智能的解决方案 。
那么在这样的解决方案下, 只要我有足够多数据 ,有足够多算力 , 然后我训练足够大的模型 , 那我就可以让这个模型能力可以持续的提升 。
就这个是规模法则的逻辑 。 但是我们会说规模法则同时给我们带来的非常大的问题 ,其实就是你模型训练得更大之后 ,其实意味着它的训练成本和它的使用成本都会相应的变得更高 。
它其实基本上是一个线性 , 甚至是一个超线性增长的一个状态 。 所以我们会认为 , 就是像历史上的任何一个对全人类都产生深远影响的这种科技 , 那么它一定是要追求一个更加高效的这么一个发展的模式 。
也就是说一旦你找到了这条通用的这种技术方案之后, 你一定要让这个技术方案的方方面面都更加的精进 , 变成一个更加精密的一个体系 , 来让我们制造出来的这个产品 , 它的成本更低 , 它的能力更强 。
这个其实是我们所提出来的 Densing law 其实想要告诉大家的这么一个发展方向 。
就我自己的一个感觉 , 就是现在这些新的模型的发布 , 我觉得就可能从外界来看 , 它更多是您刚才说的这两条主线里面的性能的提升 , 就能力的提升 。
然后在效率上, 就您说的这个第二条主线 , 你觉得最近业界的这些进展它有什么体现 ?
因为本身 AGI 的发展的路径还没有结束 , 我们会看到像 Gemini 最新的这些进展 , 就会让大家眼前一亮 。
所以就是我会看到 , 就是像它这个能力更强 , 就这条主线是更有显示度的 。 另一方面 ,其实我觉得在全球来看 , 应该说也有非常多的工作 。
因为大家其实会意识到 , 就是我花那么多的算力 , 那么多的经费 , 然后我们来去训一个模型 , 那么必然导致这样的一个模型 ,其实是没有办法在更多的场合能够用起来的 , 对吧 ?
你只能够通过 API 然后来去调用 。 那这件事情其实本身是极大的限制人工智能的真正的普及 。 智能本身应该是高度分布式的 , 它是在各个领域都会有潜在的广泛的这么一个应用 。
所以从另外一个角度看 , 就是如何让这个模型更加高效 ,其实是我们真正实现科技革命 , 就是这一轮人工智能的科技革命 , 非常重要的一个底层的驱动 。
对 , 这个问题我可以再补充一下 。其实今年一个很重要的旋律是可以看到的 ,其实是效率的改进 。 就是我们先谈开源 , 就你可以看到现在开源界 , 然后像今年的 MiniMax, 然后像千问也做千问 Next,DeepSeek 就更不用说了 ,也今年那个 V3.2 也是做了稀疏的 Attention, 包括我们也在做稀疏的 Attention。其实可以看到现在在架构上去提升模型效率 , 已经成为一个非常共识的一件事情 , 就是在开源界
。 那你从闭源界你其实也可以看到类似的事情 , 你像 OpenAI 它也会去搞各种 Mini 系列的模型 , 然后已经在 Gemini 3 火之前 , 就是当时有一个 Gemini diffusion 一个文本模型 , 它宣称它的文本生成的速度会比其他的模型快个很多很多倍 。
因为它不开源 , 所以你也不知道它具体是实现什么 。 但是你可以看到就是它们内部也在追寻这种效率的提升 。
因为其实对它们来说 , 当然固然可以看到就它们的资源量会比我们大很多 ,但实际上就是任何的再多的资源面向 AGI 的投入 , 现在都还是有限的 。
我们都得把这件事情做得更好 。
所以就是从公众来看的话 , 就是能力提升是明显 ,但是暗线应该是能效更高 。 因为其实你可以看到历史上, 比如说我们说过去的这几十年的信息革命 , 那它的明显其实让我们看到的是 , 我们的计算设备在逐渐的小型化 , 对吧 ?
我们原来的大型机 , 到了 80 年代是小型机 PC, 对吧 ? 到了 2000 年之后是手机 , 到 10 年之后是我们的智能手机 。
我们的智能化的设备其实它就已经是让我们的信息化的生活 、 工作变得非常的方便 。 这是主线 , 这是明线 。
但是它的暗线其实是芯片行业的快速发展 , 就是摩尔定律 。 所以其实我们之所以提密度法则 ,其实是想寻找大模型的摩尔定律 。
密度法则10:23
我们可以就是接下来就正式展开聊一下密度法则 。 因为我最开始看到这个研究的时候 , 我自己其实是有一个疑惑的 , 就是这个研究它揭示的规律 , 或者说这个发展的脉络 , 就是随时间推移 , 模型的训练和推理效率提高 , 对吧 ?
这个好像对业界来说是不言自明的一个现象 。 当然你们这次是有一个非常定量的描述 , 就可以讲讲就是这么做的背景和意义 ,以及说驱动这个研究背后的核心问题意识是什么 。
我觉得就是第一个角度 , 就是从人工智能发展的角度来讲 , 我们会认为它一定要追求高效 。 那追求高效它肯定不能够是一个说口号而已 , 说我就是要高效 。
那我们其实是要有一套体系 , 就像你刚才问的 , 到底是哪些因素会影响模型的密度 , 会影响我们的能效 。
那么从这个角度来讲 , 我觉得我们就达成了我们提出密度法则的这么一个目标了 。 也就是说我们要提出一个指标来 , 然后让这个指标成为一个客观的事实 , 能够团结更多的研究者来去更细致的 、 更定量的 , 然后来去探索更高效的这么一个实现的这么一个方式 。
那么第二个就是 , 虽然你说高效是不言自明的 ,但是从事实上来讲 ,2022 年 ChatGPT 兴起以后 ,其实在全球范围内大的话语体系其实是 Scaling Law, 就几乎所有的机构都会去说 , 我只有更多的数据 、 更多的算力 , 我才能训更大的模型 , 我才能追求更强的能力 。
这是从 2022 年一直到 2024 年底 , 然后一直以来的这么一个大的这么一个话语 。 那么甚至说有 OpenAI、 有英伟达 , 然后它们也都是在去说 ,其他人就不要去训大模型了 , 对吧 ?
然后只有那些有 10 万张卡的这些团队 , 然后 10 万张卡的机构才有资格去训大模型 , 你其他人就用就可以了 。
它尝试着去构建一个微算力论的这么一个话语的这么一个体系 。 那在这种情况下, 我们会认为就是 Densing law 密度法则 , 我觉得也非常的重要 。
那么其实我想从今年初 DeepSeek V3 其实会告诉大家 ,其实我不需要那么多算力 , 当然绝对算力仍然很大 ,但是绝对不是像很多的这些国际的企业和机构所宣称的 。在我们来看 , 就是我们其实是要有责任 , 然后来去在整个人工智能发展的这么一个过程中, 我们要把正确的发展方向能够告诉大家 。
因为其实就是你作为比如说深入了解整个人工智能全貌的 , 可能会知道高效很重要 ,但是就是说从很多很多人来讲 , 甚至包括决策层等等 , 那它肯定很多时候它所接受的信息仍然会觉得规模法则是第一性原理 , 我就得有 10 万张卡 , 我才有可能做通用人工智能 。
我在我来看就这件事情是非常错误的一个信号 。
对 ,因为你刚才也提到其实它是有点像摩尔定律的 。 因为我之前看 《 芯片战争 》 的时候 , 我觉得它里面对摩尔定律的描述也很精辟 , 就是它虽然叫定律 ,但它实际上并不是一个物理规律 , 它其实是一种叙事 , 或者说一种共识 , 它是指挥整个产业链和这个行业里的很多环节 , 然后大家有一个共同的目标 。
是的 , 所以摩尔定律反而约定俗成了就叫摩尔定律 。 一开始团队内部还要说叫密度定律 , 后来我们就觉得在中文的话语体系内 , 这个定律更多的跟一个物理规律可能会有关系 , 所以我们就会觉得可能就不能够叫定律 。
因为其实在英文里面 , 这个 law 它其实就是一个规律 , 对吧 ? 它没有说一定是物理定律的这么一个层面 。
但是在中文里面 ,law 翻译成定律的话 , 就显得特别高大 , 就是它得是掌握万事万物的这么一个背后的这么一个法则或者规律 。
所以我们就后来就是基本上会去提所谓的叫密度法则 , 就相当于说更体现 law 本身它的含义 。
所以我非常认可就是摩尔定律和密度法则 ,其实都是一种人工的自我实现 。 摩尔定律你如果去看就是摩尔在 1965 年他最原始的那篇文章 ,其实他自己都没有把自己称为是一个定律或者是一个 law,其实是过了十几年之后 ,是由其他人说摩尔在 1965 年根据过去的十几年总结的规律 , 竟然在他之后还 work 了这个十几年, 所以就把它定义成了摩尔 ,Moore's law。
那么甚至说在 1970 几年之后, 然后又持续的影响整个行业 。 那么所以就是摩尔定律它的影响力就越来越大 , 就是我们人类社会通过工业化 , 通过这种技术创新的这么一种自我实现 。
那我们对密度法则 , 我们也认为它也是一种自我实现 ,因为所有的追求密度更高 。 因为你想摩尔定律它也是要追求在芯片上把更多的电路给放进去 。
密度法则本身就是逆世界的商增的这么一个趋势而行 , 它本身就是在通过技术创新来追求某一种内在的秩序 , 对吧 ?
然后把更多的内容给压到一个更小的空间里面去 。 因为这个宇宙是大爆炸的 , 商增的 , 对吧 ?
是不断的扩散的 。 那我们让它密度更高 , 这件事情显然是需要外力 。 对于我们人类社会来讲 , 外力是什么 ?
就是我们不断的创新 , 让知识能够压到一个更小的空间里面 。 不管是芯片也好 , 模型也好 , 未来一定是这个发展趋势 。
就刚才那个问题我也再补充说一下, 像人本身在自然的发展的过程当中, 我们会讲物竞天择的那种自然法则 , 它其实并不是说它是一种物理规律 ,但是就是说在天然的资源受限的场景下, 你只有更好的遵循这个法则的那一批人, 它才能够存活下来 , 然后继续把你的基因遗传下去 。
所以你可以看到人的脑子并没有无限制的增长 ,而是一直在一个有限的体积下, 就是在有限的能源消耗下, 让我的智力不断的提升 。
所以其实它是我们的一个追求 , 然后也是在有限资源下的一个可能你的一个必需品 。
乔军说的这个点特别有意思 , 就是你要是说遵循自然界就是生物群落的所谓的物竞天择的话 , 说不定就你可以设想就是摩尔定律为什么能够 work, 可能也跟商业的互相的这种竞争的环境其实会有关系 , 对吧 ?
你不追求用更低的成本实现更强的算力 , 那你的企业 , 你的芯片就没有竞争力 , 对吧 ? 是我们内部的一个物竞天择 。
那你就可以设想未来的模型的发展肯定也是这个样子 。 如果你实现的模型的效率不如另外一家厂商 , 那么你竞争力就没有那么强 。
本身密度法则和规模法则本身也不是说是对立的 ,其实是相辅相成的 。其实所有的一线的大模型团队 , 它一定是要去追求它的模型的高效的 。
对 , 就是说这件事情不会在同一个模型里面完成 。 你会看到就是 GPT 的那些模型 , 它的价格 ,API 的价格其实就是在快速的下降 。
就这个本身就是一个它内部也在不断自我实现的一个过程 。
或者是说你换一个理解 , 就是 Scaling law 它强调的是计算量和能力之间的这么一个密度关系 。 但是我们想强调的就是说密度这件事情其实可能是那个斜率 , 就是说我用计算量换取的智能 , 它这个转化率是要越来越高的 。其实可以看到 , 虽然说 OpenAI 我们会说它资源很多 ,但它一直在讲说我们已经不够资源去做一些更前沿的事情 。
包括 ILLIA 为什么会从 OpenAI 走 ,是因为它觉得它拿不到足够多的资源去追寻它的潜力 。
好像做 safe 的一样 。
对 , 所以其实核心问题就是大家还是资源受限 。 就即使放在 OpenAI 来看 , 它也因为资源受限产生了矛盾 。
所以对它们内部来说去追寻这种效率也是一个非常极致的事情 。
就回到你们这一次的研究 , 它的一些核心洞察和结论是什么 ?
核心洞察其实我们虽然名字叫密度法则 , 讲的是能力密度不断的随着时间指数翻倍 ,但我其实觉得我们更想强调的是一个观点 , 就是我们要去追寻的是单位参数下, 或者是单位开销下, 我们能够转化出来的智能的能力 。
这件事情是我们相当于是立了一个 flag 或立了一个目标 , 说我们大家应该追寻这件事情 ,而不是一味的说我这个 performance 有多高 。
因为我们这个工作其实是 24 年底正式完成 , 然后当然经过投稿到现在来说 , 经过了快一年的时间才最终中稿 。
那其实在那个时间点的话 , 大家其实都在想 , 那我这个我要怎么把这个模型参数再放大一点 , 或者这个计算量再放大一点 。
那我们会认为在这样一个发展模式下的话 ,其实是不对的 。 这样的发展模式只会导致一个问题 , 就是所有人都在疯狂的砸钱 ,但实际上你没有把你的转化率 , 就是智能的转化率提升 。
那这样的话迟早会引来的就是大家的资源已经不够了 , 然后就大家就迎来了一些所谓的寒冬 。
就像 Llama, 它那个时候发了 Llama 3 405B, 那它假设下一步发展然后是要发 1000B、2000B 的稠密模型 , 我觉得这样的话那显然这个事情就 AI 的发展就没有办法持续下去 。
所以在那个时间点我们想要去做出这篇文章 ,其实就想宣称说对于技术的发展而言 , 追求密度或者追求智能转化率 , 实际上是我们技术发展一个很重要的一个主线 。
所以至于说它是 3.5 个月翻一倍还是一年翻一倍 , 我觉得这个数值本身可能反而没有那么的 。
对 , 你们现在发现的是平均 3.3 个月翻一倍 , 就差不多 100 天 。
但后来修正了一下, 就是在把 2025 年的数据加进来之后, 就变成 3.5 个月了 。 当然就是会有一些抖动 , 核心的观察就是是在加速的 。
因为就是 2023 年, 应该是 2023 年 1 月份 , 就是 ChatGPT 出现前和后 ,其实它的倍增的速度其实是在加速 。 它增加了这几个月 , 然后由原来就是 24 年它当时算出来的是 3.3, 然后把 2025 年的加进来变成 3.5, 我们理解这个可能就是一个正常的抖动 。
因为你们是 24 年底做完这个研究 , 所以最开始的有这个想法做这个研究时间是更早的 , 对吧 ?
对 ,其实我们去年年中的时候就已经在提 , 当时我们提叫知识密度 。
知识密度 ,24 年年中 。
核心是这个故事可能就要再搞早一点 , 这个其实会早到 2023 年下半年 。 那个时候其实就是你大概咱们如果拉回到 2023 年,2023 年初的时候是 ChatGPT 出来震惊全球 , 就是让所有的人都发现大模型这么好用 , 所以才兴起了就是那一轮特别大的浪潮 , 就是国内的刘小虎 , 然后这些相关的 。
那其实在 2023 年的主旋律是啥 ? 就是从 2023 年初一直到 2023 年底 , 大家的主要任务是追赶 ChatGPT 的复现 , 就是把这个模型能力复现出来 。
那么复现出来大概国内的一线团队就是大致是在 2023 年的 9 月份 、10 月份那段时间能够复现出来 。 因为我们那时候的估计就是国内跟国际的最先进的水平差不多 ,也就是差个一年左右的时间 , 基本上就都能复现出来 。
因为主要的点其实就是 instruction tuning 复现出来了 。 复现出来之后 ,其实这个时候就面临着一个决策的问题 。OpenAI 其实是在 2023 年的 4 月份发布了 GPT-4, 所以就是在 2023 年的 10 月份左右 , 就是一旦它把 ChatGPT 能力复现出来之后, 那很自然的一个决策就是我把当前的参数再扩大一些 , 然后数据再怼多一点 , 算力再弄得大一点 , 然后我们就去追求 GPT-4。
绝大部分团队也都是按照这条思路去走的 。 所以你就会看到 2024 年上半年其实就是几乎所有的这些团队都会去推 GPT-4 水平的大模型 。
那我们团队其实是在 2023 年的下半年在复现出 ChatGPT 水平的模型能力之后, 我们的第一方案也是说我们去追求一下 GPT-4 水平的模型能力 。
但是我们经过核算就会发现这样的一个模型 , 它所需要的模型的参数规模大概当时应该算出来的是 140B 的这么一个规模 。
那么对应的成本是多少 ? 就大概就是一个大几千万的一个水平 。 我们就多想了一下, 我们会说我花几千万训这样的一个模型 , 大概率在 24 年上半年国内一线的团队至少有 5 家以上能够实现出类似的能力 。
那我如何能够收回我训练这个模型的成本 ? 我们会认为我们找不到这样的一个确定的答案 。 所以我们就会认为如果说配方都没有什么变化 , 你只是把模型参数变大了 , 然后把数据弄多一点 , 再训一个 GPT-4 模型 , 对我们来讲在商业上是讲不通的 。
所以我们在那个时候就把主要的精力变成了我们去进行模型风洞的构建 。 就我们要去看把各个方面更加高效的去进行构建 , 它对于我们提升模型能力效率它有什么影响 。
所以就是这一系列的工作就产生的结果就是 2024 年 1 月份我们发布的 MiniCPM 的第一个版本 , 就是用一个 24 亿的参数就可以实现像当时的 Llama 2 的 13B, 然后像当时的 Mixtral 7B, 就是这样的一个模型的效果 。
就会发现说你就想 2.4B 是什么水平 , 就是在手机上就可以跑了 。 所以就是 2.4B MiniCPM 1,也就是 2024 年的 1 月份 , 让我们意识到了其实我们可以通过技术的持续的创新能够极大的提升模型的它的效率 ,也就是我可以用更少的参数 、 更少的计算量 , 然后来去实现相同的甚至更高的模型能力 。
当然一个方面我们就看到了就是在端侧上去部署大模型的可能性 。 所以就是在 2024 年我们就提端侧智能 , 端侧大模型 。
但是与此同时, 就是从暗线上, 乔军我们其实就再去想 , 就是它背后的规律会是什么 。 所以那个时候其实就是 24 年的整个的一年的时间 ,其实我们在尝试着就是寻找这样的规律 。
那当然就是受到摩尔定律的启示 , 就我们就相当于说提出来知识密度的这么一个概念 , 然后在知识密度的基础上我们去探究如何去找到就是所有的这些模型通过技术创新它的密度的变化的一些规律 。
这个其实是它的缘起 。
所以就至少在面壁内部的话 , 这个其实成为了你们一个目标指引 。 然后你们现在把这个东西发出去 ,其实也是因为你们觉得这个实践的方向是对的 , 然后你们觉得可能在业界里会有更多的共鸣 。
那回到就是你们研究的一些发现 , 就是比如说我看到你们数据里面 , 它说 ChatGPT 之前和之后, 从计算到能力的斜率它是变陡了 ,ChatGPT 之后是变得更陡了 。
我有一个比较好奇的事 , 就是为什么在 24 年 9 月的 o1 和 R1 之后, 就是强化学习后训练的方法被引入之后, 它没有类似的这种斜率变化 , 还是说现在这时间太短了 ?
其实更多的时间可能是技术细节上的问题了 , 就是我们能力密度去年年底的时候定义的版本是面向机座模型的 。
所以其实 o1、R1 它更多的是后训练技术的一个增长 , 所以其实没有直接体现在能力密度里 。 然后其实我们现在也在做相应的 2.0 的版本 , 就是希望能够把所有的后训练的这些技术的改进体现在能力密度的指标上 。
然后会把这个 ,因为或你可以这么理解 , 就是我们现在提到的能力密度对应的是 Scaling Law,但其实 o1、R1 它增长的是 Tester Time Scaling 或者叫 Inference Time Scaling Law, 它其实是对应的两个不同的阶段 。
然后它同样的 , 那我们的 Densing Law 可能也要有面向 Scaling Law 的一个版本 , 然后面向后面后训练的这么一个版本 。
不过相关的建模我们还在进展过程当中 。
提升密度27:08
对 , 那具体怎么去实现密度的提升 , 就可以展开说一说 。
其实分为架构 、 数据 、 然后学习算法 , 然后软硬一体 , 就是 Infra 四个层面 。其实这已经是整个模型 pipeline 上比较完整的四个方面 。
我们现在通过做相当于是大模型的密度法则的相关的工作 ,其实我们会发现不管是模型的架构 , 包括就是稀疏注意力 , 包括像 DeepSeek 引领的 , 就是今年的相当于细粒度的这种 MoE 架构 , 那么其实都是在这个方面的非常典型的工作 。
那么这种在模型架构上的创新 , 那它一定是会往更高效的角度去走 。 第二个方面就是数据治理 ,也就是说我这个世界上的已有的数据和这个世界上还没有的数据 , 那我如何能够为了模型能力的提升 , 我能够更好的去寻找学习的教材 。
那这件事情本身现在看对于模型能力提升的效率和它的上限影响也都非常大 。 你就可以想象一下一个小朋友 ,他从小到大 , 你给他的是一套非常精心挑选的教材 , 精心准备的教材 , 还是说啥也不管 , 就是直接给他乱七八糟的东西让他去读 , 显然结果是不一样的 。
那么第三个其实就是我们把它称为叫做模型风洞 ,也就是我们要寻找模型成长的规律 。 那我们能不能做到以小见大 , 就是我们做大量的小的模型的实验 , 我们收集的这些经验的这种数据 , 能够让我们预测出我们即将要训练的大模型在什么参数 、 什么数据配置下, 然后它能够达到更高的效果 。
我们能不能在模型还没有训练之前 , 我们就有可能预测出它的能力上限会是多少 。 那么这种对智能的能力成长的这种规律的把握 , 那么当年在 OpenAI 是被称为叫做 Predictable Scaling,也就是说它提出 Scaling Law 本身不只是说找到了这条 Law, 这条发展的曲线 ,而是同时能够找到我可以通过小模型来去预测大模型能力的这么一个规律 。
那么这个规律其实对于我们去更好的去利用这个规律 , 然后来更好的去设置大模型的相关的这种配置 , 就具有举足轻重的作用 。
那么第四个就是我们会看到模型它是要伴随着硬件来共同成长的 ,也就是说这个模型它是要在一个具体的硬件上, 然后来去发挥它的作用 。
所以未来也一定是要在训练和使用的阶段都要实现一个软硬协同的这么一个设计和优化 。 所以就是这几个要素其实都对模型的密度 , 对这个模型的效果 , 就是它到底是用越少的计算量 、 越少的能量的消耗来去实现一个更强的能力 , 那么都具有非常重要的作用 。
我们其实在推出密度法则之后 ,其实我们现在正在推进的工作 , 就是希望能够定量的发现 , 就是模型的架构 、 数据的治理 , 然后以及模型的风洞等等 , 然后它们对于模型密度 、 对模型的能效的这么一个影响的关系 , 就是它们之间的定量关系 。
现在来看其实还没有找到特别的清晰 ,但是我们有相应的这么一些经验性的结果 。
其实围绕这四个方面 , 我们应该可以看到现在市面上有很多相关的工作 。 第一个就是架构 , 就可以看到其实 Transformer 就两个部分 ,FFN 和 Attention。FFN 现在基本上大家已经共识就是要去做细粒度的 MoE, 然后细粒度的稀疏 。
你可以解释一下 FFN。
叫做 Fit for Work Network, 这个解释可能就是一个怎么说 , 一个比较稠密的一个矩阵层 , 然后稀疏的 MoE 其实就是说在那么大的一个矩阵里面 , 我切分成好几块 , 然后每一次计算我只选择其中一块 。
这个其实是 DeepSeek 揭示给大家的 。
为什么 MoE 这个事是 DeepSeek 揭示给大家的 ,不是像 Mistral 这些不是更早做 MoE 吗 ?
对 ,但是相当于是 Mistral 做的那些 MoE。
包括 Minimax 也更早在做 MoE。
其实 MoE 很早我们在做 , 就是原来我有一个博士生 ,其实大概张正彦 , 大概 2020 年、2021 年, 其实在早期就开始做 MoE 的架构 。
就 Mixtral experts 本身这个概念应该是上个世纪 90 年代就已经有 , 然后用到了 Transformer 里面应该其实是 2020 年左右 。 然后当时有 Google,有我们团队其实都在做 ,但的确客观上来讲是由于 DeepSeek, 然后把它真正的做到了一个这种最大的模型上, 然后做 work 了 。
因为其实它的规模化 , 然后以及说它真正的能够支持高效 , 就这件事还是有很多工程上的挑战 。
所以它是一个就是 DeepSeek 的揭示的意思是说 , 它从一个大家已经做了一段时间的这种想法和理念 , 然后它给它在一个比较大的规模上实现了 , 然后大家觉得这事很有效 。
对 ,其实这个是你可以在大模型发展行业里面 , 你可以看到从技术上来说其实没有太多新东西 。 你可以看到现在大家很火的强化学习也是上个世纪 , 就已经非常火热了 。
然后你说深度学习 、BP 等等 , 这些都是上个世纪的产物 。 然后放到现在其实让核心还是因为算力的增长 、 数据的增长 , 使得它能够发挥它的作用 。
所以我们讲 DeepSeek 揭示其实也不是说 DeepSeek 发明了这件事情 ,因为很早 GPT-4 出来的时候大家就在讨论它就是 MoE 架构 ,但是具体说它怎么样 Scaling 到那么大 , 那其实没有形成一个共识 。
然后大家也不敢一下子就是说我花很多的算力 , 我就是选择一条跟主流不一样的道路 。 所以其实 DeepSeek 做到这件事情大家就开始 follow。
而且它是开源的 。
对 ,其实就是揭示这件事情是表示它从一个非共识到共识的这么一个转折点 。
对 , 你可以继续说 , 就是在 FFN 大家会一个比较大的共识是做 MoE 的架构 。
对 , 然后你其实可以看到今年的一个很重要的一个转变 ,其实是就刚才提到的 Agentic 以及深思考 , 对吧 ? 其实这两个点其实都揭示了大模型要变成长模型 , 就是我要让模型它能够接触到足够多的上下文 , 就是你比如说你给的代码的一个仓库 , 然后或者是 Deep Research 就是海量的外部信息 。
那在这样一个场景下的话 , 那它要接受很多的输入 , 然后产生很多的输出 , 那大模型势必变成长模型 。
所以 Attention 就成为了非常重要的瓶颈 。 所以现在大家都在做这件事情 , 就是包括线性也好 , 包括稀疏也好 , 然后其实也有一些传闻 , 就是什么 Gemini 等等 , 就是都是用的 sliding window 滑动窗口这个模式的稀疏注意力 , 然后混合稠密注意力来做的 。
那你就看到其实不管是开源闭源 , 大家都在干这件事情 。 那其实这个事情架构体现的就是 , 我们很形象的称为它是智能的容器 , 就是说我能用更少的计算量达到相同的效果 , 那其实是架构它带来一个比较重要的改变 。
数据治理34:29
然后另外一个其实数据这个层面 ,其实今年也会有一个比较大的一个共识 , 就是因为去年也很多人都提到了 , 就是 Scaling Law 撞墙了 , 然后公开可获取的数据枯竭了 。
然后那其实下一步很重要的一个点 , 还有一个增长点是合成数据 , 然后以及更高质量的清洗数据 。其实这两个增长点是大家现在也都在发挥很大作用在做的 。
这点上你们可以分享自己是怎么做的吗 ?
对 , 这个的话我们其实会有一个内部的一个 pipeline, 这个 pipeline 大概是从 L0 一直到 L4, 就是大概不同的 level。 你大概可以设想就是 L0 这个层次是相当于是数据的收集 , 就我去抓取也好 , 采买也好 , 形成的最原始的数据 。
那么 L1 相当于是过滤 , 就相当于说把一些重复 、 把一些垃圾给过滤掉 。L2 相当于是选择 , 就是相当于再从这些数据里面选择我们认为高质量的这么一个数据 。L3 相当于是合成 , 相当于说我们再去做数据的合成的这种工作 , 就是合成或者是改写等等的 。
就相当于说它不再是对已有数据的简单的这么一个处理 ,而是说我会去产生一些这个世界上没有过的数据 。
那 L4 其实就是相当于是我们把它称为叫验证数据 , 就是相当于我们会经过一些形式化或者是人工的方式去确认这些数据是教材级的这么一些数据 。
譬如说最近在国际上有一个非常有名的预训练的数据集叫 Fanweb, 我们做了一件什么事呢 ? 就是我们用我们的这套数据预处理的 pipeline, 把这个 Fanweb 我们做了一个精炼 , 就相当于我们又去精选了它的相应的数据 , 得到了一个它的十分之一不到的这么一个叫做 Ultra-FinWeb。
那我们就会发现用这个 Ultra-FinWeb 训练的模型能力比原始的 Fanweb 训练的模型的能力还要再高 。 那你就可以设想我就是用不到十分之一的数据 , 然后我就可以学一个更好的模型 , 那显然我的训练的成本就可以下降到十分之一 。
就这个其实是我们能看到的 , 就是你数据治理本身带来的这么一个价值 。 那么其实这还只是预训练的这个部分 , 那还有后训练 , 就是包括 SFT, 包括强化学习 , 相应的这些数据 , 你的合成的程度 、 合成的水平 ,其实都非常大的去影响你的模型的能力的上限和效率 。
譬如说上海交大就有一位教授叫刘鹏飞 , 这个非常年轻的一个老师 ,他最近就是做了一系列的工作 , 叫 Less is More, 就是说我能用更少的数据可以去得到更强的能力 。
本身也是这个方面的一些非常好的这些结果 。 所以我们其实会看到 , 就是在数据治理这个方面 ,有非常多的信号告诉我们 ,其实我们需要做一个更精致的 、 更精炼的这么一个数据来让模型去学 。其实一个非常终极的问题就是 , 作为人工智能发展到大模型的阶段 ,其实它非常典型的特点就是数据驱动 , 就是你所有的智能都是来自于数据的 。
那我们就要问一个问题 , 就是假如说我是构建某一个水平的模型的能力 , 我可以构建的最小化的数据集会是什么 ?
就是这件问题 , 这个问题其实我觉得可以就是持续的去探索 。 那么这个事情也有助于我们去相当于说去追寻 , 就是人工智能比较终极的一些问题 ,也就是智能到底是什么 。
总之的话就是我们内部有一套比较复杂的 、 完备的一个分层的一个数据治理的体系 。 当然我们应该会在最近几个月会发布一个这个方面的一个我们的报告 , 然后以及我们整个的数据的样例 , 就是做一个数据的整体的一个开源 。
您说的这个数据的开源是指开源最后数据的就是这个结果 , 还是说这个 pipeline 本身会开源 ?
数据的结果和我们处理这个数据的一个整体的一个架构 , 就是这个我们会以一篇论文的形式来告诉大家 , 报告的形式 , 就是数据体系会开源 。
可能应该开源一部分 。
对 , 会告诉大家就是说你大概需要做成什么样子 。其实我们在过去几年也在数据这个方面开放了很多样例 , 包括像 UltraChat、UltraFeedback 等等 , 就包括刚才提到的 UltraFinWeb。其实我们想告诉大家的就是数据的质量和数量其实的确是这个模型它能够达到一个更高水平的一个非常重要的基础 。
刚才说模型架构是智能的容器 , 那么数据的话就是模型学习的教材 。 就这个是没有什么好不公开的 ,因为本身对于 AI 这个领域 , 就开源共享是共识 。
但是同时的话其实我们会看到就是自从大模型出现之后 ,其实构建一个大模型或者构建一个智能的系统 , 本身会变成一个非常复杂的一个精密的体系 , 就是它里面包含的环节特别的多 , 对吧 ?
我们只是列出来了里面比较重要的四个方面 , 对吧 ? 架构 、 数据 、 学习 , 还有硬件 ,但是里面的每一个部分又包含非常复杂的这么一个体系 。其实你看像 DeepSeek 它公布的 , 它的 DeepSeek V3, 然后它的 contributor 大概是 100 多人, 我认为那个本身已经算是一个非常精炼的一个体系了 。
你就可以设想就是在全世界范围来看 , 可能是数百人的一个团队 , 甚至上千人可能都是有可能的 。
对 , 我觉得它这个知识和成果产生的方式也很不同了 。 因为以前的论文可能就是比如说四五个或者什么七八个这种作者 , 对吧 ?
现在就是报告下面都是一片 。
是的 , 那我们可以把这个说完 ,因为刚才说了是这个模型的架构还有数据 , 再往下还有算法和软硬结合 。
对 ,其实算法也是一个很重要的点 。其实算法大家是比较能有感触的 ,因为其实预训练 , 然后到今年大家都很关注的强化学习 。
然后这件事情其实强化学习做到现在 ,其实大家还没有解决的一个问题是强化学习的 Scaling 的问题 。 就之前我们一直会讲 Pre-training 要 Scaling, 那它还有 Scaling Law,但是强化学习它的 Scaling Law 是什么 , 然后以及我们怎么样让强化学习能够持续的训下去 , 这件事情是大家一个还在持续探索的事情 。
这个可以展开讲一讲 , 就是强化学习它没有 Scaling 这个是指什么 。 我看伊莱恩那个播客也在讨论这个 ,他觉得就不应该用 Scaling 去描述现在强化学习的状态 。
强化学习41:04
对 ,因为这个事情是大家现在也还是一个非共识的事情 。 就是你可以看到 O1 当时去年你下半年的时候 ,他就讲他用的是大规模强化学习得到的 O1 这么一套系统 。
然后你其实可以看到对比预训练来说 , 强化学习的 Scaling 其实还是完全没有做得特别好 。 预训练现在基本上几十 T token, 然后预训练的步数可能就是几十万 , 对吧 ?
那你现在强化学习基本上大家训个几千步 , 然后 R1 它公布的那个报告也就训了不到一万步 , 就已经能达到在某个任务上达到很好的效果 。
但其实它还远没有到我们认为它已经 Scaling 足够好的一个程度 。 所以其实大家在强调强化学习的 Scaling,其实会讲的是说环境的 Scaling, 然后数据的 Scaling。
因为现在的强化学习很强调 verifiable 的 reward, 就是你可验证的 reward。 那现在来说大家公开的 、 已知的 、 很好获取的这种可验证的 reward 其实就是数学和代码 。
然后但是更多的场景 , 就是你虽然说代码已经很强了 ,但是你像现在这个它只是在解竞赛题 ,但是比如我要去做真实的开发编程 , 那怎么办 ?
其实开发编程这件事情就比竞赛题更复杂 ,因为竞赛题只涉及非常简单的 Python 环境 。 那你我要去做这种更复杂的软件开发 , 就会有背后更复杂的什么第三方库等等。
那其实这些事情都是大家还没做到的 。 所以 IL 怎么 Scaling 是一个很大的一个问题 。 然后你其实可以看到就是 OpenAI 之前 , 之前有那个研究员叫杰森韦 , 然后他经常发推文说这个 IL 多么的 magic, 然后他的 magic 的核心在于一个 unhackable 的 environment, 就是不可被 hack 的环境 。
那其实这个点其实它背后映射的就是我要想办法给强化学习搭建好足够好的这么一个 Scaling 的一个平台 。
那这样的话这个模型它可以在上面真的持续的学到东西 。 这个其实是大家现在在学习范式上一直在讲想要去探索的强化学习这个一个突破 。
当然这个 Ilya 他提到的这个说 ,他说强化学习不可 Scaling,是他认为这种 unhackable 的 environment 实际上是不太存在的 。 或者是说他会认为人类的学习是不是这个样子的 。
因为这个事情也已牵扯到我们对 AGI 下一步的定位 。 就是你看我像现在的强化学习 , 它能做到一个点是 , 你只要在任何一个任务上, 只要有充足的标注数据 ,有充足的人类反馈 , 它在这个任务上就能够达到千分之一 、 万分之一人类的水平 。
像现在什么 IMO 金牌 、LOI 金牌 , 就已经很多大厂都已经 claim 自己已经做到了 。 但是那这样的话其实你可以想象一下, 一家公司它做的一个就是某个具体的业务 , 它可以在这个业务上积累足够多的数据 , 通过强化学习使得它在这个业务上非常的精通 。
对 , 现在也有这个趋势吧 , 就是或者说叫这个风口就 RL2B 什么的 , 我去针对一个真实的商业环境去做这个事 。
对 , 那其实但是这样的 AI 不是我们真正想要的 AGI,是因为我们人类它的学习是很高效的 , 就是我可以在一个新的任务下, 然后通过少量的反馈 、 少量的动作 , 然后我就能够把这个任务学得很好 。
所以这个其实是学习范式上我们可能会面临的转变 , 就是有两种 。 那第一种就是继续 RL, 然后怎么把它继续 RL, 对 , 怎么 Scaling 下去 。
另一种就是你可以看到预训练和 RL 之间的一个区别 , 或者有监督微调的 RL 一个区别就是学习效率更高了 , 就会我们叫 sample efficiency 变高了 。
那再进一步的 RL 还是不够 , 那我未来怎么样让我的 RL 它的学习的效率会更高 。 这里的学习效率就是指怎么样更好的利用环境反馈 , 然后更少量的人工标注 , 它能够在一个新任务上达到一个足够好的效果 。
所以现在有的人会认为 RL 没有 Scaling,是指比如说我给它加更多的算力 , 然后让它训更多的步数 , 它并不一定带来一个更好的效果 。
它只能它在特定的任务上它能带来更好的效果 。
但是它没有 , 它没有就是比如说在更多的下游任务上带来更好的 , 它只能针对那个环境的任务它的效果更好了 。
是的 , 所以现在我们就是大模型领域 , 我们之前很多时候叫 prompt engineering, 现在我们会说什么 reward engineering, 或者是叫就是配环境 environment engineering 等等。
这都是现在来说就是不同大模型时代的新的一些产物 。
所以就是你认为它继续去 RL 这个方式 , 可能不是我们一般想象中的 AGI,但是有可能它在一些具体的场景是有很多用处的 , 对吧 ?
其实像 coding 就已经是一个这样的例子了 。
也不完全 , 就是你要想这个 Scaling 这件事情 , 它是有可能带来泛化的 。 就是你要想我们之前讲预训练 , 讲有监督 , 就是有监督微调或有监督学习这件事情 ,在深度学习时代一直是在做的 。
但是它真正出现 , 它能出现泛化就是通过预训练 , 就是 Scaling 上去之后它就泛化了 。 那 RL Scaling 能不能带来这一个点其实是不好讲的 。
所以我会讲它现在有两种技术路线 , 就是一个继续 Scaling 下去 ,在足够多的环境下 Scaling, 那它是不是就能在新的任务上泛化 , 然后或者是我们就真的需要一种新的学习范式 。
我有一个小白的天真的问题 , 就是 RL 你不能给它构造一个就是很复杂的任务 , 很多样的环境吗 ?
这很难 , 对吧 ? 就是你这个多样的环境其实就很难获取 。 因为你要想就是最简单的 , 比如说我们人, 它能够在这个世界上会获取很多的反馈 , 比如说我跟你的聊天 , 假如我看到你的这个表情已经很严肃了 , 那我会认为我可能说的话已经是不好了 , 那我这个其实就是一种反馈 。
但对强化学习来说 , 我就得告诉你 , 这是 1, 这是 -1。 那这件事情其实就已经很多样了 , 你我怎么能够把整个世界给建模起来 , 给它一个 reward。
这个其实就有点像是 Ilya 讲的那个 value function, 就是这种价值函数是怎么给到模型的 。 那这个其实是一个非常复杂的一个问题 。
对 ,因为我想象一下就是因为人所在这个真实世界的环境里 , 它其实有人是面临很多样的目标的 ,但是人可能在某一个时刻他的注意力是被某一些目标或者说某一些这种反馈给吸引住的 。
但换了一个场景 , 换了一个时空 , 你可能又在注意别的事情 。
所以其实这种价值函数或者是这种 reward model 其实是一个很难的一个事情 。 然后我们也会想一想就是这种 reward model 和真的会做这件事情 , 就是可能它是一个同等难度的产物 , 就有点鸡生蛋蛋生鸡的一个问题 。
假设我能对这个世界建模得很好 , 你做任何的事情我都能给你足够多的反馈 , 那这个 reward 或者说这个价值函数 , 它为什么天然的不是一个 AGI 呢 ?
对吧 ? 那所以就是说我可能要有一个 AGI, 我才能创造出另外一个 AGI 这种感觉 。
那你们自己现在就是在这个算法的去怎么提升的能力密度上, 比如说你们接下来可能会重点做的方向是什么 ?
对 ,其实就还是回到刚才那两个事情 , 就是我们团队其实也有在尝试去补足 RL Scaling 上的一些规律 , 然后我们团队也有一些同学然后做了一些什么 RL 当中的商变化 。
这种商其实就是可以认为是大模型的这种探索能力 。
你说这个商是商增商减那个商还是 ?
对 , 商增商减的那个商 ,其实反映到这个模型里面就是那个 token diversity。
混乱度的变化吗 ?
对 , 或者是说你说这个就是在当前这个 query 下, 然后我这个模型它能通过多次采样 , 然后生成多少种非常不一样的这种回答 , 就是一个非常直观的理解 。
然后会发现就是 RL 的过程其实这种是一种商 , 然后变化成这种 accuracy 的一个过程 。 所以我们也在尝试着去构建这种机制上的理解 。
然后还有一些就是这个面向 Scaling, 我们也会去做足够高效的 Scaling 的框架 。 就是我们希望说这个能够使得这个模型在 RL 的过程里面能够把这个算力用得足够满 , 然后那这样的话我就能够让它训得足够快 。
那未来就有可能是我用这些算力 , 比如训个几万步这些 RL。 然后还有一些更多探索的环节了 , 比如说像这种更像开放域的强化学习 , 就除了这个数学代码以外, 那像这种比如说写一篇论文 , 那这个什么样的 reward 是好的等等。
那其实我们也在做一些这种尝试 ,不过目前来说就是后面开放域的尝试这件事情其实还没有 , 就包括业界也没有一个特别成熟的一个共识 ,其实我们现在也在做这件事情 。
软硬与注意力49:21
那最后可以讲最后一层就是软硬的深度优化 , 软硬这些协调一体的深度优化 。
对 , 软硬协调的深度优化其实这件事情应该说是更是计算机发展到现在的一个核心的主线 。 这个你可以看到就是摩尔定律本身大家会说已经终止了 ,但是因为大家会认为 CPU 已经不再 , 就这种通用的计算设备已经不再像这个摩尔定律预测的一样 , 就一直能够指数的翻倍 。
但是像 GPU 它这个 , 或者说英伟达它还在支持着摩尔定律的发展 , 现在或者叫黄氏定律 ,其实就都是在做这件事情 , 就是说我们怎么能够把这个算力用得足够满 。
那其实是这个一个很重要的事情 。 假设我这个 GPU 算力 , 然后我只用满了一半 , 然后剩下一半的计算资源都消耗掉了 , 那肯定是一个非常不经济的做法 。
所以软硬协同其实就是在想是说我要怎么去把这个算力用得足够满 。 你可以看到 ,其实可以看到就是大模型或神经网络发展到现在 , 核心胜利的那些架构 , 胜利的那些专家 , 那些方法都是软硬协同的方法 。
像 Transformer 最早的提出 ,其实核心的问题就是因为它认为 Attention 这种架构是能够把 GPU 利用率打满的 , 所以它提出来这个点 , 然后 Transformer 出来了 , 然后这个 Transformer 能够把 GPU 打满之后大家就那我就可以 Scaling 了 , 就把一个模型做得很大 。
那之前那些什么 LLCM、CNN 等等都没有办法做到这件事情 , 那这个 Transformer 就胜利了 , 然后从这个出现了 GPT-1,但是 GPT-1 到 GPT-3 的话 , 那中间又会有很多这种工程心理的问题 , 然后这个大家就需要这个怎么把这个大的集群 , 然后这种通信给用满 , 使得这种大的集群能发挥它足够多的作用 。
然后你再往后像这种 Attention,其实现在大家用的什么 Flash Attention 等等 , 那它也是面向硬件去优化了这个 Attention 的这个计算 。
我们上期节目有聊到过这个 。
对 , 所以其实软硬协同这件事情一直是 AI 或者是乃至计算机行业发展一个主旋律 。 它需要的是两个方面 , 一个就是面向现代的硬件设备 , 我们要去设计更好的算法 , 那其实也是我们上次聊那个稀疏注意力一个很重要的点 , 就是我们为什么会去设计这种分块的注意力 , 然后那其实天然的就是因为 GPU 的这个计算特性导致的 。
然后还一个很重要的方向其实就是面向现在的这个 AI 设备 , 我们怎么去设计这个硬件 。 那你可以看到现在这种所谓的手机端的 NPU, 然后以及这些这个英法层面的这些努力 , 然后其实都是在做这件事情 , 包括 DeepSeek V3 它的那个技术报告里面也甚至就是在提到它甚至深入到底层去改那些汇编语言 , 然后使得说它真的能够把这个模型支持得足够好 。
那其实都是这种就是两边在协同努力达成的这么一个进展 。
因为你们自己其实今年 10 月也更新了你们在这个应该算是模型架构上的一个变化 , 就是这个稀疏注意力 InfLLM 的第二代 , 对吧 ?
今年 10 月开源的 。 它这个相比你们之前的第一代的更新和提升是什么 ?
其实我们开源是在 6 月份了 , 就是我们 6 月份第一版那个 MiniCPM 4 的时候就已经用上了 , 然后是在 10 月份把这个技术报告和一些这种训练数据 、 基座模型等等全都开放出去 , 给大家去使用 。
它相比于第一版的一个核心的一个改变 ,其实也是受到了 DeepSeek 的一个启发 , 就是要做到这个原生稀疏 , 就是我在训练阶段它就是足够稀疏的 。
这样的话就相比于这个我们第一版其实是在推理阶段去做稀疏 , 它有一个优点的 , 第一个是我训练的时间能加速了 , 第二个优点其实我稀疏度能够降低下去了 。
就之前这种推理阶段的稀疏可能 50% 左右的这个稀疏程度 , 然后同时当时推理阶段的稀疏只能类似于我们叫 pre-fitting, 就是长文本输入能够加速 ,但对长文本输出其实做得不是很好 。
那在这样一个第二代的版本里面 , 我们就把这个做到训练里稀疏度能够降低 , 然后现在基本上 128K 去需要 Attend 的 4-6K 的 token,也就是说不到 5% 的一个稀疏度 。
然后这个同时我们这个算子也能支持这个长输出 , 那这样的话我们去做这种深度思考 , 然后包括做 agent 这些领域的话 , 这个方法都是比较实用的 。
你刚才也讲到就是这个 DeepSeek 里面出的那个 NSA, 它是一个块状的 , 就是去选这个 token 的这么一个方式 。 然后我看他们 9 月更新的 DeepSeek V3.2, 它的里面的注意力又改了 ,他们又新取了一个名字叫 DeepSeek Sparse Attention,DSA。
然后相比 NSA 的话 , 我理解它的那个块状选取的方式好像是变得更细了 , 它就怎么去解决计算上的问题了 。
但这个其实这个计算上的问题 , 这个就可能太计入细节了 。 就核心可以解释的一个点就是 DeepSeek 的那个架构 , 它已经不需要解决这个仿存问题了 , 就是它不需要解决这种存储带宽上的问题了 , 然后它已经能够做到就是全被计算给绑了住 , 所以说它能够去忽略这个问题 。
但是对大部分的这个其他的模型而言 , 或大部分的其他部署场景而言 , 这个问题依旧存在 , 假如用它那个 DSA 的架构 。
然后可以强调的一个点 ,其实它那个 DSA 相比于 NSA, 这个也是我们在 InfLLM-V2 里面去批判的一个点 , 就 NSA 当时它做出来那个架构 , 它有两个缺点 。
第一个缺点就是它对短文本非常不友好 ,因为它拆成了三个注意力组件 , 那这样的话对于短文本而言 , 它三个注意力组件都得算 , 就这个计算成本直接乘三了 。
然后第二个是说它对于后训练不友好 , 就是说对大部分的模型而言 , 我们现在的训练范式就是短文本预训练 , 然后长文本只是作为后训练的阶段来做 ,不会说从头开始就是做长文本预训练 。
那 NSA 就没办法做这个短文本预训练 、 长文本后训练这个范式 , 所以它这个 DSA 就把这两个点给抛弃了 , 然后设计了一套这个 , 当然整体架构是还是非常类似的 , 然后只不过是面向这种后训练的范式 , 然后去优化了一些这个设计 。
然后我们 InfLLM-V2 当时也是觉得它这两个点不好 , 然后我们就提出来这样一个新的一个方案 。
然后因为刚才讲的是稀疏注意力的改进嘛 , 然后前段时间我和 DeltaNet 的核心作者杨松霖聊过线性注意力的一些改进 ,因为像那个 Quantum Dynamics Labs 的 , 还有 Kimi 有一个 KDA, 名字和那个什么 DSA 很像 , 然后他们都是做了一些线性注意力的改进 , 然后混了这个 DeltaNet 和 Fluid Attention。
然后当时杨松霖也提到他觉得下一个方向 , 就大家在探索的是说我直接用线性注意力去混稀疏注意力 , 你们是不是也有这方面的一些探索 ?
对 ,因为这件事情大家都能关注到嘛 , 然后其实可以你可以这么类比 , 就是线性注意力它对应的方不是全注意力 ,而是 sliding window, 就是因为 sliding window 天然的就是这个常数项的存储 , 然后能够去做这种长文本的处理嘛 , 然后它的对应项是这个 , 然后 sparse 对应的项才是 full attention, 就是全的重密的注意力 。
所以其实这两个方向在未来应该是要合并在一起的 ,因为现在你其实可以看到有很多的工作像就 KDA 也好 , 然后 MiniMax 也好 ,他们其实都在尝试着做就是线性注意力混合重密注意力 , 然后其实可以看到它能够在这个很多场景下能够保持对长文本的高效处理和效果 。
然后那未来的话 ,其实这个线性稀疏应该是一个自然的一个想法 ,但其实我觉得现在一个急需解决的一个问题 , 现在大家关注所谓的长文本 ,其实还是关注在之前那种长输入的问题上 。
然后其实我觉得现在的长文本就像我刚才提到的 , 它的发展路径一定是面向未来的深思考和这种 agent 场景 。
那面向深思考和 agent 场景的话 , 它更应该处理的内容就是它会有很长的这种输出 。 那所以面向这种长输出来说 ,其实现在很多这种线性注意力它的验证是远不够的 。
所以你其实可以发现就 MiniMax 为什么从这一次就是 M1 做这个 。
Latent Attention, 对 , 线性注意力混 Fluid Attention。
对 , 然后到现在用全 Fluid Attention, 我觉得一个很重要的原因就是 M2 它想主打 agent,但是可能直接迁移过来会发现这件事情 somehow 的还是有点性能上的损失 , 所以它最终选择了 Fluid Attention 这条路径 。
所以我认为其实这也是大家现在关注长文本这个有点偏颇导致的一个很重要的一个原因 。
你年初的时候不就说应该更多关注长输出吗 ? 就这事到现在也不是共识是吗 ?
我觉得是 。 对 ,因为就是这件事情大家可能还是会认为这个长输入很重要 , 就是给你喂一本书 , 然后问你个 QA 很重要 。
长输出其实是因为 COT, 所以变得更重要了 。
对 ,以及包括 planning, 就是我得比如说像 agent 的话 , 我得去规划好我 1、2、3、4、5 个步骤 , 然后那你最不能做到一件事情 , 我做完第二个步骤 , 我把第一个步骤做了什么事情给忘了 , 然后反过头来再做一遍 , 对吧 ?
所以其实就是这种深思考 , 然后这种多步的 planning 的这种难度 ,其实是对现在的长文本架构一个新的挑战 。
然后你说线性注意力在这件事情上表现得不是特别好 , 还是跟线性注意力本身它更容易遗忘之前的一些内容有关 。
对 。
在长输出上它即使混了 Fluid Attention 也不能解决这个问题吗 ?
就得看你混多少了 。 那之前大家都很激进的 , 像 MiniMax 它是 1:7 的混 , 只有一层 Fluid, 七层的线性 ,但是我这个我估计到后面他们有点没绷住 , 然后导致他们最终选择了 Fluid Attention。
我理解这个方向是有未来的 , 就是它应该是能够解决掉的 ,但是可能还需要一点时间 。
那你们在自己的下一代的比如说旗舰模型上, 你们会采取什么样的架构 ?
你可以预告一下 。
还在试 , 还在试 。
对 ,但是肯定一个肯定的点是一个全稀疏架构 , 就是 FNN 也稀疏 ,Attention 也稀疏 ,但具体 Attention 会不会再进一步的 , 那可能还得我们在更多的实验上去尝试 。
对 , 那接下来就是想延展讨论一下这个密度定律 , 就有了这个定量的描述之后, 对研究界还有业界有一些什么影响 ?
影响与落地58:53
就比如说有观察到比如说你们自己的行为 , 包括你就其他这个行业里的其他角色的行为有什么影响 ? 因为其实你们发出来应该有一段时间了 , 对吧 ?
就在这个杂志刊登之前 。
其实那个首先我觉得对我们自己内部 , 就是我觉得是一个统一思想的一个非常重要的一个点 。 就现在大家就是不管是做模型架构的创新 、 数据治理的创新 , 还是说这个风洞的建设 , 然后以及软硬一体协同 ,其实相当于有了一个统一的一个评价的一个标准 , 或者是一个指标 , 然后这样的话其实大家就可以更容易地去形成共识 , 然后来共同推进 。
因为其实这个我觉得可能它跟说我把模型简单地训得越大 , 然后让它去更能力更强 , 这个我觉得还是一个不太一样的一个取向 。
就这个我觉得是我们内部的一个非常重要的一个体系 ,也就是说我们自己内部其实会经常喜欢类比芯片 。 就我们比如说现在去构造一个大模型 , 我们所形成的这个包含架构设计 、 这个数据治理 、 这个学习方法 , 然后以及软硬一体的协同 , 整个这个体系我们喜欢把它称为叫大模型的光刻机 。
那它本身其实是一个很复杂的一个体系 , 那其实是要有一个共同的一个目标 , 然后才能够把比如说我们多达这个上百人的一个团队 , 然后能够形成一个非常好的一个协同 。
这个其实我觉得对内部的一个价值 。 对外部的话 , 我们所能够看到的就是 , 当然其实今年初开始 , 就是也是由于 DeepSeek V3 的这个影响 ,其实你会发现像 Sam Altman, 然后包括 Anthropic, 包括后来就是 Merrymaker 它的那个互联网的报告 ,其实都特别的强调就是 AI 的成本问题 。
所以其实我会觉得就是这个本身是顺应时势的 ,也就是说从今年开始大家开始发现就是这个效率或者是这个能效变得非常的关键 。
原因是在于随着我们要把 AI 真正的广泛的应用的各行各业 , 那么这个事情会变得非常关键 。 同时的话 , 我们会看到就是经常援引我们密度法则的这个报告 , 然后相关的工作基本上是发生在这个具身智能等等的这些专家的这个报告里面 。
就基本上你会可以看到就是在这个具身 ,因为本身它需要构建 , 就是这个相当于是这个机器人的大脑 、 小脑等等的 ,其实它们会对就是这种端侧的这种智能的这个构建的规律 , 可能会有更加敏感的这个需求 。
就是因为它是对延迟这些要求比较高 , 所以它不能就是全部依赖云端的这种模型 。
对 ,因为当时其实就是这篇是发在 Nature Machine Intelligence 上 ,在前面其实有一篇是发在 Nature Communications 上, 就是 MiniCPM-V, 就是那篇文章 。
那篇文章其实里面有一个非常经典的图 , 就是说密度法则和摩尔定律其实是揭示了就是我们在终端上其实可以装得下一个在历史上只能够在服务器上 ,在云上才能装得下跑得动的一个这个模型 。
就那个图就经常被很多这个做具身智能的专家和团队去使用 , 就大家会认为就这个其实是让他们去做具身大脑 ,有了这个非常好的这么一个法理的依据 。
这个其实在帮他们预测就是说至少就是在这个比如说算力或者这个能力密度上, 它能跑在这个具身机器人端侧的这种模型什么时候到来 。
对 , 所以我们知道的就是别人转给我的 , 就是可能很多搞这个机器人的专家 , 可能经常特别喜欢去用我们的关于这个 Densing Law 的这个相关的一些称呼 。
那按照现在的就是你们就是针对之前这两年多这些开源模型做的这个预测 , 就是具身上要能用上的这个端侧的模型 , 然后性能也很强的能支持具身大脑的 , 会在什么时候出现 ?
我们其实就是接下来几年, 就是从今年开始一直到 2030 年, 其实全球的这个一线的这个芯片团队 , 就包括英伟达 , 包括华为 ,其实他们都会有自己的就是基于就是自己的制程的一个路线图 ,也就是说它每年发布的那个芯片大概是什么样的算力 、 仿存等等的这种规格其实都是有的 。
我们其实根据那些相应发布的这个规格 , 我们其实可以算出来就是在这些主流芯片上, 就是端侧的芯片上, 然后可以去加载的这个模型的尺寸 , 然后以及它的激活参数的这个规模大概的这个程度是多少 。
所以我们大概应该是有一个估算 , 就是到 2030 年, 谁要是可以在端侧上, 然后能够部署一个超过 60 比 ,也就是 600 亿参数的这么一个大的模型 , 然后它的激活参数大概可以达到这个 8 比以上 , 就是大概是这么一个水平 。
当然就是说这个本身是线性的预测 , 就是你也不妨碍说接下来这几年的时间可能会出现一些非线性的这么一些突破 , 就这个单纯从线性上来讲大概达到这个水平 。
所以我们同时如果叠加这个密度法则 , 我们会认为就是到这个接下来的这五年的时间 , 我们一定是可以把一个 GPT-4 到 GPT-5 水平模型的这个能力 , 然后可以放在端侧上, 然后就能够形成就是每个用户自己专属的这么一个能力 , 就大概是这么一个大概估算 。
我觉得这个对手机这类相对成熟的移动设备应该还是挺有用的 。
对 ,是 , 就是所以就是手机 、 机器 , 人 、 车这种机车 , 包括 PC, 就是这几大终端 , 现在来看它的这个顺序应该是车现在是今年就是这个铺开的非常的快 。
因为车它对功耗这些要求更低一点 。
更低 ,而且它空间更大 。 那么再次一级就是 PC, 那么再次一级就是手机 。 那么本身机器人又另当别论 ,因为本身它现在也还处在一个快速发展 , 还没有固定下来的这么一个状态 。
但是相对来讲我们会觉得机器人它的这个空间应该也还可以 , 只是说它自己本身已经有非常大的功耗的这个问题 。
所以我们会认为就是在那顶上去加载一个特别高算力的这个大模型 , 可能也还是需要一个再进一步的去探索的这么一个方向 。
而且我觉得对手机 、 电脑还有车来说 , 就是你在上面放一个 GPT-4、GPT-5 水平的模型 , 我觉得是比较容易想象到它能做什么 、 能带来什么价值的 。
而具身智能可能现在它有一个别的难点 , 就是说你一个什么样水平的模型在那个上面可以 work,因为其实大家没有完全研究出来说这个具身模型到底是怎么做嘛 。
其实车你可以看成是一个更加成熟的机器人, 它的相对的 action 比较简单 ,但是就是说即使是在车上, 你比如说自动驾驶这个小脑的模型和智能座舱这个大脑的模型 , 现在来讲其实还是相对独立的去发展的 。其实未来机器人它一旦它的那个小脑的那个部分相对稳定之后, 然后再有大脑 , 那其实接下来还有一个命题就是大小脑如何协同 。其实就是在这
些方面 , 我理解就是这个机器人这个方向 , 它连小脑可能都还没有稳定下来 , 所以就还不用 , 还谈不上就是大小脑如何协同的问题 。
不过我觉得 VLA 算是这种尝试 , 对吧 ? 就大家设想的一个协同起来的方式 。
对 , 所以我觉得现在还处在战国时代 , 就是现在大家这个百花齐放 。
那对你们来说其实你们很多应用也是在这些端侧上是吗 ?
我们所以就是按刚才我们所说的顺序 , 就基本上现在今年来看就是在车上的进展特别大 ,在手机上因为它相对算力还比较受限 , 所以你看就是我们其实也试过就是 Apple Intelligence, 它的这个整体效果其实还比较受限一些 ,但是我们根据我们刚才的估算 , 应该会在未来的两到三年就会产生一个非常大的一个跃迁 。
你们可以讲讲你们和车企的一些合作吗 ? 就或者说在汽车这个场景上的一些落地 , 就这一类 。
落地的话是这样 , 就是我们今年应该最早的落地的是那个长安 、 马自达的一款车型 , 然后后面就是吉利这个有一款车型 , 然后基本上在今年就已经量产 。
它的我觉得就是速度还比较快 ,因为我们是在今年上半年就入场 , 然后开始这个相关的合作 ,但是在今年下半年就能完成这个量产的这么一个动作 。
基本上这个在这个车这个行业本身还是非常罕见的 。 就我们前面其实有过一个推送 ,其实是介绍这个方面的这个最新的进展 。
那么明年的话 , 我们陆续应该会有超过 6 款以上的这个不同的车企的车型 , 然后会加载我们的这个模型 。
基本上我们在一线的感受就是由于我们特别强调密度法则 , 那你就可以想象这个在车这个领域 , 智能座舱它本身每一款车型它都是会约定好它用哪一款芯片 。
那么这款芯片同时在约定好它的响应时间 、 它的功耗之后 ,其实你在这个芯片上能够加载的模型的那个参数规模基本上是固定下来的 。
那么密度法则让我们团队能够构建一个密度更高的模型 , 基本上就是在这些车这个方面的这个相关的这个竞争就基本上是处在一个非常领先的一个水平 。
就这个是我们今年就是在车这个方向 , 尤其是智能座舱上, 然后取得非常快的这个推进的一个比较底层的一个逻辑 。
像面壁的模型在车上主要是做什么呀 ? 因为比如说大语言模型我觉得可能比较好理解 ,有些语音交互什么的 , 然后你们多模态 ,其实你们多模态那个开源的那个版本在 GitHub 上的新书下载都挺多的 , 多模态用在车上可以做什么 ?
主要是一些这个现在还处在一个智能座舱的一个初期的阶段 , 主要是用这个多模态的模型去做一些车外和车内的这个相关的一些环境的感知 , 然后同时通过自然语言的方式跟这个车内的这些这个不同的位置的人, 然后来进行这么一个交互 , 来满足他们的这个相关的一些需求 ,并且做相应的这个提醒 。
这个其实现在不同的车厂它对于这个智能座舱的这个功能的定义其实有非常大的这个不同 。 那不同这个层次的这个车 , 它其实也会有相应的这个不同的这个设计 。
比如说一些相对比较复杂的智能座舱的需求 , 可能它的这个功能点得能超过 100 多个 , 就是相当于说你可以在各个方面 , 然后可以跟这个智能座舱的这个应用进行一个非常好的这么一个交互 。
总体的目标是要让这个座舱 , 就是你坐到这个车里面 , 你就能够体验到一个全智能化的这么一个这个环境 , 就这个其实是它的这个目标 。
但是就是目前来看 , 智能座舱还没有达成一个标准化的所有的车 , 然后都有一个共识的这么一个发展 , 还处在一个初步的这么一个阶段 。
就是我想知道 , 比如说像现在做大模型研发的公司 , 如果去把这个模型放到车上, 就像你刚才说它可能一个座舱里会有 100 多个功能点 , 这个模型和功能点之间就是你要去适配去结合 。
主要是一个微调的过程 。
是你们来做吗 ? 还是车企 ?
现在来讲 , 现在来讲是我们来做 。
这个微调大概要比如说要多少人调多久 ?
就是因为我们本身会特别的强调这个事的标准化 , 就比如我们的模型 , 然后我们其实会内部会有一个非常这个标准化的这么一个 SFT 的这么一个工具链 , 然后以及就是如何去做相应的这个数据合成的这么一个规范 。
所以就差不多 , 反正是相对是比较高效的这么一个这个模式 。
就是回到你们 23 年年中的时候 , 您当时也说就是其实面临一个抉择嘛 , 就是在复现了 ChatGPT 的能力之后, 我是继续花大几千万人民币 , 我去训一个比如 140 比的模型去追 GPT-4, 还是说我去做这个更高效的判断 。其实当时这个判断背后是有一个商业逻辑在的 。
像这个是您会参与决策吗 ? 还是 ?
会的 ,因为我们那时候作为创业公司 ,在 2023 年的下半年的时候 ,其实也在寻找我们的商业模式 。 所以在那个时候可能的一个选择就是像很多的这个创业公司 , 就是大模型的公司一样 , 来提供 API 的服务 , 这个其实是在我们的选项之内的 。
但是我们的研判就是会认为这种 API 的服务缺少差异化 , 你比如说都是各家 , 然后来去提供 API, 你的竞争力体现在什么地方呢 ?
当然我们说从密度法则来讲 , 我可以让我的模型 , 然后它的成本更低 , 我可以让 API 的价格更低 ,但是我们会认为在云上这个模式不具备商业化的这个壁垒 。
原因是什么呢 ? 原因是会有一些大厂 , 它会来发挥它的超能力 , 它在其他的方面它盈利非常的多 。
对 , 它可以烧钱 。
它家底很厚 , 它可以烧钱 , 它可以选择在这个方向上我不计成本的去进行推广 。 所以我们会认为在云上来提供 API 对于一个创业公司 , 尤其是家底很不太厚的创业公司 , 我们认为是一个风险极大的事情 。
这个基本上也预判了后面的发展 ,因为 24 年 5 月就开始价格战了 , 就开始 API 的价格战 。
对 , 就是那个价格战我觉得其实是一个非常重要的一个警示 ,因为其实那个价格战本身就是由 DeepSeek 所引发的 。
然后后面大家都跟进了什么火山引擎 、 什么阿里这些 。
所以 DeepSeek 其实本身它也在像我们团队一样都在追求高效 , 就是现在用更高的技术 , 然后来追求用更少的参数 、 更少的计算量来完成更高的这个模型能力 。
那么它在云上的确是能够呈现一个非常高的这么一个竞争力 , 对吧 ? 它可以用更低的价格 , 然后来去进行这个服务的提供 。
但是我觉得我们跟 DeepSeek 不一样的地方是 DeepSeek 它也有非常厚的家底 , 它完全可以不考虑盈利问题 ,但是对于绝大部分的创业公司来讲 ,其实它还是需要考虑自己的这个商业的这么一个这个选项 。
那你们有就是复盘过 ,因为其实你们一直在追求这个高效的这个方式嘛 , 就它并没有在叙事和舆论上形成像 25 年 1 月份 DeepSeek 的那种声势是为什么呀 ?
我觉得还是刚才说的 , 就是从绝大部分的公众来看 , 明显还是说谁家的这个能力能达到一个更高的水平 。
那这件事情我觉得显然是你要去训一个更大的模型才有可能达成 , 比如说几千亿的甚至上万亿的这么一个参数来达成这件事情 。
所以就是对于我们来讲 , 就是我觉得我们现在所走的一条路线 , 可能是更适合我们自己的判断 , 然后以及我们现在的禀赋的一个路线 。
因为对我来讲 , 我不追求这个一炮而红 , 我追求的是我能够坚定的 、 百分百的可以达成目标的这么一条路径 。
譬如说我当然可以选择孤注一掷 , 把我们融到的所有的钱都拿来去训一个超级大的模型 ,但是这件事情一旦它不能够形成商业闭环 , 那它其实就可能会带来一个不可接受的这么一个后果 。
这个对我来讲不是我能接受的 ,因为 AGI 一定会在未来 5 到 10 年到达 , 那 AGI 的这个时代的可以做的事情非常的多 。
那我为什么要去到一个拥挤的 、 可能我们并不占优势的一个赛道里面去跟别人去卷呢 ? 我觉得这不是一个明智的选择 , 对我来讲 。
所以我觉得就是我在哪听到一句话我觉得特别对 , 就别人得到的并不见得是你失去的 。 就是 DeepSeek 火 , 那并不代表着说我也追求高效 , 那我会觉得说是不是我本来应该是像它那样去做 。
我觉得不见得 ,因为其实面向未来 ,AGI 真的是一个非常广阔的天地 , 对吧 ? 你当然是可以追求像互联网时代的 Google 这样的去提供一个公开的这种云的这种服务 ,但是你可以设想就 AGI 时代的这个智能 , 它既可以发生在云端 ,也会发生在端侧 。
那么既然端侧我们看到了它的无限的这个前景 , 既然现在其实没有什么人还注意到这个方向 , 那我们提前去做布局 。
我觉得这个可能是更符合一个这个初创公司通过这个前瞻的布局 , 然后来去进行这个探索的这么一个可能 , 这个更好的这么一个方式 。
我追求的是充满不确定性的确定性 。
刚才也提到就是你们现在试这个 Apple Intelligence,其实它的效果还没有那么好 , 就在手机上 ,因为目前手机上的算力要来能支撑的这个模型的性能可能还是相对受限的 。
就是如果根据你们去观测到的这个密度法则 ,在什么时间上手机 ,因为这肯定是大家最关注的一个硬件嘛 , 然后用的人也是最多的 , 这个上面的模型能力也会变得就是能支持我们干一些非常有意思的事 , 然后非常提升效率的事 。
那我们会觉得大概到 2027 年可能会是一个比较重要的一个节点 。 这个节点意味着什么呢 ? 到 2027 年预计我们可以把大规模强化学习能够实现在端侧的模型上, 就可以进行一个非常好的一个学习的能力 。
那就意味着什么呢 ? 意味着说我们每个人都可以利用我们自己的数据来提供给这个模型作为它的这个学习环境 , 来让它持续的去进行学习 。
也就是说在 2027 年我们可以利用一个端侧的相对不错的算力 , 支持一个具备自我学习能力的模型 , 能够逐渐的成长为我们每个人专属的大模型助手 。
那我想它就可以成为我们所有的这个终端上的智能的这么一个掌握者 。
如果它要在眼镜这么小的体积上也实现类似的能力 ,是不是要更远 ?
我感觉是眼镜可以作为 。
你说手机的配件 ?
对 , 我不太认为就是一定要在眼镜上本身装上这个模型 ,因为其实我最近在控糖 ,因为我要减肥 , 所以我在装一个那个就是监测糖的 , 监测血糖的这么一个硬件 。
是扎在那个胳膊上的 , 对吧 ?
对 , 我们为什么一定要在这顶上搞一个这个芯片或者模型呢 ? 当然也有 ,但是它肯定不用做智能化的东西 , 它只要把采集的数据传到我们的这个 , 譬如说用户它有一个自己的一个终端的盒子 , 只要它能够持续的去收集这个用户的相应的数据 , 来提供相应的智能化的服务 ,其实就可以了 。
我觉得不太需要说我们要让这个智能真正的到所有的这个终端上去 。 我觉得整个人类社会的终端应该就是每个人, 这个人的各种各样的这种更加这个分布的一些 , 譬如说你的眼镜也好 , 甚至你的耳机 、 你的手表 , 然后你的这个各种各样的这种智能的这种硬件 , 那我想就是它完全是可以有一个共同的一个提供智能服务的一个终端 , 就有点像家庭里面的
NAS, 只是说你是一个便携的 , 可以跟着你走的这么一个 NAS。
分布式智能1:17:40
最后想讨论一下就你们关心的更广泛的一些行业趋势 ,其实前面稍微有也有一些聊到的 , 就是我觉得现在大家也会在讨论说这个大语言模型在预训练加强化学习后训练这个方法之后, 会有什么新的方法 , 就下一个不同的方法可能是什么 ?
对 ,因为我觉得一个最重要的点其实就是我们刚才提到的自主学习或者叫自我学习 、 自我进化 , 或者还有什么持续学习 , 反正现在名字很多 。
在线学习是这个意思吗 ?
在线学习感觉属于其中的一小部分 , 就是这名字其实很多 , 那其实还是那个判断 , 就是说现在的强化学习已经能够支持着说我们在任何一个任务上已经能够取得非常优异的效果 ,但这实际上还不是我们人类所拥有的智能的那样的一个呈现 。
所以其实刚才我们设想的这样一个场景 , 未来应该是说这个模型它是一个很好的学习者 , 然后它放在你的终端上或者是放在任何的设备上, 它可以逐渐的学习你所需要它学习的那些任务 , 比如说帮你这个 , 比如说剪播客 , 对吧 ?
或者是帮你这个去写代码等等 , 这些都是你的一些专业的技能 , 你可以像带一个实习生一样把它给带出来 , 然后慢慢的这个帮助你取代你 , 这我觉得是 。
帮助我取代 。
对 ,其实这个应该是一个这个 AGI 下一步非常重要的一个点 。 我觉得其实现在这个包括强化学习也好 , 包括预训练也好 ,是没有办法做到的一个事情 。
这也是说为什么现在会有这个事件模型 ,其实它就是想说帮助模型去获取一个足够好或者反馈的一个平台 , 然后还有一些这个其他的一些各种学习上的范式 , 包括现在那个强化学习之父 ,他也去提到说大模型为什么 ,他说大模型不是通向 AGI 的这种路径 , 核心还是这种 data-driven 的这种学习方式 , 可能还是会阻碍模型就是更高效的去学习一些新的技能 。
然后再往后其实还会有 , 就比如说这个模型有了自我学习 、 自我进化的能力之后, 它在你的手上会成为一个很专业的 , 类似于这种播报新闻的 , 然后播报科技前沿的这么一个模型 ,但可能在我的手上它就是一个研究人工智能本身的一个 researcher。
那在这样一个场景下, 那不同的模型它可能要再往下一步走 ,其实是相互的协作 , 对吧 ? 那比如我这个模型是一个 AI researcher, 然后会有其他的模型是类似于这种 infrared researcher, 那它们怎么样能够让这个 AI 模型跑得更快 , 然后再往后可能是最高阶的就是这种创造的能力 , 比如说我们会去讲说我们人类会不断的产生足够多的爱因斯坦 ,他能够根据已有的一些符号体
系 , 就是比如说基于牛顿定律这些符号体系推导出相对论 ,但是对于现在的 AI 模型来说显然是做不到这一点 , 它永远只能在人类已经定义好的符号 , 这些语言符号上做学习 , 它没有办法搞新创造出新的这种符号之间的关系 , 甚至创造出一个新的符号 。
然后这个可能假设达到这个创造能力之后, 那其实我们会认为这个现在人类社会上所有需要智能的这些工作可能都会被 AI 给取代掉 。
这是我们大概列的这个 AGI 的几步走的计划 。
所以总结下就是自主学习 , 然后是已经完成自主学习的这些 AI 之间的协作 , 最后就是真正的创新 。
对 , 或者叫 AI scientist, 大家现在常提的这个概念 ,不过我们提到这个创新可能更多会是这种创新的 meta 的能力 ,而不是在某一个比如说具体的这个比如说生物医药等等这些领域 , 它去这个做一些只能做这个领域的创新 。
这个也是一个明线 , 它的暗线其实就是相当于是在底层的这个实现的逻辑上 。 我们其实特别喜欢跟这个信息时代的这个芯片发展其实做类比 , 你会看到就是整个这个信息革命 , 我们全球是一个信息化的社会 ,但这个信息化其实它的这个底层的这个支撑其实就是芯片 , 就是算力 。
但是你就可以看一下这个算力的分布大概是什么情况 , 就是我们看到一个统计 , 就是 24 年初中国电信研究院的统计 , 它就说 23 年的时候全国的端侧的就是手机上的算力加在一起的总量是全国的这个数据中心的算力的 12 倍 。
就你大概可以设想就是说虽然云上的算力看上去很大 , 然后一个算力中心它的这个算力也很大 ,但是你架不住全国这个十几亿人可能有几十亿部手机 , 然后它手机上的这个算力总量其实是非常大的一个规模 。
所以过去的 80 年, 相当于是在全球实现了通过算力支撑的这么一个信息化的社会 。 那么这个算力的分布是什么样的呢 ?
也就是对应的这个信息的分布是什么样的呢 ? 其实是分布式的 ,是分布在这些终端上的 , 对吧 ?
我们每个人都拥有自己的一个 , 对吧 ? 以个人为中心的这么一个信息这个终端 , 对吧 ? 我们的手机 、 我们的 PC、 我们的 Pad 等等。
那么你就可以设想未来的智能社会 , 智能的分布会是什么样子呢 ? 就是在 23 年初的时候 , 曾经全球有过一些这个巨头说这个世界上不需要超过几个大模型 , 就可以满足全球的智能化的需求 。
这个跟信息化刚刚开始 ,1943 年的时候 , 就是 IBM 的董事长曾经说全球不需要超过 5 台主机就可以满足全球计算的需求一样 。
所以就是我们可以设想未来几年之后, 智能化它也一定是分布式的 , 原因就是这个世界上本身智能也都是分布在我们每个人的头脑里面 , 我们每个人的这个终端上 。
所以就是我们认为未来智能化的社会一定是要在我们的终端的设备上, 要为每个人每个智能的终端提供这种智能化的这么一个服务 , 这个其实我觉得是未来的一个基本形态 。
那么在这样的一个形态的支撑下, 你就可以想它具备了自主学习能力 , 那就意味着说在终端上我们就可以根据这个用户个人的数据去形成这个人的专属的大模型 , 这个大模型就是你的个人的这个终身的助手 , 它最懂你 , 它是这个世界上最懂你的那个智能大模型 。
那么在云上会有各种各样的这种专家大模型 ,有美团大模型专门懂这个外卖 , 这个有这个滴滴大模型专门懂这个如何去规划这个行程 , 然后有这个抖音大模型懂你的各种各样的这种娱乐的这种喜好 。
但是就是它一定是一个端的这个你的个性化大模型和这些云的专家大模型互相之间的一个协同 , 然后来完成相应的这么一个工作 。
那么在这种情况下会形成所谓的智能体的互联网 , 这个其实我们会对应就是它说的这种协作的这个模式 。
那么这个其实它就是在底层的一个暗线 ,也就是说不为公众所广为认知的 , 它其实是发生在这些计算设备 , 发生在我们的这个底层的这么一个相应的这么一个逻辑 。
这个逻辑其实我们会觉得 Densing Law 会发挥一个非常重要的作用 ,因为它就可以几乎以非常非常低这个用户所没有感知的这么一个成本来开始广为的服务我们每个用户 。
经济与工作1:24:46
在这个未来的设想里面 , 它的这个经济模式是怎么运转的呀 ?
当然这是我自己的观点了 , 就是不见得对 。在我来看就是历史上工业革命一轮一轮的 , 比如说蒸汽革命 、 电气革命 ,其实它大致是属于工业革命 , 它替代的是人的体力劳动 , 相当于是利用机器 , 然后来去达到替代人的机械化的体力劳动 , 甚至说比人的体力劳动能力还要再强 。
那我们这一轮的智能革命是在干什么呢 ? 我是觉得它其实是跟上一轮的信息革命再加上这一轮的智能革命 ,其实是在替代我们人的脑力劳动 , 我们所有的知识工作者 , 我们所有的需要这个人类关于这个世界的知识才能完成的那些工作 。
那么未来只要它是机械化的 、 重复化的 , 那其实就应该由这个人工智能来去完成 。
那我怎么赚钱呢 ? 我如果是一个个人的话 。
首先我觉得第一步 , 你的个人的智能终端其实是能够让你的工作效率变得更高 , 变得更有市场竞争力 , 就相当于说你在你的个人助手的支持下, 你完成的这个工作水平比别人更高 , 然后完成的这个工作量比别人更多 , 那你就可以能够得到更多的这么一个劳动的收获 , 对不对 ?
因为本身你是通过知识然后来完成相应的工作 , 然后来去获得相应的收入的 , 对吧 ?
我觉得这个挺难想象的 , 我觉得在那个描述的环境里 , 我感觉好像也不需要货币了 ,也不需要工作了 。
那我就举一个今年的例子 , 譬如说今年的例子就是代码大模型非常的厉害 , 那不就是相当于是所有的这些程序员其实都要加载上相应的 AI, 然后来辅助着它工作 , 来提高它的工作效率 。
那么对应的结果就是你有了这个 AI 的辅助 , 你的这个生产效率就变得极高 , 那么你其实就可以获得更好的这么一个收入 。
假如说你未来说好 , 那大家用一个通用的这个 AI 的代码大模型都不足够了 , 你需要自己去积累出你自己的一个知识库 , 你自己的这么一些这个已经编写过代码的这么一些经验 , 那么你通过这些经验所构造的这个你个人的这个助手能够更好的帮助你去写别人写不了的代码 , 那你就在这个市场上就会更有竞争力 , 对吧 ?
那它变相的其实相当于提高了整个这个社会的生产力 、 生产效率 。
那今年还有的发生的事就是刚刚亚马逊裁了 1.4 万人。
或者其实应该是说可能是应用模式是说未来其实现在来说你赚钱的方式是通过你的知识和技能赚钱 ,但是在未来 AI 能自主学习之后, 你可以设想这个 AI 本质是为你的知识 , 就你的知识和技能外化的一个替身 。
所以其实未来可能还是那么一种模式 , 就是人机协同的模式 , 你的 AI 它的这个智能水平有多高 , 可能还是取决于你怎么跟它进行协同 , 然后你怎么这个给它足够多的经验 , 然后去教它 、 去带它 。
我觉得可能下一步第一个改变可能会是这样 , 就是未来大家给你付费是因为你家你的 AI 很强 。
所以就是说你设想就是在 AI 时代还能够去工作的人, 那么他一定是一个高水平的知识工作者 ,因为低水平的知识工作已经被 AI 所替代了 。
那么在这种基础上的话 , 那就是说所有的这种高水平的知识工作者 , 那他一定是有 AI 来辅助的 。
那在这个 AI 时代 , 一个低水平的工作者如何变成成长为一个高水平的知识工作者 ?
你的这个专业领域之所以还需要你 ,是因为 AI 肯定做不了 , 肯定有 AI 做不了的事 ,因为我们是一个人类社会 。
你譬如说医学 , 譬如说心理咨询 , 譬如说金融 , 譬如说教育 , 所有的这些这个知识工作特别重要的方向 , 包括法律 , 那不可能离开人啊 。
所以它一定第一阶段一定是 AI 是辅助 ,但是 AI 在辅助的过程中, 它可以通过你的行为 , 可以通过你的反馈 , 它来不断的成长 , 对吧 ?
那它成长到一定的水平 , 那它是不是就可以在某些场景可以发挥一些作用 ?
或者是说可能是你一个人开了一家公司 , 然后你的员工是你的 AI, 然后这个你的成长过程其实就是你这家公司创业这个发展的过程 。
就这种生产力无限大的这个未来还挺难想象的 , 就你会觉得这个生产就非常过剩了 。
生产过剩1:28:54
我对这件事情充满了期待 , 原因是啥呢 ? 我会觉得过去的这几十年, 我觉得人类的发展其实是被绑得住了 , 被什么绑得住 ?
被我们人类自己的知识给绑得住了 。 你像我们过去的这几十年这个信息大爆炸 、 知识大爆炸 , 我觉得带来的结果就是每个人你都只能成为某个特别小的方向上的专家 。
所以我觉得就是这个社会我们人类历史上积累的知识总量已经大到了这一个我们任何一个人只能在里面是一个很小很小的一个拼图 。
那我会觉得如果仍然只是依赖我们人来去完成相应的这么一个前沿探索和创新 , 来更好的继续认识这个世界 , 改造这个世界 , 我会觉得变得越来越难 ,因为你这一辈子你光学新知识就已经学不完了 , 对吧 ?
那不是他有一个例子吗 ? 说举了一个例子说人类知识是一个大的一个球 , 对吧 ? 然后任何一个人的学习到了博士阶段可能就是在那个球的那个边缘 , 可能是在做那么一个小的凸起 。
那你再往后呢 ? 你可能你穷尽一生可能都到达不了那个边缘了 , 那怎么办 ? 我是觉得就得有 AI 的帮助啊 。
所以就在我来看 , 我反而是觉得 AI 的出现局部上某些方面会带来我们的这个就是生产力过剩看上去 。
你比如说代码这个程序员好像大比例的裁员或者怎么样 ,但是同时我们其实看到人类作为整体 ,其实对我们人类已经积累的这个知识的掌握其实是完全失控了的 。
这个其实说到你们说的第三阶段了 , 对吧 ? 就是 AI 它能帮助一些发现 。
我觉得现在其实已经你譬如说 AI for Science, 现在国内很多的包括国家机构等等的都在非常全力的布局 。
你看美国刚刚发的那个创世纪计划也是在做这件事情 , 原因就是在于大家都看到了就是 AI 本身对我们人类这个发现和改造这个世界其实具有非常重要的这个作用 。
你原来可能需要花十几年、 几十年才能完成的工作 , 未来有了 AI 的帮助你可能用几个小时就可以去完成 , 这是完全有可能的 。
所以在我来看 , 我会觉得我们在很多很多方向其实对这个世界还完全缺少认知 , 材料 、 能源 、 整个这个宇宙等等各个方面 , 包括 AI 本身 , 智能本质是什么 ?
不知道 , 包括我们的脑到底是什么样的一个机制 , 它的机理是什么 , 这个世界有太多的未知了 。 所以我是觉得这个智能时代最让人着迷的地方不只是说我们实现了 AGI,而是 AGI 能够让我们更快的 、 更好的能够认识一个更大的世界 。
所以我觉得完全不用担心生产力过剩啊 ,因为就像刘慈欣说的乡村教师 , 对吧 ? 这么低频的这种带宽 , 对吧 ?
口口相传所积累的这么一个人类的知识到了我们现代 , 我觉得已经难以为继了 。 所以我是觉得现在咱们探讨什么生产力过剩啊 , 什么程序员都失业啊 , 我觉得这都是沧海一粟 。
你再过 10 年、20 年, 当我们有了新的材料 ,有了新的能源 , 我们的生命科学 、 我们寿命各个方面都有一个非常大的突破 。
当我们的足迹能够超越地球 , 对吧 ? 我们能够遍布全宇宙 , 那我们还要担心程序员失业的问题吗 ?
对 ,但我这个担心不是从宏观层面的 , 它是从每个人的角度的 ,因为你失业对一个人或者说对一个家庭来说肯定是个冲击嘛 。
但是对我们全人类来讲 , 我觉得是一次大的解放 。
关于未来你有什么担心的地方吗 ? 你刚说的都是很乐观的部分 。
担心的地方 , 担心的地方 , 我担心的地方是我们人类自己会束缚我们自己的前进的步伐 。
你是指什么 ? 你是指比如说监管啊 , 或者说 。
对啊 , 你看现在已经有很多人会说不要去研究 superintelligence,不要去干这个 ,不要去干那个 。 我觉得这个是完全不合理的 。
你就跟说在 194 几年因为说我们有 computer 这个职业 , 我们完全可以用算盘来去完成一些计算 , 所以为什么要研究这个超级计算机呢 ?
为什么要研究大型计算机呢 ? 说这些大型计算机都是用来做军事的 , 用来去做这个毁灭人类的 , 我们为什么要去研究它 ?
所以你的担心是其他人对 AI 未来太过担心 。
你不觉得吗 ? 如果说回到 194 几年 ,因为一些人说 computer 这个东西 , 电子计算机这个东西是用来做军事的 , 所以我们不应该研究它 , 你觉得是合理的吗 ?
我觉得可以审慎 ,但我是觉得凡是能够提高我们探索这个世界能力的事情 , 我们一定要支持 ,不然的话我们就永远的只能够停留在一个这个盲目的未知之域 。
不过现阶段我觉得就是担忧未来的这种担忧 , 然后引来更多的监管啊 , 包括这个什么约束 , 目前还不是这个业界的主流 。
是的 ,是的 。
这其实是比较少数派的声音 。
对 , 所以我也没什么好担忧的 , 我们就努力往前走就好了 。
然后最后想问的是 , 未来一年内你们有什么想验证的问题吗 ?
可能技术上的话还是就是 RL 到底能走多远 。
RL 能走多远 。
对 , 然后自主学习到底应该以哪样的千万的方式存在 , 我觉得这是一个问题 。 然后可能未来一年我们还得再思考一个新的问题 , 就是最早带来的那个 AGI, 它的形态会是什么样 ?
我觉得应该会要在未来 1-2 年之内逐渐的呈现出来 。
最早到来的 AGI 的形态会是什么样是指什么 ?
比如说哪一天 OpenAI 宣称自己模型已经到了 AGI 这个水平 , 你觉得它会是什么样的一个模型 , 或者说它就会怎样一个系统 , 我觉得这是一个很值得思考的问题 。
因为大家现在觉得这种对话已经很通用了 ,但我觉得还远不到 。其实我现在感觉有在思考这些问题 , 比如大家现在会说 , 比如 AGI 未来就是要做人类所有能做的事情 , 对吧 ?
但是其实这件事情我觉得是不对的 。 那其实很简单一个问题 , 就是自动驾驶这件事情未来可能由大模型来做吗 ?
我觉得显然不可能 , 就是它一定会是一个非常专用的小模型做的 , 会比这个大模型要更好 。 那我们会说因为这个大模型做不了 , 比如说人类会做驾驶这件事情 , 说它不是 AGI 吗 ?
我觉得这肯定也不能这么定论 。 那所以说那 AGI 到底是什么 ? 那所以说刚才那个定义就是人类能做的事情它都能做是错的 , 那其实你就得思考它的形态到底会是什么样 。
然后我现在一个感觉就是未来的一个可能 AGI 的形态是一个生产 AI 的 AI, 就是比如说这个它是一个 , 就是 AGI 可能就是说之前那个定义可能是它是一个 2C 的一个定义 , 然后但是我觉得 AGI 应该是个 2B 的一个定义 。
就是说未来我们现在你可以看到我们会有很多的公司 , 很多的这种需要雇佣人去做很多的生产劳动 ,但是呢 , 我觉得未来的可能就是会由 AGI 来完成这件事情 。
就是我跟他说现在我想要有一个自动驾驶的这么一个模型 , 然后跟 AGI 说 , 然后 AGI 开始就是去构建这个模型 , 去比如说生产数据 、 收集数据 , 然后去不断的优化这个模型 , 让它比如说能够在那个特定的算力上跑起来 。
那这样的话我们不需要 AGI 啥都会 ,但它需要会的一个最核心的事情就是生产 AI。 对 ,但是这个也不是一个最终答案 , 我觉得但是我觉得这个问题一定得在未来 1-2 年内去思考 , 这样才能够更好 。
就说我们说的什么自主学习这些都是能力 , 那这个能力它具体应该在什么样一个产品上, 或者什么样一个模型上呈现 。
或者是一个什么用途上去体现 。
对对对 , 对 , 我觉得这是一个很重要的问题 。
因为曹军说的那个就是你从历史上来看 , 就是工业革命的一个这个特征就是用机器制造机器 , 就是你不是用手工制造机器 , 用机器制造机器是机器大生产的一个标志 。
那其实未来的 AI 大生产就是你到了智能时代 , 真正的各行各业都能够把这个 AI 能够用起来 , 那其实是用 AI 制造 AI 是它的本质 。
那么在这个里面其实很重要的一个点其实就是咱们说的这个自主学习 ,因为自主学习就是意味着说这个模型它可以自己去实现一个在某种环境里面的这种成长 。其实我觉得是一种用 AI 制造 AI 的一个雏形了 , 就像它这个 AI 本身它会自我的提升它自己的这个能力 。
所以其实这件事我觉得还是特别期待这个最早明年, 最晚后年, 然后能够有一个这种学习能力的这么一个提升 。
那刘老师您自己想验证的一个问题是什么 ?
就是我刚才说的这个 , 就是自主学习 。
自主学习 。
对 。
明年就会出现自主学习吗 ? 我怎么感觉业界现在对怎么做这个事并没有很多信号 。
这才是很有意思的点 , 就是刚才其实曹军已经提到了叫 reward engineering, 就是其实现在已经是在相关的一些特定的领域其实是可以看到就是如何去通过设计特殊的这种 reward 的这种机制 , 然后来实现一种持续的这种学习 , 就不只是停留在数学 、 代码这两个领域 , 会开始扩展到其他领域 。
最先扩展到了什么领域啊 ? 从数学和代码 。
就是可以通过形式化或者是通过相关的这种方式来提供 reward 的这些领域 , 比如说最近像物理啊等等的这些领域其实有非常大的这个进展 。
核心还是那几个学科吧 。
对对对 , 理科那些进展 。 而且我其实觉得就是现在我们看不到任何苗头 ,但是你要想这个技术发展它是一个有个 scaling 的过程 ,因为你看到这个预训练模型出现到真的被广为人知到 GPT-3 到 ChatGPT 其实是有很长的一段 scaling 的过程的 。
当然最近因为大家关注的多 , 这个 scaling 的过程迅速的在缩短 ,但是我觉得明年自主学习这件事情会成为大家能看到的一个雏形 , 就是比如说它可能没有那么泛化 ,但是比如说在某个任务上它能够逐渐变得更好 。
所以这个明年其实说的是它可能是这个信号出现 、 苗头出现 , 倒不是说被我们被大众接受到 。
不止啊 , 你想之所以能够称为 reward engineering,也就是说 RL 这件事情开始在各行各业大家通过人力然后来帮着去构建这个 reward 到底从哪来是比较好的 。
那么再进一步 , 这个人力越来越少 , 那么其实就可以形成一个真正的这种更加自主的这么一个模式 。
这个东西本来也是一个量变产生质变的过程 , 你就大概可以想象一下现在的 RL 已经开始在非常广泛的在各个领域来尝试它的这么一个这个应用了 。
然后明年可能会看到数学代码之外的更多的这个场景的成果 。
对 , 然后慢慢的再能够汇聚到一起 。 它现在先泛化的是环境 , 然后如果我们把这些所有的环境都让一个模型然后去进行这个学习 , 那是不是它能够掌握更高层的这种自主判断这个 reward 的能力 。
其实回到我们中间讨论过的那个话题 。
对 , 所以我觉得这个是一个很自然的一个过程 。
好的好的 , 那今天非常感谢刘知远老师还有肖朝军博士啊 , 做客晚点聊啊 , 然后分享了就是清华还有面壁合作去研究的这个密度法则 , 它揭示了一个什么样的业界发展的规律 ,以及这样一个叙事可能会帮助大家怎么去统一接下来的目标 ,在一个就是更高效的方式去获得更多的智能 。
然后我们也延展聊到了就是面壁自己在这个密度法则的指引下的一些模型研发 , 还有业界落地的探索 ,以及就说这个密度法则对更广泛的行业有什么影响 。
那谢谢两位参加我们的节目 , 各位拜拜 。
好 , 谢谢 。
尾声1:40:01
本期 《 连点呈现 》 继续推荐我们之前聊过的和提升模型效率相关的几期节目 , 这包括上周刚发的第 143 期 , 我们与 DeltaNet 的核心贡献者之一杨松霖聊了 DeltaNet 和更多线性注意力改进的趋势 。
本期也呼应了相关话题 , 比如我们聊到了 Qwen3 Next、Kimi 的 KDA、DeepSeek 的 DSA 和面壁自己的 InfLLM 等不同注意力机制改进的思路和进展 。
两期也都提到了业界正在探索直接混合线性注意力和稀疏注意力 。 与本期直接相关的还有同样由曹军单人嘉宾的第 103 期节目 《 用 Attention 串起大模型优化史 》。他当时就提到从年初 DeepSeek、NSA 和 Kimi 的 MoA 等成果里得到的一个启发是要把稀疏注意力做到预训练阶段 , 这在今年 6 月开源的 InfLLM 的第二版中已经实现 。
这么做的一个好处就是我们那期聊到的思维链和强化学习被更多使用后, 长文本不再只关注长输入 , 长输出也变得很重要 。
时隔 10 个月 , 曹军这一次提到他认为长输出的重要性还是没有成为一个行业共识 , 是一个急需优化的方向 。
第 103 期既是对注意力机制发展的一个很好的梳理和科普 , 当时的一些思考也必不过时, 比如那期最后我们也讨论了 AI for Science, 这在今年也成为了一个更明确的发展方向 。
本期节目就到这里 , 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。
你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 LatePost。 下期再见
。




