144: “大而强”到“小而强”|与刘知远、肖朝军聊密度法则、RL 的 Scaling Law 和智能的分布式未来
2025年12月11日 · 1:41:54
本期嘉宾是清华大学副教授、面壁智能首席科学家刘知远和清华大学博士后、面壁 MiniCPM 文本模型负责人肖朝军,他们在《自然·机器学习》子刊发表封面文章提出大模型“密度法则”:能力密度每 3.5 个月翻一番,用更少算力和数据获得同等甚至更多智能。节目先谈 Gemini 3、Nano Banana 等行业动向,区分“能力更强”和“能效更高”两条主线,并复盘面壁 2023 年下半年放弃花几千万训 140B 模型追 GPT-4、转向端侧智能的商业判断。提升密度被拆为架构(MoE 与稀疏注意力)、数据治理(Ultra-FinWeb 用不到十分之一数据达到更好效果)、算法(强化学习还没有自己的 Scaling Law,有继续扩大规模或寻找新学习方式两条路)和软硬协同四层。他们还预测 2027 年端侧模型能支持大规模强化学习,2030 年手机可跑 60B 参数、8B 激活的模型,能力相当于 GPT-4 到 GPT-5;未来智能是分布式的,每个人可拥有随身“NAS”终端。肖朝军介绍了面壁开源的 InfLLM-V2,将稀疏注意力做到预训练阶段,128K 上下文只需关注 4-6K token,并认为长文本应更多关注长输出而非长输入。最后讨论 AGI 下一步:从自主学到 AI 协作网络再到真正创新,刘知远认为“用 AI 制造 AI”是智能时代本质,他不担心生产力过剩,而担心人类自我束缚。