在 晚点聊 LateTalk 中提及的产品。

113: 秘塔闵可锐1:回到故事开始,那些「神预言」
2025年5月5日 · 1:56:09
2023年3月大模型热潮初期,秘塔科技创始人闵可锐断言,中国VC很可能会集体错过最有雄心的中国大模型创业者,并分享了他对预训练范式、创业选择及行业格局的观察。他回顾了从复旦、牛津到伊利诺伊博士辍学,经历波森数据、猎豹后于2018年创立秘塔,因看好大规模预训练而选择法律翻译切入,理由是人比机器更贵。他认为预训练本身才是范式转变,Transformer并非关键,GPT-3只是把规模推到工业界不敢想的地步,并非新架构;AI应用已进入个人开发者、创业公司和大厂所有人PK所有人的战国时代,AI Native的突破很可能在交互。他提到秘塔写作猫注册用户超700万,付费率2%-5%,公司总成本小几千万元且已能自给自足;但热潮对秘塔并非全是好事,财务投资人因担心与大厂直接竞争而谨慎,战投反而更积极。他批评研发投入95%是浪费且不知浪费在哪,OpenAI的关键是找到会花钱的少数研究者并给他们大量资金;中国投资仍循着大佬站台的传统思路,可能错过真正能干事的人。他还预测未来半年厂商将密集发模型但热潮不可持续,拿不到正反馈的团队会速生速死,并会出现二手A100;开源是另一股力量,但真正千亿级开源模型并不多,中国团队多为微调。

108: 与马毅聊智能史:“DNA是最早的大模型”,智能的本质是减熵
2025年3月17日 · 2:18:18
香港大学计算与数据科学学院院长马毅在《晚点聊》中提出,智能是生命对抗熵增的机制,DNA是最早的大模型,35亿年历史中它从DNA进化、神经系统个体记忆、语言文化演进到数学科学,因此机器智能的起点应回溯至1940年代维纳的控制论和香农的信息论,而非1956年达特茅斯会议。他认为知识本身不是智能,智能是获取和更新知识的能力,当前大模型仍停留在类似DNA的强化学习阶段,缺乏闭环反馈和自主纠错,OpenAI o1和DeepSeek-R1的推理更像刷题式的记忆模仿,而非真正的逻辑推理,甚至不如猫狗的适应能力。他预言开源模型终将超越闭源,DeepSeek式突破只是where and when的问题,不是if or not的问题。谈到技术品味,马毅强调它来自探索未知的价值观和严谨科学训练,并透露自己引用最多的成果一度没有任何会议接收,博士毕业时也找不到对口教职。他正在推动港大面向所有本科生的AI通识教育(以一门英语课为代价),并通过忆生科技研发白盒大模型和闭环纠错机制,认为人脑是并行结构,闭环系统才能应对开放世界,而端到端VLA未必是具身智能的正确解法。智能在熵增宇宙中只是短暂过程,但对抗熵增本身就构成生命的意义。

104: 我给线性注意力找“金主”,字节 say No,MiniMax say Yes
2025年3月3日 · 1:26:50
主播曼祺与MiniMax高级研究总监钟怡然聊全球首个把线性注意力做到4560亿参数级的大模型MiniMax-01;钟怡然称这证明线性注意力可以scale up,但业界仍非共识。这也是MiniMax首次开源,目的是展示架构创新并吸引人才。她解释线性注意力通过调整QKV矩阵计算顺序将复杂度从二次降到线性;MiniMax-01每7层线性注意力混1层Softmax注意力,弥补纯线性注意力召回缺陷,100万Token序列下比全Softmax注意力快2700倍,且混合架构效果优于纯Transformer。她还回顾了自己从2021年押注这个“看起来很美好的泡泡”的经历:自称是全球最懂线性注意力的一批人,找“金主”时字节say no,MiniMax say yes;创始人闫俊杰以约50%把握拍板投入公司超80%研发资源,团队此前做了3700次预训练测试验证可扩展性。她认为稀疏注意力如NSA、Mobile有损且上限低,DeepSeek的NSA只是把稀疏注意力工程化提速;而线性注意力是无损优化,序列越长优势越大。MiniMax计划4月发布整合线性架构、原生多模态和强化学习的深度推理模型。节目最后聊到她的AGI愿景——能持续自我学习的模型,以及DeepSeek爆火后研发加班追赶推理模型的节奏。

103: 用Attention串起大模型优化史,详解DeepSeek、Kimi最新注意力机制改进
2025年2月26日 · 1:28:15
清华计算机系刘知远团队的肖朝军与清华电子系汪玉团队的傅天予在本期解读DeepSeek和Kimi最新发布的注意力机制NSA与MoBA:两者都在预训练阶段引入动态与静态混合的块状稀疏注意力,以应对长文本和长思维链带来的计算瓶颈。节目先讲清原理:注意力机制让每个词与上下文动态关联,但标准Full Attention需存储所有词向量并与每个词逐一匹配,因此序列变长时存储和计算按N方爆炸,这也催生了稀疏注意力和线性注意力(RNN回归)两大改进方向。两位嘉宾指出,NSA与MoBA的突破在于用块状稀疏设计(整块保留或丢弃)适配GPU并行与内存访问,并通过Triton算子优化让训练和推理都获得实际加速;静态稀疏(如滑动窗口)虽快但可能错过远距关键信息,所以动态与静态混合成为共同选择,而稀疏训练的性能也被证明可追平甚至超过稠密注意力。他们还对照自己此前的InfLLM与MoA:前者强调稀疏需在块级别做并做到训练无关的推理加速,后者通过识别关键注意力头来保留长程关联;两人在实验中最看重训练曲线(如NSA的Figure4和MoBA的Figure3)和长CoT生成速度,而非传统Benchmark。展望未来,多模态会让序列急剧变长(如一小时视频约百万token),存储/记忆将成下一瓶颈,线性注意力或RNN路线仍是重要理论选项。下期节目将与MiniMax研究员聊其01模型采用的线性注意力架构。

71: “如果相信只靠 Scaling Laws 就能实现 AGI,你该改行了”,与香港大学马毅聊智能
2024年6月11日 · 1:53:00
本期《晚点聊 LateTalk》的嘉宾是香港大学计算机系主任、数据科学研究院院长马毅,他与主持人程曼祺的对话围绕“智能”展开,尖锐质疑当下主流的大模型路线。马毅的核心观点是:只靠 Scaling Laws(更多数据、更大算力、更大参数)无法实现 AGI,因为深度学习网络本质上都在做“压缩”——从图像、声音、语言等高维信号中寻找低维结构和规律;GPT 表现出的数学推理仍是记忆和统计,如同“高分低能”的填鸭式学生,学不到因果与逻辑。他区分了知识与智能:知识是存量,智能是增量,智能的本质是能纠正已有知识的不足并增加新知识。为此他提出“简约与自洽”原则,并用白盒模型(ReduNet、CRATE)从数学上解释神经网络每一层在做什么,称其已接近甚至超越经验设计的网络,能显著降低算力与试错成本。他还批评 AI 威胁论“要么无知要么别有目的”,主张政府应监管技术应用而非技术本身,并透露已创立公司“益生”推动白盒技术产业化;同时梳理了从控制论到深度学习的历史,强调闭环、自主学习和 AI 通识教育的重要性。
由 PodHood 提供支持