在 晚点聊 LateTalk 中提及的产品。

104: 我给线性注意力找“金主”,字节 say No,MiniMax say Yes
2025年3月3日 · 1:26:50
主播曼祺与MiniMax高级研究总监钟怡然聊全球首个把线性注意力做到4560亿参数级的大模型MiniMax-01;钟怡然称这证明线性注意力可以scale up,但业界仍非共识。这也是MiniMax首次开源,目的是展示架构创新并吸引人才。她解释线性注意力通过调整QKV矩阵计算顺序将复杂度从二次降到线性;MiniMax-01每7层线性注意力混1层Softmax注意力,弥补纯线性注意力召回缺陷,100万Token序列下比全Softmax注意力快2700倍,且混合架构效果优于纯Transformer。她还回顾了自己从2021年押注这个“看起来很美好的泡泡”的经历:自称是全球最懂线性注意力的一批人,找“金主”时字节say no,MiniMax say yes;创始人闫俊杰以约50%把握拍板投入公司超80%研发资源,团队此前做了3700次预训练测试验证可扩展性。她认为稀疏注意力如NSA、Mobile有损且上限低,DeepSeek的NSA只是把稀疏注意力工程化提速;而线性注意力是无损优化,序列越长优势越大。MiniMax计划4月发布整合线性架构、原生多模态和强化学习的深度推理模型。节目最后聊到她的AGI愿景——能持续自我学习的模型,以及DeepSeek爆火后研发加班追赶推理模型的节奏。

102: DeepSeek 启动开源周,大模型开源到底在开什么?
2025年2月25日 · 56:40
本期《晚点聊》由程曼祺主持,邀请西北大学MLL Lab博士生王子涵,围绕DeepSeek开源周及大模型开源的具体层次展开。节目指出,开源不只是开放权重,还包括技术报告、推理框架、训练框架和数据集等层级,而绝大多数公司只开放前两者。王子涵以FlashMLA为例,解释了算子级优化如何提升推理效率,并对比了vLLM、SGLang、字节VERL等社区框架的生态差异。节目还剖析了DeepSeek选择MIT协议、开源最强模型背后的优先级与盈利模式,并谈到开源训练框架需额外投入代码规范化工作。王子涵分享了自己因开源模型被滥用导致推特账号被盗的经历,提出最强模型是否应开源的社会风险问题。节目最后讨论了OpenAI可能的开源选择,以及人类在AGI时代的位置。

58: 光年之外联创再出发,与袁进辉聊 AI Infra 到底做什么?| AI 大爆炸
2024年1月24日 · 1:09:23
袁进辉,硅基流动(SiliconFlow)创始人、前一流科技创始人和光年之外联创,在《晚点聊》本期阐述了AI基础软件在中国商业化为何艰难,以及他为何二次创业押注大模型推理。他从清华学术理想破灭后在微软做出被快手使用的LightLDA,2016年创立OneFlow预判大模型将出现,技术获PyTorch跟进但商业化失败,2023年加入光年之外,被美团收购后再次创业。SiliconFlow专做推理部署,因为训练客户少且集中,推理客户更多更分散,且优化空间比训练大十余倍;团队进光年40人出来35人,现超40人,自研框架Crossing已快于vLLM和TensorRT-LLM,他称OpenAI一天生成一两万亿token,远超训练总量。商业化上他主张全球化,海外需求是国内的几十倍,国内则要绑定算力等客户必付项,希望这次能证明“好技术能赚到钱”。他判断大模型本身壁垒不高,真正的长期壁垒是工程能力;2024年国内模型有望达到GPT-4水平、应用爆发,但超级应用大概率不来自现有大模型公司,芯片也会从一家独大走向分散。他曾听到邻桌评价OneFlow“技术挺好……还不是被收购没赚钱”,希望这次创业能成为更好的范例。
由 PodHood 提供支持