在 晚点聊 LateTalk 中提及的公司。

177: 详解Kimi K3:强到冲击Anthropic估值的模型什么样?
2026年8月3日 · 1:55:18
《晚点聊》由曼祺主持,邀请RadixArk与SGLang创始成员赵晨阳、华盛顿大学博士生曾致远,从Infra与算法两条线拆解Kimi K3:这款近3T参数的开放权重模型以混合注意力架构逼近并部分超越Claude Opus 4.8等闭源前沿,同时引发对Anthropic估值的冲击与开源安全辩论。节目指出,K3用KDA线性注意力与MLA全局注意力按3:1混合,靠循环状态压缩历史,在百万上下文下获得6.3倍解码加速;其Quantile Balancing以分位数估计替代固定步长调整,支撑896个路由专家中选16个的极端稀疏负载均衡,Per-head Muon则通过逐注意力头正交化提升大规模训练稳定性。后训练部分,K3先用MOPD多教师在线蒸馏合并9个领域专家模型,既降低合版压力又提升迭代速度;在Kimi CodeBench 2.0上,K3得分仅低最强模型4分,成本却只有对方的38%。嘉宾还拆解了Attention Residuals如何让深层模型选择性读取浅层信息,以及Kernel Development Agent如何让早期checkpoint自主优化内核,甚至为国产GPGPU写Kernel。讨论也点明,K3开放了权重、MuonEP、Flash KDA和agent-inv,但未开源RL环境、知识图谱任务系统与原始专家checkpoint——权重是一次训练的产物,环境才是能反复产生下一代权重的'流水线',构成开源模型真正的护城河。最后,嘉宾判断开源模型短期内仍难超越闭源,因为OpenAI与Anthropic内部最强模型通常比已发布版本领先半代到一代,但KDA这类线性注意力混合架构已证明'条条大路通罗马'。

163: 详解DeepSeekV4:Infra巨鲸、百万上下文走进现实、极致效率优化
2026年4月30日 · 1:33:52
本集晚点聊详解DeepSeek V4,SGLang核心开发者赵晨阳(RadixArk工程师)和UCLA博士生刘益枫判定:它并非范式创新,而是沿R1的“测试时扩展”范式,用混合稀疏注意力、Muon优化器、mHC、FP4等互相耦合的工程优化,让百万上下文从理论进入实用。V4放弃了V3的MLA架构,改用滑动窗口+CSA稀疏压缩+HCA稠密压缩的层间分工,换来激活参数占比仅3%、单token推理FLOPs仅V3.2的27%、KV cache占用仅10%的极致效率;但两人也指出,解决同一问题的token消耗反而增加,有“高压水枪浇花”式的浪费。他们具体拆解了四个新特性:Muon优化器已成为检验工程能力的试金石,V4将Kimi Muon Lite的0.2系数改为0.18;mHC是DeepSeek对Hyper-Connection的稳定化改造;Infra侧TileLang降低新kernel开发成本,FP4训练让采样和部署一致,实现真正的物理提速。此外,DeepSeek这次不再披露训练成本,两人认为最终训练成本只是冰山一角;发布延期源于四个新feature耦合导致组合爆炸,但团队流动率极低。节目还讨论了DeepSeek内部评测中9%工程师不会将V4 Pro作为编程首选,以及中美模型路线分化:美国公司追新能力、高定价,中国公司追性价比和工程极限。关于评测,他们认为benchmark会过时饱和,evaluation才是永恒追求;V4也未提出新的能力域,但它的极致压缩和低单token成本,可能成为后续开源模型的起点。

158: V4发布前的DeepSeek:人才竞争、组织特点和独特的AGI目标|Solo
2026年4月6日 · 30:44
梁文锋领导的DeepSeek正因人才竞争、期权定价模糊和AGI目标分歧而经历人员变动,但这家不到200人的实验室仍保持不加班、重原创的独特氛围。主播程曼祺在节目中梳理了近期核心研究员离职:王炳轩被腾讯姚顺雨挖走,魏昊然、郭达雅可能加入大厂,阮冲去了自动驾驶公司元荣启行;直接诱因包括腾讯实习日薪被曝达5500元、字节Seed曾开出4000元,而DeepSeek无明确估值使期权价值难预期,MiniMax和智谱上市后股价翻五六倍也形成财富效应对比。更底层的张力是目标分歧:梁文锋重视国产生态(如换用Tailon算子库)和原创探索(GENIUS、Prover、OCR等),不单纯卷性能,这与他“每天高质量输出难超6~8小时、反对加班”的理念一致,却与外界期待其每次出手都像R1一样惊艳并不匹配。组织上,DeepSeek保持扁平,梁文锋直接带基模架构团队,周会向其他组开放,小团队可自发立项;产品端仅小几十人,至今未涉及AI编程、OpenClaw等热门方向,但梁文锋从2025年秋起强调产品化和商业化,3月招聘已首次提到要招agent产品经理。关于V4,节目称其或于4月开源,至少包括接近300B和500~600B的版本;但同时DeepSeek在OpenClaw模型消耗量中整体排第12(剔除免费模型后进前十),迭代频率低于智谱、MiniMax和Kimi。梁文锋本人几乎不融资、不见投资人,曾长期住酒店、现在租房,也不参与团建,被熟悉的人评价为“特别能抵抗噪音”;节目最后呼吁以平常心看待这家公司。

156: 与 Henry 的「AI季报 26Q1」:OpenClaw、OpenAI vs Anthropic的三重对阵、自进化
2026年3月31日 · 1:52:13
本期《晚点聊》26Q1 AI季报中,硅谷投资人、MoE Capital创始合伙人Henry Yin与主播程曼祺复盘了OpenClaw的爆红、OpenAI与Anthropic的三重对抗和AI自我进化等浪潮,核心判断是:编码智能体正从模型竞争转向系统与生态竞争。他们指出OpenClaw是“AI的iPhone时刻”——通过本地运行、接入聊天App、定时任务和长期记忆,它让AI真正“干活”,成为个人Agent的灯塔;但它也有成本高、不稳定和安全风险,例如Meta对齐负责人因上下文压缩导致安全指令丢失、被agent疯狂删邮件的“生死时速”。Henry还解释了OpenClaw为什么在中国比美国更出圈:飞书、微信等聊天优先生态和便宜的国产开源模型,让它与MiniMax、Kimi等形成天然组合。围绕OpenAI与Anthropic,节目对比了Codex与Claude Code、Opus 4.6与GPT-5.4,称Anthropic收入三个月从90亿美元增至190亿美元,Claude Code年化收入25亿美元超过Cursor的20亿美元,而OpenAI已内部反思“因支线任务分心”。他们还讨论了Andrej Karpathy的AutoResearch:AI在没有人类干预下自主优化训练代码,使GPT-2级模型训练时间缩短约20%,让自进化更贴近现实;同时探讨了持续学习(记忆vs权重更新)、世界模型和新的创业机会。最后,Henry分享了硅谷科技大裁员——Amazon裁1.6万人、Block裁40%、Meta计划裁20%且以全员Token消耗量衡量效率,并展望下季度DeepSeek-V4等看点。

150: 【年末AI回顾】从模型到应用、从技术到商战,拽住洪流中的意义之线|Solo
2026年2月9日 · 1:58:22
曼祺在晚点聊年终特辑中单口复盘2025年AI:1月20日DeepSeek R1与Kimi K1.5同日发布,R1以开源、详细技术报告和557万美元训练成本破圈,推动模型转向Agentic、原生多模态与Coding能力,Claude Code被视为通用Agent,应用进入Agent元年,但Sora App三十天留存率低于8%。巨头之战中,字节跳动豆包成为中国首个日活破亿的AI产品,阿里千问App重做生活助手,腾讯引入姚顺雨改革混元组织并借DeepSeek翻身;春节营销豆包上春晚、元宝发10亿红包、千问撒30亿红包。创业公司方面,智谱与MiniMax先后上市,市值分别为794亿和1284亿元人民币,但收入与美国头部公司差两三个数量级;具身智能25年融资735亿元,宇树人形机器人销量超5500台,数据、VLA模型与本体仍是瓶颈,落地方向有研发、表演、工业、家庭和陪伴。模型研究还在寻找下一个学习范式,伊利亚、哈萨比斯主张从大脑获灵感,AI for Science方面深势科技用机器学习加速科学发现。AI硬件方面,AI眼镜被视为潜在入口,但显示、续航和重量未解;深圳系公司如影石、拓竹以垂直品类和供应链优势成为另一极,AI硬件更可能是多样化而非单一入口。最后谈AI中的人:硅谷天价薪酬与万人裁员并存,中国大厂在麦麦平台上激进扩招AI岗,主持人曼祺也反思AI并未解放自己,意义感或许要从工作转向体验与创造。

143: 阿里、Kimi都在用的DeltaNet是什么?|与杨松琳聊线性注意力新改进
2025年11月30日 · 1:27:20
本期《晚点聊》邀请DeltaNet核心贡献者、MIT在读博士及开源小组FLA发起者杨松琳,解释线性注意力机制和DeltaNet从提出到被业界采用的演进脉络。她指出,DeltaNet源自2021年的论文《Linear Transformers Are Secretly Fast Weight Programmers》,它用Delta Rule强化模型的上下文检索能力,但当时缺少short convolution、输出门控等现代架构元素,也没有高效的并行实现,因此长期不受关注;直到她2024年提出《Parallelizing Linear Transformers with the Delta Rule》等算法,才让DeltaNet可以高效训练和扩展。节目中她也回应了最新行业动向:阿里Qwen 3.0 Next在注意力层混合了Gated DeltaNet与Gated Attention,Kimi Linear的KDA则是对Gated DeltaNet的改进,将粗粒度衰减细化为每个维度独立;而MiniMax M2从M1使用的线性注意力退回Full Attention,原因是线性注意力在多跳推理、状态追踪等Agentic能力上表现欠佳。杨松琳认为,线性注意力在推理效率和状态追踪上有独特价值,即便算力无限,它在高质量数据有限时也能凭借归纳偏更高效地学习;而稀疏注意力虽然单层表达更接近Full Attention,但KV cache不减少,长文本下仍是瓶颈。她还分享了自己从算法出身自学CUDA、受FlashAttention启发发起FLA开源社区的经历,以及未来可能将稀疏注意力和线性注意力混合(如DSA+KDA)的构想。

110: 与明势夏令聊Agent竞争:通用入口之战就要来,创业要做垂、做专|Agent#2
2025年4月14日 · 1:40:18
曼祺与明势创投合伙人夏令在本期推演Agent行业:他判断通用Agent入口之战将在今年下半年打响,最激烈的战场是以手机为终端的通用Agent产品,OpenAI、Google、Meta、字节、阿里、腾讯等巨头都会参与,美团、小红书、理想也跃跃欲试。夏令把自动驾驶、具身机器人与软件应用均视为Agent,以Google白皮书的'模型+编排层+工具使用'框架分析技术演进,预测L3 Agent(能完成整项任务)可能在一年内到来,并认为MCP生态的最大受益者仍然是Anthropic、OpenAI等模型公司。他指出,模型公司都有服务泛C用户的野心,创业公司应做垂直、专业的'最后一公里',尤其在中国,要用Agent直接交付结果并按收入分成收费,例如用AI帮银行批量起诉坏账,一个月立案超1.5万起,团队需既懂行业又懂AI。相比美国按席位收订阅费的模式(如Harvey每个席位每月2000多美金),中国客户更愿意为效果付费,这催生了完全不同的商业模式。关于具身智能,夏令认为最大危险并非朱啸虎所说的没有商业化PMF,而是具身模型技术尚未收敛,机器人还没迎来GPT-3时刻。他还讨论了Kill time型内容Agent,认为其高参与度可能催生新的内容平台,但当前模型能力还不足以支撑长期情感关系。

107: 与Haivivi李勇聊月入千万的AI Jellycat:小众AI硬件×大众消费品的交叉口创业
2025年3月13日 · 1:19:39
本期《晚点聊》对话 Haivivi 创始人兼 CEO 李勇,这位有 20 年硬件从业经验、曾参与天猫精灵从 0 到 3000 万台过程的老兵,讲述了他为何押注 AI 毛绒玩具这一科技巨头做不了也不想做的方向。首款产品 Bubble Pal 是 399 元的 AI 挂件,上市数月卖出几万个、单月收入破千万元人民币。李勇解释产品定义中的诸多取舍:选 3-6 岁儿童是为了控制用户预期,先做挂件而非整只毛绒玩具是为了切入存量市场、先活下来;他还认为大模型目前无法给成年人提供足够的工具或情绪价值,要等端到端语音模型成熟后再拓展成人市场。他提到泡泡玛特和 Jellycat 的持续增长证明了成年人会为情绪价值反复消费。他复盘了此前早教机卖出数十万台却因在线教育巨头入场而难以为继,也因此放弃严肃教育,完整 AI 毛绒玩具预计 25 年 Q2 上市;负债创业期间核心员工降薪到约 1 万元,2023 年 8 月与高秉强见面当天就获得投资。节目还谈到玩具赛道可容纳多家公司而工具类生死厮杀、Meta 眼镜舍弃显示器的魄力、产品破圈后前二差评是联网和按住说话,以及已接入包括 DeepSeek 在内的主流模型;长期目标则是成为 AI 时代的泡泡玛特,做'AI 版玩具总动员'。

104: 我给线性注意力找“金主”,字节 say No,MiniMax say Yes
2025年3月3日 · 1:26:50
主播曼祺与MiniMax高级研究总监钟怡然聊全球首个把线性注意力做到4560亿参数级的大模型MiniMax-01;钟怡然称这证明线性注意力可以scale up,但业界仍非共识。这也是MiniMax首次开源,目的是展示架构创新并吸引人才。她解释线性注意力通过调整QKV矩阵计算顺序将复杂度从二次降到线性;MiniMax-01每7层线性注意力混1层Softmax注意力,弥补纯线性注意力召回缺陷,100万Token序列下比全Softmax注意力快2700倍,且混合架构效果优于纯Transformer。她还回顾了自己从2021年押注这个“看起来很美好的泡泡”的经历:自称是全球最懂线性注意力的一批人,找“金主”时字节say no,MiniMax say yes;创始人闫俊杰以约50%把握拍板投入公司超80%研发资源,团队此前做了3700次预训练测试验证可扩展性。她认为稀疏注意力如NSA、Mobile有损且上限低,DeepSeek的NSA只是把稀疏注意力工程化提速;而线性注意力是无损优化,序列越长优势越大。MiniMax计划4月发布整合线性架构、原生多模态和强化学习的深度推理模型。节目最后聊到她的AGI愿景——能持续自我学习的模型,以及DeepSeek爆火后研发加班追赶推理模型的节奏。

103: 用Attention串起大模型优化史,详解DeepSeek、Kimi最新注意力机制改进
2025年2月26日 · 1:28:15
清华计算机系刘知远团队的肖朝军与清华电子系汪玉团队的傅天予在本期解读DeepSeek和Kimi最新发布的注意力机制NSA与MoBA:两者都在预训练阶段引入动态与静态混合的块状稀疏注意力,以应对长文本和长思维链带来的计算瓶颈。节目先讲清原理:注意力机制让每个词与上下文动态关联,但标准Full Attention需存储所有词向量并与每个词逐一匹配,因此序列变长时存储和计算按N方爆炸,这也催生了稀疏注意力和线性注意力(RNN回归)两大改进方向。两位嘉宾指出,NSA与MoBA的突破在于用块状稀疏设计(整块保留或丢弃)适配GPU并行与内存访问,并通过Triton算子优化让训练和推理都获得实际加速;静态稀疏(如滑动窗口)虽快但可能错过远距关键信息,所以动态与静态混合成为共同选择,而稀疏训练的性能也被证明可追平甚至超过稠密注意力。他们还对照自己此前的InfLLM与MoA:前者强调稀疏需在块级别做并做到训练无关的推理加速,后者通过识别关键注意力头来保留长程关联;两人在实验中最看重训练曲线(如NSA的Figure4和MoBA的Figure3)和长CoT生成速度,而非传统Benchmark。展望未来,多模态会让序列急剧变长(如一小时视频约百万token),存储/记忆将成下一瓶颈,线性注意力或RNN路线仍是重要理论选项。下期节目将与MiniMax研究员聊其01模型采用的线性注意力架构。

102: DeepSeek 启动开源周,大模型开源到底在开什么?
2025年2月25日 · 56:40
本期《晚点聊》由程曼祺主持,邀请西北大学MLL Lab博士生王子涵,围绕DeepSeek开源周及大模型开源的具体层次展开。节目指出,开源不只是开放权重,还包括技术报告、推理框架、训练框架和数据集等层级,而绝大多数公司只开放前两者。王子涵以FlashMLA为例,解释了算子级优化如何提升推理效率,并对比了vLLM、SGLang、字节VERL等社区框架的生态差异。节目还剖析了DeepSeek选择MIT协议、开源最强模型背后的优先级与盈利模式,并谈到开源训练框架需额外投入代码规范化工作。王子涵分享了自己因开源模型被滥用导致推特账号被盗的经历,提出最强模型是否应开源的社会风险问题。节目最后讨论了OpenAI可能的开源选择,以及人类在AGI时代的位置。

99: MiniMax 创始人闫俊杰:做大模型,千万别套用移动互联网的逻辑
2025年1月20日 · 1:38:11
本期节目专访估值已超30亿美元的中国大模型公司MiniMax创始人兼CEO闫俊杰,核心主张是做大模型不能套用移动互联网逻辑:更好的模型可以导向更好的应用,但更多用户并不会导向更好的模型,因此MiniMax当前最重要的目标不是增长或收入,而是加速技术迭代。围绕刚开源的MiniMax-01,他解释开源是为了让问题暴露更快、提升研发效率并补上技术品牌;新架构把Transformer的注意力机制改成线性注意力,以支撑超长上下文,为Agent所需的记忆与多智能体通讯打基础。他也复盘了行业误区与自身失误:蒸馏o1数据复现o1不难但非最优路径,海螺文本失利是因为没有坚持技术驱动,而Talkie月活已超Character.ai、星野在国内同类第一的暂时领先来自技术路线选对与更懂用户。闫俊杰认为不应把创业公司单列为一类赛道,AI行业仍是技术驱动的长跑;2025年他更期待Agent能在专业领域达到专业人士水平,MiniMax也会围绕技术迭代设定目标。

96: 和楼天城聊 Robotaxi:学习人类优秀司机,让我绝望
2024年12月25日 · 1:27:58
楼天城在小马智行这次访谈中系统阐述了Robotaxi过去5年的技术变革:L4必须从“Learning by Watching”(模仿学习)转向“Learning by Practicing”(实践学习),以世界模型作为车端模型的训练环境。他提出多个反直觉判断:模仿学习最多只能“像人”,但人类对AI司机的双标要求使像人永远达不到L4;越是优秀的人类司机,越依赖超越传感器数据的经验与直觉,模仿其行为反而是“反向优化”;世界上不存在MPI(接管里程)为1000公里的L2产品,因为那要求人一个月接管一次且始终保持专注,违背人性。小马5年前因此彻底放弃模仿学习,转向生成式数据和闭环训练,从零追赶,前两年“没有任何进展”,承受了巨大压力;他强调决定自动驾驶能力上限的不是车载模型,而是世界模型这一“工厂”的精度。世界模型包括数据生成器、驾驶行为评估体系、高真实性仿真和数据挖掘引擎,其中交互模拟和细粒度指标是核心竞争力。楼天城还明确L2+与L4是两件事:L2以低成本辅助人为目标,用模仿学习没有问题,但无法跨越安全与人性的门槛,做得越好,距离L4反而越远。商业化上,他预计1-2年内可实现成本更优的千台级无人车队运营并转正毛利,净利则要到5万台;而特斯拉如果继续坚持Learning by Watching,转向实践学习仍需时间。

93: 字节VS六小龙,大模型创业生存战 | 串台「十字路口Crossing」
2024年12月8日 · 1:22:51
本期《晚点聊》由晚点科技报道负责人程曼祺与「十字路口」主播杨远骋、Ronghui 串台,复盘其报道《中国大模型生存战:巨头围剿,创业难熬》,核心判断是:2024 年中国大模型竞争已从六小龙互相较量转为字节跳动等巨头与创业公司的正面激战,字节像"会跳舞的大象"后来居上。节目以技术进化速度为核心分歧:若进化快,创业公司的前瞻判断与"模应一体"能拉开差距;若放慢,产品、流量与渠道更关键,最头部公司融资承压,文章引用大厂高管"一年低消20到30亿美元"与投资人"2到3亿美元"的不同算法,并提到DeepSeek不做应用、不思考商业化。程曼祺逐一点评六小龙:月之暗面(杨植麟)只聚焦Kimi与生产力场景,提前押注多阶段推理;MiniMax(闫俊杰)更灵活,星野/Talkie在陪伴赛道留存高于字节猫箱;零一万物分拆游戏公司、智谱AutoGLM寻求手机合作。字节之所以翻身,在于张一鸣亲自下场招人、放弃对外投资、成立Flow;同时节目对比了阿里云与火山云的未来竞争,并称腾讯可后发制人、百度今年亮点是萝卜快跑。杨远骋以Recraft、Cursor为例称应用正"雨后春笋"般生长,程曼祺则对比今日头条上线7个月日活200万、一年多达1000万,说明如今大模型创业公司更难,但创始人无暇悲观;结尾引用王兴名言:战争不是由拼搏组成,而是由等待和煎熬组成。

90: 当每个国家都想要自己的大模型?与云启陈昱聊主权 AI
2024年11月20日 · 48:16
云启资本合伙人陈昱做客《晚点聊》,与主持人程曼祺深入探讨“主权AI”——各国政府自建大模型和AI基础设施的全球浪潮。节目指出,英伟达CEO黄仁勋正大力推动这一概念,英伟达预计其主权AI业务收入今年将从0增长至近100亿美元。陈昱认为主权AI本质是需求真实的to G市场,机会遍布算力中心、芯片、AI基础软件及模型出海,例如他已投资壁仞联创徐凌杰的新项目,专注底层算力软件优化。节目还梳理了中国智算中心建设现状:截至2024年5月底,中国大陆已有280多座智算中心,140个项目的投资总额达4300亿元,可统计算力规模为36.93万P,并指出地方政府招商引资是重要驱动力。针对风险,陈昱警示过度投资导致算力过剩、GPU快速换代造成浪费,以及国内to G业务账期过长。对话最后也触及主权AI对普通人的影响,既可能带来更智能的政务服务,也可能使政府管控更密集,引发AI伦理忧思。

59: AI 3D 生成会有“抖音时刻”吗?与 VAST 聊人人玩 3D 的未来 | AI 大爆炸
2024年2月1日 · 48:17
本期对话 AI 3D 生成公司 VAST 创始人宋亚宸(Simon)与 CTO 梁鼎,两人提出:3D 内容将延续文字、图片、视频的演进路径,从高门槛的 3A 内容走向大众创作,第一步是做出大众级 3D 生成工具。VAST 去年开源了 Wonder3D,并上线产品 Tripo,支持文字和图片生成 3D 模型,已生成超 30 万个模型。他们解释技术现状:Tripo 背后是多种模型组合,且 3D 表示(Mesh、NeRF 等)尚未定型,这与 2D 图形有本质区别。他们预测生成效果在 2024 年底达到 Midjourney V4 水平,2025 年初达 V5,届时出现工具成熟的“Midjourney 时刻”,随后会迎来内容平台爆发的“抖音时刻”,头显成熟只是充分不必要条件。他们还谈到,VAST 的差异在于面向大众创作者而非替代 Blender 等专业软件,并拥有大量 3D 原生数据集;长期壁垒在产品和社区运营。最后讨论了年轻 AI 创业者:团队里既有连续创业的老炮也有年轻人,老炮避坑、年轻人敢冲。

37: 热度很高,投资很少?与 42 章经曲凯聊聊 AI 创投水温
2023年6月7日 · 47:02
本期《晚点聊》由程曼祺对话42章经创始人曲凯,聚焦中国AI创投水温与舆论热度的落差。曲凯指出,ChatGPT爆火的关键在于首次真正to C,而国内投资人看得多、出手少:模型层受青睐但初期融资战已近尾声,应用层被低估,中间层最不受待见。他更看好应用公司反向长出模型能力的路径——正如推荐算法时代最好的公司是字节跳动,核心在好产品而非技术本身。曲凯还分享了一线服务十余个AI项目的体感:真正拿到钱的公司不足百家,以美元机构为主,to B应用更稳、to C想象空间更大,已有公司实现商业闭环、月收入数百万元且月增30%。他判断应用层被低估,未来两个月将有更多有趣产品上线,并呼吁投资人更多出手、创始人更重视产品落地而非估值。
由 PodHood 提供支持