晚点聊 LateTalk 中关于 模型自进化 的单集。

179: 蒸馏风暴:一场无人公开谈论的技术竞赛
2026年8月16日 · 49:33
《晚点聊》主播高洪浩与《晚点 LatePost》科技报道负责人程曼祺在本期中拆解AI模型蒸馏:它并非简单抄答案,而是有门槛的复杂系统工程。围绕字节跳动,节目披露张一鸣在内部会上反对蒸馏,理由是只能逼近难超越,且会让组织依赖捷径、丧失长期探索动力;程曼祺也分析Seed 2.1可能曾用蒸馏,字节在讨论后仍决定不走这条路。节目梳理了蒸馏出圈的关键节点——OpenAI o1开启推理模型与DeepSeek-R1发布推动规模扩大,并详解大规模蒸馏的账号与数据管线know-how、隐藏行为的难度,以及学生模型理论上可超越教师但代价是组织激励偏向确定性路径。此外,节目提及Anthropic曾点名DeepSeek、Kimi、MiniMax和阿里千问疑似蒸馏,并讨论蒸馏对商业模式的冲击:更便宜的智能让许多任务‘够用’,V4和Grok这类高性价比模型正在‘斩杀’高价低能的模型。

178: 与田渊栋聊 RSI:模型自进化如何到来?
2026年8月7日 · 1:29:02
田渊栋做客《晚点聊》谈他联合创立的 Recursive SuperIntelligence(缩写同为 RSI)如何让 AI 自我进化:这家公司刚完成6.5亿美元融资、估值超46亿美元,他认为 RSI 比 coding agent 大得多,完全自动化短期不会到来。他讲述从去年用 GPT-5 合写论文到决定创业的过程,称模型已强到「不用再招实习生」,并对比十年前 AutoML:现在大模型能理解 AI 本身,搜索空间不再由人定义。关于公司6月初的 First Steps,他说系统在 NanoChat 的 BPB 与 Speedrun、英伟达 SOL-ExecBench 算子优化上取得 SOTA:Speedrun 比社区两年成绩再快约两秒,算子优化比专注 GPU 的以色列团队 Double AI 高10%;他也评价 Anthropic《When AI builds itself》更多是提效而非递归自进化。对「领先者会越甩越远」的假设,他提出变量:智能提升可能是阶梯式跳跃而非平滑曲线,若 scaling law 不是全部,初创公司仍有空间;他还谈到大公司超过150人后变慢,RSI 目前缺数据、算力与可解释性。他坚持可解释性是关键,相信 AI 研究终将变成科学,但承认这是少数派观点。

177: 详解Kimi K3:强到冲击Anthropic估值的模型什么样?
2026年8月3日 · 1:55:18
《晚点聊》由曼祺主持,邀请RadixArk与SGLang创始成员赵晨阳、华盛顿大学博士生曾致远,从Infra与算法两条线拆解Kimi K3:这款近3T参数的开放权重模型以混合注意力架构逼近并部分超越Claude Opus 4.8等闭源前沿,同时引发对Anthropic估值的冲击与开源安全辩论。节目指出,K3用KDA线性注意力与MLA全局注意力按3:1混合,靠循环状态压缩历史,在百万上下文下获得6.3倍解码加速;其Quantile Balancing以分位数估计替代固定步长调整,支撑896个路由专家中选16个的极端稀疏负载均衡,Per-head Muon则通过逐注意力头正交化提升大规模训练稳定性。后训练部分,K3先用MOPD多教师在线蒸馏合并9个领域专家模型,既降低合版压力又提升迭代速度;在Kimi CodeBench 2.0上,K3得分仅低最强模型4分,成本却只有对方的38%。嘉宾还拆解了Attention Residuals如何让深层模型选择性读取浅层信息,以及Kernel Development Agent如何让早期checkpoint自主优化内核,甚至为国产GPGPU写Kernel。讨论也点明,K3开放了权重、MuonEP、Flash KDA和agent-inv,但未开源RL环境、知识图谱任务系统与原始专家checkpoint——权重是一次训练的产物,环境才是能反复产生下一代权重的'流水线',构成开源模型真正的护城河。最后,嘉宾判断开源模型短期内仍难超越闭源,因为OpenAI与Anthropic内部最强模型通常比已发布版本领先半代到一代,但KDA这类线性注意力混合架构已证明'条条大路通罗马'。

171: 与Henry的「AI季报 26Q2」:从 coding 到 RSI,强者愈强的未来?
2026年7月1日 · 1:39:42
本期季报中,程曼祺与MoE Capital创始合伙人Henry Yin判断,行业正同时推进智能前沿(编码代理、RSI、物理AI)与智能扩散(企业自建模型、交互创新),强者愈强但开源追赶也在加速。OpenAI与Anthropic分别发布GPT-5.6和Fable 5,Anthropic因安全护栏与静默降智引发争议,OpenAI以免费抢客,Anthropic年收入预计达620亿美元,OpenAI约400亿美元。RSI成为热土:Anthropic长文称80%合并代码由Claude编写,Richard Socher、田渊栋的Recursive在三个benchmark取得SOTA,Mirendil、Core Automation等新团队涌现。物理AI上OpenAI官宣机器人团队,Anthropic考虑布局;MoE资本统计约100亿美元流向世界模型相关公司。智能扩散上,Harvey联合Applied Compute用GLM 5.1后训练出法律模型并超越前沿模型,GLM 5.2因低成本与兼容Claude Code在硅谷走红。交互创新包括Claude Tag、Record and Replay和Thinking Machines的边听边说模型;Meta推出Musespark但反响平平,Google以Gemini Omni展示多模态,xAI转向算力租赁并收购Cursor,Midjourney发布超声波CT扫描仪。

165: GEAR 高深远:世界模型、自进化循环、DreamDojo
2026年5月18日 · 1:49:03
本期嘉宾是即将加入英伟达具身智能实验室 GEAR 的研究者高深远,他与主播程曼祺系统梳理了世界模型的分类、瓶颈与未来,并详解了他参与研发的世界模型 DreamDojo 和世界动作模型 DreamZero。节目按世界状态表征将世界模型分为几何、显式3D、隐空间和视频四类,高深远最看好视频世界模型,因为数据丰富、可端到端训练、能继承互联网视频的泛化能力;世界模型的核心价值是服务策略——用于测评、生成数据和突破物理时间限制的强化学习,但当前难以横评,因为各家机器人本体和动作空间不同。DreamDojo 从4.4万小时人类第一人称视频中迁移泛化能力,用隐式动作(Latent action)免去动作标注,把视频预测做到实时,并自建6个 benchmark 评测物理模拟和动作控制能力;DreamZero 则是以视频为骨干的策略模型,被视作可能取代 VLA 的世界动作模型(WAM)。高深远描绘了由世界模型、策略模型和连接二者的 Agent 组成的自进化循环,认为今年可能初步跑通,未来5年或成爆点;他还对比了 DeepMind 的 Genie-SIMA 与 Nvidia 的 DreamDojo-DreamZero 等竞争格局,指出当前最大瓶颈是物理模拟和动作控制的泛化,以及长程稳定性和效率。此外他提到 OpenAI 的 Sora 团队已重组到 robotics lab,并认为通用基模路线(如 Anthropic、AMI)最终也可能解决具身问题。

163: 详解DeepSeekV4:Infra巨鲸、百万上下文走进现实、极致效率优化
2026年4月30日 · 1:33:52
本集晚点聊详解DeepSeek V4,SGLang核心开发者赵晨阳(RadixArk工程师)和UCLA博士生刘益枫判定:它并非范式创新,而是沿R1的“测试时扩展”范式,用混合稀疏注意力、Muon优化器、mHC、FP4等互相耦合的工程优化,让百万上下文从理论进入实用。V4放弃了V3的MLA架构,改用滑动窗口+CSA稀疏压缩+HCA稠密压缩的层间分工,换来激活参数占比仅3%、单token推理FLOPs仅V3.2的27%、KV cache占用仅10%的极致效率;但两人也指出,解决同一问题的token消耗反而增加,有“高压水枪浇花”式的浪费。他们具体拆解了四个新特性:Muon优化器已成为检验工程能力的试金石,V4将Kimi Muon Lite的0.2系数改为0.18;mHC是DeepSeek对Hyper-Connection的稳定化改造;Infra侧TileLang降低新kernel开发成本,FP4训练让采样和部署一致,实现真正的物理提速。此外,DeepSeek这次不再披露训练成本,两人认为最终训练成本只是冰山一角;发布延期源于四个新feature耦合导致组合爆炸,但团队流动率极低。节目还讨论了DeepSeek内部评测中9%工程师不会将V4 Pro作为编程首选,以及中美模型路线分化:美国公司追新能力、高定价,中国公司追性价比和工程极限。关于评测,他们认为benchmark会过时饱和,evaluation才是永恒追求;V4也未提出新的能力域,但它的极致压缩和低单token成本,可能成为后续开源模型的起点。

160: 群核IPO后与黄晓煌聊这15年:被嫌弃的GPU、冠军酷家乐、空间智能、六小龙
2026年4月17日 · 1:40:26
本期专访群核科技创始人兼董事长黄晓煌,在公司登陆港股、成为“杭州六小龙”第一家上市公司后,他回溯15年创业史,核心判断是“活下来比活得亮眼重要”:他称见过90%的明星科技企业消失,群核靠避开巨头锋芒、做工业软件与出海存活,并把数据视为比算法更实在的壁垒。节目解释了酷家乐如何从GPU云渲染长成中国市占率第一的在线设计软件,也复盘了2018年错过具身硬件黄金期的遗憾。黄晓煌详述2023年看到AI对SaaS的颠覆后,选择自己训练空间模型而非为大模型做配套,并在视频生成与3D路线之间押注后者,认为视频模型无法真正物理正确。他还比较了欧美具身企业偏好合成数据、国内倾向真实数据的现象,并谈及“六小龙”出圈后内部阻力大减、自己如今以科研leader自居,目标是公司一半收入来自空间智能。

156: 与 Henry 的「AI季报 26Q1」:OpenClaw、OpenAI vs Anthropic的三重对阵、自进化
2026年3月31日 · 1:52:13
本期《晚点聊》26Q1 AI季报中,硅谷投资人、MoE Capital创始合伙人Henry Yin与主播程曼祺复盘了OpenClaw的爆红、OpenAI与Anthropic的三重对抗和AI自我进化等浪潮,核心判断是:编码智能体正从模型竞争转向系统与生态竞争。他们指出OpenClaw是“AI的iPhone时刻”——通过本地运行、接入聊天App、定时任务和长期记忆,它让AI真正“干活”,成为个人Agent的灯塔;但它也有成本高、不稳定和安全风险,例如Meta对齐负责人因上下文压缩导致安全指令丢失、被agent疯狂删邮件的“生死时速”。Henry还解释了OpenClaw为什么在中国比美国更出圈:飞书、微信等聊天优先生态和便宜的国产开源模型,让它与MiniMax、Kimi等形成天然组合。围绕OpenAI与Anthropic,节目对比了Codex与Claude Code、Opus 4.6与GPT-5.4,称Anthropic收入三个月从90亿美元增至190亿美元,Claude Code年化收入25亿美元超过Cursor的20亿美元,而OpenAI已内部反思“因支线任务分心”。他们还讨论了Andrej Karpathy的AutoResearch:AI在没有人类干预下自主优化训练代码,使GPT-2级模型训练时间缩短约20%,让自进化更贴近现实;同时探讨了持续学习(记忆vs权重更新)、世界模型和新的创业机会。最后,Henry分享了硅谷科技大裁员——Amazon裁1.6万人、Block裁40%、Meta计划裁20%且以全员Token消耗量衡量效率,并展望下季度DeepSeek-V4等看点。

154: 从千问变动到「AI 英雄传」|与 DINQ 高岱恒聊传奇 AI 研究员们
2026年3月11日 · 1:46:41
阿里千问人事变动后,DINQ平台上千问相关候选人的搜索量翻了3倍,Meta的Executive Search也在搜寻千问团队。前达摩院成员、DINQ创始人高岱恒从这一事件切入,认为千问凭借完整模型家族已成为开源事实标准,其下载量超过Mistral及国内其他开源模型之和;魔搭社区如同AI时代的GitHub,对阿里的战略意义远超直接收入。他还分享了自己因开源换脸项目DeepFaceLab进入达摩院的经历,强调“当你有作品,没人再问学校”;他讲述的AI研究者故事包括GPT-1作者Alec Radford曾被顶会拒稿、RAG作者曾旅居越南,这些创新往往来自边缘地带或非常规背景。在他看来,最顶尖的研究者如同文艺复兴时期的大师,追求代表作和影响力,需要抗挫折能力与平常心,而不是公司内的职级晋升。节目还提到DINQ的诞生源于一个受追捧的Roast功能,用户输入学术和代码链接即可获得对自身经历的辣评,吸引了斯坦福、MIT的教授和顶尖研究员使用。最后他讨论AI人才市场的结构性变化:Meta等公司开出千万美元年薪,让研究者产生“干几年退休”的心态;未来智力劳动可能外包化、任务化,人与具体任务的匹配将取代人与公司的绑定,而DINQ通过聚合研究者的GitHub、论文和社交媒体信息,让有创造力的人能被更高效地发现。

146: Gemini 3翻盘背后、Agent需要什么大模型、RL创业机会|与前 Google 创业者、硅谷投资人聊湾区动向
2025年12月26日 · 1:40:58
本期嘉宾是 MoE Capital 创始合伙人 Henry Yin、Naomi Xia 与 Agent 工具层公司 Precur 联创戴涵俊、Bethany Wang,由程曼祺主持,从硅谷一线视角解析 Gemini 3 与 GPT-5.2 同期发布、Google 靠什么强势回归,以及 Agent/RL 创业机会。嘉宾指出 GPT-5.2 在 GDPval 上达 70.9%(前代 38.8%)、ARC-AGI-2 达 52.9%,且 OpenAI 今年发布的三个 benchmark 均由 Anthropic 模型得分最高,显示其将研究与营销分开。Google 的反弹被归因于 TPU、Infra、模型到应用和硬件的多层协同设计,以及 DeepMind 与 Google Brain 合并后的整合。创业层面,Precur 做“可训练工具层”,让工具从失败轨迹中自我强化,早期客户测试中正确率提升约 12%;RL 机会被分为 RL 环境(如所投的 Preference Model)、RL as a Service 和 RL 垂直应用(如 Periodic Labs)。模型选择上,嘉宾强调云绑定优先于性能,Claude Code 与代码驱动工具调用(PTC)正成为 Agent 核心范式,Qwen 是表现优异的开源模型,飞往 NeurIPS 的飞机上约 1/3 的人在读 DeepSeek-V3.2 技术报告。他们预测模型将向加入大量 agent trace 的开源模型、更强多模态和长程任务优化演进。

144: “大而强”到“小而强”|与刘知远、肖朝军聊密度法则、RL 的 Scaling Law 和智能的分布式未来
2025年12月11日 · 1:41:54
本期嘉宾是清华大学副教授、面壁智能首席科学家刘知远和清华大学博士后、面壁 MiniCPM 文本模型负责人肖朝军,他们在《自然·机器学习》子刊发表封面文章提出大模型“密度法则”:能力密度每 3.5 个月翻一番,用更少算力和数据获得同等甚至更多智能。节目先谈 Gemini 3、Nano Banana 等行业动向,区分“能力更强”和“能效更高”两条主线,并复盘面壁 2023 年下半年放弃花几千万训 140B 模型追 GPT-4、转向端侧智能的商业判断。提升密度被拆为架构(MoE 与稀疏注意力)、数据治理(Ultra-FinWeb 用不到十分之一数据达到更好效果)、算法(强化学习还没有自己的 Scaling Law,有继续扩大规模或寻找新学习方式两条路)和软硬协同四层。他们还预测 2027 年端侧模型能支持大规模强化学习,2030 年手机可跑 60B 参数、8B 激活的模型,能力相当于 GPT-4 到 GPT-5;未来智能是分布式的,每个人可拥有随身“NAS”终端。肖朝军介绍了面壁开源的 InfLLM-V2,将稀疏注意力做到预训练阶段,128K 上下文只需关注 4-6K token,并认为长文本应更多关注长输出而非长输入。最后讨论 AGI 下一步:从自主学到 AI 协作网络再到真正创新,刘知远认为“用 AI 制造 AI”是智能时代本质,他不担心生产力过剩,而担心人类自我束缚。

139: ICCV最佳论文、光年之外、Sand.ai:曹越十年AI之旅,从研究者到CEO
2025年10月31日 · 2:06:28
本期对谈 Sand.ai 创始人兼 CEO 曹越——ICCV 最佳论文(Swin Transformer)得主、光年之外联创——讲他从研究者到 CEO 的十年。曹越在 ChatGPT 之前就从 OpenAI 的 CLIP/DALL·E 中读出“设计 scalable 系统最大化压榨算力”的方法论,为此离开微软亚研院加入当时国内最早做大模型的智源研究院;他说在微软亚研院学到的是关注最重要且有提升空间的 topic,并用足够资源做到极致。2023 年初他与王慧文一拍即合共创光年之外,也见过梁文锋;他记得王慧文对“中国为何没出现 OpenAI”的回答是“不够富”。他选择视频生成创业,因为技术天花板和商业天花板都高、又处在极早期。创办 Sand.ai 后,他复盘首个模型 Magi-1 因低估自回归路线难度花了一年多,之后转向“垂直整合”:让不同背景的人对齐上下文、让产品与模型互相放大。新模型 Gaga-1 以音画同出聚焦人物说话与表演,成本大幅下降,瞄准 AI 短剧、广告和 C 端“逗视频”。对 Sora 2,他最惊艳的是模型端到端直接生成有基础叙事的 10 秒短片,而非用 agent 拼接,并认为 OpenAI 是“端到端组织”,自己也正把 Sand.ai 调整成同样的组织。他还用“是否有新内容形态和新传播渠道”两个指标判断 Sora 能否成为 C 端平台。

137: Agent 是机会,造 Agent 的工具也是|从OpenAI开发者日聊起|Agent#6
2025年10月16日 · 1:28:58
本期《晚点聊》邀请AGI House联创Henry Yin与合伙人Naomi Xia,从OpenAI 10月6日DevDay发布的AgentKit出发,梳理了Agent工具链(Agentic Tooling)的六次进化与创业机会。他们认为,AgentKit是OpenAI开放了内部验证过的Agent开发全流程(构建、部署、评估),与2023年GPTs不同,Apps in ChatGPT和Apps SDK提供了真正的平台能力,可能让ChatGPT成为‘WeChatGPT’式超级应用;但AgentBuilder的可视化工作流与AGI路线有分歧,OpenAI不会放弃to B,已新设‘Future of Work’团队加速落地。工具链六次进化包括:GPT-3.5催生LangChain,function calling开启工具调用,MCP统一工具标准,GPT-4o语音带动实时语音设施,Claude 3.5引爆AI编程,O1推理与computer use让agent自我规划和用浏览器,每波都催生新公司。具体公司上,他们点评了Composio及其Rube产品以meta MCP server解决Cursor只能同时打开三个MCP server的限制,LiveKit一天2000万分钟语音(一年前100万),Letta的‘sleep time compute’记忆方案,以及OpenAI 11亿美元收购评估公司SetSeed的信号。他们估算,AI agent可将开发者工具市场从两三百亿美元推高至2000亿-5000亿美元,Okta、Twilio、Datadog在身份、通信、可观测性上可‘再做一遍’。最后,他们观察到2025年更多中国AI团队经HFZero等进入硅谷,20%-30%入营者是中国背景,其to C产品感和野心正在影响创业生态。

127: 与真格戴雨森 25 AI 中场复盘:OpenAI的IMO金牌、Kimi K2翻盘、Agent普及和抢人大战
2025年7月21日 · 1:54:55
本期《晚点聊》中,主播程曼祺与真格基金管理合伙人戴雨森复盘2025年年中AI进展:OpenAI用未公开的通用大语言模型首次达到IMO国际奥赛金牌水准(6题做对5题),戴雨森认为这验证了推理时扩展定律、说明强化学习也能攻克难以验证的证明题,被OpenAI研究员Sébastien Bubeck称为'登月时刻';而OpenAI的ChatGPT Agent虽不惊艳,却标志Agent形态成为共识,也证明'壳'(应用)的价值被低估——模型进步与应用进化可能都在加速。他提出应用价值三层论:模型只提供底层智能,Context(组织与个人上下文)和环境工具须由应用提供,这正是Manus、Genspark等创业公司的机会。 他盘点各家公司走向:K2(月之暗面)已是目前最好的开源模型,OpenRouter编程类目调用量几天内从第10升至第5;DeepSeek R2要等新基模V4;字节Seed分设Edge、Focus、Base;Google回归第一梯队,Anthropic自造Claude Code加入应用层。被高估的是机器人进厂速度——特斯拉已下调Optimus产量预期;被低估的是模型能力进化速度、应用价值与优秀团队韧性。他还谈到硅谷抢人大战由Meta主导、腾讯成国内挖人最猛者,并预计Agent应用需要新的L3原生模型,以自己每月近1000美元的AI订阅费说明生产力场景token消耗将远超娱乐类。 面对未来,他持续好奇如何衡量智能边界——当模型已能解决IMO证明题、HLE得分从年初个位数涨到20多分,人类的评估体系正在失效;他也担心效率与公平的张力:当个人拥有巨大生产力,人与人差距会被急剧拉大。他推荐契合AI创业者心态的游戏《33号远征队》,并说自己年内最想验证的是L3模型能否让Agent任务一次做到七八十分以上。

121: PingCAP黄东旭的“内在世界源代码”:《黑镜》、程序之美和创作自由
2025年6月24日 · 2:02:07
PingCAP联合创始人兼CTO黄东旭在做客《晚点聊》时,向主持人曼琪和小晚阐述了他眼中AI时代的编程、开源与生活哲学:大语言模型是“新的物种”,简单结构能产生复杂智能。他从《黑镜》第七季聊起,透露创业动机其实来自美剧《疑犯追踪》:未来AI需要存储一切,于是他们做了分布式数据库TiKV,而TiKV正是用十几条简单规则让系统自己分裂、迁移和自愈。他卖掉房子住进房车,计划40岁前学种田、缝纫和木工,因为AI让他多出50%时间,人的意义在于体验而非搞懂Transformer。谈到公司,他称创业第一天就定下创始人“互为冗余”的原则,目前七成收入来自海外,全球化就是更好的本地化;中国长不出Databricks,因为云基础设施尚未准备好。他还自己写Agent直接查询原始数据替代Salesforce报表,预测未来每个人都会拥有免费的personal database,并认为开源既是竞争策略也是建立信任的必经之路,就像DeepSeek。他坦言AI加速让他产生强烈的存在主义紧迫感,引用《神的九十亿个名字》担心人类心智尚未准备好;因此他也转向冥想、做饭和收藏老式乐器,认为人工制作的东西会变得越来越珍贵。

117: 印奇的AI创业14年:所有不能闭环的辉煌都是暂时的
2025年5月20日 · 2:06:50
本期嘉宾是千里科技董事长、旷视创始人印奇,他在37岁、AI创业14年之际总结从旷视到千里的转变,核心判断是“所有不能闭环的辉煌都是暂时的”,商业闭环和ROI优先于单纯技术信仰。他解释了为何在继续推动旷视上市、大模型创业和入股力帆(后更名千里)三者中选了最后一项:力帆经历破产重组和吉利三年清理后没有历史包袱,吉利能成为AI+车的场景提供者与数据闭环支点,这不是绑定而是开放起点。技术路线上,印奇主张智驾走特斯拉式模型驱动路线而非华为式闭环供应链,认为中国智驾要回归基本功、提升模型化比例;VLA更属于具身智能,车的行为空间有限,概念被超卖。他回顾了旷视在科创板等待三年多、两次上市受阻的近5年低谷,称这是组织成长最快的“蹲苗”期,自己将理念改为价值务实在前、技术信仰在后,并把研发与营销投入比从3:1、4:1调到1:1。他也判断智驾已到冲刺期,赢下需要数据体系、纵向整合和客户联盟三个体系,最后最多4家、可能3家留在牌桌,明年见分晓。5月补充访谈中,印奇把大模型周期视为深度学习的决赛环节,认为Super App需兼具上限与短期爆发力,将Agent分为工作、创作、生活、情感四类,判断未来18到24个月会出现引爆点。

114: 秘塔闵可锐2:“我不是演员”
2025年5月5日 · 2:01:51
本期《晚点聊 LateTalk》中,秘塔科技创始人闵可锐向主播曼祺与王与桐解释,这家成立七年的小AI公司为何刻意保持保守:他自评新产品“今天学点啥”仅70分,称秘塔80%的产品决策靠他“拍脑袋”,2024年只新融1亿多人民币、估值低得保守,还拒绝了去年的收购,因为他“当不了演员”,讲不了自己都不信的故事;他也提到秘塔搜索已接近100万日活。他说明为何不追Agent热潮——2025年上半年的模型能力仍撑不起相对通用的Agent,Manus的很多效果得益于Claude;也解释为何秘塔没有采用DeepSeek式高密度研发组织——“因为我们没钱”。他给出一个悲观判断:任何主要依靠大模型能力、有潜力做到1000万DAU的软件应用,大模型公司和大厂都会自己做,小公司只能“摸着石头过河,大厂摸着我们过河”。技术上,他认为Grok3证明了后发团队配上顶尖资源能快速追上一线模型,Llama4再次印证“一流资源、二流团队”干不过“二流资源、一流团队”,并强调预训练对推理模型至关重要,Scaling Law不是简单线性外推。节目还谈到“今天学点啥”下一步会为辅导孩子作业的家长优化,以及闵可锐对团队分工、没找产品合伙人和过去两年“各方面更会了”的反思。

111: Pokee.ai 朱哲清的 Agent 造法:强化学习作后端,语言模型作前端|Agent#3
2025年4月22日 · 1:34:56
本期嘉宾是 Pokee.ai 创始人朱哲清(Bill),他在《晚点聊》中提出一种与主流不同的 Agent 造法:大语言模型(LLM)只是 Agent 与人类交互的“前端”,后端决策与执行应由不依赖自然语言的强化学习(RL)模型完成。他批评以 LLM 为大脑的做法,称其上下文长度有限,调用工具超过 50 个就会产生幻觉,难以支撑复杂多步任务;而 Pokee.ai 用 RL 模型驱动,已打通几十个平台的上千个 API,单次任务成本约为同类产品的十分之一,执行一项任务只需数十秒。朱哲清还总结了优秀通用 Agent 的四要素:比人快、无需人工干预、能读能写、成本低,并认为技术本身不是护城河,真正的壁垒在于与用户工作流深度绑定。他分享了自己的创业历程:从斯坦福读博与 Meta 全职并行,到早期做旅行规划 demo、Shopify 垂直 Agent,直到 DeepSeek R1 带火强化学习后回归通用 Agent 方向;团队只有四人,却吸引了大量投资人和客户。关于行业竞争,他判断未来会存留三到五家公司,接下来各家将走向差异化;此外,他还给出了判断技术潜力的方法论——先构建一个极简的 ‘Toy Example’,证明只有你的技术能普适性地解决它,再投入规模化。

104: 我给线性注意力找“金主”,字节 say No,MiniMax say Yes
2025年3月3日 · 1:26:50
主播曼祺与MiniMax高级研究总监钟怡然聊全球首个把线性注意力做到4560亿参数级的大模型MiniMax-01;钟怡然称这证明线性注意力可以scale up,但业界仍非共识。这也是MiniMax首次开源,目的是展示架构创新并吸引人才。她解释线性注意力通过调整QKV矩阵计算顺序将复杂度从二次降到线性;MiniMax-01每7层线性注意力混1层Softmax注意力,弥补纯线性注意力召回缺陷,100万Token序列下比全Softmax注意力快2700倍,且混合架构效果优于纯Transformer。她还回顾了自己从2021年押注这个“看起来很美好的泡泡”的经历:自称是全球最懂线性注意力的一批人,找“金主”时字节say no,MiniMax say yes;创始人闫俊杰以约50%把握拍板投入公司超80%研发资源,团队此前做了3700次预训练测试验证可扩展性。她认为稀疏注意力如NSA、Mobile有损且上限低,DeepSeek的NSA只是把稀疏注意力工程化提速;而线性注意力是无损优化,序列越长优势越大。MiniMax计划4月发布整合线性架构、原生多模态和强化学习的深度推理模型。节目最后聊到她的AGI愿景——能持续自我学习的模型,以及DeepSeek爆火后研发加班追赶推理模型的节奏。

103: 用Attention串起大模型优化史,详解DeepSeek、Kimi最新注意力机制改进
2025年2月26日 · 1:28:15
清华计算机系刘知远团队的肖朝军与清华电子系汪玉团队的傅天予在本期解读DeepSeek和Kimi最新发布的注意力机制NSA与MoBA:两者都在预训练阶段引入动态与静态混合的块状稀疏注意力,以应对长文本和长思维链带来的计算瓶颈。节目先讲清原理:注意力机制让每个词与上下文动态关联,但标准Full Attention需存储所有词向量并与每个词逐一匹配,因此序列变长时存储和计算按N方爆炸,这也催生了稀疏注意力和线性注意力(RNN回归)两大改进方向。两位嘉宾指出,NSA与MoBA的突破在于用块状稀疏设计(整块保留或丢弃)适配GPU并行与内存访问,并通过Triton算子优化让训练和推理都获得实际加速;静态稀疏(如滑动窗口)虽快但可能错过远距关键信息,所以动态与静态混合成为共同选择,而稀疏训练的性能也被证明可追平甚至超过稠密注意力。他们还对照自己此前的InfLLM与MoA:前者强调稀疏需在块级别做并做到训练无关的推理加速,后者通过识别关键注意力头来保留长程关联;两人在实验中最看重训练曲线(如NSA的Figure4和MoBA的Figure3)和长CoT生成速度,而非传统Benchmark。展望未来,多模态会让序列急剧变长(如一小时视频约百万token),存储/记忆将成下一瓶颈,线性注意力或RNN路线仍是重要理论选项。下期节目将与MiniMax研究员聊其01模型采用的线性注意力架构。

102: DeepSeek 启动开源周,大模型开源到底在开什么?
2025年2月25日 · 56:40
本期《晚点聊》由程曼祺主持,邀请西北大学MLL Lab博士生王子涵,围绕DeepSeek开源周及大模型开源的具体层次展开。节目指出,开源不只是开放权重,还包括技术报告、推理框架、训练框架和数据集等层级,而绝大多数公司只开放前两者。王子涵以FlashMLA为例,解释了算子级优化如何提升推理效率,并对比了vLLM、SGLang、字节VERL等社区框架的生态差异。节目还剖析了DeepSeek选择MIT协议、开源最强模型背后的优先级与盈利模式,并谈到开源训练框架需额外投入代码规范化工作。王子涵分享了自己因开源模型被滥用导致推特账号被盗的经历,提出最强模型是否应开源的社会风险问题。节目最后讨论了OpenAI可能的开源选择,以及人类在AGI时代的位置。

100: 硅谷怎么看 DeepSeek ?与 Fusion Fund 张璐聊开源、Agent和“除了AI”
2025年1月29日 · 1:16:20
在《晚点聊》第100期中,程曼祺与Fusion Fund创始合伙人张璐讨论了DeepSeek开源推理模型R1引发的硅谷热议,张璐称其出圈是开源生态的胜利,并相信开源更有利于初创企业。张璐强调,R1以约557万美元训练成本(仅计算GPU hours)在多项基准上比肩甚至超越o1,其跳过监督微调、直接进行无监督强化学习的创新,也证明Scaling Law仍有巨大空间。她认为这类降低AI训练和部署成本的开源成果,会促使更多行业采用大模型,长期提升AI用量与算力需求,因此并非利空英伟达;对于Meta,短期虽有公关压力,但作为美国AI开源生态的主要玩家,将长期受益于开源繁荣。谈及Agent,张璐试用了OpenAI的Operator,指出它目前速度慢且会编造信息,但前景美好;她认为美国B端客户更看重准确性和专业度,所以垂直领域智能体在医疗、金融、保险、太空科技都大有可为,同时她也提到Agent可能带来隐私问题,但年轻人更愿意向AI倾诉。除AI外,张璐介绍硅谷还关注Tech Bio(科技与生物)和太空科技,Fusion Fund已投资SpaceX,并看好AI与这些领域的结合,她还提到SpaceX周边形成了数百家太空科技初创生态。

96: 和楼天城聊 Robotaxi:学习人类优秀司机,让我绝望
2024年12月25日 · 1:27:58
楼天城在小马智行这次访谈中系统阐述了Robotaxi过去5年的技术变革:L4必须从“Learning by Watching”(模仿学习)转向“Learning by Practicing”(实践学习),以世界模型作为车端模型的训练环境。他提出多个反直觉判断:模仿学习最多只能“像人”,但人类对AI司机的双标要求使像人永远达不到L4;越是优秀的人类司机,越依赖超越传感器数据的经验与直觉,模仿其行为反而是“反向优化”;世界上不存在MPI(接管里程)为1000公里的L2产品,因为那要求人一个月接管一次且始终保持专注,违背人性。小马5年前因此彻底放弃模仿学习,转向生成式数据和闭环训练,从零追赶,前两年“没有任何进展”,承受了巨大压力;他强调决定自动驾驶能力上限的不是车载模型,而是世界模型这一“工厂”的精度。世界模型包括数据生成器、驾驶行为评估体系、高真实性仿真和数据挖掘引擎,其中交互模拟和细粒度指标是核心竞争力。楼天城还明确L2+与L4是两件事:L2以低成本辅助人为目标,用模仿学习没有问题,但无法跨越安全与人性的门槛,做得越好,距离L4反而越远。商业化上,他预计1-2年内可实现成本更优的千台级无人车队运营并转正毛利,净利则要到5万台;而特斯拉如果继续坚持Learning by Watching,转向实践学习仍需时间。

80: OpenAI o1 来了!与硅流袁进辉聊 o1 新范式和开发者生态
2024年9月16日 · 1:40:20
本期《晚点聊》邀请硅基流动创始人袁进辉解读OpenAI o1:o1以强化学习、思维链与test-time compute的组合,突破了大语言模型在逻辑推理上的瓶颈,数学、编程和科学任务能力大幅提升。袁进辉认为这三项技术单独看都不是新idea,OpenAI把Alpha家族验证过的强化学习方法搬到大语言模型上,胜在组合,并验证了从train scaling law到inference scaling law的新范式;训练端用合成数据、推理端多次调用模型都会增加算力需求,但国内基础模型训练收缩,GPU短期有冗余、租金下降。从API定价看,o1每百万token约数十到上百美元,是4o的数倍到十倍,目前还不支持函数调用、流式传输,推理时间也长,但这些都可优化;而推理能力的提升让Agent范式更有望跑通。袁进辉还以硅基流动的一线数据反驳“AI应用降温”:大量小微企业和个人开发者正基于开源模型做应用,只是不在传统VC视野里,他称已有应用每天调用数亿至十亿token、每周活跃数十万;海外调用最多的是Meta的Llama,国内是阿里通义千问和幻方DeepSeek,千问胜在版本齐全,DeepSeek编程能力突出。他也不认为o1会改变大模型公司持续收敛的趋势,因为技术扩散和边际收益递减的逻辑未变。

71: “如果相信只靠 Scaling Laws 就能实现 AGI,你该改行了”,与香港大学马毅聊智能
2024年6月11日 · 1:53:00
本期《晚点聊 LateTalk》的嘉宾是香港大学计算机系主任、数据科学研究院院长马毅,他与主持人程曼祺的对话围绕“智能”展开,尖锐质疑当下主流的大模型路线。马毅的核心观点是:只靠 Scaling Laws(更多数据、更大算力、更大参数)无法实现 AGI,因为深度学习网络本质上都在做“压缩”——从图像、声音、语言等高维信号中寻找低维结构和规律;GPT 表现出的数学推理仍是记忆和统计,如同“高分低能”的填鸭式学生,学不到因果与逻辑。他区分了知识与智能:知识是存量,智能是增量,智能的本质是能纠正已有知识的不足并增加新知识。为此他提出“简约与自洽”原则,并用白盒模型(ReduNet、CRATE)从数学上解释神经网络每一层在做什么,称其已接近甚至超越经验设计的网络,能显著降低算力与试错成本。他还批评 AI 威胁论“要么无知要么别有目的”,主张政府应监管技术应用而非技术本身,并透露已创立公司“益生”推动白盒技术产业化;同时梳理了从控制论到深度学习的历史,强调闭环、自主学习和 AI 通识教育的重要性。
由 PodHood 提供支持