在 晚点聊 LateTalk 中提及的产品。

179: 蒸馏风暴:一场无人公开谈论的技术竞赛
2026年8月16日 · 49:33
《晚点聊》主播高洪浩与《晚点 LatePost》科技报道负责人程曼祺在本期中拆解AI模型蒸馏:它并非简单抄答案,而是有门槛的复杂系统工程。围绕字节跳动,节目披露张一鸣在内部会上反对蒸馏,理由是只能逼近难超越,且会让组织依赖捷径、丧失长期探索动力;程曼祺也分析Seed 2.1可能曾用蒸馏,字节在讨论后仍决定不走这条路。节目梳理了蒸馏出圈的关键节点——OpenAI o1开启推理模型与DeepSeek-R1发布推动规模扩大,并详解大规模蒸馏的账号与数据管线know-how、隐藏行为的难度,以及学生模型理论上可超越教师但代价是组织激励偏向确定性路径。此外,节目提及Anthropic曾点名DeepSeek、Kimi、MiniMax和阿里千问疑似蒸馏,并讨论蒸馏对商业模式的冲击:更便宜的智能让许多任务‘够用’,V4和Grok这类高性价比模型正在‘斩杀’高价低能的模型。

178: 与田渊栋聊 RSI:模型自进化如何到来?
2026年8月7日 · 1:29:02
田渊栋做客《晚点聊》谈他联合创立的 Recursive SuperIntelligence(缩写同为 RSI)如何让 AI 自我进化:这家公司刚完成6.5亿美元融资、估值超46亿美元,他认为 RSI 比 coding agent 大得多,完全自动化短期不会到来。他讲述从去年用 GPT-5 合写论文到决定创业的过程,称模型已强到「不用再招实习生」,并对比十年前 AutoML:现在大模型能理解 AI 本身,搜索空间不再由人定义。关于公司6月初的 First Steps,他说系统在 NanoChat 的 BPB 与 Speedrun、英伟达 SOL-ExecBench 算子优化上取得 SOTA:Speedrun 比社区两年成绩再快约两秒,算子优化比专注 GPU 的以色列团队 Double AI 高10%;他也评价 Anthropic《When AI builds itself》更多是提效而非递归自进化。对「领先者会越甩越远」的假设,他提出变量:智能提升可能是阶梯式跳跃而非平滑曲线,若 scaling law 不是全部,初创公司仍有空间;他还谈到大公司超过150人后变慢,RSI 目前缺数据、算力与可解释性。他坚持可解释性是关键,相信 AI 研究终将变成科学,但承认这是少数派观点。

174: AI冲击企业软件巨头?与SAP原欣聊大模型to B的颠覆与边界
2026年7月27日 · 1:31:43
本期《晚点聊》访谈SAP大中华地区总裁原欣,直面AI对SAP这类企业软件巨头的冲击与边界:她认为AI coding不会让业务逻辑和标准流程失效,SAP数十年积累的数据、流程和行业know-how仍是壁垒,但按坐席收费的商业模式将转向按用量和结果付费。原欣介绍SAP从记录系统向可执行的“自主运营企业”转型,与Anthropic、Google、微软、AWS、NVIDIA等基模和云厂商合作而非自研通用大模型;她认为“模型即产品”在To B不成立,企业用AI的落差在于脏数据不会自动消失,老板丢来“我也要”的难题,组织惯性比技术更难解决。她还判断FDE(前线部署工程师)是AI外溢到企业世界的必经路线,它和SAP过去的ERP顾问不同:前者偏工程和产品,后者偏业务和行业知识,未来将融合为既懂技术又懂业务的复合角色;SAP帮一家企业把关务Agent准确率从六七成提升到九成以上,说明标准流程叠加AI仍有价值。节目也谈到麦肯锡对2000多家企业的访谈中,28%的企业尝试AI但仅3%认为获得业务回报;大公司有钱做实验、小公司跑得快、最挣扎的是中型企业,中国没长出全球SaaS巨头源于高速增长留下的系统欠账;AI会先影响轻资产服务业,制造业从市场和售后切入。在中国,SAP与阿里云、千问、钉钉合作服务客户,并以全球本地化平台和流程挖掘工具支撑企业出海;对比本地部署、云到生成式AI,她觉得区别是速度,人的复杂性没有变。

163: 详解DeepSeekV4:Infra巨鲸、百万上下文走进现实、极致效率优化
2026年4月30日 · 1:33:52
本集晚点聊详解DeepSeek V4,SGLang核心开发者赵晨阳(RadixArk工程师)和UCLA博士生刘益枫判定:它并非范式创新,而是沿R1的“测试时扩展”范式,用混合稀疏注意力、Muon优化器、mHC、FP4等互相耦合的工程优化,让百万上下文从理论进入实用。V4放弃了V3的MLA架构,改用滑动窗口+CSA稀疏压缩+HCA稠密压缩的层间分工,换来激活参数占比仅3%、单token推理FLOPs仅V3.2的27%、KV cache占用仅10%的极致效率;但两人也指出,解决同一问题的token消耗反而增加,有“高压水枪浇花”式的浪费。他们具体拆解了四个新特性:Muon优化器已成为检验工程能力的试金石,V4将Kimi Muon Lite的0.2系数改为0.18;mHC是DeepSeek对Hyper-Connection的稳定化改造;Infra侧TileLang降低新kernel开发成本,FP4训练让采样和部署一致,实现真正的物理提速。此外,DeepSeek这次不再披露训练成本,两人认为最终训练成本只是冰山一角;发布延期源于四个新feature耦合导致组合爆炸,但团队流动率极低。节目还讨论了DeepSeek内部评测中9%工程师不会将V4 Pro作为编程首选,以及中美模型路线分化:美国公司追新能力、高定价,中国公司追性价比和工程极限。关于评测,他们认为benchmark会过时饱和,evaluation才是永恒追求;V4也未提出新的能力域,但它的极致压缩和低单token成本,可能成为后续开源模型的起点。

146: Gemini 3翻盘背后、Agent需要什么大模型、RL创业机会|与前 Google 创业者、硅谷投资人聊湾区动向
2025年12月26日 · 1:40:58
本期嘉宾是 MoE Capital 创始合伙人 Henry Yin、Naomi Xia 与 Agent 工具层公司 Precur 联创戴涵俊、Bethany Wang,由程曼祺主持,从硅谷一线视角解析 Gemini 3 与 GPT-5.2 同期发布、Google 靠什么强势回归,以及 Agent/RL 创业机会。嘉宾指出 GPT-5.2 在 GDPval 上达 70.9%(前代 38.8%)、ARC-AGI-2 达 52.9%,且 OpenAI 今年发布的三个 benchmark 均由 Anthropic 模型得分最高,显示其将研究与营销分开。Google 的反弹被归因于 TPU、Infra、模型到应用和硬件的多层协同设计,以及 DeepMind 与 Google Brain 合并后的整合。创业层面,Precur 做“可训练工具层”,让工具从失败轨迹中自我强化,早期客户测试中正确率提升约 12%;RL 机会被分为 RL 环境(如所投的 Preference Model)、RL as a Service 和 RL 垂直应用(如 Periodic Labs)。模型选择上,嘉宾强调云绑定优先于性能,Claude Code 与代码驱动工具调用(PTC)正成为 Agent 核心范式,Qwen 是表现优异的开源模型,飞往 NeurIPS 的飞机上约 1/3 的人在读 DeepSeek-V3.2 技术报告。他们预测模型将向加入大量 agent trace 的开源模型、更强多模态和长程任务优化演进。

139: ICCV最佳论文、光年之外、Sand.ai:曹越十年AI之旅,从研究者到CEO
2025年10月31日 · 2:06:28
本期对谈 Sand.ai 创始人兼 CEO 曹越——ICCV 最佳论文(Swin Transformer)得主、光年之外联创——讲他从研究者到 CEO 的十年。曹越在 ChatGPT 之前就从 OpenAI 的 CLIP/DALL·E 中读出“设计 scalable 系统最大化压榨算力”的方法论,为此离开微软亚研院加入当时国内最早做大模型的智源研究院;他说在微软亚研院学到的是关注最重要且有提升空间的 topic,并用足够资源做到极致。2023 年初他与王慧文一拍即合共创光年之外,也见过梁文锋;他记得王慧文对“中国为何没出现 OpenAI”的回答是“不够富”。他选择视频生成创业,因为技术天花板和商业天花板都高、又处在极早期。创办 Sand.ai 后,他复盘首个模型 Magi-1 因低估自回归路线难度花了一年多,之后转向“垂直整合”:让不同背景的人对齐上下文、让产品与模型互相放大。新模型 Gaga-1 以音画同出聚焦人物说话与表演,成本大幅下降,瞄准 AI 短剧、广告和 C 端“逗视频”。对 Sora 2,他最惊艳的是模型端到端直接生成有基础叙事的 10 秒短片,而非用 agent 拼接,并认为 OpenAI 是“端到端组织”,自己也正把 Sand.ai 调整成同样的组织。他还用“是否有新内容形态和新传播渠道”两个指标判断 Sora 能否成为 C 端平台。

137: Agent 是机会,造 Agent 的工具也是|从OpenAI开发者日聊起|Agent#6
2025年10月16日 · 1:28:58
本期《晚点聊》邀请AGI House联创Henry Yin与合伙人Naomi Xia,从OpenAI 10月6日DevDay发布的AgentKit出发,梳理了Agent工具链(Agentic Tooling)的六次进化与创业机会。他们认为,AgentKit是OpenAI开放了内部验证过的Agent开发全流程(构建、部署、评估),与2023年GPTs不同,Apps in ChatGPT和Apps SDK提供了真正的平台能力,可能让ChatGPT成为‘WeChatGPT’式超级应用;但AgentBuilder的可视化工作流与AGI路线有分歧,OpenAI不会放弃to B,已新设‘Future of Work’团队加速落地。工具链六次进化包括:GPT-3.5催生LangChain,function calling开启工具调用,MCP统一工具标准,GPT-4o语音带动实时语音设施,Claude 3.5引爆AI编程,O1推理与computer use让agent自我规划和用浏览器,每波都催生新公司。具体公司上,他们点评了Composio及其Rube产品以meta MCP server解决Cursor只能同时打开三个MCP server的限制,LiveKit一天2000万分钟语音(一年前100万),Letta的‘sleep time compute’记忆方案,以及OpenAI 11亿美元收购评估公司SetSeed的信号。他们估算,AI agent可将开发者工具市场从两三百亿美元推高至2000亿-5000亿美元,Okta、Twilio、Datadog在身份、通信、可观测性上可‘再做一遍’。最后,他们观察到2025年更多中国AI团队经HFZero等进入硅谷,20%-30%入营者是中国背景,其to C产品感和野心正在影响创业生态。

123: 当只有AI,人会活成怎样?与五源孟醒和两位挑战者还原72小时AI生存
2025年7月7日 · 1:56:12
本期节目由曼祺与五源资本合伙人孟醒、青年导演利建磊、AI产品开发者陈郅悦共同还原五源资本发起的“72小时AI生存挑战”,核心是验证背景各异的人仅靠大模型、AI Coding等工具能否生存、并做出有影响力的作品或产品。孟醒表示,活动受1999年互联网生存挑战启发,唯一不考虑的就是筛项目,希望跳出投资人信息茧房,回应2025年初“普通人能否用AI做出惊艳东西”的分歧;参赛者没有智能手机和浏览器,只拿到一台配置受限的电脑和一瓶水,最后有7人从300多名报名者中入选。利建磊完全不会编程,在超过24小时未进食、反复把报错复制给DeepSeek无果后,反而确定了对抗算法的主题,最终创作了马航MH370主题短片《7.41》,并得出导演无法脱离互联网工具成为超级个体的结论。陈郅悦从文科转码、3个月上线第一个产品并获得每月约1000欧元收入;这次她做出让大模型给真人主播反馈的AI虚拟直播,让素人也能在友好氛围中倾诉,她发现成本远低于预期,正在准备内测。节目还讨论了Agent的“脚铐”:验证码、登录、支付体系都为人设计,Agent只能“跪在验证码前假装是人”,数字基建尚未为AI主体铺路;而选手们度过72小时后,最强烈的需求仍是和其他参赛者交流。孟醒最后说,他不完全相信AI会带来稳定的小而美组织形态,下一步想验证的前沿是理解与生成统一的世界模型。

116: 当AI研究者写科幻,与Meta田渊栋聊他的智能想象:我们终会“所思即所得”
2025年5月17日 · 1:39:05
《晚点聊》本期请来Meta GenAI研究总监田渊栋,从他2024年出版的科幻小说《破晓之钟》切入,谈AI时代的科幻想象与现实印证:他2005年起研究人工智能,2020年动笔、2021年连载完这部完全手写的小说,书中“灵界立方”的互联设定源自英伟达GPU,两年后成了算力竞赛的真实图景。他借外星文明用虚拟世界“乐园”诱惑人类的故事,讨论未来人类可能一边进入虚拟世界、一边以计算载体走向星海,并预测科技终会到达“所思即所得”,而那时高级文明最想掠夺的是宇宙角落独一无二的智慧与“好点子”。小说主角是一群研究者,也带出他对学术圈的真实观察:他回忆了深度学习冷门时期在卡耐基梅隆读博的经历,区分了追求颠覆性突破与做实用改进的两类科研者,并讲述作为技术leader从“不要埋头苦干”到重新强调hands-on的转变,认为AI时代研发团队会更小更精悍。作为写作者,他对比了Claude、Gemini、DeepSeek等模型,认为它们仍缺乏对人物关系和长线逻辑的理解;他自己用Cursor等AI工具做了人机协作的写作软件,让AI补空、润色而自己保留核心创意。他相信人类独一无二的经验与见解是AI最需要的数据——就像银河联盟寻找全宇宙的好想法,而这本小说的续作《幽夜星火》正在网上连载。

114: 秘塔闵可锐2:“我不是演员”
2025年5月5日 · 2:01:51
本期《晚点聊 LateTalk》中,秘塔科技创始人闵可锐向主播曼祺与王与桐解释,这家成立七年的小AI公司为何刻意保持保守:他自评新产品“今天学点啥”仅70分,称秘塔80%的产品决策靠他“拍脑袋”,2024年只新融1亿多人民币、估值低得保守,还拒绝了去年的收购,因为他“当不了演员”,讲不了自己都不信的故事;他也提到秘塔搜索已接近100万日活。他说明为何不追Agent热潮——2025年上半年的模型能力仍撑不起相对通用的Agent,Manus的很多效果得益于Claude;也解释为何秘塔没有采用DeepSeek式高密度研发组织——“因为我们没钱”。他给出一个悲观判断:任何主要依靠大模型能力、有潜力做到1000万DAU的软件应用,大模型公司和大厂都会自己做,小公司只能“摸着石头过河,大厂摸着我们过河”。技术上,他认为Grok3证明了后发团队配上顶尖资源能快速追上一线模型,Llama4再次印证“一流资源、二流团队”干不过“二流资源、一流团队”,并强调预训练对推理模型至关重要,Scaling Law不是简单线性外推。节目还谈到“今天学点啥”下一步会为辅导孩子作业的家长优化,以及闵可锐对团队分工、没找产品合伙人和过去两年“各方面更会了”的反思。

109: 数字生命卡兹克如何用 AI:把任何重复3遍的事AI化
2025年3月30日 · 2:29:13
本期嘉宾是数字生命卡兹克(《数字生命卡兹克》公众号主理人),他讲述了自己从交互设计师到基金数据分析创业公司“九圈”的设计总监,再到2024年3月全职转型为AI内容创作者的历程。他所在公司在2022年底全员用AI,做出金融领域首个算法备案的基金问答产品,但因toB客户要求非标准化而商业化失败;他兼职做AI内容时,用Midjourney制作《流浪地球3》AI预告片出圈,并在Pika文章发布第二天一天做了13个券商线上路演。卡兹克自称“AI殿堂的门童”,用AI改造了内容工作流:每天自动抓取二十多个数据源,用模型打分筛选出10条AI资讯发到30多个群;用AI分析社群讨论和评论来挖掘选题;还曾用O1 Pro花11分钟完成过去11个人干两天的2400人报名筛选和分组。他认为目前真正帮到生产的Agent只有OpenAI DeepResearch,它生成的研究报告相当于三年研究员水平,甚至能写一个逻辑伏笔正确的三万字小说;多数Agent仍是玩具,因为多步任务的成功率会因每一步误差而趋近于零。他还提到DeepSeek的出圈让中国多了数亿从未接触过AI的用户,是“中国ChatGPT时刻”,也谈到与郭帆《流浪地球3》的AI合作、AI短剧《兴安岭诡事》分账盈利,并对比了2023与2025年AI产品推荐,担心AI越来越精英化,普通用户阈值变高,内容更难做。

99: MiniMax 创始人闫俊杰:做大模型,千万别套用移动互联网的逻辑
2025年1月20日 · 1:38:11
本期节目专访估值已超30亿美元的中国大模型公司MiniMax创始人兼CEO闫俊杰,核心主张是做大模型不能套用移动互联网逻辑:更好的模型可以导向更好的应用,但更多用户并不会导向更好的模型,因此MiniMax当前最重要的目标不是增长或收入,而是加速技术迭代。围绕刚开源的MiniMax-01,他解释开源是为了让问题暴露更快、提升研发效率并补上技术品牌;新架构把Transformer的注意力机制改成线性注意力,以支撑超长上下文,为Agent所需的记忆与多智能体通讯打基础。他也复盘了行业误区与自身失误:蒸馏o1数据复现o1不难但非最优路径,海螺文本失利是因为没有坚持技术驱动,而Talkie月活已超Character.ai、星野在国内同类第一的暂时领先来自技术路线选对与更懂用户。闫俊杰认为不应把创业公司单列为一类赛道,AI行业仍是技术驱动的长跑;2025年他更期待Agent能在专业领域达到专业人士水平,MiniMax也会围绕技术迭代设定目标。

80: OpenAI o1 来了!与硅流袁进辉聊 o1 新范式和开发者生态
2024年9月16日 · 1:40:20
本期《晚点聊》邀请硅基流动创始人袁进辉解读OpenAI o1:o1以强化学习、思维链与test-time compute的组合,突破了大语言模型在逻辑推理上的瓶颈,数学、编程和科学任务能力大幅提升。袁进辉认为这三项技术单独看都不是新idea,OpenAI把Alpha家族验证过的强化学习方法搬到大语言模型上,胜在组合,并验证了从train scaling law到inference scaling law的新范式;训练端用合成数据、推理端多次调用模型都会增加算力需求,但国内基础模型训练收缩,GPU短期有冗余、租金下降。从API定价看,o1每百万token约数十到上百美元,是4o的数倍到十倍,目前还不支持函数调用、流式传输,推理时间也长,但这些都可优化;而推理能力的提升让Agent范式更有望跑通。袁进辉还以硅基流动的一线数据反驳“AI应用降温”:大量小微企业和个人开发者正基于开源模型做应用,只是不在传统VC视野里,他称已有应用每天调用数亿至十亿token、每周活跃数十万;海外调用最多的是Meta的Llama,国内是阿里通义千问和幻方DeepSeek,千问胜在版本齐全,DeepSeek编程能力突出。他也不认为o1会改变大模型公司持续收敛的趋势,因为技术扩散和边际收益递减的逻辑未变。
由 PodHood 提供支持