在 晚点聊 LateTalk 中提及的产品。

165: GEAR 高深远:世界模型、自进化循环、DreamDojo
2026年5月18日 · 1:49:03
本期嘉宾是即将加入英伟达具身智能实验室 GEAR 的研究者高深远,他与主播程曼祺系统梳理了世界模型的分类、瓶颈与未来,并详解了他参与研发的世界模型 DreamDojo 和世界动作模型 DreamZero。节目按世界状态表征将世界模型分为几何、显式3D、隐空间和视频四类,高深远最看好视频世界模型,因为数据丰富、可端到端训练、能继承互联网视频的泛化能力;世界模型的核心价值是服务策略——用于测评、生成数据和突破物理时间限制的强化学习,但当前难以横评,因为各家机器人本体和动作空间不同。DreamDojo 从4.4万小时人类第一人称视频中迁移泛化能力,用隐式动作(Latent action)免去动作标注,把视频预测做到实时,并自建6个 benchmark 评测物理模拟和动作控制能力;DreamZero 则是以视频为骨干的策略模型,被视作可能取代 VLA 的世界动作模型(WAM)。高深远描绘了由世界模型、策略模型和连接二者的 Agent 组成的自进化循环,认为今年可能初步跑通,未来5年或成爆点;他还对比了 DeepMind 的 Genie-SIMA 与 Nvidia 的 DreamDojo-DreamZero 等竞争格局,指出当前最大瓶颈是物理模拟和动作控制的泛化,以及长程稳定性和效率。此外他提到 OpenAI 的 Sora 团队已重组到 robotics lab,并认为通用基模路线(如 Anthropic、AMI)最终也可能解决具身问题。

150: 【年末AI回顾】从模型到应用、从技术到商战,拽住洪流中的意义之线|Solo
2026年2月9日 · 1:58:22
曼祺在晚点聊年终特辑中单口复盘2025年AI:1月20日DeepSeek R1与Kimi K1.5同日发布,R1以开源、详细技术报告和557万美元训练成本破圈,推动模型转向Agentic、原生多模态与Coding能力,Claude Code被视为通用Agent,应用进入Agent元年,但Sora App三十天留存率低于8%。巨头之战中,字节跳动豆包成为中国首个日活破亿的AI产品,阿里千问App重做生活助手,腾讯引入姚顺雨改革混元组织并借DeepSeek翻身;春节营销豆包上春晚、元宝发10亿红包、千问撒30亿红包。创业公司方面,智谱与MiniMax先后上市,市值分别为794亿和1284亿元人民币,但收入与美国头部公司差两三个数量级;具身智能25年融资735亿元,宇树人形机器人销量超5500台,数据、VLA模型与本体仍是瓶颈,落地方向有研发、表演、工业、家庭和陪伴。模型研究还在寻找下一个学习范式,伊利亚、哈萨比斯主张从大脑获灵感,AI for Science方面深势科技用机器学习加速科学发现。AI硬件方面,AI眼镜被视为潜在入口,但显示、续航和重量未解;深圳系公司如影石、拓竹以垂直品类和供应链优势成为另一极,AI硬件更可能是多样化而非单一入口。最后谈AI中的人:硅谷天价薪酬与万人裁员并存,中国大厂在麦麦平台上激进扩招AI岗,主持人曼祺也反思AI并未解放自己,意义感或许要从工作转向体验与创造。

147: OiiOii闹闹:“先抖音后剪映” 不再成立,AI 时代怎么做创作工具和内容社区
2026年1月6日 · 1:41:27
本期《晚点聊》由祝颖丽专访动画创作Agent OiiOii创始人闹闹。开篇即提出核心观点:“先抖音后剪映”的模式在AI时代已不成立——过去先有社区再有工具,今天用户已习惯丰富内容,无法忍受单调,因此OiiOii选择先做好创作工具,再构建内容社区。闹闹把目标用户定为中国约180万至200万ACHD类账号(PUGC创作者),称OiiOii能让他们从周更做到“一日十更”,并明确不碰依赖剧本和投流的AI漫剧生意,而是追求风格、题材的多样化,以形成内容生态。她还复盘了自己2014年至2019年创办极限运动社区的经历,称那段触底反弹让她长出“抗体”,后来在字节负责剪映和抖音特效、在B站看到动画产能被压抑,最终在AI成熟时找到延续动画梦想的方式。节目中她也详细解释了多Agent工作流的复杂度、如何通过工程分流和智能选择来排列组合不同图像视频模型,以及团队中技术美术型人才的稀缺性。

139: ICCV最佳论文、光年之外、Sand.ai:曹越十年AI之旅,从研究者到CEO
2025年10月31日 · 2:06:28
本期对谈 Sand.ai 创始人兼 CEO 曹越——ICCV 最佳论文(Swin Transformer)得主、光年之外联创——讲他从研究者到 CEO 的十年。曹越在 ChatGPT 之前就从 OpenAI 的 CLIP/DALL·E 中读出“设计 scalable 系统最大化压榨算力”的方法论,为此离开微软亚研院加入当时国内最早做大模型的智源研究院;他说在微软亚研院学到的是关注最重要且有提升空间的 topic,并用足够资源做到极致。2023 年初他与王慧文一拍即合共创光年之外,也见过梁文锋;他记得王慧文对“中国为何没出现 OpenAI”的回答是“不够富”。他选择视频生成创业,因为技术天花板和商业天花板都高、又处在极早期。创办 Sand.ai 后,他复盘首个模型 Magi-1 因低估自回归路线难度花了一年多,之后转向“垂直整合”:让不同背景的人对齐上下文、让产品与模型互相放大。新模型 Gaga-1 以音画同出聚焦人物说话与表演,成本大幅下降,瞄准 AI 短剧、广告和 C 端“逗视频”。对 Sora 2,他最惊艳的是模型端到端直接生成有基础叙事的 10 秒短片,而非用 agent 拼接,并认为 OpenAI 是“端到端组织”,自己也正把 Sand.ai 调整成同样的组织。他还用“是否有新内容形态和新传播渠道”两个指标判断 Sora 能否成为 C 端平台。

136: Sora新世界 & Lovart 4个月复盘 | 与陈冕聊怎么做垂类Agent|Agent#5
2025年10月9日 · 1:59:43
Lovart创始人陈冕作客《晚点聊》第136期,与主持人程曼祺在Sora app发布前后两次对谈:他认为Sora打开的是一扇AI社交而非AI视频的大门,其核心是Cameo合拍与Remix共创,4小时体验里他惊艳于顺滑、音画同步和镜头语言;这类产品留给新玩家的窗口仅3到6个月,且更属于拥有顶尖模型和天量资金的巨头。同时他复盘了Lovart上线4个月做到15-20万日活、超过3000万美元年度预测收入的过程,坦言尚未覆盖API成本,但相信token会变便宜,订阅模式无需怀疑。他说垂直AI应用的本质是做两件事——特别的交互和特别的context,ChatCanvas是交互例子,即将上线的context模块会沉淀用户的reference和preference,增长方式是‘提前描绘未来会发生的东西,然后等它发生’;他也说现在已不再纠结开源闭源,应用公司的壁垒在于把context做到极致。在湾区旧金山California Street设办公室、参加多场线下活动并与FreePeak合办活动后,被反复追问热情的他更想清楚Lovart服务‘everyone who wants to create’,也因欧美设计师更贵更创意导向而在当地搭建了营销与设计团队。他判断To P的AI创业窗口接近关闭,下一波大机会在To C;技术变化太快,timing比移动互联网更重要,他几乎没错过重要窗口的原因就是焦虑——‘不焦虑的团队做不好AI创业’,组织必须高频迭代并拥抱焦虑。他也回顾了23年底公司濒临倒闭的危机,称坚持来自信念,信念来自认知;创业是痛并快乐,他最怕自己迭代不够快。

128: 小众AI场景拿到10亿级收入:测测任永亮首次讲述14年创业史
2025年7月30日 · 1:17:27
本期《晚点聊》对话测测创始人兼CEO任永亮,讲述他从北大医学部预防医学专业转做程序员、因个人情感问题在2011年创立测测的14年创业历程,并首次详细拆解测测从工具型社区、双边服务平台到AI对话机器人的四个发展阶段。任永亮透露,测测现有5000万注册用户,80%为女性、80%来自一二线城市,公司长期自给自足,他拒绝了外界的高价收购要约,为的是用现金流支持现在投入巨大的陪伴机器人业务;这款机器人预计明年面世,成本不低,核心是主动交互和情感陪伴,对标日本LOVOT,试图通过产品形态激发催产素而非多巴胺,打破短视频式的沉迷循环。他还分享了对泛心理赛道的独特理解:MBTI是自我认知工具,星座、生辰本质是太阳历周期假说,人是一个对初值敏感的混沌系统,这些体系只解释了一小部分规律,之所以人们总想'测测'自己,源于智人寻找确定性的本能。对AI趋势,任永亮明确表示悲观,认为大模型不会像前几次工业革命那样创造新的分工和分配体系,反而会替代工具化岗位,让多数人失去价值感,因此测测想成为'精神避难所'。他同时透露,自己因错过GPT-2而极其后悔,如今把机器人项目视为'有科学家执念的不理性选择',并借用李想的经历表达80后创业者在大风口到来时想做更大事情的心态。节目最后,他留下一个开放式问题:这个世界到底是否可被计算,能否在爱因斯坦的质能方程中加入信息维度——这也是他高中以来一直思考的困惑。

119: AI视频产品怎么Go Viral?6000万用户的PixVerse的答案
2025年6月8日 · 1:30:52
本期《晚点聊》对话爱诗科技联合创始人谢旭璋,讲述这家AI视频公司如何从投资人转身创业,做出6000万用户的产品PixVerse,并在国内以“拍我AI”上线。核心论点是:AI视频的机会不在冲击奥斯卡,而在用低门槛模板让普通人做出第一个可分享的视频,如“毒液变身”模板曾带来单月千万用户。谢旭璋分享了资源节俭的模型训练策略——用同行十分之一到二十分之一的GPU数量迭代七代模型,以及如何在Sora发布后的噪音中坚持方向。节目还复盘了他从光源资本到创业的心路历程:看过足够多公司后,认为看准就要all in,并相信非产品背景创始人也可在无人区探索成功。

89: 当技术遇上艺术:与 NVIDIA 和新片场聊 AI 如何重塑创作
2024年11月13日 · 1:14:14
NVIDIA中国区高级技术市场经理施澄秋与内容公司新片场CEO尹兴良在本期《晚点聊》中提出,生成式AI正缩短从创意到表达的距离,但影视行业真正普及新技术还需克服人才与成本障碍。施澄秋介绍了NVIDIA的Omniverse多人在线协作平台、ACE数字人引擎和NeRF神经辐射场等技术,称它们可实现实时多人在线协作、照片级数字人驱动和从少量照片快速生成3D场景重建;他还透露2021年GTC大会上黄仁勋演讲中有17秒是由ACE制作的数字分身,证明其逼真度。针对视频会议场景,他补充介绍Maxine软件,能以低带宽传输坐标来生成数字人,实现眼神聚焦。尹兴良以新片场出品的《南海归墟》为例,称该剧约一半时长为特效镜头、全片在棚内完成;他还表示,由于网络平台需要大量宣传物料,Midjourney等AIGC工具已用于制作概念海报和分镜,但视频生成距产业级仍有距离。新片场虽与国内AI厂商合作提供训练素材并测试模型,但除非成本数量级下降且有熟练的技术人员,否则不会冒险替换成熟流程,仍会优先选择传统团队。最终共识是AI的真正价值在于降低创作门槛,让普通人也能参与创作,人工智能可以打动人类但不会被打动,内心的想法和人类情感才是创作的本源。

86: We, Robot-2,清华叉院/星海图许华哲看“Optimus”的门道
2024年10月27日 · 1:05:06
许华哲(清华大学交叉信息研究院助理教授、具身智能公司星海图联合创始人)在《晚点聊》中从特斯拉We, Robot发布会的人形机器人Optimus谈起,阐释遥操作为何重要,并拆解通用具身智能当前的算法进展与创业选择。他认为这次丝滑的遥操作既是远程运力转移的实用价值,也为机器人提供高质量训练数据;从遥操到自主仍需海量数据和模型迭代。节目中他梳理了伯克利AI Research的强化学习传统、2019年ETH让机器狗爬山的标志性工作,以及自己用改进的PPO算法(BPPO)让机器狗在软垫上真实环境学习;他还区分了强化学习、模仿学习与多模态大模型的不同作用。关于形态,星海图选择轮式人形而非双足,是为了聚焦操作能力,因为操作才能改变物理世界、产生经济价值;灵巧手难度不亚于做好整个人形机器人,所以公司现阶段“力出一孔”做移动操作的本体、遥操作和智能。他也讨论了世界模型的定义争议(Sora为何不是、具备动作输入的视频预测才是)、触觉这一被忽视的模态,以及通用机器人面对的数据、模型两大瓶颈;他给出5年工厂大量部署、10年进入家庭的预期,并提醒机器人普及可能让人丧失部分决策权利。

84: 与侯晓迪聊特斯拉 We,Robot:烟雾与现实
2024年10月16日 · 1:08:36
Bot Auto 创始人兼 CEO、图森未来联合创始人侯晓迪与主持人程曼祺复盘特斯拉 We,Robot 发布会,认为马斯克的说法多为 hype:他称 Cybercab 每英里运营成本低于 0.2 美元,但仅电池折旧约 0.15 美元、电力和轮胎各约 0.05 美元,合计已超 0.2 美元,违背物理定律;没有方向盘和踏板更多是操控公众意志,而非技术进展。侯晓迪提出 L4 自动驾驶应统一以 CPM(每英里综合运营成本)为指引,并批评端到端被“意识形态化”:它在最优/平均场景表现尚可,但在最差场景不可解释、难以合规,无法用于 L4;他更认同“世界模型”是 David Marr 提出的中层视觉表征的延续。他还引用 Cruise CEO Kyle Vogt 在发布会前列出的 15 个运营要点,认为这些实打实的细节才是行业下一步需要解决的问题。他还认为特斯拉用 Model 3/Y“Airbnb”式接单短期不可行,责任归属无解;远程操控人车比从 1:3 走向 1:10 可能比外界预期更慢;L5 是永远达不到的地平线,L4 是要挣钱的产品。谈及再创业,侯晓迪表示已融资 2000 万美元,选择休斯敦是为贴近物流运营,并总结图森教训:不要过早扩张,重要的是利润而非收入,计划一年内让全 L4 功能车辆在休斯敦路测。

64: 让奶牛猫跳洗澡舞,与阿里通义薄列峰聊多模态共识中的变量是什么?| AI 大爆炸
2024年3月27日 · 51:20
本期《晚点聊》邀请阿里通义实验室XR实验室负责人薄列峰,聊其以“数字人”为主线的多模态研究——包括让奶牛猫跳洗澡舞的Animate Anyone、一键换装的Outfit Anyone,以及用一段语音驱动蒙娜丽莎开口说话/唱歌的EMO;他的核心判断是多模态是大模型发展的必然方向,但“世界模型”如何实现仍是最大变量。面对Sora,薄列峰认为其60秒高质视频确实震撼,但视频生成和世界模型远未解决,业界对世界模型的定义也无共识;相比谷歌、字节的视频平台积累,他提示OpenAI可能还用仿真数据,数据问题仍有挖掘空间。他解释EMO与旧Talking head方法的区别:它不只对口型,语音会同时控制表情、眼睛、头颈和上半身,且是zero shot,任意照片加音频即可生成,这得益于大模型的容量。节目还复盘了他的跨领域经历:07年博士毕业时深度学习尚非主流,在Amazon Go用深度学习解决实际视觉问题后确认其效果最好,并由此理解AI与硬件结合;他认为机器人等物理世界AI进化慢,硬件自由度与能耗是长期瓶颈。他也讲了Animate Anyone接入通义千问后的用户启发:宠物跳舞比真人跳舞更受欢迎,上传狗的人比猫更多,团队为此优化了骨骼检测;现阶段免费开放更重视用户反馈与模型能力迭代,而非成本。最后他提出世界模型的未来变量:应能模拟因果而非统计关系,是否必须3D化、是否需要能主动与物理世界交互的实体智能体,都还是开放问题。
由 PodHood 提供支持