在 晚点聊 LateTalk 中提及的产品。

80: OpenAI o1 来了!与硅流袁进辉聊 o1 新范式和开发者生态
2024年9月16日 · 1:40:20
本期《晚点聊》邀请硅基流动创始人袁进辉解读OpenAI o1:o1以强化学习、思维链与test-time compute的组合,突破了大语言模型在逻辑推理上的瓶颈,数学、编程和科学任务能力大幅提升。袁进辉认为这三项技术单独看都不是新idea,OpenAI把Alpha家族验证过的强化学习方法搬到大语言模型上,胜在组合,并验证了从train scaling law到inference scaling law的新范式;训练端用合成数据、推理端多次调用模型都会增加算力需求,但国内基础模型训练收缩,GPU短期有冗余、租金下降。从API定价看,o1每百万token约数十到上百美元,是4o的数倍到十倍,目前还不支持函数调用、流式传输,推理时间也长,但这些都可优化;而推理能力的提升让Agent范式更有望跑通。袁进辉还以硅基流动的一线数据反驳“AI应用降温”:大量小微企业和个人开发者正基于开源模型做应用,只是不在传统VC视野里,他称已有应用每天调用数亿至十亿token、每周活跃数十万;海外调用最多的是Meta的Llama,国内是阿里通义千问和幻方DeepSeek,千问胜在版本齐全,DeepSeek编程能力突出。他也不认为o1会改变大模型公司持续收敛的趋势,因为技术扩散和边际收益递减的逻辑未变。

64: 让奶牛猫跳洗澡舞,与阿里通义薄列峰聊多模态共识中的变量是什么?| AI 大爆炸
2024年3月27日 · 51:20
本期《晚点聊》邀请阿里通义实验室XR实验室负责人薄列峰,聊其以“数字人”为主线的多模态研究——包括让奶牛猫跳洗澡舞的Animate Anyone、一键换装的Outfit Anyone,以及用一段语音驱动蒙娜丽莎开口说话/唱歌的EMO;他的核心判断是多模态是大模型发展的必然方向,但“世界模型”如何实现仍是最大变量。面对Sora,薄列峰认为其60秒高质视频确实震撼,但视频生成和世界模型远未解决,业界对世界模型的定义也无共识;相比谷歌、字节的视频平台积累,他提示OpenAI可能还用仿真数据,数据问题仍有挖掘空间。他解释EMO与旧Talking head方法的区别:它不只对口型,语音会同时控制表情、眼睛、头颈和上半身,且是zero shot,任意照片加音频即可生成,这得益于大模型的容量。节目还复盘了他的跨领域经历:07年博士毕业时深度学习尚非主流,在Amazon Go用深度学习解决实际视觉问题后确认其效果最好,并由此理解AI与硬件结合;他认为机器人等物理世界AI进化慢,硬件自由度与能耗是长期瓶颈。他也讲了Animate Anyone接入通义千问后的用户启发:宠物跳舞比真人跳舞更受欢迎,上传狗的人比猫更多,团队为此优化了骨骼检测;现阶段免费开放更重视用户反馈与模型能力迭代,而非成本。最后他提出世界模型的未来变量:应能模拟因果而非统计关系,是否必须3D化、是否需要能主动与物理世界交互的实体智能体,都还是开放问题。
由 PodHood 提供支持