127: 与真格戴雨森 25 AI 中场复盘:OpenAI的IMO金牌、Kimi K2翻盘、Agent普及和抢人大战
2025年7月21日 · 1:54:55
本期《晚点聊》中,主播程曼祺与真格基金管理合伙人戴雨森复盘2025年年中AI进展:OpenAI用未公开的通用大语言模型首次达到IMO国际奥赛金牌水准(6题做对5题),戴雨森认为这验证了推理时扩展定律、说明强化学习也能攻克难以验证的证明题,被OpenAI研究员Sébastien Bubeck称为'登月时刻';而OpenAI的ChatGPT Agent虽不惊艳,却标志Agent形态成为共识,也证明'壳'(应用)的价值被低估——模型进步与应用进化可能都在加速。他提出应用价值三层论:模型只提供底层智能,Context(组织与个人上下文)和环境工具须由应用提供,这正是Manus、Genspark等创业公司的机会。 他盘点各家公司走向:K2(月之暗面)已是目前最好的开源模型,OpenRouter编程类目调用量几天内从第10升至第5;DeepSeek R2要等新基模V4;字节Seed分设Edge、Focus、Base;Google回归第一梯队,Anthropic自造Claude Code加入应用层。被高估的是机器人进厂速度——特斯拉已下调Optimus产量预期;被低估的是模型能力进化速度、应用价值与优秀团队韧性。他还谈到硅谷抢人大战由Meta主导、腾讯成国内挖人最猛者,并预计Agent应用需要新的L3原生模型,以自己每月近1000美元的AI订阅费说明生产力场景token消耗将远超娱乐类。 面对未来,他持续好奇如何衡量智能边界——当模型已能解决IMO证明题、HLE得分从年初个位数涨到20多分,人类的评估体系正在失效;他也担心效率与公平的张力:当个人拥有巨大生产力,人与人差距会被急剧拉大。他推荐契合AI创业者心态的游戏《33号远征队》,并说自己年内最想验证的是L3模型能否让Agent任务一次做到七八十分以上。