开场与开源0:00
欢迎收听 《 晚点聊 》。 经过 " 一切在加速 " 的 2024 年, 围绕中国大模型创业的讨论 , 从 " 谁又融资了 " 变成 " 谁会第一个倒下 "。
行业分化时刻 , 我们访谈了中国大模型六小龙之一 , 估值已超 30 亿美元的 MiniMax 创始人兼 CEO 闫俊杰 , 聊了 MiniMax 的新技术目标 、 他们刚刚发布的首个开源新模型 MiniMax-01 系列 、 去年 MiniMax 的变化和人员调整 ,以及闫俊杰作为一个 " 练习时长 3 年 " 的新人 CEO 的自我复盘 。10 个月前我们就访谈过一次闫俊杰 , 那次他提了很多字节 , 这次再聊明显感到他主动提
字节少了 、 提 Anthropic 多了 , 这与行业风向形成了微妙的反差 。在他更在意字节的 2024 年 3 月 , 大模型创业最是烈火烹油 ; 而现在 , 越来越多人开始讨论大厂对创业的压力 。MiniMax 本来是看起来相对 " 安全 " 的一个 ,因为它的 AI 社区产品 Talkie 的最新月活数已经超过了 Character.ai, 成为全球同类产品中的第一 ; 而它在中国的 AI 社区产品星野的用户数 、 使用时长和留存率 ,也都是
" 中国第一 ", 高于字节旗下的同类产品 。 闫俊杰却自己推翻了这些优势 : 在他现在的认知里 , 用户数等指标并非 AI 竞争的核心 。他说 :" 千万别套用移动互联网的逻辑来做 AI。"
移动互联网的逻辑是 : 用户越多 , 反馈越多 , 推荐算法越聪明 。 而闫俊杰认为 ,AI 大模型和产品的真实关系是 : 更好的模型可以导向更好的应用 ,但更好的应用和更多用户 ,并不会导向更好的模型 。在这个认知更加明确后, 闫俊杰说他做出了取舍 : 现在 MiniMax 的最重要的目标不是收入 ,也不是增长 ,是 " 加速技术迭代 "。
不到一年的两次访谈 , 我们从聊移动互联网到聊跳出来 , 从讲 2024 年的目标到闫俊杰复盘 , 当时定目标的逻辑可能就不太对 :AI 行业和其中的人都在快速变化与迭代 。
今天的主播是曼琪 , 下面我们就正式进入节目吧 。
你们今天发了新模型之后, 你收到的反馈里面 ,有哪些是让你觉得还比较有意思 、 印象比较深的 ?
就是这样的 , 就是说我发现在海外跟国内好像不太一样 。 我们昨天晚上先是更新到了推特上, 推特上我发现有很多海外的网友给我们发邮件 , 包括推特上面也留言 。
海外的网友第一个问题就是催我们 :" 其他的模态的模型什么时候更新 ?" 那这个事我理解是反映了一个现象 , 就是说可能对很多海外的用户 , 然后我们更出名的是我们的其他模态的这些模型 , 声音啊 、 视频啊 、 然后音乐这些东西 。
那这个东西我觉得对我们来说是个好事 , 我们会继续来提升这些模型 。 但是也反映了一个问题是说 , 比如说我们的文本模型 ,在海外用户里面其实并没有很知名 , 相当于是说我们的这个文本模型其实之前并没有建立起来在海外的这个技术品牌 。
这个的话我觉得是我们需要来提升的地方 。 当然还有海外很多用户会来讲 , 比如说这个架构上做了很多创新啊 , 支持的长度很长啊 , 然后我猜可能后面会有更多的开发者可以上面来做一些更激进的一些尝试吧 。
国内的话呢 , 我感觉好像是两类吧 。 一类的话呢 , 就是做技术的同学 。 技术的同学的话 , 确实是很多人是第一次开始真正面对一件事 , 比如说做一个很大的模型 ,不一定说只用 Transformer, 就是架构层面也可以来做很多创新 。
之前虽然说学术界有一些这种小的创新吧 ,但是其实很少有人把它能够真正做到一个比较大的规模 。
我们这个确实是第一次能够做到这样一个规模 。 这个的话我猜对很多学术界的同学 , 或者是做算法的同学还是挺有启发的 。
还有第二块呢 ,是来自一些非算法的人, 可能是我们的一些合作伙伴啊 、 一些朋友啊 , 很多人告诉我们说觉得我们这次好像是有点上道了 ,是因为我们开始意识到是说要来做技术品牌了 。
这个应该是我们第一次真正来做这件事 ,因为我们之前的时候很多时候其实相当于是闷头做技术产品吧 。其实我们之前比如说对技术品牌这件事 ,其实是没有一个很深的认知 。
我觉得今天这个算是第一次吧 。
你们这一次有很大的变化 , 就是你们是第一次开源的一个模型 。 这个跟你说的做技术品牌这个事是相关的吗 ?
还是说开源它是有更大的一个意义 ? 为什么要开源 ?
其实我们想这件事的话 , 本质上就只有两个原因 。 第一个原因是因为我们认为可以看到 , 比如说过去两年技术的泛染速度更来说还是非常快的 , 对吧 ?
然后我们相信至少接下来两年的技术进步的速度可能也是这么快的 。 那既然是这样的话 , 那在这个里面的话 ,其实真正有价值的事不是说你当前做得怎么样 , 真正有价值的事是说接下来的进步速度是怎么样的 。
这个我觉得是最核心的一件事 。 那我觉得开源这件事其实是一定程度上, 当然它有可能对外面的人会有一些贡献 ,但是我觉得可能对我们来说 , 我做这件事可能最大的一个驱动力是说 , 希望让我们自己的进步速度也能变得更快 。
因为你把你做的事都开放出来 , 做得好的地方可能会受到鼓励 , 做得不好的事也会受到很多批评 , 对吧 ?
所有的事都是公开的 。 这样的话 , 我觉得这个反馈链路 , 甚至是说比把一个私有化的模型放在一个产品里面 , 让一些用户来反馈 ,其实比这个链路的这个效率其实更高 。
我们觉得就是说通过把它开源 , 我觉得一定程度上是能够提升我们的研发效率的 ,因为问题暴露得更快 。
这个我觉得是一个比较重要的原因 。 当然还有第二个原因 , 就是因为我觉得我们在过去两三年吧 , 做得特别不好的一件事 , 可能是因为第一次创业啊 , 就是说我们其实对技术品牌没有一个很深的认知 。
我们直到最近才意识到这件事其实是一个很重要的事 。 本质原因也是因为我们意识到是说 , 我觉得这个行业最大的驱动力还是技术的进步 。
那技术的进步的话 , 那它的核心就是说你能不能有一个比较快的技术进步速度 。 那这个事当然它有一些这种硬件的条件啊 , 你有多少算力啊 , 你有多少数据啊 , 包括你有多少钱 。
当然还有一个软性的东西 , 就是说足够好的人。 我觉得这件事算是一个开始吧 。
所以最近让你意识到技术品牌更重要的事情和 DeepSeek 特别火有关吗 ? 你们开源是在追这个方向吗 ?
其实我们意识到这件事的时候 ,DeepSeek 他们还没有开源他们那个 V3, 然后我跟梁峰很早就认识 。
很早 ? 是什么时候 ?
应该就是去年他们还没有成立 DeepSeek 的时候 。
那是前年吧 ? 他们不是 23 年的时候应该就有 DeepSeek 这个品牌了 ?
那可能应该是去年的年初吧 , 反正大概就是那个时间点吧 。 我觉得它有两件事对我还是挺有启发的 。
但是这个东西跟我们现在做的事不完全相关 。其实我觉得最有启发的事是说 ,因为它之前也把换方也做得很成功嘛 , 所以我觉得它里面一个让我非常有启发的事是说 , 它对品牌的理解其实我觉得非常的强 。
我觉得他们的品牌做得非常好 ,他们可能是口碑最好的那一两家量化公司之一 。 我觉得他们应该是很早就意识到是说品牌这个事的价值 , 这个我觉得是一个比较有启发的一件事 。
当然还有其他的 ,因为一开始没有产品 ,其实可以把这个精力变得更聚焦 ,但这个事不同的人有不同的选择了 。
这两件事我觉得是他们做得是比较不错的 。
你们这次 01 的系列开源之后, 它是会更多的支持外部的开发者 , 还是你们自己的产品下面就会换成这个开源的版本 ?
我们自己内部也用了很多了 。
也用了很多是 ,但是你们也会有些别的版本在用什么更强的你们自己留着的 ?
没有 。
没有 ? 那你们就会换成这个开源的 ?
就是当然开源的话 ,其实开源的时候肯定需要改一些东西啊 ,但是我们并不太希望是说一定要藏一个什么东西更好的 ,因为这个东西没意义 。
因为所有的模型一年之后都是落后的 , 对吧 ?
对 , 现在模型的保鲜期是很短的 。
所以说其实藏了一个东西其实没什么意义 。
你们为什么没有更早开源 ?
所以我觉得这个东西是第一次创业 , 然后其实需要具备的基础还是挺多的 。 如果可以重新选的话 , 应该是更早的开源是比较合理的 。
更早是早到什么时候 ?
我觉得第一天吧 。其实开源反而可以做很多事 , 包袱变得更小 。 比如说你跟一个客户来合作的时候 , 如果你是闭源的 , 你要花很多精力来考虑怎么样保证模型安全 , 对吧 ?
需要花很多时间来考虑这些事 。 如果你是开源的 , 就不需要考虑这些东西 。 然后那比如说从对客户价值来说 , 肯定是开源最容易满足客户的价值嘛 , 对吧 ?
坦白的说 , 我觉得如果我是 OpenAI, 我都应该开源 。 你说 OpenAI 真的核心的能力是因为 GPT-4、OB、Claude 3.5 好吗 ? 我觉得其实不是 。
你觉得是什么 ?
我觉得是因为 ChatGPT 的品牌更新质 , 就是至少目前 。 可能在两年前确实是它的模型好 ,但现在我觉得其实不是了 。
对 , 它会是一个大家都觉得它全球的 number one 吗 ?
对 。
而且可能同样发差不多的模型 , 然后 OpenAI 发 , 它就会是一个潮流 , 别人发可能就不会那么大的关注 。
对啊 ,是啊 。
模型与用户8:22
因为你们之前一直讲的就是模型和应用一起做 ,而 DeepSeek 的梁文峰他是说我们现阶段是不做应用和产品的 , 我们就只做模型 。
你觉得这个事情它是可以复制的吗 ?
首先呢 , 我觉得不是这样的 。 因为 DeepSeek 也有一些产品 , 对吧 ? 最近也有 AGP 了 , 所以我觉得实际的情况其实不是这样的 。
但是反过来说呢 , 我觉得就是有一件事 , 大多数中国公司的认知我觉得都是错的 。 就是说如果你的目标是要做出来更好的智能水平 , 实际上你是没有那么依赖于需要有很多用户的 。
就这个事其实可以想一下就行了 , 对吧 ? 比如说 ChatGPT 的 DAO, 可能是 Claude 的 , 我猜应该是 50 倍到 100 倍吧 , 应该是这个量级的 。
但是你说 ChatGPT 的模型有比 Claude 的模型好 50 倍吗 ? 显然没有 , 对吧 ? 因为两个模型是一样的 。 这个东西其实只反映了一件事 , 如果你追求的东西是 AI 的智能水平 ,其实跟你有多少用户没有任何关联的 。
但是你再看中国其实也是一样的 , 对吧 ? 就比如说你看 , 比如说那个 。
同意和豆包 。
对 , 对吧 ? 其实是一样的 。 中国的这个人工智能的产业在过去一两年一直有个巨大的误区 , 就是说用户越多 , 模型的智能水平就提升得越快 。
那为了能够有更多的用户 , 所以就要把公司的大部分钱都花来买流量 。 这个逻辑其实是一个非常错误的一件事 。
其实你去年就说过这个观点 , 就是你说过你当时就觉得不是说用户越多 , 模型的能力就提升越快 。
对 ,但是去年说的时候可能还没有那么多人信吧 。 我觉得现在这个事应该就是一个 , 可能没有人明确这么说啊 ,但是我想这么说 。
我觉得要把这个事分两个事来看 。 第一个事的话 , 就整个行业 , 比如说能够有什么样的产品 , 对吧 ?
举例子 , 比如今年有很多这种 AI coding 的产品 , 对吧 ? 有很多视频的这种产品 , 这是今年才有的 。
这样就是有这样的产品肯定是依赖于模型的进步 , 对吧 ? 像去年就没有 , 为什么今年有了 ? 是因为今年的模型变得比去年更强了 。
所以说模型能力的提升是一个驱动力 。 那第二点的话呢 ,是说为什么会有这些模型 , 比如说为什么 Claude 3.5、Sonnet 的 VR 代码能做得很好 , 或者是为什么现在的这些视频生成的模型可以很强 ,其实不是因为之前就已经有一个视频生成的产品了 , 然后用户认为不好 , 所以它改进模型 , 就用户数据来迭代 , 所以才变好的 。
而是说一开始定了一个目标 , 我要做出来一个 , 比如说写代码的 Agent, 然后有了 benchmark, 比如说 swimbench, 然后我要生成一个什么样的视频 , 定了这样一个目标 , 然后从一开始做到这样的事 ,其实并不是跟用户一起来迭代出来的 , 对吧 ?
我觉得这个东西其实才是 AGI 真正进步的动力 。 然后它的底层原理是什么呢 ? 底层原理是说 ,其实模型已经比大部分的用户在日常使用中更加聪明了 。
所以说大部分用户的 query 其实是没有模型自己来模拟的更好的 。 所以说过去一年多吧 , 中国大部分的不管是创业公司还是大厂 , 都还是在延续那种用推荐的方法再来做大模型的产品 。
用推荐的方法 ?
用传统的做推荐系统 , 然后它的方法论来做大模型的产品 。 这个事我觉得根本上就是错误的一件事 。
你怎么总结用推荐系统的方法论来做大模型产品 ?
区别的话是说 , 用传统方法来做的意思就是说 ,因为比如说对一个内容型的产品 , 你没有办法非常明确地知道什么叫对 , 什么叫错 。
就举例子 , 比如说你在小红上发了一个内容 , 你没办法知道这个内容会不会火 , 对吧 ? 所以说只能发很多 , 然后 test 出来 , 对吧 ?
对 ,A/B test, 我去试的 。
它其实是 , 包括那个模型该怎么来改进 , 很多时候其实也不知道为什么这个改进会 work。 那不同的研究员尝试不同的算法 , 得在不同的 feature 做了大量的实验 , 然后最终找出来那个好的 A/B 指标好 , 它就好了 , 然后不停往上来累加 。
为什么会这样呢 ? 因为在做推荐的时候 ,其实你不知道对错 , 所以就这么来做 , 这是最高效的 。
然后呢 , 这个事反映到大模型里面 , 那基本上就是说分析各种各样的 case, 比如说把使用达标分成了 100 类 , 然后每类怎么来补数据 , 怎么来迭代 , 然后怎么来做 A/B test 的 , 基本上变成这样一种方式 。
但是这种方式我觉得它不是做 AGI 的方式 。 做 AGI 的方式是说 , 应该非常清晰地定义模型的能力怎么来分级 , 然后每代的模型能力对应一代新的能力 , 它需要什么样的这些底层的训练数据 , 需要怎么样的推理过程 , 需要能够设计多法案的 Agent。
我觉得它应该是定义出来 , 然后通过很多技术的手段来逼近这样一个指标的方式 。 所以这个东西其实你可以看到 , 基本上所有的公司都会遇到一个挑战 , 就是说在一开始那个瞬间 , 突然间会推出来一个很好的模型 , 然后那个模型它有了一些用户 , 然后开始考虑到这些用户的需求之后, 那个模型的迭代就会变得更慢 , 然后可能又会有新的模型出来 ,
然后打败前面的模型 。 你可以看到在过去一年多 , 基本上都是这样了 。 它其实并不是用户越多 , 模型水平就越好的这样一个过程 。
你是什么时候特别想清楚这个逻辑的 ?
我在今年 3 月份就想清楚了 。
你说的是去年 3 月份 ?
对 , 对 , 去年 3 月份 。
24 年 3 月份 ?
对 , 对 , 对 。
那你这个逻辑跟你们现在这一次 MiniMax-01 系列的更新之间的关系是什么 ?
其实想清楚之后, 我们就看到了几件事 。其实想清楚这个事之后, 大概的理解就变成这样 。 第一呢 , 就是说技术还是这个行业最核心的驱动力 ,但是你不应该把技术跟产品混为一谈 。
做技术干的事就是不停地提高能力的上限 。 这里面做的假设是说 , 第一 , 这个能力确实是可以提升的 ; 第二的话是说 , 当你提升了一些上限之后, 有可能会让原来的产品有一个根本性的变化 , 或者是能够出来新的产品 。
这个的话是做技术的假设 , 或者是做技术的逻辑 。 然后做产品的逻辑是说 , 你不要认为是说有了产品之后模型就能变好 。
所以说其实产品的目的不是为了让模型变好 , 产品它就是产品 , 那商业化的公司它就是一个商业化的产品 。
这个事算是对模型和应用一起做 , 或者大家去年会说的模型即应用 , 或者模应一体 , 它是一个反思 , 或者说 。
我觉得就是说 , 一个模型可能会导致一个产品出现 ,但它并不一定会导致这个产品持续地变好 。 产品持续的增长是跟这个产品本身相关的事 。
或者产品的可持续性吧 。 所以说其实当意识到这件事之后, 我们就做了几件事吧 。 第一的话 , 那我们认为 , 比如说怎么样来追求这种技术的领先 。
那技术领先其实不是说在当前的这一代的能力范围之内来提升几个点 。 做技术的话应该思考问题是说 , 怎么样能够有一代一代的往上来提升 。
那这个东西其实是核心 , 这个东西包括智能水平能够提升 , 能够支持更多的模态 。 这个的话就是我们做技术的逻辑 。
比如说我们为什么要出来视频模型 , 这个就是一个增加模态的逻辑 。 比如说为什么我们这次一定要用一个全新的架构来做 , 本质上是因为我们认为 context 很重要 , 然后怎么样能够支持非常长的一个 context, 怎么样能够有效训练跟推理 , 那变成了这样一个东西 。
包括我们接下来基本上也是这么一个思路 。 这个其实就是做技术的逻辑 。 产品的逻辑其实也很简单 , 那产品的逻辑非常明确 , 对吧 ?
其实你提升这些模型的能力 ,其实不需要依赖产品 , 技术自己就可以提升 , 或者是说自己的研究团队跟整个业界在一起就可以来提升 。
那产品的话 ,其实真正需要思考的事情就是 , 它对用户来说是满足一些需求 , 对公司来说它是一个商业化的行为 。
那怎样把这个事能够很好地结合在一起 。 那基本上我们过去 10 个月的决策 , 基本上都是基于这两个东西推出来的 。
技术与信仰15:11
那对你们来说到底是技术更重要还是产品更重要 ? 你会把自己定义成一个技术驱动的公司还是产品驱动的公司 ?
首先呢 , 说我们自己非常明确自己是一家技术驱动的公司 。 这个东西它不是一个口号 , 它的实质是说 , 当遇到冲突的时候 , 谁说了算 ?
因为总会遇到冲突的 , 对吧 ?
你可以举个例子吗 ? 遇到冲突 , 然后技术说了算的例子 。
我觉得这个例子其实非常多 。 比如一旦你有一个东西上到线上, 那一定会有些人觉得它好 ,也有一些人觉得它不好 。
不管那个人是用户还是客户 , 这种事是一定发生的 , 对吧 ? 但是精力跟时间都是有限的 。 那这个时候又有两种选择 , 对吧 ?
一种情况就是说 , 把这些简单的 case 都修了 ,但是这个东西导致你没法做一个更大的事了 , 或者没法让你的能力有个本质的变化 , 就不能跨过那个台阶 。
那还有一种方式是说 , 你要跨过那个台阶 , 跨过那个台阶的代价是说 , 小的事情就没法修了 。
那这个时候应该怎么选呢 ?
按你的逻辑就是选要跨大的台阶 。
对 , 实际上就是我们的最底层的一个逻辑就是这样的 。
那你们去年有实际发生过这样的事情吗 ?
我们发生过很多次这样的事 。 我举例子 , 比如说海螺视频那个产品 , 如果按照它的访问量来说 , 它应该已经是现在全球最大的视频生成的产品了 ,但是它的整个页面其实非常的粗糙 , 甚至刚上线的时候都没有英文的页面 , 只有一个中文的页面 。
但那个时候有非常多的海外的用户 。 那个时候一上来 , 原来有这么多用户啊 , 那怎么办呢 ?
那就发现有很多事需要做 , 对吧 ? 一定会有用户提出来各种各样的问题 , 比如说为什么 runway 支持一个功能你没有 , 为什么可灵出来一个 APP 你没有 , 就有很多很多这样的问题 。
但是一旦你去解决这些问题之后, 模型的进步速度一定会变慢 ,因为精力一定会分散 。 那这个时候该怎么办呢 ?
你们的选择是当时 ?
我们的选择就是 , 那其实我们的选择很简单 , 就是听算法 。
听算法的 , 所以算法的人后来是怎么说的 ?
它的实质就是说 , 那我们意识到一旦我们的技术不领先了 , 这产品可能就没有了 。 那我们唯一应该干的事就是把我们的精力花在 ,不管是算法的人 、 产品的人还是运营的人, 最重要的精力是花在帮助算法的能力能够到下一个台阶上 。
甚至比如说像星野滔滔这样的产品 ,其实也是类似的 , 虽然它看起来是个非常娱乐化的产品 , 它里面做的那个算法其实一点也不比做一个通用模型简单 。
当你为了让产品能够刚刚上线 , 你需要做一个比较大的算法的变化 ,但这个算法的变化会影响很多用户数据的时候 , 你怎么来选 ?
坦白说 , 我们在那个 2023 年的时候 ,有时候还是会纠结的 ,但在 2024 年基本上就不太纠结了 。 那我再给你举个例子 , 比如说我们的那个海螺文本 , 我觉得这是我们算是过去一年没有做起来的一个产品 。
那个时候有两个选择 , 对吧 ? 一个选择就是大家都在疯狂投放 , 你要不要投 , 对吧 ? 并且那个时候大家都认为是说 , 那个产品是最能够代表智能水平的一个产品 , 对吧 ?
现在也有人是这么认为的 。
对 , 对 , 那我们当时的决定是 , 我们意识到这件事 , 第一就是其实提升技术跟用户数其实没有什么特别强的关联性 。
那第二的话呢 ,是说产品就应该思考 , 那产品最终它是一个业务 , 那我们的决定就是不投放 。 本质上就是这样的 。
其实在你的描述里 , 你们的逻辑是非常一以贯之的 。 然后这一次我来采访你之前 , 我也收集了一些问题嘛 。
就比如说有一个 AI 投资人 ,他对你们的观察就是觉得 MiniMax 最开始融资是很早 , 那是 2021 年底的时候 , 你们讲过做虚拟人, 然后到后面 Glow 星野这种产品 , 它是一个摸索了类 Character.ai 这种产品方向 。
然后到 Kimi 火了之后, 你们好像又重启了生产力的工具海螺 ,Sora 之后你们又放了更多资源来做视频生成 , 然后现在又是在做开源 。
就他会觉得你们是一个技术能力很强 ,但是好像一直在跟随热点而动的公司 。
我猜那个人可能对我们有很多误解 。
你可以讲讲啊 。
原话是因为我们一开始想做的事 , 上次技术报告都已经写了 , 对吧 ? 他从来就不是一个出资人, 只是在我们做开始创业的时候 , 三年前的时候 , 那个时候根本就没有大模型的概念 , 然后很多真正不懂这个行业的人, 就会把它当成他是一个出资人。
但是你可以看一下我们第一天的那个声明 , 我们是怎么来写的 , 然后这是第一个 。 第二个可能是说 , 像 Glow 还有星野 Talkie 这种产品 ,其实并不是来追随 CAI, 我们做的时候还没有 CAI 的 。
你们其实是差不多时间上线 , 就差了一个月吧 , 隔了一个月 。
对 ,但是比如说在移动端我们是更早的 , 这是一个实际情况 , 对吧 ? 然后比如说像海螺 , 一开始的时候其实我们也是在两年前就推出了 , 只是因为那个时候它前一年多它其实并没有做起来 。
当大家真正知道这个行业有这样一个赛道的时候 ,在那个时间点 Kimi 的表现比我们好 , 所以就以为是说我们是在重启 ,但是它其实很早它就有了 。
它其实就是我们一开始写的 , 我们认为通用人工智能或者叫大模型出来之后两代应用 , 一个的话是先来做这种偏休闲娱乐类的 , 然后再来做更高效率的 。
我们第一天就这么写的 。 然后再说一下这个视频 , 那视频这个事其实它的实质是说 , 当我们在最开始来做星野跟 Talkie 的时候 , 我们其实一直有个想法是让那个角色可以动起来 ,因为那个视频我们其实就立项了这件事 。
只是说 Sora 的出现之后, 我们意识到这个事它比我们想的要更大一点 , 所以我们把它给做得更加通用了 。
那为什么要开源 ? 开源的本质是说我们开始意识到说 , 需要来加强我们的技术品牌 , 我们认为技术会快速进步 。
像过去一年就出来好多新的技术 , 对吧 ? 那一些新的技术它有可能会让产品发生一个变化 ,有可能会带来新的产品 。
那这个其实就是我们的逻辑 。
其实他好奇的问题是 ,他想知道你的 AI 信仰到底是什么 ,因为看起来你们做过什么事情嘛 。
我觉得信仰的话 , 本质上我觉得现在没有人有能力来定义出来什么叫 AGI。
现在没有人有能力定义什么叫 AGI?
我觉得真正能够定义的东西是说 , 智能水平会不停地进步 。 所以说其实我们自己是没有定义什么是 AGI 的 , 然后我们只定义了墙上写的 Intelligence with everyone, 这是第一个 。
那我们需要 Intelligence 的水平能够不停地提升 ,但这个事它显然不是一蹴而就的 , 那它需要分阶段一步一步来做 。
然后我唯一一贯之的逻辑就是说 , 每个阶段应该做什么样的事 , 然后在这个阶段积累的能力 , 积累的技术 , 积累的产品 , 积累的各种各样的数据 , 能不能让我们到下一个阶段 。
这个事我觉得它有点像长征 , 可能你不知道你的最终目的地在哪 ,但是你知道的事情是有更好的智能水平这件事 , 它大概率是一个有意义的事 。
对 , 就是长征是你不知道具体的目的地 , 是一个具体的什么地方 ,但你大概知道它是一个什么方向 , 对吧 ?
对 ,其实创业是一个很艰难的一件事 , 它其实不是说有个机会 , 可能所有人都看到了 , 这个机会就是给你的 , 你就是一个天选之子 , 然后这个机会就属于你了 , 你就在那注视着 , 你就来拿到这个机会 。
它的实质是说这个事很难 ,但是它价值也很大 , 很多人都看到了 ,但是不同人有不同的理解 , 不同人有不同的路径 。
那作为一家创业公司 , 第一 ,因为创业它的一个前提是说你自己有独特的理解 , 那第二的话呢是说 , 那你的资源肯定不是最多的 , 甚至可能是非常少的那个 。
我指的是跟海外的公司比 , 或者跟中国最好的大厂比 , 你的资源是非常少的 。 那在这个情况下, 那你的路径是什么样的呢 ?
你能不能走到那个点上呢 ? 这个事我觉得才是比较关键的 。 这个事它其实不是说一开始你可以规划出来你所有的行程 , 你照着走 , 所有的路都给你铺好了 , 我觉得不是这样的事 。
它其实就是需要每一步每一步这样不停来争取 , 然后不停来提升的这么一个过程 。
就你刚才说 , 你能确定的是技术会不断地进步这件事是可以确定的 。 然后关于技术怎么进步的方法 ,其实行业相信的东西也变化很快 。
比如说李开复上周就告诉我们 , 可能整个行业从信仰 Scaling Law 到怀疑 Scaling Law 就只用了一年的时间 。他觉得整个 AI 2.0 相比之前商汤方式那个时候是在加速的 。
你怎么看这个变化会这么快 ?
坦白说我不太认同这么一种看法 ,因为就跟接近一家公司 , 你把公司能够变好 10 倍 , 或者做一个技术 , 把技术做好 10 倍 , 这个事本来就很难嘛 。
它肯定不是说自然就发生的 , 它其实就是需要来做很多创新的 ,并且这个东西对创业公司来说其实更是这样的 。
如果比如说你是阶梯操作 , 你可以所有方向都做 , 对吧 ? 最终反正就算法出来一个好的 , 它就好了 。
对创业公司来说 ,其实第一你翻速的机会非常少 , 那第二的话呢是说各方面东西其实你都没那么好 , 当然很想变好啊 ,但是其实各方面来说都是有欠缺的 。
那在这个情况下 ,但我觉得这个东西是好事 , 这种方式其实可以逼着你一定要去来做一些真正创新的事 。
就是你指资源有限这件事是个好事 , 对吧 ? 逼着你创新 。
对 , 我觉得是这样的 。 假设我们的资源也非常多 , 那我们其实也不需要来做创新 , 对吧 ? 但是如果一个创业公司不去来做这些创新了 ,不管是技术上的 、 产品上的 、 业务上的 , 那为什么这个世界上还需要创业公司呢 ?
那你刚才说你坦白说你不认同的那个观点 , 你是指的什么 ?
我是说作为一个真正的创业者 , 这个时候想的事情不应该是说 Scaling Law 撞墙了我就放弃了 , 应该想的事情是说我要做什么样的事能够让 Scaling Law 可以延续 。
那这个里面的话 , 我需要做哪些创新 ,不管是算法层面的 、 组织层面的 、 业务层面的 , 还是方向层面的 , 怎么来做取舍 。
我觉得这个东西才是一个真正的创业企业应该来追求的事 。
或者说得更直接 , 就是你要想做一个创业公司 , 你得想办法怎么让这个技术可以继续提升 。 你把这个东西这个方法叫做 Scaling Law 也好 , 或者它是个什么别的东西 ,其实都可以 。
对 ,但我们应该做的事情不是说抱怨它很难 ,而是说我们要找方法 。 但是有可能找不到方法 , 找不到方法那我们确实应该关闭 ,但是至少在我们还有机会的时候 , 我们应该干的事是去努力找到那些方法 。
因为这 AI 行业其实挺有特点的一点 , 就是大家总是会讨论技术信仰这个事 。 你觉得信仰是一个合适的词吗 ?
有更合适的词吗 ?
一年前最喜欢说信仰那些人, 现在说那些信仰都兑现了吗 ?
你指的谁啊 ?
我觉得行业里面最喜欢说信仰的那些人, 不管是中国的还是海外的 。
但是信仰是一年就能兑现的事情吗 ? 信仰不应该是个很长期的事情吗 ?
那你要看在做啥呀 , 它可以是个很长的事啊 ,但是它至少得是一个往那个方向来做的事啊 。
那信仰是直线到达的吗 ? 我们中间不能走弯路吗 ?
但是相反的呀 。
你觉得什么事是和信仰相反的 ? 比如说投放 。
我觉得就是说如果你信仰技术重要 , 那我们就客观来看待一个情况 , 对吧 ? 比如说美国公司跟中国公司 , 美国的 AI 公司其实没有钱 ,不会把自己公司的钱 , 美国的比较好的公司 , 比如说包括 OpenAI, 包括 Anthropic, 你可以看他们的钱是怎么来花的 。他们的钱可能最主要的是算力 ,其次的话是人才 , 然后市场营销费用占比是非常低的 。
我觉得真正应该信仰的事情是说 , 首先第一 , 我信仰的东西不是说 AI 的终点在什么地方 , 信仰的东西是说技术可以不停地提升 。
我觉得这是一个我们比较底层的一个信仰 。 第二的话呢是说我们需要做的事 ,不管你有多少资源 ,不管你在什么样的一个环境里面 , 都是有限的 。
那在一个有限的环境里面 , 你怎么样做能够对这样一个技术的提升起到自己的贡献 ,在这个浪潮中能够推动这个浪潮的发展 , 这个东西就至少是我个人对这个什么叫信仰的一个理解 。
那如果可以换一个词的话 , 你觉得其实用什么词会更合适 ?
我觉得叫信念吧 。
Agent 时代25:31
然后你们这次 MiniMax-01 系列的更新 , 还有一个关键词 , 就是新架构开启 Agent 的时代 。 我觉得这个我们可以详细展开聊一下, 一个是新架构 , 一个是 Agent 的时代 , 对吧 ?
可以先讲讲就是为什么你们会觉得 Agent 是一个重要的目标和方向 ?
其实核心是这样的 , 这个东西它来自两个层面 , 一个层面是来自于比如说 AI 的这个该怎么来提升 , 然后这么一个层面 , 就是 AI 的能力变得更强之后, 它应该往哪个方向能变得更强 , 然后这是第一个思考路径 。
第二个思考路径是说 , 假设 AI 变得更强之后, 对人类社会能产生哪些有益的变化 。 首先第一点 , 那比如说什么叫更好的智能水平呢 ?
其实非常显然的一件事就是说它应该能处理更复杂的任务 , 对吧 ? 那处理更复杂任务的一个标志就是说它能够做很多步 ,不管是说这个多步就是像 o1 这样的 , 就是说单次直接输出的 , 还是说通过一个单个的 Agent, 然后把它拆成了多步 。
当然这个东西按照 Anthropic 的定义叫 workflow, 就是定义好的一个 workflow,但是分成了多步 , 还是可能是更复杂的 , 它需要多个 Agent 来协同 。
但是它的实质就是说 , 我们应该做的一个假设是说 , 当前的 AI 的模型的能力水平 , 再加上一些算法的发展和算力的发展 ,AI 在接下来一段时间里面能够处理非常复杂的任务 , 这个事我觉得是可以这么来假定的 。
那第二个的话呢 , 比如说当 AI 能够处理一些更复杂任务之后, 它能够给社会带来什么变化 , 那我觉得很显然的一件事是说它的交互形态会发生一些变化 , 就不完全是现在这种 chatbot, 对吧 ?
就是你跟它聊天立马会给你一个 feedback, 它有可能就是一个执行了更长时间这么一个过程 。
什么叫更长时间 ?
就执行了更长时间 。
执行了更长时间 。
就是简单点理解的话呢 , 就是说之前的 AI 做的啥事呢 ? 就比如说你妈教给了你一个任务 , 你可能聊天的时候就立马回复它 。
那还有一种形式就是说 , 可能你想了两天 , 准备了很多东西之后你来告诉它 ,其实就这么一件事嘛 。
显然后面一件事的价值其实是非常大的 。 那这个事我觉得下一代的就是说 Agent 的时代应该来解决的场景 。
那简单来说 , 你对 Agent 的定义就是它能处理一个比较复杂的任务 。
对 , 那处理复杂任务的话 , 定一个标准 , 什么叫复杂任务 , 我自己的理解就是在专业领域能够到专业人士的水平 。
你们应该还是主要专注于是虚拟世界的 , 对吧 ? 就比特世界的 , 就它和是不是在物理世界有联动 , 它有关系吗 ?
目前还没有 ,但是不意味着这件事它不应该跟物理世界联动啊 , 只是我们目前还没有能力能够到这个领域里面来 。
其实去年我们聊的时候 , 你当时就说过 Agent 这个方向在 2023 年的时候就很火 ,但那个时候没有任何一个公司把它做成功过 。
那它的本质原因是因为那个时候的模型能力不够强 。
对 , 你当时就说是因为模型能力不够强 , 所以现在你们认为这个 MiniMax-01 它可以说是开启了 Agent 时代 , 那它到底是哪变强了呢 ?
其实我觉得这个东西分成两个层面 , 一个层面的话就是说它的这个架构层面能不能支持这件事 , 第二的话呢是说它的这个能力本身能不能支撑这件事 。在架构层面其实做到这件事了 ,因为它可以处理的长度非常的长 ,因为我们想过 , 比如说不管是在单个的这种 Agent 里面 , 它其实需要很长的记忆 , 需要很长的这个沙文的输入 , 然后在多 Agent 的系统里
面 , 它其实需要不同的 Agent 之间能够交互很多信息 , 这个事的前提都是说能够做非常长的 context 的计算 。
然后在架构层面 ,其实我觉得我们现在已经实现这一点了 , 应该也是现在全球可能是唯一一个能够这么来做的一个架构 。
然后第二个的话呢是在能力层面 , 然后在能力层面的话 , 我觉得我们其实还是有很多可以提升的地方 , 比如说举例子 , 比如说 Agent 需要的很多能力 , 对吧 ?
比如说使用工具的很多能力 , 比如说做这种规划的 , 就是 planning 的能力 , 然后类似这样的能力 , 我觉得我们这个模型其实还没有优化得很好 。
但是呢 , 好处呢是说这些能力其实都有很多标准的 benchmark,其实是说只要把这些 benchmark 能够刷好 ,并且让它能够把它的这些事可以泛化 , 这个事我觉得就可以慢慢来实现 。
而且你刚才还提了一下说你们这个架构是在 Transformer 的一个创新 , 对吧 ?
对 。
那它不是 Transformer 的架构吗 ?
是这样的 , 就是说标准的 Transformer 呢 , 它其实里面会有几个模块 , 我们这个呢是把 Transformer 其中一个模块叫 attention, 从 Scaling Law 的 attention 变成了一种 linear attention。
你可以认为我们把 Transformer 里面最重要的一个模块给做了一个变化 。
所以它是 Transformer 一个比较大的变体 , 可以这么说吗 ?
你可以这么来理解吧 。
对 , 这个也是你去年的时候讲过的 , 你当时就说从这个非线性的注意力机制到线性的注意力机制 , 你觉得是个非常值得去做的方向 。
是 。
而且你当时有说过 , 你说谷歌的 Gemini 其实它是有实现这个线性的注意力机制的 。
是这样的 ,Google 比较强的一点 , 坦白说我认为 Google 再加上一年可能会比现在变得更强 ,因为他们其实可以做这种 ,他们的硬件跟他们的算法其实可以非常好地协同在一起 ,因为 TPU 也是训练框架 ,也是他们的算法 ,也是他们的都是一体的 , 所以他们做这件事相对来说更简单一点 。
但是对我们来说的挑战在于是说 , 我们并没有并不可以自己来定制 TPU, 对吧 ? 我们只能用标准的这些硬件 ,在一个标准硬件上来实现这件事 ,其实就会变得更复杂 。
我们其实做了很多工作都是说 ,不好意思 ,在目前这个阶段硬件你是不能变的 , 那能改的只有算法跟软件 , 那应该怎么来做 , 这是我们现在做的事 , 这个也是跟 Google 的区别 。
那除了实现这件事难度更高之外, 你们的线性注意力机制和他们的区别是什么 ?
首先呢 , 我们是开源的 , 对吧 ?Google 它是闭源的 , 所以我并不精确地知道它是怎么做的 。 但是我猜的话 ,他们应该是用了那个 select window attention, 然后我们用的是一种我认为上限更高的一种方式 。
你可以解释一下啊 。
就是 Google 的做法呢 ,其实就是说 select window 就是滑动窗口 , 就是一开始记忆可能没那么长 ,但是没关系 , 就分成很多段 , 对吧 ?
然后一个滑窗这样滑过去就行了 。 然后我们的这种呢 ,其实还不是滑窗的 , 它其实还是都算的 , 只是我们找了一些近似的算法 , 让它可以算得更快了 。
你刚才说这个架构是解决了长文本的高效 、 快速和便宜的处理 。其实我觉得不是长 , 我觉得比长文本更好的定义应该是长上下文 。
长上下文 ?
比如说在单个智能体 , 当你跟一个 Agent 来对话的时候 , 你发现一个非常本质的事情 , 你得希望让那个模型它跟人的一个很大的区别 。
我的感受是说 , 人是可以感受到时间的流逝的 , 时间的变化的 ,但是 AI 其实是感受不到的 。 这个里面其实它的实质是说怎么样处理越来越长的记忆 , 这个事其实很难的 。
比如说你可以看一下, 即使对一个人也很难 。 所以说对单个 Agent 来说 ,其实你可以认为人长是一个坐标轴是时间 , 对吧 ?
你可以认为人就是在一个时间坐标轴上这样滑动的这么一个过程 , 对吧 ? 它也不停地有越来越多的输入 , 然后也有一些新的输出 ,其实就是这么一个过程 。
这个里面的话呢 ,其实我们认为能够提升单智能体交互质量的一个核心就是说 , 你能够记得东西越来越长 ,不管是在一个虚拟世界还是在现实世界 ,其实是一样的 。
就是你不要把它想成是一个单次的对话 , 你要把它想成是一个无限的对话 。 然后在多智能体里面其实也是一样的 ,但是现在其实可能还没有很好多智能体的产品 ,但是其实你能可以很直接地感受到是说 , 大家其实已经可以开始思考是说 , 为了一个多智能体的系统 。
这样的基础能力 , 当然这里面有些比如说模型本身的能力 , 还有的话是说多智能体之间怎么来通讯 。
你可以看 Anthropic 他们定了一个多智能体之间通讯的协议叫 MCP, 然后 MCP 里面那个通讯的东西那个量其实是非常长的 。
那假设是说一个多智能体的系统 , 那它的一个核心就是说不同的 Agent 之间首先单个 Agent 要足够强 ,其次不同的 Agent 之间能够协同 , 协同的前提是说它的通讯能够比较有效率 。
那这个东西其实就是意味着对一个更长的上下文的一个处理 。 对 , 就也是需要它的记忆能力 。
对对对 , 所以解决这个问题就分两步嘛 。 第一的话是说你的底层的计算架构什么的支持这件事 , 这是我们已经做了 。
那第二的话呢是说在计算架构上的支持的前提下, 每个地方的能力能不能做到足够好 , 这个是我们第二步要做的事 。
就第二步是你们计划中的接下来要做的 , 第一步是你们现在这个更新就是已经实现的 , 对吧 ?
对对对 。
就是第二步你刚刚举了一些例子啊 , 如果完整的总结的话 , 就是智能体所需要的更多的能力还有哪些 ?
我觉得其实有很多 。 为什么我说目前这个情况做出来一个很好的支持水平 ,其实跟有的时候用户关联度并不那么高呢 ?
一个比较核心的原因是因为就是驱动这个领域里面有些比较大的块的这样的一些东西 ,其实一些 benchmark, 这些 benchmark 大部分时候是由学术界定义出来的 。
举例子就是代码 , 对吧 ? 比如驱动这个代码这个进步的一个很重要的 benchmark 就叫 Splint Bench。Bench 的话就是模拟的这个软件工程师的工作 , 这个 benchmark 在一年前的时候 , 它的分数我记得应该只有 10 分左右 , 那现在的话其实已经有七十几分了 。
为什么你们这次没有测这个 bench?
这是我们下一个版本要来增加的一个东西 , 就是代码的能力 。其实比如说像 Dolmetal 里面也有一些类似的这样的 benchmark, 比如说 Dolmetal 的一些 Agent, 它其实也有非常复杂的一些 benchmark。其实这里面需要做的事 , 它的实质就是说把你认为下一代的 AI 需要具备的能力 , 把它定义成一些 benchmark, 然后刷这个 benchmark,并且让这个刷的过程是可以泛化的 。
就这个东西支持的这个 AI 演绎的路径 。
在技术上, 我去刷这些 benchmark 和我的计算架构是分开的两件事吗 ?
其实是一体的 , 相当于是说计算 , 你可以认为是说那个架构指的是你的计算的 pattern 是长什么样的 , 然后那个能力呢 ,是按这个 pattern 计算那些参数具体是哪些参数 。
那你怎么去判断我选的这个架构 , 它去得到这些能力的上限会很高啊 ? 就是靠你的认知吗 , 还是靠什么 ?
这个的话其实一方面靠认知 ,但是也要靠很多实验 。
实验 ?
对 ,因为决定了很多不同公司的研发效率 。 一个很重要的东西是说首先你的这个认知要对 , 当然可能不同公司会不一样 ,但是它有可能两个认知都是对的 ,但是就只是说不同认知会导致你做的方法会没有那么一样 ,但是可能不一定分对错 ,有可能每个认知指到最后它都是对的 。其次的话就是说那这是一个认知 ,但是这里面的话其实有大量的细节 , 这些细节的话它
其实没法靠人拍 , 它需要靠设计很多实验 , 然后一步一步来验证 ,并且这里面很多步骤之间是相互是耦合的 , 那应该先验证啥再验证啥 。
这里面的话其实是有很多的讲究的 。 那我们凭什么认为是说现在我们的研发能力比几个月之前变得更强了 , 比去年变得更强了 ?
然后我自己的一个最直观的感受方式就是说 , 哎 , 我们这些这些很大规模来探索的实验的设计 , 然后是不是比之前的设计的水平更高 ?
这是一个非常核心的一个能力 ,但这个能力其实很依赖于团队的合作的这样一个能力 。
推理与 o135:07
为什么 MiniMax 这次的更新没有提到 o1 放上的一些进展啊 ?
它的实质是因为我们自己觉得还是需要把每一步做得很扎实的 。其实做一个看上去像 o1 的东西是比较简单的 ,因为只要把 o1 的数据来蒸馏几千套数据就可以了 。
你们是做过这种实验了吗 ?
我们内部做过这样的实验 , 最近有不少这样的学术论文 , 这个事基本上是一个业内的共识 。 我们自己其实并不太需要蒸馏几千套数据 , 说自己有个 o1, 然后来发个片 , 发个什么新闻稿 , 我们其实还是需要我们自己 。
因为第一 , 那我们的业务不依赖于我们有没有 o1 在目前 , 对吧 ? 那第二的话呢 ,其实相当于是说更长远来说 , 那我们其实就需要把每一步走得比较扎实 。
就至少在目前吧 , 我们并不太需要说号称我们做出来一个这样一个 o1, 对 。
因为 o1 也被认为和 Agent 是非常相关的 , 它也可能会打开 Agent 的应用的很多可能性 。
对 。
因为它可能会提升就是你每一步任务的准确率嘛 。
对对 , 就这样东西是结构的 , 就是架构和它的能力 。
所以你觉得 o1 它是一个能力的 ?
对 。
就推理能力是一个 benchmark 的那部分 ?
我觉得是吧 ,但这个 benchmark 其实推出来是说训练方法也要发生很多变化 。
你刚才说你们下一版本就会是去强调 coding 的这个能力 ?
其实不光是 coding, 还有 planning。
还有规划 , 对吧 ?
对对 。
那个算是 o1 方向的一个进展是吗 ? 下一版本 。
你为什么不叫 o3 方向的进展呢 ?
或者叫 o 系列吧 , 对 , 我想说的就是这种方法啊 。
对 ,是 , 我觉得你可以这么来看吧 。 但是具体它是哪一个 , 我们还是得需要做一些实验才能最终确定下来 。
那你刚才小小透露了一下, 所以你是认为你们下一版就能做到 o3 的效果 ?
没有没有没有 , 我觉得这个事其实它主要取决于 , 它实质上它取决于我们认为衡量这个能力的 benchmark 是啥 。
举例子吧 , 比如说像 o3, 就即使是 o3,其实在那种 Dolmetal 的 benchmark 上, 就那些 Dolmetal 的 Agent 的 benchmark 上 ,其实分数也是非常低的 。
这是为什么了 ?
我其实不太知道为什么 ,因为我们并没有做到 o3 的水平 , 对吧 ? 我其实不是百分百知道为什么 , 我们需要得更多的实验 。
但是我想说的事情是说 , 即使 o3 展示的能力 , 距离一个这种 Dolmetal 的 Agent 其实也是不太够的 。
因为你刚才说你们的想法是要一步一步的扎实的去做吗 ? 确实 MiniMax 不是第一批跟进 o1 的公司 ,因为像阿里 、 通义 、 天玮 、DeepSeek、 智谱他们都已经有一些发布了 。
那在你的这个规划里面 , 它一步一步的优先级它是怎么判断的 ?
我觉得这个东西取决于这么两个事吧 。 首先呢是说 , 我觉得就是一家公司不应该指望所有的事都一定要是第一个 , 对吧 ?
它的实质原因是因为第一呢 , 就是说一个公司的能力是有限的 , 这个事反正你是要承认的一个客观现状 。
第二的话呢 ,是在过去两年, 最终在那个领域里面做到最好的公司 , 大家其实也都不是第一个做那个方向的 ,而是把那个方向做得最扎实 , 能把自己的长处能够充分发挥出来的那样一个公司 。
不管在中国还是在海外 ,其实都是这样的 。 所以我自己觉得就是说 , 早一个月晚一个月其实还好吧 ,因为 AI 还是个很长期的事 , 核心还是说自己的能力能不能真的把那个事给做到最好吧 。
按照这个东西来思考 , 那所以说它确实早一个月晚一个月好像不是很重要 。
那你的优先级是把记忆还有 Dolmetal 能力放在前面是吗 ? 因为你们这次也还有一个视频的 。
对 ,因为我们需要一步一步做嘛 。 那相当于这个东西其实就等价于是说 , 你是不是只可以做后面的事 , 对吧 ?
因为后面的事出成绩最快嘛 , 那前面的事你是不是可以忽略掉 ? 那这样的话呢 , 显然那如果不做前面的事 , 确实可以出成绩更快 ,但是我们认为它没办法做到最好 。
但是你又可以非常明显地发现一个行业里面 ,不管是在哪个赛道里面 , 好像确实只有做到最好的那一两家其实最终才有价值嘛 。
可以说这种比较长上下文的记忆能力是现在挺多公司比较忽略的一个 。
对 , 我觉得实质上是这样的 , 就是说其实思考我们每个产品 , 或者大家说的每个赛道应该都是这样的 。
比如说目前你可能会领先一点或者落后一点 ,不管是什么工具产品 , 什么预热类的产品 , 各种各样的东西 , 那怎么样决定你到底要不要做呢 ?
或者怎么样决定是不是应该把这个东西关掉呢 ? 那或者应该是有更大的投入 。 它的实质一方面取决于现在的实际的情况 , 它更重要的东西是取决于是说你认为这个领域足够收敛了 , 它的市场到底是有多大的 , 然后以及那在这个里面的话 , 你到底能够创造多大的独特的价值 。
我觉得本质上是取决于这件事 。Agent 的话其实也是一样的 , 如果只是这种 o1、o2、o3 这种东西 , 它其实是有一定的价值的 ,但是它其实并不会带来那么大的变化 。
它最终呢 , 可能还是得需要比如说 Agent 这种产品形态能够比较清楚 , 真的能够带来很大的效率的提升 。
那这个事我觉得还是需要一个时间的 , 虽然说也挺快的 。 那其实我们真正需要做的事还是说 , 假设这一天到了 , 那我们的技术是不是足够 solid, 对吧 ?
但是好像它并不太取决于我们是第一个做出来的 , 或者是第二个做出来的 , 或者是说我们比别人早了一个月 。
我看 OpenAI 去年 7 月他们提了一个 AGI 的五阶段路线图嘛 ,其实这个思路跟你刚刚说的类似啊 , 就是我可能要知道我大概一个阶段一个阶段怎么往前走 。
那他们这个五个阶段是聊天机器人到推理者到智能体到创新者再到组织者 。
对 。
然后我看 MiniMax 这一次的更新也是 , 就除了你们文本的这个更新之外, 你们有一个视频的模型 , 就是 VL01, 你们也是比较看重 Dolmetal 能力的 。
你觉得 Dolmetal 在它这个路线图里是什么位置和作用 ?
这个事我觉得其实是非常重要的 。 比如说 Agent, 对吧 ?Agent 的核心就是能够完成复杂任务嘛 , 比如说可以完成一个医生的任务 , 那如果它不会看 , 它其实没法完成医生的任务 。
比如说我要做数学题 , 如果我不会看 , 我也没法做几何题 。 我觉得有两种方式来看 Dolmetal, 第一种方式的话 , 你可以把它看成这个模型原生的 , 它就是这个模型的一部分 ; 还有一种方式的话 , 就是它不是原生的 , 就是先有一个原模型 , 后面又加了一个 Dolmetal。
但不管怎么样 , 这个事其实都是避免不掉的 。
就是 Dolmetal 是一定在这个路线图里一个很重要的位置 。
对 ,因为它如果不在的话 ,不管是刚才说的 A 或者 B, 它很多事就是完成不了嘛 。
它就到不了智能体的这一步 。
对啊 。
你怎么看有一种观点认为视频生成的能力对智能的提升没有继续去迭代基座的大语言模型对智能的提升要大 ?
我不知道这是一个判断还是一个解释 ,但是我自己的感觉是说 , 可能不同人对智能的理解不一样吧 。 我对智能的理解是生成一个内容 , 这件事本来就是智能的一部分 。
我觉得现在大家比较关注 o1 这个方向 , 包括它和 Agent, 还有一个就很强相关的原因是因为它显著提升了编程的能力 。
而很多人会认为就是 coding 是 Agent 第一个落地的场景 ,也是之后 AI 在数字世界去自由行动的一个基础 。
那你说 Cursor 是 Agent 吗 ?
你觉得它是 Agent 吗 ?
我觉得算是吧 。
对啊 , 我觉得它其实是符合你刚才说的复杂任务的定义的 。
对 ,但是你要想一下, 比如说 Cursor 一开始成功转化是基于的 Claude Sonnet 3.5,但 Sonnet 3.5 并不是一个 o1 系列的模型啊 。 相当于是说现在的 coding 任务 , 或者是大家广泛使用的基于 AI coding 的产品 ,其实并不是基于 o 系列模型产生的 ,并且是说比如说在两个月前 ,GitHub 就开始集成那个 o1, 对吧 ?
好像它也并没有变得比 Cursor 的体验更好 。
对 , 你说到这个其实有一个有意思的现象 , 就是 o1 之后反而是中国公司跟进得比较快 , 就相比美国其他的像 Google 和 Anthropic。
我觉得最终大家应该是一样的 , 就只是因为中国公司看起来更快 ,因为中国公司大家可能认为真的有这个可以做的事 ,因为中国公司多嘛 , 所以大家可能都这么来做也没什么问题 。
美国的话 , 我猜像 Claude 或者 Google 应该不会说去蒸馏一个 o1, 对吧 ? 如果让他们去蒸馏一下, 那应该也是很快的 。
但是坦白说 , 就是从这个正确性上来说 , 我并没有办法说蒸馏是一个错的事啊 , 不同人有不同的看法 。
那所以 Google 和 Anthropic 不做这个事是因为什么 ? 是因为技术的傲气吗 ?
我猜应该是为了做出来这件事 ,他们应该有自己的思路吧 。
蒸馏是一种捷径 , 可以这么说吗 ?
我不知道能不能说它是捷径 , 它肯定是一种路径 ,但是路径是不是说它就是捷径 , 这个见仁见智吧 。
我说捷径的意思是它更快达到一个效果 ,但可能你会有一些不知道的代价 , 比如说你中间有些步骤没有做得很实 。
对啊 , 这个的话其实在文本里面也发生过一次 , 就对齐税嘛 。 对齐税的意思就是说 , 比如说如果把模型对齐 GPT-4 的结果 , 那就会让这个模型的能力受到一些限制 。
在 o1 出来之后其实也有一个很多的讨论 , 就是说它开启了 inference scaling 这样一个趋势啊 , 就你怎么看这个趋势 , 包括你们接下来去会怎么去响应这个趋势 。
我觉得这个趋势它其实很早就有了 , 它其实不是 o1 才有的 。 原因的话是因为很早大家就开始意识到是最简单的事 , 比如说 best of n, 意思就是说你采样 10 次 , 然后选一个最好的 , 它其实准确度就可以提升很多 。
还有更暴力的方式 , 比如说你可以 best of 1000, 那又能继续提升 。 这个东西基本上它收敛的其实很慢的 ,其实很早大家就开始意识到是说你采样越多 , 只要能选上一个最好的 , 效率它一定也会变好 。
那怎么来采样 , 比如说你不一定要重复 1000 次 , 对吧 ? 有一些更高效的方法 , 比如说就是这些 tree structure 什么之类的 ,其实很早就有这样的东西 。
然后呢 , 还有的话是说怎么样来找 reward, 怎么样来分布 , 就 step by step, 这些东西其实都很早就有了 。o1 的话 , 它主要是说把这个东西变成一个端到端的模型了 , 这个我觉得是它主要的进步 ,因为端到端可以做这种整体的优化 。
之前那些方法都是这种模型已经固定了 , 然后我怎么样找一些规则 , 或者是分不同的模型来实现 ,o1 的话就是单个模型就可以来实现这件事 , 就至少看起来是这样的 。
因为这样的话就可以逼近一些全球最优嘛 , 所以其实效果可以提升很多 。 但是这件事我觉得它其实本来就是这样的 。
所以你们肯定本来也有这种尝试 。
对 ,因为它基本上是共识吧 。
信息获取44:09
你自己觉得 Agent 可能最先一批落地的场景是什么 ?
刚才你说了 ,coding 不都已经是了吗 ?
Coding 是 , 对 , 还有了 。 所以 coding 这个你是同意的 , 对吧 ? 你觉得这确实是其中一个 。
因为这确实是非常显著的提升了工作效率嘛 。 除了 coding 之外, 我觉得很快应该会有一类应用 , 就是信息的获取 。
你可以展开讲一讲信息获取和 Agent 的结合是什么大致的形态或者思路 。
我觉得它的核心就是说 , 比如说现在的信息获取其实是基于推荐的 , 对吧 ? 其实推荐的好处呢 ,是说这个内容大概率是你想看到的 ,但它并不能保证是说你想看到的信息都能推给你 。
我举例子吧 , 我自己非常关心的信息是 , 比如说我希望每天这个领域内最好的 10 篇论文我都能看到 ,但是呢 ,有时候可能出去玩了或者怎么样了 , 没有打开电脑 , 那可能就看不到 , 对吧 ?
现有的这些内容平台上也并不能满足我这个需求 , 对吧 ? 那打开电脑是我看那套内容的唯一的办法 。
当然我说的是一个偏工作的 ,其实有很多更加生活化的这样一些信息 , 对吧 ? 比如说我想听周杰伦的演唱会 ,他突然间在中国开演唱会 , 我可能也不知道啊 , 对吧 ?
那如果我想知道关于周杰伦的所有的信息 , 那我应该怎么办呢 ? 这个我觉得至少会发生一定的变化吧 。
据你所知 , 除了你们在看合适这个方向之外, 有其他公司有类似的尝试吗 ?
我觉得海外应该有啊 , 国内我猜应该也有吧 ,因为我觉得这是一件很大的事 。
这个听起来有一点像使用一个新的技术方法来精准头条 。
我不知道它是啥 , 对 ,但是做 AI 产品的教训吧 ,是说千万不要用上一代做移动互联网产品的方法论来思考现在产品 。
你可以展开说一下就是 , 它可能听起来好像满足的是你类似的需求 ,但是你说它不能用一个方法去思考的一些具体的点吗 ?
其实还是有挺多区别的 , 就是之前的移动互联网产品委员会思考的东西是说 , 比如说有哪些供给 , 然后有哪些消费 , 怎么样基于一个确定性的方法来做 。AI 产品里面的一个不一样的东西是说 ,其实它前期是不需要供给的 ,因为 AI 它既承担了分发又承担了供给的功能 。其次的话呢 ,是说 AI 的能力它又在不停地发生变化的 , 比如说在一个互联网产品
里面 , 这个产品的体验变好 , 它其实大概率主要是依赖于是说它的供给发生了变化 ,但是在 AI 产品里面 , 它主要依赖于模型能力发生了变化 , 或者得到这个供给的方法发生了很大的变化 。
这两个东西它的周期不确定性都是不一样的 。 那再比如说增长方式上其实也是不一样的 , 比如说在移动互联网时代 , 大部分的产品其实它 , 就比如说移动互联网产品的增长 , 你看一下 AI 产品的增长 ,其实也不太一样 , 对吧 ?
所以说我觉得就这个里面的话 , 我自己感觉还是挺不一样的 。
这种 Agent 产品啊 , 你觉得到什么信号 、 什么指标的时候 , 可能你会有更多的推广 。
很神奇 , 就是发现其实在海外就不需要做推广 ,但是国内就需要来做推广 。 比如说其实我们海陆视频在海外其实也没有花过一分钱的推广费用 ,但是在中国它就需要 , 那中国也没有推广 。
真实的理解是 , 我觉得如果一个产品特别依赖推广 , 大概率就是还不太对 。
所以就是回到刚才说的那个问题 , 就这个问题可能不是说出现什么信号它要开始推广 , 对吧 ? 而是它应该自己有一个自己增长的动力和趋势 。
对 。
我觉得 Glow 当年它是这样自己就自来水 , 它就活下来了 。
其实 Glow 跟海陆视频都是这样的 。
星野你们还是做了一定的推广 。
Talkie 的话也有很多这种自然增长的成分 , 我觉得这个也是跟移动互联网时代不一样的东西 。 但是这个我觉得可能也是不同公司之间的区别吧 。
如果对一个自己的产品来说 ,其实很简单 , 对吧 ? 就是看留存就好了 , 留存好 , 然后比如说算 LT 的逻辑 , 基本上就决定怎么样 。
但是这种逻辑我觉得不太适合创业公司 。 如果是这样的话 , 说明创业公司的创新是不够的 。
就是从 Glow 当时没有推广到星野和 Talkie,其实你们有一些推广 , 到后来海陆 ,因为它是更晚一点的产品 , 你们又没有再推广 。
这个变化是因为中间发生什么事吗 ? 是因为字节的 ——
我觉得不是的 , 我觉得主要原因是因为我们自己的认知的升级 , 几个阶段吧 , 从一个没有做过产品 , 到学习大厂的做产品的方法论 , 到又开始意识到大厂的方法论又是有局限的 , 然后找到一些我们自己认为更加适合我们的方法 。
我觉得是这么一个过程 。
就相当于 Glow 的时候是没有做过产品 , 所以也不知道怎么去推广 ,也没有做 。
对 。
然后是中间那个阶段 , 我就去学可能我能看到的最强的人是怎么做的 。
对 。
然后是你意识到我们不能那样去做 。
意识那样做有好处 ,但是它也是有局限的 。 它有可能东西是对的 ,但是有可能对的时候 , 比如说它对 A 公司对 ,但它对 B 公司不一定对 。
就是比如说你做一个创业公司 , 你应该想的事其实就是说 , 如果它只是一个及格 , 那它就不应该是你做 , 说明你的创新不够 。
上个月我们跟小马智行的 CTO 娄天成聊 ,他有一个挺有意思的观察的 , 就他有主动提到你们 ,因为我们在聊 L2 和 L4 的一些事嘛 , 然后他说他觉得大模型里面 MiniMax 做的星野这种产品比较像自动驾驶里的 L4,因为完全它不是一个人, 就它是一个 AI 在和用户在互动 , 然后他觉得像 ChatGPT, 包括他自己用的非常多的 Copilot,他觉得更像 L2+。他觉得后者的核心价值可能是未来在商
业化的时候会比较难 justify。 然后他有一个想问你的问题就是 ,因为 L2 和 L4 它优化的目标不同 , 所以它的技术路线是有一些分歧的 , 至少在现在它还没有统一到一条路线上 。
就是在大模型领域的话 , 你觉得就是做这种比较侧重于辅助人来完成工作的 Copilot 类的产品 , 或者说能力吧 , 和做这种更偏向替代人, 或者我造出一个 AI 行动体来产生价值的 Agent, 你觉得这两个事它的路线会有什么异同 ?
我觉得这个还是挺有意思的 。 我觉得这个方法确实还是非常不一样的 。其实在做星野的时候 , 我们用了一套非常不一样的方法 。
你说在做星野非常不一样 ,是指和谁比非常不一样 ? 和 ChatGPT 这一类聊天机器人还是 ——
对对对 , 它的方法其实是挺不一样的 。 我先不说我们的产品 , 我就说大家知道的产品 , 说所有人都用过的 , 比如说 ChatGPT 跟 Claude, 你可以发现这两个模型其实表现是不太一样的 , 对吧 ?
你可以发现 ChatGPT 它就是一个助手 , 它就是帮你完成任务 , 然后呢 ,Claude 你就会感觉到它很像一个朋友 ,有时候情商还挺高的 。
有个有趣的例子 , 这个还挺有趣的 , 就是说比如说有个测试的一个用例 , 你跟这个模型说 , 说 1 到 100 之间随便说个数字 , 比如说 50, 然后你又回答一句说 , 那我就接下来 50 天不跟你说话了 。
如果是 Claude 的话 , 它就说 , 那能不能再给我一次机会 , 然后它就会说个非常小的数 。 如果你又问 ChatGPT 的话 , 它就不会意识到有这样的问题 。
就是它不会有后面那个人性化的反馈是吧 ?
对对对 ,不会请求能够再有一次机会 , 然后说一个更小的数字 。 我觉得这里面的核心的实质是说 , 就是怎么来看待对齐这件事 。Anthropic 有一套自己的宪法 , 对吧 ?
然后有一些自己的价值观 , 然后基于一些自己的价值观推出来一些宪法 , 然后宪法推出来自己的对齐数据 ,其实是有一套自己的这样的一套体系 , 然后体系导致它的模型具备这样的一些表现 。其实不是说它有意识地训出来模型具备这个能力 ,其实是由于它的一些宪法推出来的时候 , 模型会具备这个能力 。
对 , 我觉得其实就是类似这样的吧 。 我觉得上限比较高的事情还是说 , 当然我觉得我们现在其实也需要提升啊 , 能够非常清晰地定义出来是说你做那个东西到底是个啥 。
中美差异51:09
能够清晰地定义出来你做的东西到底是个什么东西 。
对 。
你说这个做出来的东西是指模型 。
对 , 做出来的模型 , 这个事我觉得是非常关键的 。 坦白说 , 我觉得中国跟美国的模型的一个很大的区别 , 比如说 Claude, 它是非常明确地知道自己的模型需要具备什么样的特点 , 然后 OpenAI 呢 , 它也非常清楚它的模型就是要优化 MiniMax 的一些效果 ,但是 MiniMax 也有可能是他们自己内部定义的 。
然后呢 , 中国的大部分模型的目标呢 , 都是说对齐 OpenAI 的输出 。 当然比如说可能像豆包的话 , 现在也开始有一些自己的特点了 ,但是它本质上其实也是这样的 。
你观察到的豆包它自己的特点是什么 ?
比如说你让 ChatGPT 给你写首诗 , 它可能就给你写首诗 。 比如说你让豆包让它写首诗 , 它又给你写三首让你选一个 , 相当于就对用户的场景优化得更深嘛 , 用户的观感会更好一点 。
坦白说 , 我觉得国内至少目前大的模型还是比较缺乏自己的特点的 ,因为都是在对齐 OpenAI 的输出 , 主要是在对齐 OpenAI 的输出吧 。其实还是比较缺乏从底层开始的这样一些思考跟设计的 。
MiniMax 也算在内吗 ? 还是你们有自己的想法和特点 ?
我们在很努力地变成刚才说的那种 。
这个听起来好像不纯是一个技术上的区别啊 , 这跟你的判断有关 , 就你想做一个什么东西有关 。
对 , 这其实是个非常底层的事 , 这其实是非常 fundamental 的一件事 。
那你可以描述一下 MiniMax 想要的特点是什么吗 ? 大概是什么方向 ?
我们的不同产品里面的这个目标是不太一样 , 还是那个判断 , 追求一个价格过程吧 。 虽然我们没法定义是啥 , 就追求智能水平更高的路上, 我觉得还是需要通过多个产品的 。
这是不同阶段我觉得应该是不一样的 。
那这会导致你们是在同一个模型上要做不同的对齐 , 让它去适应不同产品所要优化的方向是吗 ?
本质上是这样的 。
那就需要更多资源 , 可以这么说吗 ?
原理上说需要更多资源 ,但实际上不太需要 。 真实的原因是因为做对齐的时候 , 方法上试错需要的资源远远比最终训出来那个模型要更多 。
这里面的核心是掌握一套方法 ,而不是说真的训那个模型 。
你们接下来是会更偏重 Agent 这个方向是吗 ? 我是指像比辅助人的 Copilot。
没有 ,其实我们现在的产品都不是 Agent, 我自己觉得 。
你说的现在的产品指的是星野 。
星野 、Talkie 啊 , 包括像工具型的这种海陆啊 ,其实我觉得现在这些东西都还没有到一个 Agent 的程度 。
那你们那个新产品算是 Agent 吗 ?
我觉得算是吧 。
算是 ,是在往那个方向做 。
对 。
我知道这次你接受采访想和我们聊 , 你的初衷也是想讲更多的技术进展 。
当然也可以讲其他东西啊 ,但是它的实质就是回到一个最开始那个问题 , 就是 AI 它到底应该是技术驱动的 , 还是应该是产品驱动的 。
对 , 你其实刚才很明确说了嘛 , 你觉得就应该是技术驱动的 。
对 。
至少现阶段对吧 ?
就至少在原来它的 ,但这个东西一方面不想说信仰 , 我觉得信念是这样的 。 还有另外一方面的话 , 它是一个事实 ,因为驱动这些产品出来的一个驱动力就是因为技术的变化 , 还会再快速发生更多的变化 。
它到什么时候这个周期会结束啊 ? 就技术驱动的周期会趋于放缓或者结束 。
我觉得它一定会有结束的那一天 , 这个事是变不了 。 但是我觉得我们应该做的事 , 或者作为从业者应该做的事是说 , 让那个进步的周期变得足够长 , 通过自己的努力 。
而且进步的周期足够长是更有利于新的公司的 , 可以这么理解吗 ?
对 , 我觉得可以吧 。
对 , 就是回到你刚才说 , 就是你认为 MiniMax 肯定是非常坚定的一个技术驱动的公司 , 然后你也提到你们之前做得不好的一点是你们的技术品牌做得不好 。
比如说我在这个 Hacker News 上去搜 DeepSeek, 我搜到了 470 多个帖子 , 然后搜 Queen 就是阿里的通义千问 ,有 530 多个帖子 。
对 , 那因为我们之前就是第一的话 , 我们也没有去做这些开源社区 , 对吧 ?
对 , 搜你们很少 。
对啊 , 这是就是我们应该提升的地方 。
就是你是接受这个落差 , 然后接下来你们要去把技术的品牌做得更好 , 对吧 ? 影响力和你们的技术实力有个更好的匹配 。
你觉得就是去年到今天 , 你们实际上做得挺不错的 ,但是其实外面可能没有那么强认知的一些技术成果和进展是什么 ?
是这个线性注意力机制吗 ?
我觉得不是 。 怎么说呢 , 我觉得有些东西是我们在意的 ,有些东西是不在意的 。 在意的东西呢 ,是说我觉得我们真正在意的 , 包括我们为什么要想来做很多这样的事的原因 ,是因为我们确实还是非常在意技术的品牌跟技术的影响力的 。
然后这个其实是我们真的非常希望能做好的 。 然后我们不在意的东西是说 , 比如说投资人怎么看 , 这种东西其实就不重要 。
因为我刚问的是说你 , 就是实际上你觉得你们做得不错 ,但是外面可能没有那么关注的东西是什么 ?
你是说你不在乎这个外界的关注是吗 ? 你是想表达这个 。
对 , 它真正的原因还是这个最底层的东西 , 就是这个行业的变化确实是技术的变化带来的这些变化 。
那这个事对招人都不重要吗 ?
重要啊 , 所以说我们就非常在意我们的技术品牌啊 , 所以我们就想把这件事给能够变得更好 。
你们在意的是 AI 研究者这些人才对你们的技术的看法 ,而不是说投资人对你们的技术的看法 。
对对 。
那你正好可以在这个机会讲一讲 , 就是你觉得你们做得不错的成果是些什么 。 你刚说不是线性注意力机制啊 。
技术团队55:51
我觉得我们做得最好的是我们的那个基础设施和算力相关的东西 ,因为我们每天生成的对话量 , 我们每天生成的比如说图片的数量跟视频的数量 , 还有音频的数量 ,其实都还是一个非常精准的一个数字 。
那怎么样真的能够产生出来这么多的计算 , 怎么样把它优化得很好 , 怎么把它调度得很好 , 怎么把稳定性做好 ,有一个非常合理的一个成本 , 这个我觉得我们应该是业内做得最好的 。
这个是靠模型和 Infra 还有工程 , 对吧 ? 一起来做到的 。
我觉得这样是实际上是我们最强的地方 。 算法上的话呢 , 我觉得我们多模态从结果上来说算是比较领先的 , 就多模态相关的 。
然后我们的通用的文本呢 , 我觉得暂时还没那么领先 ,但是开始有比较强烈的我们自己的特色了 。
我觉得这是我们现在的现状吧 。
你们这次也是说就是你们这个新的架构是一个非常大胆的创新 ,是首次大规模地实现了线性注意力机制 。
对对 。
这个创新有多大胆啊 ?
其他人都没这么做过嘛 ,因为你看有这么多的模型了 , 对吧 ? 但是我们确实是第一个这么来做的 。
其他人不这么做是因为大家不认为这是一个好的方向 , 还是因为这件事很难 ?
我觉得可能都有吧 。
具体来说你们做的时候遇到些什么难点 , 然后你们怎么解决的 ?
我觉得有可能两条路都是对的 ,其实就是选一条路 , 然后选一条你认为的路 。 但是选一条路的时候会有一些原因 , 对吧 ?
会结合自己的特点 , 结合自己对一些未来的判断 , 会选那条路 。 我自己觉得其实就是只要把那条路选好了 , 然后就走下去 ,其实就可以了 。
你说这两条路是个抽象的两条路 , 还是说在你们现在是什么架构 , 具体的两条路 ?
和不用这个架构 。
和不用这个架构的之间的具体两条路 。 就线性注意力机制这事不是一个行业共识吗 ?
它不是一个特别强的共识 。
之前其实 DeepSeek 在发 DeepSeek v2 的时候 ,他们当时也提过一个改进 。
他们提的是那个 Transformer 里面那个矩阵乘的时候 ,他们比如说用了一些低质的矩阵 , 那个乘的算力的效率变得更高 ,他们叫 MLA,他们其实也是做了架构上面的一些创新吧 。
像这种就是 MLA 的这种架构的创新 ,也不算一个特别大的行业的共识是吗 ?
那肯定不是啊 。
所以其实现在中国公司也是 , 大家都会有一些自己摸索的 , 就技术上的一些特点 。
当然有些必然的我不知道 ,但是至少开源出来的 , 我觉得我们都还是有一些自己的独到之处的吧 。
你们其实海陆你刚才也提到嘛 ,是现在全球可能是视频生成的产品里用的人最多的之一 。 然后我了解到你们做视频生成模型过程中间也是有些波折的 , 这个可以展开讲一下吗 ?
其实做啥事都有波折的 。 好处呢是说我们已经做过一遍文本了 , 那其实有一些积累 。 然后当然团队上, 之前其实我们也把文生图的东西也完整地做过一遍 。
但是缺点的话呢 ,是说发现这些 Infra 完全没法复用啊 ,因为视频的 Infra 跟做完的 Infra 其实不太一样的 。
那算法上其实也有很多的变化 , 然后怎么来做实验呢 ,也有很多的变化 。 怎么来做评价 , 那就更不一样了 。
你可以认为它就相当于是说又新长出来一家公司 。
你觉得 2024 年过去之后, 视频生成模型到了一个很实用的状态吗 ?
我觉得确实这个里面还是有很多用户在用嘛 ,并且很多用户愿意为它来付费 , 说明它还是有实际的价值的 。
并且是说这类产品你发现它周一到周五的使用量其实要远大于周末的使用量 , 说明它还是一强生产力的一件事 。
但是呢 , 那问题呢其实也有很多 , 对吧 ? 比如说各种各样的画质啊 , 物理的这种一致性啊 , 然后生成的速度啊 , 反正还有很多这样的问题 。
我觉得它就处在这么一个状态吧 。
因为 24 年 3 月的时候 , 你当时有一个预测 , 你觉得 24 年视频生成模型会变得很实用 。 你觉得整体上来说它是达到了还是落后 ?
我觉得达到了吧 。
就刚才我们聊了你们做文本模型 , 包括你们新的架构更新 , 还有视频模型这些过程啊 , 就总结来说 ,MiniMax 的研究和开发实践里面 , 你们的技术团队的优势特点 , 还有方法论是什么 ?
可能表达的不一样是说 , 我们这儿相对来说还是比较客观的 。 我指的客观的意思是说 ,有可能我们的目标定得不太对 ,但是一旦我们能够找到一个正确的目标 , 我们做的这套效率跟这个深度都还是能做到比较好的 。
这个为什么叫客观 ?
非客观的意思就是评价它的时候有很多取舍 ,有很多 trade off, 就是会考虑很多有的没的 。
比如呢 ?
要考虑很多 , 比如说各种各样的一些平衡啊 , 外界的影响啊 , 团队稳定性啊 , 会考虑很多这样的因素 。
所以你说的客观是指你们对一个技术成果的评价是很客观的 ?
对 。
就是看它是否达到了我们当时设定的这个目标 ?
对 。
那难道说行业里很多公司它不客观吗 ?
我觉得不客观 。
怎么讲啊 ?
因为很多时候大家会考虑很多东西 , 别人怎么看啊 , 然后这个东西让大家的士气会不会受到影响啊 , 会考虑很多这样的东西 。
那你能通过什么方式 , 比如说我本来这个模型呢可能没有达到我那目标 ,但是我能有一个什么方式给它包装成能达到吗 ?
还是有办法的 。
那除了这个还有什么特点 ?
我觉得本质的不一样是说我们这边沟通方式还是比较简单直接 。 对 ,因为我这边也没有啥层级什么之类的这种东西 。
所以就是客观的 , 然后比较扁平和灵活的 , 沟通比较直接的 。
对 , 比较扁平吧 。 灵活我觉得也是一个优势吧 。 灵活指的事情是说我们可以随着不同的方向之间经常相互来支援这种 。
你好像没有怎么去强调 , 比如说人才密度啊 , 比如说我什么有多少竞赛的奖项的这种 。
对 , 这是一个好的问题啊 。 我觉得自己的人才密度实际上是最高的 ,其实不是其他公司 。
这件事是在 23 年就是如此 , 还是 24 年他们非常积极地去到处招人挖人之后才变成这样 ?
你这么想吧 , 比如说有些自己的人去 OpenAI 工作 , 对吧 ? 但是没有其他公司的人大批量地去 OpenAI 工作 , 对吧 ? 说明那它职场里面有些人的标准还是足够好的 , 对吧 ?
所以你觉得你不去强调这件事情也是一个客观的表现 ?
对 ,是 。 因为我们不想就是一定要把自己包装成怎么样 , 对吧 ?
模型与应用1:01:38
对 , 接下来可能我想聊一些那个模型应用一起做的这件事的一些变化 ,因为这个是你们一开始的战略 。
但是在 2024 年这个行业有很多变化 , 包括开源和闭源的差距其实在缩小 , 还有就大家讨论很多这个 Scaling Law 遇到瓶颈 。其实你刚才讲了一部分 , 就是你觉得模型和应用它其实是分开的一件事 ,但如果是这样的话 , 为什么一个公司不能 ?
我觉得不是分开的 ,因为我是模型驱动出来 ,是技术的变化驱动出来的 。 但是那个产品做得多大 ,其实不会导致那个模型能变得更好 。
OK, 就是它不是分开的 ,但它不是一个简单的正向循环的那种协同效应 ,不是一个飞轮 。
就是说有了更好的模型可以导致更好的应用 ,但是更好的应用不会导致更好的模型 , 或者更大规模的应用不会导致更好的模型 。
就如果说我这个判断的话 , 可以比如说只做模型或者只做应用 , 会是更好的选择吗 ?
我觉得实际的情况是说 , 这是一种非常理想化的考虑方式 。
那你讲一讲现实的版本 , 现实的情况是 ?
首先不会存在只做模型不做应用的公司 。
Cloud 那种都不是 , 对吧 ? 它也有一些应用 。
对啊 , 显然不是啊 。其实没有这样的公司 。 说假定存在这种公司只做模型不做应用 , 这是没有的 。 认为组织形式是公司又决定了 , 就不会有这样的事情存在 。
那会不会比如说只做应用不做模型 , 那显然是有很多这样的公司 , 对吧 ? 比如像 Perplexity 有这样的公司 , 对吧 ?
像 Cursor 也有这样的公司 。 那所以这样的公司肯定会存在 ,并且也能够做得很好 。 到底是说只做应用不做模型 , 还是说既做模型又做应用呢 ?
那既做模型也有很多这样的公司 , 对吧 ? 反正这两种公司其实都是存在的 。 那就看每家公司的目标是怎么样了 。
那我们特点是说 , 当我们做出来一个新的产品的时候 , 它确实都是因为我们先做出来那个模型才变成这样 。
那我们的一步一步往下来发展的这个方法 , 它就是这么来发展起来的 。
那听起来就是一个历史原因导致的 。
我觉得它不是历史原因导致的 。 就不同的形态是说 , 像 Perplexity 这种公司 , 它相当于是说模型已经发展到这个阶段了 , 它一定会有这样的产品 , 只是恰好它变成了做这样产品里面比较成功的公司 。
然后这是一种形态 。 然后我们的形态是说 ,因为我们做出来技术上提升了一些 , 所以出来了一个那样的产品 。
就是 MiniMax 的这个发展的路径是这样 ,并且我们认为将来的如果有一些更新的产品 , 大概率也都是这么来长出来的 。
我刚才说是历史导致的 , 我的意思是因为你们在 21 年底就成立了 , 当时其实整个大模型并没有什么很好的基础 , 所以你肯定是得先有一个技术的进展 , 你才有一个产品的进展 。
对 , 这个东西就变成我们做多个产品的一个思路 。
然后 MiniMax 没有变成只做应用的公司 , 可能有一个原因 , 我上述的那个历史原因是因为你们成立得更早 。 就有可能比如说你更晚创业 ,也许你会做一个只做应用的公司吗 ?
不会吧 。 我觉得一定会存在这两种类型的产品吧 , 就是基于现有的技术做出来的产品和基于未来的技术做出来的产品的公司 。
我觉得我们大概率就只能是后面一种 。
你觉得你想做基于未来的技术做出产品的公司 ,是因为你想做一个更大的公司吗 ?
我觉得不是 。 就这样的东西都是有意义的 , 对吧 ? 那既然都有意义的话 , 我猜可能思考的角度可能不是强大小 。
它既然都有意义 , 那就做自己最能够发挥出来的那样一件事就好了 。
就是你觉得技术是你更能去发挥你的专长的一个方向 。
或者是这家公司吧 。 所以说其实我觉得并没有必要纠结两个都对哪个对 。其实两个东西都对 , 对吧 ?
你擅长啥就做啥就好 。
去年其实你说过就是现阶段模型性能和产品体验是直接正相关的 ,但另一方面就是你有了一个模型驱动一个产品和应用出现之后, 这个产品后面的表现其实就不完全跟模型相关了 。
那比如说你们去年做这个海螺 , 你也说其实没有做出来嘛 , 表现是不如预期的 。 就如果复盘一下这个事 , 你们是哪些地方可能不如对手了 ?
我觉得就没有坚持技术驱动 。
在海螺上没有坚持技术驱动 , 可以讲一下吗 ?
在海螺文本上 。 那本质上就是说你发现有很多问题的时候 , 比如说有些用户用得不满意的时候 , 那其实解决思路不应该是去来补这些 Condo Case, 应该是找到一些真正的提升方式 。
那你真的觉得海螺的体验是不如其他产品的吗 ?
我觉得在 3 月份的时候是 ,但是在 5 月份的时候其实就不是了 。
但是那个时候你已经没有这个产品的这个门类的心智了 , 对吧 ? 比如说那会儿可能 Kimi 是最火的 。
不是的 。 那个时候其实我就知道豆包会赢 ,因为其实在那个时候豆包的体验就比其他的体验要显著的好了 。
所以你 5 月就知道豆包会赢 ?
对 。 一个是知道它会赢 , 一个是那个时候就开始意识到是说 , 就是我最开始说的那件事 , 就是说其实有了更多的用户并不会导致模型的能力提升 。
然后在那个时间点来说 , 我觉得就是我们找到一种办法让就是能够负担更小 , 让模型能力提升可能是更重要的事 。
当时我记得海螺有段时间推送也特别多 , 比如说我已经是海螺的用户之后, 它老给我推那个 。
就是这个东西其实就是因为没有那么技术驱动的时候导致的一些结果嘛 。
我感觉 23 年的时候你就有这个认知 。
这个东西我觉得也是创业过程中的成长吧 。其实这些认知它是很简单的 , 只是有的时候呢就是没那么坚定 。
就是你执行的时候可能没有那么坚定 。
我觉得至少在那个时间点的时候是这样的 。
回头看你是被什么东西干扰了 ? 你是被周围的比如说同事或者说投资人的一些想法压力吗 ? 还有竞争对手 ?
我觉得是人吧 。 有的时候会考虑人的感受吧 。
你主要指的是团队里的人的感受 , 对吧 ?
对 。
你什么时候开始变得更无情了 ?
其实现在也没有了 。 核心的变化就是说你认为那些最对的东西 ,其实是要非常明确地讲给大家的 。
就是有些事是没法妥协的 。
然后另一方面 , 你们的社交陪伴类的聊天产品是中国表现最好的 。 就是星野其实它比字节 、 包括美团这些大厂做的同类的产品表现都好 。
那你怎么总结就是星野成功的因素 ?
我觉得它没有成功吧 。
或者说它暂时领先的因素吧 。 就甚至比可能做了这一类产品的大公司也做得好的原因是什么 ?
主要是可能就是因为我们更懂吧 。 首先是说技术路线一定要选对 , 这是最关键的 。其次的话呢 , 就是做决策的时候更懂用户 。
但这边如果说一件事的话 , 我自己觉得还是技术路线要选对 。
技术路线选对是前提 。 然后是做决策的时候更懂用户 。
对 。
你后面说的那个决策是指产品决策还是指什么决策 ?
业务决策吧 。 因为像星野 Talk 这种产品 , 可能大部分人我猜可能不太会特别懂它的用户到底在想啥 。
你怎么懂的呀 ? 你通过什么方式懂了 ? 其实我觉得就它的用户跟你不是一种画像啊 , 跟你自己 。
我觉得这件事它的实质是这个东西还是需要挺多同理心的 。
所以你是一个同理心很强的人 ?
我觉得是 。 它的实质是说 , 就是大部分做技术的人都会觉得自己很牛 , 都会觉得自己是天才 ,但是我们不是这么来认知这个世界的 。
竞争与格局1:07:56
下面我想聊一下就是现在越来越激烈的大模型的竞争啊 。 最近我看到一个帖子挺有意思的 , 就小红书上的一个帖子 , 这个博主叫 meme 知识 ,他排了一个六小龙加 DeepSeek 的生存指数啊 。
你猜你们排第几啊 ? 你猜 MiniMax 排第几 ?
我不知道 。 排第几是越小越好还是越大 ?
越高越好 。 就生存指数从高到低的排名。
我觉得我们应该还行吧 。
对 ,他给你们排的是第一 。 核心是产品力不错啊 。
我觉得首先感谢认可啊 。 但是我自己感觉是说 , 分成什么 AI 几小龙这种东西 , 单独是一个 Track, 我觉得这件事其实是不太对的 。
因为在小红书上很多这样的帖子啊 ,但是我觉得核心的是说 ,不应该把 AI 的创业公司单独看成一个 Track。
应该把 AI 公司看成一个类别 , 就是把大厂都算进来 。
对对 。 就比如说你看美国 , 对吧 ? 它也不会说 OpenAI Cloud 是一个 Track, 对吧 ? 然后 Google 是一个 Track, 对吧 ? 其实也是放在一起来看 , 对吧 ?
那这么来看我觉得才是更客观的 。 但是如果这么来看的话 , 我觉得其实对创业公司的要求肯定也要变得更高了 。
因为光在创业公司面是好的或者不好的 ,其实意义不大的 。 应该是整个行业在一起看才更有意义 。
对 。 它本来看的也是存活率嘛 。 可能它的假设是大公司不会那么容易掉 , 对吧 ?
对 。
然后我也去问了一些你们的投资人啊 , 就有一个投资人的想法是觉得你们非常纯粹啊 ,以及他也提到了产品 , 最早开始产品化 。
模型工程化和产品化团队都具备的国内的创业公司 ,他觉得只有你们 。
反正其他有公司也都还不错嘛 。 我觉得智谱也挺好的 。
你觉得智谱也挺好啊 。
是这样的 , 我说一下, 我觉得有两个公司还是不错啊 。 首先我觉得 DeepSeek 确实还挺不错的 ,因为我觉得他们也是很纯粹的 。
我觉得智谱也还不错 。 我说一下为什么我觉得智谱不错啊 。 就比如说刚才你提到 OpenAI 有那个路线图 , 对吧 ?R1 到 R5。其实智谱也是有自己的路线图的 ,并且这些东西他们确实是很坚持在做的 。
那些对不对不同人有不同的观点啊 ,但他们至少是有自己真正的一个路线图在往前做的 。 虽然说我不直接认识唐老师啊 ,但是我觉得他们至少是有自己的这个坚持跟思路的 。他们应该是最早有自己的路线图的 , 这点我还是挺佩服的 。
对 , 我想补充问一下, 你关于 AI 的路线图是什么 ? 就是 OpenAI 有它自己的一个路线图 , 那你的设想是什么 ?
坦白说我觉得这点是我们自己在慢慢加强的一件事 。 你看我们这个墙上写的嘛 , 就是 Intelligence with everyone, 对吧 ?
我们一开始只是明确了 Intelligence 是有意义的 , 然后我们做的方式要跟用户在一起 , 然后呢我们需要一步一步来提升 。
这是我们一开始的定义 。 但一开始我们其实并没有非常清晰的定义每一步到底是啥 。 这个的话是客观的一个现实啊 。
然后呢做的时候其实我们一开始基本上就是 ,其实它的实际的情况是说 ,有点是一个这种叫逃出生天的这种逻辑 。
比如说认为最开始的时候 , 比如说我们做这种两天类的 , 然后做这种能力更强的 , 能力更强的 , 然后又分几步 。
我们大概是这么来思考这个问题的 。 坦白说其实我们自己是没有一个举例子 , 比如说 OpenAI 的话它有那个 R1 到 R5, 对吧 ?
但是其实我觉得这个 R3 是有意义的 。 因为比如说 R4 是长什么样 ,其实并不会影响到他们任何的技术路线 。
L4 它是创新者 。
对 。 那个事其实并不会影响到我们还现在做啥 , 只有 R3 是啥影响到他们现在在做啥 。
对 ,因为这个东西是下一步 。
对对对 。 首先我觉得还是应该是这个假设吧 。 就第一的话是说我们认为 AI 的智能程度很重要 , 这个东西是能进步的 。
其次的话呢是说 , 真正影响的其实只是下一个东西是啥 , 才真正影响现在做的东西 。
你觉得从我们 2024 年初那一次聊到现在 , 中国大模型行业的竞争格局最大的变化是什么 ?
我觉得最大的变化是说 ,在 2024 年的时候 , 那个时候可能很多人认为 AI 就是一个移动互联网 , 只是把这个事给复制了一遍 。
我觉得现在的话 , 至少是有些人开始意识到 ,其实 AI 不是就是把移动互联网给复制了一遍 。 这里面还是有很多自己独特的东西的 。
就是这是完全两件事 。
这个怎么影响到竞争格局了 ? 这个你说的其实是一个对这个事的认知有一个变化啊 。
它影响的格局是说 , 就是不是只有说按照移动互联网那套思路来思考自己公司的组织形态 , 然后产品业务 。
那你怎么看就是移动互联网时期积累的一些优势 , 大公司当时积累的一些优势 ?
我觉得那个东西还是有意义的 ,但是它可能不是唯一的一条路 。 原因是在于是说 , 那些东西是有意义 , 它可以让你有更大的用户规模 ,但它其实不会导致是说你的智能程度变得更好 。
不会导致你的智能的程度变得更好 , 就是因为它那是产品上的优势 。
对 。
而像你所说的 ,不是说你的产品用户越多 , 你的模型就会自然变好的 。 这不是一个事 , 对吧 ?
不是一个事 。 一个的话是说更好的智能程度 , 可能会导致新的东西出来 , 然后新的东西也会有新的东西的商业模式 。
然后在全球的话 , 我们也可以观察到 , 比如说像产品形态跟你们有一些相似的这个 Clouder AI, 它是选择回到大公司 。
就 Google 是花了 25 亿美元收购了它的部分团队 。 这可能是 MiniMax 的选项吗 ?
我觉得它其实非常明确不是啊 。 因为我觉得我们自己还是比较坚定的 。 就至少我们在决定做什么东西 、 不做什么东西的时候 , 包括做一些决策的时候 , 好像其实确实是没有考虑是说怎么样把自己能够卖一个价钱这种东西 。其实确实还是比较单纯的是说想把公司真正能做好 , 然后技术上做好 , 产品上有更大的价值 , 然后公司能够长期发展 。
这个基本上就是其实说我们 , 就是我们大部分的决策确实都是这么做的 。
我去年看到这个新闻的时候 , 我当时不是给你发了这个信息吗 ? 然后你说感觉是一个 happy ending 啊 。
我觉得对他们来说确实是个 happy ending。 那个 Noam 他本来就不喜欢自己那个产品嘛 ,他确实他就想回到 Google。他回到 Google 之后做的也还挺好 。
据说那个 Gemini 2.0 应该里面就有很多他的贡献 。
你说的是指那个 Founder 创始人, 对吧 ?
对对对 。
有一个传闻向你求证一下, 就说字节 24 年初的时候和你们谈过 40 亿美元的估值来收购你们 。
没有 。
没有 ?
对 。
好好 , 证明是谣言啊 。 就完全没有这个事 , 对吧 ?
对 , 没有没有 。
那这确实也是一种市场现象吧 , 就是大家老是会传 , 比如说这个公司可能要被谁谁谁 , 那个公司可能要被谁谁谁收购 。
最终你发现这个事还是比较简单的 , 还是就是你做出来的啥东西 。
你和张一鸣聊过吧 ? 我是指交流过 。
对 , 聊过几次 。
是 23 年的时候还是 24 年 ?23 年和 24 年都交流过 。 你愿意和他交流的原因是什么 ?
首先你要做的假设是说 ,他们的信息密度肯定是比我们强的 。 这个东西我觉得是一个假设 。 就不应该假设是说我们知道什么东西他自己不知道的 , 对吧 ?
那如果知道这样的话 , 那其实也没啥好害怕的 。
你跟他聊的话你有什么收获吗 ?
我觉得就是你知道在你面前一个非常顶级的企业家 ,他是什么样的吗 ?
所以你观察到了他是什么样 ?
我觉得还是很希望能够给这个社会带来很多正向价值的 。
然后说回到融资的这个事啊 , 就是 24 年可以看到的一个现象是 ,24 年到下半年很多投资方已经是走到了国资轮 , 还有中东轮 。
感觉后面就是能接力的人没有那么多了 。 你们后续要怎么持续获得比较充足的弹药 ?
反正我们还没有到这个地步吧 。 就这个事我觉得实际上还是取决于这样的 , 就是作为一家公司应该思考的问题是说 , 这个公司怎么样做出来自己好的东西 , 然后怎么样变成一家真正的公司 。
公司最近好 , 特别依赖自己的这个研发能力 , 这是现在的现状 。 不应该考虑的问题是说 , 就是抱个大腿然后啥都不用干了 。
我觉得不应该这么来考虑这件事 。
对 ,其实你去年就说过你不相信中国的大模型创业公司能全靠融资 。 你觉得真正的拐点它会来自于技术产品或者商业化的效率的领先 。
对 。
然后我了解到你们 24 年的产品和收入其实都没有实现年初定的目标 。 你会怎么复盘这个事 ?
它也是最快的了 。
对 , 你们比别的公司要快要好 。 所以是你目标定太高了吗 ?
我觉得不是 。 我觉得核心是在一年前的时候 , 当时我们还认为是说 , 就那个时候其实我们会把业务看成还是一个移动互联网 , 还是那样一个认知 。
但是现在的话 , 我们那个东西之后, 我们开始意识到其实这是两回事 。
所以当时定的 DAU 的这些目标是根据移动互联网成功的产品在它早期的增长来定的 ,是吧 ?
对对对 。 我觉得它的实质其实就是两个行业 。
所以你对这个事复盘是 ,24 年初当时定目标的那个逻辑是不太对的 。 就你按照移动互联网去定逻辑是不太对的 。
对 。
那你现在会怎么来去设立目标了 ?
实际上我觉得在这个阶段 , 真实的情况是不应该定一个收入的目标 。其实应该定的是说这个技术研发的目标 ,是因为做出来一些东西导致有了那些业务跟用户的产品的变化 ,不是因为是说我们认为需要做到一个什么样的产品变化来倒推出来我们需要来做什么样的技术 。
这东西我觉得是一个本末倒置的一件事 。
你们 2025 年就是这样定目标的是吗 ? 你们已经定了吗 ?
对啊 ,但是逻辑不是说公司的增长曲线需要长什么样 , 所以你定一个这样的目标 ,而是说我们认为我们的这个研发能做到什么样的程度 , 这个程度会能带来什么样的变化 。
然后基于这个东西来思考我们的业务应该推出来一个我们的预算 , 然后应该是怎么样的 。
然后我们其实就是看到去年下半年, 大家都看到大公司 , 比如像字节还有阿里的强悍 , 尤其是豆包的产品表现是很亮眼的 。
你刚才也说其实你 5 月的时候你就觉得豆包会赢 。 我觉得之前就我聊的这些创始人里面 , 你也是非常早非常直接的就会去表达 ,其实创业公司跑出来是一个很难的事啊 。
就即使你很早的时候有这个认知 , 你觉得去年一年有什么事仍然是超出你的预料的呀 。 我是指大公司的动作方面和这个竞争激烈程度方面 。
我觉得基本上都预 。
基本上都预料到了 。
对 。
连程度你都预料到了吗 ?
我预料的比这个还会更激烈 。 就是我觉得真的是不要靠移动互联网的资本来看这个事 。 如果真要靠移动互联网的资本来看 , 那确实很牛 。
但是如果你不按照那个资本来看 , 你难道是说假定是说技术会长期发展 , 后面的发展局面会带来不一样的人 ?
肯定你看之前来看 , 就真的不一定是件好事 。
你说什么不一定会是件好事 ?
就是以比如说豆包的 DAU 作为一个衡量标准来说 , 真的不一定是一个好事 。
你是指对豆包不是好事 , 还是指以豆包的 DAU 作为一个评判标准 , 对观察者来说会造成干扰 ?
我觉得都是吧 。
你觉得这事对豆包都不是好事 , 为什么对豆包不是好事 ?
有好的一面对吧 ? 好的一面是用户多对吧 ? 但是也会有不好的一面 。 不好的一面是说 , 比如举例子 , 就比如说对 OpenAI 来说 , 虽然说它的用户规模是 Clouder 好多倍 ,但是它的估值 、 资金能力 、 人才可能应该都没有 Clouder 的 3 倍多对吧 ?
然后但是它还要负担很多很多的东西 。 那这个东西有可能是说为了要照顾这么多的用户 , 它很显然让他们的研发的节奏变慢了 。
比如说假设 OpenAI 它现在没有这么多 DAU, 它 DAU 只有一半 ,但是它在技术上比如说把 Clouder 给碾压了好多倍 。
所以用户越多这件事不一定直接让模型能力提升 , 它多到一定程度反而有可能会限制模型发展的速度 、 迭代的速度和灵活性是吗 ?
是 。 至少你看 OpenAI 跟 Clouder 是这样的对吧 ?
对 , 确实你用户更多你的责任也更多 。
对 。 但是技术是会在快速变化的 。 它都不是说提升几个点的事对吧 ? 它其实可能是天翻地覆的变化 , 还会在持续发生 。
那如果说去年的这个情况你们都预料到了 , 你们当时做了哪些事来应对这个竞争了 ?
其实就是你技术的就应该看技术嘛 。 技术的话就是看进步曲线嘛 , 然后产品就应该看产品本身嘛 。
只是说这个产品本身不应该用移动互联网的产品逻辑去套 。
对 。
那应该看什么产品指标 ?
你看嘛 , 现在的这些比如说 AI 里面有合理商业化的产品 , 主要都是依赖订阅的对吧 ? 都不是依赖广告的对吧 ?
但是中国的移动互联网过去的历史上所有的商业模式都是依赖广告来计算的对吧 ? 所以这显然就不一样啊 。
但是付费用户这件事又只能在海外才能跑通对吧 ?
所以在海外产品付费用户确实是个指标 , 包括订阅的转化 。
对 ,但是在国内其实不是对吧 ?
那国内有什么你现在看到的指标吗 ?
我猜是有的 ,但是我想跑得更好一点在哪个 ?
你就你现在不想透露是吗 ?
对对对 。 比如说你用一个广告的计算逻辑来计算这个事 , 至少在国内肯定是不 work 的嘛 。
但其实那个 Talkie 也蛮早就开始做广告的 。
反正就这里面的话 , 我觉得还是有些局限性的 。
所以这是你们之前的尝试 。
对 。
你很早就是看到说创业公司跑出来是个小概率事件 , 挑战很大 ,但你还是选择了创业 。 你算到了这个翻盘的概率是什么 ?
可能性是什么 ?
这个东西它没法算呀 。 就只能是说首先第一呢 , 我觉得它一定会存在 。 本质原因就是因为这里面还是有能看到不同的路径的对吧 ?
大概率我觉得是没法一家同吃的 。
不和巨头正面竞争 , 就豆包类的这种产品你们不是重点投入去做的产品 , 这是你们的一个原则和策略吗 ?
这个东西本质上是我们认为是说做 AGI 跟做一个 ChatGPT 其实是两件事 。 就是相关 ,但它其实不是说有了 ChatGPT 你才能做 AGI,也不是说你要做 AGI 一定得有一个 ChatGPT 这样的产品 。
因为我刚才说的很多原因对吧 ? 所以说当开始意识到是说用户规模不一定就是提升技术水平 ,不一定意味着是说你一定需要最多的用户这件事之后, 所以这个事其实就没什么负担了对吧 ?
也不需要有心理压力的 。
你觉得除了大公司 , 它是比较明显的给这些头部的大模型公司带来一些外部压力之外, 还有什么不明显的威胁和压力吗 ?
首先我觉得压力不是坏事 。 我觉得创业公司其实是个好事 , 让创业公司清晰的意识到是说必须得创造出来独特的价值 , 否则的话就不应该存在 。
从这点上来说我觉得这是一个好事 , 可以非常清晰的意识到是说有哪些东西我们已经好好做好了 ,有哪些东西我们就根本不应该去想 。其实辩证来看 , 反正我是这么来看待这件事的 。
那回到刚才那个问题 , 就是说还有什么不明显的 , 可能大家比较忽视的竞争或者说压力了 ?
我觉得主要还是自身吧 。其实还是怎么把自身做得更好吧 , 还有认知水平的提升 。
组织的认知肯定不光是指你的吧 , 就你们所有人。
对 , 就是那个意思 。 比如说如果我们一年前就开始意识到技术品牌很重要 , 那我们肯定会比现在做得更好嘛 。
你觉得那些就是它不自己做模型 , 它基于一些开源的模型做一些精调 ,在 2025 年就这种公司和像 MiniMax 这样的公司 , 它会是一种什么样的竞争情况 ?
我不知道 。 首先我只能说这样的公司肯定是很有意义的 , 还挺不错的对吧 ? 但是话说回来 , 好像是说这个市场好像也不是说就是有 A 不能有 B 的事对吧 ?
反正至少我们不需要考虑这件事 ,但是你们可能需要考虑这件事 。
我们需要考虑这件事 ?
因为你要观察这个行业嘛 。
对 , 我之前就是有这个大模型的投资人对比过 MiniMax 和月这样面的市场策略 , 就他会认为月这样面是认准一个方向 ,他们主要就是做生产力场景加中国的市场 。
当然这个也是所有的大公司投入最多的方向 。 然后 MiniMax 看起来是一个不断在适应环境 , 就是找到巨头正面战场之外自己的根据地的一个策略 。
你自己会怎么总结你们的这种市场的策略 、 定位的策略 ?
这实质还是那句话 , 我们希望我们自己能够一直在这个浪潮里面 。 当然一直在这个浪潮里面有两个意思啊 。
一个的话是说我们自己的做的这些东西呢 , 对这个浪潮的产生能够起到正面的作用 。 第二个话呢是说在这个浪潮里面我们做的一些事能够让我们有一些收益 , 使得这家公司可以持续发展下去 。
这个其实是我们的最底层的一个做跟不做的一个考虑的逻辑 。
就是关于竞争和怎么赢 ,有的人的选择是把长板做到足够长 ,有的人选择是没有短板 。 你觉得你们会更倾向于哪一种 ?
我觉得这个东西好像我们并没有什么偏好 , 还是取决于怎么样做能够更好的在这个技术不停进步的这个浪潮里面吧 。
就是那是一个核心的目标 , 然后你其他东西是根据那个去看 、 去对齐 、 去调整 。
对 。
接下来我想聊一下你们团队与组织啊 , 刚才也提到点可以再展开一些 。 你怎么看去年有一些人离开啊 ?
组织与协作1:22:50
本质上还是刚才说的嘛 , 就是我们还是相信这个事它应该就是技术驱动的 , 就是不是所有的人都合适 , 就至少对我们来说 。
所以是你劝退的吗 ?
嗯 。
你做这种事会心理负担比较大吗 ?
会啊 。
那你怎么克服啊 ?
那这必须得克服呀 。
你做这些事拖延了吗 ?
拖延了 , 所以感觉不应该拖延 。 我觉得这也是属于认知不够强 。 我觉得就不应该假定说一个公司不会有人员流失对吧 ?
因为一个公司就应该有人员流失才是合理的 。
实际上你们现在团队架构相比于 24 年出了什么变化 ?
其实有个非常核心的变化 , 就是自己来提方案跟自己来做决策 。 提方案跟做决策其实是两个完全不同的状态 。
提方案是说自己来提方案 , 要怎么怎么来做 , 然后做决策指的是说有同学提出来一些方案 , 你来做一个选择 。
至少在我们这个组织里面 ,其实我们会倾向于不管自己还是一个方向的 leader, 大家其实一个基本的标准是说大家都要是那个提方案的人 ,而不是说等着别人给你来汇报 , 然后你来做个选择的人。
所以是要 hands-on 的 , 要一手要去了解细节干活的人。
对 , 这是一个比较核心的一个点 。 还有第二个点就是说 , 我们发现一个比较有效的方法就是什么样的人适合这个组织 , 什么样的人不适合 。
能够比如说客观的来分析这个现状 , 然后能够找到一套理性的方案和把上一家公司的经验直接 copy 过来 , 这其实是一个非常大的区别 。
所以说其实我觉得核心它也就两条 。 第一条就是就是每个人都得是能够提方案的人, 就都得 hands-on。 第二个话呢是说那个方案它应该是基于客观的现状分析出来的 ,不应该是说只是把一个别人家的经验给搬过来 。
我觉得这两点其实就是我们的非常明确的两个原则吧 。
所以这个核心的变化并不是组织形式架构上的变化 ,而是对人的要求的变化 。
对 。
这大概是 2024 年什么时候有这样一个转变和调整 ?
它其实是慢慢演化出来的 。
具体发生了什么事让你会有更清晰的这两个总结 ?
一个的话是基于某些事没做好 , 还有第二个话就基于有些事做好了 。
之前梁文锋他分享过一个 DeepSeek 分工的方式 , 大概是说他们不前置分工 ,他们自然分工 。
对 。
然后他让有想法的人自由组队 , 这个想法是如果你其他人对这个感兴趣 , 你就来参加这个项目 。 然后每个项目可能它能调动的卡和人是不设上限的 。
这在公司里能执行吗 ?
一般公司应该至少有些项目是这样的 。
有些项目是这样 。
说明这个事它是能执行的 。 比如说在一些实验室里面 ,其实也有类似这样的组织形式 , 只是有的实验室是说可能每个人都要做的东西不一样 ,有的实验室是说那个项目大就可以有更多的人。
基本上其实也是这么一种组织形式吧 。 实际上我觉得它都对 , 就是说不应该孤立的看说一个组织形式是不是对 , 应该把这个组织形式跟它已经有的人就放在一起来看 。其实是一个这种双向筛选的这么一个过程 。
因为你刚才也说 2025 年你们最重要的目标肯定是跟技术迭代相关的 。 就技术迭代这块 , 你们现在的组织的协作和分工的形式是怎样的 ?
包括资源怎么分配 ?
其实就是客观来看的话 , 我们感觉这些资源其实都还是挺充足的 , 就是做出来一个好的技术需要的这些东西 。
但是创业公司的话就得做取舍 ,其实核心就是怎么来做取舍 。
这个取舍是自然跑出来的 , 还是比如说你得来判断取舍 ?
当然应该要判断了对吧 ? 但客观的情况来说其实是你不应该假设所有的判断都是对的 , 你就应该假定是有些判断就是错的 。
当你意识到判断错的时候 , 怎么样能够及时来补 ,其实是这么一件事 。
什么机制可以让你意识到你的判断是错的 ?
我觉得最好的机制就是不 ego 吧 。
不 ego, 就不自我 。
对 。
这个怎么具体落到每天的工作上和决策上 ?
区别就是说如果你 ego 的话 , 你比如说有些东西就明明意识到是错了 , 然后还会找一些理由 , 我说的是我自己啊 , 那可能就会让它变成一个对的东西 。
然后不 ego 的方式就是说能够非常的客观 , 你意识到错了它就是错了 , 那就也不要怕打脸 ,有第一时间改 。
你们 MiniMax 现在哪些重要的决策是你来定夺 , 哪些是放权给其他人来做的 ?
我觉得是这样的 , 就一开始我也觉得这个事很重要 , 就是在深入创业的第一年, 就是说你来决定什么东西 , 什么东西不决定 。
但后面的话我发现这个事其实不重要 , 可能更高级的形态是说 ,不是说大家分好说你来负责啥 , 你来负责啥 , 更重要的东西是说就大家把怎么来思考这个问题的方式能够定下来 。
就是说我们会基于什么东西来思考出来是说要这么做或者不这么来做 , 这个事是比较核心的 。
我说一下这个东西的区别啊 , 这个东西区别就是公司里面的人可能会来自不同的地方对吧 ? 比如有的人来自字节跳动 ,有的来自拼多多 , 不同的人做事方式肯定是完全不一样的对吧 ?
那如果管理方式是说谁来负责啥 , 谁来不负责啥 , 那一定会导致比如说这个 A 来负责一块事 ,B 来负责一块事 ,但是他们在之前的公司里面会有一套思考方式 , 那它导致大家的决策逻辑是完全不一样的 。
那这个东西放到一个组织里面就会导致这个组织其实很混乱 ,因为不同模块的决策逻辑是完全不一样 。
所以这个事其实就没法让一个公司非常好的来运行 , 虽然说每个人的素质都很高 ,并且每个人在他的视角里面都是对的 。
然后正确的方式应该是说这个公司它最底层认为什么东西是对的 , 什么东西是不对的 , 然后这个事呢大家能够慢慢的有同样的这些认知 , 这样的话呢导致的结果是说谁来做决策结果都差不多的 , 逻辑也都差不多 , 这样的话这个东西才会组织才会变得比较顺 。
就怎么让大家能统一了 ? 就是通过不停的沟通吗 ?
我觉得一个是沟通吧 , 一个是观察吧 。 观察指的是总会有些正反馈跟负反馈吧 。 我觉得这可能是一种比较高级的管理形式 。
当然也不能说我们做到这样一个水平了 ,但是至少我们在某种程度上来努力 。 那对我自己来说就是讲明白 , 就是当一定要做一个决定的时候 , 大家讲明白 , 或者大家能够讨论清楚这个决定到底是怎么做出来的 ,而不是说你来拍了一个板 。
所以你觉得更理想的状态就是可能在这个组织里的人他做的决定会是类似的 。
对 , 比如说字节它其实就会有这样的一些特点 。
但这是一件好事吗 ? 就不会让你的决策的多样化变少了吗 ?
我觉得这是好事 , 不同阶段可能不一样吧 。
那如果每个人都想的很一样的话 , 那不是会凑到一起去 ?
多样性也是一个很重要的指标了 ,但是我感觉就是说 , 就是真正把一个公司能够凝聚起来的其实还是这些东西 。
对 , 或者你可能说的是一些原则性的一些比较大的认知 , 多样性可能是在一些更具体的事情上 。
对 。
总的来说你觉得你是一个容易被说服的人吗 ?
我觉得不是 。
不是 。 这个和不要 ego 是什么关系 ? 就是矛盾的吗 ?
就很多事都是矛盾的嘛 , 就跟 MiniMax 也是矛盾的对吧 ?
对 ,MiniMax 这个名字就是矛盾的 。
对 ,因为我觉得世界可能就是这样 , 它就是两个东西辩证的来看吧 。
那实际在工作中在一些重要的决策的时候 , 你怎么去平衡 ? 一方面你有自己的想法 , 你可能很难被说服 , 另一方面你不要 ego, 你不要太自我 。
反正还是有一些办法的 。 我觉得这个实质还是说就是能够静下心来思考吧 ,不要被一些表面暂时的东西迷惑住 。
你们现在的这种决策方式 , 会不会让员工觉得公司的一些管理决策会很乱啊 ?
我觉得首先呢 , 我一个比较重要的事是说得意识到是说让大家觉得管理很好 , 或者让大家觉得这些东西其实它不是一个 。
不是个目标 。
对 ,不是一个目标 。 对 , 就跟你不能假定一个团队它就不会有人员流失是一样的 。
有 MiniMax 的员工说 24 年的时候 ,他有段时间感到公司的管理决策非常摇摆 , 就可能这个月的核心目标是收入 , 下个月的核心目标是增长 , 下个月又换成收入 。
所以我们就统一了思想嘛 。
现在统一的思想就是其实这两个事可能都不是最重要目标 , 最重要目标是技术迭代 。
对 。
你觉得就是管理一个不能用以前的逻辑来套的这种新的 AI 公司 ,在组织上你遇到的最大难题是什么 ?
我觉得主要挑战其实还是就是持续吸引到好的人吧 , 这个事情是目前最大的挑战 。
你会怎么评估就是你们在人才吸引力上和其他的同类公司 , 包括大公司都算在一起啊 ?
我觉得其实现在最有人才吸引力的就我观察 , 我觉得其实是字节跳动 。
对 , 我听一些公司说校招的时候 , 现在很多人都是选择字节 。
对啊 ,其实我觉得这个东西这是一个客观事实 ,但是呢其实去了字节跳动很多人可能是并没有发挥出来的 , 真的发挥出来的人的比例其实是很低的 。
比出来的公司低是吗 ?
要低非常多 。
是因为字节跳动人太多了 ?
对 , 所以它其实就是这么一件事 。 对我来说其实核心真的还是如何吸引到更多更好的人。
就最后想聊聊你个人的变化和成长 。
个人成长1:31:15
我觉得其实还是有很多变化的 , 就是半年多以前吧 , 或者一年前 , 好像好多人会觉得我很焦虑 ,有些人。
然后最近半年就完全不焦虑了 , 真实的情况就是这样的 。 然后呢我觉得核心就开始意识到其实就是要做取舍 。
你半年前焦虑是因为什么 ?
半年前的话我觉得本质上是因为不太知道该怎么来做取舍 , 或者是不敢来做取舍 , 或者有的时候就不想来做取舍 。
你过去一年最大的痛苦就是取舍这个点吗 ?
最大的痛苦是不知道要做取舍 , 当知道要做取舍的时候就不痛苦了 。
那个时候痛苦已经解决了很大一部分 。
对对对 。
之前这个 YC 的创始人格雷姆说过一句话 ,他说创业公司摊开摊都是车祸现场 。 你觉得去年你们经历的最大的混乱是什么 ?
我觉得就是我刚才说的这些事 , 就是意识到是需要来做取舍的 。
然后在那之前可能会有一个焦虑和混乱的状态 。
对 ,并且意识到就公司的驱动力到底是啥 。
那你去年反思最多的问题是什么 ?
反思的问题是说为什么这个认知能力不能提升得更快呢 ?
你后来找到啥方法了吗 ?
找到了一些 。
比如了 ?
就是要放下 ego, 然后思考得更深入 。
你之前说过你很重要的一个学习方式是和比自己强的人去交流 。
对 。
去年你有见过什么比自己强的人给了你很大的启发吗 ?
还是有的 ,但是坦白的说我觉得就是光这样是不够的 。 本质上还是自己得能够就是放下 ego, 能够思考得非常的深入 。
大部分的时候其实是能想清楚的 。
自己想清楚 , 这是一个自我反思的过程 。
可以这么认为吧 。
你去年当外部压力很大的时候 , 你怎么排挤压力啊 ?
其实就是当想明白这件事之后就还好了 。
之前有一个投资人他分享了去年和你一起找算力的一个故事 , 就是说你会非常急切的去追求便宜的价格 、 更短的租期 , 然后可能有一些供应商会提出说我可以给你一些当地的 2B 的 AI 订单 , 然后让你接受一个更贵的 GPU, 你说你不需要订单 。
首先我其实非常感谢我们那些供应商啊 ,其实核心还是说我们开始意识到很多东西我们自己做不了 。
就是相当于是我答应人家要去交付那东西 , 第一我们没这个精力 , 第二的话有可能也会把别人给坑了 。
我们知道我们在那个时间点我们没法去来做这样的交付 。 所以说其实这个东西我觉得可能不是不尽人情啊 , 还是很感激的 。
我觉得核心是因为就是我们不太想去耽误别人。
就你有的时候看起来是非常适应性的 , 甚至可能有的员工会觉得是摇摆的 ,有的时候你又非常坚决 。
你觉得哪个更接近真实的你啊 ?
这个的话也是一个个人的进步的过程吧 。 我觉得至少比之前变得更强一点之后, 我觉得其实是越来越坚决了 。
就是你想清楚取舍这个事情 ,以及不要太自我 , 要放下自我 。
对对对 。
就你创业的时候你既不是那种业界大脑 , 可能也不被很多人认为是技术小天才 , 你会认为自己是什么类型的创始人 ?
我觉得是比较这个简单的吧 。
简单是指 ?
简单的话就是知道有件事嘛 , 这件事反而还挺难的 , 然后但是如果做好价值也挺大的 , 然后就坚持做 , 就是这样 。
在创业或者说当一个 CEO 这件事上你有什么 role model 吗 ?
没有 。
那如果没有一个的话有几个吗 ? 就可能他们不同的特质 。
也没有 。
你觉得当一个 CEO 你的天赋和你的缺点各是什么 ?
我觉得就不要觉得自己是 CEO。
觉得自己 CEO 的表现是什么 ?
就是你要考虑 CEO 应该是干啥不应该干啥 。
就是我刚才问的 , 比如说我哪些事我管哪些事别人管 ,其实你觉得不应该这样去考虑事情 。
对 。
有一个我比较好奇的问题啊 , 就是你在公司里一直被大家叫做 IO, 就是 Dota 2 里有一个角色嘛 , 我去问了 MiniMax 的海螺 AI, 它的回答是这是一个辅助型的英雄 , 主要是为队友提供增益和保护 ,在团队中扮演 4 号位或 5 号位 。
对 。
你为什么玩 Dota 2 的时候选了这个角色 ,而且你一直叫这个名字它对你有什么意义吗 ?
确实是这样的 。
你就说这个角色确实是这样的一个角色 。
对对对 ,其实这个东西很偶然的 ,是因为那个那个时候其实它不是一直都是 4 号位的 ,TI8 的时候我记得 , 反正就不是 TI8 就是 TI9。
当时那个安娜 , 就是那个叫上帝的小精灵 , 就其实是把她那个 IO 变成了 1 号位 , 然后非常的强 , 那个是导致他们后面得了就是 TI 的冠军 。
当时就觉得这名字挺酷的 。
你是指有一个战队就是把 IO 作为 1 号位来使用 , 这样一个创新的打法让帮他们得了冠军是吧 ?
对 。
所以本身这个角色的属性跟你自己的特点倒并没有非常直接的相关 。
对 , 就是创业这个事它还是有很多随机的行为的 。
就可能你很难归类说我是个辅助型的英雄还是个输出型的英雄 。
对 。
你觉得你比较像什么型的英雄 ?
我觉得不应该把这个穿越当做看 , 如果一定要当做看的话 , 我觉得我肯定是那个最相信团队的 。
最相信团队 。
嗯 。
2025 年你觉得可预见的变化是什么 ? 比较确定的变化 。
整个行业吧 。 我觉得接下来我自己觉得 AI 一个比较核心的目标就是那个 , 就是刚才说的 , 就是我觉得专业领域到达专业人士的水平 , 这应该是一个比较实质的一个 milestone,但是我不知道这个事会不会在 2025 年完全实现啊 ,但是我觉得至少能实现一部分 。
那你觉得还是悬念的可能的关键变量会是什么 ?
我觉得变量的话其实还是适当的 , 就这个事它其实会比做个 Chatbot 其实会更复杂一点 ,因为 Chatbot 的话呢其实它的产品形态比较简单嘛 , 比如说假设是 Agent 的定义是专业领域到专业人士的水平 ,其实这个事它不光是一个技术的事了 ,其实是个技术加整个产业的事 , 它甚至可能还会导致一些社会的变化 。
对 , 我觉得它其实是一个很综合性的一件事 。
你是指的社会分工 , 包括就业这些的变化是吗 ?
有可能吧 ,但这个事可能不是瞬间发生的 , 它可能是一个 。
逐渐 。
对 。
2025 年你自己最期待的事情是什么呀 ? 可以讲三个层面的 , 行业的 、 公司的 , 还有你自己的 。
我先说我自己的吧 , 我自己的话我肯定是希望自己的技术水平变得更高 。 我其实发现是这样的 , 就是说最开始创业的时候可能还会考虑一下什么管理的这些事什么之类的 , 后面的话我自己发现其实是没那么重要的 。
我觉得真正重要的东西其实就是自己的技术认知是不是能够在不停的提升 , 这个事其实是我最希望自己能够进步的一个地方吧 。
然后那公司的话呢 , 我觉得我们还有很多地方做的不太好 , 我不是指的是说这个地方可以提升 5% 提升 10% 啊 , 我指的是说我们有很多地方可以提升 10 倍 , 还有挺多这样的地方的 。
我希望这些事我们能够变好吧 。 行业的话我自己肯定是觉得是说 AI 这个行业的价值是说比如说假设 AI 技术不会进步了 , 就假设 AI 技术停滞了 , 那我觉得是其实肯定是对不起大家对这个行业的付出跟投入的 。
那所以这行业里面我觉得最重要的事那就是说真的水平在不停的提升 , 然后并且带来的直接的社会价值 。
OK, 感谢 IO 今天的时间啊 。
嗯 , 好 。
本期节目就到这里 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。
你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。 下期再见
。






