开场0:00
欢迎收听 《 晚点聊 》, 我是曼祺 。 今天我们一次发了 2 期节目 , 嘉宾都是秘塔创始人闵可锐 。
一次访谈发生在 2023 年年初 , 另一次是在最近 。 本期是 2023 年 3 月中旬的那一次访谈 , 那是中国大模型热潮的开端 。
王慧文刚自己投资 5000 万美元成立光年之外, 月之暗面还在组建 , 六小龙的名号还没有兴起 ,DeepSeek 还没有正式成立 , 字节等大公司也没有充分展现对 AI 的 " 志在必得 " 和激进投入 。
秘塔当时已经是一家成立近 5 年的公司 , 推出了法律翻译 、 秘塔写字猫等多款 AI 应用 。 现在更为人熟知的秘塔搜索则还没有上线 。
行业变化快速 , 回顾这次发生在热潮开端的讨论 , 恍若隔世 ,也有很多先见之明 。 那时可锐就有一些犀利的观察和观点 , 包括 : 中国 VC 可能会集体错过一位最有雄心的中国大模型创业者 。
我对这个事有一个判断 , 现在肯定所有人会认为我是胡说八道 ,但是这不重要 。 我会觉得在这一轮的所谓大模型的这个热潮里面 , 很有可能 , 尤其是投中国的这批投资人, 会集体 miss 掉 。
在基础大模型的创业中, 传统的组织人才方式不 work。 预训练很重要 ,是范式转变 ; 而具体到 Transformer 架构其实没那么重要 。
未来各公司的密集模型竞争不可持续 , 拿不到正反馈的团队将很快退场 , 速生速死 。 而 AI 应用领域的创业会是战国时代 ,是个人开发者 、 创业公司和大公司之间 " 所有人 PK 所有人 " 的状态 。其实在秘塔刚成立的 2018 年, 闵可锐就写过一篇文章 , 叫 《 关于机器学习的前尘往事 》, 我也会贴在 shownotes 里 。
这篇文章已经提到了当时 Anthropic 创始人 Dario 在百度工作期间发现的 Scaling Laws 的雏形 。 这篇文章开头是模仿 《 百年孤独 》 经典开篇的一个 AI 小故事 ,其中提到了 108 期节目中马毅老师也聊到的 "50 年代 AI 热潮中的感知机 "。
闵可锐是马老师在伊利诺伊大学任职时的博士研究生 , 后一爷创业 。此前他获得了复旦计算机学士学位和牛津大学数学硕士学位 。
这期节目我们完整聊了可锐的职业经历 、 秘塔创业故事 、 他在 2023 年年初对大模型格局的思考 。
而今天发的另一期节目是最近秘塔发布新产品 " 今天学点啥 " 之后的访谈 , 我们从这个产品切入聊了这两年的变化 。
下面就正式进入本期节目吧 。
对 , 就来说话 。 你觉得你们现在的重心是大模型 , 还是在应用 ?
创业与预训练2:30
我们肯定会以应用驱动 。
应用驱动 ?
对 。
因为我会觉得是恰恰是很多人所谓在做大模型 , 我看起来就是啥也没做好 。 就是它没有一个明确的应用侧重的时候 ,其实容易做成 " 我好像什么都懂 ,但是什么都做到一个基本不太可用的 " 一个阶段 。
这个其实是我觉得很多厂家 , 就包括我们知道有些号称巨头的 ,在那乱加数据加出来的 。
对 , 你可以自我介绍一下, 包括之前的经历和你们现在在做的事情 。
嗯 , 我们其实一直在干跟 AI 相关的 , 干了还是挺长时间了 。 我们基本上是从这个中学开始嘛 , 就参加那个算法竞赛 , 所以算是最初阶段就是接触算法 、 接触相关数据处理啊 , 这些其实都在很早的时间 。
然后就保送到复旦大学 , 然后复旦大学本科计算机 , 保送毕业了以后的话到牛津大学读数学的一个硕士 , 然后再到 USH 读的一个 PhD。
然后正好在读博士期间有个机会就回国创业了 , 所以其实是一个博士学位没拿到 , 就提前回国的这个状态 。
就创立了第一家公司 ,其实也是在做 AI 相关的 。
2022 年那次 ?
2013 年 。
对 , 那个是叫一个数据公司 。
波森数据 。 对 , 我们说这个还挺好玩的 ,因为波森这个名字刚好跟好像是这次那个什么铃木吧创业一模一样 , 就是叫波森 。
所以波森是这个行业里 、 这个领域里的一个 ?
其实不是 ,是波色词的那个波森 。
哦 , 所以它是科学领域 ,但并不是在人工智能领域 。
对 ,其实不在人工智能 ,在物理领域 。 就是波森 , 包括它这次创业我看拿的那个域名 , 这波森点 AI 应该是当时我们买过的一个域名。
所以你们的域名流转到了铃木这里 。
是 。 然后我们的另外一八年起的这个秘塔 , 对吧 ,Meta, 然后又跟 Facebook 撞上, 所以我们还是很会起名字的 。
起名小天才 。
是 。 所以基本上就是 2013 年回国 , 创立波森 。 波森差不多做了 4 到 5 年时间 。 就是产品上其实也有一些进展 , 就最后一个产品其实是在金融领域去做落地 。
当时马毅看上觉得这个是他们见过的少有的真正在做产品 、 做 AI,并且真正把这个产品还能卖给这些金融公司的少有的这个团队 。
所以后来其实就谈了一个收购 。 然后因为我不希望被那个马毅给绑定到 , 所以我就提前出来 。
所以我 2017 年收购的那期间我就到这个猎豹 。 猎豹 2017 到 2018 年, 待了差不多一年的一个时间 , 就是带猎豹的 AI 团队 。
因为当时猎豹其实也正好处在一个转型期间 。
是 。
就老的这个业务其实看得到那个瓶颈 , 所以其实副总在这个 2016、2017 年的时候就已经在着手准备 , 一方面是这个内容加 AI,其实看的就是更多的像是一个头条的那么样一个这个机会 。
对 , 另外一块是他在做机器人的那个公司 。
猎户星空 。
对 , 猎户星空那边 。 所以反正当时我们在两块都还是有比较深的参与 , 包括推荐系统的这个以及搭建 , 包括在猎户星空那边的话 ,是跟当时核心在做那个销量音箱 , 就是相当于是猎豹 、 猎户和喜马拉雅的那个合作 , 算国内前几个在做音箱的人家 。
是 。
对 。 这个后来就是音箱这个事被打成一团红海嘛 。 对 。
价格战 。
对 ,是 。 就疯狂的就是从上千块钱打到几十块钱 、 五十块钱 , 就几乎是半买半送的那种 。
59。 我记得当时天猫 、 百度好像都有几十块的 。
还有那种什么满多少干脆给你送一个 , 就反正这种 , 就全部是以这种方式来铺这个量 。 所以就还是比较直接的经历了整个这段这个时间 。
但是我之所以包括 2018 年就从这个猎豹出来 ,其实没有太长时间 。 一个比较重要的原因 ,其实我们觉得还是看到了在新的这一代 AI 技术的比较大的一个机会 ,而这个机会我觉得当时可能没有那么多人想进 。
对 , 我觉得这个就进入到我们这次想聊的主题了 。 因为你之前和我说你是 2017 年看到 Transformer 那个论文 , 那是 2017 年底的时候 , 对吧 ?
这个其实对你创业算是有一个直接的影响和关系吧 ?
现在有些人会来讲这个事 , 我不这么认为 。
OK。
我觉得我们看到的一个机会是在于 ,不管是在 2017 年还是 2018 年, 不管是在这个 Transformer 还是非 Transformer, 实际上就是通过深度学习加这个大规模的预训练 , 就这件事开始 work 了 。
包括那个什么 BERT 啊这些东西出来之前 , 我们对这个事是有一个基本的一个判断 , 就是说这事它应该能 work, 只不过后面那个 Transformer 这件事 , 我觉得是一个工程上很好的解决了在做这个大规模并行去得到有效训练的一个这个问题 。
就原来其实大家在训练很多是 RNN。RNN 的那个有两个问题 , 第一个问题是说你单节点跑可以 , 就是在比较小规模上跑是没问题的 。在大规模跑的话 , 它实际上什么时间的相互依赖啊等等 , 就是大规模并行其实不好做 。
但是后面也有一些架构试图在解决这个问题 。
你的意思是大规模预训练这个想法是在 Transformer 之前出现的 ?
对 。
追溯一下这个源头 , 它是从何时 ? 就是学界开始看到这是非常有潜力的一种方法 。
在这个 Transformer 之前 , 我有点忘了是 OpenAI 还是谁 ,也有相关的一些工作 , 叫什么 ELMO 啊相关的一些这工作 ,其实在 BERT 之前 ,是通过 RNN 的这个方式去做预训练 ,其实已经在很多这个任务上达到了还不错的这个效果 。
所以我们看到的就是包括在比如说 2017 年我们在做翻译这个任务的时候 , 我们清楚的知道上一代就是在深度学习之前在做统计机器翻译的时候 , 它这个天花板我们非常清楚在哪里 。
就是很多作为短语和短语之间的翻译 , 然后把短语通过一些语法规则去交换它的顺序 , 达到一个翻译的结果 。
就是那种机械化的翻译可以达到 , 就是可能能基本看懂 ,但凡是那种就是它说的是 A 这个词 , 实际上想表达 B 这个意思的这种 translation, 基本上在上一代的这个架构上面是不可能完成的 。
甚至是说几个词单独表达的意思都很清楚 ,但是它拼在一起的时候产生了很大的变化 , 比如它是一个俗语啊等等的这种情况 , 你其实都在原来的这个架构上其实很难解决 。
你可以解释一下预训练这种想法和之前的训练的区别是什么 ?
嗯 ,以前其实就相当于是说所有的任务在解决的时候 , 你就是要解决 A 任务 , 你就去 A 任务搜集 A 任务相关的这个数据标签 , 比如说去解决情感分析 , 你就去找比如说亚马逊的这个评论 , 找一万条 , 然后雇人去每一条给他说这个是正面评论 , 还是个中性的 , 还是一个偏负面的 , 对这个产品的这个评论 。
就相当于是每个任务对于模型来讲都是独立的 , 就是每次都是从零开始 , 我要干 A 任务 , 我就去 A 任务去做这个数据 , 去做这个训练 。
对 , 所以预训练就相当于是说我先去把这个语言先学会 , 我依赖的其实是一个我觉得叫无标注也不太合适 ,其实本质上你人写下来一段话的时候 , 写的这个过程实际上就是人对它的一个内容输出 , 就是一个 supervised 的一个过程 。
所以更像 self-supervised 的这个过程 , 就是你找得到大量的不管是中文也好 、 英文也好 , 这些不同语言书写的这个文本嘛 。
那这个东西就是先让它学会说怎么把这些文本给尽可能的生成出来或者猜得出来 , 对吧 ? 就是所谓的这些 Transformer 干的事 ,其实 BERT 干的事就是我在中间给你麻一些空 , 你尽可能把它给还原出来 。
这个 GPT 干的事是我给你前缀 , 对吧 ? 我给你前面 10 个词 , 你把下一词给我猜出来 。
是 。
对 , 它本质上就相当于我为了解决可能这个 sentiment analysis 去做情感分析这个问题 , 我实际上我先用一些其他的任务去把语言这件事可能先学会了 , 然后再来解决新的这个问题 。
对 , 去解决 。 所以这个被证明说它需要在第一是说标注量 , 我原来可能要一万条才能在这个上面达到一个 70 分的一个效果 , 那在新的这个范式下面 , 我可能只要 1000 条 , 可能做到 85 分的这个效果 , 就显著的降低了就是整个 engineering 的就是去落地的这么样一个这个成本 。
嗯 , 新的范式下需要标注数据的就是后面微调的部分 。
对 ,是的 。 就是前面那部分 。 而第一个是说它只挑微调的部分 , 第二个部分是你会发现有一定难度的一些语言结构 , 你原来一万条你根本覆盖不了 , 就是你解决它的概率为零 , 就变成了一个就是原来大家说有多少人工有多少智能嘛 。
就这句话我没见过 , 那我就不会 , 对吧 ? 但是现在预训练这个范式就是这句话你没见过 ,也许你会 ,因为我在整个互联网上你可能是看到过 10 次这样的表述的一个方式 , 那么它有可能是能迁移到新的这个任务上 。
所以它既带来了更多的效率 , 让以前做的更难的事变得更简单 , 同时它也能做到以前做不到的事情 。
对 。 否则以前那个对大家来讲 , 为啥很多时候对这个智能感到很绝望 ? 就是我的每一个就是你看上去好像是智能的东西 ,也许都在背后对应着一条人工的规则 , 对吧 ?
那你说我写一万条规则 , 让它假装智能 , 这件事就是很多人看起来很不 fancy。 而且当你真正去实现那一万条规则的时候 , 你会发现一个更大的问题就是你做不到它的 consistent。
就是你今天的规则和明天的规则 ,A 写的规则和 B 写的规则一定是冲突的 , 然后在冲突之下到底怎么解决 。
就包括有些原来 Google 也投了很多钱去做什么知识图谱啊这样的一些 , 就是试图把很多数据给符号化的一些工作 , 最后都被证明非常难 skill。
就即便 Google 投很多钱 , 砸很多人, 要想维持它的数据的这个实时更新 , 它的这个有效性和它 cover 了各行各业的所有领域 , 这事基本上是不可能的 。
嗯 , 对 。 那就回到 2018 年你们创业的时候 , 你们当时已经看到预训练和微调结合起来可以 work 的这个方式之后, 你们做了什么 ?
我们其实第一个在落地的那个 , 就是我们当时的一个设想啊 , 我觉得就是有多少资源办多少事 。 我们看到的是说 , 就是 AGI 我觉得这个事当时看起来还是很远 ,但是你给我一个特定的领域 , 这个领域如果是有 , 就是它跟人认为的简单或者困难甚至都关系不大 。
就是有的时候就是人认为这个任务是困难的 ,但是我们觉得它背后的那个 reasoning 的逻辑 , 哪怕是多步的一个 reasoning,但是它是有逻辑的 , 它是有规则可循的 , 这件事都可以给机器干到很好的一个程度 。
所以我们当时选的第一个去切入的是法律翻译嘛 , 就是传统上法律人认为法律翻译其实不容易 ,因为往往你既需要懂法 , 又要懂语言 , 然后这两者可能最好还有一些实务经验 , 就知道这个中间有一些专业术语到底应该怎么来解决啊等等 , 就是它有比较复杂的这个逻辑关系 。
但是我们在看这个的时候就说你有复杂的逻辑没问题 , 就是你得有逻辑 , 这个事其实就有可能被数据驱动的这个方式做解决掉 。
所以我们当时觉得其实找到高价值的场景 , 用户愿意有付费的意愿 , 然后通过 AI 的这个方式去做一个一个 domain 的去做人工的这个替代 , 这个事是具有高的可行性的 。
嗯 。
对 , 所以我们其实在往下推进的时候 , 基本上是沿着这条路径去做 。 只是到了去年年底出现了一个 , 就是我们说它更像是说在基础的这个假设逻辑上面跟我们的那个想法是类似的 ,但是它说我也不要一个一个 domain 去推了 , 我干脆把 1000 个常见 domain 我一起给你全做 ,而且呢我也不在 1000 个模型上做 , 我把它 integrate 到一个模型里面去把这个事给做了 ,
然后就变成现在 ChatGPT 的这种方向能力的一个做法 。
技术门槛12:14
嗯 , 对 。其实你刚才说两个关键 , 一个是大家对 AGI 的认知到底是怎样的 , 另外一个就是你说资源 , 你说有多少资源做多少事 。
是 。
因为 OpenAI 可能它对 AGI 的认知是它要以这个方向为它的目标 ,而且它很相信这一点是可以做到的 , 同时它资源也多 。
对 ,而且大家有的时候在用最大的一些大厂和这个 OpenAI 比 ,但是我们看起来它在创业公司里面实际上这个资源已经豪华到在其他的这个团队很难去想象的这么一个地步 。
甚至比起现在国内有些大厂的投入 , 我觉得它现在砸的这个钱一点都不逊色于这些大厂 , 可能花几十个亿人民币啊这种 。
你刚才说你们选场景的一个逻辑 , 那你们在技术上是做了些什么事 ? 就创业初期的时候 。
我们会觉得是这样的 , 技术上在我们看起来在 ChatGPT 之前 , 整个行业我觉得没有秘密 。 什么叫做没有秘密呢 ?
就是我基本上会认为不管是今天微软做了个什么事 , 做了个什么样的一个应用 , 还是 Google 做了个什么样的应用 , 你只要把相关的这个效果拿给我看 , 我就可以给你报个价 , 我就可以给你算得出来我需要几个月 , 需要几百万 , 我把这个事给你搞定 。
就是能到这个程度 。 就是我们不觉得 Google 或者微软啊这些人家在做的任何一个应用能够 tricky 到说我不能把它逆向工程出来的这么一个程度 , 直到真正的工业化生产的像 GPT-4 啊这种东西出来 , 我们发觉这个事好像就真的有难度了 。
你的意思是你们创业之初其实在技术上就是按常规的方式去做就可以了 , 就根据你的应用需要有什么功能你去做这些东西就行了 。
是 。 而且就是我觉得不止一次的我们在做的这个过程当中会看到什么呢 ? 比如说我们为了解决翻译问题去 design 了一些算法上的一些优化的一些 trick, 工程上的改进的一些 trick, 可能在一年以后你看 Google 的 publication, 哎 , 它把这个事给讲出来了 , 它的 researcher 可能发现了同样的 trick 去解决这个同样的问题 。
你的意思就是说只是你们没有发论文 。
对 , 我们只是懒得发 , 我们觉得这不重要 。
嗯 , 那你们是创业之初就是基于 Transformer 这个架构做的你们底层的模型吗 ?
它是这样的 , 实际上我觉得中国人抽风就是这个 , 这个逻辑非常严重 。 我觉得其实它没有太大必要去神化某一个架构 , 包括最近其实也是有一系列的工作在基于 RNN 号称做到接近于 Transformer 或者跟 Transformer 基本上持平的效果 。在我们看起来 , 整个数据也好 , 算力也好 , 它的工程化落地也好 , 差不多是到了那么样一个节点 。
我会相信说哪怕没有 Transformer, 比如说 GPT 这件事可能会晚个两年, 但最多可能也就是晚个两年, 它也会发生 。 它不是在这个架构上面 , 我个人认为这个架构本身的 design 没有重要到这么样一个程度 。
你认为更重要的是预训练这种想法 。
对 , 这种想法本身其实我觉得是更核心的一件事 。 至于采用 Transformer 做预训练 , 还是采用后续改进的一些 RNN 那些做预训练 , 我觉得这是技术细节讨论的问题 。
而且一定有很多人在争 BERT 怎么样又失败了 ,GPT 怎么样 , 我们看到这事没有这么极端 , 它完全可以借用 BERT 也用 GPT, 就是谁好用谁呗 。
我觉得这不是对特殊的网络架构本身有任何的信仰 。 我们看到的这个问题恰恰是这样的 , 它的 GPT-3 的论文没有用任何新东西 。
换句话说 , 它比起我们真正比如说有些为了去优化它的一些速度架构啊 , 还额外去做了一些工作的基础上来看 , 反而基本上你可以认为它用的架构除了有一个 Attention 的细节 , 它基本上就是 17 年的版本 。
但是它规模扩大了 。
对 , 它的规模扩大了 。 它唯一做到的事就是把规模扩大了 , 扩大到人家觉得完全不会去考虑的这么一个状态 。
因为我很清楚记得什么呢 ?2020 年左右的时候 , 工业界在想啥问题 , 那个时候 BERT 应该是 18 年后半年出来的 ,其实已经在各类的 , 尤其是一些分类问题 、 判别类的问题上刷榜了 。在这个以后, 包括很多工业界就像我们说下面做音箱啊这些 , 实际上是在考虑把这样的一些像 BERT 的架构去集成到工业的一些应用当中, 去做分类 , 去做比如说你给了个语
音指令 , 我要识别你到底什么意图啊等等。 但就这个架构 ,BERT base 是 1 亿参数 , 对吧 ? 大量的工业界的人认为它的消耗太大了 ,不可应用 。
所以之前我看包括像什么华为的什么诺亚实验室啊等等 , 国内有一大批的工作其实是在做怎么压缩它 , 怎么把一个 1 亿参数的模型干到 300 万 、500 万 , 然后它的 performance profile 尽可能的少 , 怎么量化 , 怎么压缩 ,有一大批的工作其实是在沿这种方向展开 。
所以当时工业界普遍认知说 1 亿参数的模型 , 那就是大模型 。1 亿参数的模型对于我的落地应用可能是很难接受的 ,是在这么样一个普遍理解的基础上,GPT-3 在 20 年拿出来做到 1000 多亿规模 。
我觉得绝大多数人当时对这个事的看法就是他们真的很有钱 , 干了一个这个事 , 这个事有 application 吗 ?No,不可能有 application,因为它已经比我说的工业界认为 1 亿参数的这个又贵了 1000 倍 。
就说这可能是一个很好的 scientific 的探索 ,但是很难相信它是一个能够去做到实际落地到产品级有产出的效果 。
了解 。 所以当时是学术界更关注 GPT-3,因为你们已经在做应用了 , 已经在做公司了 。
对 。
嗯 , 反而你没有觉得这个东西是可用的 。
我们会觉得这挺好玩 ,但不觉得它是一个能实际落地到产品级的一个东西 。2017 年 Google 发的这个 Transformer 实际上是两个部分嘛 , 一个是 encoder, 一个是 decoder。
所以其实最早这篇论文是一个完整的 encoder 加 decoder 的架构 ,在整个结构里面把 encoder 抽出来单独去做预训练 , 那就是 BERT。GPT 是把 decoder 单独抽出来 , 按照前面 N 个词去预测 N+1 个词的这个 , 就是 decoder。
最早那篇论文实际上是两者皆有的这么一个状态 , 没有说我到底 A 重要还是 B 重要 , 两个一起在用的这么一个状态 。
所以我们一直觉得为什么大家要去争这个 。
就你觉得不可比 , 它不是这么去比的 , 你是这个意思吗 ?
我觉得这事有点搞笑 。
怎么讲 ?
就像一个红色圆珠笔 , 一个蓝色圆珠笔 , 你一定要说谁好 , 这重要吗 ? 你该用蓝色就用蓝色 , 你该用红色的地方你就用红色 。
所以是看你要用它干什么 , 任务场景是什么 。
对 , 任务场景是什么 , 你根据那个任务场景去设计一个最合适的架构 , 这就完了 。 工具层面没有必要对这个事产生任何的信仰 , 这个事我觉得就非常诡异 ,而且本质上这就是一个东西 , 对吧 ?
嗯 。
你为什么会对蓝色和红色这么痴迷呢 ?
我觉得大家现在也不是说信仰吧 , 可能是你会看到 GPT 它可能在很多任务上, 就很多类型的任务上, 它确实展现的通用性会更强 。
嗯 。
而且在很多任务上, 它单个任务的表现也会很强 。
嗯 ,但是这件事我觉得它可笑的地方就在于从来没有一个大规模的公平比较 。
你说的太主观了是吗 ?
对 , 它展现出来的通用性很强 。 你拿 1000 亿的模型跟 100 亿的模型相比 , 你说 1000 亿的更强 ,1000 亿的 decoder 就是 GPT 的这个模型更强 , 你是在这么做比较的 。
你没有拿同样 1000 亿的 encoder-decoder 的模型和 1000 亿的 decoder-only 的模型在做比较 。
我觉得其实它这个比较还有一个发展的视角吧 ,因为 GPT 它其实也是一直迭代嘛 , 迭代到 3.5 到 4 的时候它才有非常惊人的表现 。
然后谷歌做 BERT, 它其实没有再一直往这个方向迭代 , 它后面也有一些别的模型 。
Google 其实现在有一个 encoder-decoder, 就是我们说两个一起用的这个模型 , 就是它的那个 T5。
对 。
然后 T5 的后续它在上面加 instruction,其实表现出来很不错的 , 至少是在同等规模上面验证我们看到的结果基本上是和 GPT 互有胜负 。
就是有的任务你好一些 ,有的任务我好一些 , 基本上是这么一个情况 。 之所以 19 年、20 年大家用 GPT 的 decoder-only 这个模型 ,其实有一个最基本的猜测 , 这是一个纯工程化的问题 , 这个架构更简单 , 更好优化 。
对 ,而且更好上规模 。
对 , 纯粹是因为能够更大限度的去利用 GPU 的这个运行能力 。 如果你是 encoder-decoder, 你要把 GPU 用满这件事会显得很复杂 ,因为你要考虑两个不同的这个串 ,有的时候这个上面你做功能高一点 ,有的时候那个高一点 ,有的时候 A 在等 B,有的时候 B 在等 A。
所以我会认为本质上是一个程序上更简单的问题 , 导致了 decoder-only 的模型在后面 , 尤其是在 OpenAI 的使用当中被更广泛的使用起来 。
它的吞吐量可能会高 20% 到 30%, 就是机器成本原因的一个考量 。
这个视角挺好的 ,因为 Ilya 他也有一些自己的表达 ,他会很强调 predicting next token 这件事情的认知 , 或者你可以说是哲学上的一个意义吧 。
你能预测下一个词其实就是指向一种逻辑能力的 。
是 。
比如说你看完一个侦探小说 , 到最后你能预测这个杀人者是谁的话 ,其实它是有一个推理能力在里面的 。
我觉得这个事从理论计算机的角度上来讲 , 是一个比较 trivial 的结论 。 换句话说 , 所谓的大家不管是用原来的 RNN 还是用 Transformer 的 sequence-to-sequence 的模型 , 你一个 sequence 进来 , 一个 sequence 出去 , 就是它的理论极限在哪里 ,是没有上限的 。
任何的可计算的函数理论上都可以这么建模 , 你就是一个图灵机 , 你读了 input, 然后你中间计算 , 最后你出来了一个结果 。
所以理论上这个架构是可以模拟任何运算的 。
就是序列到序列可以模拟任何计算 。
对 ,因为本质上所有的程序都是一个东西作为输入进来 , 一个东西作为输出出去 。
这个东西的难点是不是在于说你把真实的物理世界的各种信息怎么映射成一个序列是很难的 ?
不一定 。
因为这是什么呢 ?
现在大家逐渐在做的技术的演化就是尽可能的直接把原始的信号放进来 。 我在做多模态 , 我怎么来解决多模态 ?
就是原来大家你会发现 17 年或 17 年以前在做 AI 的人, 你去看做语音的人, 做 NLP 的人, 做图像的人 ,是完全用的不同的 skill, 都是自己发展出来的一套怎么去抽取 feature, 怎么去做信号的处理 , 然后怎么去做后续的一些 prediction。
然后逐渐发展到这两年, 你会发现大家用到的 skill 是很公共的 ,而且是越来越更大程度的利用计算 , 更少的利用 domain knowledge 来做这个事 。
明白 。
其实最典型的是这几年特斯拉在做自动驾驶 , 用了一个巨大的 Transformer 去预测各种信号 , 就是我把我不同的什么 LiDAR 的信号也好啊 , 摄像头的这个信号 , 所有的这些什么传感器的信号都放进来 , 你让模型自己去交互 , 最后出来一个你不就是想要 prediction 准确的 , 比如 predict object 的位置啊这些信息吗 ?
我全部给你转化成一个 sequence-to-sequence 的问题 。
那这个序列会特别长是吗 ?
它有可能会特别长 , 尤其是原来其实大家不太好解决的一些问题 , 比如说 Transformer 这个事最早在语音上面可能很难用 ,因为文本说 500 字 、1000 字 、1000 个 token, 你觉得这个长度好歹还是以千为单位的 , 对吧 ?
但是你如果把它换成比如说 pixel, 一张 1000×1000 的图 , 你随便现在手机一照可能都不止这个像素 ,但是如果你把它拉成一个 pixelize 的 , 它就是上百万 。
你处理上百万长度的序列 , 似乎就不能简单的用 Transformer 的 unbounded 这样的一些算法 , 那就是完全效率上不可接受 。
但现在大家也 design 了一些非常简单的方法 , 我比如说切片 , 就是这么简单粗暴 。 我一个 pixel 一个 pixel 去算可能觉得很难 ,但是我把 32×32, 相当于是我把 1000 个 pixel 当做一个大的 pixel 放到 Transformer 里面 , 然后我原来长度为 100 万的这个串 , 瞬间就变成长度为 1000 的串了 。
好了 , 那我现在就可以用到标准的 Transformer 的这种 unbounded 的这个结构去算后续的这个操作 。其实所谓的最近几年影响力非常大的什么 Vision Transformer 就是这么干的 , 这种 idea 就是我说的 , 它把整个实验全部做完 , 证明它的有效性 , 这是有价值 ,但是你不会认为这个东西是一个天才想到的事 。
嗯 。
对 , 这本质上是一个工程师把这个事给想到了以后, 实验完成 , 发现嗯确实有效 , 你不会认为哇这个人很牛解决了一个 , 虽然他可能那篇文章已经有 1 万引用了 ,1 万的 citation 了 。
所以我觉得包括后面的有些改进 ,其实在我们看来都是属于这个范畴 。
我想知道在你最近看过的论文里面有什么你真的觉得是天才的想法的吗 ?
它是这样的 , 实际上很多有天才想法的东西啊 , 恰恰是在媒体的关注最少的 ,因为很多这种东西它的应用可能是有距离的 。
比如好像就是两年前在做什么网络流 , 最大流的这种就是传统上可能 30 到 40 年间大家都认为这样的算法没有 n 方 n 三方是解决不了的 ,他们能够在一个准先行的时间幅度上把这种问题给解决掉 。
传统上这种问题其实都在业内研究了超过四五十年的时间 , 这种四五十年大家认为是比如说 n 方 n 三方的算法 , 突然有个人跑过来说哎这个事先行幅度能解决 ,他可能花了 50 页的论证证明他真的能解决掉 。
这种就是我说的是一些天才级的想法 , 你看完了以后你觉得真的非常强 ,而且我觉得很多这种级别的想法它的理解成本是很高的 。
这个就是我为啥刚才比如像 Vision Transformer 我说这个东西我一句话可以给你讲清楚 , 它到底是用了一个什么样的 idea, 对吧 ?
这是把 1000 个 pixel 粘在一起 , 都是一个大的 pixel, 后续的计算都是一样 , 这个东西是可以一句话讲清楚的 。
但是像刚才我说的那种论文 , 我原来在复旦的时候有一些算法的讨论 , 一些绝妙的想法 , 它的讨论的成本是怎么样的呢 ?
我们需要有一个讨论班 ,在理解它的这个 idea 之前 , 你大概需要有 20 节课的一个 lecture notes, 就是你把这整个一个学期准备的知识先学完 , 到最后一课的时候你也是可以开始去理解它的那个想法 。
大概其实是这么样的一个你要对这个问题理解的难度 , 你才能走到那一步 。
最后理解的一课是什么感觉的 ? 会觉得其实它也是有非常精简的或者简单的一面 。
你仍然会觉得很多技巧是很强的 ,但是这个强就建立在其实你哪怕是前面的所有工具你都准备完了 , 你在最后的那一步你觉得它也是一个 non-trivial 的过程 。
所以包括大家之前吵张益棠 , 我觉得类似 , 大家只能去吵他的传奇经历 ,但是你说真正有几个人去看过他的论文 , 对吧 ?
看完了以后说这个论文的想法真的是很好的 。
对 , 我觉得这个也不能叫吵吧 , 我觉得这个确实是普通人他能有共情能理解的部分 。
是的 。
你要是解释这个论文的话 , 首先能解释的人很少 , 然后像你说的能看懂的人也是非常少的 。
是 。 对 。
他本人的经历对很多人还是非常有激励和启发的 。
对 ,而且它恰恰具有故事性 , 所以是非常好 。 但是就换句话说 , 如果另外一个很强的人不具备故事性 , 那可能大家对他完全没有了解 , 哪怕他在一些重要的问题上做出了重大突破 。其实我是这个意思 , 像张益棠这种人非常难得 , 非常强 ,但可能也有一些很强的人大家对他一无所知 。
嗯 , 从你中学开始做一些算法的竞赛开始算 , 到现在研究 NLP 应该是有很多年, 差不多有 20 年左右 , 对吧 ?
那你怎么看 NLP 的突破 ? 其实它是来自本来研究计算机视觉的一些人, 比如说像 Ilya 他们 , 可能最开始的成果是在 imaginize 这些领域的 。
嗯 , 这个恰恰就是我说的 , 恰恰在最近这 10 年深度学习的发展 ,其实是把这些门槛给它模糊掉了 。Transformer 原来也不是在解决 , 它是在解决文本的问题 ,其实就是拿翻译作为核心它想解决的任务 。
这个 motivating 的一个 example 来设计的这个 Transformer 这个架构 , 那后来这个架构现在不管是被用到图像 , 被用到音频 、 视频的处理 ,其实我觉得是一个大一层的这么一个过程 。
它不太像是说一群做视觉的人来把这个事给怎么样了 , 它在做视觉的时候设计的这套架构对于当年做视觉的人来讲也是个新东西 ,也闻所未闻 ,也觉得这些东西不应该 work。
所以其实当年什么 Hinton 啊这些都是做了很多年的冷板凳了 , 就是你做这个是什么东西啊 。
所以你说其实是整个深度学习的这个范式 , 对更早之前里面有专家系统这种范式的一种革新 。
是 ,而且零几年的时候我在微软亚洲研究院那边 , 当时机器学习大家研究很多核心还是在图模型 , 就所谓 graphic model 的这个上面 。
我觉得包括深度学习 , 直到可能一两年前还是有不少的真正偏理论的一些学者对它其实是有比较大的质疑的态度 ,也可以理解它的可解释性 , 比起上几代的技术确实显著的要长 。
所以现在这个也是大家实际的一个 concern 嘛 , 只不过我觉得原来的这个 concern 在于你不可解释 ,而且我也不认为你 work 得有多好 。
现在是属于你不太可解释 ,而且你竟然 work 得非常好 , 那么你就有更高的监管 。
对 , 就是你的危害性可能更大 。
没错 , 对 。
因为你变得更强大了 。
是 ,而且你强大的都超出我原来对你的预期的上限了 。
对 , 我觉得昨天 Altman 去参加听证会嘛 ,他说的有一点挺对的 ,他说如果 GPT 这个技术它会犯错的话 , 它就会犯一个很大的错 , 就会带来比较严重的后果 。
因为它的实际性的能力越来越强 ,是这个问题 。
应用驱动27:23
嗯 , 那回到你们在做的这个具体的事 , 你刚才也提到说密塔是非常应用驱动的 。
不得不应用驱动 , 我觉得不得不应用驱动 。 你要么能讲一个很大的故事 , 会有很多钱 , 要么你就先把你现在手头能够有的用户 、 消费者 、 付给你钱的人照顾好 。
我觉得这本质上无非就是这个逻辑嘛 。 我们觉得第一点我们不擅长 , 做不到 , 所以我们就去做第二点 。
我看了一下你们产品的时间线 ,因为你们 18 年成立 , 然后 2019 年是有做一个翻译的产品 , 就是用在法律领域的 , 然后后面你们有做一个写作猫最开始是纠错的功能 , 它是类似于 Grammarly 改语法的那个应用 。
再后来是去年 11 月的时候 , 你们写作猫升级里面有了生成的功能 , 它是类似于 Jasper 那种 。
是 。
对吧 ? 然后今年 2 月是又有了对话的功能 ,也就是类似 ChatGPT 这种 。 你可以讲讲就是你们自己的产品在更新的这个过程中间 , 实际上它用了哪些技术吗 ?
因为你也说到是什么好用就用什么 , 它大概是一个什么样的技术组合在支持这些东西 。
像我说的什么好用用什么 。 所以在这里面它不一定是说一个大模型解决所有问题 , 尤其是比如说 19 年、20 年是落地的这个时候 , 更是会考虑说它的这个成本怎么样 , 如果有大量的用户在线 , 我的现有的运算力是不是能跟得上 。
对 ,其实我想讨论的就是说这个大模型到底在这个组合里面它占多少角色 ,因为你们已经做了其实很多年了嘛 。
那现在很多人新来做这件事情 ,他可能会高估他的哪些能力呢 ?
我觉得他们就看谁了 。 我觉得有些人对他认知可能是极其不清楚 ,有一些是属于脑子一热一定要 all in 的 ,有些是可能算过成本不 work,但是我股价能涨我也无所谓 , 反正我这个东西我先吹了再说呗 。
对 , 我觉得是不同的人可能对这事的理解是完全不一样的 。 因为我好像就前一段我看那个是谁对 360 有一个采访嘛 ,360 在 Anthropic 说做这个东西 , 然后在内部有一定的进展了以后 ,他们就问成本问题 。
我看他好像是在那个电话会上算过一把 ,200 字的一个生成大概是 4 分钱 , 这个是平均他那个答案的一个长度 。
那么如果把这个费用 scale 到他现在对 360 的每一个搜索的 query 去用 GPT 的技术来生成 ,他们每天的成本好像是 4000 万 , 然后一年算下来大概是 100 多亿的成本 , 然后 360 一年在广告上的收入大概是 80 亿左右 。
就但凡你有小学数学的逻辑 , 你就知道这时候他直接把它 scale 到 search 上, 至少在当前的这个成本时间阶段其实是不 work 的 , 你这账完全算不过来嘛 。
嗯 , 除非你有新的商业模式 。
是 , 所以本质上我觉得像 Jasper 在这块领域做的一个很大的贡献在于我在找一个切入的点 , 这个切入点是机器虽然贵 ,但是人更贵 。其实包括我在 19 年为什么去做这个法律翻译 , 我们找的逻辑是一样的 , 机器虽然要用 GPU,但是人的成本比你这个机器可是高了三个数量级还不止 。
就是人翻译我们看到在好的一些这个律所里面 ,他们自己的人工翻译收一个字的费用是要超过一块钱的 , 现在 GPT 再贵你还没贵到那个程度 。
所以我看他们好像有人在分析这个事 , 就本质上工作有些是大家 value 这个高价值 ,有些是相对低价值 。
高价值这块工作 , 那本质上你对所谓的算力去换人力这件事 , 你有一个非常高的容忍度 ,因为人的费用已经极其昂贵了 。
你哪怕能愿意出钱 ,有的时候你都雇不了这么专业的这个人来帮你去解决问题 , 对吧 ? 一个资深律师可能跟你聊一小时收你 5000 块钱 ,是这个费用 。
这个时候每个月收你几十美金 , 哪怕收你几百美金的机器的钱 , 可能对你来讲都觉得相对之下是非常容易接受的 。
对 ,但是为啥我们去做这个法律翻译的这个时候 , 我们没有去做这个新闻翻译 , 我们认为新闻翻译我们可以比谷歌做得好 ,但是收不上来钱 , 对吧 ?
谁会愿意为了一个翻译的更好一些的新闻来付给我们钱呢 ? 这个问题我们解决不了 。 你就看一看 , 大概觉得看懂这个意思不就行了吗 ?
对吧 ? 我翻译的比这个 Google 更有文采一点 , 难道你愿意一个月掏 50 块钱来给我 , 哪怕就是 50 块钱 , 对吧 ?
来订阅 。
你们后面做的这个写作猫 , 你们的目标人群是什么 ?
我们的目标当然是希望是但凡是能够在电脑上比较高频写作的人, 都能够在这个上面找到价值 。
因为我们觉得本质上他在做的就像是有一个能够辅助你写字的人一直坐在你旁边一样嘛 。 所以不论我们后面在做生成 , 最开始之前我们在做的比如说检查 , 就是指出你在写的内容里面的各种潜在的这个问题 ,并且给你提供修改的一些意见 , 对吧 ?
包括我们在做的时候还专门去优化一些 , 比如说不光是告诉你你应该把 A 改成 B, 还告诉你为什么 , 就是你到底是错在哪了 , 对吧 ?
就像是你雇了一个专业的老师坐在你旁边 , 对你的每一行都不厌其烦的帮你去检查 , 实时的给你反馈这个结果 。
我觉得就现在大家定位比如 ChatGPT 是一个 personal assistant 嘛 , 就有点类似于这个 , 只不过我们是在一个 domain 上去实现这个效果 。
因为法律是个很明确的领域 ,而且你刚才算这个成本也是非常明确的一个替代人的成本 。 那你们现在做写作猫它的成本 , 或者说它付费的需求好像没有那么明确 。
还是看你抓住哪群人啊 。 就我们说如果你一个月就写 500 字的人, 那可能确实你就是我们免费的版本的用户 , 你就拿来我们也会给你一些检查的一个意见 , 对吧 ?
对你有一定的帮助 ,但是可能不太重要 。 但如果你是一个比较重度的去写字的人, 那么确实这个可能能帮你节约很显著的时间 , 包括各种什么龙媒体啊 , 包括很多这个公务员 , 这个其实也是我们的用户 。他会发觉这个实质上能够帮他去降低写文章的错误率 , 帮他去找到一些他其实肉眼他可能看了三遍 ,他花了时间但是他还是找不出来的一些问题 。
你方便透露一下密塔翻译还有写作猫它大概的一个用户情况 , 包括付费的比例吗 ?
首先翻译这事不太一样 , 翻译的其实都是付费 , 就相当于我们是卖 B 端的一个产品 , 它其实不太是一个 C 端的 。
就你们不是针对个人律师这样去推的 , 你们是针对律所或者律师的工作室去推的 。
或者合伙人团队 ,因为这事其实跟律师的职业方式也不关嘛 , 就是它本身就是 。
合伙人带一些人做 。
对 , 很多就是合伙人的这个方式 。其次是说你推也没用 ,其实中国能够接到涉外的业务的律师也就那么多 , 那是一个数得出来的搒单 。
所以就是超出这个群体以外 ,其他用户本质上也不存在付费的可能 。
那在这个小群体里面 , 密塔现在的 。
我们渗透了百分之几十吧 , 应该 30 到 50 的这个比例 。
他们使用频次高吗 ?
这个就是很有意思的问题 。 它的问题在哪呢 ? 它的问题是跟全球大环境息息相关 , 律师绝不会没事打开这个产品来玩 。他的使用百分之百是因为他接到了一个涉外的业务的案子 , 所以非常取决于他在职业的过程中到底有多少相关的案子 。
比如说去年, 那就是一个显著降低的情况 ,不管是涉及到国外海外的业务的收并购啊什么都大量减少 。
所以它就一定是有受影响的 。 至少从去年来看 , 我们看到比起再前一年的话是有明显的一个降低的 。
就是 22 年是比较明显的走向低谷的状态 。
对 ,是的 。
不过这个产品的问题就是它可能天花板是非常有限的 。
对 , 所有的我觉得很多这种问题和它的优势都是一件事 , 对吧 ? 它的天花板很有限 , 所以你其实也很难预期再来一个人花很大的精力去投入把这个事给干好 。
就是你的竞争环境会好一点 。
对 , 就所以我们在做这个事 , 从 19 年开始去卖到很多家律所 , 你会发现基本上这些律所 , 比如公司的法务 ,他要么说我们用免费产品 ,他如果但凡是想要更高质量用付费的 ,其实也没啥别的选择 。
你们有把这个卖给国外的律师吗 ? 国外和中国有业务的 。
有 , 包括英国所 、 美国所的很多所其实都是我们的客户 。
你直接去卖到他们总部的 。
他好多是这样的 , 比如说他们亚太区的办公室 , 当然这是另外一个问题了 ,也会受这个贸易战的影响 。
从贸易战以来 ,其实包括像美国那边对中国的软件的 IT 审查其实会非常严 。 我们进到有些美国律所的时间是以年为单位来计的 。
就在之前会更容易一些 。
之前会容易一些 。
你新进去的会因为这个原因重新来考核定位吗 ?
可能还好一些 ,但是但凡你要新去跟有些监理联系 , 你就知道他在刁难 ,他也知道他在刁难 。
那到写作猫这个产品的话 , 付费的比例大概是多少 ?
2 个点到 5 个点之间吧 , 这样一个比例 。
这是超出你们的预期还是低于你们的预期了 ?
在目前的这个情况下, 我们认为是一个合理的数字 ,并且我们没有太激进的想要快速把这个数字做高 。
这个其实我们从上线以来对这个事的一个态度 , 你无非是在平衡很多的不同的质量嘛 。 比如说我们允许大量的用户 , 只有每天给了他 8000 字的一个免费检查的额度 , 那就是在容忍那些相对比较低频使用的用户能够持续的免费的使用你的产品 。
如果你想要拉高付费率 , 那很简单 , 你把这部分用户的权益全部干到 0, 中间有一部分转化 ,有一部分不转化的你就说那就再见吧 。
所以我们觉得就是这里面单纯优化一个数字 , 可能都是有很激进的方法可以做到 。
是 ,其实我也想问总数嘛 , 我只是觉得你可能不方便说 。
总数还好 , 我们现在差不多注册用户的话超过 700 万 。
密塔写作猫的总用户数是 700 万 ,是所有的都算上是吗 ? 把纠错的就是你们每个 。
因为其实我们是一个产品 , 所以我们是没有办法整体统计的 。
你们有去统计说在你们上新的大升级之后带来的新用户的情况吗 ? 我理解第一次比较大的升级就是去年, 你们把它变成生成式的 , 然后最近一次大升级是今年, 就是它有加了对话的功能 。
你说带来的新增量的用户吗 ? 我们看到的确实现在很多新增的用户里面有百分之几十是把我们用到的这个生成式功能的至少免费这个资质给用光了 。
大家只有从体验的这个角度来讲 , 还是有充分的动力去玩 、 去做这个交互 ,因为其实对于很多用户来讲 , 这还是一个新的交互的一个模式 。
商业模式36:16
有一种观点认为说在中国做 2C 订阅非常难 ,因为没有这个付费习惯 。 我不知道你自己是怎么看这个问题的 。
对 , 我觉得这个是看人和谁比嘛 。 你和海外的一些用户的付费习惯接下来比 , 你可能觉得中国的这个是更难的 。
我觉得这个不是和海外比 , 还是和说能不能让你这个公司生存下去 , 就你能让这个产品真的它的收益是能赚起来的 。
对 , 我觉得是这样的 。 我觉得它比海外是更难的 , 这个是直接看得到的一个现状 , 且单个客户能够给你带来的收入可能比起海外来讲也有一个比较明显的差异 。
包括为啥 Jasper 能这么快速的干到一美金 ARR 级别 , 它在中国它干得再好 , 我相信它可能也很难快速做到这么一个级别的订阅 。
那几乎国内做到一亿美金订阅级别的产品能够数得出来几个 , 对吧 ? 就是你可能得把什么腾讯这种订阅去掉 , 再往下看可能找不出来几家能做到这个级别 , 至少是差了一个汇率 。
你可能做到一亿人民币相对来讲可能机会还更多一些 , 做到一亿美金以上的这个 ARR 其实是有挑战的 。 但换句话说 , 你在中国做哪怕 To B 的订阅也不容易 。
所以其实本质上我觉得就是你看怎么比 。
对 , 包括你们最开始的产品是更偏 To B 或者说是 To 专业人士的 , 然后后面的这些产品是更 To C 的 。
就这个转变是基于你看到了什么变化 , 或者你们公司战略的什么变化 ?
第一款产品我觉得我们在做的时候就已经对它有个预判是说这个事天花板肯定是在那的 ,因为就是一个这么大的使用的这个群体 ,而且这是我说的另外那个逻辑嘛 。
它不会因为你做得特别好而疯狂的用它 。 这是我的一个工作场景相关的一个事 。 我把我的这个 case 做完 , 那就做完了 。
那我不可能由于用了你这个东西我突然能接到三倍的订单量 , 那是不可能的 。
对 , 就你是给它提升效率 ,并不是帮它赚钱的 。
对 ,是的 。 所以对这个事我们其实有充分理解 。 所以当这个事做完了以后, 我觉得我们对这个事的一个理解是说 , 我们还是在看哪些的就是我们所谓的场景 ,是我们认为 AI 能解决好 , 且在我们看的那个当下没有人把它解决好的 。
整个活动其实是这么一个视角 。
顺着这个视角 , 你也可以做一些别的更专业的场景 , 这是一种选择 。 然后另外你可能是去做一些非常不一样的 To C 应用 。
不过实际上我看这个写作猫 , 它不管是对话还是生成还是纠错 ,其实都是有一些其他产品的 。 所以你们为什么是这样一个选择 ?
B 端的我觉得这里面当然这是我们个人, 尤其是创始人的这个事有偏好也好 ,有一些对这块领域的一个看法 。
我觉得中国 B 端其实可能会分成两类 。 我们做的翻译这个呢 ,其实是走的一个相对比较轻 B 端的一个路线 。
它本质上是提供了一个相对清晰价值的这个产品 , 拿着一套产品来卖 B 端 。
标准化的产品 。
对 , 它的区别唯一就是可能你的商务成本比你卖 C 端可能会高一些 ,但是大量我觉得在国内所谓谈 B 端销售的时候 ,其实是在卖定制化服务 。
而且中国的很多 B 端人家有强烈的去把一个标准产品干成定制化的欲望 。
你是说客户有这欲望 ?
是 , 哪怕没有必要我也要 , 对吧 ? 我一定得给你提点啥 。 就是我们看有些说打扮要改稿子 , 对吧 ?
改了半天最后回到了原点 , 那没关系 , 我要的是一个过程 , 你得给我改到第十稿 , 然后我返回第一稿 , 那是我的选择 。
但是你交给我第一稿 , 你说不能改 , 就是它 , 那我不满意 。 大概是这么一个逻辑 。 所以其实我会发现这个事它的难度在于 , 如果去做那种非常重的商业模式 , 它会稀释掉你的 , 比如说我们的很强的这个竞争力在于确实是把这个产品 、 把这个 AI、 把这个效果 、 把这个模型做好 。
但是一旦你的其他链条上的这个权重占比过重了以后, 就是这个部分 , 它就变成一个附带的事了 , 对吧 ?
就是有做好一点当然好 。
就是技术只是你这个长链条中间的一环 。
没错 , 当然还是受制于我们自己对这个事的视野和判断和偏好 。
对 , 所以这条路你们是不选的 。
我觉得也是能力问题 , 对吧 ? 就换句话说 , 我们说有些大 B 端本质上如果你跟他谈完 ,他说行 , 我这有个 3 个亿的项目 , 我说好 , 可以做 。
但是实际上你在中国你会发现很多时候就是你跟他谈了半年, 最后谈出来一个 20 万的一个项目 , 就这个事它 work 不了 。
一年你能同时谈多少个呢 ? 你能谈 100 个 B 端 , 最后能转换成销售收入的有多少 ?
那为什么不去一些别的领域去复制这种轻量化的 B 端的标准产品 ?
比如说 。
比如说 , 所以你是因为没有想到是吗 ? 你觉得没有找到特别合适的 。
而且我会觉得是这样的 , 如果你有一个比如说一年能够给你带来 100 万收入的一个事 , 你再去找两个带来 100 万收入的事 , 它的意义其实就比较有限了 。
我们当然肯定是希望在找到的下一个这个机会点 , 它至少是能够在原有的那个机会上 scale 上一个 0。
它能 scale 两个 0 当然是最好的 。
所以你们现在选的对话机器人, 包括生成文案 , 你觉得是个特别大的市场 , 虽然竞争者也很多 。
那就来到下一个问题 , 那你们的差异化是什么 ?
这个就像之前广为流传的一篇文章 , 对吧 ?Google 没有壁垒 ,OpenAI 也没有 。 我觉得其实尤其是在现在这个时间节点 , 我们越来越不愿意去谈这种问题 。
我觉得这个叫做走着瞧 。 我觉得很多的所谓大家对一些东西理解的差异 ,不太简单的能够用一两个词 、 一两个句子去做这个概括 。
抽象来看就是你在很多东西上你确实得做得比别人要更好 ,不管是从你的这个技术层面 , 还是从你对交互的理解层面 , 你得做到更好 , 你得做到对用户的理解可能会更深入等等。
然后在这个过程当中发现到底哪些东西可能是值得优化的 。 我觉得这是一个非常动态去判断的一件事 。
明白 , 可能本来这个东西一开始就是没有壁垒 , 你可能得做着做着你才会有壁垒 , 或者才会有不一样的东西 。
对 ,而且这个过程当中, 我觉得这个也是很多用户对于很多事判断的一个残酷性 , 对吧 ? 他可能用完 GPT-4 的 ,他说你没有 GPT-4 好 。
当然背后的成本是有很大的差异的 ,但是他不 care 这一点 。 所以我觉得无非是你在一个最通用的 、 最全面战略的这个场景上, 跟实际上可能既有能力又有资源的这帮人去打 , 可能是有挑战的 。
但是你能不能在这个过程当中你发现其实有些边缘阵地你可以先开始去占掉 , 那人家现在不关注这个场景 。
就是我说好的为啥对有些事你干到一亿人民币一年, 对巨头来讲可能还不重要 ,因为这是他收入的 0.1% 以内 ,他要想的下一个 milestone 一定不是我增加 0.1% 收入的增长这个场景 。
那这种场景我觉得还是有机会 。 对于一个创业公司来讲 , 你可以全力投入把它给做好 , 你先把这一个亿拿到再说 , 对吧 ?
对于巨头来讲 ,他未必花费他最大的最主力的这个兵力去在这个上面跟你去 PK 这件事 。
你们现在看到的场景就是帮写作者去更好的写作是吗 ?
而且我们会觉得实际上你要把它细分了 , 那不同的写作场景 、 不同的人群 , 对这个事的需求理解也是完全不一样的 。
所以其实中间还是有大量的 , 哪怕是再分之一截的这个场景是还没有被解决好 ,是可以被解决得更好的 。
可以举具体的例子吗 ?
就像不同的人的写作需求完全不一样 , 公务员的写作需求和你做电商的文案的一些写作需求 , 那其实本质上我觉得是两个完全不同的场景 。
它背后不是一个大模型来解决的 , 它可能要配合其他的一些这个知识图谱啊等等这些逻辑 。
因为 Jasper 最开始他比较主打的是营销文案的撰写 。
是的 。
而且他和欧美习惯用邮件去营销的这个体系是相关联的 。
一个是邮件 , 一个是 Google 的 SEO, 那个应该是占了 Jasper 很大的一个场景 。 所以他其实是把另外一家第三方的叫 Surfer 的 SEO 呢 ,是直接集成到他的产品里面 , 就相当于提供了一个一站式的服务 。
然后密塔写作猫现在看起来还是就没有那么收束的 , 它写作的范围很广 。 就你们接下来可能会怎么去发展和设计这个产品 ?
我觉得还是走着瞧 。
走着瞧 , 你是想好了 ,但是觉得现在不方便说是吗 ?
我觉得这里面我们会对它有一个或几个的往下去做进一步探索的方向 。 第一个是说我们需要去做落地 , 需要去看我们提供了什么东西 , 用户给予什么样的一个反馈 。
另外一个就像你提到的 , 这个事本质上呢也是在一个竞争性的这个场景里面 , 我们也会考虑到我们现有的资源 , 对吧 ?
如果有一家就是非常有资源 ,在其中某个方向说我就是要 all in, 就要把这个方向打深 , 那我们是不是说我们就是要在这个方向上跟你死磕到底 ?
我们感觉也不必吧 , 大概是会这么一个判断 。 所以我觉得它是一个动态去调整的一个过程 。
你们接下来对商业模式是怎么想的 ? 现在主要是订阅 , 未来可能会有别的商业模式吗 ?
我们其实对于这块倒是一直比较开放一点 。 我们订阅只是因为订阅这个模式相对来讲是比较容易操作 , 比较容易形成规模化 。其实是不是有些人在问我们 , 比如说走一些更偏 、 更重的 、 更偏部署啊这个 , 我们觉得其实无非是你投入产出比这个事能不能算得过来 。
我觉得很多就包括刚才说中国的 To B 的这些挑战 , 我觉得你会发现大量有 VC 去做 Backup 的中国的一些创业公司 , 我会觉得最大的这个问题啊 , 就在它从 Day One 开始收入产出比其实就没算过来 , 从来都没有算过来过 。
这个是我们看到很多创业公司的一个问题 。 所以它需要不断的去拿资本去填 , 填到一个可能把收入做到可以上市的单量级 , 然后交给下一棒 , 对吧 ?
交给二级市场来买单 。 但是我觉得这两年可能这个事挑战会更大 ,因为本身资本市场的顾虑啊这些也会更多一些 。
所以你会看到很多很好的团队用精兵强将 , 花半年时间去干一些小几十万的项目的事 , 这个很容易在中国做成一个双输的局面 。
就是客户交了 50 万 ,他认为我付了很多钱 , 我是一个大客户 , 我就有资格对你指手画脚提各种意见 。
作为提供服务的公司这边 ,50 万根本不足以 cover 他的人力成本 , 可能还差了老远 。 但是他愿意花精力去支持这个客户 ,是因为他想拿这个客户的 logo, 然后为他在下一轮去讲一个更好的故事 。
相互伤害 , 就是我说的你拿 50 万你觉得你亏了 , 我交 50 万我觉得我交多了 。 就是本身这个事我觉得很大程度上中国很多 To B 干成了这个样子 。
你觉得 To C 还有什么商业模式吗 ? 除了订阅 。
我觉得首先订阅已经是很宏观的一个模式了嘛 ,其实要不就是你按次付费 , 对吧 ? 要不就是持续订阅的这个模式 。其实我觉得不在于它是不是订阅 , 或者是不是一次付费 ,是在于究竟哪些玩法上, 我说是你真正提供了价值 , 且可能又没有那么容易被一个新入局的人马上做到的 。其实我之前在跟我们同事说 , 这个非常像是战国时代嘛 , 就是很多应
战国时代45:56
用你会发现它现在的这个问题在哪呢 ? 但凡一个 junior 的开发者 , 新入局的一个开发者 , 甚至一个 part-time 的一个开发者 , 拿着 OpenAI 的 API,他花三天时间开发三天的一个东西 , 可能能直接跟你大厂原来做了很久的这个功能手 PK。他的尴尬的这个地方其实是在这个地方 。
然后所有的人现在都觉得我拿着这个东西 , 我可以做一个这个 A 这个东西 , 做一个 B 这个东西 。 而且我如果作为一个开发者 , 我的试错成本还很低 , 对吧 ?
大不了这事不成 , 我自己花几天时间开发这个东西 , 我网上一丢丢怎么样呢 , 对吧 ? 万一它有还不错的这个效果 , 甚至是说我看做了一个这个效果 , 这不就是套了一个 OpenAI 的 API 吗 ?
我自己也做一个 , 我觉得我还做的可能还会比他再好一点 。他现在不论是这个个人开发者和大厂之间 , 还是大厂和他两个之间 , 进入到一个所有人在 PK 所有人的状态 ,他的帮助率在哪 ?
我现在觉得还没到收敛的时候 , 且得打一针 。
所以也不到说我怎么收钱那么清楚的时候 。
对 ,因为它的问题在于啥呢 ? 我觉得你们应该是对过去这几个月的这个发展应该是从头跟踪到尾嘛 , 所以很熟嘛 。
所以你就会发现不管是这个里面的每一类的从业人员也好 , 投资人也好 , 一天一个样 。 为啥一天一个样 ?
因为这个世界一天一个样在变化 , 对吧 ? 前面 2 月份的时候说我一定要投大模型 , 那哐哐给你干出一堆开源了以后, 就很多投资人对这个事我觉得也是知难而退的一个态度 。
说既然现在已经有这么多的 open source, 那如果我去砸个几千万美金去支持一个团队 ,他如果还干不过 open source,他价值越等越零啊 , 对吧 ?
他烧这个钱烧不出来什么东西呢 ? 那还不像原来的这个计算方法说他干不到前三名 ,他干到第四名 ,他可能还能圈一个他自己的客户 base, 能够产生一定的价值 。
所以我觉得这个事情是一个很动态的 。 我觉得它现在其实不存在说我设计了一个绝妙的商业模式 , 然后不管刚才说的这个世界到底怎么 evolve, 我的这个一定行 。
我觉得它不存在这样一个模式 。
回到产品形态的话 , 就是现在很多人讲应用 ,他会去讲一个概念是 AI Native。
这个概念是我们在去年上线的时候我们就在讲的 , 然后这概念现在越来越多的人在讲了 。
那你可以讲讲你的版本的 AI Native 是什么 ?
我的版本的 AI Native 就是字面意思的 AI Native,因为我本质上觉得很多时候一个新的 , 尤其是技术上一个比较大的突破 , 无非就是伴随说你很有可能会对传统的这些 , 哪怕是用户的交互产生很大的一个变化 。
我觉得主要还是在交互 。
就是在交互上 。
对 , 我觉得还是在交互层面 。 为啥我觉得有些传统的厂商做的这个产品 , 它要做这个迁移 , 实际上面临这个挑战也是大的呢 ?
因为总归有很多人他在过去 10 年的时间已经非常适应了你的上一个版本的交互模式 , 然后这个时候你但凡去做转换 , 势必会得罪一群人。
我觉得这可能是很多就是只要是你一个长期产品 , 你不问是这个长期产品的迭代 , 你自认为可能做了一个很好的向上迭代 , 一定会有一群人对你不满意 。
但凡你改了交互 , 一定会有适应了老交互的人会吐槽你说我希望原来的版本 , 我不希望新的这个 , 我不适应 。
就像我说的 , 就现在还有人说我不用智能手机嘛 , 本质上就这回事 。
真的是小错人。
它是越来越变成一小错人。 比如说当你的智能手机也是在推出第一代 、 第二代还不够完善的时候 , 本质上很多软件产品迭代 , 你是强行把它原来的手机没收回来 , 塞给它一个新的一个东西 , 说对不起你只能用新的 , 它会不满意 , 对吧 ?
所以我觉得这个是大厂创新也会面临一个包袱的 。
我理解的 AI Native 是说有了新的 AI 技术之后才能做到的事 , 它以前是做不到的 。 比如说移动互联网相比 PC 互联网 , 它不一样的地方就是设备是可以移动的 , 它有位置信息 , 然后大家可以随时拍摄 , 这是以前做不到的 。
所以现在有什么以前做不到的东西吗 ? 以及基于这个它可能会有什么新的应用 。
我理解你说的这个 ,但我看到的恰恰对 AI 这个事啊 ,是另外一个层面 , 从来都没有一个从做不到到做得到的层级到一的转变 。
它只是做不好跟做得更好的区别 , 它其实是一个更灰度的一个 spectrum。 就像我说用上一代的这种做人脸识别 ,是不是做不到 ?
不是 , 只是做得比较痛苦 , 只是它的成本可能显著的是高 。 就是我们看到很多问题它其实变成这么一个东西 。
但我觉得多了对话 , 或者说让你体验非常好的多了对话 , 之前确实是做不到的 。
如果你把它限定到一个 domain, 你原来的这些专家系统什么的 ,其实本质上也在模拟多了对话的场景 。
明白 , 只是它的成本很高 , 然后会比较麻烦 。
对 , 它比如说你今天是模拟一个医生 , 我就给你看感冒 , 这件事多了对话 , 可能 20 年前我就能做到一个还比较不错的一个效果 。
但是我们也看到 IBM 的沃森系统它也是失败了 。
是 ,因为它试图解决一个更通用的一个问题 。 我觉得 IBM 这件事太综合 ,而且由于我自己也不是局内人, 我觉得是不太能够有很多这方面的 insight。
就我对这个事的一个猜测呢 ,其中有一个很重要的一个原因 , 我觉得医疗这件事 , 它是一个太强逼的一和见怪的事情 。
很多时候可能不是说我技术做得好不好 , 就像刚才我说 To B 的一样 , 如果你这个事价值占 10%, 你先得把前面 90% 你解决了 , 现在人家才能到我说我能不能搞定这个技术本身 。
而且它对错误是不能容忍的 ,因为你的后果会很严重 。其实自动驾驶也类似嘛 , 你说这个车能在路上跑 ,18 年的时候车就能在路上跑 , 没有司机开 ,但是你要 1000 万辆车都在路上跑 , 这还挺吓人的 。
是 , 所以我甚至会觉得医疗这件事 , 可能包括 IBM, 包括 Google 自己做好像也有一个什么 Google Health 那个也不太成功 。
DeepMind。
我觉得很大程度可能它的核心问题可能不在单个点的技术做不到上面 ,是有其他强监管啊等等的 。 因为我们跟你包括做医疗的一些创业者也有过一些沟通 , 医生有的时候 , 尤其是好的医生和医院的关系 ,其实本身没有那么强的依附关系 , 对吧 ?
我是一个著名的外科手术医生 , 如果你这个医院让我不爽了 , 那我去其他医院我可能照样能找到很好的机会 。
你要通过这些医生去搜集数据 ,他们其实还有各种各样的别的 concern, 甚至是比如说他们的晋升跟他们发表论文可能相关的 。
你要让我说我看了今天这个病人是一个特别离奇 、 特别古怪的数据 , 我就 input 到你的系统 , 至少得等我发表出来这个论文以后, 我可能才有动力把这个东西给放进去 。
前面那就是我 private data, 我为什么要 share 给你呢 , 对吧 ? 你跟你的同事科室之间可能是竞争关系 , 那我不想让你看到我的数据 。
有很多这种都不是你简单下一个行政命令说你必须把这个数据录入进去解决的问题 。
我感觉这已经到了社会工程的层面 。
没错 , 没错 , 这甚至对你一个系统 , 尤其你说我非常智能 , 请问你智能要干嘛呢 ? 要做决策 , 那现在做决策的人可是我 , 你要帮我做决策 , 对吧 ?
你在教我做事 。
对 , 你是想干嘛 ? 我录入完了以后, 对吧 , 过了几年你说我就不用干了 , 那我凭什么要配合你去干这件事呢 ?
所以我觉得这本质上是一个 conflict 的过程 , 这种我就觉得就非常难 。 不是你技术好 , 你说我帮你解决这个问题 。
自研模型52:16
你刚才说这个差异化是走不瞧 ,其实我有想到就说 Meta 可能跟一般做应用公司不太一样的一个点 , 就是你们自己是有在自研大模型嘛 。
你可以讲讲就是你们自研大模型是用什么方法做的 ? 比如现在有不同的 function 嘛 , 你可以从头去训练一个 , 然后你自己去大架构自己去收集数据 , 你也可以基于一个开源的去做微调或者做定制化 , 你也可以用 API 然后去做提示工程 。
所以你们是一个什么情况 ?
你刚才说到这三个 , 我觉得无非是什么呢 ? 它有不同的投入的情况是从大到小的 , 对吧 ? 但是你能够做到的可控性也是从大到小的 。
你越往这个源头做 , 你其实对它这个可控性其实越好的 。 你利用别人这个模型 , 那别人模型的从架构到数据到它 pre-trained 的一系列的这个 setup, 你是受它的限制 ,但是你也有一定的发挥空间 。
到最后的这个 prompt engineering 呢 , 就基本上你就完全依赖人家训练的这个能力了 。 它有这个能力 , 你能通过提示词把它展现出来 , 那就符合 , 没有拉倒 , 那就先不做这个功能 。
所以恰恰就像我们说找专业场景一样 , 我们当然是希望找到那些既有高价值的机会 。 现在你通过第三档做不到 , 通过第二档做效果不好 , 那你只能回归到可能要通过自研这个模型 , 从源头上设计数据 , 设计架构 , 把它给解决漂亮 , 再怎么样一些这个场景 。
但这个前提是说你首先得 identify 出来说这是一个重要的问题 , 对吧 ? 而不是说我花了很多钱 , 花了很多精力去解决了一个没有人关注的东西 。
我觉得就是你们是先选一个场景 , 这个场景是最好 , 它需要我去从头大模型来解决的场景吗 ? 还是说 。
我觉得倒过来来讲 , 这个逻辑就应该是说什么呢 ? 我们有这个去自主研发落地的这个能力 。
如果简单的通过比如说一些小的数据的 fine-tuning, 或者是一些 prompt engineering 就能解决的 ,在我们的自己的这个模型里面其实也能很快的去解决 。
那么我们为什么要不断的去做下一个版本的一些升级迭代 ? 后两个方案已经解决不了的这个问题 , 我们会把它 push 到在下一个大的版本升级迭代的时候 , 可能希望解决哪些新的问题 。
所以更直接的说 ,Meta 就是从头自己大架构收集数据 , 然后做一个模型 , 这种方式 。
对 ,因为对于某一些我们认为就是后面解决不了的问题 , 我们只能往回缩往前做 , 对 。
这是你们一开始就这样的 , 还是你们在推产品的过程中间到某一个阶段才开始做这件事的 ? 我指从头训练一个模型 。
我们其实一直是这么干的 。 第一个是说你要往回追溯 ,在之前也没有什么太多的开源的模型啊 , 这个供你选择 。
你说一直是这么干 ,是指 2018 年成立之后就有在着手做这件事情 。
对 ,因为本质上 18 年比如说我们去翻译 , 那就是从头训练 ,也没有谁开源出来一个比如说翻译模型说我已经 pre-trained 的不错了啊等等。
但是你们做的是一个相对小参数的什么 。
我们会认为这个参数就看你要解决啥问题 。
是 。
对 , 我觉得很多人是为了大把那个参数做得很大 , 大是一个成本 ,不是它的能力 , 对 。
所以你们最开始做这个事情 , 就是因为你选了法律翻译这个场景 , 你觉得有必要做这个事 , 然后就做了 。
也可以这么认为 , 或者换句话说 ,在这个之前 ,其实我之前带团队就做过翻译 , 所以我们知道这是一个它相对比较通用的这么一个架构 , 然后我们只是在这个翻译上面把它做了一个进一步的一个落地 。
至于在比如说纠错啊这些上面 , 我们其实是对这个架构还不断的做了调整和改进 。
你们自己模型的比较大的升级是什么时候啊 ?
我们其实一直在做 。
对 , 我是指比较大版本的升级啊 ,因为小的优化可能是一直在发生的 。
我们会在平均可能两三个月 , 三个月左右会迭代一个新的一个版本 , 去解决那些我们看得到一部分用户上一个版本没有被解决好的一些问题 。
你们现在翻译和写多猫背后是一个模型还是两个模型 ?
其实是不同的模型 , 对 。
翻译是翻译的模型 , 写多猫是 。
对 ,是的 ,是不同的模型 。
你可以讲讲当时第一个模型应该是翻译对吧 ? 然后后面是写多猫 。 这两个模型你们在做的时候大概投了多少资源吗 ?
这个也是另外一个我觉得不太好 。 我们其实在很长一段时间对于机器 GPU 这个投入是相当有限的 。
你们是自己买了一部分 , 还是你们主要是用的云厂商给你们提供了训练集群 ?
我们之前几乎是自己买的 ,而且几乎是自己买的非工业级的 。
消费级的 。
基本上是游戏显卡去做训练 。
你觉得这个之前指的是什么之前 ?
在去年年底之前 。
就是 ChatGPT 那前后之前 。
可能得到去年年中的这个时候 。 我们理解是啥呢 ? 就是在于偏写作这个场景 , 它是有必要上更大规模参数 ,但是解决一些其他更特定的这个问题 , 上太大参数本质上是个负担 , 这是个成本 。
所以在你们决定上更大参数之后, 你们是去用一些云服务公司给你们的算力对吧 ?
对 ,但都比较有限 ,因为很多时候我们跟人家说这个事 , 人家都表示不相信 。
你跟云厂商不用让他们相信啊 , 你给他付钱就行了 。
我是说那个我们告诉一些人家说我们到底用了多少的 GPU, 多少算力做出来的 。
他们是说你们算力太小了 。
是 , 太小了 , 就胡说八道了 。
那就没有人表示算力很小也能做出来觉得很厉害 , 想问问你们怎么做的吗 ?
因为这里面我觉得它本质上是一系列的工程问题 , 它没有办法做到告诉你一句话 , 你说这个这个绝妙的想法 , 原来你这么做能做到 , 我懂了 。
就是它不存在这样一个答案 , 它其实是无法被验证的一个问题 。 就换句话说 , 如果 ChatGPT 没出来 ,GPT-4 没出来 , 你拉着 OpenAI 的高管 , 你跟他随便聊 , 对吧 ?
他知无不言 ,他能够 convince 你他一定能把这事做出来 , 你不相信他 , 对吧 ?
嗯 。
你怎么不相信 ? 你是吹牛吧 , 什么 AGI, 吹了多少年了 , 你做了个啥呀 ?
在你们决定要上更大参数的时候 , 你们有去融资吗 ?
没有 ,因为本质上我们需要的那个成本是小的 ,是足够在我们自己的营收里面去 cover 的 。 那就是实际上 GPU 而言是这个级别的投入 , 所以我们不可能说我要去融一轮资 ,是因为我需要租十几块 GPU。
所以你们之前自己买的还没有到十几块 GPU 这个量级 。
我们自己买的其实不止 , 我们买了几十块 ,但很多消费级的嘛 ,其实单张卡其实不超过 2 万块钱 , 所以就也是一个非常 manageable 的成本价 。
你们去年去租 GPU 的时候是在几月份 ?
去年年中的时候吧 。
6、7 月份 。 那个时候中国云厂商的 GPU 的价格是个什么情况 ?
单个 A100 的话应该是在一个月 1 万块钱以内 ,其实现在最便宜的厂商也拿得到这个价 , 就是单块卡一个月 。
一个月 1 万块 。 但现在的问题是你租不到吧 ? 如果你新下单的话是租不到的 。
对 , 我觉得现在问题还是这个 , 就是被一帮冲进来的各种 , 尤其是有些土豪 , 就是又土又豪 , 对吧 ?
我先拿一千张再说 ,但以我们现在需要的这个算力单量 , 我觉得哪里都可以解决 。 我不是要 1 万张 , 我要 1 万张这个事可能现在在全中国可能很难弄 ,但是我说我要 50 张 , 这还是有各种渠道 , 对吧 ?
怎么着都给你匀一点 , 这个事都给你匀出来 。
你们现在使用算力的方案变了吗 ? 是还是在用云厂商的 , 还是你们接下来想自己采购一些 ?
我们会认为现阶段采购其实并不划算 ,因为其实单张现在已经干到 10 万的这个级别了 。
就是你们去年买的云厂商的是够用的是吗 ?
我们现在还是可以 skill, 比如说再稍微多拿 , 就是我觉得是在 100 张级别以内 , 现在你要在中国找 , 比如说 A100 你都不好找 , 你找 A800 还是很好找的 , 还是找得到 。
就是能租到 。
对 , 就这个级别其实是能搞定的 。
这个要靠什么租到的 ? 因为我听说是很难租到的 。 就是你之前已经买的 , 它可能会让你继续用 ,但是再往下的话 ,因为这些大厂云厂商自己它内部也得用这些算力 。
其实我觉得还好 , 就是你匀得出来 ,而且会有很多供应商会主动联系你 ,他因为知道你是在干这块的 。
你说云的供应商 。
对 ,是的 。 所以基本上头部的那些不管是什么腾讯云 、 什么火山啥的 , 就是都是在主动去说这个他们能够提供 。
你们现在用的是火山还是腾讯的 ?
其实都不是 , 我们都会用一点 。 阿里的我们租过 , 然后金山的我们也租过 。
但是你们现在既不是阿里也不是金山 。
我们也有第三方更小的一些提供商 , 那就是 UCloud 这种类似的企业什么的 , 甚至可能你更没有听过名字的 。
对 。
什么 EasyStep 这种 ,但他们好像不太做这个 。
反正各地我们都会有一点 ,其实还好 。 对 , 就是以我们想要的这个算力的单量级 , 我们认为不会成为一个瓶颈 。
我觉得你现在成为瓶颈 , 你基本上是想拿四位数的这个级别 , 可能会比较麻烦 。 而且你这个要求往往是说你不光是要拿四位数的卡 , 你是需要它的机房有 , 比如说 IB 的网络 , 把它做相互互联啊等等一系列的这个 ,其实对原来设计的这个机房有很大的挑战 。
因为其实我们自己买的那个机器去托管 , 我们就知道大量的中国的云厂商的机房是按十年以前的逻辑去设计的 , 这就导致哪怕是我们买这种游戏卡 , 我一个机器四个 U 嘛 ,他们基本上一个机柜可能是按 32 个 U 至少 ,minimum 32 个 U, 都好像有到 40 个 U 级别的 。
我占了它空间的十分之一 ,但是我会把它整个机柜的电全部放满 。 这是一个从机房设计来讲就是极其不合理的设计 , 甚至新版的 H 的卡对于很多云 IDC 机房的挑战在于我一台进去 , 它一个机柜的电还不够 , 它需要特殊设置才可能能解决电的这个问题 。
所以其实是从头到尾这个基建都是有问题的 ,并且政府还主导了很多当年各地的超算中心 , 然后现在问下来基本上也是都不 work。
市面上有很多人要算力 ,有很多的地方政府组织构建的算力超算中心平台全是闲置的 , 用不起来 。
它这个基础设施要更新了之后是不是就可以用起来了 ?
对 。
不用重建来导致这个 。
我不是这方面专家 ,但看起来就是我觉得需要动的基建是巨大的 。 这个我觉得是为啥 GPT-4 不是号称就是 OpenAI 相当于是清楚自己的需求了以后, 找到比如说微软对吧 ,Azure、Cloud 上面对这个事最懂的专家 , 说我们从头去打造一个超算出来 , 我清楚我的需求 , 真正有落地去设计这个的能力 , 对吧 ?
那边还有金主有钱 , 那我们这 10 亿美金砸进去 , 把这个事给搞定 。 我觉得中国有很多政府主导的这种超算中心是完全脱节的 , 完全不清楚市场到底需求在哪 , 先造了再说 , 造了以后发现一进去一看说这东西用不了 。
开源生态1:01:28
你刚才也提到了开源模型 , 然后你说你们最开始自己做模型的时候 , 那个时候也没有很多开源的可供你选择 , 那现在其实市场上有非常多开源的大模型也出现了 , 这个会对你们有什么影响 ?
我们首先觉得是这样 , 这个市场上其实并没有那么多的大的开源模型 , 之所以现在大家看上去这个场非常热闹 ,其实是里面有一大堆 fine-tune 模型 , 都是基于开源说我今天拿这个数据 fine-tune 一下, 明天我拿那个东西改一改 , 快速的产生了一大批相关的开源的这个 release 出来 。
但真正你去看 open 出来的真正叫大语言模型的 ,Meta 原来的那个 OPT 可能算一个 , 然后 BLOOM 算一个 , 就是它后面那个 LLaMA 可能算一个 , 就到那个级别的也没几个 , 三四个 , 就是差不多千亿级别的这个其实不算那么多 , 且大量的都是以这个英文为主的 。
这个其实我觉得是一个很大的问题 , 就中国这边其实没有 release 出来一个 ,其实有 , 包括那个我记得之前华为啊什么就是放过一些大级别一千亿规模的一些模型 ,tune 的都很有限 。
你们是试过了是吗 ?
对 。
你觉得它 tune 很有限的表现是什么 ? 就在什么地方不好用 ?
不好用 , 它这个问题其实是这样的 , 就为啥包括 Meta 原来公布了一个 OPT 以后, 它在最近这几个月还要去 tune 这个 LLaMA 的这个东西 ,因为它自己非常清楚它的 OPT 的那个版本虽然也是一千多亿的这个参数 , 就参数规模是一样的 , 它的 performance 比起哪怕就是 20 年的 GPT 的那篇论文的那个 report 出来的 performance 还是有显著差异 。
所以这里面其实是有一系列工程化的问题 , 包括怎么去砸这个算力 , 包括在同样的参数下面砸什么样的算力是合理的 , 包括到什么程度认为这个模型是收敛的 。
这中间其实有一系列的子问题 ,是很多只会说把这个事给跑起来的人实际上是没有考虑 , 甚至是没有想清楚的一些问题 。
比如说你的 loss 上面稍微跌了一点点 , 从总体的模型的质量来讲 , 你可以认为它是可能区别很小 ,但是对于一些长尾的问题 , 很有可能那一点点的这个提升 ,其实转化出来就说你的有一个新的能力 , 从原来是随机的能力变成了显著提升了 , 就是它不是那么简单的转化的一个问题 。
虽然现在好用的开源的大模型并没有那么多 ,但是可以预见到开源会是一个更加繁荣的生态 。 那随着这个趋势变化的话 , 就是对这些做应用的 , 或者像你们这样应用驱动自己在做大模型的公司会有什么影响 ?
我会觉得我们还是核心是持续找到那些最重要 、 最关键的场景 , 把它给做好 。 是不是有一些适合用到一些开源去解决呢 ?
我觉得我们也很难说这个一定是 no,但是还是那个走着瞧呗 。
就是你们是可能会去用一些开源 , 会去尝试的 。
对 , 我觉得它不是一个完全非黑即白的一个 。
是 ,因为它有一种可能就是那些做应用的 ,他用开源的模型 , 然后开源的这个模型因为有更多人在贡献嘛 , 它有可能会迭代的比某个公司自己做的东西要更快 。
这个事我觉得在语言模型上会相对复杂一些 ,因为这涉及到传统意义上, 这个其实就是传统软件跟 AI 软件很大的一个区别 。
就是它开源的意义是不一样的 , 开源的东西也是不一样 。
就是传统软件有的时候你在你产品定义里写说我要做一个什么功能的时候 , 你定义是非常清晰的 , 对吧 ?
我今天要做这个功能就是打开这个文件 , 然后我要支持比如说 PDF 能够显示高亮 , 就这个事是一个非常明确的诉求 。
但是恰恰是比如语言模型 , 你其实在定义我在优化什么这件事都不是那么容易 。 你说我在优化 AGI, 那首先什么是 AGI, 就这个问题已经就是一个学术需要去讨论的这个问题了 。
所以甚至在这个上面它的模糊性是非常高的 , 就是你有可能是说我的开源 , 我优化了这个 A 的这个任务 ,但这 B 的那个任务其实 performance 是掉了的 ,但因为你不关心 B 的这个任务而已 , 它其实是有些 conflict 在里面 。
你自己认为开源的模型和闭源的模型之后谁会表现更好 ?
如果你存在一些类似于像 OpenAI 这种的玩家 , 它持续的可以用市场上可能其他的这个创业公司 100 倍的投入去把资源撑到一个人类极限的这个程度 , 那我觉得那没有啥好说的 , 那一定是它的闭源的这个可能就是能做到最好的 。
因为就有一些 observation 是你看不到它能看到的 。 就换句话说 , 如果我们自己训练的这个模型 , 我一天能训练一次 , 我可能创新会快很多 ,因为我是需要看到下一版本的这个反馈 , 继续去做下一个这个迭代的 。
就我觉得这是本质上是这样一个问题 , 就其他人可能看三个月 , 看六个月 , 看到了一个反馈 。 如果你真的要把模型 disclaim 到那个地步的话 , 我是一天能看到一个反馈 , 然后你再跟我去 PK 这个事 ,其实你肯定是很吃亏的 。
这个看到反馈的速度是和你的模型规模有关的吗 ? 还是和用户的规模有关 ?
核心是和模型和你的算力有关 , 就是你得很快的把它给跑到一个很好的一个地步 , 然后有一些观察你才能观察得到 。
我们试过训练一个大两三百亿的规模的模型 , 如果我们拿单个机器去跑至少一年, 那就不用想了 , 就这个反馈周期就是黄花菜都凉了 。
你可以解释一下模型的开源和以前软件开源的区别是什么 ?
这个其实就是我说的 , 我会认为这个区别是传统软件和 AI 软件的这个区别 。
OK。
就是你传统软件在定义任务的时候和你 AI 软件在定义任务的时候其实是不太一样的 。
可以这么理解 , 就是传统软件开源的就是代码 ,而且你这个代码就是非常明确的 , 你这样输入它就是怎样的结果 。
光性是这个定义上明确的 , 所以当我用户在用的时候 , 我发现比如说有一个 bug 的时候 , 我可以很快的提交一个 path, 我把这个 bug 给解决掉 。
然后模型的开源 , 或者说 AI 软件的开源 , 它也开源了代码 , 然后它也开源参数吗 ? 权重它也开源了吗 ?
这个才是开源的核心 。 那个代码对于绝大多数真正就公司级别想要进入的都不是什么 。
那它开源了参数和权重之后, 也还是不能保证说你就能复现它的效果是吗 ? 主要是和数据有关的 。
是这样 , 就是你可能不需要复现它的效果 ,因为它的那个权重把当前它正好的那个效果已经展现出来了 , 所以很多人是基于那个之上再去 fine-tune。
那实际上开源也是我用了一个开源模型的 API 的 , 然后 fine-tune 吗 ? 还是怎样 ?
因为你拥有这个代码 , 它的最完整的话是训练代码加 inference 代码加参数 。 那么理论上来讲 , 如果你说我就是要一个它 train 好的 , 比如 LLaMA 的这个版本 , 你是可以直接用的 。
你说它这个版本 , 比如说在我的医疗文档上还做得不够好 , 我自己有比如说一万条医疗数据 , 你是可以基于它上面去做 fine-tune 的 。
对 , 就是你自己修改它的这个代价是低很多 。 因为就像我说 , 如果你有 10 张卡 , 你 train 个 200 亿 , 你可能需要一年, 但是你 fine-tune 它可能三天你就真的把它给做完了 。
如果你要再做后续的创新的话 , 这个速度拉起来了 , 你就只需要在别人已经相当于是为训练一年的那个基础上去做 , 最终上去 。
但是你 fine-tune 的时候 , 你也是可能自己要有数据 ,也得有算力去跑这个 fine-tune 的过程 , 所以说少很多 。
对 , 相对来讲可能是少了两个数量级 , 就是它让这个事能够 access 的人多太多了 。
热潮冲击1:08:02
明白 。 你觉得这次的 AI 热潮 、 大模型热潮之后, 整体上给你们公司带来了什么变化 ?
就坦白来讲呢 , 我会觉得也不是啥好事 。
可以展开讲讲 。
我们在去年 release AI 写作这件事的时候 , 你可以想想那个时间节点 ,其实是在 ChatGPT 出来大概一周两周以前 。
对 ,11 月 , 当时是 11 月底 。
对 , 就是我们看到很多反馈啊 , 包括我们在那个 11 月上线之前 ,其实我们有些小程序已经在收集用户的反馈了 。
虽然大家讲 AI 写作讲了很多年, 但是其实我们 release 这个产品也好 ,release 我们的这个小程序 , 我们发现绝大多数的中国人其实没有见过这东西 。
就是你写一个什么标题 , 我就能给你生成一篇逻辑上还完整 , 能够比如说 800 字 、1000 字 、2000 字的这个文章 , 还能读得通 。
我不仔细看的话 , 我甚至不觉得这是自己写出来的 。 就这件事的直观感受 , 绝大多数人在那个时间里面没有感受过 。
对 , 所以换句话说 , 我们相信啊 , 就如果我们有一个半年的一个时间 , 我们发了 ,ChatGPT 还没发 , 能给我们发展的话 , 实际上是会让我们包括在业内的用户增长也好 , 口碑也好 , 可能会有一个很显著的帮助 。
由于你们发布和 ChatGPT 发布的时间非常近 , 你觉得它实际带来的结果是什么 ?
它本质上是这个问题 , 就是 ChatGPT 的发布以及在两三个月的时间内的爆红 , 好处是它其实给全民把这个技术全部普及了一遍 。
所以原来 95% 可能在中国还不止 , 对吧 ? 你要算上所有人的话 , 肯定他都不认为技术能够做到这个程度 。
所以你原来做到这个程度 , 对他来讲是一个很大的一个 surprise。 就是你原来的比较是可能我们比 Siri 聪明 ,他觉得这是一个巨大的一个进步 。
现在我们要 PK 的是 ChatGPT, 对吧 ? 因为 ChatGPT 你可能没有用过 ,但是你一定听过吧 ,在全球范围内你可能都变成这么一个情况 。
所以你的对标对象已经从上一代技术变成这代技术的最强的这个竞争对手 。
我爸都知道 ChatGPT,因为它炒股 , 就 A 股概念股 , 涨得特别厉害 。
是 , 所以我们觉得它的挑战呢确实也就在这个地方 , 甚至它会让所有的巨头都极其难受吗 ? 本质上你现在不管是哪家 BAT 出来 , 对吧 ?
你发一个模型 , 人家自然给你对标的都是你比起 OpenAI 怎么样 , 你比起 GPT-4 怎么样 。
短期这件事情让你们有一个非常强劲的 ,而且短时间你无法挑战的对手 , 那有些什么别的好处吗 ?
比如说会不会有更多的资源投资 ?
对 , 投资这事我觉得你们应该也是有提的 。 我们的感受是财务投资人在这一轮的爆炒的热情里面 ,其实本质上是缺席的 。
你说的财务投资人, 你是指什么类型的机构 ?
无论是什么机构 ,但他们对大模型的投资并没有缺席 。 我看到的其实也很少 , 就是看你怎么想 。
如果你拿现在这个时间节点去比 , 比如说当年的 O2O 也好 , 投这个什么 Web3 也好 , 所有这些 , 如果你要把总金额来算上, 我认为是少了至少一个数量级的 。
总额有可能 , 只能说最头部的机构是没有缺席的 。 像红杉 、 源码这些机构还挺活跃的 ,IDG、 真格也都有在投 。
这个我看到的第一方面呢 , 你看它押注的是谁 , 对吧 ? 也就是那么几个被 troop 过的一些连续创业者 ,而且也就是最头部的 。
因为你单笔的这个钱已经不像有一些就是说我这个给个 100 万 、200 万美金 , 拿给你们去试试 , 你不拿个几千万美金 , 对这个事你好像觉得又干不了 。
我确实观察到一个现象是 , 现在应用的投资会相对少 , 出手是少的 , 可能投资人看得不少 。
中国VC1:11:15
我认为大模型其实也是少的 。
只是说有少数非常有光环的项目 , 它是让这个景象显得是非常的热闹 。
没有几个 , 一般是东西数得出来 10 个吗 ? 对吧 ? 你 O2O 的时候那能数得出来多少个 ?
但是这个创业门槛确实是不一样的 。
第一 , 我认为这个门槛是不一样的 。
能做 O2O 的人本来就很多 。
我对这个事有一个判断 , 现在肯定所有人会认为我是胡说八道 ,但是这不重要 。 我会觉得在这一轮的所谓大模型的这个热潮里面 , 很有可能尤其是投中国的这批投资人会集体 miss 掉 。
被他们 miss 掉的项目可能是一个什么花样的项目 ?
我觉得他们会 miss 掉就应用端那种投点小钱 , 或者那个应用最后长得不错 , 这种可能还是有机会 ,但是大模型这件事我非常怀疑 。
你说 miss 掉是指中国就没有这样的项目长出来 , 还是指有但是他现在在没有人注意到的 ?
也许是他们口不爱记的这些项目 ,也许是他们看不懂的一些东西 。
你有看到这种东西吗 ?
就像你说开源 , 我觉得本质上那就是一股另外的力量 。 这个事有意思的一个点在哪呢 ? 如果倒过去你看 OpenAI 它吸纳的哪些人, 对吧 ?
就是真的把这个事给做出来 ,是以一个什么样的态度把这个事给做出来 , 然后你倒过来看中国现在的这些创业团队是一个什么姿态入局 ,是哪些人来领队 , 你会发现这个事显著不一样 。
就是中国的这个投资还是循着中国的传统思路在走 ,而我觉得 OpenAI 这样一家公司 , 它不是一个传统思路 。
你说的传统思路具体指什么 ?
大佬站台 , 资深什么院士 , 什么成功的这个那个来作为领先来做这件事 。 我认为 OpenAI 不是这样的 。
你想它真正最能打的那些人 ,其实是在最一线工作的人。 就是它的 CTO, 它的这些设计和人样是要写代码的 。
有没有一种可能是追赶者和原创者他本来就是不一样的 ? 他所需要的能力组合也是不一样的 ? 因为 OpenAI 已经在最前面给你淌出这条路 , 证明了这个大致的方向是正确的 ,是可行的 。
那其实后面的人更重要的也许是资源 ,是你资源整合的能力 。
我觉得这个是其中的一个假设 , 就是现在这个节点没有太好的办法能够验证的 。 因为本身在这个阶段 , 我认为 OpenAI 还是有很多自己的 know-how 并没有公布出来 。
就是它所谓的淌出来的那条路并不足够清晰 , 所以这些所谓大佬来占个台背个书 , 弄几千万美金的项目 , 很多真正的一些重要 know-how 其实还是得从头摸索 。
我觉得其实受到的这个压力是大的 , 哪怕你是一个成功的原创业者 , 你还是会问到你这个未来怎么挣钱 。
我觉得这个问题非常难回答 ,因为很有可能在一个非常长的时间段内 , 你只能讲中国故事 , 你没有全球竞争力 , 只能讲好中国故事 , 对吧 ?
有一种观点认为现在模型层的竞争焦点是看中国谁能先做到 GPT-3.5 的水平 。
我觉得你一定会在未来的几个月甚至一年时间看到一个现象 , 就是每个人每一个每一家都 claim 自己已经完成了这件事 , 然后每一家都会拿出来一些他们评测的 report, 或者一些貌似第三方的一些评价来佐证这一点 。
然后在他们的 PR 稿发完了以后, 你会发现实际 90% 的用户还是在用 ChatGPT。 我觉得这个事未来 6 到 12 个月会发生的 , 就是你是能 claim 完 , 然后 claim 完这个事以后呢 , 就又回到了中国的特色商业模式 , 你也许会 convince 政府 , 就是你会拿到这方面的钱 ,但是真正的我觉得 C 端用户是不会为你这个事买单的 。
你觉得现在在市场上少数获得了非常多钱的大模型的项目 ,他们有可能碾压这些应用的项目吗 ? 比如说我可以最后把你收购过来 。
我觉得它的问题是它的钱也没有多到那个程度 , 它会处于一个有点你真正比钱的投入 , 你也比不过 GPT-4, 对吧 ?
那你把钱花在哪呢 ? 我觉得这里面如果一个不留神会做成就是我说的 , 它其实是卡在上下两端的中间 , 就是下那我就干脆直接去做应用 , 我反正先把这个应用做好 , 上呢我就是我就要去 PK 这个 OpenAI, 对吧 ?
我做到这个效果上, 我跟它有一战之力 。 对 , 就我觉得非常容易做到中间 。 等到你做到中间你想要往下打的时候 , 你会发现下的这个市场很有可能不是你擅长打的 ,因为那个也是一个需要花时间跟用户交互 , 就是本质上我觉得那是一个新战场 。
现在王慧文和王小川的想法都是双轮驱动 。
换句话说 , 我倒过来来揣测这个东西啊 , 你不得不这么讲啊 ,因为你说我就是要 OA 大模型 , 这个事哪怕是非常信任你的投资人 ,他真的对你有那么大的信心吗 ?
我觉得他们也相信这件事 ,因为其实你还是在模仿 OpenAI 嘛 。OpenAI 它之前做了那么多工作 ,也并没有引起那么大的关注 。ChatGPT 它还是一个应用的形态才引起这么大关注 。
对 , 对 ,是有意外的成分 。
我的意思是说它也是这样一个形态啊 。 我觉得他们确实应该是这么想的 。
你会发现他们在最早发言的时候都不是这么说的 , 对吧 ? 最早站出来的时候可不会给你提什么双轮驱动 。
最早的时候本身说的也模糊嘛 。 最早的时候可能就是振臂一呼 , 我要做中国的 OpenAI, 对吧 ? 这也没有什么具体的东西 。
对 , 我觉得这个还是局势到了这么一个地步 , 否则我觉得你非常难 。 你难道能够跟人家投资人说你先给我放 2 亿美金 , 应用我不干 , 这未来 5 年我肯定亏钱 , 我可能每年还得亏 2 亿美金 。
中国有哪些投资人真正敢去想 ? 反正我对这个事就是我就是要做中国的 OpenAI。
不然我就为人类 AGI 事业做贡献 。
对 , 做个什么应用我不 care, 就是 license 给我下就是重要 , 我自己不碰应用 , 谁敢说这个话 ?
我主要是觉得他们可能也确实不是这么想的 ,他们还是很有自知之明的 。
但我觉得这就是问题啊 , 这就是我说是不是中国的投资人在这一轮会集体 miss 掉真正能够干这个事 。
你就是说可能现在中国是有雄心更大的人 ,而还没有进入人们的视野 。
因为它如果不是一个比如说像之前那种被证明过的 , 它不会进入到你的视野 。其实有一些倒也没有那么被证明过的 , 比如说现在资本市场比较追捧的几个项目 , 还有一个是 MiniMax。MiniMax 的创始人是商行之前的一个 VP,其实他也不算是很典型的连续创业的成功者 。
对 , 还有一个项目比较受追捧 , 杨植麟做的那个新项目 。
新的我不知道 , 新公司我觉得是新的 。
我觉得这件事像我看到的哪怕就是所谓的这些明星项目 , 这个事则在全民的 , 包括在投资圈的看上去的热度和实际大家愿意出手的 ,不管是钱还是评测 , 我觉得是不成的 。
我上个星期跟区凯也录了一期播客 ,因为他们在做 FA, 就 42 张今天在做 FA,他们服务了还比较多应用的项目 ,他说有十几个吧 。他也是说他说舆论层面是非常热的 ,但其实出手没有那么多 。
因为都看不清了 。 我觉得如果你的想法在最近三个月变了三次 , 那么你怎么敢保证你现在出手一个月以后你不反悔呢 ?
我觉得本质上是这个问题 。
但是风险投资就是这样 。
对 ,但是我觉得这个就是现在这个局势的问题 , 哪怕是风险投资 ,他都认为这个风险对他来讲是不为之说 。
因为他们原来很多时候愿意去讨论终局嘛 , 对吧 ? 这个事的终局是什么 ?
我本来有一个问题是想问你终局的 ,但是我觉得确实可能很难回答 。
我觉得非常难 。 我觉得恰恰是说这个事的终局可能不在于这个行业内的影响 ,而在于这个行业把其他的行业全给破坏了一遍 , 就是破坏性的影响了其他的行业 。
就是你赚没赚钱不知道 ,其他行业是因为你的这个出现受到了毁灭性的 ,不一定是打击 ,有可能是足够大的一个变革 。
有可能消失了又 。
对 ,是的 。 包括那个前段我看他们那个眉目是讲的什么在线教育啊啥的那种 , 对吧 ? 你倒过来看现在所谓的什么一对一教育或一对一机器人教育 , 我可能能做到比你老师做的更好呀 , 对吧 ?
你这小班我都小到极限 , 你问啥我答啥 。 我对这些所有课本以及课本延伸这个知识到位了没有啊 ?
我觉得这种应用就摆在眼前 , 你想练口语那没关系 , 它 24 小时随便陪着你练 , 你想练啥给你啥 , 就是几十美金 , 对吧 ?
二三十美金一个月 , 这行业到底要怎么走 ? 不存在的呀 。
你说它未来的终局可能取决于它对别的行业造成了多大的冲击 。
我觉得它对别的行业是一定造成了巨大的冲击 , 至于这个行业自己内部怎么做 , 谁赚多少钱不知道 。
热潮对比1:19:14
这个假设其实基于说现在的 AI 有非常强的能力 。
嗯 ,是 。
在 2016 年 AlphaGo 之后 ,其实那个时候人们也对 AI 是有非常高的期待的 ,也认为它可以进入很多行业 , 甚至会有大规模的失业 。
我记得当时有一个封面杂志非常出名 , 就是一个机器人在路上走过去 , 然后丢了一个铜板给一个人类的乞丐 , 就是大家有各种畅想 ,但实际上这个是没有发生的 。
你觉得这一次和上一次会有什么不一样 ?
当然那个是个畅想了 。 我觉得这一代的技术就返回到就是我说我们 18 年在做 Meta 的这个时候 , 我们对它的预期就是它能做到 , 就是它能做到在专业场景上足够强 。
我觉得这一点是说如果回到 18 年的时候 , 我们在讲这个事 , 说对很多行业做到一个专业级的效果 , 我觉得很多人还是不相信 。
可能有些人部分相信说你把一两个这个特定的场景的这个点能做好 , 可能我认为是可行的 。 但是我觉得在这个节点上, 就是由于 ChatGPT、GPT-4 的普及 , 我觉得很多人信了 , 已经有很多人开始相信这个事 。
不过相信和实际发生是两回事 , 中间可能是有落差的 。 你觉得这一次有被高估吗 ?
我觉得有一部分东西被高估 ,但是我觉得这个事一定会发生 ,而且发生的时间比没有 OpenAI 要早 。 就是它其实是一个本质上把全行业提速的过程 。
原来像我这样的公司 , 我们也就是按照我们自己的能力 , 对吧 ? 就是今天挣 5 块钱 , 我花 3 块钱 , 我把这个事做得更好一点 。
如果这个领域做得更好 , 做到一个我认为已经比较极限的这个程度 , 我们去把下一个领域给做好 。
但是我觉得现在的包括大家的这个舆论讨论关注也好 , 包括哪怕资本市场没有这么热 ,其实会吸引很多人投入进来 , 把这个事给进一步加速 。
尤其是那些做比如说纯应用层面的 , 可能很多人已经发现 , 哪怕就是刚才说的做第三个 , 对吧 ?Prompt engineering, 可能你要扮演一个好的英语老师这件事 ,Prompt engineering 就够了 , 就能做到非常好 , 就能做到 90 分了 。
那替代掉你原来一对一的那个老师可能已经这不是未来 , 它就是现在 。 而现在缺的是啥呢 ? 现在缺的可能是一些好的 , 比如说产品设计 , 把这个东西封装得足够好用易用 。
缺的可能是它有形成一个正向的一个商业模式 , 把这个事给真正收到钱 ,以及它也需要解决怎么去面对这个竞争 。
如果你接 GPT, 它也接 , 对吧 ? 你卖 20 美金一个月 , 你觉得已经还挺便宜了 。 另一个它如果新进来了 , 它要跟你抢这个市场 , 它说我卖 10 美金 , 你怎么来解决这些问题 ?
但本质上我会认为就是这个 solution 已经放在这了 , 这个钱可能不一定是你挣 ,但这个钱一定是有人会把这个产品做到足够落地 , 做到足够好 ,以深刻的改变这个行业原来工作的这个模式 。
可以说就是你从在工业界或者说你们一直在做产品的角度 , 你会感觉这是一个连续在变化的过程 。
只是说公众或者说舆论层面 , 它会因为一些标志性的事件 , 突然有一个信心的爆棚的这么一个状态 。
但是这件事是一直会往前推的 。
对 ,而且我觉得有些爆棚就包括所谓一些互联网厂商对这个事的投入 , 我恰恰觉得并不一定能有持续性 。
很多现在出来各种讲各种 announce 的 , 再过上半年到一年可能未必 。
不过很多互联网厂商它自己就有超级应用 。
是 。
它至少可以去放到自己的超级应用里面 。
我会觉得真正能够精细和能把这样一些模型调教到一个很好程度的相关的这些工程师团队 , 就至少从现在这个节点也没有那么多 。
然后呢 , 它容易造成这里面有一些不论出于什么目的 ,在最近的这两三个月有投入还不菲的一个成本的这样的一些公司 , 可能能撑 6 个月吧 。
未来的半年这样的一个时间窗口上, 它一方面在看到它的投入是持续花钱的 ,因为你那机器放在那你就是花钱的嘛 ,不管是你采购算力 、 采购数据 , 包括雇人, 这些都是花钱的 ,不断的在花钱 。
另一方面你看到市面上又有新的一些开源的这个版本 , 你测下来好像还比你自己内部团队在那搞半天 , 对吧 ?
丢了几个亿在那孵化了半天 , 弄出来的这个效果不弱于你自己在搞的效果 。 如果再加上第三个变量 , 就是如果你的主营业务由于不管是什么原因受到了影响 , 对吧 ?
你的收入在下滑 , 你的利润在下滑 , 你说那个时候你会做一个什么样的判断 ? 所以我觉得很有可能会面临再过几个月的这个时间 , 市面上反而多出来了一大堆二手的 A100、A800。
你养这个东西在那是个纯粹烧钱的一个事 。
对 , 我最近也跟人交流到这个问题 , 说现在算力是不是紧张的 ,但是可能过一段时间它又宽松了 。
就不是当年的矿卡吗 ? 都在挖矿的时候那就非常紧张 , 炒不到 , 然后一静止流传大量的矿卡出来 , 然后显卡的一手的这个费用肯定这个成本就上不去了 。
你说 OpenAI 给整个行业加速 , 那你们公司自己准备怎么加速 ?
多买几张卡 , 对吧 ?
对 ,而且你们其实也必须加速嘛 ,因为这个环境在推着走 。
我觉得还是见招拆招 。 本质上我们其实也是要更好的去把这批用户给服务好 , 然后使得我们自己的这个就是我们说的做一个正向循环 , 然后我们也有更大的这个资源可以投入到包括在这些研发算力的这个上面去做一个更快更好的一个迭代 。
我觉得这是一个是个常态的问题 。 所以我说为啥比较可惜的是我们少了那半年的缓冲期 , 就如果我们有那个半年缓冲期 , 这件事可能会干得更顺一些 。
你们现在有在看新的融资吗 ?
我们在看 。 一个感受就是我们说的可能反而战头会更积极 , 抬头会非常谨慎 。
战头是有一些企业来主动联系你们是吗 ?
那联系的肯定是不算少 。
我说来联系就是指他们想投资的意思 。
对 , 我的意思就是联系号称想投的 , 那肯定不算少 。 这个反正我们自己会判断一下 。
你说的战头他们是什么类型的企业了 ?
可能是足够大级别的 , 比如说互联网公司 。
在这个阶段你们想拿战头吗 ?
我看到的是在这个阶段如果我们想拿钱 , 我们可能已经找不到第二选择了 。
那实际上你想拿战头吗 ? 或者说你是拿战头的顾虑是什么 ?
如果我们有一个相对比较自由的发展的话 , 我觉得就还好 。
顾虑是说它可能会管你限制一些东西 , 如果它不限制你你是觉得还好 。
对 ,因为这个也还在聊的过程当中嘛 。 我会觉得如果它有很核心的业务说你必须得配合我这个 , 那我觉得这另外一个逻辑了 。
本质上就是它想要啥 , 你觉得这个价钱卖不卖的就问题了 。
就是你肯定是不考虑阿里的是吧 ?
为什么呢 ?
因为上一次马里收购你不都提前跑了吗 ? 你就觉得你不想进入到阿里的这个体系了 。
我觉得战头和收购是不一样的 。
还有一个原因就是阿里是出了名的在战头了之后, 它的干预是相对多的 。
我觉得恰恰这里面有些事呢 , 第一个是我觉得也可以谈 ,也可以聊 。 第二个呢 , 我觉得它有一些你看到阿里干预多的 , 我觉得它一定程度也是 , 比如说你正在做这个事可能跟它的有一些偏核心的这个业务可能有结合 。
如果我觉得你在一个它总办还看不到的一个地方 , 可能也就还没到那个级别 。
所以有可能是阿里是吗 ? 你们也接触过 ?
因为最大的反正有几家都在接触 。
你说最大的也没有几家了 , 对吧 ? 那就是 BAT 字节 。
对 ,也没有几家了 。
不过字节战头的人好像这部门都基本等于这三个 ,他们分到不同的业务的战略里面去了 ,他们现在不怎么投资了 。
是 , 所以字节真的还没有直接接触 。 我估计字节肯定内部也不会 miss 掉这件事 , 我觉得他们自己会做 。
他们投入还挺大的 。
他们投入大是必然的 , 就是当你挣得到他那个钱的时候 , 就他那个投入真的就完全可以被 just fit。
你最看好中国的哪家大厂做大模型 ?
我觉得首先这里面好几家都还没出牌呢 , 对吧 ? 比如说字节到底准备做啥 , 做到什么样 。 人家还没出招 , 模糊的有人说到还不错 , 就是这么模糊的 。
所以其实我觉得很难评估 。
他们算是在做大模型对吧 ?
我觉得这个事情是这样的 , 它都到这个级别的影响力 , 你作为一个收入对吧 , 到一年几千亿的公司 , 你说我里面没有团队在做这个东西 。
对 , 我知道他们是在做大模型 , 我也知道他们在做什么 ,因为这是朱文嘉在做嘛 。 而且朱文嘉最近反正他相关的一些自报性都有一些变化 , 就可能是他为了做大模型 , 跟给他的一些权限 , 或者说有些事让他来管 ,有些事他就先不管了 。
有一些变化 。 字节 AI Lab 的负责人李航 ,他以前是给杨振元汇报的 , 现在就改向朱文嘉汇报了 。
原来是给马文英老师汇报的 。
对 ,因为马文英后来离职了嘛 。
就是因为这事我见过马文英老师也 。
马文英以前是在微软亚言院是吗 ? 还是在哪 ?
你说哪个 ?
马文英 。
对 , 原来在微软亚言 。 微软亚言应该是做到副院长了 。
你说当时你因为他离职的事你去见他 ?
没有 , 就是之前 ,因为曾经找过说是不是加入字节 AI Lab 的事 。
就是那会还没去呢 。
创业之前 。
哦 , 还没创业 ,但是你在那报了那个事 。 你跟他聊完之后你当时是什么感觉的 ? 你觉得字节能长期把 AI 做下去吗 ?
那就是 17 年左右的时候是吧 ?
就当时那个节点我就觉得 AI Lab 还是带有太浓重的类似于微软亚言的这种感觉 , 就是它还是有偏高效的这么一个氛围 。
所以我觉得它其实恰恰不是那种我们要 set up 一些什么 。 我觉得整个 OpenAI 这件事给这些研究员提出的挑战其实也是在这个地方 。
就是我在 09 年的时候在微软亚言 , 我就会认为那个阶段你看上去虽然亚言有上千号 researcher, 就是各种创新这个 ,但本质上来讲还是手工艺做法的做法 。
就包括高效 , 就是这么多年以来在包括计算机啊这个我觉得还是手工业者还是做好事的创新 。 就是我觉得这次是被狠狠的教育了一把 。
谷歌 DeepMind 和谷歌 Brain, 我不知道你了不了解他们的情况 ,他们是偏向手工业还是更偏向工业化 ?
我觉得他们其实已经在原来那基础上迈了一大步 。 因为像类似于比如说这个 AlphaGo 啊 , 包括像蛋白质折叠机 、AlphaFold 这种级别的创新 , 我觉得其实以我对像亚言啊这种机构的了解 , 我觉得是很难做到那个级别的投入 。
它其实是要倾斜很大的资源 , 把它设置成可能公司的年度最重要的那么几个目标 , 我觉得是有机会做到那个投入和效果的 。
你看原来就比如说很多所谓 research lab, 最核心的事就是发论文 。 你就知道那个工作模式 , 你今年发了 5 篇理论 , 我发了 7 篇 , 对吧 ?
你把这个改了改 , 我把那个改了改 , 你 optimize 的东西就一定不是做一个巨大的创新去做到的 。
改一改就能发顶会吗 ?
当然 。
所以顶会也不是那么难 。
顶会的 95% 以上的东西就是改一改发的 。
但顶会的最佳会比较难吗 ? 就一些什么年度最佳论文这是比较难的 。
我觉得最佳的可能 50% 真的还不错 ,50% 是有强烈的随机性 , 可能是这么一个 。
一半一半 。
对 。
如果只是单纯说入围顶会论文 , 那就有很多水分了 。
你想想还不用说现在的计算机系的一些学生 , 就是我们当年我读本科的时候 , 那还也有个几篇吧 , 本科的时候 , 对吧 ?
那也是在同学中的少数人了吧 ? 你不会说全班同学每个人都能发吧 ?
那当然也不至于 ,是少数 ,但我的意思就是那个也不 。
就你觉得没有那么难反正 ? 也不是说那么创新 , 你是怎么觉得的 ?
第一是说它没有那么难 , 第二是说我觉得恰恰是很多的研究人员 overfit 了这条路径 , 就是他的整个职业生涯在 overfit 怎么去发顶会 , 怎么去发 publication。
所以他们 miss 掉了 , 就不是说他们真的比如说 OpenAI 这所有这些 talent 加起来 , 对吧 ? 你都干过 OpenAI 那几个人 ,但是我觉得这个其实是指导方向的这个原因 。
你要说这些 research lab 每一个不比 OpenAI 大 , 那都是大 10 倍以上的大 。 哪个真正把这个事干出来了 ? 为什么是人家干出来了 ?
优化的方向不一样 。
优化的方向完全不一样 。 所以我是在比较早的时候觉得很多这帮人干的事很没劲 。
就是你想进工业界的原因吧 , 就是想去做具体的产品的原因 , 可以这么说吗 ?
对 , 对这个事的判断呢 ,有两件事我觉得是对自己能交代得过去的 。 第一件事叫做做出那些真正最牛的研究上的创新 , 就像我刚才给你讲的那个 , 就是其他人要去理解这个问题 , 可能你先去补一学期的课 。
是 。
到最后两个小时的那课的时候 , 你说哦 , 终于理清楚他把这个事给解决到这个逻辑 , 好像真是太强了 。
这个是一个路径 。 我觉得这个是一个 justify 自己的说还是做了一些事的一个目标 。 另一方面 , 另一个路径 , 那就是真正做出来一个足够好的用户的基础 , 足够广的这个产品 。
我觉得就是你要么做应用 , 你要么做理论 , 或者做真正这种创新 , 你好歹占一个吧 。 两个都占很困难 , 你占一个 。
但是我看到绝大多数人拿着第一个 , 就是我觉得现在好多微创都有些指导方向 , 我觉得是有问题的 。在第一条路径上没有做到最好 , 做到数量多的一些人被 reward 了 。
给你 50 个博士生 , 你一年发 20 篇这算啥呢 ? 你不用 motivate 他们 ,他们为了毕业的压力 ,他们自己就能把这事给搞定 , 对吧 ?
这顶会你就去发呗 。 而且你但凡在一个比较好的学校 , 你招的博士他就不是傻子 , 你也能拿这么多的 publication, 就这么简单 。
你说的是作为那个实验室的 leader 的意思是吧 ?
是 。
就播导 , 反正博士生自己会写的 。
这帮人也是全国百分之几给你招进来又不是傻子 , 难道发不了吗 ? 就像我们这种本科生 , 你稍微那个啥勤奋一点你也能发 。publication 数量这件事真的 。
但现在学界非常看重一个实验室的出版的数量 , 顶论文的数量是吗 ? 大家很看重这个 。
我觉得有另外一个问题 ,但这个又是特别攻击人家的一个 , 就是如果你在很多有一定的应用级别的这种领域去看 , 真正说能够做到我说的那种 scientific breakthrough 的 ,也没有 。
那也没有 , 数量了你不就比数量了吗 ? 对吧 ? 你还比啥 ? 如果你说这三个是得了三诺贝尔奖 , 那确实它的这个倾斜不一样 ,但是你这一个也没有啊 。
引用数量能反映质量吗 ? 至少能不全吗 ?
不完全 。 我觉得引用数量是一个非常容易被操纵的指标 。 你知道很多 researcher 为啥非常愿意去发一些 , 比如说做 dataset 的文章 ,因为你会发现这个事首先付出了苦力 , 你就能发 。
你发了以后呢 ,但凡后面的人要用 , 它就会引用你 。 所以这是一条 shortcut, 就是我做几个 , 多做几个 dataset, 我这个引用做一个 , 那个引用做一个 。
有的时候你很容易拿到 high score 的一些 citation,但你说这个东西的 , 就是我说你真是从它的门槛 , 它的 scientific 的贡献来讲 ,不能说没有 ,但我就说它本质上 reward 你的劳动力 。
因为它给这个领域提供了工具和一些基础 。
对 , 就是你干得很辛苦 , 我把清扫费给你结了 ,但是我并不说这个事你能干别人干不了 。 我觉得很多其实这种问题 , 就是 OpenAI 找的最一线的人 ,是真正在这个上面最一手看到的现象 , 一手在做工程落地 , 及时得到反馈 , 知道这笔钱花在哪 。
然后本身人也聪明 ,其实好多 researcher 本质上面临的问题是说 , 当你看到同样的现象 , 笨的那个说我可能有 10 个去往下继续试错的可能性 , 聪明的那个可能会说这 7 个不会 ,也许是在这 3 个之间我们需要继续做一个验证 。
然后这个时候你花的钱和他花的钱可能就不一样了 ,但是可能最有些灵光一闪的时候 , 我再验证一下, 如果是 1, 我们就可以得到一个很好的结果 。
而且这个事你会发现它其实很难量化 , 到底它是一个一流的还是一个二流的一个 researcher。 很多公司愿意说我为什么重视研发 , 我的研发投入多 ,但是我觉得它甚至比广告投入更难去衡量什么叫做有效的研发投入 。
有些说广告一半的投入是浪费的 , 我觉得研发 95% 是浪费的 ,而且你不知道哪 95% 是浪费的 。
不过研发就是这种特性 。
但是我觉得这个其实忽略了一件事 , 叫做真的有人的 , 就是你真的有很强的那个人 ,他的研发效率就是比你高 10 倍 , 同样的钱 ,他的能力就是能比你好 10 倍 。
但对一个特别大的组织来说 , 你是很难去甄选这些人的 。
我觉得这就是问题 。 这个其实是 OpenAI 干的一个非常重要的一件事 , 就是找到了真正在这件事情上会花钱的人 ,并且给他花很多的钱 ,他做到了一个效果 。
你其他很多机构我也总 , 你说总投入问题 , 亚言其实也不少 , 那我均匀的给我的这些 researcher 都花一些钱 , 然后你产生的那就是现在这个效果 。
刚才这个总结挺好的 。
对 , 找到会花钱的人给他们很多钱 。 但是找到会花钱的这个人 ,其实你看在 OpenAI 找他们的这几个最核心的人的时候 , 这几个人多少岁 ?
30 多 。
可能刚刚 30 左右 。 你看现在国内的这个情况 , 对吧 ? 是花到哪些人的钱上 ? 这就是我说可能会极易 miss 掉 , 就是他花的那个逻辑是完全不一样的 。
杨志文应该比较年轻吧 ?
也就他年轻点 。
野英也比较年轻 。
也是 。
就是 MiniMax 那个创始人 ,他也比较年轻 。
我觉得这里面还是有个核心 , 就这帮人现在的重点时间到底是在干嘛 ? 是在做资本运作吗 ? 对吧 ?
你还是在最一线 ? 我觉得这个很不一样 。
CEO 其实很难在最一线 ,因为他本来也应该去做一些别的事 , 从这个公司的角度 。
对 , 就是我觉得尤其是在这个时间节点 ,在中国的这些想要做大模型的 , 很容易让这个花钱花得极其没有效率 。
然后就是进入到我刚才说的那个负反馈 , 就是你投入了半天 , 你还干不过人家开源 , 然后你就在想这东西 , 我养的这帮人, 投入半天到底是在干嘛 ?
我到底做了什么 ? 我还不如人家一个个人开发者在 Hugging Face 上拉了一个模型下来一跑 ,也不比我这个效果差呀 。
你觉得此时此刻在 AI 这个领域 ,有什么大家都同意的事是你不相信的 ? 有什么大家还没有相信的事情是你相信的 ?
就包括刚才我说的一些 , 我不知道大家同不同意 , 我觉得可能很多人不同意 , 或者不愿意认为 , 包括现在如果说这个花钱的方式模式压着这部分人, 就可能都有点偏离这件事本身 。
我觉得这被太多的其他的因素干扰 , 就是太不纯粹了 。 我觉得那帮人也很纯粹 , 这个就是它可怕的地方 。
但是这个环境能够找到纯粹的 , 且还能够拿到足够多资源的人吗 ?
而且也会用资源 。 你说它纯粹 ,其实看你怎么定义纯粹这个词 。 因为 OpenAI 我觉得它是做了一整套全套的工作的 , 可以说它的这个目标是非常的明确的 。
就是我通向一个 AGI 的 , 然后可能普及到很多人的 , 让大家能感知到的一些东西 。
我甚至认为啊 , 你的目标设置成说我要做中国的 OpenAI, 这事已经不够纯粹了 。
现在说实话也没有人这么想了 , 我觉得 。
但是有人这么说 。
对 ,有人这么说 。 或者说有人在两个月前是这么说的 。
对 , 我觉得这就是一个更不纯粹的情况 。 你哪怕是这么说 , 且你这么想 , 我觉得你是比人家低了一个身位 ,但好歹这还算是一个 。
还是真诚的 。
对 , 真诚的纯粹 。
我觉得他们有的人更早的时候他是这么想的 ,但是过了一段时间之后 ,他也看清说首先这很难 ,其次可能也没有必要 , 就他也不这么想了 。
对 , 那我觉得这就是更大的问题啊 。 那你干这件事是想干嘛 ? 想挣钱吗 ? 对吧 ? 这就完全是另外一个游戏的玩法了 。
这个是我之前开玩笑跟我们同事说过的 , 就是但凡你有一个重要的目标在这件事上就抱着挣钱 , 那对不起 , 你可能已经输了 。
我觉得想挣钱也没问题啊 。 比如说我想以这种产品去挣钱 , 就我不是说去骗钱那种挣钱 , 那我觉得也没问题 。
我觉得挣钱的问题是这样的 , 就是你可能在很长的一段时间 , 你会发现你自己去死磕去做这个研发 , 去探索这条路径 , 对于挣钱来讲是一个相反的一个目标 。
对 ,因为挣钱你也分长期挣钱和短期嘛 , 快钱还是你觉得可以延迟满足 。
平衡与融资1:37:14
但我实际上看到的现象就是 , 你以为你能平衡 , 实际上你平衡不了 。 就是但凡你玩了 , 我说我有长期的理想 ,但我短期的解决挣钱的问题 , 这件事你们还解决不了 。
你们现在是怎么平衡这个问题 ?
对我们还好 ,因为首先就是我们没有对外界预期有那么多的资源 , 所以我们其实一直把它适度的平衡到最好 , 就是公司能基本养活自己的这么样一个状态 。
你们现在的收入可以一起来养活自己吗 ?
可以 。
所以你们写作猫的收入还挺多的 。
还行 ,因为我们也就几十个人嘛 。
你们 40 个人的话 , 那一年怎么也有几千万的人力成本吧 ?
有 ,其实 2000 不到 。
2000 不到 。
总成本可能会到 ,但是人力不到 。
总成本就大几千万 , 差不多 。
不会 , 小几千 。
小几千就是比无小的意思 。
是 , 那一定是比无小 。 对 。
总成本小几千万 , 那写作猫的收入确实还可以啊 。
还算有一定的收入 。
为什么这个收入对财务投资人来说不足够大呢 ?
我觉得这个事很有意思是啥呢 ? 是这样的 , 本质上来讲 , 这件事他们被吓到了 。 什么叫被吓到了呢 ?
他们看到说我们其实就是在跟最一线的大厂直接竞争 ,是这个问题 。 就财务投资人面临的是这个判断 。
所以没有 ChatGPT, 可能你们反而会获得财务投资人的优势 。
因为本质上我们有这个行业内最好的数据 ,不管是用户还是收入 , 就是没有任何问题 。 它唯一的问题是那边上千亿市值的大厂是不是马上就要过来去打这个市场 。
所以热潮对你们的短期影响其实是影响了你们的融资 。
至少对于我们来讲其实不算特别正面 。
它并不是简单的说这个热潮来了 , 然后你是这个领域的 , 你就获得了好处 。
是 , 它现在本质上就变成了 , 就是我说为啥有一些更偏离主赛道的一些应用 , 可能反而容易拿到钱 ,因为它的判断是说你大厂可能不会直接来干这个事 。
这个是我们比较有意思的一个课题 。
但是其实你们的历史也已经验证过 , 偏离主赛道的战场如果选的太小了 ,是不足以支撑一个公司长期往前走的 。
对 , 就是历史也证明绝大多数的风险投资押注的也是失败的嘛 , 所以这个也合理 。
你们的数据最初是怎么来的 , 后来是怎么循环起来的 ?
那都是 GPT 砸来的 , 都是往上抓的 。 就是核心那个一定是一个非常重要的数据 ,而且这包括他们自己说其实在公开渠道能拿到的这个数据 ,其实已经到一个相当的一个量级了 。
你们当时做法律翻译的时候会有一些特别的数据吗 ? 就网上可能找不到的一些数据 。
会有一些其实没有人关注到 ,但是我们关注到的一些数据 , 就是半公开的一些数据 。其实你如果真正在一个 domain 上去把它做得非常深 , 还是能够看到很多标准的所谓 AA 全网 , 我去扫一遍 , 爬虫我能不能拿到的东西 ,其实有的时候恰恰那种方式你反而会 miss 掉有些重要的数据 。
写作猫上线之后, 我理解应该是 2019 年底就上线了 , 你们当时好像就有一些零星的推广在做了 。 那到现在其实也有三年时间 , 这个过程中间用户的数据可以帮助你们去进步的吗 ?
我们会把用户直接说这个不准 , 那个忽略 , 包括添加的相关的一些查找的规则的这个数据拿来用 。
但是用户的比如说存在上面的数据 , 这些数据我们是不碰的 。
明白 。 它的那个行为相当于是给你们的一个人工的标注 。
对 , 会是一个有用的数据 ,但不能直接用 ,也是需要提纯的 。 因为很有可能它是按照它的逻辑去反馈 ,但是这个反馈也许你认为是对的 ,但另外几个人认为是错的 。
有些可能跟最近的一些别的现象有关 , 我主要是说就是和你们公司 , 包括你们现在在这个浪潮里的处境相关的问题 , 你觉得有什么重要的你想说的我还没问到的吗 ?
我会觉得就是现在看起来在这波大家觉得好像非常热闹 ,但我其实有一点点怀疑说 , 就等这波最热的这个热潮真正过去了以后, 我相信其实肯定会真正迎来一波落地 。
但是这波落地里面到底有多少是现在站在台上, 就是非常受到关注的这拨人, 我觉得大多数可能都不是 。
但是我们希望哪怕我们不是在最主要的赛道上面 , 至少我们在我们自己真正去划清理优化的那个方面 , 还能够做到最好 。
说至少你提到这个 domain, 我们说我们这个是做得最好 。
你们现在划清理优化的 domain 主要是法律吧 ?
对 , 我们是觉得这个是有机会被做得非常好 。 就是我们对很多领域判断就是它有没有机会做到真正 , 换句话说能不能超过这个领域的 99% 的人。
我们觉得法律这个领域也是有机会的 。
那它未来可能就不局限于法律翻译了 。
对 ,是的 。
对 ,因为法律领域还有很多别的一些空间和市场是可以去做的 。
而且在这个领域里面照搬一些国外的商业模式 , 你会发现它不太 work。
其实 OpenAI 也跟一个公司其实深度合作在做法律的落地 。
你说那个什么 Harvey 是不是投了钱 ?
投了钱是吧 ,但那个公司成立挺久了 。
哦 ,是吗 ?
就成立比较久的一个公司 。 本身它就是做法律相关的一些软件 。
Harvey 应该是 OpenAI 投了的 。 我们甚至会觉得国外的那个 , 就比方说国内 , 就美国的律师的平均收入和中国的律师平均收入实在差太远了 。
所以有的时候你会发现你要辅助你帮律师降本增效这个事 , 已经是一个巨大的挑战 。 人家比如说雇一个实习律师 , 一个月 2000 块钱 , 你帮他降什么本增什么效 , 没法弄 , 对吧 ?
那个是时薪 2000, 你这个月薪 2000, 就大家对降本增效的这个理解其实完全不一样 。
那你们可以出海了 。 你们不是已经有在出海了吗 ?
我觉得那个还不一定 。 翻译本上这个事是一个比较 universal 的 ,不太讨论出海这个 。 本来就是在语言之间切换 ,但整个不同的法系的这个其实是非常不一样 。
恰恰这个的机会也是说你 GPT 能不能顺手把中国的法律掌握到完美 , 这个事本质上也是很困难的 。
你不立足于中国的 ,而且就所有的这个法律其实规章制度这个层面 , 每天都有新的产生 , 每天都有过期 , 对吧 ?
你怎么来应对这一系列的问题 ? 你的这个实质性其实得做到非常好 ,不能你拿一个十年以前的判例 , 十年以前早就过期了的一些法律理用 , 你到现在是不是还能有用 , 这都是问题 。
明白 。 说到实质性的话 , 那就是比如说一些法律文书的撰写才会涉及到这个 。
不是啊 , 你判决 , 你的这个法律问题的判定很有可能都会涉及到 。
对 , 判定也会涉及 ,但你们现在做的是不涉及的 。 翻译是不太涉及这个的是吗 ?
翻译还好 , 翻译不太涉及 ,但你写作就会涉及 。 对 , 就是很多比如说公务员跟我们反馈 , 比如说你 20 大了 , 你引用 19 大的这个就已经过时了 , 且不要说你还引用了 17、18 大的它的一些提法呀这些 , 这都是有实质性的 。
公务员用你的东西有风险吗 ? 未来会不会政府会说公务员不要去用这种 AIGC 的东西 ?
没有 , 我们本质上是提供了一个 AI 辅助的写作平台 。 你是要 generate 还是我帮你查错呀 , 就是本质上我是给你提供了一个套件 , 且你不用我 , 你用谁呢 ?
你用 Word 把数据一会儿还是要出镜 , 就是这个是另外一个问题 。
那也可以不用啊 , 政府可以要求公务员都不要用 AIGC。
对 , 你想 , 学校也可以要求学生说你不准用 , 你禁止得了吗 ? 你如何禁止 ?
我可以通过办公电脑禁止 。
那我写这篇东西我不在你办公电脑写得了吗 ? 当然你可以出一系列的规则来反效率 。
它目的应该也不是为了反效率 , 可能是出于一些安全吧 。 因为有些政府它不见得能理解这个东西到底是怎么运转的 。
那恰恰就是出于安全的话 , 我完全可以让你数据可控 , 我完全可以把这个模型放到你的内网来解决 , 就是你数据不外流 , 然后我也看不到你的数据的 , 这些情况其实都是能的 。
就恰恰是说你部署 OpenAI 的可能有更大的风险 ,而且人家不一定配合 。 但是这些其实也就是我刚才说的 , 我相信所谓国内的大模型厂商看到的一些机会 , 就是我说我不一定要打过 OpenAI 我才能挣到钱 , 我打过你国内的这些可能就够了 。
然后我自己还有一些别的好奇的问题 , 可能跟我们现在关注的一些别的现象有关 。 就你说去年租 GPU 是一个月 A100 一块 , 那今年这个租的钱有变化吗 ?
还好 , 还好 。 重新谈可能不知道 , 我们也是个延续 。
延续事故 。
对 。
所以并没有给你们涨价或者怎么样 。
对 ,是的 。
就是因为你们没有去重新谈 , 所以也不太清楚重新谈它可能会涨多少价什么 。
对 。
那你们有去租 A7800 吗 ?
A800 还是 H800?
H800。
应该很少吧 , 除了腾讯好像发过那个 PR 稿 ,其他没有 。
对 , 腾讯宣布说自己是中国大陆首发 H800 的公司 。
没有直接聊过 , 还没直接聊 。
他们反正说他们有 , 说实话 ,他们说了这个 PR 之后他到底到货了没有 ?
是的 ,而且是要等多长时间等等 , 就是其实对于这个可能模型迭代还是有不确定性的 。 你说一个月一个爆货 , 那你到完了以后我还得做一个 swap,而且那个用新版本的很多显卡潜在的风险是啥呢 ?
你的软件有可能是要做新的适配的 , 你不一定放得进去 。
所以其实你们已经用 A100 训练过的 , 可能是不太会说我要马上换成 A800 或者 H800。
如果它的经济账足够合算 , 我们是不介意去尝试 。 就是我至少现在还没说把整个流程跑通了 , 我们不介意说我们租一台 , 花上半个月时间试试能不能把它搭上去 , 然后搭上去以后的收益到底是多少 。
就这个我们是在有一定的人力的不高的这个基础上, 我们觉得也不介意去做这个测试 。 但这个优先级也不是特别高 。
我是有一个可能要补充问一下的 , 就是你们做大模型的人是从什么地方来的 , 包括他们是怎么培养出这个能力的 ?
有些也是跟着我们干了几年, 就好多从 Day 1 公司开始的 , 就是跟着一起做 。
那他们之前是什么样的工作背景呢 ?
也许不是你想象的那种最豪华的背景 , 反正就是能打能干活的 。 就有些本来也是这些大厂上就看过几年时间的一些同事 ,PhD 硕士都有 , 本来也不懂 , 我们整个这块可能也是十年不到 。
你觉得他们是会用钱的人吗 ?
我是会用钱的人。
所以就够了 , 对吧 ?
所以很多到现在我需要介入去判断 , 我觉得这个是核心差异 。
所以其实你还是在一线想要 。
至少到现在这个时间我觉得仍然非常关键 。
你自己的精力怎么分配 ?
我觉得至少我会花一半的时间在偏研发产品上面 。
融资的事情是易伟在负责是吗 ? 一般来说 。
我也会谈 ,但是第一个是前一段 , 就是阶段性的会去跑一跑 。 第二个是呢 , 这个事对于我们来讲 , 我现在来看 , 我觉得反而是一个锦上添花的事 。
你说融资对你们是锦上添花的事 。
它的问题是啥呢 ? 假如现在多给你个 3000 万 , 你说我要大肆扩张团队 , 我要大肆去采购算力 , 都不可能 。
不可能是因为找不到算力和找不到人, 还是因为没有要投入的一个目标 ?
我认为这个投入是分级的 , 就是以我们现在这种比如说保产品去做这个迭代持续优化的这个方式 ,是成长的一个路径 。
这个路径呢 , 就是我的投入和我的这个产出可以进行一个匹配 , 然后我如果拿到多一个不是特别多的资源呢 , 我也只能沿着这条路径 , 就是我提前花 1000 万 ,但可能也就这样 。
但是融资的时候很多时候确实你得提前想到你说这个钱我得花到哪 , 然后我要多少钱 。
是 。
你怎么说才会想到一个小故事 , 说有一次孙正义见一个中国的创始人的时候 , 大概就是见面之后他有问他一个问题 , 说我想给你 100 亿 , 你就没干什么 , 然后对方反正犹豫了一下, 然后后来也说了一切 , 然后后来他就没投了 。其实他只是看你想过没有 , 就可能你说的会非常不靠谱 。
所以我觉得如果是我们拿的钱 , 它的数量级跟我们现在的这个差不多在一个数量级的时候呢 , 你本质上做的动作它不会有一个显著的差异 , 就我可能会多几个研发人员 ,但是你能随便招吗 ?
不能 。 你还是得看这帮人是相对靠谱的吧 , 你还是得一个一个面出来吧 , 你还是不希望这个人是一个三倍溢价招进来的 。
是 。
然后你的 GPU 投入 , 如果我真的拿个 3000 万 , 你说我能大肆的采购吗 ? 不能 , 对吧 ? 所以本质上我觉得它的花钱的这个模式只是我们现在的这个模式的一个线性延伸 ,而且你可能还不能延伸太远 ,因为我不希望把它做成一个一年亏上 3000 万 , 亏上 5000 万 , 对吧 ?
你就先融进来一笔钱 , 把它一年亏光了怎么一个程度 。
而且你现在也并没有说我要花钱的什么新的事情 。
那你就是一个更麻烦的讲法了 , 人家就会去加速 fashion, 你为什么要做新的这个事 , 你为什么不做老这个事 , 你新的这个事你通过什么数据来支撑你说你要去投入呢 ?
我觉得这个关键倒不是你跟投资怎么讲的 ,是说你本身就没有要做一个什么新的事 , 对吧 ?
我们觉得老的坑还有大量可以填的事 。 我觉得中国太多的 , 你可以看到现在市面上包括前段时间发的各种的开发布会 , 我觉得这是一个非常奇怪的点 , 太多的人都喜欢去讲我是 full stack AGCEFG 啥都会 , 我是拥有了 30 个行业的大模型 。
就像我看有些人写的 BPL 也很坏 , 我在 20 个行业落地 , 然后翻到最后一页 , 本次希望融资 1000 万人民币 , 难道不荒谬吗 ?
就是你在干嘛 , 对吧 ? 就我还以为这是个 200 亿的项目呢 , 结果你要融资 1000 万人民币 。 就是我觉得太多的人难道在讲这个事的时候不感到逻辑不自洽吗 ?
人家一个 middle journey, 对吧 ,他说我就干好一件事 , 我干 1 亿美金的收入出来 , 你为什么要干 20 件事 ,而且总收入加起来可能还不如人家一件事 。
就是又回到那个发论文的那个逻辑 , 你是觉得你干不好一篇好的论文 ,是吗 ? 否则你为什么要选择去干 20 个 30 个的论文 ?
所以本质是如果沿着你们本身的那个路线和产品 , 它需要的资源是线性增长的 ,并不是说我突然要很多钱 , 然后如果说要去干一个新的事情 , 你觉得是没必要的 ,而且也不对 , 就不是那样做事的方法 。
我觉得有一笔钱我们是可以把它投入到现在那个项目上把它显著加速 ,而且我觉得这个天花板已经足够到说我们砸个 1000 万美金去没有问题 , 这个天花板足够能容纳这 1000 万美金 , 对吧 ?
就是把它做得显著更好 ,但是有一个更广阔的一个市场 。
所以你们现在的产品显著加速 , 你的心理对它估算的需要的资源是 1000 万美元左右 。
有 1000 万美金我们肯定是可以把它显著加速的 。
那你们这一轮融资的目标金额是这个钱吗 ?
差不多就是这个级别 。
你们现在是自己在谈还是有机构在帮你们谈 ? 比如说什么投行啊 , 谁在帮你们谈 ?
前一段其实看了一圈 , 就是我刚才说的 , 我们看到的所有的财务机构最终状态的问题都是一个问题 。
因为就像我说的 , 我其实还是在一线会去做一些研发产品的事 , 所以我的角色恰恰不是一个说我要花 50% 加的这个时间去花在钱这个事情 , 找钱这个事情上, 找钱这个事没有正反馈 , 这是我最大的一个问题 。
你说没有正反馈是指你心里不够满足 , 就不是你喜欢做的事 , 还是就是 。
我不会认为这个事对我来讲有成就感 。 第二 , 我觉得所有人都是后见之明 , 就是他后面可以说你原来告诉我那个事 , 就是我觉得投资人本质上就这个行业面临的很大的一个问题是跟你去讲话的确实也 99% 都在胡说八道 , 所以你其实是在各种的噪音里面去找到信号 。
你说投资人接受的大局信息太多了 。
就是我说的那个 , 就是我看到 BP 也转给我的都是 , 那 20 个行业已经成功落地 , 已经深入到那个转给我的还有一页 , 对吧 ?
用 1000 万人民币 , 全都是这些乱七八糟的信息 。 所以恰恰呢 , 我觉得在这个行业里面就是我们实话实说是有问题的 ,因为不论你给他报一个什么样的数字 , 比如说对今年的收入的 prediction, 它都会给你打折扣 , 我们还是本着一个就是我觉得这事我能做到我给你报一个数 , 对 ,但这个数在被它折扣完以后会觉得这事就更没吸引力了 。
所以可能有些财务机构给的估值达不到预期 。
有各种这种潜在的问题 ,而且另外就是我们试图还是做到一个能够自给自足的那样一个状态 。
其实你这一轮拿了大公司的战头之后, 接下来会有财务机构跟着 。
对 , 这当然这就是另外一个问题 ,但是这说明什么呢 ?
说明这个世界就是这样运转的吗 ? 说明中国的现在一级市场就是这么运转的 , 就是你得有一个人拍板我领头 , 可能好我也跟点我也跟点 。
那机构们对这个事真的有判断吗 ? 就是那到底是就是有判断的没资源 , 没判断的有资源 , 就是始终我觉得是面临一个大的资源错配的一个情况 。
我觉得总体来说它最后就市场会让这个东西流动和平衡好的 。 我相信特别一线的机构还是有一些他们自己的判断的 。其实我现在这一轮还是投了很多项目 ,但是它钱也多 , 它可能发愁的是说我钱这么多我怎么要把它投出去 。
那就是另外一个问题了 。
但它投的项目还是反映了它的一些判断的 。
那反正我觉得就到这种比较大的节点上面 , 我觉得很有可能对于所有的不管是企业还是投资机构 , 这个其实本质上都是一个洗牌的过程 。
你现在对行业包括对你们自己要做的事还有什么困惑吗 ?
我觉得我们自己做的事就还好 , 就是把手上的事给做好 。 因为恰恰我觉得有时候这个问题是啥呢 ?
一部分人一定希望你预期一个五年级别的未来 ,但是那个东西能预测意味着你在做的这个事本身就是一个偏线性的事 , 你其实才比较好的去预测这个未来 。
如果你的很多投入是要冒着一定的风险去做一尝试 , 然后再拿到反馈 , 然后再进一步调整 , 然后再去投入的这种时候 , 你其实有的时候你其实不太能去做一个准确的预测 。
我觉得我们现在就在一个我不太能去准确预测五年的这么一个节点 。
了解 。 会有投资人和你说可能你应该更 aggressive 一些或者比较缺乏野心 。
我觉得还好 ,因为我觉得这事叫什么呢 ? 那你现在掏 2 亿美金出来呗 , 对吧 ? 本质上这个事你掏个 2000 万人民币 , 你说你缺乏野心 , 你这事缺乏说这个事的基础 。
但是你们确实也没有去找他们要更多钱 。
我觉得本质上也不是不 work, 我觉得是我们也没有疯到去尝试这件事的必要性 。 我觉得你都需要对于那个它得多么有判断 , 然后多么对你敢去做这样一个判断的这个程度 , 感觉下这个出来 。
我觉得没有是正常的 ,而且不应该期待这个事的发生 。 你好好把这个事给做好 , 你每年去把这个事往上推一步 。
了解 。 就今天特别感谢你的时间 。
本期 《 点点呈现 》 分享三个和其他期节目的呼应 。 一是开源的力量 , 这是 2024 年底以来被更多人关注和感知到的现象 。
而在 2023 年年初 , 这一次我们就聊到了好用的开源大模型并没有那么多 ,但是可以预见到开源会是一个更加繁荣的生态 。在 1027 节目 《DeepSeek 启动开源周 》 中, 我们有详细聊过大模型开源的分层 , 到底是在开源和分享什么部分 。
那期的嘉宾 , 美国西北大学博士生 、DeepSeek 前实习生王梓涵有一个很有意思的总结 , 她说野心最大的开源是想成为一种标准 。
二是关于具体技术路线的探讨 , 闵可锐提到预训练本身是一个比较重要的范式变化 ,而具体用什么架构来实现是不是 Transformer 其实没那么重要 。
这个观点其实和晚点最近发布的对阿里云 CTO 周婧仁的访谈相似 。 周婧仁在访谈中也提到 , 她觉得推理模型本身 ,也就是 O1 和 R1 这样的模型 , 可能谈不上一个范式变化 ,因为范式是很重的一个词 , 很大的变化才能称之为范式 。
她也是回到了这一次大模型变革的开端 , 认为预训练这种思路和方法本身是一个重要的技术转折 。在 104 期我们与 MinMax 高级研究总监钟怡然的节目中, 我们讨论了线性注意力趋势 , 这也是目前对 Transformer 的架构一个比较大的改动 , 或者也可以说是非 Transformer 本质上是 RNN 回归的一个探索方向 。
一度大热的 Mamba 等架构也是这方面的尝试 , 这反映了在整个技术社区里 , 对 Transformer 的改进甚至是新架构的提出也在不断的发生 。
三是如今被频繁讨论的大公司和创业大模型公司的竞争格局变化 。 虽然我们这次聊史 DeepSeek 还没有成立 ,但回头听我也有点吃惊 , 就是当时可锐就在想 , 比较传统的风口投资思路 , 大佬站台融数千万美元 , 快速模仿 OpenAI 也许根本行不通 。
中国 VC 可能会集体 miss 掉一个最有雄心的大模型创业公司 ,因为他们不会按传统思路出牌 ,他们也不是已经证明过自己会出现在投资机构视野里的人。
更多有关这两年变化的精细对比 , 可以听今天发的另一期节目 ,是和闵可锐 2025 年的访谈 。 本期节目就到这里 , 感谢收听 。
如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 LatePost。
下期再见 。






