开场0:00
大家好 , 欢迎收听本期 《 晚点聊 》。 我是雨桐 , 这次是我和曼祺一起跟爱诗科技聊他们的创业故事 。在上周 6 月 6 日, 爱诗科技的 AI 视频 APP" 拍我 AI" 在国内上线 ,在此之前上线 6 个多月的海外版 APP"PixVerse" 移动端月活已超过 1600 万 , 爱诗的全球用户已超 6000 万 。在去年下半年, 用户用 " 毒液 " 特效模板生成的视频在全球观看量超过 10 亿次 , 这比看过
《 毒液 》 这个电影的人还要多 。 现在点开 " 拍我 AI" 和 "PixVerse" 产品 , 我们能看到很多好玩的特效 : 把任何人物封装成一个小玩具 , 平地入海 , 变成美人鱼 , 让自家的猫跳科目三 , 或体验一次绿巨人变身 。
病毒式传播的产品的创始人是一位技术背景的 80 后, 另一位联合创始人是投资背景的 90 后 。 这次 《 晚点聊 》, 我们和爱诗科技联合创始人谢旭璋一起聊了聊非产品背景的创始人怎么做出爆款产品 、 怎么看待视频生成模型的新趋势 ,以及怎么一次次在高压下做出选择 。
今天很高兴邀请 PixVerse 做客 《 晚点聊 》。 我是曼祺 , 和我在一起的还有 《 晚点 》 科技组的作者雨桐 。
你可以先和我们的听友简单介绍一下自己 。
我叫谢旭璋 , 英文名叫 Jayden。 我现在在创业 ,在做一个公司叫爱诗科技 , 我们的产品叫 PixVerse。 我们主要的方向是做 AI 视频生成 , 我们自己做我们的模型 ,也做我们的应用 。
目前来说 , 我们的主要用户在海外, 我们国内最近也会正式发布 。 我在创业之前 , 我是原来在一直上我是原来一直上从业者 , 原来我在光源资本 , 我在那边负责他们的整个 TMT, 包括 AI 这些方向 。
因为你们之前主要的市场是海外 , 最近少进中国 , 所以我们可以先从最开始和现状这两头来聊一聊 , 就是可以给听友一个对 PixVerse 的比较快速的认知 。
其实我们是这样 ,因为我们公司长期人都比较少 。 我们公司大概两年时间 ,在 23 年的 4 月份成立了公司 , 我们在前一年大概就只有二三十个人 ,在去年大概可能我们现在整个公司大概 50 人以上 ,但整体的体量还是比较小 。
所以我们整体因为人比较有限 , 资源比较有限 , 所以我们在做很多方向选择的时候 , 我们会在早期的时候都会去做更多的聚焦 , 去做一些减法 。
所以这里面比如在选择市场的时候 , 我们最早的时候可能这里边毕竟国内外它的市场还是很不一样的 , 所以我们当时鉴于人数的限制 , 包括一些比如说我们这行业里面一些商业模式的一些考虑 , 所以我们就先做了海外市场 。
我们最早是在 23 年的 11、12 月份 , 我们在 Discord。
视频生成方向真的火起来 ,其实是 2024 年 2 月春节 , 就是 OpenAI 发了 Sora 之后, 对吧 ? 然后你们是在差不多那之前 10 个月就成立了 。
所以你们当时开始做的时候 , 就为什么选这个方向 , 包括当时视频生成是个什么状态 ,以及你和王长虎怎么认识 , 你们怎么组队的 。
创业缘起2:51
我先讲个前情提要 , 就反正我个人是原来我创业之前我在光源资本 , 我那边看 TMT, 看 AI,因为原来可能我们的机构 TMT 里面我们这个互联网移动互联网我们其实做得还可以 , 然后做了很多反正之前中国互联网上比较有名的一些 deal, 然后也投了里面一些公司 。
但是到了 22 年之后, 整个行业就有很大的变化 , 就感觉进入了整个移动互联网的黄昏 。 所以那个时候我当时自己的体感就是说当时有很多公司它其实数据 , 包括团队都非常非常好 ,但如果它是做互联网的 ,其实本身这里边不管是投资侧还是说业务侧都会有蛮大的阻力的 。
所以那个时候对我来说 , 我在看有没有一些新的一些事情 , 所以那时候我看到了整个美国当时在 22 年上半年的时候就有非常多做 AIGC, 当时叫 AIGC 或者叫文生图的公司 。
那个时候我最早一次接触到 Midjourney 或 Stable Diffusion 大概是在 22 年年中间左右 , 然后那个时候我当时就大概沉迷了可能一个月或者几周这样 , 我就每天都在 AI 生图 。
确实看出来投资行业不仅仅是因为投资人。
对 , 我觉得当时其实你确实应该花更多时间去看看新的事情 ,因为那时候可能在我觉得大家可能很多从业者在那个阶段都会去想有什么下一个大的事情或下一个大趋势是啥 。
那个时候我可能当时看到生成式 AI, 然后那时候我觉得文生图这个事情很酷 ,因为我是一个没有艺术细胞的人, 我画画很丑 , 然后也不会画画 , 然后也从来没有做过短视频 。
但是当时我发现文生图可以让我比如说我当时最有震撼的一个东西是我把我的名字就谢旭璋输到 Midjourney 里面 , 然后它出来一个很 fancy 的一个图 , 这图里面构图很精美 , 然后里面可能中间是一个人 ,他看着一个圆形的一个天空 , 然后天空反正有点玉的形状 , 跟我那个名字张我感觉有点关系 。
然后我当时觉得这东西太牛了 , 怎么技术已经发展到这个程度了 。 那时候我就觉得对我非常震撼 。
所以那时候我当时玩了很久的文生图 , 我当时还在光源 , 当时我们的团队还大家做了很多文生图 , 写了一篇小文章什么说我用 AI 帮我做了 100 张图 , 我们把那什么艺术史 、 图画史给看了一遍 。
我们在想人工智能的技术在人的创造内容的时间流上面来说 , 它属于一个什么样的一个工具 。 那时候我们还写了一篇文章 , 然后那时候我觉得还挺有意思 。
后来我发现这里边这个事情我们如果要去更深入去看的时候 , 我发现因为我不会写代码 , 那这里边我想去改变的东西都很少 , 我只能去基于已有的东西做事情 。
所以那时候我就想着那有没有可能我们去基于已经我看很多开源模型 , 能不能基于它做一些调整 。
我记得那时候那个时间点 , 当时我就在网上去发帖 , 我去找我的一些读 PhD 的一些高中同学 、 初中同学帮我发帖 , 看有没有做 AI 的一些程序员或者一些学者有兴趣大家去探索一下, 比如说整个基于文生图能做什么样的应用 。
所以那时候在 22 年下半年的时候 , 当时我找到了一些有兴趣参与的一些伙伴 ,他们当时主要在杭州 。 所以那个时候我很长时间每个周末我就去杭州跟他们一块去试着看在文生图里面能做一些怎么样的一些微调 , 能做一些好玩的东西 。
因为那时候我背在上海 , 所以我当时就每个周末我就跑去杭州 , 然后去在一个茶馆里面 ,有点黑客松 , 大家每天就去脑暴想能做什么事情 。
那个时候比较有意思 , 当时一个是当时有 Lanza 出来 ,Lanza 就是后来那个妙压其实是跟 Lanza 逻辑类似 ,但妙压晚了一年 。
但 Lanza 当时在美国 , 我记得当时上个周都很火 , 然后一个月已经有几千万美金的订阅收入了 。 那个时候还有一个技术 ,有一个微调技术 , 一个是 ControlNet, 一个是 LoRA 都出来了 。
所以这两个其实对于整个文生图的可控性 , 包括保持角色形象的一致性都有非常大的帮助 。 所以那个时候我们可能做一些探索 , 比如说我们想能不能把 Lanza 在中国 。
当时我们做了一些微调 ,但后来我们那个应用也没有上线 ,但当时在过程中其实积累了一些体感 。 当时我自己的感觉是这个事情应该会很大 ,但当时如果是一个 part-time 兴趣小组的形式 , 应该还是会很难抓到最核心的机会的 。
所以到了 22 年年底的时候 ,ChatGPT 发布了 。 发布之后其实中国在真正它资本上火起来其实是春节前后 。
那个时候我自己当然因为已经玩这个模型玩了一段时间了 , 我觉得可能这个东西在中国也会不一样 ,因为在美国已经非常非常火了 。
然后我就当时又去把中国所有的做生成式 AI 的公司基本能聊到我都聊了一遍 。 然后当时感觉就还是有机会 ,因为大家可能还是会想得没那么清楚 , 或者比如我会觉得我自己想的会比别人稍微清楚一点 。
在那个时间点 , 就是 ChatGPT 刚发布 ,22 年底的时候 , 中国在做生成式 AI 的公司比较主要的有哪些 ?
那个时候其实像现在的六小虎大部分都还没出来 , 都还没成立 , 只有 Meta 成立了 , 包括智谱 。
智谱 , 对 , 这两个成立了 。
对 , 成立了 。 然后包括有一些做稍微逆势一点 , 比如像当时做文生图也有一些公司 , 然后当时有一些做 3D、 做文生图的公司已经在成立了 。
然后视频当时我记得还没有聊到有哪些 。 所以那时候我感觉就是整个这个事情在海外或者在我的逻辑里面 , 这个事已经非常有意义 , 非常有潜力 ,但可能中国整个还没开始 , 然后大家的反应稍微慢一点 。
所以那时候我觉得那是时候应该去 all in 了 。 所以当时我记得就春节后我就先去提了离职 , 我就说但没想好做啥 ,但反正肯定是视觉生成相关的事情 , 然后我就准备去投人创业 。
然后这个是我这部分的故事 , 长虎那部分 , 长虎他的经历是原来在微软 ,在字节都有非常丰富的经验 ,他字节还管整个字节的整个视频视觉相关的一些 AI 技术 。
所以那时候其实长虎 ,因为原来我跟非常多字节出来的创业者有过合作 , 所以那个时间点在我去找创业伙伴的时候 , 长虎他也在找创业的合作伙伴 。
所以那时候我们经过一些字节的朋友介绍 , 我们交流一段时间之后, 大家觉得很多大家的方向上是有共识的 。
然后具体的开公司的一些 , 比如说资本 、 对外 、 包括大方向上, 包括可能比如他在技术产品 ,在一些前沿的科技理解上他是有优势的 , 这里面我们觉得大家比较互补 , 所以我们就决定说那一块做这家公司 。
所以在 23 年的春节后我们就去成立了这家公司 , 然后就开始了 , 大概是这个状态 。
当时王长虎一开始也是看到的是视频生成这个方向吗 ?
对 ,因为他原来过去的 20 年或 20 年以上之前都在做计算机视觉 , 做视频相关的技术 。 那本身这里边对于所有这个行业的人工智能从业者来说 , 都是巨大的一个机会 。
就视觉生成用人工智能来辅助人类或人工智能去生成内容成为了可能 。 那对于我觉得对于不管技术层面还是说未来潜在的在视频业务层面都会有很大的一些变化 。
所以我觉得那个时候因为他的 context 就是他原来在字节参与过很多现在知名的国民级产品的从 0 到 1, 背后的很多技术是他主导来做的 。
所以这里边他对于视频这块他也是有比较敏锐的一些嗅觉跟判断的 。
你们最开始是不是融资不顺利 ? 因为你们最开始成立那会儿好像大家更关注的是大语言模型的创业 , 视频生成那会儿不是那么热 。
我们其实第一轮融资还算比较顺利 , 我们第一轮融资很快就我们可能出来融资了几天我们就敲定了 。
当时有一个产业里面比较有名的投资人他就决定投资我们 , 然后包括我的原来老东家 , 包括我们自己个人都在里面 , 包括我们团队都放了一些钱 。
所以第一轮我们其实是相对比较顺利的 。
所以就是你们在 23 年的时候并没有那种所在的领域不是一个很火的感觉 。
我觉得我们还是比较幸运的 ,在那个时间点其实做整个视觉生成方向的创业公司没有那么多 。 然后我们当时团队的一些 background, 包括我们的一些想法 ,在我们的股东看来还是比较有意思的 。
所以当时我们最早我觉得还是比较顺利的 。
产品现状10:24
那就是开始吗 ? 然后我们可以加上现在的情况 , 就是你现在可以总结一下 ,因为你们成立差不多是两年多 ,24 个月 , 就爱诗现在做到了什么 , 比如说产品上 、 收入上 、 用户上, 你们现在大概是个什么状态 ?
我们现在大概几个点 , 先从模型讲 , 我们模型都是自己训的 , 我们大概在过去一年多时间里面训了七代模型 , 我们把它叫做 V1 到最近是发了 V4.5, 我们大概发了七代模型 。
我们的模型 , 我们的体感 , 包括很多的评测 , 包括一些主观 、 客观 、 盲测里边 , 我们模型都是排在全球比较靠前的位置的 。
然后这个是模型侧 , 然后我们在产品侧 , 我们目前的用户量应该是全球排在最前面的 , 我们大概有 1000 多万接近 2000 万的月活跃用户 , 然后分布在我们的移动端跟网页端 。
然后我们应该是全球最早能过千万月活的视频生成平台 。
吉梦现在是多少 ?
我觉得吉梦跟我们产品还会有一些不一样的地方 ,因为吉梦的里面蛮大的一个比例还是在做文生图或者图相关的社区 ,但我们的平台基本是视频为主 , 我们其实没有提供生图的能力 。
你为什么关注月活 ? 月活比日活更好在哪里 ? 这个指标 。
因为我觉得这个行业比较早期 ,因为大家的产品形态坦白说现在还是一个工具或者一个付费工具的形态 。
然后我觉得大家其实离所谓的社区或者离一个这种 。
就每天用的那种 。
对 , 这个还是会有一些 gap。 我觉得这里面对大家来说 , 包括我们现在其实大量用户不付费是没有核心体验的 。
所以这里边我觉得首先很多指标上面 , 包括大家可能看的很多指标 ,其实会以月的维度看更多 ,但我们自己内部月跟日都会看了 。
对 , 你正好可以讲讲就是你们的产品是一个什么样的形态 ,因为不是所有人都用过 ,因为之前主要在海外 ,而且你们的形态比较特别 , 就它其实不是给专门做视频的人用的 。
我觉得我们产品形态还蛮有意思的 , 就是首先是最早这个行业 , 我们先回到这行业最早的时候 ,其实大家的产品最早是 Runway 在做这个行业 ,但 Runway 这个团队它的背景是更偏设计 , 更偏专业影视制作这个方向 。
像我去年在美国跟 Runway 的一些朋友也有交流 , 然后当时比较有 , 我就问他们你们两三年内的 vision 是啥 ,他们说想拿奥斯卡 。
然后我觉得这个比较明确 , 就是他们希望说他们的训的模型 ,他们做产品是服务于相对比较专业的影视行业的 ,但因为他们在这行业里面其实是先行者 , 所以很多后面进来的人都会去参考他们的一些产品路径 。
我们最早的时候当然像我们的网页端产品现在也是服务很多专业的一些影视创作者 , 很多这种专业的 video creator 其实在用我们的网页端产品在创作 。
我们的网页端的用户量应该也是全球前几名的 ,但这个 market 对我们来说 , 就后来我们自己经历过过去一两年时间的一些探索之后, 我们觉得可能这个市场有机会 ,但可能更大机会其实在一个更偏移动端 、 更偏 to C 的一个市场 。
为什么呢 ? 就是包括像昨天我正好跟一个国内比较顶级的影视公司的一个高管 , 我们在交流 。 就现在我的体感或过去一年的自己感觉是 , 大家所有看到的所谓的 AI 视频 , 大家可能看到很多微信视频号里面各种各样的这种所谓的 AI 视频 , 它本质上 AI 在里面的参与的程度可能只有 10% 到 20%。
就比如说我们去想象一个视听作品 , 它最核心的是什么 ? 它最核心其实是一个是剧本 , 包括这里边剧情怎么去开展 , 不同的片段之间怎么衔接 , 那这些其实都是人的 , 目前的所有的视频都是人的工作 。
现在 AI 其实还没法把不同片段 、 不同剧情的推进这个事给做好 , 还是人去大量参与的 。 现在 AI 能解决的是部分的视频素材的生成 ,但本身我们去看视频素材这个模态或这个模块 ,在一个视听作品里面它的重要性或它的占比很重要 ,但它并不是这个视频的全部 。
视频是一个完整的一个视听作品 。 现在 AI 视频能解决的是单一模态的素材生成问题 , 那不管是从逻辑 , 比如偏语言模型 、 偏逻辑层面 , 还是说到声音 、 配音 、 配乐 , 到可能多模态的结合 , 这里边其实 AI 视频能做的事情我觉得未来会有机会 ,但目前是有限的 。
所以在这行业里面最后的交付来说的话 , 那么 AI 视频是没法在专业创作领域目前的技术发展没法实现真正端端端交付 。
所以它能够去 contribute 的比例是相对有限的 。 所以我们就会去思考说那在什么方向上它是有可能端端端交付的 , 包括什么样的市场可能是一个更大 、 更有意义的一个市场 。
那我们就去看 , 我们去看整个视频行业的发展 。 虽然说现在的比如说电影院 、 电视机这些渠道都还存在 ,但是大家也都知道现在视频里边最大的用户量或者最大的一个被使用的渠道其实是在移动端的短视频平台里面 。
大量的人其实是在看中短视频的这样的一个需求 。 同时我们觉得说这样一个 AI 生成的新的技术 , 当然它可以帮助原来的一些视频行业去做提效 、 去做降本 ,但是它更大的机会可能是怎么去把现在目前一个巨大蓬勃发展的短视频市场去能解决这里面的问题 。
那我们就去看短视频市场里面会有哪些可能还存在的问题 。 那我们可能就会发现说在这个世界上每天有几十亿人看短视频 ,但是我们去想想身边有多少人能够真正做一个病毒式的 、 有热度的 、 有人去看的短视频 ,其实可能非常非常少 , 可能是 5%、10% 不到的短视频的消费者有能力去创作短视频 。
你这个应该说高了 , 肯定没有 5% 到 10%。
对 ,但早期的时候可能像抖音跟快手投稿率应该最高是能到 10 个点以上吧 。 现在我估计可能一个是投不集中, 第二是可能大量的长尾创作者其实拿不到流量的分配 。
但是同时我们去看这个行业的发展 , 就整个视频又变成了人跟人之间或者说信息传播最重要的媒介 , 特别对于年轻人来说 , 大家其实现在看各种各样的东西都希望通过视频来获取信息 、 获取内容 。
但这个情况下, 那么视频是一个很重要的传播媒介 ,但是只有很少的人有能力去创造或者说用视频来去讲述一些信息 、 传递一些信息 。
那我觉得这里面就有很大机会 。 所以我们最早就想那怎么能让普通人用 AI 做出来第一个好玩的 、 跟自己有关的 、 跟自己身边的环境 、 生活有关的视频并且发布 。
毒液模板16:25
那我们就想去解决这个问题 。 所以大概我们在发布第三代模型的时候 , 我们就出了很多叫模板的玩法 , 当然最火的一个效果叫毒液变身 , 当然可能有很多听众或者你们可能也在国内或者海外有看到过 , 就叫 We Are Venom, 就是当时在毒液上映的时候 , 那个月应该有全球几百万人玩过我们毒液变身那个效果 。
它的效果 basically 就是说让任何人可以把自己 、 把身边的宠物 、 朋友一键变成毒液 , 然后它的过程跟它结果都是 AI 生成的 , 都是有不确定性的 , 都是很酷的一个效果 。
然后那个月其实就是我觉得这样的一个模板化的玩法 ,但是毒液的爆火其实充分验证了我们的一些想法 。
我们觉得说这可能是全世界第一次是 AI 视频生成模型被广泛的普通人去使用并且传播 。
因为这个模板玩法你们应该是 24 年下半年上 。
对 。
所以你们就是在思考说从更专业的用户到这种再次用户 , 这个思考的时间是发生在 24 年年中左右 。
我们其实很早就想去做 to C, 当时可能我们也接受过一些访谈 , 包括接触过一些对外也去讲过一些东西 , 我们就是想做 AI 视频怎么样能够去 to C 去服务广大的普通人。
但我觉得一个是技术发展 , 它有不同的阶段 ,在可能最早的那一代视频模型的时候 , 它可能对普通人来说还没有太大的使用场景 。
然后第二个是我们自己的思考也在迭代 , 所以在我们第三代模型出来之前 , 我们就感觉到图生视频或者说图生视频给普通人在手机上使用是一个非常大的一个机会 。
所以那个时间点我们就去基于这个方向 , 我们迭代了我们的模型 ,也迭代了我们的产品 , 然后最后来毒液就集中了一个我们的一些思路的一些体现 。
就可以说模板玩法是你们的目前的一个比较大的特点 。
是的 ,但模板它本质上是怎么能让普通人用很低的门槛来去使用视频模型做出来一个高质量的内容并且分享 。
因为对普通人来说他其实根本不 care 是不是 AI,他 care 是怎么样能够简单的做出来有趣 、 好玩 、 能分享的东西 。
那么我们之前觉得说模板就是它最重要打掉两个东西 , 一个是不需要去写提示词了 ,因为写提示词对于用户来说非常非常难 , 就 95% 以上用户我猜测应该都写不好提示词 , 特别是长的提示词 , 甚至它可能比拍照 、 拍视频要更难 。
另一个是通过模板化的方式我们大大提高了抽卡率 , 就它其实不需要抽卡了 , 大概率我们都是能去 deliver 一个高质量结果的 。
这里面我觉得其实是我觉得核心的解决的一些问题 。
收入增长18:49
你也可以讲讲你的收入情况 ,因为有一次就是 24 年底 , 我们不是聊过一次吗 ? 你当时有讲就是什么圣诞节的时候你们在拉美赚了很多的钱 , 你可以讲讲这个 ,也是跟一些模板有关系 。
反正我们应该这段时间我了解应该是做 AI 的应用或者做 AI 模型应用的公司里边收入增速比较快的 。
我们过去几个月我们收入可能翻了十倍 , 单月的收入 , 我们现在大概单月收入已经过了千万人民币了 , 都是海外的订阅收入 ,而且收入质量还比较高 , 我们这里面毛利是比较高的 。
那你们一年的 ARR 现在是多少 ? 算订阅的话 。
因为我自己个人觉得 ARR 这个东西比较虚 , 我自己不是很信 ARR 这个概念 ,因为到底什么是 recurring 的 。 我觉得我们的收入是比较可持续 ,因为它都是大量的海量用户在付费 , 然后他们也是有续费的 。
你刚说 ARR 比较虚是为什么 ?
就是我之前跟很多美国的投资人或者从业的朋友或者国内朋友去探讨 , 就说 ARR 到底怎么算 。 就因为我的概念里面的比如 SaaS 里面 ARR 它是要 recurring, 它要比较能重复 , 就它是需要有计算的 。
但我发现现在很多人算 ARR 它其实是比如把一天的收入乘以 365, 或者把一个月的收入乘以 12, 然后我感觉跟我概念里面的 recurring 会不太一样 。
另一个是我的概念里面其实因为我原来看 TMT, 就互联网行业其实 to C 行业没有什么 recurring, 就比如说你说腾讯游戏怎么算 recurring, 就 《 皇者荣耀 》 它不 recurring, 每个人都是单次充值 , 它其实本身 recurring revenue 是一个我觉得 SaaS 行业的一个概念 。
但我觉得比如在我们其实在做的东西更偏 to C 一点 , 虽然说也是订阅这个模式 ,但我觉得本身对我们来说有意义的是去考虑比如说我们的收入 , 比如说本身的增速以及我们收入是不是可持续的 , 我这里面用多少人在付钱 , 我的付费率 、up 付跟它的复购 , 这些对我来说更有意义 。
你们现在除了订阅之外没有别的收入方式 , 没有别的商业模式 。
我们在探索整个 API 的收入 ,因为确实有非常多找过来想去接我们 API 的一些合作伙伴 。
就是 to 开发者和 to B 的 。
to 开发者或者 to B 的收入我们也在做 , 就国内外现在有蛮多的合作方已经接了我们的 API 再去做 , 对我们来说也是通过合作方去服务好一些它终端用户的一个方式 。
就是从你 23 年 4 月份开始创业 , 算正式你们公司开始运营吗 ?
对 。
然后到现在中间发生了哪些事情是非常超出你的想象的 , 给你带来觉得还挺不一样的体验 。
我没有想过我们能一个月有 1000 多万人涌进来去玩我们的产品 ,因为这个在互联网里面也是一个很夸张的数字 。
是哪个月发生的呀 ?
就最近其实都在发生 。
最近每个月都是 1000 多万人。
对 。
对 ,因为你们最近是 1000 多万的热火 。
对 , 我会想想其实会觉得 , 我就想想以前在看互联网的时候 , 好像也很少有创业公司能在产品发布的前几个月就有这么多的人会涌进来看 ,而且特别是在整个互联网的流量红利已经结束的状态下 。
所以我觉得本身 AI 还是代表了新的一个可能性 , 你打开了不管技术还是说应用上的新的可能性 , 才会有新的流量红利出来 。
你们从产品发布到有 1000 万的月活是中间几个月 ?
首先是这样 , 我们网页端它其实跟我们最终产品还是有 gap, 我们在移动端发布之后第一个月就过千万月活了 。
移动端正式发布是在 24 年的 。
年底 。
11 月左右吧 ,11、2 月左右 。
12 月份 , 我们 1 月份就已经过千万月活了 。
因为你们今年也上线了信息流的功能 , 就是在你们自己的 APP 里面 , 比如说我是一个用户 , 我是可以发帖发到你自己的 APP 里的 。
对 。
因为之前你的玩法 ,因为我也在用 , 你的玩法是我生成一个视频之后, 我是可以一键转到什么 Instagram、Snapshot 这种地方 , 然后现在你也可以发在自己的 APP 里 , 就相当于它是有点像一个内容社区了 。
这个功能上线之后你们观察到什么变化了吗 ?
我觉得首先是我们现在还做得很初期 ,因为我自己的观点是整个 AI 行业的产品化都很早期 , 就我们可能很难拿移动互联网成熟的产品形态去看 AI 行业的产品 。
因为比如举个例子 , 就是移动互联网里面它不会让创作者去 , 比如说抖音它不会让创作者去订阅的 , 它是鼓励大家创作 , 它认为可以创作者去分钱 。
但是因为 AI 行业它有推理成本 , 包括行业发展比较早期 , 所以现在其实很多创作的范式跟创作的模式跟互联网成熟产品是不太一样的 。
所以我觉得很难拿传统的概念去套在 AI 行业里面 。 但第二个 , 对我们来说我们也是想去探索社区的可能性 ,但我觉得要一步步来 。
对我们来说最有意义的还是说怎么能去吸引更多的没有做过短视频的用户第一次来我们这用 AI 做出来一个有意义的短视频并且发布 , 这个是比较重要的 。
然后同步我们也希望说有没有可能让他们里面有创意的一些人也能去做出来一些他们觉得好玩的模板 , 然后分享给别人一键做同款 。
这里面我觉得这两个事是我们会去探索的 。 然后整个比如说内容消费社区 , 我觉得这个事我们会一步步探索着来 ,不怎么卖太大 。
对 , 就你们现在有些模板并不是你们自己想出来和运营的 ,是用户发上去的 。
对 , 它现在更多是通过投稿这些方式 , 还没有一个直接的一个发布链路 ,但我们后续这块也会去考虑 。 因为像我们线上有一些模板或者一些玩法 ,其实用户自己探索出来的 , 我们觉得其实用户的创造力跟创意是无穷无尽的 , 我们的创意是有限的 。
我们希望说未来我们把整个架子搭好 , 让大家上来唱戏 。
假如说我是一个用户 , 我做了一个模板 , 用户能不能来用的话 , 那我可以在这个系统里面给我什么奖励吗 ?
能给我分点钱吗 ?
目前还没有 , 我们在思考 。 但我觉得很多时候其实对用户来说就被人看见 , 会被人去认可他的创意 , 我觉得就是最重要的 。
就影响力本身是一种激励 。
我觉得这个可能就在第一阶段就很重要了 。
简易的很多模板是不是就会给创作者分钱的 ?
是的 ,他们会有一个非常专业的做简易里面特效创作者的生态 。 对 ,但我觉得就创作者跟用 AI 视频特效创作者还是会有一些差异化 , 会不太一样 。
因为我们的用户其实一般更普通的人 ,他可能都没有做过 。
更泛 C 的人。
他可能都不知道怎么剪视频 ,他可能都不知道怎么拍视频 ,但这些人可能第一次做视频可能就用我们做的 , 然后我觉得是一帮新的一帮 creator。
对 , 然后你刚才说的就是 API 的业务的探索 ,以及你们 24 年年中的思考 , 就是说视频生成其实在制作一个完整的视频里面它只占了一部分 。
对 。
那现在这件事情有变化吗 ? 因为其实现在会有一些产品 , 它比如说是用你的或者用可灵的 Midimax 的模型 , 它自己主要是做应用的 , 比如说今天刚上线的 Midio。
明白 。
还有刚才我们也讨论说跟 Midio 很像的 , 像 Pupit 还有 Creative, 它都是接了很多不同的视频的模型 、 语音的模型 , 然后大语言的模型 , 可以给你在一个流程里面既生成视频又有语音又有配乐还有字幕 。
对 。
就这种方向会是你们考虑的吗 ?
我觉得我们会考虑 ,但同步我们也会去看 ,因为这里面我觉得最核心还是说它是一个多模态的生成问题 。
现在各个模态之间我觉得还是比较割裂的 , 比如怎么去让视频跟声音 , 声音里面又包括了音乐 、 音效 、 人声 , 然后跟比如逻辑 , 逻辑代表比如剧本怎么去推进推演 。
这里面其实多模态的生成我觉得是一个还没被很好解决的一个问题 。 如果每个模态都有一些问题的情况下你去把它组合起来 , 它可能会有更大的问题 。
所以这里面我觉得我们会跟很多同行一块去探索 , 我们也很愿意给像去探索这块的公司提供 API 让他们去做探索 。
但我个人觉得目前来说我的机会很大 ,但是各个模态的问题都还是存在的 。
对 , 我觉得它可能就使用门槛会高一点 , 就我刚描述的那种产品形态 , 它是更面向专业的做视频的人。
对 , 包括我觉得现在 AI 行业有很多概念 , 很多 demo,但是实际上比如最后这个产品它到底想做什么 ,其实最简单比如就看它进去之后第一屏它主推 feature 是啥 , 那个可能是最核心的 , 别的 feature 可能更多是一些尝试 。
那我觉得这里边就是包括像你刚才讲的很多产品 , 它们提供很多功能 ,但最核心的需求或者场景可能一开始不会有太多 。
那从最开始到现在的这 24 个月里面 , 如果总结一下的话 , 爱诗做的几个比较关键的决策是什么 ?
我觉得最早的可能就是做视频生成 , 这个是我觉得第一个重要决策 。 然后第二个重要决策是就是我们不要去过度花钱来去训练模型 , 应该是用一个比较稳健的方式来去让大家接受资源有限的前提条件 , 然后基于资源有限的条件去提高每一代模型迭代的效率 , 这个对我们我觉得也是比较重要的 。
然后第三个我觉得是说整个产品化方向上去在整个 to C 上做更多探索 , 然后包括去做整个低门槛模板化创作这个场景 。
生存策略27:15
对 , 一和三其实刚才讲过了 , 第二个可以再展开再聊一下 。 你说的让大家接受不要花那么多资源去训模型 , 这大家指的是 ?
就我们更多是内部了 , 就内部了 。
就你们自己的研发团队是不是 ?
是有过能够消耗过度挥霍资源的时候吗 ?
对 , 我们其实一直都还是储备了比较充裕的资金的 ,但我们一直还是用一个比较稳健的经营或者花钱策略在去训练我们的模型 。
因为现在回头来看 , 我们大概训练出来目前这个模型可能做得还不错的这个模型 , 我们用的资源或者用 GPU 的数量应该是很多同行的十分之一 , 甚至可能二十分之一 。
去年我们这个时候聊的时候 , 王长虎说如果你们有更多钱 , 你们买更多卡的话 , 你们会更早的训练出 Sora。
是的 。
现在回头看并不后悔了是吗 ?
对 , 当时首先是我们也没有十倍那么多的钱 , 就是我们当时比如我们也不可能多十倍资源 ,因为我们的钱虽然充裕但也没有那么多 。
但另外一个是我们也希望说更多是把组织的效率给做上去 ,而不是说比如砸钱 。 因为毕竟我觉得 AI 创业公司在中国开始它不会像美国一样有这么充裕的资金支持 , 大家需要更多提升效率 , 通过效率来去解决更长期的问题 。
因为你把这个称之为一个决策 , 那就说明另一种做法就是我花更多资源去模型 ,在当时是一个选项 , 对吧 ?
我觉得也是个选项 。
对 , 那这个选项比如说是行业里有什么其他的人在往这个方向做 , 你们是看到其实它效果也不错 , 是一个可参考的借鉴的方式吗 ?
可灵应该是花了蛮多资源的 , 具体我量级不知道 ,但可灵应该比我们资源跟人数都要多蛮多 , 然后它做的也蛮好 。
但我觉得更多是一些可能不是正面的例子 , 更多可能包括国内外的很多大厂在这个事上面其实投入的资源也很多 。
然后但可能目前的模型训练我觉得遇到一些瓶颈 , 所以我觉得本身还是个非常难的技术 , 它不是说通过砸钱砸资源招足够多的人就能解决的 , 它对于团队效率 、 团队的一些认知 、 团队的一些做事情的方式的要求还是非常非常高的 。
你觉得在全球范围内 , 视频生成行业里面公认的比较头部或者说第一梯队的模型是哪几家公司做的 ?
就首先我觉得两个 , 一个模型的能力 , 我觉得这个本身模型评估其实相对比较主观的了 。 我自己的概念里面 , 比如海外 Google 做得很好 , 然后国内的话我们同行像可灵 、 像海螺做得都很好 , 我们自己觉得自己做的也不错 。
从用户量来说 , 这行业应该用户量最大的三家公司都是中国公司 , 就刚才我讲的三家中国公司 。
就是可灵 、Midimax 和你们 。
对 。
你刚才没有提 OpenAI。
对 。
所以大家认为 OpenAI 的视频生成已经不算第一梯队了吗 ?
对 , 我们觉得 Sora 的最后 deliver 的模型跟它当时 demo 的差距非常非常大 , 差了 10 个 PixVerse。
差了 10 个 PixVerse,OK, 所以他们这是属于有点超前宣传了 。
对 , 我觉得其实开了一个不太好的头 , 就是导致 AI 行业其实从那个时候开始就非常多公司发一个 demo, 然后说我做到了什么 ,但实际上只是交付不了实际的模型跟产品 。
但我觉得这里面本身其实你现在去看 Sora, 它我之前看过好像外网有一些人想用 Sora 现在的模型去复现它一年前 demo 效果 , 好像没有人能够成功 。
所以这里边我觉得还是 demo 或者理论跟实践或者跟产品的 gap 还是会蛮大的 。
因为我们 24 年 11 月的时候聊过一次 , 那会儿你刚从美国回来 , 你去了美国一段时间 , 然后 25 年 2 月我们又聊过一次 , 然后这两次我是明显感觉到你状态变化挺大的 。
我不知道你还记不记得 , 反正 24 年 11 月我们见的时候感觉你是比较 。
焦虑 。
比较焦虑 , 对 , 比较焦虑 。 然后到 25 年的话就可能你们的数据然后什么都起来了 , 状态就会好很多 。
你觉得这个过程中间行业和你们自己发生了些什么变化 ? 因为这个时间其实比较短 , 就大概三四个月的时间 。
对 , 我觉得几个点吧 。 第一个是我觉得整个我觉得国内的很多环境或舆论导向 , 大家会默认说所有的 AI 领域或者美国比较前沿的技术会显著领先于中国 。
比如在大家去年很长时间里面大家都在尝试复现超越 Sora 的时候 , 我觉得这个论调其实是比较大家会觉得好像差了很多 Sora, 包括我记得去年有一些大厂的创始人会讲说可能中国 10 年、20 年都做不出来 Sora,但我其实当时就觉得其实跟我们实际拿到的信息不太一样 。
因为像当时其实我觉得可灵其实对大家是很大的一个提振 ,因为可灵当时 6、7 月份开了一个发布会 , 然后当时他想请很多同行去给他捧场 ,但最后好像只有我们去了 。
然后那个发布会上面我们就一直在夸可灵 , 说可灵是在视频大模型或者在很多基础模型领域里面第一次中国团队跑得比海外要更快 。
这里面我觉得有一些逻辑或者有一些事实 , 比如说我们去看过去的几年的中国或者全世界视频行业的发展 , 那么其实不管在技术还是说产品层面 ,其实中国的公司是跑得比较更快的 。
过去几年最大的新的短视频平台 , 像最早的快手 , 像后面的抖音 、TikTok,其实都是华人或者华人公司做出来的 。
这背后除了产品之外, 它背后也培养了非常多的做视觉 、 做视频 、 做视频相关的技术这块的算法专家 。
所以本身我们相信在这里边中国的公司或中国顶尖的工程师的储备是很充裕的 。 所以我觉得本身其实可灵或者说我们或者说海螺能在这行里面做得还不错 , 我觉得它也是有一定的底层逻辑 ,有一定人才储备的一些基础的 。
所以这个变化就是在 24 年 12 月圣诞节的时候 ,OpenAI 终于把 Sora 放出来了 , 大家看了觉得好像也没什么 , 然后后来春节的时候 DeepSeek 又特别火 , 让大家信心更大了是吗 ?
对 , 我觉得 OpenAI 这个事情我觉得对这行业有好也不好 , 就是本身它还是一个行业很多风向的引领者 , 它做得比较拉胯 , 那其实不一定是好事 。
那另外一个确实我觉得也验证了我们一些想法 , 就是确实可能这个技术就是很难 , 那我们或者中国很多华人团队是能够做得很好的 。
那你觉得就是在今年 OpenAI 释放了 4O 文生图的功能 , 然后它自己说是用自回归做的吗 ?
对 。
这件事情有对你们有什么新的启发或者影响吗 ? 因为它也有可能接下来会把这个东西做到视频生成里面 ,而且中国的公司里也有 SandAI 在 4 月下旬的时候它发了视频生成的模型和产品 ,他们就是用自回归的方式来做的 。
明白 , 我觉得这些 4O 的 image generation 它做得非常非常好 , 这里面它把可能很多可控的生成 , 包括对一些复杂语义的理解都做得非常非常好 , 包括背后的 AR 相关技术路径 , 我们其实一直也有在探索 。
但我一个是我觉得 OpenAI 现在视频这块它可能也在尝试 , 然后我们自己也在尝试 , 我觉得我们不一定会比它慢 , 我们也在这块做很多工作 。
但即使有了自回归或者说跟语义或者语言输入做得更好的一些视频生成 , 我觉得也不一定 , 比如在 to C 这行业就最有意义 。
因为像我刚才讲的 , 可能 to C 的用户他就是不会去写字或不会去写 prompt, 那可能对于很多专业用户来说可能是一个有意义的帮助 ,但对于普通人来说可能最后他更在乎的是还是模型的能力 , 模型的效果 , 怎么能更方便的去使用 。
所以这块我们也会做很多探索 。
那接下来正好就是从你们的产品选择可以聊到一个 AI 应用创业比较老生常谈的问题 , 就是你们和大公司的竞争 。
因为你们现在做的是一个 to Fan C 的产品 , 你刚才其实也提到就是奇梦和你们不是那么相似 ,但是也有一些重合的部分 ,因为它里面也有图像视频的部分 。
然后另外就是你们现在做的这个模板其实在抖音和快手里面 , 它自己带的就有这个东西 , 比如说你在抖音里点抖音加的部分就会有 AI 特效可以选 ,而且你们甚至都有些一样的特效 , 比如说什么微波炉的那个我看你们也有 。
对 。
就是这头跟你们在做一些相似的时候 , 你觉得你们跑出来的机会是什么 ?
我觉得首先是有几个层面的问题 , 就首先是我们本身一个是这个模型 , 它本身这个产品它背后的基础是整个视频的模型 ,在模型的迭代上面我们对自己还是比较有信心的 。
因为现在我们的迭代速度 , 包括我们模型的一些效果 , 包括比如模型的生成速度 , 我们现在在全球都还是排在比较前面的 , 所以我们觉得技术上我们的效率能够保持下去 。
然后这个是可能做产品化 , 包括说产品迭代的一个很重要的基础 , 这块我们对团队的迭代还是有信心的 。
然后第二个是我觉得我们在面临的这个市场 , 就视频行业它一直不是赢者通吃的行业 , 就是不管在国内还是海外, 我们去看整个视频行业发展 , 就是现在电视台 、 电影院还存在 , 它也没有被优酷 IT、Netflix 取代 , 然后优酷 IT、Netflix 它也还存在 , 它也没有被抖音 、 快手 、TikTok 去取代 。
我觉得这里面本身视频它是一个还在发展 、 还在快速变大的一个行业 , 现在有短视频 、 有长视频 、 有直播 、 有各种各样的群平台 , 本身视频是一个非常大的一个商业的生态 , 就是视频它不是一个垂直赛道 , 它是很大的一个行业 。
然后我觉得我们在做的事情是 , 我觉得更多从解决问题角度来想 , 我们在解决的是这个行业里面依然有非常多的人没有做过视频 。
我们看到过去视频行业的发展 , 它一个很大的驱动因素就是随着有更大的内容供给或更不一样的内容供给 ,有更多的人参与到视频创作里面 , 会带来新的产业的一些发展 。
我们觉得 AI 视频生成也会有类似的作用 ,但这个情况下我们觉得它是一个很大的一个增量的一个蛋糕 , 它不存在说比如说一个大公司它就把所有事情干掉了 。
而且现在我们想的还是比较清楚的 , 我们觉得在海外市场 , 包括国内市场还是有很大的一个新的机会的 。
因为你们已经在海外运营了一年多 , 就实际上海外的这些视频平台对你们压力大吗 ? 还是你们更多是合作的关系 ?
因为你可以分享到那些地方 。
我感觉好像没有太大压力 , 包括我们现在其实我们的用户不仅分享到 TikTok 或者 YouTube 或者 Instagram, 很多人分享到 IM 里面 , 分享到它的社交网络里面 , 就比如说社交网络 , 它的通讯工具 , 就比如说 Telegram。
就因为我们就想象比如很多用户他做出来的好玩的跟自己有关的内容 , 可能也不一定就都适合发到公寓里面 。
很多人是愿意发群 , 比如我自己 , 我就天天在各种群里面给大家做视频 , 然后大家都很喜欢 。
所以我们观察到很多用户他其实也在他自己的圈子里面 , 或者自己的群聊 、 私聊里面 、 朋友圈里面去做分享 。
然后这个我觉得也是很重要的 , 就是我觉得本身海外的这个市场 , 它的渠道分布 、 用户的场景它就是更多元的 。
我们在这里边我觉得本身一个新的一个创作方式 , 或者用视频来分享生活 、 分享创意的方式 , 我觉得就是有一个很有意思的一个新的一个市场 。
对 , 你说的这个场景前几天我们科技组的同事也都在用这个东西 , 我们也都是在我们的小群里在传 。
我们去看到比如说最近如果大家能去使用 TikTok 的话 , 大家可以 TikTok 上比如去搜索 PixVerse, 我们能看到非常多的普通人, 就可能从来没有做过火的短视频的普通人 ,他这辈子第一个可能 1 万 、10 万 、100 万赞的视频就是用我们做出来的 。他可能对他来说就很简单 ,他只需要把自己的宠物拍个照或者拍个视频 , 让它跳个舞或者让它做些动作 ,其实就会吸引来非常多正反馈
。 我觉得这个其实是让非常多普通人第一次拥有了自己的生活 、 自己的创作被人看见的链路 。 以前可能受限于创作的能力 、 创作平台的流量分配的逻辑 ,但现在我们是真的能让普通人第一次做出来高质量的视频 ,而且每个都不一样 , 每个都很好玩 , 跟自己生活有关 。
我觉得这个是我们看到的 , 我觉得蛮令人兴奋的一个新的机会 。
你们为什么这个时间点要进国内的市场做中国的产品 ?
进入中国38:26
我觉得几个点 , 我们本身最早就是想做一个全球产品 , 然后中国也是全球里面非常大的一个市场 , 然后我们一直还没有进入这个市场 。
之前因为可能团队经历 , 包括我们一些可能早年因为人太少了 , 经历顾不过来的原因还没有进 ,但我觉得现在的时间点其实蛮好的一个节点 。
因为首先我觉得 AI 视频的一些场景已经被探索过了 , 像去年我们在毒液变身最火的时候 ,其实当时中国也有非常多人在使用 ,他们可能当时我记得那个月应该中国我猜测应该有个小几百万人来用过毒液变身 , 应该远远比看过毒液电影的人要多 。
同时当时我记得有很多人在闲鱼上会发帖 , 就找人去帮他去代做毒液变身的视频 。 所以我觉得本身这里边其实中国用户的付费意愿或者使用意愿 , 我觉得其实是一样的 。
做一条多少钱 ?
我记得当时最贵挂到 20 块钱做一条 , 一般来说可能是几块钱做一条毒液变身 。
又错失一个赚钱的机会 。
对 , 所以当时其实我在闲鱼上看到很多人通过这个来去帮人做赚钱 。 所以我觉得本身视频它是一个很通用的一个媒介形态 , 就比如在美国大家喜欢看的好玩的视频的玩法 ,在欧洲好玩的玩法在中国是一样的 。
就我觉得本身视频是一个更通用的传播媒介 , 更普世的一个沟通方式 。 所以我觉得这里边中国我觉得很多需求跟海外不会有太大区别 。
另一个是我们现在整个我觉得中国的市场 , 我觉得之前毒液变身也是我们有前期验证 , 然后现在时间点我们整个产品的开发 , 包括模型的迭代 , 包括我们团队的可能精力也更充裕了 , 我们也觉得这个时间点是比较适合进入这个市场的一个节点 。
毒液变身这个事情它的门槛在或者说壁垒在什么地方 ? 比如说我今天我是另外一家想要做视频模板的 , 我也去 copy 一个毒液的 。
对 , 比如说抖音 、 快手他们也可以做 。
我觉得几个点可以参考 , 就首先我们可以去看一下, 第一个是首先你得有一个很好的一个基础模型 , 你的基础模型得是一个很高质量的生成模型 , 你才能让变身的过程跟变身的结果都比较符合用户预期 。
这里面涉及到非常多我们对我觉得一方面是技术上, 一方面是业务上, 我们一方面技术上我们需要有个模型 ,并且我们需要把模型做一些微调 , 包括我们需要可能在很多技术层面上做一些额外的工作 。
然后另外一个是我们在业务上我们需要有一些用户洞察 , 我们需要去比如提前的去大概做一些实验跟猜测说用户会大概喜欢啥 。
然后包括可能毒液它火了可能几周到一个月 ,但是本身如果别的公司它想它可能要做也能做出来 ,但可能一个月之后它已经不火了 。
如果迭代速度不够快的话 ,是很难去 follow 上我们的迭代效率的 。
就是在持续有火的模板这件事情上, 你们是怎么去让它更有持续性 ? 这个其实有点像早年的抖音 , 就抖音之前 17、18 年的时候 , 当然它那会儿不是靠 AI, 可能是靠一些内容运营 , 就是它经常会有一些拍摄方式 , 病毒式的传播一些模板 , 然后大家就会去拍类似的东西 。
对 , 我内部会有一些创意会不停的出来 ,但我觉得这里边还是比较重要的是基础模型 , 就你的基础模型得足够好 。
如果你的基础模型不够好的话 , 你很多创意是没有办法去满足的 。 所以模型还是所有事情的基础 , 然后在这之上的话 , 我们作为内部的创意 , 包括用户的投稿创意 , 包括我们看整个市场的一些趋势 , 这个都是很重要的一些出入和创意的来源 。
然后我觉得更进一步是我们希望说未来也让用户参与到创意的产生里面 , 这个是我觉得更长期的一个我们的一些思路 。
我们希望让用户也能去贡献创意 , 来去帮助到更多的普通人能去有更多元的创作 。
你们之前在拉美还有欧洲就是反响很好的耶稣温暖你 , 就是在圣诞节前后上线的这种挺本土化的一些东西 , 这是你们自己想的还是用户的一些 idea 启发了你们 ?
首先这个 case 还蛮有意思的 , 一个是用户他确实会有很多用户发现他们会想做很多宗教的内容 ,但宗教内容本身因为都是千百年前的经典典籍 , 它是文字 , 它是不可视化的 ,因为比如没有人知道某个神长什么样子 。
耶稣他还是知道的吧 ?
但他具体长什么样子大家其实不知道 ,他可能会有一个大概的形象轮廓或者一个大概的一个意象 。
因为他有十字架上的标准的样子吗 ?
对 , 我发现说这里面好像大家对于宗教内容的可视化也是蛮多用户的需求 , 那我们就想会不会有一些玩法它是能够去帮助到用户去比如说通过创作去获得一些温暖 , 获得一些他想象中那些场景的一些实现 。
所以当时大家就想那是要我们做一个赛博耶稣 , 让他可以拥抱他所有的信徒 , 后来上了模板 。 当时我记得还挺火的 , 确实在欧洲很多国家 , 我记得德国 、 西班牙 、 意大利 , 我们都上过他们 App Store 总搒第一名。
那个时候应该他们可能全国有很多人都在玩这个模板 ,他们也很喜欢 。
这件事情在欧洲这些有宗教信仰的国家会引起一些讨论和争议吗 ? 就比如说你用 AI 来生成耶稣 。
对 , 就是我觉得本身能用 AI 去做生成的用户 ,他还是对很多新兴事物是有接受程度的 , 包括当时比较有意思 , 当时我还去联系了前任教皇的助理 , 我跟他通过一些朋友去跟他 。
方济各的助理 ?
对 , 当时去有一些我觉得共同朋友 , 然后去沟通了一下, 然后我就给他讲一下说我们这个还不错 , 然后会不会有一些合作可能性 ,但至少我们感觉其实整个就最严肃的那些宗教机构 ,他可能也没有对这个事情特别特别的抵触 。
我觉得本身还是说就是我觉得一个新媒体传播方式 , 让更多人去把自己的一些相信的东西 、 想象的东西去做可视化 ,并且让它得到一些这种温暖跟一些快乐 。
你们就是马上要上了国内的版本 , 它功能上和海外就是一模一样的吗 ? 还是它会有一些有区别的地方 ,以及你们对这个产品的表现有什么预期吗 ?
我们最早的版本还是会基本是一样的 ,因为我觉得本身中国是全球市场里面的其中一个 , 所以我们觉得本身这里面被验证的需求 、 场景逻辑 , 大部分应该是可以复用的 。
后面我们会先发出来之后, 然后看一下用户反馈 , 我们再去看要不要针对性做一些迭代跟升级 。
就是你们正式发了国内产品之后, 你们有去预判一下就是说可能会给你们的比如说竞争或者说其他对手的动作会带来什么影响吗 ?
我们的观点是中国是一个很重要的全球市场之一 , 举例来说我们可能一个大盘的数很重要 , 我们中国是我们肯定是要去做的一个市场 ,但同时我们现在还没有精力去把每一个市场做太精细的状态 , 比如说可能现在海外还是更大的 , 我们海外里边可能有更多的事情要做 ,但中国我们目前来说我们会有一些冷启动的一些策略跟方法 , 我们会先上了之后看数据 , 然后再
迭代 , 然后再去看怎么来做得更好 。 我觉得目前来说可能还是一个这样的一个状态 。
你们现在海外哪个市场最大 ? 因为我直接在你们的产品界面里看 , 就是我会看到有很多英语的 ,也有俄语的 ,也有泰语的 , 就好像还挺多元的 。
我觉得首先它的基础逻辑就是说整个视频是一个更通用的传播媒介 , 所以一个好玩的模板或者好玩的效果 , 它在美国能火 , 中国能火 ,在巴西也能火 ,在泰国也能火 ,在欧洲也能火 。
所以本身我觉得它基础是因为视频的传播或者视频的效果 , 它是更通用的一个媒介 , 所以我觉得更多对我们来说我们看到在全世界 80% 的国家 , 我们都在他们的搒单上排名是比较靠前过的 。
就实际上对你们来说 , 哪个市场是你们占比比较大 , 就在你们的比例占比较大 ,以及说收入贡献最多的 ?
还是人口大国 , 人口大国就是像美国 、 巴西 、 俄罗斯 , 然后包括整个欧洲这个市场 , 对 , 都是我们比较重要的市场 。
这个是你们提前没有计划的是吗 ? 就是放一个全球版 , 然后它跑出来是谁可能就是谁 。
对 , 我们现在做的还没有那么精细化 。
对 ,因为为什么会有巴西了 ? 因为也没有多语言版本 。
有 , 我们有多语言 , 巴西人比较爱玩 ,但我们确实对巴西市场没有那么的多洞察 。
所以就是巴西是比较多的 , 然后俄罗斯是比较多的 , 可能这些有些不在你们最开始的预计里面是吗 ?
我们的预计是这个东西是一个很普世的需求 , 所以人口大国肯定都会爱玩 , 所以我觉得它也在我们的逻辑里面 。
那印尼不多 ?
印尼也多 。
不是因为印尼不信耶稣吗 ?
我们现在的模板的使用 , 它分布已经比较均匀了 。
太夸张了 。
印尼也蛮多的 。
对 ,因为印尼也是人口大国吗 ? 印尼应该是第四吧 , 全球人口第四多的国家 。
那印度也是人口大国 。
印度也是 , 印度也时不时会有一些小的热度 。
对 , 它可能还和就是每个地区的比如说移动互联网 、 手机什么普及率有关 。
对 , 这有关系 。
对 , 然后你们去年曾说就是爱诗这个目标客群是每天玩抖音 、TikTok 的这些用户 , 这个怎么理解 ?
是指就是你们想要和他们 PK 吗 ? 还是说就是你们是希望能帮用户 ?
我们可能类比说玩抖音 、TikTok 的用户 , 就是我们想说它代表普通人, 就所有能看视频的人。
你是这个意思 ?
都是可以是我们用户 , 能看视频的人 ,他可能有一定概率都有通过视频来做表达的表达欲 ,因为视频就大家看的话 , 大家还是可能会不管是发到私聊 、 发到群聊还是发到公寓里边 , 我觉得很多人是会有表达欲的 ,但表达欲没有被满足 , 所以我们想通过 AI 创作的方式来降低用视频来表达的很多的原来的一些门槛 , 比如说每个人手机都有摄像头 ,但
是真的能拍好素材 , 或者说比如能去给它配好音 , 做好剪辑 , 包括拍出来不怕自己被嘲笑的人其实很少 。
我们希望说能用 AI 来帮助这些人迈出来第一步 , 让他做出来一个好玩的 、 跟自己有关的 、 可以分享 、 值得分享的一个视频 ,不管他分享到公寓还是私域里边 , 我们希望帮助很多人迈出第一步 , 这个是我们想去做的事情 , 所以我们之前讲说我们希望服务普通的人。
那关于就被用在什么地方上, 你们接下来可能的大的重点是什么样 ? 因为一方面你们是 to C 的嘛 , 一方面我怎么感觉你和影视公司的人交流还挺多的 。
因为还蛮有意思 , 就我觉得一个是从去年开始 ,在 Sora 刚出来的时候 ,因为当时中国就只有我们这个模型是能用的 , 当时 Sora 刚出来的时候很火 ,但国内基本没有模型是可用的状态 , 大家都很多人是后来才进入这个行业的 。
就那个时候我们还有一个上一代模型是可用的 , 所以那个时候就开始有很多影视剧公司或者专业的 creator 会找我们交流 , 那个时候就有很多交流 ,但其实最近这个交流少很多了 ,因为大家可能确实我们在这块一方面一个是技术没有那么匹配 , 第二是我觉得还需要发展 , 可能才能匹配他们的一些需求 。
回到刚才那个问题 , 更多是我们的选择 , 更多是我们还是说刚才讲的就普通人。
普通人, 就是你们聚焦的一个用处和方向 。
对 , 普通人, 怎么让普通人更容易的去体验 AI 创作的乐趣 ,并且做出来一个好玩值得分享的视频 。
你觉得视频生成领域接下来的一个竞争点和赛点是什么样 ? 就比如说谁先做到一件什么样的事情 , 可能会给目前的竞争格局带来比较大的变化 。
模型技术48:48
我觉得最基础还是整个模型跟技术的迭代 , 我觉得现在的视频生成模型还是有很大的提升发展的空间 ,不管是从各种维度 , 这个物理规律 , 包括运动幅度 , 包括生成速度 , 我觉得还是有很多的事情可以去探索 。
所以这里面我觉得本身 foundation model 的升级还是这里面最基础 、 最重要的事情 , 然后在这个之上我觉得可能方向选择你的模型用来做什么也很重要 。
我这样会打比方说 AI 视频生成模型 , 它不是全能的一个 AI 导演 , 它是一个新的一个 AI camera, 那这个 camera 它被用在什么地方也会很重要 。
那可能比如我们类比传统 camera, 那传统 camera 摄像头有些是用在电影行业 , 那可能就是一个大家伙 ,他去拍电影 ,有些用在比如短剧行业 ,有些可能用在了短视频行业 , 那它不同的使用场景 , 它的摄像头能发挥的价值 , 包括你怎么去让用户体验它的产品化路径是不一样的 。
所以我觉得本身还是一个说模型迭代跟产品方向选择相辅相成 、 互相促进的一个过程 , 所以我觉得这里边最重要的我觉得还是技术 , 技术之上就是技术用来做什么 。
你刚说的第一个点就是基础模型的提升 。 比如说你们刚提到物理规律是否那么真实 , 还有它的时长 , 还有生成的速度 , 就你们现在普遍 PixVerse 的时长 , 我感觉是 4 到 5 秒左右比较多吧 。
5 到 8 秒 。
5 到 8 秒左右比较多 ,OK。 就 5 到 8 秒的话 , 这个是你们受限于目前的模型能力它就是这么长 , 还是因为你们发现用户需要这么长的东西 ?
我觉得很有意思 , 我觉得行业里面有两个事情是反常识的伪需求 , 一个是生成更长更好 , 一个是纹身视频是最大的场景 。
首先生成更长更好并不是真实的创作需求 , 比如我们去任何比如说 B 站上看一个视频 , 或者在电影院看一部电影 , 我们去数一下就有多少镜头是长镜头 , 一镜到底的镜头非常非常少 。
我之前大概数过可能 95% 以上的镜头是 8 秒以内的 , 就其实在传统不管专业还是说普通人创造场景里面 , 比如说一分钟这么长的镜头都不是大家的常用的镜头长度 。
所以在线上我们也尝试过比如说更长时长的镜头 ,但其实我们发现用的用户非常非常少 , 所以不是说我们技术有限制做不了更长 , 更多是我们通过用户需求 , 包括实际的创作的场景里面 , 我们发现可能 10 秒或者 5 到 10 秒这个单元是一个比较有意义的一个创作单元 , 包括像我前段时间跟另外一个影视公司的核心的人再去交流 ,他们提了一个他们的一个痛
点 ,他们说现在的视频单镜头常常太长了 ,他们想要一两秒的镜头 ,他们不想要 5 到 8 秒 ,不想要 10 秒的 ,他们想要一两秒的 ,因为一两秒他们更可控 , 更好去做镜头之间的组织 。
所以我觉得本身这个是一个也不是反常识吧 , 就它其实我觉得是之前 Sora 或者 OpenAI 它给大家灌输了说一分钟生成很厉害 ,但是实际上它并不是真实需求 ,而且它也没有做出来一分钟生成 , 它也就是一个镜头之间的拼接 。
这个是第一个 。 另一个纹身视频其实也不是一个很多人在用的场景 , 专业创作者普通人其实都不用纹身视频 , 纹身视频就语义跟视觉之间的 gap 还是太大了 , 你很难用通过语义的 , 包括我现在我刚才讲普通人他会写 prompt, 包括对很多专业创作者来说 ,他其实很难用语义控制好风格化 , 很多风格化很多这个东西 。
专业创作者会用分镜吧 ,他们其实自己也会画分镜 。
对 , 大部分的创作场景还是说不管普通人还是专业用户 , 还是说图或者图加文字去生成视频 , 这个还是最重要的一个场景 。
所以回到刚才问题就是说生成时长不是技术限制 , 更多是我们的一些判断 。
那具体在就是基础模型怎么提升上, 你们比较看好的趋势是什么 ?
几个大方向吧 , 首先一个是可能会有新的架构出来 , 比如像 GPT-4o、ImageGen 那块的 AR 路线 , 我觉得是蛮有意思 , 跟我们之前很多想法是类似的 , 我们也在做 。
你们现在的是 DIT 的架构 ?
我们现在的模型是 DIT 模型 ,但整个自回归结合 Diffusion 的生成的架构 , 我们也在做很多积极的尝试 ,在这块我们有信心吧 , 我们应该也会在比较快的 , 可能在全球前几个甚至最快的速度发出来一个可用的高质量的新架构的模型 , 这个是有可能的 。
但像我刚才讲的 , 这个模型不一定就是普通人最喜欢玩 , 那可能对于专业创作者可能更有帮助 。
然后第二个是我们觉得把生成速度压得更快是更有意义的 ,因为我们现在的现场模型生成速度应该是全世界高质量模型里面最快的 , 我们只需要 5 秒到 10 秒时间就能生成出来一个高质量的视频镜头 。
对比同行的话 , 大部分的模型 , 闭源开源的高质量模型基本都需要至少一分钟到两分钟的时间才能生成出来一个高质量的镜头 。
这里面我们觉得我们还会希望说提高或者说在更好的模型的情况下保持这个生成速度 , 我觉得这个也对用户体验是至关重要的 。
对 , 这个我可以安利一下 ,因为我有自己在用你们的产品 , 我体感还是觉得挺快的 , 我觉得可能差不多十几秒到二十秒吧 。
看不同分辨率吧 , 如果是相对比较基础分辨率的话 , 最快我们应该是 5 秒可以把一个 5 秒镜头生成出来 。
它反正挺快的 。
对 。
5 秒生成 5 秒 , 那是生成的时间已经降低了 。
它基本上降低了 。
对 , 等于它这个视频最后本身的时长了 。
对 , 我们这个不是 demo, 这个是现场大家可以去体验 , 就我们 1 月份就已经有这个模型 。
有时候用这个模板第一次用的时候可能会要等十几秒 ,其实第二次用的时候 , 哪怕是不同的照片可能也会快很多 。
那应该没有 , 那应该只是说正好可能那个时候 。
排队的时间就不要短是吗 ?
对 , 理论每次都是 , 如果没有排队的话应该是基本一样 。
产品与模型54:12
我有一个问题就是你刚才提到就是你们现在在做这个 to C 的产品之外, 你们也在探索 API 的这种收入的方式 , 就是你们会觉得这样做会有点多吗 ?
会不够专注和聚焦吗 ?
我们觉得比如做一个很标准化的 API 的平台 ,其实它对我们来说是一个新的商业模式 , 我们觉得还是一个可以探索的事情 。
因为我觉得它可能会导致你模型优化的方向要不一样 , 就像你说的 , 你们可能会在全球作为第一个或者是第一批推出一个新架构的可用的高质量的视频生成模型 ,但是你刚才也提到说这个模型有可能并不是就那种天天玩 TikTok 和快手抖音的普通人会用的 , 它可能是更偏专业用户的 , 那你相当于是在往两个方向去优化你的基础模型 , 这么做不会分
散你们的一些精力吗 ?
我觉得首先它底层说这个模型我们在训的还是一个通用模型 , 就我们整体不管是 B2B 还是 B2B to C 还是说直接 to C, 它其实都是解决各种各样的场景 , 那这些场景它合起来就是一个通用的问题 。
那这里面对我们来说很多比如说 API 的一些反馈对我们来说其实反而是有益的 ,因为它代表的是一些因为可能个人客户他也会有很多 feedback, 然后很多就比如企业客户或者说一些更大的一些组织他也会有一些他的一些 feedback, 对我们来说本身对我们训练一个通用的模型来说都是有益的 。
视频生成领域的一些 to B 的业务里也会有定制化的做法吗 ? 就目前市场上这些公司 。
当然了 ,有非常多 , 就比如说各种各样的这个我们了解到各种各样的同行 ,他可能甚至有些人在做分销 , 然后很多人在做这种解决方案 。
对 ,其实我刚才问这个是否足够聚焦和专注的问题也是跟下面有一块问题我们想讨论一个话题有关的 , 就是模型和产品的关系以及你们的团队经历在这两个中间怎么来分配 。
因为 23 年就是爱诗成立的那个时间点 , 包括一大批六小龙也在那个时间成立 , 当时行业的一个主流观点就是模型和应用是要双轮驱动 , 对吧 , 你得一起做 。
然后之后可能大家的想法又有些变化 , 觉得就是你现阶段去把产品做得特别好 , 可能并不是最重要的 , 最重要的还是你的基础模型的能力要持续的去提升 ,因为你模型能力提升之后你的产品又会有一个比较大的变化 。
那具体到就是你们的这个行业和你们现在自己在做的这个事的选择里面 , 你们怎么去平衡这两个东西的关系 ?
因为我听起来它有些地方肯定是一致的嘛 , 就是你如果视频生成模型的性能越好 , 你的产品它也是会越好用 , 对吧 , 它的生成速度然后它的效果 。
但是另一方面 ,因为你们现在这个 to Fan C 的这种做法里面 , 它其实有很多可能我做专业的影视内容所需要的能力在这个产品形态里我觉得是不用优化的 , 甚至它可能有些地方是相反的 。
那这一部分的能力你是就说舍弃了 , 还是说你为了我要做一个更好的模型我也会去做 ? 就你们现在怎么去看这个关系 ?
对 , 首先我觉得就 AI 行业大家一般讲的这个 AI 模型和应用的关系一般指的是语言模型跟语言模型的应用的关系吧 , 大家语境里面一般指的是这个 。
然后我觉得首先视频生成或者说我们这行业跟语言模型还是有很大的不一样的 。 我们这行业像我刚才讲的 ,其实我们在做的事情大体上跟像一个 AI 的一个摄像头的摄像头 , 它本身是没法直接卖摄像头来赚钱的 , 它摄像头还是需要说它到底放在什么样的场景里面去给到用户 。
但本身研发这样的一个 AI 摄像头 , 本身它有很多基础的东西或通用的能力是需要去解决 ,不管说举例比如分辨率 , 或者比如说符合物理规律 , 或者比如清晰度 , 或者说这个生成的速度 , 这些是通用问题 , 这个是无论如何都是要解决的 。在产品层面来说 , 这里面确实在应用方向上我们把一个通用能力用在一个具体场景里面 , 可能在 to C 这
块我们会有些取舍 , 比如我们 APP 端它的功能就很简单 , 就比如说我们的 APP 端跟我们网页端其实是两个相对不一样的产品 , 一个是更多服务普通人, 一个更多服务专业创作者 , 那我们其实在 APP 端它的功能是相对比较少的 , 我们没有把很多网页端的专业创作功能放在 APP 端 ,因为对普通人来说可能就是没用 ,但不意味着我们通用能力上我们
不会把它做迭代 ,因为可能有一些 feature 可能对普通人来说就是很有意义的 。 比如举个例子 , 最近我们有一个功能 , 它其实最早是专业用户用的一个功能 , 它在普通人这块也被用得很夸张 , 那功能叫做首尾针 。
首尾针最早是专业场景里面怎么帮助专业用户去做 , 可能给他一个手针 , 给他一个尾针去补针的这样的一个技术 。
但最近我们发现大量用户 , 普通人在用我们的这个首尾针来做一个比如类似于让自己从小长大 ,他传一个自己小时候的 , 传一个长大的照片 , 就可以生成一个自己从小长大的一个这样一个 video。
但比如像这样能力 , 理论上最早没有在 APP 端去上线 ,但是普通人他用户去探索这个技术功能的一些可能性 , 发现一个原来可能是专业创作者 , 最早我记得这功能是 GMON 做的嘛 , 最早 GMON 他做了这个 feature, 后来大家其实都做了这功能 ,但后来这功能它最后是在我们这可能被普通人广泛用来去做这个 , 比如说这种首尾针普通人的玩法 。
你昨天在群里就是用雨桐的微信头像 , 然后就开始是她的头像 , 后来变成了她去旅游的那个照片 。
对 ,也是类似的玩法 。
就是这个时候 。
因为这个其实 。
那个效果还挺好的 。
我们说的这里面其实我觉得很多的 ,因为我觉得还是说这个技术的发展会带来打开更多可能性 , 我们很难用一个比如垂直行业 , 或者说用于一个我们目前的认知去框这个以后技术发展会带来的一些可能性 。
所以对我们来说 , 我们还是很重视说模型是所有东西的这个基础 , 我们要把基础模型做得更好 , 然后同时我们去做更多功能或者模型能力的一些边界 , 探索一些新的边界 , 然后自己跟我们用户一起去探索说基于这个更好的模型能有哪些好玩的玩法给到普通人或者专业的一些用户 。
总体来说 , 你觉得模型和产品在你们的竞争力或者说壁垒里的占比分别都是多大的比重 ?
我们概念里面这两个东西都很重要 , 就没有说哪个东西更重要 。 就像你刚才讲的 , 不同公司会有不同的观点 , 比如有些人会觉得模型决定一切 , 模型即产品 ,有些人会觉得应用它最重要 ,但我们的概念里面是这两个事都很重要 , 就是因为如果没有基础模型的话 , 你任何应用的想法都没法去实现 。
但如果一个好的技术没有找到好的这个应用方向的话 , 它的价值跟潜力也没法被发挥出来 。 所以我们的概念里面是我们希望说不管内部协作还是我们的这个公司的发展上, 我们都希望说我们要把这两块都要做好 。
有一个我想补充问一下的 , 就是你们现在做的这个方向其实是我觉得偏娱乐类 , 可以这么说吧 ?
对 。
就你们的 APP 端主要是偏娱乐类的 , 然后另一方面大部分做视频生成的 ,不管是创业公司还是大公司 , 比如说像快手 、 可灵这种 , 它是偏生产力的 ,是帮专业的影视制作者去提升效率的 。
你总体上你怎么看这两大类选择 , 它的比如说切入的难易以及它未来的天花板 ? 因为之前我们跟有一些创始人或一些投资人聊 , 可能他们就会认为生产力是一个这一次 AI 最大的出现 , 认为这是空间最大的 ,而娱乐陪伴类不是 。
但另一方面也有不少人认为可能娱乐陪伴是一个对创业公司来说更友好的地方 。
OK, 我的理解是这样子 , 就是首先我们也有生产力的产品 , 所以我们其实两边都有 。 就我觉得像我刚才前面举的例子就是说现在的生产力 , 比如生产力出来的那个结果 , 比如一个完整的一个 AI 的视听作品 , 它里面到底有多少是被 AI 视频提升生产力的 ?
比如说这个作品里面 50%、90% 以上是 AI 视频解决的 , 那我觉得那应该这个 PMF 很好 。 但目前我现状是 AI 视频更多变成了一个宣传的噱头 , 本身视听作品里面大量的还是人的精力投入 , 可能 AI 视频里面在里面解决了很多素材的创作问题 ,但本身你说这个 AI 视频的素材很多已经达到人的标准 ,但很多可能还没达到 。
所以这里面我觉得当然解决生产力很重要 ,但解决生产力你要看解决了多少嘛 , 你解决问题的这个比如你解决 10% 的生产力 , 那它是不是就会打个折扣 ?
但另外一个角度来说 ,但当然这个市场我们现在的我们的网页端产品也在服务很多用户 , 我们在生产力这块也有很多用户在用 , 所以这块我觉得是首先是这个 。
另一个是我们去看那个普通人, 我觉得首先还是两个很不一样的这个定位跟方向 。 我举个例子 , 比如说 Adobe,Adobe 它有 Photoshop, 然后它也做了文生图 , 对吧 ?
那它很难在 Photoshop 里面把文生图放在一个最重要的一个位置 ,因为它的生产力的用户就是那些用它这些非常复杂的设计编辑功能的用户 , 它的最好的一个体验的一个地方 。
那你让它原来这个巨大的一个创作者生态 , 一个内容生态去适应一个新的更平权 、 更低门槛生产方式 , 这个事情大概率我觉得可能不 work。
所以对很多这些生产力的产品来说 , 它要去做普通人 ,他可能不得不去做一个新的一个产品 ,因为很难用一个产品来服务好两个人群 。
对 , 就比如说视频里面 , 那可能看长视频的或做长视频的创作者 ,他用的工具 ,他用的产品跟普通看短视频的人用的创作工具跟产品还是两个不一样的这个产品逻辑 。
所以我觉得这里面它其实是一个要去做选择的 。 我觉得很难说难易吧 ,因为我觉得本身其实整个专业创作场景里面 , 首先我们模型也在做 ,但这里面我觉得本身像这种多模态协同的生成问题的解决 , 它可能不仅是视频模态单一的这模态里面要解决问题 , 它可能要涉及到多模态的问题 , 这个我觉得是整个行业 AI 行业需要去努力的方向
。在普通人这块我觉得它更多是要想清楚 , 你要想清楚你是不是要做这个事情 , 要做这个事情的话 , 你可能你整个组织 , 包括你的整个比如说产品化的这个方向 , 你的端 , 你的这个运营或者增长的手段 , 你的这个内部的这个产品团队的协作方式 , 它都会需要有一些变化 。
那这个事情我觉得对于已经在做专业创作者的团队来说 , 它可能也是很重要需要去决策的事情 。 所以我觉得很难说哪个容易哪个简单 , 我觉得都很难 。
然后但我觉得更难的是在专注做一个事情的时候 , 同时把另外一个事情也做好 。 我觉得这个其实是对所有组织的一个巨大的一个挑战 。
对 , 你们比较在意的竞争对手是谁 ? 全球范围 。
我觉得在技术层面有非常多值得尊重的对手或者同行 , 像最早发布这个视频生成的高质量视频生成的可灵 , 包括像海螺纹 MiniMax 也做得很好 , 像海外的 Google, 然后包括像最早定义这个 Diffusion Transformer 的 Sora, 我觉得都是技术上非常值得尊重的同行 。
我们也会很关注他们的这个迭代跟发展 , 然后同时在产品侧 , 目前跟我们做一样事情的公司 , 视频侧做 to C 的公司好像还没有 , 我们也希望说有更多的人能进入这行业 。
因为我觉得如果这行业没有太多良性竞争也是不好的 , 我们也想看到更多人一起来去探索这个事情 。
其实抖音和快手内部的模板是不是某种就是有点重合 ? 它不完全一样 ,但是有一点重合 。
我觉得抖音或者为什么比如说像快手它要去做一个新的产品 , 像做可灵 , 那也是因为像我刚才讲的 , 你很难在一个短视频专业创作工具里面又承载一个 AI 创作工具 。
同样的比如说可灵这个专业的 AI 创作工具能不能承载一个 to C 的创作工具 , 它我觉得也是一个要去思考的一个很重大的问题 。
所以产品矩阵我觉得也可以 ,但这里面就是精力分配跟团队的聚焦的问题 。
团队与目标1:05:26
你和王长虎是怎么分工的 ?
因为从事早期的时候人很少了 , 所以就当时我们大家就可能在很长时间里面我们在研发模型 , 然后长虎就把这个核心模型研发要去解决 , 然后我可能更多把其他事情对外各种 , 包括融资 , 可能比较擅长的事情 , 包括可能找一些关键的人这些事情我会做蛮多 。
但是现在慢慢的随着公司发展的越来越大 , 然后我们也会去比较灵活调整这个分工 。 现在可能长虎他更多把这个核心的产研他盯好 。
产品是王长虎自己在管是吗 ?
他现在更多精力在产品上面 。
其实王长虎刚出来的时候 ,有一些投资人并不看好他的一个原因是觉得他做不好的就是新一代的 AI 产品以及能让年轻人玩的产品 。
但是我觉得其实最后这几个视频生成公司 , 就目前的状态来看 , 反而是爱诗 PixVerse 的用户可能是最年轻 , 然后最 fancy 的一些玩法和人吧 。
因为给专业视频用的那肯定都是更工作上的群体 , 更专业的群体 。 所以你们就最后跑出来的结果 , 我觉得跟最开始大家一些判断还是有反差的 。
对 , 这是靠什么实现的 ?
是因为他本来就是一个心态比较年轻的人吗 ? 跟大家最开始想的不一样吗 ? 还是说这个过程中间你们相互交流很多 , 大家有相互有些学习 ?
我觉得首先还是说事在人为嘛 。 首先我觉得长虎他的那个上下文是足够的 , 比如他的输入是足够 , 比如原来他在自己经历过这么多的大产品的这个发展 ,他是有足够多的这个 context 的 。
就对比的可能比如说很多学术背景的一些同行 , 对互联网产品 , 对互联网产品怎么从 0 到 1,他可能上下文是会跟长虎比是有一些不足的 。
另一个是我们过去两年里面 ,其实我们的概念里面一直是本身这个模型产品同样重要 , 所以我们其实做了非常多产品探索 。
然后我在这里面我们这两年里面积累的认知跟我们的信息量 , 我觉得也是很多同行他可能不具备的 。
我们在比如我们去想在 23 年的时候做视频生成的公司可能也就没几个吧 , 现在可能到 24 年其实也很多人是因为 Sora 火了之后才进来的嘛 。
所以这里面我们过去不管是创业之前还是说创业期间的经验 , 我觉得对于长虎队或者整个团队来说 , 我们对这块的探索都是有很大的一些帮助的 。
然后另外一个是我觉得本身 AI 产品它就是一个新的东西 , 我觉得可能很多比如说以前互联网里面也是 , 就大家可能去找那些比如说大厂背景或大厂做过成功产品背景的人, 往往他可能不一定就能做得最好 。
我觉得很多东西一个是可以被学习 , 一个是可以去探索的 。 而且特别我觉得在我们这领域里面 , 说白了我们走的是一个无人区 , 就谁也没有走过这条路 。
那很多东西是大家去淌出来的 ,不是说我有一个经验我就一定能把它做好的 。
其实长虎之前在自结 , 我觉得他还是偏就是研发岗位吧 。 然后你之前其实也不是一个典型的产品背景 ,他也不是一个典型的产品背景 。
你们创业之后就是没有想过说找一个产品的负责人, 甚至合伙人的这种角色的人吗 ?
是 , 可能是我们产品现在有很好的同学在负责 ,但本身我们公司内部比较扁平 , 大家也不怎么讲什么 title。
这个是第一个 。 第二个是我举个例子很有意思 , 比如说去年在那个 23 年的时候 , 我们刚做 PixVerse, 我们刚做内测的时候 , 我们当然要做这个 AI 产品的海外增长推广嘛 。
然后原来因为我看过很多互联网公司 , 所以我就认识很多可能做增长比较厉害的一些专家 , 我们就交流 。
然后发现当时其实是个网页端产品 , 然后包括我们最早在 Discord 在网页端都有做 , 我们就去聊国内有谁在这块有经验 , 没有人, 就没有人在那个时间点对于比如怎么在海外全球市场去把一个 Discord 或者一个这种网页端的 AI 生成式产品做好的经验 。
因为大量比如说移动端也好 , 或者是传统互联网产品的经验 , 它其实是没有那么适用的 。 所以我觉得这里边它的这个 takeaway 就是说这整个 AI 生成式 AI 是一个新的一个领域 ,有很多经验它能复用 ,但有很多经验它根本没法复用 。
所以我觉得首先它是个新事 , 最后它这个事情是得大家去探索出来去做出来 ,而不是说可能去找那个符合什么简历背景要求的人, 让他把它做出来 。
我觉得这个是我们的一些经验 。
你们今年有什么大的目标吗 ?
我们今年我觉得还是说继续加速奔跑 ,在模型上跟产品上 。 我们希望到年底我们用户量能再有个至少两到三倍的增长 。
至少两到三倍的增长 。 因为你们现在的全球总用户数是 4000 万嘛 , 到年底的话 。
我们现在 6000 多万 。
现在 6000 多万 , 那又比之前你们公布上一个 4000 多万的时候又多了 。 两到三倍的增长 , 那就是有差不多小两亿 , 到年底的时候你们的目标 。
对 , 我们希望是亿级别的总用户量 。 然后对 ,因为我们觉得本身这个需求 , 我们觉得还是一个很朴素的需求 , 它应该是可以让很多人都去用起来的 。
那更长远来说你们想成为什么样的公司了 ? 比如说三年、 五年之后 。
三年、 五年之后我们希望说会成为有规模化用户量 、 规模化的盈利能力的一个 AI 公司 。
什么叫规模化的用户量 ? 什么叫规模化的盈利能力 ?
是规模化的用户量 , 可能就是我们能持续稳定的增长 , 我们能解决一些真正的需求 , 然后有很多人每天在玩 ,他会有很多自然的口碑传播 。
就是它有个绝对数吗 ? 比如超过多少是规模化的用户数量 ?
我觉得千万日活以上吧 。
千万日活以上 。
可能就是大几千万到亿级别的月活 。
所以这些指标里面最关注的是哪一个呀 ? 就提到了很多日活 、 月活 、 收入 , 然后注册用户 。
我觉得对我们来说比较重要的是一个是活跃用户量 , 活跃用户量可能日活 、 月活都很重要 。 另一个是我们现在会比较多看商业化指标 ,因为产品现在是一个比较强调付费的一个创作工具 。
现阶段我们还是会看很多商业化指标 , 比如说有多少人付钱 ,他们的付钱之后他有多少人会留下来 , 这个是比较重要 。
但我觉得本身产品也会迭代 , 我们也会希望说以后能不能有更多元的商业模式进来 , 比如说是不是能看几个广告就做个视频这种 。
那如果这样的话 , 我们希望把这个使用模型的门槛进一步降低 , 让更多不订阅用户也会拥有一些核心的一些体验 。
那这样的话 , 我们到那个阶段会更关注可能整个大盘的一些用户的留存 , 包括长期的这个使用的一些行为 。
对 , 正好你可以介绍一下就是你们现在海外这个版本 , 它的付费是哪几档 , 然后你们在国内推国内版的时候 , 你们大概付费会怎么设置 ?
目前来说我们海外大概三档 , 最便宜那档是 10 美金一个月 , 然后第二档是 30 美金一个月 , 然后最高那档 60 美金一个月 。
就单月订阅的费用 , 它大概跟那个使用量有关系 , 就你的这个用量 , 你的付的钱越多 , 你的可以使用的用量越大 , 单价会越便宜 。
国内我们应该会复用一样的定价逻辑 ,因为目前我们在国外所有国家也都是一样的定价逻辑 ,但我们会等上完线之后我们看一下反馈 , 我们再决定要不要去做一些调整 。
那巴西这个市场还真的挺出乎我的意料的 。其实巴西的经济状态也并没有那么好 。
但他们敢花钱 。
对 , 就他花钱还花得不少 。
比如当时毒液变身就很有意思 , 当毒液变身在国内火的时候 , 我们发现说在抖音里面非常多用户在评论区里面说求求了 ,6 块钱帮我做一个 , 就大家愿意只为单条这种 , 让他能够觉得有意思的创作体验去做付费的 。
我觉得这个还是我觉得还是蛮有意思的 。
这三档里面实际上就是哪一个档付钱的人最多 ?
我觉得我们的那个专业用户跟那个普通用户不太一样 。 普通用户肯定还是更低的那档会付的更多一点 , 专业用户可能会平均更多元一点 。
在所有用户里面的付费的用户占的比例这个方便透露吗 ?
这个可能不太方便 。
还有那个比如说续费的吗 ? 就比如说我这个月订完了 , 我下个月还会订吗 ?
我们的续费率我觉得比想象中要好很多吧 。 就是我觉得最后可能不比专业的一些创作工具的续费率差 。
现在就是 to C 专业视频创作者这种视频生成工具 , 一般再次复购的比例是多少 ?
我觉得它有很多不同的口径 , 就比如说专业到多专业 , 比如企业级的还是说是个人的 , 还是比如说 。
我说的还是个人吧 , 就最普遍的那种 。
我觉得大概可能五成以上的这个 , 或者说大几十的复购已经算是很好的水平了 ,但很多可能都做不到 。
对 , 刚刚说这是第一个点 , 就是你们要想有那个规模化的用户 , 然后你说三五年后还有个目标是规模化的收入 , 对吧 ?
对 , 收入 。
就这个大概是在什么体量 ?
我觉得首先收入体量是一个维度 , 另外还有希望自己能挣钱 ,因为我觉得大部分的人工智能公司在早期发展或在发展很长时间里面都是会有比较大额的亏损的 。
你说要 break even, 要盈利 。
对 , 我希望说我们在比如说你刚才讲的时间段内 , 我们能实现规模化的盈利 ,因为我们觉得在视频的领域是有可能的 ,因为视频是一个离真实的使用场景 、 真实需求 、 真实的流量 、 真实的商业化更近的一个形态 。
我们看到海外的 Midjourney, 它现在一年的订阅收入应该是个几亿美金的这个体量 。
3 亿多 。
可能不止了 , 它应该可能比 3 亿要更高了 , 我们了解到 。 然后我们相信视频的创作 , 这种普世的视频创作 , 视频的分享 , 它应该是一个更大的一个用户量的一个需求 。
然后这里面我们觉得还是会有一个很大的这个市场空间 。 那同时我们也希望说我们把整个这个公司的效率 , 我们把这个技术做到足够的平权 , 能够让我们也在帮助用户去创作的同时, 我们也能够把钱挣回来 。
你们 1600 的月活 , 差不多每个月消耗的这些算力的这个成本是多少 ?
我们还可以吧 ,因为大部分的这个大模型公司可能它的那个推理都是算不过来账的 , 我们还是在推理层面还是会有一些一些利润空间的 。
那具体的比例可能不太方便说了 。
明白 。 就说你不算你们模型研发的这个成本的话 , 你们的模型服务 serving 的这个成本 。
Serving 的我们是完全算不上 。
你们的订阅费是可以给它覆盖掉的 。
是 cover 能 cover 掉的 。
对 , 最后一部分就是想聊一下你自己的一些职业选择 。 因为你应该是毕业之后到这一次创业之前 , 你都是在光源做投行 。
投资人转身1:14:52
对 , 我在光源做投行 。 对 , 待了六年多快七年吧 。
对 , 然后其实就是你这一批进一级市场应该是 16、17 年左右是吗 ?
16 年进 。
16 年, 对 ,16 年左右 。 我觉得就是这一批进一级市场的很多人 ,其实他可能不管你是做投资还是做投行 IC 这种业务 , 可能都没有之前比如说早个五六年或者小十年来做这件事情的人发展得更顺利嘛 。
因为很多大的项目的机会在消失 。 就你可以讲讲就是你当时包括入行的选择 , 到后来慢慢想创业 , 你可以讲讲就是这个过程中间你的一些经历和思考 。
对 , 可能回到最早 , 就是我在上学的时候 , 就当时因为我们学校或学院的创业氛围还相对比较浓厚在那个阶段 。
你是一级的 ?
我是一级那个北大光华的 。 然后那个时候我们的创业氛围还比较浓厚 。
那会儿谁创业 ? 你们先讲讲吧 。
那个时候反正我的学长我的学弟们创业都还有一些声量嘛 ,在这个行业里面 。 然后我记得当时很有意思 , 当时我刚上大学的时候 , 那个时候我们同学里面大部分大家包括我的学长学姐 , 大部分人想去做那个 consulting 或者做投行 。
因为那个时候是可能是一个毕业之后平均收入最高的一个工作 , 然后也确实是很好的一个职业路径 。 所以当时我觉得蛮多人的那个主流的想法是去做这个 。
但当时我记得我大一的时候 , 当时正好我们有一个那个访学团去了一趟那个硅谷 , 然后当时我正好是那个带队的那个同学 。
你大一就有访学团去硅谷 ?
对 , 当时我大一组织了一个那个 study tour 去硅谷 。
你自己组织的 ?
当然是我们那个学生会组织的 , 然后我主要负责那个整个美国这个行程 。
所以你大一就在光华的学生会开始干活了 。
我是群众 , 就参与很多工作 。 那天去美国一个人见了很多当时那个北大的校友 , 另外一个见了很多那时候在那个那边的高校 , 包括斯坦福 、 伯克利的一些跟我们同龄的一些华人或海外的一些同学 , 然后也跟很多当时的一些创业公司交流 。
那时候其实整个万众创业在中国还不火 , 大家对创业这个事情是怎么回事 , 没有那么多概念在校园里面 。
我当时对我的冲击都很大 ,因为当时我发现为什么大洋彼岸的那些同学们 , 大家想的事情或大家想去探索的职业方向 , 就跟当时在国内我们当时可能算比较顶尖高校里面同学这个想法不太一样 。
所以我觉得大家当然讲了很多什么改变世界 , 然后说我们要去创业 , 要去做 startup, 我觉得那个其实对我的冲击有点大 。
所以我当时觉得这个行业是啥 , 所以我当时就在想会不会比如说学商科 , 那以后能去参与到创新创业里边 , 这个是一个令人有意义的一个机会 。
所以我觉得当时在刚上大学的时候就有一些这样的一些种子埋下来了 。
而且到大三大四的时候 , 就 13、14 年那会儿 ,其实是中国的一个创业的高峰 。
我记得当时我在那个毕业之前 , 一个是我当时在北大南门 , 就南门走几步就到中关村创业大街嘛 。
我就经常去那个街上, 当然街上找了个实习 , 就是他当时有一个那个专门做那个孵化器还是加速器的一个机构吧 , 当时他有很多路演 , 我就帮他们打杂 , 就是去看当时的那个创业者怎么去路演 。
然后当时有很多那种类似于 speed dating, 就很多创业者上去讲一下 idea, 然后下面投资人就开始打钱 。 我说哇 , 这个太刺激了 , 太牛了 。
然后当时整个创业大街是非常非常热的一个地方 。 然后后来我职业选择 , 当时我觉得比较巧 , 当时正好在那个光源有光源当时很小 , 当时可能就 10 个人左右吧 , 里面正好有 20% 的人是我的校友 。
当时可能那个这个机构在当时也是一个在行业内有些名气 ,但可能在公众来说 , 大家并不知道光源是谁的一个这样的一个状态 。
那时候我发现这个机构它帮快手 、 帮 PPT 融过资 , 我觉得哇 , 这两个产品我都知道 ,而且都很厉害嘛 。
我想那这样一个机构它既能去帮助创业者融资 , 又能去知道很多最顶尖投资者在想什么 , 那应该是一个蛮好的对我来说职业生涯的一个开始 , 然后让我可能更接近这个创业的这个两端 ,不管是做公司的人还是说做投资的这个人。
所以那个时候基于这样的一个比较朴素的想法 , 我就去了光源 。
所以你当时去光源的时候 , 你就是后面想创业的 。
对 , 我其实在光源的几年里面 , 我数次有冲动想创业 。
哪几次热潮会让你有这个想法 ?
我有一年在看游戏 , 我在看游戏 ,因为我自己一个是还比较喜欢打游戏 , 然后那一年整个也不是元宇宙吧 , 更多是在元宇宙之前 ,其实游戏行业就我觉得游戏其实是移动上面非常好的一个赛道 。
虽然它离资本化不近 ,但反正游戏是一个非常好的一个商业 , 它既贴合人性 , 然后它又有很好的商业模式 。
反正我觉得那时候对我来说 , 就是整个一直在参与到当时其实虽然说不是移动互联网最最黄金的那么几年, 但其实那几年也有非常多的这个新的公司跑出来 。
我觉得比较幸运吧 ,在那个时候可能就光源发展比较快的阶段 , 我也参与了 ,并且有幸在里面做一些贡献 。
消费你没有想过创业 ?
消费吗 ?
对 , 就是有一段时间消费 。
消费跟那个互联网还是会差距蛮大的 ,因为我也看过一段时间消费 ,但它跟互联网还是不像 。 互联网的这个链条或者它的这个产品化或者它的这个逻辑 , 我觉得跟消费品还是很不一样的 。
互联网它我觉得一个是更通用一点吧 , 就你如果把一个问题定义好 , 把一个需求定义好 , 它是更容易 scale 的 。
消费这里面从供应链到这个渠道到各种环节吧 , 它的链条是更复杂的 。 我觉得跟看消费跟看互联网的逻辑还是蛮不一样的 。
然后我其实从业这几年里面主要是在看互联网 。 我觉得基本上可能国内那几年里面 , 从 16 年到 23 年我离开这行业之前 , 可能 50% 以上的有百万日活的新的 APP, 我应该都有聊过或者我有参与 。
就不管是帮他融资 , 还是说可能有部分我们也我们也通过光源基金做过一些投资 。 所以还是比较亲身经历了整个互联网最后那几年的发展 。
但是从 16 年之后, 就是你说的这种有百万日活的 APP 里面 , 它应该没有什么长成 , 中型都没有长到 , 对不对 ?
就别说大型的公司 。
还是有的 , 比如说不是我参与 ,但我们可能整个就团队参与的 , 像这个得物 。
得物 ?
得物是后来出来 , 得物其实是 。
得物成立得很晚是吗 ?
得物成立蛮晚的 。
2015 年 7 月成立的 。
对 , 对 。 这几年我觉得有个现象 , 就是还是有很多新的公司 , 百万级日活或者千万级日活公司还是有不少出现的 。
但是呢 , 这里面大部分公司都会比较低调 ,因为不想被巨头看见 , 大家会更低调 。 所以那几年里面其实整个这个我觉得互联网在可能 16 到 21 年还是有一波这个高潮 。
你看比如说在光源内部的角度来看 , 当时还是光源最大的一个赛道 。 就每年不管从 GMV 还是说从我们自己投入 , 那可能都是最大的一个赛道吧 。
但这件事情在 22 年之后就不是这样了是吧 ?
对 , 我觉得 21 年年底到 22 年是一个拐点吧 , 就是整个我觉得移动互联网确实到了 , 我觉得一个跟中美 , 包括美元基金的这些关系有关 , 另外一个跟本身这个行业的也是 , 我觉得到了一个发展到一个很成熟期 , 它其实更多是进入了一个整合 , 或者说巨头把很多这个流量的一些空白的地方去做了填补 。
包括像字节这样的公司其实非常非常强 , 它可以把很多新的方向后来居上, 甚至去吞掉 。
你说像番茄小说 , 像红果的这个短剧 , 它其实都做到了很大的提升 。
是的 ,是的 ,是的 。 所以我觉得在整个这个 , 包括其实字节不仅对创业公司 , 它对于很多大厂已有的业务也是巨大的一个冲击 。
我觉得其实这里面其实到 21、22 年从资本上, 从整个行业的格局上, 它确实到了一个成熟 , 甚至可能行业去整合的一个阶段 。
所以我觉得那个是一个时间点 。
你觉得之前在光源的这 6 年多 , 对你现在来做创业有一些什么样的影响和一些你叫帮助也好 , 或者说叫语境也好吧 , 就是影响你现在的一些决策的 。
那几年经历对我还是蛮宝贵的 , 一个是我对也不能说多懂互联网吧 ,但至少我的上下文 , 我的 context 是足够的 。
我看过足够多的公司 , 从各种各样内容平台 , 从文字到图文 , 到视频 , 到直播 , 到长视频 , 到音乐 , 到音频 , 到短剧 , 包括到社交社区 , 到出海工具 ,其实所有的品类的平台我都有一些了解 ,也看了很多公司的这个发展 。
所以对我来说我有一些输入 。 另外一个是对我来说可能也是让我会更愿意去冒险吧 ,因为我觉得本身很多事情事在人为 , 就没有一些东西是被设计好的 , 比如说怎么样的人才能创业 , 或者怎么样的人他就不能创业 , 或者说符合什么履历的人他创业就一定会成功 。
我觉得这行业是没有固定范式的 , 反而是那些更愿意去冒险 , 看到一些非共识的东西的人, 能够去把事情做出来 。
所以那个时候我觉得对我来说 takeaway 就是说一个是看准了要敢赌 , 第二是看准了就要赌的话要 all in, 然后要亲身去参与 。
所以我觉得这里面对我来说会有一些 , 可能一些是从这个认知 , 或者说一些信息量层面 , 跟一些比如说思维思考事情方面上的都会有一些帮助 。
比如说在你接触比较多的公司和创始人里面 , 什么人给了你比较深的印象和启发 ? 包括你刚才说的就是可能创业成功与否跟你是否是一个特定的背景并不是直接相关 。
我觉得有两类 founder 对我的影响非常非常大 。 有一类 founder 是那种就是特别有 vision,他对于自己想做的事情特别热爱 ,他会基于自己的需求 , 或者基于自己的一些独特的洞察 , 即使所有人都不相信 ,他也愿意去冒险去说服更多人来相信他 ,并且一直坚持 , 即使在公司可能顺利不顺利的时候 , 都能一直持之以恒去做探索 。
我觉得这类人对我的触动非常非常大 ,因为我觉得这类人是真正那种能推动行业进步 , 能去持续去做创新的人。
那你和周围的就是以前跟你差不多时间入行的做一级的朋友 , 你们现在有时候偶尔会交流吗 ?
你们会讨论什么 ?
还是交流蛮多 , 就还蛮有意思的 。 就是我觉得这几年跟我交流很多同行 ,有一半以上不是在聊我们这公司 , 一半以上在聊以后他们能做什么 。
我猜也是会聊这个 , 就大家现在在想什么了 。
对 , 我觉得很多人, 比如说就我觉得可能客观来说 , 确实整个这个一级市场的环境跟我刚从业的时候有很大变化 , 包括可能美元基金 、 人民币基金都有很多的这个因为宏观形势各种原因导致这些变化 。
所以我的体感是非常多的 , 我原来的同行他们会去想一些新的一些个人探索方向 , 可能很多人会想自己创业 , 会想加入创业公司 , 或者可能有些人他也就彻底转型了 。
我觉得这里面其实都有了 ,但我觉得本身其实还是一帮很聪明的 ,有很多这个经验的人 ,他想去做一些大胆尝试的一个状态 。
我觉得现在看起来很多同行也找到很不错的一些地方 , 然后在做自己可能下一步想做的事情 。
然后现在我觉得很多人可能他就是跟你之前类似的一个情况 ,他不是直接搞 AI,但他想加入这个新的机会 ,他想跳到这个热潮里面 。
就你对有这种考虑的人, 你会有什么建议吗 ?
我会觉得还是先沉下心来去了解 , 就可能你不会写代码 ,但你可以去了解这技术大概的一些原理 , 比如说它大概能解决什么样问题 。
因为我觉得解决什么样问题 , 这个其实是一个可以被了解 , 或者可以去分析 , 或者去根据自己的独立判断去判断出来的事情 。
然后本身我觉得很多的这个学术上概念 , 你要去理解它 , 现在有那么多 AI 工具 , 那么多的教课程 , 它也没有那么难 。
但我觉得更重要的是以我的经验来说 , 我当时更多是我觉得当时我更多是因为我体验了足够长时间的这些文生图的这些产品 , 或者视觉生成的产品 ,以及我当时也去请了一些这个有代码能力的朋友来去跟我协作去做一些探索 。
所以过程中我因为这些探索跟这些上手第一手的尝试 , 让我有了可能跟我同一个时间的别的同行 ,他们也有自己的一些认知跟判断 。
所以我才会有勇气 , 或者我会有一些决心说去 , 那我看到一些可能大家没有看到的东西 , 那我可以去赌一把 , 然后把自己投进来 , 一起去探索一些未知的事情 。
在你 16 年到 23 年在光源的时候 , 你不是说这种其实互联网的项目基本上都看过吗 ? 就各个类型的 。
对 。
就是能做到这个速度达到千万月活的有吗 ?
凤毛麟角 。
就还是有的 。
还是有的 。
比如说什么类型的产品 ?
比如说当时有很多做社交的公司 , 它就在爆的那一个月 , 那肯定是很快就会到一个甚至 100 万的日新增 , 我都是有看过的 。
但基本上可能我从业那几年里面很少 , 就可能加起来不到 5 个吧 。
那这种会有留存 , 就会持续吗 ?
大部分留存没有那么好 ,但也有长期留存的公司 , 它能够持续能稳定下来 。
这是一个你觉得比较超出你预期的体验 。
对 ,因为它是一个比较可量化的东西 , 然后就会让我去对比原来看的这些东西 , 感觉还是会让人回头想想会觉得可能确实给很多用户创造了独特的一些价值 。
还有什么吗 ?
还有比如我们在我们的发布毒液之前那代模型 , 我们在内测的时候 , 我们能看到这个模型的图生视频的效果能这么好 , 这个也是在发布之前 ,在我们训出来之前的一段时间 , 还是一个超出预期的事情吧 。
我们发现说它应该已经能做一些让普通人能够玩起来了 。
你们就是创业两年多以来 ,有什么你觉得比较难或者比较低谷的时候 ?
低谷与信念1:27:39
我觉得在 Sora 发布的之后的一段时间 , 我们的模型还没有训出来的时候 , 我觉得也不能算低谷吧 , 更多是我们在潜心研发 , 潜心往前奔跑的状态 。
那个时候应该是你们的下一代模型没有训出来吧 ?
对 , 我们家整个 DIT 这个模型还没有训出来 。
你们之前 。
那个阶段我觉得更多是一个 ,因为确实这个技术很难 , 它需要一定时间周期 。 那时候市场上会有各种各样的声音 , 什么谁谁谁哪个月要发布什么模型 , 然后呢 Sora 它有多厉害 , 然后中国团队可能永远训不出来 ,有各种各样的声音 , 都是噪音 。
但对我们来说那时候更重要的是怎么去把自己手上的事情做好 ,因为它是一个无人区 , 没有人把它这个事给落汤出来了 。
所以那个时候其实是一个对要相信自己跟能力跟自己选择的方向 , 要面对非共识的一个阶段 。 那个时候我觉得还是会挺不一样的 。
那个时候需要一些什么方法和手段来提升大家的士气和信心吗 ? 有什么比较有效的方法吗 ?
很难说方法 , 更多是我觉得还是说大家的这个整个组织内部 , 大家的是不是思想一致 , 大家对于这个大的我们在探索方向是不是有比较 common 的一个共识 ,以及比如说就比如说对于我们自己的能力 , 我们能做的事情 , 大家是不是有信心 。
我觉得这个是最基础的 。
对 ,因为你说到这个 , 我想到就是在 DeepSeek 之后 ,其实有一批大语言模型的公司 , 它好像也有点面临这种情况 。
但我觉得还是不太一样 。
是不太一样 ,但有一点相似吧 。
对 , 我觉得还是不太一样 。 我觉得那个时候 Sora 出来的时候是 。
是大家都没做出来 。
大家都没做出来 ,Sora 自己其实也没做出来 。 然后 DeepSeek 那个阶段 , 我觉得跟这个情况场景会区别还蛮大的 。
行 , 那今天非常谢谢旭章来做客晚点聊 , 感谢大家的收听 。
好 , 我是曼祺 , 多谢雨桐 , 然后也非常欢迎大家去体验我们的 PixVerse 产品 , 然后我们在国内马上会发布 。
你说一下国内产品的名字 。
我们国内产品会叫拍我 AI, 一个首先拍我是 PixVerse 的谐音 , 它有一点谐音 , 另外一个是我们觉得每个人都可以成为自己生活的导演 。
那么我们希望说拍 , 拍结合 AI 生成 , 同时拍自己跟自己身边的环境 , 会成为一个新的人去创作短视频内容的新的一个范式 。
我们也希望去通过我们的努力来推广这个新的创作方式 , 能让更多的有视频保育的普通人能够第一次做出来一个好玩的视频 , 可以发给自己的朋友 , 发给自己的父母家人去看 ,并且得到非常多正反馈 。
这个是我们想做的事情 , 然后也欢迎大家来体验 ,也给我们反馈 。
OK,OK, 那 6 月初这个产品拍我在中国正式上线之后, 大家可以去试 。 那今天节目就到这 , 大家再见 , 拜拜 。
拜拜 , 谢谢
。
本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 LatePost。
下期再见
。






