开场0:00
大家好 , 欢迎收听本期的 《 晚点聊 》。 今天我们的话题是 " 技术遇上艺术 ", 一起来聊一聊计算机技术和正在蓬勃发展的 AI 技术 , 会如何与 M&E,也就是 Media and Entertainment( 媒体娱乐产业 ) 相互影响 、 相互塑造 、 一起发展 。
围绕这个话题 , 我们很高兴地邀请到了两位嘉宾 : 一位是 NVIDIA 中国区高级技术市场经理施澄秋 (Searching), 另一位是新片场的董事长兼 CEO 尹兴良 (Ethan)。
两位可以和我们的听友打个招呼 。
各位在线的小伙伴们大家好 , 我是施澄秋 , 来自 NVIDIA。
各位听众朋友们大家好 , 我是新片场的尹兴良 。
今天的两位嘉宾刚好是 " 技术塑造内容 " 这个链条的两头 。 那 NVIDIA 是全球最知名的 GPU 设计厂商 , 同时 NVIDIA 也会开发大量的软件去帮整个生态更好地使用 GPU。NVIDIA 起家就是计算机图形技术 , 最初也主要是用在游戏和影视行业 。
新片场也是一家我觉得很多朋友可能都会比较熟悉的公司 , 最开始是一个高质量的短片分享平台 , 比如说之前他们有一个非常出圈的短片叫 《 煞事配齐 》。
后来新片场也有制片的业务 , 所以其实 Ethan 这边对整个影视行业的流程都是很熟悉的 。 我们之后可以展开讲 , 比如说近年比较火的 《 鬼吹灯 》 系列 、《 精绝古城 》《 南海归墟 》 这些都是由新片场来出品的 。
那下面我们就正式进入正题 。 内容创作或者说讲故事 ,其实是人类文明最早的活动之一 。在 AI 这个技术之前 , 这个行业已经变成一个非常庞大的 、 有很多链条的工业体系 。
那第一部分我们就想先和两位聊一聊 , 这个行业里面已经有哪些技术 , 尤其是和计算机相关的一些技术的应用 ,以及这些技术可能会怎么影响了行业 。
想先请 Ethan 新片场的尹总跟我们聊一聊现在的 , 比如说在国内 , 就一个剧集的制作流程大致是怎样的 ,以及里面哪些环节可能用到技术比较多 。
你可以以你们的一些作品作为例子来讲讲 , 比如说像 《 鬼吹灯 》 的 《 南海归墟 》 啊 , 像 《 精绝古城 》 这种特效比较多的一些剧集 。
特效制作2:07
因为新片场影业 , 我们主要是做出品网络电影和网络剧比较多 , 然后也是跟三大平台在合作 。其实我们内部的出品一个内容的流程大概是 , 首先我们会有一个立项会 , 然后决定我们要做的这个项目的方向 , 然后包括梗概 , 然后包括通过内容审查 , 然后才会正式立项 。
立项之后呢 ,其实会进入剧本研发的阶段 , 就是剧本确定之后, 同时呢我们会确定这个影片的导演 , 包括主演等等这些主创 , 然后就开始正式的建组筹备 , 然后进入到实际的这个拍摄过程中 。
然后拍摄完成之后啊 ,其实就进入到了这些后期的剪辑 , 定剪了之后呢 , 就会进入到特效 。 特效做完之后, 基本上回插完就开始调色 、 声音 , 然后最终成片了 。
成片之后送到这个内容审查 , 通过内容审查以后, 就可以跟平台来去确定一个片子的上线的这么一个具体的时期 , 然后跟观众见面了 。
这就是我们内部大概一个内容生产的这么一个全链条吧 。
你刚才说特效之后回插完 , 回插是什么意思 ?
就是插到那个 。
影片中 。
对 , 就是因为特效镜头它是其实单独制作的 。 对 , 就是我们这么一个生产链条中 ,其实是有非常多的这种协力公司 , 然后来去跟我们一起合作 , 比如说有人专门负责特效 ,有人专门做剪辑调色等等 ,有人专门做美术等等之类的 。
因为一般人能想到的可能就是特效里用技术会比较多嘛 。 就除了特效之外, 还有哪些环节可能也会涉及到 ?
准确来讲 , 现在其实各个环节呢 , 大家都在用新的技术来去降低成本 、 提高效率 。 就是我举个例子 , 比如说你像在前期的这种画分镜上, 分镜的 , 就是分镜头的设计 , 过去很传统的方式是纯用绿幕嘛 , 现在很多公司在拍摄的流程中也会用到全新技术的 LED 屏幕 ,在拍摄过程中就直接把后景去叠加进去 。
这样就是这些新的技术也会在广泛利用 , 包括后期制作流程也在被技术在不断地去更深入地去辅助吧 。
但最核心大家采用这些技术的目的都是一个 , 就是提高效率 、 降低成本 。
就你刚才说的那个拍摄过程中间用 LED, 我之前也听到别的一些媒体上有人分享 , 这个确实是很新的一个技术 。
比如说这个 《 狮子王 》 的后面那个新的版本 , 就是特别逼真的那个动物的版本 , 它就有用到这个技术 。
这个应该 ,Searching 可以补充一下, 这个应该是不是就有一些 NVIDIA 的一些技术 , 或者说你们的生态里的一些合作方相关的产品的支持啊 ?
因为它那个应该是对你实时的 , 比如说毛啊 、 光啊 、 水啊这种东西的渲染都是有些要求的 , 对吧 ?
其实绿幕用了很久很久 , 可能 20 年前大家就在用绿幕 。 但是之前的绿幕跟现在绿幕其实是天壤之别的 。
那 LED 是 17、18 年刚刚兴起的 ,因为 LED 的成本在过去的几年里面急剧的下降了 。 可能举个例子 , 像十几年前 LED 可能还是 0.6 的屏 , 又很贵 , 非常贵 。
你搭一个很大的 LED 可能上千万 , 甚至破亿都有 。 所以用 LED 屏在那个时候去拍摄是不现实的 ,因为它占地成本 、 运营成本 、 维护成本 , 包括电费 , 极具高昂的一个拍摄成本 。
但这几年 LED 屏它的精细度 , 比如说 0.4、0.3, 对吧 , 甚至成本也降低了 。 那咱们国产 LED 也很便宜了 , 所以这几年就流行起来了 。
但是无论 LED 也好 , 绿幕也好 , 你的后面的这个背景 , 它其实是靠视觉运算效果渲染出来的 。
比如说举个例子 , 像你刚才讲的这个 《 狮子王 》, 它 LED 的这个后面这个东西 , 它可能是 CG 来做的 ,Computer Graphics 来做 。
这是我们 NVIDIA 的老本行 , 对吧 ?NVIDIA 我常常讲 , 我们是 GPU 的发明者 , 我们是全世界视觉运算行业的领袖 , 对吧 ?
这是我们的老本行 , 靠这个起家 , 引以为豪 ,以此谋生的 , 对吧 ? 包括我的这个薪水可能都是从这儿来的 。
那么在这个地方 , 我们可能去渲染了实时的内容 。 那这些内容呢 , 我最后做出来一段视频 , 我把它放在这个 LED 屏幕 , 拍的时候你看它后面是个硬背景 , 然后 。
最近关于这个屏幕 。
因为你就直接把它捕捉到你的画面里面去了 , 所见即所得的 。 这个是它的优势所在 。 当然它画面也比较好 , 那它可能就实时的 , 它有很多你可以看得见的一些互动啊 、 光影啊 , 它都非常棒 , 对吧 ?
举个例子 , 我拍个奢侈品的广告 , 珠宝的 , 对吧 , 后面有一些背景 。 那么前台可能是一个真人穿着这些奢侈品 , 戴着这些珠宝 , 那它其实跟后面的环境的光影效果互动是非常逼真的 。
你这个时候用绿幕做的话 ,因为绿幕它是一片大的绿色的背景 , 你再去抠把这个人 、 前台的这个东西抠出来 , 它的颜色其实就不准了 。
因为它整个你要多一道工序 , 要把这个绿幕的背景 , 它因为它有光线的一个照明的作用 , 要把它去掉 。
对于奢侈品厂商而言 ,他们是无法接受这样的绿幕拍摄方式 。 因为你把我整个的这个色调 、 这个产品的高级感的氛围无法衬托出来 。
所以 LED 有的时候它的好处是这个 。 但是绿幕呢 , 我们讲以前的绿幕 , 可能大家看起来比较傻 , 就是一个一些演员在绿箱里面去拍 。
但是现在的好处是 ,因为 CG 的这个技术发展了 ,NVIDIA 的技术也发展了 , 我们的 GPU 的渲染能力也发展了 , 所以我们今天如果用我们的绿幕 , 加上 NVIDIA 一系列相关的软件技术去做的话 ,其实它也跟 20 年前是不可同日而语的 。
比如说我可以做实时光线追踪的内容 , 我的后台的这些虚拟拍摄 ,Virtual Production 的这些内容 , 可能是可以多人协作的 。
那甚至我可以结合一些 AIGC 的内容 , 来拍摄的时候会有更好的互动性 。 那当然就像 Ethan 刚才讲的嘛 , 我们可以降本增效嘛 , 这是大家共同的追求 。
这个是整个在现在的 M&E 这个行业 , 传媒影视娱乐行业里面 , 两种不同的拍摄流派的 , 我们都可以支持 。
因为万变不离其宗 , 它都是靠这个 CG 电脑 ,Computer Graphics 来渲染出来的 。
我想问一下 Ethan, 就是你们现在拍摄 , 你们会用到 LED 这种特别新的东西吗 ?
坦白讲用的还是比较少 ,因为其实对我们来说核心还是一样 , 就是还是一个成本的考量 。 就这里面成本考量 , 除了硬件成本之外, 还有一个软成本 。
就是说其实因为像我们这种做网络内容的 , 网络电影也好 , 网络剧也好 ,其实我们讲究的一件事情是什么呢 ?
就是效率 。 就是说我们可能一个内容从立项到上线 , 我们需要非常短的时间 。 就是因为网络内容更加短并快一些 。
因为现在刚才提到的很多这些新技术 ,其实在业界并不是最普及的 。 所以说其实它在效率的层面有一个问题 , 就是在于会熟练运用这些拍摄流程的创作人还是相对比较少 。
就是你找团队也会有点麻烦 。
对 ,是的 。 就是现在大量的团队还是传统的这个模式下 。 所以对我们来讲 , 如果希望一个内容尽快地推出 , 跟观众见面 ,在产业没有特别成熟的情况下 ,其实我们往往还是会选择相对传统的模式 。
但是有一些相对大的制作 , 或者是说有一些像刚才 Searching 提到的一些更前端的一些广告片也好等等这些东西 ,其实他们可能往往会选择去尝试新的技术 , 或者去探索这些新的方式方法 。
对 , 比如说像 《 风神 》《 流浪地球 》 这种比较大的 IP, 对吧 ?
是的 ,是的 。
就我不知道这个方方面面说 , 就比如说像 《 鬼吹灯 》 这个系列 ,其实它对特效的要求还是比较高的嘛 。
我觉得它可能技术成分会比较高 。 所以在这整个链条里面 , 就技术上的一些投入 , 它可能占到你们的制片成本的多少了 ?
因为我们首先做的是 《 鬼吹灯 》 的网络电影 。 我们网络电影这个系列呢 ,其实坦白讲 , 我们在艺人上的预算其实投的反而不高 。
因为它的艺人相对来讲 ,不是占像传统的那些电影一样 , 或者说大剧集一样占大部分的预算 。其实我们确实绝大部分的预算投入在了这个制作中 。
也就是说特效中, 我拿我们 《 鬼吹灯之这个南海归墟 》 来举例子 , 它可能有一半的时长是特效镜头 , 观众看到的有一半的东西都是渲染出来的 。
因为它那个故事剧情是讲的在海上 ,但我们那个电影其实全部在棚里拍的 。 所以说你看到开场大概 20 分钟之后就出海了 , 跟海相关的所有镜头全部是跟特效相关的 。
因为其实您在这个行业也很久了 , 包括 Searching, 就是你们也可以从你们的个人经历的角度来讲讲 , 从你们入行开始到现在 , 你们觉得这个技术在中国的影视内容 , 包括新闻这些制作行业里 , 它大概是一个怎么慢慢渗透发展的过程啊 ?
因为我本科是 06 级的 , 然后我是 12 年读研究生的时候开始创业做的新片场 。其实我当时之所以做新片场 , 就是因为我自己平时业余时间比较喜欢拍片子 , 我觉得可能自己拍短片没有地方存储 , 我们就创业做了新片场这么一个平台 。
你本来是什么专业 ?
无线通信 。
哦 , 你这是理 , 哦 , 马农专业技术是吧 ?
对 , 这十几年其实我们看到 , 从我角度来讲 , 我觉得技术对于创作体系的这个颠覆真的是非常非常大的 。
技术演进11:16
我记得我在读大学的时候 , 我们拍片子还在用索尼和松下的机器 , 就是 190P 啊等等 ,EX1 啊什么这种很笨重的大的机器 。
先从拍摄这一端来讲 , 它就不是一个大众化的事情 。 而且当时你拍完东西 , 你要想导到电脑上 ,因为它是磁带 , 所以你拍多长时间是 1:1 的 。
就是说举个例子 , 比如说我们拍一天东西 , 我要花一天的时间去把它 。
导到 ?
导到电脑上, 才能开始剪辑 。 大概 12 年、13 年的时候 , 那时候用单反来去拍 , 拿 5D 来去拍 , 变成了一个行业的主流 。
到现在很多人都在用手机在拍 。 然后再有一个就是从制作端 , 虽然制作端这么多年, 大家主流的还是在用像 Adobe 的产品啊 , 包括苹果的产品 ,但是纯纯的制作流程本身也在发生出非常大的变化 。
因为本质上来讲 , 就是计算机的性能变得突飞猛进 , 这个可能跟我们 NVIDIA 的贡献也密不可分 。 我就讲一个很简单的例子 , 比如说以前导出一个 , 比如说一个小时的视频 , 可能要几个小时, 甚至这个一天 。
但现在可能就整个的制作流程完全被新的硬件 、 新的这些软件去给颠覆了 。 看未来 , 我觉得下一步可能会更加夸张 , 特别是有了 AI 这个技术之后, 就可能过去我们要花很多时间才能实现的事情 , 可能未来就是几分钟的事情 。
所以说这会让整个的创作更加的平民化 。 社交媒体这一波 ,其实把传播这件事情变得更平权了 。
我觉得 AI 这一波 , 就是创作能力不再集中在少数人手里 , 或少数机构手里 ,而是让更多的人也有机会 , 或有这个能力去参与到创作中来 。
Searching 你也可以从你的角度讲讲 ,而且你经历的这个时间跨度可能更大 , 可能是大概从 00 点左右到现在的一个情况啊 。
对 , 我可能比 Ethan 稍微老一点 , 所以可能 Ethan 经历的这些在更早之前 , 举个例子 , 像 Ethan 说他之前是这个磁带导入 , 当然我们也是一样 , 我们从 DV 导入 , 甚至 Beta 时代就导入 , 从 1394 1:1 的导进电脑 , 从那个时候还没有现在的这么高速的网络和界面 。
你看到在过去的影视创作 ,其实大家都面临同样的痛点 。Ethan 是学理科的 , 现在改去干文艺行业了 。
我是正经学广告出身的 , 现在去干这个电脑 IT 了 。 咱俩的道路截然相反 。 我学广告的时候其实非常简单 , 当时大家做的时候 , 电脑其实是对我们而言是一个非常昂贵的东西 , 可以说大家没有什么机会真的去用电脑做后期或者怎么样 。
因为当时的电脑其实成本很高 , 别说做视频了 , 你做平面的东西 , 用电脑都是一件很奢侈的事情 。其实大家都学的非常纸上谈兵的一些理论上的东西 。
我想补充问一下, 您说学广告 , 那是哪什么时候啊 ?
很早 , 我本科就是学广告的 。
对 , 我就说哪一年啊 。
90 年代 。
哦 , 您可以继续讲啊 。
显得我暴露年纪了 ,有点老 。其实我们当时你看 , 我们把拍摄的视频输入到电脑里面 , 或者说我们做当时的虚拟演播室 , 根本就没有所谓虚拟演播室这概念 , 太昂贵了 。
当时哪怕是一个极其简单的 , 比如说叠加实时字幕 , 今天看来不费吹灰之力的一件事情 , 当时其实是一个非常高昂成本的商业行为 ,以至于有许多专门做字幕机的这样的厂商 。
你现在觉得你花几十万去上门做一个实时字幕机系统 ,是不可思议的一件事情 ,但事实上在当时就是这样的一个行为 。
因为当时要用把用电脑实时叠加一些字幕 , 甚至有特效的字幕到你的屏幕上, 无论是电影还是电视 , 大屏幕小屏幕 ,其实都是一件非常昂贵的事情 。
所以你可以看到 , 当时我们用电脑去处理一些后期的特效而言 , 就是更加可以说是金字塔顶尖的这些 studio, 甚至是一些大的 film, 它影视公司它才能有能力去负载的 , 这样去负荷得了的这样的一个行为 。
但是像 Ethan 刚才讲的 ,因为我们现在今天此时此刻 , 我们的 creators, 它其实没有什么成本的限制 ,也不需要有非常专精的背景 , 它就可以去完成许多以前才能做的事情 。
以前我们可能打个比方 , 我是我会用 Premiere, 那我学 Premiere 可能不是几个月速成的 , 我可能学了几年, 甚至有些人他一辈子他的职业就是做 Premiere。
那今天我们的用户他很简单 ,他拿一个手机戳戳屏幕就可以做后期了 , 甚至他的手机没有太强大的处理 。
我的后台 ,因为后台有 GPU, 云端有 GPU, 云端有渲染能力 。 比如说我们今天的很多创作者 , 像国内的这些小伙伴 ,他们用用抖音 , 对吧 ?
比如说他用抖音 , 用小红书等等 , 用哔哩哔哩 ,他传到后台 ,他其实就可以用他前端的软件调用后台的服务器上的一些渲染也好 , 后期也好 , 这样的 GPU 资源来去帮他做在线的一些特效啊 , 一些制作啊 , 一些叠加等等 ,其实就可以完成他很多以前需要前端非常昂贵的人力物力专精的这个领域里面特有的一些技术背景才能完成的工作事情 , 现在都已经可以完成
了 。 更何况我们今天可以看到 ,因为有了这个人工智能的引入 , 这个行业就会变得有许多事情 。
以前可能说我们只有一个想法 , 今天我可以通过一段简单的指令 , 让人工智能去帮我去完成 。 就像我刚才讲 ,NVIDIA 是 GPU 的发明者 , 今天我们已经过渡了 ,NVIDIA 现在是人工智能计算领域的领导者了 。
你可以看到我们自己的产品 , 从过去的单纯的做这个视觉计算 , 到现在变成人工智能计算领域 ,其实我们的整个的产品也在因应这个潮流变化 。
当然我们对于这个影视传媒行业的我们带来的好处 , 实实在在看得见摸得着的 , 就是门槛更低 , 成本更低 , 效率更强 。
然后呢 , 能让我们更多的这个个人创作者也可以进入到这个领域里面 。 所以今天可以看到这个 UGC 的这些原生的用户 , 原生的这些内容丰富蓬勃的发展起来 。
那这个我们可以分开来讲讲啊 ,因为您也说到这肯定是个逐渐的过程嘛 。 那像 NVIDIA 在国内的这种影视行业的客户 , 或者说下游的一些生态吧 , 那早期肯定也还是一些机构为主 , 对吧 ?
比如说像我们之前有聊到过像央视 , 还有像国产的 , 我不知道 Ethan 用过没有 , 大洋的这个剪辑的一个东西 ,有点类似于 Premiere 吧 ,但是是国产的一个 , 我以前在大学也用过啊 。
就包括你刚才说那个字幕 ,以前我们就学校电视台剪完一个片子之后, 很重的一个工作 , 就是你得在那对着这个视频一句一句的去拍这个字幕 。
它是不能自动生成的 ,而且你要卡那个点 , 你要拍错一句 , 你还得重新再开始弄什么的 。 对 , 你可以讲讲就是从比如说机构的这个过程 , 包括你们这个过程中间怎么帮机构去降本增效 , 到后面有更多的个人来用 , 它是怎么演变的过程 ,以及如果有个人来用的话 ,其实这个中间的链条就会更长了 , 对吧 ?
比如说你刚才也说到这个渲染的 , 可能它有一些专门的服务商在做这个 。 所以现在这个链条大概是怎样的呢 ?
其实如果说机构的话 ,以前可能就是就像你讲的这个央视吧 , 那我们以前跟央视的合作 , 可能也是通过国内的一些第三方去完成的 。
相当长的一段时间里面 , 我们在影视传媒行业里面是一个籍籍无名的 nobody, 没有人认识我们 。 所以我们当时在进入这个行业的时候呢 , 我们在中国也没有粉红公司 ,也没有人, 也没有售后, 也没有技术支持 ,也没有 FAE, 什么都没有 , 一无所有 。
所以我们当时肯定是通过一些我们的合作伙伴 , 或者说采用了我们的技术的一些系统整合商 , 像您讲的这个大洋 ,他做非边系统 , 就是非线性边界系统 , 或者做字幕系统这样的 partner, 我们来去引入的 。
那也有一些做虚拟演播室的这样的一些合作伙伴去引入的 , 比如说像我们跟央视合作做虚拟演播室 , 很多很多年前在这个不知道大家有没有印象 , 就是 90 年代做世界杯的时候 , 那当时在世界杯每一场比赛开始之前 ,他都会有一个虚拟演播室 , 那个主持人他的虚拟演播室里面有几个小人可以低溜儿的小人弄来弄去 , 讲排名不正 , 讲这个前锋放在哪 ,
然后讲他有什么阵型的变化等等。 但其实大家都知道这个这个完全是虚拟出来的 ,因为在拍摄现场这个演播室里面 , 它其实没有这些东西的 。
那其实这些东西就是由后台的渲染去完成的 , 只不过当时的渲染非常简单 , 今天看起来那些渲染简直就是小儿科了 , 就是就是一个积木形态的渲染 。
但是在当时而言已经是很了不起了 。 再举个例子 , 像大家都知道新闻联播之后, 我们都有个这个天气预报的环节 , 对吧 ?
天气预报你可以看到主持人后面有个大屏幕 , 上面有一个气象云图 , 对吧 ? 然后后面有一个全国的地图 。其实主持人在拍摄的时候 ,他后面没有那些东西的 。
通俗的而言 ,其实就是某种意义上的一个绿幕 ,因为他背后没有那些东西 。 那主持人就是在那个屏幕上指指点点 , 后面用后期叠加上去的这样的一个方式 。
那其实这些的渲染当时都是用 GPU 来渲染完成的 。 当然今天我们看那些比较幼稚 , 跟今时今日的渲染是不可同日而语 。
今时今日我们可以做到实时光线的追踪了 ,以前这个光线追踪都要丢到渲染农场里面做离线渲染 , 一渲染可能渲染几十上百个小时来渲染一个一个几十秒的这样的一个画面 。
所以在过去你可以看到好莱坞影片的这个 , 它的制作周期是非常的长的 。 一个一个 , 比如说像 Pixar 一个一个电影 , 它可能制作周期要要 18 个月 ,24 个月之多 。
今天可能可以压缩到几个月 , 就是因为后期的渲染的时间和成本被大大的这个压缩了 。 所以我们今天可以看到 , 降本增效不仅仅是头部的顶尖的这些 studio, 这些大公司大机构来去用的 。
比如说打个比方 , 今天我们在这录的这一段音频也好 , 视频也好 , 或者说我们之后做的一些像 NVIDIA 经常跟国内的一些第三方的机构 , 我们做一些视频的访谈也好 ,其实后期去做剪辑 , 或者说在后期叠加一些背景的特效 , 比如说如果今天我们做一个视频访谈形式 , 这个时候你可能 B-roll 就会插入一些我们讲的这当时的古早味的画面进去 , 对吧 ?
那这个 B-roll 叠加进去的时候 , 那今天我们用 GPU 用电脑去做的话 , 可能点点鼠标啪一下一拖 , 那马上就这个 B-roll 这个 track 就就就 overlay 上去了 。
那可能对于我们整个的这个行业的这个制作成本周期 , 各方面的考量是带来了巨大的生产力的提升 。
我们正好可以顺着这个话题 , 就聊一聊这个新的 AI 技术的一些影响啊 。 因为刚才可能聊的是现在就大概的一个制作流程是怎样的 ,以及可能就往前倒是怎么从之前大家说的这种非常非常麻烦的过程 , 然后到现在很方便的一个过程 。其实刚才虽然没有聊 AI,但两位也都有提到啊 。
那我觉得现在最受关注的肯定是 AIGC 的这个变革嘛 , 然后也有很多地方会讨论说给影视行业 、 新闻行业带来什么变化 。
就如果从你们两个的角度来说的话 , 你们会比较在意这个热潮里的什么东西啊 ?Ethan 可以先讲讲啊 。
从我们角度来讲 ,因为毕竟我们还是产业的公司 , 所以说我们首先最在意的就是说 AIGC 这件事情怎么能应用到我们现有的工作流里 , 帮我们去降本增效 。
AI 应用22:04
我想知道就是你比较关注到这个事情是在 ChatGPT 2023 年在中国特别火之后, 还是可能你在行业里你更早就会有关注到这个东西 ?
坦白讲更早 ,而且我们其实关注的反倒不是 ChatGPT。 最早我们关注到这个领域是这个 Diffusion。
就是文生图这些 。
对 ,其实在 Midjourney 之前有另外一个 APP, 当时在美国已经很火了 , 我记得叫 Dream, 然后它其实是当时的这个所谓 Diffusion 的算法呢 ,是可以帮你去生成一些艺术画 。
它可能没有像 Midjourney 一样 , 现在可以帮你去生成一些很具体的一些东西 。 当然它其实是对于这个 Diffusion 技术的一个很简单的应用 ,但那个 APP 其实我记得当时已经是在美区的 Apple Store 里排名前几了 。
这是 22 年的时候吗 ? 还是 ?
呃 ,22 年吧 , 反正我记得印象很深的时候 , 你写一段话 , 然后它根据你这段话生成一幅你这个主题的 , 比如说梵高或莫奈风格的艺术画 。
核心是你输入段文字就可以 , 你可以不仅仅输入照片啊 ,但它背后就是 Diffusion 这个技术 。其实我们是那个时候关注到这个智能生成这个领域的 。
因为其实本身我们这个平台本身就是各种视觉艺术家的这么一个集群 , 看到我们的用户在那个 APP 再去生成一些内容啊 , 发到我们这个平台上来 。
所以说我们其实关注这个这个事情 ,Midjourney 的出现对我们这个行业其实影响就非常非常大了 。 因为 Midjourney 的产品真的是可以进入生产环节了 。
它具体进入的是您之前刚才说的那个流程里的什么环节 , 具体干什么 ?
就非常多 , 就是说因为我们整个生产环节就很多场景都是需要用到图片的 。 举个例子 , 我们的概念海报 , 我们的宣传物料啊 , 包括我们的比如说分镜头脚本 。
因为电影或者影像本身 , 它就是一个多种艺术的集合体 , 它需要音乐 , 需要图片 , 故事等等之类的 。 就说你可以理解 ,其实 Midjourney 在图片领域的突破真的是说已经可以进入实际的产业生产了啊 。
它当时生产的一些 , 比如说海报这种物料 , 它能达到你们的使用水准吗 ?
是完全可以的 。
可以的是吗 ?
对 , 完全可以 。 我们跟传统影视公司或传统内容公司不一样的地方在于 , 我们的内容绝大部分都在网络上做分发 。
就是网络上做分发呢 , 和传统线下分发不一样 。 举个例子 , 比如传统线下可能一个电影只需要一张海报 、 两张海报或三张海报 , 了不得了 。
但是对于一个在网络上这个分发的内容来讲 , 它可能需要几千张 。 简单给你举个例子 , 比如说你打开爱奇艺 , 你去刷的时候 , 你会发现就是它每一个每一个影片 , 它推荐的那个图它会变啊 , 就是它可能有有很多图 ,但这些图其实都需要制作的 。
然后过去的方法就是营销公司会切大量的剧照 , 然后去养这个美工去做很多这种贴片等等之类的 , 去看哪个图的曝光更好一些 ,ROI 更好一些 。
有的这个影片其实可用的物料很少 ,但它的影像效果就很差 。 但有了 Midjourney 之后, 其实可以批量生成生成非常多的 。
就是我觉得这个其实是就是一个在产业里很大的一个应用 。 当然可能观众们看不到啊 ,但我可以给你举一些例子 , 比如说很多这些图都是 AIGC 去生成的啊 , 我可以给你找一张 , 一看就是 AIGC 生成的 。
你这都能断点出 。
对 。
就只能要如果你让我看 , 我可能就看不出来了 。
啊 ,是 。
但它肯定也是最后人工改了一下的 , 对吧 ?
对 , 你信息流你刷到的很多这种影片的这种分发的这种图 , 都是先通过 AIGC 来去生成 。
然后再修改 。
对 , 然后再去修改 。
因为最开始 Midjourney 至少在去年的时候 , 它就类似这种模型 , 它有个问题 , 就是比如说你生成这个人的手的时候 , 或者说一些耳朵衣服的细节 , 它就会出现 。
幻觉 。
对 , 它会比较乱啊 。 它不是一个实际上人的手的样子啊 。
是的 , 就是说但是就我说在这些应用场景中, 比如说你看这个 , 这个就是 AIGC 生成的这张图 , 就是像这种 , 就是它有一些细节乱 ,其实不重要 。
不是 , 你这是怎么看出来的了 ?
这就非非常明显啊 。
这可能是这种体感吧 , 可能你看的够多 。
对 , 一看就是 Midjourney 生成的 , 就类似这种图 。 你看你仔细看 , 它可能就手确实有六个手指 ,但是并不重要啊 。
就它是一个宣传物料 。
就包括分镜的话 ,其实也这些小错也都可以容忍是吧 ?
是的 ,因为它本身就是一个概念性的一个设计 。
但是现有的这个大模型 , 它在生生成这种动作上, 就比如说你给它描述一个动作 , 它能跟你跟随指令 , 跟随的很准确 , 生成的很好吗 ?
嗯 ,不能 ,不重要 。 就是因为就是我说在这些场景下, 它其实就是个示意 。 就是分镜可能还有很多的氛围图或者是场景图 , 它其实要的就是大概那个 feel, 那个感觉 。
因为你不用细抠这些里面这些人他具体是怎么样子 ,但是你看两个一男一女站在一起 , 举止很亲密 , 你大概就知道这是一个 。
恋爱爱情 。
对 , 你可以点进去看了 。 除了这个以外, 就是我们其实也在看 AI 这个新的生产力出现之后, 它会创造出哪些新的场景 。AI 的解决方案可以完全颠覆过去的解决方案 , 这个确实在行业里已经有很多不错的 , 比如说应用啊 , 比如说在办公领域的有什么 AI PPT 啊 , 然后什么教学领域的有什么 AI 帮你做题啊等等 , 这其实是也已经出现了啊 。
嗯 , 那你在影视行业有看到什么这样的苗头吗 ?
坦白讲 , 我们所在的影视行业目前还没有啊 。 因为就是我觉得目前的 AI 技术还很难在我们现在的所在的这个行业里发挥出 ,因为因为我们这个产业太复杂了 。
就是它有你刚说的第一个在已有的环节里降本增效的作用 ,但是就说比如它创造一个新的场景 , 或者一种重塑这个整个流程 , 目前看还不明显 。
是的 。
Searching 这边也可以补充一下 ,因为你们是在一个技术供给方的这个角色 , 那从 NVIDIA 的角度 , 就你们看到 AIGC 来了之后, 它可能对 M&E 这个领域会有些什么影响 , 就你比较在意的是什么 ?
Omniverse28:09
因为 NVIDIA 其实在这个行业里面技术走得比较前沿 , 所以可能就是有很多尚未落地 , 或者落地还没有大规模的这样的一些应用 ,其实我们已经在研究 。
举几个例子啊 , 那大家可能知道 , 我们有一个这个分工协作的在线的这个平台叫 Omniverse, 这个平台我们现在其实在国内已经在使用了 ,M&E 行业也在使用 。
可以和我们的听友先科普一下 Omniverse 是个什么东西 , 就是对 。
Omniverse 首先它是它是一个多人实时在线分工协作的一个数字资产的管理制作的工作流平台 。 它是用 USD, 就是皮克斯的一个数字资产 , 叫通用场景描述 , 那它可以连接各个主流的 SV 的数字资产 , 然后全面的做到一个云原生的实时分工在线协作 , 所见即所得的实时编辑的这样的一个场景 。
也就是说举个例子 , 你今天拍了个片子 , 你后台打了个绿幕 , 对吧 ? 以前我们的绿幕是后期的 ,不是实时的 , 对吧 ?
那我们现在的这个绿幕甚至可以做到实时的 , 就是说虽然演演员是在绿幕面前演的 , 可是导演呢 ,他在这个后台 ,他的这个 monitor,他的监视器上看到这个绿幕 ,其实是已经做好的场景 。
也就是说导演看可以看到后台已经叠加上去的绿幕 , 加上演员在前台的这样的一个表演 ,是所见即所得的 。
它可以实时查看效果 ,因为这个 USD, 比如说它的它的这个数字资产叠加了进去 , 它可以看到演员比如说动作是不是不匹配啊 , 或者说某些地方可能穿帮了呀等等 , 打个比方 , 或者说更好的一些实时的更改 , 实时的特效 , 它都可以完整的去看到的这样的一个好处 。
那还有个就比如说像像我们绕不过的嘛 , 降本增效嘛 , 对吧 ? 以前我们要拍一个片子 , 比如说拍个大场景 , 拍个海上日出的这个场景 , 那以前我们可能真的是要飞到这个地方去拍 , 成本很高 , 对吧 ?
万一这么整个 crew 都拉过去了 , 突然那天下雨了 , 没没有日出 , 那我就摆一下, 你就在那等 , 对吧 ?
或者你要拍雪景什么的 , 你要等 , 那可能很难去抓到这样的一个特效 。 今天我们用这个 Omniverse,因为它是数字资产管理的 , 然后它又可以用 AI 去驱动 , 那它你可以文生图 , 文生视频 , 对吧 ?
那很多这个大模型它可能都已经做好 , 你给它一个指令 , 它就可以帮你用 USD 去做 。 而且以前如果是纯 CG 渲染出来 , 我可能需要美工 , 需要大量的专业美工去做这个 。
今天我只要一个指令 , 它就可以去 repeat 出来一个巨大的范围的场景 ,而且每一个形象它可能都是有变化的 ,不一样的 。
它不是复制粘贴出来 , 长得都是一个模子的 , 对吧 ? 就像兵马俑一样 , 每个兵马俑都是虚虚无真 , 它不一样的 , 面部表情都是独特 , 它是 unique 的一个一个 avatar。
所以我们讲说我们在这个 Omniverse 里面 , 我们有很多技术可以做数字人, 可以做就比如说像人物的由真人驱动的数字人, 甚至真人驱动的数字人, 还可以跟虚拟场景做互动 。
比如说我这个前面拍的这个这个这个真人, 打个比方是有一些场景 , 那我后台这个数字人可能是通过动捕出来的 。
以前动捕身上可能你要你这个传感器可能有几十个传感器 , 今天可能几个传感器就可以了 ,因为它已经可以用大模型去识别你的骨骼 , 你的这个人人体的关节骨骼的场景 , 它就知道你实际上在做什么样的动作 , 它马上就可以一比一投射到数字人身上 。
比如说你甚至可以用语音去驱动数字人, 比如说破坏墙壁啊 , 这个打个比方打斗场景啊 , 对于虚拟场景的一些实时的一些互动啊 , 一些一些一些场景的变化 , 你都可以在通过这个这个 Omniverse 和相关的这些软件 , 让我们的导演或者监制通过它现场的这个 monitor, 它实时可以看到 。
所以这个其实对于整个的拍摄场景而言是更有效率 , 更加的能够压缩它的后期的周期 ,而且可以实实在在节约成本的这样的一个方式 。
当然我们讲这个 , 我们 Omniverse 里面有很多组件 , 比如说像做数字人的这个 machining 嘛 , 比如说云原生的数字人的引擎 , 我们叫 ACE, 比如说像我们可以用真人的这个 , 把你的你甚至都不用做面部的这个捕捉 , 你直接讲一段话 , 它能够识别你这段话的语音语调 , 你的情绪 , 然后自动去 match 到数字人的脸部上 。
像我们的这个 audio to face 这些技术 ,其实已经都在 Omniverse 里面 , 已经已经商用了 , 很多用户已经在体验了 。
国内我们有些非常多的合作伙伴已经做了一些二次开发 , 已经可以看到一些成果了 。
新技术门槛32:41
Ethan, 你听说过这个吗 ?
啊 , 对 , 我有看 NVIDIA 的发布会 。
OK, 那你有考虑 , 比如说正好因为你们其实是需求方 , 你是客户嘛 , 你就觉得有什么问题你也可以问一下 Searching 啊 。
目前对我们这样的产业公司来讲 , 可能我们还会选择继续观望一会 ,因为就是我说的 , 我们其实最核心点是在于没有那么多的就是会应用新技术的产业人员 。
就这个其实我们在实际生产过程中可能遇到 , 就因为我们比如我们这个钱投下去了 , 我作为这个出钱的人, 我可能希望的是保质保量 , 安全的生产 , 尽快的给我交付 。
最保险的方案就是还是用这些产业里最成熟的工人和产业里最成熟的创作者 , 就是这些人来去协力做出来的东西更保险一些 。
任何一个新技术想在这个行业里普及 , 它离不开生态 , 离不开从业人员 。 我觉得这是需要一个慢慢的一个过程 。
当然当然 , 这个这个行业它需要一个孕育培养人才的这个过程 。 任何技术从从研究到发明到诞生到落地到大规模商用 , 它是一个长足的过程 。
投资人的钱都是非常金贵的 ,他要省着花的 ,不能不能有任何风险的 。
所以 Searching 可以讲一下国内在用的这个项目 , 已经拍了一剧的 , 那他们这个制作组里它是找的一些什么人在用这个东西了 ?
其实对于人员而言 ,因为因为大部分而言 , 我们的用户在使用我们的技术 , 它其实是一脉相承的 。 就是说如果他之前用过我们的技术 , 或者他之前对我们的技术有了解 ,他可能慢慢的他就知道怎么用 。
因为我们的技术也是迭代的 ,不是无中生有的 , 都是从 alpha 版到 beta 版 ,1.0、2.0 到甚至 20.0 这样迭代出来的 。
比如说像我们做光影追踪 ,以前大家做光影追踪是用用 iRay, 用 mental Ray, 对吧 ? 做离线渲染 , 那现在做实时的 ,因为我们发明了这个 RTX 的 GPU 嘛 , 就实时做 ray tracing 的 。
那今天你可能甚至一个买一个个人的消费级别的几千块钱的游戏卡 , 你都可以做实时光影追踪了 。 以前你可能是上百万的渲染农场才可以做离线的后期的光影追踪 , 这个过程是可能发展了二三十年 。
你看我们在国内的这些用户 ,他可能很多很多年前他已经会用我们的用用我们的那个 mental Ray 了 , 打个比方 。
那他今天就自然而然知道如何用我们的实时光线追踪系统 。他可能在几十年前他已经用用用 Maya, 用 3D Max 来做后期了 , 那他今天自然会用最新版本的这些里面的这些组件 , 比如比如说打个比方 , 用用一些渲染器 , 比如说打个比方 ,他他用达芬奇调色板做后台 , 对吧 ?
那他可能已经了解如何用 GPU 去加速了 。 那坦白的说 ,30 年前我们做视频 , 做后期 , 做 video decoding coding, 那个时候连 VCD 都不能做实时的解压 , 更别说做实时的压缩了 。
今天我们 4K、8K 都是小小拿捏了 , 对不对 ? 毫无压力 。 所以所以这个是需要一个用户的积累 , 是一个有经验的技术人员去来完成的 。
前沿技术35:51
嗯 , 刚才提到说 NVIDIA 会有一些比较前沿的东西 , 它是没有目前还没有大规模的落地 ,是现在落地的中间 。
除了你刚才说的这个 Omniverse 之外, 还有一些什么别的例子可以讲讲吗 ?
其实大家都知道 , 每年有一个很有名的峰会叫 SIGGRAPH, 这个 SIGGRAPH 呢 , 就是计算机图形学的最顶尖的业界的会议 。NVIDIA 每年就都去参加这个会议 , 我们每年有很多论文 , 我们也几乎每年都能拿到这个最佳论文 。其实这个是业界的一个一个风向标 ,是个标杆 。
这些论文你看似是非常早期的研究的方向 ,但是几年之后它都会商业成品落地的 。 比如说今天我们讲到的这个 stable diffusion 也好 , 或者 AI 的这些文生图 、 图生图等等这些也好 ,其实它以前是怎么来的 ?
这个叫生成式对抗网络 , 叫 GAN。8 年前就已经有这个概念了 ,但 8 年前都只是纸上谈兵 , 纯论文的 。
那什么叫生成式对抗网络 ? 就是所谓的无中生有 。 归根结底 , 它是一个由人工智能 、 由电脑驱动的缺损像素的自动填补技术 。
那缺损的像素填补出来 , 那你就生成一张图 , 生成每秒钟 24 张图 , 你就生成一个动画帧 , 那就可以变成一个可连续播放的视频 。
那么其实文生图也好 , 文生视频也好 , 它都是这样的一个概念 。 无论比如说今天你做超分 super resolution 也好 ,upscaling 也好 , 或者说像好莱坞经常讲这个这个 remaster 也好 , 把过去几十年、100 年前的视频做基于 AI 的上色 , 基于 AI 的 , 比如说把过去的胶转数啊 , 过去的胶片转 , 甚至是转 4K 的这样的一个 , 我们看看到这种 4K 数字重置版的泰坦尼克等等也好 , 这
种这种技术其实都是基于这个人工智能的方式来去实现的 。 那么我们可以看到 NVIDIA 打个比方说 , 两三年前我们提提出的这个叫 NERF 的技术 , 什么叫 NERF 技术 ?
其实基于以前我们叫 computer graphic, 今天我们就是 neurographic, 就是基于神经图形学的这样的一个研究的方向 。 那么我们今天可以看到 , 已经有五花八门的各式各样的方式来去落地了 。
就是你可能拿手机啊 , 你一个轻型的手持设备给这个场景拍几张照片 , 它马上就可以用人工智能的方式来给你生成一个 3D 的建模的图形 ,而这个图形马上可以变成一个数字资产 , 可以导入到你的 SV 里面去 , 导入到比如说像像啊 , 像你 Max 导入到 Maya, 甚至导入到基于 US 格式来阐述的这个数字资产 , 导入到 Omniverse 里面去 。
你甚至几分钟之内用一个个人的手机拍几张照片 , 它马上就可以变成 3D 建模 , 到你的专业的这个图形工作站里面去做后期的处理了 。
那这个方式以前大家想都没想过 。 以前我们要还原一个数字场景 , 还原一个对于一个建筑的一个 3D 建模的重构 , 这个是巨大工程量的一个事情 。
今天可你轻易的做到这个千万像素级 , 甚至是上亿像素级的这样的一个实时采集和 3D 场景的重建 。
那这个像 NERF 的这种方式也是 NVIDIA 提出来的 , 我们也利用 GPU, 利用 AI 的方式去做也可以 。 那今天其实对于我们的 MAE 行业里面 ,其实这个是以后可能就是一个一个很前沿 , 或者说是很有吸引力的一个降本增效的方式 。
你今天要去做星球大战或者变形金刚这种顶尖的 IP 级制作的时候 , 或者说像国内现在非常火嘛 , 做这个黑神话悟空 , 对吧 ?
做现场的采集 , 到山西去采集这些现场的场景 , 你可能以后你用 NERF 的方式 , 你可以大大的提提高你的这个效率 , 降低你的这个成本 。
以前你真的是要拿一个设备去去做这个大量的实时的实地的采集 , 今天你可能在网上搜点图 , 然后用无中生有的方式用 GPU 来去帮你做这个基于 NERF 的采集的方式 , 它可能也是可以实现的 。其实我们人类每一次科技的巨大进步 , 都来自于我们的懒或者抠 。
那懒和抠其实并不是贬义词 , 人类的惰性 , 人类的这个节约的品质是与生俱来的 ,是刻在我们 DNA 里面的 。
我们的几次工业革命 , 我们的几次巨大的技术提升 , 为什么会产生呢 ? 其实这个正是因为我们想要扩大我们的生产规模 , 想用更轻松的方式来完成更具规模化的生产力的提升 。
我们的懒其实是我们的惰性 , 驱使我们不断的去研发新的技术和产品 , 来推动我们的科技进步 。
比如说我们不想走路了 , 哎 , 于是我们发明了机械代步 , 来帮助我们能够更有品质 、 更舒适的生活 。
另一方面来说 , 那人类的节约其实很正常 ,因为在远古时期科技不发达 , 我们的医学 、 医疗各方面都不发达 , 我们要对抗天灾人祸 。
所以呢 , 我们必须要储备一部分 ,以备不时之需 。 比如说我们储备粮食 , 储备物品 , 储备生产资料 。
所以到后期形成了货币之后, 我们就开始储备货币 ,也就是存钱 。 存钱从一个另一个意义上, 或者从另一个角度上来说 , 就是对于成本的控制 。
换到今天流行的话来说 , 就是降本增效 。 那我们的这个 M&E 行业也是同样 , 过去大家可能日子很好过 , 可能投资人的钱也很多 , 大家觉得我们可能把同样的成本可以做出更大 、 制作更好的结果的产品出片 , 对吧 ?
那是或者说我们可以做更多的集数 , 或者做更多的片子 , 成本就真的是每一个 M&E 从业的人员的考量所在 。
那我们可能想做一个小成本的制作 ,但是我又想有一些比较花哨的后期 ,有一些比较高大上的特效 , 那最后我可能就用 GPU 去做 , 用 AI 去做 , 这个其实都是今后可以实现的一种方式 。NVIDIA 在探索这些前沿的技术 , 我们试图跟全世界顶尖的科学家一起来把这些技术能够实现 , 能够落地 。
所以大家如果有兴趣的话 ,也可以看看历年 SIGGRAPH 的一些一些论文 ,其实 NVIDIA 在这里面有推动了这个行业的往前的不断的发展 。
嗯 , 刚才 Searching 有一个总结很好 , 就是很多技术进步都来自于人类的懒和抠啊 , 就你要么想省时间省事 , 要么就是想省钱 , 对吧 ?
我有个很好奇的事 ,2021 年的时候 , 当年的那个 NVIDIA 的 GTC 大会 ,有一个挺轰动业界的小花絮 , 就是教主嘛 , 黄仁勋他还是穿着一个皮衣 , 对吧 ?
数字分身42:07
然后从厨房里啊端出一个 GPU, 然后过了一段时间之后, 就是你们自己释放出来 , 说这里面其实有大概 17 秒的时间 ,并不是真的黄仁勋 ,是你们用技术去给他做了一个黄仁勋的数字人, 包括这整个环境也都是虚拟的 。
但是那个特别特别真 , 就是最开始大家都没有觉得这是假的 , 这个是用的你刚才说的那个技术吗 ?
是的 , 这个就是用 Omniverse 里面的 ACE 这个技术 ,ACE 叫 Avatar Cloud Engine, 就是基于云原生的数字人引擎 , 这个是 Omniverse 里面的一个部分 ,也是一个重要的组件 。
那其实它用到的技术非常简单 , 就是扫我们这个 CEO 黄先生的整个的这个人, 元宇宙里面的数字孪生 , 给他生成一份 1:1 的这样 Digital Twins, 再把他说的话用 Audio to Face 的方式投射到他的这个数字人的脸部去做这个脸部 Mesh 来做 , 比如说表情和嘴型的匹配 , 然后后面的这个背景其实就是绿幕的虚拟拍摄是一样的 , 做好 3D 的这个后面的这些整个的背景
的叠加 , 然后再把它啊把人虚拟的这个数字人和后面的背景叠加在一起 , 来去完成这样的一个渲染的动作 。其实基本上通俗而言就是说这几个过程 , 那大家看起来可能非常的逼真 ,是因为真的我们的数字人可以做到栩栩如生的这样的一个 1:1 的匹配 。
所以我们如果不说的话 , 大家觉得哎 , 这就是真人, 但是我们说的这个十几秒的过程 ,是是完全用用这个虚拟的数字人方式来去实现的 , 那大家才知道哦 , 原来 NVIDIA 的技术能做到这么逼真的效果 , 这么好的这样的一个后期的呈现 。
嗯 , 哎 , 从这个 ACE 到 NERF 的话 ,是不是 ACE 还是我一个比较简单的理解 , 就它里面可能 AI 的程度没有那么高 ,因为其实你是做了一个很完整的扫描嘛 , 然后到 NERF 的话 ,其实你用几张比较简单的照片 , 你就可以把它这整个 3D 模型给你还原出来 ,有一部分其实是 AI 自己去生成的 , 对吧 ?
就它 AI 的程度会变得更高 , 然后你的整个成本会变得更低 。
这个就是所谓的 2D 生 3D 和真正的 3D 扫描建 3D 建模的这样的过程 ,其实这个实现的方式不太一样 , 当然成本也不同 。
就是说今天我们看国内有些合作伙伴 , 大家在国庆节前如果参加过这个一些像像腾讯数字生态大会 , 或者是阿里巴巴的云栖大会 , 你可以看到有很多他们的 partner 在现场做了一些基于云的一些方案 , 比如说像像你拍几张照 , 你就给你生成一个 3D 的数字人等等 ,其实这个在国内有很多机构或者说商业运营的团队的一些成熟方案已经在做了 , 那当然每
个人实现的方式都不同啊 。 如果有兴趣的话 , 我们的听众小伙伴可能到 GitHub 上去看看 ,有一些这个比较初期的大家已经做好的代码 , 可能也会激发一些大家创作的思路 , 可能大家也会想到一些自己的更好的方式 。其实今天无论是 CG 也好 , 或者说是这个电脑的这个 AI 也好 ,其实是一个百家争鸣 、 百花齐放的一个场景 ,因为我们讲今天是人工智能的这个刚刚的创
始的原点 ,是新纪元的一个突破点 ,因为大家都在去想用这个方向去提高我们的生产力 , 所以每个人都试图去做出一些非常好的一些一些成品的商业应用 , 所以我们也乐意于见到这个市场蓬勃发展 。
毕竟 NVIDIA 我们做 GPU, 我们是一个卖铲子的公司 , 那大家把这个铲子拿出来 , 就大家去各显神通 , 你能挖到金矿 , 你能挖到钻石 , 还是你能挖到什么 , 那大家实现的方式不同 。
哦 , 说到这个的话 , 我也有一个问题想问两位 , 就是说在 AI 这个热潮来了之后, 你们自己感受到的这个影视行业啊 , 一些新的这种技术的供应方 , 你们自己接触到的啊 ,有哪些 ?
这个可能是 NVIDIA 的下游啊 , 就是就是用你们东西的人, 然后可能是你们的上游 , 就是可能你们会是他们的客户啊 。Ethan 可以先讲讲吧 。
呃 , 我们其实现在用到比较多的就是这个 Midjourney, 当然除了可能大家日常会用到的一些 Kimi 啊 , 个人 C 端级的产品以外, 就真的是说 B 端级的存在在我们的生产工作流里的 , 现在主要就是图片领域 , 像 Midjourney 这样的公司 , 可能在我们的日常的工作的流里 。
像这个视频生成 , 就是 Sora 这种类型的模型和产品 , 目前还没有进入到你们的工作流是吗 ?
核心的问题就是在于 , 就是现目前现在视频生成领域 , 用户自己自嗨其实还是 OK 的 ,但真正到产业级生产 , 现在我们觉得这个能力 , 目前行业里的这些生产水平 , 到这个能力其实还是有一定的距离啊 , 就是但图片领域我觉得已经已经是可以达到了 ,而且我们眼看按照这个趋势下, 我觉得像视频领域 , 甚至文字领域能够进入到真正的生产流
中, 我觉得也是只是时间问题 。
嗯 , 像国内今年也出了很多这种产品嘛 , 像申树的 , 嗯 , 字节最近也出了 , 然后之前快手的可灵 , 还有 MiniMax 的海螺 , 这些你们自己就是有事吗 ?
还有这个像爱诗的 Pixverse 吗 ?
是 , 我们基本上都有试过 , 都有试过 , 对 ,因为这里面它真的到一个产业里面 , 它其实需要解决的问题其实还是还是很多的 , 就是就是比如说可控性啊 , 就是抽卡的概率啊 , 就是包括整个的这个渲染速度啊等等之类的 , 它真的想要到产业级别 , 它是一定要比我们过去传统的方式成本更低才行 。
就是如果他们比我们过去方式成本更高 , 这个成本可能是时间成本 ,也可能钱的成本 , 成本更高 , 那我们就几乎就不会替换 , 甚至是同等数量级的成本我们也不会替换 。
就是这还有一个我刚才说的 , 就是产业熟练从业者的问题 , 就只有指数级别的成本降低 , 数量级级别的成本降低 , 我觉得才真的有可能进入到这个产业里面来 。
哦 ,其实 Ethan 讲的这个也是 2B 行业挺共通的一个逻辑吧 , 比如说做这种 SaaS 也是 , 就如果你要替换一个老的方案的话 , 你大家换东西都是有成本的 , 所以不能说跟它差不多好 , 或者只比它好一点 , 你得比它好特别多 。
对 ,是的 , 必须得是数量级级别的成本降低 , 我们才会使用啊 。
比如说我刚刚提到这些国内的公司 ,他们是有主动来接洽你们 , 愿意给你们提供一些服务这样吗 ? 就他们会把你们作为一个这种希望你们付费的这种客户去跟你们谈吗 ?
AI 生态48:45
是的 , 首先您刚才提到这些我们都会有接触 ,因为本身我们就是一个视频创作者平台 ,他们的客户基本上都在我们平台上, 都是我们的用户 , 所以说这些平台几乎都会跟我们去探讨合作 ,也希望通过我们这样一个平台 , 把自己的产品推向给这些产业的从业者啊 。
所以说在这个过程中, 我们也确实会看到什么样的产品从业者真的会用起来 。
我还想到一个点 , 可能就是你们能和这些新的一些公司啊 , 或者说这种创新的角色合作 , 就是你们其实有很多这种比较高质量的视频素材 , 对吧 ?
所以也会有些公司来跟你们讨论这种数据类的合作吗 ?
呃 ,是的 ,是的 , 就是我本身也在跟这些大模型公司探讨 , 比如说我们一起来去这个共建模型等等之类的 , 就是来去做素材训 , 模型训练等等这些合作 。
嗯 ,Searching 的话 , 你从你的角度 , 你看到哪些你们下游的 ASV, 就这种独立的软件供应商 , 最近比如说发展比较好的 , 或者说新长出来的 ,在这个 AI 热潮之后啊 ?
在 AI 这个领域呢 , 就是 Ethan 讲的是没错的 , 就是大家很谨慎 ,因为我们的对于错误的这个容忍度是非常低的 , 所以呢 , 无论是成本的这个试错 , 或者说是场景的试错 , 或者说最终这个生产力环节的试错 , 我们都非常的谨慎 。
所以现在以这个图片 , 无论是 Midjourney 也好 ,Stable Diffusion 也好 , 各式各样的这个 ,其实商用化已经已经很成熟了 。
但是像您说的这个 Sora, 它太新了 , 大家都不能保证说它的最后能不能在这个这个商用的生产力领域里面 , 现在的情形其实还是一些前沿的尝试阶段 , 所以可我们可能要要等待一段时间 , 然后包括二次开发 , 或者说一个大规模的应用 , 这个产业的整个一个一个一个 workflow 的成熟 , 那需要时间 。
那我们今天看到我们的下游在利用 GPU 或者利用算力或者 AI 也好 ,其实最多的常见的还是渲染器的这个部分 ,其实国内有很多渲染器做得很好 , 像第五渲染器已经做得非常棒 , 我们也看到第五的渲染器 , 它已经基本上跟大部分的主流的 ASV 都已经打通了 , 所以很多用户也在用 , 包括个人用户甚至也在用第五渲染器 。
渲染器就是一种软件 , 对吧 ?
它是个软件啊 , 举个简单的例子啊 , 我今天拍了个就像我们现在做做这个访谈 , 如果是拍成视频的模式 , 那我的背后可能比较杂乱 , 对吧 ?
那我我把我这个人抠出来 , 你可能也知道我们如果静态的话 ,Photoshop 抠的话是一个一个一个用 , 你用你用鼠标去画一条线 , 然后把这个人抠出来 。
那以前做视频的也是同样 , 我先把我的轮轮廓抠出来 , 然后我把我这个人标记上头 , 告诉他这个人就是我需要的主场景 , 然后后面他在整个的这个画面里面 , 后面的后续帧全部都把这个人抠出来 , 对吧 ?
这个是一个比较典型的方式 ,但是那你要需要一个会用这个软件的人, 知道你把这个人物抠出来 , 知道如何让他后续都把你这个人物作为后面的背景全部抠出来 , 分离的一个方式 , 对吧 ?
今天如果用这种一些 GPU 算力介入的轻度人工智能的渲染器的出现之后呢 , 我们的用户他不需要专业的知识 , 个人的创作者 , 个人的这些 up 主也好 ,Youtuber 也好 ,他其实他已经可以利用到这样的方式 ,他只要在脸上扒一点 , 你直接就告诉你就把这人抠出来就行了 , 后面这个人都被抠出来 。他的前端不需要有 GPU 的 ,他前端是个非常轻量的 ,他甚至就是一个手机
一个平板 ,因为后台有 GPU, 后台有算力 ,他的这个 tag 和这个打标签的这个 segmentation 的这个动作已经交由后台去做了 , 就是像你讲的 SaaS 也好 , 或者 Platform as a Service 也好 , 这样的方式后台的 Platform 去做了 。NVIDIA Omniverse 就是你可以理解成一个一个一个平台 , 那我们已经可以完成很多的这样的功能 , 都是让后台的 GPU 去做 , 前端你是一个非常轻量级的设备 。
我们的 NVIDIA 的合作伙伴 , 对于我们的影视传媒行业的可能是一些专业的生产力工具 ,他其实更多的在做这个工作 。
像我们开这种视频会议的软件 , 比如说 Zoom 或者腾讯 , 它不是都可以选这个背景吗 ?
这个 NVIDIA 也有一个专门的软件叫 Maxine, 是一个我们的 SDK 来的 。 举个例子 , 我跟你讲话的时候眼神会飘 , 你看对吧 , 我眼神在飘 , 为什么呢 ?
因为我一会看看手机 , 一会看看平板 , 一会看看某一个我们谈到的 topic, 我可能把这个我们讲的话题的一些 point 我调出来嘛 , 比如说之前我准备的一些知识点 , 我可能调出来 ,但是对于参会者 , 对于你而言 , 你的感受很不好 ,因为我的眼神老飘 , 我根本没有看着你 , 对吧 ?
那我们其实可以用 NVIDIA 的技术 , 它可以保持我的眼神的聚焦 , 就是无论我眼睛看哪 , 它都可以让我让你感觉我在看着你 , 我在直视你 , 就是眼神一点都不飘 。
腾讯有这个功能吗 ? 我总没把它说错 。
腾讯会议有 , 腾讯会议有这个 。
我之前没注意啊 。
很多视频会议软件都有这功能 , 大家实现的方式不同 ,但是其实都差不多 。 这个这个是最简单的 ,NVIDIA 有一些专门的软件 , 比如说你可以去下载 , 甚至你个人电脑 , 消费级电脑都可以去下载 , 叫 NVIDIA Broadcast 的软件 , 这个软件它可以做很多功能啊 , 比如说眼神聚焦 , 比如说固定我在画面的正中间 , 我可以在房间里走来走去 , 它仍然可以实时的把我永远
聚焦在这个画面的正中间 。 举个例子 , 我我在台上做演讲的时候 , 我可以从舞台的左边走到右边 , 对吧 ?
它可以基于基于 AI 的动作的跟踪 , 自动的画面的剪裁 , 让我保持人物保持在画面的中心点 , 保持我眼神的聚焦 。
还有呢 , 就是什么呢 ? 我们今天做视频软件 , 做视频会议其实很耗这个流量的 , 我们现在流量非常好 , 对吧 ?
大家都用 5G, 如果我们今天在一个网络不好 , 比如说我在做科考 , 做野外的环境的实时的开荒等等这样的 , 甚至是比如说用无人机拍摄的一些场景 , 比如说现在典型的 M&E 行业的应用 , 做这个直播 , 我今天打个比方 , 这个发生了山火 , 我这主持人站在这旁边 , 来一台这个卫星车连线 , 然后后面的 B 肉叠加的是什么呢 ?
是这个无人机拍摄的这个整个这个山火的场景 , 对吧 ? 那么这个场景里面最后呢 , 我想把人做成好像是我人真的坐在直升机上去拍 , 这个画面就非常生动了 , 对吧 ?
但是呢 , 我人又不在直升机上, 人我就是站在那 , 对吧 ? 那那最后可能要把这个画面叠加起来 , 用 ARGC 的方式叠加起来 。
那么我们最后的 NVIDIA 想到的有一些实现的方式 , 就是首先我做数字人, 我的主持人, 打个比方 , 今天是一个一个非常有名的这个名嘴 , 那我先给他介绍我们的黄仁勋先生 , 哎呀 , 我先给他做个数字人, 然后呢 , 我再把他的所有的实时的语音语调全部投射到他脸上去 。
那这个时候呢 , 传播出来的这个视频 , 我又不想说真的利用这个非常差的网络连接 , 画面的实时传播 ,因为这个是对于当时的 Internet 的带宽而言 , 可能是有些挑战的 , 可能画面不连贯 , 很卡 。
那于是呢 , 我在前端只是放这个数字人的坐标 , 那么我的后端直播的时候 , 只是把他的用 AI 识别出来他嘴部的几个坐标 , 表情脸部表情的几个坐标 , 只传坐标 , 这个坐标传输的时候只只是数字 , 这个对于带宽的这个开销是非常低的 。
那这个数字的坐标传到后端的服务器 , 云的服务器上, 再由云的服务器 , 它这个时候它的算力也好 , 它的网络也好 , 就非常好了 , 它就可以实实在在做成一个虚拟的这个数字人, 然后逼真的呈现出来 。
今天我们就两个人做视频会议 , 没关系 , 我们每次 GTC 如果要做视频会议在线的 , 可能是几百个人级别的视频会议 , 甚至上千人的视频会议 , 全球的媒体分析师 、 专家 , 包括我们的高层 , 可能都在一个这个视频会议的直播房间里面 。
那这个时候对于网络的开销是非常大的 。 那如果使用 NVIDIA 的这样的一些相关的 SDK 和一些中间件 , 视频会议的时候 ,因为它识别了你的脸 , 然后它传送的只是你的画面的一些坐标和你的语音 , 然后它就自动投射到你的面部上 。
对于观看侧的这些用户的感官是非常好的 ,但同时又非常节约带宽 , 能够在同样的成本和同样的网络开销下, 实现更多的容量的接入 , 这个其实是非常行之有效的一种方式 , 已经在商用了 。
开发者关系57:10
我有一个很好奇的点啊 ,其实 NVIDIA 的人不算很多 , 对吧 ?
我们是个非常小的公司 。
你刚才说到一些产品和需求 , 我感觉还挺细的 , 那你这种东西是怎么决策说我要去到底开发什么 , 开发什么了 ?
而且你们又不服务 , 比如说像 Ethan 这样的最中段的客户 ,其实你们中间是隔了很多中间环节的供应商的 , 你怎么去敏感的获得这些市场上的信息 , 然后再来反过来决定我到底去研发什么东西 ?
因为我们跟大部分的 ASV 也好 , 或者说商用生产力工具的开发者而言 , 我们有非常紧密的合作 。NVIDIA 我们有一个团队叫做开发者关系和开发者技术这个团队 , 这两个团队在 NVIDIA 内部可以看到 ,其实我们这两个它不实实在在的去卖产品 ,但是这两个团队它其实是 NVIDIA 非常重要的团队 。
我记得如果没记错的话 ,2009 年,15 年前我去美国参加 GTC, 我们的 CEO 请了当时我们的这个 DevRel 和 DevTech 这个团队的一个 E-Staff,也是非常高层 , 上台去做一个技术演示 。
当时我们 CEO 就说我们这个团队花了无数的钱 ,但是我们这个团队是非常重要的 ,因为它可以让我们 build 一个桥梁 , 让所有的开发者知道 NVIDIA 开发了什么产品 ,有什么技术可以让他们能够加速他们的产品 , 同时又让我们内部的研发人员和工程师知道所有的开发人员他需要什么样的产品 , 需要什么样的软硬件的堆叠 , 需要什么样的技术 。
那这个桥梁是非常重要的 , 让我们可以保持我们的产品的领先力 , 能够保持我们对业界的敏感度 。
那其实 NVIDIA 你可以看到我们投资了大量的人力物力的资源 , 虽然我们是一个很小的公司 ,但是我们仍然愿意把非常多的 manpower 放在跟开发者之间的沟通的这样的一个工作上, 可以帮助我们能够实时获得市场上最敏锐的一手的前端的用户需求和资讯 。
所以这是非常非常重要 。 所以我们今天可以看到 , 针对 developer, 针对开发者而言 , 我们在每一个区域 , 每个 region, 包括在我们在中国也有相当庞大的团队来去支持他们 , 来去跟他们一起合作 , 携手去打造更好的这样的一个成果 。
就你刚才说到那个 NVIDIA 是个很小的公司 , 录这期节目之前 , 然后我跟 Ethan 也有就聊到说他最近去了一次美国 ,有去到 NVIDIA 的总部 ,有一个参观的经历 , 我觉得你也可以分享一下吧 ,因为我觉得很多人肯定都还是挺好奇的 。
NVIDIA 总部59:29
其实是当时是参加了一个腾讯组织的跟 NVIDIA 的交流的一个活动 , 确实这个去 NVIDIA 的时候给我感受最深 , 就感觉哎呀 , 硅谷的老新贵的感觉 , 就是说他那个所在那个位置 , 这个确实很明显是一个一家硅谷的老牌 , 就是他的这些这个办公楼也好 , 或整个园区 , 感觉就是一个更像一个比较务实的创业公司 。
我我想补充一下,Ethan 讲得很对 , 我们公司对于创业是是非常有渴求的 , 这个危机意识 , 危机感非常非常强烈 。
为什么呢 ? 因为我们研究的产品和技术的领域太前沿了 , 我们的 CEO 经常说 NVIDIA 距离倒闭只有 30 天 , 我们这句话你可以在网上可以搜索到这句话 ,因为首先我们要激励自己的员工不能松懈嘛 , 对吧 ?
因为我们的产品太前沿了 , 我们的投资放在这些上面 , 如果这些应用它不能落地 , 或者说这些应用偏离了市场的主流方向 , 那可能意味着我们的相当大的一部分投资都可能打了水漂 。
也就是说我们必须要时时刻刻的激励自己 , 把产品要把技术要把创新要做好 , 能够服务好所有的开发者 。
十几二十年前我们的股票还没有起飞 , 我们也是一个可能只有几千人, 两三千人的小公司的时候 , 我们的产品其实跟现在一样 , 大家不知道 GPU 能做什么 , 大家都觉得 NVIDIA is a video car company, 做显卡的 , 那显卡是干嘛呢 ?
打游戏的 , 那大家以前都是觉得这样的 , 你能做生产力工具吗 ? 你当时大家没想过你要做 AI 啊 , 做人工智能啊 , 做算力啊等等 , 对吧 ?
那其实所有的业界的分析师也好 , 或者说机构也好 , 投资者也好 ,因为 NVIDIA 就是一个用国内通俗的语言来说 , 就是一个野蛮生长的公司 , 很有冲劲 , 很年轻 , 朝气蓬勃 , 然后呢 , 做的事当时大家就觉得搞不清楚 NVIDIA 在做什么 ,因为你们的研发太前沿了 , 华尔街的那些那些机构的大佬和投资人们都看不懂嘛 ,因为老钱不知道我们在做的事情
, 包括今天你也讲 , 像 Ethan 也可以看到 NVIDIA 在硅谷给大家感觉就是我们是非常有冲劲 ,有这种创新意识的公司 , 你可以看到我们的园区也好 , 我们做的产品技术 , 大家讨论的内容 , 整个这个 public area 洋溢的这种气氛是不太一样的 。
AI 与创作1:02:02
嗯 , 然后我们今天最后一部分想延展的聊一下, 就是这个技术和创作的关系啊 , 我觉得这个也是新技术来临之后 ,其实每一次都会去讨论 , 比如说当年这个照相技术发明 , 可能也会讨论说它对绘画这种艺术的影响 。
那现在 AIGC 产生之后, 大家也会去想它可能会怎么改变创作 。 嗯 ,有一种观点就是觉得 AI 可能只能生成一些比较平庸的东西啊 , 然后因为比如说像 Ethan 你是在这个行业里嘛 , 然后你也能看到很多人每天用这个东西 ,不知道你是怎么看这个的 。
我觉得 AI 的真正的魅力在于 , 就是让很多人更便利的去创作 , 让创作的这个门槛降低了 。AI 的魅力不在于你拿它跟张艺谋分享钢笔 , 或者说能帮助张艺谋分享钢笔做什么 ,AI 的魅力其实在于可以帮你我这样平常人, 帮我们去激发我们本来就被压抑的或者被束缚的这个创作能力 。
整个产业里过去一直都在发生这样的事情 , 就像最早你 Searching 说的 ,其实他们那个时代可能创作在电视台 , 我们这个时代可能创作转移到了这些博主 , 包括你看我们在做的网络电影 , 我们很多网络电影出来的导演 ,在我们平台上以前拍个短片 ,他根本不是电影行业的 ,他没办法去拍长片 。
但是这种新的技术 , 新的媒介就给了这些人机会 , 然后让他们去涌现出来 。 我觉得 AI 也一样 ,AI 可能是并不会让我们平台上那些特别专业的创作人在创作内容这件事情有巨大的进步 , 它的点是在于让很多的普通人都可以参与到创作中 。
这些普通人加上 AI 创作出来的东西 , 可能有朝一日啊 , 会打败过去很专业的传统领域的这些创作人。
其实你说这个东西在没有 AI 之前也在发生 , 对吧 ?
对 ,是的是的 。
比如说像今年这个国庆档不是出现好多肖央吗 ?
是的 。
还有像大鹏也算是现在中国导演里他的这个票房什么也还算比较好 ,他们其实以前也都是拍短片的 。
是的 ,其实我们新片场创业这么多年, 我们就看到了我们平台上很多过去拍短片的创作者都一步一步走上大荧幕 , 拍了这个几十亿票房的的这个影片 , 包括你像现在我们这个社区里 , 你看创作者已经好像有三个金像 、 两个金马奖了 , 就这些人在过去就是拍短片的 , 就拍拍小 video 的 。
我觉得 AI 会加速这件事情 , 就是会让加速 , 会让很多人有创作的这个这个能力 。
嗯 , 对 , 就有可能他并不是一个专业院校背景出身的 ,但是他有他自己的特别想表达的东西 ,有他独特的视角 ,他可能就能借助 AI 这种工具去把它表现出来 。
是的是的 。 以前有很多事情必须要人做 , 今天你可能电脑可以做 , 专业人员有很多场景 , 很画面你看起来是穿帮的 , 是一眼假 , 你看了就知道这个东西是用不了的 , 没法做素材的 。
那现在因为 AI 迭代了 , 越来越智能了 , 所以它做出来的东西呢 , 非常的逼真 。 对于我们的个人的创作者 , 就像 Ethan 说的 ,以前他可能就是拍一个短片的 ,他以前有个很好的想法 ,但是他以前根本没有办法实现 。
但是今天我们借助 AI, 它实现了 ,而且非常低成本 , 非常快速的它就实现 , 它可以表达他的所有的内心的真实的想法 , 把他的创作能够实实在在拿得出一个作品 ,而不像以前 , 你可能你光空一个想法 , 你做出来的这个视频 , 做出来的这个渲染的成果 , 可能通俗的说幼幼稚的可笑 , 拿不出手 。
但是 NVIDIA 我们在过去做了很多类似的引导的工作 , 比如说我们 Omniverse 做了 ,在中国我们就做了这个创作者的比赛 , 我们的用户用 OV 去做一段视频 , 然后拿去给专家组做评审 , 做出很复杂的光影效果的后期渲染 , 拿出来一个真的是美轮美奂的作品 。
这个大家去网上搜搜索 , 搜索 NVIDIA Omniverse 竞赛之类 , 就会有很多类似的获奖作品 , 大家可以看一看 。 对于一个普普通通的 , 可能甚至是一个在校的学生 ,他用一个个人的消费级的笔记本电脑 ,他就可以做出来这样的场景 。其实这个得益于科技的进步 , 得益于 GPU 的发展 , 算力的进步 , 人工智能的进步等等等等 ,NVIDIA 致力于打造这个行业的每一个进程 , 我们投
资了大量的人力物力在这个里面 。
然后另一面的话 , 我觉得就是聊到这个技术对创造的一些改造和塑造 , 大家其实也会讨论它风险的一面 , 比如说行业里的有些工种可能就变成是机器来做 , 这是最直接的 。
那再往下就是 AI 元素加入之后, 艺术创作的性质也会发生变化 , 这中间可能涉及到创意权的归属等等问题 。
然后 NVIDIA 也是行业里非常前沿的公司 , 你们可能也做了一些工作去帮助升级和改造媒体娱乐产业的同时 ,也更好的去发挥 AI 技术好的一面 , 可以分享一些做法吗 ?
所有的数字资产你必然要给它设置数字围栏 , 这是个信息安全的 , 比如说像这个增强检索 , 就是 RAG 这个部分 , 或者说像大模型 ,有很多我们给它圈一个数字围栏来做数字防护 ,也就是说它所有的人工智能创作要在这个围栏里面 , 它不能先天马行空的去去做 , 比如说传统的道德观念 , 比如说信息的一些安全层面的一些方面等等 , 各式各样的影响
, 我们要让我们的 AI 创作在我们认为我们需要的这个领域里面 。 举个举个例子 , 我今天做这个艺术创作 , 我本来是创作中国元素的 , 国风的 , 对吧 ?
我不希望它这个 AI 创造的东西出来受到这个 , 比如说这个西方的美学的这西方作品的影响 , 那最后创作出来的东西可能是四不像了 , 对吧 ?
我可能就给它设置一个数字围栏 。 所以在这个里面 , 对于整个的 pipeline 是非常讲究的 。 那这个前提是我们的这个无论是未料也好 , 无论是后期的 prompt 也好 , 所以你可以看到 AI 是一个非常体系化的一些科学的一个一个工程 。
以前我们在大学里面像大家念什么 Double E 对吧 , 或者念计算机科学 CS 也好 , 今天我们的大学里面针对 AI 已经有 prompt engineering 这个专业了 ,也就是说你 prompt 的好不好 , 直接带来你 AI 生成的内容好不好 。
所以这个是一个非常科学化体系的一个一个过程 。 所以我们的 AI 可能在很多方方面面仍然受到人类的主导 ,不是说 AI 就啪就给你把你的工作都替换掉了 , 我们以后都失业了 。其实 AI 仍然催生了许多新兴的行业 , 新兴的人类的岗位 , 来去用人去更好的 supervise 这个 AI, 去更好的 manage 这个 AI。其实科技的发展跟人类是相辅相成 , 缺一不可的 。
最后想问两位的一个问题 , 就是说我们普通人如果有这种创作的想法 , 然后我们可以现在这个阶段从什么方面去入手 , 你们有什么建议啊 ?
我觉得创作热情最重要 , 就是其实我们社区的 slogan 叫 " 用作品打动世界 ", 就是其实这个这句 slogan 其实一直激励了社区平台很多的创作人, 大家很多人用户给我们反馈 , 当初可能就是因为这么一句话 ,因为一句热血的话去加入到这个行业的 。
我觉得在这个基础之上, 第二件事情就是得多看 AI 时代 ,AI 的工具确实帮我们降低了创作的门槛 ,但这里面更核心一件事情还是你自己的 idea 或你自己的内心的想法 , 这是一切的根源 , 就是后面才是 AI 作为你的助手 , 作为你的团队 , 帮你去实现你的想法 。
就是那你的想法哪来呢 ? 就是可能更多的还是在于你自己的一些经历 , 一些见识 , 一些认知 , 这些东西组成了你内心深处的这个想法的本源 。在这个基础上, 可能有更多后面会有更多更多的 AI 的工具去帮你去实现你的想法 。
但是我觉得首先第一件事情就是要心怀热情 , 且能够有自己内心真正想表达的东西 , 这个其实才是最重要 。
Searching 你有什么建议吗 ?
我觉得 Ethan 说的非常好 ,因为我们人类的情感是 AI 替换不了的 , 我们很多打动自己的内心深处的东西 ,AI 可能能打动我们 ,但是 AI 不会被打动 。
所以呢 , 我们可能有很多情况下, 我们自己的需求能够实实在在推动这个行业的变革和科技的发展 。
所以我们最终把自己的内心表述出来的时候 , 它一定有某一些需求 , 比如说我想要做一个什么 , 我想要达成一个什么效果 , 我想要有一个怎么样的呈现 ,而这些在过去可能受制于科技和生产力未能实现 。
但是当这些需求被推向前台的时候 , 科技公司也都会看到这些需求 , 于是大家会朝着这些需求去研发去投资 , 最后大家齐心协力一起把这个行业 , 把这个技术来做得更好更强大 , 然后最后实实在在变成了获利 。
所以我们的个人的用户而言 , 我觉得首先就像 Ethan 讲的 , 你要有想法 , 你内心你要你要自己追求的东西 。
第二是我们希望中国的开发者也好 , 创意者也好 , 能够把你们的需求表达出来 , 让所有的科技公司都听得到你们的需求 , 于是我们能够一起把这个行业共同营造一个更美好的未来 。
其实我自己想到一个很简单的点嘛 , 可以去参加 NVIDIA 的比赛 , 对吧 ? 你正好有一个小目标 , 你可以激励自己 , 比如在一个相对的时间范围内 , 你做出一个什么样的作品 。
这个实实在在可以帮助到我们的小伙伴 , 我们的开发者 , 我们的创意人员 ,因为我们的 Omniverse 对于个人创作者是免费开放的 , 大家可以免费注册使用我们里面的许多免费功能 ,而且这些像里面有很多云原生的 , 甚至算力 GPU 都是在云上的 , 这些都是免费给大家开放的 , 大家可以试试看 。
那我想补充问一下, 比如说像新片场就是 Ethan 这边 ,他们如果作为一个公司制片方来用你们这个东西 , 它现在是到底是很贵啊 , 还是说其实整体下来 。
事实上我们有不同的方案 , 我们有 Omniverse 针对个人开发者的和针对商业应用的 , 就是我们有针对 individual 的 , 还有这个针对 enterprise 的 , 就是我们分别分别叫 OVI 和 OVE,Omniverse for individual,Omniverse for enterprise, 还有我们的 NVAI,NVIDIA AI Enterprise,有很多云原生的方案 , 所有的 GPU 你可以按租用的方式买我们的 license, 按时段去租用我们的 GPU, 那其实这个就像你租算力一样 , 那因为我们里面已经带了 NVIDIA 非常多的这
个开发平台软件的 SDK 等等等等 ,NVIDIA 是一个全栈式的软件解决方案的提供商 , 我们不仅仅是做芯片的 , 我们不是一个只做芯片的芯片的硬件产业 , 我们是一个 full stack 的 platform provider, 这个非常关键 。其实像很多 AI 的领域领域的应用的一些开发组件 , 我们都已经提供了 , 甚至包括一些原代码我们都可以提供了 , 还可以跟全球数千成千上万的开发者一起去互动讨论人
工智能和 M&E 行业的最新前沿的应用方式 。
好的 , 感谢啊 ,因为这是一个福利 , 就是是免费的 , 然后如果个人的创作者想去用这个东西的话 , 可以去网上搜索 。
那今天非常感谢两位做客晚点聊和我们分享了在影视行业技术是怎么改变影视创作 , 尤其是新的 AI 到来之后, 带来了更多的哪些变化 。
我觉得两位分享特别好的一点就是 AI 作为一个技术 , 它更多是帮助我们把内心的想法更好的表达出来 , 发掘出来 。
同时现在 AI 很重要的一个作用就是可以降低内容创作的门槛 。 那感谢各位听友 , 我们今天的节目就到这里 , 各位再见 , 拜拜 。
再见 。 好 , 各位小伙伴再见 , 谢谢 , 拜拜 。
本期节目就到这里 , 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。
你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 LatePost, 下期再见
。






