开场0:00
那我可以理解为它就是一个 " 抄答案 " 的过程吗 ?
它肯定不是我们原初意义理解的那种抄答案 , 就是你能直接有个答案就抄过来 。
嗯 。
因为它还是一个训练的过程 。
包括这个过程中间你也要防止自己被坑吗 ?
对 , 我知道有某一家模型就是用中软站 , 结果发现它其实蒸出来的是自己的 , 就自己在蒸自己 。 对 。
所以综合来说 , 就把技术和组织都考虑进来的话 , 那张一鸣说有可能很难超越 ,也许是一个真实的情况 。
张一鸣可能不是最懂技术的 ,但他大概率是最懂人性的 。
大家好 , 欢迎收听 《 晚点聊 》。 我是洪浩 , 那今天又是我们 《 晚点 》 编辑部自己录的一期节目 , 没有嘉宾 。
然后我是今天的代班主持 , 那我们的嘉宾呢 ,其实是大家每一期都能听到的曼祺 。
对 , 今天是我和洪浩一起来聊我们最近做的一个报道 ,是关于蒸馏这个话题的 。
对 。
然后开头我先叠个甲 , 就是正常来说 , 这个话题最合适的方式可能是你找到一个一线从业者 ,他做过这件事情 。
是 。
然后请他来把它聊得比较透 。 但也就像我们那篇文章开头写的 , 所有人都会去关注这件事 。
闭口不谈 。
对 ,但大家不会公开去谈论 , 所以其实他不太好找到嘉宾来在节目里去讲这个事情 。 那我们最后就是我们自己来聊 。
这个信息可能就是来自于我们最近这一段时间和很多不同公司的一些从业者和研究员所获得的一些关于蒸馏的信息 , 这确实也是目前行业里非常受关注的一个话题 。
蒸馏入门1:55
现在每个人都在谈蒸馏 。 就如果对于一个可能对于技术并没有那么精通的人来说的话 , 你觉得你来解释蒸馏 , 你会怎么去解释这件事情 ?
嗯 , 我对技术也没有那么精通 。
嗯 。
我就尽量用我觉得我理解的方式来解释 。
是 。
典型的为了变强的蒸馏 ,其实大家主要讨论的是这个嘛 。 我理解它的这个过程 , 简化来描述就是你先有一堆问题 , 然后你去问一个很强的模型 , 比如说你去问 Fable, 你就得到了很多回答 , 对吧 ?
然后这个提问和回答就会构成一堆这种数据对 , 然后你再用这些数据去训练你想去提升的那个学生模型 , 就是你自己的模型 , 然后你让学生模型的输出行为去接近你想学的教师模型的输出行为 , 你让两者的差异越来越小 。
这是比较典型的蒸馏 。 当然我刚才那个是一个简化的描述啊 , 比如说你中间从那个教师模型那儿通过提问得到的东西 , 它其实是含义可能是在变化的 。
比如说有了推理模型 , 就是 OpenAI o1 系列这种模型 ,DeepSeek-R1 这种模型之后, 它不是简单的题目和回答 , 然后它中间还会有推理过程 。
嗯 。
然后包括后面 Agent 也越来越发达了嘛 , 所以这个还可以扩展到一个完整的 Agent 完成一个任务的过程 。
那我可以理解为它就是一个抄答案的过程 。 就是比如说我问我这个模型一个问题 , 然后它可能现在它没有蒸馏之前 , 它的回答是非常的差的 , 或者是它可能都不知道怎么回答这个问题 。
然后我去问 Fable 一个问题 ,Fable 它能给我一个非常精妙的一个推理过程 ,以及一个最后的结果 , 然后我就直接把这个答案告诉我的模型说 ,以后你遇到这个问题 , 你就按照 Fable 这样的方式去回答 。
然后这样的一个问题多了 , 答案多了 , 最后我的模型也懂去回答 , 包括去泛化 , 它可能类似学习 Fable 的这种推理思考方式 , 变成了一个很智能的模型 。
就是我觉得它肯定不是我们原初意义理解的那种抄答案 , 就是你能直接有个答案就抄过来 。
嗯 。
因为它还是一个训练的过程 。 就现在这种蒸馏主要是用在后训练和中训练的 。
是 。
你要用算力 , 然后你是要有数据 , 要去放到模型里去训练 , 就是一个比较高难度的去获得答案的过程 。
嗯 。
这个里面不是说像抄作业那样 , 人家写 A 你就 A 的 。
是 。
你这个是要有一些方法和技巧和你的智慧和你的劳动在里面的 。
嗯 , 就是 。
所以它不是简单的抄作业 。 对 , 结论就是这样 。
嗯 , 就是它虽然也是抄作业 ,但它是有门槛的抄作业 。
其实可以不用这个类比吧 ,因为类比肯定是会丧失一些精度的嘛 。 但是我没有想到一个特别好的类比 , 就是比如它特别像日常生活中的什么行为啊 。
但它描述的过程是我刚才说的那样 。
轨迹蒸馏4:34
嗯哼 。
就接着刚才那个说晚 , 就是说像 Agent 更发展之后, 就其实你从教师模型里获得的整个的轨迹数据 , 它的含义是在变得更复杂的 。
这个正好是文章里没有特别展开的 , 我播客里也可以补充一下 。 就是智能体的轨迹蒸馏 , 如果就对比到我刚才说那个经典的过程的话 , 它现在要获得的东西 , 就是它要从教师模型上榨取的那个数据 , 它就不再是静态的题目推理过程和答案 。
嗯 。
它是扩展成了就是一个智能体 , 你在一个环境里面 , 你去完整地做完一个任务的整个过程 。
我觉得要先跟大家解释一下环境这个概念 。
哦 , 环境就是让 Agent 真正把任务跑起来的一整套条件和系统 。 就比如说你要让它做一个编程任务 , 你要给它一个代码库 , 终端还有必要的工具 , 比如代码编辑器 、 编译器 , 还有测试工具 , 然后再设置任务和单元测试 , 就是看这个程序跑对了没 。
然后具体来说 , 这个更强的教师模型 , 比如说你用 Fable 可以干什么 , 你可以让它来造一些题目 。 当然一般大家是会先有一些真实的题目 。
嗯 。
然后再去改写和扩增这些真实的题目 。 然后你也可以让它来造环境 ,因为其实很强的模型都有 Coding 的能力嘛 , 它本身就是可以去构造这种环境系统 。
然后你也可以用它来造轨迹 , 这个是比较接近典型的蒸馏的 。
嗯 。
就是相当于就是你让这个 Cloud 自己在它造的这个环境里面 , 它去把这个任务做一遍 。 你会获得它一个完整的做这个任务的过程 ,其实它也是一堆数据嘛 。
然后你再让你的这个学生模型 , 你自己要训的这个模型去行为上接近它做这整个任务的这个过程 。
嗯 。
但实际上你也可以不做这一步 。 就如果不做这一步的话 , 我就是用这个更强的模型来去评估我自己的模型在这个环境里做任务做得怎么样 。
那如果是这个的话 , 它可能就不是蒸馏了 。 我觉得它能描述成说你用了一些最强的模型的数据和输出来帮助你做一个智能体的强化学习 。
对 , 那如果总结一下的话 , 我觉得典型的蒸馏就是你是在让这个学生模型去学这个教师模型的输出 , 然后让这两个行为越来越接近 。
嗯 。
就是你用到了对方 , 要么是它推理的轨迹 , 要么是它完成一个比如智能体任务的这种完整的轨迹 。
所以有一个误区可以讲一下, 就并不是说在训练一个模型的过程中, 只要你用到了另一个更强的模型的数据和输出 , 它就是一个典型的蒸馏 。
协议与历史6:42
但是你确实是使用了更强的闭源模型的输出在提升和优化你自己的模型 。 然后说到这个 , 我就正好想到一个问题啊 , 即使是这种情况 , 对 Anthropic 和 OpenAI 和 Google DeepMind 的这些公司来说 ,也是违反了它们的用户协议的 。
就它们原本的模型的用户协议里面已经说明了 , 就是我的模型吐出来的这些内容也好 , 答案也好 ,是不能被拿来去做训练的 。
要更宽泛 ,是说你不能利用我的服务去提升和优化你自己和我竞争的模型 。
嗯 。
嗯 ,其实这个是很宽泛的 。
嗯 。
对 。 所以哪怕有些行为它不是蒸馏 ,在领先的闭源方看来 , 你也是违反用户协议的 。
这用户协议有法律效应吗 ?
这个我觉得可能得咨询特别专业的律师 。
嗯 。
我觉得从朴素的这种想法上来说 , 目前是个灰色地带吧 。
嗯 。
因为它这个范围其实很宽泛嘛 。
因为其实整体整个蒸馏的历史也没有那么长 , 对吧 ? 就是我们现在 , 我不说原理哈 , 就是现在大家真正开始做蒸馏这件事情 , 或者大规模做这件事情 。
对对对 。
从什么时候开始的 ? 你觉得大概是 ?
我觉得它比较新 。其实你从就 Anthropic 这些公司的声明里也能看到嘛 , 比如说 Google 今年 2 月的时候 , 它发了一个文章 , 然后那个文章里的原话是说我们观测到去年开始蒸馏等一些其他的这种它们称之为偷取 IP 的行为 。
嗯 。
变得越来越多 。 我获得的信息就是从 25 年到现在是规模变大了很多 。
25 年什么时候 ?
25 年年初啊 。
DeepSeek 出来的时候 。
DeepSeek-R1 发布之后 。 但我觉得这个关键的时间点还不在 R1 啊 。 它中间有两个比较重要的节点 , 一个是在 24 年 9 月的时候 ,OpenAI 发布了 o1 这个模型 。
因为 o1 是第一个算是开启了推理模型这种范式的一个模型 , 然后 o1 是带来了两个比较大的技术上的变化 。
这个在我们自己写蒸馏的那篇文章里也提到了 , 一个就是 o1 它揭示了你在后训练中做大规模的强化学习是可以让模型学到推理策略的 。
这个推理是 reasoning。 然后蒸馏本来也主要是用在后训练的 。 所以在这个阶段 , 你更多的去做蒸馏 , 你的投入回报是上升了 。
然后 o1 还有一个发现 , 或者说它开启了一种新的方法 , 就是你在测试式时间 , 就是在模型的推理阶段 , 这个推理是 inference, 就是模型使用的阶段 , 你去给它更多的算力 , 然后让它去围绕一个问题一步一步地想生成更长的思维链 ,也能持续提升这个模型的性能 。
然后有了这个思维链和更多的推理过程之后, 就这一部分它也是模型使用阶段的产出 。 就相当于作为用户 , 理论上你是可以看见的 , 当然它可以隐藏 ,但你能通过一些手段去还原 。
然后这部分东西就变成了更好的来蒸馏的数据的原料 。
哦 , 相当于 reasoning model 出来以后, 大家发现有漏洞可以钻 。
这不是漏洞 。
嗯 , 对 ,不是漏洞 。 或者说有方法可以蒸馏了 。
也不是有方法 , 蒸馏这个方法之前就有啊 。
嗯 。
只是说你能蒸的那个原料变得更丰富了呀 。
嗯 。
就你还有了推理 。
效果更好了 。
你还有了推理过程这一部分嘛 。
嗯 。
所以就是第一个变化 , 我觉得它提升了蒸馏这个方法的投入回报比 。
是 。
然后 o1 带来的第二个变化是说有了更多高级的模型可以生成的 , 可以用于蒸馏的数据啊 。
嗯 。
嗯 。 然后蒸馏变得更多的第二个比较重要的时间点 , 我觉得确实是跟 DeepSeek-R1 当时发布有关 。 具体来说就是 R1 的技术报告那会儿发的时候 , 就 1 月份嘛 ,25 年 1 月份 , 它还发了 6 个小的蒸馏模型 。
然后这 6 个模型 ,4 个是 Claude 2.5 的底座 , 然后还有 2 个是 Meta Llama 3 的底座 。6 个模型都是把 R1 当作教师来学啊 。
然后它大概就是在试 , 就说这种方式能不能让小模型的能力提升 。其实这个才是蒸馏最开始的一种比较主流的目的 , 就是是为了压缩的 , 就是把一个大的模型的能力压到一个尺寸更小的模型里面 。
然后它的好处就是说 , 大的模型一般来说就比较贵和慢嘛 。 一个它是可以降低成本 , 可以提高速度 。
另外就是有一些场景 , 比如说在手机上 ,在汽车上, 这些端侧算力更少的地方 , 包括未来的机器人上 ,其实需要相对小的模型 ,因为它对延时 、 对算力的要求都更多 。
就比如说我现在都能记起来 , 我第一次在线下采访中间跟人比较长时间讨论蒸馏是个什么情境 。
嗯 。
是当时去采访毫末的 CEO, 顾维皓 , 然后他们是做自动驾驶的 。他当时就讲了很多自动驾驶里面蒸馏的想法 。
因为在这个场景是很典型的 , 为什么它需要压缩 。 就你在云端训练一个模型 , 它比较大嘛 , 然后你要放到车上 ,因为车上当时应该是用 Arwin 之类的吧 , 这些英伟达的芯片 , 它算力还是相对有限的 , 相比于云端的算力 。
所以你就要让它通过蒸馏和剪枝量化的这些方法变得更小 , 这样它能在车上延时更低 , 就是速度更快 。
是 。
然后它消耗的算力也更少 。 而且这个对车 、 对机器人这种场景 , 延时低这个事是很重要的 。 所以这是最开始蒸馏的主要目的 。
嗯 。 它其实不是为了做更强的去追赶 。
对对对 。
它不是为了更强 。
更实用吧 。
对对对 。 它是为了把一个更大的模型的能力压到一个更小的模型里面 。
嗯 。
其实像比如说 DeepSeek 千问也会做这种 , 对吧 ?
对 , 千问是做了很多的嘛 。
是 。
因为千问累思一发 ,其实它的开源的尺寸是非常多的 。
对 。
嗯 。 然后后来就是到我们现在看到的蒸馏嘛 。
嗯 。
我们现在看到的蒸馏其实就是为了变强的蒸馏啊 。
所以这个风 , 为了变强这个风气是谁带起来的 ?
我觉得这个可能你很难追溯到是谁带起来的 。 我觉得就你 , 你其实压缩和变强是一体两面 。 就我把一个大的模型的能力压到一个小的模型的能力里面 , 我其实也是让这个小的模型的能力在变强 。
是 。
它一开始就有这个潜力 , 对吧 ? 它就有这个空间啊 。
今年以来大家对于蒸馏的这个讨论是格外的热烈 , 比去年要热烈更多 。
对啊 , 那就是从 25 年之后大家蒸馏多了呀 。
嗯哼 。
包括那个 Anthropic、OpenAI、Google DeepMind 什么的 ,他们都在 26 年年初开始啊 ,他们其实也有更多的公开的一些文章 。
嗯 。
包括他们给美国政府的一些公开信里面 ,他有更多的去提到就是说中国公司在蒸馏它们 。
嗯 。
我觉得这是一个比较明显的导火索吧 , 就让大家更多的来讨论蒸馏 。 还有一个更重要的大的背景 , 就是最近这段时间 , 中国的开源模型的表现是明显逼近闭源模型的 。
比如说 K3 就是一个里程碑 ,其实 K3 在美国是引起了很多讨论和争议的 。 这个我们在上两期节目 , 就 177 期专门聊 K3 的时候 , 开头也是聊了这个事情啊 。
所以就各种原因累积吧 , 一个是它规模应该确实变大了 , 然后另外就是有了更强的开源模型逼近美国的闭源模型之后, 本身中美对这个话题都更关注 , 所以蒸馏被推到了风口浪尖 。
嗯 。 但其实也有一些公司不蒸馏 , 对吧 ? 就我们前阵子也报道了 。
字节不蒸馏13:44
哦 , 那不是你写的 , 你编辑的 。
是 。 对 , 这个字节 。
嗯 。
啊 , 就是张一鸣非常罕见的一个露出 , 我们已经很多年没有写过这三个字了 。 对 , 然后我们在报道里面其实也有写到嘛 , 就张一鸣在 Seed 的一场内部会上面提到说 ,他不允许字节去做这个蒸馏 。
然后包括我们之前其实也了解到 , 字节很长一段时间都没有去做蒸馏这种行为 。
嗯 。
啊 。
严谨的来说了 , 罕见的有人不蒸馏 ,并不代表其他人都蒸馏 。Anthropic、OpenAI 和 Google DeepMind 都说谁谁谁蒸馏了 , 它也并没有展示完整的证据啊 。
嗯 。
然后说回你说的这个话题 ,其实我有关于这个报道本身 , 我其实有一些想问你的地方 。
嗯 。
因为就当时我看这个报道的原文 , 它只是说张一鸣说他反对蒸馏 。
对 。
其实它好像是没有特别多上下文的语境 , 或者说他反对哪一种蒸馏 , 还是所有的蒸馏 。 我而且我也不知道它是怎么定义这个事情 。
对 , 它其实没有明确的说我到底什么是蒸馏 , 或者什么样的方式干蒸 、 湿蒸 , 就各种 , 它其实没有这样的一个定义 。
就是全员会上本身就没有其他很多语境是吧 ?
对 。
OK。 哦 , 你刚才问题是说怎么看它明确表态不蒸馏这个事儿 。
是 。 因为字节它其实是一个算力非常多的公司 , 然后现在整个大模型的竞争又极其激烈 , 再加上可能我们一直觉得 Seed 的表现吧 ,并没有预期中的好像说啊 , 字节一定会 sold out, 或者甚至它在很多领域离 sold out 还很远 , 比如说 Coding, 比如说 Gentec, 就是智能体的这个领域 ,其实离真正的一线还是挺远的 。
嗯 。
对 , 那它居然主动拒绝使用蒸馏这种方式 , 为什么你觉得 ?
这个问题我们可以讨论啊 。
是 。
因为你对字节比较了解 。 首先你那个报道里面不是已经写了几个原因吗 ?
当然是 。
我觉得也都挺有道理的啊 。 一个就是张一鸣他认为说 ,他觉得蒸馏是短期内可以改善模型表现 ,但本质上是在复制 Claude 已有的能力 。
嗯 。
所以你这么继续干下去的话 , 你最多只能逼近对方 , 你是不能实现超越的 。
嗯 。
那潜台词就是 Seed 追求的肯定是做到世界第一吧 , 我理解啊 , 就最强的模型 , 就是他们的抱负和追求 。
然后第二个原因就是那篇文章里也写到 , 就是他希望 Seed 可以从更底层的维度去构建自己在 AGI 上的壁垒 。
就有可能他认为蒸馏不是一个长期壁垒 , 当然其实大部分从业者也都是这么认为的 。 然后最后一点啊 , 最后一点不是个原因的解释 , 我觉得是一个比较强的表态 , 就是说即使不蒸馏意味着字节会在技术上短暂落后国内的一些竞争对手 ,但他们也不采用这个捷径来推进自己的模型能力 。
嗯 。
我觉得他自己说的是比较清楚 。 然后有一些我觉得可能我不确定他这个全员会上讲了没有 , 我觉得他作为一个这么大的公司 ,而且他在全球都有业务嘛 ,他对合规 , 对其他国外的公司怎么来看它 , 我觉得他会有更多的考虑吧 。
嗯 。 你觉得 Seed 今天没有办法 sold out 的核心原因 ,有没有可能是因为就是它没有蒸馏 ? 这个所谓的 sold out 是说国内 sold out 吧 ?
啊 。
哈哈哈 。 你觉得咯 ?
我觉得有一定的原因吧 。
因为你接触一些他们自己的人嘛 。
是 。
他们怎么 ,他们自己怎么觉得 ?
我觉得不蒸馏是一个呃 , 挺重要的原因之一吧 ,但你也不能完全归咎到这件事情上面 。
嗯 。 虽然这是个万金油的回答 ,但是我觉得它是挺接近事实的 。
嗯 。
嗯 。其实据我了解 。
嗯 。
就比如 Seed 2.1 应该是用了一些蒸馏的手段 。
是 。
然后那个是 6 月份发的 。 我觉得它在这之后应该是经过一段时间的思考 , 它是做了一个比较明确的选择 。
对 ,他们内部应该是有比较激烈的讨论 , 最后还是决定不要蒸馏 。
而且其实你看它这个时间很短 ,因为 2.0 到 2.1 的话 , 你算它这个开发的时间 , 我觉得也就是今年吧 。
然后在那之前有比较长的时间 , 两年多 , 两三年的时间 , 字节应该是确实不怎么蒸馏的 。
超越之问17:44
你觉得张一鸣自己说的不蒸馏的核心理由 , 就是蒸馏只能逼近 ,不能超越 , 这成立吗 ?
我觉得是这样的 。 就是首先是张一鸣自己提到的 , 如果研究蒸馏这条路 , 最多只能不断逼近对方 , 很难实现真正超越 , 这个是有可能的 。
我之前也问了很多从业者 , 大部分人认为这件事在技术上是否绝无可能 。 我是指就说蒸馏是否学校模型就不能超过教师模型 , 它可能不是绝无可能的 ,是有可能的 。
这这我觉得是一个研究课题吧 。其实蒸馏有很多方法也可以优化呀 , 对吧 ? 比如说我是不是可以不仅学某一个模型 , 我学更多的教师模型 , 我博采众长 。
当然有可能你学不好 , 就是你博采众短都有可能 。 就 Android 它是有很多可以去探索的空间的 ,但大部分人也都认为 , 就是蒸馏它会有一个隐患 , 或者说代价 , 就是组织和人的激励吧 。
如果说一段时间里面 , 你把很多精力和重心放在蒸馏上 ,因为蒸馏确实是一个我觉得相对来说它比较经济 , 就成本比较低 ,而且它比较有确定性 , 这个是更关键的 , 比较有确定性的去提升你的能力的方式 。
如果你把重心放在这个相对有确定性的方式上, 那组织里一些去做更长期的探索 , 去走一些更不确定性的路的项目 , 或者说人 ,他们可能就得不到足够的资源和认可 。
我觉得认可也很重要 。其实这种顶尖研究员 ,他还是很需要一个 , 就是这种更创新的研究能被鼓励 , 能被看到的环境吧 。
我觉得有这个组织上的隐患 。
对 。
所以综合来说 , 就把技术和组织都考虑进来的话 , 那张一鸣说有可能很难超越 ,也许是一个真实的情况 。其实当时就是你这篇文章发布之后, 我自己在朋友圈还有极客 , 我都写了一个挺长的分享的 。
我就是在问我之前就在想的那个问题 , 就是学生模型是否一定不能超越教师模型 。 然后我也分享了一些我当时就获得的这个行业里的一些从业者的反馈啊 。
然后有一个人在极客上的留言 , 我觉得就挺有意思的 。他就是说张一鸣可能不是最懂技术的 ,但他大概率是最懂人性的 。
就可能会有这种组织上的代价吧 。
这个说的蛮好的 。
嗯 。 啊 , 另外蒸馏还有一些内在的技术上的一些问题啊 , 比如说你有可能会学到教师模型的一些错误和他的一些什么巨大表现啊 , 就总之你的行为会比较接近它嘛 。
嗯 。
就你也可能会学到一些不好的东西啊 。 所以它也有一些技术上的问题啊 。
那其他公司的人难道就不会意识到这个问题吗 ? 因为我们知道可能国内可能也有几家公司表现出来它对 AGI 是有信仰的 , 对吧 ?
我觉得他们应该也能看到蒸馏的一些代价也好 , 一些负面的影响 。
我觉得取决于你认为这个代价是否是可控或者可接受的吧 。 就文章里也有一个比喻嘛 , 一个运动员理论上是可以即刻兴奋剂又勤加训练的 ,也许真的就有人是这么干的 , 对吧 ?
只是说一般而言 , 你如果嗑了兴奋剂之后, 你肯定是会有一些侥幸和惰性的 。
嗯 。
嗯 。maybe 其他人想的是 , 呃 , 我可以克制这方面的 , 我可以减少这方面的问题 。
嗯 。
或者我不一样 。 啊 , 这个我不知道 , 这个你可能得去问每个公司的 , 对吧 ? 这些决策者他们是怎么想的 。
哦 , 还有一种可能 , 就因为蒸馏只是优化模型的方法之一 , 对吧 ? 有可能对一些公司来说 , 它什么阶段什么方法有用 , 它就会在这个上面会做投入啊 。
那过了一段时间 ,也许你会发现更有用的方法 ,其实你就可以去用那些更有用的方法 。 而且确实在实践中, 一个公司它做蒸馏 , 首先这肯定不代表它后训练的数据全部都是来自于蒸馏的 。
它肯定也会有别的数据 , 另外也不代表它不干别的事儿 , 它肯定也得做 Infra 的优化 , 然后它可能会去有一些呃 , 算法和架构上的优化等等 , 就它也会去更好的去构造它自己的预训练的数据集 。
它还有很多别的事儿要干啊 。其实上次选题会的时候也说到 , 自从张一鸣有这个明确的表态之后, 有一些人想从 Seed 离开嘛 。
是是是是是 。
确实是这样的 。
但这个其实也很个体 , 你说有两三个 、 三四个人离开 , 好像也也不稀奇 。
然后他们个体的原因就是认为他们觉得不应该放弃这种方式是吗 ?
因为你的职业生涯是有限的 , 就是你每一个人的从个体的角度来讲的话 , 那我当然是希望比如说我在 Seed 的这这几年时间里面做出自己的代表作 。
明白 , 就是希望我的职业履历里面 , 我所在的团队是做过最强的模型的 。
是 。
就比如至少中国最强的模型 。
对啊 , 我最宝贵的这个人生阶段 , 或者说我的职业阶段可能就是这几年, 然后我一直在里面陪着你耗 。
当然这个是非常 。
我知道 , 非常个人化的 。
对 , 个人化的一种想法 。 啊 , 我觉得也合理吧 。
嗯 。 而且其实你去推测的话 ,有人会这么想 ,也可能会有人被张一鸣的这种表态 。
感召 。
对对对 。
那如果他不蒸馏的话 , 从你的角度来看的话 ,他现在更应该做什么 , 或者是说他的重心应该是什么呢 ?
就是字节怎么去构造高质量的数据嘛 。
是是是 。
而且你已经看到他有动作了 ,也是本周啊 , 就智能涌现有一个报道是说字节从 6 月开始重组数据团队 , 然后现在是要成立一个新的和 Seed 和 Flow 平行的一级的 AI 部门 ,是叫 AI 数据和安全 。
就相当于他把数据应该是就作为一个很重要的能力给它抽出来 , 然后成立了一个就级别还挺高的一个大的团队吧 。
所以我觉得他得自己去获得某种你不依赖于外部的领先的闭源模型 ,不依赖于 OpenAI、Anthropic 这些公司的数据的能力 。
我又想问你啊 , 就他们新成立的这个 AI 数据安全部门的这个负责人叫王英磊 。
嗯 。
Adam 王 , 这个人你之前接触过吗 ?
他是原来在 TikTok 负责直播的 。他跟文嘉和呃 ,Alex 都汇报过 。
哦 ,OK。 所以相当于跟他们之前都共事合作过 。
对 。
因为我看就公开信息就是说他之前在 TikTok。
嗯 。
然后现在来负责数据 。 因为我不太确定这两个事儿之间的相关性啊 。 就说到数据这个事儿 ,其实现在有很多第三方的数据公司也做了表达 。
对 , 所以这个我也很好奇 。 就是如果我用我第三方的数据公司去做蒸馏 , 然后我去买他们的数据 。
嗯 。
那这个算什么呢 ? 因为我也听说一些公司它可能说自己不蒸馏 , 可能在体外去做一些操作来实现蒸馏的这个目的 。
那比如说我买第三方数据 , 这个算蒸馏还是不算蒸馏 ?
我觉得这有很多操作空间吧 。
嗯 。
嗯 , 分两个层面来说 。 就是它在技术上, 我觉得如果你是让你自己要训练那个模型 , 然后你去逼近你获得的一堆更强的模型的这个输出和行为 , 我觉得技术上它是蒸馏 。
嗯 。
至于法律上, 或者说你是否违反对方用户协议上, 这个问题是否能绕开 ,有很多操作空间啊 。 包括如果之后美国有更严厉的限制的话 , 可能也有对方政府的一些限制 。
这就不单纯是技术问题了 , 这应该就会涉及到很多不同层次的问题了 。
嗯 。
嗯 。
同行讨论24:41
我们接下来可以讨论一下更多公司 , 或者说整个行业的情况 。 比如说 DeepSeek、Kimi、 智谱 、 千问这四个模型里面 , 从你的角度来看 , 你认为谁最可疑 ?
首先啊 , 我就想访问你啊 , 为什么是这四个公司 ?
因为这个不就是大家传的比较多的就这四家 ?
首先这个肯定没法评论啊 , 就到底谁在蒸馏 , 谁不在蒸馏 。其实我们可以看就美国这些公司 ,他们是在点名谁吗 ?Anthropic 2 月的时候 , 它是点名了三个公司 ,是 DeepSeek、Kimi 和 MiniMax。
然后 6 月的时候 , 它又点名了一家公司是阿里的千问啊 。
嗯 。
其实反而智谱是没有谁说的 。
对 。
就没有 。
没有 。
只有美国 。
公开来说 。
对对对 , 就没有美国公司说智谱在蒸馏或者疑似蒸馏 。 然后 OpenAI 是说 DeepSeek 有这种就疑似蒸馏的行为啊 。
嗯 。
对 , 所以这只是公开信息 , 分享一下 。
啊 。
嗯 。
那你怎么看 , 比如千问前一段时间 , 就阿里被 Anthropic 点名以后, 整个集团都开始禁用 Claude Code?
因为 6 月的时候是 Anthropic, 它应该是给美国的国会有一个信里面就提到了千问疑似吧 , 跟它进行了很多交互 ,是有 2880 万次 。
而且当时 Anthropic 说的这是有史以来发现的规模最大的蒸馏攻击 。 我觉得这两个事儿可能没有直接的必然的联系 。
嗯 , 首先它可能是一个合规的表态吧 ,因为本来中国的用户理论上就不能用 Claude 的模型 。
嗯 。
然后另外我觉得它也会要考虑自己的数据安全 ,也许它不希望让呃 , 内部的很多对 AI 的使用就是通过这个模型啊 , 对吧 ?
它可能想让他们用自己的模型 。 这我觉得它确实不一定和蒸馏有关 ,但是它也是在中美模型竞争的这个大语境里啊 。
嗯 。
如果中国所有头部模型都不允许蒸馏了 , 你觉得现在格局会发生什么样的变化 ?
你如果让所有人都不蒸馏 , 那所有人其实就在这一点上都是一样的 。
对 。
那就还是看你别的能力呗 。 不好判断 , 我感觉可能没有什么变化吧 。
不会有变化 。
因为你还是得看你别的能力啊 。
那你的意思就是说 Kimi 还是 Solta, 智谱还是能领先 ,Seed 还是落后 ?
你看你这个 。
啊 , 你这个又 。
你又预设了 。
你又预设了其他人都在蒸馏 ,而字节没有蒸馏 , 对吧 ? 然后如果所有人都不蒸馏 , 字节是不是看起来就跟大家差不多了啊 ?
是 。
这我真的没法判断啊 。
嗯 。
而且这个假设肯定也很难实现了 。
对 。
那我们其实有什么迹象可以看出一个模型是不是蒸馏的吗 ? 比如说模型有的时候经常会说 , 啊 , 比如说一个非 GPT 的模型 , 它在回答的时候有的时候会说自己是 GPT, 然后或者是说我是 OpenAI 训练的 , 那有的人就会把它来当成蒸馏的证据 。
你觉得这个靠谱吗 ?
这个肯定是不靠谱的呀 。 就你直接问一个模型 A 你是谁 , 它说是 B 的话 , 你这不能证明 A 蒸馏了 B。
嗯 。
其实 24 年 11 月的时候 , 就有人做过这种研究 , 大概他们当时是测了 27 个模型 ,有中国的有国外的 , 还设计了一个 77 个问题 。
这个研究就是在研究模型的身份混淆的问题 。 这里面会有出现比如说 GPT-4 会说自己是 GPT-3, 然后 Gemini Pro 会说自己是百度文星 。
嗯 。
字节 Seed 会说自己是 GPT, 对吧 ? 但这个论文的结论是说 , 你仅凭他们身份混淆 ,其实很难判断谁使用了谁的训练数据 , 更不能说明蒸馏 。
更合适的方式可能是你去看他们的输出分布是否接近 , 就还是看它整个行为是否接近 。
你的意思比如说它说话的方式 , 它的输出的格式 , 拒绝回答的方式 , 或者是代码的风格 ?
对 ,但我觉得这个需要很大的量 , 对吧 ?
嗯 。
你肯定不是你问它一两次 , 然后你觉得很像它 , 你就能证明什么的 。
嗯 。
然后另一方面就是你说你要去判断一个模型是否蒸馏的原因是什么 ?
对 , 可能以提这个问题 , 可能先入为主有一个印象吧 , 可能会觉得说蒸馏是不是一件不好的事情吧 , 对吧 ?
如果作为用户来说的话 , 这肯定不影响你使用啊 。
对 。
但确实可能就假如说你是个投资人。
嗯 。
或者说你是一个呃 , 要买二级市场股票的人, 你是一个想找工作 , 我在这几个公司里选一个 , 那可能取决于你的技术判断吧 。
就你认为蒸馏这个事儿长期来说 , 对一个模型研发团队是不是一件好事儿 ?
是 。
然后你去看它蒸馏了没 , 这个我觉得就对你比较有价值啊 。
蒸馏难点28:52
对 。 那我们说回蒸馏的方式吧 。 你觉得蒸馏真正困难的地方在哪里 ? 比如说你是真正的拿到了这个几百万条的 Claude 的回答比较难 , 还是说我应该知道怎么去向 Claude 提问比较难 ?
如果我们大家所有公司都可以狠狠的蒸馏 , 那蒸馏的核心竞争力是什么 ?
我觉得可能很难回答哪个部分更难 , 可能每个公司不一样 , 看你自己的薄弱环节是什么 。 就我可以讲一下我知道的蒸馏比较有难度的一些环节 , 这个也是在文章里有展开的 。
一个就是在最开始嘛 , 你怎么获得稳定高频的去访问这些模型的账号 , 然后包括你怎么去做用户运营 。
就用户它可能是帮你提供一些真实的高质量的数据的 。
用户提供数据 ?
对 ,因为你有些真实数据是从用户数据那儿筛的 。
嗯 。 你是说用户的提问吗 ?
提问 , 对 。
嗯 。
真实的提问可能只是一个种子 , 然后你可以围绕它再去做扩增和改写 。 有一种行业里会有从业者提及的做法吧 , 就是你建很多中转站 , 然后你再让一些人来通过这个中转站去用领先的 GPT 或者 Claude 的模型 , 然后最好这些用户是真的能提出这种比较有质量的问题的用户 ,而且他们真的有这个真实的需求 。
比如说它还是可能是一个高校里的理工科的学生 , 或者是一个研究者 , 或者是一个高级程序员和开发者 , 这其实是一个运营的工作 。
它也有技术的部分 , 当然中转站你不用自己建啊 ,也是你也可以去找一个就比较稳定的第三方啊 。 包括这个过程中间你也要防止自己被坑嘛 。
假如说你和一个三方中转站合作 , 对吧 ? 那人家也可以在领先的模型中间参与一些就是可能你不想用的模型 。
对 , 我知道有某一家模型就是用中转站 , 结果发现它其实蒸出来的是自己的 , 就自己在蒸自己 。 对 。
OK。 好吧 。 嗯 , 对 。 第二个整体来说 , 我觉得就是一套数据管线吧 。 就包括你怎么去构造题目 ,其实也是一个构造数据的过程 。
然后你如果说你有很多这种高质量的用户 ,在真实的任务 、 真实的场景下 ,有很多这种真实的提问 , 你从里面肯定是要筛选的 , 对吧 ?
那你怎么筛选 、 过滤 、 去虫这些真实的数据 ? 然后你怎么进一步用模型去扩增和改写这些数据 ?
中间还有涉及到纠错 ,以及整个就是这个数据的形式和配比 。 这套数据管线我觉得是会有一些难度 , 或者说至少它是有经验 know-how 在里面的 。
以及你整个这个系统 , 它是否比如说成本比较低了 , 然后比较稳定了 , 这个也会影响你的大规模这种操作的时候的效果和效率嘛 。
嗯 。
所以整体来说 , 它是一个比较复杂的系统工程 。 这回到你前面说它是不是抄作业嘛 。
对 。
就如果你非要说它是抄作业的话 , 那就是一个非常复杂的 , 就抄的那个过程非常复杂 。
嗯 。
本质上就已经不是抄了 ,不是你一笔一画你对着人家写一遍就对了 。
我理解了 。
嗯 。 大概就是这么实现的吧 。
隐藏与反制31:55
所以一家公司如果它真的想隐藏自己这种蒸馏的行为 , 你会觉得最常见的方法是什么 ?
它想向谁隐藏 ? 它是想对就是 。
Anthropic 和 OpenAI。
啊 ,OK。 那我不知道了啊 。
嗯 。 但如果它不用 API,而是直接下载一个 OpenWeight Frontier 的这个模型 , 然后在自己的机房生成几亿条数据 , 外部是不是几乎是没有办法去发现的 ?
你就是说它去蒸馏一个开源模型 。
哎 。
就假如说一个开源模型变得很强了 , 对吧 ? 其实最近黄仁勋在有一个采访里面 , 就 7 月 29 号的一个采访里 ,他也被问了这个问题 。
现在的很强的开源模型是很大的 , 比如说 K3 是接近 。
对 ,2.8。
对 , 接近 3T 嘛 。
嗯 。
然后像 V4 也是 1.6T。 就首先就是你部署一个这种这么大的开源模型 , 它也需要挺多算力的 。
嗯 。
然后你如果部署完之后, 你还持续的用它在跑各种数据 , 你的电费应该也挺高 。 就总之就是它会比较容易被监测到 。
嗯 。
就如果说政府或者说其他人认为这是一种隐患的话啊 , 可能政府比较好监测到吧 。
嗯 。 那如果我一家公司 , 那同时像 Claude、GPT、Gemini, 甚至是 DeepSeek, 然后千问 , 我每一个模型我拿一点点数据来 , 然后再让自己的模型去筛选 、 去重写 , 那我是不是就很难看出我是某一个老师的痕迹 ?
嗯 ,有可能 。 但是这个并不能像闭源的厂商隐藏你的蒸馏行为 , 对吧 ? 因为只要你有疑似 , 就比如说大规模高频的去使用它的 API, 就有类似 。
就能够被查 。
对对对 。 就你有类似这种异常行为 ,其实对方就有可能能看见嘛 。
它其实不是从结果来发现的 ,而是从你这个过程中发现的 。
对 。其实那个 Anthropic 最近它有说嘛 , 它说他们就是搞了一些更强的反制措施 。 它说它已经建立了识别蒸馏流量的分类器和行为指纹系统 , 它可以发现跨账号协同 、 重复提问和套取思维链的行为 。
所以它不是等其他模型蒸了它之后, 它从你的表现来看的 。 但我觉得这是一部分啊 。 就你过程中它也能看到 。
以及他们这次还讲了 ,他们会加强对教育啊 、 研究还有创业公司的这些账号的身份认证 。 这跟我刚才说的就是你运营的过程中间 , 比如说你找一些高校学生 。
是 。
来用 ,其实它也是相互应能 。
嗯 。
然后你比较关心这个问题 ,是因为你比较关心怎么藏这个事儿是吗 ?
是 。
你觉得藏了之后, 然后它的结果是什么了 ?
我觉得很直接的一个结果 , 比如说 , 这样举例我不知道合不合适啊 , 比如说千问也好 ,Kimi 也好 ,他们现在是没有在美国的实体清单上面的 。
那但我首先我没有说他们蒸馏了哈 。 假如说我 , 我是 Kimi 或者我是千问 , 我想去做蒸馏这件事情 , 我又不想被上美国实体清单 , 我不想被 Anthropic、OpenAI 发现 。
就你想知道这是否可能 , 对吧 ?
对 。
啊 , 那我觉得这可能也算是蒸馏的另一种代价吧 。
嗯 。
就你确实会有一些合规的隐患 。
嗯 。
而且这个叫什么 ? 药上人不知除非醒目为 , 对吧 ? 你总是有会有些痕迹的啊 。
嗯哼 。
所以其实蒸馏本身是会受到一些约束的 。 它也不可能不可能无限的这么大规模的扩展 , 包括大家也会考虑成本啊 。
超越与规则34:56
那我们说说这个蒸馏的好处吧 。 就是我们刚才也提到嘛 , 学生能不能超过老师 。
嗯 。
你觉得呢 ?
其实我刚才说了呀 , 我觉得技术上是有可能的 。
嗯 。
或者至少说我接触的从业者认为技术上是有可能的 。 它有几种可能方法 , 比如说你刚才提到的 , 我向不同的老师去学习 , 多教室蒸馏 。其实现在在后训练去合并不同方向的专家的能力的时候 , 就是会用到这种多教室的蒸馏 。
那多教室的蒸馏这个思路是否也可以用来让模型变强 ? 我这纯粹就是一个拍脑袋的技术推想啊 ,但也许会有人去试这个方向 。
嗯 , 包括之前有一些研究 , 就这个文章里有写啊 ,其实你在一些比较特定的任务上, 你是有可能让一个学生模型就在那个具体任务上去超过教室模型的 。
当然这不一定代表这个学生模型整体上就比这个教室模型 , 比如它的泛化性 、 通用性 , 然后各方面的能力都更强 。
所以我觉得它是一个一个开放式的可以去被研究的问题 。
嗯 。
就你说学生模型能否超越教室模型啊 。
嗯 。
嗯 ,其他好处比较明显嘛 。 好处就是一个你可以相对低成本 、 确定性高的去接近更强性能的模型的方法啊 。
那超越老师意不意味着它这个模型就是个 Frontier 的模型 ? 就是一个最强的 , 它可以是最强的模型 ,但它不一定是最创新的模型是吗 ?
你就说靠蒸馏能不能变成世界第一 , 对吧 ?
对 。 或者说世界第一的标准是什么 ?
我觉得我们先不用说创新不创新啊 。
嗯 。
世界第一的标准 , 那就是按照现在的 , 比如说各种对智能的评测 。
表现最好 。
它对 , 它表现最好嘛 。其实就是回到我刚才说那个问题嘛 。 那如果你已经学了最好的教室模型 , 你还超过了它 , 那你是有可能变成世界第一 。
嗯 。
我觉得这是个技术上的开放的问题啊 。 但是你能不能持续是这个第一 , 那确实跟你的创新能力有关 。
嗯 。
嗯 。其实现在就是各领风骚几个月嘛 。
对 。
嗯 。 而且其实你可以观察到一个现象啊 , 就像 Anthropic 这个公司 , 它至少今年上半年有几个月它还是持续的领先了 。
它是最近这段时间因为有很多新的模型在密集的发布 , 包括呃 。
Grok。
K3, 对 , 包括 Grok,Grok 4.6, 对 , 昨天也是刚刚发了啊 。 所以就最近这一短期的记忆里面 , 我觉得大家会会这种感觉更急迫吧 , 就是看起来开源已经非常接近闭源 。
嗯 。
但首先它现在还没有接近 。其次其实在如果你拉到半年的维度 , 那中间我觉得有几个月的时间 Anthropic 还是领先的 。Anthropic 和 OpenAI。
所以可能现在这个阶段过了之后, 也许对方又会 , 我就指最强的闭源模型的公司 ,他们可能又会跳一步啊 。
嗯 。
然后其他公司赶上, 然后他们又会跳一步 。
就我们现在看到的实际情况可能是你通过蒸馏的方式 , 你暂时是没有办法超过老师的 。 但换个角度来想吧 , 对于所有商业公司来说 , 可能现在有了蒸馏这样的方式 , 你的后发者反而其实是有优势的嘛 。
你可以用更新的这种数据 、 更强的模型来蒸馏 , 获得更好的数据 , 然后你对于领先者的这个差距其实是逐渐缩小的 , 可能也就短短的几个月 , 甚至可能时间更短 。
那听起来其实是合理的 , 对吧 ?
你就说对他们有什么问题 , 对吧 ? 对这些开源公司 。
对 。
如果不超越 , 这个现状是否也可以接受 ?
是 。
对 , 我觉得这个就是取决于大家怎么去想更强的这个 AGI 之后会怎么到来 。 就比如说有一种假设是这样的 , 啊 , 像 OpenAI 和 Anthropic 现在都讲很多什么自进化的这种能力 。
是 。
那有可能你自进化到了一定程度之后, 人在里面的作用会变小嘛 。 然后如果你用更多 AI 来去优化 AI,其实你的速度是会非常快 , 你自动化程度很高 , 那可能它的加速度会越来越大 , 那可能会把后面的人甩得更远 。
这是其中一种假设 。 那在这种假设里面 , 你率先达到某一种状态还是很重要的 。 就也许你今天看每一次 Anthropic 和 OpenAI 直逼后面的模型领先几个月或者几周吧 , 那也许再过一段时间 ,他们到了另一个状态之后, 这个时间差就没有这么容易缩短了 。
但这只是一种假设 。 所以这个东西我觉得也不能满足于说我们现在因为有这种方式 , 我跟它跟得很紧张就 OK 了 。
嗯 。
嗯 。 当然我觉得大家非常依赖于蒸馏 , 可能也只是阶段性的状态 。 它也只是一种方法嘛 。 然后你其实可以组合很多方法嘛 。
那我觉得接下来我们可以聊一个话题啊 , 就站在普通人的视角 , 对于蒸馏是有非常多的印象 , 或者是不管是刻板印象也好 , 或者说很热门的讨论也好 。
比如很多人就会觉得蒸馏是一个带有原罪的行为 。
为什么会原罪是指 ?
原罪是指可能就是我们刚刚讲的 。
就是它用了别人的数据 。
用了别人的数据 , 你抄作业等等等等。 但它其实我理解我们刚聊下来 , 它就是在一个灰色地带 , 对吧 ?
我觉得原罪这个词肯定是有点严重了啊 。
嗯 。
对 , 我觉得它是个灰色地带吧 。 它肯定是违反了那些闭源模型公司 OpenAI、Anthropic 的用户协议的 。
嗯 。
但是违反用户协议不一定构成法律上的侵权 。 这个要看其他的法律规定 。 另外就是其实我最开始也说了 , 我觉得他们的用户协议本身也就限制的很宽泛啊 。
你觉得那我们现在来讨论蒸馏这件事情 , 你个人是觉得我们应该讨论比如说能不能蒸 , 还是说什么样的蒸馏方式是可以被接受的 ?
你会有一条红线吗 ?
我觉得就是有一些明显是违反现在就全球比较通行的法律法规做法 , 肯定是不太能被接受的 。
比如说你用一些黑客攻击的方式 , 你直接侵入其他公司或者实体的系统 , 你通过黑客的方式去破解思维链什么的 , 这种是不太能被接受的 。
然后你说到就是怎么去考虑蒸馏这个问题 ,其实我觉得大部分做模型的人和这些模型公司的人 ,他肯定不会就是单独的去考虑蒸馏这个问题 。他们考虑的问题是我怎么用各种方法去让模型变得更好 ,以及我构建更长期的能持续做出更好的模型的能力 。他们应该会整体的去考虑这个问题 。
然后蒸馏是其中的一种可以用的方法 。 你用到什么程度啊 , 你怎么去用 ,因为蒸馏有一些不同的操作方式 , 包括你也可以选择不用 , 都是不同的选择 , 对吧 ?
你可以想象它会有一个比如说一个特别大的控制板 , 上面其实有很多东西都是可以调整的 。 那蒸馏只是其中的一个旋钮啊 。
嗯 。
我觉得他们会从这个角度去考虑吧 。
另一个就是那我们看到 OpenAI 和 Anthropic,他们在做预训练的时候也会弄大量的数据 , 从实体书来也好 , 从盗版书网站来也好 , 或者是从各种各样的视频网站扒下来也好 , 去搞这各种爬虫也好 。他们这种行为跟今天我们所讲的蒸馏有本质的区别吗 ?
对 , 我觉得这涉及到现在讨论中的一种常见的对话展开方式 。
是 。
就是比如说美国的公司说中国公司蒸馏 。
对 。
然后中国公司就会说 。
双标 。
对 , 会说你双标 , 或者说 , 诶 , 那你之前也是去用了很多这种可能也没有授权你可以来做模型训练的数据 , 甚至有的数据它根本都没买 , 对吧 ?
你比如说中国公司去用这些账号 , 那还是付了钱的 。 那个 Anthropic 它最近有一个 15 亿美元的集体诉讼的和解 , 那个具体那个案情就是当年它是在一些盗版图书网站下了很多书的 。
这个过程它其实就直接它就没有给这些书付费 , 然后是有很多美国的作家集体诉讼告了它这个事情 , 就目前已经达成和解了 。
嗯 。
就大家会去比较这两种行为嘛 。 我觉得整体上来说那肯定是双标的 。
嗯 。
只不过这两种行为它也不完全一样啊 。
怎么不完全一样 ?
首先它的侵权行为我觉得是不一样的 。 比如说 Anthropic 那种我直接就 。
搞盗版书 。
对 , 那肯定是侵权的 。
对 。
你就本来你没付钱买书啊 , 你就 。
比如我买了 。
你就先不说这个我买了之后是否来训模型啊 。
嗯 。
那买了之后来训模型是否侵权 , 这我不知道啊 。
但目前我们看美国的这个加州的法院判这个是不侵权的 。
就是它有一个判例是认为这样就只要你付了钱就不侵权是吗 ?
是 ,是 ,是 。 嗯 ,但只是州的这个法院怎么判的 ?
因为美国是案例法 。
嗯 。
就美国其实它后面的类似的案件 , 它会去看前面的一些情况是怎么判的 。 诶 , 这个倒是有点价值的回旋镖啊 。
嗯 。
那我在想之后如果说这种方式加州的法院认为它不构成侵权 , 对 , 那其他的公司用 Anthropic 的产出再来提升自己的模型 。
嗯 。
这是否构成侵权 ? 这是个很有意思的话题啊 。 这个案例挺有意思的 。
是 。 那我们其实最后可以做一个预测 , 就是你觉得三年以后蒸馏是会像爬虫一样的普遍 , 几乎无法阻止 , 还是说可能美国的几家 Frontier Lab 最终能够通过所谓的账号体系也好 , 模型设计也好 , 甚至是法律手段也好 , 把它给最终给禁止掉呢 ?
首先我觉得这个行业可能没法看三年之后的 。
三年之后 。
这个太久了 ,有 36 个月啊 。
哈哈哈 。
感觉 AI。
人间已经变了 。
对对对 。
就是 。
不知道 AI 已经怎样了啊 。 嗯 , 然后你说就最终这个蒸馏会不会被大幅的压下来 。
嗯 。
我觉得这个博弈肯定是会进行的 。其实就是你有一些手段 , 然后我再来反制你的手段 。
嗯 。
我可能又会找一些新的手段 。 所以蒸馏本身它有很多现实约束 , 它也不太可能肆无忌惮的蔓延啊 。
嗯 。
大家也会考虑成本的 , 你这多少花钱呢 ?
商业逻辑44:05
如果蒸馏越来越容易 , 那今天就是投入几百亿美元训练这种 Frontier Model 的商业模式 , 会不会有根本性的变化 ?
因为今天其实已经看到大家对于所谓的斩杀线也讨论的挺热的嘛 。
其实之前 177 期聊 K3 的那期也讨论这个话题 。 首先短期内的市场预期是 Anthropic 和 OpenAI 的估值会受一些影响 , 甚至有人认为这会冲击他们 IPO 的进程 。
但我觉得前提是我们现在只看到此时此刻的前面 。 比如说马斯克昨天就是 Grok 4.6 发了之后 ,他在回复另一个公司的一条推文的时候说 Grok 4.7 会超过现在的所有的模型 ,但他也补了一句说 Anthropic 的下一个模型可能会非常强 。
就有可能比如说过了一个月 Anthropic 又发了一个很强的东西 , 那我觉得大家的预期又会改变啊 。
嗯 。
闭源模型公司可能它有一些后手是没有展示的 。 所以我觉得还比较难说是否就真的冲击了投入很多钱去开发一个非常领先的模型的这个操作 。
嗯 。
但是有一件事我觉得也比较明确啊 , 就是它是冲击了商业逻辑的 。 就是像 V4, 包括 Grok 其实也是一个性价比很高的模型 。
然后有那张很著名的那个斩杀线的图嘛 , 就是在 V4 还有 Grok 4.6 的下方和右边 , 就那个区域里的模型都是被斩杀的 。
就现在确实有一个问题啊 , 我觉得就是说可能对很多任务来说 , 目前的这一批最强的模型已经很够用了 。
比如说我最近见一个呃应用公司的创始人, 就他们也是做那种偏生产力的应用 。他跟我说可能用户的十个任务里面 , 八个都能被 DeepSeek V4 Flash 解决啊 。
就当时 Pro 还没有正式发 ,而且 Flash 就真的非常便宜 , 速度也比较快啊 。 这个我觉得确实会改变很多就是商业逻辑的事儿啊 。
就它至少会改变很多定价策略吧 。 而且这也涉及到一个更大的问题 , 就是说你的智能的供给和需求之间现在是什么关系 ?
目前看起来其实对很多人的日常的使用来说 , 可能你的智能过了一个限制之后它确实就够用了 。
嗯 。
嗯 。 我们上次其实讨论姚顺雨那个播客后面也在讨论这个话题 。
对 。
就说你 Coding 之后, 你再往白领这种市场去扩散的时候 , 对智能的需求 。
并没有那么大 。
我觉得准确描述是这样 , 就是说对智能的需求的规模和它的节奏 , 就它的速度有没有那么快 ,其实是打问号的 。
是 ,是 ,是 。
最近我然后见一个就平时交流比较多的投资人的朋友 , 那他也是在想这个事情 。 就他想的问题就是我们之前都说 Coding 比视频生成大 , 万一错了呢 ?
那这个错了的可能性也是在于说可能对很多白领的工作来说 , 就现在这模型真的已经够用了 。
嗯 。
你搞更强的模型 , 这个叫什么杀鸡焉用牛刀 。
对 。
可能你没有用武之地 , 你就徒劳枉刀 。 对 , 我觉得这可能是比蒸馏更大的一个问题吧 。 就是你现在智能的供给和需求接下来是一个什么样的匹配 , 规模上 、 节奏上 。其实我自己就上次我们录那个啊姚顺雨那期的时候 , 我对这个问题啊 , 我当时是从个人感受上来说是相对悲观的 。
因为我那会儿其实除了用模型做偏 Deep Research 的工作 , 我别的工作做的比较少 。
嗯 。
但是后来一段时间我用这个 ChatGPT Codecs, 就它的工作 Work 那个功能特别多 。 我感觉它确实能让我干很多以前干不了的事儿 。
嗯 。
所以那段时间我又会比较上头 。 但是你冷却一段时间之后, 你仔细想啊 , 你是不是每天都要那么高频的去手搓各种工具 , 这个频率确实会下来一些 。
对 。
就你对更复杂任务的需求确实会下来 。 嗯 。 我所以我觉得 , 嗯 , 这是一个可能在蒸馏之外的很多人现在已经在想的问题吧 。
是 。 那我们今天其实讨论了非常多关于蒸馏的这个话题 , 蒸馏的历史 , 它可能不是一个非黑即白的一个概念 。
嗯 。
对吧 ? 然后包括我们自己为什么不蒸馏 , 蒸馏的代价是什么 ?
我们自己 。
哈哈哈 。
嗯 ,OK。
对 。 不是我们自己哈 , 就是说错了 。 对 。
没事 , 你挺有节目效果 。
所以我相信大家对于蒸馏会有一个初步的印象和认知吧 。 嗯 。
对 , 那今天节目就到这里 。 最后补充一点就是 ,因为我们收集的很多关于蒸馏的信息 , 我们并不是直接做这件事情的从业者 。
是 。
所以这个文章 , 包括这个播客 , 我觉得也是更多一个抛砖引玉的作用 。 希望大家在评论区 ,在留言区能分享更多你知道的关于蒸馏的一些方法 , 或者一些你的观察 , 或者你对这件事情的态度 。
我们也可以收集更多信息之后, 给出一个更完整的 2.0 版本 。 那感谢大家今天的收听 。 拜拜 。
好 , 拜拜 。
本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。
下期再见
。




