# 115: 华为发布超节点，如何搅动AI算力市场？与魔形智能徐凌杰聊芯片层新变化

晚点聊 LateTalk · 2025-05-11

<https://latetalk.podhood.com/f8834549-027f-4ada-8448-ca91622e5361>

本期《晚点聊》邀请魔形智能CEO徐凌杰（曾任英伟达、AMD、三星GPU架构师，壁仞科技联合创始人）解读华为CloudMatrix 384超节点，核心观点是：它本质是12个机柜、384张昇腾910组成的'横向扩展'（Scale out）集群，而非英伟达NVL72那种单机柜'纵向扩展'（Scale up），以数量换总算力——集群总算力300P，比NVL72提升67%，内存容量三倍以上、带宽两倍以上，但功耗约为后者四倍。徐凌杰认为，华为在成为英伟达之前已是'Mellanox'，网络与交换积累是其能做多卡互联的原因；但国内厂商普遍缺乏NVSwitch类产品，超节点趋势短期不冲击英伟达，压力主要给到其他国产AI芯片商。他还拆解了AI算力结构：GPU之外互联、交换机、光模块同样关键，芯片成本已从晶圆主导变为显存主导，HBM占五到六成；并透露魔形智能在H20上优化DeepSeek满血版已实现API业务盈利。英伟达已为可能被禁的H20计提55亿美元损失，不排除通过恢复被屏蔽计算单元'变废为宝'；华为在阿里发布Qwen3当天即宣布开箱即用支持。他判断英伟达最大威胁是客户集中（Google TPU、Amazon自研芯片），其已成立'半定制'部门防御；下一代算力变量或来自存算一体、类脑计算（脉冲神经网络）以及电力与散热等可持续发展约束。

## Questions this episode answers

### 华为 CloudMatrix 384 是什么？它和英伟达 NVL72 相比有哪些不同？

徐凌杰介绍，华为 CloudMatrix 384 由12个机柜组成，每个机柜4台8卡服务器，共384颗AI芯片，总算力达到300个P，比英伟达NVL72整体提升67%，互联和内存总带宽翻番。他还认为，华为这套更像Scale out横向扩展集群，而NVL72是把72颗芯片放进一个机柜做全互联，是Scale up纵向扩展。

[3:26](https://latetalk.podhood.com/f8834549-027f-4ada-8448-ca91622e5361?t=206000)

### H20 被禁/计提损失对英伟达造成了什么实质影响？

徐凌杰说，这已对英伟达造成实质影响，股价已有反映，英伟达计提了55亿美金。H20与H100、H800、H200总体是同一颗芯片，通过不同切割形成不同配置；如果部分被屏蔽的计算单元能恢复，也可能以合适性价比卖给海外客户，但这和中国客户关系不大。

[48:01](https://latetalk.podhood.com/f8834549-027f-4ada-8448-ca91622e5361?t=2881000)

### 为什么 Google TPU 没有撼动英伟达的地位？

徐凌杰认为，谷歌TPU没有撼动英伟达，是因为云厂商自研芯片有成本、供应链安全和议价考量，但定位上并不对外销售，没有做好成为独立芯片公司的准备。谷歌TPU最早与TensorFlow绑定，内部解决了一部分供应和成本问题；作为云厂商还要满足客户偏好，OpenAI就想用英伟达芯片，所以仍要采购英伟达。

[1:03:03](https://latetalk.podhood.com/f8834549-027f-4ada-8448-ca91622e5361?t=3783000)

## Key moments

- **[0:00] 开场**
- **[3:26] 华为超节点**
  - [3:40] 华为CloudMatrix 384：12个机柜、384颗昇腾910组成，总算力300P，整体算力比NVL72高67%，单芯片约780TFLOPS、128GB HBM
  - [5:42] 徐凌杰：“华为的这套系统或许还不能够称之为是真正意义上的一个超节点”
  - [6:21] Q: Scale up（纵向扩展）和Scale out（横向扩展）有什么区别？
- **[8:33] 算力结构**
  - [9:03] 徐凌杰：AI算力不止GPU，还包含互联、交换、冷却等系统；NVIDIA 2019—2020年收购Mellanox，是从GPU公司变成数据中心公司的起点
  - [12:03] 徐凌杰：DeepSeek 671B模型仅参数就要约千GB显存，一台8卡H100服务器只有640GB，所以必须把多台服务器互联——这是驱动超节点的核心需求
  - [18:45] 徐凌杰划分狭义与广义AI Infra：广义是从芯片之上到应用之下所有环节，超节点这类服务器集群优化属于偏硬件的技术空白
  - [20:38] 徐凌杰：同时掌握计算芯片与互联芯片能力的企业极少，英伟达是少数之一，第三方集群优化公司与其是互补而非竞争关系
- **[22:51] 评判指标**
  - [22:51] 徐凌杰：评价超节点要看场景——训练追求稳定性和算力规模，推理看重单位token的TCO成本，两者指标不同
  - [24:07] 徐凌杰讲Meta训练LLaMA 3实测：15000张H100集群两个月内发生数百次故障，平均两三小时一次，超节点越大稳定性要求越高
  - [25:30] 徐凌杰：魔形智能在H20集群上优化DeepSeek满血版已实现API业务盈利，具体优化效果每日有进步，与DeepSeek的H800路径不同
  - [27:43] 徐凌杰：适配不同尺寸MoE模型（如Qwen3 235B、DeepSeek 671B）的方法论一致——把专家打散到各卡、高并发激活，只调整算子和参数
- **[29:08] 训推一体**
  - [29:08] Q: 黄仁勋力推训推一体的B200/NVL72，实际业界训练和推理会用同一块GPU吗？
- **[31:49] 超节点趋势**
  - [32:13] 徐凌杰：谷歌最早做超节点式Pod集群——TPU V2为256卡，V3增至1024卡，V4达4000卡并配备光路交换OCS
  - [34:16] 徐凌杰：更大的模型和上下文需要更大系统；显存成本在H100占40—50%，到B200已升至50—60%，显存成芯片主要成本
  - [35:26] Q: HBM（高带宽显存）的全球主要供应商是谁？中国有公司吗？
  - [36:10] 徐凌杰：华为CloudMatrix 384以3倍内存容量、2倍内存带宽追平NVL72，功耗约为4倍，但中国电费便宜，以总量换性能是可行路径
- **[38:11] 华为互联积累**
  - [38:28] 徐凌杰：“NVIDIA可能并不可怕，华为会更可怕了”——若其他国产芯片厂商没有超节点能力就会落后
  - [39:43] 徐凌杰：华为做超节点依赖过去网络与交换积累，'华为在成为NVIDIA之前已经是一个Mellanox'，其他厂商缺NVSwitch式能力
  - [43:05] 徐凌杰：NVLink/NVSwitch是英伟达CUDA之外第二大生态，难点在高速SerDes IP与先进制程，国内厂商两三年内难以出现同类产品
- **[45:44] 市场冲击**
  - [45:57] 徐凌杰：华为CloudMatrix 384短期不冲击英伟达（英伟达是供给问题而非需求问题），主要压力给到其他国产AI芯片厂商
  - [47:51] 徐凌杰：英伟达因H20受限计提55亿美元损失；H20与H200同芯片，可能通过恢复被屏蔽的计算单元'变废为宝'但需破解加密
- **[51:19] 模型生态**
  - [51:19] 徐凌杰：华为在Qwen3发布当天宣布支持属正常，跑通模型不难；真正的竞争是把同架构模型跑出高吞吐、低成本和高质量
  - [53:04] 徐凌杰：国产芯片若不原生支持FP8，用FP16回退或Int8量化会增带宽/损精度，这可能让同样叫DeepSeek的模型回答质量不同
- **[56:27] 英伟达护城河**
  - [56:27] 徐凌杰：英伟达未来两三年地位难被削弱——有台积电、海力士等全球供应链和CUDA+NVLink生态，AMD被迫花49亿美元买ZT Systems补超节点能力
  - [1:00:03] 徐凌杰：英伟达最大威胁是客户集中——Amazon、Google、Microsoft都在自研芯片且有Broadcom支持，中国市场占比高也是政策风险
  - [1:01:55] Q: 谷歌TPU做了这么多年，为什么没能撼动英伟达的地位？
  - [1:04:23] 徐凌杰：英伟达已成立「半定制」部门（semi-custom design），像博通一样向大客户兜售IP，以阻止他们完全自研芯片
- **[1:06:17] 创业往事**
  - [1:06:20] 徐凌杰讲职业经历：2010年底从英伟达转投AMD，是为了跟随首席架构师Mike Menton学习新一代CU架构，跟了约一年半到两年
  - [1:08:42] 徐凌杰回忆2010年代初英伟达：2013年股价约20美元（未拆股），黄仁勋曾将股权抵押给高盛和富国银行，无人预见今日之地位
  - [1:10:00] 徐凌杰回忆2008年金融危机：入职英伟达三周即遇史上第二次裁员5%和全员降薪10%，黄仁勋只拿1美元年薪并带领大家走出危机
  - [1:12:13] 徐凌杰谈2024年再创业：看到NVL72与DeepSeek-V2验证'更大问题需更大系统'，从壁仞出来后创立魔形智能做集群优化
  - [1:13:54] 徐凌杰预测：如果未来广泛采用NVSwitch式Scale up，推理场景对光模块/光纤的需求可能减少，散热与冷却仍是机会
  - [1:17:08] 徐凌杰谈英伟达收购Lepton.ai：可能与今年GTC发布的推理框架Dynamo相关，杨青或参与其中，强化AI serving能力
- **[1:19:48] 未来计算**
  - [1:20:27] 徐凌杰展望：人类可持续发展是英伟达最大软肋，存算一体、类脑脉冲神经网络等新计算范式值得投入，可能带来颠覆
  - [1:21:51] 晚点主持人：超节点是在机柜和数据中心层面延续摩尔定律的唯一可能性，需配合高压直流供电与液冷散热
  - [1:24:02] 曼祺提到乐坤（LeCun）在GTC对话中说80年代贝尔实验室就有人做神经网络模拟硬件，他不太看好这一方向

## Speakers

- **徐凌杰** (guest)

## Topics

AI模型团队动态

## Mentioned

AMD (company), 三星 (company), 华为 (company), 壁仞科技 (company), 英伟达 (company), 谷歌 (company), 阿里云 (company), 魔形智能 (company), CloudMatrix (product), DeepSeek (product), H20 (product), H800 (product), NVL72 (product), NVLink (product), NVSwitch (product)

## Transcript

### 开场

**Host** [0:05]
欢迎收听 《 晚点聊 》， 我是曼祺 。AI 算力现在是中美都最关注的 AI 底层竞争力 。 约 1 个月前 ， 华为推出了由 384 块升腾 910 互联而成的超节点 AI 集群 CloudMatrix 384。

华为超节点发布后不久 ， 我邀请有 20 多年芯片从业经验的徐凌杰 ， 来一起聊聊这项算力底层的新变化 。

自 2000 年代中期 ， 徐凌杰先后在英伟达 、AMD 和三星参与设计 GPU 架构 ， 后来他加入阿里云 ， 领导了 GPU 云计算基础设施的搭建 。

2019 年， 他与张文等人联合创立国产 GPU 公司壁仞科技 。 2024 年， 他开始新创业 ， 成立魔形智能 ， 专注算力集群产品设计和优化 。

超节点本身就是一种从拼单芯片性能到优化整个节点和机架的算力思路变化 。 徐凌杰的从业经验正好匹配了这一趋势 。

本期节目的第一部分 ， 我们聊了华为 CloudMatrix 384 是什么 ， 它和英伟达 2024 年重磅推出的集群方案 NVL72 的异同 。

不只英伟达 ， 华为把节点做得越来越大 ， 从集群芯片数量要性能 、 以网络能力来弥补计算和存储的瓶颈 ， 已经成为算力市场的一个共识性趋势 。

在第二部分 ， 我们主要讨论了超节点的趋势对英伟达 、 对华为之外的其他国产芯片厂商 、 对整个 AI 算力市场的可能影响 ， 和一个经典的问题 ： 下一个改变算力格局的变量可能是什么 ？

节目录制后不久 ， 华为超节点开始出货 。 据 《 金融时报 》 报道 ， 一套完整的 CloudMatrix 384 的售价约为 800 万美元 ，是售价约 300 万美元的 NVL72 的两倍多 。

但要注意 ， 这并不是华为的官方价格信息 。 5 月 7 日， 华为盘古大模型团队又在预印本平台 Arxiv 上发表了一篇论文 ， 称在 6000 多块升腾芯片组成的超大集群上， 实现了 7180 亿参数的 MoE 模型的长期稳定训练 。

这篇论文的地址我贴到了 show notes 的相关链接部分 ， 节目中涉及的一些术语在 show notes 附录部分有介绍 。 下面我们就正式进入本期节目吧 。

4 月 10 日， 华为云发布了一项重要的 AI 算力新成果 ， 就是 CloudMatrix 384 超节点技术 。 简单说 ， 它是可以让 384 张升腾 AI 处理器互联形成一个大的机架的方案 。

今天 《 晚点聊 》 很高兴地邀请到了资深芯片行业和计算机行业的从业者徐凌杰 ， 来与我们一起聊聊这项对 AI 发展至关重要的底座型的技术 。

徐老师 ， 您可以和我们的听友先打个招呼 ， 简单自我介绍一下 。

**徐凌杰** [2:41]
好的 ， 曼祺 。 各位 《 晚点 》 的听众大家好 ， 我是徐凌杰 ， 大家可以叫我凌杰 。 我是一名芯片和云计算的一个老兵了 ， 之前在北美的英伟达 、AMD、 三星都做过 GPU 的芯片架构的设计 。

之后在阿里云的 GPU 的起步的时候 ， 负责过阿里云的 AI 的云基础设施 。 19 年底到 20 年初 ， 我联合创办了一家 AI 芯片公司壁仞科技 。

到去年 2024 年， 我新创立了一家新的公司 ， 叫魔形智能 ，Magic Compute， 专注于服务器集群和算力优化方面的工作 。

**Host** [3:15]
好 ，因为您有 20 多年的从业经验 ， 所以这次我们也是会从华为的这个新进展聊起 ， 后面我们可能会延展到一些整个 AI 计算的发展 ， 还有优化的趋势 。

### 华为超节点

**Host** [3:26]
我们可以先从 CloudMatrix 384 开始 。 徐老师 ， 你可以和我们的听友解释一下 CloudMatrix 384 超节点 ， 它大概是一个什么东西 ？

我觉得可能不是所有人都注意到了这个发布 ，但实际上它对行业是非常重要的 。

**徐凌杰** [3:40]
好的 ， 没问题 。 华为的 CloudMatrix 384， 我认为可以叫是高密度的横向扩展的一个算力集群 。 算力方面的话 ，其实有 12 个机柜组成 ， 每个机柜有 4 台 8 卡的服务器 ，8 乘以 4 再乘以 12， 就是我们所说的 384 颗 AI 芯片 。

这个机柜分成左边跟右边两个部分 ， 各有 6 个机柜 。 中间的话有网络交换机 ，以及 6912 个 400G 的光模块 。

顶部我们看到标识的话 ，有 3168 根光纤 ， 把整个系统进行了互联 。 从定位上来讲 ，384 集群和现在全世界最强的 、 最主流的英伟达的 NVL72 进行了对标 。

节点的总算力的话 ， 它整体达到了 300 个 P 的这么一个算力 ， 比 NVIDIA 的 NVL72 整体还提升了 67%。 在网络互联和内存总带宽方面的话 ， 对比 NVL72 也实现了翻番 。

我们刚刚讲到这个集群 ， 从芯片方面来讲的话 ， 如果说我们从集群我们拿到的这个数据进行倒推的来讲的话 ， 基本上我们可以得到单颗芯片的 16 位的浮点算力 ，也就是说是我们叫 FP16 或者说叫 BF16 来看的话 ， 大约是在 780 个 T 的这个 Flops 左右的样子 。

HBM 的容量的话 ， 应该是在 128 个 GB。 单颗封装的芯片的话 ， 应该会有 8 个 400G 小 B 的互联的一个出口 。 从静态的指标来看的话 ， 基本上达到了 NVIDIA 上一代旗舰芯片 H200 芯片的这么一个八成左右的这么一个性能 。

曼祺用了一个很有意思 ，也是最近比较火 、 比较出圈的一个名词 ， 叫超节点 。 我想 384 集群的这么一个出现的话 ，是继 NVL72 之后， 进一步点燃了我们业内 ， 包括这个媒体圈对于超节点这个概念的讨论 。

确实 ， 华为在重重的困难之下 ，在芯片上能够持续突破 ，在集群上用数量换了这个算力的总量 ，在新的这个产业和国际形势当中， 给中国趟出了一条新的路 ， 非常值得点赞 。

但在这里我也想小小抛一个暴论 ， 华为的这套系统或许还不能够称之为是真正意义上的一个超节点 。

我们如果说把超节点分为所谓的叫横向扩展或者叫纵向扩展 ，Scale out 和 Scale up 来讲的话 ， 华为的更像是一个横向扩展的集群 。

NVL72 的话 ， 更多的是一个 Scale up 的一个纵向扩展的集群 。

**Host** [6:04]
这个可以给大家解释一下， 就是横向扩展 、 纵向扩展是什么 ，以及我觉得也可以把 NVL72 也稍微介绍一下 。

因为这个其实是 2024 年在 GTC 上黄仁勋做一个非常重磅的事情推出来的 ，但因为它也比较底层 ， 所以我觉得可能也不是所有人都非常了解 。

**徐凌杰** [6:21]
好的 ， 我首先介绍一下这个 Scale up 和 Scale out 的这么一个区别 。 Scale up 从字面上来讲的话 ， 就是叫纵向的一个扩展 。

从定义上来讲的话 ， 它是通过增强单个服务器 、 单个硬件的这个能力 ， 来提升整体的集群的能力 。

Scale out 的话 ，是通过增加集群中的这个服务器的数量 ， 让更多的这个机器能够来共同分担任务 ，也就是说类似于让更多的机器一起来干活 。

如果说我们举个例子来讲的话 ， 就好比大家喜欢喝饮料 ， 今天如果说有咖啡店也好 ， 奶茶店也好 ， 我们今天有一个小功率的搅拌机 ， 客人多了之后的话 ， 如果发现机器不够用 ， 我今天把这个小功率的搅拌机变成了一个功率更大的搅拌机 ， 马力更大 ， 容量更大 ， 一下子能够处理更多杯的这么一个饮料来讲的话 ， 这个就类似于像

Scale up，也就是说我单个机器的这个能力增强了 。 Scale out 来讲的话 ， 我可能就是任务多了之后， 我再多买了几台同样的搅拌机 ， 这个饮料机 ， 这样的话也能够满足客户的需求 。

我想这是两种不一样的一个扩展 。 从去年 GTC 的时候 ，其实 NVIDIA 重磅发布了 NVL72。 NVL72 从字面上来讲的话 ，其实就是 72 颗芯片在一个数据中心的服务器的柜子里面 ， 实现了完全的全互联 。

这个其实也是业界非常重要的里程碑式的一个方向 ，也就是说这个计算的范式从原来的一颗芯片到了一台服务器 ， 又到了一整个机柜的这么一个扩展 。

刚刚其实也讲到了华为的机器的话 ， 更多的是 Scale out。 我们看到一边有 6 个机柜 ， 总共有 12 个机柜 。

NVIDIA 的 NVL72 的话 ， 一个柜子是把所有的这个 72 个晶片全部囊括在了一起 ，而且实现了点对点的一个全互联 。

**Host** [8:02]
所以简单来说的话 ， 就是 Scale up， 它就是单个服务器里的这些卡是全部相互互联的 。 然后华为说的超节点 ， 对 ， 华为这个超节点这不是我说的 ， 就是它发布的时候它自己就是这么说的 。

就他们这个超节点还是分了 12 个不同的机柜 。

**徐凌杰** [8:17]
12 个柜子 ， 对 ， 它一个柜子里面我看到图片上来讲的话 ，是有 4 台服务器 ， 一个柜子里面有 4 台服务器 。

当然 NVIDIA 的这个 NVL72 也是类似的 ，在一个柜子里面有 18 台服务器 ， 然后也是通过交换网络能够形成高速的 72 卡之间的全互联 。

**Host** [8:33]
对 ， 我觉得这里也可以讲讲就更全的这个 AI 算力的结构 。 因为刚才我们其实讲到了很多概念 ， 或者说一些术语 ， 就包括服务器 、 机柜 、 单颗的芯片等等。

### 算力结构

**Host** [8:43]
就实际上在整个 AI 算力的物理结构上， 它从底层大概是怎么构成的 。 因为大家听得最多的就是 GPU，但整个系统肯定它不光是 GPU 这一个核心模块构成的 。

您刚才也提到包括中间可能有什么互联的光纤 ， 然后中间还有交换机等等 ， 可以把这个大的图景讲一讲 。

**徐凌杰** [9:03]
GPU 或者说 AI 芯片 ， 确实是这个系统中最重要的 ，也是最贵的这么一个组成部分 。 如果说我们今天要把一个 AI 的算力基础层要能够搭建好 ， 甚至说用好来讲的话 ，其实还是要关注更多的其他元素 。

特别是说今天我们要解决的问题变得更大的情况下的话 ， 已经不是一个 GPU 或者说一台服务器的问题了 。

我们讲这个所谓的叫 Data Center as a Computer， 或者说 Data Center as a GPU 的这么个方式来思考问题 ， 来解决问题 。 随着系统的变大来讲的话 ， 这里面无论是曼祺刚刚讲到的交换 、 互联 ， 甚至于说未来来讲的话 ， 冷却 、 散热 ， 这里面都会是非常重要的问题 。

从硬件系统来讲 ， 我举个例子 ， 互联就会变得越来越重要 。 如果是说我们看系统来讲的话 ， 把 72 个芯片做一个简单的一个堆叠 ，也就是说普通的服务器用通过网卡去连 ， 比起 72 个芯片全部连在一起的话 ， 这个效果其实是差得蛮多的 。

随着 NVIDIA 的这个 GPU 一起演进的话 ， 更重要的是它的这个 NVLink 还有 NVSwitch 的这么一个互联和交换能力 。 我想这个其实也是一个综合能力的体现 ，也是一个长期主义的一个结果 。

NVIDIA 其实是我记得没错的话 ， 应该是在 2019 年、2020 年的时候收购了这个迈洛斯 Mellanox，也把互联和交换的能力收入囊中 。

这也是 NVIDIA 正式从一个 GPU 的公司变成一个数据中心的公司的一个起点 。 这是我们今天看到的 ， 这是一个综合能力的体现 。

**Host** [10:29]
但您当时在英伟达工作的时候 ， 当时有做这方面的储备吗 ？ 那是哪几年 ？

**徐凌杰** [10:34]
我在 NVIDIA 的时候是非常久远了 。在金融危机之前 ，2008 年的时候我就在 NVIDIA 了 。 那时候 NVIDIA 整体的业务来讲的话 ， 主要还是在 PC 层面 ，在显卡层面 。

我们那时候作为架构设计的团队的话 ，也会涉及到这个叫高性能计算以及 CUDA 相关的一些业务 。 但那个时候来讲的话 ，NVIDIA 还是这个行业里面的 globally， 跟今天的这个情况是完全不能相比的 。

**Host** [10:57]
对 ， 它股价包括它整个业绩的起飞 ， 可能是在 2014、15 年之后会比较明显 。 因为在 2008 年其实连深度学习都还没有怎么兴起 ， 确实还是很早的一个时候 。

**徐凌杰** [11:08]
是的 ，是的 。

**Host** [11:10]
所以它的这个 NVLink、NVSwitch 这些技术 ， 就是它后面慢慢积累的 ，但是它可能也比行业里其他人会积累得早一些 。

就是它是用这些东西把芯片给连起来 ， 对吧 ？

**徐凌杰** [11:19]
是的 ， 如果我记得没错的话 ， 应该是在 2017 年的这个 V100 的那一代 ，NVIDIA 就有了 NVLink。 那时候的 NVLink 还是会比较简单的 ，也没有实现这个全互联 。

在往后来讲的话 ， 通过把这个迈洛斯 ， 就是 Mellanox 给收购了之后的话 ，NVIDIA 极大增强了它的这个通信和交互能力 。

包括在通信的这个能力之上的话 ，NVSwitch 里面也结合了这个叫在线计算 ，也就是说在一边传输的时候 ， 一边能够计算的这么一个能力 ， 大大提升了它的一个集群化的通信效率以及这个计算效率 。

**Host** [11:52]
因为你也提到之前是用网卡来连的 ， 就是它这个连的方式 ， 它从网卡就是要向 NVLink、NVSwitch 这种技术转变 ， 这是为了满足上层的什么对计算的需求 ？

**徐凌杰** [12:03]
从 NVIDIA 的这个架构改变来讲的话 ， 我们认为最主要的这么一个驱动就是模型的大小 。 模型变得越来越大 ， 模型变得越来越大之后 ，其实第一个效果来看的话 ，也就是我们需要更多的显存来存这些参数 。

比如说我们讲的最近最火的这个 DeepSeek， 对吧 ？ DeepSeek 要 671 个 B，671 B，671 B 按照华为来算的话 ， 就是 671 G 的显存 。

再加上它的 KV Cache 也好 ， 加上它的其他的基本的一些运算必要的占用的这个显存 ， 往往要达到 1000 个 G 大 B 的显存那个占用 。

我们看到单台服务器或者单个芯片来讲就不够了 。 比如说以主流的这个 H100 来讲的话 ， 它单个芯片是 80G 的这么一个显存 。

一台服务器 ， 我们看到今天标准的这个服务器来讲 ， 往往是 8 卡服务器 ，8×80 来讲的话 ，也就是 640G。

也就是说 DeepSeek 最简单的要把这些参数要能够存起来的话 ， 就需要至少两台服务器 。 要再把它更高效的能够去跑起来来讲的话 ， 往往就需要这个更多的服务器把它连在一起 。

看到了这个模型变大的趋势 ， 看到了这个上下文变大的趋势 ， 包括这个 KV Cache 也占用很大空间的这么一个情况下的 ， 我想 NVIDIA 作为全球主流的一个芯片公司来讲 ， 往更大的这么一个集群化的方向发展的话 ， 是一个非常自然的一件事情 。

**Host** [13:20]
对 ， 我顺便提一下， 就是我们之前的有期节目里是讲过注意力机制 ， 线性注意力和非线性注意力 ， 那里面也都讲到了 KV 缓存 ， 就是随着上下文变大 ， 它变得越来越大的这个需求 。

当时我们是和做算法的人聊的 ，也提到说未来如果这个模型变得上下文越来越长的话 ， 可能最终按照现在 Transformer 这个结构 ，KV 缓存还是会爆掉 。

这个大家也可以去听听那一期 ， 我觉得有一个互文 。 然后再说回来就说到这个芯片的价格 ， 刚刚说的是 GPU 和 GPU 之间的互联 。

然后现在我觉得行业里也经常提到一个词 ， 就是总线 。 比如说华为这一次去发这个 CloudMatrix 384， 它的官方描述里就是说这些卡是通过新型高速互联总线连接的 。

就是可以讲讲总线是什么吗 ？ 比如说总线和 NVLink 和 NVSwitch， 就这些被视为是英伟达生态优势之一的技术 ， 它是什么关系 ？

**徐凌杰** [14:14]
其实我觉得我们可以不拘泥于这个名词 。 比如说我们讲 AI 芯片 ， 讲 GPU， 讲 GPGPU 或者讲 NPU， 今天我们所有的这些名词指向的都是同一个市场 ， 解决的是同一个问题 。

无论是它叫总线也好 ， 还是叫一个高速互联协议也好 ，其实就是要解决这个芯片之间互相之间通信能够协同工作的一些问题 。

我们以 NVIDIA 的这个 NVLink 为例来讲的话 ，其实更重要的是它的这个伙伴叫 NVSwitch，也就是说 NVSwitch 的话是把这个 NVLink 连在一起 。

它是一个点对点的高速互联的一个协议 ，NVLink 采用类似于网状的一个结构 ， 把多个设备连在了一起 ， 提升这个传输效率以及这个可扩展性 。

通过支持多个 NVLink 的这么一个连接 ，以及包括结合大规模交换的这个 NVSwitch 的技术的话 ， 可以构建多颗 ， 甚至于说上百颗 。

我们看到最近的这个 GTC 的话 ，也发布了这个路标 ， 未来的话至少会有 144 颗这个 GPU 能够互联起来 ，而且是全互联在一起 。

这样更快的这个通信速度的话 ， 能够让 GPU 在并行计算的同时能够更快的做同步 ， 包括做更快的这个数据共享以及这个交换 ， 提升整体的计算的一个性能 。

我想就是无论叫什么名字 ， 目标的话我们先把它搞清楚 。

**Host** [15:28]
像总线和高速互联协议 ， 这个是不是已经涉及到算力层的软件的东西了 ？ 它不完全是一个硬件的吧 ？

因为 GPU 它肯定是一个硬件的东西 。

**徐凌杰** [15:38]
我们讲这个计算和这个互联 ， 它其实两者在现在这个环境里面是越来越分不开了 。 也就是说我们的计算是需要和其他的芯片能够形成非常好的一个通信 。

计算和网络之间的话 ， 我想一个是速度的问题 ， 另外一个就是一个协议的问题 。 刚刚其实也讲到了 ， 包括像 NVIDIA， 包括我认为在华为的这套系统里面未来也会有 。

也就是说很多计算不会是光在这个 GPU 本身 ， 可能也会是在交换芯片上 。 什么意思 ？ 也就是说我很多的计算结果会分布在不同的 GPU 芯片或者叫 AI 芯片之上 。

要把这些结果给聚合来讲的话 ， 如果说是简单的做聚合 ， 还要到某个芯片或者某一些芯片里面去做计算 ， 层层的做一些累加 ， 这样的效率就会比较低 。

如果说我们能够在一个中心节点 ，也就是说这个交换芯片上能够做在线计算 ， 所谓的英文叫 Online Computing 的这么一个情况来讲的话 ， 能够把我们的整个计算给简化 。

从这个维度来讲 ， 计算和互联在这一块来讲其实是一个非常有效的连接 。

**Host** [16:37]
这种交换芯片它是一个新的类型的芯片吗 ？

**徐凌杰** [16:40]
如果说我们要把它做一个类比来讲的话 ， 它类似于像网络交换机的这么一个芯片 。 我们知道在数据中心里面有个服务器 ， 服务器通过网卡再通过交换机进行交换 。在数据中心里面的话 ， 往往我们看到的是以以太网为主的 。在 NVSwitch 这个芯片里面的话 ， 往往是一个内存语义的这么一个交换 ， 它的方式可能会不太一样 ，但芯片更多的像是一个交换芯片 。

**Host** [17:02]
我有一个挺好奇的问题 ， 就是您当年做壁仞的时候 ，其实那一波还有很多新的芯片公司 ， 就有一些它是做 CPU 的 ，也是说要用在 AI 数据中心里的 CPU， 还有一类是 DPU。

就 DPU 有一段时间也特别火 ， 我印象中 DPU 就是为了去取代之前的传统的网卡 ， 然后提供一种就是更高的这种互联的功能 。

就这些东西它现在在目前的结构里实际上它是用到了吗 ？

**徐凌杰** [17:29]
曼祺 ， 您问的非常有意思的一个问题 。 关于这个 DPU， 我之前的一份工作其实跟它还是蛮有渊源的 。在 2020 年年底的时候 ，NVIDIA 完成了对迈洛斯 Mellanox 的收购之后 ，其实我也积极的在布局要去把这个计算和这个通信要能够连在一起 。

那个时候在 2021 年的年初 ，在第一轮投资了一家做 DPU 的公司叫云迈星联 。 这家公司今天应该也是有了我们叫 RDMA 网卡的这个产品 ， 现在也在市场上销售 。

我想今天其实我们看到这个互联的需求会变得越来越高 。 这一类公司从 DPU 转型到叫 RDMA 网卡的这个过程当中的话 ， 我想也是有非常大的一个机会的 。

**Host** [18:06]
您是个人投资的是吗 ？ 第一轮 。

**徐凌杰** [18:08]
不是我个人投资 ，是公司投资的 。

**Host** [18:10]
是不是当时壁仞投资的 ？ 我想起来了 。

**徐凌杰** [18:12]
对 ，是我推动壁仞投资的 。 这个投资本来是一个战略投资 ， 后面可能变成了一个财务投资 ，也是在公司历史上蛮成功的一个退出 ， 后面还赚了钱 。

**Host** [18:22]
OK， 壁仞作为一个初创公司 ， 它已经投资赚钱了 。 你们这个眼光可能比很多投资机构都好 。 我们说回来就是算力的这个结构 ，因为刚才说的可能是一些偏硬件的东西 ， 然后我知道就现在模型智能其实你们做的是在硬件更上一层的一个优化 ， 就是可以把软件的就更广义的 ， 包括芯片 ， 包括 AI Infra 的这些算力的结构可以再延展讲一讲 。

**徐凌杰** [18:45]
今天其实我们在市场上看到有蛮多的公司在做 AI 的 Infra， 所谓的叫 AI 的基础设施 。 我们可以把 AI 的 Infra 这个工作把它分成狭义上的这个 AI Infra 或者广义上的 AI Infra。

狭义上来讲 ， 往往是指在软件层面对模型进行优化 ， 把它进行调优 ， 跑得更快 ， 成本能够打得更低 。

但我们认为广义上的这个 AI Infra 其实是更值得去重视的 。 从这个范围来讲 ， 可能是说从这个芯片之上到整个的这个应用之下， 所有的中间环节能够把这个应用在最原始的这个芯片上要能够把它跑好的话 ， 我想这里面都是这个 Infra 的环节 。

从服务器到机柜 ， 再到多个机柜组成的这么一个超节点 ，其实我们今天讲的这个话题 ， 我认为就是属于 AI Infra 里面偏硬件的这么一个环节 。

而这些领域往往还存在着大量的技术空白 。 比如说这个 NVIDIA 的 NVL72， 去年推出到今天落地来讲的话 ，其实都不是很顺利 。

因为这里面无论是互联 、 散热 、 冷却 ， 都有巨大的工程的要求 ，也有巨大的工程的空间 。 我想各位听众介绍一下这个模型智能在做什么 。

刚刚一开始介绍的时候 ， 我也讲到模型智能是专注于服务器集群和算力优化的这个工作 。 我们真的是有服务器集群 ， 这个硬件方面的工作在开展 ，也会有这个产品对客户去做销售 。

我想作为这个模型智能这家初创公司来讲的话 ， 我们的定位是一家软硬件相结合的一个 AI 的基础设施公司 。

也就是说我们既会有自己的高密度的超节点的产品和设计能力 ， 同时的话又有我们的软硬件相结合的系统的优化能力 。

这和我们团队的两位主要创始人的背景有关系 。 我自己更多的是芯片和服务器相关的背景 。 我的另外一位创业合作伙伴 ， 经称的话更多是软件和系统算法的这么一个背景 。

我们团队对于这两方面有很多之前有深入研究和实操经验的同事 ， 今天也在我们团队里面一起在共同成就这么一个事业 。

**Host** [20:38]
像这一部分就是和硬件结合的 AI Infra 的部分 ， 为什么芯片原厂它自己不做 ，其实他们自己也都在做 。 这个领域它对第三方的创业公司来说 ， 它的机会是什么 ？

**徐凌杰** [20:49]
这个芯片原厂我们其实要把它严格来定义一下 。 往往做 GPU 的公司可能不太理解做互联的 ， 做互联的公司往往又不太懂这个计算芯片怎么去做 。

我们今天看到这个 NVIDIA 可能是世界上为数不多的既懂这个计算芯片又懂互联芯片的这么一个公司 。 今天它在做 NVL72 落地来讲的话 ，也碰到了很大的困难 。

这个也是和我们这个时代的要求相关的 。 我们就举几个简单的例子 。 NVIDIA 的这个芯片来讲的话 ， 从过去的一台服务器 10 千瓦到一个柜子 NVL72 达到了 120 千瓦以上 。

然后在明年可能会推出 300 千瓦的柜子 ， 再到后面会推出 800 千瓦甚至上兆瓦的一个柜子 。 这么一个集成度 ， 包括它的冷却 、 散热 、 互联提出的要求是一个量变到质变 。

我想这里面有很多的这些技术能力 、 技术工作 ，是这个初创公司能够在里面去掌握这么一个先机 。 和这个芯片原厂并不是一个竞争关系 ，而是一个互补的一个关系 。

**Host** [21:45]
因为你也提到像英伟达这种公司 ， 它其实是少有的计算 、 互联 、 软件它都做得比较好的这样的公司 。

我觉得国内华为看起来也是在往这个方向发展 。 所以比如说像你们这样的第三方的来做 AI Infra 偏硬件的系统优化的公司 ， 你们主要的客户是其他的 AI 芯片公司吗 ？

比如说寒武纪 、 包括壁仞 、 摩尔线程是这些吗 ？

**徐凌杰** [22:09]
我们当然可以和芯片原厂进行合作 。 与此同时基于这个芯片来讲的话 ， 我想我们能够做一些非公版的一些设计 。

当然我们现在公司还是在比较早期的这个阶段 。 对于我们的这个商业模式的话 ， 后面我们等到有产品之后的话 ， 我们到时可以再交流 。

**Host** [22:23]
是不是可以透露一下就是说其实你们要自己设计芯片吗 ？

**徐凌杰** [22:25]
我们现在自己不做芯片 ， 我们在海外跟国内都有业务 。 首先也是会基于国外的芯片做一些比较不一样的一些设计 ， 然后把更多的芯片能够集成在一起 。

未来的话 ， 我们也希望能够跟这个国产芯片一起去合作 ， 去做这个大规模的集群 。

**Host** [22:39]
比如说用国外的芯片 ， 我觉得主流可能是英伟达的芯片 。其实你们是觉得你们可以做一些设计 ， 它在某些场景上可能比英伟达提供的那些标准化的方案是更有优势 。

**徐凌杰** [22:50]
公版设计要好 。

### 评判指标

**Host** [22:51]
是 。 OK， 我们来回到就是这个超节点 。 就是我们来看一个超节点或者说一个计算集群 ， 它到底好不好的时候 ， 你觉得哪些指标是比较重要的 ？

因为刚才其实最开始你介绍华为的这个 384 超节点的时候 ， 就说了很多指标 ， 包括它的总算力 、 容量 ， 还有互联的情况等等。

就如果拆解一下的话 ，是看哪些指标比较重要 ？

**徐凌杰** [23:13]
首先来讲就是从硬的指标 ， 我们会有比如说显存的带宽 ， 然后我们数据支持的格式精度 ， 然后从显存的这个容量 ， 包括我们今天的芯片的制程 ， 从它的功耗 、 从它的发热 、 从它的这个散热系统里面 。

我想这些都是客户可以考虑的一些问题 。 我们最终要来判断这个产品到底是不是好 ， 或者说适不适合这个客户 。

我想适合客户的需求会有非常密切的关系 。 就以我们每个人每天都会看到的这个车子为例 ， 不同的车其实是满足不同的需求的 。

有些人可能喜欢跑车 ， 对吧 ？ 它要最快的速度 、 最炫的外形 ， 实用性可能不是最主要的 。 最快的能够达到这个终点 ， 速度对它来讲很重要 。

对于另外一类客户来讲的话 ， 比如说它注重的是性价比 、 空间 、 性能 ，是不是有这个彩电 ，是不是有这个冰箱 。

我们今天来看这个不同的场景 ， 如果说先把它分成训练跟推理来讲的话 ，其实它是不同阶段的不同的需求 。

对于训练集群来讲 ， 我认为客户最主要的话 ，是希望能够在有稳定的这么一个预期之下， 能够达到它的这个训练的结果 。

也就是说追求的是稳定性 、 算力规模 ， 然后对于功耗和成本可能相对没有那么敏感 。 我们都知道去年这个 LLaMA 3 在 DeepSeek 当然出来之后的话 ，是 DeepSeek 最火了 。

去年可能还是 LLaMA 3 比较火的时候 ， 我们其实都看到这篇论文 。 这个 Facebook 有大的集群 ， 万卡集群 ， 如果没记错的话 ， 可能是大概 15000 张卡以上的这么一个 H100 集群 。

然后在它训练的这个过程当中， 大概两个月左右的时间出现了这个几百次的意外 。 也就是说每两三个小时都会有一次这个故障 。

对于这个故障来讲的话 ， 就要恢复 ， 要重新到 checkpoint 重新去 reload。 对于这个集群来讲的话 ， 越大的集群其实稳定性要求就变得越高 。

对于这个超节点来讲同样是这样的 。 对于这个推理集群来讲的话 ， 我想用户可能会更看重推理的服务的这么一个收益 。

也就是说它的 TCO（Total Cost of Ownership） 总体的运用成本是不是更好 。 因为训练对我们来讲往往是一个 CapEx，也就是说是一个资本性的投入 。

推理来讲的话 ， 往往是经营性的一个支出 OPEX。 我们看单位 token 的这么一个成本是不是能够达到最低 ， 这个可能是客户比较关心的一个点 。

当然我们知道这里面有机器的本身的这么一个成本 ，也有电力的成本 ，也有运维的成本 。 综合考量下来 ， 我想就能够得出一个答案 。

**Host** [25:30]
说到这个推理成本 ， 就是因为前段时间 DeepSeek 它不是搞了一个开源周 ， 开源了 Infra 的一些框架工具 ， 然后最后它有一个总结 ， 就是它自己总结自己推理优化的情况 ， 然后有一个 545% 的成本利润率 。

我不知道你们有没有去试 DeepSeek V3 和 R1， 就是在你们的优化下它能跑到什么程度 ， 然后对比 DeepSeek 自己对这个事情的优化 ， 它是一个什么情况 ？

**徐凌杰** [25:55]
这个 DeepSeek 的话确实有非常强的这么一个优化能力 。 你刚刚也问到了一个非常有意思的问题 ， 就是我们到底现在能优化多少 。

和 DeepSeek 不一样的是 ， 我们今天是在 H20 的机器上进行优化 ，而不是 H800。 H20 有着不一样的算力和通信比 ，因此需要不一样的优化策略 。

今天的话 ， 我们已经能够在 H20 的机器上针对 DeepSeek 满血版达到了一个非常不错的效果 ， 实现了 API 业务的这么一个盈利 。

未来我们也希望能够有更多的合作伙伴能够跟我们一起来合作 ， 一起能够在这么一个新城大海上一起能够赚到钱 。

怎么样能够实现盈利呢 ？ DeepSeek 用那么大的一个集群 ， 我们看到今天它其实用一个大规模分布式的所谓的叫专家并行的大规模专家并行的这套系统 ， 用几百张卡来去跑 Decode 的部分 ， 让它能够达到最好的效率 。

这个确实我们今天看到的非常明确的一个产业的一个趋势 。 无论是最近发布的 LLaMA， 还是说今天我们在录节目的当天早上发布的这个千问 ，其实都在往这个方向在发展 。

也就是说是一个大型的模型 ， 然后有很多小的众多的专家 。 同时在这个专家激活来讲的话 ， 又不是一次性都激活 ， 每次都只激活一小部分 。

如果说你只是将将的把它跑起来 ， 集群的利用率就会比较低 。 你把它的专家给打散 ， 每张卡上只放若干个专家 ， 再通过非常高的并发的这个方式 ， 能够把整个集群的利用率能够打上去 。

我想这是 DeepSeek 能够达到非常好的利用率 ，也能够达到非常好的利润率的一个源泉 。 他们也是在今年 2 月份的时候 ，也把他们的 secret source 一些秘密也公之于众 。

我想今天很多的创业团队 ， 包括互联网大厂 ， 都是在模仿 DeepSeek， 希望能够用他们的经验在这个系统上能够达到更好的效果 。

我可以透露的是 ， 我们今天也是在几十台的数百张的这个 H20 上面在调试这么一个结果 ， 这个结果每天都有进步 。

**Host** [27:43]
我想问一个技术上的问题 ， 就是模型它在推理 ，也就是在使用的时候 ， 对你们这种第三方的公司来说 ， 比如说做一些推理优化的工作 ，因为其实每个模型的尺寸不一样 。

以坤三和 DeepSeek 为例 ， 对吧 ？ 比如说坤三目前开源的这个旗舰版本 ， 它是 235B， 然后激活参数是 22B。 然后像 DeepSeek 的话 ， 它的总参数是 671B， 它的激活参数是 37B。

就它这些参数的不同 ， 会导致我每次去适配不同的模型的时候 ， 我想让这个效率如果非常极致的话 ， 我的推理其实是要改的吗 ？

还是说其实一个比较标准的方案就可以去把不同模型的推理优化都做得比较好 ？

**徐凌杰** [28:22]
其实在我看来的话 ， 方法论是非常类似的 。 我们刚刚讲从模型的结构来讲的话 ，是有众多的专家 ， 然后每次都是稀疏化的去做激活 。

方向上来讲就是把专家的话能够打散 ， 每张卡上只放若干个专家 ， 然后通过非常高的并发 ， 能够让每张卡都能够达到比较好的利用率 。

在这个方向上来讲的话 ， 算子可能会不一样 ， 包括它的专家的这个比例 ，以及这个专家的大小 ，以及其他的一些参数可能会不太一样 。

但方法论来讲是类似的 。 一般从这样一个设计来讲 ， 我们都会有理论上的一些推导 。 通过理论上一推导能够得到相对比较好的配置的一个起点 。

通过一些实验 ， 包括比较好的一些经验值来讲的话 ， 我想都是有机会能够在不同的模型 ，但是是同一个方向的这么一个模型上能够快速的调出一些比较好的结果 。

### 训推一体

**Host** [29:08]
对 ， 然后您刚才在说就是我们怎么看一个超节点或者计算集群的好坏标准的时候 ， 您是分训练和推理就分开来说的 。

然后我觉得现在行业里也有一个趋势 ， 至少英伟达在推动这个趋势吧 ， 就是它希望训练和推理是统一到相同的芯片和硬件上 。

比如说 B200， 黄仁勋就会说这是一个训推一体的芯片 。 我想知道就是这个实际上对需要用 AI 算力的企业或者开发者来说这个实用吗 ？

因为有可能你买一个 NVL72 就非常贵 ， 对吧 ？ 你就得花好像是 300 万美元吧 ， 我记得 。 就实际上现在大家在用的过程中间 ， 推理和训练是会用一样的卡吗 ？

我觉得也可以顺便讲讲就大家目前实操里面训练 、 推理都主流的一些 GPU 都是一些什么 ？

**徐凌杰** [29:51]
实操来讲的话 ， 如果是说有英伟达的 ， 比如说合规的这个 H800 来讲的话 ，其实大家还是可能会比较愿意去用英伟达的芯片来做推理 。

训练来讲的话 ，因为我们刚刚讲到有这个可靠性 、 确定性和稳定性的 ， 包括口碑和生态的一些问题 ， 大家毫不犹豫的这个主流的选择的话会是英伟达 。

我想对于推理来讲 ， 第一选择应该也会是英伟达 。 今天它是一个供给的问题 ，不是一个需求的问题 。

我想如果说在未来一段时间里面 ， 无论是其他品牌的芯片 ， 国外的芯片也好 ， 国产的芯片也好 ，在一类模型能够达到比较好的效果的话 ， 通过这个性价比的方式的话 ， 我也想也是有机会能够去做到一定的 NVIDIA 的这个替代的 。

**Host** [30:29]
所以现在实操比较主流就是训练会用 H800， 推理可能是用 H20 是吗 ？

**徐凌杰** [30:35]
推理来讲的话 ， 事实上我们经过测算 ， 可能还是 H800 的性价比相对比 H20 会更好 。 因为这些专家都打散了之后 ，其实它的问题从本来是一个容量限制的问题 ，也就是说 capacity limit 的一个问题 ， 变成了算力 bundle 的一个问题 ，也就是算力限制的一个问题 。

这个在这个大规模分布式来讲的话 ，因为 H800 的算力比这个 H20 的算力还是要好个 5 倍到 6 倍左右的一个区间 。

从价格来讲的话 ， 可能也就是两三倍的这么一个空间 。 在这么一个情况下来讲 ， 每个算力的成本还是 H800 会比较好 。

今天我们国家的这个芯片来讲 ，其实从算力本身 ， 我觉得这块还是有很大的一个空间需要去追赶上的 。

**Host** [31:13]
明白明白 。 所以实际上大家用的时候确实如英伟达 、 黄仁勋他所说的 ， 就是训练和推理你就用一个芯片 ， 它性价比是最高的 。

它不是说 NVL72 你买的越贵买的越多 ， 你越便宜吗 ？ 对 ， 它就说你实际上最后用的时候越便宜 。

**徐凌杰** [31:29]
大致的方向是这样的 。 往往对于云上的大规模的这么一个训练和推理来讲 ， 我觉得您说的是没错的 。

如果是说对于线下来讲 ， 优先级会不一样 ， 它的并发没有那么高 。 但是对于这个预算来讲 ， 可能只有 200 万 、300 万这么一个预算 ， 只能够买一两台服务器 ， 这个优先级就会不太一样 。

对于云上来讲 ， 您刚刚讲的这个方式应该是成立的 。

**Host** [31:49]
我们可以延展聊聊就是这个超节点趋势是哪些变化导致的 。其实刚才已经说了一个 ， 就是在说为什么互联技术变得越来越重要 ， 这个和模型变得越来越大是有关系的 。

### 超节点趋势

**Host** [31:59]
就具体到超节点到现在这个规模 ， 它还有什么趋势带来的吗 ？ 有什么行业的趋势导致大家都在追求这个 ？

因为确实除了英伟达 ， 然后华为之外， 像谷歌他们其实也在做类似的方案 。

**徐凌杰** [32:13]
曼祺点了非常好的一个名字 ， 谷歌 。其实最早做这个超节点 ， 我们看到 Pod 形式的这个集群来讲的话 ， 确实是这个谷歌 。

我也是在 2016 年谷歌发布了它第一代 GPU 的时候 ， 激励着我要从原来的芯片原厂进到云公司 ， 看到了更大的机会 。

**Host** [32:29]
可以讲讲这个过程吗 ？ 所以你当时应该是从三星去了阿里云什么那个节点 。

**徐凌杰** [32:33]
对 ，2016 年谷歌在五六月份发布了 TPU 这个第一代的时候 ，其实对我的这个冲击力还是蛮大的 。 那个时间点其实我们在硅谷湾区的话 ，其实很多人都接触过 AI，其实都是把 AI 当做是一个玩具 。

谷歌真正的在芯片上去投入去做 TPU 之后， 让我们意识到了 AI 是要登堂入室了 ，是真正的能够产生生产力的 。

第二个来讲的话 ， 这个计算范式可能也会发生变化 ， 从原先的 PC 到手机 ， 再到数据中心 ， 这么一个转变在硅谷 ， 那时候大家可能也都是会比较敏锐的想要抓住这么一个机会 。

对我来讲也是在那个时间点 ，有机会从原来芯片这么一个设计的公司 ， 到了阿里能够从事云计算基础设施相关的一些工作 。

**Host** [33:14]
可以继续讲就谷歌当时是怎么开启这个超节点的这种实践的吗 ？

**徐凌杰** [33:18]
对 ， 谷歌那时候的芯片我觉得也是开创了一个时代 。 到 TPU 这个 V2 的时候 ， 我们就看到它其实是一个 Pod 的形式来展现了 ，不再是一个服务器的一个形式 。

记得没错的话 ，Google 的 TPU V2 就是 256 卡 ， 到后面每一代都有了蛮大的一个跃升 。 V3 的时候是 1024 卡 ，V4 的时候应该就是 4000 卡了 。

与此同时 ，在 V4、V5 的时候也是把网络用到了极致 ， 用了这个所谓的叫 OCS（Optical Circuit Switch）， 能够动态的去配置这个网络的 。

谷歌在这方面是走得比较前面 。 谷歌走到前面之后 ，其实 NVIDIA 那时候作为两巨头之一 ， 谷歌和 NVIDIA，NVIDIA 也是推出了它的 NVIDIA 的 SuperPod。

真正让大家在这一波的生成式 AI 的这个浪潮当中， 关注到了我们严格意义上的这个 Scale up 的这么一个机器 ，其实就是我们去年看到这个 NVL72 在 GPT 上面的一个发布 。

从模型的发展趋势来讲 ， 我们再总结一下 ，其实综合来讲的话 ， 就是更大的问题需要用更大的系统来解决 。

模型的参数变大 ， 它的上下文变得更长 ， 无论是原来的上下文就变得更长 ， 还是说通过这个深度思考 ， 对于上下文的要求变得更高 ， 都形成了对于这个显存的压力 。

显存的话 ， 我们也看到从 A100 第一个版本的 40G， 到后面的 80G， 到现在 H200 的 144G， 到未来系统的 192 到 288G。 今天的这个芯片的成本结构也在发生了一个非常深刻的变化 。

原来我们觉得计算是一个主角 ， 今天真正意义上我们看到芯片的成本已经从一个芯片为主导的 、 晶圆为主导的这么一个成本结构 ， 到了一个显存为主导的一个成本结构 。

在上一代 H100 的这个架构里面 ， 显存的成本大概是在 40% 到 50%。 到新一代的 B200 的这么一个架构里面 ， 我们看到显存的容量因为变得越来越大 ，而且价格也是居高不下的情况下， 占到了五成到六成 。

显存要把它非常高效的利用起来 ， 就需要有更多的集群能够通过高速的网络把它连起来 。 再结合我们刚刚看到的 DeepSeek 的这个要求 ， 众多的 MoE 需要能够稀疏的去做激活 ， 通过这个大规模集群才能够达到推理的最好效果来讲的话 ， 我们真正的能够看到超节点无论是训练还是推理能够带来非常好的一个性价比的提升的 。

**Host** [35:26]
像显存 ， 它的全球主要供应商是谁 ？ 包括这里面有中国公司吗 ？

**徐凌杰** [35:31]
我们今天看到主要的 HBM 的供应商在韩国 ，有三星 ，有海力士 。 之前是三星会比较领先 ， 这两代的话海力士领先的会比较多 。

同时还有美国的这个 Micron 美光 。 从内存其他的这个芯片 ， 从 ARPDDR 来讲的话 ， 我们国内的好几家公司今天也能够基本上做到了这个替代 。

这也是一块能够解决这个卡脖子问题 ， 急需赶上的一个领域 。 因为 HBM 今天事实上也是对中国实施了禁运了 。

**Host** [35:56]
华为自己做不了 HBM， 对吧 ？

**徐凌杰** [35:58]
这个我不能评价 。

**Host** [36:00]
对对对 ， 说不定人家在研究 。 还有一个我想问的问题 ， 就是华为它这个 384 节点 ， 你刚才最开始也说到了嘛 ， 它是以更多的数量换来了总算力的这样一个提升 。

就是它选这个方案是因为中国本土的一些制造技术的限制 ， 导致它单颗芯片的性能就是没有办法变得更高 。

所以它找到了一个绕过去的方案 ， 还是说我相比于优化单颗性能 ，其实我把更多芯片连起来 ， 它也许就是一个更好的方式 。

**徐凌杰** [36:27]
我们先从数据上来看的话 ， 华为的这个 CloudMatrix 384 能够在整个集群上提供这个 300P 的这么一个算力 ， 几乎是这个 NVIDIA 的这个 NVL72 理论上的这么一个两倍 。

它的内存容量的话大概是三倍以上 ， 内存带宽的话是两倍以上 。 事实上能够从这个集群上的这个能力已经跟 NVIDIA 已经是平起平坐 ， 甚至比这个 NVIDIA 更高了 。

我们看到的话 ， 它付出的代价是说它的功耗 ， 潜在的这功耗基于这个外媒的这个推测 ， 可能是在这个四倍左右的样子 。

也就是说它的功耗要高了这个四倍 。 我想华为这套方案来讲的话 ，其实也是给这个中国的厂商 ， 无论是中国的这个 AI 的应用厂商 ， 还是说做基础设施的厂商 ，也是指了一条路 。

也就是说我们可以通过搭积木 ， 垒这个部件 ， 然后虽然这个每个部件 、 每个这个芯片没有那么强 ，是通过更强的这个集群的能力 、 系统的能力 ， 能够把我们整体的这个效果能够给搭建出来 。

在整体的这个成本 ， 我们刚刚讲的这个成本有分这个 CapEx 跟 Opex 来讲的话 ，Opex 来讲的话 ，在中国以 NVIDIA 的 GPU 来算的话 ， 它的 Opex 里面的电力成本的话 ，在每一年里面的话 ， 年化来讲的话 ， 大概就是 10 个点左右的样子 ， 甚至在有些西部城市可能会更低 。

因为中国要解决的这个实际问题和国外要解决的问题的话 ， 会不太一样 。 中国来讲的话 ， 电力今天不是一个特别大的一个问题 。在海外的数据中心来讲 ， 电力是一个比较大的问题 ，而且电价会比较贵 。

所以说两者的这个成本结构会不太一样 。 我想这是一个基本的一个事实 。 基于这个事实来讲的话 ， 华为今天做了这套这个系统 ， 虽然它的这个交换能力没有像 NVL72 那么强 ， 集成度也没那么高 ，也没有像我之前讲的这个暴论一样 ， 这个没有放在一个柜子里面 。

### 华为互联积累

**徐凌杰** [38:16]
但从实际效果来讲的话 ， 我觉得这是一条路 ， 这是一条这个美国厂商没有去走的 ，但是中国厂商可以通过这个系统能力去构建自己核心竞争力的一个非常重要的一条路 。

也就是说华为有了这么一个能力之后的话 ， 对于其他的这个国产芯片厂商 ， 如果说未来你没有这个超节点的能力 ， 你没有这个几百张卡连在一起去共同协作 ， 产生更好性价比的这么一个结果的能力来讲的话 ， 那你就落后了 。

这个 NVIDIA 可能并不可怕 ， 华为会更可怕了 。

**Host** [38:50]
我以为你是要说如果他们没有这个能力 ，他们可以来找你们 。

**徐凌杰** [38:54]
对对对 ， 后面就是广告嘛 。

**Host** [38:56]
刚才有一个总结特别好 ， 就是华为的这个功耗看起来也许会更高的方案 ，其实它也算是在中国这个环境里因地制宜的一个路线 。

就像你刚才说的 ，其实中国的电费会相对要便宜很多 。

**徐凌杰** [39:10]
对 ， 我觉得这是成本结构的考量 。 我们刚刚讲这个怎么评价一个系统好 ， 无论怎么样 ， 这个系统要能够跑得快 ， 这是大家基本上都会公认的一个目标 。

能够要把它跑快来讲的话 ， 根据这个今天的模型特性 ， 必须要能够在这个几百张卡上能够做这个高度的这个并行化的一个处理 。

在跑快的这个前提下 ，其实华为的这个劣势其实并没有这个外媒分析的那么大 。 也就是说通过这个成本结构来讲的话 ，其实能够掩盖相当一部分它的这么一个在设计上， 或者说在这个芯片制程上的一些劣势 。

**Host** [39:43]
就是因为你刚才也讲到 ，其实不是所有的 GPU 或者 AI 芯片的厂商 、 设计厂商 ， 它都能做到说把这么多颗芯片互联起来 。

这个里面实际上它需要的技术是什么 ？ 包括华为为什么能做到这一点 ？ 就是这个和华为以前在哪些部分的技术积累是有关系的 。

**徐凌杰** [40:02]
我想其实如果说让其他的这个芯片厂商能够像华为这样通过网卡和交换机的这么一个系统去搭建一个 384 的这样的能力来讲的话 ，其实很多公司其实是有这样一个能力的 。

我们其实主要就是看它的这个芯片上有多大的一个交换口 ，是不是有这个合作伙伴能够帮他们去搭建这么一个集群 。

如果说要进一步能够做到真正的这个 Scale up 的这个集群 ， 像 NVIDIA 的这个 NVL72 一样的话 ，其实就需要更强的能力了 。

就回到我们一开始讲到的这个 NVSwitch 的这么一个能力 。 NVSwitch 来讲的话 ， 今天我们看到其实在国内的厂商当中的话 ，其实大家基本上都还没有布局 。

可能是说在未来的这个两三年里面的话 ， 都不太会有这个 NVSwitch 类似的这么一个产品出来 。 没有这个 NVSwitch 的产品的话 ， 我们就往往需要能够通过这个网卡加上交换机去做一个扩展 。

网卡和交换机是一种这个互联方式 ，但是因为也受限于它的这个交换能力 、 交换速率 、 这个网络的这个速度 ， 包括它的整体的这个互联的一个拓扑来讲的话 ，并不会是一个全互联的 。

从效果上来讲 ， 可能会对某些应用会打些折扣 。 我想就是总结来讲的话 ， 做基本的这个类似于像华为 384 这样的集群来讲 ， 很多厂商其实有这个能力的 。

而且我认识的好几家这个国产芯片厂商 ， 都在做这个类似的 352 或者 384 的集群 ，也在这个大集群上在做性能的调优 。

**Host** [41:30]
就是刚才也讲到就是华为目前这个方案里还是用了交换机嘛 。 它这个交换机和华为当年做电信的通信这种交换机 ， 它是一个东西吗 ？

还是它其实不是一个东西 ？

**徐凌杰** [41:40]
和电信的交换机从大方向上来讲应该不是一个东西 。 就像我们大学里面的话 ， 电信那一块可能更像是这个麦克斯韦和香农定律这个方向 。

从这个计算来讲的话 ， 更多是这个冯诺依曼的架构 。在大学里面往往也是不同的这么一个教授来教授这样的课程 。

我想华为之前其实在这个 NPU， 这个 NPU 不是我们今天讲的这个神经的神经网络处理芯片 ，是指这个 Network Processing Unit 上 ，其实在过去这个十几二十年有非常多的一些积累 ，有这样一个基础 。

通过这些 NPU 的一些积累 ， 里面无论是它的一些原来的技术积累 ， 还是说人才积累来讲的话 ， 都是有非常大的一个帮助的 。

可以这么讲 ， 就是说华为在成为一个 NVIDIA 之前 ， 它其实已经是一个脉络丝了 。 也就是说我们刚刚讲这个 NVIDIA 是收购了这个 Mellanox， 从一个 GPU 芯片收购了一个网卡芯片 、 交换机芯片的这么一个公司 ， 成为了一个数据中心的一个硬件公司 。

华为在这之前的话 ， 可能自己已经是一个 Mellanox，有这个网络和这个交换能力 ， 后面又发展出了这个计算能力 。

这样的一个结合来讲的话 ，其实是综合能力在国内来讲 ， 甚至到全世界来讲的话 ， 应该都是比较强的 。

**Host** [42:49]
明白 。 就是说它跟这件事情比较相关的积累 ，是在于华为之前做的跟网络相关的一些业务 。

**徐凌杰** [42:56]
我认为是的 。

**Host** [42:57]
就可能不是那个大家一想到华为 ， 想到最多最开始它主业就是那个通信那块的业务 。 NVSwitch 的难点是什么 ？

你刚才提到就是说国内可能最近这几年都没有看到有厂商来布局 。 就为什么英伟达能做这个 ，其他人不做 ？

因为看起来它好像对英伟达的生态是很有好处的 ， 好像是应该大家去做的一个事儿 。

**徐凌杰** [43:19]
是 。 从这个 NVLink、NVSwitch 来讲的话 ， 我认为它其实是属于这个 CUDA 之外的第二大的这个重要的生态 ， 能够把它的这个系统能够非常高效的能够连接在一起 ，而且更大的系统其实能够卖出更大的价钱 。

这里面的这个核心能力来讲的话 ，其实是这个高速的这个 Service，也就是高速的这个接口芯片 、 接口 IP。

高速的接口 IP 的话 ， 往往又是和这个先进的制程节点能够连接在一起的 。 所以说这一块其实是我们国内要做这个生产制造方面的一个软肋了 。

与此同时的话 ， 这里面除了这个生产力有这层关系之外的话 ， 还有这个生产关系 。 我们看到的话 ，其实今天 NVIDIA 的自己的芯片是和自己的这个自己的网络芯片能够形成互联的 。

如果是说这个对于绝大部分的中国公司来讲 ， 没有华为这样的这个网络也强 ， 然后计算也强的这个能力来讲的话 ， 要自己再去做一个计算芯片 ， 再加上一个网络芯片来讲 ， 交换芯片来讲 ， 这个其实也是有一定难度的 。

要把这两者结合在一起 ， 既需要有这个非常强的这个设计能力 ， 同时的话也是需要有这个先进的这个制程才能达到这个结果 。

**Host** [44:29]
所以华为理论上它也还是可以做这个是吗 ？

**徐凌杰** [44:31]
理论上绝对是可以做的 。 是的 。 过去已经在做了 。

**Host** [44:36]
对 。 像这个高速接口 IP 这种东西 ， 这是英伟达自己设计的 ， 还是这个其实是可以在市场上买到一些公版 ， 然后再来开发 ？

因为我知道像比如说欣斯 ， 包括 ARM，其实他们也有一些接口类的 IP。 当然我不知道它是不是这种接口类的 IP。

**徐凌杰** [44:54]
有的有的 。 包括这个 Google 在做的 TPU 芯片的话 ，其实也是利用了 Broadcom 它的这个非常高速的博通这样的芯片 。

因为博通的话其实也是给这个 Google 做代工的 。

**Host** [45:07]
就是说其实如果有厂商想去发展 ， 它也有一些合作伙伴可以去找到 ， 然后来一起做这个能力 。 但是可能还是对类似于英伟达和华为这种它既掌握网络的技术又掌握计算的技术的公司来说 ， 做这件事是最有优势的 。

**徐凌杰** [45:23]
是的是的 。 对于中国公司来讲的话 ， 这些高速接口来讲 ， 未来可能也会受到限制 。 因为这次 H20 在最近这两个礼拜也受到了限制的话 ， 主要的这个原因的话就是带宽太高了 。

无论是它的这个 HBM 的带宽 ， 还是说它的这个互联带宽 ， 都是过了美国的线 。 这也是它这个被禁的原因之一了 。

**Host** [45:44]
接下来一部分我们就是想从华为这个超节点延展聊一下大家都比较关注的问题 ， 就是整个 AI 算力基础市场的一些变化 ， 包括不同厂商的进展带来的竞争格局的变化 。

### 市场冲击

**Host** [45:57]
我觉得大家比较关注的一个直接问题 ，因为可能也有很多投资人， 就是华为它发 CloudMatrix 384 这种东西 ， 它对英伟达会有什么冲击吗 ？

**徐凌杰** [46:07]
我个人认为的话 ，在短期之内跟 NVIDIA 来讲的话 ，其实没有特别大的影响 。 基本上是你打你的 ， 我打我的 。

短期内的话 ，NVIDIA 不是一个需求的问题 ，而是一个供应的问题 ，是产品进不来 。 所以说短期来讲对 NVIDIA 的影响不大 ，但是对其他的国产芯片的冲击我觉得是蛮大的 。

因为一旦你在这个心智上能够对这个客户产生冲击之后的话 ， 我想后面客户的话可能就会认定这个超节点才是好东西 。

从这个 DeepSeek 在今年年初的这个示范效果来讲 ， 我们其实已经看到了这个示范效应的一个威力 。 今天你能够在很多地方能够免费的去尝试到 671B 的这个满血的 DeepSeek 的模型 。

今天如果说再让你去尝试一些更小的模型来讲 ， 很多客户可能是不愿意的 。 同样的 ， 就是说华为有了这个 384 的这个集群能够达到比较好的性价比 ， 然后比起这个小规模的这个集群 ， 或者说单台服务器来讲 ， 性价比有这个好几倍 ， 甚至于说一个数量级的优势的情况下的话 ， 如果说一家这个芯片公司没有超节点的这个技术储备 ， 或者

说架构不太适合做这个扩展来讲的话 ， 就容易被淘汰 。 刚刚讲的是这个短期 。 从长期来讲的话 ， 我认为对于中国的这个市场来讲 ， 意义是比较深远的 。

我们刚刚讲的一个名词是说用数量来换这个算力的总量 。 也就是说在芯片制程还不太行的时候 ， 或者说在好的这个芯片制程的这个产能还不太够的时候 ， 通过这个系统扩展的方式 ， 当然是结合了很强的这个系统能力以及这个优化方式来提升这个整体算力 。

可能是在现阶段中国算力产业在保持一定的竞争力 、 不掉队方面来讲的一个比较重要的一个实现路径 。

**Host** [47:51]
如果说这件事情短期可能对英伟达没有什么影响的话 ，有一件刚才我们也提到的事情 ， 就是关于 H20 它是否要被禁 ， 这个现在还不是很确定 ，但是它有可能会被禁 。

然后因为 H20 本来最开始就是英伟达为了绕开之前的禁令给中国市场做的特供板 ， 它之前也下了一些订单 。

如果说美国政府重新划线把 H20 也禁运的话 ， 这个会短期对英伟达有一些业绩上的影响吗 ？ 因为它可能之前的一些订单或者库存就在别的市场 ， 比如说美国或者东南亚或者欧洲也许没有人用 。

因为你在那些市场其实你可以用它性能更高的 GPU 嘛 。

**徐凌杰** [48:28]
看起来的话 ， 这个已经对 NVIDIA 造成了实质的影响 。 股价在那天的话其实也是已经反映出来了 ，NVIDIA 是计提了 55 亿美金 。

具体说这个芯片来讲 ， 我们说这个老黄的刀法 ， 它其实跟 H100、H800， 包括 H200 来讲的话 ， 总体来讲是同一个芯片 。

在同一个芯片上做不同的这个切割来讲的话 ， 能够形成不同的这么一个配置 。 具体这些芯片是不是能够这个从计提的这些 write off 当中能够重新这个变回为宝 ， 变成其他的这个产品来讲 ， 我想 NVIDIA 可能会有其他的一些方式 。

这里的话 ， 我想就是 H20 其实之前的话还是主要是针对中国市场的 。 同样在海外能够买到这个 H200 的情况下， 我想大部分的客户应该还是会选择这个满血的产品 。

**Host** [49:12]
你说变废为宝是说 H20 可以通过什么方式 ， 难道又变成 H200 吗 ？

**徐凌杰** [49:18]
其实 H20 和这个 H200 我们看到比起来来讲的话 ， 它的算力大概是 H200 的六分之一左右的样子 。 也就是说在这上面的话 ， 屏蔽了很多的这个计算单元 。

不排除它能够这个继续打开一部分的这个计算单元 ， 之前是刻意屏蔽的 。 因为要滑到这个 2400 个 BetOps 的这么一个美国的出口管制的这个限制下 。

也就是说在 8 位的算力的话 ， 要达到 300 个 T 以下 。 如果说有一些这个算力单元是刻意被关掉的 ，其实是有机会把它重新再恢复出来 。

恢复出来的话 ， 或许在一个合适的性价比当中的话 ， 能够卖给这个海外的客户 。 当然这个就是跟中国客户是没有特别大的关系了 。

**Host** [49:57]
它这个屏蔽和恢复是硬件手段来屏蔽恢复 。 就是说它生产的时候可能就需要重新生产或者重新怎么改造一下， 还是靠软件的手段就可以做到 ？

**徐凌杰** [50:08]
既是硬件又是软件 。 往往会是在这个板级上去做一些设置 ， 然后通过一些这个板级上的一些不可更改的设置 ， 把芯片的这个配置给烧入进去 。

如果说这个 fuse， 我们说这个保险丝还没有烧过的情况下 ，其实是可以配置成其他不同的这个产品的 。

**Host** [50:28]
如果我是一个中国的客户 ， 我买一堆 H20 回来 ， 我能自己给它怎么魔改一下提升性能吗 ？

**徐凌杰** [50:35]
这个可能有点超纲了 ，但 H20 应该是不太可能去把它给恢复出来 。

**Host** [50:39]
也不一定说是要恢复成比如说满血 H200 什么的 ， 我是说就我魔改一下提升性能 ， 这有可能做到吗 ？

**徐凌杰** [50:46]
这个就涉及到要把很多的这个加密的部分要能够去破解掉了 ， 这个就难度比较高了 。 对于我们今天来讲就绝对是超纲了 。

**Host** [50:55]
明白明白 。 就是说其实你改这件事情本身就是个技术门槛很高的事情 ， 就很难的事 。

**徐凌杰** [51:00]
技术门槛非常高 ， 相当于说你要把很多的这个 。 它板子上应该还有是 RISC-V 的一些这个这个核 ， 然后用来做这个加解密的 。

等于说你要把这加解密的这些单元的话 ， 都要能够破解 ， 反向的去把它的这套东西能够恢复出来 。

同时的话 ， 要寄希望于这个 fuse 的话能够这个 reverse， 这个其实难度还是蛮高的 。

### 模型生态

**Host** [51:19]
对 。 刚才讲的就是芯片层的这些公司的一些情况 。 然后如果纵向来看 ， 就是超节点这种技术 ， 它对整个产业链的影响 ， 就是对上面的模型的影响 ， 这个接下来可能会对中国的这些模型公司有什么好的影响吗 ？

比如说今天也是正好阿里刚发了通义千问 Qwen3， 然后其实几个小时之后华为就说他们是支持了 Qwen3， 然后可以实现开箱即用 ，0 怠适配 。

我想知道就是华为这种公司 ， 它很快能适配一个新的模型 ，是怎么做到的 ？ 因为他们好像并没有提前沟通过 ， 它很快就适配了 。

**徐凌杰** [51:55]
对 。其实现在这个阶段来讲 ， 对于绝大部分的这个 AI 芯片公司 ， 能够快速的去适配一个模型来讲 ，也就是说把它跑起来 ， 应该不是一个特别难的事情 。

我想后面一个难题来讲的话 ，也就是说把这一类模型 ， 无论是这个是千问的新的发布 ， 还是说是 DeepSeek 的新的发布 ， 如果说还是同一个方向 ， 同一个类型 ，但是它的这个参数会有些不一样的情况下， 能够把它的这个模型能够非常好的 、 非常快速的 、 非常高性价比的能够跑起来 ， 我觉得这个是后面的一个竞争点 。

也就是说把它简单的把它给车子能够发动起来 ， 这个不难 ，但是要能够在那个车道上能够非常好的去加速起来 ， 这个是后面的一个竞争点 。

也就是说我们看到后面的话 ，是在保证一定的这个 token， 每个用户的这个每秒 token 数的这个前提之下， 能够达到多少并发 。

我们这样算出来 ，在稳定的这个服务的这个情况下， 整体的这个系统的吞吐是多少 ， 这个是未来大家会去比较的一个核心点 。

因为在模型都是类似的这个情况下的话 ，其实后面大家对推理来讲 ，其实就是拼一个性价比了 。 当然对于这个模型的质量 ， 我这边想要提一句的话 ，其实还是有一些这个差别 。

因为我们刚刚讲到这个在芯片层面的话 ，其实还有一个比较重要的一个参数的话 ，也就是它的这个精度 。

今天其实比如说这个 DeepSeek 来讲 ， 它是以 FP8 来做训练的 ， 就 floating point，8 位的这么一个浮点去做这个运算 ， 然后去做一个推理 。

这是它的这个满血版的这个官方发布版 。 国产芯片的话 ，其实有蛮多的这个芯片 ， 今天其实并不能够原生的去支持这个 FP8， 要么你能够去恢复到这个 FP16 或者 BF16， 这样的话其实就占用更大的这么一个带宽和存储容量 ， 那就不划算 。

有的话就是把这个 FP8 重新去量化一下， 做成这个 Int8 整形的这个 8 位 。 这里的话可能会有些精度的损失 。

我想总是会有各种各样的软件的方式能够来降低这样的影响 。 但有时候我们会看到 ， 虽然都是这个 DeepSeek，但是可能回答出来的这个质量 ，在某些环境里面的话可能会不太一样 。

**Host** [54:00]
就是你刚刚说的精度 ， 什么 FP8、Int8 这些 ， 就简单来说它是 GPU 处理数据的格式 ， 可以这么说吗 ？

**徐凌杰** [54:08]
是 GPU 计算和处理数据的一个格式 ， 包括它存储的一个格式 。 也就是说这个我们今天看到都是 8 位的情况下 ，因为它是浮点嘛 ， 它浮点的话它动态精度会更大 。

定点的话它的动态精度没有那么大 。 有时候我们需要这个动态精度比较大 ，有时候的话不需要那么大 。

有些时候这个 Int8 或许是 OK 的 ，有些时候的话我们就需要这个更大的这个精度范围 ， 能够比如说像 FP8 这样的话来处理 。

我们看到其实往后面去走的话 ， 这可能也不是个大问题 。 因为 NVIDIA 在往后的话也是会引领这个 FP6、FP4 更低精度的格式的话 ， 用到实际的应用场景里面 。

因为今天我们看到绝大部分的这个模型 ，其实都是一个概率统计意义上的这么一个结果 。 也就是说我做 next token prediction， 下一个 token 的预测来讲 ， 本来就是一个概率问题 。

我在计算的时候的话 ， 到底是这个 70.1 还是 69.8， 如果说差一点点的情况下， 可能对最后的结果没有特别大影响的情况下， 哪种精度 ？

如果说它稍微低一点的话 ， 或许都是 OK 的 。

**Host** [55:13]
就是一个 GPU 它支持多少种格式 ， 这是一个选择的问题 ， 还是说这也有技术难点 ？ 因为确实可能英伟达的芯片它支持的格式会比较全 ，因为这有很多种不同的精度嘛 ， 什么 32 的 、16 的 ， 然后 8 的又分了很多种 。

**徐凌杰** [55:29]
对 ， 这是一个设计上的一个选择 ，以及对于这个未来趋势的一个预判 。 今天来讲的话 ，其实跟着这个 NVIDIA 去走 ， 这是一个比较安全的选择 。

但往往来讲的话 ， 可能对于这个还不是能够确定 、 能够引领业界主流的这些公司来讲 ，不太愿意去投入做一些新的格式 。

等到 NVIDIA 确定了之后的话再去跟上， 可能会稍微慢个半拍到一拍 。

**Host** [55:51]
而且可能你要确定一个格式 ， 我觉得也需要你上面的开发者和用户来给你配合吧 。 比如说我觉得 FP8 这个格式最近比较火 ，也是跟 DeepSeek 比较火有关 ，因为它用 H800， 然后 H800 是原生支持 FP8 的嘛 。

它这是一个生态的关系 ， 我觉得 。

**徐凌杰** [56:06]
是一个相辅相成的一个生态关系 。 也就是说今天只有像 NVIDIA 这样的这个全球范围内大家都在使用 ， 变成一个工业基础的一个公司 ， 它引领的一些 format 更容易被大家接受 。

或许接下来这个因为美国的禁令的话 ， 中国会出现另外一种生态 ， 或许会有一些这个新的机会在国产芯片当中也会产生出来 。

### 英伟达护城河

**Host** [56:27]
讲到这个话题的话 ， 就是有一个我觉得大家也比较津津乐道 、 想去讨论的问题 ， 就是英伟达看起来它的优势 ， 它的壁垒是非常强的 。

而且它很多地方的优势是它有这种正循环 ， 就你感觉它是一个随着它生态的变化 ， 它越来越强 ， 然后又相互反馈 。

除了刚才说到的就是中美贸易的这种非市场和技术的因素之外， 如果只看市场和技术的因素 ， 英伟达有什么可能会被动摇的地方吗 ？

它的强势地位有可能会被削弱的原因 ， 或者说驱动力会是什么 ？

**徐凌杰** [57:01]
今天看起来的话 ，NVIDIA 的这个地位在全球范围内要被削弱的可能性 ， 相对来说在未来两三年里面可能会比较低 。

一个是从它的这个芯片的这个未来的这个发展 ， 包括它的路线图 ， 我们就可以看到竞争力非常强 。

另外一方面的话是它的这个生态 。 刚刚生态的话我们讲到两个 ， 一个是它的这个 CUDA 的生态 ， 另外一个的话是它的这个整个互联系统自己闭环的这么一个生态 。

就是说不仅是 GPU，也包括它的网卡 ， 包括它的互联 ， 包括它的 NV Switch。 从这个技术层面来讲的话 ，其实 NVIDIA 有个非常大的一个优势 ，是有最好的这个全球供应链围绕它的周围 。

从芯片来讲的话 ， 台积电我们就不用去讲了 。 从这个 HBM 来讲 ， 我们刚刚也讲到了这个海力士 、 三星 ，在最新的这个 HBM 上就能够给到 NVIDIA 支持 。

甚至说就是为了 NVIDIA 的这个特别的一些需求 ， 进行了一些这个特殊的一些设计 。 它总是能够比这个其他的厂商更快的 、 更早的 、 更好的能够拿到最新的这个 technology。其实对这个整个产品的竞争力还是有蛮大的一个影响 。

就比如说我们从这个 HBM2、H2E 到 HBM3 来讲的话 ，其实这个带宽的提升和容量的提升都是非常大的 。 对于这个产品的竞争力来讲 ， 能够及时的能够换到最新的这么一个科技来讲 ，是蛮大的一个优势 。

另外来讲的话 ， 还有就是从系统层面 ， 我们刚刚讲到是从这个芯片层面的这个科技 ， 还有从这个从系统层面的科技 。其实它有这个美超微 、Supermicro，有这个 Foxconn、 富士康这样的这个代工厂能够跟它去合作 。

基本上把它们的这个先进的这个制造能力也都能够包圆了 ，以至于让这个全球第二名的这个 GPU 公司 AMD 在去年 8 月份的时候 ，不得不花 49 亿美金去收购一家能够配合它去做这个超节点这个整机柜方案的一家公司 。

它去年花了 49 亿美金去收了一家公司叫 ZT Systems。 我想就是整个的这个综合能力来讲 ， 我们用一句话 ，其实也是在 NVIDIA 的它的这个最新的发布会里面其实有提到的 ， 它叫是 technology limit。

它是贴着这个技术的这么一个极限在做整体的这个产品的设计 。 当然它的这个极限来讲的话 ， 是一个全球范围内的一个科技极限 。

我想回到我们国内来讲有不一样的一些限制 。其实我们看到其实在国内的这个芯片厂商来讲 ，其实也有蛮多的这个愿意去尝试 ， 愿意去这个往前去走一步的这个公司来讲 ，也是愿意和这个国内最新的这些制程 、 这些节点 、 这些技术能够相结合 。

我想这个也是我们未来看到的这个希望所在 。

**Host** [59:41]
所以总结一下它短期的优势还是非常明显的 ， 或者说未来两三年吧 ， 就是往上游的话 ， 它有整个全球技术供应链围绕它来供给最新的技术 。

然后往下游的话 ， 它通过软件 ， 包括 CUDA， 包括它的 NV 互联的这些技术 ， 再到开发者 ， 所以它上下游都是一个很紧密的能帮它持续领先的这样一个生态 。

**徐凌杰** [1:00:03]
是的 。 它其实最大的威胁就是来自于它的这个客户比较集中 。在于海外来讲的话 ， 我们看到有这个 Amazon 也好 ，Google 也好 ， 这个 Microsoft 都有自己的这个定制开发芯片 。

Google 有 TPU，Amazon 的话有这个 Trillium， 然后他们也会寻求像 Broadcom 这样的公司来帮助他们去设计 。 Broadcom 也有非常强的本来就设计交换机的嘛 ，有非常强的这个 service 的这么一个互联的一个能力 。

我想今天这些客户比较集中来讲 ， 对于 NVIDIA 来讲是一个比较大的威胁 。 所以说中国市场占它那么高的比例 ， 如果说未来要去失去来讲的话 ， 这是我觉得短期来讲一个比较不确定的因素 ，也就是说政策性的因素 ，而不是一个科技性的因素 。

**Host** [1:00:45]
不过你刚讲到它客户集中， 这个倒是一个科技或者说产业型的因素 。 因为它的客户都是美国的大科技公司 ，其实他们也是有人才 、 有资源去自己做 AI 芯片的 。

比如说你刚才提到谷歌的 TPU， 还有 Amazon 也在做自己的芯片 。其实你也说到就当时从三星来云计算公司 ， 就是去来阿里云 ，也是因为 TPU 让你觉得是应该就是跳出之前那个体系 。

但另一方面就是好像对很多人来说 ，TPU 并没有怎么撼动英伟达的地位 。其实我 21 年、22 年的时候和英伟达北美的人聊 ，他们说公司内部其实黄仁勋自己他是比较在意 TPU 的 。

就是他可能认为 TPU 是对英伟达一个比较主要的竞争对手吧 。 但看起来好像为什么他们做了也挺长时间了 ，但好像除了自己用之外 ，并没有撼动英伟达的地位 。

甚至他们也不能完全解决自己的需求 ，他们还是要买很多英伟达的芯片 。 以及你也提到嘛 ， 就是博通其实现在在和这种大的公司合作 ， 做这种定制的 AI 芯片 。

这个趋势可能在什么时候它会显现出来 ， 就是让英伟达的这种 AI 芯片的大客户对它的需求变少 。

**徐凌杰** [1:01:55]
我们看到无论是北美的互联网大厂 ， 还是说之前在没有禁令之前 ， 中国互联网的大厂 ，其实是 NVIDIA 最大的这个采购方 ， 最大的采购方 ， 可能占了它的这个六成以上的这么一个采购量 。

对于这些客户来讲的话 ， 自己自研芯片一方面是成本的考量 ，因为 NVIDIA 的毛利率实在太高了 。 它的数据中心的毛利率的话 ， 往往达到了 70% 甚至 80% 以上 。

自己去自研芯片 ，其实养一个团队 。 今天我们以这个互联网厂商他们的这个采购量来讲的话 ， 从经济上是一个划算的账 。

另外一个来讲的话 ， 又会是一个从供应链上会比较安全的一个解决方案 。 我们知道 NVIDIA 的这个芯片在这个生成式 AI 刚出来的时候 ，ChatGPT 刚出来的时候是炙手可热 ， 这个货期非常非常久 。

你自己有这个供应链来讲的话 ， 就会比较游刃有余 。 谷歌的 TPU 的话 ，在那个时间点占了很大的一个优势 。

第三个来讲的话 ，是和 NVIDIA 的一个议价空间 。 无论是从这个谷歌的 TPU， 还是说后面这个 Amazon 自己去做芯片 ， 到这个 Microsoft 自己做那个 Maya 芯片来讲的话 ， 我觉得都是一个非常好的一个议价空间 。

我想这个其实公司和公司之间的话 ， 既有这个合作 ，也有竞争的关系 。 他们的这些芯片可能从一开始的定位来讲 ， 就不是对外去卖的 。

你对外去卖来讲的话 ，其实要付出很多的这个努力 ， 包括整个的这个组织结构 ， 包括你的这个团队的组成来讲的话 ， 都会不一样 。

没有一开始就想做好成为一个这个独立的芯片公司 。 我想这个一开始没有做好这样一个准备来讲的话 ， 后面的话也很难去做一个改变 。

我想这也是一个初始的一个定位 。

**Host** [1:03:39]
那他们完全解决了自己用的需求吗 ？ 好像也没有解决呀 。

**徐凌杰** [1:03:44]
他们其实里面分几部分 ， 就比如说谷歌的 TPU 的话 ， 最早的时候其实是要跟 TensorFlow 相结合的 。 后面当然也能够跟这个其他的这个框架能够相配合 。

内部去用确实解决了很大的一部分的这个供应问题和这个成本问题 。 他们其实同时的话也是云厂商 ，也是云厂商 。

在他们是一个云厂商的前提下 ，他们要考虑到不仅是自己内部的一个需求 ， 还有他们在云上的客户的需求 。

所以说大量的去采购这些 NVIDIA 的芯片其实是 customer first。 比如说 OpenAI 它想用的就是 NVIDIA 的芯片 ，NVIDIA 芯片最好用 ， 就要微软去买这个 NVIDIA 的芯片 。

其实我们也看到其实 NVIDIA 其实在去年还是前年， 已经偷偷的去成立了一个叫半定制部门 ， 叫 semi-custom design 的一个部门 。

也就是说它接下来也会去把自己的一些 IP 也好 ， 包括一些设计能力也好 ， 像博通一样对这些互联网大厂进行兜售 。

今天来讲的话 ， 可能还没有看到一些成功的案例 。 或许的话 ， 这也是它能够去破局 ， 既能够做进继续做这些这个 hyperscaler 大型互联网公司的生意 ， 同时的话又能够和这些公司进一步能够打开他们的心扉 。

用 NVIDIA 的这个模组 ，NVIDIA 的一些 IP 能够去解决他们的一部分的这个问题 。

**Host** [1:05:04]
它自己搞一个半定制部门 ， 这不会左右互搏吗 ？ 它本来它卖它的标准的芯片毛利就那么高 ， 包括内部的人为什么会有动力去搞这个半定制部门呢 ？

**徐凌杰** [1:05:14]
我觉得半定制部门的话 ， 主要就是解决互联网大厂的一些问题 。 就是为了让他们不去自研 ， 跟他们去谈生意 。其实半定制部门来讲的话 ， 对于这个芯片公司并不是一个不常见的一个选项 。其实 AMD 的话做半定制的话 ，其实做的时间最久 。

我们所熟知的这个 Xbox、PlayStation 其实里面的这个芯片都是这个 AMD 通过它自己的现有的一些 IP， 无论是 GPU、CPU 还是其他的一些控制器的一些 IP 的话 ， 和这个微软和索尼去定制出来的 。

所以这样的生意模式是有的 ， 只是针对一定的这个大体量的这个客户 ， 然后做定向的一些销售 ， 然后通过一些这个特定的 IP， 或许还能够绑定这些公司的一些生态 ， 比如说 NVIDIA 的这个 CUDA 生态 ， 包括它的这个 NV Switch、NVLink 的一些生态 。

当然这个只是我的一部分的这个猜想 ， 今天其实还没有看到这个事实上的一些结果出来 。

**Host** [1:06:08]
它确实想的挺全的 ， 就是这算什么一种怀柔政策是吗 ？

**徐凌杰** [1:06:14]
可能它不一定想的那么全 ， 可能是我们帮它脑补的比较全 。

### 创业往事

**Host** [1:06:18]
你当时为什么从英伟达去 AMD？

**徐凌杰** [1:06:20]
这是好久远的事情了 。 从 NVIDIA 去 AMD 的主要的原因的话 ，是能够有机会在 AMD 跟着它的首席架构师 ， 叫也是它的 senior fellow，corporate senior fellow Mike Menton， 跟着他去做这个新一代的 AMD 的这个 CU，Computer Unit 的这个架构 ，也是跟着他做了大概一年半到两年左右的时间 ，也是跟了一个大牛吧 ，有机会跟着大牛直接去学习 。

**Host** [1:06:44]
那是哪一年 ？ 就是你从英伟达去 AMD 是哪一年 ？

**徐凌杰** [1:06:47]
2010 年底 。

**Host** [1:06:48]
2010 年底 。 那个时候英伟达和 AMD 他们在 GPU 市场的份额悬殊吗 ？

**徐凌杰** [1:06:55]
差不多是 64 开 ， 或者甚至说 55 开 。在那个时代来讲的话 ，AMD 在芯片的设计 ， 包括它的这个能耗节能以及这个面积的优势来讲的话 ， 还是比较明显的 。

对于 NVIDIA，因为 NVIDIA 那个时代来讲其实也作废过几个芯片 ， 包括那时候我们在的时候那个 Fermi 其实不算是一个比较成功的一个产品 。其实那个时间点 ， 我觉得 NVIDIA 在逐渐建立自己的一个优势 ，也就是说从这个 CUDA 在寻找方向 ， 从芯片层面来讲的话 ，也在逐渐想要确立自己在某些领域里面的一些优势 ，但那时候优势不明显 。

**Host** [1:07:33]
我不知道有没有人和你讨论过这种问题 ， 就比如说如果一直留在英伟达的话 ， 那岂不是收益很多 ？

岂不是股票的收益就会很多 ？

**徐凌杰** [1:07:40]
对 ， 我现在这个朋友圈里面还有好几个跟我当年差不多时间点加入 NVIDIA， 现在生活过得很滋润的 。 当然从这个经济上来讲 ， 我觉得是会有蛮大的一个回报 。

另外来讲的话 ， 我觉得从这个产业机会的发展 ， 无论是我们从这个芯片到数据中心 ， 到这个云计算 ， 再到今天我们看到的超节点来讲的话 ， 今天我其实一直用一个 lifestyle 来讲的话 ， 就是一直在这个创业或者说寻找这个新项目的这个过程当中 。

中国的芯片的话 ，其实从在这几年的这个无论是从禁令 ， 包括这个产业格局的一些变化来讲 ， 已经从一个偏市场化的一个竞争 ， 到了一个资源型的一个竞争 ， 或者说一个偏政府导向的一个竞争 。

机会的话 ， 可能会在于这个芯片上下游的其他产业 ， 这也是我们为什么要去做这个模型智能这么一个公司 。

我们会围绕芯片 ，但是做这个芯片上下游其他的一些工作 。

**Host** [1:08:35]
就是你觉得在 2010 年底的时候 ，其实也不是特别能明显的看出来英伟达会变成现在这样的公司 ， 对吧 ？

**徐凌杰** [1:08:42]
那个时间点来讲的话 ，其实从黄仁勋自己的这个决策来讲 ， 从他的决策结果来讲 ，他自己也没有预料到 。

如果说我们看 2013 年， 那个时候应该是 AlexNet 刚刚发布的时候 。 如果说我们去翻 NVIDIA 当年的这个财报 ，13、14 年的财报 ， 我们应该可以看到黄仁勋那时候把公司 5% 还是多少的一个股份做了一个这个可转债的抵押 ， 给到了高盛和那个 Wells Fargo 富国银行 。

芯片价格的话 ， 我记得没错的话 ， 大概是在 20 块出头左右的样子 ， 这还是在 NVIDIA 没有分股之前的 20 块 ， 相当于现在的这个几块钱 ，也就是今天的这个 1%。在那个节点的话 ，其实这个高盛和这个富国银行的话 ， 应该都是行使了这么一个权利 ，因为那时候也赶上了一波这个矿机的热潮 ，NVIDIA 的股票在往上在涨 。其实从这个真正的决策来讲 ， 我也不认为

黄仁勋在 2012 年、13 年、14 年他看到了这些机会 。 我觉得这个人生没有确定性 ， 这也是这个人生本来比较精彩的地方 。在当中的话 ， 能够找到自己的一个着力点 ， 今天的老黄跟这个十年前的老黄也不是同一个老黄了 。

**Host** [1:09:50]
你还记得他 2010 年之前在公司里会说些什么吗 ？ 比如他怎么描述公司今年的目标 ， 或者说我们长期要怎么样什么的 。

**徐凌杰** [1:10:00]
我在阿里的时候 ，其实有跟黄仁勋有比较多的这个近距离的接触 。 我觉得从整体来讲是一个气场非常强 ，而且非常有这个坚定眼光的人。

从这个公司的发展来讲 ，他是愿意长期主义的 ， 长期去投一些他看好的东西 。 比如说在 2004 年、05 年的时候的话 ， 就投入做了这个 Tegra， 做这个我们叫这个 mobile 的这个移动的这个 SoC， 想进入到手机领域 。

我们在这个网上今天还能看到他之前给小米 、 给雷军站台的那一段这个过去的这个往事 。其实他其实有很多东西看好 ，由于这个由于当时的这个环境问题 ，由于自己的实力问题 ，由于这个 timing 的问题的话 ， 可能并没有成功 。

但是他是一个长期主义者 ，也就是说他对他看好的东西非常有信心 ， 非常有这个 vision，也特别能够鼓励大家能够坚定下来 。

包括在这个做 Fermi 产品的时候 ， 芯片流了两次片都不成功 ， 第三次流片终于成功的时候的话 ，其实大家还是有一堆人愿意跟着他去走 。

包括在 2008 年金融危机的时候 ， 整个公司第二次裁员 。 我进公司之后大概三个礼拜吧 ， 就碰上了这个金融危机 ， 然后 NVIDIA 历史上第二次裁员 ， 裁了 5% 的人， 然后全公司降薪 10%。

黄仁勋自己只拿一块钱 。 我其实对他的这个 leadership， 对他的这个领导力 ，以及能够这个煽动性的这个言论 ， 当时还是留下了比较深刻的印象的 。

**Host** [1:11:24]
就是他在危机之中， 反正就是对内部发表了一些让大家更凝聚 ， 或者说能有士气的一些话 ， 对吧 ？

**徐凌杰** [1:11:32]
不仅是发表这些话 ，而且是能够带领大家在危机当中能够走得出去吧 。 我觉得这是确实是一个企业家非常重要的一个素质 。

**Host** [1:11:40]
对 ，他自己只拿一块钱 ， 我觉得这是一个行动上的表达 。 对 ，其实那个英伟达的手机 GPU 确实做的不成功 。

我们前几天几个同事还在讨论这个事情来着 ， 然后因为有同事玩游戏 ， 说现在好像只有任天堂的 Switch 在用英伟达的移动端的这种 GPU， 然后大家还在吐槽 Switch 的这个性能非常差 。

**徐凌杰** [1:11:59]
那只是特定的一个版本 。

**Host** [1:12:01]
随着就是后面的这个发展 ， 芯片算力层的这些变化 ， 就是它带来了哪些上层的一些变化 ， 然后导致比如说你在 2023 年底到 2024 年看到有一个创业的机会 。

因为其实之前在壁仞已经是一次创业 ， 然后 23 年底又看到这个新的机会 ， 它是有哪些条件成熟了 ？

**徐凌杰** [1:12:21]
对 ， 我们刚刚有谈到 ，其实在 23 年底 、24 年初的时候的话 ， 中国整个的这个芯片竞争格局其实有发生了一定的变化 ， 包括从更偏市场化的一个格局到更偏这个资源型的一个竞争的一个格局 。

我那时候看到的点的话 ，是在于芯片的这个上下游或者周边的这个产业是能够做出差异化 ，而且是一个长坡厚雪的一个赛道 。在就像您讲的 ，在去年的这个 3 月份 ，NVIDIA 发布了这个 NVL72，其实对我们来讲是一个比较大的一个鼓舞 。

也就是说 ， 希望是能够在这个围绕芯片的周边的这个集群也好 ， 优化也好 ，AI Infra 也好 ， 这么一个大的赛道做出成绩 。NVL72 来讲的话 ， 给我们点亮了一束光 。在这个去年差不多这个时间节点 ，4 月底 、5 月初的时候的话 ，DeepSeek-V2 出来了 。

我们其实也是属于当时比较这个紧密关注这个 DeepSeek 的一拨人。DeepSeek-V2 其实跟 V3 来讲的话 ，其实有蛮大的一个延续性 。

但是在当年那个时间点 ， 可能大家从技术流上没有特别多的去做一些关注 。 我们其实有跟这个 DeepSeek 里面 ， 包括幻方的之前认识的一些小伙伴做过一些交流 。

从那个时间点 ， 无论是这个 NVL72 还是 DeepSeek-V2 的这么一个版本出来之后的话 ， 我们比较认定的话是说更大的这个模型 ， 更大的这个问题的话 ， 需要用更大的系统来解决 。

所以说我们开始做原型机 ， 开始在这方面投入进去 ， 做这个集群方面的一些优化 ， 找到了一个切入点 ， 然后开始就开始开始做了 ，是找到了这么一个机会 。

**Host** [1:13:54]
另一方面就是你觉得你刚刚说的这个趋势 ， 越大的问题需要越大的集群 ， 需要越大的系统 ， 它有可能会让哪些以前本来有的产业链里的细分机会消失 ？

因为有的变化来了之后， 可能有些事就被大公司自己做了 。

**徐凌杰** [1:14:10]
我想在这里面的话 ，其实有蛮大的一个格局上的改变 。 比如是说这个我们刚刚讲到 Scale up 的集群 ，Scale up 的话 ，是指在一个机柜里面的话 ， 我们能够尽量多的把这个芯片能够互联在一起一起去用 。

如果说大量的这些问题的话 ， 都能够在一个柜子里面能够解决的话 ， 可能我就不需要那么多的一些这个光模块来去做这个跟其他的柜子去做这个交互 。

对光模块的这个消耗来讲 ， 可能就会变少 。 我们今天看到这个华为的话 ，因为它今天还没有类似于一个像 NVSwitch 这样的一个芯片 ， 还是通过这个光模块加上光纤来做一个这个交互和这个互联 。

如果说是未来能够达到用这个 NVSwitch 这种 Style 的这个方式去做 Scale up 来讲 ， 我想可能未来对于光纤 ， 对于这个光模块的这个需求来讲 ，在推理里面可能会降低 ， 可能会变小 。

这个也是我一个不成熟的一个猜测 。 再往后来讲的话 ， 我想其实对于这个无论是散热 、 冷却 ， 还有这个互联来讲 ，其实都是有蛮大的一个机会在整个产业链里面 。

**Host** [1:15:15]
什么公司是做光模块的 ？ 中际旭创这种公司是做光模块的吗 ？

**徐凌杰** [1:15:20]
我没有任何 ， 没有任何这个 。

**Host** [1:15:24]
对对 ， 我只是问一下 。

**徐凌杰** [1:15:25]
有蛮多的 ，有蛮多的 。

**Host** [1:15:27]
之前有一些就是传播的时候会这么说 ， 反正大概就是说英伟达卡我们的脖子 ， 然后中际旭创卡英伟达的脖子 。

我不知道有没有这么夸张 。

**徐凌杰** [1:15:36]
有这个说法 。

**Host** [1:15:37]
这个点可以记一下， 看看之后是怎么变化的 。 包括其实这个领域也有一些初创公司 ，也有一些上市公司 ， 当然我觉得大家的业务也可以根据这个系统的变化有一些调整 。

**徐凌杰** [1:15:48]
对 ， 然后另外一个机会点我看到的话 ，是因为这个互联的能力要加强 。 我们今天已经看到 NVIDIA 在今年的 2025 年的这个 GPC 里面的话 ， 已经发布了这个基于 CPO 的 ， 就是 COLPACKED Optics，也就是说是光和电的这个光和电的共封装的这么一个这么一个产品 ， 用在它的这个互联的产品里面 。

未来的一个大的趋势来讲 ， 如果说我们对于互联的要求变得更高 ， 然后在一个柜子里面更多的这个芯片要聚合在一起的话 ，CPO 的这个可能性我觉得也是一定要去考虑的 。

通过光和电一起来做集成的话 ， 能够把更多的芯片更有效的去连接在一起 。

**Host** [1:16:28]
你怎么看最近英伟达收购了 Lepton.ai？ 就它这个可能是反映了系统层的什么样的集成的一种趋势 ？ 比如这个对英伟达的价值是什么 ？

**徐凌杰** [1:16:40]
杨青也是非常好的朋友 ， 我们之前很早就认识 ， 后来在阿里的话也是同事 。

**Host** [1:16:44]
对对对 ， 你们是同事 。

**徐凌杰** [1:16:46]
对 ，因为可能今天杨青还是在一个静默期 ，不太能够评论 。 我大胆的猜测的话 ， 可能会是和这个 NVIDIA 今年 GPC 发布的这个 Dynamo 的这个系统也是有一定关系的 。Dynamo 的话是一个它一个开源的一个模块化的一个框架 ， 用于这个优化分布式多 GPU 环境中的大规模的 AI 推理的任务 。

它的关键的一个特性的话 ， 就是能够做这个分解式的这个服务架构 ， 包括这个 PD 分离 ， 能够将这个 P 的话就是这个预填充的阶段 ，D 的话就是解码阶段能够分开 ， 能够实现的这个独立的这个分离的这个集群的最优解 。

它能够在这个 TensorRT 在这个推理框架之上又产生了一个新的一个框架 ， 叫这个 Dynamo 去做 。 我想对于 NVIDIA 来讲 ， 未来去做这个 AI 的 serving 这块能力 ， 包括给客户提供这个增值的价值来讲 ， 就会变得越来越重要 。

杨青我不知道他今天具体什么任务 ，但可能会参与到这样的一些项目里面去 。

**Host** [1:17:47]
英伟达他提这些东西跟他在做云业务有关吗 ？ 因为他其实应该是两年前还是三年前 ， 两年前吧 ，他也就是启动了自己的云计算的业务 。

**徐凌杰** [1:17:59]
对 ，NVIDIA 一直是基于这个云计算的这么一个业务 ，因为云计算是一个主要的一个客户的一个入口 。 我想谁能够跟这个用户离得更近的话 ， 谁就更有这个粘性 。

当然今天 NVIDIA 是整个这个计算行业这个说一不二的 ， 或者说基本上占垄断地位的一个标杆性的一个企业 。

它今天事实上就是工业基础 。 如果说未来它要能够去风险 ， 要降低 ， 包括 Google， 包括这个 Facebook， 包括它的这些比较集中式的这个互联网厂商 Hyperscaler 对它的影响来讲的话 ， 往上去走 ， 或许是它的一个未来的一个防守型的一个策略 ， 甚至是个进攻型的一个抓手 ， 能够抓到更多的一些这个高质量的一些营收 。

**Host** [1:18:45]
但是它的云计算业务是不是实际上做的也不怎么样 ？ 就是从它启动以来 。

**徐凌杰** [1:18:50]
它今天其实并没有大规模的去做云计算 。 它之前做的云计算是和这个游戏有关 ， 包括它的它的 GeForce，GeForce Now 是在这个云上做云游戏 。

它所谓的这个 DJIS Cloud 来讲的话 ，其实更多的是一个 2B。2B 的话在跟云计算厂商是有一定的这个补充 。 比如说 Oracle 买了一批这个 NVIDIA 的 GPU， 然后又把它返租给 NVIDIA， 返租给 NVIDIA， 等于说把低毛利的干这个机器运维的一些事情的话 ， 交给了 Oracle 去干 ， 然后 NVIDIA 再基于这套集群能够再给客户提供更高价值的一些这个服务 。

我想这是之前的一些尝试吧 ，但大公司来讲的话 ， 一般来讲都是会在多点去布局的 。 去布局并不表示它完全会走出来 ，因为跟客户来讲是一个亦敌亦友的关系 ，因为这些 Hyperscaler 自己也做芯片 ， 同时又是它的客户 。

怎么样保持这个一定的分寸 ，也有一定的这个警觉性 ，也有一定的这个进攻性 ， 这是一个非常有意思的一个平衡 。

### 未来计算

**Host** [1:19:48]
最后一个问题是想问一个更远期的问题 ， 就是说按照现在这个眼镜来看的话 ， 发展到什么时候 ， 或者说出现什么信号的时候 ， 可能是会出现下一代主流的计算芯片结构的时候 。

就比如说我们现在这个英伟达的这种方案非常主流的这个情况 ， 它可能会持续到一个什么阶段会有一个大的改变 ？

因为其实芯片领域也有一些很新的东西 ， 包括其实已经说了好几年的什么存算一体之类的 ， 然后还有一些人在现在在做就是更加像人脑的这种神经网络的硬件 ， 去模拟人的神经网络的这种硬件的结构 。

就这些东西能看到一些迹象吗 ？

**徐凌杰** [1:20:27]
这是非常有意思的一个话题 ，因为经常会有投资人来找我来交流关于存算一体 。 我小朋友其实也是对这个生物也是比较感兴趣 ，也是想要这个在人脑 ，在这个认知科学方面有所这个了解 。

回到这个问题来讲的话 ，NVIDIA 其实今天最大的一个软肋 ， 我认为就是人类的可持续发展 。 也就是说今天我们看到这个数据中心占了整个电力的可能 2%、3%。

根据未来的这个趋势 ， 无论是每个行业都需要 AI 的这么一个大的一个产业趋势 ， 还是说根据这个集群的这个趋势来讲的话 ， 它的占的比重会越来越高 。

通过超节点这个方式 ， 我们其实有一点是反共识的 。 大家可能认为超节点是费了很多电 ，但事实上来讲的话 ， 从单位的这个 token， 单位的这个吐出来的这个字 ， 我们来看的话 ，其实它的这个单位成本其实是下降的 。

但无论怎么样 ， 它的这个总的这个耗电其实非常高 。 即使我们看到电力在总的成本里面占比并不高的这个情况下， 它对人类整个社会来讲 ， 一个可持续发展来讲的话 ， 我觉得是一个比较大的一个问题 。

我们要能够去供得上这些电 ， 要能够稳定的去支持这些集群 ， 然后要把这些热能够散得出去 。

我觉得这些一方面是对于这个数据中心运营来讲是一个必须的一个点 ， 同时的话也有很多这个社会责任在这里面 。

**Guest** [1:21:51]
回到我们今天谈话的主题超节点 ， 未来我们要大规模去应用 AI， 需要更高的性能和更低的单位成本 。

超节点就是我们在机柜和数据中心层面继续去延续摩尔定律的唯一的可能性了 。 我们可以用各种方式来降低对于未来能源的依赖 ， 提升运营效率 。

我举两个例子 ， 比如说能够采用高压的直流供电 ，800 伏也好 ，1600 伏也好 ， 直流供电的话可以减少 AC 到 DC 的转换环节 ， 显著降低能量的损耗 ， 提升整体的运营效率 。

电压更高的话 ， 电流就会变得更小 ， 减少线路的损耗 ， 适合长距离的传输 。 这样的设计的话 ， 更会更符合我们对于 GPU、AI 算力设备这样高密集中化的供电的需求 。

再比如的话 ， 未来一定会成为主流的液冷的冷却 。 如果说我们可以通过相变式的冷媒的液冷来集中去形成废热的回收 ， 这样的话能够做到数据中心的更绿色 。

当然这一切的一切都需要服务器集群超节点 ，他们的设计都做出相应的端到端的调整 。

**徐凌杰** [1:22:55]
我觉得其实在整个的这个集群里面的话 ， 我们有一部分的这个计算是不是能够 offload 在一些更高效的一些这个算力里面 ， 包括我们今天看到这个人脑或者叫类脑的这个计算 ，其实也是写进了我们国家十四五的规划当中 。

类脑的话其实它是用不同的一套方式 ， 通过这个我们叫脉冲神经网络来进行这么一个计算 。 虽然在范式上来讲 ， 跟今天的这个 Transformer 这个类型还有比较大的一个差别 。

我想基于这个可持续发展来讲的话 ， 这都是值得去投入 ，而且是值得去研究的方向 。 这个人类如果说没有电的话 ， 没有这个都被能源所控制来讲的话 ， 后面这个可持续发展的话就是一个比较大的一个问题 。

**Host** [1:23:38]
对 ，其实我们录节目的这个时候有一个事 ， 就是欧洲在大规模的停电 ， 葡萄牙和西班牙 ， 还有法国 、 意大利的少部分地区 。

**徐凌杰** [1:23:46]
对 ， 这个问题对我们国家来讲 ，因为有比较好的这个基础设施 ， 问题没有那么尖锐 ，但是对于国外来讲确实是蛮大的一个问题 。

**Host** [1:23:53]
对 ，因为你刚才说这个脉冲神经网络的这种硬件 ， 今年的 GDC 大会上， 英伟达的 CTO 还有那个乐坤 ，他们也是有一个对话聊到了这个事情 。

然后里面有一个细节挺好玩的 ， 就是乐坤说他 80 年代的时候在贝尔实验室 ， 那会儿那个里面就有一个 team 的人在做这种神经网络的模拟硬件 。

就他是不太看好这个方向 ，因为他觉得这个方向已经研究了特别久 ， 然后之前看起来也不是特别 work。

对 ， 我觉得就是技术领域发展那些事情还是挺有意思的 ， 就它这个脉络 ，有些其实可能几十年前就出现的东西 ， 然后又过了很久你会发现它又获得了新的生机或者发挥了新的作用 。

比如说强化学习其实也出现很久了 ， 对吧 ？ 包括神经网络本身就是一个出现了特别久的东西 ， 然后中间冷了好几次 。

**徐凌杰** [1:24:37]
对 ， 这个历史会不断的重复 ， 只是会以这个不同的方式来呈现 。 我想不要低估任何一种这个技术的可能性 。

有时候是这个量变到质变 ，有时候是一个突变 。 包括我们今天看到的这个 DeepSeek， 可能之前我们寻到这个蛛丝马迹来讲的话 ，其实它是有迹可循的 。

包括他们之前发的一些新闻也好 ， 包括之前去年发的这个 V2 的这个模型也好 ，其实都是有迹可循的 。

但对于很多人来讲的话 ， 它是一个突变 。 我想未来要解决这些这个计算效率的一些问题的话 ， 对于一些新型的一些这个计算范式来讲 ， 我觉得都是需要去持续去关注的 。

因为哪天它颠覆你的时候 ， 你就来不及了 。

**Host** [1:25:18]
好 ， 那今天非常感谢徐凌杰做客晚点聊 ， 分享了对华为 CloudMatrix 384 超节点的解读 。 当然华为自己把这个叫超节点 ， 然后徐老师也是一开头就说了 ，其实可能严格意义上来说它还不是一个超节点 。

我们也从这个新的超节点延展聊到了 AI 算力基础层是怎么构成的 ，以及这个领域可能会有哪些新的趋势和变化 。

像英伟达作为这个领域最强势的一个玩家 ， 它接下来短期长期可能会面临什么样的情形 。 今天的节目就到这里 ， 感谢各位的收听 ， 大家再见 ， 拜拜 。

**徐凌杰** [1:25:53]
晚点的听众们再见 。

**Host** [1:25:59]
本期连剪呈现 ， 分享两个和之前节目的呼应 。 一是 103 期聊大模型注意力的那一期 ， 我们聊到了 Transformer 结构的大模型在把上下文做得更常识的限制 ， 就是 GPU 的显存大小和计算能力 。Flash Attention 等系统层的优化 ， 稀疏注意力和线性注意力的探索 ， 都是在解决 GPU 的这些硬件瓶颈 。

长期看 ， 随上下文继续变长 ， 显存可能是比计算更大的问题 。 一个数字是从 2021 年英伟达发布的 A100， 到 2025 年发布的 B200，GPU 算力增长了 64 倍 ，而显存的大小只增长了 1.2 倍 。

这期节目中也聊到 GPU 的成本结构 ，也在以用于计算的晶圆为主 ， 变为以显存为主 。 超节点某种程度就有利于弥补显存的问题 ， 比如通过 NVLink 连接的 GPU 可以合并显存 。103 期节目中， 关于注意力发展的讨论也很好反映了徐凌杰在这期中总结的 AI 算力演变的主线 ， 就是更大的问题需要更大的模型来解决 ，而更大的模型需要更大的算力系统来支撑 。

二是对于一些想补充芯片基础信息的朋友 ， 推荐晚点聊的两期老节目 ， 一个是 32 期 ， 我们与 B 站芯片科技 Up 主谈三圈 ， 聊了他了解的芯片行业 。他曾在德国的一家汽车芯片厂商工作 。

那一期我们以汽车芯片为例 ， 讲了芯片产业的分工 、 芯片制造环节 。 另一个是 49 期 ， 嘉宾是芯片简史的作者汪波老师 。

我们从一些对芯片行业的常见误读开始聊 ， 介绍了摩尔定律串起的芯片进化史 ，CPU、GPU 等主流计算芯片的崛起和沉浮 ，以及美日等芯片大国的历史发展经验 。

感兴趣的朋友可以找来听一听 。

本期节目就到这里 ， 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 ， 欢迎在评论区分享想法 ， 这也会成为我们节目的一部分 ， 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 ， 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk，也欢迎关注我们的公众号晚点 LatePost。 下期再见

。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
