<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>TPU | 面条的草稿箱</title><description>无原创，纯转发</description><link>http://drafts.miantiao.me</link><item><title>算力战国策：拆解主流 AI 芯片的技术哲学与架构之争在摩尔定律与登纳德缩放定律放缓后，AI 算力迎来爆发</title><link>http://drafts.miantiao.me/posts/178</link><guid isPermaLink="true">http://drafts.miantiao.me/posts/178</guid><pubDate>Wed, 26 Aug 2026 15:50:31 GMT</pubDate><content:encoded>&lt;b&gt;算力战国策：拆解主流 AI 芯片的技术哲学与架构之争&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;在摩尔定律与登纳德缩放定律放缓后，AI 算力迎来爆发。大模型计算本质上是海量的矩阵乘法（GEMM / GEMV），而决定性能天花板的从来不是单纯的峰值算力，而是&lt;b&gt;数据移动速度——即如何攻破“内存墙”（Memory Wall）&lt;/b&gt;。&lt;br /&gt;&lt;br /&gt;各大芯片巨头对此给出了截然不同的答卷，形成了当下六大主流 AI 芯片路线：&lt;br /&gt;&lt;br /&gt;---&lt;br /&gt;&lt;br /&gt;&lt;b&gt;1. NVIDIA GPU：极致通用与生态壁垒&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：高度并行的通用处理器。通过 CUDA 保留统一的编程模型，将硬件复杂度包装在 SM 与 Tensor Core 背后。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：通过硬件管理缓存与海量线程（Warp）隐藏访存延迟；从 Blackwell 到 Rubin，引入 TMEM、异步 TMA 与微缩精度（FP4/NVFP4）。&lt;br /&gt;•   &lt;b&gt;扩展体系&lt;/b&gt;：NVLink + NVSwitch 构建低延迟共享内存域；机架级（如 NVL72 / NVL576）坚持采用无源铜缆背板，以极低功耗实现高达 130 TB/s 的全对全互联。&lt;br /&gt;•   &lt;b&gt;护城河&lt;/b&gt;：二十年积累的 CUDA 开发者生态与深度优化的算子库（FlashAttention、CUTLASS 等）。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;2. Google &lt;/b&gt;&lt;mark class=&quot;highlight&quot;&gt;&lt;b&gt;TPU&lt;/b&gt;&lt;/mark&gt;&lt;b&gt;：脉动阵列与编译器至上&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：专为矩阵乘法而生的专用机器。剔除硬件调度器、分支预测和缓存，把每一拍的调度完全交给 XLA 编译器。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：权重常驻（Weight-Stationary）的 MXU 脉动阵列，搭配纯软件管理的暂存内存（VMEM/CMEM）；引入 SparseCore 处理非规则的 Embedding 与推荐负载。&lt;br /&gt;•   &lt;b&gt;扩展体系&lt;/b&gt;：以 3D-Torus（环面拓扑）为核心，配合独创的 Palomar OCS（3D-MEMS 光电路交换机），实现无需停机的动态拓扑重构与近万卡级（Ironwood / &lt;mark class=&quot;highlight&quot;&gt;TPU&lt;/mark&gt; v8）超大规模 Scale-up Pod。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;3. AMD Instinct：先进封装与开源联盟&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：CU 核心架构保持稳健，把算力红利押注在 3D 堆叠封装（TSMC SoIC）与更大容量的 HBM 上。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：首创 3D 堆叠 GPU 与 CPU+GPU 统一内存架构（MI300A）；配备 256MB 超大 Infinity Cache 缓解访存压力。&lt;br /&gt;•   &lt;b&gt;扩展体系&lt;/b&gt;：推进开放互联标准 UALink 与以太网 RDMA 标准（UEC/UET），在 Helios 机架上正面迎击 NVL72。&lt;br /&gt;•   &lt;b&gt;软件生态&lt;/b&gt;：以 ROCm、HIP、Triton 和 vLLM 为抓手，依托开源社区追赶 CUDA 性能。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;4. Cerebras WSE：不切晶圆的极速怪兽&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：内存墙源于把晶圆切成小芯片。Cerebras 直接把整块 300mm 晶圆做成单颗芯片（46,225 mm²）。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：片上拥有 90 万个数据流核心和 44GB 超高速 SRAM，内部聚合带宽高达 21 PB/s，无 HBM 瓶颈。&lt;br /&gt;•   &lt;b&gt;应用场景&lt;/b&gt;：极限追求单 Token 的生成延迟（Decode 速度远超 GPU 数倍），但受限于 SRAM 成本与容量，更适合作为极致低延迟的专用推理节点。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;5. AWS Trainium：云端全栈性价比&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：芯片是云服务的组件，只需在 AWS 内部体系内战胜采购 NVIDIA 的成本。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：借鉴 &lt;mark class=&quot;highlight&quot;&gt;TPU&lt;/mark&gt; 的脉动阵列与 OpenXLA 体系，同时在硬件层面原生集成 CC-Core（集合通信核心），让通信与计算在硅片上真正完全并发。&lt;br /&gt;•   &lt;b&gt;扩展体系&lt;/b&gt;：自研 NeuronSwitch 扁平互联 + Nitro EFA/SRD 弹性以太网，支撑了 Anthropic 百万卡级别的超大规模集群。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;6. Groq LPU：消除一切不确定性的纯静态架构&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：移除所有硬件仲裁器、缓存与动态调度，打造完全确定性（Deterministic）的处理器，执行时间在编译期精确到周期。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：片上全 SRAM 空间流式处理，数据如流水线般穿过功能切片；多卡之间无需交换机，纯静态编译路由。&lt;br /&gt;•   &lt;b&gt;最终归宿&lt;/b&gt;：单卡容量极小、扩展成本高，其低延迟推理技术最终被英伟达吸收，作为超低延迟推理协处理器协同工作。&lt;br /&gt;&lt;br /&gt;---&lt;br /&gt;&lt;br /&gt;&lt;b&gt;&lt;i class=&quot;emoji&quot;&gt;&lt;b&gt;💡&lt;/b&gt;&lt;/i&gt; 核心趋势与行业共识&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;1.  &lt;b&gt;单芯片算力趋同，系统工程定胜负&lt;/b&gt;：各家旗舰的单芯片 FP8/FP4 峰值已十分接近，竞争焦点彻底转向机架级互联（Scale-up 域大小）、光电混合交换与液冷系统工程。&lt;br /&gt;2.  &lt;b&gt;两极化的内存博弈&lt;/b&gt;：一条路是以 HBM 为代表的大容量路线（满足长上下文与大批次吞吐）；另一条路是以纯 SRAM 为代表的高带宽路线（追求单用户极致低延迟）。&lt;br /&gt;3.  &lt;b&gt;软件范式收敛&lt;/b&gt;：从早期的手写专用底层算子，正逐步向 Triton、MLIR、XLA 等现代编译中间层收敛，软硬件解耦正在打破单一供应商的生态锁定。&lt;br /&gt;&lt;br /&gt;&lt;i class=&quot;emoji&quot;&gt;&lt;b&gt;🔗&lt;/b&gt;&lt;/i&gt; 原文链接：&lt;a href=&quot;https://www.jacobpeake.com/ai-chip-architectures&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;https://www.jacobpeake.com/ai-chip-architectures&quot;&gt;https://www.jacobpeake.com/ai-chip-architectures&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23AI%E8%8A%AF%E7%89%87&quot; title=&quot;#AI芯片&quot;&gt;#AI芯片&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%8D%8A%E5%AF%BC%E4%BD%93%E6%9E%B6%E6%9E%84&quot; title=&quot;#半导体架构&quot;&gt;#半导体架构&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23NVIDIA&quot; title=&quot;#NVIDIA&quot;&gt;#NVIDIA&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23TPU&quot; title=&quot;#TPU&quot;&gt;#TPU&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%A4%A7%E6%A8%A1%E5%9E%8B%E7%AE%97%E5%8A%9B&quot; title=&quot;#大模型算力&quot;&gt;#大模型算力&lt;/a&gt;&lt;a class=&quot;tgme_widget_message_link_preview&quot; href=&quot;https://jacobpeake.com/ai-chip-architectures&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;A look at AI Chip Architectures. NVIDIA, AMD, TPUs, Trainium, Groq, Cerebras.&quot;&gt;
  
  &lt;div class=&quot;link_preview_site_name accent_color&quot;&gt;Jacob Peake&lt;/div&gt;
  &lt;img class=&quot;link_preview_image&quot; alt=&quot;AI Chip Architectures&quot; src=&quot;https://drafts.miantiao.me/static/https://cdn4.telesco.pe/file/ANonkYHNLE9TtJ11kk1m8FndufoK6lSxFmTv9PLHm3SeKoKh9eMVYItAFbGsnlYIb_lWhxu-c1Z7mty6VJ4jvw9F4JEXMH8c5DzGcKYDDuU6EXgMrCKfEUSnbw4IGI1pKKLmBKZK_Ryx5aqgmXnWfsNiBbimJjMcW6D5RsKlQwFs2SaM7skli--qbGLGqfH9Jw6SPUv7kO5TUpOKCVaddmgutVQyqVC_7rHCqbK1WwmIRwdlib-3C67gVysFSU2VjOp4pwN2eaBrw5SmyWShBUcMO17QOLgJFZ-1-g_MwRNDmgRDUckxm1fm6nX2qfcVSkrD5mXic2ZNi5zk5Z9TtQ.jpg&quot; width=&quot;1200&quot; height=&quot;630&quot; loading=&quot;eager&quot; /&gt;
  &lt;div class=&quot;link_preview_title&quot;&gt;AI Chip Architectures&lt;/div&gt;
  &lt;div class=&quot;link_preview_description&quot;&gt;A look at AI Chip Architectures. NVIDIA, AMD, &lt;mark class=&quot;highlight&quot;&gt;TPUs&lt;/mark&gt;, Trainium, Groq, Cerebras.&lt;/div&gt;
&lt;/a&gt;</content:encoded></item></channel></rss>