<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>大模型算力 | 面条的草稿箱</title><description>无原创，纯转发</description><link>http://drafts.miantiao.me</link><item><title>算力战国策：拆解主流 AI 芯片的技术哲学与架构之争在摩尔定律与登纳德缩放定律放缓后，AI 算力迎来爆发</title><link>http://drafts.miantiao.me/posts/178</link><guid isPermaLink="true">http://drafts.miantiao.me/posts/178</guid><pubDate>Wed, 26 Aug 2026 15:50:31 GMT</pubDate><content:encoded>&lt;b&gt;算力战国策：拆解主流 AI 芯片的技术哲学与架构之争&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;在摩尔定律与登纳德缩放定律放缓后，AI 算力迎来爆发。大模型计算本质上是海量的矩阵乘法（GEMM / GEMV），而决定性能天花板的从来不是单纯的峰值算力，而是&lt;b&gt;数据移动速度——即如何攻破“内存墙”（Memory Wall）&lt;/b&gt;。&lt;br /&gt;&lt;br /&gt;各大芯片巨头对此给出了截然不同的答卷，形成了当下六大主流 AI 芯片路线：&lt;br /&gt;&lt;br /&gt;---&lt;br /&gt;&lt;br /&gt;&lt;b&gt;1. NVIDIA GPU：极致通用与生态壁垒&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：高度并行的通用处理器。通过 CUDA 保留统一的编程模型，将硬件复杂度包装在 SM 与 Tensor Core 背后。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：通过硬件管理缓存与海量线程（Warp）隐藏访存延迟；从 Blackwell 到 Rubin，引入 TMEM、异步 TMA 与微缩精度（FP4/NVFP4）。&lt;br /&gt;•   &lt;b&gt;扩展体系&lt;/b&gt;：NVLink + NVSwitch 构建低延迟共享内存域；机架级（如 NVL72 / NVL576）坚持采用无源铜缆背板，以极低功耗实现高达 130 TB/s 的全对全互联。&lt;br /&gt;•   &lt;b&gt;护城河&lt;/b&gt;：二十年积累的 CUDA 开发者生态与深度优化的算子库（FlashAttention、CUTLASS 等）。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;2. Google TPU：脉动阵列与编译器至上&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：专为矩阵乘法而生的专用机器。剔除硬件调度器、分支预测和缓存，把每一拍的调度完全交给 XLA 编译器。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：权重常驻（Weight-Stationary）的 MXU 脉动阵列，搭配纯软件管理的暂存内存（VMEM/CMEM）；引入 SparseCore 处理非规则的 Embedding 与推荐负载。&lt;br /&gt;•   &lt;b&gt;扩展体系&lt;/b&gt;：以 3D-Torus（环面拓扑）为核心，配合独创的 Palomar OCS（3D-MEMS 光电路交换机），实现无需停机的动态拓扑重构与近万卡级（Ironwood / TPU v8）超大规模 Scale-up Pod。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;3. AMD Instinct：先进封装与开源联盟&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：CU 核心架构保持稳健，把算力红利押注在 3D 堆叠封装（TSMC SoIC）与更大容量的 HBM 上。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：首创 3D 堆叠 GPU 与 CPU+GPU 统一内存架构（MI300A）；配备 256MB 超大 Infinity Cache 缓解访存压力。&lt;br /&gt;•   &lt;b&gt;扩展体系&lt;/b&gt;：推进开放互联标准 UALink 与以太网 RDMA 标准（UEC/UET），在 Helios 机架上正面迎击 NVL72。&lt;br /&gt;•   &lt;b&gt;软件生态&lt;/b&gt;：以 ROCm、HIP、Triton 和 vLLM 为抓手，依托开源社区追赶 CUDA 性能。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;4. Cerebras WSE：不切晶圆的极速怪兽&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：内存墙源于把晶圆切成小芯片。Cerebras 直接把整块 300mm 晶圆做成单颗芯片（46,225 mm²）。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：片上拥有 90 万个数据流核心和 44GB 超高速 SRAM，内部聚合带宽高达 21 PB/s，无 HBM 瓶颈。&lt;br /&gt;•   &lt;b&gt;应用场景&lt;/b&gt;：极限追求单 Token 的生成延迟（Decode 速度远超 GPU 数倍），但受限于 SRAM 成本与容量，更适合作为极致低延迟的专用推理节点。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;5. AWS Trainium：云端全栈性价比&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：芯片是云服务的组件，只需在 AWS 内部体系内战胜采购 NVIDIA 的成本。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：借鉴 TPU 的脉动阵列与 OpenXLA 体系，同时在硬件层面原生集成 CC-Core（集合通信核心），让通信与计算在硅片上真正完全并发。&lt;br /&gt;•   &lt;b&gt;扩展体系&lt;/b&gt;：自研 NeuronSwitch 扁平互联 + Nitro EFA/SRD 弹性以太网，支撑了 Anthropic 百万卡级别的超大规模集群。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;6. Groq LPU：消除一切不确定性的纯静态架构&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;核心哲学&lt;/b&gt;：移除所有硬件仲裁器、缓存与动态调度，打造完全确定性（Deterministic）的处理器，执行时间在编译期精确到周期。&lt;br /&gt;•   &lt;b&gt;架构亮点&lt;/b&gt;：片上全 SRAM 空间流式处理，数据如流水线般穿过功能切片；多卡之间无需交换机，纯静态编译路由。&lt;br /&gt;•   &lt;b&gt;最终归宿&lt;/b&gt;：单卡容量极小、扩展成本高，其低延迟推理技术最终被英伟达吸收，作为超低延迟推理协处理器协同工作。&lt;br /&gt;&lt;br /&gt;---&lt;br /&gt;&lt;br /&gt;&lt;b&gt;&lt;i class=&quot;emoji&quot;&gt;&lt;b&gt;💡&lt;/b&gt;&lt;/i&gt; 核心趋势与行业共识&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;1.  &lt;b&gt;单芯片算力趋同，系统工程定胜负&lt;/b&gt;：各家旗舰的单芯片 FP8/FP4 峰值已十分接近，竞争焦点彻底转向机架级互联（Scale-up 域大小）、光电混合交换与液冷系统工程。&lt;br /&gt;2.  &lt;b&gt;两极化的内存博弈&lt;/b&gt;：一条路是以 HBM 为代表的大容量路线（满足长上下文与大批次吞吐）；另一条路是以纯 SRAM 为代表的高带宽路线（追求单用户极致低延迟）。&lt;br /&gt;3.  &lt;b&gt;软件范式收敛&lt;/b&gt;：从早期的手写专用底层算子，正逐步向 Triton、MLIR、XLA 等现代编译中间层收敛，软硬件解耦正在打破单一供应商的生态锁定。&lt;br /&gt;&lt;br /&gt;&lt;i class=&quot;emoji&quot;&gt;&lt;b&gt;🔗&lt;/b&gt;&lt;/i&gt; 原文链接：&lt;a href=&quot;https://www.jacobpeake.com/ai-chip-architectures&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;https://www.jacobpeake.com/ai-chip-architectures&quot;&gt;https://www.jacobpeake.com/ai-chip-architectures&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23AI%E8%8A%AF%E7%89%87&quot; title=&quot;#AI芯片&quot;&gt;#AI芯片&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%8D%8A%E5%AF%BC%E4%BD%93%E6%9E%B6%E6%9E%84&quot; title=&quot;#半导体架构&quot;&gt;#半导体架构&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23NVIDIA&quot; title=&quot;#NVIDIA&quot;&gt;#NVIDIA&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23TPU&quot; title=&quot;#TPU&quot;&gt;#TPU&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%A4%A7%E6%A8%A1%E5%9E%8B%E7%AE%97%E5%8A%9B&quot; title=&quot;#大模型算力&quot;&gt;#大模型算力&lt;/a&gt;&lt;a class=&quot;tgme_widget_message_link_preview&quot; href=&quot;https://jacobpeake.com/ai-chip-architectures&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;A look at AI Chip Architectures. NVIDIA, AMD, TPUs, Trainium, Groq, Cerebras.&quot;&gt;
  
  &lt;div class=&quot;link_preview_site_name accent_color&quot;&gt;Jacob Peake&lt;/div&gt;
  &lt;img class=&quot;link_preview_image&quot; alt=&quot;AI Chip Architectures&quot; src=&quot;https://drafts.miantiao.me/static/https://cdn4.telesco.pe/file/ANonkYHNLE9TtJ11kk1m8FndufoK6lSxFmTv9PLHm3SeKoKh9eMVYItAFbGsnlYIb_lWhxu-c1Z7mty6VJ4jvw9F4JEXMH8c5DzGcKYDDuU6EXgMrCKfEUSnbw4IGI1pKKLmBKZK_Ryx5aqgmXnWfsNiBbimJjMcW6D5RsKlQwFs2SaM7skli--qbGLGqfH9Jw6SPUv7kO5TUpOKCVaddmgutVQyqVC_7rHCqbK1WwmIRwdlib-3C67gVysFSU2VjOp4pwN2eaBrw5SmyWShBUcMO17QOLgJFZ-1-g_MwRNDmgRDUckxm1fm6nX2qfcVSkrD5mXic2ZNi5zk5Z9TtQ.jpg&quot; width=&quot;1200&quot; height=&quot;630&quot; loading=&quot;eager&quot; /&gt;
  &lt;div class=&quot;link_preview_title&quot;&gt;AI Chip Architectures&lt;/div&gt;
  &lt;div class=&quot;link_preview_description&quot;&gt;A look at AI Chip Architectures. NVIDIA, AMD, TPUs, Trainium, Groq, Cerebras.&lt;/div&gt;
&lt;/a&gt;</content:encoded></item><item><title>AI 记忆系统不该靠“设计”，而应靠“演化”如今，开发者们热衷于为 AI 助手构建各种复杂的记忆架构，比如向量检索、知识图谱、语义记忆、遗忘机制等</title><link>http://drafts.miantiao.me/posts/149</link><guid isPermaLink="true">http://drafts.miantiao.me/posts/149</guid><pubDate>Sun, 28 Jun 2026 07:23:27 GMT</pubDate><content:encoded>AI 记忆系统不该靠“设计”，而应靠“演化”&lt;br /&gt;&lt;br /&gt;如今，开发者们热衷于为 AI 助手构建各种复杂的记忆架构，比如向量检索、知识图谱、语义记忆、遗忘机制等。但作者指出，这个领域存在一个奇怪的失衡：&lt;b&gt;我们花了太多精力去“发明”记忆架构，却很少花精力去评估这些系统是否真的让 Agent 在长期交互中变得更好。&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;很多所谓的记忆系统，大多只是基于开发者个人对“好记忆”的狭隘定义而做出的过度工程（Over-engineering）。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;&lt;i class=&quot;emoji&quot;&gt;&lt;b&gt;💡&lt;/b&gt;&lt;/i&gt; 核心观点：记忆是“涌现”出来的&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;记忆并不是系统的第一顺位基础能力。相反，&lt;b&gt;记忆是在持续交互的压力下，为了让系统表现得更好而涌现出来的“二阶效应”。&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;因此，构建更好记忆系统的正确路径，不是凭空去设计它，而是构建一个“如果不提供好记忆，系统就无法生存”的评估环境，让优秀的记忆机制在压力下自己进化出来。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;&lt;i class=&quot;emoji&quot;&gt;&lt;b&gt;⚠️&lt;/b&gt;&lt;/i&gt; 现有静态评估的缺陷&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;目前的记忆评估大多是静态的：给 AI 一段历史记录，问一个当前问题，检查 AI 能否检索到相关事实。&lt;br /&gt;这种方式的弊端显而易见：&lt;br /&gt;&lt;br /&gt;•   它只能测试单一时间节点的检索能力。&lt;br /&gt;•   它无法评估记忆随着时间推移的更新、冲突解决和衰减。&lt;br /&gt;•   它忽略了用户体验的反馈循环——如果 AI 记忆表现不佳，用户在现实中会逐渐失去耐心，减少或停止相关交互。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;&lt;i class=&quot;emoji&quot;&gt;&lt;b&gt;🛠️&lt;/b&gt;&lt;/i&gt; 理想的“纵向记忆评估”方案&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;为了解决这一问题，我们需要构建一个**纵向记忆评估（Longitudinal Eval）**环境，主要包含以下要素：&lt;br /&gt;&lt;br /&gt;1.  &lt;b&gt;可重放的交互历史与未来依赖&lt;/b&gt;：模拟一连串（例如 200 次）的连续对话，后续的测试点会深度依赖前期的隐性偏好或数据。&lt;br /&gt;2.  &lt;b&gt;动态用户模拟（User Simulation）&lt;/b&gt;：用模拟的用户 Agent 来产生真实的对话。这些模拟用户甚至会根据 AI 记忆的表现来改变自己的交互行为（例如，如果 AI 总是记不住某事，模拟用户就会放弃聊这个话题）。&lt;br /&gt;3.  &lt;b&gt;多维度的评分机制&lt;/b&gt;：不仅评估回答是否正确，还要权衡记忆质量与计算成本、延迟之间的关系，避免一味追求高分而使用在生产环境中无法落地的高昂算力。&lt;br /&gt;&lt;br /&gt;&lt;b&gt;结语&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;不要再尝试自上而下地去设计完美的记忆架构了。我们应该先建好“角斗场”（评估环境），让环境压力筛选出最合理的记忆方案。&lt;br /&gt;&lt;br /&gt;阅读原文：&lt;a href=&quot;https://linghao.io/posts/memory-systems-should-be-evolved&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;https://linghao.io/posts/memory-systems-should-be-evolved&quot;&gt;https://linghao.io/posts/memory-systems-should-be-evolved&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD&quot; title=&quot;#人工智能&quot;&gt;#人工智能&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23AI_Agent&quot; title=&quot;#AI_Agent&quot;&gt;#AI_Agent&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E8%AE%B0%E5%BF%86%E7%B3%BB%E7%BB%9F&quot; title=&quot;#记忆系统&quot;&gt;#记忆系统&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%A4%A7%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B&quot; title=&quot;#大语言模型&quot;&gt;#大语言模型&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E7%B3%BB%E7%BB%9F%E8%AF%84%E4%BC%B0&quot; title=&quot;#系统评估&quot;&gt;#系统评估&lt;/a&gt;&lt;a class=&quot;tgme_widget_message_link_preview&quot; href=&quot;https://linghao.io/posts/memory-systems-should-be-evolved&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;AI memory systems are often designed as architectural bets: vector stores, profiles, summaries, graphs, etc. This post argues for a different starting point: build longitudinal eval environments where systems without good memory cannot survive, then let better…&quot;&gt;
  
  &lt;div class=&quot;link_preview_site_name accent_color&quot;&gt;linghao.io&lt;/div&gt;
  &lt;img class=&quot;link_preview_image&quot; alt=&quot;Evolving Memory Systems: An Eval-First Approach&quot; src=&quot;https://drafts.miantiao.me/static/https://cdn4.telesco.pe/file/FaDgcJbsAA5_BNDjdKgvT9vy84rXMYS-oMqcptSzdjOFpl8OYz_oYgPf6MSkMT0C_moqD2DWiSXlSaH7vs4ePIt01xaq0Ym2zFDAsorkC7CQveWB66xPd_MdWOQ3V23dqgMdmnWOmnMzPClcTUNNtubf04oRiWM45X8yIfdkYrOmzu39aPDqi8tHY7uaQs3TZpNJBb02Ci22FKKxu5PYirs5IuQd9lMF46EBBaAO18icVbfqYv5tvCzkAbcmXc63Miaz3hlpNoEmG23AILR1Pxe9XT1UNRjiDl5s5MNmapRZ2fbH9RzQNA_jH-7xFOVAl_JnUnXjqx0iUWTS91Qtcw.jpg&quot; width=&quot;1200&quot; height=&quot;630&quot; loading=&quot;eager&quot; /&gt;
  &lt;div class=&quot;link_preview_title&quot;&gt;Evolving Memory Systems: An Eval-First Approach&lt;/div&gt;
  &lt;div class=&quot;link_preview_description&quot;&gt;AI memory systems are often designed as architectural bets: vector stores, profiles, summaries, graphs, etc. This post argues for a different starting point: build longitudinal eval environments where systems without good memory cannot survive, then let better…&lt;/div&gt;
&lt;/a&gt;</content:encoded></item><item><title>大语言模型（LLM）是如何运作的？一文拆解它的底层逻辑从 GPT、Claude 到 LLaMA，大语言模型看似无所不知，但其背后的技术大多高度收敛于 Transformer 架构</title><link>http://drafts.miantiao.me/posts/133</link><guid isPermaLink="true">http://drafts.miantiao.me/posts/133</guid><pubDate>Mon, 08 Jun 2026 09:59:52 GMT</pubDate><content:encoded>大语言模型（LLM）是如何运作的？一文拆解它的底层逻辑&lt;br /&gt;&lt;br /&gt;从 GPT、Claude 到 LLaMA，大语言模型看似无所不知，但其背后的技术大多高度收敛于 Transformer 架构。本文为你快速拆解 LLM 运行的 6 个核心步骤：&lt;br /&gt;&lt;br /&gt;1.  &lt;b&gt;分词与嵌入（Tokenization &amp;amp; Embeddings）&lt;/b&gt;&lt;br /&gt;    模型不直接阅读文本。你的输入首先会被拆解为子词 Token，并转化为数字 ID。随后，这些 ID 通过“嵌入矩阵”变成高维向量。在向量空间中，语义相近的词（如“猫”和“狗”）会被分配到相邻的位置，从而获得“语义”。&lt;br /&gt;&lt;br /&gt;2.  &lt;b&gt;位置编码（Positional Encoding）&lt;/b&gt;&lt;br /&gt;    普通的注意力机制无法分辨词序。现代模型主要使用 &lt;b&gt;RoPE（旋转位置编码）&lt;/b&gt;，通过旋转向量来标记 Token 之间的相对距离，让模型知道哪个词在前，哪个词在后。&lt;br /&gt;&lt;br /&gt;3.  &lt;b&gt;注意力机制（Attention &amp;amp; Multi-Head）&lt;/b&gt;&lt;br /&gt;    这是 Transformer 的灵魂。每个 Token 会通过 Query（寻找什么）、Key（匹配什么）和 Value（传递什么）三种角色与其他 Token 进行信息交互。为了同时捕捉语法、代词指代等多种关系，模型会并行运行多个注意力“头”。现代模型多采用 &lt;b&gt;GQA（分组查询注意力）&lt;/b&gt; 来大幅降低显存占用。&lt;br /&gt;&lt;br /&gt;4.  &lt;b&gt;前馈网络（FFN &amp;amp; MoE）&lt;/b&gt;&lt;br /&gt;    如果说注意力机制是 Token 之间的“对话”，前馈网络就是 Token 的“自我思考”。模型的大部分 factual 记忆都存储在这里。为了在不增加计算成本的前提下扩大参数量，现代大模型（如 Mixtral）常使用 &lt;b&gt;MoE（混合专家模型）&lt;/b&gt;，每次只激活部分网络来处理 Token。&lt;br /&gt;&lt;br /&gt;5.  &lt;b&gt;残差流与归一化（Residual Stream &amp;amp; RMSNorm）&lt;/b&gt;&lt;br /&gt;    随着网络层数变深，信号容易衰减或爆炸。残差连接允许原始信息绕过部分计算直接向后传递，而 &lt;b&gt;RMSNorm&lt;/b&gt; 则在每层计算前对数据进行重缩放，确保数百层的网络能够稳定训练。&lt;br /&gt;&lt;br /&gt;6.  &lt;b&gt;预测下一个 Token（Next-Token Prediction）&lt;/b&gt;&lt;br /&gt;    LLM 的本质是一个“词语接龙”游戏。模型在最后一层输出所有候选词的概率分布，根据设定的“温度（Temperature）”等参数抽取下一个 Token，并将其拼回输入，循环往复，直到生成完整文本。&lt;br /&gt;&lt;br /&gt;总结来说，如今的 LLM 架构在工程上已经高度趋同（RoPE、GQA、SwiGLU、RMSNorm 的组合）。不同模型之间的差异，主要源于训练数据集、参数规模以及后期的对齐微调（RLHF）。&lt;br /&gt;&lt;br /&gt;阅读完整英文博文：&lt;a href=&quot;https://www.0xkato.xyz/how-llms-actually-work/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;https://www.0xkato.xyz/how-llms-actually-work/&quot;&gt;https://www.0xkato.xyz/how-llms-actually-work/&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23%E5%A4%A7%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B&quot; title=&quot;#大语言模型&quot;&gt;#大语言模型&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Transformer&quot; title=&quot;#Transformer&quot;&gt;#Transformer&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD&quot; title=&quot;#人工智能&quot;&gt;#人工智能&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0&quot; title=&quot;#深度学习&quot;&gt;#深度学习&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%8A%80%E6%9C%AF%E7%A7%91%E6%99%AE&quot; title=&quot;#技术科普&quot;&gt;#技术科普&lt;/a&gt;&lt;a class=&quot;tgme_widget_message_link_preview&quot; href=&quot;https://0xkato.xyz/how-llms-actually-work&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;A from-the-ground-up walkthrough of how modern LLMs work, from tokens to transformer blocks to the next-token loop&quot;&gt;
  
  &lt;div class=&quot;link_preview_site_name accent_color&quot;&gt;0xkato&lt;/div&gt;
  
  &lt;div class=&quot;link_preview_title&quot;&gt;How LLMs Actually Work&lt;/div&gt;
  &lt;div class=&quot;link_preview_description&quot;&gt;A from-the-ground-up walkthrough of how modern LLMs work, from tokens to transformer blocks to the next-token loop&lt;/div&gt;
&lt;/a&gt;</content:encoded></item></channel></rss>