引言与分析框架
当前关于人工智能基础设施的讨论经常忽略集群级训练与推理操作的基础机制。近期一次以结构化黑板讲座形式进行的技术探讨旨在弥补这一空白,通过考察大语言模型部署的实际运行工况。本次对话由硬件初创公司MatX的首席执行官Reiner Pope与谷歌张量处理单元(TPU)的底层架构师共同参与。会话旨在破除迷思,解释为何人工智能系统呈现出特定的延迟表现、成本结构与架构限制。核心论点认为,理解批大小、内存带宽与计算吞吐量之间的关系,揭示了现代人工智能的底层经济规律。若缺乏精细的数学建模与硬件级规格参数,关于速度、定价和模型扩展的声明往往仅为推测。讨论建立了一个分析大规模计算集群上部署的Transformer架构的框架,以Blackwell NVL72机架配置为基准参考。该配置包含72个GPU,并通过专用网络设备进行互联。分析方法基于两大核心原则:比较内存带宽与计算性能的屋顶线分析(Roofline Analysis),以及将推理操作分解为权重矩阵乘法耗时与上下文向量缓存获取耗时。目标不仅是描绘理论极限,更是量化这些变量如何相互作用以确定实际延迟、运营支出和系统可扩展性。讨论强调,人工智能的进步从根本上受限于硬件拓扑结构、内存层级和经济效益优化策略,而非纯粹的算法创新。通过映射这些限制,该分析为API定价、模型架构选择及推理速度随行业发展的演变提供了预测模型。
批大小与延迟的数学原理
为建立推理操作的预测模型,分析首先量化了在计算集群上执行单次前向传播所需的时间。该方法避免做出精确预测(由于工作负载分布的变异性,这本质上是不可行的),而是确定执行时间的下限。推理周期的总时长由两个相互竞争的因素决定:计算处理时间和内存检索时间。计算时间由批大小与模型中活跃参数数量的乘积,除以硬件的理论每秒浮点运算次数(FLOPS)得出。该计算涵盖了所有层中处理输入向量与权重矩阵相乘所需的时间。内存检索时间则通过累加获取全部模型参数所需的时间与获取批大小中每个元素的键值缓存(KV Cache)条目所需的时间来计算。键值缓存是一种存储已处理标记内部表示的内存结构,允许新标记在不重新计算前置层的情况下关注历史上下文。讨论阐述了自回归生成过程,其中每个新生成的标记在通过模型进行完整前向传播的同时,还会查询存储的键值缓存以确定上下文关系。这种注意力机制严重受限于内存带宽而非原始计算吞吐量,使得键值缓存耗时成为延迟计算中的关键变量。由此得出的方程表明,延迟并非批大小的线性函数。相反,它由两条相交曲线的最大值定义:一条是随批大小线性增长的线性计算时间曲线,另一条是随批大小增长而线性上升的复合内存检索曲线。计算时间曲线从零开始,随批大小扩大线性上升。内存检索曲线从一个非零基线开始,代表加载全部模型参数所需的固定时间,并随批大小扩大导致的键值缓存获取耗时增加而线性上升。这两条曲线的交点确定了计算与内存约束达到平衡的最佳运行点。该平衡点决定了特定硬件配置下的最低可实现延迟。讨论澄清,对于任何特定的硬件设置,延迟存在一个由将全部模型参数从内存传输至处理单元所需时间决定的硬性下限。任何计算优化都无法绕过这一物理极限。分析进一步探讨了上下文长度如何影响这一平衡。随着上下文长度增加,键值缓存获取耗时随之延长,导致内存曲线上移,并最终使内存带宽成为主要瓶颈。当内存检索曲线的斜率超过计算曲线斜率时,便会发生这种转变。斜率相等的交点代表特定硬件架构下的最佳上下文长度,因为它同时最大化了内存利用率和计算效率。讨论强调,偏离最佳上下文长度会显著降低机器利用效率,降幅往往很大。模型进一步指出,稀疏注意力机制通过将内存需求与上下文长度的平方根而非线性关系进行缩放,缓解了这种敏感性,尽管稀疏注意力的采用在各研究机构间仍不均衡。由此框架得出的方程为在不同批大小和上下文长度下估计系统行为提供了强有力的预测工具,使基础设施规划者能够将硬件投资与运营需求相一致。
内存带宽、计算吞吐量与成本曲线
在建立延迟框架后,分析转向经济建模,将计算时间转化为运营成本。推理操作的成本通过将操作持续时间与硬件单位时间的租赁价格相乘得出。成本优化的关键变量是每标记成本,由总推理时间除以批大小得出。当延迟方程除以批大小时,所得的成本曲线揭示了不同的行为模式。归一化到每个标记的计算时间成为常数,形成水平基线。归一化到每个标记的内存检索时间则转化为双曲线,当批大小趋近于1时趋向无穷大,随着批大小增加渐近趋于零。每个标记的总成本由这两个归一化曲线的最大值定义。在批大小为1时,每标记成本高昂得令人望而却步,因为全部模型参数的固定内存获取耗时未能分摊到多个请求中。随着批大小增加,固定内存成本分摊到更多并发请求上,导致每标记内存成本迅速下降。最终,计算成本占主导地位,确立了定价的硬性下限。该下限代表了处理标记所需的最低运营支出,完全由硬件的计算吞吐量决定。讨论利用此成本曲线解释了AI提供商提供的分层定价模型的经济性。承诺以溢价价格提供加速标记流的服务,实际上是通过增大批大小,从而利用更好的硬件利用率来降低延迟。相反,以较低费率提供较长处理时间的服务运行在接近计算下限的区域,此时硬件效率最大化,但用户等待时间延长。分析表明,简单地延长等待时间并不能显著降低成本,因为键值缓存操作和计算工作负载对每个批大小都是独特的。可实现的最小成本受限于硬件的浮点运算等级,与耐心或队列管理无关。成本曲线进一步说明了为何前沿模型无法在较小的批大小下高效运行。要实现经济上可行的定价,系统必须处理数千个并发请求以分摊内存获取的开销。讨论估计,前沿模型通常需要数千个并发序列的批大小才能达到实际的成本效率。这一需求与主要AI平台观察到的流量规模相一致,这些平台在全球每秒处理数亿个标记。成本分析确认,基础设施提供商必须设计能够处理海量并发工作负载的系统以保持竞争力。方程还凸显了独立优化内存带宽与计算吞吐量的经济激励。提高内存带宽的硬件会缩短固定的内存获取耗时,使较小的批大小也能达到可接受的成本。提高计算吞吐量的硬件会降低运营支出的下限,从而实现更便宜的长期服务。因此,成本曲线作为硬件投资决策的预测工具,指导制造商专注于最大化基础设施投资回报的组件。
最佳批大小设定与现实硬件限制
计算与内存时间曲线的交点为确定避免内存带宽瓶颈所需的最小批大小提供了数学解。通过将权重矩阵乘法的耗时与内存参数获取的耗时相等,分析得出一个无量纲的硬件常数,其值约为三百。该常数代表了浮点运算与内存带宽的比率,这一指标在从Hopper到Blackwell再到未来架构的各代GPU中始终保持惊人稳定。将此常数乘以模型的稀疏比率,即可得出最佳批大小。对于使用具有每上下文八个活跃参数的混合专家架构的模型,最佳批大小约为两千个并发序列。该数字与观察到的行业实践高度吻合,即提供商通常运行的批大小比理论最小值高两到三倍,以应对现实世界中的低效情况。讨论澄清,批大小指的是并发序列的数量,而非每个序列的标记数量。两千的批大小代表在一次前向传播中同时处理的两千个独立用户请求。分析探讨了该批大小对排队延迟的实际影响,采用公共交通类比的模型。计算集群运行在固定的调度周期上,通常为二十毫秒,这由读写高带宽内存阵列所需的时间决定。每个周期结束时,无论批大小是否已填满,都会启动新批次。恰好在批次发出后到达的请求必须等待下一个周期,从而增加最多二十毫秒的排队延迟。结合二十毫秒的处理耗时,最坏情况下的延迟达到四十毫秒。这种调度模型表明,延迟并非仅由计算复杂度决定,而是很大程度上受内存数据传输速率影响。高带宽内存阵列大约每十五至二十毫秒可完全读取和写入一次,确立了最小的调度间隔。讨论强调,硬件设计者必须平衡内存容量、带宽和调度间隔,以在最大化吞吐量的同时将延迟降至最低。最佳批大小主要仍取决于稀疏比率,而非模型总规模,这意味着越来越稀疏的架构将继续需要大型批大小以维持经济可行性。分析进一步探讨了该批大小对系统集中化的影响。两千个并发序列的批大小转化为每秒约十万两千个标记的系统吞吐量,这仅占前沿模型全球流量的一小部分。规模化竞争要求基础设施能够处理至少最大平台输出千分之一的流量,这一阈值要求具备复杂的路由和负载均衡机制。讨论总结道,最佳批大小设定是硬件拓扑与模型稀疏率的确定性函数,为基础设施规划者提供了明确的系统设计目标。
稀疏注意力、混合专家模型与通信拓扑
在分布式计算集群上部署混合专家模型时,对大型批大小的依赖引入了显著的架构挑战。混合专家架构将标记路由至专用子网络,在前向传播的每次迭代中仅激活总参数的一小部分。这种稀疏性降低了计算需求,但增加了内存容量需求,因为未激活的参数仍需存储并按需路由。讨论将混合专家层在标准计算机架上的硬件布局进行映射,揭示了决定系统性能的通信模式。每个传入的标记通过路由机制,从32个可用专家中选择一个较小的子集,通常为1到3个。每个专家作为一个带有上下投影层的标准多层感知机运行,输出在添加至残差连接前进行聚合。路由机制将不同专家分配至独立的计算单元,形成所谓的专家并行模式。该配置要求机架内所有计算单元之间进行全对全(All-to-All)通信,因为任何单元都可能需要根据路由决策向任何其他单元传输数据。讨论指出,现代计算机架专门为此通信模式设计。Nvidia的机架拓扑将计算单元置于外围,网络交换机置于内部,使每个单元都能通过两次网络跳数与其他所有单元通信。这种垂直扩展(Scale-up)网络提供了匹配混合专家路由需求的高带宽连接。然而,讨论指出了在单机架之外扩展时的一个关键限制。机架间的连接带宽约为机架内连接的八分之一,为混合专家部署造成了重大瓶颈。当标记必须跨越机架边界时,较慢的水平扩展(Scale-out)网络限制了整体吞吐量。这一限制解释了为何基础设施提供商专注于扩大垂直扩展域,而非为推理工作负载构建更大的多机架部署。讨论考察了限制机架规模的物理约束,包括供电、热管理、重量分布和线缆密度。现代机架将这些物理限制推向极致,线缆密度和路由复杂度决定了最大芯片数量。从较小机架配置向更大配置(如未来架构计划部署的500个计算单元)的过渡,要求从根本上重新设计布线架构以维持连通性。讨论强调,稀疏注意力机制通过降低对上下文长度的敏感性,为内存带宽约束提供了部分解决方案,尽管经验性的质量下降仍是限制因素。稀疏性与模型质量之间的权衡取决于经验验证而非理论计算,要求研究机构在计算节省与性能损失之间取得平衡。分析总结道,混合专家架构将继续推动硬件设计向更大的垂直扩展域和更高的线缆密度发展,因为这些配置在最大化稀疏性经济效益的同时,最小化了通信瓶颈。
并行策略:专家、流水线与垂直扩展域
在多个机架上部署混合专家模型,需要实施平衡计算效率、内存容量和延迟约束的并行策略。讨论评估了四种主要并行方法:专家并行、张量并行、数据并行和流水线并行。专家并行(将不同专家路由至不同计算单元)由于与模型拓扑高度契合,被证明是混合专家架构的最优选择。张量并行(跨单元分割计算层)随着专家变小且数量增多,其相关性已降低。数据并行(跨单元复制整个模型以分配批次)为推理工作负载提供的优势有限。流水线并行(将模型的不同层分布至独立机架)成为管理内存容量约束的可行策略。讨论通过比较垂直扩展与水平扩展的带宽需求,推导出流水线并行的数学可行性条件。分析表明,当激活的专家数量、每阶段层数与路由复杂度的乘积超过水平扩展与垂直扩展带宽比率的八倍时,流水线并行将具有优势。该条件在现代模型中通常成立,使基础设施提供商能够在不招致过高延迟惩罚的情况下,将计算层分布至多个机架。讨论以图表形式说明了流水线并行的运行机制,展示了跨机架的计算阶段序列。每个阶段处理模型的一部分,并将中间结果传输至下一个机架。讨论指出了所谓的“流水线气泡”现象,即中间机架在等待上游阶段数据时处于空闲状态。在训练工作流中,流水线气泡代表显著的计算浪费,需要复杂的调度方案来最小化停机时间。在推理工作流中,流水线气泡可通过在前一请求批次完成后立即启动后续批次来轻松缓解,从而在不牺牲吞吐量的情况下消除空闲时间。讨论强调,流水线并行并不会改善延迟,但显著降低了每个机架的内存容量需求。通过将模型权重分布至多个机架,基础设施提供商可以使用每个计算单元较小的内存阵列,从而降低硬件成本。分析总结道,流水线并行对超过机架内存容量的模型最为有利,尤其是那些具有极端稀疏比率或极长上下文长度的模型。讨论进一步探讨了流水线并行的经济影响,指出基础设施提供商必须权衡内存容量节省与跨机架通信带来的延迟惩罚。分析表明,前沿模型将继续偏好带有最小流水线并行的大型垂直扩展域,因为这些配置在最小化延迟的同时最大化计算吞吐量。讨论指出,成功的并行策略将物理硬件拓扑与模型架构对齐,表明基础设施设计应反映计算需求,而非将模型强行塞入僵化的硬件限制中。分析总结道,流水线并行将作为管理内存容量的补充工具,而专家并行与垂直扩展域的扩张将主导推理基础设施设计。
内存墙、容量约束与缩放定律
讨论涉及众所周知的内存墙限制,即内存硬件成本已占主导地位,成为基础设施支出的核心。超大规模提供商如今将约一半的资本支出分配给内存阵列,这反映了更大模型和更长上下文长度带来的日益增长的需求。讨论澄清,内存墙限制源于两个不同因素:内存带宽和内存容量。内存带宽限制决定了推理延迟和运营成本,而内存容量限制决定了模型规模和批大小优化。分析表明,更大的垂直扩展域主要解决带宽限制而非容量限制。通过使多个计算单元能够同时获取模型参数,增加的垂直扩展规模缩短了内存获取耗时,从而降低了延迟。讨论指出,流水线并行通过跨多个机架分布模型权重,有效地解决了容量限制,使基础设施提供商能够部署超过单架内存限制的大型模型。分析考察了模型扩展的历史进程,指出大型垂直扩展域的部署近期已使得具有足够实际推理内存带宽的万亿参数模型得以运行。讨论将前沿模型延迟扩展的原因归咎于硬件拓扑限制而非算法限制,因为先前的架构缺乏支持大参数量所需的垂直扩展带宽。分析进一步探讨了训练与推理计算之间的经济权衡,提出优化模型扩展的启发式框架。该框架假设,当训练、强化学习和推理支出大致相等时,总运营成本最小化。通过使这些成本分量相等,分析得出了预训练数据量、强化学习数据量与推理标记量之间的关系。计算表明,前沿模型的训练数据量通常比缩放定律(Scaling Laws)确立的理论最优值高出约一百倍。这种“过度训练”在经济上是合理的,因为推理和强化学习的成本已分摊至数百万次用户交互中。讨论强调,最佳模型规模取决于部署时长、并发用户量和API定价结构,要求基础设施提供商随着市场条件的演变不断重新校准扩展策略。分析总结道,内存墙限制将继续推动硬件创新向更大的垂直扩展域和更高效的内存层级发展,因为带宽和容量限制仍是人工智能进展的主要瓶颈。讨论指出,成功的基础设施设计必须平衡硬件投资、模型架构和经济优化,以最大化资本支出回报,同时最小化延迟和运营成本。
API定价、上下文长度与内存层级经济
讨论考察了AI提供商如何将计算限制转化为定价结构,揭示API定价直接反映了底层的内存带宽和容量限制。分析指出,针对超长上下文(通常超过二十万标记)收取的溢价定价,对应于内存带宽限制超越计算限制的临界点。讨论为上下文长度定价推导了数学模型,将指定阈值下的内存获取耗时与计算耗时相等。计算得出存储在键值缓存阵列中的每标记字节数,确认现代模型用于上下文存储的每标记量约为两千字节。讨论解释说,这一结果可通过跨层共享上下文的密集注意力机制实现,也可通过通过数学优化减少内存需求的稀疏注意力机制实现。分析进一步考察了输入与输出标记之间的定价差异,指出预处理输入的成本通常是生成输出的五倍。这种定价结构反映了任务的计算性质:解码操作严重受限于内存带宽,而预处理操作计算密集但受内存限制较小。讨论表明,内存带宽限制对解码操作影响显著,因为每个新标记都需要顺序内存获取,无法并行化。分析总结道,定价结构准确反映了硬件限制,提供商对超过内存带宽阈值的操作收取溢价。讨论进一步探讨了缓存管理的经济影响,指出命中缓存的定价显著低于未命中缓存,因为内存重建(Rematerialization)的计算成本高昂。重建需要对给定标记重新进行完整的前向传播计算,产生巨大的计算开销。分析对内存层级经济进行建模,将存储分类为高带宽内存、动态随机存取内存(DRAM)、闪存和机械硬盘。每个层级在检索和保留方面具有不同的成本配置,定价反映了容量、带宽和运营持续时间。讨论推导了内存层级选择、检索时间与保留持续时间之间的数学关系,证明提供商通过使检索和保留成本相等来优化存储分配。分析总结道,针对保留时间的API定价(例如五分钟与一小时缓存存储)直接识别了底层内存层级,较短时间对应高带宽内存,较长时间对应闪存或机械硬盘存储。讨论强调,内存层级经济将继续推动基础设施设计向混合存储架构发展,以平衡检索速度、保留成本和运营效率。分析总结道,AI定价结构是硬件限制的透明指标,使基础设施规划者能够在匹配市场需求的同时进行投资决策,并最大化运营效率。
密码学类比与可逆网络架构
讨论探索了密码学协议与神经网络架构之间的趋同演化,突出了信息混合与混淆的共享机制。密码系统旨在将结构化数据转换为统计随机输出,而神经网络则从看似随机的输入中提取结构化模式。两者都依赖复杂的混合操作来隐藏或揭示数据内的关系。讨论考察了微分密码分析,这是一种利用数学导数分析密码行为的技巧,并指出其与神经网络中基于梯度的优化存在相似之处。分析指出,两者均针对特定属性进行优化:密码最大化输出可变性以抵抗分析,而神经网络最小化损失以提高预测准确性。讨论指出了一种名为费斯妥网络(Feistel network)的构造技术,最初为密码应用开发,后适配用于神经网络架构。费斯妥构造通过保留输入信息并应用可逆转换,能够从不可逆组件创建可逆函数。分析演示了该构造如何集成到可逆神经网络中,使得无需存储中间激活状态即可反转整个模型。讨论解释说,可逆网络通过在后向传播期间重新计算前向传播的激活状态来减少训练内存占用,以计算强度换取内存节省。分析将此方法与键值缓存优化进行对比,后者通过存储内存来减轻计算负载。讨论总结道,可逆网络代表了一种战略权衡,优先考虑内存效率而非计算速度,而键值缓存则优先考虑计算速度而非内存效率。分析强调,基础设施提供商必须根据硬件限制选择优化策略,根据运营优先级在内存绑定和计算绑定方法之间做出选择。讨论进一步指出,可逆网络对推理延迟影响甚微,但显著降低了训练内存需求,使其在大模型预训练中极具价值。分析总结道,密码学技术继续影响神经网络设计,可逆架构为训练工作流中的内存约束提供了实用解决方案。讨论指出,跨学科创新对于推进人工智能基础设施至关重要,因为为密码安全开发的技术经常应用于机器学习优化。
结论与对人工智能基础设施的影响
讨论综合了规范现代人工智能基础设施的技术、架构和经济限制,证明系统设计从根本上受限于内存带宽、计算吞吐量以及经济优化策略。分析确立,批大小、上下文长度和稀疏比率决定了延迟、成本和可扩展性,为基础设施规划者提供了硬件投资的预测模型。讨论强调,内存墙限制仍是人工智能进展的主要瓶颈, necessitating 更大的垂直扩展域、混合存储架构和优化并行策略。分析总结道,前沿模型将继续优先采用大型批大小、稀疏注意力机制和混合专家架构,以在最小化运营成本的同时最大化计算效率。讨论指出,API定价结构直接反映了硬件限制,使基础设施投资与市场需求的透明对齐成为可能。分析进一步指出,可逆网络架构和密码学技术继续影响神经网络设计,为训练工作流中的内存约束提供了实用解决方案。讨论总结道,人工智能基础设施将向更大的垂直扩展域、优化的内存层级以及平衡训练、强化学习和推理支出的经济优化框架演进。分析强调,成功的基础设施设计需要硬件拓扑、模型架构与经济优化之间的对齐,确保计算资源高效部署,以在最小化延迟和运营成本的同时最大化资本支出回报。讨论验证了该分析框架,证明数学建模与硬件级规格参数提供了预测行业趋势、指导基础设施投资和优化系统性能的有力工具。分析总结道,人工智能的进步将由硬件创新、内存优化和经济效率定义,因为这些因素继续塑造机器学习研究与部署的轨迹。
Continue the conversation
Discussion