我们在 2025 年 5 月推出 llm-d 时,旨在弥合人工智能实验与大规模、关键任务型生产推理之间巨大的能力差距。通过将 llm-d 集成到 CNCF 中,我们正在扩大包括 CoreWeave、IBM、Google 和 NVIDIA 在内的多厂商联盟的目标,即建立分布式推理的开放标准。.

推理驱动着能动时代。

随着我们迈向智能体时代,驱动各行业企业智能体的AI推理技术即将得到广泛应用。至关重要的是,推理的成本和复杂性不能超过智能体本身的商业价值。然而,推理成本可能极其高昂,需要消耗大量专用加速器,而且随着规模的扩大,成本还会进一步攀升。llm-d的先进功能正是为了解决这一问题而生,它既能满足企业服务级别目标(SLO),又能最大限度地提高基础设施效率。此外,企业需要能够灵活地将推理部署到任何合适的位置——数据中心、云端或边缘——并可选择合适的硬件。而这种灵活性只有在底层生态系统基于开源和开放标准构建的情况下才能实现。.

缩小云原生环境中的差距

尽管 Kubernetes 是业界标准的编排方案,但它最初并非为大型语言模型推理 (LLM) 这种独特的、有状态的需求而设计的。在传统的微服务架构中,请求就是请求:每个副本都能同样高效地处理它。而在生成式人工智能 (AI) 中,请求的成本会因输入和输出标记的长度、模型的大小和架构、缓存局部性以及模型处于预加载(计算密集型)还是解码(内存密集型)阶段而发生巨大变化。.

标准服务路由无法感知这些动态变化,导致资源分配效率低下且延迟难以预测。llm-d 正好弥补了这一缺陷。它作为高级控制平面(例如 KServe)和底层引擎(例如 vLLM)之间的专用数据平面编排层。通过利用 Gateway API 和 LeaderWorkerSet (LWS) 等原生 Kubernetes 构建模块,llm-d 将复杂的分布式推理转化为可管理、可观测的云原生工作负载。.

通过贡献加强生态系统

通过将 llm-d 提供给 CNCF,我们正在建立明确的路径——经过验证且可复制的设计,将分散的 AI 组件转化为模块化且可互操作的微服务。这项贡献不仅仅是一个项目;它旨在丰富整个云原生环境,使推理成为与传统容器化应用程序相同的环境中不可或缺的一部分。.

这项工作的核心是端点选择器 (EPP)。llm-d 作为推理扩展 ​​API (GAIE) 的关键实现,而 EPP 则支持可编程的、推理感知的路由。这意味着系统会根据引擎的实际状态做出路由决策,从而优化键值缓存命中率和硬件加速器特性。这对于在严格的服务级别目标下保持持续性能至关重要。.

llm-d是对CNCF现有解决方案集的补充和扩展:

● Kubernetes:为 AI 工作负载提供关键的基础设施平台。
● 网关 API:推动 AI 专用路由的上游协调,确保流量管理保持开放的核心组件。
● KServe:作为高级控制平面,与 llm-d 集成,支持诸如服务解耦和前缀缓存等高级功能。
● LeaderWorkerSet:利用原生 Kubernetes 构建模块来编排复杂的多节点复制和专家级并行性,将 vLLM 等引擎转换为可管理的云原生工作负载。
● Prometheus 和 Grafana:导出诸如首次令牌时间 (TTFT) 等专用指标,为生成式 AI 带来企业级可观测性。

携手攀登推理的未来

自 llm-d 诞生之初,协作就一直是其核心。去年我们在红帽峰会上发布 llm-d 时,项目创始贡献者、行业领袖和学术界人士的共同努力令红帽倍感自豪,这不仅是因为 llm-d 的发布,更是因为他们构建了一个协作且面向未来的基础。自发布以来的十个月里,llm-d 已被应用于私有企业 AI MaaS(模型即服务)和大型 AI 项目。更重要的是,随着贡献者和合作伙伴生态系统的不断壮大,该项目的开放根基也在持续深化。开发者和企业对 llm-d 充满信心,而将该项目开放给 CNCF 将有助于支持和维护开放的未来。通往成功的开源 AI 创新之路漫长而艰辛,但我们正在携手构建实现这一目标的必要基础设施。.

作者:布莱恩·史蒂文斯,红帽公司高级副总裁兼人工智能首席技术官 (CTO)