该论文针对LLM推理服务中请求异构性(如输入/输出长度、计算密度)导致的传统调度器性能瓶颈,提出一种几何感知的在线调度框架。作者将请求特征建模为高维几何空间中的点,结合批处理效率与显存约束构建理论最优性下界,并据此设计轻量级在线算法GeoSched——无需预训练、支持动态负载调整。在vLLM和Triton后端上的实测表明,相比FIFO、FairSeq等基线,其P99延迟降低37%,GPU利用率提升22%。工作 bridging the gap between scheduling theory and LLM serving practice,为大模型推理系统提供了兼具数学严谨性与工程落地性的新范式。
vLLM
toolAI 辅助整理 · 事实字段按公开来源校验
高吞吐 LLM 推理与服务引擎,以 PagedAttention 提升显存利用与并发,广泛用于生产部署。
事实字段
定位
高吞吐推理引擎
开发方
vLLM 社区
许可证
Apache-2.0
来源追溯:
事实字段来自公开来源整理;字段级来源元数据待继续补齐,无法稳定核验的信息不做臆测。
整理说明
本页围绕「定位、事实字段、演进时间线、关联动态」组织信息,方便快速判断 vLLM 在 AI Agent 与大模型生态中的位置。
事实型字段保持保守:未公开或无法稳定核验的信息不做臆测;关联动态保留原始来源链接,便于继续阅读。
版本演进
2026-06-23
update
Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice
2026-06-23
update
Recency/Frequency Adaptive KV Caching for Large Language Model Serving
2026-06-20
update
UltraQuant: 4-bit KV Caching for Context-Heavy Agents
关联动态
该论文提出一种新型KV缓存优化策略,针对大语言模型推理过程中显存占用高、长上下文响应慢的问题,动态评估每个键值对(KV)在生成过程中的时效性(Recency)与访问频次(Frequency),并据此分级保留或淘汰缓存项。方法无需修改模型架构,兼容主流Decoder-only架构(如LLaMA、Qwen),在保持生成质量前提下,显著降低GPU显存占用(最高减少47%)并提升吞吐量(实测提升2.3倍)。作者在多个开源模型及真实服务负载下验证了其有效性,并开源了适配vLLM与HuggingFace Transformers的轻量集成模块。
UltraQuant 是一种专为上下文密集型AI智能体(如复杂推理、多步规划Agent)设计的高效KV缓存量化方案。它首次在保持生成质量几乎无损的前提下,将Transformer中关键的键值(KV)缓存压缩至4比特精度,并通过分组量化、动态范围校准与误差补偿机制,显著缓解低比特量化带来的注意力失真问题。相比主流8比特方案,内存占用降低50%,推理延迟下降18%-23%,且在Llama-3-8B、Qwen2-7B等模型上经多轮长文本生成与工具调用任务验证,BLEU、ROUGE及任务完成率均维持在原始FP16基线的99.2%以上。该工作填补了Agent场景下超低比特KV缓存系统化优化的空白。