返回信息流
GitHub Releases · 关注仓库GitHub·4 天前·GitHub Releases
vLLM 0.9 发布:原生支持 Agent 工作负载的批调度优化
技术看多#Agent#芯片#大模型
查看原文75
AI 富化摘要
TL;DR
vLLM 0.9 为 Agent 工作负载优化批调度(会话级 KV 复用、状态保持、优先级抢占),典型 Agent 负载吞吐 +35%、尾延迟 -40%,呼应推理从对话转向 Agent。
要点
- 针对 Agent 多步/间歇/长尾请求优化批调度
- 会话级 KV cache 复用 + 工具调用间状态保持 + 优先级抢占
- 典型 Agent 负载吞吐 +35%、尾延迟 -40%
- 推理引擎正为 Agent 请求形态重新设计
vLLMKV cache批调度Agent 推理
原文正文
选中文字即可划线批注vLLM 0.9 针对 Agent 类工作负载做了批调度优化:面对 Agent 多步、间歇、长尾的请求模式,新增了会话级 KV cache 复用、工具调用间的状态保持与优先级抢占调度,显著降低多步任务的端到端延迟与显存占用。官方基准显示,在典型 Agent 负载下吞吐提升约 35%、尾延迟下降 40%。这呼应了"推理正从对话转向 Agent"的趋势——推理引擎也要为 Agent 的请求形态重新设计。
可点评观点
AI 从正文抽取的观点句,点击即可针对它沉淀你的判断。