返回信息流
GitHub Releases · 关注仓库GitHub·4 天前·GitHub Releases

vLLM 0.9 发布:原生支持 Agent 工作负载的批调度优化

技术看多#Agent#芯片#大模型
75
查看原文

AI 富化摘要

TL;DR

vLLM 0.9 为 Agent 工作负载优化批调度(会话级 KV 复用、状态保持、优先级抢占),典型 Agent 负载吞吐 +35%、尾延迟 -40%,呼应推理从对话转向 Agent。

要点
  • 针对 Agent 多步/间歇/长尾请求优化批调度
  • 会话级 KV cache 复用 + 工具调用间状态保持 + 优先级抢占
  • 典型 Agent 负载吞吐 +35%、尾延迟 -40%
  • 推理引擎正为 Agent 请求形态重新设计
vLLMKV cache批调度Agent 推理

原文正文

选中文字即可划线批注

vLLM 0.9 针对 Agent 类工作负载做了批调度优化:面对 Agent 多步、间歇、长尾的请求模式,新增了会话级 KV cache 复用、工具调用间的状态保持与优先级抢占调度,显著降低多步任务的端到端延迟与显存占用。官方基准显示,在典型 Agent 负载下吞吐提升约 35%、尾延迟下降 40%。这呼应了"推理正从对话转向 Agent"的趋势——推理引擎也要为 Agent 的请求形态重新设计。

可点评观点

AI 从正文抽取的观点句,点击即可针对它沉淀你的判断。