PyTorch Blog· Ishan Dhanani, Jamie Li, Karen Chung·· 2 小时前精选AI 评分81
NVIDIA Dynamo以Session ID实现会话感知的智能体推理
Session-Aware Agentic Inference with NVIDIA Dynamo
AI 导读
PyTorch Blog介绍NVIDIA Dynamo如何通过统一的Session ID,将推理服务从请求级管理扩展为会话级路由、调度和KV cache管理。Dynamo支持会话关联的请求追踪与回放、session-aware admission control、共享KV cache索引,以及面向vLLM和SGLang的实验性KvHint策略。
推荐理由
文章把会话级路由、KV cache复用、工具边界背压和跨存储迁移串成一套实现路径,并给出具体吞吐对比,便于评估其对智能体服务的工程价值。
来源:PyTorch Blog · pytorch.org