跳到正文
PyTorch Blog· Ishan Dhanani, Jamie Li, Karen Chung·· 2 小时前精选AI 评分81

NVIDIA Dynamo以Session ID实现会话感知的智能体推理

Session-Aware Agentic Inference with NVIDIA Dynamo

AI 导读

PyTorch Blog介绍NVIDIA Dynamo如何通过统一的Session ID,将推理服务从请求级管理扩展为会话级路由、调度和KV cache管理。Dynamo支持会话关联的请求追踪与回放、session-aware admission control、共享KV cache索引,以及面向vLLM和SGLang的实验性KvHint策略。

推荐理由

文章把会话级路由、KV cache复用、工具边界背压和跨存储迁移串成一套实现路径,并给出具体吞吐对比,便于评估其对智能体服务的工程价值。

来源:PyTorch Blog · pytorch.org