GitHub · ggml-org/llama.cpp Releases·· 6 小时前AI 评分46
llama.cpp b11552 发布:忙碌 slot 被请求占用时保持上下文不变
b11552
AI 导读
llama.cpp b11552 修复请求申请忙碌 id_slot 时仍更新 prompt cache 的问题,避免 RAM cache 的更佳匹配被加载到正在生成的 slot,导致生成使用错误上下文。现在忙碌 slot 会原样返回,请求等待该 slot。
来源:GitHub · ggml-org/llama.cpp Releases · github.com