跳到正文
热点事件持续更新

llama.cpp 修复忙碌槽位上下文错误

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

llama.cpp b11552 修复了请求占用忙碌 id_slot 时更新提示缓存并加载其他上下文的问题,避免正在生成的请求继续使用错误上下文。现在,忙碌槽位会保持原样返回,请求等待该槽位空闲后再处理。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月11日
  1. GitHub · ggml-org/llama.cpp Releases
    llama.cpp b11552 发布:忙碌 slot 被请求占用时保持上下文不变

    llama.cpp b11552 修复请求申请忙碌 id_slot 时仍更新 prompt cache 的问题,避免 RAM cache 的更佳匹配被加载到正在生成的 slot,导致生成使用错误上下文。现在忙碌 slot 会原样返回,请求等待该 slot。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。