Tags: ne7359/llama-cpp-python
Toggle v0.3.27-Metal-macos-20260224's commit message
LLama: Optimize KV cache management for multi-round conversations
- Implements prefix-matching logic to truncate stale "ghost" tokens in C++ KV cache
- Prevents attention misalignment and context poisoning during multi-turn interactions
- Reduces memory overhead by reusing matched prefixes efficiently
Signed-off-by: JamePeng <jame_peng@sina.com>
Toggle main-metal's commit message
Update Submodule vendor/llama.cpp 10c98cb..d1e3556
Toggle v0.3.22-cu130-Basic-win-20260118's commit message
Toggle v0.3.22-cu130-Basic-linux-20260118's commit message
Toggle v0.3.22-cu128-Basic-win-20260118's commit message
Toggle v0.3.22-cu128-Basic-linux-20260118's commit message
Toggle v0.3.22-cu126-Basic-win-20260118's commit message
Toggle v0.3.22-cu126-Basic-linux-20260118's commit message
Toggle v0.3.22-cu124-Basic-win-20260118's commit message
Toggle v0.3.22-cu124-Basic-linux-20260118's commit message
You can’t perform that action at this time.