Skip to content

Tags: ne7359/llama-cpp-python

Tags

v0.3.27-Metal-macos-20260224

Toggle v0.3.27-Metal-macos-20260224's commit message
LLama: Optimize KV cache management for multi-round conversations

- Implements prefix-matching logic to truncate stale "ghost" tokens in C++ KV cache
- Prevents attention misalignment and context poisoning during multi-turn interactions
- Reduces memory overhead by reusing matched prefixes efficiently

Signed-off-by: JamePeng <jame_peng@sina.com>

main-metal

Toggle main-metal's commit message
Update Submodule vendor/llama.cpp 10c98cb..d1e3556

v0.3.22-cu130-Basic-win-20260118

Toggle v0.3.22-cu130-Basic-win-20260118's commit message
Bump version to 0.3.22

v0.3.22-cu130-Basic-linux-20260118

Toggle v0.3.22-cu130-Basic-linux-20260118's commit message
Bump version to 0.3.22

v0.3.22-cu128-Basic-win-20260118

Toggle v0.3.22-cu128-Basic-win-20260118's commit message
Bump version to 0.3.22

v0.3.22-cu128-Basic-linux-20260118

Toggle v0.3.22-cu128-Basic-linux-20260118's commit message
Bump version to 0.3.22

v0.3.22-cu126-Basic-win-20260118

Toggle v0.3.22-cu126-Basic-win-20260118's commit message
Bump version to 0.3.22

v0.3.22-cu126-Basic-linux-20260118

Toggle v0.3.22-cu126-Basic-linux-20260118's commit message
Bump version to 0.3.22

v0.3.22-cu124-Basic-win-20260118

Toggle v0.3.22-cu124-Basic-win-20260118's commit message
Bump version to 0.3.22

v0.3.22-cu124-Basic-linux-20260118

Toggle v0.3.22-cu124-Basic-linux-20260118's commit message
Bump version to 0.3.22