llama.cpp Releases· github-actions[bot]·· 11 小时前AI 评分22
llama.cpp b11513 发布:CUDA top-k 算法按形状选择,qwen4exp 上提速约 6 倍
b11513
AI 导读
llama.cpp 发布 b11513,为 CUDA 后端改进 top-k 算法选择:按形状在 bitonic、radix select 与 DeviceTopK/CUB argsort 之间切换,阈值可在构建时覆盖。
来源:llama.cpp Releases · github.com