跳到正文
llama.cpp Releases· github-actions[bot]·· 11 小时前AI 评分22

llama.cpp b11513 发布:CUDA top-k 算法按形状选择,qwen4exp 上提速约 6 倍

b11513

AI 导读

llama.cpp 发布 b11513,为 CUDA 后端改进 top-k 算法选择:按形状在 bitonic、radix select 与 DeviceTopK/CUB argsort 之间切换,阈值可在构建时覆盖。

来源:llama.cpp Releases · github.com