跳到正文
llama.cpp Releases· github-actions[bot]·· 3 小时前AI 评分22

llama.cpp b11518 为 Metal 后端新增 128/96 flash attention kernel

b11518

AI 导读

llama.cpp 发布 b11518,为 Metal 后端新增 128/96 flash attention kernel,并支持接受所有已编译的 kernel 组合。该版本同步更新 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台构建产物,涵盖 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端。

来源:llama.cpp Releases · github.com