从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
技术方向
模型本身的进展:新模型与新版本发布、权威评测与榜单成绩、值得看的论文与技术报告。通用模型只有带来实质能力信息(能力、架构、可用性)时才算。
21 条精选近 30 天 20 条共收录 72 条
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。