跳到正文
原文
Berkeley AI Research·· 2026-07-29精选AI 评分70

K-Search 将 CUDA 内核优化经验迁移到 Apple Silicon,注意力内核达 0.97x 原生性能

From CUDA to MLX: How K-Search Brings Decades of Kernel Expertise to Apple Silicon

AI 导读

Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。

推荐理由

原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。

来源:Berkeley AI Research · bair.berkeley.edu