BaseRT:专为 Apple Silicon 优化,让 Mac 本地大模型快 6.4 倍

原始链接在: BaseRT:专为 Apple Silicon 优化,让 Mac 本地大模型快 6.4 倍 - 小众软件

Apple Silicon 跑本地大模型,速度还能再提升多少?
BaseRT 给出了一个答案:在 M5 Pro 上,它的提示词处理速度最高达到 llama.cpp 的 6.4 倍,MLX 的 3.9 倍


BaseRT 是一款专为 Apple Silicon 优化的本地 AI 推理引擎,可以运行 Qwen、Llama、Gemma 等多种开源模型。

在对比测试中,BaseRT 的优势主要集中在 Prefill(提示词处理)阶段,在 Decode(生成速度)阶段也有一定提升:

模型阶段 对比 llama.cpp 对比 MLX
Prefill(提示词处理速度) 最高 6.4 倍 最高 3.9 倍
Decode(生成速度) 最高 1.75 倍 最高 1.33 倍

如何使用

安装

curl -LsSf https://basecompute.co/install.sh | sh

下载模型

basert pull Qwen/Qwen3-4B

运行对话

basert chat Qwen/Qwen3-4B

就可在终端中与本地模型对话了。

启动 API

basert serve Qwen/Qwen3-4B --port 8080

BaseRT 会提供 OpenAI 兼容接口:

http://localhost:8080/v1

为什么 BaseRT 可以跑得更快?

大模型运行速度,不只取决于芯片性能,也取决于软件是否能够充分利用硬件。

与 llama.cpp、MLX 等已有本地推理方案相比,BaseRT 的优化重点是利用 Apple Silicon 的硬件特性。在 M5 Pro 测试中,它利用 M5 新增的 Tensor Core 架构,以及 Metal 4 Tensor API 提供的底层计算能力,获得了明显的性能提升。

BaseRT 在 Qwen3、Qwen3.5、Qwen3.6、Llama 3.2、Gemma 4 等多个模型上进行了测试,覆盖 0.6B 到 35B 参数规模。

使用的设备:Apple M5 Pro、48 GB 内存。

Prefill(提示词处理速度)

Model BaseRT pp128 llama.cpp pp128 BaseRT pp256 llama.cpp pp256 BaseRT pp512 llama.cpp pp512 BaseRT pp1024 llama.cpp pp1024 BaseRT pp2048 llama.cpp pp2048
Qwen3-0.6B 11873 10559 17578 14093 24525 17350 29062 18973 31183 19232
Llama-3.2-1B 8936 6859 13491 9267 19539 11922 23952 13742 27443 14358
Qwen3.5-2B 4594 3908 6994 5224 10662 6888 14137 8121 16291 8500
Llama-3.2-3B 3663 2831 5658 3845 8428 5115 11206 6132 13315 6577
Gemma-4-E2B 4991 1992 7825 2524 12380 2631 14661 2600 16264 2547
Gemma-4-26B-A4B 2246 1185 3448 1488 5246 1897 6718 2208 7857 2419
Qwen3-30B-A3B 2478 1280 3767 1592 5663 2043 7357 2324 8644 2586
Qwen3.5-35B-A3B 1501 1065 2259 1356 3525 1652 4577 1894 5304 2094
Qwen3.6-35B-A3B 1361 1042 2053 1331 3198 1614 4202 1847 4860 2051
Qwen3.6-27B 440 358 664 453 1021 560 1416 662 1706 747

Decode(生成速度)

模型 BaseRT llama.cpp 提升 MLX 提升
Qwen3-0.6B 530.8 tok/s 386.1 tok/s 1.37× 398.1 tok/s 1.33×
Llama 3.2-1B 342.1 tok/s 267.1 tok/s 1.28× 298.0 tok/s 1.15×
Qwen3.5-2B 219.6 tok/s 147.1 tok/s 1.49× 208.7 tok/s 1.05×
Llama 3.2-3B 137.0 tok/s 120.0 tok/s 1.14× 131.0 tok/s 1.05×
Gemma 4-26B-A4B 85.0 tok/s 83.3 tok/s 1.02× 87.0 tok/s 0.98×
Qwen3-30B-A3B 105.1 tok/s 96.7 tok/s 1.09× 97.7 tok/s 1.08×
Qwen3.5-35B-A3B 110.6 tok/s 72.5 tok/s 1.53× 104.8 tok/s 1.06×
Qwen3.6-35B-A3B 110.7 tok/s 63.1 tok/s 1.75× 101.9 tok/s 1.09×

获取

扫了一眼issue 算了老老实实llama cpp

何解?我没看到什么问题啊

理论优势不明显,issue还提到benchmark并不符合实际体验。。。更不要说模型生态远不如llama cpp