现在手机跑本地大模型,大多数方案都有一个前提:你得有 GPU 你得有 NPU 你得是新旗舰 Cactus 反着来 它专门为手机 ARM CPU 做推理 ,
不靠 GPU 不靠 NPU 连旧手机也能跑 Qwen3 0.6B INT8 ,
在 iPhone 17 Pro 的 CPU 上能跑到 75 token/s ,
Galaxy S25 Ultra 60 token/s 甚至 iPhone X、Pixel 6a Galaxy S21这种也有 17 token/s 更狠而且体积相同 Qwen3-0.6B INT8: Cactus 370MB ONNX/TFLite/MLX 600MB GGUF 800MB Executorch 944MB ,

这不是在手机里硬塞 LLM 而是重新给手机做了一个更省电、更少发热的推理保障,提供了 OpenAI 兼容 C API 功能工具调用;
底层是 ARM SIMD内核零拷贝计算图和 Transformer Engine 因此,它未来所做的不仅仅是离线聊天,而是让应用程序、手机、穿戴设备边缘硬件真正能够运行本地人工智能。
开源地址:https://github.com/cactus-compute/cactus
官网:https://cactuscompute.com/
