← 返回总览

mizorewww/laya-mlx

Native MLX runtime for Laya typed decision models — 7–14 ms short decisions on M3 Max. No text generation, PyTorch, or cloud API.

1,577Fork: 80语言: Python协议: Apache-2.0GitHub ↗

深度介绍

它是什么

laya-mlx 是 Laya 类型化决策模型的 MLX 原生运行时。它专注一件事:在 Apple Silicon 上做快速决策推理,而非文本生成。在 M3 Max 上,单次短决策仅需 7–14 毫秒。

核心亮点

  • 原生 MLX 后端:直接调用 Apple 的 MLX 框架,充分利用统一内存与神经引擎。
  • 极低延迟:7–14 ms 的短决策响应,接近实时系统需求。
  • 零依赖负担:不依赖 PyTorch,不调用云端 API,纯本地运行。
  • 类型化决策:面向结构化输出场景(如分类、路由、判定),而非开放式生成。

为什么火

在本地 AI 浪潮中,多数项目仍在卷文本生成,laya-mlx 反其道而行,切中「快速决策」这一被忽视的刚需。Apple Silicon 用户苦于 PyTorch 在 Mac 上的性能损耗,MLX 原生方案自然受追捧。1577 星的增长印证了社区对轻量、专用推理运行时的渴望。

适合谁用

  • 在 Mac 上构建本地 Agent 或工作流引擎的开发者
  • 需要毫秒级分类/路由决策的实时系统
  • 厌倦 PyTorch 臃肿、想尝鲜 MLX 生态的 Apple Silicon 用户

快速上手

pip install laya-mlx

加载模型后调用决策接口即可,无需 GPU 集群或 API Key。具体用法见仓库 README 与示例脚本。