Niko1221/Strata
Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.
深度介绍
它是什么
Strata 是一个 C++ 编写的本地推理引擎,目标很“反直觉”:让 125B 参数的 Qwen3.8-Flash-Next(MoE 架构)跑在 8GB 显存的 NVIDIA GPU 上,支持 Windows / Linux 一键安装。
核心亮点
- 极限显存压缩:通过 MoE 稀疏激活 + 分层卸载,把百亿级模型塞进消费级显卡。
- 本地 API 兼容:在 localhost 暴露 OpenAI / Anthropic 双协议接口,现有客户端可直接接入。
- 可选图像输入:支持多模态场景,不局限于纯文本。
- MIT 协议:商用友好,C++ 实现意味着低运行时开销。
为什么火
“125B 模型 + 8GB 显卡”本身就是传播钩子。它切中了本地部署玩家最痛的点——不是不想跑大模型,而是显存不够。一键安装进一步降低了门槛,1039 星说明社区对“平民化大模型”需求真实存在。
适合谁用
显存有限但想本地跑大模型的开发者、需要私有化 API 的中小团队,以及喜欢折腾推理优化的 C++ 爱好者。
快速上手
前往 GitHub Releases 下载对应平台安装包,运行后按提示启动服务,即可在 localhost 调用兼容 OpenAI 的接口。
