← 返回总览

Niko1221/Strata

Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.

★ 1,039Fork: 113语言: C++协议: MITGitHub ↗

深度介绍

它是什么

Strata 是一个 C++ 编写的本地推理引擎,目标很“反直觉”:让 125B 参数的 Qwen3.8-Flash-Next(MoE 架构)跑在 8GB 显存的 NVIDIA GPU 上,支持 Windows / Linux 一键安装。

核心亮点

  • 极限显存压缩:通过 MoE 稀疏激活 + 分层卸载,把百亿级模型塞进消费级显卡。
  • 本地 API 兼容:在 localhost 暴露 OpenAI / Anthropic 双协议接口,现有客户端可直接接入。
  • 可选图像输入:支持多模态场景,不局限于纯文本。
  • MIT 协议:商用友好,C++ 实现意味着低运行时开销。

为什么火

“125B 模型 + 8GB 显卡”本身就是传播钩子。它切中了本地部署玩家最痛的点——不是不想跑大模型,而是显存不够。一键安装进一步降低了门槛,1039 星说明社区对“平民化大模型”需求真实存在。

适合谁用

显存有限但想本地跑大模型的开发者、需要私有化 API 的中小团队,以及喜欢折腾推理优化的 C++ 爱好者。

快速上手

前往 GitHub Releases 下载对应平台安装包,运行后按提示启动服务,即可在 localhost 调用兼容 OpenAI 的接口。