flash-moe

用C和Metal编写的推理引擎,能在笔记本电脑上运行3970亿参数的超大语言模型。

分享到 X未声明许可证

概述

Flash-MoE 是用 C、Objective-C 和手工调优的 Metal 着色器写成的推理引擎。它能在 48GB 内存的 MacBook Pro 上运行 3970 亿参数的混合专家模型 Qwen3.5-397B-A17B。209GB 的模型从 SSD 经自定义 Metal 计算流水线流式加载,不依赖 Python 和框架。

主要特点

  • 在 48GB MacBook Pro 上运行 397B 模型
  • 通过 Metal 从 SSD 流式加载模型
  • 4 位专家配置下报告约 4.36 词元每秒
  • 4 位配置支持工具调用

适用场景

适合关心超大模型如何在消费级苹果设备上运行的读者。2 位配置更快,但会破坏 JSON 输出和工具调用,实际使用应选 4 位。

上游仓库
danveloper/flash-moe
GitHub 上的 fork
Guo-astro/flash-moe
上游 Star 数
4.2k
分类
AI 智能体与大模型工具
许可证
未声明许可证没有许可证时,作者保留所有权利。复用代码前请先询问上游作者。
Fork 时间
2026-03-22
同步状态
已同步上次同步 2026-09-29