flash-moe
用C和Metal编写的推理引擎,能在笔记本电脑上运行3970亿参数的超大语言模型。
分享到 X未声明许可证
概述
Flash-MoE 是用 C、Objective-C 和手工调优的 Metal 着色器写成的推理引擎。它能在 48GB 内存的 MacBook Pro 上运行 3970 亿参数的混合专家模型 Qwen3.5-397B-A17B。209GB 的模型从 SSD 经自定义 Metal 计算流水线流式加载,不依赖 Python 和框架。
主要特点
- 在 48GB MacBook Pro 上运行 397B 模型
- 通过 Metal 从 SSD 流式加载模型
- 4 位专家配置下报告约 4.36 词元每秒
- 4 位配置支持工具调用
适用场景
适合关心超大模型如何在消费级苹果设备上运行的读者。2 位配置更快,但会破坏 JSON 输出和工具调用,实际使用应选 4 位。
- 上游仓库
- danveloper/flash-moe
- GitHub 上的 fork
- Guo-astro/flash-moe
- 上游 Star 数
- 4.2k
- 分类
- AI 智能体与大模型工具
- 许可证
- 未声明许可证没有许可证时,作者保留所有权利。复用代码前请先询问上游作者。
- Fork 时间
- 2026-03-22
- 同步状态
- 已同步上次同步 2026-09-29
同分类更多: AI 智能体与大模型工具
面向非英语国家儿童的免费桌面应用,通过和AI伙伴对话来练习英语口语和听力,可在本地离线使用。
Fork 时间 2026-09-28上次同步 2026-09-29许可证: MITAI 智能体与大模型工具GitHub
面向中国专利的智能体技能,帮助挖掘专利点、撰写交底书、通俗解读专利、跟踪政策并辅助审查答复。
Fork 时间 2026-09-28上次同步 2026-09-29许可证: MITAI 智能体与大模型工具GitHub
Hugging Face推出的精简Python库,用于构建通过编写代码来完成任务的AI代理,几行代码即可搭建。
Fork 时间 2026-09-28上次同步 2026-09-29许可证: Apache-2.0AI 智能体与大模型工具GitHub
评估AI代理处理真实法律工作能力的开源基准,提供任务和评测,用于改进法律类代理。
Fork 时间 2026-09-28上次同步 2026-09-29许可证: MITAI 智能体与大模型工具GitHub