flash-moe
C言語とMetalで書かれた推論エンジンで、3970億パラメータの巨大な言語モデルをノートPC上で動かします。
Xで共有ライセンス表記なし
概要
Flash-MoEは、C、Objective-C、手作業で調整したMetalシェーダーで書かれた推論エンジンです。3970億パラメータのMixture-of-ExpertsモデルQwen3.5-397B-A17Bを、メモリ48GBのMacBook Proで動かします。209GBのモデルをSSDからMetalの計算パイプラインへ流し込み、Pythonやフレームワークは使いません。
主な特長
- 48GBのMacBook Proで397Bモデルを実行
- SSDからMetalでモデルをストリーミング
- 4ビットエキスパートで毎秒4.36トークンと報告
- 4ビット設定でツール呼び出しに対応
こんな人・用途に
巨大モデルを一般向けAppleハードで動かす方法に関心がある人向けです。2ビットは速い一方JSON出力とツール呼び出しが壊れるため、実用は4ビットです。
- アップストリーム
- danveloper/flash-moe
- GitHubのフォーク
- Guo-astro/flash-moe
- アップストリームのスター数
- 4.2k
- カテゴリ
- AIエージェントとLLMツール
- ライセンス
- ライセンス表記なしライセンスがない場合、著作者がすべての権利を保持します。コードを再利用する前にアップストリームの作者に確認してください。
- フォーク日
- 2026-03-22
- 同期状態
- 同期済み最終同期 2026-09-29
同じカテゴリ: AIエージェントとLLMツール
英語圏以外の子どもが、AIの話し相手と会話して英語のスピーキングとリスニングを練習できる無料のデスクトップアプリです。
フォーク日 2026-09-28最終同期 2026-09-29ライセンス: MITAIエージェントとLLMツールGitHub
中国特許向けのエージェントスキルです。特許ポイントの発掘、出願書類の作成、特許の平易な解説、審査対応の支援ができます。
フォーク日 2026-09-28最終同期 2026-09-29ライセンス: MITAIエージェントとLLMツールGitHub
Hugging Face製の小さなPythonライブラリで、コードを書いて実行しながら課題を解くAIエージェントを数行で作れます。
フォーク日 2026-09-28最終同期 2026-09-29ライセンス: Apache-2.0AIエージェントとLLMツールGitHub
AIエージェントが実際の法務業務をどこまでこなせるかを測るオープンソースのベンチマークです。
フォーク日 2026-09-28最終同期 2026-09-29ライセンス: MITAIエージェントとLLMツールGitHub