flash-moe
C言語とMetalで書かれた推論エンジンで、3970億パラメータの巨大な言語モデルをノートPC上で動かします。
Xで共有ライセンス表記なし
概要
Flash-MoEは、C、Objective-C、手作業で調整したMetalシェーダーで書かれた推論エンジンです。3970億パラメータのMixture-of-ExpertsモデルQwen3.5-397B-A17Bを、メモリ48GBのMacBook Proで動かします。209GBのモデルをSSDからMetalの計算パイプラインへ流し込み、Pythonやフレームワークは使いません。
主な特長
- 48GBのMacBook Proで397Bモデルを実行
- SSDからMetalでモデルをストリーミング
- 4ビットエキスパートで毎秒4.36トークンと報告
- 4ビット設定でツール呼び出しに対応
こんな人・用途に
巨大モデルを一般向けAppleハードで動かす方法に関心がある人向けです。2ビットは速い一方JSON出力とツール呼び出しが壊れるため、実用は4ビットです。
- アップストリーム
- danveloper/flash-moe
- GitHubのフォーク
- Guo-astro/flash-moe
- アップストリームのスター数
- 4.2k
- カテゴリ
- AIエージェントとLLMツール
- ライセンス
- ライセンス表記なしライセンスがない場合、著作者がすべての権利を保持します。コードを再利用する前にアップストリームの作者に確認してください。
- フォーク日
- 2026-03-22
- 同期状態
- 同期済み最終同期 2026-10-11
同じカテゴリ: AIエージェントとLLMツール
Hello-Agentsは、AIエージェントの原理と実践を学ぶチュートリアルです。基礎からエージェントシステムやアプリケーションの構築までを案内します。
フォーク日 2026-10-10最終同期 2026-10-11独自ライセンス(リポジトリを参照)AIエージェントとLLMツールGitHub
OpenSREは、自社のインフラツールとワークフローを使って本番障害の調査を支援するAIエージェントを構築するオープンソースフレームワークです。
フォーク日 2026-10-10最終同期 2026-10-11ライセンス: Apache-2.0AIエージェントとLLMツールGitHub
Context Modeは、AIコーディングエージェントのコンテキスト消費を抑え、会話の圧縮後も作業を続けやすくします。MCPとフックを通じて、ツール出力、セッション記憶、対応プラットフォームへのルーティングを扱います。
フォーク日 2026-10-10最終同期 2026-10-11独自ライセンス(リポジトリを参照)AIエージェントとLLMツールGitHub
ARTEXは、資産の探索とテスト状況の確認に使うセルフホスト型のAI侵入テストシステムです。タスク、発見事項、資産データ、承認を一つの画面で扱えます。
フォーク日 2026-10-10最終同期 2026-10-11ライセンス: AGPL-3.0AIエージェントとLLMツールGitHub