flash-moe
用C和Metal编写的推理引擎,能在笔记本电脑上运行3970亿参数的超大语言模型。
分享到 X未声明许可证
概述
Flash-MoE 是用 C、Objective-C 和手工调优的 Metal 着色器写成的推理引擎。它能在 48GB 内存的 MacBook Pro 上运行 3970 亿参数的混合专家模型 Qwen3.5-397B-A17B。209GB 的模型从 SSD 经自定义 Metal 计算流水线流式加载,不依赖 Python 和框架。
主要特点
- 在 48GB MacBook Pro 上运行 397B 模型
- 通过 Metal 从 SSD 流式加载模型
- 4 位专家配置下报告约 4.36 词元每秒
- 4 位配置支持工具调用
适用场景
适合关心超大模型如何在消费级苹果设备上运行的读者。2 位配置更快,但会破坏 JSON 输出和工具调用,实际使用应选 4 位。
- 上游仓库
- danveloper/flash-moe
- GitHub 上的 fork
- Guo-astro/flash-moe
- 上游 Star 数
- 4.2k
- 分类
- AI 智能体与大模型工具
- 许可证
- 未声明许可证没有许可证时,作者保留所有权利。复用代码前请先询问上游作者。
- Fork 时间
- 2026-03-22
- 同步状态
- 已同步上次同步 2026-10-11
同分类更多: AI 智能体与大模型工具
Hello-Agents是学习智能体原理与实践的教程,带领读者从基础知识入门,逐步构建智能体系统和应用。
Fork 时间 2026-10-10上次同步 2026-10-11自定义许可证(见仓库)AI 智能体与大模型工具GitHub
OpenSRE 是一个开源框架,用于构建 AI 智能体,借助你的基础设施工具和工作流调查生产事故。
Fork 时间 2026-10-10上次同步 2026-10-11许可证: Apache-2.0AI 智能体与大模型工具GitHub
Context Mode帮助AI编程代理减少上下文占用,并在对话压缩后延续工作。它通过MCP和钩子处理工具输出、会话记忆,并在支持的平台间进行路由。
Fork 时间 2026-10-10上次同步 2026-10-11自定义许可证(见仓库)AI 智能体与大模型工具GitHub
ARTEX 是一款用于资产探索和测试过程审查的自托管 AI 渗透测试系统。它在一个界面中呈现任务、发现结果、资产数据和审批流程。
Fork 时间 2026-10-10上次同步 2026-10-11许可证: AGPL-3.0AI 智能体与大模型工具GitHub