GitHub上热度最高的开源大模型推理框架Colibrì,通过将SSD当作显存使用,让普通笔记本也能运行7000亿参数级别的MoE模型。其核心思路是利用MoE架构每次仅激活少量专家的特性,把常驻的Dense部分(约9.9GB)留在内存,将占370GB的路由专家权重全部放在NVMe SSD上,推理时按需加载。配合LRU缓存、专家使用频率统计和71.6%准确率的下一层专家预测预读机制,Colibrì将VRAM、RAM和SSD组织成分层内存系统,实现计算与I/O重叠。目前该框架已覆盖9个模型家族,从GLM-5.2到2.8T参数的Kimi K3,在128GB内存的纯CPU机器上可达约1.8 token/s。这一方案的意义在于,它证明运行前沿大模型不必依赖专业服务器,消费级硬件通过合理的存储调度同样可行。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅