FreeToken 是由 UC Berkeley 和 UT Austin 研究团队提出的边缘原生 MoE 推理引擎,旨在解决大模型部署对数据中心级 GPU 集群的依赖问题。其核心创新在于将个人电脑视为统一、弹性的推理平台,动态分配计算和模型状态到 GPU、CPU、内存及互联带宽上,从而在消费级硬件上运行超大规模模型。关键成果包括:在 8GB 笔记本 GPU 上以交互速度运行 35B 模型,在游戏台式机上运行 284B 模型,并在单张工作站显卡上运行 753B 的 GLM-5.2。该系统已开源(Apache-2.0),提供 CLI 和桌面应用,兼容 OpenAI 和 Anthropic API,适合个人开发者、初创企业及对数据隐私要求高的行业(如医疗、法律、金融),可支持本地编码代理、离线合同分析等应用场景,为降低大模型推理成本提供了新路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅