Aleph Alpha发布了开源权重模型Kolibri,这是一个专为德语和英语设计的混合专家(MoE)语言模型。该模型总参数量达78.1B,但每个token仅激活3.46B参数,激活比例约4.4%,支持高达1048576个token的上下文窗口,并允许用户按请求设置推理强度,以Apache 2.0许可证在Hugging Face上发布。其FP8检查点约78GB,可在单张B200、B300或H200上运行,或部署于两张H100 SXM5 GPU,通过vLLM提供服务。模型由德国团队全程自主研发,训练基础设施位于德国和芬兰,设计符合欧盟通用人工智能行为准则、AI法案及GDPR要求,数据管道在训练前会清除个人数据。架构上采用50个Transformer块,每层对384个路由专家进行评分并选取前6个,同时始终运行1个共享专家,注意力机制结合分组查询注意力与滑动窗口注意力,仅10层随上下文长度增长。该模型面向公共管理、工业和航空航天等受监管领域的自主部署需求。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅