🔥 今日值得一读 Liquid AI开源多模态决策模型:零输出令牌,一次前向传播出答案!
Liquid AI Releases Open-Weight d1-3B and d1-omni-600M: Multimodal Decision Models With Zero Output Tokens
MarkTechPost 🔥 重点 开源多模态论文方法 🕐 今天 02:23

📖 AI 总结

Liquid AI 发布了两款开放权重多模态决策模型 d1-3B 与 d1-omni-600M,二者均不生成文本,而是在单次前向传播中以零输出 token 返回经过校准的类型化答案。d1-3B 可读取文本与图像,d1-omni-600M 支持文本配图像或音频,主要面向 NVIDIA 平台上的实时决策场景,如路由、审核、意图分类、重排序、LLM 评判及智能体护栏等。模型支持三类问题:是非判断、多选项分类和有序评分。两款检查点已上线 Hugging Face,可通过 Transformers 加载并获 llama.cpp 首日支持,在年收入低于一千万美元时可免费商用。d1-3B 基于 LFM2.5-VL-3B 构建,采用 SigLIP2 视觉编码器与 32768 token 上下文,其训练中长输入、打乱选项顺序和修正数据捷径比复杂方法更为关键。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅