🔥 今日值得一读 大模型不用可训练嵌入表也能行!固定码照样跑出52%准确率
Do Language Models Need a Trainable Input Embedding Table? Fixed Minimal Token Codes at 1.7B-Class Scale
arXiv CL (cs.CL) 🔥 重点 #LLM架构#嵌入层#训练方法#效率优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
想省参数的开发者可尝试用固定token编码替代可训练嵌入表,在1.7B级模型上验证不损语言建模能力。

📖 AI 总结

该研究探讨语言模型是否必须依赖可训练的词元输入嵌入表,还是可以仅凭固定的词元身份标识获得实质语言能力。作者以相同分词器、上下文主干、解绑输出头和训练配方,从零训练三个仅解码器模型,每模型目标预算约1000亿预测词元,输入接口分别为可学习嵌入表、规范16位词元ID码,以及一种基于GF(2)的固定可逆重编码,固定码直接重复至模型宽度而无需额外输入投影。结果显示,两种固定码模型均获得可观能力:规范码在HellaSwag归一化准确率52.40%、PIQA 70.51%、LAMBADA 42.75%;可学习输入对照在HellaSwag和LAMBADA等评测上更优。因此结论是可行性而非性能持平:独立可训练的词元专属输入向量并非观测能力的必要条件。固定接口还移除约1.007亿可训练参数,使模型规模为17.11亿,但参数削减并非核心发现。这些单次实验区分了架构必要性与经验效用,并为研究不可变输入下游的表征学习提供了受控环境,但未确定特定能力的定位。

🔑 关键词速览

可训练输入嵌入表为词汇表中每个token分配一个可独立学习的向量的参数矩阵。
固定token身份使用预定义的、不可学习的编码(如16位ID码)来表示token,而非可训练向量。
仅解码器语言模型一种只使用Transformer解码器堆叠的语言模型,通常用于自回归文本生成。
GF(2)上的可逆重编码在二元域上进行的线性可逆变换,用于将token ID映射为固定码。
非绑定输出头架构输出层与输入嵌入层不共享权重的模型设计。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅