该研究探讨语言模型是否必须依赖可训练的词元输入嵌入表,还是可以仅凭固定的词元身份标识获得实质语言能力。作者以相同分词器、上下文主干、解绑输出头和训练配方,从零训练三个仅解码器模型,每模型目标预算约1000亿预测词元,输入接口分别为可学习嵌入表、规范16位词元ID码,以及一种基于GF(2)的固定可逆重编码,固定码直接重复至模型宽度而无需额外输入投影。结果显示,两种固定码模型均获得可观能力:规范码在HellaSwag归一化准确率52.40%、PIQA 70.51%、LAMBADA 42.75%;可学习输入对照在HellaSwag和LAMBADA等评测上更优。因此结论是可行性而非性能持平:独立可训练的词元专属输入向量并非观测能力的必要条件。固定接口还移除约1.007亿可训练参数,使模型规模为17.11亿,但参数削减并非核心发现。这些单次实验区分了架构必要性与经验效用,并为研究不可变输入下游的表征学习提供了受控环境,但未确定特定能力的定位。
| 可训练输入嵌入表 | 为词汇表中每个token分配一个可独立学习的向量的参数矩阵。 |
| 固定token身份 | 使用预定义的、不可学习的编码(如16位ID码)来表示token,而非可训练向量。 |
| 仅解码器语言模型 | 一种只使用Transformer解码器堆叠的语言模型,通常用于自回归文本生成。 |
| GF(2)上的可逆重编码 | 在二元域上进行的线性可逆变换,用于将token ID映射为固定码。 |
| 非绑定输出头架构 | 输出层与输入嵌入层不共享权重的模型设计。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅