小模型逆袭!TriPLU三线性乘积FFN损失直降0.04,1M字节训练就碾压SwiGLU!
TriPLU: Bypassing the Gate with Direct Trilinear Product FFNs in Tiny Language Models
arXiv CL (cs.CL) 重要 #Transformer#FFN#小模型 🕐 08-24 12:00

📖 AI 总结

本文研究了一种名为TriPLU的新型前馈网络结构,用于小型解码器语言模型。TriPLU用三线性乘积分支替代传统的门控前馈网络,直接对三个投影流进行逐元素相乘。在字符级TinyStories 1M字节实验中,TriPLU达到1.0637的平均最佳验证损失,优于SwiGLU的1.1017以及度数为4和2的乘积控制组。在Byte-BPE实验中,TriPLU在低学习率设置下也降低了TinyStories和WikiText-2的每字节比特数,PMI切片证据显示其对中高PMI相邻词对的学习有所改善。但研究发现该分支对优化敏感,在热调度下最终性能仍会下降。作者明确指出,直接乘积FFN仅在特定低计算预算场景下能改善小模型损失,并未证明其在FLOP归一化效率、扩展行为或通用大语言模型性能上的优势。

🔑 关键词速览

TriPLU三线性乘积线性单元,一种用三次乘积分支替代门控机制的前馈层
FFN前馈网络,Transformer中的标准组件,用于特征变换
SwiGLU一种门控线性单元变体,使用Swish激活函数,常用于语言模型
Byte-BPE字节级字节对编码,一种子词分词方法,处理原始字节序列
PMI点互信息,衡量词对关联强度的统计量,用于分析模型学习到的词间关系
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅