《计算机应用与软件杂志》发表论文赏析
作者:曾庆威, 张建, 张鸿昌, 谭雨阳, 沈文枫
摘要:Transformer在自然语言处理中运用广泛,但存在文本长度过长带来的输入信息被切割、显存占用太大的问题,已有的解决方法是让模型动态决定每层注意力宽度,可以在控制计算量和显存开销的前提下关联最优序列长度,但存在每层最优的注意力宽度并不能达到模型最优注意力宽度的缺点。为此,提出一种全层自适应宽度注意力模型(GAA)。让每层的注意力范围和全局关联,实现模型全局注意力范围最优,还将模型的前馈层修改为带门控单元的前馈层(FFNGLU)。在数据集enwiki8和text-8上的验证表明,该方法仅使用25%的训练计算成本,即可达到比基线更好的性能。
关键词:Transformer, 全局自适应宽度注意力, FFNGLU