本项研究由Yehjin Shin、Jeongwhan Choi、Hyowon Wi和Noseong Park共同完成,作者均来自韩国延世大学(Yonsei University)。论文发表于2024年人工智能促进协会(Association for the Advancement of Artificial Intelligence,简称AAAI)会议上。该研究属于推荐系统领域中的序列推荐(Sequential Recommendation,简称SR)方向,重点关注基于Transformer的序列推荐模型中自注意力机制(self-attention)的固有缺陷及其改进方法。
序列推荐的核心任务是依据用户的历史交互序列预测其下一次可能交互的物品。近年来,基于Transformer的模型在序列推荐中取得了显著成效,其中自注意力机制负责捕捉序列中不同位置物品之间的长程依赖关系。然而,自注意力机制最初为自然语言处理和计算机视觉任务设计,其在序列推荐场景下暴露出两个关键局限:其一,模型缺乏足够的归纳偏置(inductive bias),难以有效捕捉某些细粒度的序列模式;其二,自注意力本质上具有低通滤波(low-pass filtering)特性,会不断滤除序列中的高频信息,导致过平滑问题(oversmoothing),使不同物品的隐藏表示趋于相似,从而降低表示的表达能力和推荐性能。该研究首次在序列推荐领域揭示并系统分析了这一问题,并提出了一种名为BSARec(Beyond Self-Attention for Sequential Recommendation)的新模型,旨在通过引入傅里叶变换(Fourier transform)和频率重标定器(frequency rescaler)来缓解过平滑问题,同时增强模型对用户短期和长期兴趣的建模能力。
BSARec的核心架构由嵌入层(embedding layer)、超越自注意力编码器(beyond self-attention encoder)和预测层(prediction layer)三部分组成。嵌入层首先将用户的历史交互序列截断或填充至固定长度,并通过物品嵌入矩阵将每个物品映射为d维向量。随后,位置嵌入(positional embedding)被加到物品嵌入上,以保留序列中的位置信息。最终,嵌入表示经过dropout和层归一化(layer normalization)处理,输入到后续的编码器中。
超越自注意力编码器由多个堆叠的超越自注意力块(beyond self-attention block,简称BSA块)组成。每个BSA块包含三个模块:超越自注意力层(beyond self-attention layer)、带有频率重标定器的注意力归纳偏置模块(attentive inductive bias with frequency rescaler)以及逐点前馈网络(point-wise feed-forward network)。在超越自注意力层中,输入表示x^ℓ 被同时送入两个分支:一个分支是原始的自注意力矩阵a^ℓ,另一个分支则是由离散傅里叶变换(discrete Fourier transform,简称DFT)构造的归纳偏置矩阵a^ℓ_ib。两者的输出按照可调系数α进行加权求和,公式为s^ℓ = α a^ℓ_ib x^ℓ + (1 − α) a^ℓ x^ℓ。其中α用于控制归纳偏置和可训练自注意力之间的权衡。在归纳偏置分支中,模型对输入进行傅里叶变换,将其分解为低频成分(low-frequency components,简称LFC)和高频成分(high-frequency components,简称HFC),然后通过公式a^ℓ_ib x^ℓ = LFC[x^ℓ] + β HFC[x^ℓ] 将两者重新组合。β是一个可训练参数,用于控制高频信息的放大程度,从而缓解低通滤波导致的过平滑问题。该设计所基于的图模型是一个环形图(ring graph),其对应的离散傅里叶变换将序列中的物品嵌入视为环形拓扑上的信号。低频分量反映了用户长期稳定的兴趣,例如一位苹果产品的忠实用户;高频分量则对应用户短期的突发兴趣,例如为了度假而购买浮潜面罩。通过有选择地注入高频信息,BSARec能够同时捕捉这两种不同时间尺度的偏好变化。
每个BSA块的输出还会经过逐点前馈网络,并通过dropout、残差连接(residual connection)和层归一化进行稳定训练。在预测层中,模型将最后一层输出的物品表示与候选物品嵌入进行点积,得到用户对该物品的偏好分数。模型训练采用交叉熵损失函数(cross-entropy loss),将下一物品预测任务视为全物品集上的分类任务。
实验部分在六个基准数据集上评估了BSARec的性能,包括Amazon Beauty、Amazon Sports、Amazon Toys、Yelp、LastFM和ML-1M。这些数据集在稀疏性、领域和平均序列长度方面各不相同,以全面检验模型的适用性。对比方法涵盖三类:基于循环神经网络或卷积神经网络的模型GRU4Rec和Caser;基于Transformer的模型SASRec、BERT4Rec和FMLPRec;以及利用对比学习(contrastive learning)的Transformer模型DuoRec和FEARec。评估指标采用HR@k(Hit Rate)和NDCG@k(Normalized Discounted Cumulative Gain),k取5、10和20,且在全物品集上进行排序评估,不使用负采样。实验结果显示,BSARec在所有六个数据集和所有评估指标上均取得了最优性能。例如,在LastFM数据集上,BSARec的HR@10相对最佳基线提升了27.49%;在ML-1M数据集上,HR@5提升了5.77%;在Amazon Beauty数据集上,HR@5也提升了4.10%。值得注意的是,BSARec在不使用对比学习的情况下,依然稳定优于采用对比学习的DuoRec和FEARec,这表明其架构设计本身已具备足够的表示增强能力。
消融实验进一步验证了各组件的作用。仅使用原始自注意力的模型和仅使用注意力归纳偏置的模型在性能上均不及完整的BSARec,这说明两种机制存在互补性。将β设为标量而非可学习向量也会导致性能下降,表明对高频信息进行细粒度重标定是有益的。对α的敏感性分析显示,不同数据集对α的偏好不同:Amazon Beauty、Toys、Yelp和LastFM偏好较大的α值,而Amazon Sports和ML-1M则在较小的α下表现最佳。对低频分量数量c的敏感性分析同样表明,最佳c值因数据集而异。此外,学习到的β值在不同数据集和不同层之间呈现差异:第一层的β值普遍高于第二层,说明在浅层更强调高频信息有助于模型捕捉用户短期的兴趣变化。
模型复杂度与运行时间分析显示,BSARec相比SASRec仅引入了极少的额外参数,训练时间也仅略有增加。与基于对比学习的DuoRec和FEARec相比,BSARec的训练速度具有明显优势。例如在Amazon Beauty数据集上,BSARec的每轮训练时间为12.75秒,而FEARec为156.83秒;在ML-1M上,BSARec为20.73秒,FEARec为278.24秒。这表明BSARec在不牺牲效率的前提下实现了性能提升。
这篇论文的主要贡献在于三个方面:第一,首次在序列推荐领域揭示了自注意力机制的低通滤波本质及其导致的过平滑问题,并通过频谱可视化和理论分析进行了系统论证;第二,提出了一种新的模型BSARec,通过傅里叶变换注入注意力归纳偏置,并通过频率重标定器同时利用低频和高频信息,有效缓解过平滑问题;第三,在六个基准数据集上进行了广泛实验,验证了BSARec相对于七种基线方法的优越性,并展示了其在捕获用户短期兴趣突变方面的能力。案例研究还表明,BSARec能够成功推荐其他模型无法捕捉的用户短期兴趣转变,例如为一位长期收听摇滚音乐的LastFM用户推荐流行音乐艺术家。
该研究为序列推荐中的Transformer模型提供了一种简洁而有效的改进思路。其核心价值在于证明了在自注意力机制之外引入频域归纳偏置能够带来显著的性能提升,且不需要复杂的对比学习等辅助训练策略。这不仅为推荐系统领域提供了新的方法工具,也为理解自注意力机制在序列建模中的频率行为提供了理论视角。未来工作可进一步探索自注意力在序列推荐中的频率动态机制,以及如何在更多样化的场景下自适应地调整高低频信息的混合策略。