这是一篇关于脑机接口(BCI)中用于脑电图(EEG)解码的新型深度学习架构的研究论文。以下是对该研究的详细学术报告。
该研究成果由意大利罗马萨皮恩扎大学(Sapienza University of Rome)计算机、自动化与管理工程系的 Imad Eddine Tibermacine 作为第一作者和通讯作者主导,与同校心理学系的 Samuele Russo 以及意大利国家研究委员会(Italian National Research Council)的 Christian Napoli 合作完成。论文发表于爱思唯尔(Elsevier)旗下的《信息融合》(Information Fusion)期刊,于2026年5月1日在线发表。
这项研究的学术背景植根于基于脑电图(EEG)的脑机接口(Brain-Computer Interfaces, BCIs)领域。脑机接口旨在建立用户大脑活动与外部设备间的直接通信,在运动康复、轮椅控制等领域有广阔前景。然而,EEG信号解码面临两大核心挑战:信噪比(Signal-to-Noise Ratio, SNR)低和固有的非平稳性(non-stationarity),即信号的数据分布会随时间和记录条件变化,导致解码器性能不稳定。现有深度学习模型虽然在性能上有所提升,但大多将数据视为欧几里得空间(Euclidean spaces)中的点,忽略了EEG信号协方差矩阵(covariance matrices)的内在几何结构。这些协方差矩阵天然位于对称正定(Symmetric Positive Definite, SPD)流形(manifold)上,传统的欧式运算可能破坏其数据距离和类别结构。因此,该研究旨在引入一种能够保留SPD流形几何结构的深度学习架构,通过一种新颖的中间层信息融合(mid-level information fusion)机制,来解决多视图协方差特征在非平稳条件下的对齐(alignment)和集成问题,从而提升EEG解码的鲁棒性和准确率。
该研究的实验流程设计精巧,包含了一套完整的前向传播和反向传播机制。首先,研究采用了三个公开的EEG数据集进行验证,它们分别代表了不同类型的BCI范式:一个是时间同步的稳态视觉诱发电位(Steady-State Visual Evoked Potential, SSVEP)数据集“MAMEM-SSVEP-II”,包含11名被试的256通道数据;一个是时间异步的运动想象(Motor Imagery, MI)数据集“BCIC-IV-2a”,包含9名被试的22通道数据,执行四类运动想象任务;还有一个是与错误相关的负电位(Error-Related Negativity, ERN)数据集“BCI-ERN”,以评估模型在不平衡分类任务上的表现。 在详细工作流程中,每个EEG试次首先被转换为一个或多个“视图”(views),例如在SSVEP数据集中,一个5秒的试次被分割成4个不重叠的1秒时间窗口,每个窗口就是一个视图。每个视图的多通道信号首先经过一个轻量级的二维卷积神经网络(2D CNN)前端,该前端实现空间滤波和短时时空滤波,将原始EEG数据转换为一个特征图(feature map)E。紧接着,前端输出的特征图会被用来计算一个正则化的SPD协方差矩阵X,作为对该视图内多通道二阶关系的总结,这一步实现了数据在视图内的初步融合。接下来是研究的核心创新部分:基变换层(Basis Transformation Layer)。该层引入一个可学习的正交矩阵W(即W^T * W = I),该矩阵被约束在施蒂费尔流形(Stiefel manifold)上。通过一个保角变换(congruence transform)X’ = W^T * X * W,原始SPD矩阵X被转换为X’。这个操作在不脱离SPD流形的情况下,实现了对不同视图内协方差特征的几何一致性对齐,其本质是寻找一个最优的旋转基底以增强类别可分性。对齐之后,模型进入对数-欧几里得映射层(Log-Euclidean Mapping Layer)。该层通过对变换后的SPD矩阵X’进行特征值分解和矩阵对数运算,将其映射到单位矩阵处的切空间(tangent space),得到一个对称矩阵Y = log(X’)。这一步骤有效地将流形的曲率线性化,使得后续可以使用标准的欧几里得运算进行处理。映射后,矩阵Y的上三角元素被提取并向量化为一个特征向量,这个过程自然地融合了来自多个视图的对齐后特征。最后,这个特征向量被送入一个全连接层进行分类。在线推理时,由于基变换矩阵W已固定,无需再进行流形回缩计算,其总体延迟与在线处理兼容。为了处理矩阵对数运算可能出现的数值稳定性问题,算法对过小或几乎相等的特征值进行了特殊处理,例如使用一个阈值ε来避免除零错误,确保梯度在反向传播中保持稳定。反向传播过程详细推导了损失函数相对于基变换层参数W、对数映射层以及全连接层的梯度,并通过投影操作保证W的更新始终沿着施蒂费尔流形的切空间方向,从而维持正交约束。
研究结果有力地证明了所提方法的优越性。在分类性能上,所提出的模型“BTLSM”在所有三个基准数据集上都取得了最高的准确率或AUC值,且与当前最先进的基线模型相比有显著提升。具体而言,在BCIC-IV-2a数据集上,准确率达到78.32%,比表现最好的对比模型MATT提高了3.61个百分点;在MAMEM-SSVEP-II数据集上准确率为67.68%,提升2.49个百分点;在不平衡的BCI-ERN数据集上,AUC值达到80.45%,提升3.26个百分点。消融实验(Ablation Study)的结果进一步揭示了每个组件的关键贡献。当移除基变换层(no-BT)时,模型性能急剧下降,例如在BCIC-IV-2a上准确率降至38.4%;当移除对数-欧几里得映射(no-log)时,性能同样大幅下降;而同时移除这两个组件、采用纯欧几里得方法(euc-cov)时,性能最差。这明确证实了保留SPD几何结构和施蒂费尔流形约束对于避免过拟合和提升解码性能是必不可少的。此外,定量可解释性分析显示,学习到的基变换矩阵W能始终维持极高的正交性,其正交偏差δorth保持在10^-6量级。同时,经过施蒂费尔对齐后,特征在欧式对数域中的类别可分性指标δJ在所有数据集上都呈现出一致的正向提升,并且经过统计检验(含多重比较校正)证明这种提升是显著的。这表明模型能够稳定且可重复地学习到一种有效对齐机制,改善了非线性可分性。计算效率分析显示,尽管模型包含约31.6万可训练参数,但由于其分类器是在紧凑的对数-欧式协方差特征上进行操作,而非对原始长序列EEG数据进行重复卷积,因此其推理延迟仅为约0.89毫秒,与轻量级卷积网络相当,整体计算成本主要来自前端卷积网络。
该研究成功提出并验证了一种名为BTLSM的新型几何感知深度学习架构。其核心贡献在于设计了一个可学习的、受施蒂费尔流形约束的基变换层,它在不破坏对称正定流形结构的前提下,对多视图EEG协方差特征进行对齐,并结合对数-欧几里得映射,实现了几何保留的中间层信息融合。这一方法论的科学价值在于,它为处理非欧几里得结构数据的深度学习模型设计提供了新的视角,强调了保持数据内在几何结构对于提升模型性能的重要性。其应用价值则直接体现在对更稳健、更高效BCI系统的推动上。通过有效缓解信号非平稳性问题,该技术有望缩短BCI校准时间、提高连续控制(如轮椅驾驶)的可靠性,并增强人机交互的安全性,为BCI在临床和日常环境中的实际部署铺平了道路。该研究的亮点不仅在于其提出的新颖架构和显著的性能提升,还在于其模块化设计,其流形处理模块可以灵活地与不同的神经网络前端或低秩施蒂费尔变体相结合,以适应不同的计算资源约束,展现了良好的泛化潜力和实用性。