分享自:

多模态语义通信研究综述

期刊:通信学报DOI:10.11959/j.issn.1000−436x.2023105

本文是秦志金、赵菼菼、李凡、陶晓明发表于《通信学报》2023年5月第44卷第5期的综述论文《多模态语义通信研究综述》。论文系统梳理了语义通信的基础理论、单模态语义通信研究现状、多模态语义通信与多模态数据融合技术、安全语义通信研究,并总结了多模态语义通信面临的主要挑战。以下为对该综述主要观点的学术报告。

一、语义通信的基础理论与分类

论文首先介绍了语义通信的理论来源和基本分类。语义通信的思想源自符号学中关于语法、语义和语用的三重划分。与仅关注符号精确传输的语法通信不同,语义通信的目标是实现收发端语义信息的准确交互。在理论层面,论文回顾了语义熵、语义信道容量、广义率失真理论和面向任务的信息瓶颈理论。语义熵的定义引入背景知识和推测,突破了经典信息论仅基于统计概率的局限。语义信道容量不仅取决于收发符号之间的互信息,还取决于语义编码引入的模糊度和接收消息的平均逻辑信息。面向任务的信息瓶颈理论则通过最小化语义特征与任务标签之间的负互信息来度量语义失真,从而为面向特定智能任务的语义提取提供理论指导。

在分类上,语义通信分为面向语义的通信和面向目标的通信两类。面向语义的通信关注语义层面的准确率,其核心是在编码前引入语义表征模块,过滤与含义无关的冗余信息。面向目标的通信则进一步关注有效性层面,在语义提取中引入目标或任务信息,使系统能够根据具体通信目标过滤与任务无关的语义信息,从而在有限网络资源下完成预期任务。这一分类为理解不同层次语义通信系统提供了统一框架。

二、单模态语义通信研究现状

论文从文本、图像、音频、视频四类主要模态分别综述了单模态语义通信的研究进展。文本语义通信方面,早期研究利用词嵌入模型将单词映射为向量,并通过基于长短期记忆的序列模型实现句子传输,但这类方法难以处理长句子和复杂语法。随后,基于Transformer的联合语义-信道编码方法被引入,通过多头注意力机制并行提取句子特征,在低信噪比下相比传统方法具有明显优势。进一步研究还提出基于通用Transformer的自适应循环机制,动态调整每个位置的循环计算步骤,从而在变化的信道条件下获得更好的性能。

图像语义通信方面,研究者提出了基于深度学习的联合传输-识别方案,将深度神经网络分割为发送端特征提取器和接收端识别器,实现了在较低信噪比下的高识别准确率。针对固定信噪比训练的限制,有研究将注意力机制与联合语义-信道编码结合,根据信噪比产生可伸缩参数,提高了系统对宽范围信噪比的鲁棒性。此外,针对图像空间冗余,有工作采用掩码自编码器和视觉Transformer结构,仅对未被遮蔽的图像块进行编码,显著降低了内存消耗。

音频语义通信方面,研究主要围绕语音信号特征提取展开。有工作设计基于深度学习的音频特征提取器和特征聚合器,将原始音频向量融入包含上下文语义关系的高层隐变量。后续研究进一步引入注意力机制和残差网络结构,通过挤压和激发操作为不同特征分配权重,在多种衰落信道和信噪比下优于传统方法。面向语音识别任务,有研究将原始语音样本转换为频谱,并利用卷积神经网络进行压缩,再通过双向循环神经网络提取文本相关语义特征,最终恢复为文本转录。

视频语义通信方面,研究重点在于利用视频内容的时空冗余降低传输资源需求。有工作提出以感知质量和机器视觉任务性能为指标的深度联合信源-信道编码方案,通过视频内容感知和任务集成实现高效传输。在视频会议场景中,有研究将基于关键点的视频恢复技术引入语义通信,仅在会议开始时共享背景和面部特征信息,后续仅传输面部表情和行为变化的关键点,从而在保持分辨率的同时实现高压缩比。还有研究提出仅传输文本而非视频的方案,大幅降低网络流量。

三、多模态语义通信与数据融合技术

论文指出,单模态语义通信面临多义性和模糊性两大语义问题。多义性指同一模态信号在没有背景知识或上下文信息时难以确定其真实含义;模糊性则指语义编码和信道传输中的噪声可能导致恢复信号无法精确解释发送者语义。由于语义特征数据量远小于源信号,即使少量比特错误也会导致严重语义失真。因此,充分利用多模态信号之间的语义联系,设计面向多模态数据的高效语义编解码器成为必要。

多模态数据融合技术是实现多模态语义通信的重要基础。论文将融合方法按融合位置深浅分为早期融合和后期融合。后期融合通过组合多个单模态分支的最终得分实现,可以采用加权平均、双线性乘积或秩最小化等策略。另一类融合架构基于注意力机制,通过额外神经网络为不同特征分配权重或选择特定特征。在视觉问答任务中,共同注意力机制同时建模视觉注意力和问题注意力,利用图像和问题的对称性实现相互引导。深度模块化共同注意力机制由多层深度级联共同注意力层组成,在视觉问答中表现更佳。双重注意力网络则联合利用视觉和文本注意力,在协作推理中促进视觉和语言之间的交互。

在多模态语义通信研究方面,已有工作以视觉问答为典型任务。有研究采用两个发送机分别传输图像和文本,接收端通过记忆、注意力和合成神经网络融合两种模态的语义信息并输出预测答案。后续工作基于Transformer统一图像和文本的语义编码结构,并提出由查询模块和信息融合模块构成的语义解码网络,利用逐层Transformer提取文本关键词和图像相应区域后进行融合。还有研究者提出深度学习支持的统一语义通信系统,通过领域自适应降低传输开销,并采用多出口结构为不同难度任务提供不同深度的推理路径。也有研究提出跨模态语义通信范式,通过跨模态知识图、跨模态语义编码器和解码器提升系统可靠性。一种信道级信息融合方案将无线信道作为融合多模态数据的媒介,在接收端无需多用户信号检测即可恢复语义信息。

四、安全语义通信研究

论文指出,语义通信本身由于仅交换语义信息而非完整源数据,在一定程度上提升了隐私性和安全性,但通用知识库构建仍带来隐私问题。有研究提出联邦学习支持的语义提取模型训练方案,将终端设备分组并在边缘服务器调度下基于各自组内共享背景知识参与模型训练,通过不同组间不共享知识背景的方式在保护隐私的同时提升模型性能。针对深度神经网络易受对抗输入影响的问题,有研究定义了数据隐私泄露和语义隐私泄露两个指标,提出语义感知信息论隐私方案以保护隐私并保留语义感知的数据效用。在不可信服务器场景中,可通过设计增加隐私信息不确定性的损失函数、向中间特征添加噪声、利用对抗学习策略等方法进行隐私保护。加密方法也被用于语义通信安全,有研究提出深度联合信源-信道加密编码方案,兼具深度联合信源-信道编码的有利特性和抗选择明文攻击的安全性。基于对抗训练的加密语义通信系统可在加密和非加密两种模式下保持语义通信精确度。

五、多模态语义通信面临的挑战与总结

论文从三个层面总结了挑战。语义相关的挑战包括:基于深度学习的语义提取架构要求损失函数可微,导致现有研究与所需多模态语义通信存在差距;端到端架构中语义提取和恢复被视为黑盒,缺乏可解释性;强化学习虽然能解决不可微任务指标问题,但增加了训练复杂度;面向任务的知识库建立和维护仍需深入研究;多模态语义特征的高效提取、解码和融合仍然困难。通信相关的挑战包括:深度学习方法难以用数学公式精确解释,限制了性能分析;需要针对语义信息非均匀分布设计新的资源分配框架;异构设备、不同硬件能力和多模态编码方案给网络构建带来困难;AI算法复杂度高,需要统筹编排信息处理资源和通信资源。分布式多模态相关的挑战包括:多发送端信号同步困难,不同地理位置导致传输时延差异和多径传播使问题复杂化;异构设备产生的数据格式多样,编码器输出维度不一致,统一转换标准缺乏;不同实体间的语义通信模型难以共享。

论文最后指出,多模态语义通信的研究仍处于初级和快速发展阶段,在基本概念、容错纠错机制、资源有限设备上的快速实现、模型共享以及网络安全审查机制等方面均有待深入研究。未来可将非正交多址、大规模多输入多输出、可配置智能反射面、移动边缘计算、联邦学习等先进通信技术,以及卷积神经网络、循环神经网络等人工智能技术与多模态语义通信相结合,为构建高效的多模态语义通信范式提供可行思路。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com