分享自:

生成式人工智能增强的车联网多模态语义通信:系统设计与方法

期刊:IEEE Vehicular Technology MagazineDOI:10.1109/mvt.2025.3545399

本文提出了一种面向车联网(Internet of Vehicles, IoV)的生成式人工智能(Generative Artificial Intelligence, GAI)增强的多模态语义通信框架,称为G-MSC。该研究由北京理工大学的Jiayi Lu、新加坡科技设计大学的Wanting Yang、Zehui Xiong、Tony Q. S. Quek、北京理工大学的Chengwen Xing、萨里大学的Rahim Tafazolli以及哈利法大学的Mérouane Debbah等人合作完成,发表于IEEE Vehicular Technology Magazine,2025年6月刊出,数字对象标识符为10.1109/MVT.2025.3545399。

随着物联网和互联设备的快速发展,车联网已成为智能交通系统的核心组成部分。车联网系统由车辆、路侧单元(Roadside Units, RSUs)、车辆边缘计算(Vehicular Edge Computing, VEC)和车辆云计算(Vehicular Cloud Computing, VCC)等实体构成,支持路径规划、高清视频下载、驾驶安全等多种任务。由于单车传感器视角有限且可能受遮挡影响,需要融合摄像头、雷达、激光雷达等多模态数据以获得完整环境感知。然而,多模态数据体量巨大,加之车辆数量迅速增长,加剧了无线资源稀缺问题。同时,车联网节点的高移动性和动态拓扑导致频繁切换,给接入管理带来困难。为在保证语义准确性的前提下减少传输数据量,语义通信(Semantic Communication, SemCom)被认为是面向6G的关键技术。与传统通信只关注比特级准确传输不同,语义通信更关注信息含义的正确传递和任务有效性。当前语义通信研究多集中于文本、图像和视频等传统数据类型,鲜有专门针对车联网的架构设计,且现有基于联合信源信道编码(Joint Source-Channel Coding, JSCC)的端到端训练框架限制了语义信息的可解释性和可操作性,多车协作场景中知识库构建也面临数据采集和标注成本高昂的问题。

针对上述挑战,本文提出了G-MSC框架,利用GAI技术赋能语义编码、传输和语义解码三个环节,以支持车联网中多模态数据传输和多样化任务处理。根据任务需求,G-MSC可选择数字传输或模拟传输方式。在发送端,GAI用于多模态语义信息提取、对齐与融合;在信道传输阶段,GAI用于信道建模、信道估计和多址接入优化;在接收端,GAI用于去噪、细化以及多任务语义解码。文章的主要贡献包括:总结四类V2X通信任务及其多模态数据类型,提出G-MSC框架并阐述GAI在语义编码、信道和语义解码中的作用,开展基于鸟瞰图(Bird’s Eye View, BEV)预测任务的模拟传输案例研究,并以交并比(Intersection over Union, IoU)为指标验证了扩散模型(Diffusion Model, DM)对图像质量和预测精度的提升效果。

在车联网通信任务方面,文章将V2X通信分为四类:车辆对网络(Vehicle-to-Network, V2N)通信适用于远程监控、路径规划和高清视频下载等需要高带宽和长距离传输的任务,通常采用数字传输;车辆对基础设施(Vehicle-to-Infrastructure, V2I)通信用于低时延场景,如道路表面信息重建和动态交通信号控制,主要挑战是有限带宽下的低时延和高可靠传输;车辆对车辆(Vehicle-to-Vehicle, V2V)通信用于协作自适应巡航控制(Cooperative Adaptive Cruise Control, CACC)和自动变道(Automatic Lane Change, ALC)等需要实时共享速度和制动状态的任务,常用专用短程通信,但高速移动和遮挡会导致信道变化和信号阻塞;车辆对行人(Vehicle-to-Pedestrian, V2P)通信用于盲区检测和行人预警等短距离高保真任务,模拟传输因其成本低、保真度高而更为适用。这些任务涉及图像、点云、文本、语音等多种数据模态,各模态特性不同:摄像头提供丰富视觉信息但缺乏深度感知且易受天气影响;雷达在恶劣天气下仍有效但分辨率较低;激光雷达提供精确深度信息但成本较高;惯性测量单元(Inertial Measurement Unit, IMU)能快速检测运动变化但存在漂移误差。因此需要融合多模态数据以发挥各自优势并减少冗余。

在G-MSC框架设计中,语义编码器分为模拟编码和数字编码两种模式。模拟编码主要采用多模态对齐和多模态融合方法。多模态对齐通过旋转和平移将不同模态数据映射到统一坐标系,并同步到同一时间戳。多模态融合早期方法包括将雷达数据投影到相机域或将相机数据投影到雷达点云域,但存在投影畸变和数据鲁棒性问题;晚期融合对各模态独立处理后再整合,虽保留更多信息但模型规模大、计算开销高。为此,文章提出采用中间融合方法即BEV融合,先分别用卷积神经网络(Convolutional Neural Network, CNN)提取图像特征,用体素或PointPillar方法处理点云,再将特征投影到统一BEV空间进行融合,常用融合方式包括加法、平均、拼接、集成和专家混合等。变分自编码器(Variational Autoencoder, VAE)等生成模型还可用于学习共享隐空间以进一步增强多模态融合效果。数字编码适用于长距离通信,生成模型可将图像数据转换为文本描述,OpenAI Whisper可将语音转写为文本,YOLO算法可将图像转换为边界框和物体类别,图像描述算法可生成文本描述,最终传输文本、边界框和类别等信息。

在GAI增强的高移动性无线传输方面,文章讨论了信道建模、信道估计和多址接入三个方向。传统信道建模采用加性高斯白噪声(Additive White Gaussian Noise, AWGN)和瑞利衰落信道,难以准确反映复杂现实信道条件。文献[11]提出基于生成对抗网络(Generative Adversarial Network, GAN)的信道密度估计方法,在无先验知识情况下学习真实信道特性。信道估计方面,传统导频方法需要先验信道分布且对噪声敏感,动态信道状态信息需要频繁重计算。扩散模型可以无模型方式学习接收导频信号与信道矩阵之间的映射,实现实时信道恢复,显著提高信道估计效率。多址接入方面,文献[13]提出离散语义特征分割多址接入范式,利用深度学习提取多用户语义信息到离散子空间,GAI可进一步自适应优化语义特征提取和压缩,提升带宽利用效率。

在GAI增强的多任务语义解码方面,模拟解码有两条路径:一是在语义解码前进行去噪,功能类似于传统通信中的信道均衡;二是细化已解码数据,通过感知损失校正语义错误并增强连贯性。数字解码中扩散模型可作为独立语义解码器,利用其对复杂分布的建模能力和序列推理能力,处理多用户协作中的延迟变化。例如在多车协作场景构建中,扩散模型可立即处理已到达数据并整合延迟输入,实现实时场景重建。

案例研究采用nuScenes-mini数据集,包含6个摄像头、5个雷达和1个激光雷达,覆盖4个国家的10个场景,每个场景时长20秒,共约404张图像,其中162张用于训练,242张用于测试。实验使用1个雷达和6个摄像头执行V2I安全相关任务。首先将雷达点云和相机图像变换到同一坐标空间,对点云进行体素化,用ResNet101编码器提取图像特征,通过双线性采样获得3D特征网络,然后将点云和图像特征投影到同一BEV空间拼接,经过包含四层卷积层的信道编码后通过AWGN信道传输,压缩为BEV特征图。特征图用ResNet18网络解码后,由扩散模型进行细化,并通过输入未来时间戳作为提示,生成未来1、2、3秒的预测BEV图像。训练分三阶段:第一阶段训练多模态融合编码器和语义解码器模块;第二阶段加入信道、信道编码和解码训练,信道前网络模拟车辆端本地处理,信道后网络包括BEV压缩器模拟边缘服务器处理,采用分割学习解决车辆计算资源有限问题,学习率设置为1×10⁻⁴并使用AdamW优化器;第三阶段使用扩散模型进行细化,学习率调整为1×10⁻³,推理步数设为1000,采用Adam优化器。实验在NVIDIA RTX 4090(24GB)GPU上进行。

实验结果显示,经过扩散模型细化后的BEV图像清晰度显著提升,车辆位置更容易识别。在IoU指标上,对比无DM的无损传输、无DM的MSC传输和G-MSC传输三种方案,随着信噪比(Signal-to-Noise Ratio, SNR)从-8 dB提高到16 dB,各场景IoU均呈上升趋势。扩散模型细化在所有场景下均带来显著IoU提升,尤其在低SNR条件下,有效减轻了信道质量差导致的性能损失。场景c由于复杂度较低,DM处理后的IoU略高于场景a和场景b。预测任务中,未来1、2、3秒的BEV图像清晰且具有良好定义。

文章最后提出了三个未来研究方向:一是混合数字-模拟传输,将模拟传输用于高保真主信息传输,数字传输用于短紧急数据包;二是多车语义信息调度,结合GAI和强化学习优化传输顺序和优先级,减少数据冲突;三是跨任务协调,允许多个任务共享语义信息,动态调整资源分配以提高效率。该研究的价值在于首次系统性地将GAI技术融入车联网多模态语义通信框架,通过BEV融合和扩散模型实现了高效可靠的数据传输与预测,为解决车联网中多模态数据处理、信道不稳定和噪声干扰等核心挑战提供了新思路。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com