本工作由来自中国科学技术大学、北京大学以及京东探索研究院的多位研究者共同完成,包括Guohui Zhang、Xiaoxiao Ma、Jie Huang、Hang Xu、Hu Yu、Siming Fu、Yuming Li、Zeyue Xue、Lin Song、Haoyang Huang、Nan Duan以及通讯作者Feng Zhao。该研究以预印本形式发布于arXiv,编号为arXiv:2605.12480v1,提交日期为2026年5月12日,属于计算机视觉与音频生成交叉领域。
联合音频-视频生成近年来取得了显著进展,但在实际应用中,模型需要同时满足单模态保真度、跨模态语义一致性以及细粒度音画同步等多重目标。现有的大规模联合生成模型如LTX-2虽然在单项指标上表现优异,但在所有这些维度上同时达到理想效果仍然面临挑战。强化学习与可验证奖励的结合,尤其是群组相对策略优化,已经在文本到图像和文本到视频生成中展现了强大的后训练优化能力。然而,将强化学习直接扩展到多目标、多模态的联合音频-视频生成任务中,其效果仍然不理想。作者通过深入分析,首次揭示了将强化学习应用于该任务时的三个核心障碍:多目标优势不一致、多模态梯度不平衡以及统一信用分配导致的细粒度跨模态对齐区域探索不足。为了解决这些问题,作者提出了OmniNFT框架,旨在通过模态感知的在线扩散强化学习策略,全面改善音频与视频的感知质量、跨模态对齐和音画同步性能。
OmniNFT的核心设计包括三个相互配合的创新模块。第一个模块是模态级优势路由。在联合音频-视频生成中,同一多模态输出的视频质量和音频质量奖励经常不一致,近一半的样本在两种模态上获得相反的优势信号。传统的全局优势标量会将两种模态的优势折叠为一个无法区分的数值,导致学习信号被稀释甚至冲突。OmniNFT为视频奖励、音频奖励和跨模态同步奖励分别计算独立优势,并将视频优势仅路由到视频分支,音频优势仅路由到音频分支,而同步优势则作为共享监督广播到两个分支。这种解耦策略能够更准确地反映每个分支应当被鼓励还是被惩罚,从而提供更具信息量的学习信号。
第二个模块是层级梯度手术。作者首先通过正向分析发现,浅层Transformer块主要负责模态内生成,而中层和深层块则承担跨模态音画交互与对齐功能。进一步的反向分析显示,在音频分支的浅层中出现了异常的视频到音频交互梯度峰值,这意味着来自视频分支的梯度会错误地注入到负责音频模态内生成的浅层音频层,干扰其更新方向。为了抑制这种梯度泄漏,OmniNFT在浅层音频层的音频到视频交叉注意力键值路径上施加部分停止梯度操作,使得前向采样保持不变,但反向传播中通过该路径的梯度被按比例缩放。具体而言,对于低于预设浅层边界的Transformer块,键值张量被替换为原始值与停止梯度值的加权组合,而对于深层块则不施加任何梯度截断。这种策略保留了负责跨模态对齐的深层交互梯度,同时抑制了对浅层音频模态内生成过程的有害干扰。
第三个模块是区域级损失重加权。音画同步和细粒度对齐通常集中在视频中的发声区域,例如说话人物的唇部或产生声音的物体,而统一更新会忽略这些关键区域对整体感知质量的不成比例贡献。为了在不引入外部检测模块的情况下定位这些关键区域,作者观察到音频分支的视频到音频交叉注意力图能够自然地高亮说话主体及其发声区域。基于这一内在代理信号,OmniNFT从深层交叉模态块和最后几个去噪步骤中聚合视频到音频注意力图,为每个视频令牌计算一个重要性得分,并将其归一化映射为区域级权重。这些权重被整合到视频分支的损失函数中,使得策略优化更加集中于感知关键区域,而音频分支损失保持不变。
在实验部分,作者使用LTX-2作为骨干模型,并在JAVISBench和VBench两个基准上进行了系统评估。奖励模型方面,采用VideoAlign和HPSv3评估视频质量,采用Audiobox Aesthetics评估音频质量,采用CLAP得分评估音频-文本对齐,采用同步得分评估音画同步。评估指标覆盖四个维度:音画质量、文本一致性、音画一致性和音画同步性。定量结果显示,与LTX-2相比,OmniNFT将视觉质量从2.038提升到3.326,相对提升63.2%;音频质量从5.197提升到5.715,相对提升10.0%;文本-音频ImageBind相似度超越了LTX-2和更大的LTX-2.3模型;音画同步方面,Desync指标从0.569降低到0.269,相对降低52.7%,显著优于G-DPO的0.412。在VBench上,成像质量、美学质量和主体一致性也均获得显著提升。消融实验表明,逐步加入模态级优势路由、层级梯度手术和区域级损失重加权均能带来一致的性能提升,且引入的额外计算开销极小。超参数分析表明,在浅层执行梯度手术优于在深层执行,适中的重加权强度能够实现视觉质量与同步性能的最佳平衡。
该研究的核心发现是,将强化学习直接应用于联合音频-视频生成时,简单的全局优势策略无法有效处理多模态奖励之间的冲突,且双流模型内部的梯度流动存在不对称性。通过模态级解耦优势、层级梯度截断和区域级损失重加权三个层面的配合,OmniNFT成功缓解了这些优化不匹配问题,实现了全面的性能提升。其科学价值在于首次系统揭示了强化学习方法在多模态生成任务中的独特障碍,并提出了针对性的解决框架。应用价值方面,该方法能够提升实际音视频生成系统在视觉质量、音频保真度、语义一致性和同步精度上的综合表现,为更高质量的多模态内容生成提供了可行的后训练策略。研究的亮点包括基于注意力图的内在关键区域定位方法、无需外部检测器即可实现细粒度信用分配,以及通过简单的停止梯度操作在保持前向采样不变的同时精确控制梯度流动。这些设计使OmniNFT在引入可忽略计算开销的情况下,显著超越强基线模型。