分享自:

面向理解的语音大语言模型综述

期刊:IEEE Journal of Selected Topics in Signal ProcessingDOI:10.1109/jstsp.2025.3640535

本文发表于 *IEEE Journal of Selected Topics in Signal Processing*,作者包括 Jing Peng、Yucheng Wang、Kai Yu 等,来自上海交通大学 X-LANCE 实验室、苏黎世联邦理工学院、华中科技大学等机构。这是一篇关于语音大语言模型(Speech LLMs)在语音理解(Speech Understanding)领域的综述论文,旨在系统梳理该方向的定义、任务分类、模型架构、训练策略、数据集与评估方法,并指出当前面临的关键挑战。

文章首先指出,语音理解长期以来缺乏统一定义。作者提出了一种宽泛且与任务无关的界定:语音理解是从口语信号中感知和认知信息、最终生成文本解释的综合过程。与传统自然语言理解(Natural Language Understanding, NLU)仅处理符号化文本不同,语音理解需要解析声学信号中的语言内容、副语言线索和非语言语境。文章还区分了语音理解与口语语言理解(Spoken Language Understanding, SLU),后者更侧重于从转写文本中提取结构化语义。在此基础上,作者构建了一个三维任务分类体系:信息维度(Informational Dimension)将任务分为语言信息、副语言信息和非语言信息;功能维度(Functional Dimension)依据认知深度将任务分为感知任务、浅层认知任务和深层认知任务;格式维度(Format Dimension)则从输入输出结构的角度进一步细分任务类型。这一分类框架为后续模型设计和评估提供了系统参照。

论文回顾了语音理解模型的演进历程。早期系统采用级联架构(Cascaded Architecture),将自动语音识别(Automatic Speech Recognition, ASR)与语义理解模块串联,虽然模块化程度高,但存在错误传播、延迟增加和声学信息丢失等问题。随着深度学习发展,端到端专用系统(End-to-End Specialized Speech Understanding System)开始将语音直接映射到高层语义表示,减少了错误累积。进一步地,以大语言模型为核心的端到端通用系统(End-to-End General Speech Understanding System)出现,将预训练文本大模型作为推理核心,通过跨模态对齐使语音输入进入语言模型的表示空间,从而支持摘要、问答、情感检测等多种任务。代表性模型包括 SALMONN、SEED、Listen-Think-Understand 和 Desta-2 等。

在模型结构方面,文章将语音大语言模型归纳为三个基本阶段:模态特征提取、模态信息融合和大语言模型推理。模态特征提取阶段主要分为连续序列建模和离散序列建模两种范式。连续序列建模使用预训练音频编码器(如 Whisper、Conformer、WavLM)直接输出连续嵌入向量;离散序列建模则通过向量量化将语音转换为离散声学标记(如 HuBERT、EnCodec),使其能以类似文本标记的方式被语言模型处理。文章重点分析了连续序列建模,因为其在语音感知任务中表现更优。模态信息融合阶段解决音频与文本表示的对齐问题。对于连续嵌入,常用方法包括预解码器对齐(如通过多层感知机或 Q-Former 将音频特征投影到文本嵌入空间)和解码器内交叉注意力。对于离散标记,则采用标记映射或标记空间扩展实现融合。大语言模型推理阶段主要由自回归文本解码器组成,根据融合后的多模态输入生成文本输出。

训练策略方面,基于连续嵌入的语音大语言模型通常经历三个关键阶段:模态对齐、多任务训练和偏好对齐。模态对齐阶段利用大规模语音数据,通过 ASR 和音频描述任务使音频表示与文本表示对齐,训练目标是最小化文本输出的负对数似然。多任务训练阶段引入更丰富的任务指令,通常加入 LoRA 参数微调大语言模型,以增强模型的指令跟随和多任务泛化能力。偏好对齐阶段则利用强化学习或直接偏好优化(Direct Preference Optimization, DPO)使模型输出更符合人类偏好,但该阶段在当前语音理解研究中仍较少被关注。基于离散序列建模的模型训练流程更简单,可直接利用标准自回归目标在语音文本配对数据上微调,通常无需单独的模态对齐阶段,也较少涉及显式的偏好优化。

数据集部分按功能维度对常用语音数据集进行分类。感知任务和浅层认知任务对应于传统单任务数据集,如 LibriSpeech、AMI 会议语料库等,这些数据集规模大、标注成熟,广泛用于预训练和下游微调。深层认知任务则催生了语音问答(Speech Question Answering, SQA)等数据集,要求模型从语音内容中提取信息并进行推理。近年来,利用大语言模型参与标注和利用文本转语音(Text-to-Speech, TTS)技术生成语音指令数据成为新趋势。例如 VoiceTextBlender 通过 TTS 将文本问题转换为语音形式,增强了混合模态监督微调数据的多样性。

在性能评估方面,文章根据任务输出结构将评估方法分为确定性评估和开放式评估两类。确定性评估适用于结构化任务,如 ASR 使用词错误率(Word Error Rate, WER)、说话人日志使用日志错误率(Diarization Error Rate, DER)、关键词识别使用 F1 分数等。开放式评估适用于弱结构化或非结构化任务,常使用 BLEU、ROUGE、BERTScore 等相似度指标或基于大语言模型的评分与人工评价。论文进一步以四个代表性任务——ASR、语音翻译、情感识别和人类声音事件分类——进行了定量比较。结果显示,顶尖语音大语言模型在多个任务上已接近或达到专门模型的性能,例如 Kimi-Audio 在 LibriSpeech test-other 上取得 2.4 的词错误率,Qwen2-Audio 在 CoVoST2 英译中任务上达到最优水平。然而,模型在不同任务间的表现波动较大,情感识别的相对性能普遍低于语音翻译和声音事件分类,反映出多任务能力仍不均衡。此外,部分模型在未训练任务上泛化能力有限,如 Kimi-Audio 和 OSUM 无法有效执行语音翻译。

论文最后指出了当前语音大语言模型面临的两个核心挑战:指令敏感性(Instruction Sensitivity)和语义推理能力退化(Degradation in Semantic Reasoning)。虽然具体实验细节在原文中未完全展开,但作者明确将这两点视为限制模型鲁棒性和泛化性的关键因素。通过系统梳理定义、分类、架构、训练、数据与评估,该综述为后续研究提供了结构化参考,并推动了语音理解从传统流水线模式向以大语言模型为核心的统一范式转变。其科学价值在于明确了语音理解的任务边界和认知层次,应用价值则体现在为开发更通用、更稳健的语音交互系统提供了设计原则和实验依据。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com