分享自:

用于口语对话系统的语义条件LSTM自然语言生成

期刊:Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing

本文档属于类型a:单一原创研究报告。以下为据此生成的学术报告。

本文作者为Tsung-Hsien Wen、Milica Gašić、Nikola Mrkšić、Pei-Hao Su、David Vandyke和Steve Young,均来自剑桥大学工程系(Cambridge University Engineering Department)。该研究发表于2015年9月17日至21日在葡萄牙里斯本举行的自然语言处理经验方法会议(EMNLP 2015),收录于会议论文集第1711至1721页。论文题为“Semantically Conditioned LSTM-based Natural Language Generation for Spoken Dialogue Systems”,核心内容为提出一种基于语义控制的长短期记忆(LSTM)神经网络结构的自然语言生成方法,用于口语对话系统。

该研究属于自然语言生成(Natural Language Generation, NLG)与口语对话系统交叉领域。传统NLG系统多采用规则或模板方法,生成结果僵硬、重复性强,且难以扩展到多领域或多语言。基于语料库的方法虽然能在一定程度上学习生成,但在训练数据效率、准确性和自然度方面仍存在不足。本研究旨在提出一种可端到端训练、无需手工规则与启发式策略的神经语言生成器,从而解决上述问题。

研究的工作流程可拆解为模型设计、训练、解码与评估四个部分。首先在模型结构上,作者提出“语义控制LSTM单元”(Semantically Controlled LSTM cell, SC-LSTM)。该结构在传统LSTM之上增加了一个对话行为(Dialogue Act, DA)控制单元,其核心是引入“读取门”(reading gate)机制。该门控机制在每个时间步根据当前输入词和上一隐层状态,选择性地衰减DA向量中已表达过的槽位信息,从而自动完成句子规划(sentence planning)中的信息释放。传统LSTM的门控方程包括输入门、遗忘门和输出门,而SC-LSTM则进一步将细胞值更新方程修改为包含DA向量的贡献项,使语义信息直接参与表面实现(surface realisation)。其次,研究将SC-LSTM扩展为深层结构。深层生成器通过堆叠多个LSTM层来增强特征表达能力,并引入跳跃连接(skip connections)以缓解纵向梯度消失问题。为避免过拟合,只在非循环连接上应用dropout,且不使用于预训练词向量。在深层结构中,读取门的计算也被扩展为对所有隐层状态的加权和。第三,研究引入了一个反向LSTM重排序器(backward LSTM reranker)。由于前向生成器只能依据已生成的前文选择下一词,某些句式需要反向上下文才能判断优劣。为此,作者训练了一个从后向前建模的SC-LSTM,并将前向与反向网络的词级别槽位检测器权重进行绑定,以提升模型稳定性。训练时,目标函数为预测词分布与真实词分布之间的交叉熵,并加入正则化项控制DA向量的范数及相邻时间步DA变化的惩罚,以促使模型完整表达所有必需槽位且避免在单步内关闭过多门控。该模型使用预训练词向量(GloVe)作为词嵌入初始化,隐层大小设为80,深层网络使用两层且dropout率为50%。优化采用随机梯度下降和基于时间的反向传播算法,并利用验证集早停。解码分两阶段:前向生成器基于给定DA过生成(over-generation)多个候选句子,随后由反向重排序器结合前向损失、反向损失和槽位错误率(slot error rate)为候选句子打分排序,选取前5个最优实现结果。

在实验设置上,研究以旧金山地区餐厅和酒店信息查询为两个测试领域,分别包含12个槽位,其中部分槽位是二值槽(binary slots)或可接受“don’t care”值。训练语料来自亚马逊土耳其机器人(Amazon Mechanical Turk)众包平台,工人根据统计对话管理器生成的对话行为撰写自然英语回复。每个领域约收集5000条系统话语,经过去词化(delexicalisation)和按DA合并后,餐厅领域得到248个不同DA、酒店领域得到164个DA。数据按3:1:1划分为训练集、验证集和测试集,并进行上采样以平衡各类别频率。客观评估使用BLEU-4和槽位错误率两个指标。对比基线包括手工规则生成器(HDC)、K近邻方法(KNN)、类语言模型(classLM)、带启发式门控的RNN(rnn w/)与LSTM(lstm w/)、以及不带门控的RNN(rnn w/o)与LSTM(lstm w/o)。实验结果显示,在餐厅领域,HDC的BLEU为0.451且错误率为0,但KNN的BLEU虽低而错误率为0.87%,classLM的错误率高达8.70%,LSTM w/o错误率为1.79%,而SC-LSTM错误率降至0.62%,深层SC-LSTM(+deep)达到最高BLEU 0.731并将错误率进一步降至0.46%。在酒店领域,+deep同样获得了最高的BLEU 0.832和最低错误率0.41%。这表明学习式门控比启发式门控更能准确表达语义信息,深层结构则进一步提升了生成质量。此外,论文还通过可视化展示了SC-LSTM中门控单元如何学习到与特定槽位相关的关键词语,从而自动控制DA特征的释放,验证了模型内部机制的有效性。

主观评估部分通过人类评分进行。评估人员从餐厅领域新采样的对话行为中随机抽取两组系统生成的各5条实现结果,分别对其“信息性”(informativeness)和“自然度”(naturalness)进行3分制评分,并进行配对偏好测试。结果显示,SC-LSTM和+deep在两个指标上均优于classLM和rnn w/。其中,+deep在信息性上显著优于classLM(p<0.005),在自然度上显著优于rnn w/(p<0.05)。偏好测试中,+deep对比rnn w/的偏好率为64.3%(p<0.005),对比classLM为62.3%(p<0.005),对比SC-LSTM为52.4%但未达到显著差异。论文还展示了餐厅和酒店领域若干DA及联合系统前5个生成结果的示例,说明模型能生成自然且多样的表述。

本研究的贡献在于提出了一种完全可训练的神经语言生成架构SC-LSTM,首次在LSTM框架内通过可学习的语义门控机制端到端地联合优化句子规划与表面实现,消除了对启发式规则和手工生成器的依赖。该方法可从未对齐数据中直接学习,能够处理二值槽和“don’t care”槽等难以去词化的语义元素,具有良好的领域可扩展性。论文前景部分指出,该模型有望进一步在对话上下文中引入语篇或社交线索等特征,并可低成本迁移到多语言NLG任务中,展现了广泛的应用潜力。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com