分享自:

句法与语义在“中间”相遇:通过施事性探究语言模型的句法-语义接口

期刊:Proceedings of the 12th Joint Conference on Lexical and Computational Semantics (*SEM 2023)

研究背景与发表信息

本文介绍的研究由卡内基梅隆大学语言技术研究所的 Lindia Tjuatja、Emmy Liu、Lori Levin 和 Graham Neubig 共同完成,发表于第12届词汇与计算语义学联合会议(*SEM 2023),会议于2023年7月13至14日举行,论文收录于会议论文集第149至164页。该研究属于计算语言学和理论语言学的交叉领域,核心关注点是语言模型是否能够处理句法-语义界面上的意义交互现象,特别是施事性这一语义概念。

研究目标

本研究的核心动机源于英语中一类特殊的可选及物动词所展现的句法-语义交互现象。例如,“this author writes easily”和“this passage writes easily”虽然表面句法结构完全一致——主语名词短语加动词的不及物形式再加副词短语——但语义角色却截然相反:前一句中“this author”是施事,而后一句中“this passage”是受事。这种差异完全由主语名词的词汇语义特征驱动。反之,在及物句式中,如“something writes this author easily”和“this passage writes something easily”,句法位置强制决定了语义角色,无论名词的典型语义倾向如何。这种双向交互——词汇语义影响句法歧义消解,以及句法结构覆盖词汇先验——构成了一个理想的实验平台,用于探究语言模型是否具备句法-语义界面上的语言能力。作者提出了三个具体的研究问题:模型是否能在无句法上下文的条件下对名词的典型施事性做出与人类判断一致的预测;模型能否在不及物句式中利用词汇语义消解歧义;模型能否在及物句式中根据句法位置忽略词汇先验,正确判断名词的语义角色。

研究方法与实验流程

为了实现上述目标,作者设计了三组提示实验,并构建了一个新的评测数据集。由于英语中同时具备宾语省略和中间结构两种性质的可选及物动词数量有限,作者从语言学文献中整理出23个符合条件的动词,并为每个动词搭配了相应的名词和方式副词,最终形成233个独特名词和820个名-动-副组合。根据名词在不及物句式中的角色,这些组合被划分为施事主语(intr-agent)和受事主语(intr-patient)两类,分别有343和477个样本。对于及物句式,每个组合都可以生成施事主语(trans-agent)和受事宾语(trans-patient)两种句子,因此各有820个句子。

实验采用提示学习范式,每个提示包含四个带金标签的示例和一个不带标签的测试项。为了消除示例顺序的影响,每个实验均运行了两种示例排列顺序(“agent先patient后”和“patient先agent后”),最终取平均性能。实验1测试模型对孤立名词的施事性判断,通过比较模型预测“agent”和“patient”标签的对数似然差值(δ-LL)与人类评分以及语料库统计量的相关性来评估。由于孤立的语义角色标签缺乏明确的事件上下文,作者采用了两种近似“典型施事性”的方法:一是收集了19名英语母语或流利双语者对每个名词在任意事件中充当施事可能性的五级评分,并将平均分归一化到0到1之间;二是利用语言标注语料库统计名词作为施事的比例,具体包括从PropBank中计算agent ratio以及从Google Syntactic Ngrams中计算subject ratio。实验2测试模型在不及物句式中判断主语名词是施事还是受事的准确性,并检验其δ-LL与实验1中孤立名词δ-LL以及人类评分的相关性。实验3测试模型在及物句式中根据主语或宾语位置判断名词角色的准确性。

主要实验结果

在实验1中,作者首先验证了语料库统计量与人类评分的相关性。Google Syntactic Ngrams计算出的subject ratio与人类评分的皮尔逊相关系数为0.762,而PropBank的agent ratio与人类评分的相关性仅为0.555(仅基于166个在PropBank中出现的名词)。随后,作者将各模型的δ-LL与人类评分进行相关性分析。结果显示,大多数模型与人类评分的相关性较弱,但GPT-3 text-davinci-003表现出色,其δ-LL与人类评分的相关系数达到0.939,不仅超过了所有其他模型,也远高于语料库统计量与人类评分的相关性,甚至接近人类标注者组间平均相关性0.968。这一结果表明,text-davinci-003捕捉到的名词施事性典型度比传统语料库统计更接近人类直觉。

在实验2中,作者评估了模型在不不及物句式中判断主语角色的准确率,以及δ-LL与孤立名词δ-LL和人类评分的相关性。准确率方面,超过半数模型未能超过多数类基线(0.582),且性能并未随模型规模单调增长。相关性方面,text-davinci-003再次表现最佳:其δ-LL与孤立名词δ-LL的相关性为0.914,与人类评分的相关性为0.919,均显著高于其他模型和语料库统计量。这说明该模型能够有效地将词汇层面的施事性先验应用于句法歧义消解。

在实验3中,作者测试了模型在及物句式中根据句法位置判断名词角色的准确率。text-davinci-003在trans-agent和trans-patient两类句子上的准确率分别达到0.994和0.991,是唯一在两个实验中都显著高于随机水平的模型,且对示例顺序不敏感。

定性分析与模型失误

作者对text-davinci-003在不不及物句式中的错误进行了定性分析。绝大多数错误是将受事主语误判为施事。进一步考察发现,这些被误判的名词大多在人类评分中具有较高的施事性倾向,例如“model (person)”、“animal”以及各类交通工具(jet、aircraft、car、truck等)。这些名词在动名词搭配中可能存在另一个可行的施事解读:例如“this jet flies smoothly”既可以理解为“这架喷气式飞机飞起来很平稳”(受事解读),也可以理解为“这架喷气式飞机自己飞得很平稳”(施事解读)。这种歧义源于名词的生命度等级和动词的选择性限制之间的交互。类似地,“this model photographs beautifully”中,“model”作为人类亚型,其在动画性层级上的位置使其施事解读虽不显著但并非完全不可接受。这表明模型的“错误”实际上对应了人类语言直觉中更具模糊性的边缘案例。

研究结论与意义

本研究通过施事性这一案例,系统性地探究了语言模型在句法-语义界面上的能力。最显著的发现是GPT-3 text-davinci-003在所有三个实验中均大幅超越其他模型,并且其判断与人类评分之间的相关性甚至优于语料库统计量。这一结果具有重要的理论和方法论意义。从理论角度看,它表明大型语言模型可能在捕捉抽象语义角色原型方面比人工标注语料库更有效,因为模型接触了海量且跨领域的数据,而语料库往往规模有限且存在体裁偏差。从应用角度看,这暗示语言模型有潜力成为语言学标注、理论验证和语言现象发现的工具,例如帮助识别新的词类或句法结构。此外,模型对边缘歧义案例的识别能力表明,它可能有助于语言学家定位有趣的语言学现象。

研究亮点

本研究的亮点可以归纳为以下几点。第一,它聚焦于句法-语义界面这一此前在语言模型评测中相对被忽视的领域,通过施事性这一概念在高度受控的句法环境中同时考察了词汇语义和句法结构对语义角色分配的独立和交互作用。第二,作者构建了一个全新的评测数据集,该数据集利用了英语中一类特殊可选及物动词的独特语言学性质,实现了最小对立的实验设计。第三,研究发现text-davinci-003与人类判断的相关性超过语料库统计量,这一结果为“语言模型作为语言学研究工具”的主张提供了新颖的实证支持。第四,定性分析揭示了模型失误与人类语言直觉中真实模糊性之间的关联,表明模型的“错误”并非简单的失败,而是反映了语言系统中更细微的语义-句法交互。最后,该研究的方法论框架——通过提示学习探测模型对语义角色的敏感性——可以扩展到其他语言和其他句法-语义界面现象。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com