分享自:

LayoutLM:面向文档图像理解的文本与布局预训练

期刊:Proceedings of the 26th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '20)DOI:10.1145/3394486.3403172

文档智能新突破:LayoutLM 模型的预训练研究报告

一、研究基本信息

本研究由许一恒(Yiheng Xu,哈尔滨工业大学)、李明昊(Minghao Li,北京航空航天大学)以及微软亚洲研究院的崔磊(Lei Cui)、黄少涵(Shaohan Huang)、韦福如(Furu Wei)和周明(Ming Zhou)共同完成。其中,许一恒与李明昊为共同第一作者,均曾在微软亚洲研究院实习期间做出同等贡献。该研究成果于2020年8月23日至27日在美国加利福尼亚州举行的第26届ACM SIGKDD知识发现与数据挖掘大会(KDD ‘20)上正式发表。

二、研究背景与目标

本研究属于文档人工智能(Document AI)或文档智能(Document Intelligence)这一新兴研究领域。该领域专注于自动阅读、理解和分析商业文档的技术。商业文档涵盖采购订单、财务报告、商业邮件、销售协议、发票、收据、简历等多种形式,其信息通常以自然语言呈现,并可能以纯文本、多栏布局、各类表格和图形等多样化方式组织。理解这些文档面临巨大挑战,原因包括布局与格式的多样性、扫描文档图像质量低下,以及模板结构的复杂性。

在LayoutLM提出之前,文档AI的深度学习方法主要面临两大局限:其一,这些方法通常依赖少量人工标注的训练样本,未能充分探索利用大规模未标注训练样本的可能性;其二,现有方法大多仅利用预训练的计算机视觉(Computer Vision, CV)模型或自然语言处理(Natural Language Processing, NLP)模型,却忽略了文本与布局信息的联合训练。基于此,本研究的目标是首次在单一框架中实现文档级文本与布局信息的自监督预训练,以显著提升文档图像理解任务的性能。

三、研究方法与详细流程

本研究的工作流程涵盖了模型架构设计、预训练任务构建、大规模数据预处理、模型预训练以及下游任务微调等多个环节。

3.1 模型架构设计

LayoutLM模型的核心架构基于BERT(Bidirectional Encoder Representations from Transformers)模型。BERT是一种基于注意力机制的双向语言建模方法,其输入嵌入由词嵌入、位置嵌入和段落嵌入三部分相加构成。LayoutLM在此基础上进行了创新性扩展,新增了两种关键的输入嵌入,以实现文本、布局和视觉信息的联合建模。

第一种创新是二维位置嵌入(2-D Position Embedding)。传统BERT的位置嵌入仅建模单词在文本序列中的一维顺序位置,而LayoutLM旨在建模文档中每个词在二维空间内的相对空间位置。具体做法是,将文档页面视为一个以左上角为原点的坐标系,每个词由精确的边界框(Bounding Box)定义,其坐标为(x0, y0, x1, y1)。模型新增四个位置嵌入层,并为X维度和Y维度各维护一个嵌入表,其中x0和x1共享X嵌入表,y0和y1共享Y嵌入表。考虑到文档页面尺寸各异,所有实际坐标值被缩放到0至1000的“虚拟”坐标范围内。

第二种创新是图像嵌入(Image Embedding)。为了将文档图像的视觉特征与文本对齐,LayoutLM引入了图像嵌入层。利用光学字符识别(Optical Character Recognition, OCR)结果中每个词的边界框,将文档图像分割为与单词一一对应的图像片段。然后,使用一个在Visual Genome数据集上预训练过的Faster R-CNN模型(主干网络为ResNet-101)来提取这些图像片段的区域特征,作为对应词的图像嵌入。对于用于聚合整个序列信息的特殊标记“[CLS]”,则使用整张扫描文档图像作为感兴趣区域来生成其图像嵌入。

3.2 预训练任务

LayoutLM采用多任务学习目标进行预训练,主要包括两项任务。

任务一:掩码视觉语言模型(Masked Visual-Language Model, MVLM)。该任务受BERT的掩码语言模型启发,但进行了关键改进。在预训练过程中,模型随机遮蔽输入文本中的部分词,但关键的区别在于,这些被遮蔽词所对应的二维位置嵌入并未被遮蔽,继续保持完好。模型的目标是根据未被遮蔽的上下文文本以及这些保留的二维位置线索,来预测原始的被遮蔽词。通过这种方式,模型不仅学习语言上下文,还能理解二维位置信息与文本内容的对应关系,从而弥合视觉与语言模态之间的鸿沟。具体操作上,遵循BERT的设置,随机选取15%的输入词进行预测,其中80%的情况下替换为“[MASK]”标记,10%的情况下替换为随机词,10%的情况下保持不变。

任务二:多标签文档分类(Multi-label Document Classification, MDC)。鉴于IIT-CDIP测试集合中的每份文档图像均有多个标签,研究者在预训练阶段引入了MDC损失。通过利用文档标签来监督训练过程,模型可以更好地聚合来自不同领域的知识,并生成更高质量的文档级表示。该任务是可选的,尤其适用于使用不具备标签的大型数据集进行预训练时。

3.3 数据预处理与模型预训练

预训练使用了IIT-CDIP测试集合1.0版,该数据集包含超过600万份文档及1100万张扫描文档图像,类别涵盖信件、备忘录、邮件、表格、手写体、发票、广告、简历、科学报告等,是大规模自监督预训练的理想选择。尽管数据集提供了纯文本内容和元数据,但缺少单词的边界框位置信息。为解决此问题,研究者使用开源OCR引擎Tesseract重新处理了所有扫描文档图像,同时获取了识别出的单词及其二维位置坐标,并以hOCR格式进行存储。

模型参数初始化方面,LayoutLM基本模型(LayoutLMBASE)采用预训练的BERTBASE模型进行所有权重初始化,除新增的二维位置嵌入层外。该模型架构为一个12层Transformer,隐藏层大小为768,拥有12个注意力头,总参数量约1.13亿。大规模模型(LayoutLMLARGE)则拥有24层Transformer,隐藏层大小为1024,16个注意力头,由BERTLARGE初始化,总参数量约3.43亿。训练过程在8块NVIDIA Tesla V100 32GB GPU上进行,总批次大小为80,使用Adam优化器,初始学习率为5e-5并采用线性衰减策略。

3.4 下游任务微调

为评估预训练模型性能,研究选取了三个基准下游任务进行微调。

第一个任务是表单理解(Form Understanding),使用FUNSD数据集。该数据集包含199份真实、完全标注的扫描表单,共9707个语义实体和31485个单词,划分为149个训练样本和50个测试样本。任务被视为序列标注问题,模型为每个词预测{B, I, E, S, O}标签,以检测不同类型的实体,评估指标为词级F1分数。

第二个任务是收据理解(Receipt Understanding),使用SROIE数据集。数据集包含626张收据用于训练,347张用于测试,每张收据需提取公司、日期、地址、总金额等四类预定义实体。实验中使用真实OCR文本以消除OCR错误的影响,同样采用序列标注方法。

第三个任务是文档图像分类(Document Image Classification),使用RVL-CDIP数据集。该数据集包含40万张灰度图像,均匀分布于16个类别,划分为32万张训练图像、4万张验证图像和4万张测试图像。微调时,将LayoutLM模型的输出与整张图像的嵌入拼接后输入Softmax层进行类别预测,评估指标为总体分类准确率。

四、主要实验结果与分析

4.1 表单理解任务结果

如表1所示,仅使用文本模态时,BERTBASE模型的F1分数为0.6026,RoBERTaBASE为0.6648。而加入了文本与布局模态的LayoutLMBASE模型(1100万文档,2轮训练)取得了0.7866的F1分数,远超同等参数规模的BERT和RoBERTa。这表明二维位置信息的引入带来了质的提升。进一步加入MDC预训练损失后,性能得到额外提升。当同时使用文本、布局和图像三种模态时,LayoutLMBASE模型达到了最高的0.7927 F1分数,证明了视觉信息也提供了有益的补充。此外,表2显示,随着预训练文档数量从50万增加到1100万,以及训练轮数从1轮增加到6轮,模型在下游任务上的F1分数呈现出单调递增的趋势,这有力地证明了更大规模的预训练对低资源任务(FUNSD仅149张训练图像)至关重要。

4.2 收据理解任务结果

在SROIE数据集上(如表4所示),仅使用文本模态的BERTLARGE和RoBERTaLARGE模型的F1分数分别为0.9200和0.9280。而使用文本和布局进行预训练的LayoutLMLARGE模型(1100万文档,1轮训练)取得了0.9524的F1分数,显著超过了该竞赛排行榜上的第一名成绩(0.9402)。此结果不仅验证了LayoutLM在域内数据集(如表单FUNSD)上的优越性,也展示了其在域外数据集(如收据SROIE)上同样具有强大的泛化能力。

4.3 文档图像分类任务结果

对于RVL-CDIP数据集(如表5所示),传统的基于文本的模型如BERTBASE(89.81%)和RoBERTaBASE(90.06%)表现明显不如基于图像的方法。这揭示了在文档图像分类任务中,纯文本信息是不充分的,必须借助布局和视觉特征。即便没有使用图像嵌入,仅融合文本和布局的LayoutLMBASE模型(1100万文档,2轮训练)就达到了91.78%的准确率,已经超越了单模型的图像方法。当整合图像嵌入后,LayoutLMBASE模型的准确率跃升至94.42%,大幅优于所有先前的基线模型,包括集成方法(Ensemble Methods)的最佳结果(93.07%)。

五、研究结论与价值

本研究提出了LayoutLM,这是一种在单一框架内联合预训练文本与布局信息的简单而有效的方法。研究首次明确验证了,将二维空间布局信息与文本信息进行联合自监督预训练,能够为文档图像理解任务带来巨大增益。在此基础上,进一步融入图像视觉特征,可将模型性能提升至新的最先进水平。

从科学价值上看,LayoutLM打破了传统CV预训练和NLP预训练的藩篱,开创性地探索并实现了多模态(文本、布局、视觉)信息在文档级别的统一预训练,为文档AI领域的研究开辟了新的范式。从应用价值上看,该模型在表单理解、收据信息提取和文档图像分类等多个关键业务场景中均取得了当时的最优结果,能够极大地加速企业文档处理工作流的自动化进程,减少耗时且昂贵的人工数据录入工作,具有广阔的商业应用前景。

六、研究亮点与创新

本研究的核心亮点与创新之处可概括为以下三点:第一,首次实现了文本与布局信息的联合预训练。这是文档智能领域一个从0到1的突破,通过简单而精巧的二维位置嵌入,让模型学会了文本在页面中的空间关系。第二,提出了掩码视觉语言模型(MVLM)这一新颖的预训练任务。该任务在遮蔽文本的同时保留其位置信息,巧妙地强制模型建立语言和视觉之间的关联。第三,模型架构具有良好的可扩展性。LayoutLM以成熟的BERT模型为骨干,自然地融入了布局和图像信息,能够兼容现有的大规模预训练初始化(如从BERT或RoBERTa参数启动),并可通过增加数据规模、模型尺寸和引入更多模态信息(如图像嵌入)持续提升性能,为后续研究提供了强大的基线框架。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com