分享自:

用于科学史、科学哲学和科学社会学的⼤型语言模型:解释性使⽤、方法论挑战与批判性视角

期刊:Studies in History and Philosophy of ScienceDOI:10.1016/j.shpsa.2026.102151

大型语言模型在科学史、科学哲学与科学社会学中的应用:解释性用途、方法论挑战与批判性视角

作者: Arno Simons *,Michael Zichert,Adrian Wüthrich
机构: 柏林工业大学,现代科学的历史与哲学研究所
发表于: *Studies in History and Philosophy of Science*,第117卷,2026年,文章编号102151,2026年3月30日在线发表。

本文是一篇综合性的方法论论文,系统考察了大型语言模型(LLMs)作为研究工具在科学史、科学哲学与科学社会学(HPSS)领域中的应用潜力、方法论挑战与批判性视角。文章并非报告一项单一实证研究,而是对LLMs在HPSS领域中应用现状和未来方向的深度审视与框架构建。

论文的核心议题与目标

论文开篇指出,HPSS领域长期以来将知识视为具有情境依赖性和理论负载性,这使得该领域对倾向于牺牲语境丰富性以换取规模化的计算方法常持怀疑态度。然而,LLMs的出现可能成为调和计算与解释性方法之间张力的转折点。与传统计算工具相比,LLMs具备三大优势:其一,可访问性更高,能直接处理相对无结构的、异质的文本,并遵循自然语言指令;其二,功能更加多元,单一系统即可支持主题探索、实体标注、相似度评分等多种任务;其三,能更直接地支持意义敏感性分析,更好地捕捉语境细微差别和多义性。本文的目标是架起计算与解释性视角之间的桥梁,在提供LLM方法通俗解释的同时,对其认识论和方法论影响进行批判性反思,最终为在HPSS研究中负责任地整合LLMs提出指导性框架。

LLMs技术基础与模型类型学

为奠定讨论基础,论文提供了一个关于LLMs的简明技术导引。LLMs基于Transformer神经网络架构,其核心机制在于将文本分解为词元(Token),并通过多层网络中的“自注意力”机制,生成能够编码上下文信息的词向量,即上下文词嵌入(Contextualized Word Embeddings, CWEs)。这种机制使得同一个词在不同的上下文中可以获得不同的向量表示。

论文将LLMs区分为两种核心类型,并详细辨析了它们的关键差异与适用场景。第一类是全上下文模型(Full-context Models),以BERT为代表。它们通过掩码语言模型进行双向预训练,能够同时捕捉目标词元的左右上下文信息。其输出通常为词元或文本嵌入、分类分数等结构化表示。这类模型通常需要针对具体下游任务(如命名实体识别、文本分类)进行微调(Fine-tuning),更适合结构化预测和表征聚焦型应用,且多为开源,可本地部署,具有较高的可检查性,但技术门槛较高。第二类是生成式模型(Generative Models),以GPT系列为代表。它们通过自回归方式进行预训练,即从左到右预测下一个词元。这类模型擅长生成流畅连贯的文本,并通过指令微调获得了强大的零样本/少样本推理能力,用户通过自然语言提示即可驱动模型。其优势在于高度便捷和灵活,但多为闭源,内部运作和不透明性较高。论文据此提出了一个核心权衡:“可访问性-素养权衡(Accessibility–Literacy Trade-off)”,即生成式模型降低了使用门槛,但并未降低负责任地解释其输出所需的素养要求;而全上下文模型虽提高了技术进入壁垒,但一旦运行起来,其工作流的中产物(如嵌入向量、聚类结果)的可检查性更高。

此外,论文还将LLMs的理论基础归结为对分布假说(Distributional Hypothesis)的操作化,即通过词的使用模式分布来捕捉意义关联,这一思想可追溯至Harris(1954)和Firth的理论。

LLMs如何重塑HPSS的三大经典方法论挑战

论文的核心部分深入分析了LLMs如何重新定义HPSS领域面临的三个经典方法论问题。

第一,处理历史性杂乱数据。 早期HPSS计算化面临的核心挑战是数据的结构化整理。LLMs能够直接处理无结构的原始文本,似乎缓解了这一压力。然而,论文强调,挑战并未消失,而是发生了形式上的转变。模型本身成为了一种“认知基础设施(Epistemic Infrastructure)”,其内部是对大规模语料的浓缩表征,并嵌入了关于数据包含与编码方式的决策。这带来了新的复杂性,例如,基于当代数据训练的LLM可能会扁平化或错误地表现历史特定语言和概念。因此,研究者的关注点必须从单纯的数据本身,扩展到模型是如何被训练以及它们编码了何种假设。为应对领域偏差,论文介绍了几种关键的模型适应与定制策略:特定领域预训练(Domain-specific Pretraining),如SciBERT、BioBERT,通过在科学文献上进行继续预训练或从头预训练,使模型更好地捕捉领域语义;特定任务微调(Task-specific Fine-tuning),通过在标注数据上进行监督学习,让模型学习分类、信息抽取等任务,论文特别指出了在此过程中,标注数据所蕴含的特定历史与解释性假设的重要性;对比学习(Contrastive Learning),如SPECTER模型,通过引文链接作为相似性代理信号来优化文本嵌入,使其适用于主题聚类和检索,但论文也警示,该方法将引文所编码的复杂关系(如社会联系、修辞策略)凝固为了“相关度”的代理变量,可能偏离分析目标;以及检索增强生成(Retrieval-Augmented Generation, RAG),它结合了检索系统和生成模型,能在生成回答时引用外部文献,增强证据可追溯性,但其内部检索算法和提示模板也可能引入难以察觉的解释性假设。

第二,模式的检测与解释。 针对能否在传统细读之外发现大规模知识模式这一挑战,LLMs提供了在不同尺度上检测模式的能力。论文将应用分为两类模式。探索未知模式方面,上下文词嵌入(CWEs)可直接用于量化特定术语在不同语境中用法的一致性或变异性。例如,Kleymann等人(2022)和Simons(2024b)利用CWEs的聚类来追溯“理论”、“普朗克”等术语的语义集群;Lucy等人(2023)利用替代词生成和共现图来识别学科特定术语的意义;Ahmadi(2026)则通过计算“语义均匀性得分”来衡量一个话语社群内术语使用的标准化程度。在文本层面,以BERTopic为代表的工具通过聚类文本嵌入来揭示潜在的主题结构,已成为传统主题模型的有力替代方案,但其“每个文档一个主导主题”的假设也可能掩盖概念的多重性。检测已知模式方面,LLMs能高效执行引文语境分析、命名实体识别、论元挖掘等需要识别预定义类别的任务。例如,在引文语境分析中,无论是通过微调分类器还是直接提示生成式模型,LLMs都能大规模地对引文功能(如支持、批评)或情感进行分类。论文特别引述Liesegang & Gläser(2026)的观点指出LLM在此处的双刃剑效应:它既能迫使隐性的解释决策显性化,也可能将关于语境和意义的不稳固假设固化为系统性错误,因此必须进行严格的批判性审视与验证。

第三,建模科学变迁。 对于如何解释科学知识的历史变迁这一最深层的挑战,LLMs提供了从词元到文本层面的动态建模工具。在词元层面,词汇语义变迁检测(Lexical Semantic Change Detection, LSCD)通过比较不同时期语料中同一术语的CWEs,来重构概念的历史轨迹。论文引述多个案例展示了此方法的潜力,如Zichert等人(2025)通过追踪“虚拟”一词在物理学语料中的使用模式变化,重构了“虚拟粒子”的概念史。在文本层面,动态主题模型(如BERTopic的“主题随时间的演变”功能)可以描绘研究主题的兴起与演变;科学新颖性检测则尝试通过文本嵌入空间中的距离、监督学习或提示评分等方式,识别偏离先前话语的贡献。论文在此处以格外审慎的态度警告,认识论的创新往往是渐进且充满争议的,基于模型输出的距离或分数来界定“新颖性”必须接受历史与概念的严格检验。此外,对引文网络、影响力轨迹和论文修订的文本追踪也为理解思想的流动与转变提供了新的计算化路径。

结论与四点核心教训

在综合讨论基础上,论文提炼出负责任地整合LLMs的四点核心教训,并拓展至更广泛的基础设施与价值议题。

  1. 模型选择伴随技术与解释性权衡: 没有中立的模型选择。必须在生成式模型的灵活便捷与全上下文模型的可检查性和效率之间,根据研究的解释性目标和证据标准进行审慎权衡。混合架构(如RAG)虽然能结合二者优势,但其可审计性取决于检索结果和提示的透明程度。
  2. 使用LLMs进行解释性研究需要LLM素养: 易用不等于可以免去素养要求。研究者必须具备理解LLM产出如何生成、受何种假设影响及可能出现何种错误的批判能力。这既包括区分模型类型、理解操控手段等技术素养,也包括像对待史料一样对自然语言输出进行来源考证和论证分析的解释性素养,以避免“认知外包(Epistemic Outsourcing)”。责任必须始终由HPSS学者承担。
  3. HPSS必须定义自己的数据集、任务和评估实践: 主流基准测试往往假设稳定的分类体系和单一答案,这与HPSS材料的历史性、概念争议性相悖。论文呼吁建立一个多元且明确限定范围的任务和数据集生态系统,采用多标签、置信度分数等方式表征模糊性,并实行结合量化基线与专家解读及失败分析的混合评估模式。
  4. LLMs应增强而非取代HPSS方法论: LLMs在工作流中扮演的认知角色取决于评估深度。其产出可作为激发思考和解读的探索性提案,或作为经过严格任务限定和验证后的证据性输入。论文建议按组件和认知功能来治理工作流,对探索性步骤评估其启发能力,对证据性步骤则要求严格的验证和可追溯性。

最后,论文将讨论提升至基础设施政治学高度,指出LLMs的研究和应用嵌入在数据提取、隐藏劳动、环境影响和地缘政治压力的政治经济结构中。它倡导一种能动且批判的参与姿态,既积极探索方法论的创新,也利用HPSS自身对知识制造过程的深刻洞察,去审视和厘清LLMs作为一种工具的本质以及负责任整合的要求,从而在扩展解释能力的同时,坚守研究的多元性与论证责任。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com