作者:Peter Jansen、Peter Clark、Doug Downey、Daniel S. Weld
单位:Allen Institute for Artificial Intelligence;University of Arizona;University of Washington
来源:ACL 2026
时间:2026.07
链接:[Generating Literature-Driven Scientific Theories at Scale]
一. 研究背景
自动科学发现系统正在尝试承担越来越多的科研工作,例如提出研究假设、设计实验、编写程序以及分析实验结果。但单个实验通常只是科学研究的一部分,更高层次的目标是从大量实验和观察中归纳出能够解释现象、预测未来结果的理论。
这两类任务并不相同。总结一篇论文,可以回答某项实验发现了什么;综合大量论文,则需要进一步回答:这些实验背后是否存在共同规律?规律在什么条件下成立?是否存在已知例外?它还能预测哪些尚未观察到的结果?
THEORIZER 关注的正是这一问题:大语言模型能否通过阅读大量科学文献,自动形成具有经验依据、明确适用范围并能够被进一步检验的候选科学理论?
这一任务主要面临两个困难。
- 模型容易生成听起来合理、实际上过于宽泛的关系。即使给出了文献引用,也不代表原始论文真正支持模型生成的完整结论。
- 科学理论难以像一般文本生成任务那样评价。模型认为某个理论合理,并不能代替真正的经验检验;但如果为数千条候选规律重新开展实验,成本又非常高。
因此,论文不仅研究如何生成候选理论,还设计了一套基于时间划分的文献回测方法:使用较早时期能够获得的知识生成理论,再利用随后发表的研究结果检查这些理论提出的预测。
二. 论文概要
论文提出文献驱动的科学理论综合系统 THEORIZER。其核心工作主要包括三个部分:
- 结构化理论表达。 不把理论仅保存成一段自由文本,而是明确表示规律、适用范围和支持证据,使理论具有更清晰的可解释性与可检验性。
- 跨文献证据综合。 围绕一个研究问题检索相关论文,并自动生成问题相关的信息抽取 Schema,从不同论文中提取实验变量、实验条件和观测结果,再综合形成候选理论。
- 后续文献回测。 将候选规律转换成具体预测,再检索之后发表的论文,判断这些论文是支持、反驳,还是没有直接检验对应预测。
论文共使用约 13,744 篇源论文生成 2,856 个候选理论,并比较两组因素:文献支持与模型参数知识,以及准确性导向与新颖性导向。
实验结果表明,在本文设定下,显式使用科学文献能够提高候选规律的经验支持程度和后续预测表现,尤其能够降低新颖性导向生成所带来的风险。
三. 核心思想
3.1 将理论表示为“规律—范围—证据”
论文首先对科学理论综合任务进行了形式化。给定用户提出的研究问题 \(Q\) 与科学文献集合 \(C\),系统输出候选理论集合 \(T\):
每一个候选理论由若干个结构化三元组组成:
- LAW:描述变量之间的定性或定量关系,例如“A 增加 B”或者 \(X=Y/Z\)。
- SCOPE:描述该规律成立的条件、对象和已知例外。
- EVIDENCE:记录支持该规律的实验或观察证据。
例如,“某种方法能够提高性能”和“某种方法只在特定任务、特定模型规模和特定实验条件下能够提高性能”,两者并不是同一条科学命题。
3.2 理论的多个质量目标必须分开评价
论文提出五个候选理论应当具备的性质:
- Specificity:规律是否足够具体、可检验;
- Empirical Support:是否符合已有经验结果;
- Predictive Accuracy:能否得到未来或留出实验结果支持;
- Novelty:是否包含既有文献没有明确提出的内容;
- Plausibility:是否具有合理的科学解释或机制。
这些目标并不天然一致。一条规律可能非常可靠,但几乎没有新意;也可能非常新颖,却缺乏实际证据。因此,THEORIZER 并不尝试用一个总分同时表示所有理论质量。
四. 方法设计
4.1 文献发现
THEORIZER 首先根据用户提出的 Theory Query 构造检索问题,并使用 PAPERFINDER 寻找相关论文,再通过 Semantic Scholar 获取开放访问 PDF。
如果初始论文数量不足,系统还会继续沿已获得论文中的引用扩展候选集合,并按照相关程度补充资料。
4.2 面向研究问题生成专用 Evidence Schema
THEORIZER 并不会直接让模型逐篇写摘要,而是首先根据研究问题生成一套专门的证据抽取 Schema。
例如,如果研究记忆增强机制是否能够提高大模型 Agent 的任务性能,Schema 可能包含:
- 研究的任务类型;
- 采用的记忆机制;
- 模型规模;
- 实验设置;
- 使用记忆时的性能;
- 不使用记忆时的性能;
- 比较条件及实验局限。
系统随后逐篇论文填充 Schema,每篇论文可能产生 0 条、1 条或者多条结构化记录。
4.3 候选理论综合与反思
完成证据抽取之后,系统把来自不同论文的结构化实验结果统一提供给生成模型,由模型归纳候选理论。初始理论生成后,还会执行一次独立的 Theory Reflection,对内部一致性、证据归属和规律具体性进行检查和修改。
系统还会记录潜在冲突证据,并产生两类预测:
- 依据当前文献,模型认为较可能成立的预测;
- 目前缺乏明确支持或反驳、具有较高不确定性的预测。
4.4 将理论转换为真正可检验的预测
为了评价预测是否得到后续研究支持,THEORIZER 不只是生成一句 Prediction,而是为每条预测建立评价 Schema,包括四项内容:
- Specific Prediction:具体预测;
- Operational Signals:能够测量预测的实际变量;
- Strong Test Requirement:论文必须提供怎样的实验比较才算真正检验;
- Supporting / Contradicting Criteria:什么结果分别属于支持和反驳。
例如,如果理论声称某种干预能够提高机器翻译性能,仅仅找到一篇提到该干预的论文并不能算支持。论文必须实际比较干预前后或者有无干预时的 BLEU、ROUGE 等相关指标。
五. 实验设计
5.1 四组理论生成条件
论文主要研究两个因素。
- Knowledge Source:仅使用模型参数知识,或者额外显式提供科学文献。
- Generation Objective:强调准确性,或者强调新颖性。
两者组合以后形成四组实验:
| 生成目标 | 参数知识 | 文献支持 |
|---|---|---|
| Accuracy-Focused | Parametric + Accuracy | Literature + Accuracy |
| Novelty-Focused | Parametric + Novelty | Literature + Novelty |
5.2 时间回测设计
为了评价预测能力,作者依据生成模型报告的知识截止日期构造时间划分:
模型报告的知识截止:2024年6月
↓
补充文献并生成理论:截至2025年6月
↓
预测评价:使用2025年7月至12月发表的论文
这属于历史回测,即在已经存在的文献中模拟“先提出理论,再观察之后研究结果”的过程,而不是真正等待未来半年再进行实验。
5.3 Precision 与 Recall
对于某一条预测,设检索到的支持论文数为 \(n_s\),反驳论文数为 \(n_c\)。本文定义预测 precision 为:
没有提供直接检验证据的论文不进入 precision 的分母。
例如:找到 10 篇候选文献,其中 2 篇支持、0 篇反驳、8 篇没有做合格实验对照,则:
这里的 100% 只能表示:在真正提供直接检验证据的两篇论文中,目前全部为支持,没有找到反驳。它并不表示 10 篇论文全部支持,更不能解释为预测为真的概率是 100%。
Recall 则关注预测能否在后续文献中真正找到直接检验证据。预测层面的 recall 可以表示为:
支持和反驳都属于直接检验证据,因此都会进入 recall 的分子。
例如,一条规律产生 5 个预测,其中 1 个获得支持、1 个遭到反驳,另外 3 个没有直接证据,则:
六. 实验结果
6.1 文献支持提升了经验依据与具体性
论文首先采用固定 LLM Judge,以 1–10 分评价候选规律。Accuracy-Focused 条件下:
| 评价维度 | Parametric | Literature-Supported |
|---|---|---|
| Specificity | 5.3 | 6.5 |
| Empirical Support | 3.9 | 5.8 |
| Plausibility | 7.1 | 7.9 |
| Novelty | 5.8 | 5.8 |
文献支持最明显的作用体现在具体性和经验支持上。但这些结果来自 LLM Judge,因此不能直接解释为真实实验准确率。
6.2 后续文献回测结果
| 生成条件 | Predictive Precision | Law Recall | Prediction Recall |
|---|---|---|---|
| Accuracy + Parametric | 0.88 | 0.45 | 0.20 |
| Accuracy + Literature | 0.90 | 0.51 | 0.24 |
| Novelty + Parametric | 0.34 | 0.04 | 0.01 |
| Novelty + Literature | 0.61 | 0.16 | 0.06 |
Accuracy-Focused 条件下,两种知识来源的 precision 都很高。文献支持组从 0.88 提高至 0.90,同时提高了可被后续研究检验的覆盖范围。
Novelty-Focused 条件下差异更加明显。显式文献支持使 precision 从 0.34 提高到 0.61,同时 Law Recall 从 0.04 提高到 0.16。
这说明:当模型试图离开较安全、较常见的结论区域时,文献证据对约束生成尤其重要。
但 0.90 的 precision 仍不能理解成“90%的候选理论已经得到科学证明”。Precision 只统计存在直接检验证据的预测,而大量预测仍没有找到对应实验。
6.3 新颖性与可靠性存在明显权衡
论文还分析了 Qualified Novelty,即相对于当前检索文献集合的新颖性,而不是相对于整个科学领域的新颖性。
评价内容包括:
- 新的现象或效应;
- 新的解释机制;
- 对不同研究方向进行统一;
- 扩大规律适用范围;
- 增加新的限制条件;
- 概念重新表达;
- 跨研究经验综合。
结果显示,新颖性导向能够生成更多相对于参考语料没有明确出现的关系,但其预测可靠性明显下降。
因此:文献中没有明确提出过”并不自动意味着发现了新的正确规律,也可能只是缺乏证据的外推。
七. 局限与讨论
虽然 THEORIZER 在大规模理论综合和评价方面提供了一套较完整的方法,但论文仍存在多个值得注意的边界。
- 文献回测不能替代真实实验。 如果后续半年没有研究真正检验某条预测,系统无法判断预测是正确、错误,还是尚未得到研究。
- 负面结果可能更少发表。 因此,文献中没有发现反驳证据,不能直接解释为理论已经得到确认。
- 自动证据判定仍可能出现宽松匹配。 即使预先定义了 Strong Test Requirement,LLM Judge 仍可能把相似结果判断成直接支持。
- Accuracy 和 Novelty 条件同时改变了采样温度。 Accuracy-Focused 使用 temperature=0,而 Novelty-Focused 使用 temperature=1,因此两者差异不能完全归因于 Prompt 目标。
- 生成和评价成本较高。 一个理论问题的完整流程约需要 15–30 分钟,检索和论文下载是重要耗时来源。
- 依赖开放获取文献。 当前系统更适合科学论文开放程度较高的研究领域。
八. 对齐思考
以下内容属于面向食品价值估计研究的迁移思考,并不是论文已经完成或验证的食品应用。
8.1 有条件、可检验的食品命题
食品价值研究可以借鉴 THEORIZER 的 LAW–SCOPE–EVIDENCE 表示,将食品加工、成分变化、收率和资源消耗等关系表示成具有适用范围的候选命题。
例如,不建议构造:采用某种高级工艺,因此食品价值增加 10%。
更合理的研究对象是:在指定原料状态、设备规模和加工终点条件下,某加工工艺与单位成品能耗或成品收率之间是否存在稳定关系?为了进一步连接价值计算,可以在原论文三元组基础上加入 TEST 与 BINDING:
8.2 将工艺命题转换为成本参数
例如,假设某组符合适用条件的实验支持单位成品电耗:
其中 \(e\) 的单位为 kWh/kg 成品。如果研究情景中存在明确的电价 \(\pi\),单位为 CNY/kWh,则每 100g 成品对应的电耗成本可以由程序确定性计算:
因此:
LLM 的作用是从文献中识别、归纳并判断 \(e\) 的适用范围;金额计算仍由确定性程序完成。这样能够避免直接让模型根据“冻干”“低温”“高端工艺”等自然语言标签随意生成价格溢价。
8.3 数据集应当保存可检验的过程案例
若希望通过数据集进一步优化价值估计,数据记录不应只包含“食品名称—价值分”,而应尽量保存:
- 原料与初始状态;
- 加工工艺和操作条件;
- 设备或生产规模;
- 投入与实际产出;
- 资源消耗;
- 测量结果与单位;
- 文献来源;
- 是否真正能够检验某一条食品命题。
数据可以进一步按照用途分成:命题构建资料、命题修订案例以及冻结验证案例。
已经参与命题修订的案例不能再次被当成完全独立的盲测样本,否则容易高估命题库的实际泛化能力。
8.4 自迭代命题库应该由反例驱动
可以尝试构建如下离线迭代流程:
候选食品命题
↓
明确适用范围与检验条件
↓
读取新的独立实验或资料
↓
支持 / 反驳 / 无直接证据
↓
保留、缩小范围、分拆或停用
↓
使用未参与修订的案例重新验证
如果新资料满足原命题的适用条件,却给出了相反结果,应首先检查抽取、单位和实验条件;确认无误后,不能简单增加一个临时例外让命题永远正确,而应考虑修改适用范围或者停用原命题。
因此,自迭代的目标不是让命题数量持续增加,而是让命题边界、证据状态和可计算作用逐步更加准确。
8.5 评价命题库时,同时关注知识可靠性和价值估计效果
食品领域可以借鉴本文 precision / recall 的思想,但不能只停留在知识层面。
第一层评价命题是否获得独立证据支持:
同时报告有多少命题或预测真正找到了直接检验证据。
第二层则需要评价命题进入价值计算后是否真正改善结果。例如,对于存在独立测量值 \(y_i\) 的案例,如果系统输出区间 \([L_i,U_i]\),可以观察:
以及对应的区间宽度:
区间更窄并不自动意味着方法更准确。如果新的方法虽然缩窄区间,却让更多真实结果落在区间之外,则不能简单称为性能提升。
8.6 离线知识构建与在线价值估计分离
THEORIZER 的完整流程涉及文献检索、全文读取、证据抽取、理论生成以及后续文献评价,本身并不适合直接放入低延迟食品评分接口。
更合理的系统设计是:
离线: 文献检索 → 工艺证据抽取 → 条件化命题生成 → 独立证据检验 → 命题库 / 参数证据库 在线: 食品标签输入 → 匹配适用证据 → 配方约束与成本计算 → 市场参照 → 元/100g参考价值区间
这样可以利用 THEORIZER 的科学知识综合思想,又不会让每一次食品评分都重新搜索和阅读大量论文。
九. 总结
THEORIZER 将大语言模型的科研辅助能力,从生成零散研究想法进一步扩展到了跨文献的候选理论综合。
其最值得关注的设计,不只是 RAG 或多文档摘要,而是三个更具有研究意义的思想:
- 规律与适用范围必须同时表达。
- 语义相关文献与真正的直接检验证据必须区分。
- 候选理论的生成与理论可靠性的确认必须分开。
论文实验表明,显式文献支持能够提高候选规律的经验依据和预测表现,尤其能够降低新颖性导向生成带来的风险;但新颖性不等于正确性,高 precision 也不等于充分验证。
对于食品价值研究而言,更有意义的方向不是直接让模型根据文献生成“工艺溢价”,而是把食品研究中的工艺关系整理成有适用条件、有来源、能够接受反例,并具有明确计算落点的知识。
只有当这些条件化命题能够在独立案例上改善配方推断、加工参数或成本估计,而不只是让解释文本更加丰富时,它们才真正成为食品价值评分方法的一部分。