科技文献智能研究布局

围绕科技文献中的科学知识获取与发现,构建 Search、Extract、Discover 三个相互衔接的研究支柱,推动 AI 从找到和理解已有知识走向基于证据发现未知知识。

从文献空间到新科学知识

科技文献是科学知识最重要的外部载体之一。研究问题已经从“知识是否存在”,转向如何高效找到知识、准确恢复知识,并进一步利用已有知识产生新的科学认知。

核心研究主线: Find Knowledge → Extract Knowledge → Discover Knowledge

Scientific Literature Intelligence 不把论文搜索、文档解析、问答和深度研究视为彼此孤立的任务,而是把它们组织为连续的科学知识状态转化过程。

第一阶段从海量文献中定位相关证据,第二阶段把复杂多模态文档转化为机器可操作的科学知识,第三阶段从跨文献、跨实验的分布式证据中发现新的规律、空白、边界与假设。

推动科技文献智能从“找到与理解已有知识”, 进一步走向“基于已有知识发现未知知识”。
Search

科技文献检索

Where is the knowledge?

从海量文献空间中自主定位解决科研问题所需的证据与知识。

Extract

解析与知识抽取

What knowledge is contained?

从复杂科学文档中恢复结构、对象、关系、主张与证据。

Discover

科技文献知识发现

What new knowledge can be derived?

从已有证据中归纳规律、发现空白并形成可验证的新假设。

01 · 科技文献检索

科研检索不是一次 Query–Document Matching,而是“提出问题—搜索—阅读—发现缺口—重构目标—再次搜索”的开放探索过程。

Agentic Scientific Search

从搜索引擎走向自主科研搜索

让智能体理解科研意图、分解科学问题、规划多跳检索,利用 Citation、Author、Venue、Topic 与 Entity 等异构关系持续发现证据。

Evaluation

评价真正的科研搜索能力

不只评价相关性,还关注证据完整性、新颖性、权威性、多样性,以及 Search–Read–Reformulate 过程中的规划与工具调用质量。

02 · 科技文献解析与知识抽取

科学论文不是纯文本,而是由正文、表格、图像、公式、算法、引用和科学符号共同构成的多模态知识载体。

Scientific Document Parsing

让 AI 真正“看到”论文

恢复复杂版面、阅读顺序、章节层级、Figure、Table、Equation、Algorithm、Caption 及其跨模态对应,把面向人类阅读的文档转化为机器可感知内容。

Scientific Knowledge Extraction

从文档元素恢复科学知识

抽取 Problem、Method、Dataset、Metric、Entity、Claim、Evidence、Finding、Limitation 与 Mechanism,形成可被科研智能体继续消费的知识对象。

关键知识表示: Claim ↔ Evidence ↔ Condition ↔ Result ↔ Source
Problem Method Dataset Metric Experiment Claim Evidence Finding Limitation Mechanism

03 · 科技文献知识发现

从跨论文、跨实验、跨模态的分布式证据中,发现原文没有直接给出的稳定关系、研究空白、边界条件与科学假设。

Pattern

科学规律发现

联合文献表格与实验结果,归纳变量关系、单调或非单调规律、隐藏交互、适用条件与失效区间。

Gap

科研空白发现

识别尚未解决的问题、缺失实验条件、冲突结论、未探索变量组合与潜在边界条件。

Hypothesis

科学假设生成

组织支持与冲突证据、可能机制、适用边界和可检验预测,形成证据驱动而非自由想象的假设。

Candidate

候选对象发现

从文献知识生成并排序值得验证的材料、分子、药物靶点、科学关系或方法—问题组合。

证据驱动发现路径: Evidence → Pattern → Gap → Mechanism → Hypothesis → Verification

现有工作的统一位置

当前工作已经覆盖检索、评测、推理和深度研究,下一步需要补强知识抽取与证据驱动发现,使研究组合形成完整链条。

研究阶段 核心问题 代表工作或布局
Literature Retrieval 如何自主找到科研任务所需的文献与证据? PaperScout
Retrieval Evaluation 如何评价复杂科研搜索能力? ScholarQuest
Parsing & Extraction 如何把复杂科学文档转化为结构化知识? 下一阶段重点布局
Understanding & Reasoning AI 是否真正能够理解和推理文献知识? PaperArena
Deep Research 如何完成复杂、开放的文献研究过程? Mind2Report
Knowledge Discovery 如何从文献证据中发现新规律与新假设? 下一阶段重点布局

下一阶段重点补齐两层能力

Search 与 Deep Research 已有明确基础,下一步应把中间知识层做扎实,并建立真正以文献证据为起点的科学发现方法。

Priority A

Scientific Knowledge Extraction

面向复杂多模态科技文献,重点研究 Table、Figure、Equation、Claim–Evidence、Experiment 与领域结构化科学数据,使知识真正可被机器操作。

Priority B

Evidence-driven Scientific Discovery

从真实文献证据而非 LLM 想象出发,建立 Tables / Experiments → Pattern → Gap → Hypothesis 的可追踪发现路径。