科技文献检索
Where is the knowledge?
从海量文献空间中自主定位解决科研问题所需的证据与知识。
围绕科技文献中的科学知识获取与发现,构建 Search、Extract、Discover 三个相互衔接的研究支柱,推动 AI 从找到和理解已有知识走向基于证据发现未知知识。
科技文献是科学知识最重要的外部载体之一。研究问题已经从“知识是否存在”,转向如何高效找到知识、准确恢复知识,并进一步利用已有知识产生新的科学认知。
Scientific Literature Intelligence 不把论文搜索、文档解析、问答和深度研究视为彼此孤立的任务,而是把它们组织为连续的科学知识状态转化过程。
第一阶段从海量文献中定位相关证据,第二阶段把复杂多模态文档转化为机器可操作的科学知识,第三阶段从跨文献、跨实验的分布式证据中发现新的规律、空白、边界与假设。
Where is the knowledge?
从海量文献空间中自主定位解决科研问题所需的证据与知识。
What knowledge is contained?
从复杂科学文档中恢复结构、对象、关系、主张与证据。
What new knowledge can be derived?
从已有证据中归纳规律、发现空白并形成可验证的新假设。
科研检索不是一次 Query–Document Matching,而是“提出问题—搜索—阅读—发现缺口—重构目标—再次搜索”的开放探索过程。
让智能体理解科研意图、分解科学问题、规划多跳检索,利用 Citation、Author、Venue、Topic 与 Entity 等异构关系持续发现证据。
不只评价相关性,还关注证据完整性、新颖性、权威性、多样性,以及 Search–Read–Reformulate 过程中的规划与工具调用质量。
科学论文不是纯文本,而是由正文、表格、图像、公式、算法、引用和科学符号共同构成的多模态知识载体。
恢复复杂版面、阅读顺序、章节层级、Figure、Table、Equation、Algorithm、Caption 及其跨模态对应,把面向人类阅读的文档转化为机器可感知内容。
抽取 Problem、Method、Dataset、Metric、Entity、Claim、Evidence、Finding、Limitation 与 Mechanism,形成可被科研智能体继续消费的知识对象。
从跨论文、跨实验、跨模态的分布式证据中,发现原文没有直接给出的稳定关系、研究空白、边界条件与科学假设。
联合文献表格与实验结果,归纳变量关系、单调或非单调规律、隐藏交互、适用条件与失效区间。
识别尚未解决的问题、缺失实验条件、冲突结论、未探索变量组合与潜在边界条件。
组织支持与冲突证据、可能机制、适用边界和可检验预测,形成证据驱动而非自由想象的假设。
从文献知识生成并排序值得验证的材料、分子、药物靶点、科学关系或方法—问题组合。
当前工作已经覆盖检索、评测、推理和深度研究,下一步需要补强知识抽取与证据驱动发现,使研究组合形成完整链条。
| 研究阶段 | 核心问题 | 代表工作或布局 |
|---|---|---|
| Literature Retrieval | 如何自主找到科研任务所需的文献与证据? | PaperScout |
| Retrieval Evaluation | 如何评价复杂科研搜索能力? | ScholarQuest |
| Parsing & Extraction | 如何把复杂科学文档转化为结构化知识? | 下一阶段重点布局 |
| Understanding & Reasoning | AI 是否真正能够理解和推理文献知识? | PaperArena |
| Deep Research | 如何完成复杂、开放的文献研究过程? | Mind2Report |
| Knowledge Discovery | 如何从文献证据中发现新规律与新假设? | 下一阶段重点布局 |
Search 与 Deep Research 已有明确基础,下一步应把中间知识层做扎实,并建立真正以文献证据为起点的科学发现方法。
面向复杂多模态科技文献,重点研究 Table、Figure、Equation、Claim–Evidence、Experiment 与领域结构化科学数据,使知识真正可被机器操作。
从真实文献证据而非 LLM 想象出发,建立 Tables / Experiments → Pattern → Gap → Hypothesis 的可追踪发现路径。