Agentic RAG革新文档推理:解决AI复杂文档解析难题

新智元报道
编辑:LRST
【新智元导读】DeepRead让AI像人一样阅读文档:利用OCR识别章节结构,先精准定位相关段落,再完整读取上下文,避免碎片化检索。实验显示,其长文档问答准确率提升17%,能自动跳过冗余信息,精准提取财报、论文等复杂内容,无需额外知识图谱,轻量高效。
大语言模型的工具使用能力正推动RAG从静态的一次性检索,向自主、多轮的证据获取进化,Agentic RAG已成为解决复杂问答任务的核心方向。
但现有主流Agentic Search框架普遍存在一个关键痛点——结构盲:它们将长文档视为无差别的扁平文本块,忽略了文档原生的层级组织(如章节、段落)和顺序逻辑,导致检索碎片化、证据遗漏、冗余操作等问题频发。
比如说,人类查询「ACL论文投稿要求」时,会先翻阅目录找到「投稿指南」章节,再逐段精读关键信息。
但传统Agentic Search(如Search-o1)却只能通过不断给出新的query反复检索,可能遗漏「页码限制」「格式要求」等未被关键词覆盖的内容,还会重复获取已浏览过的片段。

这种「结构盲」带来三大问题:
证据碎片化:将文档拆分为固定大小的文本块,破坏语义连贯性,迫使智能体拼接零散片段;
检索冗余:缺乏全局结构认知,反复检索同类信息,浪费计算资源;
信息遗漏:依赖关键词匹配,无法捕获章节内隐含的相关信息。
而现代OCR技术已能精准提取文档的层级结构和阅读顺序,这为解决「结构盲」提供了基础——让智能体学会利用这些原生结构,而非忽视它们。
中国科学院计算技术研究所团队提出的DeepRead,核心创新是将文档结构转化为智能体可理解、可操作的坐标系统,通过两大工具协同实现类人推理,整体框架参考下图。

论文:https://arxiv.org/abs/2602.05014
代码:https://github.com/Zhanli-Li/DeepRead

文档结构建模:给每个段落分配「坐标」
DeepRead首先通过OCR工具将原始文档转化为结构化Markdown格式,构建双维度结构模型:
层级维度:区分标题(如章节)和内容段落,记录标题的父子关系(如「2.方法」包含「2.1模型设计」);
顺序维度:给每个段落分配唯一坐标(doc_id, sec_id, para_idx),即「文档ID-章节ID-段落索引」,让每个文本片段都有明确的位置标识。
同时,DeepRead会将轻量化的目录(TOC)注入系统提示,让智能体掌握全局结构,无需加载全量文档内容,平衡上下文开销与结构感知能力。
两大核心工具:Retrieve与ReadSection的协同
DeepRead为智能体配备两个互补工具,模拟人类「快速定位+深度阅读」的行为:
Retrieve(扫描式定位):接收语义查询,返回Top-K相关段落及其坐标,同时支持「扫描窗口」(在召回的段落加上前后各1段),模拟人类快速浏览上下文的行为;
ReadSection(聚焦式阅读):接收坐标范围(如doc_id=1, sec_id=3, start_para=0, end_para=5),返回该范围内的连续、保序段落,重构完整语义上下文,彻底解决碎片化问题。
两者形成闭环:Retrieve负责「找方向」,快速锁定相关章节;ReadSection负责「深挖掘」,获取完整证据,避免关键词检索的局限性。
涌现行为:自主学会「定位再阅读」
无需手动编码规则或是特定指令,DeepRead可自主进化出类人推理策略:先通过Retrieve获取结构锚点,再调用ReadSection精读相关章节。实验显示,90%以上的查询会遵循这一范式,且工具调用比例会自适应任务特性——ContextBench(长文档推理)更依赖ReadSection,FinanceBench(金融数据提取)更依赖Retrieve。

实验结果
跨场景的显著提升
研究人员在四大基准数据集(涵盖单文档/合成多文档数据集)上验证了DeepRead的效果,核心结果参考下表

关键亮点包括:
长文档推理突破:在需长距离依赖的ContextBench上,DeepRead准确率从74.5%提升至91.5%,提升幅度达17.0%,验证了结构感知对长文档的价值;
多文档融合优势:在基于QASPER(学术论文问答)和SyllabusQA(课程大纲对比)合成的多文档数据集上表现优越,分别提升7.7%和13.8%,证明结构感知能有效跨文档整合证据;
鲁棒性验证:通过DeepSeek-V3.2、GLM-4.7、Qwen3-235B三大独立法官评估,结果一致率达88.58%,确保提升并非偶然。

值得注意的是,DeepRead的优势并非来自「更多的检索片段」——即使Search-o1允许检索更多文本块,仍无法弥补结构缺失的差距;而盲目扩展上下文(expand)可能会降低DeepRead在部分任务上的性能,因为结构化阅读已能提供足够连贯的证据,冗余文本只会引入噪声。
案例直观感受:从「关键词拼凑」到「章节精读」
以FinanceBench中的亚马逊营收计算任务为例:
传统Search-o1风格的Agentic Search需反复检索「2016营收」「2017净销售额」等关键词,可能混淆「预估数据」与「实际财报数据」;
DeepRead则先通过Retrieve定位到「合并利润表」章节,再用ReadSection读取完整表格,精准提取2016年135987百万美元、2017年177866百万美元的净销售额,计算出30.8%的同比增长率。
总结
DeepRead的核心价值在于:挖掘文档原生结构先验,用轻量坐标系统和协同工具,实现了Agentic RAG的结构感知升级。
相比构建复杂知识图谱的方案,DeepRead无需额外结构化成本,仅通过OCR解析和工具设计,就在长文档、多文档任务上实现显著提升,兼具实用性和效率。
参考资料:
https://arxiv.org/abs/2602.05014
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
昊铂S600预售18.89万起 智能轿跑SUV配置全解析
昊铂S600开启预售,提供纯电与增程双动力,预售权益价18 89万元起。新车定位中大型轿跑SUV,轴距2936毫米,设计运动优雅。内饰采用高级材质与氛围灯,配备智能新风系统及多项安全配置。搭载ADiGO6 0座舱与高阶智驾系统,支持城区高速导航辅助驾驶。纯电续航660公里,增程综合续航超1200公里,部分车型配备双腔空气悬架。
特斯拉内华达州建Cybercab专属洗车站 打造全自动维护新模式
特斯拉在内华达州建设超3300平方米的Cybercab专用维护中心,配备全封闭自动化洗车系统,作为自动驾驶网约车队的区域枢纽。该设施专为无方向盘车辆设计,通过标准化流程保障车辆状态与安全。类似规划已在多地浮现,表明特斯拉正构建网络化维护体系以降低成本、提升效率,并为未来集成机器人。
比亚迪唐EV江城预售 东方美学硬核科技重塑纯电出行体验
比亚迪大唐EV在武汉开启预售,定位D级旗舰纯电SUV,预售价25万至32万元。车辆采用七座布局,空间利用率高,续航最高达950公里,支持快速充电。内饰融合东方美学与科技,配备高阶智能驾驶系统与舒适性功能,旨在打造高端智能出行体验。
腾讯狍子AI内测上线专治微信收藏夹信息杂乱难题
腾讯内测“狍子AI”知识库工具,用户可将微信收藏的公众号文章一键导入个人知识库,解决收藏内容检索难题。通过绑定账号并转发文章即可完成入库,操作完全在微信生态内。产品采用前端轻连接、后端重处理模式,旨在将AI能力自然融入高频使用场景,保持交互便捷。
上海移动5G-A超级上行网络正式商用 1元享40万Tokens通用服务
上海移动宣布5G-A超级上行网络实现规模商用,上行峰值速率达1Gbps,核心城区等重点区域已覆盖,并完成天地一体化海洋通信专网验证。算力方面,智算规模达11 2EFLOPS,推出国产化基座、模型聚合平台与AI可信数据空间。联合腾讯推出1元兑换40万Tokens的普惠AI服务,降低使用门槛。通信行业数据创新实验室正式揭牌。
- 日榜
- 周榜
- 月榜
1
2
3
4
5
6
7
8
9
10
相关攻略
2015-03-10 11:25
2015-03-10 11:05
2021-08-04 13:30
2015-03-10 11:22
2015-03-10 12:39
2022-05-16 18:57
2025-05-23 13:43
2025-05-23 14:01
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程
热门话题

