面包屑图标 当前位置: 首页
AI资讯
热点详情

AI直接“看”论文原图:节省75%算力,科学推理能力显著提升

AI热点日报
AI热点日报时间:2026-08-28
热点解读

上海人工智能实验室最新研究证实,让AI大模型直接“看”科学论文原始PDF图像(视觉预训练VP),比先转成纯文本再学习效果更好。该方法不仅科学推理能力显著提升,且仅需四分之一的词元预算,有效避免了传统文字化过程中的信息丢失。

上海人工智能实验室最新研究证实,让AI大模型直接“看”科学论文原始PDF图像(视觉预训练VP),比先转成纯文本再学习效果更好。该方法不仅科学推理能力显著提升,且仅需四分之一的词元预算,有效避免了传统文字化过程中的信息丢失。

最终效果预览:AI直接“看”论文原图

这项研究的核心成果在于打破了“所有知识必须编码为文本”的传统假设。通过让模型直接处理论文页面的视觉图像,AI在科学推理基准测试中取得了全面超越。更重要的是,这种“视觉预训练”(Visual Pretraining, VP)方式在处理相同语料库时,仅需消耗约四分之一的词元预算(200亿视觉词元对比800亿文本词元),实现了效率与效果的双赢。

准备说明:理解传统预训练的局限

在深入操作细节前,我们需要明确当前主流大模型预训练(Text Pretraining, TP)的默认假设与痛点:

  • 默认假设:所有值得学习的知识都可以无损地编码为文本词元序列。
  • 操作流程:互联网上的论文、网页、文档在进入模型训练前,必须经过“文字化”工序(解析HTML/LaTeX或使用文档解析模型将PDF转为纯文本)。
  • 核心痛点(文字化损失):科学论文中的图表、排版公式、页面空间布局等视觉元素,在转换为纯文本的过程中会发生丢失或变形。例如,物理示意图的几何关系、公式的排版结构、表格的行列对应关系,往往无法被文字完整转述。

操作正文:视觉预训练(VP)的实现路径

第1步:将论文PDF页面渲染为图像

操作目的:绕过有损的文字转换工序,保留原始文档的视觉形态。

具体动作:不再将PDF解析为文本,而是直接将每一页论文渲染为图像输入模型。

完成判断:系统获得包含文字、图表、公式的完整页面图像。

第2步:冻结视觉编码器提取特征

操作目的:从图像中提取高维度的视觉特征,过滤无关干扰。

具体动作:使用一个冻结的视觉编码器处理页面图像。系统会自动过滤掉页边距、空白区域等背景信息,仅保留文字、图表、公式等前景内容。

完成判断:获得纯净的前景视觉特征序列。

第3步:映射到大语言模型隐藏空间

操作目的:将视觉特征转化为大语言模型可理解的格式。

具体动作:将保留的视觉特征按照页面阅读顺序排列,通过一个线性投影层映射到大语言模型的隐藏空间。

完成判断:视觉特征成功嵌入模型的语义空间。

第4步:执行自回归训练与预测

操作目的:让模型学会理解并预测下一个视觉内容块。

具体动作:训练目标设定为预测下一个前景图像块的特征(而非文字词元)。采用对比学习方式,让模型区分正确的下一个图像块与其他图像块。同时,结合传统的文字词元预测,按固定比例混合训练。

完成判断:模型同时掌握了文字和视觉特征的预测能力。

视觉预训练VP流程示意图:展示从PDF页面图像到视觉特征提取,再到映射到大语言模型隐藏空间进行自回归训练的全过程
视觉预训练(VP)的核心流程:从PDF页面图像提取特征,映射至大模型空间进行自回归训练。

结果验证:科学推理与效率的双重提升

研究团队在Qwen3.5、Qwen3、Llama3.2 Vision和Llama3.1等多个主流模型上进行了严格控制的对比实验(VP与TP使用完全相同的语料来源)。结果如下:

1. 科学推理能力显著提升

  • Qwen3.5:GPQA Diamond从76.24提升至79.29(+3.22%);MMLU-Pro提升约2.1%;AIME 2025从74.99提升至76.98。
  • Llama 3.2 Vision:GPQA Diamond从43.88提升至47.10;AIME从23.65提升至24.27。

2. 训练效率大幅优化

处理相同的PDF语料库,VP仅需约200亿视觉词元,而TP需要约800亿文本词元。这意味着VP用四分之一的数据量达到了更好的效果。

3. 多模态能力自然增强

即便没有使用任何图像-文字配对的有监督数据,VP训练后的模型在ChartQAPro、MathVista等多模态基准测试上也有明显提升。向量空间分析显示,VP训练后视觉和文字模态的表示更加接近(全局聚类分离度从1.665降至0.661,配对余弦相似度从0.631升至0.907)。

实验结果对比图:展示视觉预训练VP在科学推理基准测试中优于文字预训练TP的数据表现
实验结果对比:VP在科学推理基准测试中一致优于TP,且在视觉结构密度高的页面上优势更显著。

问题与调整:VP的适用场景与局限性

尽管VP优势明显,但在实际应用中需注意以下限制:

  • 适用场景:VP的优势在视觉结构密度高的页面(图表、公式、表格密集)上尤为明显。在文字密集、结构简单的页面上,VP与TP表现相当。
  • 局限性:当前实验主要聚焦于高知识密度的科学PDF文档。同样的策略能否推广到自然图像或视频等更广泛的视觉语料,仍需进一步研究。
  • 定位:VP并非取代文字预训练,而是在其基础上增加视觉预训练阶段,让模型在保持文字暴露的同时,从文档原始视觉形态中学习。

总结:科学文档处理的新范式

这项研究挑战了“训练语言模型必须用纯文本”的行业默认前提。对于科学文档、图表、表格、公式等视觉密度高的内容,让模型直接“看”原始页面,比先转成文字再“读”更高效且信息量更大。VP通过保留公式拓扑结构、图表空间关系和表格对应逻辑,有效避免了“文字化损失”,为提升AI的科学推理和多模态能力提供了新的可行路径。

以上就是AI直接“看”论文原图节省算力提升科学推理的详细内容,更多关于视觉预训练、大模型训练及科学推理的资料请关注本站其它相关文章!

热点追踪提示词
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:AI直接“看”论文原图:节省75%算力,科学推理能力显著提升要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
来源:https://www.thepaper.cn/newsDetail_forward_33838061
视觉预训练 VP 科学推理 大模型训练 论文解析

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关热点
AI热点2026-08-28 14:52
忆联AM6D1与AE631:端侧AI存储底座的双旗舰方案

本文深度解析忆联AM6D1与AE631两款PCIe 5 0 SSD在端侧AI场景的应用。AM6D1凭借11400MB s读写与10 52秒模型加载速度,实现大模型“秒启”;AE631则以QLC介质与DRAM-Less架构优化TCO,延长PC续航。双产品矩阵共同解决端侧AI算力与存储瓶颈,助力AI应用普惠落地。

AI热点2026-08-28 14:52
企业语义层建好以后,Agent 到底怎么用

企业构建统一语义层后,Agent如何高效调用成关键。本文解析语义层驱动任务执行的全流程:Agent读取上下文、判断业务条件、调用工具,最终完成操作。通过共享语义层维护,避免语义烟囱,简化提示词,实现业务定义与Agent执行的解耦。

AI热点2026-08-28 14:52
2026全球具身智能标杆企业Top 100发布:璇玑动力等入选,EACI模型揭示商业化落地新标准

2026世界机器人大会发布“全球具身智能标杆企业Top 100”榜单,璇玑动力、宇树、优必选等头部企业入选。本次评选采用EACI模型,重点考察商业化订单、量产交付及场景落地能力,标志着具身智能产业进入以商业价值为核心的新阶段。

AI热点2026-08-28 14:51
具身智能下半场:从演示到交付,机器人行业如何跨越“试用期”

具身智能行业已跨越“演示”阶段,进入以交付质量为核心的下半场。本文深度解析WRC展会中工业、零售与家庭三大场景的验证逻辑差异,探讨VLA与世界模型的技术路线选择,并剖析产业链成熟度下的商业化落地现状与交付挑战。

延伸阅读