上海人工智能实验室最新研究证实,让AI大模型直接“看”科学论文原始PDF图像(视觉预训练VP),比先转成纯文本再学习效果更好。该方法不仅科学推理能力显著提升,且仅需四分之一的词元预算,有效避免了传统文字化过程中的信息丢失。
最终效果预览:AI直接“看”论文原图
这项研究的核心成果在于打破了“所有知识必须编码为文本”的传统假设。通过让模型直接处理论文页面的视觉图像,AI在科学推理基准测试中取得了全面超越。更重要的是,这种“视觉预训练”(Visual Pretraining, VP)方式在处理相同语料库时,仅需消耗约四分之一的词元预算(200亿视觉词元对比800亿文本词元),实现了效率与效果的双赢。
准备说明:理解传统预训练的局限
在深入操作细节前,我们需要明确当前主流大模型预训练(Text Pretraining, TP)的默认假设与痛点:
- 默认假设:所有值得学习的知识都可以无损地编码为文本词元序列。
- 操作流程:互联网上的论文、网页、文档在进入模型训练前,必须经过“文字化”工序(解析HTML/LaTeX或使用文档解析模型将PDF转为纯文本)。
- 核心痛点(文字化损失):科学论文中的图表、排版公式、页面空间布局等视觉元素,在转换为纯文本的过程中会发生丢失或变形。例如,物理示意图的几何关系、公式的排版结构、表格的行列对应关系,往往无法被文字完整转述。
操作正文:视觉预训练(VP)的实现路径
第1步:将论文PDF页面渲染为图像
操作目的:绕过有损的文字转换工序,保留原始文档的视觉形态。
具体动作:不再将PDF解析为文本,而是直接将每一页论文渲染为图像输入模型。
完成判断:系统获得包含文字、图表、公式的完整页面图像。
第2步:冻结视觉编码器提取特征
操作目的:从图像中提取高维度的视觉特征,过滤无关干扰。
具体动作:使用一个冻结的视觉编码器处理页面图像。系统会自动过滤掉页边距、空白区域等背景信息,仅保留文字、图表、公式等前景内容。
完成判断:获得纯净的前景视觉特征序列。
第3步:映射到大语言模型隐藏空间
操作目的:将视觉特征转化为大语言模型可理解的格式。
具体动作:将保留的视觉特征按照页面阅读顺序排列,通过一个线性投影层映射到大语言模型的隐藏空间。
完成判断:视觉特征成功嵌入模型的语义空间。
第4步:执行自回归训练与预测
操作目的:让模型学会理解并预测下一个视觉内容块。
具体动作:训练目标设定为预测下一个前景图像块的特征(而非文字词元)。采用对比学习方式,让模型区分正确的下一个图像块与其他图像块。同时,结合传统的文字词元预测,按固定比例混合训练。
完成判断:模型同时掌握了文字和视觉特征的预测能力。

结果验证:科学推理与效率的双重提升
研究团队在Qwen3.5、Qwen3、Llama3.2 Vision和Llama3.1等多个主流模型上进行了严格控制的对比实验(VP与TP使用完全相同的语料来源)。结果如下:
1. 科学推理能力显著提升
- Qwen3.5:GPQA Diamond从76.24提升至79.29(+3.22%);MMLU-Pro提升约2.1%;AIME 2025从74.99提升至76.98。
- Llama 3.2 Vision:GPQA Diamond从43.88提升至47.10;AIME从23.65提升至24.27。
2. 训练效率大幅优化
处理相同的PDF语料库,VP仅需约200亿视觉词元,而TP需要约800亿文本词元。这意味着VP用四分之一的数据量达到了更好的效果。
3. 多模态能力自然增强
即便没有使用任何图像-文字配对的有监督数据,VP训练后的模型在ChartQAPro、MathVista等多模态基准测试上也有明显提升。向量空间分析显示,VP训练后视觉和文字模态的表示更加接近(全局聚类分离度从1.665降至0.661,配对余弦相似度从0.631升至0.907)。

问题与调整:VP的适用场景与局限性
尽管VP优势明显,但在实际应用中需注意以下限制:
- 适用场景:VP的优势在视觉结构密度高的页面(图表、公式、表格密集)上尤为明显。在文字密集、结构简单的页面上,VP与TP表现相当。
- 局限性:当前实验主要聚焦于高知识密度的科学PDF文档。同样的策略能否推广到自然图像或视频等更广泛的视觉语料,仍需进一步研究。
- 定位:VP并非取代文字预训练,而是在其基础上增加视觉预训练阶段,让模型在保持文字暴露的同时,从文档原始视觉形态中学习。
总结:科学文档处理的新范式
这项研究挑战了“训练语言模型必须用纯文本”的行业默认前提。对于科学文档、图表、表格、公式等视觉密度高的内容,让模型直接“看”原始页面,比先转成文字再“读”更高效且信息量更大。VP通过保留公式拓扑结构、图表空间关系和表格对应逻辑,有效避免了“文字化损失”,为提升AI的科学推理和多模态能力提供了新的可行路径。
以上就是AI直接“看”论文原图节省算力提升科学推理的详细内容,更多关于视觉预训练、大模型训练及科学推理的资料请关注本站其它相关文章!


