扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 只读文本的AI,科学推理能力只有“看图”AI的1/3丨中科大

股市情报:上述文章报告出品方/作者:量子位;仅供参考,投资者应独立决策并承担投资风险。

只读文本的AI,科学推理能力只有“看图”AI的1/3丨中科大

时间:2026-07-31 15:27
上述文章报告出品方/作者:量子位;仅供参考,投资者应独立决策并承担投资风险。


视觉预训练只需要约四分之一的文档Token,便能取得远超文本预训练的增益。

来自中科大与上海人工智能实验室联合团队的这一实验结果,证明了在真实的训练语料中,图片往往承载着文字无法无损翻译的视觉逻辑。

若仅靠OCR将立体知识强制降维为一维文本,模型最终捕获的不过是知识的碎片。

为了打破这一局限,团队提出了一种全新的视觉预训练范式:在连续视觉表征空间中“预测下一个视觉单元”,让模型能够直接从图文交织的视觉文档中汲取最原始、最完整的科学知识。

目前,这项技术已成功应用于上海人工智能实验室Intern-S2-Preview 35B/397B系列多模态大模型的预训练中,有效提升了模型的科学推理与多模态理解能力。值得一提的是,相关研发均基于国产昇腾算力平台完成,并成功实现了面向大规模预训练的深度适配与优化。

在统一表征空间进行视觉预训练
相同语料在视觉预训练和文本预训练对比示意图

实验发现

发现一:从视觉文档中,也能学到更强的语言智能

研究首先验证了一个核心预期:如果原始文档页面比解析后的纯文本保留了更完整的知识,那么,直接从这些视觉文档中学习,也应当为模型带来更强的科学推理能力。

实验结果验证了这一判断。在保持训练设置一致的情况下,视觉预训练(VP)在MMLU-Pro、GPQA Diamond等纯文本推理基准上,全面优于纯文本预训练(TP),且该趋势在不同模型架构上稳定出现。

推理能力评测对比

这说明:模型学习到的并不只是图像的表面特征,而是视觉与文本内容共同承载的知识。

发现二:视觉预训练的收益随训练规模持续增长,呼应Scaling law

一种预训练范式能否支撑基础模型发展,关键不仅在于它是否有效,更在于它能否从不断扩大的数据与计算规模中持续获益。

实验表明,VP展现出了清晰的Scaling 趋势:随着科学文档训练量持续增加,VP相对于文本预训练的优势并未趋于饱和,而是在多个基准上稳定扩大。

视觉预训练增益随着训练规模增大

进一步分析显示,VP的收益与页面中的视觉结构密度密切相关。在以文字为主、视觉结构较少的样本上,VP与文本预训练表现接近;随着视觉信息的占比增加,VP的优势显著扩大。

更重要的是,这种增长建立在更紧凑的视觉表示之上。对于完全相同的科学PDF,解析后的文本约包含800亿个Token,而视觉表示仅包含约200亿个视觉Token。换言之,VP仅使用约四分之一的文档Token,便取得了超过文本预训练的效果,体现出更高的信息密度与扩展效率。

发现三:无需显式图文配对监督,也能促进跨模态对齐

传统多模态预训练通常依赖大量图文对、图片描述或人工标注。VP使用的却只是未经标注的原始文档页面,没有显式的图文配对监督。

尽管如此,经过视觉预训练后,模型中的视觉与文字表征仍然变得更加接近:配对图文表征的余弦相似度由0.631提升至0.907,表征空间的全局结构与局部邻域也呈现出更强的一致性。

这种跨模态对齐进一步迁移到了实际任务中。在MMMU-Pro等多模态基准上,VP在不同模型架构下均优于文本预训练。这意味着,模型在已有语言知识与视觉结构之间建立了联系。

多模态能力评测对比

方法介绍

如果说传统语言模型的训练是“根据上文猜下一个词”,VP做的就是“根据前面的视觉内容猜下一个视觉表征”。二者形式相似,区别在于预测对象从离散文字Token变成了连续视觉潜表征,具体实现如下。

  • 第一步,让原始页面以“视觉序列”进入模型。

原始PDF先被渲染成页面图像,再由冻结的视觉编码器转换为一组连续特征。视觉编码器保持不变,相当于提供稳定的“答案空间”;模型学习的不是还原每一个像素,而是预测更抽象的内容表征,从而减少颜色、噪声等低层细节的干扰。

  • 第二步,只保留有信息的前景内容。

科学文档中页边距、空白区占比很高。系统依据局部像素方差和亮度过滤低信息Patch,只保留文字、公式、图表、表格等前景区域,并按页面从左到右、从上到下的顺序排列,同时保留位置关系。

  • 第三步,预测“下一个视觉潜表征”。

前景特征通过输入投影进入语言模型。在因果注意力下,当前位置只能看到前面的视觉内容;模型的隐藏状态再经轻量预测头,去匹配下一块前景特征。训练采用带批内负样本的对比损失:预测结果既要靠近正确目标,也要与其他Patch区分开。

  • 第四步,让文字和视觉共用同一个“大脑”。

文本样本继续做下一词预测,视觉样本做下一视觉潜表征预测,两类数据按固定比例交替进入同一自回归骨干。训练时更新共享语言模型、输入投影和预测头,视觉编码器保持冻结。因此,视觉学习信号会直接更新承载语言能力的模型参数,而不是停留在外挂视觉模块中。

未来,随着预测目标进一步拓展到图像、视频与交互数据,模型或许能够逐步建立对现实更完整的内部表征。视觉预训练正是迈向这一方向的一步。改变的不只是输入模型的数据形式,更是模型获取知识、建立预测与理解世界的方式

股票复盘网
当前版本:V3.0