VisualMRC: Machine Reading Comprehension on Document Images
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV
Comments Accepted as a full paper at AAAI 2021. The first two authors have equal contribution
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV
Comments Accepted as a full paper at AAAI 2021. The first two authors have equal contribution
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV
Comments accepted at WACV 2021
面向结构化数据搜索的引导式表格检索
专题命中 文档图表理解 :grounding(abstract)
AI总结 该研究针对结构化数据库自然语言问答任务,提出四阶段引导式表格检索流程,在BIRD-DEV和BEAVER基准上取得优于基线的准确率与F1值,生成的精确连接树可直接供下游查询编译器使用。
基于强化学习的黑盒检索文档优化
机构 * Stanford University(斯坦福大学) ; ContextualAI
专题命中 文档图表理解 :vision language model(abstract)
AI总结 提出通过强化学习(GRPO)优化文档表示,使其与目标检索器的查询分布对齐,仅需黑盒访问检索排名,在代码和视觉文档检索任务中提升性能,使小模型超越大模型。
面向多文档摘要验证的空间视觉分析技术
专题命中 文档图表理解 :grounding(abstract)
AI总结 该研究针对多文档摘要验证难题,提出SVS视觉分析系统,含两种二维布局,实验表明其可提升验证准确性、降低工作量,SUMMARY-GUIDED布局综合表现最优。
Comments Accepted to IEEE VIS 2026; 13 pages, including appendices (11-page paper plus 2-page appendices)
对异构科学提取文档中表格提取的基准测试
专题命中 文档图表理解 :vision language model(abstract)
AI总结 本文提出了一种新的基准测试,用于评估端到端表格提取方法,通过分析评估指标和设计严谨的评估流程,揭示了当前方法在异构数据下的局限性。
Comments Extended version, with appendices, of a paper published at KDD '26
Scope3Trace:基于证据的可持续发展报告中范围三温室气体排放识别与提取
机构 * UNSW Sydney(新南威尔士大学悉尼分校)
专题命中 文档图表理解 :grounding(abstract)
AI总结 研究针对范围三温室气体排放分析难题,提出Scope3Trace框架,集成多种技术从ESG和可持续发展报告中提取相关信息,并构建多模态数据集,实现了异构可持续发展披露信息可靠提取与透明整合,且提取精度高。
Comments 23 pages
国联索引卡片的混合元数据提取:从可行性研究到档案系统集成
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 提出混合AI工作流从国联索引卡片中提取并整合档案元数据,结合YOLO、TrOCR、本地LLM后校正及微调视觉语言模型,实现从布局感知管道到混合架构的演进。
SlideAgent:用于多页视觉文档理解的分层代理框架
机构 * Georgia Institute of Technology(佐治亚理工学院) ; J.P. Morgan AI Research(摩根大通AI研究)
专题命中 文档图表理解 :multimodal large language model(abstract)
AI总结 提出SlideAgent,一种用于多模态多页文档(如幻灯片)理解的分层代理框架,通过全局、页面和元素三级推理构建结构化表示,在专有和开源模型上分别提升7.9%和9.8%的准确率。
Comments ACL 2026 Main Conference. https://slideagent.github.io/
含文本图像的机器翻译系统比较评估
机构 * ValgrAI - Valencian Graduate School and Research Network for Artificial Intelligence(ValgrAI - 瓦伦西亚人工智能研究生学院和研究网络)
专题命中 文档图表理解 :MLLM(abstract_cn)
AI总结 本研究比较评估了三种机器翻译范式(模块化流水线、多模态大语言模型和端到端模型Translatotron-V)在含文本图像翻译任务上的性能,发现多模态大语言模型表现最佳。
双三角形标注:一种可扩展的人机协同高精度历史文档标注框架
机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)
专题命中 文档图表理解 :multimodal large language model(abstract)
AI总结 提出双三角形标注框架,通过两层人机协同和跨模型共识自动完成大部分标注工作,实现高精度历史文档结构化信息提取。
Comments 12 pages, 4 figures. ACL ARR 2026 March submission
ForMaT:用于视觉接地多语言PDF翻译的数据集
机构 * Laniqo ; Faculty of Mathematics and Computer Science, Adam Mickiewicz University(亚当·密茨凯维奇大学数学与计算机科学学院) ; Poznań University of Technology(波兹南技术大学)
专题命中 文档图表理解 :grounding(abstract)
AI总结 ForMaT通过3956个PDF构建多语言翻译数据集,保留布局元数据以提升多模态翻译效果,采用K-Medoids采样捕捉复杂元素,揭示当前MT系统在空间接地与几何同步上的不足,为布局感知翻译模型提供基准。
MMTutorBench:首个多模态AI数学辅导基准
机构 * Tongji University(同济大学) ; Fudan University(复旦大学) ; University of Notre Dame(圣母大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学)
专题命中 文档图表理解 :multimodal large language model(abstract)
AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。
从少量数据中学习更多:利用反事实以提高图表理解的数据效率
机构 * Nanyang Technological University(南洋理工大学) ; Aumovio Singapore Pte. Ltd.(Aumovio新加坡私人有限公司)
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 本文提出ChartCF框架,通过反事实数据合成和多模态偏好优化,提升图表理解的反事实敏感性,实验表明其在少数据下表现优异。
Comments Accepted to ACL 2026 Main Conference
DataSway: 通过动画片段生成与协调使隐喻可视化生动化
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 本文提出DataSway系统,通过动画片段生成与协调技术,帮助用户创建基于SVG的隐喻可视化动画,提升数据抽象编码的理解与交互体验。
Comments Accepted to DIS'26: ACM Designing Interactive Systems. Website: https://shellywhen.github.io/projects/DataSway
对齐文档与问题:面向问题的文档重写以增强检索增强生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 文档图表理解 :grounding(abstract)
AI总结 本文提出QREAM框架,通过风格控制重写使检索文档更符合问题需求,提升检索增强生成的准确性与效率。
Comments ACL'26 Findings
从相关性到权威性:面向网页搜索引擎的权威感知生成检索
机构 * Sungkyunkwan University(成均馆大学) ; Naver Corporation(Naver公司)
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 本文提出权威感知生成检索框架AuthGR,通过多模态权威评分、三阶段训练和混合集成流程提升检索的权威性和准确性,在实际应用中显著提高用户参与度和可靠性。
Comments ACL 2026 (Industry Track)
引导查询细化:多模态混合检索与测试时优化
机构 * Stanford University(斯坦福大学) ; IBM Research(IBM研究院) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学)
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 本文提出引导查询细化方法,通过测试时优化提升多模态检索性能,使视觉中心模型在效率和性能上达到更优平衡。
Comments ICLR 2026
Nemotron ColEmbed V2:视觉文档检索中表现优异的后期交互嵌入模型
专题命中 文档图表理解 :VLM(abstract)
AI总结 本文提出Nemotron ColEmbed V2模型,通过集群采样、硬负样本挖掘等技术,在ViDoRe基准上实现最佳性能,展示了低维嵌入在准确率与存储间的平衡实验。
Comments Proceedings of the 1st Late Interaction Workshop (LIR) @ ECIR 2026, April 02, 2026
RealChart2Code:通过真实数据和多任务评估推进图表到代码生成
机构 * USTC(中国科学技术大学) ; THU(清华大学) ; CUHK(香港中文大学) ; UCAS(中国科学院大学) ; CASIA(中国科学院自动化研究所) ; BNU(北京师范大学) ; BUPT(北京邮电大学) ; BIT(北京理工大学) ; PKU(北京大学)
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。
GRPO能否提升复杂多模态表格理解?
机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) ; Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) ; Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; University of Southern California(南加州大学) ; Duke Kunshan University(杜克大学昆山分校)
专题命中 文档图表理解 :LLaVA(abstract)
AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。
Comments EMNLP 2025
Journal ref EMNLP 2025
快速而忠实:长文档检索增强生成系统中的实时验证
机构 * MBZUAI, McGill University(MBZUAI,麦吉尔大学)
专题命中 文档图表理解 :grounding(abstract)
AI总结 本文提出一种实时验证组件,用于长文档检索增强生成系统,通过平衡响应时间和验证覆盖度,提升对长文档的忠实性验证。
(解)构工艺:一种用于在工艺流程中分享专业知识的初级语法
专题命中 文档图表理解 :MLLM(abstract)
AI总结 本文提出一种初级语法,用于记录工艺实践中的即兴行动,通过CraftLink界面分析视频并生成文档,促进知识共享与协作档案建设。
Comments 31 pages, 7 figures
HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 文档图表理解 :MLLM(abstract)
AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。
TraceBack: 多智能体分解用于细粒度表格归因
机构 * Arizona State University(亚利桑那州立大学) ; Adobe Research(Adobe研究院)
专题命中 文档图表理解 :grounding(abstract)
AI总结 TraceBack通过多智能体框架实现细粒度表格归因,提供可验证的单元格支持证据,提升问题回答的透明度和可解释性。
MLDocRAG: 多模态长上下文文档检索增强生成
机构 * Independent Researcher(独立研究者)
专题命中 文档图表理解 :grounding(abstract)
AI总结 MLDocRAG通过构建多模态片段-查询图,实现多模态长上下文文档的检索增强生成,提升问答的准确性和连贯性。
Comments 15 pages
具有视觉-语言先验和3D声学环境建模的物理感知新视角声音合成
机构 * Group of Intelligent Signal Processing(智能信号处理组) ; Harbin Engineering University(哈尔滨工程大学) ; School of Intelligence Science and Technology(智能科学与技术学院) ; Nanjing University(南京大学) ; Processing Speech and Images(语音与图像处理) ; KU Leuven(库尔勒文大学) ; Acoustics Lab(声学实验室) ; University of Technology Sydney(悉尼技术大学) ; State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) ; Centre for Vision Speech and Signal Processing(视觉语音与信号处理中心) ; University of Surrey(萨里大学)
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 Phys-NVAS通过整合视觉-语言语义先验与3D声学环境建模,实现了具有物理感知的新视角声音合成,提升了声音的真实感和物理一致性。
Comments ICASSP 2026 Accept, Project page: https://physnvas.github.io/
混合RAG:利用大语言模型整合文本和表格
专题命中 文档图表理解 :grounding(abstract)
AI总结 MixRAG通过三阶段框架整合文本和表格,提升异构文档检索性能,实现混合模态文档接地的最新成果。
Comments Accepted to SIGKDD 2026
ThaiOCRBench: 一种任务多样化的泰语视觉-语言理解基准
机构 * SCB 10X R&D(SCB 10X研发部) ; SCB 10X ; SCBX Group(SCBX集团)
专题命中 文档图表理解 :vision-language model(abstract)
AI总结 ThaiOCRBench是一个针对泰语视觉-语言理解任务的多样化基准,通过人工标注的数据集评估了多种VLMs,揭示了专有模型在性能上的优势及开源模型在细粒度文本识别中的挑战。
Comments Accepted at IJCNLP-AACL 2025 (Main). This version includes the corrected Table 2 and an updated conclusion regarding the deletion count of the Gemma model