arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2502.14949 2025-06-30 cs.CV cs.AI cs.CL cs.HC cs.LG 67%

KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding

Ahmed Heakl, Abdullah Sohail, Mukul Ranjan, Rania Hossam, Ghazi Shazan Ahmad, Mohamed El-Geish, Omar Maher, Zhiqiang Shen, Fahad Khan, Salman Khan

机构 * MBZUAI(马尔瓦大学人工智能研究所) Monta AI(蒙塔人工智能) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 17 pages, 5 figures, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21839 2025-03-31 cs.CV cs.AI cs.LG 67%

M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image-Text in Document Summarization?

Haolong Yan, Kaijun Tan, Yeqing Shen, Xin Huang, Zheng Ge, Xiangyu Zhang, Si Li, Daxin Jiang

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05935 2025-03-24 cs.CV cs.AI cs.CL cs.LG 67%

SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models

Dongyang Liu, Renrui Zhang, Longtian Qiu, Siyuan Huang, Weifeng Lin, Shitian Zhao, Shijie Geng, Ziyi Lin, Peng Jin, Kaipeng Zhang, Wenqi Shao, Chao Xu, Conghui He, Junjun He, Hao Shao, Pan Lu, Hongsheng Li, Yu Qiao, Peng Gao

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ICML 2024. Code and models are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08226 2025-03-13 cs.CV cs.AI cs.LG 67%

DistilDoc: Knowledge Distillation for Visually-Rich Document Applications

Jordy Van Landeghem, Subhajit Maity, Ayan Banerjee, Matthew Blaschko, Marie-Francine Moens, Josep Lladós, Sanket Biswas

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to ICDAR 2024 (Athens, Greece)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16902 2025-01-29 cs.IR 67%

Document Screenshot Retrievers are Vulnerable to Pixel Poisoning Attacks

Shengyao Zhuang, Ekaterina Khramtsova, Xueguang Ma, Bevan Koopman, Jimmy Lin, Guido Zuccon

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05493 2024-12-12 cs.RO 67%

DexDiff: Towards Extrinsic Dexterity Manipulation of Ungraspable Objects in Unrestricted Environments

Chengzhong Ma, Houxue Yang, Hanbo Zhang, Zeyang Liu, Chao Zhao, Jian Tang, Xuguang Lan, Nanning Zheng

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13883 2024-10-21 cs.CV cs.AI cs.HC cs.LG 67%

Transformers Utilization in Chart Understanding: A Review of Recent Advances & Future Trends

Mirna Al-Shetairy, Hanan Hindy, Dina Khattab, Mostafa M. Aref

专题命中 文档图表理解 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12596 2024-03-20 cs.CL 67%

Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs

Victor Carbune, Hassan Mansoor, Fangyu Liu, Rahul Aralikatte, Gilles Baechler, Jindong Chen, Abhanshu Sharma

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

Comments Findings of NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07636 2026-08-11 cs.CR cs.AI cs.CV 新提交 62%

Adversarial Attacks on Deep OCR Systems

针对深度OCR系统的对抗攻击

Wenbo Sun, Hongzong LI, Yanyun Wang, Jiahao MA, Shuxin Zhuang, Rong Feng, Shiqin Tang, Zi Liang

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出首个针对生成式OCR视觉语言模型的纯黑盒对抗攻击,将其转化为零阶优化问题,在Deep-OCR上验证了攻击有效性并揭示解码器故障,还表明可控有目标改写更难实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15532 2026-08-11 cs.LG cs.AI cs.CL 版本更新 62%

DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

DeltaPrompts: 逃离多模态蒸馏中的零delta陷阱

Jaehun Jung, Hyunwoo Kim, Brandon Cui, Ximing Lu, David Acuna, Prithviraj Ammanabrolu, Yejin Choi

机构 * NVIDIA Research(NVIDIA研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DeltaPrompts,通过量化教师与学生之间的答案分歧(Δ)来生成高分歧的推理问题,从而解决传统蒸馏中因零delta提示导致的学习信号不足问题,实验表明DeltaPrompts在多个场景下显著提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05098 2026-08-11 cs.CV cs.AI 版本更新 62%

Beyond Pixels: Benchmarking and Reward-Based Assessing Framework for Visual Spatial Aesthetics

SA-IQA: 重新定义空间美学的图像质量评估:多维奖励

Yuan Gao, Jin Song, Yiyun Fei, Gongzhe Li, Ruigao Yang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SA-IQA通过多维奖励框架系统评估室内场景的美学质量,利用SA-BENCH基准提升AIGC生成流程和图像质量。

Comments Accepted to CVPRW 2026. Code: https://github.com/AlibabaResearch/SA-IQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05478 2026-08-07 cs.GR cs.CL cs.CV cs.HC cs.LG cs.MM 新提交 62%

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

GenGA:面向学术论文的可编辑且基于数据的图形摘要生成

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 62%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04832 2026-08-06 cs.CV cs.GR cs.LG 版本更新 62%

BIM-Native Tokenization for Constraint-Aware Room Layout Synthesis

基于标记的建筑:一种用于布局合成的Transformer

Manuel Ladron de Guevara, Jinmo Rhee, Ardavan Bidgoli, Vaidas Razgaitis, Michael Bergin

机构 * Higharc University of Calgary(卡尔加里大学)

专题命中 文档图表理解 :VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出SBM模型,通过统一建筑元素的异质特征集生成布局合成的Transformer架构,实现高保真房间嵌入和功能布局生成。

Comments 7 pages, 2 page References, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24745 2026-07-29 cs.IR cs.AI cs.CL cs.CV 新提交 62%

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

DocAnnot——利用生成式人工智能驱动的自动注释加速关键信息提取数据集的创建

Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对关键信息提取中训练数据集创建耗时的问题,提出DocAnnot框架,利用大型视觉语言模型、OCR及SICM算法,在基准测试中自动生成注释有一定F1分数,还能用于微调下游模型,大幅节省时间成本,减少人工依赖但未完全消除人工干预。

Comments 15 pages, 2 figures

Journal ref Proc. ICDAR 2025, Lecture Notes in Computer Science, vol 16025, Part III, pp. 563-576

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 62%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18997 2026-07-22 cs.CV cs.CE cs.LG 新提交 62%

Benchmarking Deep Learning Approaches for AEC Engineering Drawing Layout Detection and Information Extraction

用于AEC工程图纸布局检测和信息提取的深度学习方法基准测试

Tianyang Huang, Alessio Lombardi, Ahmed Elnagar, Ahmed Zalouk, George Paul, Sepehr Najjarpour, Arvid Sigurdsson, Khalid Ismail, Mohamed Ragab, Edlira Vakaj

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究针对AEC图纸信息提取难题,构建特定数据集,对五种深度学习架构进行基准测试,RF-DETR和Qwen3-VL表现出色,而通用预训练模型有域干扰,为AEC自动化信息提取奠定技术基础。

Comments 2026 European Conference of Computing in Construction (EC3 2026), 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10400 2026-07-14 cs.CV cs.AI 新提交 62%

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

SynthDocBench:用于长上下文视觉文档理解的可控基准测试

Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar Davasam, Vikas Yadav, Sai Rajeswar Mudumba

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉语言模型在现实文档理解中归因失败原因困难的问题,引入SynthDocBench基准测试,通过组合设计控制多因素,端到端生成多样长文档,评估模型发现三种现有基准未暴露的失败模式,揭示模型或过度拟合基准工件。

Comments 29 Pages, 27 Tables, 13 Figures, Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13376 2026-07-10 cs.CV cs.AI cs.CL 版本更新 62%

An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

用于流程图图像到代码生成的在线无参考评估框架

Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO Singapore(AUMOVIO新加坡) VinUniversity(文理大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对流程图图像到代码生成在生产中无真实代码难以评估输出质量的问题,提出无参考评估框架,通过RecallOCR和PrecisionVE两个指标及调和均值F1OCR-VE监测生成质量,在FlowVQA数据集验证了其可靠性。

Comments This manuscript was inadvertently made publicly available before all necessary internal review processes had been completed. The authors are withdrawing the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05614 2026-07-08 cs.CL cs.AI cs.CV 新提交 62%

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

BaFCo:用于复杂孟加拉语表格理解的文档理解基准

Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) Center for Computational & Data Sciences(计算与数据科学中心) University of Dhaka(达卡大学) Amazon GenAI(亚马逊生成式人工智能)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对孟加拉语表格理解因高质量标注数据稀缺受限的问题,引入BaFCo基准数据集,涵盖多领域复杂表格。定义细粒度标注模式,评估多种MLLMs,发现其理解孟加拉语表格有局限,尤其在定位细粒度实体方面。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19662 2026-06-09 cs.AI cs.CV 版本更新 62%

FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks

FieldWorkArena:面向真实作业任务的代理AI基准测试

Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang

机构 * Fujitsu Limited(富士通株式会社) Fujitsu Research of America(富士通美国研究部) Carnegie Mellon University(卡内基梅隆大学) Master’s Student, The University of Tokyo(东京大学硕士研究生) Agent Research Collective(代理研究集体)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。

Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07289 2026-06-08 cs.LG cs.CV 新提交 62%

Closed-Form Spectral Regularization for Multi-Task Model Merging

多任务模型融合的闭式谱正则化

Yongxian Wei, Runxi Cheng, Xingxuan Zhang, Li Shen, Chun Yuan, Peng Cui, Dacheng Tao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对多任务模型融合中的干扰最小化问题,发现迭代求解器实际充当隐式谱正则化器,据此提出基于谱滤波的闭式方法SWUDI及其自适应变体SWUDI-A,显著提升效率并匹配或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02569 2026-06-02 cs.CV cs.AI cs.CL 62%

AdaCodec: A Predictive Visual Code for Video MLLMs

AdaCodec: 面向视频多模态大语言模型的预测性视觉编码

Haowen Hou, Zhen Huang, Zheming Liang, Qingyi Si, Chenglin Li, Shuai Dong, Kele Shao, Ruilin Li, Dianyi Wang, Nan Duan, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) JD.com(京东公司)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对视频帧间冗余问题,提出预测性视觉编码AdaCodec,通过条件预测代价决定是否发送完整参考帧或紧凑P-令牌,在匹配视觉令牌预算下提升性能,并大幅降低首令牌延迟。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01284 2026-05-26 cs.CV cs.AI cs.CL cs.IR 62%

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

证据链:面向迭代检索增强生成的像素级视觉归因

Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家级工程研究中心,北京大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Tencent Technology(腾讯科技)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出Chain of Evidence (CoE)框架,利用视觉语言模型直接对检索到的文档截图进行推理,输出精确边界框以可视化完整推理链,解决迭代检索增强生成中的粗粒度归因和视觉语义丢失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00392 2026-05-22 cs.CV cs.LG 62%

RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference

RTPrune: 两次阅读启发的令牌修剪用于高效DeepSeek-OCR推理

Ben Wan, Yan Feng, Zihan Tang, Weizhe Huang, Yuting Zeng, Jia Wang, Tongxuan Liu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出RTPrune,一种针对DeepSeek-OCR的两次阶段令牌修剪方法,通过优先保留高范数视觉令牌并利用最优传输理论进行令牌配对和合并,从而在OCR任务中实现更高效的推理性能和更优的效率-精度权衡。

Comments 21 pages, accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13224 2026-05-12 cs.CV cs.AI 62%

Visual-ERM: Reward Modeling for Visual Equivalence

视觉-ERM:用于视觉等价性的奖励建模

Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) CUHK(香港中文大学)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉-ERM模型,通过细粒度的视觉反馈提升视觉到代码任务的奖励学习效果,实验显示其在图表到代码、表格和SVG解析任务中均取得显著提升。

Comments Project: https://github.com/InternLM/Visual-ERM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08220 2026-05-12 cs.AI cs.CE cs.CL cs.CV cs.SE 62%

Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction

空间提示优于语义提示:一种基于网格的方法以提高LLM在图表数据提取上的准确性

Andrei Lazarev, Dmitrii Sedov, Alexander Galkin

机构 * Russian Federation(俄罗斯联邦)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过对比空间提示与语义提示,发现基于网格的提示方法能显著降低图表数据提取误差,优于传统语义引导策略。

Comments his is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302248

Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 799-804

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03476 2026-04-22 cs.CV cs.AI q-bio.BM 62%

Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition

为分子结构识别微调DeepSeek-OCR-2

Haocheng Tang, Xingyu Dang, Junmei Wang

机构 * Department of Computer Science, Princeton University, Princeton, NJ, USA(普林斯顿大学计算机科学系) School of Pharmacy, University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学药学院) Khoury College of Computer Science, Northeastern University, Boston, MA, USA(东北大学Khoury计算机科学学院) Computational Chemical Genomics Screening Center, University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学计算化学基因组筛选中心)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过图像条件生成SMILES的方法微调DeepSeek-OCR-2,采用分阶段监督微调策略提升稳定性,训练数据结合合成图像和专利图像,模型在精确匹配上表现良好但不如图结构模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14198 2026-04-17 cs.LG cs.AI cs.CL 62%

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法

Bingbing Wen, Sirajul Salekin, Feiyang Kang, Bill Howe, Lucy Lu Wang, Javier Movellan, Manjot Bilkhu

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04411 2026-04-07 cs.CL cs.AI cs.CV 62%

Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding

响应未能揭示理解:揭示视觉文档理解中内部表征与响应之间的差距

Haruka Kawasaki, Ryota Tanaka, Kyosuke Nishida

机构 * Human Informatics Labs., NTT, Inc.(日本电信电话株式会社人类信息学实验室)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉文档理解中内部表征与生成响应之间的差距,发现任务所需信息在中间层更线性编码,并通过微调中间层提升性能。

Comments Accepted to CVPR2026 workshop (MULA)

详情

展开后加载摘要…

URL PDF HTML 收藏