arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2604.27361 2026-05-01 cs.CV cs.GR 57%

CasLayout: Cascaded 3D Layout Diffusion for Indoor Scene Synthesis with Implicit Relation Modeling

CasLayout:基于级联3D布局扩散的室内场景合成与隐式关系建模

Yingrui Wu, Youkang Kong, Mingyang Zhao, Weize Quan, Dong-Ming Yan, Yang Liu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院,人工智能学院,中国科学院大学) Tsinghua University(清华大学) SKLMS, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(系统科学研究所,中国科学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

AI总结 CasLayout通过级联扩散框架将场景生成分解为四个阶段,结合物理与语义约束,提升生成效率与可控性,实现高质量室内场景合成。

Comments SIGGARPH 2026 (Journal Track), Code: https://github.com/YingruiWoo/CasLayout

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL 57%

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07038 2026-04-27 cs.CV cs.CL 57%

UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents

UNIKIE-BENCH:用于视觉文档中关键信息提取的大型多模态模型基准测试

Yifan Ji, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Qian Zhang, Zhibo Yang, Junyang Lin, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出UNIKIE-BENCH基准,用于评估大型多模态模型在视觉文档关键信息提取中的性能,揭示了不同场景下模型的性能差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21070 2026-04-24 cs.CL cs.LG 57%

DWTSumm: Discrete Wavelet Transform for Document Summarization

DWTSumm:基于离散小波变换的文档摘要

Rana Salama, Abdou Youssef, Mona Diab

机构 * School of Engineering and Applied Science, George Washington University(乔治华盛顿大学工程与应用科学学院) Faculty of Computers and Artificial Intelligence, Cairo University(开罗大学计算机与人工智能学院) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 文档图表理解 :grounding(abstract);分类 cs.LG

AI总结 本文提出一种基于离散小波变换的多分辨率框架,用于长文档摘要,通过分解文本为全局和局部成分,提升摘要的语义相似性和事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13232 2026-04-23 cs.AI cs.SE 57%

PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading

PlotChain: 多模态大语言模型在工程图表阅读中的确定性检查点评估

Mayank Ravishankara

机构 * Independent Researcher, San Francisco, CA, USA(独立研究者,美国加州旧金山)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 PlotChain提出了一种确定性的基于生成器的评估基准,用于评估多模态大语言模型在工程图表阅读中的性能,通过检查点实现子技能诊断和故障定位,展示了不同模型在图表阅读任务中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08923 2026-04-23 cs.AI 57%

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

相同内容,不同答案:多模态大语言模型中的跨模态不一致

Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

机构 * University of Amsterdam(阿姆斯特丹大学) City of Amsterdam(阿姆斯特丹市) University of Technology Nuremberg(努尔堡技术大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出REST和REST+基准测试,评估多模态大语言模型的跨模态不一致性。研究发现,即使在相同语义信息下,不同模态的推理结果也不一致,且OCR错误和视觉特征影响模型性能。

Comments Accepted at CVPR 2026. Angela van Sprang and Laurens Samson contributed equally as first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02880 2026-04-20 cs.CV 57%

InstructTable: Improving Table Structure Recognition Through Instructions

InstructTable: 通过指令提升表格结构识别

Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan

机构 * Meituan(美团) Beijing Institute of Technology(北京理工大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出InstructTable框架,通过指令引导多阶段训练提升表格结构识别,结合指令预训练和细调,构建BCDSTab基准,实现在复杂表格识别中的最优性能。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21675 2026-04-20 cs.CL cs.CV cs.GR 57%

Is this chart lying to me? Automating the detection of misleading visualizations

这张图表在欺骗我吗?自动化检测误导性可视化

Jonathan Tonglet, Jan Zimny, Tinne Tuytelaars, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系、图腾斯大学(TU Darmstadt)及应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电子工程系、鲁文大学) Department of Computer Science, KU Leuven(计算机科学系、鲁文大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究提出Misviz基准测试集和合成数据集,用于自动化检测误导性可视化,发现该任务仍极具挑战性。

Comments Camera-ready version accepted at ACL 2026 Main conference. Code and data available at: https://github.com/UKPLab/acl2026-misviz

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03621 2026-04-20 cs.CV 57%

PILOT: A Promptable Interleaved Layout-aware OCR Transformer

PILOT:一种可提示的交错布局感知OCR变压器

Laziz Hamdi, Amine Tamasna, Pascal Boisson, Thierry Paquet

机构 * univ-rouen(鲁昂大学) LITIS(LITIS研究所) Malakoff Humanis(马拉科夫人类研究所)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 PILOT提出一种统一的OCR模型,通过交错布局感知和提示条件生成,实现手写和印刷文档的文本识别与空间定位,优于传统OCR和端到端HTR模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12978 2026-04-15 cs.CL cs.CV 57%

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

GlotOCR Bench: OCR模型在超过少数Unicode脚本之外仍面临困难

Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) MCML Sorbonne Université & CNRS, ISIR(索邦大学与CNRS,ISIR)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 GlotOCR Bench评估OCR在100+Unicode脚本上的泛化能力,发现大多数模型在少于十种脚本上表现良好,最强模型也难以泛化到三十种以上脚本,表明当前OCR系统依赖语言模型预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 57%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11042 2026-04-14 cs.CV 57%

Improving Layout Representation Learning Across Inconsistently Annotated Datasets via Agentic Harmonization

通过代理和谐化提升跨不一致标注数据集的布局表示学习

Renyu Li, Vladimir Kirilenko, Yao You, Crag Wolfe

机构 * Unstructured Technologies

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出利用视觉-语言模型在异质数据源中协调类别语义和边界框粒度,提升文档布局检测的准确性与一致性。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-04-14 cs.AI 57%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16644 2026-04-14 cs.CV 57%

CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance

CountLoop:通过迭代代理指导实现无训练的高实例图像生成

Anindya Mondal, Ayan Banerjee, Sauradip Nag, Josep Llados, Xiatian Zhu, Anjan Dutta

机构 * University of Surrey(萨里大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Simon Fraser University(西蒙菲莎大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 CountLoop通过迭代反馈机制实现高密度场景下的精确实例控制,结合视觉语言模型生成布局和评估反馈,减少计数误差并提升空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01972 2026-04-09 cs.CV 57%

SDesc3D: Towards Layout-Aware 3D Indoor Scene Generation from Short Descriptions

SDesc3D:面向布局感知的短描述驱动的3D室内场景生成

Jie Feng, Jiawei Shen, Junjia Huang, Junpeng Zhang, Mingtao Feng, Weisheng Dong, Guanbin Li

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出SDesc3D框架,通过多视角结构先验和区域功能暗示实现短描述驱动的3D室内场景生成,提升物理合理性和细节丰富度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14998 2026-04-08 cs.CV 57%

FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR

FinCriticalED:一个用于金融事实级OCR的视觉基准

Yueru He, Xueqing Peng, Yupeng Cao, Yan Wang, Lingfei Qian, Haohang Li, Yi Han, Shuyao Wang, Ruoyu Xiang, Fan Zhang, Zhuohan Xie, Mingquan Lin, Prayag Tiwari, Jimin Huang, Guojun Xiong, Sophia Ananiadou

机构 * Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) University of Minnesota(明尼苏达大学) Halmstad University(哈尔姆斯塔德大学) Harvard University(哈佛大学) University of Manchester(曼彻斯特大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出FinCriticalED基准,用于评估OCR和视觉语言模型在金融关键证据上的保真度,发现数值和货币单位是最脆弱的事实类型,揭示了词汇准确性和事实可靠性之间的差距。

Comments Xueqing Peng: Corresponding-Author

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02221 2026-04-03 cs.HC cs.AI 57%

Impact of Multimodal and Conversational AI on Learning Outcomes and Experience

多模态和对话式AI对学习成果和体验的影响

Karan Taneja, Anjali Singh, Ashok K. Goel

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本研究比较了三种生物学学习方法,发现多模态对话式AI在学习成果和体验上表现最佳,但文本仅对话式AI虽易用但效果最差,揭示了认知负荷理论下的学习效果与感知之间的差异。

Comments 16 pages, 3 figures, Accepted to AIED 2026 (Seoul, South Korea)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01600 2026-04-03 cs.AI 57%

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02132 2026-04-03 cs.CL cs.CR cs.CV cs.IR 57%

One Pic is All it Takes: Poisoning Visual Document Retrieval Augmented Generation with a Single Image

一张图片足矣:通过单张图片对视觉文档检索增强生成进行污染攻击

Ezzeldin Shereen, Dan Ristea, Shae McFadden, Burak Hasircioglu, Vasilios Mavroudis, Chris Hicks

机构 * The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

AI总结 本文研究了视觉文档检索增强生成(VD-RAG)对污染攻击的脆弱性,通过单张恶意图片实现针对性和通用性攻击,展示了VD-RAG在目标和通用设置下的漏洞,但在黑盒攻击下表现出一定的鲁棒性。

Comments Published in Transactions on Machine Learning Research (03/2026)

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18242 2026-04-02 cs.CV cs.NI 57%

Vision-Language-Model-Guided Differentiable Ray Tracing for Fast and Accurate Multi-Material RF Parameter Estimation

基于视觉-语言模型的可微射线追踪:用于快速且准确的多材料射频参数估计

Zerui Kang, Yishen Lim, Zhouyou Gu, Seung-Woo Ko, Tony Q. S. Quek, Jihong Park

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 本文提出一种基于视觉-语言模型的可微射线追踪框架,通过解析场景图像推断材料类别并指导射频参数估计,实现更快的收敛速度和更低的参数误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV 57%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV 57%

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV 57%

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22458 2026-03-25 cs.CV 57%

MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding

MinerU-Diffusion:通过扩散解码重新思考文档OCR作为逆向渲染

Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Peking University(北京大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MinerU-Diffusion,通过扩散解码替代自回归解码,提升文档OCR的鲁棒性和效率,实验表明其在长序列推理中速度提升3.2倍,且在视觉OCR能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18001 2026-03-19 cs.CV 57%

EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding

EchoGen:基于循环一致性的统一布局-图像生成与理解学习

Kai Zou, Hongbo Liu, Dian Zheng, Jianxiong Gao, Zhiwei Zhao, Bin Liu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Tongji University(同济大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学) Hefei University of Technology(合肥工业大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出EchoGen框架,通过统一模型联合训练布局到图像生成和图像定位任务,提升生成图像的布局准确性与文本描述一致性,同时增强图像定位的鲁棒性。

Comments 9 pages, Accepted at the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(16), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15206 2026-03-17 cs.CL cs.CV 57%

Efficient Document Parsing via Parallel Token Prediction

通过并行标记预测实现高效的文档解析

Lei Li, Ze Zhao, Meng Li, Zhongwang Lun, Yi Yuan, Xingjing Lu, Zheng Wei, Jiang Bian, Zang Li

机构 * Platform and Content Group, Tencent(腾讯平台与内容组) Renmin University of China(中国人民大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出并行标记预测方法,通过在输入序列中插入可学习标记并设计训练目标,使VLM在文档解析中实现并行解码,提升解析速度并减少模型幻觉。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV 57%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11846 2026-03-13 cs.CV 57%

ZeroSense:How Vision matters in Long Context Compression

ZeroSense:视觉在长上下文压缩中的作用

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出ZeroSense框架,通过解耦多模态大语言模型能力,评估视觉-文本压缩质量,并通过低语义相关性基准测试验证长上下文压缩效果与下游任务准确性之间的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08274 2026-03-10 cs.CL cs.AI 57%

How Much Do LLMs Hallucinate in Document Q&A Scenarios? A 172-Billion-Token Study Across Temperatures, Context Lengths, and Hardware Platforms

在文档问答场景中,大型语言模型会有多大的幻觉?一项跨温度、上下文长度和硬件平台的1720亿token研究

JV Roig

机构 * Kamiwaza AI

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 研究通过大规模评估揭示了大型语言模型在文档问答中幻觉率与温度、上下文长度及硬件平台的关系,发现模型选择和温度设置显著影响准确性与伪造率。

Comments 18 pages, 12 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 57%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏