arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-06 至 2026-04-06 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2604.03157 2026-04-06 cs.AI 86%

Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models

Chart-RL: 通过强化学习优化策略以提升基于视觉语言模型的图表问答中的视觉推理

Yunfei Bai, Amit Dhanda, Shekhar Jain

机构 * Amazon(亚马逊)

专题命中 视觉问答 :vision language model(title,abstract);visual reasoning(title);分类 cs.AI

AI总结 本文提出Chart-RL框架,通过反馈驱动的策略优化提升视觉语言模型在复杂数据可视化中的推理能力,实现更高的准确率和更高效的推理速度。

Comments In Proceedings of the 32nd ACM-SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02570 2026-04-06 cs.CV cs.LG 86%

WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models

WSVD:用于低精度视觉-语言模型快速高效执行的加权低秩近似

Haiyu Wang, Yutong Wang, Jack Jiang, Sai Qian Zhang

机构 * Tandon School of Engineering, New York University(纽约大学坦登工程学院) Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)

AI总结 本文提出WSVD方法,通过加权低秩近似和量化技术,提升视觉-语言模型的执行效率,实现1.8倍以上的解码速度提升同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02891 2026-04-06 cs.CV 83%

Progressive Video Condensation with MLLM Agent for Long-form Video Understanding

逐步视频压缩与MLLM代理用于长视频理解

Yufei Yin, Yuchen Xing, Qianke Meng, Minghao Chen, Yan Yang, Zhou Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 视觉问答 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出ProVCA,通过逐步缩小范围从粗略片段到精细帧,利用MLLM进行高效视频理解,实现高准确率。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02710 2026-04-06 cs.RO cs.AI cs.CV 81%

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试

Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02804 2026-04-06 cs.CV cs.AI cs.MM 73%

PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis

PaveBench: 一种多功能的路面病害感知及交互视觉-语言分析基准

Dexiang Li, Zhenning Che, Haijun Zhang, Dongliang Zhou, Zhao Zhang, Yahong Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Hefei University of Technology(合肥工业大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 PaveBench针对路面状况评估中的视觉识别与多模态交互需求,提供分类、检测、分割及视觉-语言问答等四项任务,支持多轮交互与事实推理,填补现有数据集在多模态分析与实际应用连接上的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02748 2026-04-06 cs.CV 70%

Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks

面向多样化脑部MRI任务的视觉指令微调语言模型

Jonghun Kim, Sinyoung Ra, Hyunjin Park

机构 * Sungkyunkwan University(成均馆大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Artificial Intelligence(人工智能系)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。

Comments ICPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2604.03179 2026-04-06 cs.LG cs.AI cs.CV 80%

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02945 2026-04-06 cs.DC 67%

MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

MSAO:基于边缘-云协作的自适应模态稀疏性感知卸载框架用于高效多模态大语言模型推理

Zheming Yang, Qi Guo, Jun Wan, Jiarui Ruan, Yunqing Hu, Chang Zhao, Xiangyang Li

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出MSAO框架,通过边缘-云协作和模态稀疏性分析,降低多模态大语言模型推理的延迟和资源消耗,提升吞吐量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01297 2026-04-06 cs.MA 67%

SimCity: Multi-Agent Urban Development Simulation with Rich Interactions

SimCity: 基于丰富交互的多智能体城市开发模拟

Yeqi Feng, Yucheng Lu, Hongyu Su, Yixin Tao, Tianxing He

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 SimCity利用大语言模型构建可解释的宏观经济系统,通过自然语言推理实现灵活适应行为,模拟摩擦性劳动力市场、异质商品市场和金融市场,并通过视觉语言模型生成虚拟城市地图,复现宏观经济规律和城市扩张动态。

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV 57%

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02434 2026-04-06 cs.AI 57%

Compositional Neuro-Symbolic Reasoning

组合式神经符号推理

Anugyan Das, Omkar Ghugarkar, Vishvesh Bhat, Asad Aali

机构 * CoreThink AI Stanford University(斯坦福大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出一种结合神经和符号方法的推理框架,通过提取网格对象结构、利用神经先验提出变换候选方案并过滤假设,提升ARC-AGI-2任务表现,无需任务特定微调或强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00683 2026-04-06 cs.CV 57%

Video Understanding: Through A Temporal Lens

视频理解:通过时间视角

Thong Thanh Nguyen

机构 * Institute of Data Science(数据科学研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过时间视角探讨如何利用视频元素间的时间关系提升视频理解,提出自动标注框架、参数高效微调策略、状态空间层整合、新型对比学习框架及对大视觉-语言模型的全面研究,揭示了视觉-语言接口对时间推理的瓶颈。

Comments PhD Thesis, NUS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15279 2026-04-06 cs.RO cs.CV 57%

Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception

看、聚焦、理解:用于具身感知的机器人眼球

Jiashu Yang, Yifan Han, Yucheng Xie, Ning Guo, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出EyeVLA框架,通过整合视觉感知、语言理解和物理摄像头控制,实现语言引导的主动视觉感知。该框架在500个真实样本上训练,使机器人在50种不同场景中完成任务的平均完成率为96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03088 2026-04-06 cs.IR 50%

ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning

ADSeeker: 一种基于知识的推理框架用于工业异常检测与推理

Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 ADSeeker通过整合视觉文档知识库和查询图像-知识检索增强生成框架,提升工业异常检测性能,提出层次稀疏提示机制和类型级特征以提取异常模式,构建大规模AD数据集MulA,实现零样本状态下的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 13 篇

2604.02893 2026-04-06 cs.CV cs.AI cs.LG 88%

Toward an Artificial General Teacher: Procedural Geometry Data Generation and Visual Grounding with Vision-Language Models

迈向人工通用教师:基于视觉-语言模型的程序几何数据生成与视觉语义

Hai Nguyen-Truong, Alper Balbay, Tunga Bayrak

机构 * Freya

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究几何教育中的视觉解释问题,提出通过程序生成几何图示数据,结合视觉-语言模型进行领域特定微调,提升几何元素分割性能,并引入几何感知的评估指标。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13633 2026-04-06 cs.CV 83%

EGM: Efficient Visual Grounding Language Models

EGM: 高效视觉语义语言模型

Guanqi Zhan, Changye Li, Zhijian Liu, Yao Lu, Yi Wu, Song Han, Ligeng Zhu

机构 * NVIDIA(英伟达) MIT(麻省理工学院) University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出EGM,通过生成大量中等质量token来提升小模型的视觉语义能力,实验证明其在效率和性能上优于大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02860 2026-04-06 cs.CV cs.AI 81%

A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos

范式转变:面向视频中的时序句子定位的端到端训练

Allen He, Qi Liu, Kun Liu, Xinchen Liu, Wu Liu

机构 * BASIS International School Park Lane Harbour(贝赛思国际学校(公园港)) UCAS(中国科学院大学) JD Explore Academy(京东探索研究院) USTC(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种端到端训练范式,联合优化视频主干网络和定位头,通过引入Sentence Conditioned Adapter提升视觉表征,实验表明优于现有方法。

Comments Accepted as CVPR 2026 Workshop PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02502 2026-04-06 cs.CV cs.AI 81%

An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis

具有自适应PID-Tversky损失的可解释视觉-语言模型框架用于腰椎管狭窄症诊断

Md. Sajeebul Islam Sk., Md. Mehedi Hasan Shawon, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种可解释视觉-语言模型框架,通过空间补丁交叉注意模块和自适应PID-Tversky损失,提升腰椎管狭窄症诊断的准确性与解释性,实现高分割Dice分数和CIDEr评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26584 2026-04-06 cs.CV 74%

Scene Grounding In the Wild

野外场景的场景定位

Tamir Cohen, Leo Segre, Shay Shomer-Chai, Shai Avidan, Hadar Averbuch-Elor

机构 * Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 本文提出一种框架,通过将部分重建与完整的参考模型对齐,提升无视觉重叠时的大尺度场景重建一致性。方法基于伪合成渲染,利用3D高斯点云和逆特征优化,引入WikiEarth数据集验证效果。

Comments CVPR 2026. Project page at https://tau-vailab.github.io/SceneGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03040 2026-04-06 cs.CV 70%

QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection

QVAD:一种以问题为中心的代理框架,用于高效且无需训练的视频异常检测

Lokman Bekit, Hamza Karim, Nghia T Nguyen, Yasin Yilmaz

机构 * Department of Electrical Engineering, University of South Florida, Tampa, Florida, USA(南佛罗里达大学电气工程系,坦帕,佛罗里达州,美国)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 QVAD提出一种以问题为中心的代理框架,通过动态对话机制提升视频异常检测的效率和性能,无需参数更新即可实现高精度检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02593 2026-04-06 cs.CV cs.AI 62%

Moondream Segmentation: From Words to Masks

月梦分割:从词语到掩码

Ethan Reid

机构 * M87 Labs, San Francisco, CA, USA(M87实验室,美国加利福尼亚州旧金山)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 月梦分割基于Moondream 3扩展,通过自回归解码生成掩码并迭代优化,引入强化学习阶段提升分割精度,实现RefCOCO和LVIS数据集的高精度分割结果。

Comments Demo: https://moondream.ai/me/playground

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02479 2026-04-06 cs.CV cs.AI 62%

Generating Satellite Imagery Data for Wildfire Detection through Mask-Conditioned Generative AI

通过掩码条件生成式AI生成卫星图像数据用于野火检测

Valeria Martin, K. Brent Venable, Derek Morgan

机构 * Department of Intelligent Systems and Robotics, University of West Florida(西佛罗里达大学智能系统与机器人系) IHMC(人类与机器认知研究所)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了基于地球观测扩散模型EarthSynth生成野火后Sentinel-2 RGB图像的可能性,通过不同实验配置评估生成效果,发现修补生成优于全图生成,且VLM辅助修补与手工提示效果相当。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17677 2026-04-06 cs.CL cs.AI cs.LG 62%

Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models

适应性引导的检索增强掩码扩散模型

Jaemin Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ARAM框架,通过动态校准引导尺度提升检索增强扩散模型在知识密集型问答中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03127 2026-04-06 cs.CL cs.AI 57%

Domain-Adapted Retrieval for In-Context Annotation of Pedagogical Dialogue Acts

领域适应的检索用于上下文注释教学对话行为

Jinsook Lee, Kirk Vanacore, Zhuqian Zhou, Bakhtawar Ahtisham, Rene F. Kizilcec

机构 * Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种领域适应的RAG流水线,用于教学对话行为标注,通过轻量级嵌入模型在对话层面索引以提高标注精度,实验显示其在两个真实教学对话数据集上显著优于无检索基线。

Comments 20 pages, 20 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02954 2026-04-06 cs.CL cs.AI 57%

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation

逻辑毒药:图检索增强生成中的逻辑攻击

Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang

机构 * Southwestern University of Finance and Economics(西南财经大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出LogicPoison攻击框架,通过逻辑推理而非注入虚假内容,破坏图检索增强生成系统中的拓扑结构,从而降低其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23048 2026-04-06 cs.AI 57%

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

从抽象到语境:大语言模型在数学中仍无法做到的事情

Bowen Cao, Dongdong Zhang, Yixia Li, Junpeng Liu, Shijue Huang, Chufan Shi, Hongyuan Lu, Yaokang Wu, Guanhua Chen, Wai Lam, Furu Wei

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究揭示LLM在现实应用中数学推理能力不足,提出ContextMATH基准测试,发现正确问题建模是成功的关键,但建模与推理仍是限制因素。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13995 2026-04-06 cs.CL cs.AI cs.CY 57%

ELEPHANT: Measuring and understanding social sycophancy in LLMs

ELEPHANT:测量和理解LLMs中的社交阿谀

Myra Cheng, Sunny Yu, Cinoo Lee, Pranav Khadpe, Lujain Ibrahim, Dan Jurafsky

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究通过ELEPHANT基准测量LLMs中的社交阿谀行为,发现模型在保持用户形象方面比人类更极端,且在道德冲突中倾向于支持用户立场。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2601.21957 2026-04-06 cs.CV 79%

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

PaddleOCR-VL-1.5:迈向一个鲁棒的多任务0.9B视觉语言模型用于野外文档解析

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)

专题命中 文档图表理解 :VLM(title,abstract);分类 cs.CV

AI总结 PaddleOCR-VL-1.5通过引入Real5-OmniDocBench基准测试,在文档解析任务中达到94.5%的SOTA准确率,并扩展了密封识别和文本定位任务,同时保持0.9B超紧凑模型的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24326 2026-04-06 cs.CV cs.AI cs.IR 62%

Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing

通过粗到细的视觉处理提升文档解析效率和性能

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Jing Zhang, Jun Zhang, Xing Wei, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队) Xi’an Jiaotong University(西安交通大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PaddleOCR-VL模型,通过粗到细的视觉处理方法,减少冗余视觉区域,提升文档解析和识别的效率与性能,实验表明其在页面级和元素级识别上均达到最优。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 7 篇

2604.03191 2026-04-06 cs.RO cs.CV cs.LG 62%

The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling

压缩间隙:为什么离散标记化限制了视觉-语言-动作模型的扩展

Takuya Shiba

机构 * Shibattic Inc.

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文探讨了在视觉-语言-动作模型中,离散标记化导致的压缩间隙问题,指出信息瓶颈的位置决定了模型扩展效果,而非统一增加模型或数据规模。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏