arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-09 至 2026-07-09 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2508.10956 2026-07-09 cs.CV cs.AI 版本更新 87%

A Study of Commonsense Reasoning over Visual Object Properties

关于视觉对象属性的常识推理研究

Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang, Floris den Hengst, Filip Ilievski

机构 * Department of Computer Science, Vrije Universiteit(自由大学计算机科学系) Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 研究针对视觉对象属性的常识推理,引入含特定图像类型、推理层次和属性维度的评估框架,在两个VQA基准中实验,发现现有VLM存在显著局限,虽新模型有进步但仍与人类有差距,还提供了相关数据和代码以助未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07179 2026-07-09 cs.CV cs.LG 新提交 84%

Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering

用于通用文档视觉问答的领域适应视觉语言模型的比较研究

Miguel Lopez-Duran, Elena Marrero, Julian Fierrez, Marta Robledo-Moreno, Ruben Vera-Rodriguez, Daniel DeAlcala, Aythami Morales, Ruben Tolosana, Oscar Delgado, Alvaro Ortigosa, Javier Ortega-Garcia

机构 * Universidad Autónoma de Madrid (UAM)(马德里自治大学) BiometricsAI(生物识别人工智能)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究对8个开源预训练VLMs在三种文档领域的DocVQA进行全面评估,通过多种评估方式发现其在不同布局性能有差异,参数缩放影响性能,视觉理解是瓶颈,还表明少样本微调能让模型快速适应目标域文档。

Comments 17 pages, 4 figures, accepted at the Automatically Domain-Adapted and Personalized Document Analysis workshop of the ICDAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07288 2026-07-09 cs.CV 新提交 83%

InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models

InfraQR:对红外视觉语言模型的边缘放置的受QR码启发的结构化补丁攻击

Xin Li, Jiaju Han, Ma Yaqi, Chengyin Hu, Yingying Zhao, Jiahuan Long, Fengyu Zhang, Yahui Chai

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Guizhou University(贵州大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 研究红外视觉语言模型对局部结构化扰动的鲁棒性,提出InfraQR攻击方法,沿图像边界放置结构化补丁并通过替代编码器优化网格单元,实验表明该方法能大幅降低分类器准确率,使对抗图像影响黑盒模型,凸显模型易受此类扰动影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 79%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06641 2026-07-09 cs.CL cs.AI cs.LG 新提交 62%

Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering

更健康的语言模型:用于公共卫生问答的检索增强生成

Felix Feldman, Joshua Harris, Timothy Laurence, Leo Loman, Ollie Higgins, Fan Grayson, Poonam Soma, Bethany Pace-Bonello, Michael Borowitz, Toby Nonnenmacher

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大型语言模型在公共卫生问答受幻觉等限制的问题,采用检索增强生成方法,通过扩展基准并系统评估检索与生成选择,比较多种检索方式,引入评判方法,突出检索对可靠公共卫生问答的作用并提供实用指导。

Comments 19 Pages, 14 Main Text Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07383 2026-07-09 cs.CV 新提交 57%

MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG

MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) PeopleAI Inc.(人智公司) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07320 2026-07-09 cs.CV 新提交 57%

SoccerNet 2026 Challenges Results

SoccerNet 2026挑战结果

Anthony Cioppa, Silvio Giancola, Håkan Ardö, Mohamad Dalal, Jan Held, Jérémie Ochin, Jiayuan Rao, Karen Sanchez, Renaud Vandeghen, Artur Xarles, Olivier Barnich, Albert Clapés, Mathieu Delvaux, Sergio Escalera, Bernard Ghanem, Cédric Hons, Antoine Houet, Sotiris Manitsaris, Tom Michel, Pierre Miralles, Thomas B. Moeslund, Mikael Nilsson, Bogdan Stanciulescu, Marc Van Droogenbroeck, Yanfeng Wang, Weidi Xie, Faisal Altawijri, Mohamed Atef, Semen Budennyy, Vasiliy Chelpanov, Puhua Chen, Yixin Chen, Lechao Cheng, Jianling Chu, Ju-Seong Do, Oleg Durygin, Omar Fetouh, Mirco Fuchs, Youssef Ghallab, Falguni Ghosh, Wonjun Heo, Yufeng Hu, Weixuan Huang, Phuong-Linh Huynh-Ha, Matvey Isupov, Yangguang Ji, Siyuan Jiang, Zhenxiang Jiang, Wonyong Jo, Ho-Young Jung, SeongHeon Kang, MinJae Kim, Youngseon Kim, Jakub Komosa, Artem Konshin, Trung-Hoang Le, Jongmin Lee, Lingling Li, Litao Li, Vadim Linkov, Fang Liu, Haoxuan Ma, Shun Makino, Ismail Mathkour, Konstantin Mitin, Mikhail Moiseev, Takumi Nagaya, Yuki Nakamura, Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Trong-Thuan Nguyen, Christian Orduz, Kwanyong Park, Fabian Perez, Parthsarthi Rawat, SuHyun Rim, Hoover Rueda-Chacón, Atom Scott, Minori Sugimura, Yuyang Sun, Shengeng Tang, Minh-Triet Tran, Ikuma Uchida, Juan Vanegas, Thanh-Nhan Vo, Jiangtao Wang, Yaxiong Wang, Xiaogang Wang, Ruifeng Wang, Rio Watanabe, Jiali Wen, Yongliang Wu, Di Yang, Xu Yang, Zhuo Yang, Xinyu Ye, Yibo Yu, Zihan Zhai, Yu Zhang, Zhenyu Zhao, Zhun Zhong, Yixi Zhou, Xingyu Zhu, Wenbo Zhu, Julian Ziegler

机构 * University of Liège(列日大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Spiideo(斯皮迪奥公司) Aalborg University(奥尔堡大学) SpAItial(斯帕蒂亚尔公司) Center for Robotics, Mines Paris, PSL(巴黎矿业学院机器人中心(巴黎文理研究大学)) Footovision(Footovision公司) Shanghai Jiao Tong University(上海交通大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) EVS Broadcast Equipment(EVS广播设备公司) Pioneer Center for Artificial Intelligence(先锋人工智能中心) Lund University(隆德大学) TAHAKOM(TAHAKOM公司) Mohamed Bin Zayed University for Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Sber AI(Sber人工智能公司) Salute For Business(Salute For Business公司) Intelligent Perception and Image Understanding Lab, Xidian University(西安电子科技大学智能感知与图像理解实验室) South China University of Technology(华南理工大学) Hefei University of Technology(合肥工业大学) Kyungpook National University(庆北国立大学) Leipzig University of Applied Sciences(莱比锡应用科学大学) Friedrich-Alexander University Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) University of Seoul(首尔大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Nanjing University(南京大学) University of Science, Ho Chi Minh City(胡志明市科技大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 SoccerNet 2026挑战涵盖五项体育视频理解视觉任务,为每项任务提供数据、协议和基线。众多团队参与,本文介绍任务、评估协议,展示排行榜并总结领先提交内容,记录各任务当前状态。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07380 2026-07-09 cs.IR 新提交 50%

Interpretable Uncertainty for Adaptive Retrieval and Reasoning in Question Answering

问答中自适应检索与推理的可解释不确定性

Ritajit Dey, Iadh Ounis, Graham McDonald

专题命中 视觉问答 :grounding(abstract)

AI总结 研究针对问答中大型语言模型的问题,提出基于LLM内部表示显式信号的不确定性感知框架,区分知识不足与模糊冲突,能在单次前向传播中估计,指导系统行为,为检索和推理策略提供透明实用替代方案。

Comments 2 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏