arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-25 至 2026-06-25 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2512.04554 2026-06-25 cs.CV 版本更新 79%

Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering

伪造答案:针对无OCR文档视觉问答的对抗性伪造

Marco Pintore, Maura Pintor, Dimosthenis Karatzas, Battista Biggio

机构 * University of Cagliari, Italy(卡利亚里大学) Computer Vision Center, UAB, Spain(UAB计算机视觉中心)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 提出一种视觉上不可察觉但语义上定向的对抗攻击方法,通过伪造文档内容诱导DocVQA模型产生错误答案,在Pix2Struct和Donut模型上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25645 2026-06-25 eess.IV cs.CV cs.HC 版本更新 77%

Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

Colon-Bench:一种用于全流程结肠镜视频中可扩展密集病变标注的智能工作流

Abdullah Hamdi, Changchun Yang, Xin Gao

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科学与技术大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出Colon-Bench,通过多阶段智能工作流实现全流程结肠镜视频的密集病变标注,包含528个视频、14类病变、30万+边界框等,并评估多模态大模型在病变分类、开放词汇视频目标分割和视频视觉问答上的性能。

Comments published at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2602.06566 2026-06-25 cs.CV cs.AI cs.CL 版本更新 87%

SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

SPARC: 分离感知与推理回路以实现VLM的测试时扩展

Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigotti

机构 * ETH Zürich(苏黎世联邦理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 视觉推理 :VLM(title_cn,abstract_cn);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 提出SPARC框架,通过显式分离视觉感知与推理,实现测试时动态扩展和不对称计算分配,在视觉推理任务中优于基线方法。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 87%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 视觉推理 :VLM(title_cn);vision-language model(abstract);vision language model(abstract);visual reasoning(abstract)

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07904 2026-06-25 cs.LG cs.CV cs.NE 版本更新 62%

Kuramoto Oscillatory Phase Encoding: Neuro-inspired Synchronization for Improved Learning Efficiency

Kuramoto振荡相位编码:神经启发同步机制提升学习效率

Mingqing Xiao, Yansen Wang, Dongqi Han, Caihua Shan, Dongsheng Li

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 提出Kuramoto振荡相位编码(KoPE),为视觉Transformer引入神经启发同步机制,通过增强结构学习提升训练、参数和数据效率,并在语义分割、少样本推理等任务中取得优势。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16518 2026-06-25 cs.CV cs.CL cs.LG 版本更新 62%

SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning

SyncLoop: 一种用于自我改进数学推理的多模态双循环框架

Xiuwei Chen, Wentao Hu, Hanhui Li, Yongxin Wang Jun Zhou, Zisheng Chen, Meng Cao, Yihan Zeng, Kui Zhang, Yu-Jie Yuan, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) MBZUAI Huawei Noah’s Ark Lab(华为诺亚实验室) Yinwang Intelligent Technology Co. Ltd(依文智科有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 提出SyncLoop多模态双循环框架,通过跨模态数据演化循环和数据-模型演化循环联合进化训练数据和模型能力,解决数据复杂度不匹配和演化分离问题,在数学推理基准上持续提升性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16863 2026-06-25 cs.CV cs.AI cs.CL 版本更新 62%

Position: Reasoning After Perception Means Reasoning Without Vision

立场:感知之后推理意味着无视觉推理

Hongcheng Gao, Zihao Huang, Jingyi Tang, Lin Xu, Xinhao Li, Haoyang Li, Yue Liu, Minhua Lin, Xinlong Yang, Taihang Hu, Ge Wu, Balong Bi, Hongyu Chen, Olive Huang, Wentao Zhang

机构 * Tsinghua University(清华大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Nankai University(南开大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文质疑多模态研究中语言推理能弥补视觉缺陷的假设,提出“感知-推理”范式导致视觉推理退化为文本空间推理,并通过图灵眼测试验证文本推理无法修复感知失败,主张转向感知内的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 1 篇

2512.01085 2026-06-25 cs.CV cs.CL 版本更新 79%

Generalised Medical Phrase Grounding

通用医学短语定位

Wenjun Zhang, Shekhar S. Chandra, Aaron Nicolson

机构 * The University of Queensland(昆士兰大学) Australian e-Health Research Centre, CSIRO Health and Biosecurity(澳大利亚电子健康研究中心,CSIRO健康与生物安全)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对现有医学短语定位方法无法处理多区域、非诊断性及不可定位短语的问题,提出通用医学短语定位任务及MedGrounder模型,采用两阶段训练策略,在零样本迁移和多区域/不可定位短语上优于基线方法。

Comments Accepted by IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2512.17796 2026-06-25 cs.CV cs.AI 版本更新 62%

CustomX: Unified Character, Action, and Scene Customization in Video World Models

CustomX: 视频世界模型中的统一角色、动作与场景定制

Yitong Wang, Fangyun Wei, Hongyang Zhang, Bo Dai, Yan Lu

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) The University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出CustomX,结合静态世界生成与可控实体模型,支持用户指定角色在3D场景中执行开放动作,通过条件自回归视频生成保持视觉保真度。

Comments Accepted to ECCV 2026. Project page: https://snowflakewang.github.io/CustomX_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 6 篇

2405.17423 2026-06-25 cs.CV cs.CL 版本更新 83%

Privacy-Aware Visual Language Models

隐私感知的视觉语言模型

Laurens Samson, Nimrod Barazani, Sennay Ghebreab, Yuki M. Asano

机构 * Socially-Intelligent Artificial Systems Group, University of Amsterdam(智能社会人工智能系统组,阿姆斯特丹大学) University of Amsterdam(阿姆斯特丹大学) Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学)

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对视觉语言模型隐私理解不足的问题,构建高质量基准数据集PrivBench和指令微调数据集PrivTune,通过少量样本微调显著提升隐私敏感性,性能超越GPT-4。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14609 2026-06-25 cs.CV 版本更新 81%

GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

GroundSet: 基于地籍数据的空间理解向量数据集

Roger Ferrod, Maël Lecene, Krishna Sapkota, George Leifman, Vered Silverman, Genady Beryozkin, Sylvain Lobry

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大模型在遥感精细空间理解上的不足,提出基于地籍矢量数据的大规模数据集,含510k高分辨率图像和380万标注对象,通过指令微调基准验证,标准架构可掌握细粒度空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新 78%

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract)

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25661 2026-06-25 cs.CV 版本更新 70%

DRM: Diffusion-based Reward Model With Step-wise Guidance

DRM: 基于扩散的奖励模型与逐步引导

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09698 2026-06-25 cs.IR cs.AI 版本更新 70%

Evaluating Scene-based In-Situ Item Labeling for Immersive Conversational Recommendation

评估基于场景的原位物品标签用于沉浸式对话推荐

Jiazhou Liang, Yifan Simon Liu, David Guo, Minqi Sun, Yilun Jiang, Scott Sanner

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Vector Institute of Artificial Intelligence(向量人工智能研究所)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对沉浸式对话推荐系统,提出基于显式意图满足和主动信息需求的原位标签分类与评估指标,基准测试显示现有方法在利用场景信息、避免冗余和预测主动需求方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09170 2026-06-25 cs.RO cs.AI 版本更新 57%

ZeroWBC: Learning Natural Whole-Body Humanoid Interaction from Human Egocentric Data

ZeroWBC: 从人类自我中心数据学习自然全身人形交互

Haoran Yang, Jiacheng Bao, Yucheng Xin, Haoming Song, Yuyang Tian, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) TeleAI, China Telecom(TeleAI,中国电信)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 提出ZeroWBC框架,利用人类自我中心视频和同步全身运动数据,通过生成-跟踪方法实现无遥操作的人形机器人全身交互控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 2 篇

2511.11421 2026-06-25 cs.CV cs.LG 版本更新 62%

BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning

BOFA: 基于CLIP的类增量学习中的桥接层正交低秩融合

Lan Li, Tao Hu, Da-Wei Zhou, Jia-Qi Yang, Han-Jia Ye, De-Chuan Zhan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出BOFA框架,通过将适应限制在CLIP的跨模态桥接层并使用正交低秩融合防止遗忘,无需额外参数或数据回放,实现高效类增量学习。

Comments Accepted by AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(27): 22967-22975, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13731 2026-06-25 cs.CV 版本更新 57%

GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization

GeoRanker:面向全球图像地理定位的距离感知排序

Pengyue Jia, Seongheon Park, Song Gao, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Geography, University of Wisconsin-Madison(威斯康星大学麦迪逊分校地理系)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出GeoRanker框架,利用大视觉语言模型联合编码查询-候选交互并预测地理邻近性,引入多阶距离损失以建模结构化空间关系,在IM2GPS3K和YFCC4K基准上达到最优。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏