arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-01 至 2026-06-01 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2605.30698 2026-06-01 cs.CV cs.AI cs.MA 85%

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

先见后议:用视觉证据对齐多智能体共识

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Shandong University(山东大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31354 2026-06-01 cs.AI cs.LG 73%

Diagnosing Failure Modes of Shared-State Collaboration in Resource-Constrained Visual Agents

资源受限视觉代理中共享状态协作的故障模式诊断

Yunpeng Zhou

机构 * Nanjing University of Information Science \& Technology, Nanjing, China

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 本文通过噪声累积视角研究弱学习者(4B-8B模型)在共享工作记忆下的协作推理故障模式,提出CoSee审计框架追踪文档视觉问答中的信息流,发现朴素共享工作空间会放大幻觉而非解决,并识别出噪声强化和策略崩溃两种主要故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31075 2026-06-01 cs.CV 70%

Task-Focused Memorization for Multimodal Agents

面向多模态智能体的任务聚焦记忆

Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li

机构 * Fudan University(复旦大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出基于强化学习的任务聚焦记忆策略学习框架TaskMem,通过两阶段训练使多模态智能体在流式观测中动态选择任务相关记忆,在三个流式基准上VQA准确率提升5.3%-7.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31069 2026-06-01 cs.CV cs.CL 57%

Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining

面向有效长视频事件预测的多级事件语义挖掘

Bo Peng, YuanJie Lyu, PengGang Qin, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 提出VISTA框架,通过多级事件语义挖掘(细节级、事件级、未来级)实现长视频事件预测,解决现有模型无法精确提取事件细节和进行细粒度分析的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07864 2026-06-01 cs.CV 57%

Thinking in Structures: Evaluating Spatial Intelligence in Constraint-Governed Spaces

在结构中思考:评估约束空间中的空间智能

Chen Yang, Guanxin Lin, Youquan He, Peiyao Chen, Guanghe Liu, Yufan Mo, Zhouyuan Xu, Linhao Wang, Guohui Zhang, Zihang Zhang, Shenxiang Zeng, Chen Wang, Jiansheng Fan

机构 * Tsinghua University(清华大学)

专题命中 视觉问答 :VLM(abstract_cn);分类 cs.CV

AI总结 提出SSI-Bench基准,通过结构约束下的空间推理任务评估视觉语言模型的空间智能,发现模型与人类存在巨大差距。

Comments ICML 2026, Project Page: https://ssi-bench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏