arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-30 至 2026-06-30 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 22 篇

2604.09781 2026-06-30 cs.CV 91%

Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

基于闭环VLM代理的文本引导的6D物体姿态重排

Sangwon Baik, Gunhee Kim, Mingi Choi, Hanbyul Joo

机构 * Seoul National University RLWRLD(首尔大学 RLWRLD)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出通过闭环VLM代理实现文本引导的6D物体姿态重排,引入多视角推理、坐标系可视化和单轴旋转预测等技术,提升VLM在3D场景中推理目标物体姿态的能力,且在不同VLM上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-06-30 cs.CL 89%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 视觉推理 :MLLM(title_cn,abstract);multimodal large language model(title,abstract);grounding(abstract)

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30168 2026-06-30 cs.CV 89%

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

潜在噪声掩码:减少多模态大语言模型中的视觉冗余

Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI)) Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract)

AI总结 提出Lens框架,通过轻量级LET令牌为视觉令牌评分,并注入自适应噪声抑制低相关令牌,在不改变模型结构的情况下提升多模态推理性能。

Comments 21 pages, 7 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29915 2026-06-30 cs.CV 89%

H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

H-GRPO: 用于基础视觉推理的置换不变强化学习

Eric Peh, Debaditya Roy, Basura Fernando

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);visual reasoning(title);vision-language model(abstract);grounding(abstract)

AI总结 提出H-GRPO框架,通过分解式证据基础将全局查询分解为原子子问题,每个子问题需显式子答案和局部证据边界框,构建结构化推理路径以提升VLM性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30185 2026-06-30 cs.AI 86%

Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

Dynamo: 视觉-语言代理的动态技能-工具演化

Yutao Sun, Yanting Miao, Hao-Xuan Ma, Mengyu Zhou, Mingshuai Chen, Tiancheng Zhao, Dexin Wang, Lei Lv, Li Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba Zhejiang University(阿里巴巴浙江大学) University of Waterloo(多伦多大学) Vector Institute(向量研究所) Nanjing University(南京大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 提出Dynamo,一种无需训练、无需权重更新的框架,通过让冻结的VLM在少量标注数据上自我检查并演化可复用的推理技能和可执行的视觉工具,提升视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28593 2026-06-30 cs.CV cs.AI cs.CL 86%

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Animation2Code: 评估视频到代码生成中的时间视觉推理

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Animation2Code基准,通过从视频重建可执行网页动画代码来评估视觉语言模型的时间视觉推理能力,发现现有模型在时间一致性上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01472 2026-06-30 cs.RO 86%

AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

AERMANI-VLM:基于视觉语言模型的空中 manipulation 的结构提示与推理

Sarthak Mishra, Rishabh Dev Yadav, Avirup Das, Saksham Gupta, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 视觉推理 :VLM(title,abstract);vision language model(title)

AI总结 本文提出AERMANI-VLM框架,通过分离高层推理与低层控制,利用结构化提示生成自然语言推理轨迹,实现安全可靠的空中 manipulation 任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02742 2026-06-30 cs.CV 85%

Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models

一致但错误:空间视觉-语言模型中的证据不敏感性

S Divakar Bhat, Toshihiko Yamasaki

机构 * The University of Tokyo, Japan(东京大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 通过引入ViewDiag多视图评估协议,发现现代视觉-语言模型在空间推理中表现出跨视角一致但错误的现象,表明其预测主要源于先验驱动而非证据敏感推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29579 2026-06-30 cs.CV cs.AI cs.LG cs.MM 85%

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models

ScAle: 注意力头缩放作为视觉语言模型中空间推理的最小适配器

Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Zhejiang University(浙江大学)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出ScAle,一种超轻量适配方法,通过学习少量标量系数调节冻结骨干网络中的注意力头和MLP激活,仅用1K可训练参数在空间推理任务上实现高达134.1%的相对精度提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16506 2026-06-30 cs.CV 79%

VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations

VIEW2SPACE:从稀疏观察研究多视角视觉推理

Fucai Ke, Zhixi Cai, Boying Li, Long Chen, Beibei Lin, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Hamid Rezatofighi

机构 * Monash University(莫纳什大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

AI总结 本文提出VIEW2SPACE基准,通过物理仿真生成高保真3D场景,评估多视角视觉推理的现状,发现多数模型表现欠佳,提出Grounded Chain-of-Thought with Visual Evidence提升性能并推广至现实数据。

Journal ref European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28971 2026-06-30 cs.CV 77%

Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution

自进化智能体图像恢复:通过深思熟虑的规划与直觉执行

Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Life Sciences, Tsinghua University(清华大学生命科学学院) Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SEAR框架,将图像恢复建模为序列决策问题,采用直觉执行器与深思熟虑规划器,结合剪枝感知蒙特卡洛树搜索和自进化情景记忆,解决贪婪搜索和信息利用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28845 2026-06-30 cs.CV 77%

Personalizing MLLMs via Reinforced Multimodal Reference Game

通过强化多模态参考游戏个性化多模态大语言模型

Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出强化参考游戏(RRG)框架,通过对比游戏学习生成准确、有区分性的概念描述,在三个个性化基准上达到最先进性能。

Comments Accepted to ECCV26. Project page: https://deepayan137.github.io/papers/conversational-personalization.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28938 2026-06-30 cs.CL 75%

EVLA: An Electro-Aware Multimodal Assistant for Physically-Grounded Driving Reasoning and Control

EVLA:一种用于物理接地驾驶推理与控制的电感知多模态助手

Yuxin Liu, Zihan Chen, Haoyu Wang, Mingxuan Zhang, Ruijie Lin, Siyuan Zhao

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出EVLA框架,融合视觉、文本与实时电动动力总成状态,通过统一共状态编码器和电感知结构化推理链,生成上下文感知且能量最优的驾驶决策,在驾驶问答基准上显著优于基线模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21545 2026-06-30 cs.CV 74%

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除

Sanghyun Jo, Donghwan Lee, Eunji Jung, Seong Je Oh, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

专题命中 视觉推理 :MLLM(title);分类 cs.CV

AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28357 2026-06-30 cs.IR cs.AI 70%

ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified Recommendation

ReasonRec: 一种用于统一推荐的推理增强多模态智能体

Yihua Zhang, Mingfu Liang, Jiyan Yang, Rong Jin, Wen-Yen Chen, Yiping Han, Huayu Li, Buyun Zhang, Liang Luo, Frank Shyu, Luke Simon, Sijia Liu, Tianlong Chen, Xi Liu

机构 * Meta AI Michigan State University(密歇根州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ReasonRec,一种基于三阶段显式推理管道的多模态推荐智能体,通过推理感知视觉指令调优、证据-视野课程学习和不确定性引导委派机制,在五个数据集上实现排名指标相对提升超30%,推理延迟降低35%。

Comments The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30026 2026-06-30 cs.CV cs.AI 62%

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

机构 * NTU Singapore(南洋理工大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学) AI2(人工智能研究所) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。

Comments Project page: https://musebench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30378 2026-06-30 cs.CV 57%

OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

OmniCoT: 全局与多步骤全景推理基准

Haocong He, Chenfei Liao, Zichen Wen, Zihao Dongfang, Xu Zheng, Bin Ren, Chang Su, Zixin Zhang, Harold Haodong Chen, Hongfei Zhang, Weijia Li, Kailun Yang, Conghui He, Xuming Hu, Nicu Sebe, Linfeng Zhang

机构 * MBZUAI Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出OmniCoT基准,通过链式思维标注和两阶段训练策略,增强多模态大模型在全景图像中的全局多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10342 2026-06-30 cs.CV 57%

CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

CoSPlan: 通过场景图增量更新实现纠正式序列规划

Shresth Grover, Priyank Pathak, Akash Kumar, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学(UCF)人工智能研究所)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 CoSPlan基准测试要求视觉语言模型在初始场景到目标场景间规划视觉动作序列,通过引入错误动作检测与纠正机制,评估模型在复杂视觉任务中的能力。

Comments The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02456 2026-06-30 cs.CV cs.CL 57%

See, Think, Learn: A Self-Taught Multimodal Reasoner

看见、思考、学习:一种自教的多模态推理器

Sourabh Sharma, Sonam Gupta, Sadbhawna

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出See-Think-Learn框架,通过自训练提升多模态推理能力,结合感知与推理生成结构化推理过程,增强模型区分正确与误导性回答的能力。

Comments Accepted at The Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19119 2026-06-30 cs.CV 57%

MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

MonoSR: 从单目图像进行开放词汇空间推理

Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li

机构 * Technical University of Munich(慕尼黑工业大学) A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所) Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MonoSR大规模单目空间推理数据集,涵盖多种场景并支持多种问题类型,评估先进视觉-语言模型并分析辅助信息对单目空间推理的重要性,为开放世界中的单目空间推理提供基础。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-06-30 cs.AI 57%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28338 2026-06-30 cs.IR 50%

Memory Shot for Long-Term Dialogue

长期对话的记忆快照

Chunyi Peng, Haidong Xin, Xuanshuo Sheng, Xin Dai, Zhenghao Liu, Shuo Wang, Yukun Yan, Zulong Chen, Yu Gu, Ge Yu

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出MemShot方法,通过将对话片段渲染为结构化视觉记忆单元,利用模型内部视觉推理能力关联关键情节,实现高效长期对话建模,在LoCoMo和LongMemEval上取得稳定性能并实现70倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏