arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 430 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 430 篇

2607.29052 2026-08-03 cs.RO 新提交 88%

Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

结果引导蒸馏:一种提升自动驾驶中视觉语言模型推理能力的师生框架

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(晨昇科技公司)

专题命中 视觉推理 :VLM(title,summary_cn);vision-language model(abstract)

AI总结 本研究提出结果引导蒸馏的师生框架,将VLM的显式推理与几何轨迹生成结合,在Waymo基准上使自动驾驶性能提升约24%,优于经典推理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00261 2026-08-04 cs.CL cs.AI cs.CV cs.MA q-bio.NC 新提交 88%

Cross-Task Dissociation in Frontier Vision-Language Model Theory of Mind

前沿视觉语言模型的心智理论跨任务解离

Kejia Zhang, Youran Sun, Chugang Yi, Haizhao Yang

机构 * University of Maryland(马里兰大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究评估9个前沿VLM在两项心理学衍生ToM任务中的表现,发现其ToM特征存在跨任务解离,无模型在两项任务中均接近典型发展成人,推理可改善部分模型在导演任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25066 2026-06-25 cs.AI cs.CV 新提交 88%

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

视觉-语言模型的搜索方式与人类相似吗?经典视觉搜索范式中推理标记作为反应时间类似物

Farahnaz Wick

机构 * Independent Researcher(独立研究者)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究视觉-语言模型(VLM)在经典视觉搜索任务中是否表现出类似人类的行为模式,通过推理标记数量作为搜索努力度的指标,发现模型复现了部分人类特征但也存在关键差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 88%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28595 2026-07-31 cs.CV 新提交 87%

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

专题命中 视觉推理 :visual reasoning(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22597 2026-06-24 cs.CV 新提交 87%

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

MapReason-OSM:视觉语言模型能否从街道地图中做出可图验证的移动决策?

Srinivas Venkatanarayanan, Clement Pakkam Isaac

机构 * NVIDIA(英伟达) University of Central Florida(中佛罗里达大学) University of South Florida(南佛罗里达大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出MapReason-OSM基准,通过自渲染OpenStreetMap面板和隐藏街道图,评估VLM在路由、设施定位等任务中做出可图验证的移动决策的能力,发现模型在图形成本推理和跨缩放一致性上表现不佳。

Comments 9 pages, 7 figures. Submitted to ACM SIGSPATIAL 2026 (Industrial Track). Code and data: https://github.com/Vi-Sri/mapreason-osm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14015 2026-08-17 cs.CV cs.AI 新提交 87%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19120 2026-06-23 cs.LG cs.CV 新提交 87%

Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

先看后思:解耦感知与推理以实现抗捷径的多模态在策略自蒸馏

Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 提出ViGOS框架,通过解耦感知和推理,在MLLM后训练中避免文本捷径,提升图像依赖行为。

Comments 29 pages, 5 figures, 8 tables; Project page: https://oedosoldier.github.io/ViGOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24814 2026-07-01 cs.RO 新提交 87%

Vision-Language Model Reasoning for Contextual Semantic Mapping in Intralogistics

面向内部物流的上下文语义建图中的视觉-语言模型推理

Marvin Rüdt, Hao Pang, Constantin Enke, Zäzilia Seibold, Kai Furmans

机构 * Institute for Material Handling and Logistics, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院物流与物料搬运研究所)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title)

AI总结 提出结合SLAM、SAM、实例聚类和VLM多视角推理的上下文语义建图流程,零样本推断物体可移动性,实现语义分类98.93% mIoU和可移动性估计89.17% mAcc。

Comments Accepted for publication at the 31st IEEE International Conference on Emerging Technologies and Factory Automation (ETFA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26196 2026-06-26 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 87%

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院) Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文系统综述多模态大语言模型中统一视觉-语言感知的范式演进,提出五阶段分类法,梳理各阶段代表性方法,并指出开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07172 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 87%

Textual Supervision Enhances Geospatial Representations in Vision-Language Models

文本监督增强视觉-语言模型中的地理空间表示

Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon, Luiz Felipe Vecchietti, Bryan Nathanael Wijaya, Cheng Yaw Low, Virgilio Almeida, Meeyoung Cha

机构 * University of São Paulo(圣保罗大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 研究视觉、视觉-语言及多模态模型的地理空间表示能力,发现文本监督能有效提升空间编码,推动地理空间AI发展。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11576 2026-06-11 cs.CV cs.AI 新提交 87%

AVIS: Adaptive Test-Time Scaling for Vision-Language Models

AVIS: 视觉语言模型的自适应测试时缩放

Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn,comments);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 提出AVIS,通过轻量策略联合优化视觉上下文缩放和推理缩放,利用无训练的关键多样性剪枝和自适应自一致性,在多种基准上提升精度-计算权衡。

Comments Project page: https://avis-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05573 2026-07-08 cs.AI cs.CE 新提交 86%

Foundation Models for Automatic CAD Generation

用于自动CAD生成的基础模型

J de Curtò, Victoria Guillén, I. de Zarzà

机构 * BARCELONA Supercomputing Center(巴塞罗那超级计算中心) Universidad Pontificia Comillas(庞培法布拉大学) Chung-Ang University(中央大学) LUXEMBOURG Institute of Science and Technology(卢森堡科学技术研究所)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 研究利用统一评估管道和基准,对用于机械零件自动CAD生成的基础模型展开实证。介绍LLMForge框架,通过两种批判机制评估七个基础模型,展示了紧凑模型的效果,以及VLM批判的作用,还探讨了相关设计及影响。

Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20561 2026-06-19 cs.CV 新提交 86%

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

TimeProVe: 先提出后验证,实现日常活动中的高效长视频时间推理

Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das

机构 * University of North Carolina, Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出TimeProVe框架,先通过轻量模块生成基于动作的候选假设,再调用昂贵VLM验证,在长视频问答中降低75%VLM调用和93%推理成本,性能提升7.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15308 2026-06-16 cs.AI 新提交 86%

Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades

强制延迟:在多模态大语言模型级联中操纵路由决策

Zhongye Liu, Yaopei Zeng, Yurui Chang, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 提出强制延迟攻击(FDA),通过对抗性图像攻击降低弱模型置信度,迫使级联系统将查询路由到强模型,揭示了MLLM级联在计算分配上的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06699 2026-08-10 cs.AI cs.CV 新提交 86%

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复

Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14697 2026-06-15 cs.CV cs.AI cs.CL 新提交 86%

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。

Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 86%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15694 2026-06-16 cs.MM cs.AI cs.CV cs.LG 新提交 86%

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs

MAF: 面向情感分析的多模态自适应少样本提示方法

Hangling Xie

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出MAF框架,通过动态检索与查询相关的多模态示例,利用轻量级系数生成网络实时融合多模态相似度,结合多数投票提升MLLM在情感分析中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 85%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01709 2026-08-04 cs.CV 新提交 85%

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

SpatialQuery:评估视觉语言模型中基于几何的多实例空间推理能力

Hai Nguyen, Tung Vu, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对视觉语言模型的多实例空间推理缺陷,推出SPATIALQUERY框架及含百万对问答的SPATIALQUERY-1M基准,结合UA-CoT提示,使Qwen3-VL-8B在空间推理任务中表现优于多种模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 85%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12786 2026-07-15 cs.CV 新提交 85%

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

CoRe:视觉语言模型中跨图像比较推理的综合框架

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。

Comments Accepted by ACMMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22694 2026-06-23 cs.CV cs.SC 新提交 85%

SATURN: Symbolic Spatial Reasoning for Multi-Perspective Grounding

SATURN: 多视角定位的符号化空间推理

Danial Kamali, Tanawan Premsri, Shreya Rajpal, Amir Zadeh, Chuan Li, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) Lambda Labs(Lambda实验室)

专题命中 视觉推理 :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出SATURN框架,通过神经符号方法实现视角感知的组合空间推理,结合3D场景重建、软空间谓词和Python符号执行器,在3D FORCE和MindCube基准上显著优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16569 2026-06-16 cs.CV cs.RO 新提交 85%

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models

PROSE: 基于视觉语言模型的无训练自我中心场景配准

Zhiang Chen, Nahyuk Lee, Boyang Sun, Taein Kwon, Marc Pollefeys, Zuria Bauer, Sunghwan Hong

机构 * ETH Zurich(苏黎世联邦理工学院) VGG, University of Oxford(牛津大学VGG实验室) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出PROSE方法,利用预训练视觉语言模型将RGB序列提升为对象级3D场景图,通过对象高度先验和相同/不同查询匹配实例,无需训练或深度传感器即可实现自我中心场景配准,在Aria基准上超越几何和场景图基线。

Comments Project page: https://rckola.github.io/prose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15231 2026-06-16 cs.AI 新提交 85%

Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

Visual-Seeker:通过主动视觉推理实现视觉原生多模态智能搜索

Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

机构 * School of Artificial Intelligence UCAS(中国科学院大学人工智能学院) Institute of Automation CAS(中国科学院自动化研究所) Ant Digital Technologies Ant Group(蚂蚁数字科技蚂蚁集团) RUC(中国人民大学) BIT(北京理工大学)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 提出Visual-Seeker,一种通过主动视觉推理进行视觉原生多模态深度搜索的智能体,在五个基准上达到最先进性能,甚至超越专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14795 2026-06-16 cs.CV 新提交 85%

Position: The Systemic Lack of Agency in Visual Reasoning

立场:视觉推理中系统性的能动性缺失

Yizhao Huang, Haoyang Chen, Shiqin Wang, Pohsun Huang, Jiayuan Li, Haoyuan Du, Yandong Shi, Zheng Wang, Zhixiang Wang

机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(武汉大学计算机学院人工智能研究所多媒体软件工程研究中心) Hubei Key Laboratory of Multimedia(湖北省多媒体与网络通信工程重点实验室) Zhongguancun Academy, Beijing, China. 100094(中关村学院,北京,中国) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) Shanda AI Research Tokyo(上海大势人工智能研究东京)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 本文指出当前视觉语言模型因缺乏自主探索能力而无法进行隐式推理,并提出V-IRD基准来评估这一能力,实验表明强语义识别不等同于主动视觉探索。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10400 2026-06-10 cs.CL cs.CV 新提交 85%

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

视觉语言模型是看见还是猜测?通过措辞控制基准衡量和减少文本先验依赖

Pratham Singla, Shivank Garg, Vihan Singh, Paras Chopra

机构 * Lossfunk Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Raeth AI

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文构建了540张图像的基准,通过为同一图像生成四种措辞变体,衡量视觉语言模型对文本先验的依赖,发现所有模型在最难变体上性能下降,开放模型下降最严重,并通过无图像消融等分析证实了真正的图像依赖。

Comments 17 pages, 7 figures, Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05729 2026-08-07 cs.AI cs.CL cs.CV cs.HC 新提交 85%

Unified Agent: Managing Interactions across Devices

统一智能体:管理跨设备交互

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14099 2026-07-17 cs.CL cs.AI cs.CV 新提交 85%

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs

只需持续提示:评估视觉语言模型中的重复苏格拉底式提示

Shayda Moezzi, Bishoy Galoaa, Lorena Genua, Taskin Padir, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 研究视觉语言模型在反复提示下的稳定性,引入JKP多轮评估框架,用三种策略对模型提问,在STAR基准子集上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B,发现重复提示利弊兼具且因模型而异,揭示了模型压力反应概况。

详情

展开后加载摘要…

URL PDF HTML 收藏