arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-07 至 2026-07-07 共收录 176 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 27 篇

2607.05089 2026-07-07 cs.CV 新提交 57%

TimeThink: Reasoning with Time for Video LLMs

TimeThink:用于视频语言模型的时间推理

Handong Li, Longteng Guo, Zikang Liu, Dongze Hao, Yepeng Tang, Zijia Zhao, Jie Jiang, Zhiwei Jin, Chen Chen, Haonan Lu, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) OPPO AI Center, OPPO Inc.(OPPO公司OPPO人工智能中心)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 研究视频推理中模型发现时间证据的问题,提出TimeThink框架,将时间线索步骤作为优化原语,引入奖励和优化目标,构建数据集,实验表明该框架提升了时间定位和推理性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04681 2026-07-07 cs.RO cs.AI 新提交 57%

Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning

视觉语言动作模型所言即所指?论忠实性在具身推理中的作用

Matthew Foutter, Matteo Cercola, Lena Wild, Yunshan Wang, Michelle Li, Daniele Gammelli, Marco Pavone

机构 * Stanford University(斯坦福大学) Politecnico di Milano(米兰理工大学) KTH Royal Institute of Technology(皇家理工学院) Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所) NVIDIA Research(英伟达研究院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 研究视觉语言动作模型中具身思维链是否真实反映决策过程。区分功能推理与忠实推理,指出当前对齐策略不足,通过人类评估揭示差距,用学习的评论家操作具身忠实性的行为替代物,强化学习后训练策略提升了忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04162 2026-07-07 cs.RO cs.LG 新提交 57%

ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning

ACE:通过零样本工作流推理实现具身操纵的智能体控制

Iok Tong Lei, QianZhi Li, Ying Jie Yap, Yujie Zhang, Rui Zhong, Haichao Gui, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 研究开放式桌面操作,提出ACE零样本工作流推理框架,结合智能体工作流推理与视觉基础接口、可重复使用的拾取和放置原语等技能,经掩码介导视觉动作接口连接语义推理与物理控制,能在线适应多种情况,在复杂任务中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03614 2026-07-07 cs.CV 新提交 57%

IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

IDEAL-Bench:用于分析3D布局推理的室内数据集和评估套件

Yuening Cai, Junwei Zhou, Youran Qu, Yu-Wing Tai

机构 * Department of Computer Science Dartmouth College(达特茅斯学院计算机科学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 介绍IDEAL-Bench评估套件,让视觉语言模型预测室内场景结构化3D布局,基于IDEAL-Scenes数据集,评估15个模型发现任务待解、模型存在不对称性及排名差异,为下一代模型空间智能评估铺路。

Comments 36 pages. Project page: https://ideal3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03069 2026-07-07 cs.CV 新提交 57%

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02607 2026-07-07 cs.CV cs.CL 新提交 57%

Latent Visual Cache for Video Reasoning

用于视频推理的潜在视觉缓存

Yongheng Zhang, Zhipeng Xu, Hao Wu, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 研究视频推理中视觉锚定衰减问题,提出潜在视频缓存Latent-VC插入解码器,通过监督对比缓存对齐等训练,在多视频基准测试中表现优于基线,能保留视觉证据提升推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20272 2026-07-07 cs.CV 版本更新 57%

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11691 2026-07-07 cs.CV 版本更新 57%

VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models

VLMEvalKit:用于评估大型多模态模型的开源工具包

Haodong Duan, Xinyu Fang, Junming Yang, Xiangyu Zhao, Zerun Ma, Yuxuan Qiao, Mo Li, Tianhao Liang, Lin Zhu, Amit Agarwal, Xiaozhe Li, Shengyuan Ding, Jiazi Bu, Ziyu Liu, Zhangyang Qi, Yifei Li, Yuhang Zang, Zhe Chen, Lin Chen, Yuan Liu, Yubo Ma, Hailong Sun, Yifan Zhang, Shiyin Lu, Tack Hwa Wong, Weiyun Wang, Peiheng Zhou, Chaoyou Fu, Junbo Cui, Jixuan Chen, Enxin Song, Song Mao, Junming Lin, Xilin Wei, Jinsong Li, Zeyi Sun, Zhaowei Wang, Zicheng Zhang, Xiaoyi Dong, Junjun He, Pan Zhang, Jiaqi Wang, Dahua Lin, Kai Chen

机构 * VLMEvalKit Team(VLMEvalKit团队) Community Contributors(社区贡献者)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 VLMEvalKit是基于PyTorch的开源工具包,为评估多模态模型提供框架。实现450+模型配置,支持330+基准测试,有单一接口,自动处理多项任务,还扩展到多领域,基于其结果有OpenVLM Leaderboard。

Comments Updated on 2026.07.05

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 57 篇

2606.13156 2026-07-07 cs.CV cs.AI 新提交 91%

Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding

迭代视觉思维:通过视觉反馈教会视觉语言模型空间自我修正

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 视觉定位与Grounding :VLM(title,abstract);grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出迭代视觉思维(IVT)框架,通过视觉反馈闭环和两阶段训练(SFT+GRPO),使视觉语言模型具备空间自我修正能力,在三个基准上提升指标2.4-3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03595 2026-07-07 cs.CV cs.AI cs.RO 新提交 88%

Token-Based Affordance Grounding with Large Vision-Language Models

基于令牌的大型视觉语言模型的可供性基础

Seung Il Lee, Qinqian Lei, Daguang Xu, Dong Yang, Robby T. Tan, Yixin Chen, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 研究旨在解决现有视觉语言模型在行动定位上的问题,提出TokAG零样本可供性基础框架,利用令牌级语义空间信号定位相关区域,引入空间感知令牌选择机制,在多基准测试中优于先前方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03647 2026-07-07 cs.CV 新提交 88%

Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs

医学视觉语言模型真的能“看”吗?用于视觉依赖型医学视觉语言模型的反事实基础框架和硬负对比训练

Anas Zafar, Leema Krishna Murali, Siddhant Bharadwaj, Ashish Vashist, Jia Wu

机构 * The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Eisai Inc.(卫材株式会社) IISc, Bangalore(印度科学研究所班加罗尔分校) Cohere Labs Community(Cohere实验室社区)

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(title,abstract);分类 cs.CV

AI总结 探讨医学视觉语言模型是依据视觉证据推理还是利用文本捷径,引入反事实评估框架和对比检索增强学习方法,提升模型视觉依赖能力并揭示跨域诊断差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05222 2026-07-07 cs.CV 新提交 87%

A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

面向科学传播中图表-图像连贯性锚定的多模态推理类型学

Avina Nakarmi, Sohom Sen, Xun Song, Sreyashi Samaddar, Aritra Dasgupta

机构 * New Jersey Institute of Technology(新泽西理工学院) Brooklyn College(布鲁克林学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出R1-R5多模态推理类型学,刻画科学文献中图表、图像与文本的协同推理缺口,可系统识别连贯性锚定状态,缩小不同人群解读科学结论的认知差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01050 2026-07-07 cs.CV 新提交 87%

GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

GeoSearcher: 基于锚点引导的渐进推理遥感视觉定位与过程监督

Dianyu Wang, Peirong Zhang, Xuyang Li, Xiaoxuan Liu, Lei Wang

机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出GeoSearcher,通过锚点引导的渐进推理和过程监督,将遥感视觉定位转化为两阶段过程,解决小目标定位和复杂查询的挑战。

Comments 14 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08467 2026-07-07 cs.CV cs.LG eess.IV 版本更新 86%

Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling

基于双解耦视觉语言模型的零样本分心驾驶员检测

Takamichi Miyata, Sumiko Miyata, Andrew Morris

机构 * Chiba Institute of Technology(千叶工业大学) Institute of Science Tokyo(东京科学大学) Loughborough University(拉夫堡大学)

专题命中 视觉定位与Grounding :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出一种主体解耦框架,通过提取驾驶员外观嵌入并从图像嵌入中移除其影响,再结合度量投影正交化文本嵌入,实现零样本分心驾驶检测,显著提升实际场景性能。

Comments Accepted to IEEE 15th International Symposium on Communication Systems, Networks and Digital Signal Processing (CSNDSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28862 2026-07-07 cs.CV 版本更新 85%

HKVLM: Faithful Query--Region Binding for Frozen-Detector Visual Grounding

HKVLM:通过将语言查询绑定到冻结检测器实现忠实推理定位

Bo Ma

机构 * Bo Ma

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出HKVLM框架,通过将定位从语言路径中分离,利用冻结检测器和语言模型,仅训练轻量对齐钩子实现推理定位,在少样本冷启动场景下显著提升定位精度并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04223 2026-07-07 cs.CL cs.AI cs.LG 新提交 81%

Detecting Hallucinations in Retrieval-Augmented Generation through Grounding-Aware Sensitivity by Perturbation (GASP)

通过扰动的基于接地感知敏感性检测检索增强生成中的幻觉(GASP)

Mohamed Aly Bouke

机构 * Centre for Intelligent Cloud Computing, CoE for Advanced Cloud, Faculty of Information Science and Technology, Multimedia University(智能云计算中心、高级云研究中心、信息科学与技术学院、多媒体大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究检索增强生成中幻觉检测问题,提出GASP方法,通过固定答案重新打分,衡量对数似然下降和Jensen-Shannon散度,评估显示其在RAGTruth上效果显著,信号能转移到TofuEval。

Comments 23 pages, 9 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05122 2026-07-07 cs.CV cs.RO 新提交 79%

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

绿色代表可行,红色代表不可行:通过语义分割实现视觉基础以用于VLA导航策略

Adrian Szvoren, Dimitrios Kanoulas, Nilufer Tuptuk

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究VLA导航策略的视觉基础,提出基于实时分割的方法,用SegFormer突出可通行与不可通行区域,评估两种变体,结果表明视觉基础可降误差,对长指令效果更佳,还能作为轨迹长度正则化器。

Comments Accepted for RSS 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03792 2026-07-07 cs.RO cs.CV 新提交 79%

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

从视觉语言导航中的区域到达到实例级定位

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Ruyi Dynamics(如意动力) Fudan University(复旦大学) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究视觉语言导航中当前评估协议局限,提出‘最后3米定位差距’及指标,构建REALM模块和REVERIE - AIM数据集,可减少过早终止,提升定位精度和视觉定位成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02930 2026-07-07 cs.CV 新提交 79%

CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection

CL-Anomaly:用于异常检测中持续学习的具有多模态大语言模型的层自适应专家混合模型

Wen Dong, Zhao Wang, Shuangqing Zhang, Kai Sun, Ben Li, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Nanjing University of Science and Technology(南京理工大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型持续学习计算昂贵及现有方法语义纠缠问题,提出CL-Anomaly框架,用隔离共享协作实现参数高效微调,介绍任务私有专家PrivLoRA等,实验表明其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-07-07 cs.CV 版本更新 79%

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30169 2026-07-07 cs.CY cs.AI cs.MA 版本更新 79%

Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms

分离性身份:语言模型代理缺乏声誉机制的基础

Botao Amber Hu, Helena Rong, Max Van Kleek

机构 * University of Oxford(牛津大学) New York University Shanghai(纽约大学上海分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文指出语言模型代理因本体上的分离性(模块可替换、身份流动)而无法满足声誉机制所需的身份持续性、行为可预测性和制裁敏感性,从而提出转向基于可观察性、事前、构成性、协议的行为约束。

Comments Accepted by FaccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16809 2026-07-07 cs.RO cs.AI 版本更新 79%

CABTO: Context-Aware Behavior Tree Grounding for Robot Manipulation

CABTO:面向机器人操作的上下文感知行为树接地

Yishuai Cai, Xinglin Chen, Yunxin Mao, Kun Hu, Yaodong Yang, Yuanpei Chen, Wenjing Yang, Ji Wang, Minglong Li

机构 * National University of Defense Technology(国防科技大学) PsiBot Peking University(北京大学) PKU-Psibot Lab(北京大学-PsiBot实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出CABTO框架,通过预训练大模型和上下文反馈,自动构建完整且一致的行为树系统,解决机器人操作中行为树接地的复杂性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00296 2026-07-07 cs.LG cs.CR 版本更新 77%

VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild

VLMGuard:从野生未标记视觉语言提示中引导恶意提示检测器

Junlin Fang, Wenyu Chen, Reshmi Ghosh, Robert Sim, Ahmed Salem, Vitor R. Carvalho, Emily Lawton, Sharon Li, Jack W. Stokes, Sean Du

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Physical and Mathematical Sciences(物理与数学科学学院) Microsoft Corp.(微软公司) Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 研究针对视觉语言模型易受恶意输入影响的问题,提出VLMGuard框架,利用野生未标记用户提示,通过自动恶意估计分数区分良性和恶意样本,训练二进制提示分类器,无需额外人工标注,效果优于现有方法。

Comments Accepted to Transactions on Machine Learning Research (07/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07866 2026-07-07 cs.RO cs.LG cs.SY eess.SY 版本更新 74%

Language-Guided Grasping under Partial Observation for Mobile Manipulation in Field Inspection and Maintenance

用于现场检查和维护中移动操作的部分观察下语言引导抓取

Dilermando Almeida, Juliano Negri, Guilherme Lazzarini, Thiago H. Segreto, Ranulfo Bezerra, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker

机构 * Department of Mechanical Engineering, Federal University of Uberlândia(联邦大学伯南迪利亚机械工程系) Department of Mechanical Engineering, University of São Paulo(圣保罗大学机械工程系) Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Faculdade Israelita de Ensino e Pesquisa Albert Einstein, Hospital Israelita Albert Einstein(艾伯特·爱因斯坦以色列教学与研究学院,艾伯特·爱因斯坦医院)

专题命中 视觉定位与Grounding :VLM(title);分类 cs.LG

AI总结 提出用于腿部移动操纵器在部分观察下的语言引导抓取流程,经多步骤处理,在四足机器人上实现并评估,相比基线提高抓取成功率,提升语言引导抓取可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 70%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25706 2026-07-07 cs.CV 版本更新 70%

Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker

迈向开放世界的指代表达理解:一种无需训练的多任务一致性检查器基准

Zongjian Wu, Lei Zhang

机构 * School of Microelectronics and Communication Engineering, Chongqing University, Chongqing, China(微电子与通信工程学院,重庆大学,重庆,中国)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对现有指代表达理解(REC)基准局限于简单场景和单目标假设的问题,提出OpenRef基准,涵盖多样视觉场景、可变目标数量和丰富词汇类型,并引入无需训练的多任务一致性检查器(MCC)以提升模型在开放世界中的性能。

Comments 23 pages, 7 figures. Project Page: https://zongjianwu.github.io/openref

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00458 2026-07-07 cs.CV 版本更新 70%

VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors

VLOD-TTA: 视觉语言目标检测器的测试时适应

Atif Belal, Heitor R. Medeiros, Marco Pedersoli, Eric Granger

机构 * International Laboratory on Learning Systems (ILLS)(国际学习系统实验室(ILLS))

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出VLOD-TTA,通过密集提案重叠和图像条件提示实现低开销的视觉语言目标检测器测试时适应,优于现有方法。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02718 2026-07-07 cs.CV cs.AI cs.LG 新提交 67%

Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models

用基础图像生成模型诊断鸟瞰目标检测器

Stanislav Panev, Minhyek Jeon, Vaishnavi Khindkar, Ahish Deshpande, Celso M de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(陆军研究实验室(DEVCOM)) Florida State University(佛罗里达州立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究用文本引导生成、属性控制编辑和自动属性验证构建可控合成测试平台,对预训练检测器进行细粒度评估,以预测实际性能差距并指导高效数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03007 2026-07-07 cs.LG cs.AI q-bio.BM 新提交 62%

Back to Basics: Improving Molecular Understanding in LLMs via SMILES-Graph Translation

回归基础:通过SMILES-图翻译提升大语言模型中的分子理解

Wenda Wang, Jinjia Feng, Zhewei Wei

机构 * Gaoling School of Artificial Intelligence(中关村人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对分子大语言模型缺乏可靠结构基础的问题,提出MolBasic框架,通过SMILES-图翻译加强结构理解,用多级结构感知基准和渐进学习方案,提升了结构理解及下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02963 2026-07-07 cs.CV cs.AI cs.MM 新提交 62%

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

用于全模态密集视频字幕的并行自回归解码

Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究密集视频字幕生成,提出并行自回归框架,利用事件间弱局部依赖重组因果依赖图,引入全局规划和事件分解并行解码机制,提升效率与字幕性能。

Comments ECCV 2026. Project website: https://github.com/showlab/PadCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏