arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-23 至 2026-03-23 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 12 篇

2603.19203 2026-03-23 cs.CV 85%

Tinted Frames: Question Framing Blinds Vision-Language Models

着色边框:问题框架使视觉语言模型失明

Wan-Cyuan Fan, Jiayun Luo, Declan Kutscher, Leonid Sigal, Ritwik Gupta

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Vector Institute for AI(人工智能向量研究所)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 本文研究视觉语言模型在不同问题框架下的注意力分配问题,发现框架影响其视觉输入处理,提出轻量级提示调优方法提升视觉感知能力。

Comments Preprint. Project page: https://davidhalladay.github.io/tinted_frames_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15160 2026-03-23 cs.CV 85%

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

EagleVision:基于BEV的双阶段框架用于空间智能

Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

机构 * Atlas Lab(Atlas实验室) School of Aerospace, BUAA(北京航空航天大学航空学院) School of Software, BUAA(北京航空航天大学软件学院) State Key Laboratory of HERATT(HERATT国家重点实验室) Key Laboratory of SDODS (MOE) Project(SDODS重点实验室(教育部))

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 EagleVision通过结合几何感知帧选择与主动BEV推理,提升视频空间推理能力,实现空间感知与验证的闭环循环。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 83%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20193 2026-03-23 cs.CV cs.AI cs.LG 82%

From Masks to Pixels and Meaning: A New Taxonomy, Benchmark, and Metrics for VLM Image Tampering

从遮罩到像素与意义:一种新的分类、基准和度量标准用于VLM图像篡改

Xinyi Shang, Yi Tang, Jiacheng Cui, Ahmed Elhagry, Salwa K. Al Khatib, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种基于像素和意义的VLM图像篡改检测新方法,引入了新的分类体系和基准,提出了基于像素的度量标准,并评估了现有模型在微编辑和非遮罩篡改上的表现。

Comments Code and data at: https://github.com/VILA-Lab/PIXAR (Accepted in CVPR 2026 Findings, but not opted in)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12788 2026-03-23 cs.CV 79%

Think and Answer ME: Benchmarking and Exploring Multi-Entity Reasoning Grounding in Remote Sensing

思考并回答ME:基准测试和探索遥感中的多实体推理 grounding

Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou, You Zhou, Dingding Yao, Zhenwei Shi

机构 * Beihang University, Beijing, China(北京航空航天大学) University of Liverpool, Liverpool, UK(利物浦大学) Institute of Acoustics, Chinese Academy of Sciences, Beijing, China(中国科学院声学研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出ME-RSRG基准数据集,通过Entity-Aware Reasoning框架提升遥感多实体推理能力,验证了该框架的有效性。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19429 2026-03-23 cs.AI cs.LO cs.SC 79%

When both Grounding and not Grounding are Bad -- A Partially Grounded Encoding of Planning into SAT (Extended Version)

当同时 grounding 和不 grounding 都不好 -- 一种部分 grounding 的规划到 SAT 编码(扩展版)

João Filipe, Gregor Behnke

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出一种部分 grounding 的 SAT 编码,在保持动作 lifted 的同时部分 grounding 预言,实现线性规模的规划效率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19608 2026-03-23 cs.CV cs.AI 62%

FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement

FB-CLIP:基于前景-背景解耦的细粒度零样本异常检测

Ming Hu, Yongsheng Huo, Mingyu Dou, Jianfu Yin, Peng Zhao, Yao Wang, Cong Hu, Bingliang Hu, Quan Wang

机构 * Xi’an Institute of Optics and Precision Mechanics, Chinese Academy of Sciences(西安光学精密机械研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Xi’an Jiaotong University(西安交通大学) Zhongnan Hospital of Wuhan University(武汉大学中南医院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FB-CLIP框架,通过多策略文本表示和前景-背景分离,提升细粒度零样本异常检测的准确性和定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19531 2026-03-23 cs.CV cs.AI 62%

dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3

dinov3.seg: 基于DINOv3的开放词汇语义分割

Saikat Dutta, Biplab Banerjee, Hamid Rezatofighi

机构 * IITB-Monash Research Academy(IITB-莫纳什研究学院) IIT Bombay(印度理工学院班加罗尔) Monash University(莫纳什大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出dinov3.seg,通过改进DINOv3模型实现开放词汇语义分割,结合文本嵌入与视觉特征,提升复杂场景下的分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19782 2026-03-23 cs.AI 57%

Embodied Science: Closing the Discovery Loop with Agentic Embodied AI

具身科学:通过代理具身AI闭合发现循环

Xiang Zhuang, Chenyi Zhou, Kehua Feng, Zhihui Zhu, Yunfan Gao, Yijie Zhong, Yichi Zhang, Junjie Huang, Keyan Ding, Lei Bai, Haofen Wang, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出具身科学框架,将科学发现视为闭环过程,结合代理推理与物理执行,通过感知-语言-行动-发现框架实现自主发现系统。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17432 2026-03-23 cs.CV 57%

AIFloodSense: A Global Aerial Imagery Dataset for Semantic Segmentation and Understanding of Flooded Environments

AIFloodSense:一个全球空中影像数据集,用于洪水环境的语义分割与理解

Georgios Simantiris, Konstantinos Bacharidis, Apostolos Papanikolaou, Petros Giannakakis, Costas Panagiotakis

机构 * Department of Management Science and Technology(管理科学与技术系) Hellenic Mediterranean University(希伯伦地中海大学) Institute of Computer Science, FORTH(信息科学研究所,FORTH)

专题命中 视觉定位与Grounding :visual question answering(abstract);分类 cs.CV

AI总结 本文提出AIFloodSense数据集,包含470张高分辨率图像,覆盖64个国家和六个大洲,支持图像分类、语义分割和视觉问答三个任务,旨在提升洪水环境的灾害评估能力。

Comments 36 pages, 19 figures, 8 tables

Journal ref Remote Sens. 2026, 18(6), 938

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19532 2026-03-23 cs.CL cs.IR cs.LG 57%

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19267 2026-03-23 cs.CL cs.IR 50%

Reviewing the Reviewer: Graph-Enhanced LLMs for E-commerce Appeal Adjudication

审查审查者:图增强的大语言模型用于电商争议裁决

Yuchen Du, Ashley Li, Zixi Huang

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出图增强的大语言模型,通过显式动作建模和冲突建模解决电商争议裁决中的信息不对称问题,提升裁决一致性。

Comments 10 pages, 3 figures, KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏