arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-18 至 2026-05-18 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 16 篇

2605.15951 2026-05-18 cs.CV 89%

From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

从失败到反馈:群体修订解锁对象级 grounding 的难题

Yuyuan Liu, Yiping Ji, Anjie Le, Jiayuan Zhu, Jiazhen Pan, Can Peng, Jiajun Deng, Fengbei Liu, Junde Wu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Technical University of Munich(慕尼黑技术大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出群体修订优化方法,通过生成改进候选响应提升硬案例学习效果,改进奖励和优势函数以增强高质量修订影响,优于现有GRPO方法。

Comments 8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16022 2026-05-18 cs.CV 87%

EndoGSim: Physics-Aware 4D Dynamic Endoscopic Scene Simulations via MLLM-Guided Gaussian Splatting

EndoGSim: 基于多模态大语言模型的物理感知4D动态内窥镜场景模拟

Changjing Liu, Yiming Huang, Long Bai, Beilei Cui, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong (CUHK)(香港中文大学电子工程系)

专题命中 视觉定位与Grounding :MLLM(title,summary_cn);分类 cs.CV

AI总结 本文提出EndoGSim框架,通过MLLM引导的高斯点散布实现内窥镜场景的物理感知重建与模拟,结合预训练分割和深度估计,提升手术模拟的真实性和准确性。

Comments Early Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16179 2026-05-18 cs.CV 85%

MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models

MAgSeg:利用多模态大语言模型对高分辨率卫星图像进行农业景观分割

Piyush Tiwary, Utkarsh Ahuja, Depanshu Sani, Aishwarya Jayagopal, Sagar Gubbi, Subhashini Venugopalan, Alok Talekar, Vaibhav Rajan

机构 * Google DeepMind(谷歌DeepMind) Google(谷歌) Indian Institute of Science(印度科学研究院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MAgSeg,一种无需视觉解码器的多模态大语言模型分割方法,有效解决南半球农业景观分割中的碎片化地块、高类内方差和标注数据稀缺问题,实现高效农业环境制图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15764 2026-05-18 cs.CV cs.AI 85%

GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

GRASP:学习多个人非语言互动中的社会推理

Junho Kim, Xu Cao, Houze Yang, Bikram Boote, Ana Jojic, Fiona Ryan, Bolin Lai, Sangmin Lee, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) Amazon AGI Korea University(亚马逊AGI韩国大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 GRASP通过连接高层社会问答与细粒度目光和指代手势事件,提升多个人非语言互动的社会推理能力,包含290万对问题-答案对,提出Social Grounding Reward提升模型性能。

Comments Project page: https://social-reaoning.github.io/grasp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15325 2026-05-18 cs.CV 84%

COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection

COPRA:基于强化学习的条件参数适应用于视频异常检测

Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He

机构 * Auburn University(奥本大学) Tencent Hunyuan(腾讯文元)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 COPRA通过生成输入特定的参数更新,动态适应冻结的VLM,提升视频异常检测的适应性和泛化能力,同时拓展到多选视频问答和密集标注等任务。

Comments Manuscript currently under review for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13805 2026-05-18 cs.CV cs.AI cs.LG 83%

RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition

RAR:用于视觉识别的检索与排序增强多模态大语言模型

Ziyu Liu, Zeyi Sun, Yuhang Zang, Wei Li, Pan Zhang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) MThreads, Inc.(MThreads公司) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 RAR结合CLIP的检索与MLLM的排序,提升细粒度识别精度,增强少样本和零样本任务表现。

Comments Project: https://github.com/Liuziyu77/RAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-05-18 cs.IR cs.AI cs.CL cs.MA 81%

Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10687 2026-05-18 cs.CV cs.AI 81%

OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL

OmniVL-Guard: 向统一视觉-语言伪造检测与定位迈进的平衡强化学习

Jinjie Shen, Jing Wu, Yaxiong Wang, Lechao Cheng, Shengeng Tang, Tianrui Hui, Nan Pu, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) Wuhan University, Wuhan, China(武汉大学) Lab for Intelligence and visiON (LION)(智能视觉实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出OmniVL-Guard,通过平衡强化学习解决多模态伪造检测与定位中的难度偏差问题,通过自演化CoT生成和自适应奖励缩放策略优化提升性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15997 2026-05-18 cs.CV 70%

Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning

分割、检测与解释:一种用于CT外观推理的统一框架

Yuyuan Liu, Can Peng, Yingyu Yang, Qianye Yang, Cheng Ouyang, J. Alison Noble

机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(生物医学工程研究所,工程科学系,牛津大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出统一框架,整合语言引导的视觉推理,提升CT图像分割与检测的精度,并提供外观推理输出。

Comments 8 pages, 4 figures, submitted to IEEE Transactions on Medical Imaging (TMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15711 2026-05-18 cs.CV 57%

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

EntropyScan: 向通过视觉注意力熵实现LVLMs的模型级后门检测

Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * China University of Geosciences(中国地质大学) University of the Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出EntropyScan,一种轻量且不依赖触发器的模型级后门检测方法,通过量化视觉注意力分布的结构扭曲来检测后门模型,实验显示其在两个LVLM架构和三种高级攻击场景中达到98.5%的F1分数和96.6%的AUC。

Comments 20 pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15708 2026-05-18 cs.CV 57%

3D Segmentation Using Viewpoint-Dependent Spatial Relationships

基于视角依赖空间关系的3D分割

Ayaka Nanri, Klara Reichard, Mert Kiray, Federico Tombari, Benjamin Busam, Asako Kanezaki

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出一个包含22万样本的3D参照分割数据集,通过密集视角采样扩展至数千万样本,研究视角依赖空间关系对3D大模型的影响,提升分割精度并提高mIoU至0.47。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15397 2026-05-18 cs.CV 57%

ELDOR: A Dataset and Benchmark for Illegal Gold Mining in the Amazon Rainforest

ELDOR:亚马逊雨林非法金矿开采的数据集和基准

Kangning Cui, Surendra Bohara, Suraj Prasai, Zishan Shao, Wei Tang, Martin Pillaca, Edwin Flores, Zhen Yang, Gregory Larsen, Evan Dethier, David Lutz, Jean-Michel Morel, Miles Silman, Victor Pauca, Fan Yang

机构 * Wake Forest University(威克森林大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Duke University(杜克大学) City University of Hong Kong(香港城市大学) Yale University(耶鲁大学) Alaska Spatial Science(阿拉斯加空间科学) Colby College(科林斯学院) Colby-Sawyer College(科林斯-萨威尔学院) Lingnan University(岭南大学) Centro de Innovación Cientifica Amazónica(亚马逊科学创新中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 ELDOR通过大规模无人机基准监测亚马逊雨林非法金矿开采对环境和景观的影响,包含2500多公顷的手动标注正射影像,涵盖采矿活动和生态结构的像素级语义标签,评估多种模型在细粒度和小规模结构识别上的性能。

Comments 70 pages, 35 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15202 2026-05-18 cs.AI cs.CL cs.IR 57%

DeepSlide: From Artifacts to Presentation Delivery

DeepSlide:从瑕疵到演示交付

Ming Yang, Zhiwei Zhang, Jiahang Li, Haoseng Liu, Yuzheng Cai, Weiguo Zheng

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DeepSlide是一种人机协同的多智能体系统,旨在优化演示全过程,从需求获取到脚本生成,提升演示的动态表现力和叙事流畅性。

Comments 37 pages,10 figures,9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05451 2026-05-18 cs.CV 57%

ViewBridge: Curriculum Knowledge Distillation for Activity View-Invariance Under Extreme Viewpoint Changes

ViewBridge:用于极端视角变化下的活动视角不变性的课程知识蒸馏

Arjun Somayazulu, Efi Mavroudi, Changan Chen, Lorenzo Torresani, Kristen Grauman

机构 * UT Austin(得克萨斯大学奥斯汀分校) Meta AI Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出ViewBridge框架,通过课程学习和知识蒸馏方法,在严重视角遮挡下学习丰富的视频表示,提升了极端视角变化下的活动识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05966 2026-05-18 cs.CL 50%

FinReporting: An Agentic Workflow for Localized Reporting of Cross-Jurisdiction Financial Disclosures

FinReporting: 一种用于跨司法管辖区财务披露本地化报告的代理工作流

Fan Zhang, Mingzi Song, Rania Elbadry, Yankai Chen, Shaobo Wang, Yixi Zhou, Xunwen Zheng, Yueru He, Yuyang Dai, Georgi Georgiev, Ayesha Gull, Muhammad Usman Safder, Fan Wu, Liyuan Meng, Fengxian Ji, Junning Zhao, Xueqing Peng, Jimin Huang, Yu Chen, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI The University of Tokyo(东京大学) Meiji Gakuin University(明治大学) McGill University(麦吉尔大学) Kyoto University(京都大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出FinReporting,一种代理工作流,用于跨司法管辖区的财务披露本地化报告。该系统构建了涵盖损益表、资产负债表和现金流量表的统一本体,将报告分解为可审计的阶段,并通过约束验证器提升一致性和可靠性。

Comments Accepted at ACL 2026 Demo Track. 9 pages, including figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15474 2026-05-18 cs.IR 50%

Jobs' AI Exposure Should Be Measured from Evidence, Not Model Priors

AI 对岗位的影响应从证据而非模型先验来衡量

Luca Mouchel, Pierre Bouquet, Yossi Sheffi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文主张通过基于证据的方法测量AI对岗位的影响,而非仅依赖LLM先验。提出一个检索增强框架,利用公开权重推理和检索到的新闻和论文摘要,为O*NET 30.2中的18796个职业-任务对分配AI影响标签,优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏