Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title);分类 cs.CV
Comments ICLR 2024 Workshop on Reliable and Responsible Foundation Models
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title);分类 cs.CV
Comments ICLR 2024 Workshop on Reliable and Responsible Foundation Models
从对齐到合成:用于文本到CT生成的对比体 grounding
机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) ; Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)
专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV、cs.AI
AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。
Comments Accepted at BMVC 2026
当提示词成为像素:面向多模态推理的提示词-区域定位
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型在视觉化任务语义场景下的准确率下降问题,提出提示词-区域定位方法,有效提升了基准测试准确率且无需OCR或区域元数据。
在跳跃前检测:视觉语言模型中的幻象检测
机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 针对视觉语言模型在缺乏视觉证据时产生自信但无根据回答的幻象问题,提出文本条件层内对齐方法,通过分析视觉编码器各层补丁令牌与问题嵌入的对齐轨迹,结合像素统计、零样本域路由和结构化自评估,实现高精度预响应幻象检测。
面向遥感图像的视觉-语言模型纯化半监督语义分割
机构 * Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) ; School of Automation, Southeast University(自动化学院,东南大学) ; College of Oceanography and Space Informatics, China University of Petroleum (East China)(海洋与空间信息学院,中国石油大学(华东))
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出SemiEarth模型,通过引入视觉-语言模型的伪标签纯化结构,提升遥感图像半监督语义分割的性能与可解释性。
3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究
机构 * Roblox Corporation(罗布乐思公司) ; Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) ; Computer Science Department, Stanford University(斯坦福大学计算机科学系) ; Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。
揭示视觉语言模型中的视觉计数瓶颈
机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.LG
AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。
Comments ICML 2026
基于双解耦视觉语言模型的零样本分心驾驶员检测
机构 * Chiba Institute of Technology(千叶工业大学) ; Institute of Science Tokyo(东京科学大学) ; Loughborough University(拉夫堡大学)
专题命中 视觉定位与Grounding :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 提出一种主体解耦框架,通过提取驾驶员外观嵌入并从图像嵌入中移除其影响,再结合度量投影正交化文本嵌入,实现零样本分心驾驶检测,显著提升实际场景性能。
Comments Accepted to IEEE 15th International Symposium on Communication Systems, Networks and Digital Signal Processing (CSNDSP 2026)
GROW$^2$:为机器人工具使用确定哪个物体和哪个部位
机构 * National University of Singapore(新加坡国立大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出GROW$^2$方法,通过分层语义和几何接地实现开放世界工具选择与部位定位,在零样本泛化中优于基线。
基于二级跟踪和强化学习验证的多模态大模型高效时空定位
机构 * Tsinghua University(清华大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。
MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力
机构 * Stanford University(斯坦福大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Instituto Tecnológico de Monterrey(蒙特雷技术学院) ; Monash University(墨尔本大学) ; University of Cambridge(剑桥大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);vision-language model(title);分类 cs.CV、cs.AI
AI总结 提出MMBU基准,涵盖35个子模态,通过分类、定位和检测任务系统评估VLM在生物医学领域的视觉感知和泛化能力,发现高准确率可能掩盖感知缺陷。
视觉-语言模型是否准备好进行饮食评估?探索AI驱动的食品图像识别的下一个前沿
机构 * Biometrics and Data Pattern Analytics Lab, Universidad Autonoma de Madrid(生物度量与数据模式分析实验室,马德里自治大学) ; IMDEA Food, CEI UAM+CSIC(IMDEA食品,CEI UAM+CSIC)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文评估了六种先进的视觉-语言模型在不同层次上的食品识别能力,提出了一个新的评估指标,并展示了FoodNExTDB数据库在饮食评估中的应用潜力。
Comments Accepted at IEEE/CVF Computer Vision and Pattern Recognition Conference workshops 2025 (CVPRw) 10 pages, 4 figures, 2 tables
Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, pp. 1-10
MPerS: 动态多模态大语言模型混合专家感知引导的遥感场景分割
机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Southwest Jiaotong University(西南交通大学)
专题命中 视觉定位与Grounding :MLLM(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出MPerS方法,通过设计多提示生成高质量遥感描述,结合DINOv3提取视觉特征,利用动态混合专家模块和语言查询引导注意力实现精准分割。
Comments Accepted to CVPR 2026 Findings. 11 pages, 6 figures
解码中的扰动:通过动态文本扰动缓解多模态大语言模型的幻觉
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Decoding by Perturbation方法,通过动态文本扰动缓解多模态大语言模型的幻觉问题,通过控制文本干预减少语言先验的影响,提升解码稳定性。
VGS-Decoding:基于视觉 grounding 分数的解码方法用于医疗 VLM 中的幻觉抑制
机构 * MBZUAI ; Rajiv Gandhi University of Knowledge Technologies(拉贾·甘地知识技术大学) ; Aarhus University(奥胡斯大学) ; Khalifa University(卡里玛大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG
AI总结 本文提出 VGS-Decoding 方法,通过视觉 grounding 分数指导解码以减少医疗 VLM 的幻觉问题,实验表明在多个数据集上取得了显著提升,且仅引入2倍推理开销。
AgriChat:一种用于农业图像理解的多模态大语言模型
机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。
LoV3D:通过区域体积评估在纵向3D脑MRI中实现认知预后推理
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 LoV3D通过纵向3D脑MRI的区域体积评估,实现认知预后推理,其核心方法是结合3D视觉-语言模型,通过区域解剖评估、纵向对比和诊断输出,提高诊断准确性与泛化能力。
看见、行动、适应:通过个性化VLM引导代理的主动感知用于无监督跨域视觉适应
机构 * Zhejiang University, Hangzhou, China(浙江大学)
专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 Sea$^2$通过智能姿态控制代理实现无监督跨域视觉适应,利用现成感知模型提升视觉任务性能。
MedReasoner: 通过强化学习实现从临床思维到像素级精度的推理 grounding
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 MedReasoner 通过强化学习实现从临床推理到像素级精度的医学影像 grounding,提出统一医学推理 grounding 任务和 U-MRG-14K 数据集,展示其在医学影像分析中的优越性能。
Comments AAAI2026
CrashChat: 一种多模态大语言模型用于多任务交通事故视频分析
机构 * Stony Brook University(石溪大学) ; The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 CrashChat是一种多模态大语言模型,用于多任务交通事故视频分析,通过任务解耦和分组策略提升事故识别、定位等任务的性能。
通过强化学习增强放射学报告生成和视觉基础识别
机构 * University of Zurich(苏黎世大学) ; ETH Zurich(苏黎世联邦理工学院) ; Zurich University of Applied Sciences(苏黎世应用科学大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本研究通过强化学习和思考机制提升放射学报告生成和视觉基础识别的性能,展示了在医学VLMs中RL作为SFT的有效补充。
Comments 10 pages main text (3 figures, 3 tables), 31 pages in total
Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位
机构 * University College London(伦敦大学学院) ; Chico Future AI Lab(芝加哥未来人工智能实验室) ; The University of Hong Kong(香港大学) ; Princeton University(普林斯顿大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。
机构 * Tel Aviv University(特拉维夫大学)
专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);LLaVA(abstract);grounding(abstract)
机构 * Tsinghua University(清华大学) ; Beijing Jiaotong University(北京交通大学) ; Inspur Yunzhou Industrial Internet Co., Ltd(Inspur云洲工业互联网有限公司)
专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments This work is accepted by AAAI 2026
机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,K.K Birla Goa校区) ; Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Human-aware Embodied AI Workshop @ IROS 2025
机构 * Independent Researchers(独立研究者)
专题命中 视觉定位与Grounding :VLM(title,abstract);vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(计算机视觉系,Mohamed Bin Zayed人工智能大学) ; School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Bytedance Seed(字节跳动种子) ; School of Computer Science, Qinghai Normal University(计算机科学学院,青海师范大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI