arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-11 至 2026-06-11 共收录 80 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2604.10242 2026-06-11 cs.CV 版本更新 70%

MedVeriSeg: Teaching LISA-Like Medical Segmentation Models to Verify Query Validity Without Extra Training

MedVeriSeg: 教授LISA-like医学分割模型验证查询的有效性而无需额外训练

Qinyue Tong, Xiaozhen Wang, Ziqian Lu, Jun Liu, Yunlong Yu, Zheming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空宇航学院) Southern Medical University(南方医科大学) School of Computer Science and Technology (School of Artificial Intelligence), Zhejiang Sci-Tech University(浙江科技学院计算机科学与技术学院(人工智能学院)) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MedVeriSeg,一种无需训练的查询验证框架,使LISA-like医学分割模型能够拒绝虚假分割查询。通过相似性响应质量评分模块和轻量级路由多代理验证模块,提升验证鲁棒性,并构建MedVeriSeg-Bench基准,有效减少幻觉分割。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11463 2026-06-11 cs.LG cs.AI 新提交 62%

LSTM-Based Detection of Structural Breaks in Property Insurance Loss Reserving: A Climate-Informed Approach

基于LSTM的财产保险损失准备金结构性断点检测:气候信息方法

Thomas Mbrice, Shashwat Panigrahi

机构 * Stony Brook University(石溪大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对气候变化导致传统精算方法失效的问题,提出使用LSTM神经网络检测结构性断点,在佛罗里达和路易斯安那州数据上预期将巨灾年份准备金精度提升15-20%,并给出理论保证。

Comments 15 pages, 0 figures, whitepaper YC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11286 2026-06-11 cs.LG cs.AI 新提交 62%

FreeBridge: Variational Schrödinger Bridges for Cellular Transition Dynamics

FreeBridge: 用于细胞转变动力学的变分薛定谔桥

Xurui Wang, Qin Ren, Jun Ma, Haibin Ling, Chenyu You

机构 * Stony Brook University(石溪大学) University of Toronto(多伦多大学) University Health Network(大学健康网络)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对高内涵成像中细胞扰动建模的端点监督问题,提出FreeBridge方法,通过变分薛定谔桥在固定细胞流形上学习随机传输,并利用经验潜在支持正则化约束中间路径,在保持端点保真度的同时减少中间支持违规。

Comments Accepted to MICCAI 2026 (early accept). Project page: https://y-research-sbu.github.io/FreeBridge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11199 2026-06-11 cs.CL cs.AI cs.IR cs.LG 新提交 62%

NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track

NightFeats @ MMU-RAGent NeurIPS 2025: 面向文本到文本轨道的上下文优化多智能体RAG系统

Quentin Fever, Naziha Aslam

机构 * NightFeats

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出一种结构化多智能体RAG系统NightFeats,通过检索、策展和组合三阶段分解知识合成,引入时序语义重排序、矛盾协调和引用保留架构,在MMU-RAGent竞赛中超越商业基线。

Comments 5 pages, 1 figure, 1 table. NeurIPS 2025 Competition Track (MMU-RAGent). System developed October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11546 2026-06-11 cs.CV 新提交 57%

VL-DINO: Leveraging CLIP Vision-Language Knowledge for Open-Vocabulary Object Detectio

VL-DINO: 利用CLIP视觉-语言知识进行开放词汇目标检测

Hao Zhang, Qinran Lin, Linqi Song, Yong Li

机构 * Chongqing University(重庆大学) City University of Hong Kong(香港城市大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出VL-DINO,通过QPSC模块构建高质量正样本增强视觉-语言对齐,VSE模块蒸馏CLIP视觉知识,ORSA模块对齐区域特征与文本嵌入,在LVIS零样本检测上达到36.3/38.1 AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11200 2026-06-11 cs.CL cs.CV 新提交 57%

Detecting AI-Generated Content on Social Media with Multi-modal Language Models

使用多模态语言模型检测社交媒体上的AI生成内容

Chenyang Yang, Shen Yan, Yibo Yang, Litao Hu, Yuchen Liu, Yuan Zeng, Hanchao Yu, Yinan Zhu, Sumedha Singla, Brian Vanover, Huijun Qian, Zihao Wang, Fujun Liu, Aashu Singh, Jianyu Wang, Xuewen Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对AI生成内容检测的泛化性差、单模态依赖和缺乏可解释性问题,提出基于多模态数据的紧凑视觉-语言模型,实现检测与解释,在公开基准和内部数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08558 2026-06-11 cs.LG stat.ML 版本更新 57%

Impact of Connectivity on Laplacian Representations in Reinforcement Learning

连通性对强化学习中拉普拉斯表示的影响

Tommaso Giorgi, Pierriccardo Olivieri, Keyue Jiang, Laura Toni, Matteo Papini

机构 * University of Edinburgh(爱丁堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了连通性对强化学习中拉普拉斯表示的误差影响,通过分析状态图的代数连通性,推导了线性价值函数近似误差的上界,并展示了表示学习管道中的端到端误差分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22934 2026-06-11 cs.AI 版本更新 57%

ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning

ProGRank: 探针梯度重排序以防御密集检索器RAG免受语料投毒攻击

Xiangyu Yin, Yi Qi, Chih-Hong Cheng

机构 * Chalmers University of Technology, Sweden(瑞典查尔姆斯理工大学) University of Leeds, United Kingdom(英国利兹大学) Carl von Ossietzky University of Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西特齐大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出ProGRank,一种无需训练的后处理检索器端防御方法,通过随机扰动下探针梯度提取不稳定信号并重排序,有效防御密集检索器RAG的语料投毒攻击。

Comments accepted by ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16415 2026-06-11 cs.CV 版本更新 57%

CountZES: Counting via Zero-Shot Exemplar Selection

CountZES: 通过零样本示例选择进行计数

Muhammad Ibraheem Siddiqui, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对零样本计数中示例质量差导致计数不准的问题,提出CountZES方法,通过检测锚定、密度引导和特征共识三阶段协同选择多样化示例,提升计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12028 2026-06-11 cs.RO 新提交 50%

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network

VICX: 通过视频生成和上下文操作网络实现可泛化的机器人操作

Song Chen, Linyan Xiang, Ying Zhou, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出VICX框架,利用冻结视频生成模型生成视觉计划,并通过视频到轨迹的上下文操作网络(V2T-ICON)将其映射为机器人可执行轨迹,实现跨任务、跨本体泛化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11424 2026-06-11 cs.CL 新提交 50%

SOMA-SQL: Resolving Multi-Source Ambiguity in NL-to-SQL via Synthetic Log and Execution Probing

SOMA-SQL: 通过合成日志和执行探测解决NL-to-SQL中的多源歧义

Sai Ashish Somayajula, Marianne Menglin Liu, Chuan Lei, Fjona Parllaku, Daniel Garcia, Rongguang Wang, Syed Fahad Allam Shah, Ankan Bansal, Sujeeth Bharadwaj, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI(甲骨文人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SOMA-SQL框架,通过合成查询日志和歧义驱动探测自动解决自然语言到SQL中的多源歧义,在6个基准上平均执行准确率提升13.0%。

Comments 34 pages, 1 figure, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11531 2026-06-11 cs.CL cs.IT math.IT 新提交 50%

Measuring language complexity from hierarchical reuse of recurring patterns

从重复模式的层次复用测量语言复杂度

Junyi Zhou, Rui Liu, Pengyu Liu, Yu Liu

机构 * Department of Systems Science, Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院系统科学系) International Academic Center of Complex Systems, Beijing Normal University(北京师范大学国际复杂系统学术中心) Department of Chinese Language and Literature, Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院中国语言文学系) Center for Linguistic Sciences, Beijing Normal University(北京师范大学语言学科学中心) School of Systems Science, Beijing Normal University(北京师范大学系统科学学院) Department of Mathematics and Applied Mathematical Sciences, University of Rhode Island(罗德岛大学数学与应用数学科学系) Department of Cell and Molecular Biology, University of Rhode Island(罗德岛大学细胞与分子生物学系)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出基于算法信息论的梯径指数,通过层次复用重复子结构测量语言复杂度,在21个平行语料库中验证了等复杂度假说和权衡假说。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2606.11477 2026-06-11 cs.CV cs.AI 新提交 79%

Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

迈向全自动考试评分:基于基础模型的笔迹答案公平性识别

Hartwig Grabowski

机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University(奥芬堡大学机器学习和分析研究所(IMLA))

专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出使用视觉-语言基础模型(VLM)识别手写答案,在61份考试(3141个答案位置)上达到98.4%准确率,并通过轻量提示将假阴性率降至0.58%,实现公平的全自动评分。

Comments 11 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 7 篇

2511.13207 2026-06-11 cs.RO cs.CV 版本更新 91%

PIGEON: VLM-Driven Object Navigation via Points of Interest Selection

PIGEON: 通过兴趣点选择的VLM驱动物体导航

Cheng Peng, Zhenzhe Zhang, Xiaobao Wei, Yanhao Zhang, Heng Wang, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Shanghang Zhang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出PIGEON框架,将物体导航建模为基于原始观测的稀疏决策问题,通过兴趣点(PoI)作为视觉决策单元,结合VLM选择关键点,实现零样本SOTA性能并迁移至主动具身问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11548 2026-06-11 cs.CV 版本更新 91%

How Auxiliary Reasoning Unleashes GUI Grounding in VLMs

辅助推理如何释放VLM中的GUI定位能力

Weiming Li, Yan Shao, Jing Yang, Yujing Lu, Ling Zhong, Yuhan Wang, Min Yu, Tongxiao Ruan, Manni Duan

机构 * Zhejiang Lab(浙江实验室) Hangzhou Research and Development Center(杭州研发中心) China Mobile(中国移动) Innovation Center of Yangtze River Delta(长江三角洲创新中心) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(title_cn,summary_cn);grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对VLM在GUI定位任务中隐式空间理解强但显式坐标输出弱的问题,提出三种零样本辅助推理方法(如标记网格),通过输入图像添加空间线索,显著提升定位性能,在多个基准上达到接近最优微调方法的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07332 2026-06-11 cs.LG cs.AI 版本更新 81%

Grounding Computer Use Agents on Human Demonstrations

基于人类演示的计算机使用智能体基础构建

Aarash Feizi, Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Kaixin Li, Rabiul Awal, Xing Han Lù, Johan Obando-Ceron, Juan A. Rodriguez, Nicolas Chapados, David Vazquez, Adriana Romero-Soriano, Reihaneh Rabbany, Perouz Taslakian, Christopher Pal, Spandana Gella, Sai Rajeswar

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) ServiceNow Research(ServiceNow研究) University of Waterloo(滑铁卢大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Polytechnique Montréal(蒙特利尔理工学院) École de Technologie Supérieure(高级技术学院) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 为解决桌面环境高质量基础数据稀缺问题,构建了包含87个应用、56K截图和3.56M人工标注的GroundCUA数据集,并基于此训练GroundNext模型,在5个基准上以少于先前十分之一的数据取得最优结果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08530 2026-06-11 cs.RO cs.AI 版本更新 70%

GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation

GEAR-VLA:学习几何感知的动作表示以实现可泛化的机器人操作

Yuan Zhang, Shiqi Zhang, Yedong Shen, Shuai Dong, Jiajun Deng, Xin Zhang, Yuxuan Gao, Jiajia Wu, Xin Nie, Zhiyuan Cheng, Jianmin Ji, Yanyong Zhang, Xingyi Zhang, Jia Pan

机构 * Anhui University(安徽大学) University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出GEAR-VLA框架,通过粗到细的动作学习、语义对齐的3D集成和具身规范化,学习统一的几何感知动作表示,实现跨物体、背景和机器人的泛化操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08195 2026-06-11 cs.CV 版本更新 70%

UI2Code^N: UI-to-Code Generation as Interactive Visual Optimization

UI2Code^N: 将UI到代码生成视为交互式视觉优化

Zhen Yang, Wenyi Hong, Mingde Xu, Xinyue Fan, Weihan Wang, Jiale Cheng, Xiaotao Gu, Jie Tang

机构 * Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出将UI截图转代码任务重构为交互式视觉优化问题,采用基于偏好的强化学习方法RVPO优化视觉排名,在UI起草、润色和编辑任务上达到SOTA。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 50%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18289 2026-06-11 cs.CL cs.CY cs.MA 版本更新 50%

Food4All: An Agentic Framework and Benchmark for Food Resource Navigation with Adaptive User Understanding

Food4All: 一种具有自适应用户理解能力的食物资源导航智能体框架与基准

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

机构 * University of Notre Dame(诺特大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 提出Food4All框架,结合食物搜索工具与300个多轮评估任务,在686个印第安纳食物资源上评估六种大语言模型,诊断其在约束条件处理和非理想用户交互中的不足。

Comments We have further refined the benchmark construction and experimental presentation to improve clarity and consistency. The revised version includes updated task design, food-resource data, and evaluation details to better align the benchmark with the intended food resource referral setting. These changes provide a more precise presentation of the experimental findings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 10 篇

2506.03933 2026-06-11 cs.CV cs.AI 版本更新 89%

Diffusion-based Cumulative Adversarial Purification for Vision Language Models

基于扩散的累积对抗净化方法用于视觉语言模型

Jia Fu, Yongtao Wu, Yihang Chen, Kunyu Peng, Xiao Zhang, Volkan Cevher, Sepideh Pashami, Anders Holst

机构 * KTH Royal Institute of Technology(皇家理工学院) Swiss Federal Institute of Technology Lausanne(洛桑联邦理工学院) University of California, Los Angeles(加州大学洛杉矶分校) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹中心) RISE Research Institutes of Sweden(瑞典RISE研究机构) Halmstad University(哈马碧大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出DiffCAP,一种基于扩散的对抗净化策略,通过理论证明对抗效应随扩散单调衰减,并利用噪声注入与VLM嵌入相似度阈值自适应净化,显著提升防御效果并加速去噪。

Comments Accepted to Transactions on Machine Learning Research (TMLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11266 2026-06-11 cs.LG 新提交 89%

Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models

碰撞前的预见:利用冻结视觉-语言模型的预期性安全强化学习

Samuel Tetteh, Cody Fleming

机构 * Iowa State University(爱荷华州立大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.LG

AI总结 提出VLM-Safe-RL框架,通过冻结视觉-语言模型生成预期性成本项,改进CMDP拉格朗日更新,在高速碰撞场景下实现安全与回报的平衡。

Comments 44pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11626 2026-06-11 cs.CV 新提交 83%

Adapting Vision-Language Models from Iconic to Inclusive for Multi-Label Recognition Without Labels

将视觉-语言模型从标志性适应到包容性:用于无标签的多标签识别

Cheng Chen, Jingyu Zhou, Yifan Zhao, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学计算机学院与青岛研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出无监督框架,通过“切割”和“缝合”两阶段适应VLMs,实现无标签的多标签图像识别,在四个数据集上超越现有无监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10198 2026-06-11 cs.LG cs.AI cs.CV 版本更新 82%

Density Ridge Selective Prediction for LLM and VLM Hallucination Detection under Calibration Label Scarcity

密度脊选择性预测:校准标签稀缺下的大语言模型与视觉语言模型幻觉检测

Nina I. Shamsi

机构 * Northeastern University Boston, United States(东北大学波士顿分校)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对校准标签稀缺时大语言模型和视觉语言模型的幻觉检测问题,提出基于核密度估计的密度脊方法,利用隐藏状态生成轨迹的六维运动特征图构建响应流形,通过到最近脊顶点的欧氏距离评分,在标签稀缺协议下AUROC提升5-20点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11874 2026-06-11 cs.AI 新提交 81%

AutoMine Solution for AV2 2026 Scenario Mining Challenge

AutoMine 解决方案:面向 AV2 2026 场景挖掘挑战

Songliang Cao, Jiele Zhao, Yuru Wang, Hao Li, Daqi Liu, Zehan Zhang, Fangzhen Li, Yu Wang, Yue Zhang, Bing Wang, Guang Chen, Hao Lu, Hangjun Ye

机构 * Xiaomi EV(小米汽车) Huazhong University of Science and Technology(华中科技大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 提出基于 LLM 和 VLM 的自优化场景挖掘方法 AutoMine,通过语义保持提示增强、鲁棒轨迹原子函数与 VLM 函数结合以及执行反馈优化,在 CVPR 2026 挑战赛中取得领先性能。

Comments CVPR 2026 Scenario Mining Challenge (Temporal Track Winners)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16651 2026-06-11 cs.CV cs.LG 版本更新 81%

Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations

正确预测,误导性解释:关于视觉-语言模型解释的脆弱性

Narges Babadi, Hadis Karimipour

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究探讨了视觉-语言模型中解释热图在对抗条件下是否忠实反映推理过程,提出X-Shift攻击揭示解释与预测行为的脱节,验证了解释机制的脆弱性。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15687 2026-06-11 cs.CL cs.AI 版本更新 79%

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

ASRU:激活引导与强化遗忘融合用于多模态大语言模型

Jiahui Guang, Haiyan Wang, Yingjie Zhu, Cuiyun Gao, Jing Li, Di Shao, Zhaoquan Gu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 ASRU提出一种可控多模态遗忘框架,通过激活引导和强化学习提升多模态大语言模型的遗忘效果和生成质量,实验显示在Qwen3-VL上遗忘效果提升24.6%,生成质量提升5.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12294 2026-06-11 cs.CV eess.IV 新提交 77%

Bridging the Modality Gap in Forensic Image Retrieval

弥合法医图像检索中的模态差距

Ricardo González-Gazapo, Annette Morales-González, Yoanna Martínez-Díaz, Heydi Méndez-Vázquez, Milton García-Borroto

机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。

Comments 23 pages, 5 figures, paper submitted to Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12258 2026-06-11 cs.CV 新提交 57%

Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning

连接昼夜:基于协同提示与原型学习的无监督跨域重识别

Jiyang Xu, Rui Liu, Hang Dai

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出无监督昼夜重识别框架,结合提示学习和原型表示学习,通过两阶段训练实现无标注跨域身份关联,性能媲美全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13631 2026-06-11 stat.CO 版本更新 50%

ProjGuard: Safety Monitoring for Computer-Use Agents via Low-Dimensional Projections

ProjGuard:通过低维投影实现计算机使用代理的安全监控

Kebin Contreras, Carlos Hinojosa, Jorge Bacca, Bernard Ghanem

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 ProjGuard通过行为轨迹监控实现计算机使用代理的安全防护,利用轻量级风险信号提前预警潜在危险,结合辅助视觉语言模型进行针对性修正,提升任务完成率并降低安全风险。

Comments The manuscript was submitted under an inappropriate category. In addition, substantial updates and improvements are currently being made to the document. To avoid confusion and ensure that readers access the most accurate version of the work, we request withdrawal of the current manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏