arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-17 至 2026-06-17 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 90%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12620 2026-06-17 cs.CV 90%

BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation

BusterX:基于MLLM的AI生成视频伪造检测与解释

Haiquan Wen, Yiwei He, Zhenglin Huang, Tianxiao Li, Zihan Yu, Xingru Huang, Lu Qi, Baoyuan Wu, Xiangtai Li, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University, SG(南洋理工大学) The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳)) Wuhan University(武汉大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 视觉定位与Grounding :MLLM(title,title_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出BusterX,一种基于多模态大语言模型的视频伪造检测系统,通过改进数据集和评估基准,提升检测准确性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14632 2026-06-17 cs.CV 版本更新 87%

BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM

BusterX++: 迈向基于MLLM的统一跨模态AI生成内容检测与解释

Haiquan Wen, Tianxiao Li, Zhenglin Huang, Yiwei He, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学)

专题命中 视觉定位与Grounding :MLLM(title,title_cn);visual reasoning(abstract);分类 cs.CV

AI总结 提出统一多模态大模型BusterX++,通过纯强化学习策略实现图像与视频伪造检测的跨模态能力迁移,性能超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17433 2026-06-17 cs.CV 新提交 84%

LADBench: A Benchmark for Logical Fault Detection in Images

LADBench: 图像中逻辑故障检测的基准

Sahasra Kondapalli, Lara Radovanovic, Aadi Palnitkar, Mingyang Mao, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学)

专题命中 视觉定位与Grounding :VLM(summary_cn);vision language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 提出LAD-Bench基准,包含1000多张合成图像的四域逻辑异常,通过分层提示协议评估模型,揭示现有VLM在隐式逻辑故障检测上的不足。

Comments Accepted to the IEEE International Conference on Development and Learning (ICDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18242 2026-06-17 cs.CV 新提交 81%

EventDrive: Event Cameras for Vision-Language Driving Intelligence

EventDrive: 用于视觉-语言驾驶智能的事件相机

Dongyue Lu, Rong Li, Ao Liang, Lingdong Kong, Wei Yin, Lai Xing Ng, Benoit R. Cottereau, Camille Simon Chane, Wei Tsang Ooi

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) Horizon Robotics(地平线机器人) A*STAR, I2R(新加坡科技研究局,资讯通信研究院) IPAL, CNRS IRL 2955, Singapore(IPAL,法国国家科学研究中心国际联合实验室2955,新加坡) University Toulouse, CNRS, CerCo, Toulouse, France(图卢兹大学,法国国家科学研究中心,CerCo,法国图卢兹) ETIS UMR 8051, CY Cergy Paris University, ENSEA, CNRS, France(ETIS UMR 8051,CY塞尔吉-巴黎大学,ENSEA,法国国家科学研究中心,法国)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出EventDrive基准和模型套件,通过多时域事件金字塔和时域混合专家模块融合事件流与RGB帧,在感知、理解、预测和规划四维度提升驾驶推理性能。

Comments CVPR2026, 34 pages, 15 figures, 15 tables, project page: https://dylanorange.github.io/projects/eventdrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17477 2026-06-17 cs.CV cs.LG 新提交 81%

Theoretical Grounding of Out-Of-Distribution Detection With Reinforcement Learning Optimizer

基于强化学习优化器的分布外检测的理论基础

Salimeh Sekeh, Xin Zhang

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种强化学习引导的优化器,通过修正梯度下降更新来降低语义分布外误报率,理论分析了模型变化和环境变化对泛化误差的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25886 2026-06-17 cs.MM 版本更新 78%

MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding

MarkIt: 免训练视觉标记用于精确视频时间定位

Pengcheng Fang, Yuxia Chen, Xiaohao Cai

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18134 2026-06-17 eess.AS 新提交 71%

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

通过说话人日志条件将口语大语言模型扩展到多说话人音频

Alexander Polok, Samuele Cornell, Sathvik Udupa, Jan Černocký, Shinji Watanabe, Lukáš Burget

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出基于说话人日志条件的口语语言模型,通过条件化声学编码器提取目标说话人表示,避免序列化输出训练导致的灾难性遗忘,在多个数据集上显著提升说话人属性转录性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17246 2026-06-17 cs.CV cs.MA 新提交 70%

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。

Comments 28 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17904 2026-06-17 cs.AI 新提交 57%

DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

DiagFlowBench:评估语言模型在基于规程的诊断对话中如何处理偏离规程输入

Guillermo Gil de Avalle, Laura Maruster, Shaina Raza, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出DiagFlowBench基准,包含50个工业诊断流程图转化的1676轮对话,评估10个模型在识别偏离规程输入时的表现,发现模型常选择真实但不恰当的步骤而非捏造事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17809 2026-06-17 cs.CV 新提交 57%

Million-scale multimodal pollen microscopy with expert-guided foundation models

百万级多模态花粉显微镜图像与专家引导的基础模型

András Biricz, Björn Gedda, Donát Magyar, Antonio Spanu, János Fillinger, Péter Pollner, István Csabai

机构 * Department of Physics of Complex Systems, ELTE Eötvös Loránd University(ELTE罗兰大学复杂物理系) The Palynological Laboratory at the Swedish Museum of Natural History(瑞典自然历史博物馆孢粉学实验室) National Centre for Public Health and Pharmacy(国家公共卫生与药品中心) INRAE, UR 546 BioSP, Site Agroparc(法国国家农业、食品与环境研究院,UR 546 BioSP,阿格罗帕克园区) National Korányi Institute for Pulmonology(国家科拉尼肺病研究所) Health Data Science and AI Knowledge Centre, Health Services Management Training Centre, Faculty of Health and Public Administration, Semmelweis University(塞梅维什大学健康与公共管理学院卫生服务管理培训中心健康数据科学与人工智能知识中心) Department of Biological Physics, ELTE Eötvös Loránd University(ELTE罗兰大学生物物理系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出百万级多模态花粉显微镜数据集Pollen AI Atlas,结合专家引导的视觉-语言模型生成形态描述,实现跨区域、跨设置的高精度花粉识别与检索。

Comments 31 pages, 5 main figures, supplementary information included. Submitted to Scientific Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17735 2026-06-17 cs.AI 新提交 57%

Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs

打破自回归诅咒:动态认知熵编排的可擦除强化学习用于大语言模型

Ziliang Wang, Kang An, Faqiang Qian, Jialu Cai, Cijun Ouyang, Yuhang Wang, Qibing Ren, Yichao Wu

机构 * SenseTime(商汤科技) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出动态认知熵编排的可擦除强化学习(E³RL),通过将模型内生的局部自回归交叉熵作为认知不确定性坐标,利用分段自适应动态阈值和优势分配精准切除逻辑缺陷并重用KV缓存,解决长序列推理中的自回归级联崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17310 2026-06-17 cs.CV 新提交 57%

SierpinskiCam: Camera-Controlled Video Retaking with Sierpinski Triangle Pattern Cues

SierpinskiCam: 基于谢尔宾斯基三角形图案线索的相机控制视频重拍

Suttisak Wizadwongsa, Hyelin Nam, Supasorn Suwajanakorn, Jeong Joon Park

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) VISTEC, Thailand(泰国威斯泰克科学技术研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出SierpinskiCam方法,通过谢尔宾斯基圆顶纹理线索增强几何引导,并引入参考视频条件机制,解决单目视频重拍中相机大角度偏离时的稀疏区域问题,提升相机可控性、几何一致性和视频质量。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24696 2026-06-17 cs.CV 版本更新 57%

NeuroClaw Technical Report

NeuroClaw 技术报告

Cheng Wang, Zhibin He, Zhihao Peng, Shengyuan Liu, Yufan Hu, Carl Yang, Lifang He, Lichao Sun, Xiang Li, Yixuan Yuan

机构 * Electronic Engineering Department, The Chinese University of Hong Kong, China(香港中文大学电子工程系) School of Electronic Information, Northwest University, China(西北大学电子信息学院) Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系) Computer Science and Engineering, Lehigh University, Bethlehem, PA, USA(莱斯利大学计算机科学与工程系) Department of Radiology, Massachusetts General Hospital, Boston, MA, USA(麻省总医院放射科) Kempner Institute for Natural and Artificial Intelligence, Harvard University, Cambridge, MA, USA(哈佛大学自然与人工智能研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对神经影像学中多模态数据、长流程和可重复性挑战,提出NeuroClaw多智能体研究助手,通过数据驱动决策、环境管理和三层技能架构实现可执行可复现的神经影像分析,并在NeuroBench基准上显著优于直接调用智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17616 2026-06-17 cs.LG 版本更新 57%

Conditional Attribution for Root Cause Analysis in Time-Series Anomaly Detection

时间序列异常检测中根因分析的条件归因

Shashank Mishra, Karan Patil, Cedric Schockaert, Didier Stricker, Jason Rambach

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Paul Wurth S.A(保罗·沃思公司) Rheinland-Pfälzische Technische Universität Kaiserslautern-Landau(莱茵河-巴尔夫技术大学凯撒斯劳滕-兰道)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出一种条件归因框架,通过检索与异常观测上下文相似的正态实例进行依赖保持的解释,结合变分自编码器和UMAP流形嵌入实现高维时间序列的高效归因,并在SWaT和MSDS基准上提升了根因识别准确率与鲁棒性。

Comments Accepted at ECML PKDD. 16 pages, 8 figures, 13 tables, and an appendix

Journal ref ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19528 2026-06-17 stat.ML cs.LG math.ST stat.TH 版本更新 57%

Learning Upper Lower Value Envelopes to Shape Online RL: A Principled Approach

学习上下值包络以塑造在线强化学习:一种原则性方法

Sebastian Reboul, Hélène Halconruy

机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris) Wiremind Cargo 16 Bd Poissonnière 75009 Paris Modal’X, Université Paris-Nanterre, 92000 Nanterre(Modal’X, Université Paris-Nanterre, 92000 Nanterre)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出一种两阶段框架,利用离线数据学习值函数的上下界,并将其融入在线算法,通过解耦上下界实现更灵活紧致的近似,理论分析给出高概率遗憾界,实验表明显著降低遗憾。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18103 2026-06-17 cs.CL cs.IR 新提交 50%

HistoRAG: Embedding Historical Methodology in Retrieval-Augmented Generation Through Critical Technical Practice

HistoRAG:通过批判性技术实践将历史方法论嵌入检索增强生成

Noah J. Kim-Baumann, Torsten Hiltmann

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对历史学等解释性学科,提出HistoRAG框架,通过分离检索与生成、时间窗口化、LLM作为评判者等架构干预,将历史编纂原则转化为RAG设计,解决标准RAG中的时间偏差、相关性评估等问题。

Comments 25 pages, 6 figures. Companion preprint to a Journal of Digital History notebook article (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17861 2026-06-17 cs.CL 新提交 50%

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

GameCraft-Bench:智能体能否在真实游戏引擎中端到端构建可玩游戏?

Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan Liu, Xin Lai, Chenxin Li, Yiduo Guo, Zhexin Zhang, Xinyuan Wang, Tianyi Bai, Ziniu Li, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Hunyuan Team, Tencent(腾讯混元团队) USTB(北京科技大学) DualverseAI SJTU(上海交通大学) NUS(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出GameCraft-Bench基准,评估编码智能体在Godot引擎中端到端生成可玩游戏的能力,最强智能体仅达41.46%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17688 2026-06-17 cs.CL 新提交 50%

LLMs Infer Cultural Context but Fail to Apply It When Responding

LLMs 能推断文化背景但在回应时未能应用

Yisong Miao, Jian Zhu, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究大型语言模型在生成文化适应性回应时,能否根据用户文化背景使用本地计量单位。提出CAPRI数据集,实验发现模型能推断文化背景但常未能应用,除非明确提示。

Comments 9 pages, 7 figures, 2 tables (24 pages, 12 figures, 8 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18009 2026-06-17 physics.soc-ph nlin.AO physics.hist-ph physics.pop-ph 新提交 50%

Making Sense of Symbols: Yin and Yang in Zurich

解读符号:苏黎世的阴阳

Frank Schweitzer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过苏黎世纬度上的白天时长模型,将阴阳符号与昼夜和季节现象关联,并揭示其几何中的黄金比例与公历的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16009 2026-06-17 cs.CL cs.HC 新提交 50%

Bridging the Usability Gap: Lessons from Interpreting Studies for Machine Interpreting Design

弥合可用性差距:口译研究对机器口译设计的启示

Claudio Fantinuoli

机构 * University of Mainz(美因茨大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文定义机器口译为语音翻译的子领域,指出其存在“准确性幻觉”,并借鉴口译研究提出未来设计的三个优先方向:能动性、共同基础与体验,以弥合可用性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02854 2026-06-17 cs.PL cs.LO math.CT 版本更新 50%

Fixed-Point Scaffolding in the Clef Programming Language

Clef 编程语言中的不动点脚手架

Houston Haynes

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于不动点组合子的编译器中间表示方法,通过范畴论构造实现类型结构保持和正确性验证,并利用 MLIR 工具链支撑实际编译。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏