arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-29 至 2026-05-29 共收录 86 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2605.30231 2026-05-29 cs.CV cs.AI 88%

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

超越3D VQA:将3D空间先验注入视觉-语言模型以增强几何推理

Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao

机构 * FAIR at Meta(Meta的FAIR)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出GASP框架,通过将几何先验注入LLM的Transformer层,利用对比损失和深度一致性监督训练,显著提升VLM的3D空间推理能力,在多个基准上取得大幅提升。

Comments CVPR 2026. Project page: https://danielchyeh.github.io/GASP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21979 2026-05-29 cs.CV cs.AI 86%

Benchmarking and Mitigating Sycophancy in Medical Vision Language Models

医疗视觉语言模型中的谄媚行为基准测试与缓解

Juangui Xu, Zikun Guo, Jingwei Lv, Hongbin Lin, Shu Yang, Jun Wen, Di Wang, Lijie Hu

机构 * MBZUAI Saarland University(萨尔兰大学) HKUST(GZ)(香港科技大学(广州)) KAUST(卡塔尔大学)

专题命中 视觉问答 :vision language model(title);VLM(abstract_cn);visual language model(abstract);visual question answering(abstract)

AI总结 针对医疗视觉语言模型中的谄媚问题,提出分层医疗视觉问答基准和VIPER策略,通过过滤非证据社会线索减少谄媚,提升模型鲁棒性。

Comments 19figures, 61pages. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29074 2026-05-29 cs.CV cs.RO 85%

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models

Embodied3DBench: 视觉语言模型低级具身空间智能的基准测试

Jiyao Zhang, Mingxu Zhang, Yitong Peng, Haoxuan Liu, Chenshuo Wang, Yuxing Long, Haoyang Huang, Dongjiang Li, Nan Duan, Hui Shen, Hao Dong

机构 * CFCS, School of CS, PKU(计算机学院CFCS,北京大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出Embodied3DBench基准,通过6类任务(空间结构理解与交互导向感知)系统评估视觉语言模型在3D环境中的低级空间智能,并合成130万QA对训练数据以弥补能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29462 2026-05-29 cs.CV cs.AI 81%

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset

大型视觉语言模型在CFMME上的基准测试:一个全面的中文金融多模态评估数据集

Qian Chen, Xianyin Zhang, Yanzhi Liu, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文言金团队,阿里云计算)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出CFMME,一个包含6052个实例的中文金融多模态评估基准,涵盖八种主要金融图像模态和四项核心多模态任务,用于评估LVLMs在金融业务全流程中的感知、理解、推理和认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29591 2026-05-29 cs.AI 74%

Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

Mind-Omni:通过离散扩散实现脑-视觉-语言建模的统一多任务框架

Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

机构 * NeuBCI Lab, State Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Future Technology, University of Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China Zhongguancun Academy, Beijing, China Peking University, Beijing, China

专题命中 视觉问答 :vision-language model(title);分类 cs.AI

AI总结 提出Mind-Omni框架,利用离散扩散范式统一七种编码与解码任务,通过脑分词器将连续脑信号转化为离散令牌,实现多模态交互,并构建脑问答指令调优数据集,在多项任务上达到或超越专用模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29402 2026-05-29 cs.CV cs.AI 73%

Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge

面向高效长视频推理的语义与视觉证据:HD-EPIC VQA挑战赛的解决方案

Yinsong Xu, Wei Jing, Liuxin Zhang, Wanjun Lv, Hui Li

机构 * Lenovo, China(联想(中国))

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出一种统一框架,通过解耦长视频推理为语义证据(粗到细提取全局过程结构)和视觉证据(基于目标的细粒度定位),并采用查询条件证据检索与整合,在HD-EPIC VQA挑战赛中取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11389 2026-05-29 cs.AI 57%

Causal-JEPA: Learning World Models through Object-Level Latent Masking

Causal-JEPA:通过对象级潜在掩码学习世界模型

Heejeong Nam, Quentin Le Lidec, Lucas Maes, Yann LeCun, Randall Balestriero

机构 * Brown University, GalilAI(布朗大学,GalilAI) New York University(纽约大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 提出C-JEPA,一种通过对象级潜在掩码扩展联合嵌入预测的对象中心世界模型,在视觉问答和智能体控制任务中分别提升反事实推理20%和仅用1%潜在特征实现高效规划。

Comments Project Page: https://hazel-heejeong-nam.github.io/cjepa/ ICML 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29339 2026-05-29 cs.CV 57%

DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

DMC-CF: 用于因果推理的动态多模态反事实QA基准

Junzhe Zhang, Huixuan Zhang, Guirong Wang, Xingyao Zhang, Pei Liu, Lin Qu, Hu Wei, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Alibaba Group(阿里巴巴集团)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对现有因果推理数据集规模有限或基于非真实数据的问题,提出基于真实视频的大规模多模态因果反事实推理基准DMC-CF-Static,并利用动态图干预框架构建动态评估基准DMC-CF-Dynamic,实验表明当前多模态大模型在真实场景下的因果推理能力仍需大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29084 2026-05-29 cs.CL cs.AI cs.IR 57%

Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG

同一问题,不同来源,不同答案:审计医学多源RAG中的来源依赖性

Yubo Li, Rema Padman, Ramayya Krishnan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出来源依赖性作为NLP评估缺失的维度,通过构建移植患者教育基准TransplantQA、分层检索策略HERO-QA和结构化输出评判器,审计多源RAG系统中同一问题因检索来源不同而给出不同答案的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 16 篇

2603.23085 2026-05-29 cs.AI 89%

When Models Learn to Ask Why: Adaptive Causal Reasoning for Trustworthy Medical Vision-Language Models

当模型学会问为什么:面向可信医疗视觉语言模型的自适应因果推理

Jianxin Lin, Chunzheng Zhu, Peter J. Kneuertz, Yunfei Bai, Yuan Xue

机构 * The Ohio State University(俄亥俄州立大学) Hunan University(湖南大学) Amazon(亚马逊)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 提出MedCausalX框架,通过因果推理链、自适应反射架构和轨迹级因果校正,解决医疗VLM中的虚假相关和推理不一致问题,显著提升诊断一致性和减少幻觉。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30161 2026-05-29 cs.CV 85%

Why Far Looks Up: Probing Spatial Representation in Vision-Language Models

为什么远处看起来在上方:探究视觉-语言模型中的空间表征

Cheolhong Min, Jaeyun Jung, Daeun Lee, Hyeonseong Jeon, Yu Su, Jonathan Tremblay, Chan Hee Song, Jaesik Park

机构 * Seoul National University(首尔国立大学) The Ohio State University(俄亥俄州立大学) NVIDIA(英伟达)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 通过最小对比对分析,发现视觉-语言模型存在垂直-距离纠缠(将图像垂直位置与距离混淆),这种透视偏差导致性能差距,并随数据规模扩大而加剧,而具有良好分离空间轴的模型更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29496 2026-05-29 cs.CL cs.CV 84%

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

视觉语言模型后训练中推理与感知的非对称优化研究

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV;VLM(comments)

AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。

Comments Project: https://asymmetric-vlm-post-training.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29446 2026-05-29 cs.AI 83%

CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials

CrystalXRD-Bench:面向多种晶体材料的XRD峰索引的视觉-语言模型基准测试

Chengliang Xu, Xiaogang Li, Peiyao Xiao, Beng Wang, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.AI

AI总结 提出CrystalXRD-Bench基准,通过250个样本评估视觉-语言模型从粉末XRD图谱中识别米勒指数(HKL)的能力,发现最佳模型Jaccard得分仅0.5888,任务远未解决。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29951 2026-05-29 cs.AI cs.CL cs.LG cs.MM 79%

MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization

MuPHI: 通过语义基础奖励优化学习隐式多模态有害推理

Anisha Saha, Varsha Suresh, Teodora Kamova, Sophia Wiedmann, Timothy Hospedales, Vera Demberg

机构 * Max Planck Institute for Informatics(马克斯·普朗克院信息研究所) Saarland Informatics Campus(萨尔兰州信息校园) Saarland University(萨尔兰州大学) The University of Edinburgh(爱丁堡大学) Samsung AI Center, Cambridge(三星AI中心,剑桥)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 针对视觉语言模型在隐式跨模态有害语义推理上的不足,提出MuPHI数据集和MuPHIRM训练框架,通过多视角奖励优化联合语义学习,提升有害检测与推理质量及分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10228 2026-05-29 cs.AI 77%

SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning

SVSR:一种用于多模态推理的自我验证与自我修正范式

Zhe Qian, Nianbing Su, Zhonghua Wang, Hebei Li, Zhongxing Xu, Yueying Li, Fei Luo, Zhuohan Ouyang, Yanbiao Ma

机构 * South China Agricultural University(华南农业大学) University of Glasgow(格拉斯哥大学) University of Electronic Science and Technology of China(电子科技大学) Monash University(莫纳什大学) University of Science and Technology of China(中国科学技术大学) National University of Defense Technology(国防科技大学) Renmin University of China(中国人民大学) South China Normal University(华南师范大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出SVSR框架,通过三阶段训练(统一偏好数据集构建、冷启动监督微调、半在线直接偏好优化)将自我验证与自我修正显式集成到多模态推理流程中,提升复杂视觉理解和多模态推理的鲁棒性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21746 2026-05-29 cs.CV 77%

Getting to the Point: Pointing Improves LVLMs at Counting

直击要点:指向提升LVLMs的计数能力

Simone Alghisi, Massimo Rizzoli, Seyed Mahed Mousavi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 提出Point-then-Count方法,通过生成目标物体坐标进行零样本计数,在多个LVLM上取得最高准确率,并揭示坐标编码的空间信息是性能提升的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29894 2026-05-29 cs.CV 74%

Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

训练智能体而非专家:学习利用异构专家进行多轮视觉推理

Yaowu Fan, Tao Han, Dazhao Du, Andy J. Ma, Jia Wan

机构 * Sun Yat-sen University(中山大学) HKUST(香港科技大学) Harbin Institute of Technology(哈尔滨理工大学)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

AI总结 提出VisHarness,一种可训练的视觉智能体,通过解耦高层感知推理与低层任务执行,学习利用异构视觉专家模型,以轻量训练实现多轮交互下的通用视觉任务求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30318 2026-05-29 cs.GR cs.AI cs.CV 73%

Before the Shutter: Aesthetic and Actionable Portrait Photography Planning in 3D Scenes

快门之前:3D场景中美学的且可执行的人像摄影规划

Ruixiang Jiang, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出在3D场景中生成人像姿态、相机、照明和曝光方案的方法,通过构建摄影场景图实现美学引导的规划,生成视觉上引人注目且几何与光度可行的人像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27959 2026-05-29 cs.CV cs.AI 73%

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning

ROVER: 面向对象中心视觉证据的路由用于基于多图像推理

Guannan Lv, Ren Nie, Hongjian Dou, Tingting Gao

机构 * Kuaishou Technology(快手科技)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出ROVER,一种轻量级可学习插件,通过对象中心差分注意力聚合上下文、蒸馏图像内线索并路由历史感知证据,实现高效全局视觉证据路由,在多图像推理中提升答案和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30346 2026-05-29 cs.CV 70%

YoCausal: How Far is Video Generation from World Model? A Causality Perspective

YoCausal: 视频生成距离世界模型还有多远?一个因果视角

You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, Zhixiang Wang

机构 * National Yang Ming Chiao Tung University Shanda AI Research Tokyo

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出YoCausal基准,通过时间反转真实视频生成反事实样本,利用反向惊奇指数(RSI)和因果认知指数(CCI)评估视频扩散模型的因果理解能力,发现模型感知时间方向不等于理解因果关系,与人类水平存在显著差距。

Comments Project page: https://www.youzhexie.me/papers/YoCausal/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18859 2026-05-29 cs.AI cs.CL cs.LG 62%

RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models

RewardFlow: 面向大语言模型智能体强化学习的拓扑感知状态图奖励传播

Xiao Feng, Bo Han, Zhanke Zhou, Jiaqi Fan, Jiangchao Yao, Ka Ho Li, Dahai Yu, Michael Kwok-Po Ng

机构 * TMLR Group(TMLR小组) Hong Kong Baptist University(香港 Baptist大学) TCL Corporate Research (HK) Co Ltd(TCL企业研究(香港)有限公司) Cooperative Medianet Innovation Center Shanghai Jiao Tong University(合作中位网创新中心上海交通大学) Department of Mathematics Hong Kong Baptist University(香港 Baptist大学数学系)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出RewardFlow方法,通过构建状态图进行拓扑感知的奖励传播,为智能体推理提供无标注的密集奖励,显著提升强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29643 2026-05-29 cs.CV cs.MA 57%

AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning

AgentCVR:通过脚本模拟强化学习的主动多智能体跨视频推理

Yilun Qiu, Jiahe Wang, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Chun Yuan

机构 * Xiaohongshu Inc.(小红书公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出AgentCVR多智能体框架,将跨视频推理视为主动证据获取任务,通过主智能体协调视觉和音频智能体进行定向证据提取,并引入脚本模拟强化学习优化策略,在跨视频对齐和定位任务上超越单次基线,达到与闭源系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29602 2026-05-29 cs.CV 57%

CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning

CogniVerse: 用认知反思与几何推理革新多模态检索增强生成

Xiang Fang, Wanlong Fang, Changshuo Wang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出CogniVerse框架,通过认知反思模块、基于黎曼流形对齐的多模态检索模块和最优传输层次生成模块,解决多模态检索增强生成中的噪声检索、跨模态语义错位和生成不连贯问题。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10219 2026-05-29 cs.AI 57%

Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models

认知支点与视觉锚定:揭示并纠正多模态推理模型中的幻觉

Zhe Qian, Yanbiao Ma, Zhuohan Ouyang, Zhonghua Wang, Zhongxing Xu, Fei Luo, Xinyu Liu, Zongyuan Ge, Yike Guo, Jungong Han

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 龙城人工智能学院) South China Agricultural University(华南农业大学) South China Normal University(华南师范大学) Monash University(莫纳什大学) Jishou University(吉首大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

AI总结 针对多模态大推理模型在长链推理中易产生幻觉的问题,提出V-STAR训练范式,通过分层视觉注意力奖励和强制反思机制,将视觉锚定引入推理过程以减轻幻觉。

Comments TPAMI under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29458 2026-05-29 cs.CL cs.AI 57%

Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment

面向LLM人格模拟的自适应访谈:基于证据的推理提升决策对齐

Ruoxi Su, Yuhan Liu, Jingyu Hu

机构 * University of Cambridge(剑桥大学) Independent Researcher(独立研究员)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 提出自适应访谈框架,通过结构化三阶段对话收集人格相关信息,并基于访谈记录评估LLM在道德困境场景中模拟个体决策的能力,发现基于后续追问的证据推理能显著提升预测准确性。

Comments 20 pages, 2 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 21 篇

2605.29585 2026-05-29 cs.CL 89%

World Models in Words: Auditing Physical State-Transition Commitments in Vision-Language Models

语言中的世界模型:审计视觉语言模型中的物理状态转换承诺

Emmanuelle Bourigault

机构 * University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)

AI总结 提出WMW框架,通过要求VLM输出结构化轨迹(初始状态、状态转换、结果状态和答案)并利用混合验证器检查模式有效性、状态基础、转换一致性和答案-轨迹兼容性,揭示仅评估最终答案所隐藏的物理推理失败。

Comments 8 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29325 2026-05-29 cs.CV 89%

Multi-Stage VLM Pipeline for Zero-Shot Traffic Accident Understanding

用于零样本交通事故理解的多阶段VLM流水线

Fumiya Tatematsu, Fumihiko Takahashi

机构 * GO Drive Inc(GO Drive公司)

专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(abstract);分类 cs.CV

AI总结 提出一个三阶段VLM流水线,在冻结的Qwen3-VL-32B-Instruct和235B MoE模型上实现零样本交通事故预测,通过9:1融合和车辆检测对齐赢得CVPR 2026 ACCIDENT挑战赛。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 13. Code: https://github.com/fuumin621/cvpr2026-accident-1st-place-solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30140 2026-05-29 cs.CV 86%

AnomalyAgent: Training-Free Agentic Models for Zero-/Few-Shot Anomaly Detection

AnomalyAgent: 用于零样本/少样本异常检测的无训练智能体模型

Yi Zhang, Jiawen Zhu, Lele Fu, Guansong Pang

机构 * Singapore Management University(新加坡国立管理学院) Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);MLLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract)

AI总结 提出一种基于多模态大语言模型的无训练智能体框架AnomalyAgent,通过定制工具集和记忆模块实现零样本/少样本异常检测,在逻辑/上下文异常等复杂场景中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30307 2026-05-29 cs.CV 85%

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);VLM(abstract_cn);grounding(abstract)

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18527 2026-05-29 cs.CV cs.AI cs.SD 81%

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

JAEGER:模拟物理环境中的联合3D音频-视觉定位与推理

Zhan Liu, Changli Tang, Yuxin Wang, Zhiyuan Zhu, Youjun Chen, Yiwen Shao, Tianzi Wang, Lei Ke, Zengrui Jin, Chao Zhang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯AI实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 提出JAEGER框架,通过集成RGB-D观测和多通道一阶环境声学,将音频-视觉大语言模型扩展到3D空间,实现联合空间定位与推理,并引入神经强度向量(Neural IV)提升声源方向估计的鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏