arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2511.07957 2026-03-05 astro-ph.IM astro-ph.HE 67%

In-Orbit GRB Identification Using LLM-based model for the CXPD CubeSat

利用基于大语言模型的模型进行轨道上伽马射线暴识别

Cunshi Wang, Zuke Feng, Difan Yi, Yuyang Li, Lirong Xie, Huanbo Feng, Yi Liu, Qian Liu, Yang Huang, Hongbang Liu, Xinyu Qi, Yangheng Zheng, Ali Luo, Guirong Xue, Jifeng Liu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出基于大语言模型的轨道上伽马射线暴识别方法,通过模拟数据训练模型,实现高精度分类和光谱指数估计,为未来轨道上实时GRB检测提供技术基础。

Comments 16 pages, 8 figures, accepted by RAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02519 2026-03-04 cs.MM cs.IR 67%

Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling

具有自适应测试时间缩放的代理混合源多模态虚假信息检测

Wei Jiang, Tong Chen, Wei Yuan, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 AgentM3D通过自适应测试时间缩放和多代理框架提升零样本多模态虚假信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23862 2026-03-02 cs.HC 67%

Human-Centered Multimodal Fusion for Sexism Detection in Memes with Eye-Tracking, Heart Rate, and EEG Signals

以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号

Iván Arcos, Paolo Rosso, Elena Gomis-Vicent

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。

Comments Accepted to appear in the Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19212 2026-02-24 cs.CL 67%

Retrieval Augmented Enhanced Dual Co-Attention Framework for Target Aware Multimodal Bengali Hateful Meme Detection

基于检索增强的增强双注意力框架的目标感知多模态孟加拉语仇恨表情识别

Raihan Tanvir, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学) Department of Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程系,Ahsanullah科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract)

AI总结 本文提出基于检索增强的增强双注意力框架,用于目标感知多模态孟加拉语仇恨表情识别,通过语义对齐提升类别平衡和多样性,实验表明xDORA和RAG-Fused DORA在识别和检测任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16317 2026-02-19 cs.GR 67%

CADEvolve: Creating Realistic CAD via Program Evolution

CADEvolve: 通过程序进化创建逼真的CAD

Maksim Elistratov, Marina Barannikov, Gregory Ivanov, Valentin Khrulkov, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract)

AI总结 CADEvolve通过程序进化生成逼真的CAD,利用VLM引导的编辑和验证,生成8000个复杂零件的可执行参数化生成器,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14901 2026-02-17 cs.LG cs.AI cs.CV cs.MA 67%

Picking the Right Specialist: Attentive Neural Process-based Selection of Task-Specialized Models as Tools for Agentic Healthcare Systems

选择合适的专家:基于神经过程的注意力机制用于选择任务专用模型作为智能医疗系统工具

Pramit Saha, Joshua Strong, Mohammad Alsharid, Divyanshu Mishra, J. Alison Noble

机构 * Department of Engineering Science, University of Oxford, United Kingdom(牛津大学工程科学系) Department of Computer Science, Khalifa University, Abu Dhabi, United Arab Emirates(哈利法大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出ToolSelect,一种基于神经过程和注意力机制的模型选择方法,用于智能医疗系统中选择任务专用模型,通过实验展示其在不同任务上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08999 2026-02-10 cs.RO 67%

CLUE: Crossmodal disambiguation via Language-vision Understanding with attEntion

CLUE: 通过语言-视觉理解进行跨模态歧义消除

Mouad Abrini, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所) Sorbonne Université Paris(索邦大学巴黎)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract)

AI总结 CLUE通过语言-视觉理解实现跨模态歧义消除,利用显式空间信号决定何时提问,提升人机交互的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04486 2026-02-05 cs.CL 67%

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03310 2026-02-04 cs.RO cs.AI cs.CV cs.LG 67%

RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization

RDT2:探索UMI数据的缩放极限以实现零样本跨具身泛化

Songming Liu, Bangguo Li, Kai Ma, Lingxuan Wu, Hengkai Tan, Xiao Ouyang, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 RDT2通过三阶段训练配方实现零样本跨具身泛化,提升机器人在开放词汇任务中的表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22041 2026-01-30 cs.MA cs.AI cs.CV cs.LG 67%

Learning to Communicate Across Modalities: Perceptual Heterogeneity in Multi-Agent Systems

在多智能体系统中学习跨模态交流:感知异质性

Naomi Pitzer, Daniela Mihai

机构 * University of Southampton(索姆塞特大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究通过异质多模态交流游戏探讨智能体在感知异质性下的交流机制,发现单模态系统更高效,多模态系统需更多信息交换,位扰动实验揭示了意义的分布编码特性。

Comments To be published in EvoLang XVI proceedings. 15 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13578 2026-01-30 cs.CV cs.AI cs.LG 67%

CMOOD: Concept-based Multi-label OOD Detection

基于概念的多标签异常检测

Zhendong Liu, Yi Nian, Yuehan Qin, Henry Peng Zou, Li Li, Xiyang Hu, Yue Zhao

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 COOD提出了一种基于概念的零样本多标签OOD检测框架,通过增强语义空间和改进评分函数,有效区分复杂标签依赖的OOD样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19498 2026-01-28 cs.CV cs.AI cs.LG 67%

Cortex-Grounded Diffusion Models for Brain Image Generation

基于皮层的扩散模型用于脑图像生成

Fabian Bongratz, Yitong Li, Sama Elbaroudy, Christian Wachinger

机构 * Lab for AI in Medical Imaging, Technical University of Munich, Germany(慕尼黑技术大学医学影像人工智能实验室) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Cor2Vox通过结合皮层结构先验,实现了高精度的脑MRI合成,能生成解剖学一致且生物合理的图像,适用于多种脑部疾病模拟和数据集和谐化任务。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14227 2026-01-21 cs.SD 67%

Transformer Architectures for Respiratory Sound Analysis and Multimodal Diagnosis

用于呼吸声分析和多模态诊断的Transformer架构

Theodore Aptekarev, Vladimir Sokolovsky, Gregory Furman

机构 * Ben Gurion University of the Negev(本· Gurion 农业大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 本文提出基于Transformer的AST和VLM模型,用于呼吸声分析和多模态诊断,AST在哮喘检测中达到97%准确率,VLM整合临床信息提升诊断能力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12486 2026-01-21 cs.HC 67%

A Multimodal Assistive System for Product Localization and Retrieval for People who are Blind or have Low Vision

一种多模态辅助系统,用于帮助盲人或低视力者进行产品定位与检索

Ligao Ruan, Giles Hamilton-Fletcher, Mahya Beheshti, Todd E Hudson, Maurizio Porfiri, John-Ross Rizzo

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种多模态辅助系统,通过目标检测与视觉-语言模型结合,帮助盲人或低视力者自主完成产品定位与检索,提升其自主性和控制感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11968 2026-01-21 cs.MM cs.SD eess.AS 67%

MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio

MuseAgent-1: 交互式 grounded 多模态理解音乐谱面与表演音频

Qihao Zhao, Yunqi Cao, Yangyu Huang, Hui Yi Leong, Fan Zhang, Kim-Hui Yap, Wei Hu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Chemical Technology(北京化工大学) Microsoft(微软公司) University of Chicago(芝加哥大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 MuseAgent-1 是一个专注于音乐的多模态代理,通过结构化符号表示和多步骤推理,提升对音乐谱面和表演音频的交互式理解能力。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09212 2026-01-15 cs.CV cs.AI cs.LG 67%

Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation

退火放松的投机解码用于更快的自回归图像生成

Xingyao Li, Fengzhuo Zhang, Cunxiao Du, Hui Ji

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出COOL-SD,通过退火放松的投机解码方法提升自回归图像生成的速度与质量。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08371 2026-01-14 cs.CV cs.AI cs.GR cs.LG 67%

Geo-NVS-w: Geometry-Aware Novel View Synthesis In-the-Wild with an SDF Renderer

Geo-NVS-w:基于SDF渲染器的野外几何感知新视角合成

Anastasios Tsalakopoulos, Angelos Kanlis, Evangelos Chatzis, Antonis Karakottas, Dimitrios Zarpalas

机构 * Centre for Research and Technology Hellas (CERTH)(希腊研究中心与技术中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Geo-NVS-w通过SDF渲染器实现野外高保真新视角合成,采用几何保持损失提升细节精度,显著降低能耗。

Comments Presented at the ICCV 2025 Workshop on Large Scale Cross Device Localization

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12793 2025-12-19 cs.RO 67%

VLG-Loc: Vision-Language Global Localization from Labeled Footprint Maps

VLG-Loc: 从标注足迹地图实现视觉-语言全局定位

Mizuho Aoki, Kohei Honda, Yasuhiro Yoshimura, Takeshi Ishita, Ryo Yonetani

机构 * The Department of Mechanical Systems Engineering, Nagoya University(名古屋大学机械系统工程系) CyberAgent AI Lab(CyberAgent AI实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 VLG-Loc通过视觉-语言模型实现从标注足迹地图的全局定位,结合蒙特卡洛定位框架和概率融合提升环境变化下的鲁棒性。

Comments v2: Updated the citation of SparseLoc from an arXiv preprint to its published version in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05745 2025-12-08 cs.CR cs.MM 67%

ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior

ARGUS: 通过引导指令遵循行为防御多模态间接提示注入攻击

Weikai Lu, Ziqian Zeng, Kehua Zhang, Haoran Li, Huiping Zhuang, Ruidong Wang, Cen Chen, Hao Peng

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract)

AI总结 ARGUS通过引导指令遵循行为,在表示空间中寻找最优防御方向,实现对多模态间接提示注入攻击的有效防御,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10445 2025-12-02 cs.AI cs.CL cs.CV cs.LG 67%

RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users

RealWebAssist: 一个用于长周期网页协助的基准测试

Suyu Ye, Haojun Shi, Darren Shih, Hyokun Yun, Tanya Roosta, Tianmin Shu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 RealWebAssist是一个评估长周期网页协助中连续指令遵循能力的新基准测试,旨在解决现实世界中用户指令模糊性和动态性带来的挑战。

Comments Project Website: https://scai.cs.jhu.edu/projects/RealWebAssist/ Code: https://github.com/SCAI-JHU/RealWebAssist

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00797 2025-12-02 cs.RO 67%

Transforming Monolithic Foundation Models into Embodied Multi-Agent Architectures for Human-Robot Collaboration

将单体基础模型转化为具身体验的多智能体架构以实现人机协作

Nan Sun, Bo Mao, Yongchang Li, Chenxu Wang, Di Guo, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 InteractGen通过分解机器人智能为多个智能体,提升服务机器人在人类环境中的自主性和协作能力。

Comments 21 pages, 16 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20841 2025-11-27 cs.RO 67%

OVAL-Grasp: Open-Vocabulary Affordance Localization for Task Oriented Grasping

OVAL-Grasp:面向任务的开放词汇表征定位抓取

Edmond Tong, Advaith Balaji, Anthony Opipari, Stanley Lewis, Zhen Zeng, Odest Chadwicke Jenkins

机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学) J.P. Morgan AI Research(摩根大通AI研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 OVAL-Grasp通过结合大语言模型和视觉-语言模型,实现面向任务的开放词汇表征抓取,有效识别物体部分并提高抓取成功率。

Comments 10 pages, 7 figures, 3 tables. Presented at the 2025 International Symposium on Experimental Robotics (ISER)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14421 2025-11-26 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

ExDDV: A New Dataset for Explainable Deepfake Detection in Video

ExDDV:用于视频可解释深度伪造检测的新数据集

Vlad Hondru, Eduard Hogea, Darian Onchis, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯大学) West University of Timişoara(蒂米什瓦拉西大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ExDDV通过引入文本和点击监督,开发出可解释的深度伪造检测模型,以提高视频中深度伪造内容的识别能力。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19537 2025-11-26 cs.CV cs.AI cs.LG eess.IV 67%

Cross-Domain Generalization of Multimodal LLMs for Global Photovoltaic Assessment

多领域泛化用于全球光伏评估的多模态大语言模型

Muhao Guo, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出利用多模态大语言模型实现跨领域泛化,用于全球光伏评估,通过结构化提示和微调在统一框架内整合检测、定位和量化,优于传统CV和Transformer基线。

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18640 2025-11-25 cs.CV cs.AI cs.LG 67%

Health system learning achieves generalist neuroimaging models

健康系统学习实现通用神经影像模型

Akhil Kondepudi, Akshay Rao, Chenhui Zhao, Yiwei Lyu, Samir Harake, Soumyanil Banerjee, Rushikesh Joshi, Anna-Katharina Meissner, Renly Hou, Cheng Jiang, Asadur Chowdury, Ashok Srinivasan, Brian Athey, Vikas Gulani, Aditya Pandey, Honglak Lee, Todd Hollon

机构 * Machine Learning in Neurosurgery Lab University of Michigan(密歇根大学机器学习神经外科实验室) University of Michigan Computational Medicine and Bioinformatics(密歇根大学计算医学与生物信息学) University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程) University of Michigan Radiology(密歇根大学放射学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 NeuroVFM通过健康系统学习范式,在临床MRI和CT影像上训练,实现高性能通用神经影像模型,提升放射学诊断和报告生成的准确性与临床实用性。

Comments 53 pages, 4 main figures, 10 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15159 2025-11-20 cs.CV cs.AI cs.CL cs.LG 67%

Generating Natural-Language Surgical Feedback: From Structured Representation to Domain-Grounded Evaluation

Firdavs Nasriddinov, Rafal Kocielnik, Anima Anandkumar, Andrew J. Hung

机构 * California Institute of Technology(加州理工学院) Cedars-Sinai Medical Center(Cedars-Sinai 医疗中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as proceedings paper for ML4H 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05430 2025-11-19 cs.CV cs.AI cs.LG 67%

Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions

Hubert Baniecki, Maximilian Muschalik, Fabian Fumagalli, Barbara Hammer, Eyke Hüllermeier, Przemyslaw Biecek

机构 * University of Warsaw(华沙大学) Warsaw University of Technology(华沙理工大学) LMU Munich(慕尼黑大学) MCML DFKI(德累斯顿大学) Bielefeld University(比勒菲尔德大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2025. Code: https://github.com/hbaniecki/fixlip

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14027 2025-11-19 cs.CL 67%

HiEAG: Evidence-Augmented Generation for Out-of-Context Misinformation Detection

Junjie Wu, Yumeng Fu, Nan Yu, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05542 2025-11-11 q-bio.NC cs.AI cs.CV cs.LG 67%

ConnectomeBench: Can LLMs Proofread the Connectome?

Jeff Brown, Andrew Kirjner, Annika Vivekananthan, Ed Boyden

机构 * MIT(麻省理工学院) HHMI(霍华德·休斯医学研究所) McGovern Institute(麦戈文研究所) MIT Departments of Brain and Cognitive Sciences(麻省理工学院脑科学与认知科学系)

专题命中 视觉定位与Grounding :InternVL(abstract);分类 cs.CV、cs.AI、cs.LG

Comments To appear in NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06980 2025-11-10 cs.CL 67%

Exploring Multimodal Perception in Large Language Models Through Perceptual Strength Ratings

Jonghyun Lee, Dojun Park, Jiwoo Lee, Hoekeon Choi, Sung-Eun Lee

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

Comments Published in IEEE Access

Journal ref IEEE Access, vol. 13, pp. 176751-176769, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏