arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-13 至 2026-04-13 共收录 63 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2505.20638 2026-04-13 cs.SD cs.CV cs.MM eess.AS 83%

Music Audio-Visual Question Answering Requires Specialized Multimodal Designs

音乐音频视觉问答需要专门的多模态设计

Wenhao You, Xingjian Diao, Wenjun Huang, Chunhui Zhang, Keyi Kong, Weiyi Wu, Chiyu Ma, Zhongyu Ouyang, Tingxuan Wu, Ming Cheng, Soroush Vosoughi, Jiang Gui

机构 * University of Waterloo(滑铁卢大学) Dartmouth College(达特茅斯学院) UC Irvine(加州大学尔湾分校) New York University(纽约大学)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文探讨了音乐音频视觉问答任务中多模态设计的必要性,指出需专门的输入处理、空间时间架构和音乐特定建模策略以应对连续密集的音频视觉内容和复杂时间动态。

Comments Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026). The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL 79%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06665 2026-04-13 cs.CV cs.AI 79%

Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine

更好的眼睛,更好的思考:为何视觉链式推理在医学中失效

Yuan Wu, Zongxian Yang, Jiayu Qian, Songpan Gao, Guanxing Chen, Qiankun Li, Yu-An Huang, Zhi-An Huang

机构 * Department of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学系) College of Computing and Data Science (CCDS), Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文发现链式推理在医学视觉问答中表现欠佳,提出通过感知锚定和描述 grounding 提升视觉 grounding 和跨模态对齐以改善性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15578 2026-04-13 cs.CV 57%

AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning

AVATAAR:通过时间自适应对齐和推理实现代理视频回答

Urjitkumar Patel, Fang-Chun Yeh, Chinmay Gondhalekar

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

AI总结 AVATAAR通过结合全局和局部视频上下文,以及预检索思考代理和重思模块,提升长视频问答的准确性和可解释性,实验显示在CinePile基准上显著提升各类问答任务性能。

Comments Accepted in the 5th IEEE Big Data Workshop on Multimodal AI (MMAI 2025), Dec 8-11, Macau, China, 2025 (Preprint Copy)

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05215 2026-04-13 cs.CL cs.LG 57%

BEDTime: A Unified Benchmark for Automatically Describing Time Series

BEDTime:一个统一的基准测试用于自动描述时间序列

Medhasweta Sen, Zachary Gottesman, Jiaxing Qiu, C. Bayan Bruss, Nam Nguyen, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉问答 :vision language model(abstract);分类 cs.LG

AI总结 本文提出BEDTime基准测试,评估模型对时间序列结构属性的描述能力,发现专为时间序列语言设计的模型表现欠佳,而视觉语言模型表现优异,且所有方法在现实鲁棒性测试中均表现脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 13 篇

2512.02231 2026-04-13 cs.CV cs.AI cs.LG 85%

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08815 2026-04-13 cs.CV 83%

Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models

通过上下文对齐的视觉-语言模型实现负责任的多模态医疗推理

Sumra Khan, Sagar Chhabriya, Aizan Zafar, Sheeraz Arif, Amgad Muneer, Anas Zafar, Shaina Raza, Rizwan Qureshi

机构 * Salim Habib University(萨利姆·哈比卜大学) Institute of Business Administration Sukkur(苏库尔工商管理学院) University of Central Florida(中佛罗里达大学) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Toronto Metropolitan University(多伦多都会大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种上下文对齐的框架,通过整合多种临床证据提升医疗多模态推理的可靠性与可信度,实验显示其在胸部X光数据集上提升了判别性能并减少幻觉关键词。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08726 2026-04-13 cs.RO 82%

Task-Aware Bimanual Affordance Prediction via VLM-Guided Semantic-Geometric Reasoning

基于VLM引导的语义-几何推理的任务感知双臂 affordance 预测

Fabian Hahne, Vignesh Prasad, Georgia Chalvatzaki, Jan Peters, Alap Kshirsagar

机构 * Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系) German Research Center for AI (DFKI)(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt(达姆施塔特工业大学认知科学中心) Hessian Center for Artificial Intelligence (Hessian.AI), Darmstadt(黑森州人工智能中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出一种任务感知双臂 affordance 预测框架,通过VLM实现跨物体类别和任务描述的泛化,融合多视角RGB-D数据生成全局6自由度抓取候选,结合语义和几何过滤提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09425 2026-04-13 cs.CV 79%

Do Vision Language Models Need to Process Image Tokens?

视觉语言模型是否需要处理图像标记?

Sambit Ghosh, R. Venkatesh Babu, Chirag Agarwal

机构 * IBM Indian Institute of Science(印度科学研究所) University of Virginia(弗吉尼亚大学)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

AI总结 本文研究了视觉语言模型中图像标记的功能,发现视觉表示快速收敛至有限复杂度,而文本表示持续重构。视觉表示在不同层间可互换,任务依赖性影响视觉处理的必要性。

Comments Accepted (Oral) at TRUE-V Workshop CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08457 2026-04-13 cs.CV cs.AI cs.RO 79%

CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning

CrashSight:面向交通事故场景理解与推理的相位感知、基础设施导向视频基准

Rui Gan, Junyi Ma, Pei Li, Xingyou Yang, Kai Chen, Sikai Chen, Bin Ran

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Wyoming(怀俄明大学) Columbia University(哥伦比亚大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 CrashSight通过真实道路摄像头数据构建大规模视频基准,评估视觉语言模型在交通事故场景中的理解与推理能力,揭示现有模型在时间与因果推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09114 2026-04-13 cs.CV cs.LG 79%

FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval

FIRE-CIR:细粒度复合时尚图像检索中的精细推理

François Gardères, Camille-Sovanneary Gauthier, Jean Ponce, Shizhe Chen

机构 * Louis Vuitton(路易威登) Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所, 巴黎高等师范学院, 法国国家科学研究中心, 巴黎文理研究大学) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学库朗数学科学研究所与数据科学中心)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 FIRE-CIR通过问题驱动的视觉推理提升时尚图像检索的可解释性和准确性,通过生成属性聚焦的视觉问题并验证参考与候选图像中的证据,实现更精确的检索结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08615 2026-04-13 cs.CV cs.AI 79%

MARINER: A 3E-Driven Benchmark for Fine-Grained Perception and Complex Reasoning in Open-Water Environments

MARINER:一种基于3E驱动的基准,用于开放水域环境中的细粒度感知与复杂推理

Xingming Liao, Ning Chen, Muying Shu, Yunpeng Yin, Peijian Zeng, Zhuowei Wang, Nankai Lin, Lianglun Cheng

机构 * Guangdong University of Technology(广东工业大学)

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MARINER基准,通过3E框架评估开放水域环境中的细粒度感知与复杂推理,揭示先进模型在复杂海洋场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09167 2026-04-13 cs.CV cs.MA 70%

MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding

MAG-3D:多智能体基础推理用于3D理解

Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu, Gao Huang

机构 * Tsinghua University(清华大学) Pico, ByteDance(字节跳动Pico)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MAG-3D,一种无需训练的多智能体框架,通过动态协调专家代理实现灵活的3D基础推理,解决复杂场景中的空间和几何关系推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27817 2026-04-13 cs.CV cs.AI cs.CR 62%

Towards Context-Aware Image Anonymization with Multi-Agent Reasoning

面向多智能体推理的上下文感知图像匿名化

Robert Aufschläger, Jakob Folz, Gautam Savaliya, Manjitha D Vidanalage, Michael Heigl, Martin Schramm

机构 * Deggendorf Institute of Technology(代根多夫应用技术大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CAIAMAR框架,通过多智能体推理和扩散匿名化技术,实现上下文感知的PII分割,减少重识别风险并提升图像质量。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22832 2026-04-13 cs.CV cs.AI 62%

Listener-Rewarded Thinking in VLMs for Image Preferences

图像偏好中的VLMs思考奖励

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov, Ivan Oseledets

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。

Comments part of a different work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07720 2026-04-13 cs.AI 57%

Towards Knowledgeable Deep Research: Framework and Benchmark

走向知识导向的深度研究:框架与基准

Wenxuan Liu, Zixuan Li, Long Bai, Chunmao Zhang, Fenghui Zhang, Zhuo Chen, Wei Li, Yuxin Zuo, Fei Wang, Bingbing Xu, Xuhui Jiang, Jin Zhang, Xiaolong Jin, Jiafeng Guo, Tat-Seng Chua, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08863 2026-04-13 cs.AI 57%

Hidden in Plain Sight: Visual-to-Symbolic Analytical Solution Inference from Field Visualizations

隐于 plain sight:从场可视化中推断视觉到符号的解析解

Pengze Li, Jiaquan Zhang, Yunbo Long, Xinping Liu, Zhou wenjie, Encheng Su, Zihang Zeng, Jiaqi Liu, Jiyao Liu, Junchi Yu, Lihao Liu, Philip Torr, Shixiang Tang, Aoran Wang, Xi Chen

机构 * Fudan University, China(复旦大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) University of Cambridge, UK(剑桥大学) Nankai University, China(南开大学) University of Oxford, UK(牛津大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

AI总结 本文研究了从二维线性稳态场的可视化中推断视觉到符号的解析解,提出ViSA-R2模型并发布ViSA-Bench基准,通过结构模式识别和物理学家路径验证,实现高精度符号表达推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08771 2026-04-13 cs.HC cs.ET 50%

TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction

TeamLLM: 探索LLMs在多模态群体交互预测中的能力

Diana Romero, Xin Gao, Daniel Khalkhali, Salma Elmalaki

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 本文研究LLMs在多模态传感器数据中预测群体协调模式的能力,发现LLMs在语言基础行为上比LSTM基线提升3.2倍,细调准确率达96%。同时揭示了文本模型在多模态交互中的局限性及模拟模式的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 19 篇

2604.08884 2026-04-13 cs.CV cs.AI 84%

HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing

HM-Bench:多模态大语言模型在高光谱遥感中的综合基准

Xinyu Zhang, Zurong Mai, Qingmei Li, Zjin Liao, Yibin Wen, Yuhang Chen, Xiaoya Fan, Chan Tsz Ho, Bi Tianyuan, Haoyuan Liang, Ruifeng Su, Zihao Qian, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Southwest University(西南大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08966 2026-04-13 cs.CV 83%

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

视频大语言模型应如何输出时间?对高效时间接地范式的分析

Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

机构 * The University of Central Florida(中佛罗里达大学) Axon(Axon公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文对比三种主流视频时间接地范式,探讨输出设计对精度与效率的影响,发现连续分布范式在效率-精度权衡中表现最佳。

Comments CVPR 2026 Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06165 2026-04-13 cs.CV cs.LG 81%

HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models

HaloProbe: 基于贝叶斯的方法检测和缓解视觉-语言模型中的物体幻觉

Reihaneh Zohrabi, Hosein Hasani, Akshita Gupta, Mahdieh Soleymani Baghshah, Anna Rohrbach, Marcus Rohrbach

机构 * Multimodal AI Lab, Technical University of Darmstadt(达姆施塔特工业大学多模态人工智能实验室) Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出HaloProbe框架,通过结合外部描述统计和内部解码信号,有效检测和缓解视觉-语言模型中的物体幻觉,实验表明其比现有干预方法更有效且保持了模型的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02598 2026-04-13 cs.HC cs.AI cs.PL 79%

Explorable Theorems: Making Written Theorems Explorable by Grounding Them in Formal Representations

可探索的定理:通过将其基于形式化表示来使书面定理可探索

Hita Kambhamettu, Will Crichton, Sean Welleck, Harrison Goldstein, Andrew Head

机构 * University of Pennsylvania(宾夕法尼亚大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出可探索的定理系统,利用LLM将定理和证明转化为Lean语言,使用户能交互式地逐步验证证明并测试例子,提升数学理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09470 2026-04-13 cs.CL 71%

Agentic Jackal: Live Execution and Semantic Value Grounding for Text-to-JQL

代理Jackal:用于文本到JQL的实时执行与语义价值接地

Vishnu Murali, Anmol Gulati, Elias Lumer, Kevin Frank, Sindy Campagna, Vamse Kumar Subbiah

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Jackal基准,通过实时执行和语义检索工具提升文本到JQL的准确性,验证了代理方法在解决语义歧义中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08921 2026-04-13 cs.CV 70%

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction

TAIHRI:面向近距离人机交互的任务感知3D人体关键点定位

Ao Li, Yonggen Ling, Yiyang Lin, Yuji Wang, Yong Deng, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Tencent Robotics X(腾讯机器人实验室X) Futian Laboratory(福田实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 TAIHRI是首个针对近距离人机交互的视觉-语言模型,通过任务感知的3D关键点定位实现人机交互中的精准空间定位,提升机器人对任务相关身体部位的识别与响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08896 2026-04-13 cs.CV 70%

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能

Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya

机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) Wuhan University(武汉大学) Linköping University(林雪平大学) University of Tokyo(东京大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。

Comments CVPR 2026 Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26641 2026-04-13 cs.CV 70%

All You Need for Object Detection: From Pixels, Points, and Prompts to Next-Gen Fusion and Multimodal LLMs/VLMs in Autonomous Vehicles

自动驾驶所需的所有内容:从像素、点和提示到下一代融合和多模态LLM/VLMs

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Hazim Alzorgan, Mahlagha Fazeli, Abolfazl Razi

机构 * Department One(第一部门) Department Two(第二部门)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文探讨自动驾驶中物体检测的最新进展,重点介绍多模态感知、视觉语言模型和大语言模型等新兴方法,分析传感器融合策略及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09101 2026-04-13 cs.CR cs.AI cs.CV cs.LG 67%

CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion

CLIP-Inspector:通过OoD触发器反向工程实现提示调优CLIP的模型级后门检测

Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal

机构 * IIIT Delhi(印度德里国际信息技术学院) IIT Delhi(印度德里理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对提示调优CLIP模型中潜在的后门攻击,CLIP-Inspector通过OoD触发器反向工程实现模型级后门检测,利用白盒访问和未标记OoD图像重建可能触发器,验证模型安全性并修复后门效果。

Comments 17 pages (8 main + 2 references + 7 supplementary), Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08609 2026-04-13 cs.CV cs.AI cs.LG 67%

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

数字取证中的仇恨与威胁检测:基于案例的多模态方法

Ponkoj Chandra Shill

机构 * University of Nevada, Reno(内华达大学雷诺分校)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08110 2026-04-13 cs.CV cs.AI cs.LG 67%

OV-Stitcher: A Global Context-Aware Framework for Training-Free Open-Vocabulary Semantic Segmentation

OV-Stitcher:一种无需训练的全局上下文感知框架,用于开放词汇语义分割

Seungjae Moon, Seunghyun Oh, Youngmin Ro

机构 * Machine Intelligence Laboratory, University of Seoul, Korea(韩国首尔市立大学机器智能实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出OV-Stitcher框架,通过直接拼接碎片化子图像特征,在最终编码器块中实现全局注意力,提升开放词汇分割的性能和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09537 2026-04-13 cs.CL cs.AI cs.IR cs.LG 62%

Case-Grounded Evidence Verification: A Framework for Constructing Evidence-Sensitive Supervision

基于案例的证据验证:构建证据敏感监督的框架

Soroosh Tayebi Arasteh, Mehdi Joodaki, Mahshad Lotfinia, Sven Nebelung, Daniel Truhn

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出案例 grounded 的证据验证框架,通过生成支持与非支持示例,提升模型对证据依赖性的学习能力,实验显示其在医学影像领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏