arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-19 至 2026-03-19 共收录 68 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2603.16292 2026-03-19 cs.CL cs.AI 79%

Attention-guided Evidence Grounding for Spoken Question Answering

基于注意力的证据 grounding 用于语音问答

Ke Yang, Bolin Chen, Yuejie Li, Yueying Hua, Jianhao Nie, Yueping He, Bowen Li, Chengjun Mao

专题命中 视觉问答 :grounding(title,abstract);分类 cs.AI

AI总结 本文提出基于注意力的证据 grounding 方法,通过 SpeechLLM 的内部跨模态注意力机制定位关键证据,减少幻觉并提升效率,优于传统 cascaded 系统。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17374 2026-03-19 cs.CV 57%

Shot-Aware Frame Sampling for Video Understanding

面向快门的视频帧采样

Mengyu Zhao, Di Fu, Yongyu Xie, Jiaxing Zhang, Zhigang Yuan, Shirin Jalali, Yong Cao

机构 * ByteDance(字节跳动) Rutgers University(罗格斯大学) Georgia Tech(佐治亚理工学院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出InfoShot,一种任务无关的快门感知帧采样方法,用于长视频理解。通过分割视频为语义一致的快门,并选择两种互补的关键帧,以保留视频结构和短时变化信息,提升视频理解和异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17822 2026-03-19 eess.AS cs.CL 50%

Multi-Source Evidence Fusion for Audio Question Answering

多源证据融合用于音频问答

Aivo Olev, Tanel Alumäe

机构 * Tallinn University of Technology, Estonia(塔林技术大学,爱沙尼亚)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出多源融合框架,利用两个大音频语言模型与25种可靠性分层的声学工具,生成可验证的推理链,提升音频问答的逻辑性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 12 篇

2603.18002 2026-03-19 cs.CV cs.AI cs.CL 90%

Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models

Loc3R-VLM:基于语言的定位与3D推理的视觉语言模型

Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间AI实验室) ETH Zurich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Loc3R-VLM通过结合全局布局重建和显式情境建模,提升视觉语言模型的3D空间理解能力,在语言定位和3D问答任务中取得最优性能。

Comments Project Page: https://kevinqu7.github.io/loc3r-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI 88%

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17680 2026-03-19 cs.CV cs.AI 84%

WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models

WeatherReasonSeg:一种用于视觉语言模型中天气感知推理分割的基准测试

Wanjun Du, Zifeng Yuan, Tingting Chen, Fucai Ke, Beibei Lin, Shunli Zhang

机构 * Beijing Jiaotong University(北京交通大学) National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 视觉推理 :visual language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WeatherReasonSeg基准测试,评估视觉语言模型在恶劣天气下的推理分割能力,通过合成和真实数据集分析天气对模型性能的影响,发现天气严重程度与模型性能呈单调下降关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI 84%

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16958 2026-03-19 cs.CV cs.AI 84%

PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models

PhysQuantAgent: 一种用于视觉-语言模型的物体质量估计推断流水线

Hisayuki Yokomizo, Taiki Miyanishi, Yan Gang, Shuhei Kurita, Nakamasa Inoue, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(信息处理技术研究所)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PhysQuantAgent框架和VisPhysQuant基准数据集,通过引入三种视觉提示方法提升视觉-语言模型对真实物体质量的估计精度。

Comments Code and dataset will be available at https://github.com/hisasnow/PhysQuantAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02458 2026-03-19 cs.CV 74%

Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration

视觉到几何:用于连续具身MLLM推理和探索的3D空间记忆

Zhongyi Cai, Yi Du, Chen Wang, Yu Kong

机构 * ACTION Lab, Michigan State University(密歇根州立大学ACTION实验室) SAIR Lab, University at Buffalo(布法罗大学SAIR实验室)

专题命中 视觉推理 :MLLM(title);分类 cs.CV

AI总结 本文提出3DSPMR框架,利用视场覆盖作为几何先验,提升具身智能在连续任务中的记忆、推理与探索能力,并引入SEER-Bench基准测试连续具身探索与推理任务。

Comments Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16289 2026-03-19 cs.CV cs.AI 73%

VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents

VisBrowse-Bench:多模态浏览代理的视觉原生搜索基准测试

Zhengbo Zhang, Jinbo Su, Zhaowen Zhou, Changtao Miao, Yuhan Hong, Qimeng Wu, Yumeng Liu, Feier Wu, Yihe Tian, Yuhao Liang, Zitong Shan, Wanke Xia, Yi-Fan Zhang, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

机构 * CASIA Ant Digital Technologies Ant Group(蚂蚁集团数字技术部) RUC(清华大学) FZU(福建师范大学) THU(清华大学) USTB(北京科技大学) PKU(北京大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisBrowse-Bench,用于评估多模态浏览代理的视觉推理能力,通过文本-图像检索和联合推理进行多模态证据交叉验证,验证了不同模型在搜索过程中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16967 2026-03-19 cs.CV cs.AI 73%

MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing

MSRAMIE:多模态结构推理代理用于多指令图像编辑

Zhaoyuan Qiu, Ken Chen, Xiangwei Wang, Yu Xia, Sachith Seneviratne, Saman Halgamuge

机构 * University Of Melbourne(墨尔本大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MSRAMIE基于多模态大语言模型构建无需训练的代理框架,通过结构化多模态推理处理多指令图像编辑任务,提升复杂指令遵循度和完成概率,同时保持图像质量和一致性。

Comments 14 pages, 6 figures, 3 tables, appendix and references provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17693 2026-03-19 cs.CV 70%

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17043 2026-03-19 cs.CV 70%

OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials

OpenQlaw: 一种用于二维量子材料分析的代理AI助手

Sankalp Pandey, Xuan-Bac Nguyen, Hoang-Quan Nguyen, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu

机构 * Quantum AI Lab, University of Arkansas, USA(量子人工智能实验室,美国亚拉巴马大学) University of Utah, USA(美国犹他大学) Department of Physics, University of Arkansas, USA(美国亚拉巴马大学物理系) MonARK NSF Quantum Foundry(MonARK NSF 量子熔炉)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 OpenQlaw通过整合NanoBot和QuPAINT,实现二维材料分析中的动态推理与可视化,提升科研人员在高通量器件制造中的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21750 2026-03-19 cs.CV cs.AI cs.CL cs.RO 62%

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

SO-Bench:多模态大语言模型的结构输出评估

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang, Zhifeng Chen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SO-Bench基准,评估多模态大语言模型在视觉输入下的结构化输出能力,揭示模型在准确性和符合数据模式方面的不足,并通过训练实验提升其结构化输出能力。

Comments v3 preprint. Added the link to the public benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17360 2026-03-19 cs.CV 57%

MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval

MCoT-MVS:基于多模态链式推理的多级视觉选择用于组合图像检索

Xuri Ge, Chunhao Wang, Xindi Wang, Zheyun Qin, Zhumin Chen, Xin Xin

机构 * Shandong University(山东大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出MCoT-MVS方法,通过多模态链式推理提取参考图像的多级视觉特征,结合注意力机制与文本提示,提升组合图像检索的准确性和鲁棒性。

Comments Accepted by The Web Conference 2026 (WWW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 25 篇

2603.16934 2026-03-19 cs.CV cs.AI 86%

AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding

AgriChat:一种用于农业图像理解的多模态大语言模型

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17441 2026-03-19 cs.CV cs.AI 84%

AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement

AdaZoom-GUI: 基于自适应缩放的GUI定位与指令细化

Siqi Pei, Liang Tang, Tiaonan Duan, Long Chen, Shuxian Li, Kaer Huang, Yanzhe Jing, Yiqiang Yan, Bo Zhang, Chenghao Jiang, Borui Zhang, Jiwen Lu

机构 * Lenovo Research(联想研究院) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AdaZoom-GUI框架,通过指令细化模块和条件缩放策略提升GUI定位精度与指令理解,构建高质量数据集并采用GRPO训练模型,实现在高分辨率GUI理解中的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16931 2026-03-19 cs.CV cs.AI 81%

Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation

脚本到幻灯片接地:将脚本句子接地到幻灯片对象以实现自动教学视频生成

Rena Suzuki, Masato Kikuchi, Tadachika Ozono

机构 * Nagoya Institute of Technology(名古屋技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Script-to-Slide Grounding任务,利用大语言模型实现脚本与幻灯片对象的自动接地,实验显示F1分数达0.924,为自动化幻灯片视频编辑奠定基础。

Comments The 21st International Conference on E-Service and Knowledge Management (ESKM 2025-Winter)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17647 2026-03-19 cs.CV 79%

Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment

面向部分的开放词汇3D功能接地 via 语义和几何对齐

Dongqiang Gou, Xuming He

机构 * ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17079 2026-03-19 cs.CV 79%

ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models

ACE-LoRA:图注意上下文增强用于医疗视觉-语言模型的参数高效适应

M. Arda Aydın, Melih B. Yilmaz, Aykut Koç, Tolga Çukur

机构 * Bilkent University(比尔肯特大学) National Magnetic Resonance Research Center (UMRAM)(国家磁共振研究所以及UMRAM)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ACE-LoRA框架,通过整合LoRA模块和ACE-HGNN模块,提升医疗VLM的零样本泛化能力,解决领域特异性与泛化能力的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI 79%

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17228 2026-03-19 cs.CV cs.AI cs.LG 75%

From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs

从丢弃到恢复:对MLLMs分割能力的机理分析

Boyong Wu, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过逐层线性探测评估MLLMs整个流程,揭示适配器导致的分割表示下降及LLM层通过注意力机制逐步恢复的机制,为未来分割模型设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17173 2026-03-19 cs.CV cs.AI 73%

Generalist Multimodal LLMs Gain Biometric Expertise via Human Salience

通用多模态大语言模型通过人类显著性获得生物特征专家能力

Jacob Piland, Byron Dowling, Christopher Sweet, Adam Czajka

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究通用多模态大语言模型在隐私约束下通过人类显著性信息实现虹膜攻击检测的可行性,实验表明其在虹膜攻击检测中优于传统CNN模型和人工评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16932 2026-03-19 cs.CV cs.AI 73%

Look Where It Matters: High-Resolution Crops Retrieval for Efficient VLMs

关注关键区域:为高效视觉语言模型的高分辨率作物检索

Nimrod Shabtay, Moshe Kimhi, Artem Spector, Sivan Haray, Ehud Rivlin, Chaim Baskin, Raja Giryes, Eli Schwartz

机构 * IBM Research(IBM研究院) Tel-Aviv University(特拉维夫大学) Technion(技术学院) Ben-Gurion University(本· Gurion大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 AwaRes通过低分辨率全局视图和工具调用实现准确与效率的平衡,自动构建监督数据并结合复合奖励训练框架,提升视觉语言模型的检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06933 2026-03-19 cs.CE cs.CL cs.HC 71%

TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding

TxSum: 基于微粒语义锚定的用户导向以太坊交易理解

Zifan Peng, Jingyi Zheng, Yule Liu, Huaiyu Jia, Qiming Ye, Jingyu Liu, Xufeng Yang, Mingchen Li, Qingyuan Gong, Xuechao Wang, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) University of North Texas(北卡罗来纳州立大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI 70%

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 视觉定位与Grounding :visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11005 2026-03-19 cs.CV 70%

Draft and Refine with Visual Experts

草稿与润色:借助视觉专家

Sungheon Jeong, Ryozo Masukawa, Jihong Park, Sanggeon Yun, Wenjun Huang, Hanning Chen, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) MOLOCO

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出DnR框架,通过可视化专家反馈提升模型视觉利用能力,减少幻觉并提高多模态系统可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17831 2026-03-19 cs.AI 57%

RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy

RPMS:通过规则增强的记忆协同提升基于LLM的具身规划

Zhenhang Yuan, Shenghai Yuan, Lihua Xie

机构 * School of Electrical & Electronic Engineering(电子与电气工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出RPMS架构,通过结构化规则检索、轻量信念状态和规则优先仲裁解决LLM在封闭世界具身环境中的失效问题,显著提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17761 2026-03-19 cs.CV 57%

Evidence Packing for Cross-Domain Image Deepfake Detection with LVLMs

跨领域图像深度伪造检测中的证据打包与大视觉语言模型

Yuxin Liu, Fei Wang, Kun Li, Yiqi Nie, Junjie Chen, Zhangling Duan, Zhaohong Jia

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) IAI, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SCEP框架,通过证据驱动推理提升跨领域图像深度伪造检测性能,无需微调大视觉语言模型,有效识别伪造线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17753 2026-03-19 cs.CV 57%

PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation

PC-CrossDiff:点-簇双级跨模态微分注意力用于统一的3D指称与分割

Wenbin Tan, Jiawen Lin, Fangyong Wang, Yuan Xie, Yong Xie, Yachao Zhang, Yanyun Qu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出PC-CrossDiff框架,通过双级跨模态微分注意力解决复杂多物体场景中指称理解和分割的挑战,提升3D视觉定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏