arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-30 至 2026-04-30 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 16 篇

2604.26250 2026-04-30 cs.CV 91%

Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning

超越捷径:通过定性推理缓解冻结VLM中的视觉错觉

Hao Guo, Fei Wang, Junjie Chen, Yiqi Nie, Jiaqi Zhao, Qiankun Li, Subin Huang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥国家科学中心) Anhui Polytechnic University(安徽理工大学) Hefei University of Technology(合肥工业大学) Anhui University(安徽大学) IGS, Imperial College London(帝国理工学院伦敦分校)

专题命中 视觉定位与Grounding :VLM(title_cn,summary_cn);grounding(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出SQI框架,通过定性约束提升冻结VLM的视觉 grounding,解决视觉错觉问题,实验显示在DataCV 2026挑战中表现优异,提升准确率并提供更好的可解释性。

Comments 4 pages, 2 figures, and 1 table. This is a methodology paper for the DataCV 2026 Challenge (CVPR Workshops), Task 1, where our method ranked 2nd

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24036 2026-04-30 cs.CV eess.IV 90%

Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues

通过语言引导的语义线索实现对遮挡和小物体的鲁棒接地

Beomchan Park, Seongho Kim, Hyunjun Kim, Sungjune Park, Yong Man Ro

机构 * Integrated Vision Language Lab.(集成视觉语言实验室)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出通过语言引导的语义线索提升MLLM在拥挤场景中的接地能力,通过语义线索提取器和文本嵌入引导优化对象语义,实验表明能有效提高接地精度。

Comments 4 pages, 2 figures, ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26521 2026-04-30 cs.AI cs.CV cs.LG cs.LO 88%

Grounding vs. Compositionality: On the Non-Complementarity of Reasoning in Neuro-Symbolic Systems

基础性与组成性:神经符号系统中推理非互补性研究

Mahnoor Shahid, Hannes Rothe

机构 * Place-Beyond-Bytes

专题命中 视觉定位与Grounding :grounding(title,summary_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 研究指出神经符号系统中组成性推理并非符号 grounding 的副产品,通过 iLTN 实验证明仅依赖 grounding 无法实现泛化,联合训练 grounding 与推理可提升零样本准确性。

Comments Accepted at AAAI MAKE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26261 2026-04-30 cs.CV 85%

Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding

多一致的2D-3D映射用于鲁棒的零样本3D视觉定位

Yufei Yin, Jie Zheng, Qianke Meng, Zhou Yu, Minghao Chen, Jiajun Ding, Min Tan, Yuling Xi, Zhiwen Chen, Chengfei Lv

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(Inria巴黎-鲁克蒙特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出MCM-VG框架,通过建立多一致的2D-3D映射实现鲁棒的零样本3D视觉定位,解决开放词汇3D提案质量差的问题,提升目标定位和推理的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00209 2026-04-30 eess.IV cs.AI cs.CV cs.RO 79%

SurgiSR4K: A High-Resolution Endoscopic Video Dataset for Robotic-Assisted Minimally Invasive Procedures

SurgiSR4K:一种用于机器人辅助微创手术的高分辨率内窥镜视频数据集

Fengyi Jiang, Xiaorui Zhang, Lingbo Jin, Ruixing Liang, Yuxin Chen, Adi Chola Venkatesh, Jason Culman, Tiantian Wu, Lirong Shao, Wenqing Sun, Cong Gao, Hallie McNamara, Jingpei Lu, Omid Mohareri

机构 * Intuitive Surgical, Inc.(Intuitive Surgical公司) Johns Hopkins Medicine Neurosurgery(约翰霍普金斯医学神经外科) Johns Hopkins University Electrical and Computer Engineering(约翰霍普金斯大学电气与计算机工程) University of British Columbia Electrical and Computer Engineering(不列颠哥伦比亚大学电气与计算机工程) Wilford & Kate Bailey Small Animal Teaching Hospital(威尔福德与凯蒂·贝利小动物教学医院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SurgiSR4K数据集,用于提升微创手术的视觉清晰度和计算机辅助导航精度,包含4K分辨率的手术视频,涵盖镜面反射、工具遮挡等挑战性场景,支持超分辨率、烟雾去除等多任务研究。

Journal ref Machine Learning for Biomedical Imaging, Vol. 3, 2025, pp. 875-885

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18112 2026-04-30 cs.CL cs.MM 75%

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07692 2026-04-30 cs.LG 74%

Tree-of-Evidence: Efficient "System 2" Search for Faithful Multimodal Grounding

证据树:高效的'系统2'搜索用于忠实的多模态接地

Micky C. Nnamdi, Benoit L. Marteau, Yishan Zhong, J. Ben Tamo, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.LG

AI总结 本文提出Tree-of-Evidence算法,通过离散优化问题实现多模态模型的可解释性,通过证据瓶颈和束搜索生成可审计的证据集,保留高预测性能并提升决策一致性。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22477 2026-04-30 cs.CV cs.LG 62%

Contrastive Semantic Projection: Faithful Neuron Labeling with Contrastive Examples

对比语义投影:利用对比示例实现忠实的神经元标注

Oussama Bouanani, Jim Berend, Wojciech Samek, Sebastian Lapuschkin, Maximilian Dreyer

机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) Technische Universität Berlin(柏林技术大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出对比语义投影(CSP),通过视觉语言模型生成候选标签并结合CLIP-like编码器进行标签分配,改进神经元标注的准确性和语义粒度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 62%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08618 2026-04-30 cs.IR cs.AI cs.SE 57%

SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support

SkillForge: 在云技术支持中锻造领域特定的自我进化代理技能

Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SkillForge通过闭环创建-评估-改进机制,解决云技术支持中领域特定技能缺乏和持续优化的问题,实验表明其能显著提升技能质量。

Comments Accepted at ACM SIGIR 2026 Industry Track. 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26565 2026-04-30 cs.CV 57%

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线

Mingji Ge, Qirui Chen, Zeqian Li, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26067 2026-04-30 cs.CV 57%

RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments

RADIO-ViPE:面向动态环境的在线紧密耦合多模态融合用于开放词汇语义SLAM

Zaid Nasser, Mikhail Iumanov, Tianhao Li, Maxim Popov, Jaafar Mahmoud, Sergey Kolyubin

机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab, ITMO University(生物机电学与高效能机器人实验室,ITMO大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 RADIO-ViPE通过在线多模态融合实现动态环境中开放词汇语义SLAM,无需校准RGB-D输入,结合视觉与语言嵌入提升地图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20032 2026-04-30 cs.CV 57%

Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

告诉模型该看哪里:通过视觉引导注意力缓解大语言模型的幻觉

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科技东南学院) Zhongguancun Laboratory(中关村实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出视觉引导注意力(VGA),通过构建精确的视觉基础并引导模型关注相关区域,缓解大语言模型在视觉任务中的幻觉问题,且无需额外训练。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26666 2026-04-30 cs.DC cs.PF 50%

FACT: Compositional Kernel Synthesis with a Three-Stage Agentic Workflow

FACT:基于三阶段代理工作流的组合内核合成

Sina Heidari, Dimitrios S. Nikolopoulos

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 FACT框架通过三阶段代理工作流实现PyTorch模块的多模式组合优化,结合CUTLASS C++实现内核合成,提升GPU计算性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26653 2026-04-30 cs.IR 50%

AgentSim: A Platform for Verifiable Agent-Trace Simulation

AgentSim:可验证代理跟踪模拟平台

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出AgentSim平台,通过多模型验证和主动人工参与流程,生成可验证的代理推理轨迹,构建了覆盖三个信息检索基准的Agent-Trace Corpus,并揭示了先进模型在信息检索中的系统性差异。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26161 2026-04-30 cs.PL 50%

Finite Functional Programming

有限函数编程

Michael Arntzenius, Max Willsey

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出有限函数编程,通过将谓词视为具有有限支持的函数,统一了函数式和逻辑编程,用于处理聚合和加权逻辑编程。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏