arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-04 至 2026-03-04 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 11 篇

2603.02329 2026-03-04 cs.CV 89%

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

HAMMER: 通过跨模态整合利用大语言模型进行意图驱动的3D affordance grounding

Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 HAMMER通过跨模态整合多模态大语言模型,实现意图驱动的3D affordance grounding,提升3D表示的准确性和鲁棒性。

Comments Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03101 2026-03-04 cs.LG cs.AI cs.CV 82%

ALARM: Automated MLLM-Based Anomaly Detection in Complex-EnviRonment Monitoring with Uncertainty Quantification

ALARM: 基于多模态大语言模型的复杂环境监控异常检测与不确定性量化

Congjing Zhang, Feng Lin, Xinyi Zhao, Pei Guo, Wei Li, Lin Chen, Chaoyue Zhao, Shuai Huang

机构 * Department of Industrial and Systems Engineering, University of Washington(华盛顿大学工业与系统工程系) Wyze Labs, Inc.(Wyze实验室)

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ALARM通过结合不确定性量化与多模态大语言模型,实现了复杂环境中的异常检测,展现出在不同领域中的高准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02484 2026-03-04 cs.RO math.OC 78%

COLREGs Compliant Collision Avoidance and Grounding Prevention for Autonomous Marine Navigation

自主水运船舶的碰撞规避与搁浅预防:符合国际海上避碰规则

Mayur S. Patil, Nataraj Sudharsan, Veneela Ammula, Jude Tomdio, Jin Wang, Michael Kei, Sivakumar Rathinam, Prabhakar R. Pagilla

机构 * Department of Mechanical Engineering, Texas A&M University, College Station, USA(德克萨斯A&M大学机械工程系) American Bureau of Shipping, Spring, TX, USA(美国船舶局)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出了一种基于凸优化的运动规划方法,用于自主水运船舶的碰撞规避、COLREGs合规性和搁浅预防。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02754 2026-03-04 cs.CV 70%

Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing

无需训练即可清晰感知:减轻多模态大语言模型在遥感中的幻觉

Yi Liu, Jing Zhang, Di Wang, Xiaoyu Tian, Haonan Guo, Bo Du

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, China(中关村学院) School of Computer Science, Chongqing University, China(重庆大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 RADAR通过利用多模态大语言模型的内在注意力,无需训练即可减少遥感视觉问答中的事实性和逻辑性幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02519 2026-03-04 cs.MM cs.IR 67%

Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling

具有自适应测试时间缩放的代理混合源多模态虚假信息检测

Wei Jiang, Tong Chen, Wei Yuan, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 AgentM3D通过自适应测试时间缩放和多代理框架提升零样本多模态虚假信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14572 2026-03-04 cs.LG cs.AI 62%

Robust Weight Imprinting: Insights from Neural Collapse and Proxy-Based Aggregation

鲁棒性权重印刻:来自神经坍缩和基于代理的聚合的见解

Justus Westerhoff, Golzar Atefi, Mario Koddenbrock, Alexei Figueroa, Alexander Löser, Erik Rodner, Felix A. Gers

机构 * DATEXIS, Berliner Hochschule für Technik (BHT), Germany(DATEXIS,柏林技术学院(BHT)) KI-Werkstatt, University of Applied Sciences Berlin, Merantix Momentum, Germany(KI工作室,柏林应用技术大学,Merantix Momentum) Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术与经济高等学院(HTW))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出IMPRINT框架,通过神经坍缩现象和代理聚合改进迁移学习,实现4%的性能提升。

Journal ref Transactions on Machine Learning Research (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02924 2026-03-04 cs.CV 57%

HDINO: A Concise and Efficient Open-Vocabulary Detector

HDINO:一种简洁且高效的开放词汇检测器

Hao Zhang, Yiqun Wang, Qinran Lin, Runze Fan, Yong Li

机构 * Chongqing University(重庆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 HDINO提出了一种简洁高效的开放词汇检测方法,通过两阶段训练策略和轻量级特征融合模块,在无需人工数据编纂的情况下实现了优于现有方法的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02896 2026-03-04 cs.CV 57%

3D-DRES: Detailed 3D Referring Expression Segmentation

3D-DRES: 详细3D指称表达分割

Qi Chen, Changli Wu, Jiayi Ji, Yiwei Ma, Liujuan Cao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 3D-DRES通过引入DetailRefer数据集和DetailBase架构,提升3D视觉语言理解的细粒度分割能力。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02688 2026-03-04 cs.AI cs.RO 57%

Retrieval-Augmented Robots via Retrieve-Reason-Act

通过检索-推理-行动实现增强型机器人

Izat Temiraliev, Diji Yang, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出检索增强型机器人学(RAR)范式,通过检索-推理-行动循环,使机器人能从外部文档获取未见程序知识,提升复杂任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02626 2026-03-04 cs.AI 57%

See and Remember: A Multimodal Agent for Web Traversal

见与忆:一种用于网页浏览的多模态代理

Xinjun Wang, Shengyao Wang, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) East China Normal University(华东师范大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 V-GEMS通过视觉 grounding 和显式记忆系统实现精确稳健的网页浏览,实验显示其在导航任务中性能提升28.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12753 2026-03-04 cs.RO 50%

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Models Reasoning

osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航

Fujing Xie, Sören Schwertfeger, Hermann Blum

机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) University of Bonn(波恩大学) Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。

Comments accepted at RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏