arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-30 至 2026-03-30 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2603.11601 2026-03-30 cs.AI 85%

See, Symbolize, Act: Grounding VLMs with Spatial Representations for Better Gameplay

看见、符号化、行动:通过空间表示接地VLMs以实现更好的游戏表现

Ashish Baghel, Paras Chopra

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文研究了通过提供视觉帧和场景符号表示来提升VLMs在交互环境中的表现,发现准确的符号信息能提升性能,但自身提取符号的模型性能受模型能力和场景复杂度影响。

Comments 11 pages, 13 figures. Accepted to LMReasoning Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26646 2026-03-30 cs.CV 83%

Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision

超越语言:基于手部指向的自我中心视觉指称表达定位

Ling Li, Bowen Liu, Zinuo Zhan, Peng Jie, Jianhui Zhong, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Apple(苹果公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EgoPoint-Ground数据集,通过手部指向与语音结合的指称机制,改进视觉指称表达的定位方法,并提出SV-CoT框架提升多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24133 2026-03-30 cs.CV cs.AI 79%

Compositional Image Synthesis with Inference-Time Scaling

基于推理时缩放的图像合成

Minsuk Ji, Sanghyeok Lee, Namhyuk Ahn

机构 * Inha University(仁荷大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无需训练的框架,结合对象中心方法与自我完善,提升布局忠实度并保持美学质量,通过大语言模型生成布局并注入图像生成过程,利用对象中心视觉-语言模型进行迭代选择,实现更强的场景对齐。

Comments projcet page: https://github.com/gcl-inha/ReFocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25791 2026-03-30 cs.CV 77%

ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

ArtHOI:通过基础模型驯化实现单目4D手-物体交互重建

Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ArtHOI框架,通过整合多基础模型先验知识,解决单目视频中手-物体交互的4D重建问题,引入自适应采样细化和多模态大语言模型引导对齐方法,构建两个新数据集并验证方法有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26127 2026-03-30 cs.CV cs.AI cs.CL cs.LG cs.MM 75%

Finding Distributed Object-Centric Properties in Self-Supervised Transformers

在自监督变压器中发现分布式以对象为中心的属性

Samyak Rawlekar, Amitabh Swain, Yujun Cai, Yiwei Wang, Ming-Hsuan Yang, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Queensland(昆士兰大学) UC Merced(加州大学默塞德分校)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文分析了自监督视觉变压器中对象中心属性的分布式编码机制,提出Object-DINO方法通过聚类注意力头提升无监督对象发现和多模态大语言模型的视觉 grounding。

Comments Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22225 2026-03-30 cs.CV cs.AI 73%

ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

ExtrinSplat:解耦几何与语义以实现3D高斯散射中的开放词汇理解

Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Guangdong Bohua UHD Innovation Center Co., Ltd.(广东博华超高清创新中心有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ExtrinSplat通过解耦几何与语义,利用视觉语言模型生成轻量文本假设,提升3D高斯散射中开放词汇物体选择和语义分割的性能和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26126 2026-03-30 cs.CV 70%

Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR

超越寻找范围:用于多模态RLVR的轨迹引导强化学习

Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Mingzhu Chen, Jiancan Wu, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Pecking University(北京大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出轨迹引导强化学习(TGRL),通过专家推理轨迹引导策略模型整合视觉证据进行精细推理,提升多模态推理性能,弥合视觉感知与逻辑推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25946 2026-03-30 cs.CV cs.AI cs.LG 67%

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

面向端到端驾驶的碰撞感知视觉-语言学习:多模态违规数据集

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Nissan Motor Corporation(日产汽车公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VLAAD模型,通过多实例学习获取碰撞信号,提升驾驶评分,并在真实数据集上验证其泛化能力。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26052 2026-03-30 cs.CV cs.AI 62%

Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

像素与词语之间的桥梁:面向多模态媒体验证的掩码感知局部语义融合

Zizhao Chen, Ping Wei, Ziyang Ren, Huan Li, Xiangru Yin

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MaLSF框架,通过主动双向验证和层次语义聚合模块,解决多模态虚假信息检测中的局部语义不一致问题,实现像素与词语的语义连接。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10983 2026-03-30 cs.CV cs.AI 62%

Binary Verification for Zero-Shot Vision

零样本视觉的二元验证

Rongbin Hu, Jeffrey Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无需训练的二元验证流程,通过量化和二元化步骤提升零样本视觉任务性能,适用于引用表达定位、空间推理和BLINK-Jigsaw等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26541 2026-03-30 cs.CV 57%

OVI-MAP:Open-Vocabulary Instance-Semantic Mapping

OVI-MAP:开放词汇实例语义映射

Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) University of Zurich(苏黎世大学) TU Munich(慕尼黑工业大学) Microsoft(微软)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OVI-MAP,通过解耦实例重建与语义推断,实现增量开放词汇3D实例语义映射,提升实时处理与零样本语义标注能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26512 2026-03-30 cs.AI 57%

CADSmith: Multi-Agent CAD Generation with Programmatic Geometric Validation

CADSmith: 基于程序化几何验证的多智能体CAD生成

Jesse Barkley, Rumi Loghmani, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 CADSmith通过多智能体管道生成CadQuery代码,并通过双重嵌套修正循环进行迭代优化,结合精确测量和视觉评估提升CAD生成质量。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26440 2026-03-30 cs.LG cs.CE 57%

Interpretable long-term traffic modelling on national road networks using theory-informed deep learning

基于理论指导的深度学习的国家道路网络长期交通建模

Yue Li, Shujuan Chen, Akihiro Shimoda, Ying Jin

机构 * Martin Centre for Architectural and Urban Studies, University of Cambridge(剑桥大学马丁建筑与城市研究中心) Independent Researcher(独立研究员)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出DeepDemand框架,结合交通理论与深度学习,通过社会经济特征和道路网络结构预测长期高速公路交通量,验证了其在长期规划中的有效性与地理可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26252 2026-03-30 cs.HC cs.AI 57%

Channelling, Coordinating, Collaborating: A Three-Layer Framework for Disability-Centered Human-Agent Collaboration

通道、协调与协作:一种面向残疾人的人机协作三层次框架

Lan Xiao, Catherine Holloway

机构 * Global Disability Innovation Hub(全球残障创新中心) UCL Interaction Centre(伦敦大学学院交互中心) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种三层次框架,重新定义AI在能力多样协作中的作用,通过建立跨能力的信息基础、协调不同能力的协作流程,并作为有界伙伴推动共同目标。

Comments Accepted in CHI '26 Workshop on Human-Agent Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17528 2026-03-30 cs.CV 57%

MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing

MM-OVSeg:多模态光学-合成孔径雷达融合用于遥感中的开放词汇分割

Yimin Wei, Aoran Xiao, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所先进智能研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MM-OVSeg通过融合光学和SAR数据,提升恶劣天气下的开放词汇分割鲁棒性与泛化能力,采用跨模态统一过程和双编码器融合模块实现多传感器表征对齐与多模态分割。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13222 2026-03-30 cs.IR cs.AI 57%

Incorporating Q&A Nuggets into Retrieval-Augmented Generation

将问答 nugget 融入检索增强生成

Laura Dietz, Bryan Li, Gabrielle Liu, Jia-Huei Ju, Eugene Yang, Dawn Lawrie, William Walden, James Mayfield

机构 * University of New Hampshire(新罕布什尔大学) University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学) University of Amsterdam(阿姆斯特丹大学) Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人类语言技术卓越中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Crucible系统,通过构建问答nugget库提升生成质量,保留引用溯源,优于现有系统。

Comments To appear in the Proceedings of ECIR 2026, Lecture Notes in Computer Science, Volume 16484

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00255 2026-03-30 cs.CV 57%

BeetleFlow: An Integrative Deep Learning Pipeline for Beetle Image Processing

BeetleFlow: 一种用于甲虫图像处理的集成深度学习流水线

Fangxun Liu, S M Rayeed, Samuel Stevens, Alyson East, Cheng Hsuan Chiang, Colin Lee, Daniel Yi, Junke Yang, Tejas Naik, Ziyi Wang, Connor Kilrain, Elijah H Buckwalter, Jiacheng Hou, Saul Ibaven Bueno, Shuheng Wang, Xinyue Ma, Yifan Liu, Zhiyuan Tao, Ziheng Zhang, Eric Sokol, Michael Belitz, Sydne Record, Charles V. Stewart, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The University of Maine(缅因大学) National Ecological Observatory Network (NEON), Battelle(国家生态观测网络(NEON),巴特尔纪念研究所) Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出BeetleFlow流水线,通过深度学习方法自动处理大量甲虫图像,实现甲虫检测、排序裁剪和形态分割,提高生物研究效率。

Comments 4 pages, NeurIPS 2025 Workshop Imageomics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26329 2026-03-30 cs.SE 50%

Large Language Models for Software Testing Education: an Experience Report

大型语言模型在软件测试教育中的应用:经验报告

Peng Yang, Yunfeng Zhu, Chao Chang, Shengcheng Yu, Zhenyu Chen, Yong Tang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过混合方法研究,探讨学生在使用LLM进行测试任务时的交互问题及教学策略,提出轻量级提示框架以提升测试脚本生成能力。

Comments Paper Accepted by the ACM International Conference on the Foundations of Software Engineering (FSE 2026) Software Engineering Education Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16123 2026-03-30 cs.HC 50%

"You Can Actually Do Something'': Shifts in High School Computer Science Teachers' Conceptions of AI/ML Systems and Algorithmic Justice

你实际上可以做些什么

Daniel J. Noh, Deborah A. Fields, Yasmin B. Kafai, Danaé Metaxa

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨了高中计算机教师在参与设计一年后,对AI/ML系统理解的转变,发现教师观点更加具体、批判性和主动性,强调通过教育角色关注算法正义。

详情

展开后加载摘要…

URL PDF HTML 收藏