arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-01 至 2026-04-01 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 17 篇

2603.29798 2026-04-01 cs.CV 88%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :VLM(title,abstract);grounding(title);vision-language model(abstract);分类 cs.CV

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29109 2026-04-01 cs.SE cs.AI 79%

SemLoc: Structured Grounding of Free-Form LLM Reasoning for Fault Localization

SemLoc:基于结构化语义绑定的自由形式LLM推理故障定位

Zhaorui Yang, Haichao Zhu, Qian Zhang, Rajiv Gupta, Ashish Kundu

机构 * UC Riverside(加州大学河滨分校) Cisco Research(思科研究院) Independent Researcher(独立研究员)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 SemLoc通过结构化语义绑定将自由形式LLM推理转化为封闭中间表示,结合语义违反光谱提升故障定位精度,实现7.6%的代码检查效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23043 2026-04-01 cs.CV 79%

HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

HieraMamba:通过分层锚点-Mamba池化实现视频时间接地

Joungbin An, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 HieraMamba通过分层锚点-Mamba池化结构,在长视频中实现精确的时间定位,解决了视频时间接地中的全局上下文与细粒度时间细节捕捉难题。

Comments CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29602 2026-04-01 cs.GR cs.AI cs.CV cs.MA 73%

IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection

IMAGAgent:通过约束感知规划与反思协调多轮图像编辑

Fei Shen, Chengyu Xie, Lihong Wang, Zhanyi Zhang, Xin Jiang, Xiaoyu Du, Jinhui Tang

机构 * National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 IMAGAgent通过闭环机制整合指令解析、工具调度与自适应修正,解决多轮图像编辑中的上下文感知与反馈问题,提升编辑精度与整体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29271 2026-04-01 cs.CV 70%

ConInfer: Context-Aware Inference for Training-Free Open-Vocabulary Remote Sensing Segmentation

ConInfer:面向无训练开放词汇遥感分割的上下文感知推理

Wenyang Chen, Zhanxuan Hu, Yaping Zhang, Hailong Ning, Yonghang Tai

机构 * Yunnan Normal University(云南师范大学) Xi’an University of Posts & Telecommunications(西安邮电大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ConInfer框架,通过联合预测多空间单元并建模其语义依赖,提升遥感图像分割的准确性和鲁棒性,实验表明在多个数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28888 2026-04-01 cs.RO 67%

A Semantic Observer Layer for Autonomous Vehicles: Pre-Deployment Feasibility Study of VLMs for Low-Latency Anomaly Detection

面向自动驾驶的语义观察层:VLMs在低延迟异常检测中的预部署可行性研究

Kunal Runwal, Swaraj Gajare, Daniel Adejumo, Omkar Ankalkope, Siddhant Baroth, Aliasghar Arab

机构 * The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系) Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院电气与计算机工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种语义观察层,通过量化视觉-语言模型实现低延迟异常检测,验证了其在自动驾驶平台上的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29777 2026-04-01 cs.CV cs.AI 62%

From Skeletons to Semantics: Design and Deployment of a Hybrid Edge-Based Action Detection System for Public Safety

从骨架到语义:一种混合边缘基于的动作检测系统在公共安全中的设计与部署

Ganen Sethupathy, Lalit Dumka, Jan Schagen

机构 * Sopra Steria Germany(Sopra Steria德国) Sopra Steria India(Sopra Steria印度)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种混合边缘动作检测系统,结合骨架运动分析与视觉语言模型,以提升公共安全中的实时视频分析能力,通过系统级对比展示两种方法在边缘计算中的互补性与局限性。

Comments Preprint version of a manuscript currently under review at IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29847 2026-04-01 cs.GR cs.CV cs.HC 57%

CADReasoner: Iterative Program Editing for CAD Reverse Engineering

CADReasoner: 用于CAD逆向工程的迭代程序编辑

Soslan Kabisov, Vsevolod Kirichuk, Andrey Volkov, Gennadii Savrasov, Marina Barannikov, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov

机构 * Lomonosov Moscow State University(莫斯科国立大学) Université Paris Dauphine(巴黎多芬大学) Innopolis University(因诺波利斯大学) FusionBrain Lab(FusionBrain实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 CADReasoner通过迭代优化几何差异,提升CAD逆向工程的精度与效率,实现多视角渲染与点云的融合,并在多个基准测试中取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29741 2026-04-01 cs.SI cs.AI cs.MA 57%

BotVerse: Real-Time Event-Driven Simulation of Social Agents

BotVerse: 基于事件驱动的实时社会代理高保真模拟

Edoardo Allegrini, Edoardo Di Paolo, Angelo Spognardi, Marinella Petrocchi

机构 * Computer Science Dept., Sapienza University of Rome(罗马大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 BotVerse通过LLM代理实现高保真社会模拟,提供安全实验环境用于红队测试和计算社会科学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29422 2026-04-01 cs.CV 57%

Multimodal Models Meet Presentation Attack Detection on ID Documents

多模态模型在身份证文档呈现攻击检测中的应用

Marina Villanueva, Juan M. Espin, Juan E. Tapia

机构 * Security Research Group Hochschule Darmstadt, Germany

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV

AI总结 本文探讨了将视觉和文本模态结合,利用预训练多模态模型提升身份证文档呈现攻击检测性能,但实验表明这些模型在该任务上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00524 2026-04-01 cs.CV 57%

Text-guided Fine-Grained Video Anomaly Understanding

基于文本引导的细粒度视频异常理解

Jihao Gu, Kun Li, He Wang, Kaan Akşit

机构 * University College London(伦敦大学学院) CVLab, College of Information Technology, United Arab Emirates University(阿联酋大学信息技术学院计算机视觉实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出T-VAU框架,通过多模态推理提取细粒度视频异常证据,结合Anomaly Heatmap Decoder和Region-aware Anomaly Encoder提升异常检测与解释能力。

Comments Accepted by CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20155 2026-04-01 cs.CV 57%

PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D Part Understanding

PartNeXt:面向细粒度和层次化3D部件理解的下一代数据集

Penghao Wang, Yiyang He, Xin Lv, Yukai Zhou, Lan Xu, Jingyi Yu, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 PartNeXt通过23000个高质量纹理3D模型,解决传统数据集在可扩展性和实用性上的不足,提升细粒度部件分割和3D部件问答任务的性能。

Comments NeurIPS 2025 DB Track. Project page: https://authoritywang.github.io/partnext

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08005 2026-04-01 cs.SE cs.AI 57%

Past, Present, and Future of Bug Tracking in the Generative AI Era

过去、现在与未来:生成AI时代的缺陷跟踪

Utku Boran Torun, Mehmet Taha Demircan, Mahmut Furkan Gön, Eray Tüzün

机构 * Bilkent University, Department of Computer Engineering(比尔肯大学计算机工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨生成AI时代缺陷跟踪的发展,提出基于大语言模型和智能代理的框架,旨在通过自然语言报告和AI自动化降低解决时间与协调成本。

Comments Accepted to ACM TOSEM Special Issue: 2030 Software Engineering Roadmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21223 2026-04-01 cs.CV cs.CL 57%

Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding

Sigma:基于骨骼的语义信息预训练用于手语理解

Muxin Pu, Mei Kuan Lim, Chun Yong Chong, Chen Change Loy

机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Sigma提出一种统一的骨骼手语理解框架,通过语义对齐学习和预训练策略提升手语识别与翻译性能,展现语义信息预训练在多语言手语任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV 57%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29856 2026-04-01 cs.HC cs.GR cs.RO 50%

An Interactive LLM-Based Simulator for Dementia-Related Activities of Daily Living

基于交互式大语言模型的痴呆相关日常活动模拟器

Kruthika Gangaraju, Shu-Fen Wung, Kevin Berner, Jing Wang, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院) University of California Davis(加州大学戴维斯分校) MGH Institute of Health Professionals(麻省总医院健康专业学院) University of New Hampshire(新罕布什尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一个交互式模拟器,利用大语言模型生成痴呆患者在日常活动中的多轮行为,通过专家反馈优化策略,提升辅助AI和机器人在痴呆护理中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29820 2026-04-01 cs.SD 50%

SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision

SIREN:基于视觉的双耳音频重建

Mingyeong Song, Seoyeon Ko, Junhyug Noh

机构 * Ewha Womans University, Seoul, Korea(韩国首尔梨花女子大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SIREN通过视觉引导将单声道音频转换为双耳音频,利用双头自注意力机制生成场景图,并通过两阶段波形域融合抑制混响,提升时间频率和相位敏感度指标。

Comments 5 pages, 1 figure, to appear in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏