arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-02 至 2026-04-02 共收录 23 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 23 篇

2604.00455 2026-04-02 cs.CV cs.AI cs.CL 88%

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

首个Logit提升:一种缓解大视觉-语言模型中物体幻觉的视觉 grounding 方法

Jiwoo Ha, Jongwoo Baek, Jinhyun So

机构 * DGIST EECS(大邱庆北科学技术院电子工程与计算机科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FLB方法,通过存储首个生成token的logit并加到后续预测中,缓解大视觉-语言模型中的长期衰减问题,有效减少物体幻觉并保持视觉信息。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00061 2026-04-02 cs.RO cs.SY eess.SP eess.SY 85%

Advancing Multi-Robot Networks via MLLM-Driven Sensing, Communication, and Computation: A Comprehensive Survey

通过MLLM驱动的感知、通信与计算推进多机器人网络:综述

Hyun Jong Yang, Howon Lee, Kyuhong Shim, Jeongho Kwak, Hyunsoo Kim, Donghoon Kim, Khoa Anh Ngo, Sehyun Ryu, Jaehyun Choi, Youbin Kim, Chanjun Moon, Michael Ryoo, Byonghyo Shim

机构 * Seoul National University(首尔大学) Ajou University(亚洲大学) Sungkyunkwan University(成均馆大学) Korea University(高丽大学) POSTECH(浦项科技大学) Stony Brook University(石溪大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 本文综述了MLLM指导下的多机器人协调,探讨了集成设计对多机器人协作的影响,展示了四种端到端演示,强调了系统级指标的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00396 2026-04-02 cs.CV 83%

VLM-in-the-Loop: A Plug-In Quality Assurance Module for ECG Digitization Pipelines

VLM-in-the-Loop:一种用于心电图数字化流程的插件质量保证模块

Jiachen Li, Shihao Li, Soovadeep Bakshi, Wei Li, Dongmei Chen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :VLM(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出VLM-in-the-Loop模块,通过闭环VLM反馈提升心电图数字化流程质量,显著提高判定一致性与保真度,适用于多种后端系统,实现高质量心电图数字化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20146 2026-04-02 cs.CV 83%

VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection

VMAD:视觉增强的多模态大语言模型用于零样本异常检测

Huilin Deng, Hongchen Luo, Wei Zhai, Yang Cao, Yu Kang

机构 * University of Science and Technology of China(中国科学技术大学) Northeastern University(东北大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 VMAD通过结合视觉信息与多模态大语言模型,提升零样本异常检测的精度与分析能力,提出缺陷敏感结构学习和局部增强令牌压缩等方法,结合RIAD数据集验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00507 2026-04-02 cs.CV 79%

RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

RegFormer:可转移的交互关系接地以实现高效的弱监督人类-物体交互检测

Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) LG Energy Solution(LG新能源) Korea University(高丽大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 RegFormer通过空间接地信号实现高效的弱监督人类-物体交互检测,无需额外训练即可直接迁移至实例级推理,实验表明其在效率和性能上均优于传统方法。

Comments Accepted at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08476 2026-04-02 cs.CV cs.MM 79%

Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models

跨模态代理演化用于领域外检测与视觉-语言模型

Hao Tang, Yu Liu, Shuanglin Yan, Fei Shen, Shengfeng He, Jing Qin

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CoEvo框架,通过双向样本条件适应文本和视觉代理,动态挖掘上下文文本负样本并迭代优化视觉代理,提升跨模态对齐和领域外检测鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01184 2026-04-02 cs.CV 79%

Object Affordance Recognition and Grounding via Multi-scale Cross-modal Representation Learning

基于多尺度跨模态表示学习的对象 affordance 识别与定位

Xinhang Wan, Dongqiang Gou, Xinwang Liu, En Zhu, Xuming He

机构 * National University of Defense Technology(国防科技大学) ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出一种新的方法,通过学习 affordance 意识的 3D 表示和分阶段推理策略,解决对象 affordance 定位与分类任务中的依赖关系建模问题,提升识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27183 2026-04-02 cs.CV 77%

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

关于空间的交流:通过语言介导的空间整合跨部分视图

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型能否通过对话整合不同视角,发现其在识别共享锚点物体上表现较好,但在关系推理和全局地图构建上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01221 2026-04-02 cs.AI cs.CV 73%

HippoCamp: Benchmarking Contextual Agents on Personal Computers

HippoCamp:在个人电脑上对上下文代理进行基准测试

Zhe Yang, Shulin Tian, Kairui Hu, Shuai Liu, Hoang-Nhat Nguyen, Yichi Zhang, Zujin Guo, Mengying Yu, Zinan Zhang, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(新加坡南洋理工大学S-Lab)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 HippoCamp是一个新的基准,用于评估代理在多模态文件管理中的能力,通过用户为中心的环境建模个体用户档案并搜索大规模个人文件进行上下文感知推理,揭示了当前代理在真实环境中的局限性。

Comments Project Page: https://hippocamp-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01179 2026-04-02 cs.RO cs.AI cs.CV 73%

A ROS 2 Wrapper for Florence-2: Multi-Mode Local Vision-Language Inference for Robotic Systems

为Florence-2设计的ROS 2封装器:面向机器人系统的多模式本地视觉语言推断

J. E. Domínguez-Vidal

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个ROS 2封装器,实现Florence-2模型的三种交互模式,支持本地部署和容器化运行,验证了消费级硬件在视觉语言任务中的可行性。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00404 2026-04-02 cs.CV 70%

The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation

第五届PVUW MeViS-Text挑战赛第一名:强多模态大语言模型与SAM3的结合用于指代视频对象分割

Xusheng He, Canyang Wu, Jinrong Zhang, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种无需微调的管道,结合强多模态大语言模型与SAM3,实现视频对象分割,取得PVUW 2026 MeViS-Text测试集第一名,得分为0.909064。

Comments 1st Place Solution for the 5th PVUW MeViS-Text Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16908 2026-04-02 cs.CV 70%

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Q-REAL:迈向AI生成内容真实性和可信度评估

Shushi Wang, Zicheng Zhang, Chunyi Li, Wei Wang, Liya Ma, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19851 2026-04-02 cs.CV 70%

Towards Online Multi-Modal Social Interaction Understanding

面向在线多模态社交交互理解

Xinpeng Li, Shijian Deng, Bolin Lai, Weiguo Pian, James M. Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :VLM(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出在线多模态社交交互理解问题,通过历史信息实现多模态社交交互理解,采用多模态大语言模型框架,引入多对话者预测和社交感知视觉提示,实现三个任务的最优性能。

Comments Accepted to Transactions on Machine Learning Research (TMLR). Project page: https://sampson-lee.github.io/online-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00853 2026-04-02 cs.CV 57%

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

MotionGrounder: 通过扩散变换器实现多物体运动迁移

Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电气工程学院) Adobe Research(Adobe研究院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出MotionGrounder,一种基于扩散变换器的多物体运动迁移框架,通过流式运动信号和对象-描述对齐损失实现稳定运动先验和空间对齐,实验显示其在定量、定性和人类评估中均优于现有方法。

Comments Please visit our project page at https://kaist-viclab.github.io/motiongrounder-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00395 2026-04-02 cs.CV 57%

Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge

通过跟踪增强提示推进复杂视频对象分割:第五届PVUW MOSE挑战赛第一名

Jinrong Zhang, Canyang Wu, Xusheng He, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, China(深圳市环区研究所)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TEP方法,通过跟踪增强提示解决SAM3在处理小目标和语义主导对象时的不足,取得PVUW挑战赛优异成绩。

Comments 1st Place Solution for the 5th PVUW MOSE Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29620 2026-04-02 cs.CV cs.MM 57%

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理

Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo Hu, Yi-Fan Zhang, Yunlong Lin, Wenxuan Huang, Mingyang Song, Dasen Dai, Bolin Jiang, Manyuan Zhang, Shi-Xue Zhang, Zhengkai Jiang, Lucas Wang, Zhao Zhong, Yu Cheng, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。

Comments Project Page: https://github.com/shawn0728/Unify-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00248 2026-04-02 cs.CL cs.AI 57%

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

REM-CTX:通过强化学习与辅助上下文实现的自动化同行评审

Pawin Taechoyotin, Daniel E. Acuna

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 REM-CTX通过强化学习与辅助上下文提升同行评审质量,实验显示其在多个领域中优于基线模型,且在质量和上下文关联性指标上表现突出。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00010 2026-04-02 cs.CL cs.AI 57%

Can LLMs Perceive Time? An Empirical Investigation

大语言模型能感知时间吗?一项实证研究

Aniketh Garikaparthi

机构 * TCS Research(塔塔咨询服务公司研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在时间估计上的局限性,通过68项任务和四类模型进行实验,发现模型在预任务估计、相对排序和事后回忆中均存在显著误差,表明模型缺乏对自身推理时间的体验性认知。

Comments ICLR 2026 I Can't Believe It's Not Better Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01110 2026-04-02 cs.SE 50%

Harnessing Hype to Teach Empirical Thinking: An Experience With AI Coding Assistants

利用 hype 教授实证思维:与 AI 编码助手的实践经验

Marvin Wyrich, Norman Peitek, Kallistos Weis, Sven Apel

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨通过 hype 驱动技术使学生更易理解实证方法,结合 AI 编码助手实践,提升学生批判性思维与实证研究能力。

Comments Accepted to FSE'26 (Education Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24116 2026-04-02 eess.AS 50%

How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools

开放程度如何?对开源语音合成工具的实用性评估

Teodora Răgman, Adrian Bogdan Stânea, Horia Cucu, Adriana Stan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文评估了四种开源语音合成框架在构建新型TTS模型的可行性,特别是在资源受限语言中的挑战,通过客观指标和主观测试揭示了工具链设置、数据预处理和计算效率的问题。

Comments Published in IEEE Access https://ieeexplore.ieee.org/document/11269795

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09504 2026-04-02 cs.CL 50%

MVSS: A Unified Framework for Multi-View Structured Survey Generation

MVSS:多视图结构化调查生成的统一框架

Yinqi Liu, Yueqi Zhu, Yongkang Zhang, Feiran Liu, Yutong Shen, Yufei Sun, Xin Wang, Renzhao Liang, Yidong Wang, Cunxiang Wang

机构 * Beijing University of Technology(北京工业大学) Peking University(北京大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出MVSS框架,通过结构优先方法生成和对齐引用支撑的层级树、结构化比较表和调查文本,提升调查生成的结构组织和证据呈现质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12993 2026-04-02 cs.SE cs.CR 50%

SmartPoC: Generating Executable and Validated PoCs for Smart Contract Bug Reports

SmartPoC: 为智能合约漏洞报告生成可执行且验证的PoC

Longfei Chen, Ruibin Yan, Taiyu Wong, Yiyang Chen, Jialai Wang, Chao Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SmartPoC通过生成并执行可执行的PoC测试用例,验证审计报告中的漏洞。该方法通过提取关键函数切片、生成-修复-执行循环及差分验证提高可执行性与准确性,实现了高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23418 2026-04-02 cs.CR 50%

Beyond Metadata: Multimodal, Policy-Aware Detection of YouTube Scam Videos

超越元数据:多模态、政策感知的YouTube诈骗视频检测

Ummay Kulsum, Aafaq Sabir, Abhinaya S. B., Anupam Das

专题命中 视觉定位与Grounding :LLaVA(abstract)

AI总结 本文提出多模态、政策感知的YouTube诈骗视频检测方法,通过结合文本、音频和视频信息,提升检测性能和鲁棒性,同时提供可解释的政策依据。

Comments Accepted at AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏