arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-27 至 2026-04-27 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 10 篇

2512.22519 2026-04-27 cs.RO 87%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22367 2026-04-27 cs.CL cs.AI 84%

CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

CNSL-bench:用于评估多模态大语言模型在中文国家手语理解能力的基准

Rui Zhao, Xuewen Zhong, Xiaoyun Zheng, Jinsong Su, Yidong Chen

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省-台湾非物质文化遗产数字化保护与智能处理重点实验室(XMU),文化和旅游部,中国) National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CNSL-bench,首个评估多模态大语言模型在中文国家手语理解能力的基准,通过权威 grounding、多模态覆盖和手部动作多样性,评估21个模型,发现当前模型在手语理解上仍显著劣于人类表现。

Comments Accepted as the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22498 2026-04-27 cs.CV cs.AI 79%

CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

CGC:基于组成性 grounded 对比的细粒度多图像理解

Lihao Zheng, Zhenwei Shao, Yu Zhou, Yan Yang, Xintian Shen, Jiawei Chen, Hao Ma, Tao Wei

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Technology, Hangzhou Dianzi University(技术,杭州电子科技大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CGC框架,通过跨图像对比和内图像对比提升多图像细粒度理解,结合规则空间奖励增强属性和对齐,实验显示在多个基准上取得最佳结果,并在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07818 2026-04-27 cs.MA 78%

Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding

基于代理推理和时间定位的开放式视频游戏漏洞检测

Muyang Zheng, Tong Zhou, Geyang Wu, Zihao Lin, Haibo Wang, Lifu Huang

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出VideoGlitchBench基准和GliDe框架,通过代理推理和时间定位检测视频游戏中的漏洞,提升语义理解和时间定位能力。

Comments 16 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14135 2026-04-27 cs.LG cs.AI cs.GT cs.MA 62%

AdaFair-MARL: Enforcing Adaptive Fairness Constraints in Multi-Agent Reinforcement Learning

AdaFair-MARL:在多智能体强化学习中强制适应性公平性约束

Promise Ekpo, Saesha Agarwal, Felix Grimm, Lekan Molu, Angelique Taylor

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) Bala-Cynwyd, PA, USA(巴拉-辛威德, 美国宾夕法尼亚州)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AdaFair-MARL框架,通过将工作负载公平性作为显式约束,使智能体在优化团队性能的同时保持贡献平衡,实验表明其在医院协调环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10649 2026-04-27 cs.LG cs.CL 57%

SpectralLoRA: Is Low-Frequency Structure Sufficient for LoRA Adaptation? A Spectral Analysis of Weight Updates

SpectralLoRA: LoRA适应是否仅需低频结构?对权重更新的频谱分析

Rajveer Singh

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文通过频谱分析发现LoRA更新主要由低频成分主导,压缩高频系数可显著降低存储需求,同时保持模型性能。研究还揭示RoBERTa-base在频谱压缩上的优势及任务复杂性对频谱敏感性的影响。

Comments v2: Added SVD-DCT correlation analysis (Pearson r=0.906, p<1e-9) connecting the empirical ~33% spectral constant to the Dyson Brownian Motion framework of Olsen et al. (2025); updated Section 7 and References. 11 pages, 6 figures, 7 tables. Indian Institute of Technology Roorkee

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18734 2026-04-27 cs.CL cs.AI 57%

Rethinking Retrieval-Augmented Generation as a Cooperative Decision-Making Problem

重新思考检索增强生成作为协作决策问题

Lichang Song, Ting Long, Yi Chang

机构 * Jilin University(吉林大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出CoRAG框架,将检索器与生成器视为平等决策者,通过共同优化任务目标提升生成稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19592 2026-04-27 cs.CV 57%

Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation

MLLMs中分解注意力融合用于无训练视频推理分割

Su Ho Han, Jeongseok Hyun, Pilhyeon Lee, Minho Shim, Dongyoon Wee, Seon Joo Kim

机构 * Yonsei University(延世大学) Inha University(inha大学) NAVER Cloud(NAVER云)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DecAF方法,通过对比物体背景融合和互补视频帧融合精炼注意力图,实现无训练视频推理分割,取得优于无训练方法和与有训练方法相当的性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HYUNJS/DecAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22245 2026-04-27 eess.AS 50%

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

通过时间聆听:为长音频理解实现精确的时间意识

Mingchen Shao, Hang Su, Wenjie Tian, Bingshen Mu, Zhennan Lin, Lichun Fan, Zhenbo Luo, Jian Luan, Lei Xie

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出LAT-Audio模型,通过构建长音频数据集和基准测试,解决长音频时间意识任务中的性能下降问题,提升模型对长音频的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21986 2026-04-27 cs.HC 50%

Community-Based AI Learning: Redistributing Artificial Intelligence's Epistemic Authority in Education

基于社区的AI学习:在教育中重新分配人工智能的认知权威

Santiago Ojeda-Ramirez, Symone Gyles, Kylie Peppler

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于社区的AI学习框架,通过重新分配权威和校准信任,促进教育中的AI素养。

详情

展开后加载摘要…

URL PDF HTML 收藏