arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-25 至 2026-05-25 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2605.19859 2026-05-25 cs.CV 92%

Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models

Eyes on VLM: 视觉语言模型中注视跟随与社会性注视预测的基准测试

Hengfei Wang, Anshul Gupta, Pierre Vuillecard, Jean-Marc Odobez

机构 * Idiap Research Institute(Idiap研究机构)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision language model(title);vision-language model(abstract);grounding(abstract)

AI总结 提出EyeVLM评估框架,通过零样本和微调方式测试视觉语言模型在注视跟随(几何视觉处理)和社会性注视预测(社交推理)两个核心任务上的能力,发现当前VLM缺乏精确的注视理解能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23883 2026-05-25 cs.CV cs.AI 90%

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

专题命中 视觉定位与Grounding :grounding(title,summary_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22902 2026-05-25 cs.LG cs.AI cs.CL 90%

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

Transcoders 追踪视觉语言模型中的视觉基础与幻觉

Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

机构 * Institute of Language and Speech Processing(语言与语音处理研究所) Athena Research Center(雅典研究中心)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 采用基于Transcoders的功能中心框架分解视觉语言模型的计算路径,揭示视觉输入如何影响文本生成,并通过反事实分析和图结构特征预测幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23797 2026-05-25 cs.LG cs.CV 89%

Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models

去偏负挖掘提升基于预训练视觉语言模型的分布外检测

Bo Peng, Jie Lu, Guangquan Zhang, Zhen Fang

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 针对分布外检测中负标签的假阴性问题,提出通过间接近似负标签分布来校正采样偏差的理论框架,并转化为基于ID标签和未标注语料数据的蒙特卡洛采样方法,在多种OOD检测设置中达到新最优。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23304 2026-05-25 cs.CV 84%

General Hazard Detection

通用危险检测

Stephanie Ng, CP Lim, SueJen Looi, Hendrik Zurlinden, David Nguyen, Lei Wei, Saeid Nahavandi, Hailing Zhou

机构 * Swinburne University of Technology(斯winburne大学) National Transport Research Organisation(国家交通运输研究组织) Google Cloud(谷歌云) Deakin University(德金大学)

专题命中 视觉定位与Grounding :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);visual reasoning(abstract)

AI总结 针对现有危险检测系统在抽象安全概念上的局限性,提出基于规则合规评估的CompliVision数据集和结合LLaVA视觉推理与人在回路反馈的通用危险检测框架。

Comments 20 pages, 7 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07801 2026-05-25 cs.CV cs.AI 81%

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos

VideoTemp-o3:在智能视频思考中协调时间定位与视频理解

Wenqi Liu, Yunxiao Wang, Shijie Ma, Meng Liu, Qile Su, Tianke Zhang, Haonan Fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22903 2026-05-25 cs.CV cs.AI cs.CL 79%

Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

不看而见:视觉-语言基准测试真的测试视觉吗?

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Stony Brook University(石溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 通过系统性实验发现,视觉-语言模型对细粒度视觉证据的依赖程度低于预期,表明当前基准测试不足以可靠评估其视觉基础能力。

Comments Accepted to GRAIL-V: Grounded Retrieval and Agentic Intelligence for Vision-Language, CVPR 2026 Workshop. accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22963 2026-05-25 cs.CL cs.AI 74%

Graph Alignment Topology as an Inductive Bias for Grounding Detection

图对齐拓扑作为接地检测的归纳偏置

Paul Landes, Pranav Herur, Adam Cross, Jimeng Sun

机构 * Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科部) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院) Carle Illinois College of Medicine, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校卡莱医学院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 提出利用图对齐拓扑作为归纳偏置,通过构建参考信息与LLM输出之间的对齐二分图并训练图神经网络建模对齐结构,在幻觉检测和问答任务上取得最先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23891 2026-05-25 cs.CV 70%

Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework

Smart-Insertion-V: 通过闭环反馈双流框架实现逼真的视频插入

Xiao Cao, Yansong Qu, Xiangzhen, Chang, Wen Xiao, Jiakui Hu, Heyuan Li, Jialun Liu, Zhiyong Huang, Xuelong Li

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出一种端到端双流框架Smart-Insertion-V,通过闭环反馈机制和双世界视角旋转位置编码解决参考对象与源视频风格域差异大的问题,实现无需掩码的逼真视频对象插入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13930 2026-05-25 cs.LG cs.HC cs.NE 70%

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

基于稀疏自编码器的脑电图基础模型机制可解释性

William Lehn-Schiøler, Magnus Ruud Kjær, Rahul Thapa, Magnus Guldberg Pedersen, Anton Mosquera Storgaard, Nick Williams, Radu Gatej, Tue Lehn-Schiøler, Andreas Brink-Kjær, Sadasivan Puthusserypady, Sándor Beniczky, James Zou, Lars Kai Hansen

机构 * BrainCapture DTU Health Tech(技术大学丹麦健康技术) DTU Compute(技术大学丹麦计算) Department of Biomedical Data Science(生物医学数据科学系) Department of Computer Science(计算机科学系) Seer Medical(Seer医疗) Filadelfia Epilepsy Hospital(菲拉德尔菲亚癫痫医院) University Hospital of Copenhagen(哥本哈根大学医院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.LG

AI总结 通过TopK稀疏自编码器从三种EEG Transformer中提取稀疏特征字典,结合临床分类法评估单语义性和纠缠性,并引入概念引导分析目标与非目标区域,揭示模型表征失败和临床纠缠问题。

Comments Preprint. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20896 2026-05-25 cs.CR cs.AI cs.LG 62%

GenAI-Driven Threat Detection with Microsoft Security Copilot

GenAI驱动的威胁检测与Microsoft Security Copilot

Scott Freitas, Amir Gharib

机构 * Microsoft Security Research(微软安全研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出动态威胁检测代理(DTDA),结合统一活动时间线、版本化LLM提示合同、规划器-执行器调查循环和动态告警生成,在Microsoft Security Copilot中实现持续、可解释的威胁检测,在线评估精确率80.1%,离线F1分数0.78。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22875 2026-05-25 cs.AI cs.LG 62%

RMA: an Agentic System for Research-Level Mathematical Problems

RMA:一个面向研究级数学问题的智能体系统

Zelin Zhao, Bo Yuan, Jaemoo Choi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出Research Math Agents (RMA)框架,通过多角色多轮协作的智能体工作流,在First Proof基准上解决80%的研究级数学问题,优于GPT-5.2R等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23204 2026-05-25 cs.AI 57%

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery

AutoResearch AI:迈向人工智能驱动的科研自动化以实现科学发现

Guiyao Tie, Jiawen Shi, Dingjie Song, Yixiao Huang, Ziji Sheng, Xueyang Zhou, Daizong Liu, Pan Zhou, Yongchao Chen, Ran Xu, Lifang He, Qingsong Wen, Manling Li, Cong Lu, Shuai Li, Pengtao Xie, Yixuan Yuan, Rui Meng, Lei Xing, Lichao Sun, Caiming Xiong, Philip S. Yu, Jianfeng Gao

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(莱斯大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Salesforce Research(Salesforce研究) Squirrel AI Learning(Squirrel AI学习) Northwestern University(西北大学) Independent(独立) Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) Chinese University of Hong Kong(香港中文大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Stanford University(斯坦福大学) Google Cloud AI Research(谷歌云AI研究) Recursive Superintelligence(递归超级智能) Microsoft Research(微软研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文综述了AI驱动的科研工作流自动化(AutoResearch)的发展,分析了从任务级AI到工作流级研究自动化的转变,并提出了五个评估维度(新颖性、有效性、影响力、可靠性和溯源),指出自主性受领域条件限制。

Comments 49 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23178 2026-05-25 cs.CV 57%

Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

将人物组合在一起:面向多人交互场景的迭代姿态-图像生成

Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出一种双姿态-图像表示方法,将人物结构先验引入预训练扩散Transformer,通过跨模态对齐和迭代场景构建,提升多人交互图像生成的提示对齐度和场景多样性。

Comments Accepted to SIGGRAPH Conference Papers 2026. 22 pages, 12 figures. Project page: https://cornell-vailab.github.io/PeopleComposer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16014 2026-05-25 cs.AI 57%

MUSEKG: A Knowledge Graph Over Museum Collections

MUSEKG:博物馆藏品知识图谱

Jinhao Li, Jianzhong Qi, Soyeon Caren Han, Eun-Jung Holden

机构 * The University of Melbourne School of Computing(墨尔本大学计算机与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出MuseKG系统,通过将异构博物馆数据组织为类型化知识图谱,支持自然语言查询和关系感知探索。

Comments SIGIR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12455 2026-05-25 cs.CV 57%

Mitigating Object Hallucinations via Sentence-Level Early Intervention

通过句子级早期干预缓解对象幻觉

Shangpin Peng, Senqiao Yang, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 提出SENTINEL框架,通过句子级早期干预和领域内偏好学习,无需人工标注即可显著减少多模态大语言模型的对象幻觉,并在幻觉和通用能力基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11138 2026-05-25 cond-mat.stat-mech cs.IT hep-th math.IT stat.ME 50%

Field Theory of Data: Anomaly Detection via the Functional Renormalization Group. The 2D Ising Model as a Benchmark

数据的场论:基于泛函重整化群的异常检测——以二维Ising模型为基准

Riccardo Finotello, Vincent Lahoche, Parham Radpay, Dine Ousmane Samary

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文建立高噪声异常检测与非平衡场论重整化群流之间的对应关系,通过二维Model A的泛函重整化群分析,证明噪声信号比作为物理温度,并利用Onsager精确解验证该方法在临界阈值识别上误差低于4%,优于KL散度。

Comments 15 pages, 2 appendixes; correction of typos and captions, improved clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23361 2026-05-25 physics.optics 50%

Approaching physical limits of latent dimensionality in optical computing

接近光学计算中潜在维度的物理极限

Zhenyu Zhao, Zijun Qiu, Xuan Hu, Yao Zhou, Jinlong Xiang, Youlve Chen, Chaojun Xu, Yuchen Yin, Tao Lin, Yikai Su, Xuhan Guo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过探索有界光学域潜在维度的物理极限,设计并实现了超紧凑多模光子处理器,在实验上逼近这些极限,为光学计算架构提供了缺失的理论参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23193 2026-05-25 cs.HC cs.CL cs.CY cs.MA 50%

CultivAgents: Cultivating Relationship-Centered Multi-Agent Systems for Personalized Gardening

CultivAgents:培育以关系为中心的多智能体系统以实现个性化园艺

Yiyang Wang, Moeiini Reilly, Britney Johnson, Kefei Yan, Alex Cabral, Josiah Hester

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出 CultivAgents,一个基于关怀伦理、协调经验、环境和民族植物学三个专业智能体的多智能体系统,为社区园丁提供个性化、社会文化背景化的园艺支持,并通过混合方法研究验证其有效性。

Comments Preprint, 9 pages. Website: https://hello-diana.github.io/CultivAgents/

详情

展开后加载摘要…

URL PDF HTML 收藏