arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-07 至 2026-04-07 共收录 24 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 24 篇

2604.00909 2026-04-07 cs.CV 85%

JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation

JAMMEval: 一个经过精细优化的日本基准数据集,用于可靠的视觉-语言模型评估

Issa Sugiura, Koki Maeda, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Naoaki Okazaki

机构 * Kyoto University(京都大学) NII LLMC(国立信息学研究所LLMC) NII(国立信息学研究所) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出JAMMEval,通过两次人工标注优化七个现有日本基准数据集,提升数据质量和评估可靠性,并验证了其在日语VQA任务中对模型能力的准确评估。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04901 2026-04-07 cs.CV cs.AI 81%

FileGram: Grounding Agent Personalization in File-System Behavioral Traces

FileGram:基于文件系统行为轨迹的智能体个性化研究

Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FileGram框架,通过文件系统行为轨迹实现智能体记忆与个性化,包含数据引擎、基准测试和内存架构,解决数据限制和多模态轨迹收集难题。

Comments Project Page: https://filegram.choiszt.com, Code: https://github.com/synvo-ai/FileGram

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03666 2026-04-07 cs.CV cs.AI 81%

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

ToG-Bench:面向任务的时空接地在第一人称视频中

Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ToG-Bench,首个面向任务的时空视频接地基准,通过任务导向的接地、显式-隐式双接地和一对一多接地特性,评估多对象和显式-隐式对象接地性能,揭示任务导向时空视频接地的挑战与性能差距。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03759 2026-04-07 cs.RO cs.AI 77%

Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation

基于先验知识:视觉-语言引导的神经符号模仿学习用于数据高效的现实机器人操作

Pierrick Lorang, Johannes Huemer, Timothy Duggan, Kai Goebel, Patrik Zips, Matthias Scheutz

机构 * Tufts University(塔夫茨大学) Austrian Institute of Technology GmbH (AIT)(奥地利技术研究所(AIT))

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出一种可扩展的神经符号框架,通过少量未标注的示范数据自动构建符号规划领域和高效控制策略,无需手动领域工程,提升现实机器人操作的效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11782 2026-04-07 cs.HC cs.AI 74%

Human-AI Collaborative Game Testing with Vision Language Models

人机协作的游戏测试与视觉语言模型

Boran Zhang, Muhan Xu, Zhijun Pan

机构 * Zhengzhou University(郑州大学) University of the Arts London(伦敦艺术大学) Royal College of Art(皇家艺术学院)

专题命中 视觉定位与Grounding :vision language model(title);分类 cs.AI

AI总结 本文研究了如何利用AI提升游戏测试效率,通过800个测试用例和276名参与者实验,发现AI辅助能显著提高缺陷识别,但AI错误会影响人类决策,强调优化人机协作的重要性。

Comments Experiment Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08392 2026-04-07 cs.RO cs.AI cs.CV 73%

ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs

ST-BiBench:多流多模态协调在双臂具身任务中的基准测试

Xin Wu, Zhixuan Liang, Yue Ma, Mengkang Hu, Zhiyuan Qin, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ST-BiBench框架,用于评估多流多模态协调,揭示MLLMs在高阶策略与精细物理执行间的协调悖论。

Comments 42 pages, 9 figures. Project page:https://stbibench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04658 2026-04-07 cs.CV 70%

Synthesis4AD: Synthetic Anomalies are All You Need for 3D Anomaly Detection

Synthesis4AD:合成异常就是3D异常检测所需

Yihan Sun, Yuqi Cheng, Junjie Zu, Yuxiang Tan, Guoyang Xie, Yucheng Wang, Yunkang Cao, Weiming Shen

机构 * National Center of Technology Innovation for Intelligent Design and Numerical Control, Huazhong University of Science and Technology(华中科技大学国家智能设计与数控技术创新中心) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Department of Intelligent Manufacturing, Contemporary Amperex Technology Ltd.(宁德时代新能源科技股份有限公司智能制造部) Institute for Infocomm Research, A*STAR(新加坡科技研究局资讯通信研究院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Synthesis4AD方法,通过大规模高保真合成异常数据提升3D异常检测性能,利用3D-DefectStudio平台生成精确点云异常掩码,并结合多模态大语言模型实现知识驱动的数据生成,实验表明在多个数据集上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04630 2026-04-07 cs.CV 70%

Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual Triggers

通过涂鸦和跨语言触发器对自动驾驶VLMs进行多模态后门攻击

Jiancheng Wang, Lidan Liang, Yong Wang, Zengzhen Su, Haifeng Xia, Yuanting Yan, Wei Wang

专题命中 视觉定位与Grounding :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出GLA攻击方法,利用自然触发器在自动驾驶场景中实现隐蔽稳定的后门攻击,实验显示仅需10%污染率即可达到90%攻击成功率且无误报,同时提升模型性能指标,揭示了自动驾驶VLMs的安全威胁。

Comments This is a submission to the "Pattern Analysis and Applications". The manuscript includes 14 pages and 6 figures. All authors have approved the submission, and there is no conflict of interest to declare

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01891 2026-04-07 cs.CV 70%

Agentic AI in Remote Sensing: Foundations, Taxonomy, and Emerging Systems

遥感中的代理AI:基础、分类与新兴系统

Niloufar Alipour Talemi, Julia Boone, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文探讨遥感中代理AI的基础、分类及新兴系统,提出统一的分类框架,分析规划机制、检索增强生成和记忆结构,并评估轨迹感知推理的准确性。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026, GeoCV Workshop

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, 2026, pp. 786-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04681 2026-04-07 cs.LG cs.CV 62%

Batch Loss Score for Dynamic Data Pruning

批量损失评分用于动态数据剪枝

Qing Zhou, Bingxuan Zhao, Tao Yang, Hongyuan Zhang, Junyu Gao, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出批量损失评分(BLS),通过指数移动平均法高效计算样本重要性,简化代码集成并提升复杂模型的数据剪枝效果。

Comments CVPR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13130 2026-04-07 cs.CV cs.AI cs.CL 62%

ZINA: Multimodal Fine-grained Hallucination Detection and Editing

ZINA:多模态细粒度幻觉检测与编辑

Yuiga Wada, Kazuki Matsuda, Komei Sugiura, Graham Neubig

机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03315 2026-04-07 cs.CV cs.AI 62%

StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics

StoryBlender: 具有时空动态的跨镜头一致且可编辑的3D分镜

Bingliang Li, Zhenhong Sun, Jiaming Bian, Yuehao Wu, Yifu Wang, Hongdong Li, Yatao Bian, Huadong Mo, Daoyi Dong

机构 * Independent Researcher(独立研究员) Australia National University(澳大利亚国立大学) Central South University(中南大学) University of New South Wales(新南威尔士大学) Vertex Lab(Vertex实验室) National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 StoryBlender通过三阶段流程实现跨镜头一致性和可编辑性,结合语义空间接地、资产材料化和时空动态,提升3D分镜生成的连续性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03240 2026-04-07 cs.LG cs.AI cs.CL 62%

Scaling DPPs for RAG: Density Meets Diversity

在RAG中扩展DPPs:密度与多样性

Xun Sun, Baiheng Xie, Li Huang, Qiang Gao

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScalDPP,通过轻量级P-Adapter整合DPPs,实现RAG中密度与多样性的联合优化,通过DML损失确保互补证据链的优先级,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04662 2026-04-07 cs.LG q-fin.MF q-fin.PR q-fin.ST 57%

Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions

前瞻性强化学习:从生成路径法则到分布价值函数

Daniel Bloch

机构 * Quant Finance Ltd College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院) University of Paris 6(巴黎第六大学) VinUniversity

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出前瞻性强化学习(ARL),通过生成路径法则和分布价值函数,解决非马尔可夫决策过程与传统强化学习架构在单观测轨迹约束下的衔接问题,提升在高波动连续时间环境中的风险管理和策略稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04632 2026-04-07 cs.CV 57%

InCTRLv2: Generalist Residual Models for Few-Shot Anomaly Detection and Segmentation

InCTRLv2:通用残差模型用于少样本异常检测和分割

Jiawen Zhu, Mengjia Niu, Guansong Pang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出InCTRLv2,一种通用少样本异常检测与分割框架,通过双分支结构引入判别异常评分学习和单类异常评分学习模块,利用视觉-文本语义先验实现双视角异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04608 2026-04-07 cs.CV 57%

Beyond Semantics: Uncovering the Physics of Fakes via Universal Physical Descriptors for Cross-Modal Synthetic Detection

超越语义:通过通用物理描述符揭示合成检测的物理本质

Mei Qiu, Jianqiang Zhao, Yanyun Qu

机构 * SDIC Intelligence Information Technology Co., Ltd.(国投智能信息技术有限公司) Xia'men University(厦门大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出通过通用物理描述符区分真实与AI生成图像,探索跨模态合成检测中的核心物理特征及多模态模型整合方法,实现高准确率检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06668 2026-04-07 cs.IR cs.LG 57%

Contradictions in Context: Challenges for Retrieval-Augmented Generation in Healthcare

上下文中的矛盾:医疗领域检索增强生成的挑战

Saeedeh Javadi, Sara Mirabi, Manan Gangar, Bahadorreza Ofoghi

机构 * Deakin University(迪肯大学) RMIT University(皇家墨尔本理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了在医疗领域使用检索增强生成方法时,源文档中过时或矛盾信息对模型性能的影响,提出了一个基准数据集并分析了不同LLM的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03667 2026-04-07 cs.CV 57%

Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos

利用目光和标记集在VLLMs中进行人-物体交互预测从第一人称视频

Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

机构 * Next Vision s.r.l. -- Spinoff of the University of Catania(Next Vision s.r.l. -- 卡塔尼亚大学衍生公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出利用VLLMs中的目光和标记集来预测人-物体交互,通过改进视觉定位能力和用户意图理解,结合逆指数采样策略,实验表明方法在HD-EPIC数据集上优于现有方法。

Comments Accepted to International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03426 2026-04-07 cs.CV 57%

Automated Segmentation and Tracking of Group Housed Pigs Using Foundation Models

基于基础模型的群养猪自动分割与跟踪

Ye Bi, Bimala Acharya, David Rosero, Juan Steibel

机构 * Iowa State University(爱荷华州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出基于基础模型的群养猪自动化监测流程,利用预训练的视觉-语言基础模型作为通用视觉骨干,并通过模块化后处理实现农场特定适应,通过Grounded-SAM2进行视频分割并结合长时间跟踪管道实现稳定的身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03387 2026-04-07 cs.AI 57%

Hume's Representational Conditions for Causal Judgment: What Bayesian Formalization Abstracted Away

休谟因果判断的表征条件:贝叶斯形式化抽象了什么

Yiling Wu

机构 * BridgeM, Inc.(BridgeM公司) Department of Philosophy, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校哲学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨休谟因果判断的三个表征条件,并分析其在从休谟到贝叶斯主义的正式化过程中如何被保留和抽象,指出大语言模型展示了统计更新而不满足这些条件的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03356 2026-04-07 cs.AI 57%

Evaluating Artificial Intelligence Through a Christian Understanding of Human Flourishing

通过基督教对人类繁荣的理解评估人工智能

Nicholas Skytland, Lauren Parsons, Alicia Llewellyn, Steele Billings, Peter Larson, John Anderson, Sean Boisen, Steve Runge

机构 * Gloo WinShape Foundation(WinShape基金会) Biblica

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基督教单轮Flourishing AI基准,评估前沿模型在七个维度上的人类繁荣表现,发现AI默认采用世俗主义,导致道德和神学推理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04755 2026-04-07 cs.LG 57%

KindSleep: Knowledge-Informed Diagnosis of Obstructive Sleep Apnea from Oximetry

KindSleep:基于血氧数据的阻塞性睡眠呼吸暂停诊断

Micky C Nnamdi, Wenqi Shi, Cheng Wan, J. Ben Tamo, Benjamin M Smith, Chad A Purnell, May D Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) UT Southwestern Medical Center(德克萨斯大学西南医学中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 KindSleep利用深度学习整合临床知识与单通道血氧数据,实现精准的阻塞性睡眠呼吸暂停诊断,其在不同人群中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23230 2026-04-07 cs.CV 57%

Action-guided generation of 3D functionality segmentation data

基于动作的3D功能分割数据生成

Jaime Corsetti, Francesco Giuliari, Davide Boscaini, Pedro Hermosilla, Andrea Pilzer, Guofeng Mei, Alexandros Delitzas, Francis Engelmann, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学) TU Wien(维也纳工业大学) NVIDIA(英伟达) ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(马克斯·普朗克信息学研究所) Stanford University(斯坦福大学) USI Lugano(卢加诺大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出SynthFun3D,通过动作描述生成3D功能分割数据,解决真实数据稀缺问题,提升3D功能理解性能。

Comments Accepted at CVPR 2026 GenRecon3D workshop. 17 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20922 2026-04-07 q-bio.PE math.PR math.SP 50%

Spectral Geometry and Heat Kernels on Phylogenetic Trees

谱几何与在系统发育树上的热核

Ángel Alfredo Morán Ledezma

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种统一的谱框架,用于有限超度量系统发育树,结合算子理论和随机动力学分析。通过引入超度量拉普拉斯算子,研究其谱理论,并展示其在系统发育分析中的应用,包括谱重构定理、谱间隙解释及生物特征分解。

详情

展开后加载摘要…

URL PDF HTML 收藏