arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2506 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交 82%

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24884 2026-06-24 cs.RO cs.AI cs.LG 新提交 82%

InSight: Self-Guided Skill Acquisition via Steerable VLAs

InSight: 通过可引导的VLA实现自主技能获取

Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。

Comments Project website: https://insight-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21020 2026-06-23 cs.CV cs.AI 新提交 82%

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

CheXpercept: 评估胸部X光片中专家级病变感知的基准

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医疗中心) Konkuk University Medical Center(建国大学医疗中心)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出CheXpercept基准,通过粗粒度检测、细粒度轮廓评估与修正、语义级属性提取三个层次评估视觉语言模型在胸部X光片上的专家级病变感知能力,发现当前模型仅在粗粒度任务上表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28055 2026-07-31 cs.IR 新提交 82%

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索与插入以实现可验证的图像定位

Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11018 2026-07-14 cs.RO 新提交 82%

Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching

通过轻量级流匹配实现大象启发式软躯干运动的全身语义到驱动的基础

Tingcong Liu, Tongshun Chen, Siyi Ma, Yuhao Wang, Aye Phyu Phyu Aung, Ibrahim Alsarraj, J. Senthilnath, Bo An, Ke Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract)

AI总结 针对近距离人机交互中类似躯干机器人关联开放词汇响应难的问题,提出基于轻量级流匹配的全身语义到驱动基础框架,将多模态大语言模型响应转换为元组,参数化轨迹并采样运动,实验显示其提升关联正确性、减少推理时间,还提升了人机交互满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20873 2026-06-23 cs.CL 新提交 82%

SciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding

SciLens: 多模态科学声明验证的智能蕴含与归因框架

Yueming Wang, Tianshi Zheng, Jiaxin Bai, Yangqiu Song, Ginny Wong, Simon See

机构 * The Hong Kong University of Science and Technology(香港科技大学) Hong Kong Baptist University(香港浸会大学) NVIDIA AI Technology Center(英伟达人工智能技术中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract)

AI总结 提出SciLens框架,通过将声明分解为原子命题并归因到表格/图表证据,实现多模态科学声明验证,在SciClaimEval上达到79.2%宏F1和63.1%配对准确率。

Comments KDD 2026 SciSoc Agents & LLMs (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15427 2026-06-16 cs.LG cs.AI cs.CV 新提交 82%

Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection

通过提示实现视觉语言模型发射后能力扩展用于在轨航天器检测

Nicholas A. Welsh, Lennon J. Shikhman, Monty Nehru Attazs, Seemanthini K. Putane, Van Minh Nguyen, Ryan T. White

机构 * Florida Institute of Technology(佛罗里达理工学院) University of Florida(佛罗里达大学)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究利用提示驱动的视觉语言模型在轨扩展语义能力,无需修改权重即可通过自然语言提示检测新航天器部件,在129张图像上零样本实例分割达到0.385 mAP@0.5。

Comments 5 pages, 1 figure, 2 tables. Equal contribution by Nicholas A. Welsh and Lennon Shikhman. Published in the CVPR2026 Workshop on AI4Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03179 2026-08-05 cs.CV 新提交 81%

EditFlow3D: Automated Local Editing of 3D Assets with Trajectory Preservation

EditFlow3D:保留轨迹的3D资产自动化局部编辑

Rui Nie, Chuang Wang, Haitao Zhou, Jiahe Song, Buyu Li, Sheng Wang, Qian Yu

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.CV

AI总结 EditFlow3D是一种无需训练的3D局部编辑框架,通过VLM驱动工作流生成掩码与视觉引导,结合掩码引导差分流和轨迹保留技术,在新基准EditFlow-Bench上验证了其编辑准确性与非目标区域保留能力优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 81%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 视觉定位与Grounding :multimodal large language model(abstract,abstract_cn);MLLM(summary_cn);分类 cs.CV

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 81%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27667 2026-07-31 cs.CV 新提交 81%

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

证据见证组合:针对闭集多模态答案的单预填充风险检测

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。

Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12911 2026-07-15 cs.CV 新提交 81%

Open-KNEAD: Knowledge-grounded Nutrition Estimation via Agentic Decomposition

Open-KNEAD:通过智能分解实现基于知识的营养估计

Bruce Coburn, Jingbo Yue, Jinge Ma, Siddeshwar Raghavan, Gautham Vinod, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型用于膳食评估时检索增强基础方法是否仍有价值。提出无需训练、可本地部署的Open-KNEAD框架,通过营养感知检索关联食物项与FNDDS代码,提高份量估计,还能恢复非美国烹饪风格估计偏差,优势显著并开源相关框架与知识库。

Comments 10 pages main paper, 5 pages supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08522 2026-07-10 cs.LG 新提交 81%

Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data

停止猜测何时停止测试:用足够的数据进行高效模型评估

Ofir Arviv, Kristjan Greenewald, Yotam Perlitz, Hadar Mulian, Michal Shmueli-Scheuer, Leshem Choshen

机构 * IBM Research(IBM研究院)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.LG

AI总结 研究指出固定大小基准用于模型评估效率低,提出自适应评估框架,结合序贯测试统计范式与定制停止标准,在Open VLM Leaderboard上展示能自适应管理效率与可靠性权衡,降低计算成本并保持统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交 81%

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31471 2026-07-01 cs.CV 新提交 81%

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

边建图边思考:用于增量式3D场景图的异步视觉-语言智能体

Deniz Bickici, Michael Pabst, Shohei Mori, Dieter Schmalstieg

机构 * University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨技术大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出异步架构,轻量在线建图与重型语义精化并发运行,通过语义闭环、属性标注和空间关系推导,实现探索时可查询且语义渐增的3D场景图,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026. Project page: https://denizbickici.github.io/thinkgraphs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20728 2026-06-23 cs.CV cs.CL 新提交 81%

VTOS: Learning to Orchestrate Vision Tools by Co-Searching Solutions and Observers

VTOS: 通过联合搜索解决方案和观察者来学习编排视觉工具

Jinchao Ge, Lingqiao Liu, Shuwen Zhao, Lei Wang

机构 * University of Wollongong(伍伦贡大学) Adelaide University(阿德莱德大学) Tianjin University of Technology(天津理工大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV

AI总结 提出VTOS框架,通过联合搜索解决方案和观察者程序,自适应编排视觉工具(如Grounding DINO、SAM等),解决密集目标、遮挡和小目标等挑战,在LVIS-Count和PlantSeg-OOD任务上优于静态流水线和智能体基线。

Comments 18 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18242 2026-06-17 cs.CV 新提交 81%

EventDrive: Event Cameras for Vision-Language Driving Intelligence

EventDrive: 用于视觉-语言驾驶智能的事件相机

Dongyue Lu, Rong Li, Ao Liang, Lingdong Kong, Wei Yin, Lai Xing Ng, Benoit R. Cottereau, Camille Simon Chane, Wei Tsang Ooi

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) Horizon Robotics(地平线机器人) A*STAR, I2R(新加坡科技研究局,资讯通信研究院) IPAL, CNRS IRL 2955, Singapore(IPAL,法国国家科学研究中心国际联合实验室2955,新加坡) University Toulouse, CNRS, CerCo, Toulouse, France(图卢兹大学,法国国家科学研究中心,CerCo,法国图卢兹) ETIS UMR 8051, CY Cergy Paris University, ENSEA, CNRS, France(ETIS UMR 8051,CY塞尔吉-巴黎大学,ENSEA,法国国家科学研究中心,法国)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出EventDrive基准和模型套件,通过多时域事件金字塔和时域混合专家模块融合事件流与RGB帧,在感知、理解、预测和规划四维度提升驾驶推理性能。

Comments CVPR2026, 34 pages, 15 figures, 15 tables, project page: https://dylanorange.github.io/projects/eventdrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16601 2026-06-16 cs.CV 新提交 81%

DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models

DifferAD-R1: 基于差异引导的多模态大语言模型工业异常定位

Dingrong Wang, Xian Tao, Zhen Qu, Hengliang Luo, Xinyi Gong, Fei Shen, Zhengtao Zhang, Guiguang Ding

机构 * Institute of Automation, Chinese Academy of Sciences (CAS)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CASI Vision Technology Co., Ltd.(中科慧远视觉技术有限公司) Shandong Laboratory of Aluminum Advanced Manufacturing in Binzhou (SLAAMB), Binzhou Institute of Technology, Weiqiao-UCAS Science and Technology Park(山东省滨州市铝先进制造实验室(SLAAMB),滨州技术学院,魏桥国科科技园) Space Information Research Institute, Hangzhou Dianzi University(杭州电子科技大学空间信息研究院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出DifferAD-R1框架,通过差异引导双图像范式将异常定位转化为一次性差异定位问题,并设计双一致性定位奖励和难度感知策略,在AD-DualDiff数据集上优于现有方法。

Comments Submitted to IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16470 2026-06-16 cs.CV cs.RO 新提交 81%

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands

解耦的以对象为中心的视频理解用于生成机器人操作指令

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Xiem HoangVan, Nak Young Chong

机构 * School of Information Science, Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学信息科学学院) University of Engineering and Technology, Vietnam National University(越南国立大学工程与技术大学) Department of Robotics, Hanyang University(汉阳大学机器人学系)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出解耦动作识别与对象选择的框架,通过TSM分类动作和对象选择算法识别任务相关对象,结合VLM生成精确指令,在Something-Something V2上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09303 2026-06-09 cs.CV 新提交 81%

Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning

再思考:通过候选发现与比较推理进行分割

Xinyan Gao, Haoran Hao, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出两阶段框架Rea2Seg,先基于注意力图生成候选掩码,再用多模态大语言模型推理评分,将分割转化为候选发现与判别选择,并引入新基准ReasonSeg-SGDR全面评估感知、定位与推理能力。

Comments Project page: https://snowball521.github.io/Rea2Seg-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09564 2026-08-11 cs.CV cs.AI 新提交 81%

From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation

从语义接地到决策优化:面向长 horizon 无人机视觉语言导航的统一框架

Zeyuan Ma, Jiaxin Chen, Di Huang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文针对无人机视觉语言导航的现有问题,提出统一语义到决策框架,经实验在AerialVLN和OpenFly基准上达到SOTA性能。

Comments 10 pages, 5 figures. Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02505 2026-08-04 cs.AI cs.CV cs.IR 新提交 81%

Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation

无实体的溯因推理?科学假说生成的表征奠基与溯因循环

Michael Farmer

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需实体的科学溯因推理,构建含弃权机制的溯因循环架构,以惯例空间解决跨领域检索难题,通过案例抽象架构并提出DAB-30基准作为评估方案。

Comments 20 pages, 4 figures. DAB-30 execution reported in companion paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00147 2026-08-04 cs.CV cs.LG 新提交 81%

RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding

RadPRISM:用于概念解耦图像表示与视觉定位的模式分层放射学报告监督方法

Fabian Drexel, Marlene Fritzsche, Era Stambollxhiu, Miriam Kumpf, Lena Schmitzer, Lea Schumann, Jannik Kahmann, Friedrich Puttkammer, Johannes Moll, Jannik Lübberstedt, Zeineb Ben Chaaben, Anirudh Narayanan, Cosmin I. Bercea, Sebastian Ziegelmayer, Marcus R. Makowski, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Technical University of Munich, School of Medicine and Health(慕尼黑工业大学医学与健康学院) Klinikum rechts der Isar(右伊萨尔医院) Charité – Universitätsmedizin Berlin(柏林夏里特医学院) Freie Universität Berlin(柏林自由大学) Humboldt Universität zu Berlin(柏林洪堡大学) Imperial College London(伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) University Hospital Essen (AöR)(埃森大学医院(AöR)) Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所(IKIM)) Institute of Interventional and Diagnostic Radiology and Neuroradiology(介入与诊断放射学及神经放射学研究所) National Center for Tumor Diseases West(西部肿瘤疾病国家中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

AI总结 RadPRISM将放射学模式作为分层轴,通过专用视觉子空间对齐临床概念,提升零样本分类与视觉定位性能,实现可透明检查的概念解耦医学图像表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14494 2026-07-17 cs.AI cs.IR cs.LG 新提交 81%

SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation

SAGA:用于智能文本到SPARQL生成的模式感知基础

Yiming Zhang, Koji Tsuda

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14149 2026-07-17 cs.AI cs.LG 新提交 81%

Enhancing Small Language Models Reasoning through Knowledge Graph Grounding

通过知识图谱基础增强小型语言模型推理

Dimitrios Kelesis, Konstantinos Bougiatiotis, Georgios Paliouras

机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究利用神经符号智能框架增强小型语言模型推理能力,通过特定工具调用转变模型,在两种场景下评估,发现虽提示提升性能,但受提取瓶颈等限制,还存在“干扰效应”,刻画了挑战并提供迭代验证路线图。

Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 81%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 视觉定位与Grounding :multimodal large language model(title);grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13421 2026-07-16 cs.CV cs.AI 新提交 81%

ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding

ScanFocus:一种用于时空视频定位的从粗到细框架

Kai Chen, Ming Dai, Wenxuan Cheng, Wankou Yang

机构 * Southeast University(东南大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 研究时空视频定位问题,提出ScanFocus从粗到细框架,利用统一融合编码器和轻量级模块生成粗略提议,再用语义引导时间聚合器恢复细节,实验表明该方法性能优于以往方法。

Comments this paper has already been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13305 2026-07-16 cs.CV cs.AI cs.MM 新提交 81%

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

无需基础的准确性:诊断视频语言模型基准测试中的视觉依赖解离

Jae Joong Lee

机构 * Purdue University(普渡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视频语言模型基准测试中视觉依赖问题,引入视觉依赖差距(VDG),通过实验表明准确性与视觉依赖可分离,任务类型排名稳定,帧多样性贡献大,H.264实验有新发现,VDG可作标准审查,推动相关研究。

Comments Accepted, ACM International Conference on Multimedia 2026 (ACM MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06636 2026-07-09 cs.SE cs.AI cs.LG 新提交 81%

Specification Grounding Drives Test Effectiveness for LLM Code

规范基础驱动大语言模型代码测试有效性

Amin Haeri, Mahdi Ghelichi

机构 * TD Bank(TD银行)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型代码测试,固定测试器等因素,仅改变一条提示行来隔离规范基础对测试效果的影响。发现规范基础是测试有效性的主要驱动因素,能提高代码正确性、灵敏度和精度,降低误报率,在不同模型和供应商中都有此效果,在算法问题上无影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04223 2026-07-07 cs.CL cs.AI cs.LG 新提交 81%

Detecting Hallucinations in Retrieval-Augmented Generation through Grounding-Aware Sensitivity by Perturbation (GASP)

通过扰动的基于接地感知敏感性检测检索增强生成中的幻觉(GASP)

Mohamed Aly Bouke

机构 * Centre for Intelligent Cloud Computing, CoE for Advanced Cloud, Faculty of Information Science and Technology, Multimedia University(智能云计算中心、高级云研究中心、信息科学与技术学院、多媒体大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究检索增强生成中幻觉检测问题,提出GASP方法,通过固定答案重新打分,衡量对数似然下降和Jensen-Shannon散度,评估显示其在RAGTruth上效果显著,信号能转移到TofuEval。

Comments 23 pages, 9 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏