arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7370 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7370 篇

2406.12225 2024-06-19 cs.CV 77%

The Solution for CVPR2024 Foundational Few-Shot Object Detection Challenge

Hongpeng Pan, Shifeng Yi, Shouwei Yang, Lei Qi, Bing Hu, Yi Xu, Yang Yang

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);multimodal large language model(abstract);分类 cs.CV

Comments CVPR2024 Foundational Few-Shot Object Detection Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13388 2024-06-07 cs.CV 77%

UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion

Wei Li, Xue Xu, Jiachen Liu, Xinyan Xiao

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ACL 2024, Main Conference, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01307 2024-04-02 cs.RO cs.CV 77%

SAGE: Bridging Semantic and Actionable Parts for GEneralizable Manipulation of Articulated Objects

Haoran Geng, Songlin Wei, Congyue Deng, Bokui Shen, He Wang, Leonidas Guibas

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02969 2024-03-26 cs.CV 77%

Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception

Junwen He, Yifan Wang, Lijun Wang, Huchuan Lu, Jun-Yan He, Jin-Peng Lan, Bin Luo, Xuansong Xie

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08657 2024-02-14 cs.CV 77%

PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs

Michael Dorkenwald, Nimrod Barazani, Cees G. M. Snoek, Yuki M. Asano

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07704 2023-10-12 cs.CV cs.CL 77%

Ferret: Refer and Ground Anything Anywhere at Any Granularity

Haoxuan You, Haotian Zhang, Zhe Gan, Xianzhi Du, Bowen Zhang, Zirui Wang, Liangliang Cao, Shih-Fu Chang, Yinfei Yang

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 30 pages, 10 figures. Code/Project Website: https://github.com/apple/ml-ferret

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07353 2026-08-10 cs.CL cs.AI cs.IR cs.LG 新提交 76%

Geo-Spatial Concept Probing of Large Language Models: Abstraction, Compositionality, and Grounding

大语言模型的地理空间概念探测:抽象性、组合性与接地性

Karim Radouane, Jose G Moreno, Lynda Tamine

机构 * University of Toulouse(图卢兹大学) IRIT(信息科学与技术研究院(IRIT))

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 该研究针对LLMs的抽象性、组合性与接地性设计测试,构建空间概念基准并开展多模型实验,揭示当前LLMs的概念理解局限,为相关模型的优化提供洞见。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06713 2026-08-10 cs.AI cs.LG 新提交 76%

MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring

MolBioKG:通过多分辨率结构锚定将图外分子锚定到生物医学知识图谱中

Yiming Zhang, Hikaru Shindo, Shuan Chen, Kaushalya Madhawa, Jun Jin Choong, Yuna Oikawa, Takashi Fujiwara, Keisuke Ozawa

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 MolBioKG是解决生物医学KG中图外分子冷启动问题的两层系统,通过多分辨率结构锚定实现分子与KG的关联,在多项任务中优于基线并提升关键指标。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01663 2026-08-04 cs.CV cs.AI 新提交 76%

Few-Shot Concept Prompt Learning for Segmentation Foundation Models via Visual Grounding

基于视觉定位的分割基础模型少样本概念提示学习

Rahul Venkataramani, Rachana Sathish

机构 * Advanced Technology Group(先进技术集团) GE HealthCare(GE医疗)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.AI

AI总结 该研究针对分割基础模型在临床任务中表现不足的问题,提出FS-CPL方法,通过视觉定位学习概念提示,在四个医学影像基准上取得显著性能提升,且与骨干网络无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21615 2026-07-27 cs.AI cs.LG 新提交 76%

FrED: External Data Influence Estimation via Domain Knowledge Graph Grounding

FrED:通过领域知识图谱基础进行外部数据影响估计

Theodoros Aivalis, Iraklis A. Klampanos, Antonis Troumpoukis, Joemon M. Jose

机构 * National Centre for Scientific Research “Demokritos”(国家科学研究中心“德谟克利特”) University of Glasgow(格拉斯哥大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 针对生成式AI训练数据归因问题,提出在黑盒设置下运行的概率框架,融合连续特征相似度与领域特定知识图谱,在艺术图像合成和天气预报等领域评估,证明其有效性,为外部数据影响分析提供高效可解释机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20533 2026-07-24 cs.LG cs.AI 新提交 76%

Grounding Investor Views: Neural Predicates in the Black-Litterman Model

在布莱克-利特曼模型中锚定投资者观点:神经谓词

Marcos Florencio

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 研究在布莱克-利特曼模型下投资组合构建问题,提出用神经谓词作为观点生成机制,将结构化金融分析数据经其处理后映射到模型相关矩阵,方法可解释且完全可微,实现端到端学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06001 2026-07-03 cs.RO cs.AI cs.CV 版本更新 76%

Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration

恢复VLA模型中的语言基础:无需训练的注意力重校准方法

Ninghao Zhang, Bin Zhu, Shijie Zhou, Jingjing Chen

机构 * Tsinghua University(清华大学) Singapore Management University(新加坡管理学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.AI

AI总结 针对VLA模型在分布外指令下出现“语言盲视”问题,提出无需训练的注意力重校准方法IGAR,通过调整注意力分布恢复语言指令影响,在LIBERO基准和真实机器人上有效减少错误执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20769 2026-06-23 cs.CL cs.AI cs.LG 新提交 76%

FirstPass: Grounding AI Scientific Judgment in Multi-Round Editorial Outcomes

FirstPass: 在多轮编辑结果中奠定AI科学判断的基础

Prabhjot Singh, Somnath Luitel, Manmeet Singh, Josh Durkee

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) RediMinds Inc.(RediMinds公司) Disaster Science Operations Center, Western Kentucky University(西肯塔基大学灾害科学运营中心)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 针对同行评审AI在领域覆盖、对话建模和评估标准上的不足,提出FirstPass数据集和微调模型,利用Nature Communications多轮评审对话,通过响应损失掩码实现80.5%的编辑结果预测准确率,并生成接近人类长度的评审意见。

Comments Accepted at the AI for Science Workshop at the 43rd International Conference on Machine Learning (ICML 2026). 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09855 2026-06-12 cs.MM cs.CV cs.LG 新提交 76%

MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting

MinhwaNet: 韩国民俗画中忠实但不足的对象定位

Joonhyung Bae

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.LG

AI总结 提出MinhwaNet,通过部分级检测器生成对象证据图,发现韩国民俗画中符号列表不足以预测画作类型,而符号布局更重要,揭示了忠实但不足的解离现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03520 2026-06-11 cs.LG cs.AI cs.SY eess.SY 版本更新 76%

Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment

可认证安全RLHF:基于语义基础与固定惩罚约束优化的更安全大语言模型对齐

Kartik Pandit, Sourav Ganguly, Arnesh Banerjee, Shaahin Angizi, Arnob Ghosh

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) New Jersey Institute of Technology(新泽西理工学院) Department of Computer Engineering(计算机工程系) Heritage Institute of Technology(遗产理工学院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 针对现有RLHF方法依赖奖励/成本函数和双变量调优导致性能敏感且缺乏可证明安全保证的问题,提出CS-RLHF,通过语义基础成本模型和固定惩罚约束优化,实现可认证安全对齐,效率提升至少5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09109 2026-06-09 cs.CV cs.IR cs.LG 新提交 76%

Driving Video Retrieval for Complex Queries with Structured Grounding

面向复杂查询的驾驶视频检索与结构化对齐

Manyi Yao, Sparsh Garg, Christian Shelton, Amit Roy-Chowdhury, Abhishek Aich

机构 * NEC Laboratories, America(美国NEC实验室) University of California, Riverside(加州大学河滨分校)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.LG

AI总结 提出STRIVE-D框架,通过弱监督领域视频校准规则、融合视觉语言与关键词检索信号,在驾驶视频检索中实现高达84%的top-1准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08908 2026-06-09 cs.CV cs.AI 新提交 76%

Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection

面向光刻缺陷检测的视觉-语言模型失败感知精炼

Pangyun Jeong, Jiyeong Kong, Yuehua Hu, Dohee Jeong, Kyung-Tae Kang

机构 * Hanyang University(汉阳大学) Korea University(高丽大学) Korea Institute of Industrial Technology(韩国生产技术研究院)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV、cs.AI

AI总结 提出两阶段视觉-语言框架,先微调Qwen3-VL检测缺陷,再通过训练精炼模块修正第一阶段错误,提升检测可靠性。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16253 2026-05-12 cs.CV cs.AI 76%

Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models

将评分接地:为可靠视觉语言处理奖励模型的显式视觉前提验证

Junxin Wang, Dai Guan, Weijie Qiu, Zhihang Li, Yongbo Gai, Zhengyi Yang, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) Alibaba Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所阿里巴巴分所) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.AI

AI总结 本文提出EVPV方法,通过显式验证视觉前提提升视觉语言处理奖励模型的可靠性,实验表明其在多模态推理基准上提升了重排序准确率。

Comments 27 pages, 4 figures, 10 tables. Evaluated on VisualProcessBench and six multimodal reasoning benchmarks (LogicVista, MMMU, MathVerse-VO, MathVision, MathVista, WeMath). Includes ablations and causal analysis via controlled constraint corruption. Code: https://github.com/Qwen-Applications/EVPV-PRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09625 2026-05-05 cs.CV cs.AI 76%

Grounding Synthetic Data Generation With Vision and Language Models

基于视觉和语言模型的合成数据生成基础

Ümit Mert Çağlar, Alptekin Temizel

机构 * Graduate School of Informatics(信息学院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.AI

AI总结 本文提出一种视觉-语言 grounded 框架,用于可解释的遥感合成数据增强与评估,引入 ARAS400k 数据集,包含 100k 真实图像和 300k 合成图像,用于语义分割和图像描述生成。

Comments Accepted for presentation at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Synthetic Data for Computer Vision Workshop (SynData4CV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18210 2026-04-21 cs.AI cs.LG cs.MA 76%

TacticGen: Grounding Adaptable and Scalable Generation of Football Tactics

TacticGen: 基于适应性和可扩展性的足球战术生成

Sheng Xu, Guiliang Liu, Tarak Kharrat, Yudong Luo, Mohamed Aloulou, Javier López Peña, Konstantin Sofeikov, Adam Reid, Paul Roberts, Steven Spencer, Joe Carnall, Ian McHale, Oliver Schulte, Hongyuan Zha, Wei-Shi Zheng

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Real Analytics, London(Real Analytics,伦敦) Birmingham City Football Club, Birmingham(伯明翰城足球俱乐部,伯明翰) Management School, University of Liverpool(利物浦大学管理学院) School of Computing Science, Simon Fraser University(Simon Fraser大学计算机科学学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 TacticGen通过多智能体扩散变换器生成适应性战术,结合规则、自然语言和神经模型实现可扩展的战术设计,验证了其在专业足球战术规划中的实用性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18579 2026-03-20 cs.CL cs.AI cs.LG 76%

ICE: Intervention-Consistent Explanation Evaluation with Statistical Grounding for LLMs

ICE:基于统计基础的LLM干预一致解释评估

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology, Allahabad(印度阿勒颇信息学院) National Institute of Electronics and Information Technology(电子与信息技术国家研究院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 本文提出ICE框架,通过多干预操作比较解释与随机基线,发现解释一致性依赖于干预操作,且不同语言模型在不同任务上的表现存在显著差异,揭示了模型与语言之间的复杂交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18207 2026-02-27 cs.CV cs.AI 76%

From Open Vocabulary to Open World: Teaching Vision Language Models to Detect Novel Objects

从开放词汇到开放世界:教会视觉语言模型检测新物体

Zizhao Li, Zhengkang Xiang, Joseph West, Kourosh Khoshelham

机构 * The University of Melbourne Parkville, VIC, Australia(墨尔本大学帕克维尔分校)

专题命中 视觉定位与Grounding :vision language model(title);分类 cs.CV、cs.AI

AI总结 本文提出了一种开放世界框架,使OVD模型能够检测新物体,通过引入OWEL和MSCAL方法提升模型对远超出分布物体的识别能力。

Comments Accepted by BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13314 2026-02-25 cs.CV cs.AI 76%

Sim2Radar: Toward Bridging the Radar Sim-to-Real Gap with VLM-Guided Scene Reconstruction

Sim2Radar:通过VLM引导的场景重建弥合雷达仿真到现实的差距

Emily Bejerano, Federico Tondolo, Ayaan Qayyum, Xiaofan Yu, Xiaofan Jiang

机构 * Columbia University(哥伦比亚大学) University of California, Merced(加州大学默塞德分校)

专题命中 视觉定位与Grounding :VLM(title);分类 cs.CV、cs.AI

AI总结 Sim2Radar通过VLM引导的场景重建,利用合成数据提升雷达感知性能,实现3D AP提升3.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18487 2026-02-17 cs.RO cs.CV cs.LG 76%

Grounding Bodily Awareness in Visual Representations for Efficient Policy Learning

在视觉表示中 grounding 身体意识以实现高效的策略学习

Junlin Wang, Zhiyun Lin

机构 * SUSTech Shenzhen(深圳科技大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.LG

AI总结 本文提出ICon方法,通过对比学习提升机器人操作中策略学习的效率和跨机器人迁移能力。

Comments A preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21296 2026-01-30 cs.LG cs.AI 76%

Grounding and Enhancing Informativeness and Utility in Dataset Distillation

基于信息性和效用的蒸馏数据集 grounding

Shaobo Wang, Yantai Yang, Guo Chen, Peiru Li, Kaixin Li, Yufa Zhou, Zhaorun Chen, Linfeng Zhang

机构 * EPIC Lab, SJTU(SJTU实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Duke University(杜克大学) The University of Chicago(芝加哥大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 本文提出InfoUtil框架,通过博弈论和梯度范数优化,提升数据集蒸馏的信息性和效用,实验显示在ImageNet-1K上性能提升6.1%。

Comments Accepted by ICLR 2026, 20 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19366 2025-12-11 cs.LG cs.AI 76%

Grounding the Ungrounded: A Spectral-Graph Framework for Quantifying Hallucinations in Multimodal LLMs

未接地的接地:一种基于谱-图框架的多模态大语言模型幻觉量化方法

Supratik Sarkar, Swagatam Das

机构 * Morgan Stanley(摩根士丹利) Indian Statistical Institute (Kolkata)(印度统计研究所(加尔各答))

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于谱-图框架的多模态大语言模型幻觉量化方法,通过谱分解和RKHS本征模式,提供可解释的语义失真度量。

Comments 49 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06040 2025-10-08 cs.CV cs.AI 76%

VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization

Xinye Cao, Hongcan Guo, Jiawen Qian, Guoshun Nan, Chao Wang, Yuqi Pan, Tianhao Hou, Xiaojuan Wang, Yutong Gao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Minzu University of China(民族大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04201 2025-10-07 cs.CV cs.AI 76%

World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge

Moo Hyun Son, Jintaek Oh, Sun Bin Mun, Jaechul Roh, Sehyun Choi

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Georgia Institute of Technology(佐治亚理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) TwelveLabs

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12496 2025-07-18 cs.RO cs.AI cs.LG 76%

FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making

Yucen Wang, Rui Yu, Shenghua Wan, Le Gan, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

Comments Accepted by Forty-Second International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16826 2025-06-23 cs.CV cs.AI cs.RO 76%

AnyTraverse: An off-road traversability framework with VLM and human operator in the loop

Sattwik Sahu, Agamdeep Singh, Karthik Nambiar, Srikanth Saripalli, P. B. Sujit

机构 * Department of Electrical Engineering and Computer Science, Indian Institute of Science Education and Research Bhopal(电子工程与计算机科学系,印度科学教育与研究学院布达佩斯分校) Department of Mechanical Engineering, Texas A&M University(机械工程系,德克萨斯A&M大学)

专题命中 视觉定位与Grounding :VLM(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏