arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-04 至 2026-05-04 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 6 篇

2605.00684 2026-05-04 cs.CV 79%

Static and Dynamic Graph Alignment Network for Temporal Video Grounding

静态与动态图对齐网络用于时序视频定位

Zhanjie Hu, Bolin Zhang, Jianhua Wang, Jianbo Zheng, Chenchen Yan, Takahiro Komamizu, Ichiro Ide, Jiangbo Qian

机构 * Faculty of Electronic Engineering and Computer Science, Ningbo University(宁波大学电子工程与计算机科学学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) College of Computing and Engineering, Hunan Normal University(湖南师范大学计算机与工程学院) Faculty of Computing, Georg-August-Universität Göttingen(哥廷根大学计算机学院) Center for Artificial Intelligence, Mathematical and Data Science, Nagoya University(名古屋大学人工智能、数学与数据科学中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出SDGAN,通过联合静态和动态视觉特征构建互补的时序图,引入查询-片段对比学习和自适应图建模,结合多粒度时间提案和渐进易难训练策略,提升时序视频定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00060 2026-05-04 cs.AI cs.SY eess.SY 70%

TADI: Tool-Augmented Drilling Intelligence via Agentic LLM Orchestration over Heterogeneous Wellsite Data

TADI:通过异构钻井现场数据的代理LLM编排实现工具增强的钻井智能

Rong Lu

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 TADI通过代理LLM编排整合钻井数据,实现证据驱动的分析智能,展示了领域专用工具设计对分析质量的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 62%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00631 2026-05-04 cs.CL cs.IR 50%

H-RAG at SemEval-2026 Task 8: Hierarchical Parent-Child Retrieval for Multi-Turn RAG Conversations

H-RAG在SemEval-2026任务8中的应用:多轮RAG对话中的层次父-子检索

Passant Elchafei, Hossam Emam, Mohamed Alansary, Monorama Swain, Markus Schedl

机构 * Johannes Kepler University Linz(约翰尼斯·开普勒大学林茨) Linz Institute of Technology(林茨技术学院) Artificial Intelligence Lab(人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 H-RAG通过层次化父-子检索方法提升多轮RAG对话性能,结合密集-稀疏搜索与上下文重构,实现检索与生成的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00353 2026-05-04 cs.IR 50%

Negative Data Mining for Contrastive Learning in Dense Retrieval at IKEA.com

密集检索中对比学习的负样本挖掘

Eva Agapaki, Amritpal Singh Gill

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于结构化负样本策略和LLM评估方法提升IKEA产品检索,通过生成语义挑战性负样本和训练数据生成,提升检索性能,但发现在线用户参与度无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21723 2026-05-04 cs.RO 50%

VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation

VLBiMan: 视觉-语言锚定的一次示例演示使通用化双臂机器人操作成为可能

Huayi Zhou, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VLBiMan通过任务感知分解从单个示例中提取可重用技能,实现双臂机器人操作的通用化,减少演示需求并增强跨平台适应性。

Comments accepted by ICLR 2026. The project link is https://hnuzhy.github.io/projects/VLBiMan/

详情

展开后加载摘要…

URL PDF HTML 收藏