arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-15 至 2026-06-15 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 13 篇

2606.12910 2026-06-15 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 85%

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

边界框作为目标:通过神经符号规划实现语言条件抓取

Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。

Comments Project website: https://allisonandreyev.github.io/grasp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13870 2026-06-15 cs.CV cs.AI cs.LG 新提交 80%

Mirage Probes: How Vision Models Fake Visual Understanding

幻象探针:视觉模型如何伪造视觉理解

Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao, Raz Lapid, Amit LeVi, Allen G. Roush, Ravid Shwartz-Ziv, Hod Lipson

机构 * Columbia University(哥伦比亚大学) Intuit Technion(以色列理工学院) Thoughtworks New York University(纽约大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出幻象探针框架,通过对比探针揭示视觉语言模型在无图像时也能回答问题的两种幻象行为:文本偏见和虚假图像,并证明后者需要表征级干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14089 2026-06-15 cs.RO 新提交 67%

A Modular Dual-Arm Apple Harvesting Robot with Enhanced Field Performance

一种具有增强田间性能的模块化双臂苹果采摘机器人

Keyi Zhu, Kyle Lammers, Chaaran Arunachalam, Kaixiang Zhang, Renfu Lu, Zhaojian Li

机构 * Michigan State University(密歇根州立大学) United States Department of Agriculture Agricultural Research Service(美国农业部农业研究局)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 提出一种模块化双臂苹果采摘机器人,采用垂直堆叠臂实现单树上下区域同时作业,结合基础模型感知、7阶加加速度轨迹生成、线性扫描采摘策略等5项改进,在商业果园中达到80.0%采摘成功率和7.53秒平均单臂周期,91.2%果实达到特级标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20734 2026-06-15 cs.CL cs.AI cs.CV cs.IR cs.LG 版本更新 67%

UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities

UniversalRAG: 在多样模态和粒度的语料库上实现检索增强生成

Woongyeong Yeo, Kangsan Kim, Soyeong Jeong, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出UniversalRAG,一种能够处理多种模态和粒度的检索增强生成框架,通过动态路由机制和多粒度组织,提升跨模态知识检索的有效性,实验表明其在多个模态基准上的优越性。

Comments ACL 2026. Project page : https://universalrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14699 2026-06-15 cs.CV cs.GR cs.RO 新提交 57%

Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control

Instruct-Particulate: 基于运动学控制的可扩展前馈式3D物体关节化

Ruining Li, Yuxin Yao, Matt Zhou, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, Andrea Vedaldi

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出Instruct-Particulate模型,通过运动学规范(部件描述、连接性、关节类型等)指导3D网格的关节分割和运动参数预测,利用异构数据集(15万+物体)训练,实现跨类别和AI生成网格的泛化。

Comments Project page: https://instruct-particulate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14667 2026-06-15 cs.CV 新提交 57%

Memento: Reconstruct to Remember for Consistent Long Video Generation

Memento: 通过重建来记忆以实现一致的长视频生成

Xuan Wei, Longbin Ji, Guan Wang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Qingqi Hong

机构 * Xiamen University(厦门大学) ERNIE Team, Baidu Inc.(百度公司ERNIE团队)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出Memento框架,通过主体重建引导和双查询记忆机制,解决长视频生成中主体一致性丢失问题,实现跨镜头连贯生成。

Comments Project page: https://ernie-research.github.io/Memento/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13731 2026-06-15 cs.AI cs.MA 新提交 57%

TwinBI: An Agentic Digital Twin for Efficient Augmented Interactions with Business Intelligence Dashboards

TwinBI:一种用于与商业智能仪表盘高效增强交互的智能数字孪生

Jisoo Jang Wen-Syan Li

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出TwinBI框架,通过LLM代理与可执行仪表盘状态耦合,统一对话、操作、语义和溯源,提升多步分析中状态一致性,将精确匹配准确率从43.3%提升至63.3%,超时率从40%降至10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13692 2026-06-15 cs.DB cs.AI 新提交 57%

An Agentic Retrieval Framework for Autonomous Context-Aware Data Quality Assessment

一种面向自主上下文感知数据质量评估的智能体检索框架

Hadi Fadlallah, Ibrahim Dhaini, Fatima Mubarak, Rima Kilany

机构 * University of Sciences and Arts in Lebanon(利比亚科学与艺术大学) Saint-Joseph University of Beirut(贝鲁特圣约瑟夫大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种智能体检索框架,通过多智能体工作流理解数据使用意图、推导上下文感知评估策略并生成可执行验证逻辑,引入可行性验证阶段确保可靠性,实验表明能自适应不同使用场景并减少不可执行规则。

Comments 26 pages, 18 figures, Submitted to the International Journal of Intelligent Information and Database Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05774 2026-06-15 cs.CV 版本更新 57%

LiAuto-GeoX: Efficient Grounded Driving Transformer

LiAuto-GeoX: 高效接地驾驶Transformer

Jiawei Lian, Haoyi Sun, Yang Wu, Lifu Mu, Siyuan Wang, Le Hui, Ning Mao, Tao Wei, Pan Zhou, Kun Zhan, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Li Auto Inc.(Li Auto公司) Northwestern Polytechnical University(西北工业大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出LiAuto-GeoX,通过稀疏激光雷达先验和几何保持蒸馏框架,实现高效、实时的自车中心密集3D重建,并显著提升下游自动驾驶任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14146 2026-06-15 cs.NE 新提交 50%

A Programmer's Guide to Cascaded Adaptive Combiners: Online Learning by Biologically Accurate Models of Multilayer Neuron Networks

级联自适应组合器程序员指南:基于多层神经元网络的生物精确模型在线学习

Martin Nilsson, Denis Kleyko

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种更符合生物计算机制的机械性神经网络模型,通过级联自适应组合器实现多层网络的高效在线学习,替代反向传播,在图像分类任务中取得竞争性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14054 2026-06-15 cs.HC 新提交 50%

Visible Adoption, Untracked Contribution: GitHub Evidence of the Accountability Gap Across Three Cohorts of an HCI Prototyping Course

可见的采用,未追踪的贡献:来自GitHub的证据揭示HCI原型设计课程三个队列间的问责差距

Maria Teresa Parreira, Pranav Prabhat Sinha, Hauke Sandhaus, Wendy Ju

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过分析203个GitHub仓库和23,065次提交,研究三个队列(2022、2023、2025年)中GenAI采用情况,发现工具披露率从0%升至66%,但贡献归属仍属少数,揭示问责缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06794 2026-06-15 cs.CL cs.IR 新提交 50%

TA-RAG: Tone-Aware Retrieval-Augmented Generation for Peer-Support Health Communication

TA-RAG: 面向同伴支持健康沟通的语气感知检索增强生成

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出TA-RAG框架,通过轻量级提示在RAG管道中嵌入语气控制(无污名化、可读性调整、受众适应、同理心改写),无需微调模型,提升敏感健康沟通质量。

Comments 5 pages, 5 figures, CIKM 2026 submission manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03636 2026-06-15 cs.GT 版本更新 50%

Causal Mirage Equilibrium in Agentic Machine Intelligence

生成式机器智能中的因果幻象均衡

Hamidou Tembine

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。

Comments 10 pages, 1 figure. References double-checked manually

详情

展开后加载摘要…

URL PDF HTML 收藏