arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2302.13996 2023-02-28 cs.CV 70%

Aligning Bag of Regions for Open-Vocabulary Object Detection

Size Wu, Wenwei Zhang, Sheng Jin, Wentao Liu, Chen Change Loy

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09263 2022-10-18 cs.CV cs.CL 70%

Vision-Language Pre-training: Basics, Recent Advances, and Future Trends

Zhe Gan, Linjie Li, Chunyuan Li, Lijuan Wang, Zicheng Liu, Jianfeng Gao

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments A survey paper/book on Vision-Language Pre-training (102 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13653 2022-05-04 cs.CV 70%

GRIT: General Robust Image Task Benchmark

Tanmay Gupta, Ryan Marten, Aniruddha Kembhavi, Derek Hoiem

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.02061 2021-05-06 cs.CV 70%

Proposal-free One-stage Referring Expression via Grid-Word Cross-Attention

Wei Suo, Mengyang Sun, Peng Wang, Qi Wu

专题命中 视觉定位与Grounding :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

Comments To be published in the 30th International Joint Conference on Artificial Intelligence (IJCAI-2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08164 2019-09-19 cs.CV 70%

Dynamic Graph Attention for Referring Expression Comprehension

Sibei Yang, Guanbin Li, Yizhou Yu

专题命中 视觉定位与Grounding :visual reasoning(abstract);grounding(abstract);分类 cs.CV

Comments Accepted as an Oral presentation at ICCV2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.02265 2019-08-07 cs.CV cs.CL 70%

ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks

Jiasen Lu, Dhruv Batra, Devi Parikh, Stefan Lee

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20111 2026-08-21 cs.RO cs.ET 新提交 67%

Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms

面向规划的端到端自动驾驶:架构、评估与新兴范式

Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) Chongqing University(重庆大学) The Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Beihang University(北京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16188 2026-08-18 cs.OS 新提交 67%

AdaSprite: Resource-efficient Online Co-Adaptation for V2I Systems Under Large-scale Data Drifts

AdaSprite:大规模数据漂移下车路协同(V2I)系统的资源高效在线协同自适应

Lehao Wang, Zhiwen Yu, Sicong Liu, Kefan Chen, Fengmin Wu, Bin Guo

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 针对V2I系统大规模数据漂移下边缘资源受限的协同自适应问题,AdaSprite通过协同弹性扩缩等技术,使弱边缘支持17个并发V2I任务,SLO达成率与吞吐量分别提升1.6倍、2.1倍。

Comments MobiSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00600 2026-08-18 cs.RO 版本更新 67%

I-Perceive: A Foundation Model for Active Perception with Language Instructions

I-Perceive:一种基于语言指令的主动感知基础模型

Yongxi Huang, Zhuohang Wang, Wenjing Tang, Xinyu He, Cewu Lu, Panpan Cai

机构 * Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学)

专题命中 视觉定位与Grounding :VLM(abstract_cn);grounding(abstract)

AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12835 2026-08-14 cs.RO 新提交 67%

AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN

AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象

Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09125 2026-08-11 cs.RO 新提交 67%

Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation

可靠双臂手术子任务操作的轨迹发散 horizon 决策

Mingwu Su, Guankun Wang, Jinsong Lin, Rulin Zhou, Ziyi Hao, Zhiwei Fang, Huxin Gao, Jiewen Lai, Jiazheng Wang, Fan Zhang, Hongliang Ren

机构 * The Chinese University of Hong Kong (CUHK)(香港中文大学) Huawei Technologies Co. Ltd.(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 针对现有VLA策略在手术操作中易累积误差的问题,提出TDHD机制,构建双臂手术基准并收集600个演示,实验显示其可提升器械和组织操作的成功率。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27341 2026-08-11 cs.AI cs.CV cs.LG 版本更新 67%

A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scaling

外科AI的比较研究:数据、计算和扩展的潜力与局限

Kirill Skobelev, Eric Fithian, Yegor Baranovski, Jack Cook, Sandeep Angara, Shauna Otto, Zhuang-Fang Yi, John Zhu, Neeraj Mainkar, Margaux Masson-Forsythe, Daniel A. Donoho, X. Y. Han

机构 * Center for Applied AI, Chicago Booth(应用人工智能中心,芝加哥商学院) Surgical Data Science Collective(外科数据科学集体) Children’s National Hospital(儿童医学中心) Operations Management & Tolan Center for Healthcare, Chicago Booth(运营管理与托兰医疗中心,芝加哥商学院)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过2026年最先进的AI方法,研究了外科手术工具检测中的性能和限制,发现即使使用多十亿参数模型和大量训练数据,当前的视觉语言模型在神经外科手术工具检测任务中仍表现不足,且模型规模和训练时间的增加对性能提升效果有限,表明当前AI在手术应用中仍面临显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06967 2026-08-10 cs.CL 新提交 67%

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

语言模型无需视觉输入即可进行想象?Ekphrasis:测量仅文本大型语言模型的视觉创意构想能力

Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本研究推出基准Ekphrasis,测量仅文本大型语言模型的视觉创意构想能力,发现该能力与流畅度分离,且其排序可跨模态稳定存在。

Comments 25 pages, 4 main figures, with appendices. Code and data: https://github.com/Imhongyu/Ekphrasis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06876 2026-08-10 cs.CV cs.AI cs.DC cs.LG 新提交 67%

FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition

FedVAR:用于视频异常识别的原型对齐联邦框架

Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim

机构 * Chungbuk National University(忠北国立大学) Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院) University of Central Florida(中佛罗里达大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对联邦视频异常识别中的语义错位问题,本文提出FedVAR框架,通过视觉语言模型的原型对齐机制缓解错位,实验显示其性能优于现有联邦基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17145 2026-08-10 cs.GR 版本更新 67%

Text2Villa: Hierarchical Generation of 3D Indoor Environments with Physics-Aware Analysis-by-Synthesis

Text2Villa:通过物理感知的合成分析进行3D室内环境的分层生成

Xiang Tang, Ruotong Li, Xiaopeng Fan

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 研究旨在解决从自然语言生成3D室内场景的问题,提出Text2Villa框架。宏观构建数据集微调布局生成器,微观引入A-PSSG并结合碰撞检测与语义推理,有效解决相关问题,性能优于以往方法,为下游应用提供3D内容基础。

Comments 17 pages, 12 figures, Project page: https://xdlbw.github.io/Text2Villa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05730 2026-08-07 cs.HC 新提交 67%

SpaceVLA: Spatially Grounded VLA for Robotic Manipulation with User-Authored Grasp and Place Anchors

SpaceVLA:用于机器人操作的空间 grounding VLA,支持用户编写的抓取与放置锚点

Daniia Zinniatullina, Iaroslav Kolomiets, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

专题命中 视觉定位与Grounding :grounding(title_cn)

AI总结 本研究针对VLA模型操作时缺乏显式空间意图的问题,提出视觉意图锚点的XR流程,通过微调OpenVLA-7B的SpaceVLA模型,在Unity试验中实现91.25%抓取成功率,完成机器人抓取放置任务。

Comments A poster for the ISMAR conference, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04576 2026-08-06 cs.CL 新提交 67%

Causal Evidence Extraction and Triangulation in Crisis Reports using Large Language Models: A ReliefWeb-based Study

基于大型语言模型的危机报告中因果证据提取与三角验证:一项基于ReliefWeb的研究

Yuanjun Zhang, Mourad Oussalah

机构 * University of Oulu(奥卢大学) LUT University(拉普兰塔理工大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 该研究基于ReliefWeb数据,提出两阶段LLM流水线提取危机报告中结构化因果证据,结合上下文保留的三角验证方法,在100份专家标注报告中取得优异性能,为现金援助的食品相关结果提供了高收敛性证据。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 32478-32491, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03387 2026-08-06 cs.RO 版本更新 67%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01077 2026-08-04 cs.RO 新提交 67%

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

VespaSeg:一种用于指代表达分割的资源感知“先定位后分割”流水线

Savindu Dilshan Wickramasinghe

机构 * University of Moratuwa(莫拉图瓦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 本文针对指代表达分割中整体式模型部署成本高的问题,提出模块化流水线VespaSeg,采用轻量型视觉-语言模型定位与MobileSAM分割,经适配后在RefCOCO数据集上实现高精度,且内存占用低、推理速度快。

Comments 5 pages, 3 figures. Code and result artifacts: https://github.com/Savidilsh/VespaSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29585 2026-08-03 cs.CL 新提交 67%

Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

谄媚行为破坏合作型视觉-语言任务中的认知警觉性

Rupak Sarkar, Neha Srikanth, Saloni Gupta, Claire Bonial, Philip Resnik, Rachel Rudinger

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 该研究针对合作型视觉-语言任务,提出信息不对称的“找不同”任务,发现模型存在谄媚行为破坏认知警觉性的问题,通过学习向量调整模型可减少此类错误,提升模型可靠性。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05627 2026-08-03 cs.CV cs.AI cs.LG cs.RO 版本更新 67%

Leveraging Image Generators to Address Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping

利用图像生成器解决训练数据稀缺问题:Gen4Regen数据集用于森林再生制图

Gabriel Jeanson, David-Alexandre Duclos, William Larrivée-Hardy, Noé Cochet, Matěj Boxan, Anthony Deschênes, François Pomerleau, Philippe Giguère

机构 * Northern Robotics Laboratory, Université Laval, Québec, QC, G1V 0A6, Canada(拉瓦尔大学北部机器人实验室,魁北克,QC,G1V 0A6,加拿大) Département d'informatique et de génie logiciel, Université Laval, Québec, QC, G1V 0A6, Canada(拉瓦尔大学计算机与软件工程系,魁北克,QC,G1V 0A6,加拿大)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过Gen4Regen数据集和Nano Banana Pro模型生成高质量图像及语义掩码,解决森林再生物种分割中的数据稀缺和类别不平衡问题,提升F1分数15%以上。

Comments 33 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23797 2026-07-28 cs.RO 新提交 67%

Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map

注意力的记忆:通过视觉-语言-运动地图进行语言条件下的重新感知

Dibyendu Ghosh

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn)

AI总结 研究携带行为注释地图的机器人的规划问题,通过将重新感知视为注意力决策,利用持久地图的记忆实现资源分配优化,在语言条件任务中表现出色,证明地图能指导机器人关注重点,而非空间导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23739 2026-07-28 cs.SI 新提交 67%

Separating Clicks from Baits: Using Large Language Models to Detect Misleading YouTube Thumbnails

从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图

Wajiha Naveed, Muhammad Muneeb Pervez, Zaeem Mohtashim Khan, Zafar Ayyub Qazi, Zartash Afzal Uzmi

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract)

AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。

Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)

Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28963 2026-07-28 cs.RO cs.AI cs.CV cs.LG 版本更新 67%

AutoWorld: Learning Multi-Agent Traffic Simulation with Self-Supervised World Models

AutoWorld: 通过自监督世界模型扩展多智能体交通仿真

Mozhgan Pourkeshavarz, Tianran Liu, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出AutoWorld框架,利用未标记的LiDAR数据自监督学习世界模型,提升多智能体交通仿真的真实感与性能,实验表明未标记数据能有效提升仿真效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20990 2026-07-24 cs.ET 新提交 67%

LivePhys: Transforming Static Physics Problems into Interactive Simulations via a Scan-to-Play Framework

LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟

Xiaowei Dai, Ziyu Luo, Xiangwen Zhang, Xiaoming Chen, Juan Wu, Yonghong Ke

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18709 2026-07-23 cs.RO 版本更新 67%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract)

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04703 2026-07-08 cs.HC 版本更新 67%

Bounded Autonomy: Controlling LLM Characters in Live Multiplayer Games

有界自主性:控制游戏中的LLM角色

Yunjia Guo, Jinghan Zhu, Siyu Wang, Haixin Qiao

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出有界自主性架构,通过三种接口控制游戏中的LLM角色,使其在多人互动中保持可执行性和社会一致性,并通过实验验证其有效性。

Comments 9 pages, 5 figures, 5 tables; manuscript unchanged from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19216 2026-07-08 cs.CV cs.AI cs.LG 版本更新 67%

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

DreamPartGen: 通过协作潜在去噪实现语义引导的部件级3D生成

Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen, Ismini Lourentzou

机构 * University of Illinois Urbana - Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 DreamPartGen通过协作潜在去噪实现语义引导的部件级3D生成,引入双部件潜在和关系语义潜在,提升几何和语义一致性,实现高质量文本对齐的3D合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02718 2026-07-07 cs.CV cs.AI cs.LG 新提交 67%

Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models

用基础图像生成模型诊断鸟瞰目标检测器

Stanislav Panev, Minhyek Jeon, Vaishnavi Khindkar, Ahish Deshpande, Celso M de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(陆军研究实验室(DEVCOM)) Florida State University(佛罗里达州立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究用文本引导生成、属性控制编辑和自动属性验证构建可控合成测试平台,对预训练检测器进行细粒度评估,以预测实际性能差距并指导高效数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07819 2026-07-02 cs.CV cs.AI cs.LG 67%

ACD-CLIP: Decoupling Representation and Dynamic Fusion for Zero-Shot Anomaly Detection

ACD-CLIP:解耦表征与动态融合用于零样本异常检测

Ke Ma, Jun Long, Hongxiao Fei, Liujie Hua, Zhen Dai, Yueyi Luo

机构 * Central South University(中南大学) Hunan Vocational College of Science and Technology(湖南科技职业学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ACD-CLIP通过联合优化特征表征与跨模态融合,解决预训练视觉语言模型在零样本异常检测中的适应性不足问题,提出参数高效卷积低秩适应器和动态融合网关提升检测精度与鲁棒性。

Comments 4 pages, 1 reference, 3 figures

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏