arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-09 至 2026-07-09 共收录 52 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2508.10956 2026-07-09 cs.CV cs.AI 版本更新 87%

A Study of Commonsense Reasoning over Visual Object Properties

关于视觉对象属性的常识推理研究

Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang, Floris den Hengst, Filip Ilievski

机构 * Department of Computer Science, Vrije Universiteit(自由大学计算机科学系) Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 研究针对视觉对象属性的常识推理,引入含特定图像类型、推理层次和属性维度的评估框架,在两个VQA基准中实验,发现现有VLM存在显著局限,虽新模型有进步但仍与人类有差距,还提供了相关数据和代码以助未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07179 2026-07-09 cs.CV cs.LG 新提交 84%

Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering

用于通用文档视觉问答的领域适应视觉语言模型的比较研究

Miguel Lopez-Duran, Elena Marrero, Julian Fierrez, Marta Robledo-Moreno, Ruben Vera-Rodriguez, Daniel DeAlcala, Aythami Morales, Ruben Tolosana, Oscar Delgado, Alvaro Ortigosa, Javier Ortega-Garcia

机构 * Universidad Autónoma de Madrid (UAM)(马德里自治大学) BiometricsAI(生物识别人工智能)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究对8个开源预训练VLMs在三种文档领域的DocVQA进行全面评估,通过多种评估方式发现其在不同布局性能有差异,参数缩放影响性能,视觉理解是瓶颈,还表明少样本微调能让模型快速适应目标域文档。

Comments 17 pages, 4 figures, accepted at the Automatically Domain-Adapted and Personalized Document Analysis workshop of the ICDAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07288 2026-07-09 cs.CV 新提交 83%

InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models

InfraQR:对红外视觉语言模型的边缘放置的受QR码启发的结构化补丁攻击

Xin Li, Jiaju Han, Ma Yaqi, Chengyin Hu, Yingying Zhao, Jiahuan Long, Fengyu Zhang, Yahui Chai

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Guizhou University(贵州大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 研究红外视觉语言模型对局部结构化扰动的鲁棒性,提出InfraQR攻击方法,沿图像边界放置结构化补丁并通过替代编码器优化网格单元,实验表明该方法能大幅降低分类器准确率,使对抗图像影响黑盒模型,凸显模型易受此类扰动影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 79%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06641 2026-07-09 cs.CL cs.AI cs.LG 新提交 62%

Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering

更健康的语言模型:用于公共卫生问答的检索增强生成

Felix Feldman, Joshua Harris, Timothy Laurence, Leo Loman, Ollie Higgins, Fan Grayson, Poonam Soma, Bethany Pace-Bonello, Michael Borowitz, Toby Nonnenmacher

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大型语言模型在公共卫生问答受幻觉等限制的问题,采用检索增强生成方法,通过扩展基准并系统评估检索与生成选择,比较多种检索方式,引入评判方法,突出检索对可靠公共卫生问答的作用并提供实用指导。

Comments 19 Pages, 14 Main Text Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07383 2026-07-09 cs.CV 新提交 57%

MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG

MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) PeopleAI Inc.(人智公司) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07320 2026-07-09 cs.CV 新提交 57%

SoccerNet 2026 Challenges Results

SoccerNet 2026挑战结果

Anthony Cioppa, Silvio Giancola, Håkan Ardö, Mohamad Dalal, Jan Held, Jérémie Ochin, Jiayuan Rao, Karen Sanchez, Renaud Vandeghen, Artur Xarles, Olivier Barnich, Albert Clapés, Mathieu Delvaux, Sergio Escalera, Bernard Ghanem, Cédric Hons, Antoine Houet, Sotiris Manitsaris, Tom Michel, Pierre Miralles, Thomas B. Moeslund, Mikael Nilsson, Bogdan Stanciulescu, Marc Van Droogenbroeck, Yanfeng Wang, Weidi Xie, Faisal Altawijri, Mohamed Atef, Semen Budennyy, Vasiliy Chelpanov, Puhua Chen, Yixin Chen, Lechao Cheng, Jianling Chu, Ju-Seong Do, Oleg Durygin, Omar Fetouh, Mirco Fuchs, Youssef Ghallab, Falguni Ghosh, Wonjun Heo, Yufeng Hu, Weixuan Huang, Phuong-Linh Huynh-Ha, Matvey Isupov, Yangguang Ji, Siyuan Jiang, Zhenxiang Jiang, Wonyong Jo, Ho-Young Jung, SeongHeon Kang, MinJae Kim, Youngseon Kim, Jakub Komosa, Artem Konshin, Trung-Hoang Le, Jongmin Lee, Lingling Li, Litao Li, Vadim Linkov, Fang Liu, Haoxuan Ma, Shun Makino, Ismail Mathkour, Konstantin Mitin, Mikhail Moiseev, Takumi Nagaya, Yuki Nakamura, Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Trong-Thuan Nguyen, Christian Orduz, Kwanyong Park, Fabian Perez, Parthsarthi Rawat, SuHyun Rim, Hoover Rueda-Chacón, Atom Scott, Minori Sugimura, Yuyang Sun, Shengeng Tang, Minh-Triet Tran, Ikuma Uchida, Juan Vanegas, Thanh-Nhan Vo, Jiangtao Wang, Yaxiong Wang, Xiaogang Wang, Ruifeng Wang, Rio Watanabe, Jiali Wen, Yongliang Wu, Di Yang, Xu Yang, Zhuo Yang, Xinyu Ye, Yibo Yu, Zihan Zhai, Yu Zhang, Zhenyu Zhao, Zhun Zhong, Yixi Zhou, Xingyu Zhu, Wenbo Zhu, Julian Ziegler

机构 * University of Liège(列日大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Spiideo(斯皮迪奥公司) Aalborg University(奥尔堡大学) SpAItial(斯帕蒂亚尔公司) Center for Robotics, Mines Paris, PSL(巴黎矿业学院机器人中心(巴黎文理研究大学)) Footovision(Footovision公司) Shanghai Jiao Tong University(上海交通大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) EVS Broadcast Equipment(EVS广播设备公司) Pioneer Center for Artificial Intelligence(先锋人工智能中心) Lund University(隆德大学) TAHAKOM(TAHAKOM公司) Mohamed Bin Zayed University for Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Sber AI(Sber人工智能公司) Salute For Business(Salute For Business公司) Intelligent Perception and Image Understanding Lab, Xidian University(西安电子科技大学智能感知与图像理解实验室) South China University of Technology(华南理工大学) Hefei University of Technology(合肥工业大学) Kyungpook National University(庆北国立大学) Leipzig University of Applied Sciences(莱比锡应用科学大学) Friedrich-Alexander University Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) University of Seoul(首尔大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Nanjing University(南京大学) University of Science, Ho Chi Minh City(胡志明市科技大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 SoccerNet 2026挑战涵盖五项体育视频理解视觉任务,为每项任务提供数据、协议和基线。众多团队参与,本文介绍任务、评估协议,展示排行榜并总结领先提交内容,记录各任务当前状态。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07380 2026-07-09 cs.IR 新提交 50%

Interpretable Uncertainty for Adaptive Retrieval and Reasoning in Question Answering

问答中自适应检索与推理的可解释不确定性

Ritajit Dey, Iadh Ounis, Graham McDonald

专题命中 视觉问答 :grounding(abstract)

AI总结 研究针对问答中大型语言模型的问题,提出基于LLM内部表示显式信号的不确定性感知框架,区分知识不足与模糊冲突,能在单次前向传播中估计,指导系统行为,为检索和推理策略提供透明实用替代方案。

Comments 2 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 10 篇

2508.17298 2026-07-09 cs.CV cs.AI 版本更新 86%

Explain Before You Answer: A Survey on Compositional Visual Reasoning

回答之前先解释:组合视觉推理综述

Fucai Ke, Joy Hsu, Zhixi Cai, Zixian Ma, Xin Zheng, Xindi Wu, Sukai Huang, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Ranjay Krishna, Jiajun Wu, Hamid Rezatofighi

机构 * Monash University(墨尔本大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Griffith University(格里菲斯大学) Princeton University(普林斯顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 综述2023年至2025年组合视觉推理文献,形式化核心定义,追溯范式转变,编目基准指标,提炼见解、识别挑战并概述方向,为该领域提供统一分类、历史路线图和批判性展望。

Comments Project Page: https://github.com/pokerme7777/Compositional-Visual-Reasoning-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23802 2026-07-09 cs.AI cs.CV 版本更新 84%

EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

EMO-R3:多模态大语言模型中用于情感推理的反射强化学习

Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型情感推理难题,提出EMO-R3框架。引入结构化情感思维并设计反射情感奖励,经大量实验验证,该框架显著提升模型可解释性与情商,在多视觉情感理解基准测试中表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07251 2026-07-09 cs.CL 新提交 82%

Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models

视觉语言模型中使用空间指示表达式的多语言能力评估

Kaito Watanabe, Taisei Yamamoto, Tomoki Doi, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract)

AI总结 研究聚焦视觉语言模型的空间推理能力,通过开发基准评估其使用四种语言空间指示表达式的多语言能力,实验发现测试模型使用指示词方式与人类不同,特别是在依距离选指示词方面。

Comments Accepted to ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07507 2026-07-09 cs.CV cs.AI 新提交 81%

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

HIVE:理解视觉语言模型中的幻觉后推理

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) Meta AI Kent State University(肯特州立大学) Imperial College London(伦敦帝国学院)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07117 2026-07-09 cs.CV cs.AI 新提交 62%

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

用于文本到图像上下文学习的思维树推理

Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

机构 * Korea University(韩国大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。

Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交 62%

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19723 2026-07-09 cs.CL cs.AI 版本更新 57%

Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

大型语言模型中的数学推理:基准测试、架构、评估与开放挑战

Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima

机构 * organization= School of Electrical Engineering Computer Science, National University of Science organization= School of Computing, Data Mathematical Sciences, Western Sydney University, Indonesia organization= Department of Communication, Quality Management Information Systems, Mid Sweden University, Östersund Campus, Sweden

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18734 2026-07-09 cs.CV 版本更新 57%

EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos

EgoExoMem: 跨视角记忆推理 over 同步的自身视角和外部视角视频

Ruiping Liu, Junwei Zheng, Yufan Chen, Di Wen, Shaofang Quan, Chengzhi Wu, Jiaming Zhang, Kailun Yang, Kunyu Peng, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) Hunan University(湖南大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出EgoExoMem,首个跨视角记忆推理基准,通过同步自身视角和外部视角视频进行跨视角记忆推理,利用E$^2$-Select方法实现高效的帧选择,实验表明自身和外部视角提供互补的记忆线索,但现有模型在基准测试中表现有限。

Comments The source code and dataset can be found at https://github.com/RuipingL/EgoExoMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23615 2026-07-09 cs.CV 版本更新 57%

HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

无需标注的高分辨率大多模态模型视觉推理技术

Jiacheng Yang, Anqi Chen, Yunkai Dang, Qi Fan, Cong Wang, Wenbin Li, Feng Miao, Yang Gao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Institute of Brain-inspired Intelligence(脑启发式智能研究院) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05711 2026-07-09 cs.CV 版本更新 57%

From My View to Yours: Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision

从我的视角到你的视角:利用特权自我中心监督从外中心视频中学习自我中心线索

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Elorian AI

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型难以从外中心视频推断自我中心属性的问题,提出Ego2ExoVLM框架,利用时间同步视频对及特权监督,通过两个组件实现此能力,在多任务评估中取得领先性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 14 篇

2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新 86%

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.LG

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07382 2026-07-09 cs.LG astro-ph.HE astro-ph.IM 新提交 85%

Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector

用于快速射电暴检测的通用视觉语言模型:针对专用探测器的零样本基准测试

Raiff H. Santos, Amilcar R. Queiroz, Tharcisyo S. S. Duarte, K. E. L. de Farias, Rafael A. Batista

机构 * Universidade Federal de Campina Grande(坎皮纳格兰德联邦大学) Instituto de Formação de Educadores, Universidade Federal do Cariri(卡里里联邦大学教育工作者培训学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究通用视觉语言模型在零样本下检测快速射电暴,从模拟动态频谱中抽取样本作基准,比较其与专用探测器,发现Gemma 4 2B准确率与SwinYNet相近,在结构化RFI上误报率低,重写提示可用于三类分类,准确率较高。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06636 2026-07-09 cs.SE cs.AI cs.LG 新提交 81%

Specification Grounding Drives Test Effectiveness for LLM Code

规范基础驱动大语言模型代码测试有效性

Amin Haeri, Mahdi Ghelichi

机构 * TD Bank(TD银行)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型代码测试,固定测试器等因素,仅改变一条提示行来隔离规范基础对测试效果的影响。发现规范基础是测试有效性的主要驱动因素,能提高代码正确性、灵敏度和精度,降低误报率,在不同模型和供应商中都有此效果,在算法问题上无影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07101 2026-07-09 cs.RO cs.AI 新提交 79%

GeoProp: Grounding Robot State in Vision for Generalist Manipulation

GeoProp:将机器人状态在视觉中进行定位以实现通用操作

Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究针对机器人操作中本体感觉与视觉缺乏有效对齐问题,提出轻量级GeoProp适配器,通过几何定位、特征采样及FiLM调制等使两者对齐,在多任务中提升策略性能,是具身策略的简单高效归纳偏差。

Comments 21 pages, 8 figures, 11 tables. Project page: https://alibaba-damo-academy.github.io/GeoProp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06925 2026-07-09 cs.AI 新提交 79%

Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix

在紧凑世界模型中建立空间关系:指令泄漏与无目标动力学修复

Yufeng Wang, Lu Wei, Haibin Ling

机构 * Stony Brook University(纽约州立大学石溪分校) Westlake University(西湖大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究以语言目标为条件的紧凑世界模型中空间关系建立问题,发现指令泄漏陷阱,提出将目标排除在动力学外并监督读取路径的修复方法,适用于相关世界模型,提升关系基础的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07676 2026-07-09 cs.AI 新提交 57%

SkillCenter: A Large-Scale Source-Grounded Skill Library for Autonomous AI Agents

SkillCenter:用于自主人工智能代理的大规模源基础技能库

Tianming Sha, Yue Zhao, Lichao Sun, Yushun Dong

机构 * Stony Brook University(纽约州立大学石溪分校) University of Southern California(南加州大学) Lehigh University(里海大学) Florida State University(佛罗里达州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对自主AI代理缺乏扎实操作知识的问题,构建SkillCenter技能库,通过多源获取等端到端框架,集成大量源基础和社区技能,实现技能可追溯,以保障代理输出的正确性、安全性和可维护性。

Comments 44 pages, 5 figures. Code: https://github.com/LabRAI/SkillCenter ; Data: https://huggingface.co/datasets/Tommysha/skillcenter-bundles

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07216 2026-07-09 cs.CV 新提交 57%

Why Fake ? Unveiling the Semantic Vocabulary of Deepfake Detectors

为何造假?揭示深度伪造检测器的语义词汇

Vazgken Vanian, Alexandros Doumanoglou, Dimitris Zarpalas

机构 * Information Technologies Institute (ITI) Centre For Research and Technology HELLAS (CERTH)(信息技术研究所(ITI)希腊研究与技术中心(CERTH))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究深度伪造检测,用编码-解码方向对技术分析黑箱检测器决策过程,揭示训练中隐含的真假特征,实现全局模型理解、空间感知概念定位和反事实分析,助于深入理解检测策略。

Comments Accepted at CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07192 2026-07-09 cs.CV 新提交 57%

Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection

用于未知域目标检测的原型锚定广义流形回归

Zihao Zhang, Aming Wu, Yang Li, Yahong Han

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 研究单域广义目标检测,提出MR-DCoT方法,通过视觉-文本双思维链生成离群示例,利用类特定原型锚定学习校正算子,将未知域泛化建模为流形回归问题,实验验证了该方法在多场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15770 2026-07-09 physics.optics cs.AR cs.CV 版本更新 57%

Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding

通过纳米光子波前编码实现物理基础的单目深度

Bingxuan Li, Jiahao Wu, Yuan Xu, Zezheng Zhu, Yunxiang Zhang, Kenneth Chen, Yanqi Liang, Nanfang Yu, Qi Sun

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究旨在解决单目深度感知中度量尺度模糊问题,核心方法是用超透镜通过纳米光子学编码深度线索,结合DFMs与输入自适应策略及模拟管道,实验证明该方法有效提升单目度量深度传感精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07129 2026-07-09 cs.RO 新提交 50%

Compositional Motion Generation from Demonstration with Object-Centric Neural Fields

基于以对象为中心的神经场的示范组合运动生成

Ahmet Ercan Tekden, Yasemin Bekiroglu

机构 * Chalmers University of Technology(查尔姆斯理工大学) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出基于以对象为中心神经场的示范组合运动生成框架,通过时空组合性连接感知与运动,结合规范神经场与潜在条件变形渲染场景,用时间混合专家生成轨迹,在模拟和实际实验中展现良好性能。

Comments Accepted by IEEE Robotics and Automation Letters (RAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06990 2026-07-09 cs.RO 新提交 50%

A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation

用于鲁棒多机器人操作的闭环多智能体框架

Yi-Xiang He, Lan Wei, Haoming Cen, Jian-Jian Jiang, Zhuohao Li, Guanxing Lu, Yihan Yang, Dandan Zhang, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Imperial College London(帝国理工学院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对多机器人操作中高级推理应用于实际执行的挑战,提出基于分层闭环智能体的LLM框架,含规划、操作、验证智能体。经实际实验验证,该框架成功率高、适应性强,为多样操作任务提供可推广方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05894 2026-07-09 cs.CL 版本更新 50%

EMBER: Efficient Memory via Budgeted Evidence Retention for Long-Horizon Agents

EMBER: 通过预算化证据保留实现高效记忆的长时程智能体

Yilong Li, Suman Banerjee, Tong Che

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA Research(NVIDIA研究)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对长时程智能体在固定预算下保留证据的问题,提出EMBER学习型保留策略,通过存储证据胶囊(含原文摘录、检索键和更新元数据)并利用查询后反馈训练,在LongMemEval-RR上显著提升F1、保留召回和读取召回。

详情

展开后加载摘要…

URL PDF HTML 收藏