arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-24 至 2026-06-24 共收录 63 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 7 篇

2606.24115 2026-06-24 cs.CV cs.AI 新提交 90%

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

胃肠内窥镜中视觉语言模型幻觉检测的基准测试

Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息学研究所) West Virginia University(西弗吉尼亚大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);LLaVA(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)

AI总结 针对胃肠内窥镜领域,在Gut-VLM数据集上基准测试九种幻觉检测方法,发现白盒方法ReXTrust在所有五个视觉语言模型上AUC最高,平均领先19.5点。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA) 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00869 2026-06-24 cs.CL 版本更新 87%

What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难

Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Texas A&M University(德克萨斯A&M大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn)

AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23881 2026-06-24 cs.CL cs.CV cs.IR 新提交 86%

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。

Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24335 2026-06-24 cs.CV 新提交 81%

Ill-Posed by Design: Probing Evidence Use in VLMs

刻意设计的不适定问题:探究VLMs中的证据使用

Boaz Meivar, Shaked Perek, Shani Shvartzman, Eli Schwartz, Shai Avidan

机构 * Tel Aviv University(特拉维夫大学) IBM Research(IBM研究院)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出单目物体尺寸估计作为不适定诊断任务,通过反事实分析分解六种视觉和语言证据通道,评估12个开源VLM,发现最大模型仍落后于纯文本LLM,且模型未有效利用场景几何信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23717 2026-06-24 eess.IV 新提交 78%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22419 2026-06-24 cs.CL cs.DB 新提交 78%

Knowledge-Graph Grounding Helps LLMs Only for Out-of-Training Knowledge: A Controlled Study on Clinical Question Answering

知识图谱基础仅对训练外知识帮助LLM:临床问答的受控研究

Madhulatha Mandarapu, Sandeep Kunkunuru

专题命中 视觉问答 :grounding(title,abstract)

AI总结 通过受控实验发现,知识图谱基础仅在问题涉及模型训练外知识时提升LLM性能,对已知事实无帮助,且公共KG信息冗余。

Comments 9 pages. Code: https://github.com/samyama-ai/clinical-llm-graphrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 62%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 9 篇

2606.22597 2026-06-24 cs.CV 新提交 87%

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

MapReason-OSM:视觉语言模型能否从街道地图中做出可图验证的移动决策?

Srinivas Venkatanarayanan, Clement Pakkam Isaac

机构 * NVIDIA(英伟达) University of Central Florida(中佛罗里达大学) University of South Florida(南佛罗里达大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出MapReason-OSM基准,通过自渲染OpenStreetMap面板和隐藏街道图,评估VLM在路由、设施定位等任务中做出可图验证的移动决策的能力,发现模型在图形成本推理和跨缩放一致性上表现不佳。

Comments 9 pages, 7 figures. Submitted to ACM SIGSPATIAL 2026 (Industrial Track). Code and data: https://github.com/Vi-Sri/mapreason-osm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24726 2026-06-24 cs.CV 新提交 84%

SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

SER: 用语义证据奖励学习视频推理定位

Sheng Xia, Zhengqin Lai, Tianxiang Jiang, Kanghui Tian, Shoujun Zhou, Bin Li, Yi Wang

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 视觉推理 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV

AI总结 提出语义证据奖励(SER),通过将时空证据定位重构为约束验证任务,利用裁判VLM评估证据的相关性和定位质量,在V-STAR基准上提升3.0点mLGM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23843 2026-06-24 cs.CV cs.IR 新提交 83%

HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

HANCLIP:双曲角否定视觉语言模型系列

Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

机构 * ADAPT Centre Dublin City University, Ireland(爱尔兰都柏林城市大学ADAPT中心) University of East Anglia Norwich, UK(英国东英吉利大学) Queen’s University Belfast Belfast, UK(英国贝尔法斯特女王大学) University of Science Vietnam National University Ho Chi Minh City, Vietnam(越南胡志明市国家大学理科大学)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对视觉语言模型对否定语义脆弱的问题,提出HANCLIP系列,通过双曲空间和角度三元组目标重构嵌入空间,在20K数据上训练,增强否定敏感性同时保持预训练表示,在NegBench等基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24422 2026-06-24 cs.CV 新提交 70%

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23938 2026-06-24 cs.AI cs.CL 新提交 70%

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

神经符号驱动:基于规则忠实推理的驾驶VLA

Xiangbo Gao, Xiukun Huang, Boyu Lu, Junge Zhang, Mengjie Mao, Jiachen Li, Wei Xiong, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) University of California, Riverside(加利福尼亚大学河滨分校) University of Pittsburgh(匹兹堡大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11129 2026-06-24 cs.CV 新提交 70%

WorldOlympiad: Can Your World Model Survive a Triathlon?

WorldOlympiad:你的世界模型能经受铁人三项考验吗?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) The Hong Kong University of Science and Technology(香港科技大学) Monash University(莫纳什大学) TRE, Alibaba Group(阿里巴巴TRE)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。

Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09768 2026-06-24 cs.MA 67%

SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis

SAGE: 可扩展的代理基于地面评估用于作物疾病诊断

Muhammad Arbab Arshad, Tirtho Roy, Yanben Shen, Dinakaran Elango, Shivani Chiranjeevi, Asheesh K. Singh, Baskar Ganapathysubramanian, Chinmay Hegde, Arti Singh, Soumik Sarkar

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract)

AI总结 本文提出SAGE框架,通过构建大规模作物疾病图像-症状数据集,结合自动管道生成基于源的症状描述,并引入自主视觉推理代理提升疾病诊断准确性。

Journal ref CVPR 2026 Workshop on Emerging Directions in Data for Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24849 2026-06-24 cs.CV cs.AI 新提交 62%

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链

Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) Ant Group(蚂蚁集团) The University of Hong Kong(香港大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 提出隐式视觉思维链(IV-CoT)框架,通过结构到语义的级联分解和训练时草图监督,在不增加推理开销的情况下提升文本到图像生成的结构感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24636 2026-06-24 cs.AI 新提交 57%

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

CineCap: 基于时空锚点的结构化推理用于电影化视频描述

Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang, Xin Tao, Pengfei Wan, Xiaohan Xing, Max Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Xiamen University(厦门大学) Kling Team, Kuaishou Technology(快手科技Kling团队) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 23 篇

2605.01482 2026-06-24 cs.AI 版本更新 85%

Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

通过群体相对策略优化在结构因果模型中 grounding 多跳推理

Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24759 2026-06-24 cs.CV cs.AI 新提交 84%

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架

Xiaowei Gao, Pengxiang Li, Yitai Cheng, Ruihan Xu, James Haworth, Stephen Law, Yun Ye

机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom organization= SpaceTimeLab, Department of Civil, Environmental Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24884 2026-06-24 cs.RO cs.AI cs.LG 新提交 82%

InSight: Self-Guided Skill Acquisition via Steerable VLAs

InSight: 通过可引导的VLA实现自主技能获取

Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。

Comments Project website: https://insight-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11197 2026-06-24 cs.CV 版本更新 81%

MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration

MedP-CLIP:具有区域感知提示集成的医学CLIP

Jiahui Peng, He Yao, Jingwen Li, Yanzhou Su, Sibo Ju, Yujie Lu, Jin Ye, Hongchun Lu, Xue Li, Lincheng Jiang, Min Zhu, Junlong Cheng

机构 * Sichuan University(四川大学) Xinjiang University(新疆大学) Alibaba Group(阿里巴巴集团) Fuzhou University(福州大学) Shanghai AI Laboratory(上海人工智能实验室) Southwest Jiaotong University(西南交通大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出MedP-CLIP,一种区域感知医学视觉语言模型,通过特征级区域提示集成机制,支持多种提示形式,在保持全局上下文的同时聚焦局部区域,在零样本识别、交互式分割等任务中显著优于基线方法。

Comments Accepted by Medical Image Analysis (MedIA)

Journal ref Medical Image Analysis, 113 (2026), 104193

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新 77%

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24344 2026-06-24 cs.LO cs.AI 新提交 74%

What Does ODRL Mean? A Cross-Level Ontological Grounding of Permissions, Prohibitions, and Duties in UFO-L

ODRL 意味着什么?UFO-L 中许可、禁止和义务的跨层次本体论基础

Daham M. Mustafa, Christoph Lange, Giancarlo Guizzardi, Diego Collarana, Christoph Quix, Stefan Decker

机构 * University of Twente, The Netherlands(特文特大学,荷兰) RWTH Aachen University, Aachen, Germany(亚琛工业大学,德国)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 针对 ODRL 策略评估器忽略规范立场、权威结构等问题,提出跨层次设计原则,将 ODRL 规则映射到 UFO-L 中的法律关联子,从两种扩展至八种法律立场,并在 Isabelle/HOL 中机械验证。

Comments Accepted at FOIS 2026 (16th International Conference on Formal Ontology in Information Systems), Vitória, Brazil; to appear in Frontiers in Artificial Intelligence and Applications, IOS Press. 16 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交 73%

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24208 2026-06-24 cs.RO 新提交 71%

Grounding Generative Policies in Physics: Optimization-Guided Diffusion for Robot Control

将生成式策略基于物理:面向机器人控制的优化引导扩散

Sabrina Bodmer, René Zurbrügg, Tifanny Portela, Hao Ma, Alexandre Didier, Marco Hutter, Colin Jones, Melanie Zeilinger

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出推理时优化框架,通过将扩散引导建模为约束优化问题,在采样中施加物理可行性约束,无需重训练即可提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24539 2026-06-24 cs.CV 新提交 70%

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

PointVG-R: 通过视觉思维链在多模态大语言模型中内化几何推理以实现精确指向定位

Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出PointVG-R,通过强化学习和冷启动数据内化几何推理,结合视觉思维链数据集EgoPoint-CoT,在指向性视觉定位任务中实现mIoU提升15.86个点的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23917 2026-06-24 cs.CV 新提交 70%

Trustworthy Image Authentication using Forensic Knowledge Graphs

使用取证知识图谱的可信图像认证

Tai D. Nguyen, Matthew C. Stamm

机构 * Drexel University(德雷塞尔大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出取证知识图谱(FKG)框架,通过结构化取证证据提取与推理实现可解释的图像伪造检测,优于现有检测器和视觉语言模型。

Comments Accepted and Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23835 2026-06-24 cs.CV eess.IV 新提交 70%

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

ABACUS: 自适应统一基础模型,桥接图像计数理解与生成

Anindya Mondal, Sauradip Nag, Anjan Dutta

机构 * University of Surrey(萨里大学) Simon Fraser University(西蒙菲莎大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出ABACUS统一视觉语言模型,通过密度感知自适应缩放、边界感知计数策略和循环一致性GRPO,无需特定训练即可处理多种计数任务并生成计数忠实图像,在七个基准上达到最优。

Comments Under review, webpage: https://mondalanindya.github.io/ABACUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24255 2026-06-24 cs.CV cs.AI 新提交 62%

Social Structure Matters in 3D Human-Human Interaction Generation

社会结构在三维人-人交互生成中的重要性

Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达) Nanjing University(南京大学) University of Technology Sydney(悉尼科技大学) Australian National University(澳大利亚国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Solo-to-Social框架,利用LLM规划社会结构(阶段分解、角色分配)并指导运动执行器生成协调的双人3D运动,解决文本驱动的人-人交互生成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23991 2026-06-24 cs.AI cs.LG cs.MA cs.RO 新提交 62%

Critique of Agent Model

智能体模型批判

Eric Xing, Mingkai Deng, Jinyu Hou

机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24498 2026-06-24 cs.CV 新提交 57%

VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection

VistaRef: 提升指向目标检测的视觉空间方位感知能力

Ling Li, Zhizhen Cai, Xinkun Wu, Ziyu Zhu, Jiaqing Lyu, Bowen Liu, Zhidong Deng

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出VistaRef框架,通过局部手部实体建模和几何射线建模模块增强空间方位感知,并引入方向一致性对齐损失,在指向目标检测任务中实现14个绝对点的精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏