arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-13 至 2026-05-13 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 18 篇

2605.08802 2026-05-13 cs.CV 83%

CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization

CoLVR: 通过对比优化增强探索性潜在视觉推理

Ziyang Ding, Linjian Meng, Yiming Wu, Yuhan Li, Yuhao Liu, Zhen Zhao

机构 * Shandong University(山东大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CoLVR通过引入潜在对比训练框架,利用角度扰动引导学习多样化且探索性的表示,提升潜在视觉推理的探索能力,在VSP和Jigsaw任务中分别提升5.83%和8.00%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11534 2026-05-13 cs.RO 80%

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

PRISM:在模拟的具身环境中进行规划与意图推理

Yunn Kang Lim, Pengzhan Sun, Ziyi Bai, Xun Xu, Angela Yao, Xulei Yang, Shijie Li

机构 * A*STAR National University of Singapore(国立新加坡大学) BAAI(北京人工智能研究院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn)

AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16070 2026-05-13 cs.CL 78%

Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants

减少冗余:提升视觉语言模型在行走助手中的实用性

Chongyang Li, Zhiqiang Yuan, Hanbo Bi, Zexi Jia, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能研究院)

专题命中 视觉推理 :vision language model(title);visual language model(abstract)

AI总结 本文提出WalkVLM-LR模型,通过优化输出和时间冗余,提升视觉语言模型在行走助手中的实用性,实验表明其在输出简洁性和时间冗余方面表现优异。

Comments ICASSP 2026 Best Industry Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05922 2026-05-13 cs.CV 77%

Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

思考,然后评分:视频奖励建模中的解耦推理与评分

Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng Wang, Xintao Wang, Pengfei Wan, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DeScore模型,通过解耦推理与评分机制提升视频奖励建模的泛化能力,结合冷启动和强化学习优化,实现更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05269 2026-05-13 cs.CV 77%

B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding

B4DL:用于空间时间理解的4D激光雷达LLM基准

Changho Choi, Youngwoo Shin, Gyojin Han, Dong-Jae Lee, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出B4DL基准,用于训练和评估多模态大语言模型对4D激光雷达数据的理解,结合可扩展的数据生成管道和新模型,实现动态户外环境的空间时间推理。

Comments Accepted at ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12495 2026-05-13 cs.CV cs.AI cs.LG 75%

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

AlphaGRPO:通过分解性可验证奖励解锁UMMs中的自反思多模态生成

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 AlphaGRPO通过分解性可验证奖励提升多模态生成能力,实现文本到图像生成和自反思修正,验证了自反思强化方法在生成高质量输出中的有效性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21887 2026-05-13 cs.RO 75%

IGV-RRT: Prior-Real-Time Observation Fusion for Active Object Search in Changing Environments

IGV-RRT:面向动态环境主动目标搜索的先验-实时观测融合

Wei Zhang, Ping Gong, Yujie Wang, Leilei Yao, Minghui Bai, Rongfeng Ye, Yinchuan Wang, Yachao Wang, Chen Sun, Chaoqun Wang

机构 * The School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Department of Data and Systems Engineering, HKU(数据与系统工程系,香港大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract)

AI总结 本文提出IGV-RRT框架,结合先验场景知识与实时目标相关性估计,通过双层语义映射模块和实时规划器提升动态环境中目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11541 2026-05-13 cs.CV 74%

GeoR-Bench: Evaluating Geoscience Visual Reasoning

GeoR-Bench:评估地质学视觉推理

Yushuo Zheng, Zicheng Zhang, Huiyu Duan, Chunyi Li, Zijian Chen, Ziheng Jia, Yue Shi, Ke Gu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Technology(北京理工大学)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

AI总结 GeoR-Bench通过推理引导的视觉编辑任务评估地质学视觉推理,包含440个样本涵盖6类地质学领域和24种任务类型,揭示地质学推理仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11462 2026-05-13 cs.CV cs.AI 73%

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

SpatialForge: 从开放世界2D图像中提升3D感知空间推理

Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu

机构 * Lingnan University(岭南大学) XPENG Robotics(小鹏机器人)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialForge,通过大规模合成数据提升空间推理能力,构建了包含1000万对空间问答的大型数据集,验证了2D数据扩展对3D空间推理的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11856 2026-05-13 cs.CV cs.CL 70%

UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

UniVLR: 统一文本与视觉的视觉潜在推理用于多模态大语言模型

Houcheng Jiang, Jiajun Fu, Junfeng Fang, Chen Gao, Xiang Wang, Xiangnan He, Yong Li

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 UniVLR提出一种统一的视觉潜在推理框架,将文本推理和辅助视觉证据视为共享的视觉工作空间,通过压缩统一表示提升多模态大语言模型的视觉推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04476 2026-05-13 cs.CV 70%

Vision-aligned Latent Reasoning for Multi-modal Large Language Model

多模态大语言模型中的视觉对齐潜在推理

Byungwoo Jeon, Yoonwoo Jeong, Hyunseok Lee, Minsu Cho, Jinwoo Shin

机构 * Byungwoo Jeon Yoonwoo Jeong Hyunseok Lee Minsu Cho Jinwoo Shin

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出视觉对齐潜在推理框架,通过动态生成视觉对齐的潜在标记,提升多模态大语言模型在长上下文理解和精确视觉感知任务中的表现。

Comments Published as conference proceeding for ICML 2026. Last two authors advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11304 2026-05-13 cs.CV 70%

CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography

CheXTemporal:用于胸部X光影像中时间感知推理的数据集

Eva Prakash, Yunhe Gao, Chong Wang, Justin Xu, Neal Prakash, Arne Michalson, Seena Dehkharghani, Eun Kyoung Hong, Julie Bauml, Roger Boodoo, Jean-Benoit Delbrouck, Sophie Ostmeier, Curtis Langlotz

机构 * Stanford University(斯坦福大学) University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) HOPPR University Hospital Zurich(苏黎世大学医院)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究提出CheXTemporal数据集,用于胸部X光影像中时间感知推理,包含前后X光片及时间空间标注,评估了多种视觉语言模型在零样本设定下的接地和进展分类任务,发现模型在空间接地和时间推理方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11663 2026-05-13 cs.CL 67%

Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability

具有90万规模日本全国学业能力评估学生响应分布的多模态基准

Kyosuke Takami, Yuka Tateisi, Satoshi Sekine, Yusuke Miyao

机构 * Osaka Kyoiku University(大阪教养大学) University of Tokyo(东京大学) NII LLMC(日本国家信息与通信技术研究所大语言模型中心)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)

AI总结 本文提出一个基于日本全国学业能力评估的多模态数据集,包含真实考试布局、图表和教育文本,用于评估多模态大语言模型的性能,通过精确匹配准确率和字符级F1分数分析不同学科间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11931 2026-05-13 cs.CV 57%

Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

学会思考:通过视觉感知的自我改进训练提升多模态推理

Qihuang Zhong, Liang Ding, Wenjie Xuan, Juhua Liu, Bo Du, Dacheng Tao

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence(计算机学院、多媒体软件国家工程研究中心、人工智能研究院) Hubei Key Laboratory of Multimedia(湖北多媒体重点实验室) Network Communication Engineering, Wuhan University, China(网络通信工程、武汉大学,中国) The University of Sydney, Australia(悉尼大学,澳大利亚) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VISTA框架,通过视觉感知的自我改进训练提升多模态推理能力,解决数据不平衡和语言先验偏差问题,实验显示在多种训练场景下提升性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09266 2026-05-13 cs.AI 57%

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

SeePhys Pro:多模态RLVR中模态迁移和盲训练效应的诊断

Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhen, Dandan Tu, Yinya Huang, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世人工智能中心) Huawei Technologies Ltd(华为技术有限公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 SeePhys Pro研究多模态RLVR中模态迁移对物理推理的影响,发现当前模型在信息从语言迁移到图像时表现下降,盲训练可提升性能,但依赖残余文本和分布特征而非有效视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10500 2026-05-13 cs.CV 57%

Visual Enhanced Depth Scaling for Multimodal Latent Reasoning

视觉增强深度缩放用于多模态潜在推理

Yudong Han, Yong Wang, Zaiquan Yang, Zhen Qu, Liyuan Pan, Xiangxiang Chu

机构 * Beijing Institute of Technology(北京理工大学) AMAP, Alibaba Group(阿里集团AMAP) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Yangtze Delta Region Academy of Beijing Institude of Technology, Jiaxing, China(北京理工大学扬子江地区学院,嘉兴,中国)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出视觉回放模块和路由深度缩放,通过增强视觉感知和细化复杂潜在表示,提升多模态潜在推理的效率与性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11633 2026-05-13 cs.AI 57%

Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations

大语言模型代理能否应对灾难?评估异构地理空间推理在紧急行动中的基准测试

Junjue Wang, Weihao Xuan, Heli Qi, Pengyu Dai, Kunyi Liu, Hongruixuan Chen, Zhuo Zheng, Junshi Xia, Stefano Ermon, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出DORA基准测试,评估大语言模型在灾难响应中的端到端流程,揭示了灾难领域接地、工具选择瓶颈和组合脆弱性等挑战。

Comments DORA stress-tests LLM agents on real-world disaster operations that demand comprehensive orchestration of 108 specialized tools over heterogeneous geospatial data

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11629 2026-05-13 cs.CL 50%

OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

OmniThoughtVis: 一种可扩展的蒸馏流水线,用于可部署的多模态推理模型

Yuanhao Yue, Chengyu Wang, Yuanjie Lyu, Lei Shen, Jun Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文提出OmniThoughtVis流水线,通过大规模多模态Co T监督将高容量教师模型的推理能力转移到小型部署模型,实现了在多个基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏