arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4469 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4469 篇

2606.24422 2026-06-24 cs.CV 新提交 70%

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23938 2026-06-24 cs.AI cs.CL 新提交 70%

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

神经符号驱动:基于规则忠实推理的驾驶VLA

Xiangbo Gao, Xiukun Huang, Boyu Lu, Junge Zhang, Mengjie Mao, Jiachen Li, Wei Xiong, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) University of California, Riverside(加利福尼亚大学河滨分校) University of Pittsburgh(匹兹堡大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11129 2026-06-24 cs.CV 新提交 70%

WorldOlympiad: Can Your World Model Survive a Triathlon?

WorldOlympiad:你的世界模型能经受铁人三项考验吗?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) The Hong Kong University of Science and Technology(香港科技大学) Monash University(莫纳什大学) TRE, Alibaba Group(阿里巴巴TRE)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。

Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23206 2026-06-23 cs.CV cs.CL 新提交 70%

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

CFPO:用于多模态推理的反事实策略优化

Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出反事实策略优化框架,通过跨模态反事实增强机制强制视觉与文本推理的因果一致性,显著提升多模态推理的准确性。

Comments Accepted to ICML 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17642 2026-06-23 cs.AI 新提交 70%

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen: 通过自演化经验记忆实现的金融多模态推理

Pianran Guo, Pengcheng Zhou, Yucheng Jian, Shuhua Chen, Zhonfliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 提出FinAcumen框架,通过选择性经验记忆机制增强工具增强型多模态推理,在四个金融基准上持续提升冻结的8B视觉语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20100 2026-06-19 cs.CV 新提交 70%

WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization

WeGenBench:面向文本到图像模型优化的多维诊断基准

Qian Liang, Xiaomin Li, Ying Zhang, Jia Xu, Lihao Ni, Hongrui Li, Jingjing Li, Jing Lyu, Chen Li

机构 * University of Electronic Science and Technology of China(电子科技大学) Dalian University of Technology(大连理工大学) Weixin, Tencent(腾讯微信)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出WeGenBench基准,包含4000个中英双语提示,通过场景分类和多维标签实现跨维度评估,并设计基于视觉语言模型的新颖指标,精准定位模型在特定生成类别中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14985 2026-06-19 cs.CV cs.CL 版本更新 70%

IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models

IdealGPT: 通过大型语言模型迭代分解视觉与语言推理

Haoxuan You, Rui Sun, Zhecan Wang, Long Chen, Gengyu Wang, Hammad A. Ayyubi, Kai-Wei Chang, Shih-Fu Chang

机构 * Columbia University(哥伦比亚大学) HKUST(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出IdealGPT框架,利用大型语言模型迭代分解视觉语言推理任务,通过子问题生成、子答案获取和最终答案推理的循环过程,在零样本设置下显著提升多步推理性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14383 2026-06-17 cs.CV 新提交 70%

IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

IndustryBench-MIPU:面向工业产品的多图像属性值提取基准

Haonan Qi, Jin Cao, Yongqi Zhang, Xintong Wang, Weidong Tang, Bin Chen, Chengfu Huo, Haojun Pan, Hengyu You, Jing Li, Yingde Wang, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队) Taobao&Tmall, Alibaba Group(淘宝&天猫,阿里巴巴集团)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出首个多图像工业产品理解基准IndustryBench-MIPU,通过结构化属性提取任务评估多模态大模型在规格表、铭牌、技术图纸上的文本识别、视觉推理、领域知识和跨图像证据整合能力,发现多图像完整性是核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16978 2026-06-17 cs.CV 版本更新 70%

A Benchmark for Omni-Modal Reasoning in Long Videos

长视频全模态推理基准

Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Jinxing Zhou, Sahal Shaji Mullappilly, Mohammad Almansoori, Noor Ahsan, Beknur Kalmakhanbet, Sambal Shikhar, Rishabh Lalla, Jean Lahoud, Mariette Awad, Fahad Shahbaz Khan, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) American University of Beirut(贝鲁特美国大学) Linköping University(利尔贝里大学)

专题命中 视觉推理 :grounding(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15328 2026-06-16 cs.CV 新提交 70%

SGFormer++: Semantic Graph Transformer for Incremental 3D Scene Graph Generation

SGFormer++:用于增量式3D场景图生成的语义图Transformer

Mengshi Qi, Changsheng Lv, Zijian Fu, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出SGFormer++,通过图嵌入层和语义注入层实现全局消息传递,并引入空间引导特征适配器和级联二值预测头解决增量场景图生成中的灾难性遗忘问题,在3DSSG基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12419 2026-06-12 cs.CY cs.AI 新提交 70%

GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns

GeoDial:面向几何问题求解的多模态对话式辅导数据集,包含可视化辅导轮次

Sankalan Pal Chowdhury, Junling Wang, Donya Rooein, April Yi Wang, Mrinmaya Sachan

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) Bocconi University(博科尼大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 提出GeoDial数据集,包含1300+几何师生对话,通过可扩展标注协议整合对话行为、视觉高亮和反馈,微调视觉语言模型发现其难以生成准确图解高亮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07436 2026-06-12 cs.CV 新提交 70%

Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning

Skill-3D:面向智能体3D空间推理的场景感知技能进化

Haoyuan Li, Zhengdong Hu, Jun Wang, Hehe Fan, Yi Yang

机构 * Zhejiang University(浙江大学) University of Technology Sydney(技术悉尼大学) OPPO Research Institute(OPPO研究院)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Skill-3D框架,通过场景记忆和技能库的协同进化,使智能体根据场景自适应选择工具,显著提升3D空间推理中工具使用的正确性和充分性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11770 2026-06-11 cs.AI 新提交 70%

SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

SVoT: 基于强化学习的空间推理状态感知思维可视化

Chao Lei, Yanbei Jiang, Markus Hiller, Zhijian Zhou, Xunye Tian, Krista A. Ehinger, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 提出SVoT框架,通过强化学习生成可验证的中间状态和可视化,结合文本与视觉推理链,提升多模态大模型在多跳空间推理中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08464 2026-06-09 cs.CV 新提交 70%

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07689 2026-06-09 cs.CV 新提交 70%

Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking

Struct-Searcher:代理式结构化思维推进多模态深度信息检索

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Zheng Lian, Hao Wu, Yuan Gao, Xinyu Geng, Xin Wang, Pheng-Ann Heng

机构 * CUHK(香港中文大学) LIGHTSPEED PKU(北京大学) Tongji University(同济大学) THU(清华大学) HKUST(香港科技大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出基于信念修正理论的结构化代理工作流Struct-Searcher,通过维护多模态结构图实现冲突感知的深度信息检索,在多个基准上平均相对准确率提升17.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05949 2026-06-08 cs.CV 版本更新 70%

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Nankai University(南开大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) ZODA Alaya Studio(Alaya工作室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06245 2026-06-05 cs.RO cs.AI 70%

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作

Boyang Zhang, Lianlei Shan

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Computer Science, Tsinghua University(清华大学计算机系)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。

Comments 14 pages, 5 figures, submitted to CoRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06100 2026-06-05 cs.CV 70%

HyperVis: Continuous Latent Visual Relational Graphs on the Lorentz Hyperboloid for Compositional Reasoning

HyperVis:洛伦兹双曲面上的连续潜在视觉关系图用于组合推理

Moshiur Farazi, Sameera Ramasinghe, Mahbub Ahmed Turza, Shafin Rahman

机构 * Data Science and AI, University of Doha for Science and Technology, Qatar(数据科学与人工智能,多哈科学技术大学,卡塔尔) Pluralis Research, Australia(Pluralis研究,澳大利亚) Department of Electrical and Computer Engineering, North South University, Bangladesh(电气与计算机工程系,北南大学,孟加拉国)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对视觉语言模型在组合推理中理解物体间关系的困难,提出HyperVis方法,通过计算密集视觉关系张量并投影到洛伦兹双曲面,利用空间物理(IoA驱动的蕴含锥和外部角排斥)增强层次结构,在训练时作为正则化器提升生成式VQA性能,在推理时作为关系编码器提升判别式组合评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05635 2026-06-05 cs.CV cs.MM 70%

ShotCrop$^3$: Cropping Human-Centric Images into Cinematic Triple-Shot Compositions

ShotCrop$^3$:将人物中心图像裁剪为电影级三镜头构图

Dehong Kong, Lina Lei, Lingtao Zheng, Chenyang Wu, Ailing Zhang, Xinran Qin, Teng Ma, Jiaqi Xu, Zhixin Wang, Zhikai Chen, Xuecheng Qi, Renjing Pei, Fan Li

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出三镜头构图任务,通过三阶段训练流程(思维链微调、半监督微调和组相对策略优化)从单张人物中心图像生成远景、中景和特写三张裁剪图,并附带简短描述,以支持视觉叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10254 2026-06-05 cs.CV 70%

Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis

Facial-R1: 通过推理与识别对齐实现面部情绪分析

Jiulong Wu, Yucheng Shen, Lingyong Yan, Haixin Sun, Deguo Xia, Jizhou Huang, Min Cao

专题命中 视觉推理 :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Facial-R1框架,通过三阶段对齐方法解决面部情绪分析中推理与识别不一致及推理幻觉的问题,并引入FEA-20K基准数据集,验证了其在多个标准基准上的最佳性能。

Comments Withdrawn by the authors due to pending intellectual property considerations. The authors have determined that the current version contains material that should not have been publicly disseminated at this stage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03142 2026-06-03 cs.CV 70%

Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy

解构LVLMs可视化素养中的视觉与事实正确性

Soohyun Lee, Jaeyoung Kim, Seokhyeon Park, Sihyeon Lee, Jiwon Song, Bohyoung Kim, Hyunjoo Song, Jinwook Seo

机构 * Seoul National University(首尔国立大学) MADI Co., Ltd.(MADI公司) Hankuk University of Foreign Studies(韩国民法大学) Soongsil University(顺天大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 提出框架分离视觉正确性与事实正确性,通过反事实测试和仲裁指标揭示LVLMs在可视化素养评估中依赖事实记忆而非视觉推理的问题。

Comments Under review at IEEE Transactions on Visualization and Computer Graphics (TVCG). 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02774 2026-06-03 cs.CV 70%

GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving

GeoDrive-Bench:自动驾驶中区域特定多模态推理的基准测试

Yingzi Ma, Chaowei Xiao, Ming Jiang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出GeoDrive-Bench基准,通过5053个跨六国人工验证的多选题,评估视觉语言模型在感知、预测、规划和区域推理四个驾驶任务中基于区域特定交通规则的推理能力,并设计蒸馏算法注入区域知识以提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00667 2026-06-03 cs.CV 70%

Act Like a Pathologist: Tissue-Aware Whole Slide Image Reasoning

像病理学家一样:组织感知的全切片图像推理

Wentao Huang, Weimin Lyu, Peiliang Lou, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Wenchao Han, Ruifeng Guo, Jiawei Zhou, Chao Chen, Chen Wang

机构 * Stony Brook University(石英溪大学) Mayo Clinic(梅奥诊所) Harvard Medical School(哈佛医学院) Stanford University(斯坦福大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出一种问题引导、组织感知的粗到细检索框架HistoSelect,通过识别相关组织区域并选择最具信息量的补丁,在减少70%视觉标记的同时提升病理问答准确性。

Comments 14 pages, 8 figures. Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00240 2026-06-02 cs.AI cs.MA 70%

MindZero: Learning Online Mental Reasoning With Zero Annotations

MindZero:零标注的在线心智推理学习

Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 提出MindZero框架,通过自监督强化学习训练多模态大语言模型,实现高效鲁棒的在线心智推理,无需显式心智状态标注。

Comments ICML 2026. Website: https://scai.cs.jhu.edu/MindZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09095 2026-06-02 cs.CL cs.CV 70%

Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs

阅读,而非思考:理解并弥合多模态大语言模型中文本变为像素时的模态差距

Kaiser Sun, Xiaochuang Yuan, Hongjun Liu, Chen Zhao, Cheng Zhang, Mark Dredze, Fan Bai

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊) New York University(纽约大学) Texas A&M University(德克萨斯大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本文系统诊断多模态大语言模型在处理图像文本时的模态差距,发现其源于模型推理意愿不足而非感知失败,并提出一种轻量级自蒸馏方法有效弥合该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04069 2026-06-02 cs.CV cs.RO 70%

SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL

SpaceTools: 通过双交互强化学习实现工具增强的空间推理

Siyi Chen, Mikaela Angelina Uy, Chan Hee Song, Faisal Ladhak, Adithyavairavan Murali, Qing Qu, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA University of Michigan(密歇根大学)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出双交互强化学习(DIRL)框架,通过两阶段训练让视觉语言模型学会协调多种工具(如深度估计、分割、姿态估计)进行精确空间推理,在多个基准上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25842 2026-06-01 cs.AI cs.CL 70%

MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

MuCRASP: 多模态思维链推理感知的结构化剪枝

Aritra Dutta, Somak Aditya

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,哈里科普尔)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.AI

AI总结 针对视觉语言模型在结构化剪枝后思维链推理准确性下降的问题,提出MuCRASP框架,通过识别推理关键令牌并保持跨模态对齐,在压缩下维持推理质量。

Comments Preprint ver. 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19923 2026-06-01 cs.CV cs.CL 70%

Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding

从语言到视觉的反事实推理蒸馏:因果图引导的视频理解后训练

Yuefei Chen, Jiang Liu, Xiaodong Lin, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对视觉语言模型在反事实推理上的不足,提出CounterVQA基准和CFGPT后训练方法,通过从语言模态蒸馏反事实推理能力提升视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30346 2026-05-29 cs.CV 70%

YoCausal: How Far is Video Generation from World Model? A Causality Perspective

YoCausal: 视频生成距离世界模型还有多远?一个因果视角

You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, Zhixiang Wang

机构 * National Yang Ming Chiao Tung University Shanda AI Research Tokyo

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出YoCausal基准,通过时间反转真实视频生成反事实样本,利用反向惊奇指数(RSI)和因果认知指数(CCI)评估视频扩散模型的因果理解能力,发现模型感知时间方向不等于理解因果关系,与人类水平存在显著差距。

Comments Project page: https://www.youzhexie.me/papers/YoCausal/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27960 2026-05-28 cs.CV 70%

Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

Mags-RL: 通过智能体强化学习为多模态大语言模型戴上放大镜以进行复杂场景推理

Xuanzhao Dong, Wenhui Zhu, Peijie Qiu, Xiwen Chen, Xiaobing Yu, Xin Li, Zhipeng Wang, Shao Tang, Gen Li, Yujian Xiong, Hao Wang, Yanxi Chen, Prayag Tiwari, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) Halmstad University(哈姆斯塔德大学) Florida State University(佛罗里达州立大学) Rice University(里士满大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出Mags-RL框架,通过智能体强化学习让多模态大语言模型调用超分辨率代理进行高分辨率细粒度检查,实现两轮推理以提升复杂场景下的视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏