arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-09 至 2026-06-09 共收录 155 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 13 篇

2604.17488 2026-06-09 cs.CV 91%

AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation

AutoVQA-G:用于自动视觉问答与接地标注的自我改进代理框架

Rongsheng Hu, Runwei Guan, Yicheng Di, Jiayu Bao, Yuan Liu

机构 * School of Artificial Intelligence(人工智能学院)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出AutoVQA-G框架,通过迭代优化流程提升视觉问答接地标注的准确性,优于现有多模态LLM,为构建高质量数据促进更稳健的视觉语言模型训练提供新方法。

Comments Accepted at IEEE ICASSP 2026. 5 pages, 5 figures. Code available at https://github.com/rohnson1999/AutoVQA-G

Journal ref Proc. 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 12312-12316, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09142 2026-06-09 cs.CV cs.AI 新提交 89%

Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models

通过视觉语言模型从自我中心视觉解码行人过街意图

Danya Li, Xiang Su, Yan Feng, Rico Krueger

机构 * Technical University of Denmark(丹麦技术大学) University of Helsinki(赫尔辛基大学) Delft University of Technology(代尔夫特理工大学)

专题命中 视觉问答 :vision language model(title,abstract);VLM(summary_cn,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 利用视觉语言模型(VLM)将行人过街意图预测转化为视觉问答任务,通过参数高效微调并结合自我运动、车辆运动和眼动等上下文线索,在自我中心视频上实现了14.5%的准确率提升,创下新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16349 2026-06-09 cs.CV cs.AI 版本更新 86%

Collaborative Edge-to-Server Inference for Vision-Language Models

面向视觉-语言模型的协作式边缘到服务器推理

Soochang Song, Yongjune Kim

机构 * Department of Electrical Engineering, Pohang University of Science and Technology (POSTECH)(电气工程系,波扬科学技术大学(POSTECH))

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出一种协作式边缘到服务器推理框架,通过两阶段选择性重传策略,在降低通信成本的同时保持视觉-语言模型的推理精度。

Comments 12 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06407 2026-06-09 cs.CV cs.IR cs.LG eess.IV 版本更新 85%

A Vision-language Framework for Comparative Reasoning in Radiology

放射学中比较推理的视觉语言框架

Tengfei Zhang, Ziheng Zhao, Xiaoman Zhang, Lisong Dai, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Radiology, Renmin Hospital of Wuhan University(武汉大学仁民医院放射科) Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University(上海交通大学附属第六人民医院)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 提出一个实体感知的跨图像推理框架,通过构建大规模比较影像数据集MedReCo-DB和开发MedReCo及MedReCo-VLM模型,实现了参考病例检索和时间比较解读,显著提升了放射学比较推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08959 2026-06-09 cs.CV cs.CL 新提交 83%

ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

ChinaHeritaQA:面向中国世界遗产地的文化基础视觉问答数据集

Yi Zhang, Bolei Ma, Yong Cao, Chengyan Wu, Daniel Hershcovich, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) FAU Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Tübingen & Tübingen AI Center(图宾根大学与图宾根人工智能中心) Sun Yat-sen University(中山大学) University of Copenhagen(哥本哈根大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出ChinaHeritaQA多模态基准数据集,包含2279张图像和14133个双语多项选择题,覆盖七个认知维度,评估视觉语言模型在中国世界遗产上的文化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08542 2026-06-09 cs.RO cs.AI cs.CV 新提交 82%

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics

专题命中 视觉问答 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09644 2026-06-09 cs.CL cs.CV 新提交 81%

Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving

答案从何而来?面向自动驾驶的多视角MLLMs中视角级视觉证据识别基准

Yimu Wang, Yee Man Choi, Barry Zhang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 针对多视角自动驾驶场景,提出一个基准测试,评估多模态大模型在视觉问答中识别支持性相机视角的能力,包含122个冲突中心问题对,并区分视角选择与答案正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10028 2026-06-09 cs.LG cs.AI cs.DC 版本更新 79%

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization

基于LLM增强优化的无人机低空经济网络高效机载视觉-语言推理

Yang Li, Ruichen Zhang, Yinqiu Liu, Guangyuan Liu, Abbas Jamalipour, Xianbin Wang, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院、新加坡国立科技大学) The University of Sydney, Sydney, Australia(悉尼大学、澳大利亚悉尼) Department of Electrical and Computer Engineering, Western University, London, Canada(电气与计算机工程系、西方大学、加拿大伦敦) Department of Electrical and Computer Engineering, Sungkyunkwan University, South Korea(电气与计算机工程系、全州大学、韩国)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 针对无人机低空经济网络中机载视觉-语言模型推理的准确性与通信效率挑战,提出分层优化框架,包括交替分辨率与功率优化算法及大语言模型增强的强化学习轨迹优化方法,有效提升推理性能与通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07549 2026-06-09 cs.AI cs.MA 新提交 77%

PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow

PathoSage:通过经验感知的代理工作流实现病理学多源证据裁决

Chengyang Zhang, Wenchuan Zhang, Bo Li, Mengran Li, Bob Zhang, Yuhao Yi, Hong Bu, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Department of Pathology and Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科/临床病理研究所) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出PathoSage框架,通过结构化证据审议和Beta-Bernoulli经验系统,独立评估工具证据并解决冲突,减少幻觉和分类器分歧,提升病理学推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14342 2026-06-09 cs.CV cs.AI 版本更新 73%

AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning

AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理

Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AgroOmni数据集,通过288K视觉问答对覆盖56个专业任务类别,解决多视角跨尺度农业多模态推理中的尺度偏差问题,提出AgroNVILA模型在AgroMind基准上达到62.32%的SOTA成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18676 2026-06-09 cs.CV cs.AI 版本更新 73%

MedVision: Benchmarking Quantitative Medical Image Analysis

MedVision:定量医学图像分析的基准测试

Yongcheng Yao, Yongshuo Zong, Raman Dutt, Yongxin Yang, Sotirios A Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对当前医学视觉语言模型缺乏定量推理能力的问题,提出MedVision数据集和基准,涵盖22个公共数据集、3080万图像-标注对,通过监督和强化微调显著提升检测、肿瘤/病变大小估计和角度/距离测量性能。

Comments 22 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07962 2026-06-09 cs.CV 新提交 70%

ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

ChronoPhyBench:多模态大语言模型真正理解世界还是仅仅利用语言先验?

Bin Zhu, Yanhao Jia, Kexin Zhao, Jie Wang, Munan Ning, Hao Li, Yuwei Niu, Tanqing Sun, Huangchong Yan, Mingjun Pan, Xinyi Wu, Qishen Yin, Yunyang Ge, Shuai Zhao, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre Intelligence Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出ChronoPhyBench基准,通过视频上下文和文本描述强制模型进行物理状态推理,揭示当前开源模型物理推理能力仍处初级阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08063 2026-06-09 cs.CV cs.AI cs.CL 新提交 62%

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

Robust-U1: MLLMs能否自我恢复受损视觉内容以实现鲁棒理解?

Jiaqi Tang, Jianmin Chen, Youyang Zhai, Wei Wei, Runtao Liu, Mengjie Zhao, Xiangyu Wu, Qingfa Xiao, Qifeng Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出Robust-U1框架,通过监督微调、强化学习和多模态推理,使多模态大模型具备显式视觉自恢复能力,在真实和对抗性损坏下达到最先进鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 21 篇

2606.08894 2026-06-09 cs.CV cs.CL 新提交 90%

Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

推理视觉语言模型对语义视觉干扰具有鲁棒性吗?

Yizheng Sun, Mochuan Zhan, Yanan Ma, Jia Tong See, Yifan Wang, Ziyi Wang, Hao Li, Yang Cui, Wenhao Cai, Jingyu Sun, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun

机构 * University of Manchester(曼彻斯特大学) Marex Imperial College London(帝国理工学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 针对推理VLM在真实场景中易受语义视觉干扰的问题,提出Distract-Bench基准,发现推理VLM对语义干扰的鲁棒性低于感知退化,且干扰常被纳入推理过程导致错误答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09290 2026-06-09 cs.CV 新提交 89%

Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning

Visual Para-Thinker++:用于视觉推理的单策略多智能体框架

Haoran Xu, Hongyu Wang, Yifei Gao, Jiaze Li, Zizhao Tong, Xiaofeng Zhang, Xiaosong Yuan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) Tianjin University(天津大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学) Jilin University(吉林大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);visual reasoning(title,abstract);分类 cs.CV

AI总结 提出Visual Para-Thinker++框架,通过共享MLLM策略实例化为多个角色智能体并行推理,结合多智能体能力注入和角色解耦优化,有效缓解视觉推理中的早期感知承诺和幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 88%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 86%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08035 2026-06-09 cs.CV 新提交 83%

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

DyCo-RL: 用于视觉推理的动态跨模态协调

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe

机构 * University of Trento(特伦托大学) BAAI(北京智源人工智能研究院) Singapore Management University(新加坡管理大学) IQuest Research

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22766 2026-06-09 cs.CL 版本更新 82%

Imagination Helps Visual Reasoning, But Not Yet in Latent Space

想象力有助于视觉推理,但尚未在潜在空间中实现

You Li, Chi Chen, Yanghao Li, Fanhu Zeng, Kaiyu Huang, Jinan Xu, Maosong Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract)

AI总结 通过因果中介分析发现,多模态大语言模型中的潜在推理存在输入-潜在和潜在-答案两个关键断连,表明其有效性有限,并提出显式想象方法CapImagine,在视觉推理任务中表现更优。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07872 2026-06-09 cs.CV 新提交 81%

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?

VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?

Didi Zhu, Changrui Chen, Stefanos Zafeiriou, Jiankang Deng

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16136 2026-06-09 cs.RO 版本更新 80%

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning

基于思维图的奖励进化:一种用于强化学习的双层语言模型框架

Changwei Yao, Xinzi Liu, Chen Li, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);visual language model(abstract)

AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。

Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01880 2026-06-09 cs.RO 78%

Multimodal Large Language Models for Real-Time Situated Reasoning

多模态大语言模型用于实时情境推理

Giulio Antonio Abbo, Senne Lenaerts, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉推理 :multimodal large language model(title,abstract)

AI总结 本文探讨多模态大语言模型如何支持实时情境和价值感知决策,结合GPT-4o与模拟智能扫地机器人平台,展示其在家庭活动、社会规范和用户偏好推理中的能力,以及在清洁、舒适和安全等价值上的细致决策。

Comments Submitted to the interactivity track of the 21st ACM/IEEE International Conference on Human-Robot Interaction on December 2025, accepted January 2026

Journal ref HRI Companion 2026: Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09091 2026-06-09 cs.LG cs.CV 新提交 76%

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization

稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化

Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.LG

AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08464 2026-06-09 cs.CV 新提交 70%

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07689 2026-06-09 cs.CV 新提交 70%

Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking

Struct-Searcher:代理式结构化思维推进多模态深度信息检索

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Zheng Lian, Hao Wu, Yuan Gao, Xinyu Geng, Xin Wang, Pheng-Ann Heng

机构 * CUHK(香港中文大学) LIGHTSPEED PKU(北京大学) Tongji University(同济大学) THU(清华大学) HKUST(香港科技大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出基于信念修正理论的结构化代理工作流Struct-Searcher,通过维护多模态结构图实现冲突感知的深度信息检索,在多个基准上平均相对准确率提升17.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-06-09 cs.LG cs.AI 新提交 62%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V1, 15 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00229 2026-06-09 cs.RO cs.AI cs.LG 版本更新 62%

Continuous Reasoning for Vision-Language-Action

视觉-语言-动作的连续推理

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

机构 * Airoa

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 针对视觉-语言-动作策略中语言与连续控制粒度不匹配的问题,提出一种可共享、可验证的连续推理方法,通过高斯潜变量接口和自验证目标提升机器人任务成功率。

Comments Project page: https://continuous-reasoning.airoa.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09585 2026-06-09 cs.AI 新提交 57%

Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text

光学推理:重新思考图像作为超越文本的表达性推理媒介

Yutong Bian, Dongjie Cheng, Heming Xia, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出光学推理概念,将图像作为独立推理媒介,通过排版和图形两种变体实现,在语言和多模态任务中匹配或超越文本推理,同时减少推理令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09033 2026-06-09 cs.CV cs.CL 新提交 57%

CRANE: Knowledge Editing for Reasoning MLLMs

CRANE:面向推理多模态大语言模型的知识编辑

Han Huang, Hao Wang, Mengqi Zhang, Shu Wu, Qiang Liu, Liang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) New Laboratory of Pattern Recognition (NLPR), CASIA(中国科学院自动化研究所模式识别国家重点实验室) Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对推理多模态大语言模型在知识编辑中出现的结构崩溃、认知失调和浅层内化三种失败模式,提出检索增强框架CRANE,无需逐编辑参数修改,通过模态感知双库检索系统和两阶段训练策略实现高成功率。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08719 2026-06-09 cs.CV 新提交 57%

Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

无图像思考:通过在线自我蒸馏内化视觉操作

Yishuo Cai, Jiahui Liu, Yuanxin Liu, Haobo Deng, Linli Yao, Yuhao Zheng, Kun Ouyang, Zhimo Li, Ziyue Wang, Xu Sun, Haoli Bai, Xiaohui Li

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Central South University(中南大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Huawei Technologies(华为技术有限公司)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 提出Imagine-OPD框架,通过在线自我蒸馏将“用图像思考”的视觉推理能力内化为“用想象思考”,在不调用外部工具的情况下生成内部视觉线索,在保持性能的同时显著降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏