Modeling Gestalt Visual Reasoning on the Raven's Progressive Matrices Intelligence Test Using Generative Image Inpainting Techniques
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG
Comments 11 pages, 3 figures
专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.LG
Comments To appear in CVPR 2019. All data and code concerning CLEVR-Ref+ and IEP-Ref have been released at https://cs.jhu.edu/~cxliu/2019/clevr-ref+
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
Comments NAACL 2018 (8 pages; added pointer-ordering examples)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
Comments AAAI 2018. Code available at http://github.com/ethanjperez/film . Extends arXiv:1707.03017
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI
Comments Full AAAI 2018 paper is at arXiv:1709.07871. Presented at ICML 2017's Machine Learning in Speech and Language Processing Workshop. Code is at http://github.com/ethanjperez/film
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG
构建合理的视觉-语言模型推理以实现盲图像质量评估
机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院)
专题命中 视觉推理 :vision-language model(title,journal_ref);VLM(abstract);分类 cs.CV
AI总结 本文提出一种两阶段调优方法,通过分离视觉感知与质量推断,提升视觉-语言模型在盲图像质量评估中的推理稳定性与可靠性。
Comments Accepted to the ICONIP (International Conference on Neural Information Processing), 2025
Journal ref Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment. In: Taniguchi, T., et al. Neural Information Processing. ICONIP 2025. Lecture Notes in Computer Science, vol 16310. Springer, Singapore
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV;VLM(comments)
Comments Project Page: https://apc-vlm.github.io/
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV;VLM(comments)
Comments 13 pages, 4 figures. Code released at https://github.com/groundlight/vlm-visual-demonstrations
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV;visual question answering(comments)
Comments CVPR 2019 Visual Question Answering and Dialog Workshop
CP-MoE:一致性保留的混合专家用于持续学习
机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。
Comments Accepted at CoLLAs 2026
MOON3.0: 基于推理的多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。
Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures
D-VLC:面向未知环境中异构具身多机器人系统的去中心化视觉-语言协作框架
专题命中 视觉推理 :VLM(summary_cn,abstract)
AI总结 本文提出D-VLC框架,结合去中心化异步推理等技术,让通用VLM生成机器人特定动作,多场景实验显示其任务成功率超70%,完成时间较几何贪心基线最多缩短55.8%。
从像素到概念:利用基础模型构建丰富的3D语义场景图森林
机构 * FZI Research Center for Information Technology(FZI信息技术研究中心) ; Machine Intelligence and Robotics Lab (MaiRo), Karlsruhe Institute for Technology (KIT)(卡尔斯鲁厄理工学院机器智能与机器人实验室)
专题命中 视觉推理 :VLM(summary_cn,abstract)
AI总结 提出利用基础模型构建具有开放语义关系的3D场景图森林,通过VLM和LLM推理抽象概念节点与关系,提升机器人场景理解与任务执行能力。
Comments To be published in the Proceedings of the IEEE/RSJ International Conference on Intelligent Robots & Systems (IEEE IROS 2026)
OneCanvas: 通过全景重投影实现3D场景理解
机构 * Technical University of Munich(慕尼黑技术大学) ; Huawei(华为)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出OneCanvas方法,将多视图补丁特征聚合到全景画布上,利用深度和相机位姿进行重投影,无需复杂几何编码器或大量训练,在SQA3D等基准上达到最先进精度。
Comments Project page: https://baranowskibrt.github.io/onecanvas/
Gen-VCoT: 基于扩散的RGB中间表示的生成式视觉思维链推理
机构 * Hunan Chemical Industry Vocational and Technical College(湖南化工职业技术学院)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出Gen-VCoT框架,利用专家视觉模型生成RGB图像作为推理中间步骤,通过自适应路由器选择推理深度,在空间和深度问题上分别提升25%和50%,但简单事实查询性能下降,表明最优表示依赖于任务。
Comments 12 pages, 5 figures
CycliST:用于循环状态转换推理的视频语言模型基准
机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(人工智能与机器学习实验室,图腾斯达特技术大学) ; Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(Konrad Zuse 学校(ELIZA)) ; Honda Research Institute Europe GmbH, Offenbach, Germany(本田欧洲研究院,奥芬巴赫,德国) ; Uncertainty in Artificial Intelligence Group, TU Eindhoven(人工智能不确定性小组,埃因霍温技术大学) ; Hessian Center for AI (hessian.AI)(黑森人工智能中心(hessian.AI)) ; Center for Cognitive Science(认知科学中心) ; German Center for Artificial Intelligence (DFKI)(德国人工智能中心(DFKI))
专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CycliST基准,通过合成视频评估视频语言模型对循环状态转换的文本推理能力,揭示现有模型在检测循环模式、时间理解和定量分析方面的局限。
Comments Published in the Journal of Data-centric Machine Learning Research (DMLR); https://openreview.net/forum?id=l03g53HUL2
Journal ref Journal of Data-centric Machine Learning Research, 2026
基于思维图的奖励进化:一种用于强化学习的双层语言模型框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Tokyo(东京大学)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);visual language model(abstract)
AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。
Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)
3DCodeBench:通过代码进行智能体程序化3D建模的基准测试
机构 * Google DeepMind(谷歌DeepMind) ; University of Southern California(南加州大学) ; Google Research(谷歌研究)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。
Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix
EMBGuard:为具身智能体安全规划构建危险感知护栏
机构 * Independent Researcher(独立研究者) ; Department of Biomedical Engineering(生物医学工程系) ; the Department of Intelligent Precision Healthcare Convergence, Sungkyunkwan University(智能精准医疗融合系,全州大学) ; Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract)
AI总结 提出首个基于MLLM的具身安全护栏EMBGuard,通过解耦物理风险推理与智能体策略,评估(视觉观察,动作)对来识别危险配置并提供自然语言解释,同时构建训练数据集EMBHazard和基准测试EMBGuardTest,在紧凑模型尺寸下达到与专有MLLM竞争的性能并降低误报率。
Comments Accepted at ICML 2026
IVR-R1:通过强化学习中的迭代视觉基础推理优化轨迹
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Kuaishou Technology(快手科技) ; Shenzhen Institute of Advanced Integration Technology, Shenzhen(深圳先进集成技术研究院)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出IVR-R1框架,利用奖励驱动的筛选机制和迭代再推理循环,在强化学习中动态校正多模态推理轨迹,以解决视觉幻觉和逻辑错误问题。
MedExpMem:适应经验记忆用于鉴别诊断
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MedExpMem经验记忆框架,通过存储和利用诊断失败中的判别经验,增强医学视觉语言模型的鉴别诊断能力,在放射学基准上最高提升7.0%准确率。
Comments MICCAI 2026 Early Accept. Submission Version
PRISM:在模拟的具身环境中进行规划与意图推理
机构 * A*STAR ; National University of Singapore(国立新加坡大学) ; BAAI(北京人工智能研究院)
专题命中 视觉推理 :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn)
AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。
Flame3D: 无需3D特定训练的3D场景零样本组合推理
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 Flame3D通过可组合的空间工具和训练自由框架,实现3D场景的零样本组合推理,支持动态空间合成和外部数据整合,展示了在ScanQA和Compose3D上的竞争力。
测试时匹配:在多模态模型中解锁组合推理
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出测试时匹配算法,通过改进评估指标提升多模态模型的组合推理能力,使SigLIP-B16和GPT-4.1在Winoground等基准上取得新突破。
Comments To appear at ICLR 2026; extended results to generative multimodal models
理解强化学习在多模态推理模型后训练中幻觉的作用
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Science and Technology of China(中国科学技术大学) ; Arizona State University(亚利桑那州立大学) ; Honda Research Institute, USA(本田美国研究所)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。
Comments CVPR 2026
一种用于胸部X光解读的推理增强视觉-语言基础模型
专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 CheXOne模型通过生成诊断预测和临床依据的推理轨迹,提升胸部X光解读的可解释性与准确性,在多个评估任务中表现优异。
Comments Codes: https://github.com/YBZh/CheXOne Models: https://huggingface.co/StanfordAIMI/CheXOne
Bongard-RWR+: Bongard问题中细粒度概念的现实世界表示
机构 * Warsaw University of Technology(华沙技术大学) ; AGH University of Krakow(克拉科夫AGH大学)
专题命中 视觉推理 :vision language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Bongard-RWR+数据集,通过视觉语言模型生成现实世界图像,评估VLMs在细粒度概念识别中的局限性。
Comments Accepted to The Fourteenth International Conference on Learning Representations (ICLR 2026)
无需缩放:用于细粒度多模态感知的区域到图像蒸馏
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Zhongguancun Academy(中关村学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出区域到图像蒸馏方法,通过训练时间内化代理缩放能力,提升细粒度多模态感知性能。