Improve Vision Language Model Chain-of-thought Reasoning
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 10 pages + appendix
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 10 pages + appendix
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments accepted to IEEE Transactions on Big Data. Project Page: http://lvlm-ehub.opengvlab.com/
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments 5 pages
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments link: https://hf.co/spaces/WildVision/vision-arena
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.LG
Comments NAACL 2024 Main Conference. The data is released at https://github.com/Yangyi-Chen/CoTConsistency
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
Comments Presented at International Conference on Learning Representations (ICLR) 2024
专题命中 视觉推理 :vision language model(title);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Accepted to DMLR @ ICLR 2024
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Data and results are available at: https://github.com/EternityYW/Gemini-Commonsense-Evaluation/
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments to appear in EMNLP 2018
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG
视觉语言模型后训练中推理与感知的非对称优化研究
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV;VLM(comments)
AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。
Comments Project: https://asymmetric-vlm-post-training.github.io/
多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计
机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.LG;VLM(comments)
AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。
Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning
视觉-语言模型在位置披露中是否尊重上下文完整性?
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.AI
AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。
Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench
APIVOT:具有交错视觉语言思维的自适应规划
机构 * Stanford University(斯坦福大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。
Comments Project Page: https://emilyzjin.github.io/projects/apivot.html
空间思考者:通过密集奖励强化场景图基础的空间推理
机构 * University of Oxford(牛津大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。
Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)
ReSiReg:面向语言条件机器人任务的空间一致语义
机构 * Graz University of Technology, Institute of Software Engineering and Artificial Intelligence(格拉茨技术大学,软件工程与人工智能研究所) ; University of Applied Sciences Technikum Wien, Department of Industrial Engineering(维也纳应用科技大学,工业工程系) ; University of Alicante, Department of Computer Technology(阿利坎特大学,计算机技术系) ; University of Natural Resources and Life Sciences, Institute for Integrative Nature Conservation Research(自然资源与生命科学大学,整合自然保护研究 institute)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 提出ReSiReg方法,通过重构空间一致的VLM中间特征,改善密集语言接地检索,在OVSS和3D映射中提升空间一致性,并发布紧凑的25M参数VLM模型。
PLanAR:面向机器人操作的规划语言基础智能推理
机构 * Purdue University(普渡大学) ; Istituto Italiano di Tecnologia(意大利理工研究院)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 提出PLanAR框架,通过规划语言接口定义VLM推理空间,实现开放词汇的长时域机器人操作,并支持逐步验证与重规划。
Comments New version with updated framing, contributions, experiments, and figures
IPR-1:交互式物理推理器
机构 * CARNEGIE MELLON UNIVERSITY(卡内基梅隆大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出IPR模型,通过世界模型滚动评分和强化VLM策略,结合物理中心动作代码PhysCode,在1000+异构游戏基准上实现鲁棒的物理推理,性能超越GPT-5并零样本迁移至未见游戏。
Comments Accepted by CVPR 2026. 13 pages of main text and 20 pages of appendices. Project page: https://mybearyzhang.github.io/ipr-1
PhyGround:用于生成世界模型中物理推理的基准测试
机构 * Northeastern University(东北大学) ; Tulane University(路易斯安那州立大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。
Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/
ESARBench: 一种用于代理无人机体感知搜索与救援的基准
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract)
AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。
Comments 20 pages, 7 figures
SYMBOLIZER:基于VLMs的符号模型无关任务规划
机构 * RWTH Aachen(亚琛理工大学) ; University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究院)
专题命中 视觉推理 :VLM(summary_cn,abstract);visual language model(abstract)
AI总结 本文提出SYMBOLIZER框架,利用VLMs将图像转化为符号状态,结合启发式搜索实现跨领域任务规划,优于直接VLM规划并可与基于启发式的传统方法媲美。
Comments under review
HoloLLM:面向语言基础的人感知与推理的多感官基础模型
机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。
Comments Camera-ready version. Accepted at NeurIPS 2025
ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别
专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。
Comments 10 pages, 7 figures
LongEarth-R1:用于长时序地球观测推理的视觉语言模型基准测试与对齐
专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI
AI总结 该研究推出长时序地球观测推理基准LongEarth-Bench,开发LongEarth-R1模型,在全部12项长序列遥感推理任务中表现最优,同时在标准遥感基准上保持竞争力。
TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理
专题命中 视觉推理 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。
Comments Project Page: https://whynotgit2025.github.io/TennisVAR/