arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2606.09076 2026-07-15 cs.CV 版本更新 81%

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

超越标量奖励:将推理内化到分数分布中

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao, Yuming Jiang, Xiangpeng Yang, Chunle Guo, Peng Gao, Ming-Ming Cheng, Steven C. H. Hoi

机构 * Alibaba Group(阿里巴巴集团) Nankai University(南开大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 提出Z-Reward框架,通过教师-学生模型将推理型奖励内化为紧凑VLM的分数分布,实现高效且准确的文本到图像优化。

Comments Z-Image Team Technical Report. Project page: https://srameo.github.io/projects/z-reward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07361 2026-07-13 cs.CV 新提交 81%

BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning

BUS:用于高级多模态推理的受脑启发的无监督自我反思

Jiacheng Yang, Tongying Xiao, Yunkai Dang, Cong Wang, Yuekun Yang, Qi Fan, Tianyu Ding, Wenbin Li, Feng Miao, Yang Gao

机构 * AAAI Press(美国人工智能协会出版社)

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究针对VLM处理复杂视觉任务的不足,受脑启发提出BUS无监督训练框架,通过反向预测提升其反思推理能力,无需标注数据,与多种微调方法兼容,经实验验证在多任务中有效提升了VLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00461 2026-07-02 cs.CV 新提交 81%

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

非对称互变分学习实现多模态连续推理

Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型离散推理丢失感知细节及训练-推理不匹配问题,提出非对称互变分学习框架,通过双向KL散度校准先验与后验,缓解答案泄露,提升连续潜在推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10757 2026-06-23 cs.CV 版本更新 81%

CodePercept: Code-Grounded Visual STEM Perception for MLLMs

CodePercept: 基于代码的MLLM视觉STEM感知

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian Hu, Ruilin Luo, Ruize Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) Qwen Team(通义实验室) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 视觉推理 :MLLM(title_cn,abstract_cn);visual reasoning(abstract);分类 cs.CV

AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17639 2026-06-18 cs.RO cs.CV 新提交 81%

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

ERQA-Plus:具身AI推理的诊断基准

Hong Yang, Basura Fernando

机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉推理 :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出ERQA-Plus基准,包含1766个基于机器人中心图像的问答实例,覆盖感知、动作、社交、导航和常识推理,用于诊断具身AI的推理能力。

Comments under review at NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18746 2026-06-17 cs.CV 版本更新 81%

Bridging Modality Disconnect in Self-Reflection via Closed-Loop Visually Grounded Verification

通过闭环视觉基础验证弥合自我反思中的模态脱节

Haoyu Zhang, Yuwei Wu, Pengxiang Li, Xintong Zhang, Zhi Gao, Rui Gao, Mingyang Gao, Che Sun, Yunde Jia

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出MIRROR框架,通过闭环视觉反思(草稿-批评-区域验证-修订)减少VLM幻觉,并构建ReflectV数据集训练视觉基础的多轮反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07872 2026-06-09 cs.CV 新提交 81%

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?

VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?

Didi Zhu, Changrui Chen, Stefanos Zafeiriou, Jiankang Deng

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06538 2026-06-08 cs.CV 新提交 81%

WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

WorldBench: 一个具有挑战性且视觉多样的多模态推理基准

Yida Yin, Harish Krishnakumar, Chung Peng Lee, Boya Zeng, Wenhao Chai, Shengbang Tong, Wenhu Chen, Hu Xu, Xingyu Fu, Gabriel Sarch, Aleksandra Korolova, Zhuang Liu

机构 * Princeton University(普林斯顿大学) NYU(纽约大学) University of Waterloo(滑铁卢大学) Meta, FAIR(Meta和FAIR)

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出WorldBench,通过构建多领域视觉概念分类法并收集多样化图像,设计前沿MLLM难以回答的问题,以评估多模态大语言模型的视觉理解能力,揭示其弱点。

Comments Project page: https://worldbench-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08903 2026-06-08 cs.RO cs.AI 81%

3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning

面向机器人任务规划的3D grounded视觉-语言框架:自动化提示合成与监督推理

Guoqin Tang, Qingxuan Jia, Zeyuan Huang, Gang Chen, Ning Ji, Zhipeng Yao

机构 * Tsinghua University(清华大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出融合2D提示合成模块和小语言模型的框架,提升机器人3D场景理解与任务执行能力,实验显示任务成功率高达96.0%。

Journal ref Engineering Applications of Artificial Intelligence, vol. 164, p. 113268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02518 2026-06-02 cs.CV 81%

ToolFG: Towards Well-Grounded Fine-Grained Image Classification

ToolFG:面向良好基础的细粒度图像分类

Yu Xue, Haoxuan Qu, Zhuoling Li, Yihang Lou, Yan Bai, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Peking University(北京大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 提出ToolFG框架,通过MCTS引导的工具使用知识蒸馏和模型-工具协同进化机制,使MLLM自主调用外部工具获取可靠视觉线索,实现细粒度图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00963 2026-06-02 cs.CV cs.CL 81%

Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning

Reasmory: 3D重建作为VLMs空间推理的显式记忆

Jixuan He, Xueting Li, Chieh Hubert Lin, Ming-Hsuan Yang

机构 * Cornell Tech, Cornell University(康奈尔科技学院、康奈尔大学) NVIDIA(英伟达) illoca AI(illoca人工智能) The University of California, Merced(加州大学梅尔塞德斯分校)

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出Reasmory框架,通过结构化程序执行重建的3D显式记忆,并引入轻量级领域特定语言约束VLM查询和操作,在空间推理任务上提升6-18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31572 2026-06-01 cs.CV 81%

nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving

nuReasoning:面向长尾自动驾驶的推理中心数据集与基准

Zhiyu Huang, Johnson Liu, Rui Song, Zewei Zhou, Ruining Yang, Yun Zhang, Tianhui Cai, Hanyin Zhang, Mingxuan Gao, Valeria Xu, Jiali Chen, Yishan Shen, Yiluan Guo, Tony, Qi, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Motional

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 提出nuReasoning数据集,包含2万段20秒长尾驾驶场景的推理标注,支持空间、决策和反事实推理评估,并证明推理监督可提升VLM和VLA的驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30740 2026-06-01 cs.RO cs.AI 81%

GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation

GSAM: 一种通用且安全的铰接物体操作机器人框架

Beichen Shao, Mengying Xie, Heng Su, Wanyi Zhang, Mingyan Li, Yan Ding, Fausto Giunchiglia, Chao Chen

机构 * College of Computer Science, Chongqing University, Chongqing, China(重庆大学计算机学院) Lumos Robotics, China(Lumos机器人中国) Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学) Fudan University, China(复旦大学) Department of Information Engineering and Computer Science, University of Trento, Trento, Italy(特伦托大学信息工程与计算机科学系)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 提出GSAM框架,通过视觉感知器生成运动学参数、基于VLM的细调器进行常识推理修正、交互约束函数生成器集成障碍物避免知识,并由运动学感知规划器验证轨迹可达性,在50个铰链任务上相比最佳基线将标准差降低3.1%、操作成功率提升36.0%。

Comments Accepted by the 19th International Conference on Parallel Problem Solving from Nature (PPSN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22409 2026-06-01 cs.CV 81%

SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments

SpaMEM:具身环境中通过感知-记忆集成进行动态空间推理的基准测试

Chih-Ting Liao, Xi Xiao, Chunlei Meng, Zhangquan Chen, Yitong Qiao, Weilin Zhou, Tianyang Wang, Xu Zheng, Xin Cao

机构 * The University of New South Wales(新南威尔士大学) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Xinjiang University(新疆大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉推理 :VLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SpaMEM基准,通过动作条件场景变换和多模态数据,分层评估多模态大模型在具身环境中的空间信念演化能力,揭示坐标一致性和视觉记忆瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI 81%

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06869 2026-05-14 cs.AI 81%

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

Agentick: 一个统一的连续决策制定代理基准测试

Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10564 2026-05-12 cs.CV cs.RO 81%

DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving

DeepSight: 通过潜在状态预测实现长视距世界建模的端到端自动驾驶

Lingjun Zhang, Changjie Wu, Linzhe Shi, Jiangyang Li, Jiaxin Liu, Lei Yang, Hang Zhang, Mu Xu, Hong Wang

机构 * Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团Amap) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出通过鸟瞰图空间预测连续未来帧的潜在语义特征,实现长视距世界建模,并引入高效适应性文本推理机制提升复杂场景下的驾驶性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09269 2026-05-12 cs.CL cs.CV 81%

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模

Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文元) University of Maryland, College Park(马里兰大学 College Park 分校) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19974 2026-05-11 cs.CV 81%

RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection

基于内在反思的生成式空间推理器:RL-RIG

Tianyu Wang, Zhiyuan Ma, Qian Wang, Xinyi Zhang, Xinwei Long, Bowen Zhou

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 RL-RIG通过生成-反思-编辑范式,提升图像生成的精细空间关系捕捉能力,采用Scene Graph IoU和VLM评估策略,在空间一致性上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01278 2026-05-05 cs.AI 81%

Valley3: Scaling Omni Foundation Models for E-commerce

Valley3:面向电商的多模态大语言模型规模化

Zeyu Chen, Guanghao Zhou, Qixiang Yin, Ziwang Zhao, Huanjin Yao, Pengjiu Xia, Min Yang, Cen Chen, Minghui Qiu

机构 * Valley Team, ByteDance Group(字节跳动集团山谷团队)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Valley3通过四阶段预训练管道,融合多模态能力与电商知识,实现跨模态指令跟随和长链推理,构建了涵盖6个任务的电商基准测试,展现出在电商场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19105 2026-04-22 cs.CV 81%

EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation

视角运动:层次推理与扩散用于中心视觉-语言运动生成

Ruibing Hou, Mingyue Zhou, Yuwei Gui, Mingshuang Luo, Bingpeng Ma, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)) Jilin University (JLU)(吉林大学(JLU)) Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学(BUPT)) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出EgoMotion框架,通过层次推理和扩散模型生成基于第一视角视觉和语言指令的3D人类运动,解决语义推理与运动建模的协同优化问题,提升多模态接地和运动质量。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14799 2026-04-17 cs.CL cs.CV 81%

Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

在何时不回答:评估多模态推理系统中的退避

Nishanth Madhusudhan, Vikas Yadav, Alexandre Lacoste

机构 * ServiceNow Research(ServiceNow研究院)

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出MM-AQA基准,通过视觉模态依赖性和证据充分性变换生成不可回答实例,评估三种前沿VLM和两种MAS架构,发现VLM在标准提示下 rarely 退避,MAS提升退避但引入准确率-退避权衡,序列设计表现优异,表明退避意识训练比提示或更多代理更重要。

Comments 10 pages and 4 figures (excluding appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00867 2026-04-02 cs.CV 81%

A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video

一种用于无训练代理推理的4D表示

Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmoteit, Benjamin D. Killeen, Christian Heiliger, Nassir Navab

机构 * Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所) Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出一种基于显式4D表示的框架,利用多模态大语言模型实现无训练的手术代理推理,提升时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26330 2025-10-01 cs.CV cs.IR 81%

SQUARE: Semantic Query-Augmented Fusion and Efficient Batch Reranking for Training-free Zero-Shot Composed Image Retrieval

Ren-Di Wu, Yu-Yen Lin, Huei-Fang Yang

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21745 2025-08-08 cs.CV 81%

Few-Shot Vision-Language Reasoning for Satellite Imagery via Verifiable Rewards

Aybora Koksal, A. Aydin Alatan

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

Comments ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL). 10 pages, 3 figures, 6 tables. Our model, training code and dataset will be at https://github.com/aybora/FewShotReasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10042 2025-06-05 cs.CV 81%

EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability

Ziyue Wang, Yurui Dong, Fuwen Luo, Minyuan Ruan, Zhili Cheng, Chi Chen, Peng Li, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Management, Fudan University, Shanghai, China(管理学院,复旦大学,上海,中国)

专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22282 2026-08-14 cs.CV cs.AI cs.CL 版本更新 81%

CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning

CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架

Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。

Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11655 2026-08-13 cs.CV cs.AI 新提交 81%

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力

Xikai Sun, Kebin Liu, Haotian Wang, Li Liu, Xu Wang, Yunhao Liu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03922 2026-08-12 cs.CL cs.AI cs.CV 版本更新 81%

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试

Zhaolu Kang, Junhao Gong, Jiaxu Yan, Wanke Xia, Yian Wang, Ziwen Wang, Huaxuan Ding, Zhuo Cheng, Wenhao Cao, Zhiyuan Feng, Siqi He, Shannan Yan, Junzhe Chen, Xiaomin He, Chaoya Jiang, Wei Ye, Kaidong Yu, Xuelong Li

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) University of British Columbia(不列颠哥伦比亚大学) Renmin University of China(中国人民大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。

Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07581 2026-08-11 cs.CV cs.AI 新提交 81%

Multi-Branch Policy Optimization for Multimodal Large Language Models

面向多模态大语言模型的多分支策略优化

Shuai Lyu, Yuning Gong, Ruiling Gao, Xiaoran Shang, Zhonghong Ou, Ping Zong, Yifan Zhu, Yuan Sun, Yang Qin, Peng Hu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Sichuan University(四川大学) Shanghai University(上海大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型统一信用分配的缺陷,提出MBPO框架,通过树结构与分支相对优势分配信用,结合时间回放缓冲区提升性能,在多模态推理基准上优于基线。

Comments 10 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏