arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-24 至 2026-03-24 共收录 92 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 12 篇

2512.03794 2026-03-24 cs.CV cs.AI cs.CL cs.LG 87%

AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition

AdaptVision: 通过自适应视觉获取实现高效的视觉-语言模型

Zichuan Lin, Yicheng Liu, Yang Yang, Lvfang Tao, Deheng Ye

机构 * Tencent Hunyuan(腾讯文言)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 AdaptVision通过自适应视觉获取机制,结合强化学习与工具学习,提升视觉-语言模型在视觉问答任务中的效率与准确性。

Comments Accepted by CVPR 2026. Code and models are available at https://github.com/AdaptVision/AdaptVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06638 2026-03-24 cs.CV cs.AI 86%

StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering

StaR-KVQA:用于隐式知识视觉问答的结构化推理轨迹

Zhihao Wen, Wenkang Wei, Yuan Fang, Xingtong Yu, Hui Zhang, Weicheng Zhu, Xin Zhang

机构 * Ant International, Ant Group(蚂蚁集团国际部,蚂蚁集团) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院) Anhui Provincial Key Laboratory of High Performance Computing(安徽省高性能计算重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 StaR-KVQA通过引入双路径结构化推理轨迹提升隐式知识视觉问答的准确性与推理透明度,采用自蒸馏方法构建轨迹增强数据集,无需外部检索工具,在OK-VQA基准上实现11.3%的精度提升。

Comments 8+3+3 pages, code: https://github.com/jianyingzhihe/StaR-KVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21701 2026-03-24 cs.CV cs.AI 84%

Rethinking Token Reduction for Large Vision-Language Models

重新思考大型视觉-语言模型中的标记缩减

Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) School of Software Technology, Zhejiang University(浙江大学软件学院) National University of Singapore(新加坡国立大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MetaCompress,一种基于学习的无提示方法,解决多轮视觉问答中标记缩减的挑战,通过统一压缩映射提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17292 2026-03-24 cs.CV cs.LG 81%

TPCL: Task Progressive Curriculum Learning for Robust Visual Question Answering

TPCL:面向鲁棒视觉问答的任务渐进课程学习

Ahmed Akl, Abdelwahed Khamis, Zhe Wang, Ali Cheraghian, Sara Khalifa, Kewen Wang

机构 * School of Information and Communication Technology(信息与通信技术学院) Data61, CSIRO Australia(Data61,澳大利亚联邦科学与工业研究组织) School of Information Systems(信息系统学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出TPCL框架,通过渐进式课程学习提升视觉问答在分布偏移、低数据等场景下的鲁棒性,取得SOTA性能。

Comments Our source code is available at https://github.com/AhmedAAkl/tpcl

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11404 2026-03-24 cs.CV cs.AI 73%

Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner

Patho-R1: 基于多模态强化学习的病理专家推理器

Wenchuan Zhang, Penghao Zhang, Jingru Guo, Tao Cheng, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu

机构 * Department of Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科部门) Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院临床病理科研究所) University of Toronto(多伦多大学) Business School, Sichuan University(四川大学商学院) Department of Pathology, Shengjing Hospital of China Medical University(中国医科大学盛京医院病理科部门)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Patho-R1,通过构建高质量推理导向数据集,结合三阶段训练流程提升病理推理能力,实现跨模态任务的鲁棒性能。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(33): 28418-28426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05959 2026-03-24 cs.CL cs.AI cs.CV 73%

M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG

M4-RAG:大规模多语言多文化多模态检索增强生成

David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata

机构 * Stanford University(斯坦福大学) MBZUAI Indian Institute of Science(印度科学研究院) Ontario Tech University(安大略技术大学) University of Toronto(多伦多大学) Capital One

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 M4-RAG提出一个覆盖42种语言、56种方言和189个国家的多模态大规模基准,通过构建8万多个文化多样化的图像-问题对,评估跨语言和模态的检索增强视觉问答性能,揭示模型大小与检索效果的不匹配问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02258 2026-03-24 cs.CV 70%

Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning

病理代理RAG:通过强化学习实现多模态代理检索增强生成用于病理学视觉语言模型

Wenchuan Zhang, Jingru Guo, Hengzhe Zhang, Penghao Zhang, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出Patho-AgenticRAG,通过强化学习实现多模态代理检索增强生成,解决病理学视觉语言模型在高分辨率、复杂组织结构和临床语义上的挑战,提升诊断准确性。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(35): 29921-29929, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV 70%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10744 2026-03-24 cs.AI cs.CV 62%

Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration

探索与长期记忆:一个基准和基于多模态LLM的强化学习框架用于具身探索

Sen Wang, Bangwei Liu, Zhenkun Gao, Lizhuang Ma, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMEE框架,通过多模态LLM强化学习促进终身学习,构建LMEE-Bench基准评估具身探索过程与结果,采用MemoryExplorer方法提升记忆检索与主动探索能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21925 2026-03-24 cs.AI 57%

Guideline-grounded retrieval-augmented generation for ophthalmic clinical decision support

基于指南的检索增强生成用于眼科临床决策支持

Shuying Chen, Sen Cui, Zhong Cao

机构 * University of International Business and Economics(国际商务经济大学) Tsinghua University(清华大学) Heidelberg Institute of Global Health(海德堡全球健康研究院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出Oph-Guid-RAG系统,通过多模态视觉RAG方法提升眼科临床问答与决策支持,通过可控检索框架和多模态推理提升证据基础和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21660 2026-03-24 cs.CV 57%

OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imaging

OmniFM:迈向模态鲁棒且任务无关的联邦学习 for 异质医学影像

Meilin Liu, Jiaying Wang, Jing Shan

机构 * School of Software, Shenyang University of Technology(沈阳理工大学软件学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 OmniFM提出一种统一训练分类、分割、超分辨率、视觉问答和多模态融合的联邦学习框架,通过频域洞察提升跨模态一致性,实现任务无关和模态鲁棒的联邦学习。

Comments Accepted by CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02845 2026-03-24 cs.CV 57%

Go Beyond Earth: Understanding Human Actions and Scenes in Microgravity Environments

超越地球:理解微重力环境中的人类行为与场景

Di Wen, Lei Qi, Kunyu Peng, Kailun Yang, Fei Teng, Ao Luo, Jia Fu, Yufan Chen, Ruiping Liu, Yitian Shi, M. Saquib Sarfraz, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄大学,德国) Hunan University, China(湖南大学,中国) INSAIT, Sofia University, Bulgaria(INSAIT,索菲亚大学,保加利亚) Waseda University, Japan(早稻田大学,日本) KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院,瑞典) RISE Research Institutes of Sweden, Sweden(瑞典RISE研究机构,瑞典)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出MicroG-4M数据集,用于微重力环境下的人类行为和场景理解,包含50种动作、1238个丰富描述和7000多个问答对,支持动作识别、视频captioning和视觉问答任务。

Comments 16 pages, 4 figures, code are available at https://github.com/LEI-QI-233/HAR-in-Space

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 17 篇

2603.20808 2026-03-24 cs.CV cs.LG 84%

Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models

预测正则化对抗多模态大语言模型中的视觉表征退化

Enguang Wang, Qiang Wang, Yuanchen Wu, Ke Yan, Xinbin Yuan, Shouhong Ding, Xialei Liu, Ming-Ming Cheng

机构 * NKIARI VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) AAIS, Nankai University(AAIS,南开大学) Tencent Youtu Lab(腾讯优设实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文研究多模态大语言模型中的视觉表征退化问题,提出预测正则化方法以维持视觉表征,提升视觉语言性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20662 2026-03-24 cs.AI cs.CV 84%

Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning

空间中的注意:VLM头部在空间推理中的功能角色

Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu, Jiayang Ao, Xingjun Ma, Sarah Monazam Erfani, James Bailey

机构 * The University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学) Fudan University(复旦大学) Monash University(莫纳什大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01547 2026-03-24 cs.CV cs.AI cs.LG 82%

Vision-language models lag human performance on physical dynamics and intent reasoning

视觉-语言模型在物理动态和意图推理上仍逊于人类表现

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Agder(阿格德大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20275 2026-03-24 cs.CV cs.AI 81%

Understanding Pruning Regimes in Vision-Language Models Through Domain-Aware Layer Selection

通过领域感知的层选择理解视觉-语言模型中的剪枝规则

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究通过领域感知激活相似性分析,揭示视觉-语言模型中不同剪枝预算下层移除对性能的影响,发现三种剪枝规则:低预算下性能敏感,中预算下结构损伤累积,高预算下结构连续性主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22179 2026-03-24 cs.AI 79%

MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management

MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型

Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley

机构 * Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系) Bakar Institute, UCSF(Bakar研究所,旧金山大学) UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划) Department of Radiology, Stanford University(斯坦福大学放射学系) Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biology, Stanford University(斯坦福大学生物学系)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 MARCUS通过多模态视觉-语言模型实现心电图、超声和心脏磁共振成像的端到端解读,其多代理架构在心脏诊断中表现出优于前沿模型的准确率和自由文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21577 2026-03-24 cs.AI 74%

Mind over Space: Can Multimodal Large Language Models Mentally Navigate?

心灵超越空间:多模态大语言模型能否进行心理导航?

Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) college of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.AI

AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09935 2026-03-24 cs.CV 70%

LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning

LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示

Jiangyong Huang, Xiaojian Ma, Xiongkun Linghu, Junchao He, Qing Li, Song-Chun Zhu, Yixin Chen, Baoxiong Jia, Siyuan Huang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。

Comments Project page: https://leo-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20894 2026-03-24 cs.MM 67%

AcoustEmo: Open-Vocabulary Emotion Reasoning via Utterance-Aware Acoustic Q-Former

AcoustEmo:通过语句感知的声学Q-Former实现开放词汇情绪推理

Liyun Zhang, Xuanmeng Sha, Shuqiong Wu, Fengkai Liu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 AcoustEmo通过引入语句感知的声学Q-Former,利用时间同步滑动窗口提取段级音频token,提升复杂情绪推理能力,在EMER任务中优于基线模型。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 62%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22091 2026-03-24 cs.CV 57%

P-Flow: Prompting Visual Effects Generation

P-Flow:提示视觉效果生成

Rui Zhao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 P-Flow通过测试时提示优化,基于参考视频与生成输出的视觉效果差异,迭代改进提示,实现高保真且多样化的动态视觉效果定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21559 2026-03-24 cs.CV 57%

Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning

重新审视通过配对亲和学习的弱监督视频场景图生成

Minseok Kang, Minhyeok Lee, Minjung Kim, Jungho Lee, Donghyeong Kim, Sungmin Woo, Inseok Jeon, Sangyoun Lee

机构 * Yonsei University(延世大学) LG Electronics(LG电子)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文通过引入可学习的配对亲和力,改进弱监督视频场景图生成,利用配对亲和学习和调节,提升关系模型的准确性,实验表明在Action Genome上取得最优性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05162 2026-03-24 cs.GR cs.CV 57%

GenAI-DrawIO-Creator: A Framework for Automated Diagram Generation

GenAI-DrawIO-Creator:自动化图表生成的框架

Jinze Yu, Dayuan Jiang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出GenAI-DrawIO-Creator框架,利用大语言模型实现基于XML的图表自动生成与修改,通过高级系统设计和提示工程提升XML输出质量,展示原型能从自然语言或代码生成准确图表,并通过模拟评估证明其在图表创建效率和结构精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04559 2026-03-24 cs.CV 57%

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

面向可扩展多模态推理的推理对齐感知解耦

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Cloud Project(华为云项目)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出RAPID方法,通过解耦多模态模型的感知与推理模块,利用强化学习优化感知输出,使模型能与任意强大文本推理模型配合,实现无需重新训练的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20650 2026-03-24 cs.AI cs.CY 57%

From 50% to Mastery in 3 Days: A Low-Resource SOP for Localizing Graduate-Level AI Tutors via Shadow-RAG

从50%到精通:一种低资源SOP,通过影子RAG本地化研究生级AI导师

Zonglin Yang, J. -H. Xie, Lining Zhang, Jiyou Jia, Zhi-X. Chen

机构 * School of Mechanics and Engineering Science, Peking University, Beijing, 100871, China(北京理工大学机械与工程科学学院) Readraft Intelligent Technology Co., Ltd., China(读raft智能科技有限公司) Graduate School of Education, Peking University, Beijing, 100871, China(北京大学教育学院) AI for Science Institute, Beijing, 100080, China(AI for Science研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出一种低成本SOP,利用影子RAG架构和数据清洗策略,在3人天内本地化研究生级AI导师,使32B模型性能从74%提升至90%。

Comments 9 pages, 3 figures, practitioner report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20637 2026-03-24 cs.SE cs.AI cs.CR 57%

AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing

AEGIS:从线索到结论——通过辩证法和元审计的图引导深度漏洞推理

Sen Fang, Weiyuan Ding, Zhezhen Cao, Zhou Yang, Bowen Xu

机构 * NC State University(北卡罗来纳州立大学) University of Alberta(阿尔伯塔大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 AEGIS通过图引导的深度漏洞推理,结合辩证法和元审计,解决LLM推理不严谨的问题,实现从线索到结论的验证,提升漏洞检测的准确性与可靠性。

Comments 29 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11026 2026-03-24 cs.CV 57%

GIR-Bench: Versatile Benchmark for Generating Images with Reasoning

GIR-Bench:用于生成图像的多功能基准

Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17487 2026-03-24 cs.CV 57%

Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models

智能下放:探索小型多模态模型中感知与推理的瓶颈

Mark Endo, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文研究小型多模态模型中感知与推理能力的瓶颈,通过分析LLM容量下降对多模态能力的影响,提出视觉提取调优方法,提升效率与性能。

Comments CVPR 2026, website at https://web.stanford.edu/~markendo/projects/downscaling_intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 27 篇

2406.01914 2026-03-24 cs.CV cs.AI cs.CL 90%

HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task

HPE-CogVLM: 通过头部姿态接地任务提升视觉语言模型

Yu Tian, Tianqi Shao, Tsukasa Demizu, Xuyang Wu, Hsin-Tai Wu

机构 * Docomo Innovations, Inc.(Docomo创新公司) Department of Computer Science and Engineering, Santa Clara University(圣克拉拉大学计算机科学与工程系)

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HPE-CogVLM框架,利用VLM的物体检测能力提升头部姿态估计精度,通过改进的LoRA层合并方法,有效解决融合任务中的响应格式问题,实现优于现有方法的性能。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2026. This version includes major updates in methodology and experiments. The final version is available at IEEE Xplore

Journal ref IEEE Transactions on Circuits and Systems for Video Technology, Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏