机构
*
Ant International, Ant Group(蚂蚁集团国际部,蚂蚁集团)
;
School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
;
School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院)
;
Anhui Provincial Key Laboratory of High Performance Computing(安徽省高性能计算重点实验室)
专题命中
视觉问答
:visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Rethinking Token Reduction for Large Vision-Language Models
重新思考大型视觉-语言模型中的标记缩减
Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)
;
Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
;
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
National University of Singapore(新加坡国立大学)
;
Alibaba Group(阿里巴巴集团)
TPCL: Task Progressive Curriculum Learning for Robust Visual Question Answering
TPCL:面向鲁棒视觉问答的任务渐进课程学习
Ahmed Akl, Abdelwahed Khamis, Zhe Wang, Ali Cheraghian, Sara Khalifa, Kewen Wang
机构
*
School of Information and Communication Technology(信息与通信技术学院)
;
Data61, CSIRO Australia(Data61,澳大利亚联邦科学与工业研究组织)
;
School of Information Systems(信息系统学院)
Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner
Patho-R1: 基于多模态强化学习的病理专家推理器
Wenchuan Zhang, Penghao Zhang, Jingru Guo, Tao Cheng, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu
机构
*
Department of Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科部门)
;
Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院临床病理科研究所)
;
University of Toronto(多伦多大学)
;
Business School, Sichuan University(四川大学商学院)
;
Department of Pathology, Shengjing Hospital of China Medical University(中国医科大学盛京医院病理科部门)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
M4-RAG:大规模多语言多文化多模态检索增强生成
David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata
机构
*
Stanford University(斯坦福大学)
;
MBZUAI
;
Indian Institute of Science(印度科学研究院)
;
Ontario Tech University(安大略技术大学)
;
University of Toronto(多伦多大学)
;
Capital One
Go Beyond Earth: Understanding Human Actions and Scenes in Microgravity Environments
超越地球:理解微重力环境中的人类行为与场景
Di Wen, Lei Qi, Kunyu Peng, Kailun Yang, Fei Teng, Ao Luo, Jia Fu, Yufan Chen, Ruiping Liu, Yitian Shi, M. Saquib Sarfraz, Rainer Stiefelhagen
机构
*
Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄大学,德国)
;
Hunan University, China(湖南大学,中国)
;
INSAIT, Sofia University, Bulgaria(INSAIT,索菲亚大学,保加利亚)
;
Waseda University, Japan(早稻田大学,日本)
;
KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院,瑞典)
;
RISE Research Institutes of Sweden, Sweden(瑞典RISE研究机构,瑞典)
机构
*
East China Normal University(东华大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
University of Agder(阿格德大学)
MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management
MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型
Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley
机构
*
Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系)
;
Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系)
;
Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系)
;
Bakar Institute, UCSF(Bakar研究所,旧金山大学)
;
UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划)
;
Department of Radiology, Stanford University(斯坦福大学放射学系)
;
Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系)
;
Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
;
Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)
;
Department of Biology, Stanford University(斯坦福大学生物学系)
Mind over Space: Can Multimodal Large Language Models Mentally Navigate?
心灵超越空间:多模态大语言模型能否进行心理导航?
Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei
机构
*
Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)
;
Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系)
;
School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院)
;
college of AI, Tsinghua University(清华大学人工智能学院)
;
Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)
专题命中
视觉推理
:multimodal large language model(title);分类 cs.AI
机构
*
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
;
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
Department of Automation, Tsinghua University(清华大学自动化系)
Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
面向可扩展多模态推理的推理对齐感知解耦
Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang
机构
*
Southern University of Science and Technology(南方科技大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Huawei Cloud Project(华为云项目)
机构
*
School of Mechanics and Engineering Science, Peking University, Beijing, 100871, China(北京理工大学机械与工程科学学院)
;
Readraft Intelligent Technology Co., Ltd., China(读raft智能科技有限公司)
;
Graduate School of Education, Peking University, Beijing, 100871, China(北京大学教育学院)
;
AI for Science Institute, Beijing, 100080, China(AI for Science研究院)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
GIR-Bench:用于生成图像的多功能基准
Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Peking University(北京大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Xiaohongshu Inc.(小红书公司)
CommentsAccepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2026. This version includes major updates in methodology and experiments. The final version is available at IEEE Xplore
Journal refIEEE Transactions on Circuits and Systems for Video Technology, Early Access, 2026