Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
通过文本表示引导推理来解锁多模态大语言模型中的空间推理
Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu
机构
*
College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
;
The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)
Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder
更少的协同,更好的表现:通过条件和降质掩码自编码器解决异质多模态图像联合预训练
Bowen Peng, Yongxiang Liu, Jie Zhou, Xiaodong Chen, Tianpeng Liu, Xiaogang Yu, Li Liu
机构
*
College of Electronic Science and Technology, National University of Defense Technology (NUDT)(电子科学与技术学院,国防科技大学)
;
Beijing Institute of Remote Sensing Information(遥感信息研究所)
Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis
增强后再平衡模态协作用于鲁棒多模态情感分析
Kang He, Yuzhe Ding, Xinrong Wang, Fei Li, Chong Teng, Donghong Ji
机构
*
Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门与可信计算教育部重点实验室,网络安全科学与工程学院,武汉大学)
机构
*
School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院)
;
School of Software, Tsinghua University, Beijing, China(清华大学软件学院)
;
School of Information Resource Management, Renmin University of China,Beijing, China(中国人民大学信息资源管理学院)
;
School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院)
;
Baidu Inc., Beijing, China(百度公司)
Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization
针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化
Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang
机构
*
Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡)
;
School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡)
;
College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)
;
DSO National Laboratories, Singapore(新加坡国防科学实验室)
MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning
MaLoRA:基于关键空间对齐的门控模态LoRA
Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Institute for Clarity in Documentation(文档清晰研究所)
;
Inria Paris-Rocquencourt(巴黎-鲁维尔研究所)
;
Rajiv Gandhi University(拉贾·甘地大学)
;
Palmer Research Laboratories(帕勒实验室)
CommentsAccepted at the IEEE Engineering in Medicine and Biology Society Annual International Conference (Proceedings of the 48th International Conference), 2026
ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning
ReFineVLA: 通过教师引导微调实现多模态推理感知的通用机器人策略
Tuan Van Vo, Tan Q. Nguyen, Khang Nguyen, Nhat Xuan Tran, Duy H. M. Nguyen, An T. Le, Ngo Anh Vien, Minh Nhat Vu
机构
*
VinRobotics
;
University of Texas at Arlington(德克萨斯大学阿灵顿分校)
;
Max Planck Research School for Intelligent Systems (IMPRS-IS)(智能系统Max Planck研究学校)
;
Intelligent Autonomous Systems Lab(智能自主系统实验室)
;
TU Darmstadt(德累斯顿技术大学)
;
Automation & Control Institute(自动化与控制研究所)
;
TU Wien(维也纳技术大学)
;
Austrian Institute of Technology (AIT)(奥地利技术研究所)
Rethinking Cross-Modal Fine-Tuning: Optimizing the Interaction Between Feature Alignment and Target Fitting
重新思考跨模态微调:优化特征对齐与目标拟合之间的交互
Trong Khiem Tran, Manh Cuong Dao, Phi Le Nguyen, Thao Nguyen Truong, Trong Nghia Hoang
机构
*
Washington State University(华盛顿州立大学)
;
National University of Singapore(新加坡国立大学)
;
National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)
;
Hanoi University of Science and Technology(河内科学技术大学)
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
ZTE Corporation(中兴通讯)
;
School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
;
School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院)
;
School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)
机构
*
National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学)
;
School of Computer Science, Peking University(北京大学计算机学院)
;
PKU-CMCC(Hubei) Joint Research Lab for LLM Industrial Applications(北京大学-CMCC(湖北)大语言模型工业应用联合实验室)
;
School of Health Sciences and Biomedical Engineering, Hebei University of Technology(河北工业大学健康科学与生物医学工程学院)
Frequency-Decomposed INR for NIR-Assisted Low-Light RGB Image Denoising
频域分解的隐式神经表示用于近红外辅助低光照RGB图像去噪
Ligen Shi, Zengyu Pang, Chang Liu, Shuchen Sun, Jun Qiu
机构
*
College of Computer Science (College of Software), Inner Mongolia University, Hohhot, 010021, China(内蒙古大学计算机学院(软件学院))
;
School of Mathematics and Statistics, Wuhan University, Wuhan, 430072, China(武汉大学数学与统计学院)
;
Institute of Computational Imaging, Beijing Information Science and Technology University, Beijing 102206, China(北京信息科技大学计算成像研究院)
mlr3torch: A Deep Learning Framework in R based on mlr3 and torch
mlr3torch: 基于mlr3和torch的深度学习框架
Sebastian Fischer, Lukas Burk, Carson Zhang, Bernd Bischl, Martin Binder
机构
*
LMU Munich(慕尼黑莱布尼茨大学)
;
MCML(预防研究与流行病学研究所)
;
Leibniz Institute for Prevention Research and Epidemiology - BIPS(预防研究与流行病学研究所)
;
University of Bremen(布伦瑞大学)