arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 192 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 25 篇

2604.16657 2026-04-21 cs.LG cs.AI 88%

Cross-Modal Bayesian Low-Rank Adaptation for Uncertainty-Aware Multimodal Learning

跨模态贝叶斯低秩适应用于不确定性感知的多模态学习

Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin

机构 * Dalhousie University(达尔豪斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出CALIBER框架,通过跨模态注意力机制实现多模态不确定性感知的参数高效微调,实验表明其在文本和音频模型上均优于传统基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23404 2026-04-21 cs.CV cs.CL 86%

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning

通过文本表示引导推理来解锁多模态大语言模型中的空间推理

Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu

机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。

Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16462 2026-04-21 cs.CV cs.AI 86%

From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration

从继承到饱和:解构视觉冗余的演化以实现架构感知的MLLM推理加速

Jiaqi Shi, Yuechan Li, Xulong Zhang, Xiaoyang Qu, Jianzong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HalfV框架,通过统一剪枝策略缓解内在视觉冗余,并根据具体表现适应性处理二次饱和冗余,实现跨架构的高效推理。

Comments 16 pages, 14 figures, plus appendix, accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17087 2026-04-21 cs.CV cs.LG 85%

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

EvoComp: 通过语义引导的进化标注学习多模态大语言模型的视觉令牌压缩

Jiafei Song, Fengwei Zhou, Jin Qu, Wenjin Jason Li, Tong Wu, Gengjian Xue, Zhikang Zhao, Daomin Wei, Yichao Lu, Bailin Na

机构 * OPPO CTG

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出EvoComp框架,通过语义引导的进化标注策略,有效压缩视觉令牌数量,同时保持任务精度,实验显示在3倍压缩下保持99.3%的准确率,并在移动设备上提升1.6倍速度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16952 2026-04-21 cs.CV 85%

Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder

更少的协同,更好的表现:通过条件和降质掩码自编码器解决异质多模态图像联合预训练

Bowen Peng, Yongxiang Liu, Jie Zhou, Xiaodong Chen, Tianpeng Liu, Xiaogang Yu, Li Liu

机构 * College of Electronic Science and Technology, National University of Defense Technology (NUDT)(电子科学与技术学院,国防科技大学) Beijing Institute of Remote Sensing Information(遥感信息研究所)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CoDe-MAE,通过Optical-anchored Knowledge Distillation和Conditioned Contrastive Learning解决高分辨率多模态联合预训练中的异质性-分辨率悖论,有效防止表示退化并在多个下游任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12518 2026-04-21 cs.CL 83%

Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis

增强后再平衡模态协作用于鲁棒多模态情感分析

Kang He, Yuzhe Ding, Xinrong Wang, Fei Li, Chong Teng, Donghong Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门与可信计算教育部重点实验室,网络安全科学与工程学院,武汉大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出EBMC框架,通过语义解耦和跨模态增强提升表示质量,结合能量引导模态协调机制和实例感知模态信任蒸馏,解决多模态情感分析中的模态不平衡问题,实验显示其在缺失模态情况下表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16943 2026-04-21 cs.CL 83%

MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

MNAFT:多模态大语言模型的模态神经感知微调用于图像翻译

Bo Li, Ningyuan Deng, Tianyu Dong, Shaobo Wang, Shaolin Zhu, Lijie Wen

机构 * School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院) School of Software, Tsinghua University, Beijing, China(清华大学软件学院) School of Information Resource Management, Renmin University of China,Beijing, China(中国人民大学信息资源管理学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Baidu Inc., Beijing, China(百度公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MNAFT,通过识别视觉和语言模块中语言无关和语言特定的神经元,改进多模态大语言模型在图像翻译中的表现,实验表明其优于现有方法。

Comments Accepted by SCIS (SCIENCE CHINA Information Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23179 2026-04-21 cs.AI 81%

Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization

针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) DSO National Laboratories, Singapore(新加坡国防科学实验室)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出MCRMO-Attack,通过多作物聚合与注意力引导裁剪稳定监督,通过对齐性门控令牌路由提升token级可靠性,并元学习跨目标扰动先验,从而在商业MLLM上提升未见图像攻击成功率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26721 2026-04-21 cs.AI cs.MM 81%

MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning

MaLoRA:基于关键空间对齐的门控模态LoRA

Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang

机构 * University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-鲁维尔研究所) Rajiv Gandhi University(拉贾·甘地大学) Palmer Research Laboratories(帕勒实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 本文提出MaLoRA,通过门控机制对齐多模态LLM微调中的关键空间,揭示文本偏见源于注意力键空间内在不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17274 2026-04-21 cs.CV cs.AI 81%

Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

本能与反思:统一令牌和 verbalized 自信在多模态大模型中

Yunkai Dang, Yifan Jiang, Yizhu Jiang, Anqi Chen, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究多模态大模型响应自信估计的本能-反思不一致问题,提出融合框架和均值对齐方法,提升校准和失败预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17209 2026-04-21 cs.CV cs.AI eess.SP 81%

DREAM: Dynamic Retinal Enhancement with Adaptive Multi-modal Fusion for Expert Precision Medical Report Generation

DREAM:动态视网膜增强与自适应多模态融合用于专家精准医疗报告生成

Nagur Shareef Shaik, Teja Krishna Cherukuri, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 DREAM通过动态多模态融合提升视网膜图像医疗报告生成精度,在数据有限时仍能生成高质量报告,实现BLEU-4 0.241的SOTA表现。

Comments Accepted at the IEEE Engineering in Medicine and Biology Society Annual International Conference (Proceedings of the 48th International Conference), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09474 2026-04-21 cs.CL cs.AI 81%

Multimodal Policy Internalization for Conversational Agents

多模态策略内化用于对话代理

Zhenhailong Wang, Jiateng Liu, Amin Fazel, Ritesh Sarkhel, Xing Fan, Xiang Li, Chenlei Guo, Heng Ji, Ruhi Sarikaya

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出多模态策略内化任务,通过将复杂策略内化为模型参数,提升对话代理的策略遵循能力,同时提供新数据集和训练框架TriMPI以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17800 2026-04-21 cs.RO cs.CV 79%

ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning

ReFineVLA: 通过教师引导微调实现多模态推理感知的通用机器人策略

Tuan Van Vo, Tan Q. Nguyen, Khang Nguyen, Nhat Xuan Tran, Duy H. M. Nguyen, An T. Le, Ngo Anh Vien, Minh Nhat Vu

机构 * VinRobotics University of Texas at Arlington(德克萨斯大学阿灵顿分校) Max Planck Research School for Intelligent Systems (IMPRS-IS)(智能系统Max Planck研究学校) Intelligent Autonomous Systems Lab(智能自主系统实验室) TU Darmstadt(德累斯顿技术大学) Automation & Control Institute(自动化与控制研究所) TU Wien(维也纳技术大学) Austrian Institute of Technology (AIT)(奥地利技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ReFineVLA框架,通过教师引导的推理增强数据集微调机器人策略,提升多模态推理能力与泛化性能,在模拟任务中取得最佳表现。

Comments arXiv admin note: substantial text overlap with arXiv:2505.19080

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20249 2026-04-21 cs.LG cs.CV eess.IV 79%

Unified Multimodal Brain Decoding via Cross-Subject Soft-ROI Fusion

通过跨受体软ROI融合实现统一的多模态脑解码

Xuanyu Hu

机构 * The University of Manchester, Manchester, UK(曼彻斯特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BrainROI模型,通过软ROI融合和可解释提示优化,提升跨受体脑解码的泛化能力和描述质量,在NSD数据集上取得领先结果。

Comments 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17122 2026-04-21 cs.CV 79%

Multimodal Fusion of Histopathology Images and Electronic Health Records for Early Breast Cancer Diagnosis

多模态融合组织病理图像与电子健康记录用于早期乳腺癌诊断

Aditya Shribhagwan Khandelwal, Mohammad Samar Ansari, Asra Aslam

机构 * University of Sheffield(谢菲尔德大学) University of Chester(切斯特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出整合BreCaHAD数据集的病理特征与MIMIC-IV的临床数据的多模态框架,通过训练单模态模型和中间融合模型提升乳腺癌早期诊断的准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16615 2026-04-21 cs.LG cs.AI 79%

Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation

超越特征融合:基于上下文的贝叶斯PEFT用于多模态不确定性估计

Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin

机构 * Dalhousie University(达尔豪斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CoCo-LoRA,一种结合音频上下文的多模态不确定性感知参数高效微调方法,通过在低秩空间中条件化上下文变分后验,实现对音频等外部因素的不确定性建模,提升语音应用的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18460 2026-04-21 cs.LG 78%

Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective

从因果推断视角学习不变模态表示以实现稳健的多模态学习

Sijie Mai, Shiqin Han

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出CmIR框架,通过因果推断分离模态中的因果不变表示与环境特定的虚假表示,提升多模态学习的鲁棒性和泛化能力。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18231 2026-04-21 cs.LG cs.AI 74%

Rethinking Cross-Modal Fine-Tuning: Optimizing the Interaction Between Feature Alignment and Target Fitting

重新思考跨模态微调:优化特征对齐与目标拟合之间的交互

Trong Khiem Tran, Manh Cuong Dao, Phi Le Nguyen, Thao Nguyen Truong, Trong Nghia Hoang

机构 * Washington State University(华盛顿州立大学) National University of Singapore(新加坡国立大学) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Hanoi University of Science and Technology(河内科学技术大学)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.AI

AI总结 本文提出一种原理性框架,通过特征-标签扭曲概念解释特征对齐与目标拟合的交互,建立目标误差的可证明泛化界,提升跨模态微调性能。

Comments Accepted AISTATS 20226

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09244 2026-04-21 cs.MM cs.CV cs.RO 62%

2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness

2D或3D:谁在VLA模型中主导显著性?——具有模态显著性意识的三阶段令牌剪枝框架

Zihao Zheng, Sicheng Tian, Zhihao Mao, Lingyue Zhang, Chenyue Li, Ziyun Zhang, Hong Gao, Yuchen Huang, Yutong Xu, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ZTE Corporation(中兴通讯) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出三阶段令牌剪枝框架,通过捕捉2D/3D模态显著性的差异与动态,提升VLA模型的推理效率,实验显示在最小精度损失下实现2.55倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18573 2026-04-21 cs.CV 57%

T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability

T-REN:学习文本对齐的区域标记以提高密集视觉-语言对齐和可扩展性

Savya Khosla, Sethuraman T, Aryan Chadha, Alex Schwing, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 T-REN通过文本对齐的区域标记提升密集视觉-语言对齐和可扩展性,实验证明在多个任务中性能提升显著同时大幅降低token数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10448 2026-04-21 cs.CL 57%

Instruction Data Selection via Answer Divergence

通过答案分歧进行指令数据选择

Bo Li, Mingda Wang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) School of Computer Science, Peking University(北京大学计算机学院) PKU-CMCC(Hubei) Joint Research Lab for LLM Industrial Applications(北京大学-CMCC(湖北)大语言模型工业应用联合实验室) School of Health Sciences and Biomedical Engineering, Hebei University of Technology(河北工业大学健康科学与生物医学工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出通过多样本输出的几何结构选择指令数据,通过计算答案分歧分数提升下游性能,实验表明仅使用10K个ADG选择的例子在六个基准上表现更优。

Comments Github: https://github.com/WisdomShell/ADG Project: https://wisdomshell.github.io/ADG/

Journal ref ACL2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05920 2026-04-21 cs.CV 57%

High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

通过多轮基于定位的强化学习实现高分辨率视觉推理

Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu

机构 * Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。

Comments Accepted by ACL(Findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16800 2026-04-21 cs.CV 57%

Frequency-Decomposed INR for NIR-Assisted Low-Light RGB Image Denoising

频域分解的隐式神经表示用于近红外辅助低光照RGB图像去噪

Ligen Shi, Zengyu Pang, Chang Liu, Shuchen Sun, Jun Qiu

机构 * College of Computer Science (College of Software), Inner Mongolia University, Hohhot, 010021, China(内蒙古大学计算机学院(软件学院)) School of Mathematics and Statistics, Wuhan University, Wuhan, 430072, China(武汉大学数学与统计学院) Institute of Computational Imaging, Beijing Information Science and Technology University, Beijing 102206, China(北京信息科技大学计算成像研究院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于频域分解隐式神经表示的近红外辅助低光照图像修复方法,通过多尺度小波变换分离图像频域成分,利用低光照RGB信号引导低频亮度和颜色重建,利用高信噪比近红外信号约束高频纹理细节生成,解决传统方法在空间域中的颜色失真和伪影问题。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18152 2026-04-21 stat.ML cs.LG 50%

mlr3torch: A Deep Learning Framework in R based on mlr3 and torch

mlr3torch: 基于mlr3和torch的深度学习框架

Sebastian Fischer, Lukas Burk, Carson Zhang, Bernd Bischl, Martin Binder

机构 * LMU Munich(慕尼黑莱布尼茨大学) MCML(预防研究与流行病学研究所) Leibniz Institute for Prevention Research and Epidemiology - BIPS(预防研究与流行病学研究所) University of Bremen(布伦瑞大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文介绍mlr3torch框架,基于mlr3生态系统构建,简化了神经网络的定义、训练和评估,支持表格数据和通用张量,提供预定义架构和图形化建模流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18021 2026-04-21 eess.SP 50%

Paradigm Shift from Statistical Channel Modeling to Digital Twin Prediction: An Environment-Generalizable ChannelLM for 6G AI-enabled Air Interface

从统计信道建模到数字孪生预测的范式转变:一种适用于6G AI赋能空气接口的环境通用化信道LM

Yichen Cai, Yuelong Qiu, Jianhua Zhang, Li Yu, Yuxiang Zhang, Zhen Zhang, Guangyi Liu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种环境通用化的信道LM驱动的数字孪生架构,通过动态物体检测和多模态对齐实现高精度环境重建,结合物理可解释的特征提取和信道LM核心,实现多任务信道预测,实验表明在未见过的环境中,信道状态信息预测误差降低4.23 dB,端到端推理延迟仅70毫秒。

Comments 16 pages, 12 figures, Submitted to Nature Partner Journals Wireless Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 17 篇

2502.02871 2026-04-21 cs.CL cs.AI 86%

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning

位置:多模态大语言模型可以显著推动科学推理

Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文探讨多模态大语言模型在科学推理中的应用,提出四阶段研究路线,指出当前模型在跨领域推理中的潜力与挑战,为实现通用人工智能提供新视角。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08539 2026-04-21 cs.CV cs.AI cs.CL 82%

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

OpenVLThinkerV2: 一个多领域视觉任务的通用多模态推理模型

Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出G$^2$RPO训练目标,通过非线性分布匹配解决多视觉任务中的奖励拓扑差异和感知与推理平衡问题,构建了鲁棒的OpenVLThinkerV2模型,在18个基准测试中表现优异。

Comments code at: https://github.com/uclanlp/openvlthinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09741 2026-04-21 cs.CV cs.LG 81%

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

构造性失真:通过注意力引导的图像扭曲改进MLLMs

Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Skan AI Texas A&M University(德克萨斯大学阿姆斯特朗分校) University of California, Irvine(加州大学 Irvine 分校)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出AttWarp方法,通过注意力引导的图像扭曲增强MLLMs对细节和空间关系的感知能力,提升准确性和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00065 2026-04-21 cs.CL cs.AI 81%

Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models

使用视角词比词汇词对人类更困难,甚至对多模态语言模型更为困难

Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Ozyurek, Paula Rubio-Fernandez

机构 * Max Planck Institute for Psycholinguistics(马克斯·普朗克心理学语言学研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究比较了人类和多模态语言模型在使用词汇、所有格和指示词时的认知负荷,发现视角词对两者都更难,且多模态模型在所有格和指示词上表现更差,揭示了其在常识和社交认知能力上的不足。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14738 2026-04-21 cs.CL 79%

AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning

AutoRubric: 基于评分标准的生成奖励用于忠实的多模态推理

Mengzhao Jia, Zhihan Zhang, Ignacio Cases, Zheyuan Liu, Meng Jiang, Peng Qi

机构 * University of Notre Dame(内布拉斯加大学) Uniphore

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 AutoRubric通过整合可验证奖励学习与过程级监督,利用自动收集的评分标准生成奖励,实现多模态推理的高保真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏