arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-31 至 2026-03-31 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 12 篇

2602.22601 2026-03-31 cs.LG cs.CV 79%

$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

$ϕ$-DPO:面向大多模态模型持续学习的公平性直接偏好优化方法

Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas(阿肯色大学 CVIU 实验室) Dep. of Geosciences, University of Arkansas(阿肯色大学地球科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出$ϕ$-DPO框架,通过直接偏好优化缓解持续学习中的灾难性遗忘问题,并解决数据不平衡导致的公平性问题,实验表明其在多个基准上表现优异。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05352 2026-03-31 cs.LG cs.AI 79%

Recent Advances of Multimodal Continual Learning: A Comprehensive Survey

多模态持续学习的最新进展:综合性综述

Dianzhi Yu, Xinni Zhang, Yankai Chen, Aiwei Liu, Yifei Zhang, Philip S. Yu, Irwin King

机构 * Tsinghua University(清华大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态持续学习的最新进展,分析了其核心挑战与方法分类,提出四种主要方法类别,并讨论了未来研究方向和开放资源。

Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS). DOI: 10.1109/TNNLS.2026.3658485. Copyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26778 2026-03-31 cs.LG cs.AI 79%

TED: Training-Free Experience Distillation for Multimodal Reasoning

TED: 无需训练的经验蒸馏用于多模态推理

Shuozhi Yuan, Jinqing Wang, Zihao Liu, Miaomiao Yuan, Haoran Peng, Jin Zhao, Bingwen Wang, Haoyi Wang

机构 * China Telecom Digital Intelligence Technology Co.,Ltd.(中国电信数字智能科技有限公司) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 TED提出一种无需训练的基于上下文的经验蒸馏框架,通过将知识转移目标从模型参数转向注入学生提示中的上下文经验,提升多模态推理性能,实验表明在低数据环境下效果优于传统方法。

Comments 13 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28362 2026-03-31 cs.RO cond-mat.mtrl-sci cond-mat.soft physics.app-ph 78%

A Foldable and Agile Soft Electromagnetic Robot for Multimodal Navigation in Confined and Unstructured Environments

一种多功能软电磁机器人,用于在受限和无结构环境中多模式导航

Zhihao Lv, Xiaoyong Zhang, Mengfan Zhang, Xiaoyu Song, Xingyue Liu, Yide Liu, Shaoxing Qu, Guoyong Mao

机构 * State Key Laboratory of Fluid Power and Mechatronic Systems(流体动力与机电系统国家重点实验室) Key Laboratory of Soft Machines and Smart Devices of Zhejiang Province(浙江省软体机器人与智能器件重点实验室) Center for X-mechanics(交叉力学中心) Department of Engineering Mechanics, Zhejiang University(浙江大学工程力学系)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一种可折叠且灵活的软电磁机器人,具备多种运动模式,可在复杂环境中高效导航,其体积可减少79%,并能适应黏弹性表面和模拟生物组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27036 2026-03-31 physics.ins-det cs.LG 78%

Material Identification using Multi-Modal Intrinsic Radiation and Radiography

利用多模态内在辐射和X射线摄影进行材料识别

Khoa Nguyen, Brendt Wohlberg, Oleg Korobkin, Marc Klasky

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文通过结合X射线摄影、高分辨率γ射线光谱和中子多重性测量,研究特殊核材料配置的多模态材料识别,展示随机森林分类器在单壳和双壳配置中的高识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27179 2026-03-31 cs.CV 70%

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

基于推理的异常检测与定位:图像级监督

Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26737 2026-03-31 cs.CV cs.AI 62%

Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning

超越静态视觉标记:结构化的顺序视觉推理

Guangfu Guo, Xiaoqian Lu, Yue Feng, Mingming Sun

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构化顺序视觉推理方法,通过构建视觉重要性图谱并按判别顺序进行推理,提升多模态模型的视觉认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28120 2026-03-31 cs.CV 57%

MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding

MedLoc-R1: 为基于GRPO的医疗视觉接地任务的性能感知课程奖励调度

Guangjing Yang, Ziyuan Qin, Chaoran Zhang, Chenlin Du, Jinlin Wang, Wanran Sun, Zhenyu Zhang, Bing Ji, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Peking University(北京大学) Shandong University(山东大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MedLoc-R1框架,通过性能感知奖励调度提升医疗视觉接地任务的定位准确性和训练稳定性,无需引入辅助网络。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27969 2026-03-31 cs.CV 57%

Hg-I2P: Bridging Modalities for Generalizable Image-to-Point-Cloud Registration via Heterogeneous Graphs

Hg-I2P:通过异构图实现通用的图像到点云配准

Pei An, Junfeng Ding, Jiaqi Yang, Yulong Wang, Jie Ma, Liangliang Nan

机构 * Huazhong University of Science and Technology(华中科技大学) Northwestern Polytechnical University(西北工业大学) Huazhong Agricultural University(华中农业大学) Delft University of Technology(代尔夫特理工大学)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Hg-I2P方法,通过异构图融合多模态特征,提升图像与点云配准的泛化能力和精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27536 2026-03-31 cs.AI 57%

Dual-Stage LLM Framework for Scenario-Centric Semantic Interpretation in Driving Assistance

双阶段LLM框架用于驾驶辅助中的场景中心语义解释

Jean Douglas Carvalho, Hugo Taciro Kenji, Ahmad Mohammad Saber, Glaucia Melo, Max Mauro Dias Santos, Deepa Kundur

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出双阶段LLM框架,用于评估城市驾驶场景中基于LLM的风险推理可复现性。通过多模态驾驶数据构建确定性场景窗口,并在固定提示约束和闭合数字风险方案下评估,揭示模型间在风险等级分配、高风险升级、证据使用和因果归因上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22339 2026-03-31 cs.LG cs.CL stat.ML 57%

Problems with Chinchilla Approach 2: Systematic Biases in IsoFLOP Parabola Fits

Chinchilla方法2的问题2:等效FLOP拟合中的系统性偏差

Eric Czech, Zhiwei Xu, Yael Elmatad, Yixin Wang, William Held

机构 * Open Athena AI Foundation(开放雅典娜AI基金会) Department of Statistics, University of Michigan, Ann Arbor(密歇根大学安娜堡分校统计系)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文研究了Chinchilla方法2在拟合神经网络扩展定律时的系统性偏差,指出其在无噪声合成数据中仍存在偏差,影响参数分配,并提出通过变量投影方法改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20465 2026-03-31 astro-ph.SR 50%

Advances and Challenges in Solar Flare Prediction: A Review

太阳耀斑预测的进展与挑战:综述

Mingfu Shao, Suo Liu, Haiqing Xu, Peng Jia, Hui Wang, Liyue Tong, Yang Bai, Chen Yang, Yuyang Li, Nan Li, Jiaben Lin

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文综述了太阳耀斑预测的最新研究,探讨了从统计学习到机器学习和深度学习,再到多模态大模型的发展历程,并分析了现有预测平台的性能与局限性。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏