arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-15 至 2026-05-15 共收录 88 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 13 篇

2605.14771 2026-05-15 cs.AI 79%

MediaClaw: Multimodal Intelligent-Agent Platform Technical Report

MediaClaw:多模态智能体平台技术报告

Shaoan Zhao, Huanlin Gao, Qiang Hui, Ting Lu, Xueqiang Guo, Yantao Li, Xinpei Su, Fuyuan Shi, Chao Tan, Fang Zhao, Kai Wang, Shiguo Lian

机构 * China Unicom AI (Yuanjing) Team(中国unicom AI (元京)团队)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 MediaClaw基于OpenClaw生态系统构建多模态智能体平台,通过统一抽象、插件扩展和工作流编排三层架构解决AIGC应用中的碎片化能力、异构接口、生产流程断层和高质量流程复用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14556 2026-05-15 cs.AI 79%

TeachAnything: A Multimodal Crowdsourcing Platform for Training Embodied AI Agents in Symmetrical Reality

教任何事物:一种多模态众包平台,用于在对称现实中的训练具身AI代理

Zidong Liu, Rongkai Liu, Yue Li, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TeachAnything平台,通过多模态示范信号整合三阶段示范范式,实现跨场景、任务和具身的多样化示范数据收集,为对称现实中的具身AI代理开发提供实用基础。

Comments 5 pages, 3 figures. Accepted as an IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13213 2026-05-15 cs.AI 79%

Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning

多模态多智能体推理的分层攻击

Hao Zhou, Tiru Wu, Yan Jiang, Wanqi Zhou, Junxing Hu, Ai Han

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出HAM³框架,通过感知、通信、推理三层分层攻击,评估多智能体系统在不同推理范式下的攻击成功率,揭示多模态多智能体系统的安全漏洞。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14747 2026-05-15 cs.CL cs.AI cs.CV cs.LG 67%

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14495 2026-05-15 cs.MM cs.AI 62%

Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification

可争议的多智能体辩论与基于竞技场的论证计算用于多媒体验证

Truong Thanh Hung Nguyen, Vo Thanh Khang Nguyen, Hoang-Loc Cao, Phuc Ho, Van Pham, Hung Cao

机构 * University of New Brunswick(新 Brunswick大学) University of Science, VNU-HCM(越南国家大学科学学院(VNU-HCM))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出一种可争议的多智能体框架,结合多模态大语言模型、外部验证工具和基于竞技场的定量双极论证,以解决多媒体验证的透明性和可争议性问题。

Comments ACM ICMR 2026 Grand Challenge on Multimedia Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16813 2026-05-15 cs.AI cs.CL cs.DB 62%

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench:评估智能家庭中的代理系统

Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim

机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。

Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14742 2026-05-15 cs.CV cs.RO 57%

EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

EARL:一种统一的分析引导强化学习框架,用于第一人称交互推理与像素定位

Yuejiao Su, Xinshen Zhang, Zhen Ye, Lei Yao, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学电子与电气工程系) Division of Emerging Interdisciplinary Areas (EMIA), The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学新兴跨学科领域研究中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EARL框架,通过分析引导特征合成器提升第一人称交互推理与像素定位的准确性,实验显示在Ego-IRGBench上像素定位达到65.48% cIoU,优于现有方法。

Comments Accepted at ICML 2026. Project page: https://github.com/yuggiehk/EARL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14266 2026-05-15 cs.AI cs.CY 57%

Agentic AI Ecosystems in Higher Education: A Perspective on AI Agents to Emerging Inclusive, Agentic Multi-Agent AI Framework for Learning, Teaching and Institutional Intelligence

高等教育中的代理AI生态系统:对AI代理在新兴包容性、代理多代理AI框架中学习、教学和机构智能的视角

Vidya K Sudarshan, Anushka Sisodia, Reshma A Ramachandra, Sia Batra, Josephine Chong Leng Leng

机构 * College of Computing and Data Science, Nanyang Technological University, NTU, Singapore(南洋理工大学计算机与数据科学学院) DeepMed Ptd Ltd, India(印度DeepMed公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文探讨高等教育中代理多代理AI平台的整合,旨在解决教育机构复杂性中的碎片化问题,强调包容性和适应性决策的重要性。

Comments 50 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13276 2026-05-15 cs.AI cs.RO 57%

D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models

D-VLA:一种面向视觉-语言-动作模型的高并发分布式异步强化学习框架

Yucheng Guo, Yongjian Guo, Zhong Guan, Wen Huang, Haoran Sun, Haodong Yue, Xiaolong Xiang, Shuai Di, Zhen Sun, Luqiao Wang, Junwu Xiong, Yicheng Gong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学) Beihang University(北航) JDT AI Infra(京东AI基础设施)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出D-VLA框架,通过平面解耦和四线异步流水线提升大规模视觉-语言-动作模型的并发性和效率,实验显示其在吞吐量和采样效率上优于主流框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01758 2026-05-15 cs.AI 57%

Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems

在感染蔓延前捕捉它:多智能体系统中的前瞻性引导防御

Yue Ma, Ziyuan Yang, Yi Zhang

机构 * Sichuan University(四川大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Foresight-Guided Local Purification框架,通过智能体模拟未来交互行为,消除感染。实验表明,该方法将最大累积感染率从95%降至5.47%,有效保持交互多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14628 2026-05-15 cs.HC 50%

SmartWalkCoach: An AI Companion for End-to-End Walking Guidance, Motivation, and Reflection

SmartWalkCoach: 一种面向全程步行引导、激励与反思的AI伴侣

Xianzhe Zhang, Mingxuan Hu, Bufan Xue, Erick Purwanto, Thomas J Selig, Daniel Yonto

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出SmartWalkCoach,通过整合地理、陪伴和总结三个轻量级代理,降低步行规划的认知负荷,提升步行过程中的参与度与动机,通过动态干预改善用户感受和体验。

Comments 15 pages, 2 figures, to be presented to ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24316 2026-05-15 cs.GR 50%

Large-Scale Photogrammetric Documentation of St. John's Co-Cathedral: A Workflow for Cultural Heritage Preservation

大规模摄影测量记录圣约翰共祭坛:文化保护的流程

Matthew Kenely, Mark Bugeja, Andre Grima, Peter Pullicino, Matthew Pullicino, Dylan Seychell

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文介绍了一种用于大规模摄影测量记录马耳他瓦莱塔圣约翰共祭坛的完整流程,该建筑为世界遗产,具有复杂的巴洛克建筑和卡拉瓦乔作品。通过七晚的夜间拍摄,采集了99,000张照片,利用DSLR相机、无人机和激光雷达扫描,生成包含25-30十亿三角形的高精度3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14154 2026-05-15 physics.chem-ph 50%

TSAgent: An Agentic Workflow for Autonomous Transition State Search

TSAgent:一种用于自主过渡态搜索的智能工作流

Varun Madhavan, Ankit Mathanker, Dean M. Sweeney, Oluwatosin A. Ohiro, Yixin Wang, Bryan R. Goldsmith

专题命中 多模态Agent :multimodal(abstract)

AI总结 TSAgent通过持续的计划-执行-分析-重新计划循环,自动在密度泛函理论水平上搜索过渡态,实现了83%的准确率,并在对比实验中表现出优于人类专家的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 12 篇

2605.13897 2026-05-15 q-bio.QM cs.LG 88%

Attention-Based Multimodal Survival Prediction with Cross-Modal Bilinear Fusion

基于注意力的多模态生存预测与跨模态双线性融合

Hassan Keshvarikhojasteh, Josien P. W. Pluim, Mitko Veta

机构 * Department of Biomedical Engineering, Eindhoven University of Technology, Eindhoven, The Netherlands(埃因霍温理工大学生物医学工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 本文提出一种新型多模态深度学习框架,通过整合全滑片病理特征、RNA测序表达谱和临床变量,利用双线性融合提升参数效率和可解释性,实验表明在CHIMERA数据集上优于拼接基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14710 2026-05-15 cs.CV cs.AI 84%

Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke

基于视觉核心的对比学习用于脑卒中平衡多模态预后预测

Liren Chen, Lidong Sun, Mingyan Huang, Junzhe Tang, Yinghui Zhu, Guanjie Wang, Yiqing Xia, Ting Xiao

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出三模态融合模型,通过大语言模型生成半结构化诊断文本并设计VDAFM模块,提升多模态融合鲁棒性,实现脑卒中预后预测的高精度。

Comments Corresponding author: Ting Xiao

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14654 2026-05-15 cs.CV 83%

Beyond Instance-Level Self-Supervision in 3D Multi-Modal Medical Imaging

超越实例级自监督在3D多模态医学影像中的应用

Tan Pan, Shuhao Mei, Yixuan Sun, Kaiyu Guo, Chen Jiang, Zhaorui Tan, Mengzhu Li, Limei Han, Xiang Zou, Yuan Cheng, Mahsa Baktashmotlagh

机构 * Fudan University, China(复旦大学) University of Queensland, Australia(昆士兰大学) Shanghai Academy of AI for Science, China(上海人工智能科学研究院) Huashan Hospital, National Center for Neurological Disorders, Fudan University, China(华山医院,国家神经系统疾病中心,复旦大学) Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR), Singapore(生物信息研究所(BII),科技研究局(A*STAR),新加坡)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出利用跨实例拓扑一致性作为监督信号,通过实例内和实例间对齐机制提升多模态医学影像的表征学习,实验显示在7个下游任务中实现了分割和分类任务的平均提升,并在模态缺失时表现出更强的鲁棒性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14458 2026-05-15 cs.AI 83%

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop:通过查询引导的分层令牌剪枝实现多模态大语言模型

Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

机构 * Samsung Research(三星研究院)

专题命中 多模态训练与对齐 :omni-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出OmniDrop,通过查询引导的分层令牌剪枝方法,提升多模态大语言模型的效率与性能,实验表明其在多个音频视频基准测试中表现优异,减少预填充延迟和内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05008 2026-05-15 cs.CV 83%

Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation

多模态因果驱动表示学习用于通用化医学图像分割

Xusheng Liang, Lihua Zhou, Nianxin Li, Miao Xu, Ziyang Song, Dong Yi, Jinlin Wu, Jiawei Ma, Hongbin Liu, Zhen Lei, Jiebo Luo

机构 * City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所) UESTC(电子科技大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MCDRL框架,结合因果推理与VLM解决医学图像分割的领域泛化问题,通过文本提示识别病变区域并消除领域特定影响,提升分割准确性与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14650 2026-05-15 eess.SP 82%

Multimodal Learning for MIMO Beam Prediction Based on Variational Inference

基于变分推断的多模态学习用于MIMO波束预测

Zijian Zheng, Wenqiang Yi, Hyundong Shin, Arumugam Nallanathan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于变分推断的多模态框架,通过模块化特征提取和跨模态语义对齐提升MIMO波束预测精度,实验表明其在仅使用20%多模态数据的情况下表现优异。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00574 2026-05-15 cs.CV cs.AI 81%

Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation

解耦稳定性与可塑性以实现多模态测试时适应

Yongbo He, Zirun Guo, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DASP框架,通过解耦多模态测试时适应中的稳定性与可塑性,解决现有方法在无偏模态中的负迁移和有偏模态中的灾难性遗忘问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14406 2026-05-15 cs.LG cs.CV 79%

GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation

GeoViSTA:用于多模态环境表示的地理视觉-表格变压器

Yuhao Liu, Sadeer Al-Kindi, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Department of Electrical and Computer Engineering, Rice University(理海大学电气与计算机工程系) Center for Cardiovascular Computational and Precision Health, Department of Cardiology, DeBakey Heart and Vascular Center, Houston Methodist(休斯顿方法主义医疗中心心血管计算与精准健康中心、心内科部门、德贝基心脏和血管中心)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 GeoViSTA通过融合栅格影像与表格数据,构建统一的地理嵌入表示,提升对环境、社会和健康问题的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14327 2026-05-15 cs.LG cs.AI 79%

AIM-DDI: A Model-Agnostic Multimodal Integration Module for Drug-Drug Interaction Prediction

AIM-DDI: 一种模型无关的多模态整合模块用于药物-药物相互作用预测

Yerin Park, Sangseon Lee

机构 * Department of Artificial Intelligence, Inha University(人工智能系,Inha大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出AIM-DDI模块,通过共享潜在空间整合多模态信息,提升药物-药物相互作用预测的鲁棒性,尤其在未见过的药物情况下表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14990 2026-05-15 cs.CV 57%

Characterizing the visual representation of objects from the child's view

从儿童视角表征物体的可视化分析

Jane Yang, Tarun Sepuri, Alvin Wei Ming Tan, Khai Loong Aw, Michael C. Frank, Bria Long

机构 * Department of Psychology, University of California San Diego(加州大学圣地亚哥分校心理学系) Department of Psychology, Stanford University(斯坦福大学心理学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究分析了儿童日常经验中物体类别表征的视觉输入,发现常见物体如杯子、椅子占据主导地位,而多数类别出现频率低。尽管物体视角多样,但检测到的类别在上位类别中表现出更强的聚类特征。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14878 2026-05-15 cs.MA 50%

Decision-Level Fusion for Robust Wearable Affect Recognition

决策级融合用于鲁棒的可穿戴情感识别

Lokesh Singh, Athina Georgara, Jayati Deshmukh, Tan Viet Tuyen Nguyen, Sarvapali D. Ramchurn

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究了可穿戴生理数据中情感状态自动识别的鲁棒性问题,提出结合傅里叶-贝塞尔级数展开与EWT的非稳态处理流程,通过决策级融合提升在异构和部分可靠传感下的识别鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14571 2026-05-15 cs.RO cs.LG 50%

Let Robots Feel Your Touch: Visuo-Tactile Cortical Alignment for Embodied Mirror Resonance

让机器人感受你的触摸:用于具身镜像共振的视觉-触觉皮层对齐

Tianfang Zhu, Ning An, Rui Wang, Jiasi Gao, Qingming Luo, Anan Li, Guyue Zhou

机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Key Laboratory of Biomedical Engineering of Hainan Province, School of Biomedical Engineering, Hainan University(海南省生物医学工程重点实验室,海南大学生物医学工程学院) School of New Media Art and Design, Beihang University(北航艺术与设计学院) MoE Key Laboratory for Biomedical Photonics, Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(教育部生物医学光子学重点实验室,武汉光电研究所,华中科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出镜像触觉网络,通过多级约束实现视觉与触觉表征的语义、分布和几何对齐,使机器人能从RGB图像预测毫米级触觉信号,为具身镜像共振提供可解释的机器人感知路径。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 3 篇

2605.14938 2026-05-15 cs.LG cs.CV 79%

Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习

Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19653 2026-05-15 cs.LG 78%

Conformal Prediction for Multimodal Regression

多模态回归的符合预测

Alexis Bose, Jonathan Ethier, Paul Guinand

机构 * Communications Research Centre Canada(加拿大通讯研究中心)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出多模态符合回归,通过内部特征提取实现对图像和文本等多模态数据的预测区间构造,拓展了符合预测的应用范围。

Comments Code available at https://github.com/ic-crc/uncertainty-estimation 20 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14917 2026-05-15 cs.LG cs.CE cs.IT math.IT stat.ML 78%

A Mutual Information Lower Bound for Multimodal Regression Active Learning

多模态回归主动学习的互信息下界

Leonardo Ferreira Guilhoto, Akshat Kaushal, Paris Perdikaris

机构 * Graduate Group on Applied Mathematics & Computational Science(应用数学与计算科学研究生组) Department of Computer and Information Science(计算机与信息科学系) University of Pennsylvania(宾夕法尼亚大学) Department of Mechanical Engineering and Applied Mechanics(机械工程与应用力学系)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出多模态回归主动学习的互信息下界方法,通过两个索引框架区分epistemic和aleatoric不确定性,证明其在数据集增长时趋于零,且在多模态系统基准中优于其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏