arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3020 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 530 篇

2606.10572 2026-06-10 cs.AI 新提交 79%

One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA

每个多模态证据一个令牌:面向资源受限问答的潜在记忆

Zhi Zheng, Ziqiao Meng, Hao Luan, Wei Liu, Wee Sun Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出潜在记忆范式,将每个证据压缩为单个高维潜在令牌,通过统一训练实现高效检索与生成,在资源受限场景下以3-10倍令牌节省达到竞争性问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10488 2026-06-10 cs.CV 新提交 79%

5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning

5% > 100%: 平坦性偏好是您进行多模态参数高效微调所需的一切

Yifan Zhu, Can Lin, Hangjie Yuan, Zixiang Zhao, Pengfei Zhang, Tao Feng, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Anhui University of Science and Technology(安徽理工大学) Tsinghua University(清华大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 揭示参数高效微调方法中普遍存在的平坦性偏好,即少量尖锐维度主导泛化,并提出FlatPO方法优化这些维度以提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09148 2026-06-09 cs.CL 新提交 79%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09143 2026-06-09 cs.CV 新提交 79%

CAMF-Det: Closure-Aware Multimodal Fusion for LiDAR-Camera 3D Object Detection on UAV Platforms

CAMF-Det: 面向无人机平台的激光雷达-相机闭合感知多模态融合3D目标检测

Yanze Jiang, Yanfeng Gu, Xian Li

机构 * School of Electronics and Information Engineering, Harbin Institute of Technology(哈尔滨工业大学电子与信息工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对无人机俯视场景中树冠遮挡导致的多模态信息退化问题,提出基于比尔-朗伯定律的闭合感知融合框架CAMF-Det,通过显式建模双模态遮挡强度并注入检测流程,在自建数据集上实现困难级别mAP_BEV提升9.43%和4.88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09091 2026-06-09 cs.LG cs.CV 新提交 79%

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization

稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化

Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08511 2026-06-09 cs.CV 新提交 79%

Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs

少看多思:面向高效多模态大语言模型的块级注意力跳过

Jie Ma, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型视觉注意力饱和问题,提出训练无关的Visual-Skip方法,通过选择性跳过冗余的视觉自注意力模块实现块级稀疏性,并利用轻量级校准动态选择最优稀疏路径,在保持性能的同时显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07676 2026-06-09 q-bio.GN cs.AI 新提交 79%

Single-Cell Cross-Modal Transfer by Adversarial Fine-Tuning of Foundation Models

通过基础模型的对抗微调实现单细胞跨模态迁移

Joseph Boyd, Matthew Lyon, Martino Mansoldo, Christian Hurry, Finnian Firth

机构 * University of Cambridge(剑桥大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 提出利用单细胞基础模型进行对抗微调,实现未配对空间转录组与单细胞RNA测序数据的跨模态翻译,性能优于多组学翻译方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07000 2026-06-08 cs.AI 新提交 79%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06867 2026-06-08 cs.CV 新提交 79%

Multi-FRuGaL: Multimodal Flexible Redundancy-aware Decomposed Gated Learning for Cancer Diagnosis and Prognosis

Multi-FRuGaL:面向癌症诊断与预后的多模态灵活冗余感知分解门控学习

Sanket Kachole, Siddhesh Thakur, Shubham Innani, Sanyukta Adap, Suhang You, Carla Pitarch-Abaigar, Spyridon Bakas

机构 * Division of Computational Pathology, Department of Pathology and Laboratory Medicine, Indiana University School of Medicine(计算病理学部,病理学与实验室医学部,印第安纳大学医学院) IU Melvin and Bren Simon Comprehensive Cancer Center(印第安纳大学Melvin和Bren Simon综合癌症中心) Departments of Biostatistics and Health Data Science(生物统计学与健康数据科学部) Radiology and Imaging Sciences(放射学与影像科学部) Neurological Surgery(神经外科) Indiana University School of Medicine(印第安纳大学医学院) Department of Computer Science, Luddy School of Informatics, Computing, and Engineering(计算机科学部,Luddy信息、计算与工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Multi-FRuGaL框架,通过分解感知自适应门控中间融合,在缺失模态下学习模态级表示,分离冗余与互补信号,提升癌症诊断与预后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23445 2026-07-28 cs.CV cs.CL 新提交 79%

Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models

Omni-Prune:用于高效全模态大语言模型的查询感知统一令牌剪枝

Yiming Zhong, Chang Nie, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 研究针对全模态大语言模型推理时音频-视频令牌序列长、预填充延迟高和GPU内存使用量大的问题,提出无需训练的查询感知Omni-Prune框架,联合去除冗余并保留跨模态证据,实验证明其性能优于基线方法,能加速预填充并减少内存。

Comments 14 pages, 7 figures. Code: https://github.com/kimberlyii/Omni-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04079 2026-07-07 cs.CV cs.AI cs.LG 新提交 79%

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

看一次就够了?用于3D问答的在线几何感知令牌剪枝

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

机构 * National Tsing Hua University(国立清华大学) Industrial Technology Research Institute ITRI(工业技术研究院) University of Toronto(多伦多大学) Atmanity Inc(Atmanity公司)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。

Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22138 2026-06-23 cs.CL cs.AI cs.LG q-bio.BM 新提交 79%

BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

BioMatrix:迈向覆盖序列、结构和语言模态矩阵的综合性生物基础模型

Qizhi Pei, Zhimeng Zhou, Yi Duan, Yiyang Zhao, Wei Li, Han Guo, Liang He, Chengping Li, Chang-Yu Hsieh, Conghui He, Rui Yan, Lijun Wu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) OpenDataLab, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室 OpenDataLab) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 提出首个原生多模态生物基础模型BioMatrix,通过统一分词方案将分子序列、结构、蛋白质序列、结构和自然语言映射到共享离散标记空间,在单一解码器架构下实现所有模态的统一生成,在80项任务中77项达到最优或竞争力水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19052 2026-08-20 cs.CR 新提交 78%

Malformer: A Multi-Modal Malware Detector Using Transformers

Malformer:一种基于Transformer的多模态恶意软件检测器

Samuel Howard, Kshitiz Aryal, Mahmoud Abdelsalam, Maanak Gupta, Andrew Wheeler, Pradip Kunwar

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本研究提出四模态恶意软件检测模型Malformer,融合文本、图像、图形、音频表示,采用多模态Transformer融合,在201549个样本数据集上准确率98.3%,优于单/双模态检测器,为恶意软件防御提供稳健基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18396 2026-08-20 eess.SY 新提交 78%

LiDAR-Derived Surface Priors for Multimodal Sensing-Assisted NLoS Beam Search in Indoor 60-GHz Networks

室内60GHz网络中多模态传感辅助非视距波束搜索的激光雷达衍生表面先验

Amod Ashtekar, Dalton Davis, Rafaela Lomboy, Omar Ibrahim, Raj Sai Sohel Bandari, Mohammed E. Eltayeb

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract)

AI总结 该研究提出用激光雷达衍生的局部表面结构作为先验,结合射频测量,可将60GHz网络的波束对探测减少72%,同时保持74.5%位置的波束在详尽搜索的3dB范围内,降低毫米波波束搜索不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16962 2026-08-19 eess.IV 新提交 78%

Clinical Pathways Matter for Multimodal Deep Learning in Early Alzheimers Disease Detection

临床路径对早期阿尔茨海默病检测中的多模态深度学习至关重要

Yao Lu, Solveig Kristina Hammonds, Alvaro Fernandez-Quilez

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出基于SigLIP的零样本多模态框架,结合结构MRI与常规临床变量,在ADNI队列中实现早期阿尔茨海默病风险分层,性能优于传统模型,且可扩展至纵向数据。

Comments Published

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12944 2026-08-14 cs.LG eess.IV stat.ML 新提交 78%

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

CardioState-JEPA:面向共享心脏表征的延迟感知跨模态学习

Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

机构 * Singapore Management University(新加坡管理大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 CardioState-JEPA是一种延迟感知跨模态心脏基础模型,通过对齐ECG、PPG、PCG的共享生理表征,在25项下游任务上显著提升了各模态的分类性能,实现了异质心脏信号的相互监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10700 2026-08-12 cs.IR 新提交 78%

Deciding When to Rely on Visual Information: Gated Multimodal Fusion in Sequential Recommendation

何时依赖视觉信息:序列推荐中的门控多模态融合

Natalija Glisovic, Danica Kragic, Martin Tegner

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出VisGate框架,基于物品和用户上下文自适应融合多模态信号,揭示视觉效用随物品、交互稀疏性变化的规律,实现更精准的序列推荐并可解释视觉信息的作用。

Comments 8 pages, 6 figures, Accepted at CARS @ RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09830 2026-08-11 cs.LG 新提交 78%

Deep Multimodal Wearable Sensor Fusion for Detection of Body-Focused Repetitive Behaviors

用于聚焦身体重复行为检测的深度多模态可穿戴传感器融合

Samaneh Rezaeimanesh, Mohsen Behradfar, Mohammad Fili, Guiping Hu

机构 * George Mason University(乔治梅森大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究开发多模态深度学习框架,利用腕戴式传感器数据检测聚焦身体的重复行为,在二元及九分类任务中均优于单模态基线,为可穿戴辅助心理健康诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05647 2026-08-07 cs.RO 新提交 78%

KILVO: Kinematic-Inertial-LiDAR-Visual Odometry with Robust Multimodal Adaptation for Humanoid Robots

KILVO:面向人形机器人的具备鲁棒多模态自适应的运动学-惯性-激光雷达-视觉里程计

Jixin Gao, Fucheng Liu, Teng Zhang, Fusheng Zha

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出面向人形机器人的KILVO里程计,基于ESIKF整合多传感器并设计多模态自适应与接触估计模块,实验显示其精度、效率及鲁棒性优于现有方法,代码与数据集已开源。

Comments This article has been accepted for publication in IEEE/ASME Transactions on Mechatronics. Personal use is permitted. All other uses require IEEE permission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02692 2026-08-05 cs.LG 新提交 78%

PatTree: a novel approach for automated creation of multimodal, graph-based patient representations for medical classification tasks

PatTree:一种用于医学分类任务的多模态图基患者表示自动构建新方法

Julia Gehrmann, Lars Quakulinski, Hamza Naseem, Oya Beyan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出PatTree,一种自动构建的多模态图基患者表示,在ADNI-1队列子集上实现阿尔茨海默病等三分类任务98.5%平衡准确率,可作为临床AI流程的可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01620 2026-08-04 eess.SP 新提交 78%

Smartwatch Photoplethysmography-Derived Heart Age via ECG-Guided Cross-Modal Pretraining as a Digital Biomarker of Vascular Aging

通过心电引导跨模态预训练从智能手表光体积描记术衍生的心龄作为血管衰老的数字生物标志物

Donglin Xie, Xueying Gui, Yutian Zhu, Feng Xu, Guangkun Nie, Chenyang Xu, Jun Li, Shuailong Tang, Xiaoyu Li, Qi Xie, Yelei Li, Shenda Hong

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本研究开发心电引导跨模态框架,利用智能手表PPG衍生的心龄差作为数字生物标志物,证实其与动脉僵硬度、高血压显著相关,可用于血管衰老评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01020 2026-08-04 cs.CR 新提交 78%

Inverting the Hidden: Unveiling Multimodal Privacy Leakage in Collaborative LVLM Inference

反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露

Shuaifan Jin, Zhibo Wang, Qiyuan Wang, Yiting Han, Yajie Zhou, Yuanfan Zhang, Jiahui Hu, Xiaoyi Pang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00621 2026-08-04 cs.LG 新提交 78%

RHEA: Reliability-Harmonized Reconstruction and Assignment for Robust Multimodal-Attributed Graph Clustering

RHEA:用于鲁棒多模态属性图聚类的可靠性协调重构与分配

Yinlin Zhu, Di Wu, Ziyu Han, Zekai Chenm, Wang Luo, Miao Hu, Guocong Quan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态属性图聚类中属性含噪或缺失时性能下降的问题,提出RHEA框架,通过估计节点特定模态可靠性并结合邻域信息提升聚类效果,在基准测试中表现优于最强基线。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29000 2026-08-03 cs.IR cs.LG 新提交 78%

PaletteID: Prototype-Composed Semantic Identifiers for Multimodal CTR Prediction

PaletteID:用于多模态点击率预测的原型组合语义标识符

Huanyu Liu, Baining Chen, Hui Liu, Zengyang Li, Ziyi Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出PaletteID模型,以SQ-DPP构建原型调色板聚合语义相关原型,在两个公开数据集上提升CTR预测性能,对长尾物品增益更显著且标识符分配更鲁棒、语义更可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28708 2026-08-03 cs.LG 新提交 78%

MMFGU: Multimodal Federated Graph Unlearning

MMFGU:多模态联邦图遗忘

Haodong Lu, Zekai Chen, Weiwei Ji, Shihao Li, Xunkai Li, Xun Wu, Yinlin Zhu, Rong-Hua Li

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对现有联邦图遗忘无法满足多模态细粒度遗忘请求的问题,提出MMFGU框架,通过目标特定表示解耦等技术解决三大挑战,实验显示其能有效移除请求信息并实现41.5倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28446 2026-07-31 cs.CE 新提交 78%

CoLAS: Multimodal Corroboration of Latent Asset Signals for Financial Trading

CoLAS:面向金融交易的潜在资产信号多模态确证

Yanzheng Jin, Pengyang Shao, Xiaohao Liu, Xi Ai, Fei Shen, Kenji Kawaguchi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对金融交易中异构模态信号不可靠的问题,提出CoLAS多模态确证框架,通过增强共享分量与鲁棒一致性目标,在股票和加密货币数据集上实现年化收益率和夏普比率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24747 2026-07-29 cs.CR cs.HC 新提交 78%

Multimodal User Authentication Method via Fusion of Keystroke Dynamics and Glove-Based Hand Kinematics

通过击键动力学和基于手套的手部运动学融合的多模态用户认证方法

Issei Hyakuda, Lei Jing

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对击键动力学受环境影响问题,提出融合击键动力学与手部运动学的多模态认证框架,用定制手套捕获特征,经混合架构融合,通过“未见”评估协议验证,该方法能有效提升认证准确率,融合模态增强了生物识别辨别力。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24607 2026-07-28 cs.IR 新提交 78%

One Graph, Multiple Gains: Single High-Quality Item-Item Graph for Multimodal Recommendation

一图多益:用于多模态推荐的单个高质量物品-物品图

Jinfeng Xu, Zheyu Chen, Ziyue Peng, Shuo Yang, Jinze Li, Zewei Liu, Shujie Li, Yipeng Du, Edith C. H. Ngai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究多模态推荐中物品-物品图构建及应用,提出IIMRec框架构建高质量图,通过融合信号和NCER优化,并在推荐三阶段重用,以RIG、内容引导UI图扩展、INA三种方式使用,实验证明其性能优于基线,冷启动等条件下效果更佳。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23370 2026-07-28 cs.LG cs.CE econ.EM stat.CO 新提交 78%

Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features

通过社会情绪与技术特征的状态感知多模态融合预测比特币价格走势

Muhammad Abdullah Haroon

机构 * FAST National University of Computer and Emerging Sciences (FAST-NUCES)(快速国立计算机与新兴科学大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 研究比特币亚日价格预测难题,提出状态感知多模态学习(RAML)方法,依据市场状态动态融合社会情绪与技术特征,实验表明该方法在预测中表现良好,确立状态条件自适应融合为多模态金融预测的必要原则。

Comments 19 pages, 15 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20742 2026-07-24 cs.LG 新提交 78%

Adaptive Confidence-weighted Expansion for Trustworthy Multi-Omics Multimodal Fusion

用于可信多组学多模态融合的自适应置信加权扩展

Mohammad Raahemi, Ali Sekhavati, Alireza Maleki, Hamid Nasiri

机构 * Faculty of Engineering, University of Ottawa(渥太华大学工程学院) RIV Lab, Department of Computer Engineering, Bu-Ali Sina University(布阿里·西纳大学计算机工程系RIV实验室) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态学习模型在噪声或无信息数据流下性能不佳及缺乏数据质量评估机制的问题,提出自适应置信加权扩展(ACE)框架,通过生成互补模态和双层置信机制提升性能,在多组学数据集评估中显著优于现有算法。

Comments Accepted for publication in the proceedings of the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏