arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-26 至 2026-05-26 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 9 篇

2605.24684 2026-05-26 cs.LG cs.AI 79%

Beyond the Aggregation Dilemma: Prior-Retaining Decoupled Learning for Multimodal Graphs

超越聚合困境:多模态图的先验保持解耦学习

Hao Yan, Xuanru Wang, Jun Yin, Shirui Pan, Senzhang Wang, Chengqi Zhang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态属性图学习中强制聚合导致性能反转的聚合困境,提出解耦双路径架构SUPRA,通过保持先验特征的独立性和轻量级共享GNN捕获结构协同,并辅以深度监督缓解梯度饥饿,实现SOTA性能且显著降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25894 2026-05-26 cs.LG q-fin.ST 78%

Predicting Stock Price Direction on Earnings Announcement Days using Multi-modal Deep Learning

使用多模态深度学习预测盈利公告日的股价方向

Manuel Noseda, Nathan Soldati, Marco Paina

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本研究结合基本面指标、技术指标和新闻情感,利用LSTM和Transformer模型预测盈利公告日的股价方向,发现Transformer在识别波动方面更敏感,且新闻情感有助于提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25734 2026-05-26 stat.AP stat.ME stat.ML 78%

Stein-Encoder: A White-Box Supervised Encoder via Stein Identities in Multi-Modal Studies

Stein-Encoder: 多模态研究中基于Stein恒等式的白盒监督编码器

Jiarui Zhang, Shuoxun Xu, Jiasheng Shi, Xinzhou Guo

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 针对多模态生物医学数据中基因与临床特征混杂的问题,提出Stein-Encoder白盒监督框架,利用Stein方法和残差化技术构建可解释的单指标,实现结构解耦并提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20747 2026-05-26 q-bio.GN cs.LG 71%

Multi-Modal Machine Learning for Population- and Subject-Specific lncRNA-Type 2 Diabetes Association Analysis

多模态机器学习用于群体和个体特异性lncRNA-2型糖尿病关联分析

Ashwani Siwach, Sanjeev Narayan Sharma, Sunil Datt Sharma

机构 * Department of Electronics and Communication Engineering, IIITDM Jabalpur(IIITDM Jabalpur电子与通信工程系) Department of Electronics and Communication Engineering, Central University of Jammu(Jammu中央大学电子与通信工程系)

专题命中 其他多模态 :multi-modal(title)

AI总结 本研究通过整合表达、二级结构和序列特征的多模态机器学习框架,在独立队列中识别与2型糖尿病相关的lncRNA,并利用SHAP分析实现群体和个体水平的关联解释。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22947 2026-05-26 cs.ET 71%

Mycoponically Integrated Network Device for Multimodal Sensing with Living Mycelial Networks

基于活体菌丝网络的多模态传感的真菌集成网络设备

Zihan Oliver Zeng, David Marshall Porterfield, Upinder Kaur

专题命中 其他多模态 :multimodal(title)

AI总结 提出一种名为MIND的生物物理接口,通过真菌水培技术维持代谢、标准化电极几何结构并耐受机械损伤,实现长达11个月以上的活体菌丝多模态传感,可区分14种刺激类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10054 2026-05-26 cs.LG cs.AI cs.CL cs.CV 67%

Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs

Uni-DPO:大语言模型动态偏好优化的统一范式

Shangpin Peng, Weinong Wang, Zhuotao Tian, Senqiao Yang, Xing Wu, Haotian Xu, Chengquan Zhang, Takashi Isobe, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对现有DPO方法忽略数据质量和学习难度差异的问题,提出Uni-DPO统一框架,通过自适应重加权偏好对实现更有效的数据利用和更优性能。

Comments Accepted by ICLR 2026. Code & models: https://github.com/pspdada/Uni-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07607 2026-05-26 cs.CV 57%

FS-I2P:A Hierarchical Focus-Sweep Registration Network with Dynamically Allocated Depth

FS-I2P:一种具有动态分配深度的分层聚焦扫描配准网络

Zhixin Cheng, Yujia Chen, Xujing Tao, Bohao Liao, Xiaotian Yin, Baoqun Yin, Tianzhu Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(深空探测国家实验室,深空探测实验室) Institute of Advanced Technology, University of Science and Technology of China(先进技术研究院,中国科学技术大学)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种基于聚焦-扫描范式的分层交互模块和动态层分配策略,用于解决图像到点云配准中的尺度模糊和注意力漂移问题,在RGB-D Scenes V2和7-Scenes数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24816 2026-05-26 cs.CV 57%

AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning

AOEPT:打破模态缺失提示调优中的隐式模态缩减瓶颈

Jian Lang, Rongpei Hong, Ting Zhong, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出AOEPT方法,通过模态上下文提示(MCPs)蒸馏全局模态先验,为缺失模态提供潜在信息源,恢复多模态Transformer的推理范围,解决模态缺失场景下隐式模态缩减瓶颈问题。

Comments 20 pages, Accepted by ICML 2026, Code is available from https://github.com/Jian-Lang/AOEPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24311 2026-05-26 cs.RO 50%

Terrain-Adaptive Grouser Wheel for Optimal Planetary Exploration: Design and Experimental Investigation

地形自适应履刺轮用于最优行星探测:设计与实验研究

Vincent Griffo, Yashwanth Kumar Nakka

机构 * Aerospace Robotics Lab, Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology(航空航天机器人实验室,丹尼尔·古根海姆航空航天工程学院,佐治亚理工学院)

专题命中 其他多模态 :multimodal(abstract)

AI总结 针对行星车在颗粒地形上的移动难题,提出一种可连续调节履刺高度的多模态轮,实验表明自适应部署可减少滑转30-58%,并提升行驶时间和能效达77.4%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏