arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-16 至 2026-06-16 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 8 篇

2510.01444 2026-06-16 cs.AI cs.CL cs.LG 版本更新 81%

Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning

双不确定性引导的多模态推理策略学习

Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent Hunyuan(腾讯文汇) University of Maryland(马里兰大学) University of North Carolina(北卡罗来纳大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DUPL方法,通过量化感知不确定性和输出不确定性来引导策略更新,在多个多模态推理基准上显著提升模型准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15160 2026-06-16 cs.CV cs.LG 新提交 79%

DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

DLWM: 多样化潜在世界模型用于高效多模态推理

David Huang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DLWM框架,结合潜在空间推理与强化学习,通过多样化潜在假设和资源感知策略提升多模态推理效率,准确率提升2-5%,内存减少24%。

Comments Preprint. 9 pages main text, 15 pages total including appendix, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20066 2026-06-16 eess.SP cs.AI 79%

A Multi-Modal Non-Invasive Deep Learning Framework for Progressive Prediction of Seizures

一种用于癫痫发作渐进预测的多模态非侵入式深度学习框架

Ali Saeizadeh, Douglas Schonholtz, Joseph S. Neimat, Pedram Johari, Tommaso Melodia

机构 * Institute for the Wireless Internet of Things, Northeastern University, Boston, MA, U.S.A.(无线物联网研究所,东北大学,波士顿,马萨诸塞州,美国) University of Louisville, Louisville, KY, U.S.A.(路易斯维尔大学,路易斯维尔,肯塔基州,美国)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于非侵入式多模态传感器网络的深度学习框架,用于癫痫发作的渐进预测,通过提高预测精度和实时处理能力,实现95%的灵敏度和98%的特异度。

Comments 4 pages, 5 figures, Proceedings of the IEEE 20th International Conference on Body Sensor Networks (BSN), October 2024

Journal ref 2024 IEEE 20th International Conference on Body Sensor Networks (BSN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16294 2026-06-16 cs.CV q-bio.NC 新提交 57%

Sex-based Network-Specific Differences in Connectomes: A Krakencoder-Based Analysis

基于性别的连接组网络特异性差异:基于Krakencoder的分析

Vibhashree S H, Debanjali Bhattacharya, Vamshi Krishna Kancharla, Neelam Sinha

机构 * Centre for Brain Research, Indian Institute of Science(印度科学研究所大脑研究中心) Dept. of Artificial Intelligence, Amrita School of Artificial Intelligence, Amrita Vishwa Vidyapeetham(阿姆里塔大学阿姆里塔人工智能学院人工智能系)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 使用Krakencoder框架模拟脑连接组模态间缺陷传播,分析702名健康被试的结构和功能连接组,发现默认模式网络扰动最大,感觉运动网络最小,完整预测连接组保留更多性别判别信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09673 2026-06-16 cs.LG cs.AI 版本更新 57%

Active Inference with a Self-Prior in the Mirror-Mark Task

镜像标记任务中带有自我先验的主动推理

Dongmin Kim, Hoshinori Kanazawa, Yasuo Kuniyoshi

机构 * The University of Tokyo(东京大学) Laboratory for Intelligent Systems and Informatics(智能系统与信息学实验室)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出一种基于自我先验的计算模型,通过主动推理驱动标记导向行为,无需外部奖励即可模拟镜像自我识别。

Comments 8 pages, 5 figures, Accepted to IEEE ICDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16028 2026-06-16 cs.LG cs.IT math.FA math.IT 新提交 50%

The Information-Theoretic Benefit of Shared Representations under Orthogonality Constraints

正交约束下共享表示的信息论优势

Thomas Dittrich, Oliver Potocki, Philipp Grohs

机构 * Johann Radon Institute of Computational and Applied Mathematics, Austrian Academy of Sciences(奥地利科学院约翰·拉东计算与应用数学研究所) Faculty of Mathematics, University of Vienna(维也纳大学数学学院)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文通过信息论框架,证明在正交约束下,联合近似比单独近似需要更少的描述长度,揭示了共享表示在组合架构中的效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06654 2026-06-16 astro-ph.HE 版本更新 50%

An Intrinsic Degeneracy in a Simplified Semi-Analytic Two-Spot Model for Thermal X-Ray Pulse-Profiles

简化半解析双斑模型用于热X射线脉冲轮廓中的内在简并性

Tong Zhao, Mingyu Ge, Renxin Xu

专题命中 其他多模态 :multi-modal(abstract)

AI总结 在简化半解析双斑模型中识别出一种内在简并性,该简并性在考虑多普勒效应、统计误差和仪器响应时仍可能导致似然面出现双峰,为先前研究中发现的多峰后验分布提供了直觉解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16007 2026-06-16 cs.HC 50%

From zero to figure hero. A checklist for designing scientific data visualizations

从零到图灵英雄:设计科学数据可视化的方法清单

Helena Klara Jambor

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一个方法清单,帮助生物学家设计清晰准确的科学数据可视化,涵盖选择显示类型、颜色使用和布局优化等关键方面,以提升科学发现的传播效果。

Comments 19 pages, 2 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏