arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-16 至 2026-06-16 共收录 167 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 27 篇

2606.16843 2026-06-16 cs.CL 新提交 57%

Data-Driven Decoding of Russell's Circumplex Model of Affect

基于数据驱动的Russell情感环状模型解码

Amdjed Belaref, Samir Sadok, Zineb Noumir, Renaud Seguier

机构 * Alten CentraleSupélec IETR UMR CNRS 6164(中央理工-高等电力学院 IETR CNRS 6164 联合研究单位) Inria at Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学,CNRS,LJK)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文研究Transformer嵌入是否恢复Russell环状模型的几何规律,通过文本和语音模型实验,发现多模态融合完美对齐情感排序,零样本下细粒度情感词接近人类映射坐标。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16756 2026-06-16 cs.CV 新提交 57%

3D Classification of Paramagnetic Rim Lesions in Multiple Sclerosis via Asymmetric QSM-FLAIR Modeling

多发性硬化症中顺磁性边缘病变的3D分类:基于非对称QSM-FLAIR建模

Veronica Pignedoli, Giacomo Boffa, Nicoletta Noceti, Matilde Inglese, Francesca Odone, Matteo Moro

机构 * MaLGa, DIBRIS, University of Genova(热那亚大学) DINOGMI, University of Genova(热那亚大学) IRCCS Azienda Ospedaliera Metropolitana(IRCCS大都会医院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出一种3D多模态深度学习框架,利用非对称QSM-FLAIR建模对多发性硬化症中的顺磁性边缘病变进行自动分类,通过自监督预训练和对比正则化提升有限数据下的鲁棒性,在88名患者队列中验证了有效性。

Comments 10 pages, 3 figures, accepted at MICCAI 2026. Github link: https://github.com/veronicapignedoli/FRODO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16474 2026-06-16 cs.CV cs.RO 新提交 57%

MVOFormer: Flow-Semantic Transformer for Robust Monocular Visual Odometry

MVOFormer:用于鲁棒单目视觉里程计的流-语义Transformer

Jituo Li, Shunwang Sun, Jialu Zhang, Xinqi Liu, Jinyao Hu, Zhicheng Lu, Sajad Saeedi, Guodong Lu

机构 * State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室) Zhejiang Key Laboratory of Industrial Big Data and Robot Intelligent Systems(浙江省工业大数据与机器人智能系统重点实验室) School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Robotics Institute, Zhejiang University(浙江大学机器人研究院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Rural Health Research Institute, Charles Sturt University(查尔斯特大学农村健康研究所) University College London(伦敦大学学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出MVOFormer,一种流-语义双分支编码器与迭代多模态解码器结合的Transformer框架,通过融合密集几何运动与语义先验实现粗到细位姿优化,在零样本泛化上显著超越现有方法。

Comments 8 pages, 6 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14808 2026-06-16 eess.IV cs.CV cs.IT math.IT 新提交 57%

Explainable Task-Oriented Token Communication for AI-Native 6G Networks

面向AI原生6G网络的可解释任务导向Token通信

Feibo Jiang, Lei Mao, Li Dong, Kezhi Wang, Cunhua Pan, Jiangzhou Wang

机构 * IEEE

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出ET-TokenCom框架,通过跨模态注意力融合视觉Token与任务Token,实现可解释的任务导向图像通信,解决Token表示不足、协作差和可解释性低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02877 2026-06-16 cs.CV 版本更新 57%

Pathway-Structured Privileged Distillation for Deployable Computational Pathology

面向可部署计算病理学的通路结构特权蒸馏

Yongxin Guo, Hao Lu, Onur Koyun, Muhammet Demir, Metin Gurcan

机构 * School of Medicine, Wake Forest University(威克森林大学医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出MoPE框架,通过通路索引病理专家和记忆使用对齐,将多模态学习转化为仅组织学推理的特权蒸馏,提升全切片图像推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18227 2026-06-16 cs.LG cs.AI 版本更新 57%

Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality

Token缩减应超越生成模型中的效率——从视觉、语言到多模态

Zhenglun Kong, Yize Li, Fanhu Zeng, Lei Xin, Shvat Messica, Xue Lin, Pu Zhao, Manolis Kellis, Hao Tang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Northeastern University(东北大学) CAS(中国科学院) Wuhan University(武汉大学) MIT(麻省理工学院) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Token缩减应超越传统效率优化,成为生成模型的基础原则,通过减少冗余token来促进多模态融合、缓解幻觉、维持长输入连贯性并提升训练稳定性。

Comments Project page: https://github.com/ZLKong/Awesome-Collection-Token-Reduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00107 2026-06-16 cs.LG cs.AI eess.SP 版本更新 57%

Virtual Sensing to Enable Real-Time Monitoring of Inaccessible Locations & Unmeasurable Parameters

虚拟传感实现不可达位置与不可测参数的实时监测

Kazuma Kobayashi, Farid Ahmed, Jaewan Park, Subhankar Sarkar, Souvik Chakraborty, Syed Bahauddin Alam

机构 * Plasma & Radiological Engineering Department, Grainger College of Engineering, Nuclear, University of Illinois Urbana-Champaign(等离子体与辐射工程系,格拉inger工程学院,核能,伊利诺伊大学厄巴纳-香槟分校) Mechanical Science and Engineering Department, Grainger College of Engineering, University of Illinois Urbana-Champaign(机械科学与工程系,格拉inger工程学院,伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications, Urbana, IL, USA(国家超级计算应用中心,伊利诺伊州厄巴纳,美国) Department of Applied Mechanics, Indian Institute of Technology Delhi, New Delhi, India(应用力学系,印度理工学院德里,新德里,印度) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 针对能量系统中物理传感器无法部署的实时监测问题,提出基于神经算子的虚拟传感框架MIMONet,将稀疏边界测量映射到内部场,在多种热流体系统中实现亚毫秒级高精度推理。

Comments New analysis and results are added

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17010 2026-06-16 cs.LG 新提交 50%

From Tokens to Policy: Causal and Interpretable Heterogeneous Treatment Effects Identification

从令牌到策略:因果且可解释的异质性处理效应识别

Riccardo Cadei, Frank Otchere, Nyasha Tirivayi, Gustavo Angeles Tagliaferro, Falco J. Bargagli-Stoffi, Francesco Locatello

机构 * ISTA UNICEF(联合国儿童基金会) UCLA(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出NEXIS方法,利用多模态预处理表示将HTE识别转化为马尔可夫毯发现问题,实现因果可解释的异质性处理效应识别,并在非洲反贫困项目中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15221 2026-06-16 cs.CR 新提交 50%

Robust and Precise Application Fingerprinting on 5G Physical Uplink Channel

5G物理上行链路上的鲁棒且精确的应用指纹识别

Yu Li, Liqi Zhuang, Dong Wei, Jiwen Luo, Hang Zhang, Meng Zhang, Xiaona Li, Weiqing Huang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 针对5G加密控制信道打破传统攻击链的问题,本文发现物理层侧信道(上行MCS稳定导致PRB数量反映IP包长度),结合上行控制信道重构双向流量,设计了三步被动攻击Crosshair,通过盲提取、数据增强和跨模态对齐实现高精度应用识别。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 8 篇

2510.01444 2026-06-16 cs.AI cs.CL cs.LG 版本更新 81%

Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning

双不确定性引导的多模态推理策略学习

Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent Hunyuan(腾讯文汇) University of Maryland(马里兰大学) University of North Carolina(北卡罗来纳大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DUPL方法,通过量化感知不确定性和输出不确定性来引导策略更新,在多个多模态推理基准上显著提升模型准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15160 2026-06-16 cs.CV cs.LG 新提交 79%

DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

DLWM: 多样化潜在世界模型用于高效多模态推理

David Huang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DLWM框架,结合潜在空间推理与强化学习,通过多样化潜在假设和资源感知策略提升多模态推理效率,准确率提升2-5%,内存减少24%。

Comments Preprint. 9 pages main text, 15 pages total including appendix, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20066 2026-06-16 eess.SP cs.AI 79%

A Multi-Modal Non-Invasive Deep Learning Framework for Progressive Prediction of Seizures

一种用于癫痫发作渐进预测的多模态非侵入式深度学习框架

Ali Saeizadeh, Douglas Schonholtz, Joseph S. Neimat, Pedram Johari, Tommaso Melodia

机构 * Institute for the Wireless Internet of Things, Northeastern University, Boston, MA, U.S.A.(无线物联网研究所,东北大学,波士顿,马萨诸塞州,美国) University of Louisville, Louisville, KY, U.S.A.(路易斯维尔大学,路易斯维尔,肯塔基州,美国)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于非侵入式多模态传感器网络的深度学习框架,用于癫痫发作的渐进预测,通过提高预测精度和实时处理能力,实现95%的灵敏度和98%的特异度。

Comments 4 pages, 5 figures, Proceedings of the IEEE 20th International Conference on Body Sensor Networks (BSN), October 2024

Journal ref 2024 IEEE 20th International Conference on Body Sensor Networks (BSN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16294 2026-06-16 cs.CV q-bio.NC 新提交 57%

Sex-based Network-Specific Differences in Connectomes: A Krakencoder-Based Analysis

基于性别的连接组网络特异性差异:基于Krakencoder的分析

Vibhashree S H, Debanjali Bhattacharya, Vamshi Krishna Kancharla, Neelam Sinha

机构 * Centre for Brain Research, Indian Institute of Science(印度科学研究所大脑研究中心) Dept. of Artificial Intelligence, Amrita School of Artificial Intelligence, Amrita Vishwa Vidyapeetham(阿姆里塔大学阿姆里塔人工智能学院人工智能系)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 使用Krakencoder框架模拟脑连接组模态间缺陷传播,分析702名健康被试的结构和功能连接组,发现默认模式网络扰动最大,感觉运动网络最小,完整预测连接组保留更多性别判别信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09673 2026-06-16 cs.LG cs.AI 版本更新 57%

Active Inference with a Self-Prior in the Mirror-Mark Task

镜像标记任务中带有自我先验的主动推理

Dongmin Kim, Hoshinori Kanazawa, Yasuo Kuniyoshi

机构 * The University of Tokyo(东京大学) Laboratory for Intelligent Systems and Informatics(智能系统与信息学实验室)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出一种基于自我先验的计算模型,通过主动推理驱动标记导向行为,无需外部奖励即可模拟镜像自我识别。

Comments 8 pages, 5 figures, Accepted to IEEE ICDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16028 2026-06-16 cs.LG cs.IT math.FA math.IT 新提交 50%

The Information-Theoretic Benefit of Shared Representations under Orthogonality Constraints

正交约束下共享表示的信息论优势

Thomas Dittrich, Oliver Potocki, Philipp Grohs

机构 * Johann Radon Institute of Computational and Applied Mathematics, Austrian Academy of Sciences(奥地利科学院约翰·拉东计算与应用数学研究所) Faculty of Mathematics, University of Vienna(维也纳大学数学学院)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文通过信息论框架,证明在正交约束下,联合近似比单独近似需要更少的描述长度,揭示了共享表示在组合架构中的效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06654 2026-06-16 astro-ph.HE 版本更新 50%

An Intrinsic Degeneracy in a Simplified Semi-Analytic Two-Spot Model for Thermal X-Ray Pulse-Profiles

简化半解析双斑模型用于热X射线脉冲轮廓中的内在简并性

Tong Zhao, Mingyu Ge, Renxin Xu

专题命中 其他多模态 :multi-modal(abstract)

AI总结 在简化半解析双斑模型中识别出一种内在简并性,该简并性在考虑多普勒效应、统计误差和仪器响应时仍可能导致似然面出现双峰,为先前研究中发现的多峰后验分布提供了直觉解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16007 2026-06-16 cs.HC 50%

From zero to figure hero. A checklist for designing scientific data visualizations

从零到图灵英雄:设计科学数据可视化的方法清单

Helena Klara Jambor

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一个方法清单,帮助生物学家设计清晰准确的科学数据可视化,涵盖选择显示类型、颜色使用和布局优化等关键方面,以提升科学发现的传播效果。

Comments 19 pages, 2 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏