arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-11 至 2026-08-11 共收录 202 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 30 篇

2608.09907 2026-08-11 cs.CV 新提交 70%

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

DistMoE:用于分布式指令调优的混合专家模型中无需私有数据排练的路由机制

Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Bergamo(贝加莫大学)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型分布式私有数据场景,提出DistMoE混合专家方法,通过公共锚定专家组合阶段实现无需排练的路由,在视觉-语言基准上取得灵活复用与适配的竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08630 2026-08-11 cs.CV 新提交 70%

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip:用于交错长上下文建模的统一视觉与文本压缩方法

Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08307 2026-08-11 cs.CV cs.AI 新提交 62%

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

用于医学视觉问答的频域双分支融合

Yusra Tariq, Rakesh Chandra Joshi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出频域双分支融合模块,结合BiomedCLIP与BioBART,在PMC-VQA预训练后于VQA-RAD、SLAKE微调,提升医学VQA性能且架构轻量高效。

Comments 7 Pages, 4 figures, under review at AAAI 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08107 2026-08-11 cs.CL cs.AI 新提交 62%

NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs

NeuPAT:面向语言保留多模态大语言模型的神经元感知可塑性分配调优

Jiayue Jin, Jingwei Zhang, Chen Wang, Jing Liu, Longteng Guo

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 NeuPAT是一种轻量架构无关框架,通过选择性保护语言敏感神经元、促进高可塑性神经元适配多模态,在11个语言基准上恢复了普通调优94.5%的语言能力下降,同时保持相当多模态性能,实现了能力保留型多模态大语言模型扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09880 2026-08-11 cs.CV cs.LG 新提交 57%

Financial Numerical Prediction and Allocation as Token Generation

金融数值预测与分配:以 token 生成的方式实现

Xu Ouyang, Moontae Lee

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出 FinATOM 框架,通过因果语言模型的 token 生成实现金融数值预测与 ETF 分配,在多组测试中显著提升了夏普比率与累计收益,验证了该方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09264 2026-08-11 cs.CV 新提交 57%

Task-Adaptive 3D Cross-Field MRI Translation via Field-Conditioned Content-Style Pretraining

基于场条件内容-风格预训练的任务自适应3D跨场MRI转换

Haowen Pang, Yingqi Hao, Pengli Zhu

机构 * School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院) School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(清华大学医学院生物医学工程学院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 多模态训练与对齐 :any-to-any(abstract);分类 cs.CV

AI总结 针对跨场MRI转换的域偏移问题,提出基于场条件内容-风格预训练的3D非配对转换框架,适配三项挑战赛任务,可保留三维解剖结构。

Comments MICCAI 2026 Workshop on MRIxFields

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08926 2026-08-11 cs.AI cs.LG 新提交 57%

Decoding Phenotypes: A Framework for Fusing Genomic Language Models and Neuroimaging

解码表型:融合基因组语言模型与神经成像的框架

Tianli Tao, Ziyang Wang, Emma Robinson, Rachel Sparks, Le Zhang

机构 * King’s College London(伦敦国王学院) Aston University(阿斯顿大学) University of Birmingham(伯明翰大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出多模态框架GeneFuse,整合GLM遗传表征与神经成像特征,在NC vs. MCI、NC vs. AD任务上分别获0.77、0.83的AUROC,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07582 2026-08-11 cs.CV 新提交 57%

Predictive Failure Detection in Network Hardware Using Thermal Imaging and Deep Learning with Sensor Fusion

基于热成像与传感器融合深度学习的网络硬件预测性故障检测

Ashly Joseph

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 该研究提出结合热成像与电源传感器数据的多模态深度学习模型,经ROI预处理后可实现网络硬件早期故障的高精度预测,为数据中心主动维护提供支撑。

Journal ref Proceedings of the 2025 3rd International Conference on Data Science and Network Security (ICDSNS), Tiptur, India, 25-26 July 2025, Institute of Electrical and Electronics Engineers (IEEE), pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06247 2026-08-11 cs.CR cs.AI 版本更新 57%

SALLIE: Generation-Free Hidden-State Detection of Jailbreaks and Prompt Injections Across Text and Vision

SALLIE:防范潜在语言与图像攻击

Guy Azov, Ofer Rivlin, Guy Shtar

机构 * Intuit

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 SALLIE是一种轻量级运行时检测框架,通过机制可解释性提取模型内部激活信号,有效应对文本和图像攻击,无需性能降级或架构修改。

Comments 17 pages, 5 figures, 17 tables. Preprint under review. v2: substantially revised - new title expansion, reworked method presentation, added calibration-regime analysis (shared / threshold-only / fully calibrated) and matched-protocol comparison with RCS-KCD; technical appendices A-H now included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09166 2026-08-11 cs.RO cs.LG stat.ME 新提交 50%

Particle-Based Conformal Prediction for Contact-Aware Uncertainty Calibration in Stratified Configuration Spaces

分层构型空间中接触感知不确定性校准的基于粒子的保形预测

Luís Marques, Kristian Popov, Dmitry Berenson

机构 * University of Michigan(密歇根大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对机器人接触障碍物时运动模型不准确、未来构型分布异常的问题,提出CaPTURe算法,实现了接触与非接触场景下的指定覆盖率要求,任务成功率较最佳基线提升30%。

Comments 31 pages, 10 figures, 5 tables. Accepted at COPA 2026 (Conformal and Probabilistic Prediction with Applications). Project page: https://um-arm-lab.github.io/capture/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01414 2026-08-11 cs.RO 版本更新 50%

Learning When to See and When to Feel: Adaptive Vision-Torque Fusion for Contact-Aware Manipulation

学习何时视觉何时触觉:适应性视觉-扭矩融合用于接触感知操控

Jiuzhou Lei, Chang Liu, Yu She, Xiao Liang, Minghui Zheng

机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) Zachry Department of Civil and Environmental Engineering, Texas A&M University(德州农工大学扎克里土木与环境工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出适应性视觉-扭矩融合策略,通过比较不同融合方法提升机器人操控性能,实验显示方法在成功率上优于基线14%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 11 篇

2605.29064 2026-08-11 cs.CL cs.CV cs.HC cs.MA 版本更新 81%

Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

分析多模态大语言模型代理在城市感知中生成解释的角色效应

Neemias da Silva, Matt Ratto, Myriam Delgado, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * Universidade Tecnologica Federal do Parana(巴西南里奥格兰德联邦技术大学) University of Toronto(多伦多大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 通过对比不同角色提示和无角色设置下多模态大语言模型生成的文本,发现标题描述趋同,但理由描述随社会经济和政治属性系统变化,感知标签无显著差异。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07759 2026-08-11 eess.SP cs.AI 新提交 79%

CFD-Guided Detection of Concept Drift in Multimodal Physiologic Signals

CFD引导的多模态生理信号概念漂移检测

Farouk Ganiyu Adewumi, Timothy Oladunni, Rochak Ghimire, Kosisochukwu Ogbuanya, Sanaa Reeves, Sandy Akoy

专题命中 其他多模态 :multimodal(title);cross-modal(abstract);分类 cs.AI

AI总结 本研究提出PECS生理稳定性框架,将模型内部变化与信号可测量变化对比,在多生理信号数据集上验证其性能优于基线,可用于可穿戴心血管AI的概念漂移监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07795 2026-08-11 stat.ML cs.LG stat.ME 新提交 78%

Conformal Calibration for Multi-Modal Regression with Missing Modalities

针对模态缺失的多模态回归的共形校准

Ilia Azizi

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 针对多模态回归中模态缺失或分歧导致预测区间难校准的问题,提出感知模态的共形校准层,在多组实验中提升了区间性能,尤其在模态缺失时恢复了覆盖率。

Comments Published at the Symposium on Conformal and Probabilistic Prediction with Applications (COPA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08071 2026-08-11 cond-mat.mtrl-sci 新提交 78%

Multimodal deep learning framework to predict strain localization of Mg/LPSO two-phase alloys

预测Mg/LPSO两相合金应变局域化的多模态深度学习框架

Daiki Kuriki, Fabien Briffod, Takayuki Shiraiwa, Manabu Enoki

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究采用多模态深度学习框架,结合三种微观结构描述符,从三维图像预测Mg/LPSO两相合金的压缩局域应变分布,验证了方法的有效性。

Comments Published in Acta Materialia, Volume 281, 120398 (2024)

Journal ref Acta Materialia 281 (2024) 120398

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04430 2026-08-11 math.NA cs.NA stat.ML 版本更新 78%

An adaptive split-combine Gaussian mixture filter for nonlinear and multimodal state estimation

面向非线性与多模态状态估计的自适应拆分-合并高斯混合滤波器

San Kim, Won Chang, Daniel B. Forger, Dae Wook Kim

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文针对非线性多模态状态估计问题,提出自适应拆分-合并高斯混合滤波器(AMF),通过拆分合并高斯粒子实现高效准确的PDF估计,在多基准测试中性能优于基线滤波器,还提出了其并行实现方案。

Comments 60 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09482 2026-08-11 cs.CV cs.AI 新提交 76%

Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance

超越统一恢复:利用像素级多模态引导赋能全场景恢复

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

机构 * Xiaomi Corporation(小米公司)

专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 针对全场景图像恢复现有方法采用统一策略忽略区域退化差异的问题,提出MGN-AIR框架,通过像素级多模态引导实现更精细恢复,在多任务基准上性能显著优于现有方法。

Comments Accepted by ACMMM2026 as Oral Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06094 2026-08-11 cs.LG 版本更新 71%

Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems

你所需要的只是对正常情况建模:多模态网络物理系统中异常检测的联合潜在聚类

Alexander Apartsin, Yehudit Aperstein

机构 * Holon Institute of Technology (HIT)(霍隆技术学院) Afeka Academic College of Engineering(阿法卡工程学院)

专题命中 其他多模态 :multimodal(title)

AI总结 研究多模态网络物理系统异常检测,提出联合潜在聚类方法,通过MIIM假设集、公平协议及潜在评分建模正常行为,在三个真实数据集上表现优异,优于其他深度检测器。

Comments 17 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19125 2026-08-11 cs.LG cs.AI 版本更新 57%

Transformer Circuits Can Realize Clustering Algorithms

Transformer电路可实现聚类算法

Kenneth L. Clarkson, Lior Horesh, Takuya Ito, Charlotte Park, Parikshit Ram

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究表明Transformer电路可实现Lloyd算法等精确聚类算法,提出的k均值Transformer聚类算法泛化性强且质量优于Lloyd算法,改动后可衍生多种新型聚类算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.10961 2026-08-11 cs.LG cs.AI 57%

Bike Sharing Demand Prediction based on Knowledge Sharing across Modes: A Graph-based Deep Learning Approach

Yuebing Liang, Guan Huang, Zhan Zhao

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09030 2026-08-11 eess.SY cs.LG cs.SY math.OC 新提交 50%

Closing the loop in learning with missing data

缺失数据学习中的闭环构建

Dimitrios Pylorof, Humberto E. Garcia

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究针对训练数据缺失的机器学习问题,从动力系统视角推导了具有李雅普诺夫稳定性的自适应学习机制,在多模态场景中验证了其能提升学习一致性与稳定性的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16028 2026-08-11 math.NA cs.NA math.ST stat.TH 版本更新 50%

Sequential Monte Carlo with Gaussian Mixture Approximation for Infinite-Dimensional Statistical Inverse Problems

基于高斯混合近似的序贯蒙特卡洛方法用于无限维统计反问题

Haoyu Lu, Junxiong Jia, Deyu Meng

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于高斯混合近似的序贯蒙特卡洛方法,用于解决无限维统计反问题,通过构建预条件转移核和收敛定理,实现了对后验分布的精确估计并展示了离散不变性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏