arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-24 至 2026-07-24 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 17 篇

2512.04966 2026-07-24 cs.IT cs.LG eess.SP math.IT 版本更新 88%

Environment-Aware Channel Inference via Cross-Modal Flow: From Multimodal Sensing to Wireless Channels

通过跨模态流进行环境感知信道推断:从多模态感知到无线信道

Guangming Liang, Mingjie Yang, Dongzhu Liu, Paul Henderson, Lajos Hanzo

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 研究在高多普勒环境下无需导频的信道推断,提出数据驱动框架将传感到信道映射设为跨模态流匹配问题,通过融合多模态特征、学习速度场等实现实时CSI估计,实验表明该方法在信道估计精度和频谱效率上优于基准。

Comments 17 pages, 15 figures, 44 references, to appear in IEEE Transactions on Mobile Computing (TMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21546 2026-07-24 cs.CV 新提交 83%

UnDA: Unpaired Domain Alignment for Cross-Modal Knowledge Transfer in Medical Imaging

UnDA:用于医学成像中跨模态知识转移的无配对域对齐

Rafsan Jany, Shadab Tanjeed Ahmad, Ahsan Bulbul, Tahsinul Islam, Md Azam Hossain, Abu Raihan Mostofa Kamal

机构 * Korea Institute of Oriental Medicine(韩国韩医学研究院) Islamic University of Technology(伊斯兰科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 针对医学成像中跨模态知识转移时获取配对数据难、处理模态差距及噪声传播问题,提出UnDA框架,通过与主干无关的对齐模块、不确定性加权最优传输及每个类别的ProtoNCE目标,实现无配对跨模态蒸馏,提升目标模态分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21384 2026-07-24 cs.AI 新提交 83%

Multimodal Pretraining for Generalizable EEG Representation Learning

用于可泛化脑电信号表征学习的多模态预训练

Targol Bakhtiarvand, Jugal Kalita, Adham Atyabi

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 研究针对癫痫EEG模型应用局限问题,开发多模态EEG基础模型,结合多种编码器,通过创新预训练技术创建癫痫相关表征。在多个数据集和评估设置下实验,该模型实现强大癫痫检测与适应新场景能力,支持可解释癫痫定位,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05964 2026-07-24 cs.CV 版本更新 83%

QATMA: Quantization-Aware Training with Multimodal Alignment for Open-Vocabulary Object Detection

CR-QAT: 基于课程关系量化感知训练的开放词汇目标检测

Jinyeong Park, Donghwa Kang, Seunghwan An, Insoo Kim, Brent ByungHoon Kang, Hyeongboo Baek, Jibum Kim

机构 * Incheon National University, Incheon, South Korea(韩国仁川国立大学) KAIST, Daejeon, South Korea(韩国成均馆大学) University of Seoul, Seoul, South Korea(首尔大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 CR-QAT通过课程关系量化感知训练提升开放词汇目标检测在低比特设置下的性能,实现显著的AP提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21058 2026-07-24 cs.RO 新提交 82%

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

用于机器人开颅手术的受人类启发框架:集成多模态融合与自适应轨迹调整

Renzhen Le, Xiao Zhang, Di Wu, Yuanyu Wei, Jiachen Zhu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) The University of Tokyo(东京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究针对机器人开颅手术问题,提出受人类启发的闭环框架,集成术前规划与术中执行。采用自适应双轮廓融合算法生成轨迹,利用多模态网络融合信号实现突破检测,通过原位投影策略调整轨迹,实验验证该框架能实现安全自主且高效闭环控制的开颅手术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20906 2026-07-24 cond-mat.mtrl-sci cond-mat.dis-nn physics.app-ph physics.data-an 新提交 82%

Uni-XAS: Alignment-Driven Bidirectional Multimodal Learning for X-ray Absorption Spectroscopy

Uni-XAS:用于X射线吸收光谱的对齐驱动双向多模态学习

Suyang Zhong, Yuhao Zhao, Boying Huang, Fanjie Xu, Pengwei Xu, Haoyi Tao, Xi Fang, Jun Cheng, Fujie Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对X射线吸收光谱建模中异构模态学习难题,提出Uni-XAS框架。通过XASLip解决元素内配位变化,用检索增强解码防尺度崩溃等,还引入排列校正流匹配解决逆问题,在多方面表现出色,为多模态学习和评估奠定基础。

Comments 48 pages, 7 figures, 11 tables. Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21347 2026-07-24 cs.CV 新提交 79%

Quality-Aware Multimodal Fusion Reveals Implicit Identity in Valence-Arousal Features

质量感知多模态融合揭示效价-唤醒特征中的隐含身份

Jisu Kim, Benjamin S. Riggan

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对传统人脸识别在无约束环境中表现不佳的问题,提出质量感知自适应融合方法 QAAF 用于多模态效价-唤醒估计,在 VA 估计任务中取得良好效果,且经 VA 训练的特征在编码身份上表现出色,确立了多模态 VA 估计为传统人脸识别的互补软生物特征模态。

Comments 10 pages, 3 figures, 6 tables. Accepted for publication at IEEE International Joint Conference on Biometrics (IJCB), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20511 2026-07-24 cs.AI 新提交 79%

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20742 2026-07-24 cs.LG 新提交 78%

Adaptive Confidence-weighted Expansion for Trustworthy Multi-Omics Multimodal Fusion

用于可信多组学多模态融合的自适应置信加权扩展

Mohammad Raahemi, Ali Sekhavati, Alireza Maleki, Hamid Nasiri

机构 * Faculty of Engineering, University of Ottawa(渥太华大学工程学院) RIV Lab, Department of Computer Engineering, Bu-Ali Sina University(布阿里·西纳大学计算机工程系RIV实验室) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态学习模型在噪声或无信息数据流下性能不佳及缺乏数据质量评估机制的问题,提出自适应置信加权扩展(ACE)框架,通过生成互补模态和双层置信机制提升性能,在多组学数据集评估中显著优于现有算法。

Comments Accepted for publication in the proceedings of the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21179 2026-07-24 cs.CV 新提交 70%

Out of Sight, Still in Mind: Token Compression for Omni-LLMs

视而不见,仍记于心:全模态大语言模型的令牌压缩

Suho Yoo, Youngjoon Jang, Hyebin Cho, Joon Son Chung

机构 * KAIST(韩国科学技术院) VGG, University of Oxford(牛津大学视觉几何组)

专题命中 多模态训练与对齐 :audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 研究旨在降低Omni-LLMs推理时输入令牌成本,提出无需训练的ReMo框架,通过跨模态重分配信息压缩视觉令牌,在Qwen2.5-Omni上实验,去除54%输入令牌且准确率无损失,甚至略超全令牌模型。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21371 2026-07-24 cs.CV cs.AI 新提交 62%

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

DINOde:用于开放词汇语义分割的连续视觉-文本对齐

Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh, Kuk-Jin Yoon

机构 * Multimodal Intelligence and Perception Lab., DGIST(多模态智能与感知实验室,大邱庆北科学技术院) Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对开放词汇语义分割中视觉与文本对齐问题,提出基于ODE的DINOde框架,通过语义文本流和全局上下文流、速度切向投影等组件,连续对齐视觉与文本,实验证明该方法优于现有方法,性能达领先水平。

Comments Accepted to ECCV 2026. 27 pages, 8 figures, and 10 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07033 2026-07-24 cs.CV cs.AI 版本更新 62%

AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning

AnchorPrune:用于视觉令牌剪枝的相关性锚定上下文扩展

Kyuan Oh, Bumsoo Kim

机构 * Chung-Ang University(崇实大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对大型视觉语言模型推理成本高、视觉令牌冗余问题,提出无需训练的AnchorPrune框架,通过构建相关性锚点并扩展,自适应确定锚点大小,分配预算恢复上下文,提升了模型的准确率与效率,尤其在严重压缩下效果显著。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21076 2026-07-24 cs.CV 新提交 57%

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

C-PTQ:用于多模态大语言模型训练后量化的Fisher加权通道敏感性

Jiameng Li, Han Zhou, Matthew B. Blaschko

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型训练后量化中异常通道致性能下降问题,提出C-PTQ方法,通过设计Fisher加权目标统一任务特定损失扰动和量化误差,无需辅助模块达最优性能,经实验验证有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15995 2026-07-24 cs.LG cs.AI 版本更新 57%

Constrained latent state modeling: A unifying perspective on representation learning under competing constraints

受限潜在状态建模:在竞争约束下表示学习的统一视角

Gwenolé Quellec

机构 * LaTIM UMR 1101

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出受限潜在状态建模(CLSM),统一了表示学习中在竞争约束下的核心原则与方法,揭示了潜在状态的内在耦合关系与根本权衡。

Comments Companion repository containing the reference implementation, reproducible experiments, documentation, and model cards: https://github.com/gwenole-quellec/clsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05774 2026-07-24 cs.LG cs.AI math.PR 版本更新 57%

Variational Speculative Decoding: Rethinking Draft Training from Token Likelihood to Sequence Acceptance

变分推测解码:从令牌似然到序列接受的草稿训练再思考

Xiandong Zou, Jianshu Li, Jing Huang, Pan Zhou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :MLLM(abstract_cn);分类 cs.AI

AI总结 提出变分推测解码(VSD),将草稿训练视为对潜在提议(草稿路径)的变分推断,通过最大化目标模型接受的边际概率来优化,结合路径级效用和期望最大化过程,显著提升解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20598 2026-07-24 eess.IV 新提交 50%

MedDiT4SR: Tri-Stream Joint Adaptation of Pre-Trained Diffusion Transformers for Medical Image Super-Resolution

MedDiT4SR:用于医学图像超分辨率的预训练扩散Transformer的三流联合自适应

Zhi Chen, Le Zhang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对医学图像超分辨率难题,提出MedDiT4SR三流自适应框架,集成多种表示于扩散Transformer块,引入SR Adapter和SA Refiner,实验验证该框架能有效让预训练DiT模型适应不同医学成像域的超分辨率任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12338 2026-07-24 cs.LG 版本更新 50%

Wireless TokenCom: RL-Based Tokenizer Agreement for Multi-User Wireless Token Communications

无线令牌通信:基于强化学习的多用户无线令牌通信中的令牌化协议

Farshad Zeinali, Mahdi Boloursaz Mashhadi, Rahim Tafazolli

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于强化学习的混合框架,用于多用户无线TokenCom中的令牌化协议,提升语义质量和资源效率,减少视频传输中的冻结事件。

Comments Submitted to IEEE Journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏