arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-10 至 2026-07-10 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2607.08573 2026-07-10 cs.AI 新提交 83%

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

用于情感和情绪识别的SHAP加权跨模态专家融合:证据与局限

Adis Alihodzic, Selma Skopljakovic Hubljar

机构 * Faculty of Science, University of Sarajevo(萨拉热窝大学理学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究多模态情感和情绪识别,重新审视XAI引导的自适应融合\xgaf,分析专家特征维度不等时SHAP归因减少的影响,通过实验对比不同融合方法在情感识别任务中的表现,揭示SHAP减少、专家维度和跨模态专家设计对模块化多模态融合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10946 2026-07-10 cs.IT cs.AI cs.LG eess.SP math.IT 版本更新 70%

ToDMA: Large Model-Driven Massive Token Communications for Semantic Multiple Access

ToDMA:用于语义多址接入的大模型驱动海量令牌通信

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Robert Schober, Deniz Gündüz

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) University of Surrey(Surrey大学) Friedrich-Alexander-University Erlangen-Nurnberg(埃森哲-亚琛工业大学) Imperial College London(伦敦帝国理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出ToDMA,一种大模型驱动的语义多址接入方案,将无源随机接入与上下文感知令牌处理结合,用于海量令牌通信。通过压缩感知检测令牌及估计信道状态信息,利用上下文模型恢复冲突令牌,能降低接入延迟并保持令牌恢复与语义重建质量。

Comments Submitted to IEEE journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08076 2026-07-10 cs.CV cs.AI 新提交 62%

LDFE: Laplacian Decoupled Feature Enhancement Block for Dual-Stream CNN-based RGB-IR Object Detection

LDFE:用于基于双流 CNN 的 RGB-IR 目标检测的拉普拉斯解耦特征增强模块

Wenhao Dong, Xiaoyan Luo, Linlin Yang, Haodong Zhu, Xiaorong Shi, Guodong Guo, Baochang Zhang

机构 * Beihang University(北京航空航天大学) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复使用航天运输技术国家重点实验室) The School of Astronautics(航天学院) The National Key Laboratory of Integrated Air-Ground Navigation Technologies(集成空天地导航技术国家实验室) The State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) The School of Artificial Intelligence(人工智能学院) Zhongguancun Academy(中关村学院) The School of Automation Science and Electrical Engineering(自动化科学与电气工程学院) Beijing Institute of Control and Electronics Technology(北京控制电子技术研究所) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Hangzhou Research Institute, School of Artificial Intelligence(杭州研究院,人工智能学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究基于双流 CNN 的 RGB-IR 目标检测问题,提出拉普拉斯解耦特征增强模块 LDFE,通过全局-局部分解等操作融合不同阶段特征,在多个数据集上显著提升目标检测性能,mAP 超 SOTA 方法。

Journal ref Pattern Recognition,Volume 179, Part D,2026,113935

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 57%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 50%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07927 2026-07-10 quant-ph 新提交 50%

Invariance Audits for Quantum Kernels and Variational Rewinding: A Real-to-Hermitian Taxonomy of Projector, Flag, Anchor, and Density Geometry

量子核与变分回绕的不变性审计:投影器、标志、锚和密度几何的实到厄米特分类法

Azadeh Alavi, Fatemeh Kouchmeshki, Hossein Akhoundi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究量子机器学习中向量替换表示的不变性决策,开发实到厄米特分类法,形式化相关核并证明性质,通过多种实验表明量子和几何提升在不变性与任务匹配时有用,丢弃带标签信息时正确失败。

详情

展开后加载摘要…

URL PDF HTML 收藏