arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-13 至 2026-08-13 共收录 65 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 15 篇

2608.11623 2026-08-13 cs.LG cs.AI cs.NI eess.SP 新提交 57%

FM-LLM: A frequency-enhanced mixture-of-experts framework for adapting LLMs to time series forecasting

FM-LLM:一种用于适配大语言模型(LLMs)进行时间序列预测的频率增强型混合专家框架

Rentao Gu, Yihang Ding, Junjie Li, Yi Ding, Weijing Sang, Xiaoli Huo, Xin Qin, Yuefeng Ji

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute(中国电信研究院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 本研究提出FM-LLM框架,通过频谱标记对齐器与非对称MoE解码器等设计,在11个基准的多数指标上优于现有LLM基线,且具备良好迁移性。

Journal ref R. Gu, Y. Ding, J. Li, Y. Ding, W. Sang, X. Huo, X. Qin, and Y. Ji, Knowl.-Based Syst., vol.341, p.115776, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11595 2026-08-13 cs.CV 新提交 57%

ProtoHGF-Net: Prototype HyperGraph Fusion with Intra-modal Calibration for RGBT Object Detection

ProtoHGF-Net:用于RGBT目标检测的模态内校准原型超图融合网络

Xiangqi Chen, Xiuling Zhang, Chengzhuan Yang, Li Zhao, Dawei Zhang, Yanchao Wang, Liyuan Chen, Hua Wang, Hao Peng, Zhonglong Zheng

机构 * Zhejiang Normal University(浙江师范大学) National University of Defense Technology(国防科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对现有RGBT目标检测方法密集跨模态交互易引入背景干扰的问题,提出ProtoHGF-Net框架,通过原型级语义交互与教师掩码校准蒸馏技术,在三个公开数据集上取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09169 2026-08-13 cs.CV 57%

UniSemAlign: Text-Prototype Alignment with a Foundation Encoder for Semi-Supervised Histopathology Segmentation

UniSemAlign:基于基础编码器的文本-原型对齐用于半监督病理分割

Le-Van Thai, Tien Dat Nguyen, Hoai Nhan Pham, Lan Anh Dinh Thi, Duy-Dong Nguyen, Ngoc Lam Quang Bui

机构 * AI VIETNAM Lab, Vietnam(AI VIETNAM实验室,越南) Hanoi University of Science and Technology, Vietnam(河内科技大学,越南)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 UniSemAlign通过引入显式类别结构提升视觉分割,利用共享嵌入空间中的原型和文本对齐分支,减少类别模糊性并稳定伪标签优化,实验表明其在有限标注下显著优于现有半监督方法。

Comments Accepted at CVPR 2026 Workshop. 11 pages, 5 figures, 4 tables

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6803--6813

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11364 2026-08-13 cs.HC 新提交 50%

QUARTZ: Qualitative Understanding via Accessible Representation and Visualization

QUARTZ:通过可访问表示与可视化实现定性理解

Omar Khan, JooYoung Seo

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对盲人和低视力研究者无法访问定性数据可视化的问题,提出基于网络的QUARTZ系统,通过用户研究揭示相关障碍并提出设计准则,以提升该群体参与定性研究的可访问性。

Comments 24 pages, accepted at ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 1 篇

2608.12235 2026-08-13 cond-mat.soft 新提交 50%

Random close packing at extreme size ratios with an Adam-based inflation protocol

基于Adam优化膨胀协议的极端尺寸比下的随机密堆积

Kenneth Desmond

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究提出基于Adam优化器的\texttt{rcpgenerator}代码,实现极端尺寸比下的高维密堆积生成,性能优于传统方法,结果与实验及理论预测吻合。

Comments 11 pages, 10 figures, 3 tables, Code: https://github.com/KD-physics/RCPGenerator; data archived at Zenodo, doi:10.5281/zenodo.21435447

详情

展开后加载摘要…

URL PDF HTML 收藏