arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-20 至 2026-08-20 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2608.18132 2026-08-20 cs.CL cs.SD eess.AS 新提交 82%

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

对齐即全部所需:通用音频-语言模型的无指令训练

Xuanru Zhou, Yiwen Shao, Jiahong Li, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 该研究提出仅对齐的无指令大音频-语言模型LALM,仅训练轻量投影器,在多模态数据集上用更少数据达到或优于基线,证明仅靠对齐即可构建有竞争力的多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19063 2026-08-20 cs.CV 新提交 79%

When Two Tracers Disagree: An Investigation of Multimodal Fusion for Clinical PET/CT Segmentation

当两种示踪剂意见不合时:临床PET/CT分割的多模态融合研究

Jack A. Johnson, Bartłomiej W. Papież

机构 * University of Oxford(牛津大学) Nuffield Department of Medicine(纳菲尔德医学系) Department of Oncology(肿瘤学系) Big Data Institute(大数据研究所) Nuffield Department of Population Health(纳菲尔德人口健康系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对前列腺癌PSMA与FDG PET/CT的多模态融合分割,训练示踪剂特异性3D nnU-Net基线并对比多种融合策略,发现融合未始终优于单示踪剂模型,需更优架构保留示踪剂特异性表征

Comments 10 pages (8 pages main content and 2 pages of references), 2 figures, 2 tables, accepted to MICCAI 2026 Cancer Prevention, Detection, and IntervenTion (CaPTion) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18515 2026-08-20 cs.CV 新提交 79%

Cross-Modal MRI Ovary Segmentation in Endometriosis Using Unpaired TVUS Prototype Priors

基于未配对经阴道超声(TVUS)原型先验的子宫内膜异位症跨模态MRI卵巢分割

Xingjian Kang, Lina Felsner, Dominik Perrin, Daiqi Liu, Jasmin Arjomandi, Franziska Mathis-Ullrich, Alexandra Stoll, Katharina Breininger

机构 * Center for AI and Data Science (CAIDAS), Julius-Maximilians-Universität Würzburg(维尔茨堡大学人工智能与数据科学中心) Institute for Computational Imaging and AI in Medicine (CompAI), Technical University of Munich(慕尼黑工业大学计算成像与医学人工智能研究所) Pattern Recognition Lab, Friedrich-Alexander Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学模式识别实验室) Department Artificial Intelligence in Biomedical Engineering (AIBE), Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学生物医学工程人工智能系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对子宫内膜异位症MRI卵巢分割难题,本研究提出结合TVUS原型库的双分支框架,适配MedSAM3对齐跨模态特征,在相关数据集上较SOTA方法提升超5个百分点,验证了原型库与热身预训练的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19052 2026-08-20 cs.CR 新提交 78%

Malformer: A Multi-Modal Malware Detector Using Transformers

Malformer:一种基于Transformer的多模态恶意软件检测器

Samuel Howard, Kshitiz Aryal, Mahmoud Abdelsalam, Maanak Gupta, Andrew Wheeler, Pradip Kunwar

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本研究提出四模态恶意软件检测模型Malformer,融合文本、图像、图形、音频表示,采用多模态Transformer融合,在201549个样本数据集上准确率98.3%,优于单/双模态检测器,为恶意软件防御提供稳健基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18396 2026-08-20 eess.SY 新提交 78%

LiDAR-Derived Surface Priors for Multimodal Sensing-Assisted NLoS Beam Search in Indoor 60-GHz Networks

室内60GHz网络中多模态传感辅助非视距波束搜索的激光雷达衍生表面先验

Amod Ashtekar, Dalton Davis, Rafaela Lomboy, Omar Ibrahim, Raj Sai Sohel Bandari, Mohammed E. Eltayeb

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract)

AI总结 该研究提出用激光雷达衍生的局部表面结构作为先验,结合射频测量,可将60GHz网络的波束对探测减少72%,同时保持74.5%位置的波束在详尽搜索的3dB范围内,降低毫米波波束搜索不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18546 2026-08-20 cs.LG 新提交 67%

MARCUS: Missing-Aware Region Representation with Contextual Urban Signals for Rent Prediction

MARCUS:结合上下文城市信号的缺失感知区域表示用于租金预测

Chenya Huang, Bin Liang, Zhidong Li, Yuxi Lu, Kunqi Li, Justin Wang, Fang Chen

机构 * The Property Investors Alliance(房地产投资者联盟)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 针对城市区域表示中缺失数据的语义价值被忽略问题,提出缺失感知区域表示模型MARCUS,将缺失视为城市信号,在悉尼和纽约租金预测任务上较基线显著降低MAE,性能最优。

Comments 10 pages, 7 figures, 4 tables. Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18696 2026-08-20 cs.CV cs.AI 新提交 62%

Impact of Iterative Fine-Tuning on Transcription Accuracy in Complex Historical Sanskrit Manuscripts

迭代微调对复杂历史梵文手稿转录准确率的影响

Kartik Chincholikar, Kaushik Gopalan, Mihir Hasabnis

机构 * Centre for Inter-disciplinary Artificial Intelligence (CAI)(跨学科人工智能中心(CAI)) FLAME University(火焰大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对复杂历史梵文手稿的OCR挑战,提出可在布局与外观层级迭代微调的传统OCR流水线,构建含精细标注的数据集,验证了迭代微调的性能提升并完成多模态大模型基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18410 2026-08-20 cs.LG 新提交 50%

Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies

用于高效视觉-语言-动作策略的角色条件子令牌路由

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智能技术公司)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏