arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-20 至 2026-08-20 共收录 70 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2608.18396 2026-08-20 eess.SY 新提交 78%

LiDAR-Derived Surface Priors for Multimodal Sensing-Assisted NLoS Beam Search in Indoor 60-GHz Networks

室内60GHz网络中多模态传感辅助非视距波束搜索的激光雷达衍生表面先验

Amod Ashtekar, Dalton Davis, Rafaela Lomboy, Omar Ibrahim, Raj Sai Sohel Bandari, Mohammed E. Eltayeb

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract)

AI总结 该研究提出用激光雷达衍生的局部表面结构作为先验,结合射频测量,可将60GHz网络的波束对探测减少72%,同时保持74.5%位置的波束在详尽搜索的3dB范围内,降低毫米波波束搜索不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18546 2026-08-20 cs.LG 新提交 67%

MARCUS: Missing-Aware Region Representation with Contextual Urban Signals for Rent Prediction

MARCUS:结合上下文城市信号的缺失感知区域表示用于租金预测

Chenya Huang, Bin Liang, Zhidong Li, Yuxi Lu, Kunqi Li, Justin Wang, Fang Chen

机构 * The Property Investors Alliance(房地产投资者联盟)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 针对城市区域表示中缺失数据的语义价值被忽略问题,提出缺失感知区域表示模型MARCUS,将缺失视为城市信号,在悉尼和纽约租金预测任务上较基线显著降低MAE,性能最优。

Comments 10 pages, 7 figures, 4 tables. Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18696 2026-08-20 cs.CV cs.AI 新提交 62%

Impact of Iterative Fine-Tuning on Transcription Accuracy in Complex Historical Sanskrit Manuscripts

迭代微调对复杂历史梵文手稿转录准确率的影响

Kartik Chincholikar, Kaushik Gopalan, Mihir Hasabnis

机构 * Centre for Inter-disciplinary Artificial Intelligence (CAI)(跨学科人工智能中心(CAI)) FLAME University(火焰大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对复杂历史梵文手稿的OCR挑战,提出可在布局与外观层级迭代微调的传统OCR流水线,构建含精细标注的数据集,验证了迭代微调的性能提升并完成多模态大模型基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18410 2026-08-20 cs.LG 新提交 50%

Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies

用于高效视觉-语言-动作策略的角色条件子令牌路由

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智能技术公司)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 5 篇

2608.18953 2026-08-20 stat.ME 新提交 78%

Mixed Membership Model of Low-rank Matrices with Multimodal Extension

具有多模态扩展的低秩矩阵混合隶属度模型

David Snider, Zhongyuan Lyu, Jian Kang, Yuqi Gu

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对矩阵值数据提出带多模态扩展的低秩混合隶属度模型,兼具可解释群体原型与连续受试者隶属度,在模拟及人类连接组计划数据中表现优异,达极小极大最优重构率。

Comments 75 pages, 13 figures, 3 tables, including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02060 2026-08-20 cs.LG cs.AI 版本更新 70%

FiLoRA: Focus-and-Ignore LoRA for Controllable Feature Reliance

FiLoRA: 专注与忽略LoRA用于可控的特征依赖

Hyunsuk Chung, Soyeon Caren Han, Seungyeon Ji, Jinwoo Kim, Eun-Jung Holden, Kyungreem Han

机构 * University of Melbourne, Melbourne, Australia Brain Science Institute, Korea Institute of Science Department of Computer Science Engineering, Korea University, Seoul, Republic of Korea Division of Bio-Medical Science \& Technology, University of Science Technology KIST School, Seoul, Republic of Korea

专题命中 其他多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 FiLoRA通过指令条件门控实现对多模态模型内部特征依赖的可控调节,提升模型在虚假特征干预下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18228 2026-08-20 stat.ME 新提交 50%

Using Spacing to Detect Multi-Modality

利用间距检测多模态

Greg Kreider

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出利用间距特征检测多模态的方法,开发了含参数模型、游程分析等的检验方法,结合变点检测器定位间距变化,通过示例验证并总结了总体性能。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18181 2026-08-20 stat.ML cs.LG 新提交 50%

Fair Multi-View Determinantal Coresets via Adaptive NEPv

基于自适应NEPv的公平多视图行列式核心集

Richard Yi Da Xu

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究针对多视图子集选择的公平性问题,提出基于自适应NEPv的公平多视图行列式核心集方法,推导自适应SCF求解器并通过实验验证,为商标管理等场景提供了多视图多样性选择方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05973 2026-08-20 quant-ph 版本更新 50%

Distributions of Noisy Expectation Values over Sets of Measurement Operators

噪声期望值在测量算子集合上的分布

Matthew Duschenes, Roger G. Melko, Juan Carrasquilla, Raymond Laflamme

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文研究了在随机混合量子态下,测量算子集合的期望值分布,通过组合方法推导了矩表达式,并通过模拟哈尔随机砖块量子电路验证了有效全局去极化模型的适用性。

Comments 7+17 pages, 4+4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏