arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-27 至 2026-07-27 共收录 50 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2607.22118 2026-07-27 cs.HC 新提交 50%

An AI-Driven Virtual Patient for Breaking Bad News: An Expert Formative Study on Facial Expression Intensity

用于传达坏消息的人工智能驱动虚拟患者:面部表情强度的专家形成性研究

Steffen Hauck, Theresa Schell, Sophie Jörg, Jens Grubert

专题命中 多模态评测 :multi-modal(abstract)

AI总结 研究探讨大语言模型驱动的虚拟患者情感表达设计难题,提出结合大语言模型对话与实时面部动画的框架,通过对七位医学专家评估,发现专家通过多渠道评估情感真实感,为未来医学培训模拟器提出需同步多模态管道的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14021 2026-07-27 cs.RO 版本更新 50%

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

工业灵巧性基准测试:一个用于工业灵巧操作的硬件-软件基准测试平台

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

机构 * Analog Devices, Inc.(亚德诺半导体技术有限公司)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对工业灵巧操作瓶颈,提出从经典流程到端到端多模态模仿学习框架的转变,介绍了IDB板、DAG-ROS框架和AG-iDP3策略框架,通过数据中心电缆操作实验表明新策略在多方面优于传统方法,推动向可扩展机器人自动化发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05988 2026-07-27 cs.LG 版本更新 50%

Layer-wise LoRA fine-tuning: a similarity metric approach

逐层LoRA微调:相似性度量方法

Keith Ando Ogawa, Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出逐层LoRA微调方法,通过选择性微调部分层以减少可训练参数并保持预测性能,适用于不同架构和任务。

Comments Accepted at the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 1 篇

2607.21653 2026-07-27 cs.LG cs.CL cs.DC 新提交 57%

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt:用于智能体强化学习的可扩展原生 PyTorch 训练框架

Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

机构 * NVIDIA(英伟达)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 研究针对智能体强化学习中算法修改成本高的问题,提出原生 PyTorch 训练框架 Molt,其代码简洁,智能体是普通程序,通过异步循环训练策略,在全异步协议下性能与先进堆栈相当,且开源提供资源。

Comments tech report for Molt

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 14 篇

2607.22043 2026-07-27 cs.CL cs.CV 新提交 86%

Scaling Native Multimodal Pre-Training From Scratch

从零开始扩展原生多模态预训练

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯大语言模型部)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

AI总结 研究在固定计算预算下训练基于Transformer的视觉语言模型的最优模型大小和token数量,发现语言和多模态目标扩展行为不同,推导效率前沿,还表明原生多模态预训练能促进跨模态转移,为扩展多模态基础模型奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22013 2026-07-27 cs.CV cs.AI 新提交 84%

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

用于多模态思维链推理的视觉显著性引导蒸馏

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态思维链推理在小模型中存在的问题,提出视觉显著性引导蒸馏方法,利用多模态大语言模型注意力图生成扰动图像,经奇异值分解提取引导向量指导层间蒸馏,实验证明该方法能改进推理生成和答案推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21600 2026-07-27 cs.AI 新提交 83%

Securing Multimodal AI through Internal Information Decomposition

通过内部信息分解保护多模态人工智能

Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型的攻击问题,提出FlowGuard框架,通过监测内部多模态一致性检测有害输入,受部分信息分解启发得出FlowVectors量化相关指标,有效降低攻击成功率且减少效用损失和延迟,为多模态推理提供有效防御。

Comments Accepted as Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22408 2026-07-27 cs.LG 新提交 82%

LunarFM: A Shared Multimodal Representation of the Moon's Surface

LunarFM:月球表面的共享多模态表示

Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-Pollán

机构 * University of Cambridge(剑桥大学) German Aerospace Center (DLR)(德国航空航天中心) SPAIDER SPACE(斯派德太空公司) Mines Paris - PSL University(巴黎矿业学院 - 巴黎文理研究大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) European Space Resources Innovation Center (ESRIC)(欧洲空间资源创新中心) Universidad de Antioquia(安蒂奥基亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 因月球探索需求,针对多源观测致月球表面分析碎片化问题,提出LunarFM多模态基础模型,融合多仪器观测学习通用表示,支持多种下游应用,还提供相关数据集、预训练模型等,助力月球表面高效分析。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22035 2026-07-27 cs.LG 新提交 82%

DCS: A Unified Conditional Sensitivity Framework for Cross-Modal Copyright Infringement Detection

DCS:用于跨模态版权侵权检测的统一条件敏感度框架

Xiafeng Man

机构 * Fudan University(复旦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 研究针对基础模型版权侵权检测问题,提出统一的DCS框架,将侵权证据视为反事实条件分布转移,通过条件差分隐私形式化,创建双分支并结合多种因素界定敏感度,还定义校准统计量,适用于多种模型并以不同方式评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22422 2026-07-27 physics.flu-dyn cs.AI 新提交 79%

PRIMS: Physics-guided Representation for Fluid Identification in Multimodal Sensing

PRIMS:多模态传感中用于流体识别的物理引导表示

Hai-Long Nguyen, Trung Thanh Nguyen, Lars Holm, Dennis Alveringh, Duc Viet Le

机构 * University of Twente(特文特大学) Nagoya University(名古屋大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对微流体应用中流体识别挑战,提出PRIMS物理感知多模态Transformer,通过三个模块集成物理知识于表示学习和注意力机制,实现可解释、数据高效的流体分类,实验显示其性能优越且鲁棒性强。

Comments 2026 European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21660 2026-07-27 cond-mat.mtrl-sci cs.AI cs.LG 新提交 79%

Generative and multimodal AI for materials prediction and design: Progress, challenges, and perspectives

用于材料预测和设计的生成式和多模态人工智能:进展、挑战与展望

Xianyuan Liu, Charles Anjah, Benjamin E. Jolly, Jonathon F. S. Markanday, Joshua Berry, Haolin Wang, Nicola A. Morley, Robert D. J. Oliver, Alexandra J. Ramadan, Delvin Ce Zhang, Katerina A. Christofidou, Haiping Lu

机构 * School of Computer Science, University of Sheffield, Sheffield, UK(计算机科学学院,谢菲尔德大学) Centre for Machine Intelligence, University of Sheffield, Sheffield, UK(智能机器研究中心,谢菲尔德大学) School of Chemical, Materials and Biological Engineering, University of Sheffield, Sheffield, UK(化学、材料与生物工程学院,谢菲尔德大学) Henry Royce Institute, Royce Discovery Centre, University of Sheffield, Sheffield, UK(亨利·罗伊奇研究所,谢菲尔德大学) Materials Nexus Ltd., Salisbury House, Cambridge, UK(材料 nexus 有限公司,剑桥,英国) School of Mathematical and Physical Sciences, University of Sheffield, Sheffield, UK(数学与物理科学学院,谢菲尔德大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨生成式和多模态人工智能在材料预测与设计中的应用,引入材料属性层次结构框架,指出当前证据局限,强调需全社区标准支持多模态相关建模与基准测试,以设计具科学和实际新颖性、可实验实现的材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22147 2026-07-27 cs.CV 新提交 57%

Visual Relocalization from Sparse Views in Aliased and Low-Texture Environments via Novel View Synthesis

通过新视图合成在别名和低纹理环境中从稀疏视图进行视觉重定位

Maria Peribañez, Javier Civera, Rudolph Triebel, Riccardo Giubilato

机构 * University of Zaragoza(萨拉戈萨大学) German Aerospace Center (DLR)(德国航空航天中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对类行星地形中视觉定位难题,提出基于 3D 高斯溅射构建可微地图表示估计相机姿态的方法,采用结合光度与几何损失的几何感知训练策略,经实验验证能有效提升定位准确性与姿态估计鲁棒性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22078 2026-07-27 cs.CV 新提交 57%

CommandLM: Data driven behavior level descriptor for ego vehicles

CommandLM:用于自动驾驶车辆的数据驱动行为级描述符

Boris Tokic, Constantin Selzer, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对自动驾驶系统中可解释行为级决策需求,提出多模态大语言模型CommandLM,通过融合多传感器数据生成行为描述,经特定训练和适配器处理,实验表现优于基线,人工评估显示其输出可助力行为审计,实现高效透明的行为级理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21624 2026-07-27 cs.AI cs.DC cs.LG 新提交 57%

FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs

FBLayout:为在移动GPU上高效微调大语言模型优化内存布局

Kahou Tam, Wei Niu, Yu Bao, Xiaomin Ouyang, Chengzhong Xu, Li Li

机构 * University of Macau(澳门大学) University of Georgia(佐治亚大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 研究针对移动GPU上Transformer模型微调内存低效问题,提出FBLayout框架,通过统一布局、索引转换及激活引导选择等方法,在多手机多模型测试中实现加速,提高缓存效率并减少内存占用,助力设备上大模型微调。

Comments 13 pages, 21 figures, Mobisys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18681 2026-07-27 cs.CV 版本更新 57%

Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs

超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型

Jaeyeon Lee, Shunjie Wen, Dong-Wan Choi

机构 * Inha University(延世大学)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 提出SPARE方法,将令牌剪枝重构为子空间重建问题,通过迭代选择投影残差大的令牌进行剪枝,并引入反相关性机制保留上下文信息,在LLaVA上剪枝94%令牌仍保持95%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22271 2026-07-27 cond-mat.mtrl-sci 新提交 56%

SAGE-Net: Semantics-Augmented Geometric Encoder for Material Property Prediction

SAGE-Net:用于材料属性预测的语义增强几何编码器

Guanghui Zhang, Yuxuan Yao, Kieran B. Spooner, Jun Yin, Dan Han, David O. Scanlon, Lijun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(comments)

AI总结 研究针对材料属性预测,提出语义增强几何编码器网络SAGE-Net,通过语义引导消息传递将晶体学语义注入几何消息传递,在多基准测试中表现出色,能有效捕捉晶体学特征,是深度集成多模态材料学习的通用可转移框架。

Comments 29 pages, 5 figures, multi-modal network

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21899 2026-07-27 cs.SD 新提交 50%

CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following

CODA:用于基于图像的实时乐谱跟随的级联在线不连续感知对齐

Yining Yang, Ruogu Chen, Jie Han

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文针对实时乐谱跟随难题,提出CODA系统。它利用乐谱级联结构增强预测一致性,通过静音驱动中断模式实现不连续恢复。在多模态乐谱数据集钢琴基准测试中,CODA在实时吞吐量下取得了领先的跟踪精度和不连续恢复性能。

Comments 8 pages, 3 figures, accepted by the International Society for Music Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21921 2026-07-27 cs.CE math-ph math.MP 新提交 50%

Learning Population-Level Dynamics through a Latent Fokker--Planck Model and Discrepancy Transport Maps

通过潜在福克 - 普朗克模型和差异传输映射学习总体水平动力学

Chengyang Huang, Krishna Garikipati

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对科学和工程系统概率分布动力学未知问题,提出总体水平推理框架,通过潜在福克 - 普朗克模型和差异传输映射恢复潜在随机动力学,经正则化联合学习,能准确重建复杂概率演化,为动力学推理提供通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 2 篇

2607.22330 2026-07-27 stat.ME eess.SP 新提交 50%

A Hierarchical Likelihood Model for Non-linear Inverse Problems under Additive and Multiplicative Noise

一种用于加性和乘性噪声下非线性逆问题的分层似然模型

Nicolas Goeman, Pierre-Antoine Thouvenin, Pierre Chainais

专题命中 其他多模态 :multimodal(abstract)

AI总结 针对加性和乘性噪声下的非线性逆问题,提出通用分层贝叶斯模型及高效MCMC算法。该方法无需校准近似模型超参数,更通用。通过天文学合成数据评估,在逐点估计和计算成本上达最优,为从业者选模型提供指导。

Comments 10 pages, 6 figures, 4 algorithms, 2 tables, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02441 2026-07-27 cs.RO 版本更新 50%

Adaptive Learned State Estimation based on KalmanNet

基于KalmanNet的自适应学习状态估计

Arian Mehrfard, Bharanidhar Duraisamy, Stefan Haag, Florian Geiss, Mirko Mählisch

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Institute for Autonomous Driving, University of the Bundeswehr Munich(慕尼黑联邦国防军大学自动驾驶研究所)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出AM-KNet,通过引入传感器特定的测量模块和超网络实现多传感器自动驾驶中的自适应状态估计,提升真实世界汽车数据的估计精度和跟踪稳定性。

Comments Pending release approval from company

详情

展开后加载摘要…

URL PDF HTML 收藏