arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-25 至 2026-05-25 共收录 66 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2605.23033 2026-05-25 cs.LG cs.AI 57%

Uncovering the Latent Potential of Deep Intermediate Representations

揭示深度中间表示的潜在能力

Arnesh Batra, Arush Gumber, Aniket Khandelwal, Jashn Khemani, Anubha Gupta

机构 * SBILab, Indraprastha Institute of Information Technology Delhi, Delhi, India(SBILab,印度德里印度理工学院信息技术学院,德里,印度)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 通过几何与实证研究,提出层最优嵌入选择(LOES)和几何正则化损失(GeoReg),以非单调分布的任务相关信息选择判别性子空间并稳定表示几何,在多种架构和模态下优于基线方法。

Comments Accepted to ICML2026 as a Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02780 2026-05-25 cs.AI cs.LG 57%

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Yi Li, Yan Sun, Boyu Wang, Pingzhao Hu

机构 * Department of Computer Science, Western University, London, Canada(加拿大伦敦西方大学计算机科学系) Department of Biochemistry, Western University, London, Canada(加拿大伦敦西方大学生物化学系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出Cuttlefish,一种统一多模态大语言模型,通过缩放感知适配器和几何基础适配器,自适应调整结构令牌数量并注入几何线索,以提升异构结构推理性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23477 2026-05-25 cs.RO 50%

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation

语义结构化混合专家用于组合机器人操作

Chengyu Deng, Guanqi Chen, Yizhou Chen, Zejia Liu, Zhiwen Ruan, Guanhua Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出语义结构化混合专家扩散策略(SMoDP),通过视觉语言模型标注的技能语义指导专家专业化,实现参数高效的多任务组合操作。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22941 2026-05-25 cs.LG 50%

Hazard-Responsive Digital Twin for Climate-Driven Urban Resilience and Equity

面向气候驱动的城市韧性与公平的灾害响应数字孪生

Zhenglai Shen, Hongyu Zhou

机构 * Buildings and Transportation Science Division, Oak Ridge National Laboratory(奥克伍德国家实验室建筑与交通科学部门) Civil and Environmental Engineering, University of Tennessee(田纳西大学土木与环境工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种灾害响应数字孪生(H-RDT),结合物理信息神经网络、多模态数据融合和公平感知风险分析,在合成区域中验证其能维持温度预测稳定性、自适应融合多源数据、识别高脆弱性区域,并通过前瞻性干预降低热风险。

Comments 52 pages, 9 figures

Journal ref Sustainable Cities and Society 144 (2026) 107413

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 2 篇

2602.01449 2026-05-25 math.NA cs.NA math.PR stat.ML 78%

Dimension-Free Multimodal Sampling via Preconditioned Annealed Langevin Dynamics

无维度多模态采样:基于预处理退火朗之万动力学

Lorenzo Baldassari, Josselin Garnier, Knut Solna, Maarten V. de Hoop

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对函数空间问题有限维近似细化下保持稳定的多模态目标采样算法,提出预处理退火朗之万动力学,在谱条件下实现维度一致的时间复杂度内的高斯混合目标采样。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19812 2026-05-25 cs.LG 50%

Eye Gaze-Informed and Context-Aware Pedestrian Trajectory Prediction in Shared Spaces with Automated Shuttles: A Virtual Reality Study

共享空间中自动穿梭车与行人的眼动知情与情境感知轨迹预测:一项虚拟现实研究

Danya Li, Yan Feng, Rico Krueger

机构 * Department of Technology, Management and Economics at the Technical University of Denmark(丹麦技术大学技术、管理与经济学系) Department of Transport & Planning, Civil Engineering Geosciences at Delft University of Technology(代尔夫特理工大学交通运输与规划、土木工程与地质科学系)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 通过虚拟现实实验收集行人与自动穿梭车交互时的眼动、头部朝向和运动数据,开发多模态预测模型,发现眼动信息在特定角度下对轨迹预测有显著贡献,与情境信息结合可降低最终位移误差8.47%。

详情

展开后加载摘要…

URL PDF HTML 收藏