arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-27 至 2026-04-27 共收录 51 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2503.05231 2026-04-27 cs.RO cs.AI 79%

Kaiwu: A Multimodal Manipulation Dataset and Framework for Robot Learning and Human-Robot Interaction

Kaiwu:一种用于机器人学习和人机交互的多模态操控数据集和框架

Shuo Jiang, Haonan Li, Ruochen Ren, Yanmin Zhou, Zhipeng Wang, Bin He

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Kaiwu多模态数据集,解决复杂装配场景中缺失的真实同步多模态数据问题,通过20名受试者和30个交互对象,记录11,664个整合动作实例,支持机器人学习、精细操作、人类意图研究和人机协作。

Comments 8 pages, 5 figures, Submitted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 11, pp. 11482-11489, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22367 2026-04-27 cs.CL cs.AI 62%

CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

CNSL-bench:用于评估多模态大语言模型在中文国家手语理解能力的基准

Rui Zhao, Xuewen Zhong, Xiaoyun Zheng, Jinsong Su, Yidong Chen

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省-台湾非物质文化遗产数字化保护与智能处理重点实验室(XMU),文化和旅游部,中国) National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CNSL-bench,首个评估多模态大语言模型在中文国家手语理解能力的基准,通过权威 grounding、多模态覆盖和手部动作多样性,评估21个模型,发现当前模型在手语理解上仍显著劣于人类表现。

Comments Accepted as the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22333 2026-04-27 cs.CV cs.AI 62%

ChangeQuery: Advancing Remote Sensing Change Analysis for Natural and Human-Induced Disasters from Visual Detection to Semantic Understanding

ChangeQuery: 从视觉检测到语义理解,推动自然灾害和人为灾害的遥感变化分析

Dongwei Sun, Jing Yao, Kan Wei, Xiangyong Cao, Chen Wu, Zhenghui Zhao, Pedram Ghamisi, Jun Zhou, Jón Atli Benediktsson

机构 * School of Computer Science and Technology and the Ministry of Education Key Lab for Intelligent Networks and Network Security, Xi’an Jiaotong University(计算机科学与技术学院和教育部智能网络与网络安全重点实验室,西安交通大学) State Key Laboratory of Remote Sensing and Digital Earth, Aerospace Information Research Institute, Chinese Academy of Sciences(遥感与数字地球国家重点实验室,航空信息研究所,中国科学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克研究所) Lancaster Environment Centre, Lancaster University(兰卡斯特大学环境研究中心) Faculty of Electrical and Computer Engineering, University of Iceland(冰岛大学电气与计算机工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ChangeQuery通过多模态框架实现灾害情境感知,结合DICQ数据集和自动化标注管道,提升灾害监测的交互性和解释性,实现高精度的灾害量化与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22260 2026-04-27 cs.CV cs.AI 62%

Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset

迈向安全的移动性:由开放-ended视觉-语言数据集驱动的统一运输基础模型

Wenhui Huang, Songyan Zhang, Collister Chua, Yang Liang, Zhiqi Mao, Heng Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Land Transportation Dataset数据集和UniVLT模型,通过开放-ended视觉问答和多任务学习,提升城市交通环境下的安全推理能力,实现微观自动驾驶与宏观交通分析的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22305 2026-04-27 stat.AP 50%

Finite element model updating of building structures under seismic excitation: A parallelized latent space-based Bayesian framework

建筑结构在地震激励下的有限元模型更新:一种基于潜在空间的并行化贝叶斯框架

Taro Yaoyama, Sangwon Lee, Minoru Matsubara, Kenzo Kodera, Takeshi Ugata, Tatsuya Itoi

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种基于潜在空间的并行化贝叶斯框架,用于建筑结构在地震激励下的有限元模型更新,通过GPU加速实现高效不确定性量化和参数估计。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 6 篇

2604.22428 2026-04-27 cs.AI 79%

CognitiveTwin: Robust Multi-Modal Digital Twins for Predicting Cognitive Decline in Alzheimer's Disease

CognitiveTwin: 用于预测阿尔茨海默病认知衰退的稳健多模态数字孪生

Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

机构 * Department of Mechanical, Industrial & Manufacturing Eng.(机械、工业与制造工程系) The University of Toledo(托莱多大学) Department of Industrial Eng. and Mngt. Systems(工业工程与管理系统系) University of Central Florida(中央佛罗里达大学) Department of Statistics and Data Science(统计与数据科学系) Department of Internal Medicine(内科医学系)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 CognitiveTwin通过融合多模态纵向数据预测个体认知轨迹,展现高准确性和公平性,对缺失数据具有鲁棒性,适用于临床试验和个性化医疗。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22558 2026-04-27 cs.LG cs.AI 70%

SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

SOLAR-RL:半在线长 horizon 分配强化学习

Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, Lingfang Zeng

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang Lab(浙江实验室) CUHK MMLab(香港大学多模态实验室) Hubei University(湖北省大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。

Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19500 2026-04-27 cs.AI cs.CV cs.GR cs.LG 62%

Teaching an Agent to Sketch One Part at a Time

教代理分步绘制一部分

Xiaodan Du, Ruize Xu, David Yunis, Yael Vinker, Greg Shakhnarovich

机构 * TTI-Chicago(芝加哥大学技术研究所) University of Chicago(芝加哥大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种分步生成矢量草图的方法,通过多轮过程-奖励强化学习训练多模态语言模型代理,利用新数据集ControlSketch-Part实现可解释、可控且局部可编辑的文本到矢量草图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22685 2026-04-27 astro-ph.IM astro-ph.EP cs.NI cs.PF 50%

CosmicDancePro -- Measuring LEO satellite's orbital decay and network connectivity implications during solar storms

CosmicDancePro -- 评估太阳风暴期间低地球轨道卫星轨道衰减和网络连接影响

Suvam Basak, Amitangshu Pal, Debopam Bhattacherjee

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究利用CosmicDancePro工具分析太阳风暴对低地球轨道卫星网络的影响,揭示轨道衰减机制和网络连接降级现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20834 2026-04-27 cs.RO 50%

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17706 2026-04-27 cs.RO 50%

OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL

OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型

Haoxiang Jie, Yaoyuan Yan, Xiangyu Wei, Kailin Wang, Hongjie Yan, Zhiyou Heng, Daocheng Chen

机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) Omni AI(奥米尼人工智能) VBot East China Normal University(东华大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 6 篇

2604.16377 2026-04-27 cs.CL cs.CY 83%

GoCoMA: Hyperbolic Multimodal Representation Fusion for Large Language Model-Generated Code Attribution

GoCoMA:超几何多模态表示融合用于大语言模型生成代码归因

Nitin Choudhury, Bikrant Bikram Pratap Maurya, Bhavinkumar Vinodbhai Kuwar, Arun Balaji Buduru

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 GoCoMA通过超几何空间融合代码风格和二进制特征,提升大语言模型生成代码的归因准确性,在两个基准测试中优于单一模态和欧几里得多模态基线。

Comments Accepted to the International Conference on Multimedia & Expo (ICME) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03248 2026-04-27 cs.LG cs.AI cs.CV physics.med-ph 81%

Multimodal Neural Operators for Real-Time Biomechanical Modelling of Traumatic Brain Injury

多模态神经算子用于创伤性脑损伤的实时生物力学建模

Anusha Agarwal, Dibakar Roy Sarkar, Somdatta Goswami

机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态神经算子架构用于创伤性脑损伤的生物力学建模,通过融合体积解剖影像、人口特征和采集参数,预测全字段脑位移,验证了DeepONet在准确性、速度和参数量上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28717 2026-04-27 eess.AS 79%

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

层次化跨模态融合能否预测人工智能 dubbed 内容的人类感知?

Ashwini Dasare, Nirmesh Shah, Ashishkumar Gudmalwar, Pankaj Wasnik

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 eess.AS

AI总结 本文提出层次化跨模态架构,整合音频、视频和文本信息,通过轻量LoRA适配器实现多模态高效微调,利用主动学习优化客观指标,实现对AI dubbed内容的可扩展自动评估。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22177 2026-04-27 cs.CV 77%

Uni-Encoder Meets Multi-Encoders: Representation Before Fusion for Brain Tumor Segmentation with Missing Modalities

单编码器遇见多编码器:在缺失模态下的脑肿瘤分割中的表示学习前融合

Peibo Song, Xiaotian Xue, Jinshuo Zhang, Zihao Wang, Jinhua Liu, Shujun Fu, Fangxun Bao, Si Yong Yeo

机构 * School of Mathematics, Shandong University(山东大学数学学院) GSFS, The University of Tokyo(东京大学GSFS) MedVisAI Lab(医学视觉人工智能实验室) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) Centre of AI in Medicine, Singapore(新加坡医学人工智能中心)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出UniME方法,通过两阶段异构架构在缺失模态下实现脑肿瘤分割,通过单编码器和多编码器的结合提升分割精度。

Comments CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22281 2026-04-27 cs.CV 57%

DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

DocPrune:通过背景、问题和理解感知的令牌修剪实现高效的文档问答

Joonmyung Choi, Sanghyeok Lee, Jongha Kim, Sehyung Kim, Dohwan Ko, Jihyung Kil, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出DocPrune框架,通过背景、问题和理解感知的令牌修剪提升长文档理解效率,实验显示在M3DocRAG上提升了吞吐量和F1分数。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21750 2026-04-27 cs.LG 50%

From Words to Amino Acids: Does the Curse of Depth Persist?

从词到氨基酸:深度诅咒是否依然存在?

Aleena Siji, Amir Mohammad Karimi Mamaghan, Ferdinand Kapl, Tobias Höppe, Emmanouil Angelis, Andrea Dittadi, Maurice Brenner, Michael Heinzinger, Karl Henrik Johansson, Kaitlin Maile, Johannes von Oswald, Stefan Bauer

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz AI, Munich(慕尼黑海德堡研究所人工智能部门) KTH Royal Institute of Technology(皇家理工学院) Institute of Computational Biology, Helmholtz Munich(海德堡慕尼黑计算生物学研究所) Google, Paradigms of Intelligence Team(谷歌,智能范式团队)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究蛋白质语言模型中深度效率问题,通过分析七种主流PLM家族,发现任务相关计算集中在部分层,其余层主要提供预测细化,这一趋势在序列和多模态模型中均存在。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2604.22149 2026-04-27 eess.SY cs.SY 50%

Sampling-Based Safety Filter with Probabilistic Restrictiveness Guarantee

基于概率限制性的采样安全过滤器

Junyoung Park, Hyeontae Sung, Heejin Ahn

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种模块化采样安全过滤器,通过Stein变分模型预测控制生成控制序列样本,以保证任意名义控制器的安全性,并在复杂非凸环境中有效捕捉多模安全区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22065 2026-04-27 cs.RO cs.NA math.NA 50%

SNGR: Selective Non-Gaussian Refinement for Ambiguous SLAM Factor Graphs

SNGR:针对模糊SLAM因子图的选择性非高斯细化

Anushka Kulkarni, Sarthak Dubey

机构 * Northeastern University, Boston, MA, USA(东北大学,波士顿,马萨诸塞州,美国)

专题命中 其他多模态 :multimodal(abstract)

AI总结 SNGR通过在高斯近似可能失效的窗口中进行定向嵌套采样,提升SLAM精度并降低计算成本,适用于范围仅SLAM中的错误数据关联问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07080 2026-04-27 astro-ph.EP 50%

Magma Ocean Waves and Thermal Variability on Lava Worlds

火行星上的岩浆海洋波与热变异性

Mohammad Farhat, Eugene Chiang

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究火行星上岩浆海洋受潮汐力作用产生的波浪及热分布特征,揭示其潮汐加热机制和 mantle 中的热传导过程。

Comments Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09233 2026-04-27 cs.CY 50%

Secondary Bounded Rationality: A Theory of How Algorithms Reproduce Structural Inequality in AI Hiring

二级有限理性:算法如何在人工智能招聘中再现结构性不平等的理论

Jia Xiao

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出二级有限理性的理论,探讨算法如何通过技术和社会政治约束放大人类偏见,揭示AI招聘系统如何将历史不平等转化为看似 meritocratic 的结果,并提出缓解策略。

Comments This is not my current research interest; this work is very basic and naive

详情

展开后加载摘要…

URL PDF HTML 收藏