arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-29 至 2026-04-29 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2601.12052 2026-04-29 cs.CV 79%

Task-Driven Prompt Learning: A Joint Framework for Multi-modal Cloud Removal and Segmentation

任务驱动的提示学习:多模态云去除与分割的联合框架

Zaiyan Zhang, Jie Li, Shaowei Shi, Qiangqiang Yuan

机构 * Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出TDP-CR框架,通过任务驱动的多模态方法联合实现云去除与土地覆盖分割,解决云遮挡导致的语义不一致问题,提升分析级数据质量。

Comments Accepted by IGARSS 2026 Conference (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14245 2026-04-29 cs.LG cond-mat.mtrl-sci cs.AI cs.CE q-bio.BM 79%

Curriculum-guided multimodal representation learning enables generalizable prediction of nanomaterial-protein interactions

基于课程引导的多模态表示学习可实现纳米材料-蛋白质相互作用的通用预测

Hengjie Yu, Kenneth A. Dawson, Haiyun Yang, Shuya Liu, Yan Yan, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所在先进科技研究院) Centre for BioNano Interactions, School of Chemistry, University College Dublin(都柏林大学学院化学系生物纳米相互作用中心) School of Biomolecular and Biomedical Science, UCD Conway Institute of Biomolecular and Biomedical Research(都柏林大学学院生物分子与生物医学科学系,康沃利斯生物分子与生物医学研究学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CuMMI模型,通过多阶段课程学习和大规模数据集,实现纳米材料-蛋白质相互作用的通用预测,验证了其在不同数据集上的鲁棒性和可迁移性。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08533 2026-04-29 cs.RO cs.AI 74%

ACROSS: A Deformation-Based Cross-Modal Representation for Robotic Tactile Perception

ACROSS: 一种基于变形的跨模态表示用于机器人触觉感知

Wadhah Zai El Amri, Malte Kuhlmann, Nicolás Navarro-Guerrero

机构 * L3S Research Center(L3S研究所以)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.AI

AI总结 本文提出ACROSS框架,通过利用传感器变形信息实现触觉数据跨传感器转换,将BioTac信号转换为DIGIT传感器数据,解决现有数据集在新设备上的应用问题。

Comments Accepted to 2025 IEEE Conference on Robotics and Automation (ICRA 2025). arXiv admin note: text overlap with arXiv:2410.14310

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12834 2026-04-29 cs.SD cs.AI eess.AS 62%

Gelina: Unified Speech and Gesture Synthesis via Interleaved Token Prediction

Gelina:通过交错标记预测实现统一的语音和手势合成

Téo Guichoux, Théodor Lemerle, Shivam Mehta, Jonas Beskow, Gustav Eje Henter, Laure Soulier, Catherine Pelachaud, Nicolas Obin

机构 * 1 ISIR, Sorbonne Universit\'e, Paris, France 2 STMS Lab -- IRCAM, Sorbonne Universit\'e, Paris, France 3 CNRS, France 4 Department of Speech, Music Hearing, KTH Royal Institute of Technology, Stockholm, Sweden

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 Gelina通过交错标记序列实现语音与手势的统一合成,支持多说话人和多风格克隆,提升语音与手势的同步性与语调对齐。

Comments Paper accepted at ICASSP 2026, 5 pages

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 16122-16126

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01070 2026-04-29 cs.CL 57%

How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning

如何通过强化学习解锁几何交错推理中的顿悟时刻

Xiangxiang Zhang, Caijun Jia, Siyuan Li, Dingyu He, Xiya Xiong, Zheng Sun, Honghao He, Yuchen Wu, Bihui Yu, Linzhuang Sun, Cheng Tan, Jingxuan Wei

机构 * ByteDance(字节跳动) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) Westlake University(西交大学) University of Chinese Academy of Science(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(教育部计算能力网络与信息安全重点实验室) Shandong Computer Science Center (National Supercomputer Center in Jinan)(山东省计算机科学中心(济南国家超算中心)) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文探讨了在几何交错推理中,通过强化学习框架Faire克服传统监督微调的局限性,实现更深层次的因果对齐,从而提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11544 2026-04-29 cs.RO cs.AI 57%

Visuo-Haptic Object Perception for Robots: An Overview

机器人视觉-触觉物体感知综述

Nicolás Navarro-Guerrero, Sibel Toprak, Josip Josifovski, Lorenzo Jamone

机构 * Advanced Robotics at Queen Mary (ARQ), School of Engineering and Materials Science, Queen Mary University of London(伦敦女王大学工程与材料科学学院先进机器人研究中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了机器人视觉-触觉物体感知的现状,探讨了生物基础、传感技术、计算方法及未来研究方向,强调多模态学习的挑战与应用进展。

Comments published in Autonomous Robots

Journal ref Autonomous Robots, 27 (2023) https://link.springer.com/article/10.1007/s10514-023-10091-y

详情

展开后加载摘要…

URL PDF HTML 收藏