arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-30 至 2026-04-30 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 8 篇

2505.20032 2026-04-30 cs.CV cs.LG cs.RO 86%

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

ViTaPEs: 视觉触觉位置编码用于多模态转换器中的跨模态对齐

Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert

机构 * Chair of Cyber-Physical Systems(感知系统教授席位) Institute of Machine Learning and Neural Computation(机器学习与神经计算研究所) Technical University of Leoben(莱比锡技术大学) Graz University of Technology(格拉茨技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(title);分类 cs.CV

AI总结 ViTaPEs通过两阶段位置注入学习任务无关的视觉触觉表示,提升多模态对齐性能,实验证明其在多种任务和领域中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21420 2026-04-30 cs.CV cs.CL 85%

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE:通过减少令牌数在MLLMs中实现更快更好的学习

Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 ReGATE通过参考引导的自适应令牌消除方法加速MLLM训练,减少计算量同时保持模型准确性,在多个基准测试中表现出色。

Comments ACL 2026. Project page: https://people-robots.github.io/regate

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26582 2026-04-30 cs.CV cs.AI 81%

Star-Fusion: A Multi-modal Transformer Architecture for Discrete Celestial Orientation via Spherical Topology

星融合:一种多模态变换器架构,通过球面拓扑实现离散天体定向

May Hammad, Menatallh Hammad

机构 * Department of Aerospace Informatics, Julius-Maximilians-Universität Würzburg(航空航天信息学系,乌尔姆-马克斯-普朗克大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Star-Fusion架构,通过球面拓扑分类解决天体定向问题,采用球面K-means聚类和多模态融合策略,实现高精度和高效定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26067 2026-04-30 cs.CV 79%

RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments

RADIO-ViPE:面向动态环境的在线紧密耦合多模态融合用于开放词汇语义SLAM

Zaid Nasser, Mikhail Iumanov, Tianhao Li, Maxim Popov, Jaafar Mahmoud, Sergey Kolyubin

机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab, ITMO University(生物机电学与高效能机器人实验室,ITMO大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 RADIO-ViPE通过在线多模态融合实现动态环境中开放词汇语义SLAM,无需校准RGB-D输入,结合视觉与语言嵌入提升地图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26313 2026-04-30 cs.CR cs.LG 78%

VulStyle: A Multi-Modal Pre-Training for Code Stylometry-Augmented Vulnerability Detection

VulStyle:一种多模态预训练用于代码风格度量增强的漏洞检测

Chidera Biringa, Ajmal Abbas, Vishnu Selvaraj, Gokhan Kul

机构 * University of Massachusetts Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 VulStyle通过融合函数级源代码、非终端AST结构和代码风格度量特征,提升漏洞检测性能,实现BigVul和VulDeePecker上的F1指标提升。

Comments 12 pages, 2 figures. Accepted at the 56th Annual IEEE/IFIP International Conference on Dependable Systems and Networks (DSN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26370 2026-04-30 cs.CV cs.LG math.AT 77%

Topology-Aware Representation Alignment for Semi-Supervised Vision-Language Learning

面向拓扑的表示对齐用于半监督视觉-语言学习

Junwon You, Mihyun Jang, Sangwoo Mo, Jae-Hun Jung

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出ToMA框架,通过持久同调识别拓扑显著边,利用跨模态对应关系对齐多模态表示,提升视觉-语言学习在遥感和时尚检索中的性能。

Comments 30 pages, 10 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14845 2026-04-30 cs.LG cs.AI 57%

Integrating Weather Foundation Model and Satellite to Enable Fine-Grained Solar Irradiance Forecasting

融合天气基础模型与卫星实现精细化太阳能辐照度预报

Ziqing Ma, Kai Ying, Xinyue Gu, Tian Zhou, Tianyu Zhu, Haifan Zhang, Peisong Niu, Zheng Wang, Cong Bai, Liang Sun

机构 * DAMO Academy, Alibaba Group(阿里集团达摩院) College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Baguan-solar框架,融合全球天气基础模型与高分辨率静止卫星图像,实现千米级24小时辐照度预报,优于现有基准模型,降低RMSE 16.08%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26427 2026-04-30 cs.IR 50%

CARD: Non-Uniform Quantization of Visual Semantic Unit for Generative Recommendation

CARD: 视觉语义单元的非均匀量化用于生成推荐

Yibiao Wei, Jie Zou, Pengfei Zhang, Xiao Ao, Weikang Guo, Zeyu Ma, Yang Yang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 CARD框架通过引入视觉语义单元统一文本、视觉和协同信号,提升生成推荐中高质SID学习,同时采用非均匀量化框架解决语义分布不均问题,实验显示其优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏