arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-02 至 2026-06-02 共收录 31 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 31 篇

2606.00909 2026-06-02 cs.CL cs.AI 93%

MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models

MLLM-Microscope:解锁多模态大语言模型中的隐藏结构

Ravil Mussabayev, Rustam Mussabayev

机构 * Satbayev University(萨特拜耶夫大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MLLM-Microscope系统,通过分析线性度、内在维度和各向异性,揭示多模态大语言模型中隐藏的表示结构,并基于ScienceQA数据集评估LLaVA-NeXT和OmniFusion,发现模态融合方式显著影响模型内部工作机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02941 2026-06-02 cs.CV 85%

MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion

MMTalker: 多分辨率3D说话头合成与多模态特征融合

Bin Liu, Zhixiang Xiong, Zhifen He, Bo Li

机构 * IEEE Publication Technology Group(IEEE出版技术组) Piscataway, NJ(新泽西州皮萨卡威)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出一种基于多分辨率表示和多模态特征融合的3D语音驱动面部动画合成方法MMTalker,通过网格参数化、非均匀可微采样、残差图卷积网络和双交叉注意力机制,实现高唇同步精度和逼真面部表情。

Comments This article presents only the preliminary research results, which are not yet complete and lack necessary supplementary experiments. The author has decided to withdraw it to improve the research work, and will submit a more complete version in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00170 2026-06-02 cs.HC cs.AI cs.CV 84%

UF-AMA: A unified framework for cross-domain emotion recognition via adaptive multimodal alignment

UF-AMA: 通过自适应多模态对齐的跨域情感识别统一框架

Zheng Wang, Shuo Wang, Junhong Wang

机构 * Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Department of Electronic Engineering and Information Science, University of Science and Technology of China(中国科学技术大学电子工程与信息科学系) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种统一框架UF-AMA,利用自适应多模态对齐和置信度感知筛选机制,解决跨主体和跨会话的生理信号情感识别中的分布偏移问题,在SEED和SEED-IV数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01558 2026-06-02 cs.CV 83%

Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning

注意力引导的多模态大语言模型微调提升思维链推理能力

Sanchit Sinha, Guangzhi Xiong, Bohan Liu, Zhenghao He, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型中思维链推理效果不佳的问题,提出注意力引导的微调目标Attentive-CoT,通过延迟答案承诺和维持视觉令牌访问来提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01837 2026-06-02 cs.CR 82%

Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition

良性输入,有害输出:通过分布式语义重组的跨模态越狱

Yani Wang, Yilong Yang, Yang Liu, Zhuzhu Wang, Zuobin Ying, Zhuo Ma

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 提出分布式语义重组(DSR)框架,将有害意图分解为良性文本和视觉基元,利用多模态大模型的推理能力在跨模态推理阶段融合为有害输出,实现高攻击成功率且输入毒性极低。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01047 2026-06-02 cs.RO 82%

Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation

学习多模态轨迹策略以实现数据高效的机器人操作

Zijia Chen, Yuenan Hou, Xinhua Jiang, Yu Li, Weijie Li, Li Liu

机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学学院,国防科技大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 针对机器人操作中数据稀缺导致的多模态干扰问题,提出基于混合专家模型的多模态轨迹预测框架MATE,通过细粒度子令牌特征解耦和跨模态余弦路由器实现稳定专家分配,在LIBERO基准和真实乒乓球实验中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00445 2026-06-02 cs.CV cs.AI cs.LG 81%

DarkVesselNet: Multi-Modal Remote Sensing and Trajectory Reasoning for Dark Vessel Detection

DarkVesselNet: 用于暗船检测的多模态遥感和轨迹推理

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出DarkVesselNet,融合Sentinel-1 SAR、Sentinel-2光学影像、地理空间基础模型、AIS轨迹推理、TGARD间隙检测和Pi-DPM异常头,实现多模态遥感暗船检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-06-02 cs.CL 79%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02352 2026-06-02 cs.CV 79%

Multi-modal Video Representation Alignment for Robust Self-supervised Driver Distraction Detection

多模态视频表示对齐用于鲁棒的自监督驾驶员分心检测

David J. Lerch, Livien Majer, Zeyun Zhong, Manuel Martin, Frederik Diederichs, Rainer Stiefelhagen

机构 * Fraunhofer IOSB(弗劳恩霍夫智能系统研究所) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出一种多模态全局对齐框架,通过软目标和加权机制处理错误负样本和不可靠正样本,在Drive&Act数据集上优于现有方法,实现鲁棒的驾驶员分心检测。

Comments Accepted at the IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01543 2026-06-02 cs.CV 79%

PathAR: Structure-First Autoregressive Synthesis of Multimodal Pathology Images

PathAR: 结构优先的多模态病理图像自回归合成

Yuan Zhang, Jiahao Xia, Junzhang Huang, Meng Wang, Feng Chen, Guanyu Yang, Huazhu Fu

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其交叉应用重点实验室(东南大学),教育部) Centre for Innovation and Precision Eye Health, Yong Loo Lin School of Medicine, National University of Singapore(创新与精准眼健康中心,新加坡国立大学 Yong Loo Lin 医学院) Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore(眼科学系,新加坡国立大学 Yong Loo Lin 医学院) Department of Biostatistics, Center for Global Health, School of Public Health, Nanjing Medical University(生物统计学系,全球健康中心,南京医科大学) Institute of High-Performance Computing, Agency for Science, Technology and Research(高性能计算研究所,科技研究局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出PathAR,一种结构优先的自回归合成框架,通过显式分解结构与外观并使用交错自回归Transformer,实现模态标签条件下的病理图像生成,改善结构一致性和模态保真度。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01207 2026-06-02 cs.CV cs.LG 79%

Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning

特征对齐决定融合策略:多模态学习中交叉注意力与拼接的比较研究

Zhiqiang Zhou, Xuezhen Xie

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化学工业职业技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 通过实验和理论分析,证明特征对齐质量而非数据规模是决定多模态融合策略优劣的关键因素,当特征预对齐时拼接优于交叉注意力。

Comments 8 pages,6 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00991 2026-06-02 cs.AI 79%

Large Language Models in Transportation Systems Management and Operations: From Text Reasoning to Multi-modal Decision Support

交通系统管理与运营中的大语言模型:从文本推理到多模态决策支持

Siyan Li, Zehao Wang, Jiachen Li, Kanok Boriboonsomsin, Matthew J. Barth, Guoyuan Wu

机构 * Bourns College of Engineering, Center for Environmental Research and Technology, University of California at Riverside, CA, USA(伯恩斯工程学院,环境研究与技术中心,加州大学河滨分校,美国,加利福尼亚州河滨)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文综述了大语言模型(LLM)和多模态大语言模型(MM-LLM)在交通系统管理与运营(TSMO)中的应用,涵盖运营与服务、移动性与车队服务、数据建模与决策支持三大领域,并指出了数据异构性、实时推理、可解释性等挑战及未来方向。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04509 2026-06-02 cs.CL 79%

Model-Dowser: Data-Free Importance Probing to Mitigate Catastrophic Forgetting in Multimodal Large Language Models

Model-Dowser:无数据重要性探测以缓解多模态大语言模型中的灾难性遗忘

Hyeontaek Hwang, Nguyen Dinh Son, Daeyoung Kim

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 提出Model-Dowser,一种基于重要性评分的稀疏微调方法,通过联合考虑权重幅度、输入激活和输出敏感性来缓解多模态大语言模型微调中的灾难性遗忘,在LLaVA和NVILA上优于现有方法。

Comments Accepted at ICML 2026. Code link: https://model-dowser.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23694 2026-06-02 cs.RO cs.AI 79%

Interpretable Multimodal Gesture Recognition for Drone and Mobile Robot Teleoperation via Log-Likelihood Ratio Fusion

基于对数似然比融合的可解释多模态手势识别用于无人机和移动机器人遥操作

Seungyeol Baek, Jaspreet Singh, Lala Shakti Swarup Ray, Hymalai Bello, Paul Lukowicz, Sungho Suh

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Computer Science, RPTU Kaiserslautern-Landau(计算机科学系,RPTU凯撒斯劳滕-兰道) Embedded Intelligence, German Research Center for Artificial Intelligence (DFKI)(嵌入式智能,德国人工智能研究中心(DFKI))

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种融合腕戴式Apple Watch惯性数据和定制手套电容传感信号的多模态手势识别框架,利用对数似然比后期融合策略提升性能并提供可解释性,在降低计算成本的同时达到与视觉基线相当的识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06163 2026-06-02 eess.IV cs.CV cs.LG physics.med-ph 79%

Cross-Modal Fine-Tuning of 3D Convolutional Foundation Models for ADHD Classification with Low-Rank Adaptation

基于低秩适应的3D卷积基础模型跨模态微调用于ADHD分类

Jyun-Ping Kao, Shinyeong Rho, Shahar Lazarev, Hyun-Hae Cho, Fangxu Xing, Taehoon Shin, C. -C. Jay Kuo, Jonghye Woo

机构 * National Institute of Mental Health, National Institutes of Health(国家精神卫生研究所,国立卫生研究院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出一种参数高效的迁移学习方法,通过3D低秩适应(LoRA)将预训练于CT图像的3D卷积基础模型微调至MRI的ADHD分类任务,在公开扩散MRI数据集上达到71.9%准确率和0.716 AUC,仅需164万可训练参数。

Comments Accepted for presentation at the IEEE International Symposium on Biomedical Imaging (ISBI) 2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13774 2026-06-02 cs.LG cs.CV 79%

UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial Representations

UrbanFusion: 用于鲁棒空间表示对比学习的随机多模态融合

Dominik J. Mühlematter, Lin Che, Ye Hong, Martin Raubal, Nina Wiedemann

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出UrbanFusion模型,通过随机多模态融合(SMF)和Transformer模块整合街景、遥感、地图和POI数据,在56个城市41项任务中优于现有GeoAI模型。

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01334 2026-06-02 cs.CV 74%

HOLA: Holistic Multi-Modal Alignment for Open-Set 3D Recognition

HOLA: 面向开放集3D识别的全息多模态对齐

Koby Aharonov, Oren Shrout, Ayellet Tal

机构 * Technion – Israel Institute of Technology(技术ion-以色列理工学院)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

AI总结 提出HOLA方法,通过解耦多正例对比损失和对齐点云与多视图图像及文本描述,实现开放集3D识别中的全息多模态对齐,在长尾基准上取得最先进零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00471 2026-06-02 cs.CV 70%

MUSCLE-NET: Predicted-Multiscale-Aware Network for Pedestrian Trajectory Forecasting

MUSCLE-NET:面向行人轨迹预测的预测多尺度感知网络

Yu Liu, Ming Huang, Xiao Ren, Zhijie Liu, Youfu Li, He Kong

机构 * Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, School of Automation and Intelligent Manufacturing, Southern University of Science and Technology (SUSTech), Shenzhen(广东省全主动系统控制理论与技术重点实验室,自动化与智能制造学院,南方科技大学(SUSTech),深圳) Department of Mechanical Engineering, City University of Hong Kong, Hong Kong SAR, China(香港城市大学机械工程系,香港特别行政区,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MUSCLE-NET,通过多尺度多模态特征提取和尺度自适应预测机制,解决现有方法对观测信息利用不足及忽视未来运动尺度依赖的问题,在JAAD和PIE数据集上取得竞争性能。

Comments This manuscript has been accepted to the IEEE Transactions on Intelligent Transportation Systems as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00508 2026-06-02 cs.CV cs.AI 62%

V-LynX: Token Interface Alignment for Video+X LLMs

V-LynX: 视频+X 大语言模型的令牌接口对齐

Jungin Park, Jiyoung Lee, Kwanghoon Sohn

机构 * Yonsei University, Seoul, South Korea(延世大学,首尔,韩国) Ewha Womans University, Seoul, South Korea(成均馆大学,首尔,韩国)

专题命中 多模态训练与对齐 :audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文发现视频大语言模型中存在令牌接口连续流形,并提出V-LynX框架,通过轻量辅助路径对齐注意力响应和统计分布,无需配对监督即可集成新模态,在音视频问答、3D推理等任务上达到最优效率。

Comments ICML 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02374 2026-06-02 cs.AI 57%

Spatial Representation Learning Beyond Pixels: Unifying Raster Data and Vector Semantics for Human-Centric Geospatial Foundation Models

超越像素的空间表示学习:统一栅格数据和向量语义以构建以人为中心的地理空间基础模型

Steffen Knoblauch, Hao Li, Gengchen Mai, Konstantin Klemmer, Song Gao, WenWen Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出统一栅格感知与向量推理的联合空间表示学习范式,旨在解决当前地球观测基础模型仅依赖栅格模态、忽略向量数据中丰富结构化信息的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01671 2026-06-02 cs.CL 57%

When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models

当意义旅行:混合专家模型在语言模型习语理解中的细粒度作用

Sarmistha Das, Vaibhav Vishal, Shreyas Guha, Amaan Ali, Kitsuchart Pasupa, Sriparna Saha

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) School of Information Technology, King Mongkut’s Institute of Technology Ladkrabang, Thailand(泰国拉差班国王理工大学信息科技学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 针对低资源东南亚语言中习语的文化隐喻复杂性,提出Varnika多模态习语语料库和混合专家模型HybridMoE,通过控制混合和掩码多模态嵌入缓解专家稀疏性,实现习语理解性能提升5-6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00746 2026-06-02 cs.CV cs.LG 57%

Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

将并行序列模型扩展到基础规模的视觉编码器

Yitong Jiang, Hongjun Wang, Collin McCarthy, Hanrong Ye, David Wehr, Xinhao Li, Qi Dou, Tianfan Xue, Ka Chun Cheung, Simon See, Wonmin Byeon, Ke Chen, Kai Han, Jinwei Gu, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 提出C-GSPN,一种基于2D空间传播的基础规模视觉编码器,通过快速CUDA内核、压缩潜在空间传播块和两阶段交叉算子蒸馏,在减少参数的同时提升性能并实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00602 2026-06-02 cs.CV 57%

ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training

ASAP: 基于解剖感知语义自适应预训练的医学体素表示学习

Rongsheng Wang, Fenghe Tang, Zihang Jiang, Yingtai Li, Xu Zhang, Haoran Lai, Wenxin Ma, Wei Wei, Zhiyang He, Xiaodong Tao, Rui Yan, Qingsong Yao, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE) Lab, YRD-RIGHT, USTC Suzhou Institute for Advanced Research(医学影像、机器人、分析计算与学习(MIRACLE)实验室,YRD-RIGHT,中国科学技术大学苏州研究院) Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology(江苏省多模态数字孪生技术重点实验室) Biomedical Basic Research Center (BBRC) of Jiangsu Province(江苏省生物医学基础研究中心) Department of Radiology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, USTC(放射科,中国科学技术大学第一附属医院,生命科学与医学系,中国科学技术大学) Anhui IFLYTEK CO., Ltd(安徽科大讯飞股份有限公司) School of Medicine, Stanford University(医学院,斯坦福大学) State Key Laboratory of Precision and Intelligent Chemistry, Hefei, Anhui, China(安徽省精密与智能化学重点实验室,合肥,安徽,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出ASAP框架,通过解剖感知知识注入、语义自适应对齐与融合,从胸部CT扫描和放射学报告中学习可迁移且可解释的体素表示,在15个数据集和22个下游任务上取得最先进性能。

Comments MICCAI2025 extention

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23161 2026-06-02 cs.AI 57%

PATRA: Pattern-Aware Alignment and Balanced Reasoning for Time Series Question Answering

PATRA: 面向时间序列问答的模式感知对齐与平衡推理

Junkai Lu, Peng Chen, Xingjian Wu, Yang Shu, Chenjuan Guo, Christian S. Jensen, Bin Yang

机构 * East China Normal University, Shanghai, China(华东师范大学) Aalborg University, Aalborg, Denmark(奥胡斯大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 针对现有LLM方法在时间序列推理中忽略模式提取和简单任务主导学习的问题,提出模式感知对齐与平衡推理模型PATRA,通过提取趋势和季节模式实现深度对齐,并设计任务感知平衡奖励以协调不同难度任务的学习,在多种时间序列问答任务中优于强基线。

Comments Accepted By ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06331 2026-06-02 cs.CV 57%

WorldCache: Accelerating World Models for Free via Heterogeneous Token Caching

WorldCache: 通过异构令牌缓存免费加速世界模型

Weilun Feng, Guoxin Fan, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Dingrui Wang, Longlong Liao, Michele Magno, Yongjun Xu, Chuanguang Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 针对扩散世界模型中令牌异质性和非均匀时间动态导致的推理慢问题,提出基于曲率引导的异构令牌预测和混沌优先自适应跳过的缓存框架WorldCache,实现高达3.7倍加速并保持98%的推出质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11832 2026-06-02 cs.AI cs.LG 57%

Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning

安全幻象:虚假相关性如何破坏VLM安全微调及通过机器遗忘缓解

Yiwei Chen, Yuguang Yao, Yihua Zhang, Bingquan Shen, Gaowen Liu, Sijia Liu

机构 * Michigan State University(密歇根州立大学) National University of Singapore(新加坡国立大学) Cisco Research(思科研究)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文发现视觉语言模型(VLM)的安全微调存在“安全幻象”,即虚假相关性导致脆弱性,并提出机器遗忘作为替代方案,显著降低攻击成功率和不必要拒绝。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01836 2026-06-02 eess.IV 50%

Face Liveness Detection Using RGB and Thermal Image Fusion

使用RGB和热成像融合的人脸活体检测

Merve Erşan, Melike Girgin, Tayfun Akgül

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种融合RGB图像边缘信息与热成像的方法,利用自定义ARISTOF数据集和YOLOv8-Face模型,有效提升人脸活体检测的鲁棒性。

Comments Published in ELECO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01745 2026-06-02 cs.SI 50%

Enhancing the Socioeconomic Understanding of Foundation Models with Urban Mobility

利用城市流动性增强基础模型的社会经济理解

Baoshen Guo, Donghang Li, Zhiqing Hong, Kailai Sun, Heye Huang, Alok Prakash, Shenhao Wang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出MobFusion范式,通过将流动性网络作为上下文、图连接器和结构化令牌三种方式融入基础模型,以提升城市社会经济预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01717 2026-06-02 cs.LG 50%

Decentralized Instruction Tuning: Conflict-Aware Splitting and Weight Merging

去中心化指令微调:冲突感知拆分与权重合并

Minsik Choi, Geewook Kim

机构 * Korea University(韩国大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出MERIT方法,通过冲突感知拆分和权重合并实现去中心化指令微调,在Qwen2.5-VL-3B上8个基准平均分从54.3提升至57.0。

Comments 32 pages, 5 figures. Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00716 2026-06-02 cs.LG eess.SP 50%

Graph Transfer Learning via Shared Latent Geometry: Theory and Applications

基于共享潜在几何的图迁移学习:理论与应用

Tong Wu, Andrew Campbell, Anna Scaglione

机构 * University of Central Florida, USA(佛罗里达中央大学) Cornell University, USA(康奈尔大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出一种非对称双路径架构,通过教师编码器从高保真模拟器学习算子多项式特征,学生编码器从稀疏数据学习相同潜在几何,实现零样本迁移并给出可证明的误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏