arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 502 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 502 篇

2606.18566 2026-06-18 cs.CV cs.AI cs.GR 新提交 81%

Multi-Modal Hyper-Graph Fusion for Low-Light Crowd Counting

多模态超图融合用于低光照人群计数

Hao-Yuan Ma, Li Zhang, Yushi Qiu, Jie Gao, Yan Zhang, Bangjun Wang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对低光照环境下人群计数难题,构建三个新基准数据集,提出多模态超图融合模块和可变形矩形稀疏注意力模块,形成低光照计数网络LCNet,在三个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17950 2026-06-17 cs.CV cs.AI 新提交 81%

Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

即插即适应:基于预训练对齐模型的首眼多模态指代消解

Jinghan Wu, Jing Li, Ivor W. Tsang, Xuetao Zhang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Centre for Frontier AI Research and Institute of High-Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心与高性能计算研究所)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出即插即适应方法,利用预训练的细粒度对齐模型,通过证据理论融合视觉与类别线索,无需目标数据集训练或大型VLLM,在CIN基准上CoNLL F1比专用方法和流行VLLM分别提升5.31%和2.12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-06-17 cs.CV cs.CL 新提交 81%

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 81%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11614 2026-06-11 cs.LG cs.AI cs.CV 新提交 81%

Information-Theoretic Decomposition for Multimodal Interaction Learning

多模态交互学习的信息论分解

Zequn Yang, Yake Wei, Haotian Ni, Zhihao Xu, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学人工智能学院,北京) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) Beihang University, Beijing(北航,北京) Gaotu Techedu Inc.(高图科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出基于信息论的多模态交互分解方法DMIL,通过变分分解架构和微调策略学习样本特定的冗余、独特和协同交互,提升多模态学习性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07635 2026-06-09 cs.CV cs.AI 新提交 81%

NeuroAlign: Hierarchical Multimodal Fusion of Dynamic and Structural Neuroimaging for MCI Analysis

NeuroAlign: 用于MCI分析的动态与结构性神经影像的分层多模态融合

Xiongri Shen, Zhenxi Song, Jiaqi wang, Yi Zhong, Leilei Zhao, Chenqi Xu, Linling Li, Yichen Wei, Lingyan Liang, Demao Deng, Luping Song, Ping Luan, Ahmed M. Anter, Shuqiang Wang, Baiying Lei, Zhiguo Zhang

机构 * Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Intelligence Science and Engineering, College of Artificial Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)人工智能学院智能科学与工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Guangdong Key Laboratory of Biomedical Measurements and Ultrasound Imaging, School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(深圳大学医学部生物医学工程学院广东省生物医学测量与超声成像重点实验室) Department of Radiology, The People’s Hospital of Guangxi Zhuang Autonomous Region, Guangxi Academy of Medical Sciences(广西壮族自治区人民医院放射科,广西医学科学院) Shenzhen Sixth People’s Hospital (Nanshan Hospital), Huazhong University of Science and Technology Union Shenzhen Hospital(华中科技大学协和深圳医院(深圳市第六人民医院)) School of Basic Medical Sciences, Shenzhen University(深圳大学基础医学院) Egypt-Japan University of Science and Technology (E-JUST)(埃及日本科技大学) School of Biomedical Engineering, National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, Guangdong Key Laboratory for Biomedical Measurements and Ultrasound Imaging, Shenzhen University Medical School(深圳大学医学部生物医学工程学院,国家地方联合医学超声关键技术工程实验室,广东省生物医学测量与超声成像重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出NeuroAlign框架,通过双模态分层对齐和双域分层交互融合fMRI与DTI特征,实现MCI/SCD检测,并设计无梯度归因方法SAM进行特征分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11691 2026-08-13 cs.LG cs.CL 新提交 79%

LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 针对原生RL训练多模态模型的隐私泄漏问题,提出基于熵动态的无训练推理时遗忘框架LEMUR,可更有效地抑制敏感信息在推理轨迹和答案中的泄漏,同时保留模型非敏感效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11263 2026-08-13 cs.CV 新提交 79%

GeoUniPR: A Geometry-Consistent Unified Framework for Cross-Modal Place Recognition

GeoUniPR:用于跨模态地点识别的几何一致性统一框架

Wonbong Kim, Jiatong Xiao, Rui Li, Xufei Wang, Qiwen Gu, Junqiao Zhao, Chen Ye, Guang Chen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Research Institute for Intelligent Autonomous System, Tongji University(同济大学上海智能自主系统研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本研究提出GeoUniPR框架,通过构建几何一致性深度图像视图并引入SC-InfoNCE损失,在无需复杂对齐模块的情况下,实现了跨模态地点识别的最优性能与良好泛化能力。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09986 2026-08-12 cs.AI cs.LG 新提交 79%

MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis

MIDAS:面向不完整多模态情感分析的基于不确定性感知融合的互信息解缠方法

Yuhua Wen, Yingying Zhou, Qifei Li, Yingming Gao, Zhengqi Wen, Jianhua Tao, Ya Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对多模态情感分析中模态不完整的问题,提出MIDAS框架,通过互信息解缠与不确定性感知融合实现鲁棒的多模态表示,在多个数据集上取得优于基线的性能。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09590 2026-08-11 cs.CV 新提交 79%

TeaMatch: Teachable Cross-Modal Representation Learning for 2D-3D Matching

TeaMatch:用于2D-3D匹配的可教学跨模态表示学习

Chongjian Wang, Junjie Gao

机构 * Shandong University of Science and Technology(山东科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本研究提出TeaMatch框架,将可教学性作为跨模态表示学习准则,提升2D-3D匹配鲁棒性,可无缝集成到现有匹配流水线,在相关基准上实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07574 2026-08-11 cs.CV cs.RO 新提交 79%

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion

基于Swin Transformer与临床元数据融合的多模态皮肤病变分类

Nethmi Pathirana, Isuru Munasinghe, Dileeka Alwis

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对皮肤病变分类的自动化挑战,提出结合Swin Transformer图像特征与临床元数据的多模态框架,在公开数据集上实现92.55%测试准确率,兼具强少数类性能与预测可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05608 2026-08-07 cs.LG cs.AI 新提交 79%

GAUGE: Granularity-Adaptive Counterfactual Gating of Evidence for Incomplete Multimodal Classification

GAUGE:面向不完整多模态分类的粒度自适应反事实证据门控

Yunping Shi, En Yu, Kairui Guo, Jie Lu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对不完整多模态分类问题,提出轻量型GAUGE框架,通过细粒度反事实证据门控实现更优性能,为模态不完整下的证据控制提供了可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04016 2026-08-06 cs.CY cs.AI cs.LG stat.AP 新提交 79%

AI-driven Multimodal Representation Learning for Latent Mediation Structure Discovery of Socioeconomic Disadvantage, Psychosocial Factors, and Cardiometabolic Multimorbidity: Insights from the All of Us Research Program

人工智能驱动的多模态表征学习用于发现社会经济劣势、心理社会因素与心脏代谢共病的潜在中介结构:来自All of Us研究计划的见解

Cong Cao, Shuangge Ma

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究基于All of Us研究计划数据,开发AI驱动的多模态中介框架,通过变分自编码器推导潜在表征,发现心理社会脆弱性是连接社会经济劣势与心脏代谢共病的关键中介通路,为探究健康相关复杂关系提供了新方法。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03559 2026-08-05 cs.CV 新提交 79%

Compass: Degradation-Simulated Reciprocal Learning with Lightweight Needle RWKV for Multimodal Crack Segmentation under Missing Modalities

Compass:面向缺失模态场景下多模态裂缝分割的退化模拟互学习与轻量型Needle RWKV

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mianzhao Wang, Shengyong Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 Compass是面向缺失模态场景的多模态裂缝分割轻量型网络,通过DSD、Needle Block与ETPF实现鲁棒分割,在90%深度模态缺失时仍达SOTA性能,仅需258万参数。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03109 2026-08-05 cs.CV cs.RO 新提交 79%

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

结合三维骨架提取与语言分析的多模态植物根表型分析

Jiakai Lin, Zijun Li, Guoyu Lu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01622 2026-08-04 cs.NE cs.MM 新提交 79%

SMM Transformer: Leveraging Spiking Neural Networks for Multimodal Tasks

SMM Transformer:利用脉冲神经网络实现多模态任务

Xiubo Liang, Jinxing Han, Yuke Li, Haoqi Zhu, Yu Zhao, Hongzhi Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于脉冲神经网络的SMM Transformer框架,通过PLMP、SMSA、SMoE三个核心组件解决SNN多模态Transformer的训练与效率问题,在基准测试中实现了有竞争力的准确率与显著的能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01488 2026-08-04 cs.CV 新提交 79%

Towards Compact Unified Multimodal Tracking: Synergizing Knowledge Distillation with Structural Pruning

迈向紧凑的统一多模态目标跟踪:知识蒸馏与结构剪枝的协同

Yuqi Li, Yuedong Tan, Huiran Duan, Weilun Feng, Chuanguang Yang, Zhulin An, Zongwei Wu, Shiping Wen, Tingwen Huang, Yingli Tian

机构 * The City College of New York(纽约城市学院) INSAIT Sofia University “St. Kliment Ohridski”(圣克莱门特奥赫里德斯基索非亚大学) Julius-Maximilians-Universität Würzburg(维尔茨堡大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳先进技术研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态跟踪模型计算负担大的问题,提出双对齐蒸馏框架,结合知识蒸馏与结构剪枝,在五组基准上实现了高准确率与5倍速度提升的紧凑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28565 2026-07-31 cs.CV 新提交 79%

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27917 2026-07-31 cs.AI 新提交 79%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25820 2026-07-29 cs.CV 新提交 79%

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

基于大语言模型衍生成分标签和多模态融合的食品图像分割

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

机构 * National Cheng Kung University(国立成功大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25322 2026-07-29 cs.AI 新提交 79%

From Cellular Responses to Pharmacological Domains: Multimodal Zero-Shot Drug Representation Learning

从细胞反应到药理学领域:多模态零样本药物表示学习

Jintao Huang, Lu Leng, Ziyuan Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态药物发现中存在的问题,提出PMRD框架,通过分离机制因素、构建共识反应域、增强机制候选、动态加权及结合互补表示等方法,实现多模态零样本药物性质预测,提升预测效果并减少化合物间冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24447 2026-07-28 cs.CV 新提交 79%

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models

RP - OPSD:用于多模态大语言模型的分辨率特权在线自蒸馏

Qihui Zhu, Yuchen Wang, Zijian Wen, Tao Zhang, Mengjie Zhang, Yang Liu, Shuangwu Chen, Siying Wu, Jian Yang, Xiaofeng Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在线自蒸馏问题,利用同一图像高低分辨率视图信息差提出RP - OPSD,学生策略用低分辨率图像生成轨迹,教师策略用原始分辨率图像监督,实验表明该方法能提升性能并加快训练速度,为在线自蒸馏提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23658 2026-07-28 cs.CV 新提交 79%

XMatchAD: A Cross-Modal Matching Perspective on Reconstruction-based Anomaly Detection

XMatchAD:基于重建的异常检测的跨模态匹配视角

Mingxiu Cai, Zhe Zhang, Gaochang Wu, Tianyou Chai

机构 * Northeastern University(东北大学) State Key Laboratory of Synthetical Automation for Process Industries(流程工业综合自动化国家重点实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对基于重建的无监督异常检测方法难以捕捉细微异常、异常边界模糊的问题,提出XMatchAD框架,从伪跨模态匹配视角利用输入与重建图像的匹配关系,通过多步骤提升异常检测和定位精度,性能优于现有方法。

Comments accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23245 2026-07-28 cs.MM cs.LG 新提交 79%

FedTaste: Topology-Aware Structural Transfer for Multimodal Federated Learning with Missing Modalities

FedTaste:用于具有缺失模态的多模态联邦学习的拓扑感知结构转移

Haochen Liang, Jie Zhang, Hideya Ochiai

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 针对多模态联邦学习中模态缺失和数据分布问题,提出FedTaste框架,利用冻结基础模型提取联合多模态拓扑,结合模态自适应结构提示等方法,避免显式模态插补,在多数据集和非IID设置下性能优越且通信开销低。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22779 2026-07-28 cs.LG cs.AI 新提交 79%

Multimodal Surface EMG Hand Gesture Recognition Using Query-Based Transformers for Prosthetic Control

使用基于查询的变压器进行多模态表面肌电手势识别以用于假肢控制

Federico Del Pup, Elisa Tentori, Manfredo Atzori

机构 * Department of Information Engineering, University of Padua(帕多瓦大学信息工程系) Padova Neuroscience Center, University of Padua(帕多瓦大学帕多瓦神经科学中心) Department of Biomedical Sciences, University of Padua(帕多瓦大学生物医学科学系) Department of Neuroscience, University of Padua(帕多瓦大学神经科学系) Information Systems Institute, University of Applied Sciences Western Switzerland (HES-SO Valais)(瑞士西部应用科学大学(HES-SO瓦莱州)信息系统研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对表面肌电手势识别用于假肢控制时当前架构的局限,提出EMG-CrossFormer,通过级联交叉注意力融合层组合单模态编码器表示,经实验验证该方法能提升仅sEMG解码及多模态融合下的手势识别性能。

Comments GitHub repository: see https://github.com/deepPNClab/emg-crossformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22702 2026-07-28 cs.CV cs.LG 新提交 79%

MIME: Multimodal Interactive Motion Encoder

MIME:多模态交互式运动编码器

Addison Zucek, Prerit Gupta, Kamila Kuatova, Aniket Bera

机构 * Purdue University(普渡大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对动画、AR/VR等场景中多人交互的文本-运动表示学习问题,提出多模态交互式运动编码器MIME,通过特定方法捕捉结构并训练,在文本-运动检索任务中表现出色,还能跨数据集支持下游运动生成。

Comments Under review at WACV 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22422 2026-07-27 physics.flu-dyn cs.AI 新提交 79%

PRIMS: Physics-guided Representation for Fluid Identification in Multimodal Sensing

PRIMS:多模态传感中用于流体识别的物理引导表示

Hai-Long Nguyen, Trung Thanh Nguyen, Lars Holm, Dennis Alveringh, Duc Viet Le

机构 * University of Twente(特文特大学) Nagoya University(名古屋大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对微流体应用中流体识别挑战,提出PRIMS物理感知多模态Transformer,通过三个模块集成物理知识于表示学习和注意力机制,实现可解释、数据高效的流体分类,实验显示其性能优越且鲁棒性强。

Comments 2026 European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21660 2026-07-27 cond-mat.mtrl-sci cs.AI cs.LG 新提交 79%

Generative and multimodal AI for materials prediction and design: Progress, challenges, and perspectives

用于材料预测和设计的生成式和多模态人工智能:进展、挑战与展望

Xianyuan Liu, Charles Anjah, Benjamin E. Jolly, Jonathon F. S. Markanday, Joshua Berry, Haolin Wang, Nicola A. Morley, Robert D. J. Oliver, Alexandra J. Ramadan, Delvin Ce Zhang, Katerina A. Christofidou, Haiping Lu

机构 * School of Computer Science, University of Sheffield, Sheffield, UK(计算机科学学院,谢菲尔德大学) Centre for Machine Intelligence, University of Sheffield, Sheffield, UK(智能机器研究中心,谢菲尔德大学) School of Chemical, Materials and Biological Engineering, University of Sheffield, Sheffield, UK(化学、材料与生物工程学院,谢菲尔德大学) Henry Royce Institute, Royce Discovery Centre, University of Sheffield, Sheffield, UK(亨利·罗伊奇研究所,谢菲尔德大学) Materials Nexus Ltd., Salisbury House, Cambridge, UK(材料 nexus 有限公司,剑桥,英国) School of Mathematical and Physical Sciences, University of Sheffield, Sheffield, UK(数学与物理科学学院,谢菲尔德大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨生成式和多模态人工智能在材料预测与设计中的应用,引入材料属性层次结构框架,指出当前证据局限,强调需全社区标准支持多模态相关建模与基准测试,以设计具科学和实际新颖性、可实验实现的材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21347 2026-07-24 cs.CV 新提交 79%

Quality-Aware Multimodal Fusion Reveals Implicit Identity in Valence-Arousal Features

质量感知多模态融合揭示效价-唤醒特征中的隐含身份

Jisu Kim, Benjamin S. Riggan

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对传统人脸识别在无约束环境中表现不佳的问题,提出质量感知自适应融合方法 QAAF 用于多模态效价-唤醒估计,在 VA 估计任务中取得良好效果,且经 VA 训练的特征在编码身份上表现出色,确立了多模态 VA 估计为传统人脸识别的互补软生物特征模态。

Comments 10 pages, 3 figures, 6 tables. Accepted for publication at IEEE International Joint Conference on Biometrics (IJCB), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20511 2026-07-24 cs.AI 新提交 79%

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏