Multimodal LLMs Do Not Compose Skills Optimally Across Modalities
多模态大语言模型在跨模态间无法最优组合技能
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.CL
AI总结 本文研究多模态大语言模型跨模态技能组合能力,发现其存在显著差距,并提出链式推理和微调策略以改善,但效果有限。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态大语言模型在跨模态间无法最优组合技能
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.CL
AI总结 本文研究多模态大语言模型跨模态技能组合能力,发现其存在显著差距,并提出链式推理和微调策略以改善,但效果有限。
使用ART微调多模态大语言模型:基于艺术的强化训练
机构 * University of Stavanger(斯塔万格大学) ; NORCE Research(NORCE研究机构)
专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI
AI总结 提出ART方法,通过优化原始视觉输入将信息注入冻结的多模态大语言模型,实现软提示微调,无需修改计算图,在数学和工具使用基准上达到与LoRA相当的精度。
使用特征融合的多模态脑肿瘤分类
机构 * School of Physics, Engineering and Computer Science(物理、工程与计算机科学学院) ; University of Hertfordshire(赫特福德郡大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出双分支多模态网络,融合MRI图像与91个放射组学特征,通过门控融合实现脑肿瘤分类,准确率达96.13%。
多模态交互学习的信息论分解
机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学人工智能学院,北京) ; Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) ; Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) ; Beihang University, Beijing(北航,北京) ; Gaotu Techedu Inc.(高图科技有限公司)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出基于信息论的多模态交互分解方法DMIL,通过变分分解架构和微调策略学习样本特定的冗余、独特和协同交互,提升多模态学习性能。
Comments Accepted to CVPR 2026
缺失模态下的多模态学习中的潜在世界恢复
机构 * Queen's University Belfast(贝尔法斯特女王大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI
AI总结 提出潜在世界恢复(LWR)框架,通过邻居潜在对齐和可用性感知融合,在缺失模态下实现鲁棒的多模态预测,避免显式重构误差。
从二维网格到一维标记:重塑多模态图像融合的共享表示
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 提出基于冻结预训练图像标记器的紧凑一维标记接口,通过选择性标记编辑(STE)稀疏更新关键标记,在保持融合骨干网络不变的同时引导全局外观一致性,实现全局连贯与局部保真的最佳平衡。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
面向表格-图像多模态学习的参数高效适配器微调
机构 * School of Mathematical Sciences, Soochow University(苏州大学数学科学学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 提出TI-Adapter框架,通过冻结表格编码器并添加适配器,以及图像分支的嵌入层和瓶颈层适配器,实现高效多模态微调,在20个数据集上以更少参数达到或超越全微调性能。
FreqKD: 面向红外目标检测的频率解耦跨模态知识蒸馏
机构 * University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV
AI总结 针对RGB与红外图像模态差异,提出频率解耦蒸馏框架FreqKD,对低频和高频成分分别施加严格MSE和松弛log-MSE损失,在KAIST数据集上提升DINOv2基线2.4 mAP50。
FAST-MEL: 一种快速、准确且存储高效的多模态实体链接解决方案
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 提出FAST-MEL,通过紧凑的固定大小向量化表示文本和视觉信息,在保持高准确率的同时实现三个数量级的加速和一个数量级的存储节省。
Journal ref SIGIR 2026
多模态传感器融合仪器用于测量区域人类流动性:分布式人类数据引擎(DHDE)
机构 * Headquarters for Regional Revitalization, University of Fukui, Japan(复兴地区总部,福井大学,日本)
专题命中 多模态训练与对齐 :multi-modal(title,abstract)
AI总结 提出分布式人类数据引擎(DHDE),通过融合边缘AI相机、数字意图信号、行为记录和气象数据,解决外围区域人类流动性测量中传感器稀疏和行为异质性问题,验证了稀疏传感器补偿方法,并发现“低活力悖论”。
Comments 32 pages, 4 figures, 3 tables. Pre-print of a manuscript submitted for peer review (v2)
MOTOR:基于令牌交叉的无ID多模态物品表示学习用于嵌入推荐
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 提出MOTOR框架,用可学习共享多模态令牌替代物品ID嵌入,通过产品量化和令牌交叉网络实现语义共享与冷启动改进。
Comments Accepted by ECML-PKDD 2026
DroneShield-AI:一种用于受争议空域中实时自主无人机威胁检测、行为意图分类和群体智能的多模态传感器融合框架
机构 * Independent Researcher(独立研究者)
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV
AI总结 提出DroneShield-AI框架,集成RF信号分类、声学检测、YOLOv8视觉检测等六层处理,通过行为意图分类引擎(BICE)实现六类威胁分类并提前30秒预警,以及图神经网络群体智能模块(GNN-SIM)分析多无人机编队,在低成本硬件上达到96.1%检测精度和142ms延迟。
Comments 23 pages, 6 figures, 11 tables. Code available at https://github.com/bayizeremarius/DroneShield-AI
特质更深:面向人格评估的特质特异性非对称融合
机构 * Hefei University of Technology(合肥工业大学) ; Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) ; Jianghuai Advanced Technology Center(江淮前沿技术中心) ; Anhui Provincial Industry Innovation Center of Humanoid Robots(安徽省人形机器人产业创新中心) ; Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出Traits Run Deeper框架,通过多模态基础表示、特质特异性非对称融合和分布校准回归模块,解决人格评估中模态偏好差异和标签偏差问题,在AVI Challenge 2026上MSE降低约25%。
IB-HFN: 信息瓶颈驱动的SAR-光学融合网络用于高保真云去除
机构 * Institute of Geospatial Information, Information Engineering University(测绘信息研究院,信息工程大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出IB-HFN网络,通过双流骨干、空间信息瓶颈融合模块和联合优化策略,抑制SAR散斑噪声并保留光学细节,实现高保真云去除。
运动增强外观:用于微手势在线识别的RGB-骨架门控残差融合
机构 * School of Computer Science and Information Engineering, Hefei University of Technology (HFUT), Hefei, China(合肥工业大学计算机与信息工程学院)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 提出DyFADet+双流RGB-骨架框架,通过门控残差模块自适应融合骨架运动与RGB特征,实现微手势在线识别,在SMG数据集上F1达40.88,排名第二。
Comments 13 pages, 2 figures
离散时间高斯过程混合在机器人策略学习中的惊人有效性
机构 * Department of Computer Science, University of Freiburg, Germany(弗赖堡大学计算机科学系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出MiDiGap方法,利用少量演示和相机观测,通过离散时间高斯过程混合实现机器人操作策略的灵活表示与模仿学习,在长时域、高约束、动态和多模态任务上取得SOTA性能,并支持推理时引导。
Comments Submitted for publication to IEEE Transaction on Robotics
面向接触丰富机器人强化学习的自监督多感官预训练
机构 * Interactive Robot Perception & Learning (PEARL) Lab, TU Darmstadt, Germany(图腾机器人感知与学习实验室,图腾施塔德大学,德国) ; Hessian.AI(海斯堡人工智能) ; Robotics Institute Germany (RIG)(德国机器人研究所(RIG))
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 提出MSDP框架,通过掩码自编码和跨模态预测学习多感官表示,并采用非对称架构(评论家使用交叉注意力提取动态特征,演员使用稳定池化表示)加速策略学习,在模拟和真实机器人任务中展现出鲁棒性和高效性。
Comments 8 pages, 11 figures
Journal ref IEEE Robotics and Automation Letters, 2026, Vol. 11, No. 6, pp. 6799-6806