Multimodal LLMs Do Not Compose Skills Optimally Across Modalities
多模态大语言模型在跨模态间无法最优组合技能
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文研究多模态大语言模型跨模态技能组合能力,发现其存在显著差距,并提出链式推理和微调策略以改善,但效果有限。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
多模态大语言模型在跨模态间无法最优组合技能
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文研究多模态大语言模型跨模态技能组合能力,发现其存在显著差距,并提出链式推理和微调策略以改善,但效果有限。
显式表示对齐用于多模态情感分析
机构 * AgentAlpha
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。
Comments 10 pages, 5 figures
MACD:基于反事实数据的模型感知对比解码
机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安娜堡分校) ; University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校)
专题命中 VLM训练与架构 :InternVL(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MACD方法,利用视频语言模型自身反馈识别导致幻觉的目标区域,生成目标级反事实输入,结合对比解码减少幻觉,提升多模型在复杂场景下的准确性。
PAND:面向提示的邻域蒸馏用于轻量级细粒度视觉分类
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出PAND框架,通过提示感知语义校准和邻域感知结构蒸馏,将大型视觉语言模型知识迁移至轻量网络,在细粒度分类任务上超越现有方法。
Comments Accepted by ICIP2026
DenseMLLM:用于密集预测的标准多模态大语言模型
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学电子与计算机工程系) ; Tencent, Youtu-Lab, China(腾讯优图实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出DenseMLLM,通过标准多模态大语言模型架构和视觉令牌监督策略,无需任务特定解码器即可实现语义分割、深度估计等密集预测任务,在多个基准上取得竞争性能。
Comments ICML 2026
PARCEL: 基于池锚定的条件弹性查询重采样以实现高效视觉-语言理解
机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所) ; Google(谷歌)
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出PARCEL视觉分词架构,通过池锚定和条件弹性查询重采样解决视觉令牌压缩中的空间与查询表示冲突,在27个基准上提升性能-效率帕累托前沿。
Comments 33 pages, 4 figures
EpiCurveBench: 评估视觉语言模型在流行病曲线数字化中的表现
机构 * Computational Health Informatics Program(计算健康信息学项目) ; Boston Children’s Hospital & Harvard Medical School(波士顿儿童医院及哈佛医学院)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 针对现有图表数据提取基准中忽略时间序列结构的问题,提出包含1000张真实流行病曲线图像的EpiCurveBench基准和基于动态规划的EpiCurveSimilarity评估指标,实验表明最强模型仅达52.3% ECS,且ECS能更好区分模型性能。
BioFact-MoE:基于生物学因子分解的混合专家模型用于肝细胞癌的视觉-语言预后建模
机构 * Department of Radiology \& Biomedical Imaging, Department of Biomedical Engineering, Department of Electrical Engineering, Department of Statistics \& Data Science Yale University, New Haven, CT, 06510, USA
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出BioFact-MoE框架,通过生物学监督的混合专家模型显式分解肝脏和肿瘤因子,在肝细胞癌预后预测中提升准确性和生物学可解释性。
Comments Early accepted at MICCAI 2026
有机HAR:在有机环境中通过高效视频分析实现隐私保护传感器的活动发现
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract)
AI总结 本研究提出有机HAR框架,通过将传感器能力置于活动发现中心,利用隐私保护传感器识别自然信号模式,并在关键时刻使用视觉语言模型进行场景理解,从而在有机环境中实现高效且隐私保护的活动识别。
Comments 23 pages, 14 figures, with a 4-page appendix containing 2 additional figures. To appear in Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. (IMWUT), Vol. 9, No. 4, Article 203 (December 2025). DOI: 10.1145/3770674
Journal ref Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 9(4) (2025) 203:1-203:32
RoboMemArena:一个全面且具有挑战性的机器人记忆基准
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Tsinghua University(清华大学) ; Zhejiang University of Technology(浙江工业大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。
Comments Project website: https://robomemarena.github.io
WildClawBench: 一个用于真实世界、长周期代理评估的基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Shanghai Innovation Institute(上海创新研究院) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。
Comments Github link: https://github.com/internlm/WildClawBench
探索多模态聊天机器人作为治疗艺术活动的促进者
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文提出一种基于多模态大语言模型的聊天机器人,通过实时分析视觉创作并促进反思对话,探讨其在艺术治疗中的应用潜力及未来发展方向。
基于文本的多尺度频率表示适应
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出FreqAdapter,通过在频域进行多尺度信号微调,结合文本信息减少信息冗余,提升多模态模型的性能与效率。
Comments ACL 2026 Main
Prox-E:基于原始抽象的细粒度3D形状编辑
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出Prox-E,一种无需训练的框架,通过显式的原始几何抽象实现细粒度3D控制,有效平衡身份保持、形状质量和指令忠实度。
Comments Accepted to SIGGRAPH 2026. Project page: https://etaisella.github.io/Prox-E/
For-Value:高效前向仅数据估值用于微调LLM和VLM
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Meta
专题命中 VLM训练与架构 :VLM(title_cn);vision-language model(abstract)
AI总结 本文提出For-Value框架,通过前向计算高效评估数据价值,无需反向传播,提升大规模模型训练效率。
AFMRL: 基于属性增强的电商细粒度多模态表示学习
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文提出AFMRL,通过属性生成任务提升电商细粒度多模态表示学习,结合属性引导对比学习和检索感知属性强化,实现更精准的相似商品检索。
Comments Accepted by ACL 2026
多任务强化学习用于增强多模态大语言模型作为裁判
机构 * Meta AI ; Hong Kong University of Science and Technology(香港科技大学) ; Emory University(埃默里大学)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文提出MT-RL-Judge框架,通过多任务强化学习优化多模态大语言模型作为裁判,提升判断一致性和与人类偏好的相关性,并在分布外任务中展现鲁棒泛化能力。
Comments ACL 2026 Industry Track
如何向大型多模态模型传授新技能
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google DeepMind(谷歌DeepMind) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文研究了如何在不丧失原有能力的前提下通过序列微调向大型多模态模型传授新技能,提出两种有效的微调方法以平衡学习与遗忘。
Comments In submission. Code is available at https://github.com/jessemelpolio/LMM_CL
通过AI反馈提升文本到视频生成中动态物体交互
机构 * Google DeepMind(谷歌DeepMind) ; The University of Tokyo(东京大学) ; Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。
Comments Website: https://sites.google.com/view/aif-dynamic-t2v/
当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。
Comments Accepted at DIS 2026 PWiP
链式放大:通过尺度自回归和偏好对齐实现极端超分辨率
机构 * KAIST AI(韩国科学技术院人工智能系)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Chain-of-Zoom框架,通过自回归链和多尺度提示实现极端超分辨率,利用GRPO优化文本提示对齐人类偏好,实验显示标准4x扩散模型在CoZ下可实现256倍以上高质量放大。
Comments NeurIPS 2025 (Spotlight)
ReAlign:通过推理引导的细粒度对齐优化视觉文档检索
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract)
AI总结 本文提出ReAlign方法,利用VLM推理能力生成细粒度视觉描述作为监督信号,提升视觉文档检索性能,实验表明在不同领域数据集上均取得2%的相对提升。
轻量级提示引导的CLIP适应用于单目深度估计
机构 * School of Engineering Science, Simon Fraser University(西蒙弗雷泽大学工程科学学院) ; School of Information Science and Technology, Eastern Institute of Technology(东方理工学院信息科学与技术学院)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出MoA-DepthCLIP框架,通过轻量级MoA模块和选择性微调提升单目深度估计的精度与效率,优于基线模型。
Comments 14 pages, 2 figures
GoldiCLIP:平衡显式监督的Goldilocks方法用于语言-图像预训练
机构 * AI Center – Mountain View, Samsung Electronics(三星电子山景城AI中心)
专题命中 VLM训练与架构 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 GoldiCLIP通过平衡监督信号提出新框架,结合文本条件自蒸馏、编码器解码器与VQA目标及不确定性加权机制,在3000万数据下实现高效预训练,提升多任务检索性能。
PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。
Comments CVPR26 poster. 25 pages, 19 figures
DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器
机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) ; Toyota Research Institute(丰田研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract)
AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。
多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型
专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。
Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN
基于视频基础模型的世界模拟用于物理AI
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。
GMAIL: 生成模态对齐用于生成图像学习
机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系) ; Department of Machine Learning, MBZUAI, UAE(马斯克大学人工智能研究所) ; Department of Artificial Intelligence, Hanyang University ERICA, South Korea(翰阳大学ERICA人工智能系)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 GMAIL通过多模态学习方法对齐生成图像与真实图像,提升视觉-语言任务中的生成图像学习效果。
COVR:视觉控制中视觉语言模型与强化学习代理的协同优化
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 COVR通过协同优化视觉语言模型与强化学习代理,利用RL生成数据提升VLM语义推理能力,并通过动作先验引导策略学习,实现视觉控制任务中的高效优化。
Comments The paper was accepted by the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)