MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning
MAG:流形引导的半监督多模态上下文学习
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出MAG框架,通过将未标记多模态数据用于半监督传播的演示选择,提升多模态大语言模型的上下文学习性能,在8个基准的标签稀缺场景下优于强基线。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
MAG:流形引导的半监督多模态上下文学习
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出MAG框架,通过将未标记多模态数据用于半监督传播的演示选择,提升多模态大语言模型的上下文学习性能,在8个基准的标签稀缺场景下优于强基线。
UniGen-AR:通过自回归建模统一视觉生成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) ; Toyota Research Institute(丰田研究院)
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究统一视觉生成问题,提出UniGen-AR框架,将通用多模态语言模型与视觉自回归解码器配对,能为多任务生成图像值输出,相比基于扩散的基线,推理延迟低达19倍,确立视觉自回归建模为统一视觉生成的高效主干。
多样化意图的多轮时尚图像检索
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。
ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑
机构 * HKUST(香港科技大学) ; Kling Team(克林团队) ; NJU(南京大学) ; UCAS(中国科学院大学) ; PKU(北京大学) ; HKU(香港大学)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。
Comments Project Page: https://rebind-mrv2v.github.io/
Dress-ED:基于指令的虚拟试穿和试脱编辑
机构 * University of Modena(摩德纳大学) ; University of Trento(特伦托大学) ; University of Pisa(比萨大学)
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。
Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/
SLU-2K:基于问题的手语翻译语义评估基准
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Catania(卡塔尼亚大学) ; University of Granada(格拉纳达大学) ; CITIC & DaSCI Institute(CITIC与DaSCI研究所)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 提出SLU-2K基准,通过2350个视频问答对评估手语翻译的语义理解,揭示当前系统在语义正确性上的不足。
Comments Accepted at the GenSign Workshop, CVPR 2026
GarmentSketch:大规模草图到时尚基准
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。
Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch
利用灵活上下文并行实现LLM训练的高效扩展
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.LG
AI总结 针对数据异构导致负载不均和通信冗余问题,提出自适应重配置通信组和上下文并行度的FCP策略,实现近线性加速比,最高达1.46倍吞吐提升。
PhysX-Omni: 为刚体、变形体和关节物体统一的模拟准备物理3D生成
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)
专题命中 其他VLM :vision-language model(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出PhysX-Omni,一种统一的模拟准备物理3D生成框架,通过开发针对视觉-语言模型的高效几何表示和首个通用模拟准备3D数据集PhysXVerse,以及评估生成和理解能力的PhysX-Bench,显著提升了生成和理解性能,推动下游应用如具身AI和物理模拟的发展。
Comments Project page: https://physx-omni.github.io/
Code-as-Room: 通过代理代码合成从俯视图图像生成3D房间
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Southern University of Science and Technology(南方科技大学) ; University of Warwick(沃里克大学)
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出Code-as-Room框架,通过结构化执行 harness 生成3D房间,利用Blender代码表示房间,并引入专门的代码基3D房间合成基准进行评估。
CoCoEdit:通过区域正则化的强化学习实现内容一致的图像编辑
机构 * The Hong Kong Polytechnic University, Hong Kong(香港理工大学) ; OPPO Research Institute, ShenZhen, China(OPPO研究院,深圳,中国)
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出CoCoEdit框架,通过区域正则化强化学习提升图像编辑内容一致性,利用改进的指令和掩码生成高质量训练集,并引入像素相似度奖励和区域正则化器,提升编辑质量和一致性。
Comments Accepted by ICML 2026
VLMs在物理世界中离隐私意识还有多远?一项实证研究
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 其他VLM :vision-language model(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过实证研究揭示VLMs在物理环境中隐私意识的不足,提出ImmersedPrivacy框架评估模型在复杂场景中的隐私感知能力,发现现有模型在感知和隐私冲突处理上存在显著缺陷。
Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Hunyuan, Tencent(腾讯文脉) ; Shanghai AI Lab(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。
Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO
压缩后再匹配:一种高效的多模态嵌入预训练范式
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Kuaishou Technology(快手科技)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。
Comments ACL2026
TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成
机构 * Nara Institute of Science and Technology(奈良科学技術研究所) ; The University of Tokyo(东京大学) ; Chungnam National University(Chungnam国立大学) ; Institute of Science Tokyo(东京科学研究所)
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。
Comments Under review
Restore-R1: 通过多模态大语言模型感知反馈的强化学习图像修复代理
机构 * Amazon(亚马逊) ; Northeastern University(东北大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出Restore-R1框架,利用强化学习和多模态大语言模型感知反馈,高效解决图像修复问题,无需标注数据即可实现高质量修复。
ClearAIR: 一种受人类视觉感知启发的全能图像修复框架
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出ClearAIR,受人类视觉感知启发,采用分层粗到细的修复策略,通过多模态大语言模型进行整体评估,并引入区域意识和任务识别流程,提升图像修复精度与细节恢复能力。
Comments Accepted to AAAI 2026. Project page: https://github.com/House-yuyu/ClearAIR
基于多模态大语言模型的低资源音频分类中可解释属性的自适应发现
机构 * Kyoto University(京都大学)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
AI总结 本文提出利用多模态大语言模型自适应发现可解释音频属性,提升低资源音频分类的效率和准确性。
Comments 5 pages, 1 figure
学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解
机构 * Amazon AGI(亚马逊人工智能研究院)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。
UVE: MLLMs是否能作为AI生成视频的统一评估器?
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; ByteDance Seed(字节跳动种子) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文探讨使用多模态大语言模型作为AI生成视频的统一评估器的可行性,并通过UVE-Bench基准测试评估了18种MLLMs的性能。
从视觉感知到深度共情:一种利用多模态大语言模型和多智能体协作的房屋-树-人绘画自动评估框架
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出利用多模态大语言模型和多智能体协作,开发自动评估房屋-树-人绘画测试的框架,以提升投射评估的标准化和效率。
Comments 16 pages, 8 figures
MMDuet2:通过多轮强化学习增强视频MLLMs的主动交互
机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 MMDuet2通过多轮强化学习方法,实现了视频MLLMs在多轮对话中的主动交互,提升了回复时机和质量,达到ProactiveVideoQA基准的最优性能。
通过多模态大语言模型 jailbreak 实现高效的 LLM-jailbreaking
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出一种通过多模态大语言模型实现高效 LLM-jailbreaking 的方法,结合图像-文本语义匹配提升攻击成功率,并在效率和泛化能力上优于现有方法。
机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments The M-PACE framework uses a "mother-child" AI model system to automate and unify compliance checks for ads, reducing costs while maintaining high accuracy
机构 * Stanford University(斯坦福大学)
专题命中 其他VLM :vision-language model(abstract);vision language model(abstract);分类 cs.CV
Comments Accepted at ICCV 2025. Project website: https://dense-functional-correspondence.github.io/
机构 * Keio University(庆应大学) ; NVIDIA(英伟达)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to ICCV Workshop 2025
机构 * Sony Group Corporation(索尼集团)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted as a main conference paper at EMNLP 2025
机构 * Faculty of Engineering, University of Porto(葡萄牙波尔图大学工程学院)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments To appear at the Third Workshop on Large Language Models for Evaluation in Information Retrieval (LLM4Eval 2025), co-located with SIGIR 2025. 9 pages, 2 figures, 5 tables
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV