PICABench: How Far Are We from Physically Realistic Image Editing?
PICABench: 我们距离物理真实图像编辑还有多远?
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 PICABench通过系统评估物理真实感,探索图像编辑中物理效应的挑战与解决方案。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
PICABench: 我们距离物理真实图像编辑还有多远?
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 PICABench通过系统评估物理真实感,探索图像编辑中物理效应的挑战与解决方案。
用于多物体3D场景的2D系统中视频与语言对齐的多信息无导数控制
机构 * University of Zurich(苏黎世大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种无导数优化方法,用于在多物体3D场景中实现视频与语言的对齐,通过在线适应物体遮挡和区分特征来提升跨模态任务性能。
MCITlib: 多模态持续指令微调库与基准
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新科学研究院人工智能与机器人中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology(福建 pattern recognition and image understanding 工程学院,厦门大学科技学院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 MCITlib提供多模态持续学习的库和基准,支持8种算法并评估3个基准,旨在解决灾难性遗忘和跨模态协调问题。
Comments Preprint
MaxInfo: 一种基于最大体积的无训练关键帧选择方法以提升视频理解
机构 * AXXX, Russia(AXXX, 俄罗斯) ; FusionBrain Lab, Russia(融合脑实验室, 俄罗斯) ; Institute of Numerical Mathematics, Russia(数值数学研究所, 俄罗斯) ; Innopolis University, Russia(因诺波利斯大学, 俄罗斯)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG
AI总结 MaxInfo是一种基于最大体积原理的无训练关键帧选择方法,通过提升视频理解性能,有效减少冗余并保持多样性。
通过大视觉语言模型辅助对齐任务特定视觉模型
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 通过大视觉语言模型辅助对齐任务特定视觉模型,提升模型与人类规范的一致性。
DETACH:解构时空对齐用于外向视频和环境传感器的分阶段学习
机构 * KAIST(韩国科学技术院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 DETACH通过解构时空对齐方法,解决外向视频与环境传感器在动作识别中的对齐问题,提升模型在Opportunity++和HWU-USP数据集上的性能。
基于大脑活动的阅读与操控LLM状态的轴
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出利用人类大脑活动作为坐标系,通过ICA提取潜在轴,操控LLM状态,实现可解释和可控的LLM行为。
Comments 10 pages, 4 figures. Code: https://github.com/sandroandric/Brain-Grounded-Axes-for-Reading-and-Steering-LLM-States
超越CLIP:基于知识的多模态Transformer用于糖尿病视网膜病变诊断中的跨模态对齐
机构 * Department of Medicine Stanford University Stanford, USA(医学系 斯坦福大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种基于知识的多模态Transformer框架,通过整合视网膜图像、临床文本和结构化数据,提升糖尿病视网膜病变诊断中的跨模态对齐与检索性能。
Comments 14 pages, 14 figures
独立密度估计
机构 * Orcava Inc.(Orcava公司)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本研究提出独立密度估计(IDE)方法,通过学习句子中单个词与图像特征之间的联系,提升模型在组合泛化任务上的性能。
Comments 10 pages, 1 table, 4 figures
面向类别的双对齐生成提示适应:C-DGPA
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 C-DGPA通过双分支架构协同优化边缘分布和条件分布对齐,提升无监督领域适应中提示学习的领域不变性和语义判别性。
SIGMMA:基于层次图的多尺度多模态对比对齐:组织病理图像与空间转录组
机构 * Wellcome Sanger Institute(沃森桑格研究所) ; Cambridge Centre for AI in Medicine(剑桥人工智能医学中心) ; Institute of AI for Health(人工智能与健康研究所) ; Cambridge Stem Cell Institute(剑桥干细胞研究所)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 SIGMMA通过多尺度多模态对比对齐,提升组织病理图像与空间转录组的跨模态对应表示,提高基因表达预测和跨模态检索性能。
复杂数学表达式识别:基准测试、大规模数据集和强大基线
机构 * \equalcontrib(机构1)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出CMER-Bench基准测试和大规模数据集MER-17M和CMER-3M,开发了CMERNet模型,有效提升了复杂数学表达式识别的性能。
反射偏好优化(RPO):通过提示引导的反思增强策略对齐
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Alibaba Group(阿里巴巴集团)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。
StreamingAssistant: 为加速在线视频理解的高效视觉标记修剪
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Westlake University(西湖大学) ; Beijing Jiaotong University(北京交通大学) ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 StreamingAssistant通过高效视觉标记修剪技术,提升在线视频理解的准确性和效率,减少GPU内存使用和计算延迟。
更细的更好:面向粒度感知的开集域泛化
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 SeeCLIP通过细粒度语义增强解决开集域泛化中的结构风险与开放空间风险困境,提升模型对难区分未知类别的判别能力。
Comments 9 pages,3 figures,aaai2026
Any2Caption:任何条件到字幕以实现可控视频生成
机构 * Kuaishou Technology(快手科技) ; National University of Singapore(新加坡国立大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。
Comments Project Page: https://sqwu.top/Any2Cap/
MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, Santa Barbara(加州大学圣芭芭拉分校)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。
重新思考稀疏自编码器:仅从编码器特征中进行选择和投影以实现公平性与控制
机构 * Bitdefender ; University Politehnica of Bucharest(巴特亚大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于编码器特征的选择和投影框架,通过改进公平性和可控性,提升模型在视觉语言和大语言模型中的表现。
开放性学习机器人中的自主性-对齐问题:目的框架的正式化
机构 * Institute of Cognitive Sciences and Technologies, National Research Council(认知科学与技术研究所,国家研究理事会) ; Integrated Group for Engineering Research, CITIC, Universidade da Coruña(工程研究联合组,CITIC,科鲁纳大学) ; Institute of Intelligent Systems and Robotics, Sorbonne University / CNRS(智能系统与机器人研究所,索邦大学 / CNRS)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种用于开放性学习机器人的计算框架,通过定义'目的'来平衡自主性与人类控制,解决自主性-对齐问题。
Comments 33 pages, 5 figures
通过有限计算资源下的动量自蒸馏提升医学视觉-语言预训练
机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) ; Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究通过动量自蒸馏与梯度累积提升医学视觉-语言预训练效率,实现高效多模态学习并提升零样本分类和少量样本适应性能。
Comments WACV 2026
通过文本条件视频生成实现渐进式图像修复
机构 * Department of Computer Science, University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校计算机科学系) ; School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
AI总结 本研究通过微调CogVideo,利用文本条件视频生成实现图像渐进式修复,提升感知度量并展示强泛化能力。
Comments First two authors contributed equally to this work. IEEE ICNC Accepted
所有中心距离最多几个token:基于领域不变提示微调的知识蒸馏
机构 * Department of Computer Engineering, Sharif University of Technology, Tehran, Iran(计算机工程系,谢赫拉兹大学,德黑兰,伊朗)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出领域不变提示微调(DIPT)方法,通过学习领域不变提示提升知识蒸馏效果,从而增强病理学领域模型的泛化能力。
FANoise:奇异值自适应噪声调制用于鲁棒多模态表示学习
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG
AI总结 FANoise通过自适应噪声注入策略提升多模态表示学习的鲁棒性和性能
Comments 13 pages, 5 figures, accept to AAAI2026
概念感知的批量采样提升语言-图像预训练
机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Trento(特伦托大学) ; LAION ; Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本研究提出CABS方法,通过概念感知的批量采样提升语言-图像预训练效果,提供灵活的任务适应性数据整理方案。
Comments Tech Report
OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐
机构 * AntGroup(蚂蚁集团) ; Peking University(北京大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。
AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型
机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) ; Department of Biomedical Engineering, Peking University(北京大学生物医学工程系) ; National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 AdaTok通过自适应令牌压缩方法,利用对象感知表示提升多模态大语言模型的效率,实现高压缩比与高性能的平衡。
Uni-MoE-2.0-Omni: 通过先进MoE、训练和数据扩展语言导向的多模态大模型
机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 Uni-MoE-2.0-Omni通过先进MoE、训练和数据技术,实现了语言导向的多模态大模型,展现出在多模态理解、推理和生成任务中的卓越性能。
Comments 47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Waterloo(滑铁卢大学) ; Vector Institute(向量研究所) ; Google(谷歌)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Nanyang Technological University(南洋理工大学) ; University of Leicester(莱斯特大学) ; School of Astronautics, Beihang University(北京航空航天大学航天学院)
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV、cs.AI