MaterialFusion: High-Quality, Zero-Shot, and Controllable Material Transfer with Diffusion Models
MaterialFusion:基于扩散模型的高质量零样本可控材质迁移
AI总结 MaterialFusion是基于扩散模型的新型材质迁移框架,可零样本实现高质量可控材质迁移,在质量、可控性等方面优于现有方法,代码公开。
Comments Accepted to CVPR 2025
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
MaterialFusion:基于扩散模型的高质量零样本可控材质迁移
AI总结 MaterialFusion是基于扩散模型的新型材质迁移框架,可零样本实现高质量可控材质迁移,在质量、可控性等方面优于现有方法,代码公开。
Comments Accepted to CVPR 2025
揭示通用多模态嵌入中的视觉身份
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团)
AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。
Comments Accepted to CVPR 2026
学习关注何处与如何判断:具备质量感知显著性的分辨率无关图像质量评估
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Colorado Boulder(科罗拉多大学博尔德分校)
AI总结 提出基于CLIP的多尺度补丁驱动模型ReLIQS,解决无参考图像质量评估的分辨率适配、计算效率等问题,在多类基准上泛化能力优于主流基线且成本相当或更低。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
第一届AI儿童挑战赛
机构 * PediaMed AI ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 该第一届AI儿童挑战赛推出儿童步态视觉分析赛道,设EVGS评分、脑瘫步态模式分类任务,提供对应数据集与真值以推动AI在儿童医疗领域的应用。
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 5564-5570. 2026
两步即可:基于一致性模型的高效3D点云异常检测
机构 * R.V. College of Engineering(R.V. 工程学院) ; Technical University of Applied Sciences Würzburg-Schweinfurt(Würzburg-Schweinfurt 应用科学大学)
AI总结 本文提出基于一致性学习的重建异常检测方法,通过简化推理过程提升效率,实现低延迟的3D点云异常检测,适用于资源受限设备。
Comments Accepted to CVPR 2026, at the 9th Workshop on Efficient Deep Learning for Computer Vision (ECV). To be published in the IEEE/CVF CVPR 2026 Workshop Proceedings
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 3479-3487
基于大语言模型的视觉编码器分层预训练
机构 * University of Cincinnati(辛辛那提大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。
Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026
学习选择视觉上下文示例
机构 * University of Cincinnati(辛辛那提大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 本文提出LSD方法,通过强化学习构建最优演示集,提升多模态大语言模型在视觉回归任务中的表现,揭示了学习选择在视觉上下文学习中的必要性。
Comments 21 pages, 12 figure, accepted to Computer Vision and Pattern Recognition Conference (CVPR) 2026 Findings Track
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 9455-9465) 2026
PatchAlign3D: 本地特征对齐用于密集3D形状理解
机构 * École polytechnique(巴黎政治学院) ; University of Virginia(弗吉尼亚大学) ; KAUST(王国立阿联酋科技大学)
AI总结 PatchAlign3D通过点云直接生成语言对齐的片段特征,实现高效零样本3D部分分割,优于传统渲染方法。
Comments CVPR 2026. Project website: https://souhail-hadgi.github.io/patchalign3dsite/
面向距离的软提示学习用于多模态愉悦-唤醒估计
机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) ; Department of Automobile and IT Convergence(汽车与IT融合系)
AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。
Comments 8pages
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301
AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理
机构 * Southern University of Science and Technology(南方科技大学) ; Harvard University(哈佛大学) ; California Institute of Technology(加州理工学院) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。
Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026
面向稳健多帧医学视觉问答的目标对齐直接答案监督微调
机构 * Yale University(耶鲁大学)
AI总结 该研究针对MedFrameQA数据集,提出目标对齐的直接答案SFT是最强稳健适配系列,其在保留报告准确率上优于冻结基线且稳定性好,还可迁移至其他骨干网络,旨在引导研究聚焦稳健优化而非架构复杂度。
Comments Presented at the CVPR 2026 Workshop on Multimodal Foundation Models for Biomedicine: Challenges and Opportunities
推理时代理决策规则在多图像医学推理任务中优于更长的进化搜索
机构 * Yale University(耶鲁大学)
AI总结 本研究对比5种推理时代理策略,发现多图像医学推理中,顺序投票决策规则比扩展进化搜索预算的影响更大,其最终测试准确率显著优于基线及复杂变体。
Comments Presented at the CVPR 2026 Workshop on Multi-Modal Reasoning for Agentic Intelligence
MOON2.0:动态模态平衡多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。
Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures
PoseMaster: 一个统一的3D原生框架用于风格化姿态生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Tencent Hunyuan(腾讯文脉)
AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。
Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster
目标检测模型的测试时后门检测
AI总结 针对目标检测模型的后门攻击挑战,提出测试时后门检测方法TRACE,利用变换一致性实现黑盒通用检测,AUROC较最优防御提升30%且可抵抗自适应攻击。
Comments Accepted to CVPR 2025. Code is available at https://github.com/Rookie143/Trace
机构 * Imperial College London(伦敦帝国学院)
Comments CVPR 2025 Workshop VisCon
MEDIC-AD:迈向医疗视觉-语言模型的临床智能
机构 * AIDAS Laboratory, Seoul National University(首尔大学AIDAS实验室) ; Samsung Changwon Hospital(三星昌原医院) ; Samsung Medical Center(三星医疗中心) ; NVIDIA, Santa Clara, USA(英伟达(美国圣克拉拉))
AI总结 MEDIC-AD通过分阶段框架提升医疗视觉-语言模型在病变检测、症状跟踪和视觉可解释性方面的性能,实现临床应用中的最优表现。
Journal ref CVPR 2026
Multinex:通过多先验反光模型实现轻量级低光照图像增强
机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) ; ETcTI, University Politehnica Timisoara(蒂米șoara工业大学ETcTI) ; West University of Timisoara(蒂米șoara西大学)
AI总结 本文提出Multinex,一种轻量级低光照图像增强框架,通过多先验反光模型实现光照和颜色校正,显著降低计算成本并提升性能。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
FiDeSR: 高保真且细节保留的一步扩散超分辨率
机构 * Kyungpook National University ; Korea Electronics Technology Institute
AI总结 FiDeSR通过细节感知加权策略和残差-残差噪声细化,实现高保真且细节保留的一步扩散超分辨率
Comments Accepted to CVPR 2026
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 38270-38280
对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱
机构 * Tsinghua University(清华大学) ; Harbin Engineering University(哈尔滨工程大学) ; Shandong University(山东大学) ; Xidian University(西安电子科技大学)
AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。
Comments Accepted by CVPR 2026 (Oral)
PixDLM:一种用于无人机推理分割的双路径多模态语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。
Comments Accepted to CVPR 2026 (highlight)
TWINGS: 基于薄板样条翘曲对齐的稀疏视图高斯泼溅初始化
机构 * Yonsei University(延世大学) ; Korea Institute of Science and Technology(韩国科学技术院)
AI总结 提出TWINGS框架,利用薄板样条(TPS)对齐反投影点与三角化控制点,为3D高斯泼溅提供几何精确的初始化,从而在稀疏视图下提升场景重建的细节保留和颜色保真度。
Comments Accepted at CVPR 2026, Project page: https://sandokim.github.io/twings/
酿造更强的特征:多光谱地球观测的双教师蒸馏
机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅纳大学计算机与信息科学学院)
AI总结 本文提出双教师对比蒸馏框架,用于多光谱地球观测,通过结合多光谱和光学教师,实现跨模态表示学习,提升多光谱和光学数据的性能。
Comments Accepted to CVPR 2026 as Highlight
连续上下文:基于指令的图像编辑的连续强度控制
机构 * Snap Research ; Tel Aviv University(特拉维夫大学) ; IISc Bangalore(班加罗尔IISc)
AI总结 研究基于指令的图像编辑中编辑强度控制问题,提出连续上下文模型,通过扩展先进模型并引入标量编辑强度,训练轻量级投影网络,合成多样数据集,实现对多种图像编辑操作的编辑强度统一细粒度控制。
Comments Project Page: https://snap-research.github.io/kontinuouskontext/, Accepted at CVPR 2026
不忘旧知:用于个性化联邦学习的无数据重放超网络个性化
机构 * VinUni-Illinois Smart Health Center(VinUni-Illinois智能健康中心) ; College of Engineering & Computer Science(工程与计算机科学学院) ; University of Notre Dame(诺特丹大学) ; Technische Universität Berlin(柏林技术大学)
AI总结 研究联邦学习中新客户端分批加入场景,提出pFedDSH方法,结合中央超网络、二进制掩码和无数据重放,平衡新旧客户端利益,在不暴露数据情况下传播改进,实验证明该方法能保持现有客户端稳定性,维持新客户端通信及适应成本不变。
Comments CVPR 2026 Findings
PyPose:一个结合物理优化的机器人学习库
AI总结 PyPose结合深度感知模型与物理优化,提供高效的机器人学习库,实现计算速度提升超过10倍,适用于SLAM、规划、控制等任务。
Comments Project Website: https://pypose.org Documentation: https://pypose.org/docs/ Tutorial: https://pypose.org/tutorials/ Source code: https://github.com/pypose/pypose
Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023
CaT-GS:通过帧间缓存和瓦片调度实现大规模场景的高效3DGS渲染
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 针对3DGS在大规模场景中性能下降问题,CaT-GS提出通过推测性多帧预处理、帧间缓存机制及重构光栅化任务来消除冗余与减轻负载不平衡,实验证明其显著提升渲染速度,为大规模场景高保真实时渲染建立新基准。
Comments CVPR 2026
通过零样本几何评估实现世界行动模型的测试时缩放
机构 * University of Michigan(密歇根大学) ; NVIDIA(英伟达)
AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。
Comments Extened version of CVPR 2026 EAI workshop
通过影响匹配进行数据集蒸馏
机构 * HKU(香港大学) ; CUHK(香港中文大学) ; Stanford(斯坦福大学)
AI总结 从结果角度重审数据集蒸馏,提出影响匹配方法,通过可微估计器量化参数变化,学习合成集使影响与真实数据集匹配,在分类和视觉语言蒸馏任务中表现出色,超越基线。
Journal ref CVPR 2026
用于悬吊负载下工人检测的隐私感知合成视频基准测试与关系评估
机构 * Government Technology Agency of Singapore(新加坡政府科技局)
AI总结 研究悬吊负载下工人检测的隐私问题,引入SynthSite合成视频基准测试及隐私感知混合生成工作流程,在五种隐私条件下评估相关指标,发现保留结构的模糊处理效用更好,强调建筑安全分析隐私评估需兼顾外观抑制和几何线索保留。
Comments Accepted at the 3rd Workshop on Synthetic Data for Computer Vision (SynData4CV), CVPR 2026. OpenReview: https://openreview.net/forum?id=dMfhFmDWsg . Dataset and code: https://huggingface.co/datasets/govtech/SynthSite