Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication
高斯香农:基于通信的高精度扩散模型水印技术
AI总结 本文提出Gaussian Shannon水印框架,通过将扩散过程视为噪声通信信道,实现鲁棒追踪和精确位恢复,适用于无损元数据应用。
Comments Accepted by CVPR 2026 Findings
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
高斯香农:基于通信的高精度扩散模型水印技术
AI总结 本文提出Gaussian Shannon水印框架,通过将扩散过程视为噪声通信信道,实现鲁棒追踪和精确位恢复,适用于无损元数据应用。
Comments Accepted by CVPR 2026 Findings
STAC:用于流式3D重建的时空感知缓存压缩
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出STAC框架,通过时空感知缓存机制提升流式3D重建的内存效率和重建质量,减少内存消耗并加速推理。
Comments 10 pages, 6 figures. Accepted by CVPR 2026. This version includes supplementary material
从轨道到地面:从极端俯仰角卫星图像生成城市光束摄影测量
机构 * Peking University(北京大学) ; AMAP(高德地图) ; Ant Group(蚂蚁集团) ; Shandong University(山东大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 本文提出两种设计选择,通过2.5D高度图和可微渲染技术,解决从稀疏轨道图像合成地面视图的挑战,实现大规模城市重建。
Comments Accepted by CVPR 2026 Findings. Project page: https://pku-vcl-geometry.github.io/Orbit2Ground/
像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像
机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) ; Baidu Inc.(百度公司) ; School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)
AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。
Comments Accepted by CVPR 2026
探索扩散模型在机器人控制中的条件
机构 * KAIST AI(韩国科学技术院人工智能学院) ; NAVER AI Lab(NAVER人工智能实验室)
AI总结 本文研究利用预训练文本到图像扩散模型获取任务适应的视觉表示,提出ORCA方法以动态视觉信息提升机器人控制性能。
Comments Accepted to CVPR 2026. Project page: https://orca-rc.github.io/
MozzaVID:莫扎瑞拉奶酪体积分类数据集
机构 * Technical University of Denmark(丹麦技术大学)
AI总结 本文提出MozzaVID数据集,用于体积分类任务,包含25种奶酪类型和149个样本,提供三种分辨率的数据,旨在促进体积分类算法的发展和食品结构研究。
Comments Accepted at MetaFood (CVPR 2026 Workshop)
AFL:基于预训练模型的联邦学习单轮分析方法
机构 * South China University of Technology(华南理工大学) ; Tsinghua University(清华大学) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) ; The Hong Kong University of Science and Technology(香港科技大学) ; Microsoft(微软)
AI总结 本文提出AFL,一种利用分析解的联邦学习方法,通过单轮训练和绝对聚合法则,减少通信开销并提升收敛速度,具有数据分区不变性。
Comments Published in CVPR 2025
超越损失值:通过损失轨迹对齐实现鲁棒动态剪枝
机构 * National University of Singapore(新加坡国立大学) ; Wuhan University(武汉大学) ; Sichuan University(四川大学)
AI总结 本文提出AlignPrune模块,通过动态对齐得分改进动态剪枝在标签噪声下的鲁棒性,实验表明其在多个基准上提升精度达6.3%。
Comments Published in CVPR 2026 Findings
HIVE:一种用于多模态推理密集检索的LLM框架
AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。
Comments accepted at CVPR 2026 Workshop GRAIL-V
BRIDGE:通过强化学习查询对齐实现多模态到文本检索
机构 * High institute for computer & information systems(高等计算机与信息系统学院) ; Chungbuk National University(忠北大学) ; Assiut University(艾斯尤特大学) ; University of Innsbruck(因斯布鲁克大学)
AI总结 BRIDGE通过强化学习查询对齐模型和增强神经搜索检索器,解决多模态查询在文本库中的检索问题,实现优于多模态编码器的nDCG@10性能。
Comments Accepted at CVPR 2026 Workshop GRAIL-V
超越均值:在连续情感预测中建模注释分布
AI总结 本文提出了一种基于Beta分布的框架,用于建模注释共识,以捕捉情感感知的中心趋势、变异性、不对称性和不确定性。
Comments This paper has been accepted at the CVPR 2026 Workshop on Affective Behavior Analysis in-the-wild (ABAW)
LaScA:语言条件下的可扩展情感动态建模
机构 * University of Piraeus(比雷埃夫斯大学)
AI总结 本文提出LaScA框架,利用语言模型作为语义上下文条件器,结合手工制作的情感描述符建模情感变化,通过可解释的面部和声音特征提升预测准确性。
Comments This paper has been accepted at the CVPR 2026 Workshop on Affective Behavior Analysis in-the-wild (ABAW)
DINO-QPM:为全球可解释的图像分类适应视觉基础模型
机构 * Institute for Information Processing, L3S - Leibniz University Hannover(信息处理研究所,L3S - 莱布尼茨汉诺威大学)
AI总结 DINO-QPM通过将复杂特征转换为可解释的对比表示,提升图像分类的可解释性,同时在准确性和解释质量上优于DINOv2线性探针。
Comments Accepted to the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026
CSA-Graphs: 一种保护隐私的结构数据集用于儿童性虐待研究
机构 * Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学) ; Instituto Federal de Educação, Ciência e Tecnologia de Minas Gerais (IFMG)(米纳斯吉拉斯联邦教育、科学和技术研究所) ; Universidade de São Paulo (USP)(圣保罗大学) ; Universidade Federal de Minas Gerais (UFMG)(米纳斯吉拉斯联邦大学) ; Polícia Federal (PF)(联邦警察) ; University of Sheffield(谢菲尔德大学)
AI总结 本文提出CSA-Graphs数据集,通过结构化表示替代原始图像,保留上下文信息以实现儿童性虐待图像分类,同时遵守法律和伦理限制。
Comments Conference on Computer Vision and Pattern Recognition (CVPR 2026), in the Workshop on Computer Vision for Children (CV4CHL)
ACE-Merging:无数据模型融合与自适应协方差估计
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出ACE-Merging方法,通过自适应协方差估计实现无数据模型融合,解决专家模型间干扰问题,实验表明其在视觉和语言基准上优于现有方法。
Comments Accepted to CVPR 2026 (Main Track)
TopoMaskV3:用于道路拓扑理解的3D掩码头:具有密集偏移和高度预测
机构 * Graduate School of Informatics, Middle East Technical University(中东技术大学信息学研究生院) ; Togg/Trutek AI Team(Togg/Trutek 人工智能团队)
AI总结 TopoMaskV3通过引入密集偏移场和高度图,实现了3D道路拓扑理解的稳健预测,同时解决了地理数据泄露问题,取得了新的性能突破。
Comments Accepted to CVPR 2026 Workshops (AUTOPILOT 2026): 3rd Workshop on Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks
BrepGaussian:从多视角图像中通过高斯点划进行CAD重建
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Nanjing Urban Construction Tunnel& Bridge Intelligent Management Co., Ltd.(南京城建隧道桥梁智能管理有限公司)
AI总结 本文提出BrepGaussian框架,通过学习2D图像中的3D参数化表示,实现从多视角图像中重建CAD模型,其核心方法是结合可学习特征的高斯点划渲染器和特定拟合策略,有效分离了几何重建与特征学习。
Comments Accepted to CVPR 2026
FlexAvatar:通过部分监督学习完整的3D头像
机构 * Technical University of Munich(慕尼黑工业大学)
AI总结 FlexAvatar通过结合单目和多视角数据,解决单目数据不足和多视角数据获取困难的问题,实现高质量的3D头像生成。
Comments Accepted to CVPR 2026, Project website: https://tobias-kirschstein.github.io/flexavatar/ , Video: https://youtu.be/g8wxqYBlRGY
MedGRPO:异构医学视频理解的多任务强化学习
机构 * Northeastern University(东北大学) ; United Imaging Intelligence(联影智能)
AI总结 本文提出MedGRPO框架,通过跨数据集奖励归一化和医学LLM评判器提升医学视频理解的训练效果,建立基础基准和训练方法。
Comments Accepted at CVPR 2026
PoM:一种线性时间的注意力替代方案:多项式混合器
机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科路桥学院,巴黎综合理工学院) ; LIX, École Polytechnique, CNRS, IP Paris(LIX,巴黎综合理工学院,法国国家科学研究中心,巴黎综合理工学院) ; Department of Information Engineering, Università degli Studi di Padova(帕多瓦大学信息工程系) ; AMIAD, Pole recherche, EFEO(AMIAD,法国远东学院研究部) ; LASTIG, Univ Gustave Eiffel, IGN, Géodata Paris(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理与森林信息研究所,巴黎地理数据)
AI总结 本文提出PoM,一种线性复杂度的替代注意力机制,通过学习多项式函数聚合输入令牌,实现高效序列处理,减少长序列计算成本。
Comments Accepted to CVPR Findings 2026
扩展ZACH-ViT以实现鲁棒医学影像:在低数据环境下对损坏和对抗性压力测试
机构 * BioML Lab, RI CODE, UniBw, Munich, Germany(慕尼黑联邦国防军大学,RI CODE,BioML实验室,德国慕尼黑) ; AUMC, Amsterdam, Netherlands(阿姆斯特丹大学医学中心,荷兰阿姆斯特丹)
AI总结 本文扩展ZACH-ViT,评估其在低数据环境下对常见图像损坏和对抗扰动的鲁棒性,发现其在清洁数据和常见损坏下表现优异,在对抗性压力下仍保持竞争力,但对抗鲁棒性仍是挑战。
Comments Accepted at CVPR 2026 Workshop (PHAROS-AIF-MIH)
PhySe-RPO:物理与语义引导的相对策略优化用于基于扩散的手术烟雾去除
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; School of Future Technology, South China University of Technology(华南理工大学未来技术学院)
AI总结 本文提出PhySe-RPO框架,通过物理和语义引导的相对策略优化,解决手术烟雾去除中配对监督不足的问题,实现物理一致、语义忠实且临床可解释的扩散修复。
Comments 12 pages,7figures,published to CVPR
Diff4Splat:基于潜在动态重建模型的可控4D场景生成
机构 * Peking University(北京大学) ; Xiamen University(厦门大学) ; CUHK(香港中文大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。
Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat
BulletGen: 通过子弹时间生成提升4D重建
机构 * Meta Reality Labs(Meta 现实实验室)
AI总结 BulletGen利用生成模型在Gaussian动态场景表示中校正错误并补全缺失信息,通过对扩散视频生成模型输出与4D重建在单个冻结子弹时间步骤的对齐,实现新颖视角合成和2D/3D跟踪任务的最先进结果。
Comments Accepted at CVPR 2026 Workshop "4D World Models: Bridging Generation and Reconstruction"
稀疏感知体素注意力与前景调节用于3D语义场景补全
AI总结 本文提出VoxSAMNet,通过稀疏感知和语义引导设计,解决单目语义场景补全中体素分布不平衡和泛化能力差的问题,实现更高效准确的3D场景补全。
Comments Accepted at CVPR 2026
SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战
机构 * Wuhan University(武汉大学) ; Great Bay University(大湾区大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Sun Yat-sen University(中山大学) ; Hefei University of Technology(合肥工业大学) ; University of Barcelona(巴塞罗那大学)
AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。
Comments Accepted by the SVC workshop @ CVPR 2026
通过组合并行令牌预测实现可控图像生成
机构 * Durham University(杜伦大学)
AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,相比现有方法在误差率和FID上均有显著提升,并实现高效的文本到图像生成控制。
Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF). arXiv admin note: substantial text overlap with arXiv:2405.06535
超越语义:在稀疏自编码器中解构信息范围以用于CLIP
机构 * KAIST(韩国科学技术院) ; Korea AI Safety Institute, ETRI(韩国电子通信研究院人工智能安全研究所)
AI总结 本文提出信息范围作为理解CLIP表示的新维度,通过Contextual Dependency Score量化稀疏自编码器特征的广度,揭示不同信息范围特征对CLIP预测和置信度的影响差异。
Comments CVPR 2026 Findings
GaussianGrow:基于3D点云与文本引导的几何感知Gaussian生成
机构 * School of Software, Tsinghua University(清华大学软件学院) ; Kuaishou Technology(快手科技) ; CAIR and CIDSAI, NYU Abu Dhabi(纽约大学阿布扎比分校CAIR和CIDSAI)
AI总结 本文提出GaussianGrow,通过学习从3D点云中生长Gaussian,结合多视角扩散模型和文本引导,提升生成几何精度与质量。
Comments Accepted by CVPR 2026. Project page: https://weiqi-zhang.github.io/GaussianGrow
深入信赖:为高斯散射可靠的单目深度监督
机构 * Queensland University of Technology(昆士兰科技大学)
AI总结 本文提出一种整合模糊和噪声深度先验的训练框架,以提升高斯散射的几何监督,从而提高渲染质量。
Comments accepted to CVPR 3DMV Workshop