arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-14 至 2026-05-14 共收录 16
2605.13755 2026-05-14 cs.CV

Generative Texture Diversification of 3D Pedestrians for Robust Autonomous Driving Perception

生成3D行人纹理多样化以实现自动驾驶感知的鲁棒性

Arka Bhowmick, Enes Ozeren, Ahmed Abdullah, Oliver Wasenmuller

机构 * BIT Technology Solutions GmbH(比特技术解决方案 GmbH) Mannheim University of Applied Sciences(曼海姆应用科学大学)

AI总结 本文提出一种简单有效的方法,通过StyleGAN2生成多样化的3D行人资产,用于合成场景生成,提升自动驾驶感知的鲁棒性。

Comments Published at SAIAD 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13467 2026-05-14 cs.CL

PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

PDCR:感知分解置信度奖励用于视觉-语言推理

Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13465 2026-05-14 cs.CV

Z-Order Transformer for Feed-Forward Gaussian Splatting

Z-Order Transformer用于前馈高斯点云

Can Wang, Lei Liu, Wei Jiang, Dong Xu

机构 * The University of Hong Kong(香港大学) Futurewei Technologies Inc(未来科技公司)

AI总结 本文提出Z-Order Transformer用于前馈高斯点云,通过稀疏注意力机制和Z-order策略有效捕捉高斯点间空间与语义关系,提升实时渲染质量与效率。

Comments Accept by CVPR 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13396 2026-05-14 cs.CV

PreFIQs: Face Image Quality Is What Survives Pruning

PreFIQs: 人脸识别图像质量是压缩后所剩的

Jan Niklas Kolf, Guray Ozgur, Andrea Atzori, Žiga Babnik, Vitomir Štruc, Naser Damer, Fadi Boutros

机构 * Fraunhofer Institute for Computer Graphics Research IGD(弗劳恩霍夫计算机图形研究研究所IGD) University of Ljubljana(卢布尔雅那大学) Technical University of Darmstadt(达姆施塔特技术大学)

AI总结 PreFIQs通过无监督且无需训练的方法,利用模型压缩过程中嵌入的几何位移来评估人脸图像质量,实验证明其在多个基准上表现优异,建立了新的state-of-the-art结果。

Comments Accepted at CVPR 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13395 2026-05-14 cs.LG cs.CV

Taming the Long Tail: Rebalancing Adversarial Training via Adaptive Perturbation

驯服长尾:通过自适应扰动重新平衡对抗训练

Lilin Zhang, Yimo Guo, Yue Li, Jiancheng Shi, Xianggen Liu

机构 * Sichuan University(四川大学) Dongfang Electric (Chengdu) Innovation Research Co., Ltd.(东方电子(成都)创新研究院有限公司) Southwest China Research Institute of Electronic Equipment(西南中国电子设备研究院)

AI总结 本文针对长尾数据中的对抗训练问题,提出RobustLT框架,通过自适应调整扰动提升模型鲁棒性和类别平衡。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.12784 2026-05-14 cs.CV

The GAN that Warped: Semantic Attribute Editing with Unpaired Data

扭曲的GAN:无配对数据下的语义属性编辑

Gara Dorta, Sara Vicente, Neill D. F. Campbell, Ivor J. A. Simpson

机构 * University of Bath(巴斯大学) Anthropics Technology Ltd.(Anthropics技术有限公司) University of Sussex(苏塞克斯大学)

AI总结 本文提出通过平滑扭曲场进行语义图像编辑,利用生成对抗网络在无配对数据下实现高分辨率人脸编辑,有效保持身份特征。

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.07079 2026-05-14 stat.ML

Structured Uncertainty Prediction Networks

结构不确定性预测网络

Gara Dorta, Sara Vicente, Lourdes Agapito, Neill D. F. Campbell, Ivor Simpson

AI总结 本文首次提出预测合成图像结构不确定性分布的网络,通过学习全高斯协方差矩阵实现高效采样和似然评估,用于图像重建和去噪。

Comments CVPR 2018 (final version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13152 2026-05-14 cs.CV cs.AI cs.LG cs.RO

EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision

EvObj:学习无需场景监督的3D实例分割的演进对象表示

Jiahao Chen, Zihui Zhang, Yafei Yang, Jinxi Li, Shenxing Wei, Zhixuan Sun, Bo Yang

机构 * Shenzhen Research Institute, The Hong Kong Polytechnic University(深圳研究 institute,香港理工大学) vLAR Group, The Hong Kong Polytechnic University(vLAR 团队,香港理工大学)

AI总结 EvObj通过整合对象辨别和完成模块,解决合成数据与真实点云间的几何差距问题,实现无需场景监督的3D实例分割,实验表明其在真实和合成数据上均优于基线方法。

Comments CVPR 2026. Code and data are available at: https://github.com/vLAR-group/EvObj

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12845 2026-05-14 cs.CV cs.AI

AssemblyBench: Physics-Aware Assembly of Complex Industrial Objects

AssemblyBench: 复杂工业物体的物理感知装配

Danrui Li, Jiahao Zhang, Bernhard Egger, Moitreya Chatterjee, Suhas Lohit, Tim K. Marks, Anoop Cherian

机构 * Rutgers, The State University of New Jersey(新泽西罗格斯大学) The Australian National University(澳大利亚国立大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)

AI总结 本文提出AssemblyBench数据集和AssemblyDyno模型,通过多模态指令和3D部件模型预测装配顺序和轨迹,优于现有方法的装配姿态估计和轨迹可行性评估。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12826 2026-05-14 cs.CV cs.AI

FRAME: Forensic Routing and Adaptive Multi-path Evidence Fusion for Image Manipulation Detection

FRAME:图像篡改检测的取证路由与自适应多路径证据融合

Kaixiang Zhao, Tianrun Yu, Aoxu Zhang, Junhao Su, Porter Jenkins, Amanda Hughes

机构 * Brigham Young University Rutgers University

AI总结 FRAME通过多路径分析空间整合多种取证算法,自适应选择信息量大的路径并融合互补证据,提升图像篡改检测与定位性能。

Comments Accepted to CVPR 2026 SAFE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10127 2026-05-14 cs.CV

Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition

Fashion130K: 一个用于服装生成的电子商务服装数据集,具有统一的多模态条件

Yu He, Ting Zhu, Yichun Liu, Lichen Ma, Xinyuan Shan, Jingling Fu, Yu Shi, Junshi Huang, Yan Li

AI总结 本文提出Fashion130K数据集和统一多模态条件框架,通过多模态提示对齐和融合变压器提升生成一致性,实验验证了UMC在视觉一致性上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05582 2026-05-14 cs.LG cs.CV

Bias In, Bias Out? Finding Unbiased Subnetworks in Vanilla Models

偏差输入,偏差输出?在普通模型中寻找无偏子网络

Ivan Luiz De Moura Matos, Abdel Djalil Sad Saoud, Ekaterina Iakovleva, Vito Paolo Pastore, Enzo Tartaglione

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎电信学院(LTCI)、巴黎理工学院)

AI总结 本文提出BISE方法,通过剪枝从常规训练模型中提取无偏子网络,无需额外数据或微调,提升模型鲁棒性与效率。

Comments This work has been accepted for publication at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23013 2026-05-14 cs.CV cs.LG

SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

SubspaceAD:通过子空间建模实现无训练少样本异常检测

Camile Lendering, Erkut Akdag, Egor Bondarev

机构 * AIMS Group, Department of Electrical Engineering, Eindhoven University of Technology(AIMS组,电气工程系,埃因霍温理工大学)

AI总结 SubspaceAD提出一种无需训练的少样本异常检测方法,通过冻结DINOv2模型提取正常图像的补丁特征,并利用PCA建模估计正常变化的低维子空间,从而在无训练、提示微调或内存库的情况下实现最先进的性能。

Comments Accepted to CVPR 2026. Revised version with corrected AU-PRO evaluation and recomputed metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01707 2026-05-14 cs.CV cs.AI cs.CL

StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos

StreamGaze:流媒体视频中的目光引导时间推理与前瞻性理解

Daeun Lee, Subhojyoti Mukherjee, Branislav Kveton, Ryan A. Rossi, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Mohit Bansal

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究院)

AI总结 StreamGaze通过引入目光引导的任务评估多模态大语言模型在流媒体视频中的时间推理和前瞻性理解能力,揭示了现有模型在目光引导下的时间推理、意图建模和前瞻性预测方面的局限性。

Comments Accepted to CVPR 2026 with strong scores (5/5/5) but desk-rejected after the camera-ready due to not completing all reviewing duties

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18604 2026-05-14 cs.LG

Exemplar-Free Continual Learning for State Space Models

无示例连续学习的状态空间模型

Isaac Ning Lee, Leila Mahmoodi, Trung Le, Mehrtash Harandi

机构 * Monash University(蒙纳士大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出Inf-SSM,通过利用无限维Grassmannian的几何结构,约束状态空间模型在连续学习中的状态演化,有效减少灾难性遗忘并提升准确率。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12620 2026-05-14 cs.AI

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

再思一次,行动一次:验证引导的动作选择用于具身智能体

Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

机构 * Technical University of Darmstadt(达姆斯塔特技术大学)

AI总结 本文提出验证引导的动作选择框架,通过显式验证步骤提升基于MLLM的具身智能体的鲁棒性,实验证明在复杂任务中性能提升达36%。

Comments CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏