arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-08 至 2026-05-08 共收录 15
2605.06664 2026-05-08 cs.CV cs.AI

BAMI: Training-Free Bias Mitigation in GUI Grounding

BAMI:无需训练的GUI定位偏差缓解

Borui Zhang, Bo Zhang, Bo Wang, Wenzhao Zheng, Yuhao Cheng, Liang Tang, Yiqiang Yan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University, China(清华大学,中国) Lenovo Research, China(联想研究院,中国)

AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06572 2026-05-08 cs.CV cs.NA math.NA

Solving Minimal Problems Without Matrix Inversion Using FFT-Based Interpolation

通过FFT插值解决最小问题而不进行矩阵求逆

Haidong Wu, Snehal Bhayani, Janne Heikkilä

机构 * Center for Machine Vision and Signal Analysis(机器视觉与信号分析中心) University of Oulu(奥卢大学)

AI总结 本文提出一种基于采样且无需矩阵求逆的方法,利用稀疏隐变量结果ants构建求解器,通过逆快速傅里叶变换插值高效重建行列式多项式,从而在数值稳定性和运行时间上提供传统Gröbner基和结果ants方法的实用替代方案。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06214 2026-05-08 cs.CV

Differentiable Adaptive 4D Structured Illumination for Joint Capture of Shape and Reflectance

可微适应性4D结构照明用于形状和反光的联合捕获

Huakeng Ding, Yaowen Chen, Kun Zhou, Hongzhi Wu

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)

AI总结 本文提出一种可微框架,通过统一的空间-角结构光和单相机,高效获取物体形状和反光的高质联合数据,采用基于直方图的像素级概率模型减少深度不确定性。

Comments Accepted to CVPR 2026. 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06092 2026-05-08 cs.CV

Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning

通过上下文提示和噪声学习提升自监督跟踪

Yaozong Zheng, Qihua Liang, Bineng Zhong, Shuimu Zeng, Yuanliang Xue, Ning Li, Shuxiang Song

机构 * Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education Guangxi Normal University(教育区块链与智能技术重点实验室,教育部广西师范大学) University Engineering Research Center of Educational Intelligent Technology Guangxi Normal University(教育智能技术大学工程研究中心,广西师范大学) University of Southampton(南安普顿大学) Xi’an Research Institute of High Technology(西安高科技研究所)

AI总结 本文提出一种新的自监督跟踪框架,通过联合利用细粒度语义提示和上下文噪声,提升模型在无标签视频中学习鲁棒跟踪表示的能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05014 2026-05-08 cs.CV

CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

CARD: 一种用于复杂道路地形密集3D重建的多模态汽车数据集

Gasser Elazab, Frank Neuhaus, Tilman Koß, Malte Splietker, Aditya Date, Michael Unterreiner, Maximilian Jansen, Olaf Hellwich

机构 * CARIAD SE(CARIAD公司) Technische Universität Berlin(柏林技术大学) Vision & Robotics GmbH(视觉与机器人技术有限公司)

AI总结 CARD数据集通过提供连续序列中的近密3D地面真实信息,解决了现有数据集在复杂道路地形下深度估计和补全的不足,支持更精确的几何和感知任务评估。

Comments Accepted at CVPR 2026 (Highlight). Project page: https://card.content.cariad.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07819 2026-05-08 cs.CV cs.LG

Fusion Complexity Inversion: Why Simpler Cross View Modules Outperform SSMs and Cross View Attention Transformers for Pasture Biomass Regression

融合复杂性倒置:为何更简单的跨视图模块在牧草生物量回归中优于SSM和跨视图注意力变换器

Mridankan Mandal

机构 * Department of Information Technology(信息科技系) Indian Institute of Information Technology, Allahabad Prayagraj(印度阿姆利达德普信息科技学院)

AI总结 本文研究了在稀少农业数据下,简单跨视图模块在牧草生物量回归中的优越性,发现模型复杂度与性能呈反比关系,提出应优先考虑模型基础架构质量而非融合复杂度。

Comments Accepted to CVPR: Vision for Agriculture Workshop 2026 (Withdrawn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11016 2026-05-08 cs.CV cs.AI

SoccerMaster: A Vision Foundation Model for Soccer Understanding

SoccerMaster: 一种用于足球理解的视觉基础模型

Haolin Yang, Jiayuan Rao, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出SoccerMaster,一种统一的足球视觉理解模型,通过多任务预训练统一处理从细粒度感知到高层语义推理的多种任务,实验表明其在多种下游任务中表现优异。

Comments Accepted by CVPR 2026 (Oral); Project Page: https://haolinyang-hlyang.github.io/SoccerMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05889 2026-05-08 cs.CV cs.AI cs.LG cs.NA math.NA

DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation

DBMSolver: 一种无需训练的扩散桥采样器用于高质量图像到图像翻译

Sankarshana Venugopal, Mohammad Mostafavi, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

AI总结 DBMSolver通过指数积分器利用DBM底层SDE和ODE的半线性结构,实现高效的一阶和二阶解,减少5倍采样次数并提升图像质量,适用于多种图像任务。

Comments Accepted to CVPR 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05590 2026-05-08 cs.CV

Uncertainty-Guided Edge Learning for Deep Image Regression in Remote Sensing

不确定性引导的边缘学习用于遥感中的深度图像回归

Anh Vu Nguyen, Dino Sejdinovic, Tat-Jun Chin

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

AI总结 本文提出一种不确定性引导的边缘学习算法,用于遥感中的深度图像回归,通过深度beta回归提高边缘设备上的训练效率。

Comments AI4Space @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05510 2026-05-08 cs.CV

The First Controllable Bokeh Rendering Challenge at NTIRE 2026

NTIRE 2026首个可控制的光斑渲染挑战

Tim Seizinger, Florin-Alexandru Vasluianu, Jeffrey Chen, Zhuyun Zhou, Zongwei Wu, Radu Timofte, Dafeng Zhang, Yipeng Lin, Qi Yan, Junhao Chen, Yang Yang, Divyavardhan Singh, Hariom Thacker, Hammad Mohammad, Aanchal Maurya, Kishor Upla, Kiran Raja, Wei Zhou, Hongyu Huang, Yujin Cho, Grigory Malivenko, Jiachen Tu, Yaokun Shi, Guoyi Xu, Yaoxin Jiang, Jiajia Liu

机构 * NTIRE 2026

AI总结 本文介绍了NTIRE 2026首个可控制的光斑渲染挑战的结果,展示了最有效的提交方法,8支队伍在最终测试阶段提交了有效解决方案,所有提交均在未见过的图像上进行评估,重点是人物和复杂细致的主体。

Comments Challenge report paper from NTIRE Workshop at CVPR 2026

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05390 2026-05-08 cs.CV

LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World

LAMP:面向度量3D世界的多摄像头人体跟踪

Nan Yang, Julian Straub, Fan Zhang, Richard Newcombe, Jakob Engel, Lingni Ma

机构 * Meta Reality Labs Research(Meta现实实验室)

AI总结 LAMP提出一种新颖简单框架,通过早期解耦观察者与目标运动,解决多摄像头视角下3D人体跟踪问题,实现动态视角下的高效跟踪。

Comments CVPR 2026. Project page: https://facebookresearch.github.io/LAMP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05328 2026-05-08 cs.CV cs.RO

Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shift

Query2Uncertainty: 3D目标检测中分布偏移下的鲁棒不确定性量化与校准

Till Beemelmanns, Alexey Nekrasov, Stefan Vilceanu, Jonas Steinhaus, Timo Woopen, Bastian Leibe, Lutz Eckstein

机构 * Institute for Automotive Engineering, RWTH Aachen(汽车工程研究所,亚琛RWTH大学) Computer Vision Institute, RWTH Aachen(计算机视觉研究所,亚琛RWTH大学)

AI总结 本文提出一种密度感知校准方法,结合后验校准器与DETR风格3D目标检测器的潜在对象查询特征密度,提升分布偏移场景下的不确定性估计与校准性能。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04282 2026-05-08 cs.LG

Hardware-Aware Neural Feature Extraction for Resource-Constrained Devices

面向资源受限设备的神经特征提取:考虑硬件的神经特征提取

Francesco Tosini, Simone Pedroni, Christian Veronesi, Pietro Bartoli, Andrea Giudici, Marco Paracchini, Marco Marcon, Diana Trojaniello

机构 * Department of Electronics, Information and Bioengineering (DEIB), Politecnico di Milano(电子、信息与生物工程系(DEIB),米兰理工学院) Smart Eyewear Lab, EssilorLuxottica(智能眼镜实验室,EssilorLuxottica)

AI总结 本文提出Gideon,一种面向资源受限设备的神经特征提取器,结合关系知识蒸馏和可微神经架构搜索,在内存和运算约束下提升INT8鲁棒性与量化抗性,实现高效部署。

Comments This paper has been accepted for publication at the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026. \c{opyright}IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏