BAMI: Training-Free Bias Mitigation in GUI Grounding
BAMI:无需训练的GUI定位偏差缓解
机构 * Tsinghua University, China(清华大学,中国) ; Lenovo Research, China(联想研究院,中国)
AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。
Comments Accepted by CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
BAMI:无需训练的GUI定位偏差缓解
机构 * Tsinghua University, China(清华大学,中国) ; Lenovo Research, China(联想研究院,中国)
AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。
Comments Accepted by CVPR 2026
通过FFT插值解决最小问题而不进行矩阵求逆
机构 * Center for Machine Vision and Signal Analysis(机器视觉与信号分析中心) ; University of Oulu(奥卢大学)
AI总结 本文提出一种基于采样且无需矩阵求逆的方法,利用稀疏隐变量结果ants构建求解器,通过逆快速傅里叶变换插值高效重建行列式多项式,从而在数值稳定性和运行时间上提供传统Gröbner基和结果ants方法的实用替代方案。
Comments Accepted to CVPR 2026
可微适应性4D结构照明用于形状和反光的联合捕获
机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) ; Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)
AI总结 本文提出一种可微框架,通过统一的空间-角结构光和单相机,高效获取物体形状和反光的高质联合数据,采用基于直方图的像素级概率模型减少深度不确定性。
Comments Accepted to CVPR 2026. 10 pages, 13 figures
通过上下文提示和噪声学习提升自监督跟踪
机构 * Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education Guangxi Normal University(教育区块链与智能技术重点实验室,教育部广西师范大学) ; University Engineering Research Center of Educational Intelligent Technology Guangxi Normal University(教育智能技术大学工程研究中心,广西师范大学) ; University of Southampton(南安普顿大学) ; Xi’an Research Institute of High Technology(西安高科技研究所)
AI总结 本文提出一种新的自监督跟踪框架,通过联合利用细粒度语义提示和上下文噪声,提升模型在无标签视频中学习鲁棒跟踪表示的能力。
Comments CVPR 2026
融合你的方式:通过直接偏好优化对齐图像融合与异质需求
机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) ; Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) ; Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)
AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。
Comments Accepted by CVPR 2026
CARD: 一种用于复杂道路地形密集3D重建的多模态汽车数据集
机构 * CARIAD SE(CARIAD公司) ; Technische Universität Berlin(柏林技术大学) ; Vision & Robotics GmbH(视觉与机器人技术有限公司)
AI总结 CARD数据集通过提供连续序列中的近密3D地面真实信息,解决了现有数据集在复杂道路地形下深度估计和补全的不足,支持更精确的几何和感知任务评估。
Comments Accepted at CVPR 2026 (Highlight). Project page: https://card.content.cariad.digital
融合复杂性倒置:为何更简单的跨视图模块在牧草生物量回归中优于SSM和跨视图注意力变换器
机构 * Department of Information Technology(信息科技系) ; Indian Institute of Information Technology, Allahabad Prayagraj(印度阿姆利达德普信息科技学院)
AI总结 本文研究了在稀少农业数据下,简单跨视图模块在牧草生物量回归中的优越性,发现模型复杂度与性能呈反比关系,提出应优先考虑模型基础架构质量而非融合复杂度。
Comments Accepted to CVPR: Vision for Agriculture Workshop 2026 (Withdrawn)
SoccerMaster: 一种用于足球理解的视觉基础模型
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出SoccerMaster,一种统一的足球视觉理解模型,通过多任务预训练统一处理从细粒度感知到高层语义推理的多种任务,实验表明其在多种下游任务中表现优异。
Comments Accepted by CVPR 2026 (Oral); Project Page: https://haolinyang-hlyang.github.io/SoccerMaster
DBMSolver: 一种无需训练的扩散桥采样器用于高质量图像到图像翻译
机构 * Seoul National University(首尔国立大学)
AI总结 DBMSolver通过指数积分器利用DBM底层SDE和ODE的半线性结构,实现高效的一阶和二阶解,减少5倍采样次数并提升图像质量,适用于多种图像任务。
Comments Accepted to CVPR 2026. Includes supplementary material
不确定性引导的边缘学习用于遥感中的深度图像回归
机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)
AI总结 本文提出一种不确定性引导的边缘学习算法,用于遥感中的深度图像回归,通过深度beta回归提高边缘设备上的训练效率。
Comments AI4Space @ CVPR 2026
NTIRE 2026首个可控制的光斑渲染挑战
机构 * NTIRE 2026
AI总结 本文介绍了NTIRE 2026首个可控制的光斑渲染挑战的结果,展示了最有效的提交方法,8支队伍在最终测试阶段提交了有效解决方案,所有提交均在未见过的图像上进行评估,重点是人物和复杂细致的主体。
Comments Challenge report paper from NTIRE Workshop at CVPR 2026
Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)
LAMP:面向度量3D世界的多摄像头人体跟踪
机构 * Meta Reality Labs Research(Meta现实实验室)
AI总结 LAMP提出一种新颖简单框架,通过早期解耦观察者与目标运动,解决多摄像头视角下3D人体跟踪问题,实现动态视角下的高效跟踪。
Comments CVPR 2026. Project page: https://facebookresearch.github.io/LAMP
Query2Uncertainty: 3D目标检测中分布偏移下的鲁棒不确定性量化与校准
机构 * Institute for Automotive Engineering, RWTH Aachen(汽车工程研究所,亚琛RWTH大学) ; Computer Vision Institute, RWTH Aachen(计算机视觉研究所,亚琛RWTH大学)
AI总结 本文提出一种密度感知校准方法,结合后验校准器与DETR风格3D目标检测器的潜在对象查询特征密度,提升分布偏移场景下的不确定性估计与校准性能。
Comments Accepted for publication at CVPR 2026
面向资源受限设备的神经特征提取:考虑硬件的神经特征提取
机构 * Department of Electronics, Information and Bioengineering (DEIB), Politecnico di Milano(电子、信息与生物工程系(DEIB),米兰理工学院) ; Smart Eyewear Lab, EssilorLuxottica(智能眼镜实验室,EssilorLuxottica)
AI总结 本文提出Gideon,一种面向资源受限设备的神经特征提取器,结合关系知识蒸馏和可微神经架构搜索,在内存和运算约束下提升INT8鲁棒性与量化抗性,实现高效部署。
Comments This paper has been accepted for publication at the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026. \c{opyright}IEEE
通过激活回放提升大多模态模型的推理能力
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(国立新加坡大学) ; Tencent Youtu Lab(腾讯云图实验室) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学)
AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。
Comments CVPR 2026