arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2604.12574 2026-04-15 cs.CV

Cross-Modal Knowledge Distillation for PET-Free Amyloid-Beta Detection from MRI

跨模态知识蒸馏用于无PET的MRI淀粉样蛋白β检测

Francesco Chiumento, Julia Dietlmeier, Ronan P. Killeen, Kathleen M. Curran, Noel E. O'Connor, Mingming Liu

机构 * Dublin City University(都柏林城市大学) Insight Research Ireland Centre for Data Analytics(爱尔兰Insight研究数据分析师中心) St. Vincent’s University Hospital(圣文森医院) University College Dublin(都柏林大学)

AI总结 本文提出一种基于BiomedCLIP的跨模态知识蒸馏框架,利用MRI单独预测淀粉样蛋白β,无需PET或临床变量,实现了可解释的无PET检测方法。

Comments Accepted to CVPR Workshops 2026 (PHAROS-AIF-MIH)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10655 2026-04-15 cs.CV cs.AI cs.MM

LoViF 2026 The First Challenge on Weather Removal in Videos

LoViF 2026:视频天气去除的第一个挑战

Chenghao Qian, Xin Li, Yeying Jin, Shangguan Sun, Yilian Zhong, Yuxiang Chen, Shibo Yin, Yushun Fang, Xilei Zhu, Yahui Wang, Chen Lu, Ying Fu, Jianan Tian, Jifan Zhang, Chen Zhou, Junyang Jiang, Yuping Sun, Zhuohang Shi, Xiaojing Liu, Jiao Liu, Yatong Zhou, Shuai Liu, Qiang Deng, Jiajia Mi, Qianhao Luo, Weiling Li

AI总结 本文介绍了LoViF 2026挑战,旨在通过恢复受雨雪等恶劣天气影响的清晰视频,提升视频恢复的鲁棒性和真实感,引入了新的短格式WRV数据集。

Comments CVPR Workshop Challenge Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09853 2026-04-15 cs.CV

Do vision models perceive illusory motion in static images like humans?

视觉模型是否像人类一样感知静态图像中的错觉运动?

Isabella Elaine Rosario, Fan L. Cheng, Zitang Sun, Nikolaus Kriegeskorte

机构 * Columbia University(哥伦比亚大学) Kyoto University(京都大学)

AI总结 研究评估了多种光流模型在Rotating Snakes illusion中的表现,发现大多数模型无法生成与人类感知一致的流场,仅人类启发的Dual-Channel模型在模拟眼跳条件下表现出预期的旋转运动。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22394 2026-04-15 cs.CV

Vision Transformers Need More Than Registers

视觉变换器需要更多的寄存器

Cheng Shi, Yizhou Yu, Sibei Yang

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Sun Yat-sen University(中山大学)

AI总结 本文通过系统分析发现视觉变换器的 artifacts 来源于懒惰聚合行为,通过选择性整合 patch 特征提升性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12537 2026-04-15 cs.CV cs.AI

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12502 2026-04-15 cs.CV cs.AI

SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker

SEATrack: 简单、高效且自适应的多模态跟踪器

Junbin Su, Ziteng Xue, Shihui Zhang, Kun Chen, Weiming Hu, Zhipeng Zhang

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) School of Software, Beihang University(北航软件学院) Hebei Key Laboratory of Computer Virtual Technology and System Integration(河北省计算机虚拟技术与系统集成重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(多模态人工智能系统国家重点实验室(MAIS),CASIA) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院自动化实验室)

AI总结 SEATrack通过跨模态对齐和层次混合专家机制,在RGB-T、RGB-D和RGB-E跟踪任务中实现性能与效率的平衡。

Comments Accepted as a CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12403 2026-04-15 cs.CV

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

双模锚引导过滤用于测试时提示微调

Jungwon Choi, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程学院)

AI总结 本文提出双模锚引导框架,通过语义证据指导视图选择,结合文本和图像锚点进行过滤和集成,提升测试时提示微调的鲁棒性。

Comments Accepted by CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12391 2026-04-15 cs.CV cs.AI

Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models

模型链预训练:重新思考视觉基础模型的训练加速

Jiawei Fan, Shigeng Wang, Chao Li, Xiaolong Liu, Anbang Yao

机构 * Intel Labs China(英特尔中国实验室) iMotion Automotive Technology(iMotion汽车技术)

AI总结 本文提出Chain-of-Models Pre-Training方法,通过模型链实现视觉基础模型的高效训练,提升性能并降低成本,验证于45个数据集。

Comments This work is accepted to CVPR 2026. Code is available at https://github.com/deep-optimization/CoM-PT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12356 2026-04-15 cs.CV

OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion

OmniFood8K:通过层次化频率对齐融合实现单图像营养估计

Dongjian Yu, Weiqing Min, Qian Jiang, Xing Lin, Xin Jin, Shuqiang Jiang

机构 * School of Software, Yunnan University, China(云南大学软件学院,中国) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国)

AI总结 本文提出OmniFood8K数据集和端到端框架,通过频率对齐融合模块提升单图像营养预测精度,解决中餐营养估计不足和深度传感器限制问题。

Comments Accepted by CVPR 2026 (Highlight Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12343 2026-04-15 cs.CV

Detecting Precise Hand Touch Moments in Egocentric Video

在第一人称视频中精确检测手触时刻

Huy Anh Nguyen, Feras Dayoub, Minh Hoai

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

AI总结 本文提出HiCE模块和TouchMoment数据集,通过时空特征和跨注意力机制提升手触检测精度,实验显示在严格评估标准下,方法在平均精度上优于现有基线16.91%。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12309 2026-04-15 cs.CV

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

通过3D基础先验实现逼真且一致的轨道视频生成

Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) Amazon(亚马逊)

AI总结 本文提出利用3D基础生成模型的丰富形状先验作为辅助约束,以生成几何逼真且一致的轨道视频,通过多尺度latent特征提升生成效率和形状真实感。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12221 2026-04-15 cs.CV

BarbieGait: An Identity-Consistent Synthetic Human Dataset with Versatile Cloth-Changing for Gait Recognition

BarbieGait: 一种具有多功能衣物变换的恒定身份合成人类数据集用于步态识别

Qingyuan Cai, Saihui Hou, Xuecai Hu, Yongzhen Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) AMAP, Alibaba Group(阿里集团AMAP)

AI总结 本文提出BarbieGait数据集,通过虚拟引擎模拟衣物变换以保持步态身份信息,提出GaitCLIF模型提升跨衣物步态识别性能,推动相关研究进展。

Comments CVPR 2026, Project Page: https://github.com/BarbieGait/BarbieGait

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12159 2026-04-15 cs.CV

VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale

VidTAG: 全球范围内基于时间对齐的视频到GPS地理定位与去噪序列预测

Parth Parag Kulkarni, Rohit Gupta, Prakash Chandra Chhipa, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能研究所,中央佛罗里达大学) Luleå Tekniska Universitet(卢勒奥理工大学) Amazon Prime Video Science(亚马逊Prime视频科学)

AI总结 VidTAG通过双编码器框架实现视频到GPS的细粒度地理定位,结合自监督与语言对齐特征,利用TempGeo和GeoRefiner模块提升时间一致性,优于基线模型20%并在全球粗粒度任务中超越现有方法25%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11961 2026-04-15 cs.CV

Fall Risk and Gait Analysis in Community-Dwelling Older Adults using World-Spaced 3D Human Mesh Recovery

社区老年人跌倒风险与步态分析中的世界空间3D人体网格恢复

Chitra Banarjee, Patrick Kwon, Ania Lipat, Rui Xie, Chen Chen, Ladda Thiamwong

机构 * College of Medicine, UCF(UCF医学院) Institute of AI, UCF(UCF人工智能研究所) College of Nursing, UCF(UCF护理学院) College of Sciences, UCF(UCF科学学院)

AI总结 本文提出利用3D人体网格恢复模型提取步态参数,分析社区老年人的步态特征,发现步态时间与惯性测量单元数据显著相关,揭示高跌倒风险与步态特征的关联。

Comments Work was accepted at Computer Vision for Biomechanics Workshop (CVBW) at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11913 2026-04-15 cs.CV

V-Nutri: Dish-Level Nutrition Estimation from Egocentric Cooking Videos

V-Nutri:从第一人称烹饪视频进行菜品营养估计

Chengkun Yue, Chuanzhi Xu, Jiangpeng He

机构 * Indiana University(印第安纳大学) The University of Sydney(悉尼大学)

AI总结 本文提出V-Nutri框架,结合预训练视觉模型和轻量级融合模块,利用烹饪过程关键帧提升菜品营养估计精度。

Comments Accepted to the 3rd MetaFood Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10950 2026-04-15 cs.CV

Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation

通过蒸馏辅助测试时适应提升视频语义分割模型

Jihun Kim, Hoyong Kwon, Hyeokjun Kweon, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出DiTTA框架,通过高效测试时适应将图像分割模型转化为时间感知的视频分割模型,无需标注视频,实验表明其在VSPW和Cityscapes上表现优异。

Comments accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10226 2026-04-15 cs.CV cs.RO

Latent Chain-of-Thought World Modeling for End-to-End Driving

潜在链式思维世界建模用于端到端驾驶

Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang, Wenjie Luo, Yulong Cao, Philipp Krahenbuhl, Marco Pavone, Boris Ivanovic

机构 * UT Austin(得克萨斯大学奥斯汀分校) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 本文提出Latent-CoT-Drive模型,通过潜在语言整合链式思维推理与决策,提升驾驶性能与安全性,实现更快推理和更优轨迹质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19820 2026-04-15 cs.CV cs.AI cs.CL cs.LG

CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception

CropVLM: 为细粒度视觉语言感知学习动态聚焦

Miguel Carvalho, Helder Dias, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

AI总结 CropVLM通过强化学习提升VLM在细粒度图像理解任务中的性能,无需人工标注或合成数据,有效增强模型对细节的捕捉能力。

Comments Accepted to the GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11792 2026-04-14 cs.CV

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

LottieGPT:为自回归生成设计向量动画的标记化

Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。

Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11711 2026-04-14 cs.CV

Seeing Through the Tool: A Controlled Benchmark for Occlusion Robustness in Foundation Segmentation Models

透过工具看见:面向基础分割模型遮挡鲁棒性的受控基准

Nhan Ho, Luu Le, Thanh-Huy Nguyen, Thien Nguyen, Xiaofeng Liu, Ulas Bagci

机构 * Stony Brook University(石溪大学) AIMA Research Lab(AIMA研究实验室) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) Northwestern University(西北大学)

AI总结 本文提出OccSAM-Bench基准,评估分割模型在合成手术遮挡下的性能,揭示两种模型类型:遮挡意识模型和遮挡无关模型,强调临床需求驱动的模型选择。

Comments Accepted at CV4Clinic, CVPR 2026. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11668 2026-04-14 cs.CV

UNIGEOCLIP: Unified Geospatial Contrastive Learning

UNIGEOCLIP:统一地理对比学习

Guillaume Astruc, Eduard Trulls, Jan Hosang, Loic Landrieu, Paul-Edouard Sarlin

机构 * LASTIG, Univ Gustave Eiffel, IGN, ENSG, France(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理林业信息研究所,法国国家地理科学学院,法国) Google, Switzerland(谷歌,瑞士) CNES, France(法国国家空间研究中心,法国) LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris, Marne-la-Vallée, France(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科桥梁学院,巴黎理工学院,马恩拉瓦莱,法国)

AI总结 UNIGEOCLIP通过统一嵌入空间对五种地理模态进行联合对齐,提升多模态地理数据的对比学习性能,优于单一模态模型和坐标基线。

Journal ref CVPR 2026 EarthVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11637 2026-04-14 cs.CV

STS-Mixer: Spatio-Temporal-Spectral Mixer for 4D Point Cloud Video Understanding

STS-Mixer:用于4D点云视频理解的时空频混合器

Wenhao Li, Xueying Jiang, Gongjie Zhang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出STS-Mixer框架,通过将4D点云视频转换为图谱信号,结合时空与频域信息,提升对4D点云视频的几何结构和时间动态的理解。

Comments Accepted by CVPR 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11585 2026-04-14 cs.CV cs.RO

GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth

GeomPrompt:用于在缺失和退化深度下的RGB-D语义分割的几何提示学习

Krishna Jaganathan, Patricio Vela

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 GeomPrompt通过从RGB生成任务驱动的几何提示,提升RGB-D语义分割在缺失和退化深度下的性能,同时比单目深度估计器更高效。

Comments Accepted to the CVPR 2026 URVIS Workshop. Project page: https://geomprompt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11579 2026-04-14 cs.CV

Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions

透过触觉:基于触觉驱动的材料区域视觉定位

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

AI总结 本文提出通过密集跨模态特征交互学习局部视觉-触觉对齐,生成触觉条件下的材料分割热图,提升材料区域视觉定位的鲁棒性和多样性。

Comments CVPR 2026. Project page: https://mm.kaist.ac.kr/projects/SeeingThroughTouch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11576 2026-04-14 cs.CV

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

微调如你预训练:提升视觉语言模型零样本对抗鲁棒性

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Xi’an Jiaotong University(西安交通大学) University of Oxford(牛津大学)

AI总结 本文提出AdvFLYP方法,通过遵循CLIP预训练过程的训练配方,利用网络上收集的图像-文本对生成对抗样本,并通过对比损失匹配文本,提升视觉语言模型的零样本对抗鲁棒性。

Comments Accepted to CVPR Findings Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11487 2026-04-14 cs.CV

NTIRE 2026 Challenge on Robust AI-Generated Image Detection in the Wild

2026年NTIRE挑战赛:野外鲁棒AI生成图像检测挑战

Aleksandr Gushchin, Khaled Abud, Ekaterina Shumitskaya, Artem Filippov, Georgii Bychkov, Sergey Lavrushkin, Mikhail Erofeev, Anastasia Antsiferova, Changsheng Chen, Shunquan Tan, Radu Timofte, Dmitry Vatolin, Chuanbiao Song, Zijian Yu, Hao Tan, Jun Lan, Zhiqiang Yang, Yongwei Tang, Zhiqiang Wu, Jia Wen Seow, Hong Vin Koay, Haodong Ren, Feng Xu, Shuai Chen, Ruiyang Xia, Qi Zhang, Yaowen Xu, Zhaofan Zou, Hao Sun, Dagong Lu, Mufeng Yao, Xinlei Xu, Fei Wu, Fengjun Guo, Cong Luo, Hardik Sharma, Aashish Negi, Prateek Shaily, Jayant Kumar, Sachin Chaudhary, Akshay Dudhane, Praful Hambarde, Amit Shukla, Zhilin Tu, Fengpeng Li, Jiamin Zhang, Jianwei Fei, Kemou Li, Haiwei Wu, Bilel Benjdira, Anas M. Ali, Wadii Boulila, Chenfan Qu, Junchi Li

AI总结 本文介绍了2026年NTIRE挑战赛,旨在开发能区分真实图像与生成图像的模型,针对实际场景中的图像变换(如裁剪、缩放、压缩、模糊)提升检测鲁棒性。

Comments CVPR 2026 NTIRE Workshop Paper, Robust AI-Generated Image Detection Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11355 2026-04-14 cs.CV

LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalization

LEADER: 学习可靠的局部到全局对应关系用于LiDAR重定位

Jianshi Wu, Minghang Zhu, Dunqiang Liu, Wen Li, Sheng Ao, Siqi Shen, Chenglu Wen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建省城市智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算教育部重点实验室,厦门大学信息学院) School of Engineering Mathematics and Technology, University of Bristol(布里斯托大学工程数学与技术学院)

AI总结 本文提出LEADER框架,通过几何编码器提升描述性,采用截断相对可靠性损失减少不可靠预测影响,实验表明在Oxford RobotCar和NCLT数据集上性能优于现有方法。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11230 2026-04-14 cs.CV

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: AI Flash Portrait (Track 3)

NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:AI闪光人像(第三赛道)

Ya-nan Guan, Shaonan Zhang, Hang Guo, Yawen Wang, Xinying Fan, Tianqu Zhuang, Jie Liang, Hui Zeng, Guanyi Qin, Lishen Qu, Tao Dai, Shu-Tao Xia, Lei Zhang, Radu Timofte, Bin Chen, Yuanbo Zhou, Hongwei Wang, Qinquan Gao, Tong Tong, Yanxin Qian, Lizhao You, Jingru Cong, Lei Xiong, Shuyuan Zhu, Zhi-Qiang Zhong, Kan Lv, Yang Yang, Kailing Tang, Minjian Zhang, Zhipei Lei, Zhe Xu, Liwen Zhang, Dingyong Gou, Yanlin Wu, Cong Li, Xiaohui Cui, Jiajia Liu, Guoyi Xu, Yaoxin Jiang, Yaokun Shi, Jiachen Tu, Liqing Wang, Shihang Li, Bo Zhang, Biao Wang, Haiming Xu, Xiang Long, Xurui Liao, Yanqiao Zhai, Haozhe Li, Shijun Shi, Jiangning Zhang, Yong Liu, Kai Hu, Jing Xu, Xianfang Zeng, Yuyang Liu, Minchen Wei

AI总结 本文提出NTIRE 2026第三次RAIM挑战,聚焦AI闪光人像赛道,旨在解决低光照条件下人像修复的噪声抑制、细节保留与光照颜色还原平衡问题,提供包含800组真实低光照人像数据的评估数据集和基准代码。

Comments Accepted to CVPR 2026 Workshop. Includes supplementary material as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11162 2026-04-14 cs.CV

Boxes2Pixels: Learning Defect Segmentation from Noisy SAM Masks

Boxes2Pixels: 从噪声SAM掩码中学习缺陷分割

Camile Lendering, Erkut Akdag, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 本文提出Boxes2Pixels框架,通过将SAM视为噪声教师,利用分层解码器和在线自修正机制提升缺陷分割精度,实现在工业表面中提升mIoU和IoU指标。

Comments Accepted for presentation at the AI4RWC Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11156 2026-04-14 cs.CV

rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training

rPPG-VQA:一种用于无监督rPPG训练的视频质量评估框架

Tianyang Dai, Ming Chang, Yan Chen, Yang Hu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出rPPG-VQA框架,通过信号级和场景级分析评估视频对rPPG模型训练的适用性,结合双分支架构和两阶段自适应采样策略提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏