arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-13 至 2026-05-13 共收录 14
2605.12449 2026-05-13 cs.CV

LychSim: A Controllable and Interactive Simulation Framework for Vision Research

LychSim:一种可控且交互式的视觉研究仿真框架

Wufei Ma, Chloe Wang, Siyi Chen, Jiawei Peng, Patrick Li, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 LychSim基于Unreal Engine 5构建,提供简洁的Python API、生成多样化高保真环境的流程数据管道以及MCP协议集成,用于视觉研究中的可控仿真与闭环优化。

Comments 3D-LLM/VLA Workshop at CVPR 2026. Project page: https://lychsim.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12437 2026-05-13 cs.CV

3D Gaussian Splatting for Efficient Retrospective Dynamic Scene Novel View Synthesis with a Standardized Benchmark

基于3D高斯点划的高效回顾性动态场景新视角合成与标准化基准

Yunxiao Zhang, Suryansh Kumar

机构 * Visual and Spatial AI Lab(视觉与空间人工智能实验室) VCCM Section College of PVFA(VCCM学院光电工程学院) Department of ECEN(电子工程系) Department of CSCE(计算机科学与工程系) Texas A&M University(德克萨斯A&M大学)

AI总结 本文提出基于同步多视角动态场景的3D高斯点划方法,无需时间耦合约束即可实现高效回顾性动态场景新视角合成,并构建了标准化的动态多视角数据集框架以支持可重复的NeRF和3DGS研究。

Comments Accepted for publication at CVPR 2026; 4D World Models Workshop. Draft info: 14 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12430 2026-05-13 cs.CV

AOI-SSL: Self-Supervised Framework for Efficient Segmentation of Wire-bonded Semiconductors In Optical Inspection

AOI-SSL:用于光学检测中高效分割焊接半导体的自监督框架

Joaquín Figueira, Rob Van Gastel, Giacomo D'Amicantonio, Zhuoran Liu, Ioan Gabriel Bucur, Faysal Boughorbel, Egor Bondarev

机构 * AIMS Lab, Eindhoven University of Technology(埃因霍温理工大学AIMS实验室) CoC, ASMPT(ASMPT联合中心) iCIS, Radboud University(拉德堡德大学iCIS实验室)

AI总结 本文提出AOI-SSL框架,结合小领域自监督预训练与上下文推理,提升焊接半导体分割效率,减少标注数据需求,实验显示自监督预训练显著提升分割质量。

Comments Accepted to the AI4RWC Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12138 2026-05-13 cs.CV cs.CL cs.IR

Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

为广告设计:基于统一自回归模型的个性化广告图像和文本生成

Yexing Xu, Wei Feng, Shen Zhang, Haohan Wang, Yuxin Qin, Yaoyu Li, Ao Ma, Yuhao Luo, Lu Wang, Xudong Ren, Haoran Wang, Run Ling, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Longguang Wang, Yulan Guo

机构 * Sun Yat-Sen University(中山大学) Northeastern University(东北大学)

AI总结 本文提出统一广告生成模型Uni-AdGen,通过单个自回归框架生成个性化图文广告,结合前景感知模块和指令微调提升生成质量,并引入大规模广告数据集和新指标提升个性化生成效果。

Comments 22 pages, 19 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12017 2026-05-13 cs.CV

FAME: Feature Activation Map Explanation on Image Classification and Face Recognition

FAME:图像分类和人脸识别中的特征激活图解释

Xinyi Zhang, Manuel Günther

机构 * Department of Informatics, University of Zurich(苏黎世大学信息学院)

AI总结 本文提出FAME,结合网络梯度计算输入图像的变化,改进传统CAM方法,展示其在图像分类和人脸识别中的有效性。

Comments Accepted for CVPR Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12006 2026-05-13 cs.CV

Robust Promptable Video Object Segmentation

鲁棒可提示视频对象分割

Sohyun Lee, Yeho Gwon, Lukas Hoyer, Konrad Schindler, Christos Sakaridis, Suha Kwak

机构 * POSTECH Google(谷歌) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出鲁棒可提示视频对象分割方法MoGA,通过内存对象条件门控适应处理视频对象分割中的退化问题,提升在真实环境下的鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11898 2026-05-13 cs.CV

Few-Shot Synthetic Data Generation with Diffusion Models for Downstream Vision Tasks

少样本合成数据生成与扩散模型用于下游视觉任务

Daniil Dushenev, Nazariy Karpov, Daniil Zinovjev, Alexander Gorin, Konstantin Kulikov

机构 * National University of Science and Technology MISIS(俄罗斯莫斯科国立研究型技术大学)

AI总结 本文提出一种轻量级合成数据增强方法,通过微调LoRA适配器和预训练扩散模型生成合成样本,提升罕见类别的召回率和F1分数,适用于不同视觉领域。

Comments 5 pages, 3 figures, 1 table. Accepted at SynData4CV Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05077 2026-05-13 cs.CV

FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching

FlowDIS:基于流匹配的语言引导二元图像分割

Andranik Sargsyan, Shant Navasardyan

机构 * Picsart AI Research (PAIR)(Picsart AI研究院)

AI总结 本文提出FlowDIS,一种基于流匹配框架的二元图像分割方法,通过文本提示实现精确像素级对象分割,实验表明其在DIS-TE测试集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03061 2026-05-13 cs.CV

Can Nano Banana 2 Replace Traditional Image Restoration Models? An Evaluation of Its Performance on Image Restoration Tasks

Nano Banana 2能否替代传统图像修复模型?对其在图像修复任务上的性能评估

Weixiong Sun, Xiang Yin, Chao Dong

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

AI总结 本文评估了Nano Banana 2在图像修复任务中的性能,发现提示设计至关重要,简洁提示和显式保真约束能平衡重建与感知质量。模型在全参考性能上表现竞争,用户研究中表现优异,但在感知质量与修复保真度之间存在差距,需改进可控性与保真度评估。

Comments Accepted by CVPR 2026 Workshop AAVM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11520 2026-05-13 cs.CV cs.AI

PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting

PointGS: 基于3D高斯散射的语义一致无监督3D点云分割

Yixiao Song, Qingyong Li, Wen Wang, Zhicheng Yan

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) Frontiers Science Center for Smart High-speed Railway System, Beijing Jiaotong University(智能高速铁路系统前沿科学中心,北京交通大学)

AI总结 PointGS通过3D高斯散射统一中间表示,解决3D点云与2D图像的语义一致性问题,实现无监督分割,优于现有方法,在ScanNet-V2和S3DIS上分别提升0.9%和2.8%的mIoU。

Comments Accepted by Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11435 2026-05-13 cs.CV

ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models

ZeroIDIR:基于扰动一致扩散模型的零参考照明退化图像恢复

Hai Jiang, Zhen Liu, Yinjie Lei, Songchen Han, Bing Zeng, Shuaicheng Liu

机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) University of Electronic Science and Technology of China(电子科技大学) College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院)

AI总结 本文提出ZeroIDIR框架,通过自适应伽马校正模块和扰动一致性扩散模型,实现零参考照明退化图像恢复,提升恢复精度与稳定性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11369 2026-05-13 cs.CV

Dynamic Full-body Motion Agent with Object Interaction via Blending Pre-trained Modular Controllers

具有物体交互的动态全身体态代理通过融合预训练模块控制器

Sanghyeok Nam, Byoungjun Kim, Daehyung Park, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出一种框架,通过结合预训练的运动先验和模仿代理,在规划和执行阶段生成动态且长期的人-物交互动作,如持桌奔跑,提升了动态人-物交互任务的成功率。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07552 2026-05-13 cs.CV

VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network

VIMCAN: 基于混合Mamba-交叉注意力网络的视觉-惯性3D人体姿态估计

Zepeng Yang, Junxuan Bai, Hao Li, Ju Dai, Junjun Pan, Yongfeng Yin, Bin Li

机构 * Beihang University(北航) Peng Cheng Laboratory(鹏城实验室) Capital University of Physical Education and Sports(首都体育学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 VIMCAN结合Mamba的高效序列建模与交叉注意力的空间推理,实现RGB关键点与穿戴式IMU数据的鲁棒融合,取得更优精度和实时推理性能。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12625 2026-05-13 cs.GR cs.AI

Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments

神经动态GI:面向动态光照环境的随机访问神经压缩技术

Jianhui Wu, Jian Zhou, Zhi Zhou, Zhangjin Huang, Chao Li

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

AI总结 本文提出Neural Dynamic GI,通过多维特征图和轻量神经网络整合时间信息,实现动态光照环境下的高效光映射压缩,显著降低存储需求并提升实时解压效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏