arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-20 至 2026-03-20 共收录 26
2603.19232 2026-03-20 cs.CV

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19224 2026-03-20 cs.CV

EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing

EffectErase: 视频对象移除与插入的联合处理以实现高质量效果擦除

Yang Fu, Yike Zheng, Ziyun Dai, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China(大数据研究院,计算机科学与人工智能学院,复旦大学,中国)

AI总结 本文提出EffectErase方法,通过联合视频对象移除与插入,解决动态目标对象及其视觉效果的高质量擦除问题,利用大规模VOR数据集提升效果擦除质量。

Comments CVPR 2026, Project Page: https://henghuiding.com/EffectErase/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19176 2026-03-20 cs.SD cs.CV eess.AS

Few-shot Acoustic Synthesis with Multimodal Flow Matching

少样本声学合成与多模态流匹配

Amandine Brunetto

机构 * Center for Robotics, Mines Paris - PSL University(机器人中心,巴黎 Mines - PSL 大学)

AI总结 本文提出FLAC方法,通过流匹配生成少样本声学合成,结合空间、几何和声学线索生成新的场景房间脉冲响应,优于现有八样本基线。

Comments To appear at CVPR 2026. 23 pages, 16 figures. Project Page: https://amandinebtto.github.io/FLAC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19158 2026-03-20 cs.CV

Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation

自适应辅助提示融合用于目标忠实的扩散生成

Kwanyoung Lee, SeungJu Cha, Yebin Ahn, Hyunwoo Oh, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

AI总结 本文提出自适应辅助提示融合框架,通过辅助锚点提示在低密度区域稳定扩散过程,提升目标提示的忠实性与生成质量。

Comments Accepted in CVPR 2026 (main track). 10 pages, 6 figures; supplementary material included (14 pages, 11 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19157 2026-03-20 cs.CV

ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation

ADAPT:基于注意力的自适应提示调度与稀有概念生成的插值正交补集

Kwanyoung Lee, Hyunwoo Oh, SeungJu Cha, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

AI总结 ADAPT框架通过确定性提示调度和语义对齐,提升稀有概念生成效果,无需额外训练,在RareBench基准上表现优异。

Comments Accepted in CVPR 2026 (findings). 10 pages, 4 figures; supplementary material included (8 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19076 2026-03-20 cs.CV cs.RO

DROID-SLAM in the Wild

野外中的DROID-SLAM

Moyang Li, Zihan Zhu, Marc Pollefeys, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft(微软)

AI总结 本文提出一种鲁棒的实时RGB SLAM系统,通过可微的不确定性感知捆绑调整处理动态环境,实现鲁棒的跟踪与重建。

Comments CVPR 2026, Project Page: https://moyangli00.github.io/droid-w/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19028 2026-03-20 cs.CV cs.AI cs.LG

SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models

SEM:用于视觉-语言模型后验去偏的稀疏嵌入调制

Quentin Guimard, Federico Bartsch, Simone Caldarella, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) Toyota Motor Europe(丰田欧洲公司) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

AI总结 本文提出SEM框架,通过稀疏自编码器空间调制嵌入,实现视觉-语言模型的后验去偏,提升检索和零样本分类的公平性。

Comments CVPR Findings 2026. Project website: https://sparse-embedding-modulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19026 2026-03-20 cs.CV

Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token

重新思考MLLM本身作为分割器:仅用一个分割标记

Anqi Zhang, Xiaokang Ji, Guangyu Gao, Jianbo Jiao, Chi Harold Liu, Yunchao Wei

机构 * Beijing Institute of Technology(北京理工大学) University of Birmingham(伯明翰大学) Beijing Jiaotong University(北京交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出SELF1E方法,通过保留原始图像分辨率并利用残差特征提升分割精度,无需外部解码器即可实现与专业解码器相当的分割性能。

Comments Paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18834 2026-03-20 cs.CV

Statistical Characteristic-Guided Denoising for Rapid High-Resolution Transmission Electron Microscopy Imaging

基于统计特征的去噪方法用于快速高分辨率透射电子显微镜成像

Hesong Li, Ziqi Wu, Ruiwen Shao, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

AI总结 本文提出一种统计特征引导的去噪网络,通过空间和频域特征指导去噪过程,提升HRTEM图像质量,实验表明其在去噪和定位任务中优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18757 2026-03-20 cs.CV

DA-Mamba: Learning Domain-Aware State Space Model for Global-Local Alignment in Domain Adaptive Object Detection

DA-Mamba: 基于全局-局部对齐的领域感知状态空间模型学习用于领域自适应目标检测

Haochen Li, Rui Zhang, Hantao Yao, Xin Zhang, Yifan Hao, Shaohui Peng, Yongwei Zhao, Ling Li

机构 * Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学校)

AI总结 DA-Mamba通过结合CNN与状态空间模型,提升领域自适应目标检测的全局与局部对齐能力,有效解决传统方法在全局特征提取和计算效率上的不足。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18671 2026-03-20 cs.CV

Towards High-Quality Image Segmentation: Improving Topology Accuracy by Penalizing Neighbor Pixels

迈向高质量图像分割:通过惩罚邻近像素提高拓扑准确性

Juan Miguel Valverde, Dim P. Papadopoulos, Rasmus Larsen, Anders Bjorholm Dahl

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 本文提出SCNP方法,通过惩罚最差分类的邻近像素 logits 来提升拓扑准确性,已在13个数据集上验证有效性,并集成至三种分割框架。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19195 2026-03-20 cs.CV

All-in-One Slider for Attribute Manipulation in Diffusion Models

用于扩散模型属性操控的全能滑块

Weixin Ye, Hongguang Zhu, Wei Wang, Yahui Liu, Mengyu Wang, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Cooperation Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作联合实验室) City University of Macau(澳门城市大学) Kuaishou(快手) Meitu(美图)

AI总结 本文提出All-in-One滑块模块,通过分解文本嵌入空间实现高效的属性操控,支持多属性组合与零样本操控,提升扩散模型的属性操控精度和可扩展性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18753 2026-03-20 cs.CV

CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods

CrossHOI-Bench: 一个统一的HOI评估基准,涵盖视觉-语言模型和特定HOI方法

Qinqian Lei, Bo Wang, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Mississippi(密西西比大学) ASUS Intelligent Cloud Services(ASUS智能云服务)

AI总结 本文提出CrossHOI-Bench,通过显式正例和 curated 负例,统一评估VLM和HOI方法,揭示两者在多任务和细粒度交互上的互补优劣。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18541 2026-03-20 cs.CV

Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection

矫正目标域色散以提升跨域少样本目标检测

Yongwei Jiang, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

AI总结 本文针对跨域少样本目标检测中目标域色散问题,提出生物启发的注意力细化框架,通过正负模式细化和文本语义对齐模块提升检测精度,实验证明在六个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18510 2026-03-20 cs.CV

OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

OnlinePG: 在线开放词汇全景映射与3D高斯点云分裂

Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang

机构 * State Key Lab of CAD & CG(CAD与CG国家重点实验室) VIVO BlueImage Lab(VIVO BlueImage实验室) HKUST(香港科技大学)

AI总结 本文提出OnlinePG,通过在线全景映射结合3D高斯点云分裂实现开放词汇场景理解,解决现有方法在实时性和实例级理解上的不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18495 2026-03-20 cs.AI

Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning

跨领域演示到代码的神经符号反事实推理

Jooyoung Kim, Wonje Choi, Younguk Song, Honguk Woo

机构 * Department of Computer Science and Engineering, Sungkyunkwan University(Sungkyunkwan 大学计算机科学与工程系)

AI总结 本文提出NeSyCR框架,通过神经符号反事实推理解决跨领域机器人编程中的过程不匹配问题,提升任务成功率31.14%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18461 2026-03-20 cs.CV

Cell-Type Prototype-Informed Neural Network for Gene Expression Estimation from Pathology Images

基于细胞类型原型的神经网络用于从病理图像估计基因表达

Kazuya Nishimura, Ryoma Bise, Shinnosuke Matsuo, Haruka Hirose, Yasuhiro Kojima

机构 * The University of Osaka, Japan(大阪大学) Kyushu University(九州大学) National Cancer Center Japan(日本国立癌症中心)

AI总结 本文提出CPNN模型,利用单细胞RNA测序数据估计病理图像中基因表达,通过细胞类型原型指导提升预测精度和可解释性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18101 2026-03-20 cs.CV cs.AI cs.LG

Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters

仅训练异构图像-补丁-文本图监督以推进少样本学习适配器

Mohammed Rahman Sherif Khan Mohammad, Ardhendu Behera, Sandip Pradhan, Swagat Kumar, Amr Ahmed

机构 * Edge Hill University(埃德希尔大学)

AI总结 本文提出一种仅训练的异构图监督方法,通过多尺度视觉补丁和文本提示构建统一图,利用模态感知图变压器进行跨模态推理,并通过节点过滤提取高保真类特征,从而提升少样本学习性能。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06450 2026-03-20 cs.CV

What Is Wrong with Synthetic Data for Scene Text Recognition? A Strong Synthetic Engine with Diverse Simulations and Self-Evolution

合成数据在场景文本识别中有什么问题?一个强大的合成引擎与多样化的模拟和自我进化

Xingsong Ye, Yongkun Du, JiaXin Zhang, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯公司微信视觉团队)

AI总结 本文提出UnionST合成引擎,通过多样化的模拟和自我进化框架,提升合成数据的现实性和有效性,实验表明其在复杂场景中优于现有合成数据。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22184 2026-03-20 cs.CV

Shoe Style-Invariant and Ground-Aware Learning for Dense Foot Contact Estimation

具有鞋款不变性和地面感知的学习用于密集脚部接触估计

Daniel Sungho Jung, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(电子工程与智能机器人研究所,首尔国立大学)

AI总结 本文提出FECO框架,通过鞋款不变性和地面感知学习,解决单张RGB图像中密集脚部接触估计的鞋款多样性与地面特征提取问题。

Comments Accepted at CVPR 2026. Project page: https://feco-release.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20649 2026-03-20 cs.CV

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08316 2026-03-20 cs.CV

Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

通过2D语义知识解锁3D affordance分割

Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)

AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16861 2026-03-20 cs.CV cs.AI

Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection

先看再融合:基于2D引导的跨模态对齐用于鲁棒的3D检测

Xiang Li, Zhangchi Hu, Xiao Xu, Bin Kong

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出利用2D对象先验进行跨模态特征预对齐,解决LiDAR与相机特征的空间错位问题,提升3D检测鲁棒性。

Comments accepted to cvpr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13387 2026-03-20 cs.CV

TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast

TR2M: 通过语言描述和双级尺度导向对比转移单目相对深度到度量深度

Beilei Cui, Yiming Huang, Long Bai, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出TR2M框架,通过语言描述和图像输入,利用双级尺度导向对比学习,解决相对深度到度量深度的转换问题,实现跨域的零样本性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏