arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-02 至 2026-04-02 共收录 33
2604.01082 2026-04-02 cs.CV cs.GR

ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data

ReMoGen:通过多样化数据的模块学习实现实时的人际交互生成

Yaoqin Ye, Yiteng Xu, Qin Sun, Xinge Zhu, Yujing Sun, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Guangzhou Institute of Energy Conversion, CAS(中国科学院广州能源研究所) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出ReMoGen框架,通过模块化学习生成实时的人际交互反应,利用大规模单人动作数据集学习通用动作先验,并通过Meta-Interaction模块适应不同交互领域,实现高效且高质量的动作响应。

Comments accepted by CVPR 2026, project page: https://4dvlab.github.io/project_page/remogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01081 2026-04-02 cs.CV cs.LG cs.RO eess.IV

ProOOD: Prototype-Guided Out-of-Distribution 3D Occupancy Prediction

ProOOD:基于原型的分布外3D占用预测

Yuheng Zhang, Mengfei Duan, Kunyu Peng, Yuhang Wang, Di Wen, Danda Pani Paudel, Luc Van Gool, Kailun Yang

机构 * Hunan University(湖南大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 本文提出ProOOD方法,通过原型引导的语义填充和尾部挖掘提升3D占用预测和分布外检测性能,实验表明其在多个数据集上均取得显著改进。

Comments Accepted to CVPR 2026. The source code is publicly available at https://github.com/7uHeng/ProOOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00969 2026-04-02 cs.CV

DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

DLWM:双潜在世界模型实现自动驾驶中的整体高斯中心预训练

Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen

机构 * HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) USTC(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部门)

AI总结 本文提出DLWM,通过双潜在世界模型实现自动驾驶中的整体高斯中心预训练,提升3D占用感知、4D占用预测和运动规划性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00849 2026-04-02 cs.CV

Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation

解耦以再耦合:在主体驱动的文本到图像生成中解决相似性-可控性悖论

Shuang Li, Chao Deng, Hang Chen, Liqun Liu, Zhenyu Hu, Te Cao, Mengge Xue, Yuan Chen, Peng Shu, Huan Yu, Jie Jiang

机构 * Tencent(腾讯)

AI总结 本文提出DisCo框架,通过解耦和再耦合视觉与文本信息,解决主体驱动文本到图像生成中相似性与可控性矛盾问题,实现高保真主体保持与精确文本控制。

Comments Accepted by CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00827 2026-04-02 cs.CV

Video Patch Pruning: Efficient Video Instance Segmentation via Early Token Reduction

视频补丁剪枝:通过早期令牌减少实现高效的视频实例分割

Patrick Glandorf, Thomas Norrenbrock, Bodo Rosenhahn

AI总结 本文提出VPP框架,利用时间先验知识实现早期ViT层的高效稀疏性,实现高达60%的补丁减少,在密集预测任务中超越传统图像基补丁剪枝方法,保持在补丁使用低于55%时的稳定性能。

Comments CVPR'26 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00597 2026-04-02 cs.CV

Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors

面向视角鲁棒的端到端自动驾驶与3D基础模型先验

Hiroki Hashimoto, Hiromichi Goto, Hiroyuki Sugai, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国立信息学研究所)

AI总结 本文提出一种无需数据增强的端到端自动驾驶方法,利用3D基础模型的几何先验提升视角变化鲁棒性,实验显示在pitch和高度扰动下性能提升显著。

Comments Accepted at CVPR Workshop on Simulation for Autonomous Driving 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00559 2026-04-02 cs.CV

FecalFed: Privacy-Preserving Poultry Disease Detection via Federated Learning

FecalFed: 通过联邦学习实现隐私保护的家禽疾病检测

Tien-Yu Chi

AI总结 本文提出FecalFed框架,通过联邦学习解决家禽疾病检测中的数据隐私和异构性问题,释放了高质量数据集,并展示了在非独立同分布条件下实现高准确率的隐私保护方法。

Comments Accepted to the CVPR 2026 Workshop on Vision for Agriculture

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00519 2026-04-02 cs.CV

Learnability-Guided Diffusion for Dataset Distillation

基于可学习性的扩散模型用于数据集蒸馏

Jeffrey A. Chan-Santiago, Mubarak Shah

AI总结 本文提出基于可学习性的数据集蒸馏方法,通过逐步构建合成数据集,减少冗余信号,提升模型性能,在ImageNet-1K等数据集上取得最佳结果。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00452 2026-04-02 cs.CV

Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulation

视而不见,失之跟踪:通过查询状态操控对基于传播的多目标跟踪器进行对抗攻击

Halima Bouzidi, Haoyu Liu, Yonatan Gizachew Achamyeleh, Praneetsai Vasu Iddamsetty, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

AI总结 本文提出FADE框架,通过操控查询状态攻击基于传播的多目标跟踪器,导致身份切换和跟踪终止。

Comments Accepted for presentation at CVPR 2026 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00404 2026-04-02 cs.CV

The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation

第五届PVUW MeViS-Text挑战赛第一名:强多模态大语言模型与SAM3的结合用于指代视频对象分割

Xusheng He, Canyang Wu, Jinrong Zhang, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出一种无需微调的管道,结合强多模态大语言模型与SAM3,实现视频对象分割,取得PVUW 2026 MeViS-Text测试集第一名,得分为0.909064。

Comments 1st Place Solution for the 5th PVUW MeViS-Text Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00395 2026-04-02 cs.CV

Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge

通过跟踪增强提示推进复杂视频对象分割:第五届PVUW MOSE挑战赛第一名

Jinrong Zhang, Canyang Wu, Xusheng He, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, China(深圳市环区研究所)

AI总结 本文提出TEP方法,通过跟踪增强提示解决SAM3在处理小目标和语义主导对象时的不足,取得PVUW挑战赛优异成绩。

Comments 1st Place Solution for the 5th PVUW MOSE Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00383 2026-04-02 cs.CV

Mine-JEPA: In-Domain Self-Supervised Learning for Mine-Like Object Classification in Side-Scan Sonar

Mine-JEPA: 针对侧扫声呐中矿类物体分类的领域自监督学习

Taeyoun Kwon, Youngwon Choi, Hyeonyu Kim, Myeongkyun Cho, Junhyeok Choi, Moon Hwan Kim

机构 * Maum AI Inc.(Maum AI公司) Seoul National University(首尔大学) KAIST(韩国科学技术院) Yonsei University(延世大学)

AI总结 本文提出Mine-JEPA,首个针对侧扫声呐矿类物体分类的领域自监督学习框架,通过SIGReg损失在1170张未标记声呐图像上预训练,实现二分类F1得分0.935,优于DINOv3。

Comments 9 pages, 3 figures, 6 tables. Accepted at CVPR 2026 MACVi Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25527 2026-04-02 cs.CV

Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training

超越黄金数据:通过时间步选择性训练解决运动-视觉质量困境

Xiangyang Luo, Qingyu Li, Yuming Li, Guanbo Huang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Shao-Lun Huang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 本文提出TQD方法,通过时间步选择性训练解决视频生成中运动与视觉质量的矛盾,证明在不平衡数据上训练可超越传统高质量数据训练效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25267 2026-04-02 cs.CV

EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval

EagleNet:面向文本-视频检索的能耗感知细粒度关系学习网络

Yuhan Chen, Pengwen Dai, Chuan Wang, Dayan Wu, Xiaochun Cao

机构 * Sun Yat-sen University(中山大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Key Laboratory of Adversarial Artificial Intelligence(深圳市对抗性人工智能重点实验室) Beijing Jiaotong University(北京交通大学) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

AI总结 本文提出EagleNet,通过细粒度关系学习机制和能耗感知匹配,提升文本-视频检索中文本与视频帧间关系的表达,增强语义匹配能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24327 2026-04-02 cs.CV

Le MuMo JEPA: Multi-Modal Self-Supervised Representation Learning with Learnable Fusion Tokens

Le MuMo JEPA:多模态自监督表示学习中的可学习融合标记

Ciem Cornelissen, Sam Leroux, Pieter Simoens

机构 * IDLab, Department of Information Technology, Ghent University - imec(根特大学-imec信息技术系IDLab)

AI总结 本文提出Le MuMo JEPA框架,通过学习融合标记实现多模态统一表示学习,实验显示其在性能与效率之间取得最佳平衡,尤其在CenterNet检测和密集深度估计中表现优异。

Comments 14 pages, 4 figures, supplementary material. Accepted at the CVPR 2026 Workshop on Unified Robotic Vision with Cross-Modal Sensing and Alignment (URVIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19660 2026-04-02 cs.CV cs.SD

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09266 2026-04-02 cs.CV

ForgeDreamer: Industrial Text-to-3D Generation with Multi-Expert LoRA and Cross-View Hypergraph

ForgeDreamer: 工业文本到3D生成的多专家LoRA与跨视图超图

Junhao Cai, Deyu Zeng, Junhao Pang, Lini Li, Zongze Wu, Xiaopin Zhong

机构 * Shenzhen University(深圳大学) Guangzhou Maritime University(广州航海学院)

AI总结 本文提出ForgeDreamer框架,通过多专家LoRA集合和跨视图超图增强方法,解决工业文本到3D生成中的领域适应与几何推理问题,提升语义泛化和几何精度。

Comments Accepted to CVPR 2026 Findings!

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08018 2026-04-02 cs.CV

Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared

不再缺失:字典引导的跨模态图像融合在红外缺失情况下的应用

Yafei Zhang, Meng Ma, Huafeng Li, Yu Liu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系)

AI总结 本文提出了一种基于共享卷积字典的字典引导框架,解决红外缺失时的跨模态图像融合问题,通过联合字典学习、视觉引导红外推断和自适应融合方法提升感知质量和下游检测性能。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19053 2026-04-02 cs.CV cs.RO

TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation

TeFlow:实现多帧监督以实现自监督前馈场景流估计

Qingwen Zhang, Chenhan Jiang, Xiaomeng Zhu, Yunqi Miao, Yushan Zhang, Olov Andersson, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Hong Kong University of Science and Technology(香港科技大学) University of Warwick(华威大学) Linköping University(林雪平大学) Scania(斯堪尼亚)

AI总结 TeFlow通过挖掘时间一致的监督信号,改进多帧监督以提升自监督前馈场景流估计的稳定性与性能,实现33%的性能提升。

Comments CVPR 2026; 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16148 2026-04-02 cs.CV

ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion

ActionMesh: 带有时间轴的3D扩散模型用于动画3D网格生成

Remy Sabathier, David Novotny, Niloy J. Mitra, Tom Monnier

机构 * Meta Reality Labs(Meta现实实验室) SpAItial University College London(伦敦大学学院)

AI总结 ActionMesh通过引入时间轴的3D扩散模型,实现了从多种输入生成动画3D网格,具备快速生成、无骨骼和拓扑一致性的优势,提升了在纹理和重定向等应用中的效率。

Comments CVPR 2026. Project webpage with code and videos: https://remysabathier.github.io/actionmesh/ . V2 update includes more baseline models with a larger evaluation set on our new publicly released benchmark ActionBench, and {3D+video}-to-animated-mesh qualitative comparison in supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18640 2026-04-02 cs.CV cs.AI cs.RO

Geometric-Photometric Event-based 3D Gaussian Ray Tracing

几何-光度事件基于的3D高斯射线追踪

Kai Kohyama, Yoshimitsu Aoki, Guillermo Gallego, Shintaro Shiba

机构 * Keio University(庆应义塾大学) Technische Universität Berlin(柏林工业大学) Science of Intelligence Excellence Cluster(智能科学卓越集群) Einstein Center Digital Future(爱因斯坦数字未来中心) Robotics Institute Germany(德国机器人研究所) The University of Tokyo(东京大学)

AI总结 本文提出GPERT框架,通过分离事件渲染与快照渲染,解决事件基于3DGS的精度与时间分辨率平衡问题,实现高精度3D重建。

Comments 15 pages, 12 figures, 5 tables

Journal ref IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Denver, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17312 2026-04-02 cs.CV

CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理

Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao

机构 * Beihang University(北京航空航天大学) Westlake University(西湖大学) ByteDance Singapore(字节跳动新加坡) ByteDance China(字节跳动中国)

AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。

Comments CVPR 2026. Project page: https://codedance-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12090 2026-04-02 cs.CV cs.CR cs.LG

SPDMark: Selective Parameter Displacement for Robust Video Watermarking

SPDMark:基于选择性参数位移的鲁棒视频水印技术

Samar Fares, Nurbek Tastan, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

AI总结 SPDMark通过在视频扩散模型中选择性位移参数,在生成视频时嵌入不可见水印,实现高鲁棒性和计算效率的平衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03932 2026-04-02 cs.CV

Beyond the Ground Truth: Enhanced Supervision for Image Restoration

超越真实数据:图像修复的增强监督

Donghun Ryou, Inju Ha, Sanghyeok Chu, Bohyung Han

AI总结 本文提出一种增强真实图像的框架,通过超分辨率和自适应频率掩码生成高质量监督,提升图像修复效果,实验表明其能改善修复图像质量。

Comments Project page: https://hij1112.github.io/beyond-the-ground-truth/ Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09388 2026-04-02 cs.CV

Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition

通过邻域感知语义学习,通过开放形式流决策:面向鲁棒零样本骨架动作识别

Yang Chen, Miaoge Li, Zhijie Rao, Deze Zeng, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) China University of Geoscience(中国地质大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Flora方法,通过灵活调整文本语义和开放形式分布感知流分类器,解决零样本骨架动作识别中的语义对齐和分类器鲁棒性问题,实验验证其有效性。

Comments Accepted by CVPR 2026 Findings; Project Code: https://github.com/cseeyangchen/Flora

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02226 2026-04-02 cs.CV cs.AI cs.LG

TempoControl: Temporal Attention Guidance for Text-to-Video Models

TempoControl: 文本到视频模型中的时间注意力引导

Shira Schiber, Ofir Lindenbaum, Idan Schwartz

机构 * Bar-Ilan University(巴伊兰大学)

AI总结 本文提出TempoControl,通过新颖的优化方法实现文本到视频模型的时间对齐,无需重新训练,支持时间重排、动作时机控制和音频对齐等应用。

Comments Accepted CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08250 2026-04-02 cs.CV cs.LG

CHEEM: Continual Learning by Reuse, New, Adapt and Skip -- A Hierarchical Exploration-Exploitation Approach

CHEEM:通过重用、新信息、适应和跳过进行持续学习——一种分层探索-利用方法

Chinmay Savadikar, Michelle Dai, Tianfu Wu

机构 * North Carolina State University(北卡罗来纳州立大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出CHEEM框架,通过分层探索-利用方法解决持续学习中的稳定性与可塑性矛盾,实现高效神经网络架构搜索,优于现有方法,接近全微调上限。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00267 2026-04-02 cs.CV

Omni-MMSI: Toward Identity-attributed Social Interaction Understanding

Omni-MMSI:迈向基于身份的社会互动理解

Xinpeng Li, Bolin Lai, Hardy Chen, Shijian Deng, Cihang Xie, Yuyin Zhou, James Matthew Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出Omni-MMSI任务,要求从原始音频、视觉和语音输入中全面理解社会互动,通过身份属性的社会线索识别与推理,提升AI助手对人类互动的感知与响应能力。

Comments Accepted to CVPR 2026. Project page: https://sampson-lee.github.io/omni-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00172 2026-04-02 cs.CV

Suppressing Non-Semantic Noise in Masked Image Modeling Representations

抑制掩码图像建模表示中的非语义噪声

Martine Hjelkrem-Tan, Marius Aasan, Rwiddhi Chakraborty, Gabriel Y. Arteaga, Changkyu Choi, Adín Ramírez Rivera

机构 * University of Oslo(奥斯陆大学) UiT The Arctic University of Norway(特罗姆瑟大学 - 挪威北极大学)

AI总结 本文提出SOAP方法,通过PCA分析实测和合成非语义图像,抑制图像补丁表示中的非语义信息,提升零样本性能。

Comments Published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏