arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2606.29301 2026-06-30 cs.CV

Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision

Pointer-CAD v2: 先规划后构建的尺寸感知参数化CAD生成

Dacheng Qi, Chenyu Wang, Jingwei Xu, Yi Ma, Shenghua Gao

机构 * The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) TranscEngram Monash University(墨尔本大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Pointer-CAD v2,采用先规划后构建范式,通过指针机制直接预测连续参数值,消除量化误差,并在顶点、边和面层级引入层次化几何精度指标,显著提升CAD生成的几何精度。

Comments Accepted to ECCV 2026. Code is available at https://github.com/Snitro/Pointer-CAD-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29200 2026-06-30 cs.LG

BrainRiem: Riemannian Prototype Learning for Source-Free Cross-Site Brain Network Diagnosis

BrainRiem: 基于黎曼原型学习的无源跨站点脑网络诊断

Kunyu Zhang, Tianxiang Xu

AI总结 针对多站点fMRI域偏移和隐私限制,提出BrainRiem无源域适应框架,通过流形感知双层优化学习紧致黎曼脑原型,在ABIDE和REST-meta-MDD上优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29198 2026-06-30 cs.CV

DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution

DTI: 面向生成式人脸视频超分辨率的动态轨迹初始化

Yingwei Tang, Chen Yan, Wendi Liu, Qiang Hu, Xiaoyun Zhang

AI总结 提出动态轨迹初始化范式,将生成式人脸视频超分辨率重构为输入驱动的定向恢复,通过增强注入条件机制和判别性引导实现保真度与感知质量的平衡,达到SOTA性能。

Comments This paper is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29029 2026-06-30 cs.CV

Adaptive Spectrum-Aware Feature Disentangled Network for Small Object Detection

自适应频谱感知特征解耦网络用于小目标检测

Yang Guo, Zihan Yang, Feifei Kou, Yulan Hu, Ran Zhang, Siyuan Yao

机构 * Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) Beijing University of Posts and Telecommunications(北京邮电大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Renmin University of China(中国人民大学) CITIC Bank(中国 CITIC 银行)

AI总结 针对小目标检测中背景干扰问题,提出SFDNet框架,通过自适应频谱解耦模块分解特征为互补频谱分量并丢弃背景干扰,结合类原型蒸馏增强同类语义一致性,在多个基准上显著超越现有方法。

Comments 19 pages, 7 figures. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28840 2026-06-30 cs.CV

DLGStream: Dynamic Language-embedded Guassian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming

DLGStream: 动态语言嵌入高斯泼溅用于开放词汇的自由视点视频流

Zhihui Ke, Yuyang Liu, Xiaobo Zhou, Tie Qiu

机构 * School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院)

AI总结 提出DLGStream,一种动态语言嵌入高斯表示,通过双不透明度属性联合优化颜色和语言特征,并引入插值变形场减少时间冗余,实现低帧大小、高帧率的开放词汇自由视点视频流。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28745 2026-06-30 cs.CV

FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution

FreqOrtho-SR:面向真实世界图像超分辨率的频率引导正交专家学习

Minh Son Hoang, Dinh Phu Tran, Quyen Nguyen Duc, Dam Hoang Phuong, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国科学技术院计算机学院)

AI总结 针对真实图像超分辨率中像素保真度与语义质量平衡难、退化多样性适应差的问题,提出FreqOrtho-SR,通过频率引导的LoRA专家混合(FreqMoE)实现退化类型特化,并利用正交梯度投影(OGP)保证像素与语义目标互补学习,在多个基准上取得优异性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28688 2026-06-30 cs.CV

LogiCo: A Unified Framework for Logical and Structural Anomaly Detection

LogiCo: 逻辑与结构异常检测的统一框架

Ximiao Zhang, Min Xu, Xiuzhuang Zhou

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) College of Information and Engineering, Capital Normal University(首都师范大学信息与工程学院)

AI总结 提出LogiCo框架,通过组件级特征重建同时检测逻辑和结构异常,在四个基准上达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28673 2026-06-30 cs.CV

BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production

BackTranslation2.0——一种基于语言学的评估手语生成质量的指标

Oliver Cory, Maksym Ivashechkin, Karahan Sahin, Oline Ranum, Jianhe Low, Edward Fish, Anton Pelykh, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

AI总结 提出BackTranslation2.0,一种基于语言学的文本到手语翻译评估指标,通过代理框架整合多个工具评估语法、音韵、流畅性和保真度,与人类判断高度相关。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28654 2026-06-30 cs.CV cs.AI cs.LG

FedLAS: Feature-Modulated Bidirectional Label Smoothing for Neural Network Calibration

FedLAS: 特征调制的双向标签平滑用于神经网络校准

Thiru Thillai Nadarasar Bahavan, Sachith Seneviratne, Saman Halgamuge

机构 * The University of Melbourne(墨尔本大学)

AI总结 提出FedLAS算法,通过特征范数置信度指标和双向校准门控模块,动态调整每个样本的标签平滑程度,同时解决过自信和欠自信问题,提升神经网络校准性能。

Comments ECCV 2026 Accepted Provisionally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28643 2026-06-30 cs.CV

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

Obliviate: 从自回归图像生成模型中擦除概念

Hossein Shakibania, Jonas Henry Grebe, Tobias Braun, Ege Aktemur, Saleh Aslani, Mehmet Görkem Yiğit, Marcus Rohrbach

机构 * TU Darmstadt, Germany(图宾根大学) Multimodal AI Lab, TU Darmstadt, Germany(多模态人工智能实验室) Zuse School ELIZA(祖斯学院ELIZA) hessian.AI, Germany(海西斯.AI)

AI总结 提出Obliviate方法,通过KL散度监督视觉token分布、轨迹级更新和对齐视觉前缀,有效擦除自回归文生图模型中的有害概念,在保持模型效用同时大幅降低不当内容生成。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28626 2026-06-30 cs.CV

SIGNET: Motion-Level Knowledge Transfer for Cross-Language Sign Language Translation

SIGNET: 跨语言手语翻译的运动级知识迁移

Sobhan Asasi, Ozge Mercanoglu Sincan, Richard Bowden

机构 * CVSSP, University of Surrey, United Kingdom(CVSSP,萨里大学,英国)

AI总结 提出SIGNET框架,通过注意力机制和手部先验聚合实现运动级知识迁移,在多个基准上达到最先进翻译性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01971 2026-06-30 cs.CV

ProtoFair: Fair Self-Supervised Contrastive Learning via Pseudo-Counterfactual Pairs

ProtoFair: 通过伪反事实对实现公平的自监督对比学习

Marah Halawa, Olaf Hellwich

机构 * Technische Universität Berlin(柏林技术大学)

AI总结 提出ProtoFair,一种无需修改现有SSL目标的公平性对比损失,通过无监督原型聚类识别伪反事实对,拉近内容匹配的跨组样本,学习对敏感属性不变的表示,在CelebA和UTKFace上提升公平性并保持精度。

Comments Paper accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31603 2026-06-30 cs.CV cs.AI

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models

Lumos-Nexus: 面向视频统一模型的高效频率桥接与同质潜在空间

Jiazheng Xing, Hangjie Yuan, Lingling Cai, Xinyu Liu, Yujie Wei, Fei Du, Tao Feng, Hai Ci, Jiasheng Tang, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 提出Lumos-Nexus框架,通过两阶段训练和渐进频率桥接,在保持推理能力的同时显著提升视频生成保真度。

Comments ECCV 2026 Camera-Ready Version. Project page (https://jiazheng-xing.github.io/nexus-lumos-home/) and Code (https://github.com/alibaba-damo-academy/Lumos-Custom/) are available

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11913 2026-06-30 cs.CV

Vector Scaffolding: Inter-Scale Orchestration for Differentiable Image Vectorization

向量支架:跨尺度 orchestration 用于可微图像向量化

Jaerin Lee, Kanggeon Lee, Kyoung Mu Lee

机构 * Dept. of ECE&ASRI, Seoul National University, Korea(电子工程与人工智能研究院,首尔国立大学,韩国) IPAI, Seoul National University, Korea(人工智能研究所,首尔国立大学,韩国)

AI总结 本文提出 Vector Scaffolding 框架,通过分层优化解决传统方法中拓扑坍缩问题,提升向量化效果与编辑性。

Comments 22 pages, 12 figures, ECCV 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26520 2026-06-30 cs.CV

3D-LENS: A 3D Lifting-based Elevated Novel-view Synthesis method for Single-View Aerial-Ground Re-Identification

3D-LENS:一种基于3D提升的单视角空地重识别方法

William Grolleau, Astrid Sabourin, Guillaume Lapouge, Catherine Achard

机构 * Université Paris-Saclay, CEA, List(巴黎萨克雷大学、CEA、List) Sorbonne University, CNRS, Institute of Intelligent Systems and Robotics (ISIR)(索邦大学、CNRS、智能系统与机器人研究所)

AI总结 本文提出3D-LENS方法,通过结合几何一致的新型视角合成与鲁棒表示学习,解决单视角空地重识别中的视角域差距问题,实现跨视角检索。

Comments 15 pages, 2 figures, accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19679 2026-06-30 cs.CV

MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation

MMControl: 多模态控制用于联合音频视频生成

Liyang Li, Wen Wang, Canyu Zhao, Tianjian Feng, Zhiyue Zhao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

AI总结 本文提出MMControl,通过双流条件注入机制实现联合音频视频生成的多模态控制,支持视觉和听觉信号的精细控制,提升跨模态对齐效果。

Comments Accepted to ECCV 2026. Project page: https://aim-uofa.github.io/MMControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19702 2026-06-30 cs.CV

Face Anything: 4D Face Reconstruction from Any Image Sequence

人脸任意:从任意图像序列中进行4D人脸重建

Umut Kocasari, Simon Giebenhain, Richard Shaw, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出基于标准面部点预测的统一方法,用于高保真的4D人脸重建,通过单次前馈模型实现时间一致的几何和可靠的对应关系,实验表明在重建和跟踪任务中性能优于现有方法。

Comments Accepted to ECCV 2026. Project website: https://kocasariumut.github.io/FaceAnything/ , Video: https://www.youtube.com/watch?v=wSGHpAscp0Y

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19624 2026-06-30 cs.CV

GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction

GRAFT:用于人体场景重建的几何细化和拟合变换

Pradyumna YM, Yuxuan Xue, Yue Chen, Nikita Kister, István Sárándi, Gerard Pons-Moll

机构 * Westlake University(西湖大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

AI总结 GRAFT通过几何细化和拟合变换,提升单图像中人体与场景交互的重建质量,实现快速且精确的交互推理。

Comments ECCV 2026. Project Page: https://pradyumnaym.github.io/graft

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10764 2026-06-30 cs.CV

Dual-End Consistency Model

双端一致性模型

Linwei Dong, Ruoyu Guo, Ge Bai, Zehuan Yuan, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Bytedance Inc.(字节跳动公司) Zhejiang Lab(浙江实验室)

AI总结 本文提出双端一致性模型,通过选择关键子轨迹集群解决训练不稳定和采样灵活性问题,实现稳定高效的生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07021 2026-06-30 cs.CV

ModuSeg: Decoupling Object Discovery and Semantic Retrieval for Training-Free Weakly Supervised Segmentation

ModuSeg:解耦目标发现与语义检索以实现无训练弱监督分割

Qingze He, Fagui Liu, Dengke Zhang, Qingmao Wei, Quan Tang

机构 * South China University of Technology Pengcheng Laboratory(华南理工大学鹏城实验室)

AI总结 ModuSeg通过解耦目标发现与语义检索,提出无训练弱监督分割框架,利用通用掩码提出器和语义基础模型构建特征库,提升分割精度与鲁棒性。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07753 2026-06-30 cs.CV cs.CL cs.LG

Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding

共生MoE:解构生成与理解之间的协同效应

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

AI总结 本文提出Symbiotic-MoE框架,通过模态感知专家解缠绕和渐进训练策略,解决生成与理解任务间的冲突,提升多模态协同能力,在MMLU和OCRBench上取得显著提升。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02714 2026-06-30 cs.CV

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

ExploreVLA: 为端到端自动驾驶的密集世界建模与探索

Zihao Sheng, Xin Ye, Jingru Luo, Sikai Chen, Liu Ren

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出基于世界建模的统一理解与生成框架,通过密集监督和内在奖励提升自动驾驶策略探索能力,在NAVSIM和nuScenes基准上取得优异性能。

Comments Accepted to ECCV 2026. The code is available at https://zihaosheng.github.io/ExploreVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02327 2026-06-30 cs.CV cs.AI

Steerable Visual Representations

可操控的视觉表示

Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano

机构 * University of Technology Nuremberg(纽伦堡工业大学) Carnegie Mellon University(卡内基梅隆大学) International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院)

AI总结 本文提出可操控的视觉表示,通过自然语言指导视觉特征,提升视觉任务的灵活性和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12957 2026-06-30 cs.CV

HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding

HSD:基于分层推测解码的文档解析视觉语言模型训练免费加速

Wenhui Liao, Hongliang Li, Pengyu Xie, Xinyu Cai, Yufan Shen, Yi Xin, Qi Qin, Shenglong Ye, Tianbin Li, Ming Hu, Junjun He, Yihao Liu, Wenhai Wang, Min Dou, Bin Fu, Botian Shi, Yu Qiao, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Institute of Advanced Technology, CAS(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

AI总结 本文提出HSD分层推测解码框架,通过轻量级管道起草器预测区域划分并生成粗稿,分阶段验证以保持全文连贯性,实验证明在文档解析任务中实现显著加速。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26658 2026-06-30 cs.CV

Zero-Shot Depth from Defocus

无监督的景深估计

Yiming Zuo, Hongyu Wen, Venkat Subramanian, Patrick Chen, Karhan Kayan, Mario Bijelic, Felix Heide, Jia Deng

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

AI总结 本文提出ZEDD基准和FOSSA网络,通过堆栈注意力层和焦点距离嵌入实现无监督景深估计,利用现有RGBD数据生成合成焦点堆栈,实验显示误差降低55.7%。

Comments Accepted to ECCV 2026. Added additional results and clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25743 2026-06-30 cs.CV

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25265 2026-06-30 cs.CV

ViewSplat: View-Adaptive 3D Gaussian Splatting for Feed-Forward Synthesis

ViewSplat: 用于前馈合成的视图自适应3D高斯散射

Moonyeon Jeong, Seunggi Min, Suhyeon Lee, Hongje Seong

机构 * University of Seoul(首尔市立大学) Korea Electronics Technology Institute(韩国电子技术研究院)

AI总结 ViewSplat通过视图自适应的3D高斯散射方法提升未置位图像的视图合成精度,采用视图依赖的残差更新机制,实现高保真度的实时渲染。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25144 2026-06-30 cs.CV cs.AI

FD$^2$: A Dedicated Framework for Fine-Grained Dataset Distillation

FD²:面向细粒度数据集蒸馏的专用框架

Hongxu Ma, Guang Li, Shijie Wang, Dongzhan Zhou, Baoli Sun, Takahiro Ogawa, Miki Haseyama, Zhihui Wang

机构 * Zhejiang University(浙江大学) Hokkaido University(北海道大学) The University of Queensland(昆士兰大学) Shanghai AI Laboratory(上海人工智能实验室) Dalian University of Technology(大连理工大学)

AI总结 本文提出FD²框架,通过局部化判别区域和构建细粒度表示,解决细粒度数据集蒸馏中样本相似性过高的问题,提升识别性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12703 2026-06-30 cs.CV

SVCBench: A Streaming Video Counting Benchmark for Spatial-Temporal State Maintenance

SVCBench:一种用于空间-时间状态维护的流视频计数基准

Pengyiang Liu, Zhongyue Shi, Hongye Hao, Qi Fu, Xueting Bi, Siwei Zhang, Xiaoyang Hu, Zitian Wang, Linjiang Huang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 SVCBench通过流式多点查询观察状态维护轨迹,设计了三个互补指标来诊断数值精度、轨迹一致性及时间意识,评估主流视频语言模型在空间-时间状态维护上的不足,尤其在周期性事件计数上表现不佳。

Comments Accepted to ECCV 2026. Project page: https://buaa-colalab.github.io/SVCBench/

详情

展开后加载摘要…

URL PDF HTML 收藏