arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-06-30 至 2026-06-30 共收录 98
2604.02714 2026-06-30 cs.CV

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

ExploreVLA: 为端到端自动驾驶的密集世界建模与探索

Zihao Sheng, Xin Ye, Jingru Luo, Sikai Chen, Liu Ren

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出基于世界建模的统一理解与生成框架,通过密集监督和内在奖励提升自动驾驶策略探索能力,在NAVSIM和nuScenes基准上取得优异性能。

Comments Accepted to ECCV 2026. The code is available at https://zihaosheng.github.io/ExploreVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02327 2026-06-30 cs.CV cs.AI

Steerable Visual Representations

可操控的视觉表示

Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano

机构 * University of Technology Nuremberg(纽伦堡工业大学) Carnegie Mellon University(卡内基梅隆大学) International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院)

AI总结 本文提出可操控的视觉表示,通过自然语言指导视觉特征,提升视觉任务的灵活性和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12957 2026-06-30 cs.CV

HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding

HSD:基于分层推测解码的文档解析视觉语言模型训练免费加速

Wenhui Liao, Hongliang Li, Pengyu Xie, Xinyu Cai, Yufan Shen, Yi Xin, Qi Qin, Shenglong Ye, Tianbin Li, Ming Hu, Junjun He, Yihao Liu, Wenhai Wang, Min Dou, Bin Fu, Botian Shi, Yu Qiao, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Institute of Advanced Technology, CAS(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

AI总结 本文提出HSD分层推测解码框架,通过轻量级管道起草器预测区域划分并生成粗稿,分阶段验证以保持全文连贯性,实验证明在文档解析任务中实现显著加速。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26658 2026-06-30 cs.CV

Zero-Shot Depth from Defocus

无监督的景深估计

Yiming Zuo, Hongyu Wen, Venkat Subramanian, Patrick Chen, Karhan Kayan, Mario Bijelic, Felix Heide, Jia Deng

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

AI总结 本文提出ZEDD基准和FOSSA网络,通过堆栈注意力层和焦点距离嵌入实现无监督景深估计,利用现有RGBD数据生成合成焦点堆栈,实验显示误差降低55.7%。

Comments Accepted to ECCV 2026. Added additional results and clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25743 2026-06-30 cs.CV

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25265 2026-06-30 cs.CV

ViewSplat: View-Adaptive 3D Gaussian Splatting for Feed-Forward Synthesis

ViewSplat: 用于前馈合成的视图自适应3D高斯散射

Moonyeon Jeong, Seunggi Min, Suhyeon Lee, Hongje Seong

机构 * University of Seoul(首尔市立大学) Korea Electronics Technology Institute(韩国电子技术研究院)

AI总结 ViewSplat通过视图自适应的3D高斯散射方法提升未置位图像的视图合成精度,采用视图依赖的残差更新机制,实现高保真度的实时渲染。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25144 2026-06-30 cs.CV cs.AI

FD$^2$: A Dedicated Framework for Fine-Grained Dataset Distillation

FD²:面向细粒度数据集蒸馏的专用框架

Hongxu Ma, Guang Li, Shijie Wang, Dongzhan Zhou, Baoli Sun, Takahiro Ogawa, Miki Haseyama, Zhihui Wang

机构 * Zhejiang University(浙江大学) Hokkaido University(北海道大学) The University of Queensland(昆士兰大学) Shanghai AI Laboratory(上海人工智能实验室) Dalian University of Technology(大连理工大学)

AI总结 本文提出FD²框架,通过局部化判别区域和构建细粒度表示,解决细粒度数据集蒸馏中样本相似性过高的问题,提升识别性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12703 2026-06-30 cs.CV

SVCBench: A Streaming Video Counting Benchmark for Spatial-Temporal State Maintenance

SVCBench:一种用于空间-时间状态维护的流视频计数基准

Pengyiang Liu, Zhongyue Shi, Hongye Hao, Qi Fu, Xueting Bi, Siwei Zhang, Xiaoyang Hu, Zitian Wang, Linjiang Huang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 SVCBench通过流式多点查询观察状态维护轨迹,设计了三个互补指标来诊断数值精度、轨迹一致性及时间意识,评估主流视频语言模型在空间-时间状态维护上的不足,尤其在周期性事件计数上表现不佳。

Comments Accepted to ECCV 2026. Project page: https://buaa-colalab.github.io/SVCBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22282 2026-06-30 cs.CV cs.AI

UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation

UniMotion: 一种用于运动-文本-视觉理解和生成的统一框架

Ziyi Wang, Xinshun Wang, Shuang Chen, Yang Cong, Mengyuan Liu

机构 * Peking University(北京大学) Donghua University(东华大学) South China University of Technology(华南理工大学)

AI总结 UniMotion首次提出统一框架,同时处理人类运动、自然语言和RGB图像的理解与生成,通过连续模态处理和自监督预训练解决传统模型的局限性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17975 2026-06-30 cs.CV

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

AHOY! 从YouTube视频中通过高斯点云和视频扩散先验构建可动画的遮挡人类

Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Imperial College London(帝国理工学院) KAUST(阿卜杜拉国王科技大学)

AI总结 本文提出AHOY方法,通过高斯点云和视频扩散先验从真实视频中重建完整可动画3D人体,解决遮挡挑战,提出四点贡献:生成监督、两阶段架构、解耦策略、头身监督。

Comments ECCV 2026. Project page is available at https://miraymen.github.io/ahoy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16506 2026-06-30 cs.CV

VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations

VIEW2SPACE:从稀疏观察研究多视角视觉推理

Fucai Ke, Zhixi Cai, Boying Li, Long Chen, Beibei Lin, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Hamid Rezatofighi

机构 * Monash University(莫纳什大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出VIEW2SPACE基准,通过物理仿真生成高保真3D场景,评估多视角视觉推理的现状,发现多数模型表现欠佳,提出Grounded Chain-of-Thought with Visual Evidence提升性能并推广至现实数据。

Journal ref European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05663 2026-06-30 cs.CV

LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection

LeAD-M3D:利用不对称蒸馏实现实时单目3D检测

Johannes Meier, Jonathan Michel, Oussema Dhaouadi, Yung-Hsu Yang, Christoph Reich, Zuria Bauer, Stefan Roth, Marc Pollefeys, Jacques Kaiser, Daniel Cremers

机构 * DeepScenario ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) TU Darmstadt(达姆施塔特工业大学) ELIZA Microsoft(微软)

AI总结 本文提出LeAD-M3D,通过不对称蒸馏提升单目3D检测精度与效率,无需额外模态,在KITTI和Waymo数据集上达到SOTA性能,速度提升达3.6倍。

Comments ECCV 2026. Project page: https://deepscenario.github.io/LeAD-M3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20157 2026-06-30 cs.CV

SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery

SKEL-CF:从粗到细的生物力学骨架与表面网格恢复

Da Li, Jiping Jin, Xuanlong Yu, Wei Liu, Xiaodong Cun, Kai Chen, Rui Fan, Jiangang Kong, Xi Shen

AI总结 本文提出SKEL-CF框架,通过变压器编码器-解码器结构实现生物力学骨架参数的粗到细估计,利用4DHuman-SKEL数据集提升训练质量,并通过相机建模缓解深度和尺度模糊问题,实验验证了其在MOYO数据集上的优越性能。

Comments Accepted By ECCV 2026;Project page: https://pokerman8.github.io/SKEL-CF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14526 2026-06-30 cs.CV

LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion

LatSearch:基于潜在奖励的搜索以加速推理时间扩展在视频扩散中

Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Zhensong Zhang, Jifei Song, Jiankang Deng, Ioannis Patras

AI总结 本文提出LatSearch,通过潜在奖励引导的重采样和剪枝机制,提升视频扩散的推理效率和生成质量,验证其在VBench-2.0基准上的优越性。

Comments Accepted at ECCV 2026. Project page: see https://zengqunzhao.github.io/LatSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14152 2026-06-30 cs.CV

SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation

SK-Adapter:基于骨架的结构控制用于原生3D生成

Anbang Wang, Yuzhuo Ao, Shangzhe Wu, Chi-Keung Tang

AI总结 本文提出SK-Adapter框架,通过将3D骨架作为第一类控制信号,实现原生3D生成的精确结构控制,同时保留几何与纹理质量,优于现有基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13082 2026-06-30 cs.CV cs.RO eess.IV

InterEdit: Navigating Text-Guided 3D Dyadic Human Motion Editing

InterEdit:文本引导的3D双人运动编辑

Yebin Yang, Di Wen, Lei Qi, Weitong Kong, Junwei Zheng, Ruiping Liu, Yufan Chen, Chengzhi Wu, Kailun Yang, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Kunyu Peng

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) KAUST(韩国国立大学) INSAIT

AI总结 本文提出InterEdit3D数据集和TMME基准,基于文本引导的双人3D运动编辑方法,通过语义感知计划令牌对齐和交互感知频率令牌对齐策略提升编辑一致性与保真度。

Comments Accepted to ECCV 2026. The dataset and code will be released at https://github.com/YNG916/InterEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12598 2026-06-30 cs.CV

Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating

神经门:通过神经层面梯度门缓解LVLMs的隐私风险

Xiangkui Cao, Jie Zhang, Meina Kan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出Neural Gate方法,通过神经层面模型编辑提升LVLMs对隐私问题的拒绝率,增强隐私保护同时保持模型原有功能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11734 2026-06-30 cs.CV

VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On

VTEdit-Bench:多参考图像编辑模型在虚拟试穿中的综合基准

Xiaoye Liang, Zhiyuan Qu, Mingye Zou, Jiaxin Liu, Lai Jiang, Mai Xu, Yiheng Zhu

AI总结 本文提出VTEdit-Bench基准,用于评估多参考图像编辑模型在虚拟试穿中的性能,包含24220对测试图像,涵盖五个代表性任务,通过VTEdit-QA评估模型一致性、布料一致性和图像质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05999 2026-06-30 cs.CV

RePer-360: Releasing Perspective Priors for 360$^\circ$ Depth Estimation via Self-Modulation

RePer-360:通过自调节机制释放视角先验以实现360度深度估计

Cheng Guan, Chunyu Lin, Zhijie Shen, Junsong Zhang, Jiyuan Wang

AI总结 本文提出RePer-360框架,通过自调节机制在保留预训练视角先验的情况下实现单目全景深度估计,仅用1%的数据即可提升RMSE约20%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03143 2026-06-30 cs.CV cs.AI

Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing

二维编辑,三维验证:强化学习用于多视角一致场景编辑

Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, Yuyang Yin, Lang Nie, Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang Liao, Guosheng Lin

AI总结 本文提出RL3DEdit框架,利用强化学习优化多视角一致的3D场景编辑,通过VGGT模型生成的置信度图和姿态误差作为奖励信号,提升编辑质量与效率。

Comments Accepted by ECCV 2026, 32 pages, 10 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02149 2026-06-30 cs.CV eess.SP

3D Field of Junctions: A Noise-Robust, Training-Free Structural Prior for Volumetric Inverse Problems

3D 立体接点场:一种噪声鲁棒、无需训练的结构先验用于体积分量逆问题

Narges Moeini, Namhoon Kim, Justin Romberg, Sara Fridovich-Keil

AI总结 本文提出3D FoJ方法,通过优化3D楔形接点来实现体积分量逆问题的去噪,无需训练数据,保留和增强3D边缘和角结构,适用于低信噪比下的多种3D成像任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23294 2026-06-30 cs.CV

Towards Long-Form Spatio-Temporal Video Grounding

面向长形式时空视频定位

Xin Gu, Bing Fan, Jiali Yao, Zhipeng Zhang, Yan Huang, Cheng Han, Heng Fan, Libo Zhang

AI总结 本文提出ART-STVG方法,针对长时视频中的目标定位问题,通过自回归Transformer架构和记忆银行设计,提升对长视频中时空信息的处理能力,实验表明其在长形式STVG任务中优于现有方法。

Comments 22 pages, 11 figures. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19323 2026-06-30 cs.CV

DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering

DefenseSplat: 通过频率感知过滤增强3D高斯点划的鲁棒性

Yiran Qiao, Yiren Lu, Yunlai Zhou, Rui Yang, Linlin Hou, Yu Yin, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学)

AI总结 本文提出一种频率感知过滤策略,通过抑制对抗性噪声提升3D高斯点划的鲁棒性,同时保持训练性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15727 2026-06-30 cs.CV cs.AI cs.GR cs.LG eess.IV

Spanning the Visual Analogy Space with a Weight Basis of LoRAs

通过LoRAs的权重基来跨越视觉类比空间

Hila Manor, Rinon Gal, Haggai Maron, Tomer Michaeli, Gal Chechik

AI总结 本文提出LoRWeB,通过在单次推理中为每个类比任务专门化模型,动态组合学习的变换原语,以提升视觉类比学习的泛化能力。

Comments Accepted to ECCV 2026; Code and data are in https://research.nvidia.com/labs/par/lorweb

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21078 2026-06-30 cs.CV

UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer

UniPR-3D:迈向基于视觉几何基础的通用视觉位置识别

Tianchen Deng, Xun Chen, Ziming Li, Hongming Shen, Shuhao Zhai, Danwei Wang, Javier Civera, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Zaragoza(萨拉戈萨大学) University of Macau(澳门大学)

AI总结 本文提出UniPR-3D,首个融合多视角信息的视觉位置识别架构,通过3D tokens与2D tokens联合描述,提升跨视角推理与泛化能力,实验表明其优于单多视角基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10342 2026-06-30 cs.CV

CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

CoSPlan: 通过场景图增量更新实现纠正式序列规划

Shresth Grover, Priyank Pathak, Akash Kumar, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学(UCF)人工智能研究所)

AI总结 CoSPlan基准测试要求视觉语言模型在初始场景到目标场景间规划视觉动作序列,通过引入错误动作检测与纠正机制,评估模型在复杂视觉任务中的能力。

Comments The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21545 2026-06-30 cs.CV

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除

Sanghyun Jo, Donghwan Lee, Eunji Jung, Seong Je Oh, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20117 2026-06-30 cs.CV cs.SD eess.AS

Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

通过解耦音频语义实现延迟双向对齐的音频视觉分割

Jingqi Tian, Yiheng Du, Haoji Zhang, Yuji Wang, Isaac Ning Lee, Xulong Bai, Tianrui Zhu, Jingxuan Niu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学)

AI总结 本文提出DDAVS方法,通过解耦音频语义和延迟双向对齐解决音频视觉分割中的多源纠缠和视听错位问题,实验表明其在多种场景下均取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17151 2026-06-30 cs.CV

Text-Conditioned Background Generation for Editable Multi-Layer Documents

基于文本条件的背景生成用于可编辑的多层文档

Taewon Kang, Joseph K J, Chris Tensmeyer, Jihyung Kil, Wanrong Zhu, Ming C. Lin, Vlad I. Morariu

AI总结 本文提出一个多页面编辑和主题连续性的文档中心背景生成框架,通过自动可读性优化和摘要-指令过程确保文本可读性和视觉一致性。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026). 56 pages, 39 figures

详情

展开后加载摘要…

URL PDF HTML 收藏