arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2603.22282 2026-06-30 cs.CV cs.AI

UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation

UniMotion: 一种用于运动-文本-视觉理解和生成的统一框架

Ziyi Wang, Xinshun Wang, Shuang Chen, Yang Cong, Mengyuan Liu

机构 * Peking University(北京大学) Donghua University(东华大学) South China University of Technology(华南理工大学)

AI总结 UniMotion首次提出统一框架,同时处理人类运动、自然语言和RGB图像的理解与生成,通过连续模态处理和自监督预训练解决传统模型的局限性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17975 2026-06-30 cs.CV

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

AHOY! 从YouTube视频中通过高斯点云和视频扩散先验构建可动画的遮挡人类

Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Imperial College London(帝国理工学院) KAUST(阿卜杜拉国王科技大学)

AI总结 本文提出AHOY方法,通过高斯点云和视频扩散先验从真实视频中重建完整可动画3D人体,解决遮挡挑战,提出四点贡献:生成监督、两阶段架构、解耦策略、头身监督。

Comments ECCV 2026. Project page is available at https://miraymen.github.io/ahoy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16506 2026-06-30 cs.CV

VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations

VIEW2SPACE:从稀疏观察研究多视角视觉推理

Fucai Ke, Zhixi Cai, Boying Li, Long Chen, Beibei Lin, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Hamid Rezatofighi

机构 * Monash University(莫纳什大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出VIEW2SPACE基准,通过物理仿真生成高保真3D场景,评估多视角视觉推理的现状,发现多数模型表现欠佳,提出Grounded Chain-of-Thought with Visual Evidence提升性能并推广至现实数据。

Journal ref European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05663 2026-06-30 cs.CV

LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection

LeAD-M3D:利用不对称蒸馏实现实时单目3D检测

Johannes Meier, Jonathan Michel, Oussema Dhaouadi, Yung-Hsu Yang, Christoph Reich, Zuria Bauer, Stefan Roth, Marc Pollefeys, Jacques Kaiser, Daniel Cremers

机构 * DeepScenario ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) TU Darmstadt(达姆施塔特工业大学) ELIZA Microsoft(微软)

AI总结 本文提出LeAD-M3D,通过不对称蒸馏提升单目3D检测精度与效率,无需额外模态,在KITTI和Waymo数据集上达到SOTA性能,速度提升达3.6倍。

Comments ECCV 2026. Project page: https://deepscenario.github.io/LeAD-M3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20157 2026-06-30 cs.CV

SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery

SKEL-CF:从粗到细的生物力学骨架与表面网格恢复

Da Li, Jiping Jin, Xuanlong Yu, Wei Liu, Xiaodong Cun, Kai Chen, Rui Fan, Jiangang Kong, Xi Shen

AI总结 本文提出SKEL-CF框架,通过变压器编码器-解码器结构实现生物力学骨架参数的粗到细估计,利用4DHuman-SKEL数据集提升训练质量,并通过相机建模缓解深度和尺度模糊问题,实验验证了其在MOYO数据集上的优越性能。

Comments Accepted By ECCV 2026;Project page: https://pokerman8.github.io/SKEL-CF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14526 2026-06-30 cs.CV

LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion

LatSearch:基于潜在奖励的搜索以加速推理时间扩展在视频扩散中

Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Zhensong Zhang, Jifei Song, Jiankang Deng, Ioannis Patras

AI总结 本文提出LatSearch,通过潜在奖励引导的重采样和剪枝机制,提升视频扩散的推理效率和生成质量,验证其在VBench-2.0基准上的优越性。

Comments Accepted at ECCV 2026. Project page: see https://zengqunzhao.github.io/LatSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14152 2026-06-30 cs.CV

SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation

SK-Adapter:基于骨架的结构控制用于原生3D生成

Anbang Wang, Yuzhuo Ao, Shangzhe Wu, Chi-Keung Tang

AI总结 本文提出SK-Adapter框架,通过将3D骨架作为第一类控制信号,实现原生3D生成的精确结构控制,同时保留几何与纹理质量,优于现有基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13082 2026-06-30 cs.CV cs.RO eess.IV

InterEdit: Navigating Text-Guided 3D Dyadic Human Motion Editing

InterEdit:文本引导的3D双人运动编辑

Yebin Yang, Di Wen, Lei Qi, Weitong Kong, Junwei Zheng, Ruiping Liu, Yufan Chen, Chengzhi Wu, Kailun Yang, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Kunyu Peng

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) KAUST(韩国国立大学) INSAIT

AI总结 本文提出InterEdit3D数据集和TMME基准,基于文本引导的双人3D运动编辑方法,通过语义感知计划令牌对齐和交互感知频率令牌对齐策略提升编辑一致性与保真度。

Comments Accepted to ECCV 2026. The dataset and code will be released at https://github.com/YNG916/InterEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12598 2026-06-30 cs.CV

Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating

神经门:通过神经层面梯度门缓解LVLMs的隐私风险

Xiangkui Cao, Jie Zhang, Meina Kan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出Neural Gate方法,通过神经层面模型编辑提升LVLMs对隐私问题的拒绝率,增强隐私保护同时保持模型原有功能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11734 2026-06-30 cs.CV

VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On

VTEdit-Bench:多参考图像编辑模型在虚拟试穿中的综合基准

Xiaoye Liang, Zhiyuan Qu, Mingye Zou, Jiaxin Liu, Lai Jiang, Mai Xu, Yiheng Zhu

AI总结 本文提出VTEdit-Bench基准,用于评估多参考图像编辑模型在虚拟试穿中的性能,包含24220对测试图像,涵盖五个代表性任务,通过VTEdit-QA评估模型一致性、布料一致性和图像质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05999 2026-06-30 cs.CV

RePer-360: Releasing Perspective Priors for 360$^\circ$ Depth Estimation via Self-Modulation

RePer-360:通过自调节机制释放视角先验以实现360度深度估计

Cheng Guan, Chunyu Lin, Zhijie Shen, Junsong Zhang, Jiyuan Wang

AI总结 本文提出RePer-360框架,通过自调节机制在保留预训练视角先验的情况下实现单目全景深度估计,仅用1%的数据即可提升RMSE约20%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03143 2026-06-30 cs.CV cs.AI

Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing

二维编辑,三维验证:强化学习用于多视角一致场景编辑

Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, Yuyang Yin, Lang Nie, Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang Liao, Guosheng Lin

AI总结 本文提出RL3DEdit框架,利用强化学习优化多视角一致的3D场景编辑,通过VGGT模型生成的置信度图和姿态误差作为奖励信号,提升编辑质量与效率。

Comments Accepted by ECCV 2026, 32 pages, 10 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02149 2026-06-30 cs.CV eess.SP

3D Field of Junctions: A Noise-Robust, Training-Free Structural Prior for Volumetric Inverse Problems

3D 立体接点场:一种噪声鲁棒、无需训练的结构先验用于体积分量逆问题

Narges Moeini, Namhoon Kim, Justin Romberg, Sara Fridovich-Keil

AI总结 本文提出3D FoJ方法,通过优化3D楔形接点来实现体积分量逆问题的去噪,无需训练数据,保留和增强3D边缘和角结构,适用于低信噪比下的多种3D成像任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23294 2026-06-30 cs.CV

Towards Long-Form Spatio-Temporal Video Grounding

面向长形式时空视频定位

Xin Gu, Bing Fan, Jiali Yao, Zhipeng Zhang, Yan Huang, Cheng Han, Heng Fan, Libo Zhang

AI总结 本文提出ART-STVG方法,针对长时视频中的目标定位问题,通过自回归Transformer架构和记忆银行设计,提升对长视频中时空信息的处理能力,实验表明其在长形式STVG任务中优于现有方法。

Comments 22 pages, 11 figures. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19323 2026-06-30 cs.CV

DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering

DefenseSplat: 通过频率感知过滤增强3D高斯点划的鲁棒性

Yiran Qiao, Yiren Lu, Yunlai Zhou, Rui Yang, Linlin Hou, Yu Yin, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学)

AI总结 本文提出一种频率感知过滤策略,通过抑制对抗性噪声提升3D高斯点划的鲁棒性,同时保持训练性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15727 2026-06-30 cs.CV cs.AI cs.GR cs.LG eess.IV

Spanning the Visual Analogy Space with a Weight Basis of LoRAs

通过LoRAs的权重基来跨越视觉类比空间

Hila Manor, Rinon Gal, Haggai Maron, Tomer Michaeli, Gal Chechik

AI总结 本文提出LoRWeB,通过在单次推理中为每个类比任务专门化模型,动态组合学习的变换原语,以提升视觉类比学习的泛化能力。

Comments Accepted to ECCV 2026; Code and data are in https://research.nvidia.com/labs/par/lorweb

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21078 2026-06-30 cs.CV

UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer

UniPR-3D:迈向基于视觉几何基础的通用视觉位置识别

Tianchen Deng, Xun Chen, Ziming Li, Hongming Shen, Shuhao Zhai, Danwei Wang, Javier Civera, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Zaragoza(萨拉戈萨大学) University of Macau(澳门大学)

AI总结 本文提出UniPR-3D,首个融合多视角信息的视觉位置识别架构,通过3D tokens与2D tokens联合描述,提升跨视角推理与泛化能力,实验表明其优于单多视角基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10342 2026-06-30 cs.CV

CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

CoSPlan: 通过场景图增量更新实现纠正式序列规划

Shresth Grover, Priyank Pathak, Akash Kumar, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学(UCF)人工智能研究所)

AI总结 CoSPlan基准测试要求视觉语言模型在初始场景到目标场景间规划视觉动作序列,通过引入错误动作检测与纠正机制,评估模型在复杂视觉任务中的能力。

Comments The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21545 2026-06-30 cs.CV

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除

Sanghyun Jo, Donghwan Lee, Eunji Jung, Seong Je Oh, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20117 2026-06-30 cs.CV cs.SD eess.AS

Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

通过解耦音频语义实现延迟双向对齐的音频视觉分割

Jingqi Tian, Yiheng Du, Haoji Zhang, Yuji Wang, Isaac Ning Lee, Xulong Bai, Tianrui Zhu, Jingxuan Niu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学)

AI总结 本文提出DDAVS方法,通过解耦音频语义和延迟双向对齐解决音频视觉分割中的多源纠缠和视听错位问题,实验表明其在多种场景下均取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17151 2026-06-30 cs.CV

Text-Conditioned Background Generation for Editable Multi-Layer Documents

基于文本条件的背景生成用于可编辑的多层文档

Taewon Kang, Joseph K J, Chris Tensmeyer, Jihyung Kil, Wanrong Zhu, Ming C. Lin, Vlad I. Morariu

AI总结 本文提出一个多页面编辑和主题连续性的文档中心背景生成框架,通过自动可读性优化和摘要-指令过程确保文本可读性和视觉一致性。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026). 56 pages, 39 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16413 2026-06-30 cs.CV

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM: 使大语言模型能够理解边界表示

Liyuan Deng, Hao Guo, Yongkang Dai, Yunpeng Bai, Yifan Zhu, Yuanyuan Gao, Huaxi Huang, Yilei Shi

AI总结 BrepLLM通过双阶段训练管道,将B-rep数据转化为图表示并进行语义对齐,实现3D语言生成,展示了在3D物体分类和描述任务中的最佳性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21256 2026-06-30 cs.CV

LaGen: Towards Autoregressive LiDAR Scene Generation

LaGen:迈向自主驾驶的自回归激光雷达场景生成

Sizhuo Zhou, Xiaosong Jia, Fanrui Zhang, Junjie Li, Juyong Zhang, Yukang Feng, Jianwen Sun, Songbur Wong, Junqi You, Junchi Yan

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出LaGen,首个支持长时交互生成的自回归框架,能基于单帧输入生成高保真4D激光雷达场景,并通过场景解耦和噪声调节模块提升生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19119 2026-06-30 cs.CV

MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

MonoSR: 从单目图像进行开放词汇空间推理

Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li

机构 * Technical University of Munich(慕尼黑工业大学) A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所) Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出MonoSR大规模单目空间推理数据集,涵盖多种场景并支持多种问题类型,评估先进视觉-语言模型并分析辅助信息对单目空间推理的重要性,为开放世界中的单目空间推理提供基础。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14900 2026-06-30 cs.CV cs.AI cs.CL

Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

Skin-R1: 基于视觉-语言模型的临床知识引导的皮肤病诊断

Zehao Liu, Weijieying Ren, Jipeng Zhang, Tianxiang Zhao, Jingxi Zhu, Xiaoting Li, Vasant G Honavar

AI总结 Skin-R1结合教材引导的临床推理监督与强化学习,提升皮肤病诊断的准确性和鲁棒性,通过构建基于教材的推理生成器和强化学习框架,改进模型在异构数据集和稀疏标注下的表现。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12784 2026-06-30 cs.CV cs.CL

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM:细粒度自奖励用于统一多模态模型

Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) The University of Hong Kong(香港大学) Peking University(北京大学) Noah’s Ark Lab, Huawei(华为诺亚方舟实验室) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 SRUM通过内部评估模块对生成模块进行自奖励,提升统一多模态模型的视觉生成能力,实验证明在T2I-CompBench和T2I-ReasonBench上性能显著提升。

Comments Accepted to ECCV 2026. 20 pages, 8 figures, webpage can be seen in https://waynejin0918.github.io/srum_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-06-30 cs.AI

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02393 2026-06-30 cs.CV cs.GR

PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection

PLOT:通过物体跟踪进行伪标签的单目3D目标检测

Seokyeong Lee, Sithu Aung, Junyong Choi, Seungryong Kim, Ig-Jae Kim, Junghyun Cho

机构 * Korea Institute of Science and Technology (KIST)(韩国科学技术研究院) KAIST AI(韩国科学技术院人工智能系) VRG, FEE, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院视觉识别组) Samsung Research(三星研究院) AI-Robotics, KIST School, University of Science and Technology (UST)(科学技术联合大学院KIST学院人工智能机器人系) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学延世-KIST融合研究院)

AI总结 PLOT通过物体跟踪生成单目视频中的3D标注,无需辅助传感器或模型重训练,实现了在自动驾驶、机器人和监控等领域的可靠3D目标检测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04739 2026-06-30 cs.CV

SPARC: Scalable Path-Specific Counterfactual Fairness via Causal Conditional Independence

SPARC:通过因果条件独立实现可扩展的路径特定反事实公平性

Bowei Tian, Yexiao He, Ziyao Wang, Meng Liu, Yongkai Wu, Ang Li

机构 * University of Maryland(马里兰大学) Clemson University(克莱姆森大学)

AI总结 本文提出SPARC方法,通过因果条件独立约束实现路径特定反事实公平性,解决了高维数据中反事实估计不可行的问题。

Comments 26 pages, 6 figures. European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏