arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 333
2603.17920 2026-07-02 cs.CV 版本更新

SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式

Markus Gross, Sai Bharadhwaj Matha, Rui Song, Viswanathan Muthuveerappan, Conrad Christoph, Julius Huber, Daniel Cremers

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校) Uni Cambridge(剑桥大学)

AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15129 2026-07-02 cs.CV 版本更新

Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors

利用视频扩散先验的超低比特率图像压缩的下一帧解码

Yunuo Chen, Chuqin Zhou, Jiangchuan Li, Xiaoyue Ling, Bing He, Jincheng Dai, Li Song, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 提出一种超低比特率图像压缩新范式,通过定义紧凑锚帧作为中间状态,利用预训练视频扩散模型将解码转化为下一帧预测,在保持语义的同时丢弃高频细节,相比DiffC在CLIC2020上节省超50%比特率并实现5倍解码加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13859 2026-07-02 cs.CV 版本更新

Geo-ID: Test-Time Geometric Consensus for Cross-View Consistent Intrinsics

Geo-ID: 测试时几何一致性用于跨视角一致本征分解

Alara Dirik, Stefanos Zafeiriou

AI总结 提出Geo-ID框架,利用稀疏几何对应关系在测试时耦合单视角本征预测,实现跨视角一致分解,无需重训练或逆渲染。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08316 2026-07-02 cs.CR cs.CL cs.CV 版本更新

SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

SlowBA:针对基于VLM的GUI代理的高效后门攻击

Junxian Li, Tu Lan, Haozhen Tan, Yan Meng, Haojin Zhu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

AI总结 提出SlowBA后门攻击,通过强化学习注入触发模式,诱导VLM-based GUI代理产生冗长推理链,显著增加响应延迟,同时保持任务准确性。

Comments Accepted by ECCV 2026. Codes and supplementary materials are in https://github.com/tu-tuing/SlowBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06852 2026-07-02 cs.CV 版本更新

Active View Selection with Perturbed Gaussian Ensemble for Tomographic Reconstruction

基于扰动高斯集成的主动视角选择用于层析重建

Yulun Wu, Ruyi Zha, Wei Cao, Yingying Li, Yuanhao Cai, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Australian National University(澳大利亚国立大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对稀疏视角CT重建中视角选择问题,提出扰动高斯集成框架,通过不确定性建模和密度引导扰动选择最优视角,有效消除几何伪影。

Comments Accepted to ECCV 2026. Project page: https://perturbed-gaussian-ensemble.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06275 2026-07-02 cs.CV 版本更新

Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution

扩散变换器超分辨率的频谱与轨迹正则化

Jingkai Wang, Yixin Tang, Jue Gong, Jiatong Li, Shu Li, Libo Liu, Jianliang Lan, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shenzhen Transsion Holdings Co., Ltd.(深圳传音控股股份有限公司)

AI总结 提出StrSR框架,通过非对称判别蒸馏和频率分布匹配策略,解决扩散变换器在真实图像超分辨率中的轨迹失配和周期性伪影问题,实现最先进性能。

Comments 15 pages, appears at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16249 2026-07-02 cs.CV 版本更新

AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware

AFFMAE: 在桌面硬件上实现高分辨率显微图像分割的可扩展视觉预训练

David Smerkous, Zian Wang, Behzad Najafian

机构 * Department of Laboratory Medicine & Pathology, University of Washington(华盛顿大学检验医学与病理学系) Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) Electrical Engineering & Computer Science, Oregon State University(俄勒冈州立大学电气工程与计算机科学系)

AI总结 提出AFFMAE框架,通过自适应离网格令牌合并实现分层预训练,在桌面硬件上以2倍预训练速度和减半内存达到与MAE相当的显微分割性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14679 2026-07-02 cs.CV 版本更新

Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection

基于语义注入的通用图像免疫方法抵御基于扩散模型的图像编辑

Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) Yonsei University(延世大学)

AI总结 提出首个通用对抗扰动框架,通过语义注入使扩散模型误解输入图像,抑制原始内容,从而有效阻断未经授权的编辑,在通用扰动设置下优于基线,并具备黑盒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05275 2026-07-02 cs.CV 版本更新

Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs

Magic-MM-Embedding: 面向视觉令牌高效的多模态大语言模型通用嵌入

Qi Li, Yanzhe Zhao, Yongxin Zhou, Yameng Wang, Yandong Yang, Yuanjia Zhou, Jinxiang Liu

机构 * Honor Device Co., Ltd., China(荣耀终端有限公司,中国)

AI总结 提出Magic-MM-Embedding,通过视觉令牌压缩架构和多阶段渐进训练策略,在通用多模态嵌入中实现高效率和最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03370 2026-07-02 cs.CV cs.LG 版本更新

GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition

GryphOne: 面向离线手写数学表达式识别中结构细化的符号感知掩码扩散

Takaya Kawakatsu, Ryo Ishiyama

机构 * Preferred Networks, Inc.(Preferred Networks公司) Kyushu University(九州大学)

AI总结 提出离散扩散框架GryphOne,将HMER重构为迭代符号细化而非序列生成,通过符号感知分词和随机掩码互学习提升鲁棒性,在MathWriting上达到5.51% CER和59.9% EM,超越所有重实现模型和商业系统。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07221 2026-07-02 cs.CV 版本更新

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

病理学组合检索的组织病理学多模态嵌入

Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

AI总结 提出HOMIE框架,将生成式多模态大语言模型适配为病理检索专家,解决组合查询中的架构、任务和领域不匹配问题,在病理组合检索基准上显著优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20907 2026-07-02 cs.CV 版本更新

PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding

PanoGrounder: 利用全景场景表示桥接2D和3D,实现基于VLM的3D视觉定位

Seongmin Jung, Seongho Choi, Gunwoo Jeon, Minsu Cho, Jongwoo Lim

机构 * Seoul National University(首尔大学) Robotics Lab, Hyundai Motor Company(现代汽车公司机器人实验室) Pohang University of Science and Technology (POSTECH)(浦项科技大学)

AI总结 提出PanoGrounder框架,通过多模态全景表示与预训练2D VLM结合,实现强泛化能力的3D视觉定位,在ScanRefer和Nr3D上取得最优结果。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19985 2026-07-02 cs.CV 版本更新

SONIC: Spectral Optimization of Noise for Inpainting with Consistency

SONIC: 用于一致性修复的噪声谱优化

Seungyeon Baek, Erqun Dong, Shadan Namazifard, Mark J. Matthews, Kwang Moo Yi

机构 * University of British Columbia(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

AI总结 提出一种无需训练的修复方法,通过谱域优化初始噪声样本,使通用文本到图像模型适用于修复任务,在少量优化步骤后超越现有技术。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17731 2026-07-02 cs.CV cs.LG 版本更新

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11925 2026-07-02 cs.CV 版本更新

Continuous Speculative Decoding for Autoregressive Image Generation

连续推测解码用于自回归图像生成

Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) JD.COM Inc(京东集团股份有限公司) China Tower Corporation Limited(中国铁塔股份有限公司)

AI总结 提出连续推测解码方法,通过近似准则、去噪轨迹对齐和接受-拒绝采样,加速连续视觉自回归模型,实现2倍以上加速且保持生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12009 2026-07-02 cs.CV 版本更新

Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale

Affogato: 基于大规模自动数据生成的开词汇可操作区域定位

Junha Lee, Eunha Park, Chunghyun Park, Dahyun Kang, Minsu Cho

机构 * Pohang University of Science and Engineering (POSTECH)(浦项科技大学) SqueezeBits RLWLRD

AI总结 提出Affogato框架,通过自动化流程生成750K 3D可操作区域热力图与自然语言查询对,解决数据瓶颈,实现开词汇可操作区域定位,并验证其跨架构迁移能力。

Comments ECCV 2026, Project page: https://junha-l.github.io/affogato/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19645 2026-07-02 cs.CV 版本更新

Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models

一次学习,随处编辑:扩散模型的视觉方向迁移

Yusuf Dalva, Hidir Yesiltepe, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

AI总结 提出ViDiT框架,通过从图像编辑对中学习连续编辑方向,实现无需微调的零样本图像属性编辑,在保持输入保真度的同时实现精确、可扩展的属性控制。

Comments ECCV 2026, Project page: http://vidit-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30342 2026-07-01 cs.CV 版本更新

A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP

通过CLIP实现分类器无关的零样本对抗攻击检测

Hodaya Krakover, Meir Yossef Levi, Eyal Gofer, Guy Gilboa

机构 * Technion - Israel Institute of Technology(以色列理工学院)

AI总结 提出A4D框架,利用CLIP的提示相似度分数,在完全黑盒零样本设置下检测对抗攻击,无需攻击或分类器先验知识。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24251 2026-07-01 cs.LG cs.CV 版本更新

Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions

重新思考边缘上的持续异常检测:在现实工业条件下进行基准测试

Chad Weatherly, Sen Lin

机构 * University of Houston(休斯敦大学)

AI总结 针对现有持续异常检测方法在评估、比较和边缘部署约束上的不足,提出统一基准和训练无关方法DINOSaur,在多种协议下超越所有现有方法,并在边缘设备上实现快速推理和适应。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21466 2026-07-01 cs.CV 版本更新

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26567 2026-07-01 cs.CV 版本更新

AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision

AirZoo: 一种用于地面几何3D视觉的统一大规模数据集

Xiaoya Cheng, Rouwan Wu, Xinyi Liu, Zeyu Cui, Yan Liu, Na Zhao, Yu Liu, Maojun Zhang, Shen Yan

机构 * National University of Defense Technology(国防科技大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出AirZoo数据集,通过可扩展生成流程、全面场景多样性和丰富的几何标注,解决无人机感知中复杂视角变换和环境条件的挑战,验证其在三维重建和图像检索中的有效性。

Comments ECCV 2026. Project page: https://nudt-sawlab.github.io/AirZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18747 2026-07-01 cs.CV 版本更新

URoPE: Universal Relative Position Embedding across Geometric Spaces

URoPE: 在几何空间中实现通用的相对位置嵌入

Yichen Xie, Depu Meng, Chensheng Peng, Yihan Hu, Quentin Herau, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

AI总结 URoPE扩展了RoPE,使模型能在不同视角或维度的几何空间中处理位置信息,适用于多任务如视图合成、3D检测等,提升模型在几何推理中的表现。

Comments Accepted by ECCV 2026. Code is available: https://urope-pe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18744 2026-07-01 cs.CV 版本更新

Match-Any-Events: Zero-Shot Motion-Robust Feature Matching Across Wide Baselines for Event Cameras

Match-Any-Events: 零样本跨大基线事件相机运动鲁棒特征匹配

Ruijun Zhang, Hang Su, Kostas Daniilidis, Ziyun Wang

机构 * Johns Hopkins University(约翰霍普金斯大学) ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Archimedes, Athena RC(Archimedes,Athena RC)

AI总结 本文提出首个零样本事件匹配模型,通过运动鲁棒且高效的注意力骨干网络和稀疏感知事件token选择,实现跨数据集大基线对应。实验显示比现有方法提升37.7%。

Comments Accepted to ECCV 2026

Journal ref Proceedings of the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15620 2026-07-01 cs.CV cs.RO 版本更新

Towards Generalizable Robotic Manipulation in Dynamic Environments

面向动态环境的通用机器人操作

Heng Fang, Shangru Li, Shuhan Wang, Xuanyang Xi, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

AI总结 本文提出DOMINO数据集与基准,通过实验评估现有VLA模型,提出PUMA架构提升动态感知能力,实现动态任务中的高成功率。

Comments Accepted to ECCV 2026. Project Page: https://h-embodvis.github.io/DOMINO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10652 2026-07-01 cs.CV cs.AI 版本更新

Are Video Reasoning Models Ready to Go Outside?

视频推理模型是否已准备好走向户外?

Yangfan He, Changgyu Boo, Jaehong Yoon

机构 * NTU Singapore(新加坡国立大学) Korea University(韩国大学)

AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。

Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09731 2026-07-01 cs.DC cs.AI 版本更新

SMART: When is it Actually Worth Expanding a Speculative Tree?

SMART: 在什么情况下扩展推测树实际上是有价值的?

Lifu Wang, Pan Zhou

机构 * Singapore Management University(新加坡管理大学)

AI总结 SMART系统通过运行时树构建优化,提升生成速度,通过边际效益-成本分析,在不同硬件和批量规模下实现平均20%的额外加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09100 2026-07-01 cs.CV cs.RO 版本更新

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。

Comments 29 pages, 10 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04834 2026-07-01 cs.CV cs.MM cs.RO eess.IV 版本更新

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景

Jiajun Zhai, Hao Shi, Shangwei Guo, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hunan University(湖南大学)

AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。

Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏