arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 555
2606.25347 2026-06-26 cs.LG cs.CV 新提交

Geometry-Anchored Transport Framework for Exemplar-Free Class-Incremental Learning

几何锚定传输框架用于无样本类增量学习

Hongye Xu, Bartosz Krawczyk

机构 * Chester F. Carlson Center for Imaging Science, Rochester Institute of Technology(罗切斯特理工学院切斯特·F·卡尔森成像科学中心)

AI总结 提出几何锚定传输框架,通过分析几何锚定和拓扑感知演化约束,在训练阶段内嵌特征传输,解决无样本类增量学习中的各向异性漂移问题。

Comments Accepted to ECCV 2026. 17 pages, 4 figures, 3 tables. Code: https://github.com/HXuSz11/GATF_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25065 2026-06-26 cs.GR 新提交

Self-supervised Garment Dynamics with Persistent Wrinkles

具有持久褶皱的自监督服装动力学

Xiaoyuan Yang, Deshan Gong, Taku Komura, He Wang

AI总结 提出首个显式建模持久褶皱的自监督神经服装模拟器,通过物理启发的损失函数和课程学习实现弹塑性材料模拟,生成自然褶皱。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24649 2026-06-26 cs.CV 新提交

Agentic Collaborative Cognition for Zero-Shot 3D Understanding

零样本3D理解的智能体协作认知

Wenxin Wang, Bo Zhang, Feng Chen, Zixuan Wang, Wen Li, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出协作多智能体框架,通过规划智能体补充视角和感知智能体构建结构化认知地图,实现零样本3D理解,在6个基准上达到最优性能。

Comments Accepted by ECCV 2026. Project page: https://zhangbo135.github.io/agentic-collaborative-cognition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22540 2026-06-26 cs.CV 新提交

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

PolicyTrim: 提升视觉-语言-动作模型的内在策略效率

Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出PolicyTrim框架,通过强化学习后训练扩展动作块可靠长度并减少冗余物理步骤,实现高达5.83倍的端到端部署加速且不降低任务成功率。

Comments Accepted by ECCV 2026. Project page: https://inceptionwang.github.io/PolicyTrim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22537 2026-06-26 cs.CV 新提交

NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models

NegAS: 基于负标签引导的注意力与评分用于视觉语言模型的分布外目标检测

Yingjie Zhang, Shuai Li, Peng Wang

机构 * Northwestern Polytechnical University(西北工业大学)

AI总结 提出NegAS框架,利用负标签引导注意力(NegA)和基于sigmoid的OOD评分函数(NegS),解决VLM检测器中OOD区域利用不足和评分不兼容问题,显著提升OOD检测性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25907 2026-06-25 cs.CV 新提交

In-context Region-based Drag: Drag Any Region to Any Shape

基于上下文区域的拖拽:将任意区域拖拽至任意形状

Jiacheng Sui, Tianyu Hao, Bingjie Gao, Li Niu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ICRDrag方法,通过上下文学习框架和两种注意力正则化,实现区域级拖拽编辑,在精度和视觉保真度上显著优于现有方法。

Comments Accepted by ECCV 2026. Dataset, code, and model are available at https://github.com/bcmi/ICRDrag-Region-Drag-Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25784 2026-06-25 cs.CV 新提交

$S^{2}$-FracMix: Label-Preserving Self-Saliency Mixup Augmentation

$S^{2}$-FracMix: 保持标签的自显著性混合增强

Khawar Islam, Arif Mahmood, Xin Jin, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Information Technology University(信息技术大学) Westlake University(西湖大学)

AI总结 提出$S^{2}$-FracMix框架,通过自显著性混合和分形模式注入,在单图像内生成标签一致的增强样本,提升视觉模型的泛化性和鲁棒性,在多个任务上达到最优。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25736 2026-06-25 cs.CV 新提交

UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving

UniTeD: 面向自动驾驶联合感知与规划的时域统一扩散模型

Bo Zhao, Xinting Zhao, Naifan Li, Erkang Cheng, Haibin Ling

机构 * Nullmax Westlake University(西湖大学)

AI总结 提出UniTeD框架,通过共享生成空间的迭代去噪统一建模感知与规划,引入时域过渡模块和锚点刷新策略,在多个基准上达到最先进性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25634 2026-06-25 cs.CV 新提交

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of Technology Sydney(悉尼科技大学) Follow Me AI Pty LTD(Follow Me AI有限公司)

AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。

Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25585 2026-06-25 cs.CV 新提交

FeVOS: Foresight Expression Video Object Segmentation

FeVOS:前瞻性表达视频目标分割

Kehan Lan, Kaining Ying, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所)

AI总结 提出前瞻性表达视频目标分割任务,通过推理时空线索预测未来目标,并构建FeVOS数据集和FeVOS-R1模型,实现最先进性能。

Comments Accepted by ECCV 2026. Homepage: https://henghuiding.com/FeVOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25488 2026-06-25 cs.LG 新提交

Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning

精简蒸馏:通过可学习数据剪枝实现高效知识蒸馏

Yifan Wu, Yiqi Wang, Xichen Ye, Wenjing Yan, Xiaoqiang Li, Cheng Jin, Xiangyu Yue, Weizhong Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院)

AI总结 提出IF-Beta框架,结合影响函数与可学习Beta分布采样策略,通过双层优化实现高效数据剪枝,在减少数据和计算量的同时提升蒸馏性能。

Comments Acceepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25317 2026-06-25 cs.CV cs.AI 新提交

ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency

ESTANet: 通过预测不一致性实现程序性视频中的高效在线错误检测

Shih-Po Lee, Reza Ghoddoosian, Faizan Siddiqui, Enna Sachdeva, Behzad Dariush

机构 * Honda Research Institute, USA(本田研究所(美国)) Northeastern University(东北大学)

AI总结 提出ESTANet轻量框架,利用多个动作检测器在正确与错误执行时的预测不一致性,通过多数投票实现实时在线错误检测,在三个数据集上达到最优性能。

Comments 18 pages, 8 figures, uses eccv.sty

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25306 2026-06-25 cs.CV cs.AI 新提交

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) AI2(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。

Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25245 2026-06-25 cs.CV 新提交

OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos

OrthoTrack:基于公开正射影像的连续六自由度无人机轨迹估计

Oussema Dhaouadi, Zuria Bauer, Johannes Michael Meier, Olaf Wysocki, Marc Pollefeys, Daniel Cremers

机构 * ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Microsoft(微软公司)

AI总结 提出OrthoTrack,利用公开正射影像和表面模型实现无训练、实时、无漂移的连续六自由度无人机轨迹估计,无需GPS或后处理对齐。

Comments ECCV 2026 - Project page: http://orthotrack.ethz.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24963 2026-06-25 cs.CV cs.LG 新提交

Curvature-Guided Mixing for MLLM Adaptation

曲率引导混合用于MLLM适配

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

AI总结 提出曲率引导混合(CGM)框架,通过二阶Hessian近似推导最优软混合比,以及硬混合变体CGM†,在LLaVA-1.5和Qwen2.5VL上改善任务专化与通用知识保持的权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24935 2026-06-25 cs.CV 新提交

SEMIR: Topology-Preserving Graph Minors for Thin-Structure Segmentation

SEMIR:保持拓扑结构的图子式用于薄结构分割

Luke James Miller, Yugyung Lee

机构 * University of Missouri-Kansas City(密苏里大学堪萨斯城分校)

AI总结 提出SEMIR框架,用参数化图子式替代像素网格,在收缩准则下保持薄结构连通性,通过轻量GNN分类并精确映射回像素,在多个数据集上匹配或超越基线并减少碎片化。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24449 2026-06-25 cs.CV 新提交

SENTRY: SAM2-Enhanced Neighbor-Aware and Temporally Reasoned Memory for Visual Tracking

SENTRY: 基于SAM2增强的邻域感知与时序推理记忆用于视觉跟踪

Mohamad Alansari, Yonathan Michael, Hasan AlMarzouqi, Muzammal Naseer, Naoufel Werghi, Sajid Javed

机构 * Khalifa University(哈利法大学) University of Western Australia(西澳大利亚大学)

AI总结 针对SAM2跟踪器在遮挡、快速运动和干扰下因置信度掩码选择导致的漂移问题,提出无需训练、即插即用的SENTRY模块,通过短时一致性验证、多假设聚合和循环匹配来优化记忆更新,在9个基准上实现零样本SOTA。

Comments Accepted for publication at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20300 2026-06-25 cs.CV 新提交

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection

CMDS-AD: 跨模态双流解耦用于少样本异常检测

Junhao Cai, Junyu Chen, Deyu Zeng, Junhao Pang, Qiwei Liang, Xiaopin Zhong, Zongze Wu

机构 * Shenzhen University(深圳大学) Guangzhou Maritime University(广州航海学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出跨模态双流异常检测框架CMDS-AD,通过扩散模型生成多样本并利用低频正常估计辅助解耦高频缺陷,在1-shot设置下MVTec 3D-AD上I-AUROC提升5.7%。

Comments Accepted to ECCV 2026! Project page: https://cmds-ad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24740 2026-06-24 cs.CV 新提交

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

BioMedVR: 面向生物医学视觉重编程的混淆感知提示专家混合模型

Jiaxiang Liu, Tianxiang Hu, Juwei Guan, Yujie Wu, Yusong Wang, Yao Mu, Zuozhu Liu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科技研究院) Zhejiang University(浙江大学) Southeast University(东南大学) The Hong Kong Polytechnic University(香港理工大学) Institute of Science Tokyo(东京科学大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出BioMedVR框架,通过可学习的VR模块实现预训练VLM在生物医学图像上的少样本适应,利用混淆最小化机制和提示专家混合模型解决细粒度分类中的类间混淆问题,在18个数据集上验证了优越性能。

Comments Accepted at ECCV 2026. 19 pages, 6 figures. Project page: https://jxliu-ai.github.io/biomedvr-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24716 2026-06-24 cs.CV cs.AI 新提交

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

评估稀疏自编码器与概念标注的可解释性

Jonas Klotz, Cassio F. Dantas, Pallavi Jain, Diego Marcos, Begüm Demir

机构 * The Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所) Technische Universität Berlin(柏林工业大学) INRAE(法国国家农业、食品与环境研究院) Inria, EVERGREEN(法国国家信息与自动化研究所,EVERGREEN) UMR TETIS, Univ Montpellier(UMR TETIS,蒙彼利埃大学)

AI总结 提出一种基于人类标注的评估框架,通过合成基准和二分匹配方法量化稀疏自编码器潜在变量与概念的对齐,并验证可解释性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24525 2026-06-24 cs.CV 新提交

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24484 2026-06-24 cs.CV 新提交

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

推进面向艺术字的场景文本识别:数据集与方法

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) South China University of Technology(华南理工大学)

AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24479 2026-06-24 cs.CV 新提交

MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction

MambaRaw: 基于选择性状态空间建模的高效4K原始图像重建

Peize Li, Fanhu Zeng, Tongda Xu, Xingguo Xu, Xinjie Zhang, Xingtong Ge, Haotian Zhang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Dalian University of Technology(大连理工大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 提出MambaRaw框架,利用状态空间模型高效估计熵参数,通过TileMambaBlock和能量感知精化模块实现4K原始图像的高效重建,在三个相机数据集上达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24422 2026-06-24 cs.CV 新提交

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24404 2026-06-24 cs.CV 新提交

Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition

面向多模态动作识别的模态感知分布外检测

Lars Doorenbos, Duc Manh Vu, Serdar Ozsoy, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

AI总结 提出一种后处理混合检测器,利用多模态与单模态预测关系及特征空间得分,在推理时显式考虑模态信息,提升多模态分布外检测性能。

Comments Accepted at ECCV '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24375 2026-06-24 cs.CV 新提交

MATCH: Flow Matching for Multi-View Anomaly Detection

MATCH: 基于流匹配的多视角异常检测

Mathis Kruse, Melissa Schween, Bodo Rosenhahn

机构 * Institute for Information Processing, L3S, Leibniz University Hannover(汉诺威莱布尼茨大学L3S信息处理研究所)

AI总结 提出首个基于流匹配的多视角异常检测方法MATCH,通过ODE公式估计似然并计算异常分数,在Real-IAD和MANTA-Tiny数据集上达到SOTA性能,且可在消费级硬件上实时运行。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24361 2026-06-24 cs.CV 新提交

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

SignNet-1M:大规模多语言手语视频数据集及下游基准

Zhewen He, Junyi Hu, Haomian Huang, Zhenhua Li, Yu-Shen Liu, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign 技术公司) Tsinghua University(清华大学)

AI总结 提出SignNet-1M,通过3D高斯泼溅、扩散模型和后期渲染增强合成多样化手语视频,提升模型在跨视角、背景和身份等分布偏移下的泛化能力。

Comments 25 pages. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24333 2026-06-24 cs.CV 新提交

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学)

AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24297 2026-06-24 cs.CV 新提交

Training-free Cross-domain Few-shot Segmentation via Robust Semantic Representation and Matching

基于鲁棒语义表示与匹配的无训练跨域小样本分割

Sujun Sun, Mingwu Ren, Haofeng Zhang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进工程机械智能制造国家重点实验室)

AI总结 提出无训练框架,利用DINOv3编码器和三个核心模块(语义感知特征融合、自适应支持增强、混合原型匹配)实现跨域小样本分割,无需训练或微调,在四个目标域数据集上达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏