arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2607.19032 2026-07-22 cs.CV 新提交

IMMoE: Incomplete Multi-View Anomaly Detection via Mixture of View Experts Fusion

IMMoE:通过视图专家融合进行不完整多视图异常检测

Lei Hu

机构 * South China University of Technology(华南理工大学)

AI总结 研究不完整多视图异常检测问题,提出IMMoE方法,含多视图专家融合与局部异常增强编码器两个关键模块,通过自动生成数据集,在RIMAD和Real-IAD数据集上取得领先性能,提升了像素级和图像级指标。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19027 2026-07-22 cs.CV 新提交

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

缓解零样本视频时刻检索中的模态和语言风格差距

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。

Comments ECCV 2026 (* These authors contributed equally.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18863 2026-07-22 cs.CV 新提交

Reliability-Aware 3D Geometric Injection for Universal Person Re-identification

用于通用行人重识别的可靠性感知3D几何注入

Bohan Su, Jiashuo Wang, Fangyi Liu, Mang Ye

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(武汉大学计算机学院多媒体软件国家工程研究中心)

AI总结 针对通用行人重识别问题,提出UniGeo框架,通过一致性感知可靠性门和双流残差融合,将3D信息处理解耦,投影单目3D参数补偿结构,以残差形式引入3D先验并过滤噪声,提升了挑战性场景性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18801 2026-07-22 cs.CV 新提交

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

ZeroSplat:3D高斯点云渲染中的广义指代分割

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) China University of Geosciences(中国地质大学)

AI总结 针对现有指代3D高斯点云渲染方法局限,提出ZeroSplat框架,通过多视图几何约束将2D视觉语言模型先验提升至3D空间,无需额外特征存储,在广义和单目标场景中显著优于现有方法,且效率高。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18763 2026-07-22 cs.CV 新提交

Posterior Samplings are Missing Modalities Generators for Medical Image Translation

后验采样是医学图像翻译中缺失模态的生成器

Jonghun Kim

机构 * Sungkyunkwan University(成均馆大学)

AI总结 针对医学图像因时间和协议限制存在缺失模态的问题,提出统一框架,将缺失模态生成视为联合分布下的线性逆问题,通过后验采样及流匹配模型解决,在多数据集实验中性能优于基线,下游肿瘤分割表现更好。

Comments ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26615 2026-07-22 cs.CV eess.IV 版本更新

TaskTok: Delving into Task Tokens for Task-driven Image Restoration

TaskTok: 深入探究任务驱动图像恢复中的任务令牌

Hongjae Lee, Sojung Kang, Jaeseong Yu, Seung-Won Jung

机构 * Korea University(高丽大学)

AI总结 提出TaskTok框架,通过可学习的令牌开关和轻量级令牌细化模块选择性恢复任务相关令牌,在提升下游任务性能的同时保持高计算效率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11704 2026-07-22 cs.CV 版本更新

ScaleMoGen: Autoregressive Next-Scale Prediction for Human Motion Generation

ScaleMoGen:基于人类动作生成的自回归多尺度预测

Inwoo Hwang, Hojun Jang, Bing Zhou, Jian Wang, Young Min Kim, Chuan Guo

机构 * Seoul National University(首尔国立大学) Snap Inc.(Snap公司) Meta Reality Labs(Meta现实实验室)

AI总结 ScaleMoGen提出了一种多尺度自回归框架,通过自回归预测生成动作,实现了更精细的动作生成,同时在HumanML3D和SnapMoGen数据集上取得最佳性能。

Comments Accepted to ECCV 2026. Project page: https://inwoohwang.me/ScaleMoGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15280 2026-07-22 cs.CV cs.AI 版本更新

Why Do Vision Language Models Struggle To Recognize Human Emotions?

为什么视觉语言模型难以识别人类情绪?

Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara, Steven McDonagh

机构 * The University of Edinburgh, UK(爱丁堡大学)

AI总结 本文探讨视觉语言模型在识别人类情绪上的不足,指出面部表情识别任务的连续性和动态性导致模型存在连续性和时间信息处理的漏洞,提出改进采样策略和多阶段上下文增强方法以提升情绪识别能力。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18142 2026-07-21 cs.CV cs.AI cs.CL cs.MA 新提交

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测

Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Griffith University(格里菲斯大学)

AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17790 2026-07-21 cs.CV cs.AI 新提交

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

ReViV:从单目自我中心视频中重建4D中的观看者和视图

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学) Microsoft(微软)

AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。

Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17693 2026-07-21 cs.CV 新提交

Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation

用于无训练测试时医学图像分割的内存支持协同适应

Lingrui Li, Nan Pu, Dong Zhao, Wenjing Li, Andrew P French, Zhun Zhong, Xin Chen

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计支柱)

AI总结 研究针对医学图像分割中测试时适应的挑战,提出内存支持协同适应(MSSA)框架,不更新模型参数,通过构建在线内存、文本引导语义先验及跨图像结构对齐实现稳健适应,实验证明其优于现有方法。

Comments 18 pages, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17479 2026-07-21 cs.CV 新提交

TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning

TraversRL:基于强化学习的可通行行人路径生成

Bin Han, Robert Wolfe, Bill Howe

机构 * University of Washington(华盛顿大学) Rutgers University(罗格斯大学)

AI总结 研究旨在从航拍图像生成行人路径,核心方法是用TraversRL视觉条件模型,通过特定动作空间和奖励机制迭代生长路径网络,主要贡献是相比基线提升交并比与连通性指标,结合奖励生成更优网络,证明该建模方法的有效性。

Comments Accepted to ECCV 2026, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17467 2026-07-21 cs.CV cs.LG 新提交

DA-MergeLoRA: Hypernetwork-Based LoRA Merging for Few-Shot Test-Time Domain Adaptation

DA-MergeLoRA:基于超网络的LoRA合并用于少样本测试时的域适应

Siobhan Reid, Zhixiang Chi, Li Gu, Omid Reza Heidari, Ziqiang Wang, Yang Wang

机构 * Concordia University(康考迪亚大学) University of Toronto(多伦多大学) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所)

AI总结 研究少样本测试时的域适应问题,提出DA-MergeLoRA框架,将LoRA微调与模型合并相结合,通过元学习训练超网络生成合并因子,在多个域适应数据集上取得最优性能。

Comments ECCV 2026, Code: https://github.com/nahbois4321/DA-MergeLoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17340 2026-07-21 cs.CV 新提交

Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection

用于域增量目标检测的正交知识刷新

Aoting Zhang, Dongbao Yang, Chang Liu, Xiaopeng Hong, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Nankai University(南开大学) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 研究域增量目标检测问题,提出正交知识刷新(OKR)框架,通过构建特定域子空间、采用正交刷新策略和拓扑感知一致性,减少知识干扰和语义碎片化,实验表明该方法在mAP上比最佳无范例方法有显著提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16838 2026-07-21 cs.CV cs.GR 新提交

TopoGS: Planar Reconstruction via Topology-aware 3D Gaussian Splatting

TopoGS:通过拓扑感知3D高斯点云进行平面重建

Shanshan Pan, Jiale Chen, Yilin Liu, Hui Huang

机构 * Shenzhen University(深圳大学) Autodesk Research(欧特克研究院)

AI总结 研究旨在从原始图像提取结构化3D表示,提出TopoGS框架,通过提取多视图图像的2D拓扑关系,将高斯基元锚定到结构元素,联合优化平面参数等,在ScanNet++数据集上达最优性能,生成高质量3D模型。

Comments European Conference on Computer Vision (Proceedings of ECCV 2026); Project page: https://vcc.tech/research/2026/TopoGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16321 2026-07-21 cs.CV cs.IR 新提交

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

超越语义的艺术:用于多关系表示的层状信息对比学习

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

机构 * University of Zurich(苏黎世大学) Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) Sapienza University of Rome(罗马第一大学) Amazon(亚马逊) University of Amsterdam(阿姆斯特丹大学) The University of Osaka(大阪大学)

AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16280 2026-07-21 cs.CV 新提交

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

3D FaceShell:作为视觉语言模型防御机制的3D人脸头像属性转移

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对VLM可从3D人脸渲染图像提取敏感属性的隐私挑战,提出3D FaceShell框架,通过可学习高斯壳产生扰动,在保持面部外观的同时引导VLM语义解释,实验证明其能有效提高属性注入和不匹配率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25578 2026-07-21 cs.CV 版本更新

H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks

H-Adapter: 通过注意力导出的源对齐头发掩码实现姿态鲁棒的发型迁移

Seulgi Jeong, Yunseong Cho, Sanghun Park

机构 * SNOW Corp.(SNOW公司)

AI总结 提出H-Adapter,利用区域特定损失解耦头发与非头发目标,导出源对齐头发编辑掩码引导扩散修复,实现大姿态差异下的鲁棒发型迁移,在FID、FID_CLIP和CLIP-I指标上取得最优。

Comments Accepted at ECCV 2026. Project page: https://sanghunpark.github.io/hadapter_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22394 2026-07-21 cs.CV 版本更新

Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning

曲率自适应一致性流匹配:基于强化学习的自主轨迹优化

Songtao Tian, Guhan Chen, Bohan Li, Jingyi Ma, Zixiong Yu

机构 * Tsinghua University(清华大学)

AI总结 提出曲率自适应一致性流匹配(CACFM),利用强化学习代理动态构建效率导向课程,优先处理关键区域,在FLUX和SDXL等大规模模型上实现最先进结果,极少数步下保持高视觉保真度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20209 2026-07-21 cs.GR cs.LG cs.RO 版本更新

NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control

NaP-Control: 为多功能和快速字符控制导航扩散先验

Chia-Wen Chen, Yan Wu, Korrawe Karunratanakul, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出NaP-Control方法,通过强化学习操控任务无关的扩散策略先验的潜在噪声,实现快速、鲁棒且高保真的字符控制,同时通过环境交互优化任务奖励,提升成功率并适应挑战性场景。

Comments ECCV 2026. Project page: https://chiawenchen.github.io/nap-control-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03043 2026-07-21 cs.LG cs.AI cs.CR cs.CV 版本更新

IoUCert: Robustness Verification for Anchor-based Object Detectors

IoUCert: 基于锚点的目标检测器鲁棒性验证

Benedikt Brückner, Alejandro J. Mercado, Yanghao Zhang, Panagiotis Kouvaros, Alessio Lomuscio

AI总结 IoUCert通过改进的坐标变换和区间边界传播方法,首次实现了对基于锚点的目标检测模型在多种输入扰动下的鲁棒性验证。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18528 2026-07-21 cs.LG cs.SD 版本更新

Audio-Visual Continual Test-Time Adaptation without Forgetting

音频视觉持续测试时间适应无需遗忘

Sarthak Kumar Maharana, Akshay Mehra, Bhavya Ramakrishna, Yunhui Guo, Guan-Ming Su

AI总结 本文提出AVReCAP方法,在测试时无需源数据即可提升模型性能,通过动态检索最佳融合层参数减少灾难性遗忘。

Comments ECCV 2026 & ICML 2026 Workshop Continual Adaptation at Scale: Towards Sustainable AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16636 2026-07-21 cs.CV 版本更新

REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion

利用全局和局部语义重新绑定潜在信息以进行纠缠扩散

Giorgos Petsangourakis, Christos Sgouropoulos, Bill Psomas, Theodoros Giannakopoulos, Giorgos Sfikas, Ioannis Kakogeorgiou

机构 * University of West Attica(西阿提卡大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学)

AI总结 研究针对潜在扩散模型语义监督不足问题,提出REGLUE框架,联合建模VAE图像潜在信息、局部VFM语义和全局[CLS]令牌,用轻量级卷积语义压缩器聚合特征,经实验验证该框架能提升FID并加速收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26800 2026-07-21 cs.CV cs.GR cs.LG 版本更新

OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes

OmniX:从统一全景生成与感知到适用于图形的3D场景

Yukun Huang, Jiwen Yu, Yanning Zhou, Jianan Wang, Xintao Wang, Pengfei Wan, Xihui Liu

机构 * University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Tencent(腾讯)

AI总结 研究基于全景的2D提升技术,提出OmniX框架,利用跨模态适配器结构和循环空间算子,将预训练2D流匹配先验用于多模态联合建模,构建数据集,实现适用于图形的3D场景生成,为虚拟世界创建开辟新可能。

Comments ECCV 2026; Project page: https://yukun-huang.github.io/OmniX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12562 2026-07-21 cs.CV 版本更新

History-Aware Transformation of ReID Features for Multiple Object Tracking

用于多目标跟踪的重识别特征的历史感知变换

Ruopeng Gao, Yuyao Wang, Chunxu Liu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 该研究针对多目标跟踪中ReID特征应用问题,提出历史感知特征变换方法,将轨迹历史特征作上下文,用定制FLD投影特征到特定空间,免训练提升特征判别力,证明特定上下文表示对MOT更优,推动ReID特征定制探索。

Comments Accepted by ECCV 2026. Without bells and whistles, achieving 80.8 HOTA on SportsMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15868 2026-07-20 cs.CV cs.AI cs.GR cs.HC cs.RO 新提交

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

EgoExoMoCap:分布式自我-外部人体运动捕捉

Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo

机构 * Meta Reality Labs(元现实实验室) ETH Zürich(苏黎世联邦理工学院)

AI总结 针对头戴式设备人体运动捕捉,提出EgoExoMoCap分布式框架,联合自我与外部中心多模态信号,利用头部等跟踪信号及DINOv3特征,能在复杂场景中稳健重建运动,突破了两种范式孤立的局限。

Comments Accepted by ECCV 2026, Project page and code: https://siplab.org/projects/EgoExoMoCap

详情

展开后加载摘要…

URL PDF HTML 收藏