arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 552
2608.06613 2026-08-10 cs.CV cs.AI 新提交

Do 3D Medical Foundation Models See Through MRI Artifacts? A Controlled Study of Representation Robustness

三维医学基础模型能看穿MRI伪影吗?一项关于表示鲁棒性的对照研究

Julia Anna Mielcarz, Daniel Klaaby, Mostafa Mehdipour Ghazi

机构 * Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心)

AI总结 本文对照评估五种三维医学基础模型的表示鲁棒性,发现其鲁棒性与模型及伪影类型相关,部分模型对伪影更敏感,仅靠大规模预训练无法保证伪影不变性,需部署前评估鲁棒性。

Comments Accepted at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06142 2026-08-07 cs.CV 新提交

Learning visual representations for compositional analysis of artworks and photographs

面向艺术品与照片的组合分析学习视觉表征

Fatemeh Behrad, Tinne Tuytelaars, Johan Wagemans

机构 * KU Leuven University(KU Leuven大学(荷语鲁汶大学))

AI总结 该研究对比了受人类启发的构图分析方法与微调基础模型两种范式,在三类任务上评估性能,发现前者冻结编码器时具竞争力且可解释,后者微调后性能更优但可解释性与泛化性下降。

Comments ECCV workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05626 2026-08-07 cs.CV 新提交

Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping

通过SDR融合与增益图逆色调映射实现双输出多曝光HDR重建

Jinho Kim, Jinwoo Kim, Seon Joo Kim

机构 * Yonsei University(延世大学)

AI总结 该研究提出DOME-HDR框架,通过LoRA适配的潜在扩散模型与双交叉注意力融合模块生成SDR,结合HPGM网络预测增益图实现多曝光HDR重建,在多个数据集上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05616 2026-08-07 cs.CV 新提交

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

TruthLens:通过大型视觉语言模型(LVLM)中的自评估真实性分数检测对象幻觉

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(马来西亚诺丁汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 TruthLens 是一种无需额外成本的 LVLM 对象幻觉检测框架,通过微调 LM 头部输出真实性分数,在 MS-COCO 数据集上的 Qwen2.5-VL-7B 上实现了超 17% 的 AUROC 提升,性能达当前最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05424 2026-08-07 cs.CV cs.LG 新提交

Invisible Shortcuts: Why Vision Encoders Know Your Camera

隐形捷径:视觉编码器为何了解你的相机

Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos, Noa Garcia, Giorgos Tolias

AI总结 该研究发现视觉编码器会利用像素级隐形元数据痕迹形成捷径,元数据-语义关联越强模型敏感性越高,提出的缓解策略可降低敏感性并提升分布外泛化能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05260 2026-08-07 cs.CV 新提交

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

一段文本胜过千条标题:重新思考视觉-语言检索的文本监督

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。

Comments Accepted at the MUCG workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05149 2026-08-06 cs.CV 新提交

CoCo-IR: Contextual Composed Image Retrieval

CoCo-IR:上下文组合图像检索

Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) OpenAI

AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04995 2026-08-06 cs.CV 新提交

Promptable Animal Pose Tracking Across Species

可跨物种提示式动物姿态跟踪

Le Li, Daniela Ivanova, Nicolas Pugeault

AI总结 针对动物姿态跟踪的跨物种泛化与精度问题,提出有监督、无监督两种基于视觉基础模型的方法,在APTv2和TigDog数据集上实现了精度与泛化性的平衡,为动物保护应用提供实用方案。

Comments Accepted for presentation at the ECCV 2026 Workshop on CV4Ecology

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04865 2026-08-06 cs.CV 新提交

Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen

超越帧的烹饪:厨房中的立体事件相机数据集

Chengming Feng, Hesam Araghi, Liming Zheng, Julien Dupeyroux, Xucong Zhang, Jan van Gemert, Nergis Tömen

机构 * Delft University of Technology(代尔夫特理工大学) STMicroelectronics(意法半导体)

AI总结 本文推出EventKitchen数据集,以第一人称视角从10名参与者在13个厨房中收集5.5小时的烹饪相关多传感器数据,训练基线模型完成动作识别等任务,为神经形态视觉提供新基准。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04642 2026-08-06 cs.CV 新提交

YOLO-PVC: 2D-to-3D Consolidation of Slice-wise Detections for Volumetric Liver Tumor Localization in MRI

YOLO-PVC:用于MRI中体积肝肿瘤定位的切片式检测的2D到3D整合方法

Talha Waqas, Mounir Lahlouh, Kawther Taibouni, Mahnoor Waqas, Salar Ahmed, Sébastien Mulé, Yasmina Leroul-Chenoune

机构 * ESME Research Lab(ESME研究实验室) Université Paris-Est Créteil(巴黎东部克雷泰伊大学) LRE EPITA(EPITA LRE实验室) Institute of Space Technology(空间技术研究所) Henri Mondor University Hospital(亨利·蒙多大学医院)

AI总结 针对切片式2D目标检测器在体积数据中预测碎片化不稳定的问题,提出YOLO-PVC框架,通过几何整合提升肝脏肿瘤定位的3D IoU至0.710,优于多种基线方法。

Comments 14 pages, 2 figures, 4 tables. Accepted at AI4M3D Workshop, ECCV 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04483 2026-08-06 cs.CV 新提交

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝

Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

机构 * Maum AI Inc.(Maum AI公司)

AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。

Comments Accepted to ECCV 2026 workshop, UniWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04210 2026-08-06 cs.CV 新提交

PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images

PADFormer:基于稀疏视角图像的姿态无关异常检测

Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang

机构 * Amazon(亚马逊) Simon Fraser University(西蒙菲莎大学) Northeastern University(东北大学)

AI总结 针对现有姿态无关异常检测方法依赖3D重建的缺陷,提出PADFormer模型,利用ViT结合跨视图掩码重建等机制,在PAD基准及FSAD任务上实现最优性能,兼具效率与泛化性。

Comments Accepted to ECCV 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03407 2026-08-05 cs.CV cs.AI cs.LG 新提交

Distilled Roads: Generalisable Road Network Extraction Across Sensors, Resolutions, and Region

蒸馏路网:跨传感器、分辨率和区域的通用路网提取

Sanayya, Rakshith Sathish, Ashwathi Nambiar

AI总结 本研究提出结合跨分辨率知识蒸馏、多传感器训练与拓扑感知监督的框架,构建出泛化性强、效率高的路网提取模型,在公开基准上性能优于现有最优方法。

Comments Accepted at ECCV 2026 workshop - TerraBytes II

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03323 2026-08-05 cs.CV 新提交

PolyLayout: Multi-room Manhattan Layout Estimation

PolyLayout:多房间曼哈顿布局估计

Gustav Hanning, Shaohui Liu, Rémi Pautrat, Marc Pollefeys, Kalle Åström, Viktor Larsson

AI总结 针对现有多房间布局估计方法泛化差、未利用建筑结构的问题,提出 PolyLayout 方法,通过联合优化跨房间的曼哈顿 3D 多边形,在新基准上实现了优于现有方法的准确性与鲁棒性。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03198 2026-08-05 cs.CV cs.RO 新提交

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

通过可微物理渲染连接在线与离线手写文字

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

AI总结 该研究提出统一在线-离线手写生成框架,通过物理画笔模型与可微渲染模块解决两类手写生成范式的缺陷,经实验验证实现了结构与视觉保真度。

Comments Accepted at ECCV 2026, Project page: https://seonmip.github.io/onoff

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02990 2026-08-05 cs.RO 新提交

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02502 2026-08-04 cs.AI 新提交

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

CMuon:通过分块动量正交化加速并稳定扩散Transformer的训练

Chuyan Chen, Peng Sun, Kun Yuan

机构 * Peking University(北京大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

AI总结 针对扩散Transformer训练计算成本高、普通Muon优化器存在后期收敛问题的瓶颈,提出CMuon策略,通过分块权重实现训练加速与收敛优化,在ImageNet 256上200个epoch达FID1.18,训练速度超AdamW2倍

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02315 2026-08-04 cs.CV 新提交

GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo, Claudio Rossi, Edoardo Arnaudo

机构 * Fondazione LINKS(LINKS基金会) Politecnico di Torino(都灵理工大学)

AI总结 该研究推出GEOID-Flood大规模多模态洪水分割基准数据集,评估发现基础模型优势适度,光学-SAR融合微调效果最佳,该数据集训练的模型迁移性更优。

Comments Accepted at ECCV 2026 - Terrabytes II Workshop, 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02285 2026-08-04 cs.CV 新提交

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration

Sen-Cap:基于激光雷达-相机融合的传感器灵活且抗噪的人体运动捕捉框架

Aoru Xue, Yujing Sun, Yiming Ren, Kwok-Yan Lam, Mao Ye, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信托中心)

AI总结 Sen-Cap是一种无需传感器间校准的激光雷达-相机融合人体运动捕捉框架,通过跨传感器运动估计器与抗噪轨迹跟踪器实现灵活部署与强鲁棒性,在多数据集上达最优性能,适用于真实场景。

Comments 16 pages, 8 figures, 4 tables. Accepted at ECCV 2026. Aoru Xue and Yujing Sun contributed equally. Yuexin Ma is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01977 2026-08-04 cs.CV 新提交

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)

AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01793 2026-08-04 cs.LG 新提交

ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection

ReFP-AD:用于基于能量的异常检测的整流流预处理

Camile Lendering, Erkut Akdag, Joaquín Figueira, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 该研究针对统一异常检测中高维token空间EBM训练不稳定问题,提出ReFP-AD方法,经实验在MVTec-AD和VisA数据集上取得优于基线的异常检测性能。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01761 2026-08-04 cs.CV 新提交

DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing

DecoupleGS:用于端到端自动驾驶测试的交互式三维高斯溅射

Siying Li, Ying Ni, Jie Sun, Jian Sun, Haotian Shi

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室)

AI总结 DecoupleGS是一种解耦三维高斯溅射框架,通过分解场景为静态背景与动态智能体,结合三个针对性模块实现高保真交互,为端到端自动驾驶测试提供实用闭环传感器仿真平台。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01706 2026-08-04 cs.CV 新提交

UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization

UniSim-SLAM:采用统一Sim(3)优化的前馈SLAM

Inha Lee, Dongjae Jeong, Junhee Lee, Kyungdon Joo

机构 * National Institute of Science and Technology(国立科学技术研究所)

AI总结 UniSim-SLAM是采用统一Sim(3)优化的前馈SLAM系统,通过前端两视图跟踪与后端多视图子图优化,在TUM RGB-D和7-Scenes数据集上实现了当前最佳未校准设置下的轨迹精度,误差显著降低。

Comments Accepted at ECCV 2026. Project page: https://vision3d-lab.github.io/unisim-slam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01643 2026-08-04 cs.CV cs.AI cs.GR 新提交

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

StreamTalk:基于关键姿态锚定的流式伴随语音手势生成

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi

机构 * The University of Tokyo(东京大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学)

AI总结 StreamTalk是带周期性生成-检索-精调循环的闭环流式伴随语音手势生成框架,通过关键姿态锚定减少长程漂移,在BEAT2数据集上达到最优FGD指标,实时运行帧率达76 FPS。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01185 2026-08-04 cs.CV cs.LG 新提交

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01129 2026-08-04 cs.RO cs.CV 新提交

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity

FeDepth:面向机器人异构性的深度估计联邦学习

Ganghyeon Lee, Inha Lee, Junhee Lee, Jeongeon Lee, Sung Whan Yoon, Kyungdon Joo

机构 * Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院)

AI总结 针对机器人感知深度估计中联邦学习因客户端异构性导致性能下降的问题,本文提出FeDepth框架,通过软聚类建模客户端关系,在多架构上提升了联邦学习的鲁棒性。

Comments Accepted at ECCV 2026. Ganghyeon Lee and Inha Lee contributed equally. Kyungdon Joo is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00903 2026-08-04 cs.CV 新提交

PeCA: Palette Context Assisted Inference for Test-Time Paint-Bucket Colourisation on Animation Videos

PeCA:调色板上下文辅助推理,用于动画视频的测试时油漆桶上色

Dongheng Lin, Jianbo Jiao

机构 * University of Birmingham(伯明翰大学)

AI总结 针对动画视频油漆桶上色的区域对应易受模糊片段影响的问题,提出无训练即插即用的PeCA框架,通过空间与时间上下文推理优化,实验证实其性能持续提升。

Comments ECCV 2026, Project Page: https://rathgrith.github.io/PeCA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00800 2026-08-04 cs.CV 新提交

AIMold: An Autonomous AI-based Pipeline for Complex Mold Design

AIMold:一种用于复杂模具设计的自主AI驱动流水线

Pengyun Qiu, Shuo Wang, Zeyuan Chen, Yihao Zhi, Chongjie Ye, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) FNii-Shenzhen(深圳未来网络研究院)

AI总结 研究针对复杂模具设计依赖专家知识、缺乏公开数据集的问题,推出含超2.3万个模型的MoldCAD数据集,提出AI流水线实现模具设计自动化,助力制造感知型CAD生成。

Comments Accepted to ECCV 2026. Code is available at https://github.com/tb2-sy/AIMold

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏