arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-18 至 2026-08-18 共收录 31
2608.16810 2026-08-18 cs.CV cs.LG q-bio.QM 新提交

Unsupervised Learning of Cell Instances with Generative Routing Pyramids

基于生成路由金字塔的细胞实例无监督学习

Ziwen Liu, Martin Weigert

机构 * Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据分析与人工智能中心(ScaDS.AI)) Technische Universität Dresden(德累斯顿工业大学)

AI总结 该研究提出基于生成路由金字塔的无监督方法,实现未标注显微镜图像的细胞实例分割与表型分类,在实例分割及细胞表型生成建模上表现具竞争力。

Comments 15 pages, 4 figures; ECCV 2026 Workshop BIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16646 2026-08-18 cs.CV 新提交

Training-Free Reconstruction-Based AI-Generated Image Detectors Are Inherently Vulnerable to Adversarial Examples

无训练的基于重构的AI生成图像检测器固有地易受对抗样本攻击

Roman Demchenko, Jonas Ricker, Asja Fischer

机构 * Ruhr University Bochum(鲁尔大学波鸿分校)

AI总结 该研究针对基于自编码器重构误差的AI生成图像检测器提出两种新型对抗攻击方法,发现其易受难以察觉的对抗样本攻击,检测性能显著下降,且对抗样本可跨检测器迁移,揭示了此类检测器的固有脆弱性。

Comments Accepted at AI4MFDD (AI for Multimedia Forensics & Disinformation Detection) Workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16514 2026-08-18 cs.CV cs.AI cs.CL cs.HC cs.MM 新提交

Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans

匹配结果,不同注视:中央凹多模态大语言模型(MLLM)的搜索方式与人类的对比

Mohamed Amine Kerkouri, Marouane Tliba, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * F-initiatives(F计划) Université Sorbonne Paris Nord(巴黎北索邦大学) Northwestern University(西北大学) IULM university(IULM大学)

AI总结 研究对比三款通用MLLM与人类在目标导向视觉搜索中的表现,发现模型在决策和目标获取上优于人类,但注视过程与人类不同,现有指标无法验证类人视觉,零样本模型不适用于过程层面问题。

Comments Paper accepted at 3rd HCV workshop at ECCV 2026. 12 pages main text, 16 pages supp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16384 2026-08-18 cs.CV cs.LG 新提交

Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation

用于参数高效通用视觉适配的自路由张量适配器

Suraj Yadav

机构 * Indraprastha Institute of Information Technology Delhi(因德拉普拉斯信息技术学院德里分校)

AI总结 提出自路由张量适配器(SRTA),无需外部门控网络即可实现样本特定适配,在多领域视觉分类基准上,以更少参数达到与MoE式PEFT基线相当或更优的平均准确率。

Comments Accepted at ECCV Workshop 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16338 2026-08-18 cs.CV cs.AI 新提交

SIGMA-Lane: Scale-pyramId Gated MAmba for Temporally Consistent Video Lane Detection

SIGMA-Lane:用于时间一致性视频车道检测的金字塔门控Mamba

Tiancheng Zhang, Mengmeng Wang, Yan Gao, Xiangjie Kong, Guojiang Shen, Jiaxin Du

机构 * College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

AI总结 SIGMA-Lane通过在SSM路径添加感知遮挡门控,结合双门控时间滤波与SSR,提升了视频车道检测在严重遮挡下的时间稳定性,在VIL-100等数据集上取得了有竞争力的指标。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16014 2026-08-18 cs.CV 新提交

Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision

面向机器人视觉的深度引导多视图曝光 bracketing(HDR 成像技术)

Jinnyeong Kim, Juhyung Choi, Woohyeok Kim, Sunghyun Cho, Seung-Hwan Baek

机构 * POSTECH(浦项科技大学)

AI总结 针对多传感器机器人系统 HDR 感知评估基准缺失的问题,构建含真实与合成场景的大规模数据集,提出深度引导多视图曝光 bracketing(DMEB)单帧 HDR 方法,经评估该方法可作为参考基准且具应用潜力。

Comments 14 pages, ECCV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15984 2026-08-18 cs.CV 新提交

A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models

用于真实世界运动语言模型的即插即用二维运动接口

Kaname Yokoyama, Norimichi Ukita

机构 * Toyota Technological Institute(丰田工业大学)

AI总结 针对MoLMs依赖三维运动输入、真实世界适用性受限的问题,提出即插即用二维运动接口,经实验验证其性能接近三维输入,优于从零训练的二维输入方案,为MoLMs部署提供实用途径。

Comments Accepted to HCMIW at ECCV 2026 (Oral Presentation). Code and demo: this https URL (https://github.com/irajisamurai/2D-Motion-Interface)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15796 2026-08-18 cs.CV 新提交

Emergent 3D Instance Segmentation from Self-Supervised Point Transformers

自监督点Transformer的涌现式3D实例分割

Ted Lentsch, Santiago Montiel-Marín, Holger Caesar, Julian F. P. Kooij

机构 * Delft University of Technology(代尔夫特理工大学) University of Alcalá(阿尔卡拉大学)

AI总结 本研究探究自监督点Transformer是否含分离3D实例的结构信息,据此提出无需训练的TokenGraph3D方法,在无先验条件下大幅优于基线,使涌现的3D实例结构可见。

Comments ECCV 2026 DriveX

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15614 2026-08-18 cs.CV cs.AI 新提交

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测

Matteo Stoiber, Niels Buus Lassen

机构 * Copenhagen Business School(哥本哈根商学院)

AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。

Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15549 2026-08-18 cs.RO cs.AI 新提交

MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration

MistyPilot:通过多智能体大语言模型技能编排实现社交机器人控制

Xiao Wang, Lu Dong, Ifeoma Nwogu, Srirangaraj Setlur, Venu Govindaraju

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

AI总结 该研究提出多智能体大语言模型框架MistyPilot,可解释自然语言指令并编排Misty社交机器人技能,经评估其在多项任务上准确率高、方差低,用户反馈积极,代码将公开。

Comments Accepted at the ECCV 2026 ACVR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15395 2026-08-18 cs.CV 新提交

JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation

JoLT:用于上下文引导的高分辨率分块生成的联合潜在轨迹

Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

机构 * Obvious Research(奥布弗西斯研究公司) Sorbonne Université(索邦大学)

AI总结 本文提出JoLT方法,通过联合去噪LR与HR潜在图像生成高分辨率图像,其生成的图像细节丰富、视觉效果佳,优于竞争基线,为艺术创作提供新方向。

Comments 25 pages, 10 figures, 7 tables. Accepted at the AI4VA Workshop at ECCV 2026. Project page: this https URL (https://obvious-research.github.io/jolt/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15238 2026-08-18 cs.CV 新提交

UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models

UC-VLM:基于一致性驱动学习的视觉语言大模型生成图像检测方法

Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学)

AI总结 UC-VLM是仅依赖二元监督的多阶段框架,通过复用真实性标签实现视觉适配与文本生成,在GenImage、Chameleon等数据集上显著提升了AI生成图像检测的准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15230 2026-08-18 cs.CV 新提交

PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas

PersonaDrive:基于多维驾驶 personas 的可控轨迹预测

Chan Lee, Kimin Yun, Yuseok Bae, Seong Tae Kim, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学) ETRI(韩国电子通信研究院)

AI总结 针对现有轨迹预测方法可控性不足的问题,提出 PCT 数据集与 PersonaDrive 框架,通过多轴设计实现可控轨迹生成,性能优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15195 2026-08-18 cs.CV 新提交

Beyond Natural-Image Foundation Models: Benchmarking Satellite Pretraining for Ophthalmic Image Analysis

超越自然图像基础模型:针对眼科图像分析的卫星图像预训练基准测试

Lovre Antonio Budimir, Mingya Alexa Gong, Alyssa Foong Quinney, Ivana Matovinović, Yukun Zhou, Pearse A. Keane, Sven Lončarić, Marinko V. Šarunić

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算机学院) University College London(伦敦大学学院) Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) Department of Computer Science, University College London(伦敦大学学院计算机科学系) NIHR Moorfields Biomedical Research Centre(NIHR穆尔菲尔德生物医学研究中心) Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) Moorfields Eye Hospital NHS Foundation Trust(穆尔菲尔德眼科医院NHS基金会信托)

AI总结 本文针对眼科图像分析,对比卫星图像与自然图像预训练的视觉基础模型,发现卫星图像预训练在眼科任务上表现优于自然图像,部分任务可媲美医学专家模型。

Comments Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MEDFMB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15141 2026-08-18 cs.CV 新提交

HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation

HOIMask:面向用于人机交互生成的生成式掩码建模

Yihong Ji, Jinsong Zhang, He Hu, Hongbo Xu

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Fuzhou University(福州大学)

AI总结 HOIMask作为首个用于离散空间HOI运动建模的生成式掩码框架,通过HOI VQ编码、Transformer架构及接触感知重构引导,生成的HOI运动优于现有扩散方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14767 2026-08-18 cs.CV cs.AI cs.CL cs.RO 新提交

NARRATE: A Multimodal Real-World Australian Driving Dataset for Human-Centred Explanations in Automated Driving

NARRATE:用于自动驾驶中以人为本解释的多模态真实世界澳大利亚驾驶数据集

Ashkan Yousefi Zadeh, Zishuo Zhu, Xiaomeng Li, Andry Rakotonirainy, Sebastien Glaser, Ronald Schroeter, Patricia Delhomme, Zahra Mehraban

机构 * ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(澳大利亚农村及偏远地区自动驾驶车辆ARC培训中心) Université Gustave Eiffel(Gustave Eiffel大学) Queensland University of Technology (QUT)(昆士兰科技大学)

AI总结 研究人员推出多模态真实世界澳大利亚驾驶数据集NARRATE,含2050个带注释事件,提供多类标签与情境意识注释,开展四项基准任务验证其价值,为开发以人为本的自动驾驶解释模型奠定基础。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV 2026) DriveX Workshop (Foundation Models for Autonomous Driving)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14701 2026-08-18 cs.CV 新提交

Periocular Soft Biometrics: A Survey and Applications to Multimedia Forensics and Disinformation Detection

眼周软生物特征:综述及其在多媒体取证与虚假信息检测中的应用

Fernando Alonso-Fernandez, Kevin Hernandez-Diaz, Josef Bigun

机构 * Halmstad University(哈尔姆斯塔德大学)

AI总结 该研究综述了眼周图像的人口统计属性估计方法,探讨其在多媒体取证与虚假信息检测中的应用,并指出数据集偏差等未解决挑战。

Comments Accepted for publication at ECCV 2026 Workshop on AI for Multimedia Forensics & Disinformation Detection (AI4MFDD2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11985 2026-08-18 cs.CV 版本更新

Auditing Frame-Level AUC in Weakly Supervised Video Anomaly Detection: Granularity, Resolution, and Scene Bias

弱监督视频异常检测中帧级AUC的审计:粒度、分辨率与场景偏差

Sara Abdulaziz, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

AI总结 该研究针对弱监督视频异常检测的帧级AUC审计,发现其存在定位预测不可靠、分辨率不足、受场景偏差影响等问题,并公开了粒度感知协议。

Comments Accepted at ECCV 2026 Empirical Theory (ET) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-08-18 cs.CV 版本更新

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22424 2026-08-18 cs.CV 版本更新

FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation

FlowDec:用于鲁棒连续视觉-语言导航的时间条件流去污染器

Yufei Zhang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州))

AI总结 提出FlowDec,一种针对LM-based VLN-CE的图像恢复框架,通过混合时间条件策略和动作质心引导滤波,在导航精度和生成延迟上超越现有去污染方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12739 2026-08-18 cs.HC 版本更新

Quieting the Cobwebs: Browser Interaction for Visual Floaters

静音蛛网:用于视觉浮渣的浏览器交互

Kenneth Ge, Jinglin Li, Shikhar Ahuja

AI总结 本文提出了一种基于眼物理的浮渣模拟工具,用于评估不同运动水平下的文本可读性,并开发了一个新型浏览器扩展,通过减少眼球运动来最大化浏览器任务的信噪比,适用于所有UI元素。

Comments Accepted at ECCV 2026 HCV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10723 2026-08-18 cs.CV cs.AI cs.LG cs.MA 版本更新

AgentMV: A State-Guided Multi-Agent Framework for Budget-Aware Music Video Generation

AllocMV:通过结构化持久状态实现音乐视频生成的最优资源分配

Huimin Wang, Chang Xia, Leilei Ouyang, Yongqi Kang, Yu Fu, Yuqi Ouyang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 AllocMV提出了一种分层框架,将音乐视频合成建模为多重选择背包问题,通过动态规划优化资源分配,确保跨镜头一致性并降低生成成本。

Comments ECCV 2026 AI4VA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10466 2026-08-18 cs.CV 版本更新

ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos

ExpertEdit: 从专家视频中学习技能感知的动作编辑

Arjun Somayazulu, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 ExpertEdit通过无配对专家视频学习技能驱动的动作编辑,无需配对数据或手动指导,提升动作真实感和专家质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01322 2026-08-18 cs.CV 版本更新

Human Pose Estimation in Trampoline Gymnastics: How to Improve Performance on Extreme Poses

蹦床体操中的人体姿态估计:利用新合成数据集提高性能

Léa Drolet-Roy, Victor Nogues, Bérenger Chedal-Anglay, Sylvain Gaudet, Eve Charbonneau, Mickaël Begon, Lama Séoud

机构 * Polytechnique Montreal(蒙特利尔理工学院) Institut National du Sport du Québec(魁北克国家体育学院) University of Sherbrooke(舍布鲁克大学) University of Montreal(蒙特利尔大学)

AI总结 本文通过合成蹦床姿态数据集STP提升姿态估计性能,采用ViTPose模型进行微调,在2D和3D姿态估计中取得显著改进,3D精度提升12.5mm。

Comments Accepted to the MoCha workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-18 cs.CV 版本更新

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12478 2026-08-18 cs.CV cs.LG 版本更新

Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化

Rujie Wu, Haozhe Zhao, Hai Ci, Yizhou Wang

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20839 2026-08-18 cs.CV 版本更新

Training-Free Multi-Concept Image Editing

无需训练的多概念图像编辑

Niki Foteinopoulou, Ignas Budvytis, Stephan Liwicki

机构 * Cambridge Research Laboratory, Toshiba Europe(东芝欧洲剑桥研究实验室)

AI总结 提出无需训练的多概念图像编辑方法,通过概念蒸馏采样实现多视觉概念的无缝组合与控制,提升图像编辑的精度与细节表现。

Comments Accepted in ECCV'26 (17 pages, 13 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07825 2026-08-18 cs.HC cs.CV cs.LG 版本更新

Helios 2.0: A Robust, Ultra-Low Power Gesture Recognition System Optimised for Event-Sensor based Wearables

Helios 2.0:一种鲁棒、超低功耗的手势识别系统,优化用于基于事件传感器的可穿戴设备

Prarthana Bhattacharyya, Joshua Mitton, Ryan Page, Owen Morgan, Oliver Powell, Benjamin Menzies, Gabriel Homewood, Kemi Jacobs, Paolo Baesso, Taru Muhonen, Richard Vigars, Louis Berridge

机构 * Ultraleap Ltd.(Ultraleap有限公司)

AI总结 Helios 2.0通过微手势识别和模拟方法,实现超低功耗的手势控制,提升可穿戴设备用户体验。

Comments To be presented at ECCV-2026 at the Event-Based Multimodal Vision Workshop. 24 pages, 14 figures. Prarthana Bhattacharyya, Joshua Mitton, Ryan Page, Owen Morgan, and Oliver Powell contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏