arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-08-18 至 2026-08-18 共收录 18
2608.16810 2026-08-18 cs.CV cs.LG q-bio.QM 新提交

Unsupervised Learning of Cell Instances with Generative Routing Pyramids

基于生成路由金字塔的细胞实例无监督学习

Ziwen Liu, Martin Weigert

机构 * Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据分析与人工智能中心(ScaDS.AI)) Technische Universität Dresden(德累斯顿工业大学)

AI总结 该研究提出基于生成路由金字塔的无监督方法,实现未标注显微镜图像的细胞实例分割与表型分类,在实例分割及细胞表型生成建模上表现具竞争力。

Comments 15 pages, 4 figures; ECCV 2026 Workshop BIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16646 2026-08-18 cs.CV 新提交

Training-Free Reconstruction-Based AI-Generated Image Detectors Are Inherently Vulnerable to Adversarial Examples

无训练的基于重构的AI生成图像检测器固有地易受对抗样本攻击

Roman Demchenko, Jonas Ricker, Asja Fischer

机构 * Ruhr University Bochum(鲁尔大学波鸿分校)

AI总结 该研究针对基于自编码器重构误差的AI生成图像检测器提出两种新型对抗攻击方法,发现其易受难以察觉的对抗样本攻击,检测性能显著下降,且对抗样本可跨检测器迁移,揭示了此类检测器的固有脆弱性。

Comments Accepted at AI4MFDD (AI for Multimedia Forensics & Disinformation Detection) Workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16514 2026-08-18 cs.CV cs.AI cs.CL cs.HC cs.MM 新提交

Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans

匹配结果,不同注视:中央凹多模态大语言模型(MLLM)的搜索方式与人类的对比

Mohamed Amine Kerkouri, Marouane Tliba, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * F-initiatives(F计划) Université Sorbonne Paris Nord(巴黎北索邦大学) Northwestern University(西北大学) IULM university(IULM大学)

AI总结 研究对比三款通用MLLM与人类在目标导向视觉搜索中的表现,发现模型在决策和目标获取上优于人类,但注视过程与人类不同,现有指标无法验证类人视觉,零样本模型不适用于过程层面问题。

Comments Paper accepted at 3rd HCV workshop at ECCV 2026. 12 pages main text, 16 pages supp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16384 2026-08-18 cs.CV cs.LG 新提交

Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation

用于参数高效通用视觉适配的自路由张量适配器

Suraj Yadav

机构 * Indraprastha Institute of Information Technology Delhi(因德拉普拉斯信息技术学院德里分校)

AI总结 提出自路由张量适配器(SRTA),无需外部门控网络即可实现样本特定适配,在多领域视觉分类基准上,以更少参数达到与MoE式PEFT基线相当或更优的平均准确率。

Comments Accepted at ECCV Workshop 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16338 2026-08-18 cs.CV cs.AI 新提交

SIGMA-Lane: Scale-pyramId Gated MAmba for Temporally Consistent Video Lane Detection

SIGMA-Lane:用于时间一致性视频车道检测的金字塔门控Mamba

Tiancheng Zhang, Mengmeng Wang, Yan Gao, Xiangjie Kong, Guojiang Shen, Jiaxin Du

机构 * College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

AI总结 SIGMA-Lane通过在SSM路径添加感知遮挡门控,结合双门控时间滤波与SSR,提升了视频车道检测在严重遮挡下的时间稳定性,在VIL-100等数据集上取得了有竞争力的指标。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16014 2026-08-18 cs.CV 新提交

Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision

面向机器人视觉的深度引导多视图曝光 bracketing(HDR 成像技术)

Jinnyeong Kim, Juhyung Choi, Woohyeok Kim, Sunghyun Cho, Seung-Hwan Baek

机构 * POSTECH(浦项科技大学)

AI总结 针对多传感器机器人系统 HDR 感知评估基准缺失的问题,构建含真实与合成场景的大规模数据集,提出深度引导多视图曝光 bracketing(DMEB)单帧 HDR 方法,经评估该方法可作为参考基准且具应用潜力。

Comments 14 pages, ECCV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15984 2026-08-18 cs.CV 新提交

A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models

用于真实世界运动语言模型的即插即用二维运动接口

Kaname Yokoyama, Norimichi Ukita

机构 * Toyota Technological Institute(丰田工业大学)

AI总结 针对MoLMs依赖三维运动输入、真实世界适用性受限的问题,提出即插即用二维运动接口,经实验验证其性能接近三维输入,优于从零训练的二维输入方案,为MoLMs部署提供实用途径。

Comments Accepted to HCMIW at ECCV 2026 (Oral Presentation). Code and demo: this https URL (https://github.com/irajisamurai/2D-Motion-Interface)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15796 2026-08-18 cs.CV 新提交

Emergent 3D Instance Segmentation from Self-Supervised Point Transformers

自监督点Transformer的涌现式3D实例分割

Ted Lentsch, Santiago Montiel-Marín, Holger Caesar, Julian F. P. Kooij

机构 * Delft University of Technology(代尔夫特理工大学) University of Alcalá(阿尔卡拉大学)

AI总结 本研究探究自监督点Transformer是否含分离3D实例的结构信息,据此提出无需训练的TokenGraph3D方法,在无先验条件下大幅优于基线,使涌现的3D实例结构可见。

Comments ECCV 2026 DriveX

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15614 2026-08-18 cs.CV cs.AI 新提交

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测

Matteo Stoiber, Niels Buus Lassen

机构 * Copenhagen Business School(哥本哈根商学院)

AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。

Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15549 2026-08-18 cs.RO cs.AI 新提交

MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration

MistyPilot:通过多智能体大语言模型技能编排实现社交机器人控制

Xiao Wang, Lu Dong, Ifeoma Nwogu, Srirangaraj Setlur, Venu Govindaraju

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

AI总结 该研究提出多智能体大语言模型框架MistyPilot,可解释自然语言指令并编排Misty社交机器人技能,经评估其在多项任务上准确率高、方差低,用户反馈积极,代码将公开。

Comments Accepted at the ECCV 2026 ACVR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15395 2026-08-18 cs.CV 新提交

JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation

JoLT:用于上下文引导的高分辨率分块生成的联合潜在轨迹

Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

机构 * Obvious Research(奥布弗西斯研究公司) Sorbonne Université(索邦大学)

AI总结 本文提出JoLT方法,通过联合去噪LR与HR潜在图像生成高分辨率图像,其生成的图像细节丰富、视觉效果佳,优于竞争基线,为艺术创作提供新方向。

Comments 25 pages, 10 figures, 7 tables. Accepted at the AI4VA Workshop at ECCV 2026. Project page: this https URL (https://obvious-research.github.io/jolt/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15238 2026-08-18 cs.CV 新提交

UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models

UC-VLM:基于一致性驱动学习的视觉语言大模型生成图像检测方法

Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学)

AI总结 UC-VLM是仅依赖二元监督的多阶段框架,通过复用真实性标签实现视觉适配与文本生成,在GenImage、Chameleon等数据集上显著提升了AI生成图像检测的准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15230 2026-08-18 cs.CV 新提交

PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas

PersonaDrive:基于多维驾驶 personas 的可控轨迹预测

Chan Lee, Kimin Yun, Yuseok Bae, Seong Tae Kim, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学) ETRI(韩国电子通信研究院)

AI总结 针对现有轨迹预测方法可控性不足的问题,提出 PCT 数据集与 PersonaDrive 框架,通过多轴设计实现可控轨迹生成,性能优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15195 2026-08-18 cs.CV 新提交

Beyond Natural-Image Foundation Models: Benchmarking Satellite Pretraining for Ophthalmic Image Analysis

超越自然图像基础模型:针对眼科图像分析的卫星图像预训练基准测试

Lovre Antonio Budimir, Mingya Alexa Gong, Alyssa Foong Quinney, Ivana Matovinović, Yukun Zhou, Pearse A. Keane, Sven Lončarić, Marinko V. Šarunić

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算机学院) University College London(伦敦大学学院) Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) Department of Computer Science, University College London(伦敦大学学院计算机科学系) NIHR Moorfields Biomedical Research Centre(NIHR穆尔菲尔德生物医学研究中心) Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) Moorfields Eye Hospital NHS Foundation Trust(穆尔菲尔德眼科医院NHS基金会信托)

AI总结 本文针对眼科图像分析,对比卫星图像与自然图像预训练的视觉基础模型,发现卫星图像预训练在眼科任务上表现优于自然图像,部分任务可媲美医学专家模型。

Comments Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MEDFMB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15141 2026-08-18 cs.CV 新提交

HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation

HOIMask:面向用于人机交互生成的生成式掩码建模

Yihong Ji, Jinsong Zhang, He Hu, Hongbo Xu

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Fuzhou University(福州大学)

AI总结 HOIMask作为首个用于离散空间HOI运动建模的生成式掩码框架,通过HOI VQ编码、Transformer架构及接触感知重构引导,生成的HOI运动优于现有扩散方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14767 2026-08-18 cs.CV cs.AI cs.CL cs.RO 新提交

NARRATE: A Multimodal Real-World Australian Driving Dataset for Human-Centred Explanations in Automated Driving

NARRATE:用于自动驾驶中以人为本解释的多模态真实世界澳大利亚驾驶数据集

Ashkan Yousefi Zadeh, Zishuo Zhu, Xiaomeng Li, Andry Rakotonirainy, Sebastien Glaser, Ronald Schroeter, Patricia Delhomme, Zahra Mehraban

机构 * ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(澳大利亚农村及偏远地区自动驾驶车辆ARC培训中心) Université Gustave Eiffel(Gustave Eiffel大学) Queensland University of Technology (QUT)(昆士兰科技大学)

AI总结 研究人员推出多模态真实世界澳大利亚驾驶数据集NARRATE,含2050个带注释事件,提供多类标签与情境意识注释,开展四项基准任务验证其价值,为开发以人为本的自动驾驶解释模型奠定基础。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV 2026) DriveX Workshop (Foundation Models for Autonomous Driving)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14701 2026-08-18 cs.CV 新提交

Periocular Soft Biometrics: A Survey and Applications to Multimedia Forensics and Disinformation Detection

眼周软生物特征:综述及其在多媒体取证与虚假信息检测中的应用

Fernando Alonso-Fernandez, Kevin Hernandez-Diaz, Josef Bigun

机构 * Halmstad University(哈尔姆斯塔德大学)

AI总结 该研究综述了眼周图像的人口统计属性估计方法,探讨其在多媒体取证与虚假信息检测中的应用,并指出数据集偏差等未解决挑战。

Comments Accepted for publication at ECCV 2026 Workshop on AI for Multimedia Forensics & Disinformation Detection (AI4MFDD2026)

详情

展开后加载摘要…

URL PDF HTML 收藏