arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2607.09753 2026-07-14 cs.CV cs.AI cs.LG 新提交

Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis

通过内部潜变量分析对扩散模型进行统一骨干细化

Haksoo Lim, Myeongjin Lee, Wonjoon Chang, Jaesik Choi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) INEEJI

AI总结 研究扩散模型骨干细化问题,提出DUNE框架,通过分析内部潜变量检测突变偏差,对选定条目进行骨干特定抑制,可自然扩展到基于Transformer的模型,经实验验证该方法能提高保真度并减少幻觉。

Comments 45 pages, 23 figures. Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06438 2026-07-14 cs.RO cs.CV cs.GR 版本更新

WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation

WristMimic:基于手腕引导操作的全身人形机器人控制

Wongyun Yu, Youngwoon Kim, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学)

AI总结 研究如何将人类物体交互演示重定向到物理模拟,提出WristMimic框架,分离无接触身体运动与手部操作,通过手腕引导,让手指从物体跟踪和接触结果学习行为,实验显示该框架在跨手部模型重定向时效果良好。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29473 2026-07-14 cs.CV 版本更新

MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

MAVIN:具有叙事控制的多镜头视听生成

Kaiqi Liu, Yunyao Mao, Ziqi Cai, Zheng Geng, Jing Wang, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Shuchen Weng, Boxin Shi

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Sun Yat-sen University(中山大学)

AI总结 提出MAVIN框架,通过边界感知注意力、ID感知传播和多智能体脚本管线,实现多镜头视听生成中的叙事控制,解决时间错位、可控性差和脚本不完整问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26740 2026-07-14 cs.CV 版本更新

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

LiveEdit:迈向基于扩散的实时流式视频编辑

Xinyu Wang, Chongbo Zhao, Fangneng Zhan, Yue Ma

机构 * THU(清华大学) HKUST(香港科技大学)

AI总结 提出一种因果逐帧编辑的流式视频框架,通过三阶段蒸馏将双向模型能力迁移至单向流式编辑器,结合AR掩码缓存实现12.66 FPS的实时编辑,并保持背景稳定。

Comments Accepted by ECCV 2026, Project page: https://live-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26515 2026-07-14 cs.CV 版本更新

Forget, Anticipate and Adapt: Test Time Training for Long Videos

遗忘、预期与适应:长视频的测试时训练

Rajat Modi, Sebastian Noel, Xin Liang, Yogesh Singh Rawat

机构 * University of Central Florida(中佛罗里达大学)

AI总结 提出帧遗忘网络(FFN),通过仅处理滑动窗口中的三帧并定义惊奇度量自适应调整窗口,实现长视频的高效测试时训练。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18757 2026-07-14 cs.CV 版本更新

Driving Like Yourself: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving

驾驶千面:一个闭环个性化端到端自动驾驶的基准

Xiaoru Dong, Ruiqin Li, Xiao Han, Zhenxuan Wu, Jiamin Wang, Jian Chen, Qi Jiang, SM Yiu, Xinge Zhu, Yuexin Ma

机构 * The University of Hong Kong(香港大学) ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出Person2Drive平台,通过个性化数据集、评价指标和框架,解决自动驾驶个性化难题,实现细粒度分析与有效个性化。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21649 2026-07-14 cs.CV

Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yan, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。

Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26599 2026-07-14 cs.CV 版本更新

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

VGGRPO:迈向世界一致的视频生成的4D潜在奖励

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore Gazulla

机构 * Google(谷歌) University of Oxford(牛津大学) CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) University of Copenhagen(哥本哈根大学)

AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。

Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17665 2026-07-14 cs.CV 版本更新

OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents

OpenEarthAgent:一个用于工具增强地理空间代理的统一框架

Akashah Shabbir, Muhammad Umer Sheikh, Muhammad Akhtar Munir, Hiyam Debary, Mustansar Fiaz, Muhammad Zaigham Zaheer, Paolo Fraccaro, Fahad Shahbaz Khan, Muhammad Haris Khan, Xiao Xiang Zhu, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) IBM Research(IBM研究院) Linköping University(林霍姆斯大学) Technical University Munich(慕尼黑技术大学) Australian National University(澳大利亚国立大学)

AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。

Comments Accepted at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16112 2026-07-14 cs.CV 版本更新

AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs

AutoV:面向视觉提示检索的损失导向排名用于大视觉-语言模型

Yuan Zhang, Chun-Kai Fan, Sicheng Yu, Junwen Pan, Tao Huang, Ming Lu, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoV通过损失导向的提示检索提升大视觉-语言模型在图像理解等任务中的性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13132 2026-07-14 cs.CV 版本更新

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21095 2026-07-14 cs.CV 版本更新

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

UniRec-0.1B:具有1亿参数的统一文本和公式识别

Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 研究旨在实现文本和公式的统一识别,提出含1亿参数的UniRec-0.1B模型。通过构建大规模数据集,应对层次结构变异性和语义纠缠等挑战,引入分层监督训练和语义解耦分词器。实验证明该模型优于同类,且速度大幅提升,有效且高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09329 2026-07-13 cs.CV cs.GR 新提交

Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition

用于增强材质-光照分解的动态逆渲染

Raza Yunus, Benjamin Ummenhofer, Jan Eric Lenssen, Eddy Ilg

机构 * University of Technology Nuremberg(纽伦堡工业大学) Intel(英特尔公司) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息园)

AI总结 研究逆渲染中材质-光照分解的不适定问题,提出结合物体跟踪、重建与逆渲染的方法,利用刚性运动物体的多样光-表面相互作用解决模糊性,实验证明该方法在合成数据和真实视频中均有优势。

Comments Accepted at ECCV 2026. Project page: https://razayunus.github.io/DIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09193 2026-07-13 cs.CV 新提交

YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation

YeTI:仅需两张噪声图像即可生成真实世界的sRGB噪声

Jaekyun Ko, Byung Wan Lim, Soomin Lee, Dongjin Kim, Tae Hyun Kim

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Mobile Experience (MX) Division, Samsung Electronics(三星电子移动体验部门)

AI总结 针对真实世界sRGB图像去噪难题,提出YeTI框架,仅从同一场景两张噪声图像学习,利用重构自编码器和条件扩散Transformer分离场景与噪声特征,生成逼真噪声,经实验验证其有效性及在下游去噪任务中的实用价值。

Comments Accepted to ECCV 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09138 2026-07-13 cs.RO 新提交

BeyondSight: Object Permanence for End-to-End Autonomous Driving

超越视野:端到端自动驾驶中的物体持久性

Sandro Papais, Letian Wang, Mudit Jain, Behnaz Rezaei, Steven L. Waslander

机构 * University of Toronto(多伦多大学) Qualcomm Technologies, Inc.(高通技术公司)

AI总结 研究针对自动驾驶中物体易被遮挡问题,提出超越视野框架,通过维持持久物体假设解耦物体存在与可观测性,引入nuScenes - Permanence用于训练评估,实验证明该框架显著提升遮挡推理能力,凸显物体持久性对自动驾驶的重要性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09126 2026-07-13 cs.CV cs.CL 新提交

VTaMo: Video-Text Alignment Model for Sign Language Translation

VTaMo:用于手语翻译的视频-文本对齐模型

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign科技)

AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。

Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09081 2026-07-13 cs.CV 新提交

Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation

用于动作分割数据集压缩的自适应潜在轨迹锚定

Artheme Gauthier-Villar, Guodong Ding, Angela Yao

机构 * National University of Singapore(新加坡国立大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 该研究针对动作分割数据集压缩问题,提出利用去噪扩散隐式模型,将动作段表示为噪声流形中由稀疏潜在点锚定连续轨迹的方法,并引入自适应分配机制。实验表明,该框架显著优于现有方法,在保持低压缩率时实现与真实数据训练相当的性能。

Comments 16 pages, 5 figures, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09061 2026-07-13 cs.CV cs.AI cs.LG 新提交

On Locality and Length Generalization in Visual Reasoning

关于视觉推理中的局部性和长度泛化

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究中心)

AI总结 研究从视觉状态跟踪和长度泛化角度,探讨局部、顺序视觉模型是否有计算优势。受语言模型启发,研究简单视觉任务中视觉模型行为。发现其会利用全局捷径,基于严格局部感知的策略可缓解此问题,表明局部注意力对稳健组合泛化很关键。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09024 2026-07-13 cs.CV cs.AI 新提交

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23086 2026-07-13 cs.LG cs.CV 版本更新

Policy-based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards

基于策略的自回归图像模型实例和分布级奖励调优

Orhun Bugra Baran, Melih Kandemir, Ramazan Gokberk Cinbis

机构 * Middle East Technical University (METU)(中东部技术大学) University of Southern Denmark(南部丹麦大学)

AI总结 本文提出一种轻量级强化学习框架,通过将基于标记的自回归合成视为马尔可夫决策过程,结合分布级LOO-FID奖励和实例级CLIP/HPSv2奖励,提升图像生成的质量和多样性。

Comments Accepted at the European Conference on Computer Vision (ECCV), 2026. This version includes the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05711 2026-07-13 cs.CV 版本更新

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

任何到完整:提示深度任何物以完成深度估计的一阶段

Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, Desheng Zhang

机构 * Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学) JD Logistics(京东物流) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 Any2Full提出一种单阶段深度完成框架,通过尺度提示适应预训练MDE模型,提升鲁棒性和效率,优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18822 2026-07-13 cs.CV 版本更新

Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations

鲁棒的自监督跨模态超分辨率对抗真实世界错位观测

Xiaoyu Dong, Jiahuan Li, Ziteng Cui, Naoto Yokoya

机构 * The Univsrsity of Tokyo(东京大学) RIKEN AIP(理化学研究所)

AI总结 RobSelf通过自监督方法实现鲁棒的跨模态超分辨率,通过误对齐感知的特征翻译和内容感知的参考滤波器提升性能和效率。

Comments ECCV 2026. Supp: https://drive.google.com/file/d/1fqTYuSY7Qp7PFHiHViZs7y6lz6Bws7ws/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13907 2026-07-13 cs.CV 版本更新

White Aggregation and Restoration for Few-shot 3D Point Cloud Semantic Segmentation

用于少样本3D点云语义分割的白色聚合与恢复

Jiyun Im, SuBeen Lee, Miso Lee, Jae-Pil Heo

机构 * Sungkyunkwan University(全州大学)

AI总结 研究少样本3D点云语义分割,针对现有方法问题,提出基于注意力机制的白色聚合与恢复模块(WARM),解决分布差距,生成有效原型,在多个数据集上取得良好性能,证明其在确定性原型生成中的有效性。

Comments Accepted to ECCV 2026. 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08772 2026-07-10 cs.CV 新提交

Wat3R: Underwater 3D Geometry Learning without Annotations

Wat3R:无需标注的水下3D几何学习

Jiangwei Ren, Xingyu Jiang, Zijie Song, Wei Xu, Hongkai Lin, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对水下3D几何估计难题,提出跨域半监督学习框架Wat3R,基于师生架构,无需标注水下数据,利用未标注视频学习,设计跨视图一致性损失,构建Water3D数据集,实验证明其在水下多视图深度估计和点云重建上性能优于现有方法。

Comments Accepted to ECCV 2026. The dataset and code are available at https://github.com/LSXI7/Wat3R

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08771 2026-07-10 cs.CV 新提交

ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device

ZipDepth:在任何设备上随时随地实现轻量级零样本单目深度估计

Fabio Tosi, Luca Bartolomei, Matteo Poggi, Stefano Mattoccia

机构 * University of Bologna(博洛尼亚大学)

AI总结 研究单目深度估计难题,提出ZipDepth轻量级网络,结合可重新参数化编码器-解码器与知识蒸馏,在多域训练集训练,参数仅610万,能在多设备实时运行,在五个基准测试中平衡零样本精度与部署效率,向高精度基础模型迈进。

Comments ECCV 2026. Code: https://github.com/fabiotosi92/ZipDepth - Project page: https://zipdepth.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08688 2026-07-10 cs.CV 新提交

SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

SAM-MT:实时交互式多目标视频分割

Ruiqi Shen, Chang Liu, Henghui Ding

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 研究针对多目标视频分割中帧率随目标数增加而降低的问题,基于SAM2提出SAM-MT。通过显式查询、解耦掩码注意力等方法,实现延迟与目标数解耦,保持分割性能,达到与单目标基线相当的实时速度。

Comments ECCV 2026, Project Page: https://henghuiding.com/SAM-MT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08537 2026-07-10 cs.CV 新提交

Whareformer: Learning to Track What is Where in Long Egocentric Videos

Whareformer:学习在长时间的第一人称视角视频中追踪物体位置

Jacob Chalk, Saptarshi Sinha, Dima Damen, Yannis Kalantidis, Diane Larlus

机构 * University of Bristol(布里斯托大学) NAVER LABS Europe(NAVER欧洲实验室)

AI总结 针对第一人称视角视频的OSNOM任务,提出基于Transformer的Whareformer模型,通过可更新内存和轨迹分配模块联合推理物体外观与位置,在小数据集训练后在多数据集长测试视频上达SOTA,性能显著优于先前工作。

Comments Accepted at ECCV 2026. Project Webpage: https://jacobchalk.github.io/Whareformer/

详情

展开后加载摘要…

URL PDF HTML 收藏