arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 555
2607.00545 2026-07-02 cs.CV 新提交

ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation

ECoSim:面向可控交通模拟的数据高效微调

Yu-Hsiang Chen, Wei-Jer Chang, Yi-Ting Chen, Masayoshi Tomizuka

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出轻量级控制适应框架,通过身份初始化的FiLM层调制中间特征,为预训练的扩散和自回归交通模型添加多模态控制(草图、潜在行为编码和文本),使用不到1%的配对数据实现强可控性。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00529 2026-07-02 cs.CV 新提交

NoPA: Non-Parametric Online 3D Scene Graph Generation

NoPA: 非参数化在线3D场景图生成

Qi Xun Yeo, Seungjun Lee, Yan Li, Gim Hee Lee

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

AI总结 针对现有3D场景图生成方法无法实时运行的问题,提出NoPA,用非参数化分布表示物体,保留几何细节,并通过基于最大均值差异的合并策略和关系传播,实现实时且准确的在线场景图生成。

Comments This paper has been accepted in ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00525 2026-07-02 cs.CV 新提交

SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation

SPECSIA:用于基于绘图的3D动画中新颖视角增强的风格化数据集

Kyuwon Kim, Sunjae Yoon, Chang D. Yoo

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学电子工程学院) Department of AI, Chung-Ang University, Seoul, Republic of Korea(韩国 Chung-Ang 大学人工智能系)

AI总结 提出SPECSIA-15K数据集和DraViE模块,通过数据先验去除新颖视角伪影,提升动画保真度和时间一致性,降低每角色适应成本。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00494 2026-07-02 cs.CV 新提交

HieDG: A Hierarchical Discrete Geometry-Guided Framework for Multi-Animal Tracking

HieDG: 一种用于多动物跟踪的层次化离散几何引导框架

Chenxun Deng, Zhongde Zhang, Ye Yuan, Chengyang Zhang, Yifan Zhang, Bohao Chen, Hongying Yan, Hang Zhou, Hua Han, Xi Chen

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所脑认知与脑启发智能技术国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Technology, Beijing Forestry University(北京林业大学工学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) College of Computer Science, Sichuan University(四川大学计算机学院) C²DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所C²DL) School of Automation, Chongqing University(重庆大学自动化学院) Faculty of Life and Health Sciences, Shenzhen University of Advanced Technology(深圳理工大学生命健康学院) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

AI总结 针对多动物跟踪中外观相似、密度高和运动不规则导致的身份关联困难,提出HieDG框架,通过两级残差码本将连续几何信号离散化为结构化令牌,与视觉嵌入对齐并集成到查询中,显著提升身份一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00492 2026-07-02 cs.CV 新提交

GenSP: Consistent Spherical Parameterization via Learning Shape Generative Models

GenSP:通过学习形状生成模型实现一致的球面参数化

Sai Karthikey Pentapati, Shashank Gupta, Rajesh Sureddi, Yuezhi Yang, Alan C. Bovik, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学博尔德分校)

AI总结 提出GenSP框架,通过学习神经生成模型预测从单位球面到形状的连续映射,并通过逆映射获得一致的球面参数化,显著降低几何畸变并提升跨形状一致性。

Comments Accepted at ECCV 2026. Sai Karthikey Pentapati and Shashank Gupta contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00457 2026-07-02 cs.AI 新提交

Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments

面向演化环境中具身智能体的多尺度世界模型混合

Jinwoo Jang, Daniel J. Rho, Sihyung Yoon, Hyunsuk Cho, Honguk Woo

AI总结 提出MuSix框架,通过尺度感知的世界模型混合与演化,解决具身智能体在动态环境中的多尺度推理和知识适应问题,在EmbodiedBench和HAZARD上超越现有方法。

Comments Accepted at ECCV 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00446 2026-07-02 cs.CV cs.AI 新提交

VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement

VideoSearch-R1: 通过软查询细化实现迭代视频检索与推理

Seohyun Lee, Seoung Choi, Dohwan Ko, Jongha Kim, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学)

AI总结 提出VideoSearch-R1框架,通过软查询细化(SQR)在连续潜空间优化搜索查询,结合GRPO训练,实现大规模视频库的迭代检索与精确时序定位,性能达SOTA。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00434 2026-07-02 cs.CV cs.LG 新提交

Information-Regularized Attention for Visual-Centric Reasoning

信息正则化注意力用于以视觉为中心的推理

Guohao Sun, Xiaofang Wang, Yash Patel, Mengchen Liu, Zhiqiang Tao, Praveen Krishnan

机构 * FAIR at Meta(Meta 的 FAIR 部门) Rochester Institute of Technology(罗切斯特理工学院)

AI总结 针对视觉语言模型中的对象幻觉、视觉基础弱和灾难性遗忘问题,提出信息正则化注意力机制,通过随机注意力显式调控视觉信息注入,改善表示学习稳定性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00428 2026-07-02 cs.CV 新提交

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

HyFL-CLIP: 用于鲁棒长上下文理解的CLIP双曲微调

Ji Ha Jang, Hayeon Kim, Chulwon Lee, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) IPAI INMC & AIIS(智能计算与人工智能研究所) Seoul National University(首尔国立大学)

AI总结 提出HyFL-CLIP,通过双曲空间微调CLIP,利用跨流形相似性蒸馏和爱因斯坦中点聚合建模层次蕴含关系,提升长上下文理解鲁棒性,在文本扰动下长文本跨模态检索提升高达19.5%。

Comments Accepted to ECCV 2026. Project page: https://janeyeon.github.io/hyflclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00409 2026-07-02 cs.CV 新提交

MedCAGD: Context-Aware Gated Decoder for Efficient Medical Image Segmentation

MedCAGD:用于高效医学图像分割的上下文感知门控解码器

Saad Wazir, Patrick Dominique Vibild, Dinh Phu Tran, Seongah Kim, Daeyoung Kim

机构 * School of Computing, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院计算学院) Department of Energy, Aalborg University(奥尔堡大学能源系)

AI总结 提出一种上下文感知门控解码器,通过轻量多尺度通道重校准、门控跳跃融合和全局上下文聚合机制,有效利用预训练编码器特征,在11个基准上优于强基线。

Comments Accepted at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00402 2026-07-02 cs.CV cs.AI cs.LG 新提交

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

文本到图像扩散模型安全对齐中的高效用幻觉

Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah

机构 * Institute of Artificial Intelligence University of Central Florida(中佛罗里达大学人工智能研究所)

AI总结 揭示安全对齐方法在粗粒度指标上看似高效用,但在细粒度语义正确性上显著下降,提出结构感知几何正则化(SAGE)以恢复结构化效用。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00382 2026-07-02 cs.CV 新提交

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

活力感知压缩:面向高效图像到形状扩散Transformer

Jaeah Lee, Hyunjin Kim, Jaewoong Cho, Gihyun Kwon

机构 * KRAFTON AI, Republic of Korea(KRAFTON AI, 韩国) Amazon, Australia(亚马逊, 澳大利亚)

AI总结 提出首个针对图像到形状扩散Transformer的压缩方法,通过活力引导的结构化剪枝、自适应量化和微调,在保持几何保真度下实现高达66%的模型尺寸缩减。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00371 2026-07-02 cs.CV cs.AI 新提交

MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts

MEPA: 基于专家混合的多尺度表示对齐用于视觉自回归建模

Nuoyan Zhou, Zhijun Tu, Lei Yu, Kun Cheng, Jie Hu, Nannan Wang, Xinghao Chen

机构 * State Key Laboratory of Integrated Services Networks, Xidian University(西安电子科技大学综合业务网理论及关键技术国家重点实验室) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对视觉自回归模型在多尺度表示学习中的优化冲突和语义传播问题,提出尺度感知的专家混合架构和残差特征聚合方案,提升训练效率和生成质量。

Comments 15 pages, 4 figures, 8 tables, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00369 2026-07-02 cs.CV 新提交

SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions

SFDATrack: 恶劣天气条件下的广义无源域自适应跟踪

Siyuan Yao, Ziqi Wang, Ruiqi Yu, Junqi Huang, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

AI总结 提出SFDATrack,一种仅利用目标域恶劣天气样本的无源域自适应跟踪器,通过双交互Mamba骨干和超球原型投影实现鲁棒状态估计,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00361 2026-07-02 cs.CR 新提交

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift: 视觉-语言模型上基于“啊哈时刻”驱动的推理级后门攻击

Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

AI总结 提出ReShift框架,通过“啊哈时刻”驱动推理轨迹重定向,结合PRDC管道和SRJO策略实现隐蔽的后门攻击,理论保证熵反弹与轨迹发散的联系。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00289 2026-07-02 cs.CV 新提交

OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization

OnPoint: 点监督在线时序动作定位的离线到在线多级蒸馏

Sakib Reza, Gauri Jagatap, Mohsen Moghaddam, Octavia Camps, Andrea Fanelli

机构 * Northeastern University(东北大学) Dolby Laboratories, Inc.(杜比实验室公司) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出点监督在线时序动作定位任务,并设计离线到在线多级蒸馏框架,通过伪段实例、类激活序列和窗口级蒸馏转移知识,结合点标签和注意力校准,在五个数据集上优于基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00259 2026-07-02 cs.CV cs.AI 新提交

Multi-Hypothesis Test-Time Adaptation to Mitigate Underspecification

多假设测试时自适应以缓解欠指定问题

Afshar Shamsi, Xiao-Yu Guo, Hamid Alinejad-Rokny, Arash Mohammadi, Damien Teney, Ehsan Abbasnejad

机构 * Concordia University(康科德大学) Australian Institute for Machine Learning(澳大利亚机器学习研究所) University of New South Wales(新南威尔士大学) Idiap Research Institute(Idiap研究机构) Monash University(墨尔本大学)

AI总结 针对测试时自适应中的欠指定问题,提出多假设多样化框架,通过输出、参数、优化器和输入层面的多样化探索多个自适应轨迹,提升鲁棒性,在混合偏移、小批量及标签偏移场景下分别提升3-4%、2-3%和1-2.5%。

Comments 26 pages, 4 figures, 12 tables, Accepted in ECCV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00189 2026-07-02 cs.CV 新提交

VOCA: Visual Odometry with Codec Awareness

VOCA: 具有编解码感知的视觉里程计

Nouri Alexander Hilscher, Mateo de Mayo, Dominik Muhle, Christoph Otten genannt Hermes, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 提出VOCA方法,利用视频编解码信息改进压缩流上的立体视觉里程计跟踪性能,在因果VO上达到最先进的相对轨迹误差和效率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00183 2026-07-02 cs.CV 新提交

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

DriftScope: 测量扩散模型适应的隐藏效应

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Universitat Autonoma de Barcelona, Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学项目) City University of Hong Kong, HK SAR, China(香港城市大学)

AI总结 针对预训练文本到图像扩散模型的适应(概念定制或遗忘),提出DriftScope诊断工具,通过稀疏自编码器和零样本分类揭示模型权重修改导致语义无关概念系统性漂移,FID/KID无法早期检测,而特定类别零样本准确率下降高达18.9点。

Comments 22 pages, 5 figures, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00176 2026-07-02 cs.CV 新提交

PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment

PRISM-VO:使用光度全光集束调整的尺度感知视觉里程计

Aymeric Fleith, Julian Zirbel, Daniel Cremers, Niclas Zeller

机构 * Technical University of Munich(慕尼黑工业大学) Karlsruhe University of Applied Sciences(卡尔斯鲁厄应用科学大学)

AI总结 提出PRISM-VO,一种基于光度全光集束调整的纯优化稀疏光度视觉里程计,通过联合优化相机位姿和逆深度,实现精确的度量尺度重建,避免单目SLAM的尺度模糊。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00157 2026-07-02 cs.CV 新提交

Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video

渐进式姿态引导的单目视频4D动物重建

Siyuan Li, Weiying Chen, Yilin Wang, Xinxin Zuo, Xingyu Li, Li Cheng

机构 * University of Alberta(阿尔伯塔大学) Concordia University(康科迪亚大学)

AI总结 提出一种基于3D高斯溅射的渐进式测试时优化框架,通过解耦关节姿态与非刚性变形,实现从单目视频高保真重建4D动物,在多种物种上优于现有方法。

Comments Accepted to ECCV 2026. Camera-ready author version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00144 2026-07-02 cs.CV cs.AI cs.LG 新提交

A Mechanism-Driven Theory of Phase Transitions in Active Learning

主动学习中相变的一种机制驱动理论

Julia Machnio, Mads Nielsen, Mostafa Mehdipour Ghazi

机构 * Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心)

AI总结 通过将预算制度重新解释为泛化主导机制的转变,提出了一种三阶段分类(数据驱动、过渡、模型驱动),并利用可测量代理和分段回归识别,解释了不同策略在不同阶段的有效性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00124 2026-07-02 cs.CV 新提交

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

分割,快与慢:双路径处理的实时开放词汇视频实例分割

Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

机构 * Google TU Munich(谷歌慕尼黑分校) Munich Center for Machine Learning University of Modena(慕尼黑机器学习中心莫德纳大学)

AI总结 提出SegFS双流快慢框架,通过稀疏关键帧的开放词汇对象模型预测实例表示,并在特征空间条件化轻量快速网络,实现高效时域传播,在保持分割性能的同时将延迟降低至MOBIUS的1/14。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00090 2026-07-02 cs.CV cs.AI 新提交

Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition

迷失在尾部:解决城市视觉地点识别中的地理不平衡问题

Zhiyao Shu, Jiacheng Yang, Yang Lu, Waishan Qiu, Chuan Li, Da Chen

机构 * George Mason University(乔治梅森大学) Xiamen University(厦门大学) University of Hong Kong(香港大学) Lambda University of Bath(巴斯大学)

AI总结 针对城市级视觉地点识别中数据长尾分布导致模型偏向频繁拍摄区域的问题,提出分布感知地点识别(DAPR)框架,通过重平衡梯度贡献和多尺度距离搜索机制,在SF-XL等基准上显著提升性能。

Comments Accepted to ECCV 2026, 28 pages including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00465 2026-07-02 cs.CV cs.CL cs.LG 新提交

StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning

StochasT:基于随机轮次深度的视觉指令微调学习

Yuan Qing, Chengzhi Mao, Boqing Gong

机构 * Boston University(波士顿大学) Rutgers University(罗格斯大学)

AI总结 针对视觉指令微调中多轮训练与单轮测试不匹配的问题,提出StochasT方法,通过随机分组语言任务为不同大小的轮次深度,增强模型在单轮和多轮场景下的鲁棒性。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/StochasT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00374 2026-07-02 cs.CV cs.AI cs.CL cs.IR cs.MM 新提交

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

学习组合:重新审视零样本组合图像检索的代理任务设计

Jingjing Zhang, Lei Zhang, Zheren Fu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出FoCo模型,通过文本锚定的视觉聚合和上下文条件语义补全两个代理任务联合学习组合函数,在零样本组合图像检索中取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00159 2026-07-02 cs.CL cs.CV cs.IR cs.MM 新提交

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强

Qian Ma, S M Rayeed, Charles V. Stewart, Qiong Wu, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。

Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31225 2026-07-02 cs.MM 新提交

A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR

神经形态OT-CFM在多说话人VSR中的首次探索

Lin Chen, Jingping Fang, Hairui Liu, Chenyang Xu, Junhao Chen, Xiaorui Li, Weidong Cai, Xiaoming Chen

AI总结 提出LipsFlow框架,利用神经形态事件流和最优传输条件流匹配,在复杂多说话人场景下实现高鲁棒性和低延迟的视觉语音识别,达到22.3%词错误率和240毫秒延迟。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31077 2026-07-02 cs.CV 新提交

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配

Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院)

AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏