arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2607.00428 2026-07-02 cs.CV 新提交

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

HyFL-CLIP: 用于鲁棒长上下文理解的CLIP双曲微调

Ji Ha Jang, Hayeon Kim, Chulwon Lee, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) IPAI INMC & AIIS(智能计算与人工智能研究所) Seoul National University(首尔国立大学)

AI总结 提出HyFL-CLIP,通过双曲空间微调CLIP,利用跨流形相似性蒸馏和爱因斯坦中点聚合建模层次蕴含关系,提升长上下文理解鲁棒性,在文本扰动下长文本跨模态检索提升高达19.5%。

Comments Accepted to ECCV 2026. Project page: https://janeyeon.github.io/hyflclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00409 2026-07-02 cs.CV 新提交

MedCAGD: Context-Aware Gated Decoder for Efficient Medical Image Segmentation

MedCAGD:用于高效医学图像分割的上下文感知门控解码器

Saad Wazir, Patrick Dominique Vibild, Dinh Phu Tran, Seongah Kim, Daeyoung Kim

机构 * School of Computing, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院计算学院) Department of Energy, Aalborg University(奥尔堡大学能源系)

AI总结 提出一种上下文感知门控解码器,通过轻量多尺度通道重校准、门控跳跃融合和全局上下文聚合机制,有效利用预训练编码器特征,在11个基准上优于强基线。

Comments Accepted at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00402 2026-07-02 cs.CV cs.AI cs.LG 新提交

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

文本到图像扩散模型安全对齐中的高效用幻觉

Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah

机构 * Institute of Artificial Intelligence University of Central Florida(中佛罗里达大学人工智能研究所)

AI总结 揭示安全对齐方法在粗粒度指标上看似高效用,但在细粒度语义正确性上显著下降,提出结构感知几何正则化(SAGE)以恢复结构化效用。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00382 2026-07-02 cs.CV 新提交

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

活力感知压缩:面向高效图像到形状扩散Transformer

Jaeah Lee, Hyunjin Kim, Jaewoong Cho, Gihyun Kwon

机构 * KRAFTON AI, Republic of Korea(KRAFTON AI, 韩国) Amazon, Australia(亚马逊, 澳大利亚)

AI总结 提出首个针对图像到形状扩散Transformer的压缩方法,通过活力引导的结构化剪枝、自适应量化和微调,在保持几何保真度下实现高达66%的模型尺寸缩减。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00371 2026-07-02 cs.CV cs.AI 新提交

MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts

MEPA: 基于专家混合的多尺度表示对齐用于视觉自回归建模

Nuoyan Zhou, Zhijun Tu, Lei Yu, Kun Cheng, Jie Hu, Nannan Wang, Xinghao Chen

机构 * State Key Laboratory of Integrated Services Networks, Xidian University(西安电子科技大学综合业务网理论及关键技术国家重点实验室) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对视觉自回归模型在多尺度表示学习中的优化冲突和语义传播问题,提出尺度感知的专家混合架构和残差特征聚合方案,提升训练效率和生成质量。

Comments 15 pages, 4 figures, 8 tables, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00369 2026-07-02 cs.CV 新提交

SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions

SFDATrack: 恶劣天气条件下的广义无源域自适应跟踪

Siyuan Yao, Ziqi Wang, Ruiqi Yu, Junqi Huang, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

AI总结 提出SFDATrack,一种仅利用目标域恶劣天气样本的无源域自适应跟踪器,通过双交互Mamba骨干和超球原型投影实现鲁棒状态估计,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00361 2026-07-02 cs.CR 新提交

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift: 视觉-语言模型上基于“啊哈时刻”驱动的推理级后门攻击

Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

AI总结 提出ReShift框架,通过“啊哈时刻”驱动推理轨迹重定向,结合PRDC管道和SRJO策略实现隐蔽的后门攻击,理论保证熵反弹与轨迹发散的联系。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00289 2026-07-02 cs.CV 新提交

OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization

OnPoint: 点监督在线时序动作定位的离线到在线多级蒸馏

Sakib Reza, Gauri Jagatap, Mohsen Moghaddam, Octavia Camps, Andrea Fanelli

机构 * Northeastern University(东北大学) Dolby Laboratories, Inc.(杜比实验室公司) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出点监督在线时序动作定位任务,并设计离线到在线多级蒸馏框架,通过伪段实例、类激活序列和窗口级蒸馏转移知识,结合点标签和注意力校准,在五个数据集上优于基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00259 2026-07-02 cs.CV cs.AI 新提交

Multi-Hypothesis Test-Time Adaptation to Mitigate Underspecification

多假设测试时自适应以缓解欠指定问题

Afshar Shamsi, Xiao-Yu Guo, Hamid Alinejad-Rokny, Arash Mohammadi, Damien Teney, Ehsan Abbasnejad

机构 * Concordia University(康科德大学) Australian Institute for Machine Learning(澳大利亚机器学习研究所) University of New South Wales(新南威尔士大学) Idiap Research Institute(Idiap研究机构) Monash University(墨尔本大学)

AI总结 针对测试时自适应中的欠指定问题,提出多假设多样化框架,通过输出、参数、优化器和输入层面的多样化探索多个自适应轨迹,提升鲁棒性,在混合偏移、小批量及标签偏移场景下分别提升3-4%、2-3%和1-2.5%。

Comments 26 pages, 4 figures, 12 tables, Accepted in ECCV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00189 2026-07-02 cs.CV 新提交

VOCA: Visual Odometry with Codec Awareness

VOCA: 具有编解码感知的视觉里程计

Nouri Alexander Hilscher, Mateo de Mayo, Dominik Muhle, Christoph Otten genannt Hermes, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 提出VOCA方法,利用视频编解码信息改进压缩流上的立体视觉里程计跟踪性能,在因果VO上达到最先进的相对轨迹误差和效率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00183 2026-07-02 cs.CV 新提交

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

DriftScope: 测量扩散模型适应的隐藏效应

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Universitat Autonoma de Barcelona, Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学项目) City University of Hong Kong, HK SAR, China(香港城市大学)

AI总结 针对预训练文本到图像扩散模型的适应(概念定制或遗忘),提出DriftScope诊断工具,通过稀疏自编码器和零样本分类揭示模型权重修改导致语义无关概念系统性漂移,FID/KID无法早期检测,而特定类别零样本准确率下降高达18.9点。

Comments 22 pages, 5 figures, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00176 2026-07-02 cs.CV 新提交

PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment

PRISM-VO:使用光度全光集束调整的尺度感知视觉里程计

Aymeric Fleith, Julian Zirbel, Daniel Cremers, Niclas Zeller

机构 * Technical University of Munich(慕尼黑工业大学) Karlsruhe University of Applied Sciences(卡尔斯鲁厄应用科学大学)

AI总结 提出PRISM-VO,一种基于光度全光集束调整的纯优化稀疏光度视觉里程计,通过联合优化相机位姿和逆深度,实现精确的度量尺度重建,避免单目SLAM的尺度模糊。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00157 2026-07-02 cs.CV 新提交

Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video

渐进式姿态引导的单目视频4D动物重建

Siyuan Li, Weiying Chen, Yilin Wang, Xinxin Zuo, Xingyu Li, Li Cheng

机构 * University of Alberta(阿尔伯塔大学) Concordia University(康科迪亚大学)

AI总结 提出一种基于3D高斯溅射的渐进式测试时优化框架,通过解耦关节姿态与非刚性变形,实现从单目视频高保真重建4D动物,在多种物种上优于现有方法。

Comments Accepted to ECCV 2026. Camera-ready author version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00144 2026-07-02 cs.CV cs.AI cs.LG 新提交

A Mechanism-Driven Theory of Phase Transitions in Active Learning

主动学习中相变的一种机制驱动理论

Julia Machnio, Mads Nielsen, Mostafa Mehdipour Ghazi

机构 * Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心)

AI总结 通过将预算制度重新解释为泛化主导机制的转变,提出了一种三阶段分类(数据驱动、过渡、模型驱动),并利用可测量代理和分段回归识别,解释了不同策略在不同阶段的有效性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00124 2026-07-02 cs.CV 新提交

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

分割,快与慢:双路径处理的实时开放词汇视频实例分割

Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

机构 * Google TU Munich(谷歌慕尼黑分校) Munich Center for Machine Learning University of Modena(慕尼黑机器学习中心莫德纳大学)

AI总结 提出SegFS双流快慢框架,通过稀疏关键帧的开放词汇对象模型预测实例表示,并在特征空间条件化轻量快速网络,实现高效时域传播,在保持分割性能的同时将延迟降低至MOBIUS的1/14。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00090 2026-07-02 cs.CV cs.AI 新提交

Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition

迷失在尾部:解决城市视觉地点识别中的地理不平衡问题

Zhiyao Shu, Jiacheng Yang, Yang Lu, Waishan Qiu, Chuan Li, Da Chen

机构 * George Mason University(乔治梅森大学) Xiamen University(厦门大学) University of Hong Kong(香港大学) Lambda University of Bath(巴斯大学)

AI总结 针对城市级视觉地点识别中数据长尾分布导致模型偏向频繁拍摄区域的问题,提出分布感知地点识别(DAPR)框架,通过重平衡梯度贡献和多尺度距离搜索机制,在SF-XL等基准上显著提升性能。

Comments Accepted to ECCV 2026, 28 pages including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00465 2026-07-02 cs.CV cs.CL cs.LG 新提交

StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning

StochasT:基于随机轮次深度的视觉指令微调学习

Yuan Qing, Chengzhi Mao, Boqing Gong

机构 * Boston University(波士顿大学) Rutgers University(罗格斯大学)

AI总结 针对视觉指令微调中多轮训练与单轮测试不匹配的问题,提出StochasT方法,通过随机分组语言任务为不同大小的轮次深度,增强模型在单轮和多轮场景下的鲁棒性。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/StochasT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00374 2026-07-02 cs.CV cs.AI cs.CL cs.IR cs.MM 新提交

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

学习组合:重新审视零样本组合图像检索的代理任务设计

Jingjing Zhang, Lei Zhang, Zheren Fu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出FoCo模型,通过文本锚定的视觉聚合和上下文条件语义补全两个代理任务联合学习组合函数,在零样本组合图像检索中取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00159 2026-07-02 cs.CL cs.CV cs.IR cs.MM 新提交

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强

Qian Ma, S M Rayeed, Charles V. Stewart, Qiong Wu, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。

Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29963 2026-07-02 cs.CV cs.CR 版本更新

Explainability-Aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors

可解释性感知的视锥攻击:揭示基于LiDAR的3D目标检测器中的结构脆弱性

Chengzeng You, Binbin Xu, Soteris Demetriou

机构 * Imperial College London(帝国理工学院伦敦分校)

AI总结 提出可解释性引导的对抗分析方法,通过SALL方法生成通用显著性图,并设计EFA攻击,仅扰动最关键的视锥区域,在KITTI和nuScenes上使检测召回率下降超15个百分点,同时减少25-50%的扰动视锥数。

Comments European Conference on Computer Vision (ECCV), September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29686 2026-07-02 cs.CV 版本更新

PoseShield: Neural Collision Fields for Human Self-Collision Resolution

PoseShield: 用于人体自碰撞解析的神经碰撞场

Zhengyuan Li, Zeyun Deng, Yifan Shen, Liangyan Gui, Miaolan Xie, Joseph Campbell, Xifeng Gao, Kui Wu, Zherong Pan, Aniket Bera

机构 * Purdue University(普渡大学) LightSpeed Studios(LightSpeed工作室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对SMPL人体姿态估计中的自碰撞问题,提出在姿态空间直接定义神经碰撞约束,通过Eikonal正则化优化求解,实现95.8%的碰撞修复成功率。

Comments ECCV 2026. Code: https://github.com/lzhyu/PoseShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31225 2026-07-02 cs.MM 新提交

A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR

神经形态OT-CFM在多说话人VSR中的首次探索

Lin Chen, Jingping Fang, Hairui Liu, Chenyang Xu, Junhao Chen, Xiaorui Li, Weidong Cai, Xiaoming Chen

AI总结 提出LipsFlow框架,利用神经形态事件流和最优传输条件流匹配,在复杂多说话人场景下实现高鲁棒性和低延迟的视觉语音识别,达到22.3%词错误率和240毫秒延迟。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31077 2026-07-02 cs.CV 新提交

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配

Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院)

AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-07-02 cs.CV 新提交

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: https://xiaomeng-yang.github.io/Prompt2Effect

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06714 2026-07-02 cs.CV 新提交

Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

锚定而非分级:视觉-语言模型在纹理倾斜感知中失败

Qian Zhang, Michal Golovanevsky, Fulvio Domini, James Tompkin

机构 * Brown University(布朗大学) Harvard University(哈佛大学)

AI总结 研究视觉-语言模型(VLM)在纹理倾斜感知任务中的表现,发现零样本和上下文提示均产生锚定失败,仅预测少数离散角度,监督微调部分缓解但残留锚定,表明问题在于表示到输出的语言接口无法分级表达。

Comments 15 pages. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11689 2026-07-02 cs.AI 版本更新

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型

Mei Chee Leong, Ying Gu, Hui Li Tan, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Singapore(新加坡)

AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12165 2026-07-02 cs.CV 版本更新

Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video

利用被动场景声音和真实世界视频进行音频-视觉相机姿态估计

Daniel Adebi, Sagnik Majumder, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出一种结合方向到达谱和双耳嵌入的音频-视觉框架,用于真实世界视频中的相机姿态估计,在视觉信息受损时表现出鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04035 2026-07-02 cs.CV cs.LG 版本更新

Large-Scale High-Quality 3D Gaussian Head Reconstruction from Multi-View Captures

从多视角捕获中大规模高质量3D高斯头部重建

Evangelos Ntavelis, Sean Wu, Mohamad Shahbazi, Fabio Maninchedda, Dmitry Kostiaev, Artem Sevastopolsky, Vittorio Megaro, Trevor Phillips, Alejandro Blumentals, Shridhar Ravikumar, Mehak Gupta, Reinhard Knothe, Jeronimo Bayer, Matthias Vestner, Simon Schaefer, Thomas Etterlin, Christian Zimmermann, Alexey Artemov, Mathias Deschler, Peter Kaufmann, Stefan Brugger, Sebastian Martin, Brian Amberg, Tom Runia

机构 * Apple(苹果公司)

AI总结 HeadsUp通过高效编码器-解码器架构实现大规模多视角捕获下高质量3D高斯头部重建,利用UV参数化高斯体实现与输入图像数量和分辨率解耦,支持高分辨率输入图像训练,取得最佳重建质量并能泛化到新身份。

Comments Accepted to ECCV 2026. Project website: https://apple.github.io/ml-headsup/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00271 2026-07-02 cs.CV cs.AI cs.RO 版本更新

REALM: An RGB- and Event-Aligned Latent Manifold for Cross-Modal Perception

REALM:一种RGB和事件对齐的潜在流形用于跨模态感知

Vincenzo Polizzi, David B. Lindell, Jonathan Kelly

机构 * University of Toronto, Robotics Institute(多伦多大学机器人研究所) University of Toronto, Department of Computer Science(多伦多大学计算机科学系)

AI总结 REALM通过将事件表示投影到预训练的RGB基础模型潜在空间,实现跨模态感知,利用LoRA技术解锁冻结RGB主干的几何和语义先验,实现零样本应用复杂解码器。

Comments Accepted to the European Conference on Computer Vision (ECCV), Malmö, SE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏