arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 4781
2607.15806 2026-07-20 cs.CV 新提交

HybridSim: A Physics-Learning Hybrid Digital Twin for mmWave Human Sensing

HybridSim:用于毫米波人体感知的物理学习混合数字孪生

Weitao Xiong, Tianyu Liu, Peng Li, Kok Chung Chua, Toa Chean Khim, Pu Wang, Hongfei Xue

机构 * Xiamen University Malaysia(厦门大学马来西亚分校) The Hong Kong University of Science and Technology(香港科技大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 研究针对毫米波雷达信号模拟成本高问题,提出HybridSim混合模拟器,用三平面和图卷积网络等提取人体特征、稳定优化,通过逆渲染等建模信号路径,实验显示其能有效增强特定地点数据,提升人体感知任务表现。

Comments Accepted to ECCV 2026. Project Page: https://weitao-xiong.github.io/HybridSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15699 2026-07-20 cs.CV 新提交

GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking

GoStop:基于强化学习的事件驱动特征跟踪中的自适应时间聚合

Youngho Kim, Hoonhee Cho, Jae-Young Kang, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 研究基于事件相机的特征跟踪问题,提出用强化学习框架自适应控制事件累积过程,训练智能体依运动线索决策,引入新数据集评估,集成该框架到现有方法可提升性能,在动态运动下更具鲁棒性且平衡跟踪精度与效率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15652 2026-07-20 cs.CV 新提交

CSS-BA: Gate-Guided Column Space Search for Bundle Adjustment

CSS-BA:用于光束法平差的门控列空间搜索

Ayano Kaneda, Takafumi Taketomi, Shugo Yamaguchi, Shigeo Morishima

机构 * Waseda University(早稻田大学) CyberAgent, Inc.(株式会社CyberAgent)

AI总结 针对低视差和近旋转情况下传统BA法病态问题,提出门控引导的CSS-BA,通过结合CSS和几何感知门控稳定舒尔-LM更新,所有参数保留在优化中,仅限制更新方向,实验显示其优化稳定、姿态精度提高且校准有竞争力。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15491 2026-07-20 cs.CV 新提交

Trajectory-aware Cross-view Geo-localization with Sequential Observations

基于序列观测的轨迹感知跨视角地理定位

Tianyi Gao, Jiayu Lin, Danielle Beaulieu, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 研究跨视角地理定位,提出TrajLoc统一框架处理视频片段和路线描述,利用视觉与语言语义相互强化匹配,还提出TrajMod模块,实验显示该框架在视频和文本地理定位上比现有方法有显著优势。

Comments Accepted to ECCV 2026. Project Page: https://humblegamer.github.io/trajloc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12262 2026-07-20 cs.CV 版本更新

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

视频流思考:VideoLLMs可以同时观看和思考

Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus Xiaomi Inc.(小米公司)

AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。

Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13636 2026-07-20 cs.CV cs.RO 版本更新

MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning

MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型

Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。

Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14976 2026-07-17 cs.CV 新提交

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

从带草稿到无草稿:通过特权蒸馏和快速植入实现一步视频对象移除

Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

AI总结 研究视频对象移除问题,提出D2DF框架,通过特权蒸馏和自引导快速植入模块,将教师模型多步细化能力提炼到学生模型,实现一步视频对象移除,在质量和效率上优于传统及多步生成方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14927 2026-07-17 cs.CV 新提交

TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization

TanGO:通过切线空间引导和优化实现免训练3D编辑

Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo, Hyeonseo Yun, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Chung-Ang University(中央大学)

AI总结 研究针对3D生成模型免训练编辑存在语义伪影的问题,提出TanGO框架,通过在切线空间自适应逐令牌引导,制定最优控制规则并确定控制信号强度,减少结构伪影,性能优于现有基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14737 2026-07-17 cs.CV cs.LG 新提交

GeoDetect: Geometric Adversarial Detection for VLPs

GeoDetect:用于视觉语言预训练模型的几何对抗检测

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

AI总结 研究视觉语言预训练模型易受对抗攻击问题,基于其嵌入空间几何结构特点,提出GeoDetect方法,利用几何分数识别对抗样本,经综合评估,该方法能可靠检测多种VLP架构及威胁设置下的对抗样本,提升模型安全性与可靠性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14560 2026-07-17 cs.CV 新提交

Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection

打破长增量3D目标检测中的模型遗忘循环

Peisheng Qian, Jie Xu, Xulei Yang, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Institute for Infocomm Research, A*STAR(资讯通信研究院,新加坡科技研究局)

AI总结 针对长增量3D目标检测中模型易遗忘问题,提出LDMR框架,通过监测训练检查点的类检测质量,驱动类人阶段内回顾和场景感知跨阶段记忆进化机制,有效减轻模型遗忘,性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14334 2026-07-17 cs.CV 新提交

MixCompress: Mixture of Experts for Variable Rate Learned Image Compression

MixCompress:用于可变速率学习图像压缩的专家混合模型

Calvin-Khang Ta, Praneet Singh, Tong Shao, Peng Yin

机构 * Dolby Laboratories(杜比实验室)

AI总结 研究针对学习图像压缩中为各率失真点存独立模型的问题,提出MixCompress框架,用稀疏门控专家混合路由减轻梯度冲突,引入深度混合扩展动态扩模型容量,结合条件辅助变换,有效提升性能,建立新的帕累托前沿。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31456 2026-07-17 cs.LG 版本更新

Zero-Shot Quantization for Object Detectors using Off-the-Shelf Generative Models

利用现成生成模型实现目标检测器的零样本量化

Hyunho Lee, Kyomin Hwang, Hyeonjin Kim, Suyoung Kim, Sunghyun Wee, Nojun Kwak

机构 * Seoul National University(首尔大学) LG Electronics(LG电子)

AI总结 提出GoodQ框架,利用现成生成模型构建训练集,通过信息密集提示、内在分布感知选择和教师引导自适应降噪,解决零样本量化目标检测中的多实例、类别不平衡和伪标签噪声问题,在低比特(W4A4)达到最优性能。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28149 2026-07-17 cs.CV cs.AI 版本更新

Toward Robust In-Context Segmentation via Concept Guidance

通过概念引导实现鲁棒的上下文分割

Zhigang Chen, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

AI总结 提出概念引导的上下文分割(CG-ICS),通过提取参考图像的高层语义概念而非仅依赖低层视觉匹配,结合文本概念与视觉示例,显著提升分割准确性和鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20785 2026-07-17 cs.CV 版本更新

ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

ME-IQA: 通过重新排序增强的记忆图像质量评估

Kanglong Fan, Tianhe Wu, Wen Wen, Jianzhao Liu, Le Yang, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。

Comments Published as a conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22098 2026-07-17 cs.CV 版本更新

WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation

WorldWander:在视频生成中连接自我中心和外中心世界

Quanjian Song, Yiren Song, Kelly Peng, Yuan Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

AI总结 研究聚焦视频生成中自我中心与外中心世界转换,提出WorldWander框架,基于视频扩散变换器,整合上下文视角对齐与协作位置编码,精心策划数据集,实验证明该框架在视角同步、角色一致性和泛化能力上表现卓越,设定了新基准。

Comments Accepted by ECCV 2026; Code: https://github.com/showlab/WorldWander

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13504 2026-07-16 cs.CV 新提交

DP-BOA: Dirichlet-Process Birth-or-Assign for On-the-Fly Category Discovery

DP-BOA:用于实时类别发现的狄利克雷过程出生或分配

Peiyan Gu, Zixin Teng, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

AI总结 研究实时类别发现问题,提出基于在线狄利克雷过程高斯混合模型的DP-BOA框架,通过比较后验预测证据决定样本归属并在线更新统计,在标准OCD基准测试中性能优异,新类别发现能力强且已知类精度有竞争力。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13456 2026-07-16 cs.CV cs.CG cs.GR 新提交

TreeSRNF: Square-Root Normal Fields for Generative Modelling of the Geometric and Structural Variability in Tree-like 3D Objects

TreeSRNF:用于树状3D对象几何和结构变异性生成建模的平方根法向场

Tahmina Khanam, Hamid Laga, Mohammed Bennamoun, Guanjin Wang, Ferdous Sohel, Farid Boussaid, Anuj Srivastava

机构 * Murdoch University(莫道克大学) University of Western Australia(西澳大利亚大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 该研究针对树状3D对象几何与结构变异性问题,将平方根法向场表示推广到此类对象,构建黎曼树状空间及度量,开发相关算法,可计算统计摘要并合成新对象,性能显著优于现有技术。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13421 2026-07-16 cs.CV cs.AI 新提交

ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding

ScanFocus:一种用于时空视频定位的从粗到细框架

Kai Chen, Ming Dai, Wenxuan Cheng, Wankou Yang

机构 * Southeast University(东南大学)

AI总结 研究时空视频定位问题,提出ScanFocus从粗到细框架,利用统一融合编码器和轻量级模块生成粗略提议,再用语义引导时间聚合器恢复细节,实验表明该方法性能优于以往方法。

Comments this paper has already been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13365 2026-07-16 cs.CV 新提交

DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation

DiffGI:用于高保真薄壳3D生成的可微几何图像

Eungjune Shim, Hansol Lee, Eunjung Ju

机构 * CLO Virtual Fashion Inc.(CLO虚拟时尚公司)

AI总结 DiffGI针对现有3D生成模型问题,提出端到端3D到2D映射框架,用连续函数取代二进制图,引入可微算法,训练相关模型,在薄壳3D生成中实现高保真、高精度,减少计算资源需求。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13336 2026-07-16 cs.CV cs.CR cs.LG 新提交

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization

深入探讨统一视频保护在图像到视频和基于微调的定制方面的时间挑战

Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

机构 * The University of Sydney(悉尼大学) University of Melbourne(墨尔本大学) City University of Hong Kong(香港城市大学) Wuhan University(武汉大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 研究针对基于扩散模型的视频定制引发的隐私等保护问题,提出TC-UAP方法,通过优化身份级多帧UAP并引入相关时间建模和损失,使其在时间上一致且鲁棒,在多种视频定制及攻击下实现强身份保护。

Comments This work provides a basis for the ECCV 2026 LifeGenIP Challenge on Unlearnable Videos against Diffusion-based Customization. Challenge page: https://lifegenip.cc/competition. Evaluation code: ECCV26_LifeGenIP_starting_kit" target="_blank" rel="noopener">https://github.com/tmllab/ECCV26_LifeGenIP_starting_kit. Project page: https://saythe17.github.io/TC-UAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13265 2026-07-16 cs.CV 新提交

Differentiable Polarized Path Tracing

可微偏振路径追踪

Pramod Rao, Jérémy Riviere, Xilong Zhou, Abhijeet Ghosh, Abhimitra Meka, Thabo Beeler, Marc Habermann, Christian Theobalt, Delio Vicini

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔兰信息学园区) VIA Research Center(VIA研究中心) Google(谷歌)

AI总结 研究逆渲染问题,提出偏振感知的可微路径追踪方法,通过路径重放和局部缓存组合估计无偏梯度,能在复杂场景中高效稳定优化材质和光照参数,拓宽基于物理的逆渲染适用性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11588 2026-07-16 cs.CV 版本更新

FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry

FoundationGeo:学习用于单目度量几何的空间逐像素场

Muxin Liu, Xiaoyang Lyu, Tianhe Ren, Peng Dai, Xiaoshan Wu, Zhiyue Zhang, Jiaqi Zhang, Jiehong Lin, Shaoshuai Shi, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Voyager Research, DiDi Chuxing(滴滴出行探索研究院)

AI总结 FoundationGeo是两阶段框架,第一阶段学习高保真几何模型,第二阶段引入校准场生成3D点图。它还解决相机固有覆盖问题,通过合成数据提高鲁棒性。在多基准零射击评估中,该方法增强跨域鲁棒性,性能优于其他基线。

Comments Accepted to ECCV 2026. Project page: https://mx-liu6.github.io/FoundationGeo-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06405 2026-07-16 cs.MM cs.SD 版本更新

Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

在潜在空间中通过跨模态对齐实现精确的视频到音频生成

Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran, Long-Khanh Pham, Paarth Neekhara, Shehzeen Hussain, Van Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) NVIDIA Corporation(NVIDIA公司)

AI总结 研究视频到音频生成问题,提出Flowley架构,结合视觉特征与文本提示,通过渐进软掩码交叉注意力实现视听同步,无额外计算成本,还提出SoundCap字幕,该方法在多个指标及零样本音频质量上达先进水平。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30248 2026-07-16 cs.CV cs.LG 版本更新

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成

Shihao Zhang, Yunzhi Li, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

机构 * Huawei Central Research Institute(华为中央研究院) Guangdong University of Technology(广东技术大学)

AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09246 2026-07-16 cs.CV 版本更新

SOMA: From Surface Observations to Muscle Anatomy

SOMA:从表面观察到肌肉解剖

Eduardo Alvarado, Emily Kim, Gerrit Nolte, Friedemann Runte, Mario Botsch, Marc Habermann, Christian Theobalt

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区) TU Dortmund University(多特蒙德工业大学)

AI总结 提出SOMA模型,从多视角RGB相机获取的表面信号推断时空肌肉行为,并构建SKIM数据集,首次实现从多视角RGB数据恢复肌肉变形,提供可扩展的低成本解剖动画方案。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06614 2026-07-16 cs.CV cs.LG 版本更新

Holistic Optimal Label Selection for Robust Prompt Learning under Partial Labels

整体最优标签选择用于在部分标签下的鲁棒提示学习

Yaqi Zhao, Haoliang Sun, Yating Wang, Yongshun Gong, Yilong Yin

机构 * Shandong University, Jinan, China(山东大学(济南,中国))

AI总结 本文提出Holistic Optimal Label Selection方法,通过局部密度过滤和全局最优传输策略,提升部分标签下的提示学习性能,实验表明其在八个基准数据集上表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14604 2026-07-16 cs.RO cs.CV cs.LG 版本更新

Tactile Modality Fusion for Vision-Language-Action Models

触觉模态融合用于视觉-语言-动作模型

Charlotte Morissette, Amin Abyaneh, Wei-Di Chang, Anas Houssaini, David Meger, Hsiu-Chin Lin, Jonathan Tremblay, Gregory Dudek

AI总结 本文提出TacFiLM,一种轻量级模态融合方法,将视觉-触觉信号整合到视觉-语言-动作(VLA)模型中。通过特征级线性调制(FiLM)对中间视觉特征进行条件化,提升接触丰富操作行为的性能。

Comments Accepted to the European Conference on Computer Vision (ECCV), 2026, 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏