arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-06-30 至 2026-06-30 共收录 98
2606.30598 2026-06-30 cs.CV

Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation

面向野外场景的自我中心3D手-物体姿态估计

Siddhant Bansal, Zhifan Zhu, Shashank Tripathi, Jiahe Zhao, Michael J. Black, Dima Damen

机构 * University of Bristol(布里斯托大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)

AI总结 针对野外自我中心RGB图像中手-物体姿态估计的遮挡和接触模糊问题,提出EPIC-Contact数据集和HOPformer端到端Transformer模型,联合预测双手和物体姿态,在ARCTIC和EPIC-Contact上显著提升成功率并降低接触偏差。

Comments Accepted at ECCV 2026; Project Page: https://sid2697.github.io/epic-contact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30557 2026-06-30 cs.CV

EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics

EcoVideo: 云边动态中的熵编排视频生成范式

Jiayu Chen, Hengyi Zhang, Maoliang Li, Minyu Li, Zihao Zheng, Xuanzhe Liu, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University, China(北京大学计算机科学学院,中国) State Key Lab of Multimedia Information Processing, Peking University, China(北京大学多媒体信息处理国家重点实验室,中国) International School, Beijing University of Posts and Telecommunications, China(北京邮电大学国际学院,中国) School of Information Science and Technology, Beijing Forestry University, China(北京林业大学信息科学与技术学院,中国)

AI总结 提出EcoVideo框架,利用自注意力熵进行无训练帧选择,云大模型去噪关键帧,边轻量模型插值重建,自适应调整预算和深度,实现2.9倍端到端加速。

Comments EcoVideo is honored to be accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30498 2026-06-30 cs.CV cs.AI

On the Faithfulness of Post-Hoc Concept Bottleneck Models

事后概念瓶颈模型的忠实性研究

Laines Schmalwasser, Jan Blunk, Niklas Penzel, Julia Niebling, Joachim Denzler

机构 * Institute of Data Science, German Aerospace Center(数据科学研究所,德国航空航天中心) Computer Vision Group Jena, Friedrich Schiller University Jena(贾恩计算机视觉小组,弗里德里希·席勒大学贾恩) GEOMAR Helmholtz Centre for Ocean Research Kiel(基尔海洋研究赫尔姆霍茨中心)

AI总结 本文分析事后概念瓶颈模型(post-hoc CBMs)中概念投影的失败案例,提出新指标解耦概念忠实性与预测准确性,揭示标准准确率评估无法检测的不忠实行为。

Comments Accepted at ECCV 2026, 41 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30492 2026-06-30 cs.CV

RBE-Flow: Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration

RBE-Flow:基于特征流形的递归贝叶斯估计用于跨模态配准

Mengzhu Ding, Xin Song, Xiaoke Ding, Hongwei Ding, Xuecong Liu

机构 * Northeastern University, China(东北大学)

AI总结 针对跨模态图像配准中非线性辐射差异和几何畸变导致的优化困难,提出RBE-Flow框架,将密集流估计重构为特征流形上的闭环递归贝叶斯估计,通过递归流形优化和不确定性自适应概率更新实现自校正,在多个基准上取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30476 2026-06-30 cs.CV cs.RO eess.IV

PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking

PS-MOT: 从点种子培育实例意识用于多目标跟踪

Kai Luo, Fei Teng, Mengfei Duan, Wanjun Jia, Xu Wang, Hao Shi, Kunyu Peng, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Karlsruhe Institute of Technology(卡尔斯鲁厄大学)

AI总结 提出PS-MOT,一种点监督多目标跟踪方法,通过层次化流水线(数据级TFP、模型级PEWA、损失级UGL)解决空间模糊和身份漂移问题,在多个数据集上达到新最优。

Comments Accepted to ECCV 2026. The source code is available at https://github.com/xifen523/PS-MOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30474 2026-06-30 cs.RO

Grasp-Oriented Non-Prehensile Manipulation via Learning a Graspability Field

基于抓取能力场学习的面向抓取的非抓取操作

Licheng Zhong, Gim Hee Lee

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

AI总结 提出通过学习物体配置的抓取能力场,将非抓取操作优化为最大化抓取成功概率,而非达到预设位姿,实现闭环操作到抓取的单一策略。

Comments European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30360 2026-06-30 cs.LG cs.CV

On the Vulnerability of Parameter-Level Defenses to Model Merging

参数级防御对模型合并的脆弱性

Kuangpu Guo, Qingyan Zheng, Jian Liang, Yongcan Yu, Zilei Wang, Ran He, Tieniu Tan

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所国家工程实验室及机器智能研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文揭示参数级防御因保护任务向量幅度小而失效,提出锚点引导攻击(AGA)通过预训练模型恢复变换矩阵,并设计锚点排斥微调(ARF)作为防御。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30355 2026-06-30 cs.CV cs.AI

Residual-Guided Expert Specialization for Incomplete Multimodal Learning

残差引导的专家特化用于不完整多模态学习

Seunghun Baek, Jihwan Park, Jaeyoon Sim, Minjae Jeong, Hoseok Lee, Won Hwa Kim

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

AI总结 提出MARS框架,利用缺失引起的表示偏差引导专家特化,通过残差信号路由样本到对应专家,并引入差异感知噪声正则化缓解训练-测试路由差距,在缺失场景下提升多模态分类与分割性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30288 2026-06-30 cs.CV

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

VisReflect: 用于长视觉上下文中细粒度感知的潜在视觉反射

Xiaoqian Shen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布斯大学)

AI总结 针对长视觉上下文中细粒度感知的挑战,提出VisReflect框架,通过潜在空间中的连续视觉反射选择性强调相关区域,无需显式定位或额外前向传播,在图像和视频基准上分别提升4.1%和1.8%,并减少约44%推理时间。

Comments Accepted to ECCV 2026; Project page: https://xiaoqian-shen.github.io/VisReflect

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30262 2026-06-30 cs.CV

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

中间文本表示引导的文本到图像生成以增强唯一性对齐

Soyoun Won, Aryan Yazdan Parast, Basim Azam, Jean Honorio, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学)

AI总结 针对文本到图像扩散模型在生成唯一性对象时因概念关联偏差导致对齐失败的问题,提出中间文本表示引导扩散方法,无需额外训练即可恢复被抑制的概念,在OAO-AttackBench上VQAScore提升高达19.1个百分点。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30215 2026-06-30 cs.CV cs.AI

Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion

高效RGB-T目标检测通过稀疏跨模态融合

Chao Tian, Zikun Zhou, Chao Yang, Guoqing Zhu, Zhenyu He

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 提出稀疏融合机制,先快速扫描图像识别候选区域,再对稀疏候选进行特征融合,实现高效RGB-T目标检测,在降低计算成本的同时保持高精度。

Comments Accepted by ECCV-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30124 2026-06-30 cs.CV

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

SciIR:面向科学图像推理生成的大规模训练数据集与基准

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)

AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30045 2026-06-30 cs.CV

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

行走于隐空间:通过神经场景表示进行交互式世界探索

Zhiqi Li, Chengrui Dong, Zhenhua Du, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Dongxu Wei, Peidong Liu

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Afari Intelligent Drive(Afari智能驾驶)

AI总结 提出以场景为中心的交互式视频生成范式,将生成变量从帧隐变量改为可渲染的固定长度隐状态(神经隐式场景),通过紧凑场景状态随机转移和确定性姿态条件渲染实现长程一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30030 2026-06-30 cs.CV

CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion

CogSENet: 基于模糊条件语义路由和显式频率融合的盲图像去模糊

Pan Wang, Yihao Hu, Xiujin Liu

机构 * University of Science and Technology of China(中国科学技术大学) Westlake University(西交大学) University of Michigan(密歇根大学)

AI总结 提出CogSENet,通过模拟鹰视觉系统的语义驱动状态空间模块和双频融合块,实现空间变化模糊下的自适应恢复,在去模糊、去雾、去雨和去噪任务上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30019 2026-06-30 cs.CV

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30017 2026-06-30 cs.CV

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

移动端3D高斯泼溅的蒙特卡洛能量聚合

Xiaobiao Du, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Xin Yu

机构 * University of Technology Sydney(悉尼技术大学) Baidu Inc.(百度公司) Australian Institute for Machine Learning(澳大利亚机器学习研究所)

AI总结 针对移动端3D高斯泼溅中高阶球谐函数带来的计算和存储开销问题,提出Flux-GS方法,通过蒙特卡洛能量聚合和属性条件增强模块实现低阶表示下的高质量渲染,并采用多视图密度控制减少冗余高斯体。

Comments ECCV 2026, Project Page:https://xiaobiaodu.github.io/flux-gs-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30012 2026-06-30 cs.CV

SkelEM: Training-Signal Decoupling of Skeleton and Diffusion for Self-supervised Axial Super-Resolution in Volume Microscopy

SkelEM:用于体积显微镜中自监督轴向超分辨率的骨架与扩散训练信号解耦

Bohao Chen, Yanchao Zhang, Yanan Lv, Chenxun Deng, Hua Han, Xi Chen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, China(中国科学院大学先进交叉学科学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, China(中国科学院脑认知与脑启发智能技术国家重点实验室) School of Future Technology, University of Chinese Academy of Sciences, China(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院)

AI总结 提出SkelEM框架,通过解耦低频拓扑与高频细节的训练信号,结合确定性骨架与扩散精炼器,实现体积显微镜自监督轴向超分辨率,仅需≤5步即可恢复高保真细节,并在新基准BRAVE-ASR上取得最优平衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30003 2026-06-30 cs.CV

GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising

GeoEdit: 基于几何感知的双分支去噪对象编辑

Yi He, Jiangming Wang, Xinyu Wang, Mark Fong, Songchun Zhang, Yuxuan Xue, Hai-Tao Zheng, Yue Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Peking University(北京大学) HKUST(香港科技大学) University of Tübingen(图宾根大学)

AI总结 提出GeoEdit,一种无需训练的三阶段管道,通过3D解耦、点对应对齐和双分支去噪,实现单张照片中对象的刚性几何变换(平移、旋转、缩放),同时保持背景自然和身份一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30001 2026-06-30 cs.CV cs.GR cs.HC cs.SD

SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset

SICAGE: 使用TED4C-L数据集的说话人无关文化感知手势生成

Ariel Gjaci, Antonio Sgorbissa, Vittorio Murino

机构 * Italian Institute of Technology(意大利理工学院) University of Genoa(热那亚大学)

AI总结 提出SICAGE框架,通过域泛化学习说话人无关的文化表征,结合ALaDiT扩散模型生成文化适切手势,在TED4C-L数据集上验证了运动真实性、多样性和文化一致性提升。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29952 2026-06-30 cs.LG cs.AI cs.CV

Exploiting Local Flatness for Efficient Out-of-Distribution Detection

利用局部平坦性进行高效分布外检测

Seonghwan Park, Hyunji Jung, Dongyeop Lee, Namhoon Lee

机构 * Korea Electronics Technology Institute (KETI)(韩国电子技术研究所) Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)

AI总结 提出Fold方法,利用特征Hessian和部分特征归一化,通过局部平坦性差异高效检测分布外数据,并引入AutoFold自动校准,在保持计算效率的同时提升检测性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29941 2026-06-30 cs.RO cs.CV

Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation

从运动感知触觉:一种具有触觉运动相关性的统一模态感知视觉-触觉策略

Shengqi Xu, Guojin Zhong, Yang Liu, Fanjie Wang, Hu Luo, Hanyu Zhou, Weiyao Zhang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

AI总结 提出基于触觉运动相关性的运动感知触觉表示,并利用混合Transformer架构实现统一模态感知的视觉-触觉策略,以解决接触丰富操作中的感知模糊和跨模态融合问题。

Comments Accepted by ECCV 2026. Project website: https://shengqi77.github.io/Seeing-Touch-from-Motion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29908 2026-06-30 cs.RO cs.AI

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation

沉思之道:面向具身导航的空间感知世界动作模型

Hong Chen, Daqi Liu, Zehan Zhang, Haiguang Wang, Tianhao Lu, Longfei Yan, Haiyang Sun, Fangzhen Li, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Yihua Tan

AI总结 提出SWAM,一种任务中心联合观测-动作生成框架,通过单次推理同时生成中间RGB-D序列和对应动作轨迹,解决现有世界模型规划器依赖候选、计算开销大和动作-视觉不一致的问题,在成功率、轨迹精度和推理效率上显著超越两阶段方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29880 2026-06-30 cs.CV

IREU: Identity-Related Encoder-Only Unlearning for Customized Portrait Generation

IREU:面向定制肖像生成的基于身份的仅编码器遗忘

Chaoyi Shi, Shanshan Zhang, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学PCA实验室) PCA Lab, School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学PCA实验室)

AI总结 针对定制肖像生成中的隐私风险,提出IREU方法,通过离线定位身份相关特征并仅扰动这些特征来实现身份遗忘,同时保持其他身份的高保真度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29847 2026-06-30 cs.CV

See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs

仅在需要时看:用于缓解LVLM中幻觉的上下文感知注意力干预

Yuqing Lei, Wenbo Lyu, Yingjun Du, Xiantong Zhen, Cees G. M. Snoek, Ling Shao

机构 * University of Chinese Academy of Sciences(中国科学院大学) University of Amsterdam(阿姆斯特丹大学) United Imaging Healthcare Co., Ltd.(联合影像医疗科技股份有限公司)

AI总结 提出训练自由的上下文感知注意力干预(CAI),通过两轴选择性(看哪里和何时干预)在解码时针对性增强视觉 grounding,有效缓解物体幻觉并保持语言流畅性。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29794 2026-06-30 cs.CV

UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras

UniTriSplat:统一球面光栅化的通用相机3D高斯泼溅框架

Yipeng Zhu, Huajian Huang, Tristan Braud, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 针对现有3DGS框架依赖相机特定光栅化导致跨相机模型性能下降的问题,提出UniTriSplat,利用HEALPix离散化在单位球面上统一高斯泼溅,实现从窄视场到全景的一致优化。

Comments 32 pages, 14 figures, 6 tables. Project page: https://yipengzhu0809.github.io/UniTriSplat/ . UniTriSplat was accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29786 2026-06-30 cs.CV cs.RO

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成

Yirum Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29600 2026-06-30 cs.CV cs.AI

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

一场景,两深度:探究单目基础模型中的几何歧义性

Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang

机构 * University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Vanderbilt University(范德比大学)

AI总结 本文提出稀疏双层序数基准MD-3k,用于测量单目深度基础模型的深度层偏好和多层空间关系准确性,发现不同模型对同一分层几何结构有不同解析,且拉普拉斯视觉提示可改变冻结模型的输出层。

Comments 49 pages, 25 figures; Accepted by European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29579 2026-06-30 cs.CV cs.AI cs.LG cs.MM

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models

ScAle: 注意力头缩放作为视觉语言模型中空间推理的最小适配器

Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Zhejiang University(浙江大学)

AI总结 提出ScAle,一种超轻量适配方法,通过学习少量标量系数调节冻结骨干网络中的注意力头和MLP激活,仅用1K可训练参数在空间推理任务上实现高达134.1%的相对精度提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29531 2026-06-30 cs.CV cs.AI

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos

MotionAtlas: 面向运动中心视频的详细区域描述

Weisong Liu, Haochen Wang, Kuan Gao, Yuhao Wang, Yikang Zhou, Zhongwei Ren, Jacky Mai, Anna Wang, Yanwei Li, Jason Li, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Wuhan University(武汉大学) Beijing Jiaotong University(北京交通大学)

AI总结 提出MotionAtlas系统,通过区域感知运动描述、自举精炼数据管道和定制训练策略,在运动中心视频描述中显著提升细粒度理解,超越现有模型。

Comments Accepted to ECCV 2026. Project page: https://kagura-0001.github.io/projects/MotionAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29501 2026-06-30 cs.RO

Learning Transferable Dynamics Priors from Action to World Modeling

从动作到世界建模的可迁移动力学先验学习

Ze Huang, Jiahui Zhang, Hairuo Liu, Chenxi Zhang, Ran Cheng, Li Zhang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) McGill University, Montreal, QC, Canada(麦吉尔大学,蒙特利尔,魁北克,加拿大)

AI总结 提出A2World模型,通过大规模机器人操作数据预训练动作条件世界模型,学习可迁移的交互动力学先验,支持模拟器评估和策略学习。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏