arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1048 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1048 篇

2605.14531 2026-06-09 cs.CL 版本更新 57%

Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space

语言生成作为最优控制:潜在控制空间中的闭环扩散

ZiYi Dong, Yuliang Huang, Weijian Deng, Xiangyang Ji, Liang Lin, Pengxu Wei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文将语言生成重新表述为随机最优控制问题,通过统一理论视角分析自回归和扩散模型,解释其局限性,并提出基于流匹配的闭环控制器实现高效文本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11212 2026-06-09 cs.CL 版本更新 57%

ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

ReVision:通过时间视觉冗余减少扩展计算机使用代理

Amirhossein Abaskohi, Yuhang He, Peter West, Giuseppe Carenini, Pranit Chawla, Vibhav Vineet

机构 * University of British Columbia(不列颠哥伦比亚大学) Microsoft Research(微软研究院)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 ReVision通过去除冗余视觉片段,减少token使用并提升成功率,使代理能处理更长轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24762 2026-06-09 cs.LG 版本更新 57%

In-Context Learning of Temporal Point Processes with Foundation Inference Models

基于基础推理模型的时间点过程上下文学习

David Berghaus, Patrick Seifner, Kostadin Cvejoski, César Ojeda, Ramsés J. Sánchez

机构 * Lamarr Institute(拉马尔研究所) Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) University of Bonn(波恩大学) JetBrains Research(JetBrains研究) University of Potsdam(波恩大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 提出一种基于摊销推理和上下文学习的点过程基础推理模型FIM-PP,通过大规模合成数据预训练,无需额外训练即可估计真实MTPP,或快速微调至目标系统。

Comments This paper is published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08733 2026-06-09 cs.LG 版本更新 57%

Foundation Inference Models for Ordinary Differential Equations

常微分方程的基础推理模型

Maximilian Mauel, Johannes R. Hübers, David Berghaus, Patrick Seifner, Ramses J. Sanchez

机构 * University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 提出FIM-ODE,一种预训练的基础推理模型,通过单次前向传播从含噪轨迹直接预测向量场,实现零样本性能匹配并超越ODEFormer,微调后优于现代神经和GP基线。

Comments Published in ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17868 2026-06-09 cs.LG math.OC 版本更新 57%

SpectraLDS: Provable Distillation for Linear Dynamical Systems

SpectraLDS:线性动力系统的可证明蒸馏

Devan Shah, Shlomo Fortgang, Sofiia Druchyna, Elad Hazan

机构 * Computer Science Department, Princeton University(普林斯顿大学计算机科学系) Google DeepMind Princeton(谷歌DeepMind普林斯顿)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 提出首个可证明方法识别对称线性动力系统,通过谱变换实现与状态维度无关的精度保证,并实现常数时间和空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08922 2026-06-09 cs.LG stat.ML 版本更新 57%

The Mirrored Influence Hypothesis: Efficient Data Influence Estimation by Harnessing Forward Passes

镜像影响假说:利用前向传播的高效数据影响估计

Myeongseob Ko, Feiyang Kang, Weiyan Shi, Ming Jin, Zhou Yu, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 提出镜像影响假说,将训练数据对测试预测的影响转化为逆问题,通过测试样本梯度加训练样本前向传播高效估计数据影响,显著提升效率。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19100 2026-06-08 cs.AI 版本更新 57%

LuMamba: Latent Unified Mamba for Electrode Topology-Invariant and Efficient EEG Modeling

LuMamba: 用于电极拓扑不变且高效的EEG建模的潜在统一Mamba

Danaé Broustail, Anna Tegon, Thorir Mar Ingolfsson, Yawei Li, Luca Benini

机构 * ETH Zürich, Institute of Information Systems(苏黎世联邦理工学院信息系统研究所)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 提出LuMamba框架,结合拓扑不变编码和线性复杂度状态空间模型,通过LUNA的查询交叉注意力机制统一通道,FEMBA的双向Mamba块高效时序建模,在5个下游任务上以4.6M参数达到SOTA性能。

Comments EUSIPCO 2026, 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05363 2026-06-08 cs.AI 版本更新 57%

MHA-RAG: Improving Efficiency, Accuracy, and Consistency by Encoding Exemplars as Soft Prompts

MHA-RAG:通过将示例编码为软提示来提高效率、准确性和一致性

Abhinav Jain, Xinyu Yao, Thomas Reps, Christopher Jermaine

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Department of Computer Science, University of Wisconsin–Madison(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 提出MHA-RAG框架,将领域示例编码为软提示,通过多头注意力机制控制生成,在多个问答基准上相比标准RAG提升20点性能,同时降低10倍推理成本。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10318 2026-06-08 cs.LG 版本更新 57%

pTNAS: Progressive Neural Architecture Search for Tabular Data

pTNAS: 面向表格数据的渐进式神经架构搜索

Naili Xing, Shaofeng Cai, Lingze Zeng, Jiaqi Zhu, Peng Lu, Jian Pei, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 提出首个针对表格数据的渐进式神经架构搜索方法pTNAS,采用过滤-精炼优化策略,结合零成本代理和固定预算调度算法,实现架构快速识别与性能持续提升,相比其他NAS方法加速高达82.75倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10466 2026-08-18 cs.CV 版本更新 50%

ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos

ExpertEdit: 从专家视频中学习技能感知的动作编辑

Arjun Somayazulu, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :language model(abstract)

AI总结 ExpertEdit通过无配对专家视频学习技能驱动的动作编辑,无需配对数据或手动指导,提升动作真实感和专家质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18739 2026-08-18 cs.CV 版本更新 50%

EdgeCrafter: Compact ViTs for Edge Dense Prediction via Task-Specialized Distillation

EdgeCrafter: 通过任务专用蒸馏实现边缘密集预测的紧凑ViTs

Longfei Liu, Yongjie Hou, Yang Li, Qirui Wang, Youyang Sha, Yongjun Yu, Yinzhi Wang, Peizhe Ru, Xuanlong Yu, Xi Shen

机构 * Intellindust AI Lab(Intellindust AI实验室)

专题命中 效率与部署 :pretraining(abstract)

AI总结 本文提出EdgeCrafter,一种用于边缘密集预测的紧凑ViT框架,通过任务专用蒸馏和边缘感知设计,在COCO数据集上实现高效准确的检测、实例分割和姿态估计。

Comments Accepted by TMLR 2026. The Objects365 pre-training results have also been updated. Code is available at: https://intellindust-ai-lab.github.io/projects/EdgeCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08024 2026-08-18 cs.CV cs.SE 版本更新 50%

A Highly Efficient Diversity-based Input Selection for DNN Improvement Using VLMs

一种基于多样性的高效输入选择方法用于通过VLMs改进DNN

Amin Abbasishahkoo, Mahboubeh Dadkhah, Lionel Briand

机构 * School of EECS, University of Ottawa(电气与计算机工程系,渥太华大学) Research Ireland Lero centre for software, University of Limerick(软件研究中心,利默里克大学)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出基于概念的多样性(CBD)方法,利用视觉语言模型高效改进DNN,通过混合输入选择策略在大规模数据集上实现高效且有效的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11903 2026-08-17 eess.IV cs.CV cs.MM 版本更新 50%

Learning Perceptual Representations for Gaming NR-VQA with Multi-Task FR Signals

学习用于游戏NR-VQA的多任务FR信号感知表示

Yu-Chih Chen, Michael Wang, Chieh-Dun Wen, Kai-Siang Ma, Avinab Saha, Li-Heng Chen, Alan Bovik

机构 * National Yang Ming Chiao Tung University The University of Texas at Austin Netflix Inc.

专题命中 效率与部署 :pretraining(abstract)

AI总结 本文提出MTL-VQA,通过多任务学习框架利用全参考信号学习感知特征,有效提升游戏视频无参考质量评估的性能。

Comments 6 pages, 2 figures, IEEE ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00237 2026-08-13 cs.CV cs.RO 版本更新 50%

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA(英伟达公司)

专题命中 效率与部署 :language model(abstract)

AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新 50%

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25758 2026-08-13 cs.CV 版本更新 50%

Dual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMs

基于双分布估计的零样本噪声测试时自适应方法

Wenjie Zhu, Yabin Zhang, Liang Xu, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :language model(abstract)

AI总结 针对噪声测试时自适应中分布外异常值问题,提出双分布估计框架,通过无训练的高斯分布建模实现零样本鲁棒自适应。

Comments Accepted by ECCV2026. Project Page:https://zhuwenjie98.github.io/DDE-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-12 cs.ET 版本更新 50%

Scale-CDA: A Scalable Retrofit Platform for Cooperative Driving Automation in Production Vehicles

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14047 2026-08-12 cs.CV cs.AR 版本更新 50%

Evolving Layer-Specific Scalar Functions for Hardware-Aware Transformer Adaptation

进化层特定标量函数用于硬件感知的Transformer适应

Kieran Carrigg, Sigur de Vries, Amirhossein Sadough, Marcel van Gerven

机构 * Department of Machine Learning and Neural Computing(机器学习与神经计算系) Donders Institute for Brain, Cognition, and Behaviour(大脑、认知与行为多纳尔斯研究所)

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出一种高效硬件感知框架,通过遗传编程进化层特定标量函数,避免重新训练,提升Transformer在边缘设备上的性能。

Comments 8 pages, 7 figures. v2: updated GP method (FLOP-based complexity, knee-point selection) and re-run results

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09725 2026-08-12 cs.CV 版本更新 50%

On-Policy Distillation with Best-of-N Teacher Rollout Selection

基于N最佳教师轨迹选择的在线策略蒸馏

Ke Zhang, Yunjie Tian, Dongdi Zhao, Yijiang Li, Yuanye Liu, Vishal M Patel, Di Fu

机构 * Johns Hopkins University(约翰霍普金斯大学) TikTok University of California, San Diego(加州大学圣地亚哥分校) Fudan University(复旦大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出BRTS框架,通过选择更准确且与学生行为一致的教师轨迹提升在线策略蒸馏效果,在AIME和AMC基准测试中取得显著改进。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06009 2026-08-11 cs.CV 版本更新 50%

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

Wan-Animate-2:拓展角色动画的应用边界

Guangyuan Wang, Li Hu, Dechao Meng, Zhongyi Zhang, Peng Zhang, Xindi Zhang, Mingyang Huang, Ruoshi Zhang, Ke Sun, Zhe Zhang, Xingjun Wang, Gang Cheng, Hai Xu, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 效率与部署 :pretraining(abstract)

AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。

Comments Project page: https://humanaigc.github.io/wan-animate-2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27086 2026-08-11 astro-ph.CO astro-ph.IM gr-qc hep-ph 版本更新 50%

Conditional variational autoencoders for cosmological model discrimination and anomaly detection in cosmic microwave background power spectra

用于宇宙学模型区分和宇宙微波背景功率谱异常检测的条件变分自编码器

Tian-Yang Sun, Tian-Nuo Li, He Wang, Jing-Fei Zhang, Xin Zhang

专题命中 效率与部署 :post-training(abstract)

AI总结 该研究提出参数条件变分自编码器(CVAE),可实现宇宙微波背景功率谱的可解释压缩、快速诊断及异常检测,将MCMC运行时间从约40小时缩短至约2分钟,支持超出$\u039b$CDM的宇宙学模型区分。

Comments 22 pages, 18 figures; accepted for publication in Physical Review D

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28443 2026-08-07 cs.RO 版本更新 50%

One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA

单未来,每机器人:采用去中心化JEPA的标签高效集体状态预测

Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov

机构 * ITMO University(ITMO大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 该研究提出CS-JEPA架构,解决群体机器人去中心化共享状态预测问题,在多类场景下提升预测误差、一致性及相关指标,为去中心化群体预测提供标签高效基元。

Comments Submitted to IEEE ICRA 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14907 2026-08-07 cs.CV 版本更新 50%

nnMIL: A generalizable multiple instance learning framework for computational pathology

nnMIL:一种可泛化的计算病理学多实例学习框架

Xiangde Luo, Jinxi Xiang, Yuanfeng Ji, Ruijiang Li

机构 * Department of Radiation Oncology, Stanford University School of Medicine, Stanford, CA, USA(放射肿瘤科,斯坦福大学医学院,斯坦福,CA,USA) Stanford Institute for Human-Centered Artificial Intelligence, Stanford, CA, USA(斯坦福大学人本人工智能研究所,斯坦福,CA,USA)

专题命中 效率与部署 :foundation model(abstract)

AI总结 nnMIL是一种可泛化的计算病理学多实例学习框架,通过斑块与特征级随机采样等技术,在4万张全切片图像的35项临床任务中优于现有方法,实现了病理学基础模型向临床预测的转化。

Comments In this version, we fixed some issues and updated some results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03387 2026-08-06 cs.RO 版本更新 50%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10082 2026-08-06 cs.CV cs.MM cs.RO eess.IV 版本更新 50%

Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation

通过双阶段蒸馏实现无约束事件-图像特征匹配的无标签目标域适应

Zhonghua Yi, Hao Shi, Qi Jiang, Yufan Zhang, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) National University of Defense Technology(国防科技大学) Ant Group(蚂蚁集团)

专题命中 效率与部署 :pretraining(abstract)

AI总结 研究针对无约束事件-图像特征匹配问题,提出双阶段训练范式,先进行无标签蒸馏预训练,再引入极线引导自蒸馏框架,在新的跨模态评估基准上实验,取得领先的姿态估计性能。

Comments Accepted to ACM MM 2026. The source code and benchmark will be made publicly available at https://github.com/ZhonghuaYi/nexus2-official

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15042 2026-08-06 cs.DC cs.OS 版本更新 50%

Determinism-Preserving GPU Spatial Sharing with Vitamin-E

高效GPU空间共享中的性能隔离与语义确定性

Zhenyuan Yang, Wenxin Zheng, Mingyu Li, Haibo Chen

专题命中 效率与部署 :LLM(abstract)

AI总结 本文提出CoGPU系统,通过引入GPU协程实现逻辑到物理资源的解耦,解决GPU空间共享中的资源利用率、性能隔离与语义确定性三重矛盾,提升多租户环境下的训练吞吐量和推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01693 2026-08-06 cs.CV 版本更新 50%

From Understanding to Erasing: Towards Complete and Stable Video Object Removal

从理解到擦除:迈向完全且稳定的视频对象移除

Dingming Liu, Wenjing Wang, Chen Li, Jing Lyu, Haotian Dong

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出通过外部和内部指导机制,结合视觉基础模型与视频扩散模型,提升视频对象移除的物理和语义理解能力,实现清晰且连贯的移除效果,并建立首个真实世界基准测试。

Comments Code: https://github.com/WeChatCV/UnderEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18266 2026-08-06 cs.CV 版本更新 50%

YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos

YouTube-Occ:从YouTube视频学习室内3D语义占据预测

Haoming Chen, Lichen Yuan, TianFang Sun, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对室内3D语义占据预测数据稀缺的问题,提出YouTube-Occ框架,通过自动化数据流水线与双对齐预训练策略,在NYUv2等基准上实现性能提升,代码数据将公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00938 2026-08-05 cs.IR 版本更新 50%

GRACE: Generative Recommender Acceleration Engine for Real-Time Ads Retrieval

GRACE:面向实时广告检索的生成式推荐加速引擎

Zhou Fang, Yuhang Huang, Ang Zhang, Yihan He, Ruichao Xiao, Chao Li, Yavuz Yetim, Sibyl Yang, Xiaohan Wei, Fei Tian, Liang Wang, Chonglin Sun, Liyuan Li, Nathan Yan, Gaoxiang Liu

专题命中 效率与部署 :LLM(abstract_cn)

AI总结 该研究提出GRACE系统,通过生成式目标匹配解决广告检索合规性问题,优化解码器设计降低延迟,满足实时广告检索的合规、延迟及成本要求。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22882 2026-08-05 cs.CV cs.RO 版本更新 50%

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏