arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-31 至 2026-07-31 共收录 46 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 18 篇

2607.28382 2026-07-31 cs.RO 新提交 83%

SemAnCorr: Semantic Anchored Correspondence for Zero-Shot Manipulation Skill Transfer

SemAnCorr:用于零样本操作技能迁移的语义锚定对应方法

Xiaoxiang Dong, William Baron, Hongyi Chen, Uksang Yoo, Jeffrey Ichnowski, Weiming Zhi

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) College of Connected Computing, Vanderbilt University(范德堡大学互联计算学院) College of Engineering, University of California, Berkeley(加州大学伯克利分校工程学院) School of Computer Science, The University of Sydney(悉尼大学计算机学院)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);分类 cs.RO

AI总结 SemAnCorr是一种无需训练的机器人密集对应框架,通过联合优化建立语义与几何一致的对应关系,在PartNet-Mobility基准上获90.8%语义准确率,可实现可靠的零样本操作技能迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28251 2026-07-31 eess.SY cs.SY 新提交 82%

Self-Evolving Learning for Embodied AI with Criticality Model

基于临界模型的具身智能自进化学习

Linxuan He, Yuying Tian, Lingxiang Fan, Jiaqi Pi, Yinqiao Lu, Shang Su, Mengkai Shi, Shuo Feng

专题命中 机器人操作 :embodied AI(title,abstract);manipulation(abstract)

AI总结 本文提出基于临界模型的具身智能自进化学习方法,通过状态级临界模型引导采样易失败场景,在多类具身任务中显著降低失败率,性能优于基线及同类先进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28198 2026-07-31 cs.RO cs.CV 新提交 81%

UniCross: Unified Cross-Skill Dexterous Manipulation Synthesis

UniCross:统一跨技能灵巧操作合成

Hui Zhang, Julian Ferchow, Jie Song, Mirko Meboldt

机构 * ETH Zürich(苏黎世联邦理工学院) inspire AG(inspire AG公司) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本研究提出UniCross框架,将抓取、重定位等四种灵巧操作技能统一建模,提炼出跨技能策略,可泛化到新物体、抗干扰,还能在不同手型间迁移,实现长时程操作。

Comments Project page: https://zdchan.github.io/UniCross/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28596 2026-07-31 cs.RO 新提交 79%

FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation

FA-RDP:用于接触丰富操作的频率自适应反应式扩散策略

Lifeng Zhuo, Wendi Chen, Han Xue, Shirun Tang, Jun Lv, Cewu Lu, Chuan Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix Ltd.(诺玛特里斯有限公司)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 FA-RDP 是一种频率自适应反应式扩散策略,通过多频率视觉-力 Transformer 和多模态指标动态调整采样策略,结合流形一致性蒸馏,在接触丰富操作任务中兼顾多模态保留与反应性,实现最高成功率。

Comments Project page: https://fa-rdp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27890 2026-07-31 cs.RO 新提交 79%

Static In, Dynamic Out: Counterfactual Action Augmentation for Moving Object Manipulation

静态输入,动态输出:面向运动物体操作的反事实动作增强方法

Woo Chul Shin, Zhenyang Chen, Alfred Cueva, Nadun Ranawaka Arachchige, Yingyan Celine Lin, Benjamin Joffe, Shreyas Kousik, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 该研究针对视觉运动策略无法适应运动物体操作的问题,提出SIDO反事实动作增强方法,经模拟和真实任务验证,其在提升运动物体操作成功率的同时保留了静态物体操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27715 2026-07-31 physics.optics 新提交 78%

Multi-mode fiber enabled multi-wavelength optical trapping and dynamic manipulation

多模光纤实现多波长光捕获与动态操控

Yikun Shen, Chuangye Zhang, Yuquan Zhang, Jiahui Pan, Siwei Chen, Hongyang Xu, Yixuan Chen, Qi Jin, Xiaocong Yuan, Changjun Min

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 该研究提出并实验验证了一种集成端面微透镜的全多模光纤光镊系统,可实现多波长下细胞的稳定捕获与轴向动态操控,为光纤生物光子平台提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28625 2026-07-31 cs.CV 新提交 77%

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

ACE-Data-0:以人为中心的环境捕获作为具身数据引擎

Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) ACE Robotics(ACE机器人公司)

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);world model(abstract);分类 cs.CV

AI总结 本研究提出以人为中心的具身数据引擎ACE,构建含150小时数据的ACE-Data-0数据集,引入分层基准,暴露现有方法缺陷,为具身AI等领域提供基础。

Comments Project Page: https://ace-data-engine.github.io/ACE-Data-0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28243 2026-07-31 cs.CV cs.AI 新提交 73%

EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE

EgoGenesis:基于在线锚定投影记忆与Action-3D RoPE的自我中心世界-动作建模

Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Tianji KernalMind Co., Ltd.(天机芯智有限公司) The Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学)

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出EgoGenesis模拟器,通过在线锚定投影记忆与Action-3D RoPE合成自我中心操作视频,扩充训练数据,显著提升了真实机器人单臂、双臂任务的分布外操作成功率。

Comments project page: https://egogenesis.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27784 2026-07-31 cs.RO 新提交 70%

DexDirect: Direct Kinesthetic Arm Guidance for Efficient Dexterous Demonstration Collection

DexDirect:用于高效灵巧演示采集的直接运动学手臂引导

Beom Jun Kim, Shiu-Jen Wang, Jonathan Liu, Alvin Zhu, Quanyou Wang, Hanzhang Fang, Feng Xu, Mingzhang Zhu, Yuchen Cui, Dennis W. Hong

机构 * UCLA(加利福尼亚大学洛杉矶分校)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 该研究提出DexDirect方法,结合直接运动学手臂引导与视觉手部重定向,采集灵巧操作演示的效率更高、认知负荷更低,训练的扩散策略在立方体抓取任务上达到90%成功率。

Comments 8pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27422 2026-07-31 cs.LG 新提交 70%

Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search

好的排序器,差的目标:表达性策略搜索下的双线性对比评判器

Ayushman Singh, Siddharth Aphale

机构 * Stanford University(斯坦福大学) Sesame AI(芝麻AI公司)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.LG

AI总结 该研究发现双线性对比评判器的排序能力与其优化安全性不匹配,其存在范数漂移等问题,在多任务中无法可靠排序动作,需结合价值校准标量用于动作选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28405 2026-07-31 cs.AI cs.LG 新提交 62%

QuantWAMs: Calibrating at the Right Granularity for World Action Models

QuantWAMs:为世界动作模型校准至合适粒度

Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantWAMs框架,通过三种校准策略优化后训练量化,在WAMs上实现内存大幅降低与速度提升,同时保持与FP16接近的性能,验证了部署可行性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28229 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 62%

EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

EMBL AI Librarian:面向AI智能体的生命科学知识层

Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar, Matt Jeffryes, Daljit Nijjer, Vittorio Perera, Ola Spjuth, Julio Saez-Rodriguez, Melissa Harrison, Fabio Petroni

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出EMBL AI Librarian,为AI智能体升级Europe PMC接口,通过LLM统筹检索,在多基准任务中提升性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27261 2026-07-31 cs.RO 新提交 61%

It's Not Just More Demos: Counterfactual Action Sensitivity Coverage for Data-Efficient Robust Robot Imitation

不仅仅是更多演示:用于数据高效的鲁棒机器人模仿的反事实动作敏感性覆盖

Giovanni D'urso, Kaushik Roy, Nicholas Lawrance, Brendan Tidd

机构 * CSIRO Robotics, CSIRO, Australia(澳大利亚联邦科学与工业研究组织机器人学部,澳大利亚联邦科学与工业研究组织)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 针对视觉运动模仿策略对干扰项脆弱的问题,提出CFNBC框架,通过测量动作漂移选择紧凑修复集,在机器人任务中20-30个候选的修复性能优于随机选择。

Comments Workshop paper accepted at the RSS 2026 Workshop on Data-Centric Robotics: What Data Do Robots Really Need?

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28416 2026-07-31 cs.RO 新提交 57%

FasTac: A Curved Multispectral Vision-Based Tactile Sensor for High-Speed High-Precision 3D Shape and Force Perception

FasTac:一种用于高速高精度3D形状与力感知的曲面多光谱视觉触觉传感器

Xiaofan Lu, Kaiji Huang, Jiahui Chen, Yuankai Lin, Hua Yang, Zhouping Yin

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院智能制造装备与技术国家重点实验室) National Innovation Institute of Digital Design and Manufacturing(国家数字化设计与制造创新中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 FasTac是一款集成多光谱光度立体、动态卷积力估计及FPGA加速的曲面多光谱视觉触觉传感器,可实现高精度3D形状与力感知,兼具高速处理能力,经实验验证其性能优于现有方案。

Comments 13 pages, 11 figures, including 2 pages of supplementary material. Submitted to IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28391 2026-07-31 cs.RO 新提交 57%

TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction

TacWAM:锚点引导的力学感知触觉世界动作模型

Lei Jin, Yiding Ma, Xin Zhang, Chen Gao, Wei Wu, Yong Li

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究提出TacWAM,通过空间对齐融合触觉编码器、触觉历史编码器及锚点引导三模态注意力,在四项真实接触操作任务上使平均成功率达75.0%,远超最强基线37.5个百分点。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27250 2026-07-31 cs.SE cs.AI 新提交 57%

Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories

上下文文件对编码智能体有帮助吗?针对真实仓库的双智能体消融研究

Prakhar Khatri

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本研究通过双智能体(Claude Code、Codex)的受控消融实验,发现上下文文件对编码智能体的正确性无显著提升,其失败源于实现技能而非知识缺失,还解释了过往研究矛盾的原因并公开了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28155 2026-07-31 cs.HC 新提交 50%

A Mathematical Framework for Reading the Autopsias' Meta - Compositional System

用于解读Autopsias元作曲系统的数学框架

Patricio F. Calatayud, Pablo Padilla Longoria, Álvaro Martínez Ramírez

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文以Autopsias元作曲系统为案例,构建评估动态音乐记谱法可读性的数学框架,证明数学可辅助理解音乐信息与演奏,提出需扩充正字法规则以改善作曲家与演奏者的沟通。

Comments 13 pages, 12 figures, 11 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27695 2026-07-31 cond-mat.mtrl-sci cond-mat.str-el physics.app-ph quant-ph 新提交 50%

Unconventional and Fragile Magnetic Exciton in a van der Waals Quantum Magnet

范德华量子磁体中的非常规且脆弱的磁激子

Kai-Xuan Zhang, Min Zhang, Minjae Kim, Yong-Hyun Kim, Junghyun Kim, Heejun Yang, Pyeongjae Park, Chaebin Kim, Mangesh Diware, Junik Hwang, Youjin Lee, Byeong-Gwan Cho, Hyeong-Do Kim, Tae-Yeong Koo, Chunhua Chen, Mingtao Li, Xujie Lü, Wenge Yang, Kee-Hoon Kim, Seung-Ho Baek, Hyeonsik Cheong, Sung-Keun Lee, Beom Hyun Kim, Christopher Lane, Jian-Xin Zhu, Zhaorong Yang, Young-Woo Son, Je-Geun Park

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文以静水压力为调控参数,探究NiPS₃磁激子的亮态-暗态转变机制,发现其光学亮度由高阶关联机制主导,为关联量子磁体中纠缠磁激子研究提供框架。

Comments Our findings indicate that the sharp coherence of the entangled magnetic exciton benefits from its delicate quantum nature, and its optical brightness can be activated by exciton pairing or spin-orbit coupling, while its fragility under external control is achievable through a high-order perturbation rather than a first-order transition

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 7 篇

2607.28256 2026-07-31 cs.RO 新提交 85%

When Robots Exchange Meaning: A Demo of Goal-Oriented Semantic Communications for Collaborative Robotics

当机器人交换意义:面向协作机器人的目标导向语义通信演示

Peizheng Li, Xinyi Lin, Sajida Gufran, Adnan Aijaz

专题命中 具身导航 :robotics(title,abstract);embodied AI(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种机器人-边缘端语义通信测试平台,通过VQ-VAE等技术实现视觉压缩与语义建图,为协作机器人及相关6G网络研究提供了实用演示平台。

Comments 3 pages, 3 figures. This paper has been accepted for presentation as a demo paper at IEEE CSCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28474 2026-07-31 cs.RO 新提交 83%

TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation

TEA-AgriVLN:面向农业视觉语言导航的可通行性估计告警

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 针对农业场景可通行性模糊问题,提出TEA模块并集成至AgriVLN构建TEA-AgriVLN,在A2A基准上将SR提至0.54、NE降至2.70米,实现农业VLN-CE领域最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27922 2026-07-31 cs.RO 新提交 79%

Learning Social Robot Navigation By Sensing Human Legs

通过感知人腿实现社交机器人导航

Alberto Vaglio, Andrea Garulli, Antonio Giannitrapani, Renato Quartullo, Tommaso Van Der Meer

机构 * University of Siena(锡耶纳大学) Uninettuno University(意大利 uniNettuno 大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出CALF架构,结合卷积、注意力和MLP从激光雷达解读腿部运动,在LegNav模拟器中训练后,经TurtleBot 4零样本部署验证,实现了平滑合规的社交机器人导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28045 2026-07-31 cs.RO 新提交 57%

RaDiVe: Robust 4D Radar Odometry with Distance-Bounded NDT and Velocity-Discrepancy Point Uncertainty

RaDiVe:基于距离约束NDT与速度差异点不确定性的鲁棒4D雷达里程计

Sangwoo Jung, Dongjae Lee, Chiyun Noh, Ayoung Kim

机构 * SNU(首尔国立大学)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出RaDiVe框架,通过距离约束NDT、速度差异点不确定性模型及SDF表面点提取构建鲁棒4D雷达里程计,在多数据集上优于现有基线且保持实时性

Comments 8 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27418 2026-07-31 cs.LG 新提交 57%

Context-Informed Ship Trajectory Prediction via Conditional Attention

基于条件注意力的上下文感知船舶轨迹预测

Yuan Guan, Chandler Squires, Timothy Hu, Pradeep Ravikumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Advanced Technology Laboratories Lockheed Martin(洛克希德·马丁公司先进技术实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 该研究提出Conditional Informer架构,通过条件注意力机制编码船舶与环境的物理依赖,结合Modality Masking策略,在AIS与ERA5数据上提升了船舶轨迹预测准确率并降低了传感器故障时的误差。

Comments Accepted for publication at the 2026 29th International Conference on Information Fusion (IEEE FUSION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27697 2026-07-31 cs.HC 新提交 50%

DP-LENS: A Density-Aware Polyfocal Lens with Topology-Driven Auto-Routing for Occlusion Management in Immersive 3D Analytics

DP-LENS:一种用于沉浸式3D分析中遮挡管理的密度感知多焦点透镜,带有拓扑驱动自动路由功能

Nieyu Cao, Xian Wang, Lik-Hang Lee

专题命中 具身导航 :navigation(abstract)

AI总结 该研究针对沉浸式3D分析中数据遮挡导致的高认知负荷问题,提出带拓扑驱动自动路由的DP-LENS系统,结合LLM语音交互,经用户验证可降低负荷、提升效率,为相关系统设计提供启示。

Comments Accepted to IEEE International Symposium on Mixed and Augmented Reality (ISMAR) 2026, to appear in IEEE Transactions on Visualization and Computer Graphics (TVCG). 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27762 2026-07-31 astro-ph.EP astro-ph.IM 新提交 50%

The International Lunar Reference System

国际月球参考系统

Agnès Fienga

专题命中 具身导航 :navigation(abstract)

AI总结 该研究针对月球探测加速下PNT标准化需求,提出采用GNSS相关方法构建符合IERS标准的ILuRF2026,为月球PNT框架提供弹性支持。

Comments proceedings of the REFAG 2026 to be published in IAG Symposia Series by Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 9 篇

2607.27511 2026-07-31 cs.RO 新提交 86%

Failure Detection for Surgical Robot Imitation Policies via Flow-Matching World Modeling

基于流匹配世界建模的外科机器人模仿策略故障检测

Zhefeng Huang, Yilin Cai, Ankit Patel, Mohammad Hajiha, Brendan Browne, Yue Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究针对外科机器人模仿策略的故障检测难题,提出FoMo-FD方法,利用流匹配世界模型实现无故障演示的视觉-动作不一致性窗口级检测,在dVRK的模拟与真实实验中表现优于基线方法。

Comments 9 pages, 6 figures. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28415 2026-07-31 cs.LG cs.AI cs.CV cs.MM cs.RO 新提交 83%

QQWorld: Quantile-Quantile Matching for World Model Regularization

QQWorld:用于世界模型正则化的分位数-分位数匹配

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28362 2026-07-31 cs.CV cs.AI cs.LG 新提交 82%

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow

ShadowDancer:通过从视频及其阴影中学习统一动力学表示,赋予视频世界模型任意动作控制能力

Jin Cao, Zian Meng, Kaipeng Zhang

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 ShadowDancer通过阴影对与跨阴影预测学习统一动力学表示,实现视频世界模型的任意动作帧级控制,在多动力学族上的动作迁移与长回放性能优于基线,平均盲胜率达86%。

Comments https://ShadowDancer-1.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 81%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28624 2026-07-31 cs.CV 新提交 79%

PhiZero: A World Model Built Around Physical Language

PhiZero:基于物理语言构建的世界模型

Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所NLPR)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 该研究提出围绕物理语言构建的PhiZero世界模型,采用先推理再渲染的范式,经实验验证其可建模物理连贯的世界演化,还具备交互式世界建模等应用潜力。

Comments Project page: https://phi-zero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏