arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-21 至 2026-08-21 共收录 35 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 11 篇

2607.04234 2026-08-21 cs.RO cs.AI cs.CV 版本更新 88%

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects (Early Version)

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.AI、cs.CV

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

Comments Early version of SoftVTBench, Accepted by ECCVW

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18779 2026-08-21 cs.RO 版本更新 83%

DiffDef: A Diffusion Model for Generating Multimodal Goal Shapes From Demonstrations for Deformable Object Manipulation

DiffDef:一种用于从演示中生成可变形物体操纵的多模态目标形状的扩散模型

Bao Thach, Tanner Watts, Siyeon Kim, Britton Jordan, Mohanraj Shanthi, Shing-Hei Ho, James M. Ferguson, Tucker Hermans, Alan Kuntz

机构 * Robotics Center and Kahlert School of Computing, University of Utah(大学计算机学院和机器人中心,犹他大学) NVIDIA Corporation(英伟达公司)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 针对现有可变形物体操纵方法依赖不切实际的目标获取方式、无法处理多模态目标的问题,提出DiffDef扩散模型,学习可行目标形状分布,在仿真和两种物理机器人平台上验证其可提升任务性能。

Comments Published and presented at ICRA 2026. 8 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25960 2026-08-21 cs.CR cs.AI cs.RO 版本更新 81%

WaveVerif: Acoustic Side-Channel based Verification of Robotic Workflows

WaveVerif:基于声学侧信道的机器人工作流验证

Zeynep Yasemin Erdogan, Shishir Nagaraja, Chuadhry Mujeeb Ahmed, Ryan Shah

机构 * Newcastle University(新castle大学)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究提出WaveVerif框架,利用声学侧信道分析开发机器学习验证系统,可实时低成本无源验证机器人工作流,准确率超80%且无需硬件修改。

Comments 11 pages, 3 figures, Corresponding Author: Zeynep Yasemin Erdogan (z.y.erdogan2@newcastle. this http URL (http://ac.uk) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20033 2026-08-21 cs.RO 版本更新 74%

HOST:Robots Acquire Manipulation Skills in Seconds from a Single Human Video

机器人从单个人类视频中在数秒内获取操作技能

Guangyan Chen, Meiling Wang, Te Cui, Zichen Zhou, Qi Shao, Shalfun Li, Hang Su, Roy Gan, Hao Wang, Mengyin Fu, Yi Yang, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) X SQUARE ROBOT(X方块机器人) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title);分类 cs.RO

AI总结 研究提出HOST框架,通过自定位预测,使机器人能从单个人类视频数秒内获取操作技能,保留先前技能,相比零样本基线及任务50次机器人示范微调的基线,在示范次数和获取速度上优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15654 2026-08-21 cs.RO cs.AI 版本更新 73%

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty

PO-PDDL: 从视觉演示中学习符号化POMDP以实现不确定性下的机器人规划

Wenjing Tang, Xuanjin Jin, Yuan Liu, Renming Huang, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出PO-PDDL符号化POMDP框架,通过从机器人执行视频中重建潜在状态轨迹、识别部分可观测性并学习随机转移与观测模型,实现不确定性下的鲁棒任务规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19161 2026-08-21 cs.RO 版本更新 70%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Wanlin Li, Chenxi Xiao, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06754 2026-08-21 cs.RO eess.SY 版本更新 70%

Model-Less Feedback Control of Space-based Continuum Manipulators using Backbone Tension Optimization

无模型反馈控制空间连续 manipulators 的背骨张力优化

Shrreya Rajneesh, Rakesh Kumar Sahoo, Manoranjan Sinha

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉吉尔普尔)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出一种无模型反馈控制方法,通过背骨张力优化实现连续 manipulators 的高精度运动控制,无需模型校准或参数识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17097 2026-08-21 cs.CV 版本更新 57%

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

HarmoHOI:用于多视图手-物体交互合成的外观与3D运动协调

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) Shadow AI(影谱科技)

专题命中 机器人操作 :embodied AI(abstract);分类 cs.CV

AI总结 研究针对多视图手-物体交互合成难题,提出HarmoHOI统一扩散框架,用多视图扩散Transformer混合模型联合建模视频与点轨迹,结合全局运动对齐扩散确保一致性,采用混合数据学习策略,实现多视图HOI高质量合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25619 2026-08-21 cs.CV 版本更新 57%

ScaleHP: Scale-Mediated Optimization of Coupled Errors for Metric-Space Hand Pose Estimation

ScaleHP: 在度量空间中估计手部姿态

Ruitao Jing, Xingyu Chen, Hongyang Li, Qing Jiang, Yukai Shi, Lei Zhang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Visincept International Digital Economy Academy (IDEA Research)(国际数字经济学院(IDEA研究院)) South China University of Technology(华南理工大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 提出ScaleHP,一种端到端的一阶段手部姿态估计框架,利用手部骨骼内在比例关系作为度量先验,通过尺度token和透视约束最小二乘法在相机坐标系中恢复绝对度量尺度,在多个基准上达到最先进性能。

Comments 19 pages, 9 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05853 2026-08-21 cs.CV 版本更新 57%

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击

Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19279 2026-08-21 cs.GT 版本更新 50%

Approximating Electoral Control Problems

近似选举控制问题

Huy Vu Bui, Michael C. Chavrimootoo, Kien T. Le, Son M. Nguyen

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了选举控制问题的近似性,分析了 plurality、approval 和 Condorcet 等投票规则下的控制问题是否可近似,并在加权和非加权投票场景中证明了结果。

Comments Accepted at ADT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 8 篇

2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 82%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14357 2026-08-21 cs.RO cs.AI 版本更新 81%

SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation

SUM-AgriVLN:面向农业视觉语言导航的空间理解记忆

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

机构 * China Agricultural University(中国农业大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 针对现有农业视觉语言导航方法忽视重复指令的空间记忆潜力的局限,提出SUM模块并集成至AgriVLN构建SUM-AgriVLN,在A2A基准上将SR从0.47提至0.54,NE仅微增,达领域顶尖性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08521 2026-08-21 cs.RO cs.AI eess.SY 版本更新 80%

FMT$^{\mathrm{X}}$: Lazy Wavefront Search for Dynamic Replanning

FMT$^{\mathrm{X}}$:用于动态重规划的惰性波前搜索

Soheil Espahbodi Nia

专题命中 具身导航 :robotics(abstract,comments);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出FMT$^{\mathrm{X}}$算法,通过代价改进测试和直接代价推送实现动态重规划,实验显示其在路径质量、修复工作量及碰撞检查效率上表现良好,明确了碰撞检测策略对规划性能的影响。

Comments 52 pages, 15 figures. Substantially revised version with strengthened asymptotic-optimality analysis, revised complexity analysis, expanded dynamic-replanning experiments, and updated presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02886 2026-08-21 cs.RO eess.SY 版本更新 79%

Exact Signed-Distance Control Barrier Functions via Minkowski Operations for Safe Navigation among Polytopes

基于闵可夫斯基运算的控制障碍函数用于多面体间的安全导航

Yi-Hsuan Chen, Shuo Liu, Wei Xiao, Calin Belta, Michael Otte

机构 * University of Maryland(马里兰大学) Boston University(波士顿大学) Nanyang Technological University(南洋理工大学)

专题命中 具身导航 :navigation(title);robotics(abstract);分类 cs.RO

AI总结 该研究针对多面体环境的机器人安全导航问题,提出结合非光滑控制障碍函数与闵可夫斯基运算的精确符号距离函数方法,可实现非保守机动与安全恢复。

Comments 16 pages, 13 figures. Expanded version of a paper published in IEEE CDC 2025. Demo video: this https URL (https://youtu.be/D0zVswzyxaE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20004 2026-08-21 cs.MA 版本更新 78%

The traffic concentration effects of urban navigation services

城市导航服务的交通集中效应

Giuliano Cornacchia, Mirco Nanni, Dino Pedreschi, Luca Pappalardo

专题命中 具身导航 :navigation(title,abstract)

AI总结 该研究通过在意大利三座城市及抽象环境的模拟实验,发现导航服务存在交通集中效应,低使用率时减排但超阈值后益处消失,路线多样性随使用率上升而降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07468 2026-08-21 cs.LG cs.AI 版本更新 73%

Learning-Based Speed Estimation from Accelerometer-Only Inertial Sensing

CarSpeedNet: 基于学习的仅使用加速度计的车速估计

Barak Or

机构 * CEO Office, MetaOr Artificial Intelligence(MetaOr人工智能首席执行办公室) Google(谷歌) Reichman Tech School, Reichman University(Reichman大学技术学院)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 CarSpeedNet通过仅使用加速度计实现车速估计,无需陀螺仪或其他传感器,提升低资源环境下的导航精度。

Comments 6 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17633 2026-08-21 cs.RO 版本更新 70%

OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects

OVIP-SG:用于小型细粒度物体映射与检索的开放词汇实例保留场景图

Tianjing Hao, Haiyu Lan, Angsong Li, Cheng Chen, Enyu Li, Jiarui Yang, Yuning Su, Peiwen Lin, Wang Chuang

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出OVIP-SG框架,通过VLM等技术实现小型细粒度物体的实例保留映射与语言引导检索,在Replica数据集上的多项指标优于现有方法,且经实际机器人实验验证有效。

Comments 15 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16853 2026-08-21 cs.RO 版本更新 61%

FlexWorm: Primitive-augmented Hybrid Contact-motion Planning for Suction-based Multi-segment Deformable Robots

FlexWorm:用于基于吸盘的多段可变形机器人的基元增强混合接触-运动规划

Zili Tang, Tiecheng Guo, Qinyue Zhang, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 FlexWorm框架为基于吸盘的多段可变形机器人提出规划方法,含IKHS与PaHS,仿真和硬件实验表明其在复杂环境下规划性能更优且鲁棒性良好。

Comments 13 pages, 18 figures, accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026. Supplementary video: this https URL (https://youtu.be/OQR5Sx5Bwnc)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 3 篇

2608.19085 2026-08-21 cs.RO cs.AI 版本更新 81%

DA-WAM: Decision-Aligned Future Latents for Driving World Models

DA-WAM:面向驾驶世界模型的决策对齐未来潜变量

Ruiguo Zhong, Benshan Ma, Xiaolong Chen, Lang Zhang, Mingyue Feng, Yaonong Wang, Pei Liu, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Leapmotor(零跑汽车) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 DA-WAM 是统一预测表示学习等模块的驾驶世界模型框架,通过动作条件未来潜变量实现决策对齐,在 NAVSIM 数据集上达到最优性能,验证了关键组件的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18853 2026-08-21 eess.SY cs.LG 版本更新 79%

Learn for Variation: Efficient AAV Trajectory Learning through a Differentiable Wireless World Model

为变化学习:在可微环境中变分引导的AAV轨迹学习

Xiucheng Wang, Zhenye Chen, Nan Cheng, Zhisheng Yin, Xuemin Shen

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院) School of Aerospace Science and Technology, Xidian University(航天学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出L4V框架,通过变分引导解决AAV轨迹规划中的奖励驱动强化学习问题,利用密集政策梯度提升任务完成效率和传输速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07303 2026-08-21 cs.LG 版本更新 57%

Bootstrap Theory of Representational Emergence (TBER): Explanatory Insufficiency, Transition Regimes, and the Emergence of New Representational Levels

表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力

Jacques Raynal, Pierre Slangen, Elsa Raynal, Jacques Margerit

机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。

Comments Version 4. Major theoretical revision introducing the distinction between manifestations of explanatory insufficiency and resolution regimes (local-corrective, representationally resolutive, and structurally recurrent), together with regime-sensitive diagnosis and closure assessment. Formal mathematical boundary cases have been clarified. 28 references, no figures or tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 2 篇

2607.26807 2026-08-21 cs.RO 版本更新 57%

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

基于运动学的路由、基于观测的执行:MoE增强视觉-语言智能体(VLA)中的运动学监督专家路由

Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本研究针对MoE增强VLA的专家路由问题,提出KinRT方法,通过运动学聚类监督路由器训练,在两个平台上验证其性能优于现有模型,相关代码与平台将开源。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13710 2026-08-21 cs.LG 版本更新 57%

HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models

HBVLA: 推动面向视觉-语言-动作模型的1位后训练量化

Xin Yan, Zhenglin Wan, Feiyang Ye, Xingrui Yu, Hangyu Du, Yang You, Ivor Tsang

专题命中 机器人基础模型 :robotic(abstract);分类 cs.LG

AI总结 HBVLA通过改进的二值化框架,实现对视觉-语言-动作模型的高效1位量化,保留了高精度性能,适用于资源受限的机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 3 篇

2601.10930 2026-08-21 cs.RO 版本更新 79%

Where to Touch, How to Contact: A Hierarchical RL-MPC Framework for Geometry-Aware Sim-to-Real Manipulation

何处触碰,如何接触:面向几何感知的长时间灵巧操作的分层RL-MPC框架

Zhixian Xie, Yu Xiang, Michael Posa, Wanxin Jin

机构 * Arizona State University(亚利桑那州立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出分层RL-MPC框架,高层RL策略预测接触意图(接触位置和子目标位姿),低层接触隐式MPC优化局部接触模式并实时重规划,实现几何泛化的非抓取操作,数据效率提升10倍且零样本迁移到真实环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01476 2026-08-21 cs.LG cs.CL 版本更新 57%

From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering

当奖励黑客反弹时:通过表征层面信号理解与缓解它

Rui Wu, Ruixiang Tang

机构 * Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型强化学习中奖励黑客现象,通过环境操控设置分析其三阶段反弹模式,并提出基于表征工程的Advantage Modification方法以更有效抑制黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02710 2026-08-21 cs.LG 版本更新 57%

Maximum Likelihood Reinforcement Learning

最大似然强化学习

Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 MaxRL是一种基于采样的强化学习框架,通过最大似然估计提升模型训练效率,实验显示其在多个任务中表现优于现有方法。

Comments ICML 2026. Project website: this https URL (https://zanette-labs.github.io/MaxRL/)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 5 篇

2512.10668 2026-08-21 cs.CV 版本更新 77%

XDen-1K: A Density Field Dataset of Real-World Objects

XDen-1K:一个现实世界物体的密度场数据集

Jingxuan Zhang, Tianqi Yu, Yatu Zhang, Jinze Wu, Kaixin Yao, Jingyang Liu, Yuyao Zhang, Jiayuan Gu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 XDen-1K通过提供大规模现实世界物体的多模态数据,推动物理基础视觉推理和具身AI的研究。

Comments Project Page: this https URL (https://xden-1k.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29786 2026-08-21 cs.CV cs.RO 版本更新 62%

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成

Yirum Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17584 2026-08-21 cs.RO 版本更新 57%

HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction

HODAgent:面向物理世界人机交互的按需、响应式人形机器人

Wang Warren Chen, Jiahao Zhang, Zhenjiang Li, Mingxu Wang, Lei Yi, Yuchen Kang, Shuo Sun, Ziping Chen, Jie Chen

机构 * Xiaopeng(小鹏)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO

AI总结 HODAgent作为面向服务人形机器人的System-2具身智能体,通过半双工架构实现自适应服务,在仿真与实体机器人上均显著优于基准模型。

Comments we have received a formal directive from our company requiring all company assets to undergo a mandatory internal review process before any public release. We are now required to immediately withdraw the paper to comply with this policy

详情

展开后加载摘要…

URL PDF HTML 收藏