arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-28 至 2026-07-28 共收录 39 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 11 篇

2607.13653 2026-07-28 cs.CV cs.RO 版本更新 88%

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

专题命中 机器人操作 :embodied agent(title,abstract);manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29227 2026-07-28 cs.RO 版本更新 82%

Kernel-SDF: An Open-Source Library for Real-Time Signed Distance Function Estimation using Kernel Regression

基于核回归的SDF库:利用核回归进行实时符号距离函数估计的开源库

Zhirui Dai, Tianxing Fan, Mani Amani, Jaemin Seo, Ki Myung Brian Lee, Hyondong Oh, Nikolay Atanasov

机构 * University of California, San Diego(加州大学圣地亚哥分校) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 机器人操作 :robotics(abstract,comments);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 本文提出Kernel-SDF开源库,通过核回归实时估计带不确定性的符号距离函数,提供高精度SDF、梯度和网格构造,适用于机器人应用。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L) 2026; code: https://github.com/ExistentialRobotics/kernel_sdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20033 2026-07-28 cs.RO 版本更新 74%

Robots Acquire Manipulation Skills in Seconds from a Single Human Video

机器人从单个人类视频中在数秒内获取操作技能

Guangyan Chen, Meiling Wang, Te Cui, Zichen Zhou, Qi Shao, Shalfun Li, Hang Su, Roy Gan, Hao Wang, Mengyin Fu, Yi Yang, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) X SQUARE ROBOT(X方块机器人) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title);分类 cs.RO

AI总结 研究提出HOST框架,通过自定位预测,使机器人能从单个人类视频数秒内获取操作技能,保留先前技能,相比零样本基线及任务50次机器人示范微调的基线,在示范次数和获取速度上优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06989 2026-07-28 cs.RO cs.SY eess.SY 版本更新 57%

Ace! Motion Planning of Professional-Level Table Tennis Serves with a Robot Arm

王牌!用机器人手臂进行专业水平乒乓球发球的运动规划

Guillem Torrente, Guilherme Jorge Maeda, Divij Grover, Megumu Tsukamoto, Hamdi Sahloul, Peter Dürr

机构 * Sony AI, Tokyo, Japan(索尼人工智能,东京,日本) Sony AI, Zürich, Switzerland(索尼人工智能,苏黎世,瑞士) Sony Group Corporation, Tokyo, Japan(索尼集团公司,东京,日本)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 研究乒乓球机器人发球问题,结合运动原语、模型预测控制和贝叶斯优化方法,实现符合官方规则发球,自旋高达550rad/s,速度达6.7m/s,表现与精英球员相当甚至更优。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04498 2026-07-28 cs.CV cs.SD 版本更新 57%

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02063 2026-07-28 cs.CV 版本更新 57%

ORGAN: Object-Centric Representation Learning using Cycle Consistent Generative Adversarial Networks

ORGAN:基于循环一致生成对抗网络的对象中心表示学习

Joël Küchler, Ellen van Maren, Vaiva Vasiliauskaitė, Katarina Vulić, Reza Abbasi-Asl, Stephan J. Ihle

机构 * Laboratory of Biosensors and Bioelectronics, Institute for Biomedical Engineering, University and ETH Zurich(生物传感器与生物电子实验室,生物医学工程研究所,大学和ETH苏黎世分校) Department of Neurology, Insel Gruppe, Bern, Switzerland(神经病学系,因塞格鲁普,瑞士伯恩) University of California, San Francisco, USA(加州大学旧金山分校,美国) Department of Neurobiology, University of Chicago, 951 E 58th St, Chicago, 60637, IL, USA(神经生物学系,芝加哥大学,951 E 58th St, 奇克阿哥,60637, IL, 美国) Department of Physics, University of Chicago, 929 E 57th St, Chicago, 60637, IL, USA(物理学系,芝加哥大学,929 E 57th St, 奇克阿哥,60637, IL, 美国)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 ORGAN通过循环一致生成对抗网络实现对象中心表示学习,在合成数据集上表现优异,并能处理现实世界中具有众多对象和低对比度的数据。

Comments GitHub: https://github.com/Hullimulli/ORGAN

Journal ref Artificial Intelligence Applications and Innovations (AIAI 2026), IFIP Advances in Information and Communication Technology, vol. 792, pp. 94-111, Springer (2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26600 2026-07-28 nucl-th 版本更新 50%

The $^{229}$Th Isomer: Nuclear Structure, Clocks, and Tests of Fundamental Physics

$^{229}$Th 同核异能态:核结构、时钟与基础物理检验

Xiao Lu, Rui Zhao, Shan-Gui Zhou

专题命中 机器人操作 :manipulation(abstract)

AI总结 综述$^{229}$Th同核异能态在实验光谱、核结构理论及基础物理检验方面的进展,重点介绍其异常低的跃迁能量及其在核时钟和暗物质探测中的应用。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00917 2026-07-28 eess.SP 版本更新 50%

TenSIM: Tensor-Based Channel Estimation for MIMO Systems with Stacked Intelligent Metasurfaces

TenSIM:基于张量的堆叠智能超表面MIMO系统信道估计

André L. F. de Almeida, George C. Alexandropoulos

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对堆叠智能超表面辅助MIMO系统,提出基于张量分解的信道估计框架TenSIM,利用奇偶层分别建模PARAFAC和Tucker模型,实现信道解耦与估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14718 2026-07-28 cs.DB cs.HC 版本更新 50%

Natural Language Interfaces for Databases: What Changes for SQL-Literate Users?

数据库的自然语言接口:对用户有何改变?

Panos Ipeirotis, Haotian Zheng

专题命中 机器人操作 :navigation(abstract)

AI总结 研究比较基于GPT-4o的NLIDB SQL-LLM与传统SQL平台Snowflake,发现接口改变工作类型非工作量,SQL-LLM用户查询速度快但准确性低,熟悉SQL的参与者转向自然语言后仍有验证负担。

Comments 26 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19682 2026-07-28 econ.TH 版本更新 50%

Persuasion under the Threat of Verification

在验证威胁下的说服

Georgy Lukyanov, Samuel Safaryan

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究公共交流后私下事实调查中,发送者在异质接收者验证前进行公共实验的情况。核心方法是分析发送者公共信息成本对结果的影响,主要贡献是揭示了不同成本下公共信息性与私下验证的关系及阶段反转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03206 2026-07-28 eess.SP 版本更新 50%

Indoor Statistical and Deterministic RCS Characterization for ISAC Channel Modeling

用于集成感知与通信信道建模的室内统计与确定性雷达散射截面特性分析

Ali Waqar Azim, Ahmad Bazzi, Roberto Bomfin, Nikolaos Giakoumidis, Theodore S. Rappaport, Marwa Chafii

专题命中 机器人操作 :robotic(abstract)

AI总结 研究在25 - 28GHz室内工厂对无人机等测试目标进行统计RCS分析,确定最佳拟合分布。基于特定双基地配置测量,用对数正态和伽马分布建模。还提供评估框架,评估新确定性RCS模型,部分模型能准确拟合数据,适用于NF双基地配置表征。

Comments Accepted for Publication in IEEE Transactions on Wireless Communications

Journal ref IEEE Transactions on Wireless Communications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 11 篇

2607.06882 2026-07-28 cs.RO cs.AI 版本更新 81%

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

GemNav:使用多模态大语言模型的离散令牌视觉机器人导航

Peter Bohm, Saimunur Rahman, Abdelwahed Khamis, Sagun Man Singh Shrestha, Chris McCool, Peyman Moghadam

机构 * CSIRO Technology(联邦科学与工业研究组织)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 研究探索基于大型预训练模型的视觉机器人导航策略新方法,提出GemNav,仅对语言塔用LoRA适配冻结的多模态大语言模型用于中短程航点导航,无辅助视觉编码器等,在小语料库上零样本转移到未见环境,提供了数据高效、可部署的导航替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14807 2026-07-28 cs.CV cs.RO 版本更新 81%

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00288 2026-07-28 cs.RO cs.CV 版本更新 81%

UAV-ON: A Benchmark for Open-World Object Goal Navigation with Aerial Agents

UAV-ON:用于空中智能体的开放世界目标导航基准测试

Jianqiang Xiao, Yuexuan Sun, Yixin Shao, Boxi Gan, Rongqiang Liu, Yanjin Wu, Weili Guan, Xiang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10577 2026-07-28 cs.RO 版本更新 79%

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav:零样本视觉与语言导航作为工具调用框架

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22342 2026-07-28 cs.RO 版本更新 79%

VL-LN Bench: Towards Long-horizon Goal-oriented Navigation with Active Dialogs

VL-LN基准:通过主动对话实现长视界目标导向导航

Wensi Huang, Shaohao Zhu, Meng Wei, Siqi Zhang, Jinming Xu, Xihui Liu, Hanqing Wang, Tai Wang, Feng Zhao, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 VL-LN基准通过引入主动对话机制,提升长视界目标导向导航任务的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20071 2026-07-28 cs.CV 版本更新 70%

GaussianSeed: Hierarchical Gaussian Seeding for High-Resolution 3D Occupancy Prediction

高斯种子:用于高分辨率3D占用预测的分层高斯播种

Xinzhuo Li, Xianghui Pan, Jiayuan Du, Wei Wei, Liuyi Wang, Chengju Liu, Qijun Chen

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 针对现有3D占用预测方法难以扩展到高体素分辨率的问题,提出高斯种子框架,通过分层设计规避内存瓶颈,构建TJScenes数据集,实验表明该方法在保持高精度的同时具有最低延迟,推动了高分辨率3D占用预测的效率-质量前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05658 2026-07-28 physics.ao-ph cs.LG physics.geo-ph 版本更新 57%

Integrating GNSS-Derived Zenith Wet Delay into a Weather Foundation Model Improves Precipitation Forecasting

将全球导航卫星系统(GNSS)导出的天顶湿延迟整合到天气基础模型中可改善降水预报

Leonardo Trentini, Fanny Lehmann, Laura Crocetti, Benedikt Soja

机构 * Weather Foundation(天气基金会)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 研究将GNSS导出的ZWD整合到Aurora天气基础模型中,扩展后的模型学习ZWD能力与预训练变量相当,微调时纳入ZWD可改善降水预报,增益随严重程度增加,能让降水功率谱更现实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10760 2026-07-28 cs.RO 版本更新 57%

MAGS-SLAM: Monocular Multi-Agent Gaussian Splatting SLAM for Geometrically and Photometrically Consistent Reconstruction

MAGS-SLAM:单目多智能体高斯点云SLAM用于几何和光度一致的重建

Zhihao Cao, Qi Shao, Shuhao Zhai, Jing Zhang, Anh Nguyen, Hesheng Wang, Baoru Huang

机构 * ETH Zurich(苏黎世联邦理工学院) Harbin Engineering University(哈尔滨工程大学) University of Liverpool(利物浦大学) University of Macau(澳门大学) University of Ottawa(多伦多大学) Wuhan University(武汉大学) Imperial College London(伦敦帝国学院)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 MAGS-SLAM通过单目视觉实现多智能体高斯点云SLAM,无需RGB-D传感器即可完成几何和光度一致的场景重建,实验表明其跟踪精度和渲染质量可与现有RGB-D方法媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17604 2026-07-28 cs.RO 版本更新 57%

MoE-Based Learned Inertial Odometry for Bicycle Localization

基于专家混合模型的自行车定位学习惯性里程计

Hao Qiao, Yan Wang, Shuo Yang, Xiaoyao Yu, Jian kuang, Xiaoji Niu

机构 * School of Geodesy and Geomatics(测绘学院) GNSS Research Center(GNSS研究中心) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 针对城市峡谷中自行车定位难题,提出基于MoE网络的学习惯性里程计,将神经速度预测器与扩展卡尔曼滤波器耦合,减少计算开销,在低FLOPs下取得良好精度和泛化能力,优于其他模型。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03910 2026-07-28 cs.SE cs.AI cs.CL 版本更新 57%

CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph Databases

CodexGraph:通过代码图数据库连接大型语言模型和代码库

Xiangyan Liu, Bo Lan, Zhiyuan Hu, Yang Liu, Zhicheng Zhang, Fei Wang, Michael Shieh, Wenmeng Zhou

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究旨在解决大型语言模型处理整个代码库的难题,提出通过将LLM代理与代码库图数据库接口集成的CodexGraph系统,利用图数据库特性实现精确上下文检索和代码导航,经多基准评估及实际应用开发,展现其在软件工程中的竞争力与潜力。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02544 2026-07-28 cs.SE 版本更新 50%

Developer Experience with AI Coding Agents: HTTP Behavioral Signatures in Documentation Portals

与AI代码代理的开发者体验:文档门户中的HTTP行为签名

Oleksii Borysenko

专题命中 具身导航 :navigation(abstract)

AI总结 本文研究AI代码代理对技术文档访问的影响,发现HTTP行为特征在文档门户中具有可识别性,提出改进开发者文档设计和反馈机制的实践方案。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 3 篇

2603.28963 2026-07-28 cs.RO cs.AI cs.CV cs.LG 版本更新 83%

AutoWorld: Learning Multi-Agent Traffic Simulation with Self-Supervised World Models

AutoWorld: 通过自监督世界模型扩展多智能体交通仿真

Mozhgan Pourkeshavarz, Tianran Liu, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出AutoWorld框架,利用未标记的LiDAR数据自监督学习世界模型,提升多智能体交通仿真的真实感与性能,实验表明未标记数据能有效提升仿真效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22430 2026-07-28 cs.LG 版本更新 79%

On the Identifiability of Controlled World Models

关于受控世界模型的可识别性

Xiangteng Zhang, Yang Guan, Bo Zhang, Hongyang Li, Ya-Qin Zhang, Shengbo Eben Li

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新 57%

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 2 篇

2607.18016 2026-07-28 cs.RO 版本更新 79%

Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation

人形机器人视觉语言动作闭环:用于可验证移动操作的持久3D对象令牌

Peng Ren, Haoyang Ge, Jiang Zhao, Cong Huang, Yukun Shi, Pei Chi, Kai Chen

机构 * BUAA(北京航空航天大学) DeepCybo(深灵机器人) ZGCI(未提及具体中文译名)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 研究人形机器人视觉语言动作中对象状态差异问题,提出持久对象令牌化方法(POT)并实例化为POT-VLA,通过RGB-D观察维护3D对象记录,转换为对象令牌用于动作生成与验证,实验表明该方法提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01031 2026-07-28 cs.RO cs.AI cs.LG 版本更新 67%

VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference

VLASH: 通过未来状态感知的异步推断实现实时VLAs

Jiaming Tang, Yufei Sun, Yilong Zhao, Shang Yang, Yujun Lin, Zhuoyang Zhang, James Hou, Yao Lu, Zhijian Liu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Caltech(加州理工学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 VLASH通过未来状态感知的异步推断框架,实现高效、准确的实时VLAs控制,显著提升反应速度和任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 3 篇

2607.21302 2026-07-28 cs.AI 版本更新 57%

Expert Behavior Prior Reinforcement Learning

专家行为先验强化学习

Gong Gao, Weidong Zhao, Xianhui Liu, Ning Jia

机构 * School of Computer Science, Tongji University(同济大学计算机科学与技术学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 研究针对行为先验强化学习依赖静态离线数据集的问题,提出专家行为先验算法,通过Q引导的条件变分自编码器生成专家策略先验,并结合专家策略引导和策略梯度校正模块,提升样本效率与收敛稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18985 2026-07-28 cs.AI 版本更新 57%

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction

雅典娜大脑技术报告:用于通用智能和具身交互的高效机器人大脑

Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 研究针对具身智能体对设备端紧凑模型需求,提出雅典娜大脑8B模型,经多阶段训练流程,使其兼具通用与具身交互能力,实验证明该模型在通用和具身评估中有效,能在保持性能同时生成更简洁回复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08757 2026-07-28 cs.RO 版本更新 57%

A Visuo-Tactile Data Collection System with Haptic Feedback for Coarse-to-Fine Imitation Learning

一种带有触觉反馈的视觉-触觉数据采集系统用于粗到细模仿学习

Yeseung Kim, Nayoung Oh, Jun Park, Teetat Thamronglak, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种视觉-触觉数据采集系统,生成时间结构丰富的接触密集演示,用于模仿学习。通过直接驱动夹具和触觉阵列,保留自然触觉反馈,结合实时注释,生成多模态数据集以支持粗到细学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏