arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-12 至 2026-08-12 共收录 83 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 18 篇

2608.10817 2026-08-12 cs.RO 新提交 79%

AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation

AECNav:用于高效零样本开放词汇对象导航的主动证据整合

Guanlin Liu, Shaobin Ling, Renyuan Liu, Zeying Gong, Junjie Hu

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 AECNav是一种无需训练的零样本开放词汇对象导航方法,通过证据门控感知、证据整合与主动证据获取三个组件,在多个基准数据集上达到最新性能,且在物理机器人上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09946 2026-08-12 cs.HC cs.AI 新提交 79%

HoosierHelp: Benchmarking LLM Agents for Social Service Navigation

HoosierHelp:面向社会服务导航的大语言模型智能体基准测试

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI

AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09944 2026-08-12 cs.HC cs.AI 新提交 79%

Navigation Alone Is Not Enough: Evaluating Explanatory Assistive UI Agents

仅导航是不够的:评估解释性辅助UI智能体

Santosh Patapati

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI

AI总结 该研究推出辅助UI智能体基准NeXUI,评估其导航、解释及用户控制能力,实验发现Gemini-3.5-Flash在该基准中表现不佳,为相关研发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09816 2026-08-12 cs.RO 版本更新 79%

Hierarchical Fast-Slow ReAct Agent for Zero-Shot Object-Goal Navigation

用于零样本物体目标导航的分层快慢ReAct智能体

Zhaochen Lan, Zhi Yang, Yuxiang Fu, Mengxiang Lin

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 该研究针对零样本物体目标导航,提出分层快慢ReAct智能体,结合价值图控制器与坐标锚定记忆及VLM,在HM3D、MP3D验证集上取得零样本方法最高成功率,远前沿审议可提升性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09449 2026-08-12 cs.CV 版本更新 79%

Sekai2: From World Exploration to Interactive World Modeling

Sekai2:从世界探索到交互式世界建模

Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, Yongtao Ge

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 具身导航 :world model(title,abstract);分类 cs.CV

AI总结 研究人员推出多源真实世界视频数据集Sekai2,其具备丰富观测数据与标注,可用于长时程视频生成、相机可控合成及交互式世界模型预训练。

Comments Sekai2 dataset technical report. Developed at Alaya Lab

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28560 2026-08-12 cs.RO 版本更新 79%

X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

X-NavDP:通过组Q分数重加权匹配将导航扩散策略泛化到新行为和实体

Tianyu Yang, Yiming Zeng, Wenzhe Cai, Yuqiang Yang, Jiaqi Peng, Hui Cheng, Jiangmiao Pang, Tai Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 该研究针对导航扩散策略泛化性不足的问题,提出GQRM框架对X-NavDP进行后训练,大幅提升了跨实体视觉导航的模拟与现实场景成功率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10959 2026-08-12 cs.LG 版本更新 79%

Population-Aware Physics-Informed Neural Particle Flow for Robust Spacecraft Bayesian Navigation

群体感知的物理信息神经粒子流用于贝叶斯更新

Batu Candan, Simone Servadio

机构 * Iowa State University(爱荷华州立大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.LG

AI总结 提出群体感知的物理信息神经粒子流(PA-PINPF),通过群体编码器增强粒子更新,在贝叶斯后验传输中优于标准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10278 2026-08-12 cs.CV 新提交 77%

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

空间思维链:面向视觉语言模型的模态无关空间定位

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

专题命中 具身导航 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10791 2026-08-12 cs.RO 新提交 76%

Dual Stress: Runtime Safety Monitoring for Safety-Constrained MPC Navigation

双重应力:安全约束模型预测控制导航的运行时安全监测

Jamil Chahine, Wenqi Cai, John Abanes, Anthony Tzes

机构 * American University of Beirut (AUB)(贝鲁特美国大学) New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校) New York University(纽约大学)

专题命中 具身导航 :navigation(title);分类 cs.RO;robotics(comments)

AI总结 本文提出基于MPC约束优化的Karush-Kuhn-Tucker乘子的双重应力信号,将其与15个几何检测器对比,发现其漏检碰撞的补充预警能力显著,结合后可提升制动可行碰撞的预警占比。

Comments 6 pages, 4 figures, 2 tables, submitted to the 13th International Conference on Automation, Robotics and Applications (ICARA 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10023 2026-08-12 cs.RO cs.CV cs.SY eess.SY 新提交 62%

Protection Levels for Vision-Based Pose Estimation

基于视觉的位姿估计的保护水平

Olivia Beyer Bruvik, Romeo Valentin, Marc R. Schlichting, Don Walker, Mykel J. Kochenderfer

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本研究扩展了现有视觉位姿估计框架,推导了适用于航空场景的非线性PnP问题保护水平算法,分析了相关因素对其的影响并展示了权衡关系,为视觉导航的完整性认证提供支持。

Comments 11 pages, 5 figures. Accepted for publication at the 2026 AIAA DATC/IEEE 45th Digital Avionics Systems Conference (DASC). O. Beyer Bruvik and R. Valentin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10249 2026-08-12 cs.LG 新提交 57%

STCAD: Scalable Trajectory Clustering and Anomaly Detection on Terabyte-Scale AIS Data

STCAD:针对TB级AIS数据的可扩展轨迹聚类与异常检测

Bertram Hage, Alexander Schiøtz, Felix Thomsen, Christian Rand, Peder Heiselberg

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 该研究提出STCAD框架,通过自定义BERT模型与CURE层次聚类实现TB级AIS轨迹的无监督聚类,结合重构损失与聚类噪声分配检测异常,在国家级AIS数据集上验证了方法的有效性。

Comments Accepted at IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06811 2026-08-12 cs.RO 版本更新 57%

A 26-Gram Tailless Butterfly-Inspired Flapping-Wing Robot with Onboard Attitude Control

一种26克受蝴蝶启发的机器人实现自主无尾飞行

Weibin Gu, Chenrui Feng, Lian Liu, Chen Yang, Xingchi Jiao, Yuhe Ding, Xiaofei Shi, Chao Gao, Alessandro Rizzo, Guyue Zhou

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Department of Electronics and Telecommunications(电子电信系) School of Vehicle and Mobility(车辆与移动系统学院) Xinchen Qihang Inc.(新晨启航有限公司)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 AirPulse 是一种26克受蝴蝶启发的无尾飞行机器人,通过低频拍打和分层控制实现自主飞行,为解码蝴蝶飞行动态和开发抗碰撞空中机器人提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03495 2026-08-12 cs.RO 版本更新 57%

Navigating in Uncertain Environments with Heterogeneous Visibility

在不确定环境中利用异质可见性导航

Jongann Lee, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种基于异质可见性的导航算法,通过优化观察奖励与通行成本之和,有效降低导航成本并提升信息获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17005 2026-08-12 cs.RO cs.SY eess.SY 版本更新 57%

Autonomous Exploration-Based Precise Mapping for Mobile Robots through Stepwise and Consistent Motions

基于逐步一致运动的移动机器人自主探索精准建图

Muhua Zhang, Lei Ma, Ying Wu, Kai Shen, Yongkui Sun, Henry Leung

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种面向采用激光SLAM的室内移动机器人的自主探索框架,通过多RRT采样、逐步一致运动等策略提升建图精度与鲁棒性,经仿真与真实实验验证其优于基准2D算法。

Comments 8 pages, 11 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09975 2026-08-12 physics.ao-ph 新提交 50%

A black-box-model-enhanced interaction method for water-wave scattering by large group of arbitrary-shaped ice floes in Arctic route planning

北极航线规划中大量任意形状浮冰水波散射的黑箱模型增强交互方法

Chongwei Zhang, Hongli Yang, Peng Wu, Peng Lu, Dezhi Ning

专题命中 具身导航 :navigation(abstract)

AI总结 本研究提出WCD黑箱模型构建DTM,开发EI方法高效预测北极航线中大量任意形状浮冰的水波场,结合动态规划优化航线,可使船舶平均波幅降至入射波幅约一半,计算效率极高。

Comments 31 pages, 37 figures; submitted to Cold Regions Science and Technology on March 22, 2025; received first revision request on March 18, 2026; submitted first revision on April 7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25639 2026-08-12 eess.SP 版本更新 50%

Optimization-Based Velocity-Integral Sliding-Window Coarse Alignment: Attitude Error Analysis and Validation

基于优化的速度积分滑窗粗对准:姿态误差分析与验证

Xuyang Jiang, Xiyuan Chen, Weiming Jing

专题命中 具身导航 :navigation(abstract)

AI总结 针对GNSS辅助滑窗速度积分粗对准,提出一阶姿态误差传播模型,通过解析传播传感器误差并利用Davenport q方法建立映射,推导确定性偏移和协方差,蒙特卡洛和实车实验验证了模型准确性。

Comments 17 pages, 6 figures, including Supplementary Material; revised version of arXiv:2606.25639v2

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 9 篇

2608.10386 2026-08-12 cs.LG cs.RO 新提交 81%

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving

Dreamer-SAC:用于样本高效自动驾驶的潜世界模型离线策略学习

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出Dreamer-SAC框架,结合循环状态空间世界模型与离线策略SAC算法,在自动驾驶场景中优于DreamerV3、SAC等基线,且所需真实环境交互更少。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10107 2026-08-12 cs.CV 新提交 79%

4D-WAM: 4D Consistent World Modeling for Autonomous Driving

4D-WAM:面向自动驾驶的4D一致世界建模

Jiacheng Fu, Yibo Yuan, Meng Tian, Yue Li, Jiangtong Zhu, Jianhua Han, Yueyi Zhang, Jianwu Fang, Jianru Xue, Hang Xu, Zhiwei Xiong

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出4D-WAM模型,通过几何基础模型的训练时监督与面向决策的时间步长采样策略,提升自动驾驶中世界-动作模型的4D场景一致性,在NAVSIM-v1、NAVSIM-v2基准上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10222 2026-08-12 eess.SP 新提交 78%

A JEPA-Based Field-Layer World Model for Bridging Channel Prediction and Estimation

一种基于JEPA的场层世界模型,用于衔接信道预测与估计

Yuzhi Yang, Brahim Mefgouda, Hang Zou, Lina Bariah, Anis Bara, Yuhuan Lu, Hao Zhang, MérouaneDebbah

专题命中 具身推理 :world model(title,abstract)

AI总结 该研究针对MIMO-OFDM无线系统中CSI预测鲁棒性差的问题,提出基于JEPA的场层世界模型,通过多尺度对齐策略实现跨频段重构,显著提升了波束成形增益。

Comments submitted to IEEE trans

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10864 2026-08-12 cs.CV 新提交 70%

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

面向视觉语言模型空间推理的多视图关系蒸馏

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交 62%

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10439 2026-08-12 cs.CV 新提交 57%

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

流强制:构建用于鲁棒流视频生成的统一训练轨迹

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics(地平线机器人) Anyverse Dynamics

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-12 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: https://github.com/boschresearch/TASE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12231 2026-08-12 cs.LG 版本更新 57%

Temporal Straightening for Latent Planning

时间拉直用于隐式规划

Ying Wang, Oumayma Bounou, Gaoyue Zhou, Randall Balestriero, Tim G. J. Rudner, Yann LeCun, Mengye Ren

机构 * New York University(纽约大学) Brown University(布朗大学) University of Toronto(多伦多大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 受人类视觉处理中感知拉直假说启发,提出时间拉直方法,通过曲率正则化联合学习JEPA世界模型的编码器和预测器,改善隐式规划中的表示学习,使梯度规划更稳定并提高目标到达任务成功率。

Comments ICML2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01073 2026-08-12 q-bio.NC 版本更新 50%

The Modeler-Schema Theory of Consciousness: Diffuse Awareness, Focal Experience, and a Saccadic Consistency Experiment

意识的模型者图式理论,附可证伪实验

Frank Heile

专题命中 具身推理 :world model(abstract)

AI总结 提出意识源于单一控制代理——模型者图式,它监控模型者构建内部世界模型的过程,通过将模型者输出转化为感受质产生体验,并用于模型优化;通过扫视变化检测实验区分两种自下而上注意请求,为意识难题提供可检验方案。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2608.10393 2026-08-12 cs.AI cs.RO 新提交 84%

Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models

隐藏于明处:针对视觉-语言-动作模型的基于扩散的无约束机器人攻击

Jiahui Han, Yuhui Yao, Xin Wang, Jiafei Cao, Mingxuan Zhang, Danfeng Shan, Huiqi Deng, Guanchu Wang, Xia Hu

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出基于扩散的无约束机器人攻击方法DURA,针对视觉-语言-动作模型生成自然对抗补丁,实验表明其性能优于现有方法,暴露了物理部署的VLA模型的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28803 2026-08-12 cs.CV cs.LG 版本更新 62%

HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models

Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 4 篇

2608.09138 2026-08-12 cs.RO cs.AI 版本更新 74%

SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning

SpeedTuning:用轻量强化学习加速策略执行

David D. Yuan, Tony Z. Zhao, Kaylee Burns, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(journal_ref)

AI总结 SpeedTuning是一种轻量强化学习框架,可预测动作最优执行速度,在无需额外数据采集的情况下,将机器人操作策略加速超2.4倍且保持足够成功率,适用于多种动态精确任务。

Comments 10 pages, 12 figures. This arXiv version includes an appendix with qualitative simulation rollouts and additional ablations. Published at ICRA 2025

Journal ref 2025 IEEE International Conference on Robotics and Automation (ICRA), pp. 1184-1192, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00642 2026-08-12 cs.AI cs.LG 版本更新 73%

Coachable agents for interactive gameplay

可指导的交互式游戏智能体

Roberto Capobianco, Harm van Seijen, Nolan D. Bard, Neil Burch, Fatima Davelouis, Josh Davidson, Alisa Devlic, Yunshu Du, Ishan Durugkar, Siddhant Gangapurwala, Daniel Hernandez, G. Zacharias Holland, Sahil Jain, Kenta Kawamoto, Raksha Kumaraswamy, Patrick MacAlpine, Dustin R. Morrill, Declan Oller, Francesco Riccio, Akanksha Saran, Craig Sherstan, Kaushik Subramanian, Thomas J. Walsh, Samuel Barrett, Kizza N. Frisbee, Mady Govil, Johannes Günther, Varun R. Kompella, James A. MacGlashan, Maxwell Svetlik, Michael D. Thomure, Jaden B. Travnik, Kevin Waugh, Elahe Aghapour, Florian Fuchs, Andreanne Lemay, Shruti Mishra, Takuma Seno, Peter Stone, Michael Spranger, Peter R. Wurman

机构 * Sony AI, Zurich, Switzerland(索尼AI,苏黎世,瑞士) Sony AI, North America (various locations)(索尼AI,北美(多地)) Sony AI, Tokyo, Japan(索尼AI,东京,日本)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出结合通用价值函数近似器与精心选择的训练场景、学习算法和数据增强的框架,使智能体在复杂领域(如《地平线:西之绝境》、《GT赛车》和类人机器人)中实时展现不同风格,同时保持主任务性能。

Comments Source code: https://github.com/SonyResearch/coachable_agents - Videos: https://drive.google.com/drive/folders/19F5uKziT_zkDurze5sy5iMFD4BHfD3lV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04744 2026-08-12 cs.LG cs.AI 62%

Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework

Yongxin Deng, Xihe Qiu, Jue Chen, Xiaoyu Tan

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

Journal ref Knowledge-Based Systems, 322 (2025) 113689

详情

展开后加载摘要…

URL PDF HTML 收藏