arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-05 至 2026-08-05 共收录 34 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2604.25459 2026-08-05 cs.RO 版本更新 86%

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

专题命中 机器人学习 :robot learning(title);embodied AI(abstract);manipulation(abstract);navigation(abstract)

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 11 篇

2605.22882 2026-08-05 cs.CV cs.RO 版本更新 89%

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 机器人操作 :world model(title,abstract);manipulation(title,abstract);分类 cs.RO、cs.CV;robotic(comments)

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13040 2026-08-05 cs.RO 版本更新 88%

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试

Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) China University of Mining Technology(中国矿业大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15065 2026-08-05 cs.RO cs.CV cs.LG 版本更新 87%

DriftWorld: Fast World Modeling through Drifting

DriftWorld:通过漂移实现快速世界建模

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 机器人操作 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对预测性世界模型生成展开慢的问题,提出基于漂移生成模型的DriftWorld,训练时学习动作条件漂移以快速生成未来帧,在机器人操作基准测试中实现快速准确决策,还能作离线模拟器,性能优于基于扩散的基线。

Comments Website at https://susie-lu.github.io/driftworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12341 2026-08-05 cs.CV 版本更新 79%

Bridging the Micro--Macro Gap: Frequency-Aware Semantic Alignment for Image Manipulation Localization

弥合微-宏观差距:面向图像操纵本地化的频率感知语义对齐

Xiaojie Liang, Zhimin Chen, Ziqi Sheng, Wei Lu

机构 * School of Computer Science Engineering, Sun Yat-sen University Guangzhou China Engineering, Sun Yat-sen University

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 本文提出FASA框架,通过自适应双频带DCT模块提取操纵敏感频率特征,结合冻结CLIP表示的补丁级对比对齐学习语义先验,实现传统和扩散生成操纵的精准本地化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 75%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18933 2026-08-05 cs.RO cs.AI 版本更新 73%

Gated Memory Policy: In-Context Memorization and Adaptation

门控记忆策略

Yihuai Gao, Jeff Jinyun Liu, Shuang Li, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出门控记忆策略,通过学习记忆回溯时机与内容,提升机器人操作任务中对历史信息的利用效率,实现在非马尔可夫任务中性能提升30.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07622 2026-08-05 cs.RO 版本更新 57%

Continuous and large-scale: ELEANOR, the soft architected arm inspired by the elephant trunk

连续且大规模:受象鼻启发的软结构手臂ELEANOR

Giovanna A. Naselli, Anderson B. Nardin, Seonggun Joe, Ryan Drinkwater, Enrico Donato, Diego Bianchi, Egidio Falotico, Michel C. Milinkovitch, Lucia Beccai

机构 * Soft BioRobotics Perception Laboratory, Istituto Italiano di Tecnologia(软生物机器人感知实验室,意大利理工学院) Department of Autonomous Systems Engineering, Korea Aerospace University(自主系统工程系,韩国航空航天大学) Photocentric Ltd.(Photocentric公司) BRAIR lab, The BioRobotics Institute, Scuola Superiore Sant’Anna(BRAIR实验室,生物机器人研究所,圣安娜高等学院) Laboratory of Artificial and Natural Evolution, Department of Genetics and Evolution, University of Geneva(人工与自然进化实验室,基因与进化系,日内瓦大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 以非洲象鼻为模型,提出注重结构连续性和动态特性的设计方法,通过3D打印构建结合腱驱动的连续体手臂,实现对不同物体的全身抓握,突出了仿生设计在机器人技术中的应用及与生物象鼻的比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08469 2026-08-05 cs.RO cs.SY eess.SY 版本更新 57%

Electrostatic Clutch-Based Mechanical Multiplexer with Increased Force Capability

基于静电离合器的机械多路复用器及其增强的力能力

Timothy E. Amish, Jeffrey T. Auletta, Chad C. Kessens, Joshua R. Smith, Jeffrey I. Lipton

机构 * Dept of Electrical and Computer Engineering, University of Washington(华盛顿大学电气与计算机工程系) US Army Research Directorate, DEVCOM Army Research Laboratory(美国陆军研究署, DEVCOM陆军研究实验室) Mechanical and Industrial Engineering Department of Northeastern University(东北大学机械与工业工程系)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于静电 capstan 离合器的机械多路复用器,实现单电机同时和顺序控制,展示在四自由度腱驱动机器人手中,单电机输出力达212N,垂直抓力提升4.09倍,水平承载力达111.2N。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20381 2026-08-05 cs.CL cs.AI cs.HC 版本更新 57%

The production of meaning in the processing of natural language

自然语言处理中意义产生的机制

Christopher J. Agostino, Quan Le Thien, Nayan D'Souza, Louis van der Elst

机构 * Department of Physics, Indiana University(印第安纳大学物理系) Department of Linguistics, Indiana University(印第安纳大学语言学系) Imperial College London(伦敦帝国学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。

Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06179 2026-08-05 cond-mat.mtrl-sci 版本更新 50%

Advances in Phonons: From Band Topology to Phonon Chirality

声子的进展:从带拓扑到声子手性

Tiantian Zhang, Yizhou Liu, Hu Miao, Shuichi Murakami

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文探讨了拓扑声子和圆极化声子的理论与实验进展,强调声子角动量与Weyl声子的关联,以及未来在量子技术中的应用潜力。

Comments Comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13358 2026-08-05 cs.CR cs.SE 版本更新 50%

GraphQLer: Enhancing GraphQL Security with Context-Aware API Testing

GraphQLer:通过上下文感知API测试增强GraphQL安全性

Omar Tsai, Jianing Li, Tsz Tung Cheung, Lejing Huang, Hao Zhu, Jianrui Xiao, Iman Sharafaldin, Mohammad A. Tayebi

专题命中 机器人操作 :manipulation(abstract)

AI总结 GraphQLer是一款开源GraphQL API安全测试框架,通过构建依赖图合成漏洞链,在多类API上的漏洞检测和覆盖率表现显著优于ZAP、EvoMaster等基线工具。

Comments Publicly available on: https://github.com/omar2535/GraphQLer

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 6 篇

2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 85%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 具身导航 :world model(title,abstract);embodied agent(abstract);navigation(abstract);分类 cs.CV

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26798 2026-08-05 physics.bio-ph cond-mat.soft cond-mat.stat-mech q-bio.MN 版本更新 78%

Navigation driven by bidirectional information transmission between sensing and actuation

由感知与执行之间双向信息传输驱动的导航

Avishek Das, Pieter Rein ten Wolde

专题命中 具身导航 :navigation(title,abstract)

AI总结 该研究通过解析模型提出行为状态方程(BESTs),证实感知与执行的双向信息传输是导航的组织原则,且经大肠杆菌趋化性模拟验证。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19138 2026-08-05 cs.CR cs.AI cs.LG cs.SE 版本更新 62%

AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection

AgenticSCR: 一种用于检测初期漏洞的自主代理安全代码审查

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

机构 * The University of Melbourne(墨尔本大学) Monash University(莫纳什大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 AgenticSCR通过结合LLMs、自主决策和语义记忆,有效检测预提交阶段的初期漏洞,优于传统SAST工具和静态LLM基线。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE'26 Industry-Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20482 2026-08-05 cs.AI cs.CL 版本更新 57%

PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails

PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试

Seungbin Yang, Chaewoon Ki, Dohyun Lee, Jaegul Choo, ChaeHun Park

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究针对用户指令不明确时网络代理需从浏览历史推断上下文的问题,引入PersonaTrail基准及偏好感知上下文记忆框架PACMem,利用浏览轨迹评估代理,实验证明PACMem优于现有基于记忆的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18660 2026-08-05 cs.RO 版本更新 57%

MVP-Tac: A Miniaturized Dual-Modal Vision and Photoelastic Tactile Sensor for Robot-Assisted Minimally Invasive Surgery

MVP-Tac:一种用于机器人辅助微创手术的小型化双模态视觉与光弹性触觉传感器

Md Rakibul Islam Prince, Jaeeun Kim, Yuhao Zhou, Mason Vrshek, Shivani Reddy Sama, Adyaa Khera, Sheeraz Athar, Zijie Xu, Jiabin Liu, Shaoting Lin, Wei Li, Yu She

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University(普渡大学埃尔莫尔电气与计算机工程学院) Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) Robotics Engineering Technology, Purdue University(普渡大学机器人工程技术学院) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系) Department of Mechanical Engineering, Michigan State University(密歇根州立大学机械工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究针对机器人辅助微创手术缺乏触觉反馈问题,介绍了MVP-Tac传感器,它采用反射光弹性成像,能在视觉触觉间切换,经力校准及肿瘤触诊等实验验证其有效性,为恢复RMIS中触诊并保持视觉反馈提供实用途径。

Comments 8 pages, 8 figures. To appear in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15169 2026-08-05 cs.CV 版本更新 57%

MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion

MeSS: 基于城市网格的户外场景生成与跨视角一致扩散

Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 3 篇

2608.01127 2026-08-05 cs.CV 版本更新 83%

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.CV

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25242 2026-08-05 cs.CV 版本更新 79%

Medical world models in healthcare: foundations, applications, and challenges for trustworthy clinical translation

医疗保健中的医学世界模型:可信临床翻译的基础、应用与挑战

Zhaoyan Chen, Zhongxiu Cong, Zhuanfeng Jin, Wanshu Fan, Dongsheng Zhou, Qi Ai, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) Department of Radiology, Xinhua Hospital Affiliated to Dalian University(大连大学附属新华医院放射科) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 探讨医学世界模型在医疗保健中的应用,通过结构化综合定义其领域相关内容,围绕四种能力组织,涵盖多方面证据,虽有早期可行性证据,但受多种因素限制,临床翻译需多方面保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21644 2026-08-05 cs.LG cs.SY eess.SY 版本更新 57%

Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations

迈向偏微分方程的目标无关联合嵌入预测控制

Jonathan Gallagher, Roberto Guglielmi

机构 * University of Waterloo(滑铁卢大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 该研究针对偏微分方程提出目标无关控制框架,基于联合嵌入预测架构,通过离线训练小型二维ViT编码器等,经模型预测路径积分控制器复用。在相关基准测试中,KE探测器规划提升奖励、降低误差,验证了潜在动力学与目标无关及校准可观测量用于状态控制的优势。

Comments Associated code will be open sourced alongside a later, updated submission

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 1 篇

2608.02326 2026-08-05 cs.RO 版本更新 79%

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

ChainVLA:通过统一执行状态串联视觉-语言-动作查询以实现长 horizon 操纵

Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 ChainVLA 是 12 亿参数的 VLA 策略,通过联合可修订的执行状态串联查询,结合进展上下文与运动尾部,在长 horizon 操纵任务中大幅提升成功率, ablation 验证了两个组件的关键作用。

Comments 13 pages (9 main + 4 appendix), 4 figures. Project page: https://muqy1818.github.io/chainvla-web/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 4 篇

2603.13888 2026-08-05 cs.RO 版本更新 79%

Path-conditioned Reinforcement Learning-based Local Planning for Long-Range Navigation

基于路径条件的强化学习局部规划用于远距离导航

Mateo Haro, Julia Richter, Fan Yang, Cesar Cadena, Marco Hutter

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于强化学习的局部导航策略,利用路径信息作为上下文指导,提升远距离导航效率并保持在路径信息退化时的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 57%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20880 2026-08-05 stat.ML cs.LG stat.ME 版本更新 57%

Adversarial observations in probabilistic State-Space Models for robust Reinforcement Learning

概率状态空间模型中的对抗观测用于鲁棒强化学习

M. Santos-Pascual, D. Ríos Insua

机构 * Inst. Math. Sciences, Spanish Nat. Research Council, Madrid, Spain(西班牙国家研究委员会数学科学研究所,马德里)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 分析线性概率状态空间模型中受似然约束的对抗观测对潜在状态和策略决策的影响,为构建鲁棒强化学习系统提供理论基础,适用于机器人等安全关键领域。

Comments 42 pages, 10 figures, PREPRINT ONGOING: Revised version with additional theoretical results and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21145 2026-08-05 eess.SY cs.SY 版本更新 50%

Deep Reinforcement Learning for Adaptive Gain Tuning in Control of Teleoperation Manipulators with Joint Flexibility and Time-Varying Delays

具有关节灵活性和时变延迟的遥操作机器人控制中自适应增益调整的深度强化学习

Armin Attarzadeh, Mohammad Ali Ghaemifar, Alireza Khanzadeh, Soheil Ganjefar

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对含有关节灵活性和时变延迟的遥操作机器人控制问题,提出结合稳定P+d控制器与基于TD3算法的深度强化学习智能体的混合控制方法,可实时调整增益减少振动,为相关遥操作系统提供实用方案。

Comments 7 pages, 6 figures. Source code available at: https://github.com/ArminAttarzadeh/DRL-Controller-Gain-Tuner

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 人机交互与遥操作 2 篇

2607.22999 2026-08-05 cs.RO cs.AI cs.HC cs.LG 版本更新 67%

WCM: World-Cognition Model for Generalizable Human-Robot Interaction

WCM:用于通用人机交互的世界认知模型

Yuzhen Chen, KC Zhou

专题命中 人机交互与遥操作 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对机器人在物理任务交互困难的问题,提出基于SLAK架构和异步运行时的世界认知模型(WCM),引入人在回路教学模式,经思维链监督改进模型,在九个现实世界人机交互任务中平均成功率达73.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14068 2026-08-05 cs.RO 版本更新 57%

Stiffness Copilot: An Impedance Policy for Contact-Rich Teleoperation

刚性助手:一种用于接触丰富的远程操作的阻抗策略

Yeping Wang, Zhengtong Xu, Pornthep Preechayasomboon, Ben Abbatematteo, Amirhossein H. Memar, Nick Colonnese, Sonny Chan

专题命中 人机交互与遥操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出Stiffness Copilot,一种基于视觉的共享控制策略,通过在线调整机器人刚度实现安全高效的接触丰富任务远程操作。

Comments Accepted to IROS 2026. Project website: https://stiffness-copilot.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 机器人数据与评测 5 篇

2606.15673 2026-08-05 cs.AI cs.LG 版本更新 62%

Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking

哪里出错了?基于语义状态追踪的Web智能体过程级评估

Jiwan Chung, JiHyuk Byun, Vibhav Vineet, Seon Joo Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出WebStep基准,通过语义MDP追踪过程状态,揭示隐藏于终端成功率下的智能体差异,并定位具体改进方向。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28114 2026-08-05 cs.AI 版本更新 57%

Language model agents show in-group trust bias invisible to standard behavioural audits

指令调优语言模型代理中类似人类的内群体偏见

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏