arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-22 至 2026-07-22 共收录 85 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 23 篇

2607.19274 2026-07-22 cs.RO 新提交 70%

Eversion-based robots can enable safe access,steering and endoscopic imaging within the spinal subarachnoid space

基于外翻的机器人可实现脊髓蛛网膜下腔内的安全进入、转向和内窥镜成像

Zicong Wu, Panagiotis Kalozoumis, S. M. Hadi Sadati, Aminul I. Ahmed, Jonathan Shapey, Christian Baker, Thomas Booth, Wenfeng Xia, Sebastien Ourselin, Panagiotis Vartholomeos, Christos Bergeles

机构 * King’s College London(伦敦国王学院) University of Thessaly(色萨利大学) Queen Mary University London(伦敦玛丽女王大学) Institute of Psychiatry, Psychology & Neuroscience, King’s College London(伦敦国王学院精神病学、心理学与神经科学研究所)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究脊髓蛛网膜下腔安全导航问题,提出直径2毫米的外翻生长机器人平台,经多种验证,该平台能实现摩擦最小化伸展和转向,为鞘内干预建立基础,后续还需更大队列和生理条件下的进一步验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13791 2026-07-22 cs.RO cs.CV cs.HC cs.LG 67%

Learning to Assess Danger from Movies for Cooperative Escape Planning in Hazardous Environments

学习从电影中评估危险以进行合作逃离规划在危险环境中

Vikram Shree, Sarah Allen, Beatriz Asfora, Jacopo Banfi, Mark Campbell

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出利用电影数据训练机器人评估危险,结合多模态信息提升人机合作逃离效率。

Comments 8 pages, 8 figures Accepted for publication at 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13830 2026-07-22 cs.RO cs.CV 版本更新 62%

Recursive ArUco Markers: A Scalable Fiducial Marker Design for Unmanned Aerial Vehicle Landing Pads

递归ArUco标记:一种用于无人机着陆垫的可扩展基准标记设计

Rafael Munoz-Salinas, Francisco Jose Romero-Ramirez, Sergio Garrido-Jurado

机构 * Universidad de Córdoba(科尔多瓦大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究针对无人机着陆依赖的视觉基准标记操作范围有限问题,提出递归ArUco标记设计,通过改进位采样策略实现任意深度递归、遮挡下稳健检测及多唯一标识符字典,使无人机机队可同时在指定位置着陆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18537 2026-07-22 cs.RO cs.AI 版本更新 62%

SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction

SKETCH: 面向长时域船舶轨迹预测的语义关键点条件建模

Linyong Gan, Zimo Li, Wenxin Xu, Xingjian Li, Jianhua Z. Huang, Enmei Tu, Shuhang Chen

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) COSCO SHIPPING Advanced Technology Institute, Shanghai, China(中远海运技术研究院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 针对长时域轨迹预测中方向漂移问题,提出基于语义关键点(NKP)的条件轨迹建模框架,将预测分解为全局语义决策与局部运动建模,采用预训练-微调策略估计NKP先验,在真实AIS数据上显著提升长时域、方向精度和细粒度预测性能。

Comments Final Camera-Ready Version. Accepted by ICML 2026 (PMLR Vol. 306)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08926 2026-07-22 cs.RO 版本更新 61%

Fly, Track, Land: Infrastructure-less Magnetic Localization for Heterogeneous UAV-UGV Teaming

飞行、跟踪、着陆:一种无基础设施的磁感应定位用于异构无人机-地面车辆协同

Valerio Brunacci, Davide Plozza, Alessio De Angelis, Michele Magno, Tommaso Polonelli

机构 * Department of Engineering, University of Perugia(工程系,佩鲁吉亚大学) Multi-Robot Systems Group, Faculty of Electrical Engineering, Czech Technical University in Prague(多机器人系统组,电气工程系,布拉格捷克技术大学) D-ITET Department, ETH Zürich(D-ITET部门,苏黎世联邦理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 该研究提出一种无基础设施的磁感应定位系统,使无人机在移动地面车辆上实现厘米级精度的自主悬停、跟踪和着陆。

Comments Revised version submitted to Robotics and Autonomous Systems (Elsevier). Supplementary video available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19284 2026-07-22 cs.RO 新提交 57%

Stochastic Multi-Objective Kinodynamic Planning Against Adversaries

针对对手的随机多目标运动动力学规划

Thomas Marshall Vielmetti, Daniel Cherenson, Dimitra Panagou

机构 * University of Michigan(密歇根大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究在含随机混合对手环境下的多目标运动动力学规划,核心方法是将规划空间转移到闭环策略序列,通过蒙特卡洛粒子展开评估风险,引入SMO-RRT和SMO-SST算法,推导有限样本界,实现概率安全规划。

Comments 8 pages, 1 figure, accepted to CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19174 2026-07-22 cs.RO 新提交 57%

Bayesian Retraction Optimization for Tissue Attachment Mapping in Surgical Dissection

用于手术解剖中组织附着映射的贝叶斯回缩优化

Shing-Hei Ho, Bao Thach, Toan Vo, James M. Ferguson, Alan Kuntz

机构 * The Robotics Center and the Kahlert School of Computing at the University of Utah(美国犹他大学机器人中心和卡尔特计算学院) School of Computational Science and Engineering, Georgia Institute of Technology(美国佐治亚理工学院计算科学与工程学院) Department of Electrical and Computer Engineering and Department of Computer Science, Vanderbilt University(美国范德堡大学电气与计算机工程系和计算机科学系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 针对外科医生短缺,该研究将组织附着识别视为概率问题,提出基于顺序贝叶斯希尔伯特地图和贝叶斯回缩优化的方法,避免显式组织建模,在模拟中验证并实现向实际机器人解剖实验的零样本转移,为自动化手术解剖提供新途径。

Comments IEEE IROS 2026 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18910 2026-07-22 cs.LG 新提交 57%

Breaking Feedback-Blindness: Utility-Augmented Transformer for Sequential Decision Making

打破反馈盲目性:用于序列决策的效用增强Transformer

Yuyang Shen, Shan Dai, Daimin Chen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) University of International Business and Economics(对外经济贸易大学)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 研究非平稳和部分可观测环境下序列决策问题,提出效用增强Transformer(UAT),通过紧凑效用状态调制注意力检索,解决现有模型反馈盲目性问题,在四个非平稳基准测试中性能优于其他基线。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18517 2026-07-22 cs.RO 新提交 57%

Beyond Fixed Goal Delivery: Online POMDP Planning for Target Interception in Crowds

超越固定目标交付:人群中目标拦截的在线部分可观测马尔可夫决策过程规划

Himanshu Gupta, Kelvin Aladum, Nisar Ahmed, Bradley Hayes, Zachary Sunberg

机构 * Dept. of Aerospace Engineering Sciences(航空航天工程科学系) Dept. of Computer Science, University of Colorado Boulder(科罗拉多大学博尔德分校计算机科学系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究拥挤环境中目标拦截问题,将其建模为部分可观测马尔可夫决策过程,用树搜索在线求解。对比顺序路径速度规划器和统一规划器,发现高密度时前者安全拦截率低、耗时多,揭示了空间限制的结构局限性。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13715 2026-07-22 cs.CV 版本更新 57%

MVGD-Net: A Novel Motion-aware Video Glass Surface Detection Method

MVGD-Net: 一种新颖的运动感知视频玻璃表面检测网络

Yiwei Lu, Hao Huang, Tao Yan

机构 * Tao Yan(谭燕)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 MVGD-Net通过利用视频中运动不一致特性,提出新颖网络检测玻璃表面,结合多模块融合与大规模数据集提升检测性能。

Comments This paper has been accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI-26). It contians 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17913 2026-07-22 cs.AI 版本更新 57%

Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents

学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架

Jinjie Wei, Jiyao Liu, Lihao Liu, Ming Hu, Junzhi Ning, Mingcheng Li, Weijie Yin, Junjun He, Xiao Liang, Chao Feng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Amazon(亚马逊) Shanghai Innovation Institute(上海创新研究院) ByteDance Douyin Content Group(字节跳动抖音内容部)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。

Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18702 2026-07-22 quant-ph 新提交 50%

A Reversible Continuous-Variable Photonic Memory Architecture Based on Displacement-Evolved Coherent-State Dynamics

基于位移演化相干态动力学的可逆连续变量光子存储架构

Sanjit Krishna G M

专题命中 具身导航 :navigation(abstract)

AI总结 研究基于位移演化相干态动力学,引入元数据辅助的连续变量光子存储架构,结合多模存储与元数据索引,能实现历史存储状态的导航和重建,为未来元数据感知存储架构提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18390 2026-07-22 astro-ph.CO gr-qc hep-ph physics.ins-det 新提交 50%

GUEST: Gravitational Universe Exploration with Satellite Tracking. A passive satellite laser-ranging mission for the dark gravitational Universe

GUEST:利用卫星跟踪进行引力宇宙探索。一项针对暗引力宇宙的被动卫星激光测距任务

Diego Blas, Aurélien Hees, F. Javier Atapuerca, Giada Bargiacchi, Massimo Bassan, Joshua N. Benabou, Bruno Bertrand, Adrien Bourgoin, Clare Burrage, Nicolò Burzillà, Alfonso Caldiero, Roberto Campagnola, Andrea Caputo, Ana Caramete, Laurentiu Caramete, Joan Manel Casalta Escuer, Julien Chabé, Gabriel Chiritoi, Marco Cinelli, Florin-Ioan Constantin, Neil J. Cornish, Clément Courde, Simone Dell'Agnello, Alessandro Di Marco, Sebastian Ellis, Malcolm Fairbairn, Ariadna Farrés, Joshua W. Foster, Silvia Gasparotto, Marta Goli, Yann Gouttenoire, Michael Häfner, Antonio J. Iovino, Maria-Catalina Isfan, Justin Janquart, Alexander C. Jenkins, Jean-Paul Kneib, Sébastien Le Maistre, David Lucchesi, Marco Lucente, Angus Macdonald, Jorge Martín Camalich, Rosa Martínez Rubiella, Josep J. Masdemont, Ilia Musco, Toshimichi Otsubo, Cristóbal Padilla, Fco. Rogelio Palomo Pinto, Alice Paun, Alice Perego, Roberto Peron, Florentina-Crenguta Pislan, Florin Adrian Popescu, Luca Porcelli, Nanda Rea, Rafael Rebolo, Marco Reyes, Ignasi Ribas, José C. Rodríguez, Pascal Rosenblatt, Albert Roura, Soumen Roy, Mariano Sánchez Nogales, Francesco Santoli, Feliciana Sapio, Anja Schlicht, Ulrich Schreiber, Angela Serrano, Daniel Serrano Lombillo, Alberto Sesana, Carlos F. Sopuerta, Krzysztof Sośnica, Nicola Tamanini, Elisa Todarello, Sokratis Trifinopoulos, Miguel Vanvlasselaer, Dario Vetrano, Massimo Visco, Hanxi Wang, Xiao Xue, Miguel Zumalacárregui

专题命中 具身导航 :navigation(abstract)

AI总结 GUEST旨在探测微赫兹频段引力波,通过两个部署在高偏心率地球轨道的被动球体,由卫星激光测距站跟踪至少10年。它能开展多领域科学计划,如搜索超大质量黑洞双星引力波、探测超轻暗物质等,在引力波探测等方面有重要贡献。

Comments 23 pages, 14 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22147 2026-07-22 cs.DS 版本更新 50%

Optimal-Time Move Structure Construction

最优时间移动结构构造

Nathaniel K. Brown, Ahsan Sanaullah, Shaojie Zhang, Ben Langmead

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出一种最优时间与空间的移动结构构造算法,用于高效表示和导航排列,尤其在r远小于n时能显著压缩空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17238 2026-07-22 cs.HC 版本更新 50%

Actionable Guidance Outperforms Map and Compass Cues in Demanding Immersive VR Wayfinding

可操作指导在 demanding immersive VR 导航中优于地图和指南针提示

Apurv Varshney, Lily M. Turkstra, Jiaxin Su, Mable Zhou, Scott T. Grafton, Barry Giesbrecht, Mary Hegarty, Michael Beyeler

专题命中 具身导航 :navigation(abstract)

AI总结 本文比较了三种VR导航技术:方向箭头、迷你地图和指南针,发现箭头指导在导航性能上最佳,提示在沉浸式导航中直接转化为行动提示的界面更有效。

Comments AV and LMT contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08745 2026-07-22 cs.IR 版本更新 50%

Towards Full Candidate Interaction: A Comprehensive Comparison Network for Better Route Recommendation

迈向完整候选交互:一种全面比较网络用于更好的路线推荐

Hanyu Guo, Chao Chen, Longfei Xu, Chengzhang Wang, Kaikui Liu, Xiangxiang Chu

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出全面比较网络(CCN)用于改进路线推荐,通过比较非重叠段构建特征,解决路线推荐中的独特挑战,并在AMAP中成功部署。

Comments Accepted by the ACM Conference on Recommender Systems 2026 (RecSys '26), Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03642 2026-07-22 cs.CG 版本更新 50%

Generalized k-Cell Decomposition for Visibility Planning in Polygons

多边形中用于可见性规划的广义 k 单元分解

Yeganeh Bahoo, Sajad Saeedi, Roni Sherman

专题命中 具身导航 :robotic(abstract)

AI总结 研究多边形环境追逃问题,提出广义 k 单元分解方法,通过纳入特定可见性多边形扩展现有工作,构建分割线并证明正确性,实现可靠路径规划,为机器人监控开辟新途径,难点在于计算多边形和找分割线交点。

Comments Presented at the 32nd Annual Fall Workshop on Computational Geometry (FWCG 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 10 篇

2607.19343 2026-07-22 cs.CV cs.RO 新提交 86%

Masked Visual Actions for Unified World Modeling

用于统一世界建模的掩码视觉动作

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

机构 * Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学帕克分校) Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究如何将动作传达给视频模型用于机器人世界建模,提出掩码视觉动作这一像素空间控制接口,经微调后单个检查点在多场景和实施例中表现出色,在下游操作中能辅助策略评估、改进决策和支持逆建模。

Comments Project webpage: https://masked-visual-actions.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26182 2026-07-22 cs.CV cs.AI cs.LG 版本更新 85%

Lifting Embodied World Models for Planning and Control

提升具身世界模型用于规划与控制

Alex N. Wang, Trevor Darrell, Pavel Izmailov, Yutong Bai, Amir Bar

机构 * Computer Science, New York University(纽约大学计算机科学系) BAIR, UC Berkeley(伯克利大学BAIR)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出一种轻量级策略,将高层动作映射到低层关节动作序列,结合冻结的世界模型,实现预测未来观察的提升世界模型,有效降低规划复杂度。

Comments Accepted to ECCV2026. Edited policy masking

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交 81%

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18715 2026-07-22 cs.AI 新提交 79%

DWM: Separating World Effects from Actions in Latent World Models

DWM:在潜在世界模型中分离世界效应与动作

Yi-Ge Zhang, Tianqi Du, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究在潜在世界模型中分离世界效应与动作的问题,提出DWM框架,通过辅助世界头和正交性约束实现预测转换的显式加法分解,在构建的W变体基准测试中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18696 2026-07-22 cs.AI 新提交 79%

Do AI-Native Biotechs Need Departments? Benchmarking Company World Models for AI-Driven Drug Development

人工智能原生生物技术公司需要部门吗?人工智能驱动药物研发的公司世界模型基准测试

Yinan Wang

机构 * Noah AI Research(诺亚人工智能研究)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究人工智能原生生物技术公司组织模式,提出公司世界模型,用含45个案例的虚拟实验室基准测试,比较多种架构,发现价值转换架构表现优,核心操作原语应是资产到价值状态而非静态组织结构图,不过研究仅限虚拟实验室。

Comments Working paper. Includes public no-label benchmark cases and dry-lab evaluation artifacts. No wet-lab, patient-level, clinical, regulatory, or investment validation is claimed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18367 2026-07-22 cs.AI 新提交 79%

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

阿莱雅世界:交互式长视野世界建模——完整技术报告

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao

机构 * Alaya Lab(阿莱亚实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究旨在创建交互式视频世界模型,核心方法是基于15B视频扩散变压器构建阿莱雅世界,通过自回归生成短潜在块等实现多种能力,在iWorld - Bench上长视野生成性能最佳,为相关研究提供开源可扩展基础。

Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19191 2026-07-22 cs.CV cs.AI cs.LG 新提交 67%

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

ABot-World-0:在单台桌面GPU上进行无限交互式世界展开

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 介绍ABot-World-0这一用于实时长视野闭环交互的动作条件视频世界模型,利用多源数据学习世界动态。通过多种技术提炼模型,设计控制界面与部署堆栈,在单台桌面GPU上实现高效视频流传输,实验验证其有竞争力的可控性和世界演变能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18703 2026-07-22 cs.CV 新提交 57%

Generative World Renderer at the Speed of Play

以游戏速度运行的生成式世界渲染器

Guixu Lin, Zheng-Hui Huang, Siqi Yang, Ming-Hsuan Yang, Kaipeng Zhang, Zhixiang Wang

机构 * Alaya Lab(阿莱雅实验室) University of California, Merced(加州大学默塞德分校)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究如何提升生成式世界渲染器AlayaRenderer的速度,核心方法是将其重构为自回归流模型并引入轻量级编解码器,主要贡献是大幅降低推理成本,实现30 FPS可玩的生成式世界,保留核心渲染能力。

Comments Project page: https://alaya-renderer-flash.alayalab.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18565 2026-07-22 eess.SY cs.RO cs.SY 新提交 57%

Integrity-Gated Eco-CACC: Epistemic Admissibility for Cooperative Driving at Signalized Intersections

完整性门控生态协同自适应巡航控制:信号交叉口协同驾驶的认知可容许性

Lyes Saad Saoud, Moussa Ayyash

机构 * Chicago State University(芝加哥州立大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 研究信号交叉口Eco-CACC系统,提出完整性门控框架,结合多种因素构建统一完整性度量调节控制权,仿真表明其在模型一致时保持效率,完整性下降时能早期保守响应,解决现有方法在传感等问题下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12721 2026-07-22 cs.AI 版本更新 57%

The Theory of Mind Utility: Formal Specification of a Mentalizing Mechanism

心智理论效用:心理化机制的形式化规范

Nikolos Gurney, Stacy Marsella

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 提出心智理论效用(ToM-U)框架,通过局部认知世界模型(LEWM)形式化推断他人信念的计算问题,定义结构、推理过程及失败痕迹,区别于贝叶斯心智理论等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 8 篇

2607.16602 2026-07-22 cs.CV 版本更新 83%

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

PAVXploreRL:具有动作探索的物理动作视觉世界模型强化学习

Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fengjiao Cheng, Xiaodan Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Sun Yat-sen University(中山大学)

专题命中 模仿学习与强化学习 :world model(title,abstract);embodied AI(abstract);分类 cs.CV

AI总结 研究针对动作条件世界模型泛化性差的问题,提出PAVXploreRL强化学习框架,基于预训练潜在世界模型,通过奖励驱动训练优化PAV目标,联合利用ID轨迹与OOD动作探索提升泛化能力,实验证明该方法性能更优。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21638 2026-07-22 cs.AI cs.LG cs.MA cs.RO 版本更新 82%

Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assistive Robotics

Assistax: 一个用于辅助机器人的多智能体硬件加速强化学习基准

Leonard Hinckeldey, Elliot Fosong, Rimvydas Rubavicius, Elle Miller, Trevor McInroe, Fan Zhang, Patricia Wollstadt, Stefano V. Albrecht, Subramanian Ramamoorthy

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出Assistax基准,利用JAX硬件加速和基于多智能体强化学习的辅助机器人任务,实现高达370倍加速,并测试机器人的零样本协调能力。

Comments Accepted at the Reinforcement Learning Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18362 2026-07-22 cs.RO 新提交 70%

FARO: Feasibility-Aware Robot Motion Optimization

FARO:可行性感知机器人运动优化

Michal Ciebielski, Shafeef Omar, Aaron Johnson, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Advanced Study, Technical University of Munich(慕尼黑工业大学高级研究所) Carnegie Mellon University(卡内基梅隆大学) SIEMENS AG(西门子公司) Huawei-TUM joint laboratory(华为-慕尼黑工业大学联合实验室)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 针对机器人在未知场景快速规划新行为的挑战,提出嵌套运动动力学框架,结合可行性引导树搜索和大语言模型采样策略,能改善搜索过程,生成的轨迹可用强化学习控制器跟踪,质量高可用于实际运动操作场景。

详情

展开后加载摘要…

URL PDF HTML 收藏