arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-13 至 2026-08-13 共收录 73 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 11 篇

2604.03236 2026-08-13 cs.HC cs.CL 版本更新 50%

BLADE: Better Language Answers through Dialogue and Explanations

BLADE:通过对话和解释提升语言答案

Chathuri Jayaweera, Phoebe Huang, Bonnie J. Dorr

机构 * University of Florida(佛罗里达大学)

专题命中 具身导航 :navigation(abstract)

AI总结 BLADE通过引导学习者接触相关教学资源而非直接提供答案,提升学生对课程资源的导航能力和概念理解。

Comments Contains 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 11 篇

2607.00836 2026-08-13 cs.RO cs.AI cs.SY eess.SY 版本更新 90%

From World Models to World Action Models: A Concise Tutorial for Robotics

从世界模型到世界动作模型:面向机器人学的简明教程

Xiaoxiong Zhang, Xiong Zeng, Wei Zhang

专题命中 具身推理 :robotics(title,abstract);world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本教程提出世界模型作为动作条件预测模型的设计空间视图,分类为观测空间和状态空间模型,并引入世界动作模型,总结四种代表性范式,为具身预测与控制提供结构化分类。

Comments Project page: https://clearlab-sustech.github.io/WorldModelSurvey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09305 2026-08-13 cs.RO 83%

Embodied intelligent industrial robotics: Framework and techniques

具身智能工业机器人:框架与技术

Chaoran Zhang, Chenhao Zhang, Zhaobo Xu, Qinghongbing Xie, Jinliang Hou, Pingfa Feng, Long Zeng

专题命中 具身推理 :robotics(title,abstract);world model(abstract);分类 cs.RO

AI总结 本文提出了一种新的基于知识的具身智能工业机器人框架,旨在提升工业机器人在复杂环境中的智能水平和应用潜力。

Comments 70 pages, 13 figures. The associated project can be found at https://github.com/jackyzengl/EIIR

Journal ref Journal of Manufacturing Systems 88 (2026) 158-189

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12078 2026-08-13 cs.CV cs.AI cs.LG 新提交 83%

Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models

更好的槽,更好的世界:以对象为中心的世界模型中的表示质量与鲁棒性

Shukrullo Nazirjonov, Sai Prasanna, Anna Manasyan, Georg Martius

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 该研究通过受控实验分析以对象为中心的世界模型,发现槽质量与规划成功率正相关,槽绑定良好时可减少辅助输入,且在分布偏移下其鲁棒性优于LeWM,预训练特征是鲁棒性关键因素。

Comments Published at Model-Based RL in the Era of Generative World Models Workshop at RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09730 2026-08-13 cs.CV cs.RO 交叉投稿 81%

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

世界令牌:通过训练时世界建模增强具身策略

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

机构 * JIUTIAN Research(九天研究院) Zhongguancun Academy(中关村学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-13 cs.RO cs.CV 版本更新 81%

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07303 2026-08-13 cs.LG 版本更新 80%

Bootstrap Theory of Representational Emergence: Explanatory Insufficiency as a Driver of Representation Learning and World Models

表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力

Jacques Raynal, Pierre Slangen, Elsa Raynal, Jacques Margerit

机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。

Comments 27 pages, 25 references, no figures or tables. Conceptual framework on representational emergence and explanatory insufficiency, with implications for representation learning, world models, autonomous AI, and scientific discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11601 2026-08-13 cs.CV 新提交 79%

How Can Driving World Models Do Counterfactual Prediction?

驾驶世界模型如何能进行反事实预测?

Jiaru Zhang, Can Cui, Yi Xu, Xin Ye, Ruqi Zhang, Ziran Wang

机构 * Purdue University(普渡大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文指出驾驶世界模型的反事实预测目标与直接动作条件预测存在根本差距,构建基准验证该问题,并提出简单无训练流程提升反事实预测效果,呼吁开发更好的相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11174 2026-08-13 cs.RO 版本更新 79%

VIScore: Diagnosing Planning-Relevant Quality in Latent World Models

VIScore:诊断潜在世界模型中与规划相关的质量

Haiyu Wu, Randall Balestriero, Morgan Levine

机构 * Altos Labs(阿尔托斯实验室) Brown University(布朗大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 该研究针对潜在世界模型规划成功率与潜在空间属性脱节的问题,提出VIScore指标,覆盖编码器、预测器、规划器,在跨任务场景下斯皮尔曼相关性超0.75,可更好解释规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18064 2026-08-13 cs.AI 版本更新 79%

Towards Human Motion World Models via Executable Behaviour Representations

通过可执行模型理解人类行为

Rimvydas Rubavicius, Manisha Dubey, N. Siddharth, Subramanian Ramamoorthy

机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。

Comments Accepted in ECCV2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10915 2026-08-13 cs.AI 版本更新 77%

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

具身融合智能体:以人为中心的智能体人工智能新范式

Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Nanjing Medical University(南京医科大学) Nanjing University(南京大学) Renmin University of China(中国人民大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学) University of Glasgow(格拉斯哥大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(abstract,abstract_cn);embodied agent(abstract);分类 cs.AI

AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。

Comments 38 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08023 2026-08-13 cs.RO 版本更新 70%

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

4D-WAM:通过轨迹场将时空感知注入世界动作模型

Lishan Yang, Wenxuan Song, Xi Wang, Pingyue Sheng, Zheng Fang, Ziyang Zhou, Junjie He, Haodong Yan, Jiayi Chen, Nan Sun, Qiao Sun, Pengwei Wang, Lingqiao Liu, Yan Wang, Yuxiang Gao, Feras Dayoub, Haoang Li

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 5 篇

2608.12308 2026-08-13 cs.CV cs.AI 新提交 84%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 机器人基础模型 :navigation(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11363 2026-08-13 cs.RO cs.LG 新提交 73%

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人基础模型 :robot learning(abstract);robot policy(abstract);分类 cs.RO、cs.LG

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 62%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09448 2026-08-13 cs.RO cs.CV 版本更新 62%

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

VANE:通过未来视觉表示预测实现视觉-语言-动作模型的可靠测试时训练

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Li Auto Inc.(理想汽车)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出VANE框架,通过条件提示自适应、未来视觉后果学习及候选更新隔离评估的方法,提升VLA策略在闭环操纵中的可靠性,在SimplerEnv WidowX上将平均成功率提高3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 57%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 3 篇

2608.12063 2026-08-13 cs.RO cs.AI 新提交 81%

Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL

基于稀疏离线到在线强化学习从SMPC演示中学习移动操作

Martin Schuck, Maks Sorokin, Simone Manni, Duy Ta, Angela P. Schoellig, Marco Hutter, Simon Le Cleac'H, Jan Brüdigam

机构 * RAI Institute(RAI研究所) Technical University of Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究利用仿真中SMPC生成的离线数据,结合稀疏奖励训练离策略RL智能体,整合动态稳定性控制器,实现机器人移动操作技能的仿真到真实迁移,性能超越原最优控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11350 2026-08-13 cs.CL cs.RO 新提交 79%

Self-Evolving Embodied Agents via Skill-Harness Evolution

基于技能-工具链进化的自演化具身智能体

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * Microsoft Research(微软研究院) Northeastern University(东北大学)

专题命中 模仿学习与强化学习 :embodied agent(title,abstract);分类 cs.RO

AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12306 2026-08-13 cs.LG cs.AI 新提交 73%

Redistribution-based Cost Inference Improves Sparse Safe Offline RL

基于重分配的代价推断改进稀疏安全离线强化学习

Ebenezer Gelo, Geraud Nangue Tasse, Steven James, Benjamin Rosman

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 针对安全离线强化学习中稀疏轨迹级停止反馈问题,提出RCI框架转换为密集每步代价,经理论证明转换无损,实验在两类任务上违规率更低且鲁棒性好。

Comments Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), affiliated with IJCAI/ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 3 篇

2608.12145 2026-08-13 cs.CV cs.LG 新提交 62%

Autonomous Telerehabilitation via Skeletal Motion Prediction and Joint-Level Performance Assessment

基于骨骼动作预测与关节级性能评估的自主远程康复

Lara Pereira, João Ruivo Paulo, Pedro Santos, Paulo Peixoto

机构 * Institute of Systems and Robotics(系统与机器人研究所) University of Coimbra(科英布拉大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种基于骨骼动作预测与关节级性能评估的双模块远程康复系统,其动作分类与预测模块在对应基准上表现优异,为自主反馈式远程康复提供了新方案。

Comments Accepted at IEEE RO-MAN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11540 2026-08-13 eess.SY cs.AI cs.CY cs.SY 新提交 57%

A Conceptual Framework for Enhancing Workforce Readiness for Smart Manufacturing in the AI Era

AI时代提升智能制造劳动力准备度的概念框架

Dalton Ross Smith, Wilburn Whittington, Alejandro Martinez, Aidan Duncan, Gang Li

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.AI

AI总结 针对AI时代智能制造劳动力能力缺口,本文提出含九个阶段、四个支柱的WRL框架,经89个顶点项目验证可诊断能力差距,为教育等领域提供循证工具,未来将校准支柱权重并测试信效度。

Comments 30 pages, 11 figures, submission for ASEE Journal of Engineering Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11417 2026-08-13 cs.RO cs.HC cs.SY eess.SY 新提交 57%

Locomotion Variability and User Experience in Smart Wheelchair Human-Robot Interaction

智能轮椅人机交互中的运动变异性与用户体验

Sean Kille, Adina M. Panchea, Balint Varga, Sören Hohmann

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Université de Sherbrooke(谢布鲁克大学)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 该研究在智能轮椅共享控制场景中,提出保留自然运动结构的支持自主辅助策略,发现其在任务表现相当的情况下,能提升用户感知自主感与有用性,凸显设计辅助机器人需尊重人类运动结构的重要性。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 15 篇

2608.11901 2026-08-13 cs.RO 新提交 83%

DaViNCi: A Dataset Towards Outdoor Vision-and-Language Navigation with Continuous Actions and Dynamic Elements

DaViNCi:面向包含连续动作与动态元素的户外视觉语言导航的数据集

Zihao Xie, Pingrui Lai, Yitong Wu, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出首个同时包含连续动作与动态元素的户外视觉语言导航数据集DaViNCi,通过实验验证其挑战性,为推动户外VLN向更真实环境发展提供实用支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11246 2026-08-13 cs.AI cs.LG cs.RO 新提交 82%

Towards the Harness of Embodied Agents

迈向具身智能体的管控

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。

Comments Project page: https://eit-hai.github.io/thea

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11431 2026-08-13 cs.RO 版本更新 80%

A Generalized Theory of Load Distribution in Redundantly-actuated Robotic Systems

冗余驱动机器人系统中载荷分布的通用理论

Joshua Flight, Clément Gosselin

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出冗余驱动机器人系统中载荷分布的通用理论,推导了高效力合成与分析解,并指出现有方法的不足,通过示例展示改进效果。

Comments 23 pages, 15 figures. Submitted to The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19985 2026-08-13 cs.CV 版本更新 70%

Vision-Reasoning-Guided Occlusion Removal from Light Fields

视觉推理引导的光场遮挡去除

Mohamed Youssef, Oliver Bimber

机构 * Johannes Kepler University(约翰·开普勒大学)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05474 2026-08-13 cs.CV 版本更新 70%

3D Scene Generation: A Survey

3D场景生成:一项综述

Haozhe Xie, Beichen Wen, Zhaoxi Chen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。

Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12358 2026-08-13 cs.CV cs.AI cs.RO 67%

From Prompts to Pavement: LMMs-based Agentic Behavior-Tree Generation Framework for Autonomous Vehicles

从提示到道路:基于大语言模型的代理行为树生成框架用于自动驾驶车辆

Omar Y. Goba, Ahmed Y. Gado, Catherine M. Elias, Ahmed Hussein

机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大·冯·洪堡大学(开罗分校)计算机科学与工程系,埃及) C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室(车辆系统中的认知驾驶研究),开罗,埃及) IAV GmbH, Berlin, Germany(IAV GmbH,柏林,德国)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出了一种基于大语言模型和多模态视觉模型的代理行为树生成框架,用于自动驾驶车辆在复杂环境中自适应导航。该框架通过链式符号提示评估场景关键性,通过上下文学习构建高层子目标,并通过生成器合成可执行的BT子树,实现了在CARLA+Nav2模拟中对突发障碍物(如道路堵塞)的成功绕行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11564 2026-08-13 cs.CV cs.RO 新提交 62%

Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision

利用分层监督将基于RGB的基础模型重新用于热图像的深度估计

Jie Hong, Tingtian Li, Xuesong Li, Xiao Li

机构 * The University of Hong Kong(香港大学) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对热图像深度估计中RGB基础模型分层表示利用不足的问题,提出RGB-HS框架,通过分层监督和基于图像质量的标记加权对齐,在基准上实现了有竞争力的性能。

Comments Accepted in IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏