arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-11 至 2026-08-11 共收录 189 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 24 篇

2608.08476 2026-08-11 cs.CV 新提交 57%

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion

RayLift:利用3D几何先验提升互补射线级证据以实现语义场景补全

Meng Wang, Hongxia Yu, Wenzhe He, Xingdong Song, Huilong Pi, Jiapeng Zhang, Ruihui Li

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 针对现有语义场景补全方法的深度误差传播问题,提出RayLift框架,通过互补上下文编码器、深度射线证据提升模块和语义感知体素集成器,在两个基准数据集上实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29393 2026-08-11 cs.RO 版本更新 57%

AquaJEPA: An Action-Conditioned Multimodal JEPA Family for Underwater Robot Dynamics

AquaJEPA:面向水下机器人动力学的动作条件多模态预测表示

Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov

机构 * ITMO University(ITMO大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 该研究提出动作条件多模态预测模型AquaJEPA,在Stonefish环境中对比多种基线,经120个带计划DVL损失的配对环境实验,其闭环性能最优,配对最终误差显著优于多数基线。

Comments Submitted to IEEE ICRA 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21109 2026-08-11 cs.RO 版本更新 57%

Anomaly-Informed Confidence Calibration for Vision-Based Safety Prediction

基于异常的置信度校准用于基于视觉的安全预测

Zhenjiang Mao, Jiawen Wu, Gabriel Wagner, Zhongzheng Zhang, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab, Department of Electrical and Computer Engineering, University of Florida(可信工程自主性实验室,电气与计算机工程系,佛罗里达大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 本文提出了一种基于异常的在线校准方法,通过融合感知和动态异常分数来改进基于视觉的安全预测中的置信度估计,从而在面对分布偏移时减少过自信,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14382 2026-08-11 cs.CV cs.GR cs.MM 版本更新 57%

Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation

Delta Forcing:交互式自回归视频生成中的信任区域引导

Yuheng Wu, Xiangbo Gao, Tianhao Chen, Xinghao Chen, Qing Yin, Zhengzhong Tu, Dongman Lee

机构 * Texas A\&M University(德克萨斯A&M大学) University of Washington(华盛顿大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出Delta Forcing方法,通过约束不可靠的教师监督在适应性信任区域中,以提高自回归视频生成的一致性并保持对新事件的响应性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 5 篇

2608.07619 2026-08-11 cs.RO 新提交 85%

GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning

GWM-VLA:面向视觉-语言-动作学习的几何感知隐式世界建模

Yanping Zhao, Hang Yu, Yiwei Wang, Chen Ye, Siyu Tian, Di Zhang, Qingjun Wang, Qian Chen, Junqiao Zhao, Chen Ye, Guang Chen

专题命中 机器人基础模型 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对VLA模型在视觉/环境变化下性能下降问题,提出GWM-VLA框架,通过几何感知多视角编码等技术提升模型鲁棒性,经仿真和真实环境实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02501 2026-08-11 cs.RO cs.CV cs.OS 版本更新 81%

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Embodied.cpp:面向异构机器人的具身AI模型可移植推理运行时

Ling Xu, Borui Li, Hao Wu, Chuyu Han, Xiangyu Li, Mohan Hua, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

机构 * Southeast University(东南大学) Nanjing University(南京大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 机器人基础模型 :embodied AI(title,abstract);分类 cs.RO、cs.CV

AI总结 提出Embodied.cpp,一个基于C++的可移植推理运行时,通过五层架构支持多速率执行、延迟优先融合推理和可扩展接口,在异构机器人上高效部署VLA和世界动作模型。

Comments 18 pages, 2 figures, Project website: https://github.com/SEU-PAISys/Embodied.cpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26820 2026-08-11 cs.RO 版本更新 77%

Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting?

VLA 模型能否从现实世界数据中持续学习而不遗忘?

Jiarun Zhu, Yijun Hong, Xiaoquan Sun, Zetian Xu, Qijun He, Haijier Chen, Zhiyong Wang, Mingqi Yuan, Wenjun Zeng, Jiayu Chen

机构 * HKU(香港大学) INFIFORCE EIT, Ningbo(宁波工程学院) HUST(华中科技大学) SUSTech(南方科技大学) HITSZ(香港理工大学)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究通过构建包含四个顺序操作任务的真实世界持续学习数据集,实证发现视觉-语言-动作(VLA)模型在持续学习异构真实世界演示时存在严重灾难性遗忘,并系统评估了经验回放方法的关键实施因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01265 2026-08-11 cs.RO cs.CV 版本更新 73%

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

作为视觉-语言-动作模型轨迹先验的埃尔米特曲线

Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Jiangsu Cytoderm Intelligent Technology Co., Ltd.(江苏赛克德智能科技有限公司) National University of Singapore(新加坡国立大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对视觉-语言-动作模型动作块的弱结构化问题,提出埃尔米特轨迹先验,其中埃尔米特正则化变体在仿真与真实机器人任务中显著提升了操纵成功率且无额外推理开销。

Comments Project page is available at https://aopolin-lv.github.io/Hermite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 62%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 11 篇

2608.09467 2026-08-11 cs.CV cs.AI 新提交 81%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02953 2026-08-11 cs.CV 版本更新 79%

RealWeather: Realistic and Scene-Faithful Weather Translation with Driving World Models

RealWeather:基于驾驶世界模型的逼真且场景忠实的天气转换

Yuwei Ning, Liangzhi Wang, Yi Xiao, Zhenhua Wu, Yun Pang, Mingkun Chang, Jichang Li, Guanbin Li

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.CV

AI总结 RealWeather是一种驾驶世界模型,通过渐进式逼真度引导和场景忠实度强化学习优化实现逼真且场景忠实的天气转换,在视觉逼真度、结构保留等方面优于现有方法,支持长尾天气场景生成与零样本泛化。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08491 2026-08-11 cs.AI 新提交 77%

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Southern University of Science and Technology(南方科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Beijing Language and Culture University(北京语言大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.AI

AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-11 cs.RO cs.CV 新提交 62%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures, Published in Sensors

Journal ref Sensors 26(16), 5046 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07870 2026-08-11 cs.LG cs.RO 新提交 62%

V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

V-Simba:释放强化学习在视觉连续控制中的架构潜力

Donghu Kim, Youngdo Lee, Hojoon Lee, Johan Obando-Ceron, Byungkun Lee, Aaron Courville, Pablo Samuel Castro, Jaegul Choo, Clare Lyle

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 该研究针对视觉RL样本效率低的问题,提出受Simba架构启发的V-Simba视觉RL架构,基于SAC改进后在多个基准测试中性能优于或媲美现有方法,且计算效率更高。

Comments Accepted at RLC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07223 2026-08-11 cs.AI 版本更新 61%

Reflex First, Reflect Later: Latency-Aware Embodied LLM Agents for Dynamic Response

先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体

Yangqing Zheng, Shunqi Mao, Dingxin Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI;embodied AI(comments)

AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。

Comments Accepted by the CVPR 2025 Embodied AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09258 2026-08-11 cs.RO 新提交 57%

Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm

面向任务的编队决策:通过强化学习实现对攻击型集群的驱赶

Zhaozong Wang, Guibin Sun, Jinyong Chen, Rui Zhou

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文针对攻击型集群驱赶任务,提出基于强化学习的编队决策方法,通过参数化编队形状缓解防御者机动性劣势,在仿真与物理平台上验证了方法的可行性与扩展性。

Comments Accepted for publication in IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07725 2026-08-11 cs.LG 新提交 57%

Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning

平均奖励强化学习的有限常数前沿与可审计后悔证书

Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文针对平均奖励强化学习,提出感知常数的比较协议,推导通信MDP的有限下界证书,改进已发表系数,给出跨度约束乐观学习者的可审计组合规则,完成相关形式化与诊断测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01151 2026-08-11 cs.LG 版本更新 57%

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

拉格朗日扰动扩散引导:用于生成策略的潜在强化学习

Hikmet Simsir, Ozgur S. Oguz

机构 * University of Michigan(密歇根大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。

Comments Accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01476 2026-08-11 cs.LG cs.CL 版本更新 57%

From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering

当奖励黑客反弹时:通过表征层面信号理解与缓解它

Rui Wu, Ruixiang Tang

机构 * Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型强化学习中奖励黑客现象,通过环境操控设置分析其三阶段反弹模式,并提出基于表征工程的Advantage Modification方法以更有效抑制黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28533 2026-08-11 cs.CL 版本更新 50%

GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum

GraphWalker: 通过合成轨迹课程实现基于知识图谱的代理问答

Shuwen Xu, Yao Xu, Jiaxiang Liu, Chenhao Yuan, Wenshuo Peng, Jun Zhao, Kang Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 GraphWalker通过自动化轨迹合成和分阶段微调解决知识图谱问答中的探索与泛化问题,提升轻量强化学习性能,在CWQ和WebQSP上取得最优效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 4 篇

2511.05033 2026-08-11 cs.RO 版本更新 83%

Epically Powerful: An open-source software and mechatronics infrastructure for wearable robotic systems

强大非凡:用于可穿戴机器人系统的开源软件与机电一体化基础设施

Jennifer K. Leestma, Siddharth R. Nathella, Christoph P. O. Nuesslein, Snehil Mathur, Gregory S. Sawicki, Aaron J. Young

专题命中 人机交互与遥操作 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 Epically Powerful是一款开源机器人基础设施,可简化可穿戴机器人系统的底层框架,支持QDD执行器等硬件对接,降低定制化可穿戴机器人开发门槛,还适用于其他相关机器人领域。

Comments 12 pages, 5 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09015 2026-08-11 cs.RO 新提交 57%

Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization

基于偏好的贝叶斯优化实现个性化下肢外骨骼助力

Xiao-Yin Liu, Guotao Li, Weiqun Wang, Zeng-Guang Hou

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Macau University of Science and Technology(澳门科技大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 本文提出偏好贝叶斯优化(PbBO)方法,结合分层控制器,实现个性化下肢外骨骼助力,经20次迭代以90.7%准确率收敛最优参数,实验显示可显著降低用户代谢率、心率及肌肉激活度。

Comments 20 pages, 15 figures, https://youtu.be/8X1SFqUU4G4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08263 2026-08-11 cs.HC 新提交 50%

Underwater MMG-Based Muscle State Monitoring with Integrated Emergency Buoyancy Assistance

基于水下肌动电流图(MMG)的肌肉状态监测及集成式紧急浮力辅助系统

Xiao Jin, Yixian Fan, Zefeng Yuan, Zhenhua Yu

专题命中 人机交互与遥操作 :robotic(abstract)

AI总结 该研究开发了基于水下MMG的可穿戴紧急辅助系统,采用防水MMG传感器与MiniRocket分类器实现泳姿识别,可快速触发浮力部署,为水生环境下的肌肉状态监测与应急提供支撑。

Comments 8 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07942 2026-08-11 cond-mat.soft cond-mat.mtrl-sci 新提交 50%

Reactive polar mesogenic self-assembly approach enables domain-programmable polymer ferroelectrics

反应性极性介晶自组装方法实现可区域编程的聚合物铁电体

Fan Ye, Minghui Deng, Yuyang Zheng, Xiujuan Liu, Xiuhu Zhao, Haowei Jiang, Yanyun Hou, Bingyu Zou, Neng-Ang Peng, Shuo Zhao, Kutay Sağdıç, Danqing Liu, Yang Shen, Yan-Qing Lu, Satoshi Aya, Mingjun Huang

专题命中 人机交互与遥操作 :robotics(abstract)

AI总结 本研究提出反应性极性介晶自组装方法,制备不含多氟烷基的柔性铁电液晶聚合物,通过光取向实现可编程极性畴结构,为柔性电子等领域拓展了自适应材料设计空间。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 30 篇

2608.07533 2026-08-11 cs.AI cs.SE 新提交 85%

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09891 2026-08-11 cs.RO 新提交 81%

RoSE: A Robotic Soft Esophagus for Endoprosthetic Stent Testing

RoSE:用于腔内支架测试的机器人软食管

Dipankar Bhattacharya, Sherine Jesna V. A., Leo K. Cheng, Weiliang Xu

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 本研究开发了仿生机器人软食管RoSE作为腔内支架体外测试装置,通过测试两种不同径向刚度支架的径向力、迁移情况及对吞咽功能的影响,为支架评估提供创新平台。

Comments Author accepted manuscript. 31 pages, 13 figures, 3 tables. Published in Soft Robotics (2021). Project page: https://bhattner143.github.io/rose-stent.github.io/

Journal ref Soft Robotics, Vol. 8, No. 4 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08281 2026-08-11 cs.AI cs.RO 新提交 81%

Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios

探索大语言模型(LLM)在现实世界海事航行场景中的情境理解与《国际海上避碰规则》(COLREG)遵从能力

Julius Wirbel, P. Nicholas Hansen, Line K. H. Clemmensen, Roberto Galeazzi

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究探索LLM在海事航行中的应用,构建含50个真实场景的AIS数据集,评估不同LLM的理解与推理能力,发现不微调则难以解决海事航行任务。

Comments Submitted and accepted to the IFAC WC 2026 as an invited session paper for track 7.2 Transportation and Vehicle Systems - Marine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08523 2026-08-11 cs.AI 新提交 79%

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

用质量多样性优化发现多模态具身智能体的多样化规划策略

Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI

AI总结 针对多模态具身智能体现有规划器易因单一规划风格失效导致停滞的问题,提出质量多样性框架,通过进化策略模板构建多样化策略库,实现自适应规划与故障恢复,在ThreeDWorld基准上提升了任务成功率与交互效率。

Comments To appear in ACM MM (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08036 2026-08-11 cs.RO 新提交 79%

Compiling and Benchmarking Task-State Horizons for Embodied Agents

面向具身智能体的任务状态视界的编译与基准测试

Meiqi Wang, Shichao Li

专题命中 机器人数据与评测 :embodied agent(title);robotic(abstract);分类 cs.RO

AI总结 该研究定义任务状态视界(TSH),推出RoboGraph编译器并发布含588个情节的基准,发现多数先进智能体模型在高TSH下维护、更新任务相关状态存在差距。

Comments 32 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27826 2026-08-11 cs.AI 版本更新 79%

NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms

NormAct:具身规划中隐藏社会规范遵守的基准

Shiyun Zhao, Xinwei Song, Tianyu Guo, Xiaomeng Gao, Mingyuan Liu, Xu Han, Yuanyuan Zhang, Zhenliang Zhang, Xue Feng, Bo Dai

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) China Academy of Information and Communications Technology(中国信息通信研究院) ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI

AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。

Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏