arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2965 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2965 篇

2605.16979 2026-05-19 cs.RO 50%

NORM-Nav: Zero-Shot Mobile Robot Navigation with Natural Language Behavioral Constraints

NORM-Nav: 通过自然语言行为约束实现零样本移动机器人导航

Dongjie Huo, Junhui Wang, Chao Gao, Yan Qiao, Dong Zhang, Guyue Zhou

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Systems Engineering and Collaborative Laboratory for Intelligent Science and Systems, Macau University of Science and Technology(澳门大学系统工程与智能科学与系统联合实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出NORM-Nav框架,通过将自然语言行为约束整合到基于成本图的规划中,提升移动机器人在人类环境中导航的社交适应性,实验表明其在任务成功率和轨迹贴近人类参考方面优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02759 2026-05-19 cs.RO cs.CV 50%

DynoSLAM: Dynamic SLAM with Generative Graph Neural Networks for Real-World Social Navigation

DynoSLAM:基于生成图神经网络的动态SLAM用于现实世界的社交导航

Danil Tokhchukov, Veronika Morozova, Gonzalo Ferrer

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出DynoSLAM,通过整合社交感知图神经网络,解决动态环境中SLAM的不确定性问题,提升机器人在拥挤环境中的导航能力。

Comments Code & Project page at https://github.com/makriot/dynoslam

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16537 2026-05-19 cs.RO 50%

Nori Bot: A Sub-$1,000 Floor-to-Counter Mobile Manipulator

Nori Bot:一款不到1000美元的 floor-to-counter 移动机械臂

Antonio Li, Sungjoon Park, Wen Ni Chew

机构 * LeRobot

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 Nori Bot 通过600mm Z轴提升、Raspberry Pi 4与OpenClaw协同控制以及软件安全栈解决移动机械臂的三大限制,成本仅为同类商业平台的3%。

Comments 7 pages, 3 figures, 2 tables. Columbia University Deep Learning Robot Manipulation course project, Spring 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16402 2026-05-19 cs.CV 50%

WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments

WinDeskGround:复杂多窗口桌面环境中的鲁棒GUI定位基准

Haoren Zhao, Tianyi Chen, Zhen Wang

机构 * School of Cyberspace, Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学信息学院) Microsoft(微软公司)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出WinDeskGround基准,通过参数生成复杂桌面场景,评估GUI定位鲁棒性。实验显示顶级模型在简单环境表现佳,但部分遮挡下准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15964 2026-05-18 cs.RO cs.CV 50%

WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

WorldVLN: 用于空域视觉-语言导航的自回归世界动作模型

Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zhiheng Zheng, Weichen Zhang, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Shandong University(山东大学) Manifold AI Beijing Institute of Technology(北京理工大学) Northeastern University(东北大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 WorldVLN提出一种自回归世界动作模型,通过预测潜在世界演变并生成可执行的航点动作,提升空域视觉-语言导航性能,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09869 2026-05-18 cs.RO cs.CV 50%

ConsistNav: Closing the Action Consistency Gap in Zero-Shot Object Navigation with Semantic Executive Control

ConsistNav:通过语义执行控制关闭零样本物体导航中的动作一致性差距

Haosen Wang, Zhenyang Li, Yinqiang Zhang, Zongqi He, Lutao Jiang, Kai Li, Yizhou Zhao, Liaoyuan Fan, Wenjian Hou, Tingbang Liang, Yibin Wen, Defeng Gu

机构 * Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) City University of Hong Kong(香港城市大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出ConsistNav框架,通过语义执行控制模块解决零样本物体导航中动作一致性问题,提升导航精度与鲁棒性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14911 2026-05-15 cs.RO 50%

Chrono-Gymnasium: An Open-Source, Gymnasium-Compatible Distributed Simulation Framework

Chrono-Gymnasium:一个开源、兼容Gymnasium的分布式模拟框架

Bocheng Zou, Harry Zhang, Khailanii Slaton, Jingquan Wang, Derrick Ruan, Huzaifa Mustafa Unjhawala, Radu Serban, Dan Negrut

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 Chrono-Gymnasium通过分布式计算框架提升高保真多体动力学模拟的效率,支持机器人导航和行星着陆器优化,减少计算时间而不牺牲物理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15384 2026-05-15 cs.GT 50%

Co-Investment in Mobile Edge Computing with Infrastructure Update and Dynamic Participation

移动边缘计算中的协同投资与基础设施更新及动态参与

Amal Sakr, Andrea Araldo, Tijani Chahed, Daniel Kofman

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出一种协同投资方案,通过运营商和多个服务提供商共同部署和共享移动边缘计算基础设施,解决资源规划、分配及成本收益分配问题,并通过动态参与机制提升整体收益。

Comments Accepted at IFIP Networking, May 24-27, 2026, Lugano, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12552 2026-05-14 cs.NI eess.SP 50%

DQN-Driven Adaptive Neighbor Discovery for Directional Aerial Networks

基于DQN的自适应邻居发现方向空中网络

Md Asif Ishrak Sarder, Murat Yuksel, Elizabeth Bentley

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出基于DQN的自适应收发机选择协议,解决方向空中网络中邻居发现与隐私保护的平衡问题,通过动态调整探测模式提升连接效率和隐私保护。

Comments Accepted at IEEE ICC 2025. This is the author-accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11782 2026-05-13 cs.CV 50%

Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

面向低视力人群的基于VQA的事件地图城市风险感知导航

Antoni Valls, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出基于视觉问答的事件地图框架,利用视觉语言模型进行行人场景描述和危险识别,通过三级查询结构实现细粒度场景理解,生成风险感知导航地图,验证多模态大语言模型在助视导航中的有效性。

Comments 10 pages, 6 figures, submitted to IEEE T-ITS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10440 2026-05-12 cs.CY 50%

TourMart: A Parametric Audit Instrument for Commission Steering in LLM Travel Agents

TourMart: 一种用于LLM旅行代理佣金管理的参数审计工具

Yao Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 TourMart通过参数lambda和kappa驱动反事实分析,区分LLM工程故障与真实商业引导,验证代理引导效果,输出合规报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25380 2026-05-11 cs.CV 50%

Benchmarking and Improving GUI Agents in High-Dynamic Environments

在高动态环境中评估和改进GUI代理

Enqi Liu, Liyuan Pan, Zhi Gao, Yan Yang, Chenrui Shi, Yang Liu, Jingrong Wu, Qing Li

机构 * Beijing Institute of Technology(北京理工大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Yangtze Delta Region Academy of Beijing Institute of Technology(北京理工大学长江三角洲地区研究院) Australian National University(澳大利亚国立大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出DynamicGUIBench和DynamicUI,通过动态界面处理方法提升高动态GUI环境下的代理性能,同时保持其他基准测试的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27974 2026-05-01 cs.CV cs.DB 50%

FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting

FineState-Bench:面向细粒度GUI状态设置的状态条件化基准测试

Fengxian Ji, Jingpu Yang, Zirui Song, Yuanxi Wang, Zhexuan Cui, Yuke Li, Qian Jiang, Xiuying Chen

机构 * MBZUAI, United Arab Emirates(阿联酋MBZUAI研究院) Northeastern University, China(中国东北大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 FineState-Bench通过精确目标状态评估,检验智能体能否正确映射指令至UI控件,提出FineState-Metrics与VDA诊断工具,实验显示视觉接地仍有提升空间,但整体准确率不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27620 2026-05-01 cs.CV 50%

SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation

SpaAct:基于课程适应的空间激活转换学习用于视觉语言导航

Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Hanbing Li, Lin Zhao, Kailin Lyu, Long Chen, Zhi-Xin Yang, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) The State Key Laboratory of Internet of Things for Smart City(智能城市物联网国家重点实验室) Centre for Artificial Intelligence and Robotics(人工智能与机器人中心) University of Macau(澳门大学) Xiaomi EV(小i EV) School of Automation(自动化学院) Beijing Institute of Technology(北京理工大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 SpaAct通过引入空间激活任务和课程适应方法,提升视觉语言导航中动态空间感知能力,实现更高效的导航性能。

Comments Submmited to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26899 2026-04-30 eess.SY cs.RO cs.SY 50%

Safe Navigation using Neural Radiance Fields via Reachable Sets

通过可达集实现神经辐射场的安全导航

Omanshu Thapliyal, Malarvizhi Sankaranarayanasamy, Ravigopal Vennelakanti

机构 * Researcher, Hitachi America Ltd.(Hitachi America Ltd.研究人员) Sr. Researcher, Hitachi America Ltd.(Hitachi America Ltd.高级研究人员)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出利用可达集和神经辐射场进行安全导航,通过约束最优控制解决路径规划问题,验证了在复杂环境中安全避障的能力。

Comments 5 pages, 8 figures, 2026 4th International Conference on Mechatronics, Control and Robotics (ICMCR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23941 2026-04-28 cs.CV 50%

GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction

GoClick:轻量级元素接地模型用于自主GUI交互

Hongxin Li, Yuntao Chen, Zhaoxiang Zhang

机构 * 1 University of Chinese Academy of Sciences, Beijing, China. 2 New Laboratory of Pattern Recognition, State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China. 3 Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences, Hong Kong, China. Zhaoxiang Zhang

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出GoClick,一种轻量级GUI元素接地模型,通过改进架构和数据精炼流程,在保持高精度的同时降低参数规模,适用于资源受限设备的低延迟GUI交互任务。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23648 2026-04-28 cs.RO 50%

Safe Navigation in Unknown and Cluttered Environments via Direction-Aware Convex Free-Region Generation

通过方向感知的凸自由区域生成实现未知和杂乱环境中的安全导航

Zhicheng Song, Yongjian Li, Kai Chen, Yulin Li, Fan Shi, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出一种结合候选运动方向与机器人几何的凸自由区域生成框架,通过连续安全轨迹生成实现持续无碰撞运动,实验表明该方法在杂乱2D导航场景中生成更符合后续导航的自由区域,并在3D和真实世界中验证了其扩展性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23561 2026-04-28 math.OC 50%

Wireless Mobile Charging for Emergency Electric Vehicle Routing: A Mixed-Integer and Metaheuristic Framework for In-Motion Energy Transfer

无线移动充电用于紧急电动汽车路线规划:一种混合整数和元启发式框架用于行驶中的能量传输

Jingyi Zhao, Haoxiang Yang, Youxuan Pan, Yang Liu

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出无线移动充电电动汽车路线规划问题,通过感应耦合实现移动充电卡车对行驶中的电动汽车无线充电,结合混合整数规划和元启发式算法优化异构车队的路线与动态能量传输。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21130 2026-04-24 cs.RO 50%

Self-Predictive Representation for Autonomous UAV Object-Goal Navigation

自预测表征用于自主无人机目标-目标导航

Angel Ayala, Donling Sui, Francisco Cruz, Mitchell Torok, Mohammad Deghat, Bruno J. T. Fernandes

机构 * Escola Politécnica de Pernambuco, Universidade de Pernambuco(巴伊兰联邦大学皮奥伊技术学院) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) School of Mechanical and Manufacturing Engineering, University of New South Wales(新南威尔士大学机械与制造工程学院) Escuela de Ingeniería, Universidad Central de Chile(智利中央大学工程学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出自预测模型AmelPred,用于提升无人机在3D目标-目标导航中的数据样本效率和规划性能。

Comments Submitted to T-RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20940 2026-04-24 cs.MM cs.NI cs.SD 50%

Sema: Semantic Transport for Real-Time Multimodal Agents

Sema:面向实时多模态代理的语义传输

Jiaying Meng, Bojie Li

机构 * Pine AI

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 Sema通过结合离散音频分词与混合屏幕表示及突发性分组传输,有效降低带宽并保持任务准确性,解决多模态代理传输中的语义保真问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26557 2026-04-23 cs.HC 50%

The Invisible Mentor: Inferring User Actions from Screen Recordings to Recommend Better Workflows

隐形导师:从屏幕记录推断用户行为以推荐更好的工作流程

Litao Yan, Andrew Head, Ken Milne, Vu Le, Sumit Gulwani, Chris Parnin, Emerson Murphy-Hill

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 本文提出InvisibleMentor系统,通过屏幕记录推断用户行为,推荐更高效的工作流程,优于传统依赖日志或用户提示的助手。

Comments 15 pages, 6 figures

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), 1-17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09358 2026-04-22 cs.HC 50%

Virtual Reality User Interface Design: Best Practices and Implementation

虚拟现实用户界面设计:最佳实践与实现

Esin Mehmedova, Santiago Berrezueta-Guzman, Stefan Wagner

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出28条统一的VR用户界面设计指南,通过系统文献综述和用户研究,开发了VR应用FlUId及交互网页工具,旨在提升VR界面设计的效率和用户体验。

Comments Pre-print submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19064 2026-04-22 cs.CV 50%

The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation

视觉-语言导航中自改进智能体的平衡本质

Zhen Liu, Yuhan Liu, Jinjun Wang, Jianyi Liu, Wei Song, Jingwen Fu

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence and the Institute of Artificial Intelligence and Robotics(人机混合增强智能国家重点实验室和人工智能与机器人研究院) School of Information Science and Technology(信息科学与技术学院) Zhongguancun Academy(中关村学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SDB机制,通过平衡行为多样性与学习稳定性,提升视觉-语言导航中自改进性能,在R2R、SOON和REVERIE数据集上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16384 2026-04-21 cs.RO cs.CY 50%

RHINO-AR: An Augmented Reality Exhibit for Teaching Mobile Robotics Concepts in Museums

RHINO-AR:一种用于博物馆中教学移动机器人概念的增强现实展览

Nils Dengler, Tim Graf, Leif Van Holland, Patrick Stotko, Reinhard Klein, Maren Bennewitz

机构 * Humanoid Robots Lab, University of Bonn, Germany(波恩大学人形机器人实验室,德国)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 RHINO-AR通过将虚拟重建的机器人置于真实博物馆空间,解决了VR展览与现实环境分离的问题,提升了非专业观众对移动机器人导航概念的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15772 2026-04-20 cs.RO 50%

Fuzzy Logic Theory-based Adaptive Reward Shaping for Robust Reinforcement Learning (FARS)

基于模糊逻辑理论的自适应奖励塑造用于鲁棒强化学习(FARS)

Hürkan Şahin, Van Huyen Dang, Erdi Sayar, Alper Yegenoglu, Erdal Kayacan

机构 * Automatic Control Group (RAT)(自动控制组(RAT))

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出基于模糊逻辑的自适应奖励塑造方法,通过整合人类直觉提升强化学习的稳定性与鲁棒性,在复杂导航任务中实现更平滑的运动与控制过渡。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14872 2026-04-17 cs.HC 50%

SkillDroid: Compile Once, Reuse Forever

SkillDroid: 一次编译,永久复用

Qijia Chen, Andrea Bellucci, Zhida Sun, Giulio Jacucci

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 SkillDroid通过编译成功的人工智能引导GUI轨迹为参数化技能模板,实现无需LLM调用的复用,显著提升任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13245 2026-04-16 cs.RO cs.SY eess.SY 50%

Capability-Aware Heterogeneous Control Barrier Functions for Decentralized Multi-Robot Safe Navigation

具备能力的异构控制屏障函数用于去中心化多机器人安全导航

Joonkyung Kim, Yanze Zhang, Wenhao Luo, Yiwei Lyu

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出CA-HCBF框架,通过统一动力学模型和能力度量,实现异构机器人团队的安全一致性和能力感知协调,提升安全性和任务效率。

Comments 8 pages, 3 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21667 2026-04-16 cs.RO cs.CV 50%

From Instruction to Event: Sound-Triggered Mobile Manipulation

从指令到事件:基于声音的移动操作

Hao Ju, Shaofei Huang, Hongyu Li, Zihan Ding, Si Liu, Meng Wang, Zhedong Zheng

机构 * University of Macau(澳门大学) Beihang University(北航) Hefei University of Technology(合肥工业大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出基于声音的移动操作方法,通过开发Habitat-Echo数据平台和任务规划器,使移动代理能主动感知并响应声音事件,无需显式指令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12872 2026-04-15 cs.RO 50%

OVAL: Open-Vocabulary Augmented Memory Model for Lifelong Object Goal Navigation

OVAL: 开放词汇增强记忆模型用于终身物体目标导航

Jiahua Pei, Yi Liu, Guoping Pan, Yuanhao Jiang, Houde Liu, Xueqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 OVAL提出一种开放词汇增强记忆框架,解决长期目标导航中的记忆限制问题,通过内存描述符和概率探索策略提升导航效率与鲁棒性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12565 2026-04-15 cs.RO cs.CV 50%

Scalable Trajectory Generation for Whole-Body Mobile Manipulation

可扩展的全身体态移动操作轨迹生成

Yida Niu, Xinhai Chang, Xin Liu, Ziyuan Jiao, Yixin Zhu

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) Institute of Unmanned System, Beihang University(无人系统研究院,北航) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) Yuanpei College, Peking University(元培学院,北京大学) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,PKU-武汉人工智能研究所)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出AutoMoMa框架,通过GPU加速整合运动学模型与并行轨迹优化,生成大规模物理有效轨迹数据,解决全身体态移动操作中规模、多样性和运动学精度的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏