arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-13 至 2026-05-13 共收录 58 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 58 篇

2605.11436 2026-05-13 cs.CL cs.AI 90%

Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty

Agent-BRACE: 通过 verbalized 状态不确定性解耦信念与行动以应对长 horizon 任务

Joykirat Singh, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Akshay Nambi, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 规划决策 :agent(title,title_cn);分类 cs.AI、cs.CL

AI总结 Agent-BRACE 通过解耦信念状态模型与策略模型,利用强化学习优化,在长 horizon 部分可观测任务中提升性能,实现上下文窗口恒定且任务相关信息保留。

Comments Code: https://github.com/joykirat18/Agent-BRACE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12078 2026-05-13 cs.SE cs.AI 87%

Property-Level Reconstructability of Agent Decisions: An Anchor-Level Pilot Across Vendor SDK Adapter Regimes

代理决策的属性级可重构性:一个跨供应商SDK适配器制度的锚点试点

Oleg Solozobov

机构 * Independent Researcher (Global)(全球独立研究员)

专题命中 规划决策 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究通过锚点试点评估代理决策在不同制度下的可重构性,发现不同制度下属性级可重构性存在差异,揭示了严格治理完整性在不同层级的分布情况。

Comments 23 pages, 3 tables; reproducibility package: https://doi.org/10.5281/zenodo.20077961; GitHub: https://github.com/agent-runtime-evidence/anchor-level-reconstructability-pilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11633 2026-05-13 cs.AI 84%

Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations

大语言模型代理能否应对灾难?评估异构地理空间推理在紧急行动中的基准测试

Junjue Wang, Weihao Xuan, Heli Qi, Pengyu Dai, Kunyi Liu, Hongruixuan Chen, Zhuo Zheng, Junshi Xia, Stefano Ermon, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Stanford University(斯坦福大学)

专题命中 规划决策 :agent(abstract,abstract_cn);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 本文提出DORA基准测试,评估大语言模型在灾难响应中的端到端流程,揭示了灾难领域接地、工具选择瓶颈和组合脆弱性等挑战。

Comments DORA stress-tests LLM agents on real-world disaster operations that demand comprehensive orchestration of 108 specialized tools over heterogeneous geospatial data

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11225 2026-05-13 cs.AI cs.LG cs.MA 84%

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

PIVOT:通过轨迹细化弥合LLM代理中的规划与执行

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis

专题命中 规划决策 :planning(title);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 PIVOT通过自监督框架迭代优化轨迹,解决LLM代理规划与执行不一致问题,实验证明其在约束满足和计算效率上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12004 2026-05-13 cs.CL 83%

Learning Agentic Policy from Action Guidance

从动作指导学习代理策略

Yuxiang Ji, Zengbin Wang, Yong Wang, Shidong Yang, Ziyu Ma, Guanhua Chen, Zonghua Sun, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) Southern University of Science and Technology(南方科技大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出ActGuide-RL方法,通过利用日常人类交互生成的动作数据,减少对昂贵迭代监督微调的依赖,提升代理强化学习在搜索代理基准上的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08978 2026-05-13 cs.AI 83%

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

学习探索:通过探索意识策略优化实现代理推理的扩展

Xingyuan Hua, Sheng Yue, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus, Shenzhen, China(中山大学深圳校区信息科学与技术学院) State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China(清华大学互联网体系结构国家重点实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种探索意识强化学习框架,使LLM代理在不确定性高时主动探索,通过细粒度奖励函数和探索意识分组机制提升任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11951 2026-05-13 cs.RO 82%

From Reaction to Anticipation: Proactive Failure Recovery through Agentic Task Graph for Robotic Manipulation

从反应到预见:通过代理任务图实现机器人操作的前瞻性故障恢复

Sheng Xu, Ruixing Jin, Huayi Zhou, Bo Yue, Guanren Qiao, Yunxin Tai, Yueci Deng, Kui Jia, Guiliang Liu

机构 * Sheng Xu Ruixing Jin Huayi Zhou Bo Yue Guanren Qiao Yunxin Tai Kui Jia Guiliang Liu

专题命中 规划决策 :agentic(title,abstract);planning(abstract)

AI总结 本文提出AgentChord系统,通过代理任务图实现前瞻性故障恢复,提升机器人操作的可靠性和自主性。

Comments 18 pages, accepted to RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11534 2026-05-13 cs.RO 82%

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

PRISM:在模拟的具身环境中进行规划与意图推理

Yunn Kang Lim, Pengzhan Sun, Ziyi Bai, Xun Xu, Angela Yao, Xulei Yang, Shijie Li

机构 * A*STAR National University of Singapore(国立新加坡大学) BAAI(北京人工智能研究院)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00775 2026-05-13 cs.RO cs.SY eess.SY 82%

SAGAS: Semantic-Aware Graph-Assisted Stitching for Offline Temporal Logic Planning

SAGAS:语义感知的图辅助拼接用于离线时序逻辑规划

Ruijia Liu, Ancheng Hou, Xiang Yin

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 SAGAS结合符号合成的组成性和从离线轨迹学习的数据驱动可达结构,实现零样本泛化,无需任务特定奖励或在线交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26752 2026-05-13 cs.CV 80%

GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents

GLM-5V-Turbo:迈向多模态代理的原生基础模型

V Team, Wenyi Hong, Xiaotao Gu, Ziyang Pan, Zhen Yang, Yuting Wang, Yue Wang, Yuanchang Yue, Yu Wang, Yanling Wang, Yan Wang, Xijun Liu, Wenmeng Yu, Weihan Wang, Wei Li, Shuaiqi Duan, Sheng Yang, Ruiliang Lv, Mingdao Liu, Lihang Pan, Ke Ning, Junhui Ji, Jinjiang Wang, Jing Chen, Jiazheng Xu, Jiale Zhu, Jiale Cheng, Ji Qi, Guobing Gan, Guo Wang, Cong Yao, Zijun Dou, Zihao Zhou, Zihan Wang, Zhiqi Ge, Zhijie Li, Zhenyu Hou, Zhao Xue, Zehui Wang, Zehan Qi, Zehai He, Yutao Zhang, Yusen Liu, Yukuo Cen, Yuchen Li, Yuan Wang, Yu Yang, Yongbin Liu, Yijian Lu, Yifan Xu, Yanzi Wang, Yanxiao Zhao, Yanfeng Wang, Yadong Xue, Yabo Xu, Xinyu Zhang, Xinyu Liu, Xiao Liu, Wenyi Zhao, Wenkai Li, Tianyu Tong, Tianshu Zhang, Shudan Zhang, Shengdong Yan, Qinkai Zheng, Mingde Xu, Licheng Bao, lat Long long, Jiaxing Xu, Jiaxin Fan, Jiawen Qian, Jiali Chen, Jiahui Lin, Jiadai Sun, Haozhi Zheng, Haoran Wang, Haochen Li, Hanyu Lai, Han Xu, Fan Yang, Dan Zhang, Da Yin, Chuangxin Zhao, Chengcheng Wu, Boyan Shi, Bowen Lv, Bowei Jia, Bo Li, Bin Chen, Baoxu Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Z.ai & Tsinghua University(Z.ai与清华大学)

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 GLM-5V-Turbo旨在提升多模态代理的感知与执行能力,通过整合多模态感知作为推理、规划和工具使用的核心组件,实现跨异构上下文的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11882 2026-05-13 cs.AI 79%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11706 2026-05-13 cs.LG 79%

GRAFT: Graph-Tokenized LLMs for Tool Planning

GRAFT:基于图-令牌的大型语言模型用于工具规划

Xinyi Gao, Xinyu Ren, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 GRAFT通过内部化工具图和在线策略工具上下文蒸馏,提升工具规划的依赖意识和准确性,实现更可靠的复杂工作流中的LLM工具规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11117 2026-05-13 cs.LG cs.MA math.PR 79%

GRAFT-ATHENA: Self-Improving Agentic Teams for Autonomous Discovery and Evolutionary Numerical Algorithms

GRAFT-ATHENA:自我改进的代理团队用于自主发现和进化数值算法

Juan Diego Toscano, Zhaojie Chai, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 GRAFT-ATHENA通过自我改进的代理团队,在自主发现和进化数值算法中实现跨领域的方法积累与能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11664 2026-05-13 cs.CR 78%

Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis

安全上下文注入:通过静态过滤和代理分析实现推理时的安全对齐

Zhenhao Xu, Wenhan Chang, Yichuan Chen, Yuxin Fang, Junhao Liu, Tianqing Zhu

专题命中 规划决策 :agentic(title,abstract)

AI总结 本文提出Safety Context Injection框架,通过静态过滤和代理分析在推理阶段提升模型安全性,减少攻击成功率和毒性。

Comments 17pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11618 2026-05-13 cs.RO 78%

Sampling-Based Follow-the-Leader Motion Planning for Manipulator-Mounted Continuum Robots

基于采样的跟随者-领导者运动规划用于机械臂搭载的连续机器人

Chengnan Shentu, Nicholas Baldassini, Oluwagbotemi D. Iseoluwa, Radian Gondokaryono, Jessica Burgner-Kahrs

机构 * University of Toronto(多伦多大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种基于采样的跟随者-领导者运动规划方法,用于机械臂搭载的连续机器人,通过分离全局形状搜索与基座姿态确定,实现高效规划与高精度路径跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11369 2026-05-13 cs.CV 78%

Dynamic Full-body Motion Agent with Object Interaction via Blending Pre-trained Modular Controllers

具有物体交互的动态全身体态代理通过融合预训练模块控制器

Sanghyeok Nam, Byoungjun Kim, Daehyung Park, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 规划决策 :agent(title);planning(abstract)

AI总结 本文提出一种框架,通过结合预训练的运动先验和模仿代理,在规划和执行阶段生成动态且长期的人-物交互动作,如持桌奔跑,提升了动态人-物交互任务的成功率。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11119 2026-05-13 cs.RO 78%

ASIP-Planner: Adaptive Planning for UAV Surface Inspection in Partially Known Indoor Environments

ASIP-Planner: 面向部分已知室内结构的自适应规划

Hanyu Jin, Zhefan Xu, Haoyu Shen, Xinming Han, Kanlong Ye, Kenji Shimada

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出ASIP-Planner框架,通过全局覆盖规划与局部视角调整模块,提升无人机在部分已知室内环境中的表面检测效率与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11509 2026-05-13 cs.AI cs.LG cs.MA cs.SY eess.SY 73%

Hierarchical LLM-Driven Control for HAPS-Assisted UAV Networks: Joint Optimization of Flight and Connectivity

分层LLM驱动控制用于HAPS辅助无人机网络:飞行与连接的联合优化

Zijiang Yan, Hao Zhou, Wael Jaafar, Jianhua Pei, Ping Wang, Halim Yanikomeroglu, Hina Tabassum

机构 * Department of Electrical Engineering and Computer Science, York University(约克大学电气工程与计算机科学系) Samsung Research America(三星美国研究院) Department of Software and IT Engineering, École de technologie supérieure (ÉTS), University of Quebec(魁北克大学软件与信息技术工程系,École de technologie supérieure) Non-Terrestrial Networks (Carleton-NTN) Lab and the Department of Systems and Computer Engineering, Carleton University(非地面网络(Carleton-NTN)实验室和系统与计算机工程系,卡尔顿大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在整合陆地和非陆地网络中多无人机系统的联合优化问题,提出基于LLM的分层多速率控制框架,通过高精度仿真平台验证了其在提升运输效率、通信吞吐量和减少碰撞率方面的优势。

Comments Submission for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11388 2026-05-13 cs.CL cs.AI 73%

Deep Reasoning in General Purpose Agents via Structured Meta-Cognition

通过结构化元认知实现通用代理中的深度推理

Dean Light, Michael Theologitis, Kshitish Ghate, Shuyue Stella Li, Benjamin Newman, Chirag Shah, Aylin Caliskan, Pang Wei Koh, Dan Suciu, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出深度推理方法,通过结构化元认知构建任务特定框架,提升复杂任务处理能力,在四个基准测试中超越现有方法,减少早终止和幻觉。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02799 2026-05-13 cs.LG cs.AI 73%

Joint Learning of Hierarchical Neural Options and Abstract World Model

层级神经选项与抽象世界模型的联合学习

Wasu Top Piriyakulkij, Wolfgang Lehrach, Kevin Ellis, Kevin Murphy

机构 * Cornell University(康奈尔大学) Google Deepmind(谷歌DeepMind)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgentOWL方法,通过高效样本学习抽象世界模型和层级神经选项,使智能体在Object-Centric Ataris游戏中以更少数据学习更多技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22168 2026-05-13 cs.DC cs.PL 71%

TileLoom: Automatic Dataflow Planning for Tile-Based Languages on Spatial Dataflow Accelerators

TileLoom:面向空间数据流加速器的tile基语言自动数据流规划

Wei Li, Zhenyu Bai, Heru Wang, Pranav Dangi, Zhiqiang Zhang, Cheng Tan, Huiying Lan, Weng-Fai Wong, Tulika Mitra

专题命中 规划决策 :planning(title)

AI总结 TileLoom通过MLIR框架实现tile基程序到空间数据流架构的编译,通过分布式核心和芯片内网络提升数据复用与通信效率,实验显示其性能与厂商库相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13163 2026-05-13 cs.LG 70%

Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback

高效算法用于具有带反馈的逻辑上下文滑动老虎机

Tanmay Goyal, Gaurav Sinha

机构 * Microsoft Research India(微软印度研究院)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出Slate-GLM-OFU和Slate-GLM-TS算法,通过局部规划和全局学习实现低计算成本和低遗憾,实验显示其在合成设置中优于现有基线,并在二分类任务中表现良好。

Comments Accepted to UAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11051 2026-05-13 cs.SE cs.AI cs.CL cs.LG 70%

On Problems of Implicit Context Compression for Software Engineering Agents

关于软件工程代理隐式上下文压缩的问题

Kirill Gelvan, Igor Slinko, Felix Steinbauer, Egor Bogomolov, Florian Kofler, Yaroslav Zharov

机构 * JetBrains Research(JetBrains研究院) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究软件工程代理在长周期任务中因上下文长度限制导致的失败问题,探讨连续嵌入编码方法的适用性及多步骤编码任务中的性能不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11519 2026-05-13 cs.AI cs.CL cs.LG 67%

Controllable User Simulation

可控用户模拟

Guy Tennenholtz, Ofer Meshi, Amir Globerson, Uri Shalit, Jihwan Jeong, Craig Boutilier

机构 * Google Research(谷歌研究) Tel Aviv University(特拉维夫大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出将可控模拟视为因果推断问题,通过改进模拟器训练方法消除 lookahead 偏差,实现更稳定的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12312 2026-05-13 cs.LG cs.AI 62%

Transferable Delay-Aware Reinforcement Learning via Implicit Causal Graph Modeling

可迁移的延迟感知强化学习:通过隐式因果图建模

Chenran Zhao, Dianxi Shi, Yaowen Zhang, Chunping Qiu, Shaowu Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) Institute of Military Transportation(军事交通运输研究院) School of Artificial Intelligence, Hebei University of Technology(人工智能学院,河北工业大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于隐式因果图建模的可迁移延迟感知强化学习方法,通过节点级语义编码和消息传递机制学习可迁移的结构表示和环境动态知识,以优化策略并实现跨任务知识迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12289 2026-05-13 cs.LG cs.AI 62%

PriorZero: Bridging Language Priors and World Models for Decision Making

PriorZero:连接语言先验与世界模型以实现决策制定

Junyu Xiong, Yuan Pu, Jia Tang, Yazhe Niu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 PriorZero通过解耦的rollout训练设计,将LLM生成的语义先验整合到基于世界模型的规划中,提升探索效率和长期性能,适用于文本冒险游戏和指令遵循任务。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12262 2026-05-13 cs.AI cs.LG 62%

Missingness-MDPs: Bridging the Theory of Missing Data and POMDPs

缺失性马尔可夫决策过程:弥合缺失数据理论与部分可观测马尔可夫决策过程之间的鸿沟

Joshua Wendland, Markel Zubia, Roman Andriushchenko, Maris F. L. Galesloot, Milan Ceska, Henrik von Kleist, Thiago D. Simao, Maximilian Weininger, Nils Jansen

机构 * Ruhr University Bochum(博德姆鲁尔大学) Brno University of Technology(布拉格技术大学) Radboud University Nijmegen(拉德博德大学奈杰姆) Harvard University(哈佛大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出缺失性马尔可夫决策过程(miss-MDP),一种结合缺失数据理论的POMDP子类,通过学习缺失函数来解决未知缺失函数下的最优策略问题,证明所得策略在真miss-MDP中近似最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15759 2026-05-13 cs.RO cs.AI cs.LG 62%

Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation

模拟蒸馏:在模拟中预训练世界模型以实现快速真实世界适应

Jacob Levy, Tyler Westenbroek, Kevin Huang, Fernando Palafox, Patrick Yin, Shayegan Omidshafiei, Dong-Ki Kim, Abhishek Gupta, David Fridovich-Keil

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) FieldAI

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SimDist框架,利用物理模拟器生成大量动作条件机器人经验,通过蒸馏结构先验提升世界模型性能,实现高效真实世界适应。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11114 2026-05-13 cs.LG cs.AI stat.ML 62%

In-Context Multi-Objective Optimization

上下文多目标优化

Xinyu Zhang, Conor Hassan, Julien Martinelli, Daolang Huang, Samuel Kaski

机构 * Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TAMO通过Transformer架构实现多目标黑盒优化,无需重新训练即可在不同任务间转移,显著提升优化效率并保持帕累托前沿质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11613 2026-05-13 cs.LG cs.AI 62%

From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

从通用相关性到输入特定的信用在在线自我蒸馏中

Guobin Shen, Lei Huang, Xiang Cheng, Chenxiao Zhao, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文研究在线自我蒸馏中奖励的测量与信用分配,提出CREDIT方法通过对比学习分离输入特定成分,提升模型在多个基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏