arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 946 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 946 篇

2603.26719 2026-06-12 physics.soc-ph 版本更新 78%

Planning for climate neutrality in the Nordic power sector: Insights from a non-harmonised comparison of eight energy system models

同方向下的多样化努力:北欧国家气候中性电力部门路径的多模型比较

Emir Fejzić, Will Usher, Ida Græsted Jensen, Marianne Zeyringer, Oskar Vågerö, Maximilian Roithner, Guillermo Valenzuela-Venegas, Rasmus Bramstoft, Marie Münster, Jean-Nicolas Louis, Pernille Seljom, Miguel Chang, Eirik Ogner Jåstad, Dmitrii Bogdanov, Christian Breyer

专题命中 规划决策 :planning(title,abstract)

AI总结 本文通过八个结构各异的能源系统模型比较北欧国家电力部门转型路径,揭示模型结果在关键指标上的分歧与共识,强调非协调多模型比较的价值与局限。

Comments 31 pages, 9 figures in main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06578 2026-06-11 cs.RO cs.SY eess.SY 版本更新 78%

Non-Equilibrium MAV-Capture-MAV via Time-Optimal Planning and Reinforcement Learning

非平衡MAV捕获MAV:基于时间最优规划和强化学习

Canlun Zheng, Zhanyu Guo, Zikang Yin, Chunyu Wang, Zhikun Wang, Shiyu Zhao

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,中国杭州) WINDY Lab, Department of Artificial Intelligence, Westlake University, Hangzhou, China(西湖大学人工智能系WINDY实验室,中国杭州) Department of Electrical Engineering, California Institute of Technology, Pasadena, USA(加州理工学院电气工程系,美国帕萨迪纳)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对高机动性目标捕获难题,本文设计紧凑型捕获MAV,结合时间最优规划与强化学习方法,在非稳定状态下实现目标捕获。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01324 2026-06-09 cs.RO 版本更新 78%

Integrated Hierarchical Decision-Making in Inverse Kinematic Planning and Control

集成化分层决策在逆运动学规划与控制中

Kai Pfeiffer, Quan Zhang, Yuqing Chen, Gordon Boateng, Yuquan Wang, Vincent Bonnet, Aberrahmane Kheddar

机构 * University of Cambridge(剑桥大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种高效的非线性规划框架,整合分层决策与全身逆运动学规划控制,解决逆运动学规划中同时选择端效应器位置的问题。

Comments Accepted paper to "Robotics: Science and Systems" (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24044 2026-06-09 math.OC 版本更新 78%

Bi-Level Route Optimization and Path Planning with Hazard Exploration

具有危险探索的双层路径优化与路径规划

Jimin Choi, Grant Stagg, Cameron K. Peterson, Max Z. Li

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种双层无人机监测策略,高层通过车辆路径问题优化访问顺序并引入基于边的质心Voronoi图分配路径预算,低层通过B样条轨迹最大化信息增益,贝叶斯推理动态更新危险概率,仿真验证了空间覆盖和危险发现率的提升。

Journal ref 2025 IEEE 64th Conference on Decision and Control (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19799 2026-08-14 cs.AI hep-lat 版本更新 77%

PhysMaster: Building an Autonomous AI Physicist for Theoretical and Computational Physics Research

PhysMaster:构建一个自主的AI物理学家用于理论和计算物理学研究

Tingjia Miao, Wenkai Jin, Jinxin Tan, Muhua Zhang, Xianghe Pang, Zexi Liu, Yuwen Du, Tian Jin, Tu Guo, Zhengliang Zhang, Jingkun Liu, Yuelin Hu, Jiejun Zhang, Yunjie Huang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Physics and Astronomy(物理天文学院) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Tsung-Dao Lee Institute(李政道研究所) Zhiyuan College(智源学院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) DP Technology(DP技术)

专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 PhysMaster通过结合抽象推理与数值计算,利用LANDAU数据宇宙提升决策可靠性,实现理论与计算物理学研究的自动化与自主发现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08876 2026-08-04 cs.LG 版本更新 77%

OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架

Xinyu Li, Ronghui Mu, Lin Li, Tianjin Huang, Gaojie Jin

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.LG

AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15097 2026-07-21 cs.SE cs.CR 版本更新 77%

Veritas: Grounding LLM Agents for Reliable Vulnerability Reasoning over Stripped Binaries

Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro

专题命中 规划决策 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.SE

AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 77%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08964 2026-07-14 cs.AI 版本更新 77%

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

长视野终端基准测试:使用基于密集奖励的评分方式测试智能体在长视野终端任务中的极限

Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang

机构 * Tencent(腾讯) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) Lehigh University(里海大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对现有终端基准测试局限,引入长视野终端基准测试(Long-Horizon-Terminal-Bench),含46个长视野任务。通过分解为分级子任务提供密集中间奖励,评估15个前沿模型,揭示改进空间,分析失败模式,发布该基准测试助力长视野终端智能体发展。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07339 2026-08-03 cs.AI cs.LG cs.RO 版本更新 76%

RAPiD: Reward-Guided Consistency Distillation of Diffusion Planners for Real-Time Autonomous Driving

RAPiD: 通过扩散行为先验实现安全高效的实时确定性轨迹规划

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * School of Information Technology, Monash University, Malaysia(墨尔本大学信息科技学院) Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院) TCS Research, India(印度TCS研究)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 RAPiD通过扩散行为先验实现高效安全的实时轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25364 2026-07-30 cs.AI cs.SE 版本更新 76%

Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales

人工智能代理的解释约束工具执行:无需信任模型原理的服务器验证动作声明

Genliang Zhu, Chu Wang

机构 * Accentrust(Accentrust公司) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :AI agent(title);分类 cs.AI、cs.SE

AI总结 研究针对人工智能代理工具执行问题,提出EBTE中介层,将原理内容转换为动作声明并经服务器检查。通过形式化和实现参考配置文件,经多场景验证其可行性与诊断价值,支持服务器检查动作声明而非其他相关特性。

Comments 25 pages, 1 figure, 15 tables. Revised presentation and synchronized evaluation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09408 2026-08-14 cs.IR 版本更新 75%

DREAM Technical Report

DREAM技术报告

Bin Zhang, Bowen Zheng, Chao Yi, Chengyu Lai, Dian Chen, Dimin Wang, Gaoyang Guo, Jialin Zhu, Jian Wu, Jing Yu, Jiuning Lin, Lingqing Zhang, Lingyun Zheng, Mao Zhang, Mingming Pan, Ruiquan Lan, Shuai Zhong, Wen Chen, Wendong Zhang, Xiaodong Zhu, Xuan Chen, Xunke Xi, Yifan Lu, Yiheng Wang, Yue Zeng, Yujie Luo, Yuning Jiang, Zhe Hu, Zhibo Xiao, Zihong Huang, Binbin Cao, Bo Zheng, Danning Wang, Dixuan Wang, Ge Fan, Haixia Wu, Han Zhu, Hao Fang, Haoming Chen, Huiping Chu, Jian Wang, Jianjun Wu, Jiawei Wu, Jiaxin Yu, Jingwen Liu, Jinzhe Shan, Kai Meng, Kai Zhang, Keqin Xu, Kewei Zhu, Lang Tian, Leihui Chen, Li Chen, Licheng Xu, Lide Xiao, Ruitong Zhang, Shiyao Peng, Silu Zhou, Tao Wang, Wei Shi, Wenjun Yang, Xiang Chen, Xiang Gao, Xiao Ren, Xu Liu, Xuwen Wang, Yang Li, Yeqiu Yang, Yi Hu, Yichen Yuan, Yinnan Song, Yipeng Yu, Yuan Liu, Yunqi Gao, Zhiliang Huang, Zhujin Gao, Zongyuan Wu

专题命中 规划决策 :agentic(abstract,abstract_cn);planning(abstract)

AI总结 该研究针对工业推荐流水线的缺陷,提出基于智能体方法的DREAM架构,通过意图引擎、元引擎与奖励双循环优化,在淘宝测试中实现多项核心指标提升,验证了智能体元控制的可行性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11140 2026-08-05 cs.SE cs.AI cs.CL cs.HC 版本更新 75%

Automated Visualization Code Synthesis via Multi-Path Reasoning and Feedback-Driven Optimization

通过多路径推理和反馈驱动优化实现自动化可视化代码合成

Wonduk Seo, Daye Kang, Hyunjin An, Taehan Kim, Soohyuk Cho, Seungyong Lee, Minhyeong Yu, Jian Park, Yi Bu, Seunghyun Lee

机构 * AI Research, Enhans, Seoul, South Korea Innovation \& Technology, KAIST, Daejeon, South Korea Department of Computer Science, University of California, Berkeley, CA, United States Department of Electrical

专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 VisPath通过多路径推理和反馈驱动优化,提升自动化可视化代码生成的可靠性与准确性。

Comments Accepted by International Conference on Pattern Recognization (ICPR 2026)

Journal ref Pattern Recognition. ICPR 2026. Lecture Notes in Computer Science, vol 16812. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26494 2026-07-31 cs.AI cs.CL cs.LG 版本更新 75%

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

MiniMax-M2系列:小激活释放最大现实智能

Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang, Boji Dan, Changhao Zhang, Changqing Yu, Chao Wang, Cheng Ma, Cheng Zhong, Cheng Zhu, Chengjun Xiao, Chengyi Yang, Chengyu Du, Chenyang Zhang, Chi Zhang, Chuangyi Huang, Chunhao Zhang, Chunhui Du, Chunyu Zhao, Congchao Guo, Da Chen, Deming Ding, Dianjun Sun, Dong Li, Dongyu Zhang, Enhui Yang, Fei Yu, Guang Zheng, Guodong Zheng, Guohong Li, Haichao Zhu, Haigang Zhou, Haimo Zhang, Han Ding, Hao Zhang, Haohai Sun, Haolin Lyu, Haonan Lu, Haoyu Wang, Huajie Shi, Huiyang Li, Jiacheng Chen, Jian Zhang, Jiaqi Zhuang, Jiaren Cai, Jiaxin Pan, Jiayao Li, Jiayuan Song, Jichuan Zhang, Jie Wang, Jihao Gu, Jin Zhu, Jingwei Dong, Jingyang Li, Jingyu Zhang, Jingze Zhuang, Jinhao Tian, Jinli Liu, Jinyi Hu, Jun Tao, Jun Zhang, Junbin Ruan, Junhao Xu, Junjie Yan, Junteng Liu, Junxian He, Kang Xu, Ke Ji, Ke Yang, Kecheng Xiao, Keyu Duan, Keyu Li, Le Han, Letian Ruan, Li Yuan, Lianfei Yu, Liheng Feng, Lijie Mo, Lin Li, Linge Du, Lingye Bao, Lingyu Yang, Lingyuan Zhou, Loki, Lu Chen, Lunbin Zeng, Ming Li, Ming Zhong, Mingliang Tao, Mingyuan Chi, Mujie Lin, Nan Hu, Ningxin Chen, Peiyin Zhu, Peng Gao, Pengcheng Gao, Pengfei Li, Penglin Li, Pengyu Zhao, Qibin Ren, Qibing Ren, Qidi Xu, Qihan Ren, Qile Li, Qin Wang, Quanliang Chen, Qunhong Zeng, Rong Tian, Rongxin Guo, Rui Dong, Ruitao Leng, Ruize Zhang, Shanqi Liu, Shaoxiang Chen, Shaoyu Chen, Sheng Jia, Shun Yao, Shuoran Zhao, Shuqi Yu, Sichen Li, Sicheng Pan, Songquan Zhu, Tengfei Li, Tian Xie, Tiancheng Qin, Tianle Li, Tianrun Liang, Wei Liu, Weiqi Xu, Weitao Li, Weixiang Chen, Weiyu Cheng, Weiyu Zhang, Wenhu Chen, Wenqian Zhao, Xiancai Chen, Xiangjun Song, Xiangyuan Wang, Xianzhen Luo, Xiao Luo, Xiao Su, Xiaobo Li, Xiaodong Han, Xiaojie Wu, Xihao Song, Xingyi Han, Xinyu Guan, Xuan Lu, Xun Zou, Xunhao Lai, Xutong Li, Xuyang Shen, Yan Gong, Yan Ma, Yang Jiao, Yang Wang, Yang Xu, Yangsen Wang, Ye Tang, Yicheng Chen, Yihang Wang, Yinran Qiu, Yiqi Shi, Yiting Guo, Yiwen Huang, Yixuan Wang, Yongyi Hu, Yu Gao, Yu Zhang, Yuan Li, Yuanxiang Ying, Yuanzhen Zhang, Yubo Wang, Yuchen Song, Yufeng Yang, Yuhang Meng, Yuhang Miao, Yuhao Li, Yujie Liu, Yulin Hu, Yunan Huang, Yunji Li, Yunyi Huang, Yusen Zhang, Yusu Hong, Yutao Xie, Yutong Zhang, Yuwen Liao, Yuxuan Shi, Yuze Wenren, Zebin Li, Zehan Li, Zejian Luo, Zeyu Jin, Zeyuan Sun, Zhanpeng Zhou, Zhaochen Su, Zhendong Li, Zhengmao Zhu, Zhengyuan Peng, Zhenhua Fan, Zhi Zhang, Zhichao Xu, Zhiheng Lv, Zhikang Xu, Zhitao He, Zhiwei He, Zhongyuan Li, Zibo Gao, Zijia Wu, Zijian Song, Zijian Zhou, Zijun Sun, Zishan Huang, Ziying Chen, Ziyue Ge

机构 * MiniMax

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MiniMax-M2系列混合专家语言模型,通过小激活参数实现前沿性能,核心包括智能体驱动数据管道、可扩展强化学习系统Forge及自进化检查点M2.7。

Comments Technical Report. 35 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04763 2026-07-28 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Multi-Turn On-Policy Distillation with Prefix Replay

基于前缀重放的多轮在线策略蒸馏

Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei

机构 * Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究用于智能体任务的在线策略蒸馏,提出重放前缀在线策略蒸馏方法,复用预收集教师轨迹作重放前缀,解决多轮在线策略蒸馏的前缀陷阱问题,提高效率且保持或提升精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21133 2026-07-09 cs.RO 版本更新 75%

Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum

通过主动空间大脑和可泛化动作小脑的人形全身 manipulation

Zhizhao Liang, Yi-Lin Wei, Xuhang Chen, Mu Lin, Yi-Xiang He, Zhexi Luo, Jun-Hui Liu, Kun-Yu Lin, Wei-Shi Zheng

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程学院,中山大学)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出了一种通用的人形 locomotion-manipulation 框架,通过主动空间大脑和可泛化动作小脑来解决复杂3D环境中空间理解困难和动作生成泛化困难的问题,展示了在多种任务和环境中的强性能。

Comments Project page: https://leungchaos.github.io/Humanoid-Whole-Body-Manipulation-via-Active-Spatial-Brain-and-Generalizable-Action-Cerebellum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05922 2026-06-11 cs.AI cs.CL cs.LG 版本更新 75%

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference

回顾性工具优化:通过轨迹回滚上的自我偏好改进LLM智能体

Wenbo Pan, Shujie Liu, Chin-Yew Lin, Jingying Zeng, Xianfeng Tang, Xiangyang Zhou, Yan Lu, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出一种自监督方法RHO,利用历史轨迹回滚和自偏好选择优化智能体工具集,无需真实标签,在SWE-Bench Pro上通过单轮优化将通过率从59%提升至78%。

Comments Code: https://github.com/wbopan/retro-harness ; Project website: https://paper-rho.wenbo.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19314 2026-06-11 cs.AI cs.CL cs.LG 版本更新 75%

PRInTS: Reward Modeling for Long-Horizon Information Seeking

PRInTS:面向长程信息检索的奖励建模

Jaewoo Lee, Archiki Prasad, Justin Chih-Yao Chen, Zaid Khan, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PRInTS生成式过程奖励模型,通过密集评分和轨迹摘要提升长程信息检索中工具交互与推理能力,在多个基准上超越前沿模型。

Comments ACL 2026, 19 pages, code: https://github.com/G-JWLee/PRInTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09809 2026-06-10 cs.CV 版本更新 75%

SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing

SciFlow-Bench:通过逆解析评估结构感知的科学图表生成

Tong Zhang, Honglin Lin, Zhou Liu, Chong Chen, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Huawei Cloud BU(华为云业务部) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 提出SciFlow-Bench基准,通过逆解析将生成的图表图像转换为结构化图进行比较,以结构可恢复性而非视觉相似性评估科学图表生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14380 2026-06-08 cs.RO 版本更新 75%

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

CRAFT:利用基础模型自主教练强化学习以完成多机器人协调任务

Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(机械工程系,加州大学伯克利分校)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 提出CRAFT框架,利用大语言模型分解任务、生成奖励函数,并通过视觉语言模型优化,实现多机器人协调学习,在四足导航和双臂操作任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14211 2026-06-09 cs.AI cs.LG 版本更新 74%

ASH: Agents that Self-Hone via Embodied Learning

ASH: 通过具身学习自我精炼的智能体

Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

机构 * University of Waterloo(多伦多大学) National Research Council Canada(加拿大国家研究理事会)

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG;AI agent(comments)

AI总结 提出ASH系统,通过从无标签互联网视频中学习具身策略,利用自改进循环和逆动力学模型,在长时域任务中显著超越基线方法。

Comments Published as a workshop paper at ICML 2026 Workshop on Scalable Learning and Optimization for Efficient Multimodal AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05033 2026-08-14 cs.DC cs.LG 版本更新 74%

SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System

SparseDitto:基于大语言模型的智能体系统,为不同稀疏性模式定制GPU内核

Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen Ding

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 SparseDitto是基于LLM的系统,可为不同矩阵、算子和GPU定制稀疏矩阵GPU内核,在多类算子与GPU上较cuSPARSE实现显著加速,还可提升GCN训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00485 2026-08-05 cs.CL 版本更新 74%

SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning

SERL-SQL:面向Text-to-SQL强化智能体学习的选择性回溯蒸馏

Tao Liu, Tao Feng, Xiangheng Li, Jinwang Song, Yifan Li, Xiaoqing Cheng, Dixuan Zhang, Siquan Li, Lin Lan, Hongying Zan, Kunli Zhang, Chao Wu

专题命中 规划决策 :agentic(title);分类 cs.CL

AI总结 该研究针对现有Text-to-SQL强化学习方法奖励指导不足的问题,提出SERL-SQL框架,通过教师模型重评分与掩码权重优化GRPO优势,在BIRD、Spider等基准上取得优异执行准确率,其奖励选择策略表现优于一致性选择。

Comments 9 pages,6 figures, Underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24341 2026-08-04 cs.AI 版本更新 74%

Simulating Tenant Responses to Energy Policy Interventions with Transaction-Cost-Aware LLM Agent

使用具有交易成本意识的大语言模型模拟租户对能源政策干预的反应

Weijie Xia, Stefanie Horian, Hanyue Huang, Queena K. Qian, Jie Yang, Pedro P. Vergara

机构 * Mistral AI(米斯特拉尔人工智能公司) Ollama(奥拉马)

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 研究利用感知交易成本,开发摩擦感知角色建模方法,以模拟租户对能源政策干预的反应。通过荷兰公民调查数据,比较不同模型和设置,发现纳入该方法能提升模型性能,为政策理论与LLM政策模拟搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27814 2026-08-04 cs.AI 版本更新 74%

ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks

ATOD: 面向多轮自主智能体的退火轮次感知在线策略蒸馏

Qitai Tan, Zefang Zong, Mo Li, Yipeng Shi, Yang Li, Peng Chen

机构 * Tencent Inc.(腾讯公司) Tsinghua University(清华大学)

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 提出ATOD混合在线蒸馏算法,通过退火式OPD-RL调度和轮次级重加权,解决长程交互任务中OPD性能天花板和RL早期低效问题,在三个基准上超越教师模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20253 2026-07-30 cs.SD cs.AI eess.AS 版本更新 74%

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

推动全曲生成的前沿:分层自回归规划与流匹配渲染

Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Biao Tian, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, Haina Zhu

机构 * Alibaba(阿里巴巴)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 该研究提出统一歌曲生成框架,支持多项任务,由四个组件构成。通过特定编码、建模、匹配及模块实现歌曲生成,还研究多种后训练策略,实验表明该框架在评估中性能具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05000 2026-07-17 cs.CR cs.LG 版本更新 74%

Agentic Vulnerability Reasoning on COTS Binaries

基于商用现货二进制文件的智能体漏洞推理

Hwiwon Lee, Jongseong Kim, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新 73%

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16057 2026-08-12 cs.CL cs.AI 版本更新 73%

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准

Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Carnegie Mellon University(卡内基梅隆大学) Harvard Business School, Harvard University(哈佛大学哈佛商学院)

专题命中 规划决策 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23146 2026-08-12 cs.LG cs.AI 版本更新 73%

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Syed Mahir Ahamed, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew Lin, Florian Lorkowski, Marina Pérez del Valle, Radman Rakhshandehroo, Patric Rommel, Emanuel Ruzak, Nathan Theng, Paul Yushin Rapoport

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) WorldQuant University(WorldQuant大学) UC Berkeley(加州大学伯克利分校) Aix-Marseille University(阿维尼翁-马赛大学) MIT(麻省理工学院) University of Zurich(苏黎世大学) University of British Columbia(不列颠哥伦比亚大学) University of Stuttgart(斯图加特大学) University of Buenos Aires(布宜诺斯艾利斯大学) California State University, Fresno(弗雷斯诺加州州立大学) University of Chicago(芝加哥大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。

Comments RLC 2026: Accepted to Finding the Frame Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏