arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2976 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 909 篇

2603.29105 2026-06-16 cs.NI 版本更新 78%

LoRaWAN Gateway Placement for Network Planning Using Ray Tracing-Based Channel Models

基于射线追踪信道模型的LoRaWAN网关部署网络规划

Cláudio Modesto, Lucas Mozart, Glauco Gonçalves, Cleverson Nahum, Bruno Castro, Aldebaro Klautau

专题命中 规划决策 :planning(title,abstract)

AI总结 研究不同信道模型对LoRaWAN网关部署的影响,提出结合射线追踪与离散事件仿真的优化框架,发现模型选择显著影响部署方案,存在计算成本与现实保真度的权衡。

Comments This paper has been accepted at IEEE Open Journal of the Communications Society (DOI: https://doi.org/10.1109/OJCOMS.2026.3704345)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13090 2026-06-16 cs.RO 版本更新 78%

Multi-Robot Motion Planning from Vision and Language using Heat-Inspired Diffusion

基于热启发的扩散模型实现从视觉和语言的多机器人运动规划

Jebeom Chae, Junwoo Chang, Seungho Yeom, Yujin Kim, Jongeun Choi

机构 * Department of Artificial Intelligence, Yonsei University(燕山大学人工智能学院) School of Mechanical Engineering, Yonsei University(燕山大学机械工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出LHD框架,结合CLIP语义先验与碰撞避免扩散核,实现语言条件化的多机器人无碰撞轨迹规划,在成功率上优于先前方法并降低延迟。

Comments 8 pages, 6 figures, accepted by IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7118-7125, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23014 2026-06-16 cs.CV 版本更新 78%

Planning with Unified Multimodal Models

统一多模态模型规划

Yihao Sun, Zhilong Zhang, Yang Yu, Pierre-Luc Bacon

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Nanjing University(南京大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出Uni-Plan框架,利用统一多模态模型同时作为策略、动态模型和价值函数,通过自判别过滤避免动态预测幻觉,在具身决策任务中优于VLM方法,无需专家演示且数据可扩展。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00836 2026-06-16 cs.RO 版本更新 78%

One-Step Model Predictive Path Integral for Manipulator Motion Planning Using Configuration Space Distance Fields

基于构型空间距离场的一步模型预测路径积分用于机械臂运动规划

Yulin Li, Tetsuro Miyazaki, Kenji Kawashima

机构 * Department of Information Physics and Computing, The University of Tokyo(东京大学信息物理与计算系)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出将构型空间距离场与模型预测路径积分结合,利用CDF梯度统一代价函数并缩短规划时域至一步,实现高效避障,在2D环境和7自由度机械臂仿真中成功率近100%,控制频率超750Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06637 2026-06-16 cs.CV 版本更新 78%

CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning

CLAD: 面向视觉-语言程序规划的约束潜在动作扩散模型

Lei Shi, Andreas Bulling

机构 * Machine Perception and Interaction group, Örebro University(机器感知与交互组,奥雷布罗大学) Collaborative Artificial Intelligence group, University of Stuttgart(协作人工智能组,斯图加特大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出CLAD模型,利用变分自编码器学习动作和观测的潜在表示作为约束,引导扩散模型生成动作,在三个数据集上大幅超越现有方法。

Comments Accepted at RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00865 2026-06-15 cs.IR 版本更新 78%

Doctor-RAG: A Failure-Aware Repair Framework for Agentic Retrieval-Augmented Generation

Doctor-RAG:面向智能检索增强生成的故障感知修复框架

Shuguang Jiao, Chengkai Huang, Shuhan Qi, Xuan Wang, Yifan Li, Quanchi Weng, Lingchuan Liu, Xunliang Cai, Lina Yao

专题命中 规划决策 :agentic(title,abstract)

AI总结 提出Doctor-RAG框架,通过显式错误定位和前缀复用,在智能RAG中实现高效诊断与局部修复,显著提升多跳问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20428 2026-06-12 cs.RO 版本更新 78%

Lexicographic Minimum-Violation Motion Planning using Signal Temporal Logic

使用信号时序逻辑的字典序最小违规运动规划

Patrick Halder, Lothar Kiltz, Hannes Homburger, Johannes Reuter, Matthias Althoff

机构 * School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算信息与技术学院) ZF Friedrichshafen AG(弗赖堡汽车集团) Institute of System Dynamics, HTWG Konstanz(康斯坦茨HTWG系统动力学研究所)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种将字典序多目标优化转化为单目标标量优化的方法,通过非均匀量化和位移扩展MPPI求解器,并引入结合时空违规的谓词鲁棒性度量,实现可解释且可扩展的字典序STL最小违规运动规划。

Comments Submitted to the IEEE Open Journal of Intelligent Transportation Systems (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11009 2026-06-12 cs.HC 版本更新 78%

From Planning to Revision: How AI Writing Support at Different Stages Alters Ownership

从规划到修订:不同阶段的人工智能写作支持如何改变所有权感

Katy Ilonka Gero, Tao Long, Carly Schnitzler, Paramveer Dhillon

专题命中 规划决策 :planning(title,abstract)

AI总结 研究AI写作支持在规划、起草和修订阶段对作者所有权感的影响,发现任何AI辅助都会降低所有权感,但规划阶段影响最小,起草阶段影响最大,且AI贡献的文本和想法越多,所有权感越低。

Journal ref In Designing Interactive Systems Conference (DIS 26). June 13-17, 2026, Singapore, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26719 2026-06-12 physics.soc-ph 版本更新 78%

Planning for climate neutrality in the Nordic power sector: Insights from a non-harmonised comparison of eight energy system models

同方向下的多样化努力:北欧国家气候中性电力部门路径的多模型比较

Emir Fejzić, Will Usher, Ida Græsted Jensen, Marianne Zeyringer, Oskar Vågerö, Maximilian Roithner, Guillermo Valenzuela-Venegas, Rasmus Bramstoft, Marie Münster, Jean-Nicolas Louis, Pernille Seljom, Miguel Chang, Eirik Ogner Jåstad, Dmitrii Bogdanov, Christian Breyer

专题命中 规划决策 :planning(title,abstract)

AI总结 本文通过八个结构各异的能源系统模型比较北欧国家电力部门转型路径,揭示模型结果在关键指标上的分歧与共识,强调非协调多模型比较的价值与局限。

Comments 31 pages, 9 figures in main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06578 2026-06-11 cs.RO cs.SY eess.SY 版本更新 78%

Non-Equilibrium MAV-Capture-MAV via Time-Optimal Planning and Reinforcement Learning

非平衡MAV捕获MAV:基于时间最优规划和强化学习

Canlun Zheng, Zhanyu Guo, Zikang Yin, Chunyu Wang, Zhikun Wang, Shiyu Zhao

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,中国杭州) WINDY Lab, Department of Artificial Intelligence, Westlake University, Hangzhou, China(西湖大学人工智能系WINDY实验室,中国杭州) Department of Electrical Engineering, California Institute of Technology, Pasadena, USA(加州理工学院电气工程系,美国帕萨迪纳)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对高机动性目标捕获难题,本文设计紧凑型捕获MAV,结合时间最优规划与强化学习方法,在非稳定状态下实现目标捕获。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01324 2026-06-09 cs.RO 版本更新 78%

Integrated Hierarchical Decision-Making in Inverse Kinematic Planning and Control

集成化分层决策在逆运动学规划与控制中

Kai Pfeiffer, Quan Zhang, Yuqing Chen, Gordon Boateng, Yuquan Wang, Vincent Bonnet, Aberrahmane Kheddar

机构 * University of Cambridge(剑桥大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种高效的非线性规划框架,整合分层决策与全身逆运动学规划控制,解决逆运动学规划中同时选择端效应器位置的问题。

Comments Accepted paper to "Robotics: Science and Systems" (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24044 2026-06-09 math.OC 版本更新 78%

Bi-Level Route Optimization and Path Planning with Hazard Exploration

具有危险探索的双层路径优化与路径规划

Jimin Choi, Grant Stagg, Cameron K. Peterson, Max Z. Li

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种双层无人机监测策略,高层通过车辆路径问题优化访问顺序并引入基于边的质心Voronoi图分配路径预算,低层通过B样条轨迹最大化信息增益,贝叶斯推理动态更新危险概率,仿真验证了空间覆盖和危险发现率的提升。

Journal ref 2025 IEEE 64th Conference on Decision and Control (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19799 2026-08-14 cs.AI hep-lat 版本更新 77%

PhysMaster: Building an Autonomous AI Physicist for Theoretical and Computational Physics Research

PhysMaster:构建一个自主的AI物理学家用于理论和计算物理学研究

Tingjia Miao, Wenkai Jin, Jinxin Tan, Muhua Zhang, Xianghe Pang, Zexi Liu, Yuwen Du, Tian Jin, Tu Guo, Zhengliang Zhang, Jingkun Liu, Yuelin Hu, Jiejun Zhang, Yunjie Huang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Physics and Astronomy(物理天文学院) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Tsung-Dao Lee Institute(李政道研究所) Zhiyuan College(智源学院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) DP Technology(DP技术)

专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 PhysMaster通过结合抽象推理与数值计算,利用LANDAU数据宇宙提升决策可靠性,实现理论与计算物理学研究的自动化与自主发现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08876 2026-08-04 cs.LG 版本更新 77%

OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架

Xinyu Li, Ronghui Mu, Lin Li, Tianjin Huang, Gaojie Jin

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.LG

AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15097 2026-07-21 cs.SE cs.CR 版本更新 77%

Veritas: Grounding LLM Agents for Reliable Vulnerability Reasoning over Stripped Binaries

Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro

专题命中 规划决策 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.SE

AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 77%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08964 2026-07-14 cs.AI 版本更新 77%

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

长视野终端基准测试:使用基于密集奖励的评分方式测试智能体在长视野终端任务中的极限

Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang

机构 * Tencent(腾讯) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) Lehigh University(里海大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对现有终端基准测试局限,引入长视野终端基准测试(Long-Horizon-Terminal-Bench),含46个长视野任务。通过分解为分级子任务提供密集中间奖励,评估15个前沿模型,揭示改进空间,分析失败模式,发布该基准测试助力长视野终端智能体发展。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07339 2026-08-03 cs.AI cs.LG cs.RO 版本更新 76%

RAPiD: Reward-Guided Consistency Distillation of Diffusion Planners for Real-Time Autonomous Driving

RAPiD: 通过扩散行为先验实现安全高效的实时确定性轨迹规划

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * School of Information Technology, Monash University, Malaysia(墨尔本大学信息科技学院) Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院) TCS Research, India(印度TCS研究)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 RAPiD通过扩散行为先验实现高效安全的实时轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25364 2026-07-30 cs.AI cs.SE 版本更新 76%

Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales

人工智能代理的解释约束工具执行:无需信任模型原理的服务器验证动作声明

Genliang Zhu, Chu Wang

机构 * Accentrust(Accentrust公司) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :AI agent(title);分类 cs.AI、cs.SE

AI总结 研究针对人工智能代理工具执行问题,提出EBTE中介层,将原理内容转换为动作声明并经服务器检查。通过形式化和实现参考配置文件,经多场景验证其可行性与诊断价值,支持服务器检查动作声明而非其他相关特性。

Comments 25 pages, 1 figure, 15 tables. Revised presentation and synchronized evaluation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09408 2026-08-14 cs.IR 版本更新 75%

DREAM Technical Report

DREAM技术报告

Bin Zhang, Bowen Zheng, Chao Yi, Chengyu Lai, Dian Chen, Dimin Wang, Gaoyang Guo, Jialin Zhu, Jian Wu, Jing Yu, Jiuning Lin, Lingqing Zhang, Lingyun Zheng, Mao Zhang, Mingming Pan, Ruiquan Lan, Shuai Zhong, Wen Chen, Wendong Zhang, Xiaodong Zhu, Xuan Chen, Xunke Xi, Yifan Lu, Yiheng Wang, Yue Zeng, Yujie Luo, Yuning Jiang, Zhe Hu, Zhibo Xiao, Zihong Huang, Binbin Cao, Bo Zheng, Danning Wang, Dixuan Wang, Ge Fan, Haixia Wu, Han Zhu, Hao Fang, Haoming Chen, Huiping Chu, Jian Wang, Jianjun Wu, Jiawei Wu, Jiaxin Yu, Jingwen Liu, Jinzhe Shan, Kai Meng, Kai Zhang, Keqin Xu, Kewei Zhu, Lang Tian, Leihui Chen, Li Chen, Licheng Xu, Lide Xiao, Ruitong Zhang, Shiyao Peng, Silu Zhou, Tao Wang, Wei Shi, Wenjun Yang, Xiang Chen, Xiang Gao, Xiao Ren, Xu Liu, Xuwen Wang, Yang Li, Yeqiu Yang, Yi Hu, Yichen Yuan, Yinnan Song, Yipeng Yu, Yuan Liu, Yunqi Gao, Zhiliang Huang, Zhujin Gao, Zongyuan Wu

专题命中 规划决策 :agentic(abstract,abstract_cn);planning(abstract)

AI总结 该研究针对工业推荐流水线的缺陷,提出基于智能体方法的DREAM架构,通过意图引擎、元引擎与奖励双循环优化,在淘宝测试中实现多项核心指标提升,验证了智能体元控制的可行性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11140 2026-08-05 cs.SE cs.AI cs.CL cs.HC 版本更新 75%

Automated Visualization Code Synthesis via Multi-Path Reasoning and Feedback-Driven Optimization

通过多路径推理和反馈驱动优化实现自动化可视化代码合成

Wonduk Seo, Daye Kang, Hyunjin An, Taehan Kim, Soohyuk Cho, Seungyong Lee, Minhyeong Yu, Jian Park, Yi Bu, Seunghyun Lee

机构 * AI Research, Enhans, Seoul, South Korea Innovation \& Technology, KAIST, Daejeon, South Korea Department of Computer Science, University of California, Berkeley, CA, United States Department of Electrical

专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 VisPath通过多路径推理和反馈驱动优化,提升自动化可视化代码生成的可靠性与准确性。

Comments Accepted by International Conference on Pattern Recognization (ICPR 2026)

Journal ref Pattern Recognition. ICPR 2026. Lecture Notes in Computer Science, vol 16812. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26494 2026-07-31 cs.AI cs.CL cs.LG 版本更新 75%

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

MiniMax-M2系列:小激活释放最大现实智能

Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang, Boji Dan, Changhao Zhang, Changqing Yu, Chao Wang, Cheng Ma, Cheng Zhong, Cheng Zhu, Chengjun Xiao, Chengyi Yang, Chengyu Du, Chenyang Zhang, Chi Zhang, Chuangyi Huang, Chunhao Zhang, Chunhui Du, Chunyu Zhao, Congchao Guo, Da Chen, Deming Ding, Dianjun Sun, Dong Li, Dongyu Zhang, Enhui Yang, Fei Yu, Guang Zheng, Guodong Zheng, Guohong Li, Haichao Zhu, Haigang Zhou, Haimo Zhang, Han Ding, Hao Zhang, Haohai Sun, Haolin Lyu, Haonan Lu, Haoyu Wang, Huajie Shi, Huiyang Li, Jiacheng Chen, Jian Zhang, Jiaqi Zhuang, Jiaren Cai, Jiaxin Pan, Jiayao Li, Jiayuan Song, Jichuan Zhang, Jie Wang, Jihao Gu, Jin Zhu, Jingwei Dong, Jingyang Li, Jingyu Zhang, Jingze Zhuang, Jinhao Tian, Jinli Liu, Jinyi Hu, Jun Tao, Jun Zhang, Junbin Ruan, Junhao Xu, Junjie Yan, Junteng Liu, Junxian He, Kang Xu, Ke Ji, Ke Yang, Kecheng Xiao, Keyu Duan, Keyu Li, Le Han, Letian Ruan, Li Yuan, Lianfei Yu, Liheng Feng, Lijie Mo, Lin Li, Linge Du, Lingye Bao, Lingyu Yang, Lingyuan Zhou, Loki, Lu Chen, Lunbin Zeng, Ming Li, Ming Zhong, Mingliang Tao, Mingyuan Chi, Mujie Lin, Nan Hu, Ningxin Chen, Peiyin Zhu, Peng Gao, Pengcheng Gao, Pengfei Li, Penglin Li, Pengyu Zhao, Qibin Ren, Qibing Ren, Qidi Xu, Qihan Ren, Qile Li, Qin Wang, Quanliang Chen, Qunhong Zeng, Rong Tian, Rongxin Guo, Rui Dong, Ruitao Leng, Ruize Zhang, Shanqi Liu, Shaoxiang Chen, Shaoyu Chen, Sheng Jia, Shun Yao, Shuoran Zhao, Shuqi Yu, Sichen Li, Sicheng Pan, Songquan Zhu, Tengfei Li, Tian Xie, Tiancheng Qin, Tianle Li, Tianrun Liang, Wei Liu, Weiqi Xu, Weitao Li, Weixiang Chen, Weiyu Cheng, Weiyu Zhang, Wenhu Chen, Wenqian Zhao, Xiancai Chen, Xiangjun Song, Xiangyuan Wang, Xianzhen Luo, Xiao Luo, Xiao Su, Xiaobo Li, Xiaodong Han, Xiaojie Wu, Xihao Song, Xingyi Han, Xinyu Guan, Xuan Lu, Xun Zou, Xunhao Lai, Xutong Li, Xuyang Shen, Yan Gong, Yan Ma, Yang Jiao, Yang Wang, Yang Xu, Yangsen Wang, Ye Tang, Yicheng Chen, Yihang Wang, Yinran Qiu, Yiqi Shi, Yiting Guo, Yiwen Huang, Yixuan Wang, Yongyi Hu, Yu Gao, Yu Zhang, Yuan Li, Yuanxiang Ying, Yuanzhen Zhang, Yubo Wang, Yuchen Song, Yufeng Yang, Yuhang Meng, Yuhang Miao, Yuhao Li, Yujie Liu, Yulin Hu, Yunan Huang, Yunji Li, Yunyi Huang, Yusen Zhang, Yusu Hong, Yutao Xie, Yutong Zhang, Yuwen Liao, Yuxuan Shi, Yuze Wenren, Zebin Li, Zehan Li, Zejian Luo, Zeyu Jin, Zeyuan Sun, Zhanpeng Zhou, Zhaochen Su, Zhendong Li, Zhengmao Zhu, Zhengyuan Peng, Zhenhua Fan, Zhi Zhang, Zhichao Xu, Zhiheng Lv, Zhikang Xu, Zhitao He, Zhiwei He, Zhongyuan Li, Zibo Gao, Zijia Wu, Zijian Song, Zijian Zhou, Zijun Sun, Zishan Huang, Ziying Chen, Ziyue Ge

机构 * MiniMax

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MiniMax-M2系列混合专家语言模型,通过小激活参数实现前沿性能,核心包括智能体驱动数据管道、可扩展强化学习系统Forge及自进化检查点M2.7。

Comments Technical Report. 35 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04763 2026-07-28 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Multi-Turn On-Policy Distillation with Prefix Replay

基于前缀重放的多轮在线策略蒸馏

Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei

机构 * Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究用于智能体任务的在线策略蒸馏,提出重放前缀在线策略蒸馏方法,复用预收集教师轨迹作重放前缀,解决多轮在线策略蒸馏的前缀陷阱问题,提高效率且保持或提升精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21133 2026-07-09 cs.RO 版本更新 75%

Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum

通过主动空间大脑和可泛化动作小脑的人形全身 manipulation

Zhizhao Liang, Yi-Lin Wei, Xuhang Chen, Mu Lin, Yi-Xiang He, Zhexi Luo, Jun-Hui Liu, Kun-Yu Lin, Wei-Shi Zheng

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程学院,中山大学)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出了一种通用的人形 locomotion-manipulation 框架,通过主动空间大脑和可泛化动作小脑来解决复杂3D环境中空间理解困难和动作生成泛化困难的问题,展示了在多种任务和环境中的强性能。

Comments Project page: https://leungchaos.github.io/Humanoid-Whole-Body-Manipulation-via-Active-Spatial-Brain-and-Generalizable-Action-Cerebellum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05922 2026-06-11 cs.AI cs.CL cs.LG 版本更新 75%

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference

回顾性工具优化:通过轨迹回滚上的自我偏好改进LLM智能体

Wenbo Pan, Shujie Liu, Chin-Yew Lin, Jingying Zeng, Xianfeng Tang, Xiangyang Zhou, Yan Lu, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出一种自监督方法RHO,利用历史轨迹回滚和自偏好选择优化智能体工具集,无需真实标签,在SWE-Bench Pro上通过单轮优化将通过率从59%提升至78%。

Comments Code: https://github.com/wbopan/retro-harness ; Project website: https://paper-rho.wenbo.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19314 2026-06-11 cs.AI cs.CL cs.LG 版本更新 75%

PRInTS: Reward Modeling for Long-Horizon Information Seeking

PRInTS:面向长程信息检索的奖励建模

Jaewoo Lee, Archiki Prasad, Justin Chih-Yao Chen, Zaid Khan, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PRInTS生成式过程奖励模型,通过密集评分和轨迹摘要提升长程信息检索中工具交互与推理能力,在多个基准上超越前沿模型。

Comments ACL 2026, 19 pages, code: https://github.com/G-JWLee/PRInTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09809 2026-06-10 cs.CV 版本更新 75%

SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing

SciFlow-Bench:通过逆解析评估结构感知的科学图表生成

Tong Zhang, Honglin Lin, Zhou Liu, Chong Chen, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Huawei Cloud BU(华为云业务部) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 提出SciFlow-Bench基准,通过逆解析将生成的图表图像转换为结构化图进行比较,以结构可恢复性而非视觉相似性评估科学图表生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14380 2026-06-08 cs.RO 版本更新 75%

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

CRAFT:利用基础模型自主教练强化学习以完成多机器人协调任务

Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(机械工程系,加州大学伯克利分校)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 提出CRAFT框架,利用大语言模型分解任务、生成奖励函数,并通过视觉语言模型优化,实现多机器人协调学习,在四足导航和双臂操作任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14211 2026-06-09 cs.AI cs.LG 版本更新 74%

ASH: Agents that Self-Hone via Embodied Learning

ASH: 通过具身学习自我精炼的智能体

Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

机构 * University of Waterloo(多伦多大学) National Research Council Canada(加拿大国家研究理事会)

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG;AI agent(comments)

AI总结 提出ASH系统,通过从无标签互联网视频中学习具身策略,利用自改进循环和逆动力学模型,在长时域任务中显著超越基线方法。

Comments Published as a workshop paper at ICML 2026 Workshop on Scalable Learning and Optimization for Efficient Multimodal AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05033 2026-08-14 cs.DC cs.LG 版本更新 74%

SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System

SparseDitto:基于大语言模型的智能体系统,为不同稀疏性模式定制GPU内核

Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen Ding

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 SparseDitto是基于LLM的系统,可为不同矩阵、算子和GPU定制稀疏矩阵GPU内核,在多类算子与GPU上较cuSPARSE实现显著加速,还可提升GCN训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏