arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-22 至 2026-07-22 共收录 62 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 62 篇

2508.00429 2026-07-22 cs.CL cs.LG cs.MA 版本更新 90%

Node-as-Agent: Graph Agentic Network

节点即智能体:图智能体网络

Minghao Guo, Xi Zhu, Qingyue Jiao, Xiujin Liu, Haochen Xue, Chong Zhang, Shuhang Lin, Jingyuan Huang, Ziyi Ye, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学) University of Liverpool(利物浦大学) Fudan University(复旦大学)

专题命中 规划决策 :agent(title,abstract);agentic(title,abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 研究针对图神经网络不能处理节点信息不平衡及忽略全局语义关系的局限,提出检索增强图智能体网络ReaGAN,赋予节点自主决策能力,通过智能体规划和局部 - 全局检索实现自适应消息传播,在少样本设置下性能优异。

Comments 11 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14512 2026-07-22 cs.AI cs.CL cs.LG 版本更新 89%

RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning

RetroAgent:利用大语言模型在结构化记忆中进行搜索以实现智能逆合成规划

Yanqiao Zhu, Jingru Gan, Xiaoqi Sun, Fang Sun, Yidan Shi, Md Mofijul Islam, Chao Shang, Wenhao Gao, Connor W. Coley, Yizhou Sun, Wei Wang

机构 * UCLA(加利福尼亚大学洛杉矶分校) MIT(麻省理工学院) Amazon(亚马逊公司) UPenn(宾夕法尼亚大学)

专题命中 规划决策 :planning(title,abstract);agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究多步逆合成规划难题,提出RetroAgent智能体,通过结合结构化记忆桥接符号搜索与神经推理,利用记忆和化学工具观察搜索状态,实验证明其在分布内和分布外基准测试中性能强且泛化能力好。

Comments To appear at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18243 2026-07-22 cs.AI 新提交 88%

From Agent Failure Paths to Quantified Residual Risk: A Compositional Framework for Resilient Agentic AI

从智能体故障路径到量化残余风险:一种用于弹性智能体人工智能的组合框架

Hassan Karim, Sai Sitharaman, Deepti Gupta, Danda B. Rawat

专题命中 规划决策 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 研究智能体人工智能风险表示问题,提出CPSAINT和FRIESA-K结合故障机制与风险估计,通过单独惩罚报告治理可观测性,形式化结构可组合性,在两个场景展示框架,获支持跨域推理等的紧凑内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29932 2026-07-22 cs.AI 版本更新 86%

SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon Strategy Game Planning

SAGA: 场景感知、目标演化的长时域CivRealm策略规划智能体

Tianyu Jin, Shuo Chen, Yida Wang, Liuyu Xiang, Yingzhuo Liu, Yexin Li, Peipei Li, Zhaofeng He

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对长时域策略游戏中场景盲视、上下文溢出和跨游戏学习浅层化问题,提出SAGA多智能体框架,通过地图语义场景图、工具增强规划器和双时域反馈循环,在FreeCiv中取得最高文明评分并降低输出令牌27%。

Comments 18 pages, 4 figures. Code https://github.com/Kazecloudk/SAGA-Scene-Aware-Goal-Evolving-Agents-for-Long-Horizon-Strategy-Game-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19284 2026-07-22 cs.RO 新提交 85%

Stochastic Multi-Objective Kinodynamic Planning Against Adversaries

针对对手的随机多目标运动动力学规划

Thomas Marshall Vielmetti, Daniel Cherenson, Dimitra Panagou

机构 * University of Michigan(密歇根大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 研究在含随机混合对手环境下的多目标运动动力学规划,核心方法是将规划空间转移到闭环策略序列,通过蒙特卡洛粒子展开评估风险,引入SMO-RRT和SMO-SST算法,推导有限样本界,实现概率安全规划。

Comments 8 pages, 1 figure, accepted to CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19238 2026-07-22 cs.CE 新提交 85%

FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents

FinanceComplexQA:对工业级金融文档进行智能体推理的基准测试

Xianfu Cheng, Shiwei Zhang, Jiyu Zhao, Jian Yang, Xinyuan Wang, Ming Zhou, Weixiao Zhou, Xiangyuan Guan, Xiang Li, Zhenhe Wu, Ziyi Ni, Zhoujun Li, Bingjing Xu

专题命中 规划决策 :agentic(title,abstract);agent(abstract);workflow(abstract)

AI总结 研究针对金融文档智能体推理性能差异问题,设计Finance-LaTeX SKILL生成金融文档和问答对,引入FinanceComplexQA基准测试,对领先系统和工具全面评估,通过分析失败案例研究其在多方面的能力。

Comments 27 pages, 9 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18806 2026-07-22 cs.AI cs.CL cs.MA 新提交 84%

AI Tour Meeting: Group Travel Planning by LLM Agents

人工智能旅游会议:基于大语言模型代理的团体旅行规划

Daisuke Kikuta

机构 * NTT, Inc.(日本电报电话公司)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出基于大语言模型代理的团体旅行规划框架AI Tour Meeting,通过自然语言讨论找满足约束和偏好的行程,提供相关配置接口实现灵活编排,可作模拟工具,还展示了系统验证等结果以证明其效用。

Comments The code is available at https://github.com/ntt-dkiku/ai-tour-meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18589 2026-07-22 cs.LG cs.AI 新提交 84%

Planning as Emergent Behavior in Reinforcement Learning with Relational Hidden States

关系隐藏状态强化学习中作为涌现行为的规划

Armin Sommer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究无模型强化学习中规划作为涌现行为的现象,发现神经架构的隐藏状态结构是决定因素,关系隐藏状态网络能获规划机制,恢复环境转移结构并改进策略,解释了涌现规划现象并引发相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18530 2026-07-22 cs.LG cs.AI 新提交 81%

Censoring-Aware In-Context Learning for Generalized Supplier Lead Time Estimation in Supply Chain Planning

供应链规划中广义供应商提前期估计的审查感知上下文学习

Christopher Wang, Sebastien Ouellet, Behrouz Haji Soleimani, Ali Etemad

机构 * Queen’s University(女王大学) Kinaxis Inc.(Kinaxis公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究供应链规划中供应商提前期预测问题,提出审查感知上下文学习模型LeadTime-ICL,结合Transformer与条件归一化流头,经预训练可适应新数据集,在多数据集上评估表现优异,为工业规划提供准确低成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26182 2026-07-22 cs.CV cs.AI cs.LG 版本更新 81%

Lifting Embodied World Models for Planning and Control

提升具身世界模型用于规划与控制

Alex N. Wang, Trevor Darrell, Pavel Izmailov, Yutong Bai, Amir Bar

机构 * Computer Science, New York University(纽约大学计算机科学系) BAIR, UC Berkeley(伯克利大学BAIR)

专题命中 规划决策 :planning(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级策略,将高层动作映射到低层关节动作序列,结合冻结的世界模型,实现预测未来观察的提升世界模型,有效降低规划复杂度。

Comments Accepted to ECCV2026. Edited policy masking

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19306 2026-07-22 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 79%

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs

从距离到轨迹:无人机的实时带符号距离函数映射与距离加速运动规划

Jason Stanley, Zhirui Dai, Qihao Qian, Tzu-Chin Ho, Tianxing Fan, Siddharth Saha, Christopher Barngrover, Ki Myung Brian Lee, Nikolay Atanasov

机构 * UC San Diego(加州大学圣地亚哥分校) Shield AI(护盾人工智能公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究针对无人机在杂乱环境中的自主飞行,提出围绕带符号距离函数协同设计映射与规划阶段。开发OREN重建SDF,Bubble$^\star$基于距离信息规划,减少碰撞检查。集成方法在四旋翼飞行器上实时导航,提升SDF估计并快速找到长轨迹。

Comments 25 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18347 2026-07-22 cs.SE cs.CR cs.MA 新提交 79%

A Decision-Centered Reference Architecture for Trustworthy Agentic Commerce

用于可信代理商务的以决策为中心的参考架构

Dimitrios S. Sfiris

专题命中 规划决策 :agentic(title,abstract);分类 cs.SE

AI总结 研究针对代理商务问题,提出以决策为中心的与协议无关的架构,含规范信封等多种机制,通过开源实现、多场景和消融评估,支持受保护依赖项检测等多项功能,但未涵盖部分关键特性。

Comments 23 pages, 3 figures. Includes ancillary reproducibility materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16299 2026-07-22 cs.CL 版本更新 79%

PyPhonPlan: Simulating phonetic planning with dynamic neural fields and task dynamics

PyPhonPlan:基于动态神经场和任务动态的语音规划模拟

Sam Kirkham

机构 * Phonetics Laboratory, Lancaster University, United Kingdom(兰卡斯特大学语音实验室,英国)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 PyPhonPlan通过动态神经场和任务动态模拟,提供模块化组件实现语音规划建模,展示了交互性语音动态建模能力。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15875 2026-07-22 cs.RO cs.AI 版本更新 79%

Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation

Fly0: 解耦语义定位与几何规划以实现零样本空中导航

Zhenxing Xu, Yihong Lu, Weidong Bao, Zhengqiu Zhu, Jingxuan Zhou, Zhichuang Wang, Ji Wang, Lihua Liu, Wei He

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) Information Support Force Engineering University(信息支援力量工程大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19336 2026-07-22 cs.AI cs.CL 新提交 79%

Agents in the Wild: Where Research Meets Deployment

野外的智能体:研究与部署的交汇点

Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini

机构 * Georgetown University(乔治敦大学) Salesforce(Salesforce公司) Bayer(拜耳公司) Bloomberg(彭博公司) Microsoft Research(微软研究院)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 探讨基于大语言模型的智能体系统从研究到部署的转变,通过案例研究分析成功设计模式及失败缓解策略,为与会者提供跨行业安全可靠部署的全面视角、设计模式、评估清单和模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18855 2026-07-22 cs.RO cs.SY eess.SY 新提交 78%

Pose-Parameterized Motion Planning and CBF-QP Self-Collision Filtering for a Long-Reach Drilling Boom

用于长距离钻臂的姿态参数化运动规划和CBF-QP自碰撞过滤

Mehdi Heydari Shahna, Tuomo Kivelä, Jouni Mattila

机构 * Faculty of Engineering and Natural Sciences, Tampere University(坦佩雷大学工程与自然科学学院) Sandvik Mining and Construction Oy(山特维克采矿与建筑公司)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究针对长距离钻臂从操作员监督控制向自主控制转变的需求,提出在测量状态逆运动学中集成姿态参数化规划与CBF-QP的方法,经两项钻孔任务评估,该方法效果良好,无逆运动学故障,位置误差小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18517 2026-07-22 cs.RO 新提交 78%

Beyond Fixed Goal Delivery: Online POMDP Planning for Target Interception in Crowds

超越固定目标交付:人群中目标拦截的在线部分可观测马尔可夫决策过程规划

Himanshu Gupta, Kelvin Aladum, Nisar Ahmed, Bradley Hayes, Zachary Sunberg

机构 * Dept. of Aerospace Engineering Sciences(航空航天工程科学系) Dept. of Computer Science, University of Colorado Boulder(科罗拉多大学博尔德分校计算机科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究拥挤环境中目标拦截问题,将其建模为部分可观测马尔可夫决策过程,用树搜索在线求解。对比顺序路径速度规划器和统一规划器,发现高密度时前者安全拦截率低、耗时多,揭示了空间限制的结构局限性。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03642 2026-07-22 cs.CG 版本更新 78%

Generalized k-Cell Decomposition for Visibility Planning in Polygons

多边形中用于可见性规划的广义 k 单元分解

Yeganeh Bahoo, Sajad Saeedi, Roni Sherman

专题命中 规划决策 :planning(title,abstract)

AI总结 研究多边形环境追逃问题,提出广义 k 单元分解方法,通过纳入特定可见性多边形扩展现有工作,构建分割线并证明正确性,实现可靠路径规划,为机器人监控开辟新途径,难点在于计算多边形和找分割线交点。

Comments Presented at the 32nd Annual Fall Workshop on Computational Geometry (FWCG 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11453 2026-07-22 econ.TH 75%

Persistence, patience and costly information acquisition

持久性、耐心与 costly 信息获取

Benjamin Davies

专题命中 规划决策 :agent(summary_cn,abstract)

AI总结 研究探讨了在高斯AR(1)过程下,理性 agent 如何平衡信息获取成本与信念不精确成本,分析持久性和耐心对稳态信念和成本的影响。

Comments 13 pages, 1 figure. v2 clarifies exposition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19232 2026-07-22 cs.LG cs.MA 新提交 74%

S3: Stable Subgoal Selection by Constraining Uncertainty of Coarse Dynamics in Hierarchical Reinforcement Learning

S3:通过约束分层强化学习中粗粒度动力学的不确定性进行稳定子目标选择

Kshitij Kumar Srivastava, Kshitij Jerath

机构 * University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)

专题命中 规划决策 :agent(abstract,comments);planning(abstract);分类 cs.LG;autonomous agent(comments)

AI总结 研究分层强化学习中高层智能体子目标选择问题,提出用粗粒度动力学提供动力学感知内在动机,通过最小化预测不确定性稳定高层策略,经实验验证该方法在非平稳长期环境中表现优于现有方法。

Comments Manuscript accepted to the Eighteenth Workshop on Adaptive and Learning Agents (ALA), at the 25th International Conference of Autonomous Agents and Multi Agent Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13791 2026-07-22 cs.RO cs.CV cs.HC cs.LG 74%

Learning to Assess Danger from Movies for Cooperative Escape Planning in Hazardous Environments

学习从电影中评估危险以进行合作逃离规划在危险环境中

Vikram Shree, Sarah Allen, Beatriz Asfora, Jacopo Banfi, Mark Campbell

专题命中 规划决策 :planning(title);分类 cs.LG

AI总结 本文提出利用电影数据训练机器人评估危险,结合多模态信息提升人机合作逃离效率。

Comments 8 pages, 8 figures Accepted for publication at 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18715 2026-07-22 cs.AI 新提交 70%

DWM: Separating World Effects from Actions in Latent World Models

DWM:在潜在世界模型中分离世界效应与动作

Yi-Ge Zhang, Tianqi Du, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究在潜在世界模型中分离世界效应与动作的问题,提出DWM框架,通过辅助世界头和正交性约束实现预测转换的显式加法分解,在构建的W变体基准测试中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18241 2026-07-22 cs.AI 新提交 70%

BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

BatchDAG:用于企业数据上可扩展即席分析的大语言模型规划执行图

Anupreet Walia

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对企业数据跨实体分析问题,提出BatchDAG系统,大语言模型生成操作DAG,经确定性引擎评估。通过实体感知批处理优化,减少大语言模型调用。实验显示其质量高、溯源性好,能高效处理查询,是通用编排层替代手工工作流程。

Comments 9 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14751 2026-07-22 cs.LG 版本更新 70%

HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents

HERAKLES:用于开放式语言模型智能体的分层技能编译

Thomas Carta, Clément Romac, Loris Gaven, Pierre-Yves Oudeyer, Olivier Sigaud, Sylvain Lamprier

机构 * Inria(Flowers)(Inria) University of Bordeaux(波尔多大学) Sorbonne Université (ISIR)(索邦大学) Univ Angers (LERIA) SFR MATHSTIC(昂格斯大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 研究部分可观测、稀疏奖励且目标空间大的环境中目标条件强化学习,提出HERAKLES分层智能体,联合学习高级语言模型策略与低级控制器,通过同时训练实现可扩展技能组合,提升开放式组合环境下的效率和适应性。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18453 2026-07-22 math.OC 新提交 67%

A National-Scale EV Charging Scheduling Framework: Optimal Detour Routing Under Infrastructure Capacity Constraints

一个全国规模的电动汽车充电调度框架:基础设施容量约束下的最优迂回路由

Taner Cokyasar

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 研究在现有充电基础设施下电动汽车长途旅行调度负担与成本,提出基于优化的可扩展框架,分三阶段计算最优充电调度,应用于大量车辆轨迹,能快速生成可行调度并评估电动汽车成本竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19270 2026-07-22 cs.LG cs.AI 新提交 62%

GUIDED Network-Agnostic Feature Initialization for Spatial Transferability in GNN-based Models

基于GNN的模型中用于空间可迁移性的引导式网络无关特征初始化

Alessandro Scalese, Santhanakrishnan Narayanan, Constantinos Antoniou

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对交通分配问题中GNN模型空间泛化差的问题,提出网络无关初始化层GUIDED,通过在虚拟链路注入需求标量属性标准化输入空间。实验表明其能提升模型性能、鲁棒性及参数效率,减少训练时间,为相关空间问题提供通用蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19191 2026-07-22 cs.CV cs.AI cs.LG 新提交 62%

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

ABot-World-0:在单台桌面GPU上进行无限交互式世界展开

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 介绍ABot-World-0这一用于实时长视野闭环交互的动作条件视频世界模型,利用多源数据学习世界动态。通过多种技术提炼模型,设计控制界面与部署堆栈,在单台桌面GPU上实现高效视频流传输,实验验证其有竞争力的可控性和世界演变能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18604 2026-07-22 cs.RO cs.AI cs.LG cs.NI cs.SY eess.SY 新提交 62%

Intelligent Multi-UAV Navigation in ITNTNs: A Hierarchical LLM Approach

智能多无人机在综合陆地与非陆地网络中的导航:一种分层大语言模型方法

Zijiang Yan, Hao Zhou, Wael Jaafar, Jianhua Pei, Ping Wang, Halim Yanikomeroglu, Hina Tabassum

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对高速无人机在三维空中高速公路部署中面临的协调问题,提出分层大语言模型驱动控制框架,利用云端大语言模型管理全局负载平衡,边缘大语言模型转化局部观测为子目标,引导深度强化学习控制器执行轨迹,降低碰撞率并提高系统吞吐量。

Comments This paper has been accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18293 2026-07-22 cs.LG cs.CL 新提交 62%

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏

Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :tool use(abstract);分类 cs.CL、cs.LG

AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13070 2026-07-22 cs.SE cs.AI 版本更新 62%

Falsifiable Release Gates for Self-Improving Systems: Standing Invariants at Scale

用于自我改进系统的可证伪发布门限

Deepak Soni

机构 * AI Architect(人工智能架构师)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究自我改进系统安全声明,提出可证伪发布门限及构建验证方法,在Antahkarana运行时应用,经机器检查确保安全,发布验收结果,明确范围,使结果可重现、门限可在其他框架运行。

Comments 23 pages, 14 figures. Major revision merging the follow-up "Standing Invariants at Scale" into this paper per arXiv moderation: the machine-checked action-safety core preserved across six further releases, six new invariant families with teeth, and real-hardware self-improvement; suite grown from 122 to 563 tests. Software, gate suite, run artifacts, and TLA+ spec are open source

详情

展开后加载摘要…

URL PDF HTML 收藏