arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-13 至 2026-05-13 共收录 191 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 16 篇

2605.12131 2026-05-13 cs.AI 89%

Rollout Cards: A Reproducibility Standard for Agent Research

Rollout Cards: 代理研究的可重复性标准

Charlie Masters, Ziyuan Liu, Stefano V. Albrecht

机构 * Deepflow Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出Rollout Cards作为代理研究的可重复性标准,通过保留rollout记录并声明报告规则,解决评估结果不可复现的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 85%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11928 2026-05-13 cs.AI 83%

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents

当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体

Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng Gao, Haiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu, Ryan A. Rossi, Hua Wei, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。

Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12497 2026-05-13 cs.CV 82%

From Web to Pixels: Bringing Agentic Search into Visual Perception

从网络到像素:将代理搜索引入视觉感知

Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue

机构 * Deep Research

专题命中 工具调用 :agentic(title,abstract);workflow(abstract)

AI总结 本文提出感知深度研究,引入WebEye基准,通过代理搜索到像素的工作流程,解决隐藏目标身份并绑定到框、掩码或 grounded 答案,实验显示其在三个任务视图中表现最佳。

Comments Project page: https://pixel-searcher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11868 2026-05-13 cs.CR cs.AI 79%

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

IPI-proxy:一种用于对抗间接提示注入的拦截代理

Chia-Pei, Chen, Kentaroh Toyoda, Anita Lai, Alex Leung

机构 * Vulcan Research, AIFT(火山研究,AIFT)

专题命中 工具调用 :AI agent(title,abstract);分类 cs.AI

AI总结 本文提出IPI-proxy,一种开源工具,用于针对间接提示注入攻击的网络浏览AI代理进行红队测试。通过拦截代理重写白名单域的HTTP响应,嵌入攻击负载,支持多种嵌入技术与插入点,实现参数扫描评估。

Comments code: https://github.com/VulcanLab/IPI-Proxy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 79%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17265 2026-05-13 cs.IR 78%

MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search

MemSearch-o1:通过基于推理的内存增长增强大语言模型的代理搜索

Sheng Zhang, Junyi Li, Yingyi Zhang, Pengyue Jia, Yichao Wang, Xiaowei Qian, Wenlin Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao

专题命中 工具调用 :agentic(title,abstract)

AI总结 MemSearch-o1通过基于推理的内存增长和回溯机制,解决代理搜索中的内存稀释问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11781 2026-05-13 cs.CR 78%

Five Attacks on x402 Agentic Payment Protocol

对x402代理支付协议的五种攻击

Zelin Li, Qin Wang, Zhipeng Wang

专题命中 工具调用 :agentic(title);workflow(abstract)

AI总结 本文分析x402协议,发现其在设计和实现中存在漏洞,提出五种攻击揭示授权、绑定、重放保护及Web层处理中的弱点,通过测试环境和审计验证攻击可行性,并提出缓解措施。

Comments 17 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09287 2026-05-13 cs.AI 74%

PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

PiCA:基于枢纽的搜索代理强化学习中的信用分配

Dongyi Liu, Yifan Niu, Qinwen Wang, Han Xiao, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 PiCA通过重新定义搜索轨迹为累积搜索进度的序列过程,解决长周期信用分配中的稀疏奖励、孤立信用和分布偏移问题,提升知识密集型问答任务性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06130 2026-05-13 cs.AI 57%

Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

技能1:通过强化学习实现技能增强代理的统一进化

Yaorui Shi, Yuxin Chen, Zhengxi Lu, Yuchun Miao, Shugui Liu, Qi GU, Xunliang Cai, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出Skill1框架,通过单一策略协同进化技能选择、利用与蒸馏,以共享任务目标优化技能库维护,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17637 2026-05-13 cs.AI cs.FL cs.LO 57%

About Time: Model-free Reinforcement Learning with Timed Reward Machines

关于时间:无模型强化学习中的定时奖励机

Rajarshi Roy, Anirban Majumdar, Ritam Raha, David Parker, Marta Kwiatkowska

机构 * University of Liverpool(利物浦大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出定时奖励机(TRMs)以解决传统奖励机在时间约束建模上的不足,通过无模型强化学习框架学习满足时间约束的最优策略,并在实验中验证其有效性。

Comments Extended version of paper accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11324 2026-05-13 cs.LG stat.ML 57%

$\varepsilon$-Good Action Identification in Fixed-Budget Monte Carlo Tree Search

固定预算蒙特卡洛树搜索中的ε-好动作识别

Yinan Li, Tuan Nguyen, Kwang-Sung Jun

机构 * Department of Computer Science(计算机科学系) University of Arizona(亚利桑那大学) CSE/GSAI POSTECH(POSTECH CSE/GSAI)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文研究了深度为2的max-min树中的固定预算max-min动作识别问题,提出了一种无需输入ε的算法,实现了实例依赖的误差界,并给出了max-min识别的下界结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11259 2026-05-13 cs.AI 57%

Template-as-Ontology: Configurable Synthetic Data Infrastructure for Cross-Domain Manufacturing AI Validation

模板作为本体:用于跨领域制造人工智能验证的可配置合成数据基础设施

Grama Chethan

机构 * Siemens Digital Industries Software(西门子数字工业软件)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI

AI总结 本文提出一种模板作为本体的方法,通过单一Python配置模块生成制造仿真和AI分析工具的统一数据结构,验证了跨领域制造AI验证的可行性。

Comments 18 pages, 1 fugure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10125 2026-05-13 cs.AI cs.HC 57%

Useful for Exploration, Risky for Precision: Evaluating AI Tools in Academic Research

对探索有用,对精确性危险:评估学术研究中的AI工具

Anthea Dathe, Kiran Hoffmann, Aline Mangold

机构 * Dresden University of Technology(德累斯顿技术大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本文评估了AI工具在学术研究中的应用,指出尽管AI工具能提升效率,但其输出难以验证且易出错,需结合人本与计算机指标进行评估,发现问答工具虽能提供概述但不适用于精确信息提取,文献综述工具则缺乏可复现性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12449 2026-05-13 cs.CV 50%

LychSim: A Controllable and Interactive Simulation Framework for Vision Research

LychSim:一种可控且交互式的视觉研究仿真框架

Wufei Ma, Chloe Wang, Siyi Chen, Jiawei Peng, Patrick Li, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 工具调用 :agentic(abstract)

AI总结 LychSim基于Unreal Engine 5构建,提供简洁的Python API、生成多样化高保真环境的流程数据管道以及MCP协议集成,用于视觉研究中的可控仿真与闭环优化。

Comments 3D-LLM/VLA Workshop at CVPR 2026. Project page: https://lychsim.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21887 2026-05-13 cs.RO 50%

IGV-RRT: Prior-Real-Time Observation Fusion for Active Object Search in Changing Environments

IGV-RRT:面向动态环境主动目标搜索的先验-实时观测融合

Wei Zhang, Ping Gong, Yujie Wang, Leilei Yao, Minghui Bai, Rongfeng Ye, Yinchuan Wang, Yachao Wang, Chen Sun, Chaoqun Wang

机构 * The School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Department of Data and Systems Engineering, HKU(数据与系统工程系,香港大学)

专题命中 工具调用 :planning(abstract)

AI总结 本文提出IGV-RRT框架,结合先验场景知识与实时目标相关性估计,通过双层语义映射模块和实时规划器提升动态环境中目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 58 篇

2605.11436 2026-05-13 cs.CL cs.AI 90%

Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty

Agent-BRACE: 通过 verbalized 状态不确定性解耦信念与行动以应对长 horizon 任务

Joykirat Singh, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Akshay Nambi, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 规划决策 :agent(title,title_cn);分类 cs.AI、cs.CL

AI总结 Agent-BRACE 通过解耦信念状态模型与策略模型,利用强化学习优化,在长 horizon 部分可观测任务中提升性能,实现上下文窗口恒定且任务相关信息保留。

Comments Code: https://github.com/joykirat18/Agent-BRACE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12078 2026-05-13 cs.SE cs.AI 87%

Property-Level Reconstructability of Agent Decisions: An Anchor-Level Pilot Across Vendor SDK Adapter Regimes

代理决策的属性级可重构性:一个跨供应商SDK适配器制度的锚点试点

Oleg Solozobov

机构 * Independent Researcher (Global)(全球独立研究员)

专题命中 规划决策 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究通过锚点试点评估代理决策在不同制度下的可重构性,发现不同制度下属性级可重构性存在差异,揭示了严格治理完整性在不同层级的分布情况。

Comments 23 pages, 3 tables; reproducibility package: https://doi.org/10.5281/zenodo.20077961; GitHub: https://github.com/agent-runtime-evidence/anchor-level-reconstructability-pilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11633 2026-05-13 cs.AI 84%

Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations

大语言模型代理能否应对灾难?评估异构地理空间推理在紧急行动中的基准测试

Junjue Wang, Weihao Xuan, Heli Qi, Pengyu Dai, Kunyi Liu, Hongruixuan Chen, Zhuo Zheng, Junshi Xia, Stefano Ermon, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Stanford University(斯坦福大学)

专题命中 规划决策 :agent(abstract,abstract_cn);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 本文提出DORA基准测试,评估大语言模型在灾难响应中的端到端流程,揭示了灾难领域接地、工具选择瓶颈和组合脆弱性等挑战。

Comments DORA stress-tests LLM agents on real-world disaster operations that demand comprehensive orchestration of 108 specialized tools over heterogeneous geospatial data

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11225 2026-05-13 cs.AI cs.LG cs.MA 84%

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

PIVOT:通过轨迹细化弥合LLM代理中的规划与执行

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis

专题命中 规划决策 :planning(title);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 PIVOT通过自监督框架迭代优化轨迹,解决LLM代理规划与执行不一致问题,实验证明其在约束满足和计算效率上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12004 2026-05-13 cs.CL 83%

Learning Agentic Policy from Action Guidance

从动作指导学习代理策略

Yuxiang Ji, Zengbin Wang, Yong Wang, Shidong Yang, Ziyu Ma, Guanhua Chen, Zonghua Sun, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) Southern University of Science and Technology(南方科技大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出ActGuide-RL方法,通过利用日常人类交互生成的动作数据,减少对昂贵迭代监督微调的依赖,提升代理强化学习在搜索代理基准上的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08978 2026-05-13 cs.AI 83%

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

学习探索:通过探索意识策略优化实现代理推理的扩展

Xingyuan Hua, Sheng Yue, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus, Shenzhen, China(中山大学深圳校区信息科学与技术学院) State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China(清华大学互联网体系结构国家重点实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种探索意识强化学习框架,使LLM代理在不确定性高时主动探索,通过细粒度奖励函数和探索意识分组机制提升任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11951 2026-05-13 cs.RO 82%

From Reaction to Anticipation: Proactive Failure Recovery through Agentic Task Graph for Robotic Manipulation

从反应到预见:通过代理任务图实现机器人操作的前瞻性故障恢复

Sheng Xu, Ruixing Jin, Huayi Zhou, Bo Yue, Guanren Qiao, Yunxin Tai, Yueci Deng, Kui Jia, Guiliang Liu

机构 * Sheng Xu Ruixing Jin Huayi Zhou Bo Yue Guanren Qiao Yunxin Tai Kui Jia Guiliang Liu

专题命中 规划决策 :agentic(title,abstract);planning(abstract)

AI总结 本文提出AgentChord系统,通过代理任务图实现前瞻性故障恢复,提升机器人操作的可靠性和自主性。

Comments 18 pages, accepted to RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11534 2026-05-13 cs.RO 82%

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

PRISM:在模拟的具身环境中进行规划与意图推理

Yunn Kang Lim, Pengzhan Sun, Ziyi Bai, Xun Xu, Angela Yao, Xulei Yang, Shijie Li

机构 * A*STAR National University of Singapore(国立新加坡大学) BAAI(北京人工智能研究院)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00775 2026-05-13 cs.RO cs.SY eess.SY 82%

SAGAS: Semantic-Aware Graph-Assisted Stitching for Offline Temporal Logic Planning

SAGAS:语义感知的图辅助拼接用于离线时序逻辑规划

Ruijia Liu, Ancheng Hou, Xiang Yin

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 SAGAS结合符号合成的组成性和从离线轨迹学习的数据驱动可达结构,实现零样本泛化,无需任务特定奖励或在线交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26752 2026-05-13 cs.CV 80%

GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents

GLM-5V-Turbo:迈向多模态代理的原生基础模型

V Team, Wenyi Hong, Xiaotao Gu, Ziyang Pan, Zhen Yang, Yuting Wang, Yue Wang, Yuanchang Yue, Yu Wang, Yanling Wang, Yan Wang, Xijun Liu, Wenmeng Yu, Weihan Wang, Wei Li, Shuaiqi Duan, Sheng Yang, Ruiliang Lv, Mingdao Liu, Lihang Pan, Ke Ning, Junhui Ji, Jinjiang Wang, Jing Chen, Jiazheng Xu, Jiale Zhu, Jiale Cheng, Ji Qi, Guobing Gan, Guo Wang, Cong Yao, Zijun Dou, Zihao Zhou, Zihan Wang, Zhiqi Ge, Zhijie Li, Zhenyu Hou, Zhao Xue, Zehui Wang, Zehan Qi, Zehai He, Yutao Zhang, Yusen Liu, Yukuo Cen, Yuchen Li, Yuan Wang, Yu Yang, Yongbin Liu, Yijian Lu, Yifan Xu, Yanzi Wang, Yanxiao Zhao, Yanfeng Wang, Yadong Xue, Yabo Xu, Xinyu Zhang, Xinyu Liu, Xiao Liu, Wenyi Zhao, Wenkai Li, Tianyu Tong, Tianshu Zhang, Shudan Zhang, Shengdong Yan, Qinkai Zheng, Mingde Xu, Licheng Bao, lat Long long, Jiaxing Xu, Jiaxin Fan, Jiawen Qian, Jiali Chen, Jiahui Lin, Jiadai Sun, Haozhi Zheng, Haoran Wang, Haochen Li, Hanyu Lai, Han Xu, Fan Yang, Dan Zhang, Da Yin, Chuangxin Zhao, Chengcheng Wu, Boyan Shi, Bowen Lv, Bowei Jia, Bo Li, Bin Chen, Baoxu Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Z.ai & Tsinghua University(Z.ai与清华大学)

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 GLM-5V-Turbo旨在提升多模态代理的感知与执行能力,通过整合多模态感知作为推理、规划和工具使用的核心组件,实现跨异构上下文的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11882 2026-05-13 cs.AI 79%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11706 2026-05-13 cs.LG 79%

GRAFT: Graph-Tokenized LLMs for Tool Planning

GRAFT:基于图-令牌的大型语言模型用于工具规划

Xinyi Gao, Xinyu Ren, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 GRAFT通过内部化工具图和在线策略工具上下文蒸馏,提升工具规划的依赖意识和准确性,实现更可靠的复杂工作流中的LLM工具规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11117 2026-05-13 cs.LG cs.MA math.PR 79%

GRAFT-ATHENA: Self-Improving Agentic Teams for Autonomous Discovery and Evolutionary Numerical Algorithms

GRAFT-ATHENA:自我改进的代理团队用于自主发现和进化数值算法

Juan Diego Toscano, Zhaojie Chai, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 GRAFT-ATHENA通过自我改进的代理团队,在自主发现和进化数值算法中实现跨领域的方法积累与能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11664 2026-05-13 cs.CR 78%

Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis

安全上下文注入:通过静态过滤和代理分析实现推理时的安全对齐

Zhenhao Xu, Wenhan Chang, Yichuan Chen, Yuxin Fang, Junhao Liu, Tianqing Zhu

专题命中 规划决策 :agentic(title,abstract)

AI总结 本文提出Safety Context Injection框架,通过静态过滤和代理分析在推理阶段提升模型安全性,减少攻击成功率和毒性。

Comments 17pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏