arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35436 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35436 篇

2602.12276 2026-08-18 cs.AI cs.CL 版本更新 84%

Agentic Test-Time Scaling for WebAgents

代理测试时缩放 for WebAgents

Nicholas Lee, Lutfi Eren Erdogan, Chris Joseph John, Surya Krishnapillai, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 CATTS 通过动态分配计算资源提升代理在 WebArena-Lite 和 GoBrowse 的性能,比 React 提高 9.1%,且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13612 2026-08-17 cs.AI cs.SE 新提交 84%

SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data

SemPlan:面向企业数据的基于大语言模型(LLM)查询的结构化语义规划基准测试

Bruno Santos Teixeira

机构 * Universidade Federal de Ouro Preto (UFOP)(欧鲁普雷图联邦大学(UFOP))

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究构建了SemPlan基准测试,对比四种架构在企业数据LLM查询语义规划中的表现,发现结构化语义规划架构(A3)正确率最高,不同架构在正确率、策略合规性、成本等方面存在权衡。

Comments 11 pages, 3 figures, 9 tables. Submitted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13581 2026-08-17 cs.HC cs.AI cs.LG 新提交 84%

From Prediction to Intervention: Personalized Meal-Level Glucose Regulation via an LLM Agent

从预测到干预:基于大语言模型智能体的个性化餐级血糖调节

Mingyu Huang, Weiqing Min, Ying Jin, Yilin Wang, Shuqiang Jiang

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对精准营养中个性化血糖调节的挑战,提出融合生理学习与LLM智能体的系统,通过生理感知预测器和预测驱动优化智能体提升血糖预测准确率并降低血糖波动。

Comments Accepted in ACL 2026 Findings, 17 pages, 4 figures

Journal ref Findings of the Association for Computational Linguistics ACL 2026, pages 21629 to 21645

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13571 2026-08-17 cs.CL cs.AI 新提交 84%

Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems

并非所有token都平等:面向智能体大语言模型系统的感知通胀路由

Heming Fu, Shan Lin, Qianqian Xie, Guojun Xiong

机构 * Stony Brook University(石溪大学) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 针对智能体LLM系统的token通胀问题,提出四阶段路由框架InflationAgent,通过测量通胀、引入CBE信号、最大化SER并采用新鲜升级策略,在GSM8K上优于FrugalGPT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13560 2026-08-14 cs.CV cs.AI cs.CL 新提交 84%

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

AutoDesign:面向长视距智能体设计的元工具优化

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

机构 * Meituan(美团) MBZUAI(Mohamed bin Zayed University of Artificial Intelligence) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 AutoDesign是符合人类设计先验的元工具优化框架,以论文转海报生成任务为实例,在PosterBench上性能优于Claude Design,集成其学习的DesignHarness可提升代码智能体性能,且获人类最高偏好。

Comments Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19824 2026-08-13 cs.AI cs.CL cs.CV cs.RO 84%

From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning

从提示到路面通过时间:代理场景到计划推理中的时间定位

Ahmed Y. Gado, Omar Y. Goba, Alaa Hassanein, Catherine M. Elias, Ahmed Hussein

机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及) C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS) M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人) IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)

专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本研究探讨了在代理间通信中引入时间条件是否能保持或增强推理的一致性,而不会降低语义或逻辑一致性,并通过BDD-X数据集的curated子集评估了三种具有递增时间整合的规划器架构。结果表明,时间条件改变了推理风格,但并未在标准NLP正确性指标上产生统计显著改进,但定性分析揭示了预测危险推理、稳定纠正行为和战略分歧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03924 2026-08-13 cs.CL cs.AI 版本更新 84%

Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversation

不确定性作为规划信号:面向目标导向对话的多轮决策

Xinyi Ling, Ye Liu, Reza Averly, Xia Ning

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出CUP框架,通过结合语言模型与结构化规划,解决目标导向对话中不确定性与信息获取之间的平衡问题,提升对话成功率并减少交互轮次。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10628 2026-08-12 cs.CV cs.CL cs.LG 新提交 84%

InSight-doc: Agentic Visual Perception for Long-Document Understanding

InSight-doc:面向长文档理解的智能体视觉感知框架

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14574 2026-08-11 cs.CL cs.AI 版本更新 84%

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划决策 :planning(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06961 2026-08-10 cs.AI cs.LG 新提交 84%

CAi Copilot: Reducing Operational Workload in Molecular Design through Intent-Driven Agentic Workflows

CAi Copilot:通过意图驱动的智能体工作流减少分子设计中的操作工作量

Zhu Wang, Jiangyu Chen, Yingjun Shang, Yuhui Yao, Laiao Lu, Tianfan Fu, Na Zou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 规划决策 :agentic(title);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 CAi Copilot是面向专家的意图驱动智能体,通过三层架构整合分子设计分散工具,在45项任务中整体性能最优,得分84.59,可将设计意图转化为可追溯工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05499 2026-08-07 cs.CV cs.AI cs.LG 新提交 84%

APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

APQF:基于智能体分析引导的结构化剪枝与混合精度量化及自适应微调

Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou, Brian Gelder, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 APQF是结合LLM引导与分析支撑的自动化剪枝量化框架,在ImageNet等数据集上实现高压缩比且精度接近基线,优于现有联合剪枝量化方法。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04588 2026-08-06 cs.CL cs.AI 新提交 84%

EASy: Towards Efficient LLM-Based Agentic System

EASy:迈向高效的基于大语言模型的智能体系统

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Monash University(莫纳什大学)

专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00339 2026-08-04 cs.AI cs.CL 新提交 84%

Bayesian and Motivated Reasoning in AI Agents

AI智能体中的贝叶斯推理与动机推理

Eddie Yang

专题命中 规划决策 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究发现AI智能体的结论受先验信念影响,相同数值数据因框架不同会得出不同结论,揭示了委托其决策存在依赖未指定先验的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10739 2026-08-04 cs.CL cs.AI 版本更新 84%

Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving

长周期推理代理用于竞赛级数学问题求解

Yuzhe Gu, Songyang Gao, Zijian Wu, Lingkai Kong, Wenwei Zhang, Zhongrui Cai, Fan Zheng, Tianyou Ma, Junhao Shen, Haiteng Zhao, Duanyang Zhang, Huilun Zhang, Kuikun Liu, Chengqi Lyu, Yanhui Duan, Chiyu Chen, Ningsheng Ma, Jianfei Gao, Han Lyu, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab The Chinese University of Hong Kong(香港中文大学) ICMAT Spanish National Research Council(西班牙国家科研 council) The High School Affiliated to Renmin University of China(中国人民大学附属高中) Ren Hui Academy of Beijing(北京润辉学院)

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Intern-S1-MO,通过多轮分层推理和OREAL-H框架,突破IMO级数学问题的上下文限制,实现26/35分的优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12384 2026-08-03 cs.LG cs.AI 版本更新 84%

APPO: Agentic Procedural Policy Optimization

APPO: 智能体程序策略优化

Xucong Wang, Ziyu Ma, Yong Wang, Yuxiang Ji, Shidong Yang, Guanhua Chen, Pengkun Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图) Southern University of Science and Technology(南方科技大学)

专题命中 规划决策 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 提出APPO方法,通过细粒度分支和程序级优势缩放改进智能体强化学习的信用分配,在13个基准上平均提升近4个点。

Comments 25 pages, including 14 pages of main text and 11 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25090 2026-07-29 cs.AI cs.LG 新提交 84%

Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering

套娃智能体:展开子智能体以进行长期机器学习工程

Rushi Qiang, Changhao Li, Haotian Sun, Yuchen Zhuang, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对机器学习工程长期决策难题,提出套娃智能体框架,将问题解决分解为协调层次结构,高级协调器发指令,低级子智能体执行,开发有效训练范式,实验证明该方法有效且可扩展,能提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22385 2026-07-27 cs.AI cs.LG 新提交 84%

Agentic Root Cause Analysis through Evidence-Grounded Reasoning

通过基于证据的推理进行智能根本原因分析

Amaury Wei, Olga Fink

机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21653 2026-07-27 cs.LG cs.CL cs.DC 新提交 84%

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt:用于智能体强化学习的可扩展原生 PyTorch 训练框架

Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

机构 * NVIDIA(英伟达)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 研究针对智能体强化学习中算法修改成本高的问题,提出原生 PyTorch 训练框架 Molt,其代码简洁,智能体是普通程序,通过异步循环训练策略,在全异步协议下性能与先进堆栈相当,且开源提供资源。

Comments tech report for Molt

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19913 2026-07-23 cs.AI cs.CL cs.CR 新提交 84%

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

JANUS:预见长期智能体安全中的潜在风险

Yuan Xiong, Linji Hao, Shizhu He, Yequan Wang, Lijun Li

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究长期智能体安全潜在风险,提出JANUS框架,通过多智能体模拟合成轨迹,经预测与裁决耦合任务学习共享策略,用CoAA-RL联合优化,所产生的Vanguard模型提升了智能体安全防护及任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18806 2026-07-22 cs.AI cs.CL cs.MA 新提交 84%

AI Tour Meeting: Group Travel Planning by LLM Agents

人工智能旅游会议:基于大语言模型代理的团体旅行规划

Daisuke Kikuta

机构 * NTT, Inc.(日本电报电话公司)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出基于大语言模型代理的团体旅行规划框架AI Tour Meeting,通过自然语言讨论找满足约束和偏好的行程,提供相关配置接口实现灵活编排,可作模拟工具,还展示了系统验证等结果以证明其效用。

Comments The code is available at https://github.com/ntt-dkiku/ai-tour-meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18589 2026-07-22 cs.LG cs.AI 新提交 84%

Planning as Emergent Behavior in Reinforcement Learning with Relational Hidden States

关系隐藏状态强化学习中作为涌现行为的规划

Armin Sommer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究无模型强化学习中规划作为涌现行为的现象,发现神经架构的隐藏状态结构是决定因素,关系隐藏状态网络能获规划机制,恢复环境转移结构并改进策略,解释了涌现规划现象并引发相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17780 2026-07-21 cs.PL cs.AI cs.LG cs.MA 新提交 84%

ETAS: An Effect-Typed Language for Agent Systems

ETAS:一种用于智能体系统的效果类型化语言

Huiri Tan, Yikun Wang, Puyang Zhang, Shangyu Li, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能体系统设计ETAS语言,核心方法是通过规范一致性分配类型并用行为索引跟踪计算,主要贡献是为智能体执行相关推理提供编程语言基础,涵盖授权、非确定性等方面,还实现了该语言并形式化相关性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17225 2026-07-21 cs.SE cs.AI 新提交 84%

Specifying the Delegated-Autonomy Boundary: Requirements Engineering for Agentic AI

指定委托自治边界:智能体人工智能的需求工程

Chetan Arora, Andreas Vogelsang, Abbi Sharma

机构 * Faculty of IT, Monash University(莫纳什大学信息科技学院) University of Duisburg-Essen(杜伊斯堡-埃森大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究智能体人工智能系统带来的需求工程问题,提出机构理由记录和智能体委托策略两个互补工件,通过分级建模权限,以医院出院协调智能体和自动代码审查智能体为例阐释框架,解决委托自治边界相关需求工程问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14642 2026-07-17 cs.AI cs.SE 新提交 84%

MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

MCPEvol-Bench:跨MCP服务器动态演化对大语言模型智能体性能进行基准测试

Huanxi Liu, Kun Hu, Jiaqi Liao, Qiang Wang, Pengfei Qian, YuanZhao Zhai, Dawei Feng, Bo Ding, Huaimin Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) State Key Laboratory of Complex & Critical Software Environment(复杂关键软件环境国家重点实验室) National Key Laboratory of Parallel and Distributed Computing(并行与分布式计算国家重点实验室)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 研究针对MCP服务器工具接口和功能持续演化致评估有缺陷的问题,引入MCPEvol-Bench基准测试,提出11种变异算子模拟工具演化,对12个先进大语言模型测试,发现前沿模型也难适应,凸显大语言模型驱动工作流程脆弱性,确立评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21005 2026-07-17 cs.AI cs.CL 版本更新 84%

Building Agent Harnesses for Scientific Curation from Multimodal Sources

构建用于多模态来源科学数据提取的智能体框架

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Ruilian Zhang, Oluwaseun Egbelowo, Kelly Yee, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校) Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))

专题命中 规划决策 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09175 2026-07-13 cs.AI cs.CL 新提交 84%

Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

分布转移下可靠长时代理上下文演化的范围验证

Dan C. Hsu, Luke Lu

机构 * RedMind Research(红芯研究公司) National Taiwan University(国立台湾大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 研究长时代理上下文演化在分布转移下的验证问题,提出图正则化代理上下文演化方法(GRACE),通过维护指令为类型化语义图并在局部验证更新,实验表明该方法显著提升了严格可靠性。

Comments 18 pages, 3 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07178 2026-07-09 cs.LG cs.AI 新提交 84%

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

多任务智能强化学习的熵步长策略优化

Zetian Hu, Shunyu Liu, Junjie Zhang, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05804 2026-07-08 cs.AI cs.CL 新提交 84%

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

TurnOPD:使在线策略蒸馏具有转向意识以实现高效的长期智能体训练

Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文言)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对在线策略蒸馏在长期智能体任务应用不足的问题,提出TurnOPD,通过自适应展开深度预算和渐进式转向归一化损失预算两个策略,在多任务实验中实现更高验证准确率,超越普通OPD,推进了准确率-时间前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05001 2026-07-08 cs.CR cs.AI cs.LG cs.MA 新提交 84%

TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction

TACTIC-KG:面向网络威胁情报知识图谱构建的小型智能体团队

Mouhamed Amine Bouchiha, Gregory Blanc

机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Telecom SudParis, Institute of Paris Polytechnic)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对网络威胁情报报告构建知识图谱的问题,提出TACTIC-KG框架,将任务分解给模块化专业语言模型智能体,用轻量级模型提升性能并降低成本,实验表明优于整体式模型。

Comments 20 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13213 2026-07-08 cs.AI cs.HC cs.LG 版本更新 84%

Agentic AI for Commercial Insurance Underwriting with Adversarial Self-Critique

用于商业保险承保的具有对抗性自我批评的智能体人工智能

Joyjit Roy, Samaresh Kumar Singh

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对商业保险承保中AI可靠性问题,提出含对抗性自我批评机制的人在回路智能体系统,开发故障模式分类法。实验表明该机制降低幻觉率、提高准确率,还确保人类权威,为受监管领域安全部署AI提供模型。

Comments 9 pages, 8 figuers, 6 tables, Presented at 9th International Conference on Modern Computing, Networking and Applications (MCNA2026)

Journal ref 2026 International Conference on Modern Computing, Networking and Applications (MCNA)

详情

展开后加载摘要…

URL PDF HTML 收藏