arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 231 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 231 篇

2602.13769 2026-08-05 cs.AI cs.CE cs.NE 版本更新 92%

OR-Agent: Bridging Evolutionary Search and Structured Research for Automated Algorithm Discovery

OR-Agent:连接进化搜索与结构化研究以实现自动化算法发现

Qi Liu, Ruochen Hao, Can Li, Wanjing Ma

机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education(教育部道路与交通工程重点实验室) College of Transportation, Tongji University(同济大学交通运输学院)

专题命中 工具调用 :agent(title,title_cn);planning(abstract);workflow(abstract);multi-agent(abstract)

AI总结 OR-Agent通过结构化树形工作流和进化-系统化构想机制,实现自动化算法发现的高效探索与科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16653 2026-06-23 cs.AI 版本更新 91%

Agent Skill Framework: Perspectives on the Potential of Small to Medium Language Models in Industrial Environments

Agent技能框架:中小型语言模型在工业环境中的潜力视角

Yangjie Xu, Lujun Li, Lama Sleem, Niccolo Gentile, Yewei Song, Yiqun Wang, Siming Ji, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A.(Foyer公司) Princeton University(普林斯顿大学) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 工具调用 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 研究在资源受限的工业场景中,中小型开源语言模型(270M-80B)使用Agent技能的效果,发现30B-80B模型受益显著,而小型模型技能选择困难,思考变体提升有限且增加GPU开销。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06890 2026-07-07 cs.AI cs.MA 版本更新 90%

Beyond the Black Box: Interpretability of Agentic AI Tool Use

超越黑箱:代理AI工具使用的可解释性

Hariom Tatsat, Ariye Shater

机构 * Quantitative Analytics, Barclays(巴克莱证券量化分析部)

专题命中 工具调用 :tool use(title);agentic(title);agent(abstract);AI agent(abstract)

AI总结 本文提出了一种基于稀疏自编码器(SAEs)和线性探针的机制可解释性工具包,旨在提升代理AI在长周期任务中对工具调用的可观测性和可解释性,通过分析模型内部状态来识别工具决策的关键特征,从而揭示代理失败的深层原因。

Comments 12 pages, 4 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01311 2026-07-15 cs.CL 版本更新 90%

Catalyst-Agent: Autonomous heterogeneous catalyst screening with an LLM Agent

Catalyst-Agent:基于LLM Agent的自主异质催化剂筛选

Achuth Chandrasekhar, Janghoon Ock, Amir Barati Farimani

机构 * Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机械工程系,匹兹堡,PA 15213,USA) Department of Chemical and Biomolecular Engineering, University of Nebraska--Lincoln, Lincoln, NE 68588, USA(内布拉斯加大学林肯分校化学与生物分子工程系,林肯,NE 68588,USA)

专题命中 工具调用 :agent(title,title_cn);分类 cs.CL

AI总结 提出Catalyst-Agent,一种基于MCP服务器和LLM的AI代理,通过OPTIMADE API探索材料数据库、利用UMA模型计算吸附能,实现闭环自主催化剂筛选,在ORR、NRR和CO2RR反应中成功率达33-41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27742 2026-07-09 cs.CV 版本更新 89%

TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration

TIR-Agent:训练一个探索性且高效的图像修复代理

Guoli Jia, Yisheng Zhang, Haote Hu, Shanxu Zhao, Kaikai Zhao, Long Sun, Xinwei Long, Kai Tian, Che Jiang, Zhaoxiang Liu, Kai Wang, Shiguo Lian, Kaiyan Zhang, Bowen Zhou

机构 * Tsinghua University(清华大学) China Unicom(中国联通) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工具调用 :agent(title,title_cn)

AI总结 本文提出TIR-Agent,通过监督微调和强化学习两阶段训练,解决图像修复中任务调度和工具组合的效率问题,实验表明其在多个基准上表现优异且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21027 2026-06-16 cs.CL cs.AI 版本更新 89%

Beyond Text-to-SQL: An Agentic LLM System for Governed Enterprise Analytics APIs

超越文本到SQL:一个面向受控企业分析API的代理LLM系统

Gundeep Singh, Parsa Kavehzadeh, Jing Xia, Xue-Yong Fu, Julien Bouvier Tremblay, Md Tahmid Rahman Laskar, Vincent Lum, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 工具调用 :agent(summary_cn,abstract);agentic(title,abstract);分类 cs.AI、cs.CL;AI agent(comments)

AI总结 本文提出Analytic Agent,一个基于LLM的代理系统,能够将自然语言意图安全地转换为与企业分析API的交互,解决传统文本到SQL系统在企业环境中面临的可靠性与合规性问题。

Comments Accepted to the Enterprise AI Agents Workshop @ KDD 2026. The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05872 2026-06-25 cs.AI cs.CV 版本更新 89%

Entropy-Based Observability for AI Agent Behavior

基于熵的AI智能体评估:一种测量行为模式的轻量级框架

Olasimbo Ayodeji Arigbabu

机构 * Olasimbo Ayodeji Arigbabu(奥拉西姆波·阿里加布)

专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 提出一种基于熵的轻量级评估框架(EEA),通过动作熵、轨迹熵、工具熵、信息增益、探索效率和鲁棒性熵等指标,从决策过程结构角度补充传统任务成功率等评估方法。

Comments 6 pages, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04990 2026-06-17 cs.CR cs.AI 版本更新 89%

From Agent Traces to Trust: A Survey of Evidence Tracing and Execution Provenance in LLM Agents

从智能体痕迹到信任:LLM智能体中的证据追踪与执行溯源

Yiqi Wang, Jiaqi Zhang, Taotao Cai, Zirui Liu, Qingqiang Sun, Zequn Sun, Zhangkai Wu, Manqing Dong, Mingkai Zheng, Xuefei Yin, Yanming Zhu

机构 * Griffith University(格里菲斯大学) Jiangsu University(江苏大学) University of Southern Queensland(南方昆士兰大学) Peking University(北京大学) Great Bay University(大湾大学) Nanjing University(南京大学) Macquarie University(麦觉瑞大学) Southern University of Science and Technology(南方科学与技术大学)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);tool-use(abstract);planning(abstract)

AI总结 本文系统综述了LLM智能体中的证据追踪与执行溯源方法,通过统一溯源视角连接检索、工具使用、记忆等环节,提出分类体系并讨论开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06647 2026-06-08 cs.IR cs.AI cs.LG 版本更新 88%

Superintelligent Retrieval Agent: The Next Frontier of Agentic Retrieval

超级智能检索代理:代理检索的下一个前沿

Zeyu Yang, Qi Ma, Jason Chen, Anshumali Shrivastava

机构 * Meta Superintelligence Labs(Meta超级智能实验室) Rice University(里士满大学)

专题命中 工具调用 :agent(title,abstract);agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出SIRA,通过单次语料判别性检索压缩多轮探索,利用LLM丰富文档词汇、预测查询缺失词汇并基于语料统计过滤,在BEIR基准上取得最强平均检索性能,并在下游QA任务中超越RL训练的代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25333 2026-07-31 cs.CL 版本更新 88%

CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories

CRMWeaver:通过智能体强化学习与共享记忆构建强大的商业智能体

Yilong Lai, Yipin Yang, Ting Liang, Jialong Wu, Zhenglin Wang, Jianguo Lin, Keping Yang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Southeast University(东南大学) University of Montreal(蒙特利尔大学)

专题命中 工具调用 :agent(title,abstract);agentic(title,abstract);分类 cs.CL

AI总结 针对商业智能体面临的数据复杂、任务异质问题,提出CRMWeaver方法,通过智能体强化学习训练与共享记忆机制提升性能,在CRMArena-Pro数据集的B2B、B2C场景中取得竞争力结果,实用价值显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16300 2026-07-23 cs.AI 版本更新 88%

Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection

循环代码取证:面向图像伪造检测的代理工具使用

Fanrui Zhang, Qiang Zhang, Sizhuo Zhou, Jianwen Sun, Chuanhao Li, Jiaxin Ai, Yukang Feng, Yujie Zhang, Wenjie Li, Zizhen Li, Yifan Chang, Jiawei Liu, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工具调用 :tool use(title);agentic(title);agent(abstract);tool-use(abstract)

AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17406 2026-07-02 cs.AI 版本更新 88%

EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale

EvoMaster:一种用于大规模代理科学的基础进化代理框架

Xinyu Zhu, Yuzhu Cai, Zexi Liu, Cheng Wang, Fengyang Li, Wenkai Jin, Wanxu Liu, Zehao Bing, Bingyang Zheng, Jingyi Chai, Shuo Tang, Rui Ye, Yuwen Du, Xianghe Pang, Yaxin Du, Tingjia Miao, Yuzhi Zhang, Ruoxue Liao, Zhaohan Ding, Linfeng Zhang, Yanfeng Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) SciLand DP Technology(DP技术)

专题命中 工具调用 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 EvoMaster通过持续自我进化机制,使代理能迭代优化假设并积累知识,实现跨学科的高效科学发现,其易用性与性能在多个基准测试中均表现优异。

Comments 44 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20491 2026-07-27 cs.AI cs.CL cs.LG 版本更新 87%

DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making

DFAH-Bench:金融决策中可观测智能体不稳定性的基准测试

Raffi Khatchadourian

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究金融决策中智能体行为稳定性,引入DFAH-Bench基准,通过多渠道衡量。发现仅结果一致性不能完全反映稳定性,前沿模型存在决策与工具路径一致性差距,识别出三种行为模式,并开源相关代码和数据。

Comments 15 pages, 3 figures. Code, sanitized replay logs, one-command reproduction (make reproduce-paper), and an interactive results explorer: https://github.com/ibm-client-engineering/output-drift-financial-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12650 2026-07-28 cs.CV cs.AI 版本更新 86%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 工具调用 :agentic(title,abstract);tool use(title);分类 cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06305 2026-08-10 cs.AI cs.CL cs.IR 版本更新 86%

Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations

超越Top-K:用可解释智能体操作替代黑盒检索

Sagar Tamang, Ayush Vyas, Tabarakul Hazarika

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对长文档检索的结构缺陷,提出无嵌入智能体检索框架READ,在政府财务报告数据集上显著优于密集检索,且性能提升源于操作界面,同时发现BM25与READ无统计差异。

Comments 20 pages, 5 figures, 14 tables. Code, benchmark, and full result trajectories: https://github.com/twospoon/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31693 2026-07-17 cs.IR cs.AI cs.CL 版本更新 86%

ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping

ShopX:面向智能购物中意图到商品实现的基础模型

Jiacheng Chen, Tao Zhang, Manxi Lin, Dunxian Huang, Teng Shi, Honghao Fu, Mengyan Li, Xinming Zhang, Chenchi Zhang, Xuan Lu, Xiaoxiong Du, Haibin Chen, Shaolin Ye, Hao Chang, Xiaoqi Li, Shuwen Xiao, Yujin Yuan, Jingxuan Feng, Shaopan Xiong, Huimin Yi, Ju Huang, Qiu Shen, Ying Chen, Junjun Zheng, Xiangheng Kong, Dan Ou, Haihong Tang, Yuning Jiang, Bo Zheng

专题命中 工具调用 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。

Comments The new version adds additional results and details

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01086 2026-07-17 cs.AI cs.CR cs.DB cs.DC cs.SE 版本更新 86%

MedBeads: An AI-Native Clinical Context Graph Built from Immutable Beads and Reconstructable Clinical Links

MedBeads:面向可信医疗AI的智能体原生不可变数据基底

Takahito Nakajima

机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。

Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00137 2026-07-14 cs.AI cs.SE 版本更新 86%

Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents

开放、可靠且集体:一个由社区驱动的工具使用AI代理框架

Hy Dang, Quang Dao, Meng Jiang

机构 * University of Notre Dame(圣母大学) Rose-Hulman Institute of Technology(罗斯-霍曼理工学院)

专题命中 工具调用 :AI agent(title);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 本文提出OpenTools框架,通过标准化工具方案、提供轻量级插件式封装及自动化测试套件,提升工具使用可靠性,实验表明社区贡献的高质量工具在多个架构上提升了6%-22%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21850 2026-06-16 cs.CL cs.AI 版本更新 86%

ACC: Compiling Agent Trajectories for Long-Context Training

ACC:用于长上下文训练的代理轨迹编译

Qisheng Su, Zhen Fang, Shiting Huang, Yu Zeng, Yiming Zhao, Kou Shi, Ziao Zhang, Lin Chen, Zehui Chen, Lijun Wu, Feng Zhao

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(中科院大学科学技术大学MoE关键实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ACC,一种将代理轨迹编译为长上下文问答对的方法,通过整合多轮交互中的工具响应和环境观察,提升大语言模型的长上下文推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21461 2026-07-27 cs.AI 版本更新 85%

AREX: Towards a Recursively Self-Improving Agent for Deep Research

AREX:迈向深度研究的递归自我改进智能体

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Jianlyu Chen, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28787 2026-07-23 cs.IR cs.AI 版本更新 85%

Do Data Agents Need Semantic Metadata? A Comparative Study in Agentic Data Retrieval

智能体需要语义元数据吗?智能体数据检索的比较研究

Shiyu Chen, Tarfah Alrashed, Alon Halevy, Natasha Noy

机构 * Google(谷歌)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 通过对比基线智能体(搜索开放网络)与语义智能体(利用schema.org元数据)在数据检索中的表现,发现语义元数据在检索可操作数据时精度更高(整体精度高65.7%),而基线智能体覆盖更广但存在“最后一英里效用”失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24115 2026-07-07 cs.LG 版本更新 85%

Agentic AI-RAN: Enabling Intent-Driven, Explainable and Self-Evolving Open RAN Intelligence

智能体人工智能-RAN:实现意图驱动、可解释和自我进化的开放式RAN智能

Zhizhou He, Yang Luo, Xinkai Liu, Mahdi Boloursaz Mashhadi, Mohammad Shojafar, Merouane Debbah, Rahim Tafazolli

机构 * G/6GIC, Institute for Communication Systems (ICS), University of Surrey(5G/6G研究所,通信系统研究所(ICS),萨里大学) G Research Center, Khalifa University(6G研究中心,卡利法大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.LG

AI总结 探讨如何将智能体控制器引入开放式RAN,介绍相关架构,对比传统ML/RL xApps,围绕网络切片生命周期等任务分类,引入智能体原语并展示其在多小区O-RAN模拟中提升性能,还讨论了安全等挑战。

Comments 11 pages, 4 figures. Accepted at IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04086 2026-06-18 cs.CL 版本更新 85%

ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"

ToolGrad:利用文本“梯度”高效生成工具使用数据集

Zhongyi Zhou, Kohei Uehara, Haoyu Zhang, Jingtao Zhou, Lin Gu, Ruofei Du, Zheng Xu, Tatsuya Harada

机构 * Google(谷歌) The University of Tokyo(东京大学) RIKEN AIP(日本学术振兴会AIP) Tohoku University(东北大学)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 提出ToolGrad框架,通过文本“梯度”引导的迭代过程先构建有效工具使用链再合成用户查询,实现低成本、高成功率的数据生成,训练模型性能超越基线。

Comments ACL 2026 Findings. Source code: https://github.com/zhongyi-zhou/toolgrad

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22928 2026-08-12 cs.CR 版本更新 85%

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:代理AI的攻击面——工具与自主性

Ali Dehghantanha, Sajad Homayoun

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15485 2026-08-10 cs.CY cs.AI cs.HC cs.LG cs.SE 版本更新 85%

The Perils of Agency: How Developers Perceive, Prioritize, and Address Risks in Agentic AI Products

代理的风险:开发者如何感知、优先级排序和应对代理型AI产品中的风险

Hao-Ping Lee, Jessica He, David Piorkowski, Thomas Serban von Davier, Jodi Forlizzi, Sauvik Das

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 通过35位行业开发者的研究,发现开发者对代理型AI风险的感知与自主性、工具使用等代理特性紧密相关,他们优先考虑产品和业务风险,缺乏成熟的控制手段,揭示了代理能力与风险控制之间的张力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19021 2026-07-21 cs.CR 版本更新 85%

Trustworthy AI LLM Scalability Risk Index (LSRI): A Cybersecurity Framework Assessing Agentic-AI Security & Software Model Supply Chain Safety Boosting AI-Generated Malware Defense & Explainability Mitigating Emerging Risks of Generative AI

大语言模型在代理AI中的可扩展性风险与模型供应链安全

Kiarash Ahi, Vaibhav Agrawal, Saeed Valizadeh

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文研究了大语言模型在代理AI中的可扩展性风险及模型供应链安全问题,提出LSRI指数和模型供应链框架,以提升安全关键环境下的LLM部署安全性。

Comments Accepted for publication in Journal of Computer Information Systems (2026). DOI: 10.1080/08874417.2026.2624670

Journal ref Journal of Computer Information Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11520 2026-07-15 cs.CL cs.AI cs.LG 版本更新 85%

ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories

ISE:一种基于执行的多轮操作系统代理轨迹合成方法

Siyuan Luo, Nairong Zheng, Lin Zhou, Tiankuo Yao, Shengyou Yuan, Haojia Yu, Cong Pang, Jiapeng Luo, Lewei Lu

机构 * University of Electronic Science and Technology of China(电子科技大学) SenseTime Research(商汤科技研究院)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ISE三阶段范式,通过结构化意图构建、角色锁定用户模拟和真实执行环境,生成多轮代理轨迹,微调后显著提升代理工具使用性能。

Comments 13 pages, 6 figures. Dataset and code: https://github.com/Valiere01/ISE-Trace

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22897 2026-07-03 cs.AI cs.CL cs.CV cs.LG cs.MM 版本更新 85%

OmniGAIA: Towards Native Omni-Modal AI Agents

OmniGAIA:迈向原生全模态AI代理

Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Haoxuan Li, Hao Wang, Shijian Wang, Guanting Dong, Jiajie Jin, Yinuo Wang, Yuan Lu, Ji-Rong Wen, Zhicheng Dou, Zhouchen Lin

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) Peking University(北京大学) Southeast University(东南大学) Tsinghua University(清华大学)

专题命中 工具调用 :AI agent(title);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OmniGAIA基准和OmniAtlas代理,通过全模态事件图和后见引导树探索策略,实现跨视频、音频和图像的深度推理与工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00887 2026-06-16 cs.CL cs.AI cs.LG 版本更新 85%

EffGen: Enabling Small Language Models as Capable Autonomous Agents

EffGen: 使小型语言模型成为能干的自主智能体

Gaurav Srivastava, Aafiya Hussain, Chi Wang, Yingyan Celine Lin, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) Google DeepMind, USA(谷歌DeepMind)

专题命中 工具调用 :autonomous agent(title);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 EffGen是一个针对小型语言模型优化的开源智能体框架,通过提示压缩、任务分解、复杂度路由和统一记忆系统,实现高效、安全的本地部署,在13个基准测试中优于LangChain等框架。

Comments Accepted to ICML 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14257 2026-07-24 cs.CL cs.AI 版本更新 84%

Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs

以学生为中心的蒸馏缩小了小型和大型语言模型之间的智能差距

Yuanjie Lyu, Chengyu Wang, Jun Huang, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究旨在缩小大小语言模型智能差距,提出SCoRe框架,让学生生成训练轨迹,教师纠正最早错误,经微调与短视距强化学习,提升学生解决问题能力,在12个基准测试中,70亿参数学生模型缩小了与720亿参数教师模型的性能差距

Comments Accepted to ICML 2026. The title has been changed from "From Correction to Mastery: Reinforced Distillation of Large Language Model Agents" to "Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs"; the camera-ready version has been uploaded

详情

展开后加载摘要…

URL PDF HTML 收藏