arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-20 至 2026-03-20 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2602.08199 2026-03-20 cs.OS cs.DC 85%

Fork, Explore, Commit: OS Primitives for Agentic Exploration

分支、探索、提交:用于代理探索的操作系统原语

Cong Wang, Yusheng Zheng

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 本文提出分支上下文操作系统抽象,支持并行探索路径和原子提交回滚,通过BranchFS和branch系统调用实现,提升代理探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18197 2026-03-20 cs.AI cs.CR cs.NI 83%

Access Controlled Website Interaction for Agentic AI with Delegated Critical Tasks

受控网站交互用于代理AI的委托关键任务

Sunyoung Kim, Hokeun Kim

机构 * Arizona State University(亚利桑那州立大学)

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种受控网站交互设计,用于代理AI执行关键任务,通过细粒度访问控制机制提升安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01536 2026-03-20 cs.AI 79%

Algebras of actions in an agent's representations of the world

动作代数在代理对世界的表示中的代数

Alexander Dean, Eduardo Alonso, Esther Mondragon

机构 * Artificial Intelligence Research Centre (CitAI), Department of Computer Science, City St George's, University of London(人工智能研究与应用中心(CitAI)、计算机科学系、圣乔治学院、伦敦大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出从代理视角提取世界变换代数的框架,通过计算方法提取简单强化学习场景中的变换代数并分类,推广SBDRL的等变条件和解缠定义到任意代数的变换属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18447 2026-03-20 cs.DB cs.AI cs.CL cs.CV cs.IR 79%

SODIUM: From Open Web Data to Queryable Databases

SODIUM:从开放网络数据到可查询数据库

Chuxuan Hu, Philip Li, Maxwell Yang, Daniel Kang

机构 * UIUC(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对需要整合多源网络数据的分析问题,提出SODIUM任务,通过系统化构建潜在数据库支持查询。开发SODIUM-Agent系统,采用ATP-BFS算法实现深度网络探索与结构化信息提取,准确率达91.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10971 2026-03-20 cs.CR cs.CL 77%

AJAR: Adaptive Jailbreak Architecture for Red-teaming

AJAR:适应性突破架构用于红队测试

Yipu Dou, Wang Yang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 AJAR框架通过可调用MCP服务实现多轮突破算法,提升X-Teaming攻击成功率至76.0%,并在工具访问下优化攻击面。

Comments 7 pages, 3 figures. Code and data available at https://github.com/douyipu/ajar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18743 2026-03-20 cs.AI cs.CL cs.LG 67%

Memento-Skills: Let Agents Design Agents

Memento-Skills:让代理设计代理

Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao, Zhixun Chen, Menglong Zhang, Yihang Chen, Jinsong Li, Runyu Yang, Qiangbin Liu, Xinlei Yu, Jianmin Zhou, Na Wang, Chunyang Sun, Jun Wang

机构 * Memento-Team(Memento团队)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Memento-Skills是一种能够持续学习的通用大语言模型代理系统,通过经验自主构建、适应和改进任务特定代理,利用状态提示的强化学习框架和可重用的技能库实现持续学习。

Comments Memento-Skills Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18235 2026-03-20 cs.CR cs.CV 67%

Toward Reliable, Safe, and Secure LLMs for Scientific Applications

迈向科学应用中可靠、安全和安全的LLM

Saket Sanjeev Chaturvedi, Joshua Bergerson, Tanwi Mallick

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文探讨了科学应用中LLM代理的安全与安全挑战,提出通过多代理系统生成领域特定对抗性安全基准,构建多层次防御框架以提升LLM可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19173 2026-03-20 cs.LG cs.AI 62%

SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits

SOL-ExecBench:面向真实世界GPU内核的光速基准测试,针对硬件极限

Edward Lin, Sahil Modi, Siva Kumar Sastry Hari, Qijing Huang, Zhifan Ye, Nestor Qin, Fengzhe Zhou, Yuan Zhang, Jingquan Wang, Sana Damani, Dheeraj Peri, Ouye Xie, Aditya Kane, Moshe Maor, Michael Behar, Triston Cao, Rishabh Mehta, Vartika Singh, Vikram Sharma Mailthody, Terry Chen, Zihao Ye, Hanfeng Chen, Tianqi Chen, Vinod Grover, Wei Chen, Wei Liu, Eric Chung, Luis Ceze, Roger Bringmann, Cyril Zeller, Michael Lightstone, Christos Kozyrakis, Humphrey Shi

机构 * NVIDIA

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 SOL-ExecBench通过235个CUDA内核优化问题,针对NVIDIA Blackwell GPU的硬件极限,提出基于Speed-of-Light(SOL)的基准测试方法,评估内核优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18813 2026-03-20 cs.AI 57%

Can LLM generate interesting mathematical research problems?

大语言模型能否生成有趣的数学研究问题?

Xiaoyang Chen, Xiang Jiang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨大语言模型能否生成有价值的前沿数学研究问题,通过生成665个微分几何问题并经人类验证,发现许多问题对专家而言尚属未知且具有独特研究价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18762 2026-03-20 cs.CR cs.AI 57%

ClawTrap: A MITM-Based Red-Teaming Framework for Real-World OpenClaw Security Evaluation

ClawTrap:一种基于中间人攻击的红队框架,用于现实世界OpenClaw安全评估

Haochen Zhao, Shaoyang Cui

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ClawTrap,一种基于中间人攻击的红队框架,用于评估现实世界OpenClaw的安全性。该框架支持多种定制化攻击形式,提供可重复的管道流程,用于规则驱动的拦截、转换和审计。

Comments 8 pages, 5 figures, 2 tables. Preliminary technical report; quantitative experiments and extended evaluation to appear in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07300 2026-03-20 cs.LG 57%

AutoResearch-RL: Perpetual Self-Evaluating Reinforcement Learning Agents for Autonomous Neural Architecture Discovery

AutoResearch-RL:持续自我评估的强化学习代理用于自主神经架构发现

Nilesh Jain, Rohit Yadav, Sagar Kotian, Claude AI

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 AutoResearch-RL通过强化学习代理持续自主发现神经网络架构和超参数,无需人工监督,通过验证位率指标优化策略,实现高效实验迭代。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18326 2026-03-20 cs.LG 57%

Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration

摆脱离线悲观主义:用于安全前沿探索的向量场奖励塑造

Amirhossein Roknilamouki, Arnob Ghosh, Eylem Ekici, Ness B. Shroff

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出向量场奖励塑造方法,通过梯度对齐和旋转向量项诱导持续安全前沿探索,验证了在连续导航任务中有效平衡安全与信息收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18035 2026-03-20 cs.LG 57%

Taming Epilepsy: Mean Field Control of Whole-Brain Dynamics

癫痫控制:整体脑动力学的均场控制

Ming Li, Ting Gao, Jingqiao Dua

机构 * School of Mathematics and Information Science(数学与信息科学学院) Guangzhou University(广州大学) School of Sciences(科学学院) Great Bay University(大亚湾大学) Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力系统重点实验室) School of Mathematics and Statistics(数学与统计学学院) Huazhong University of Science and Technology(华中科技大学) Center for Mathematical Science(数学科学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于图正则化的Koopman均场游戏框架,通过Reservoir Computing和Alternating Population and Agent Control Network实现脑神经动力学的非线性控制,有效抑制癫痫发作并保持脑功能拓扑结构。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20558 2026-03-20 cs.AI cs.IR 57%

From Logs to Language: Learning Optimal Verbalization for LLM-Based Recommendation at Industry Scale

从日志到语言:学习用于基于LLM的推荐系统的最优 verbalization

Yucheng Shi, Ying Li, Yu Wang, Yesu Feng, Arjun Rao, Rein Houthooft, Shradha Sehgal, Jin Wang, Hao Zhen, Ninghao Liu, Linas Baltrunas

机构 * University of Georgia(佐治亚大学) Netflix Capital One Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种数据驱动框架,通过强化学习学习最优 verbalization 方法,提升基于LLM的推荐系统表现,实验显示在Netflix数据集上推荐准确率提升达93%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06023 2026-03-20 cs.AI cs.RO 57%

Developing a Discrete-Event Simulator of School Shooter Behavior from VR Data

基于VR数据开发校园枪击行为离散事件模拟器

Christopher A. McClurg, Alan R. Wagner

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出一种数据驱动的离散事件模拟器,用于模拟校园枪击行为,通过VR数据学习枪手行为,评估机器人干预策略,实现高效安全干预策略的可扩展评估。

Comments Accepted for presentation at ANNSIM 2026. Camera-ready version. 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18668 2026-03-20 cs.GT cs.CC cs.DS 50%

Complexity of Auctions with Interdependence

拍卖中相互依赖的复杂性

Patrick Loiseau, Simon Mauras, Minrui Xu

专题命中 Agent评测 :agent(abstract)

AI总结 研究拍卖设计中相互依赖模型的计算复杂性,分析在确定性和随机性设定下,优化 truthful 机制的近似比问题,推翻传统假设,提供高效算法和复杂性理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18192 2026-03-20 cs.CV 50%

MicroVision: An Open Dataset and Benchmark Models for Detecting Vulnerable Road Users and Micromobility Vehicles

MicroVision:一个用于检测易受伤害道路使用者和微交通车辆的开放数据集和基准模型

Alexander Rasch, Rahul Rajendra Pai

机构 * Chalmers University of Technology(楚尔姆斯理工大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出MicroVision数据集,用于检测常见的易受伤害道路使用者和静止的微交通车辆,通过提供先进的基准模型提升交通安全和监控系统的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17270 2026-03-20 cs.GT 50%

Allocating Chores with Restricted Additive Costs: Achieving EFX, MMS, and Efficiency Simultaneously

在受限加性成本下分配家务:同时实现EFX、MMS和效率

Zehan Lin, Xiaowei Wu, Shengwei Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 研究在受限加性成本下如何公平高效分配家务,提出同时满足EFX和MMS的算法,并证明其社会成本近似比为2,且最优。

Comments To appear in WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏