arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-20 至 2026-03-20 共收录 133 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2603.19173 2026-03-20 cs.LG cs.AI 62%

SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits

SOL-ExecBench:面向真实世界GPU内核的光速基准测试,针对硬件极限

Edward Lin, Sahil Modi, Siva Kumar Sastry Hari, Qijing Huang, Zhifan Ye, Nestor Qin, Fengzhe Zhou, Yuan Zhang, Jingquan Wang, Sana Damani, Dheeraj Peri, Ouye Xie, Aditya Kane, Moshe Maor, Michael Behar, Triston Cao, Rishabh Mehta, Vartika Singh, Vikram Sharma Mailthody, Terry Chen, Zihao Ye, Hanfeng Chen, Tianqi Chen, Vinod Grover, Wei Chen, Wei Liu, Eric Chung, Luis Ceze, Roger Bringmann, Cyril Zeller, Michael Lightstone, Christos Kozyrakis, Humphrey Shi

机构 * NVIDIA

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 SOL-ExecBench通过235个CUDA内核优化问题,针对NVIDIA Blackwell GPU的硬件极限,提出基于Speed-of-Light(SOL)的基准测试方法,评估内核优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18813 2026-03-20 cs.AI 57%

Can LLM generate interesting mathematical research problems?

大语言模型能否生成有趣的数学研究问题?

Xiaoyang Chen, Xiang Jiang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨大语言模型能否生成有价值的前沿数学研究问题,通过生成665个微分几何问题并经人类验证,发现许多问题对专家而言尚属未知且具有独特研究价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18762 2026-03-20 cs.CR cs.AI 57%

ClawTrap: A MITM-Based Red-Teaming Framework for Real-World OpenClaw Security Evaluation

ClawTrap:一种基于中间人攻击的红队框架,用于现实世界OpenClaw安全评估

Haochen Zhao, Shaoyang Cui

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ClawTrap,一种基于中间人攻击的红队框架,用于评估现实世界OpenClaw的安全性。该框架支持多种定制化攻击形式,提供可重复的管道流程,用于规则驱动的拦截、转换和审计。

Comments 8 pages, 5 figures, 2 tables. Preliminary technical report; quantitative experiments and extended evaluation to appear in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07300 2026-03-20 cs.LG 57%

AutoResearch-RL: Perpetual Self-Evaluating Reinforcement Learning Agents for Autonomous Neural Architecture Discovery

AutoResearch-RL:持续自我评估的强化学习代理用于自主神经架构发现

Nilesh Jain, Rohit Yadav, Sagar Kotian, Claude AI

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 AutoResearch-RL通过强化学习代理持续自主发现神经网络架构和超参数,无需人工监督,通过验证位率指标优化策略,实现高效实验迭代。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18326 2026-03-20 cs.LG 57%

Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration

摆脱离线悲观主义:用于安全前沿探索的向量场奖励塑造

Amirhossein Roknilamouki, Arnob Ghosh, Eylem Ekici, Ness B. Shroff

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出向量场奖励塑造方法,通过梯度对齐和旋转向量项诱导持续安全前沿探索,验证了在连续导航任务中有效平衡安全与信息收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18035 2026-03-20 cs.LG 57%

Taming Epilepsy: Mean Field Control of Whole-Brain Dynamics

癫痫控制:整体脑动力学的均场控制

Ming Li, Ting Gao, Jingqiao Dua

机构 * School of Mathematics and Information Science(数学与信息科学学院) Guangzhou University(广州大学) School of Sciences(科学学院) Great Bay University(大亚湾大学) Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力系统重点实验室) School of Mathematics and Statistics(数学与统计学学院) Huazhong University of Science and Technology(华中科技大学) Center for Mathematical Science(数学科学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于图正则化的Koopman均场游戏框架,通过Reservoir Computing和Alternating Population and Agent Control Network实现脑神经动力学的非线性控制,有效抑制癫痫发作并保持脑功能拓扑结构。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20558 2026-03-20 cs.AI cs.IR 57%

From Logs to Language: Learning Optimal Verbalization for LLM-Based Recommendation at Industry Scale

从日志到语言:学习用于基于LLM的推荐系统的最优 verbalization

Yucheng Shi, Ying Li, Yu Wang, Yesu Feng, Arjun Rao, Rein Houthooft, Shradha Sehgal, Jin Wang, Hao Zhen, Ninghao Liu, Linas Baltrunas

机构 * University of Georgia(佐治亚大学) Netflix Capital One Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种数据驱动框架,通过强化学习学习最优 verbalization 方法,提升基于LLM的推荐系统表现,实验显示在Netflix数据集上推荐准确率提升达93%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06023 2026-03-20 cs.AI cs.RO 57%

Developing a Discrete-Event Simulator of School Shooter Behavior from VR Data

基于VR数据开发校园枪击行为离散事件模拟器

Christopher A. McClurg, Alan R. Wagner

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出一种数据驱动的离散事件模拟器,用于模拟校园枪击行为,通过VR数据学习枪手行为,评估机器人干预策略,实现高效安全干预策略的可扩展评估。

Comments Accepted for presentation at ANNSIM 2026. Camera-ready version. 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18668 2026-03-20 cs.GT cs.CC cs.DS 50%

Complexity of Auctions with Interdependence

拍卖中相互依赖的复杂性

Patrick Loiseau, Simon Mauras, Minrui Xu

专题命中 Agent评测 :agent(abstract)

AI总结 研究拍卖设计中相互依赖模型的计算复杂性,分析在确定性和随机性设定下,优化 truthful 机制的近似比问题,推翻传统假设,提供高效算法和复杂性理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18192 2026-03-20 cs.CV 50%

MicroVision: An Open Dataset and Benchmark Models for Detecting Vulnerable Road Users and Micromobility Vehicles

MicroVision:一个用于检测易受伤害道路使用者和微交通车辆的开放数据集和基准模型

Alexander Rasch, Rahul Rajendra Pai

机构 * Chalmers University of Technology(楚尔姆斯理工大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出MicroVision数据集,用于检测常见的易受伤害道路使用者和静止的微交通车辆,通过提供先进的基准模型提升交通安全和监控系统的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17270 2026-03-20 cs.GT 50%

Allocating Chores with Restricted Additive Costs: Achieving EFX, MMS, and Efficiency Simultaneously

在受限加性成本下分配家务:同时实现EFX、MMS和效率

Zehan Lin, Xiaowei Wu, Shengwei Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 研究在受限加性成本下如何公平高效分配家务,提出同时满足EFX和MMS的算法,并证明其社会成本近似比为2,且最优。

Comments To appear in WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2603.01179 2026-03-20 cs.DC cs.CR 82%

A402: Binding Cryptocurrency Payments to Service Execution for Agentic Commerce

A402:将加密货币支付绑定到服务执行以实现代理商业

Yue Li, Lei Wang, Kaixuan Wang, Zhiqiang Yang, Ke Wang, Zhi Guan, Jianbo Gao

专题命中 其他Agent :agentic(title,abstract);AI agent(abstract)

AI总结 本文提出A402,一种最小化信任的支付架构,通过原子服务通道实现加密货币支付与服务执行的绑定,提升代理商业的性能和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18063 2026-03-20 cs.CR cs.AI 57%

MCP-38: A Comprehensive Threat Taxonomy for Model Context Protocol Systems (v1.0)

MCP-38:一种针对模型上下文协议系统的全面威胁分类

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research(Vulcan研究院) AIFT

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文提出MCP-38,一种针对模型上下文协议系统的威胁分类体系,包含38个威胁类别,通过系统化方法覆盖MCP特有的语义攻击面。

Comments v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏