arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-11 至 2026-03-11 共收录 136 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 8 篇

2603.08716 2026-03-11 cs.AR cs.AI 83%

Design Conductor: An agent autonomously builds a 1.5 GHz Linux-capable RISC-V CPU

设计导体:一个自主代理构建1.5 GHz的Linux兼容RISC-V CPU

The Verkor Team, Ravi Krishna, Suresh Krishna, David Chin

机构 * The Verkor Team(Verkor 团队)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 设计导体自主构建1.5 GHz的Linux兼容RISC-V CPU,通过端到端流程实现从需求文档到GDSII的完整芯片设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08993 2026-03-11 cs.SE cs.AI cs.CR cs.PL 81%

Arbiter: Detecting Interference in LLM Agent System Prompts

Arbiter:检测LLM代理系统提示中的干扰

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 Arbiter通过结合形式评估规则和多模型LLM扫描,检测LLM代理系统提示中的干扰模式,发现152个问题并揭示漏洞类别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09004 2026-03-11 cs.SE 79%

Can AI Agents Generate Microservices? How Far are We?

AI代理能否生成微服务?我们距离多远?

Bassam Adnan, Matteo Esposito, Davide Taibi, Karthik Vaidhyanathan

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.SE

AI总结 本文研究了AI代理生成微服务的能力,发现渐进式生成在单元测试中表现较好,而清洁状态生成在集成测试中表现更优,但整体上仍需人类监督。

Comments 10 pages, 7 figures, accepted at the 2026 IEEE International Conference on Software Architecture (ICSA 2026). This is the pre-print version; the camera-ready version is published by IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04709 2026-03-11 q-bio.QM 78%

Forecasting and predicting stochastic agent-based model data with biologically-informed neural networks

利用生物启发式神经网络进行随机基于代理模型数据的预测与预测

John T. Nardini

专题命中 软件智能体 :agent(title,abstract)

AI总结 利用生物启发式神经网络引导的偏微分方程预测随机基于代理模型数据,提高参数空间探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09951 2026-03-11 cs.LG cs.AI cs.SE 67%

Towards a Neural Debugger for Python

迈向Python的神经调试器

Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18057 2026-03-11 cs.LG cs.AI cs.CC math.CO 62%

Reinforced Generation of Combinatorial Structures: Hardness of Approximation

增强的组合结构生成:近似难度

Ansh Nagda, Prabhakar Raghavan, Abhradeep Thakurta

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 利用AI方法在复杂性理论中取得进展,改进MAX-CUT、MAX-3-CUT和TSP的近似难度结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06931 2026-03-11 cs.LO 50%

LLM2SMT: Building an SMT Solver with Zero Human-Written Code

LLM2SMT:构建一个无需人工编写代码的SMT求解器

Mikoláš Janota, Mirek Olšák

专题命中 软件智能体 :agent(abstract)

AI总结 LLM2SMT通过无需人工编写代码的方式,构建了一个基于DPLL(T)风格的QF_UF SMT求解器,实现了同余闭包算法并生成证明,展示了其在SMT-LIB基准测试中的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 4 篇

2603.09113 2026-03-11 cs.RO cs.AI 57%

PM-Nav: Priori-Map Guided Embodied Navigation in Functional Buildings

PM-Nav:基于先验图的功能性建筑中具身导航

Jiang Gao, Xiangyu Dong, Haozhou Li, Haoran Zhao, Yaoming Zhou, Xiaoguang Ma

机构 * Faculty of Robot Science and Engineering at Northeastern University(东北大学机器人科学与工程学院) Foshan Graduate School of Innovation at Northeastern University(东北大学佛山创新研究生学院) School of Aeronautic Science and Engineering at Beihang University(北航航空科学与工程学院)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 PM-Nav通过构建先验图和多模型协作机制,提升了功能性建筑中的导航精度和效率。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05364 2026-03-11 math.CO 50%

A Path Variant of the Explorer Director Game on Graphs

图上的探索者导演游戏变种

Abigail Raz, Paddy Yang

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文研究了图上的探索者-导演游戏变种,分析了f_d(G,v)和f_p(G,v)之间的差异,证明了两者可以相差任意大的n。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08905 2026-03-11 cs.RO 50%

Proprioceptive Safe Active Navigation and Exploration for Planetary Environments

本体感知安全主动导航与探索用于行星环境

Matthew Y. Jiang, Feifei Qian, Shipeng Liu

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 PSANE通过本体感知技术在未知变形环境中实现安全导航与探索,利用腿部与地形的交互信息提升地形可通行性评估与导航性能。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08837 2026-03-11 cs.HC 50%

NaviNote: Enabling In-situ Spatial Annotation Authoring to Support Exploration and Navigation for Blind and Low Vision People

NaviNote: 使现场空间标注创作成为支持盲人和低视力人群探索与导航的手段

Ruijia Chen, Yuheng Wu, Charlie Houseago, Filipe Gaspar, Filippo Aleotti, Dorian Gálvez-López, Oliver Johnston, Diego Mazala, Guillermo Garcia-Hernando, Maryam Bandukda, Gabriel Brostow, Jessica Van Brummelen

专题命中 GUI与网页智能体 :agentic(abstract)

AI总结 NaviNote通过结合高精度视觉定位与代理架构,为盲人和低视力人群提供语音驱动的注释创作与导航支持,显著提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 13 篇

2603.09875 2026-03-11 cs.MA cs.CR cs.DC 88%

The Bureaucracy of Speed: Structural Equivalence Between Memory Consistency Models and Multi-Agent Authorization Revocation

速度的官僚主义:内存一致性模型与多智能体授权撤销之间的结构等价性

Vladyslav Parakhin

专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(title);agentic(abstract)

AI总结 本文提出能力一致性系统,通过有限新鲜度语义构建状态映射,实现高并发下授权撤销的安全性保障,显著降低未经授权操作数量。

Comments 18 pages, 3 figures. Simulation code at https://github.com/hipvlady/prizm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08755 2026-03-11 cs.PL cs.AI cs.SE 84%

Turn: A Language for Agentic Computation

Turn:一种用于代理计算的语言

Muyukani Kizito

机构 * Turn Lang(Turn语言) Prescott Data(Prescott数据)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 Turn是一种用于代理计算的编译型语言,通过类型安全、能力身份系统和编译时模式吸收等机制,实现对大型语言模型推断的可靠控制和安全管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08812 2026-03-11 cs.CV 82%

VisionCreator-R1: A Reflection-Enhanced Native Visual-Generation Agentic Model

VisionCreator-R1: 一种增强反思的原生视觉生成代理模型

Jinxiang Lai, Wenzhe Zhao, Zexin Lu, Hualei Zhang, Qinyu Yang, Rongwei Quan, Zhimin Li, Shuai Shao, Song Guo, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文言) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 记忆与上下文管理 :agentic(title);agent(abstract);planning(abstract)

AI总结 VisionCreator-R1通过引入反射-计划联合优化方法,提升视觉生成代理在单图和多图任务中的表现,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08745 2026-03-11 cs.AR cs.MA cs.PF 82%

ChatNeuroSim: An LLM Agent Framework for Automated Compute-in-Memory Accelerator Deployment and Optimization

ChatNeuroSim:一种用于自动计算在内存加速器部署和优化的LLM代理框架

Ming-Yen Lee, Shimeng Yu

专题命中 记忆与上下文管理 :agent(title,abstract);workflow(abstract)

AI总结 ChatNeuroSim是一种基于LLM的代理框架,用于自动部署和优化计算在内存加速器,通过设计空间修剪技术提升优化效率。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18722 2026-03-11 cs.AI 79%

VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft

VistaWise: 构建低成本代理的跨模态知识图谱用于Minecraft

Honghao Fu, Junlong Ren, Qi Chai, Deheng Ye, Yujun Cai, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Queensland(昆士兰大学) Tencent(腾讯)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 VistaWise通过整合跨模态知识图谱和专用模型,实现低成本、高效率的Minecraft代理构建。

Comments Accepted by EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09297 2026-03-11 cs.IR cs.CL 70%

TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QA

TA-Mem: 用于LLM长期对话问答的工具增强自主记忆检索

Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang

专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);分类 cs.CL

AI总结 TA-Mem通过引入工具增强的自主记忆检索框架,解决了LLM在长距离推理任务中的记忆存储问题,提升了长期对话问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09476 2026-03-11 cs.AI 57%

Telogenesis: Goal Is All U Need

基于认知缺口的内生注意力优先级生成

Zhuoran Deng, Yizhi Zhang, Ziyi Zhang, Wan Shen

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于认知缺口的内生注意力优先级生成方法,通过预测误差、无知和陈旧三个因素,实现了在无外部奖励的情况下自适应优先级生成,优于固定策略并恢复环境结构。

Comments 6 pages, 3 figures, submitted to ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08837 2026-03-11 cs.SI cs.AI 57%

Debiasing International Attitudes: LLM Agents for Simulating US-China Perception Changes

消除国际偏见:用于模拟中美感知变化的LLM代理

Nicholas Sukiennik, Yichuan Xu, Yuqing Kan, Jinghua Piao, Yuwei Yan, Chen Gao, Yong Li

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本研究提出基于LLM代理的框架,通过去偏机制模拟中美感知变化,发现魔鬼代言人代理最有效缓解偏见。

Comments Submitted to TCSS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08727 2026-03-11 cs.AR cs.AI cs.DC cs.PF 57%

ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs

ARKV:在有限内存预算下为LLMs长上下文推理实现自适应和资源高效的KV缓存管理

Jianlong Lei, Shashikant Ilager

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 ARKV通过动态分配精度级别,实现LLMs长上下文推理中的高效内存管理,减少内存使用并保持高精度。

Comments Accepted in ACM/IEEE CCGRID 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09904 2026-03-11 eess.SY cs.SY 50%

Dynamic Average Consensus with Privacy Guarantees and Its Application to Battery Energy Storage Systems

具有隐私保证的动态平均一致性算法及其在电池储能系统中的应用

Mihitha Maithripala, Chenyang Qiu, Zongli Lin

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一种具有隐私保护的动态平均一致性算法,用于电池储能系统的荷电状态平衡,通过掩码信号防止信息泄露并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09387 2026-03-11 econ.TH 50%

Unintended Consequences: Updating Causal Models

意外后果:更新因果模型

Joseph Y. Halpern, Evan Piermont, Marie-Louise Vierø

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文探讨了因果信念如何影响代理选择,并提出稳态概念以解释反馈如何更新因果模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09135 2026-03-11 quant-ph 50%

Critical States Preparation With Deep Reinforcement Learning

临界态制备与深度强化学习

Jia-Wen Yu, Yi-Ming Yu, Ke-Xiong Yan, Jun-Hao Lin, Jie Song, Ye-Hong Chen, Yan Xia

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出利用深度强化学习快速制备量子临界态,并应用于量子拉比模型,实现高保真度的临界态制备。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19345 2026-03-11 eess.SY cs.SY 50%

Privacy-Preserving Distributed Control for a Networked Battery Energy Storage System

隐私保护的分布式控制用于联网电池储能系统

Mihitha Maithripala, Zongli Lin

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种隐私保护的分布式控制算法,用于实现联网电池储能系统的SoC平衡,通过隐私保护的估计器确保安全的功率分配和状态平衡。

Comments Accepted for publication in Journal of Energy Storage

Journal ref Journal of Energy Storage, Volume 153, 120958 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 20 篇

2603.09052 2026-03-11 cs.AI cs.CL cs.LG 89%

From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring

从天到分钟:一个自主AI代理在远程患者监测中实现可靠的临床分诊

Seunghwan Kim, Tiffany H. Kung, Heena Verma, Dilan Edirisinghe, Kaveh Sedehi, Johanna Alvarez, Diane Shilling, Audra Lisa Doyle, Ajit Chary, William Borden, Ming Jack Po

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Sentinel通过自主AI代理实现远程患者监测的高效分诊,超越个体医生的灵敏度,提供可扩展且临床可行的解决方案。

Comments 46 pages, 11 figures, Abstract in metadata is shortened to meet arXiv character limits; see PDF for full version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08806 2026-03-11 cs.SE cs.AI 88%

Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications

基于行为规范的AI代理定义(TDAD):从行为规范编译工具使用代理

Tzafrir Rehan

机构 * Fiverr Labs(Fiverr 实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.SE

AI总结 TDAD通过编译行为规范生成可执行测试,确保工具使用代理在生产环境中的行为合规性,提升测试质量和回归安全性。

Comments 9 pages, 2 figures, open benchmark at https://github.com/f-labs-io/tdad-paper-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 88%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08835 2026-03-11 cs.AI cs.CL cs.LG 88%

MASEval: Extending Multi-Agent Evaluation from Models to Systems

MASEval: 从模型到系统的多智能体评估扩展

Cornelius Emde, Alexander Rubinstein, Anmol Goel, Ahmed Heakl, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Oxford(牛津大学) University of Tübingen(图宾根大学) TU Darmstadt(德累斯顿理工大学) MBZUAI NAVER AI Lab(NAVER AI实验室) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title);multi-agent(title);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 MASEval通过系统层面的比较揭示框架选择与模型选择同等重要,为智能体系统设计提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09157 2026-03-11 cs.AI 86%

Real-Time Trust Verification for Safe Agentic Actions using TrustBench

基于TrustBench的安全代理行为实时信任验证

Tavishi Sharma, Vinayak Sharma, Pragya Sharma

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 TrustBench通过双模式框架在代理行动前验证安全性,有效减少有害行为,提升自主代理的可信度

Comments Accepted at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09821 2026-03-11 cs.CL 83%

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

One-Eval: 一个用于自动化和可追溯的LLM评估代理系统

Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He, Zhen Hao Wong, Meiyi Qiang, Zhou Liu, Hao Liang, Peichao Lai, Zeang Sheng, Wentao Zhang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.CL

AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏