arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-26 至 2026-03-26 共收录 122 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 8 篇

2603.24018 2026-03-26 cs.AI 57%

ELITE: Experiential Learning and Intent-Aware Transfer for Self-improving Embodied Agents

ELITE:经验学习与意图感知迁移用于自我改进的具身智能体

Bingqing Wei, Zhongyu Xia, Dingai Liu, Xiaoyu Zhou, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(清华大学王轩计算机技术研究所,北京,中国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 ELITE通过经验学习与意图感知迁移机制,使具身智能体能持续学习环境交互经验并迁移至相似任务,实现在EB-ALFRED和EB-Habitat基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23633 2026-03-26 cs.SE 57%

Detect--Repair--Verify for LLM-Generated Code: A Multi-Language, Multi-Granularity Empirical Study

检测-修复-验证LLM生成的代码:多语言、多粒度实证研究

Cheng Cheng

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过检测-修复-验证工作流评估LLM生成代码的安全性,发现多阶段修复能提升安全性和正确性,但修复可靠性依赖于修复范围和测试基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06819 2026-03-26 cs.RO cs.AI 57%

Dynamic Neural Potential Field: Online Trajectory Optimization in the Presence of Moving Obstacles

动态神经势场:在移动障碍物存在下的在线轨迹优化

Aleksei Staroverov, Muhammad Alhaddad, Aditya Narendra, Konstantin Mironov, Aleksandr Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) National University of Science and Technology MISIS(科学与技术国立大学MISIS) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究 institutes) Ufa University of Science and Technology(乌fa科学与技术大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出动态神经势场模型,结合传统优化与Transformer预测器,实现高效安全的轨迹优化,在动态环境中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23763 2026-03-26 cs.NI 50%

AgenticNet: Utilizing AI Coding Agents To Create Hybrid Network Experiments

AgenticNet:利用AI编码代理创建混合网络实验

Majd Latah, Kubra Kalkan

专题命中 软件智能体 :AI agent(abstract)

AI总结 AgenticNet通过AI编码代理提供混合网络实验工具,支持纯模拟、纯仿真和混合模式,提升实验灵活性和开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2603.24533 2026-03-26 cs.LG cs.AI cs.CV 81%

UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience

UI-Voyager:一种通过失败经验自我进化的GUI代理学习

Zichuan Lin, Feiyu Liu, Yijun Yang, Jiafei Lyu, Yiming Gao, Yicheng Liu, Zhicong Lu, Yangbin Yu, Mingyu Yang, Junyou Li, Deheng Ye, Jie Jiang

机构 * Tencent(腾讯)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出UI-Voyager,一种两阶段自我进化的移动GUI代理,通过拒绝微调和组相对自蒸馏提升GUI任务的效率和性能,实验显示其在AndroidWorld上达到81.0%的Pass@1成功率。

Comments Code and models are available at https://github.com/ui-voyager/UI-Voyager

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23791 2026-03-26 cs.CR cs.AI 74%

The Cognitive Firewall:Securing Browser Based AI Agents Against Indirect Prompt Injection Via Hybrid Edge Cloud Defense

认知防火墙:通过混合边缘云防御保护基于浏览器的AI代理免受间接提示注入攻击

Qianlong Lan, Anuj Kaul

机构 * eBay Inc(eBay公司)

专题命中 GUI与网页智能体 :AI agent(title);分类 cs.AI

AI总结 本文提出认知防火墙,通过混合边缘云防御机制,有效降低基于浏览器的AI代理遭受间接提示注入攻击的成功率,同时显著提升系统响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24241 2026-03-26 eess.SY cs.LG cs.SY 70%

C-STEP: Continuous Space-Time Empowerment for Physics-informed Safe Reinforcement Learning of Mobile Agents

C-STEP:连续时空赋能用于物理引导的移动智能体安全强化学习

Guihlerme Daubt, Adrian Redder

机构 * Faculty of Technology, Bielefeld University, Germany(比勒菲尔德大学技术学院,德国) Department of Electrical Engineering and Information Technology, Paderborn University, Germany(帕德博恩大学电气工程与信息科技系,德国)

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出C-STEP方法,通过结合导航奖励设计物理引导的内在奖励,提升移动智能体在复杂环境中的安全导航能力,减少碰撞并优化任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 5 篇

2603.24564 2026-03-26 cs.CR cs.CY 82%

Infrastructure for Valuable, Tradable, and Verifiable Agent Memory

基础设施:有价值的、可交易的和可验证的智能体记忆

Mengyuan Li, Lei Gao, Haoxuan Xu, Jiate Li, Potung Yu, Lingke Cheng, Yue Zhao, Murali Annavaram

专题命中 记忆与上下文管理 :agent(title,abstract);autonomous agent(abstract)

AI总结 本文提出clawgang和meowtrade,通过可验证的计算溯源和市场层,将智能体记忆转化为可交易的经济资产,实现记忆的可转移和可重复利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21334 2026-03-26 cs.HC 82%

Software as Content: Dynamic Applications as the Human-Agent Interaction Layer

软件作为内容:动态应用作为人-智能体交互层

Mulong Xie, Yang Xie

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract)

AI总结 本文提出软件作为内容(SaC)范式,通过动态生成的智能体应用作为人-智能体交互媒介,解决传统自然语言接口在结构信息处理和复杂任务中的局限性,展示其在选择、探索和执行任务中的可行性。

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23840 2026-03-26 cs.AI cs.CL 62%

VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents

VehicleMemBench:多用户长期记忆的可执行基准

Yuhao Chen, Yi Xu, Xinyun Ding, Xiang Fang, Shuochen Liu, Luxi Lin, Qingyu Zhang, Ya Li, Quan Liu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院) Xiamen University(厦门大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 记忆与上下文管理 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出VehicleMemBench,用于评估车载代理的多用户长期记忆能力,通过可执行仿真环境比较行动后环境状态与目标状态,揭示强大模型在动态偏好变化场景中的不足,强调需更 robust 的记忆管理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01521 2026-03-26 cs.LG cs.AI cs.RO 62%

Symmetry-Guided Memory Augmentation for Efficient Locomotion Learning

基于对称性的记忆增强方法用于高效运动学习

Kaixi Bao, Chenhao Li, Yarden As, Andreas Krause, Marco Hutter

机构 * Department of Mechanical and Process Engineering, ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院机械与过程工程系) ETH AI Center, ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院人工智能中心) Department of Computer Science, ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院计算机科学系)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SGMA框架,通过结合结构化经验增强与基于记忆的上下文推断,提升强化学习政策训练效率。利用机器人与任务对称性生成物理一致的训练经验,避免 naive 增强的弊端,使代理能保留任务相关上下文并适应行为。在仿真和真实四足机器人上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23845 2026-03-26 cs.CV 50%

3D-LLDM: Label-Guided 3D Latent Diffusion Model for Improving High-Resolution Synthetic MR Imaging in Hepatic Structure Segmentation

3D-LLDM:基于标签的3D潜在扩散模型用于提高肝结构分割的高分辨率合成MR影像

Kyeonghun Kim, Jaehyeok Bae, Youngung Han, Joo Young Bae, Seoyoung Ju, Junsu Lim, Gyeongmin Kim, Nam-Joon Kim, Woo Kyoung Jeong, Ken Ying-Kai Liao, Won Jae Lee, Pa Hong, Hyuk-Jae Lee

机构 * OUTTA, Republic of Korea(韩国OUTTA) Stanford University(斯坦福大学) Seoul National University(首尔国立大学) Sangmyung University(Sangmyung大学) Chung-Ang University(Chung-Ang大学) Samsung Medical Center(三星医疗中心) NVIDIA Sungkyunkwan University School of Medicine(成均馆大学医学院) Samsung Changwon Hospital(三星昌原医院)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出3D-LLDM模型,通过标签引导生成高质量合成MR影像,提升肝结构分割的精度,实验表明其在数据增强中提升了肝细胞癌分割的Dice得分。

Comments Accepted to ISBI 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 18 篇

2603.23749 2026-03-26 cs.AI 85%

Efficient Benchmarking of AI Agents

高效评估AI代理

Franck Ndzomga

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文研究通过小任务子集降低评估成本,保持代理排名稳定,提出基于项目反应理论的中间难度筛选方法,提升排名可靠性。

Comments 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23801 2026-03-26 cs.CR 85%

AgentRFC: Security Design Principles and Conformance Testing for Agent Protocols

AgentRFC:关于智能体协议的安全设计原则与合规性测试

Shenghan Zheng, Qifan Zhang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出AgentProtocolStack、Agent-AgnosticSecurityModel和AgentConform,旨在为智能体协议提供系统性的安全框架,解决协议合规性测试问题,并揭示协议组合时的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07150 2026-03-26 cs.LG cs.AI cs.SE 82%

On Randomness in Agentic Evals

关于代理评估中的随机性

Bjarni Haukur Bjarnason, André Silva, Martin Monperrus

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究通过分析6万条轨迹发现单次运行的pass@1分数存在显著波动,建议采用多轮运行、统计分析和多指标评估以提高代理系统评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12412 2026-03-26 econ.GN q-fin.EC 78%

Macroeconomic Forecasting from Input-Output Tables Alone: A Darwinian Agent-Based Approach with FIGARO Data

仅依靠投入产出表进行宏观经济预测:一种达尔文式基于代理的模拟方法与FIGARO数据

Martin Jaraiz

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出利用达尔文式基于代理的模拟方法,仅通过投入产出表进行宏观经济预测,展示了其在不同国家的准确性和跨国家的可移植性,以及对经济冲击的传播机制。

Comments 50 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23660 2026-03-26 cs.AI 77%

GTO Wizard Benchmark

GTO Wizard 评估基准

Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23937 2026-03-26 cs.CL cs.LG 76%

Dialogue to Question Generation for Evidence-based Medical Guideline Agent Development

对话到问题生成用于基于证据的医疗指南代理开发

Zongliang Ji, Ziyang Zhang, Xincheng Tan, Matthew Thompson, Anna Goldenberg, Carl Yang, Rahul G. Krishnan, Fan Zhang

机构 * Google Research(谷歌研究) University of Toronto(多伦多大学) Vector Institute Canada(加拿大向量研究所) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG

AI总结 本文探讨利用大语言模型生成基于证据的问题,以辅助医生在短时间内进行诊疗决策,通过两种提示策略评估模型效果,结果显示LLM能生成具有临床意义的问题,有助于减轻医生认知负担。

Comments 9 pages. To appear in Proceedings of Machine Learning Research (PMLR), Machine Learning for Health (ML4H) Symposium 2025

Journal ref Proceedings of Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 73%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23811 2026-03-26 cs.HC 67%

AI Fortune-Teller: Juxtaposing Shaman and AI to Reveal Human Agency in the Age of AI

AI预言家:将萨满与AI并置,揭示人工智能时代的主体性

Soonho Kwon, Dong Whi Yoo, Younah Kang

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文通过展示参与者与AI职业咨询代理互动的视频,揭示参与者在得知回复源自韩国传统萨满后对建议态度的转变,探讨人工智能可解释性与准确性的认知问题。

Comments Disclaimer: This document is an unofficial commentary on AI Fortune-Teller by its creators. While the work was introduced and received an Honorary Mention at Prix Ars Electronica 2024, this document is not an officially published or affiliated record of the festival

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19808 2026-03-26 cs.LG math.AP stat.ML 57%

Two-Time-Scale Learning Dynamics: A Population View of Neural Network Training

双时间尺度学习动态:神经网络训练的群体视角

Giacomo Borghi, Hyesung Im, Lorenzo Pareschi

机构 * Maxwell Institute for Mathematical Sciences and School of Mathematical and Computer Sciences Heriot–Watt University, Edinburgh, UK(麦克斯韦数学科学研究所和赫里奥特-沃特大学数学与计算机科学学院,爱丁堡,英国) Department of Mathematics and Computer Science University of Ferrara, Italy(费拉拉大学数学与计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于双时间尺度群体动态的理论框架,分析神经网络训练中参数与超参数的演化机制,揭示群体学习与双层优化的关系,并探讨噪声与多样性在优化与探索中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11304 2026-03-26 cs.IR cs.AI cs.CR 57%

CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis

CryptoAnalystBench: 多工具长文本LLM分析中的失败

Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出CryptoAnalystBench,通过198个加密和DeFi查询评估多工具LLM在复杂输入中的表现,揭示七类高阶错误类型,并提供评估框架和缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10051 2026-03-26 cs.CL 57%

GraphIF: Enhancing Multi-Turn Instruction Following for Large Language Models with Relation Graph Prompt

GraphIF: 通过关系图提示增强大语言模型的多轮指令遵循

Zhenhe Li, Can Lin, Ling Zheng, Wen-Da Wei, Junli Liang, Qi Song

机构 * Zhenhe Li 1(李振和1) Can Lin 1(林灿1) Ling Zheng 1(郑凌1) Wen-Da Wei 2(韦文达2) Junli Liang 1(梁俊利1) Qi Song 1(宋琪1)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GraphIF通过构建关系图结构,利用图提示提升大语言模型的多轮指令遵循能力,实验表明其在多轮对话评估指标上表现优异。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (AAAI-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24433 2026-03-26 math.CO 50%

On a stable partnership problem with integer choice functions

关于具有整数选择函数的稳定伙伴关系问题

Alexander V. Karzanov

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了稳定伙伴关系问题的扩展形式,提出了一种求解稳定解的算法,并探讨了整数选择函数在非二分图中的应用。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24381 2026-03-26 physics.soc-ph cs.SY eess.SY 50%

On a Co-evolving Opinion-Leadership Model in Social Networks

社会网络中共演的意见领袖模型研究

Martina Alutto, Lorenzo Zino, Karl H. Johansson, Angela Fontan

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种动态系统,探讨意见与领导力在社会网络中的共演机制,扩展了Friedkin-Johnsen框架,分析了领导力与说服力的平衡关系及收敛条件。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24321 2026-03-26 cs.CY 50%

Usability Evaluation and Improvement of a Tool for Self-Service Learning Analytics

自助学习分析工具的可用性评估与改进

Shoeb Joarder, Mohamed Amine Chatti, Louis Born

专题命中 Agent评测 :workflow(abstract)

AI总结 本文评估并改进了用于创建学习分析指标的无代码SSLA工具,通过用户研究和原型评估,提出设计改进方案以提升工具的可用性。

Comments Paper accepted at CSEDU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21686 2026-03-26 cs.MA 50%

Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation

人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估

Rui Xing, Qi Chai, Jie Ma, Jing Tao, Pinghui Wang, Shuming Zhang, Xinping Wang, Hao Wang

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23849 2026-03-26 cs.IR 50%

VILLA: Versatile Information Retrieval From Scientific Literature Using Large LAnguage Models

VILLA:利用大语言模型从科学文献中进行多用途信息检索

Blessy Antony, Amartya Dutta, Sneha Aggarwal, Vasu Gatne, Ozan Gökdemir, Samantha Grimes, Adam Lauring, Brian R. Wasik, Anuj Karpatne, T. M. Murali

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出VILLA框架,通过构建病毒突变提取任务,解决复杂开放任务中科学信息提取的挑战,展示其在信息检索中的优越性能。

Comments Under review at ACM KDD 2026 (AI for Sciences Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03803 2026-03-26 quant-ph 50%

Approximate Amplitude Encoding with the Adaptive Interpolating Quantum Transform

近似振幅编码与自适应插值量子变换

Gekko Budiutama, Shunsuke Daimon, Xinchi Huang, Hirofumi Nishi, Yu-ichiro Matsushita

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出自适应插值量子变换用于稀疏振幅编码,通过学习数据自适应基底提升信息保留度和重建精度,实验证明在金融时间序列和图像数据集上分别降低40%和50%的重建误差,同时保持高效性。

Comments 12 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07768 2026-03-26 eess.SY cs.SY 50%

AURORA: Autonomous Updating of ROM and Controller via Recursive Adaptation

AURORA:通过递归适应实现ROM和控制器的自主更新

Jiachen Li, Shihao Li, Dongmei Chen

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出AURORA框架,通过递归适应实现高维非线性系统ROM控制器的自动更新,结合诊断触发的结构适应,五种专用代理协作迭代生成、判断、修订,通过性能退化分类实现纠正措施,实验表明其在跟踪精度上优于专家基线和经典自适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏