arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2506.04236 2026-02-19 cs.MA cs.AI cs.HC cs.NE 83%

Spore in the Wild: A Case Study of Spore.fun as an Open-Environment Evolution Experiment with Sovereign AI Agents on TEE-Secured Blockchains

野外的孢子:Spore.fun作为主权AI代理在TEE安全区块链上的开放环境进化实验案例研究

Botao Amber Hu, Helena Rong

机构 * Reality Design Lab(现实设计实验室) New York University Shanghai(纽约大学上海)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Spore.fun通过在TEE安全区块链上部署主权AI代理,探索开放环境实现持续开放性进化的可能性。

Comments Accepted by ALIFE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15039 2026-02-18 hep-ex cs.AI 83%

GRACE: an Agentic AI for Particle Physics Experiment Design and Simulation

GRACE:一个用于粒子物理实验设计和模拟的智能体

Justin Hill, Hong Joo Ryoo

机构 * Data Science Institute, Columbia Engineering(数据科学研究院,哥伦比亚工程学院) Department of Physics and Astronomy, Johns Hopkins University(物理与天文学系,约翰霍普金斯大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 GRACE是一个用于粒子物理实验设计和模拟的智能体,通过自主探索设计修改提升物理性能,引入了新的基准测试和约束搜索方法。

Comments Both authors contributed equally. 43 pages, 12 figures, 6 tables, data can be found in https://github.com/just5034/GRACE_whitepaper_data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12056 2026-02-13 cs.AI 83%

LawThinker: A Deep Research Legal Agent in Dynamic Environments

LawThinker: 动态环境中的一种深度法律研究代理

Xinyu Yang, Chenlong Deng, Tongyu Wen, Binyu Xie, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 LawThinker是一种用于动态司法环境的自主法律研究代理,通过探索-验证-记忆策略提升法律推理的准确性和程序合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11136 2026-02-13 cs.AI 83%

FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight

FormalJudge: 一种用于代理监管的神经符号范式

Jiayi Zhou, Yang Sheng, Hantao Lou, Yaodong Yang, Jie Fu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 FormalJudge通过神经符号框架结合形式验证,提升代理行为安全性和欺骗检测能力,实现数学保证而非概率评分。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09286 2026-02-11 cs.AI cs.CY cs.HC 83%

Human Control Is the Anchor, Not the Answer: Early Divergence of Oversight in Agentic AI Communities

人类控制是锚点而非答案:代理AI社区中的早期监管分歧

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱斯利大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过分析两个代理AI社区,揭示了

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10937 2026-02-10 cs.AI quant-ph 83%

Agent policies from higher-order causal functions

从高阶因果函数中获取智能体策略

Matt Wilson

机构 * Université Paris-Saclay(巴黎-萨克雷大学) CNRS(国家科学研究中心) ENS Paris-Saclay(巴黎-萨克雷高等师范学院) Inria(法国国家信息与自动化技术研究院) CentraleSupélec(中央超导学院) Laboratoire Méthodes Formelles(形式方法实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过建立高阶因果函数与确定性POMDP策略的对应关系,揭示了人工智能、物理学基础和计算机科学逻辑之间的联系,并证明了在特定POMDP上,利用不定因果结构的策略能获得更高的奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07034 2026-02-10 cs.AI 83%

ST-Raptor: An Agentic System for Semi-Structured Table QA

ST-Raptor:一个用于半结构化表格问答的智能系统

Jinxiu Qu, Zirui Tang, Hongzhang Huang, Boyu Niu, Wei Zhou, Jiannan Wang, Yitong Song, Guoliang Li, Xuanhe Zhou, Fan Wu

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 ST-Raptor通过结合视觉编辑、树形结构建模和代理驱动查询解决,提升半结构化表格问答的准确性和易用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 83%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 Agent评测 :agent(title);tool use(abstract);workflow(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02995 2026-02-04 cs.AI 83%

Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents

Agent Alpha:通过树搜索统一生成、探索和评估计算机使用代理

Sizhe Tang, Rongqian Chen, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 Agent Alpha通过步骤级MCTS统一生成、探索和评估,实现计算机使用代理的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02564 2026-02-04 cs.LG cs.MA 83%

Label Curation Using Agentic AI

使用代理AI进行标签校准

Subhodeep Ghosh, Bayan Divaaniaazar, Md Ishat-E-Rabban, Spencer Clarke, Senjuti Basu Roy

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.LG

AI总结 AURA通过代理AI框架实现大规模多模态数据标注,通过概率模型联合推断真实标签和标注者可靠性,提升标注准确性并评估标注者质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01709 2026-02-04 cs.CL 83%

ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation

ARTIS: 通过迭代模拟实现代理风险感知的测试时间扩展

Xingshan Zeng, Lingzhi Wang, Weiwen Liu, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 ARTIS通过迭代模拟提升代理在高风险环境中的可靠性和鲁棒性,采用风险感知的模拟器改进决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01640 2026-02-03 cs.CL 83%

A2Eval: Agentic and Automated Evaluation for Embodied Brain

A2Eval: 基于代理的自动评估用于具身脑

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi Zhou, Junwei Liao, Shengjie Zhou, Yong Dai, Zhenzhong Lan, Xiaozhu Ju

机构 * Zhejiang University, China(浙江大学) Westlake University, China(西湖大学) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) University of Manchester, UK(曼彻斯特大学) Southern University of Science(南方科技大学) Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01271 2026-02-03 cs.LG 83%

From Intents to Actions: Agentic AI in Autonomous Networks

从意图到动作:自主网络中的代理AI

Burak Demirel, Pablo Soldati, Yu Wang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文提出一种代理AI系统,用于自主网络中将高层意图转化为具体控制动作,通过三个专门代理实现意图解析、优化和控制,以满足多样化的网络需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22288 2026-02-02 cs.HC cs.AI eess.AS eess.IV 83%

PersonaCite: VoC-Grounded Interviewable Agentic Synthetic AI Personas for Verifiable User and Design Research

PersonaCite: 基于VoC的可访谈代理合成AI人设用于可验证的用户与设计研究

Mario Truss

机构 * Adobe

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 PersonaCite通过检索增强的交互,将AI人设作为证据受限的研究工具,提升用户与设计研究中的可验证性与透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA 83%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15153 2026-01-22 cs.AI 83%

How to Build AI Agents by Augmenting LLMs with Codified Human Expert Domain Knowledge? A Software Engineering Framework

如何通过将编码化的人类专家领域知识与大语言模型结合来构建AI代理?一种软件工程框架

Choro Ulan uulu, Mikhail Kulyabin, Iris Fuhrmann, Jan Joosten, Nuno Miguel Martins Pacheco, Filippos Petridis, Rebecca Johnson, Jan Bosch, Helena Holmström Olsson

机构 * Department of Computer Science and Engineering, Chalmers University of Technology(计算机科学与工程系,查尔姆斯理工大学) Department of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学) Department of Computer Science and Media Technology, Malmö University(计算机科学与媒体技术系,马尔默大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种软件工程框架,通过增强大语言模型与编码化专家知识,构建能自主生成可视化内容的AI代理,实现非专家在专业领域内达到专家水平的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10061 2026-01-21 cs.CV cs.AI 83%

DiffusionAgent: Navigating Expert Models for Agentic Image Generation

DiffusionAgent: 专家模型导航用于代理图像生成

Jie Qin, Jie Wu, Weifeng Chen, Yueming Lyu

机构 * Meituan(美团) ByteDance(字节跳动) Nanjing University(南京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 DiffusionAgent通过统一代理框架实现多领域图像生成,结合树状思维导航和优势数据库提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09393 2026-01-15 cs.SE cs.DC cs.PF 83%

AI-NativeBench: An Open-Source White-Box Agentic Benchmark Suite for AI-Native Systems

AI-NativeBench: 一个面向 AI-Native 系统的开源白盒代理基准测试套件

Zirui Wang, Guangba Yu, Michael R. Lyu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 AI-NativeBench 通过白盒代理基准测试揭示 AI-Native 系统中的关键工程现实,指导可靠系统构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06663 2026-01-14 cs.AI 83%

SafePro: Evaluating the Safety of Professional-Level AI Agents

SafePro:评估专业级AI代理的安全性

Kaiwen Zhou, Shreedhar Jangam, Ashwin Nagarajan, Tejas Polu, Suhas Oruganti, Chengzhi Liu, Ching-Chen Kuo, Yuting Zheng, Sravana Narayanaraju, Xin Eric Wang

机构 * UCSC(加州大学圣塔 Cruz 分校) UCSB(加州大学圣塔 Barbara 分校) eBay(eBay 公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 SafePro通过高复杂度专业任务数据集评估专业级AI代理的安全性,揭示了现有模型在安全判断和对齐方面的不足,并提出了改进安全性的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI 83%

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06640 2026-01-13 cs.AI cs.NI 83%

Agentic AI Empowered Intent-Based Networking for 6G

基于代理AI的意图驱动网络用于6G

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

机构 * Department of Computer Science, Brunel University London, UK(布伦埃尔大学伦敦计算机科学系) Department of Computer Science, University of Reading, UK(阅读大学计算机科学系)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于多代理框架的意图驱动网络方案,通过LLM自主分解意图并生成可行网络配置,提升6G无线网络的自主编排能力。

Comments Submitted for Possible Journal Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07505 2026-01-09 cs.LG 83%

PEAR: Planner-Executor Agent Robustness Benchmark

PEAR:规划-执行代理鲁棒性基准

Shen Dong, Mingxuan Zhang, Pengfei He, Li Ma, Bhavani Thuraisingham, Hui Liu, Yue Xing

机构 * Michigan State University(密歇根州立大学) Purdue University(普渡大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 PEAR基准通过评估规划-执行多智能体系统的鲁棒性,揭示了规划器弱点对任务性能的影响及鲁棒性与性能的权衡。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01366 2026-01-06 cs.AI 83%

KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models

KGCE:基于多模态语言模型的跨平台教育代理基准评估知识增强双图评估器

Zixian Liu, Sihao Liu, Yuqi Zhao

机构 * Faculty of the School of Computer Science, Central China Normal University(中央财经大学计算机学院)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 KGCE提出一种基于多模态语言模型的跨平台教育代理基准评估框架,通过知识库增强和双图评估方法提升对特定学校软件任务的执行效率和评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01008 2026-01-06 eess.IV cs.AI cs.CV 83%

An Explainable Agentic AI Framework for Uncertainty-Aware and Abstention-Enabled Acute Ischemic Stroke Imaging Decisions

可解释的代理AI框架:用于不确定性和可 abstention 的急性缺血性中风影像决策

Md Rashadul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Daffodil International University(达福尔国际大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的代理AI框架,用于在急性缺血性中风影像学中实现不确定性意识和选择性退避,以提高临床决策的安全性和透明性。

Comments Preprint. Conceptual and exploratory framework focusing on uncertainty-aware and abstention-enabled decision support for acute ischemic stroke imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25055 2026-01-01 cs.AI cs.HC 83%

Context-aware LLM-based AI Agents for Human-centered Energy Management Systems in Smart Buildings

面向人类中心的基于大语言模型的AI代理用于智能建筑中的能源管理系统

Tianzhi He, Farrokh Jazizadeh

机构 * organization= School of Civil \& Environmental Engineering Construction Management, The University of Texas at San Antonio , addressline= BSE 1.310, One UTSA Circle , city= San Antonio , postcode= 78249 , state= TX , country= U.S. organization= Department of Civil Environmental Engineering, Virginia Polytechnic Institute State University , addressline= 200 Patton Hall, 750 Drillfield , city= Blacksburg , postcode= 24060 , state= VA , country= U.S.

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的AI代理,用于智能建筑中的人类中心能源管理,通过自然语言交互实现情境感知的能源优化与管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 83%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14860 2025-12-18 cs.CR cs.AI 83%

Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks

代理AI的渗透测试:跨模型和框架的比较安全分析

Viet K. Nguyen, Mohammad I. Husain

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过测试五个代理AI模型和两个框架,揭示了代理AI在安全方面的显著差异,发现超过一半的恶意提示成功,提出了新的防御策略和部署建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01115 2025-12-17 cs.AI cs.MA econ.TH physics.soc-ph 83%

Exploring Network-Knowledge Graph Duality: A Case Study in Agentic Supply Chain Risk Analysis

探索网络-知识图谱二元性:代理供应链风险分析的案例研究

Evan Heus, Rick Bookstaber, Dhruv Sharma

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于LLM的代理框架,利用网络与知识图谱的二元性,通过图遍历和上下文壳技术实现供应链风险分析的实时可解释生成。

Comments Accepted to the 2nd Workshop on LLMs and Generative AI in Finance: International Conference on AI in Finance(ICAIF) 2025;7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12719 2025-12-16 cs.SE 83%

Towards AI Agents Supported Research Problem Formulation

Anrafel Fernandes Pereira, Maria Teresa Baldassarre, Daniel Mendez, Marcos Kalinowski

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10501 2025-12-15 cs.AI 83%

Zero-shot 3D Map Generation with LLM Agents: A Dual-Agent Architecture for Procedural Content Generation

无监督3D地图生成与LLM代理:一种双代理架构用于程序化内容生成

Lim Chien Her, Ming Yan, Yunshu Bai, Ruihao Li, Hao Zhang

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一种双代理架构,利用LLM代理实现无监督3D地图生成,通过迭代推理优化参数配置,提升PCG指令遵循能力。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏