arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

1801.07357 2019-09-18 cs.AI 83%

CHALET: Cornell House Agent Learning Environment

Claudia Yan, Dipendra Misra, Andrew Bennnett, Aaron Walsman, Yonatan Bisk, Yoav Artzi

专题命中 Agent评测 :agent(title);autonomous agent(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.03189 2017-11-21 cs.MA cs.AI physics.soc-ph 83%

Towards Agent-Based Model Specification in Smart Grid: A Cognitive Agent-based Computing Approach

Waseem Akram, Muaz A. Niazi, Laszlo Barna Iantovics

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

Comments 14 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.06275 2017-03-21 cs.AI 83%

Evolving Game Skill-Depth using General Video Game AI Agents

Jialin Liu, Julian Togelius, Diego Perez-Liebana, Simon M. Lucas

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

Comments 9 pages, 17 figures, CEC2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.06963 2016-10-12 cs.AI 83%

Limits to Verification and Validation of Agentic Behavior

David J. Jilk

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

Comments 13 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1403.2821 2014-03-13 cs.SE cs.MA 83%

Towards an Agent-Oriented Modeling and Evaluation Approach For Vehicular Systems Security

Mohamed Garoui, Belhassen Mazigh, Béchir El Ayeb, Abderrafiaa Koukam

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.SE

Comments International Journal of Information Technology, Modeling and Computing (IJITMC) Vol. 2, No. 1, 2014. arXiv admin note: text overlap with arXiv:1204.1581 by other authors without attribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01822 2026-06-24 cs.CR cs.CY 83%

Firewalls to Secure Dynamic LLM Agentic Networks

为动态LLM代理网络设计防火墙

Sahar Abdelnabi, Amr Gomaa, Eugene Bagdasarian, Per Ola Kristensson, Reza Shokri

专题命中 Agent评测 :agentic(title,comments);agent(abstract);AI agent(abstract)

AI总结 本文提出双防火墙架构,通过任务上下文投影过滤通信内容,有效降低隐私和安全攻击成功率,同时保持任务完成质量。

Comments TMLR 2026. Our code and transcripts can be found at: https://github.com/amrgomaaelhady/Firewall-Agentic-Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04637 2025-10-07 cs.GR cs.CV 83%

Social Agent: Mastering Dyadic Nonverbal Behavior Generation via Conversational LLM Agents

Zeyi Zhang, Yanju Zhou, Heyuan Yao, Tenglong Ao, Xiaohang Zhan, Libin Liu

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Yuanpei College, Peking University(北京大学元培学院) School of Computer Science, Peking University(北京大学计算机学院) Tencent(腾讯) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

Comments SIGGRAPH ASIA 2025 (Conference Track); Project page: https://pku-mocca.github.io/Social-Agent-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09563 2025-08-14 cs.MA econ.GN q-fin.EC 83%

ABIDES-Economist: Agent-Based Simulator of Economic Systems with Learning Agents

Kshama Dwarakanath, Tucker Balch, Svitlana Vyetrenko

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)

Comments Updated version of arXiv:2402.09563 with a survey of stylized facts for validating economic agent-based models, along with experiments showcasing the utility of our simulator for economic policy

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.02459 2016-11-09 cs.HC 83%

Using cognitive agent-based simulation for the evaluation of indoor wayfinding systems

Helmut Schrom-Feiertag, Martin Stubenschrott, Georg Regal, Johann Schrammel, Volker Settgast

专题命中 Agent评测 :agent(title,abstract);planning(abstract,comments)

Comments 13th International Conference on Design & Decision Support Systems in Architecture and Urban Planning. June 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08124 2026-07-10 cs.SE cs.LG 新提交 82%

TTHE: Test-Time Harness Evolution

测试时工具演化

Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Science and Technology of China(中国科学技术大学) Hong Kong Generative AI Research & Development Center, The Hong Kong University of Science and Technology(香港生成式人工智能研究与开发中心,香港科技大学) TCL Corporate Research (HK) Co., Ltd(TCL 企业研究(香港)有限公司)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);workflow(abstract);agentic(abstract)

AI总结 研究LLM智能体测试时工具优化问题,提出TTHE方法,通过维护候选工具种群,基于执行轨迹推理优化,无需黄金标签或特定任务监督,在多任务实验中改进基线工具,将测试时适应重塑为程序演化并确定代理可靠性挑战。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11976 2026-06-11 cs.SE cs.AI 新提交 82%

Exploration Structure in LLM Agents for Multi-File Change Localization

LLM代理中的探索结构用于多文件变更定位

Akeela Darryl Fattha, Kia Ying Chua, Lingxiao Jiang, Laura Wynter

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 针对多子系统变更场景,提出非线性、领域范围的并行代理探索结构,在SWE Bench Pro基准上,小规模Haiku类模型通过领域代理并行生成实现高微F1分数,优于线性顺序探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11702 2026-06-11 cs.CV cs.AI cs.CL 新提交 82%

MedCTA: A Benchmark for Clinical Tool Agents

MedCTA: 临床工具智能体基准

Tajamul Ashraf, Hyewon Jeong, Fida Mohammad Thoker, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 Agent评测 :AI agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 提出MedCTA基准,基于放射影像、病理切片和报告等真实临床多模态输入,评估医疗AI智能体在工具检索、证据获取和集成方面的规划与执行能力。

Comments Project Page: https://ivul-kaust.github.io/MedCTA/ Code: https://github.com/IVUL-KAUST/MedCTA Data: https://huggingface.co/datasets/IVUL-KAUST/MedCTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08590 2026-06-09 cs.SE cs.AI cs.DC 新提交 82%

Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents

可审计的图引导的Kubernetes事件根因分析

Anastasiia Kuvshinova, Seungmin Jin

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI、cs.SE

AI总结 提出Graph Traversal Agent,结合LLM推理与确定性图操作,通过类型化证据图、有界搜索和独立验证实现可审计的根因分析,在ITBench上F1从0.6087提升至0.9130。

Comments 8 pages, 1 figure. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21516 2026-05-22 cs.LG cs.AI 82%

Harnesses for Inference-Time Alignment over Execution Trajectories

在执行轨迹上进行推理时间对齐的工具

Boyuan Wang, Bochao Li, Minghan Wang, Yuxin Tao, Fang Kong

专题命中 Agent评测 :agent(abstract,abstract_cn);workflow(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了在执行轨迹上进行推理时间对齐的工具设计,通过任务分解和引导执行机制来提高长期性能,发现工具设计中分解和引导的复杂性并不总是带来更好的结果,提出了任务分解和引导执行的两种机制,并通过合成实验和实际终端代理基准验证了这些发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16813 2026-05-15 cs.AI cs.CL cs.DB 82%

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench:评估智能家庭中的代理系统

Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim

机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)

专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。

Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00382 2026-05-04 cs.SE cs.AI cs.SI 82%

Social Bias in LLM-Generated Code: Benchmark and Mitigation

LLM生成代码中的社会偏见:基准测试与缓解

Fazle Rabbi, Lin Ling, Song Wang, Jinqiu Yang

机构 * Concordia University(康科德大学) Lassonde School of Engineering, York University(York大学工程学院)

专题命中 Agent评测 :agent(summary_cn,abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM生成代码中的社会偏见问题,通过SocialBias-Bench基准测试发现四种主流模型存在严重偏见,提出Fairness Monitor Agent (FMA)有效降低偏见并提升代码正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22239 2026-04-27 cs.CL cs.AI 82%

Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA

在大规模文档集合中导航:MuDABench用于多文档分析问答

Zhanli Li, Yixuan Cao, Lvzhou Luo, Ping Luo

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Wenlan School of Business, Zhongnan University of Economics and Law(中南财经政法大学文澜商学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出在大规模半结构化文档集合上进行分析问答的任务,介绍了MuDABench多文档分析问答基准,要求跨多个文档提取和综合信息以进行定量分析,实验发现标准RAG系统表现不佳,提出多代理工作流以提升性能。

Comments Findings of ACL 2026. The camera-ready version corrects some labeling errors. The accompanying repository is continuously updated based on community feedback; for the most up-to-date implementation and results, please refer to the repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 82%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17883 2026-04-21 cs.SE cs.HC cs.LG 82%

Scaling Human-AI Coding Collaboration Requires a Governable Consensus Layer

规模化的人工智能编码协作需要一个可治理的共识层

Tianfu Wang, Zhezheng Hao, Yin Wu, Wei Wu, Qiang Lin, Hande Dong, Nicholas Jing Yuan, Hui Xiong

机构 * Tencent(腾讯)

专题命中 Agent评测 :agentic(summary_cn,abstract);分类 cs.LG、cs.SE

AI总结 本文提出Agentic Consensus共识层,通过类型属性图替代代码作为主要工程产物,解决AI辅助开发中代码与聊天历史维度塌陷导致的系统不透明问题,强调通过共识熵衡量协作流程的对齐度和干预距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24329 2026-04-14 cs.CL cs.AI cs.CV 82%

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。

Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21064 2026-04-06 cs.LG cs.AI 82%

Textual Equilibrium Propagation for Deep Compound AI Systems

文本平衡传播用于深度复合人工智能系统

Minghui Chen, Wenlong Deng, James Zou, Han Yu, Xiaoxiao Li

机构 * Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出文本平衡传播(TEP),通过局部学习原理解决长周期工作流中文本梯度爆炸和消失问题,提升深度复合AI系统的准确性和效率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12282 2026-03-03 cs.AI cs.LG 82%

AISSISTANT: Human-AI Collaborative Review and Perspective Research Workflows in Data Science

AIssistant: 人机协作的数据科学科研与视角研究工作流

Sasi Kiran Gaddipati, Farhana Keya, Gollam Rabby, Sören Auer

机构 * TIB Leibniz Information Centre for Science and Technology(图灵信息科学与技术研究所) L3S Research Center(L3S研究中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 AIssistant通过人机协作框架提升数据科学科研与视角研究的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 82%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);multi-agent(abstract)

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09030 2025-11-13 cs.AI cs.CL cs.MA 82%

Solving a Million-Step LLM Task with Zero Errors

Elliot Meyerson, Giuseppe Paolo, Roberto Dailey, Hormoz Shahrzad, Olivier Francon, Conor F. Hayes, Xin Qiu, Babak Hodjat, Risto Miikkulainen

机构 * Cognizant AI Lab(Cognizant AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);multi-agent(abstract)

Comments Main paper: 14 pages, 29 pages with references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01935 2025-03-05 cs.MA cs.AI cs.CL cs.CY 82%

MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents

Kunlun Zhu, Hongyi Du, Zhaochen Hong, Xiaocheng Yang, Shuyi Guo, Zhe Wang, Zhenhailong Wang, Cheng Qian, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);planning(abstract);multi-agent(abstract)

Comments https://github.com/MultiagentBench/MARBLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04984 2025-01-16 cs.AI cs.LG 82%

Frontier Models are Capable of In-context Scheming

Alexander Meinke, Bronson Schoen, Jérémy Scheurer, Mikita Balesni, Rusheb Shah, Marius Hobbhahn

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10871 2024-10-16 cs.CL cs.AI 82%

Applying Refusal-Vector Ablation to Llama 3.1 70B Agents

Simon Lermen, Mateusz Dziemian, Govind Pimpale

专题命中 Agent评测 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.09890 2021-05-04 cs.AI cs.LG cs.MA 82%

Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration

Xavier Puig, Tianmin Shu, Shuang Li, Zilin Wang, Yuan-Hong Liao, Joshua B. Tenenbaum, Sanja Fidler, Antonio Torralba

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);multi-agent(abstract)

Comments ICLR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.03309 2019-08-12 cs.MA cs.CY cs.LG 82%

Automatic Calibration of Dynamic and Heterogeneous Parameters in Agent-based Model

Dongjun Kim, Tae-Sub Yun, Il-Chul Moon

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG;autonomous agent(comments);multi-agent(comments)

Comments 31 pages, 12 figures, Journal of Autonomous Agents and Multi-Agent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13586 2026-08-17 cs.HC cs.CY 新提交 82%

The Tool-to-Entity Threshold: Parasocial Dynamics of Personalised AI Agents in Shared Social Spaces

工具到实体的阈值:共享社交空间中个性化AI智能体的准社会动态

Leonardo Borges, Asif Q. Gill

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 该研究提出身份标记框架,结合自传式民族志方法,揭示共享社交空间中个性化AI智能体从工具转变为社会实体的四种新动态,指出现有同意框架混淆了智能体存在与消息处理的同意。

Comments 24 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏