CHALET: Cornell House Agent Learning Environment
专题命中 Agent评测 :agent(title);autonomous agent(abstract);planning(abstract);分类 cs.AI
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(title);autonomous agent(abstract);planning(abstract);分类 cs.AI
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI
Comments 14 pages, 23 figures
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
Comments 9 pages, 17 figures, CEC2017
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
Comments 13 pages, 0 figures
专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.SE
Comments International Journal of Information Technology, Modeling and Computing (IJITMC) Vol. 2, No. 1, 2014. arXiv admin note: text overlap with arXiv:1204.1581 by other authors without attribution
为动态LLM代理网络设计防火墙
专题命中 Agent评测 :agentic(title,comments);agent(abstract);AI agent(abstract)
AI总结 本文提出双防火墙架构,通过任务上下文投影过滤通信内容,有效降低隐私和安全攻击成功率,同时保持任务完成质量。
Comments TMLR 2026. Our code and transcripts can be found at: https://github.com/amrgomaaelhady/Firewall-Agentic-Networks
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Yuanpei College, Peking University(北京大学元培学院) ; School of Computer Science, Peking University(北京大学计算机学院) ; Tencent(腾讯) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract)
Comments SIGGRAPH ASIA 2025 (Conference Track); Project page: https://pku-mocca.github.io/Social-Agent-Page/
专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)
Comments Updated version of arXiv:2402.09563 with a survey of stylized facts for validating economic agent-based models, along with experiments showcasing the utility of our simulator for economic policy
专题命中 Agent评测 :agent(title,abstract);planning(abstract,comments)
Comments 13th International Conference on Design & Decision Support Systems in Architecture and Urban Planning. June 2016
测试时工具演化
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; University of Science and Technology of China(中国科学技术大学) ; Hong Kong Generative AI Research & Development Center, The Hong Kong University of Science and Technology(香港生成式人工智能研究与开发中心,香港科技大学) ; TCL Corporate Research (HK) Co., Ltd(TCL 企业研究(香港)有限公司)
专题命中 Agent评测 :agent(abstract);tool-use(abstract);workflow(abstract);agentic(abstract)
AI总结 研究LLM智能体测试时工具优化问题,提出TTHE方法,通过维护候选工具种群,基于执行轨迹推理优化,无需黄金标签或特定任务监督,在多任务实验中改进基线工具,将测试时适应重塑为程序演化并确定代理可靠性挑战。
Comments 15 pages, 5 figures
LLM代理中的探索结构用于多文件变更定位
机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理学院)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);multi-agent(abstract)
AI总结 针对多子系统变更场景,提出非线性、领域范围的并行代理探索结构,在SWE Bench Pro基准上,小规模Haiku类模型通过领域代理并行生成实现高微F1分数,优于线性顺序探索。
MedCTA: 临床工具智能体基准
机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; Massachusetts Institute of Technology (MIT)(麻省理工学院)
专题命中 Agent评测 :AI agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)
AI总结 提出MedCTA基准,基于放射影像、病理切片和报告等真实临床多模态输入,评估医疗AI智能体在工具检索、证据获取和集成方面的规划与执行能力。
Comments Project Page: https://ivul-kaust.github.io/MedCTA/ Code: https://github.com/IVUL-KAUST/MedCTA Data: https://huggingface.co/datasets/IVUL-KAUST/MedCTA
可审计的图引导的Kubernetes事件根因分析
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI、cs.SE
AI总结 提出Graph Traversal Agent,结合LLM推理与确定性图操作,通过类型化证据图、有界搜索和独立验证实现可审计的根因分析,在ITBench上F1从0.6087提升至0.9130。
Comments 8 pages, 1 figure. Preprint
在执行轨迹上进行推理时间对齐的工具
专题命中 Agent评测 :agent(abstract,abstract_cn);workflow(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文研究了在执行轨迹上进行推理时间对齐的工具设计,通过任务分解和引导执行机制来提高长期性能,发现工具设计中分解和引导的复杂性并不总是带来更好的结果,提出了任务分解和引导执行的两种机制,并通过合成实验和实际终端代理基准验证了这些发现。
PersonalHomeBench:评估智能家庭中的代理系统
机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)
专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。
Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix
LLM生成代码中的社会偏见:基准测试与缓解
机构 * Concordia University(康科德大学) ; Lassonde School of Engineering, York University(York大学工程学院)
专题命中 Agent评测 :agent(summary_cn,abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文研究LLM生成代码中的社会偏见问题,通过SocialBias-Bench基准测试发现四种主流模型存在严重偏见,提出Fairness Monitor Agent (FMA)有效降低偏见并提升代码正确性。
在大规模文档集合中导航:MuDABench用于多文档分析问答
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Wenlan School of Business, Zhongnan University of Economics and Law(中南财经政法大学文澜商学院)
专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);multi-agent(abstract)
AI总结 本文提出在大规模半结构化文档集合上进行分析问答的任务,介绍了MuDABench多文档分析问答基准,要求跨多个文档提取和综合信息以进行定量分析,实验发现标准RAG系统表现不佳,提出多代理工作流以提升性能。
Comments Findings of ACL 2026. The camera-ready version corrects some labeling errors. The accompanying repository is continuously updated based on community feedback; for the most up-to-date implementation and results, please refer to the repository
InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);planning(abstract);agentic(abstract)
AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。
规模化的人工智能编码协作需要一个可治理的共识层
机构 * Tencent(腾讯)
专题命中 Agent评测 :agentic(summary_cn,abstract);分类 cs.LG、cs.SE
AI总结 本文提出Agentic Consensus共识层,通过类型属性图替代代码作为主要工程产物,解决AI辅助开发中代码与聊天历史维度塌陷导致的系统不透明问题,强调通过共识熵衡量协作流程的对齐度和干预距离。
GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架
机构 * University of Southern California(南加州大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);multi-agent(abstract)
AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。
Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)
文本平衡传播用于深度复合人工智能系统
机构 * Nanyang Technological University(南洋理工大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文提出文本平衡传播(TEP),通过局部学习原理解决长周期工作流中文本梯度爆炸和消失问题,提升深度复合AI系统的准确性和效率。
Comments Accepted to ICLR 2026
AIssistant: 人机协作的数据科学科研与视角研究工作流
机构 * TIB Leibniz Information Centre for Science and Technology(图灵信息科学与技术研究所) ; L3S Research Center(L3S研究中心)
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)
AI总结 AIssistant通过人机协作框架提升数据科学科研与视角研究的效率和质量。
MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准
机构 * ETH Zürich(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院) ; HUG
专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);multi-agent(abstract)
AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。
Comments Accepted to NeurIPS 2025
机构 * Cognizant AI Lab(Cognizant AI实验室) ; UT Austin(得克萨斯大学奥斯汀分校)
专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);multi-agent(abstract)
Comments Main paper: 14 pages, 29 pages with references and appendix
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);planning(abstract);multi-agent(abstract)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);agentic(abstract)
专题命中 Agent评测 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);multi-agent(abstract)
Comments ICLR 2021
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG;autonomous agent(comments);multi-agent(comments)
Comments 31 pages, 12 figures, Journal of Autonomous Agents and Multi-Agent Systems
工具到实体的阈值:共享社交空间中个性化AI智能体的准社会动态
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 该研究提出身份标记框架,结合自传式民族志方法,揭示共享社交空间中个性化AI智能体从工具转变为社会实体的四种新动态,指出现有同意框架混淆了智能体存在与消息处理的同意。
Comments 24 pages, 3 figures, 2 tables