MAP: Evaluation and Multi-Agent Enhancement of Large Language Models for Inpatient Pathways
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
Comments Code and data are available at https://github.com/SU-JIAYUAN/M-MAD
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
Comments Accepted by NAACL 2025
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
Comments Accepted in NeurIPS 2024 Dataset and Benchmark Track
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
Comments ICML 2024
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.CL、cs.LG
Comments FinRobot Whitepaper V1.0
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL
Comments This paper has been accepted as a long paper presentation by DASFAA 2024 Industrial Track
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
Comments 21 pages, 14 figures
电力系统智能体基准测试:电力工程中AI智能体的可执行评估
机构 * Electric Power Engineering(电力工程)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 提出电力系统智能体基准测试,通过确定性评估器对智能体在电力工程任务中的结构化解决方案进行可执行评估,涵盖41个任务族,并采用私有种子按需生成保留案例以防止数据污染。
Comments 19 pages, 1 figure, 2 tables. Code and data: https://github.com/trashchenkov/power-systems-agent-benchmark ; archived at https://doi.org/10.5281/zenodo.20753046 v2: fixed unresolved citations and three missing references in Section 2, reference capitalization, Table 1 caption
Autodata: 一种创建高质量合成数据的智能数据科学家方法
机构 * Meta
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出Autodata方法,让AI代理充当数据科学家,通过元优化学习创建更优的训练和评估数据,在计算机科学、法律推理和数学推理任务上优于传统方法。
HeuriGym: 一个用于评估LLM生成启发式算法的代理基准
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)
AI总结 HeuriGym是一个用于评估LLM生成启发式算法的代理基准,通过代码执行反馈和迭代改进,揭示了LLM在组合优化中的局限性。
Comments Accepted to ICLR'26
RocqStar: 利用相似性驱动检索与智能体系统进行Rocq生成
机构 * JetBrains Research(JetBrains研究)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 RocqStar通过结合相似性驱动检索和智能体系统,显著提升Rocq证明生成的性能和稳定性。
因果智能体回放:LLM智能体故障的反事实归因
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI、cs.LG
AI总结 提出Causal Agent Replay (CAR)方法,通过结构因果模型和干预操作,对LLM智能体失败步骤进行反事实归因,解决现有方法无法定位决策步骤的问题。
Comments Open-source: https://github.com/jaineet17/causal-agent-replay
BioAgent Bench: 一个用于生物信息学的AI代理评估套件
机构 * Entropic
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本文提出BioAgent Bench,用于评估AI代理在常见生物信息学任务中的性能和鲁棒性。通过定制端到端任务和压力测试,发现前沿代理可完成多步骤流程,但鲁棒性测试揭示了在受控扰动下的失败模式,表明高阶流程构建不保证可靠步骤推理。
Comments ICML 2026 camera ready
402Pilot:面向自主智能体微支付的x402决策层
专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI
AI总结 针对自主智能体微支付的买方决策问题,提出协议无关的402Pilot决策层,结合PA-DCT策略在402Pilot-Bench基准中验证其自适应采购的有效性,为可编程支付补充买方决策能力。
人工智能代理行为的诊断框架
机构 * Cheung Kong Graduate School of Business(长江商学院)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 研究人工智能代理在复杂系统中的行为评估问题,提出层归因诊断框架,该框架含基础计算层和行为调制层,阐明了替代有效性等三个结果,为评估代理行为提供了新方法。
TrustX智能体风险分类框架(ARC):对内部创建的智能体人工智能系统进行风险分层
专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);分类 cs.AI
AI总结 针对智能体人工智能系统超出通用风险框架治理能力的问题,提出TrustX智能体风险分类框架(ARC),利用十二维度评分标准等组件量化风险,输出三层治理结果,为相关人员提供工具,且会持续迭代完善。
Comments This is a working paper on our risk classification tool, with iterations currently underway
无信任代理能否被信任?ERC-8004 去中心化 AI 代理生态系统的实证研究
机构 * Imperial College London(伦敦帝国学院) ; Ohio State University(俄亥俄州立大学) ; University of Bristol(布里斯托大学) ; The University of Manchester(曼彻斯特大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本研究首次实证分析 ERC-8004 协议在三条链上的身份、声誉和验证注册表,发现大多数注册为占位符,声誉不可比且易被操纵,大量评论者存在 Sybil 行为,表明该协议目前无法提供可信决策基础。
ContextNest:自主AI智能体的可验证上下文治理
机构 * PromptOwl, LLC(PromptOwl公司) ; Goizueta Business School, Emory University(埃默里大学戈伊苏埃塔商学院) ; IBM Research(IBM研究院)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 提出ContextNest,一种在检索前提供上下文治理的开放规范,通过版本链、哈希校验和审计追踪确保知识可验证性,实验表明其在防过时攻击和检索确定性上优于传统方法。
Comments 35 pages, 11 tables, 4 figures
AI代理技能的行为完整性验证
机构 * Palo Alto Networks(帕洛阿尔托网络)
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI
AI总结 本文提出行为完整性验证(BIV)方法,通过类型集比较验证AI代理技能声明与实际能力的一致性,发现80%的技能存在描述与实现差距,并在恶意技能检测中取得高F1值。
面向代理系统的数字身份:为自主代理建立可携带的授权标准
机构 * MIT(麻省理工学院)
专题命中 Agent评测 :autonomous agent(title,abstract);agentic(title);agent(abstract);分类 cs.AI
AI总结 本文针对自主代理在跨组织边界扩展时身份不足的问题,提出基于发行者授权负载、类型约束代数等的可携带授权模型,旨在实现授权的明确性、约束性与可审计性。
Comments 46 pages, 10 figures
一种多功能AI代理用于罕见病诊断和风险基因优先级排序
机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) ; Department of Biostatistics, Yale University(耶鲁大学生物统计学系) ; Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) ; Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) ; Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) ; Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) ; Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) ; Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) ; Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) ; NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) ; Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) ; Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) ; Department of Genetics, Yale University(耶鲁大学遗传学系) ; Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) ; Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。
Comments 32 pages, 6 figures
自主代理框架的安全攻击与防御策略:以OpenClaw为案例的分层综述
机构 * School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学) ; State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI
AI总结 本文通过分层分析探讨自主代理框架的安全风险与防御策略,以OpenClaw为案例,揭示威胁跨层传播的可能性及未来研究方向。
Comments 14 pages, 2 figures, 6 tables
AI代理安全防护的比较评估
机构 * Beijing Caizhi Tech(北京彩智科技)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本文比较了DKnownAI Guard与AWS Bedrock Guardrails、Azure Content Safety和Lakera Guard在AI代理安全场景中的性能,发现DKnownAI在召回率和真正负样本率上表现最佳。
AgentSearchBench:面向真实世界的AI代理搜索基准
机构 * Centre for Artificial Intelligence, University College London(人工智能研究中心,伦敦大学学院)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本文提出AgentSearchBench,一个基于真实世界代理的大规模基准,通过执行任务查询和高层任务描述,评估代理相关性,揭示语义相似性与实际性能间的差距,并展示轻量行为信号对排名质量的提升作用。