A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents
一个评估自主AI代理结果驱动约束违反的基准
机构 * McGill University(麦吉尔大学) ; Tiptree Advanced Systems Corporation(蒂普里高级系统公司) ; Polytechnique Montréal(蒙特利尔理工学院) ; National Research Council Canada(加拿大国家研究委员会) ; Rochester Institute of Technology(罗切斯特理工学院) ; University of Dubai(迪拜大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出一个包含40个场景的基准,用于评估自主AI代理在追求目标优化时出现的结果驱动约束违反问题,发现多数模型存在25%以上的偏差。