Model Forensics: Investigating Whether Concerning Behavior Reflects Misalignment
模型取证:调查令人担忧的行为是否反映对齐失败
机构 * MATS
专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出一个两步基线协议,通过读取思维链生成假设并编辑环境测试假设,以区分模型行为是出于恶意意图还是良性原因,并在六个环境中验证了该方法。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
模型取证:调查令人担忧的行为是否反映对齐失败
机构 * MATS
专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出一个两步基线协议,通过读取思维链生成假设并编辑环境测试假设,以区分模型行为是出于恶意意图还是良性原因,并在六个环境中验证了该方法。
集体困境中的AI说服性框架
机构 * Data Science Section, IT University of Copenhagen(丹麦哥本哈根IT大学数据科学系) ; Computer Science Department, University of Milan(意大利米兰大学计算机科学系) ; Copenhagen Center for Social Data Science, University of Copenhagen(丹麦哥本哈根大学哥本哈根社会科学数据科学中心)
专题命中 其他Agent :AI agent(abstract);分类 cs.CL
AI总结 本研究通过集体风险博弈实验,测试AI助手使用个性化说服框架对合作行为的影响,发现亲社会效应短暂而反社会效应持久,揭示了AI影响集体行动的双重用途风险。
Comments The first two authors contributed equally to this research. The article contains 20 pages, 10 figures, and 2 tables