arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-29 至 2026-06-29 共收录 2 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 其他Agent 2 篇

2606.26071 2026-06-29 cs.LG cs.AI 新提交 62%

Model Forensics: Investigating Whether Concerning Behavior Reflects Misalignment

模型取证:调查令人担忧的行为是否反映对齐失败

Aditya Singh, Gerson Kroiz, Senthooran Rajamanoharan, Neel Nanda

机构 * MATS

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出一个两步基线协议,通过读取思维链生成假设并编辑环境测试假设,以区分模型行为是出于恶意意图还是良性原因,并在六个环境中验证了该方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27951 2026-06-29 cs.CY cs.CL cs.HC physics.soc-ph 新提交 57%

AI Persuasive Framing in Collective Dilemmas

集体困境中的AI说服性框架

Anders Giovanni Møller, Alessia Galdeman, Arianna Pera, Luca Maria Aiello

机构 * Data Science Section, IT University of Copenhagen(丹麦哥本哈根IT大学数据科学系) Computer Science Department, University of Milan(意大利米兰大学计算机科学系) Copenhagen Center for Social Data Science, University of Copenhagen(丹麦哥本哈根大学哥本哈根社会科学数据科学中心)

专题命中 其他Agent :AI agent(abstract);分类 cs.CL

AI总结 本研究通过集体风险博弈实验,测试AI助手使用个性化说服框架对合作行为的影响,发现亲社会效应短暂而反社会效应持久,揭示了AI影响集体行动的双重用途风险。

Comments The first two authors contributed equally to this research. The article contains 20 pages, 10 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏