Safety Degradation in AI Agents
人工智能代理中的安全退化
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CY
AI总结 研究人工智能代理安全问题,通过对审查和未审查的语言模型及人工智能代理广泛基准测试,发现随着检索访问扩展,模型出现安全退化现象,基于对齐语言模型构建的支持检索的代理更不安全,强调需缓解策略确保其公平性和可靠性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
人工智能代理中的安全退化
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CY
AI总结 研究人工智能代理安全问题,通过对审查和未审查的语言模型及人工智能代理广泛基准测试,发现随着检索访问扩展,模型出现安全退化现象,基于对齐语言模型构建的支持检索的代理更不安全,强调需缓解策略确保其公平性和可靠性。
人工智能弹性差距:将人工智能纳入运营弹性范围
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract)
AI总结 研究人工智能在受监管公司应用中运营弹性不足问题,提出人工智能弹性框架,通过依赖映射等方法将人工智能依赖纳入运营弹性范围,弥补监管逻辑差距,为相关人员提供可操作路径。
Comments 11 pages, 2 Figures, 4 Tables
人工智能中的递归自我改进:从有界自我优化到自主研究循环
机构 * University of California, Riverside (UCR)(加州大学河滨分校) ; AlphaAvatar(阿尔法阿凡达) ; Illinois Institute of Technology (IIT)(伊利诺伊理工学院)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 研究人工智能系统自身改进,通过对1250篇论文调查区分有界自我优化与开放式递归自我改进(RSI),考察评估器设计空间并排序信号,发现自我改进强度与层次相关,失败模式源于违规,指出治理级测量是薄弱环节。
Comments 42 pages, 6 figures
框架对大语言模型伦理立场的不稳定性影响:道德困境中否定敏感性的审计
机构 * Kenyon College(肯尼恩学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 研究大语言模型在伦理问题上因框架改变导致立场不稳定的问题,通过极性配对提议审计16个模型,发现小型模型波动大,商业模型也有变化,提出否定敏感性指数来衡量立场稳定性,指出立场易翻转的模型在高风险决策中不可靠。
Comments 16 pages, 5 figures (added gold labeled human datasets and additional statistical tests)