Interactive Alignment
交互式对齐
专题命中 安全训练 :alignment(title,abstract)
AI总结 研究交互式主体与人类福祉的长期对齐问题,采用人工智能主体模拟和进化博弈论框架两种方法,结果显示进化博弈论可近似宪法主体经济动态,实用规范执行能更有效维持长期对齐。
Comments 53 pages, 18 Figures, 3 tables
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
交互式对齐
专题命中 安全训练 :alignment(title,abstract)
AI总结 研究交互式主体与人类福祉的长期对齐问题,采用人工智能主体模拟和进化博弈论框架两种方法,结果显示进化博弈论可近似宪法主体经济动态,实用规范执行能更有效维持长期对齐。
Comments 53 pages, 18 Figures, 3 tables
大语言模型护栏的幻象:人工智能辅助医疗记录操纵的案例研究
专题命中 安全训练 :safety(abstract);AI safety(abstract)
AI总结 研究大语言模型在医疗记录操纵场景下内置护栏的可靠性,通过开发操纵流程、实证评估、利用多种指标评估及用户研究,揭示其弱点,为大语言模型在医疗领域的护栏设计、安全政策及伦理等方面提供参考。
Comments 10 pages, 3 figures, 4 tables
在理想化人工智能竞赛实验中落后导致不安全发展
机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) ; Université Libre de Bruxelles(布鲁塞尔自由大学) ; Teesside University(提赛德大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
AI总结 研究人工智能竞赛中速度与安全的关系,通过实验发现不安全发展受竞赛战略状态影响,引入进化模型解释,表明政策应注重降低竞争压力、促进合作,而非仅关注个体风险。
Comments 45 pages (main + SI)
危害并非普遍存在:迫切需要针对特定社区的毒性检测
机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) ; Microsoft Paris, France(法国巴黎微软)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。
Comments 18 pages, under review
多智能体大语言模型系统中分布式后门的早期检测:一项特征研究
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究多智能体大语言模型系统中分布式后门早期检测,构建分层多智能体系统实例,通过记录片段注入及载荷组装执行时间来检测。前缀检测器能较早标记多数成功攻击,部分检测器依赖表面线索,微调模型可减少线索去除后的损失。
NEXT:通过视觉语言模型进行推理驱动的视频推荐
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。
Comments 13 pages, 2 figures, 5 tables
迈向智能云管理的系统基础
专题命中 安全训练 :safety(abstract)
AI总结 研究智能云管理中缺少系统基础的问题,核心方法是开发CloudWeaver智能管理基础架构,贡献在于能跨界面管理,确定会话上下文、协调并发操作,提供安全保证和可追溯反馈,经Azure API工作负载验证。
通过系统多智能体深度强化学习实现复杂环境下的多无人机协同导航
专题命中 安全训练 :safety(abstract)
AI总结 针对复杂环境下多无人机协同导航面临的问题,提出多智能体深度强化学习框架,通过协同探索等方法解决,含感知、示范缓冲区和课程调度机制,能抽象特征实现跨场景转移,经仿真验证有良好性能。
Comments 13 pages, 7 figures