Emergence of Communication in an Interactive World with Consistent Speakers
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
Comments Emergent Communication Workshop @ NeurIPS 2018
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
Comments Emergent Communication Workshop @ NeurIPS 2018
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments ICRA 2019; Presented at IROS 2018 Workshop on Machine Learning in Robot Motion Planning
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments 6 pages, NAECON 2018 - IEEE National Aerospace and Electronics Conference
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Code: https://github.com/IBM/constrained-rl
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Further results and demo videos can be viewed at: https://wayve.ai/blog/l2diad
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
用于自我改进系统的可证伪发布门限
机构 * AI Architect(人工智能架构师)
专题命中 安全训练 :safety(abstract,comments);分类 cs.AI
AI总结 研究自我改进系统安全声明,提出可证伪发布门限及构建验证方法,在Antahkarana运行时应用,经机器检查确保安全,发布验收结果,明确范围,使结果可重现、门限可在其他框架运行。
Comments 23 pages, 14 figures. Major revision merging the follow-up "Standing Invariants at Scale" into this paper per arXiv moderation: the machine-checked action-safety core preserved across six further releases, six new invariant families with teeth, and real-hardware self-improvement; suite grown from 122 to 563 tests. Software, gate suite, run artifacts, and TLA+ spec are open source
ChainCaps: 通过单调能力衰减实现组合安全的工具使用智能体
机构 * Independent Researcher, Seattle, WA, USA(华盛顿州塞勒姆独立研究员) ; Independent Researcher, New York City, NY, USA(纽约市纽约独立研究员) ; King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学技术大学)
专题命中 安全训练 :safety(abstract,comments);分类 cs.AI
AI总结 针对工具组合中的权限洗钱漏洞,提出ChainCaps机制,通过运行时能力预算交集传播规则,在不修改智能体或工具服务器的情况下,将攻击成功率从25-68%降至0-4.8%,同时保持96-100%的良性任务完成率。
Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026
智能体指令的自动形式化为策略即代码
专题命中 安全训练 :safety(abstract,comments);分类 cs.AI
AI总结 提出自动形式化流水线,通过LLM生成-批评循环将智能体提示和自然语言策略转化为Cedar策略语言,在MedAgentBench上比手工编码覆盖更多规范。
Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026
机构 * Volvo Cars(沃尔沃汽车公司) ; University of Gothenburg(哥德堡大学) ; Chalmers University of Technology(查尔姆斯理工大学)
专题命中 安全训练 :safety(abstract,comments);分类 cs.AI
Comments Accepted in the 44th International Conference on Computer Safety, Reliability and Security (SafeComp 2025)
专题命中 安全训练 :safety(abstract);分类 cs.AI;trustworthy(comments)
Comments Accepted to NeurIPS 2024 Workshop on Safe & Trustworthy Agents
专题命中 安全训练 :safety(abstract,comments);分类 cs.LG
Comments 43rd International Conference on Computer Safety, Reliability and Security (SafeComp2024), Florence, Italy, September 17-20.2024
专题命中 安全训练 :safety(abstract,comments);分类 cs.LG
Comments NeurIPS 2019 Workshop on Safety and Robustness in Decision Making
专题命中 安全训练 :safety(abstract,journal_ref);分类 cs.AI
Journal ref Workshop on Safety Risk and Uncertainty in Reinforcement Learning, Conference on Uncertainty in Artificial Intelligence (UAI), 2018
TRUSS:面向任务可靠且用户安全的自动化智能体技能生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。
使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究
机构 * Politecnico di Milano(米兰理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。
Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026
准备好应对什么?反思人工智能与机器人技术在应用和政策层面的准备情况
专题命中 安全训练 :alignment(abstract);分类 cs.CY
AI总结 该研究通过分析982名参与者对17项AI与机器人技术挑战的15200次评估,揭示了挑战复杂性、重要性与准备度的关联,指出政策制定者需关注挑战特有障碍及同一利益相关者的内部差异。
Comments 33 pages, including supplementary. 8 tables, 5 figures
Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化
机构 * AWS AI(亚马逊云科技人工智能部门)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。
LEGO-RL:利用原生强化学习实现编码智能体
机构 * Huawei Technologies Co., Ltd(华为技术有限公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。
Comments Webpage: https://lego-rl.pages.dev
DiSCO:通过分布引导的对比提示优化防御文本到图像生成
机构 * Qualcomm AI Research(高通人工智能研究院) ; King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。
用米尔格拉姆范式测量大型语言模型对权威的服从性
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。
Comments 11 pages, 7 figures,
概率程序合成中的似然黑客行为
机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) ; University of Edinburgh, School of Informatics(爱丁堡大学信息学院) ; CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。
Journal ref Proceedings of the 42nd Conference on Uncertainty in Artificial Intelligence, PMLR 337:2744-2791, 2026
基于Q的变分逆强化学习
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出新型贝叶斯逆强化学习方法QVIRL,兼具可扩展性与不确定性量化能力,在多类任务的学徒学习中表现优异,是首个可从原始像素观测训练的贝叶斯IRL方法。
HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Nankai University(南开大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。
Comments Project page: https://grange007.github.io/HAF
大语言模型拒绝回答中的对称性破缺:答案释放比拒绝恢复更具局部性
机构 * University of Manchester(曼彻斯特大学) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究通过受控保留设置揭示大语言模型拒绝回答存在对称性破缺:答案释放具高度局部性,拒绝恢复需更广干预,拒绝并非简单对称开关,对安全审计具启示。
VARM-Bench:中文辱骂内容审核中可验证的结构化推理基准测试
机构 * NUAA(南京航空航天大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 针对中文辱骂内容审核缺乏可验证决策依据的问题,提出VARM-Bench基准,通过确定性协议评估模型,发现标签级性能可能掩盖记录错误,提供可审计的评估基准。