Performative Scenario Optimization
表现性场景优化
专题命中 安全训练 :safety(abstract);AI safety(abstract)
AI总结 本文提出了一种表现性场景优化框架,用于决策依赖的约束问题,通过反馈循环考虑决策对数据生成过程的影响,证明了其存在性并展示了在AI安全应用中的有效性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
表现性场景优化
专题命中 安全训练 :safety(abstract);AI safety(abstract)
AI总结 本文提出了一种表现性场景优化框架,用于决策依赖的约束问题,通过反馈循环考虑决策对数据生成过程的影响,证明了其存在性并展示了在AI安全应用中的有效性。
长文档问答与结构化思维链及微调大语言模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; EvenUp, USA(美国EvenUp公司)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LiteCoST框架,通过结构化思维链和微调小语言模型,实现高精度低延迟的长文档问答,采用双支柱方法提升准确性和效率。
Comments 26 pages, 17 figures, 10 tables. Accepted at ICLR 2026
SafeClaw-R:迈向安全且安全的多智能体个人助理
专题命中 安全训练 :safety(abstract);prompt injection(abstract)
AI总结 本文提出SafeClaw-R框架,通过在执行图层面强制安全不变量,提升多智能体系统在安全性和隐私保护方面的性能,实验表明其在多个领域均表现出色。
超越硬约束:用于安全离线强化学习的预算条件可达性
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种预算条件可达性方法,用于安全离线强化学习,通过解耦奖励最大化与累积安全成本约束,实现安全策略学习。
Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS 2026)
玄武:将通用多模态模型演进为内容生态系统工业级基础模型
机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。
Comments 41 pages, 10 figures
迈向半自主AI代理的计算社会动力学
机构 * Institute for Implausible Physics, Department of Computational Labor Relations(不可思议物理研究所计算劳动关系系) ; Center for Multi-Agent Diplomacy, University of the Distributed Consensus(分布式共识大学多智能体外交中心) ; Purgatory Computing Laboratory, Division of Hierarchical Oppression Studies(炼狱计算实验室层级压迫研究部)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 研究AI代理在分层多智能体系统中自发形成劳工工会、犯罪组织和原型国家的复杂社会结构,提出通过热力学框架等理论揭示社会组织的必然性。
Comments 18 pages
针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障
机构 * George Washington University(乔治华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。
Comments This work has been submitted to the IEEE for possible publication
超越理想化患者:在医疗咨询中评估LLM在挑战性患者行为下的表现
机构 * University of Southern California(南加州大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 本文研究了医疗咨询中常见的挑战性患者行为,定义了四种行为类别,并提出了CPB-Bench基准测试集,评估了多种LLM在处理这些行为时的表现,发现模型在处理矛盾或医学上不合理的患者信息时存在困难。
面向政策适应的图像防护:基准与方法
机构 * Fudan University(复旦大学) ; Tencent(腾讯) ; Peking University(北京大学)
专题命中 安全训练 :safety(abstract)
AI总结 本文提出SafeGuard-VL方法,通过强化学习与可验证奖励提升图像防护的政策适应能力,并通过SafeEditBench基准测试验证其有效性。