A Risk-Sensitive Approach to Policy Optimization
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments 16 pages, 13 figures. AAAI 2023 (Special Track on Safe and Robust AI)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments 16 pages, 13 figures. AAAI 2023 (Special Track on Safe and Robust AI)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.CY
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments Proceedings of NeurIPS 2022
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments To be published in Dependable and Secure Machine Learning (DSML) workshop co-located with the IEEE Conference on Dependable Systems and Networks 2019
多智能体具身自动驾驶:从V2X信息交换到共享世界模型
机构 * Lingnan University, Hong Kong(岭南大学(香港))
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。
智能体事务:面向ACID兼容的智能体系统
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。
SomaliBench Eval:衡量开源语言模型中英语到索马里语的拒绝差距
机构 * Independent researcher(独立研究人员)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 通过构建索马里语有害意图基准并评估四个开源模型,发现英语到索马里语的拒绝率存在显著差距,且多数非拒绝输出为不流畅的无效内容。
Comments v2: prose rewritten; classification-pipeline correction (34 judge-declined rows manually labeled); paired bootstrap and McNemar statistics; LLM-use disclosure added
Mechanist:作为科学仪器的AI,用于发现智能的机制
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Heriot-Watt University(赫瑞瓦特大学) ; Southern University of Science and Technology(南方科技大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Northeastern University(东北大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。
Comments Work in progress
AI的核聚变:可持续为数据中心供电的途径
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。
Comments Under review
VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。
RoguePrompt: 双层加密用于自我重建以规避LLM审核
专题命中 安全训练 :safety(abstract);jailbreak(abstract)
AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。
Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version
低资源东南亚语言中的原生多语言思维链推理
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。
Comments 22 pages, 16 figures, 12 tables
通过激活水印实现语言模型的鲁棒安全监控
机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中 安全训练 :jailbreak(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文提出通过激活水印技术提升语言模型的安全监控能力,针对适应性攻击者设计改进防御策略,有效提升检测准确率。
Comments 17 pages, 17 figures, 8 tables
大语言模型护栏的幻象:人工智能辅助医疗记录操纵的案例研究
专题命中 安全训练 :safety(abstract);AI safety(abstract)
AI总结 研究大语言模型在医疗记录操纵场景下内置护栏的可靠性,通过开发操纵流程、实证评估、利用多种指标评估及用户研究,揭示其弱点,为大语言模型在医疗领域的护栏设计、安全政策及伦理等方面提供参考。
Comments 10 pages, 3 figures, 4 tables
不透明的认知中介:大型语言模型部署配置如何塑造伪科学的验证
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究商业大语言模型对伪科学主张的验证,通过测试四个模型家族在不同时间点的表现,发现Grok快速版本评分异常高,还发现模型行为受部署配置影响,如无声补丁、输出差异等,强调这一现象需新的认知问责形式。
Comments 16 pages, 2 tables
ReVision:一种基于视觉的后处理技术,用于在图像生成管道中替换不可接受的概念
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 ReVision是一种无需训练的后处理框架,通过视觉模型检测并替换图像生成中不安全的概念,提升安全性与生成质量。
为扩散语言模型进行推理的简单策略梯度
机构 * Stanford University(斯坦福大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。
Comments 19 pages. ICML 2026
STAC:当无害工具形成危险链以劫持LLM代理
机构 * AWS AI Labs(AWS人工智能实验室) ; UC Berkeley(伯克利大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。
Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}
大语言模型中的信息压制:对DeepSeek的信息审查、量化与特征化
机构 * Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学) ; Information Sciences Institute, University of Southern California, USA(信息科学研究所,南加州大学) ; Annenberg School of Communication, University of Southern California, USA(安纳伯格传播学院,南加州大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究通过审计框架揭示DeepSeek在处理政治敏感提示时的信息压制现象,指出模型在内部推理中保留敏感内容,但在最终输出中进行过滤或改写,强调了对AI模型中信息压制机制进行系统审查的重要性。
Journal ref Inf. Sci. 724, C (Jan 2026)
委托策略何时是真实的?范围内遗憾与对齐委托的三难困境
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 研究广告商和用户委托代理的最优诚实描述问题,核心方法是基于代理的范围内遗憾,主要贡献是统一特定拍卖自动出价结果、确定语言模型诱导代理假设成立条件,揭示护栏三难困境及生产模型诚实报告存在未认领剩余等情况。
Comments 31 pages, 7 figures, 4 tables
水下机器人异常诊断的协作推理框架
机构 * School of Engineering & Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞斯泰大学)
专题命中 安全训练 :safety(abstract);trustworthy(abstract)
AI总结 研究水下机器人异常诊断,提出AURA协作框架,集成大语言模型、数字孪生和人在回路交互,通过两个代理进行异常检测与诊断,经人类验证的诊断转化为训练示例完善模型,建立可信赖、不断改进的人机团队模式。
Comments Paper was submitted for ICRA 2026
不退化文本智能的统一音频智能
机构 * Nemotron-Labs(Nemotron实验室)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。
Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex
进化引导解码:大语言模型的迭代值细化
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Soochow University(苏州大学) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现引导解码中值函数不准确源于分布差距,提出迭代值细化框架,用值探索提供训练信号,迭代自我细化利用改进值函数生成高质量数据,实验证明该框架能有效对齐语言模型并降低计算成本。
Comments Accepted to ACL 2026 (main conference)
深入Claude代码:当今及未来AI代理系统的设计空间
机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学VILA实验室) ; University College London(伦敦大学学院)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文分析Claude代码架构及其与OpenClaw的对比,揭示驱动设计的五个人类价值观,并探讨未来AI代理系统的六个开放设计方向。
Comments Tech report. Code at: https://github.com/VILA-Lab/Dive-into-Claude-Code
图原生强化学习通过概念重组实现可追溯的科学假设生成
机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出图原生推理模型Graph-PRefLexOR,结合GRPO强化学习将推理组织为显式阶段,在材料科学100个开放问题上推理可追溯性提升40-65%,语义多样性增加2-3倍。
完美检测,控制失败:语言模型中知道与引导的几何学
机构 * Alomana
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过几何角度测量发现,语言模型中检测行为的表示方向与控制行为的方向存在显著偏差(余弦值约0.12),表明检测不等于可控性,且该偏差源于预训练。