How Effective Is Constitutional AI in Small LLMs? A Study on DeepSeek-R1 and Its Peers
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全训练 :safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Website: https://www.tamper-resistant-safeguards.com
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2024
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 23 pages; 1 figure and 10 supplementary figures; Accepted (spotlight presentation) at NeurIPS 2024 SoLaR workshop
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 15 pages
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2024
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 30 pages, 7 figures, NeurIPS camera-ready
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
大语言模型人格测量中的持久不稳定性:规模、推理和对话历史的影响
专题命中 安全训练 :alignment(abstract,comments);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型在人格测量中存在持续不稳定性,规模扩大、推理和对话历史等干预措施未能有效提升稳定性。
Comments Accepted at AAAI 2026, Track on AI Alignment
安全与资源约束下的多时间尺度干预学习
专题命中 安全训练 :safety(title);分类 cs.LG
AI总结 该研究提出MINT模型,通过增强干预状态与结构化策略处理多时间尺度干预,在三类基准测试中表现优异,尤其在T1DM场景下大幅提升血糖控制效果。
你会投票给谁?大型语言模型(LLM)的政治立场审计:意大利案例研究
机构 * Revelis s.r.l.(雷维利斯有限责任公司)
专题命中 安全训练 :alignment(title);分类 cs.CL
AI总结 本文以意大利为案例,提出系统可复现的LLM政治立场审计框架,分析多模型对意政党及领导人的评价行为、差异等,探究模型政治偏好相关问题。
X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中
机构 * Tencent Hunyuan(腾讯混元) ; Zhejiang University(浙江大学)
专题命中 安全训练 :alignment(title);分类 cs.LG
AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。
评估两用生物学环境中的校准拒绝和安全有用性
机构 * American Wetware(美国湿科公司) ; LatchBio
专题命中 安全训练 :alignment(title);分类 cs.AI
AI总结 研究针对人工智能用于生命科学工作流可能导致滥用的问题,提出BioSecBench-Refusal基准,将常规与红队任务配对,测试16种配置下模型拒绝率,发现多数配置对常规工作拒绝率高,有推理空间的模型能识别更多威胁,为开发者提供校准工具。
MGUP:一种用于随机优化的动量-梯度对齐更新策略
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Pengcheng Laboratory(鹏城实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 安全训练 :alignment(title);分类 cs.LG
AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。
Comments Published in NeurIPS 2025
FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐
机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) ; Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)
专题命中 安全训练 :alignment(title);分类 cs.AI
AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。
Comments 26 pages, 7 figures, 25 tables
Safe-FedLLM:深入探究联邦大语言模型的安全性
机构 * Hainan University(海南大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 安全训练 :safety(title);分类 cs.AI
AI总结 本文提出Safe-FedLLM,一种基于探针的防御框架,通过三级防御(步骤级、客户端级和阴影级)利用轻量级分类器区分恶意与良性LoRA更新,以增强联邦大语言模型对恶意客户端的鲁棒性。
教师-学生表征对齐用于强化学习驱动的模仿学习
机构 * Department of Computer Science(计算机科学系) ; Örebro University(奥雷布罗大学)
专题命中 安全训练 :alignment(title);分类 cs.LG
AI总结 提出一种通过自监督对比学习构建共享嵌入空间的方法,以减小教师和学生策略之间的不可模仿差距,从而提升学生策略性能。
Comments 6 pages, 5 figures. Accepted as an oral presentation at the RL4IL Workshop at ICRA 2026
行为线索推理:通过监督提高推理的效率和安全性
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Brigham Young University
专题命中 安全训练 :safety(title);分类 cs.AI
AI总结 该研究提出行为线索推理方法,通过引入行为线索来增强大语言模型的可控性和可监控性,从而在复杂数学问题解决中减少50%的无效推理token,并在安全行动恢复方面将成功率从46%提升至96%。
TEMPO: 通过模式分离策略优化实现可信大语言模型回测的时序执行
机构 * Department of Statistic and Data Science(统计与数据科学系)
专题命中 安全训练 :trustworthy(title);分类 cs.LG
AI总结 本文提出TEMPO方法,通过模式分离策略优化,解决大语言模型回测中因泄露后截止日期知识导致的评估不准确问题,核心贡献是引入双模式奖励和基于GRPO的训练流程,有效减少知识泄露并提升任务性能。
Comments 9 pages in main context
教LLM变得有说服力:来自异质奖励的强化学习后训练政策优化
机构 * Fliggy Alibaba(飞猪阿里)
专题命中 安全训练 :alignment(title);分类 cs.CL
AI总结 本文提出REPO方法,通过结合偏好训练奖励模型、LLM作为判断者和规则奖励函数,提升在线旅行社的价格谈判对话质量,实验显示在对话评分、优秀回应比例和坏案例修复率上均有显著提升。
Comments accepted by ACL 2026 indusry track
从AVA学习:为政策与发展研究构建的可信生成式AI的早期经验
机构 * University of Oxford(牛津大学) ; Nouswise, Inc.(Nouswise公司)
专题命中 安全训练 :trustworthy(title);分类 cs.AI
AI总结 AVA通过多代理流程为政策研究提供证据合成,通过引用可验证性和合理回避机制实现认知谦逊,实验证明其能节省用户时间,为专用AI设计提供指导。
Comments Accepted at ACM CHI'26
Elign:从基础机器学习力场中等效扩散模型对齐
机构 * Department of Computer Science, Yale University, New Haven, USA(计算机科学系,耶鲁大学,新 Haven,USA) ; Program in Computational Biology and Biomedical Informatics, Yale University, New Haven, USA(计算生物学与生物医学信息学项目,耶鲁大学,新 Haven,USA) ; IQuestLab
专题命中 安全训练 :alignment(title);分类 cs.LG
AI总结 Elign通过结合基础机器学习力场和强化学习优化,实现了等效扩散模型的对齐,提升分子构象生成的准确性和效率。
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, China(人工智能教育部重点实验室、人工智能研究院、上海交通大学) ; Department of Computer Science, University of Illinois Chicago, USA(计算机科学系、伊利诺伊大学芝加哥分校)
专题命中 安全训练 :trustworthy(title);分类 cs.LG
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UC Berkeley(伯克利大学)
专题命中 安全训练 :alignment(title);分类 cs.LG
专题命中 安全训练 :safety(title);分类 cs.CL
Comments 8 pages, 4 figures
专题命中 安全训练 :alignment(title);分类 cs.LG
Comments 10 pages, 3 figures, extended version of our 2024 American Control Conference publication
Journal ref Proceedings of the 2024 American Control Conference (ACC), 2024