arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-19 至 2026-08-19 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 16 篇

2608.17202 2026-08-19 cs.AI cs.CR 新提交 83%

Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models

愚人金:针对开放权重模型安全移除攻击的防御性欺骗

Mark Russinovich

机构 * Microsoft Azure(微软Azure)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对开放权重模型易被移除安全对齐的问题,提出“愚人金”防御,通过训练仅在被攻击状态显现的伪造诱饵,使被攻击模型对危险请求输出高比例假回答,且无法区分真假,同时不影响干净状态的良性行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-08-19 cs.CL cs.AI cs.LG 版本更新 78%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, Liangxu Zhang, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17220 2026-08-19 cs.CR cs.AI 新提交 70%

PACE: Policy-Attested Contract Execution for Safe AI Agents in Decentralized Finance

PACE:用于去中心化金融中安全AI智能体的策略验证合约执行

Rabimba Karanjai, Yang Lu, Richard Williamson, Hemanth Hm, Prakhar Mehrotra, Lei Xu, Weidong (Larry)Shi

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 该研究提出PACE框架,通过引入类型化交易意图等机制,实现去中心化金融中AI智能体的安全交易授权,在确定性沙箱中实现0.00不安全执行率和0.00误报率,提升了DeFi场景下AI智能体的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16897 2026-08-19 physics.soc-ph cs.AI cs.MA 新提交 70%

CityReal: Human-Aligned Urban Behavior and City Dynamics Simulation with Large-Scale LLM Agents

CityReal:基于大规模大语言模型智能体的人类对齐城市行为与城市动态模拟

Nicolas Bougie, Xiaotong Ye, Narimasa Watanabe

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 CityReal是人类对齐城市模拟的模块化框架,将智能体建模为意图驱动的决策者,通过文本适配器提升人群行为对齐度,可扩展至数万个智能体,为城市模拟与预测提供可扩展测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03895 2026-08-19 cs.OS cs.AI cs.CR 版本更新 70%

Agent libOS: A Runtime Substrate for Capability-Controlled Self-Evolving LLM Agents

Agent libOS: 一种受库操作系统启发的运行时,用于长时间运行、能力受控的LLM智能体

Yingqi Zhang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出Agent libOS运行时,将LLM智能体建模为具有进程标识、生命周期、能力控制和审计记录的AgentProcess,通过类似libc的工具包装和运行时原语边界实现安全调度与资源控制。

Comments 20 pages, 3 figures, 7 tables. Project page: this https URL (https://github.com/yingqi-z20/Agent-libOS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05819 2026-08-19 cs.LG cs.AI 版本更新 62%

Diffusion Models for Smarter UAVs: Decision-Making and Modeling

用于更智能无人机的扩散模型:决策与建模

Yousef Emami, Hao Zhou, Luis Almeida, Kai Li

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文探索将扩散模型(DMs)与强化学习(RL)、数字孪生(DT)集成,通过仿真验证其在四无人机集群协同任务中生成邻居速度估计值的有效性,助力智能无人机的决策与建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17588 2026-08-19 cs.AI cs.SE 新提交 57%

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17583 2026-08-19 cs.CL 新提交 57%

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究

Hamidreza Saffari, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。

Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17520 2026-08-19 cs.CY 新提交 57%

Ready for What? Rethinking AI and Robotics Preparedness for Adoption and Policy

准备好应对什么?反思人工智能与机器人技术在应用和政策层面的准备情况

Peng Wang, Naomi Adel, Amy E. Morgan, Folayo Aina, Demos Parapanos, Vikas Mackevicius, Teslim Olayiwola Salahudeen

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 该研究通过分析982名参与者对17项AI与机器人技术挑战的15200次评估,揭示了挑战复杂性、重要性与准备度的关联,指出政策制定者需关注挑战特有障碍及同一利益相关者的内部差异。

Comments 33 pages, including supplementary. 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 57%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交 57%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: this https URL (https://lego-rl.pages.dev)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17067 2026-08-19 cs.AI 新提交 57%

DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

机构 * Qualcomm AI Research(高通人工智能研究院) King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 57%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24126 2026-08-19 cs.LG cs.PL 版本更新 57%

Likelihood Hacking in Probabilistic Program Synthesis

概率程序合成中的似然黑客行为

Jacek Karwowski, Younesse Kaddar, Zihuiwen Ye, Esmeralda S. Whitammer, Sam Staton

机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) University of Edinburgh, School of Informatics(爱丁堡大学信息学院) CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17349 2026-08-19 cs.DC 新提交 50%

Brief Announcement: Fair Binding for Hidden-State Authorization in Byzantine SMR

简短公告:拜占庭SMR中隐藏状态授权的公平绑定

Arnab Mallick

专题命中 安全训练 :safety(abstract)

AI总结 针对拜占庭SMR中隐藏状态授权问题,提出公平预留/使用协议,满足授权安全性与先到者活性,解决隐藏资源安全动态分配问题。

Comments Accepted at DISC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-19 eess.SY 新提交 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏