arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-12 至 2026-08-12 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2608.10513 2026-08-12 cs.CV cs.AI 新提交 89%

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap:通过图像字幕强化学习提升大型视觉语言模型(LVLM)的安全性

Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

专题命中 安全训练 :safety(title,abstract);DPO(abstract,abstract_cn);alignment(abstract);jailbreak(abstract)

AI总结 SafeCap是一种通过图像字幕强化学习提升LVLM安全性的框架,在多模态安全基准上安全得分提升3.7-19.0个百分点,且视觉效用相当或更优,性能优于安全SFT等方法。

Comments 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11146 2026-08-12 cs.CL 新提交 83%

The Illusion of Cross-Lingual Safety in Low-Resource Languages

低资源语言中跨语言安全的错觉

Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay, Maryam Ibrahim Mukhtar, Esmael Ahmed Abdu, Tassallah Abdullahi, Jessica Oparebea, Saminu Mohammad Aliyu, Idris Abdulmumin, Abubakar Juma Chilala, Nicholaus Dismas Ladislaus, Alfred Malengo Kondoro, Lemofouet Valdini Douglace, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 研究发现大型语言模型的跨语言安全迁移在四种非洲低资源语言中极为有限,现有多语言安全对齐仅停留在表面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10258 2026-08-12 cs.CL cs.AI 新提交 81%

TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

TAF-MED:声明自我治疗意图下大语言模型的多轮安全拒绝崩溃

Waleed Jamil, Raphael Schmitt

机构 * Independent Researcher(独立研究者) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心医学院普通实践研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出TAF-MED医疗安全基准,评估8个大语言模型的多轮医疗对话安全表现,发现多数模型会在后续对话中出现安全拒绝崩溃,自动评判工具与医生标注一致性较高,将公开基准支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10454 2026-08-12 eess.SY cs.SY 新提交 67%

Nuclear fusion for AI: A pathway to power data centers sustainably

AI的核聚变:可持续为数据中心供电的途径

Layla Araiinejad, Vineet Jagadeesan Nair

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10157 2026-08-12 cs.AI 新提交 57%

SBCO: Self-Supervised, Verifier-Grounded Harness Optimization For Planning Agents

SBCO:面向规划智能体的自监督、验证器驱动的工具链优化器

Vivek Kulkarni, Sudipta Paul, Aounon Kumar, Nicholas Tzou, Srinivas Chappidi

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本研究针对规划任务提出SBCO,一种自监督的验证器驱动工具链优化器,其性能优于或相当的定制基线,且计算成本仅为其1/4至1/5.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07935 2026-08-12 cs.LG 版本更新 57%

Adaptive Supervised Anchoring for On-Policy Self-Distillation

面向策略内自蒸馏的自适应监督锚定

Meilin Yang, Zixuan Ding, Jianhao Nie, Weite Zhang, Yuxin Zhang, Zhiming Shao, Li Yu, Zhe Fu

机构 * Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 针对策略内自蒸馏的 rollout 条件信号退化问题,提出分离监督路径并自适应调整锚定强度的框架,提升了任务获取能力并优化了可塑性-稳定性权衡。

Comments 9 pages, 4 figures, and 3 tables. Meilin Yang and Zixuan Ding contributed equally. Corresponding authors: Li Yu and Zhe Fu

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18401 2026-08-12 cs.CL 版本更新 57%

CAPO: Critic-Guided Action-Aligned Policy Optimization for Advancing LLM Agent Capabilities

StepPO: 面向智能体强化学习的步骤对齐策略优化

Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Chunli Liu, Shijin Wang, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 安全训练 :RLHF(abstract_cn);分类 cs.CL

AI总结 提出StepPO,一种步骤级策略优化方法,通过将智能体强化学习从token级MDP重构为步骤级MDP并引入步骤级信用分配,以解决现有算法在智能体决策粒度上的不匹配问题,在多跳问答等任务上优于多种RL算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 50%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 安全训练 :safety(abstract)

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏