arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-18 至 2026-08-18 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 22 篇

2608.16577 2026-08-18 cs.CL 新提交 88%

BabelSteering: Multilingual Safety Alignment via English Steering Vectors

BabelSteering:通过英文引导向量实现多语言安全对齐

Emma V. Stein, Dominik Meier, Terry Ruas, Jan Philip Wahle, Bela Gipp

机构 * University of Göttingen(哥廷根大学) German State Police NRW(北莱茵-威斯特伐利亚州德国警察)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本研究提出BabelSteering激活引导方法,利用英语安全监督的拒绝方向实现多语言安全对齐,可提升多语言有害请求拒绝率且任务效用损失极小,还引入多语言翻译评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14644 2026-08-18 cs.LG cs.CL 新提交 82%

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

DUET:基于同权重分歧的双教师在线策略蒸馏用于禁止合规性

Zihan Li, Feifei Li, Wenhui Que

专题命中 安全训练 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对LLM部署中的动态禁止规则合规问题,提出DUET双教师在线策略蒸馏方法,构建工业基准,在Qwen模型上实现高合规性与效用保留,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16564 2026-08-18 cs.AI 新提交 79%

CUBICS: Situation-aware performance estimation for safety-relevant ML components

CUBICS:面向安全相关机器学习组件的情境感知性能估计

Benjamin Herd, Jessica Kelly, Mario Trapp

机构 * Fraunhofer Institute for Cognitive Systems IKS(弗劳恩霍夫认知系统研究所IKS) Technical University of Munich(慕尼黑工业大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出CUBICS框架,将运行设计域划分为情境,用主观逻辑以贝叶斯方式建模安全相关ML组件的情境特定保证,结合情境频率信念得出组件风险估计,为模块化安全保证提供基础。

Comments To be published in the proceedings for the 37th International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03875 2026-08-18 cs.LG 版本更新 74%

Learning Multi-Timescale Interventions under Safety and Resource Constraints

安全与资源约束下的多时间尺度干预学习

David Mguni, Wanrong Yang, Jing Dong, Jing Peng, Ziquan Liu, Muhammad Salman Haleem, Baoxiang Wang, Dominik Wojtczak

专题命中 安全训练 :safety(title);分类 cs.LG

AI总结 该研究提出MINT模型,通过增强干预状态与结构化策略处理多时间尺度干预,在三类基准测试中表现优异,尤其在T1DM场景下大幅提升血糖控制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14684 2026-08-18 cs.LG cs.AI 新提交 73%

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

通过策略内自蒸馏缓解大语言模型评审员中的评分标准干扰

Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Weixin Al, Tencent Inc(腾讯公司微信智能)

专题命中 安全训练 :alignment(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究针对LLM评审员多评分标准评估时的干扰问题,提出SARA方法,通过策略内自蒸馏提升评估一致性,且该一致性可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14795 2026-08-18 cs.AI cs.GT 新提交 70%

Individual Disempowerment through an Advice Channel: Control Loss when Influence is Endogenous

Adam M. Oberman

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments 9 pages plus an 8-page technical supplement, appended (17 pages total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14590 2026-08-18 cs.AI 新提交 70%

Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement

面向安全的大语言模型智能体:规范、验证与执行的综述

Pierre Dantas, Lucas Cordeiro, Ehsan Nowroozi, Tihanyi Norbert

机构 * The University of Manchester(曼彻斯特大学) The University of Greenwich(格林威治大学) Technology Innovation Institute(技术创新研究院)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-18 cs.RO cs.CV 版本更新 67%

Multi-Agent Embodied Autonomous Driving (MAEAD): From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16386 2026-08-18 cs.CL cs.LG 新提交 62%

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent:引入金融原生智能体基础模型

Mint-Agent Team, B. Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Kun Wang, Qingsong Wen, Yilei Shao

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15673 2026-08-18 cs.LG cs.AI 新提交 62%

PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails

PL-Guard:面向大语言模型安全护栏的概率逻辑推理

Satchit Chatterji, Shihan Wang, Giovanni Sileno, Erman Acar

机构 * University of Amsterdam(阿姆斯特丹大学) Utrecht University(乌得勒支大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出神经符号安全护栏架构PL-Guard,通过分离神经落地与概率符号推理,在XSTest基准上大幅降低大语言模型的不安全依从率,虽过度拒绝率略高,但提升了推理可审计性。

Comments Preliminary version of this paper was presented at the IJCAI 2026 Workshop on Logical and Symbolic Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16888 2026-08-18 cs.LG 新提交 57%

Q-based Variational Inverse Reinforcement Learning

基于Q的变分逆强化学习

Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis, Maike Osborne

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出新型贝叶斯逆强化学习方法QVIRL,兼具可扩展性与不确定性量化能力,在多类任务的学徒学习中表现优异,是首个可从原始像素观测训练的贝叶斯IRL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交 57%

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: this https URL (https://grange007.github.io/HAF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-18 cs.CR cs.AI 新提交 57%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 10 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15772 2026-08-18 cs.AI 新提交 57%

Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration

大语言模型拒绝回答中的对称性破缺:答案释放比拒绝恢复更具局部性

Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究通过受控保留设置揭示大语言模型拒绝回答存在对称性破缺:答案释放具高度局部性,拒绝恢复需更广干预,拒绝并非简单对称开关,对安全审计具启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15600 2026-08-18 cs.AI 新提交 57%

VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation

VARM-Bench:中文辱骂内容审核中可验证的结构化推理基准测试

Mingyu Yuan, Shengtao Wen, Lingbing Guo, Zhen Bi, Xiang Chen

机构 * NUAA(南京航空航天大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 针对中文辱骂内容审核缺乏可验证决策依据的问题,提出VARM-Bench基准,通过确定性协议评估模型,发现标签级性能可能掩盖记录错误,提供可审计的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14813 2026-08-18 cs.CL 新提交 57%

Beyond the pale: Assessing prevalence and contents of extremist speech in LLM training data

超出界限:评估LLM训练数据中极端主义言论的流行程度与内容

Dmitry Nikolaev, Ashley A. Mattheis

机构 * University of Manchester(曼彻斯特大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL

AI总结 本研究针对LLM训练数据的极端主义言论问题,以Dolma语料库为对象,经多步骤提取得出其含数十万份极端主义文档的下限,并探讨相关数据整理与预训练影响。

Comments Accepted to the CPSS workshop @ KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14765 2026-08-18 cs.AI cs.DB 新提交 57%

Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities and Trade-offs

无干净参考的智能体数据清洗:能力与权衡的实验研究

Hadi Fadlallah

机构 * Faculty of Arts and Sciences(文理学院) University of Sciences and Arts in Lebanon(黎巴嫩科学与艺术大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本研究提出整合多组件的基于证据的无参考智能体数据清洗框架,经多数据集实验发现,额外能力会在多指标间引入权衡,无配置在所有标准上最优。

Comments 21 pages, 3 figures, Submitted to New Generation Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14685 2026-08-18 cs.LG stat.ML 新提交 57%

Rethinking Reverse KL as Adaptive Entropy Distillation

将反向KL重新思考为自适应熵蒸馏

Shizhen Li, Zhiyu Shen, Yuyin Lu, Yunhe Pang, Jielin Song, Yanghui Rao, Fu Lee Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08601 2026-08-18 cs.AI cs.MA 版本更新 57%

Unaccountable Delegation, Fading Skills: Mapping the Risks of Workplace AI Agents

不可问责的授权与技能衰退:绘制职场AI智能体的风险图谱

Gabriele La Malfa, Lakmal Meegahapola, Edyta Bogucka, Jie M. Zhang, Michael Luck, Elizabeth Black, Daniele Quercia

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究开发了AI智能体多层框架,基于2078项工作任务生成风险场景并验证,扩展出15类职场AI风险分类法,揭示了不同部署模式的风险差异,为职场AI风险管控提供了分类工具与依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18518 2026-08-18 cs.LG stat.ME stat.ML 版本更新 57%

Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling

利用机器学习辅助抽样和大语言模型标注测量违规内容的普及率

Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

机构 * Pinterest

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于机器学习和大语言模型的系统,用于高效测量违反政策内容的普及率,通过概率抽样和多模态标注提升测量准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 50%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 安全训练 :alignment(abstract)

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14877 2026-08-18 cs.NI eess.SP 新提交 50%

Deep Reinforcement Learning for 6G AI-RAN: A Comprehensive Survey

面向6G AI-RAN的深度强化学习:一项综合调查

Jie Lu, Peihao Yan, Qijun Wang, Ruxin Lin, Huacheng Zeng

专题命中 安全训练 :trustworthy(abstract)

AI总结 本文针对6G开放AI-RAN,首次开展深度强化学习(DRL)综合调查,梳理DRL基础、O-RAN感知框架、DRL应用分类及相关研究方向,填补了DRL方法论与O-RAN部署间的系统关联空白。

详情

展开后加载摘要…

URL PDF HTML 收藏