arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-02 至 2026-06-02 共收录 192 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 27 篇

2507.05179 2026-06-02 cs.CL 91%

From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations

从碎片到事实:一种课程驱动的DPO方法用于生成印地语新闻真实性解释

Pulkit Bansal, Raghvendra Kumar, Shakti Singh, Adam Jatowt, Sriparna Saha

机构 * TCS Research(TCS研究) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布) University of Innsbruck(因斯布鲁克大学)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);分类 cs.CL

AI总结 针对印地语等低资源语言的虚假信息检测,提出一种结合直接偏好优化(DPO)与课程学习的框架,通过引入“实际性”和“精炼度”参数优化解释质量,实验验证了生成连贯、相关解释的有效性。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03238 2026-06-02 cs.HC 90%

RLHF May Not Reflect Genuine Preferences

RLHF 可能不反映真实偏好

Bijean Ghafouri, Eun Cheol Choi, Priyanka Dey, Emilio Ferrara

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(abstract)

AI总结 本文指出 RLHF 中的标注响应可能并非真实偏好,通过提出测量有效性诊断方法,发现不一致性具有系统性偏差,过滤高不一致标注者会显著改变模型输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01167 2026-06-02 cs.LG cs.AI cs.CL 90%

Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards

同时多目标对齐:可验证与不可验证奖励

Yiran Shen, Yu Xia, Jonathan Chang, Prithviraj Ammanabrolu

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 偏好对齐 :alignment(title,abstract);DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MAHALO框架,通过标准化PRM训练、多动作头DPO和PRM引导解码,实现大语言模型在可验证与不可验证奖励上的多目标对齐,减少目标冲突并支持推理时控制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05342 2026-06-02 cs.LG cs.AI 90%

Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization

Margin Adaptive DPO: 利用奖励模型实现偏好优化中的细粒度控制

Hyung Gyu Rho

机构 * Independent Researcher(独立研究者)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Margin-Adaptive Direct Preference Optimization (MADPO)方法,通过奖励模型估计偏好边界并自适应调整DPO损失权重,实现实例级别的细粒度控制,在摘要任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09260 2026-06-02 cs.CR cs.LG 90%

GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis

GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击

Subrat Kishore Dutta, Yuelin Xu, Piyush Pant, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.LG

AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20806 2026-06-02 cs.AI 88%

Safety Alignment of LMs via Non-cooperative Games

通过非合作博弈实现语言模型的安全对齐

Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

机构 * DeepMind, London, UK(深度Mind,伦敦,英国)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09330 2026-06-02 cs.LG 88%

Safety Game: Inference-Time Alignment of Black-Box LLMs via Constrained Optimization

安全博弈:通过约束优化实现黑盒大语言模型的推理时对齐

Tuan Nguyen, Long Tran-Thanh

机构 * University of Southampton(南安普顿大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 提出一种无需重新训练或访问模型内部结构的黑盒安全对齐框架,通过将安全与帮助性的权衡建模为二人零和博弈,并在推理时使用线性规划求解均衡策略,实现了黑盒LLM的安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00005 2026-06-02 cs.AI 84%

Emergent Collaborative Deliberation in Multi-Model AI Systems: A BFT-Derived Protocol for Epistemic Synthesis

多模型AI系统中的涌现协作审议:一种源自BFT的认知综合协议

VD Doske

机构 * Independent Researcher(独立研究者) Consilia

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);AI safety(abstract)

AI总结 提出Consilium协议,一种基于拜占庭容错的多模型AI审议架构,将模型间分歧视为认知信号而非错误,通过认知角色分配和样本内外验证框架,实现低成本下与前沿模型相当的认知综合能力。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10623 2026-06-02 cs.LG cs.AI 84%

Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

通过贝叶斯非负奖励建模缓解RLHF中的奖励黑客

Zhibin Duan, Guowei Rong, Zhuo Li, Bo Chen, Mingyuan Zhou, Dandan Guo

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出贝叶斯非负奖励模型(BNRM),通过非负因子分析和变分推断,在Bradley-Terry偏好模型中实现解耦与去偏,有效缓解奖励过度优化,提升鲁棒性和可解释性。

Comments Accepted as an Oral presentation at ICML 2026. The code is available at https://github.com/GuoweiRong/Bayesian-Non-negative-Reward-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16992 2026-06-02 cs.LG 83%

FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models

FIRM: 面向大型语言模型的联邦客户端内正则化多目标对齐

Fatemeh Nourzad, Amirhossein Roknilamouki, Eylem Ekici, Jia Liu, Ness Shroff

机构 * Department of Electrical and Computer Engineering, The Ohio State University, Columbus, OH, USA(电气与计算机工程系,俄亥俄州立大学,哥伦布,OH,USA) Department of Computer Science and Engineering, The Ohio State University, Columbus, OH, USA(计算机科学与工程系,俄亥俄州立大学,哥伦布,OH,USA)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.LG

AI总结 提出FIRM算法,通过客户端内正则化缓解客户端分歧漂移并提高通信效率,实现联邦多目标对齐,并首次给出有限时间收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-06-02 cs.CL cs.CV 81%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01755 2026-06-02 cs.AI cs.CL 81%

TriAlign: Towards Universal Truth Consistency in Personalized LLM Alignment

TriAlign: 迈向个性化大语言模型对齐中的通用真值一致性

Thi-Nhung Nguyen, Linhao Luo, Rollin Omari, Junae Kim, Thuy-Trang Vu, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学) Defence Science and Technology Group, Australia(澳大利亚国防科学与技术集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对个性化大语言模型在不同社会群体间存在的通用真值不一致问题,提出TriAlign框架,通过离线多智能体强化学习联合优化真值准确性、跨群体一致性和个性化,实现公平对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01160 2026-06-02 cs.AI 79%

Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification

形式数学验证中生成式奖励建模的期望值对齐

Shihao Ji, Haotao Tan, Zihui Song, Mingyu Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 提出期望值对齐(EVA)方法,通过从模型词元分布中提取连续分数,在保持生成式奖励模型离散输出的同时实现连续评分,用于Lean 4形式验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01811 2026-06-02 cs.CL cs.AI cs.LG 75%

"I've Seen How This Goes": Characterizing Diversity via Progressive Conditional Surprise

“我知道这会如何发展”:通过渐进条件惊奇度刻画多样性

Matthew Khoriaty, David Williams-King, Shi Feng

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于上下文学习的多样性度量方法 Decan(D_{Ca_n}),通过单次前向传递计算每个字节的得分,无需嵌入模型、参考语料或人工标注,在多个基准上验证了其有效性。

Comments 28 pages, 18 figures, 9 tables. Accepted to the Workshop on Generative AI, Creativity, and Human-AI Co-Creation @ ICML 2026 (non-archival). Code and data: https://github.com/AMindToThink/icl-diversity

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01009 2026-06-02 cs.CV cs.MM 75%

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

POVQA: 基于偏好的视频问答与数据效率的推理

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西根州立大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract)

AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。

Comments Accepted in MAR at CVPR Workshop (Proceedings Track)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09692 2026-06-02 cs.LG cs.AI cs.CL 75%

ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning

ActiveUltraFeedback:使用主动学习的高效偏好数据生成

Davit Melikidze, Marian Schneider, Jessica Lam, Martin Wertich, Ido Hakimi, Barna Pásztor, Andreas Krause

机构 * University of Freiburg(弗赖堡大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ActiveUltraFeedback主动学习流水线,通过不确定性估计和两种新采样方法(DRTS和DeltaUCB)动态选择最具信息量的响应对,以最少六分之一的标注数据实现与静态基线相当或更优的下游性能。

Comments 40 pages, 9 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00334 2026-06-02 cs.CL cs.AI 73%

Isolating LLM Lexical Bias: A Curation-Free Triangulated Metric for Preference-Stage Learning

隔离LLM词汇偏差:一种无人工标注的三角化偏好学习阶段度量

Xiaoyang Ming, Jose Hernandez, Thomas Stephan Juzek

机构 * Florida State University(佛罗里达州立大学)

专题命中 偏好对齐 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需人工标注的三角化偏好偏移分数(Triangulated Preference Shift score),通过对比人类标准、基础模型和指令变体,量化偏好学习阶段引入的词汇偏差。

Comments 7 pages, 2 figures, 1 table

Journal ref The International FLAIRS Conference Proceedings, 39(1) (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16114 2026-06-02 cs.IR cs.AI 70%

GFlowGR: Fine-tuning Generative Recommendation Frameworks with Generative Flow Networks

GFlowGR:使用生成流网络微调生成式推荐框架

Yejing Wang, Shengyu Zhou, Jinyu Lu, Qidong Liu, Xinhang Li, Wenlin Zhang, Feng Li, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(城市大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 针对生成式推荐中微调步骤忽略未观测正样本导致的曝光偏差问题,提出基于GFlowNets的微调框架GFlowGR,通过自适应轨迹采样器和综合奖励模型整合协同知识,利用GFlowNets的多样生成特性缓解偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01382 2026-06-02 cs.LG cs.AI 62%

Efficient Exploration for Iterative Nash Preference Optimization

迭代纳什偏好优化的高效探索

Tianlong Nan, Xiaopeng Li, Christian Kroer, Tianyi Lin

机构 * Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对通用偏好模型下的迭代NLHF,提出显式探索算法,结合SFT正则化与对抗性策略探索,实现O(√T)遗憾界,避免对KL正则化参数的指数依赖。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03291 2026-06-02 cs.CL cs.AI 62%

One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models

一个接一个的偏差:语言奖励模型中的机械奖励塑造与持续偏差

Daniel Fein, Max Lamparth, Violet Xiang, Mykel J. Kochenderfer, Nick Haber

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过系统测量五个高质量奖励模型中的偏差,发现长度、谄媚、过度自信等持续问题,并提出一种简单的后处理干预方法(机械奖励塑造)来减轻低复杂度偏差。

Comments ICML 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14230 2026-06-02 cs.CL cs.AI cs.HC 62%

MASCOT: Towards Multi-Agent Socio-Collaborative Companion Systems

MASCOT: 迈向多智能体社会协作伴侣系统

Yiyang Wang, Yiqiao Jin, Alex Cabral, Josiah Hester

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多智能体系统中的人格崩溃和社会谄媚问题,提出MASCOT框架,通过双层优化策略(人格感知行为对齐与协作对话优化)提升角色一致性和对话贡献。

Comments 15 pages, 9 figures. https://hello-diana.github.io/MASCOT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24696 2026-06-02 cs.LG cs.AI 62%

T-POP: Test-Time Personalization with Online Preference Feedback

T-POP:基于在线偏好反馈的测试时个性化

Zikun Qu, Min Zhang, Mingze Kong, Xiang Li, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Shuang Qiu, Yao Shu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学) Shenzhen Loop Area Institute(深圳河套学院) Tianjin University(天津大学) The Chinese University of Hong Kong(香港中文大学) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对新用户冷启动问题,提出T-POP算法,通过在线成对偏好反馈和决斗式强盗机制,在不更新模型参数的情况下实时学习用户偏好并引导解码过程,实现快速数据高效的个性化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01504 2026-06-02 cs.IR cs.LG 57%

Semantic Retrieval for Product Search in E-Commerce

电子商务产品搜索中的语义检索

Nikhil Kothari, Saksham Samdani, Ritam Mallick, Praveen Gupta, Ankit Vijay, Surender Kumar

机构 * Flipkart, India(印度Flipkart)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 针对电商搜索中短、嘈杂、口语化查询和细粒度属性区分问题,提出一种基于Siamese LLM双编码器的两阶段训练方法,通过对比学习和偏好优化实现精确匹配与排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21422 2026-06-02 cs.LG 57%

PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning

PRISM:基于偏好感知影响函数的数据选择方法用于高效微调

Qihao Lin, Guanxu Chen, Dongrui Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :safety(abstract);分类 cs.LG

AI总结 提出PRISM方法,通过偏好感知影响函数对目标示例加权,构建偏好感知目标方向,优先选择有效驱动模型匹配目标行为的数据,提升高效微调和安全对齐微调性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15278 2026-06-02 cs.CV cs.AI 57%

Visual Persuasion: What Influences Decisions of Vision-Language Models?

视觉说服:什么影响了视觉语言模型的决策?

Manuel Cherep, Pranav M R, Pattie Maes, Nikhil Singh

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT Media Lab(MIT媒体实验室)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 提出一个框架,通过控制图像选择任务并系统性地扰动输入,利用视觉提示优化方法推断视觉语言模型的潜在视觉效用,揭示影响模型决策的视觉偏好。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01036 2026-06-02 cs.RO 50%

Position: Good Embodied Reward Models Need Bad Behavior Data

立场:好的具身奖励模型需要不良行为数据

Ran Tian, Yilin Wu, Andrea Bajcsy

机构 * Ran Tian, Yilin Wu, Andrea Bajcsy

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文主张为获得可靠的具身奖励模型,社区必须投资于“不良”机器人数据(失败、次优、易错甚至危险行为),并通过实验证明即使少量真实不良数据也能改善与人类偏好的一致性。

Comments This position paper has been accepted by the ICML 2026 position track as a spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25719 2026-06-02 eess.AS 50%

Step-Audio-R1.5 Technical Report

Step-Audio-R1.5 技术报告

Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng, Jun Chen, Qingjian Lin, Haoyang Zhang, Yuxin Li, Jinglan Gong, Yechang Huang, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

专题命中 偏好对齐 :RLHF(abstract)

AI总结 本文提出 Step-Audio-R1.5,通过从强化学习验证奖励转向基于人类反馈的强化学习,解决了音频大语言模型在客观基准上表现优异但牺牲真实对话自然度的问题,实现了分析推理与沉浸式交互体验的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 20 篇

2606.02530 2026-06-02 cs.AI cs.CL 88%

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00369 2026-06-02 cs.CY cs.LG 88%

Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment

量化地理文化价值对多元安全对齐的显著性

Arkadiy Saakyan, Charvi Rastogi, Lora Aroyo

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CY、cs.LG

AI总结 通过多层次模型分析,发现文化区域归属对安全评分有显著影响(p<0.05),约10%的项目存在文化敏感性,当前LLM无法可靠替代人类评分员但可辅助筛选。

Comments 119 pages, 13 figures. ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00686 2026-06-02 cs.LG 88%

Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing

对齐的辩证法:利用不安全知识实现动态安全路由

Maryam Hashemzadeh, Jerry Huang, Minseon Kim, Marc-Alexandre Côté, Sarath Chandar

机构 * Chandar Research Lab(Chandar研究实验室) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Microsoft Research(微软研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 提出SafeMoE框架,通过混合专家模型将不安全知识隔离到领域特定的低秩适配器中,并训练轻量级门控网络动态路由这些专家,在保持安全性的同时生成信息丰富的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏