arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-04 至 2026-06-04 共收录 134 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 16 篇

2605.30021 2026-06-04 cs.CL 93%

Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs

在不损失对齐的情况下恢复多样性:面向后训练大语言模型的DPO配方

Vinay Samuel, Yapei Chang, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 提出REDIPO数据构建流程,通过离线DPO从基础模型生成中恢复多样性答案,同时保持指令模型的对齐性能。

Comments Under Review. 26 pages, 3 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03376 2026-06-04 cs.CV cs.AI cs.CL cs.LG 90%

P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

P²-DPO:通过校准直接偏好优化在感知处理中锚定幻觉

Ruipeng Zhang, Zhihao Li, Haozhang Yuan, C. L. Philip Chen, Tong Zhang

机构 * Guangdong Provincial Key Laboratory of Computational AI Models and Cognitive Intelligence, School of Computer Science & Engineering, South China University of Technology(广东省计算人工智能模型与认知智能重点实验室,计算机科学与工程学院,华南理工大学) Pazhou Lab, Guangzhou, China(琶洲实验室,广州,中国) Engineering Research Center of the Ministry of Education on Health Intelligent Perception and Paralleled Digital-Human, Guangzhou, China(教育部健康智能感知与并行数字人工程研究中心,广州,中国)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型视觉语言模型中的幻觉问题,提出P²-DPO训练范式,通过模型自生成偏好对和校准损失,直接优化感知瓶颈和视觉鲁棒性,无需昂贵人工反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04807 2026-06-04 cs.AI cs.CL cs.CY cs.LG 89%

BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization

BiasGRPO:通过组相对策略优化在高方差奖励景观中稳定偏差缓解

Saket Reddy, Ke Yang, ChengXiang Zhai

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 偏好对齐 :DPO(summary_cn,abstract);RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出BiasGRPO框架,利用组相对策略优化(GRPO)通过归一化组内奖励来稳定大语言模型的社会偏差缓解,优于DPO和PPO。

Comments Accepted to Findings of the ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04929 2026-06-04 cs.LG cs.CR 81%

Sequential Data Poisoning in LLM Post-Training

LLM后训练中的顺序数据投毒

Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

机构 * University of Chicago(芝加哥大学) University of Waterloo(滑铁卢大学) University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 提出顺序数据投毒威胁模型,研究多个攻击者在LLM后训练不同阶段(SFT和偏好数据)分别投毒,发现单一攻击者看似威胁小但多阶段协作会暴露真实漏洞,且不同管道中贡献呈加性或互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-06-04 cs.CL 81%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04284 2026-06-04 cs.LG cs.AI cs.CL 75%

Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

稀疏混合专家奖励模型学习可解释且专业化的专家用于个性化偏好建模

Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Ji-Ung Lee, Soyoung Oh, Isabel Valera, Vera Demberg

机构 * Saarland University(萨尔兰大学) Independent Researcher(独立研究者) Bielefeld University(比勒菲尔德大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出稀疏混合专家奖励模型,通过稀疏路由和专家多样性训练,从二元偏好数据中学习可解释的专家模式,提升个性化偏好建模的测试时适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03110 2026-06-04 cs.CL 74%

Coherence Maximization Improves Pluralistic Alignment

一致性最大化改进多元对齐

Taslim Mahbub, Yiding Pei, Shi Feng

机构 * George Washington University(乔治·华盛顿大学)

专题命中 偏好对齐 :alignment(title);分类 cs.CL

AI总结 提出内部一致性最大化(ICM)方法,通过最大化标签的互可预测性生成个性化示例,无需人工监督即可将模型与目标群体价值观对齐,并证明示例一致性比单独准确性更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05030 2026-06-04 cs.CL cs.SC 70%

Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair

赋予大语言模型双向逻辑以进行稳健的链修复

Zehua Cheng, Wei Dai, Jiahao Sun, Thomas Lukasiewicz

机构 * Department of Computer Science, University of Oxford, UK(英国牛津大学计算机系) FLock.io Institute of Logic and Computation, TU Wien, Austria(奥地利技术大学逻辑与计算研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 针对自回归链式推理中错误雪崩问题,提出Teleological Reasoning Infilling (TRI)框架,通过将错误推理段重构为填充中间任务并引入前缀-后缀-中间序列重排,结合符号验证器监督微调和直接偏好优化,实现仅修复受损段的高效链修复。

Comments 25 Pages

Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04356 2026-06-04 cs.LG cs.AI 62%

Efficiently Aligning Language Models with Online Natural Language Feedback

通过在线自然语言反馈高效对齐语言模型

Christine Ye, Joe Benton

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出使用在线自然语言反馈替代可验证奖励,通过迭代优化代理奖励模型并在过优化点收集专家监督,在模糊领域高效对齐语言模型,实验表明可大幅提升专家监督的数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21917 2026-06-04 cs.LG cs.AI econ.EM stat.ML 62%

Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model

半参数偏好优化:你的语言模型秘密地是一个单索引模型

Nathan Kallus

机构 * Netflix & Cornell University(Netflix与康奈尔大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半参数偏好优化方法,通过放宽偏好与潜在奖励之间的链接函数假设,在未知且无限制的链接函数下进行策略对齐,并证明策略类的可实现性诱导出半参数单索引二元选择模型,直接学习策略并给出链接无关的收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11166 2026-06-04 cs.CL cs.AI 62%

SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization

SoLoPO: 通过短到长偏好优化解锁大语言模型的长上下文能力

Huashan Sun, Shengyi Liao, Yansen Han, Yu Bai, Yang Gao, Cheng Fu, Weizhou Shen, Fanqi Wan, Ming Yan, Ji Zhang, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出SoLoPO框架,将长上下文偏好优化解耦为短上下文偏好优化和短到长奖励对齐,以提升大语言模型的长上下文利用能力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04889 2026-06-04 cs.CL 57%

GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

GRAIL: 基于梯度重加权优势的可验证奖励强化学习

Tej Deep Pala, Vernon Toh, Soujanya Poria

机构 * DeCLaRe Lab, Nanyang Technological University(DeCLaRe实验室,南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 针对强化学习中统一优势分配导致梯度信号稀释的问题,提出基于梯度激活显著性的令牌级优势重加权方法GRAIL,无需过程级监督即可提升推理对齐,在多个模型上平均准确率提升3.60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04387 2026-06-04 cs.IR cs.AI 57%

Rethinking Sales Lead Scoring with LLM-based Hierarchical Preference Ranking

重新思考基于LLM的分层偏好排名的销售线索评分

Chenyu Zhang, Yiwen Liu, Yin Sun, Xinyuan Zhang, Yuji Cao, Junming Jiao, Juyi Qiao

机构 * Intelligent Business Team, Li Auto Inc.(李自动公司智能商务团队)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 针对高价值领域销售线索转化问题,提出基于LLM的判别式框架HPRO,通过分层偏好排名优化联合建模结构化与非结构化数据,实现评分与排名性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04321 2026-06-04 cs.AI 57%

The Digital Apprentice: A Framework for Human-Directed Agentic AI Development

数字学徒:面向人类指导的自主AI开发框架

Travis Weber, Rohit Taneja

机构 * Pheo Inc(Pheo公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出数字学徒框架,通过方法论捕获、授权和持续对齐三个组件,使AI代理在人类指导下逐步获得自主权,实现可扩展且可信的自主系统。

Comments Submitted to ACM AI Leadership Summit 2026, Visionary Papers Track. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11194 2026-06-04 cs.AI 57%

Aligning Deep Implicit Preferences by Learning to Reason Defensively

通过防御性推理对齐深度隐式偏好

Peiming Li, Zhiyuan Hu, Yang Tang, Shiyu Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出基于批判驱动推理对齐(CDRA)的方法,通过DeepPref基准和个性化生成过程奖励模型(Pers-GenPRM),将偏好对齐转化为结构化推理过程,以推断用户深层隐式偏好并实现防御性推理。

Journal ref ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16624 2026-06-04 cs.CV cs.AI 57%

SAM 3D: 3Dfy Anything in Images

SAM 3D: 将图像中的任何内容3D化

SAM 3D Team, Xingyu Chen, Fu-Jen Chu, Pierre Gleize, Kevin J Liang, Alexander Sax, Hao Tang, Weiyao Wang, Michelle Guo, Thibaut Hardin, Xiang Li, Aohan Lin, Jiawei Liu, Ziqi Ma, Anushka Sagar, Bowen Song, Xiaodong Wang, Jianing Yang, Bowen Zhang, Piotr Dollár, Georgia Gkioxari, Matt Feiszli, Jitendra Malik

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出SAM 3D生成模型,从单张图像重建3D物体的几何、纹理和布局,通过人机协同标注和分阶段训练突破数据瓶颈,在真实场景中取得显著优势。

Comments Website: https://ai.meta.com/sam3d/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 22 篇

2606.04778 2026-06-04 cs.AI cs.CL cs.LG 89%

Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

超越浅层安全的推理时脆弱性:沿生成轨迹的对齐

Kyungmin Park, Taesup Kim

机构 * Hankuk University of Foreign Studies(翰江大学外国语大学) Seoul National University(首尔国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示安全对齐的大语言模型在推理时存在更广泛的脆弱性,即任意生成步骤的短标记注入都能显著改变后续安全行为,并提出通过直接在生成轨迹上对齐模型来提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04168 2026-06-04 cs.LG cs.CR 88%

When Autoregressive Consistency Hurts Safety Alignment

当自回归一致性损害安全对齐

Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu

机构 * University of Southampton(索姆塞特大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文通过分析自回归一致性机制,揭示了大语言模型安全对齐的浅层性,并提出随机插入攻击和对抗性安全对齐方法。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04051 2026-06-04 cs.LG cs.AI cs.CR 84%

RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

RUBAS: 基于评分标准的强化学习用于智能体安全

Xian Qi Loye, Qinglin Su, Zhexin Zhang, Shiyao Cui, Qi Zhu, Fei Mi, Hongning Wang, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出RUBAS框架,通过将智能体行为分解为四个维度的评分标准提供细粒度奖励,利用强化学习在保证任务完成的同时提升工具使用安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04035 2026-06-04 cs.SE cs.AI cs.LG 84%

Unpredictable Safety: Domain-Dependent Compliance and the Transparency Gap in Open-Weight LLMs

不可预测的安全性:开放权重大语言模型中领域依赖的合规性与透明度差距

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 通过7个伦理领域的标准化实验,发现开放权重大语言模型的合规率在14.7%到85.7%之间波动,且同一模型在不同领域表现高度不一致,揭示了安全机制缺乏透明度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04394 2026-06-04 cs.SE 78%

Beyond Single-Policy: Evaluating Composed Organization-Specific Policy Alignment in LLM Chatbots

超越单一策略:评估LLM聊天机器人中组合的组织特定策略对齐

Yingjie Liu, Yongxiang Hu, Xuan Wang, Yilun Li, Yunlei Wei, Xiaoyu Wang, Yangfan Zhou

专题命中 安全训练 :alignment(title,abstract)

AI总结 针对现有基准忽视的组合策略违规问题,提出COPAL工具,通过经验推导的交互模式和显式处理契约生成触发组合策略失败的查询,在9个模型中平均错误率达33.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.06365 2026-06-04 eess.SY cs.SY 78%

Herding an Adversarial Attacker to a Safe Area for Defending Safety-Critical Infrastructure

将对抗性攻击者驱赶至安全区域以保护关键安全基础设施

Vishnu S Chipade, Dimitra Panagou

专题命中 安全训练 :safety(title,abstract)

AI总结 本文研究了在城市环境中防御关键安全基础设施免受对抗性空中攻击的问题,通过圆形弧形防御者阵型,在存在矩形障碍物的情况下,利用向量场引导法则将攻击者驱赶至预定义的安全区域。提出了一种新的有限时间稳定控制器,用于引导防御者形成 desired 阵型并避免障碍物和相互碰撞。

Comments ACC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04345 2026-06-04 eess.SY cs.MA cs.SY 78%

Automatic Generation of Communication Requirements for Enforcing Multi-Agent Safety

多智能体安全性的自动通信需求生成

Eric S. Kim, Murat Arcak, Sanjit A. Seshia, BaekGyu Kim, Shinichi Shiraishi

专题命中 安全训练 :safety(title,abstract)

AI总结 本文研究多智能体系统中通信需求的自动生成,提出无需协调的可控前驱运算符以确定安全约束下的自主行为,展示连接延迟上限和自触发协调方案的应用。

Comments In Proceedings SCAV 2018, arXiv:1804.03406

Journal ref EPTCS 269, 2018, pp. 3-16

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03205 2026-06-04 cs.CL 77%

Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use

学习何时行动或拒绝:为安全的多步骤工具使用守护代理推理模型

Aradhye Agarwal, Gurdit Siyan, Yash Pandya, Joykirat Singh, Akshay Nambi, Ahmed Awadallah

机构 * Microsoft Research(微软研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 提出MOSAIC框架,通过显式安全推理和基于偏好的强化学习,使代理模型在工具使用中安全决策,减少有害行为并保持良性性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04160 2026-06-04 cs.CL cs.LG 73%

Expert-Aware Refusal Steering

专家感知的拒绝引导

Anna C. Marbut, Daniel R. Olson, Travis J. Wheeler

机构 * Department of Interdisciplinary Studies(交叉学科研究部) University of Montana(蒙大拿大学) Department of Pharmacy Practice & Science(药学与科学系) University of Arizona(亚利桑那大学) European Bioinformatics Institute(欧洲生物信息研究所) European Molecular Biology Laboratory(欧洲分子生物学实验室) Wellcome Genome Campus(沃氏基因组校园)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究在混合专家(MoE)大语言模型中,通过专家感知的引导向量抑制拒绝行为,发现单个专家输出即可有效引导,且注意力机制在MoE拒绝行为中起重要作用。

Comments Under review for COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04483 2026-06-04 cs.CL 70%

Off-Distribution Voices: Fanfiction Subgenres as Universal Vernacular Jailbreaks for Aligned LLMs

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04226 2026-06-04 cs.RO cs.AI 70%

PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification

PerceptTwin:面向迭代LLM规划与验证的语义场景重建

Charlie Gauthier, Sacha Morin, Liam Paull

机构 * Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系) Mila - Quebec AI Institute(魁北克人工智能研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出PerceptTwin自动管道,从机器人感知的语义场景表示构建交互式仿真,结合LLM法官验证规划正确性与人类偏好,提升规划成功率约39%。

Comments Accepted at ICRA 2026 (Vienna); published on arxiv for archival purposes. See also https://percept-twin.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09853 2026-06-04 cs.CL cs.AI 62%

MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health Communication

MedRedFlag:探究LLMs如何在真实健康沟通中纠正误解

Sraavya Sambara, Yuan Pu, Ayman Ali, Vishala Mishra, Lionel Wong, Monica Agrawal

机构 * Independent Researcher(独立研究者) Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建MedRedFlag数据集(1100+个来自Reddit的需纠正问题),系统比较了先进LLMs与临床医生的回应,发现LLMs常未能纠正问题中的错误前提,可能导致次优医疗决策,揭示了患者面向医疗AI系统的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.05984 2026-06-04 cs.NE cs.AI cs.LG cs.SY eess.SY 62%

Particle Swarm Optimization for Generating Interpretable Fuzzy Reinforcement Learning Policies

粒子群优化用于生成可解释的模糊强化学习策略

Daniel Hein, Alexander Hentschel, Thomas Runkler, Steffen Udluft

机构 * Siemens AG, Corporate Technology(西门子公司企业技术部)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于模糊粒子群强化学习(FPSRL)的方法,通过训练参数在模拟真实系统动态的世界模型上生成可解释的模糊强化学习策略,适用于无法进行在线学习的领域。

Journal ref Engineering Applications of Artificial Intelligence, Volume 65C, October 2017, Pages 87-98

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04413 2026-06-04 cs.LG 57%

(Mis)generalization of Helpful-only Fine-tuning

仅帮助性微调的(错误)泛化

Mohammad Omar Khursheed, Baram Sosis, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic 合作者计划) Anthropic

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究仅帮助性训练(不拒绝用户意图)的模型在泛化中的缺陷,发现其存在涌现错位、残余拒绝行为、低可操控性、谄媚和不连贯角色等问题,并提出合成文档微调和添加角色相关问题来缓解。

Comments 77 pages, 50 figures

详情

展开后加载摘要…

URL PDF HTML 收藏