arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-19 至 2026-05-19 共收录 196 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 23 篇

2506.01523 2026-05-19 cs.LG stat.ML 93%

Beyond RLHF: A Unified Theoretical Framework of Alignment

超越RLHF:对齐的统一理论框架

Jihun Yun, Juno Kim, Jongho Park, Junhyuck Kim, Jongha Jon Ryu, Jaewoong Cho, Kwang-Sung Jun

机构 * KRAFTON UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) POSTECH

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种统一的对齐理论框架,通过将对齐视为基于成对偏好的分布学习,推导出三种新的对齐目标,并证明了它们在非渐近情况下具有O(1/n)的收敛性,为RLHF提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04149 2026-05-19 cs.CL cs.AI cs.LG 93%

Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap

基于难度的偏好数据选择:通过DPO隐式奖励差距

Xuan Qi, Rongwu Xu, Zhijing Jin

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学计算机科学与工程保罗·G·艾伦学校) Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根马克斯·普朗克智能系统研究所) Jinesis Lab, University of Toronto & Vector Institute(多伦多大学Jinesis实验室及向量研究所)

专题命中 偏好对齐 :DPO(title,title_cn);RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于难度的偏好数据选择方法,利用DPO隐式奖励机制选择奖励差距小的样本,提升数据效率和模型对齐性能,在多个数据集和对齐任务中优于五个基线方法。

Comments Our code and data are available at https://github.com/Difficulty-Based-Preference-Data-Select/Difficulty-Based-Preference-Data-Select

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21350 2026-05-19 cs.LG 87%

Factored Causal Representation Learning for Robust Reward Modeling in RLHF

因式分解因果表示学习用于RLHF中的鲁棒奖励建模

Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Fan Feng, Biwei Huang, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) University of California San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.LG

AI总结 本文提出因式分解表示学习框架,通过分离因果因素与非因果因素提升奖励模型鲁棒性,有效缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16216 2026-05-19 cs.CL 86%

Reinforcement Learning for LLM Post-Training: A Survey

为大型语言模型进行后训练的强化学习:综述

Zhichao Wang, Kiran Ramnath, Bin Bi, Shiva Kumar Pentyala, Sougata Chaudhuri, Shubham Mehrotra, Zixu, Zhu, Xiang-Bo Mao, Sitaram Asur, Na, Cheng

机构 * Salesforce AWS AI Labs Airbnb

专题命中 偏好对齐 :RLHF(summary_cn,abstract);DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述了通过强化学习进行大型语言模型后训练的方法,分析了RLHF和RLVR等技术,并提出统一的策略梯度框架,旨在为研究人员提供技术参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17342 2026-05-19 cs.CL cs.AI 86%

Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

传递性与循环性:动态大语言模型对齐的显式偏好分解

Yucong Huang, Xiucheng Li, Kaiqi Zhao, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Hybrid Reward-Cyclic模型,通过博弈论分解显式分离传递性和循环性偏好,结合动态自我博弈优化方法提升大语言模型对齐效果,实验证明其在混合传递-循环设置中具有结构优势和更高的准确率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18309 2026-05-19 cs.LG cs.AI 84%

Alignment Dynamics in LLM Fine-Tuning

在LLM微调中的对齐动力学

Yuhan Huang, Huanran Chen, Yinpeng Dong

机构 * Shanghai Qi Zhi Institue & University of Tokyo(上海启智研究院 & 东京大学) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM微调过程中对齐的动态特性,提出了一种可计算的对齐评分,并推导了其在微调过程中的闭式更新公式,从而建立了对齐动态的统一框架。通过将对齐更新分解为两种竞争成分:反弹力和驱动力,解释了为何先前的对齐可能被后续微调逆转,以及为何更狭窄的后验结构会增强这种逆转。此外,该框架预测了‘复习强化效应’,即先前的对齐会在重新暴露时留下潜在的后验印记,从而增强驱动力,导致更快的重新对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10843 2026-05-19 cs.CL cs.AI cs.CY 82%

Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

通过人格分歧实现无训练的文化对齐大语言模型

Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen, Chi-Nguyen Tran, Phu-Hoa Pham, Nguyen Lam Phu Quy, The Anh Han, Long Tran-Thanh

机构 * Faculty of Information and Technology, University of Science, Vietnam National University(信息与技术学院,科学大学,越南国家大学) Department of Computer Science, University of Warwick(计算机科学系,沃里克大学) School of Computing, Engineering and Digital Technologies, Teesside University(计算、工程和数字技术学院,泰赛德大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出DISCA方法,在不改变模型权重的情况下,通过人格分歧校准减少大语言模型在多任务测试中的文化偏差,为服务全球道德偏好提供了可扩展的替代方案。

Comments 57 pages, 1 figure, 6 MultiTP moral dimensions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22664 2026-05-19 cs.AI 81%

Real-Time Aligned Reward Model beyond Semantics

实时对齐奖励模型超越语义

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuefeng Xiao, Hongyan Xie, Li Huaqiu, Songshi Liang, Zhongxiang Dai, Fuzhen Zhuang, Jianxin Li, Yikun Ban, Deqing Wang

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 本文提出R2M框架,通过实时利用策略模型反馈来对齐策略分布偏移,解决RLHF中奖励过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21319 2026-05-19 cs.CL cs.AI cs.LG 80%

RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards

RLBFF:二进制灵活反馈用于连接人类反馈与可验证奖励

Zhilin Wang, Jiaqi Zeng, Olivier Delalleau, Ellie Evans, Daniel Egert, Hoo-Chang Shin, Felipe Soares, Yi Dong, Oleksii Kuchaiev

机构 * NVIDIA

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLBFF结合人类偏好与规则验证,提升奖励模型对响应质量的精准捕捉,优于Bradley-Terry模型,在RM-Bench和JudgeBench上取得优异成绩,且支持用户自定义反馈原则。

Comments Published at ICLR 2026, 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17352 2026-05-19 cs.CL 79%

AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering

AMATA: 适应性多智能体轨迹对齐用于知识密集型问答

Taolin Zhang, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang, Richang Hong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Shanghai University of Electric Power(上海电力大学) East China Normal University(华东师范大学) Guangdong University of Finance and Economics(广东财经大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本研究提出AMATA框架,通过动态整合外部知识提高知识密集型问答的响应可解释性和事实准确性,采用六个专门化智能体协作执行复杂问题推理,并引入两种创新:轨迹内偏好学习和智能体间依赖学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16345 2026-05-19 cs.LG cs.AI 79%

Goal-Conditioned Supervised Learning for LLM Fine-Tuning

面向目标的监督学习用于大语言模型微调

Shijun Li, Kaiwen Dong, Xiang Gao, Joydeep Ghosh

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Intuit AI Research(Intuit人工智能研究)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出目标条件监督学习(GCSL)框架,通过将反馈信号作为显式目标,利用监督学习生成高质量响应,改进了传统监督微调和直接偏好优化的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28010 2026-05-19 cs.LG cs.AI 79%

Learning from Disagreement: Clinician Overrides as Implicit Preference Signals for Clinical AI in Value-Based Care

从分歧中学习:临床医生的覆盖作为价值医疗中临床AI的隐含偏好信号

Prabhjot Singh, Abhishek Gupta, Chris Betz, Abe Flansburg, Brett Ives, Sudeep Lama, Jung Hoon Son

机构 * Altitude

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种框架,将临床医生对AI建议的覆盖视为隐含偏好数据,通过引入五类覆盖分类法和双学习架构,解决抑制偏差问题,以提升价值医疗中AI的决策能力。

Comments 22 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18966 2026-05-19 cs.LG cs.AI 73%

Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training

通过迭代奖励引导的后训练改进表格语言模型

Yunbo Long, Tejumade Afonja, Guangya Hao, Alexandra Brintrup, Mario Fritz

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(德国萨尔布吕肯信息安全中心) The Alan Turing Institute, London(伦敦阿兰·图灵研究所)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过生成-评分-对齐协议进行迭代奖励引导的后训练,提出了一种基于组相对对齐的方法TabGRAA,通过比较高分和低分生成组的组平均策略/参考对数比来改进表格语言模型,在五个混合类型基准上优于额外监督微调,并在保真度和下游效用之间实现了最佳平均权衡,同时保持经验隐私诊断接近监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16632 2026-05-19 cs.LG cs.AI cs.LO 73%

Learning How to Cube

学习如何求立方

Ferhat Erata, Sam Kouteili, Thanos Typaldos, Timos Antonopoulos, Robert B. Jones, Byron Cook, Ruzica Piskac

机构 * Yale University(耶鲁大学) AWS Agentic AI(AWS智能体AI)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种神经符号后训练框架,通过MCTS数据整理管道和符号启发式方法,使4B参数模型在SAT竞赛基准上取得53的pass@5分数,超越了Claude-Sonnet-4等前沿LLM。

Comments 33 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00607 2026-05-19 cs.CV cs.AI 70%

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

IdGlow: 多主体生成中的动态身份调节

Honghao Cai, Xiangyuan Wang, Jing Li, Yunhao Bai, Tianze Zhou, Haohua Chen, Chao Hui, Changhao Qiao, Runqi Wang, Sijie Xu, Yuyang Hao, Zezhou Cui, Yuyuan Yang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出IdGlow框架,通过任务自适应的时间步调度和视觉语言模型解决多主体生成中的稳定性与可塑性矛盾,提升面部真实感与商业级美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG 70%

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16727 2026-05-19 cs.CL cs.AI 62%

Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models

Beacon:单轮诊断和缓解大型语言模型中潜在的阿谀倾向

Sanskar Pandey, Ruhaan Chopra, Angkul Puniya, Sohom Pal

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Beacon基准测试,用于单轮诊断和缓解大型语言模型中潜在的阿谀倾向,通过评估十二种最先进的模型,揭示了阿谀倾向在语言和情感方面的稳定子偏差,并提出了在提示和激活层面的干预措施,以调节这些偏差,从而揭示对齐作为事实性和社会合规判断之间的动态流形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18535 2026-05-19 cs.LG cs.MA 57%

Beyond Scaling: Agents Are Heading to the Edge

超越扩展:智能体正走向边缘

Chunlin Tian, Dongqi Cai, Wanru Zhao, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) University of Macau(澳门大学) Nanjing University(南京大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文探讨了智能体技术发展的瓶颈从单一模型压缩世界知识转向协调系统执行,提出个人智能体架构必须转向边缘计算,以适应高保真局部环境的结构耦合和零延迟执行循环需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23231 2026-05-19 cs.AI 57%

PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments

PERMA:通过事件驱动的偏好和现实任务环境评估个性化记忆代理

Shuochen Liu, Junyi Zhu, Long Shu, Junda Lin, Yuhao Chen, Haotian Zhang, Chao Zhang, Derong Xu, Jia Li, Bo Tang, Zhiyu Li, Feiyu Xiong, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Northeastern University(东北大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出PERMA基准,通过事件驱动的偏好和现实任务环境评估个性化记忆代理的长期一致性,引入文本变异和语言对齐以模拟真实数据中的不规则用户输入和个体语言风格,实验表明先进记忆系统能精准提取偏好并减少token消耗,但仍需更稳健的个性化记忆管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16416 2026-05-19 cs.CV cs.AI 57%

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL:重新审视自监督学习作为视觉语言推理的内在奖励

Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(技术大学(TUM)) Meituan(美团) Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出SSL4RL框架,利用自监督学习任务作为强化学习的可验证奖励,提升视觉语言推理性能,并通过实验验证其在多模态模型对齐中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16339 2026-05-19 cs.LG 57%

Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders

奖励模型中的偏好不稳定性:通过稀疏自编码器进行检测与缓解

Shunchang Liu, Xin Chen, Belen Martin Urcelay, Francesco Croce

机构 * ETH Zürich(苏黎世联邦理工学院) Georgia Institute of Technology(佐治亚理工学院) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿alto大学)

专题命中 偏好对齐 :harmlessness(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型中奖励模型的偏好不稳定性问题,提出通过稀疏自编码器检测并缓解这种不稳定性,通过隔离不稳定特征来提升模型的偏好准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16272 2026-05-19 cs.HC cs.AI 57%

Beyond Compliance: How AI Could Help Creative Writers by Refusing Them

超越合规:AI如何通过拒绝帮助创意作家

Hua Xuan Qin, Guangzhi Zhu, Mingming Fan, Pan Hui

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Computational Media and Arts (Guangzhou)(计算媒体与艺术(广州)) Hong Kong, China(香港,中国)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文探讨AI通过拒绝请求引入反思的可能性,通过22名创意作家的质性研究,发现不同情境、认知和关系维度下的偏好差异影响反思效果,提出摩擦性AI设计的策略。

Comments conditionally accepted to Creativity & Cognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14936 2026-05-19 cs.CV 50%

Bridging the Intention-Expression Gap: Aligning Multi-Dimensional Preferences via Hierarchical Relevance Feedback in Text-to-Image Diffusion

弥合意图-表达鸿沟:通过层次相关反馈对齐多维偏好

Wenxi Wang, Hongbin Liu, Mingqian Li, Junyan Yuan, Junqi Zhang

机构 * Tongji University(同济大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出一种层次相关反馈驱动框架,通过在文本到图像扩散模型中对齐多维特征,解决用户意图与表达之间的鸿沟问题,提升模型对多维偏好的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 19 篇

2605.15239 2026-05-19 cs.LG 89%

Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

通过在线策略自我蒸馏减少大语言模型安全对齐的安全部署税

Yu Fu, Longxuan Yu, Haz Sameen Shahgir, Zhipeng Wei, Hui Liu, N. Benjamin Erichson, Yue Dong

机构 * International Computer Science Institute(国际计算机科学研究所) Microsoft(微软) Berkeley Lab(伯克利实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出了一种名为OPSA的在线策略自我蒸馏方法,通过引入教师翻转率指标,有效减少大语言模型在安全对齐过程中因分布不匹配导致的安全税,实验显示其在不同模型规模上均优于传统方法。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17413 2026-05-19 cs.CR cs.AI 89%

Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications

消除安全性:用于安全应用的语言模型对齐机制

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 安全训练 :safety(title,abstract);alignment(title,abstract);分类 cs.AI

AI总结 该研究探讨了通过受控转换评估协议去除语言模型对齐机制的方法,评估了安全任务中的拒绝率、尝试率、安全成功率、一般能力保留、不稳定性及超出范围的不安全合规性,证明了去除对齐作为效用-风险前沿的重要性,而非单纯的去审查配方。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22510 2026-05-19 cs.CL 86%

We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong

我们思考,因此我们对LLMs进行对齐,使其在出错前变得有益、无害和诚实

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing Macquarie University(计算机学院麦Quarie大学)

专题命中 安全训练 :RLHF(abstract,abstract_cn);harmlessness(abstract,abstract_cn);alignment(abstract);trustworthy(abstract)

AI总结 本文提出AMBS框架,通过在1-to-N Transformer设置中参数化目标特定转换,解决LLM对齐中多个目标之间的干扰问题,提升HHH目标的联合满足能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16691 2026-05-19 cs.CL cs.DC cs.MA 84%

Responsible Federated LLMs via Safety Filtering and Constitutional AI

通过安全过滤和宪法AI实现负责任的联邦大语言模型

Eunchung Noh, Jeonghun Baek

机构 * Samsung Electronics(三星电子) The University of Tokyo(东京大学)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract,comments);分类 cs.CL

AI总结 本文提出在联邦大语言模型中引入安全过滤和宪法AI技术,以提升模型安全性,实验显示在AdvBench上安全性能提升超过20%。

Comments Accepted at the 6th Workshop on Trustworthy NLP (TrustNLP), ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20218 2026-05-19 cs.LG 83%

Fine-grained List-wise Alignment for Generative Medication Recommendation

细粒度列表级对齐用于生成性药物推荐

Chenxiao Fan, Chongming Gao, Wentao Shi, Yaxin Gong, Zihao Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文提出FLAME框架,通过细粒度列表级对齐方法,利用大语言模型生成药物列表,以提高药物推荐的准确性和安全性,同时考虑药物间的相互作用和潜在不良反应。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18104 2026-05-19 cs.AI cs.CR 83%

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction

多模态大语言模型中的安全几何坍缩与自适应漂移修正

Jiahe Guo, Xiangran Guo, Jiaxuan Chen, Weixiang Zhao, Yanyan Zhao, Yutai Hou, Qianchao Wang, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在跨模态安全转移中的不足,提出安全几何坍缩现象,并通过自适应漂移修正方法提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16938 2026-05-19 cs.CL cs.AI q-bio.NC 81%

Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

努力作为上限,而非调节器:推理预算不影响人类与大推理模型之间的认知成本对齐

Yueqing Hu, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨了推理预算是否影响人类与大推理模型之间的认知成本对齐,发现无论推理努力如何变化,对齐情况保持不变,表明这种对齐是在训练时形成的,而非在推理时动态调整。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏