Privately Aligning Language Models with Reinforcement Learning
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG
Comments Accepted at ICLR 2024
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG
Comments Accepted at ICLR 2024
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 9 pages, 1 figure
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL
Comments Accepted by NAACL 2024
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI
Comments Published at the GEM workshop, ICLR 2024. Generative and Experimental Perspectives for Biomolecular Design (https://www.gembio.ai/)
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL
Comments 8 pages, 6 figures
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI
专题命中 偏好对齐 :RLHF(abstract);trustworthy(abstract);分类 cs.CL
Comments EMNLP 2023 Camera Ready
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL
Comments ArXiv version For NeurIPS 2023 accepted paper: RRHF: Rank Responses to Align Language Models with Human Feedback
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL
Comments 59 pages, 5 figures
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与医学中的chair,技术大学慕尼黑(TUM)和慕尼黑技术大学医院) ; Department of Orthopaedics and Sports Orthopaedics, TUM University Hospital(骨科与运动骨科,慕尼黑技术大学医院) ; Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML)) ; Department of Computing, Imperial College London, UK(计算系,帝国理工学院伦敦)
专题命中 偏好对齐 :alignment(abstract,comments);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to TACL. Pre-MIT Press version. Major restructuring; added preference alignment section and additional tables. 36 pages
专题命中 偏好对齐 :alignment(abstract,comments);safety(abstract)
Comments Project page: https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models/tree/Alignment
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 偏好对齐 :DPO(abstract,abstract_cn)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
OmniVLM:一种用于高效设备端推理的令牌压缩、参数少于十亿的视觉语言模型
机构 * Nexa AI
专题命中 偏好对齐 :DPO(abstract,abstract_cn)
AI总结 研究提出OmniVLM视觉语言模型,通过令牌压缩机制减少计算开销,经多阶段训练匹配更大模型性能。在多基准测试中优于现有基线,在笔记本电脑上实证显示速度提升,能在边缘设备高效部署,模型权重可在huggingface获取。
立场:将AI对齐于我们的抱负,而非缺陷
机构 * National University of Singapore(新加坡国立大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文主张AI不应与聚合的人类偏好对齐,而应基于能力、事实准确性、诚实和合法性等客观目标底线,在底线之上允许多元价值权衡。
Journal ref Pluralistic Alignment Workshop at ICML 2026
PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Meta BizAI(Meta商业人工智能)
专题命中 偏好对齐 :DPO(abstract,abstract_cn)
AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。
Comments ECCV 2026
扩散变换器中的注意力 sinks:一种因果分析
机构 * Department of Computer Science, Tulane University, New Orleans, LA, USA(路易斯安那州新奥尔良大学计算机科学系)
专题命中 偏好对齐 :alignment(abstract,abstract_cn)
AI总结 研究探讨了扩散变换器中注意力 sinks 的作用,通过动态识别并抑制注意力接收者,发现其对文本-图像对齐和偏好代理影响有限,但强干预下出现特定边界。
Emo-LiPO:基于LLM的文本到语音中细粒度情感强度控制的列表式偏好优化
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Agency for Science, Technology and Research(新加坡科技研究局) ; National University of Singapore(新加坡国立大学) ; Shenzhen Research Institute of Big Data(深圳市大数据研究院) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 偏好对齐 :DPO(abstract,abstract_cn)
AI总结 提出Emo-LiPO框架,将情感强度控制建模为学习排序问题,通过列表式偏好优化对齐文本与语音的情感强度,实现更忠实连续的情感表达,在ESD-plus数据集上显著提升情感准确性和强度可控性。
Comments Accepted by IJCAI 2026. Emotional TTS, Preference Optimization, Emotion Intensity Control
LLM介导的智能微电网需求响应协调
专题命中 偏好对齐 :RLHF(abstract,abstract_cn)
AI总结 针对智能微电网中产消者自愿合作的需求响应协调问题,提出一种结合博弈论与LLM叙事评估的混合决策架构,通过结构化指令实现33.3%的需求削减合作率,优于非结构化消息和基线。
Comments Accepted for publication in 18th International Conference on Sustainability in Energy and Buildings (SEB-26), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer
量化与缓解LLM评判者的自我偏好偏差
机构 * CompleX Lab, School of Computer Science and Engineering, University of Electronic Science and Technology of China, Chengdu, China(复杂实验室、计算机科学与工程学院、电子科技大学、成都、中国)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出自动化框架量化LLM自我偏好偏差,并通过认知负荷分解的多维评估策略平均降低31.5%的偏差。
PersonaAgent:弥合个性化LLM智能体的记忆与行动
机构 * Amazon Stores Foundational AI(亚马逊基础AI)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PersonaAgent框架,通过整合个性化记忆模块(情景与语义记忆)和行动模块,并利用角色提示作为中介实现记忆与行动的协同,以解决LLM智能体的个性化任务。
Comments Accepted in ACL 2026
灯塔中的伊莱亚斯,再次?诊断LLM故事中的低多样性
机构 * Department of Information Science(信息科学系)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过采样20000个故事发现,LLM生成的故事中存在高度重复的词汇(如Elias、灯塔等),这些词汇来自偏好数据而非预训练数据,表明小数据集与强对齐算法的结合可能对多样性产生不成比例的影响。
探究优化下上下文与参数化思维链忠实性之间的相互作用
机构 * University of Copenhagen(哥本哈根大学) ; Technische Universität Berlin(柏林技术大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过提出统一偏好对齐接口FaithMate,研究上下文与参数化两种思维链忠实性范式在优化下的相互作用,发现两者正相关但不对称,且上下文忠实性指标间存在权衡。
Comments The first two authors contributed equally and share first-authorship
通过句子级早期干预缓解对象幻觉
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Chinese University of Hong Kong(香港中文大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 偏好对齐 :DPO(abstract,abstract_cn)
AI总结 提出SENTINEL框架,通过句子级早期干预和领域内偏好学习,无需人工标注即可显著减少多模态大语言模型的对象幻觉,并在幻觉和通用能力基准上超越现有方法。