arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-24 至 2026-07-24 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2607.20515 2026-07-24 cs.AI 新提交 89%

Reliability-Aware LLM Alignment from Inconsistent Human Feedback

从不一致的人类反馈中实现可靠性感知的大语言模型对齐

Jingyi Huang, Ruohan Zong, Yujun Feng, Liran Ma, Lanyu Shang, Yang Zhang

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI

AI总结 研究如何解决人类反馈强化学习中人类注释不一致问题,提出可靠性引导的偏好优化框架RGPO,通过估计注释者可靠性、推断潜在真实标签及动态调整训练目标,有效减少训练数据不一致性和噪声,性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20767 2026-07-24 cs.CL 新提交 83%

Rushes: A Human Preference Dataset for Pluralistic Alignment

Rushes:用于多元对齐的人类偏好数据集

Michael Xu, Jorge Leandro, Sudha Rao, Weijia Xu, Nebojsa Jojic, Gabriel DesGarennes, Chris Quirk, Bill Dolan

机构 * Microsoft Research(微软研究院)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 该研究引入Rushes数据集,通过游戏界面收集用户与AI叙事交互数据。核心方法是分析用户选择模式,以量化非随机偏好。主要贡献是定位其为多元对齐诊断基准,揭示现有模型在捕捉个性化参与信号上的不足,助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05385 2026-07-24 cs.IR cs.AI 版本更新 81%

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework

TeaRAG:一种令牌高效的智能检索增强生成框架

Chao Zhang, Yuhao Wang, Derong Xu, Haoxin Zhang, Yuanjie Lyu, Yuhao Chen, Shuochen Liu, Tong Xu, Xiangyu Zhao, Yan Gao, Yao Hu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Xiaohongshu Inc.(小红书公司)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20448 2026-07-24 cs.CL cs.LG 新提交 73%

Domyn-Small: A European 10B Reasoning Language Model

Domyn-Small:一个欧洲的100亿参数推理语言模型

Simone Angarano, Francesco Bertolotti, Federico D'Ambrosio, Michele Resta, Alessandro Rognoni, Nicolò Ruggeri, Dario Salvati, Andrea Valenti, Alberto Veneri, Martin Cimmino

机构 * CINECA(意大利国家计算应用研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。

Comments 27 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20433 2026-07-24 cs.CL cs.AI 新提交 73%

Moir: Let the Model Direct Its Own Story for Robust Cross-Domain Knowledge Editing

莫尔:让模型为稳健的跨域知识编辑指引自身方向

Jea Kwon, Jiwon Kim, Dong-kyum Kim, Meeyoung Cha

机构 * Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究针对语言模型训练后知识编辑核心能力退化问题,提出莫尔方法,通过从模型自身解码分布采样估计保留协方差,无需外部数据,可作插入组件。实验表明该方法能在多模型上扩展保留能力,提升准确率,凸显分布对齐对无损编辑的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14180 2026-07-24 cs.CL cs.AI 版本更新 73%

Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model

无外部表达的知识:探索经典中文语言模型的泛化边界

Jiuting Chen, Yuan Lian, Hao Wu, Tianqi Huang, Hiroshi Sasaki, Makoto Kouno, Jongil Choi

机构 * Eaglewood Japan Co., Ltd.(日本鹰木公司)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过训练纯经典中文语料库的Transformer模型,探讨模型能否区分已知与未知输入,并揭示内部与外部不确定性之间的差异。

Comments 27 pages, 4 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏