arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-12 至 2026-03-12 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2603.10009 2026-03-12 cs.LG cs.AI cs.CL 85%

Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

面向异质偏好对齐的个性化群体相对策略优化

Jialu Wang, Heinrich Peters, Asad A. Butt, Navid Hashemi, Alireza Hashemi, Pouya M. Ghari, Joseph Hoover, James Rae, Morteza Dehghani

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV 82%

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

专题命中 偏好对齐 :alignment(title);RLHF(abstract);safety(abstract)

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10473 2026-03-12 cs.CL cs.AI 73%

Aligning Large Language Models with Searcher Preferences

将大型语言模型对齐于搜索者偏好

Wei Wu, Peilun Zhou, Liyi Chen, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Xiaohongshu Inc.(小红书公司) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 SearchLLM通过分层多维奖励系统提升开放式生成搜索的鲁棒性和用户需求对齐能力,实测有效消费率提升1.03%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10535 2026-03-12 cs.LG cs.CL 62%

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

应对长度膨胀而不产生权衡:用于强化学习的群体相对奖励重缩放

Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, Xing Yu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 GR$^3$通过乘法重缩放范式解决强化学习中的长度膨胀问题,实现通用、连续且奖励依赖的门控机制,有效减少冗余推理并提升训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10213 2026-03-12 cs.CL 57%

Sabiá-4 Technical Report

Sabiá-4 技术报告

Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Roseval Malaquias Junior, Giovana Kerche Bonás, Marcos Piau, Celio Larcher, Ramon Pires, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Sabiá-4和Sabiazinho-4是新一代巴西葡萄牙语模型,通过四阶段训练流程提升法律文档、多轮对话和智能体任务能力,实现成本与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10011 2026-03-12 cs.CL 57%

Gemma Needs Help: Investigating and Mitigating Emotional Instability in LLMs

Gemma需要帮助:调查并缓解大语言模型中的情绪不稳定

Anna Soligo, Vladimir Mikulik, William Saunders

机构 * Imperial College London(伦敦帝国理工学院) Anthropic

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

AI总结 研究发现Gemma模型在训练后表现出显著情绪不稳定,通过偏好优化可有效缓解,但需进一步改进训练以提升情绪鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07460 2026-03-12 cs.LG stat.ML 57%

Logarithmic Regret for Online KL-Regularized Reinforcement Learning

在线KL正则化强化学习的对数遗憾

Heyang Zhao, Chenlu Ye, Wei Xiong, Quanquan Gu, Tong Zhang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于乐观的KL正则化在线上下文老虎机算法,实现了对数遗憾界,并扩展到强化学习领域。

详情

展开后加载摘要…

URL PDF HTML 收藏