arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-23 至 2026-06-23 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 15 篇

2601.04389 2026-06-23 cs.CL cs.AI 版本更新 91%

Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

安全并非普遍:大语言模型对齐中的选择性安全陷阱

Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * Advanced Knowledge Center for Immersive Technologies(沉浸式技术先进知识中心) Federal University of Goiás(戈亚斯联邦大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型在安全对齐中的选择性安全陷阱,通过MiJaBench基准测试发现安全防御存在人口统计学层级差异,通过DPO优化实现跨群体的安全泛化。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21089 2026-06-23 cs.AI 新提交 90%

Repeated post-training is not Self-improving: Diagnosing Scientific Amnesia in Continual DPO Pipelines

重复后训练并非自我改进:诊断持续DPO流水线中的科学健忘症

Jianzhe Lin, Fei Wang, Xiaolin Li, Rajeshkumar Golani, Jubin Chheda

机构 * MetaAI

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 针对工业LLM团队在持续DPO训练中遇到的性能退化问题,本文提出“科学健忘症”概念,并设计诊断套件、基于程序的流水线及基准测试,通过对比五种策略发现,结论高度依赖流水线设置和评估设计。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09777 2026-06-23 cs.NE cs.AI cs.CL cs.LG 版本更新 83%

EvoPref: Multi-Objective Evolutionary Optimization Discovers Diverse LLM Alignments Beyond Gradient Descent

EvoPref:多目标进化优化发现超越梯度下降的多样化大语言模型对齐

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EvoPref通过多目标进化算法在帮助性、无害性和诚实性目标上优化LoRA适配器,发现比梯度下降更丰富的对齐方式,实验显示其在偏好覆盖和崩溃率上均有显著提升。

Comments 10 pages, 2 figures, 6 tables, 1 algorithm. Accepted to GECCO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21550 2026-06-23 cs.AI 新提交 79%

AI Alignment From Social Choice Perspectives

从社会选择视角看AI对齐

Daniel Halpern, Evi Micha, Ariel D. Procaccia, Benjamin Schiffer, Itai Shapira, Shirley Zhang

机构 * Google Research(谷歌研究院) University of Southern California(南加州大学) Harvard University(哈佛大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文从社会选择理论视角审视人类反馈对齐中的偏好聚合问题,识别失败模式并揭示处理分歧的广阔设计空间。

Comments Accepted for publication in ACM SIGecom Exchanges

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13312 2026-06-23 cs.MM cs.LG 版本更新 79%

Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架

Yuxuan Yang, Xiaotong Mao, Jingyao Wang

机构 * National Jiangsu University of Finance(江苏财经大学) University of Lorraine(洛林大学) Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 提出Design-MLLM框架,通过双分支美学导向奖励的强化对齐,解决室内设计中空间可行性硬约束与美学偏好软约束的矛盾,生成既可行又美观的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04477 2026-06-23 cs.LG 版本更新 70%

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

基于数据的探索:面向人类反馈的在线强化学习

Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang, Lanjihong Ma, Masashi Sugiyama

机构 * Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院) Northeastern University(东北大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 提出数据依赖探索的偏好优化方法(DEPO),利用历史数据构建不确定性奖励,鼓励探索高价值区域,理论证明其数据依赖的遗憾界更紧,实验表明样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07930 2026-06-23 cs.CL 版本更新 70%

Patches of Nonlinearity: Instruction Vectors in Large Language Models

非线性补丁:大型语言模型中的指令向量

Irina Bigoulaeva, Jonas Rohweder, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity ATHENE, Germany(计算机科学系,达姆施塔特技术大学和应用网络安全国家研究中心ATHENE,德国)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 通过因果中介分析发现指令表示在模型中高度局部化,称为指令向量(IVs),并揭示其线性可分性与非线性因果交互并存,提出一种免于线性假设的新方法定位信息处理,发现IVs作为电路选择器。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24551 2026-06-23 cs.CV 版本更新 67%

PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation

PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成

Yuanhao Cai, Kunpeng Li, Menglin Jia, Jialiang Wang, Junzhe Sun, Feng Liang, Weifeng Chen, Felix Juefei-Xu, Chu Wang, Ali Thabet, Xiaoliang Dai, Xuan Ju, Alan Yuille, Ji Hou

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰霍普金斯大学) Meta BizAI(Meta商业人工智能)

专题命中 偏好对齐 :DPO(abstract,abstract_cn)

AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22019 2026-06-23 cs.LG cs.AI 新提交 62%

Channel Location Constrains the Auditability of Subliminal Learning

通道位置限制潜意识学习的可审计性

Tamas Madl

机构 * Austrian Research Institute for Artificial Intelligence(奥地利人工智能研究所) University of Vienna(维也纳大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究潜意识学习中隐藏特征传递的可审计性,发现通道位置决定审计有效性,并识别三种传递机制,证明审计必须匹配载体通道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21645 2026-06-23 cs.CL cs.LG 新提交 62%

Behavioral and Representational Evidence of Binomial Ordering Preferences in Large Language Models

大型语言模型中二项式排序偏好的行为与表征证据

Zhiqing Yang, Yilun Liu, Yunpu Ma, Volker Tresp, Hinrich Schütze

机构 * Ludwig Maximilian University of Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 通过多语言二项式数据集和分布度量,研究LLM对梯度频率分布的建模能力,发现模型虽能恢复主导顺序,但难以精确匹配偏好分布,并通过稀疏探针验证偏好强度在中间层编码且可操纵。

Comments Code and data are publicly available at https://github.com/Zhi-qing-Yang/Linguistic-Binomials-in-Large-Language-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21502 2026-06-23 cs.CL 新提交 57%

Towards Pedagogically Aligned LLM Tutors for Math Mistake Remediation

面向数学错误纠正的教学对齐LLM导师

Kseniia Petukhova, Tien Dat Nguyen, Ekaterina Kochmar

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出两阶段对齐流程(监督微调+偏好优化),结合合成数据提升LLM在数学错误纠正中的教学质量和事实准确性,优于基线模型并与专有模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新 57%

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21993 2026-06-23 cs.SE cs.CV 新提交 50%

From Driving Videos to Simulatable Scenarios

从驾驶视频到可模拟场景

Alexandre Levy, Ernest Valveny Llobet, Antonio Manuel López

机构 * Dept. Computer Science, Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学计算机科学系) Computer Vision Center (CVC), UAB(UAB计算机视觉中心)

专题命中 偏好对齐 :safety(abstract)

AI总结 提出D-V2S框架,通过视觉语言模型和大语言模型从驾驶视频自动生成可模拟场景,实现90%语义元素保留和75%偏好率。

Comments 8 pages, 11 figures and Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-06-23 cs.CV 新提交 50%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: https://phi-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01624 2026-06-23 cs.CV 版本更新 50%

PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

PISCES: 基于最优传输对齐奖励的无标注文本到视频后训练

Minh-Quan Le, Gaurav Mittal, Cheng Zhao, David Gu, Dimitris Samaras, Mei Chen

机构 * Microsoft(微软) Stony Brook University(石溪大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出PISCES算法,通过双重最优传输对齐奖励模块,无需人工标注即可提升文本生成视频的质量和语义对齐,在VBench上超越现有方法。

Comments Accepted to ICML 2026. Project page and code: https://roar-ai.github.io/pisces/

详情

展开后加载摘要…

URL PDF HTML 收藏