arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-13 至 2026-03-13 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2603.11126 2026-03-13 cs.MA cs.CL 85%

Enhancing Value Alignment of LLMs with Multi-agent system and Combinatorial Fusion

通过多智能体系统和组合融合增强大语言模型的价值对齐

Yuanhong Wu, Djallel Bouneffouf, D. Frank Hsu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出VAS-CFA框架,通过多智能体和组合融合提升大语言模型的价值对齐,实验证明其在标准度量上优于现有方法。

Comments 5 pages, 3 figures, accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11881 2026-03-13 cs.CL cs.AI 73%

Bielik-Minitron-7B: Compressing Large Language Models via Structured Pruning and Knowledge Distillation for the Polish Language

Bielik-Minitron-7B:通过结构化剪枝和知识蒸馏压缩大型语言模型以适应波兰语

Remigiusz Kinas, Paweł Kiszczak, Sergio P. Perez, Krzysztof Ociepa, Łukasz Flis, Krzysztof Wróbel, Adrian Gwoździej

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 Bielik-Minitron-7B通过结构化剪枝和知识蒸馏将Bielik-11B-v3.0模型压缩至7.35B参数,优化波兰语性能,实现90%的性能恢复和50%的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12246 2026-03-13 cs.AI cs.CL cs.LG 67%

Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training

检验推理LLM作为裁判在不可验证LLM后续训练中的表现

Yixin Liu, Yue Yu, DiJia Su, Sid Wang, Xuewei Wang, Song Jiang, Bo Liu, Arman Cohan, Yuandong Tian, Zhengxing Chen

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过受控合成设置检验推理LLM作为裁判在非验证LLM后续训练中的效果,发现推理裁判能生成高性能策略,但易受对抗性输出影响,揭示了其在实际政策训练中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11661 2026-03-13 cs.SD 67%

Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models

Resonate:通过来自大音频语言模型的在线反馈强化文本到音频生成

Xiquan Li, Junxi Liu, Wenxi Chen, Haina Zhu, Ziyang Ma, Xie Chen

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 Resonate通过整合在线GRPO和大音频语言模型奖励,提升文本到音频生成的音频质量和语义对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11563 2026-03-13 cs.CV cs.RO 67%

SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning

SVLL:分阶段视觉-语言学习用于物理基础的具身任务规划

Yuyuan Yang, Junkun Hong, Hongrong Wang, Honghao Cai, Xunpeng Ren, Ge Wang, Mingcong Lei, Shenhao Yan, Jiahao Yang, Chengsi Yao, Xi Li, Yiming Zhao, Yatong Han, Jinke Ren

机构 * FNii-Shenzhen, CUHKSZ(FNii深圳,CUHKSZ) SSE, CUHKSZ(SSE,CUHKSZ) SAI, CUHKSZ(SAI,CUHKSZ) Shenzhen University(深圳大学) University of Sydney(悉尼大学) Harbin Engineering University(哈尔滨工程大学) Ising AI

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 SVLL 通过分阶段学习和 Bias-DPO 对齐目标,实现稳健的物理基础具身任务规划,提升任务成功率并减少物理约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01204 2026-03-13 cs.LG 57%

Subliminal Signals in Preference Labels

偏好标签中的潜意识信号

Isotta Magistrali, Frédéric Berdoz, Sam Dauncey, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 研究揭示偏好标签可能传递潜意识行为特征,挑战传统二进制监督假设,强调需机制检测并缓解潜意识偏好传输以确保超对齐的稳健监督。

Comments Accepted at AITW@ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12247 2026-03-13 cs.CV 50%

Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation

相信你的批评者:用于忠实图像编辑和生成的鲁棒奖励建模与强化学习

Xiangyu Zhao, Peiyuan Zhang, Junming Lin, Tianhao Liang, Yuchen Duan, Shengyuan Ding, Changyao Tian, Yuhang Zang, Junchi Yan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) BUPT(北京邮电大学) CUHK(香港中文大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出FIRM框架,通过定制数据集和鲁棒奖励模型,提升图像编辑和生成的忠实性与指令遵循,采用'基础与奖励'策略平衡一致性与质量,实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11494 2026-03-13 cs.DB 50%

PRMB: Benchmarking Reward Models in Long-Horizon CBT-based Counseling Dialogue

PRMB:基于长期horizon认知行为疗法对话的奖励模型基准测试

Yougen Zhou, Qin Chen, Ningning Zhou, Jie Zhou, Liang He

专题命中 偏好对齐 :alignment(abstract)

AI总结 PRMB提出了一种用于评估奖励模型在多会话CBT咨询中长期效果的基准,揭示了现有方法的不足并展示了生成奖励模型的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏