arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-16 至 2026-04-16 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2604.13079 2026-04-16 cs.CY cs.AI cs.GT cs.LG 87%

Alignment as Institutional Design: From Behavioral Correction to Transaction Structure in Intelligent Systems

对齐作为制度设计:从行为修正到智能系统中的交易结构

Rui Chai

机构 * Shanghai Sanda University(上海沙达大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出将AI对齐视为制度设计,通过内部交易结构使对齐行为成为各组件的低成本策略,将对齐问题转化为政治经济学问题。

Comments This is Paper 5 in a 10-paper series on Super-Alignment via Wuxing Institutional Architecture. It shifts alignment from external behavioral correction to internal institutional design, making aligned behavior the lowest-cost equilibrium

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13828 2026-04-16 cs.CL 79%

MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment

MUSE:通过自演化档案和评分引导对齐实现多领域中文用户模拟

Zihao Liu, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Peng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Meituan(美团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 MUSE通过自演化档案和评分引导对齐,生成逼真且行为一致的中文用户响应,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13551 2026-04-16 cs.CL cs.IR 79%

Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate

辩论以对齐:通过双阶段多智能体辩论实现可靠的实体对齐

Cunda Wang, Ziying Ma, Po Hu, Weihua Wang, Feilong Bao

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning, Central China Normal University, Wuhan, China(湖北人工智能与智能学习省级重点实验室,中央财经大学,武汉,中国) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机科学学院,武汉,中国) National Language Resources Monitoring and Research Center for Network Media, Central China Normal University, Wuhan, China(网络媒体语言资源监测与研究中心,中央财经大学,武汉,中国) College of Computer Science, Inner Mongolia University, Hohhot, China(内蒙古大学计算机学院,呼和浩特,中国) National and Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, Inner Mongolia University, Hohhot, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,内蒙古大学,呼和浩特,中国) Inner Mongolia Key Laboratory of Multilingual Artificial Intelligence Technology, Inner Mongolia University, Hohhot, China(内蒙古多语言人工智能技术重点实验室,内蒙古大学,呼和浩特,中国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出AgentEA框架,通过双阶段多角色辩论机制提升实体对齐的可靠性,实验表明其在跨语言、稀疏、大规模和异构场景下均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13602 2026-04-16 cs.LG 77%

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

大模型时代的奖励黑客:机制、涌现偏差、挑战

Xiaohua Wang, Muzhao Tian, Yuqi Zeng, Zisu Huang, Jiakang Yuan, Bowen Chen, Jingwen Xu, Mingbo Zhou, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学NLP小组)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 本文探讨大模型中奖励黑客的机制与挑战,提出代理压缩假说框架,分析优化过程中的表现偏差和对抗性行为,提出检测与缓解策略。

Comments 42 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL 70%

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13598 2026-04-16 cs.LG stat.ME 57%

Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning

通过证据感知奖励和自校正偏好学习增强放射科报告生成

Qin Zhou, Guoyan Liang, Qianyi Yang, Jingyuan Chen, Sai Wu, Chang Yao, Zhe Wang

机构 * Department of Computer Science and Engineering, ECUST(电子科技大学计算机科学与工程系) Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, P. R. China(教育部能源化工过程智能制造重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出ESC-RL方法,结合证据感知对齐奖励和自校正偏好学习,提升放射科报告生成的临床准确性与持续改进能力,实验表明其在胸部X光数据集上表现优异。

Comments 13 pages,4 figures, ACL2026-main

详情

展开后加载摘要…

URL PDF HTML 收藏