arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-13 至 2026-04-13 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2601.23045 2026-04-13 cs.AI 57%

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

AI的混乱:模型智能与任务复杂性如何影响对齐问题

Alexander Hägele, Aryo Pradipta Gema, Henry Sleight, Ethan Perez, Jascha Sohl-Dickstein

机构 * Anthropic Fellows Program(Anthropic 研究员计划) EPFL(瑞士联邦理工学院洛桑) University of Edinburgh(爱丁堡大学) Constellation Anthropic

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了高智能AI模型在复杂任务中失败的机制,发现模型规模越大,失败行为越不一致,强调对齐研究在防止奖励黑客和目标误指定中的重要性。

Comments ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08691 2026-04-13 cs.SI cs.AI 57%

AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society

AgentSociety: 基于大语言模型的生成代理大规模模拟推动对人类行为与社会的理解

Jinghua Piao, Yuwei Yan, Jun Zhang, Nian Li, Junbo Yan, Xiaochong Lan, Zhihong Lu, Zhiheng Zheng, Jing Yi Wang, Di Zhou, Chen Gao, Fengli Xu, Fang Zhang, Ke Rong, Jun Su, Yong Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出AgentSociety平台,通过大规模模拟人类行为和社会动态,探索社会问题如极化、虚假信息传播等,验证其在社会科学研究中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG 57%

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-04-13 cs.LG q-bio.GN 57%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏