arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-27 至 2026-04-27 共收录 35 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 6 篇

2604.22548 2026-04-27 stat.AP cs.LG 57%

Multi-output Extreme Spatial Model for Complex Aircraft Production Systems

多输出极值空间模型用于复杂飞机生产系统

Cheolhei Lee, Xing Wang, Xiaowei Yue, Jianguo Wu

机构 * Grado Department of Industrial and Systems Engineering, Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学工业与系统工程系) Department of Mathematics, Illinois State University(伊利诺伊州立大学数学系) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) Department of Industrial Engineering and Management, Peking University(北京大学工业工程与管理系)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出多输出极值空间模型,用于复杂飞机生产系统中的极值预测与风险分析,通过双域线性函数捕捉动态,提升极端事件预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22166 2026-04-27 cs.CL 57%

Fine-Grained Analysis of Shared Syntactic Mechanisms in Language Models

语言模型中共享句法机制的细粒度分析

Ryoma Kumon, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) RIKEN(日本理化学研究所) Tohoku University(东北大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过细粒度分析探讨语言模型在不同句法结构中是否共享神经机制,发现填词-缺口依赖在早期至中期层有高度局部化的共享机制,而否定极性项目许可则无统一机制。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22432 2026-04-27 cs.SE 50%

R2Code: A Self-Reflective LLM Framework for Requirements-to-Code Traceability

R2Code:一种用于需求到代码追溯的自反思大语言模型框架

Yifei Wang, Jacky Keung, Xiaoxue Ma, Zhenyu Mao, Kehui Chen, Yishu Li

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出R2Code框架,通过分解增强的双向对齐网络、自反思一致性验证模块和动态上下文适应检索机制,提升需求到代码追溯的准确性并降低推理成本。

Comments Accepted to IEEE COMPSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22291 2026-04-27 cs.CR cs.SE 50%

Train in Vain: Functionality-Preserving Poisoning to Prevent Unauthorized Use of Code Datasets

无效训练:功能保持污染以防止未经授权使用代码数据集

Yuan Xiao, Jiaming Wang, Yuchen Chen, Wei Song, Jun Sun, Shiqing Ma, Yanzhou Mu, Juan Zhai, Chunrong Fang, Jin Song Dong, Zhenyu Chen

专题命中 其他安全 :safety(abstract)

AI总结 本文提出FunPoison,一种保持功能的污染方法,通过注入可编译的弱使用片段来有效防止未经授权的数据集使用,同时保持100%的编译正确性。

Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026). Code is available at: https://github.com/xiaoyuanpigo/FunPoison

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17624 2026-04-27 cs.HC 50%

Developing Models of Procedural Skills using an AI-assisted Text-to-Model Approach

利用AI辅助的文本到模型方法开发程序技能模型

Rahul K. Dass, Shubham Puri, Arpit Khandelwal, Xiao Jin, Ashok K. Goel

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种AI辅助的文本到模型方法,通过本体约束提示和模板生成,将教学材料转化为完整的任务-方法-知识模型,显著降低结构化程序技能表示的构建成本,使大规模AI辅导系统部署成为可能。

Comments 10 pages. To appear in Proceedings of the 13th ACM Conference on Learning at Scale (L@S '26)

详情

展开后加载摘要…

URL PDF HTML 收藏