arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-23 至 2026-04-23 共收录 67 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 17 篇

2604.20496 2026-04-23 cs.CR cs.AI 57%

Mythos and the Unverified Cage: Z3-Based Pre-Deployment Verification for Frontier-Model Sandbox Infrastructure

神话与未验证的笼子:基于Z3的预部署验证用于前沿模型沙盒基础设施

Dominik Blain

机构 * COBALT Formal Verification(COBALT形式验证)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出COBALT,一种基于Z3的正式验证引擎,用于在部署前检测C/C++基础设施中的CWE-190/191/195算术漏洞模式。通过四个生产案例验证其有效性,并提出四层 containment 框架以提升前沿模型的安全性。

Comments 12 pages, 2 figures, 4 production case studies, 4 tables. Research paper on formal verification for frontier-model sandbox infrastructure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13871 2026-04-23 cs.LG cs.SY eess.SY 57%

Hardware-Efficient Neuro-Symbolic Networks with the Exp-Minus-Log Operator

高效硬件神经符号网络与Exp-Minus-Log运算符

Eymen Ipek

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出一种结合深度神经网络与Exp-Minus-Log运算符的混合模型,旨在解决传统DNN在安全关键和资源受限环境中的透明性和计算效率问题,通过硬件可实现的Sheffer元素提升可解释性和形式验证可行性。

Comments This paper has been withdrawn by the authors due to the discovery of a fundamental limitation in EML method

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20811 2026-04-23 cs.AI 57%

Diagnosing CFG Interpretation in LLMs

在LLM中诊断CFG解释

Hanqi Li, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) AISpeech Co., Ltd., Suzhou, China(上海AI语音有限公司) Shanghai Innovation Institution, Shanghai, China(上海创新研究所) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究LLM在处理新上下文无关文法时能否生成语法正确、行为功能和语义忠实的输出,揭示LLM在语法、行为和语义层面的层次退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20490 2026-04-23 cs.IR 50%

Break the Optimization Barrier of LLM-Enhanced Recommenders: A Theoretical Analysis and Practical Framework

突破LLM增强推荐系统优化障碍:理论分析与实践框架

Zhangchi Zhu, Wei Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过理论分析和实践框架,解决LLM增强推荐系统中优化障碍问题,提出TF-LLMER框架,通过嵌入规范化和Rec-PCA方法提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20429 2026-04-23 cs.CV 50%

Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing

快速-精细:一种用于遥感跨模态检索的两阶段框架,具有多粒度表示

Xi Chen, Xu Chen, Xiangyang Jia, Xu Zhang, Shuquan Wei, Wei Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种两阶段框架,通过多粒度表示提升遥感跨模态检索效率与精度,采用文本无关召回和文本引导重排序阶段,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20067 2026-04-23 q-fin.TR 50%

Testing replication for an agent-based model of market fragmentation and latency arbitrage

对代理基于市场碎片化和延迟套利模型的复制性检验

Ethan Ratliff-Crain, Colin M. Van Oort, Matthew T. K. Koehler, Brian F. Tivnan

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过复制Wah和Wellman 2016年的延迟套利模型,发现原论文中缺失的实现细节和有限的定量报告阻碍了准确复制。通过增加模拟次数生成置信区间,弥补了分布信息的不足,并指出模型复杂性与对齐难度成正比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16879 2026-04-23 cs.CV 50%

Adaptive Forensic Feature Refinement via Intrinsic Importance Perception

通过内在重要性感知实现自适应的 forensic 特征细化

Jiazhen Yang, Junjun Zheng, Kejia Chen, Xiangheng Kong, Jie Lei, Zunlei Feng, Bingde Hu, Yang Gao

机构 * Zhejiang University(浙江大学) Alibaba Inc(阿里巴巴公司) Zhejiang University of Technology(浙江工业大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出I2P框架,通过自适应识别关键层表示并约束任务驱动的参数更新,提升SID任务的特定性同时保留预训练表示的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏