arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-08 至 2026-06-08 共收录 65 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 17 篇

2606.06531 2026-06-08 cs.AI quant-ph 新提交 57%

CARVE-Q: Quantum-Proposed, Classically Certified Interactive Driving Repair

CARVE-Q:量子提议、经典认证的交互式驾驶修复

Yifan Wang

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 针对被否决的驾驶操作,提出CARVE-Q架构,通过量子最小搜索加速修复格搜索,同时保持安全认证的经典性,实现可审计的交互修复。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03280 2026-06-08 cs.AI 版本更新 57%

A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting

Pythia多跳设置中跨模型激活迁移的负面结果

Peiyan Zhang, Jason Xin

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究在Pythia-160M到Pythia-410M的多跳推理设置中,通过线性翻译层传递隐藏状态是否能够改善下游回答,结果发现离线表示对齐不足以实现有用的因果通信。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17948 2026-06-08 cs.CR cs.AI cs.MA 版本更新 57%

RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs

RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络

Parteek Jamwal, Minghao Shao, Boyuan Chen, Achyuta Muthuvelan, Asini Subanya, Boubacar Ballo, Kashish Satija, Mariam Shafey, Mohamed Mahmoud, Moncif Dahaji Bouffi, Pasindu Wickramasinghe, Siyona Goel, Yaakulya Sabbani, Hakim Hacid, Mthandazo Ndhlovu, Eleanna Kafeza, Sanjay Rawat, Muhammad Shafique

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07380 2026-06-08 cs.CL 版本更新 57%

Mining Useful General Data for Low-Resource Domain Adaptation

挖掘低资源领域适应的有用通用数据

Pingjie Wang, Hongcheng Liu, Yusheng Liao, Ziqing Fan, Yaxin Du, Shuo Tang, Yanfeng Wang, Yu Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对低资源领域数据稀缺问题,提出NTK-Selector方法,利用神经正切核从通用数据中筛选有用样本,显著提升领域适应效果。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07034 2026-06-08 cs.CV 新提交 50%

ForensicConcept: Transferable Forensic Concepts for AIGI Detection

ForensicConcept: 用于AIGI检测的可迁移取证概念

Menyanshu Zhou, Ziyin Zhou, Ke Sun, Yunpeng Luo, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出ForensicConcept框架,通过Transformer归因定位关键补丁、构建概念码本并利用扩散特征对齐,实现AI生成图像检测中可迁移取证概念的提取与跨骨干网络迁移。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏