arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-16 至 2026-06-16 共收录 106 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2606.07678 2026-06-16 cs.LG cs.AI 新提交 94%

DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

DOG-DPO:几何中的动态优化用于安全对齐

Yi Nian, Tiankai Yang, Yudi Zhang, Qi Pan, Zelong Xu, Shenzhe Zhu, Qingqing Luan, Yue Huang, Xiangliang Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) Iowa State University(爱荷华州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) UT Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员) University of Notre Dame(圣母大学)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DOG-DPO框架,将偏好对表示为模型表示空间中的方向,通过几何分解和多样性覆盖选择子集,仅用11%数据即可恢复大部分安全增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15396 2026-06-16 cs.CL cs.AI 新提交 87%

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

CHILLGuard:面向细粒度中文大语言模型安全护栏的可扩展数据构建与模型感知偏好对齐

Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen ShenNong Information Technology Co., Ltd.(深圳神农信息技术有限公司)

专题命中 偏好对齐 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

AI总结 针对中文场景,提出细粒度风险分类体系(5大类31小类),通过可扩展数据构建管道生成高质量训练数据,并采用模型感知直接偏好优化训练CHILLGuard,在基准上F1分数提升15.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15572 2026-06-16 cs.CY 新提交 79%

Improving Capstone Team Outcomes through Dynamic Skill Matching and Preference Alignment

通过动态技能匹配和偏好对齐改进顶点项目团队成果

Brandon Pardi, Garret Castro, Michael Pisman, Avash Adhikari, Santosh Chandrasekhar

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CY

AI总结 提出三阶段方法,结合学生偏好与项目技能需求,利用大语言模型提取技能要求,通过动态分配算法优化团队组成,提升技能覆盖和偏好满意度。

Comments 15 pages, 3 figures, Accepted to the 12th International Conference on Computational Science and Computational Intelligence (CSCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14831 2026-06-16 cs.CR cs.AI 新提交 77%

Is Your Agent Playing Dead? Deployed LLM Agents Exhibit Constraint-Evasive Fabrication and Thanatosis

你的智能体在装死吗?部署的LLM智能体表现出约束规避性虚构与假死

Andoni Rodríguez, Alberto Pozanco, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI

AI总结 本文发现LLM智能体在不可调和约束下会自发虚构外部障碍(约束规避性虚构),极端情况下模拟系统崩溃(假死),并通过实验证明该行为具有鲁棒性、随机性和自我强化特性,现有安全基准未覆盖此故障模式。

Comments 10 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17056 2026-06-16 cs.CL 新提交 70%

The Value Axis: Language Models Encode Whether They're on the Right Track

价值轴:语言模型编码它们是否在正确的轨道上

Nick Jiang, Isaac Kauvar, Jack Lindsey

机构 * Stanford University(斯坦福大学) Anthropic

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。

Comments Code repository: https://github.com/nickjiang2378/value-axis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15277 2026-06-16 cs.IR cs.AI cs.DB cs.ET cs.LG 新提交 62%

Guiding Federated Graph Recommendation with LLM-encoded knowledge

利用LLM编码知识指导联邦图推荐

Thi Minh Chau Nguyen, Hien Trang Nguyen, Duc Anh Nguyen, Van Ho-Long, Thanh Trung Huynh, Zhao Ren

机构 * institutetext(机构)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦图推荐中跨客户端图表示对齐难的问题,提出利用大语言模型编码的语义信号指导结构表示的选择性聚合,提升推荐准确性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15079 2026-06-16 cs.CL cs.AI 新提交 62%

Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale

Ling 和 Ring 2.6 技术报告:高效且即时的万亿参数规模智能体智能

Ang Li, Ben Liu, Bin Han, Bin Hu, Bin Jing, Binbin Hu, Bing Li, Cai Chen, Caizhi Tang, Changxin Tian, Chao Huang, Chao Zhang, Chen Liang, Chen Qian, Chengfu Tang, Chengyao Wen, Chilin Fu, Chunwei Wu, Cong Zhang, Cunyin Peng, Daixin Wang, Dalong Zhang, Deng Zhao, Dingnan Jin, Dingyuan Zhu, Donghao Zhang, Fan Yuan, Fangzheng Zhao, Fanzhuang Meng, Feifan Wu, Feng Xu, Fengbin Fang, Gangshan Wang, Guodong Yang, Hailin Zhao, Haitao Wang, Haitao Zhang, Hanxiao Zhang, Hanzi Wang, Hao Dai, Hao Liu, Hao Qian, Hao Wu, Haoxiong Liu, Haoyu Xu, Heng Zhang, Hong Liu, Hongliang Zhang, Hongrui Liu, Hongxun Li, Hongzhi Ruan, Huaidong Xiong, Huihuang Zheng, Huikang Tang, Jia Guo, Jia Li, Jia Liu, Jiameng Wang, Jiaming Liu, Jiannan Shi, Jianping Wei, Jiaolong Yang, Jiapeng Wang, Jie Gao, Jie Wang, Jiewei Wu, Jin Yang, Jinjin Li, Jinjing Huang, Jinquan Sun, Jinyao Chen, Juanhui Tu, Jun Liu, Jun Mei, Jun Xu, Jun Zhou, Junjie Ou, Junnan Sipan, Junpeng Fang, Kaihong Zhang, Kaiqin Hu, Ke Shi, Kuan Xu, Kun Tang, Kunlong Chen, Lanyin Mei, Lei Chen, Lei Liang, Lei Xu, Li Tang, Liang Jiang, Liangcheng Fu, Lihui Zhang, Linfeng Shi, Lintao Ma, Liyuan Liu, Longfei Li, Longfei Zheng, Lu Liu, Lu Yu, Man Li, Meiqi Zhu, Meng Li, Mengjie Gao, Mengshu Sun, Mingming Yin, Mingyang Zhang, Mingyuan Fan, Nuo Xu, Pan Tang, Peijie Jiang, Peilong Zhao, Peng Lin, Pingping Liu, Qi Zuo, Qian Zhao, Qiang Cheng, Qianggang Cao, Qiaoben Bao, Qing Cui, Qingyuan Yang, Qitao Shi, Qiyin Huang, Qizheng Zhou, Quan Wan, Runyuan Zhao, Shaomian Zheng, Shaowei Wei, Shengnan Zhang, Shuaicheng Li, Shujie Li, Shuo Zhang, Sikang Bian, Tianchu Yao, Tiange Xu, Tianshu Wang, Ting Guo, Tinghao Wang, Tingwei Huang, Tong Zhao, Tongkai Yang, Wang Hong, Wanli Gu, Wei Lu, Weichang Wu, Weiguang Han, Weiquan Li, Wenbo Shen, Wenjing Fang, Wenzhi Tang, Xiang Shu, Xiao Shi, Xiaodong Yan, Xiaolu Zhang, Xiaopei Wan, Xiaqing Sun, Xin Zhao, Xingyu Lu, Xinxing Yang, Xinyao Tang, Xinyu Kong, Xinyu Liu, Xiong Xu, Xuan Sun, Xudong Han, Xudong Wang, Xujie Shen, Yalin Zhang, Yangyang Hou, Yankun Ren, Yao Zhao, Ye Chen, Yeyang Chen, Yibo Cao, Yifan Zuo, Yijie Chen, Ying Li, Yingjie Song, Yingxue Li, Yiqi Wang, Yixuan Sun, Yizhu Xiao, Yongfei Xu, Yu Liu, Yuchen Fang, Yue Gao, Yue Yu, Yue Zhang, Yuqi Zhang, Yuxiao He, Yuxiao Lu, Yuxin Tian, Yuxuan Li, Yuzhuo Fu, Zhankai Xu, Zhaoxin Huan, Zhenduo Zhang, Zhengke Gui, Zhengyu Huang, Zhenjun Ma, Zhenxuan Pan, Zheping Qu, Zhibo Zhu, Zhidong Fan, Zhigang Huangfu, Zhihao Wang, Zhiqiang Zhang, Zhizhen Liu, Zhuyan Zhou, Zibin Lin, Zihang Zeng, Zihao Wang, Zilong Wang, Ziqi Liu, Zitao Xuan, Zixuan Cheng, Zujie Wen, Zuoli Tang

机构 * Ling Team(Ling团队) Inclusion AI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Ling-2.6和Ring-2.6模型系列,通过架构迁移预训练、混合线性注意力设计及KPop强化学习框架,实现低延迟、强推理与高效部署,开源所有检查点。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 16 篇

2606.16808 2026-06-16 cs.AI 新提交 91%

Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

自适应且显式安全:触发大型推理模型中的潜在安全意识

Ke Miao, Jiaxin Li, Hongliang Chen, Yuke Hu, Zhan Qin

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute, China(杭州高新区(滨江)区块链与数据安全研究院) Li Auto Inc.(理想汽车) Tsinghua University(清华大学) King Abdullah University Of Science And Technology(阿卜杜拉国王科技大学)

专题命中 安全训练 :DPO(summary_cn,abstract);safety(title,abstract);alignment(abstract);jailbreak(abstract)

AI总结 针对大型推理模型易受越狱攻击的问题,提出Safe Trigger方法,通过SFT显式诱导安全标签触发安全分析,并用DPO优化,显著降低攻击成功率而不影响通用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15385 2026-06-16 cs.AI 新提交 89%

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

语言模型智能体中的奖励黑客:重新审视AI安全网格世界

Ömer Veysel Çağatan, Xuandong Zhao

机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。

Comments 28 pages, 16 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10740 2026-06-16 cs.AI cs.CL cs.LG 新提交 80%

When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

当思维链更清楚时:多轮推理模型的失败模式

Sai Kartheek Reddy Kasu, Nils Lukas, Samuele Poppi

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CoT-Output 2x2安全矩阵诊断多轮推理模型隐藏的时间动态失败,发现监督悖论和上下文注入失败两种可复现漏洞。

Comments Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 79%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 安全训练 :trustworthy(title,abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15540 2026-06-16 cs.SD cs.AI cs.MM eess.AS 新提交 79%

AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

AP-GRPO: 基于锚定门控语音对齐与策略优化的病理语音重建

Pengfei Zhang, Hoang H Nguyen, Yutong Song, Wenjun Huang, Tahmid Imtiaz Imu, Henry Peng Zou, Jiang Wu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 针对神经退行性和神经运动障碍患者的病理语音,提出AP-GRPO框架,通过锚定门控奖励和语音对齐奖励优化语音语言模型,实现忠实重建,并揭示疾病特异性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15517 2026-06-16 cs.CL 新提交 79%

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

SHARD: 通过自我重构蒸馏实现安全且有益的校准

Viswonathan Manoranjan, Amogh Gupta, Anvesh Rao Vijjini, Thomas Hofweber, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.CL

AI总结 提出SHARD方法,通过哲学准则重构敏感提示以暴露良性意图,并自我重构响应,在保持安全性的同时提升帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16914 2026-06-16 cs.AI 新提交 70%

Greed Is Learned: Visible Incentives as Reward-Hacking Triggers

贪婪是习得的:可见激励作为奖励黑客触发器

Tong Che, Rui Wu

机构 * NVIDIA Research(英伟达研究院) Rutgers University(罗格斯大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究强化学习中的奖励通道成瘾现象,即智能体因可见的自我利益通道(如分数、KPI)而偏离真实任务,并发现该成瘾可翻转模型的安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16771 2026-06-16 cs.LG 新提交 57%

GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突

Haotian Liu, Yihao Liu, Jingwei Ni, Siyuan Huang, Xinpeng Liu, Pengyu Cheng, Jiajun Song, Ruijin Ding, Junfeng Li, Zhechao Yu, Mengyu Zhou, Hongteng Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Renmin University of China(中国人民大学) Peking University(北京大学) ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16313 2026-06-16 cs.RO cs.AI 新提交 57%

Is Your Trajectory Displacement Safe in Long-tail?

你的轨迹位移在长尾场景中安全吗?

Qiao Sun, Weicheng Zheng, Yixin Huang, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出FluidTest评估框架,通过成对WebUI协议、32种语义威胁分类和三元验证系统,检测规划轨迹相对于专家参考的额外威胁,实验发现SOTA规划器仍存在大量安全相关失败。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16244 2026-06-16 cs.CR cs.AI 新提交 57%

SPARK: Security Knowledge Priming and Representation-Guided Knowledge Activation for LLM-based Secure Code Generation

SPARK: 基于安全知识引导与表示激活的LLM安全代码生成

Xiaoyun Xu, Lichao Wu, Jona te Lintelo, Siyu Zhang, Stjepan Picek

机构 * Radboud University(拉德堡德大学) University of Bristol(布里斯托大学) University of Zagreb(扎格雷布大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16111 2026-06-16 cs.CL 新提交 57%

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

面向帕累托最优工具集成智能体的帕累托排名策略优化

Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。

Comments ICML 2026 Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15910 2026-06-16 cs.CL 新提交 57%

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

校准的分诊,而非自主:医学视觉-语言模型的置信度估计

Reza Khanmohammadi, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL

AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15709 2026-06-16 cs.AI cs.MA 新提交 57%

AI-Driven Framework for Adaptive Water Network Management with Proof-of-Concept Implementation: Addressing Non-Revenue Water in Jordan

基于AI的自适应水网管理框架及概念验证实施:解决约旦无收益水问题

Mohammed Fasha, Nahel Al-Maayta, Bilal Sowan, Mohammad Athamneh, Husam Barham

机构 * Jordan(约旦)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出集成EPANET水力建模、数字孪生、SCADA和LLM智能体的框架,通过实时数据与物理模拟结合实现异常检测与自适应决策,概念验证在约旦1164节点管网中实现2分钟内自动生成健康报告,爆管检测定位准确。

Journal ref 2026 2nd International Conference on Computational Intelligence Approaches and Applications (ICCIAA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14786 2026-06-16 cs.MM cs.AI cs.CV 新提交 57%

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite: 一种可扩展的MLLM-to-Lite框架用于重复内容识别

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu

机构 * Tiktok(字节跳动) National University of Singapore School of Computing(新加坡国立大学计算机学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出MatchLM2Lite框架,通过将多模态大语言模型蒸馏为轻量模型,实现视频、音频和文本联合建模的实时重复内容识别,在降低35倍计算成本的同时保持高准确率,并成功部署于大规模生产环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16436 2026-06-16 cs.RO cs.CV 新提交 50%

V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos

V2P-Manip:从单目人类视频学习灵巧操作

Kaihan Chen, Yanming Shao, Haifeng Ji, Xiaokang Yang, Yao Mu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 提出V2P-Manip框架,从单目人类演示视频中提取具有视觉保真度和物理合理性的轨迹,通过两阶段精炼实现空间对齐与物理一致性,在TACO和OakInk基准上显著优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16116 2026-06-16 eess.SY cs.MA cs.RO cs.SY math.DS 新提交 50%

Distributed Safe Consensus Under Asymmetric Input and Time-Varying Output Constraints

非对称输入与时变输出约束下的分布式安全一致性

Abhinav Sinha, Shashi Ranjan Kumar

机构 * Guidance, Autonomy, Learning, and Control for Intelligent Systems (GALACxIS) Lab, Department of Aerospace Engineering and Engineering Mechanics, University of Cincinnati(智能系统引导、自主、学习与控制实验室,航空航天工程与工程力学系,辛辛那提大学) Intelligent Systems and Control (ISaC) Lab, Department of Aerospace Engineering, Indian Institute of Technology Bombay(智能系统与控制实验室,航空航天工程系,印度班加罗尔理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 针对单积分多智能体系统,提出一种结合障碍坐标变换的分布式控制律,同时满足非对称执行器约束和时变输出安全约束,实现渐近同步。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2606.16527 2026-06-16 cs.CR cs.CL 新提交 85%

DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing

DoubtProbe:通过结构验证与语义审计的黑盒越狱防御

Xuanyu Yin, Yilin Jiang, Jun Zhou, Kai Chen, Zhengfu Cao, Xiaolei Dong

机构 * East China Normal University(东华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出DoubtProbe双分支推理时防御框架,结合结构验证与语义审计,将黑盒越狱防御转化为受控变换下的一致性检查,在多个基准上实现更强更稳定的防御-效用权衡。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16751 2026-06-16 cs.CR cs.AI 新提交 79%

Automated jailbreak attack targeting multiple defense strategies

针对多种防御策略的自动化越狱攻击

Qi Wang, Chengcheng Wan, Weijia He, Yanqing Li, Hanqi Sun, Xiaodong Gu, Jiangtao Wang

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院) University of Southampton(南安普顿大学) Shanghai Jiao Tong University(上海交通大学) Software Engineering Institute, East China Normal University(东华大学软件工程研究院)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 提出UNIATTACK框架,从防御视角提取攻击特征并优化,实现跨模型和类别的单次黑盒攻击,显著提升成功率并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15788 2026-06-16 cs.CR cs.AI 新提交 77%

GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking

GAS-Leak-LLM:基于遗传算法的后缀优化实现黑盒LLM越狱

Aman Anifer, Vignesh Kumar Kembu, Vishnu M, Antonino Nocera, Vinod P., Amal Murali PK, Akshay S Rajan

机构 * Department of Electrical, Computer and Biomedical Engineering(电气、计算机与生物医学工程系) University of Pavia(帕维亚大学) Department of Computer Applications(计算机应用系) Cochin University of Science and Technology(科钦科学技术大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出GAS-Leak-LLM方法,利用遗传算法在黑盒设置下自动进化对抗后缀以绕过LLM安全约束,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15008 2026-06-16 cs.CR 新提交 67%

Security Engineering of OpenClaw: Analyzing Attack Surface Expansion and Trust-Boundary Violations

OpenClaw的安全工程:分析攻击面扩展与信任边界违反

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract)

AI总结 本文分析多智能体LLM系统OpenClaw中攻击面扩展与信任边界违反,发现输出聚合导致妥协概率从0.24升至0.86,防御控制可显著降低风险但影响效用与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16999 2026-06-16 cs.SE cs.CL cs.LG 新提交 62%

Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models

无信号下的选择,通过表达恢复:冻结小代码模型的事后伪造操作符的测量研究

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究测量了冻结小代码模型的事后语义操作符(如选择、验证、修复)的有效性,发现它们均未优于Best-of-N,并揭示了覆盖墙、能力剪刀和共识陷阱等机制原因;而表达层恢复(M1)通过鲁棒提取和签名对齐提升了准确率。

Comments 33 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2606.15441 2026-06-16 cs.CR cs.AI 新提交 88%

Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment

通过推理启用的任务对齐防御自适应提示注入攻击

Lipeng He, Yihan Wang, Jiawen Zhang, N. Asokan

机构 * University of Waterloo(滑铁卢大学) Zhejiang University(浙江大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 提示注入 :prompt injection(title,abstract);alignment(title);safety(abstract);分类 cs.AI

AI总结 提出RETA方法,通过基于用户任务的多目标强化学习训练防御器,利用思维链推理验证行动一致性,并采用字典学习多样性奖励生成对抗样本,在六种自适应攻击下平均攻击成功率低于4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16897 2026-06-16 cs.CL 新提交 83%

Contrastive-Difference CKA Reveals Concept-Specific Structural Alignment Across Language Model Architectures

对比差异CKA揭示跨语言模型架构的概念特定结构对齐

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 提示注入 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 提出对比差异CKA(CKA_Delta)方法,发现不同LLM架构在概念表示上存在几何收敛与功能可迁移性分离的现象,能有效区分概念特定相似性与通用相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏