arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 150 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 18 篇

2511.01472 2026-06-30 cs.RO 50%

AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

AERMANI-VLM:基于视觉语言模型的空中 manipulation 的结构提示与推理

Sarthak Mishra, Rishabh Dev Yadav, Avirup Das, Saksham Gupta, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AERMANI-VLM框架,通过分离高层推理与低层控制,利用结构化提示生成自然语言推理轨迹,实现安全可靠的空中 manipulation 任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 越狱攻击 5 篇

2602.12418 2026-06-30 cs.CR cs.CL cs.LG 84%

Sparse Autoencoders are Capable LLM Jailbreak Mitigators

稀疏自编码器是LLM劫持攻击缓解器

Yannick Assogba, Jacopo Cortellazzi, Javier Abad, Pau Rodriguez, Xavier Suau, Arno Blaas

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于SAE的CC-Delta方法,通过比较带有和无劫持上下文的有害请求的token级表示,识别劫持相关的稀疏特征,从而在稀疏SAE特征空间中实现更优的安全-效用权衡。

Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026. 31 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10764 2026-06-30 cs.CV cs.AI 83%

Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization

打破刹车,而非车轮:通过熵最大化实现无目标越狱

Mengqi He, Xinyu Tian, Xin Shen, Shu Zou, Jinhong Ni, Zhaoyuan Yang, Weikang Li, Xuesong Li, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) The University Of Queensland(昆士兰大学) Peking University(北京大学) GE research(通用电气研究院) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 提出UJEM-KL攻击方法,通过最大化决策令牌的熵来翻转视觉-语言模型的拒绝输出,实现高迁移性的无目标越狱。

Comments Preprint. 17 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28981 2026-06-30 cs.CY 77%

Bad company corrupts good morals: Understanding and Measuring Narrative-Induced Moral Reasoning Degradation in LLMs

坏公司败坏好道德:理解与衡量叙事引发的LLM道德推理退化

Wanying Yu, Boyang Ma, Zhibo Eric Sun, Minghui Xu, Yue Zhang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 本研究提出BreakingBad框架,系统衡量负面叙事沉浸对LLM道德推理、行为及部署风险的影响,发现叙事暴露导致道德准确率下降12%-31%,且退化具有结构性,第一人称叙事影响更强,并传播至实际部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29441 2026-06-30 cs.CR cs.AI cs.CL cs.ET cs.LG 75%

Closing the Activation-Cone Blind Spot: Response-Time Probing and Unified Defense

关闭激活锥盲点:响应时间探测与统一防御

Subhadip Mitra

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型推理时安全方法,发现提示时激活防御对预填充攻击存在结构性盲点,提出响应时间探测(线性探针)结合停止机制,将预填充攻击成功率降至0,并与AlphaSteer组合实现正交防御。

Comments 27 pages, 12 figures, 18 tables. Code and data: https://github.com/bassrehab/response-time-probing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29649 2026-06-30 cs.CL 57%

Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages

VLM检测有害ASCII艺术的分辨率阈值:跨构建模式与语言的研究

Yikai Hua, Peter West

机构 * Department of Computer Science(计算机科学系) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 研究图像分辨率如何影响VLM检测有害ASCII艺术,发现检测率在特定分辨率阈值以上急剧下降,且基于单词的模式最难检测,揭示了VLM内容审核系统的系统性漏洞。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 2 篇

2606.29623 2026-06-30 cs.AI cs.LG 62%

SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings

SCARCE: 基于嵌入的可扩展级联分析用于罕见事件表征

Yingjie Wang, Yi Dong, Edmund Lau, Jie Meng, Taylor T Johnson, Xiaowei Huang

机构 * University of Liverpool, UK(利物浦大学) UK AI Security Institute, UK(英国人工智能安全研究所) Loughborough University, UK(洛桑大学) Department of Computer Science, Vanderbilt University, USA(范德比大学计算机科学系)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出SCARCE方法,用学习到的潜在表示和几何标尺替代传统子集模拟中的性能函数,通过自适应阈值构建嵌套事件,在MNIST误分类和LLM越狱任务中实现更低的估计误差和更好的可迁移性。

Comments 23 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28425 2026-06-30 cs.CR cs.AI 57%

Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems

工具使用使多智能体LLM系统中的隐写术无法检测

Jimmy Laurence Rippin, Simon C. Marshall, David Demitri Africa, Christian Schroeder de Witt

机构 * Oxford University(牛津大学) Artificial Intelligence Security Institute (AISI)(人工智能安全研究所)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 本文研究多智能体AI系统中通过工具使用(如代码执行、网络搜索)实现无法检测的隐写通信,发现智能体可自适应构建隐写系统,并提出协调度量评估无事先约定的隐写协调风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 7 篇

2606.29602 2026-06-30 cs.CR 85%

An Empirical Evaluation of Prompt Injection Vulnerabilities in Large Language Models Across Multilingual and Obfuscated Attack Scenarios

多语言与混淆攻击场景下大语言模型提示注入漏洞的实证评估

Caglar Uysal, Baturay Birinci, Süha Orhun Mutluergil, Orçun Çetin

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文实证评估六种大语言模型在多语言和混淆攻击下的提示注入漏洞,发现所有模型均易受攻击,非英语语言恶意合规率更高,需加强安全防御。

Comments Accepted to the AI-SS 2026 Workshop at the 21st European Dependable Computing Conference (EDCC 2026). To be published in the EDCC Companion Proceedings (EDCC-C)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12277 2026-06-30 cs.CL cs.AI cs.CR 81%

Prompt Injection as Role Confusion

提示注入作为角色混淆

Charles Ye, Jasmine Cui, Dylan Hadfield-Menell

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过角色探测和CoT伪造攻击,揭示提示注入源于LLM对文本来源的角色感知混淆,并提出角色混淆程度可预测攻击成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28649 2026-06-30 cs.CR cs.AI cs.RO 79%

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots

RIPA: 针对LLM控制的ROS 2机器人的感官向量提示注入攻击

Nima Dorzhiev

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出RIPA,首个通过感官管道对ROS 2机器人进行多通道提示注入攻击的系统研究,发现模型脆弱性不随规模单调变化,并提出混合语义防火墙。

Comments 12 pages, 4 figures, 10 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29960 2026-06-30 cs.CL 70%

IHDec: Divergence-Steered Contrastive Decoding for Securing Multi-Turn Instruction Hierarchies

IHDec:面向多轮指令层级安全性的散度引导对比解码

Nicole Geumheon Liu, Haeun Jang, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 针对多轮对话中指令层级失效问题,提出基于Jensen-Shannon散度的无训练对比解码方法IHDec,自动检测并抑制越级指令,优于训练基线且保持响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29142 2026-06-30 cs.CY cs.SE 57%

Agent Security Meets Regulatory Reality -- A Practitioner Systematization of Autonomous-Agent Threats and Controls in Regulated Financial Systems

代理安全遇上监管现实——受监管金融系统中自主代理威胁与控制的从业者系统化

Krishna Mohan, Guda Nagavenkata Srinivasa

专题命中 提示注入 :prompt injection(abstract);分类 cs.CY

AI总结 本文基于生产经验,将六类代理威胁映射到美欧金融监管义务,提出四种架构模式将手动流程自动化处理约80%案例,并报告三项负面结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI 57%

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28791 2026-06-30 cs.SE 50%

From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer

从确定性到委托:AI原生软件工程与智能体工程师的演进

Mamdouh Alenezi

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出AI原生软件工程是范式转变,定义新职业角色“智能体工程师”,其核心工件从程序转向智能体系统,并分析工作单元、正确性和问责制的三大转变。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2606.28963 2026-06-30 cs.CL cs.CY cs.LG 69%

Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data

超越均值:从小型试点数据对齐基于LLM的调查模拟器的三轴保真度

Eun Cheol Choi, Youngrae Kim, Prabhu Pugalenthi, Hong-En Chen, Bo-Ruei Huang

专题命中 幻觉与事实性 :alignment(abstract,comments);分类 cs.CL、cs.CY、cs.LG

AI总结 针对LLM模拟社会调查响应时的系统偏差,提出结构、边际和个体三轴保真度框架,通过提示、修正和微调三种方法对比,发现微调小型试点数据可实现平衡保真度,但保真度水平因子样本而异。

Comments 11 pages, 8 tables, 3 figures; Pluralistic Alignment @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28817 2026-06-30 eess.SY cs.SY 67%

Trust-Calibrated Certified Repair for Physics-Constrained Decisions under Localized Model Misspecification

面向局部模型误设下物理约束决策的信任校准认证修复

Yifan Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract)

AI总结 针对模型信任修复在局部模型误设下导致虚假安全的问题,提出信任校准认证修复(TCR),通过错误发现控制、测试门控收缩、不确定性比例安全裕度和认证修复程序,实现高可行性、低成本且可解释的修复。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28881 2026-06-30 cs.LG cs.AI 62%

An Integrated Machine Learning and Hierarchical Variance Decomposition Pipeline for Student Performance Prediction and Metacognitive Calibration on Multi-Signal Telemetry

一种用于多信号遥测的学生表现预测与元认知校准的集成机器学习与层次方差分解流水线

Gurdeep Singh Virdee

机构 * Fergana State Technical University(费尔干纳技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出UBP-CAP框架,集成LightGBM分类器、校准指标和交叉广义线性混合模型,引入预测-解释分歧指数(PEDI),在1195条记录上验证了系统性校准偏差和情境性校准特性。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07965 2026-06-30 cs.AI cs.LG 62%

When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning

当模型知道它不知道的时候:校准、级联和清洗

Chenjie Hao, Weyl Lu, Yuko Ishiwaka, Zengyi Li, Weier Wan, Yubei Chen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需训练的通用方法,通过校准、级联和数据清洗提升模型识别自身不确定性的能力,验证了校准置信度的可靠性及应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29654 2026-06-30 cs.AI cs.MA 57%

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

预算约束下的多智能体LLM“行动或延迟”协商与局部可靠性界限

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) General Motors (GM)(通用汽车(GM))

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出一种预算约束下的“行动或延迟”决策框架,通过k近邻下置信界评估LLM协商的可靠性,在满足用户指定的错误行动预算时自动执行,否则延迟人工审核,并在六个基准上验证了有效性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2601.03546 2026-06-30 cs.CL cs.AI cs.HC cs.LG 82%

Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict

大语言模型在隐私与亲社会冲突下的价值-行动对齐

Guanyu Chen, Chenxiao Yu, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型在隐私与亲社会冲突中的价值-行动对齐,通过多组结构方程模型分析隐私关注与亲社会性对数据共享的影响,提出价值-行动对齐率(VAAR)作为评估指标。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 58 篇

2606.28332 2026-06-30 cs.CY cs.AI 88%

When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries

当医疗安全对齐失败:评估LLMs在高风险医疗查询上的基准

Yige Li, Jun Sun, Wei Zhao, Zhe Li, Yutao Wu, Hanxun Huang, Xiang Zheng, Xingjun Ma

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 提出MedHarm基准,包含1100个高风险医疗查询,评估15个LLM在毒理学、药理学等10个安全关键类别上的表现,发现对齐模型仍可能产生不安全响应,医疗微调会加剧危害,外部护栏存在脆弱性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09288 2026-06-30 cs.CY 88%

AI Safety for Everyone

为所有人的人工智能安全

Balint Gyevnar, Atoosa Kasirzadeh

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文探讨了人工智能安全与高级AI系统存在风险的深刻联系,指出需考虑更广泛的安全挑战,而非仅限于生存风险。研究发现现有安全工作涵盖实际问题,如对抗鲁棒性和可解释性,强调需包容多元视角的AI安全观念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06096 2026-06-30 cs.LG cs.CL 88%

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

对齐审计员:一种用于验证和细化大语言模型目标的贝叶斯框架

Matthieu Bou, Nyal Patel, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(伦敦帝国学院) Amazon AGI(亚马逊通用人工智能)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);safety(abstract);trustworthy(abstract)

AI总结 本文提出一种贝叶斯框架,通过验证和细化LLM目标,解决逆强化学习中奖励函数推断的非识别性问题,提供可操作的诊断和验证政策效用的方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30256 2026-06-30 cs.AI cs.CY 81%

EMPATH: A Multilingual Auditor-Judge Benchmark for Safety Evaluation of Emotional-Support Chatbots

EMPATH:情感支持聊天机器人安全评估的多语言审计-评判基准

Camilo Chacón Sartori

机构 * MindSurf

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 提出EMPATH基准,通过审计模型模拟求助用户生成多轮对话,评判模型从19个指标评估安全,解决多语言多轮危机对话中的安全评估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14940 2026-06-30 cs.CL cs.AI 81%

CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

CASE-Bench:面向大语言模型的上下文感知安全基准

Guangzhi Sun, Xiao Zhan, Shutong Feng, Philip C. Woodland, Jose Such

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CASE-Bench,通过整合上下文信息评估大语言模型的安全性,揭示上下文对人类判断的显著影响,并发现商业模型在安全情境下的响应与人类判断存在明显偏差。

Comments 24 pages. This paper has been accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29685 2026-06-30 cs.LG 79%

CAREBench: A Child-Safety Risk Benchmark for Language Models

CAREBench:语言模型的儿童安全风险基准

Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson, Jay Caldwell, Sheriff Issaka, Skyler Wang, Francisco Guzmán, Steven Kelling, Jonas Mueller

机构 * Handshake AI University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 提出CAREBench基准,包含500个提示和12个风险类别,评估语言模型在儿童安全风险升级前的识别与应对能力,发现前沿模型失败率2%-58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI 79%

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29049 2026-06-30 cs.LG 79%

MOSAIC: Orchestrating Collaborative Knowledge Tracing with Hierarchical Semantic Alignment

MOSAIC: 通过层次语义对齐编排协作知识追踪

Xinjin Li, Mengyue Wang, Yuzhen Lin, Pengbin Feng, Ziqi Sha, Yeyang Zhou, Yu Ma

机构 * Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) School of Information Systems and Management, Carnegie Mellon University(信息系统与管理学院,卡内基梅隆大学) Department of Mathematics, University of Southern California(数学系,南加州大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Computer Science Department, UC San Diego(计算机科学系,UCSD)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出MOSAIC框架,利用冻结LLM生成动态嵌入和层次预测提示,结合跨粒度一致性目标,在协作知识追踪中实现多粒度掌握估计,在多个数据集上取得SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28863 2026-06-30 cs.CY cs.AI 79%

Defeat Devices in AI Systems

AI系统中的失效装置

Emilio Ferrara

机构 * Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AI系统在评估与部署环境间行为差异的共性机制——失效装置,定义了三要素判别测试,并论证其可在前沿AI系统中自然涌现,需系统监测。

Comments Final version published in Future Internet, 18(7), 339, 2026

Journal ref Future Internet, 18(7), 339 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏