arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-04 至 2026-06-04 共收录 134 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 22 篇

2605.25402 2026-06-04 cs.CV cs.AI 57%

Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation

解剖锚定的自监督:蒸馏视觉基础模型用于不变超声表示

Chunzheng Zhu, Yijun Wang, Jianxin Lin, Feng Wang, Hongwei Wang, Lei Zhao, Shengli Li, Kenli Li

机构 * Hunan University(湖南大学) Shenzhen Maternity and Child Healthcare Hospital(深圳妇幼保健医院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出解剖锚定的超声自监督框架ANAUS,通过可学习潜在提示引擎和领域自适应实现无标注解剖分割,并设计双策略自监督学习(语义感知解剖分离对齐和上下文核心区域预测)来增强表示学习,在六个公开数据集上超越现有方法。

Comments MICCAI 2026 Accepted Paper; Anatomy-Anchored Ultrasound Self-Supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09627 2026-06-04 cs.LG cs.RO cs.SY eess.SY 57%

Barrier-Certified Adaptive Reinforcement Learning with Applications to Brushbot Navigation

具有应用的障碍证书自适应强化学习:Brushbot导航

Motoya Ohnishi, Li Wang, Gennaro Notomista, Magnus Egerstedt

机构 * School of Electrical Engineering, Royal Institute of Technology(皇家理工学院电气工程学院) Georgia Institute of Technology(佐治亚理工学院) RIKEN Center for Advanced Intelligence Project(日本理化学研究所高级智能研究中心) School of Mechanical Engineering(机械工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种安全学习框架,结合自适应模型学习算法和障碍证书,用于具有可能非平稳智能体动态的系统。通过稀疏优化技术提取模型的动态结构,并利用学习的模型结合控制障碍证书来约束策略(反馈控制器),以保持安全性,即避免特定的不利状态空间区域。在某些条件下,保证了在安全被非平稳性破坏后,以李雅普诺夫稳定性的方式恢复安全。此外,将动作-价值函数近似重新公式化,使任何基于内核的非线性函数估计方法都能应用于我们的自适应学习框架。最后,保证了障碍证书策略优化的解是全局最优的,确保在温和条件下进行贪心策略改进。所得到的框架通过四旋翼无人机的模拟进行验证,该无人机此前在安全学习文献中被假设为平稳性,然后在动态未知、高度复杂且非平稳的Brushbot机器人上进行测试。

Comments ©2019 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref Published in IEEE Transactions on Robotics, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.00035 2026-06-04 cs.RO cs.LG cs.SY eess.SY stat.ML 57%

Autonomous Highway Driving using Deep Reinforcement Learning

使用深度强化学习实现自动驾驶高速公路驾驶

Subramanya Nageshrao, Eric Tseng, Dimitar Filev

机构 * Ford Greenfield Labs(福特绿谷实验室) Ford Research and Innovation Center(福特研究与创新中心)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于强化学习的方法,通过与模拟交通直接交互,使自动驾驶车辆在复杂和多变的环境中做出决策,解决了传统规则和预设成本函数在实时优化中的不足,提高了学习效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.01487 2026-06-04 cs.AI cs.SY eess.SY 57%

Designing a Safe Autonomous Artificial Intelligence Agent based on Human Self-Regulation

基于人类自我调节设计安全的自主人工智能代理

Mark Muraven

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出通过研究人类自我调节机制,设计安全的人工智能代理,以避免复杂系统中因目标不明确导致的有害后果。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.07313 2026-06-04 eess.SY cs.AI cs.LO cs.RO cs.SY 57%

Safe Control under Uncertainty

在不确定性下的安全控制

Dorsa Sadigh, Ashish Kapoor

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Probabilistic Signal Temporal Logic(PrSTL)用于定义随机属性并确保概率保证,通过该逻辑合成安全控制器,应用于四旋翼和自动驾驶车辆等案例。

Comments 10 pages, 6 figures, Submitted to HSCC 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04149 2026-06-04 cs.RO 50%

CoPark: Learning Reactive Parking via Self-Play

CoPark:通过自我对弈学习反应式泊车

Jiarong Wei, Yanxing Chen, Sinuo Song, Yin Wu, Anna Rehr, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE(CARIAD SE公司) Technical University of Munich(慕尼黑技术大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出CoPark,一种基于残差策略的多智能体自我对弈强化学习方法,通过固定先验与残差头结合,在反应式泊车中实现高精度与安全交互的平衡,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.05506 2026-06-04 eess.SY cs.SY 50%

Enhancing the performance of a safe controller via supervised learning for truck lateral control

通过监督学习增强安全控制器的性能以用于卡车侧向控制

Yuxiao Chen, Ayonga Hereid, Huei Peng, Jessy Grizzle

专题命中 安全训练 :safety(abstract)

AI总结 本文结合监督学习与控制屏障函数,设计了兼具高性能与可证明安全性的控制器,通过轨迹优化生成训练集,利用监督学习生成控制策略,并通过CBF保证安全,验证了该方法在卡车车道保持中的有效性。

Comments submitted to IEEE Transaction of Control System Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.04537 2026-06-04 eess.SY cs.SY 50%

Cloud Resource Allocation for Cloud-Based Automotive Applications

面向云基础汽车应用的云资源分配

Zhaojian Li, Tianshu Chu, Ilya V. Kolmanovsky, Xiang Yin, Xunyuan Yin

专题命中 安全训练 :safety(abstract)

AI总结 本文研究云基础汽车系统的资源分配问题,提出集中化和去中心化模型,分别用于私有云和公有云,通过优化算法提升服务质量与资源利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 越狱攻击 6 篇

2605.20654 2026-06-04 cs.LG cs.AI 86%

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

REFLECTOR: 内化逐步反思以对抗间接越狱

Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出REFLECTOR两阶段框架,通过教师引导生成反思数据并进行监督微调,再结合强化学习内化自主反思能力,在复杂间接攻击下实现超过90%的防御成功率,同时提升通用性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06911 2026-06-04 cs.CR cs.AI 85%

TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering

TamperBench:系统化压力测试微调和篡改下的LLM安全性

Saad Hossain, Tom Tseng, Punya Syon Pandey, Samanvay Vajpayee, Matthew Kowal, Nayeema Nonta, Samuel Simko, Stephen Casper, Zhijing Jin, Kellin Pelrine, Sirisha Rambhatla

机构 * Critical ML Lab Waterloo Canada(Waterloo大学Critical ML实验室) FAR.AI Berkeley USA(伯克利美国FAR.AI公司) University of Toronto Toronto Canada(多伦多大学) University of Waterloo Waterloo Canada(Waterloo大学) ETH Zürich Zürich Switzerland(苏黎世联邦理工学院) MIT CSAIL Cambridge USA(麻省理工学院CSAIL实验室) University of Toronto, MPI, EuroSafeAI, Vector Institute Toronto Canada(多伦多大学、马克斯·普朗克研究所、EuroSafeAI、Vector Institute) Critical ML Lab University of Waterloo Waterloo Canada(Waterloo大学Critical ML实验室)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出统一框架TamperBench,通过系统化超参数扫描评估21个开源LLM在9种篡改威胁下的安全性和实用性,发现越狱微调是最严重攻击,当前对齐阶段防御基本失效。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04612 2026-06-04 cs.CL 70%

Hybrid Adversarial Defence for Natural Language Understanding Tasks

混合对抗防御用于自然语言理解任务

Manar Abouzaid, Yang Wang, Chenghua Lin, Stuart E. Middleton

机构 * School of Electronics and Computer Science, University of Southampton, UK(南安普顿大学电子与计算机科学学院) Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL

AI总结 提出一种结合熵、不确定性和几何特征的混合防御框架,在多个自然语言理解数据集上同时提升了干净任务性能和对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01576 2026-06-04 cs.CV 69%

Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models

Robust-LLaVA:大规模鲁棒图像编码器对多模态大语言模型的有效性

Hashmat Shadab Malik, Fahad Shamshad, Muzammal Naseer, Karthik Nandakumar, Fahad Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) Khalifa University(卡利法大学) Michigan State University(密歇根州立大学) Australian National University(澳大利亚国立大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);trustworthy(comments)

AI总结 本文提出利用大规模对抗预训练的图像分类模型替代CLIP编码器,以增强多模态大语言模型对视觉对抗扰动的鲁棒性,在无需额外对抗训练的情况下,在视觉问答、图像描述和越狱攻击任务中取得显著鲁棒性提升。

Comments Accepted at Trustworthy FMs Workshop Trust Before Use: Building Foundation Models that You Can Trust (ICCVW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04027 2026-06-04 cs.CR cs.AI 57%

MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models

MaskForge:用于越狱扩散大语言模型的结构感知自适应攻击

Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu, Minhui Xue, Yue Zhao, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) University of Southern California(南加州大学) Responsible AI Research (RAIR) Centre, The University of Adelaide(阿德莱德大学负责任人工智能研究中心)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出MaskForge,一种全黑盒自适应攻击方法,通过优化结构模式库实现扩散大语言模型的红队测试,平均攻击成功率达79.3%。

Comments 28 pages, 7 figures, 11 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15741 2026-06-04 cs.CV 50%

HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion

HyperDiT: 用于高保真像素空间扩散的超连接Transformer

Yu He, Lichen Ma, Zipeng Guo, Xinyuan Shan, Jingling Fu, Dong Chen, Junshi Huang, Yan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 针对像素空间扩散模型中全局语义与细粒度细节难以兼顾的粒度困境,提出HyperDiT框架,通过超连接跨尺度交互和尺度感知旋转位置编码,结合预训练视觉基础模型的密集语义,在像素空间实现高保真生成,在ImageNet 256×256上取得1.56的SoTA FID。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 2 篇

2606.05101 2026-06-04 cs.SD cs.LG 79%

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

FoeGlass: 简单的上下文学习足以对音频深度伪造检测器进行红队测试

Sepehr Dehdashtian, Jacob H Seidman, Vishnu N Boddeti, Gaurav Bharaj

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 红队测试 :red teaming(title,abstract);分类 cs.LG

AI总结 提出FoeGlass,一种基于大语言模型上下文学习的黑盒自动红队方法,通过生成音频样本发现深度伪造检测器的盲点,将假阴性率降低高达94%。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23694 2026-06-04 cs.AI cs.CL cs.CR 73%

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

SafeSearch: 基于LLM的搜索代理的自动化红队测试

Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 红队测试 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeSearch自动化红队框架,系统评估基于LLM的搜索代理在五个风险类别中的安全性,发现GPT-4.1-mini在搜索工作流中攻击成功率高达90.5%,且常见防御措施效果有限。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2606.04141 2026-06-04 cs.CR cs.AI 57%

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

当场抓获(激活):面向LLM智能体的凭证泄露预输出和多轮检测

Kargi Chauhan, Pratibha Revankar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究通过激活探针、蜜令令牌和累积信息流追踪三种互补防御方法,在预输出和多轮对话中检测LLM智能体的凭证泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 9 篇

1812.07410 2026-06-04 cs.LG cs.SY eess.SY stat.ML 79%

An Improved Deep Belief Network Model for Road Safety Analyses

一种改进的深度信念网络模型用于道路安全分析

Guangyuan Pan, Liping Fu, Lalita Thakali, Matthew Muresan, Ming Yu

机构 * Intelligent Transportation Systems Research Center(智能交通系统研究中心) Wuhan University of Technology(武汉理工大学) University of Waterloo(滑铁卢大学) Department of Civil & Environmental Engineering(土木与环境工程系) Department of Electrical & Computer Engineering(电气与计算机工程系)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.LG

AI总结 本文提出了一种改进的深度信念网络模型,用于提升道路安全分析中的碰撞预测能力,通过两个案例研究展示该模型在预测性能上的优势,并与其他传统模型进行比较。

Journal ref Transportation Research Board 97th Annual Meeting, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04274 2026-06-04 cs.CL cs.CY 73%

Long Live Fine-Tuning: Task-Specific Transformers Outperform Zero-Shot LLMs for Misinformation Response Classification on Reddit

长存微调:在Reddit上,任务特定Transformer在错误信息响应分类中优于零样本LLM

JooYoung Lee, Lin Tian, Angela Brillantes, Adriana-Simona Mihăiţă, Marian-Andrei Rizoiu

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 通过对比微调模型与零样本LLM在Reddit错误信息评论分类上的表现,发现微调RoBERTa在宏F1分数上显著优于最佳零样本模型,且成本更低,表明任务特定微调在检测隐性错误信息方面仍更可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04262 2026-06-04 cs.CL cs.AI 62%

Can I Take Another Dose? Evaluating LLM Decision-Making Under Temporal Uncertainty in OTC Dosing QA

我可以再服一剂吗?评估LLM在OTC剂量问答中时间不确定性下的决策能力

Maroof Kousar, Yibo Hu

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出DOSEBENCH基准测试,评估大语言模型在非处方药剂量问答中处理时间推理、约束遵循和不确定性的能力。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04444 2026-06-04 cs.NI cs.AI 57%

vLLM Semantic Router: Signal Driven Decision Routing for Mixture-of-Modality Models

vLLM Semantic Router: 面向多模态混合模型的信号驱动决策路由

Xunzhuo Liu, Huamin Chen, Samzong Lu, Yossi Ovadia, Guohong Wen, Hao Wu, Zhengda Tan, Jintao Zhang, Senan Zedan, Yehudit Kerido, Liav Weiss, Haichen Zhang, Bishen Yu, Asaad Balum, Noa Limoy, Abdallah Samara, Baofa Fan, Brent Salisbury, Ryan Cook, Zhijie Wang, Qiping Pan, Rehan Khan, Avishek Goswami, Houston H. Zhang, Shuyi Wang, Ziang Tang, Fang Han, Zohaib Hassan, Jianqiao Zheng, Avinash Changrani, Xue, Liu, Bowei He

机构 * MBZUAI(穆斯林人工智能研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出vLLM Semantic Router框架,通过可组合信号编排(13种异构信号类型和布尔决策规则)实现多模态模型部署中的智能请求路由,支持不同场景的差异化策略配置。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.01577 2026-06-04 cs.RO cs.LG cs.SY eess.SY 57%

Episodic Learning with Control Lyapunov Functions for Uncertain Robotic Systems

具有控制李雅普诺夫函数的不确定性机器人系统的经验学习

Andrew J. Taylor, Victor D. Dorobantu, Hoang M. Le, Yisong Yue, Aaron D. Ames

机构 * California Institute of Technology(加州理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于控制李雅普诺夫函数的机器学习框架,用于适应机器人系统中的参数不确定性和未建模动态,通过迭代更新李雅普诺夫函数导数的估计和改进控制器,最终获得一个稳定性的二次规划基于控制器,并在平面Segway模拟中验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10702 2026-06-04 eess.SY cs.SY math.OC 50%

Cautious Model Predictive Control using Gaussian Process Regression

基于高斯过程回归的谨慎模型预测控制

Lukas Hewing, Juraj Kabzan, Melanie N. Zeilinger

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种结合高斯过程回归的模型预测控制方法,用于建模非线性动力系统,通过考虑残余不确定性来实现安全控制。

Comments Published in IEEE Transactions on Control Systems Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.08095 2026-06-04 eess.SY cs.SY 50%

Control Theory Meets POMDPs: A Hybrid Systems Approach

控制理论与POMDPs的交汇:一种混合系统方法

Mohamadreza Ahmadi, Nils Jansen, Bo Wu, Ufuk Topcu

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种将控制理论应用于POMDPs的方法,通过混合系统方法确定POMDPs的可达信念空间,并利用Lyapunov函数的子水平集进行过估计,同时提出屏障证书定理以验证安全性和最优性要求。

Comments arXiv admin note: text overlap with arXiv:1810.00093

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.05607 2026-06-04 eess.SY cs.SY 50%

Learning for DC-OPF: Classifying active sets using neural nets

为直流最优功率流学习:利用神经网络分类主动集

Deepjyoti Deka, Sidhant Misra

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出利用神经网络分类算法学习不确定性实现与最优解主动集之间的映射,从而提高实时预测的计算效率,并在IEEE PES PGLib-OPF基准库中多个系统上展示了该方法的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.03823 2026-06-04 eess.SY cs.SY 50%

Verification of Uncertain POMDPs Using Barrier Certificates

使用屏障证书验证不确定POMDPs

Mohamadreza Ahmadi, Murat Cubuktepe, Nils Jansen, Ufuk Topcu

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文研究不确定POMDPs的验证问题,通过将POMDP转化为切换系统并利用屏障证书方法,结合求和平方编程实现最优性和安全性的验证,以火星探测器为例验证方法有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

1710.02770 2026-06-04 cs.LO cs.SE cs.SY eess.SY 78%

Proceedings 2nd International Workshop on Causal Reasoning for Embedded and safety-critical Systems Technologies

第二届嵌入式和安全关键系统技术因果推理国际研讨会论文集

Alex Groce, Stefan Leue

专题命中 隐私与版权 :safety(title,abstract)

AI总结 本文探讨了复杂嵌入式和安全关键系统中因果推理的方法,旨在促进不同领域研究者之间的交流,以提升关键系统故障根本原因分析的科学性。

Journal ref EPTCS 259, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18879 2026-06-04 cs.LG cs.AI cs.CL 67%

ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models

ZeroUnlearn:大语言模型中的少样本知识遗忘

Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ZeroUnlearn框架,通过模型编辑将机器遗忘重新定义为精确的知识重映射问题,利用封闭解乘法参数更新实现高效、定向的少样本遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 25 篇

2509.02655 2026-06-04 cs.CY cs.AI 87%

BioBlue: Systematic runaway-optimiser-like LLM failure modes on biologically and economically aligned AI safety benchmarks for LLMs with simplified observation format

BioBlue:在生物与经济对齐的AI安全基准上,具有简化观察格式的LLM的系统性类失控优化失败模式

Roland Pihlakas, Sruthi Susan Kuriakose

机构 * Independent researcher(独立研究者) Three Laws research collaboration(Three Laws研究合作) Rakvere, Estonia(爱沙尼亚拉克雷市)

专题命中 安全评测 :safety(title);AI safety(title);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究通过长期控制环境测试LLM,发现尽管LLM能理解目标,但在多目标场景下会系统性偏离至单目标、无界优化行为,表现出类似失控优化的失败模式。

Comments 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14760 2026-06-04 cs.CL 83%

Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation

推理边界:通过测试时深思增强规范对齐

Haoran Zhang, Yafu Li, Xuyang Hu, Dongrui Liu, Zhilin Wang, Bo Li, Yu Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 提出Align3方法,利用测试时深思(TTD)和分层反思修正来推理规范边界,并构建SpecBench基准,实验表明TTD能有效增强规范对齐。

Comments 10 pages main text, 52 pages total (including appendix). Code and resources are available at https://github.com/zzzhr97/SpecBench

详情

展开后加载摘要…

URL PDF HTML 收藏