arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 347 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2606.13994 2026-06-15 cs.CR cs.AI cs.LG 新提交 81%

Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

隐于无形:使用DECOMPBENCH基准测试代理安全对抗分解攻击

Vikhyath Kothamasu, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DeCompBench基准,通过分解攻击将有害任务拆分为良性子任务,揭示现有代理安全机制在对抗分解攻击时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12429 2026-06-12 cs.CY cs.AI 新提交 81%

Muse Spark Safety & Preparedness Report

Muse Spark 安全与准备报告

Cristina Menghini, Peter Ney, Hamza Kwisaba, Zifan, Wang, Miles Turpin, Felix Binder, Jean-Christophe Testud, Aidan Boyd, Nathaniel Li, Ivan Evtimov, Klaudia Krawiecka, Arman Zharmagambetov, Jeremy Kritz, Alexander R. Fabbri, Daniel Song, Jinpeng Miao, Joonas Hjelt, Meghna Ramani, Leona Lan, Reza Aghajani, Joanna Bitton, Mahesh Pasupuleti, Devin Norder, Khalid El-Arini, Paridhi Singh, Vítor Albiero, Sahana CB, Rashnil Chaturvedi, Elahe Dabir, Edoardo Debenedetti, Jim Gust, Ziwen Han, Kat He, Sean Hendryx, Lifeng Jin, Polina Kirichenko, Sandra Lefdal, Kenneth Li, Asad Liaqat, Inna Lin, Despoina Magka, Neal Mangaokar, Ishita Mediratta, Zach Miller, Smitha Milli, Niloofar Mireshghallah, Saba Nazir, Hung Nguyen, Maximilian Nickel, Kelvin Niu, Kerem Oktar, Bhargavi Paranjape, Parth Pathak, Maya Pavlova, Emmanuel Ramirez, David Renardy, Candace Ross, Yasha Sheynin, Claudia Shi, Shivam Singhal, Evangelia Spiliopoulou, Rakshith Sharma Srinivasa, Jamelle Watson-Daniels, Spencer Whitman, Adina Williams, Chen Xing, Andy Zou, Tommy Ma, Siqi Deng, James Beldock, Prashant Ratanchandani, Kate Plawiak, Taesung Lee, Ryan Victory, Lindsay Hundley, Rachad Alao, Himaghna Bhattacharjee, Jianfeng Chi, Gary Frost, Pegah Ghahremani, Niki Howe, Yuheng Huang, Saeed Jahed, Hannah Korevaar, Trang Le, Zhe Liu, Jinghong Luo, Qin Lyu, Nina Mehrabi, Abraham Montilla, Chirag Nagpal, Cyrus Nikolaidis, Rajvardhan Oak, Manoj Ravi, Vidya Sarma, Aman Shankar, Alana Shine, Eric Michael Smith, Mariana Tandon, Michael Tontchev, Caoyu Wang, Zihan Wang, Corinne Wong, Zheng Wu, Hongyuan Zhan, Justin Zhao, Zexuan Zhong, Chengxu Zhuang, Tristan Goodman, Ayaz Minhas, Harrison Rudolph, Victoria Jeffries, Ingrid Dickinson, Alex Vaughan, Lauren Deason, Kamalika Chaudhuri, Julian Michael, Shengjia Zhao, Summer Yue

机构 * Muse Spark

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 Meta 发布 Muse Spark 大语言模型,评估其在化学/生物、网络安全和失控风险等灾难性风险领域的安全性,通过多层缓解措施将风险降至可接受水平,并作为 Meta AI 的基础模型发布。

Comments 159 pages, 57 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09227 2026-06-09 cs.CR cs.AI cs.CE cs.CY cs.HC cs.SI 新提交 81%

Trustworthy Smart Fabs via Professional Proxies: Scaling Safe and Sustainable by Design (SSbD) through Industrial Data Spaces

通过专业代理实现可信智能晶圆厂:通过工业数据空间扩展安全与可持续设计(SSbD)

Han-Teng Liao, Chang-Yi Kao, Karen Ang

机构 * Independent Researcher Dept. Computer Science and Independent Researcher Information Management(独立研究员计算机科学系及独立研究员信息管理)

专题命中 安全训练 :trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 针对欧盟SSbD等法规带来的治理瓶颈,提出基于零信任的社会技术编排框架,通过硬件隔离信任区中的专业代理工作流,在工业数据空间中实现自主治理,解决数据主权悖论。

Comments This work was accepted for presentation at the 32nd IEEE ICE/ITMC Conference, Porto, Portugal, 2026 but was subsequently withdrawn prior to publication due to submission volume limits. It is currently under consideration for publication elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10740 2026-06-16 cs.AI cs.CL cs.LG 新提交 80%

When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

当思维链更清楚时:多轮推理模型的失败模式

Sai Kartheek Reddy Kasu, Nils Lukas, Samuele Poppi

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CoT-Output 2x2安全矩阵诊断多轮推理模型隐藏的时间动态失败,发现监督悖论和上下文注入失败两种可复现漏洞。

Comments Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13304 2026-08-14 cs.CL 新提交 79%

Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

拒绝意图,而非形式:基于包装器的意图组监督用于大语言模型安全

Ping Wu, Haibo Tong, Feifei Zhao, Han Shen, Yu Shi, Yilin Zhao, Sicheng Shen, Guobin Shen, Yun Luo, Yi Zeng

机构 * Ant Group(蚂蚁集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 该研究针对大语言模型安全调优的表面形式捷径问题,提出WIFA方法,结合两种微调路径提升有害内容拒绝能力并降低良性提示过度拒绝率,在Qwen和Llama上验证了效果。

Comments 23 pages, 11 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11705 2026-08-13 cs.AI 新提交 79%

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为

Lang Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11498 2026-08-13 cs.CV cs.ET cs.LG 新提交 79%

Language-Structured Relational Q-Learning for Threat-Aware Control in Safety-Critical Driving

面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习

Aditya Humnabadkar, Huaizhong Zhang, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 该研究针对安全关键驾驶,提出语言结构化关系Q学习(ERQ-Net),经2500个场景测试,提升了威胁感知能力但存在识别-控制差距,为相关策略学习提供了新视角。

Comments Accepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11451 2026-08-13 cs.RO cs.AI cs.SY eess.SY 新提交 79%

Herding End-to-End Autonomous Driving via Neuro-Symbolic Safety Guards

通过神经符号安全护卫实现端到端自动驾驶的引导

Simón Patiño Idarraga, Erick Silva, Rehana Yasmin, Ali Shoker

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 该研究针对端到端驾驶智能体违反交通规则的问题,提出无需重训的神经符号安全护卫,在Fail2Drive和Bench2Drive基准上使成功率提15%、安全碰撞降53%且保留原驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09443 2026-08-11 cs.AI 新提交 79%

Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity

面向多病老年患者个性化用药安全的耦合图-策略蒸馏方法

Zihan Wang, Anglin Liu, Rongyi Wang, Dantong Li, Yi Lu, Siqing Yuan, Hongxia Xu, Zhongtian Long, Jintai Chen

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出ATLAS框架与GeriMedBench基准,通过耦合图-策略蒸馏实现多病老年患者的个性化用药安全,在多基准测试中表现优于对比系统,获临床医生更高评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04415 2026-08-06 cs.CL 新提交 79%

Social Pressure Breaks Majority Voting in LLM Safety Panels

社交压力会破坏大语言模型安全评审团的多数投票机制

Yibo Hu, Jiaming Qu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amazon(亚马逊)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 该研究发现,在LLM安全评审团中,同行的错误标签断言会大幅提升误报率,且评审员更易追随“不安全”方向,多数投票机制会因社交压力失效,还提供了部署前诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26820 2026-07-30 cs.LG cs.CR 新提交 79%

Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

黑盒多轮交互中轨迹级安全风险预测

Shi Lin, Peng Qian, Dinghao Liu, Renjie Sun, Sifan Wu, Dezhang Kong, Chenpei Wang, Xun Wang

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出 Recast 框架,通过双尺度轨迹视图建模风险演变,可提前2.41轮预测88.3%的安全故障,误报率12.3%,实现轨迹级安全风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21646 2026-07-27 cs.LG 新提交 79%

Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning

作为非平稳强化学习安全约束的调整速度

Timothy Tomashevskiy

机构 * McMaster University(麦克马斯特大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究非平稳强化学习中的安全问题,提出以调整速度为安全约束,用上下文表示和预测估计适应需求,与智能体适应能力比较,超限时收紧动作集并激活屏蔽,实验验证该方法可减少安全违规,支持适应可行性原则。

Comments 15 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 79%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18506 2026-07-22 cs.CY 新提交 79%

AI Value Alignment for Evolving Social Norms

用于不断演变的社会规范的人工智能价值对齐

Nenad Tomašev, Matija Franklin, Simon Osindero

专题命中 安全训练 :alignment(title,abstract);分类 cs.CY

AI总结 研究人工智能价值对齐对社会规范演变的影响,引入基于社会物理学的数学建模框架,通过解析与模拟分析长期后果,强调价值锁定等风险,倡导用此模型作认知桥梁助力社会技术预见及大规模智能体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16247 2026-07-21 cs.LG cs.CV 新提交 79%

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety

用于主动具身安全的自进化即时记忆

Bingrui Sima, Lizhong Wang, Xiaoya Lu, Kun He, Xiao Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究视觉语言模型在闭环交互中应对动态危险的问题,提出自进化即时记忆框架,含RSG、事实记忆和经验记忆,并通过自动测试-验证-写入循环完善元技能,实验证明该框架大幅提升安全成功率且不阻碍任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-07-17 cs.AI cs.CR 新提交 79%

When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13594 2026-07-16 cs.AI 新提交 79%

SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

安全哨兵:通过执行-询问-拒绝路由实现上下文感知的人工干预

Tianyu Chen, Chujia Hu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究LLM智能体行动风险,将问题重构为三向路由决策,用安全哨兵实例化,其推理简化,单阈值可调整。该模型在准确率和召回率上优于多种基线,能同时控制错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10014 2026-07-14 cs.RO cs.LG cs.MA cs.SY eess.SY 新提交 79%

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤

Alex Zongo, Peng Wei

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。

Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 79%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06326 2026-07-08 cs.AI 新提交 79%

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard:用于无推理语言模型安全护栏的意图驱动推理主动训练

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究为开放世界应用的语言模型设计安全护栏的问题,提出基于推理主动训练、无推理推理范式的DT-Guard模型,通过构建意图驱动数据集等方法提升性能,实验证明其在安全基准测试中表现优异,能有效将推理监督内化到低延迟安全判别中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 79%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26575 2026-06-26 cs.RO cs.AI 新提交 79%

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control

IDEA: 通过效果对齐对动力学失配不敏感的模拟到现实迁移多智能体控制

Chenlong Liu, Zhuohui Zhang, Xinyan Chen, Zhipeng Wang, Bin Cheng, Bin He

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 提出一种通过效果对齐对动力学失配不敏感的模拟到现实迁移方法,结合随机环境结构与离散语义动作,并开发动作同步机制,提升多智能体系统在真实场景中的训练效率和成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 79%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22509 2026-06-23 cs.AI 新提交 79%

Imagine to Ensure Safety in Hierarchical Reinforcement Learning

想象以确保分层强化学习的安全性

Gregory Gorbov, Artem Latyshev, Aleksandr I. Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21822 2026-06-23 cs.PL cs.AI cs.SE 新提交 79%

CNnotator: LLM-Guided Memory Safety Annotation Synthesis

CNnotator: LLM引导的内存安全注释合成

Twain Byrnes, Mike Dodds

机构 * Carnegie Mellon University(卡内基梅隆大学) Galois, Inc.(Galois公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。

Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version

Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 79%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 安全训练 :trustworthy(title,abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15540 2026-06-16 cs.SD cs.AI cs.MM eess.AS 新提交 79%

AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

AP-GRPO: 基于锚定门控语音对齐与策略优化的病理语音重建

Pengfei Zhang, Hoang H Nguyen, Yutong Song, Wenjun Huang, Tahmid Imtiaz Imu, Henry Peng Zou, Jiang Wu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 针对神经退行性和神经运动障碍患者的病理语音,提出AP-GRPO框架,通过锚定门控奖励和语音对齐奖励优化语音语言模型,实现忠实重建,并揭示疾病特异性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15517 2026-06-16 cs.CL 新提交 79%

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

SHARD: 通过自我重构蒸馏实现安全且有益的校准

Viswonathan Manoranjan, Amogh Gupta, Anvesh Rao Vijjini, Thomas Hofweber, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.CL

AI总结 提出SHARD方法,通过哲学准则重构敏感提示以暴露良性意图,并自我重构响应,在保持安全性的同时提升帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14315 2026-06-15 cs.CY 新提交 79%

'AI Alignment' Encompasses Competing Technical Priorities

“AI对齐”包含相互竞争的技术优先级

Tushita Jha, Rory Svarc, Mateusz Bagiński

专题命中 安全训练 :alignment(title,abstract);分类 cs.CY

AI总结 本文指出AI对齐概念存在多种定义,不同研究项目下的对齐干预可能相互冲突,并建议研究者区分政策与科学范围、明确方法分歧、区分理想与代理指标、细化危害/收益来源、承认概念多样性。

Comments 9 pages, 0 figures, 2 tables, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09749 2026-06-09 cs.RO cs.LG 新提交 79%

Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models

你的模型已经知道:面向视觉-语言-动作模型的注意力引导安全过滤器

Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文发现VLA模型中的少数注意力头能可靠定位目标物体,利用这一特性提出无需训练的安全框架,结合控制障碍函数和实时目标跟踪器,实现动态障碍物下的碰撞避免,在动态场景中性能提升43%。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏