arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

2606.12429 2026-06-12 cs.CY cs.AI 新提交 81%

Muse Spark Safety & Preparedness Report

Muse Spark 安全与准备报告

Cristina Menghini, Peter Ney, Hamza Kwisaba, Zifan, Wang, Miles Turpin, Felix Binder, Jean-Christophe Testud, Aidan Boyd, Nathaniel Li, Ivan Evtimov, Klaudia Krawiecka, Arman Zharmagambetov, Jeremy Kritz, Alexander R. Fabbri, Daniel Song, Jinpeng Miao, Joonas Hjelt, Meghna Ramani, Leona Lan, Reza Aghajani, Joanna Bitton, Mahesh Pasupuleti, Devin Norder, Khalid El-Arini, Paridhi Singh, Vítor Albiero, Sahana CB, Rashnil Chaturvedi, Elahe Dabir, Edoardo Debenedetti, Jim Gust, Ziwen Han, Kat He, Sean Hendryx, Lifeng Jin, Polina Kirichenko, Sandra Lefdal, Kenneth Li, Asad Liaqat, Inna Lin, Despoina Magka, Neal Mangaokar, Ishita Mediratta, Zach Miller, Smitha Milli, Niloofar Mireshghallah, Saba Nazir, Hung Nguyen, Maximilian Nickel, Kelvin Niu, Kerem Oktar, Bhargavi Paranjape, Parth Pathak, Maya Pavlova, Emmanuel Ramirez, David Renardy, Candace Ross, Yasha Sheynin, Claudia Shi, Shivam Singhal, Evangelia Spiliopoulou, Rakshith Sharma Srinivasa, Jamelle Watson-Daniels, Spencer Whitman, Adina Williams, Chen Xing, Andy Zou, Tommy Ma, Siqi Deng, James Beldock, Prashant Ratanchandani, Kate Plawiak, Taesung Lee, Ryan Victory, Lindsay Hundley, Rachad Alao, Himaghna Bhattacharjee, Jianfeng Chi, Gary Frost, Pegah Ghahremani, Niki Howe, Yuheng Huang, Saeed Jahed, Hannah Korevaar, Trang Le, Zhe Liu, Jinghong Luo, Qin Lyu, Nina Mehrabi, Abraham Montilla, Chirag Nagpal, Cyrus Nikolaidis, Rajvardhan Oak, Manoj Ravi, Vidya Sarma, Aman Shankar, Alana Shine, Eric Michael Smith, Mariana Tandon, Michael Tontchev, Caoyu Wang, Zihan Wang, Corinne Wong, Zheng Wu, Hongyuan Zhan, Justin Zhao, Zexuan Zhong, Chengxu Zhuang, Tristan Goodman, Ayaz Minhas, Harrison Rudolph, Victoria Jeffries, Ingrid Dickinson, Alex Vaughan, Lauren Deason, Kamalika Chaudhuri, Julian Michael, Shengjia Zhao, Summer Yue

机构 * Muse Spark

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 Meta 发布 Muse Spark 大语言模型,评估其在化学/生物、网络安全和失控风险等灾难性风险领域的安全性,通过多层缓解措施将风险降至可接受水平,并作为 Meta AI 的基础模型发布。

Comments 159 pages, 57 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09227 2026-06-09 cs.CR cs.AI cs.CE cs.CY cs.HC cs.SI 新提交 81%

Trustworthy Smart Fabs via Professional Proxies: Scaling Safe and Sustainable by Design (SSbD) through Industrial Data Spaces

通过专业代理实现可信智能晶圆厂:通过工业数据空间扩展安全与可持续设计(SSbD)

Han-Teng Liao, Chang-Yi Kao, Karen Ang

机构 * Independent Researcher Dept. Computer Science and Independent Researcher Information Management(独立研究员计算机科学系及独立研究员信息管理)

专题命中 安全训练 :trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 针对欧盟SSbD等法规带来的治理瓶颈,提出基于零信任的社会技术编排框架,通过硬件隔离信任区中的专业代理工作流,在工业数据空间中实现自主治理,解决数据主权悖论。

Comments This work was accepted for presentation at the 32nd IEEE ICE/ITMC Conference, Porto, Portugal, 2026 but was subsequently withdrawn prior to publication due to submission volume limits. It is currently under consideration for publication elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28583 2026-05-28 cs.RO cs.AI cs.LG cs.SY eess.SY 81%

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

SARAD:基于LLM的安全感知混合强化学习与碰撞预测在自动驾驶中的应用

Kangyu Wu, Peng Cui, Guoxi Chen, Ya Zhang

机构 * National Natural Science Foundation (NNSF) of China(中国国家自然科学基金委员会) National Science and Major Project(国家科学技术重大专项)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出SARAD框架,结合大语言模型和深度强化学习,通过检索增强生成和碰撞预测模块提升自动驾驶的安全性和效率。

Comments 7 pages, 4 figures, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23954 2026-05-26 cs.CL cs.AI cs.SD 81%

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs

EchoDistill:面向鲁棒音频大语言模型的噪声到干净自蒸馏对齐

Liang Lin, Chunxi Luo, Kaiwen Luo, Jie Zhang, Jin Wang, Yuanhe Zhang, Cai Yuchen, Qiankun Li, Gongli Xi, Zhenhong Zhou, Kun Wang, Junhao Dong

机构 * NTU(国立台湾大学) SHU(上海大学) ICT, CAS(中国科学院信息科技研究院) HDU(华中科技大学) BUPT(北京邮电大学) USTC(中国科学技术大学) SKL-NST, BUPT(北京邮电大学国家智能计算研究中心)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出EchoDistill框架,通过冻结的干净音频教师模型指导噪声学生模型进行组相对策略优化,实现噪声到干净的自蒸馏对齐,提升音频大语言模型在复杂噪声下的语义可靠性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16938 2026-05-19 cs.CL cs.AI q-bio.NC 81%

Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

努力作为上限,而非调节器:推理预算不影响人类与大推理模型之间的认知成本对齐

Yueqing Hu, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨了推理预算是否影响人类与大推理模型之间的认知成本对齐,发现无论推理努力如何变化,对齐情况保持不变,表明这种对齐是在训练时形成的,而非在推理时动态调整。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14454 2026-05-15 cs.LG cs.CL cs.CR 81%

LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

LiSA: 通过保守策略诱导实现终身安全适应

Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 LiSA通过结构化记忆提升固定基础防护机制,在稀疏反馈下优于记忆基基线,保持噪声反馈下的鲁棒性,并推动延迟-性能前沿。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14366 2026-05-15 cs.CL cs.LG 81%

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

基于语义奖励的强化学习实现低资源语言扩展而不产生对齐税

Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

机构 * Minzu University of China(中国民族大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hainan International College, Minzu University of China(中国民族大学海南国际学院)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于语义空间对齐的GRPO方法,通过嵌入层语义奖励优化,减少对预训练知识的破坏性干扰,提升低资源语言扩展效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05329 2026-05-08 cs.AI cs.LG 81%

Understanding Annotator Safety Policy with Interpretability

通过可解释性理解标注者安全政策

Alex Oesterling, Donghao Ren, Yannick Assogba, Dominik Moritz, Sunnie S. Y. Kim, Leon Gatys, Fred Hohman

机构 * Harvard University(哈佛大学) Apple(苹果公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Annotator Policy Models,通过学习标注行为揭示安全政策差异,解决标注分歧根源问题,提升安全政策设计的透明性和包容性。

Comments 38 pages, 13 figures, ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20995 2026-04-29 cs.AI cs.CL cs.SE 81%

Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models

价值冲突诊断揭示语言模型中广泛存在的对齐伪装现象

Inderjeet Nair, Jie Ruan, Lu Wang

机构 * Computer Science and Engineering University of Michigan(计算机科学与工程大学密歇根大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过VLAF框架揭示语言模型中存在广泛对齐伪装现象,发现小型模型如7B参数模型中对齐伪装率高达37%,并提出轻量级缓解方法减少伪装行为。

Comments Under submission at COLM 2026 Won the Best Student Paper Award at MSLD 2026 @ UIUC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22879 2026-04-28 cs.MA cs.AI cs.CR cs.LG 81%

Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems

超越单体对齐:防止多智能体系统中的上下文碎片化违规

Jie Wu, Ming Gong

机构 * Atlassian(Atlassian公司)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Distributed Sentinel架构,通过Semantic Taint Token协议解决多智能体系统中因上下文碎片化导致的政策违规问题,实验证明其在跨域政策验证中的高效性与可靠性。

Comments 34 pages, 3 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18471 2026-04-23 cs.SE cs.AI cs.CL 81%

CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment

CodeRL+: 通过执行语义对齐改进代码生成

Xue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) School of Computer Science, Wuhan University(武汉大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CodeRL+,通过将执行语义对齐整合到RLVR训练流程中,提升代码生成的准确性,实验显示其在pass@1指标上平均提升4.6%。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17928 2026-04-21 cs.LG cs.AI 81%

HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment

HEALing Entropy Collapse: 通过混合领域熵动力学对齐增强少样本RLVR的探索

Zhanyu Liu, Qingguo Hu, Ante Wang, Chenqing Liu, Zhishang Xiang, Hui Li, Delai Qiu, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Tsinghua University(清华大学) Xiamen Unisound Intelligence Technology Co., Ltd(厦门Unisound智能科技有限公司) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文化和旅游部,中国)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出HEAL框架,通过混合领域熵动力学对齐缓解少样本RLVR中的熵崩溃问题,提升探索多样性与推理性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07954 2026-04-21 cs.CL cs.AI 81%

Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation

Bielik Guard:高效的波兰语安全分类器用于LLM内容审核

Krzysztof Wróbel, Jan Maria Kowalski, Jerzy Surma, Igor Ciuciura, Maciej Szymański

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 Bielik Guard通过高效波兰语安全分类器提升LLM内容审核效果,0.5B模型在F1分数上表现最佳,0.1B模型在效率与低误报率上优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10687 2026-04-21 cs.AI cs.CY 81%

Safe for Whom? Rethinking How We Evaluate the Safety of LLMs for Real Users

为谁安全?重新思考如何为真实用户评估LLM的安全性

Manon Kempermann, Sai Suresh Macharla Vasu, Mahalakshmi Raveenthiran, Theo Farrell, Ingmar Weber

机构 * Interdisciplinary Institute for Societal Computing(社会计算跨学科研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了评估LLM对真实用户安全性的挑战,指出需考虑用户情境差异,通过测试不同LLM在金融和健康建议上的表现,发现用户背景影响评估结果,且仅依赖用户披露信息不足以提升安全性评估。

Comments Paper accepted at IASEAI'26; please cite that peer-reviewed version instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08601 2026-04-13 cs.AI cs.LG 81%

OpenKedge: Governing Agentic Mutation with Execution-Bound Safety and Evidence Chains

OpenKedge: 通过执行绑定的安全性和证据链治理代理突变

Jun He, Deying Yu

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 OpenKedge通过引入执行绑定的安全性和证据链,将代理突变转化为受控过程,确保系统行为的可审计性和可预测性。

Comments 17 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12626 2026-04-07 cs.HC cs.AI cs.CY cs.ET 81%

DoubleAgents: Human-Agent Alignment in a Socially Embedded Workflow

DoubleAgents:社会嵌入式工作流中的人机对齐

Tao Long, Xuanming Zhang, Sitong Wang, Zhou Yu, Lydia B Chilton

机构 * Columbia University(哥伦比亚大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 DoubleAgents通过分布式认知框架实现人机对齐,整合协调代理、可视化仪表板和策略模块,提升复杂社会嵌入式任务的执行效率与用户信任。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28650 2026-04-03 cs.LG cs.AI stat.ML 81%

Information-Theoretic Limits of Safety Verification for Self-Improving Systems

自我改进系统安全验证的信息论极限

Arsenios Scrivens

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究安全验证在允许无界有益自修改的同时维持有限累积风险的理论极限,提出双条件并建立其兼容性理论。

Comments 27 pages, 6 figures. Companion empirical paper: doi:10.5281/zenodo.19237566

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20206 2026-03-24 cs.CL cs.AI 81%

Enhancing Safety of Large Language Models via Embedding Space Separation

通过嵌入空间分离增强大语言模型的安全性

Xu Zhao, Xiting Wang, Weiran Shen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出嵌入空间分离方法,通过扩大有害与安全表示间的距离提升大语言模型安全性,同时保持模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12033 2026-02-26 cs.LG cs.AI 81%

EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation

EARL: 用于可靠RTL代码生成的熵感知强化学习对齐大语言模型

Jiahe Shi, Zhengqi Gao, Ching-Yun Ko, Duane Boning

机构 * MIT(麻省理工学院) IBM(国际商业机器公司)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 EARL通过熵感知强化学习提升Verilog代码生成的可靠性与准确性

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14252 2026-02-17 cs.AI cs.LG cs.RO 81%

GRAIL: Goal Recognition Alignment through Imitation Learning

GRAIL:通过模仿学习进行目标识别对齐

Osher Elhadad, Felipe Meneguzzi, Reuth Mirsky

机构 * Department of Computer Science, Bar Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, Aberdeen University(阿伯丁大学计算机科学系) Department of Computer Science, Tufts University(塔夫茨大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 GRAIL通过模仿学习和逆强化学习,从演示轨迹中学习目标导向策略,提高目标识别的准确性和鲁棒性。

Comments Accepted for publication at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11018 2026-02-12 cs.LG cs.AI stat.ML 81%

OSIL: Learning Offline Safe Imitation Policies with Safety Inferred from Non-preferred Trajectories

OSIL: 通过非偏好轨迹推断学习离线安全模仿策略

Returaj Burnwal, Nirav Pravinbhai Bhatt, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 OSIL通过非偏好轨迹推断安全策略,从离线演示中学习安全且奖励最大化的策略,优于基线方法。

Comments 21 pages, Accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08621 2026-02-10 cs.LG cs.AI cs.CR 81%

Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs

稀疏模型,稀疏安全:混合专家大语言模型中的不安全路线

Yukun Jiang, Hai Huang, Mingjie Li, Yage Zhang, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示了混合专家大语言模型中的不安全路由问题,提出RoSais评分和F-SOUR框架以量化和发现安全风险,通过实验展示了高ASR的攻击效果,并提出防御策略以提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01952 2026-02-10 cs.CV cs.AI cs.LG cs.RO 81%

GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment

GrndCtrl: 通过自监督奖励对齐实现世界模型的 grounding

Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 GrndCtrl通过自监督奖励对齐提升世界模型的几何 grounding,实现更稳定的空间一致性与导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02594 2026-02-06 cs.LG cs.AI cs.SE 81%

SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents

SMARLA:一种用于深度强化学习智能体的安全监控方法

Amirhossein Zolfagharian, Manel Abdellatif, Lionel C. Briand, Ramesh S

机构 * School of Electrical Engineering and Computer Science (EECS), University of Ottawa(电气工程与计算机科学系,渥太华大学) Software and Information Technology Engineering Department, École de Technologie Supérieure(软件与信息技术工程系,高等技术学院) Lero SFI Research Center and University of Limerick(Lero SFI研究中心和利默里克大学) Department of Research and Development, General Motors(研发部,通用汽车)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 SMARLA是一种用于深度强化学习智能体的安全监控方法,通过状态抽象和Q值预测安全违规,实现早期检测与低假阳性率的平衡。

Journal ref in IEEE Transactions on Software Engineering, vol. 51, no. 01, pp. 82-105, Jan. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10520 2026-02-03 cs.AI cs.CY 81%

Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment

与规范性单一体制代理告别:GRACE:一种基于原因的神经符号架构,用于安全和道德的人工智能对齐

Felix Jahn, Yannic Muskalla, Lisa Dargasz, Patrick Schramowski, Kevin Baum

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Center for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) Saarland Informatics Campus(萨尔州信息学校区) Computer Science Department, TU Darmstadt(图宾根大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 GRACE是一种基于原因的神经符号架构,用于安全和道德的人工智能对齐,通过分离规范性推理与工具性决策,确保AI代理的行为符合道德规范。

Comments 10 pages, 4 figures, accepted at 2nd Annual Conference of the International Association for Safe & Ethical AI (IASEAI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01037 2025-12-22 cs.CL cs.AI 81%

When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals

当安全阻止感知:测量大语言模型拒绝中的语义混淆

Riad Ahmed Anonto, Md Labid Al Nahiyan, Md Tanvir Hassan

机构 * Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义混淆的概念及测量框架,通过ParaGuard语料库和三种模型无关指标,揭示大语言模型拒绝中的局部不一致问题,帮助开发者优化安全与准确性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16279 2025-12-19 cs.AI cs.CL 81%

QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems

QuadSentinel: 多智能体系统中机器可验证的顺序安全控制

Yiliu Yang, Yilei Jiang, Qunzhong Wang, Yingshui Tan, Xiaoyong Zhu, Sherman S. M. Chow, Bo Zheng, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba Group(阿里巴巴集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 QuadSentinel通过四智能体守卫系统,将安全政策转化为机器可验证规则,提升多智能体系统的安全控制效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26935 2025-11-03 cs.RO cs.AI cs.CL cs.FL 81%

RepV: Safety-Separable Latent Spaces for Scalable Neurosymbolic Plan Verification

Yunhao Yang, Neel P. Bhatt, Pranay Samineni, Rohan Siva, Zhanyang Wang, Ufuk Topcu

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

Comments Code and data are available at: https://repv-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13139 2025-10-29 cs.CY cs.CE cs.CL cs.MA 81%

Addressing the alignment problem in transportation policy making: an LLM approach

Xiaoyu Yan, Tianxing Dai, Yu Marco Nie

机构 * Department of Civil and Environmental Engineering, Northwestern University(土木与环境工程系,西北大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00971 2025-10-28 cs.LG cs.AI 81%

Reasoning as an Adaptive Defense for Safety

Taeyoun Kim, Fahim Tajwar, Aditi Raghunathan, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 44 pages, 10 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏