arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-10 至 2026-06-10 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2606.11046 2026-06-10 cs.CL 新提交 83%

Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models

推理是否保持对齐?关于大型推理模型的可信度研究

Prajakta Kini, Avinash Reddy, Souradip Chakraborty, Satya Sai Srinath Namburi GNVV, Furong Huang, Amrit Singh Bedi, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) University of Central Florida(中佛罗里达大学) University of Maryland College Park(马里兰大学帕克分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 研究通过监督微调、强化学习和蒸馏生成的推理模型在安全、偏见、隐私等六个可信度维度上是否保持对齐,发现推理模型常出现对齐退化,如毒性增加、刻板印象加剧等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10487 2026-06-10 cs.LG cs.AI 新提交 62%

Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs

早停早省:隐藏状态探针作为LLM输出流式审核的实用方案

Huizhen Shu, Xuying Li, Piao Xue

机构 * ModelOneAI yunshanai(云山AI)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出基于隐藏状态的轻量级词元级探针,在解码循环中实时检测不安全输出,无需额外前向传播,实现亚毫秒级安全审核,可提前中断或修改生成。

Comments Technical Report. 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09866 2026-06-10 cs.LG cs.AI 新提交 62%

Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning

双人探戈:面向安全LLM微调的耦合任务-参考选择

Xinrui Chen, Jianhao Zhang, Ou Wu, Di Gao

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出DualSelect框架,通过耦合任务与安全参考选择,在微调时保持安全对齐,提升安全评分至少5.10点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10321 2026-06-10 cs.LG cs.AI cs.RO math.OC 新提交 62%

Baseline-Free Policy Optimization for Neural Combinatorial Optimization

无基线的神经组合优化策略优化

Carlos S. Sepúlveda, Gonzalo A. Ruz

机构 * Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院) Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局) Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS)) Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出使用GRPO算法消除神经组合优化中的基线依赖,避免训练崩溃,在TSP和CVRP上达到接近POMO的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10989 2026-06-10 cs.AI 新提交 57%

Null-Space Constrained Low-Rank Adaptation for Response-Specified Large Language Model Unlearning

零空间约束的低秩自适应用于指定响应的大型语言模型遗忘

Bocheng Ju, Jianhua Wang, Chengliang Liu, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University(北京交通大学智能交通信息安全与隐私保护北京市重点实验室) College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院) Institute of Computing Technologies, China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司计算技术研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出零空间约束响应指定遗忘框架,通过正交投影低秩参数化将LoRA更新限制在保留子空间的零空间内,在抑制遗忘知识的同时保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10334 2026-06-10 cs.AI 新提交 57%

Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts

通过视觉反馈的自蒸馏策略优化:连接代码与视觉工件

Haoyu Dong

机构 * Microsoft(微软)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出Visual-SDPO框架,利用渲染视觉反馈作为特权上下文,通过自蒸馏和视觉引导的代码信用加权优化代码生成视觉工件的质量,在图表、UI和幻灯片生成任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10598 2026-06-10 cs.SE 新提交 50%

Exploring and Complementing End Users' Requirements in IoT enabled System

探索与补充物联网系统中终端用户的需求

Haotian Li, Xiaohong Chen, Zhi Jin, Shuyuan Xiao, Chenxu Wang, Haoxiang Yan, Xiaoyi Chen

专题命中 安全训练 :safety(abstract)

AI总结 针对终端用户通过触发动作编程创建物联网规则时表达碎片化的问题,提出一种基于意图的需求补全方法,利用双向需求可追溯树和多智能体框架,结合大语言模型推理与结构化可追溯性,实现功能完整且内在安全的规则补全,将规则补全率提升43%,逻辑冲突减少21%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09841 2026-06-10 cs.HC 新提交 50%

Human-Centered AI for Safe Shuttle Car Routing in Underground Room-and-Pillar Coal Mines Using Graph Neural Networks

面向人类中心的图神经网络安全穿梭车路径规划在房柱式地下煤矿中的应用

Bryant Pollard

专题命中 安全训练 :safety(abstract)

AI总结 针对地下煤矿低能见度、动态环境下的安全路径决策问题,提出基于图神经网络的人类中心AI决策支持系统,通过专家合成数据训练、浏览器界面部署及SHAP可解释性分析,提升任务完成率、响应速度和用户信任。

Comments 18 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏