arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-16 至 2026-03-16 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 7 篇

2410.10862 2026-03-16 cs.CL cs.AI cs.CR cs.CY cs.LG 89%

Superficial Safety Alignment Hypothesis

表面安全对齐假说

Jianwei Li, Jung-Eun Kim

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出表面安全对齐假说,认为安全对齐通过让模型选择正确推理方向来实现,识别出四种关键组件以建立安全防护。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 70%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12273 2026-03-16 cs.CL cs.AI cs.LG 67%

Aligning Language Models from User Interactions

从用户交互对齐语言模型

Thomas Kleine Buening, Jonas Hübotter, Barna Pásztor, Idan Shenfeld, Giorgia Ramponi, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) MIT(麻省理工学院) University of Zurich(苏黎世大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过自蒸馏直接从用户交互学习的方法,利用用户反馈调整模型行为,提升对齐和指令遵循能力,同时实现个性化和持续适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14841 2026-03-16 cs.SE cs.AI 57%

Helping LLMs Improve Code Generation Using Feedback from Testing and Static Analysis

通过测试和静态分析反馈帮助LLM提升代码生成

Greta Dolcetti, Vincenzo Arceri, Eleonora Iotti, Sergio Maffeis, Agostino Cortesi, Enea Zaffanella

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出利用测试和静态分析评估和指导通用开源LLM生成代码的质量及自我改进,发现生成代码常存在错误和安全问题,但提供反馈后能有效修复代码缺陷。

Journal ref Discover Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12823 2026-03-16 cs.CL cs.CV 57%

Adaptive Vision-Language Model Routing for Computer Use Agents

自适应视觉-语言模型路由用于计算机使用代理

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由项目) MBZUAI McGill University(麦吉尔大学) AMD Red Hat(红帽公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12430 2026-03-16 cs.CV 50%

Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation

Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证

Jian Jiang, Chenxi Lin, Yiming Gu, Zengyi Qin, Zhitao Zeng, Kun Yuan, Yonghao Long, Xiang Xia, Cheng Yuan, Yuqi Wang, Zijie Yue, Kunyi Yang, Yuting Zhang, Zhu Zhuo, Dian Qin, Xin Wang, NG Chi Fai, Brian Anthony, Daguang Xu, Guy Rosman, Ozanan Meireles, Zizhen Zhang, Nicolas Padoy, Hesheng Wang, Qi Dou, Yueming Jin, Yutong Ban

专题命中 安全训练 :safety(abstract)

AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12421 2026-03-16 cs.CV 50%

A Neuro-Symbolic Framework Combining Inductive and Deductive Reasoning for Autonomous Driving Planning

一种结合归纳推理与演绎推理的神经符号框架用于自动驾驶规划

Hongyan Wei, Wael AbdAlmageed

机构 * Clemson University(克莱姆森大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种神经符号框架,结合归纳与演绎推理提升自动驾驶规划的透明性和安全性,在nuScenes基准中优于现有方法。

Comments Under review. 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏