arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-16 至 2026-07-16 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2607.13346 2026-07-16 cs.CR cs.AI cs.CL 新提交 81%

The Refusal Residue: When Probes Catch Alignment Faking and When They Don't

拒绝残差:探测何时能捕捉到对齐造假以及何时不能

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI 研究所)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究对齐造假中隐藏状态能否揭示输出隐藏内容,对13个模型扫描,发现Qwen3 - 32B和Llama - 3.1 - 8B存在自然造假及不对称拒绝残差,样本检测有模型条件性,还发布五控制测量框架用于对齐造假检测。

Comments Accepted to the Mechanistic Interpretability Workshop at ICML 2026. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13594 2026-07-16 cs.AI 新提交 79%

SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

安全哨兵:通过执行-询问-拒绝路由实现上下文感知的人工干预

Tianyu Chen, Chujia Hu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究LLM智能体行动风险,将问题重构为三向路由决策,用安全哨兵实例化,其推理简化,单阈值可调整。该模型在准确率和召回率上优于多种基线,能同时控制错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 78%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 安全训练 :alignment(title,abstract)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15587 2026-07-16 cs.RO 版本更新 78%

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments

完美演示造就差劲教师:从关键运动片段学习鲁棒对齐

Mingyu Liu, Zeju Li, Jiuhe Shu, Hanqing Wang, Yuhao Chao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 安全训练 :alignment(title,abstract)

AI总结 针对精细操作中流畅演示因压缩关键对齐动作导致策略学习不足的问题,提出数据级重采样和表示级STAIR特征,利用稠密运动感知监督提升策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13934 2026-07-16 cs.MA 新提交 75%

Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

Pezego-HITL:一种用于加纳农业推广的基于政策的大语言模型架构

Shunbao Li, Zhipeng Yuan, Amoako Ofori, Benedicta Y. Fosu-Mensah, Yang Li, Manu Kenchappa Junjanna, Qing Xue, Po Yang

专题命中 安全训练 :alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 研究针对加纳农业推广中大语言模型应用问题,提出基于政策的结构化检索增强生成与验证内存路由方法,通过P-EVAL框架评估,提升了模型政策对齐率、农艺利用率,降低延迟,还验证了通用性,为小农户农业提供可扩展模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13655 2026-07-16 cs.AI 新提交 70%

Explaining Reinforcement Learning Agents via Inductive Logic Programming

通过归纳逻辑编程解释强化学习智能体

Celeste Veronese, Edoardo Zorzi, Daniele Meli, Alessandro Farinelli

机构 * University of Verona(维罗纳大学) Sapienza University of Rome(罗马第一大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 该研究致力于推进可解释强化学习,引入客观指标量化策略可解释性。采用归纳逻辑编程提取符号表示并定义新指标,实验表明这些指标能突出特定动作学习动态,提供细粒度洞察,揭示多智能体模式,助力策略转移与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13172 2026-07-16 cs.AI cs.LG 新提交 62%

Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

通过世界模型从人类偏好和理由中学习安全智能体行为

Ilias Kazantzidis, Timothy J. Norman, Yali Du, Christopher T. Freeman

机构 * University of Southampton(南安普顿大学) King’s College London(伦敦国王学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究在环境未知且无合适奖励函数时安全训练与部署智能体策略的问题,提出DROPJ方法,先学习世界模型,由人类在其中生成模拟轨迹并给出偏好及理由,据此训练奖励模型用于部署,实验表明该方法可降低训练成本、提升部署性能及安全性。

Comments 42 pages, 18 figures. Extended version of a paper presented at ICAART 2026; submitted for consideration in the ICAART 2026 post-publication selected-papers volume in Lecture Notes in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13036 2026-07-16 cs.CL cs.AI 新提交 62%

Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

诊断前先询问:Safe-Psych,一种用于精神病学领域大语言模型的顺序评估基准

Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ionescu, Michael A. Riegler

机构 * National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学国立科技大学) Psychiatric Hospital Doctor Gheorghe Preda(格奥尔基·普雷达医生精神病医院) Oslo Metropolitan University(奥斯陆都市大学) Kristiania University of Applied Sciences(克里斯蒂亚尼亚应用科学大学) SimulaMet(SimulaMet公司) Lucian Blaga University of Sibiu(锡比乌卢西安·布拉加大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型在精神病学决策支持中处理证据不完整问题,引入顺序评估基准Safe-Psych,通过模拟真实临床记录及精神科医生行动标签,评估多个模型,发现模型存在过早诊断等问题,揭示其局限性,为改善模型安全性研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14046 2026-07-16 cs.AI 新提交 57%

Earthquaker-AI: A Retrieval-Augmented Generation Framework with Rubric-Based Assessment for Primary School Earthquake Education

地震人工智能:一种基于评分标准评估的小学地震教育检索增强生成框架

Xanthi Kokkinou, Chaido Mizeli, Nafsika Koulaxidou, Marina Delianidi, Konstantinos Diamantaras

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对小学生地震教育问题,提出地震人工智能混合教育框架,集成检索增强生成对话式AI助手,结合乐高机器人、评分标准和AI,通过不同年级的渐进学习提升学生地震应对能力,实验显示有高可信度和准确性。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13539 2026-07-16 cs.CV cs.GR 新提交 50%

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

ThinkBLOX:基于渐进推理的3D室内场景生成

Yuan Xiao, Can Wang, Xiangyu Kong, Jing Liao

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 安全训练 :alignment(abstract)

AI总结 研究针对传统与现有3D室内场景生成方法不足,提出基于VLM的渐进推理框架ThinkBLOX,构建数据集并采用监督微调与新强化学习方案,在多方面优于基线,支持多样3D场景应用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏