arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-26 至 2026-06-26 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2606.26575 2026-06-26 cs.RO cs.AI 新提交 79%

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control

IDEA: 通过效果对齐对动力学失配不敏感的模拟到现实迁移多智能体控制

Chenlong Liu, Zhuohui Zhang, Xinyan Chen, Zhipeng Wang, Bin Cheng, Bin He

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 提出一种通过效果对齐对动力学失配不敏感的模拟到现实迁移方法,结合随机环境结构与离散语义动作,并开发动作同步机制,提升多智能体系统在真实场景中的训练效率和成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26396 2026-06-26 cs.LG 新提交 70%

At the Edge of Understanding: Sparse Autoencoders Trace The Limits of Transformer Generalization

在理解的边缘:稀疏自编码器追踪Transformer泛化的极限

Praneet Suresh, Jack Stanley, Sonia Joseph, Luca Scimeca, Danilo Bzdok

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Meta AI Sapient manifold-informed selection of samples for improved Intelligence

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 通过稀疏自编码器分析内部概念,发现OOD输入(如拼写错误和越狱提示)会激活更多错误概念,并据此提出一种基于机制的微调策略来增强LLM鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26106 2026-06-26 cs.CL cs.AI 新提交 62%

Reducing Conversational Escalation in Large Language Model Dialogue with Nonviolent Communication Constraints

使用非暴力沟通约束减少大语言模型对话中的对话升级

Zhixing Sun, Shenghe Xu, Tao Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过非暴力沟通原则的轻量级提示约束,引导大语言模型在冲突对话中减少升级行为,实验表明该方法能稳定与高度抵抗用户的交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03247 2026-06-26 cs.CL cs.CY 版本更新 62%

Somatic in the East, Psychological in the West?: Investigating Clinically-Grounded Cross-Cultural Depression Symptom Expression in LLMs

东方躯体化,西方心理化?:探究临床基础下跨文化抑郁症状在LLMs中的表达

Shintaro Sakai, Jisun An, Migyeong Kang, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Sungkyunkwan University(成均馆大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究测试大语言模型(LLMs)是否复现西方抑郁患者报告心理症状、东方患者报告躯体症状的文化模式,发现英语提示下模型未能复现,但东方语言提示改善部分对齐,原因在于模型对文化人物敏感性低及症状层级压倒文化线索。

Comments C3NLP workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26649 2026-06-26 cs.AI cs.CR 新提交 61%

Autoformalization of Agent Instructions into Policy-as-Code

智能体指令的自动形式化为策略即代码

Adam Mondl, Matthew Maisel, John H. Brock

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

AI总结 提出自动形式化流水线,通过LLM生成-批评循环将智能体提示和自然语言策略转化为Cedar策略语言,在MedAgentBench上比手工编码覆盖更多规范。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27147 2026-06-26 cs.CV cs.AI 新提交 57%

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

安全自回归图像生成与迭代自改进码本

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。

Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26981 2026-06-26 cs.RO cs.AI 新提交 57%

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

上下文模型预测生成:从语言模型到物理的开放词汇运动合成

Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07407 2026-06-26 cs.CL 版本更新 57%

Training Language Models to Use Prolog as a Tool

训练语言模型以使用Prolog作为工具

Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。

Comments ACL 2026 Findings (change from last version: corrected year in this comment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26886 2026-06-26 cs.HC 新提交 50%

Optimizing Human-Machine Interface for Real-Time AI Support in the Operating Room: the CVS Copilot

优化手术室中实时AI支持的人机界面:CVS Copilot

Lorenzo Arboit, Nicolas Chanel, Aditya Murali, Pietro Mascagni, Nicolas Padoy

专题命中 安全训练 :safety(abstract)

AI总结 针对腹腔镜胆囊切除术中自动CVS评估的AI系统,通过17名外科医生的用户中心设计研究,优化了术中HMI,提出外科医生控制、角色自适应的CVS Copilot界面。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏