arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-26 至 2026-03-26 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2602.14844 2026-03-26 cs.LG 83%

Interactionless Inverse Reinforcement Learning: A Data-Centric Framework for Durable Alignment

无交互逆强化学习:一种数据驱动的对齐框架

Elias Malomgré, Pieter Simoens

机构 * IDLab, Ghent University - imec(IDLab,根特大学-imec)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文提出无交互逆强化学习框架,旨在通过数据驱动的方法学习可检查、可编辑和可重用的奖励特征,从而将对齐问题从一次性训练成本转变为可验证的工程资产。

Comments Accepted for the AAMAS 2026 Blue Sky Ideas track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24241 2026-03-26 eess.SY cs.LG cs.SY 57%

C-STEP: Continuous Space-Time Empowerment for Physics-informed Safe Reinforcement Learning of Mobile Agents

C-STEP:连续时空赋能用于物理引导的移动智能体安全强化学习

Guihlerme Daubt, Adrian Redder

机构 * Faculty of Technology, Bielefeld University, Germany(比勒菲尔德大学技术学院,德国) Department of Electrical Engineering and Information Technology, Paderborn University, Germany(帕德博恩大学电气工程与信息科技系,德国)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出C-STEP方法,通过结合导航奖励设计物理引导的内在奖励,提升移动智能体在复杂环境中的安全导航能力,减少碰撞并优化任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23772 2026-03-26 cs.NI cs.AI 57%

AI-driven Intent-Based Networking Approach for Self-configuration of Next Generation Networks

基于人工智能的意图驱动网络方法用于下一代网络的自配置

Md. Kamrul Hossain, Walid Aljoby

机构 * Information and Computer Science Department, King Fahd University of Petroleum and Minerals(信息与计算机科学系,国王法赫德石油与矿物大学) IRC for Intelligent Secure Systems, King Fahd University of Petroleum and Minerals(智能安全系统研究院,国王法赫德石油与矿物大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种端到端闭环IBN流程,利用大语言模型和结构化验证将自然语言意图转化为可执行策略,并通过多意图故障预测提升自动化可靠性。

Comments Accepted for presentation in IEEE/IFIP NOMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16212 2026-03-26 cs.RO 50%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 安全训练 :alignment(abstract)

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23880 2026-03-26 cs.SI 50%

ProcureGym: A Multi-Agent Markov Game Framework for Modeling National Volume-based Drug Procurement

ProcureGym: 一个用于建模国家基于体积的药品采购的多智能体马尔可夫游戏框架

Jia Wang, Qian Xu, Xuanwen Ding, Zhuangqi Li, Chao He, Bao Liu, Zhongyu Wei

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出ProcureGym,通过真实数据模拟中国基于体积的药品采购,评估RL、LLM等智能体模型,发现RL在收益和利润上表现更优,揭示最大有效报价和采购量对战略结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏