arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-13 至 2026-04-13 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2604.08601 2026-04-13 cs.AI cs.LG 81%

OpenKedge: Governing Agentic Mutation with Execution-Bound Safety and Evidence Chains

OpenKedge: 通过执行绑定的安全性和证据链治理代理突变

Jun He, Deying Yu

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 OpenKedge通过引入执行绑定的安全性和证据链,将代理突变转化为受控过程,确保系统行为的可审计性和可预测性。

Comments 17 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09521 2026-04-13 cs.IT cs.AI math.IT 79%

Semantic Rate-Distortion for Bounded Multi-Agent Communication: Capacity-Derived Semantic Spaces and the Communication Cost of Alignment

语义率-失真:受限多智能体通信的容量导出语义空间及对齐成本

Anthony T. Nixon

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究多智能体在受限通信下的语义率-失真问题,提出基于容量导出的语义空间,并探讨通信对齐的成本与结构相变。

Comments 34 pages, 13 figures. Code: https://github.com/alch3mistdev/semantic-rate-distortion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08588 2026-04-13 cs.LG cs.AI 62%

Act or Escalate? Evaluating Escalation Behavior in Automation with Language Models

行动或升级?基于语言模型评估自动化中的升级行为

Matthew DosSantos DiSorbo, Harang Ju

机构 * Harvard Business School(哈佛商学院) Johns Hopkins Carey Business School(约翰霍普金斯大学凯瑞商学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了语言模型在自动化决策中如何平衡行动与升级,发现模型在成本权衡上的隐含阈值存在显著差异,且自我评估存在偏差,通过干预测试发现链式思维训练能产生稳健的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09493 2026-04-13 cs.NI 50%

Policy-Aware Edge LLM-RAG Framework for Internet of Battlefield Things Mission Orchestration

面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架,结合轻量检索模块与本地LLM进行任务规划,并通过JudgeLLM验证用户指令以提高可靠性。

Comments 10 pages, 5 figures, Accepted at AIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 50%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏