arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-03 至 2026-06-03 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 11 篇

2606.03954 2026-06-03 cs.CV cs.LG cs.RO 79%

VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring

VLESA: 用于人类活动监测的视觉语言具身安全智能体

Hanjiang Hu, Yiyuan Pan, Jiaxing Li, Xusheng Luo, Alexander Robey, Na Li, Yebin Wang, Changliu Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Mitsubishi Electric Research Laboratories(三菱电机研究实验室) Harvard University(哈佛大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 提出VLESA框架,通过自我中心视频监测人类活动,利用GRPO训练的目标条件安全Q过滤器进行实时安全干预,在ASIMOV-2.0基准上实现更高干预精度。

Comments 18 pages, 5 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03678 2026-06-03 cs.AI 79%

EvoDrive: Pareto Evolution for Safety-Critical Autonomous Driving via Self-Improving LLM Agents

EvoDrive: 通过自我改进的LLM智能体实现安全关键自动驾驶的帕累托进化

Tong Nie, Yuewen Mei, Yihong Tang, Junlin He, Jie Deng, Jian Sun, Wei Ma

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出EvoDrive,首个基于LLM的自动化智能体进化框架,通过模拟器接地演员-评论家架构和帕累托存档,在安全关键场景生成中实现对抗性与真实性的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02967 2026-06-03 cs.ET cs.AI cs.AR cs.SY eess.SY 79%

Glass Box at Orbit: A Constitutional AI Verification Framework for Trustworthy Autonomous CubeSat Intelligence

轨道上的玻璃盒:面向可信自主立方星智能的宪法AI验证框架

Karthik Barma, Anil Sanneboyina, V C Premchand Yadav

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全训练 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 提出玻璃盒框架,通过运行时宪法AI验证层拦截自主航天器决策,利用六项物理约束和七项线性时序逻辑安全不变式确保安全,并证明其验证开销与模型规模无关。

Comments 12 pages, 2 figures, 2 tables, 32 references. Paper 1 of the Project October series on autonomous orbital intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03601 2026-06-03 cs.SE cs.AI 70%

DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

DDOR: 用于可解释过度拒绝测试与修复的Delta调试方法

Qinyan Zhou, Peixin Zhang, Jun Sun, Haonan Zhang, Dongxia Wang

机构 * Southeast University(东南大学) Singapore Management University(新加坡管理学院) Zhejiang University(浙江大学) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出DDOR框架,通过delta调试定位最小拒绝触发片段(mRTF),实现黑盒环境下大语言模型过度拒绝行为的自动化测试与修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17659 2026-06-03 cs.RO cs.CV 67%

Plan-R1: Safe and Feasible Trajectory Planning as Language Modeling

Plan-R1:安全且可行的轨迹规划作为语言建模

Xiaolong Tang, Meina Kan, Shiguang Shan, Xilin Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 提出Plan-R1两阶段轨迹规划框架,通过原则对齐与行为学习解耦,结合规则奖励和方差解耦GRPO,显著提升自动驾驶规划的安全性和可行性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03967 2026-06-03 cs.CL cs.AI 62%

AlignAtt4LLM: Fast AlignAtt for Decoder-Only LLMs at IWSLT 2026 Simultaneous Speech Translation Task

AlignAtt4LLM:面向仅解码器LLM的快速AlignAtt方法在IWSLT 2026同声传译任务中的应用

Quentin Fuxa, Dominik Macháček

机构 * Charles University, MFF, ÚFAL(查理大学,人文学院,ÚFAL) University of Edinburgh(爱丁堡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出AlignAtt4LLM系统,通过显式源文本跨度、离线选择翻译对齐头、选择性qk快速重放和运行时查询/键捕获,首次将AlignAtt策略应用于仅解码器LLM,在英德、英意同声传译中优于基线。

Comments Accepted to IWSLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03866 2026-06-03 cs.IR cs.AI cs.CL 62%

Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation

Taiji: 面向工业LLM增强推荐的帕累托最优策略优化与语义ID权衡

Yuecheng Li, Zeyu Song, Jing Yao, Chi Lu, Peng Jiang, Kun Gai

机构 * Kuaishou Technology(快手科技) Unaffiliated(无隶属)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Taiji框架,通过逆向工程推理和开放拒绝采样生成高质量CoT数据,并采用帕累托最优策略优化(POPO)自适应调整跨域奖励权重,实现LLM语义知识与推荐ID特征的帕累托最优权衡,在快手广告平台部署后服务超4亿日活用户。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03005 2026-06-03 cs.AI 57%

From Moderation to Mediation: Can LLMs Serve as Mediators in Online Flame Wars?

从审核到调解:LLMs能否充当在线论战中的调解员?

Dawei Li, Abdullah Alnaibari, Arslan Bisharat, Manuel Sandoval, Deborah Hall, Yasin Silva, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Loyola University Chicago(芝加哥洛约拉大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本研究探索大型语言模型(LLMs)能否超越内容审核,作为调解员通过判断对话公平性和情感动态并生成共情缓和信息来化解在线冲突,实验表明API模型在推理和干预一致性上优于开源模型。

Comments Accepted by PAKDD 2026 special session on Data Science: Foundations and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03868 2026-06-03 cs.CV 50%

Unified Video-Action Joint Denoising for Dexterous Action and Data Generation

统一视频-动作联合去噪用于灵巧动作与数据生成

Dingrui Wang, YuAn Wang, Jinkun Liu, Yue Zhang, Mattia Piccinini, Yu Sun, Johannes Betz

机构 * Technical University of Munich(慕尼黑技术大学) ByteDance(字节跳动) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出Donk模型,通过联合建模交互视频与手部轨迹的分布,实现灵巧手的动作生成与数据增强。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02994 2026-06-03 cs.CV 50%

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation

Video-OPD:通过在线策略蒸馏实现多模态大语言模型在时序视频定位中的高效后训练

Jiaze Li, Hao Yin, Haoran Xu, Boshen Xu, Wenhui Tan, Zewen He, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出Video-OPD框架,利用在线策略蒸馏和教师验证分歧聚焦课程,以高效后训练多模态大语言模型进行时序视频定位,克服稀疏奖励和高计算开销问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20623 2026-06-03 cs.RO 50%

Latent Activation Editing: Inference-Time Refinement of Learned Policies for Safer Multirobot Navigation

潜在激活编辑:基于推理时策略精炼的安全多机器人导航

Satyajeet Das, Darren Chiu, Zhehui Huang, Lars Lindemann, Gaurav S. Sukhatme

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Automatic Control Laboratory, ETH Zürich(苏黎世联邦理工学院自动控制实验室)

专题命中 安全训练 :safety(abstract)

AI总结 提出潜在激活编辑(LAE)框架,通过在推理时在线检测并编辑中间激活,在不修改权重或架构的情况下降低预训练策略的碰撞率,在四旋翼导航中实现近90%的碰撞减少。

详情

展开后加载摘要…

URL PDF HTML 收藏