arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2502.01241 2026-04-14 cs.CR 50%

Peering Behind the Shield: Guardrail Identification in Large Language Models

窥视屏障之后:大型语言模型中的屏障识别

Ziqing Yang, Yixin Wu, Rui Wen, Michael Backes, Yang Zhang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AP-Test方法,通过对抗性提示检测黑盒AI代理中的屏障,解决安全对齐LLM和缺乏决策策略的问题,实验显示其在多种场景下实现完美分类准确率。

Comments To Appear in the 64th Annual Meeting of the Association for Computational Linguistics, July 2-7, 2026. ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10598 2026-04-14 cs.RO 50%

AWARE: Adaptive Whole-body Active Rotating Control for Enhanced LiDAR-Inertial Odometry under Human-in-the-Loop Interaction

AWARE: 一种适应性全身主动旋转控制用于增强人体在环交互下的激光雷达惯性里程计

Yizhe Zhang, Jianping Li, Liangliang Yin, Zhen Dong, Bisheng Yang

机构 * organization= State Key Laboratory of Information Engineering in Surveying, Mapping Remote Sensing , addressline= Wuhan University , city= Wuhan , postcode= 430079 , country= China organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AWARE框架,通过UAV自身旋转能力扩展传感器视野,提升LIO可观测性。采用可微分MPC与强化学习结合,实现估计精度与飞行稳定性平衡,并通过安全飞行走廊机制确保操作安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07299 2026-04-14 cs.NE cs.SY eess.SY 50%

Optimizing Chlorination in Water Distribution Systems via Surrogate-assisted Neuroevolution

通过代理辅助神经进化优化水分配系统中的氯化

Rivaaj Monsia, Daniel Young, Olivier Francon, Risto Miikkulainen

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于神经进化、多目标优化和代理建模的框架,用于优化水分配系统中氯气的投放策略,通过进化神经网络实现氯气在关键节点的投放,以减少总投放量并保持浓度均匀,优于传统强化学习方法。

Comments 13 pages, 9 figures, GECCO '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09493 2026-04-13 cs.NI 50%

Policy-Aware Edge LLM-RAG Framework for Internet of Battlefield Things Mission Orchestration

面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架,结合轻量检索模块与本地LLM进行任务规划,并通过JudgeLLM验证用户指令以提高可靠性。

Comments 10 pages, 5 figures, Accepted at AIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 50%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24499 2026-04-10 cs.CV 50%

Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning

Reason-SVG:通过强化学习增强向量图形生成的结构化推理

Ximing Xing, Ziteng Xue, Yandong Guan, Jing Zhang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 安全训练 :alignment(abstract)

AI总结 Reason-SVG通过引入Drawing-with-Thought范式和混合奖励机制,提升大语言模型生成高质量SVG的能力,实现结构化推理与视觉一致性。

Comments Accepted by CVPR 2026. 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06972 2026-04-09 cs.RO cs.MA 50%

Differentiable Environment-Trajectory Co-Optimization for Safe Multi-Agent Navigation

可微环境-轨迹联合优化用于安全多智能体导航

Zhan Gao, Gabriele Fadini, Stelian Coros, Amanda Prorok

机构 * University of Cambridge(剑桥大学) Zurich University of Applied Sciences, ZHAW(苏黎世应用科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种可微环境-轨迹联合优化方法,通过双层优化问题提升多智能体导航的安全性和效率,实验验证了其在物流和交通场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06873 2026-04-09 cs.MA 50%

Generating Local Shields for Decentralised Partially Observable Markov Decision Processes

为去中心化部分可观测马尔可夫决策过程生成局部护盾

Haoran Yang, Nobuko Yoshida

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种护盾过程代数,用于在无通信的Dec-POMDP中指定安全全局行为,通过编译过程自动机和全局Mealy机,生成局部Mealy机以减少碰撞。

Comments In Proceedings PLACES 2026, arXiv:2604.05737

Journal ref EPTCS 444, 2026, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06804 2026-04-09 cs.DB 50%

LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO

LASER: 一种数据驱动的低成本高效SQL重写方法基于SQL-GRPO

Jiahui Li, Tongwang Wu, Yuren Mao, Rong Kang, Tieying Zhang, Yunjun Gao

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出LASER,一种数据驱动的SQL重写方法,通过构建SQL-MCTS大规模语料库和SQL-GRPO专用对齐策略,提升小模型在SQL优化中的执行效率和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05448 2026-04-08 cs.HC 50%

Foreign Domestic Workers' Perspectives on an LLM-Based Emotional Support tool for Caregiving Burden

外国家庭佣工对基于大语言模型的情感支持工具在照护负担中的看法

Shin Shoon Nicholas Teng, Kenny Tsu Wei Choo

专题命中 安全训练 :safety(abstract)

AI总结 研究探讨了新加坡外国家庭佣工使用基于大语言模型的聊天机器人作为日常非临床情感支持工具的体验,发现其在心理安全、语言无障碍和多功能资源方面的设计启示。

Comments 5 pages, Accepted at CHI 2026 Posters

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04479 2026-04-08 cs.HC 50%

How can LLMs Support Policy Researchers? Evaluating an LLM-Assisted Workflow for Large-Scale Unstructured Data

大型语言模型如何支持政策研究?评估一个用于大规模非结构化数据的LLM辅助工作流

Yuhan Liu, Shuyao Zhou, Jakob Kaiser, Ella Colby, Jennifer Okwara, Maggie Wang, Varun Nagaraj Rao, Andrés Monroy-Hernández

专题命中 安全训练 :alignment(abstract)

AI总结 本文评估了LLM辅助工作流在处理大规模非结构化数据中的应用,探讨了其在政策研究中的可行性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04499 2026-04-07 eess.SY cs.SY math.OC 50%

Distributed Covariance Steering via Non-Convex ADMM for Large-Scale Multi-Agent Systems

通过非凸ADMM实现分布式协方差控制用于大规模多智能体系统

Augustinos D. Saravanos, Isin M. Balci, Arshiya Taj Abdul, Efstathios Bakolas, Evangelos A. Theodorou

专题命中 安全训练 :safety(abstract)

AI总结 本文研究在概率碰撞避免约束下,通过非凸ADMM实现分布式协方差控制,提出三种方法在保守性和计算效率间平衡,验证了算法的收敛性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15858 2026-04-07 cs.PL cs.SE 50%

Search-Based Multi-Trajectory Refinement for Safe C-to-Rust Translation with Large Language Models

基于搜索的多轨迹优化用于大型语言模型驱动的安全C到Rust转换

HoHyun Sim, Hyeonjoong Cho, Yeonghyeon Go, Sadegh AlMahdi Kazemi Zarkouei, Zhoulai Fu, Ali Shokri, Binoy Ravindran

专题命中 安全训练 :safety(abstract)

AI总结 本文提出LAC2R方法,利用MCTS系统探索多轨迹优化,提升C到Rust转换的安全性和准确性,实验表明其在大规模和小规模基准测试中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03995 2026-04-07 cs.CV cs.SD 50%

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

多模态字体攻击在音频视觉推理中的系统研究

Tianle Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02265 2026-04-03 cs.CV 50%

Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models

模块化能量引导用于基础模型的安全文本到图像生成

Yaoteng Tan, Zikui Cai, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) University of Maryland(马里兰大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于梯度反馈的引导框架,利用预训练基础模型的潜在估计实现安全可控的文本到图像生成,适用于扩散和流匹配模型,提升生成质量与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27051 2026-04-02 eess.SY cs.SY 50%

Proprioceptive feedback paradigm for safe and resilient motion control

本体反馈范式用于安全且稳健的运动控制

Mrdjan Jankovic

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种类本体反馈机制用于运动控制系统,通过快速反馈环路补偿意外响应,分析了可管理的损伤程度,并提供了全MPF和分MPF两种方案。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22690 2026-04-02 cs.CV 50%

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can:利用画布进行多人体生成的架构与艺术家

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research, an initiative of Qualcomm Technologies, Inc.(高通人工智能研究院,高通技术公司旗下)

专题命中 安全训练 :alignment(abstract)

AI总结 Ar2Can提出一种两阶段框架,通过分离空间规划与身份渲染,解决多人体生成中人脸身份丢失问题,采用空间引导的面部匹配奖励提升生成质量,使用合成数据实现高精度和保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01228 2026-04-01 cs.CV 50%

Towards Policy-Adaptive Image Guardrail: Benchmark and Method

面向政策适应的图像防护:基准与方法

Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou

机构 * Fudan University(复旦大学) Tencent(腾讯) Peking University(北京大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出SafeGuard-VL方法,通过强化学习与可验证奖励提升图像防护的政策适应能力,并通过SafeEditBench基准测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27650 2026-03-31 cs.CV 50%

V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models

V-CAST:面向高效视频大语言模型的曲率感知时空剪枝

Xinying Lin, Xuyang Liu, Yiyu Wang, Teng Ma, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院) Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出V-CAST,一种无需训练的视频长上下文推理剪枝策略,通过曲率引导的时空分配模块和双锚点空间选择机制,提升视频大语言模型的效率与性能。

Comments Code: \url{https://github.com/xinyouu/V-CAST}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27583 2026-03-31 cs.RO cs.SY eess.SY 50%

LLM-Enabled Low-Altitude UAV Natural Language Navigation via Signal Temporal Logic Specification Translation and Repair

基于大语言模型的低空无人机自然语言导航:通过信号时序逻辑规范翻译与修复

Yuqi Ping, Huahao Ding, Tianhao Liang, Longyu Zhou, Guangyu Lei, Xinglin Chen, Junwei Wu, Jieyu Zhou, Tingting Zhang

机构 * Guangdong Provincial Key Laboratory of Space-Aerial Networking and Intelligent Sensing, Harbin Institute of Technology, Shenzhen(广东省空天网络与智能感知重点实验室,哈尔滨工业大学(深圳)) Peng Cheng Laboratory (PCL), Shenzhen(鹏城实验室) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计系) School of Computer Science and Engineering, Central South University, Changsha(中南大学计算机科学与工程学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种统一框架,通过将自然语言指令转换为信号时序逻辑规范并利用混合整数线性规划生成轨迹,提升低空无人机在复杂环境中的安全导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10300 2026-03-30 cs.CV 50%

From Imitation to Intuition: Intrinsic Reasoning for Open-Instance Video Classification

从模仿到直觉:用于开放实例视频分类的内在推理

Ke Zhang, Xiangchen Zhao, Yunjie Tian, Jiayu Zheng, Vishal M. Patel, Di Fu

机构 * Johns Hopkins University(约翰霍普金斯大学) ByteDance Inc(字节跳动公司)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出DeepIntuit框架,通过冷启动监督对齐和GRPO优化,将视频分类从模仿转向直觉推理,提升开放实例分类性能。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24931 2026-03-27 cs.RO 50%

COIN: Collaborative Interaction-Aware Multi-Agent Reinforcement Learning for Self-Driving Systems

COIN: 基于协作交互的多智能体强化学习用于自动驾驶系统

Yifeng Zhang, Jieming Chen, Tingguang Zhou, Tanishq Duhan, Jianghong Dong, Yuhong Cao, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院机械工程系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出COIN框架,通过改进的CIG-TD3算法和双层交互感知集中批评者架构,提升多智能体自动驾驶系统在复杂动态场景中的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16212 2026-03-26 cs.RO 50%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 安全训练 :alignment(abstract)

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23880 2026-03-26 cs.SI 50%

ProcureGym: A Multi-Agent Markov Game Framework for Modeling National Volume-based Drug Procurement

ProcureGym: 一个用于建模国家基于体积的药品采购的多智能体马尔可夫游戏框架

Jia Wang, Qian Xu, Xuanwen Ding, Zhuangqi Li, Chao He, Bao Liu, Zhongyu Wei

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出ProcureGym,通过真实数据模拟中国基于体积的药品采购,评估RL、LLM等智能体模型,发现RL在收益和利润上表现更优,揭示最大有效报价和采购量对战略结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21810 2026-03-24 eess.SY cs.MA cs.RO cs.SY 50%

Partial Attention in Deep Reinforcement Learning for Safe Multi-Agent Control

深度强化学习中多智能体控制的安全部分注意力

Turki Bin Mohaya, Peter Seiler

机构 * Department of Electrical Engineering and Computer Science at the University of Michigan(密歇根大学电气工程与计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出在多智能体安全控制中应用注意力机制,设计神经网络控制高速公路汇入场景的自动驾驶车辆,通过部分注意力提升安全性和效率。

Comments This work has been accepted for publication in the proceedings of the 2026 American Control Conference (ACC), New Orleans, Louisiana, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21427 2026-03-24 cs.SE 50%

Dynasto: Validity-Aware Dynamic-Static Parameter Optimization for Autonomous Driving Testing

Dynasto:面向自动驾驶测试的有效性感知动态-静态参数优化

Dmytro Humeniuk, Mohammad Hamdaqa, Houssem Ben Braiek, Amel Bennaceur, Foutse Khomh

专题命中 安全训练 :safety(abstract)

AI总结 Dynasto通过联合优化初始场景参数和动态对抗行为,发现更多真实安全关键故障,揭示自动驾驶系统中的弱点。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21142 2026-03-24 cs.RO 50%

Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation

动态控制屏障函数调节与视觉-语言模型用于安全、适应性和实时视觉导航

Jeffrey Chen, Rohan Chandra

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AlphaAdj框架,利用视觉-语言模型动态调整控制屏障函数参数,以实现在动态环境中安全、高效和实时的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20658 2026-03-24 cs.RO 50%

Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation

加速补丁:学习一种插件式策略以加快具身操作

Zhichao Wu, Junyin Ye, Zhilong Zhang, Yihao Sun, Haoxin Lin, Jiaheng Luo, Haoxiang Ren, Lei Yuan, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China School of Artificial Intelligence, Nanjing University, China Mila-Quebec AI Institute \& Université de Montréal, Canada

专题命中 安全训练 :safety(abstract)

AI总结 本文提出Speedup Patch,一种轻量且策略无关的框架,通过仅使用离线数据实现插件式加速,通过约束马尔可夫决策过程优化调度器,提升执行效率而不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20356 2026-03-24 cs.LO cs.CR cs.FL 50%

Agentproof: Static Verification of Agent Workflow Graphs

Agentproof: 静态验证代理工作流图

Melwin Xavier, Vaisakh M A, Melveena Jolly, Midhun Xavier

专题命中 安全训练 :safety(abstract)

AI总结 Agentproof通过提取四个主流代理框架的统一抽象图模型,应用六种结构检查并生成见证轨迹,评估时间安全策略,实现无需手动建模的静态验证,发现工作流中的结构缺陷和政策违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15674 2026-03-24 eess.SY cs.SY 50%

Safe and Stable Formation Control with Autonomous Multi-Agents Using Adaptive Control (Extended Version)

使用自适应控制的自主多智能体安全稳定编队控制(扩展版)

Jose A. Solano-Castellanos, Peter A. Fisher, Anuradha Annaswamy

专题命中 安全训练 :safety(abstract)

AI总结 本文提出结合自适应控制、控制屏障函数和连接图的方法,解决多智能体系统在动态不确定性和通信限制下的稳定与安全编队控制问题,通过自适应控制确保稳定性,安全过滤器生成安全指令,参考模型实现无不确定情况下的编队控制。

Comments Accepted to Modeling, Estimation and Control Conference (MECC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏