arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2501.06756 2026-06-17 eess.SY cs.SY 版本更新 50%

Generative AI Enabled Robust Sensor Placement in Cyber-Physical Power Systems: A Graph Diffusion Approach

生成式AI赋能的信息物理电力系统鲁棒传感器布置:一种图扩散方法

Changyuan Zhao, Guangyuan Liu, Bin Xiang, Benoit Delinchant, Dong In Kim

专题命中 安全训练 :safety(abstract)

AI总结 提出一种基于图扩散的生成式AI框架,通过经验反馈图扩散算法优化传感器布置,同时提升物理层异常检测和网络层通信韧性,解决信息物理电力系统的NP-hard优化问题。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16436 2026-06-16 cs.RO cs.CV 新提交 50%

V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos

V2P-Manip:从单目人类视频学习灵巧操作

Kaihan Chen, Yanming Shao, Haifeng Ji, Xiaokang Yang, Yao Mu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 提出V2P-Manip框架,从单目人类演示视频中提取具有视觉保真度和物理合理性的轨迹,通过两阶段精炼实现空间对齐与物理一致性,在TACO和OakInk基准上显著优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16116 2026-06-16 eess.SY cs.MA cs.RO cs.SY math.DS 新提交 50%

Distributed Safe Consensus Under Asymmetric Input and Time-Varying Output Constraints

非对称输入与时变输出约束下的分布式安全一致性

Abhinav Sinha, Shashi Ranjan Kumar

机构 * Guidance, Autonomy, Learning, and Control for Intelligent Systems (GALACxIS) Lab, Department of Aerospace Engineering and Engineering Mechanics, University of Cincinnati(智能系统引导、自主、学习与控制实验室,航空航天工程与工程力学系,辛辛那提大学) Intelligent Systems and Control (ISaC) Lab, Department of Aerospace Engineering, Indian Institute of Technology Bombay(智能系统与控制实验室,航空航天工程系,印度班加罗尔理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 针对单积分多智能体系统,提出一种结合障碍坐标变换的分布式控制律,同时满足非对称执行器约束和时变输出安全约束,实现渐近同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15459 2026-06-16 cs.RO 版本更新 50%

Neural Minimum-Distance Estimation for Collision-Aware Operation of Multi-Arm Laparoscopy Surgical Robots Through Learning-from-Simulation

基于仿真学习的多臂腹腔镜手术机器人碰撞感知操作的神经最小距离估计

Sarvin Ghiasi, Majid Roshanfar, Jake Barralet, Liane S. Feldman, Amir Hooshiar

机构 * Surgical Performance Enhancement and Robotics (SuPER) Centre, Department of Surgery(外科性能增强与机器人中心(SuPER)中心,外科部) The Wilfred and Joyce Posluns Centre for Image Guided Innovation & Therapeutic Intervention (PCIGITI)(威廉与乔伊斯·波斯伦中心(PCIGITI)影像引导创新与治疗干预中心) The Hospital for Sick Children (SickKids)(儿童医院(SickKids))

专题命中 安全训练 :safety(abstract)

AI总结 提出结合分析建模、实时仿真与深度残差神经网络的框架,用于多臂手术机器人最小距离估计与碰撞预警,模型在验证集上R²=0.940,RMSE=42.0 mm。

Journal ref Sensors 2026, 26(12), 3744

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05727 2026-06-11 cs.DC 版本更新 50%

LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing

LLM增强的深度强化学习用于协作边缘计算中的任务卸载

Hao Guo, Kaixiang Xu, Ziwu Ge, Lei Yang

专题命中 安全训练 :alignment(abstract)

AI总结 提出LeDRL框架,结合轻量级LLM与自注意力增强DRL,通过结构化提示和语义反馈实现实时任务卸载,在成功率、收敛速度和实时性上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10598 2026-06-10 cs.SE 新提交 50%

Exploring and Complementing End Users' Requirements in IoT enabled System

探索与补充物联网系统中终端用户的需求

Haotian Li, Xiaohong Chen, Zhi Jin, Shuyuan Xiao, Chenxu Wang, Haoxiang Yan, Xiaoyi Chen

专题命中 安全训练 :safety(abstract)

AI总结 针对终端用户通过触发动作编程创建物联网规则时表达碎片化的问题,提出一种基于意图的需求补全方法,利用双向需求可追溯树和多智能体框架,结合大语言模型推理与结构化可追溯性,实现功能完整且内在安全的规则补全,将规则补全率提升43%,逻辑冲突减少21%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09841 2026-06-10 cs.HC 新提交 50%

Human-Centered AI for Safe Shuttle Car Routing in Underground Room-and-Pillar Coal Mines Using Graph Neural Networks

面向人类中心的图神经网络安全穿梭车路径规划在房柱式地下煤矿中的应用

Bryant Pollard

专题命中 安全训练 :safety(abstract)

AI总结 针对地下煤矿低能见度、动态环境下的安全路径决策问题,提出基于图神经网络的人类中心AI决策支持系统,通过专家合成数据训练、浏览器界面部署及SHAP可解释性分析,提升任务完成率、响应速度和用户信任。

Comments 18 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08137 2026-06-09 eess.SY cs.SY 新提交 50%

A Barrier-Modulated Architecture for Safe Affine Formation Control in Second-Order Multi-Agent Systems

面向二阶多智能体系统安全仿射编队控制的屏障调制架构

Ashik Abrar Naeem, Mohammad Ariful Haque

专题命中 安全训练 :safety(abstract)

AI总结 提出一种结合高阶控制屏障函数与自适应动态规划的屏障调制架构,实现二阶多智能体系统的安全仿射编队控制,通过分析型与数据驱动两种安全控制器保证绝对避碰和一致最终有界编队跟踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08035 2026-06-09 cs.CV 新提交 50%

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

DyCo-RL: 用于视觉推理的动态跨模态协调

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe

机构 * University of Trento(特伦托大学) BAAI(北京智源人工智能研究院) Singapore Management University(新加坡管理大学) IQuest Research

专题命中 安全训练 :alignment(abstract)

AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15422 2026-06-09 cs.SE 版本更新 50%

A Survey on the Applications of Generative Artificial Intelligence in Automated Driving Systems Test Scenario Generation Methods

生成式人工智能在自动驾驶系统测试场景生成方法中的应用综述

Ji Zhou, Yongqi Zhao, Yixian Hu, Hexuan Li, Zhengguo Gu, Nan Xu, Arno Eichberger

专题命中 安全训练 :safety(abstract)

AI总结 综述生成式AI在自动驾驶测试场景生成中的应用,分析31篇主要研究,提出包含多模态扩展、伦理检查表和ODD覆盖图的分类法,以解决标准化评估缺失等问题。

Comments 40 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17003 2026-06-08 math.OC cs.SY eess.SY 版本更新 50%

Constricting Tubes for Prescribed-Time Safe Control

为指定时间安全控制设计的约束管

Darshan Gadginmath, Ahmed Allibhoy, Fabio Pasqualetti

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种约束控制屏障函数框架,用于具有输入约束的控制仿射系统指定时间控制。通过构造一个随时间变化的安全管,从包含初始条件的放松集缩小到目标集,确保在用户指定的截止时间内恢复。框架通过单个仿射约束每时间步,实现可扩展性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06244 2026-06-05 cs.CR 50%

Steering LLM Viewpoints through Fabricated Evidence Injection

通过捏造证据注入操控LLM观点

Xi Yang, Chang Liu, Zhenglin Huang, Haoran Li, Weiming Zhang, Jian Weng, Yangqiu Song

专题命中 安全训练 :safety(abstract)

AI总结 提出Ghostwriter两阶段攻击框架,通过注入带有可信标记的捏造证据,利用LLM对外部上下文的盲目信任来操控其观点,并探索防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23497 2026-06-05 cs.CV 50%

VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation

VOLD:通过在线蒸馏将LLM推理能力转移到视觉语言模型

Walid Bousselham, Hilde Kuehne, Cordelia Schmid

机构 * Tuebingen AI Center(图宾根人工智能中心) University of Tuebingen(图宾根大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Inria, École Normale Supérieure, CNRS, PSL Research University(法国国家科学研究院、巴黎-萨克勒大学、École Normale Supérieure、PSL研究大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出VOLD框架,通过在线蒸馏将文本模型的推理能力转移到视觉语言模型,利用组相对策略优化与在线蒸馏结合,提升推理性能,并验证了冷启动对齐在在线训练中的重要性。

Comments www.walidbousselham.com/VOLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04149 2026-06-04 cs.RO 50%

CoPark: Learning Reactive Parking via Self-Play

CoPark:通过自我对弈学习反应式泊车

Jiarong Wei, Yanxing Chen, Sinuo Song, Yin Wu, Anna Rehr, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE(CARIAD SE公司) Technical University of Munich(慕尼黑技术大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出CoPark,一种基于残差策略的多智能体自我对弈强化学习方法,通过固定先验与残差头结合,在反应式泊车中实现高精度与安全交互的平衡,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.05506 2026-06-04 eess.SY cs.SY 50%

Enhancing the performance of a safe controller via supervised learning for truck lateral control

通过监督学习增强安全控制器的性能以用于卡车侧向控制

Yuxiao Chen, Ayonga Hereid, Huei Peng, Jessy Grizzle

专题命中 安全训练 :safety(abstract)

AI总结 本文结合监督学习与控制屏障函数,设计了兼具高性能与可证明安全性的控制器,通过轨迹优化生成训练集,利用监督学习生成控制策略,并通过CBF保证安全,验证了该方法在卡车车道保持中的有效性。

Comments submitted to IEEE Transaction of Control System Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.04537 2026-06-04 eess.SY cs.SY 50%

Cloud Resource Allocation for Cloud-Based Automotive Applications

面向云基础汽车应用的云资源分配

Zhaojian Li, Tianshu Chu, Ilya V. Kolmanovsky, Xiang Yin, Xunyuan Yin

专题命中 安全训练 :safety(abstract)

AI总结 本文研究云基础汽车系统的资源分配问题,提出集中化和去中心化模型,分别用于私有云和公有云,通过优化算法提升服务质量与资源利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03868 2026-06-03 cs.CV 50%

Unified Video-Action Joint Denoising for Dexterous Action and Data Generation

统一视频-动作联合去噪用于灵巧动作与数据生成

Dingrui Wang, YuAn Wang, Jinkun Liu, Yue Zhang, Mattia Piccinini, Yu Sun, Johannes Betz

机构 * Technical University of Munich(慕尼黑技术大学) ByteDance(字节跳动) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出Donk模型,通过联合建模交互视频与手部轨迹的分布,实现灵巧手的动作生成与数据增强。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02994 2026-06-03 cs.CV 50%

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation

Video-OPD:通过在线策略蒸馏实现多模态大语言模型在时序视频定位中的高效后训练

Jiaze Li, Hao Yin, Haoran Xu, Boshen Xu, Wenhui Tan, Zewen He, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出Video-OPD框架,利用在线策略蒸馏和教师验证分歧聚焦课程,以高效后训练多模态大语言模型进行时序视频定位,克服稀疏奖励和高计算开销问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20623 2026-06-03 cs.RO 50%

Latent Activation Editing: Inference-Time Refinement of Learned Policies for Safer Multirobot Navigation

潜在激活编辑:基于推理时策略精炼的安全多机器人导航

Satyajeet Das, Darren Chiu, Zhehui Huang, Lars Lindemann, Gaurav S. Sukhatme

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Automatic Control Laboratory, ETH Zürich(苏黎世联邦理工学院自动控制实验室)

专题命中 安全训练 :safety(abstract)

AI总结 提出潜在激活编辑(LAE)框架,通过在推理时在线检测并编辑中间激活,在不修改权重或架构的情况下降低预训练策略的碰撞率,在四旋翼导航中实现近90%的碰撞减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01663 2026-06-02 cs.GT cs.DC cs.MA 50%

A Sheaf Framework for Strategic Multi-Agent Systems: From Consensus to Nash Equilibria

面向策略性多智能体系统的层框架:从共识到纳什均衡

Manuel Hernández, Eduardo Sánchez-Soto

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出一个统一的范畴框架,通过引入博弈层概念,将事件演算、SCEL类集成形成和博弈论奖励结构整合到时空历史的格罗滕迪克拓扑中,并证明纳什均衡对应于派生最佳响应对应层的全局截面,而同调障碍分类策略一致性的失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29772 2026-06-01 cs.NI 50%

ARIADNE: AI-RAN Informed Link Adaptation in Digital Twin Network Environments

ARIADNE:数字孪生网络环境中基于AI-RAN的链路自适应

Maria Tsampazi, Neagin Neasamoni Santhi, Nicole Perrotta, Falko Dressler, Tommaso Melodia

专题命中 安全训练 :safety(abstract)

AI总结 提出在线强化学习模块ARIADNE,集成于SIONNA框架实现链路自适应,在频谱效率上比行业标准和最先进方法分别提升11%和20%,并揭示RL学习的MCS选择策略与OLLA不同。

Comments 6 pages, 9 fugures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26448 2026-05-27 cs.MA cs.GT cs.NE 50%

Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure

公共物品博弈中的宪法军备竞赛:合作-背叛压力下共进化的大语言模型宪法

Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan Tan

专题命中 安全训练 :alignment(abstract)

AI总结 研究在公共物品博弈中,通过LLM引导的进化搜索,发现对抗性宪法共进化在耦合适应度和足够评估预算下可行,并产生可解释的红队测试工件。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26239 2026-05-27 cs.CV cs.MA 50%

Sentinel: Embodied Cooperative Spatial Reasoning and Planning

Sentinel:具身协同空间推理与规划

Xiangye Lin, Hongxin Zhang, Ruxi Deng, Qinhong Zhou, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(abstract)

AI总结 提出Sentinel挑战和CoSaR框架,通过自然语言通信与空间导航算法结合,解决多智能体在城市规模户外环境中的协同空间推理与规划问题。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25411 2026-05-26 cs.CR cs.SC 50%

Heimdall: Formally Verified Automated Migration of Legacy eBPF Programs to Rust

Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移

Vishnu Asutosh Dasu, Monika Santra, Md Rafi Ur Rashid, Ashish Kumar, Saeid Tizpaz-Niari, Gang Tan

专题命中 安全训练 :safety(abstract)

AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25362 2026-05-26 cs.RO 50%

Prior Policy Guided Dual-Agent Coordinated Manipulation Planning of Spacecraft-Manipulator System

先验策略引导的航天器-机械臂系统双智能体协同操控规划

Yuhui Hu, Dong Zhou, Kaihong Ouyang, Zhongliang Yu, Jianfeng Lv, Xiangyu Shao

机构 * School of Astronautics(航天学院) School of Automation(自动化学院) School of Information Science and Engineering(信息科学与工程学院)

专题命中 安全训练 :safety(abstract)

AI总结 针对空间机械臂与基座强耦合导致的姿态稳定问题,提出先验策略引导的双智能体协同操控规划框架,通过时间步级专家切换机制提升深度强化学习效率,实现末端执行器高精度到达与基座姿态稳定。

Comments 36 pages, 13 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24972 2026-05-26 cs.IT math.IT 50%

Integrated Sensing, Communication, and Computing for NR-V2X: A Cross-Layer Resource Allocation Framework Using Multi-Agent Reinforcement Learning

面向NR-V2X的集成感知、通信与计算:基于多智能体强化学习的跨层资源分配框架

Indulekha K. P., T. G. Venkatesh

专题命中 安全训练 :safety(abstract)

AI总结 提出一种基于多智能体近端策略优化的跨层调度器MAPPO-SPS,联合优化SB-SPS预留、无线资源划分和计算卸载决策,以平衡感知精度、通信可靠性和计算延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10439 2026-05-26 cs.CE 50%

HypeR Adaptivity: Joint $hr$-Adaptive Meshing via Hypergraph Multi-Agent Deep Reinforcement Learning

HypeR 自适应:通过超图多智能体深度强化学习实现联合 $hr$ 自适应网格划分

Niccolò Grillo, James Rowbottom, Pietro Liò, Carola Bibiane Schönlieb, Stefania Fresca

专题命中 安全训练 :alignment(abstract)

AI总结 提出 HypeR 框架,利用超图神经网络和多智能体强化学习联合优化网格重定位与细化,在有限元方法中实现 $hr$ 自适应,相比纯 $h$ 自适应方法将近似误差降低 6-10 倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24309 2026-05-26 cs.CR 50%

Reframing LLM Agent Security as an Agent-Human Interaction Problem

将LLM智能体安全重新定义为智能体-人类交互问题

Peiran Wang, Ying Li, Yuan Tian

专题命中 安全训练 :alignment(abstract)

AI总结 本文通过系统分析59篇学术论文、21个生产智能体系统和26个安全插件,论证LLM智能体安全本质上是智能体-人类交互问题,而非纯算法问题,并提出了三方向研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23477 2026-05-25 cs.RO 50%

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation

语义结构化混合专家用于组合机器人操作

Chengyu Deng, Guanqi Chen, Yizhou Chen, Zejia Liu, Zhiwen Ruan, Guanhua Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出语义结构化混合专家扩散策略(SMoDP),通过视觉语言模型标注的技能语义指导专家专业化,实现参数高效的多任务组合操作。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23356 2026-05-25 eess.SY cs.SY 50%

A Distributed Framework for Data-Driven Safe Coordination in Leader-Follower Networks

一种用于领导者-跟随者网络中数据驱动安全协调的分布式框架

Mirhan Urkmez, Maryam Sharifi, Shahab Heshmati-Alamdari

专题命中 安全训练 :safety(abstract)

AI总结 本文提出分布式数据驱动零化控制屏障函数(3D-ZCBF)框架,通过从输入-状态数据中识别导数边界,在无需显式模型的情况下保证领导者-跟随者多智能体系统的连通性。

Comments Submitted to IEEE TCNS

详情

展开后加载摘要…

URL PDF HTML 收藏