arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 162 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 162 篇

2504.11907 2026-07-07 cs.RO 版本更新 50%

A Graph-Based Reinforcement Learning Approach with Frontier Potential Based Reward for Safe Cluttered Environment Exploration

一种基于前沿势奖励的基于图的强化学习方法用于安全杂乱环境探索

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology(计算机科学、电气与航天工程系,吕勒奥技术大学)

专题命中 安全训练 :safety(abstract)

AI总结 提出结合图神经网络探索贪心策略与安全护盾的方法,用近端策略优化算法训练网络,最大化探索效率并减少护盾干预,还提出奖励函数,能在杂乱环境高效安全探索。

Comments 6 pages, 4 figures, accepted at the 24th European Control Conference (ECC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 50%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 安全训练 :alignment(abstract)

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13940 2026-07-03 cs.RO 版本更新 50%

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning

NeHMO:用于分散式安全多臂运动规划的神经Hamilton-Jacobi可达性学习

Qingyi Chen, Zachary Kingston, Ahmed H. Qureshi

机构 * Department of Computer Science at Purdue University(普渡大学计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 提出基于神经Hamilton-Jacobi可达性学习的方法,学习安全值函数以捕获最坏情况下的臂间安全约束,并开发分散式轨迹优化框架,实现可扩展、数据高效的多臂运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03591 2026-07-02 cs.RO cs.SY eess.SY 版本更新 50%

Manifold-constrained Hamilton-Jacobi Reachability Learning for Decentralized Multi-Agent Motion Planning

流形约束的 Hamilton-Jacobi 可达性学习用于去中心化多智能体运动规划

Qingyi Chen, Ruiqi Ni, Junyoung Kim, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(abstract)

AI总结 提出流形约束的 HJR 学习框架,通过求解流形约束下的 HJR 问题获取任务感知安全条件,并集成到去中心化轨迹优化规划器中,实现安全且任务可行的多智能体运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15614 2026-07-01 cs.RO 版本更新 50%

AION: Aerial Indoor Object-Goal Navigation Using Dual-Policy Reinforcement Learning

AION: 基于双策略强化学习的空中室内目标导航

Zichen Yan, Yuchen Hou, Shenao Wang, Yichao Gao, Rui Huang, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)

专题命中 安全训练 :safety(abstract)

AI总结 提出AION,一种端到端双策略强化学习框架,解耦探索与目标到达行为,用于视觉空中目标导航,无需外部定位或全局地图,在AI2-THOR和IsaacSim中验证了优越性能。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22378 2026-06-23 cs.RO 版本更新 50%

Adaptive vs. Static Robot-to-Human Handover: A Study on Orientation and Approach Direction

自适应与静态机器人-人类交接:关于方向和接近方向的研究

Federico Biagi, Dario Onfiani, Simone Silenzi, Cristina Iani, Luigi Biagiotti

机构 * Department of Engineering "Enzo Ferrari", University of Modena and Reggio Emilia(工程学院"Enzo Ferrari",摩德纳和雷吉奥艾米利亚大学) Department of Surgery, Medicine, Dentistry and Morphological Sciences, University of Modena and Reggio Emilia(外科、医学、牙科和形态学科学学院,摩德纳和雷吉奥艾米利亚大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出了一种自适应框架,通过实时调整物体的交付姿态,提升人类抓取的效率和安全性,实验表明动态对齐能降低用户认知负荷和生理压力,增强对机器人可靠性的信任。

Comments The paper has been accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06495 2026-06-18 cs.CR 版本更新 50%

Graphs Don't Stay Secret: Practical Subgraph Reconstruction Attacks on Defended Graph RAG

图并非保密:对防御图RAG的实用子图重构攻击

Minkyoo Song, Jaehan Kim, Myungchul Kang, Hanna Kim, Seungwon Shin, Sooel Son

专题命中 安全训练 :safety(abstract)

AI总结 提出GRASP攻击,通过多轮查询从防御的图RAG系统中重构子图,达到82.9 F1,并评估防御措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06756 2026-06-17 eess.SY cs.SY 版本更新 50%

Generative AI Enabled Robust Sensor Placement in Cyber-Physical Power Systems: A Graph Diffusion Approach

生成式AI赋能的信息物理电力系统鲁棒传感器布置:一种图扩散方法

Changyuan Zhao, Guangyuan Liu, Bin Xiang, Benoit Delinchant, Dong In Kim

专题命中 安全训练 :safety(abstract)

AI总结 提出一种基于图扩散的生成式AI框架,通过经验反馈图扩散算法优化传感器布置,同时提升物理层异常检测和网络层通信韧性,解决信息物理电力系统的NP-hard优化问题。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15459 2026-06-16 cs.RO 版本更新 50%

Neural Minimum-Distance Estimation for Collision-Aware Operation of Multi-Arm Laparoscopy Surgical Robots Through Learning-from-Simulation

基于仿真学习的多臂腹腔镜手术机器人碰撞感知操作的神经最小距离估计

Sarvin Ghiasi, Majid Roshanfar, Jake Barralet, Liane S. Feldman, Amir Hooshiar

机构 * Surgical Performance Enhancement and Robotics (SuPER) Centre, Department of Surgery(外科性能增强与机器人中心(SuPER)中心,外科部) The Wilfred and Joyce Posluns Centre for Image Guided Innovation & Therapeutic Intervention (PCIGITI)(威廉与乔伊斯·波斯伦中心(PCIGITI)影像引导创新与治疗干预中心) The Hospital for Sick Children (SickKids)(儿童医院(SickKids))

专题命中 安全训练 :safety(abstract)

AI总结 提出结合分析建模、实时仿真与深度残差神经网络的框架,用于多臂手术机器人最小距离估计与碰撞预警,模型在验证集上R²=0.940,RMSE=42.0 mm。

Journal ref Sensors 2026, 26(12), 3744

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05727 2026-06-11 cs.DC 版本更新 50%

LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing

LLM增强的深度强化学习用于协作边缘计算中的任务卸载

Hao Guo, Kaixiang Xu, Ziwu Ge, Lei Yang

专题命中 安全训练 :alignment(abstract)

AI总结 提出LeDRL框架,结合轻量级LLM与自注意力增强DRL,通过结构化提示和语义反馈实现实时任务卸载,在成功率、收敛速度和实时性上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15422 2026-06-09 cs.SE 版本更新 50%

A Survey on the Applications of Generative Artificial Intelligence in Automated Driving Systems Test Scenario Generation Methods

生成式人工智能在自动驾驶系统测试场景生成方法中的应用综述

Ji Zhou, Yongqi Zhao, Yixian Hu, Hexuan Li, Zhengguo Gu, Nan Xu, Arno Eichberger

专题命中 安全训练 :safety(abstract)

AI总结 综述生成式AI在自动驾驶测试场景生成中的应用,分析31篇主要研究,提出包含多模态扩展、伦理检查表和ODD覆盖图的分类法,以解决标准化评估缺失等问题。

Comments 40 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17003 2026-06-08 math.OC cs.SY eess.SY 版本更新 50%

Constricting Tubes for Prescribed-Time Safe Control

为指定时间安全控制设计的约束管

Darshan Gadginmath, Ahmed Allibhoy, Fabio Pasqualetti

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种约束控制屏障函数框架,用于具有输入约束的控制仿射系统指定时间控制。通过构造一个随时间变化的安全管,从包含初始条件的放松集缩小到目标集,确保在用户指定的截止时间内恢复。框架通过单个仿射约束每时间步,实现可扩展性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏