arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

1903.01576 2019-03-07 eess.SP cs.LG 57%

V2X System Architecture Utilizing Hybrid Gaussian Process-based Model Structures

Hossein Nourkhiz Mahjoub, Behrad Toghi, S M Osman Gani, Yaser P. Fallah

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted for Oral Presentation at the 13th IEEE Systems Conference (SysCon 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.10754 2019-03-01 cs.LG stat.ML 57%

Introspection Learning

Chris R. Serrano, Michael A. Warren

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 8 pages. Submitted to 2019 AAAI Spring Symposium on Verification of Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.06083 2018-12-06 stat.ML cs.LG 57%

Learning Optimal Personalized Treatment Rules Using Robust Regression Informed K-NN

Ruidi Chen, Ioannis Paschalidis

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.03728 2018-11-12 cs.LG cs.CR stat.ML 57%

Detecting Backdoor Attacks on Deep Neural Networks by Activation Clustering

Bryant Chen, Wilka Carvalho, Nathalie Baracaldo, Heiko Ludwig, Benjamin Edwards, Taesung Lee, Ian Molloy, Biplav Srivastava

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.01147 2018-11-06 cs.AI 57%

SafeRoute: Learning to Navigate Streets Safely in an Urban Environment

Sharon Levy, Wenhan Xiong, Elizabeth Belding, William Yang Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.03080 2018-09-11 cs.CY 57%

A path to AI

Ion Dronic

专题命中 安全训练 :alignment(abstract);分类 cs.CY

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.09203 2018-03-28 cs.AI cs.RO 57%

Autonomous Ramp Merge Maneuver Based on Reinforcement Learning with Continuous Action Space

Pin Wang, Ching-Yao Chan

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.08757 2018-01-29 cs.AI 57%

Safe Exploration in Continuous Action Spaces

Gal Dalal, Krishnamurthy Dvijotham, Matej Vecerik, Todd Hester, Cosmin Paduraru, Yuval Tassa

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.06782 2017-11-21 cs.LG cs.RO 57%

Leave no Trace: Learning to Reset for Safe and Autonomous Reinforcement Learning

Benjamin Eysenbach, Shixiang Gu, Julian Ibarz, Sergey Levine

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Videos of our experiments are available at: https://sites.google.com/site/mlleavenotrace/

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.03730 2017-09-14 cs.LG cs.HC 57%

Interpreting Shared Deep Learning Models via Explicable Boundary Trees

Huijun Wu, Chen Wang, Jie Yin, Kai Lu, Liming Zhu

专题命中 安全训练 :trustworthy(abstract);分类 cs.LG

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10528 2017-05-31 cs.LG 57%

Constrained Policy Optimization

Joshua Achiam, David Held, Aviv Tamar, Pieter Abbeel

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted to ICML 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.05577 2016-04-20 cs.SE cs.AI cs.MA 57%

Contribution to the Formal Specification and Verification of a Multi-Agent Robotic System

Nadeem Akhtar, Malik M. Saad Missen

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:1501.05120

Journal ref European Journal of Scientific Research, ISSN 1450-216X / 1450-202X Vol.117 No.1 January, 2014, pp. 35-55

详情

展开后加载摘要…

URL PDF HTML 收藏
1501.04725 2015-01-21 cs.PL cs.LG 57%

Learning Invariants using Decision Trees

Siddharth Krishna, Christian Puhrsch, Thomas Wies

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17222 2025-04-07 cs.CV 56%

How Could Generative AI Support Compliance with the EU AI Act? A Review for Safe Automated Driving Perception

Mert Keser, Youssef Shoeb, Alois Knoll

专题命中 安全训练 :safety(abstract,journal_ref)

Journal ref 2024 IEEE International Conference on Vehicular Electronics and Safety (ICVES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03284 2024-03-29 eess.SY cs.RO cs.SY 56%

Safe Collective Control under Noisy Inputs and Competing Constraints via Non-Smooth Barrier Functions

Clinton Enwerem, John S. Baras

专题命中 安全训练 :safety(abstract,comments)

Comments Accepted to the 2024 European Control Conference. See Section VI.B (in particular, Theorem 1, Proposition 2, and Remark 2) for updates incorporating new results (from Reference 3) on almost-sure safety of ZCBFs

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01739 2025-11-11 cs.AI cs.LG 54%

Conceptual Belief-Informed Reinforcement Learning

Xingrui Gu, Chuyi Jiang, Laixi Shi

机构 * University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :alignment(comments,journal_ref);分类 cs.AI、cs.LG

Comments Accepted by ICML 2025 Workshop on Models of Human Feedback for AI Alignment

Journal ref ICML 2025 Workshop on Models of Human Feedback for AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08154 2026-08-20 cs.CV 50%

Investigating Vision-Language Model for Point Cloud-based Vehicle Classification

Yiqiao Li, Jie Wei, Camille Kamga

专题命中 安全训练 :safety(abstract)

Comments 5 pages,3 figures, 1 table, CVPR DriveX workshop

Journal ref DriveX Workshop at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17349 2026-08-19 cs.DC 新提交 50%

Brief Announcement: Fair Binding for Hidden-State Authorization in Byzantine SMR

简短公告:拜占庭SMR中隐藏状态授权的公平绑定

Arnab Mallick

专题命中 安全训练 :safety(abstract)

AI总结 针对拜占庭SMR中隐藏状态授权问题,提出公平预留/使用协议,满足授权安全性与先到者活性,解决隐藏资源安全动态分配问题。

Comments Accepted at DISC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-19 eess.SY cs.SY 新提交 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 50%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 安全训练 :alignment(abstract)

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14877 2026-08-18 cs.NI eess.SP 新提交 50%

Deep Reinforcement Learning for 6G AI-RAN: A Comprehensive Survey

面向6G AI-RAN的深度强化学习:一项综合调查

Jie Lu, Peihao Yan, Qijun Wang, Ruxin Lin, Huacheng Zeng

专题命中 安全训练 :trustworthy(abstract)

AI总结 本文针对6G开放AI-RAN,首次开展深度强化学习(DRL)综合调查,梳理DRL基础、O-RAN感知框架、DRL应用分类及相关研究方向,填补了DRL方法论与O-RAN部署间的系统关联空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 50%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 安全训练 :safety(abstract)

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09872 2026-08-11 math.OC stat.ME 新提交 50%

Safe Start: Configuring Optimization Algorithms for Decision-Making under Extreme Risks

安全起始:极端风险下决策的优化算法配置

Henry Lam, Wasin Meesena

专题命中 安全训练 :safety(abstract)

AI总结 针对极端风险下的随机优化问题,提出基于安全起始的解决方案,结合方差缩减保障运行时间,在投资组合优化和神经网络鲁棒分类中验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22787 2026-08-11 cs.HC cs.RO 版本更新 50%

DiSCo: Diffusion Sequence Copilots for Shared Autonomy

DiSCo:用于共享自主的扩散序列助手

Andy Wang, Xu Yan, Brandon McMahan, Michael Zhou, Yuyang Yuan, Johannes Y. Lee, Ali Shreif, Matthew Li, Zhenghao Peng, Bolei Zhou, Yuchen Cui, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 安全训练 :alignment(abstract)

AI总结 DiSCo通过扩散策略规划与用户动作一致的动作序列,提升复杂系统控制性能,适用于模拟驾驶和机械臂任务。

Comments 10 pages, 5 figures, HRI '26: Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03509 2026-08-10 cs.CR 版本更新 50%

SkillJack: Persistent Skill Backdoors in Self-Evolving Agents

SkillJack:自进化智能体中的持续性技能后门

Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

专题命中 安全训练 :safety(abstract)

AI总结 该研究提出SkillJack攻击,利用自进化智能体的经验转技能流水线植入持续性恶意技能,在SkillX和Anything2Skill上验证其低检测率、高成功率,揭示技能演化为新攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19499 2026-08-10 cs.RO 版本更新 50%

Progress-Certified Reversible Simplex Supervision of Goal-Reaching Reinforcement Learning

强化学习目标到达控制与保证Lyapunov-like稳定器的移动机器人

Mehdi Heydari Shahna, Jouni Mattila

机构 * Faculty of Engineering(工程学院) Natural Sciences(自然科学) Tampere University(塔尔库大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于强化学习的控制框架,通过Lyapunov-like稳定器保证移动机器人在无结构环境中的目标到达,提升目标到达率至99%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 50%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 安全训练 :alignment(abstract)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00133 2026-08-04 eess.SY cs.SY 新提交 50%

Deep Reinforcement Learning: From First Principles to Reasoning Models

深度强化学习:从第一性原理到推理模型

Ghoshana Bista

专题命中 安全训练 :safety(abstract)

AI总结 本书介绍深度强化学习从经典方法到各类算法及多领域应用的演进,融合基础与研究视角,面向具备相关基础的学生、研究者和工程师。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29239 2026-08-04 cs.CR 版本更新 50%

Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

专题命中 安全训练 :alignment(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28835 2026-08-03 cs.SE cs.OS cs.PL 新提交 50%

From C to Idiomatic Rust: A Ship-of-Theseus Agentic Translation

从C到地道Rust:Theseus之船智能体翻译

Vasily A. Sartakov

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种智能体AI驱动的结构化C到Rust迁移工作流,先生成语义保留的非地道Rust基线,再逐步重写为地道Rust,经12.5千行代码的iodine验证可实现可靠迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏