arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2401.13275 2024-01-30 cs.CL cs.AI 62%

Can AI Assistants Know What They Don't Know?

Qinyuan Cheng, Tianxiang Sun, Xiangyang Liu, Wenwei Zhang, Zhangyue Yin, Shimin Li, Linyang Li, Zhengfu He, Kai Chen, Xipeng Qiu

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11334 2024-01-24 cs.CV cs.AI cs.LG 62%

Generalized Out-of-Distribution Detection: A Survey

Jingkang Yang, Kaiyang Zhou, Yixuan Li, Ziwei Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Feel free to comment on our Overleaf manuscript: https://www.overleaf.com/9899719915wmccvdtwpkct#c25192

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13365 2024-01-23 cs.LG cs.AI 62%

Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs

Hector Kohler, Riad Akrour, Philippe Preux

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments To be included in an other submission. arXiv admin note: text overlap with arXiv:2304.05839

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07272 2024-01-17 cs.LG cs.CL 62%

Dialogue for Prompting: a Policy-Gradient-Based Discrete Prompt Generation for Few-shot Learning

Chengzhengxu Li, Xiaoming Liu, Yichen Wang, Duyi Li, Yu Lan, Chao Shen

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

Comments AAAI 2024 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03786 2024-01-12 cs.LG cs.AI cs.RO 62%

Long-term Safe Reinforcement Learning with Binary Feedback

Akifumi Wachi, Wataru Hashimoto, Kazumune Hashimoto

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to AAAI-24

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11339 2024-01-12 cs.AI cs.LG cs.MA 62%

ProAgent: Building Proactive Cooperative Agents with Large Language Models

Ceyao Zhang, Kaijie Yang, Siyi Hu, Zihao Wang, Guanghe Li, Yihang Sun, Cheng Zhang, Zhaowei Zhang, Anji Liu, Song-Chun Zhu, Xiaojun Chang, Junge Zhang, Feng Yin, Yitao Liang, Yaodong Yang

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments v3 is the AAAI'24 camera ready version, which polished abstract and introduction based on the reviewers' comments, and enriched related works. 7 pages of main content, 2 pages of references, 2 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10639 2024-01-10 cs.AI cs.LG 62%

Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning

Yuxiao Lu, Arunesh Sinha, Pradeep Varakantham

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01141 2023-12-15 cs.LG cs.AI 62%

DeepSaDe: Learning Neural Networks that Guarantee Domain Constraint Satisfaction

Kshitij Goyal, Sebastijan Dumancic, Hendrik Blockeel

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06436 2023-12-13 cs.LG cs.AI 62%

Reward Certification for Policy Smoothed Reinforcement Learning

Ronghui Mu, Leandro Soriano Marcolino, Tianle Zhang, Yanghao Zhang, Xiaowei Huang, Wenjie Ruan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments This paper will be presented in AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02227 2023-12-13 cs.LG cs.AI cs.SY eess.SY 62%

State-Wise Safe Reinforcement Learning With Pixel Observations

Simon Sinong Zhan, Yixuan Wang, Qingyuan Wu, Ruochen Jiao, Chao Huang, Qi Zhu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01241 2023-12-05 cs.CL cs.LG 62%

Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization

Rajkumar Ramamurthy, Prithviraj Ammanabrolu, Kianté Brantley, Jack Hessel, Rafet Sifa, Christian Bauckhage, Hannaneh Hajishirzi, Yejin Choi

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

Comments In Proceedings of ICLR 2023. Code found at https://github.com/allenai/rl4lms and Project website at https://rl4lms.apps.allenai.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17769 2023-12-05 cs.CL cs.AI 62%

Social Contract AI: Aligning AI Assistants with Implicit Group Norms

Jan-Philipp Fränken, Sam Kwok, Peixuan Ye, Kanishk Gandhi, Dilip Arumugam, Jared Moore, Alex Tamkin, Tobias Gerstenberg, Noah D. Goodman

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments SoLaR NeurIPS 2023 Workshop (https://solar-neurips.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08592 2023-12-01 cs.SE cs.AI cs.CL 62%

AART: AI-Assisted Red-Teaming with Diverse Data Generation for New LLM-powered Applications

Bhaktipriya Radharapu, Kevin Robinson, Lora Aroyo, Preethi Lahoti

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10863 2023-11-23 cs.RO cs.AI cs.LG 62%

Verified Compositional Neuro-Symbolic Control for Stochastic Systems with Temporal Logic Tasks

Jun Wang, Haojun Chen, Zihe Sun, Yiannis Kantaros

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2209.06130

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03033 2023-11-07 cs.LG cs.AI 62%

Beyond Words: A Mathematical Framework for Interpreting Large Language Models

Javier González, Aditya V. Nori

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 4 figures, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00063 2023-11-02 cs.RO cs.AI cs.LG cs.MA cs.SY eess.SY 62%

Safe multi-agent motion planning under uncertainty for drones using filtered reinforcement learning

Sleiman Safaoui, Abraham P. Vinod, Ankush Chakrabarty, Rien Quirynen, Nobuyuki Yoshikawa, Stefano Di Cairano

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20287 2023-11-01 cs.LG cs.AI 62%

Sample-Efficient and Safe Deep Reinforcement Learning via Reset Deep Ensemble Agents

Woojun Kim, Yongjae Shin, Jongeui Park, Youngchul Sung

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2023 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14788 2023-10-24 cs.LG cs.AI cs.SY eess.SY 62%

Specialized Deep Residual Policy Safe Reinforcement Learning-Based Controller for Complex and Continuous State-Action Spaces

Ammar N. Abbas, Georgios C. Chasparis, John D. Kelleher

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10501 2023-10-17 cs.CL cs.AI 62%

NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails

Traian Rebedea, Razvan Dinu, Makesh Sreedhar, Christopher Parisien, Jonathan Cohen

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2023 - Demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08595 2023-10-17 cs.RO cs.AI cs.LG 62%

Deep Reinforcement Learning for Autonomous Vehicle Intersection Navigation

Badr Ben Elallid, Hamza El Alaoui, Nabil Benamar

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in the 2023 International Conference on Innovation and Intelligence for Informatics, Computing, and Technologies (3ICT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10007 2023-10-03 cs.RO cs.AI cs.LG cs.MA 62%

Multi-Agent Deep Reinforcement Learning for Cooperative and Competitive Autonomous Vehicles using AutoDRIVE Ecosystem

Tanmay Vilas Samak, Chinmay Vilas Samak, Venkat Krovi

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted as Multi-Agent Dynamic Games (MAD-Games) Workshop Paper at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04707 2023-09-12 cs.AI cs.LG 62%

Advantage Actor-Critic with Reasoner: Explaining the Agent's Behavior from an Exploratory Perspective

Muzhe Guo, Feixu Yu, Tian Lan, Fang Jin

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12270 2023-08-24 cs.LG cs.AI 62%

Language Reward Modulation for Pretraining Reinforcement Learning

Ademi Adeniji, Amber Xie, Carmelo Sferrazza, Younggyo Seo, Stephen James, Pieter Abbeel

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Code available at https://github.com/ademiadeniji/lamp

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10130 2023-08-22 econ.GN cs.AI cs.CY q-fin.EC 62%

GPTs are GPTs: An Early Look at the Labor Market Impact Potential of Large Language Models

Tyna Eloundou, Sam Manning, Pamela Mishkin, Daniel Rock

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03907 2023-08-09 cs.HC cs.CY cs.LG 62%

Advancements In Crowd-Monitoring System: A Comprehensive Analysis of Systematic Approaches and Automation Algorithms: State-of-The-Art

Mohammed Ameen, Richard Stone

专题命中 安全训练 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07813 2023-08-08 cs.SE cs.AI cs.LG 62%

A Search-Based Testing Approach for Deep Reinforcement Learning Agents

Amirhossein Zolfagharian, Manel Abdellatif, Lionel Briand, Mojtaba Bagherzadeh, Ramesh S

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Journal ref in IEEE Transactions on Software Engineering, vol. 49, no. 7, pp. 3715-3735, July 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13944 2023-06-27 cs.LG cs.AI 62%

Safe Reinforcement Learning with Dead-Ends Avoidance and Recovery

Xiao Zhang, Hai Zhang, Hongtu Zhou, Chang Huang, Di Zhang, Chen Ye, Junqiao Zhao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02670 2023-06-21 cs.LG cs.AI cs.CR cs.RO 62%

Robust Adversarial Attacks Detection based on Explainable Deep Reinforcement Learning For UAV Guidance and Planning

Thomas Hickling, Nabil Aouf, Phillippa Spencer

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09055 2023-06-16 cs.RO cs.AI cs.LG 62%

Predictive Maneuver Planning with Deep Reinforcement Learning (PMP-DRL) for comfortable and safe autonomous driving

Jayabrata Chowdhury, Vishruth Veerendranath, Suresh Sundaram, Narasimhan Sundararajan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02337 2023-05-15 cs.CY cs.AI 62%

Regulating ChatGPT and other Large Generative AI Models

Philipp Hacker, Andreas Engel, Marco Mauer

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments FAccT '23, June 12-15, 2023, Chicago, IL, USA

详情

展开后加载摘要…

URL PDF HTML 收藏