arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2406.15508 2024-06-25 q-fin.CP cs.AI cs.LG cs.RO 62%

What Teaches Robots to Walk, Teaches Them to Trade too -- Regime Adaptive Execution using Informed Data and LLMs

Raeid Saqur

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2405.09747

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13245 2024-06-25 cs.RO cs.AI cs.CL 62%

A Survey of Robotic Language Grounding: Tradeoffs between Symbols and Embeddings

Vanya Cohen, Jason Xinyu Liu, Raymond Mooney, Stefanie Tellex, David Watkins

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments IJCAI 2024 Survey Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11844 2024-06-19 cs.CY cs.AI 62%

Prompting the E-Brushes: Users as Authors in Generative AI

Yiyang Mei

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

Journal ref International Journal of Law, Ethics, and Technology 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12604 2024-06-19 cs.CL cs.AI 62%

Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming

Jiaxu Liu, Xiangyu Yin, Sihao Wu, Jianhong Wang, Meng Fang, Xinping Yi, Xiaowei Huang

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments Preprint, 10 pages main with 10 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11114 2024-06-19 cs.CL cs.CY cs.SI 62%

Whose Emotions and Moral Sentiments Do Language Models Reflect?

Zihao He, Siyi Guo, Ashwin Rao, Kristina Lerman

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03160 2024-06-18 cs.LG cs.AI cs.RO 62%

HAIM-DRL: Enhanced Human-in-the-loop Reinforcement Learning for Safe and Efficient Autonomous Driving

Zilin Huang, Zihao Sheng, Chengyuan Ma, Sikai Chen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by Communications in Transportation Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06657 2024-06-12 cs.CL cs.AI cs.IR 62%

Harnessing AI for efficient analysis of complex policy documents: a case study of Executive Order 14110

Mark A. Kramer, Allen Leavens, Alexander Scarlat

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06700 2024-06-07 cs.LG cs.AI 62%

Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement

Muning Wen, Junwei Liao, Cheng Deng, Jun Wang, Weinan Zhang, Ying Wen

专题命中 安全训练 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20413 2024-06-03 cs.CR cs.CL cs.CV cs.LG 62%

Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters

Haibo Jin, Andy Zhou, Joe D. Menke, Haohan Wang

专题命中 安全训练 :jailbreak(abstract);分类 cs.CL、cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17039 2024-05-28 cs.CL cs.LG 62%

BWArea Model: Learning World Model, Inverse Dynamics, and Policy for Controllable Language Generation

Chengxing Jia, Pengyuan Wang, Ziniu Li, Yi-Chen Li, Zhilong Zhang, Nan Tang, Yang Yu

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16184 2024-05-28 eess.SY cs.AI cs.LG cs.SY 62%

Safe Deep Model-Based Reinforcement Learning with Lyapunov Functions

Harry Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15152 2024-05-27 cs.CL cs.AI 62%

Machine Unlearning in Large Language Models

Saaketh Koundinya Gundavarapu, Shreya Agarwal, Arushi Arora, Chandana Thimmalapura Jagadeeshaiah

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02025 2024-05-09 cs.LG cs.AI 62%

A Survey of Constraint Formulations in Safe Reinforcement Learning

Akifumi Wachi, Xun Shen, Yanan Sui

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at IJCAI-24 survey track

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18821 2024-05-01 eess.SY cs.AI cs.LG cs.SY 62%

Control Policy Correction Framework for Reinforcement Learning-based Energy Arbitrage Strategies

Seyed Soroush Karimi Madahi, Gargya Gokhale, Marie-Sophie Verwee, Bert Claessens, Chris Develder

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments ACM e-Energy 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18326 2024-04-30 cs.LG cs.AI 62%

SAFE-RL: Saliency-Aware Counterfactual Explainer for Deep Reinforcement Learning Policies

Amir Samadi, Konstantinos Koufos, Kurt Debattista, Mehrdad Dianati

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08570 2024-04-15 cs.RO cs.AI cs.LG 62%

Enhancing Autonomous Vehicle Training with Language Model Integration and Critical Scenario Generation

Hanlin Tian, Kethan Reddy, Yuxiang Feng, Mohammed Quddus, Yiannis Demiris, Panagiotis Angeloudis

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08604 2024-04-11 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

Verification of Neural Reachable Tubes via Scenario Optimization and Conformal Prediction

Albert Lin, Somil Bansal

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to 6th Annual Learning for Dynamics & Control Conference. arXiv admin note: text overlap with arXiv:2209.12336

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03386 2024-04-05 cs.RO cs.AI cs.LG 62%

SENSOR: Imitate Third-Person Expert's Behaviors via Active Sensoring

Kaichen Huang, Minghao Shao, Shenghua Wan, Hai-Hang Sun, Shuai Feng, Le Gan, De-Chuan Zhan

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14316 2024-03-22 cs.LG cs.AI 62%

Reinforcement Learning by Guided Safe Exploration

Qisong Yang, Thiago D. Simão, Nils Jansen, Simon H. Tindemans, Matthijs T. J. Spaan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accecpted at ECAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10081 2024-03-20 cs.CV cs.CL cs.LG 62%

DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback

Yangyi Chen, Karan Sikka, Michael Cogswell, Heng Ji, Ajay Divakaran

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

Comments CVPR 2024. The feedback datasets are released at: https://huggingface.co/datasets/YangyiYY/LVLM_NLF

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06397 2024-03-13 cs.LG cs.AI cs.SY eess.SY 62%

DeepSafeMPC: Deep Learning-Based Model Predictive Control for Safe Multi-Agent Reinforcement Learning

Xuefeng Wang, Henglin Pu, Hyung Jun Kim, Husheng Li

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01769 2024-03-05 cs.LG cs.AI math.OC 62%

A Safe Screening Rule with Bi-level Optimization of $ν$ Support Vector Machine

Zhiji Yang, Wanyi Chen, Huan Zhang, Yitian Xu, Lei Shi, Jianhua Zhao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09468 2024-03-01 cs.RO cs.AI cs.LG 62%

Safe Reinforcement Learning in a Simulated Robotic Arm

Luka Kovač, Igor Farkaš

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 4 pages, 2 figures. Appeared in 2023 International Conference on Artificial Neural Networks (ICANN) proceedings. Published version copyrighted by Springer. This work was funded by the Horizon Europe Twinning project TERAIS, G.A. number 101079338 and in part by the national project APVV-21-0105. Link to the code: https://zenodo.org/doi/10.5281/zenodo.10694747

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07457 2024-03-01 cs.LG cs.AI 62%

When Demonstrations Meet Generative World Models: A Maximum Likelihood Framework for Offline Inverse Reinforcement Learning

Siliang Zeng, Chenliang Li, Alfredo Garcia, Mingyi Hong

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16979 2024-02-28 cs.CY cs.LG cs.SI 62%

Algorithmic Arbitrariness in Content Moderation

Juan Felipe Gomez, Caio Vieira Machado, Lucas Monteiro Paes, Flavio P. Calmon

专题命中 安全训练 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16869 2024-02-28 cs.CY cs.AI 62%

Considering Fundamental Rights in the European Standardisation of Artificial Intelligence: Nonsense or Strategic Alliance?

Marion Ho-Dac

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13926 2024-02-22 cs.CL cs.AI 62%

Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content

Federico Bianchi, James Zou

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13338 2024-02-22 cs.LG cs.AI cs.MA 62%

Multi-Agent Car Parking using Reinforcement Learning

Omar Tanner

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Journal ref Book of Abstracts, ICUR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05149 2024-02-09 cs.LG cs.AI 62%

FlowPG: Action-constrained Policy Gradient with Normalizing Flows

Janaka Chathuranga Brahmanage, Jiajing Ling, Akshat Kumar

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Journal ref Thirty-seventh Conference on Neural Information Processing Systems. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17633 2024-02-01 cs.CL cs.AI 62%

Navigating the OverKill in Large Language Models

Chenyu Shi, Xiao Wang, Qiming Ge, Songyang Gao, Xianjun Yang, Tao Gui, Qi Zhang, Xuanjing Huang, Xun Zhao, Dahua Lin

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏