arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2509.15799 2025-10-10 eess.SY cs.AI cs.RO cs.SY math.OC 57%

Hierarchical Reinforcement Learning with Low-Level MPC for Multi-Agent Control

Max Studt, Georg Schildbach

机构 * Max Studt 1 Georg Schildbach 1

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07642 2025-10-10 cs.CL 57%

Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models

Đorđe Klisura, Joseph Khoury, Ashish Kundu, Ram Krishnan, Anthony Rios

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Louisiana State University(路易斯安那州立大学) Cisco Research(思科研究)

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments 8 pages + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06756 2025-10-09 cs.AI 57%

Verifying Memoryless Sequential Decision-making of Large Language Models

Dennis Gross, Helge Spieker, Arnaud Gotlieb

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05169 2025-10-08 cs.CR cs.AI 57%

From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs

Guangyu Shen, Siyuan Cheng, Xiangzhe Xu, Yuan Zhou, Hanxi Guo, Zhuo Zhang, Xiangyu Zhang

机构 * Purdue University(普渡大学) Columbia University(哥伦比亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03527 2025-10-07 cs.CL 57%

Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs

Sayan Ghosh, Shahzaib Saqib Warraich, Dhruv Tarsadiya, Gregory Yauney, Swabha Swayamdipta

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02627 2025-10-06 cs.RO cs.AI 57%

A Trajectory Generator for High-Density Traffic and Diverse Agent-Interaction Scenarios

Ruining Yang, Yi Xu, Yixiao Chen, Yun Fu, Lili Su

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02403 2025-10-06 q-bio.QM cs.AI cs.CV 57%

Glaucoma Detection and Structured OCT Report Generation via a Fine-tuned Multimodal Large Language Model

Jalil Jalili, Yashraj Gavhane, Evan Walker, Anna Heinke, Christopher Bowd, Akram Belghith, Massimo A. Fazio, Christopher A. Girkin, C. Gustavo De Moraes, Jeffrey M. Liebmann, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01995 2025-10-03 cs.CL 57%

LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target

Md Arid Hasan, Firoj Alam, Md Fahad Hossain, Usman Naseem, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Qatar Computing Research Institute(卡塔尔计算研究院) Daffodil International University(达芙妮国际大学) Macquarie University(麦考瑞大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25767 2025-10-01 cs.AI 57%

Galton's Law of Mediocrity: Why Large Language Models Regress to the Mean and Fail at Creativity in Advertising

Matt Keon, Aabid Karim, Bhoomika Lohana, Abdul Karim, Thai Nguyen, Tara Hamilton, Ali Abbas

机构 * mv Research Lab(55mv研究实验室) Monash University(莫纳什大学) School of Engineering, Western Sydney University(西澳大学工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08753 2025-09-30 cs.CL 57%

Streaming Sequence-to-Sequence Learning with Delayed Streams Modeling

Neil Zeghidour, Eugene Kharitonov, Manu Orsini, Václav Volhejn, Gabriel de Marmiesse, Edouard Grave, Patrick Pérez, Laurent Mazaré, Alexandre Défossez

机构 * Kyutai

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20563 2025-09-30 cs.AI 57%

Taking control: Policies to address extinction risks from advanced AI

Andrea Miotti

机构 * Control AI & Conjecture(Control AI与Conjecture)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19301 2025-09-29 cs.RO cs.LG 57%

Residual Off-Policy RL for Finetuning Behavior Cloning Policies

Lars Ankile, Zhenyu Jiang, Rocky Duan, Guanya Shi, Pieter Abbeel, Anusha Nagabandi

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Project website: https://residual-offpolicy-rl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07848 2025-09-26 cs.AI 57%

Safe Explicable Policy Search

Akkamahadevi Hanni, Jonathan Montaño, Yu Zhang

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) School of Mathematical and Statistical Sciences, Arizona State University(数学与统计科学学院,亚利桑那州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06123 2025-09-26 cs.LG cs.RO 57%

Security of Deep Reinforcement Learning for Autonomous Driving: A Survey

Ambra Demontis, Srishti Gupta, Maura Pintor, Luca Demetrio, Kathrin Grosse, Hsiao-Ying Lin, Chengfang Fang, Battista Biggio, Fabio Roli

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15389 2025-09-24 cs.CL cs.CR cs.CV 57%

Are Vision-Language Models Safe in the Wild? A Meme-Based Benchmark Study

DongGeon Lee, Joonwon Jang, Jihae Jeong, Hwanjo Yu

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18681 2025-09-24 cs.AI 57%

Implementation of airborne ML models with semantics preservation

Nicolas Valot, Louis Fabre, Benjamin Lesage, Ammar Mechouche, Claire Pagetti

专题命中 安全训练 :safety(abstract);分类 cs.AI

Journal ref 44th Digital Avionics Systems Conference (DASC), Sep 2025, Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16490 2025-09-23 cs.LG 57%

Revisiting Broken Windows Theory

Ziyao Cui, Erick Jiang, Nicholas Sortisio, Haiyan Wang, Eric Chen, Cynthia Rudin

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17448 2025-09-23 cs.LG 57%

Rectified Robust Policy Optimization for Model-Uncertain Constrained Reinforcement Learning without Strong Duality

Shaocong Ma, Ziyi Chen, Yi Zhou, Heng Huang

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16088 2025-09-22 cs.LG 57%

Randomized Smoothing Meets Vision-Language Models

Emmanouil Seferis, Changshun Wu, Stefanos Kollias, Saddek Bensalem, Chih-Hong Cheng

机构 * National Technical University of Athens(希腊雅典国家技术大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CSX-AI(CSX-AI公司) Carl von Ossietzky University of Oldenburg(奥尔登堡卡尔·冯·奥西特齐大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 安全训练 :jailbreak(abstract);分类 cs.LG

Comments EMNLP'25 full version, including appendix (proofs, additional experiments)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15776 2025-09-16 cs.CL cs.IR 57%

ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning

Changtai Zhu, Siyin Wang, Ruijun Feng, Kai Song, Xipeng Qiu

机构 * Fudan University(复旦大学) ByteDance Inc(字节跳动公司) University of New South Wales(新南威尔士大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 at the Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10478 2025-09-16 cs.NI cs.LG cs.SY eess.SY 57%

The LLM as a Network Operator: A Vision for Generative AI in the 6G Radio Access Network

Oluwaseyi Giwa, Michael Adewole, Tobi Awodumila, Pelumi Aderinto

机构 * African Institute for Mathematical Sciences(非洲数学科学研究所)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Submitted to Workshop on AI and ML for Next-Generation Wireless Communications and Networking, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09852 2025-09-15 cs.CL 57%

Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization

Chuyuan Li, Austin Xu, Shafiq Joty, Giuseppe Carenini

机构 * Department of Computer Science, University of British Columbia(英属哥伦比亚大学计算机科学系) Salesforce AI Research(Salesforce人工智能研究)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17813 2025-09-12 cs.RO cs.LG 57%

Safe Multi-Agent Navigation guided by Goal-Conditioned Safe Reinforcement Learning

Meng Feng, Viraj Parimi, Brian Williams

机构 * Computer Science and Artificial Intelligence Laboratory, Massachusetts Institute of Technology(计算机科学与人工智能实验室,麻省理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract here is shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07845 2025-09-10 cs.LG 57%

Predicting person-level injury severity using crash narratives: A balanced approach with roadway classification and natural language process techniques

Mohammad Zana Majidi, Sajjad Karimi, Teng Wang, Robert Kluger, Reginald Souleyrette

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04478 2025-09-08 cs.CL 57%

An End-to-End System for Culturally-Attuned Driving Feedback using a Dual-Component NLG Engine

Iniakpokeikiye Peter Thompson, Yi Dewei, Reiter Ehud

机构 * Dept. of Computing Science University of Aberdeen(计算科学系阿伯丁大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments The paper has 5 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03768 2025-09-05 cs.AI stat.ML 57%

RAGuard: A Novel Approach for in-context Safe Retrieval Augmented Generation for LLMs

Connor Walker, Koorosh Aslansefat, Mohammad Naveed Akram, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学) AURA CDT(AURA联合培养计划)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03550 2025-09-05 cs.AI 57%

Diffusion-RL Based Air Traffic Conflict Detection and Resolution Method

Tonghe Li, Jixin Liu, Weili Zeng, Hao Jiang

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 59 pages,13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01379 2025-09-03 cs.CL 57%

WATCHED: A Web AI Agent Tool for Combating Hate Speech by Expanding Data

Paloma Piot, Diego Sánchez, Javier Parapar

机构 * IRLab, CITIC, Universidade da Coruña, Spain(IR实验室、CITIC、科鲁纳大学、西班牙)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15144 2025-09-03 cs.AI 57%

Mobile-Agent-v3: Fundamental Agents for GUI Automation

Jiabo Ye, Xi Zhang, Haiyang Xu, Haowei Liu, Junyang Wang, Zhaoqing Zhu, Ziwei Zheng, Feiyu Gao, Junjie Cao, Zhengxi Lu, Jitong Liao, Qi Zheng, Fei Huang, Jingren Zhou, Ming Yan

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02997 2025-08-29 cs.CL 57%

CoCoTen: Detecting Adversarial Inputs to Large Language Models through Latent Space Features of Contextual Co-occurrence Tensors

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 安全训练 :jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏