arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2510.17369 2025-10-21 cs.RO cs.AI cs.LG 62%

Bridging Embodiment Gaps: Deploying Vision-Language-Action Models on Soft Robots

Haochen Su, Cristian Meo, Francesco Stella, Andrea Peirone, Kai Junge, Josie Hughes

机构 * EPFL(苏黎世联邦理工学院) LatentWorlds AI TUDelft(代尔夫特理工大学) Embodied AI SA(具身人工智能股份有限公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS 2025 SpaVLE workshop. 4 pages, 2 figures(in main paper, excluding references and supplements)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15896 2025-10-21 cs.HC cs.AI cs.CY 62%

From Coordination to Personalization: A Trust-Aware Simulation Framework for Emergency Department Decision Support

Zoi Lygizou, Dimitris Kalles

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13093 2025-10-16 stat.ML cs.AI cs.LG 62%

A Multi-dimensional Semantic Surprise Framework Based on Low-Entropy Semantic Manifolds for Fine-Grained Out-of-Distribution Detection

Ningkang Peng, Yuzhe Mao, Yuhao Zhang, Linjin Qian, Qianfeng Yu, Yanhui Gu, Yi Chen, Li Kong

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.15907 2025-10-14 cs.AI cs.LG 62%

Learning to Be Cautious

Montaser Mohammedalamen, Dustin Morrill, Alexander Sieusahai, Yash Satsangi, Michael Bowling

机构 * University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Published at the Transactions on Machine Learning Research Journal (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08776 2025-10-13 cs.CL cs.AI 62%

Measuring Moral LLM Responses in Multilingual Capacities

Kimaya Basu, Savi Kolari, Allison Yu

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 5 figures; referenced articles: arXiv:2303.08774, arXiv:2303.12528, arXiv:2308.14132, arXiv:2505.12201, arXiv:2406.04428, arXiv:2407.02273, arXiv:2404.01268, arXiv:2502.09747, arXiv:2507.13474, arXiv:2505.21479, arXiv:2306.05685

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08648 2025-10-13 cs.LG cs.AI 62%

Inverse-Free Wilson Loops for Transformers: A Practical Diagnostic for Invariance and Order Sensitivity

Edward Y. Chang, Ethan Y. Chang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04503 2025-10-13 cs.CR cs.AI cs.CL 62%

P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs

Shuai Zhao, Xinyi Wu, Shiqian Zhao, Xiaobao Wu, Zhongliang Guo, Yanhao Jia, Anh Tuan Luu

机构 * Nanyang Technological University, Singapore(南洋理工大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03892 2025-10-07 cs.AI cs.CL 62%

Kantian-Utilitarian XAI: Meta-Explained

Zahra Atf, Peter R. Lewis

机构 * Faculty of Business and Information Technology(商业与信息技术学院) Ontario Tech University(安大略技术大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted for presentation as a poster at the 35th IEEE International Conference on Collaborative Advances in Software and Computing, 2025. Conference website:https://conf.researchr.org/details/cascon-2025/posters-track/1/Kantian-Utilitarian-XAI-Meta-Explained

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01259 2025-10-03 cs.CL cs.AI cs.CR 62%

In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b

Nils Durner

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 27 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15254 2025-10-03 cs.SE cs.CL cs.LG 62%

CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation

Anirudh Khatry, Robert Zhang, Jia Pan, Ziteng Wang, Qiaochu Chen, Greg Durrett, Isil Dillig

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

Comments To be published at COLM, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00274 2025-10-02 cs.AI cs.LG cs.MA 62%

MAGIC-MASK: Multi-Agent Guided Inter-Agent Collaboration with Mask-Based Explainability for Reinforcement Learning

Maisha Maliha, Dean Hougen

机构 * School of Computer Science University of Oklahoma(计算机科学学院俄克拉荷马大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15339 2025-09-30 cs.CL cs.LG 62%

LionGuard 2: Building Lightweight, Data-Efficient & Localised Multilingual Content Moderators

Leanne Tan, Gabriel Chua, Ziyu Ge, Roy Ka-Wei Lee

机构 * GovTech, Singapore(新加坡政府科技局) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15367 2025-09-30 cs.CV cs.AI cs.CL 62%

Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition

Dasol Choi, Seunghyun Lee, Youngsook Song

机构 * AIM Intelligence(AIM智能公司) Yonsei University(延世大学) Lablup Inc.(Lablup公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11020 2025-09-29 cs.CL cs.AI 62%

Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning

Bokai Hu, Sai Ashish Somayajula, Xin Pan, Pengtao Xie

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11044 2025-09-24 cs.LG cs.AI q-bio.BM 62%

FragmentGPT: A Unified GPT Model for Fragment Growing, Linking, and Merging in Molecular Design

Xuefeng Liu, Songhao Jiang, Qinan Huang, Tinson Xu, Ian Foster, Mengdi Wang, Hening Lin, Rick Stevens

机构 * Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学分子工程学院) Department of Chemistry, University of Chicago(芝加哥大学化学系) Argonne National Laboratory(阿贡国家实验室) AI Lab, Princeton University(普林斯顿大学人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15157 2025-09-22 cs.LG cs.CL 62%

Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning

Shiwan Zhao, Xuyang Zhao, Jiaming Zhou, Aobo Kong, Qicheng Li, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14129 2025-09-18 cs.LG cs.CY 62%

Breaking the Cycle of Incarceration With Targeted Mental Health Outreach: A Case Study in Machine Learning for Public Policy

Kit T. Rodolfa, Erika Salomon, Jin Yao, Steve Yoder, Robert Sullivan, Kevin McGuire, Allie Dickinson, Rob MacDougall, Brian Seidler, Christina Sung, Claire Herdeman, Rayid Ghani

机构 * Machine Learning Department(机器学习部门) Heinz College of Public Policy(公共政策学院) Carnegie Mellon University(卡内基梅隆大学) Center for Data Science and Public Policy(数据科学与公共政策中心) University of Chicago(芝加哥大学)

专题命中 安全训练 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11431 2025-09-16 cs.AI cs.CL 62%

Securing AI Agents: Implementing Role-Based Access Control for Industrial Applications

Aadil Gani Ganie

专题命中 安全训练 :prompt injection(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02465 2025-09-16 cs.CL cs.AI 62%

Revealing the Inherent Instructability of Pre-Trained Language Models

Seokhyun An, Minji Kim, Hyounghun Kim

机构 * Department of Computer Science and Engineering, UNIST(UNIST计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments Findings of EMNLP 2025 (32 pages). Code available at https://github.com/seokhyunan/response-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04535 2025-09-08 cs.RO cs.AI cs.LG 62%

In-Context Policy Adaptation via Cross-Domain Skill Diffusion

Minjong Yoo, Woo Kyung Kim, Honguk Woo

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 9 pages

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14701 2025-09-05 cs.CL cs.LG 62%

An Unsupervised Natural Language Processing Pipeline for Assessing Referral Appropriateness

Vittorio Torri, Annamaria Bottelli, Michele Ercolanoni, Olivia Leoni, Francesca Ieva

机构 * ARIA s.p.a - Azienda Regionale per l’Innovazione e gli Acquisti(区域创新与采购公司) Regione Lombardia(伦巴第大区) Human Technopole(人类技术极地)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

Comments 49 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00654 2025-09-03 cs.SD cs.AI cs.LG cs.MM eess.AS 62%

The Name-Free Gap: Policy-Aware Stylistic Control in Music Generation

Ashwin Nagarajan, Hao-Wen Dong

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Michigan(密歇根大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20040 2025-08-28 cs.AI cs.LG 62%

Model Science: getting serious about verification, explanation and control of AI systems

Przemyslaw Biecek, Wojciech Samek

机构 * Centre for Credible AI, Warsaw University of Technology, University of Warsaw(可信AI研究中心,华沙技术大学,华沙大学) Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute, Technical University of Berlin, Germany BIFOLD - Berlin Institute for the Foundations of Learning(人工智能系,弗劳恩霍夫 Heinrich Hertz 研究所,柏林技术大学,德国 BIFOLD - 柏林学习与数据基础研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 8 pages

Journal ref Frontiers in AI track at European Conference on Artificial Intelligence (ECAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18884 2025-08-27 cs.LG cs.AI 62%

HAEPO: History-Aggregated Exploratory Policy Optimization

Gaurish Trivedi, Alakh Sharma, Kartikey Singh Bhandari, Dhruv Kumar, Pratik Narang, Jagat Sesh Challa

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比兰)

专题命中 安全训练 :DPO(abstract);分类 cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18180 2025-08-27 cs.AI cs.LG 62%

Safe Reinforcement Learning in Black-Box Environments via Adaptive Shielding

Daniel Bethell, Simos Gerasimou, Radu Calinescu, Calum Imrie

机构 * University of York, UK(英国约克大学) Cyprus University of Technology, Cyprus(塞浦路斯技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments To be published in ECAI 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09600 2025-08-26 cs.MA cs.AI cs.CL cs.CR 62%

Effective Red-Teaming of Policy-Adherent Agents

Itay Nakash, George Kour, Koren Lazar, Matan Vetzler, Guy Uziel, Ateret Anaby-Tavor

专题命中 安全训练 :jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18397 2025-08-26 cs.MA cs.AI cs.ET cs.LG 62%

An Outlook on the Opportunities and Challenges of Multi-Agent AI Systems

Fangqiao Tian, An Luo, Jin Du, Xun Xian, Robert Specht, Ganghua Wang, Xuan Bi, Jiawei Zhou, Ashish Kundu, Jayanth Srinivasa, Charles Fleming, Rui Zhang, Zirui Liu, Mingyi Hong, Jie Ding

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Corrected references

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16133 2025-08-21 cs.CY cs.AI 62%

A Conceptual Framework for AI-based Decision Systems in Critical Infrastructures

Milad Leyli-abadi, Ricardo J. Bessa, Jan Viebahn, Daniel Boos, Clark Borst, Alberto Castagna, Ricardo Chavarriaga, Mohamed Hassouna, Bruno Lemetayer, Giulia Leto, Antoine Marot, Maroua Meddeb, Manuel Meyer, Viola Schiaffonati, Manuel Schneider, Toni Waefler

机构 * IRT SystemX(IRT系统X) INESC TEC TenneT SBB Delft University of Technology(代尔夫特理工大学) EnliteAI Zurich University of Applied Science(苏黎世应用科学大学) Réseau de Transport d’Electricité(电力传输网络) Flatland Association(Flatland协会) Politecnico di Milano(米兰理工大学) University of Applied Sciences Northwestern Switzerland(瑞士西北应用科学大学) Fraunhofer IEE(弗劳恩霍夫研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

Journal ref 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11504 2025-08-18 cs.LG cs.CY 62%

Predicting and Explaining Traffic Crash Severity Through Crash Feature Selection

Andrea Castellani, Zacharias Papadovasilakis, Giorgos Papoutsoglou, Mary Cole, Brian Bautsch, Tobias Rodemann, Ioannis Tsamardinos, Angela Harden

机构 * Honda Research Institute Europe(霍恩达欧洲研究机构) The Ohio State University(俄亥俄州立大学) Department of Computer Science, University of Crete(克里特大学计算机科学系) American Honda Motor Co., Inc.(美国本田摩托公司)

专题命中 安全训练 :safety(abstract);分类 cs.CY、cs.LG

Comments Preprint. Manuscript under review at "Accident Analysis & Prevention" journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17130 2025-08-12 cs.CL cs.CR cs.CY 62%

Steering the CensorShip: Uncovering Representation Vectors for LLM "Thought" Control

Hannah Cyberey, David Evans

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏