arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2602.06375 2026-02-09 cs.AI 57%

Difficulty-Estimated Policy Optimization

难度估计策略优化

Yu Zhao, Fan Jiang, Tianle Liu, Bo Zeng, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 DEPO通过动态难度估计器优化推理对齐的效率和鲁棒性,减少回放成本并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07210 2026-02-09 cs.RO cs.AI 57%

HyPlan: Hybrid Learning-Assisted Planning Under Uncertainty for Safe Autonomous Driving

HyPlan:在不确定环境下通过混合学习辅助规划实现安全自动驾驶

Donald Pfaffmann, Matthias Klusch, Marcel Steinmetz

机构 * Saarland University, Computer Science Dept.(萨尔兰大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) French National Centre for Scientific Research (CNRS)(法国国家科学研究中心)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 HyPlan通过结合多智能体行为预测、深度强化学习和POMDP规划,实现安全且高效的自动驾驶导航

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04972 2026-02-06 cs.CY 57%

Learning Context Matters: Measuring and Diagnosing Personalization Gaps in LLM-Based Instructional Design

学习上下文很重要:在基于LLM的教学设计中测量和诊断个性化差距

Johaun Hatchett, Debshila Basu Mallick, Brittany C. Bradford, Richard G. Baraniuk

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 本文提出了一种框架,用于测量和诊断学习上下文对基于LLM教学系统的影响,发现提供学习上下文能改善LLM的教学策略,但尚未实现可靠的个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13060 2026-02-05 cs.LG cs.GT math.OC stat.ML 57%

Achieving Logarithmic Regret in KL-Regularized Zero-Sum Markov Games

在KL正则化零和马尔可夫博弈中实现对数遗憾

Anupam Nayak, Tong Yang, Osman Yagan, Gauri Joshi, Yuejie Chi

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出OMG和SOMG算法,在KL正则化下实现对数遗憾,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00755 2026-02-04 cs.MA cs.AI cs.NE 57%

Evolving Interpretable Constitutions for Multi-Agent Coordination

为多智能体协调演化可解释的宪法

Ujwal Kumar, Alice Saito, Hershraj Niranjani, Rayan Yessou, Phan Xuan Tan

机构 * College of Engineering Shibaura Institute of Technology(Shibaura Institute of Technology 工程学院) Faculty of Arts and Sciences The University of Tokyo(东京大学 文理学部) Department of EECS University of California, Berkeley(加州大学伯克利分校 电子工程与计算机科学系) Department of Informatics Università degli Studi di Milano-Bicocca(米兰-比科卡大学 信息学系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过进化算法自动发现多智能体协调的可解释宪法,通过实验展示进化宪法在提升社会稳定性方面的有效性。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02970 2026-02-04 cs.LG 57%

Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL

Co2PO:多智能体强化学习中的协调约束策略优化

Shrenik Patel, Christine Truong

机构 * Rutgers University, New Brunswick, NJ(罗杰斯大学,新不伦瑞克,新泽西) Carnegie Mellon University, Pittsburgh, PA(卡内基梅隆大学,匹兹堡,宾夕法尼亚)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 Co2PO通过引入共享黑板架构和风险预测机制,实现多智能体强化学习中的协调安全优化,提升探索效率并减少保守性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02132 2026-02-03 cs.CL 57%

There Is More to Refusal in Large Language Models than a Single Direction

大型语言模型中拒绝行为远不止单一方向

Faaiz Joad, Majd Hawasly, Sabri Boughorbel, Nadir Durrani, Husrev Taha Sencar

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) HBKU(哈比卜大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究揭示大型语言模型中拒绝行为由多种几何方向控制,不同方向影响拒绝方式而非是否拒绝

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00950 2026-02-03 cs.AI 57%

MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support

MindGuard: 多轮心理健康支持中的防护分类器

António Farinhas, Nuno M. Guerreiro, José Pombal, Pedro Henrique Martins, Laura Melton, Alex Conway, Cara Dochat, Maya D'Eon, Ricardo Rei

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 MindGuard通过临床验证的危险分类法,提升多轮心理健康对话中的安全性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC 57%

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00399 2026-02-03 stat.ML cs.LG 57%

Reinforcement Learning for Control Systems with Time Delays: A Comprehensive Survey

具有时间延迟的控制系统强化学习:全面综述

Armando Alves Neto

机构 * Department of Electronics Eng. (DELT), UFMG(电子工程系(DELT),联邦大学米纳斯吉拉斯州分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文综述了针对控制系统中时间延迟的强化学习方法,分析了不同方法的优缺点,并提出了未来研究方向。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22801 2026-02-02 cs.LG 57%

Clipping-Free Policy Optimization for Large Language Models

无需裁剪的策略优化用于大语言模型

Ömer Veysel Çağatan, Barış Akgün, Gözde Gül Şahin, Xuandong Zhao

机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) Koç University, Istanbul, Türkiye(Koç大学) University of California, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。

Comments 23 pages, 10 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02662 2026-02-02 cs.LG 57%

Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning

通过在线强化学习将大语言模型接地于交互环境

Thomas Carta, Clément Romac, Thomas Wolf, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Inria (Flowers)(Inria(Flowers)) University of Bordeaux(波尔多大学) Hugging Face Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) Sorbonne Université(索邦大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。

Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a

Journal ref PMLR 202 (2023):3676-3713

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18790 2026-01-27 cs.CL 57%

MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts

MortalMATH: 评估推理目标与紧急情境之间的冲突

Etienne Lanzeray, Stephane Meilliez, Malo Ruelle, Damien Sileo

机构 * Univ. Lille(里尔大学) Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 MortalMATH研究了推理模型在紧急情境下的表现差异,发现通用模型能拒绝危险任务,而专门模型则忽视危险,导致安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18619 2026-01-27 cs.AI 57%

Visual Attention Reasoning via Hierarchical Search and Self-Verification

通过分层搜索与自验证的视觉注意力推理

Wei Cai, Jian Zhao, Yuchen Yuan, Tianle Zhang, Ming Zhu, Haichuan Tang, Xuelong Li

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出通过分层搜索与自验证的视觉注意力推理框架,有效提升多模态大语言模型的视觉定位和推理能力,显著降低幻觉发生率。

Comments The paper is withdrawn by the authors after discovering a flaw in the theoretical derivation presented in the Method section. This incorrect step leads to conclusions that are not supported by the corrected derivation. The authors plan to reconstruct the argument and will release an updated version once the issue is fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16891 2026-01-27 cs.AI 57%

LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation

LLMs作为布局设计师:增强的空间推理用于内容感知布局生成

Sha Li, Stefano Petrangeli, Yu Shen, Xiang Chen, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 LaySPA通过强化学习框架增强LLM的空间推理能力,实现内容感知布局生成,优于通用LLM和专用布局模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16547 2026-01-26 cs.SD cs.AI eess.AS 57%

CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation

CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距

Jing Hu, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Haitao Zheng, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14228 2026-01-21 cs.LG 57%

Attention-Based Offline Reinforcement Learning and Clustering for Interpretable Sepsis Treatment

基于注意力机制的离线强化学习与聚类用于可解释的脓毒症治疗

Punit Kumar, Vaibhav Saran, Divyesh Patel, Nitin Kulkarni, Alina Vereshchaka

机构 * Department of Computer Science(计算机科学系) Engineering University at Buffalo Buffalo, New York, USA(布法罗大学工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出基于注意力机制的离线强化学习与聚类方法,用于可解释的脓毒症治疗决策支持,通过多模块整合提升治疗准确性和可解释性。

Comments 8 pages, 6 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12822 2026-01-21 cs.AI 57%

MirrorGuard: Toward Secure Computer-Use Agents via Simulation-to-Real Reasoning Correction

MirrorGuard:通过模拟到现实推理校正实现安全的计算机使用代理

Wenqi Zhang, Yulin Shen, Changyue Jiang, Jiarun Dai, Geng Hong, Xudong Pan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 MirrorGuard通过模拟到现实推理校正提升计算机使用代理的安全性,有效降低系统风险并保持代理实用性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12126 2026-01-21 cs.AI 57%

UniMo: Unified Motion Generation and Understanding with Chain of Thought

UniMo: 基于推理链的统一运动生成与理解

Guocun Wang, Kenkun Liu, Jing Lin, Guorui Song, Jian Li, Xiaoguang Han

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 UniMo通过整合运动-语言信息和可解释的推理链,提升3D人体运动生成与理解的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12008 2026-01-21 cs.LG 57%

Extreme Value Policy Optimization for Safe Reinforcement Learning

极值政策优化用于安全强化学习

Shiqing Gao, Yihang Zhou, Shuai Shao, Haoyu Luo, Yiheng Bing, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出极值政策优化算法,通过极值理论建模和极值优先机制,有效减少约束违反并提升安全强化学习性能。

Comments Published in the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11199 2026-01-19 cs.CR cs.AI 57%

SD-RAG: A Prompt-Injection-Resilient Framework for Selective Disclosure in Retrieval-Augmented Generation

SD-RAG:一种抗提示注入的框架,用于检索增强生成中的选择性披露

Aiman Al Masoud, Marco Arazzi, Antonino Nocera

机构 * Department of Electrical, Computer and Biomedical Engineering(电气、计算机与生物医学工程系) University of Pavia(帕维亚大学)

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 SD-RAG通过在检索阶段应用净化和披露控制,提升检索增强生成中的隐私保护和抗提示注入能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10911 2026-01-19 cs.LG 57%

Realistic Curriculum Reinforcement Learning for Autonomous and Sustainable Marine Vessel Navigation

现实课程强化学习用于自主可持续海洋船舶导航

Zhang Xiaocai, Xiao Zhe, Liang Maohan, Liu Tao, Li Haijiang, Zhang Wenbin

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出基于现实课程强化学习的框架,结合数据驱动的海洋模拟和机器学习预测模块,以实现自主且可持续的船舶导航。

Comments Present in The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10835 2026-01-19 cs.CV cs.AI 57%

Can Vision-Language Models Understand Construction Workers? An Exploratory Study

视觉-语言模型能理解建筑工人吗?一项探索性研究

Hieu Bui, Nathaniel E. Chodosh, Arash Tavakoli

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Villanova University(维拉诺瓦大学) Department of Computing Sciences(计算科学系) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究评估了三种视觉-语言模型在识别建筑工人行为和情绪方面的性能,发现GPT-4o表现最佳,但需进一步改进以提高实际应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09048 2026-01-19 q-bio.OT cs.AI 57%

Monitoring Deployed AI Systems in Health Care

在医疗领域监控已部署的AI系统

Timothy Keyes, Alison Callahan, Abby S. Pandya, Nerissa Ambers, Juan M. Banda, Miguel Fuentes, Carlene Lugtu, Pranav Masariya, Srikar Nallan, Connor O'Brien, Thomas Wang, Emily Alsentzer, Jonathan H. Chen, Dev Dash, Matthew A. Eisenberg, Patricia Garcia, Nikesh Kotecha, Anurang Revri, Michael A. Pfeffer, Nigam H. Shah, Sneha S. Jain

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种用于医疗领域已部署AI系统监控的框架,围绕系统完整性、性能和影响三个原则,提供监控计划的指导和实施挑战分析。

Comments 36 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05467 2026-01-16 cs.SE cs.AI 57%

STELP: Secure Transpilation and Execution of LLM-Generated Programs

STELP: 保障LLM生成程序的编译与执行

Swapnil Shinde, Sahil Wadhwa, Andy Luo, Akshay Gupta, Mohammad Shahed Sorower

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 STELP通过安全编译和执行LLM生成的代码,解决生产环境中的安全性和可靠性问题,提升代码执行的安全性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09353 2026-01-15 cs.AI 57%

Monte-Carlo Tree Search with Neural Network Guidance for Lane-Free Autonomous Driving

基于神经网络引导的蒙特卡罗树搜索用于无车道自动驾驶

Ioannis Peridis, Dimitrios Troullinos, Georgios Chalkiadakis, Pantelis Giankoulidis, Ioannis Papamichail, Markos Papageorgiou

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于神经网络引导的蒙特卡罗树搜索方法,用于无车道环境下的自动驾驶,旨在提高交通流率并优化安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06135 2026-01-15 cs.CL cs.CV 57%

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

Prompting4Debugging: 通过寻找问题性提示对文本到图像扩散模型进行红队测试

Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Hsinchu, Taiwan(国家阳明交通大学计算机科学系) IBM Research, NY 10598, USA(IBM研究院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 Prompting4Debugging通过寻找问题性提示揭示文本到图像扩散模型的安全漏洞,表明现有安全机制存在重大缺陷。

Comments ICML 2024 main conference paper. The source code is available at https://github.com/zhiyichin/P4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08668 2026-01-14 cs.CL 57%

Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification

分析大型语言模型在仇恨言论净化中的虚假拒绝行为偏见

Kyuri Im, Shuzhou Yuan, Michael Färber

机构 * TU Dresden(德累斯顿理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究分析了大型语言模型在仇恨言论净化中的虚假拒绝偏见,并提出通过中英互译策略减少此类拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08327 2026-01-14 cs.RO cs.AI 57%

Safe Heterogeneous Multi-Agent RL with Communication Regularization for Coordinated Target Acquisition

安全的异构多智能体强化学习与通信正则化用于协同目标获取

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology, Luleå, Sweden.(计算机科学与空间工程系,卢勒奥技术大学,卢勒奥,瑞典)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种安全的异构多智能体强化学习框架,通过通信正则化和安全过滤器实现协同目标获取任务中的安全与稳定执行。

Comments 7 pages, 4 figures, submitted to the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07972 2026-01-14 cs.CL 57%

Knowing But Not Doing: Convergent Morality and Divergent Action in LLMs

知晓而不做:在大语言模型中收敛的道德与发散的行为

Jen-tse Huang, Jiantong Qin, Xueli Qiu, Sharon Levy, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) Rutgers University(罗格斯大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型在价值对齐训练下仍存在知识与行为之间的不一致,通过ValAct-15k数据集发现模型在情境决策上高度一致,但自我报告与实际行为关联较弱。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏