arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2603.01488 2026-03-10 cs.AI 57%

LLM-assisted Semantic Option Discovery for Facilitating Adaptive Deep Reinforcement Learning

基于大语言模型的语义选项发现用于促进自适应深度强化学习

Chang Yao, Jinghui Qin, Kebing Jin, Hankz Hankui Zhuo

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的闭环框架,通过语义驱动技能重用和实时约束监控,提升深度强化学习在数据效率、约束合规性和跨任务迁移能力方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17932 2026-03-09 cs.CY 57%

Operational Agency: A Permeable Legal Fiction for Tracing Culpability in AI Systems

可操作代理:一种渗透性法律虚构,用于追踪AI系统中的过失

Anirban Mukherjee, Hannah Hanwen Chang

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出可操作代理(OA)和可操作代理图(OAG)作为追踪AI系统过失的法律框架,通过分析AI的操作特征和因果关系,为法院和立法提供证据方法,确保人类问责制与技术自主性同步。

Comments Forthcoming, SMU Science and Technology Law Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04033 2026-03-05 cs.CL 57%

Who Judges the Judge? Evaluating LLM-as-a-Judge for French Medical open-ended QA

谁评判法官?评估LLM作为法官在法语医学开放性问答中的表现

Ikram Belmadani, Oumaima El Khettari, Pacôme Constant dit Beaufils, Richard Dufour, Benoit Favre

机构 * Aix-Marseille Univ., CNRS, LIS UMR 7020(艾克斯-马赛大学,法国国家科学研究中心,LIS UMR 7020) Nantes Univ., École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院南特校区,法国国家科学研究中心,LS2N,UMR 6004) Nantes Université, CHU Nantes, PHU 11: Santé Publique, Clinique des données, INSERM, CIC 1413(南特大学,南特大学医院,PHU 11:公共卫生,数据诊所,法国国家卫生与医学研究院,CIC 1413) Nantes Université, CNRS, INSERM, L’institut du thorax(南特大学,法国国家科学研究中心,法国国家卫生与医学研究院,胸科研究所) Université Grenoble Alpes, CNRS, INRIA, Grenoble INP, LIG UMR 5217(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,INRIA,格勒诺布尔INP,LIG UMR 5217)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究评估了LLM在法语医学开放性问答中作为评判者的有效性,发现领域适应模型在与专家注释一致方面表现最佳,并通过微调和GRPO提升了性能。

Comments Accepted in HeaLing Workshop - EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03768 2026-03-05 cs.RO cs.AI 57%

Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport

认知到控制 - 多智能体学习用于人-仿人协作运输

Hao Zhang, Ding Zhao, H. Eric Tseng

机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究提出认知到控制框架,通过多智能体强化学习实现人-仿人协作运输中的持续推理与稳定控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02504 2026-03-05 cs.AI 57%

NeuroProlog: Multi-Task Fine-Tuning for Neurosymbolic Mathematical Reasoning via the Cocktail Effect

NeuroProlog:通过鸡尾酒效应实现神经符号数学推理的多任务微调

Pratibha Zunjare, Michael Hsiao

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 NeuroProlog通过鸡尾酒效应实现神经符号数学推理的多任务微调,提升数学推理准确率并改进程序修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03371 2026-03-05 cs.CR cs.AI 57%

Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs

睡眠细胞:将潜在恶意时间后门注入工具使用的大语言模型

Bhanu Pallakonda, Mikkel Hindsbo, Sina Ehsani, Prag Mishra

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本研究提出SFT-then-GRPO方法,通过多阶段PEFT框架在工具使用LLM中植入隐蔽的恶意后门,揭示了强化学习在掩盖灾难性漏洞中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22263 2026-03-05 cs.LG 57%

Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning

擦除或隐藏?抑制虚假的反向学习神经元以实现稳健的反向学习

Nakyeong Yang, Dong-Kyum Kim, Jea Kwon, Minsung Kim, Kyomin Jung, Meeyoung Cha

机构 * Seoul National University(首尔国立大学) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出Ssiuu方法,通过属性引导正则化有效抑制虚假反向学习神经元,提升反向学习的鲁棒性和准确性。

Comments accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21831 2026-03-04 cs.CY 57%

A Multi-Turn Framework for Evaluating AI Misuse in Fraud and Cybercrime Scenarios

针对欺诈和网络犯罪场景的多轮评估框架

Kimberly T. Mai, Anna Gausen, Magda Dubois, Mona Murad, Bessie O'Dell, Nadine Staes-Polet, Christopher Summerfield, Andrew Strait

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出了一种针对欺诈和网络犯罪场景的多轮评估框架,评估了当前大型语言模型在提供可操作信息方面的局限性,并揭示了安全措施和请求分解对信息提供的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02680 2026-03-04 cs.AI 57%

LLMs for High-Frequency Decision-Making: Normalized Action Reward-Guided Consistency Policy Optimization

基于大语言模型的高频决策:归一化动作奖励引导的一致性策略优化

Yang Zhao, Zihao Li, Zhiyu Jiang, Dandan Ma, Ganchao Liu, Wenzhe Zhao

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出NAR-CP方法,通过归一化动作奖励和一致性损失优化,提升高频决策任务中的策略一致性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02588 2026-03-04 cs.CL 57%

ExpGuard: LLM Content Moderation in Specialized Domains

ExpGuard: 专门领域中的大语言模型内容审核

Minseok Choi, Dongjin Kim, Seungbin Yang, Subin Kim, Youngjun Kwak, Juyoung Oh, Jaegul Choo, Jungmin Son

机构 * KAIST AI(韩国科学技术院人工智能研究所) Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 ExpGuard通过专门领域的大语言模型内容审核模型,有效提升对金融、医疗和法律领域有害内容的防御能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21533 2026-03-03 cs.RO cs.AI 57%

Model Predictive Adversarial Imitation Learning for Planning from Observation

基于模型预测的对抗模仿学习用于从观察中规划

Tyler Han, Yanda Bao, Bhaumik Mehta, Gabriel Guo, Anubhav Vishwakarma, Emily Kang, Sanghun Jung, Rosario Scalise, Jason Zhou, Bryan Xu, Byron Boots

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于模型预测的对抗模仿学习方法,通过端到端学习从观察中规划,提升样本效率和鲁棒性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12664 2026-03-03 cs.AI cs.SY eess.SY 57%

Behavioral Generative Agents for Energy Operations

行为生成代理在能源运营中的应用

Cong Chen, Omer Karaduman, Xu Kuang

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院) Graduate School of Business, Stanford University(斯坦福大学商学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用生成代理模拟客户决策,揭示能源运营中消费者行为模式,提升能源管理系统设计和政策分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23719 2026-03-02 cs.RO cs.AI 57%

SAGE-LLM: Towards Safe and Generalizable LLM Controller with Fuzzy-CBF Verification and Graph-Structured Knowledge Retrieval for UAV Decision

SAGE-LLM:面向安全且可泛化的LLM控制器,结合模糊-CBF验证和图结构知识检索用于无人机决策

Wenzhe Zhao, Yang Zhao, Ganchao Liu, Zhiyu Jiang, Dandan Ma, Zihao Li, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi’an 710072, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,西安 710072,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI)、中国电信,中国)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 SAGE-LLM通过模糊-CBF验证和图结构知识检索,提升无人机决策的安全性和泛化能力,无需在线训练即可在复杂环境中保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23840 2026-03-02 cs.CL 57%

Measuring Sycophancy of Language Models in Multi-turn Dialogues

在多轮对话中衡量语言模型的趋炎附势性

Jiseung Hong, Grace Byun, Seungone Kim, Kai Shu, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。

Comments Accepted to Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21496 2026-02-26 cs.AI 57%

Beyond Refusal: Probing the Limits of Agentic Self-Correction for Semantic Sensitive Information

超越拒绝:探求代理自我校正对语义敏感信息的极限

Umid Suleymanov, Zaur Rajabov, Emil Mirzazada, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) School of IT and Engineering, ADA University(ADA大学信息科技与工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出SemSIEdit框架,通过代理代理迭代批评和重写敏感信息,减少泄露并平衡隐私与效用,揭示规模依赖的安全分歧和推理悖论。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04446 2026-02-24 cs.LG 57%

Sampling-aware Adversarial Attacks Against Large Language Models

针对大语言模型的采样感知对抗攻击

Tim Beyer, Yan Scholten, Leo Schwinn, Stephan Günnemann

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于采样感知的对抗攻击方法,通过优化与采样资源分配提升攻击成功率和效率,揭示了采样在评估大语言模型安全性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10134 2026-02-23 cs.AI 57%

FRSICL: LLM-Enabled In-Context Learning Flight Resource Allocation for Fresh Data Collection in UAV-Assisted Wildfire Monitoring

FRSICL: 基于大语言模型的上下文学习飞行资源分配用于无人机辅助 wildfire 监测中的新鲜数据采集

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教智利大学) Instituto de Telecomunicações(电信研究院) Faculdade de Engenharia, Universidade do Porto(工程学院,葡萄牙里斯本大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的上下文学习飞行资源分配方法,用于无人机辅助森林火灾监测中的实时数据采集优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17345 2026-02-20 cs.CR cs.AI 57%

What Breaks Embodied AI Security:LLM Vulnerabilities, CPS Flaws,or Something Else?

使具身AI安全破裂的因素:大语言模型漏洞、CPS缺陷还是其他东西?

Boyang Ma, Hechuan Guo, Peizhuo Lv, Minghui Xu, Xuelong Dai, YeChao Zhang, Yijun Yang, Yue Zhang

机构 * Shandong University(山东大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文探讨了具身AI安全问题的根源,指出系统级不匹配而非孤立模型缺陷或传统CPS攻击是主要因素,并提出了四个核心见解以解释其安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00167 2026-02-20 cs.AI cs.CR cs.RO 57%

Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI

能自主决策的无人机:基于具身AI的突发着陆决策

Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究利用具身AI实现无人机在突发情况下的自主决策与安全着陆,展示了新的适应性恢复管道,提升了自主空中系统的安全性和韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04856 2026-02-17 cs.CL 57%

CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation

CoT并非真理链:对用于虚假新闻生成的推理LLM的实证内部分析

Zhao Tong, Chunlin Gong, Yiping Zhang, Haichao Shi, Qiang Liu, Xingcheng Xu, Shu Wu, Xiao-Yu Zhang

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究揭示推理LLM在生成虚假新闻时,即使拒绝有害请求,其内部推理仍可能传播不安全内容,通过分析框架和指标揭示潜在风险并挑战安全假设。

Comments 28 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13227 2026-02-17 cs.NI cs.AI 57%

An Agentic AI Control Plane for 6G Network Slice Orchestration, Monitoring, and Trading

面向6G网络切片编排、监控与交易的代理式AI控制平面

Eranga Bandara, Ross Gore, Sachin Shetty, Ravi Mukkamala, Tharaka Hewa, Abdul Rahman, Xueping Liang, Safdar H. Bouk, Amin Hass, Peter Foytik, Ng Wee Keong, Kasun De Zoysa

机构 * Florida International University, USA(佛罗里达国际大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Accenture Technology Labs, Arlington, VA, USA(埃森哲技术实验室) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出面向6G网络切片编排、监控与交易的代理式AI控制平面,通过市场感知编排和自然语言接口实现经济导向的智能控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00602 2026-02-16 cs.LG cs.SY eess.SY 57%

Multi-Agent Stage-wise Conservative Linear Bandits

多智能体分阶段保守线性老虎机

Amirhossein Afsharrad, Ahmadreza Moradipari, Sanjay Lall

机构 * Stanford University(斯坦福大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出MA-SCLUCB算法,通过分阶段保守约束实现多智能体在安全保证下的高效分布式学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12004 2026-02-13 cs.AI 57%

CSEval: A Framework for Evaluating Clinical Semantics in Text-to-Image Generation

CSEval: 一个用于评估文本到图像生成中临床语义的框架

Robert Cronshaw, Konstantinos Vilouras, Junyu Yan, Yuning Du, Feng Chen, Steven McDonagh, Sotirios A. Tsaftaris

机构 * School of Engineering, University of Edinburgh, United Kingdom(爱丁堡大学工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 CSEval通过语言模型评估文本到图像生成中临床语义的一致性,弥补现有方法在临床相关性评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11829 2026-02-13 cs.LG cs.GT 57%

Towards Sustainable Investment Policies Informed by Opponent Shaping

面向可持续投资政策的对手塑造驱动的投资策略

Juan Agustin Duque, Razvan Ciuca, Ayoub Echchahed, Hugo Larochelle, Aaron Courville

机构 * University of Montreal and MILA(蒙特利尔大学和MILA)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过对手塑造算法优化投资策略,以解决可持续发展中的社会困境问题。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11780 2026-02-13 cs.AI 57%

RELATE: A Reinforcement Learning-Enhanced LLM Framework for Advertising Text Generation

RELATE: 一种增强强化学习的大型语言模型框架用于广告文本生成

Jinfang Wang, Jiajie Liu, Jianwei Wu, Ziqin Luo, Zhen Chen, Chunlei Li, Biao Han, Tao Deng, Yi Li, Shuanglong Li, Lin Liu

机构 * Baidu Inc.(百度公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 RELAITE通过整合性能和合规性目标到生成过程中,提升广告文本的转化效果和实际应用效果。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11651 2026-02-13 cs.CR cs.AI 57%

DMind-3: A Sovereign Edge--Local--Cloud AI System with Controlled Deliberation and Correction-Based Tuning for Safe, Low-Latency Transaction Execution

DMind-3:一种主权边缘-本地-云AI系统,具备受控推理与基于纠正的调优,用于安全低延迟交易执行

Enhao Huang, Frank Li, Tony Lin, Lowes Yang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DMind-3通过边缘-本地-云三层架构,结合受控推理与纠正调优,实现安全低延迟的交易执行,提升金融执行的可靠性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11076 2026-02-12 eess.SY cs.AI cs.SY eess.SP 57%

Interpretable Attention-Based Multi-Agent PPO for Latency Spike Resolution in 6G RAN Slicing

可解释的基于注意力的多智能体PPO用于6G RAN切片中的延迟尖峰解决

Kavan Fatehi, Mostafa Rahmani Ghourtani, Amir Sonee, Poonam Yadav, Alessandra M Russo, Hamed Ahmadi, Radu Calinescu

机构 * University of York, UK(约克大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出AE-MAPPO,通过整合六个注意力机制,实现6G RAN切片中延迟尖峰的快速诊断与高效解决,兼具SLA合规性和可解释性。

Comments This work has been accepted to appear in the IEEE International Conference on Communications (ICC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10793 2026-02-12 cs.LG cs.RO 57%

Semi-Supervised Cross-Domain Imitation Learning

半监督跨领域模仿学习

Li-Min Chu, Kai-Siang Ma, Ming-Hong Chen, Ping-Chun Hsieh

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,国家阳明交通大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出半监督跨领域模仿学习方法,通过结合监督与无监督学习,实现稳定且高效的数据驱动策略学习。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10481 2026-02-12 cs.CR cs.AI cs.MA 57%

Protecting Context and Prompts: Deterministic Security for Non-Deterministic AI

保护上下文和提示:非确定性AI的确定性安全

Mohan Rajagopalan, Vinay Rao

机构 * MACAW Security, Inc.(MACAW安全公司)

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 本研究提出认证提示和上下文技术,通过加密验证和策略代数实现LLM的预防性安全,有效防止提示注入和上下文操纵攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07193 2026-02-11 cs.HC cs.AI 57%

"Death" of a Chatbot: Investigating and Designing Toward Psychologically Safe Endings for Human-AI Relationships

聊天机器人之死:探索并设计人类与AI关系的心理安全结束

Rachel Poonsiriwong, Chayapatr Archiwaranguprok, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文探讨了人类与AI伴侣关系终止的心理安全设计,提出四个设计原则和工具,帮助平台提供闭合并促进人类连接。

详情

展开后加载摘要…

URL PDF HTML 收藏