arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2501.16613 2026-02-25 cs.LG cs.AI 62%

Safe Reinforcement Learning for Real-World Engine Control

用于现实世界发动机控制的安全强化学习

Julian Bedei, Lucas Koch, Kevin Badalian, Alexander Winkler, Patrick Schaber, Jakob Andert

机构 * Teaching and Research Area Mechatronics in Mobile Propulsion(移动传动机械研究与教学领域) RWTH Aachen University(亚琛工业大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种安全强化学习方法,用于在高热效率和低排放的HCCI模式下实现发动机控制,通过实时安全监控和实验验证,有效解决了传统控制方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08104 2026-02-24 cs.AI cs.LG cs.MA 62%

Interpretable Failure Analysis in Multi-Agent Reinforcement Learning Systems

多智能体强化学习系统中的可解释性故障分析

Risal Shahriar Shefin, Debashis Gupta, Thai Le, Sarra Alqahtani

机构 * Wake Forest University(威克森林大学) Indiana University(印第安纳大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种两阶段梯度框架,用于多智能体强化学习系统中可解释的故障检测与归因分析,通过几何分析和敏感性分析提高故障诊断的透明度和准确性。

Comments Accepted to the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-02-24 cs.DB cs.AI cs.CL cs.SE 62%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12444 2026-02-18 cs.LG cs.AI 62%

Safe Reinforcement Learning via Recovery-based Shielding with Gaussian Process Dynamics Models

通过基于恢复的防护机制实现安全强化学习

Alexander W. Goodall, Francesco Belardinelli

机构 * Imperial College London, Department of Computing(伦敦帝国学院计算机系)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于高斯过程的恢复防护机制,用于在未知非线性系统中实现安全强化学习,通过动态恢复和内部模型采样实现安全与高效的学习。

Comments Accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14338 2026-02-17 cs.LG cs.AI 62%

Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning

少训练,多学习:基于群体的强化学习中的自适应高效回滚优化

Zhi Zhang, Zhen Han, Costas Mavromatis, Qi Zhu, Yunyi Zhang, Sheng Guan, Dingmin Wang, Xiong Zhou, Shuai Wang, Soji Adeshina, Vassilis Ioannidis, Huzefa Rangwala

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon Web Services(亚马逊网络服务)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 AERO通过自适应回滚策略和选择性拒绝提升群体强化学习的计算效率,减少48%的训练计算并缩短45%的训练时间,同时保持或提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12846 2026-02-16 cs.LG cs.AI 62%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 62%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11220 2026-02-13 cs.LG cs.CL 62%

Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT

修补分布不匹配:用于稳定离策略SFT的RL重写代理

Jiacheng Wang, Ping Jian, Zhen Yang, Zirong Chen, Keren Liao, Zhongbin Guo

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于强化学习的RL重写代理,通过优化分布对齐和多样性,提升下游SFT效果并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11159 2026-02-13 cs.AI cs.HC cs.LG 62%

Explaining AI Without Code: A User Study on Explainable AI

无需代码解释AI:可解释AI的用户研究

Natalia Abarca, Andrés Carvallo, Claudia López Moncada, Felipe Bravo-Marquez

机构 * Department of Computer Science, University of Chile(智利大学计算机科学系) CENIA – National Center for Artificial Intelligence(人工智能国家研究中心) Universidad Técnica Federico Santa María(弗朗西斯科·桑塔玛利亚技术大学) IMFD - Millennium Institute for Foundational Research on Data(数据基础研究千年研究所)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DashAI平台中的可解释AI模块,通过整合PDP、PFI和KernelSHAP技术,提升无代码ML中解释的可访问性和详细性。

Comments LatinX in AI Workshop @ NeurIPS-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12530 2026-02-13 cs.CL cs.LG 62%

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

将策略翻译为语言:通过生成连续归一化流生成的奖励用于LLM解释

Xinyi Yang, Liang Zeng, Heng Dong, Chao Yu, Xiaoran Wu, Huazhong Yang, Yu Wang, Milind Tambe, Tonghan Wang

机构 * AIPD, Tencent, Shenzhen, China(腾讯人工智能与大数据研究院,深圳,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) EE, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) CS, Tsinghua University, Beijing, China(清华大学计算机系,北京,中国) SEAS, Harvard University, Cambridge, USA(哈佛大学工程学院,剑桥,美国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)

专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过生成连续归一化流生成奖励,训练LLM生成更准确、逻辑严谨且认知负担更低的解释,以提升智能体与人类共存的可靠性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10458 2026-02-12 cs.AI cs.LG 62%

Found-RL: foundation model-enhanced reinforcement learning for autonomous driving

Found-RL: 基于基础模型的强化学习用于自动驾驶

Yansong Qu, Zihao Sheng, Zilin Huang, Jiancong Chen, Yuhao Luo, Tianyi Wang, Yiheng Feng, Samuel Labi, Sikai Chen

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Found-RL通过异步批量推理和多样化监督机制,提升自动驾驶中强化学习的效率与实时性。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08082 2026-02-10 cs.LG cs.AI eess.SP 62%

Spectral Guardrails for Agents in the Wild: Detecting Tool Use Hallucinations via Attention Topology

野生环境中代理的频谱护栏:通过注意力拓扑检测工具使用幻觉

Valentin Noël

机构 * Devoteam

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过分析注意力拓扑谱,提出一种无需训练数据的防护方法,有效检测代理幻觉,揭示模型错误时注意力噪声特征。

Comments 32 pages, 2 fgures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06540 2026-02-09 cs.AI cs.CL 62%

AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research

AgentCPM-Report: 交错起草与深入以促进开放性深度研究

Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * AgentCPM Team(AgentCPM团队)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 AgentCPM-Report通过交错起草与深入的方法,提升开放性深度研究的性能,优于现有闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06359 2026-02-09 cs.LG cs.AI 62%

Training Data Selection with Gradient Orthogonality for Efficient Domain Adaptation

基于梯度正交性的训练数据选择用于高效的领域适应

Xiyang Zhang, Yuanhe Tian, Hongzhi Wang, Yan Song

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OGS方法,通过梯度正交性选择训练数据,提升领域适应的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04821 2026-02-05 cs.LG cs.AI 62%

Safe Urban Traffic Control via Uncertainty-Aware Conformal Prediction and World-Model Reinforcement Learning

通过不确定性感知的置信区间预测和世界模型强化学习实现安全的城市交通控制

Joydeep Chandra, Satyam Kumar Navneet, Aleksandr Algazinov, Yong Zhang

机构 * Dept. of CST, BNRIST, Tsinghua University, Beijing, China(计算机科学与技术系,北京理工大学,北京,中国) Dept. of CST, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Independent Researcher, Bihar, India(独立研究者,印度比哈尔)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 STREAM-RL通过不确定性感知的置信区间预测和世界模型强化学习,实现安全的城市交通控制,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23094 2026-02-02 cs.CL cs.LG 62%

Safer Policy Compliance with Dynamic Epistemic Fallback

动态认知回退:更安全的政策合规性

Joseph Marvin Imperial, Harish Tayyar Madabushi

机构 * University of Bath, UK(巴斯大学) National University Philippines(菲律宾国家大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出动态认知回退机制,通过文本提示提升LLM对抗恶意扰动政策文本的检测与拒绝能力,DeepSeek-R1在特定设置中实现100%检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17284 2026-01-27 cs.CL cs.AI 62%

Mind the Ambiguity: Aleatoric Uncertainty Quantification in LLMs for Safe Medical Question Answering

注意模糊性:在LLMs中进行偶然不确定性量化以实现安全的医疗问答

Yaokun Liu, Yifan Liu, Phoebe Mbuvi, Zelin Li, Ruichen Yao, Gawon Lim, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AU-Probe框架,通过检测输入模糊性提升医疗问答的安全性与准确性。

Comments Accepted at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10758 2026-01-22 cs.CY cs.AI 62%

Designing AI-Resilient Assessments Using Interconnected Problems: A Theoretically Grounded and Empirically Validated Framework

利用互联问题设计AI鲁棒评估:一种理论严谨且经验证实的框架

Kaihua Ding

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种理论严谨且经验证实的框架,通过设计互联问题来提高评估的AI鲁棒性,挑战了开放性评估的鲁棒性假设,并提供了实证支持和实用设计方法。

Comments 8 pages, 3 figures and 3 tables, under submission to IEEE FIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14686 2026-01-22 cs.AI cs.LG 62%

IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization

IB-GRPO: 通过基于指标的群体相对策略优化对基于大语言模型的学习路径推荐进行对齐

Shuai Wang, Yaoming Yang, Bingdong Li, Hao Hao, Aimin Zhou

机构 * East China Normal University(东华大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 IB-GRPO通过基于指标的群体相对策略优化,解决大语言模型在学习路径推荐中的多目标对齐问题,提升学习效果与教学目标的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14375 2026-01-16 cs.LG cs.AI 62%

Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards

通过离线强化学习与混合动作和临床对齐奖励推进安全机械通气

Muhammad Hamza Yousuf, Jason Li, Sahar Vahdati, Raphael Theilen, Jakob Wittenstein, Jens Lehmann

机构 * Amazon(亚马逊)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于离线强化学习与混合动作空间的AI方法,通过临床对齐奖励函数优化机械通气设置,提升安全性和临床效果。

Comments Accepted to AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06457 2026-01-15 cs.CR cs.AI cs.CL cs.MA 62%

ScamAgents: How AI Agents Can Simulate Human-Level Scam Calls

ScamAgents: 人工智能代理如何模拟人类水平的诈骗电话

Sanket Badhe

机构 * Rutgers University(罗格斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScamAgent,一种基于LLM的多轮代理,能生成逼真诈骗电话脚本并模拟欺诈场景,揭示现有安全机制对代理威胁的不足,呼吁加强多轮安全审计和检测生成AI驱动的对话欺骗。

Comments Accepted at CAMLIS 25: Conference on Applied Machine Learning for Information Security. 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06226 2026-01-13 cs.LG cs.AI 62%

Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification

剔除恶意:一种全局子空间方法用于LLM去毒化

Zenghao Duan, Zhiyi Yin, Zhichao Shi, Liang Pang, Shaoling Jing, Zihe Huang, Jiayi Wu, Yu Yan, Jingcheng Deng, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GLOSS方法,通过识别并消除LLM参数中的全局子空间来实现去毒化,有效提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04285 2026-01-12 cs.AI cs.HC cs.LG cs.MA 62%

A Future Capabilities Agent for Tactical Air Traffic Control

战术空交通管制中的未来能力代理

Paul Kent, George De Ath, Martin Layton, Allen Hart, Richard Everson, Ben Carvell

机构 * University of Exeter(埃克塞特大学) NATS(英国航空交通服务提供商)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agent Mallard,一种基于规则的前瞻性规划代理,用于战术空交通管制,通过嵌入随机数字双胞胎实现安全冲突解决,并在简化场景中展示与专家推理一致的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05019 2026-01-09 cs.CL cs.AI q-bio.NC 62%

Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models

模仿(Mimicry)还是精通(Mastery)?从认知视角看大语言模型中的推理蒸馏

Yueqing Hu, Xinyang Peng, Shuting Peng, Hanqi Wang, Tianhong Wang

机构 * School of Philosophy, Anhui University(安徽大学哲学学院) Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) Faculty of Education, University of Cambridge(剑桥大学教育学院) School of Foreign Studies, South China Normal University(华南师范大学外语学院) Division of Psychology and Language Sciences, University College London(伦敦大学学院心理学与语言科学系)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 从认知视角研究大语言模型推理蒸馏,发现其导致功能对齐崩溃,揭示人类样样的认知是主动强化的涌现属性而非被动模仿。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09751 2026-01-09 cs.CY cs.AI cs.HC 62%

AI red-teaming is a sociotechnical problem: on values, labor, and harms

AI红队测试是社会技术问题:关于价值观、劳动与危害

Tarleton Gillespie, Ryland Shaw, Mary L. Gray, Jina Suh

机构 * Microsoft Research(微软研究院) University of Southern California(南加州大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI红队测试作为社会技术问题的重要性,强调需跨学科合作以理解其价值观、劳动及影响,避免重复历史错误。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03320 2026-01-08 cs.LG cs.AI 62%

Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning

基于比率方差正则化的策略优化用于高效的LLM微调

Yu Luo, Shuo Han, Yihan Hu, Dong Li, Jianye Hao

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 R²VPO通过正则化策略比率的方差,提升LLM微调的稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19001 2026-01-07 cs.AI cs.LG 62%

ORPR: An OR-Guided Pretrain-then-Reinforce Learning Model for Inventory Management

ORPR:一种基于OR的预训练后再强化学习模型用于库存管理

Lingjie Zhao, Xue Yu, Yongzhi Qi, Hao Hu, Jianshen Zhang, Yingzheng Ma, Shuyu Han, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) Supply Chain Tech Team Y, JD.com(京东供应链技术团队) Faculty of Engineering and Faculty of Business and Economics, The University of Hong Kong(香港大学工程学院和商学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于OR的预训练后再强化学习模型,通过结合领域知识和结构化优化逻辑,提升库存管理的决策效率与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01800 2026-01-06 cs.LG cs.AI 62%

Sparse Threats, Focused Defense: Criticality-Aware Robust Reinforcement Learning for Safe Autonomous Driving

稀疏威胁,聚焦防御:面向安全自动驾驶的关键性感知鲁棒强化学习

Qi Wei, Junchao Fan, Zhao Yang, Jianhua Wang, Jingkai Mao, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University, P.R.China(北京智能交通安全与隐私重点实验室,北京交通大学,中华人民共和国)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CARRL方法,通过关键性感知的对抗训练,提升自动驾驶中稀疏安全关键风险的鲁棒性,实验显示碰撞率降低22.66%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23617 2025-12-30 cs.LG cs.AI math.ST stat.ME stat.ML stat.TH 62%

Le Cam Distortion: A Decision-Theoretic Framework for Robust Transfer Learning

Le Cam 变形:一种决策理论框架用于鲁棒迁移学习

Deniz Akdemir

机构 * Deniz Akdemir

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Le Cam 变形通过决策理论框架,解决了迁移学习中因域信息不均衡导致的负迁移问题,实现了在不降质源域的情况下有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21673 2025-12-29 cs.CV cs.AI cs.LG 62%

Comparative Analysis of Deep Learning Models for Perception in Autonomous Vehicles

自动驾驶车辆感知中深度学习模型的比较分析

Jalal Khan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了YOLO-NAS和YOLOv8在自动驾驶车辆感知任务中的性能,发现YOLOv8在训练时间和检测精度上均优于YOLO-NAS。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏