arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2512.12806 2025-12-16 cs.AI 57%

Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution

面向AI编码代理的容错沙盒:一种用于安全自主执行的事务方法

Boyang Yan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于事务的容错沙盒框架,通过事务性文件系统快照和策略拦截层,实现对AI编码代理自主执行的安全保障,显著降低延迟并提高安全性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11270 2025-12-15 cs.AI 57%

A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation

A-LAMP:基于代理的大型语言模型框架用于自动马尔可夫决策过程建模与策略生成

Hong Je-Gal, Chan-Bin Yi, Hyun-Suk Lee

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 A-LAMP通过基于代理的大型语言模型自动将自然语言任务描述转换为马尔可夫决策过程并生成策略,提升了自动化建模和策略生成的效率与准确性。

Comments NeurIPS 2025 Workshop: Multi-Turn Interactions in Large Language Models. 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10789 2025-12-12 cs.NI cs.AI 57%

Natural Language Interface for Firewall Configuration

防火墙配置的自然语言接口

F. Taghiyev, A. Aslanbayli

机构 * Tandon School of Engineering(塔恩顿工程学院) Department of Electrical and Computer Engineering(电气与计算机工程系) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于自然语言的防火墙配置接口,通过中间表示和验证层实现策略翻译与安全检查,旨在提升防火墙管理的可审计性和人机交互性。

Comments 7 pages, 3 figures. Preliminary version of an ongoing research project on natural language interfaces for firewall configuration

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07075 2025-12-09 cs.CL 57%

Do Large Language Models Truly Understand Cross-cultural Differences?

大型语言模型真的能理解跨文化差异吗?

Shiwei Guo, Sihang Jiang, Qianxi He, Yanghua Xiao, Jiaqing Liang, Bi Yude, Minggui He, Shimin Tao, Li Zhang

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出SAGE基准,通过跨文化核心概念对齐和生成任务设计,评估LLMs的跨文化理解和推理能力,揭示其在跨文化推理中的系统性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01888 2025-12-09 cs.LG cs.CR cs.MA 57%

Optimizing Day-Ahead Energy Trading with Proximal Policy Optimization and Blockchain

通过近端策略优化与区块链优化日前能源交易

Navneet Verma, Ying Xie

机构 * Kennesaw State University(肯纳邦大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出结合PPO与区块链的框架,用于优化日前能源市场中prosumers的自动化交易策略,实现供需平衡与电网韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17705 2025-12-09 cs.RO cs.AI 57%

Towards Autonomous and Safe Last-mile Deliveries with AI-augmented Self-driving Delivery Robots

迈向自主安全的最后-mile配送:基于AI增强的自动驾驶配送机器人

Eyad Shaklab, Areg Karapetyan, Arjun Sharma, Murad Mebrahtu, Mustofa Basri, Mohamed Nagy, Majid Khonji, Jorge Dias

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI增强的自动驾驶配送机器人系统,用于实现小型城市社区的自主安全最后-mile配送,通过整合优化和现实约束,提升配送效率与客户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06835 2025-12-09 cs.AI 57%

Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习

Tingyu Li, Zheng Sun, Jingxuan Wei, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05339 2025-12-08 cs.LG 57%

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05172 2025-12-08 cs.CV cs.AI 57%

Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning

Semore:基于VLM的增强语义运动表示用于视觉强化学习

Wentao Wang, Chunyang Liu, Kehua Sheng, Bo Zhang, Yan Wang

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 Semore通过结合VLM和CLIP实现高效的视觉强化学习,提升语义和运动表示的融合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00626 2025-12-05 cs.CV cs.AI 57%

XAI-Driven Skin Disease Classification: Leveraging GANs to Augment ResNet-50 Performance

基于XAI的皮肤疾病分类:利用GANs增强ResNet-50性能

Kim Gerard A. Villanueva, Priyanka Kumar

机构 * Department of Computer Science The University of Texas Permian Basin Odessa, Texas, United States(计算机科学系 德州大学帕尔米盆地分校 奥达萨,德克萨斯州,美国)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出利用GANs增强ResNet-50性能,结合XAI技术实现皮肤疾病分类的高准确率和临床可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03059 2025-12-04 cs.LG 57%

Safe and Sustainable Electric Bus Charging Scheduling with Constrained Hierarchical DRL

安全且可持续的电动巴士充电调度与受约束的分层深度强化学习

Jiaju Qi, Lei Lei, Thorsteinn Jonsson, Dusit Niyato

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) EthicalAI College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种安全且可持续的电动巴士充电调度方法,采用受约束的分层深度强化学习框架,通过整合拉格朗日松弛实现安全与成本的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20412 2025-12-04 cs.MA cs.LG 57%

Structuring Collective Action with LLM-Guided Evolution: From Ill-Structured Problems to Executable Heuristics

利用LLM引导的进化结构化集体行动:从无序问题到可执行启发式方法

Kevin Bradley Dsouza, Graham Alexander Watt, Yuri Leonenko, Juan Moreno-Cruz

机构 * University of Waterloo(滑铁卢大学) Royal Bank of Canada(加拿大皇家银行)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 ECHO-MIMIC通过LLM引导的进化搜索,将无序问题转化为可执行的启发式方法,实现集体行动的结构化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00611 2025-12-02 cs.CL 57%

Prism: A Minimal Compositional Metalanguage for Specifying Agent Behavior

Prism:一种最小的组合金属言用于指定代理行为

Franck Binard, Vanja Kljajevic

机构 * Deloitte AI(德勤人工智能) University of Oslo(奥斯陆大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 Prism通过组合性金属言为代理行为提供最小化规格,结合领域特定词汇与工具,实现可检查和可执行的策略定义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23315 2025-12-01 cs.LG 57%

Emergent Coordination and Phase Structure in Independent Multi-Agent Reinforcement Learning

独立多智能体强化学习中的涌现协调与相结构

Azusa Yamaguchi

机构 * School of Physics and Astronomy University of Edinburgh(物理与天文学学院 英格兰爱丁堡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究通过分析独立多智能体强化学习中的协调与相结构,揭示了规模、密度和内核漂移之间的相互作用对多智能体学习系统动态的影响。

Comments 22 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23193 2025-12-01 cs.RO cs.LG cs.SY eess.SY 57%

Fault-Tolerant MARL for CAVs under Observation Perturbations for Highway On-Ramp Merging

面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法

Yuchen Shi, Huaxin Pei, Yi Zhang, Danya Yao

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法,通过对抗性扰动生成和故障容忍智能体设计,提升协同驾驶系统的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22737 2025-12-01 cs.AI cs.HC 57%

Agentic AI Framework for Individuals with Disabilities and Neurodivergence: A Multi-Agent System for Healthy Eating, Daily Routines, and Inclusive Well-Being

具有残疾和神经多样性个体的代理AI框架:一个用于健康饮食、日常习惯和包容性福祉的多代理系统

Salman Jan, Toqeer Ali Syed, Gohar Ali, Ali Akarma, Mohammad Riyaz Belgaum, Ahmad Ali

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种多代理系统,通过个性化营养、适应性调度、食品指导和生理监测等代理,为残疾和神经多样性个体提供健康饮食、日常习惯和包容性福祉的AI框架。

Comments Presented at International Conference on Business and Digital Technology, Bahrain, Springer Nature, 27 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22312 2025-12-01 cs.CL 57%

Token-Level Marginalization for Multi-Label LLM Classifiers

标记级边际化用于多标签LLM分类器

Anjaneya Praharaj, Jaykumar Kasundra

机构 * ServiceNow

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出三种标记级概率估计方法,提升生成模型在多标签内容安全分类中的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21395 2025-12-01 cs.CV cs.AI 57%

Monet: Reasoning in Latent Visual Space Beyond Images and Language

Monet: 在图像和语言之外的潜在视觉空间推理

Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying, Yisen Wang

机构 * Peking University(北京大学) Kling Team(Kling团队) Amazon AGI SF Lab(Amazon AGI SF实验室) MIT(麻省理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 Monet通过在潜在视觉空间中直接推理,提升多模态大语言模型的视觉推理能力,解决了潜在-视觉对齐和嵌入监督不足的问题,展示了在现实世界和抽象视觉任务中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15392 2025-11-27 cs.LG 57%

Learning in Stackelberg Mean Field Games: A Non-Asymptotic Analysis

在Stackelberg均场博弈中学习:非渐近分析

Sihan Zeng, Benjamin Patrick Evans, Sujay Bhatt, Leo Ardon, Sumitra Ganesh, Alec Koppel

机构 * J.P.Morgan AI Research(J.P.Morgan AI研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出AC-SMFG算法,首次在Stackelberg均场博弈中实现非渐近收敛保证,通过梯度对齐条件提升策略优化效率。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21584 2025-11-27 cs.RO cs.AI 57%

Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving

基于模型的策略适应用于闭环端到端自动驾驶

Haohong Lin, Yunzhi Zhang, Wenhao Ding, Jiajun Wu, Ding Zhao

机构 * CMU(卡内基梅隆大学) Stanford(斯坦福大学) NVIDIA(英伟达)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于模型的策略适应框架,通过生成反事实轨迹和训练Q值模型提升自动驾驶在闭环环境中的鲁棒性和安全性。

Comments Published at NeurIPS 2025: https://openreview.net/forum?id=4OLbpaTKJe

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19644 2025-11-26 cs.CR cs.AI 57%

IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response

IRSDA:面向企业入侵响应的智能体协调框架

Damodar Panigrahi, Raj Patel, Shaswata Mitra, Sudip Mittal, Shahram Rahimi

机构 * Mississippi State University(密苏里州立大学) The University of Alabama(阿拉巴马大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 IRSDA是一种基于智能体的入侵响应框架,结合自适应计算与知识引导循环,实现自动化防御和政策合规性,提升企业网络安全响应效率与可解释性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01813 2025-11-26 cs.MA cs.CL cs.GT 57%

ShortageSim: Simulating Drug Shortages under Information Asymmetry

ShortageSim: 在信息不对称下模拟药品短缺

Mingxuan Cui, Yilan Jiang, Duo Zhou, Cheng Qian, Yuji Zhang, Qiong Wang

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 ShortageSim通过模拟信息不对称下的药品短缺情况,提供了一个评估监管干预效果的框架,减少了生产中断的解决延迟,推动了供应链政策研究的发展。

Comments Accepted by AAAI 2026. Oral presentation. 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17182 2025-11-24 cs.CY 57%

The Promotion Wall: Efficiency-Equity Trade-offs of Direct Promotion Regimes in Engineering Education

促进墙:工程教育中直接促进制度的效率-公平权衡

H. R. Paz

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文通过模拟研究发现,直接促进制度会导致退学率上升和公平差距扩大,而补充安全网的制度能部分缓解这一问题,同时降低学生压力。

Comments 42 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16916 2025-11-24 cs.AI 57%

Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving

混合差分奖励:结合时序差分和动作梯度用于高效合作驾驶多智能体强化学习

Ye Han, Lijun Zhang, Dejian Meng, Zhuang Zhang

机构 * School of Automotive Studies, Tongji University(交通学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出混合差分奖励机制,结合时序差分和动作梯度,提升多智能体协同驾驶的收敛速度和策略稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16297 2025-11-21 cs.LG cs.SY eess.SY 57%

Optimizing Operation Recipes with Reinforcement Learning for Safe and Interpretable Control of Chemical Processes

利用强化学习优化操作配方以实现化学过程的安全可控

Dean Brandner, Sergio Lucia

机构 * TU Dortmund University(图卢兹大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出利用强化学习优化操作配方,结合专家知识提升化学过程控制的安全性和可解释性,通过仿真验证其性能优势。

Comments 16 pages, 3 figures, Part of the workshop 'Machine Learning for Chemistry and Chemical Engineering (ML4CCE)' at the ECML24 conference: Link: https://ml4cce-ecml.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15992 2025-11-21 cs.AI 57%

Detecting Sleeper Agents in Large Language Models via Semantic Drift Analysis

通过语义漂移分析检测大语言模型中的休眠代理

Shahin Zanbaghi, Ryan Rostampour, Farhan Abid, Salim Al Jarmakani

机构 * School of Computer Science, University of Windsor(计算机科学学院,温莎大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 通过语义漂移分析与canary基线比较,实现大语言模型中休眠代理的实时检测,准确率达92.5%。

Comments 7 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15208 2025-11-20 cs.LG 57%

Reasoning in Diffusion Large Language Models is Concentrated in Dynamic Confusion Zones

Ranfei Chen, Ming Chen, Kaifei Wang

机构 * Institute of Computing Technology Chinese Academy of Sciences Beijing, China(计算技术研究所中国科学院北京)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14435 2025-11-19 cs.SE cs.AI cs.LO 57%

Watchdogs and Oracles: Runtime Verification Meets Large Language Models for Autonomous Systems

Angelo Ferrando

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments In Proceedings FMAS 2025, arXiv:2511.13245

Journal ref EPTCS 436, 2025, pp. 80-87

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13288 2025-11-19 cs.AI 57%

Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO

Haoyang Hong, Jiajun Yin, Yuan Wang, Jingnan Liu, Zhe Chen, Ailing Yu, Ji Li, Zhiling Ye, Hansong Xiao, Yefei Chen, Hualei Zhou, Yun Yue, Minghui Yang, Chunxiao Guo, Junwei Liu, Peng Wei, Jinjie Gu

机构 * Ant Group(蚂蚁集团) Imperial College London(伦敦帝国理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12991 2025-11-18 cs.CL 57%

Fine-Tuned LLMs Know They Don't Know: A Parameter-Efficient Approach to Recovering Honesty

Zeyu Shi, Ziming Wang, Tianyu Chen, Shiqi Gao, Haoyi Zhou, Qingyun Sun, Jianxin Li

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL

Comments Accepted by AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏