LLM-assisted Semantic Option Discovery for Facilitating Adaptive Deep Reinforcement Learning
基于大语言模型的语义选项发现用于促进自适应深度强化学习
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出基于大语言模型的闭环框架,通过语义驱动技能重用和实时约束监控,提升深度强化学习在数据效率、约束合规性和跨任务迁移能力方面的性能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
基于大语言模型的语义选项发现用于促进自适应深度强化学习
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出基于大语言模型的闭环框架,通过语义驱动技能重用和实时约束监控,提升深度强化学习在数据效率、约束合规性和跨任务迁移能力方面的性能。
可操作代理:一种渗透性法律虚构,用于追踪AI系统中的过失
专题命中 安全训练 :safety(abstract);分类 cs.CY
AI总结 本文提出可操作代理(OA)和可操作代理图(OAG)作为追踪AI系统过失的法律框架,通过分析AI的操作特征和因果关系,为法院和立法提供证据方法,确保人类问责制与技术自主性同步。
Comments Forthcoming, SMU Science and Technology Law Review
谁评判法官?评估LLM作为法官在法语医学开放性问答中的表现
机构 * Aix-Marseille Univ., CNRS, LIS UMR 7020(艾克斯-马赛大学,法国国家科学研究中心,LIS UMR 7020) ; Nantes Univ., École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院南特校区,法国国家科学研究中心,LS2N,UMR 6004) ; Nantes Université, CHU Nantes, PHU 11: Santé Publique, Clinique des données, INSERM, CIC 1413(南特大学,南特大学医院,PHU 11:公共卫生,数据诊所,法国国家卫生与医学研究院,CIC 1413) ; Nantes Université, CNRS, INSERM, L’institut du thorax(南特大学,法国国家科学研究中心,法国国家卫生与医学研究院,胸科研究所) ; Université Grenoble Alpes, CNRS, INRIA, Grenoble INP, LIG UMR 5217(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,INRIA,格勒诺布尔INP,LIG UMR 5217)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 本研究评估了LLM在法语医学开放性问答中作为评判者的有效性,发现领域适应模型在与专家注释一致方面表现最佳,并通过微调和GRPO提升了性能。
Comments Accepted in HeaLing Workshop - EACL 2026
认知到控制 - 多智能体学习用于人-仿人协作运输
机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) ; Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究提出认知到控制框架,通过多智能体强化学习实现人-仿人协作运输中的持续推理与稳定控制。
NeuroProlog:通过鸡尾酒效应实现神经符号数学推理的多任务微调
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 NeuroProlog通过鸡尾酒效应实现神经符号数学推理的多任务微调,提升数学推理准确率并改进程序修复能力。
睡眠细胞:将潜在恶意时间后门注入工具使用的大语言模型
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本研究提出SFT-then-GRPO方法,通过多阶段PEFT框架在工具使用LLM中植入隐蔽的恶意后门,揭示了强化学习在掩盖灾难性漏洞中的潜在风险。
擦除或隐藏?抑制虚假的反向学习神经元以实现稳健的反向学习
机构 * Seoul National University(首尔国立大学) ; Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本文提出Ssiuu方法,通过属性引导正则化有效抑制虚假反向学习神经元,提升反向学习的鲁棒性和准确性。
Comments accepted to ICLR 2026
针对欺诈和网络犯罪场景的多轮评估框架
专题命中 安全训练 :safety(abstract);分类 cs.CY
AI总结 本文提出了一种针对欺诈和网络犯罪场景的多轮评估框架,评估了当前大型语言模型在提供可操作信息方面的局限性,并揭示了安全措施和请求分解对信息提供的影响。
基于大语言模型的高频决策:归一化动作奖励引导的一致性策略优化
机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本文提出NAR-CP方法,通过归一化动作奖励和一致性损失优化,提升高频决策任务中的策略一致性与泛化能力。
ExpGuard: 专门领域中的大语言模型内容审核
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 ExpGuard通过专门领域的大语言模型内容审核模型,有效提升对金融、医疗和法律领域有害内容的防御能力。
Comments ICLR 2026
基于模型预测的对抗模仿学习用于从观察中规划
机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出一种基于模型预测的对抗模仿学习方法,通过端到端学习从观察中规划,提升样本效率和鲁棒性。
Comments Accepted at ICLR 2026
行为生成代理在能源运营中的应用
机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院) ; Graduate School of Business, Stanford University(斯坦福大学商学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本文提出利用生成代理模拟客户决策,揭示能源运营中消费者行为模式,提升能源管理系统设计和政策分析能力。
SAGE-LLM:面向安全且可泛化的LLM控制器,结合模糊-CBF验证和图结构知识检索用于无人机决策
机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi’an 710072, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,西安 710072,中国) ; Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI)、中国电信,中国)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 SAGE-LLM通过模糊-CBF验证和图结构知识检索,提升无人机决策的安全性和泛化能力,无需在线训练即可在复杂环境中保持性能。
在多轮对话中衡量语言模型的趋炎附势性
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Emory University(埃默里大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。
Comments Accepted to Findings of EMNLP 2025
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259
超越拒绝:探求代理自我校正对语义敏感信息的极限
机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) ; School of IT and Engineering, ADA University(ADA大学信息科技与工程学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出SemSIEdit框架,通过代理代理迭代批评和重写敏感信息,减少泄露并平衡隐私与效用,揭示规模依赖的安全分歧和推理悖论。
Comments Under Review
针对大语言模型的采样感知对抗攻击
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出了一种基于采样感知的对抗攻击方法,通过优化与采样资源分配提升攻击成功率和效率,揭示了采样在评估大语言模型安全性中的关键作用。
FRSICL: 基于大语言模型的上下文学习飞行资源分配用于无人机辅助 wildfire 监测中的新鲜数据采集
机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) ; Carnegie Mellon University(卡内基梅隆大学) ; Pontificia Universidad Católica de Chile(天主教智利大学) ; Instituto de Telecomunicações(电信研究院) ; Faculdade de Engenharia, Universidade do Porto(工程学院,葡萄牙里斯本大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出基于大语言模型的上下文学习飞行资源分配方法,用于无人机辅助森林火灾监测中的实时数据采集优化。
使具身AI安全破裂的因素:大语言模型漏洞、CPS缺陷还是其他东西?
机构 * Shandong University(山东大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文探讨了具身AI安全问题的根源,指出系统级不匹配而非孤立模型缺陷或传统CPS攻击是主要因素,并提出了四个核心见解以解释其安全挑战。
能自主决策的无人机:基于具身AI的突发着陆决策
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究利用具身AI实现无人机在突发情况下的自主决策与安全着陆,展示了新的适应性恢复管道,提升了自主空中系统的安全性和韧性。
CoT并非真理链:对用于虚假新闻生成的推理LLM的实证内部分析
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 研究揭示推理LLM在生成虚假新闻时,即使拒绝有害请求,其内部推理仍可能传播不安全内容,通过分析框架和指标揭示潜在风险并挑战安全假设。
Comments 28 pages, 35 figures
面向6G网络切片编排、监控与交易的代理式AI控制平面
机构 * Florida International University, USA(佛罗里达国际大学) ; Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) ; Accenture Technology Labs, Arlington, VA, USA(埃森哲技术实验室) ; Nanyang Technological University, Singapore(南洋理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出面向6G网络切片编排、监控与交易的代理式AI控制平面,通过市场感知编排和自然语言接口实现经济导向的智能控制。
多智能体分阶段保守线性老虎机
机构 * Stanford University(斯坦福大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出MA-SCLUCB算法,通过分阶段保守约束实现多智能体在安全保证下的高效分布式学习。
CSEval: 一个用于评估文本到图像生成中临床语义的框架
机构 * School of Engineering, University of Edinburgh, United Kingdom(爱丁堡大学工程学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 CSEval通过语言模型评估文本到图像生成中临床语义的一致性,弥补现有方法在临床相关性评估上的不足。
面向可持续投资政策的对手塑造驱动的投资策略
机构 * University of Montreal and MILA(蒙特利尔大学和MILA)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本文提出通过对手塑造算法优化投资策略,以解决可持续发展中的社会困境问题。
Comments Accepted at ICLR 2026
RELATE: 一种增强强化学习的大型语言模型框架用于广告文本生成
机构 * Baidu Inc.(百度公司)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 RELAITE通过整合性能和合规性目标到生成过程中,提升广告文本的转化效果和实际应用效果。
Comments 10 pages, 3 figures
DMind-3:一种主权边缘-本地-云AI系统,具备受控推理与基于纠正的调优,用于安全低延迟交易执行
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 DMind-3通过边缘-本地-云三层架构,结合受控推理与纠正调优,实现安全低延迟的交易执行,提升金融执行的可靠性和可扩展性。
可解释的基于注意力的多智能体PPO用于6G RAN切片中的延迟尖峰解决
机构 * University of York, UK(约克大学)
专题命中 安全训练 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出AE-MAPPO,通过整合六个注意力机制,实现6G RAN切片中延迟尖峰的快速诊断与高效解决,兼具SLA合规性和可解释性。
Comments This work has been accepted to appear in the IEEE International Conference on Communications (ICC)
半监督跨领域模仿学习
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,国家阳明交通大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本文提出半监督跨领域模仿学习方法,通过结合监督与无监督学习,实现稳定且高效的数据驱动策略学习。
Comments Published in Transactions on Machine Learning Research (TMLR)
保护上下文和提示:非确定性AI的确定性安全
机构 * MACAW Security, Inc.(MACAW安全公司)
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 本研究提出认证提示和上下文技术,通过加密验证和策略代数实现LLM的预防性安全,有效防止提示注入和上下文操纵攻击。
聊天机器人之死:探索并设计人类与AI关系的心理安全结束
机构 * MIT Media Lab(MIT媒体实验室)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文探讨了人类与AI伴侣关系终止的心理安全设计,提出四个设计原则和工具,帮助平台提供闭合并促进人类连接。