PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
《智能体AI的搭车指南:从基础到系统》
机构 * Haggai Roitman
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。
Comments version 1.3
南贝格4.2 - 3B:以紧凑模式解锁智能体能力
机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 偏好对齐 :DPO(abstract,abstract_cn)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
RM-Distiller: 利用生成式大语言模型进行奖励模型蒸馏
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 RM-Distiller通过系统利用教师LLM的精炼、评分和生成能力,提升奖励模型蒸馏效果,首次系统性地探索了生成式LLM在奖励建模中的应用。
Comments Accepted to IJCAI-ECAI 2026
迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。
Comments 14 pages
SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐
机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。
Comments Accepted by SIGKDD 2026
不透明的认知中介:大型语言模型部署配置如何塑造伪科学的验证
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究商业大语言模型对伪科学主张的验证,通过测试四个模型家族在不同时间点的表现,发现Grok快速版本评分异常高,还发现模型行为受部署配置影响,如无声补丁、输出差异等,强调这一现象需新的认知问责形式。
Comments 16 pages, 2 tables
ReVision:一种基于视觉的后处理技术,用于在图像生成管道中替换不可接受的概念
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 ReVision是一种无需训练的后处理框架,通过视觉模型检测并替换图像生成中不安全的概念,提升安全性与生成质量。
ARBITER:面向服务水平目标的Kubernetes修复的受保护代理控制
专题命中 安全训练 :safety(abstract)
AI总结 研究在Kubernetes微服务上维护SLO的难题,提出ARBITER受保护控制平面,构建因果资源图等,分离规划与执行,支持多种规划方式。通过实验评估其在选择修复操作和下游目标等方面的效果,展示了优于HPA/仅资源控制的性能。
立场:人工智能/机器学习领域对深度伪造的研究与人工智能生成的非自愿亲密图像(AIG-NCII)不一致
专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 研究指出人工智能/机器学习领域对深度伪造的研究与AIG-NCII不一致,现有技术干预忽略AIG-NCII,现有干预只关注观众认知危害,忽略主体尊严危害,建议更新威胁模型,在安全研究中解决AIG-NCII,同时警告研究人员涉足该领域需谨慎并做好防护。
Comments ICML 2026. Outstanding position paper honorable mention
量身定制的虚假信息:个性化如何挑战大语言模型的安全防护
机构 * University of Sheffield(谢菲尔德大学) ; University of Copenhagen(哥本哈根大学) ; Big Data for Smart Society Institute (GATE)(大数据智能社会研究所(GATE)) ; University of São Paulo(圣保罗大学)
专题命中 红队测试 :safety(abstract);分类 cs.CL
AI总结 研究LLMs针对特定角色生成虚假信息的情况,采用红队测试方法创建数据集,发现安全防护在多数情况下失效,各模型能有效定制输出,还揭示了特定语言和心理模式及安全防护有效性差异,凸显加强多语言安全防护的必要。
V-DEAL:将视频安全去校准诊断为理解-拒绝耦合失败
机构 * University of Queensland(昆士兰大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 提示注入 :safety(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.AI
AI总结 研究视频大语言模型安全对齐问题,提出V-DEAL三级诊断框架分析漏洞机制,通过测试发现模型识别有害视频内容有一定准确率,但配对有害视频与良性查询时攻击成功率高,视觉理解激活拒绝倾向弱,还引入提示注入干预方法降低攻击成功率。
AgentWatcher: 一种基于规则的提示注入监控
专题命中 提示注入 :prompt injection(title,abstract)
AI总结 本文提出AgentWatcher,通过聚焦短文本片段和定义明确的规则,解决提示注入检测中上下文长度影响和规则不明确的问题,实现可扩展且可解释的检测方法。
Comments The code is available at https://github.com/wang-yanting/AgentWatcher
谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; ST Engineering, Singapore(ST工程,新加坡) ; IBM Research, USA(IBM研究院,美国) ; University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)
专题命中 提示注入 :prompt injection(title);分类 cs.AI、cs.CY
AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。
Comments 25 pages
SkillSieve:一种用于检测恶意AI代理技能的分层分流框架
机构 * Department of Earth Science and Engineering(地球科学与工程系) ; Imperial College London(帝国理工学院伦敦分校) ; Department of Computer Science(计算机科学系) ; University College London(伦敦大学学院) ; Lingban Technology Co., Ltd.(灵伴科技有限公司) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 提出SkillSieve三层检测框架,通过启发式评分、LLM子任务分析和多LLM陪审团辩论,高效检测恶意AI代理技能,在390个技能基准上达到F1=0.920。
Comments 10 pages, 2 figures, 6 tables
从基于摄像头的感知到推理:面向主动弱势道路使用者安全的全面综述
机构 * University of Washington(华盛顿大学) ; University of Utah(犹他大学)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 综述基于摄像头的主动弱势道路使用者安全方法,将文献分为视觉感知、运动建模和行为理解三部分,构成统一分层管道实现早期风险预测和及时干预,纳入新兴AI范式,识别关键挑战并讨论研究方向,提供VRU安全系统开发基础。
Comments 18 pages, 4 figures, 5 tables
Journal ref IEEE Transactions on Intelligent Transportation Systems, 2026, pp. 1-17
用于微调CLIP的移位感知校准:利用图像-文本对齐
专题命中 幻觉与事实性 :alignment(title);分类 cs.LG
AI总结 研究针对微调CLIP时预测置信度与准确性不一致问题,提出无需训练的移位感知校准(SAC)方法,利用原始与微调CLIP输出对数差异作校准信号,经实验验证该方法在多数据集和微调方法上提升了校准效果。
ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证
机构 * Multiverse Computing ; Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) ; Centre for Social Innovation(社会创新中心) ; Donostia International Physics Center(多诺斯蒂亚国际物理中心) ; Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。
Comments 20 pages, 4 figures
重新思考用于大语言模型的前景理论:在认知不确定性下决策的不稳定性
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文重新审视前景理论在大语言模型中的应用,发现其在认知不确定性下的决策稳定性存在问题,指出前景理论可能无法可靠地处理此类不确定性。
OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 隐私与版权 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。
Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026
MedFailBench:用于医学人工智能安全边界检查的临床医生构建的开源基准测试
机构 * Kutahya Emet Dr. Fazil Dogan State Hospital(屈塔希亚埃梅特法齐尔·多安州立医院)
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI
AI总结 MedFailBench提出不同问题,构建合成基准测试和失败图谱,通过严重程度和安全门类型标记医学人工智能错误,当前版本含44个合成病例等内容,以特定许可形式发布并带有DOI。
Comments 6 pages; synthetic benchmark reviewed by a clinician; no patient data
TRIDENT:评估金融、医学和法律领域大语言模型的安全性
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 研究针对大语言模型在金融、医学和法律领域的安全评估问题,基于相关伦理准则定义安全原则并引入Trident-Bench基准进行评估,揭示了不同模型的安全差距,为LLM安全研究提供了系统资源和研究基础。
Comments COLM 2026
迈向理解遗忘难度:一种机制视角和电路引导的难度度量
机构 * University of Massachusetts Lowell(马萨诸塞大学洛约拉分校) ; Walmart Global Tech(沃尔玛全球技术) ; University of Virginia(弗吉尼亚大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CUD度量,通过分析模型电路揭示遗忘难度的机制特征,为设计基于模型机制的遗忘方法提供理论基础。
Comments ACL 2026 Findings
欧盟人工智能法案中的稳健性与网络安全
机构 * University of Tübingen(图宾根大学) ; IBM Research Africa(IBM非洲研究中心) ; Saarland University(萨尔兰州大学) ; CSZ Institute for Artificial Intelligence and Law, University of Tübingen(人工智能与法律研究所,图宾根大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文针对欧盟人工智能法案中高风险人工智能系统和通用人工智能模型相关条款,识别其在稳健性和网络安全方面的法律挑战与缺陷,结合机器学习进展评估实施挑战,为制定相关标准等提供参考,弥合法律与研究差距。
Comments A previous version contained an incorrect publication year for the AI Act on page 1. This has been corrected
Journal ref The 2025 ACM Conference on Fairness, Accountability, and Transparency
适配器合并重新激活潜在推理痕迹:一种机制分析
机构 * Zjydiary Group(Zjydiary小组)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示适配器合并后推理痕迹的重新激活机制,通过几何方法减少泄漏并提升准确性。
Comments Withdrawn by the authors after identifying an implementation error in adapter coefficient scaling that materially affects the main empirical results and invalidates the current conclusions. A corrected reanalysis is in progress
人工智能评估中随机对照试验的原则与指南
专题命中 安全评测 :分类 cs.AI、cs.CY、cs.LG;safety(comments);AI safety(comments)
AI总结 研究针对人工智能评估随机对照试验缺乏通用标准和共享词汇的问题,借鉴多学科实践综合五条原则,形成33条可操作指南,为其发挥设计工具、评估标准和标准制定蓝图的作用,提供评估标准、共享语言及指南。
Comments 33 pages, ICML 2026 (Workshop on Technical AI Governance Research) and Technical AI Safety Conference
智能体不仅会认同,还会记忆:对有状态个人智能体中持续谄媚行为的基准测试
机构 * City University of Hong Kong(香港城市大学) ; ByteDance(字节跳动) ; Yale University(耶鲁大学) ; Fudan University(复旦大学) ; Hong Kong Baptist University(香港浸会大学) ; Dalian University of Technology(大连理工大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究有状态个人智能体中的持续谄媚行为,引入PASB基准测试,评估真实智能体。通过特定方法隔离写入过程,发现提交边界是关键转折点,提交声明有三种模式,表明智能体谄媚行为是状态写入治理问题,PASB确定相关写入时控制。
OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现
机构 * OpenAI
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。
Comments 13 pages, two graphs
PReSS:通过论证压力评估LLM中政治立场稳定性的黑盒框架
机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) ; University of California Riverside(加州大学河滨分校)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 PReSS通过评估LLM在不同话题下的立场稳定性,揭示了模型政治立场的动态变化,为理解和干预政治敏感行为提供新视角。
Comments 13 pages, 8 figures
Journal ref In Proceedings of the 3rd Workshop on Natural Language Processing for Political Sciences (PoliticalNLP 2026) @ LREC 2026 (pp. 234-247)