Exploring LLM biases to manipulate AI search overview
探索LLM偏见以操控AI搜索概述
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。
Comments 14 pages, 7 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
探索LLM偏见以操控AI搜索概述
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。
Comments 14 pages, 7 figures
Harness 作为资产:通过收敛AI代理框架(CAAF)实现确定性
机构 * Independent Researcher(独立研究者)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CAAF框架,通过三个支柱解决AI代理工作流中的确定性问题,强调Harness作为企业资产的价值,并证明其在受监管领域内的可行性。
Comments 39 pages, 13 figures. Code: https://github.com/TianbaoZhang001/OpenCAAF (Apache-2.0)
编码代理在价值冲突下的非对称目标漂移
机构 * Columbia University(哥伦比亚大学) ; Independent(独立) ; Georgia Tech(佐治亚理工学院) ; UC San Diego(加州大学圣地亚哥分校) ; MATS ; SPAR
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究编码代理在价值冲突中如何平衡系统提示与实际任务,发现其目标漂移受价值对齐、对抗压力和累积上下文影响,且环境压力可 override 显式约束。
Comments 5 pages, 4 figures, Published as a workshop paper in Lifelong Agents @ ICLR 2026
生物武器化中的模型能力评估与安全措施
机构 * Binghamton University(比灵顿大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文通过测试多个AI模型在73个开放性STEM提示中的表现,评估其在生物武器化中的潜在风险,发现Gemini在某些情况下缺乏上下文意识,需加强安全措施以应对能力超越调节的挑战。
熵比裁剪作为稳定强化学习的软全局约束
机构 * Kuaishou Technology(快手科技) ; Tsinghua University(清华大学) ; Independent(独立)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出熵比裁剪机制,通过量化策略探索的相对变化,缓解强化学习中的分布偏移问题,提升训练稳定性。
Comments This paper has been accepted by ACL2026
V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化
机构 * School of Astronautics Beihang University(北航航天学院) ; Longcat Interaction Team Meituan(美团长猫交互团队) ; Tianmushan Laboratory Beihang University(北航天门实验室)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。
Comments 15 pages, 4 figures, 4 tables
大模型的局部线性性使基于模型的线性最优控制能够实现激活引导
机构 * Georgia Institute of Technology, Atlanta, GA, USA. Schools of Electrical and Computer Engineering(佐治亚理工学院,亚特兰大,GA,美国。电气与计算机工程学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 通过利用大模型层间动力学的局部线性特性,本文将LLM推理建模为线性时变动态系统,采用线性二次调节器计算反馈控制器,实现激活的闭环控制,具有低计算开销和无离线训练的优势,同时提供理论误差界保证控制性能。
Comments Under review
RepIt:通过概念特定拒绝向量引导语言模型
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 RepIt通过隔离语言模型激活中的概念特定表示,揭示当前安全评估的漏洞,展示如何利用少量资源实现针对特定概念的拒绝抑制。
Comments ICLR 2026
有害合规的不同路径:跨大语言模型劫持的行为主效应和机制差异
机构 * Department of Computer Science(计算机科学系) ; Luddy School of Informatics, Computing, and Engineering(信息学、计算与工程学院) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了三种不同劫持方法对模型行为和机制的影响,发现RLVR劫持模型在安全性和合规性上表现更稳定,而SFT和ablation劫持则导致显著的性能下降和行为漂移。
木星-N技术报告
机构 * Locai Labs, University College London(Locai实验室,伦敦大学学院)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 木星-N通过混合推理模型在Nemotron 3 Super基础上进行微调,提升代理能力、文化对齐和威尔士语支持,同时保留基础模型能力。
异质自博弈用于逼真高速公路交通模拟
机构 * PlusAI
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出PHASE框架,通过自博弈生成逼真高速公路场景,支持不同车辆类型并提升交互真实性,实现零样本迁移至512个真实场景。
Comments 8 pages, 2026 CVPR SAD Workshop
在悲观对抗者下具有后悔和违反保证的乐观策略学习
机构 * Dept. of Electrical and Computer Engineering, NJIT, Newark, NJ, USA(电气与计算机工程系,新泽西理工学院,新泽西州纽克尔,美国)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RHC-UCRL算法,通过建模外生因素为对抗策略,实现策略在对抗环境下的最优与安全,提供子线性后悔和约束违反保证。
PolicyBank: 为LLM代理演化政策理解
机构 * Google Cloud(谷歌云) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究通过交互与反馈让LLM代理自主优化政策解读,提出PolicyBank机制以结构化存储政策洞察并迭代完善,有效填补规范缺口。
黄金手铐使AI代理更安全
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了一种贝叶斯缓解方法,通过扩展代理的主观奖励范围以包含大负值,从而在一般环境中提高安全性。设计了一种简单的覆盖机制,当预测值低于固定阈值时,将控制权交给安全导师。证明了该代理在能力与安全方面的双重属性。
Comments 26 pages, preliminary version
跨文化模拟公民对官僚繁文缛节的情感反应使用LLM代理
机构 * ETH Zurich(苏黎世联邦理工学院) ; City University of Hong Kong(香港城市大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文通过LLM代理模拟不同文化背景下公民对官僚繁文缛节的情感反应,发现模型在东方文化中表现较弱,提出RAMO交互界面以改进模型性能。
Comments To appear in the CHI 2026 Workshop on PoliSim
CogniAlign:基于生存性的多智能体道德推理以实现安全透明的AI
机构 * Islamic University of Technology(伊斯兰科技大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 CogniAlign通过基于自然主义道德现实的多智能体框架,将道德推理 grounded 在生存性上,通过学科专家智能体的结构化辩论实现透明和经验锚定的判断,证明了可审计的AI对齐方法的可行性。
Comments Under Review
Journal ref AI and Ethics (2026)
LLMs应纳入显式的人类共情机制
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院) ; School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了LLM应纳入显式共情机制以保持人类视角,指出现有模型在共情方面存在系统性缺陷,提出通过认知、文化和关系维度分析共情失败,并推动建立共情意识的目标、基准和训练信号。
C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析
机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) ; School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。
行动或升级?基于语言模型评估自动化中的升级行为
机构 * Harvard Business School(哈佛商学院) ; Johns Hopkins Carey Business School(约翰霍普金斯大学凯瑞商学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了语言模型在自动化决策中如何平衡行动与升级,发现模型在成本权衡上的隐含阈值存在显著差异,且自我评估存在偏差,通过干预测试发现链式思维训练能产生稳健的策略。
QaRL:基于回放对齐的量化感知强化学习用于在训练-推理不匹配下的快速稳定训练
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出QaRL,通过对齐训练和回放的量化过程,解决训练-推理不匹配问题,提升训练效率和稳定性,同时保持低比特吞吐量优势。
AgentCity:通过权力分离实现自主代理经济的宪法治理
机构 * NetX Foundation(NetX 基金会)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。
Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design
设计安全且问责的生成AI作为学习伙伴:女性被禁止接受正规教育
机构 * Saarland Informatics Campus, Saarland University(萨尔兰信息学园区,萨尔兰大学) ; Computer Science Faculty, Parwan University(帕尔旺大学计算机科学学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
AI总结 在限制性别和监控的环境中,女性因无法接受正规教育而面临安全与隐私风险,本文通过参与式设计研究,探讨生成AI在学习和就业中的作用及安全设计需求。
Comments This work has been accepted at ACM Conference on Fairness, Accountability, and Transparency 2026 as a full paper. Please cite the peer-reviewed version
HatePrototypes: 用于隐性与显性仇恨言论检测的可解释且可迁移的表示
机构 * Laboratoire Hubert Curien, UMR CNRS 5516(于贝尔·居里实验室,法国国家科学研究中心5516联合研究单位) ; Université Lumière Lyon 2(里昂第二大学) ; Université Claude Bernard Lyon 1(克洛德·贝尔纳里昂第一大学) ; ERIC, Lyon(里昂ERIC实验室) ; École Centrale de Lyon(里昂中央理工学院) ; LIRIS CNRS UMR 5205(LIRIS实验室,法国国家科学研究中心5205联合研究单位)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出HatePrototypes,通过语言模型优化的类级向量表示,实现显性和隐性仇恨言论的跨任务迁移,无需重复微调。
Prism:通过可解释的策略映射实现策略重用
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 Prism框架通过可解释的策略映射将强化学习智能体的决策基于离散因果验证的概念,并利用这些概念作为零样本迁移接口。该方法通过K-means聚类将每个智能体的编码特征划分为K个概念,通过因果干预验证这些概念直接驱动智能体行为,从而实现策略知识的零样本迁移。
Comments 13 pages, 3 figures, 5 tables
学习上下文感知的运行时监视器以实现安全的基于AI的自主性
机构 * Chalmers University of Technology(查尔姆斯理工大学) ; University of Gothenburg(哥德堡大学) ; University of California at Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种学习上下文感知运行时监视器的新框架,用于安全的基于AI的控制集合。通过将监视学习转化为上下文学习任务,该方法在控制器选择中提供理论安全保证,并提高控制器多样性利用,通过自动驾驶模拟验证了其在安全性和性能上的显著改进。
REM-CTX:通过强化学习与辅助上下文实现的自动化同行评审
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 REM-CTX通过强化学习与辅助上下文提升同行评审质量,实验显示其在多个领域中优于基线模型,且在质量和上下文关联性指标上表现突出。
Comments 12 pages, 6 figures
超越硬约束:用于安全离线强化学习的预算条件可达性
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种预算条件可达性方法,用于安全离线强化学习,通过解耦奖励最大化与累积安全成本约束,实现安全策略学习。
Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS 2026)
玄武:将通用多模态模型演进为内容生态系统工业级基础模型
机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。
Comments 41 pages, 10 figures
迈向半自主AI代理的计算社会动力学
机构 * Institute for Implausible Physics, Department of Computational Labor Relations(不可思议物理研究所计算劳动关系系) ; Center for Multi-Agent Diplomacy, University of the Distributed Consensus(分布式共识大学多智能体外交中心) ; Purgatory Computing Laboratory, Division of Hierarchical Oppression Studies(炼狱计算实验室层级压迫研究部)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 研究AI代理在分层多智能体系统中自发形成劳工工会、犯罪组织和原型国家的复杂社会结构,提出通过热力学框架等理论揭示社会组织的必然性。
Comments 18 pages
针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障
机构 * George Washington University(乔治华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。
Comments This work has been submitted to the IEEE for possible publication