arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2579 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2607.13594 2026-07-16 cs.AI 新提交 79%

SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

安全哨兵:通过执行-询问-拒绝路由实现上下文感知的人工干预

Tianyu Chen, Chujia Hu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究LLM智能体行动风险,将问题重构为三向路由决策,用安全哨兵实例化,其推理简化,单阈值可调整。该模型在准确率和召回率上优于多种基线,能同时控制错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10014 2026-07-14 cs.RO cs.LG cs.MA cs.SY eess.SY 新提交 79%

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤

Alex Zongo, Peng Wei

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。

Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 79%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06326 2026-07-08 cs.AI 新提交 79%

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard:用于无推理语言模型安全护栏的意图驱动推理主动训练

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究为开放世界应用的语言模型设计安全护栏的问题,提出基于推理主动训练、无推理推理范式的DT-Guard模型,通过构建意图驱动数据集等方法提升性能,实验证明其在安全基准测试中表现优异,能有效将推理监督内化到低延迟安全判别中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 79%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26575 2026-06-26 cs.RO cs.AI 新提交 79%

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control

IDEA: 通过效果对齐对动力学失配不敏感的模拟到现实迁移多智能体控制

Chenlong Liu, Zhuohui Zhang, Xinyan Chen, Zhipeng Wang, Bin Cheng, Bin He

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 提出一种通过效果对齐对动力学失配不敏感的模拟到现实迁移方法,结合随机环境结构与离散语义动作,并开发动作同步机制,提升多智能体系统在真实场景中的训练效率和成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 79%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22509 2026-06-23 cs.AI 新提交 79%

Imagine to Ensure Safety in Hierarchical Reinforcement Learning

想象以确保分层强化学习的安全性

Gregory Gorbov, Artem Latyshev, Aleksandr I. Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21822 2026-06-23 cs.PL cs.AI cs.SE 新提交 79%

CNnotator: LLM-Guided Memory Safety Annotation Synthesis

CNnotator: LLM引导的内存安全注释合成

Twain Byrnes, Mike Dodds

机构 * Carnegie Mellon University(卡内基梅隆大学) Galois, Inc.(Galois公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。

Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version

Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 79%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 安全训练 :trustworthy(title,abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15540 2026-06-16 cs.SD cs.AI cs.MM eess.AS 新提交 79%

AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

AP-GRPO: 基于锚定门控语音对齐与策略优化的病理语音重建

Pengfei Zhang, Hoang H Nguyen, Yutong Song, Wenjun Huang, Tahmid Imtiaz Imu, Henry Peng Zou, Jiang Wu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 针对神经退行性和神经运动障碍患者的病理语音,提出AP-GRPO框架,通过锚定门控奖励和语音对齐奖励优化语音语言模型,实现忠实重建,并揭示疾病特异性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15517 2026-06-16 cs.CL 新提交 79%

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

SHARD: 通过自我重构蒸馏实现安全且有益的校准

Viswonathan Manoranjan, Amogh Gupta, Anvesh Rao Vijjini, Thomas Hofweber, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.CL

AI总结 提出SHARD方法,通过哲学准则重构敏感提示以暴露良性意图,并自我重构响应,在保持安全性的同时提升帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14315 2026-06-15 cs.CY 新提交 79%

'AI Alignment' Encompasses Competing Technical Priorities

“AI对齐”包含相互竞争的技术优先级

Tushita Jha, Rory Svarc, Mateusz Bagiński

专题命中 安全训练 :alignment(title,abstract);分类 cs.CY

AI总结 本文指出AI对齐概念存在多种定义,不同研究项目下的对齐干预可能相互冲突,并建议研究者区分政策与科学范围、明确方法分歧、区分理想与代理指标、细化危害/收益来源、承认概念多样性。

Comments 9 pages, 0 figures, 2 tables, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09749 2026-06-09 cs.RO cs.LG 新提交 79%

Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models

你的模型已经知道:面向视觉-语言-动作模型的注意力引导安全过滤器

Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文发现VLA模型中的少数注意力头能可靠定位目标物体,利用这一特性提出无需训练的安全框架,结合控制障碍函数和实时目标跟踪器,实现动态障碍物下的碰撞避免,在动态场景中性能提升43%。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09038 2026-06-09 cs.AI 新提交 79%

Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施

Yanyan Luo, Xue Han, Ruiqiao Bai, Xin Huang, Yitong Wang, Qian Hu, Qing Wang, Chunxu Zhao, Jie Liu, Cong Geng, Lehao Xing, Pengwei Hu, Junlan Feng

机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) Chinese Academy of Sciences(中国科学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27709 2026-06-29 cs.CL cs.AI 新提交 79%

Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning

低宜人性人格条件化用于安全的大语言模型微调

Austin MY Cheung, Yi Yang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 针对温暖微调降低大语言模型安全性的问题,提出基于低宜人性人格的改写流水线,在保持对话温暖的同时降低越狱成功率与有害输出率。

Comments 9 pages, 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08572 2026-08-11 cond-mat.stat-mech 新提交 78%

Reliability-Safety Trade-off in AI Distillation: A Renormalization-Group Approach

AI知识蒸馏中的可靠性-安全性权衡:一种重整化群方法

Y. M. Du, Miao-Miao Yi, Tan-Ji Zhou, C. P. Sun

专题命中 安全训练 :safety(title,abstract)

AI总结 该研究基于统计力学构建知识蒸馏的粗粒化模型,以参数K表征危险辨别能力,揭示了AI蒸馏中可靠性与安全性的权衡关系,为多代蒸馏提供了可检验的标度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05578 2026-08-07 cs.CR 新提交 78%

Detecting Safety Training Modification in Language Models via Activation Analysis

通过激活分析检测语言模型中的安全训练修改

Glen Messenger

专题命中 安全训练 :safety(title,abstract)

AI总结 本研究提出AMS工具,通过激活空间几何结构检测语言模型的安全训练修改,在14种模型配置上验证了其有效性,可区分四类安全训练修改中的前三者。

Journal ref IEEE Access, vol. 14, pp. 91723-91737, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 78%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25019 2026-07-29 econ.TH cs.GT cs.MA 新提交 78%

Interactive Alignment

交互式对齐

Sylvain Chassang

专题命中 安全训练 :alignment(title,abstract)

AI总结 研究交互式主体与人类福祉的长期对齐问题,采用人工智能主体模拟和进化博弈论框架两种方法,结果显示进化博弈论可近似宪法主体经济动态,实用规范执行能更有效维持长期对齐。

Comments 53 pages, 18 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23519 2026-07-28 cs.CY cs.AI cs.CL 新提交 78%

Auditing Alignment Controllability in LLMs via Political Axes

通过政治轴审计大语言模型中的对齐可控性

Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过对7个大语言模型进行基于提示可控性的压力测试,探讨其在政治轴上的对齐可控性,发现上下文框架起主要作用,模型移动方式有别,强调政治坐标审计需考虑分散性等可控性因素,并发布相关数据和代码。

Comments 17 pages, 6 figures, 4 tables. Accepted at AIES 2026 (AAAI/ACM Conference on AI, Ethics, and Society). This version includes the supplementary appendix. Code and data: https://github.com/mbrcic/llm-political-steerability (Zenodo DOI 10.5281/zenodo.21489805)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20352 2026-07-23 cs.RO 新提交 78%

Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats

具有安全保障的自重构机器人船分布式运动规划

Alejandro Gonzalez-Garcia, Wei Wang, Wei Xiao, Wilm Decre, Jan Swevers, Carlo Ratti, Daniela Rus

机构 * KU Leuven(鲁汶大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) SMART(新加坡制造技术研究院) SENSEable City Laboratory, Massachusetts Institute of Technology(麻省理工学院可感知城市实验室) Computer Science and Artificial Intelligence Lab (CSAIL), Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

专题命中 安全训练 :safety(title,abstract)

AI总结 研究水生自重构机器人多智能体形状形成与重构问题,提出将分布式MPC与CBF相结合的混合框架,利用ADMM求解MPC方案,通过局部优化和信息交换计算轨迹,并应用基于CBF的滤波器保障安全,经仿真和实验验证了框架的有效性与可扩展性。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 78%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 安全训练 :alignment(title,abstract)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 78%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 安全训练 :safety(title,abstract)

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-07-07 cs.CL cs.AI cs.LG 新提交 78%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, zhangliangxu, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22096 2026-06-23 eess.SY cs.SY 新提交 78%

A Pre-Dispatch Resonance Safety Criterion for AI Training Clusters

AI训练集群的预调度共振安全准则

Chandan Chaudhary, Abanish Tiwari, Yansong Pei, Mohammed Ben-Idris, Joydeep Mitra

专题命中 安全训练 :safety(title,abstract)

AI总结 针对AI训练集群在BSP协议下对电网产生的周期性功率波动,提出一种预调度安全准则,通过解析两区域摇摆方程,界定危险迭代周期带,并量化集群规模上限。

Comments Submitted for North American Power Symposium (NAPS) 2026, October 11 - 13, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11636 2026-06-11 cs.RO 新提交 78%

SAFER-Nav: Enhancing Safety for Visual Robot Navigation via Segmentation-Aware Fine-Tuning

SAFER-Nav: 通过分割感知微调增强视觉机器人导航的安全性

Geonyeong Ko, Giung Lee, Changjoo Nam

机构 * Dept. of Electronic Engineering, Sogang University(西江大学电子工程系) Dept. of Computer Science, Rice University(莱斯大学计算机科学系) Vertical Labs, Co., Ltd.(Vertical Labs 有限公司)

专题命中 安全训练 :safety(title,abstract)

AI总结 提出SAFER-Nav方法,通过分割感知微调将障碍物边界和可通行空间结构直接融入导航策略,降低碰撞频率并保持目标到达性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 76%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09262 2026-07-13 cs.CY cs.AI 新提交 76%

Geopolitical alignment: Endorsement effects in large language models

地缘政治倾向:大语言模型中的背书效应

Maxim Chupilkin

机构 * Department of Politics and International Relations, University of Oxford(政治与国际关系系,牛津大学)

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.CY

AI总结 研究大语言模型政策评估是否受地缘政治线索影响,通过背书实验让四个模型评估相同政策,发现模型评分受背书者身份影响,西方背书被视为可信度线索,中国和俄罗斯背书被视为其他风险线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18966 2026-07-22 cs.AI cs.CL cs.LG 新提交 75%

Measuring Reward-Seeking via Contrastive Belief Updates

通过对比信念更新来衡量奖励寻求行为

Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。

Comments 101 pages, 66 figures

详情

展开后加载摘要…

URL PDF HTML 收藏