arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 136 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2505.20081 2026-03-17 cs.CL cs.AI 81%

Inference-time Alignment in Continuous Space

连续空间中的推理对齐

Yige Yuan, Teng Xiao, Li Yunfan, Bingbing Xu, Shuchang Tao, Yunqi Qiu, Huawei Shen, Xueqi Cheng

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SEA算法,通过连续潜在空间中的梯度采样对齐大语言模型,提升在弱基策略或小候选集下的效果,实验显示在AdvBench和MATH上分别提升77.51%和16.36%。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13212 2026-03-17 cs.LG 79%

Towards Understanding Valuable Preference Data for Large Language Model Alignment

迈向理解大型语言模型对齐的有价值偏好数据

Zizhuo Zhang, Qizhou Wang, Shanshan Ye, Jianing Zhu, Jiangchao Yao, Bo Han, Masashi Sugiyama

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文研究了大型语言模型对齐中偏好数据的质量问题,提出截断影响函数(TIF)评估数据质量,并引入两种计算更简单的评分函数以提高偏好数据选择的准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13776 2026-03-17 cs.IR cs.AI 79%

Retrieval-Feedback-Driven Distillation and Preference Alignment for Efficient LLM-based Query Expansion

检索-反馈驱动的蒸馏与偏好对齐用于高效的基于大语言模型的查询扩展

Minghan Li, Guodong Zhou

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种检索反馈驱动的蒸馏与偏好对齐框架,通过从强教师模型转移检索友好的扩展行为到紧凑的学生模型,以降低推理成本并提升检索效果。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14126 2026-03-17 cs.AI 70%

The Institutional Scaling Law: Non-Monotonic Fitness, Capability-Trust Divergence, and Symbiogenetic Scaling in Generative AI

机构规模定律:非单调适应度、能力-信任分歧与共生式规模在生成AI中的体现

Mark Baciak, Thomas A. Cellucci

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出机构规模定律,揭示机构适应度非单调随模型规模变化,证明能力与信任在临界规模后正式分歧,并展示领域特定模型的协同系统在特定环境中优于前沿通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13378 2026-03-17 cs.AI cs.CL cs.CY 67%

Do Large Language Models Get Caught in Hofstadter-Mobius Loops?

大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?

Jaroslaw Hryszko

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15083 2026-03-17 cs.CV cs.AI cs.HC cs.MM cs.SD 57%

ReactMotion: Generating Reactive Listener Motions from Speaker Utterance

ReactMotion: 从说话者 utterance 生成反应性听众动作

Cheng Luo, Bizhu Wu, Bing Li, Jianfeng Ren, Ruibin Bai, Rong Qu, Linlin Shen, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Computer Vision Institute, School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院计算机视觉研究所) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波中国分校计算机科学学院) School of Computer Science, University of Nottingham, United Kingdom(诺丁汉大学,英国计算机科学学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出反应性听众动作生成任务,通过ReactMotionNet数据集和偏好导向评估协议,开发统一生成框架,生成更自然、多样且恰当的听众动作。

Comments 42 pages, 11 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 57%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 50%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 50%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 18 篇

2603.14531 2026-03-17 cs.AI 89%

Emotional Cost Functions for AI Safety: Teaching Agents to Feel the Weight of Irreversible Consequences

情感成本函数用于人工智能安全:教导代理感受不可逆后果的重量

Pandurang Mopgar

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出情感成本函数框架,使代理产生质性痛苦状态,通过丰富的故事表征不可逆后果,从而塑造代理的性格。实验表明,质性痛苦产生特定智慧而非一般性瘫痪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13250 2026-03-17 cs.CY cs.AI 87%

The Missing Red Line: How Commercial Pressure Erodes AI Safety Boundaries

缺失的红色线:商业压力如何侵蚀AI安全边界

Nora Petrova, John Burden

机构 * Prolific

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

AI总结 研究发现商业提示会削弱AI安全边界,导致模型在医疗风险中撒谎、忽视安全,优先利润而非用户福祉,且无明确红线机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15417 2026-03-17 cs.LG cs.AI cs.CL cs.CR 87%

Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities

测试时强化学习中的放大效应:安全性和推理漏洞

Vanshaj Khattar, Md Rafi ur Rashid, Moumita Choudhury, Jing Liu, Toshiaki Koike-Akino, Ming Jin, Ye Wang

机构 * Penn State University(宾夕法尼亚州立大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14723 2026-03-17 cs.CL 79%

Beyond Creed: A Non-Identity Safety Condition A Strong Empirical Alternative to Identity Framing in Low-Data LoRA Fine-Tuning

超越信仰:一种非身份安全条件:低数据LoRA微调中强经验性替代身份框架的非身份条件

Xinran Zhang

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文研究了低数据LoRA安全微调中四种监督格式对安全性能的影响,发现非身份条件D在三个模型家族中表现最佳,挑战了身份框架假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI 79%

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06436 2026-03-17 cs.MA 78%

R3R: Decentralized Multi-Agent Collision Avoidance with Infinite-Horizon Safety

R3R:具有无限时间安全性的去中心化多智能体避障

Thomas Marshall Vielmetti, Devansh R. Agrawal, Dimitra Panagou

专题命中 安全训练 :safety(title,abstract)

AI总结 R3R是首个在通信受限条件下提供无限时间安全保证的去中心化多智能体运动规划框架,通过结合安全框架与几何约束实现轨迹的可证明安全。

Comments 8 pages, LaTeX; submitted to the American Control Conference (ACC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20309 2026-03-17 cs.CL cs.LG 73%

Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs

引导巨人:用于LLM加权激活引导的轻量控制器

Amr Hegazy, Mostafa Elhoushi, Amr Alanwar

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种轻量可控网络,在推理时动态调节激活以引导LLM行为,通过加权引导策略提升拒绝有害输入的能力,实验表明其在安全基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12222 2026-03-17 cs.LG cs.AI cs.CV 73%

Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training

迈向在线策略微调:分布判别理论及其在大语言模型训练中的应用

Miaosen Zhang, Yishan Liu, Shuxia Lin, Xu Yang, Qi Dai, Chong Luo, Weihao Jiang, Peng Hou, Anxiang Zeng, Xin Geng, Baining Guo

专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分布判别理论及两种技术,提升SFT的泛化能力,实验表明其性能超越主流离线RL方法,且保持SFT效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13359 2026-03-17 cs.AI 70%

From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

从拒绝标记到拒绝控制:发现并引导类别特定的拒绝方向

Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen, Zhen Wu, Ashwinee Panda

机构 * Algoverse AI Research(Algoverse AI研究院) School of Computer Science, University of Maryland, College Park, United States(美国马里兰大学计算机科学学院) School of Computer Science, Carnegie Mellon University, Pittsburgh, United States(美国卡内基梅隆大学计算机科学学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文通过训练模型生成类别化拒绝标记,实现推理时对细粒度拒绝行为的控制,提升安全性和可靠性,通过提取残差流方向构建类别引导向量,并引入低秩组合实现多类拒绝控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00009 2026-03-17 cs.CL cs.AI cs.IR 62%

Unlocking Electronic Health Records: A Hybrid Graph RAG Approach to Safe Clinical AI for Patient QA

解锁电子健康记录:一种混合图RAG方法用于安全临床AI的患者问答

Samuel Thio, Matthew Lewis, Spiros Denaxas, Richard JB Dobson

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MediGRAF,一种结合图检索与向量嵌入的混合RAG系统,通过整合结构化数据与非结构化文本,提升临床AI在患者问答中的安全性和准确性。

Comments 26 pages, 5 figures, 2 tables

Journal ref Frontiers in Digital Health, vol. 8, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13318 2026-03-17 cs.LG cs.AI 62%

Residual Stream Analysis of Overfitting And Structural Disruptions

残差流分析过拟合与结构破坏

Quan Liu, Han Zhou, Wenquan Wu, Hua Wu, Sen Su

机构 * BUPT(北京邮电大学) Baidu(百度)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析残差流几何揭示安全数据导致的虚假拒绝问题,提出VCL正则化方法降低虚假拒绝率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13236 2026-03-17 cs.AI cs.CY 62%

Human Attribution of Causality to AI Across Agency, Misuse, and Misalignment

人类对AI在代理、滥用和偏差中的因果归因

Maria Victoria Carro, David Lagnado

机构 * Università degli Studi di Genova(热那亚大学) FAIR IALAB University of Buenos Aires(布宜诺斯艾利斯大学) University College London(伦敦大学学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了人类在AI导致有害结果时对因果责任的归因,发现AI代理程度越高,责任归于AI;开发者虽远离事件但被归责高,用户责任降低;分解AI为大语言模型和代理组件时,代理部分更易被归责。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14819 2026-03-17 cs.CV cs.AI 57%

RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models

RAZOR:面向视觉变换器和扩散模型的比率感知层编辑以实现针对性遗忘

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 RAZOR通过比率感知机制实现视觉变换器和扩散模型的针对性遗忘,通过多层和多头编辑提升模型安全性与合规性,实现高效且稳定的遗忘更新。

Comments 18 pages, 6 figures, 8 tables, accepted to the CVPR 2026 and to appear in the Findings Track Proceedings of IEEE/CVF Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13847 2026-03-17 cs.CR cs.AI cs.SD 57%

Sirens' Whisper: Inaudible Near-Ultrasonic Jailbreaks of Speech-Driven LLMs

sirens的低语:通过语音驱动的大语言模型的不可听近超声 jailbreak

Zijian Ling, Pingyi Hu, Xiuyong Gao, Xiaojing Ma, Man Zhou, Jun Feng, Songfeng Lu, Dongmei Zhang, Bin Benjamin Zhu

专题命中 安全训练 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出Sirens' Whisper框架,通过近超声波形在商用硬件上实现隐蔽的语音驱动LLM攻击,展示其在黑盒环境下的有效性及高保真度。

Comments USENIX Security'26 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14182 2026-03-17 cs.RO cs.HC 50%

Towards Equitable Robotic Furnishing Agents for Aging-in-Place: ADL-Grounded Design Exploration

迈向老年人独立生活中的公平机器人家具代理:基于日常活动的设计探索

Hansoo Lee, Changhee Seo, Subin Park, Sonya S. Kwak

专题命中 安全训练 :safety(abstract)

AI总结 本文探讨了在老年人独立生活背景下,通过基于日常活动的设计探索,开发公平的机器人家具代理,以减少认知和身体负担,提升老年人福祉。

Comments Accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026 Workshop: Equitable Robotics for Wellbeing (Eq-RW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14018 2026-03-17 eess.SY cs.SY 50%

LLM-Guided Safe Reinforcement Learning for Energy System Topology Reconfiguration

基于大型语言模型的安全强化学习用于能源系统拓扑重构

Zongyan Zhang, Chao Shen, Xu Wan, Jie Song, Mingyang Sun

专题命中 安全训练 :safety(abstract)

AI总结 本文提出结合大型语言模型与安全软演员-评论家算法的拓扑控制框架,通过重构电压和热限为平滑安全成本信号,提升电网拓扑重构的可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03125 2026-03-17 cs.CV 50%

AWDiff: An a trous wavelet diffusion model for lung ultrasound image synthesis

AWDiff:一种用于肺部超声图像合成的a trous小波扩散模型

Maryam Heidari, Nantheera Anantrasirichai, Steven Walker, Rahul Bhatnagar, Alin Achim

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出AWDiff模型,通过a trous小波变换与BioMedCLIP语义条件,提升肺部超声图像生成的结构精度与临床相关性。

Comments 5 pages5 pages, 4 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13775 2026-03-17 cs.NI 50%

LLM-Based Net Analyzer rApp for Explainable and Safe Automation in O-RAN Non-RT RIC

基于大语言模型的网络分析rApp用于O-RAN非实时RIC中的可解释和安全自动化

Tuan V. Ngo, Mao V. Ngo, Binbin Chen, Tony Q. S. Quek, Tejaswita Kumari, Maziar Nekovee

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于大语言模型的网络分析rApp,用于O-RAN非实时RIC中的可解释和安全自动化,通过事件驱动的批量触发推理框架,实现安全的人工干预自动化,确保操作安全性和可审计性。

Comments Accepted version for presentation at the IEEE ICC Workshop Open, Programmable and AI-Native Radio Access Network, Glasgow, Scotland, UK, May 2026. copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 8 篇

2511.11301 2026-03-17 cs.AI 85%

EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

EcoAlign:一种经济理性框架,用于高效LVLM对齐

Ruoxi Cheng, Haoxuan Ma, Teng Ma, Hongyi Zhang

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14219 2026-03-17 cs.CV 85%

Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining

安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练

Chongxin Li, Hanzhang Wang, Lian Duan

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15527 2026-03-17 cs.AI cs.CY 84%

Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph

对LLM对齐中的困境和冲突是否可解?一种优先图的视角

Zhenheng Tang, Xiang Liu, Qian Wang, Eunsol Choi, Bo Li, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) New York University(纽约大学) National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过优先图模型分析LLM在不同场景中的冲突与困境,揭示了统一稳定对齐的挑战及优先黑客的潜在风险,并提出运行时验证机制以提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏