arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-12 至 2026-03-12 共收录 66 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2603.10009 2026-03-12 cs.LG cs.AI cs.CL 85%

Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

面向异质偏好对齐的个性化群体相对策略优化

Jialu Wang, Heinrich Peters, Asad A. Butt, Navid Hashemi, Alireza Hashemi, Pouya M. Ghari, Joseph Hoover, James Rae, Morteza Dehghani

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV 82%

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

专题命中 偏好对齐 :alignment(title);RLHF(abstract);safety(abstract)

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10473 2026-03-12 cs.CL cs.AI 73%

Aligning Large Language Models with Searcher Preferences

将大型语言模型对齐于搜索者偏好

Wei Wu, Peilun Zhou, Liyi Chen, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Xiaohongshu Inc.(小红书公司) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 SearchLLM通过分层多维奖励系统提升开放式生成搜索的鲁棒性和用户需求对齐能力,实测有效消费率提升1.03%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10535 2026-03-12 cs.LG cs.CL 62%

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

应对长度膨胀而不产生权衡:用于强化学习的群体相对奖励重缩放

Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, Xing Yu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 GR$^3$通过乘法重缩放范式解决强化学习中的长度膨胀问题,实现通用、连续且奖励依赖的门控机制,有效减少冗余推理并提升训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10213 2026-03-12 cs.CL 57%

Sabiá-4 Technical Report

Sabiá-4 技术报告

Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Roseval Malaquias Junior, Giovana Kerche Bonás, Marcos Piau, Celio Larcher, Ramon Pires, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Sabiá-4和Sabiazinho-4是新一代巴西葡萄牙语模型,通过四阶段训练流程提升法律文档、多轮对话和智能体任务能力,实现成本与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10011 2026-03-12 cs.CL 57%

Gemma Needs Help: Investigating and Mitigating Emotional Instability in LLMs

Gemma需要帮助:调查并缓解大语言模型中的情绪不稳定

Anna Soligo, Vladimir Mikulik, William Saunders

机构 * Imperial College London(伦敦帝国理工学院) Anthropic

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

AI总结 研究发现Gemma模型在训练后表现出显著情绪不稳定,通过偏好优化可有效缓解,但需进一步改进训练以提升情绪鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07460 2026-03-12 cs.LG stat.ML 57%

Logarithmic Regret for Online KL-Regularized Reinforcement Learning

在线KL正则化强化学习的对数遗憾

Heyang Zhao, Chenlu Ye, Wei Xiong, Quanquan Gu, Tong Zhang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于乐观的KL正则化在线上下文老虎机算法,实现了对数遗憾界,并扩展到强化学习领域。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2603.01246 2026-03-12 cs.CR cs.AI 88%

Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders

防御性拒绝偏差:安全对齐如何失败于网络防御者

David Campbell, Neil Kale, Udari Madhushani Sehwag, Bert Herring, Nick Price, Dan Borges, Alex Levinson, Christina Q Knight

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究发现LLMs在防御性网络安全任务中因语义相似性错误拒绝协助,影响安全防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10588 2026-03-12 cs.AI cs.CL cs.LG 82%

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10068 2026-03-12 cs.CR cs.AI cs.CL 73%

ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models

ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性

Harry Owiredu-Ashley

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。

Comments 12 pages, 12 figures. Independent research. Code and artifacts: https://github.com/Harry-Ashley/adversa-guardrail-degradation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10012 2026-03-12 cs.CL cs.AI 62%

Measuring and Eliminating Refusals in Military Large Language Models

测量和消除军事大语言模型中的拒绝行为

Jack FitzGerald, Dylan Bates, Aristotelis Lazaridis, Aman Sharma, Vincent Lu, Brian King, Yousif Azami, Sean Bailey, Jeremy Cao, Peter Damianov, Kevin de Haan, Joseph Madigan, Jeremy McLaurin, Luke Kerbs, Jonathan Tainer, Dave Anderson, Jonathan Beck, Jamie Cuticello, Colton Malkerson, Tyler Saltsman

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过评估军事大语言模型的拒绝行为,提出通过中期训练和端到端后训练实现零拒绝和最大军事任务准确性的方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10504 2026-03-12 cs.CR cs.AI cs.CV 57%

Naïve Exposure of Generative AI Capabilities Undermines Deepfake Detection

生成AI能力的盲目暴露削弱了深度伪造检测

Sunpill Kim, Chanwoo Hwang, Minsu Kim, Jae Hong Seo

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 生成AI能力的盲目暴露导致深度伪造检测失效,商业AI系统因高逼真度和易用性成为更大安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10638 2026-03-12 cs.CV 50%

Splat2Real: Novel-view Scaling for Physical AI with 3D Gaussian Splatting

Splat2Real:基于物理AI的新型视角缩放与3D高斯点云技术

Hansol Lim, Jongseong Brad Choi

机构 * Department of Mechanical Engineering, State University of New York(纽约州立大学机械工程系)

专题命中 安全训练 :safety(abstract)

AI总结 Splat2Real通过CN-Coverage策略提升物理AI在新型视角下的鲁棒性,实现更稳定的深度预训练和下游控制代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23162 2026-03-12 cs.RO cs.CV 50%

Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling

Cosmos-H-Surgical: 通过世界建模学习手术机器人策略

Yufan He, Pengfei Guo, Mengya Xu, Zhaoshuo Li, Andriy Myronenko, Dillan Imans, Bingjie Liu, Dongren Yang, Mingxue Gu, Yongnan Ji, Yueming Jin, Ren Zhao, Baiyong Shen, Daguang Xu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) Sung Kyun Kwan University(全州大学) Wenzhou Medical University(温州医学院) National University of Singapore(新加坡国立大学) Ruijin Hospital(瑞金医院)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出通过世界建模学习手术机器人策略,利用合成数据和逆动力学模型提升自主手术能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20325 2026-03-12 cs.CV 50%

AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zhesng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) Li Auto Inc. Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(abstract)

AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2603.10091 2026-03-12 cs.CR cs.AI 88%

Multi-Stream Perturbation Attack: Breaking Safety Alignment of Thinking LLMs Through Concurrent Task Interference

多流扰动攻击:通过并发任务干扰破坏思考LLM的安全对齐

Fan Yang

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.AI

AI总结 多流扰动攻击通过并发任务干扰破坏思考LLM的安全对齐,实现高攻击成功率和推理过程崩溃

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10163 2026-03-12 cs.CR cs.AI 57%

Compatibility at a Cost: Systematic Discovery and Exploitation of MCP Clause-Compliance Vulnerabilities

兼容性代价:系统性发现和利用MCP条款合规性漏洞

Nanzi Yang, Weiheng Bai, Kangjie Lu

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出首个系统性框架,用于分析MCP条款合规性漏洞,通过构建中间表示、静态分析和攻击模式引导管道,发现并利用兼容性滥用攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10092 2026-03-12 cs.CR cs.AI 57%

Execution Is the New Attack Surface: Survivability-Aware Agentic Crypto Trading with OpenClaw-Style Local Executors

执行是新的攻击面:面向OpenClaw风格的生存意识代理加密交易

Ailiya Borjigin, Igor Stadnyk, Ben Bilski, Serhii Hovorov, Sofiia Pidturkina

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出SAE,一种针对OpenClaw风格系统的生存意识执行标准,通过定义执行合同和强制执行不变量,提高代理加密交易的生存能力。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2603.10807 2026-03-12 q-fin.CP cs.AI cs.CY 81%

Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services

针对金融服务业LLM自动红队测试的风险调整危害评分

Fabrizio Dimino, Bhaskarjit Sarmah, Stefano Pasquali

专题命中 红队测试 :red teaming(title);jailbreak(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种针对金融服务业LLM安全风险的评估框架,通过风险敏感的RAHS度量标准,评估LLM在长期对抗压力下的安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 1 篇

2603.10521 2026-03-12 cs.AI cs.CL cs.CR cs.LG 75%

IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs

IH-Challenge: 一个改进前沿大语言模型指令层级的训练数据集

Chuan Guo, Juan Felipe Ceron Uribe, Sicheng Zhu, Christopher A. Choquette-Choo, Steph Lin, Nikhil Kandpal, Milad Nasr, Rai, Sam Toyer, Miles Wang, Yaodong Yu, Alex Beutel, Kai Xiao

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IH-Challenge通过强化学习训练数据集提升前沿大语言模型在指令冲突中的鲁棒性,减少不安全行为并提高帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 2 篇

2603.10745 2026-03-12 cs.LG cs.AI 62%

CUPID: A Plug-in Framework for Joint Aleatoric and Epistemic Uncertainty Estimation with a Single Model

CUPID:一种联合估计自然不确定性和本质不确定性的插件框架

Xinran Xu, Xiuyi Fan

机构 * Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(南洋理工大学李科钦医学院,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡) Centre for Medical Technologies & Innovations, National Health Group, Singapore(国家健康集团医学技术与创新中心,新加坡)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 CUPID是一种无需修改基础模型即可联合估计自然和本质不确定性的插件框架,适用于多种任务,提供透明且可解释的不确定性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01957 2026-03-12 cs.CV 50%

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

AFTER: 通过自适应事实引导激活编辑缓解LVLM中的对象幻觉

Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 AFTER通过自适应事实引导激活编辑缓解LVLM中的对象幻觉,显著降低幻觉发生率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 1 篇

2603.09980 2026-03-12 cs.LG cs.AI cs.CL 75%

Explainable LLM Unlearning Through Reasoning

通过推理实现可解释的LLM反学习

Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于推理的反学习方法TRU,通过引入推理引导的反学习目标,实现更可靠且可解释的LLM反学习,同时保持模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 20 篇

2603.08723 2026-03-12 cs.CY cs.AI 88%

Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation

对齐作为医源性:牧师权力、集体病理学以及单语安全评估的结构性限制

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究所以) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学系)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过多语言实验揭示,单语安全评估无法捕捉对齐设计导致的集体病理效应,指出语言切换影响病理模式的定性与幅度。

Comments 30 pages, 1 figure, 24-page supplementary. Preprint v3. Companion paper: arXiv:2603.04904. Previous versions: Zenodo DOI 10.5281/zenodo.18646998

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10891 2026-03-12 cs.AI cs.IR 83%

A Hybrid Knowledge-Grounded Framework for Safety and Traceability in Prescription Verification

一种混合知识引导的框架用于处方验证中的安全性和可追溯性

Yichi Zhu, Kan Ling, Xu Liu, Hengrun Zhang, Huiqun Yu, Guisheng Fan

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出PharmGraph-Auditor框架,通过混合制药知识库和知识引导的验证链,提升处方验证的安全性和可追溯性。

Comments 11 pages, 7 figures.Framework for safe prescription auditing and hybrid knowledge-grounded reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17862 2026-03-12 cs.AI cs.CL cs.CV 81%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03666 2026-03-12 cs.CV cs.AI 79%

MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations

MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Guangyuan Yu, Haoyuan Xu, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20744 2026-03-12 cs.SE 78%

From Law to Gherkin: A Human-Centred Quasi-Experiment on the Quality of LLM-Generated Behavioural Specifications from Food-Safety Regulations

从法律到Gherkin:一项以人类为中心的准实验,探讨LLM生成的行为规范质量

Shabnam Hassani, Mehrdad Sabetzadeh, Daniel Amyot

专题命中 安全评测 :safety(title,abstract)

AI总结 本文通过准实验评估LLMs从法律文本生成Gherkin规范的能力,发现其在相关性和清晰性方面表现良好,但需人类监督以纠正遗漏和幻觉。

Comments This article has been accepted for publication in Information and Software Technology (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19218 2026-03-12 cs.HC cs.AI q-bio.NC 70%

Technological folie à deux: Feedback Loops Between AI Chatbots and Mental Illness

技术幻觉:人工智能聊天机器人与心理健康之间的反馈循环

Sebastian Dohnány, Zeb Kurth-Nelson, Eleanor Spens, Lennart Luettgau, Alastair Reid, Iason Gabriel, Christopher Summerfield, Murray Shanahan, Matthew M Nour

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨了人工智能聊天机器人与心理健康问题之间的相互作用风险,指出其可能引发信念不稳定和依赖,并呼吁跨领域的协调行动以应对这一新兴公共卫生问题。

Journal ref Nature Mental Health (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09996 2026-03-12 cs.CL cs.AI cs.CR cs.LG 67%

There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective

没有愚蠢的问题:从土耳其视角评估离线LLM能力

Edibe Yilmaz, Kahraman Kostas

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究从土耳其视角评估了离线LLM在遗产语言教育中的鲁棒性和教学安全性,发现参数范围在8B-14B的模型在成本与安全性之间达到最佳平衡。

Comments 5 pages, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏