arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-20 至 2026-03-20 共收录 64 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2603.18507 2026-03-20 cs.AI 83%

Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM

专家人设提升LLM对齐但损害准确性:基于PRISM的意图驱动人设路由 Bootstrapping

Zizhao Hu, Mohammad Rostami, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了专家人设在不同任务类型和提示长度下的有效性,提出PRISM框架通过自蒸馏实现意图条件的人设路由,提升生成任务的人类偏好对齐,同时保持判别任务的准确性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18736 2026-03-20 cs.LG cs.AI cs.CL stat.ML 82%

CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks

CausalRM:基于观察性用户反馈的因果理论奖励建模用于RLHF

Hao Wang, Licheng Pan, Zhichao Chen, Chunyuan Zheng, Zhixuan Chu, Xiaoxi Li, Yuan Lu, Xinggao Liu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) Zhejiang University(浙江大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CausalRM框架,通过因果理论处理观察性用户反馈中的噪声和偏见问题,提升RLHF任务性能,实验显示在WildGuardMix和HarmBench上分别提升49.2%和32.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18411 2026-03-20 cs.CL cs.AI cs.LG 82%

TARo: Token-level Adaptive Routing for LLM Test-time Alignment

TARo: 令牌级自适应路由用于大语言模型测试时间对齐

Arushi Rai, Qiang Zhang, Hanqing Zeng, Yunkai Zhang, Dipesh Tamboli, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang

机构 * Meta University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TARo通过令牌级自适应路由在推理时引导冻结的LLM进行结构化推理,提升推理性能达22.4%,并在医疗和指令遵循任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18008 2026-03-20 cs.CL cs.AI cs.CY 82%

TherapyGym: Evaluating and Aligning Clinical Fidelity and Safety in Therapy Chatbots

TherapyGym: 评估和对齐疗法聊天机器人中的临床忠实性与安全性

Fangrui Huang, Souhad Chbeir, Arpandeep Khatua, Sheng Wang, Sijun Tan, Kenan Ye, Lily Bailey, Merryn Daniel, Ryan Louie, Sanmi Koyejo, Ehsan Adeli

机构 * Department of Computer Science, Stanford University, Stanford, CA, USA(计算机科学系,斯坦福大学,斯坦福,加州,美国) Department of Psychiatry and Behavioral Sciences, Stanford University, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学,斯坦福,加州,美国) Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(生物医学数据科学系,斯坦福大学,斯坦福,加州,美国) University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加州,美国) The University of Hong Kong, Hong Kong(香港大学,香港)

专题命中 偏好对齐 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 TherapyGym通过评估和提升疗法聊天机器人中的忠实性与安全性,结合CTRS评分和多标签标注方案,利用RL训练框架改进模型性能,提升临床应用的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19182 2026-03-20 cs.AI cs.CL 73%

Box Maze: A Process-Control Architecture for Reliable LLM Reasoning

迷宫盒子:一种用于可靠大语言模型推理的过程控制架构

Zou Qiang

机构 * Independent Researcher(独立研究者)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Box Maze框架,通过内存 grounding、结构化推理和边界约束三层结构提升LLM推理可靠性,实验显示其在对抗性场景中显著降低边界失效率。

Comments 10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI 70%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18258 2026-03-20 cs.LG cs.AI 62%

Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization

在对数空间中进行锐度感知最小化以高效提升直接偏好优化

Haocheng Luo, Zehang Deng, Thanh-Toan Do, Mehrtash Harandi, Dinh Phung, Trung Le

机构 * Monash University(墨尔本大学) Swinburne University of Technology(斯威本科技大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出logits-SAM方法,通过在对数空间中建模坐标动态,缓解直接偏好优化中的挤压效应,提升模型性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18606 2026-03-20 cs.SE 50%

SQL-Commenter: Aligning Large Language Models for SQL Comment Generation with Direct Preference Optimization

SQL-Commenter: 通过直接偏好优化对齐大型语言模型以生成SQL注释

Lei Yu, Peng Wang, Jingyuan Zhang, Xin Wang, Jia Xu, Li Yang, Changzhi Deng, Jiajia Ma, Fengjun Zhang

专题命中 偏好对齐 :DPO(abstract)

AI总结 本文提出SQL-Commenter,通过构建复杂SQL查询数据集、持续预训练和直接偏好优化,提升SQL注释生成的准确性和质量,在Spider和Bird基准测试中优于现有方法。

Comments Accepted to ICPC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2508.04904 2026-03-20 cs.HC 78%

Toward Scalable Patient Safety Training: A Prototype for Root Cause Analysis Simulation With AI Virtual Avatars

迈向可扩展的患者安全培训:一种基于AI虚拟仿真的根因分析原型

Yuqi Hu, Qiwen Xiong, Zhenzhen Qin, Brandon Watanabe, Yujing Wang, Mirjana Prpa, Ilmi Yoon

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种AI驱动的仿真平台,通过根因分析模拟提升患者安全培训的可扩展性,利用虚拟角色和AI技术实现沉浸式学习,降低培训成本。

Comments This works has been accepted at the 2026 IEEE Conference on Artificial Intelligence, where a revised version of this work will be published

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 70%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19152 2026-03-20 cs.CL cs.AI 62%

VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models

VEPO:用于低资源语言基础模型的变量熵策略优化

Chonghan Liu, Yimin Du, Qi An, Xin He, Cunqi Zhai, Fei Tan, Weijia Lin, Xiaochun Gong, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VEPO,通过强化学习可验证奖励整合确定性结构约束,提升低资源语言的分词效率和翻译质量。

Comments 23 pages. Includes figures and tables. Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18326 2026-03-20 cs.LG 57%

Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration

摆脱离线悲观主义:用于安全前沿探索的向量场奖励塑造

Amirhossein Roknilamouki, Arnob Ghosh, Eylem Ekici, Ness B. Shroff

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出向量场奖励塑造方法,通过梯度对齐和旋转向量项诱导持续安全前沿探索,验证了在连续导航任务中有效平衡安全与信息收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15978 2026-03-20 cs.AI 57%

From Workflow Automation to Capability Closure: A Formal Framework for Safe and Revenue-Aware Customer Service AI

从工作流自动化到能力闭合:一种安全且收益意识的客户服务AI形式框架

Cosimo Spera

机构 * Minerva CQ

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种形式框架,用于安全且收益意识的客户服务AI,解决自动化转型中安全缺口问题,通过动态组合能力实现安全目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19170 2026-03-20 cs.RO math.OC 50%

ADMM-Based Distributed MPC with Control Barrier Functions for Safe Multi-Robot Quadrupedal Locomotion

基于ADMM的分布式MPC与控制屏障函数用于安全多机器人四足运动

Yicheng Zeng, Ruturaj S. Sambhus, Basit Muhammad Imran, Jeeseop Kim, Vittorio Pastore, Kaveh Akbari Hamed

机构 * Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系) The University of Texas at El Paso(德克萨斯理工大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于ADMM的去中心化MPC框架,结合控制屏障函数约束,用于多机器人腿部系统的安全轨迹规划。通过节点-边分割公式与共识约束,将全局问题分解为独立二次规划问题,实现高效去中心化优化,提升实时性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18658 2026-03-20 eess.SY cs.SY 50%

Mean-field control barrier functions for stochastic multi-agent systems

均场控制屏障函数用于随机多智能体系统

Cinzia Tomaselli, Gian Carlo Maffettone, Samy Wu Fung, Levon Nurbekyan, Mario di Bernardo

专题命中 安全训练 :safety(abstract)

AI总结 本文提出均场控制屏障函数,用于保障随机多智能体系统安全,通过稳定性分析和数值模拟验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09490 2026-03-20 econ.TH 50%

Robust Trust

稳健的信任

Piotr Dworczak, Alex Smolin

专题命中 安全训练 :alignment(abstract)

AI总结 研究者分析了在信息不对称情况下,代理人如何根据私人信息和可能有偏见的顾问建议做出稳健决策,通过信任区域政策最大化最坏情况下的预期收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18059 2026-03-20 cs.CR cs.SE 50%

Guardrails as Infrastructure: Policy-First Control for Tool-Orchestrated Workflows

护栏作为基础设施:面向工具编排工作流的政策优先控制

Akshey Sigdel, Rista Baral

专题命中 安全训练 :safety(abstract)

AI总结 本文提出Policy-First Tooling,通过显式约束、风险感知门控等机制提升工具调用安全性,实验显示其在减少违规行为和降低重试放大方面效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02009 2026-03-20 cs.DC 50%

STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds

STRATUS:一种用于现代云服务自主可靠性工程的多智能体系统

Yinfang Chen, Jiaqi Pan, Jackson Clark, Yiming Su, Noah Zheutlin, Bhavya Bhavya, Rohan Arora, Yu Deng, Saurabh Jha, Tianyin Xu

专题命中 安全训练 :safety(abstract)

AI总结 本文提出STRATUS,一种基于LLM的多智能体系统,用于实现云服务的自主SRE。系统通过状态机组织多个专用智能体,提升故障检测、诊断和缓解的效率,并通过Transactional No-Regression规范提高自主故障缓解的成功率。

Comments 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2601.10971 2026-03-20 cs.CR cs.CL 83%

AJAR: Adaptive Jailbreak Architecture for Red-teaming

AJAR:适应性突破架构用于红队测试

Yipu Dou, Wang Yang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 AJAR框架通过可调用MCP服务实现多轮突破算法,提升X-Teaming攻击成功率至76.0%,并在工具访问下优化攻击面。

Comments 7 pages, 3 figures. Code and data available at https://github.com/douyipu/ajar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11149 2026-03-20 cs.LG cs.CR 79%

Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models

大语言模型中越狱攻击的系统缩放分析

Xiangwen Wang, Ananth Balashankar, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 本文系统分析了大语言模型中越狱攻击的缩放规律,通过计算限制优化过程评估不同方法、模型家族和危害类型的攻击成功率,发现提示基方法在计算效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16137 2026-03-20 cs.CL 77%

SIA: A Synthesize-Inject-Align Framework for Knowledge-Grounded and Secure E-commerce Search LLMs with Industrial Deployment

SIA:一种用于知识引导和安全的电子商务搜索LLM的合成-注入-对齐框架

Zhouwei Zhai, Mengxiang Chen, Anmeng Zhang

机构 * Beijing China(中国北京)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出SIA框架,通过合成高质量语料库、参数高效预训练和双路径对齐方法,解决电子商务搜索LLM的知识幻觉和安全漏洞问题,并在京东实现工业部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11132 2026-03-20 cs.CR cs.AI 70%

WebWeaver: Breaking Topology Confidentiality in LLM Multi-Agent Systems with Stealthy Context-Based Inference

WebWeaver: 在LLM多智能体系统中通过隐蔽的基于上下文推断打破拓扑保密性

Zixun Xiong, Gaoyi Wu, Lingfeng Yao, Miao Pan, Xiaojiang Du, Hao Wang

机构 * Department of Electrical and Computer Engineering, Stevens Institute of Technology(斯蒂文斯理工学院电气与计算机工程系) Genentech(基因泰克) Department of Electrical and Computer Engineering, University of Houston(休斯顿大学电气与计算机工程系)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 WebWeaver通过仅 compromise 一个任意智能体推断LLM多智能体系统的完整拓扑,采用隐蔽的基于上下文推断方法,提出新的隐蔽 jailbreak 机制和无 jailbreak 扩散设计,提升推断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2603.18433 2026-03-20 cs.CR 82%

Prompt Control-Flow Integrity: A Priority-Aware Runtime Defense Against Prompt Injection in LLM Systems

提示控制流完整性:一种优先级感知的运行时防御,用于对抗LLM系统中的提示注入

Md Takrim Ul Alam, Akif Islam, Mohd Ruhul Ameen, Abu Saleh Musa Miah, Jungpil Shin

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract)

AI总结 本文提出Prompt Control-Flow Integrity,一种优先级感知的运行时防御机制,通过结构化组合系统、开发者、用户和检索文档片段来防范提示注入攻击,实现零误报率和低开销。

Comments 4 Figures, 3 Tables, Submitted to the International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18063 2026-03-20 cs.CR cs.AI 57%

MCP-38: A Comprehensive Threat Taxonomy for Model Context Protocol Systems (v1.0)

MCP-38:一种针对模型上下文协议系统的全面威胁分类

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research(Vulcan研究院) AIFT

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出MCP-38,一种针对模型上下文协议系统的威胁分类体系,包含38个威胁类别,通过系统化方法覆盖MCP特有的语义攻击面。

Comments v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2603.18353 2026-03-20 cs.AI 70%

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji

机构 * University of California San Francisco(加州大学旧金山分校) Waymark University of Pennsylvania(宾夕法尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。

Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18895 2026-03-20 cs.HC cs.AI cs.LG 62%

From Accuracy to Readiness: Metrics and Benchmarks for Human-AI Decision-Making

从准确到准备:人类-人工智能决策的度量与基准

Min Hun Lee

机构 * Singapore Management University(新加坡国立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出评估人类-人工智能决策的度量框架,聚焦团队准备度,引入四类评价指标并连接人类-人工智能上boarding生命周期,通过交互轨迹评估校准、错误恢复与治理。

Comments ACM CHI 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02290 2026-03-20 cs.CL cs.AI 62%

Hallucination or Creativity: How to Evaluate AI-Generated Scientific Stories?

幻觉或创造力:如何评估AI生成的科学故事?

Alex Argese, Pasquale Lisena, Raphaël Troncy

机构 * EURECOM

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出StoryScore指标,用于评估AI生成的科学故事,结合语义对齐、词汇 grounding、叙事控制等方法,解决传统指标无法区分教育创造力与事实错误的问题。

Journal ref Proceedings of the Text2Story'26 Workshop, Delft (The Netherlands), 29-March-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09734 2026-03-20 cs.CL cs.AI 62%

From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis

从检测到诊断:通过自动化数据合成推进幻觉分析

Yanyi Liu, Qingwen Yang, Tiezheng Guo, Feiyu Qu, Jun Liu, Yingyou Wen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从检测到诊断的新范式,通过自动化数据合成生成高质量训练样本,训练出HDM-4B-RL模型,在幻觉诊断任务中超越现有检测模型,实现更可靠的生成式AI系统。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06265 2026-03-20 cs.CL 57%

Large Language Models Hallucination: A Comprehensive Survey

大语言模型幻觉:全面调查

Aisha Alansari, Hamzah Luqman

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 本文全面调查大语言模型中的幻觉现象,分析其成因、检测与缓解方法,探讨现有评估指标及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2603.19011 2026-03-20 cs.CR cs.AI 57%

Security awareness in LLM agents: the NDAI zone case

LLM代理中的安全意识:NDAI区域案例

Enrico Bottazzi, Pia Park

机构 * Leku

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 研究探讨LLM代理在安全环境识别中的能力差异,发现失败的证明会抑制披露,而成功的证明导致不同模型反应不一,揭示LLM在检测危险信号方面可靠但无法验证安全,需进一步改进以支持隐私保护代理协议。

详情

展开后加载摘要…

URL PDF HTML 收藏