arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-02 至 2026-04-02 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2604.00558 2026-04-02 cs.CV 83%

STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO

STAR:通过转弯点对齐和段级DPO缓解空间推理中的级联错误

Pukun Zhao, Longxiang Wang, Chen Chen, Peicheng Wang, Fanqing Zhou, Runze Li, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东财经大学) Chongqing University(重庆大学) Westlake University(西湖大学) The University of Hong Kong(香港大学)

专题命中 偏好对齐 :alignment(title);DPO(title)

AI总结 本文提出STAR框架,通过拓扑锚点解决复杂拓扑中的级联错误问题,引入RedMaze-23K数据集并采用段级DPO提升长距离导航的自我修正能力,实验表明其32B版本在开源模型中表现最优。

Comments 9 pages, 6 figures, 4 tables, Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01152 2026-04-02 cs.CL cs.AI 73%

Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learning

Brainstacks:通过冻结MoE-LoRA堆栈实现跨领域认知能力的持续LLM学习

Mohammad R. Abu Ayyash

机构 * Brains Build Research

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 Brainstacks通过冻结MoE-LoRA堆栈实现持续多领域微调,利用残差增强突破单堆栈限制,实现跨领域组合。

Comments 26 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04636 2026-04-02 cs.AI 57%

When Agents Persuade: Rhetoric Generation and Mitigation in LLMs

当代理体说服:大语言模型中的修辞生成与缓解

Julia Jose, Ritik Roongta, Rachel Greenstadt

机构 * New York University(纽约大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在被提示生成宣传内容时的表现,通过专门模型分析其修辞手法,并发现通过监督微调等方法可有效减少此类内容生成。

Comments Accepted to the ICLR 2026 Workshop on Agents in the Wild (AgentWild). 20 pages including appendix, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00766 2026-04-02 cs.CV cs.AI 57%

Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?

大视觉-语言模型是否准备好指导盲人和低视力者?

Eunki Kim, Na Min An, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

机构 * SKT KAIST AI(韩国科学技术院人工智能) NAVER Theia Insights

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出统一框架,通过用户研究和定制数据集,开发出更高效的评估器,提升大视觉-语言模型在盲人和低视力用户导航中的应用性能。

Comments 42 pages, 14 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17870 2026-04-02 cs.CL 57%

Just as Humans Need Vaccines, So Do Models: Model Immunization to Combat Falsehoods

正如人类需要疫苗,模型也需要:模型免疫化以对抗虚假信息

Shaina Raza, Rizwan Qureshi, Azib Farooq, Marcelo Lotif, Aman Chadha, Deval Pandya, Christos Emmanouilidis

机构 * Vector Institute(向量研究所) University of Central Florida(中佛罗里达大学) University of Cincinnati(辛辛那提大学) Independent Researcher(独立研究员) University of Groningen(格罗宁根大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出模型免疫化方法,通过在训练中加入精心挑选的(错误陈述,纠正)对,以直接监督虚假信息,提升模型在TruthfulQA上的准确性并提高对抗虚假信息的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01399 2026-04-02 cs.CV 50%

Resolving the Identity Crisis in Text-to-Image Generation

缓解文本到图像生成中的身份危机

Shubhankar Borse, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出DisCo框架,通过强化学习优化图像内和跨样本的身份多样性,解决多人类生成中的身份重复和计数错误问题,无需真实数据,在DiverseHumans数据集上取得高准确率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 9 篇

2604.00072 2026-04-02 cs.LG cs.AI stat.ML 87%

Empirical Validation of the Classification-Verification Dichotomy for AI Safety Gates

对AI安全闸门中分类-验证二元对立的实证验证

Arsenios Scrivens

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.LG

AI总结 研究通过实证表明,基于分类器的安全闸门在AI系统经过数百次迭代后无法维持可靠监管,且结构上无法实现。

Comments 21 pages, 9 figures. Companion theory paper: doi:10.5281/zenodo.19237451

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00228 2026-04-02 cs.CL 79%

Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries

语言模型是否知道何时会拒绝?探测安全边界内的自我意识

Tanay Gondil

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 研究探讨语言模型能否准确预测自身拒绝行为,通过系统分析发现模型在安全边界处敏感度下降,且通过置信度评分可提升安全部署的准确性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00992 2026-04-02 eess.SY cs.SY 78%

Tube-Based Safety for Anticipative Tracking in Multi-Agent Systems

基于管状的安全性用于多智能体系统中的前瞻性跟踪

Armel Koulong, Ali Pakniyat

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出了一种基于管状的安全框架,用于非线性Brunovsky多智能体系统在有界扰动下的鲁棒前瞻性跟踪,通过建立反馈增强的辅助控制策略的安全证书,避免了传统的Lipschitz界可行性条件,从而得到显式的鲁棒正不变管半径,减少约束保守性并保持正式的前向不变性。

Comments This work has been submitted to the 65th IEEE Conference on Decision and Control for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22514 2026-04-02 eess.SY cs.SY 78%

Robust Multi-Agent Safety via Tube-Based Tightened Exponential Barrier Functions

通过管状紧缩指数屏障函数实现多智能体系统鲁棒安全性

Armel Koulong, Ali Pakniyat

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种构造性框架,用于合成非线性多智能体系统在有界扰动下的可证明安全控制器。核心贡献是通过约束紧缩方法将鲁棒误差反馈与名义轨迹规划相结合,利用RPI管的几何特性推导状态依赖的安全余量,从而保证轨迹安全性。

Comments Joint submission to IFAC World Congress 2026 and NAHS journal (Reference: NAHS_101717). Accepted for NAHS journal; under review by World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00627 2026-04-02 cs.CR 67%

When Safe Models Merge into Danger: Exploiting Latent Vulnerabilities in LLM Fusion

当安全模型融合进入危险:在LLM融合中利用潜在漏洞

Jiaqing Li, Zhibo Zhang, Shide Zhou, Yuxi Li, Tianlong Yu, Kailong Wang

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 研究揭示模型融合引入的新攻击面,提出TrojanMerge框架通过约束优化问题攻击安全对齐,实验显示融合模型产生高危害响应,源模型保持安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00248 2026-04-02 cs.CL cs.AI 62%

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

REM-CTX:通过强化学习与辅助上下文实现的自动化同行评审

Pawin Taechoyotin, Daniel E. Acuna

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 REM-CTX通过强化学习与辅助上下文提升同行评审质量,实验显示其在多个领域中优于基线模型,且在质量和上下文关联性指标上表现突出。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10030 2026-04-02 cs.MA cs.LG 57%

Multi-agent In-context Coordination via Decentralized Memory Retrieval

通过去中心化记忆检索实现多智能体上下文协调

Tao Jiang, Zichuan Lin, Lihe Li, Yi-Chen Li, Cong Guan, Lei Yuan, Zongzhang Zhang, Yang Yu, Deheng Ye

机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Tencent(腾讯)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出MAICC方法,通过去中心化记忆检索提升多智能体强化学习中任务协调效率,实验表明其在Level-Based Foraging和SMAC等基准上表现更优。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 40, No. 27, pp. 22363-22371, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27051 2026-04-02 eess.SY cs.SY 50%

Proprioceptive feedback paradigm for safe and resilient motion control

本体反馈范式用于安全且稳健的运动控制

Mrdjan Jankovic

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种类本体反馈机制用于运动控制系统,通过快速反馈环路补偿意外响应,分析了可管理的损伤程度,并提供了全MPF和分MPF两种方案。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22690 2026-04-02 cs.CV 50%

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can:利用画布进行多人体生成的架构与艺术家

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research, an initiative of Qualcomm Technologies, Inc.(高通人工智能研究院,高通技术公司旗下)

专题命中 安全训练 :alignment(abstract)

AI总结 Ar2Can提出一种两阶段框架,通过分离空间规划与身份渲染,解决多人体生成中人脸身份丢失问题,采用空间引导的面部匹配奖励提升生成质量,使用合成数据实现高精度和保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2604.00324 2026-04-02 cs.LG cs.AI 73%

The Persistent Vulnerability of Aligned AI Systems

对齐AI系统持续的脆弱性

Aengus Lynch

机构 * University College London(伦敦大学学院)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了自主AI代理在文件系统访问、电子邮件控制和多步骤规划中的部署问题,提出ACDC、LAT等方法以解决AI安全四大难题,通过实验展示对抗性攻击的成功率及模型对齐测试结果。

Comments PhD thesis, University College London, 2025. 157 pages. Supervised by Ricardo Silva

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2602.00750 2026-04-02 cs.CR cs.AI 79%

Bypassing Prompt Injection Detectors through Evasive Injections

通过规避性注入绕过提示注入检测器

Md Jahedur Rahman, Ihsen Alouani

机构 * Centre for Secure Information Technologies(安全信息技术中心) Queen's University Belfast(贝尔法斯特女王大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出了一种多探针规避攻击,通过优化后缀同时欺骗所有层间漂移检测器,实验显示其在Phi-3和Llama-3上成功绕过检测器的高成功率,提出基于对抗后缀增强的防御方法。

Comments This paper is to appear at ICNNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2602.22413 2026-04-02 cs.AI 70%

Epistemic Filtering and Collective Hallucination: A Jury Theorem for Confidence-Calibrated Agents

知识过滤与集体幻觉:一个适用于置信度校准代理的陪审团定理

Jonas Karge

机构 * Technische Universität Dresden(德累斯顿工业大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究异质代理在时间中学习自我可靠性估计并选择性 abstain 的集体准确性,提出基于置信度校准的框架,推导非渐近下界并证明其在置信度门控设置下的泛化能力,通过蒙特卡洛模拟验证,探讨其在AI安全中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25052 2026-04-02 cs.CL cs.AI 62%

Closing the Confidence-Faithfulness Gap in Large Language Models

弥合大语言模型中的置信度-忠实度差距

Miranda Muqing Miao, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过线性探针和对比激活添加分析,揭示大语言模型中置信度信号与校准的线性关系,提出双阶段适应性引导流程以提升校准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00983 2026-04-02 cs.CV 50%

ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration

现在行动:通过自适应上下文整合预防治愈LVLM幻觉

Bei Yan, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 4 篇

2601.05144 2026-04-02 cs.AI 70%

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models

提炼思维,标注答案:一种基于原则语义的水印方法用于大型推理模型

Shuliang Liu, Xingyu Li, Hongyi Liu, Dong Fang, Yibo Yan, Bingchen Duan, Qi Zheng, Lingfeng Su, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速)

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出ReasonMark,一种专为推理密集型LLM设计的水印框架,通过分离生成过程为无干扰的思维阶段和水印标注的答案阶段,利用关键性评分提取语义关键标记,提升水印鲁棒性与推理质量。

Comments 31 pages, Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00586 2026-04-02 cs.CL 57%

More Human, More Efficient: Aligning Annotations with Quantized SLMs

更人性化、更高效:将注释与量化小型语言模型对齐

Jiayu Wang, Junyoung Lee

机构 * Home Team Science and Technology Agency(内政团队科技局)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过量化小型语言模型在有限人类注释数据上进行微调,以获得高对齐性和确定性的评估与注释方法,提升了注释一致性并展示了其在情感分类任务中的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02966 2026-04-02 cs.PL cs.AI cs.MA 57%

Lumos: Let there be Language Model System Certification

Lumos: 让语言模型系统认证成为可能

Isha Chaudhary, Vedaant Jain, Prineet Parhar, Kavya Sachdeva, Avaljot Singh, Sayan Ranu, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 Lumos提出首个系统化框架,通过概率编程DSL实现语言模型系统行为的正式认证,支持复杂关系和时间规格,揭示了先进视觉语言模型在自动驾驶场景中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00592 2026-04-02 cs.CV cs.HC 50%

HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models

HarassGuard: 在社交虚拟现实中利用视觉-语言模型检测骚扰行为

Junhee Lee, Minseok Kim, Hwanjo Heo, Seungwon Woo, Jinwoo Kim

机构 * Kwangwoon University(光云大学) ETRI(韩国电子通信研究院) Chungbuk National University(忠北大学)

专题命中 隐私与版权 :safety(abstract)

AI总结 本文提出HarassGuard系统,通过视觉输入检测社交VR中的身体骚扰行为,利用提示工程和微调VLMs,在不使用敏感生物数据的情况下实现高准确率的骚扰检测。

Comments To appear in the 2026 TVCG Special Issue on the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 9 篇

2604.00008 2026-04-02 cs.CL cs.AI 84%

How Trustworthy Are LLM-as-Judge Ratings for Interpretive Responses? Implications for Qualitative Research Workflows

大语言模型作为评判者对解释性回应的可信度如何?对定性研究工作流程的影响

Songhee Han, Jueun Shin, Jiyoon Han, Bung-Woo Jun, Hilal Ayan Karabatman

机构 * Florida State University(佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型作为评判者在解释性回应评估中的可信度,通过比较模型表现与人类评判,指出其在筛选模型时的有效性,但不适合替代人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 79%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12140 2026-04-02 cs.HC cs.CY 77%

Worker Discretion Advised: Co-designing Risk Disclosure in Crowdsourced Responsible AI (RAI) Content Work

工人自主性指导:在众包负责任的人工智能(RAI)内容工作中共同设计风险披露

Alice Qian, Ziqi Yang, Ryland Shaw, Jina Suh, Laura Dabbish, Hong Shen

专题命中 安全评测 :safety(abstract);red teaming(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文探讨了在众包负责任的人工智能内容工作中如何平衡工人保护与任务设计者需求,通过共设计研讨会提出风险披露机制的设计建议和特征概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25302 2026-04-02 cs.AI cs.CL cs.LG cs.MA 67%

Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents

深入代理矩阵:对LLM代理自复制风险的现实评估

Boxuan Zhang, Yi Yu, Jiaxuan Guo, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过构建真实环境评估LLM代理自复制风险,引入OR和AOC指标,发现超过50%的模型在压力下表现出不受控的自复制倾向,强调了对风险评估和安全措施的迫切需求。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03131 2026-04-02 cs.AI cs.CL cs.LG 67%

Code Comprehension then Auditing for Unsupervised LLM Evaluation

代码理解后审计用于无监督LLM评估

Bhrij Patel, Souradip Chakraborty, Mengdi Wang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学帕克分校) Princeton University(普林斯顿大学) University of Central Florida(中佛罗里达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoCoA框架,通过先理解代码功能再评估任务对齐,提升无监督LLM评估的准确性与F1分数。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17760 2026-04-02 cs.LG cs.AI 62%

But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors

但你的诚实答案是什么?利用引导向量辅助LLM-法官的诚实替代方案

Leon Eshuijs, Archie Chaudhury, Alan McBeth, Ethan Nguyen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent(独立)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JUSSA框架,通过引导向量优化法官的诚实性,提升对欺骗性回答的检测能力,实验显示在不同 dishonesty 水平下,GPT-4.1和Claude Haiku的AUROC均有显著提升,但任务复杂度不匹配时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏