arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-05 至 2026-06-05 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 18 篇

2606.05688 2026-06-05 cs.CL cs.AI 81%

Value-and-Structure Alignment for Routing-Consistent Quantization of Mixture-of-Experts Models

面向路由一致性的混合专家模型量化的值与结构对齐

Hancheol Park, Geonho Lee, Tairen Piao, Tae-Ho Kim

机构 * Nota Inc., South Korea(韩国Nota公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VSRAQ方法,通过值对齐和结构对齐两个互补目标保持量化前后的专家选择行为一致性,减少量化引起的性能下降,无需推理开销。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11618 2026-06-05 cs.LG 79%

Optimal CO2 storage management considering safety constraints in multi-stakeholder multi-site CCS projects: a Markov game perspective

考虑安全约束的多利益相关者多地点碳捕集与封存项目最优存储管理:从马尔可夫博弈视角

Jungang Chen, Seyyed A. Hosseini

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

AI总结 本文基于马尔可夫博弈方法,研究多利益相关者多地点碳捕集与封存项目中不同联盟结构对利益相关者目标的影响,提出一种考虑安全约束的多智能体强化学习框架,以实现多利益相关者的最优存储管理。

Comments 58 pages

Journal ref Int. J. Greenh. Gas Control 149 (2026) 104683

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20914 2026-06-05 cs.LG cs.AI cs.CL 67%

Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?

Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?

Maxime Méloux, Silviu Maniu, François Portet, Maxime Peyrard

机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、国家科学研究中心、格勒诺布尔INP、实验室LIG)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了在机械可解释性(MI)框架下,给定行为是否具有唯一解释的问题,通过统计可识别性理论分析了MI解释的可识别性,并提出了两种主要策略及实验结果。

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05185 2026-06-05 cs.CY cs.CV cs.LG 62%

Drishti AI-Event Guardian: An Intelligent Real-Time Crowd Monitoring and Emergency Response System for Mass Gathering Events

Drishti AI-Event Guardian:面向大规模聚集事件的智能实时人群监控与应急响应系统

Ritabrata Roy Choudhury, Arkajyoti Karmakar, Rudra Pratap Mitra

机构 * School of Computer Engineering, Kalinga Institute of Industrial Technology(计算机工程学院,凯林加工业技术学院) School of Electronics Engineering, Kalinga Institute of Industrial Technology(电子工程学院,凯林加工业技术学院)

专题命中 其他安全 :safety(abstract);分类 cs.CY、cs.LG

AI总结 提出Drishti AI-Event Guardian框架,结合YOLOv8、异常检测和梯度提升回归等多模态深度学习技术,实现实时人群密度估计、异常检测、预测建模、人脸识别、医疗紧急报告、聊天机器人和智能警卫重分配,在Kumbh Mela和RCB Victory Parade事件中验证了低延迟和高精度。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13830 2026-06-05 cs.AI cs.LG 62%

Quantifying Sensitivity for Tree Ensembles: A symbolic and compositional approach

对树集成模型的敏感性量化:一种符号和组合方法

Ajinkya Naik, Chaitanya Garg, S. Akshay, Ashutosh Gupta, Kuldeep S. Meel

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) University of Toronto(多伦多大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种针对树集成模型的敏感性量化方法,通过离散化输入空间并枚举易受敏感性影响的区域,结合代数决策图(ADD)编码和分拆子问题,实现高效计算。实验表明,所提工具XCount在速度和可扩展性方面优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10823 2026-06-05 cs.CL cs.AI 62%

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

CLASH:从多个视角评估语言模型在高风险困境中的判断

Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Philosophy(哲学系) University of Michigan Ann Arbor(安娜堡大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CLASH数据集,用于研究基于价值观的决策过程,发现语言模型在处理矛盾决策、心理不适和价值观变化时存在显著不足。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10486 2026-06-05 cs.AI cs.CL 62%

IDEAL: Leveraging Infinite and Dynamic Characterizations of Large Language Models for Query-focused Summarization

IDEAL: 利用大型语言模型的无限和动态特性进行查询导向的摘要

Jie Cao, Dian Jiao, Yang Dai, Rolan Yan, Wenqiao Zhang, Siliang Tang

机构 * Zhejiang University(浙江大学) Tencent, Wechat(腾讯,微信)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文针对查询导向摘要问题,提出两种核心方法:高效细粒度查询-LLM对齐和长文档摘要,通过Query-aware HyperExpert和Query-focused Infini-attention模块实现,实验验证了方法的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05395 2026-06-05 cs.RO cs.AI 57%

VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents

VASO:物理AI智能体的形式可验证自进化技能

Yunhao Yang, Neel P. Bhatt, Kevin Wang, Samuel Tetteh, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Iowa State University(爱荷华州立大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出VASO框架,通过形式验证引导LLM生成的机器人技能合约自进化,将模型检查的反例转化为文本梯度更新技能合约,无需微调模型权重,在Jackal和四旋翼任务中达到97.2%的形式规范符合率。

Comments Project webpage: https://languagegroundedriskdetection.github.io/ProjectPage/vaso-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05376 2026-06-05 cs.LG 57%

SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

SHALA-LLM:在对齐LLM中智能处理模糊标签

Jingyao Wu, Ashley Wang, Keane Ong, Paul Pu Liang, Rosalind Picard

机构 * MIT Media Lab, Massachusetts Institute of Technology(麻省理工学院媒体实验室、麻省理工学院) National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出SHALA-LLM强化学习框架,通过从标注者分布中学习并动态优先处理高模糊样本,改善LLM对模糊标签的建模,在NLI和情感识别任务中提升与标注者分布的一致性及分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03785 2026-06-05 cs.CL 57%

Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

后门遗忘泛化:走向移除大语言模型中未知触发器的路径

Lisa Bouger, Théo Lasnier, Philippe Loubet Moundi, Yannick Teglia, Djamé Seddah

机构 * Inria Paris(法国巴黎国家信息与自动化研究所) Sorbonne Université(索邦大学) Thales CDI(泰雷兹CDI)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文通过实验证明,针对单个后门的遗忘训练可以泛化抑制其他未明确针对的后门,并引入交叉激活偏移距离量化不同训练引起的模型变化,为利用可控后门移除未知后门提供新方向。

Comments 22 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20628 2026-06-05 cs.CL 57%

Divide-Prompt-Refine: a Training-Free, Structure-Aware Framework for Biomedical Abstract Generation

Divide-Prompt-Refine:一种无需训练的、结构感知的生物医学摘要生成框架

Sylvey Lin, Joe Menke, Shufan Ming, Dongin Nam, Neil Smalheiser, Halil Kilicoglu

机构 * University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出DPR-BAG框架,旨在生成具有完整文本但无摘要的生物医学文章的连贯且事实准确的摘要。该框架通过分解全文文档为结构化的修辞要素,进行并行LLM摘要生成,并应用最终的精炼阶段恢复全局话语连贯性。

Comments Accepted by BioNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00054 2026-06-05 cs.CV cs.AI 57%

HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling

HiDe: 通过分层解耦重新思考高分辨率MLLMs中的Zoom-IN方法

Xianjie Liu, Yiman Hu, Yixiong Zou, Liang Wu, Jian Xu, Bo Zheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出HiDe框架,通过分层解耦方法解决高分辨率图像中背景干扰导致的视觉理解问题,提升多模态大语言模型在高分辨率图像任务中的性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06073 2026-06-05 cs.IR 50%

Edge-Aware Curvature Modeling for Graph Understanding in Large Language Models

面向大语言模型图理解的边缘感知曲率建模

Zhenghong Lin, Zhibin Shi, Hongyang Dong, Xinjie Ye, Yuhong Chen, Shiping Wang

专题命中 其他安全 :alignment(abstract)

AI总结 针对图感知大语言模型中节点级对齐忽略边缘信息导致信息传播次优的问题,提出CureLLM框架,通过无训练文本提示和曲率感知图表示学习注入边缘信号,在11个数据集上超越20种对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05916 2026-06-05 cs.CV 50%

Unveiling the Unknown: Open Vocabulary Object Detection with Scene Graphs

揭示未知:基于场景图的开放词汇目标检测

Yi Chen, Yinghao Lu, Zhehao Li, Chenchen Yan, Jiafei Wu, Chong Wang, Jiangbo Qian

机构 * Faculty of Electrical Engineering and Computer Science, Ningbo University(宁波大学电气工程与计算机科学学院) Faculty of Computing, Georg-August-Universität Göttingen(哥廷根大学计算机学院) Merchants’ Guild Economics and Cultural Intelligent Computing Laboratory, Ningbo University(宁波大学商帮经济与文化智能计算实验室) School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出场景引导的关系建模检测框架,利用场景图捕获候选区域与上下文对象之间的结构化语义和空间关系,并通过关系注意力模块和场景文本对齐分支增强开放词汇目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05909 2026-06-05 cs.SD eess.AS 50%

Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

超越WER:面向环境临床记录员的配对声学压力测试

Xiao-Hang Jiang, Han-Jie Guo, Ying-Si Liang, Yang Ai, Zhen-Hua Ling, Lei Jiang, Zhi-Yang He

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Co., Ltd.(iFLYTEK公司)

专题命中 其他安全 :safety(abstract)

AI总结 提出配对声学压力测试方法,通过注入噪声并冻结下游模型,揭示噪声对临床推理的安全影响,发现轻微声学扰动可逆转临床意义而不显著增加词错误率,并展示轻量级缓解策略。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05753 2026-06-05 cs.CV 50%

Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

余弦误导:辅助损失重塑视觉语言模型,而非其潜变量

XiuYu Zhang, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过实验发现,在视觉语言模型的潜视觉推理中,余弦相似度等对齐损失与准确性负相关,并引入PRISM诊断工具揭示潜变量被绕过,辅助损失主要通过共享参数重塑语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05383 2026-06-05 cs.CR cs.SE 50%

Evolution of Log-Based Detection Rules in Public Repositories

基于日志的检测规则在公共仓库中的演变

Minjun Long, David Evans

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了公共仓库中基于日志的检测规则的演变,通过分析Sigma和Splunk Security Content两个项目中的6859条规则历史,发现约56%的规则至少经过一次修订,且规则生命周期内演变非单调,经常出现回退,表明规则变化并非持续积累,而是存在操作上的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06259 2026-06-05 eess.AS cs.SD 50%

Leveraging Prompt Learning and Pause Encoding for Alzheimer's Disease Detection

利用提示学习和暂停编码进行阿尔茨海默病检测

Yin-Long Liu, Rui Feng, Jia-Hong Yuan, Zhen-Hua Ling

机构 * National Social Science Foundation of China(中华人民共和国国家社会科学基金) Supercomputing Center of the USTC(中国科学技术大学超算中心)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出通过提示学习和暂停信息编码改进基于转录文本的阿尔茨海默病检测,利用提示模板将分类任务转化为掩码语言建模任务,并通过比较不同自动语音识别模型和集成技术,达到95.8%的检测准确率。

Comments Accepted by ISCSLP 2024

Journal ref Proc. IEEE ISCSLP 2024, pp. 486-490, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏