arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-08 至 2026-05-08 共收录 80 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2605.05440 2026-05-08 cs.AI 57%

Authorization Propagation in Multi-Agent AI Systems: Identity Governance as Infrastructure

多智能体AI系统中的授权传播:身份治理作为基础设施

Krti Tallam

机构 * Kamiwaza AI

专题命中 AI治理与伦理 :prompt injection(abstract);分类 cs.AI

AI总结 本文探讨多智能体系统中授权传播问题,提出三个子问题和七项结构要求,强调身份治理应作为基础设施持续评估和设计。

Comments Security and systems paper, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05830 2026-05-08 cs.CR 50%

Fairness in Token Delegation: Mitigating Voting Power Concentration in DAOs

代币委托中的公平性:缓解DAO中的投票权集中问题

Johnnatan Messias, Ayae Ide

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究DAO治理中委托机制的问题,通过分析14个DAO论坛的数据,发现委托常与持有者优先级不一致,提出引入兴趣匹配以缓解权力集中。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他安全 18 篇

2409.07985 2026-05-08 cs.AI cs.LG 81%

Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols

用于AI控制的游戏:AI部署协议安全评估模型

Charlie Griffin, Louis Thomson, Buck Shlegeris, Alessandro Abate

机构 * University of Oxford(牛津大学) Redwood Research(红木研究)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AI-Control Games模型,用于评估不信任AI部署协议的安全性,通过多目标部分可观测随机博弈框架,改进协议设计并分析安全影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06370 2026-05-08 cs.LG stat.ML 79%

Greedy Alignment Principle for Optimizer Selection

贪心对齐原则用于优化器选择

Jaerin Lee, Kyoung Mu Lee

机构 * Computer Vision Lab, ASRI, Seoul National University(计算机视觉实验室,ASRI,首尔国立大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出基于梯度更新对齐的贪心原则,用于优化器选择与调参,通过数学建模证明该原则能最大化损失下降率,并在多种任务中验证动态动量规则的有效性。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05907 2026-05-08 q-bio.NC 78%

Decoding Alignment without Encoding Alignment: A critique of similarity analysis in neuroscience

无需编码对齐的解码对齐:对神经科学中相似性分析的批评

Johannes Bertram, Luciano Dyballa, T. Anderson Keller, Savik Kinger, Steven W. Zucker

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文指出解码相似性分析的局限性,揭示解码表示可能受少量神经元影响,提出编码 manifold 作为对比神经系统的补充工具。

Comments 40 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06258 2026-05-08 cs.LG cs.AI 62%

The Weight Gram Matrix Captures Sequential Feature Linearization in Deep Networks

权重格雷矩阵捕捉深度网络中的序列特征线性化

Taehun Cha, Daniel Beaglehole, Adityanarayanan Radhakrishnan, Donghun Lee

机构 * MIT Mathematics Broad Institute of MIT and Harvard(麻省理工学院数学Broad研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于特征的框架,通过将权重更新与特征演变关联,揭示深度网络训练中权重格雷矩阵捕捉特征动态,并引入目标线性度量,展示深度网络如何逐步将表示转换为目标线性结构。

Comments 29 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05421 2026-05-08 cs.CV cs.AI cs.LG 62%

DARK: Diagonal-Anchored Repulsive Knowledge Distillation for Vision-Language Models under Extreme Compression

DARK:针对极端压缩下视觉-语言模型的对角锚定排斥知识蒸馏

Numan Saeed, Asif Hanif, Fadillah Adamsyah Maani, Hussain Alasmawi, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed人工智能大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARK,一种对比知识蒸馏框架,通过分解损失函数为对角项和非对角项,使学生模型在极端压缩下更高效地排斥教师模型的非目标相似结构,实验证明其在零样本基准上表现优异。

Comments Project website: www.numansaeed.com/mobilefetalclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08110 2026-05-08 cs.CV cs.CL cs.LG 62%

The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding

构图的艺术:用于组合视觉定位的注意力正则化训练

Jiayun Luo, Mir Rayat Imtiaz Hossain, Pritam Sarkar, Boyang Li, Leonid Sigal

机构 * The University of British Columbia(不列颠哥伦比亚大学) Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CompART,通过分解标题为以对象为中心的短语并构建复合短语,提升多对象定位能力,验证了其在多种视觉语言模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05218 2026-05-08 cs.LG cs.AI math.DS nlin.CD 62%

Horizon-Constrained Rashomon Sets for Chaotic Forecasting

具有水平约束的Rashomon集用于混沌预测

Gauri Kale, Rahul Vishwakarma, Holly Diamond, Ava Hedayatipour, Amin Rezaei

机构 * Dept. of Electrical Engineering, California State University Long Beach, USA WorkOnward Inc., USA Dept. of Computer Engineering \& Computer Science, California State University Long Beach, USA

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出水平约束Rashomon集理论框架,用于研究混沌系统中模型多样性随预测时间的变化,通过Lyapunov加权指标和决策对齐算法提升决策质量,实验表明在安全关键领域具有显著优势。

Journal ref AIP Advances 16, 045208 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20180 2026-05-08 cs.CV cs.AI cs.CL 62%

Adaptive Greedy Frame Selection for Long Video Understanding

自适应贪心帧选择用于长视频理解

Yuning Huang, Xiaoyu Ji, Joseph Huang, Yichi Zhang, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种自适应贪心帧选择方法,在固定帧预算下联合优化查询相关性和语义代表性,通过构建1FPS候选池并嵌入两种互补空间,提升长视频问答的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06632 2026-05-08 cs.LG 57%

Crafting Reversible SFT Behaviors in Large Language Models

在大型语言模型中构建可逆的SFT行为

Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

机构 * Michigan State University(密歇根州立大学) Hippocratic AI(希波克拉底AI) University of Georgia(佐治亚大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出LCDD和SFT-Eraser方法,通过构建稀疏必要子网络实现对SFT诱导行为的可控逆向,验证了结构对行为因果必要性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06520 2026-05-08 cs.GT cs.LG cs.MA stat.ME 57%

Optimizing Social Utility in Sequential Experiments

在连续实验中优化社会效用

Ander Artola Velasco, Stratis Tsirtsis, Manuel Gomez-Rodriguez

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Hasso Plattner Institute(哈索·platzer研究所)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出一种统计协议,通过开发者连续进行随机对照试验并由监管机构部分补贴成本,以提高社会效用。通过动态规划和分治法,有效找到最优策略和补贴水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06143 2026-05-08 cs.CV cs.AI 57%

AI-Generated Images: What Humans and Machines See When They Look at the Same Image

AI生成图像:当人类和机器注视同一张图像时的所见

Silvia Poletti, Justin Ilyes, Marcel Hasenbalg, David Fischinger, Martin Boyer

机构 * Austrian Institute of Technology(奥地利技术研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了如何通过多种架构和微调策略开发更有效的AI生成图像检测器,提供人类可理解的解释。研究基于大规模逼真伪造图像数据集,评估了最新文本到图像AI生成器的性能,并整合16种可解释AI方法,通过调查100名参与者收集的文本和视觉反馈,优化解释清晰度。

Comments Included in the main conference proceedings published by Springer Nature (CCIS Series)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05400 2026-05-08 cs.SE cs.AI cs.HC 57%

Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering Methodology

代理编程的准备:作为情境工程方法论的刻意准备

Andrew Zigler

机构 * LinearB

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种三阶段的代理编程准备方法,通过情境 grounding、协作规范和任务分解,提升 AI 编程的效率与质量,通过 hackathon 实验验证了准备阶段的重要性。

Comments 5 pages. Accepted at VibeX 2026, the 1st International Workshop on Vibe Coding and Vibe Researching, co-located with EASE 2026, Glasgow, June 9-12 2026. Camera-ready version. Research artifact: https://doi.org/10.5281/zenodo.19868258

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05344 2026-05-08 cs.CV cs.AI cs.IR 57%

Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery

Open-SAT: 一种基于LLM的查询嵌入细化方法用于卫星影像开放词汇物体检索

Md Adnan Arefeen, Biplob Debnath, Ravi K. Rajendran, Murugan Sankaradas, Srimat T. Chakradhar

机构 * North South University(北南大学) NEC Laboratories America(NEC实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Open-SAT通过LLM引导在推理阶段优化查询与卫星影像内容的对齐,提升开放词汇检索性能,实验表明其F1分数提升达16.04%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17419 2026-05-08 cs.CV 50%

EAGLE: Expert-Augmented Attention Guidance for Tuning-Free Industrial Anomaly Detection in Multimodal Large Language Models

EAGLE:专家增强的注意力引导用于多模态大语言模型中的无调优工业异常检测

Xiaomeng Peng, Xilang Huang, Seon Han Choi

机构 * Ewha Womans University(峨山女子大学)

专题命中 其他安全 :alignment(abstract)

AI总结 EAGLE通过整合专家异常检测器与冻结的MLLM,提出无调优框架,提升多模态大语言模型在工业异常检测中的准确率,且在MVTec-AD和VisA数据集上达到94.4%和88.1%的异常鉴别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05756 2026-05-08 cs.RO cs.CV 50%

MaMi-HOI: Harmonizing Global Kinematics and Local Geometry for Human-Object Interaction Generation

MaMi-HOI:协调全局运动学与局部几何以生成人-物交互

Hao Wang, Shiqi Wang, Qi Liu

机构 * School of Future Technology, South China University of Technology, Guangzhou, Guangdong, China(未来技术学院,华南理工大学,广州,广东,中国)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MaMi-HOI框架,通过几何感知接近适配器和运动学和谐适配器协调宏观运动流畅性与微观空间精度,实现自然运动与精确接触的平衡,扩展了长轨迹生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05628 2026-05-08 cs.AR cs.DC 50%

Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems

面向多GPU系统的计算感知交换机计算

Chen Zhang, Qijun Zhang, Zhuoshan Zhou, Yijia Diao, Haibo Wang, Zhe Zhou, Zhipeng Tu, Zhiyao Li, Guangyu Sun, Zhuoran Song, Zhigang Ji, Jingwen Leng, Minyi Guo

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出CAIS框架,通过计算感知的ISA扩展、线程块协调和数据流优化,提升多GPU系统中LLM张量并行的通信与计算效率,实验显示其在训练速度上优于现有方案。

Comments 15 pages, 18 figures, HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05556 2026-05-08 cs.CV 50%

An extremely coarse feedback signal is sufficient for learning human-aligned visual representations

极粗的反馈信号足以学习与人类对齐的视觉表征

Yash Mehta, Michael F. Bonner

机构 * Department of Cognitive Science, Johns Hopkins University(约翰霍普金斯大学认知科学系)

专题命中 其他安全 :alignment(abstract)

AI总结 研究探讨了粗略反馈信号对视觉表征对齐的影响,发现即使仅区分8类,网络表征也能达到甚至超越细粒度模型的对齐程度,并更接近人类感知相似性判断。

Comments 21 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05552 2026-05-08 cs.HC 50%

Designing with Tensions: Older Adults' Emotional Support-Seeking Under System-Level Constraints in Conversational AI

在张力中设计:在对话AI中受系统级约束的老年人情感支持寻求

Mengqi Shi, Tianqi Song, Zicheng Zhu, Yi-Chieh Lee

专题命中 其他安全 :safety(abstract)

AI总结 研究探讨老年人在对话AI中寻求情感支持时的体验,发现现有安全干预可能打断情感互动,影响老年人的情感参与和情绪状态。

详情

展开后加载摘要…

URL PDF HTML 收藏