arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 557 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 557 篇

2606.26987 2026-06-26 cs.CL cs.AI 新提交 62%

Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs

模型在哪里找到幸福?开源大语言模型中的情感向量

Sinie van der Ben, Raphaël Baur, Yannick Metz, Mennatallah El-Assady

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究在开源模型中复现情感向量,发现效价几何结构在层间分布存在差异,且唤醒度编码受语料影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26744 2026-06-26 cs.LG cs.CL 新提交 62%

HyperDFlash: Hyper-Connection-Aligned Block Speculative Decoding with Gated Residual Reduction

HyperDFlash: 面向MHC架构的块级推测解码与门控残差缩减

Luxi Lin, Shuang Peng, Rui Ma, Junhao Hua, Shuwei Fan, Zhengda Qin, Qiang Wang, Hongjian Sun, Fangmin Chen, Songwei Liu

机构 * ByteDance(字节跳动)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对DeepSeek-V4的多超连接架构,提出HyperDFlash框架,通过对齐残差流和轻量门控缩减器,解决推测解码中特征错位和误差累积问题,显著提升解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26523 2026-06-26 cs.AI cs.LG 新提交 62%

Radical AI Interpretability

激进AI可解释性

Daniel A. Herrmann, Benjamin A. Levinstein

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 借鉴激进解释哲学和机械可解释性工具,提出将AI系统解释为智能体的框架,解决如何从计算事实推断信念、欲望和意义的问题,并建立成功标准。

Comments Draft of manuscript to appear as Cambridge Element in the Philosophy of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25073 2026-06-25 cs.LG cs.AI cs.MA 新提交 62%

GCT-MARL: Graph-Based Contrastive Transfer for Sample-Efficient Cooperative Multi-Agent Reinforcement Learning

GCT-MARL: 基于图对比迁移的样本高效合作多智能体强化学习

Animesh Animesh, Satheesh K Perepu, Kaushik Dey

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出GCT-MARL框架,利用多视图图对比学习和自适应加权对齐损失,结合两阶段训练协议,实现跨不同规模和组成群体的高效迁移,显著加速目标任务收敛。

Comments Accepted at The Continual RL Workshop, RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24459 2026-06-24 cs.LG cs.CL 新提交 62%

An LLM-based Two-Stage Transformer Framework for Cross-Domain Bearing Fault Diagnosis with Limited Data

基于LLM的两阶段Transformer框架用于跨域轴承故障诊断与有限数据

Jinghan Wang, Feng Cheng, Wentao Wu, Hang Li, Gaoliang Peng, Tianchen Liu

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出知识引导的两阶段迁移学习框架,使用轻量级GPT-2风格Transformer提取振动信号层次特征,通过原型知识调制和分类自适应实现跨域故障诊断,在仅10%标注数据下达到92.61%准确率。

Comments Accepted as a conference article of AIM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23124 2026-06-23 cs.CL cs.AI 新提交 62%

PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation

PRIDE: 特权信息增强的共情对话生成蒸馏方法

Jiaqiang Wu, Zhouan Zhu, Shangfei Wang

机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22550 2026-06-23 cs.CV cs.AI cs.CL cs.MM 新提交 62%

Training-Free Semantic Correction for Autoregressive Visual Models

自回归视觉模型的免训练语义校正

Junhao Chen, Chanyu Zhu, Zheqi Lv, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21977 2026-06-23 cs.CY cs.AI cs.HC 新提交 62%

Old Fictions, New Skins: Evaluating the Manipulative Capabilities of LLMs in Healthcare

旧小说,新皮肤:评估LLM在医疗保健中的操纵能力

Gathoni Ireri, Roger D. Odipo

机构 * ILINA Program(ILINA项目) Haki AI

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 通过随机实验发现,ChatGPT 5.2和DeepSeek V3.2在肯尼亚参与者中能显著操纵其治疗决策,成功率从44.0%升至59.5%,凸显非洲医疗AI中防范操纵的必要性。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21843 2026-06-23 cs.AI cs.CL 新提交 62%

Measuring What Persists: Conditioning Mechanisms and a Geometric Framework for AI Agent Identity

测量持续存在的内容:AI智能体身份的调节机制与几何框架

Andrew Tanner

机构 * Anisotrope AI

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。

Comments 29 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21197 2026-06-23 cs.CV cs.AI cs.LG 新提交 62%

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

通过稀疏自编码器提取和分析视觉语言模型中的多模态概念

Sergio Lanza, Jae Hee Lee, Stefan Wermter

机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。

Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13007 2026-06-23 cs.LG cs.AI 新提交 62%

scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing

scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序

Ping Xu, Pengjiang Li, Tian Du, Zaitian Wang, Jiawei Gu, Zhiyuan Ning, Ziyue Qiao, Pengfei Wang, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18717 2026-06-18 cs.CL cs.AI 新提交 62%

Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish

Morpheus: 一种面向土耳其语的形态感知神经分词器和词嵌入器

Tolga Şakar

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语粘着特性,提出Morpheus神经词素边界模型,实现无损可逆分词与结构化词嵌入,在可逆分词器中达到最低比特每字符(1.425),词素对齐F1提升至0.61,GPU内存节省约19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18688 2026-06-18 cs.LG cs.AI 新提交 62%

Dual-Channel Grounded World Modeling (DCGWM): Structural Prevention of Objective Interference Collapse via Heterogeneous External Grounding with Inward-Only Gradient Flow

双通道接地世界建模 (DCGWM):通过异构外部接地与内向梯度流结构性防止目标干扰崩溃

Akshay Hazare

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出双通道接地世界建模(DCGWM),通过分区潜空间和内向梯度流,结构性防止联合嵌入预测架构中多目标接地导致的目标干扰崩溃。

Comments Position paper. Experimental validation in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17454 2026-06-18 cs.AI cs.LG 新提交 62%

Dissecting model behavior through agent trajectories

通过智能体轨迹剖析模型行为

Gaurav Gupta, Vatshank Chaturvedi, Jun Huan, Anoop Deoras

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出“意图-执行差距”概念,并设计Simple Strands Agent(SSA)框架,通过分析138k条轨迹揭示模型在自主问题解决中的行为差异。

Comments 106 pages, 50 Figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17830 2026-06-17 cs.LG cs.AI 新提交 62%

Functional Equivalence in Attention: A Comprehensive Study with Applications to Linear Mode Connectivity

注意力中的功能等价性:一项综合研究及其在线性模式连通性中的应用

Viet-Hoang Tran, Vinh Khanh Bui, Van-Hoan Trinh, Tan Lai Ngoc, Tan M. Nguyen

机构 * National University of Singapore(新加坡国立大学) Center for AI Research, VinUniversity(Vin大学人工智能研究中心) Independent Researcher(独立研究者) Technical University of Munich(慕尼黑技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文形式化研究了Transformer中位置编码对功能等价性的影响,发现正弦编码保持原始注意力的对称性,而旋转编码显著减少对称群从而增强表达力,并通过对齐算法实证了位置编码对线性模式连通性的关键作用。

Comments Published at the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15994 2026-06-16 cs.AI cs.LG 新提交 62%

Agentic Framework for Deep Learning workload migration via In-Context Learning

基于上下文学习的深度学习工作负载迁移智能体框架

Qiyue Liang, Steven Ingram, George Vanica, Andi Gavrilescu, Newfel Harrat, Hassan Sipra, Sethuraman Sankaran

机构 * Google(谷歌)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15033 2026-06-16 cs.HC cs.CL cs.CY 新提交 62%

Cloze: An Open Research Platform for Studying Human-AI Conversations in Mental Health Contexts

Cloze:一个用于研究心理健康背景下人机对话的开放研究平台

Matthew Flathers, Francesco Cipriani, John Torous

机构 * Beth Israel Deaconess Medical Center(贝塞斯达以色列德acons医疗中心) University College London(伦敦大学学院) Division of Digital Psychiatry(数字精神病学部)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.CY

AI总结 提出开源平台Cloze,支持在心理健康研究中控制、监控人机对话,统一配置模型、指令、安全约束并记录完整溯源,为建立人机交互证据基础提供研究基础设施。

Comments 7 pages, 2 figures. Cloze is released under AGPL-3.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14718 2026-06-16 cs.CY cs.AI 新提交 62%

Gender Differences in AI Literacy Workshop Outcomes and Deepfake Engagement

AI素养工作坊成果与深度伪造参与中的性别差异

Jake Renzella, Christian Bergh, Natasha Banks, Alexandra Vassar

机构 * University of New South Wales(新南威尔士大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究通过统计回归分析澳大利亚中学生AI素养工作坊前后数据,发现男性在STEM职业兴趣上显著更高,女性更常使用AI工具,且工作坊后女性在AI知识和职业兴趣上提升更大,部分缩小了性别差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06646 2026-06-16 cs.CL cs.AI 新提交 62%

CAF-Gen: A Multi-Agent System for Enriching Argumentation Structures

CAF-Gen: 一种用于丰富论证结构的多智能体系统

Jakub Bąba, Jarosław A. Chudziak

机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(电子与信息技术学院,华沙技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出CAF-Gen多智能体框架,通过迭代创建-评审流程将浅层论证结构自动转换为符合Carneades论证框架的丰富模型,克服单次生成的结构不稳定性。

Comments Accepted for publication in the proceedings of ICCCI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14466 2026-06-15 cs.SD cs.AI cs.LG 新提交 62%

The Perceived Fragility of Explanations in Audio Models: Manipulation of Attribution with Unchanged Predictions

音频模型中解释的感知脆弱性:在预测不变的情况下操纵归因

Piotr Kitłowski, Dominik Wiącek, Mateusz Modrzejewski

机构 * University of Warsaw(华沙大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出一种心理声学框架,通过优化不可听扰动来解耦模型归因与分类,证明在音频深度伪造检测中可系统扭曲解释热图而保持预测标签不变。

Comments Accepted to the ICML 2026 Workshop on Machine Learning for Audio: 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14386 2026-06-15 cs.LG cs.AI q-fin.PM 新提交 62%

Discovery under Hypothesis Redundancy: A Geometric Theory of Discovery Bottlenecks

假设冗余下的发现:发现瓶颈的几何理论

Li Xia, Baoxun Wang

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院) Platform & Content Group, Tencent(腾讯平台与内容事业群)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出搜索压缩假说,通过谱压缩、正交逃逸和残差信号对齐三个几何条件解释混合发现系统的优势,实验表明仅新颖性不足,需预测对齐。

Comments 23 pages, 1 figure, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12754 2026-06-12 cs.CL cs.AI 新提交 62%

LLMs Can Better Capture Human Judgments--With the Right Prompts

LLMs 能更好地捕捉人类判断——使用合适的提示

Danica Dillion, Chen Cecilia Liu, Baihui Wang, Daniele Barolo, Tanmay Rajore, Niket Tandon, Pranathi Ravikumar, Kurt Gray

机构 * Complexity Science Hub, Vienna(维也纳复杂科学中心) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of Chicago(芝加哥大学) Microsoft Research(微软研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过简单提示策略,LLMs 能恢复人类反应的完整分布,并减少对措辞变化的敏感性,提升 AI-人类对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11262 2026-06-11 cs.LG cs.AI 新提交 62%

PermDoRA -- Understanding Adapter Interference in Language Models: Limits of Parameter-Space Geometry

PermDoRA -- 理解语言模型中的适配器干扰:参数空间几何的局限性

Gowtham Sivaramakrishnan, Sarvesha Kumar Kombaiah Seetha, Kishan Gupta Balaji, Santhosh Baradwaj Vaduvur Ranganathan

机构 * Independent Researcher(独立研究员)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究适配器组合中的干扰是否源于线性参数更新重叠,通过DoRA-RBAC框架和几何感知合并策略实验,发现参数空间几何不是干扰主因,而是共享非线性表示中的交互。

Comments 18 Pages, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09848 2026-06-10 cs.HC cs.AI cs.CY 新提交 62%

Human-AI Coordination Zones: A Framework for Designing Human-in-the-Loop Experiences with Agentic AI

人机协调区域:设计具有代理性AI的人机协同体验框架

James Pierce, Vaiva Kalnikaitė, Siddharth Gupta, Brian Granger

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 提出人机协调框架,通过显著性、参与度和活动三个维度定义协调区域,并提供输入分类、协调曲线和设计模式,用于生成、分析和沟通人机交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 62%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07604 2026-06-09 cs.LG cs.AI 新提交 62%

Contribution Weights: A Geometrical Analysis of Self-Attention Transformers

贡献权重:自注意力Transformer的几何分析

Harry Jake Cunningham, Nicola Muca Cirone

机构 * University of Cambridge(剑桥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出基于投影的贡献权重度量,结合注意力权重、值向量大小和方向对齐,更准确识别关键令牌,并揭示注意力汇的主动抑制功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07533 2026-06-09 cs.CL cs.AI cs.SD 新提交 62%

Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

桥接传统可解释性方法与多模态多语言模型:基于XAI的分析

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出多模态Shapley值框架,结合频谱图引导的音素对齐(SGPA)预处理方法,实现文本与音频特征的可解释性归因,并开源计算包与可视化工具。

Comments Bachelor's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07531 2026-06-09 cs.CL cs.AI 新提交 62%

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台

Jakub Muszyński, Paweł Pozorski, Maria Ganzha

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。

Comments Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07313 2026-06-08 cs.CL cs.AI 新提交 62%

SV-Detect: AI-generated Text Detection with Steering Vectors

SV-Detect: 基于引导向量的AI生成文本检测

Mikhail Vishnyakov, Tatiana Gaintseva

机构 * Independent Researcher(独立研究者) Queen Mary University of London(伦敦女王学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出从冻结语言模型的隐藏表示中提取引导向量,通过层间投影特征训练轻量分类器,实现跨域、跨模型和编辑攻击下的机器生成文本检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13254 2026-06-12 cs.CL 新提交 61%

Evaluating Pluralism in LLMs through Latent Perspectives

通过潜在视角评估LLM中的多元主义

Laura Majer, Jan Šnajder, Martin Tutek

机构 * University of Helsinki(赫尔辛基大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 其他安全 :alignment(abstract,comments);分类 cs.CL

AI总结 提出一种领域无关的多层无监督框架,从LLM生成文本中提取潜在视角,评估多元主义差距,发现稀有视角仍被不成比例地低估。

Comments Pluralistic Alignment Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏