arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 580 篇

2606.18688 2026-06-18 cs.LG cs.AI 新提交 62%

Dual-Channel Grounded World Modeling (DCGWM): Structural Prevention of Objective Interference Collapse via Heterogeneous External Grounding with Inward-Only Gradient Flow

双通道接地世界建模 (DCGWM):通过异构外部接地与内向梯度流结构性防止目标干扰崩溃

Akshay Hazare

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出双通道接地世界建模(DCGWM),通过分区潜空间和内向梯度流,结构性防止联合嵌入预测架构中多目标接地导致的目标干扰崩溃。

Comments Position paper. Experimental validation in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17454 2026-06-18 cs.AI cs.LG 新提交 62%

Dissecting model behavior through agent trajectories

通过智能体轨迹剖析模型行为

Gaurav Gupta, Vatshank Chaturvedi, Jun Huan, Anoop Deoras

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出“意图-执行差距”概念,并设计Simple Strands Agent(SSA)框架,通过分析138k条轨迹揭示模型在自主问题解决中的行为差异。

Comments 106 pages, 50 Figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17830 2026-06-17 cs.LG cs.AI 新提交 62%

Functional Equivalence in Attention: A Comprehensive Study with Applications to Linear Mode Connectivity

注意力中的功能等价性:一项综合研究及其在线性模式连通性中的应用

Viet-Hoang Tran, Vinh Khanh Bui, Van-Hoan Trinh, Tan Lai Ngoc, Tan M. Nguyen

机构 * National University of Singapore(新加坡国立大学) Center for AI Research, VinUniversity(Vin大学人工智能研究中心) Independent Researcher(独立研究者) Technical University of Munich(慕尼黑技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文形式化研究了Transformer中位置编码对功能等价性的影响,发现正弦编码保持原始注意力的对称性,而旋转编码显著减少对称群从而增强表达力,并通过对齐算法实证了位置编码对线性模式连通性的关键作用。

Comments Published at the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15994 2026-06-16 cs.AI cs.LG 新提交 62%

Agentic Framework for Deep Learning workload migration via In-Context Learning

基于上下文学习的深度学习工作负载迁移智能体框架

Qiyue Liang, Steven Ingram, George Vanica, Andi Gavrilescu, Newfel Harrat, Hassan Sipra, Sethuraman Sankaran

机构 * Google(谷歌)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15033 2026-06-16 cs.HC cs.CL cs.CY 新提交 62%

Cloze: An Open Research Platform for Studying Human-AI Conversations in Mental Health Contexts

Cloze:一个用于研究心理健康背景下人机对话的开放研究平台

Matthew Flathers, Francesco Cipriani, John Torous

机构 * Beth Israel Deaconess Medical Center(贝塞斯达以色列德acons医疗中心) University College London(伦敦大学学院) Division of Digital Psychiatry(数字精神病学部)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.CY

AI总结 提出开源平台Cloze,支持在心理健康研究中控制、监控人机对话,统一配置模型、指令、安全约束并记录完整溯源,为建立人机交互证据基础提供研究基础设施。

Comments 7 pages, 2 figures. Cloze is released under AGPL-3.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14718 2026-06-16 cs.CY cs.AI 新提交 62%

Gender Differences in AI Literacy Workshop Outcomes and Deepfake Engagement

AI素养工作坊成果与深度伪造参与中的性别差异

Jake Renzella, Christian Bergh, Natasha Banks, Alexandra Vassar

机构 * University of New South Wales(新南威尔士大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究通过统计回归分析澳大利亚中学生AI素养工作坊前后数据,发现男性在STEM职业兴趣上显著更高,女性更常使用AI工具,且工作坊后女性在AI知识和职业兴趣上提升更大,部分缩小了性别差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06646 2026-06-16 cs.CL cs.AI 新提交 62%

CAF-Gen: A Multi-Agent System for Enriching Argumentation Structures

CAF-Gen: 一种用于丰富论证结构的多智能体系统

Jakub Bąba, Jarosław A. Chudziak

机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(电子与信息技术学院,华沙技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出CAF-Gen多智能体框架,通过迭代创建-评审流程将浅层论证结构自动转换为符合Carneades论证框架的丰富模型,克服单次生成的结构不稳定性。

Comments Accepted for publication in the proceedings of ICCCI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14466 2026-06-15 cs.SD cs.AI cs.LG 新提交 62%

The Perceived Fragility of Explanations in Audio Models: Manipulation of Attribution with Unchanged Predictions

音频模型中解释的感知脆弱性:在预测不变的情况下操纵归因

Piotr Kitłowski, Dominik Wiącek, Mateusz Modrzejewski

机构 * University of Warsaw(华沙大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出一种心理声学框架,通过优化不可听扰动来解耦模型归因与分类,证明在音频深度伪造检测中可系统扭曲解释热图而保持预测标签不变。

Comments Accepted to the ICML 2026 Workshop on Machine Learning for Audio: 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14386 2026-06-15 cs.LG cs.AI q-fin.PM 新提交 62%

Discovery under Hypothesis Redundancy: A Geometric Theory of Discovery Bottlenecks

假设冗余下的发现:发现瓶颈的几何理论

Li Xia, Baoxun Wang

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院) Platform & Content Group, Tencent(腾讯平台与内容事业群)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出搜索压缩假说,通过谱压缩、正交逃逸和残差信号对齐三个几何条件解释混合发现系统的优势,实验表明仅新颖性不足,需预测对齐。

Comments 23 pages, 1 figure, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12754 2026-06-12 cs.CL cs.AI 新提交 62%

LLMs Can Better Capture Human Judgments--With the Right Prompts

LLMs 能更好地捕捉人类判断——使用合适的提示

Danica Dillion, Chen Cecilia Liu, Baihui Wang, Daniele Barolo, Tanmay Rajore, Niket Tandon, Pranathi Ravikumar, Kurt Gray

机构 * Complexity Science Hub, Vienna(维也纳复杂科学中心) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of Chicago(芝加哥大学) Microsoft Research(微软研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过简单提示策略,LLMs 能恢复人类反应的完整分布,并减少对措辞变化的敏感性,提升 AI-人类对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11262 2026-06-11 cs.LG cs.AI 新提交 62%

PermDoRA -- Understanding Adapter Interference in Language Models: Limits of Parameter-Space Geometry

PermDoRA -- 理解语言模型中的适配器干扰:参数空间几何的局限性

Gowtham Sivaramakrishnan, Sarvesha Kumar Kombaiah Seetha, Kishan Gupta Balaji, Santhosh Baradwaj Vaduvur Ranganathan

机构 * Independent Researcher(独立研究员)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究适配器组合中的干扰是否源于线性参数更新重叠,通过DoRA-RBAC框架和几何感知合并策略实验,发现参数空间几何不是干扰主因,而是共享非线性表示中的交互。

Comments 18 Pages, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09848 2026-06-10 cs.HC cs.AI cs.CY 新提交 62%

Human-AI Coordination Zones: A Framework for Designing Human-in-the-Loop Experiences with Agentic AI

人机协调区域:设计具有代理性AI的人机协同体验框架

James Pierce, Vaiva Kalnikaitė, Siddharth Gupta, Brian Granger

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 提出人机协调框架,通过显著性、参与度和活动三个维度定义协调区域,并提供输入分类、协调曲线和设计模式,用于生成、分析和沟通人机交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 62%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07604 2026-06-09 cs.LG cs.AI 新提交 62%

Contribution Weights: A Geometrical Analysis of Self-Attention Transformers

贡献权重:自注意力Transformer的几何分析

Harry Jake Cunningham, Nicola Muca Cirone

机构 * University of Cambridge(剑桥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出基于投影的贡献权重度量,结合注意力权重、值向量大小和方向对齐,更准确识别关键令牌,并揭示注意力汇的主动抑制功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07533 2026-06-09 cs.CL cs.AI cs.SD 新提交 62%

Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

桥接传统可解释性方法与多模态多语言模型:基于XAI的分析

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出多模态Shapley值框架,结合频谱图引导的音素对齐(SGPA)预处理方法,实现文本与音频特征的可解释性归因,并开源计算包与可视化工具。

Comments Bachelor's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07531 2026-06-09 cs.CL cs.AI 新提交 62%

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台

Jakub Muszyński, Paweł Pozorski, Maria Ganzha

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。

Comments Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07313 2026-06-08 cs.CL cs.AI 新提交 62%

SV-Detect: AI-generated Text Detection with Steering Vectors

SV-Detect: 基于引导向量的AI生成文本检测

Mikhail Vishnyakov, Tatiana Gaintseva

机构 * Independent Researcher(独立研究者) Queen Mary University of London(伦敦女王学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出从冻结语言模型的隐藏表示中提取引导向量,通过层间投影特征训练轻量分类器,实现跨域、跨模型和编辑攻击下的机器生成文本检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13254 2026-06-12 cs.CL 新提交 61%

Evaluating Pluralism in LLMs through Latent Perspectives

通过潜在视角评估LLM中的多元主义

Laura Majer, Jan Šnajder, Martin Tutek

机构 * University of Helsinki(赫尔辛基大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 其他安全 :alignment(abstract,comments);分类 cs.CL

AI总结 提出一种领域无关的多层无监督框架,从LLM生成文本中提取潜在视角,评估多元主义差距,发现稀有视角仍被不成比例地低估。

Comments Pluralistic Alignment Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17102 2026-08-19 cs.CL eess.AS eess.IV 新提交 57%

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

跨语音与面部的情感:多模态基础模型中的共享情感机制

Xiutian Zhao, Luqi Sun, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心) Group on Language, Audio & Music (GLAM), Imperial College London(伦敦帝国理工学院语言、音频与音乐组)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究在Gemma-4-12B-it等3款多模态基础模型中识别出情感敏感神经元,发现语音与面部情感识别的表征在解码器级部分汇聚,且存在双向因果迁移,为跨模态情感机制提供了新分析。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16686 2026-08-18 cs.HC cs.CL cs.RO 新提交 57%

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

闭合情感循环:具情感动态感知的多模态说话人-听话人共情社交机器人

Zi Haur Pang, Casey Kennington, Tatsuya Kawahara

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出AffectLoop系统,在Misty II机器人上实现多模态情感动态感知的说话人-听话人共情交互,经试点研究验证可提升共情响应与用户满意度。

Comments This paper has been accepted for presentation at APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16681 2026-08-18 cs.CV cs.AI 新提交 57%

Bridging the Gap between Labeled and Unlabeled Data via Unified Flow with Feature Memory Bank

通过带特征记忆库的统一流缩小标注数据与未标注数据之间的差距

Shanwen Wang, Xin Sun, Danfeng Hong, Junyu Dong, Patrick Le Callet

机构 * City University of Macau(澳门城市大学) Southeast University(东南大学) Ocean University of China(中国海洋大学) Nantes Université(南特大学) Ecole Centrale Nantes(南特中央理工学院) CAPACITES SAS CNRS(法国国家科学研究中心) LS2N(南特数字科学实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对半监督语义分割中伪标签质量差的问题,提出带特征记忆库的统一流方法,结合视觉基础模型与遥感领域教师优化标注与未标注数据,在遥感数据集上优于当前最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16237 2026-08-18 cs.SE cs.AI 新提交 57%

Software Engineering for AI-driven Building Operation

面向AI驱动建筑运行的软件工程

Philipp Zech, Sascha Hammes, Johannes Weninger, Jürgen Pannosch, Gernot Steidl

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究针对AI驱动建筑运行部署面临的软件工程挑战,结合跨学科项目识别缺失视角,分享经验与最佳实践,为故障有物理后果的系统的SE4AI奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15762 2026-08-18 cs.OS cs.DC cs.LG 新提交 57%

Global Simulation-Guided Dynamic Operator Scheduling for Efficient Multi-Tenant Model Serving

面向高效多租户模型服务的全局仿真引导型动态算子调度

Weinan Liu, Zeyuan Ding, Dian Ding, Chengcheng Wan, Lu Tang, Guangtao Xue, Jiwu Shu, Yiming Zhang

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出SliceScheduler系统,通过全局映射图、全局仿真器等组件实现算子级调度,在维持SLA违规率低于9%的同时,将多租户LLM服务的令牌吞吐量提升1.10-2.29倍,有效提高GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15687 2026-08-18 cs.AI 新提交 57%

THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts

THESIS-MoE:可训练的分层提取与混合专家模型中谄媚行为的引导

Kareem Hassani, Chaymaa Abbas, Lama Mawlawi, Mariette Awad

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出THESIS-MoE,通过共享对比信号定位MoE模型中谄媚行为的计算子电路,采用有条件干预方法,在保留知识的同时消除了高达90%的信念诱导谄媚行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15085 2026-08-18 cs.CL 新提交 57%

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性

Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14924 2026-08-18 cs.CV cs.AI 新提交 57%

PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining

PaSTel:通过多尺度层级生物先验对比预训练锚定空间转录组学中的组织学

Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati, Walid Abdelmoula, Tommaso Mansi, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 PaSTel是一种整合多尺度生物先验的层级多模态预训练框架,通过三层生物先验设计解决现有空间转录组学方法的局限,在多个下游任务中性能优于现有编码器。

Comments This paper was accepted to the 3rd ICML 2026 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14746 2026-08-18 cs.AI 新提交 57%

Advanced modelling and data analytics in aviation

航空领域的高级建模与数据分析

Aziida Nanyonga

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究将ML、NLP等高级AI方法应用于航空安全数据,挖掘事故模式、分析非结构化报告,为航空利益相关者提供数据驱动的安全决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14580 2026-08-18 cs.AI cs.IR 新提交 57%

OGX: An Open-Source, Vendor-Neutral Generative AI Application Server

OGX:开源、厂商中立的生成式AI应用服务器

Francisco Javier Arceo, Sébastien Han, Matthew Farrellee, Charlie Doern, Yuan Tang, Derek Higgins, Varsha Prasad Narsing, Gordon Sim, Sumanth Kamenani, Ben Browning, Raghotham Murthy

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 OGX是开源厂商中立的生成式AI应用服务器,支持主流实验室API与多后端,为多款AI开发者工具提供模型无关自托管后端,获超8400 GitHub星标

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13911 2026-08-17 cs.LG 新提交 57%

MedMix: Specialization-Consistent Federated Sparse MoEs under Modality Heterogeneity

MedMix:模态异质性下的专业化一致联邦稀疏混合专家模型

Adiba Orzikulova, Dong Min Kim, Jaehong Yoon, Sung-Ju Lee

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 针对联邦多模态医疗AI的客户端与样本级模态异质性问题,提出MedMix框架,通过模态上下文感知路由、共识引导路由对齐与客户端自适应专家聚合,在多模态医疗数据集上取得最优平均F1值,严重异质性下提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13690 2026-08-17 cs.CV cs.AI 新提交 57%

MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation

MedPlex:用于临床基础医学分割的深度视觉-语言协同适配

Rafi Ibn Sultan, Hui Zhu, Chengyin Li, Dongxiao Zhu

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特医疗集团) Institute for AI and Data Science Wayne State University(韦恩州立大学人工智能与数据科学研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MedPlex是一种端到端VLM框架,通过双向融合和两级概念对齐,实现医学图像分割的视觉-语言协同适配,在CT、MR的多类医学分割任务中达到最优性能。

Comments Accepted By BMVC-2026

详情

展开后加载摘要…

URL PDF HTML 收藏