arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2745 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 585 篇

2606.14386 2026-06-15 cs.LG cs.AI q-fin.PM 新提交 62%

Discovery under Hypothesis Redundancy: A Geometric Theory of Discovery Bottlenecks

假设冗余下的发现:发现瓶颈的几何理论

Li Xia, Baoxun Wang

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院) Platform & Content Group, Tencent(腾讯平台与内容事业群)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出搜索压缩假说,通过谱压缩、正交逃逸和残差信号对齐三个几何条件解释混合发现系统的优势,实验表明仅新颖性不足,需预测对齐。

Comments 23 pages, 1 figure, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12754 2026-06-12 cs.CL cs.AI 新提交 62%

LLMs Can Better Capture Human Judgments--With the Right Prompts

LLMs 能更好地捕捉人类判断——使用合适的提示

Danica Dillion, Chen Cecilia Liu, Baihui Wang, Daniele Barolo, Tanmay Rajore, Niket Tandon, Pranathi Ravikumar, Kurt Gray

机构 * Complexity Science Hub, Vienna(维也纳复杂科学中心) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of Chicago(芝加哥大学) Microsoft Research(微软研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过简单提示策略,LLMs 能恢复人类反应的完整分布,并减少对措辞变化的敏感性,提升 AI-人类对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11262 2026-06-11 cs.LG cs.AI 新提交 62%

PermDoRA -- Understanding Adapter Interference in Language Models: Limits of Parameter-Space Geometry

PermDoRA -- 理解语言模型中的适配器干扰:参数空间几何的局限性

Gowtham Sivaramakrishnan, Sarvesha Kumar Kombaiah Seetha, Kishan Gupta Balaji, Santhosh Baradwaj Vaduvur Ranganathan

机构 * Independent Researcher(独立研究员)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究适配器组合中的干扰是否源于线性参数更新重叠,通过DoRA-RBAC框架和几何感知合并策略实验,发现参数空间几何不是干扰主因,而是共享非线性表示中的交互。

Comments 18 Pages, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09848 2026-06-10 cs.HC cs.AI cs.CY 新提交 62%

Human-AI Coordination Zones: A Framework for Designing Human-in-the-Loop Experiences with Agentic AI

人机协调区域:设计具有代理性AI的人机协同体验框架

James Pierce, Vaiva Kalnikaitė, Siddharth Gupta, Brian Granger

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 提出人机协调框架,通过显著性、参与度和活动三个维度定义协调区域,并提供输入分类、协调曲线和设计模式,用于生成、分析和沟通人机交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 62%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07604 2026-06-09 cs.LG cs.AI 新提交 62%

Contribution Weights: A Geometrical Analysis of Self-Attention Transformers

贡献权重:自注意力Transformer的几何分析

Harry Jake Cunningham, Nicola Muca Cirone

机构 * University of Cambridge(剑桥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出基于投影的贡献权重度量,结合注意力权重、值向量大小和方向对齐,更准确识别关键令牌,并揭示注意力汇的主动抑制功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07533 2026-06-09 cs.CL cs.AI cs.SD 新提交 62%

Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

桥接传统可解释性方法与多模态多语言模型:基于XAI的分析

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出多模态Shapley值框架,结合频谱图引导的音素对齐(SGPA)预处理方法,实现文本与音频特征的可解释性归因,并开源计算包与可视化工具。

Comments Bachelor's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07531 2026-06-09 cs.CL cs.AI 新提交 62%

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台

Jakub Muszyński, Paweł Pozorski, Maria Ganzha

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。

Comments Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07313 2026-06-08 cs.CL cs.AI 新提交 62%

SV-Detect: AI-generated Text Detection with Steering Vectors

SV-Detect: 基于引导向量的AI生成文本检测

Mikhail Vishnyakov, Tatiana Gaintseva

机构 * Independent Researcher(独立研究者) Queen Mary University of London(伦敦女王学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出从冻结语言模型的隐藏表示中提取引导向量,通过层间投影特征训练轻量分类器,实现跨域、跨模型和编辑攻击下的机器生成文本检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13254 2026-06-12 cs.CL 新提交 61%

Evaluating Pluralism in LLMs through Latent Perspectives

通过潜在视角评估LLM中的多元主义

Laura Majer, Jan Šnajder, Martin Tutek

机构 * University of Helsinki(赫尔辛基大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 其他安全 :alignment(abstract,comments);分类 cs.CL

AI总结 提出一种领域无关的多层无监督框架,从LLM生成文本中提取潜在视角,评估多元主义差距,发现稀有视角仍被不成比例地低估。

Comments Pluralistic Alignment Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19168 2026-08-20 cs.LG 新提交 57%

Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training

学习后遗忘:预训练中单示例反事实的测量

Zachary Speck, Asa Shepard

机构 * Arizona State University(亚利桑那州立大学) Williams College(威廉姆斯学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本研究通过对32个GPT-2模型的小规模预训练反事实实验,测量单示例注入对模型的短期影响,发现该影响会在训练后期衰减,且未检测到长期显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18580 2026-08-20 cs.AI cs.PL 新提交 57%

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

FACET:在终端任务合成中保留源意图与可执行状态

Kou Shi, Zun Wang, Qisheng Su, Shiting Huang, Ziao Zhang, Zhen Fang, Qingnan Ren, Jin Liu, Yu Zeng, Yiming Zhao, Lin Chen, Zehui Chen, Feng Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。

Comments this https URL (https://stokou.github.io/FACET-Terminal/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18165 2026-08-20 cs.AI cs.FL cs.LO 新提交 57%

RDFdL: Integrating RDF with Differential Dynamic Logic

RDFdL:将RDF与微分动态逻辑(Differential Dynamic Logic)集成

Yuyang Li, Lukas Kubelka, Julia Butte, Tobias Käfer

机构 * Institute AIFB, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院AIFB研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 针对RDF知识图谱无法推理物理系统动态行为的问题,提出将RDF与微分动态逻辑集成的RDFdL框架,实现静态与动态知识的统一表示推理,可用于制造业相关场景。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17102 2026-08-19 cs.CL eess.AS eess.IV 新提交 57%

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

跨语音与面部的情感:多模态基础模型中的共享情感机制

Xiutian Zhao, Luqi Sun, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心) Group on Language, Audio & Music (GLAM), Imperial College London(伦敦帝国理工学院语言、音频与音乐组)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究在Gemma-4-12B-it等3款多模态基础模型中识别出情感敏感神经元,发现语音与面部情感识别的表征在解码器级部分汇聚,且存在双向因果迁移,为跨模态情感机制提供了新分析。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16686 2026-08-18 cs.HC cs.CL cs.RO 新提交 57%

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

闭合情感循环:具情感动态感知的多模态说话人-听话人共情社交机器人

Zi Haur Pang, Casey Kennington, Tatsuya Kawahara

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出AffectLoop系统,在Misty II机器人上实现多模态情感动态感知的说话人-听话人共情交互,经试点研究验证可提升共情响应与用户满意度。

Comments This paper has been accepted for presentation at APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16681 2026-08-18 cs.CV cs.AI 新提交 57%

Bridging the Gap between Labeled and Unlabeled Data via Unified Flow with Feature Memory Bank

通过带特征记忆库的统一流缩小标注数据与未标注数据之间的差距

Shanwen Wang, Xin Sun, Danfeng Hong, Junyu Dong, Patrick Le Callet

机构 * City University of Macau(澳门城市大学) Southeast University(东南大学) Ocean University of China(中国海洋大学) Nantes Université(南特大学) Ecole Centrale Nantes(南特中央理工学院) CAPACITES SAS CNRS(法国国家科学研究中心) LS2N(南特数字科学实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对半监督语义分割中伪标签质量差的问题,提出带特征记忆库的统一流方法,结合视觉基础模型与遥感领域教师优化标注与未标注数据,在遥感数据集上优于当前最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16237 2026-08-18 cs.SE cs.AI 新提交 57%

Software Engineering for AI-driven Building Operation

面向AI驱动建筑运行的软件工程

Philipp Zech, Sascha Hammes, Johannes Weninger, Jürgen Pannosch, Gernot Steidl

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究针对AI驱动建筑运行部署面临的软件工程挑战,结合跨学科项目识别缺失视角,分享经验与最佳实践,为故障有物理后果的系统的SE4AI奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15762 2026-08-18 cs.OS cs.DC cs.LG 新提交 57%

Global Simulation-Guided Dynamic Operator Scheduling for Efficient Multi-Tenant Model Serving

面向高效多租户模型服务的全局仿真引导型动态算子调度

Weinan Liu, Zeyuan Ding, Dian Ding, Chengcheng Wan, Lu Tang, Guangtao Xue, Jiwu Shu, Yiming Zhang

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出SliceScheduler系统,通过全局映射图、全局仿真器等组件实现算子级调度,在维持SLA违规率低于9%的同时,将多租户LLM服务的令牌吞吐量提升1.10-2.29倍,有效提高GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15687 2026-08-18 cs.AI 新提交 57%

THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts

THESIS-MoE:可训练的分层提取与混合专家模型中谄媚行为的引导

Kareem Hassani, Chaymaa Abbas, Lama Mawlawi, Mariette Awad

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出THESIS-MoE,通过共享对比信号定位MoE模型中谄媚行为的计算子电路,采用有条件干预方法,在保留知识的同时消除了高达90%的信念诱导谄媚行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15085 2026-08-18 cs.CL 新提交 57%

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性

Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14924 2026-08-18 cs.CV cs.AI 新提交 57%

PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining

PaSTel:通过多尺度层级生物先验对比预训练锚定空间转录组学中的组织学

Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati, Walid Abdelmoula, Tommaso Mansi, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 PaSTel是一种整合多尺度生物先验的层级多模态预训练框架,通过三层生物先验设计解决现有空间转录组学方法的局限,在多个下游任务中性能优于现有编码器。

Comments This paper was accepted to the 3rd ICML 2026 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14746 2026-08-18 cs.AI 新提交 57%

Advanced modelling and data analytics in aviation

航空领域的高级建模与数据分析

Aziida Nanyonga

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究将ML、NLP等高级AI方法应用于航空安全数据,挖掘事故模式、分析非结构化报告,为航空利益相关者提供数据驱动的安全决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14580 2026-08-18 cs.AI cs.IR 新提交 57%

OGX: An Open-Source, Vendor-Neutral Generative AI Application Server

OGX:开源、厂商中立的生成式AI应用服务器

Francisco Javier Arceo, Sébastien Han, Matthew Farrellee, Charlie Doern, Yuan Tang, Derek Higgins, Varsha Prasad Narsing, Gordon Sim, Sumanth Kamenani, Ben Browning, Raghotham Murthy

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 OGX是开源厂商中立的生成式AI应用服务器,支持主流实验室API与多后端,为多款AI开发者工具提供模型无关自托管后端,获超8400 GitHub星标

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13911 2026-08-17 cs.LG 新提交 57%

MedMix: Specialization-Consistent Federated Sparse MoEs under Modality Heterogeneity

MedMix:模态异质性下的专业化一致联邦稀疏混合专家模型

Adiba Orzikulova, Dong Min Kim, Jaehong Yoon, Sung-Ju Lee

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 针对联邦多模态医疗AI的客户端与样本级模态异质性问题,提出MedMix框架,通过模态上下文感知路由、共识引导路由对齐与客户端自适应专家聚合,在多模态医疗数据集上取得最优平均F1值,严重异质性下提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13690 2026-08-17 cs.CV cs.AI 新提交 57%

MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation

MedPlex:用于临床基础医学分割的深度视觉-语言协同适配

Rafi Ibn Sultan, Hui Zhu, Chengyin Li, Dongxiao Zhu

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特医疗集团) Institute for AI and Data Science Wayne State University(韦恩州立大学人工智能与数据科学研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MedPlex是一种端到端VLM框架,通过双向融合和两级概念对齐,实现医学图像分割的视觉-语言协同适配,在CT、MR的多类医学分割任务中达到最优性能。

Comments Accepted By BMVC-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13617 2026-08-17 cs.AI cs.SC 新提交 57%

How Compliant is Sepsis Treatment? An Expert-Guided Neuro-symbolic Pipeline for Generating Clinical Compliance Insights

脓毒症治疗的依从性如何?一种专家指导的神经符号管道用于生成临床依从性见解

Himanshu Tripathi, Kaushik Roy, Subash Neupane, Shahram Rahimi

机构 * The University of Alabama(阿拉巴马大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究针对脓毒症治疗依从性验证问题,提出专家指导的神经符号管道,结合大语言模型语义规范化与Sugeno模糊推理系统,在MIMIC-IV数据集上揭示了抗生素时机等关键依从性问题及相关临床差异。

Comments This has been submitted and accepted in NeSy 2026 (https://2026.nesyconf.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13029 2026-08-14 q-bio.GN cs.AI cs.SE 新提交 57%

Static analysis-guided agentic AI translation enables Rust as a full stack bioinformatics language

静态分析引导的智能体AI翻译使Rust成为全栈生物信息学语言

Johan Henriksson

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究结合智能体AI与静态分析,将生物信息学遗留代码翻译为Rust,在Bascet软件上实现规模、构建时间、性能的显著优化,且支持原生Windows运行,为生物信息学软件大规模重构提供了低成本方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13450 2026-08-14 cs.SE cs.CR cs.LG 新提交 57%

LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles

大语言模型辅助的自动驾驶车辆中攻击者可及软件弱点的动态威胁分析

Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman, Md Rayhanur Rahman

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 该研究针对自动驾驶车辆软件弱点的动态威胁分析难题,探究LLM辅助Autoware的自动化测试工件生成,发现构建集成是核心障碍,推理模型编译测试用例的表现优于代码专用模型。

Comments 17 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12689 2026-08-14 cs.CV cs.AI 新提交 57%

Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging

Mr3D-VL:面向多参数3D磁共振成像的通用视觉语言基础模型

Zhi Qiao, Xintong Wu, Yichu He, Feng Shi

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文针对现有3D视觉语言模型无法满足多参数3D MRI跨模态协同推理需求的问题,提出Mr3D-VL模型,通过特定设计实现性能提升,在多项任务上优于同规模的领域及通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12677 2026-08-14 cs.AI cs.CV 新提交 57%

The Role of Natural Language Understanding in Multimodal Video-Based Dengue Diagnosis

自然语言理解在基于多模态视频的登革热诊断中的作用

Danial Sharifrazi, Saadat Behzadi, Julakha Jahan Jui, Mojtaba Mohammadi, Nouman Javed, Roohallah Alizadehsani, Prasad N. Paradkar, Asim Bhatti

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出基于YOLO和CLIP的视觉-语言框架,从视频中分类未受感染与DENV2感染的蚊子,帧级准确率达98.54%、灵敏度达99.91%,证实该框架可用于分析感染相关生物行为。

详情

展开后加载摘要…

URL PDF HTML 收藏