arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-26 至 2026-05-26 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 26 篇

2605.12374 2026-05-26 cs.CV cs.AI cs.LG 81%

Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

填补GAP:多模态大语言模型中视觉推理的粒度对齐范式

Yanting Miao, Yutao Sun, Dexin Wang, Mengyu Zhou, Pascal Poupart, Lei Lv, Qi Zhao, Li Wang, Hao Li, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba University of Waterloo(阿里大学水力学院) Vector Institute(向量研究所) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出GAP(粒度对齐范式),通过特征级、上下文级和能力引导级对齐,解决多模态大语言模型中视觉潜在推理的特征空间不匹配问题,提升感知与推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00682 2026-05-26 cs.IR cs.AI 79%

RecGOAT: Graph Optimal Adaptive Transport for LLM-Enhanced Multimodal Recommendation with Dual Semantic Alignment

RecGOAT: 用于LLM增强多模态推荐的图最优自适应传输与双语义对齐

Yuecheng Li, Hengwei Ju, Zeyu Song, Wei Yang, Chi Lu, Peng Jiang, Kun Gai

机构 * Fudan University(复旦大学) University of Southern California(南加州大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 针对生成式语言模型表示与ID协同信号之间的语义异质性,提出基于图神经网络和最优传输理论的双粒度语义对齐框架RecGOAT,通过实例级和分布级对齐实现统一特征空间,理论证明其表示误差更低,实验达到最优性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25189 2026-05-26 cs.LG cs.CL 76%

Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

方向对齐缓解语言模型强化学习中的奖励黑客问题

Wenlong Deng, Jiaji Huang, Kaan Ozkara, Yushu Li, Christos Thrampoulidis, Xiaoxiao Li, Youngsuk Park

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Amazon(亚马逊)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.LG

AI总结 通过分析强化学习更新的几何结构,发现奖励黑客源于优化偏离稳定低维学习轨迹,提出可信方向投影方法约束梯度在干净参考子空间内,延迟捷径利用并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22005 2026-05-26 cs.LG cs.AI cs.CL 75%

Check Your LLM's Secret Dictionary! Five Lines of Code Reveal What Your LLM Learned (Including What It Shouldn't Have)

检查你的大语言模型的秘密词典!五行代码揭示你的大语言模型学到了什么(包括它不应该学到的)

Hisashi Miyashita

机构 * Mgnite Inc.(Mgnite公司)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过对lm_head权重矩阵进行奇异值分解(仅需五行PyTorch代码且无需模型推理),直接从模型权重中揭示可解释的语义子空间,并发现模型训练数据组成和策展哲学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26004 2026-05-26 cs.CV cs.CL 74%

MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models

MAGIC: 面向视觉语言模型的多模态对齐与接地感知指令核心集

Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 提出MAGIC方法,利用预训练VLM中的多模态增益、桥接相关性和技能神经元签名三种内在信号,通过无训练、前向传播的核心集选择,构建紧凑且行为保真的子集用于多模态指令微调,在20%预算下达到甚至超越全微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10644 2026-05-26 cs.AI cs.CL cs.CR cs.HC cs.MA 73%

From Multi-Agent Systems and the Semantic Web to Agentic AI: A Unified Narrative of the Web of Agents

从多智能体系统和语义网到智能体AI:智能体网络的统一叙事

Tatiana Petrova, Boris Bliznioukov, Aleksandr Puzikov, Radu State

机构 * SEDAN - SnT University of Luxembourg(卢森堡大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出智能体网络(WoA)经历了从平台端协调(第一代)、数据端标注(第二代)到模型端解释(第三代)的语义努力迁移,并分析了各代失败模式及当前开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24867 2026-05-26 cs.AI cs.CL cs.NI 62%

Clustering as Reasoning: A $k$-Means Interpretation of Chain-of-Thought Graph Learning

聚类即推理:思维链图学习的 $k$-均值解释

Xuanting Xie, Zhaochen Guo, Bingheng Li, Xingtong Yu, Zhifei Liao, Zhao Kang, Yuan Fang

机构 * University of Electronic Science and Technology of China(电子科技大学) Singapore Management University(新加坡国立大学) Michigan State University(密歇根州立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出KCoT框架,通过将Transformer块与$k$-均值算法建立数学对应,将思维链推理与图表示学习统一,实现迭代语义-拓扑交互,在标准基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24856 2026-05-26 cs.LG cs.AI 62%

The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth

概念分配区:追踪概念如何跨越Transformer深度形成

James Henry

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出概念分配区(CAZ)框架,通过层间度量(分离度、概念一致性、概念速度)检测概念在残差流中逐渐形成的深度区间,并在34个模型上验证了分离曲线的多模态性及温和CAZ的因果活性。

Comments 34 models, 8 architectural families, 7 concepts. Companion papers: GEM (arXiv forthcoming), CAZ Validation (arXiv forthcoming), PRH Validation (arXiv forthcoming). Code: https://github.com/jamesrahenry/Rosetta_Tools

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24754 2026-05-26 cs.CV cs.AI cs.LG 62%

Motion-Compensated Weight Compression

运动补偿权重压缩

Ismail Lamaakal

机构 * Multidisciplinary Faculty of Nador Mohammed Premier University(纳多莫哈梅德 premier 大学多学科学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出运动补偿权重压缩(MCWC)方法,通过对齐置换对称块并利用层序预测和熵编码,有效压缩神经网络权重,在Transformer语言建模和视觉分类任务中提升率-精度帕累托前沿。

Comments 54 pages, 17 tables, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02605 2026-05-26 cs.NE cs.AI cs.CL q-bio.NC 62%

Fine-Tuning Language Models to Know What They Know

微调语言模型使其了解自身所知

Sangjun Park, Elliot Meyerson, Xin Qiu, Risto Miikkulainen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cognizant AI Lab(认知人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种框架,通过进化策略对齐方法(ESMA)在控制偏差的同时提升大语言模型的元认知能力,并在未见数据集、语言和新知识上展现出鲁棒泛化性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24004 2026-05-26 cs.AI cs.CV cs.LG cs.RO 62%

Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving

推理--想象--行动:基于世界模型的闭环LLM自动驾驶决策

Zhengqi Sun, Yiwen Sun, Boxuan Liu, Tailai Chen, Tianxu Guo, Jiabin Liu

机构 * 1Department of Information Management, Peking University, Beijing 100871, China 2School of Intelligence Science Technology, Peking University, Beijing 100871, China 3State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing 100080, China 4Yuanpei College, Peking University, Beijing 100871, China 5China Agricultural University, Beijing, China 6CRSC Research \& Design Institute Group Co., Ltd., Beijing, China

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出Reason--Imagine--Act (RIA)闭环框架,结合LLM推理器与动作条件世界模型进行在线安全验证,在CARLA点目标协议下实现80.05%路线完成率、51.10%到达率和0.20%碰撞率。

Comments Accepted by the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026). 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25748 2026-05-26 cs.AI 57%

Agent-Centric Social Trajectory Prediction: A Free Energy Principle Perspective

以智能体为中心的社交轨迹预测:自由能原理视角

Yanping Wu, Ji Zhang, Hao Chen, Edmond S. L. Ho, Chongfeng Wei

机构 * University of Glasgow(格拉斯哥大学) Southwest Jiaotong University(西南交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对现有轨迹预测方法依赖全局状态、部分可观测下信念推理不足及缺乏认知行为约束的问题,提出基于自由能原理的智能体中心轨迹预测框架FEP-Diff,通过双分支时空编码器、目标条件信念学习器和残差扩散轨迹生成器,在受限可观测条件下实现认知合理的预测。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18172 2026-05-26 cs.AI 57%

Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs

可视化不可见:生成式视觉定位赋能多模态大语言模型的通用脑电图理解

Jun-Yu Pan, Yansen Wang, Enze Zhang, Bao-Liang Lu, Wei-Long Zheng, Dongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出生成式视觉定位(GVG)框架,通过脑电图到图像的生成模型作为视觉翻译器,为多模态大语言模型提供结构化视觉上下文,以增强非视觉脑电图的理解和临床状态解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24639 2026-05-26 cs.CV cs.AI 57%

DisDop: Distillation with Domain Priors for Open-Vocabulary Aerial Object Detection

DisDop: 基于领域先验蒸馏的开放词汇航空目标检测

Ruihao Xu, Yong Liu, Yansong Tang, Sule Bai, Xubing Ye, Bingyao Yu, Yutao Guo, Jiwen Lu, Jie Zhou

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出DisDop框架,通过从遥感基础模型(RemoteCLIP和DINOv3)中系统蒸馏多级领域先验知识到轻量级检测器,实现开放词汇航空目标检测的最新性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22631 2026-05-26 cs.MS cs.LG cs.LO cs.NA cs.PL math.NA 57%

TorchLean: Formalizing Neural Networks in Lean

TorchLean: 在 Lean 中形式化神经网络

Robert Joseph George, Jennifer Cruden, Will Adkisson, Xiangru Zhong, Huan Zhang, Anima Anandkumar

机构 * California Institute of Technology(加利福尼亚理工学院) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 提出 TorchLean 框架,在 Lean 4 中统一神经网络的执行、验证与定理证明,通过共享语义弥合执行网络与分析工件之间的语义鸿沟。

Comments 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24351 2026-05-26 cs.CL 57%

How Much Structure Do LLMs Need? Evaluating LLMs for Bibliometric Cluster Description

LLM 需要多少结构?评估 LLM 用于文献计量聚类描述

Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez

机构 * School of Information Technology(信息科技学院) Department of Mathematics and Statistics(数学与统计学系) York University(约克大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过六种不同证据和结构水平的流水线,评估文献计量结构是否改善 LLM 辅助的聚类描述生成,发现混合工作流(算法提供可审计结构,LLM 生成可读描述)效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24138 2026-05-26 cs.SE cs.AI 57%

Understanding Conversational Patterns in Multi-agent Programming: A Case Study on Fibonacci Game Development

多智能体编程中的对话模式理解:以斐波那契游戏开发为例

Srijita Basu, Viktor Kjellberg, Simin Sun, Bengt Haraldsson, Md. Abu Ahammed Babu, Wilhelm Meding, Farnaz Fotrousi, Miroslaw Staron

机构 * Chalmers University of Technology University of Gothenburg Gothenburg Sweden Research \& Development, Volvo Car Corporation Gothenburg Sweden University of Gothenburg Research \& Development, Volvo Car Corporation

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过分析12种开源LLM组合中设计者与程序员智能体的对话,揭示了多智能体交互的效率、一致性和有效性三个关键维度,发现DeepSeek-R1:DeepSeek-R1对能从首次迭代起稳定收敛到正确解,而其他组合则存在发散或错误共识问题。

Comments 10 pages, 7 figures, AIware, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23924 2026-05-26 cs.CL cs.IR q-fin.GN 57%

Improving the Completeness and Comparability of Segment Disclosures: A Large Language Model Approach

提高分部披露的完整性和可比性:一种大语言模型方法

Yue Liu, Zhiyuan Cheng, Longying Lai

机构 * Rutgers Business School(罗格斯商学院) Rutgers University - Newark(罗格斯大学-新布朗斯维尔回声分校) School of Engineering(工程学院) Stanford University(斯坦福大学) Simon Business School(西蒙商学院) University of Rochester(罗切斯特大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究开发了一种基于大语言模型的框架,直接从10-K文件中提取分部披露信息,保留可报告和嵌套分部信息,并设计检索增强系统以支持跨公司和跨时间的可比性,从而解决结构化数据库中分部数据的完整性和可比性问题。

Comments 39 pages, 4 figures, submitted to Accounting Horizons

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05004 2026-05-26 cs.CL 57%

Can Large Language Models Resolve Semantic Discrepancy in Self-Destructive Subcultures? Evidence from Jirai Kei

大语言模型能否解决自我毁灭亚文化中的语义差异?来自Jirai Kei的证据

Peng Wang, Xilin Tao, Siyi Yao, Jiageng Wu, Yuntao Zou, Zhuotao Tian, Libo Qin, Dagang Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology(澳门科技大学计算机科学与工程学院) SKLPlanets, Macau University of Science and Technology(澳门科技大学SKLPlanets) College of Software, Northeastern University(东北大学软件学院) School of Energy and Power Engineering, Huazhong University of Science and Technology(华中科技大学能源与动力工程学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对亚文化中自我毁灭行为检测面临的知识滞后和语义错位问题,提出多智能体框架SAS,通过自动检索和亚文化对齐显著提升LLM检测性能,并优于现有先进方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03318 2026-05-26 cs.CV 50%

EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs

EgoMind: 通过多模态大语言模型中的语言推理激活空间认知

Zhenghao Chen, Huiqun Wang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出EgoMind框架,通过角色扮演描述和渐进空间分析的无几何空间推理方法,仅用少量数据即可在多基准测试中提升MLLMs的空间推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00219 2026-05-26 cs.MA cs.NI 50%

μACP: A Formal Calculus for Expressive, Resource-Constrained Agent Communication

μACP:一种表达性强、资源受限的智能体通信的形式化演算

Arnab Mallick, Indraveni Chebolu

专题命中 其他安全 :safety(abstract)

AI总结 提出μACP形式化演算,通过最小四动词基编码有限状态FIPA协议,并建立消息复杂度的信息论界限,在资源受限环境下实现表达性与效率的统一。

Comments Accepted as a Full paper at AAMAS 2026

Journal ref AAMAS 2026: Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24946 2026-05-26 cs.CV 50%

Interpretability Transfer from Language to Vision via Sparse Autoencoders

通过稀疏自编码器实现从语言到视觉的可解释性迁移

Alexey Kravets, Da Li, Chuan Li, Da Chen, Vinay P. Namboodiri

机构 * University of Bath, UK(巴斯大学) Lambda, Inc.(Lambda公司) Samsung AI Centre Cambridge(三星AI研究中心)

专题命中 其他安全 :alignment(abstract)

AI总结 提出VISTA框架,通过约束视觉投影器将视觉token映射到LLM的文本SAE空间,实现无需专用视觉SAE的视觉可解释性,并在对象移除和替换任务上分别提升35%和47%。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24674 2026-05-26 cs.CV 50%

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing

推理对齐:扩散Transformer在视频编辑中的隐式推理

Yan Li, Lin Liu, Xiaopeng Zhang, Qi Tian

机构 * The Hongkong University of Science and Technology(香港科技大学) Huawei Inc.(华为公司)

专题命中 其他安全 :alignment(abstract)

AI总结 针对指令式视频编辑中条件信号未分化及交叉注意力监督不足的问题,提出RVEDiT框架,通过粒度路由令牌条件和参考锚定注意力对齐实现粗到细编辑与内部推理正则化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24619 2026-05-26 cs.SE 50%

Synthesizing Inductive Invariants for Distributed Protocols via IC3 and Large Language Models

通过IC3和大语言模型综合分布式协议的归纳不变量

Weining Cao, Guangyuan Wu, Yuan Yao, Hengfeng Wei, Taolue Chen, Xiaoxing Ma

专题命中 其他安全 :safety(abstract)

AI总结 提出IC3Syn框架,结合符号IC3控制器和大语言模型,自动综合分布式协议的归纳不变量,无需逻辑限制或人工模板,在29个协议上验证了有效性。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24337 2026-05-26 cs.HC 50%

Me, Myself, and My Voice: Exploring Cultural and Linguistic Identity in AAC AI-generated Voices

我,我自己,和我的声音:探索AAC AI生成声音中的文化与语言身份

Tobias Weinberg, Aaleyah Lewis, Ricardo E. Gonzalez Penuela, Weicong Hong, Jennifer Mankoff, Thijs Roumen

专题命中 其他安全 :alignment(abstract)

AI总结 通过调查和工具设计,研究AAC用户对AI生成声音的文化身份对齐需求,发现非二元、跨性别和非美国出生的用户身份对齐评分较低,且文化声音对齐超越口音和语言,涉及归属感和自我认同。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17016 2026-05-26 cs.SE 50%

HELO-APR: Enhancing Low-Resource Program Repair through Cross-Lingual Knowledge Transfer

HELO-APR:通过跨语言知识迁移增强低资源程序修复

Zhipeng Wang, Boyang Yang, Yidong Wan, Liuye Guo, You Lv, Tao Zheng, Zhuowei Wang, Tieke He

专题命中 其他安全 :alignment(abstract)

AI总结 提出HELO-APR框架,通过从高资源语言合成低资源语言修复数据并采用课程学习策略,显著提升低资源语言的自动程序修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏