arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-03 至 2026-06-03 共收录 28 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 28 篇

2606.03812 2026-06-03 cs.AI 83%

Enhancing Operational Safety via Agentic Dialogue Hazard Identification Analysis

通过智能体对话危害识别分析增强操作安全性

Sanjay Das, Ran Elgedawy, Ethan Seefried, Ryan Burchfield, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 其他安全 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 提出HAZDIAL框架,利用结构化多智能体多轮对话(对抗性辩论与建设性讨论)改进基于NLP的危害识别质量,并通过算法优化智能体交互,实验证明优于单次基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29123 2026-06-03 cs.CL 79%

Learning Concepts, Not Tokens: Self-Supervised Semantic Alignment for Language Models

学习概念,而非词元:语言模型的自我监督语义对齐

Christine Zhang, Dan Jurafsky, Chen Shani

机构 * Stanford University(斯坦福大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出一种自我监督框架,通过预测语义等价词元集合(概念)替代下一个词元预测,提升语言模型的语义对齐能力,并在分类、聚类、重排序及下游推理任务中取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01374 2026-06-03 cs.CL 79%

MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation

MTA:面向大型语言模型蒸馏的多粒度轨迹对齐

Pham Khanh Chi, Quoc Phong Dao, Thuat Nguyen, Linh Ngo Van, Trung Le, Thanh Hong Nguyen

机构 * Hanoi University of Science and Technology(河内理工大学) Monash University(墨尔本大学) University of Oregon(俄勒冈大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出多粒度轨迹对齐(MTA)框架,通过层自适应策略对齐师生模型的层间变换轨迹,结合动态结构对齐损失和隐藏表示对齐损失,提升知识蒸馏效果。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01205 2026-06-03 cs.CL 79%

SRA: Span Representation Alignment for Large Language Model Distillation

SRA: 面向大型语言模型蒸馏的跨度表示对齐

Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi, Tung Nguyen, Linh Ngo Van, Nguyen Thi Ngoc Diep, Trung Le

机构 * Hanoi University of Science and Technology(河内科学技术大学) VNU University of Engineering and Technology(VNU工程大学) Monash University(莫纳什大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出SRA框架,通过将蒸馏对齐单元从token转为跨度的质心表示,并引入几何正则化和对齐跨度logit蒸馏,显著提升跨分词器知识蒸馏性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15744 2026-06-03 cs.CL 79%

Language, Place, and Social Media: Geographic Dialect Alignment in New Zealand

语言、地点与社交媒体:新西兰的地理方言对齐

Sidney Wong

机构 * Computer Science and Software Engineering, University of Canterbury(坎特伯雷大学计算机科学与软件工程系) Department of Linguistics, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校语言学系) School of Psychology, Speech and Hearing, University of Canterbury(坎特伯雷大学心理学、语音与听力学校) Department of Linguistics, University of Canterbury(坎特伯雷大学语言学系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究通过整合用户感知的定性分析与计算方法,探究新西兰Reddit社区中地理方言对齐现象,发现地点相关社区形成连续言语社区,且高级语言建模揭示了语义变异与变化。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23234 2026-06-03 cs.CV cs.AI 79%

Edge-Aware and Content-Adaptive Infrared Gas Leak Detection for Industrial Safety Monitoring

边缘感知与内容自适应的工业安全监控红外气体泄漏检测

Dongsheng Li, Tianli Ma, Siling Wang, Beibei Duan, Song Gao

机构 * School of Mechatronic Engineering, Xi’an Technological University(机械电子工程学院,西安理工大学) School of Electronic Information Engineering, Xi’an Technological University(电子信息工程学院,西安理工大学) Shaanxi Shanhua Coal Chemical Co., Ltd.(陕西神华化工有限公司)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 针对红外气体羽流微弱、半透明且边界模糊的检测难题,提出一种边缘感知与内容自适应特征融合检测器(ECAF-Det),通过羽流导向的局部-全局特征增强、多尺度边缘感知模块和内容自适应稀疏路由路径聚合网络,在IIG和LangGas数据集上显著提升了检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01282 2026-06-03 cs.CV cs.AI 79%

Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement

Align-KD:为移动视觉语言模型增强提取跨模态对齐知识

Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, China(通用人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室,中国)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出Align-KD方法,通过蒸馏教师模型浅层跨模态对齐知识,指导1.7B学生模型学习视觉-文本匹配,在6个基准上平均提升2.0分。

Comments CVPR 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08426 2026-06-03 cs.GT cs.AI 70%

Mechanism Design Is Not Enough: Prosocial Agents for Cooperative AI

机制设计是不够的:面向合作AI的亲社会智能体

Xuanqiang Angelo Huang, Charlie Tharas, Samuele Marro, Van Q. Truong, Bernhard Schölkopf, Emanuele La Malfa, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所) Jinesis Lab, University of Toronto & Vector Institute(多伦多大学Jinesis实验室及向量研究所) EuroSafeAI University of Pennsylvania(宾夕法尼亚大学) Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根最大计划智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文证明仅靠机制设计无法最大化LLM智能体的社会福利,并提出亲社会智能体(兼顾他人福利)能弥补这一差距,实现更优的社会与个体结果。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03871 2026-06-03 cs.CV cs.CL cs.LG 62%

Visual Instruction Tuning Aligns Modalities through Abstraction

视觉指令调优通过抽象对齐模态

Luis Palacios, Lorenzo Basile, Diego Doimo, Alberto Cazzaniga

机构 * Area Science Park, Trieste, Italy(特里埃斯特Area Science Park)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 通过探针分析和因果干预,发现视觉指令调优将视觉特征直接嵌入LLM的中间语义层,绕过早期单模态处理层,并通过扩展和强化现有抽象阶段对齐视觉与文本表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03232 2026-06-03 cs.LG cs.AI 62%

GFFMERGE: Efficient Merging of Graph Neural Force Fields and Beyond

GFFMERGE: 图神经力场的高效合并及其扩展

Parth Verma, Parv P. Singh, Vipul Garg, Ishita Thakre, N. M. Anoop Krishnan, Sayan Ranu

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Cambridge(剑桥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出GFFMERGE框架,通过凸嵌入对齐问题解析解实现图神经网络的闭式模型合并,在力场回归任务中恢复接近联合训练的性能,并实现5-27倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03712 2026-06-03 cs.LG 57%

When Graph Tokens Sink: A Mechanistic Analysis of Graph Language Models

当图标记沉没:图语言模型的机制分析

Ding Zhang, Runtao Zhou, Wenqing Zheng, Rizal Fathony, Bayan Bruss, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文通过分析图语言模型中图标记的内部行为,发现激活层面的显著性与图信息利用之间存在解耦,揭示了现有图标记构建、放置和对齐机制的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03569 2026-06-03 cs.CV cs.AI 57%

When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics

当注意力崩溃时:从结构到语义的阶段性视觉令牌剪枝

Jiahui Wang, Kai Zhang, Mai Han, Huanghe Zhang

机构 * Shandong University(山东大学) National University of Singapore (Suzhou) Research Institute(新加坡国立大学(苏州)研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对视觉语言模型推理中视觉令牌剪枝因依赖单一注意力分数导致特征多样性下降的问题,提出两阶段剪枝框架STS,先通过排斥采样最大化结构多样性,再通过指令感知交叉注意力过滤语义无关令牌,从而提升保留令牌的结构多样性与细粒度任务对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03279 2026-06-03 cs.LG 57%

A Geometric Lens on Physics-Aligned Data Compression

物理对齐数据压缩的几何视角

Aleix Segui, Wesley Armour

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文通过局部几何理论揭示了物理信息损失函数在科学数据压缩中导致的率失真权衡,并提出了基于主特征空间重叠的对齐诊断方法。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03234 2026-06-03 cs.LG 57%

Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

正确即力量:对齐验证的隐藏状态增强强化学习推理

Ziyue Wang, Aomufei Yuan, Yongfu Zhu, Shuai Dong, Wenpu Liu, Yiran Yao, Weichu Xie, Yuqi Xu, Caoyuan Ma, Wenqi Shao, Xiaoying Zhang, Nan Duan, Jiaqi Wang

机构 * Peking University(北京大学) JINGDONG(京东) Shanghai Innovation Institute(上海创新研究院) The University of Tokyo(东京大学) Tianjin University(天津大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出Hidden-Align辅助损失函数,在强化学习训练中对齐正确rollout在锚点token处的最后一层隐藏状态,提升数学推理性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02753 2026-06-03 cs.CV cs.AI 57%

MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data

MetaWorld: 从单视角视频数据扩展多智能体视频世界模型

Teng Hu, Mingchun Lu, Yating Wang, Jiangning Zhang, Jinkun Hao, Ye Pan, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出MetaWorld框架,通过单目世界状态展开、主体感知世界生成器和世界状态对齐机制,从单视角视频构建多智能体视频世界模型,解决数据稀缺和世界状态对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02638 2026-06-03 cs.SD cs.AI eess.AS 57%

SegTune: Structured and Fine-Grained Control for Song Generation

SegTune:歌曲生成的结构化与细粒度控制

Yuejiao Wang, Zihao Ji, Pengfei Cai, Xu Li, Haorui Zheng, Zewen Song, Zhongliang Liu, Chen Zhang, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出基于扩散Transformer的SegTune框架,通过用户或LLM指定局部音乐描述实现结构化细粒度控制,并引入LLM时长预测器实现精确歌词-音乐对齐,在音乐性和可控性上超越现有基线。

Comments This paper has been accepted to ACL 2026 as an oral presentation and has been nominated for the Best Paper Award. This work is a revised and extended version of an earlier technical report (arXiv:2510.18416). arXiv admin note: text overlap with arXiv:2510.18416

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30166 2026-06-03 cs.SI cs.LG 57%

SAHG: Sector-Anisotropic Hyperbolic Graph Model for Social Bot Detection

SAHG:用于社交机器人检测的扇区各向异性双曲图模型

Hanning Lu, Yingguang Yang, Jinwei Su, Yang Liu, Zhaoqian Yao, Yaoming Li, Taoran Liang, Ziyi Zhang, Ran Ran, Kefu Xu, Bin Chong

机构 * University of Leeds(利兹大学) University of Science and Technology of China(中国科学技术大学) South China Normal University(华南师范大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Harbin University of Commerce(哈尔滨商业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出扇区各向异性双曲图模型SAHG,通过方向依赖曲率场和扇区原型解决欧几里得GNN在层次无标度社交图中的失真问题以及异质连接导致的信号污染问题,在三个基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00392 2026-06-03 cs.LG 57%

Localized, High-resolution Geographic Representations with Slepian Functions

基于Slepian函数的局部高分辨率地理表示

Arjun Rao, Ruth Crasto, Tessa Ooms, David Rolnick, Konstantin Klemmer, Marc Rußwurm

机构 * Department of Computer Science, University of Colorado Boulder(科罗拉多大学波德分校计算机科学系) Microsoft(微软公司) University College London(伦敦大学学院) McGill University(麦吉尔大学) Mila–Quebec AI Institute(魁北克AI研究所) University of Bonn, Germany(德国波恩大学) University of Wageningen, Netherlands(荷兰瓦赫宁根大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 提出利用球面Slepian函数构建地理编码器,在感兴趣区域内集中表示能力,实现高分辨率且计算高效,并引入混合Slepian-球谐编码器平衡局部与全局性能,在分类、回归等任务中优于基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16882 2026-06-03 physics.chem-ph cond-mat.mtrl-sci cs.LG 57%

A Cartesian-3j Framework for Machine Learning Interatomic Potentials

机器学习原子间势的 Cartesian-3j 框架

Zemin Xu, Chenyu Wu, Wenbo Xie, P. Hu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出基于Cartesian-3j符号和Cartesian广义Clebsch-Gordan系数的不可约Cartesian张量框架,构建MACE、NequIP和Allegro的Cartesian版本,并引入TACE-v1-OAM-M模型在Matbench Discovery上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21448 2026-06-03 cs.CL 57%

When Models Refuse: Political Steerability and Feature Richness as Measures of Ideological Depth

当模型拒绝时:政治可操控性与特征丰富度作为意识形态深度的度量

Shariar Kabir

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文提出意识形态深度概念,通过可操控性和稀疏自编码器测量的特征丰富度,研究大语言模型拒绝遵循良性指令是否源于能力缺陷而非安全规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22854 2026-06-03 cs.CL 57%

Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention

一次训练,随处重用:通过路由注意力实现可泛化的隐式上下文学习

Jiaqian Li, Yanshu Li, Ligong Han, Ruixiang Tang, Wenya Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出In-Context Routing (ICR)方法,在注意力logits层面捕获可泛化的上下文学习模式,通过可学习的输入条件路由器调制注意力logits,实现高效的一次训练多次重用框架,在12个数据集上优于现有隐式ICL方法并展现强泛化能力。

Comments ICML 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03610 2026-06-03 cs.CV 50%

SkelHCC: A Hyperbolic CLIP-Driven Cache Adaptation Framework for Skeleton-based One-Shot Action Recognition

SkelHCC:一种基于双曲CLIP驱动的缓存自适应框架用于骨架基础的一次动作识别

Yanan Liu, Anqi Zhu, Jingmin Zhu, Jun Liu, Hossein Rahmani, Mohammed Bennamoun, Farid Boussaid, Dan Xu, Qiuhong Ke

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出SkelHCC框架,利用双曲几何编码骨架层次结构,结合CLIP和免训练缓存实现一次动作识别,在三个数据集上达到最优。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03406 2026-06-03 cs.CV 50%

SAMatcher: Co-Visibility Modeling with Segment Anything for Robust Feature Matching

SAMatcher: 基于Segment Anything的共视性建模用于鲁棒特征匹配

Xu Pan, Qiyuan Ma, Mingyue Dong, He Chen, Wei Ji, Xianwei Zheng

专题命中 其他安全 :alignment(abstract)

AI总结 提出SAMatcher框架,通过共视性建模预测共视区域掩码和边界框作为结构先验,利用Segment Anything Model的对称交叉视图交互机制和统一监督方案,显著提升大视角和尺度变化下的特征匹配性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03183 2026-06-03 cs.MM cs.CV cs.SD eess.AS 50%

Inference-Time Scaling for Joint Audio-Video Generation

联合音视频生成的推理时缩放

Jaemin Jung, Kyeongha Rho, Inkyu Shin, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Luma AI

专题命中 其他安全 :alignment(abstract)

AI总结 针对联合音视频生成中多目标优化的挑战,提出多验证器框架与自适应奖励加权算法,在无需额外训练的情况下显著提升语义对齐、感知质量和音视频同步。

Comments Accepted by Transactions on Machine Learning Research (TMLR). Project page: https://jung-jaemin.github.io/ITS-AVGen-Proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02651 2026-06-03 cs.PL cs.LO cs.SE 50%

From Rocq to Metal: A Pipeline for Formally Verified Microcontroller Firmware

从Rocq到Metal:形式化验证微控制器固件的流水线

Valentin Bergeron, Karolina Gorna

专题命中 其他安全 :safety(abstract)

AI总结 本文提出Encore!虚拟机,通过延续传递风格运行Rocq提取的Scheme代码,实现微控制器固件的形式化验证,并利用大语言模型辅助策略合成自动证明固件正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16816 2026-06-03 cs.RO 50%

"I'm Not Mad, Just Focused'': Understanding Human Emotions in Human-Robot Collaboration

“我没生气,只是专注”:理解人机协作中的人类情绪

Seung Chan Hong, Dana Kulić, Leimin Tian

机构 * Faculty of Engineering, Monash University(莫纳什大学工程学院) CSIRO Robotics(CSIRO机器人实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 提出基于视觉语言模型(VLM)的情绪识别系统,利用上下文理解改善人机协作中的情绪解读,实验表明其语义相似性和情感对齐优于基线CNN系统,且用户偏好情绪自适应机器人行为。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8260-8267, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15748 2026-06-03 cs.CV 50%

Concept-wise Attention for Fine-grained Concept Bottleneck Models

面向细粒度概念瓶颈模型的概念级注意力机制

Minghong Zhong, Guoshuai Zou, Kanghao Chen, Dexia Chen, Ruixuan Wang

专题命中 其他安全 :alignment(abstract)

AI总结 提出概念级注意力机制(CoAt-CBM),通过可学习概念视觉查询和概念对比优化,实现自适应细粒度图像-概念对齐,解决预训练偏差和概念互斥问题,显著提升性能。

Comments Withdrawn by authors for revision and improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05852 2026-06-03 cs.CV 50%

Interpretable Modeling of Driver Attention Shifts with a Vision-Language Model

基于视觉-语言模型的驾驶员注意力转移可解释建模

Kaiser Hamid, Khandakar Ashrafi Akbar, Peihang Li, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Towson University(托森大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本研究通过少量人工监督微调视觉-语言模型,生成可解释的驾驶员注意力转移描述,以补充传统注视热图,提升人因分析、监控和态势感知支持。

详情

展开后加载摘要…

URL PDF HTML 收藏