arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-14 至 2026-05-14 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 16 篇

2605.13429 2026-05-14 cs.CL 79%

TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment

TokAlign++: 通过更好的词 token 对齐推进词汇适应

Chong Li, Yingzhuo Deng, Wen Yang, Jiajun Zhang, Chengqing Zong

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 TokAlign++通过学习更好的词 token 对齐词典,提升多语言模型的词汇适应性能,实验显示其能提升多语言文本压缩率并保持模型能力,仅需1k步即可恢复基础模型性能。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13436 2026-05-14 cs.CL cs.LG 62%

Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP

通过子词正则化预训练语言模型:BPE Dropout在低资源NLP中的实证研究

Ruan Visser, Trienko Grobler, Marcel Dunaiski

机构 * Department of Computer Science, Stellenbosch University(斯瓦茨堡大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在低资源NLP中预训练时应用BPE Dropout对下游性能的影响,发现随机分词在预训练和微调时均优于仅在微调时应用,尤其在数据较少时表现更佳。

Comments Comments: 12 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10931 2026-05-14 cs.LG cs.CL 62%

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

异步推理:无需训练的交互式思考LLM

George Yakushev, Nataliia Babina, Masoud Vahid Dastgerdi, Vyacheslav Zhdanovskiy, Denis Kuznedelev, Alina Shutova, Max Ryabinin

机构 * Yandex HSE University(俄罗斯高等经济大学) The University of Tokyo(东京大学) MATS Together AI

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需额外训练的LLM异步推理方法,通过位置嵌入特性实现同时思考、倾听和生成输出,提升数学、常识和安全推理任务的准确性和响应速度。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12714 2026-05-14 cs.LG cs.CL 62%

Layer-wise Representation Dynamics: An Empirical Investigation Across Embedders and Base LLMs

逐层表示动态:跨嵌入器和基础大语言模型的实证研究

Jingzhou Jiang, Yi Yang, Kar Yan Tam

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LRD框架,通过三种逐层测量家族分析语言模型的层间表示动态,揭示架构和任务层面差异,并应用于模型选择和层间剪枝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12674 2026-05-14 cs.AI cs.LG cs.RO 62%

Revealing Interpretable Failure Modes of VLMs

揭示视觉语言模型的可解释性故障模式

Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva, Sayan Ranu, Gagandeep Singh

机构 * UIUC(伊利诺伊大学香槟分校) Kumo AI IIT Delhi(德里印度理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REVELIO框架,通过系统性探索揭示VLMs在自动驾驶和室内机器人领域中的可解释性故障模式,发现模型在空间定位和安全威胁识别上的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02977 2026-05-14 cs.CV cs.AI cs.LG 62%

Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding

对图像与长描述中的森林和树木进行对齐以实现视觉基础理解

Byeongju Woo, Zilin Wang, Byeonghyun Pak, Sangwoo Mo, Stella X. Yu

机构 * Agency for Defense Development(国防发展局) University of Michigan(密歇根大学) POSTECH

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAFT模型,通过分层视觉语言学习原理,解决长描述中细节丰富的场景理解问题,实现图像与文本的细粒度对齐,取得六个长文本检索基准的最优性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05410 2026-05-14 cs.AI cs.CL 62%

ChatSR: Multimodal Large Language Models for Scientific Formula Discovery

ChatSR:用于科学公式发现的多模态大语言模型

Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning

机构 * AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国) College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国) School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ChatSR通过设计专用编码器和模态对齐机制,将科学数据映射到可被大语言模型处理的表示空间,从而生成符合领域先验的数学公式,推动科学发现自动化。

Comments 14 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13202 2026-05-14 cs.CV cs.AI 57%

STAR: Semantic-Temporal Adaptive Representation Learning for Few-Shot Action Recognition

STAR:语义-时间自适应表示学习用于少样本动作识别

Hongli Liu, Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Engineering Research Center of Key Software Technologies for Smart City Perception and Planning, Ministry of Education(教育部智能城市感知与规划关键软件技术工程研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 STAR通过语义对齐和时间感知模块,解决少样本动作识别中的语义-时间对齐和多尺度时间动态建模问题,提升模型在有限样本下的泛化能力。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12917 2026-05-14 cs.CV cs.LG 57%

Adaptive Conformal Prediction for Reliable and Explainable Medical Image Classification

自适应置信区间用于可靠且可解释的医学图像分类

One Octadion, Novanto Yudistira, Lailil Muflikhah

机构 * Faculty of Computer Science, Universitas Brawijaya(博雅大学计算机科学学院)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出自适应Lambda准则改进RAPS,提升医学图像分类的可靠性与可解释性,实验表明其在跨域验证中表现优异。

Comments To appear in IEA/AIE 2026 (Springer LNAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12730 2026-05-14 cs.AI cs.GR cs.MA physics.soc-ph 57%

BEHAVE: A Hybrid AI Framework for Real-Time Modeling of Collective Human Dynamics

BEHAVE:一种混合AI框架,用于实时建模集体人类动态

Helene Malyutina

机构 * Independent Researcher, Collective Dynamics Lab(独立研究者,集体动力学实验室)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 BEHAVE框架通过建模连续行为场,实时捕捉群体动态,结合神经网络实现数据驱动学习,应用于群体安全、危机团队动态等场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12719 2026-05-14 cs.RO cs.LG 57%

A Five-Layer MLOps Architecture for Connected Automated Driving

面向连接自动化驾驶的五层MLOps架构

Bastian Lampe, Lutz Eckstein

机构 * Institute for Automotive Engineering (ika), RWTH Aachen University(汽车工程研究所(ika),亚琛工业大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出五层MLOps架构,旨在通过集体学习提升自动驾驶系统安全性和性能,支持车队运营商等利益相关者设计实现MLOps流程,通过多级自我评估降低边缘案例风险。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12682 2026-05-14 cs.AI 57%

Learning Transferable Latent User Preferences for Human-Aligned Decision Making

学习可迁移的潜在用户偏好以实现人类对齐的决策制定

Alina Hyk, Sandhya Saisubramanian

机构 * Oregon State University(俄勒冈州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出CLIPR框架,通过少量对话输入学习可迁移的自然语言规则,以提升决策与人类偏好的对齐度并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26969 2026-05-14 cs.IR cs.AI 57%

AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization

AgenticRecTune: 多智能体与自演化技能 hub 用于推荐系统优化

Xidong Wu, Yue Zhuan, Ruoqiao Wei, Hangxin Chen, Di Bai, Jintao Liu, Xinyi Wang, Xue Wang, Luoshu Wang, Xinwu Cheng

机构 * Google(谷歌)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出AgenticRecTune框架,通过五个智能体实现端到端配置优化,利用LLM进行最优配置空间探索,结合自演化Skillhub提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13835 2026-05-14 cs.CV 50%

Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning

解锁基于CLIP的类增量学习中的补丁级特征

Hao Sun, Zi-Jun Ding, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出SPA方法,通过利用CLIP的补丁级语义信息提升类增量学习性能,通过生成类级语义描述引导补丁特征选择,并利用最优传输对齐语义特征,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13177 2026-05-14 physics.optics 50%

Volumetric Optical Scattering Neural Networks

体积分散神经网络

Xuhao Luo, Qiang Song, Weiwei Cai, Lei Chen, Enbo Yang, Hao Wang, Zhipei Sun, Yueqiang Hu, Joel K. W. Yang, Huigao Duan

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出体积分散神经网络,利用密集排列的弱散射体实现三维局部连接的光计算介质,实现高密度、高紧凑性和高效光学计算,应用于嵌入式光学智能和AI领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11444 2026-05-14 cs.CV 50%

Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

通过混合频率专家利用多模态大语言模型实现一站式图像修复

Eunho Lee, Rei Kawakami, Youngbae Hwang

机构 * Chungbuk National University(Chungbuk国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种利用多模态大语言模型指导的图像修复框架,通过混合频率专家模块提升对复合退化特征的建模能力,在多个数据集上取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏