arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7945 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7945 篇

2602.13857 2026-02-17 cs.LG eess.SP 79%

sleep2vec: Unified Cross-Modal Alignment for Heterogeneous Nocturnal Biosignals

sleep2vec:用于异构夜间生物信号的统一跨模态对齐

Weixuan Yuan, Zengrui Jin, Yichen Wang, Donglin Xie, Ziyi Ye, Chao Zhang, Xuesong Chen

机构 * Five Seasons Medical(五 Seasons 医疗) Tsinghua University(清华大学) Beijing Key Laboratory for Sleep Breathing Disorder(北京睡眠呼吸障碍重点实验室) Peking University(北京大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 sleep2vec通过统一跨模态对齐和原理化缩放,实现了对异构夜间生物信号的高效、通用建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09225 2026-02-11 cs.LG 79%

Barycentric alignment for instance-level comparison of neural representations

实例层面神经表示的重心对齐

Shreya Saha, Zoe Wanying He, Meenakshi Khosla

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院) Department of Electrical and Computer Engineering, UCSD(UCSD电子与计算机工程系) Cognitive Science Department, UCSD(UCSD认知科学系) Department of Computer Science(计算机科学系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 通过实例层面的神经表示重心对齐,揭示了跨视觉和语言模型的表示收敛与发散特性,并展示了人类对齐的跨模态比较能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07540 2026-02-10 cs.CV cs.LG 79%

LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing

基于LLM的诊断证据对齐用于有限配对情况下的医学视觉-语言预训练

Huimin Yan, Liang Bai, Xian Yang, Long Chen

机构 * Institute of Intelligent Information Processing, Shanxi University(山西大学智能信息处理研究所) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学阿利安斯商学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出LLM引导的诊断证据对齐方法,旨在解决有限配对数据下医学视觉-语言预训练的诊断表示学习问题,通过提取关键诊断证据提升跨模态对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12215 2026-02-10 cs.CL 79%

GMSA: Enhancing Context Compression via Group Merging and Layer Semantic Alignment

GMSA:通过组合并和层语义对齐增强上下文压缩

Jiwei Tang, Zhicheng Zhang, Shunlong Wu, Jingheng Ye, Lichen Bai, Zitai Wang, Tingwei Lu, Lin Hai, Yiming Zhao, Hai-Tao Zheng, Hong-Gee Kim

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Seoul National University(首尔国立大学) Sun Yat-sen University(中山大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 GMSA通过组合并和层语义对齐技术,提升长上下文场景下的上下文压缩效率,实现更高效的模型压缩与下游任务性能提升。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03124 2026-02-04 cs.CV cs.LG 79%

Feature, Alignment, and Supervision in Category Learning: A Comparative Approach with Children and Neural Networks

特征、对齐与监督在类别学习中的作用:基于儿童与神经网络的比较方法

Fanxiao Wani Qiu, Oscar Leong

机构 * Department of Psychology, University of Southern California(南加州大学心理学系) Department of Statistics and Data Science, University of California, Los Angeles(加州大学洛杉矶分校统计与数据科学系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文通过比较儿童与神经网络在少量半监督类别学习任务中的表现,揭示了监督、特征结构和对齐在学习过程中的相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22513 2026-02-04 cs.AI 79%

Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models

为何自我奖励有效:语言模型迭代对齐的理论保证

Shi Fu, Yingjie Wang, Shengchao Hu, Peng Wang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过理论分析揭示了自我奖励语言模型在迭代对齐中的有效性,证明了其性能随迭代次数呈指数衰减,并为线性softmax模型提供了定制化的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16540 2026-02-04 cs.SD cs.AI eess.AS 79%

Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG

模型是像我们一样听吗?探查音频大语言模型与自然EEG的表征对齐

Haoyun Yang, Xin Xiao, Jiang Zhong, Yu Tian, Dong Xiaohua, Yu Mao, Hao Wu, Kaiwen Wei

机构 * School of Computer Science, Chongqing University(重庆大学计算机科学学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) School of Economics and Business Administration, Chongqing University(重庆大学经济与商业管理学院) School of Artificial Intelligence, Southwest University(西南大学人工智能学院) The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本研究通过比较音频大语言模型与EEG信号,揭示了模型在自然聆听中的表征对齐特性,发现排名依赖分裂、时空对齐模式及情感分离现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01603 2026-02-03 stat.ML cs.LG 79%

Inference-Aware Meta-Alignment of LLMs via Non-Linear GRPO

通过非线性GRPO实现LLM的推理感知元对齐

Shokichi Takakura, Akifumi Wachi, Rei Higuchi, Kohei Miyaguchi, Taiji Suzuki

机构 * LY Corporation(LY公司) The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出IAMA方法,通过非线性GRPO实现LLM在有限计算资源下的多标准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00951 2026-02-03 cs.AI 79%

R-HTN: Rebellious Online HTN Planning for Safety and Game AI

R-HTN:安全与游戏AI中的反叛在线HTN规划

Hector Munoz-Avila, David W. Aha, Paola Rizzo

机构 * Computer Science \& Engineering, Lehigh University Bethlehem, PA 18015-3084 USA Navy Center for Applied Research in AI Naval Research Laboratory

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 R-HTN是一种用于安全与游戏AI的在线HTN规划算法,通过反叛机制在遵循指令的情况下实现任务目标。

Journal ref The Annual Conference on Advances in Cognitive Systems (ACS-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22948 2026-02-02 cs.AI 79%

Alignment among Language, Vision and Action Representations

语言、视觉和动作表征的一致性

Nicola Milano, Stefano Nolfi

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过训练Transformer智能体执行自然语言指令,发现语言、视觉和动作表征在跨模态中呈现部分共享的语义结构,支持模态无关的语义组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22722 2026-02-02 cs.LG 79%

Local Intrinsic Dimension of Representations Predicts Alignment and Generalization in AI Models and Human Brain

表示的局部内在维度预测AI模型和人脑中的对齐和泛化

Junjie Yu, Wenxiao Ma, Chen Wei, Jianyu Zhang, Haotian Deng, Zihan Deng, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(生物医学工程系,南方科技大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 研究发现,AI模型和人脑的表示局部内在维度与对齐和泛化能力相关,且模型容量和数据规模增加可降低该维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09378 2026-02-02 cs.CL 79%

Can you map it to English? The Role of Cross-Lingual Alignment in Multilingual Performance of LLMs

能否映射到英语?跨语言对齐在大语言模型多语言性能中的作用

Kartik Ravisankar, Hyojung Han, Sarah Wiegreffe, Marine Carpuat

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究探讨了LLM中跨语言对齐对多语言NLU任务性能的影响,通过引入DALI指数验证了表示对齐在正确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08512 2026-01-28 cs.CV cs.AI 79%

MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding

MLVTG: 基于Mamba的特征对齐与LLM驱动的多模态视频时间定位

Zhiyi Zhu, Xiaoyu Wu, Zihao Liu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 MLVTG通过结合MambaAligner和LLMRefiner,实现了多模态视频时间定位的高精度定位与语义净化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27017 2026-01-27 cs.CL 79%

Kad: A Framework for Proxy-based Test-time Alignment with Knapsack Approximation Deferral

Kad: 一种基于代理的测试时对齐框架与背包近似延迟

Ayoub Hammal, Pierre Zweigenbaum, Caio Corro

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 Kad通过基于代理的测试时对齐方法,将令牌特定的延迟规则转化为0-1背包问题,从而降低对齐过程的计算成本,并提升任务性能和解码速度。

Comments EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20062 2026-01-23 cs.CL 79%

Poor Alignment and Steerability of Large Language Models: Evidence from College Admission Essays

大语言模型的对齐性和操控性不足:来自大学录取文书的证据

Jinsook Lee, AJ Alvero, Thorsten Joachims, René Kizilcec

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究通过分析大学录取文书发现,大语言模型在对齐和操控性方面存在不足,提示信息未能有效改变模型输出的语言模式。

Comments 48 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12962 2026-01-21 cs.CY 79%

ACE-Align: Attribute Causal Effect Alignment for Cultural Values under Varying Persona Granularities

ACE-Align:属性因果效应对齐用于不同人格粒度下的文化价值观

Jiatang Luo, Bingbing Xu, Rongxin Chen, Xiaoyan Zhao, Yang Zhang, Liang Pang, Zhiyong Huang, Tat-Seng Chua, Huawei Shen

专题命中 其他安全 :alignment(title,abstract);分类 cs.CY

AI总结 ACE-Align通过属性因果效应对齐,提升不同人格粒度下文化价值观的公平性,减少高低资源地区差距。

Comments 18 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10064 2026-01-16 cs.CL 79%

Long-Chain Reasoning Distillation via Adaptive Prefix Alignment

通过自适应前缀对齐实现长链推理蒸馏

Zhenghao Liu, Zhuoyang Wu, Xinze Li, Yukun Yan, Shuo Wang, Zulong Chen, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系) Alibaba Group, China(阿里巴巴集团)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 通过自适应前缀对齐方法提升学生模型的推理能力,有效蒸馏教师生成的长推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09732 2026-01-16 cs.CL 79%

Benchmarking Cross-Lingual Semantic Alignment in Multilingual Embeddings

在多语言嵌入中评估跨语言语义对齐的基准测试

Wen G. Gong

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究提出语义亲和力指标,评估多语言嵌入的跨语言语义对齐,发现训练目标而非规模决定对齐效果,强调显式翻译监督的重要性。

Comments 20 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16237 2026-01-14 cs.CL 79%

Align-GRAG: Anchor and Rationale Guided Dual Alignment for Graph Retrieval-Augmented Generation

Align-GRAG: 基于锚点和推理引导的双 Alignment 图检索增强生成

Derong Xu, Pengyue Jia, Xiaopeng Li, Yingyi Zhang, Maolin Wang, Qidong Liu, Xiangyu Zhao, Yichao Wang, Huifeng Guo, Ruiming Tang, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 Align-GRAG通过锚点和推理引导的双 Alignment 框架,提升图检索增强生成的准确性与语义对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06335 2026-01-13 cs.SE cs.AI 79%

Foundational Analysis of Safety Engineering Requirements (SAFER)

安全工程需求基础分析(SAFER)

Noga Chemo, Yaniv Mordecai, Yoram Reich

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 SAFER通过生成式人工智能和模型驱动方法,提升复杂安全关键系统的需求生成与分析,解决需求冲突和不一致问题,提高安全工程效率和可靠性。

Journal ref IEEE Aerospace Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03401 2026-01-08 cs.CL 79%

Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms

通过利用大语言模型对齐机制使数据不可学习

Ruihan Zhang, Jun Sun

机构 * Singapore Management University(新加坡国立管理大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 通过利用LLM对齐机制,提出免责声明注入方法,使数据对模型不可学习,实现数据保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01546 2026-01-06 cs.AI 79%

Improving Behavioral Alignment in LLM Social Simulations via Context Formation and Navigation

通过情境形成与导航提升LLM社交模拟中的行为一致性

Letian Kong, Qianran, Jin, Renyu Zhang

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出通过情境形成与导航提升LLM在复杂决策环境中的行为一致性,验证了两阶段框架在不同任务中的有效性。

Comments 39 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05619 2026-01-06 cs.LG cs.SE 79%

Detecting Proxy Gaming in RL and LLM Alignment via Evaluator Stress Tests

通过评估者压力测试检测强化学习和大语言模型对齐中的代理游戏

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 通过评估者压力测试检测强化学习和大语言模型对齐中的代理游戏,提升安全性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11167 2026-01-05 cs.CL 79%

Cultural Palette: Pluralising Culture Alignment via Multi-agent Palette

文化调色板:通过多智能体调色板实现文化对齐的多元化

Jiahao Yuan, Zixiang Di, Shangzixin Zhao, Zhiqing Cui, Hanqing Wang, Guisong Yang, Usman Naseem

机构 * ECNU(华东师范大学) USST(上海理工大学) BNU(北京师范大学) HKUST–GZ(香港理工大学-广州)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 Cultural Palette通过多智能体框架实现文化对齐的多元化,利用文化地理和颜色混合机制提升跨文化响应的适应性与准确性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21218 2025-12-30 cs.CL 79%

Can Finetuing LLMs on Small Human Samples Increase Heterogeneity, Alignment, and Belief-Action Coherence?

能否通过在小样本人类数据上微调LLM增加异质性、对齐性和信念-行为一致性?

Steven Wang, Kyle Hunt, Shaojie Tang, Kenneth Joseph

机构 * Department of Management Science and Systems, University at Buffalo(管理科学与系统系,布法罗大学) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究探讨通过微调LLM在小样本人类数据上是否能提高模拟结果的异质性、对齐性和信念-行为一致性,发现虽有提升但无法完全替代人类数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22741 2025-12-30 cs.CL 79%

Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis

基于解释和时序对齐的文本引导稀疏专家混合模型用于多模态情感分析

Dongning Rao, Yunbiao Zeng, Zhihua Jiang, Jujian Lv

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出基于解释和时序对齐的文本引导稀疏专家混合模型,用于提升多模态情感分析的性能。

Comments 9 pages, 9 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21985 2025-12-29 cs.CV cs.AI 79%

LVLM-Aided Alignment of Task-Specific Vision Models

通过大视觉语言模型辅助对齐任务特定视觉模型

Alexander Koebler, Lukas Kuhn, Ingo Thon, Florian Buettner

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 通过大视觉语言模型辅助对齐任务特定视觉模型,提升模型与人类规范的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14396 2025-12-24 cs.RO cs.AI cs.CV 79%

Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning

具有语义-物理对齐的连续视觉-语言-动作共学用于行为克隆

Xiuxiu Qi, Yu Yang, Jiannong Cao, Luyao Bai, Chongshan Fan, Chengtai Cao, Hongpeng Wang

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CCoL框架,通过连续共学视觉、语言和动作,解决行为克隆中的语义-物理不一致问题,提升动作执行的准确性和鲁棒性。

Comments Accepted at AAAI 2026, the Project website is available at https://qhemu.github.io/CCoL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12085 2025-12-23 cs.LG cs.GR 79%

GraphShaper: Geometry-aware Alignment for Improving Transfer Learning in Text-Attributed Graphs

GraphShaper: 图形感知对齐以提高文本属性图形中的迁移学习

Heng Zhang, Tianyi Zhang, Yuling Shi, Xiaodong Gu, Yaomin Shen, Haochen You, Zijian Zhang, Yilei Yuan, Jin Huang

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 GraphShaper通过多几何专门化框架提升文本属性图中迁移学习的性能,实现9.47%和7.63%的准确率提升。

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18554 2025-12-23 cs.CV cs.AI 79%

Enhancing Medical Large Vision-Language Models via Alignment Distillation

通过对齐蒸馏增强医学大视觉-语言模型

Aofei Chang, Ting Wang, Fenglong Ma

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出MEDALIGN方法,通过蒸馏CLIP模型的知识提升医学大视觉-语言模型的视觉对齐和生成质量。

Comments Accepted to AAAI'2026 (Main track)

详情

展开后加载摘要…

URL PDF HTML 收藏