arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-23 至 2026-03-23 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 15 篇

2502.20795 2026-03-23 cs.CL 79%

Test-Time Alignment for Large Language Models via Textual Model Predictive Control

通过文本模型预测控制对大型语言模型进行测试时对齐

Kuang-Da Wang, Teng-Ruei Chen, Yu Heng Hung, Guo-Xun Ko, Shuoyang Ding, Yueh-Hua Wu, Yu-Chiang Frank Wang, Chao-Han Huck Yang, Wen-Chih Peng, Ping-Chun Hsieh

机构 * National Yang Ming Chiao Tung University NVIDIA National Taiwan University

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出TMPC方法,通过文本模型预测控制解决测试时对齐问题,通过分层强化学习原理改进生成过程,提升不同任务的性能。

Comments Accepted for ICLR 2026. Project page: https://rl-bandits-lab.github.io/TMPC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19574 2026-03-23 cs.HC cs.AI cs.CL cs.CY cs.SI 67%

AI Psychosis: Does Conversational AI Amplify Delusion-Related Language?

AI精神病:对话AI是否会放大妄想相关语言?

Soorya Ram Shimgekar, Vipin Gunda, Jiwon Kim, Violeta J. Rodriguez, Hari Sundaram, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨对话AI对妄想相关语言的影响,通过模拟用户和三种模型家族分析妄想语言的变化,发现高妄想用户对话中妄想得分持续上升,而AI响应可有效降低此趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19843 2026-03-23 cs.CY cs.CL cs.HC 62%

Overreliance on AI in Information-seeking from Video Content

对视频内容信息检索中过度依赖AI的研究

Anders Giovanni Møller, Elisa Bassignana, Francesco Pierri, Luca Maria Aiello

机构 * IT University of Copenhagen(丹麦技术大学) Bocconi University(博科尼大学) Politecnico di Milano(米兰理工学院) Pioneer Centre for AI(先锋人工智能中心)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.CY

AI总结 研究探讨生成式AI对视频信息检索准确性、效率及信心的影响,发现AI辅助提升准确率但易导致过度依赖,进而引发安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16665 2026-03-23 cs.LG cs.AI cs.DC 62%

Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter

驯服长尾:通过自适应草案器实现高效的推理强化学习训练

Qinghao Hu, Shang Yang, Junxian Guo, Xiaozhe Yao, Yujun Lin, Yuxian Gu, Han Cai, Chuang Gan, Ana Klimovic, Song Han

机构 * MIT(麻省理工学院) ETH Zurich(苏黎世联邦理工学院) NVIDIA(英伟达) MIT-IBM AI Lab(麻省理工-IBM人工智能实验室) MIT, NVIDIA(麻省理工学院、英伟达)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TLT系统,通过自适应草案器和自适应回放引擎,解决强化学习训练中响应生成的长尾分布问题,实现1.7倍的训练加速并保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19308 2026-03-23 cs.LG cs.AI cs.MA 62%

GT-Space: Enhancing Heterogeneous Collaborative Perception with Ground Truth Feature Space

GT-Space:通过地面真实特征空间增强异构协作感知

Wentao Wang, Haoran Xu, Guang Tan

机构 * Sun Yat-sen University, Shenzhen Campus(中山大学深圳校区) Peng Cheng Laboratory (PCL)(鹏城实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GT-Space框架,通过构建地面真实标签的共同特征空间,实现异构agent的统一特征对齐,避免了传统方法中需要重新训练编码器或设计解释器模块的局限,提升了多agent协作感知的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10515 2026-03-23 physics.comp-ph cs.CE cs.LG cs.SY eess.SY 61%

Virtual Sensing for Solder Layer Degradation and Temperature Monitoring in IGBT Modules

IGBT模块焊层退化与温度监测的虚拟传感

Andrea Urgolo, Monika Stipsitz, Hèlios Sanchis-Alepuz

机构 * Silicon Austria Labs GmbH(硅 Austria 实验室)

专题命中 其他安全 :safety(abstract,journal_ref);分类 cs.LG

AI总结 本文利用机器学习虚拟传感技术,通过有限物理传感器估计IGBT模块焊层退化状态及温度分布,实现高精度退化区域估计和表面温度复现。

Comments Andrea Urgolo and Monika Stipsitz contributed equally to this work

Journal ref 2025 9th International Conference on System Reliability and Safety (ICSRS), Turin, Italy, 2025, pp. 538-547

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19831 2026-03-23 eess.AS cs.AI cs.MM 57%

Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?

Gesture2Speech: 手部动作能多大程度上塑造表现性语音?

Lokesh Kumar, Nirmesh Shah, Ashishkumar P. Gudmalwar, Pankaj Wasnik

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出Gesture2Speech框架,利用视觉手势线索调节合成语音的语调,通过多模态MoE架构动态融合语言内容和手势特征,提升语音自然度和手势与语调的同步性。

Comments Accepted at The 2nd International Workshop on Bodily Expressed Emotion Understanding (BEEU) at AAAI 2026 [non-archival]

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL 57%

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17910 2026-03-23 cs.CL 57%

L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention

L2V-CoT:通过潜在干预实现链式推理的跨模态转移

Yuliang Zhan, Xinyu Tang, Han Wan, Jian Li, Ji-Rong Wen, Hao Sun

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出L2V-CoT方法,通过潜在干预将链式推理从LLM转移到VLM,利用低频潜在表示提升多步推理能力,实验表明优于无训练基线和监督方法。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19269 2026-03-23 cs.CL 57%

From Tokens To Agents: A Researcher's Guide To Understanding Large Language Models

从标记到代理:研究者理解大型语言模型的指南

Daniele Barolo

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文探讨了如何有效使用大型语言模型,分析了预训练数据、标记化、Transformer架构等六个关键组成部分,通过案例研究展示如何评估LLM在特定研究中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03773 2026-03-23 q-bio.GN cs.LG 57%

A Phylogenetic Approach to Genomic Language Modeling

基于系统发育的基因组语言建模方法

Carlos Albors, Jianan Canal Li, Gonzalo Benegas, Chengzhong Ye, Yun S. Song

机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系) Department of Statistics(统计学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种基于系统发育树的基因组语言模型训练框架,通过多物种全基因组比对提升模型对进化约束元件的识别能力,展示了PhyloGPN在单序列预测功能性破坏变异方面的有效性。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19838 2026-03-23 cs.RO 50%

Multi-Agent Motion Planning on Industrial Magnetic Levitation Platforms: A Hybrid ADMM-HOCBF approach

多智能体在工业磁悬浮平台上的运动规划:一种混合ADMM-HOCBF方法

Bavo Tistaert, Stan Servaes, Alejandro Gonzalez-Garcia, Ibrahim Ibrahim, Louis Callens, Jan Swevers, Wilm Decré

机构 * MECO Research Team, Dept. of Mechanical Engineering, KU Leuven and Flanders Make(MECO研究团队,机械工程系,KU莱顿和弗拉芒制造)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出了一种新颖的混合运动规划方法,用于具有holonomic特性的多智能体系统。通过结合去中心化的交替方向乘子法(ADMM)与集中式的高阶控制屏障函数(HOCBF)架构,解决了传统集中式MPC在智能体数量增加时的可计算性问题,并提供安全性保障。

Comments 8 pages, 4 figures, accepted to the European Control Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19766 2026-03-23 cs.CV 50%

Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images

适应预训练的单细胞基础模型以从组织学图像生成空间基因表达

Donghai Fang, Yongheng Li, Zhen Wang, Yuansong Zeng, Wenwen Min

机构 * Sun Yat-sen University(中山大学) Yunnan University(云南大学) Chongqing University(重庆大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出HINGE模型,通过引入SoftAdaLN和扩散目标,将预训练的单细胞基础模型适配为条件表达生成器,提升了组织学图像生成空间基因表达的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19678 2026-03-23 cs.CV 50%

Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

视觉-语言属性解耦与强化用于终身人物重识别

Kunlun Xu, Haotong Cheng, Jiangmeng Li, Xu Zou, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能与自动化学院,武汉,中国)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出VLADR方法,通过视觉-语言属性解耦与强化提升跨域知识迁移,增强抗遗忘与泛化能力,实验表明在抗遗忘和泛化能力上优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19568 2026-03-23 cs.HC 50%

AI as Relational Translator: Rethinking Belonging and Mutual Legibility in Cross-Cultural Contexts

AI作为关系翻译者:重新思考跨文化情境中的归属与相互可理解性

Yao Xiao, Rafael A. Calvo

专题命中 其他安全 :safety(abstract)

AI总结 本文挑战将AI视为伴侣的主流观念,提出AI应支持人与人之间的关系。通过东亚移民案例,提出多代理架构实现情感意图解码、上下文重构和关系支撑。

Comments 8 pages, 2 figures. Accepted for publication in the Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26). With minor typographical corrections

详情

展开后加载摘要…

URL PDF HTML 收藏