arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-02 至 2026-04-02 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9 篇

2504.13129 2026-04-02 cs.CV cs.AI cs.LG 62%

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01108 2026-04-02 cs.AI 57%

Adversarial Moral Stress Testing of Large Language Models

对抗性道德压力测试:大语言模型的伦理鲁棒性评估

Saeid Jamshidi, Foutse Khomh, Arghavan Moradi Dakhel, Amin Nikanjam, Mohammad Hamdaqa, Kawser Wazed Nafi

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔理工学院SWAT实验室) Huawei Distributed Scheduling and Data Engine Lab(华为分布式调度与数据引擎实验室) SæT Laboratory, Polytechnique Montréal(蒙特利尔理工学院SæT实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AMST框架,通过对抗性多轮交互评估大语言模型的伦理鲁棒性,揭示传统单轮评估无法发现的降级模式,强调分布稳定性与尾部行为的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00014 2026-04-02 cs.CL cs.HC 57%

Disentangling Prompt Element Level Risk Factors for Hallucinations and Omissions in Mental Health LLM Responses

分离提示元素层面的风险因素以评估心理健康LLM响应中的幻觉与遗漏

Congning Ni, Sarvech Qadir, Bryan Steitz, Mihir Sachin Vaidya, Qingyuan Song, Lantian Xia, Shelagh Mulvaney, Siru Liu, Hyeyoung Ryu, Leah Hecht, Amy Bucher, Christopher Symons, Laurie Novak, Susannah L. Rose, Murat Kantarcioglu, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University Medical Center(范德比尔特大学医学中心) Vanderbilt University(范德比尔特大学) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出UTCO框架,通过系统性压力测试评估心理健康LLM响应中的幻觉与遗漏,发现上下文和语气是主要风险因素,支持将遗漏作为主要安全结果进行评估。

Comments Submitted to AMIA 2026 Annual Symposium (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2604.00021 2026-04-02 cs.CL cs.AI cs.CY 75%

How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models

语言模型如何处理道德指令?在四个模型中的反思、一致性及其他认知

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(刑事精神病学研究所/性犯罪者医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神医学系)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过多代理模拟探讨语言模型处理道德指令的机制,发现不同模型存在不同的处理类型,且处理能力与指令格式的交互影响内部处理。

Comments 34 pages, 7 figures, 4 tables. Preprint. OSF pre-registration: osf.io/4n5uf. Companion paper: arXiv:2603.04904

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00323 2026-04-02 cs.CL cs.CY 62%

Large Language Models in the Abuse Detection Pipeline

大语言模型在滥用检测流水线中的应用

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta

机构 * Google LLC(谷歌有限责任公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨大语言模型在滥用检测生命周期中的应用,分析其在标签生成、检测、审核及审计等阶段的作用,并讨论其面临的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02976 2026-04-02 cs.AI 57%

Teaching AI to Handle Exceptions: Supervised Fine-Tuning with Human-Aligned Judgment

教AI处理例外:基于人类对齐判断的监督微调

Matthew DosSantos DiSorbo, Harang Ju, Sinan Aral

机构 * Harvard Business School(哈佛商学院) Johns Hopkins University(约翰霍普金斯大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了如何通过监督微调使AI处理例外,发现使用人类解释的微调能显著提升模型决策能力,揭示了对齐人类判断需明确训练决策过程而非仅决策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01056 2026-04-02 eess.SY cs.SY 50%

A Functional Learning Approach for Team-Optimal Traffic Coordination

团队最优交通协调的函数学习方法

Weihao Sun, Gehui Xu, Alessio Moreschini, Thomas Parisini, Andreas A. Malikopoulos

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出基于核的方法的策略迭代函数学习框架,用于计算交通协调问题中的团队最优策略,结合二次调节项和非线性安全惩罚项,通过核空间近似求解,并在SUMO中验证。

Comments 8 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22588 2026-04-02 cs.HC cs.ET 50%

Practitioner Voices Summit: How Teachers Evaluate AI Tools through Deliberative Sensemaking

实践者声音峰会:教师如何通过 deliberative sensemaking 评估 AI 工具

Dorottya Demszky, Christopher Mah, Helen Higgins

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨教师在整合AI工具时的评估标准及支持条件,通过全国峰会收集61名数学教师制定的200余条评估标准,揭示了 deliberative sensemaking 的五种机制及TPACK与代理的相互促进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 19 篇

2604.00012 2026-04-02 cs.CL cs.AI 81%

Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms

发现并重新激活已训练大语言模型的隐藏安全机制

Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang, Yisen Wang

机构 * Cranberry-Lemon University(蔓越莓柠檬大学)

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在后训练过程中安全机制的退化原因,提出SafeReAct方法通过LoRA适配器恢复被抑制的安全行为,提升模型在有害提示下的安全性而不影响推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00279 2026-04-02 cs.CV cs.AI 79%

The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment

妥协的几何学:通过可控的模态对齐解锁生成能力

Hongyuan Liu, Qinli Yang, Wen Li, Zhong Zhang, Jiaming Liu, Wei Han, Zhili Qin, Jinxia Guo, Junming Shao

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Bristol(布里斯托大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过几何分析揭示模态间隙的两个组成部分,提出TPC-CMA框架以减少两者,显著提升跨模态对齐性能,实验显示在不同目标α下模态间隙大幅降低,同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00249 2026-04-02 cs.AI cs.MA 79%

A Safety-Aware Role-Orchestrated Multi-Agent LLM Framework for Behavioral Health Communication Simulation

一种安全意识导向的角色协调多智能体LLM框架用于行为健康沟通模拟

Ha Na Cho

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种安全导向的角色协调多智能体LLM框架,通过协调不同角色的智能体模拟支持性行为健康对话,通过分解对话责任并动态激活智能体以确保安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06801 2026-04-02 cs.LG cs.AI 62%

On the Non-Identifiability of Steering Vectors in Large Language Models

大型语言模型中转向向量的不可识别性

Sohan Venkatesh, Ashish Mahendran Kurapath

机构 * Manipal Institute of Technology Bengaluru(马尼帕尔理工学院班加罗尔校区)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大型语言模型中转向向量的不可识别性,指出在白盒单层访问下,转向向量因行为上无法区分的干预等价类而无法唯一确定,强调需超越行为测试的结构约束以实现可靠对齐干预。

Comments Code available at https://github.com/sohv/non-identifiability

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00223 2026-04-02 cs.LG cs.AI 62%

Diversity-Aware Reverse Kullback-Leibler Divergence for Large Language Model Distillation

具有多样性的反Kullback-Leibler散度用于大规模语言模型蒸馏

Hoang-Chau Luong, Dat Ba Tran, Lingwei Chen

机构 * Rochester Institute of Technology(罗切斯特理工学院) Rowan University(罗文大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DRKL,通过消除非目标梯度影响并增强非目标监督,改进了RKL在大规模语言模型蒸馏中的性能与多样性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00027 2026-04-02 cs.CL cs.LG 62%

Multi-lingual Multi-institutional Electronic Health Record based Predictive Model

多语言多机构电子健康记录基于预测模型

Kyunghoon Hur, Heeyoung Kwak, Jinsu Jang, Nakhwan Kim, Edward Choi

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Science and Technology(韩国科学技术院金载哲人工智能研究生院) NAVER Digital Healthcare LAB(NAVER数字医疗实验室) Department of Health and Medical Information, Ansan University(安山大学健康与医疗信息系) Institute of Human Behavior and Genetics, Korea University College of Medicine(高丽大学医学院人类行为与遗传研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多语言多机构学习方法,通过文本对齐实现跨国ICU数据集的联合训练,优于多语言编码器和翻译方法,提升临床预测性能。

Comments On revision stage, 10 main pages, 3 supplementary pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00007 2026-04-02 cs.CL cs.AI 62%

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni: 多模态统一的大扩散语言模型

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。

Comments Project Page: https://dynin.ai/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00005 2026-04-02 cs.AI cs.CL 62%

How Emotion Shapes the Behavior of LLMs and Agents: A Mechanistic Study

情绪如何塑造大语言模型和代理的行为:一种机制性研究

Moran Sun, Tianlin Li, Yuwei Zheng, Zhenhong Zhou, Aishan Liu, Xianglong Liu, Yang Liu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出E-STEER框架,通过在隐藏状态中嵌入情绪作为可控变量,研究情绪对推理、生成、安全性和多步代理行为的影响,揭示情绪与行为之间的非单调关系。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00397 2026-04-02 cs.CV cs.AI 57%

Improving Generalization of Deep Learning for Brain Metastases Segmentation Across Institutions

提升跨机构深度学习在脑转移瘤分割中的泛化能力

Yuchen Yang, Shuangyang Zhong, Haijun Yu, Langcuomu Suo, Hongbin Han, Florian Putz, Yixing Huang

机构 * Peking University Health Science Center(北京大学医学部) Beijing Key Laboratory of Intelligent Neuromodulation and Brain Disorder Treatment(北京智能神经调控与脑疾病治疗重点实验室) University Hospital Erlangen(埃尔朗根大学医院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出VAE-MMD方法,通过结合变分自编码器和最大均值差异损失,提升跨机构脑转移瘤分割的泛化能力,实验显示在多个数据集上均取得了显著提升。

Comments 5 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02418 2026-04-02 cs.CR cs.LG 57%

Leveraging Large Language Models to Bridge Cross-Domain Transparency in Stablecoins

利用大型语言模型弥合稳定币跨领域透明度

Yuexin Xiang, Yuchen Lei, Yuanzhe Zhang, Qin Wang, Tsz Hon Yuen, Andreas Deppeler, Jiangshan Yu

机构 * Faculty of Information Technology, Monash University(莫纳什大学信息技术学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信任中心) School of Business, Monash University(莫纳什大学商学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出利用大型语言模型整合稳定币跨领域透明度,通过语义对齐发行披露与市场数据,揭示披露与可验证数据间的系统性差距,提升去中心化金融的自动化审计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00057 2026-04-02 cs.MM cs.AI 57%

Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning

面向知识增强视觉推理的自动足球解说生成

Zeyu Jin, Xiaoyu Qin, Songtao Zhou, Kaifeng Yun, Jia Jia

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出GameSight模型,通过视觉推理与知识增强生成更准确的足球解说,提升解说质量与上下文相关性。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15929 2026-04-02 cs.AI math.AP math.LO 57%

Semi-Autonomous Formalization of the Vlasov-Maxwell-Landau Equilibrium

半自动化的Vlasov-Maxwell-Landau平衡形式化

Vasily Ilin

机构 * University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文展示了一个完整的Lean 4形式化,用于Vlasov-Maxwell-Landau系统中的平衡特性描述,通过AI辅助数学研究流程,结合AI推理模型、编码工具和专业证明器,实现了高效的形式化验证。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01155 2026-04-02 cs.SD 50%

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01134 2026-04-02 cs.RO cs.DB eess.IV 50%

VRUD: A Drone Dataset for Complex Vehicle-VRU Interactions within Mixed Traffic

VRUD:一种用于复杂车辆-行人交互的无人机数据集

Ziyu Wang, Hongrui Kou, Cheng Wang, Ruochen Li, Hubert P. H. Shum, Amir Atapour-Abarghouei, Yuxin Zhang

机构 * National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与仿生全国重点实验室) DRIVEResearch School of Engineering and Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院) Department of Computer Science, Durham University(杜伦大学计算机科学系)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出VRUD数据集,用于复杂城市交通环境中的车辆-行人交互研究,包含高精度轨迹数据和多智能体交互场景,填补了现有数据集在无结构城市环境中的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-04-02 cs.CV 50%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 其他安全 :safety(abstract)

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20205 2026-04-02 cs.CV 50%

OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport

OTPrune: 通过最优传输实现分布对齐的视觉令牌剪枝

Xiwen Chen, Wenhui Zhu, Gen Li, Xuanzhao Dong, Yujian Xiong, Hao Wang, Peijie Qiu, Qingquan Song, Zhipeng Wang, Shao Tang, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出OTPrune,通过最优传输对齐视觉表示分布,实现高效的视觉令牌剪枝,提升推理效率并保持表示的稳定性与语义忠实性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19225 2026-04-02 eess.IV cs.CV 50%

Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding

统一的医学图像标记器用于自回归合成与理解

Chenglong Ma, Yuanfeng Ji, Jin Ye, Zilong Li, Chenhui Wang, Junzhi Ning, Wei Li, Lihao Liu, Qiushan Guo, Tianbin Li, Junjun He, Hongming Shan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Stanford University(斯坦福大学) Shanghai AI Laboratory(上海人工智能实验室) ByteDance Seed(字节跳动Seed)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MedITok,通过两阶段训练框架统一医学图像标记器,利用大规模未配对图像提升重建精度,并结合图像-文本对注入细粒度语义,实现自回归建模在诊断和生成任务中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00213 2026-04-02 cs.RO math.OC 50%

A Player Selection Network for Scalable Game-Theoretic Prediction and Planning

一种用于可扩展博弈论预测与规划的玩家选择网络

Tianyu Qiu, Eric Ouano, Fernando Palafox, Christian Ellis, David Fridovich-Keil

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出PSN Game框架,通过学习玩家选择网络减少博弈规模,提升预测准确性和规划安全性,同时利用目标推断网络处理信息不完全场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09744 2026-04-02 cs.MA 50%

Inferring Occluded Agent Behavior in Dynamic Games from Noise Corrupted Observations

从噪声受损观测中推断动态博弈中被遮挡行为

Tianyu Qiu, David Fridovich-Keil

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种考虑遮挡的博弈推理方法,用于估计可能被遮挡的智能体位置,并推断可见和被遮挡智能体的意图,同时验证了在噪声观测下的导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏