arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-12 至 2026-03-12 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 18 篇

2603.10243 2026-03-12 cs.CL 88%

GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning

GR-SAP: 生成性重放用于在微调过程中保持安全对齐

Zhouxiang Fang, Jiawei Zhou, Hanjie Chen

专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09997 2026-03-12 cs.CL cs.AI cs.CY cs.HC 83%

Empathy Is Not What Changed: Clinical Assessment of Psychological Safety Across GPT Model Generations

共情并未改变:对心理安全的临床评估跨GPT模型世代

Michael Keeman, Anastasia Keeman

机构 * Keido Labs(Keido实验室)

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过临床评估发现,GPT模型在心理安全方面存在变化,尽管共情评分无显著差异,但危机检测能力提升而建议安全下降,揭示了模型在对话中间阶段的显著变化。

Comments 17 pages, 7 figures. First empirical measurement of the #keep4o phenomenon using clinical psychological safety frameworks. Compares GPT-4o, o4-mini, and GPT-5-mini on empathy, crisis detection, and advice safety dimensions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08017 2026-03-12 cs.HC cs.AI 79%

Alignment-Process-Outcome: Rethinking How AIs and Humans Collaborate

对齐-过程-结果:重新思考AI和人类如何协作

Haichang Li, Anjun Zhu, Arpit Narechania

机构 * George Mason University(乔治·马歇尔大学) Simon Fraser University(西蒙·弗雷泽大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出通过任务和意图两个视角重新理解AI与人类协作的结构关系,揭示对齐、过程和结果之间的动态联系。

Comments Accepted by Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA 26), Barcelona, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10682 2026-03-12 cs.RO 78%

OnFly: Onboard Zero-Shot Aerial Vision-Language Navigation toward Safety and Efficiency

OnFly:面向安全与效率的机载零样本空中视觉语言导航

Guiyong Zheng, Yueting Ban, Mingjie Zhang, Juepeng Zheng, Boyu Zhou

机构 * School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他安全 :safety(title,abstract)

AI总结 OnFly通过共享感知双智能体架构和混合记忆机制,实现高效稳定的零样本空中视觉语言导航,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09566 2026-03-12 cs.AI cs.LG 76%

Toward Closed-loop Molecular Discovery via Language Model, Property Alignment and Strategic Search

通过语言模型、性质对齐和战略搜索实现闭环分子发现

Junkai Ji, Zhangfan Yang, Dong Xu, Ruibin Bai, Jianqiang Li, Tingjun Hou, Zexuan Zhu

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG

AI总结 Trio结合语言模型、性质对齐和战略搜索,实现高效且可解释的闭环分子设计,提升药物配体的结合亲和力、药物性和合成可及性。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09987 2026-03-12 cs.CL cs.AI cs.LG 67%

Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation

链式推理特征转换的进化演示优化

Xinyuan Wang, Kunpeng Liu, Arun Vignesh Malarkkan, Yanjie Fu

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种通过进化轨迹经验优化LLM驱动的特征转换方法,提升转换多样性与下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10877 2026-03-12 cs.CL 57%

From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers

从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移

Ayan Sengupta, Shantanu Dixit, Md Shad Akhtar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10052 2026-03-12 cs.RO cs.LG 57%

OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies

OmniGuide: 通用引导场用于增强通用机器人策略

Yunzhou Song, Long Le, Yong-Hyun Park, Jie Wang, Junyao Shi, Lingjie Liu, Jiatao Gu, Eric Eaton, Dinesh Jayaraman, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 OMNIGUIDE通过整合多种引导源提升通用机器人策略在复杂任务中的性能

Comments Project Page: $\href{https://omniguide.github.io/}{this\; url}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02816 2026-03-12 cs.CV cs.AI 57%

BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation

BrandFusion: 一种多智能体框架,用于文本到视频生成中的无缝品牌整合

Zihao Zhu, Ruotong Wang, Siwei Lyu, Min Zhang, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) State University of New York at Buffalo(纽约州立大学布法罗分校) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 BrandFusion通过多智能体框架实现文本到视频生成中的无缝品牌整合,提升品牌辨识度和内容自然度,推动T2V的可持续商业化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24224 2026-03-12 cs.LG 57%

Proposing a Framework for Machine Learning Adoption on Legacy Systems

为遗留系统采用机器学习提出一个框架

Ashiqur Rahman, Hamed Alhoori

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出一个基于API的框架,通过解耦ML模型生命周期与生产环境,为遗留系统提供轻量级浏览器界面,减少升级成本和生产中断,提升制造业生产质量与安全。

Comments Accepted at The First International Workshop on Resilient Artificial Intelligence for Manufacturing (ICDM'25)

Journal ref 2025 IEEE International Conference on Data Mining Workshops (ICDMW), Washington, DC, USA, 2025, pp. 1616-1623

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04233 2026-03-12 cs.LG cs.SI 57%

Graph machine learning for flight delay prediction due to holding manouver

基于图机器学习的飞行延误预测:因等待 maneuver 引起的延误

Jorge L. Franco, Manoel V. Machado Neto, Filipe A. N. Verri, Diego R. Amancio

机构 * Institute of Mathematics and Computer Science, University of São Paulo(圣保罗大学数学与计算机科学研究所) Aeronautical Technology Institute – ITA(航空技术研究所 – ITA)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本研究利用图机器学习方法预测因等待 maneuver 引起的飞行延误,通过CatBoost和GATs模型提升预测精度并提供可解释性,以提高航空运营效率。

Journal ref Physica A 685, 131318 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10862 2026-03-12 cs.SD 50%

OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs

OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型

Yujie Liao, Xuelong Geng, Hongfei Xue, Shuiyuan Wang, Lei Xie

机构 * Ascend NPUs(Ascend NPU)

专题命中 其他安全 :alignment(abstract)

AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10825 2026-03-12 cs.CV 50%

A dataset of medication images with instance segmentation masks for preventing adverse drug events

一种包含实例分割掩码的药物图像数据集,用于预防不良药物事件

W. I. Chu, S. Hirani, G. Tarroni, L. Li

机构 * City St George’s, University of London, School of Science & Technology(伦敦城市圣乔治学院科学与技术学院) City St George’s, University of London, School of Health & Medical Sciences(伦敦城市圣乔治学院健康与医学科学学院) Imperial College London, Dept of Computer Science(伦敦帝国学院计算机科学系)

专题命中 其他安全 :safety(abstract)

AI总结 MEDISEG提供包含实例分割掩码的药物图像数据集,用于提升AI在药物识别中的性能和鲁棒性。

Comments 25 pages, 19 figures. Submitted to Scientific Data (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10780 2026-03-12 cs.CV 50%

Guiding Diffusion Models with Semantically Degraded Conditions

通过语义退化条件引导扩散模型

Shilong Han, Yuming Zhang, Hongxia Wang

机构 * College of Science, National University of Defense Technology(国防科技大学理学院)

专题命中 其他安全 :alignment(abstract)

AI总结 通过语义退化条件引导扩散模型,提升文本图像对齐与组合准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10343 2026-03-12 eess.SP 50%

Multi-Modal Intelligent Channel Modeling: From Fine-tuned LLMs to Pre-trained Foundation Models

多模态智能信道建模:从微调大语言模型到预训练基础模型

Lu Bai, Zengrui Han, Mingran Sun, Xiang Cheng

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出多模态智能信道建模,通过微调大语言模型和预训练基础模型,实现6G无线通信的精确预测与灵活建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08665 2026-03-12 cs.CR 50%

Cybersecurity AI: Hacking Consumer Robots in the AI Era

人工智能时代的消费机器人网络安全问题

Víctor Mayoral-Vilches, Unai Ayucar-Carbajo, Olivier Laflamme, Ruikai Peng, María Sanz-Gómez, Francesco Balassone, Lucas Apa, Endika Gil-Uriarte

专题命中 其他安全 :safety(abstract)

AI总结 本文探讨了生成式AI对机器人网络安全的影响,通过三个案例研究展示了AI如何自动化发现漏洞,呼吁传统防御架构向AI原生防御代理演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14918 2026-03-12 cs.CV 50%

X-WIN: Building Chest Radiograph World Model via Predictive Sensing

X-WIN:通过预测感知构建胸片世界模型

Zefan Yang, Ge Wang, James Hendler, Mannudeep K. Kalra, Pingkun Yan

专题命中 其他安全 :alignment(abstract)

AI总结 X-WIN通过预测感知构建胸片世界模型,利用体积数据提炼3D解剖知识,提升CXR的表示学习和诊断能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13302 2026-03-12 cs.CV 50%

An Overview about Emerging Technologies of Autonomous Driving

自动驾驶新兴技术概述

Yu Huang, Yue Chen, Zijiang Yang

专题命中 其他安全 :safety(abstract)

AI总结 本文概述了自动驾驶新兴技术,重点探讨了数据闭环框架下的关键技术和开放性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏