GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning
GR-SAP: 生成性重放用于在微调过程中保持安全对齐
专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
GR-SAP: 生成性重放用于在微调过程中保持安全对齐
专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。
共情并未改变:对心理安全的临床评估跨GPT模型世代
机构 * Keido Labs(Keido实验室)
专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究通过临床评估发现,GPT模型在心理安全方面存在变化,尽管共情评分无显著差异,但危机检测能力提升而建议安全下降,揭示了模型在对话中间阶段的显著变化。
Comments 17 pages, 7 figures. First empirical measurement of the #keep4o phenomenon using clinical psychological safety frameworks. Compares GPT-4o, o4-mini, and GPT-5-mini on empathy, crisis detection, and advice safety dimensions
对齐-过程-结果:重新思考AI和人类如何协作
机构 * George Mason University(乔治·马歇尔大学) ; Simon Fraser University(西蒙·弗雷泽大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出通过任务和意图两个视角重新理解AI与人类协作的结构关系,揭示对齐、过程和结果之间的动态联系。
Comments Accepted by Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA 26), Barcelona, Spain, 2026
OnFly:面向安全与效率的机载零样本空中视觉语言导航
机构 * School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) ; Southern University of Science and Technology(南方科技大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 其他安全 :safety(title,abstract)
AI总结 OnFly通过共享感知双智能体架构和混合记忆机制,实现高效稳定的零样本空中视觉语言导航,提升安全性和效率。
通过语言模型、性质对齐和战略搜索实现闭环分子发现
专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG
AI总结 Trio结合语言模型、性质对齐和战略搜索,实现高效且可解释的闭环分子设计,提升药物配体的结合亲和力、药物性和合成可及性。
Comments 30 pages, 7 figures
链式推理特征转换的进化演示优化
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种通过进化轨迹经验优化LLM驱动的特征转换方法,提升转换多样性与下游任务性能。
从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移
机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) ; Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。
OmniGuide: 通用引导场用于增强通用机器人策略
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 OMNIGUIDE通过整合多种引导源提升通用机器人策略在复杂任务中的性能
Comments Project Page: $\href{https://omniguide.github.io/}{this\; url}$
BrandFusion: 一种多智能体框架,用于文本到视频生成中的无缝品牌整合
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; State University of New York at Buffalo(纽约州立大学布法罗分校) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 BrandFusion通过多智能体框架实现文本到视频生成中的无缝品牌整合,提升品牌辨识度和内容自然度,推动T2V的可持续商业化应用。
为遗留系统采用机器学习提出一个框架
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本文提出一个基于API的框架,通过解耦ML模型生命周期与生产环境,为遗留系统提供轻量级浏览器界面,减少升级成本和生产中断,提升制造业生产质量与安全。
Comments Accepted at The First International Workshop on Resilient Artificial Intelligence for Manufacturing (ICDM'25)
Journal ref 2025 IEEE International Conference on Data Mining Workshops (ICDMW), Washington, DC, USA, 2025, pp. 1616-1623
基于图机器学习的飞行延误预测:因等待 maneuver 引起的延误
机构 * Institute of Mathematics and Computer Science, University of São Paulo(圣保罗大学数学与计算机科学研究所) ; Aeronautical Technology Institute – ITA(航空技术研究所 – ITA)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本研究利用图机器学习方法预测因等待 maneuver 引起的飞行延误,通过CatBoost和GATs模型提升预测精度并提供可解释性,以提高航空运营效率。
Journal ref Physica A 685, 131318 (2026)
OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型
机构 * Ascend NPUs(Ascend NPU)
专题命中 其他安全 :alignment(abstract)
AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。
Comments 5 pages, 2 figures
一种包含实例分割掩码的药物图像数据集,用于预防不良药物事件
机构 * City St George’s, University of London, School of Science & Technology(伦敦城市圣乔治学院科学与技术学院) ; City St George’s, University of London, School of Health & Medical Sciences(伦敦城市圣乔治学院健康与医学科学学院) ; Imperial College London, Dept of Computer Science(伦敦帝国学院计算机科学系)
专题命中 其他安全 :safety(abstract)
AI总结 MEDISEG提供包含实例分割掩码的药物图像数据集,用于提升AI在药物识别中的性能和鲁棒性。
Comments 25 pages, 19 figures. Submitted to Scientific Data (Nature Portfolio)
通过语义退化条件引导扩散模型
机构 * College of Science, National University of Defense Technology(国防科技大学理学院)
专题命中 其他安全 :alignment(abstract)
AI总结 通过语义退化条件引导扩散模型,提升文本图像对齐与组合准确性。
Comments Accepted to CVPR 2026
多模态智能信道建模:从微调大语言模型到预训练基础模型
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出多模态智能信道建模,通过微调大语言模型和预训练基础模型,实现6G无线通信的精确预测与灵活建模。
人工智能时代的消费机器人网络安全问题
专题命中 其他安全 :safety(abstract)
AI总结 本文探讨了生成式AI对机器人网络安全的影响,通过三个案例研究展示了AI如何自动化发现漏洞,呼吁传统防御架构向AI原生防御代理演变。
X-WIN:通过预测感知构建胸片世界模型
专题命中 其他安全 :alignment(abstract)
AI总结 X-WIN通过预测感知构建胸片世界模型,利用体积数据提炼3D解剖知识,提升CXR的表示学习和诊断能力。
Comments Accepted by CVPR 2026
自动驾驶新兴技术概述
专题命中 其他安全 :safety(abstract)
AI总结 本文概述了自动驾驶新兴技术,重点探讨了数据闭环框架下的关键技术和开放性问题。