arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-27 至 2026-03-27 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2603.24857 2026-03-27 cs.CR cs.AI cs.CL cs.CV cs.LG 67%

AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective

在基础模型时代的人工智能安全:从统一视角的综合调查

Zhenyi Wang, Siyu Luan

机构 * University of Central Florida(中佛罗里达大学) University of Copenhagen(哥本哈根大学)

专题命中 隐私与版权 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从统一视角出发,系统探讨了基础模型时代AI安全问题,提出统一闭环威胁分类框架,揭示模型与数据之间的双向风险传播,为构建可扩展的安全策略提供理论基础。

Comments Published at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24772 2026-03-27 cs.CL cs.AI cs.LG 67%

Evaluating Fine-Tuned LLM Model For Medical Transcription With Small Low-Resource Languages Validated Dataset

评估细调LLM模型在医疗转录中的表现:针对小规模低资源语言验证数据集

Mohammed Nowshad Ruhani Chowdhury, Mohammed Nowaz Rabbani Chowdhury, Sakari Lukkarinen

机构 * School of ICT and Industrial Management(信息通信技术与工业管理学院) Metropolia University of Applied Sciences(Metropolia应用科学大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过在有限的芬兰语验证数据集上微调LLaMA 3.1-8B,评估了领域对齐的NLP模型在医疗转录中的有效性,结果显示BLEU、ROUGE-L和BERTScore F1等指标表现良好,表明细调在芬兰语医疗口语转录中的可行性。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏