arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-25 至 2026-03-25 共收录 73 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 25 篇

2601.12138 2026-03-25 cs.AI 83%

DriveSafe: A Hierarchical Risk Taxonomy for Safety-Critical LLM-Based Driving Assistants

DriveSafe:面向安全关键的LLM驾驶助手风险分类

Abhishek Kumar, Riya Tapwal, Carsten Maple

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Warwick(沃里克大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出DriveSafe,一种四层风险分类体系,用于系统表征LLM驾驶助手的安全关键失效模式,涵盖技术、法律、社会和伦理维度,通过专家评审和模型评估验证其现实性与安全性。

Comments This is the revised version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23037 2026-03-25 cs.CV cs.AI cs.CL cs.LG cs.RO 82%

YOLOv10 with Kolmogorov-Arnold networks and vision-language foundation models for interpretable object detection and trustworthy multimodal AI in computer vision perception

YOLOv10结合Kolmogorov-Arnold网络和视觉-语言基础模型用于可解释的目标检测和可信的多模态AI在计算机视觉感知

Marios Impraimakis, Daniel Vazquez, Feiyu Zhou

机构 * University of Bath(巴斯大学) Zhejiang University(浙江大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于Kolmogorov-Arnold网络和视觉-语言基础模型的YOLOv10框架,通过七种几何和语义特征提升目标检测的可解释性,并在模糊、遮挡或低纹理场景中实现可信的置信度估计。

Comments 14 pages, 23 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22819 2026-03-25 cs.CV cs.AI 79%

TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment

TDATR:通过表格细节感知学习和单元级视觉对齐改进端到端表格识别

Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 TDATR通过表格细节感知学习和单元级视觉对齐改进端到端表格识别,采用感知-融合策略,提升模型鲁棒性和识别精度,无需数据集特定微调即可在七个基准上取得领先性能。

Comments Acceptd by CVPR 2026. Project Page: https://github.com/Chunchunwumu/TDATR.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22350 2026-03-25 cs.AI cs.CR 79%

Session Risk Memory (SRM): Temporal Authorization for Deterministic Pre-Execution Safety Gates

会话风险记忆(SRM):确定性预执行安全门的时序授权

Florin Adrian Chitan

机构 * Independent Researcher(独立研究者) ILION Project(ILION项目)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出SRM,一种轻量确定性模块,通过轨迹级授权扩展无状态执行门,以检测分布式攻击。实验显示SRM在检测率和准确率上优于传统方法,且具备低延迟。

Comments 12 pages, 3 figures. Companion paper to arXiv:2603.13247. Benchmark dataset and artifacts available on Zenodo: 10.5281/zenodo.15410944

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22295 2026-03-25 cs.CL cs.AI 79%

Whether, Not Which: Mechanistic Interpretability Reveals Dissociable Affect Reception and Emotion Categorization in LLMs

是否而非哪一个:机制可解释性揭示了LLMs中可分离的情感接收与情绪分类

Michael Keeman

机构 * Keido Labs(Keido实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过机制可解释性方法揭示了LLMs中情感处理的两种可分离机制,证明了情绪电路并非依赖关键词,为AI安全评估提供了新标准。

Comments 38 pages, 11 figures, 16 tables. Code and data: https://github.com/keidolabs/affect-reception

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23304 2026-03-25 cs.CR 78%

Security Barriers to Trustworthy AI-Driven Cyber Threat Intelligence in Finance: Evidence from Practitioners

可信AI驱动的金融网络安全威胁情报中的安全障碍:来自实践者的证据

Emir Karaosman, Advije Rizvani, Irdin Pekaric

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 研究探讨金融机构在使用AI驱动的威胁情报时面临的安全障碍,结合文献综述、访谈和调查,识别出四个阻碍可信AI部署的社会技术失败模式,并提出三种安全操作保障措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08121 2026-03-25 cs.LG cs.AI cs.CL 67%

Balanced Accuracy: The Right Metric for Evaluating LLM Judges -- Explained through Youden's J statistic

平衡准确率:评估大语言模型判官的正确指标——通过Youden的J统计量解释

Stephane Collot, Colin Fraser, Justin Zhao, William F. Shen, Timon Willi, Ilias Leontiadis

机构 * Meta Superintelligence Labs(Meta超智能实验室) Meta University of Cambridge(剑桥大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Youden的J统计量证明平衡准确率是评估LLM判官的更优指标,通过分析和实验展示其在选择判官时提升分类器鲁棒性的效果。

Comments 10 pages, 5 figures

Journal ref In Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 5: Industry Track), pages 927-936, Rabat, Morocco, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23501 2026-03-25 cs.CV cs.AI cs.CL 62%

MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage

MedObvious:通过临床分诊暴露视觉语言模型中的医学莫拉维奇悖论

Ufaq Khan, Umair Nawaz, L D M S S Teja, Numaan Saeed, Muhammad Bilal, Yutong Xie, Mohammad Yaqub, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(马尔代夫布扎伊德人工智能大学,阿联酋) National Institute of Technology, Silchar(西尔CHAR国家理工学院) Birmingham City University, UK(伯明翰城市大学,英国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究提出MedObvious基准测试,通过临床分诊任务验证视觉语言模型的输入验证能力,发现现有模型在处理不一致或无效输入时仍存在可靠性问题。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22318 2026-03-25 cs.CL cs.LG 62%

Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worlds

飞行猪、FaR及更广泛的领域:评估LLM在反事实世界中的推理能力

Anish R Joishy, Ishwar B Balappanawar, Vamshi Krishna Bonagiri, Manas Gaur, Krishnaprasad Thirunarayan, Ponnurangam Kumaraguru

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Wright State University(威斯汀豪斯州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在反事实场景下的推理能力,提出FaR方法以增强模型的元认知,减少逻辑与知识冲突带来的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22328 2026-03-25 cs.LG cs.AI stat.ML 62%

Beyond the Mean: Distribution-Aware Loss Functions for Bimodal Regression

超越均值:用于双模回归的分布感知损失函数

Abolfazl Mohammadi-Seif, Carlos Soares, Rita P. Ribeiro, Ricardo Baeza-Yates

机构 * INESC TEC

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种分布感知损失函数,结合归一化RMSE、Wasserstein和Cramér距离,用于解决双模回归中的预测不确定性问题,提高了模型的稳定性与鲁棒性。

Comments 28 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22305 2026-03-25 cs.LG cs.AI 62%

CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News

CN-Buzz2Portfolio: 一个面向中国市场、基于LLM的宏观与行业资产配置基准数据集

Liyuan Chen, Shilong Li, Jiangpeng Yan, Shuoling Liu, Qiang Yang, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) E Fund Management Co., Ltd.(E基金管理有限公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CN-Buzz2Portfolio数据集,用于评估LLM在动态金融决策中的表现,通过模拟真实市场关注流,测试模型在宏观叙事到资产配置的转换能力,揭示不同模型在资产分配上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23308 2026-03-25 cs.CV cs.AI 57%

Curriculum-Driven 3D CT Report Generation via Language-Free Visual Grafting and Zone-Constrained Compression

基于课程学习的3D CT报告生成:通过无语言视觉移植与区域约束压缩

V. K. Cody Bumgardner, Mitchell A. Klusty, Mahmut S. Gokmen, Evan W. Damron

机构 * Center for Applied Artificial Intelligence, University of Kentucky(应用人工智能中心,肯塔基大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Ker-VLJEPA-3B框架,通过四阶段课程学习生成胸腔CT报告,采用无语言视觉主干和区域约束压缩提升生成质量,实验显示其在CT-RATE基准上取得更高F1分数。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15994 2026-03-25 cs.CR cs.AI 57%

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估

Dongsen Zhang, Zekun Li, Xu Luo, Xuannan Liu, Peipei Li, Wenjun Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22777 2026-03-25 cs.AI 57%

AgriPestDatabase-v1.0: A Structured Insect Dataset for Training Agricultural Large Language Model

AgriPestDatabase-v1.0:用于训练农业大语言模型的结构化昆虫数据集

Yagizhan Bilal Durak, Ahsan Ul Islam, Shahidul Islam, Ashley Morgan-Olvera, Iftekhar Ibne Basith, Syed Hasib Akhter Faruqui

机构 * Sam Houston State University(萨姆豪斯敦州立大学) Kennesaw State University(肯纳威克州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出AgriPestDatabase-v1.0,构建了结构化昆虫数据集并采用轻量级LLM进行微调,以提升农业害虫管理的决策支持能力。

Comments Accepted in Artificial Super Intelligence Conference 2026 (Sponsored by KSU PLOT & IEEE CIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23276 2026-03-25 cs.AI 57%

CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays

CXReasonAgent:基于证据的胸部X光诊断推理代理

Hyungyung Lee, Hangyul Yoon, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出CXReasonAgent,结合大语言模型和临床诊断工具,通过图像生成的诊断和视觉证据进行证据导向的诊断推理,展示了其在多轮对话基准测试中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07023 2026-03-25 q-fin.TR cs.AI 57%

Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation

对LLM代理的行为一致性验证:通过股票市场模拟分析交易风格切换

Zeping Li, Guancheng Wan, Keyang Chen, Yu Chen, Yiwen Zhao, Philip Torr, Guangnan Ye, Zhenfei Yin, Hongfeng Chai

机构 * Fudan University(复旦大学) Wuhan University(武汉大学) BNP Paribas(BNP巴黎银行) Oxford University(牛津大学) Haven

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过股票市场模拟分析交易风格切换,评估LLM代理策略切换与金融理论的一致性,提出四个行为金融驱动因素作为性格特质,并通过Mann-Whitney U检验比较策略切换行为与理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13152 2026-03-25 cs.CV cs.AI 57%

Continuous Patient Monitoring with AI: Real-Time Analysis of Video in Hospital Care Settings

利用AI进行连续患者监测:医院护理环境中的实时视频分析

Paolo Gabriel, Peter Rehani, Tyler Troy, Tiffany Wyatt, Michael Choma, Narinder Singh

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一个AI驱动的平台,用于医院环境中持续被动的患者监测,通过视频分析实时洞察患者行为和互动,提升患者安全和护理质量。

Comments 21 pages, 9 figures, 3 tables, submitted to Frontiers in Imaging > Imaging Applications > (Research Topic) Deep Learning for Medical Imaging Applications for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05036 2026-03-25 cs.HC cs.AI 57%

Mapping the Challenges of HCI: An Application and Evaluation of ChatGPT for Mining Insights at Scale

映射人机交互的挑战:利用ChatGPT进行大规模洞察挖掘的应用与评估

Jonas Oppenlaender, Joonas Hämäläinen

机构 * University of Oulu, Center for Applied Computing, Faculty of Information Technology and Electrical Engineering(奥卢大学,应用计算中心,信息科技与电气工程学院) University of Jyväskylä, Software and Communications Engineering, Faculty of Information Technology(耶夫尼耶斯基大学,软件与通信工程,信息科技学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文评估ChatGPT在从大规模人机交互文献中提取研究挑战的应用,通过两步法提取并筛选挑战,发现与伦理和可及性等领域的强关联,以及人机协作等领域的不足,验证了LLM在大规模定性分析中的实用性。

Comments Accepted in International Journal of Human-Computer Interaction; 45 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22291 2026-03-25 cs.CL 57%

Evaluating Large Language Models' Responses to Sexual and Reproductive Health Queries in Nepali

评估大型语言模型对尼泊尔性与生殖健康问题的回应

Medha Sharma, Supriya Khadka, Udit Chandra Aryal, Bishnu Hari Bhatta, Bijayan Bhattarai, Santosh Dahal, Kamal Gautam, Pushpa Joshi, Saugat Kafle, Shristi Khadka, Shushila Khadka, Binod Lamichhane, Shilpa Lamichhane, Anusha Parajuli, Sabina Pokharel, Suvekshya Sitaula, Neha Verma, Bishesh Khanal

机构 * Nepal Applied Mathematics and Informatics Institute for research(尼泊尔应用数学与信息学研究所) Partnership for Sustainable Development Nepal(尼泊尔可持续发展伙伴关系) Visible Impact(可见影响)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出LEAF框架,评估大型语言模型在尼泊尔性与生殖健康问题上的准确性、语言、可用性及安全性,发现仅35.1%的回应符合标准,揭示了当前模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22290 2026-03-25 cs.CL cs.IR 57%

Less is More: Adapting Text Embeddings for Low-Resource Languages with Small Scale Noisy Synthetic Data

少即是多:利用小规模噪声合成数据适应低资源语言的文本嵌入

Zaruhi Navasardyan, Spartak Bughdaryan, Bagrat Minasyan, Hrant Davtyan

机构 * Metric AI Lab(Metric AI实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文挑战了大规模数据对语义对齐的必要性假设,通过小规模噪声合成数据提升低资源语言文本嵌入性能,实验显示在仅1万对数据下即可获得显著改进,验证了噪声对语义对齐的鲁棒性。

Comments Accepted at LoResLM 2026, EACL 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23132 2026-03-25 cs.CV 50%

InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance

InterDyad:通过查询中间视觉指导实现交互式双人语音到视频生成

Dongwei Pan, Longwei Guo, Jiazhi Guan, Luying Huang, Yiding Li, Haojie Liu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou

机构 * Baidu Inc.(百度公司)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出InterDyad框架,通过查询结构运动指导实现自然交互动态合成,解决双人场景中跨个体依赖和精细行为控制问题,提出交互性注入器、元查询模态对齐机制和角色感知双人高斯指导等方法,提升唇形同步和空间一致性。

Comments Project Page: https://interdyad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22860 2026-03-25 cs.SI 50%

Who Sits Where? Automated Detection of Director Interlocks in Indian Companies

谁坐在哪里?印度公司的董事交叉任职自动检测

Prateek Sancheti, Kamalakar Karlapalem, Kavita Vemuri

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一种可扩展的图论框架,用于系统识别和分析董事交叉任职,利用BFS和LLM检测董事-公司集群,揭示潜在的网络驱动因素,提升自动检测复杂企业关系的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22574 2026-03-25 cs.RO 50%

GIFT: Generalizing Intent for Flexible Test-Time Rewards

GIFT:基于意图的灵活测试时间奖励

Fin Amin, Nathaniel Dennler, Andreea Bobu

机构 * NC State(北卡罗来纳州立大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 GIFT通过语言模型推断用户演示中的高层意图,以提升奖励在新环境下的泛化能力,优于基于视觉和语义相似性的基线方法。

Comments To appear at IEEE ICRA '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18835 2026-03-25 cs.DB 50%

Tursio Database Search: How far are we from ChatGPT?

Tursio数据库搜索:我们距离ChatGPT还有多远?

Sulbha Jain, Shivani Tripathi, Shi Qiao, Alekh Jindal

专题命中 安全评测 :safety(abstract)

AI总结 本文提出评估框架,评估企业数据库自然语言搜索质量,对比Tursio与ChatGPT在银行数据库上的表现,发现Tursio在相关性上表现接近基准,但存在数据库完整性瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17108 2026-03-25 cs.CV 50%

LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience

基于大语言模型的社交媒体影像洪水深度估计:一种具有机制可解释性的视觉-语言模型框架用于交通韧性

Nafis Fuad, Xiaodong Qian

专题命中 安全评测 :safety(abstract)

AI总结 本文提出FloodLlama,一种基于视觉-语言模型的洪水深度估计框架,通过合成数据集和多模态传感管道实现厘米级实时洪水深度估计,提升交通网络韧性。

Comments There is a update in result, which is needed to be addressed

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2603.18788 2026-03-25 cs.CL cs.AI 73%

Mi:dm K 2.5 Pro

KT Tech innovation Group

专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22322 2026-03-25 cs.LG cs.AI cs.CY 67%

AEGIS: An Operational Infrastructure for Post-Market Governance of Adaptive Medical AI Under US and EU Regulations

AEGIS:一种用于美国和欧盟法规下适应性医疗AI市场后治理的操作基础设施

Fardin Afdideh, Mehdi Astaraki, Fernando Seoane, Farhad Abtahi

机构 * Department of Clinical Science, Intervention and Technology, Karolinska Institutet(临床科学、干预与技术部门,Karolinska研究院) Department of Medical Radiation Physics, Stockholm University(医学辐射物理学部门,斯德哥尔摩大学) Department of Oncology-Pathology, Karolinska Institutet(肿瘤学-病理学部门,Karolinska研究院) Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) Department of Textile Technology, University of Bor s(纺织技术部门,Bor s大学) Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院) Department of Biomedical Engineering and Health System, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出AEGIS框架,通过数据集整合、模型监控和条件决策模块,实现FDA PCCP和EU AI Act条款的执行,支持医疗AI的持续学习与安全更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23251 2026-03-25 cs.CL cs.LG 62%

Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Models

人工智能是否正在赶上人类表达?探索英语和阿拉伯语中情感、个性、作者身份和语言风格的模仿

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(计算机与信息科学学院,沙特阿拉伯国王沙德大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究六种大语言模型在英语和阿拉伯语中模仿情感和个性的能力,发现AI生成文本可被识别,但分类性能下降,揭示了LLM在情感信号编码上的差异。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22612 2026-03-25 cs.CR cs.HC 50%

BioShield: A Context-Aware Firewall for Securing Bio-LLMs

BioShield: 一种面向生物大语言模型的上下文感知防火墙

Protiva Das, Sovon Chakraborty, Sidhant Narula, Lucas Potter, Xavier-Lewis Palmer, Pratip Rana, Daniel Takabi, Mohammad Ghasemigol

专题命中 AI治理与伦理 :safety(abstract)

AI总结 BioShield通过上下文感知的提示扫描和响应验证,为生物领域大语言模型提供多层次安全防护,有效防止双重用途攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 14 篇

2603.23091 2026-03-25 cs.CL 70%

When Language Models Lose Their Mind: The Consequences of Brain Misalignment

当语言模型失去理智:大脑错位的后果

Gabriele Merlin, Mariya Toneva

机构 * MPI-SWS(马克斯·普朗克研究所)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究探讨了大脑对齐对语言能力的影响,通过创建大脑错位模型发现其显著损害下游性能,强调了大脑对齐在实现稳健语言能力中的关键作用。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏