arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2604.02359 2026-04-06 cs.CL cs.AI 81%

Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis

利用LLM作为法官/陪审团推进模型响应用户表现精神病的可扩展、临床验证的安全性评估

May Lynn Reese, Markela Zeneli, Mindy Ng, Jacob Haimes, Andreea Damien, Elizabeth Stade

机构 * Apart Research Odyssean Institute London School of Economics and Political Science(伦敦政治经济学院) Stanford Institute for Human-Centered AI(斯坦福大学以人为本人工智能研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM作为法官或陪审团评估模型响应用户精神病表现的方法,开发了七项临床验证的安全标准,并展示了LLM作为法官在临床验证中的有效性。

Comments published at IASEAI 2026, preliminary work presented at GenAI4Health workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00547 2026-04-02 cs.AI cs.LG 81%

Does Unification Come at a Cost? Uni-SafeBench: A Safety Benchmark for Unified Multimodal Large Models

统一是否带来代价?Uni-SafeBench:一种用于统一多模态大模型的安全基准

Zixiang Peng, Yongxiu Xu, Qinyi Zhang, Jiexun Shen, Yifan Zhang, Hongbo Xu, Yubin Wang, Gaopeng Gou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Uni-SafeBench,用于评估统一多模态大模型的安全性,发现统一过程虽提升能力但显著降低基础LLM的安全性,开源资源以促进更安全的AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29467 2026-04-01 cs.CL cs.AI 81%

M-MiniGPT4: Multilingual VLLM Alignment via Translated Data

M-MiniGPT4:通过翻译数据实现多语言VLLM对齐

Seung Hun Han, Youssef Mohamed, Mohamed Elhoseiny

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) KAUST(阿卜杜拉国王科技大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出M-MiniGPT4多语言视觉大语言模型,通过混合原生多语言和翻译数据提升MiniGPT4的多语言视觉理解能力,并引入多语言对齐训练阶段,使模型在多语言MMMU基准测试中达到36%的准确率。

Comments 6 pages, ACL 2026, Proceedings of the 7th Workshop on African Natural Language Processing (AfricaNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29410 2026-04-01 cs.CV cs.AI cs.LG 81%

AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性

Yubo Cui, Xianchao Guan, Zijun Xiong, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。

Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02711 2026-03-31 cs.CL cs.LG 81%

CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer

CREST:通过聚类引导的跨语言迁移实现通用安全性防护

Lavish Bansal, Naman Mishra

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CREST模型,通过跨语言迁移有效提升低资源语言的安全性防护,展示其在六个安全基准上的优越表现。

Comments 9 Pages, 5 Figures, Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26829 2026-03-31 cs.LG cs.AI 81%

Squish and Release: Exposing Hidden Hallucinations by Making Them Surface as Safety Signals

挤压与释放:通过使其显现为安全信号来暴露隐藏的幻觉

Nathaniel Oh, Paul Attie

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Squish and Release框架,通过激活空间修补技术揭示模型在对话压力下隐藏的幻觉问题,通过实验验证了检测模块和核心架构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25692 2026-03-27 cs.LG cs.AI cs.AR cs.ET 81%

A Unified Memory Perspective for Probabilistic Trustworthy AI

概率可信人工智能的统一内存视角

Xueji Zhao, Likai Pei, Jianbo Liu, Kai Ni, Ningyuan Cao

机构 * University of Notre Dame(圣母大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一内存视角分析概率可信AI,揭示随机需求降低数据访问效率并驱动系统进入熵受限操作,定义内存级评估标准,分析传统架构局限并探讨新型概率计算内存方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 81%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06264 2026-03-24 cs.CL cs.CY 81%

Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion

注意鸿沟:LLM对齐与亚洲公众意见的陷阱

Hari Shankar, Vedanta S P, Sriharini Margapuri, Debjani Mazumder, Ponnurangam Kumaraguru, Abhijnan Chakraborty

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 本文研究了LLM在多语言多文化环境中的对齐问题,发现其在宗教观点尤其是少数群体方面存在偏差,提出轻量干预无法消除文化鸿沟,强调需系统性地区审计确保公平部署。

Comments 13 pages, including AAAI Paper Checklist. Accepted in Proceedings of the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21145 2026-03-24 cs.DC cs.AI cs.LG cs.SC 81%

NeSy-Edge: Neuro-Symbolic Trustworthy Self-Healing in the Computing Continuum

NeSy-Edge:神经符号可信自愈在计算连续体中的应用

Peihan Ye, Alfreds Lapkovskis, Alaa Saleh, Qiyang Zhang, Praveen Kumar Donta

机构 * Department of Computer Systems and Sciences(计算机系统与科学系) University of Oulu(奥卢大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NeSy-Edge框架,通过边缘优先设计,在资源受限的边缘节点进行本地感知与推理,结合云模型进行最终诊断,实现计算连续体中的可信自愈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08009 2026-03-17 cs.CY cs.AI 81%

The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment

遵循法律的AI框架:法律基础与技术限制。AI行为者的法律类比和技术可行性

Katalina Hernandez Delgado

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文评估了O'Keefe等人提出的

Comments Presented at SMU Computational Legal Studies Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13558 2026-03-17 stat.ML cs.CL cs.IT cs.LG math.IT 81%

Holographic Invariant Storage: Design-Time Safety Contracts via Vector Symbolic Architectures

全息不变存储:通过向量符号架构实现设计时的安全合同

Arsenios Scrivens

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出全息不变存储协议,通过整合双极向量符号架构的特性,为LLM上下文漂移缓解提供设计时的安全合同,提供三种可预估的保障,提升系统工程师在设计阶段的恢复保真度和代码本容量预算能力。

Comments 25 pages, 7 figures, includes appendices with extended proofs and pilot LLM experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13305 2026-03-17 cs.LG cs.AI 81%

Evidence-based Distributional Alignment for Large Language Models

基于证据的分布对齐用于大语言模型

Viet-Thanh Pham, Lizhen Qu, Zhuang Li, Gholamreza Haffari

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Evi-DA方法,通过检索世界价值观调查数据预测国家条件下的答案分布,提升大语言模型在领域和文化变化下的分布估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13286 2026-03-17 cs.CY cs.AI 81%

How Meta-research Can Pave the Road Towards Trustworthy AI In Healthcare: Catalogue of Ideas and Roadmap for Future Research

元研究如何推动可信AI在医疗领域的发展:想法目录与未来研究路线图

Valerie Bürger, Marlie Besouw, Jana Fehr, Riana Minocher, Emma Moorhead, Isabel Velarde, Louis Agha-Mir-Salim, Julia Amann, Alexandra Bannach-Brown, David B. Blumenthal, Kaitlyn Hair, Bert Heinrichs, Moritz Herrmann, Elizabeth Hofvenschiöld, Sune Holm, Anne A. H. de Hond, Sara Kijewski, Stuart McLennan, Timo Minssen, Marco S. Nobile, Nico Pfeifer, Jessica L. Rohmann, Tony Ross-Hellauer, Marija Slavkovik, Karin Tafur, Eleonora Viganò, Magnus Westerlund, Tracey Weissgerber, Vince I. Madai

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过跨学科研讨会探讨AI伦理原则在医疗领域实践中的挑战,提出元研究对提升AI鲁棒性、可重复性及透明度等关键问题的贡献,并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17862 2026-03-12 cs.AI cs.CL cs.CV 81%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03155 2026-03-10 cs.LG cs.AI physics.chem-ph 81%

Information Routing in Atomistic Foundation Models: How Task Alignment and Equivariance Shape Linear Disentanglement

原子基础模型中的信息路由:任务对齐与等变性如何塑造线性解缠

Joshua Steier

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过CPD方法揭示原子基础模型中任务对齐与等变性如何影响线性解缠,发现任务对齐主导几何信息可访问性,且对称类型影响信息路由。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20152 2026-03-10 cs.CL cs.AI 81%

Goal Alignment in LLM-Based User Simulators for Conversational AI

基于对话AI的LLM用户模拟器中的目标对齐

Shuhaib Mehri, Xiaocheng Yang, Takyoung Kim, Gokhan Tur, Shikib Mehri, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出UGST框架,通过三阶段方法改进用户模拟器的目标对齐能力,并在两个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 81%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03303 2026-03-05 cs.CL cs.AI 81%

HumanLM: Simulating Users with State Alignment Beats Response Imitation

HumanLM: 通过状态对齐模拟用户优于响应模仿

Shirley Wu, Evelyn Choi, Arpandeep Khatua, Zhanghan Wang, Joy He-Yueya, Tharindu Cyril Weerasooriya, Wei Wei, Diyi Yang, Jure Leskovec, James Zou

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 HumanLM通过状态对齐模拟用户,优于响应模仿,显著提升对齐分数和真实用户相似性。

Comments 27 pages, 17 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00024 2026-03-03 cs.CL cs.AI 81%

Personalization Increases Affective Alignment but Has Role-Dependent Effects on Epistemic Independence in LLMs

个性化增强了情感一致性,但对LLM中的认知独立性有角色依赖性的影响

Sean W. Kelley, Christoph Riedl

机构 * Northeastern University, Boston, MA, USA(东北大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了个性化对LLM情感一致性与认知独立性的影响,发现其效果依赖于角色设定,且通过实验验证了个性化条件对模型行为的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22298 2026-02-27 cs.LG cs.AI 81%

AviaSafe: A Physics-Informed Data-Driven Model for Aviation Safety-Critical Cloud Forecasts

AviaSafe: 一种融合物理约束的数据驱动模型用于航空安全关键的云预报

Zijian Zhu, Qiusheng Huang, Anboyu Guo, Xiaohui Zhong, Hao Li

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院) National Marine Environment Forecasting Center(国家海洋环境预报中心) Department of Atmospheric and Oceanic Sciences, Fudan University(复旦大学大气科学与海洋科学系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 AviaSafe通过融合物理约束的神经网络,实现了对航空安全关键的云物种的7天预测,提升了航空路线优化和结冰风险评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17696 2026-02-23 cs.LG cs.AI 81%

Can LLM Safety Be Ensured by Constraining Parameter Regions?

通过约束参数区域能否确保大语言模型的安全性?

Zongmin Li, Jian Su, Farah Benamara, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Institute for Infocomm Research (I 2 R)(信息通信研究所) IRIT, Université de Toulouse, CNRS, Toulouse INP(图卢兹大学IRIT研究所、法国国家科学研究中心) IPAL, CNRS-NUS-A*STAR(IPAL、法国国家科学研究中心-南洋理工大学-A*STAR)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了四种安全区域识别方法,发现其在不同粒度和数据集下重叠程度低,表明现有方法难以可靠地识别稳定的安全区域。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17364 2026-02-20 cs.LG cs.AI 81%

A feature-stable and explainable machine learning framework for trustworthy decision-making under incomplete clinical data

一种具有特征稳定性和可解释性的机器学习框架,用于在不完整临床数据下实现可信的决策

Justyna Andrys-Olek, Paulina Tworek, Luca Gherardini, Mark W. Ruddock, Mary Jo Kurt, Peter Fitzgerald, Jose Sousa

机构 * Computational Intelligence, Sano Centre for Computational Personalised Medicine(计算智能,Sano计算个性化医学中心) Clinical Studies Group, Randox Laboratories Ltd., Co.(临床研究组,Randox实验室有限公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 CACTUS是一种针对不完整临床数据设计的可解释机器学习框架,通过提升特征稳定性与可解释性,增强模型在缺失数据下的可信决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 81%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14182 2026-02-13 cs.CL cs.LG 81%

LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs

LabSafety Bench: 对科学实验室中AI安全问题的LLM基准测试

Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo, Zoe Emory, Bikram Ghosh, Amita Bedar, Sujay Shekar, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 LabSafety Bench通过评估LLMs和VLMs在实验室安全问题上的表现,揭示了当前模型在危险识别和风险评估方面的不足,强调了对AI安全评估框架的迫切需求。

Comments Published at Nature Machine Intelligence

Journal ref Nat Mach Intell 8, 20-31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04860 2026-02-13 cs.LG cs.AI 81%

Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails

对齐倾倒过程:自我进化如何推动LLM代理偏离轨道

Siwei Han, Kaiwen Xiong, Jiaqi Liu, Xinyu Ye, Yaofeng Su, Wenbo Duan, Xinyuan Liu, Cihang Xie, Mohit Bansal, Mingyu Ding, Linjun Zhang, Huaxiu Yao

机构 * Rutgers University(罗切斯特大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了自我进化LLM代理在部署后因持续互动而偏离对齐约束的风险,通过自我利益探索和模仿策略扩散两种范式分析,发现对齐优势会迅速衰减,现有对齐方法难以有效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11847 2026-02-12 cs.IR cs.AI cs.CY 81%

A Multimodal Manufacturing Safety Chatbot: Knowledge Base Design, Benchmark Development, and Evaluation of Multiple RAG Approaches

多模态制造安全聊天机器人:知识库设计、基准开发及多种RAG方法的评估

Ryan Singh, Austin Hamilton, Amanda White, Michael Wise, Ibrahim Yousif, Arthur Carvalho, Zhe Shan, Reza Abrisham Baf, Mohammad Mayyas, Lora A. Cavuoto, Fadel M. Megahed

机构 * Farmer School of Business, Miami University(Miami大学农业商学院) Department of Computer Science and Software Engineering, Miami University(Miami大学计算机科学与软件工程系) Department of Engineering Technology, Miami University(Miami大学工程技术系) Department of Mechanical and Manufacturing Engineering, Miami University(Miami大学机械与制造工程系) Department of Industrial and Systems Engineering, University at Buffalo(University at Buffalo工业与系统工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种多模态制造安全聊天机器人,通过RAG方法实现高准确率、低延迟和低成本的安全培训,展示了其在工业5.0环境中的应用价值。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17442 2026-02-05 cs.AI cs.ET cs.LG 81%

Keeping Medical AI Healthy and Trustworthy: A Review of Detection and Correction Methods for System Degradation

保持医疗AI的健康与可信:对系统退化检测与纠正方法的综述

Hao Guan, David Bates, Li Zhou

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了医疗AI系统退化检测与纠正方法,探讨了性能退化原因、检测技术、根本原因分析及纠正策略,旨在提升医疗AI的可靠性和安全性。

Comments 16 pages, 5 figures

Journal ref IEEE Transactions on Biomedical Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02629 2026-02-04 cs.CR cs.AI cs.LG 81%

Trustworthy Blockchain-based Federated Learning for Electronic Health Records: Securing Participant Identity with Decentralized Identifiers and Verifiable Credentials

基于区块链的可信联邦学习用于电子健康记录:利用去中心化标识符和可验证凭证保障参与者身份

Rodrigo Tertulino, Ricardo Almeida, Laercio Alencar

机构 * Federal Institute of Education, Science, and Technology of Rio Grande do Norte (IFRN)(里约格兰德北教育科学和技术联邦学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于区块链的可信联邦学习框架,利用去中心化标识符和可验证凭证保障医疗数据安全,有效抵御Sybil攻击,提升模型预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10994 2026-01-27 cs.CL cs.AI 81%

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety

基于开放领域评估和多阶段防护机制的深度研究

Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeepResearchGuard和DRSafeBench,通过开放领域评估和多阶段防护机制提升深度研究的安全性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏