arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 116 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2512.23743 2026-03-24 cs.SE cs.AI 70%

Hybrid-Code v2: Zero-Hallucination Clinical ICD-10 Coding via Neuro-Symbolic Verification and Automated Knowledge Base Expansion

Hybrid-Code v2:通过神经符号验证和自动知识库扩展实现零幻觉的临床ICD-10编码

Yunguo Yu

机构 * AI Innovation & Prototyping, Zyter(人工智能创新与原型开发,Zyter)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 Hybrid-Code v2结合神经网络与符号验证,实现零类型I幻觉,同时保持高覆盖率和精度,通过自动知识库扩展解决规则系统扩展性问题。

Comments Version 2: Substantially extended version with (1) multi-layer verification framework (format, evidence, negation, temporal, exclusion), (2) automated knowledge base expansion from unlabeled clinical text, (3) formal zero Type-I hallucination guarantees, and (4) expanded experimental evaluation on 5,000 cases with detailed error analysis. 28 pages, 3 figure, original research paper;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20246 2026-03-24 cs.CL cs.AI cs.NE q-bio.NC 62%

Decoding the decoder: Contextual sequence-to-sequence modeling for intracortical speech decoding

解码解码器:用于皮层语音解码的上下文序列到序列建模

Michal Olak, Tommaso Boccato, Matteo Ferrante

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于Transformer的多任务序列到序列模型,用于从皮层记录中解码语音,通过引入Neural Hammer Scalpel模块提升鲁棒性和可解释性,实验显示其在语音解码任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20921 2026-03-24 cs.LG 57%

Discriminative Representation Learning for Clinical Prediction

判别表示学习用于临床预测

Yang Zhang, Li Fan, Samuel Lawrence, Shi Li

机构 * The University of Hong Kong (HKU)(香港大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种监督深度学习框架,通过最大化类间分离与类内方差比,提升临床预测性能,优于其他预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20505 2026-03-24 cs.AI 57%

Efficient Counterfactual Reasoning in ProbLog via Single World Intervention Programs

通过单世界干预程序在ProbLog中实现高效的反事实推理

Saimun Habib, Vaishak Belle, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) The MITRE Corporation(MITRE公司)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出单世界干预程序(SWIPs)用于ProbLog中的反事实推理,通过将ProbLog子句分为观测和固定部分,减少计算复杂度并提升推理可靠性,实验表明在大规模数据上推理时间减少35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22170 2026-03-24 cs.MA 50%

Human-Inspired Pavlovian and Instrumental Learning for Autonomous Agent Navigation

受人类启发的经典条件反射与工具性学习用于自主体导航

Jingfeng Shan, Francesco Guidi, Mehrdad Saeidi, Enrico Testi, Elia Favarelli, Andrea Giorgetti, Davide Dardari, Alberto Zanella, Giorgio Li Pira, Francesca Starita, Anna Guerra

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出一种融合经典条件反射、工具性MF和工具性MB组件的混合强化学习架构,通过地理参考环境特征塑造内在价值信号,提升自主体在不确定环境中的导航安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20668 2026-03-24 cs.RO 50%

ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems

以目标区域驱动的视网膜注视用于视觉-语言-动作系统中的统一自体表示

Xinhai Sun, Xiang Shi, Menglin Zou, Wenlong Huang

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出了一种以目标区域驱动的数据表示方法,通过单个外部相机投影末端执行器姿态,实现手眼协调的区域划分,提升跨机器人系统的数据重用性和跨体征对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 隐私与版权 3 篇

2603.21656 2026-03-24 cs.LG cs.CY 76%

TrustFed: Enabling Trustworthy Medical AI under Data Privacy Constraints

TrustFed: 在数据隐私约束下实现可信的医疗AI

Vagish Kumar, Syed Bahauddin Alam, Souvik Chakraborty

机构 * Department of Applied Mechanics(应用力学系) Indian Institute of Technology Delhi(印度理工学院德里) Grainger College of Engineering(工程学院) Nuclear, Plasma & Radiological Engineering Department(核物理与辐射工程系) National Center for Supercomputing Applications(国家超级计算应用中心) Yardi School of Artificial Intelligence (ScAI)(Yardi人工智能学院(ScAI)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 隐私与版权 :trustworthy(title);分类 cs.CY、cs.LG

AI总结 TrustFed通过联邦不确定性量化框架,在异构和不平衡医疗数据上提供分布无关的有限样本覆盖保证,无需集中访问,提升预测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05027 2026-03-24 cs.AI 57%

S5-SHB Agent: Society 5.0 enabled Multi-model Agentic Blockchain Framework for Smart Home

S5-SHB代理:面向社会5.0的多模型代理区块链框架用于智能家居

Janani Rangila, Akila Siriweera, Incheon Paik, Keitaro Naruse, Isuru Jayanada, Vishmika Devindi

机构 * KD University(KD大学) University of Aizu(东亚大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文提出S5-SHB代理框架,通过多代理协调和居民控制治理,解决智能家居中适应性共识、智能多代理协调和居民可控治理的问题。

Comments 15 pages, 15 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18415 2026-03-24 cs.HC 50%

AI-Wrapped: Participatory, Privacy-Preserving Measurement of Longitudinal LLM Use In-the-Wild

AI-Wrapped:参与式、隐私保护的长期LLM使用情况实地测量

Cathy Mengying Fang, Sheer Karny, Chayapatr Archiwaranguprok, Yasith Samaradivakara, Pat Pataranutaporn, Pattie Maes

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出AI-Wrapped系统,通过隐私保护的方式收集真实LLM聊天使用数据,并分析用户使用模式及主题,揭示用户在日常场景中对LLM的使用特点及潜在问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 安全评测 43 篇

2603.06264 2026-03-24 cs.CL cs.CY 81%

Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion

注意鸿沟:LLM对齐与亚洲公众意见的陷阱

Hari Shankar, Vedanta S P, Sriharini Margapuri, Debjani Mazumder, Ponnurangam Kumaraguru, Abhijnan Chakraborty

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 本文研究了LLM在多语言多文化环境中的对齐问题,发现其在宗教观点尤其是少数群体方面存在偏差,提出轻量干预无法消除文化鸿沟,强调需系统性地区审计确保公平部署。

Comments 13 pages, including AAAI Paper Checklist. Accepted in Proceedings of the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21145 2026-03-24 cs.DC cs.AI cs.LG cs.SC 81%

NeSy-Edge: Neuro-Symbolic Trustworthy Self-Healing in the Computing Continuum

NeSy-Edge:神经符号可信自愈在计算连续体中的应用

Peihan Ye, Alfreds Lapkovskis, Alaa Saleh, Qiyang Zhang, Praveen Kumar Donta

机构 * Department of Computer Systems and Sciences(计算机系统与科学系) University of Oulu(奥卢大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NeSy-Edge框架,通过边缘优先设计,在资源受限的边缘节点进行本地感知与推理,结合云模型进行最终诊断,实现计算连续体中的可信自愈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20595 2026-03-24 cs.AI cs.MA 79%

Position: Multi-Agent Algorithmic Care Systems Demand Contestability for Trustworthy AI

位置:多智能体算法护理系统需具备可挑战性以实现可信AI

Truong Thanh Hung Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick, Canada(安利克斯 everywhere 实验室,新不伦瑞克大学,加拿大) National Research Council Canada, Canada(加拿大国家研究委员会,加拿大) Thompson Rivers University, Canada(汤普森河大学,加拿大) ISB Corporation, Japan(ISB公司,日本) University of Northern British Columbia, Canada(北北加拿大大学,加拿大)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文探讨了多智能体算法护理系统中可挑战性设计的必要性,提出通过透明性、干预机会和审查机制来增强人机协作的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23814 2026-03-24 cs.CR 78%

Beyond the TESSERACT:Trustworthy Dataset Curation for Sound Evaluations of Android Malware Classifiers

超越TESSERACT:为Android恶意软件分类器提供可信的数据集编纂

Theo Chow, Mario D'Onghia, Lorenz Linhardt, Zeliang Kan, Daniel Arp, Lorenzo Cavallaro, Fabio Pierazzi

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文探讨了Android恶意软件分类器评估中数据集编纂的重要性,识别了五个影响性能差异的新因素,提出了可信数据集编纂的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV 78%

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV 78%

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22097 2026-03-24 cs.AI cs.LG 76%

SpecTM: Spectral Targeted Masking for Trustworthy Foundation Models

SpecTM:用于可信基础模型的频谱定向遮蔽

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 本文提出SpecTM,一种结合物理约束的遮蔽设计,通过预训练时利用交叉频谱上下文重建目标波段,提升EO领域基础模型的可信度和可解释性。

Comments Accepted to IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20953 2026-03-24 cs.CR cs.AI 70%

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

在工具调用之前:自主AI代理的确定性预行动授权

Uchi Uchibeke

机构 * APort Technologies Inc.(APort技术公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Open Agent Passport,通过同步拦截工具调用、评估声明性策略并生成加密审计记录,实现自主AI代理的确定性预授权,提升安全性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20697 2026-03-24 cs.CV cs.AI 70%

Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models

卫星到街道:通过生成视觉模型从卫星图像合成灾害后视角

Yifan Yang, Lei Zou, Wendy Jepson

机构 * Department of Geography Texas A\&M University(地理系德克萨斯农工大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过生成视觉模型从卫星图像合成灾害后街道视角的方法,对比了基于VLM和MoE的生成策略,揭示了高现实感生成与结构信息保留之间的平衡问题。

Comments Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12920 2026-03-24 cs.CL cs.AI cs.CY cs.HC cs.IR 67%

Auditing Google's AI Overviews and Featured Snippets: A Case Study on Baby Care and Pregnancy

对谷歌AI概述和特色摘要的审计:关于婴儿护理和怀孕的案例研究

Desheng Hu, Joachim Baumann, Aleksandra Urman, Elsa Lichtenegger, Robin Forsberg, Aniko Hannak, Christo Wilson

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过系统算法审计1508个真实婴儿护理和怀孕相关查询,评估AI概述和特色摘要的信息质量和一致性,发现33%的案例信息不一致,且医疗保障缺失严重。

Comments 18 pages, 10 figures; to appear in AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21019 2026-03-24 cs.CR cs.SE 67%

SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration

SkillProbe:通过多智能体协作实现新兴智能体技能市场places的安全审计

Zihan Guo, Zhiyu Chen, Xiaohang Nie, Jianghao Lin, Yuanjian Zhou, Weinan Zhang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 针对LLM智能体生态系统中技能市场面临的安全挑战,提出SkillProbe框架,通过多智能体协作实现技能审计,揭示高流行技能的安全性不足及系统性风险。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21010 2026-03-24 cs.CV 67%

SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis

SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架

Zhixiang Lu, Shijie Xu, Kaicheng Yan, Xuyue Cai, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00004 2026-03-24 cs.IR cs.CL cs.DL cs.LG 62%

C$^2$-Cite: Contextual-Aware Citation Generation for Attributed Large Language Models

C$^2$-Cite: 基于上下文感知的引用生成方法用于带属性的大语言模型

Yue Yu, Ting Bai, HengZhi Lan, Li Qian, Li Peng, Jie Wu, Wei Liu, Jian Luan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出C$^2$-Cite框架,通过整合引用标记与参考内容的语义关系,提升引用生成质量与响应正确性。

Comments WSDM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08713 2026-03-24 cs.CL cs.AI 62%

Automatic Essay Scoring and Feedback Generation in Basque Language Learning

巴斯克语言学习中的自动作文评分与反馈生成

Ekhi Azurmendi, Xabier Arregi, Oier Lopez de Lacalle

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文首次公开了针对巴斯克语C1水平的自动作文评分与反馈生成数据集,通过微调开源模型提升评分与反馈质量,验证了编码器模型的可靠性及监督微调对性能的提升。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19299 2026-03-24 cs.LG cs.AI 62%

Open-weight genome language model safeguards: Assessing robustness via adversarial fine-tuning

开放权重基因组语言模型的安全保障:通过对抗性微调评估鲁棒性

James R. M. Black, Moritz S. Hanke, Aaron Maiwald, Tina Hernandez-Boussard, Oliver M. Crook, Jaspreet Pannu

机构 * Center for Health Security(健康安全中心) Johns Hopkins Bloomberg School of Public Health(约翰霍普金斯大学布隆伯格公共卫生学院) Department of Chemistry(化学系) University of Oxford(牛津大学) Stanford University School of Medicine(斯坦福大学医学院) Department of Chemistry & Kavli Institute for Nanoscience Discovery(化学系及卡弗里纳米科学发现研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了开放权重基因组语言模型在对抗性微调下的鲁棒性,发现通过微调有害病毒序列可恢复模型的滥用相关能力,强调了需要安全框架以确保模型安全部署。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Biosecurity Safeguards for Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14783 2026-03-24 cs.CL cs.CY 62%

Human or LLM as Standardized Patients? A Comparative Study for Medical Education

人类或大语言模型作为标准化患者?医学教育中的比较研究

Bingquan Zhang, Xiaoxiao Liu, Yuchi Wang, Lei Zhou, Qianqian Xie, Benyou Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Freedom AI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出EasyMED框架和SPBench基准,通过对比实验显示其在医学教育中更接近人类标准化患者行为,尤其在案例一致性与可控披露方面表现更优,且在学习效果和成本效率上具有优势。

Comments 24 pages, 13 figures, 10 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21280 2026-03-24 cs.CY cs.AI 62%

WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making

WARBENCH:评估大语言模型在军事决策中的综合基准

Zongjie Li, Chaozheng Wang, Yuchong Xie, Pingchuan Ma, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) Zhejiang University of Technology(浙江工业大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出WARBENCH基准,揭示现有大语言模型在军事决策中存在结构性缺陷,包括战术推理崩溃、法律违规率高、量化降维导致性能下降等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 57%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21698 2026-03-24 cs.AI 57%

A Blueprint for Self-Evolving Coding Agents in Vehicle Aerodynamic Drag Prediction

车辆气动阻力预测中自演化编码代理的蓝图

Jinhui Ren, Huaiming Li, Yabin Liu, Tao Li, Zhaokun Liu, Yujia Liang, Zengle Ge, Chufan Wu, Xiaomin Yuan, Danyu Liu, Annan Li, Jianmin Wu

机构 * Famou Agent Team(Famou 代理团队) Baidu AI Cloud(百度AI云) IAT AI Team(IAT人工智能团队)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于合同的自演化编码代理框架,通过约束优化发现可执行的代理管道,提升车辆阻力系数预测的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21654 2026-03-24 cs.CR cs.AI 57%

Towards Secure Retrieval-Augmented Generation: A Comprehensive Review of Threats, Defenses and Benchmarks

迈向安全的检索增强生成:对威胁、防御和基准的全面综述

Yanming Mu, Hao Hu, Feiyang Li, Qiao Yuan, Jiang Wu, Zichuan Liu, Pengcheng Liu, Mei Wang, Hongwei Zhou, Yuling Liu

机构 * State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Information Engineering University(信息工程大学) Henan Key Laboratory of Information Security(河南省信息安全重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了检索增强生成系统中的安全威胁、防御方法及评估基准,系统分析了数据污染、对抗攻击等核心威胁,并提出双视角的防御技术分类,为未来研究提供统一基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02960 2026-03-24 cs.AI 57%

Architecting Trust in Artificial Epistemic Agents

在人工智能认知代理中构建信任

Nahema Marchal, Stephanie Chan, Matija Franklin, Manon Revel, Geoff Keeling, Roberta Fischli, Bilva Chandra, Iason Gabriel

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文探讨了大规模语言模型作为认知代理的影响,提出通过构建信任、对齐人类认知目标和加强社会认知基础设施,确保AI系统的可靠性与包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏