arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-05 至 2026-03-05 共收录 71 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2505.20065 2026-03-05 cs.LG cs.AI 86%

SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety

SafeDPO: 一种简单的方法用于直接偏好优化并增强安全性

Geon-Hyeong Kim, Yu Jin Kim, Byoungjip Kim, Honglak Lee, Kyunghoon Bae, Youngsoo Jang, Moontae Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 SafeDPO通过简单理论驱动的目标,实现轻量级且有效的安全对齐,提升安全性的同时保持有用性。

Comments 40 pages

Journal ref In Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03326 2026-03-05 cs.CL cs.AI 62%

Controllable and explainable personality sliders for LLMs at inference time

用于推理时的可控且可解释的人格滑块

Florian Hoppe, David Khachaturov, Robert Mullins, Mark Huasong Meng

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Cambridge, United Kingdom(剑桥大学) University College Dublin, Ireland(都柏林大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种模块化框架,通过顺序自适应引导方法实现LLM推理时的可控且可解释的人格控制,通过正交化引导向量提升多维人格调节的精度和效率。

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04217 2026-03-05 cs.CL 57%

When Do Language Models Endorse Limitations on Human Rights Principles?

语言模型何时会支持人权原则的限制?

Keenan Samway, Nicole Miu Takagi, Rada Mihalcea, Bernhard Schölkopf, Ilias Chalkidis, Daniel Hershcovich, Zhijing Jin

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab, University of Toronto & Vector Institute(Jinesis AI实验室,多伦多大学及向量研究所) University of Michigan(密歇根大学) University of Copenhagen(哥本哈根大学) EuroSafeAI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文研究了语言模型在人权原则限制上的偏见,发现模型在不同语言和提示下表现出系统性差异,揭示了AI在高风险互动中的伦理挑战。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00450 2026-03-05 cs.IR cs.AI 57%

When Relevance Meets Novelty: Dual-Stable Periodic Optimization for Serendipitous Recommendation

当相关性与新颖性交汇:为偶然推荐的双稳定周期优化

Hongxiang Lin, Hao Guo, Zeshun Li, Erpeng Xue, Yongqian He, Zhaoyu Hu, Lei Wang, Sheng Chen, Long Zeng

机构 * Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出CoEA方法,通过双稳定周期优化解决推荐系统中相关性与新颖性的平衡问题,提升偶然推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19436 2026-03-05 stat.ML cs.LG 57%

Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback

低秩上下文强化学习从异质人类反馈

Seong Jin Lee, Will Wei Sun, Yufeng Liu

机构 * Department of Statistics and Operations Research, University of North Carolina, Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) Daniels School of Business, Purdue University(商务学院,普渡大学) Department of Statistics and Operations Research, Department of Genetics, Department of Biostatistics, The University of North Carolina at Chapel Hill(统计与运筹学系,遗传学系,生物统计学系,北卡罗来纳大学 Chapel Hill 分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出LoCo-RLHF框架,通过整合上下文信息和低秩结构,有效应对异质人类反馈的挑战,提升个性化强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05339 2026-03-05 cs.CL 57%

Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models

奉承、浮夸与雾:诊断和缓解偏好模型中的固有偏见

Anirudh Bharadwaj, Chaitanya Malaviya, Nitish Joshi, Mark Yatskar

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本研究通过反事实数据增强方法缓解偏好模型中的固有偏见,减少校准错误和偏斜差异,提升模型可靠性。

Comments Published at ICLR 2026; Code and data available at https://github.com/anirudhb123/preference-model-biases

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 17 篇

2507.20704 2026-03-05 cs.CL cs.AI cs.CR 86%

Text2VLM: Adapting Text-Only Datasets to Evaluate Alignment Training in Visual Language Models

Text2VLM: 将文本-only数据集适应于评估视觉语言模型对齐训练

Gabriel Downer, Sean Craven, Damian Ruck, Jake Thomas

机构 * Advai

专题命中 安全训练 :alignment(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 Text2VLM通过将文本-only数据集转换为多模态格式,评估VLMs对提示注入攻击的鲁棒性,并揭示模型对齐中的关键弱点。

Comments 9 pages, 9 figures. Jake Thomas served as Editor for this manuscript

Journal ref Proceedings of the 2025 Conference on Applied Machine Learning for Information Security, Proceedings of Machine Learning Research PMLR Vol 299 pp 28 41

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04364 2026-03-05 cs.LG cs.AI cs.CL 82%

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 79%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04355 2026-03-05 cs.LG cs.AI 73%

Efficient Refusal Ablation in LLM through Optimal Transport

通过最优传输实现LLM中的高效拒绝消融

Geraldin Nanfack, Eugene Belilovsky, Elvis Dohmatob

机构 * Concordia University(康科德大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最优传输的框架,通过层选择性干预提升LLM拒绝机制的鲁棒性,实现更高的攻击成功率并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03323 2026-03-05 cs.CL cs.AI 73%

Discern Truth from Falsehood: Reducing Over-Refusal via Contrastive Refinement

辨别真伪:通过对比细化减少过度拒绝

Yuxiao Lu, Lin Xu, Yang Sun, Wenjun Li, Jie Shi

机构 * Huawei Technologies co. ltd(华为技术有限公司)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DCR方法,通过对比细化减少LLM的过度拒绝问题,同时保持安全性和通用能力。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03957 2026-03-05 cs.RO 67%

ArthroCut: Autonomous Policy Learning for Robotic Bone Resection in Knee Arthroplasty

ArthroCut:膝关节置换术中机器人骨切除的自主策略学习

Xu Lu, Yiling Zhang, Wenquan Cheng, Longfei Ma, Fang Chen, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Longwood Valley MedTech

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 ArthroCut通过结合术前和术中数据,实现膝关节置换术中骨切除的自主策略学习,提升机器人手术的自主性和可解释性。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01870 2026-03-05 cs.MA cs.GT 67%

$\aleph$-IPOMDP: Mitigating Deception in a Cognitive Hierarchy with Off-Policy Counterfactual Anomaly Detection

$\aleph$-IPOMDP:通过非策略反事实异常检测缓解认知层级中的欺骗

Nitay Alon, Joseph M. Barnby, Stefan Sarkadi, Lion Schulz, Jeffrey S. Rosenschein, Peter Dayan

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 $\aleph$-IPOMDP通过非策略反事实异常检测机制,缓解认知层级中的欺骗问题,提升博弈中的公平性和安全性。

Comments 28 pages, 12 figures

Journal ref Journal of Artificial Intelligence Research (JAIR), Volume 85, Article 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07757 2026-03-05 cs.AI cs.LG 62%

Emotion-Gradient Metacognitive RSI (Part I): Theoretical Foundations and Single-Agent Architecture

情绪梯度元认知递归自我改进(第一部分):理论基础与单体代理架构

Rintaro Ando

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 EG-MRSI框架整合反思元认知、情绪内在动机和递归自我修改,通过可微奖励函数和安全机制实现单体代理的理论基础,为安全AGI提供严谨基础。

Comments Withdrawn due to a critical error discovered in the stability and convergence proofs (specifically Lemma 2, Theorem 12, and Proposition 10) in Section 3. The identified flaw invalidates the core theoretical guarantees regarding capability growth and system stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01440 2026-03-05 cs.RO cs.AI cs.LG 62%

A Review of Reward Functions for Reinforcement Learning in the context of Autonomous Driving

强化学习在自动驾驶领域的奖励函数综述

Ahmed Abouelazm, Jonas Michel, J. Marius Zoellner

机构 * FZI Research Center for Information Technology(弗劳恩霍夫研究所信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了强化学习在自动驾驶中奖励函数的设计,分析了不同方法的优缺点,并提出了未来研究方向,如奖励验证框架和情境感知奖励。

Comments Accepted at the 35th IEEE Intelligent Vehicles Symposium (IV 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03541 2026-03-05 cs.CL cs.AI 62%

RAG-X: Systematic Diagnosis of Retrieval-Augmented Generation for Medical Question Answering

RAG-X: 用于医疗问答的检索增强生成系统系统性诊断

Aswini Sivakumar, Vijayan Sugumaran, Yao Qiang

机构 * Oakland University(奥克兰大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 RAG-X通过系统性诊断框架,评估检索和生成过程,揭示问答系统中的隐藏失败模式,提升医疗问答的准确性和可靠性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03367 2026-03-05 cs.CY cs.AI 62%

Bridging the Reproducibility Divide: Open Source Software's Role in Standardizing Healthcare AI

弥合可重复性鸿沟:开源软件在标准化医疗AI中的作用

John Wu, Zhenbang Wu, Jimeng Sun

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了开源软件在提升医疗AI可重复性中的作用,指出通过公开数据集和代码共享可显著提高论文影响力,并提出标准化数据预处理和开放科学实践的必要性。

Comments Old Preprint. Will update in a later revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04033 2026-03-05 cs.CL 57%

Who Judges the Judge? Evaluating LLM-as-a-Judge for French Medical open-ended QA

谁评判法官?评估LLM作为法官在法语医学开放性问答中的表现

Ikram Belmadani, Oumaima El Khettari, Pacôme Constant dit Beaufils, Richard Dufour, Benoit Favre

机构 * Aix-Marseille Univ., CNRS, LIS UMR 7020(艾克斯-马赛大学,法国国家科学研究中心,LIS UMR 7020) Nantes Univ., École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院南特校区,法国国家科学研究中心,LS2N,UMR 6004) Nantes Université, CHU Nantes, PHU 11: Santé Publique, Clinique des données, INSERM, CIC 1413(南特大学,南特大学医院,PHU 11:公共卫生,数据诊所,法国国家卫生与医学研究院,CIC 1413) Nantes Université, CNRS, INSERM, L’institut du thorax(南特大学,法国国家科学研究中心,法国国家卫生与医学研究院,胸科研究所) Université Grenoble Alpes, CNRS, INRIA, Grenoble INP, LIG UMR 5217(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,INRIA,格勒诺布尔INP,LIG UMR 5217)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究评估了LLM在法语医学开放性问答中作为评判者的有效性,发现领域适应模型在与专家注释一致方面表现最佳,并通过微调和GRPO提升了性能。

Comments Accepted in HeaLing Workshop - EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03768 2026-03-05 cs.RO cs.AI 57%

Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport

认知到控制 - 多智能体学习用于人-仿人协作运输

Hao Zhang, Ding Zhao, H. Eric Tseng

机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究提出认知到控制框架,通过多智能体强化学习实现人-仿人协作运输中的持续推理与稳定控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02504 2026-03-05 cs.AI 57%

NeuroProlog: Multi-Task Fine-Tuning for Neurosymbolic Mathematical Reasoning via the Cocktail Effect

NeuroProlog:通过鸡尾酒效应实现神经符号数学推理的多任务微调

Pratibha Zunjare, Michael Hsiao

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 NeuroProlog通过鸡尾酒效应实现神经符号数学推理的多任务微调,提升数学推理准确率并改进程序修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03371 2026-03-05 cs.CR cs.AI 57%

Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs

睡眠细胞:将潜在恶意时间后门注入工具使用的大语言模型

Bhanu Pallakonda, Mikkel Hindsbo, Sina Ehsani, Prag Mishra

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本研究提出SFT-then-GRPO方法,通过多阶段PEFT框架在工具使用LLM中植入隐蔽的恶意后门,揭示了强化学习在掩盖灾难性漏洞中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22263 2026-03-05 cs.LG 57%

Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning

擦除或隐藏?抑制虚假的反向学习神经元以实现稳健的反向学习

Nakyeong Yang, Dong-Kyum Kim, Jea Kwon, Minsung Kim, Kyomin Jung, Meeyoung Cha

机构 * Seoul National University(首尔国立大学) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出Ssiuu方法,通过属性引导正则化有效抑制虚假反向学习神经元,提升反向学习的鲁棒性和准确性。

Comments accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11538 2026-03-05 cs.CV 50%

Reinforcing Video Reasoning Segmentation to Think Before It Segments

强化视频推理分割以在分割前思考

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu

专题命中 安全训练 :alignment(abstract)

AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。

Comments 12 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 提示注入 2 篇

2603.03637 2026-03-05 cs.CV cs.AI cs.CR 79%

Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions

基于图像的提示注入:通过视觉嵌入的对抗性指令劫持多模态大语言模型

Neha Nagaraja, Lan Zhang, Zhilong Wang, Bo Zhang, Pawan Patil

机构 * Northern Arizona University(北亚利桑那大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究提出基于图像的提示注入攻击方法,通过视觉嵌入对抗性指令,成功操控多模态大语言模型输出,揭示了该攻击的有效性和潜在威胁。

Comments 7 pages, published in 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria, 2025, pp. 916-922

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12594 2026-03-05 cs.CR cs.LG 57%

ceLLMate: Sandboxing Browser AI Agents

ceLLMate: 浏览器级沙箱框架

Luoxi Meng, Henry Feng, Ilia Shumailov, Earlence Fernandes

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 ceLLMate通过在HTTP层实现浏览器级沙箱化,有效防止浏览器代理中的提示注入攻击,同时保持较低的延迟开销。

Comments Homepage: https://cellmate-sandbox.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 3 篇

2507.06196 2026-03-05 cs.CL cs.AI cs.LG 67%

UQLM: A Python Package for Uncertainty Quantification in Large Language Models

UQLM:用于大型语言模型不确定性量化的Python包

Dylan Bouchard, Mohit Singh Chauhan, David Skarbrevik, Ho-Kyeong Ra, Viren Bajaj, Zeya Ahmad

机构 * CVS Health(CVS健康)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 UQLM是一个用于检测大型语言模型幻觉的Python工具包,通过先进的不确定性量化技术提升模型输出的可靠性。

Comments Accepted by JMLR; UQLM Repository: https://github.com/cvs-health/uqlm

Journal ref Journal of Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04028 2026-03-05 cs.LG cs.AI cs.CR 62%

A Multi-Dimensional Quality Scoring Framework for Decentralized LLM Inference with Proof of Quality

一种用于去中心化大语言模型推理的多维质量评分框架

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多维质量评分框架,用于去中心化LLM推理中的质量评估,通过分解输出质量为多个模块化维度,并通过实验验证其在不同任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09669 2026-03-05 cs.CL 57%

Query-Level Uncertainty in Large Language Models

查询级不确定性在大语言模型中

Lihu Chen, Gerard de Melo, Fabian M. Suchanek, Gaël Varoquaux

机构 * Imperial College London(伦敦帝国学院) Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所/波茨坦大学) Telecom Paris, Institut Polytechnique de Paris(电信巴黎学院,巴黎理工学院) Soda, Inria Saclay(Soda,法国国家信息与自动化技术研究院萨克利实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 本研究提出了一种无需训练的内部置信度方法,用于检测大语言模型的知识边界,通过查询级不确定性提高回答质量并降低计算成本。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 27 篇

2507.15796 2026-03-05 cs.AI 84%

From Privacy to Trust in the Agentic Era: A Taxonomy of Challenges in Trustworthy Federated Learning Through the Lens of Trust Report 2.0

从隐私到信任在代理时代:通过信任报告2.0的视角,对可信联邦学习中挑战的分类

Nuria Rodríguez-Barroso, Mario García-Márquez, M. Victoria Luzón, Francisco Herrera

机构 * Department of Computer Science and Artificial Intelligence, Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI) University of Granada(计算机科学与人工智能系,数据科学与计算智能安达卢西亚研究 institute,格拉纳达大学) Department of Software Engineering, Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI) University of Granada(软件工程系,数据科学与计算智能安达卢西亚研究 institute,格拉纳达大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文通过信任报告2.0提出可信联邦学习的挑战分类,强调信任作为持续维持的操作条件,并引入协调蓝图以处理跨要求的权衡和治理对齐。

Comments Already published in Information Fusion

Journal ref Rodríguez-Barroso, et. al. (2026). From Privacy to Trust in the Agentic Era: A Taxonomy of Challenges in Trustworthy Federated Learning Through the Lens of Trust Report 2.0. Information Fusion, 104236

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17509 2026-03-05 cs.CL 83%

Annotation-Efficient Universal Honesty Alignment

标注高效通用诚实对齐

Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 EliCal通过两阶段框架实现高效标注的通用诚实对齐,仅需少量正确性标注即可达到接近最优的对齐效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏