A Technical Policy Blueprint for Trustworthy Decentralized AI
可信去中心化人工智能的技术政策蓝图
专题命中 AI治理与伦理 :trustworthy(title);分类 cs.CY
AI总结 提出一种技术政策蓝图,通过将治理需求编码为策略即代码对象,并解耦策略验证与执行,实现去中心化AI系统的透明、可扩展和可验证治理。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可信去中心化人工智能的技术政策蓝图
专题命中 AI治理与伦理 :trustworthy(title);分类 cs.CY
AI总结 提出一种技术政策蓝图,通过将治理需求编码为策略即代码对象,并解耦策略验证与执行,实现去中心化AI系统的透明、可扩展和可验证治理。
通过模仿模型权重评估样本效用以实现高效数据选择
机构 * Apple(苹果公司)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出基于梯度和几何的Mimic Score指标,通过Grad-Mimic框架在线重加权样本加速训练、离线构建数据过滤器,在六个图像数据集上提升数据效率和CLIP模型性能。
Comments This work appears in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026) and was selected as an Oral paper at the ICML 2025 DataWorld Workshop
UCPO:不确定性感知策略优化
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 针对现有强化学习范式在不确定性奖励下存在的优势偏差和过度自信问题,提出三元优势解耦和动态不确定性奖励调整机制,显著提升模型在知识边界外的可靠性。
Comments Accepted by ICML 2026
学术研究中的持久性AI智能体:单研究者实施案例研究
机构 * Department of Preventive Medicine and Public Health, Faculty of Medicine, King Abdulaziz University(预防医学与公共卫生系,医学院,国王阿卜杜勒阿齐兹大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 通过单研究者案例研究,分析了持久性AI智能体在真实学术环境中的架构、使用、产出和治理,发现缓存主导的工作流可能将经济单位从每token成本转向每完成工件成本。
Comments 19 pages, 2 figures, 3 main tables; supplementary appendix with 6 tables, 2 figures, and a reproducibility methods section. Describes 17 configured agents in a persistent research environment and introduces the PARE-M (Persistent Agentic Research Environment Measurement) framework