TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models
TaylorPODA:一种基于泰勒展开的方法,用于改进不透明模型的事后归因
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 研究针对不透明模型事后归因方法缺乏普遍标准的问题,提出基于泰勒展开框架的TaylorPODA方法,通过引入假设、分析矛盾、设计可控分配机制等,使其既满足假设又适应下游目标,提升了归因与用户定义效用的对齐及解释的可交流性。
Comments 21 pages, 4 figures. Submitted to TMLR. Re-upload with amended manuscript