Creative Quality Alignment: Expert Tacit Knowledge Transfer via Chain-of-Thought Fine-Tuning
创意质量对齐:通过思维链微调实现专家隐性知识迁移
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过低数据成本和小基模型的严格工程条件,实证验证了校准惊喜中的创意质量度量,并发现数据偏差,提出创意质量对齐方法及理论解释。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
创意质量对齐:通过思维链微调实现专家隐性知识迁移
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过低数据成本和小基模型的严格工程条件,实证验证了校准惊喜中的创意质量度量,并发现数据偏差,提出创意质量对齐方法及理论解释。
LVLMs中的语言偏差:从深入分析到简单有效的缓解方法
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))
专题命中 AI治理与伦理 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文系统研究了大视觉语言模型中的语言偏差问题,发现其根源在于训练中的模态未对齐,并提出了两种简单有效的缓解方法:语言偏差正则化(LBR)和语言偏差惩罚(LBP)。
Comments Accepted by ICML 2026
元认知应成为生成式AI中有限且有效自我治理的科学框架
机构 * University of Waterloo(滑铁卢大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出元认知作为生成式AI自我治理的科学框架,通过计算、算法和生态三个层面的元认知对齐实现有限且有效的自我治理。
Comments 16 pages, 1 figure, 1 table
操作化重构权威:自主智能体系统中的运行时构建、依赖解析与执行门控
机构 * TraslaIA
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出一种运行时执行模型,通过动态依赖解析和恢复循环,确保动作仅在当前状态可构建权威时执行,从而保证安全性和条件活性。
Comments Agent Governance Series, Paper P6. Companion papers on arXiv: P0 (2604.17511), P1 (2603.18829), P2 (2604.17517). P3/4 and P5 submitted concurrently (pending arXiv IDs). Zenodo: 10.5281/zenodo.19699460
结构抽象作为非平稳语言模型训练的归纳偏置
机构 * University of Southern California(南加州大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出抽象增强训练(AAT)方法,通过联合优化具体实例及其结构抽象,减少灾难性干扰并提升关系泛化能力,在非平稳语言模型训练中验证了结构抽象作为稳定学习信号的有效性。
从替代到编排:企业研发中代理型人工智能的社会技术架构
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 针对企业研发中的生产力悖论(如Eroom定律),提出HARMONY社会技术架构,通过认知负荷再分配和有界自主性设计,引入科学企业家角色和编排杠杆指标,以提升人类-代理混合系统的研发产出。
宗教表征中的省略偏见:评估LLM在日常伦理决策中的回答
机构 * Brigham Young University ; Baylor University ; University of Notre Dame ; Yeshiva University
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 通过构建AllFaith宗教表征基准,评估LLM在回答日常伦理问题时是否提及宗教,发现模型普遍存在省略宗教框架的偏见,尤其在个人实际情境中更为明显。
减少偏差与方差:用于图像聚类的生成语义引导与双层集成
机构 * Institute of Big Data Science and Industry(大数据科学与产业研究院) ; Key Laboratory of Evolutionary Science Intelligence of Shanxi Province(山西省进化智能科学重点实验室) ; School of Artificial Intelligence, Shanxi University(山西大学人工智能学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 提出GSEC框架,通过生成语义引导减少偏差、双层集成学习降低方差,在六个基准数据集上超越18种最新方法。
"感觉有点诡异":与人工智能体协作写作中类人交互的探索
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 通过构建三种不同类人程度的AI辅助编辑器并开展用户研究,探讨协作的时间与视觉维度如何影响写作体验及人机社会连接。
Comments 29 pages, 3 figures