arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1832 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1832 篇

2604.24686 2026-04-28 cs.AI 57%

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

治理你无法观察的事物:面向自主AI代理的自适应运行时治理

German Marin, Jatin Chaudhary

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出信息有效性原理,通过估计未观察风险上界并设定安全余量,实现自主AI代理的自适应运行时治理,结合Aubin viability理论构建Agent有效性框架,引入风险门机制实现预测性治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23949 2026-04-28 cs.AI 57%

Context-Aware Hospitalization Forecasting Evaluations for Decision Support using LLMs

基于上下文的医院化疗预测评估:利用LLMs进行决策支持

Rhea Makkuni, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文评估了利用LLMs进行医院化疗预测的方法,通过三种方法在60个县的数据上验证了上下文增强的混合模型在非平稳医疗资源预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21549 2026-04-24 cs.AI stat.ME 57%

Unbiased Prevalence Estimation with Multicalibrated LLMs

基于多校准LLM的无偏流行率估计

Fridolin Linder, Thomas Leeper, Daniel Haimovich, Niek Tax, Lorenzo Perini, Milan Vojnovic

机构 * Meta Platforms Inc.(Meta公司) The London School of Economics and Political Science(伦敦政治经济学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出多校准方法以解决分类模型在存在协变量偏移时的流行率估计偏差问题,通过理论分析和实证应用展示其在LLM中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21036 2026-04-24 cs.AI 57%

Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models

谁定义了公平性?面向生成模型的基于目标的提示方法用于人口特征表示

Marzia Binta Nizam, James Davis

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种轻量级框架,在推理阶段通过提示级干预减轻生成模型中的代表性偏见,允许用户选择多种公平性定义,通过审计目标符合度和肤色分布来评估公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20677 2026-04-24 cs.CL 57%

Intersectional Fairness in Large Language Models

大语言模型中的交叉公平性

Chaima Boufaied, Ronnie De Souza Santos, Ann Barcomb

机构 * University of Calgary(卡尔加里大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文评估了六个大语言模型在交叉人口属性上的公平性,发现模型在模糊情境中表现良好,但在解歧情境中受刻板印象影响,且跨群体结果分布不均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20300 2026-04-24 cs.AI 57%

FSFM: A Biologically-Inspired Framework for Selective Forgetting of Agent Memory

FSFM:一种生物启发的智能体记忆选择性遗忘框架

Yingjie Gu, Wenjian Xiong, Liqiang Wang, Pengcheng Ren, Chao Li, Xiaojing Zhang, Yijuan Guo, Qi Sun, Jingyao Ma, Shidang Shi

机构 * China Mobile Digital Intelligence Business Unit(中国移动数字智能业务部) China Mobile Jiutian Company(中国移动蓟田公司) China Mobile Jiutian Research Institute(中国移动蓟田研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出FSFM框架,通过生物启发机制实现智能体记忆的选择性遗忘,提升效率、质量和安全性,经实验验证在访问效率、内容质量和安全性能上均有显著提升。

Comments 28 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20199 2026-04-23 cs.CL 57%

All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG

所有语言都重要:理解并缓解多语言RAG中的语言偏差

Dan Wang, Guozhao Mo, Yafei Shi, Cheng Zhang, Bo Zheng, Boxi Cao, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) MYbank, AntGroup(蚂蚁集团MYbank)

专题命中 AI治理与伦理 :alignment(abstract_cn);分类 cs.CL

AI总结 本文研究多语言RAG中的语言偏差问题,提出LAURA方法,通过多语言证据排名与生成效用对齐,有效缓解语言偏差并提升性能。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21293 2026-04-23 cs.AI cs.HC 57%

Understanding AI Trustworthiness: A Scoping Review of AIES & FAccT Articles

理解人工智能可信性:AIES与FAccT文章的综述

Siddharth Mehrotra, Jin Huang, Xuelong Fu, Roel Dobbe, Clara I. Sánchez, Maarten de Rijke

机构 * University of Amsterdam \& Delft University of Technology The Netherlands University of Cambridge United Kingdom University of Amsterdam The Netherlands Delft University of Technology The Netherlands University of Amsterdam \& Delft University of Technology University of Cambridge University of Amsterdam Delft University of Technology

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过综述AIES和FAccT会议论文,探讨人工智能可信性的概念、测量与验证方法,揭示技术与社会维度的不足,提出跨学科研究的重要性。

Comments Submitted to Journal of Artificial Intelligence Research (JAIR)

Journal ref Journal of Artificial Intelligence Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03396 2026-04-23 cs.CL 57%

Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation

打破助手模式:在基于大语言模型的程序化角色生成中建模行为变异

Maan Qraitem, Kate Saenko, Bryan A. Plummer

机构 * Boston University(波士顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出PersonaWeaver框架,通过解耦世界观构建与行为构建,生成更具多样性和戏剧张力的角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18729 2026-04-22 cs.CL 57%

Investigating Counterfactual Unfairness in LLMs towards Identities through Humor

通过幽默探讨语言模型中身份相关的反事实不公平性

Shubin Kim, Yejin Son, Junyeong Park, Keummin Ka, Seungbeen Lee, Jaeyoung Lee, Hyeju Jang, Alice Oh, Youngjae Yu

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文通过观察在保持其他因素不变的情况下交换说话者和被指对象,研究语言模型在幽默生成拒绝、说话者意图推断及社会影响预测中的反事实不公平性,揭示身份相关的偏见模式。

Comments Accepted to ACL 2026 Main Conference. The first two authors contributed equally. The last three authors are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24827 2026-04-21 cs.LG 57%

Inter-Agent Relative Representations for Multi-Agent Option Discovery

多智能体选项发现的智能体相对表示

Raul D. Steleac, Mohan Sridharan, David Abel

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种多智能体选项发现方法,通过压缩状态空间并保留协调信息,提升多智能体协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06700 2026-04-21 cs.CL 57%

How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects

语言模型如何将逻辑有效性与合理性混淆:内容效应的表征分析

Leonardo Bertolazzi, Sandro Pezzelle, Raffaella Bernardi

机构 * University of Trento(特伦托大学) University of Amsterdam(阿姆斯特丹大学) Free University of Bozen-Bolzano(博赞-博洛尼亚自由大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究揭示语言模型中逻辑有效性与合理性概念的表征关联,通过构建去偏向量减少内容效应,提升推理准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 57%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01486 2026-04-21 cs.CL 57%

Human-Centered Supervision for Sentiment Analysis in Telugu: A Systematic Inquiry Beyond Accuracy

面向泰卢格语情感分析的人本监督:超越准确性的系统探究

Vallabhaneni Raj Kumar, Ashwin S, Supriya Manna, Niladri Sett, Cheedella V S N M S Hema Harshitha, Kurakula Harshitha, Anand Kumar Sharma, Basina Deepakraj, Tanuj Sarkar, Bondada Navaneeth Krishna, Samanthapudi Shakeer

机构 * SRM University AP, India(印度AP SRM大学) University of Maryland, College Park, USA(美国马里兰大学 College Park分校) GITAM University, Bangalore, India(印度班加罗尔GITAM大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出TeSent数据集,通过人类选择的解释进行模型对齐,探讨在低资源语言中监督学习对预测性能和公平性的影响。

Comments Camera-ready version; ACL Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 57%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14922 2026-04-21 cs.CL 57%

Synthia: Scalable Grounded Persona Generation from Social Media Data

Synthia:从社交媒体数据中可扩展的 grounded 人格生成

Vahid Rahimzadeh, Erfan Moosavi Monazzah, Mohammad Taher Pilehvar, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies(德黑兰高级研究 institute) University of Tehran(德黑兰大学) Cardiff University(卡迪夫大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 Synthia通过结合真实社交媒体数据与语言模型,生成更贴近现实的人格,提升与人类意见分布的一致性,同时在公平性和偏见分析中表现更优,保留交互图结构以支持网络感知分析。

Comments Accepted at ACL 2026 Main Conference, the dataset is available on HuggingFace (see https://huggingface.co/datasets/teias-ai/synthia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17730 2026-04-21 cs.CY 57%

Gender Bias in Perception of Human Managers Extends to AI Managers

人工智能管理者的人格偏见延伸至人类管理者

Hao Cui, Taha Yasseri

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 研究探讨了AI管理者与人类管理者在感知上的差异,发现性别对管理者的评价有显著影响,尤其是女性AI管理者在未获奖时面临更多负面评价。

Comments 40 pages, 26 figures, 8 tables

Journal ref Computers in Human Behavior Reports, 21 (2026), 100984

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15675 2026-04-20 cs.CL 57%

C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment

C-Mining:通过几何偏移无监督发现文化数据合成的种子

Pufan Zeng, Yilun Liu, Mingchen Dai, Mengyao Piao, Chunguang Zhao, Lingqi Miao, Shimin Tao, Weibin Meng, Minggui He, Chenxin Liu, Zhenzhen Qin, Li Zhang, Hongxia Ma, Boxing Chen, Daimeng Wei

机构 * Huawei China(华为中国) Huawei Canada(华为加拿大) University of Science and Technology of China(中国科学技术大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出C-Mining框架,通过几何偏移发现文化种子,提升文化理解与推理能力,实验显示在CulturalBench-Hard上提升6.03分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01956 2026-04-17 cs.CR cs.AI 57%

Towards Adaptive, Learning-Based Security in Decentralized Applications

迈向去中心化应用中的自适应、基于学习的安全性

Stefan Kambiz Behfar, Jon Crowcroft

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文探讨了Web3系统中传统安全机制的局限性,提出基于学习的安全原语,通过AI驱动的智能证书实现持续推理与适应,以应对动态演变的攻击策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05972 2026-04-15 cs.CY 57%

THETA: A Textual Hybrid Embedding-based Topic Analysis Framework and AI Scientist Agent for Scalable Computational Social Science

THETA: 一种基于文本混合嵌入的主题分析框架和AI科学家代理用于可扩展的计算社会科学

Zhenke Duan, Xin Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 THETA通过Domain-Adaptive Fine-tuning优化语义向量结构,结合AI Scientist Agent框架实现主题分析的理论深度与数据规模的平衡,实验显示其在捕捉领域特定解释性构念方面优于传统模型。

Comments we should change the authors and some results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12133 2026-04-15 cs.AI 57%

Towards Platonic Representation for Table Reasoning: A Foundation for Permutation-Invariant Retrieval

迈向表格推理的柏拉图表示:一种排列不变检索的基础

Willy Carlos Tchuitcheu, Tan Lu, Ann Dooms

机构 * Department of Mathematics and Data Science, Vrije Universiteit Brussel (VUB)(瓦隆公国布鲁塞尔自由大学数学与数据科学系) Data Science Lab, Royal Library of Belgium (KBR)(比利时皇家图书馆数据科学实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出柏拉图表示假设,主张表格推理需要内在排列不变的潜在空间,通过分析和实验揭示了现有模型在布局变化下的脆弱性,并提出结构感知的表格推理编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 57%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11974 2026-04-14 cs.AI 57%

Normative Common Ground Replication (NormCoRe): Replication-by-Translation for Studying Norms in Multi-Agent AI

规范共同基础复制(NormCoRe):通过翻译研究多智能体AI中的规范

Luca Deck, Simeon Allmendinger, Lucas Müller, Niklas Kühl

机构 * University of Bayreuth(拜罗伊特大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出NormCoRe框架,通过将人类实验设计翻译到多智能体AI环境,系统研究规范形成机制,展示在分配正义实验中AI代理的规范判断与人类基线的差异。

Comments ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10367 2026-04-14 cs.AI cs.SD 57%

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成

Yuzhe Weng, Haotian Wang, Xinyi Yu, Xiaoyan Wu, Haoran Xu, Shan He, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23045 2026-04-13 cs.AI 57%

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

AI的混乱:模型智能与任务复杂性如何影响对齐问题

Alexander Hägele, Aryo Pradipta Gema, Henry Sleight, Ethan Perez, Jascha Sohl-Dickstein

机构 * Anthropic Fellows Program(Anthropic 研究员计划) EPFL(瑞士联邦理工学院洛桑) University of Edinburgh(爱丁堡大学) Constellation Anthropic

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了高智能AI模型在复杂任务中失败的机制,发现模型规模越大,失败行为越不一致,强调对齐研究在防止奖励黑客和目标误指定中的重要性。

Comments ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08691 2026-04-13 cs.SI cs.AI 57%

AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society

AgentSociety: 基于大语言模型的生成代理大规模模拟推动对人类行为与社会的理解

Jinghua Piao, Yuwei Yan, Jun Zhang, Nian Li, Junbo Yan, Xiaochong Lan, Zhihong Lu, Zhiheng Zheng, Jing Yi Wang, Di Zhou, Chen Gao, Fengli Xu, Fang Zhang, Ke Rong, Jun Su, Yong Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出AgentSociety平台,通过大规模模拟人类行为和社会动态,探索社会问题如极化、虚假信息传播等,验证其在社会科学研究中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG 57%

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-04-13 cs.LG q-bio.GN 57%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06148 2026-04-08 cs.CR cs.AI cs.MA 57%

Who Governs the Machine? A Machine Identity Governance Taxonomy (MIGT) for AI Systems Operating Across Enterprise and Geopolitical Boundaries

谁掌控机器?面向跨企业与地缘政治边界的AI系统机器身份治理分类(MIGT)

Andrew Kurtz, Klaudia Krawiecka

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出AI身份风险分类(AIRT)和机器身份治理分类(MIGT),解决AI系统中机器身份治理的空白,涵盖37个风险子类,同时应对技术、合规和跨司法管辖区协调的缺口。

Comments 75 pages (excl. references), 2 tables. Addresses policy makers, regulators, and practitioners at the intersection of AI governance, cybersecurity, and geopolitical risk

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05756 2026-04-08 cs.CL 57%

Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning

通过KL优化微调控制多轮LLM生成的分布偏倚

Yanbei Jiang, Amr Keleg, Ryandito Diandaru, Jey Han Lau, Lea Frermann, Biaoyan Fang, Fajri Koto

机构 * University of Melbourne(墨尔本大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Oracle(甲骨文公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过KL优化微调结合语义对齐的方法,解决多轮LLM生成中分布控制问题,实验显示其在属性生成任务中表现优异。

Comments Accepted at ACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏