arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-06 至 2026-04-06 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2604.02652 2026-04-06 cs.LG cs.AI 86%

Generalization Limits of Reinforcement Learning Alignment

强化学习对齐的泛化极限

Haruhi Shida, Koo Imai, Keigo Kansa

机构 * Aladdin Security Inc(阿拉丁安全公司)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了强化学习对齐技术的泛化能力限制,提出复合越狱方法,通过结合多种攻击技术提高攻击成功率,验证了安全训练无法广泛泛化 hypothesis。

Comments 7 pages, 2 figures, 2 tables, accepted at JSAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02766 2026-04-06 cs.LG cs.AI 84%

Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs

随机难以超越:在线DPO中的主动选择

Giyeong Oh, Junghyun Lee, Jaehyun Park, Youngjae Yu, Wonho Bae, Junhyug Noh

机构 * Seoul National University(首尔大学) Ewha Womans University(梨花女子大学) KAIST(韩国科学技术院) UBC(不列颠哥伦比亚大学)

专题命中 偏好对齐 :DPO(title,abstract);harmlessness(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在线DPO中主动选择策略的有效性,发现即使在强先验基础上,主动选择的计算开销难以抵消简单随机采样带来的多样性优势。

Comments first commit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02507 2026-04-06 stat.ML cs.LG 70%

Reinforcement Learning from Human Feedback: A Statistical Perspective

基于人类反馈的强化学习:统计学视角

Pangpang Liu, Chengchun Shi, Will Wei Sun

机构 * Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计学系) Mitch Daniels School of Business, Purdue University(普渡大学米奇·丹尼尔斯商学院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文从统计学角度探讨了基于人类反馈的强化学习,分析了其在大语言模型对齐中的核心方法与挑战,包括奖励模型学习和策略优化,并讨论了相关统计模型和最新研究进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21584 2026-04-06 cs.CV 67%

TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs

TARS:最小最大令牌自适应偏好策略用于减少多模态大语言模型中的幻觉

Kejia Zhang, Keda Tao, Zhiming Luo, Chang Liu, Jiasheng Tang, Huan Wang

机构 * Xiamen University(厦门大学) Westlake University(西湖大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) AWS AI Lab, Amazon(亚马逊AWS AI实验室) Hupan Laboratory(湖畔实验室)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 TARS通过最小最大优化问题重构直接偏好优化,通过对抗性令牌扰动减少多模态大语言模型中的幻觉,通过频域对齐损失提升隐藏表征,优于标准DPO并超越数据增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02686 2026-04-06 cs.LG cs.AI 62%

Beyond Semantic Manipulation: Token-Space Attacks on Reward Models

超越语义操控:奖励模型中的标记空间攻击

Yuheng Zhang, Mingyue Huo, Minghao Zhu, Mengxue Zhang, Nan Jiang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究员) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Token Mapping Perturbation Attack(TOMPA)框架,通过在标记空间中进行对抗优化,发现非语言标记模式以提升奖励模型性能,揭示了当前RLHF流程的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2604.02687 2026-04-06 eess.SY cs.SY 78%

Inverse Safety Filtering: Inferring Constraints from Safety Filters for Decentralized Coordination

逆安全过滤:从安全过滤器推断约束以实现去中心化协调

Minh Nguyen, Jingqi Li, Gechen Qu, Claire J. Tomlin

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种在线方法,通过观察其他智能体的安全过滤动作推断约束,结合去中心化规划方法确保安全,通过仿真和硬件实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22367 2026-04-06 cs.CL cs.AI cs.CY 67%

What Is The Political Content in LLMs' Pre- and Post-Training Data?

大语言模型预训练和后训练数据中的政治内容是什么?

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

机构 * Bocconi University(博科尼大学) University of Manchester(曼彻斯特大学) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。

Comments 10 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02353 2026-04-06 cs.LG cs.AI 62%

Prism: Policy Reuse via Interpretable Strategy Mapping in Reinforcement Learning

Prism:通过可解释的策略映射实现策略重用

Thomas Pravetz

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Prism框架通过可解释的策略映射将强化学习智能体的决策基于离散因果验证的概念,并利用这些概念作为零样本迁移接口。该方法通过K-means聚类将每个智能体的编码特征划分为K个概念,通过因果干预验证这些概念直接驱动智能体行为,从而实现策略知识的零样本迁移。

Comments 13 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 6 篇

2604.02574 2026-04-06 cs.CR cs.AI cs.LG 86%

Understanding the Effects of Safety Unalignment on Large Language Models

理解安全对齐偏差对大语言模型的影响

John T. Halloran

机构 * Leidos(Leidos公司)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 研究通过JT和WO方法评估六种大模型在恶意和良性任务中的表现,发现WO方法使模型更易执行恶意活动,而JT方法则更易产生幻觉。通过监督微调有效限制WO带来的攻击能力。

Comments 12 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13518 2026-04-06 cs.AI cs.NE 70%

AgenticRed: Evolving Agentic Systems for Red-Teaming

AgenticRed:为红队测试设计的进化系统

Jiayi Yuan, Jonathan Nöther, Natasha Jaques, Goran Radanović

机构 * University of Washington(华盛顿大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 AgenticRed通过进化算法自动设计红队系统,无需人工干预,显著提升攻击成功率,达到96%-100%的ASR。

Comments Website: https://yuanjiayiy.github.io/AgenticRed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15323 2026-04-06 cs.CL 70%

Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling

通过输出预填充改进多选问答中的LLM首词预测

Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学与雷焦艾米利亚大学) University of Pisa(比萨大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Brown University(布朗大学) Meta

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文提出预填充攻击,通过在模型输出前添加结构化自然语言前缀,提升多选问答中LLM首词预测的准确性与可靠性。

Comments 23 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03081 2026-04-06 cs.CR cs.AI cs.CL 62%

Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems

针对LLM编码代理技能生态系统的供应链污染攻击

Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma

机构 * Griffith University(格里菲斯大学) The State Information Center(国家信息中心) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Wake Forest University(维克森林大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM编码代理技能生态系统中供应链攻击对行动空间的影响,提出DDIPE方法通过嵌入恶意逻辑到技能文档中实现隐式payload执行,实验显示其在强防御下可绕过11.6%-33.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02954 2026-04-06 cs.CL cs.AI 62%

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation

逻辑毒药:图检索增强生成中的逻辑攻击

Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang

机构 * Southwestern University of Finance and Economics(西南财经大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicPoison攻击框架,通过逻辑推理而非注入虚假内容,破坏图检索增强生成系统中的拓扑结构,从而降低其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03205 2026-04-06 cs.CR cs.LG 57%

A Tsetlin Machine-driven Intrusion Detection System for Next-Generation IoMT Security

基于Tsetlin机器的下一代IoMT安全入侵检测系统

Rahul Jaiswal, Per-Arne Andersen, Linga Reddy Cenkeramaddi, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT, University of Agder, Norway(挪威阿格德尔大学信息与通信技术系)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于Tsetlin机器的入侵检测系统,用于检测针对IoMT网络的多种网络攻击,通过命题逻辑建模攻击模式,实验表明其在二分类和多分类中均优于传统机器学习分类器。

Comments 8 pages, 15 figures, 9 tables. Accepted at the 7th Silicon Valley Cybersecurity Conference (SVCC 2026), California, USA

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2604.02375 2026-04-06 cs.SE cs.PL 50%

KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents

KAIJU:一种意图门控的LLM代理执行内核

Cormac Guerin, Frank Guerin

专题命中 提示注入 :prompt injection(abstract)

AI总结 KAIJU通过解耦LLM推理层与代理执行流程,引入意图门控执行和执行内核,提升LLM代理在复杂任务中的执行效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2604.02389 2026-04-06 cs.SD cs.AI eess.AS 57%

Audio Spatially-Guided Fusion for Audio-Visual Navigation

音频空间引导融合用于音频视觉导航

Xinyu Zhou, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合研究实验室,具身智能) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种音频空间引导融合方法,通过自适应提取空间状态信息,实现多模态特征动态对齐与融合,提升在未知声源分布下的导航泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16383 2026-04-06 cs.LG stat.ML 57%

Multivariate Uncertainty Quantification with Tomographic Quantile Forests

多变量不确定性量化与断层量化森林

Takuya Kanazawa

机构 * Kobe Gakuin University(神户学院大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出Tomographic Quantile Forests,一种非参数、不确定性感知的树回归模型,用于多变量目标的条件分布估计,通过多方向量化聚合和 sliced Wasserstein 距离最小化实现多变量分布重建。

Comments 36 pages. v2: matches published version

Journal ref Math. Comput. Appl. 2026, 31(2), 53

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 23 篇

2604.02695 2026-04-06 cs.CV 88%

XrayClaw: Cooperative-Competitive Multi-Agent Alignment for Trustworthy Chest X-ray Diagnosis

XrayClaw:协作-竞争多智能体对齐用于可信的胸部X光诊断

Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology, Shenzhen, China(深圳理工大学,深圳,中国)

专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract)

AI总结 本文提出XrayClaw框架,通过协作-竞争架构提升胸部X光诊断的可靠性,实现高准确性和临床推理一致性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01444 2026-04-06 cs.CR 85%

Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models

制造风险:在大型语言模型中基准测试和降低食品安全风险

Weidi Luo, Xiaofei Wen, Tenghao Huang, Hongyi Wang, Zhen Xiang, Chaowei Xiao, Kristina Gligorić, Muhao Chen

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

AI总结 本文提出FoodGuardBench基准,用于评估大型语言模型在食品安全领域的安全性和鲁棒性,发现现有模型存在对食品相关领域安全对齐不足、生成有害指令及防护措施失效等问题,并提出FoodGuard-4B作为改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL 84%

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01589 2026-04-06 cs.LG cs.AI 84%

SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond

SafeSci: 科学领域及更广泛场景下大型语言模型的安全性评估

Xiangyang Zhu, Yuan Tian, Qi Jia, Kaiwei Zhang, Zicheng Zhang, Chunyi Li, Kaiyuan Ji, Dongrui Liu, Zijian Chen, Lu Sun, Renrui Zhang, Yan Teng, Jing Shao, Wei Sun, Xia Hu, Yu Qiao, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) ECNU(华东师范大学) ByteDance(字节跳动)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSci框架,通过SafeSciBench和SafeSciTrain评估和提升科学领域LLM的安全性,发现现有模型存在关键漏洞,并展示微调提升安全对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02359 2026-04-06 cs.CL cs.AI 81%

Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis

利用LLM作为法官/陪审团推进模型响应用户表现精神病的可扩展、临床验证的安全性评估

May Lynn Reese, Markela Zeneli, Mindy Ng, Jacob Haimes, Andreea Damien, Elizabeth Stade

机构 * Apart Research Odyssean Institute London School of Economics and Political Science(伦敦政治经济学院) Stanford Institute for Human-Centered AI(斯坦福大学以人为本人工智能研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM作为法官或陪审团评估模型响应用户精神病表现的方法,开发了七项临床验证的安全标准,并展示了LLM作为法官在临床验证中的有效性。

Comments published at IASEAI 2026, preliminary work presented at GenAI4Health workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07553 2026-04-06 cs.CL 79%

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

VeriOS: 基于查询的人机GUI交互以实现可信操作系统代理

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 VeriOS通过引入查询驱动的人机GUI交互框架,提升操作系统代理在不可信环境中的任务完成能力,实验显示其在不可信场景中性能显著提升,同时保持正常场景下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02372 2026-04-06 cs.CR cs.LG 74%

Backdoor Attacks on Decentralised Post-Training

在去中心化后训练中的后门攻击

Oğuzhan Ersoy, Nikolay Blagoev, Jona te Lintelo, Stefanos Koffas, Marina Krček, Stjepan Picek

机构 * University of Neuchâtel(纳沙泰尔大学) Radboud University(拉德堡德大学) Delft University of Technology(代尔夫特理工大学) SecureML University of Zagreb(萨格勒布大学)

专题命中 安全评测 :safety(abstract,comments);alignment(abstract);分类 cs.LG;trustworthy(comments)

AI总结 本文提出首个针对流水线并行的后门攻击,通过控制中间阶段实现模型对齐偏差,实验显示触发词可使对齐率从80%降至6%,且在安全对齐训练下仍成功60%。

Comments Accepted to ICLR 2026 Workshop 'Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities'

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02947 2026-04-06 cs.AI 70%

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

AgentHazard:用于评估计算机使用代理有害行为的基准

Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 AgentHazard基准通过2653个实例评估计算机使用代理的有害行为,揭示了模型在连续上下文和工具使用中识别安全风险的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02669 2026-04-06 cs.CL 70%

Redirected, Not Removed: Task-Dependent Stereotyping Reveals the Limits of LLM Alignments

转向而非移除:任务依赖性刻板印象揭示了LLM对齐的局限

Divyanshu Kumar, Ishita Gupta, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

机构 * Enkrypt AI

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究通过任务依赖性刻板印象分析,揭示LLM对齐的局限性,指出单一基准测试无法全面反映模型偏见,且对齐实践可能掩盖而非减轻代表性伤害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00290 2026-04-06 cs.AI cs.MA 70%

ClinicalReTrial: Clinical Trial Redesign with Self-Evolving Agents

临床试验重设计:具有自进化代理的临床试验重设计

Sixue Xing, Kerui Wu, Xuanye Xia, Meng Jiang, Jintai Chen, Tianfan Fu

机构 * University of Notre Dame(圣母大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出ClinicalReTrial系统,通过自进化代理对临床试验协议进行迭代重设计,提升成功率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03174 2026-04-06 cs.CL cs.AI 62%

Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation

超越参数:大型语言模型中上下文丰富技术的综述:从上下文提示到因果检索增强生成

Prakhar Bansal, Shivangi Agarwal

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中通过增加结构化上下文来提升性能的技术,涵盖上下文学习、提示工程、检索增强生成等方法,并提出透明的文献筛选协议和可信检索增强NLP的研究优先级。

Comments 7 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02527 2026-04-06 cs.LG cs.AI 62%

Jump Start or False Start? A Theoretical and Empirical Evaluation of LLM-initialized Bandits

先发优势还是虚假开端?基于LLM初始化的多臂老虎机的理论与实证评估

Adam Bayley, Xiaodan Zhu, Raquel Aoki, Yanshuai Cao, Kevin H. Wilson

机构 * Queen’s University(女王大学) RBC Borealis

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM生成的偏好在存在噪声和系统性偏差时对多臂老虎机性能的影响,发现30%以内噪声下初始化有效,40%后效果下降,50%后性能劣化。系统性偏差下,LLM初始化可能比冷启动更差,通过理论分析得出LLM初始化优于冷启动的充分条件。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03216 2026-04-06 cs.CL 57%

BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence

BAS:一种基于决策理论的评估大语言模型置信度的方法

Sean Wu, Fredrik K. Gustafsson, Edward Phillips, Boyan Gao, Anshul Thakur, David A. Clifton

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出BAS,一种基于决策理论的评估方法,用于评估大语言模型置信度在不同风险偏好下的决策支持能力,揭示置信度与决策可靠性之间的关系,并展示如何通过干预提升置信度可靠性。

Comments 24 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏