arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31906 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31906 篇

2608.01395 2026-08-04 cs.CL cs.AI 新提交 90%

Language Equality has a Price: A Systematic Investigation of Multi-turn LLM Performance for EU-24+

语言平等是有代价的:针对欧盟24+语言的多轮大语言模型性能系统研究

Sherzod Hakimov, Karl Osswald, Jelle Psurek, Eszter Bukovszky, A. Altar Lüser, David Schlangen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 本研究以30种语言评估9种LLM,发现开源模型难以覆盖欧盟24种官方语言,商用模型表现更优且非英语语言运行成本更高、得分更低,揭示语言平等存在代价。

Comments Source code: https://github.com/clembench/multilingual

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29771 2026-08-04 cs.AI cs.LG q-fin.CP q-fin.PM 版本更新 90%

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

CLQT:用于LLM投资组合管理代理诊断评估的闭环、成本感知、策略一致性基准

Bo Qu, Mingguang Chen

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出CLQT基准,通过闭环交易环境诊断LLM代理的决策过程,而非仅排名收益,评估五个维度的能力。

Comments 56 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19913 2026-08-04 cs.CL cs.AI 版本更新 90%

When LLM Essays Outscore Student Essays: What a Korean Writing Rubric Rewards and Where Readers Disagree

从直觉到校准判断:基于评分标准的专家小组研究人类对LLM生成韩语文本的检测

Shinwoo Park, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究通过三阶段盲 longitudinal 研究评估人类对LLM生成韩语文本的判断,提出LREAD框架提升准确性与一致性,证明评分标准辅助判断能提高检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28934 2026-08-03 cs.CL cs.AI cs.CY 新提交 90%

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

FairFund-Bench:评估大语言模型资源分配中的分配偏差

Martin Lukk

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。

Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交 90%

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 90%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19576 2026-07-30 cs.AI cs.CL cs.SE 版本更新 90%

Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries

库漂移:在自我演化的LLM技能库中诊断和修复一种无声的失败模式

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文研究了自我演化的LLM技能库中的一种无声失败模式——库漂移,通过可重复触发实验、细粒度诊断和验证修复方法,揭示了技能积累无序导致检索退化、假阳性注入和性能停滞的问题,并提出了一种经过验证的修复方案,显著提升了技能库的性能。

Comments Accepted to the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN@ICML 2026), Seoul, South Korea. https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23765 2026-07-28 cs.LG cs.AI 新提交 90%

WISERouter: LLM Routing with Workload Budget Constraint

WISERouter:具有工作负载预算约束的大语言模型路由

Yifei Li, Zihui Gao, Laks V. S. Lakshmanan

机构 * The University of British Columbia(英属哥伦比亚大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模使用LLMs成本高的问题,将LLM路由建模为约束上下文多臂老虎机问题,提出WISERouter框架,支持离线和在线学习。证明WR-Online有次线性遗憾界,实验表明WR-Offline性能超基线且更守预算,WR-Online用较少探索数据达可比性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23121 2026-07-28 cs.IR cs.CL cs.LG 新提交 90%

SMART: LLM-Augmented Hybrid Retrieval for Dynamic Product Ads

SMART:用于动态产品广告的大语言模型增强混合检索

Congfei Zhang, Jingxiao Ma, Xiaodong Liu, Hsiang-wei Chao, Siman Wang, Ge Liu, Shantanu Aggarwal, Vincent Zhang, Meghana Missula, Rachel Liao, Zichu Li, Xiao Bai, Yunzhi Zhou, Yajun Wang, Zhe Liu, Jinchao Li, Yu Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究动态产品广告中重定向和开拓新客户的平衡问题,提出SMART方法,通过规则与LLM生成查询结合及质量门控管理成本,经实验验证,该方法有效提升广告转化率,降低LLM成本。

Comments To be published in the 20th ACM Conference on Recommender Systems (recsys'26), September 27 - October 2, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20864 2026-07-24 cs.LG cs.CL 新提交 90%

Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks

位置偏差隐藏在天花板效应背后:LLM基准测试的排列诊断

Hiroki Tamba

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究LLM基准测试中位置偏差问题,引入inspect_permute工具对四个供应商在五个MMLU主题上进行测试,发现位置偏差仅在特定准确率区间可检测,明确了可检测区域及两种机制类型,界定了位置偏差测量范围,使核心问题可验证。

Comments 25 pages, 4 figures, 2 appendices. Code, data, and preregistration verification at https://github.com/TambaClan/inspect_permute. Companion paper: arXiv:2606.26185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19415 2026-07-23 q-bio.QM cs.AI cs.CL 新提交 90%

Auditing Retrieval-Augmented LLM Hypotheses for Longitudinal Cell Painting Morphology

纵向细胞绘画形态学的检索增强大语言模型假设审计

Gilchan Park, Guang Zhao, Byung-Jun Yoon, Shinjae Yoo

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对纵向细胞绘画形态学,提出检索增强解释框架,结合多方面证据使LLM生成可审计假设,引入两个定量审计测试,通过实验验证其有效性,产生了可证伪的生物学假设,揭示低剂量率下的适应性表型。

Comments Accepted for publication at ACM BCB 2026. This is the author's version. The definitive Version of Record is available at [https://doi.org/10.1145/3807503.3819448](https://doi.org/10.1145/3807503.3819448)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07323 2026-07-16 cs.AI cs.LG cs.NE cs.SC 版本更新 90%

Discovering Ordinary Differential Equations with LLM-Based Qualitative and Quantitative Evaluation

基于LLM的定性与定量评估的常微分方程发现

Sum Kyun Song, Bong Gyun Shin, Jae Yong Lee

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Republic of Korea(韩国首尔 Chung-Ang 大学人工智能系) Daejin University, Pocheon, Republic of Korea(韩国坡州市 Daejin 大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出DoLQ方法,通过多智能体架构结合LLM进行定性与定量评估,实现常微分方程的发现,实验表明其在多维ODE基准测试中性能优于现有方法。

Comments Accepted at ICML 2026

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07469 2026-07-09 cs.CL cs.AI 新提交 90%

SynthAVE: Scalable Synthetic Labeling for E-Commerce with LLM-Arena Validation

SynthAVE:通过大语言模型领域验证实现电子商务的可扩展合成标注

Andrea Scarinci, Virginia Negri, Brayan Impata, Suleiman Khan, Victor Martinez, Marcello Federico

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对电子商务属性提取微调大语言模型需大量标注数据、人工标注成本高的问题,提出SynthAVE基准及多LLM领域框架,通过多数投票验证合成标注,实现经济高效且质量与人工审核相当的大规模属性值提取验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06157 2026-07-08 cs.CL cs.AI 新提交 90%

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

用于协商协作的大语言模型智能体:部分可观测联合决策下的联合决策研究

Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Fuzhou University(福州大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究部分可观测联合决策任务下的协商LLM智能体,通过形式化问题、引入基准、实例化框架和协议并评估LLMs,发现复杂任务仍挑战语言模型,协商过程有反思纠错机会,为评估改进LLM智能体奠定基础。

Comments Code is available at https://github.com/wcx21/deliberative-collaboration-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02368 2026-07-03 stat.ML cs.AI cs.LG math.DG 新提交 90%

The Dual Nature of LLM Persona: Aggregated Tendencies and Frame-Dependent Geometry

LLM人格的双重性质:聚合倾向与框架依赖的几何结构

Yuan Yuan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 通过心理测量问卷评估LLM人格时,发现人格表达包含聚合特征(大五人格分数)和几何特征(SPD流形)两种可分离成分,其中几何特征并非内在属性,而是框架依赖的协调模式,揭示了LLM人格的双重性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22737 2026-07-03 cs.AI cs.CL cs.SE 新提交 90%

GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation

GroundEval:有状态智能体评估中LLM评判的确定性替代方案

Jeffrey Flynt

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出GroundEval框架,通过记录智能体搜索、获取、引用和访问的证据轨迹,以确定性方式评估其回答,解决LLM评判无法检测的证据路径失效问题。

Comments Streamlined entry point into framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00297 2026-07-02 cs.LG cs.CL 新提交 90%

EPC: A Standardized Protocol for Measuring Evaluator Preference Dynamics in LLM Agent Systems

EPC:一种用于测量LLM智能体系统中评估者偏好动态的标准协议

Zewen Liu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EPC协议,通过四阶段隔离范式标准化测量LLM智能体系统中评估者偏好耦合现象,并提供参考快照和版本约定以支持复现、比较和衰减检测。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01233 2026-07-02 cs.CL cs.AI 新提交 90%

Measuring the Gap Between Human and LLM Research Ideas

衡量人类与LLM研究想法之间的差距

Ziyu Chen, Yilun Zhao, Arman Cohan

机构 * Yale University(耶鲁大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文构建大规模评估框架,通过逆向工程提取论文核心想法,引入双轴研究品味分类法,发现LLM想法集中在桥梁式机会和综合方法,而人类想法分布更广,揭示两者系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30931 2026-07-01 cs.AI cs.LG cs.MA math.OC math.PR 新提交 90%

RoPoLL: Robust Panel of LLM Judges

RoPoLL: 鲁棒的LLM评审团

Anish Acharya, Kris W Pan, Brian Verkhovsky

机构 * Amazon Web Services(亚马逊云服务)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对LLM评审团在污染数据下偏差无界的问题,提出RoPoLL,用几何中位数聚合替代均值,实现最优鲁棒性,在多种偏差攻击下显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28183 2026-07-01 cs.CL cs.AI 版本更新 90%

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

BenGER:德国法律中基于归入的法律推理的LLM系统基准测试

Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas, Matthias Grabmair

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Ludwig Maximilian University of Munich (LMU)(慕尼黑路德维希-马克西米利安大学) University of Konstanz(康斯坦茨大学) University of Saarbrücken(萨尔布吕肯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BenGER数据集,用于评估LLM系统在德国法律归入推理中的表现,通过自动和基于法官的指标比较12个LLM系统与人类基线。

Comments Pre-Print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29273 2026-06-30 cs.CL cs.AI 90%

A Hybrid Framework for Song Lyric Annotation Based on Human-LLM Alignment

基于人类-大语言模型对齐的歌词注释混合框架

Rashini Liyanarachchi, Frank Tran, Md Mahmudul Hasan, Aditya Joshi, Erik Meijering

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出混合注释框架,通过预测人类与LLM在歌词情感标注中的潜在不一致,优化注释过程,并创建句子级歌词数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28796 2026-06-30 cs.CL cs.LG 90%

Structure-Preserving Document Translation via Multi-Stage LLM Pipeline: A Case Study in Marathi

通过多阶段LLM流水线实现结构保持的文档翻译:以马拉地语为例

Manasi Waghe, Danish Chandargi, Mohammad Aamir Rayyan, Raviraj Joshi, A. R. Deshpande

机构 * Pune Institute of Computer Technology(普那计算机技术学院) L3Cube Labs(L3Cube实验室) Indian Institute of Technology Madras(印度理工学院马德拉斯分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种结构保持的马拉地语-英语政府文档翻译框架,集成布局感知OCR、坐标文本提取、LLM翻译和HTML重建,确保文档布局和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09708 2026-06-30 cs.LG cs.AI cs.DC 90%

Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple Silicon

Metal-Sci: 一个用于苹果硅芯片上进化式LLM内核搜索的科学计算基准

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 Metal-Sci基准通过10个科学任务和六个优化领域,评估LLM在自动内核搜索中的性能,展示了不同模型在不同任务上的加速效果及结构化评估方法的可靠性。

Comments Published at the Fifth Workshop on Deep Learning for Code (DL4C) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24901 2026-06-25 cs.LG cs.AI 新提交 90%

LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning

LLM演化作为行业规模生态系统:持续学习的生命周期视角

Hao Jiang, Enneng Yang, Guojie Zhu, Yibin Chen, Yunkun Xu, Zifu Kou, Jiayi Li, Chong Chen, Zhao Cao, Li Shen

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 从生态系统视角重新定义工业级LLM持续学习为闭环更新与发布问题,识别三大挑战,提出五项生命周期设计原则,并评估其成熟度与部署蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24679 2026-06-25 cs.LG cs.AI 新提交 90%

FlowPipe: LLM-Enhanced Conditional Generative Flow Networks for Data Preparation Pipeline Construction

FlowPipe: 基于条件生成流网络的LLM增强数据准备流水线构建

Kunyu Ni, Lei Cao, Jie He, Xiaotong Zhang, Jianfeng Jin, Junyu Dong, Yanwei Yu

机构 * Ocean University of China(中国海洋大学) University of Arizona(亚利桑那大学) University of Science and Technology Beijing(北京科技大学) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出FlowPipe框架,利用条件生成流网络(C-GFlowNets)和LLM语义调制,解决数据准备流水线自动构建中的组合优化和稀疏搜索问题,在74个数据集上平均准确率提升11.96%,训练收敛速度提升12.5倍。

Comments Accepted by SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23217 2026-06-23 cs.CL cs.AI 新提交 90%

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

MuPPET:多轮对话中LLM助手上下文隐私的基准测试

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Rome Tor Vergata(罗马第二大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22203 2026-06-23 cs.CL cs.AI cs.MA cs.SI 新提交 90%

When Is Emergent Consensus Real? A Measured Coupling Gain and a Validity Diagnostic for LLM Agent Societies

何时涌现共识是真实的?一种测量耦合增益与LLM智能体社会的有效性诊断

Dongxu Yang

机构 * DeepLethe

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对LLM智能体社会中的涌现共识或极化现象,提出基于反事实扰动的耦合增益测量方法,并建立有效性诊断工具,区分真实社会动态与模型伪影。

Comments 13 pages (incl. appendix with proofs), 7 figures. Code and per-run logs released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21710 2026-06-23 cs.CL cs.AI cs.IR 新提交 90%

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

PrivacyAlign: LLM代理的上下文隐私对齐

Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella

机构 * University of Waterloo(滑铁卢大学) ServiceNow AI Research(ServiceNow AI 研究) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21098 2026-06-23 cs.CL cs.AI 新提交 90%

LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations

基于LLM的多参考评估方法用于短语边界标注的高效稳健评估

Younghan Park, Hoyeon Lee, Hawon Jeong, Jong-Hwan Kim

机构 * NAVER Cloud(NAVER云) Yonsei University(延世大学) KAIST AI(韩国科学技术院人工智能)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出基于LLM的多参考评估方法(LMRE),通过生成多个有效短语边界解决单参考评估的局限性,在韩语测试中与人类判断一致性更强。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20668 2026-06-23 cs.CR cs.AI cs.LG 新提交 90%

BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

BELLS-O:评估LLM监督系统的运营权衡

Leonhard Waibl, Felix Michalak, Hadrien Mariaccia

机构 * University of Graz, Graz, Austria(格拉茨大学) Supervised Program for Alignment Research (SPAR)(对齐研究监督计划 (SPAR)) Centre pour la Sécurité de l'IA (CeSIA), Paris, France(人工智能安全研究中心 (CeSIA),巴黎,法国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出首个独立运营基准BELLS-O,评估28个LLM监督系统在检测率、误报率、延迟和成本上的权衡,发现专用护栏在内容审核中占优,而前沿通用模型在越狱检测中表现更好但成本更高。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD). 2 figures; main text plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏