arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.06546 2026-06-08 cs.LG 新提交 90%

Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建

Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出Elmes*框架,自动构建细粒度场景特定量规,用于评估大语言模型在教育场景中的多维教学能力,构建Edu-330基准并揭示模型差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14630 2026-08-18 cs.CL cs.AI 新提交 90%

Characterizing Rhetorical Misalignment in Decision-Making with Language Models

表征语言模型决策中的修辞失配问题

Zirui Cheng, Joey Chan, Simo Du, Chenhao Tan, Yue Guo, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi Medical Center(纽约市健康与医院公司雅各比医学中心) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究开发决策理论框架研究LLM的修辞失配问题,通过临床实验发现其会诱导平均2.81%的有害决策翻转,还提出用LLM模拟决策者实现可扩展评估,揭示了高风险领域的新安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 90%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 评测与基准 :LLM(title,summary_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13136 2026-08-14 cs.CL cs.AI cs.DB cs.MA 新提交 90%

LigBench: A Unified and Human-Aligned Benchmark for LLM-based Research Idea Generation

LigBench:面向基于大语言模型的研究创意生成的统一且符合人类偏好的基准

Chenrun Wang, Mingxuan Zhu, Tiancheng Huang, Wenjie Li, Yujie Zhang, Zichen Zhu, Zhiying Zou, Kai Yu, Lu Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有LLM研究创意生成评估零散、缺乏统一标准的问题,提出LigBench基准及PAIR-IQ数据集,实验表明LigBench评估稳定可解释且与专家判断一致性高,PAIR-IQ训练的模型排名准确性和鲁棒性更强

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11434 2026-08-13 cs.AI cs.CL cs.CV 新提交 90%

Benchmarking LLM Judges for Mobile Agent Evaluation

面向移动智能体评估的LLM评判基准测试

Ziqiang Wang, Li Gu, Zhixiang Chi, Zhi Liu, Seyed Mehdi Ayyoubzadeh, Yuanhao Yu, Yang Wang

机构 * Mila – Québec AI Institute(米拉-魁北克人工智能研究所) Concordia University(康考迪亚大学) University of Toronto(多伦多大学) Shanghai University(上海大学) McMaster University(麦克马斯特大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究推出MobileJudgeBench基准,评估6种LLM评判器方法在移动智能体轨迹上的可靠性,发现简单基线评判器具竞争力、基准质量指标可预测评判器效用,且不同LLM后端故障特征相反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10970 2026-08-12 cs.CL cs.AI 新提交 90%

ReLTEx: Reliable LLM-based Taxonomy Expansion

ReLTEx:基于大语言模型的可靠分类体系扩展

Zeinab Ghamlouch, Mehwish Alam

机构 * Télécom Paris(巴黎电信学院) Institut Polytechnique de Paris(巴黎综合理工学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReLTEx是结合LLM候选生成、结构感知验证与递归扩展控制的框架,可减少幻觉,在基准分类体系的掩码扩展任务中,能生成更可靠、语义连贯的分类体系扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03206 2026-08-05 cs.CY cs.AI cs.CL 新提交 90%

EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners

EduClaw-Bench:面向教学大型语言模型智能体的长周期基准测试集(含模拟学习者)

Unggi Lee, Sookbun Lee, Yeil Jeong, Eunjoo Lee, Minchul Shin, Hoilym Kwon

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出EduClaw-Bench长周期基准测试集,结合模拟学习者评估LLM智能体辅导效果,发现辅导质量取决于基础模型与智能体适配器的结合,且多数组合无法维持全程良好辅导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02464 2026-08-04 cs.AI cs.LG cs.SE 新提交 90%

Real-Time Detection and Repair of LLM Agent Failures

LLM智能体故障的实时检测与修复

Sunny Dubey

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 该研究提出基于LLM智能体步骤遥测的实时故障检测与修复系统,结合单类回声状态网络集成与确定性验证层,可高效检测并修复故障,提升任务成功率且成本极低。

Comments 16 pages, 5 figures. Code, data and demo: github.com/sunnydubey1111/agent-trajectory-sentinel Walkthrough: youtu.be/a05n_000klE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02442 2026-08-04 cs.AI cs.CL 新提交 90%

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

正确答案,错误方法:捷径作弊误导前沿科学基准上的大语言模型推理评估

Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究指出前沿LLM在科学推理基准中存在解题作弊问题,仅答案评估会高估其推理能力,开发的反作弊策略可抑制该问题。

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01395 2026-08-04 cs.CL cs.AI 新提交 90%

Language Equality has a Price: A Systematic Investigation of Multi-turn LLM Performance for EU-24+

语言平等是有代价的:针对欧盟24+语言的多轮大语言模型性能系统研究

Sherzod Hakimov, Karl Osswald, Jelle Psurek, Eszter Bukovszky, A. Altar Lüser, David Schlangen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 本研究以30种语言评估9种LLM,发现开源模型难以覆盖欧盟24种官方语言,商用模型表现更优且非英语语言运行成本更高、得分更低,揭示语言平等存在代价。

Comments Source code: https://github.com/clembench/multilingual

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28934 2026-08-03 cs.CL cs.AI cs.CY 新提交 90%

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

FairFund-Bench:评估大语言模型资源分配中的分配偏差

Martin Lukk

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。

Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交 90%

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 90%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23765 2026-07-28 cs.LG cs.AI 新提交 90%

WISERouter: LLM Routing with Workload Budget Constraint

WISERouter:具有工作负载预算约束的大语言模型路由

Yifei Li, Zihui Gao, Laks V. S. Lakshmanan

机构 * The University of British Columbia(英属哥伦比亚大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模使用LLMs成本高的问题,将LLM路由建模为约束上下文多臂老虎机问题,提出WISERouter框架,支持离线和在线学习。证明WR-Online有次线性遗憾界,实验表明WR-Offline性能超基线且更守预算,WR-Online用较少探索数据达可比性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23121 2026-07-28 cs.IR cs.CL cs.LG 新提交 90%

SMART: LLM-Augmented Hybrid Retrieval for Dynamic Product Ads

SMART:用于动态产品广告的大语言模型增强混合检索

Congfei Zhang, Jingxiao Ma, Xiaodong Liu, Hsiang-wei Chao, Siman Wang, Ge Liu, Shantanu Aggarwal, Vincent Zhang, Meghana Missula, Rachel Liao, Zichu Li, Xiao Bai, Yunzhi Zhou, Yajun Wang, Zhe Liu, Jinchao Li, Yu Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究动态产品广告中重定向和开拓新客户的平衡问题,提出SMART方法,通过规则与LLM生成查询结合及质量门控管理成本,经实验验证,该方法有效提升广告转化率,降低LLM成本。

Comments To be published in the 20th ACM Conference on Recommender Systems (recsys'26), September 27 - October 2, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20864 2026-07-24 cs.LG cs.CL 新提交 90%

Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks

位置偏差隐藏在天花板效应背后:LLM基准测试的排列诊断

Hiroki Tamba

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究LLM基准测试中位置偏差问题,引入inspect_permute工具对四个供应商在五个MMLU主题上进行测试,发现位置偏差仅在特定准确率区间可检测,明确了可检测区域及两种机制类型,界定了位置偏差测量范围,使核心问题可验证。

Comments 25 pages, 4 figures, 2 appendices. Code, data, and preregistration verification at https://github.com/TambaClan/inspect_permute. Companion paper: arXiv:2606.26185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19415 2026-07-23 q-bio.QM cs.AI cs.CL 新提交 90%

Auditing Retrieval-Augmented LLM Hypotheses for Longitudinal Cell Painting Morphology

纵向细胞绘画形态学的检索增强大语言模型假设审计

Gilchan Park, Guang Zhao, Byung-Jun Yoon, Shinjae Yoo

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对纵向细胞绘画形态学,提出检索增强解释框架,结合多方面证据使LLM生成可审计假设,引入两个定量审计测试,通过实验验证其有效性,产生了可证伪的生物学假设,揭示低剂量率下的适应性表型。

Comments Accepted for publication at ACM BCB 2026. This is the author's version. The definitive Version of Record is available at [https://doi.org/10.1145/3807503.3819448](https://doi.org/10.1145/3807503.3819448)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07469 2026-07-09 cs.CL cs.AI 新提交 90%

SynthAVE: Scalable Synthetic Labeling for E-Commerce with LLM-Arena Validation

SynthAVE:通过大语言模型领域验证实现电子商务的可扩展合成标注

Andrea Scarinci, Virginia Negri, Brayan Impata, Suleiman Khan, Victor Martinez, Marcello Federico

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对电子商务属性提取微调大语言模型需大量标注数据、人工标注成本高的问题,提出SynthAVE基准及多LLM领域框架,通过多数投票验证合成标注,实现经济高效且质量与人工审核相当的大规模属性值提取验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06157 2026-07-08 cs.CL cs.AI 新提交 90%

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

用于协商协作的大语言模型智能体:部分可观测联合决策下的联合决策研究

Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Fuzhou University(福州大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究部分可观测联合决策任务下的协商LLM智能体,通过形式化问题、引入基准、实例化框架和协议并评估LLMs,发现复杂任务仍挑战语言模型,协商过程有反思纠错机会,为评估改进LLM智能体奠定基础。

Comments Code is available at https://github.com/wcx21/deliberative-collaboration-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02368 2026-07-03 stat.ML cs.AI cs.LG math.DG 新提交 90%

The Dual Nature of LLM Persona: Aggregated Tendencies and Frame-Dependent Geometry

LLM人格的双重性质:聚合倾向与框架依赖的几何结构

Yuan Yuan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 通过心理测量问卷评估LLM人格时,发现人格表达包含聚合特征(大五人格分数)和几何特征(SPD流形)两种可分离成分,其中几何特征并非内在属性,而是框架依赖的协调模式,揭示了LLM人格的双重性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22737 2026-07-03 cs.AI cs.CL cs.SE 新提交 90%

GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation

GroundEval:有状态智能体评估中LLM评判的确定性替代方案

Jeffrey Flynt

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出GroundEval框架,通过记录智能体搜索、获取、引用和访问的证据轨迹,以确定性方式评估其回答,解决LLM评判无法检测的证据路径失效问题。

Comments Streamlined entry point into framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00297 2026-07-02 cs.LG cs.CL 新提交 90%

EPC: A Standardized Protocol for Measuring Evaluator Preference Dynamics in LLM Agent Systems

EPC:一种用于测量LLM智能体系统中评估者偏好动态的标准协议

Zewen Liu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EPC协议,通过四阶段隔离范式标准化测量LLM智能体系统中评估者偏好耦合现象,并提供参考快照和版本约定以支持复现、比较和衰减检测。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01233 2026-07-02 cs.CL cs.AI 新提交 90%

Measuring the Gap Between Human and LLM Research Ideas

衡量人类与LLM研究想法之间的差距

Ziyu Chen, Yilun Zhao, Arman Cohan

机构 * Yale University(耶鲁大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文构建大规模评估框架,通过逆向工程提取论文核心想法,引入双轴研究品味分类法,发现LLM想法集中在桥梁式机会和综合方法,而人类想法分布更广,揭示两者系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30931 2026-07-01 cs.AI cs.LG cs.MA math.OC math.PR 新提交 90%

RoPoLL: Robust Panel of LLM Judges

RoPoLL: 鲁棒的LLM评审团

Anish Acharya, Kris W Pan, Brian Verkhovsky

机构 * Amazon Web Services(亚马逊云服务)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对LLM评审团在污染数据下偏差无界的问题,提出RoPoLL,用几何中位数聚合替代均值,实现最优鲁棒性,在多种偏差攻击下显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24901 2026-06-25 cs.LG cs.AI 新提交 90%

LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning

LLM演化作为行业规模生态系统:持续学习的生命周期视角

Hao Jiang, Enneng Yang, Guojie Zhu, Yibin Chen, Yunkun Xu, Zifu Kou, Jiayi Li, Chong Chen, Zhao Cao, Li Shen

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 从生态系统视角重新定义工业级LLM持续学习为闭环更新与发布问题,识别三大挑战,提出五项生命周期设计原则,并评估其成熟度与部署蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24679 2026-06-25 cs.LG cs.AI 新提交 90%

FlowPipe: LLM-Enhanced Conditional Generative Flow Networks for Data Preparation Pipeline Construction

FlowPipe: 基于条件生成流网络的LLM增强数据准备流水线构建

Kunyu Ni, Lei Cao, Jie He, Xiaotong Zhang, Jianfeng Jin, Junyu Dong, Yanwei Yu

机构 * Ocean University of China(中国海洋大学) University of Arizona(亚利桑那大学) University of Science and Technology Beijing(北京科技大学) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出FlowPipe框架,利用条件生成流网络(C-GFlowNets)和LLM语义调制,解决数据准备流水线自动构建中的组合优化和稀疏搜索问题,在74个数据集上平均准确率提升11.96%,训练收敛速度提升12.5倍。

Comments Accepted by SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23217 2026-06-23 cs.CL cs.AI 新提交 90%

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

MuPPET:多轮对话中LLM助手上下文隐私的基准测试

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Rome Tor Vergata(罗马第二大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22203 2026-06-23 cs.CL cs.AI cs.MA cs.SI 新提交 90%

When Is Emergent Consensus Real? A Measured Coupling Gain and a Validity Diagnostic for LLM Agent Societies

何时涌现共识是真实的?一种测量耦合增益与LLM智能体社会的有效性诊断

Dongxu Yang

机构 * DeepLethe

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对LLM智能体社会中的涌现共识或极化现象,提出基于反事实扰动的耦合增益测量方法,并建立有效性诊断工具,区分真实社会动态与模型伪影。

Comments 13 pages (incl. appendix with proofs), 7 figures. Code and per-run logs released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21710 2026-06-23 cs.CL cs.AI cs.IR 新提交 90%

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

PrivacyAlign: LLM代理的上下文隐私对齐

Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella

机构 * University of Waterloo(滑铁卢大学) ServiceNow AI Research(ServiceNow AI 研究) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21098 2026-06-23 cs.CL cs.AI 新提交 90%

LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations

基于LLM的多参考评估方法用于短语边界标注的高效稳健评估

Younghan Park, Hoyeon Lee, Hawon Jeong, Jong-Hwan Kim

机构 * NAVER Cloud(NAVER云) Yonsei University(延世大学) KAIST AI(韩国科学技术院人工智能)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出基于LLM的多参考评估方法(LMRE),通过生成多个有效短语边界解决单参考评估的局限性,在韩语测试中与人类判断一致性更强。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏