arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2608.07378 2026-08-10 eess.AS cs.AI cs.LG 新提交 92%

LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening

LSEAD:一种基于大语言模型(LLM)的隐私保护型语音分析框架,用于阿尔茨海默病(AD)早期筛查

Xin Wang, Yingchao Huang, Yuhan Su, Shanshan Yao, Wei Peng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于开源LLM的隐私保护语音分析框架LSEAD,在ADReSS系列数据集上使AD分类准确率提升最多5个百分点,为早期AD筛查提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05726 2026-08-10 cs.CL cs.AI 交叉投稿 92%

Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation

通过随机数生成缓解作为评判者的大语言模型(LLM-as-a-Judge)中的评分偏差

Yuma Asato, Kiyoaki Shirai, Natthawut Kertkeidkachorn

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM-as-a-Judge的评分偏差问题,提出通过随机数生成识别并校正LLM潜在数字偏差的方法,在四项任务上的表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22148 2026-08-10 cs.AI cs.CL 版本更新 92%

Ratchet: How Reliable Must an LLM Judge Be to Retire a Skill?

Ratchet:一种最小化卫生的自演化LLM代理技能库

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) HSBC Holdings Plc.(汇丰控股有限公司) HSBC Technology Center, China(汇丰技术中心,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Ratchet,一种单代理循环,使冻结的LLM能够自行编写、检索、整理和淘汰其自然语言技能,通过整合四个卫生机制提升技能库的生命周期管理,从而在MBPP+ hard-100数据集上显著提升性能。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04240 2026-08-06 cs.CL cs.AI 新提交 92%

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

棋盘上的幻觉:工具增强型大语言模型(LLM)象棋评论评估

S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) Sentient Labs University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ACT-Eval框架,评估工具增强型LLM的象棋评论,发现事实幻觉普遍存在,工具可提升事实正确性但战略战术覆盖度仍有限。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15416 2026-08-04 cs.LG cs.AI 版本更新 92%

Margin-Adaptive Confidence Ranking for Reliable LLM Judgement

基于边际的置信度排名用于可靠的LLM判断

Gaojie Jin, Yong Tao, Lijia Yu, Tianjin Huang

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于边际的置信度排名方法,通过学习专用置信度估计器,改进LLM在人类判断一致性上的表现,通过模拟标注者多样性与边际排名公式,显式建模LLM区分人类一致与不一致案例的置信度,并推导出通用性保证。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27155 2026-07-30 cs.AI cs.CL cs.HC 新提交 92%

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

OmegaUse-OfficeVal:基于经济基准的长周期办公套件任务LLM智能体评测基准

Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OmegaUse-OfficeVal是带经济基准的长周期办公套件任务LLM智能体评测基准,含100项任务,评测发现前沿LLM成本低速度快但质量未达人类水平,代码与数据集已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22766 2026-07-28 cs.LG cs.AI 新提交 92%

Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

超越夏普利值:用于大语言模型对齐和评估的基于影响的数据审核管道

Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(title,summary_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型数据质量问题,引入可扩展的基于影响的数据审核管道,通过映射语义邻域到有向图,利用参考LLM概率分布评估数据效用,转换为局部优势指标,有效清理数据集,揭示基准漏洞,确保数据完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09843 2026-07-08 cs.HC cs.AI cs.CL 新提交 92%

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models

一个原生LLM的心理测量工具不能预测LLM行为:来自25个模型的证据

Juan Manuel Contreras

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过探索性因子分析从LLM行为中构建心理测量工具,发现LLM的自我报告与观察行为无关,揭示自我报告与人类判断之间的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30919 2026-07-07 cs.LG cs.AI 版本更新 92%

De-attribute to Forget for LLM Unlearning

De-attribute to Forget for LLM Unlearning

Xinyang Lu, Jiabao Pan, Rachael Hwee Ling Sim, See-Kiong Ng, Anthony Kum Hoe Tung, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于数据归因奖励的LLM遗忘框架DareU,通过强化学习降低生成响应与遗忘数据的归因分数,实现有效遗忘并平衡模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11354 2026-07-01 cs.AI cs.CL 版本更新 92%

ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences

ReplicatorBench:用于社会科学和行为科学中可复制性评估的LLM代理基准测试

Bang Nguyen, Dominik Soós, Qian Ma, Rochana R. Obadage, Zack Ranjan, Sai Koneru, Timothy M. Errington, Shakhlo Nematova, Sarah Rajtmajer, Jian Wu, Meng Jiang

机构 * University of Notre Dame(圣母大学) Old Dominion University(老道明大学) Pennsylvania State University(宾夕法尼亚州立大学) Independent Researcher(独立研究员) Uppsala University(乌普萨拉大学) Center for Open Science(开放科学中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReplicatorBench,一个端到端的基准测试,用于评估AI代理在可复制性研究中的能力,涵盖数据提取、实验设计与结果解释三个阶段,并开发了ReplicatorAgent框架以评估不同LLM和编程语言的性能。

Comments Accepted to KDD 2026 AI4Sciences Track, Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10109 2026-06-30 cs.AI cs.HC cs.LG 92%

LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals

基于自我报告的LLM代理能够实现通用个体模拟

Joon Sung Park, Carolyn Q. Zou, Jonne Kamphorst, Niles Egan, Aaron Shaw, Benjamin Mako Hill, Carrie Cai, Meredith Ringel Morris, Percy Liang, Robb Willer, Michael S. Bernstein

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Department of Communication Studies, Northwestern University(西北大学传播学系) Department of Communication, University of Washington(华盛顿大学传播学系) Google DeepMind(谷歌DeepMind) Department of Sociology, Stanford University(斯坦福大学社会学系) Sciences Po(巴黎政治学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于自我报告数据的LLM代理在模拟个体行为方面的有效性,通过不同数据源构建代理并验证其在多种任务中的准确性和跨群体公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27009 2026-06-26 cs.AI cs.LG cs.MA 新提交 92%

Semantic Early-Stopping for Iterative LLM Agent Loops

迭代式LLM智能体循环的语义早停

Sahil Shrivastava

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体LLM循环中固定迭代次数终止的低效问题,提出基于语义相似度和质量评估的早停机制,理论证明终止确定性,实验表明无质量门控的语义早停在HotpotQA上节省38%操作token且性能持平。

Comments 7 pages, 5 figures, 4 tables. Open implementation, machine-checked theory, and reproducible harness: github.com/SahilShrivastava-Dev/semantic-halting-problem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25750 2026-06-25 cs.CR cs.CL cs.LG 新提交 92%

RAS: Measuring LLM Safety Through Refusal Alignment

RAS: 通过拒绝对齐衡量LLM安全性

Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University Hon Hai Research Institute

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出白盒评估方法SafeVec,通过内部表示而非生成答案衡量LLM安全性,计算拒绝对齐分数RAS,实现快速、校准的安全评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25665 2026-06-23 cs.CL cs.AI cs.DL cs.IR 版本更新 92%

LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation

LLM-ReSum: 一个通过自我评估实现LLM反思性总结的框架

Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Haihua Chen, Junhua Ding

机构 * dept. of Information Science University of North Texas Denton, Texas, USA(信息科学系 俄克拉荷马州立大学 丹顿 俄克拉荷马州 美国) dept. of Data Science University of North Texas Denton, Texas, USA(数据科学系 俄克拉荷马州立大学 丹顿 俄克拉荷马州 美国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-ReSum框架,通过整合LLM评估与生成,提升低质量摘要的事实准确性与覆盖率,引入新的法律文档摘要基准PatentSumEval。

Comments This paper has been accepted as an invited paper for publication in Proceedings of The 12th IEEE International Conference on Big Data Computing Service and Machine Learning Applications. This is the accepted manuscript. The final authenticated version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19714 2026-06-19 stat.ML cs.AI cs.LG stat.CO stat.ME 新提交 92%

AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing

AURA: 用于LLM作为评判审计的自适应不确定性感知精炼

Zilong Zhang, Yi-Ting Hung, Weiyi He, Junxi Zhang, Lei Ding, Chi-Kuang Yeh

机构 * Department of Mathematics and Statistics(数学与统计学系) Georgia State University(佐治亚州立大学) Department of Probability and Statistics(概率与统计学系) Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学) Concordia University(Concordia 大学) Department of Statistics(统计学系) University of Manitoba(曼尼托巴大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出AURA框架,通过自适应不确定性感知精炼,在少量人工验证下迭代学习人类一致性信号,优先审核不确定比较,提升LLM评判的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19376 2026-06-19 cs.LG cs.AI cs.IR 新提交 92%

Cost-Optimal LLM Routing with Limited User Feedback under User Satisfaction Guarantees

在用户满意度保证下基于有限用户反馈的成本最优LLM路由

Herbert Woisetschläger, Arastun Mammadli, Ryan Zhang, Shiqiang Wang

机构 * Technical University of Munich(慕尼黑工业大学) University of Exeter(埃克塞特大学) Horace Greeley High School(霍勒斯格里利高中)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM推理成本与服务质量之间的矛盾,提出SLARouter在线路由算法,利用稀疏单侧用户反馈学习成本最优策略,理论保证成本最优和SLA合规,实验显示成本降低高达2.2倍。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00802 2026-06-18 cs.SE cs.CL cs.LG 版本更新 92%

GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents

GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化

Jie JW Wu, Ayanda Patrick Herlihy, Ahmad Saleem Mirza, Ali Afoud, Fatemeh Fard

机构 * Michigan Technological University, Houghton(密歇根技术大学) Birmingham City University(伯明翰城市大学) University of British Columbia, Kelowna(不列颠哥伦比亚大学, 肯洛纳)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GrowthHacker基准,利用LLM代理自动迭代修改代码以优化离线策略评估(OPE)实现,在Open Bandit Pipeline和Scope-RL上评估多种框架,证明基于LLM的代理可作为自动增长黑客持续改进OPE系统。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16368 2026-06-16 cs.CL cs.LG 新提交 92%

Evaluating LLM Personalization via Semantic Constraint Verification

通过语义约束验证评估LLM个性化

Xuran Li, Guanqin Zhang, Imran Razzak, Hakim Hacid, Eleanna Kafeza, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Technology Innovation Institute(技术创新研究所) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出NLICV框架,利用自然语言推理模型将句子映射到真值条件集,验证个性化约束,将LLM行为分为四类,与人类标注高度一致,并大幅降低延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16206 2026-06-16 cs.AI cs.CL cs.CY cs.HC 新提交 92%

Measuring Whether LLM Tutors Teach or Solve: A Diagnostic for Educational Impact

衡量LLM导师是教学还是解题:教育影响的诊断方法

Junyi Yao, Zihao Zheng, Baichuan Li

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Department of Operations Research and Engineering Management, Southern Methodist University(南卫理公会大学运筹学与工程管理系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM作为教育导师时解题能力不等于教学支持的问题,提出基于解题导向与教学导向基准性能差距的诊断方法,通过MathTutorBench分析表明两者仅部分对齐,建议分开报告评分并明确保护学生能动性的标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16902 2026-06-16 cs.AI cs.LG 版本更新 92%

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

LLM-WikiRace 基准测试:大语言模型在真实知识图谱上的规划能力有多强?

Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University of Oxford, UK(牛津大学,英国) University College London (Centre for AI), UK(伦敦大学学院(人工智能中心),英国) University of Basel, Switzerland(巴塞尔大学,瑞士)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出 LLM-Wikirace 基准,通过维基百科超链接导航任务评估大语言模型的规划、推理与世界知识,发现模型在简单任务上超人类,但困难任务成功率仅 23%,且规划与长程推理是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13735 2026-06-15 cs.AR cs.AI cs.LG cs.PL 新提交 92%

VHDLSuite: Unified Pipeline for LLM VHDL Generation with Data Synthesis and Evaluation

VHDLSuite:面向LLM VHDL生成的统一流水线,包含数据合成与评估

Yijun Shen, Minghao Shao, Yichen Zhao, Zhuoyan Yu, Boyuan Chen, Yik-Cheung Tam, Muhammad Shafique

机构 * Center for Data Science, NYU Shanghai, China(纽约市立大学上海分校数据科学中心) NYU Tandon School of Engineering, USA(纽约大学Tandon工程学院) NYU Abu Dhabi, UAE(纽约大学阿布扎比分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出VHDLSuite基础设施,通过自动基准合成、可执行验证和多模型诊断分析,解决LLM在VHDL生成评估中的不足,并构建含200+问题的VHDLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12117 2026-06-11 cs.CL cs.AI 新提交 92%

Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation

软提示调优用于公平且高效的LLM基准评估

Selen Erkan, Bastian Boll, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu

机构 * Aleph Alpha Research Lab(Aleph Alpha 研究实验室) TU Darmstadt(达姆施塔特工业大学) Hessian.AI(黑森人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出软提示调优方法,通过优化少量软提示向量使基础模型适应基准格式,公平评估其真实知识,效率高且无需完整后训练。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17717 2026-06-11 cs.AI cs.LG 版本更新 92%

A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data

评估LLM生成数据的质量与可信度综述

Kaituo Zhang, Mingzhi Hu, Hoang Anh Duy Le, Fariha Kabir Torsha, Zhimeng Jiang, Minh Khai Bui, Chia-Yuan Chang, Yu-Neng Chuang, Zhen Xiong, Ying Lin, Guanchu Wang, Na Zou

机构 * University of Houston(德克萨斯大学休斯敦分校) Worcester Polytechnic Institute(沃思利理工学院) Rice University(里德大学) Texas A&M University(德克萨斯农工大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Southern California(南加州大学) University of North Carolina at Charlotte(北卡罗来纳州立大学夏洛特分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LLM数据审计框架,从质量和可信度两个维度系统分类评估指标,分析六种模态数据生成方法的评估缺陷并给出改进建议。

Comments Published at TMLR. Title changed in the final version

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08400 2026-06-09 cs.SE cs.AI cs.CL 新提交 92%

Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

历史与模型对LLM评分的影响:高级软件工程课程研究

Qilin Zhou, Zhuo Wang, Yue Li, W. K. Chan

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对研究生阅读报告评分负担重的问题,提出人机协同的LLM辅助评分流程,基于180份作业评估Grok和GPT的评分一致性与人类对齐,发现交互历史导致评分标准漂移,需特定操作缓解不公平。

Comments 5 pages, accepted by ISET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06614 2026-06-08 cs.CL cs.AI cs.HC 新提交 92%

Re-Centering Humans in LLM Personalization

重新将人类置于LLM个性化中心

Lechen Zhang, Jiarui Liu, Tal August

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM个性化在合成数据与人类数据上的性能差距,通过收集人类对话和判断揭示系统在属性提取、相关属性配对和个性化响应生成阶段的局限性,并引入轻量级训练干预以缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05751 2026-06-08 cs.CL cs.AI 版本更新 92%

Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns

分析LLM生成文本中说服性语言的差异:揭示刻板的性别模式

Amalie Brogaard Pauli, Maria Barrett, Max Müller-Eberstein, Isabelle Augenstein, Ira Assent

机构 * Department of Computer Science, Aarhus University(阿arhus大学计算机科学系) AMD Silo AI University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根IT大学) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出框架评估LLM生成说服性语言时受接收者性别、发送者意图和输出语言的影响,发现所有模型均存在显著的性别差异,反映性别刻板印象的语言倾向。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06235 2026-06-05 cs.LG cs.AI 92%

Design a Reliable LLM-Integrated Interface for Mortality Forecasting

设计一个可靠的LLM集成接口用于死亡率预测

Thi Kim Ngan Nguyen

机构 * Curtin University(Curtin大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一个结合大语言模型(LLM)的接口,通过自然语言输入驱动确定性预测流程,在保持统计精度的同时提升非专家用户的可及性。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05180 2026-06-05 cs.CL cs.AI 92%

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

从评分到解释:评估基于量规的教学质量评估中的SHAP和LLM理由

Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Lund University(吕勒奥大学) University of Tübingen(图宾根大学) Stanford Graduate School of Education(斯坦福大学教育研究生院) Harvard Graduate School of Education(哈佛大学教育研究生院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个结合SHAP和LLM理由的框架,用于基于量规的评分模型的可解释性,并在课堂转录数据上评估其忠实性和可迁移性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01400 2026-06-02 cs.CL cs.AI 92%

Consistent and Distinctive: LLM Benchmark Efficiency via Maximum Independent Set Prompt Selection on Similarity Graphs

一致且独特:基于相似图最大独立集提示选择的LLM基准测试效率

Denica Kjorvezir, Marko Djukanović, Ana Gjorgjevikj, Gjorgjina Cenikj, Tome Eftimov

机构 * Computer Systems Department, Jožef Stefan Institute, Ljubljana, Slovenia(计算机系统部,乔塞夫·斯塔芬研究所,卢布尔雅那,斯洛文尼亚) Jožef Stefan International Postgraduate School, Ljubljana, Slovenia(乔塞夫·斯塔芬国际研究生学院,卢布尔雅那,斯洛文尼亚) Center for Astrophysics and Cosmology, University of Nova Gorica, Nova Gorica, Slovenia(天体物理与宇宙学中心,诺瓦戈里察大学,诺瓦戈里察,斯洛文尼亚)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于相似图最大独立集的提示选择框架,通过选择多样且非冗余的子集,在保持LLM排名一致性的同时显著减少基准测试成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21140 2026-06-02 cs.LG cs.CL stat.AP stat.ML 92%

How to Correctly Report LLM-as-a-Judge Evaluations

如何正确报告LLM作为评估者的评估结果

Chungpa Lee, Thomas Zeng, Jongwon Jeong, Jy-yong Sohn, Kangwook Lee

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM作为评估者时存在偏差的问题,提出一种插件式校正框架,实现无偏估计和统计原理的不确定性量化,并证明在分布偏移下仍保持无偏性。

Journal ref International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏