arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-01 至 2026-06-01 共收录 81 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 81 篇

2603.17145 2026-06-01 cs.LG cs.AI 94%

REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge

REAL: 面向LLM评判的回归感知强化学习

Yasi Zhang, Tianyu Chen, Mingyuan Zhou, Oscar Leong, Ying Nian Wu, Michal Lukasik

机构 * University of California, Los Angeles(加州大学洛杉矶分校) The University of Texas at Austin(得克萨斯大学奥斯汀分校) Google Research Now at Google DeepMind(谷歌研究 现在在谷歌深Mind)

专题命中 评测与基准 :LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出REAL框架,通过广义策略梯度将回归目标融入强化学习,优化LLM作为评分器的数值评估,在多个规模模型上超越SFT和标准RL方法。

Comments Accepted to ICML 2026. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12005 2026-06-01 cs.CL 93%

LaCy: What Small Language Models Can and Should Learn is Not Just a Question of Loss

LaCy: 小型语言模型能学且应学的不仅仅是损失问题

Szilvia Ujváry, Louis Béthune, Pierre Ablin, João Monteiro, Marco Cuturi, Michael Kirchhof

机构 * Apple(苹果公司) University of Cambridge(剑桥大学)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究在预训练中,小型语言模型(SLM)应学习哪些token以及应通过<CALL>委托哪些token,提出结合损失和事实性信号的LaCy方法,提升SLM在级联生成中的事实准确性。

Comments 40 pages, 26 figures, 10 tables, preprint. v3-v4: new results for RAG, ablations and additional analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30907 2026-06-01 cs.SE cs.AI cs.CL cs.LG 92%

BlueFin: Benchmarking LLM Agents on Financial Spreadsheets

BlueFin: 在金融电子表格上对LLM智能体进行基准测试

Srivatsa Kundurthy, Clara Na, Colton Moraine, Anoushka Mohta, Case Winter, George Fang, John Ling, Emma Strubell, Zach Kirshner

机构 * Longitude Labs Inc.(Longitude Labs公司) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BlueFin基准,通过131个真实金融电子表格任务评估LLM智能体的合成、操作和理解能力,并验证了LM评判与人类专家的一致性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30736 2026-06-01 cs.LG cs.AI cs.CL 92%

OrcaRouter: A Production-Oriented LLM Router with Hybrid Offline-Online Learning

OrcaRouter: 一种面向生产的混合离线-在线学习LLM路由器

Zhenghua Bao, Fengya Tian, Chris Zhang, Zhenjun Chen, Xile Ma, Yi Shi

机构 * Continuum AI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OrcaRouter,一种结合LinUCB上下文赌博机与混合离线-在线学习协议的生产级LLM路由器,通过离线全信息反馈和在线赌博机学习实现低成本高精度模型选择。

Comments 6 pages, 1 table. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30394 2026-06-01 cs.SE cs.AI 92%

CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models

CodeGolf Bench:评估大型语言模型简洁代码生成能力的多语言基准

Vedant Padwal

机构 * Independent(独立)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出CodeGolf Bench基准,基于代码高尔夫竞赛,在60种编程语言中评估LLM生成简洁高效代码的能力,实验表明推理模型显著优于非推理模型。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11972 2026-06-01 cs.CL 92%

Reassessing Extractive QA Datasets at Scale: LLM-as-a-Judge and In-Depth Analyses

重新评估大规模抽取式问答数据集:LLM作为评判者与深入分析

Xanh Ho, Jiahao Huang, Florian Boudin, Akiko Aizawa

机构 * National Institute of Informatics, Japan(日本国立信息研究所) The University of Tokyo, Japan(东京大学) Inria, LS2N, Nantes Université, France(法国Inria、LS2N、南特大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究系统性地使用LLM作为评判者评估四个抽取式问答数据集,发现其与人类评价的相关性远高于EM和F1,并分析了答案类型敏感性、提示变化和自偏好偏差等因素。

Comments GEM Workshop at ACL 2026; code and data are available at https://github.com/Alab-NII/llm-judge-extract-qa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31167 2026-06-01 cs.AI 92%

LLM-FACETS: A Privacy-Preserving Framework for Evaluating LLM Transparency and Accountability

LLM-FACETS:一个保护隐私的评估LLM透明度和问责制的框架

Tom Lucas, Alessio Buscemi, Alfredo Capozucca, German Castignani, Barbara Delacroix

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学与技术研究所) University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个开源框架LLM-FACETS,通过浏览器界面和插件架构,为技术专家、领域专家和合规官员提供隐私保护的LLM评估,实现透明度与问责制。

Comments Submitted to ACM Journal on Responsible Computing, Special Section: Collaborative Methods and Tools for Engineering and Evaluating Transparency in AI. 28 pages 9 figures, 7 tables, 1 algorithm. Source code: https://github.com/Scriptor-Group/AIMVi

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14583 2026-06-01 cs.AI 92%

LLM Bias Evaluation: Gender, Racial, and Age Disparities in Occupational and Crime Scenarios

LLM偏差评估:职业与犯罪场景中的性别、种族和年龄差异

Vishal Mirza, Rahul Kulkarni, Aakanksha Jadhav

机构 * New York University(纽约大学) Northeastern University(东北大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了2024年四大领先LLM在职业和犯罪场景中的性别、种族和年龄偏差,发现去偏努力常导致新的公平性权衡,即“去偏悖论”。

Comments Updated title and abstract to emphasize key findings on the debiasing paradox for improved discoverability. Content and findings unchanged. 11 pages, 17 figures, Accepted at IEEE Conference on Artificial Intelligence (IEEE CAI) 2025. Full Paper acceptance in the Vertical HUMAN-CENTERED AI category

Journal ref 2025 IEEE Conference on Artificial Intelligence (CAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30481 2026-06-01 cs.CL 91%

When English Rewrites Local Knowledge: Global Narrative Dominance in Large Language Models

当英语重写地方知识:大语言模型中的全球叙事主导

Md Arid Hasan, Ruwad Naswan, Farhan Samir, Sharifa Sultana, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) BUET(巴特利特大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究通过构建孟加拉语文化数据集CulturalNB,评估大语言模型在低资源文化背景下的跨语言知识一致性,发现英语提问会系统性地增加全球替代和制度框架,减少地方视角覆盖,表明文化失败不仅是知识缺失,更是根基和叙事优先级问题。

Comments Submitted to ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09873 2026-06-01 cs.SE 91%

Beyond Strict Rules: Assessing the Effectiveness of Large Language Models for Code Smell Detection

超越严格规则:评估大型语言模型在代码异味检测中的有效性

Saymon Souza, Amanda Santana, Eduardo Figueiredo, Igor Muzetti, João Eduardo Montandon, Lionel Briand

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本研究评估了四种大型语言模型(DeepSeek-R1、GPT-5 mini、Llama-3.3、Qwen2.5-Code)在30个Java项目中检测九种代码异味的效果,并提出了结合LLM与静态分析工具的检测策略,该策略在五个异味类型上F1分数优于单独使用LLM或工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00747 2026-06-01 cs.CL cs.AI 91%

Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training

将搜索与训练解耦:通过模型合并实现大规模语言模型预训练的数据混合缩放

Shengrui Li, Fei Zhao, Kaiyan Zhao, Jieying Ye, Haifeng Liu, Fangcheng Shi, Zheyong Xie, Yao Hu, Shaosheng Cao

机构 * NLP Team, Xiaohongshu Inc., Shanghai, China(小红书自然语言处理团队,小红书公司,上海,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出DeMix框架,通过模型合并预测最优数据配比,在降低搜索成本的同时提升基准性能。

Comments 18 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20784 2026-06-01 cs.CL cs.AI 91%

Towards Atoms of Large Language Models

迈向大型语言模型的原子

Chenhui Hu, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出原子理论,通过原子内积(AIP)定义、评估和识别大型语言模型的基本表示单元(原子),并证明在阈值激活稀疏自编码器(TSAE)下原子可识别,实验发现神经元和特征不满足理想原子标准,而通过匹配TSAE容量与数据规模可识别出近乎完美的原子。

Comments To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26942 2026-06-01 cs.AI cs.LO cs.SE 90%

Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

Paul Sigloch, Christoph Benzmüller

机构 * University of Bamberg(巴姆堡大学) Free University of Berlin(柏林自由大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种结合形式符号方法与神经语义分析的混合验证架构,用于检测LLM输出中的幻觉、不一致和隐私漏洞,在医疗设备损伤评估系统中实现83%的结构化实体幻觉检测率和72%的语义虚构检测率。

Comments Extended preprint version of accepted technical communication at KI 2026. 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00521 2026-06-01 cs.AI 90%

Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory

通过项目反应理论诊断LLM作为评判者的可靠性

Junhyuk Choi, Sohhyung Park, Chanhee Cho, Hyeonchu Park, Bugeun Kim

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Republic of Korea(Chung-Ang 大学人工智能系) Department of Industrial Engineering, Seoul National University, Seoul, Republic of Korea(首尔国立大学工业工程系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出基于项目反应理论(IRT)的两阶段诊断框架,通过内在一致性和人类对齐两个维度评估LLM作为评判者的可靠性,并提供可解释的诊断信号。

Comments Accepted ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10868 2026-06-01 cs.LG 90%

Go-UT-Bench: A Fine-Tuning Dataset for LLM-Based Unit Test Generation in Go

Go-UT-Bench:用于基于LLM的Go语言单元测试生成的微调数据集

Yashshi Pipalani, Hritik Raj, Rajat Ghosh, Vaishnavi Bhargava, Debojyoti Dutta

机构 * Nutanix

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 针对代码LLM训练数据不平衡问题,提出Go-UT-Bench数据集(5264对代码与单元测试),通过微调提升模型在Go语言单元测试生成任务上的性能,在超过75%的基准任务上优于基础模型。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30358 2026-06-01 cs.LG quant-ph 89%

QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits

QASM-Eval:用于训练和评估LLM在超越量子电路的OpenQASM-3上的数据集

Zhenxiao Fu, Lei Jiang, Fan Chen

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM在OpenQASM-3硬件级编程上的训练与评估空白,构建了包含专家验证测试集和训练集的数据集,覆盖经典逻辑、时序调度、脉冲控制等,并通过扩展验证器自动验证,实验表明微调后LLM性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21928 2026-06-01 cs.CL 89%

Evaluation of Automatic Speech Recognition Using Generative Large Language Models

使用生成式大语言模型评估自动语音识别

Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(瑞士联邦理工学院) Brno University of Technology(布拉格技术大学) Avignon University(阿维尼翁大学) Le Mans University(勒曼大学) Nantes University(南特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出利用生成式大语言模型通过假设选择、语义距离计算和错误分类三种方法评估ASR,在HATS数据集上达到92-94%的人类一致性,优于WER和语义指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28918 2026-06-01 cs.LG cs.AI cs.IR 89%

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL

当LLM奖励设计失败时:面向诊断的稀疏结构化RL改进

Youting Wang, Yuan Tang, Bowen Liu, Xuan Liu, Dingyan Shang

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 针对稀疏结构化强化学习任务,提出诊断驱动的迭代奖励函数改进方法,通过训练诊断和失败模式分类指导修正,显著提升MiniGrid任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30804 2026-06-01 cs.CL 89%

Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit

将LLM性别偏见锚定人类基线:跨语言审计

Jiwoo Choi, Seonwoo Ahn, Tongxin Zhang, Seohyon Jung

机构 * School of Digital Humanities and Computational Social Sciences, KAIST, South Korea(数字人文与计算社会科学学院,韩国韩国科学技术院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过HEXACO-100人格量表,跨英语、韩语、中文和日语审计六种大语言模型的性别刻板印象,发现其偏见幅度是人类跨国差异的2.5倍,并引入四模式框架(一致性、抑制、重组、放大)描述跨语言行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15778 2026-06-01 cs.CL 89%

*-PLUIE: Personalisable metric with Llm Used for Improved Evaluation

*-PLUIE:使用大语言模型改进评估的可个性化度量

Quentin Lemesle, Léane Jourdan, Daisy Munson, Pierre Alain, Jonathan Chevelu, Arnaud Delhay, Damien Lolive

机构 * Univ Rennes, CNRS, IRISA, EXPRESSION(里尔大学、法国国家科学研究中心、IRISA、EXPRESSION) Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学、南特中央理工学院、法国国家科学研究中心、LS2N、UMR 6004) Univ Rennes, CNRS, IRISA, SOTERN(里尔大学、法国国家科学研究中心、IRISA、SOTERN) Univ of South Brittany, CNRS, IRISA, ARCHIMEDIA(布列塔尼南部大学、法国国家科学研究中心、IRISA、ARCHIMEDIA)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(abstract);分类 cs.CL

AI总结 提出*-PLUIE,一种基于困惑度的可个性化LLM评判度量,通过任务特定提示变体实现与人类判断的更强相关性,同时保持低计算成本。

Comments Accepted at *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30018 2026-06-01 cs.CL cs.LG 88%

Latent Performance Profiling of Large Language Models

大型语言模型的潜在性能剖析

Tanmoy Chakraborty, Ayan Sengupta, Suparna Bhattacharya, Partha Pratim Chakrabarti, Amlan Chakrabarti, Supratik Chakraborty, Partha Pratim Das, Lipika Dey, Richa Singh, Mayank Vatsa

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(印度理工学院德里分校电子工程系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里分校人工智能学院) Hewlett Packard Enterprise, India(印度惠普企业公司) Department of Computer Science & Engineering, Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校计算机科学与工程系) A.K.Choudhury School of Information Technology, University of Calcutta, India(印度加尔各答大学信息科技学院) Department of Computer Science & Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Department of Computer Science, Ashoka University, India(阿什oka大学计算机科学系) Department of Computer Science & Engineering, Indian Institute of Technology Jodhpur(印度理工学院朱罗普分校计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出潜在性能剖析(LPP)框架,通过隐藏激活和输出分布提取任务无关的诊断指标,揭示模型内在特性,补充传统基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04661 2026-06-01 cs.CL cs.AI 88%

Beyond Memorization: Assessing Semantic Generalization in Large Language Models Using Phrasal Constructions

超越记忆:使用短语结构评估大型语言模型中的语义泛化

Wesley Scivetti, Melissa Torgbi, Austin Blodgett, Mollie Shichman, Taylor Hudson, Claire Bonial, Harish Tayyar Madabushi

机构 * Georgetown University(乔治城大学) University of Bath(巴斯大学) DEVCOM U.S. Army Research Laboratory(美国陆军研究实验室) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract_cn);pretraining(abstract)

AI总结 通过构式语法构建诊断评估,测试大型语言模型在低频但人类易理解的短语结构上的语义理解与泛化能力,发现模型在句法相同但语义不同的构式上性能下降超40%。

Comments Camera Ready: AACL-IJCNLP (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08964 2026-06-01 cs.LG cs.AI cs.CL cs.CY 88%

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

语言模型智能体中目标导向性的行为与表征评估

Raghu Arghal, Fade Chen, Niall Dalton, Evgenii Kortukov, Calum McNamara, Angelos Nalmpantis, Moksh Nirvaan, Gabriele Sarti, Mario Giulianelli

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) Indiana University, Bloomington(印第安纳大学,布卢明顿) Northeastern University(东北大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种结合行为评估与内部表征可解释性分析的目标导向性评估框架,并以LLM智能体在2D网格世界中的导航为例,验证了其行为与表征的一致性。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31251 2026-06-01 cs.CV cs.AI 88%

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Materials Science and Engineering(材料科学与工程学院) China Mobile Research Institute(中国移动研究院) College of Computing and Data Science(计算与数据科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出ERGeoBench基准,通过单视图、全景视图和具身视图三种渐进设置评估多模态大语言模型在视觉驱动的具身地理定位中的能力,发现当前模型在高层次地理语义推理上表现良好,但在细粒度感知、度量定位和视图间空间一致性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30803 2026-06-01 cs.AI 87%

PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges

PReMISE:作为LLM评判者测量规范的政策评分标准

Swastik Roy, Rajkumar Pujari, Tharindu Kumarage, Charith Peris, Rahul Gupta, Anna Rumshisky, Pradeep Natarajan, Venkatesh Saligrama

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PReMISE框架,从人类偏好数据中发现政策级评分标准集,并从结构充分性、可靠性、偏好拟合和对抗鲁棒性四个维度审计评分标准,通过偏好排名选择和可靠性约束修复操作提升评判准确性并降低可被利用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30568 2026-06-01 cs.CL 87%

Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge

生成与精炼动态评估准则用于LLM-as-a-Judge

Zijie Wang, Eduardo Blanco

机构 * University of Arizona(亚利桑那大学) Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出无需人工标注的自动生成细粒度评估准则方法,通过数据集级和实例级粒度生成,并利用元评判奖励信号迭代微调准则生成器,在成对和逐点评估中均超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22971 2026-06-01 cs.AI 84%

SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy

SPM-Bench:面向扫描探针显微镜的大型语言模型基准测试

Peiyao Xiao, Xiaogang Li, Xinyi Gao, Chengliang Xu, Ben Wang, Zichao Chen, Zeyu Wang, Lin Qu, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 提出SPM-Bench,一个全自动数据合成管道和严格评估指标(SIP-F1),用于测试LLMs在扫描探针显微镜领域的推理能力,并首次量化模型“个性”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13812 2026-06-01 cs.DB cs.AI cs.MA 84%

DTBench: A Synthetic Benchmark for Document-to-Table Extraction

DTBench:文档到表格提取的合成基准

Yuxiang Guo, Zhuoran Du, Nan Tang, Kezheng Tang, Congcong Ge, Yunjun Gao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science(香港科学与技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DTBench合成基准,通过反向Table2Doc范式和多智能体合成流程生成文档,系统评估LLM在文档到表格提取中的多种能力。

Comments KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19463 2026-06-01 cs.SE cs.AI 84%

Understanding the Fundamental Design Decisions of Retrieval-Augmented Generation Systems

理解检索增强生成系统的基本设计决策

Shengming Zhao, Yuchen Shao, Yuheng Huang, Jiayang Song, Zhijie Wang, Chengcheng Wan, Lei Ma

机构 * Fudan University(复旦大学) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) The University of Tokyo(东京大学) Macau University of Science and Technology(澳门科学理工学院) Concordia University(Concordia大学) University of Alberta(阿尔伯塔大学) The University of Tokyo, Japan(日本东京大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过系统实验,研究了RAG部署中的三个关键决策(是否部署、检索量、知识集成方式),揭示了任务和模型依赖的优化策略,为实践者提供基于证据的指导。

Journal ref ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31556 2026-06-01 cs.CV cs.AI cs.CL cs.CY cs.HC 84%

Vision-Language Models Suppress Female Representations Under Ambiguous Input

视觉-语言模型在模糊输入下抑制女性表征

Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji

机构 * School of Engineering and Applied Sciences(工程与应用科学系) Department of Psychology(心理学系)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过引入零样本度量LALS,发现视觉-语言模型在模糊输入下内部编码与输出存在系统性解耦,女性信号在生成前被抑制,揭示了模型对性别偏见的内部处理机制。

Comments 16 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏