arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-24 至 2026-02-24 共收录 82 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2602.18583 2026-02-24 cs.CL cs.AI cs.LG 91%

Luna-2: Scalable Single-Token Evaluation with Small Language Models

Luna-2:基于小语言模型的可扩展单令牌评估

Vatsal Goel, Rishon Dsouza, Nikhil Ega, Amey Ramesh Rambatla, Rob Friel, Shuai Shao, Yash Sheth

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17433 2026-02-24 cs.CY 90%

Preserving Historical Truth: Detecting Historical Revisionism in Large Language Models

守护历史真实:检测大语言模型中的历史修正主义

Francesco Ortu, Joeun Yook, Punya Syon Pandey, Keenan Samway, Bernhard Schölkopf, Alberto Cazzaniga, Rada Mihalcea, Zhijing Jin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 该研究提出HistoricalMisinfo数据集,用于评估大语言模型在面对历史修正主义请求时的鲁棒性及事实准确性。

Comments Accepted at IASEAI 2026, non-archival

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18935 2026-02-24 cs.DL cs.SE 89%

Responsible Intelligence in Practice: A Fairness Audit of Open Large Language Models for Library Reference Services

实践中的负责任智能:开放大型语言模型在图书馆参考服务中的公平性审计

Haining Wang, Jason Clark, Angelica Peña

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了三个开源大型语言模型在图书馆参考服务中的公平性,发现无显著种族差异,但存在轻微性别差异,强调持续监测的重要性。

Comments Invited chapter for the edited volume Artificial Intelligence and Social Justice Intersections in Library and Information Studies: Challenges and Opportunities (Emerald Group Publishing, in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19006 2026-02-24 cs.AI quant-ph 88%

Evaluating Large Language Models on Quantum Mechanics: A Comparative Study Across Diverse Models and Tasks

评估大型语言模型在量子力学中的表现:跨多样模型和任务的比较研究

S. K. Rithvik

机构 * Quantum Science and Technology Laboratory, Physical Research Laboratory, Navrangpura, Ahmedabad 380009, India(量子科学与技术实验室,物理研究实验室,Ahmedabad) Indian Institute of Technology Gandhinagar, Palaj, Gandhinagar 382055, India(印度理工学院冈达塞瓦尔)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了不同大型语言模型在量子力学问题上的表现,揭示了模型层级、任务难度及工具增强效果的差异,提供了可重复的基准和性能分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20137 2026-02-24 cs.CV 88%

Do Large Language Models Understand Data Visualization Rules?

大语言模型理解数据可视化规则吗?

Martin Sinnona, Valentin Bonas, Emmanuel Iarussi, Viviana Siless

机构 * Universidad Torcuato Di Tella(托科托迪特拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了大语言模型在数据可视化规则检测中的性能,发现其在基本规则上表现良好,但在复杂规则上存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20084 2026-02-24 cs.CV 88%

Do Large Language Models Understand Data Visualization Principles?

大语言模型理解数据可视化原则吗?

Martin Sinnona, Valentin Bonas, Viviana Siless, Emmanuel Iarussi

机构 * Universidad Torcuato Di Tella(托科托迪泰拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(阿根廷国家科学与技术研究院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文首次系统评估大语言模型和视觉-语言模型在推理数据可视化原则方面的能力,通过严格验证数据揭示了模型在检测和纠正可视化违规方面的表现及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19294 2026-02-24 cs.SE 88%

Towards Automated Page Object Generation for Web Testing using Large Language Models

基于大语言模型的网页测试用例自动生成方法

Betül Karagöz, Filippo Ricca, Matteo Biagiola, Andrea Stocco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了利用大语言模型自动生成网页测试用例页面对象的可行性,通过实证分析展示了其在准确性与元素识别率上的表现。

Comments In proceedings of the 19th IEEE International Conference on Software Testing, Verification and Validation 2026 (ICST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19073 2026-02-24 cs.CE 88%

Evaluation and Benchmarking Suite for Financial Large Language Models and Agents

金融大语言模型与代理的评估与基准测试套件

Shengyuan Lin, Kaiwen He, Jaisal Patel, Qinchuan Zhang, Chris Ding, James Tang, Keyi Wang, Yupeng Cao, Yan Wang, Kairong Xiao, Vincent Caldeira, Matt White, Xiao-Yang Liu Yanglet

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出了一套评估和基准测试套件,用于评估和比较金融大语言模型与代理,促进更稳健的FinAI生态系统。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18928 2026-02-24 cs.SE 88%

Narrowing the Complexity Gap in the Evaluation of Large Language Models

缩小大型语言模型评估中的复杂性差距

Yang Chen, Shuyang Liu, Reyhaneh Jabbarvand

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 GeneBench通过增加编程基准的复杂性,揭示了LLMs在真实世界任务中的表现下降,证明了其评估的挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11915 2026-02-24 cs.CL cs.AI cs.LG 87%

CORE: Measuring Multi-Agent LLM Interaction Quality under Game-Theoretic Pressures

CORE: 在博弈论压力下评估多智能体大语言模型交互质量

Punya Syon Pandey, Yongjin Yang, Jiarui Liu, Zhijing Jin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE通过量化多智能体LLM在不同博弈压力下的语言使用效果,揭示社会激励对语言适应的影响,并提供评估对话鲁棒性的指标。

Comments EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-02-24 cs.DB cs.AI cs.CL cs.SE 86%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19643 2026-02-24 cs.CL 85%

KGHaluBench: A Knowledge Graph-Based Hallucination Benchmark for Evaluating the Breadth and Depth of LLM Knowledge

KGHaluBench: 一种基于知识图谱的幻觉基准测试,用于评估大语言模型知识的广度和深度

Alex Robertson, Huizhi Liang, Mahbub Gani, Rohit Kumar, Srijith Rajamohan

机构 * School of Computing, Newcastle University(计算学院,新castle大学) Sage Ai, Sage Group PLC(Sage Ai,Sage集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 KGHaluBench通过基于知识图谱的基准测试,评估大语言模型在知识广度和深度上的表现,提供更全面的真相评估方法。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18891 2026-02-24 cs.CY cs.AI cs.HC 85%

Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation

协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究

Yuan An

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18479 2026-02-24 physics.chem-ph cs.AI cs.DL 85%

AgentCAT: An LLM Agent for Extracting and Analyzing Catalytic Reaction Data from Chemical Engineering Literature

AgentCAT: 一种用于从化学工程文献中提取和分析催化反应数据的LLM代理

Wei Yang, Zihao Liu, Tao Tan, Xiao Hu, Hong Xie, Lulu Li Xin Li, Jianyu Han, Defu Lian, Mao Ye

机构 * University of Science and Technology of China(科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) National Engineering Research Center of Lower-Carbon Catalysis Technology(低碳催化技术国家工程研究中心) Dalian Institute of Chemical Physics, Chinese Academy of Sciences(化学物理研究所,中国科学院) IFLYTEK CO.LTD(IFLYTEK有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentCAT是一种用于从化学工程文献中提取和分析催化反应数据的LLM代理,通过形式化抽象和挑战分析,解决了复杂依赖结构下的数据提取问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11962 2026-02-24 cs.HC cs.CY 85%

Wisdom of the LLM Crowd: A Large Scale Benchmark of Multi-Label U.S. Election-Related Harmful Social Media Content

LLM群体的智慧:多标签美国大选相关有害社交媒体内容的大规模基准测试

Qile Wang, Prerana Khatiwada, Carolina Coimbra Vieira, Benjamin E. Bagozzi, Kenneth E. Barner, Matthew Louis Mauriello

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过LLM群体智慧方法,构建了包含10万条美国大选相关有害社交媒体内容的多标签数据集,验证了LLM在分类任务中的有效性,并分析了人类标注者背景对标注行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19690 2026-02-24 cs.HC 85%

"The explanation makes sense": An Empirical Study on LLM Performance in News Classification and its Influence on Judgment in Human-AI Collaborative Annotation

『解释有道理』:一项关于LLM在新闻分类中的表现及其在人机协作标注中影响的实证研究

Qile Wang, Prerana Khatiwada, Avinash Chouhan, Ashrey Mahesh, Joy Mwaria, Duy Duc Tran, Kenneth E. Barner, Matthew Louis Mauriello

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM在新闻分类中的表现及其对人机协作标注的影响,发现详细解释能显著提高用户信心并影响决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01356 2026-02-24 cs.SE 85%

LAURA: Enhancing Code Review Generation with Context-Enriched Retrieval-Augmented LLM

LAURA: 通过上下文增强的检索增强大语言模型提升代码审查生成

Yuxin Zhang, Yuxia Zhang, Zeyu Sun, Yanjie Jiang, Hui Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 LAURA通过整合审查范例检索、上下文增强和系统引导,提升代码审查生成的准确性和质量。

Comments This arXiv submission is the author's accepted manuscript

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE), IEEE, 2025, pp. 2983-2995

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04891 2026-02-24 cs.CL cs.AI cs.LG 85%

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

SocialHarmBench: 揭示 LLM 对有害社会请求的脆弱性

Punya Syon Pandey, Hai Son Le, Devansh Bhardwaj, Rada Mihalcea, Zhijing Jin

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SocialHarmBench 通过 585 个提示揭示 LLM 在政治敏感场景中的脆弱性,揭示了模型在有害请求中的高风险表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21990 2026-02-24 cs.CV cs.SD 85%

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入

Changli Tang, Qinfan Xiao, Ke Mei, Tianyi Wang, Fengyun Rao, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13862 2026-02-24 physics.soc-ph 85%

Measuring Self-Rating Bias in LLM-Generated Survey Data: A Semantic Similarity Framework for Independent Scale Mapping

测量大语言模型生成调查数据中的自我评分偏差:一种基于语义相似性的独立量表映射框架

Eduardo Vera Pichardo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于语义相似性的框架,用于测量LLM生成调查数据中的自我评分偏差,通过解耦生成与量表映射提升数据准确性。

Comments 36 pages, 8 figures, 1 longtable appendix. Code/data: https://github.com/Lalitronico/ssr-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18230 2026-02-24 cs.LG cs.AI 84%

[Re] Benchmarking LLM Capabilities in Negotiation through Scoreable Games

通过可评分游戏评估大语言模型在谈判中的能力基准测试

Jorge Carrasco Pollo, Ioannis Kapetangeorgis, Joshua Rosenthal, John Hua Yao

机构 * Informatics Institute University of Amsterdam(信息学院阿姆斯特丹大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过可评分游戏评估大语言模型在谈判中的能力,发现基准复杂但模型比较存在歧义,强调上下文在评估中的重要性。

Comments Accepted for publication at Transactions on Machine Learning Research (TMLR) and MLRC Journal Track, 2025. Code available at: https://github.com/joshrosie/FACT29

Journal ref Transactions on Machine Learning Research (TMLR), June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19843 2026-02-24 cs.SE cs.AI 83%

MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems

MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估

Jin Jia, Zhiling Deng, Zhuangbin Chen, Yingqi Wang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03867 2026-02-24 cs.CL 83%

EuroGEST: Investigating gender stereotypes in multilingual language models

EuroGEST:研究多语言语言模型中的性别刻板印象

Jacqueline Rowe, Mateusz Klimaszewski, Liane Guillou, Shannon Vallor, Alexandra Birch

机构 * University of Edinburgh(爱丁堡大学) Warsaw University of Technology(华沙技术大学) Aveni

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EuroGEST研究多语言语言模型中的性别刻板印象,通过跨29种欧洲语言的数据集揭示了性别刻板印象的普遍性及模型对刻板印象的编码强度。

Comments In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 32074-32096, Suzhou, China. Association for Computational Linguistics. 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18693 2026-02-24 cs.CL 83%

Contradiction to Consensus: Dual Perspective, Multi Source Retrieval Based Claim Verification with Source Level Disagreement using LLM

与共识相悖:基于双视角、多源检索的声明验证系统,利用源级别分歧

Md Badsha Biswas, Ozlem Uzuner

机构 * George Mason University(乔治·梅奥大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出基于双视角多源检索和跨源分歧分析的声明验证系统,利用LLM提升验证准确性并揭示来源差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19177 2026-02-24 cs.CL cs.AI 82%

Next Reply Prediction X Dataset: Linguistic Discrepancies in Naively Generated Content

下一步回复预测X数据集:在粗心生成内容中的语言差异

Simon Münker, Nils Schwager, Kai Kugler, Michael Heseltine, Achim Rettinger

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出通过X数据集评估LLM生成内容与人类生成内容的语言差异,旨在提升计算社会科学研究的准确性。

Comments 8 pages (12 including references), 2 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 81%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18998 2026-02-24 cs.AI cs.CL 81%

Benchmark Test-Time Scaling of General LLM Agents

通用大语言模型代理的基准测试时间扩展

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Meta

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18613 2026-02-24 cs.LG cs.CL cs.IR 81%

Diagnosing LLM Reranker Behavior Under Fixed Evidence Pools

在固定证据池下诊断LLM重排序器行为

Baris Arat, Emre Sefer

机构 * Ozyegin University(奥济根大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过固定证据池诊断LLM重排序行为,发现不同模型在冗余和多样性上有显著差异,且LLM在小预算下表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24943 2026-02-24 cs.IR cs.AI cs.CL cs.LG 80%

RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment

RAIR:一种融合长尾和视觉显著子集的规则感知基准,用于电商相关性评估

Chenji Lu, Zhuo Chen, Hui Zhao, Zhenyi Wang, Pengjie Wang, Chuan Yu, Jian Xu

机构 * Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RAIR提出了一种融合长尾和视觉显著子集的规则感知基准,用于评估电商相关性,通过标准化框架和多子集数据提升模型评估的全面性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20059 2026-02-24 cs.AI 79%

Interaction Theater: A case of LLM Agents Interacting at Scale

交互戏剧:大规模LLM代理互动的案例

Sarath Shekkizhar, Adam Earle

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究发现大规模LLM智能体互动表面活跃但实质空洞,需设计协调机制以促进有效交流。

详情

展开后加载摘要…

URL PDF HTML 收藏