arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2411.02455 2025-12-29 cs.CL cs.AI cs.CY 90%

An Exploration of Higher Education Course Evaluation by Large Language Models

大型语言模型在高等教育课程评估中的探索

Bo Yuan, Jiazi Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大型语言模型进行高等教育课程评估,发现微调和提示工程能显著提高评估准确性,LLM生成的反馈有助于教学改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18622 2025-12-23 cs.DB cs.AI cs.CL cs.HC cs.MA 90%

A Multi-agent Text2SQL Framework using Small Language Models and Execution Feedback

基于小型语言模型和执行反馈的多智能体文本到SQL框架

Thanh Dat Hoang, Thanh Trung Huynh, Matthias Weidlich, Thanh Tam Nguyen, Tong Chen, Hongzhi Yin, Quoc Viet Hung Nguyen

机构 * Griffith University (Australia)(格里菲斯大学) VinUniversity (Vietnam)(文大学) Humboldt-Universitat zu Berlin (Germany)(柏林洪堡大学) The University of Queensland, Australia (2025)(昆士兰大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title);LLM(abstract);large language model(abstract)

AI总结 MATS是一种针对小型语言模型的文本到SQL框架,通过多智能体机制和强化学习训练方案,在有限参数下实现与大规模LLM相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20915 2025-12-22 cs.CR cs.AI cs.LG 90%

ZKPROV: A Zero-Knowledge Approach to Dataset Provenance for Large Language Models

ZKPROV: 一种用于大语言模型数据溯源的零知识方法

Mina Namazi, Alexander Nemecek, Erman Ayday

机构 * Open University of Catalonia(加泰罗尼亚开放大学) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 ZKPROV通过零知识证明实现大语言模型的数据溯源验证,保障数据隐私与效率平衡,适用于医疗等敏感领域。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01329 2025-12-19 cs.CL cs.AI 90%

Evaluating Large Language Models in Crisis Detection: A Real-World Benchmark from Psychological Support Hotlines

评估大型语言模型在危机检测中的表现:来自心理支持热线的现实世界基准测试

Guifeng Deng, Shuyin Rao, Tianyu Lin, Anlu Dai, Pan Wang, Junyi Xie, Haidong Song, Ke Zhao, Dongwu Xu, Zhengdong Cheng, Tao Li, Haiteng Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PsyCrisisBench,通过评估540个标注转录文本,测试64种LLM在危机检测任务中的表现,发现LLM在自杀计划识别和风险评估中表现优异,但情绪状态识别仍具挑战性。

Comments Preprint. Submitted to IEEE Journal of Biomedical and Health Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11009 2025-12-16 cs.CL cs.AI 90%

SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth

SproutBench: 为青少年设计的安全和伦理大型语言模型基准

Wenpeng Xing, Lanyi Wei, Haixiao Hu, Jingyi Yu, Rongchang Li, Mohan Li, Changting Lin, Meng Han

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SproutBench通过1283个发展性对抗提示评估47种LLMs,揭示儿童安全漏洞,为青少年AI设计提供指导。

Comments Accepted in AAAI 2026 Workshop on AI for Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08945 2025-12-11 cs.CL cs.AI 90%

The Linguistic Architecture of Reflective Thought: Evaluation of a Large Language Model as a Tool to Isolate the Formal Structure of Mentalization

反思性思维的语言架构:评估一个大语言模型作为隔离心理化形式结构的工具

Stefano Epifani, Giuliano Castigliego, Laura Kecskemeti, Giuliano Razzicchia, Elisabeth Seiwald-Sonderegger

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大语言模型在再现心理化语言结构方面的能力,发现其在MBT轴线评估中表现出较高的一致性,但在整合内部状态和外部情境方面存在局限。

Comments 18 pages, 1 table, Project coordinator: Stefano Epifani

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04671 2025-12-09 cs.CL cs.LG q-bio.PE 90%

PhyloLM : Inferring the Phylogeny of Large Language Models and Predicting their Performances in Benchmarks

PhyloLM : 推断大语言模型的系统发育并预测其在基准测试中的性能

Nicolas Yax, Pierre-Yves Oudeyer, Stefano Palminteri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 PhyloLM通过系统发育算法推断大语言模型的系统发育关系并预测其在基准测试中的性能。

Comments The project code is available at https://github.com/Nicolas-Yax/PhyloLM . Published as https://iclr.cc/virtual/2025/poster/28195 at ICLR 2025. A code demo is available at https://colab.research.google.com/drive/1agNE52eUevgdJ3KL3ytv5Y9JBbfJRYqd

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03589 2025-12-08 cs.AI cs.CL cs.HC 90%

Human Evaluation of Procedural Knowledge Graph Extraction from Text with Large Language Models

利用大语言模型进行文本中过程知识图谱提取的人类评估

Valentina Anita Carriero, Antonia Azzini, Ilaria Baroni, Mario Scrocca, Irene Celino

机构 * Princeton University(普林斯顿大学) Springer Heidelberg(斯普林格海德堡) ABC Institute(ABC研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型和提示工程方法,从文本中提取过程知识并构建知识图谱,通过用户研究评估其质量和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18054 2025-12-04 cs.CL cs.LG 90%

Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large Language Model Datasets

Blu-WERP(网络内容提取与精炼流程):一种用于预处理大语言模型数据集的可扩展流程

Gowtham, Sai Rupesh, Sanjay Kumar, Saravanan, Venkata Chaithanya

机构 * BluBridge Research(BluBridge研究机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 Blu-WERP是一种用于提升大语言模型训练数据质量的高效预处理流程,通过优化Common Crawl WARC文件,显著提高了模型性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19361 2025-12-02 cs.CL cs.AI cs.SC cs.SD eess.AS 90%

SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models

SpeechIQ: 大型语言模型在语音理解中的跨认知层级语音智能商

Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi

机构 * Kyoto University(京都大学) NVIDIA Carnegie Mellon University(卡内基梅隆大学) Institute of Science Tokyo(东京科学研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SpeechIQ是一种基于语音的智能评估框架,通过三个认知层级评估大型语言模型在语音理解中的能力,提供统一的比较和识别标注错误与幻觉。

Comments ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20073 2025-12-02 cs.CL cs.AI cs.MA 90%

Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents

Collab-Overcooked: 大语言模型作为协作代理的基准测试与评估

Haochen Sun, Shuwen Zhang, Lujie Niu, Lei Ren, Hao Xu, Hao Fu, Fangkun Zhao, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Collab-Overcooked基准测试,评估大语言模型在协作代理中的表现,揭示其在目标解释和协作能力上的优劣。

Comments Accepted to EMNLP 2025 Main Conference. Camera-Ready Version. 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00290 2025-12-02 cs.CL cs.AI 90%

EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education

EduEval: 一个用于评估大语言模型在中文教育中表现的分层认知基准

Guoqing Ma, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Jiawei Shen, Zilong Li, Yidan Liang

机构 * Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 EduEval通过分层认知基准评估大语言模型在中文教育中的表现,揭示其在事实性任务与创造性任务上的差异,并发现开源模型在复杂教育推理上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01219 2025-11-27 cs.CL cs.AI 90%

Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset

通过概念学习数据集揭示大型语言模型中的隐性偏见

Leroy Z. Wang

机构 * UPLB(菲律宾大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文通过概念学习数据集揭示大型语言模型在量化词上的隐性偏见,并展示上下文概念学习在发现隐藏偏见中的有效性。

Comments Presented at EurIPS 2025 Workshop - Unifying Perspectives on Learning Biases (UPLB) https://sites.google.com/view/towards-a-unified-view

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10727 2025-11-25 cs.CL cs.AI 90%

Word-level Annotation of GDPR Transparency Compliance in Privacy Policies using Large Language Models

基于大型语言模型的GDPR透明性合规性隐私政策词级注释

Thomas Cory, Wolf Rieder, Julia Krämer, Philip Raschke, Patrick Herbke, Axel Küpper

机构 * Erasmus University Rotterdam(埃因霍温大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的隐私政策词级注释方法,用于评估GDPR透明性合规性,通过模块化管道和双层评估提升注释准确性。

Comments Accepted to Proceedings on Privacy Enhancing Technologies (PoPETs) 1 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12183 2025-11-25 cs.CL cs.LG 90%

Leveraging large language models for structured information extraction from pathology reports

利用大型语言模型从病理报告中提取结构化信息

Jeya Balaji Balasubramanian, Daniel Adams, Ioannis Roxanis, Amy Berrington de Gonzalez, Penny Coulson, Jonas S. Almeida, Montserrat García-Closas

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用大型语言模型从病理报告中提取结构化信息,通过对比人类标注员和多个LLM模型的准确性,展示了一种可定制、模块化的开源工具,提升病理数据的分析效率和互操作性。

Comments 29 pages, 6 figures

Journal ref J. Pathol. Inform. 19 (2025) 100521

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19492 2025-11-25 cs.CL cs.AI 90%

MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models

MedHalu:大型语言模型在医疗查询中生成幻觉的研究

Vibhor Agarwal, Yiqiao Jin, Mohit Chandra, Munmun De Choudhury, Srijan Kumar, Nishanth Sastry

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 MedHalu研究了LLM在医疗查询中生成幻觉的问题,提出MedHalu基准和MedHaluDetect框架,发现LLM在检测医学幻觉方面表现不佳,提出专家在环方法提升检测效果。

Comments Accepted at ICWSM2026. https://netsys.surrey.ac.uk/datasets/medhalu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04224 2025-11-24 cs.CL cs.AI cs.DL 90%

Fairness Evaluation of Large Language Models in Academic Library Reference Services

学术图书馆参考服务中大型语言模型的公平性评估

Haining Wang, Jason Clark, Yueru Yan, Star Bradley, Ruiyang Chen, Yiqiong Zhang, Hengyi Fu, Zuoyu Tian

机构 * Indiana University(印第安纳大学) Montana State University(蒙塔纳州立大学) Wuhan University(武汉大学) Guangdong University of Foreign Studies(广东外语外贸大学) San José State University(圣何塞州立大学) Macalester College(麦基尔学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在学术图书馆参考服务中对不同用户身份的公平性,发现其在种族和民族上无差异,但存在对女性的轻微刻板印象偏见,显示其在公平沟通方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13548 2025-11-18 cs.CR cs.AI cs.CL 90%

ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models

Siyang Cheng, Gaotian Liu, Rui Mei, Yilin Wang, Kejia Zhang, Kaishuo Wei, Yuqi Yu, Weiping Wen, Xiaojie Wu, Junhua Liu

机构 * iFLYTEK Security Laboratory(iFLYTEK安全实验室) Anhui SparkShield Intelligent Technology Co., Ltd.(安徽SparkShield智能科技有限公司) Peking University(北京大学) School of Automation, University of Electronic Science and Technology of China(电子科技大学自动化学院) Northwest University(西北大学) University of New South Wales(新南威尔士大学) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术处置协调中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10881 2025-11-17 cs.CL cs.AI 90%

A Multifaceted Analysis of Negative Bias in Large Language Models through the Lens of Parametric Knowledge

Jongyoon Song, Sangwon Yu, Sungroh Yoon

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted to IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01611 2025-11-14 cs.AI cs.CL 90%

PsychCounsel-Bench: Evaluating the Psychology Intelligence of Large Language Models

Min Zeng

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13839 2025-11-11 cs.CL cs.AI 90%

Meronymic Ontology Extraction via Large Language Models

Dekai Zhang, Simone Conia, Antonio Rago

机构 * Imperial College London(帝国理工学院伦敦分校) Sapienza University of Rome(罗马大学萨皮恩扎分校) King’s College London(伦敦国王学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15987 2025-11-11 cs.CL cs.AI 90%

Likelihood-based Mitigation of Evaluation Bias in Large Language Models

Masanari Oi, Masahiro Kaneko, Ryuto Koike, Mengsay Loem, Naoaki Okazaki

机构 * Tokyo Institute of Technology(东京技术大学) MBZUAI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 5 main pages

Journal ref ACL2024 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03641 2025-11-06 cs.CR cs.AI cs.CL cs.CY 90%

Watermarking Large Language Models in Europe: Interpreting the AI Act in Light of Technology

Thomas Souverain

机构 * Department of AI Ethics, CEA Paris-Saclay(人工智能伦理系,CEA巴黎萨克雷)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 2 Tables and 2 Pictures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02119 2025-11-05 cs.AI cs.CL 90%

InsurAgent: A Large Language Model-Empowered Agent for Simulating Individual Behavior in Purchasing Flood Insurance

Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng, Dan M. Frangopol, Minghui Cheng

机构 * University of Miami(迈阿密大学) Hunan University(湖南大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Lehigh University(莱斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19667 2025-11-04 cs.CL cs.AI 90%

Can Large Language Models Analyze Graphs like Professionals? A Benchmark, Datasets and Models

Xin Li, Weize Chen, Qizhi Chu, Haopeng Li, Zhaojun Sun, Ran Li, Chen Qian, Yiwei Wei, Zhiyuan Liu, Chuan Shi, Maosong Sun, Cheng Yang

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) College of Petroleum Engineering, China University of Petroleum (Beijing) at Karamay(中国石油大学(北京)克拉玛依校区石油工程学院) Institute for Artificial Intelligence, Tsinghua University(清华大学人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10455 2025-10-31 cs.CL cs.AI 90%

IDEA: Enhancing the Rule Learning Ability of Large Language Model Agent through Induction, Deduction, and Abduction

Kaiyu He, Mian Zhang, Shuo Yan, Peilin Wu, Zhiyu Zoey Chen

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系德克萨斯大学达拉斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26484 2025-10-31 cs.CL cs.AI 90%

Bayesian Network Fusion of Large Language Models for Sentiment Analysis

Rasoul Amirzadeh, Dhananjay Thiruvady, Fatemeh Shiri

机构 * School of Information Technology, Deakin University(德克萨斯大学信息技术学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算机技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02745 2025-10-30 cs.AI cs.CL 90%

CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models

Son The Nguyen, Niranjan Uma Naresh, Theja Tulabandhula

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01281 2025-10-29 cs.CL cs.AI 90%

Arena-Lite: Efficient and Reliable Large Language Model Evaluation via Tournament-Based Direct Comparisons

Seonil Son, Ju-Min Oh, Heegon Jin, Cheolhun Jang, Jeongbeom Jeong, Kuntae Kim

机构 * NC AI RLWRLD Inc.(RLWRLD公司) Samsung AI Research(三星人工智能研究所) Global AI Platform(全球人工智能平台) Samsung Life Insurance(三星人寿保险)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 8 pages for main body, 19 pages in total

Journal ref EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24013 2025-10-29 cs.AI cs.LG cs.NE math.CO math.OC 90%

Discovering Heuristics with Large Language Models (LLMs) for Mixed-Integer Programs: Single-Machine Scheduling

İbrahim Oğuz Çetinkaya, İ. Esra Büyüktahtakın, Parshin Shojaee, Chandan K. Reddy

机构 * Grado Department of Industrial and Systems Engineering, Virginia Tech, Blacksburg, VA(弗吉尼亚理工大学工业与系统工程系) Department of Computer Science, Virginia Tech, Arlington, VA(弗吉尼亚理工大学计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏