arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2308.04026 2023-08-09 cs.AI 89%

AgentSims: An Open-Source Sandbox for Large Language Model Evaluation

Jiaju Lin, Haoran Zhao, Aochi Zhang, Yiting Wu, Huqiuyue Ping, Qin Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments submit to EMNLP2023 demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03873 2023-08-09 cs.SE cs.LG 89%

Evaluating and Explaining Large Language Models for Code Using Syntactic Structures

David N Palacio, Alejandro Velasco, Daniel Rodriguez-Cardenas, Kevin Moran, Denys Poshyvanyk

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16180 2023-08-01 cs.CL 89%

Do LLMs Possess a Personality? Making the MBTI Test an Amazing Evaluation for Large Language Models

Keyu Pan, Yawen Zeng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14225 2023-07-27 cs.IR cs.LG 89%

Large Language Models are Competitive Near Cold-start Recommenders for Language- and Item-based Preferences

Scott Sanner, Krisztian Balog, Filip Radlinski, Ben Wedin, Lucas Dixon

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

Comments To appear at RecSys'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12966 2023-07-25 cs.CL 89%

Aligning Large Language Models with Human: A Survey

Yufei Wang, Wanjun Zhong, Liangyou Li, Fei Mi, Xingshan Zeng, Wenyong Huang, Lifeng Shang, Xin Jiang, Qun Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12573 2023-07-25 cs.CL 89%

Tachikuma: Understading Complex Interactions with Multi-Character and Novel Objects by Large Language Models

Yuanzhi Liang, Linchao Zhu, Yi Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Preliminary version of an ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08974 2023-07-19 cs.AI cs.CY 89%

Development of the ChatGPT, Generative Artificial Intelligence and Natural Large Language Models for Accountable Reporting and Use (CANGARU) Guidelines

Giovanni E. Cacciamani, Michael B. Eppler, Conner Ganjavi, Asli Pekan, Brett Biedermann, Gary S. Collins, Inderbir S. Gill

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 20 pages, 1 figure, protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14520 2023-06-02 cs.CL 89%

Large Language Models Are State-of-the-Art Evaluators of Translation Quality

Tom Kocmi, Christian Federmann

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted in EAMT, 10 pages, 8 tables, one figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17701 2023-05-31 cs.CL 89%

KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large Language Model Application

Hwaran Lee, Seokhee Hong, Joonsuk Park, Takyoung Kim, Gunhee Kim, Jung-Woo Ha

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 17 pages, 8 figures, 12 tables, ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18099 2023-05-30 cs.CL cs.CY 89%

Writing user personas with Large Language Models: Testing phase 6 of a Thematic Analysis of semi-structured interviews

Stefano De Paoli

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01820 2023-05-30 cs.IR cs.AI 89%

InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval

Vitor Jeronymo, Luiz Bonifacio, Hugo Abonizio, Marzieh Fadaee, Roberto Lotufo, Jakub Zavrel, Rodrigo Nogueira

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14857 2023-05-25 cs.CL 89%

BUFFET: Benchmarking Large Language Models for Few-shot Cross-lingual Transfer

Akari Asai, Sneha Kudugunta, Xinyan Velocity Yu, Terra Blevins, Hila Gonen, Machel Reid, Yulia Tsvetkov, Sebastian Ruder, Hannaneh Hajishirzi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments The data and code is available at https://buffetfs.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03245 2023-05-24 cs.CL 89%

Large language models effectively leverage document-level context for literary translation, but critical errors persist

Marzena Karpinska, Mohit Iyyer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments preprint (31 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12586 2023-05-23 cs.CL 89%

Enhancing Few-shot Text-to-SQL Capabilities of Large Language Models: A Study on Prompt Design Strategies

Linyong Nan, Yilun Zhao, Weijin Zou, Narutatsu Ri, Jaesung Tae, Ellen Zhang, Arman Cohan, Dragomir Radev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01937 2023-05-04 cs.CL cs.HC 89%

Can Large Language Models Be an Alternative to Human Evaluations?

Cheng-Han Chiang, Hung-yi Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments ACL 2023 main conference paper. Main content: 10 pages (including limitations). Appendix: 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10423 2023-04-21 cs.SE cs.AI cs.NE 89%

Fully Autonomous Programming with Large Language Models

Vadim Liventsev, Anastasiia Grishina, Aki Härmä, Leon Moonen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted for publication in the Genetic and Evolutionary Computation Conference (GECCO 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.18116 2023-04-03 cs.CL stat.CO 89%

Pair Programming with Large Language Models for Sampling and Estimation of Copulas

Jan Górecki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14742 2023-03-28 cs.CL 89%

Exploring the Impact of Instruction Data Scaling on Large Language Models: An Empirical Study on Real-World Use Cases

Yunjie Ji, Yong Deng, Yan Gong, Yiping Peng, Qiang Niu, Lei Zhang, Baochang Ma, Xiangang Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08037 2023-02-14 cs.CL 89%

Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models

Bernd Bohnet, Vinh Q. Tran, Pat Verga, Roee Aharoni, Daniel Andor, Livio Baldini Soares, Massimiliano Ciaramita, Jacob Eisenstein, Kuzman Ganchev, Jonathan Herzig, Kai Hui, Tom Kwiatkowski, Ji Ma, Jianmo Ni, Lierni Sestorain Saralegui, Tal Schuster, William W. Cohen, Michael Collins, Dipanjan Das, Donald Metzler, Slav Petrov, Kellie Webster

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12004 2023-01-31 cs.CL 89%

Understanding the Effectiveness of Very Large Language Models on Dialog Evaluation

Jessica Huynh, Cathy Jiao, Prakhar Gupta, Shikib Mehri, Payal Bajaj, Vishrav Chaudhary, Maxine Eskenazi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted for publication at IWSDS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10815 2022-12-22 cs.CL 89%

ZEROTOP: Zero-Shot Task-Oriented Semantic Parsing using Large Language Models

Dheeraj Mekala, Jason Wolfe, Subhro Roy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02506 2022-10-07 cs.CL cs.SE 89%

Large Language Models are Pretty Good Zero-Shot Video Game Bug Detectors

Mohammad Reza Taesiri, Finlay Macklon, Yihe Wang, Hengshuo Shen, Cor-Paul Bezemer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15093 2022-10-03 cs.CL 89%

Unpacking Large Language Models with Conceptual Consistency

Pritish Sahu, Michael Cogswell, Yunye Gong, Ajay Divakaran

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.14157 2022-07-29 cs.SE cs.AI 89%

A Hazard Analysis Framework for Code Synthesis Large Language Models

Heidy Khlaaf, Pamela Mishkin, Joshua Achiam, Gretchen Krueger, Miles Brundage

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08946 2026-05-27 cs.CY 89%

Authorship Attribution in the Era of LLMs: Problems, Methodologies, and Challenges

LLM时代的作者身份归属:问题、方法与挑战

Baixiang Huang, Canyu Chen, Kai Shu

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文系统综述了LLM时代作者身份归属的四个代表性问题和挑战,包括人类文本归属、LLM生成文本检测、LLM生成文本归属以及人机合著文本归属,并探讨了泛化性和可解释性等关键问题。

Comments ACM SIGKDD Exploration. 12 pages. Additional resources, including a regularly updated list of related papers, and LLM-generated text detectors, are available at https://llm-authorship.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13166 2026-04-14 quant-ph cs.AI cs.CL cs.LG 89%

Large Language Models Can Help Mitigate Barren Plateaus in Quantum Neural Networks

大型语言模型有助于缓解量子神经网络中的 barren plateaus

Jun Zhuang, Chaowen Guan

机构 * Boise State University(博伊西州立大学) University of Cincinnati(辛辛那提大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

AI总结 本文提出AdaInit框架,利用具有亚鞅性质的大语言模型迭代合成量子神经网络的初始参数,以维持梯度方差,缓解 barren plateaus 问题。

Comments [ACL'26 Findings] TL;DR: We propose a new LLM-driven submartingale-based framework that adaptively generates effective initial parameters for quantum neural networks to mitigate barren plateaus by leveraging LLMs with the submartingale property

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04024 2025-06-03 eess.IV cs.CV 89%

Enhancing chest X-ray datasets with privacy-preserving large language models and multi-type annotations: a data-driven approach for improved classification

Ricardo Bigolin Lanfredi, Pritam Mukherjee, Ronald Summers

机构 * Imaging Biomarkers and Computer-Aided Diagnosis Laboratory, Department of Radiology and Imaging Sciences, National Institutes of Health Clinical Center(影像生物标志物与计算机辅助诊断实验室,放射学与成像科学系,国家卫生研究院临床中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments)

Comments Code and data: https://github.com/rsummers11/CADLab/tree/master/MAPLEZ_LLM_report_labeler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05297 2024-06-06 cs.CL cs.AI cs.LG 89%

Challenging the Validity of Personality Tests for Large Language Models

Tom Sühr, Florian E. Dorner, Samira Samadi, Augustin Kelava

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments A less extensive and shorter version of this work has been accepted at Socially Responsible Language Modelling Research (SoLaR) 2023 Workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15159 2024-05-31 cs.CL cs.AI cs.CR cs.LG 89%

Machine Unlearning of Pre-trained Large Language Models

Jin Yao, Eli Chien, Minxin Du, Xinyao Niu, Tianhao Wang, Zezhou Cheng, Xiang Yue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

Comments ACL 2024 main. Code and data at https://github.com/yaojin17/Unlearning_LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 89%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏