arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2403.11858 2024-03-19 cs.CL 89%

GPT-4 as Evaluator: Evaluating Large Language Models on Pest Management in Agriculture

Shanglong Yang, Zhipeng Yuan, Shunbao Li, Ruoling Peng, Kang Liu, Po Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08937 2024-03-19 cs.SE cs.AI 89%

Bugs in Large Language Models Generated Code: An Empirical Study

Florian Tambon, Arghavan Moradi Dakhel, Amin Nikanjam, Foutse Khomh, Michel C. Desmarais, Giuliano Antoniol

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 47 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07872 2024-03-13 cs.CL 89%

Rethinking Generative Large Language Model Evaluation for Semantic Comprehension

Fangyun Wei, Xi Chen, Lin Luo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02742 2024-03-06 cs.CL 89%

Towards Training A Chinese Large Language Model for Anesthesiology

Zhonghai Wang, Jie Jiang, Yibing Zhan, Bohao Zhou, Yanhong Li, Chong Zhang, Liang Ding, Hua Jin, Jun Peng, Xu Lin, Weifeng Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02613 2024-03-06 cs.HC cs.AI 89%

Large Language Models and Video Games: A Preliminary Scoping Review

Penny Sweetser

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17733 2024-02-28 cs.CL 89%

Tower: An Open Multilingual Large Language Model for Translation-Related Tasks

Duarte M. Alves, José Pombal, Nuno M. Guerreiro, Pedro H. Martins, João Alves, Amin Farajian, Ben Peters, Ricardo Rei, Patrick Fernandes, Sweta Agrawal, Pierre Colombo, José G. C. de Souza, André F. T. Martins

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17505 2024-02-28 cs.IR cs.CL 89%

BASES: Large-scale Web Search User Simulation with Large Language Model based Agents

Ruiyang Ren, Peng Qiu, Yingqi Qu, Jing Liu, Wayne Xin Zhao, Hua Wu, Ji-Rong Wen, Haifeng Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16499 2024-02-27 cs.CL 89%

LLMArena: Assessing Capabilities of Large Language Models in Dynamic Multi-Agent Environments

Junzhe Chen, Xuming Hu, Shuodi Liu, Shiyu Huang, Wei-Wei Tu, Zhaofeng He, Lijie Wen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05200 2024-02-27 cs.HC cs.AI cs.IR 89%

Knowledge Sharing in Manufacturing using Large Language Models: User Evaluation and Model Benchmarking

Samuel Kernan Freire, Chaofan Wang, Mina Foosherian, Stefan Wellsandt, Santiago Ruiz-Arenas, Evangelos Niforatos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 11 pages, 3 figures, and 1 table. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13291 2024-02-26 cs.CR cs.LG cs.PL cs.SE 89%

DeepCode AI Fix: Fixing Security Vulnerabilities with Large Language Models

Berkay Berabi, Alexey Gronskiy, Veselin Raychev, Gishor Sivanrupan, Victor Chibotaru, Martin Vechev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 26 pages, 13 figures (v2, small fix in author affiliations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13623 2024-02-22 cs.CL cs.SI 89%

FLAME: Self-Supervised Low-Resource Taxonomy Expansion using Large Language Models

Sahil Mishra, Ujjwal Sudev, Tanmoy Chakraborty

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13498 2024-02-22 cs.CL 89%

The Lay Person's Guide to Biomedicine: Orchestrating Large Language Models

Zheheng Luo, Qianqian Xie, Sophia Ananiadou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12914 2024-02-21 cs.CL cs.HC 89%

Large Language Model-based Human-Agent Collaboration for Complex Task Solving

Xueyang Feng, Zhi-Yuan Chen, Yujia Qin, Yankai Lin, Xu Chen, Zhiyuan Liu, Ji-Rong Wen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10899 2024-02-20 cs.CL 89%

Taxonomy-based CheckList for Large Language Model Evaluation

Damin Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17882 2024-02-19 cs.CL 89%

I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench

Yuan Li, Yue Huang, Yuli Lin, Siyuan Wu, Yao Wan, Lichao Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10172 2024-02-16 cs.AI cs.MA 89%

OptiMUS: Scalable Optimization Modeling with (MI)LP Solvers and Large Language Models

Ali AhmadiTeshnizi, Wenzhi Gao, Madeleine Udell

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07462 2024-02-14 cs.CL 89%

Are Large Language Model-based Evaluators the Solution to Scaling Up Multilingual Evaluation?

Rishav Hada, Varun Gumma, Adrian de Wynter, Harshita Diddee, Mohamed Ahmed, Monojit Choudhury, Kalika Bali, Sunayana Sitaram

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to EACL 2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06647 2024-02-13 cs.AI cs.HC 89%

A Survey on Large Language Model Hallucination via a Creativity Perspective

Xuhui Jiang, Yuxing Tian, Fengrui Hua, Chengjin Xu, Yuanzhuo Wang, Jian Guo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03182 2024-02-06 cs.LG 89%

Empowering Time Series Analysis with Large Language Models: A Survey

Yushan Jiang, Zijie Pan, Xikun Zhang, Sahil Garg, Anderson Schneider, Yuriy Nevmyvaka, Dongjin Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01495 2024-02-05 cs.CL 89%

A Comparative Analysis of Conversational Large Language Models in Knowledge-Based Text Generation

Phillip Schneider, Manuel Klettner, Elena Simperl, Florian Matthes

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00262 2024-02-02 cs.AI 89%

Computational Experiments Meet Large Language Model Based Agents: A Survey and Perspective

Qun Ma, Xiao Xue, Deyu Zhou, Xiangning Yu, Donghua Liu, Xuwen Zhang, Zihan Zhao, Yifan Shen, Peilin Ji, Juanjuan Li, Gang Wang, Wanpeng Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16745 2024-01-31 cs.CL 89%

MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models

Wai-Chung Kwan, Xingshan Zeng, Yuxin Jiang, Yufei Wang, Liangyou Li, Lifeng Shang, Xin Jiang, Qun Liu, Kam-Fai Wong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Code and data are available at https://github.com/KwanWaiChung/MT-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15927 2024-01-30 cs.CL 89%

E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models

Jinchang Hou, Chang Ao, Haihong Wu, Xiangtao Kong, Zhigang Zheng, Daijia Tang, Chengming Li, Xiping Hu, Ruifeng Xu, Shiwen Ni, Min Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14703 2024-01-30 cs.CL 89%

Establishing Vocabulary Tests as a Benchmark for Evaluating Large Language Models

Gonzalo Martínez, Javier Conde, Elena Merino-Gómez, Beatriz Bermúdez-Margaretto, José Alberto Hernández, Pedro Reviriego, Marc Brysbaert

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03266 2024-01-18 cs.LG 89%

UniPredict: Large Language Models are Universal Tabular Classifiers

Ruiyu Wang, Zifeng Wang, Jimeng Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08206 2024-01-17 cs.IR cs.CL 89%

Generative Multi-Modal Knowledge Retrieval with Large Language Models

Xinwei Long, Jiali Zeng, Fandong Meng, Zhiyuan Ma, Kaiyan Zhang, Bowen Zhou, Jie Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14033 2024-01-17 cs.CL 89%

T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step

Zehui Chen, Weihua Du, Wenwei Zhang, Kuikun Liu, Jiangning Liu, Miao Zheng, Jingming Zhuo, Songyang Zhang, Dahua Lin, Kai Chen, Feng Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Project: https://open-compass.github.io/T-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02208 2024-01-05 cs.CL 89%

DIALIGHT: Lightweight Multilingual Development and Evaluation of Task-Oriented Dialogue Systems with Large Language Models

Songbo Hu, Xiaobin Wang, Zhangdie Yuan, Anna Korhonen, Ivan Vulić

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 17 pages, 7 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01711 2024-01-04 cs.CL cs.IR 89%

Evaluating Large Language Models in Semantic Parsing for Conversational Question Answering over Knowledge Graphs

Phillip Schneider, Manuel Klettner, Kristiina Jokinen, Elena Simperl, Florian Matthes

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to ICAART 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00690 2024-01-02 cs.CL 89%

Benchmarking Large Language Models on Controllable Generation under Diversified Instructions

Yihan Chen, Benfeng Xu, Quan Wang, Yi Liu, Zhendong Mao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏