arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2504.08981 2025-04-15 cs.LG cs.AI 90%

AGENT: An Aerial Vehicle Generation and Design Tool Using Large Language Models

Colin Samplawski, Adam D. Cobb, Susmit Jha

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08781 2025-04-15 cs.CL cs.AI cs.IR 90%

Efficient Evaluation of Large Language Models via Collaborative Filtering

Xu-Xiang Zhong, Chao Yi, Han-Jia Ye

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07982 2025-04-14 cs.CL cs.AI 90%

Metamorphic Testing for Fairness Evaluation in Large Language Models: Identifying Intersectional Bias in LLaMA and GPT

Harishwar Reddy, Madhusudan Srinivasan, Upulee Kanewala

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12946 2025-04-10 cs.CL cs.LG 90%

A Flexible Large Language Models Guardrail Development Methodology Applied to Off-Topic Prompt Detection

Gabriel Chua, Shing Yee Chan, Shaun Khoo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05736 2025-04-09 cs.CL cs.AI 90%

Rank-Then-Score: Enhancing Large Language Models for Automated Essay Scoring

Yida Cai, Kun Liang, Sanwoo Lee, Qinghan Wang, Yunfang Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05603 2025-04-09 cs.CL cs.LG 90%

On the Impact of Language Nuances on Sentiment Analysis with Large Language Models: Paraphrasing, Sarcasm, and Emojis

Naman Bhargava, Mohammed I. Radaideh, O Hwang Kwon, Aditi Verma, Majdi I. Radaideh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 21 pages, 10 Tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00053 2025-04-09 cs.CL cs.AI 90%

Integrating Large Language Models with Human Expertise for Disease Detection in Electronic Health Records

Jie Pan, Seungwon Lee, Cheligeer Cheligeer, Elliot A. Martin, Kiarash Riazi, Hude Quan, Na Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05925 2025-04-07 cs.DB cs.AI cs.CL cs.IR 90%

Assessing SPARQL capabilities of Large Language Models

Lars-Peter Meyer, Johannes Frey, Felix Brei, Natanael Arndt

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Peer reviewed and published at NLP4KGc @ Semantics 2024, see original publication at https://ceur-ws.org/Vol-3874/paper3.pdf . Updated Metadata

Journal ref CEUR-WS Vol.3874 (12/2024) 35-53

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24310 2025-04-01 cs.CL cs.AI 90%

BEATS: Bias Evaluation and Assessment Test Suite for Large Language Models

Alok Abhishek, Lisa Erickson, Tushar Bandopadhyay

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 32 pages, 33 figures, preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21598 2025-04-01 cs.CR cs.AI cs.LG 90%

Prompt, Divide, and Conquer: Bypassing Large Language Model Safety Filters via Segmented and Distributed Prompt Processing

Johan Wahréus, Ahmed Hussain, Panos Papadimitratos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments 22 pages; 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18947 2025-04-01 cs.CL cs.AI 90%

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Kaiwen Zuo, Yirui Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments Published to AAAI-25 Bridge Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21383 2025-03-28 cs.CL cs.LG 90%

Controlling Large Language Model with Latent Actions

Chengxing Jia, Ziniu Li, Pengyuan Wang, Yi-Chen Li, Zhenyu Hou, Yuxiao Dong, Yang Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19540 2025-03-26 cs.CL cs.AI 90%

FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models

Dahyun Jung, Seungyoon Lee, Hyeonseok Moon, Chanjun Park, Heuiseok Lim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19213 2025-03-26 cs.CL cs.AI cs.HC 90%

A Survey of Large Language Model Agents for Question Answering

Murong Yue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17936 2025-03-25 cs.CL cs.AI 90%

An Empirical Study of the Role of Incompleteness and Ambiguity in Interactions with Large Language Models

Riya Naik, Ashwin Srinivasan, Estrid He, Swati Agarwal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17403 2025-03-25 cs.CL cs.AI 90%

ChatGPT or A Silent Everywhere Helper: A Survey of Large Language Models

Azim Akhtarshenas, Afshin Dini, Navid Ayoobi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06196 2025-03-25 cs.CL cs.AI 90%

Large Language Models: A Survey

Shervin Minaee, Tomas Mikolov, Narjes Nikzad, Meysam Chenaghlu, Richard Socher, Xavier Amatriain, Jianfeng Gao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16585 2025-03-24 cs.CL cs.CV cs.DC cs.LG 90%

Distributed LLMs and Multimodal Large Language Models: A Survey on Advances, Challenges, and Future Directions

Hadi Amini, Md Jueal Mia, Yasaman Saadati, Ahmed Imteaj, Seyedsina Nabavirazavi, Urmish Thakker, Md Zarif Hossain, Awal Ahmed Fime, S. S. Iyengar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15521 2025-03-21 cs.HC cs.AI cs.CL cs.CY 90%

From Divergence to Consensus: Evaluating the Role of Large Language Models in Facilitating Agreement through Adaptive Strategies

Loukas Triantafyllopoulos, Dimitris Kalles

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 32 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08598 2025-03-20 cs.CL cs.AI 90%

Language Model Council: Democratically Benchmarking Foundation Models on Highly Subjective Tasks

Justin Zhao, Flor Miriam Plaza-del-Arco, Benjamin Genchel, Amanda Cercas Curry

专题命中 评测与基准 :language model(title,abstract);foundation model(title);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13520 2025-03-19 cs.CL cs.LG cs.SE 90%

Evaluating the Process Modeling Abilities of Large Language Models -- Preliminary Foundations and Results

Peter Fettke, Constantin Houy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 1 figure, submitted to 20th International Conference on Wirtschaftsinformatik 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18326 2025-03-19 cs.CL cs.AI 90%

PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models

Huixuan Zhang, Yun Lin, Xiaojun Wan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13205 2025-03-18 cs.AI cs.CL cs.CV cs.HC cs.MA 90%

MAP: Evaluation and Multi-Agent Enhancement of Large Language Models for Inpatient Pathways

Zhen Chen, Zhihao Peng, Xusheng Liang, Cheng Wang, Peigan Liang, Linsheng Zeng, Minjie Ju, Yixuan Yuan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07927 2025-03-18 cs.AI cs.CL cs.HC 90%

A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications

Pranab Sahoo, Ayush Kumar Singh, Sriparna Saha, Vinija Jain, Samrat Mondal, Aman Chadha

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09743 2025-03-14 cs.CL cs.LG 90%

Review GIDE -- Restaurant Review Gastrointestinal Illness Detection and Extraction with Large Language Models

Timothy Laurence, Joshua Harris, Leo Loman, Amy Douglas, Yung-Wai Chan, Luke Hounsome, Lesley Larkin, Michael Borowitz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08662 2025-03-12 cs.CL cs.AI 90%

Exploring the Word Sense Disambiguation Capabilities of Large Language Models

Pierpaolo Basile, Lucia Siciliani, Elio Musacchio, Giovanni Semeraro

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06709 2025-03-11 cs.CL cs.AI 90%

Delusions of Large Language Models

Hongshen Xu, Zixv yang, Zichen Zhu, Kunyao Lan, Zihan Wang, Mengyue Wu, Ziwei Ji, Lu Chen, Pascale Fung, Kai Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04795 2025-03-10 cs.CL cs.AI 90%

Cyber for AI at SemEval-2025 Task 4: Forgotten but Not Lost: The Balancing Act of Selective Unlearning in Large Language Models

Dinesh Srivasthav P, Bala Mallikarjunarao Garlapati

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11681 2025-03-06 cs.CL cs.AI 90%

RIDE: Enhancing Large Language Model Alignment through Restyled In-Context Learning Demonstration Exemplars

Yuncheng Hua, Lizhen Qu, Zhuang Li, Hao Xue, Flora D. Salim, Gholamreza Haffari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 38 pages, 2 figures, 20 tables; The paper is under review in ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01887 2025-03-05 cs.LG cs.AI 90%

When Continue Learning Meets Multimodal Large Language Model: A Survey

Yukang Huo, Hao Tang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments 42 pages, 6 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏