arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2308.11432 2025-03-04 cs.AI cs.CL 90%

A Survey on Large Language Model based Autonomous Agents

Lei Wang, Chen Ma, Xueyang Feng, Zeyu Zhang, Hao Yang, Jingsen Zhang, Zhiyuan Chen, Jiakai Tang, Xu Chen, Yankai Lin, Wayne Xin Zhao, Zhewei Wei, Ji-Rong Wen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Correcting several typos, 35 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17631 2025-03-04 cs.CL cs.AI 90%

JudgeLM: Fine-tuned Large Language Models are Scalable Judges

Lianghui Zhu, Xinggang Wang, Xinlong Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments JudgeLM is accepted by ICLR2025. Code is available at https://github.com/baaivision/JudgeLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20609 2025-03-03 cs.CL cs.AI 90%

Leveraging Large Language Models for Building Interpretable Rule-Based Data-to-Text Systems

Jędrzej Warczyński, Mateusz Lango, Ondrej Dusek

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09768 2025-03-03 cs.CL cs.AI 90%

Can Large Language Models Predict the Outcome of Judicial Decisions?

Mohamed Bayan Kmainasi, Ali Ezzat Shahroor, Amani Al-Ghraibah

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19160 2025-02-27 cs.CL cs.AI 90%

Detecting Linguistic Indicators for Stereotype Assessment with Large Language Models

Rebekka Görge, Michael Mock, Héctor Allende-Cid

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19008 2025-02-27 cs.CL cs.AI 90%

Binary Neural Networks for Large Language Model: A Survey

Liangdong Liu, Zhitong Zheng, Cong Wang, Tianhuang Su, Zhenyu Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18935 2025-02-27 cs.CL cs.AI 90%

JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models

Shuyi Liu, Simiao Cui, Haoran Bu, Yuming Shang, Xi Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 5 figures, accepted at PAKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08904 2025-02-25 cs.RO cs.AI cs.LG 90%

AnyBipe: An End-to-End Framework for Training and Deploying Bipedal Robots Guided by Large Language Models

Yifei Yao, Wentao He, Chenyu Gu, Jiaheng Du, Fuwei Tan, Zhen Zhu, Junguo Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15810 2025-02-25 cs.CL cs.AI 90%

Zero-Shot Commonsense Validation and Reasoning with Large Language Models: An Evaluation on SemEval-2020 Task 4 Dataset

Rawand Alfugaha, Mohammad AL-Smadi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02408 2025-02-25 cs.CL cs.LG 90%

CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models

Song Wang, Peng Wang, Tong Zhou, Yushun Dong, Zhen Tan, Jundong Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments ICLR 2025 Soptlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17753 2025-02-24 cs.CL cs.AI 90%

Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language

Amalie Brogaard Pauli, Isabelle Augenstein, Ira Assent

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14469 2025-02-21 cs.CL cs.AI cs.SI 90%

Enhancing Smart Environments with Context-Aware Chatbots using Large Language Models

Aurora Polo-Rodríguez, Laura Fiorini, Erika Rovini, Filippo Cavallo, Javier Medina-Quero

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12844 2025-02-21 cs.CL cs.LG stat.ML 90%

metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models

Alex Kipnis, Konstantinos Voudouris, Luca M. Schulze Buschoff, Eric Schulz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments accepted for publication at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12491 2025-02-21 cs.CL cs.AI 90%

Assessing and Understanding Creativity in Large Language Models

Yunpu Zhao, Rui Zhang, Wenyi Li, Di Huang, Jiaming Guo, Shaohui Peng, Yifan Hao, Yuanbo Wen, Xing Hu, Zidong Du, Qi Guo, Ling Li, Yunji Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Journal ref Machine Intelligence Research (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12203 2025-02-19 cs.LG cs.AI cs.GT cs.NE 90%

An Interpretable Automated Mechanism Design Framework with Large Language Models

Jiayuan Liu, Mingyu Guo, Vincent Conitzer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01737 2025-02-18 cs.CL cs.AI 90%

Assistive Large Language Model Agents for Socially-Aware Negotiation Dialogues

Yuncheng Hua, Lizhen Qu, Gholamreza Haffari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 3 figures, 14 tables; The paper has been published in the Findings of the Association for Computational Linguistics: EMNLP 2024

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22108 2025-02-18 cs.CL cs.AI 90%

Protecting Privacy in Multimodal Large Language Models with MLLMU-Bench

Zheyuan Liu, Guangyao Dou, Mengzhao Jia, Zhaoxuan Tan, Qingkai Zeng, Yongle Yuan, Meng Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments NAACL Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11068 2025-02-18 cs.CL cs.AI 90%

Large Language Models for Causal Discovery: Current Landscape and Future Directions

Guangya Wan, Yunsheng Lu, Yuqi Wu, Mengxuan Hu, Sheng Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09659 2025-02-17 cs.CL cs.AI cs.CY 90%

Cancer Vaccine Adjuvant Name Recognition from Biomedical Literature using Large Language Models

Hasin Rehana, Jie Zheng, Leo Yeh, Benu Bansal, Nur Bengisu Çam, Christianah Jemiyo, Brett McGregor, Arzucan Özgür, Yongqun He, Junguk Hur

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07352 2025-02-14 cs.CL cs.AI cs.DL 90%

Bridging the Evaluation Gap: Leveraging Large Language Models for Topic Model Evaluation

Zhiyin Tan, Jennifer D'Souza

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments accepted by IRCDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06470 2025-02-11 cs.CL cs.AI 90%

A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks

Hieu Minh "Jord" Nguyen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Advancing Artificial Intelligence through Theory of Mind Workshop, AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06065 2025-02-11 cs.CL cs.AI cs.IR 90%

Benchmarking Prompt Sensitivity in Large Language Models

Amirhossein Razavi, Mina Soltangheis, Negar Arabzadeh, Sara Salamat, Morteza Zihayat, Ebrahim Bagheri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05139 2025-02-11 cs.CL cs.AI 90%

A Practical Examination of AI-Generated Text Detectors for Large Language Models

Brian Tufts, Xuandong Zhao, Lei Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13237 2025-02-11 cs.CL cs.AI cs.CR 90%

Large Language Models are Easily Confused: A Quantitative Metric, Security Implications and Typological Analysis

Yiyi Chen, Qiongxiu Li, Russa Biswas, Johannes Bjerva

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 15 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17428 2025-02-11 cs.AI cs.CL 90%

Aligning Large Language Models for Enhancing Psychiatric Interviews Through Symptom Delineation and Summarization: Pilot Study

Jae-hee So, Joonhwan Chang, Eunji Kim, Junho Na, JiYeon Choi, Jy-yong Sohn, Byung-Hoon Kim, Sang Hui Chu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Journal ref JMIR Form Res 2024;8:e58418

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01679 2025-02-05 cs.CY cs.CL cs.LG 90%

LIBRA: Measuring Bias of Large Language Model from a Local Context

Bo Pang, Tingrui Qiao, Caroline Walker, Chris Cunningham, Yun Sing Koh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Paper accepted by ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09321 2025-02-05 cs.CR cs.AI cs.CL 90%

JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models

Delong Ran, Jinyuan Liu, Yichen Gong, Jingyi Zheng, Xinlei He, Tianshuo Cong, Anyu Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments This is the Extended Version for the Poster at NDSS Symposium 2025, Feb 24-28, 2025. Our code is available at https://github.com/ThuCCSLab/JailbreakEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01243 2025-02-04 cs.CL cs.AI 90%

OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology

Chengfeng Zhou, Ji Wang, Juanjuan Qin, Yining Wang, Ling Sun, Weiwei Dai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00674 2025-02-04 cs.CL cs.LG 90%

Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?

Wenzhe Li, Yong Lin, Mengzhou Xia, Chi Jin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00595 2025-02-04 cs.CL cs.AI 90%

RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines

Pengfei Yu, Dongming Shen, Silin Meng, Jaewon Lee, Weisu Yin, Andrea Yaoyun Cui, Zhenlin Xu, Yi Zhu, Xingjian Shi, Mu Li, Alex Smola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Submitted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏