arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2505.02847 2025-05-22 cs.CL cs.AI cs.CY 91%

Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models

Bang Zhang, Ruotian Ma, Qingxuan Jiang, Peisong Wang, Jiaqi Chen, Zheng Xie, Xingyu Chen, Yue Wang, Fanghua Ye, Jian Li, Yifan Yang, Zhaopeng Tu, Xiaolong Li

机构 * Tencent(腾讯)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);language agent(abstract)

Comments code: https://github.com/Tencent/digitalhuman/tree/main/SAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09610 2025-05-20 cs.AR cs.AI cs.CL cs.SE 91%

Customizing a Large Language Model for VHDL Design of High-Performance Microprocessors

Nicolas Dupuis, Ravi Nair, Shyam Ramji, Sean McClintock, Nishant Chauhan, Priyanka Nagpal, Bart Blaner, Ken Valk, Leon Stok, Ruchir Puri

机构 * IBM Research(IBM研究院) IBM Infrastructure(IBM基础设施)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07247 2025-05-16 cs.CL cs.AI 91%

SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models

Peichao Lai, Kexuan Zhang, Yi Lin, Linyihan Zhang, Feiyang Ye, Jinhao Yan, Yanwei Xu, Conghui He, Yilei Wang, Wentao Zhang, Bin Cui

机构 * Peking University(北京大学) Fuzhou University(福州市大学) Hunan University(湖南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03848 2025-04-23 cs.CL cs.AI 91%

ANLS* -- A Universal Document Processing Metric for Generative Large Language Models

David Peer, Philemon Schöpf, Volckmar Nebendahl, Alexander Rietzler, Sebastian Stabinger

机构 * DeepOpinion

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);SFT(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17236 2025-03-25 cs.CL cs.AI cs.IR 91%

Large Language Models Empowered Personalized Web Agents

Hongru Cai, Yongqi Li, Wenjie Wang, Fengbin Zhu, Xiaoyu Shen, Wenjie Li, Tat-Seng Chua

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

Comments Accepted to WWW 2025. The code and data are available on the project website https://hongrucai.github.io/PersonalWAB/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01238 2025-03-24 cs.AI cs.CL eess.SP 91%

Large Language Models are Zero-Shot Recognizers for Activities of Daily Living

Gabriele Civitarese, Michele Fiori, Priyankar Choudhary, Claudio Bettini

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Paper accepted for publication in the ACM Transactions on Intelligent Systems and Technology (TIST) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10937 2025-03-17 cs.CV cs.AI cs.LG 91%

ChatGPT Encounters Morphing Attack Detection: Zero-Shot MAD with Multi-Modal Large Language Models and General Vision Models

Haoyu Zhang, Raghavendra Ramachandra, Kiran Raja, Christoph Busch

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14688 2025-03-06 cs.CL cs.AI 91%

ExpertPrompting: Instructing Large Language Models to be Distinguished Experts

Benfeng Xu, An Yang, Junyang Lin, Quan Wang, Chang Zhou, Yongdong Zhang, Zhendong Mao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06195 2025-02-25 cs.CL cs.AI 91%

EgoSocialArena: Benchmarking the Social Intelligence of Large Language Models from a First-person Perspective

Guiyang Hou, Wenqi Zhang, Yongliang Shen, Zeqi Tan, Sihao Shen, Weiming Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14317 2025-02-12 cs.CL cs.AI 91%

Claim Verification in the Age of Large Language Models: A Survey

Alphaeus Dmonte, Roland Oruche, Marcos Zampieri, Prasad Calyam, Isabelle Augenstein

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06859 2025-01-14 cs.CL cs.AI 91%

A Comprehensive Evaluation of Large Language Models on Mental Illnesses in Arabic Context

Noureldin Zahran, Aya E. Fouda, Radwa J. Hanafy, Mohammed E. Fouda

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02085 2024-12-31 cs.CV cs.AI cs.CL eess.SP 91%

Unleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language Models

Yulei Qin, Yuncheng Yang, Pengcheng Guo, Gang Li, Hang Shao, Yuchen Shi, Zihan Xu, Yun Gu, Ke Li, Xing Sun

专题命中 评测与基准 :language model(title,abstract);instruction tuning(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted to TMLR with Survey Certificate, review, survey, 37 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00380 2024-12-12 cs.CL cs.AI 91%

HonestLLM: Toward an Honest and Helpful Large Language Model

Chujie Gao, Siyuan Wu, Yue Huang, Dongping Chen, Qihui Zhang, Zhengyan Fu, Yao Wan, Lichao Sun, Xiangliang Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10473 2024-11-19 cs.HC cs.AI cs.CL cs.CY 91%

PhDGPT: Introducing a psychometric and linguistic dataset about how large language models perceive graduate students and professors in psychology

Edoardo Sebastiano De Duro, Enrique Taietta, Riccardo Improta, Massimo Stella

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 20 pages, 8 figures. Edoardo Sebastiano De Duro and Enrique Taietta equally contributed to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03963 2024-11-19 cs.AI cs.LG 91%

ERATTA: Extreme RAG for Table To Answers with Large Language Models

Sohini Roychowdhury, Marko Krema, Anvar Mahammad, Brian Moore, Arijit Mukherjee, Punit Prakashchandra

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 5 pages, 4 tables, IEEE Big Data, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10006 2024-11-18 cs.CL cs.AI 91%

Orca: Enhancing Role-Playing Abilities of Large Language Models by Integrating Personality Traits

Yuxuan Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09972 2024-11-18 cs.CL cs.AI 91%

Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems

Taaha Kazi, Ruiliang Lyu, Sizhe Zhou, Dilek Hakkani-Tur, Gokhan Tur

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04528 2024-11-12 cs.LG cs.AI 91%

Using Large Language Models for Hyperparameter Optimization

Michael R. Zhang, Nishkrit Desai, Juhan Bae, Jonathan Lorraine, Jimmy Ba

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02666 2024-11-06 cs.LG cs.AI cs.SI 91%

From Twitter to Reasoner: Understand Mobility Travel Modes and Sentiment Using Large Language Models

Kangrui Ruan, Xinyang Wang, Xuan Di

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 6 pages; Accepted by ITSC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00023 2024-11-06 eess.AS cs.AI cs.CL cs.SD 91%

Device-Directed Speech Detection for Follow-up Conversations Using Large Language Models

Ognjen, Rudovic, Pranay Dighe, Yi Su, Vineet Garg, Sameer Dharur, Xiaochuan Niu, Ahmed H. Abdelaziz, Saurabh Adya, Ahmed Tewfik

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15319 2024-10-22 cs.CL cs.AI stat.ML 91%

Causality for Large Language Models

Anpeng Wu, Kun Kuang, Minqin Zhu, Yingrong Wang, Yujia Zheng, Kairong Han, Baohong Li, Guangyi Chen, Fei Wu, Kun Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15936 2024-10-22 cs.CL cs.AI 91%

Zero-Shot Spam Email Classification Using Pre-trained Large Language Models

Sergio Rojas-Galeano

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Journal ref Applied Computer Sciences in Engineering. WEA 2024. Communications in Computer and Information Science, vol 2222. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07815 2024-10-11 cs.CL cs.AI 91%

Are Large Language Models Good Statisticians?

Yizhang Zhu, Shiyin Du, Boyan Li, Yuyu Luo, Nan Tang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted by NeurIPS 2024 D&B. 34 pages, 11 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00929 2024-10-03 cs.AI cs.LG 91%

A Knowledge-Informed Large Language Model Framework for U.S. Nuclear Power Plant Shutdown Initiating Event Classification for Probabilistic Risk Assessment

Min Xian, Tao Wang, Sai Zhang, Fei Xu, Zhegang Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19705 2024-10-01 cs.CL cs.AI 91%

CollectiveSFT: Scaling Large Language Models for Chinese Medical Benchmark with Collective Instructions in Healthcare

Jingwei Zhu, Minghuan Tan, Min Yang, Ruixue Li, Hamid Alinejad-Rokny

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13120 2024-09-23 cs.CL cs.AI cs.CY 91%

Are Large Language Models Good Essay Graders?

Anindita Kundu, Denilson Barbosa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04394 2024-08-23 cs.CL cs.AI 91%

Automated Educational Question Generation at Different Bloom's Skill Levels using Large Language Models: Strategies and Evaluation

Nicy Scaria, Suma Dharani Chenna, Deepak Subramani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Journal ref Artificial Intelligence in Education. AIED 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09835 2024-08-22 cs.CL cs.AI 91%

ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code

Xiangru Tang, Yuliang Liu, Zefan Cai, Yanjun Shao, Junjie Lu, Yichi Zhang, Zexuan Deng, Helan Hu, Kaikai An, Ruijun Huang, Shuzheng Si, Sheng Chen, Haozhe Zhao, Liang Chen, Yan Wang, Tianyu Liu, Zhiwei Jiang, Baobao Chang, Yin Fang, Yujia Qin, Wangchunshu Zhou, Yilun Zhao, Arman Cohan, Mark Gerstein

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01700 2024-08-05 cs.CL cs.AI 91%

Data Management For Training Large Language Models: A Survey

Zige Wang, Wanjun Zhong, Yufei Wang, Qi Zhu, Fei Mi, Baojun Wang, Lifeng Shang, Xin Jiang, Qun Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12994 2024-07-25 cs.CL cs.AI 91%

A Survey of Prompt Engineering Methods in Large Language Models for Different NLP Tasks

Shubham Vatsal, Harsh Dubey

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏