arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2501.02901 2025-01-07 cs.SE cs.PL 89%

DeCon: Detecting Incorrect Assertions via Postconditions Generated by a Large Language Model

Hao Yu, Tianyu Chen, Jiaming Huang, Zongyang Li, Dezhi Ran, Xinyu Wang, Ying Li, Assaf Marron, David Harel, Yuan Xie, Tao Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02408 2025-01-07 cs.IR 89%

GenTREC: The First Test Collection Generated by Large Language Models for Evaluating Information Retrieval Systems

Mehmet Deniz Türkmen, Mucahid Kutlu, Bahadir Altun, Gokalp Cosgun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20427 2024-12-31 cs.IR 89%

AmalREC: A Dataset for Relation Extraction and Classification Leveraging Amalgamation of Large Language Models

Mansi, Pranshu Pandya, Mahek Bhavesh Vora, Soumya Bharadwaj, Ashish Anand

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 18 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16120 2024-12-20 cs.SE 89%

Fixing Large Language Models' Specification Misunderstanding for Better Code Generation

Zhao Tian, Junjie Chen, Xiangyu Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments Accepted by ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07499 2024-12-18 cs.IR 89%

Can Large Language Models Assess Serendipity in Recommender Systems?

Yu Tokutake, Kazushi Okamoto

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Journal ref Journal of Advanced Computational Intelligence and Intelligent Informatics, Fuji Technology Press, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10509 2024-12-17 cs.AI cs.CL cs.LG 89%

Do Large Language Models Show Biases in Causal Learning?

Maria Victoria Carro, Francisca Gauna Selasco, Denise Alejandra Mester, Margarita Gonzales, Mario A. Leiva, Maria Vanina Martinez, Gerardo I. Simari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06693 2024-12-10 cs.CL cs.AI cs.CV cs.LG cs.MM 89%

OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions

Yi-Kai Zhang, Xu-Xiang Zhong, Shiyin Lu, Qing-Guo Chen, De-Chuan Zhan, Han-Jia Ye

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05625 2024-12-10 cs.RO 89%

Can Large Language Models Help Developers with Robotic Finite State Machine Modification?

Xiangyu Robin Gan, Yuxin Ray Song, Nick Walker, Maya Cakmak

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05093 2024-12-09 cs.CY 89%

Sense and Sensitivity: Evaluating the simulation of social dynamics via Large Language Models

Da Ju, Adina Williams, Brian Karrer, Maximilian Nickel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07057 2024-12-09 cs.CL cs.AI cs.CV cs.LG 89%

MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models

Yichi Zhang, Yao Huang, Yitong Sun, Chang Liu, Zhe Zhao, Zhengwei Fang, Yifan Wang, Huanran Chen, Xiao Yang, Xingxing Wei, Hang Su, Yinpeng Dong, Jun Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 100 pages, 84 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04056 2024-12-06 cs.MA cs.CY cs.HC 89%

Prompt Engineering Guidance for Conceptual Agent-based Model Extraction using Large Language Models

Siamak Khatami, Christopher Frantz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15017 2024-12-05 cs.CL cs.AI cs.CV cs.HC cs.LG 89%

Knowledge Mechanisms in Large Language Models: A Survey and Perspective

Mengru Wang, Yunzhi Yao, Ziwen Xu, Shuofei Qiao, Shumin Deng, Peng Wang, Xiang Chen, Jia-Chen Gu, Yong Jiang, Pengjun Xie, Fei Huang, Huajun Chen, Ningyu Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Findings; 39 pages (v4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10187 2024-12-05 cs.HC 89%

Collecting Qualitative Data at Scale with Large Language Models: A Case Study

Alejandro Cuevas, Jennifer V. Scurrell, Eva M. Brown, Jason Entenmann, Madeleine I. G. Daepp

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01868 2024-12-04 cs.LG cs.AI cs.CL stat.ML 89%

Composition of Experts: A Modular Compound AI System Leveraging Large Language Models

Swayambhoo Jain, Ravi Raju, Bo Li, Zoltan Csaki, Jonathan Li, Kaizhao Liang, Guoyao Feng, Urmish Thakkar, Anand Sampat, Raghu Prabhakar, Sumati Jairath

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00832 2024-12-03 cs.CV 89%

EventGPT: Event Stream Understanding with Multimodal Large Language Models

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Xin Meng, Fei Richard Yu, Xiangyang Ji, Ming Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00023 2024-12-03 cs.DB 89%

Evaluating Large Language Models on Business Process Modeling: Framework, Benchmark, and Self-Improvement Analysis

Humam Kourani, Alessandro Berti, Daniel Schuster, Wil M. P. van der Aalst

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17760 2024-11-28 cs.CL cs.AI cs.CV cs.LG 89%

Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach

Shijian Deng, Wentian Zhao, Yu-Jhe Li, Kun Wan, Daniel Miranda, Ajinkya Kale, Yapeng Tian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11066 2024-11-19 cs.CV 89%

TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models

Tingyu Qu, Mingxiao Li, Tinne Tuytelaars, Marie-Francine Moens

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11109 2024-11-19 cs.CL cs.AI cs.LG 89%

Investigating Annotator Bias in Large Language Models for Hate Speech Detection

Amit Das, Zheng Zhang, Najib Hasan, Souvika Sarkar, Fatemeh Jamshidi, Tathagata Bhattacharya, Mostafa Rahgouy, Nilanjana Raychawdhary, Dongji Feng, Vinija Jain, Aman Chadha, Mary Sandage, Lauramarie Pope, Gerry Dozier, Cheryl Seals

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS Safe Generative AI Workshop, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07439 2024-11-13 cs.SD cs.IR eess.AS 89%

Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models

SeungHeon Doh, Keunwoo Choi, Daeyong Kwon, Taesu Kim, Juhan Nam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted for publication at the 25th International Society for Music Information Retrieval Conference (ISMIR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01090 2024-11-08 cs.CV 89%

Learning Multiple Object States from Actions via Large Language Models

Masatoshi Tateno, Takuma Yagi, Ryosuke Furuta, Yoichi Sato

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments This is an accepted WACV 2025 paper. Project page: https://masatate.github.io/ObjStatefromAction.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03659 2024-11-07 cs.CY 89%

Towards Scalable Automated Grading: Leveraging Large Language Models for Conceptual Question Evaluation in Engineering

Rujun Gao, Xiaosu Guo, Xiaodi Li, Arun Balajiee Lekshmi Narayanan, Naveen Thomas, Arun R. Srinivasa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 21 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03500 2024-11-07 cs.DB 89%

λ-Tune: Harnessing Large Language Models for Automated Database System Tuning

Victor Giannankouris, Immanuel Trummer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments To be presented at SIGMOD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01368 2024-11-05 cs.IR q-fin.CP 89%

Combining Financial Data and News Articles for Stock Price Movement Prediction Using Large Language Models

Ali Elahi, Fatemeh Taghvaei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18927 2024-10-25 cs.CR 89%

SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models

Zonghao Ying, Aishan Liu, Siyuan Liang, Lei Huang, Jinyang Guo, Wenbo Zhou, Xianglong Liu, Dacheng Tao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18624 2024-10-25 cs.CL cs.AI cs.LG 89%

Prompting and Fine-Tuning of Small LLMs for Length-Controllable Telephone Call Summarization

David Thulke, Yingbo Gao, Rricha Jalota, Christian Dugast, Hermann Ney

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract,comments);language model(abstract,comments);LLM(abstract)

Comments Accepted at the The International Conference on Foundation and Large Language Models (FLLM2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05392 2024-10-22 cs.CL cs.AI cs.CY cs.LG 89%

Deconstructing The Ethics of Large Language Models from Long-standing Issues to New-emerging Dilemmas: A Survey

Chengyuan Deng, Yiqun Duan, Xin Jin, Heng Chang, Yijun Tian, Han Liu, Yichen Wang, Kuofeng Gao, Henry Peng Zou, Yiqiao Jin, Yijia Xiao, Shenghao Wu, Zongxing Xie, Weimin Lyu, Sihong He, Lu Cheng, Haohan Wang, Jun Zhuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09962 2024-10-16 cs.CV 89%

LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models

Han Qiu, Jiaxing Huang, Peng Gao, Qin Qi, Xiaoqin Zhang, Ling Shao, Shijian Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11111 2024-10-16 cs.CL cs.AI cs.LG 89%

Inducing anxiety in large language models can induce bias

Julian Coda-Forno, Kristin Witte, Akshay K. Jagadish, Marcel Binz, Zeynep Akata, Eric Schulz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17139 2024-10-15 cs.LG cs.AI cs.CL cs.IT math.IT 89%

Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models

Lai Wei, Zhiquan Tan, Chenghai Li, Jindong Wang, Weiran Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏