arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2502.17657 2025-02-26 stat.AP cs.AI 89%

StatLLM: A Dataset for Evaluating the Performance of Large Language Models in Statistical Analysis

Xinyi Song, Lina Lee, Kexin Xie, Xueying Liu, Xinwei Deng, Yili Hong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17000 2025-02-25 cs.CV cs.LG 89%

An Enhanced Large Language Model For Cross Modal Query Understanding System Using DL-KeyBERT Based CAZSSCL-MPGPT

Shreya Singh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16863 2025-02-25 cs.MA cs.LG cs.RO 89%

Leveraging Large Language Models for Effective and Explainable Multi-Agent Credit Assignment

Kartik Nagpal, Dayi Dong, Jean-Baptiste Bouvier, Negar Mehr

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 8 pages+Appendix, 6 Figures, AAMAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15147 2025-02-25 cs.AI cs.HC 89%

A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models

Zhongzhan Huang, Shanshan Zhong, Pan Zhou, Shanghua Gao, Marinka Zitnik, Liang Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted by TPAMI. arXiv admin note: text overlap with arXiv:2312.02439

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15797 2025-02-25 cs.CR cs.AI 89%

OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities

Michael Kouremetis, Marissa Dotter, Alex Byrne, Dan Martin, Ethan Michalak, Gianpaolo Russo, Michael Threet, Guido Zarrella

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 31 pages, 17 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13564 2025-02-20 cs.CL 89%

PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models

Guangwei Li, Yuansen Zhang, Yinggui Wang, Shoumeng Yan, Lei Wang, Tao Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07068 2025-02-20 cs.CL 89%

Specializing Large Language Models to Simulate Survey Response Distributions for Global Populations

Yong Cao, Haijiang Liu, Arnav Arora, Isabelle Augenstein, Paul Röttger, Daniel Hershcovich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 15 pages, 9 figures, accepted to NAACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09801 2025-02-20 cs.IR cs.CL 89%

Conversational Text Extraction with Large Language Models Using Retrieval-Augmented Systems

Soham Roy, Mitul Goswami, Nisharg Nargund, Suneeta Mohanty, Prasant Kumar Pattnaik

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Journal ref 2024 6th International Conference on Computational Intelligence and Networks (CINE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13396 2025-02-20 cs.CL 89%

Prompting a Weighting Mechanism into LLM-as-a-Judge in Two-Step: A Case Study

Wenwen Xie, Gray Gwizdz, Dongji Feng

专题命中 评测与基准 :LLM(title,abstract);prompting(title);large language model(abstract);language model(abstract)

Comments 5 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13059 2025-02-19 cs.CL 89%

SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models

Xianfu Cheng, Wei Zhang, Shiwei Zhang, Jian Yang, Xiangyuan Guan, Xianjie Wu, Xiang Li, Ge Zhang, Jiaheng Liu, Yuying Mai, Yutao Zeng, Zhoufutu Wen, Ke Jin, Baorui Wang, Weixiao Zhou, Yunhong Lu, Tongliang Li, Wenhao Huang, Zhoujun Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09747 2025-02-19 cs.CL 89%

The Widespread Adoption of Large Language Model-Assisted Writing Across Society

Weixin Liang, Yaohui Zhang, Mihai Codreanu, Jiayu Wang, Hancheng Cao, James Zou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10724 2025-02-18 cs.CL 89%

Large Language Models Are Active Critics in NLG Evaluation

Shuying Xu, Junjie Hu, Ming Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16288 2025-02-18 cs.CL 89%

PlagBench: Exploring the Duality of Large Language Models in Plagiarism Generation and Detection

Jooyoung Lee, Toshini Agrawal, Adaku Uchendu, Thai Le, Jinghui Chen, Dongwon Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments This is a camera-ready version of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09799 2025-02-17 cs.HC cs.AI cs.CY 89%

Co-designing Large Language Model Tools for Project-Based Learning with K12 Educators

Prerna Ravi, John Masla, Gisella Kakoti, Grace Lin, Emma Anderson, Matt Taylor, Anastasia Ostrowski, Cynthia Breazeal, Eric Klopfer, Hal Abelson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 25 pages

Journal ref CHI Conference on Human Factors in Computing Systems (CHI '25), April 26-May 01, 2025, Yokohama, Japan. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14497 2025-02-17 cs.CL 89%

Evaluating and Improving Graph to Text Generation with Large Language Models

Jie He, Yijun Yang, Wanqiu Long, Deyi Xiong, Victor Gutierrez-Basulto, Jeff Z. Pan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08796 2025-02-14 cs.CL cs.CY cs.HC 89%

A Systematic Review on the Evaluation of Large Language Models in Theory of Mind Tasks

Karahan Sarıtaş, Kıvanç Tezören, Yavuz Durmazkeser

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15504 2025-02-13 cs.CL 89%

Mitigating Social Bias in Large Language Models: A Multi-Objective Approach within a Multi-Agent Framework

Zhenjie Xu, Wenqing Chen, Yi Tang, Xuanying Li, Cheng Hu, Zhixuan Chu, Kui Ren, Zibin Zheng, Zhichao Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments This work has been accepted at The 39th Annual AAAI Conference on Artificial Intelligence (AAAI-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18418 2025-02-13 cs.CL 89%

Know Your Limits: A Survey of Abstention in Large Language Models

Bingbing Wen, Jihan Yao, Shangbin Feng, Chenjun Xu, Yulia Tsvetkov, Bill Howe, Lucy Lu Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments TACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05701 2025-02-11 cs.LG 89%

TOKON: TOKenization-Optimized Normalization for time series analysis with a large language model

Janghoon Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14059 2025-02-10 q-fin.CP cs.CE cs.CL 89%

UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models

Yuzhe Yang, Yifei Zhang, Yan Hu, Yilin Guo, Ruoli Gan, Yueru He, Mingcong Lei, Xiao Zhang, Haining Wang, Qianqian Xie, Jimin Huang, Honghai Yu, Benyou Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02866 2025-02-06 cs.SE cs.AI 89%

A Systematic Approach for Assessing Large Language Models' Test Case Generation Capability

Hung-Fu Chang, Mohammad Shokrolah Shirazi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11668 2025-02-04 cs.CL 89%

"Not Aligned" is Not "Malicious": Being Careful about Hallucinations of Large Language Models' Jailbreak

Lingrui Mei, Shenghua Liu, Yiwei Wang, Baolong Bi, Jiayi Mao, Xueqi Cheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18794 2025-02-03 q-bio.GN cs.AI 89%

Survey and Improvement Strategies for Gene Prioritization with Large Language Models

Matthew Neeley, Guantong Qi, Guanchu Wang, Ruixiang Tang, Dongxue Mao, Chaozhong Liu, Sasidhar Pasupuleti, Bo Yuan, Fan Xia, Pengfei Liu, Zhandong Liu, Xia Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 11 pages, 4 figures, 10 pages of supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18668 2025-02-03 cs.AI cs.SE 89%

Simulation Streams: A Programming Paradigm for Controlling Large Language Models and Building Complex Systems with Generative AI

Peter Sunehag, Joel Z. Leibo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Technical report accompanying the release of code on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18081 2025-01-31 cs.AI cs.CY 89%

Normative Evaluation of Large Language Models with Everyday Moral Dilemmas

Pratik S. Sachdeva, Tom van Nuenen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14499 2025-01-27 cs.LG cs.CY 89%

Automated Assignment Grading with Large Language Models: Insights From a Bioinformatics Course

Pavlin G. Poličar, Martin Špendl, Tomaž Curk, Blaž Zupan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05208 2025-01-24 cs.AI cs.DB 89%

A Survey of Large Language Model-Based Generative AI for Text-to-SQL: Benchmarks, Applications, Use Cases, and Challenges

Aditi Singh, Akash Shetty, Abul Ehtesham, Saket Kumar, Tala Talaei Khoei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12975 2025-01-23 cs.CL 89%

OnionEval: An Unified Evaluation of Fact-conflicting Hallucination for Small-Large Language Models

Chongren Sun, Yuran Li, Di Wu, Benoit Boulet

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17404 2025-01-23 cs.AI 89%

Grammar-based Game Description Generation using Large Language Models

Tsunehiko Tanaka, Edgar Simo-Serra

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted for publication at the IEEE Transactions on Games

Journal ref IEEE Transactions on Games, 2024 (early access)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11354 2025-01-22 cs.SE cs.AI 89%

Towards Advancing Code Generation with Large Language Models: A Research Roadmap

Haolin Jin, Huaming Chen, Qinghua Lu, Liming Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏