arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31906 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31906 篇

2309.01219 2025-09-16 cs.CL cs.AI cs.CY cs.LG 90%

Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models

Yue Zhang, Yafu Li, Leyang Cui, Deng Cai, Lemao Liu, Tingchen Fu, Xinting Huang, Enbo Zhao, Yu Zhang, Chen Xu, Yulong Chen, Longyue Wang, Anh Tuan Luu, Wei Bi, Freda Shi, Shuming Shi

机构 * Tencent AI lab(腾讯AI实验室) Soochow University(苏州大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) Nanyang Technological University(南洋理工大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments work in progress;

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03331 2025-09-04 cs.SE cs.CR 90%

VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities

Weizhe Wang, Wei Ma, Qiang Hu, Yao Zhang, Jianfei Sun, Bin Wu, Yang Liu, Guangquan Xu, Lingxiao Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09577 2025-08-13 cs.HC 90%

Polymind: Parallel Visual Diagramming with Large Language Models to Support Prewriting Through Microtasks

Qian Wan, Jiannan Li, Huanchen Wang, Zhicong Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted to CSCW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08109 2025-08-12 cs.CL cs.AI cs.LG 90%

A Closer Look at Machine Unlearning for Large Language Models

Xiaojian Yuan, Tianyu Pang, Chao Du, Kejiang Chen, Weiming Zhang, Min Lin

机构 * University of Science and Technology of China(中国科学技术大学) Sea AI Lab, Singapore(新加坡Sea AI实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03470 2025-08-06 cs.SE 90%

On the Evaluation of Large Language Models in Multilingual Vulnerability Repair

Dong wang, Junji Yu, Honglin Shu, Michael Fu, Chakkrit Tantithamthavorn, Yasutaka Kamei, Junjie Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20762 2025-07-29 cs.IR 90%

Watermarking Large Language Model-based Time Series Forecasting

Wei Yuan, Chaoqun Yang, Yu Xing, Tong Chen, Nguyen Quoc Viet Hung, Hongzhi Yin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18784 2025-07-29 cs.SE 90%

Secret Breach Detection in Source Code with Large Language Models

Md Nafiu Rahman, Sadif Ahmed, Zahin Wahab, S M Sohan, Rifat Shahriyar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 19th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM 2025) cameraready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12808 2025-07-18 cs.CL cs.AI cs.LG cs.SD eess.AS 90%

Large Language Models' Internal Perception of Symbolic Music

Andrew Shin, Kunitake Kaneko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08367 2025-07-14 cs.CV cs.SY eess.SY 90%

Understanding Driving Risks using Large Language Models: Toward Elderly Driver Assessment

Yuki Yoshihara, Linjing Jiang, Nihan Karatas, Hitoshi Kanamori, Asuka Harada, Takahiro Tanaka

机构 * Institutes of Innovation for Future Society, Nagoya University, Japan(面向未来的创新研究所,名古屋大学,日本)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21567 2025-07-03 cs.CL cs.AI cs.LG 90%

BioPars: A Pretrained Biomedical Large Language Model for Persian Biomedical Text Mining

Baqer M. Merzah, Tania Taami, Salman Asoudeh, Saeed Mirzaee, Amir reza Hossein pour, Amir Ali Bengari

机构 * Department of Computer Science, Faculty of Education, University of Kufa(计算机科学系,教育学院,科菲大学) Department of Computer Science, Florida State University(计算机科学系,佛罗里达州立大学) Department of Computer Engineering, Velayat University(计算机工程系,瓦莱yat大学) Department of Mechanical Engineering, Amirkabir University of Technology(机械工程系,阿米卡比尔技术大学) Department of Computer Engineering, Ferdowsi University of Mashhad(计算机工程系,法尔德大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04370 2025-07-02 cs.CL cs.AI cs.LG 90%

Large Language Model Confidence Estimation via Black-Box Access

Tejaswini Pedapati, Amit Dhurandhar, Soumya Ghosh, Soham Dan, Prasanna Sattigeri

机构 * IBM Research Yorktown Heights(IBM研究院纽约高地分部) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Microsoft New York(微软纽约分公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01763 2025-06-24 cs.DB cs.AI cs.CL cs.LG 90%

When Large Language Models Meet Vector Databases: A Survey

Zhi Jing, Yongye Su, Yikun Han, Bo Yuan, Haiyun Xu, Chunjiang Liu, Kehai Chen, Min Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Purdue University(普渡大学) University of Michigan(密歇根大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) National Science Library (Chengdu), Chinese Academy of Sciences(中国科学院成都科学图书馆) Shandong University of Technology(山东科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15617 2025-06-19 cs.CL cs.AI cs.LG 90%

The Compositional Architecture of Regret in Large Language Models

Xiangxiang Cui, Shu Yang, Tianjin Huang, Wanyu Lin, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析实验室) King Abdullah University of Science and Technology(卡瓦尔大学科学与技术大学) State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(认知神经科学与学习国家重点实验室,北京师范大学) University of Exeter(埃克塞特大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13186 2025-06-17 cs.SE 90%

Empirical Evaluation of Large Language Models in Automated Program Repair

Jiajun Sun, Fengjie Li, Xinzhu Qi, Hongyu Zhang, Jiajun Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12992 2025-06-17 cs.CV 90%

SmartHome-Bench: A Comprehensive Benchmark for Video Anomaly Detection in Smart Homes Using Multi-Modal Large Language Models

Xinyi Zhao, Congjing Zhang, Pei Guo, Wei Li, Lin Chen, Chaoyue Zhao, Shuai Huang

机构 * University of Washington(华盛顿大学) Wyze Labs, Inc.(Wyze实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments CVPR 2025 Workshop: VAND 3.0 - Visual Anomaly and Novelty Detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11110 2025-06-16 cs.CL cs.AI cs.LG 90%

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models

Jaeho Lee, Atharv Chowdhary

机构 * Brown University(布朗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 4 figures, appendix contains 2 additional figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11050 2025-06-13 cs.SE 90%

An Empirical Evaluation of Pre-trained Large Language Models for Repairing Declarative Formal Specifications

Mohannad Alhanahnah, Md Rashedul Hasan, Lisong Xu, Hamid Bagheri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13948 2025-06-03 cs.AI cs.CL cs.LG 90%

CityGPT: Empowering Urban Spatial Cognition of Large Language Models

Jie Feng, Tianhui Liu, Yuwei Du, Siqi Guo, Yuming Lin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学) School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院、北京交通大学) Department of Electronic Engineering, Tsinghua University(电子工程系、清华大学) Department of Urban Planning, Tsinghua University(城市规划系、清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by KDD 2025 Research Track, https://github.com/tsinghua-fib-lab/CityGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01012 2025-05-27 cs.IR cs.AI cs.CL cs.LG 90%

Query Performance Prediction using Relevance Judgments Generated by Large Language Models

Chuan Meng, Negar Arabzadeh, Arian Askari, Mohammad Aliannejadi, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学) University of Waterloo(滑铁卢大学) Leiden University(莱顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACM Transactions on Information Systems (TOIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18488 2025-05-27 cs.LG cs.AI cs.CL 90%

Synthesizing and Adapting Error Correction Data for Mobile Large Language Model Applications

Yanxiang Zhang, Zheng Xu, Shanshan Wu, Yuanbo Zhang, Daniel Ramage

机构 * Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11665 2025-05-20 cs.CL cs.AI cs.LG 90%

Multilingual Prompt Engineering in Large Language Models: A Survey Across NLP Tasks

Shubham Vatsal, Harsh Dubey, Aditi Singh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09831 2025-05-12 cs.LG cs.AI cs.CL cs.NE 90%

Recent Advances in Federated Learning Driven Large Language Models: A Survey on Architecture, Performance, and Security

Youyang Qu, Ming Liu, Tianqing Zhu, Longxiang Gao, Shui Yu, Wanlei Zhou

机构 * Big Data Mining and Analytics(大数据挖掘与分析)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19612 2025-04-29 cs.IR 90%

Keyword-driven Retrieval-Augmented Large Language Models for Cold-start User Recommendations

Hai-Dang Kieu, Minh Duc Nguyen, Thanh-Son Nguyen, Dung D. Le

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 10 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02810 2025-04-28 cs.CL cs.AI cs.LG 90%

Generative Evaluation of Complex Reasoning in Large Language Models

Haowei Lin, Xiangyu Wang, Ruilin Yan, Baizhou Huang, Haotian Ye, Jianhua Zhu, Zihao Wang, James Zou, Jianzhu Ma, Yitao Liang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17975 2025-04-10 cs.CL cs.AI cs.HC cs.LG 90%

Automating Customer Needs Analysis: A Comparative Study of Large Language Models in the Travel Industry

Simone Barandoni, Filippo Chiarello, Lorenzo Cascone, Emiliano Marrale, Salvatore Puccio

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23213 2025-04-01 cs.CL cs.AI cs.LG 90%

RECALL-MM: A Multimodal Dataset of Consumer Product Recalls for Risk Analysis using Computational Methods and Large Language Models

Diana Bolanos, Mohammadmehdi Ataei, Daniele Grandi, Kosa Goucher-Lambert

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16458 2025-03-25 q-fin.RM cs.AI cs.CL cs.LG 90%

Credit Risk Meets Large Language Models: Building a Risk Indicator from Loan Descriptions in P2P Lending

Mario Sanz-Guerrero, Javier Arroyo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Inteligencia Artificial, 28(75) (2025), 220-247

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2025-03-17 cs.LG cs.AI cs.CL 90%

Emergent Abilities in Large Language Models: A Survey

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17055 2025-03-11 cs.CL cs.AI cs.CY cs.LG 90%

Large Language Models Assume People are More Rational than We Really are

Ryan Liu, Jiayi Geng, Joshua C. Peterson, Ilia Sucholutsky, Thomas L. Griffiths

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06263 2025-03-11 cs.CY cs.AI cs.CL cs.LG 90%

Critical Foreign Policy Decisions (CFPD)-Benchmark: Measuring Diplomatic Preferences in Large Language Models

Benjamin Jensen, Ian Reynolds, Yasir Atalan, Michael Garcia, Austin Woo, Anthony Chen, Trevor Howarth

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏