arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2508.00741 2025-08-04 cs.CL cs.AI 79%

Out-of-Context Abduction: LLMs Make Inferences About Procedural Data Leveraging Declarative Facts in Earlier Training Data

Sohaib Imran, Rob Lamb, Peter M. Atkinson

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21123 2025-07-30 cs.AI cs.LG 79%

Leveraging Generative AI to Enhance Synthea Module Development

Mark A. Kramer, Aanchal Mathur, Caroline E. Adams, Jason A. Walonoski

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Title: Leveraging Generative AI to Enhance Synthea Module Development Word Count: [Approximately 12,000 words] Figures: 3 Tables: 3 Supplementary Material: Extensive appendices with prompts and disease profiles

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21110 2025-07-30 cs.CL cs.AI cs.IR 79%

SemRAG: Semantic Knowledge-Augmented RAG for Improved Question-Answering

Kezhen Zhong, Basem Suleiman, Abdelkarim Erradi, Shijing Chen

机构 * University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学) Qatar University(卡塔尔大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11274 2025-07-30 cs.CL cs.AI 79%

Task Arithmetic for Language Expansion in Speech Translation

Yao-Fei Cheng, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Wen Shen Teo, Siddhant Arora, Shinji Watanabe

机构 * University of Washington(华盛顿大学) Sony Group Corporation(索尼集团) University of Electro-Communications(电通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20752 2025-07-29 cs.CL cs.LG 79%

Multilingual Self-Taught Faithfulness Evaluators

Carlo Alfano, Aymen Al Marjani, Zeno Jonke, Amin Mantrach, Saab Mansour, Marcello Federico

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17924 2025-07-25 cs.LG cs.AI 79%

UrbanPulse: A Cross-City Deep Learning Framework for Ultra-Fine-Grained Population Transfer Prediction

Hongrong Yang, Markus Schlaepfer

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15061 2025-07-22 cs.CL cs.AI 79%

WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization

Zhengwei Tao, Jialong Wu, Wenbiao Yin, Junkai Zhang, Baixuan Li, Haiyang Shen, Kuan Li, Liwen Zhang, Xinyu Wang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14987 2025-07-22 cs.AI cs.CR cs.LG 79%

AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning

Yi Zhang, An Zhang, XiuYu Zhang, Leheng Sheng, Yuxin Chen, Zhenkai Liang, Xiang Wang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13859 2025-07-21 cs.IR cs.AI cs.CL 79%

SPARQL Query Generation with LLMs: Measuring the Impact of Training Data Memorization and Knowledge Injection

Aleksandr Gashkov, Aleksandr Perevalov, Maria Eltsova, Andreas Both

机构 * img/wse-cube-no-shadow.png Web \& Software Engineering (WSE) Research Group, Leipzig University of Applied Sciences (HTWK Leipzig), Leipzig, Germany CBZ München GmbH, Heilbronn, Germany

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Winner of Best Paper Award at the 25th International Conference on Web Engineering (ICWE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03572 2025-07-21 cs.HC cs.AI cs.CL 79%

From Code to Compliance: Assessing ChatGPT's Utility in Designing an Accessible Webpage -- A Case Study

Ammar Ahmed, Margarida Fresco, Fredrik Forsberg, Hallvard Grotli

机构 * Department of Computer Science, Norwegian University of Science and Technology(计算机科学系,挪威科学技术大学) Department of Design, Norwegian University of Science and Technology(设计系,挪威科学技术大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07009 2025-07-17 cs.CL cs.IT cs.LG math.IT 79%

A Mathematical Theory for Learning Semantic Languages by Abstract Learners

Kuo-Yu Liao, Cheng-Shang Chang, Y. -W. Peter Hong

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.LG

Comments V1 was submitted to ISIT 2024 on Jan. 28, 2024. V2 was uploaded to ArXiv on April 13, 2024. V3 was uploaded to ArXiv on May 16, 2024

Journal ref in IEEE Journal on Selected Areas in Communications, vol. 43, no. 7, pp. 2700-2713, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10618 2025-07-16 cs.LG cs.AI 79%

Compute Requirements for Algorithmic Innovation in Frontier AI Models

Peter Barnett

机构 * Machine Intelligence Research Institute, CA, USA(机器智能研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10657 2025-07-14 cs.CL cs.AI 79%

An Empirical Study of Validating Synthetic Data for Formula Generation

Usneek Singh, José Cambronero, Sumit Gulwani, Aditya Kanade, Anirudh Khatry, Vu Le, Mukul Singh, Gust Verbruggen

机构 * Microsoft Bangalore, India(微软印度班加罗尔) Google Atlanta, USA(谷歌美国亚特兰大) Microsoft Redmond, USA(微软美国雷德蒙德) University of Texas at Austin(德克萨斯大学奥斯汀) Microsoft Keerbergen, Belgium(微软比利时基尔伯根)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at Findings of NAACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07217 2025-07-11 cs.AI cs.LG cs.LO 79%

Neurosymbolic Feature Extraction for Identifying Forced Labor in Supply Chains

Zili Wang, Frank Montabon, Kristin Yvonne Rozier

机构 * Iowa State University(爱荷华州立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03253 2025-07-10 cs.CL cs.AI 79%

RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs

Baolong Bi, Shenghua Liu, Xingzhang Ren, Dayiheng Liu, Junyang Lin, Yiwei Wang, Lingrui Mei, Junfeng Fang, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology(计算技术研究所) Key Laboratory of Network Data Science and Technology, ICT, CAS(网络数据科学与技术重点实验室) State Key Laboratory of AI Safety(人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of California Merced(加州大学默塞德分校) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04480 2025-07-08 cs.LG cs.AI 79%

Source Attribution in Retrieval-Augmented Generation

Ikhtiyor Nematov, Tarik Kalai, Elizaveta Kuzmenko, Gabriele Fugagnoli, Dimitris Sacharidis, Katja Hose, Tomer Sagi

机构 * Université Libre de Bruxelles, Belgium(布鲁塞尔自由大学) Aalborg University, Denmark(奥尔堡大学) University of Padova, Italy(帕多瓦大学) TU Wien, Austria(维也纳技术大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22491 2025-07-01 cs.CL cs.AI cs.CY 79%

PromptAug: Fine-grained Conflict Classification Using Data Augmentation

Oliver Warke, Joemon M. Jose, Faegheh Hasibi, Jan Breitsohl

机构 * University of Glasgow(格拉斯哥大学) Radboud University(拉德堡德大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22343 2025-06-30 stat.ML cs.CL cs.LG stat.ME 79%

Optimal Estimation of Watermark Proportions in Hybrid AI-Human Texts

Xiang Li, Garrett Wen, Weiqing He, Jiayuan Wu, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19399 2025-06-25 cs.CL cs.AI 79%

Automated Detection of Pre-training Text in Black-box LLMs

Ruihan Hu, Yu-Ming Shang, Jiankun Peng, Wei Luo, Yazhe Wang, Xi Zhang

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications, China(可信分布式计算与服务重点实验室,北京邮电大学,中国) Zhongguancun Laboratory, China(中关村实验室,中国)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18898 2025-06-24 cs.CV cs.AI cs.CL cs.MM 79%

Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations

Jiaming Han, Hao Chen, Yang Zhao, Hanyu Wang, Qi Zhao, Ziyan Yang, Hao He, Xiangyu Yue, Lu Jiang

机构 * CUHK MMLab(香港中文大学MML实验室) ByteDance Seed(字节跳动种子)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Project page: https://tar.csuhan.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15712 2025-06-23 cs.LG cs.AI 79%

BatteryBERT for Realistic Battery Fault Detection Using Point-Masked Signal Modeling

Songqi Zhou, Ruixue Liu, Yixing Wang, Jia Lu, Benben Jiang

机构 * Department of Automation Tsinghua University Beijing, China(自动化系 清华大学 北京中国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11702 2025-06-16 cs.CL cs.AI 79%

Configurable Preference Tuning with Rubric-Guided Synthetic Data

Víctor Gallego

机构 * Komorebi AI Technologies, Madrid, Spain(Komorebi人工智能技术公司)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICML 2025 Workshop on Models of Human Feedback for AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14021 2025-06-09 cs.CL cs.LG q-bio.QM 79%

HIGHT: Hierarchical Graph Tokenization for Molecule-Language Alignment

Yongqiang Chen, Quanming Yao, Juzheng Zhang, James Cheng, Yatao Bian

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

Comments ICML2025, 27 pages, 7 figures, 23 tables; project page: https://higraphllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08541 2025-06-09 cs.CL cs.LG 79%

Where is the signal in tokenization space?

Renato Lui Geh, Honghua Zhang, Kareem Ahmed, Benjie Wang, Guy Van den Broeck

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03198 2025-06-06 cs.CL cs.HC cs.LG stat.AP stat.ML 79%

The Impossibility of Fair LLMs

Jacy Anthis, Kristian Lum, Michael Ekstrand, Avi Feller, Chenhao Tan

机构 * University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Drexel University(德雷塞尔大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Published in ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06474 2025-06-05 cs.IR cs.AI cs.CL 79%

ROGRAG: A Robustly Optimized GraphRAG Framework

Zhefan Wang, Huanjun Kong, Jie Ying, Wanli Ouyang, Nanqing Dong

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments ACL2025 demo track, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07045 2025-06-05 cs.CR cs.AI cs.CL cs.CY 79%

Scalable and Ethical Insider Threat Detection through Data Synthesis and Analysis by LLMs

Haywood Gelman, John D. Hastings

机构 * The Beacom College of Computer and Cyber Sciences(贝科姆计算机与网络科学学院) Dakota State University(达科他州立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 6 pages, 0 figures, 8 tables

Journal ref 2025 IEEE 13th International Symposium on Digital Forensics and Security (ISDFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10495 2025-05-26 cs.LG cs.CL 79%

RouteNator: A Router-Based Multi-Modal Architecture for Generating Synthetic Training Data for Function Calling LLMs

Vibha Belavadi, Tushar Vatsa, Dewang Sultania, Suhas Suresha, Ishita Verma, Cheng Chen, Tracy Holloway King, Michael Friedrich

机构 * Adobe Inc.(Adobe公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 4th International Workshop on Knowledge-Augmented Methods for Natural Language Processing

Journal ref https://aclanthology.org/2025.knowledgenlp-1.10/ KnowledgeNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12100 2025-05-20 cs.CL cs.AI 79%

Improving Fairness in LLMs Through Testing-Time Adversaries

Isabela Pereira Gregio, Ian Pons, Anna Helena Reali Costa, Artur Jordão

机构 * Escola Politécnica, Universidade de São Paulo(圣保罗大学理工大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20094 2025-05-09 cs.CL cs.LG 79%

Scaling Synthetic Data Creation with 1,000,000,000 Personas

Tao Ge, Xin Chan, Xiaoyang Wang, Dian Yu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏