arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12365 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2402.08030 2024-02-14 cs.HC cs.AI cs.LG 86%

Why and When LLM-Based Assistants Can Go Wrong: Investigating the Effectiveness of Prompt-Based Interactions for Software Help-Seeking

Anjali Khurana, Hari Subramonyam, Parmit K Chilana

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in the Proceedings of the 29th International Conference on Intelligent User Interfaces (IUI'24), March 18--21, 2024, in Greenville, SC, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07525 2024-01-19 cs.CL cs.AI 86%

TAROT: A Hierarchical Framework with Multitask Co-Pretraining on Semi-Structured Data towards Effective Person-Job Fit

Yihan Cao, Xu Chen, Lun Du, Hao Chen, Qiang Fu, Shi Han, Yushu Du, Yanbin Kang, Guangming Lu, Zi Li

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ICASSP 2024 camera ready. 5 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16867 2023-12-01 cs.CL cs.AI 86%

The Falcon Series of Open Language Models

Ebtesam Almazrouei, Hamza Alobeidli, Abdulaziz Alshamsi, Alessandro Cappelli, Ruxandra Cojocaru, Mérouane Debbah, Étienne Goffinet, Daniel Hesslow, Julien Launay, Quentin Malartic, Daniele Mazzotta, Badreddine Noune, Baptiste Pannier, Guilherme Penedo

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11462 2023-11-27 cs.CL cs.AI 86%

LLM aided semi-supervision for Extractive Dialog Summarization

Nishant Mishra, Gaurav Sahu, Iacer Calixto, Ameen Abu-Hanna, Issam H. Laradji

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments to be published in EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09006 2023-11-16 cs.CL cs.LG 86%

Data Similarity is Not Enough to Explain Language Model Performance

Gregory Yauney, Emily Reif, David Mimno

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Journal ref Published in EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06827 2023-11-08 cs.CL cs.LG 86%

Teaching Language Models to Hallucinate Less with Synthetic Tasks

Erik Jones, Hamid Palangi, Clarisse Simões, Varun Chandrasekaran, Subhabrata Mukherjee, Arindam Mitra, Ahmed Awadallah, Ece Kamar

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00871 2023-11-03 cs.LG cs.CL stat.ML 86%

Pretraining Data Mixtures Enable Narrow Model Selection Capabilities in Transformer Models

Steve Yadlowsky, Lyric Doshi, Nilesh Tripuraneni

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00576 2023-10-03 cs.CL cs.LG 86%

GrowLength: Accelerating LLMs Pretraining by Progressively Growing Training Length

Hongye Jin, Xiaotian Han, Jingfeng Yang, Zhimeng Jiang, Chia-Yuan Chang, Xia Hu

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08632 2023-09-19 cs.CL cs.AI 86%

Pretraining on the Test Set Is All You Need

Rylan Schaeffer

专题命中 预训练与数据 :pretraining(title);LLM(abstract);language model(abstract);foundation model(abstract)

Comments 3 pages, satire

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04564 2023-09-12 cs.CL cs.LG 86%

When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale

Max Marion, Ahmet Üstün, Luiza Pozzobon, Alex Wang, Marzieh Fadaee, Sara Hooker

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00946 2023-08-22 cs.CL cs.AI 86%

Teaching Smaller Language Models To Generalise To Unseen Compositional Questions

Tim Hartill, Neset Tan, Michael Witbrock, Patricia J. Riddle

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02294 2023-06-06 cs.CL cs.CY cs.LG 86%

Exposing Bias in Online Communities through Large-Scale Language Models

Celine Wald, Lukas Pfahler

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06742 2023-05-22 cs.CL cs.LG cs.PL cs.SE 86%

ERNIE-Code: Beyond English-Centric Cross-lingual Pretraining for Programming Languages

Yekun Chai, Shuohuan Wang, Chao Pang, Yu Sun, Hao Tian, Hua Wu

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at ACL 2023 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01907 2022-12-06 cs.CL cs.LG stat.ML 86%

Understanding How Model Size Affects Few-shot Instruction Prompting

Ayrton San Joaquin, Ardy Haroen

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11086 2026-07-07 cs.SE cs.AI 版本更新 86%

Evaluating LLM-Based Regression Test Generation

基于大语言模型的回归测试生成评估

Jing Liu, Seongmin Lee, Eleonora Losiouk, Marcel Böhme

机构 * MPI-SP(Max Planck Institute for Software Process Engineering) University of California at Los Angeles(加州大学洛杉矶分校) University of Padua(帕多瓦大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用大语言模型为特定程序即时生成回归测试,将其作为机器翻译任务,通过对多个项目测试,反馈导向的零样本原型Cleverest表现良好,还探讨了提交消息对其效果的影响。

Comments 23 pages. Published in PACMSE Volume 3, Issue FSE. Artifact of Paper "Evaluating LLM-based Regression Test Generation": https://dl.acm.org/do/10.5281/zenodo.19616584

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06500 2025-06-10 cs.CL 86%

Improving LLM-Powered EDA Assistants with RAFT

Luyao Shi, Michael Kazda, Charles Schmitter, Hemlata Gupta

机构 * IBM Research San Jose, CA(IBM桑 Jose研究院) IBM Infrastructure Poughkeepsie, NY(IBM基础设施部)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted paper at IEEE International Conference on LLM-Aided Design, 2025 (LAD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16797 2024-06-11 cs.CL 86%

Set the Clock: Temporal Alignment of Pretrained Language Models

Bowen Zhao, Zander Brumbaugh, Yizhong Wang, Hannaneh Hajishirzi, Noah A. Smith

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

Comments Accepted as Findings of ACL 2024. Our code and data is available at https://github.com/yizhongw/llm-temporal-alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11348 2026-08-13 cs.CR 新提交 86%

An Empirical Study of Output-to-Input Loops for Black-Box Backdoor Detection in Fine-Tuned Open-Weight LLMs

针对微调开源权重大语言模型的黑盒后门检测的输出-输入循环的实证研究

Md. Nahid Hasan, Mohammad Arif Hossain

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出self-feeding黑盒测试方法,通过将LLM自身输出反馈为输入检测后门,在6个开源权重LLM上实现高模型级检测精度,仅需文本级查询访问即可作为模型安全的低成本初查手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22213 2026-08-11 cs.LG cs.AI cs.CL 版本更新 86%

SPA: A Simple but Tough-to-Beat Baseline for Knowledge Injection

SPA:一个简单但难以被击败的基线模型用于知识注入

Kexian Tang, Jiani Wang, Shaowen Wang, Kaifeng Lyu

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SPA基线模型,通过精心设计的提示生成大规模合成数据以增强模型知识,实验表明其优于现有方法,并揭示了先前方法的两个关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20346 2026-07-23 cs.CE physics.flu-dyn 新提交 86%

IteraSim RAG: A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM-Based Computational Fluid Dynamics

IteraSim RAG:基于OpenFOAM的计算流体动力学的多阶段检索增强智能后端

Pratyush Kumar

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对OpenFOAM配置CFD案例的难题,提出IteraSim RAG。通过LLM扩展查询、多种融合与重排策略及多智能体分工协作,结合规范知识层。在28个案例基准测试中表现良好,能完成配置、诊断修复问题,还公布相关内容以保障可重复性。

Comments 40 pages, 7 figures, 5 tables. Submitted to Computer Physics Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27559 2026-06-29 cs.IR 新提交 86%

A Sensitivity-Aware Test Collection for Search Among Personal Information

一种面向个人信息搜索的敏感性感知测试集

Jack McKechnie, Graham McDonald, Craig Macdonald

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 为解决个人信息搜索中的敏感信息泄露问题,构建了包含敏感与非敏感标注的Enron邮件子集测试集,通过众包和LLM扩展查询与相关性评估,并提供了基线性能。

Comments SIGIR 2026 Resource Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26127 2026-06-26 cs.SI cs.CR 新提交 86%

Account-History Features for Social Bot Detection in the Era of Large Language Models

大语言模型时代社交机器人检测中的账户历史特征

Gaurang Katyal

专题命中 预训练与数据 :language model(title,abstract);large language model(title)

AI总结 针对大语言模型可生成类人文本导致内容特征失效的问题,提出利用攻击者难以低成本操纵的账户历史特征(如账户年龄、粉丝数等),在随机森林模型上实现ROC-AUC 0.977,显著优于纯内容基线,且对对抗性文本改写具有鲁棒性。

Comments Code and result tables: https://github.com/gaurangkatyal/behavioral-bot-detection (Zenodo DOI: 10.5281/zenodo.20358445)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03300 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 86%

R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?

R1-SyntheticVL:生成模型的合成数据是否已为多模态大语言模型做好准备?

Jingyi Zhang, Tianyi Lin, Huanjin Yao, Xiang Lan, Shunyu Liu, Jiaxing Huang

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出集体对抗数据合成(CADS)方法,通过集体智能和对抗学习自动生成高质量、多样且具有挑战性的多模态数据,用于增强多模态大语言模型(MLLM)在复杂现实任务中的性能。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15334 2026-05-18 cs.LG cs.AI cs.CL cs.SE 86%

From I/O to Code with Discovery Agent

从输入输出到代码:发现代理

Yihong Dong, Jiaru Qian, Haoran Zhang, Peixu Wang, Binhua Li, Zhi Jin, Yongbin Li, Ge Li, Xiaokang Yang, Xue Jiang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Wuhan University(武汉大学) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiaotong University(上海交通大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DIO-Agent,通过将IO2Code视为离散程序空间的进化搜索,利用LLM作为突变算子,结合执行误差信号指导突变,解决从输入输出行为合成代码的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27624 2026-05-01 cs.CL cs.AI cs.CY cs.HC cs.LG 86%

Mapping how LLMs debate societal issues when shadowing human personality traits, sociodemographics and social media behavior

映射LLMs在模仿人类性格特征、社会人口统计数据和社会媒体行为时如何辩论社会问题

Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过CDS数据集研究LLMs在不同社会和情境提示下生成的辩论内容变化,分析其社会议题立场和情感表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03242 2026-04-30 cs.CR 86%

SLIM: Stealthy Low-Coverage Black-Box Watermarking via Latent-Space Confusion Zones

SLIM:通过潜在空间混淆区实现隐蔽的低覆盖率黑盒水印

Hengyu Wu, Yang Cao

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 SLIM通过利用LLM内在属性诱导潜在空间混淆区,实现低覆盖率黑盒数据溯源验证,兼具隐蔽性与模型实用性,提供现代LLM流水线中保护训练数据的稳健解决方案。

Comments Accept the findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01595 2026-04-28 cs.CL cs.AI cs.LG 86%

Always Tell Me The Odds: Fine-grained Conditional Probability Estimation

始终告诉我概率:细粒度条件概率估计

Liaoyaqi Wang, Zhengping Jiang, Anqi Liu, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种最先进的模型,用于在上下文条件下对命题进行细粒度概率估计。通过结合人类和合成数据创建与评估、扩大模型规模和改进监督,提出了一系列强而精确的概率估计模型,在依赖条件概率估计的任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14616 2026-04-17 cs.CL cs.AI cs.LG 86%

Retrieve, Then Classify: Corpus-Grounded Automation of Clinical Value Set Authoring

检索,然后分类:基于语料库的临床价值集编纂自动化

Sumit Mukherjee, Juan Shu, Nairwita Mazumder, Tate Kernell, Celena Wheeler, Shannon Hastings, Chris Sidey-Gibbons

机构 * Oracle Health Data Intelligence(Oracle健康数据智能)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出RASC方法,通过检索现有价值集生成候选池,再分类筛选代码,提升临床价值集编纂效率,构建首个大规模基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03826 2026-04-16 cs.SE 86%

Context Matters: Evaluating Context Strategies for Automated ADR Generation Using LLMs

上下文至关重要:使用LLM评估自动化ADR生成的上下文策略

Aviral Gupta, Rudra Dhar, Daniel Feitosa, Karthik Vaidhyanathan

专题命中 预训练与数据 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了不同上下文策略对自动化ADR生成质量的影响,发现上下文提示显著提升生成准确性,小范围历史记录在质量和效率间取得最佳平衡。

Comments 11 pages, 5 diagrams, Accepted at EASE Conference 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20799 2026-02-25 cs.SE 86%

Unseen-Codebases-Domain Data Synthesis and Training Based on Code Graphs

基于代码图的未见代码库数据合成与训练

Guangsheng Ou, Qiming Zhang, Sirong Chen, Anji Li, Dong Xu, Tiancheng Luo, Dekun Dai, Cuiyun Gao, Long Wang, Jun Zhou, Mingwei Liu, Zibin Zheng

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 提出UCD-Training框架,通过代码图构建和两阶段训练,提升模型对未见代码库的推理能力和数据合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏