arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2402.16153 2024-02-27 cs.SD cs.AI cs.CL cs.LG cs.MM eess.AS 87%

ChatMusician: Understanding and Generating Music Intrinsically with LLM

Ruibin Yuan, Hanfeng Lin, Yi Wang, Zeyue Tian, Shangda Wu, Tianhao Shen, Ge Zhang, Yuhang Wu, Cong Liu, Ziya Zhou, Ziyang Ma, Liumeng Xue, Ziyu Wang, Qin Liu, Tianyu Zheng, Yizhi Li, Yinghao Ma, Yiming Liang, Xiaowei Chi, Ruibo Liu, Zili Wang, Pengfei Li, Jingcheng Wu, Chenghua Lin, Qifeng Liu, Tao Jiang, Wenhao Huang, Wenhu Chen, Emmanouil Benetos, Jie Fu, Gus Xia, Roger Dannenberg, Wei Xue, Shiyin Kang, Yike Guo

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments GitHub: https://shanghaicannon.github.io/ChatMusician/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15343 2024-02-26 cs.CL cs.AI cs.LG 87%

NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated Data

Sergei Bogdanov, Alexandre Constantin, Timothée Bernard, Benoit Crabbé, Etienne Bernard

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10513 2024-02-22 cs.CV eess.IV 87%

Unifying Image Processing as Visual Prompting Question Answering

Yihao Liu, Xiangyu Chen, Xianzheng Ma, Xintao Wang, Jiantao Zhou, Yu Qiao, Chao Dong

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18168 2024-02-07 cs.CL cs.AI cs.LG 87%

Personas as a Way to Model Truthfulness in Language Models

Nitish Joshi, Javier Rando, Abulhair Saparov, Najoung Kim, He He

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06762 2023-12-22 cs.CL cs.AI cs.IR cs.LG 87%

Shall We Pretrain Autoregressive Language Models with Retrieval? A Comprehensive Study

Boxin Wang, Wei Ping, Peng Xu, Lawrence McAfee, Zihan Liu, Mohammad Shoeybi, Yi Dong, Oleksii Kuchaiev, Bo Li, Chaowei Xiao, Anima Anandkumar, Bryan Catanzaro

专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05741 2023-12-18 cs.CL cs.AI cs.LG 87%

Efficiently Adapting Pretrained Language Models To New Languages

Zoltan Csaki, Pian Pawakapan, Urmish Thakker, Qiantong Xu

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to "The third Neurips Workshop on Efficient Natural Language and Speech Processing 2023" (ENLSP-III)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07700 2023-11-15 cs.CL cs.AI cs.LG 87%

AuthentiGPT: Detecting Machine-Generated Text via Black-Box Language Models Denoising

Zhen Guo, Shangdi Yu

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15780 2023-10-25 cs.SE 87%

Make LLM a Testing Expert: Bringing Human-like Interaction to Mobile GUI Testing via Functionality-aware Decisions

Zhe Liu, Chunyang Chen, Junjie Wang, Mengzhuo Chen, Boyu Wu, Xing Che, Dandan Wang, Qing Wang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted by IEEE/ACM International Conference on Software Engineering 2024 (ICSE 2024). arXiv admin note: substantial text overlap with arXiv:2305.09434

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13230 2023-10-10 cs.LG cs.AI cs.CL 87%

To Repeat or Not To Repeat: Insights from Scaling LLM under Token-Crisis

Fuzhao Xue, Yao Fu, Wangchunshu Zhou, Zangwei Zheng, Yang You

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02301 2023-07-06 cs.CL cs.AI cs.LG 87%

Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes

Cheng-Yu Hsieh, Chun-Liang Li, Chih-Kuan Yeh, Hootan Nakhost, Yasuhisa Fujii, Alexander Ratner, Ranjay Krishna, Chen-Yu Lee, Tomas Pfister

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to Findings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09535 2023-05-30 cs.CL cs.AI cs.LG 87%

BLOOM+1: Adding Language Support to BLOOM for Zero-Shot Prompting

Zheng-Xin Yong, Hailey Schoelkopf, Niklas Muennighoff, Alham Fikri Aji, David Ifeoluwa Adelani, Khalid Almubarak, M Saiful Bari, Lintang Sutawika, Jungo Kasai, Ahmed Baruwa, Genta Indra Winata, Stella Biderman, Edward Raff, Dragomir Radev, Vassilina Nikoulina

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14803 2022-10-27 cs.CL cs.AI cs.LG 87%

Don't Prompt, Search! Mining-based Zero-Shot Learning with Language Models

Mozes van de Kar, Mengzhou Xia, Danqi Chen, Mikel Artetxe

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09338 2022-10-20 cs.CL cs.AI cs.LG 87%

Deep Bidirectional Language-Knowledge Graph Pretraining

Michihiro Yasunaga, Antoine Bosselut, Hongyu Ren, Xikun Zhang, Christopher D Manning, Percy Liang, Jure Leskovec

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at NeurIPS 2022. Code, data, and trained models are available at https://github.com/michiyasunaga/dragon

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05549 2022-10-12 cs.CL cs.AI cs.LG cs.NE 87%

Continual Training of Language Models for Few-Shot Learning

Zixuan Ke, Haowei Lin, Yijia Shao, Hu Xu, Lei Shu, Bing Liu

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26352 2026-03-20 cs.CL cs.AI cs.MA 87%

The Geometry of Dialogue: Graphing Language Models to Reveal Synergistic Teams for Multi-Agent Collaboration

对话的几何学:基于图谱的语言模型揭示多智能体协作的协同团队

Kotaro Furuya, Yuichi Kitagawa

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于交互的自动团队组建框架,通过构建语言模型图谱揭示多智能体协作的协同团队,实验表明其能发现功能一致的团队并优于随机基线。

Comments Accepted at the AAAI-26 Workshop on LLM-based Multi-Agent Systems: Towards Responsible, Reliable, and Scalable Agentic Systems (LaMAS 2026) as an oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18932 2025-10-23 cs.CL cs.LG 87%

Evaluating LLM Story Generation through Large-scale Network Analysis of Social Structures

Hiroshi Nonaka, K. E. Perry

机构 * Soka University of America(索卡大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments This paper has 14 pages and 8 figures. To be presented at the NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10635 2025-07-30 cs.AI cs.CL 87%

Strategist: Self-improvement of LLM Decision Making via Bi-Level Tree Search

Jonathan Light, Min Cai, Weiqin Chen, Guanzhi Wang, Xiusi Chen, Wei Cheng, Yisong Yue, Ziniu Hu

机构 * Rensselaer Polytechnic Institute(拉特加大学) Shenzhen University(深圳大学) University of California, Los Angeles(加州大学洛杉矶分校) NEC laboratories America(NEC美国实验室) California Institute of Technology(加州理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments website: https://llm-strategist.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06664 2025-03-11 cs.LG cs.AI 87%

Exploring LLM Agents for Cleaning Tabular Machine Learning Datasets

Tommaso Bendinelli, Artur Dox, Christian Holz

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 1 main figure, 3 plots, Published at ICLR 2025 Workshop on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12149 2026-08-13 cs.CL 新提交 86%

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期

Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo

机构 * Startlux(星创公司) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) University of Sydney(悉尼大学) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL

AI总结 本研究系统揭示混合线性注意力大语言模型中大规模激活的两种形态,证实其在多架构、多配置等场景下的重复性,明确其对输出门控的响应规律及机制,为相关模型优化提供依据。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10239 2026-08-12 cs.AI 新提交 86%

Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction

超越检测:评估防御型大语言模型(LLM)在实时逐轮交互中对抗AI生成社会工程攻击的能力

Yuqiao Xu, Osama Zafar, Alexander Nemecek, Erman Ayday

专题命中 预训练与数据 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究构建含300例的在线住房语料库,评估5种防御型LLM在实时逐轮与静态设置下对抗AI社会工程攻击的能力,发现防御效果差异大,需单独测量干预等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09126 2026-08-11 cs.CL 新提交 86%

Subjective Multi-Bias Detection with Large Language Models

基于大语言模型的主观多偏见检测

Ruiyu Li, Zhiying Zhu

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本研究针对文本中的主观多偏见问题,采用大语言模型,在WIKIBIAS数据集上检测三类偏见,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08650 2026-08-11 cs.CL 新提交 86%

The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism

大语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行

Jiguo Li

专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL

AI总结 本技术综述梳理了大语言模型混合专家架构的演进,通过五个维度和四个控制平面分析关键技术,揭示其从激活稀疏参数到解耦路由、预算与执行的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05178 2026-08-07 cs.CY cs.AI 新提交 86%

Who Gets Access? Global Region and Academic Status Bias in AI-Generated Academic Gatekeeping Scenarios

谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差

Nouar AlDahoul, Hezerul Abdul Karim, Myles Joshua Toledo Tan

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05539 2026-07-31 cs.AI 版本更新 86%

From Large Language Model Predicates to Logic Tensor Networks: Neurosymbolic Offer Validation in Regulated Procurement

从大型语言模型谓词到逻辑张量网络:神经符号学在受规制采购中的投标验证

Cedric Haufe, Frieder Stolzenburg

机构 * Harz University of Applied Sciences(哈尔茨应用科学大学) Merseburg University of Applied Sciences(梅泽堡应用科学大学) University of New South Wales (UNSW)(新南威尔士大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 本文提出一种结合符号与子符号人工智能的神经符号方法,用于验证受规制公共机构的投标文件,通过语言模型提取信息并结合逻辑张量网络(LTN)进行可审计决策,提升决策的可解释性和合规性。

Comments 17 pages, 2 figures, 4 tables, extended version, with appendix

Journal ref In Diedrich Wolter and Gesina Schwalbe, editors, KI 2026: Advances in Artificial Intelligence -- 49th German Conference on AI, LNAI 16830, pages 236--243, Bremen, Germany, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16900 2026-07-23 cs.AI 版本更新 86%

Environment-free Synthetic Data Generation for API-Calling Agents

用于 API 调用智能体的无环境合成数据生成

Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu, Alexander T Toshev, Oncel Tuzel, Raviteja Vemulapalli

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22759 2026-07-20 cs.AI 版本更新 86%

Towards a General Intelligence and Interface for Wearable Health Data

迈向可穿戴健康数据的通用智能与接口

Girish Narayanswamy, Maxwell A. Xu, A. Ali Heydari, Samy Abdel-Ghaffar, Marius Guerard, Kara Vaillancourt, Zhihan Zhang, Jake Garrison, Levi Albuquerque, Dimitris Spathis, Hong Yu, Hamid Palangi, Xuhai "Orson" Xu, David G. T. Barrett, Joseph Breda, Jed McGiffin, Yubin Kim, Yuwei Zhang, Naghmeh Rezaei, Samuel Solomon, Karan Ahuja, Tim Althoff, Jake Sunshine, Ming-Zher Poh, Benjamin Yetton, Ari Winbush, Nicholas B. Allen, James M. Rehg, Isaac Galatzer-Levy, Yun Liu, John Hernandez, Anupam Pathak, Conor Heneghan, Yuzhe Yang, Ahmed A. Metwally, Pushmeet Kohli, Mark Malhotra, Shwetak Patel, Xin Liu, Daniel McDuff

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学) University of Oregon(俄勒冈大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出一个基于超过一万亿分钟无标签传感器数据预训练的可穿戴健康基础模型,通过联合扩展模型容量和预训练数据量,在35项健康预测任务上实现系统性性能提升,并利用LLM代理自动搜索下游预测头,集成到个人健康代理中以提高相关性和安全性。

Comments Narayanswamy and Xu are co-first authors. McDuff and Liu are co-last authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07748 2026-07-10 cs.LG 新提交 86%

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据

Didula Samaraweera, Anjana Supun, Srinath Perera

机构 * WSO2

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。

Comments 11 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16893 2026-07-07 cs.CL 版本更新 86%

Predicting the Emergence of Induction Heads in Language Model Pretraining

预测语言模型预训练中归纳头的出现

Tatsuya Aoyama, Ethan Gotlieb Wilcox, Nathan Schneider

机构 * Department of Linguistics, Georgetown University(语言学系,乔治城大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL

AI总结 研究训练数据统计特性与归纳头形成关系,通过自然和合成数据设置,发现简单公式可预测归纳头形成点,表面二元重复频率等影响其形成并找到决策边界,局部依赖也影响其形成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20086 2026-06-15 cs.CL 版本更新 86%

OLaPh: Optimal Language Phonemizer

OLaPh: 最优语言音素化器

Johannes Wirth

机构 * Institute for Information Systems at Hof University of Applied Sciences(霍夫应用科学大学信息学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出OLaPh混合框架,结合多语言词典、NLP技术和统计子词分割,在WikiPron基准上显著优于基线,并通过LLM合成语料探索神经泛化能力。

Comments 12 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01255 2026-06-02 cs.CL 86%

Agentic Clustering: Controllable Text Taxonomies via Multi-Agent Refinement

Agentic Clustering: 通过多智能体精炼实现可控文本分类

Simon Löwe, Emily Silcock

机构 * Burning Glass Institute(Burning Glass研究院) Harvard University(哈佛大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种基于多智能体(提议者、合成者、审计者、调查者、批评者)的自适应文本聚类方法,通过编排器LLM动态调整聚类流程,在七个公开基准上实现最先进性能,ARI最高提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏