arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137794 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12318 篇

2308.06507 2023-08-15 cs.CL 89%

AutoConv: Automatically Generating Information-seeking Conversations with Large Language Models

Siheng Li, Cheng Yang, Yichun Yin, Xinyu Zhu, Zesen Cheng, Lifeng Shang, Xin Jiang, Qun Liu, Yujiu Yang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to ACL 2023 Main Conference (Short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09814 2023-06-19 eess.AS cs.CL 89%

Investigating the Utility of Surprisal from Large Language Models for Speech Synthesis Prosody

Sofoklis Kakouros, Juraj Šimko, Martti Vainio, Antti Suni

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at SSW 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07899 2023-06-14 cs.CL cs.CY 89%

Artificial Artificial Artificial Intelligence: Crowd Workers Widely Use Large Language Models for Text Production Tasks

Veniamin Veselovsky, Manoel Horta Ribeiro, Robert West

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04980 2023-06-09 cs.CL cs.SD eess.AS 89%

Assessing Phrase Break of ESL Speech with Pre-trained Language Models and Large Language Models

Zhiyi Wang, Shaoguang Mao, Wenshan Wu, Yan Xia, Yan Deng, Jonathan Tien

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by InterSpeech 2023. arXiv admin note: substantial text overlap with arXiv:2210.16029

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03809 2023-06-07 cs.CY cs.AI 89%

Can large language models democratize access to dual-use biotechnology?

Emily H. Soice, Rafael Rocha, Kimberlee Cordova, Michael Specter, Kevin M. Esvelt

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 6 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07830 2023-05-23 cs.CL 89%

Prompting Language Models for Linguistic Structure

Terra Blevins, Hila Gonen, Luke Zettlemoyer

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.CL

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13047 2023-05-19 cs.CL 89%

AugESC: Dialogue Augmentation with Large Language Models for Emotional Support Conversation

Chujie Zheng, Sahand Sabour, Jiaxin Wen, Zheng Zhang, Minlie Huang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL

Comments Findings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09268 2023-02-21 cs.CL 89%

Bag of Tricks for Effective Language Model Pretraining and Downstream Adaptation: A Case Study on GLUE

Qihuang Zhong, Liang Ding, Keqin Peng, Juhua Liu, Bo Du, Li Shen, Yibing Zhan, Dacheng Tao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

Comments Technical report. arXiv admin note: text overlap with arXiv:2212.01853

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06710 2023-01-24 cs.CL 89%

Large Language Models are few(1)-shot Table Reasoners

Wenhu Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to Findings of EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01853 2022-12-06 cs.CL 89%

Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE

Qihuang Zhong, Liang Ding, Yibing Zhan, Yu Qiao, Yonggang Wen, Li Shen, Juhua Liu, Baosheng Yu, Bo Du, Yixin Chen, Xinbo Gao, Chunyan Miao, Xiaoou Tang, Dacheng Tao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);foundation model(abstract);分类 cs.CL

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12302 2022-10-25 cs.CL 89%

What do Large Language Models Learn beyond Language?

Avinash Madasu, Shashank Srivastava

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments Accepted at the Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10841 2022-10-21 cs.CL cs.CV 89%

Prompting through Prototype: A Prototype-based Prompt Learning on Pretrained Vision-Language Models

Yue Zhang, Hongliang Fei, Dingcheng Li, Tan Yu, Ping Li

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03905 2022-04-25 cs.CL 89%

BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model

Hongyi Yuan, Zheng Yuan, Ruyi Gan, Jiaxing Zhang, Yutao Xie, Sheng Yu

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted by BioNLP 2022, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20630 2026-07-24 cs.DB cs.AI cs.CL 新提交 89%

Demonstrating GenDB: Instance-Optimized and Customized Query Processing Code Generation via LLM Agents

展示GenDB:通过大语言模型代理实现实例优化和定制化查询处理代码生成

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对传统查询处理引擎扩展难题,提出GenDB生成式查询引擎,借助大语言模型代理生成代码。核心方法是通过LLM agents为特定场景生成优化代码,主要贡献是展示其工作流程、性能优势并提供用户探索平台。

Comments Accepted by VLDB 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00274 2026-07-02 cs.CL cs.AI 新提交 89%

SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

SEFORA:学生论文反馈语料库及LLM反馈评估框架

Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 为解决大规模写作反馈中缺乏真实课堂反馈语料和评估方法的问题,构建了SEFORA语料库和UniMatch评估框架,实验表明LLM生成的反馈与教师反馈一致性低(F1≤0.4)。

Comments Under review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22079 2026-06-23 cs.CL cs.LG 新提交 89%

Where Does the Signal Live? A Web Data Recipe for Medical Encoder Pretraining

信号在哪里?医学编码器预训练的网页数据配方

Bofeng Huang, Jacques Sun, Diane Bouchacourt, Nicolas Barascud, Fajwel Fogel

机构 * Doctolib

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对医学领域编码器预训练数据稀缺问题,提出医学术语密度过滤和信号放大改写两种互补方法,在法语医学NLP上构建FineMed语料库和DoctoBERT编码器,性能优于现有方法。

Comments Code, models, and data: https://github.com/doctolib-lab/doctobert

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22108 2026-06-15 cs.LG cs.AI 版本更新 89%

Learning What to Predict: Downstream-Guided Task Design for Continued Pretraining

学习预测什么:下游引导的持续预训练任务设计

Shuqi Ke, Giulia Fanti

机构 * Department of ECE(电子工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,summary_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出V-pretraining方法,通过轻量级任务设计器为无标签批次构建目标或视图,利用下游损失的一阶减少作为反馈,指导自监督更新,提升目标能力而不损害泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 89%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27379 2026-05-29 cs.AI cs.CL 89%

Soro: A Lightweight Foundation Model and Chatbot for Tajik

Soro: 一种轻量级塔吉克语基础模型与聊天机器人

Stanislav Liashkov, Haitz Sáez de Ocáriz Borde, Azizjon Azimi, Khushbakht Shoymardonov, Shuhratjon Khalilbekov, Bonu Boboeva

专题命中 预训练与数据 :foundation model(title);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对塔吉克斯坦计算和连接受限环境,提出基于Gemma 3的塔吉克语专用对话大语言模型Soro,通过持续预训练和监督微调,在塔吉克语基准测试上显著优于同尺寸基线,并支持量化部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14062 2026-05-15 cs.AI cs.CL 89%

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成

Anjir Ahmed Chowdhury, Syed Zawad, Feng Yan

机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12452 2026-05-13 cs.CL cs.AI cs.CY 89%

The Algorithmic Caricature: Auditing LLM-Generated Political Discourse Across Crisis Events

算法漫画:在危机事件中审计LLM生成的政治言论

Gunjan, Sidahmed Benabderrahmane, Talal Rahwan

机构 * New York University (NYUAD), Division of Science, Computer Science Department(纽约大学(NYUAD),科学学院,计算机科学系)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比真实与生成的政治言论,发现生成内容在情感强度、结构规律性和词汇框架上不如真实言论真实,提出了'漫画差距'作为评估生成内容社会真实性的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08875 2026-05-12 cs.LG cs.AI 89%

When Tables Leak: Attacking String Memorization in LLM-Based Tabular Data Generation

表格泄露:攻击基于大语言模型的表格数据生成中的字符串记忆化

Joshua Ward, Bochao Gu, Chi-Hua Wang, Guang Cheng

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了基于大语言模型的表格数据生成中字符串记忆化带来的隐私风险,提出LevAtt攻击方法并设计防御策略,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05227 2026-05-08 cs.LG cs.AI 89%

Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods

重新思考大语言模型训练中的数据整理:在线重加权优于离线方法

Wanru Zhao, Yihong Chen, Yuzhi Tang, Wentao Ma, Shengchao Hu, Shell Xu Hu, Alex Iacob, Abhinav Mehrotra, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) OATML, University of Oxford(牛津大学OATML实验室) University of Toronto(多伦多大学) Shanghai Jiao Tong University(上海交通大学) Samsung AI Center(三星人工智能中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出ADAPT框架,通过动态在线重加权提升模型泛化能力,实验显示其在指令微调和大规模预训练中优于传统离线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23475 2026-04-28 cs.LG cs.CL 89%

Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

超节点和光环:LLM前馈层中的损失关键枢纽

Audrey Cherilyn, Houman Safaai

机构 * Kempner Institute at Harvard University(哈佛大学凯普纳研究所)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究Transformer前馈网络中通道级重要性的组织方式,发现损失敏感性集中于少量通道,通过损失代理展示超节点和光环结构,验证保护核心对结构化剪枝的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15861 2026-04-23 cs.CL cs.AI 89%

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

CAST:实现稳定的大语言模型文本分析用于数据分析

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CAST通过算法提示和先思考后发言提升大语言模型在表格数据分析中的输出稳定性,实验表明其在多个基准上表现最佳,稳定性提升达16.2%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16423 2026-04-21 cs.LG cs.AI 89%

Shifting the Gradient: Understanding How Defensive Training Methods Protect Language Model Integrity

梯度偏移:理解防御性训练方法如何保护语言模型完整性

Satchel Grant, Victor Gillioz, Jake Ward, Thomas McGrath

机构 * Stanford University(斯坦福大学) MATS

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 本文通过对比PPS和IP两种防御性训练方法,揭示其在保护语言模型完整性上的不同机制,发现PPS通过调整激活梯度抑制特质表达,而IP则通过解释数据中的特质表达来减少预测损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04781 2025-09-08 cs.CY cs.AI cs.LG 89%

The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models

Danielle Ensign, Henry Sleight, Kyle Fish

专题命中 预训练与数据 :LLM(title);large language model(title);language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09709 2025-04-28 cs.LG cs.CL 89%

GOFA: A Generative One-For-All Model for Joint Graph Language Modeling

Lecheng Kong, Jiarui Feng, Hao Liu, Chengsong Huang, Jiaxin Huang, Yixin Chen, Muhan Zhang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Peking University(北京大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01832 2025-01-06 cs.CL cs.LG 89%

Time Series Language Model for Descriptive Caption Generation

Mohamed Trabelsi, Aidan Boyd, Jin Cao, Huseyin Uzunalioglu

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04646 2024-10-29 cs.CL cs.LG 89%

Efficacy of Large Language Models in Systematic Reviews

Aaditya Shah, Shridhar Mehendale, Siddha Kanthi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Both Shah and Mehendale contributed equally to this work; order of authorship is random. This paper will be published in the proceedings of The 2nd International Conference on Foundation and Large Language Models (FLLM2024) in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏