arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

cmp-lg/9408010 2009-11-30 cmp-lg cs.CL 79%

On Using Selectional Restriction in Language Models for Speech Recognition

Joerg P. Ueberla

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments feedback is welcome to ueberla@cs.sfu.ca

详情

展开后加载摘要…

URL PDF HTML 收藏
cmp-lg/9612002 2009-11-30 cmp-lg cs.CL 79%

Specialized Language Models using Dialogue Predictions

Cosmin Popovici, Paolo Baggia

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments 4 pages, LaTeX, 2 eps figures, uses icassp.sty, a4.sty and psfig.tex; to appear in Proc. of ICASSP 1997, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0108005 2009-11-30 cs.CL 79%

A Bit of Progress in Language Modeling

Joshua Goodman

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments 73 pages, extended version of paper to appear in Computer Speech and Language

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0105016 2009-11-30 cs.CL 79%

Probabilistic top-down parsing and language modeling

Brian Roark

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments 28 pages, 6 tables, 8 figures. To appear in Computational Linguistics 27(2), June 2001

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0104019 2009-11-30 cs.CL 79%

Dynamic Nonlocal Language Modeling via Hierarchical Topic-Based Adaptation

Radu Florian, David Yarowsky

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments 8 pages, 29 figures, presented at ACL99, College Park, Maryland

Journal ref Proceedings of the 37th Annual Meeting of the ACL, pages 167-174, College Park, Maryland

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0001022 2009-11-30 cs.CL 79%

Recognition Performance of a Structured Language Model

Ciprian Chelba, Frederick Jelinek

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments 4 pages

Journal ref Proceedings of Eurospeech, 1999, pp. 1567-1570, Budapest, Hungary

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19200 2026-08-21 cs.CL cs.AI 新提交 79%

Transformer Models for Text Summarization: A Comparative Study of BART, BERT, and RoBERTa

用于文本摘要的Transformer模型:BART、BERT与RoBERTa的对比研究

Daisy Aptovska, Vinayak Elangovan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对文本摘要任务,对比分析BERT、RoBERTa、BART三款Transformer模型的架构、预训练策略及在抽取式、生成式摘要任务中的适用性,为相关应用提供参考。

Comments 1- pages

Journal ref International Journal of Artificial Intelligence and Applications (IJAIA), Vol.17, No.3, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17843 2026-08-19 cs.CL cs.AI 新提交 79%

Encoded but Not Actionable: Auditing the Decode-Generate-Steer Gap in Frozen LLMs for Geometric Constraints

已编码但不可执行:审计冻结大语言模型中几何约束的解码-生成-引导差距

Man Liang, Xinzhao Cheng, Faizan Wajid

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究以参数化CAD约束为测试平台,审计6个冻结LLMs的解码-生成-引导差距,发现几何关系可解码性与生成、引导能力存在差异,区分了编码与表达控制失败。

Comments 13 pages, 7 figures, 8 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15548 2026-08-18 cs.LG cs.AI 新提交 79%

Spectral Saliency for Machine Unlearning

用于机器遗忘的光谱显著性

Cedar Site Bai, Amber Yijia Zheng, Raymond A. Yeh, Brian Bullins

机构 * Purdue University(普渡大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对机器遗忘问题,受Muon启发提出光谱显著性遗忘(SSU)方法,通过对弱奇异分量设阈值更新,在图像分类器、扩散模型和LLM上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06015 2026-08-07 cs.LG cs.AI 新提交 79%

ProDVI: Programmatic Dynamics Priors for Value Network Initialization

ProDVI:用于价值网络初始化的程序化动态先验

Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 ProDVI是利用大型语言模型生成的Python函数初始化RL智能体的框架,通过预训练价值网络编码器,提升无模型RL算法的样本效率,无需依赖数据集或模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22146 2026-08-03 cs.CL cs.LG 版本更新 79%

FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale

精细指令:将合成指令扩展到预训练规模

Ajay Patel, Colin Raffel, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型监督训练数据有限的问题,提出将互联网规模预训练文档知识转化为合成指令和答案训练对的程序,生成FineInstructions数据集,经实验验证该方法在预训练中表现优于其他技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13187 2026-08-03 cs.CY cs.AI cs.CL 版本更新 79%

"Not in My Backyard": LLMs Uncover Online and Offline Social Biases Against Homelessness

"Not in My Backyard":LLMs揭示针对无家可归者的在线和线下社会偏见

Jonathan A. Karr, Benjamin F. Herbst, Matthew L. Sisk, Xueyun Li, Ting Hua, Matthew Hauenstein, Georgina Curto, Nitesh V. Chawla

机构 * University of Notre Dame(诺丁汉大学) United Nations University Institute in Macau(联合国大学澳门研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过大规模数据集和LLM训练揭示了针对无家可归者的在线和线下社会偏见,展示了数据量对模型性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09311 2026-07-30 cs.LG cs.AI 79%

Adaptive political surveys and GPT-4: Tackling the cold start problem with simulated user interactions

Fynn Bachmann, Daan van der Weijden, Lucien Heitz, Cristina Sarasua, Abraham Bernstein

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 23 pages. Under review at PLOS One

Journal ref PLOS ONE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00883 2026-07-29 cs.LG cs.AI cs.CY stat.AP 79%

Knowledge without Wisdom: Measuring Misalignment between LLMs and Intended Impact

无智慧的知识:衡量大语言模型与预期影响之间的不一致

Michael Hardy, Yunsung Kim

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了大语言模型在基准测试和下游任务中的对齐问题,发现模型行为与专家人类行为存在较大偏差,且常见预训练方法导致了显著的不一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14717 2026-07-28 cs.LG cs.AI math.OC stat.ML 版本更新 79%

Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling

跷跷板:通过平衡学习率和批量调度加速训练

Alexandru Meterez, Depen Morwani, Jingfeng Wu, Costin-Andrei Oncescu, Cengiz Pehlevan, Sham Kakade

机构 * Harvard University(哈佛大学) Kempner Institute at Harvard University(哈佛大学 Kempner 机构) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究如何加速大语言模型预训练,提出Seesaw框架,通过平衡学习率和批量调度,在保留损失动态时减少串行步骤。理论上给出相关等效性证明并扩展,实验表明该框架能在相同浮点运算量下减少时钟时间,接近理论极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14186 2026-07-27 cs.SE cs.AI cs.LG 版本更新 79%

NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs

NexForge:通过需求优先合成扩展可执行智能体任务

Jiarong Zhao, Zhikai Lei, Zhiheng Xi, Rui Zheng, Hang Yan, Jie Zhou, Qin Chen, Liang He

专题命中 预训练与数据 :LLM(abstract);post-training(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 研究针对可执行智能体训练数据扩展瓶颈,提出需求优先框架NexForge,通过需求发现、任务编译等步骤生成训练数据,提升了模型在多个基准测试中的性能,助力Nex-N2模型达到开源先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08646 2026-07-10 cs.CL cs.AI 新提交 79%

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX:通过自适应编程编辑大规模精炼预训练数据

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

机构 * Peking University(北京大学) ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08011 2026-07-10 cs.CR cs.AI cs.IR cs.LG 新提交 79%

Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions

小心你的自动补全内容:后门代码补全的取证溯源

Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(德克萨斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大型语言模型代码补全易受后门攻击的问题,提出CodeTracer取证框架,它仅靠微调语料库和错误补全事件,提取行为指纹,经推理将不安全逻辑归因于特定后门数据,评估显示其有高准确性、低误识率和强鲁棒性。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06116 2026-07-10 cs.AI cs.CL cs.CY 79%

The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety

在大语言模型中的同质化问题:迈向人工智能安全中的有意义多样性

Ian Rios-Sialer

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型中同质化问题,提出通过编码价值观系统来促进多样性,通过实验揭示性别偏见并引入xeno-reproduction概念以缓解同质化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19833 2026-07-07 cs.CL cs.AI cs.DL 版本更新 79%

Polarity Detection of Sustainable Development Goals in News Text

新闻文本中可持续发展目标的极性检测

Andrea Cadeddu, Alessandro Chessa, Vincenzo De Leo, Gianni Fenu, Francesco Osborne, Diego Reforgiato Recupero, Angelo Salatino, Luca Secchi

机构 * LinkaLab

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍可持续发展目标极性检测新任务,提出SDG - POD数据集,评估六种开源大语言模型在零样本和微调设置下的表现,发现微调模型性能更佳,合成训练数据可提升模型鲁棒性和分类性能。

Comments The paper has been updated thanks to the reviewers comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30700 2026-07-01 cs.SD cs.AI cs.LG eess.AS eess.SP 新提交 79%

BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations

BEST-RQ-2:先上下文化再预测——自监督音频表示的两步方法

Ludovic K. Tuncay, Etienne Labbé, Thomas Pellegrini

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出BEST-RQ-2,通过两步式上下文化-预测预训练方案,使用ViT编码器和轻量预测器,在保持推理计算不变下提升跨域迁移性能。

Journal ref Interspeech 2026, Sep 2026, Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30339 2026-06-30 cs.CL cs.LG 79%

REAR: Test-time Preference Realignment through Reward Decomposition

REAR: 通过奖励分解实现测试时偏好重对齐

Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An

机构 * Nanyang Technological University(新加坡国立大学) Nanjing University(南京大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出REAR框架,通过将奖励函数分解为问题相关和偏好相关两部分,推导出可线性组合的对齐奖励,实现无需训练的测试时偏好重对齐,适用于多种任务。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21456 2026-06-23 cs.IR cs.AI cs.CL 版本更新 79%

Revisiting Text Ranking in Deep Research

重新审视深度研究中的文本排序

Chuan Meng, Litu Ou, Sean MacAvaney, Jeff Dalton

机构 * The University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过复现实验,从检索单元、流水线配置和查询特性三个角度评估文本排序方法在深度研究中的有效性,并提出Q2Q方法缓解查询不匹配问题。

Comments Accepted at the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12445 2026-06-16 cs.AI cs.LG stat.ML 版本更新 79%

Computational Safety for Generative AI: A Hypothesis Testing Perspective

生成式AI的计算安全性:假设检验视角

Pin-Yu Chen

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从假设检验角度形式化生成式AI的计算安全性,提出基于信号处理的方法检测恶意输入和AI生成内容。

Comments Extended version of the paper presented at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14325 2026-06-15 cs.CL cs.AI 新提交 79%

Achieving Precise Text-To-Cypher Via Grounded Knowledge Graph Data Generation

通过基于知识图谱的数据生成实现精确的文本到Cypher转换

Francesco Cazzaro, Jessica Lennon, Ariadna Quattoni

机构 * Universitat Politècnica de Catalunya(波兰理工大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种自动合成数据生成方法,微调小型LLM以提升Text2Cypher性能,使其在本地部署中与大型专有模型竞争,保障数据主权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12486 2026-06-10 cs.LG cs.CL 79%

The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws

训练过程至关重要:平均预训练参数计数统一了稀疏和密集的扩展规律

Tian Jin, Ahmed Imtiaz Humayun, Utku Evci, Suvinay Subramanian, Amir Yazdanbakhsh, Dan Alistarh, Gintare Karolina Dziugaite

机构 * MIT CSAIL(MIT 计算科学与人工智能实验室) Rice University(稻大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Google(谷歌) IST Austria(奥地利科学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文通过研究80种不同的剪枝计划,发现预训练过程中在25%和75%的计算量启动和结束剪枝可获得最佳评估损失,提出新的扩展规律统一了稀疏和密集预训练的扩展规律。

Comments 17 pages

Journal ref The Thirteenth International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09658 2026-06-09 cs.LG cs.AI 新提交 79%

Muon Learns More Robust and Transferable Features than Adam

Muon 比 Adam 学习更鲁棒和可迁移的特征

Tianyu Ruan, Fengzhuo Zhang, Shuche Wang, Shihua Zhang

机构 * Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过鲁棒性和可迁移性视角,证明 Muon 优化器相比 Adam 和 SGD 能学习到更鲁棒、更可迁移的特征,并通过理论分析支持了经验发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06679 2026-06-08 cs.CL cs.AI cs.CY 新提交 79%

HKJudge: A Legal Discourse-Annotated Corpus for Interpreting What Courts Find, How They Reason, and What They Rule

HKJudge:用于解释法院认定事实、推理过程和裁决结果的法律话语标注语料库

Xi Xuan, Wenxin Zhang, Yufei Zhou, King-kui Sin, Chunyu Kit

机构 * City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个句子级专家标注的法律话语数据集HKJudge,包含香港各级法院刑事判决,设计双层话语模式(26种修辞角色和3种判刑要素),并基于BERT和LLM进行基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27268 2026-05-27 cs.CL cs.AI 79%

Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)

迷失在采样中:通过词覆盖率评估大语言模型中的词汇可达性

Samer Awad, Javier Conde, Carlos Arriaga, Tairan Fu, Javier Coronado-Blázquez, Pedro Reviriego

机构 * Information and Processing Telecommunications Center(信息与处理电信中心) Universidad Politécnica de Madrid(马德里理工大学) Politecnico di Milano(米兰理工大学) Banco de España(西班牙银行)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出词覆盖率(WCS)指标,量化标准采样过滤器(如Top-p、Top-k、Min-p)如何抑制低频率高信息词汇的生存率,揭示解码机制对语言多样性的影响。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26788 2026-05-27 cs.CL cs.AI 79%

SeDT: Sentence-Transformer Decision-Transformer Conditioning for Multi-Turn Conversation Reliability

SeDT: 基于句子变换器的决策变换器条件化用于多轮对话可靠性

Ramakrishna Vamsi Setti, Jagadeesh Rachapudi, Sachin Chaudhary, Praful Hambarde, Amit Shukla

机构 * Independent Researcher(独立研究者) Drone Lab, IIT Mandi(IIT曼迪无人机实验室) UPES, Dehradun(德里敦UPES)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在多轮对话中性能下降的问题,提出一种无需训练和额外数据的推理方法SeDT,通过引入离线强化学习中的return-to-go条件化,利用语义、词汇和位置信号计算累积相关性得分并注释对话历史,显著提升模型性能并降低不可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏