arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137794 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12318 篇

2606.11018 2026-07-31 cs.CL 版本更新 91%

Measuring Human Value Expression in Social Media Texts: Calibrated LLM Annotation and Encoder Transfer

测量社交媒体文本中的人类价值表达:校准的LLM标注与编码器迁移

Maria Milkova, Maksim Rudnev

机构 * Independent researcher, Lisbon, Portugal(独立研究者,里斯本,葡萄牙) University of Waterloo, ON, Canada(滑铁卢大学,安大略省,加拿大)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本研究使用校准的LLM标注和软标签训练,将基于Schwartz人类基本价值理论的社交媒体文本价值表达迁移到编码器模型,实现可扩展预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11925 2026-06-11 cs.CV cs.LG 新提交 91%

Corpus Augmentation for Sign Language Translation via LLM-Guided Video Stitching

通过LLM引导的视频拼接进行手语翻译的语料增强

Zsolt Robotka, Ádám Rák, Jalal Al-Afandi, András Horváth, György Cserey

机构 * Peter Pazmany Catholic University, Faculty of Information Technology and Bionics(彼得·帕兹马尼天主教大学信息科技与仿生学院) DeepSign Technologies Ltd.(DeepSign科技有限公司)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.LG

AI总结 提出一种无需额外标注或生成模型的手语翻译语料增强方法,利用CTC强制对齐提取手语片段,通过LLM生成句子并拼接视频,在GFSLT-VLP基线上提升BLEU-4达2.92,并发现合成数据对视觉-语言预训练有害但可提升下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28054 2026-06-10 cs.CL 版本更新 91%

Who Wrote the Book? Detecting and Attributing LLM Ghostwriters

谁写了这本书?检测与归因LLM代笔作者

Anudeex Shetty, Qiongkai Xu, Olga Ohrimenko, Jey Han Lau

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息学院) School of Computing, FSE, Macquarie University, Australia(麦考瑞大学计算学院)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出GhostWriteBench数据集和TRACE指纹方法,用于检测和归因LLM生成的长文本,在跨域和未见模型上达到SOTA性能。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18428 2026-06-09 cs.AI 版本更新 91%

AlphaOPT: Formulating Optimization Programs with Self-Improving LLM Experience Library

AlphaOPT: 利用自改进LLM经验库构建优化问题

Minwei Kong, Ao Qu, Xiaotong Guo, Wenbin Ouyang, Chonghe Jiang, Han Zheng, Yining Ma, Dingyi Zhuang, Yuhan Tang, Junyi Li, Shenhao Wang, Haris Koutsopoulos, Hai Wang, Cathy Wu, Jinhua Zhao

机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Massachusetts Institute of Technology(麻省理工学院) University of Florida(佛罗里达大学) Northeastern University(东北大学) Singapore Management University(新加坡管理学院)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 提出AlphaOPT,一种自改进经验库,使LLM能从有限监督中学习优化建模知识,通过库学习和库演化两阶段循环,逐步提升性能,在多个基准上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27661 2026-05-01 cs.CL 91%

Language Ideologies in a Multilingual Society: An LLM-based Analysis of Luxembourgish News Comments

多语言社会中的语言意识形态:基于LLM的卢森堡语新闻评论分析

Emilia Milano, Alistair Plum, Yves Scherrer, Christoph Purschke

机构 * University of Luxembourg(卢森堡大学) University of Oslo(奥斯陆大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了利用大语言模型检测语言意识形态的潜力,通过手动标注卢森堡语评论并评估不同提示条件下的模型表现,发现尽管LLM在多类意识形态标注上尚未完全优化,但仍能有效识别语言意识形态内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07044 2025-12-23 cs.CL 91%

Evaluating Large Language Models for Anxiety, Depression, and Stress Detection: Insights into Prompting Strategies and Synthetic Data

评估大型语言模型用于焦虑、抑郁和压力检测:提示策略和合成数据的见解

Mihael Arcan, David-Paul Niland

机构 * Lua Health(Lua健康)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL

AI总结 本研究评估了大型语言模型在焦虑、抑郁和压力检测中的性能,发现Distil-RoBERTa和XLNet在不同任务中表现优异,合成数据有效缓解类别不平衡,但需注意精度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16986 2024-10-08 cs.AI 91%

Harnessing Diversity for Important Data Selection in Pretraining Large Language Models

Chi Zhang, Huaping Zhong, Kuan Zhang, Chengliang Chai, Rui Wang, Xinlin Zhuang, Tianyi Bai, Jiantao Qiu, Lei Cao, Ju Fan, Ye Yuan, Guoren Wang, Conghui He

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06575 2024-08-20 cs.CL 91%

Chain-of-Dictionary Prompting Elicits Translation in Large Language Models

Hongyuan Lu, Haoran Yang, Haoyang Huang, Dongdong Zhang, Wai Lam, Furu Wei

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22938 2026-07-02 cond-mat.mtrl-sci cs.CL cs.LG 版本更新 91%

Large language model-enabled automated data extraction for concrete materials informatics

基于大语言模型的混凝土材料信息学自动化数据提取

Zhanzhao Li, Kengran Yang, Qiyao He, Kai Gong

机构 * Department of Civil and Environmental Engineering, Rice University(Rice大学土木与环境工程系) Rice Advanced Materials Institute, Rice University(Rice大学先进材料研究所) Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) Independent researcher(独立研究员)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出一种基于大语言模型的自动化数据提取方法,用于从非结构化科学文献中提取混凝土材料数据,构建了最大的开放实验室数据库,提升了材料信息学的数据基础设施发展。

Comments 21 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19347 2026-06-19 cs.CL cs.AI cs.PL 新提交 91%

How LLMs Fail and Generalize in RTL Coding for Hardware Design?

LLM在硬件设计的RTL编码中如何失败与泛化?

Guan-Ting Liu, Chao-Han Huck Yang, Chenhui Deng, Zhongzhi Yu, Brucek Khailany, Yu-Chiang Frank Wang

机构 * NVIDIA Research(英伟达研究院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出基于问题可解性的错误分类法,揭示LLM在RTL编码中受限于预训练知识,对齐技术仅教会编译,而推理能力才是关键瓶颈。

Comments Preview, under submission for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15521 2026-06-16 cs.CL cs.LG 新提交 91%

Emergent retokenization symmetry in large language models: phenomenology and applications

大型语言模型中涌现的重分词对称性:现象学与应用

Kanishk Jain, Matthew Day, Tankut Can

机构 * Department of Physics, Emory University(埃默里大学物理系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究发现大型语言模型在训练中部分涌现出重分词对称性,通过重分词实验探测模型对语义等价输入表示的敏感性和鲁棒性,并提出一种新的推理时采样策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13618 2026-05-12 cs.CL cs.LG 91%

Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models

基于大语言模型的时间序列事件建模中的时间标记策略

Zefang Liu, Nam H. Nguyen, Yinzhu Quan, Shi-Xiong Zhang

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文研究了大语言模型中时间序列事件建模的时间标记策略,通过对比不同编码方法发现,标记器需与数据统计特性匹配才能提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08220 2026-05-12 cs.AI cs.CE cs.CL cs.CV cs.SE 91%

Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction

空间提示优于语义提示:一种基于网格的方法以提高LLM在图表数据提取上的准确性

Andrei Lazarev, Dmitrii Sedov, Alexander Galkin

机构 * Russian Federation(俄罗斯联邦)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文通过对比空间提示与语义提示,发现基于网格的提示方法能显著降低图表数据提取误差,优于传统语义引导策略。

Comments his is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302248

Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 799-804

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13777 2026-04-16 cs.CL cs.AI 91%

From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models

从锚点到监督:基于记忆图的无语料去学习框架

Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai University of Electric Power(上海电力大学) School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出MAGE框架,通过用户提供的轻量锚点识别目标实体,利用记忆图恢复相关记忆并生成监督,实现无语料的去学习,有效提升隐私保护和审计能力。

Comments 15 pages, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12350 2026-04-15 cs.LG cs.AI 91%

Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models

基于 Scaffold 的偏好三元组用于大语言模型可控分子优化

Yi Xiong, Liang Xiong, Xiaohong Ji, Sen Yang, Zhifeng Gao, Huaimin Wang, Kele Xu

机构 * National Key Laboratory of Parallel and Distributed Processing(平行与分布式处理国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院) National University of DefenseTechnology(国防科技大学) DP Technology(DP科技)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出 Scaffold-Conditioned Preference Triplets (SCPT) 方法,通过构建约束三元组实现可控分子优化,提升分子性质改进的同时保持 Scaffold 相似性,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10985 2026-04-14 cs.AI cs.CL cs.CV 91%

Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models

回到牛棚与LLAMAs:在微调视觉语言模型中进化预训练LLM骨干

Sameera Horawalavithana, Lauren Phillips, Ian Stewart, Sai Munikoti, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 预训练与数据 :LLM(title,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 研究探讨了在微调视觉语言模型时,不同预训练LLM骨干对下游任务性能的影响,发现新版本LLM并非总能提升性能,且表现依赖具体任务。

Comments Preprint and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00785 2026-04-02 cs.LG cs.AI cs.DC 91%

Scalable Pretraining of Large Mixture of Experts Language Models on Aurora Super Computer

在Aurora超级计算机上可扩展地预训练大型专家混合语言模型

Dharma Teja Vooturi, Dhiraj Kalamkar, Dipankar Das, Bharat Kaul

机构 * Parallel Computing Lab (India) Intel Corporation(英特尔公司印度并行计算实验室)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文在Aurora超级计算机上展示了大规模预训练大型语言模型,开发了Optimus训练库,预训练了多个MoE模型,并通过定制GPU内核和新型EP-Aware分片优化器提升了训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26164 2026-03-30 cs.LG cs.CL 91%

DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models

DataFlex: 一种统一的以数据为中心的大型语言模型动态训练框架

Hao Liang, Zhengyang Zhao, Meiyi Qiang, Mingrui Chen, Lu Ma, Rongyi Yu, Hengyi Feng, Shixuan Sun, Zimo Meng, Xiaochen Ma, Xuanlin Yang, Qifeng Cai, Ruichuan An, Bohan Zeng, Zhen Hao Wong, Chengyu Shen, Runming He, Zhaoyang Han, Yaowei Zheng, Fangcheng Fu, Conghui He, Bin Cui, Zhiyu Li, Weinan E, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) OriginHub Technology LLaMA-Factory Team(LLaMA-Factory团队) Zhongguancun Academy(中关村学院) OpenDataLab, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室OpenDataLab) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 DataFlex 提供了一种统一的以数据为中心的动态训练框架,支持样本选择、领域混合调整和样本再加权,提升了大型语言模型的训练效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15851 2026-03-23 cs.CL cs.AI 91%

Control Illusion: The Failure of Instruction Hierarchies in Large Language Models

控制幻觉:大型语言模型中指令层级的失效

Yilin Geng, Haonan Li, Honglin Mu, Xudong Han, Timothy Baldwin, Omri Abend, Eduard Hovy, Lea Frermann

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究探讨了大型语言模型中指令层级机制的有效性,发现模型在处理简单格式冲突时难以保持一致的优先级,且系统/用户提示分离方法无法建立可靠层级,社会层级框架对模型行为影响更大。

Comments Accepted to AAAI-26 Main Technical Track Proceedings

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(36): 30816-30824, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10793 2026-03-17 cs.CL cs.AI 91%

LabelFusion: Fusing Large Language Models with Transformer Encoders for Robust Financial News Classification

LabelFusion:融合大型语言模型与Transformer编码器以实现稳健的金融新闻分类

Michael Schlee, Christoph Weisser, Timo Kivimäki, Melchizedek Mashiku, Benjamin Saefken

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出LabelFusion架构,结合提示工程的LLM与微调的RoBERTa编码器,通过轻量MLP投票层提升金融新闻分类性能,在低数据环境下LLM单独使用表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10361 2026-02-20 cs.CL cs.LG 91%

Enhancing Multilingual LLM Pretraining with Model-Based Data Selection

通过基于模型的数据选择增强多语言大语言模型预训练

Bettina Messmer, Vinko Sabolčec, Martin Jaggi

机构 * EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于模型的数据选择框架,通过提高多语言大语言模型预训练的效果,实现了在较少训练数据下达到基线分数并提升其他基准测试的表现。

Comments NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06617 2026-02-11 cs.LG cs.AI cs.PF 91%

Generalizing Scaling Laws for Dense and Sparse Large Language Models

为密集和稀疏大语言模型推广缩放定律

Md Arafat Hossain, Xingfu Wu, Valerie Taylor, Ali Jannesari

机构 * Department of Computer Science(计算机科学系) Iowa State University(爱荷华州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文提出了一种通用缩放定律,适用于密集和稀疏大语言模型,通过比较实验验证了其在大规模模型中的有效性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04379 2026-01-30 cs.CV cs.AI cs.CL cs.HC 91%

Can Large Language Models Capture Video Game Engagement?

大语言模型能否捕捉视频游戏参与度?

David Melhart, Matthew Barthet, Georgios N. Yannakakis

机构 * Institute of Digital Games, University of Malta Msida, Malta(马耳他大学数字游戏研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大语言模型在多模态输入下预测视频游戏参与度的能力,发现尽管LLMs在多个领域表现优异,但其在连续情绪标注上仍无法超越人类注释。

Comments This work has been submitted to the IEEE for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12384 2025-12-16 cs.LG cs.CL 91%

The Data Efficiency Frontier of Financial Foundation Models: Scaling Laws from Continued Pretraining

金融基础模型的数据效率前沿:从持续预训练中获得的扩展定律

Jesse Ponnock

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了金融基础模型在持续预训练中的数据效率,发现通过较小的词预算可实现有效的领域适应,且大模型规模仍具可行性。

Comments 8 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12116 2025-11-18 cs.CL cs.AI 91%

LLMLagBench: Identifying Temporal Training Boundaries in Large Language Models

Piotr Pęzik, Konrad Kaczyński, Maria Szymańska, Filip Żarnecki, Zuzanna Deckert, Jakub Kwiatkowski, Wojciech Janowski

机构 * University of Lodz(洛兹大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10093 2025-11-14 cs.CL cs.AI 91%

On the Military Applications of Large Language Models

Satu Johansson, Taneli Riihonen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)

Comments Published in the meeting proceedings of the 2025 International Conference on Military Communications and Information Systems (ICMCIS) by the NATO Science and Technology Organization (STO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08877 2025-11-13 cs.CL cs.AI 91%

Hallucinate or Memorize? The Two Sides of Probabilistic Learning in Large Language Models

Junichiro Niimi

机构 * Meijo University(名古屋大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03823 2025-11-07 cs.CL cs.AI 91%

PLLuM: A Family of Polish Large Language Models

Jan Kocoń, Maciej Piasecki, Arkadiusz Janz, Teddy Ferdinan, Łukasz Radliński, Bartłomiej Koptyra, Marcin Oleksy, Stanisław Woźniak, Paweł Walkowiak, Konrad Wojtasik, Julia Moska, Tomasz Naskręt, Bartosz Walkowiak, Mateusz Gniewkowski, Kamil Szyc, Dawid Motyka, Dawid Banach, Jonatan Dalasiński, Ewa Rudnicka, Bartłomiej Alberski, Tomasz Walkowiak, Aleksander Szczęsny, Maciej Markiewicz, Tomasz Bernaś, Hubert Mazur, Kamil Żyta, Mateusz Tykierko, Grzegorz Chodak, Tomasz Kajdanowicz, Przemysław Kazienko, Agnieszka Karlińska, Karolina Seweryn, Anna Kołos, Maciej Chrabąszcz, Katarzyna Lorenc, Aleksandra Krasnodębska, Artur Wilczek, Katarzyna Dziewulska, Paula Betscher, Zofia Cieślińska, Katarzyna Kowol, Daria Mikoś, Maciej Trzciński, Dawid Krutul, Marek Kozłowski, Sławomir Dadas, Rafał Poświata, Michał Perełkiewicz, Małgorzata Grębowiec, Maciej Kazuła, Marcin Białas, Roman Roszko, Danuta Roszko, Jurgita Vaičenonienė, Andrius Utka, Paweł Levchuk, Paweł Kowalski, Irena Prawdzic-Jankowska, Maciej Ogrodniczuk, Monika Borys, Anna Bulińska, Wiktoria Gumienna, Witold Kieraś, Dorota Komosińska, Katarzyna Krasnowska-Kieraś, Łukasz Kobyliński, Martyna Lewandowska, Marek Łaziński, Mikołaj Łątkowski, Dawid Mastalerz, Beata Milewicz, Agnieszka Anna Mykowiecka, Angelika Peljak-Łapińska, Sandra Penno, Zuzanna Przybysz, Michał Rudolf, Piotr Rybak, Karolina Saputa, Aleksandra Tomaszewska, Aleksander Wawer, Marcin Woliński, Joanna Wołoszyn, Alina Wróblewska, Bartosz Żuk, Filip Żarnecki, Konrad Kaczyński, Anna Cichosz, Zuzanna Deckert, Monika Garnys, Izabela Grabarczyk, Wojciech Janowski, Sylwia Karasińska, Aleksandra Kujawiak, Piotr Misztela, Maria Szymańska, Karolina Walkusz, Igor Siek, Jakub Kwiatkowski, Piotr Pęzik

机构 * Department of Artificial Intelligence, Wrocław University of Science and Technology(沃斯克拉大学人工智能系) NASK National Research Institute(国家研究 institute) National Information Processing Institute(国家信息处理研究所) Institute of Slavic Studies, Polish Academy of Sciences(波兰科学院斯拉夫研究学院) Institute of Computer Science, Polish Academy of Sciences(波兰科学院计算机科学研究所) University of Łódź(卢布林大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);preference optimization(abstract)

Comments 83 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03325 2025-10-27 cs.CL cs.AI 91%

Electronic Circuit Principles of Large Language Models

Qiguang Chen, Libo Qin, Jinhao Liu, Dengyun Peng, Jiaqi Wang, Mengkang Hu, Zhi Chen, Wanxiang Che, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) ByteDance Seed (China)(字节跳动种子(中国))

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05668 2025-09-09 cs.CL cs.AI 91%

Llama-GENBA-10B: A Trilingual Large Language Model for German, English and Bavarian

Michael Hoffmann, Jophin John, Stefan Schweter, Gokul Ramakrishnan, Hoi-Fong Mak, Alice Zhang, Dmitry Gaynullin, Nicolay J. Hammer

机构 * Leibniz Supercomputing Centre (LRZ)(莱布尼茨超算中心) Cerebras Systems(Cerebras系统)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)

Comments Michael Hoffmann and Jophin John contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏