arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12353 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12353 篇

2602.21485 2026-02-26 cs.CL cs.HC 88%

Evaluating the Usage of African-American Vernacular English in Large Language Models

评估大型语言模型中非裔美国人俚语英语的使用情况

Deja Dunlap, R. Thomas McCoy

机构 * Yale University(耶鲁大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估了大型语言模型对非裔美国人俚语英语的表示准确性,发现模型在语法使用上存在偏差,并复制了刻板印象,需改进训练数据和公平性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03313 2026-02-24 cs.LG 88%

Scaling Laws Revisited: Modeling the Role of Data Quality in Language Model Pretraining

再论缩放定律:建模数据质量在语言模型预训练中的作用

Anirudh Subramanyam, Yuxin Chen, Robert L. Grossman

机构 * Center for Translational Data Science(转化数据科学中心) Department of Computer Science(计算机科学系) Department of Medicine(医学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出了一种考虑数据质量的缩放定律,通过实验展示了高质量数据可减少模型规模和计算需求。

Comments 21 pages, 5 figures

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18468 2026-02-24 cs.CY cs.CL 88%

The Algorithmic Unconscious: Structural Mechanisms and Implicit Biases in Large Language Models

算法无意识:大型语言模型中的结构机制与隐性偏见

Philippe Boisnard

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型中结构性机制与隐性偏见,揭示了分词、注意力等机制对偏见的影响,并提出技术诊所框架以促进AI基础设施的批判性利用。

Comments 18 pages, 5 figures, Extended version of a paper presented at the international conference 'Artificial Intelligence and Transformations of Information' (LOGOS/FLSH, Hassan II University of Casablanca, Morocco, December 2025), accepted for publication in LOGOS after double-blind peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09655 2026-02-12 cs.CR cs.AI 88%

Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique

针对微调大型语言模型的数据来源审计技术与文本保留技术

Yanming Li, Cédric Eichler, Nicolas Anciaux, Alexandra Bensamoun, Lorena Gonzalez Manzano, Seifeddine Ghozzi

机构 * Inria(法国国家信息与自动化技术研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于文本保留技术的审计系统,用于检测微调大型语言模型时敏感文本的使用情况,通过不可见Unicode字符构建标记并利用统计保证实现高检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07540 2026-02-10 cs.CV cs.LG 88%

LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing

基于LLM的诊断证据对齐用于有限配对情况下的医学视觉-语言预训练

Huimin Yan, Liang Bai, Xian Yang, Long Chen

机构 * Institute of Intelligent Information Processing, Shanxi University(山西大学智能信息处理研究所) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学阿利安斯商学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出LLM引导的诊断证据对齐方法,旨在解决有限配对数据下医学视觉-语言预训练的诊断表示学习问题,通过提取关键诊断证据提升跨模态对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11300 2026-02-06 cs.HC cs.AI 88%

Beyond touch-based human-machine interface: Control your machines in natural language by utilizing large language models and OPC UA

超越基于触控的人机界面:通过利用大语言模型和OPC UA控制机器

Bernd Hofmann, Niklas Piechulek, Sven Kreitlein, Joerg Franke, Patrick Bruendl

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 利用大语言模型和OPC UA实现自然语言控制机器,通过工具调用提升工业人机交互的自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07687 2026-01-27 cs.CL 88%

Large Language Models as Proxies for Theories of Human Linguistic Cognition

大语言模型作为人类语言认知理论的代理

Imry Ziv, Nur Lan, Emmanuel Chemla, Roni Katzir

机构 * Tel Aviv University(特拉维夫大学) École Normale Supérieure(高等师范学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨了大语言模型作为人类语言认知理论代理的潜力,分析了其在解释语言模式获取和类型学验证中的作用,指出其帮助有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15892 2026-01-26 cs.CL 88%

Stable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Model

Stable-DiffCoder:推动代码扩散大语言模型的前沿

Chenghao Fan, Wen Heng, Bo Li, Sichen Liu, Yuxuan Song, Jing Su, Xiaoye Qu, Kai Shen, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);pretraining(abstract);分类 cs.CL

AI总结 Stable-DiffCoder通过基于扩散的训练方法,在代码生成任务中超越了传统自回归模型,提升了代码建模的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10986 2026-01-19 cs.CL 88%

ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models

ZPD检测器:基于能力-难度对齐的数据选择用于大语言模型

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Shijian Li

机构 * State Key Laboratory of Brain–Machine Intelligence(脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ZPD检测器通过能力-难度对齐动态选择高价值样本,提升大语言模型的数据利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09100 2026-01-16 cs.AI 88%

DScheLLM: Enabling Dynamic Scheduling through a Fine-Tuned Dual-System Large language Model

DScheLLM:通过微调双系统大语言模型实现动态调度

Lixiang Zhang, Chenggong Zhao, Qing Gao, Xiaoke Zhao, Gengyi Bai, Jinhu Lv

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 DScheLLM通过微调双系统大语言模型,首次在动态环境中应用大语言模型解决作业车间调度问题,展示其在智能调度优化中的潜力。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19631 2026-01-16 cs.AI 88%

Leveraging Open-Source Large Language Models for encoding Social Determinants of Health using an Intelligent Router

利用开源大型语言模型对健康社会决定因素进行编码的方法

Akul Goel, Surya Narayanan Hari, Belinda Waltman, Matt Thomson

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于开源LLM的智能路由系统,用于高准确率提取SDOH相关医疗记录信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05776 2026-01-12 cs.CL 88%

One Script Instead of Hundreds? On Pretraining Romanized Encoder Language Models

一个脚本而不是数百个?关于预训练罗马化编码语言模型

Benedikt Ebing, Lennart Keller, Goran Glavaš

机构 * Center for Artificial Intelligence and Data Science(人工智能与数据科学中心) University of Würzburg(乌尔姆大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 研究通过预训练罗马化和原始文本,探讨罗马化在多语言模型中的有效性,发现分段脚本语言性能损失小,而形态音节脚本语言需更高保真度罗马化以缓解退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01491 2026-01-07 cs.CL 88%

The Homogenizing Effect of Large Language Models on Human Expression and Thought

大语言模型对人类表达与思维的同质化效应

Zhivar Sourati, Alireza S. Ziabari, Morteza Dehghani

机构 * Department of Computer Science(计算机科学系) Center for Computational Language Sciences(计算语言学中心) Department of Psychology, University of Southern California(心理学系,南加州大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 大语言模型通过标准化语言和推理,加剧了人类认知多样性的同质化效应,影响集体智慧和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00869 2026-01-06 cs.AI 88%

Cultural Encoding in Large Language Models: The Existence Gap in AI-Mediated Brand Discovery

大语言模型中的文化编码:AI介导的品牌发现中的存在缺口

Huang Junyao, Situ Ruimin, Ye Renqin

机构 * OmniEdge (Zhizibianjie) AI Consulting Co., Ltd.(OmniEdge(智比特)人工智能咨询有限公司)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本研究揭示大语言模型中文化编码导致的品牌存在缺口,提出数据护城河框架,帮助品牌通过本地化提升AI可见性。

Comments 19 pages, 5 tables. Dataset and code available at https://github.com/zhizibianjie-omniedge/geo-cultural-encoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01495 2026-01-05 cs.CL 88%

C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models

C-VARC:一个大规模的中文价值观规则语料库用于大语言模型的价值对齐

Ping Wu, Guobin Shen, Dongcheng Zhao, Yuwei Wang, Yiting Dong, Yu Shi, Enmeng Lu, Feifei Zhao, Yi Zeng

机构 * BrainCog Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所脑认知实验室,北京,中国) Beijing Key Laboratory of Safe AI and Superalignment, Beijing, China(北京安全人工智能与超对齐关键实验室,北京,中国) Beijing Institute of AI Safety and Governance, Beijing, China(北京人工智能安全与治理研究所,北京,中国) The School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) Long-term AI, Beijing, China(长期人工智能,北京,中国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 C-VARC通过构建大规模中文价值观规则语料库,提供了一种基于中国核心价值观的价值对齐方法,有效提升了大语言模型在不同文化背景下的伦理评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12411 2025-12-30 cs.CL 88%

The Cultural Gene of Large Language Models: A Study on the Impact of Cross-Corpus Training on Model Values and Biases

大语言模型的文化基因:跨语料库训练对模型价值观与偏见的影响研究

Emanuel Z. Fenech-Borg, Tilen P. Meznaric-Kos, Milica D. Lekovic-Bojovic, Arni J. Hentze-Djurhuus

机构 * Department of Communications(通讯系) University of Malta(马耳他大学) Faculty of Mathematics(数学系) University of Primorska(普里摩尔卡大学) Faculty of Electrical Engineering(电气工程系) University of Montenegro(黑山大学) Faculty of Science & Technology(科学与技术系) University of the Faroe Islands(法罗群岛大学) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过跨文化探针数据集分析大语言模型在个人主义-集体主义和权力距离维度上的文化偏见,揭示模型价值观与训练语料文化背景的关联。

Comments 10 pages, 5 figures, IEEE conference format, submitted to [Conference Name]

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18027 2025-12-23 cs.CL cs.CY cs.SI 88%

CoPE: A Small Language Model for Steerable and Scalable Content Labeling

CoPE:一种可调节且可扩展的内容标注小语言模型

Samidh Chakrabarti, David Willner, Kevin Klyman, Tiffany Saade, Emily Capstick, Sabina Nong

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 CoPE是一种可调节且可扩展的内容标注小语言模型,通过矛盾示例训练和双目标注方法,实现高效准确的内容标注,并在小规模下达到与前沿模型相当的性能。

Comments 21 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17669 2025-12-22 cs.CL 88%

Generating Completions for Broca's Aphasic Sentences Using Large Language Models

利用大语言模型生成布罗卡失语症患者句子的完成

Sijbren van Vaals, Yevgen Matusevych, Frank Tsiwah

机构 * Center for Language and Cognition Groningen, University of Groningen(格罗宁根大学语言与认知中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究利用大语言模型生成布罗卡失语症患者句子的完成,通过合成数据训练模型以提升其在语法规则缺失句子重建中的性能。

Comments in IEEE Journal of Biomedical and Health Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12770 2025-12-16 cs.CL 88%

Curió-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining

Curió-Edu 7B: 探究数据选择对LLM持续预训练的影响

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

机构 * Institute of Computing (IC) University of Campinas (UNICAMP)(计算研究所(IC)坎皮纳斯大学(UNICAMP)) School of Electrical and Computer Engineering (FEEC) University of Campinas (UNICAMP)(电气与计算机工程学院(FEEC)坎皮纳斯大学(UNICAMP))

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL

AI总结 Curió-Edu 7B通过数据选择在有限计算资源下超越完整语料库模型,证明数据质量对语言适应的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03270 2025-12-12 cs.CL 88%

SCALE: Upscaled Continual Learning of Large Language Models

SCALE:大规模语言模型的扩展持续学习

Jin-woo Lee, Junhwa Choi, Bongkyu Hwang, Jinho Choo, Bogun Kim, JeongSeon Yi, Joonseok Lee, DongYoung Jung, Jaeseon Park, Kyoungwon Park, Suk-hoon Jung

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SCALE通过宽度扩展架构在持续学习中平衡稳定性与可塑性,减少遗忘并提升多语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06922 2025-12-09 cs.CL cs.CY 88%

Large Language Models and Forensic Linguistics: Navigating Opportunities and Threats in the Age of Generative AI

大语言模型与语言学鉴定:在生成式AI时代的机会与威胁

George Mikros

机构 * College of Humanities and Social Sciences(人文与社会科学学院) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨了大语言模型对语言学鉴定的双重影响,指出其在分析工具与身份混淆方面的矛盾,并提出混合工作流程和可解释检测方法以提升科学可信度和法律可采性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17892 2025-12-05 cs.CL 88%

EMMA-500: Enhancing Massively Multilingual Adaptation of Large Language Models

EMMA-500: 提升大规模多语言适应性的大语言模型

Shaoxiong Ji, Zihao Li, Jaakko Paavola, Peiqin Lin, Pinzhen Chen, Dayyán O'Brien, Hengyu Luo, Hinrich Schütze, Jörg Tiedemann, Barry Haddow

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 EMMA-500通过持续预训练提升多语言性能,尤其改善低资源语言的覆盖与跨语言迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00872 2025-12-02 cs.CV cs.AI 88%

TAP-CT: 3D Task-Agnostic Pretraining of Computed Tomography Foundation Models

TAP-CT: 3D 任务无关的计算机断层扫描基础模型预训练

Tim Veenboer, George Yiasemis, Eric Marcus, Vivien Van Veldhuizen, Cees G. M. Snoek, Jonas Teuwen, Kevin B. W. Groot Lipman

机构 * Netherlands Cancer Institute(荷兰癌症研究所) University of Amsterdam(阿姆斯特丹大学) Kaiko

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 TAP-CT提出了一种基于ViT和DINOv2的3D CT基础模型预训练方法,通过任务无关的自监督学习实现高效的医学影像处理。

Comments 22 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00602 2025-12-02 cs.MA cs.AI 88%

AgentODRL: A Large Language Model-based Multi-agent System for ODRL Generation

AgentODRL: 基于大语言模型的多智能体系统用于ODRL生成

Wanle Zhong, Keman Huang, Xiaoyong Du

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 AgentODRL通过多智能体系统和大语言模型技术,提升ODRL生成的准确性和效率。

Comments Accepted by AAAI 2026. 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19484 2025-11-26 cs.SE cs.LG 88%

stable-pretraining-v1: Foundation Model Research Made Simple

stable-pretraining-v1: 使基础模型研究变得简单

Randall Balestriero, Hugues Van Assel, Sami BuGhanem, Lucas Maes

机构 * Brown University(布朗大学) Genentech(基因泰克) Mila & Université de Montréal(Mila与蒙特利尔大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 stable-pretraining是一个模块化、可扩展且性能优化的库,旨在通过简化基础模型研究流程,提高灵活性和迭代速度,促进发现和扩展研究可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14738 2025-11-19 cs.LG 88%

LAUD: Integrating Large Language Models with Active Learning for Unlabeled Data

Tzu-Hsuan Chou, Chun-Nan Chou

机构 * CMoney Technology Corporation(CMoney技术公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments 7 pages and one figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09862 2025-11-18 cs.LG 88%

RadarLLM: Empowering Large Language Models to Understand Human Motion from Millimeter-Wave Point Cloud Sequence

Zengyuan Lai, Jiarui Yang, Songpengcheng Xia, Lizhou Lin, Lan Sun, Renwen Wang, Jianran Liu, Qi Wu, Ling Pei

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments Accepted by AAAI 2026 (extended version with supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12602 2025-11-13 cs.LG physics.bio-ph 88%

SynLlama: Generating Synthesizable Molecules and Their Analogs with Large Language Models

Kunyang Sun, Dorian Bagni, Joseph M. Cavanagh, Yingze Wang, Jacob M. Sawyer, Bo Zhou, Andrew Gritsevskiy, Oufan Zhang, Teresa Head-Gordon

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25804 2025-10-31 cs.CL 88%

Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data

Haoran Deng, Yingyu Lin, Zhenghao Lin, Xiao Liu, Yizhou Sun, Yi-An Ma, Yeyun Gong

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21585 2025-10-27 cs.LG q-bio.NC 88%

REVE: A Foundation Model for EEG -- Adapting to Any Setup with Large-Scale Pretraining on 25,000 Subjects

Yassine El Ouahidi, Jonathan Lys, Philipp Thölke, Nicolas Farrugia, Bastien Pasdeloup, Vincent Gripon, Karim Jerbi, Giulia Lioi

机构 * IMT Atlantique Lab-STICC UMR CNRS 6285(IMT Atlantique 实验室) Psychology Department Université de Montréal(蒙特利尔大学心理学系) Mila (Quebec AI research institute)(魁北克人工智能研究院) UNIQUE (Quebec Neuro-AI research center)(魁北克神经人工智能研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

Comments Code available at: https://brain-bzh.github.io/reve/

详情

展开后加载摘要…

URL PDF HTML 收藏