arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137636 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12308 篇

2312.04828 2025-01-08 cs.CL cs.AI 91%

HuRef: HUman-REadable Fingerprint for Large Language Models

Boyi Zeng, Lizheng Wang, Yuncong Hu, Yi Xu, Chenghu Zhou, Xinbing Wang, Yu Yu, Zhouhan Lin

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14280 2024-06-25 cs.CL cs.AI 91%

RomanSetu: Efficiently unlocking multilingual capabilities of Large Language Models via Romanization

Jaavid Aktar Husain, Raj Dabre, Aswanth Kumar, Jay Gala, Thanmay Jayakumar, Ratish Puduppully, Anoop Kunchukuttan

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments Accepted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02379 2023-11-07 cs.RO cs.AI cs.LG 91%

Accelerating Reinforcement Learning of Robotic Manipulations via Feedback from Large Language Models

Kun Chu, Xufeng Zhao, Cornelius Weber, Mengdi Li, Stefan Wermter

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments CoRL 2023 Workshop (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17446 2023-10-03 cs.CL cs.LG cs.PL cs.SE 91%

L2CEval: Evaluating Language-to-Code Generation Capabilities of Large Language Models

Ansong Ni, Pengcheng Yin, Yilun Zhao, Martin Riddell, Troy Feng, Rui Shen, Stephen Yin, Ye Liu, Semih Yavuz, Caiming Xiong, Shafiq Joty, Yingbo Zhou, Dragomir Radev, Arman Cohan

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

Comments Project Website: https://l2c-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16726 2026-07-15 cs.MA 版本更新 91%

Bridging Individual and Collective Realism in LLM-Based Human Mobility Simulation via Mobility Scaling-Law Guidance

通过共享数据中的移动度量引导基于LLM的人群移动模拟

Hua Yan, Heng Tan, Yu Yang

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 M2LSimu通过共享数据中的移动度量引导多提示调整,有效提升基于LLM的人群移动模拟的群体协调与真实性

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29013 2026-06-30 cs.CV 91%

Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers

Mural: 通过混合Transformer将LLM知识迁移到图像生成

Achin Jain, Jie An, Siddharth Chaudhary, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Mixture-of-Transformers架构,将冻结的LLM与扩散图像生成器结合,仅用文本-图像对训练,在多个基准上取得优异性能,并涌现出跨语言生成、颜色引导构图等新能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20613 2026-06-23 cs.CY 新提交 91%

Gender Disparities in LLM-Based Intimate Partner Violence Detection

基于LLM的亲密伴侣暴力检测中的性别差异

Tabia Tanzin Prama, Mikaela Irene Fudolig, Abigail M. Crocker, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过反事实变体测试LLM在亲密伴侣暴力检测中的性别偏见,发现当受害者为男性时,暴力检测率系统性降低,女性施暴者身份是暴力识别的负向预测因子。

Comments Accepted at the Seventh Workshop on NLP and Computational Social Science (at ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06502 2026-06-08 cs.CR 新提交 91%

Subtle Injection for Ground-truth Inference of LLM Training Data

用于LLM训练数据真实推断的微妙注入

Abraham Itzhak Weinberg

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SIGIL框架,通过向文本中嵌入不可感知的“金丝雀序列”,使训练了这些文档的LLM在特定查询下表现出可检测的行为特征,从而证明文档被用于训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19936 2026-06-01 cs.LG cs.AI cs.CL 91%

Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data

Gap-K%: 通过测量 Top-1 预测差距检测预训练数据

Minseo Kwak, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出 Gap-K% 方法,利用 LLM 的 top-1 预测与目标 token 的对数概率差距及滑动窗口策略,在 WikiMIA 和 MIMIR 基准上实现预训练数据检测的最优性能。

Comments ACL 2026 Main Conference; 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26492 2026-05-27 cs.CL cs.AI cs.LG 91%

Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories

灯塔中的伊莱亚斯,再次?诊断LLM故事中的低多样性

Sil Hamilton, David Mimno

机构 * Department of Information Science(信息科学系)

专题命中 预训练与数据 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过采样20000个故事发现,LLM生成的故事中存在高度重复的词汇(如Elias、灯塔等),这些词汇来自偏好数据而非预训练数据,表明小数据集与强对齐算法的结合可能对多样性产生不成比例的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25838 2026-05-26 cs.DB 91%

Same Data, Different Schemas: Robustness of LLM-based Text-to-SQL

相同数据,不同模式:基于LLM的文本到SQL的鲁棒性

Nitin Kanchinadam, Aditya Menachery, Amol Deshpande

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一个框架,通过从同一E/R模型生成多个等价关系模式变体,评估LLM在文本到SQL任务中对模式变化的鲁棒性,发现模式结构显著影响模型行为,且提供E/R规范可改善但不完全消除不一致性。

Comments Accepted for publication at Nineth International Workshop on Exploiting Artificial Intelligence Techniques for Data Management (aiDM '26), co-located with ACM SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21537 2026-05-22 cs.SE 91%

Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization

言辞清晰却错误:基于LLM的代码现代化中的自我审查失败

Gokul Chandra Purnachandra Reddy, Aditya Lolla, Harsha Sanku

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在使用大型语言模型(LLM)将遗留代码迁移到现代栈时,LLM是否能够识别其自身输出是否改变了可观察行为,发现自我审查不可靠,且存在语义保持漂移等问题。

Comments 11 pages, 6 figures, 2 tables. Corpus, oracle, output extractor, prompts, harness, self-review probe, and all 1,980 + 1,979 raw model outputs released as supplementary material at https://zenodo.org/records/20300861

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07957 2026-05-11 cs.SE 91%

Similar Pattern Annotation via Retrieval Knowledge for LLM-Based Test Code Fault Localization

通过检索知识实现相似模式注释的LLM基于测试代码故障定位

Golnaz Gharachorlu, Mahsa Panahandeh, Lionel C. Briand, Ruifeng Gao, Ruiyuan Wan

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SPARK框架,通过整合CI环境积累的调试知识,提升LLM在测试代码故障定位中的效率,实验表明其在复杂测试用例中能更准确识别故障位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05501 2026-05-08 cs.CR 91%

SOCpilot: Verifying Policy Compliance for LLM-Assisted Incident Response

SOCpilot: 验证LLM辅助事件响应中的政策合规性

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira Júnior

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SOCpilot通过固定事件包、行动目录、政策规则和验证器,验证LLM辅助事件响应计划的合规性,评估两个LLM提供商在金融行业案例中的表现,去除非合规动作并提供零成本准备检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27945 2026-05-01 eess.SP 91%

CRS-LLM: Cooperative Beam Prediction with a GPT-Style Backbone and Switch-Gated Fusion

CRS-LLM:基于GPT风格主干和切换门融合的协作波束预测

Fangzhi Li, Cunhua Pan, Hong Ren, Dongming Wang, Jiangzhou Wang

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CRS-LLM框架,通过将波束跟踪建模为联合BS-波束空间的单分类问题,结合双视角CSI分词器和截断GPT风格主干,实现更准确的波束预测,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07769 2026-04-10 cs.SE 91%

An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models

基于影响分数的代码大语言模型预训练数据选择实证研究

Chengli Xing, Zhengran Zeng, Gexiang Fang, Rui Xie, Wei Ye, Shikun Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);LLM(abstract)

AI总结 本文探讨了影响分数过滤技术在编程数据集中的有效性,通过大规模实验评估了该方法对模型性能的提升,并分析了有益训练数据在不同阶段和任务中的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01785 2026-03-06 cs.CL cs.AI cs.LG 91%

MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining

MuRating: 一种用于多语言大语言模型预训练的高质量数据选择方法

Zhixun Chen, Ping Guo, Wenhan Han, Yifan Zhang, Binbin Liu, Haobin Lin, Fengze Liu, Yan Zhao, Bingni Zhang, Taifeng Wang, Yin Zheng, Trevor Cohn, Meng Fang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ByteDance(字节跳动) Eindhoven University of Technology(埃因霍温理工大学) University of Melbourne(墨尔本大学) University of Liverpool(利物浦大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI、cs.LG

AI总结 MuRating通过多语言评估器选择高质量数据,提升多语言大语言模型的预训练效果。

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07819 2025-01-15 cs.CV 91%

3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding

Haomiao Xiong, Yunzhi Zhuge, Jiawen Zhu, Lu Zhang, Huchuan Lu

专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted to IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18424 2024-10-22 cs.IR 91%

PromptReps: Prompting Large Language Models to Generate Dense and Sparse Representations for Zero-Shot Document Retrieval

Shengyao Zhuang, Xueguang Ma, Bevan Koopman, Jimmy Lin, Guido Zuccon

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

Comments EMNLP2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06018 2024-03-12 cs.CL cs.AI cs.LG 91%

Few-Shot Cross-Lingual Transfer for Prompting Large Language Models in Low-Resource Languages

Christopher Toukmaji

专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

Comments 47 pages, 26 figures; a thesis submitted in partial satisfaction of the requirements for the degree of Bachelor of Science in Computer Science at the University of California - Santa Cruz

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06692 2023-09-18 cs.LG cs.AI cs.CL 91%

Guiding Pretraining in Reinforcement Learning with Large Language Models

Yuqing Du, Olivia Watkins, Zihan Wang, Cédric Colas, Trevor Darrell, Pieter Abbeel, Abhishek Gupta, Jacob Andreas

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06253 2026-08-07 cs.LG 新提交 91%

MetaboLLM: a metabolomics-specialized large language model for biochemical knowledge integration and predictive metabolite graph construction

MetaboLLM:用于生化知识整合与预测性代谢物图构建的代谢组学专用大语言模型

Dohyun Ku, Min Gu Kwak, Francisco J. Pasquel, Jing Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 该研究开发了代谢组学专用大语言模型MetaboLLM及配套的MetaboLLM-GIN,经多阶段适配后,在相关任务及两个临床预测场景中均取得优于对照模型的性能,证明领域专用语言模型可构建可预测且可解释的代谢物图表征。

Comments 60 pages, 3 figures, 16 tables; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22652 2026-07-28 cs.AI 新提交 91%

KG2Code: Bridging Knowledge Graphs and Large Language Models via Executable Code for Question Answering

KG2Code:通过可执行代码连接知识图谱与大语言模型以进行问答

Yike Wu, Nan Hu, Guilin Qi, Guohui Xiao, Chen Jiang, Xinchun Zou, Yuchen Lu, Songlin Zhai, Yongrui Chen, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其交叉应用重点实验室(东南大学)) Huawei Technologies(华为技术有限公司) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 研究针对知识图谱问答中现有方法的局限,提出KG2Code方法,将知识图谱转换为代码表示,在此基础上构建KG2Code-QA框架,把KGQA作为代码生成任务,还构建代码语料库,训练后的模型在KGQA任务中表现优异且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30634 2026-06-30 cs.LG 91%

One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining

一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍

Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.LG

AI总结 本文挑战异步流水线并行中一步梯度延迟导致不稳定的普遍观点,发现延迟影响取决于优化器选择,Muon等新优化器具有鲁棒性,并提出基于误差反馈的修正方法,在10B参数模型上实现与同步训练相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29773 2026-06-30 cs.LG 91%

GLIP: Graph and LLM Joint Pretraining for Graph-Level Tasks

GLIP:面向图级任务的图与大型语言模型联合预训练

Haoxin Sun, Yiqing Lin, Yajun Huang, Chenhui Dong, Mingjun Li, Zhongzhi Zhang

机构 * Fudan University(复旦大学) ByteDance(字节跳动)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20381 2026-06-19 cs.AI 新提交 91%

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

重新思考LLM FP4预训练中的收缩偏差:几何起源、系统影响与UFP4方案

Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

机构 * Ling Team, Ant Group(蚂蚁集团灵团队)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.AI

AI总结 本文发现E2M1格式因几何不对称导致收缩偏差,该偏差经随机哈达玛变换放大,造成训练不稳定;提出均匀网格E1M2/INT4及UFP4训练方案,在多种模型上实现更低损失。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06048 2026-06-19 cs.LG 版本更新 91%

BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining

BLISS: 一种用于语言模型预训练数据选择的轻量级双层影响评分方法

Jie Hao, Rui Yu, Wei Zhang, Huixia Wang, Jie Xu, Mingrui Liu

机构 * Department of Computer Science, George Mason University, USA(乔治·马歇尔大学计算机科学系) IBM T.J. Watson Research Center, USA(IBM T.J. Watson研究部) Department of Statistics, Rice University(里士大学统计系) Department of System Engineering & Operations Research, George Mason University, USA(乔治·马歇尔大学系统工程与运营管理系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出一种无需外部预训练模型的轻量级数据选择方法BLISS,通过双层优化和代理模型估计训练样本的长期影响,实现高效数据筛选,在C4数据集上预训练多种规模模型,显著加速收敛并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19170 2026-06-18 cs.CL 新提交 91%

Dango: A Strictly L1-Only Large Language Model for Studying Second Language Acquisition

Dango:一个严格仅L1的大型语言模型,用于研究第二语言习得

Shiho Matta, Yin Jou Huang, Fei Cheng, Takashi Kodama, Hirokazu Kiyomaru, Yugo Murawaki

机构 * Kyoto University(京都大学) NII-LLMC(日本国立信息与通信技术研究所-语言模型中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 提出1.8B参数的Dango模型,通过过滤L2污染和微调L2学习课程,模拟人类L2产出模式,优于未过滤和多语言基线。

Comments 8 pages main text, 20 pages total including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06738 2026-02-17 cs.CL 91%

AWM: Accurate Weight-Matrix Fingerprint for Large Language Models

AWM: 用于大型语言模型的准确权重矩阵指纹

Boyi Zeng, Lin Chen, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 AWM通过基于权重矩阵的无训练指纹方法,利用线性分配问题和无偏中心核对齐相似性,实现对大型语言模型训练来源的可靠识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08500 2026-01-14 cs.CL 91%

It's All About the Confidence: An Unsupervised Approach for Multilingual Historical Entity Linking using Large Language Models

信心才是关键:一种用于多语言历史实体链接的无监督方法,使用大语言模型

Cristian Santini, Marieke Van Erp, Mehwish Alam

机构 * Department of Humanities, University of Macerata(马切拉塔大学人文学科系) KNAW Humanities Cluster, DHLab(荷兰人文集群、DHLab) INFRES Department, Télécom Paris(巴黎电信学院INFRES部门)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

AI总结 本文提出MHEL-LLaMo,一种结合小型语言模型和大语言模型的无监督方法,用于多语言历史实体链接,通过置信度评分降低计算成本并提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏