A Pure Transformer Pretraining Framework on Text-attributed Graphs
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 1st place at SemEval-2024 Task 8, Subtask C, to appear in SemEval-2024 proceedings
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
Comments Preprint; updated reference and related works
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
Comments 15 pages
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
Comments ACL 2023
专题命中 预训练与数据 :language model(title,abstract);small language model(abstract);instruction tuning(abstract);pretraining(abstract)
专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments Accepted at Learning Meaningful Representations of Life workshop, NeurIPS 2022
语义老虎机:上下文内的探索-利用受语义先验的偏置
机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; Skyfall AI(天空fall人工智能公司) ; McGill University(麦吉尔大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出语义老虎机框架,发现LLM的探索-利用受语义先验偏置,语义标签对齐奖励可提升性能,负奖励比同等正奖励触发更多探索,为LLM智能体决策可靠性提供了新见解。
Comments 10 pages, 5 figures in main body
训练混合:将小规模支架式预训练运行重组为更大的语言模型
机构 * Google(谷歌公司) ; School of Computing, Dublin City University(都柏林城市大学计算机学院)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI
AI总结 本研究提出训练混合(MoT)框架,将Transformer划分为层块在冻结对齐器内独立训练后重组,在13亿参数Gemma模型上验证其可重组为可用语言模型,可复用对齐器实现计算优势,用于研究可复用训练单元。
Comments Accepted at the Workshop on Methods and Opportunities at Small Scale (MOSS), COLM 2026
NeuPAT:面向语言保留多模态大语言模型的神经元感知可塑性分配调优
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 NeuPAT是一种轻量架构无关框架,通过选择性保护语言敏感神经元、促进高可塑性神经元适配多模态,在11个语言基准上恢复了普通调优94.5%的语言能力下降,同时保持相当多模态性能,实现了能力保留型多模态大语言模型扩展。
全栈FP4:通过量化投影、优化器和注意力进行稳定的语言模型预训练
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Sichuan University(四川大学) ; Beijing Zhongguancun Academy(北京中关村科学院) ; Zhejiang University(浙江大学) ; Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑科学与类脑研究中心通用人工智能大模型北京市重点实验室) ; Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑机智能技术重点实验室)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);分类 cs.AI、cs.LG
AI总结 研究针对4位预训练中优化器状态等未充分探索的问题,提出全栈FP4框架。通过模块精度策略解决稳定性瓶颈,如用LoRA-SVD抑制量化噪声,设计优化器变换,采用混合精度方案,实现稳定高效的端到端预训练。
Comments Fix experiment bugs and some statement, update current developed hardware efficiency result on 5090
MACRO:Transformer层的马尔可夫链路由
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。
感知到的种族与性别对警察语言使用的影响:来自VR模拟的实验证据
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过VR模拟实验发现,警察对黑人男性虚拟角色的说话恭敬程度更低,还探讨了LLM在ATE估计中的应用,推荐混合效应模型结合iptw方法,认为LLM相关技术需进一步完善。
DenialRAG:通过嵌入参数化弃权的单文档RAG污染攻击
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DenialRAG单文档RAG污染攻击,通过嵌入参数化弃权引导LLM生成错误答案,经多数据集、多模型及防御评估,其在Mistral-7B上攻击效果最优,凸显RAG污染风险的复杂性。
Comments Submit to ACSAC 2026
从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态
机构 * Meituan(美团) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。
多模态上下文学习用于低资源语言的语音识别
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了通过多模态上下文学习提升低资源语言语音识别性能的方法,分析了跨语言迁移学习对模型效率的影响,并提出结合更强声学模型与语音LLM的改进系统。
Comments ACL 2026 findings
对话推荐系统中用户模拟的提示优化:一个多目标框架
机构 * Monash University(莫纳什大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出多目标框架自动优化LLM提示,以生成更真实、多样化的用户模拟行为,缓解对话推荐系统中的评估与数据获取难题。
Comments to be published in 2026 IEEE 42nd International Conference on Data Engineering Workshops (ICDEW)
一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Sun Yat-Sen University(中山大学) ; Technical University of Munich(慕尼黑工业大学) ; Heilbronn Data Science Center(海尔布隆数据科学中心) ; Munich Data Institute(慕尼黑数据研究所)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。
STRIDE: 通过子集扰动的稀疏恢复进行训练数据归因
机构 * Jinesis AI Lab, University of Toronto & Vector Institute(Jinesis AI实验室,多伦多大学及向量研究所) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所,图宾根,德国) ; Thoughtworks(Thoughtworks公司) ; Martian ; ELLIS Institute, Tübingen, Germany(图宾根ELLIS研究所,德国) ; EuroSafeAI
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出STRIDE框架,将训练数据归因建模为压缩感知中的稀疏恢复问题,通过激活空间中的轻量级“引导算子”模拟数据子集的影响,实现高效且准确的LLM预训练归因。
Comments project page: https://stride-tda.github.io/
LLM应如何消费高质量数据?通过质量感知的功能缩放定律实现最优数据调度
机构 * Peking University(北京大学) ; Meituan(美团)
专题命中 预训练与数据 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文通过引入数据质量维度扩展功能缩放定律,解析求解了联合数据质量和批次大小调度问题,揭示了高质量数据的双重角色,并提出了Drop-Stable-Rampup调度策略,在15B MoE模型上相比WSD和余弦衰减分别提升平均准确率+1.70和+2.98。
LLMs 作为噪声信道:香农视角下的模型容量与缩放定律
机构 * University of Virginia(弗吉尼亚大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对现有缩放定律无法解释非单调性能退化的问题,提出基于香农-哈特利定理的香农缩放定律,将LLM训练建模为噪声信道上的信息传输,通过信号噪声比解释模型规模与数据量对性能的影响。
Comments Accepted by ICML 2026
理性是否必要且充分?为可解释的虚假信息检测调优大语言模型
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了如何通过调优大语言模型(LLM)来提升可解释性虚假信息检测的性能,提出了一种新的数据合成管道LONSREX,用于定位必要且充分的理性,以解决现有方法中因粗粒度标签和过度验证行为导致的理性不足和冗余问题。
Comments Accepted by KDD 2026. 12 pages, 8 figures. Code: https://github.com/wangbing1416/LONSREX
通过子词正则化预训练语言模型:BPE Dropout在低资源NLP中的实证研究
机构 * Department of Computer Science, Stellenbosch University(斯瓦茨堡大学计算机科学系)
专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG
AI总结 本文研究了在低资源NLP中预训练时应用BPE Dropout对下游性能的影响,发现随机分词在预训练和微调时均优于仅在微调时应用,尤其在数据较少时表现更佳。
Comments Comments: 12 pages, 8 figures, 5 tables
通过因果语言模型的绕行提升编码器持续预训练
机构 * Sorbonne Université / INRIA Paris ALMAnaCH Team(索邦大学 / 巴黎INRIA ALMAnaCH团队) ; INRIA Paris ALMAnaCH Team(巴黎INRIA ALMAnaCH团队)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI
AI总结 本文通过在持续预训练中临时切换到因果语言模型并随后进行短时掩码语言模型衰减,提升了下游任务性能,特别是在生物医学文本上表现更优。