HuRef: HUman-REadable Fingerprint for Large Language Models
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments NeurIPS 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments NeurIPS 2024
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments Accepted to ACL 2024
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments CoRL 2023 Workshop (oral)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)
Comments Project Website: https://l2c-eval.github.io/
通过共享数据中的移动度量引导基于LLM的人群移动模拟
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 M2LSimu通过共享数据中的移动度量引导多提示调整,有效提升基于LLM的人群移动模拟的群体协调与真实性
Mural: 通过混合Transformer将LLM知识迁移到图像生成
机构 * Amazon AGI(亚马逊人工智能研究院)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出Mixture-of-Transformers架构,将冻结的LLM与扩散图像生成器结合,仅用文本-图像对训练,在多个基准上取得优异性能,并涌现出跨语言生成、颜色引导构图等新能力。
基于LLM的亲密伴侣暴力检测中的性别差异
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 研究通过反事实变体测试LLM在亲密伴侣暴力检测中的性别偏见,发现当受害者为男性时,暴力检测率系统性降低,女性施暴者身份是暴力识别的负向预测因子。
Comments Accepted at the Seventh Workshop on NLP and Computational Social Science (at ACL) 2026
用于LLM训练数据真实推断的微妙注入
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SIGIL框架,通过向文本中嵌入不可感知的“金丝雀序列”,使训练了这些文档的LLM在特定查询下表现出可检测的行为特征,从而证明文档被用于训练。
Gap-K%: 通过测量 Top-1 预测差距检测预训练数据
机构 * Yonsei University(延世大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出 Gap-K% 方法,利用 LLM 的 top-1 预测与目标 token 的对数概率差距及滑动窗口策略,在 WikiMIA 和 MIMIR 基准上实现预训练数据检测的最优性能。
Comments ACL 2026 Main Conference; 15 pages
灯塔中的伊莱亚斯,再次?诊断LLM故事中的低多样性
机构 * Department of Information Science(信息科学系)
专题命中 预训练与数据 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过采样20000个故事发现,LLM生成的故事中存在高度重复的词汇(如Elias、灯塔等),这些词汇来自偏好数据而非预训练数据,表明小数据集与强对齐算法的结合可能对多样性产生不成比例的影响。
相同数据,不同模式:基于LLM的文本到SQL的鲁棒性
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一个框架,通过从同一E/R模型生成多个等价关系模式变体,评估LLM在文本到SQL任务中对模式变化的鲁棒性,发现模式结构显著影响模型行为,且提供E/R规范可改善但不完全消除不一致性。
Comments Accepted for publication at Nineth International Workshop on Exploiting Artificial Intelligence Techniques for Data Management (aiDM '26), co-located with ACM SIGMOD 2026
言辞清晰却错误:基于LLM的代码现代化中的自我审查失败
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文研究了在使用大型语言模型(LLM)将遗留代码迁移到现代栈时,LLM是否能够识别其自身输出是否改变了可观察行为,发现自我审查不可靠,且存在语义保持漂移等问题。
Comments 11 pages, 6 figures, 2 tables. Corpus, oracle, output extractor, prompts, harness, self-review probe, and all 1,980 + 1,979 raw model outputs released as supplementary material at https://zenodo.org/records/20300861
通过检索知识实现相似模式注释的LLM基于测试代码故障定位
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出SPARK框架,通过整合CI环境积累的调试知识,提升LLM在测试代码故障定位中的效率,实验表明其在复杂测试用例中能更准确识别故障位置。
SOCpilot: 验证LLM辅助事件响应中的政策合规性
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 SOCpilot通过固定事件包、行动目录、政策规则和验证器,验证LLM辅助事件响应计划的合规性,评估两个LLM提供商在金融行业案例中的表现,去除非合规动作并提供零成本准备检查。
CRS-LLM:基于GPT风格主干和切换门融合的协作波束预测
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出CRS-LLM框架,通过将波束跟踪建模为联合BS-波束空间的单分类问题,结合双视角CSI分词器和截断GPT风格主干,实现更准确的波束预测,优于现有基线方法。
基于影响分数的代码大语言模型预训练数据选择实证研究
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);LLM(abstract)
AI总结 本文探讨了影响分数过滤技术在编程数据集中的有效性,通过大规模实验评估了该方法对模型性能的提升,并分析了有益训练数据在不同阶段和任务中的差异。
MuRating: 一种用于多语言大语言模型预训练的高质量数据选择方法
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; ByteDance(字节跳动) ; Eindhoven University of Technology(埃因霍温理工大学) ; University of Melbourne(墨尔本大学) ; University of Liverpool(利物浦大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI、cs.LG
AI总结 MuRating通过多语言评估器选择高质量数据,提升多语言大语言模型的预训练效果。
Comments NeurIPS 2025 poster
专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
Comments Accepted to IEEE Transactions on Multimedia (TMM)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)
Comments EMNLP2024 main
专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
Comments 47 pages, 26 figures; a thesis submitted in partial satisfaction of the requirements for the degree of Bachelor of Science in Computer Science at the University of California - Santa Cruz
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2023
MetaboLLM:用于生化知识整合与预测性代谢物图构建的代谢组学专用大语言模型
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 该研究开发了代谢组学专用大语言模型MetaboLLM及配套的MetaboLLM-GIN,经多阶段适配后,在相关任务及两个临床预测场景中均取得优于对照模型的性能,证明领域专用语言模型可构建可预测且可解释的代谢物图表征。
Comments 60 pages, 3 figures, 16 tables; includes Supplementary Information
KG2Code:通过可执行代码连接知识图谱与大语言模型以进行问答
机构 * Southeast University(东南大学) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其交叉应用重点实验室(东南大学)) ; Huawei Technologies(华为技术有限公司) ; University of Manchester(曼彻斯特大学) ; University of Edinburgh(爱丁堡大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 研究针对知识图谱问答中现有方法的局限,提出KG2Code方法,将知识图谱转换为代码表示,在此基础上构建KG2Code-QA框架,把KGQA作为代码生成任务,还构建代码语料库,训练后的模型在KGQA任务中表现优异且泛化性强。
一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍
专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.LG
AI总结 本文挑战异步流水线并行中一步梯度延迟导致不稳定的普遍观点,发现延迟影响取决于优化器选择,Muon等新优化器具有鲁棒性,并提出基于误差反馈的修正方法,在10B参数模型上实现与同步训练相当的性能。
GLIP:面向图级任务的图与大型语言模型联合预训练
机构 * Fudan University(复旦大学) ; ByteDance(字节跳动)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。
重新思考LLM FP4预训练中的收缩偏差:几何起源、系统影响与UFP4方案
机构 * Ling Team, Ant Group(蚂蚁集团灵团队)
专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.AI
AI总结 本文发现E2M1格式因几何不对称导致收缩偏差,该偏差经随机哈达玛变换放大,造成训练不稳定;提出均匀网格E1M2/INT4及UFP4训练方案,在多种模型上实现更低损失。
Comments 18 pages, 12 figures
BLISS: 一种用于语言模型预训练数据选择的轻量级双层影响评分方法
机构 * Department of Computer Science, George Mason University, USA(乔治·马歇尔大学计算机科学系) ; IBM T.J. Watson Research Center, USA(IBM T.J. Watson研究部) ; Department of Statistics, Rice University(里士大学统计系) ; Department of System Engineering & Operations Research, George Mason University, USA(乔治·马歇尔大学系统工程与运营管理系)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)
AI总结 提出一种无需外部预训练模型的轻量级数据选择方法BLISS,通过双层优化和代理模型估计训练样本的长期影响,实现高效数据筛选,在C4数据集上预训练多种规模模型,显著加速收敛并提升下游任务性能。
Dango:一个严格仅L1的大型语言模型,用于研究第二语言习得
机构 * Kyoto University(京都大学) ; NII-LLMC(日本国立信息与通信技术研究所-语言模型中心)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 提出1.8B参数的Dango模型,通过过滤L2污染和微调L2学习课程,模拟人类L2产出模式,优于未过滤和多语言基线。
Comments 8 pages main text, 20 pages total including references and appendices
AWM: 用于大型语言模型的准确权重矩阵指纹
机构 * LUMIA Lab(LUMIA实验室) ; School of Artificial Intelligence(人工智能学院) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
AI总结 AWM通过基于权重矩阵的无训练指纹方法,利用线性分配问题和无偏中心核对齐相似性,实现对大型语言模型训练来源的可靠识别。
Comments ICLR 2026
信心才是关键:一种用于多语言历史实体链接的无监督方法,使用大语言模型
机构 * Department of Humanities, University of Macerata(马切拉塔大学人文学科系) ; KNAW Humanities Cluster, DHLab(荷兰人文集群、DHLab) ; INFRES Department, Télécom Paris(巴黎电信学院INFRES部门)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
AI总结 本文提出MHEL-LLaMo,一种结合小型语言模型和大语言模型的无监督方法,用于多语言历史实体链接,通过置信度评分降低计算成本并提升准确性。