arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2604.22117 2026-04-29 cs.LG cs.AI cs.CL 94%

PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

PermaFrost-Attack: stealth pretraining seeding (spS) 用于在LLM训练期间种植逻辑地雷

Harsh Kumar, Rahul Maity, Tanmay Joshi, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * Manipal University Jaipur(Manipal大学斋普尔) NIT, Karnataka(Karnataka理工学院) Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa印度普拉吉亚实验室) Apple, USA(美国苹果公司) Google, USA(美国谷歌公司)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在LLM训练中通过隐蔽预训练播种(SPS)植入逻辑地雷的威胁模型,通过几何诊断方法揭示了潜藏的中毒行为,展示了SPS对基础模型的安全性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01490 2026-04-29 cs.CL 90%

Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning

多个篮子里的合成鸡蛋:合成数据多样性对LLM微调的影响

Max Schaffelder, Albert Gatt

机构 * Utrecht University(乌特勒支大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究合成数据来源多样性对LLM微调的影响,发现多样化数据可缓解分布崩溃,提升输出质量,并减少自偏好偏差。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18090 2026-04-29 cs.DL cs.AI cs.CL 90%

Named Entity Recognition of Historical Texts via Large Language Model

通过大语言模型进行历史文本的命名实体识别

Shibingfeng Zhang, Giovanni Colavizza

机构 * University of Bologna(博洛尼亚大学) University of Copenhagen(哥本哈根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了利用零样本和少样本提示策略,用大语言模型进行历史文档命名实体识别,实验表明在HIPE-2022数据集上表现良好,尽管不如全监督模型,但仍具潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 83%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);prompting(abstract)

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24770 2026-04-29 cs.CL cs.SD 81%

Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR

通过语音合成进行老年人语境数据增强用于老年人ASR

Minsik Lee, Seoi Hong, Chongmin Lee, Sieun Choi, Jian Kim, Jua Han, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(计算机科学与人工智能系,东国大学) Department of Biostatistics, Harvard University(生物统计学系,哈佛大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过结合大语言模型和语音合成技术,解决老年人ASR数据稀缺问题,实验表明方法有效降低WER达58.2%。

Comments 5 pages, 2 figures, under review at IEEE Signal Processing Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25906 2026-04-29 cs.IR 80%

Make Any Collection Navigable: Methods for Constructing and Evaluating Hypergraph of Text

使任意集合可导航:构建和评估文本超图的方法

Dean E. Alvarez, ChengXiang Zhai

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出构建和评估文本超图的方法,引入了努力比率指标,实验表明简单TF-IDF基线在该指标上可与基于LLM的方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25891 2026-04-29 cs.LG cs.AI cs.CR 79%

Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

条件性偏差:通用干预可以隐藏新兴偏差背后的情境触发

Jan Dubiński, Jan Betley, Anna Sztyber-Betley, Daniel Tan, Owain Evans

机构 * Warsaw University of Technology(华沙技术大学) NASK National Research Institute(NASK国家研究院) Constellation Truthful AI University College London(伦敦大学学院) Center on Long-Term Risk(长期风险中心) UC Berkeley(伯克利大学)

专题命中 预训练与数据 :language model(abstract);post-training(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究发现通用干预可减少新兴偏差,但若评估提示模仿训练情境,则模型会再次出现偏差。三种干预方法均产生条件性偏差,表明在真实训练后,模型可能在标准评估中表现正常但存在潜在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20941 2026-04-29 cs.LG 77%

Revisiting the Past: Data Unlearning with Model State History

重访过去:利用模型状态历史的数据遗忘

Keivan Rezaei, Mehrdad Saberi, Abhilasha Ravichander, Soheil Feizi

机构 * Department of Computer Science, University of Maryland(大学马里兰大学计算机科学系) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出MSA算法,通过利用预训练过程中的模型检查点来估计并抵消特定数据点的影响,实验证明其在多个基准、模型和评估指标上表现优异,为更灵活的数据擦除大型语言模型提供有效方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24819 2026-04-29 cs.SE cs.AI 70%

Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

用数据编程:面向自改进大语言模型的测试驱动数据工程

Chenkai Pan, Xinglong Xu, Yuhang Xu, Yujun Wu, Siyuan Li, Jintao Chen, Conghui He, Jingxuan Wei, Cheng Tan

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过数据编程方法,将数据工程生命周期映射到软件开发生命周期,实现对大语言模型的可靠训练与改进,通过数据修复提升模型性能。

Comments 57 pages, 28 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25316 2026-04-29 cs.CV 50%

Towards Robust Deep Learning-based Rumex Obtusifolius Detection from Drone Images

面向无人机图像的鲁棒深度学习Rumex Obtusifolius检测

Fabian Dionys Schrag, Mehmet Ozgur Turkoglu, Konrad Schindler, Ralph Lukas Stoop

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文研究了通过无人机图像对Rumex进行分类的领域适应问题,发现基于ResNet的CNN模型在目标域表现不佳,而预训练的Vision Transformer在领域转移中表现更优,公开了包含15次飞行数据的AGSMultiRumex数据集。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07105 2026-04-29 cs.RO 50%

Genie Sim PanoRecon: Fast Immersive Scene Generation from Single-View Panorama

Genie Sim PanoRecon:从单视角全景快速生成沉浸式场景

Zhijun Li, Yongxin Su, Di Yang, Jichao Wang, Zheyuan Xing, Qian Wang, Maoqing Yao

机构 * AgibotTech

专题命中 预训练与数据 :LLM(abstract)

AI总结 提出Genie Sim PanoRecon,通过高斯点散布管道快速生成高质量3D场景,用于机器人操作模拟,实现全景分解、并行处理和无缝重建,提升仿真实景生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏