arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-17 至 2026-08-17 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 14 篇

2608.13866 2026-08-17 cs.LG cs.CL 新提交 90%

Geometric Filtering of LLM-Generated Samples for Few-Shot Text Classification

用于小样本文本分类的大语言模型生成样本的几何过滤

Benjamín Schindler, Gonzalo A. Ruz

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对LLM生成样本质量异质性问题,提出基于句子嵌入空间欧氏距离的几何过滤框架,结合软加权机制提升小样本文本分类性能,在多任务、多模型及多配置下均表现优异。

Comments 6 pages, 2 figures, to be published in IEEE LACCI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14229 2026-08-17 cs.CL 新提交 89%

The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning

越受欢迎,越难遗忘:用于大语言模型遗忘的自适应受欢迎度

Anna Borisiuk, Andrey Savchenko, Alexander Panchenko, Elena Tutubalina

机构 * AIRI Sber AI Lab(Sber AI实验室) Skoltech(斯科尔科沃科学技术研究院) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息学研究所可信人工智能研究中心)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(abstract);分类 cs.CL

AI总结 针对现有LLM遗忘方法未区分训练数据频率的问题,提出AdaPop方法,经实验其在转述查询和对抗性重构下均能显著减少遗忘内容泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14198 2026-08-17 cs.LG cs.CL 新提交 88%

MINT: A Universal Zero-Shot Predictor for Transaction Data

MINT:一种用于交易数据的通用零样本预测器

Parameswaran Kamalaruban, Viktor Drobnyi, Maeve Madigan, Julia Rozanova, David Sutton, Stuart Burrell

机构 * Visa Inc.(维萨公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);foundation model(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28008 2026-08-17 cs.CL cs.AI 版本更新 88%

RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

RepBench:将基准编译为大语言模型的能力表征

Yanshi Li, Xueru Bai, Shuman Liu, Long Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 RepBench构建多基准支撑的大语言模型能力表征探测数据层,揭示读出方式与聚合准则对评估的重要性,相关资源以闭环工作流形式发布。

Comments 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14211 2026-08-17 cs.LG cs.AI 新提交 84%

Training Fair Tabular Foundation Models

训练公平表格基础模型

Patrik Kenfack, Jesse C. Cresswell, Anthony L. Caterini, Samira Ebrahimi Kahou, Ulrich Aïvodji

机构 * ÉTS Montréal(蒙特利尔高等技术学院) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Layer 6 AI(第六层人工智能公司) University of Calgary(卡尔加里大学) CIFAR(加拿大高级研究所)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对表格基础模型(TFMs)公平性未被充分探索的问题,本研究提出FairTFM训练策略,将公平约束融入TFMs训练,在132个公平任务上实现公平性提升且保持竞争力准确性。

Comments Spotlight paper at the ICML 2026 Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14414 2026-08-17 cs.LG 新提交 79%

CytoBERT: A Foundation Model for Cytometry Data

CytoBERT:用于细胞计数数据的基础模型

Syed Abdul Haseeb Qadri, Bjarne C. Hiller, Felix Blanke, Vanja Sophie Cangalovic, Kutalmış Coşkun, Amin Mirzaei, Tom Siegl, Sebastian Bader, Thomas Kirste, Martin Becker

机构 * University of Rostock(罗斯托克大学) Marburg University(马尔堡大学) Hessian Center for Artificial Intelligence(黑森人工智能中心)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 针对细胞计数数据异质性与非标准化导致机器学习难以应用的问题,推出开源基础模型CytoBERT,经5000万细胞数据预训练后可实现跨数据集迁移学习,为通用细胞计数分析提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13947 2026-08-17 cs.CL 新提交 77%

Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion

通过属性引导的体裁扩展扩展非以故事为中心数据的创意写作规模

Hwan Chang, Yongil Kim, Heuiyeen Yeen, Yireun Kim, Jinsik Lee, Hwanhee Lee

机构 * Chung-Ang University(中央大学) LG AI Research(LG AI研究院)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出属性引导的体裁扩展框架,构建涵盖13种体裁的5万示例语料库,经微调的模型在多类创意写作任务上表现优于基线模型,证实受控体裁扩展是提升创意写作能力的关键。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13695 2026-08-17 cs.CY cs.LG 新提交 70%

Language-Specific Gaps in AI Safety Training Datasets

AI安全训练数据集中的语言特定缺口

Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03966 2026-08-17 cs.CL 版本更新 70%

HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification

HalluTruthQA-4K:面向阿拉伯语幻觉检测与事实验证的细粒度语料库及标注流程

Salah Eddine Bekhouche, Abdessalam Bouchekif, Hichem Telli, Mohammed-En-Nadhir Zighem, Abdenour Hadid

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HalluTruthQA-4K,这一含4000个阿拉伯语问答实例的细粒度语料库,用于阿拉伯语幻觉检测等任务,为HalluScoring 2026共享任务提供官方数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14509 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

Split the Labor: Separating Evidence Interpretation from Decision Aggregation

分工:将证据解释与决策聚合分离

Zhelun Wu

机构 * Atlassian(亚特兰西安公司)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出将证据解释与决策聚合分离,设计四字段证据元组解决计数尺度漂移问题,在纵向语料库上实现了优于基线的AUPRC性能。

Comments Atlassian. 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13973 2026-08-17 cs.CV 新提交 67%

Rethinking Auxiliary Modalities in Multimodal Zero-shot Anomaly Detection: From Semantic Fusion to Conditional Modulation

重新思考多模态零样本异常检测中的辅助模态:从语义融合到条件调制

Peng Wu, Xin Ge, Yujia Sun, Guansong Pang

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本研究针对现有多模态零样本异常检测方法的缺陷,提出即插即用的辅助条件增强框架,通过全局到局部的条件调制实现选择性多模态增强,在MVTec 3D-AD等数据集上提升了现有RGB零样本异常检测器的性能并达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12314 2026-08-17 cs.RO cs.CV 版本更新 67%

LatentAM: Real-Time, Large-Scale Latent Gaussian Attention Mapping via Online Dictionary Learning

LatentAM:通过在线字典学习实现实时、大规模的潜在高斯注意力映射

Junwoon Lee, Yulun Tian

机构 * Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 LatentAM通过在线字典学习实现实时、大规模的潜在高斯注意力映射,提升机器人感知的特征重建保真度与实时性

Comments 8 pages, 7 figures. Accepted for RA-L. Homepage: this https URL (https://junwoonlee.github.io/projects/LatentAM/) Code: this https URL (https://github.com/UMich-SSI-Lab/latentam)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08067 2026-08-17 cs.CL cs.AI 版本更新 62%

DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects

DialectS2S:面向低资源汉语方言的端到端语音对话建模

Yi Shu, Tianyu Peng, Yingzhuo Deng, Wen Yang, Jun Lin, Changming Xie, Xinyu Yu, Jiajun Zhang

专题命中 预训练与数据 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源汉语方言语音数据稀缺及语义不一致问题,提出DialectS2S模型,通过合成流水线与自对齐后训练策略提升方言语音生成质量,开源框架实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11637 2026-08-17 astro-ph.IM 版本更新 50%

Multivariate time series transformer embeddings for light curves of periodic variable stars

用于周期性变星光变曲线的多变量时间序列Transformer嵌入

Gabriel Chiong, Ignacio Becker, Pavlos Protopapas

专题命中 预训练与数据 :pretraining(abstract)

AI总结 该研究扩展了Astromer框架,提出多波段Transformer架构,在周期性变星分类任务中,其F1分数较单波段模型提升10至23个百分点,展现了多波段模型的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏