arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2311.01025 2024-05-01 cs.CV 80%

Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection

Sungjune Park, Hyunjun Kim, Yong Man Ro

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07963 2024-04-12 cs.CY cs.AI cs.CL cs.HC cs.LG 80%

EduAgent: Generative Student Agents in Learning

Songlin Xu, Xinyu Zhang, Lianhui Qin

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11779 2024-04-09 cs.CL cs.AI cs.LG 80%

Tokenization Matters: Navigating Data-Scarce Tokenization for Gender Inclusive Language Technologies

Anaelia Ovalle, Ninareh Mehrabi, Palash Goyal, Jwala Dhamala, Kai-Wei Chang, Richard Zemel, Aram Galstyan, Yuval Pinter, Rahul Gupta

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NAACL 2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20550 2024-04-08 cs.CV cs.AI cs.CL cs.LG 80%

CapsFusion: Rethinking Image-Text Data at Scale

Qiying Yu, Quan Sun, Xiaosong Zhang, Yufeng Cui, Fan Zhang, Yue Cao, Xinlong Wang, Jingjing Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments CVPR 2024. Code & Dataset: https://github.com/baaivision/CapsFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15393 2024-02-06 cs.LG cs.AI cs.CL 80%

DoGE: Domain Reweighting with Generalization Estimation

Simin Fan, Matteo Pagliardini, Martin Jaggi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02285 2024-02-06 cs.CL cs.AI cs.LG 80%

SynthDST: Synthetic Data is All You Need for Few-Shot Dialog State Tracking

Atharva Kulkarni, Bo-Hsiang Tseng, Joel Ruben Antony Moniz, Dhivya Piraviperumal, Hong Yu, Shruti Bhargava

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages. 4 figures, EACL 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13986 2024-01-26 cs.CL cs.AI cs.LG 80%

Towards Consistent Natural-Language Explanations via Explanation-Consistency Finetuning

Yanda Chen, Chandan Singh, Xiaodong Liu, Simiao Zuo, Bin Yu, He He, Jianfeng Gao

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:2307.08678

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01408 2023-12-05 cs.CV 80%

Improving In-Context Learning in Diffusion Models with Visual Context-Modulated Prompts

Tianqi Chen, Yongfei Liu, Zhendong Wang, Jianbo Yuan, Quanzeng You, Hongxia Yang, Mingyuan Zhou

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17233 2023-11-30 cs.CL cs.AI cs.IT cs.LG math.IT 80%

Quantifying the redundancy between prosody and text

Lukas Wolf, Tiago Pimentel, Evelina Fedorenko, Ryan Cotterell, Alex Warstadt, Ethan Wilcox, Tamar Regev

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04132 2023-10-31 cs.CL cs.AI cs.LG 80%

Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information Extraction

Martin Josifoski, Marija Sakota, Maxime Peyrard, Robert West

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03495 2023-10-20 cs.CL cs.AI cs.LG 80%

Automatic Prompt Optimization with "Gradient Descent" and Beam Search

Reid Pryzant, Dan Iter, Jerry Li, Yin Tat Lee, Chenguang Zhu, Michael Zeng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11392 2023-09-29 cs.IR 80%

Retrieving Supporting Evidence for Generative Question Answering

Siqing Huo, Negar Arabzadeh, Charles L. A. Clarke

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments arXiv admin note: text overlap with arXiv:2306.13781

Journal ref Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region (SIGIR-AP '23), November 26--28, 2023, Beijing, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03876 2023-09-08 cs.CL cs.AI cs.CY cs.LG 80%

OpinionGPT: Modelling Explicit Biases in Instruction-Tuned LLMs

Patrick Haller, Ansar Aynetdinov, Alan Akbik

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13781 2023-06-27 cs.IR 80%

Retrieving Supporting Evidence for LLMs Generated Answers

Siqing Huo, Negar Arabzadeh, Charles L. A. Clarke

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01786 2023-05-30 cs.CL cs.AI cs.LG 80%

Crosslingual Generalization through Multitask Finetuning

Niklas Muennighoff, Thomas Wang, Lintang Sutawika, Adam Roberts, Stella Biderman, Teven Le Scao, M Saiful Bari, Sheng Shen, Zheng-Xin Yong, Hailey Schoelkopf, Xiangru Tang, Dragomir Radev, Alham Fikri Aji, Khalid Almubarak, Samuel Albanie, Zaid Alyafeai, Albert Webson, Edward Raff, Colin Raffel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 main pages (119 with appendix), 16 figures and 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17651 2023-05-29 cs.CL cs.AI cs.LG 80%

Self-Refine: Iterative Refinement with Self-Feedback

Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, Shashank Gupta, Bodhisattwa Prasad Majumder, Katherine Hermann, Sean Welleck, Amir Yazdanbakhsh, Peter Clark

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code, data, and demo at https://selfrefine.info/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04360 2023-04-12 cs.CL cs.AI cs.LG 80%

Does Synthetic Data Generation of LLMs Help Clinical Text Mining?

Ruixiang Tang, Xiaotian Han, Xiaoqian Jiang, Xia Hu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 8 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.07705 2021-09-10 cs.CL cs.AI cs.LG 80%

How to Train BERT with an Academic Budget

Peter Izsak, Moshe Berchansky, Omer Levy

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04200 2026-01-09 cs.CL cs.AI 80%

Attribute-Aware Controlled Product Generation with LLMs for E-commerce

基于属性意识的LLM电商产品生成控制

Virginia Negri, Víctor Martínez Gómez, Sergio A. Balanya, Subburam Rajaram

机构 * Amazon Spain(亚马逊西班牙分公司) Amazon Germany(亚马逊德国分公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的属性意识电商产品生成方法,通过三种策略生成高质量合成数据,提升电商数据集的准确率与实用性。

Comments AAAI'26 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models (RSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05525 2025-08-08 cs.CL cs.AI 80%

The World According to LLMs: How Geographic Origin Influences LLMs' Entity Deduction Capabilities

Harsh Nishant Lalai, Raj Sanjay Shah, Jiaxin Pei, Sashank Varma, Yi-Chia Wang, Ali Emami

机构 * BITS, Pilani(比哈尔理工学院) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) Emory University(埃默里大学)

专题命中 预训练与数据 :language model(abstract,comments);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Conference on Language Modeling 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13760 2024-11-22 cs.LG cs.CL cs.HC 80%

A Framework for Evaluating LLMs Under Task Indeterminacy

Luke Guerdan, Hanna Wallach, Solon Barocas, Alexandra Chouldechova

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments To Appear in NeurIPS 2024 Workshops on Evaluating Evaluations (EvalEval) and Statistical Foundations of LLMs and Foundation Models (SFLLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07188 2024-07-16 cs.CL cs.AI 80%

Merging Improves Self-Critique Against Jailbreak Attacks

Victor Gallego

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published at ICML 2024 Workshop on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21489 2026-08-21 cs.LG 版本更新 79%

GraphPFN: A Prior-Data Fitted Graph Foundation Model

GraphPFN:一种先验数据拟合的图基础模型

Dmitry Eremeev, Oleg Platonov, Gleb Bazhenov, Artem Babenko, Liudmila Prokhorenkova

机构 * HSE University(莫斯科国立高等经济学院) Yandex Research(Yandex研究院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 针对图基础模型的可迁移性和数据稀缺问题,提出GraphPFN,基于先验数据拟合网络框架,设计多级随机块模型和优先连接过程生成合成图,结合图感知结构化因果模型生成属性,并扩展LimiX模型以融合图邻域聚合层,在节点级任务上实现上下文学习和微调的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17722 2026-08-19 cs.CR cs.LG 新提交 79%

MemCatalyst: Amplifying Data Auditing on Vision-Language Models via Data Poisoning

MemCatalyst:通过数据投毒增强视觉-语言模型的数据审计

Xukun Luan, Jinyan Liu, Yuhui Gong, Yuanguo Bi, Bing Hu, Xuesong Li, Di Wang

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出MemCatalyst数据投毒工具,通过文本与图像投毒策略增强视觉-语言模型的成员推断审计性能,在黑盒设置下投毒样本可跨架构迁移,仅需少量投毒样本即可提升审计效果且不影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17120 2026-08-19 cs.CL 新提交 79%

Children, but not language models, show accelerating returns in word learning

儿童在词汇学习中表现出加速回报,而语言模型则不然

Michael C. Frank

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究对比儿童与语言模型的词汇学习,发现儿童词汇学习呈加速积累特征,而语言模型则呈现恒定比例回报,且儿童学习所需训练数据远少于语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16900 2026-08-19 physics.soc-ph cs.AI cs.CY quant-ph 新提交 79%

QuantumNovelty: A Skill-Orchestrating Language Agent for Referee-Style Review and Patentability Screening of Quantum Papers and Patents

QuantumNovelty:用于量子论文与专利的评审式审查及可专利性筛选的技能编排语言智能体

Shlomo Kashani

专题命中 预训练与数据 :language agent(title,abstract);分类 cs.AI

AI总结 QuantumNovelty是一款开源技能编排语言智能体,可生成量子计算产物并通过含确定性门的审计层审查,在对抗语料库及真实手稿、专利的测试中表现出审查保守性,属于量子论文与专利审查的决策支持工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15798 2026-08-18 cs.LG stat.ML 新提交 79%

Cross-Entropy Risk Estimation for Language Models: Inconsistency Must Be Dense, and the Holdout Method Is No Exception

语言模型的交叉熵风险估计:不一致性必然是稠密的,留出法也不例外

Hanti Lin

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 该研究指出语言模型的每词交叉熵风险无法被一致估计,即使采用留出法也存在稠密的不一致状态,提出两种需付出代价的解决途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14414 2026-08-17 cs.LG 新提交 79%

CytoBERT: A Foundation Model for Cytometry Data

CytoBERT:用于细胞计数数据的基础模型

Syed Abdul Haseeb Qadri, Bjarne C. Hiller, Felix Blanke, Vanja Sophie Cangalovic, Kutalmış Coşkun, Amin Mirzaei, Tom Siegl, Sebastian Bader, Thomas Kirste, Martin Becker

机构 * University of Rostock(罗斯托克大学) Marburg University(马尔堡大学) Hessian Center for Artificial Intelligence(黑森人工智能中心)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 针对细胞计数数据异质性与非标准化导致机器学习难以应用的问题,推出开源基础模型CytoBERT,经5000万细胞数据预训练后可实现跨数据集迁移学习,为通用细胞计数分析提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10295 2026-08-12 cs.CV cs.AI 新提交 79%

Frozen Brain-MRI Foundation Models Are Site Fingerprints

冻结的脑MRI基础模型是站点指纹

Saman Rahbar

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI

AI总结 该研究发现冻结脑MRI基础模型的嵌入包含采集站点的指纹,该指纹可线性解码且与预训练无关,可通过特定方法移除,同时指出其对共享嵌入的影响及密集分割的代价,并发布了审计工具包。

Comments 15 pages, 5 figures, 7 tables. Code: https://github.com/saman-rahbar/scanner-fingerprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19040 2026-08-11 cs.LG 版本更新 79%

OATS: Online Data Augmentation for Time Series Foundation Models

OATS: 用于时间序列基础模型的在线数据增强

Junwei Deng, Chang Xu, Jiaqi W. Ma, Ming Jin, Chenghao Liu, Xu Zhang, Li Zhao, Jiang Bian

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Griffith University(格里菲斯大学) Datadog AI Research(Datadog AI研究院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 OATS通过动态生成合成数据提升时间序列基础模型的性能,采用探索-利用机制和扩散框架,在多个数据集上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏