arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12393 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2601.09733 2026-01-16 cs.CL cs.AI 82%

Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets

闭合数据循环:利用OpenDataArena工程更优质的训练数据集

Xin Gao, Xiaoyang Wang, Yun Zhu, Mengzhang Cai, Conghui He, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出利用OpenDataArena构建闭合循环数据集,通过ODA-Math-460k和ODA-Mixture数据集展示其在数学推理和多领域指令任务上的卓越性能。

Comments Superior ODA-Math, ODA-Mixture Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06435 2025-12-30 cs.CL cs.AI 82%

Learning the Topic, Not the Language: How LLMs Classify Online Immigration Discourse Across Languages

学习主题,而非语言:如何LLMs在跨语言环境下分类在线移民 discourse

Andrea Nasuto, Stefano Maria Iacus, Francisco Rowe, Devika Jain

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种轻量级开源框架,利用微调后的LLaMA模型跨13种语言分类移民相关推文,展示LLMs在少量数据下可泛化主题理解,并通过多语言微调捕捉意识形态细微差别,实现高效且低成本的多语言分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21332 2025-12-25 cs.CL cs.AI 82%

C2LLM Technical Report: A New Frontier in Code Retrieval via Adaptive Cross-Attention Pooling

C2LLM技术报告:通过自适应跨注意力池化实现代码检索的新前沿

Jin Qin, Zihan Liao, Ziyin Zhang, Hang Yu, Peng Di, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 C2LLM通过自适应跨注意力池化技术,实现更高效的代码检索,其模型在代码嵌入任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25378 2025-10-30 cs.CL cs.AI 82%

Hallucinations in Bibliographic Recommendation: Citation Frequency as a Proxy for Training Data Redundancy

Junichiro Niimi

机构 * Meijo University(名古屋大学) RIKEN AIP(理化学研究所AIP)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23659 2025-10-28 cs.CL cs.AI 82%

Aligning LLMs for Multilingual Consistency in Enterprise Applications

Amit Agarwal, Hansa Meghwani, Hitesh Laxmichand Patel, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21813 2025-10-28 cs.CV cs.AI cs.LG 82%

SITS-DECO: A Generative Decoder Is All You Need For Multitask Satellite Image Time Series Modelling

Samuel J. Barrett, Docko Sow

机构 * LGND AI Tolbi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14045 2025-10-22 cs.CL cs.AI 82%

From Unaligned to Aligned: Scaling Multilingual LLMs with Multi-Way Parallel Corpora

Yingli Shen, Wen Lai, Shuo Wang, Ge Gao, Kangyang Luo, Alexander Fraser, Maosong Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Minzu University of China(民族大学) Institute for AI, Tsinghua University(清华大学人工智能研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

Comments EMNLP 2025 Main Conference (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20186 2025-10-20 cs.CL cs.LG 82%

Thinking Augmented Pre-training

Liang Wang, Nan Yang, Shaohan Huang, Li Dong, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 19 pages; v4 fixes an issue for HumanEval scores

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02340 2025-10-16 cs.CL cs.LG 82%

Can Prompts Rewind Time for LLMs? Evaluating the Effectiveness of Prompted Knowledge Cutoffs

Xin Gao, Ruiyi Zhang, Daniel Du, Saurabh Mahindre, Sai Ashish Somayajula, Pengtao Xie

机构 * UC San Diego(UC圣迭戈大学) SUNY Buffalo(纽约州立大学布法罗分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

Comments Published at EMNLP 2025; Code and data available at https://github.com/gxx27/time_unlearn

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02294 2025-10-03 cs.CL cs.AI 82%

F2LLM Technical Report: Matching SOTA Embedding Performance with 6 Million Open-Source Data

Ziyin Zhang, Zihan Liao, Hang Yu, Peng Di, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14256 2025-09-19 cs.CL cs.AI 82%

JU-NLP at Touché: Covert Advertisement in Conversational AI-Generation and Detection Strategies

Arka Dutta, Agrik Majumdar, Sombrata Biswas, Dipankar Das, Sivaji Bandyopadhyay

机构 * Department of Computer Science and Engineering, Jadavpur University(计算机科学与工程系,贾瓦德pur大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07311 2025-09-10 cs.CL cs.AI 82%

Does This Look Familiar to You? Knowledge Analysis via Model Internal Representations

Sihyun Park

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15164 2025-09-08 cs.NE cs.AI cs.LG 82%

From Frege to chatGPT: Compositionality in language, cognition, and deep neural networks

Jacob Russin, Sam Whitman McGrath, Danielle J. Williams

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 19 pages (28 pages including references), 2 figures. Forthcoming in an edited volume on neuroscience and philosophy

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18452 2025-09-05 cs.CL cs.AI 82%

FRIDA to the Rescue! Analyzing Synthetic Data Effectiveness in Object-Based Common Sense Reasoning for Disaster Response

Mollie Shichman, Claire Bonial, Austin Blodgett, Taylor Hudson, Francis Ferraro, Rachel Rudinger

机构 * University of Maryland, College Park(马里兰大学学院市分校) Army Research Lab(陆军研究实验室) Oak Ridge Associated Universities(橡树岭关联大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 8 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21065 2025-08-13 cs.CL cs.HC cs.LG cs.RO 82%

AI Pedagogy: Dialogic Social Learning for Artificial Agents

Sabrina Patania, Luca Annese, Cansu Koyuturk, Azzurra Ruggeri, Dimitri Ognibene

机构 * University of Milan-Bicocca(米兰-比科卡大学) Technical University of Munich(慕尼黑技术大学) Institute for Cognitive Sciences and Technologies (ISTC-CNR)(认知科学与技术研究所(ISTC-CNR))

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments accepted at ICSR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06219 2025-08-06 cs.CL cs.LG 82%

Can Performant LLMs Be Ethical? Quantifying the Impact of Web Crawling Opt-Outs

Dongyang Fan, Vinko Sabolčec, Matin Ansaripour, Ayush Kumar Tarun, Martin Jaggi, Antoine Bosselut, Imanol Schlag

机构 * EPFL(苏黎世联邦理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments COLM 2025 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13390 2025-07-21 cs.CL cs.LG 82%

PARAM-1 BharatGen 2.9B Model

Kundeshwar Pundalik, Piyush Sawarkar, Nihar Sahoo, Abhishek Shinde, Prateek Chanda, Vedant Goswami, Ajay Nagpal, Atul Singh, Viraj Thakur, Vijay Dewane, Aamod Thakur, Bhargav Patel, Smita Gautam, Bhagwan Panditi, Shyam Pawar, Madhav Kotcha, Suraj Racha, Saral Sureka, Pankaj Singh, Rishi Bal, Rohit Saluja, Ganesh Ramakrishnan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08890 2025-07-15 cs.IR cs.AI cs.CL 82%

Overview of the TREC 2023 deep learning track

Nick Craswell, Bhaskar Mitra, Emine Yilmaz, Hossein A. Rahmani, Daniel Campos, Jimmy Lin, Ellen M. Voorhees, Ian Soboroff

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments arXiv admin note: substantial text overlap with arXiv:2507.08191

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00316 2025-07-03 cs.LG cs.CL eess.IV 82%

$μ^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation

Siyou Li, Pengyao Qin, Huanan Wu, Dong Nie, Arun J. Thirunavukarasu, Juntao Yu, Le Zhang

机构 * School of Electronic Engineering and Computer Science(电子工程与计算机科学学院) Queen Mary University of London(伦敦女王学院) School of Engineering, College of Engineering and Physical Sciences(工程学院,工程与物理科学学院) University of Birmingham(伯明翰大学) Guangdong University of Technology(广东工业大学) Meta Inc. US(Meta美国公司) Nuffield Department of Clinical Neurosciences(临床神经科学系) University of Oxford(牛津大学) William Harvey Research Institute, NIHR Barts Biomedical Research Centre, Queen Mary University London(威廉·哈里弗研究所在NIHR巴茨生物医学研究中心,伦敦女王学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16912 2025-06-23 cs.CL cs.LG 82%

From Data to Knowledge: Evaluating How Efficiently Language Models Learn Facts

Daniel Christoph, Max Ploner, Patrick Haller, Alan Akbik

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) Science Of Intelligence(智能科学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG;large language model(comments)

Comments Accepted to the First Workshop on Large Language Model Memorization (L2M2), co-located with ACL 2025 in Vienna

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10020 2025-06-13 cs.CR cs.AI cs.CL 82%

From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment

Kyubyung Chae, Hyunbin Jin, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05767 2025-06-09 cs.CL cs.AI 82%

dots.llm1 Technical Report

Bi Huo, Bin Tu, Cheng Qin, Da Zheng, Debing Zhang, Dongjie Zhang, En Li, Fu Guo, Jian Yao, Jie Lou, Junfeng Tian, Li Hu, Ran Zhu, Shengdong Chen, Shuo Liu, Su Guang, Te Wo, Weijun Zhang, Xiaoming Shi, Xinxin Peng, Xing Wu, Yawen Liu, Yuqiu Ji, Ze Wen, Zhenhai Liu, Zichao Li, Zilong Liao

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13467 2025-06-02 cs.LG cs.AI cs.DC 82%

LlamaDuo: LLMOps Pipeline for Seamless Migration from Service LLMs to Small-Scale Local LLMs

Chansung Park, Juyong Jiang, Fan Wang, Sayak Paul, Jing Tang

机构 * Electronics and Telecommunications Research Institute(电子电信研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Hugging Face

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments The first three authors contributed equally to this work; Accepted by ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15501 2025-05-22 cs.CL cs.AI 82%

Protoknowledge Shapes Behaviour of LLMs in Downstream Tasks: Memorization and Generalization with Knowledge Graphs

Federico Ranaldi, Andrea Zugarini, Leonardo Ranaldi, Fabio Massimo Zanzotto

机构 * Human-centric ART, University of Rome Tor Vergata(罗马托维加塔大学人本艺术研究中心) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16677 2025-04-24 cs.CL cs.AI 82%

A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics

Luisa Shimabucoro, Ahmet Ustun, Marzieh Fadaee, Sebastian Ruder

机构 * Cohere For AI University of São Paulo(圣保罗大学) Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10796 2025-04-22 cs.LG cs.CL 82%

Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance

Sachin Goyal, Christina Baek, J. Zico Kolter, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

Comments Published at ICLR 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01702 2025-02-25 cs.AI cs.CL cs.RO 82%

AgentRefine: Enhancing Agent Generalization through Refinement Tuning

Dayuan Fu, Keqing He, Yejie Wang, Wentao Hong, Zhuoma Gongque, Weihao Zeng, Wei Wang, Jingang Wang, Xunliang Cai, Weiran Xu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05629 2025-02-21 cs.CL cs.AI 82%

Vector-ICL: In-context Learning with Continuous Vector Representations

Yufan Zhuang, Chandan Singh, Liyuan Liu, Jingbo Shang, Jianfeng Gao

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02672 2025-02-07 cs.CL cs.LG 82%

Transformers Boost the Performance of Decision Trees on Tabular Data across Sample Sizes

Mayuka Jayawardhana, Renbo, Samuel Dooley, Valeriia Cherepanova, Andrew Gordon Wilson, Frank Hutter, Colin White, Tom Goldstein, Micah Goldblum

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10221 2025-01-13 cs.CV cs.AI cs.CL 82%

Long Story Short: Story-level Video Understanding from 20K Short Films

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

专题命中 预训练与数据 :LLM(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏