arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138627 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12379 篇

2510.21813 2025-10-28 cs.CV cs.AI cs.LG 82%

SITS-DECO: A Generative Decoder Is All You Need For Multitask Satellite Image Time Series Modelling

Samuel J. Barrett, Docko Sow

机构 * LGND AI Tolbi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14045 2025-10-22 cs.CL cs.AI 82%

From Unaligned to Aligned: Scaling Multilingual LLMs with Multi-Way Parallel Corpora

Yingli Shen, Wen Lai, Shuo Wang, Ge Gao, Kangyang Luo, Alexander Fraser, Maosong Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Minzu University of China(民族大学) Institute for AI, Tsinghua University(清华大学人工智能研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

Comments EMNLP 2025 Main Conference (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20186 2025-10-20 cs.CL cs.LG 82%

Thinking Augmented Pre-training

Liang Wang, Nan Yang, Shaohan Huang, Li Dong, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 19 pages; v4 fixes an issue for HumanEval scores

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02340 2025-10-16 cs.CL cs.LG 82%

Can Prompts Rewind Time for LLMs? Evaluating the Effectiveness of Prompted Knowledge Cutoffs

Xin Gao, Ruiyi Zhang, Daniel Du, Saurabh Mahindre, Sai Ashish Somayajula, Pengtao Xie

机构 * UC San Diego(UC圣迭戈大学) SUNY Buffalo(纽约州立大学布法罗分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

Comments Published at EMNLP 2025; Code and data available at https://github.com/gxx27/time_unlearn

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02294 2025-10-03 cs.CL cs.AI 82%

F2LLM Technical Report: Matching SOTA Embedding Performance with 6 Million Open-Source Data

Ziyin Zhang, Zihan Liao, Hang Yu, Peng Di, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14256 2025-09-19 cs.CL cs.AI 82%

JU-NLP at Touché: Covert Advertisement in Conversational AI-Generation and Detection Strategies

Arka Dutta, Agrik Majumdar, Sombrata Biswas, Dipankar Das, Sivaji Bandyopadhyay

机构 * Department of Computer Science and Engineering, Jadavpur University(计算机科学与工程系,贾瓦德pur大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07311 2025-09-10 cs.CL cs.AI 82%

Does This Look Familiar to You? Knowledge Analysis via Model Internal Representations

Sihyun Park

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15164 2025-09-08 cs.NE cs.AI cs.LG 82%

From Frege to chatGPT: Compositionality in language, cognition, and deep neural networks

Jacob Russin, Sam Whitman McGrath, Danielle J. Williams

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 19 pages (28 pages including references), 2 figures. Forthcoming in an edited volume on neuroscience and philosophy

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18452 2025-09-05 cs.CL cs.AI 82%

FRIDA to the Rescue! Analyzing Synthetic Data Effectiveness in Object-Based Common Sense Reasoning for Disaster Response

Mollie Shichman, Claire Bonial, Austin Blodgett, Taylor Hudson, Francis Ferraro, Rachel Rudinger

机构 * University of Maryland, College Park(马里兰大学学院市分校) Army Research Lab(陆军研究实验室) Oak Ridge Associated Universities(橡树岭关联大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 8 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21065 2025-08-13 cs.CL cs.HC cs.LG cs.RO 82%

AI Pedagogy: Dialogic Social Learning for Artificial Agents

Sabrina Patania, Luca Annese, Cansu Koyuturk, Azzurra Ruggeri, Dimitri Ognibene

机构 * University of Milan-Bicocca(米兰-比科卡大学) Technical University of Munich(慕尼黑技术大学) Institute for Cognitive Sciences and Technologies (ISTC-CNR)(认知科学与技术研究所(ISTC-CNR))

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments accepted at ICSR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06219 2025-08-06 cs.CL cs.LG 82%

Can Performant LLMs Be Ethical? Quantifying the Impact of Web Crawling Opt-Outs

Dongyang Fan, Vinko Sabolčec, Matin Ansaripour, Ayush Kumar Tarun, Martin Jaggi, Antoine Bosselut, Imanol Schlag

机构 * EPFL(苏黎世联邦理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments COLM 2025 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13390 2025-07-21 cs.CL cs.LG 82%

PARAM-1 BharatGen 2.9B Model

Kundeshwar Pundalik, Piyush Sawarkar, Nihar Sahoo, Abhishek Shinde, Prateek Chanda, Vedant Goswami, Ajay Nagpal, Atul Singh, Viraj Thakur, Vijay Dewane, Aamod Thakur, Bhargav Patel, Smita Gautam, Bhagwan Panditi, Shyam Pawar, Madhav Kotcha, Suraj Racha, Saral Sureka, Pankaj Singh, Rishi Bal, Rohit Saluja, Ganesh Ramakrishnan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08890 2025-07-15 cs.IR cs.AI cs.CL 82%

Overview of the TREC 2023 deep learning track

Nick Craswell, Bhaskar Mitra, Emine Yilmaz, Hossein A. Rahmani, Daniel Campos, Jimmy Lin, Ellen M. Voorhees, Ian Soboroff

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments arXiv admin note: substantial text overlap with arXiv:2507.08191

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00316 2025-07-03 cs.LG cs.CL eess.IV 82%

$μ^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation

Siyou Li, Pengyao Qin, Huanan Wu, Dong Nie, Arun J. Thirunavukarasu, Juntao Yu, Le Zhang

机构 * School of Electronic Engineering and Computer Science(电子工程与计算机科学学院) Queen Mary University of London(伦敦女王学院) School of Engineering, College of Engineering and Physical Sciences(工程学院,工程与物理科学学院) University of Birmingham(伯明翰大学) Guangdong University of Technology(广东工业大学) Meta Inc. US(Meta美国公司) Nuffield Department of Clinical Neurosciences(临床神经科学系) University of Oxford(牛津大学) William Harvey Research Institute, NIHR Barts Biomedical Research Centre, Queen Mary University London(威廉·哈里弗研究所在NIHR巴茨生物医学研究中心,伦敦女王学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16912 2025-06-23 cs.CL cs.LG 82%

From Data to Knowledge: Evaluating How Efficiently Language Models Learn Facts

Daniel Christoph, Max Ploner, Patrick Haller, Alan Akbik

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) Science Of Intelligence(智能科学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG;large language model(comments)

Comments Accepted to the First Workshop on Large Language Model Memorization (L2M2), co-located with ACL 2025 in Vienna

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10020 2025-06-13 cs.CR cs.AI cs.CL 82%

From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment

Kyubyung Chae, Hyunbin Jin, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05767 2025-06-09 cs.CL cs.AI 82%

dots.llm1 Technical Report

Bi Huo, Bin Tu, Cheng Qin, Da Zheng, Debing Zhang, Dongjie Zhang, En Li, Fu Guo, Jian Yao, Jie Lou, Junfeng Tian, Li Hu, Ran Zhu, Shengdong Chen, Shuo Liu, Su Guang, Te Wo, Weijun Zhang, Xiaoming Shi, Xinxin Peng, Xing Wu, Yawen Liu, Yuqiu Ji, Ze Wen, Zhenhai Liu, Zichao Li, Zilong Liao

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13467 2025-06-02 cs.LG cs.AI cs.DC 82%

LlamaDuo: LLMOps Pipeline for Seamless Migration from Service LLMs to Small-Scale Local LLMs

Chansung Park, Juyong Jiang, Fan Wang, Sayak Paul, Jing Tang

机构 * Electronics and Telecommunications Research Institute(电子电信研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Hugging Face

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments The first three authors contributed equally to this work; Accepted by ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15501 2025-05-22 cs.CL cs.AI 82%

Protoknowledge Shapes Behaviour of LLMs in Downstream Tasks: Memorization and Generalization with Knowledge Graphs

Federico Ranaldi, Andrea Zugarini, Leonardo Ranaldi, Fabio Massimo Zanzotto

机构 * Human-centric ART, University of Rome Tor Vergata(罗马托维加塔大学人本艺术研究中心) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16677 2025-04-24 cs.CL cs.AI 82%

A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics

Luisa Shimabucoro, Ahmet Ustun, Marzieh Fadaee, Sebastian Ruder

机构 * Cohere For AI University of São Paulo(圣保罗大学) Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10796 2025-04-22 cs.LG cs.CL 82%

Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance

Sachin Goyal, Christina Baek, J. Zico Kolter, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

Comments Published at ICLR 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01702 2025-02-25 cs.AI cs.CL cs.RO 82%

AgentRefine: Enhancing Agent Generalization through Refinement Tuning

Dayuan Fu, Keqing He, Yejie Wang, Wentao Hong, Zhuoma Gongque, Weihao Zeng, Wei Wang, Jingang Wang, Xunliang Cai, Weiran Xu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05629 2025-02-21 cs.CL cs.AI 82%

Vector-ICL: In-context Learning with Continuous Vector Representations

Yufan Zhuang, Chandan Singh, Liyuan Liu, Jingbo Shang, Jianfeng Gao

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02672 2025-02-07 cs.CL cs.LG 82%

Transformers Boost the Performance of Decision Trees on Tabular Data across Sample Sizes

Mayuka Jayawardhana, Renbo, Samuel Dooley, Valeriia Cherepanova, Andrew Gordon Wilson, Frank Hutter, Colin White, Tom Goldstein, Micah Goldblum

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10221 2025-01-13 cs.CV cs.AI cs.CL 82%

Long Story Short: Story-level Video Understanding from 20K Short Films

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

专题命中 预训练与数据 :LLM(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05629 2025-01-13 cs.CL cs.AI 82%

The Impact of Model Scaling on Seen and Unseen Language Performance

Rhitabrat Pokharel, Sina Bagheri Nezhad, Ameeta Agrawal, Suresh Singh

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted at SEAS Workshop at AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15282 2024-12-23 cs.CL cs.AI cs.IR 82%

A Systematic Examination of Preference Learning through the Lens of Instruction-Following

Joongwon Kim, Anirudh Goyal, Aston Zhang, Bo Xiong, Rui Hou, Melanie Kambadur, Dhruv Mahajan, Hannaneh Hajishirzi, Liang Tan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18634 2024-11-19 cs.LG cs.CL stat.ML 82%

A Theoretical Understanding of Self-Correction through In-context Alignment

Yifei Wang, Yuyang Wu, Zeming Wei, Stefanie Jegelka, Yisen Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12108 2024-10-10 cs.LG cs.CL cs.CR 82%

Private prediction for large-scale synthetic text generation

Kareem Amin, Alex Bie, Weiwei Kong, Alexey Kurakin, Natalia Ponomareva, Umar Syed, Andreas Terzis, Sergei Vassilvitskii

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 20 pages; updated figure + some new experiments from EMNLP 2024 findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02678 2024-10-04 cs.CL cs.AI 82%

Distilling an End-to-End Voice Assistant Without Instruction Training Data

William Held, Ella Li, Michael Ryan, Weiyan Shi, Yanzhe Zhang, Diyi Yang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏