arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2311.08552 2023-11-16 cs.CL 85%

UT5: Pretraining Non autoregressive T5 with unrolled denoising

Mahmoud G. Salem, Jiayu Ye, Chu-Cheng Lin, Frederick Liu

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13060 2023-10-31 cs.CL 85%

Injecting structural hints: Using language models to study inductive biases in language learning

Isabel Papadimitriou, Dan Jurafsky

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

Comments Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16958 2023-10-27 cs.LG physics.chem-ph 85%

Transferring a molecular foundation model for polymer property predictions

Pei Zhang, Logan Kearney, Debsindhu Bhowmik, Zachary Fox, Amit K. Naskar, John Gounley

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03350 2023-10-19 cs.CL 85%

Measuring and Narrowing the Compositionality Gap in Language Models

Ofir Press, Muru Zhang, Sewon Min, Ludwig Schmidt, Noah A. Smith, Mike Lewis

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

Comments To appear at Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02363 2023-09-11 cs.CL 85%

Entity Tracking in Language Models

Najoung Kim, Sebastian Schuster

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

Comments ACL 2023 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16493 2023-09-01 cs.AI cs.RO 85%

Expanding Frozen Vision-Language Models without Retraining: Towards Improved Robot Perception

Riley Tavassoli, Mani Amani, Reza Akhavian

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.AI

Comments Preprint submitted to Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08520 2023-08-17 cs.CV cs.LG 85%

Painter: Teaching Auto-regressive Language Models to Draw Sketches

Reza Pourreza, Apratim Bhattacharyya, Sunny Panchal, Mingu Lee, Pulkit Madan, Roland Memisevic

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05012 2023-08-10 cs.AI 85%

MetRoBERTa: Leveraging Traditional Customer Relationship Management Data to Develop a Transit-Topic-Aware Language Model

Michael Leong, Awad Abdelhalim, Jude Ha, Dianne Patterson, Gabriel L. Pincus, Anthony B. Harris, Michael Eichler, Jinhua Zhao

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02469 2023-08-01 cs.CV cs.CL 85%

What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?

Yan Zeng, Hanbo Zhang, Jiani Zheng, Jiangnan Xia, Guoqiang Wei, Yang Wei, Yuchen Zhang, Tao Kong

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14908 2023-05-25 cs.CL 85%

PURR: Efficiently Editing Language Model Hallucinations by Denoising Language Model Corruptions

Anthony Chen, Panupong Pasupat, Sameer Singh, Hongrae Lee, Kelvin Guu

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03212 2023-05-19 cs.CV cs.AI 85%

LLM2Loss: Leveraging Language Models for Explainable Model Diagnostics

Shervin Ardeshir

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06280 2023-04-25 cs.LG 85%

Language Models are Realistic Tabular Data Generators

Vadim Borisov, Kathrin Seßler, Tobias Leemann, Martin Pawelczyk, Gjergji Kasneci

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09151 2023-04-19 cs.CL 85%

UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining

Hyung Won Chung, Noah Constant, Xavier Garcia, Adam Roberts, Yi Tay, Sharan Narang, Orhan Firat

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05058 2022-12-13 cs.CY cs.AI 85%

Structured Like a Language Model: Analysing AI as an Automated Subject

Liam Magee, Vanicka Arora, Luke Munn

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04092 2022-12-09 cs.CL 85%

Successive Prompting for Decomposing Complex Questions

Dheeru Dua, Shivanshu Gupta, Sameer Singh, Matt Gardner

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10258 2022-10-24 cs.CL 85%

Continued Pretraining for Better Zero- and Few-Shot Promptability

Zhaofeng Wu, Robert L. Logan, Pete Walsh, Akshita Bhagia, Dirk Groeneveld, Sameer Singh, Iz Beltagy

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10747 2022-10-14 cs.CV cs.AI 85%

Language Models with Image Descriptors are Strong Few-Shot Video-Language Learners

Zhenhailong Wang, Manling Li, Ruochen Xu, Luowei Zhou, Jie Lei, Xudong Lin, Shuohang Wang, Ziyi Yang, Chenguang Zhu, Derek Hoiem, Shih-Fu Chang, Mohit Bansal, Heng Ji

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05446 2022-09-15 cs.SE cs.LG 85%

CoditT5: Pretraining for Source Code and Natural Language Editing

Jiyang Zhang, Sheena Panthaplackel, Pengyu Nie, Junyi Jessy Li, Milos Gligoric

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments ASE 2022 (camera ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01127 2022-09-07 cs.CV cs.CL 85%

VL-BEiT: Generative Vision-Language Pretraining

Hangbo Bao, Wenhui Wang, Li Dong, Furu Wei

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.00212 2022-08-19 cs.CL cs.SD eess.AS 85%

Effect and Analysis of Large-scale Language Model Rescoring on Competitive ASR Systems

Takuma Udagawa, Masayuki Suzuki, Gakuto Kurata, Nobuyasu Itoh, George Saon

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL

Comments Accepted to Interspeech 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11167 2026-08-12 cs.CV cs.CL cs.LG 新提交 85%

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09717 2026-08-10 cs.LG cs.AI 版本更新 85%

Provable Training Data Identification for Large Language Models

大语言模型训练数据的可证明识别

Zhenlong Liu, Hao Zeng, Weiran Huang, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出PTDI方法,通过集级推断实现大语言模型训练数据识别的可证明误差控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 85%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01061 2026-07-14 cs.AI cs.CL 版本更新 85%

Agentic generation of verifiable rules for deterministic, self-expanding reaction classification

用于确定性、自扩展反应分类的可验证规则的智能体生成

Daniel Armstrong, Maarten Dobbelaere, Valentas Olikauskas, Helena Avila, Octavian Susanu, Jérôme Waser, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Laboratory for Chemical Technology, Ghent University(根特大学化学技术实验室) NCCR Catalysis(瑞士国家研究能力中心催化项目)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体LLM框架,通过验证循环自动生成反应规则,将标准分类从68类扩展到14,073类,并实现97.7%的未知反应分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-07-09 cs.CL cs.AI 新提交 85%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03160 2026-07-07 cs.CL cs.AI 新提交 85%

The Role of Prompt Language and Translation-Theory-Driven Prompts in Large Language Models: A Case Study on Spanish-Chinese Journalistic Translation

提示语言和翻译理论驱动的提示在大语言模型中的作用:以西班牙语-中文新闻翻译为例

Haohong Lai, Weijia Li

机构 * Faculty of Translation and Interpreting(翻译与口译学院) Autonomous University of Barcelona(巴塞罗那自治大学) Barcelona, Spain(西班牙巴塞罗那)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究提示语言和翻译理论驱动的提示设计对GPT-5.2生成的西中新闻翻译质量的影响。通过48种实验条件翻译平行语料库,用自动评估指标和人工评估,发现理论驱动提示能减少特定错误,提示语言影响小。

Comments Published in the Proceedings of the 27th Annual Conference of the European Association for Machine Translation (EAMT 2026), pp. 927-945. ACL Anthology entry forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29315 2026-06-30 cs.AI cs.LG 85%

Hierarchical Experimentalist Agents

分层实验者智能体

Abhranil Chandra, Sankaran Vaidyanathan, Utsav Dhanuka, Varun Gandhi, Scott Niekum

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出HExA框架,通过主动实验迭代设计实验、学习可复用技能,无需训练或外部监督,在Interphyre基准上将Claude Sonnet成功率从2%提升至77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15465 2026-06-19 cs.CL cs.AI 85%

RadEx: A Framework for Structured Information Extraction from Radiology Reports based on Large Language Models

RadEx:基于大型语言模型的结构化信息提取框架

Daniel Reichenpfader, Jonas Knupp, André Sander, Kerstin Denecke

机构 * Institute for Patient-centered Digital Health, Bern University of Applied Sciences, Biel, Switzerland(以患者为中心的数字健康研究所,伯恩应用科学大学,比尔,瑞士) ID Suisse AG, St. Gallen, Switzerland(ID瑞士股份有限公司,圣加尔,瑞士)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 RadEx框架通过15个软件组件和10个工具,实现从放射科报告中自动提取结构化信息,支持生成式和编码器模型,提升临床应用中的信息处理效率与系统互操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03415 2026-06-01 cs.PL cs.AI cs.CL cs.SE 85%

LLMs Lean on Priors, Not Programming Language Semantics

LLMs 依赖先验而非编程语言语义

Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco Research(思科研究)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过 PLSemanticsBench 基准测试,发现前沿大语言模型在程序执行任务中依赖预训练统计规律而非形式语义规则,语义变异和结构复杂度导致准确率大幅下降。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16026 2026-05-18 cs.CL cs.AI 85%

From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation

从平铺语言标签到类型学先验:面向多语言语音到语音翻译的结构化语言条件化

Yu Pan, Yang Hou, Xiongfei Wu, Liang Zhang, Yves Le Traon, Lei Ma, Jianjun Zhao

机构 * School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学院) Recho Inc.(Recho公司) National Institute of Informatics(国家信息研究所) Interdisciplinary Research Centre on Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与信任跨学科研究中心) Donghua University(东华大学) Department of Computer Science, The University of Tokyo(东京大学计算机科学系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电子与计算机工程系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出S2ST-Omni 2框架,通过结构化类型学先验改进多语言语音到语音翻译,实验显示其在多个评估指标上表现优异,且在数据受限条件下仍能提升翻译效率。

Comments Submitted to IEEE/ACM TASLP. This work extends S2ST-Omni, accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏