UT5: Pretraining Non autoregressive T5 with unrolled denoising
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
Comments Findings of EMNLP 2023
专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL
Comments To appear at Findings of EMNLP 2023
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
Comments ACL 2023 Camera-ready
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.AI
Comments Preprint submitted to Information Fusion
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL
Comments 32 pages
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.AI
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.AI
专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL
Comments EMNLP 2022
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.AI
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
Comments ASE 2022 (camera ready)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL
Comments Accepted to Interspeech 2022
多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。
大语言模型训练数据的可证明识别
机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) ; Shanghai Innovation Institute(上海创新研究院) ; School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.AI、cs.LG
AI总结 本文提出PTDI方法,通过集级推断实现大语言模型训练数据识别的可证明误差控制。
注意力对字母大小写敏感
专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。
Comments Accepted at ECCV 2026
用于确定性、自扩展反应分类的可验证规则的智能体生成
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) ; Laboratory for Chemical Technology, Ghent University(根特大学化学技术实验室) ; NCCR Catalysis(瑞士国家研究能力中心催化项目)
专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出多智能体LLM框架,通过验证循环自动生成反应规则,将标准分类从68类扩展到14,073类,并实现97.7%的未知反应分类准确率。
DiaLLM:英语方言适应中稳健性-生成差距的研究
机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) ; University of New South Wales(新南威尔士大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)
AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。
提示语言和翻译理论驱动的提示在大语言模型中的作用:以西班牙语-中文新闻翻译为例
机构 * Faculty of Translation and Interpreting(翻译与口译学院) ; Autonomous University of Barcelona(巴塞罗那自治大学) ; Barcelona, Spain(西班牙巴塞罗那)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 研究提示语言和翻译理论驱动的提示设计对GPT-5.2生成的西中新闻翻译质量的影响。通过48种实验条件翻译平行语料库,用自动评估指标和人工评估,发现理论驱动提示能减少特定错误,提示语言影响小。
Comments Published in the Proceedings of the 27th Annual Conference of the European Association for Machine Translation (EAMT 2026), pp. 927-945. ACL Anthology entry forthcoming
分层实验者智能体
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出HExA框架,通过主动实验迭代设计实验、学习可复用技能,无需训练或外部监督,在Interphyre基准上将Claude Sonnet成功率从2%提升至77%。
RadEx:基于大型语言模型的结构化信息提取框架
机构 * Institute for Patient-centered Digital Health, Bern University of Applied Sciences, Biel, Switzerland(以患者为中心的数字健康研究所,伯恩应用科学大学,比尔,瑞士) ; ID Suisse AG, St. Gallen, Switzerland(ID瑞士股份有限公司,圣加尔,瑞士)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 RadEx框架通过15个软件组件和10个工具,实现从放射科报告中自动提取结构化信息,支持生成式和编码器模型,提升临床应用中的信息处理效率与系统互操作性。
LLMs 依赖先验而非编程语言语义
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cisco Research(思科研究)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 通过 PLSemanticsBench 基准测试,发现前沿大语言模型在程序执行任务中依赖预训练统计规律而非形式语义规则,语义变异和结构复杂度导致准确率大幅下降。
Comments Accepted at ICML 2026
从平铺语言标签到类型学先验:面向多语言语音到语音翻译的结构化语言条件化
机构 * School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学院) ; Recho Inc.(Recho公司) ; National Institute of Informatics(国家信息研究所) ; Interdisciplinary Research Centre on Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与信任跨学科研究中心) ; Donghua University(东华大学) ; Department of Computer Science, The University of Tokyo(东京大学计算机科学系) ; Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电子与计算机工程系)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出S2ST-Omni 2框架,通过结构化类型学先验改进多语言语音到语音翻译,实验显示其在多个评估指标上表现优异,且在数据受限条件下仍能提升翻译效率。
Comments Submitted to IEEE/ACM TASLP. This work extends S2ST-Omni, accepted to Findings of ACL 2026