GPT-NER: Named Entity Recognition via Large Language Models
专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract);prompting(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract);prompting(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments FSE 2023 (camera ready)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted to ACL 2023 Main Conference (Short)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted at SSW 2023
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments 9 pages, 4 figures
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted by InterSpeech 2023. arXiv admin note: substantial text overlap with arXiv:2210.16029
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments 6 pages, 0 figures
专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.CL
Comments ACL 2023
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL
Comments Findings of ACL 2023
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL
Comments Technical report. arXiv admin note: text overlap with arXiv:2212.01853
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
Comments Accepted to Findings of EACL 2023
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);foundation model(abstract);分类 cs.CL
Comments Technical report
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted at the Findings of EMNLP 2022
专题命中 预训练与数据 :language model(title,abstract);prompting(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);prompting(abstract);分类 cs.CL
Comments Accepted by BioNLP 2022, Long Paper
展示GenDB:通过大语言模型代理实现实例优化和定制化查询处理代码生成
机构 * Cornell University(康奈尔大学)
专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对传统查询处理引擎扩展难题,提出GenDB生成式查询引擎,借助大语言模型代理生成代码。核心方法是通过LLM agents为特定场景生成优化代码,主要贡献是展示其工作流程、性能优势并提供用户探索平台。
Comments Accepted by VLDB 2026 (Demo)
SEFORA:学生论文反馈语料库及LLM反馈评估框架
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 为解决大规模写作反馈中缺乏真实课堂反馈语料和评估方法的问题,构建了SEFORA语料库和UniMatch评估框架,实验表明LLM生成的反馈与教师反馈一致性低(F1≤0.4)。
Comments Under review for EMNLP 2026
信号在哪里?医学编码器预训练的网页数据配方
机构 * Doctolib
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对医学领域编码器预训练数据稀缺问题,提出医学术语密度过滤和信号放大改写两种互补方法,在法语医学NLP上构建FineMed语料库和DoctoBERT编码器,性能优于现有方法。
Comments Code, models, and data: https://github.com/doctolib-lab/doctobert
学习预测什么:下游引导的持续预训练任务设计
机构 * Department of ECE(电子工程系) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 预训练与数据 :pretraining(title,summary_cn);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出V-pretraining方法,通过轻量级任务设计器为无标签批次构建目标或视图,利用下游损失的一阶减少作为反馈,指导自监督更新,提升目标能力而不损害泛化。
对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例
机构 * National Taiwan University(国立台湾大学) ; Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) ; Radboud University(拉德堡德大学) ; Institut Jean Nicod(让·尼科研究所)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。
Soro: 一种轻量级塔吉克语基础模型与聊天机器人
专题命中 预训练与数据 :foundation model(title);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对塔吉克斯坦计算和连接受限环境,提出基于Gemma 3的塔吉克语专用对话大语言模型Soro,通过持续预训练和监督微调,在塔吉克语基准测试上显著优于同尺寸基线,并支持量化部署。
知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成
机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) ; IBM Research(IBM研究院)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。
Comments 17 pages, 4 figures, 7 tables
算法漫画:在危机事件中审计LLM生成的政治言论
机构 * New York University (NYUAD), Division of Science, Computer Science Department(纽约大学(NYUAD),科学学院,计算机科学系)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文通过对比真实与生成的政治言论,发现生成内容在情感强度、结构规律性和词汇框架上不如真实言论真实,提出了'漫画差距'作为评估生成内容社会真实性的指标。
表格泄露:攻击基于大语言模型的表格数据生成中的字符串记忆化
机构 * University of California Los Angeles(加州大学洛杉矶分校)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文研究了基于大语言模型的表格数据生成中字符串记忆化带来的隐私风险,提出LevAtt攻击方法并设计防御策略,验证了其有效性。
重新思考大语言模型训练中的数据整理:在线重加权优于离线方法
机构 * University of Cambridge(剑桥大学) ; OATML, University of Oxford(牛津大学OATML实验室) ; University of Toronto(多伦多大学) ; Shanghai Jiao Tong University(上海交通大学) ; Samsung AI Center(三星人工智能中心)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 本文提出ADAPT框架,通过动态在线重加权提升模型泛化能力,实验显示其在指令微调和大规模预训练中优于传统离线方法。
Comments ICLR 2026
超节点和光环:LLM前馈层中的损失关键枢纽
机构 * Kempner Institute at Harvard University(哈佛大学凯普纳研究所)
专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 研究Transformer前馈网络中通道级重要性的组织方式,发现损失敏感性集中于少量通道,通过损失代理展示超节点和光环结构,验证保护核心对结构化剪枝的重要性。
CAST:实现稳定的大语言模型文本分析用于数据分析
机构 * Nanjing University(南京大学) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; Microsoft Research(微软研究院)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 CAST通过算法提示和先思考后发言提升大语言模型在表格数据分析中的输出稳定性,实验表明其在多个基准上表现最佳,稳定性提升达16.2%。
Comments ACL 2026 Findings
梯度偏移:理解防御性训练方法如何保护语言模型完整性
机构 * Stanford University(斯坦福大学) ; MATS
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)
AI总结 本文通过对比PPS和IP两种防御性训练方法,揭示其在保护语言模型完整性上的不同机制,发现PPS通过调整激活梯度抑制特质表达,而IP则通过解释数据中的特质表达来减少预测损失。
专题命中 预训练与数据 :LLM(title);large language model(title);language model(title);分类 cs.AI、cs.LG