Relational Weight Priors in Neural Networks for Abstract Pattern Learning and Language Modelling
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 29 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 29 pages
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted as Long Paper to EACL 2021
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
MENASpeechBank: 一个具有基于人设的多轮对话的参考语音库用于音频大语言模型
机构 * Qatar Computing Research Institute(卡塔尔计算研究所)
专题命中 预训练与数据 :large language model(abstract,comments);language model(abstract,comments);LLM(abstract);分类 cs.CL、cs.AI
AI总结 MENASpeechBank通过合成数据管道生成多轮对话数据,支持音频大语言模型在多样化语音和方言场景中的训练与应用。
Comments Foundation Models, Large Language Models, Native, Speech Models, Arabic, AI-persona, Persona-conditioned-conversations
机构 * Data and Web Science Group, University of Mannheim(曼海姆大学数据与网络科学组) ; Vision and AI Lab, Indian Institute of Science(印度科学院视觉与人工智能实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG;LLM(comments)
Comments Accepted at NeurIPS 2025 bWorkshop Lock-LLM. *Equal Contribution
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
Comments Accepted at The First Workshop on Language Models for Low-Resource Languages @ COLING 2025
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
Comments Published at the 1st Conference on Language Modeling (COLM 2024)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG
Comments Accepted to the 2024 Conference on Language Modeling
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
Comments Yongxin Zhou, François Portet, Fabien Ringeval. Effectiveness of French Language Models on Abstractive Dialogue Summarization Task. LREC 2022, Marseille, France, 21-23 June 2022
TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展
机构 * Tether AI Research(泰瑟人工智能研究院)
专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);SLM(abstract_cn)
AI总结 针对非洲语言机器翻译的数字鸿沟问题,推出面向19种撒哈拉以南非洲语言的开源资源TranslatePsy-AfriSLM,经质量过滤后构建的小参数模型性能远超更大规模的同类系统。
Comments EMNLP 2026 (under ARR, meta review of 4, awaiting accept decision)
AgenticCANN:基于知识增强的智能体演化的自动昇腾C算子生成
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究针对昇腾C算子生成的独特挑战,提出AgenticCANN知识增强智能体演化框架,在昇腾910B实验中实现高可行性与加速效果,验证了知识注入的通用性优势。
PERCEPT:用于波斯语-英语代码混合的词性标注与分析语料库
机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学工程学院电气与计算机工程学院) ; School of Engineering Science, College of Engineering, University of Tehran(德黑兰大学工程学院工程科学学院) ; Tehran Institute for Advanced Studies, Khatam University(哈塔米大学德黑兰高级研究所)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 本文推出首个含通用依存关系词性标注的公开波斯语-英语代码混合语料库PERCEPT,结合LLM辅助标注框架完成6800条社交媒体帖子标注,通过分析揭示代码混合词的词性、位置分布规律,为相关NLP研究提供支撑。
检测机器学习工程岗位简历中的软技能
机构 * Technical University of Munich(慕尼黑工业大学) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 本研究构建含300份简历的平衡语料库,用LLM流水线提取软技能并检验13项假设,发现候选人多以叙事披露软技能,资历影响领导力表述率,关键词筛选会遗漏软技能。
冲突还是策略?2022-2025年法国新闻头条中对不屈法国(La France insoumise,LFI)和国民联盟(Rassemblement National,RN)的不对称角色框架
机构 * Le French News Lab(法国新闻实验室)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 该研究分析2022-2025年法国25家媒体28592条头条,发现新闻对LFI和RN的角色框架不对称,建立分层可靠性框架校准LLM政治文本标注流水线。
Comments 19 pages, 3 figures, includes appendices
SignLlama:通过优先考虑视觉特征增强无词素手语翻译的大语言模型
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; University of Warwick(华威大学)
专题命中 预训练与数据 :pretraining(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对无词素手语翻译(GFSLT)中LLMs的视觉特征利用问题,提出SignLlama模型,通过过滤伪词素CTC预训练与视觉优先蒸馏策略,在多数据集上取得极具竞争力的性能。
昨日之盾,今日之矛:生产环境中的自演进安全护栏
机构 * University of Science and Technology of China(中国科学技术大学) ; Shenzhen University(深圳大学) ; Sangfor Technologies(深信服科技)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 针对静态LLM安全护栏无法应对新威胁的问题,提出自演进安全护栏SESG多智能体系统,可快速适配新威胁,性能优于静态护栏及自适应基线,已应用于深信服护栏并取得良好效果。
ATLAS: 大规模软件生态系统的智能体分类体系
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学) ; Nankai University(南开大学) ; Sinosoft Company Limited(中软国际有限公司)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 提出ATLAS框架,结合LLM全局知识与实际仓库分布,通过智能体协作和自修正循环自动构建软件仓库的层次化分类体系,在54,387个GitHub仓库上评估,分类质量F1达83.13%,优于基线15个百分点。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
通过生成合成数据和去语境化用户问题构建开放检索式对话问答系统
机构 * Department of Informatics, Athens University of Economics and Business(雅典经济与商业大学信息学院) ; Omilia - Conversational Intelligence(Omilia-对话智能) ; Archimedes, Athena Research Center(雅典研究中心Archimedes) ; NCSR Demokritos(德摩斯蒂斯国家研究中心)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 针对开放检索式对话问答数据集获取困难的问题,提出基于组织纯文本文档生成合成带标注对话的流程,训练问题重写器去语境化用户问题,结合LLM构建OR-CONVQA系统。
Comments Accepted at SIGDIAL 2025
Translate-R1:通过强化学习实现成本感知的翻译工具使用
机构 * Amazon Stores Foundation AI(亚马逊商店基金会人工智能)
专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);pretraining(abstract);分类 cs.CL
AI总结 提出一种基于强化学习的门控策略,让LLM自主评估理解能力,仅在必要时调用翻译工具,在22种语言上提升奖励并降低翻译成本。
Comments 14 pages main text plus appendix, 7 figures, 11 tables
文学文本中快速准确的引语归属
机构 * Deezer Research(Deezer研究院) ; LORIA(洛里亚实验室) ; Université Sorbonne Paris Nord(巴黎北索邦大学) ; CNRS(法国国家科学研究中心) ; LIPN(巴黎第十三大学计算机科学实验室) ; IDIAP(IDIAP研究所)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究针对文学文本引语归属的效率与精度难题,提出基于编码器的联合评分方案,在Project Dialogism小说语料库上实现94.5%准确率,速度远超同类方法,且发布了修改后的ModernBookNLP工具。
PlainMedScale:德语和英语的多级别简化医学文本语料库
机构 * Heidelberg University(海德堡大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 本研究构建了德语和英语的多级别简化医学语料库PlainMedScale,开展试点研究发现现有可读性指标无法跨层级泛化、SOTA开放权重LLM的Plain Language提示仍保留部分输入难度,并公开了代码与数据。
Comments accepted at KONVENS 2026
SimpleWikiSearch:用于智能体搜索的简洁离线维基百科环境
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SimpleWikiSearch是一套明确可运行的离线维基百科环境,用于智能体搜索的可复现评估,提供基线结果及对比闭源模型的子集,而非提出新智能体算法。
Comments Technical Report
EmotionAI:一种面向语音情感驱动的对话分析的隐私保护计算智能流水线
机构 * School of Science and Technology, Nottingham Trent University(诺丁汉特伦特大学科学与技术学院)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种完全本地的计算智能流水线,结合语音情感识别与生成式推理,实现隐私保护的对话情感分析,在RAVDESS数据集上达到48.8%准确率,零外部调用。
Comments 12 pages, 4 figures. Submitted to UK Workshop on Computational Intelligence (UKCI 2026)
LatentLens: 揭示大语言模型中高度可解释的视觉标记
机构 * University of Cambridge(剑桥大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。
Comments ICML 2026 (Camera Ready)
SciCodePile:用于具有挑战性的科学代码生成的128GB语料库和可执行基准测试
机构 * Singapore Management University(新加坡管理大学) ; Nanjing University(南京大学) ; SUN YAT-SEN University(孙中山大学) ; Home Team Science & Technology Agency(家庭团队科技局)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)
AI总结 研究大型语言模型处理科学代码的能力,提出SciCodePile语料库及可执行基准测试,评估15个模型在三项任务上的表现,发现科学代码生成极具挑战,同时展示了该语料库在训练上的效用,代码和数据可获取。
实现多语言隐私政策审计:对西班牙移动应用的大规模分析
机构 * ETH Zurich(苏黎世联邦理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究多语言环境下隐私政策审计,利用大语言模型构建跨语言分类器,通过对西班牙谷歌应用商店应用的大规模审计,发现公共部门与商业应用语言使用差异及声明与实际做法的差异,揭示仅英语审计掩盖透明度差距的问题。
ATLAS:一种用于非晶材料的基础神经采样器
机构 * Microsoft Research New England(微软研究院新英格兰分部) ; Center for Computational Science and Engineering(计算科学与工程中心) ; MIT(麻省理工学院) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Department of Materials Science and Engineering(材料科学与工程系) ; Department of Computer Science and Engineering(计算机科学与工程系) ; OSU(俄亥俄州立大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)
AI总结 研究针对非晶材料能量景观难采样问题,提出ATLAS神经采样器,由等变图神经网络参数化,能跨系统泛化,利用扩散过程时间反转估计热力学量。在多种系统中验证有效性,还通过预训练降低逆设计成本,结合大语言模型搜索高熵金属玻璃,确立其为基础模型。
温度如何塑造检索增强生成中的意识形态话语?
机构 * Wichita State University(威斯康星州立大学) ; São Paulo Catholic University(圣保罗天主教大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究探讨温度对检索增强生成中意识形态话语的影响,通过对新冠治疗文章语料库应用词汇多维分析,让模型在不同温度下回答意识形态问题并评估,发现RAG框架易转移意识形态话语,中等温度下话语对齐最高,低温时下降。
FedMosaic:通过参数适配器进行联邦检索增强生成
机构 * SKLCCSE Lab Beihang University Beijing China(SKLCCSE实验室 北航) ; Department of Data Science City University of Hong Kong Hong Kong China(数据科学系 香港城市大学) ; Beijing Advanced Innovation Center Beihang University Beijing China(北京先进创新中心 北航) ; Beihang University(北航) ; City University of Hong Kong(香港城市大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对隐私敏感领域,解决联邦检索增强生成中高存储通信及适配器聚合问题。核心方法是提出FedMosaic框架,聚类文档成多文档适配器并选择性聚合。主要贡献是准确率提高,存储和通信成本降低,且不共享原始文档。
Comments 11 pages