arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138790 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2103.06198 2021-03-11 cs.CL cs.AI cs.LG 82%

Relational Weight Priors in Neural Networks for Abstract Pattern Learning and Language Modelling

Radha Kopparti, Tillman Weyde

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.11836 2021-01-29 cs.CL cs.AI cs.LG 82%

DRAG: Director-Generator Language Modelling Framework for Non-Parallel Author Stylized Rewriting

Hrituraj Singh, Gaurav Verma, Aparna Garimella, Balaji Vasan Srinivasan

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted as Long Paper to EACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.11855 2020-10-23 cs.CL cs.AI cs.LG 82%

Detecting and Exorcising Statistical Demons from Language Models with Anti-Models of Negative Data

Michael L. Wick, Kate Silverstein, Jean-Baptiste Tristan, Adam Pocock, Mark Johnson

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.10322 2019-08-28 cs.CL cs.AI cs.IR cs.LG 82%

Bridging the Gap for Tokenizer-Free Language Models

Dokook Choe, Rami Al-Rfou, Mandy Guo, Heeyoung Lee, Noah Constant

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07036 2026-02-10 cs.SD cs.AI cs.CL eess.AS 82%

MENASpeechBank: A Reference Voice Bank with Persona-Conditioned Multi-Turn Conversations for AudioLLMs

MENASpeechBank: 一个具有基于人设的多轮对话的参考语音库用于音频大语言模型

Zien Sheikh Ali, Hunzalah Hassan Bhatti, Rabindra Nath Nandi, Shammur Absar Chowdhury, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 预训练与数据 :large language model(abstract,comments);language model(abstract,comments);LLM(abstract);分类 cs.CL、cs.AI

AI总结 MENASpeechBank通过合成数据管道生成多轮对话数据,支持音频大语言模型在多样化语音和方言场景中的训练与应用。

Comments Foundation Models, Large Language Models, Native, Speech Models, Arabic, AI-persona, Persona-conditioned-conversations

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02768 2025-10-06 cs.LG cs.CL 82%

A Granular Study of Safety Pretraining under Model Abliteration

Shashank Agnihotri, Jonas Jakubassa, Priyam Dey, Sachin Goyal, Bernt Schiele, Venkatesh Babu Radhakrishnan, Margret Keuper

机构 * Data and Web Science Group, University of Mannheim(曼海姆大学数据与网络科学组) Vision and AI Lab, Indian Institute of Science(印度科学院视觉与人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG;LLM(comments)

Comments Accepted at NeurIPS 2025 bWorkshop Lock-LLM. *Equal Contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12500 2024-12-18 cs.CL cs.AI 82%

Beyond Data Quantity: Key Factors Driving Performance in Multilingual Language Models

Sina Bagheri Nezhad, Ameeta Agrawal, Rhitabrat Pokharel

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at The First Workshop on Language Models for Low-Resource Languages @ COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02418 2024-07-31 cs.CL cs.AI 82%

Auxiliary task demands mask the capabilities of smaller language models

Jennifer Hu, Michael C. Frank

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Published at the 1st Conference on Language Modeling (COLM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15498 2024-07-16 cs.LG cs.CL 82%

Emergent World Models and Latent Variable Estimation in Chess-Playing Language Models

Adam Karvonen

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to the 2024 Conference on Language Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08305 2022-07-19 cs.CL cs.AI 82%

Effectiveness of French Language Models on Abstractive Dialogue Summarization Task

Yongxin Zhou, François Portet, Fabien Ringeval

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Yongxin Zhou, François Portet, Fabien Ringeval. Effectiveness of French Language Models on Abstractive Dialogue Summarization Task. LREC 2022, Marseille, France, 21-23 June 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18655 2026-08-20 cs.CL 新提交 81%

TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation

TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展

Milan Gritta, Patrik Lambert, Jihye Back, Amril Nazir

机构 * Tether AI Research(泰瑟人工智能研究院)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);SLM(abstract_cn)

AI总结 针对非洲语言机器翻译的数字鸿沟问题,推出面向19种撒哈拉以南非洲语言的开源资源TranslatePsy-AfriSLM,经质量过滤后构建的小参数模型性能远超更大规模的同类系统。

Comments EMNLP 2026 (under ARR, meta review of 4, awaiting accept decision)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26661 2026-08-14 cs.AI 版本更新 81%

AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution

AgenticCANN:基于知识增强的智能体演化的自动昇腾C算子生成

Junhao Qiu, Zidong Wang, Yansong Sun, Zhitong Ma, Ping Guo, Qingfu Zhang

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对昇腾C算子生成的独特挑战,提出AgenticCANN知识增强智能体演化框架,在昇腾910B实验中实现高可行性与加速效果,验证了知识注入的通用性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10109 2026-08-12 cs.CL 新提交 81%

PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing

PERCEPT:用于波斯语-英语代码混合的词性标注与分析语料库

Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学工程学院电气与计算机工程学院) School of Engineering Science, College of Engineering, University of Tehran(德黑兰大学工程学院工程科学学院) Tehran Institute for Advanced Studies, Khatam University(哈塔米大学德黑兰高级研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文推出首个含通用依存关系词性标注的公开波斯语-英语代码混合语料库PERCEPT,结合LLM辅助标注框架完成6800条社交媒体帖子标注,通过分析揭示代码混合词的词性、位置分布规律,为相关NLP研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10046 2026-08-12 cs.LG cs.CY 新提交 81%

Detecting Soft Skills in ML Engineering Roles CVs

检测机器学习工程岗位简历中的软技能

Aidin Azamnouri, Nouran Ayad, Justus Bogner, Stefan Wagner

机构 * Technical University of Munich(慕尼黑工业大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本研究构建含300份简历的平衡语料库,用LLM流水线提取软技能并检验13项假设,发现候选人多以叙事披露软技能,资历影响领导力表述率,关键词筛选会遗漏软技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09936 2026-08-12 cs.CL 新提交 81%

Conflict or Strategy? Asymmetric Role Framing of La France insoumise and Rassemblement National in French News Headlines, 2022-2025

冲突还是策略?2022-2025年法国新闻头条中对不屈法国(La France insoumise,LFI)和国民联盟(Rassemblement National,RN)的不对称角色框架

Amr Sobhy

机构 * Le French News Lab(法国新闻实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究分析2022-2025年法国25家媒体28592条头条,发现新闻对LFI和RN的角色框架不对称,建立分层可靠性框架校准LLM政治文本标注流水线。

Comments 19 pages, 3 figures, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09006 2026-08-11 cs.CV cs.AI 新提交 81%

SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs

SignLlama:通过优先考虑视觉特征增强无词素手语翻译的大语言模型

Shiwei Gan, Xiao Liu, Yafeng Yin, Zhiwei Jiang, Bowen Guo, Lie Xie, Sanglu Lu, Hongkai Wen

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) University of Warwick(华威大学)

专题命中 预训练与数据 :pretraining(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对无词素手语翻译(GFSLT)中LLMs的视觉特征利用问题,提出SignLlama模型,通过过滤伪词素CTC预训练与视觉优先蒸馏策略,在多数据集上取得极具竞争力的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08471 2026-08-11 cs.AI 新提交 81%

Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

昨日之盾,今日之矛:生产环境中的自演进安全护栏

Cong Ming, Jingyi Chen, Bin Liu, Qi Chu, Tao Gong, Nenghai Yu, Yingfei Xiang

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) Sangfor Technologies(深信服科技)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对静态LLM安全护栏无法应对新威胁的问题,提出自演进安全护栏SESG多智能体系统,可快速适配新威胁,性能优于静态护栏及自适应基线,已应用于深信服护栏并取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21597 2026-08-11 cs.SE cs.CL cs.IR 版本更新 81%

ATLAS: Agentic Taxonomy of Large-Scale Software Ecosystems

ATLAS: 大规模软件生态系统的智能体分类体系

Junyi Lu, Mengyao Lyu, Jiahui Wu, Lei Yu, Chengwei Liu, Fengjun Zhang, Li Yang, Chun Zuo, Yang Liu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Nankai University(南开大学) Sinosoft Company Limited(中软国际有限公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出ATLAS框架,结合LLM全局知识与实际仓库分布,通过智能体协作和自修正循环自动构建软件仓库的层次化分类体系,在54,387个GitHub仓库上评估,分类质量F1达83.13%,优于基线15个百分点。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04884 2026-08-07 cs.CL 版本更新 81%

Building Open-Retrieval Conversational Question Answering Systems by Generating Synthetic Data and Decontextualizing User Questions

通过生成合成数据和去语境化用户问题构建开放检索式对话问答系统

Christos Vlachos, Nikolaos Stylianou, Alexandra Fiotaki, Spiros Methenitis, Elisavet Palogiannidi, Themos Stafylakis, Ion Androutsopoulos

机构 * Department of Informatics, Athens University of Economics and Business(雅典经济与商业大学信息学院) Omilia - Conversational Intelligence(Omilia-对话智能) Archimedes, Athena Research Center(雅典研究中心Archimedes) NCSR Demokritos(德摩斯蒂斯国家研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对开放检索式对话问答数据集获取困难的问题,提出基于组织纯文本文档生成合成带标注对话的流程,训练问题重写器去语境化用户问题,结合LLM构建OR-CONVQA系统。

Comments Accepted at SIGDIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06835 2026-08-06 cs.CL 版本更新 81%

Translate-R1: Cost-Aware Translation Tool Use via Reinforcement Learning

Translate-R1:通过强化学习实现成本感知的翻译工具使用

Pratik Jayarao, Chaitanya Dwivedi, Himanshu Gupta, Neeraj Varshney, Adithya M Devraj, Meet Vadera, Priyanka Nigam, Bing Yin

机构 * Amazon Stores Foundation AI(亚马逊商店基金会人工智能)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 提出一种基于强化学习的门控策略,让LLM自主评估理解能力,仅在必要时调用翻译工具,在22种语言上提升奖励并降低翻译成本。

Comments 14 pages main text plus appendix, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02359 2026-08-04 cs.CL 新提交 81%

Fast and Accurate Quotation Attribution in Literary Texts

文学文本中快速准确的引语归属

Gaspard Michel, Hugo Attali, Elena V. Epure

机构 * Deezer Research(Deezer研究院) LORIA(洛里亚实验室) Université Sorbonne Paris Nord(巴黎北索邦大学) CNRS(法国国家科学研究中心) LIPN(巴黎第十三大学计算机科学实验室) IDIAP(IDIAP研究所)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对文学文本引语归属的效率与精度难题,提出基于编码器的联合评分方案,在Project Dialogism小说语料库上实现94.5%准确率,速度远超同类方法,且发布了修改后的ModernBookNLP工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01158 2026-08-04 cs.CL 新提交 81%

PlainMedScale: A Corpus of Multi-Level Simplified Medical Texts in German and English

PlainMedScale:德语和英语的多级别简化医学文本语料库

Bruno Brocai, Ilaria Papagno, Mayumi Ohta

机构 * Heidelberg University(海德堡大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究构建了德语和英语的多级别简化医学语料库PlainMedScale,开展试点研究发现现有可读性指标无法跨层级泛化、SOTA开放权重LLM的Plain Language提示仍保留部分输入难度,并公开了代码与数据。

Comments accepted at KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26070 2026-07-30 cs.IR cs.AI 新提交 81%

SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search

SimpleWikiSearch:用于智能体搜索的简洁离线维基百科环境

Guanming Xiong, Penghui Zhang

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SimpleWikiSearch是一套明确可运行的离线维基百科环境,用于智能体搜索的可复现评估,提供基线结果及对比闭源模型的子集,而非提出新智能体算法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24941 2026-07-28 cs.SD cs.AI 版本更新 81%

EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis

EmotionAI:一种面向语音情感驱动的对话分析的隐私保护计算智能流水线

Wai Laam Mak, Isibor Kennedy Ihianle, Pedro Machado

机构 * School of Science and Technology, Nottingham Trent University(诺丁汉特伦特大学科学与技术学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种完全本地的计算智能流水线,结合语音情感识别与生成式推理,实现隐私保护的对话情感分析,在RAVDESS数据集上达到48.8%准确率,零外部调用。

Comments 12 pages, 4 figures. Submitted to UK Workshop on Computational Intelligence (UKCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00462 2026-07-23 cs.CV cs.AI 版本更新 81%

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19104 2026-07-22 cs.SE cs.AI 新提交 81%

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

SciCodePile:用于具有挑战性的科学代码生成的128GB语料库和可执行基准测试

Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

机构 * Singapore Management University(新加坡管理大学) Nanjing University(南京大学) SUN YAT-SEN University(孙中山大学) Home Team Science & Technology Agency(家庭团队科技局)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 研究大型语言模型处理科学代码的能力,提出SciCodePile语料库及可执行基准测试,评估15个模型在三项任务上的表现,发现科学代码生成极具挑战,同时展示了该语料库在训练上的效用,代码和数据可获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18424 2026-07-22 cs.CY cs.CL 新提交 81%

Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps

实现多语言隐私政策审计:对西班牙移动应用的大规模分析

Marcos Moran, David Rodriguez, Luka Nenadic, Norman Sadeh, Jose M. Del Alamo

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多语言环境下隐私政策审计,利用大语言模型构建跨语言分类器,通过对西班牙谷歌应用商店应用的大规模审计,发现公共部门与商业应用语言使用差异及声明与实际做法的差异,揭示仅英语审计掩盖透明度差距的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19198 2026-07-22 cond-mat.mtrl-sci cs.LG physics.comp-ph 新提交 81%

ATLAS: A Foundation Neural Sampler for Amorphous Materials

ATLAS:一种用于非晶材料的基础神经采样器

Mouyang Cheng, Denis Blessing, Botao Yu, Gerhard Neumann, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

机构 * Microsoft Research New England(微软研究院新英格兰分部) Center for Computational Science and Engineering(计算科学与工程中心) MIT(麻省理工学院) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Department of Materials Science and Engineering(材料科学与工程系) Department of Computer Science and Engineering(计算机科学与工程系) OSU(俄亥俄州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 研究针对非晶材料能量景观难采样问题,提出ATLAS神经采样器,由等变图神经网络参数化,能跨系统泛化,利用扩散过程时间反转估计热力学量。在多种系统中验证有效性,还通过预训练降低逆设计成本,结合大语言模型搜索高熵金属玻璃,确立其为基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11783 2026-07-14 cs.CL 新提交 81%

How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

温度如何塑造检索增强生成中的意识形态话语?

Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) São Paulo Catholic University(圣保罗天主教大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨温度对检索增强生成中意识形态话语的影响,通过对新冠治疗文章语料库应用词汇多维分析,让模型在不同温度下回答意识形态问题并评估,发现RAG框架易转移意识形态话语,中等温度下话语对齐最高,低温时下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05235 2026-07-14 cs.CL 版本更新 81%

FedMosaic: Federated Retrieval-Augmented Generation via Parametric Adapters

FedMosaic:通过参数适配器进行联邦检索增强生成

Zhilin Liang, Yuxiang Wang, Zimu Zhou, Hainan Zhang, Boyi Liu, Yongxin Tong

机构 * SKLCCSE Lab Beihang University Beijing China(SKLCCSE实验室 北航) Department of Data Science City University of Hong Kong Hong Kong China(数据科学系 香港城市大学) Beijing Advanced Innovation Center Beihang University Beijing China(北京先进创新中心 北航) Beihang University(北航) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对隐私敏感领域,解决联邦检索增强生成中高存储通信及适配器聚合问题。核心方法是提出FedMosaic框架,聚类文档成多文档适配器并选择性聚合。主要贡献是准确率提高,存储和通信成本降低,且不共享原始文档。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏