AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 31 pages
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 13 pages, 4 figures
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to NeurIPS 2023 (Datasets and Benchmarks Track)
Journal ref NeurIPS 2023
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 17 pages, 8 figures
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)
程序化预训练:用抽象数据预热语言模型
机构 * EPFL(苏黎世联邦理工学院) ; Idiap Research Institute(伊迪普研究机构) ; AIML, Adelaide University(人工智能实验室,阿德莱德大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG
AI总结 提出程序化预训练方法,通过在抽象结构化数据(如形式语言生成的程序数据)上预训练语言模型,显著提升其推理能力并加速后续语义知识学习,实验表明仅需0.1-0.3%的程序数据即可超越标准预训练。
Comments ICML 2026. Project page: https://zlshinnick.github.io/procedural-pretraining-page/
机构 * Badrinath Ramakrishnan Akshaya Balaji(独立研究者)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
Comments 14 pages, 2 figures. Code and experimental framework available at https://github.com/akshayaaa10/llm-privacy-research
专题命中 预训练与数据 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments Peer reviewed and to appear in the ESWC 2025 Workshops and Tutorials Joint Proceedings (Workshop on Evaluation of Language Models in Knowledge Engineering [ELMKE])
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
Comments Under review at Workshop on LLM-Aided Design (LAD'24)
TEAMMix:用于大语言模型增强弱监督分层文本分类的类别体系丰富增强与少数类增强混合策略
机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) ; Shaoxing K3i Technology Co. Ltd(绍兴K3i科技有限公司) ; State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)
专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对LLM应用于分层文本分类的局限,本文提出TEAMMix框架,通过丰富标签层次、生成伪样本并优化其质量,提升了细粒度及不平衡数据集上的分类性能。
Comments Accepted by IEEE CSCWD 2026
面向大语言模型预训练的可扩展、感知频率与长度的子文档去重
专题命中 预训练与数据 :pretraining(title,abstract);large language model(title);language model(title);分类 cs.CL
AI总结 针对大语言模型预训练的子文档去重难题,提出解耦重复检测与副本保留的可扩展框架,在基准数据集上实现最优模型性能,凸显显式副本保留控制的价值。
基于预测导航的深度研究预训练
机构 * Tencent(腾讯) ; Hunyuan Team(混元团队)
专题命中 预训练与数据 :pretraining(title,summary_cn);SFT(abstract,abstract_cn);分类 cs.CL
AI总结 提出Deep Research Pretraining(DRP)离线框架,在学术引用图和维基百科超链接上预训练Qwen3-14B-Base模型,可提升智能体在多个基准任务上的表现,是轨迹智能体训练的补充方法。
Comments working in progress; correspondence to {ucaswu,maxwellyu}@tencent.com or wuxing@iie.ac.cn
PMC-InterCPT:重新思考用于多模态持续预训练的医学交错数据
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Sun Yat-sen University(中山大学) ; InfiX.ai ; PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL
AI总结 针对医学多模态持续预训练中图像-文本对数据存在的上下文缺失、结构噪声等问题,提出PMC-InterCPT交错语料库,通过恢复缺失标题、清洗文本、重建交错样本及LLM监督过滤,结合模态感知重采样,有效提升医学与通用多模态性能。
EvoCause:基于大语言模型引导的因果图进化的根本原因分析
专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 EvoCause 用 LLM 优化因果图以提升电信等系统的根本原因分析性能,发布了 TeleRCA 基准,在合成数据和真实网络数据上均优于基线方法。
选择还是投影?评估用于LLM训练数据解释的低维向量
机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) ; UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) ; Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学文学与文化研究系)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文通过对比选择和投影方法,发现有针对性的组件选择在LLM训练数据解释中更有效且计算更高效。
Comments KONVENS 2026. 9 pages
LLM生成的GPU内核中的正确性错觉
机构 * Arizona State University, USA(亚利桑那州立大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG
AI总结 通过高精度CPU参考和操作模式感知的模糊测试,发现现有基准测试中基于固定形状的allclose检查无法检测LLM风格的转录错误,提出一种新协议并验证其有效性。
Comments 10 pages, 2 figures, LNCS format. Companion papers to follow on arXiv next week; IDs will be added in a v2 replace
基于语料库的前沿计算物理容错LLM流水线:从语料到论文的自主研究
机构 * Princeton University(普林斯顿大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI
AI总结 提出一个端到端LLM流水线,从11,083篇arXiv论文语料库出发,自主完成前沿计算物理研究,包括构思方向、复现文献、第一性原理计算和撰写论文,通过冗余设计实现容错。
Comments 39 pages, 5 figures. Accepted at the ICML 2026 AI for Science Workshop (https://openreview.net/forum?id=R5YXaPgUAx). Includes the pipeline-generated companion physics manuscript as an appendix. Data and scaffolding archive: https://doi.org/10.5281/zenodo.21126996
面向LLM集成应用的MCP服务器架构模式
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过分析15个MCP服务器,归纳出五种架构模式和四种反模式,并评估了分类可靠性、传输开销和工具选择准确性。
Comments 9 pages, IEEEtran conference format, 2 figures. Extended version; a condensed version is under review at IEEE Software. Replication package: https://github.com/rodriguescarson/mcp-patterns-icsme2026
LLM生成的临床语料库中实际有多少是新内容?用于溯源分类的内容冗余的生产规模测量
机构 * University of Thi-Qar(提-卡大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过多智能体临床提取管道的完整输出,引入基于溯源冗余分解方法,发现仅10.9%的token是训练唯一内容,79.4%是冗余的,原始token计数高估信息量约9倍。
Libretto:赋予LLM智能体音乐结构感
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI
AI总结 提出Libretto框架,通过LLM原生语法(显式起始槽、声部、小节组织)和基于语料库的统计评估(节奏、和声、旋律等),实现符号音乐的生成、诊断与迭代自修正,将符号音乐转化为可测量、可编辑的对象。
人机交互中的共构盲点与非对称认知脆弱性
机构 * Independent Researcher(独立研究者) ; Universidade Federal de Pernambuco(巴伊亚联邦大学)
专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出共构盲点与非对称认知脆弱性两个概念,揭示用户与LLM交互中因忽视输出共构性而产生的结构性风险,并以道金斯案例说明权威地位差异导致的不对称后果。
Comments 12 pages, out of which 2 are transcripts; Target venue: CHI 2027
从流行病预测理解时间序列基础模型的关键特征
机构 * Department of Computer Science, School of Engineering and Applied Science, University of Virginia(弗吉尼亚大学工程与应用科学学院计算机科学系) ; School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) ; Biocomplexity Institute, University of Virginia(弗吉尼亚大学生物复杂性研究所) ; Department of Electrical and Computer Engineering, School of Engineering and Applied Science, University of Virginia(弗吉尼亚大学工程与应用科学学院电气与计算机工程系)
专题命中 预训练与数据 :LLM(summary_cn,abstract);foundation model(title,abstract);pretraining(abstract);分类 cs.LG
AI总结 系统评估多种时间序列模型在流感预测中的表现,发现混合专家模型性能最优,预训练在长时域提升显著,而LLM方法效果较差。
Comments 15 pages, 2 figures, 9 tables
SING: 用于LLM代理中可扩展主动工具发现的合成意图图
机构 * Cornell University(康奈尔大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Ohio State University(俄亥俄州立大学) ; Hong Kong Baptist University(香港浸会大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出SING框架,通过构建意图-工具图并动态检索工具,在长周期任务中提升工具发现准确率,Global Recall@5提高59.8%,下游成功率提高28.9%。
LLM作为判别器:当合成表格看起来仍然真实
机构 * Vrije Universiteit, Amsterdam(阿姆斯特丹自由大学) ; Equativ, Paris(Equativ,巴黎) ; EDICIA, Nantes(EDICIA,南特)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG
AI总结 提出用LLM区分真实与合成表格数据,测试不同设置和模型,发现LLM判别可作为实用的隐私审计信号。
路由平台:理解并突破LLM路由器的准确性极限
机构 * Rice University(莱斯大学) ; Amazon(亚马逊)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG
AI总结 研究发现多种LLM路由方法存在“路由平台”现象,即准确性趋同且远低于理想路由器,主要原因是可预测性瓶颈;通过增大训练数据、更强编码器和端到端微调可突破平台。
Comments 23 Pages, 12 Tables, 9 Figures