On Using Selectional Restriction in Language Models for Speech Recognition
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
Comments feedback is welcome to ueberla@cs.sfu.ca
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
Comments feedback is welcome to ueberla@cs.sfu.ca
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
Comments 4 pages, LaTeX, 2 eps figures, uses icassp.sty, a4.sty and psfig.tex; to appear in Proc. of ICASSP 1997, Munich, Germany
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
Comments 73 pages, extended version of paper to appear in Computer Speech and Language
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
Comments 28 pages, 6 tables, 8 figures. To appear in Computational Linguistics 27(2), June 2001
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
Comments 8 pages, 29 figures, presented at ACL99, College Park, Maryland
Journal ref Proceedings of the 37th Annual Meeting of the ACL, pages 167-174, College Park, Maryland
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL
Comments 4 pages
Journal ref Proceedings of Eurospeech, 1999, pp. 1567-1570, Budapest, Hungary
用于文本摘要的Transformer模型:BART、BERT与RoBERTa的对比研究
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对文本摘要任务,对比分析BERT、RoBERTa、BART三款Transformer模型的架构、预训练策略及在抽取式、生成式摘要任务中的适用性,为相关应用提供参考。
Comments 1- pages
Journal ref International Journal of Artificial Intelligence and Applications (IJAIA), Vol.17, No.3, May 2026
已编码但不可执行:审计冻结大语言模型中几何约束的解码-生成-引导差距
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 该研究以参数化CAD约束为测试平台,审计6个冻结LLMs的解码-生成-引导差距,发现几何关系可解码性与生成、引导能力存在差异,区分了编码与表达控制失败。
Comments 13 pages, 7 figures, 8 tables, including appendices
用于机器遗忘的光谱显著性
机构 * Purdue University(普渡大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对机器遗忘问题,受Muon启发提出光谱显著性遗忘(SSU)方法,通过对弱奇异分量设阈值更新,在图像分类器、扩散模型和LLM上验证了其有效性。
ProDVI:用于价值网络初始化的程序化动态先验
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 ProDVI是利用大型语言模型生成的Python函数初始化RL智能体的框架,通过预训练价值网络编码器,提升无模型RL算法的样本效率,无需依赖数据集或模拟器。
精细指令:将合成指令扩展到预训练规模
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究针对大语言模型监督训练数据有限的问题,提出将互联网规模预训练文档知识转化为合成指令和答案训练对的程序,生成FineInstructions数据集,经实验验证该方法在预训练中表现优于其他技术。
"Not in My Backyard":LLMs揭示针对无家可归者的在线和线下社会偏见
机构 * University of Notre Dame(诺丁汉大学) ; United Nations University Institute in Macau(联合国大学澳门研究所)
专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文通过大规模数据集和LLM训练揭示了针对无家可归者的在线和线下社会偏见,展示了数据量对模型性能的重要性。
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Comments 23 pages. Under review at PLOS One
Journal ref PLOS ONE 2025
无智慧的知识:衡量大语言模型与预期影响之间的不一致
机构 * Stanford University(斯坦福大学)
专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了大语言模型在基准测试和下游任务中的对齐问题,发现模型行为与专家人类行为存在较大偏差,且常见预训练方法导致了显著的不一致。
跷跷板:通过平衡学习率和批量调度加速训练
机构 * Harvard University(哈佛大学) ; Kempner Institute at Harvard University(哈佛大学 Kempner 机构) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究如何加速大语言模型预训练,提出Seesaw框架,通过平衡学习率和批量调度,在保留损失动态时减少串行步骤。理论上给出相关等效性证明并扩展,实验表明该框架能在相同浮点运算量下减少时钟时间,接近理论极限。
NexForge:通过需求优先合成扩展可执行智能体任务
专题命中 预训练与数据 :LLM(abstract);post-training(abstract);SFT(abstract);分类 cs.AI、cs.LG
AI总结 研究针对可执行智能体训练数据扩展瓶颈,提出需求优先框架NexForge,通过需求发现、任务编译等步骤生成训练数据,提升了模型在多个基准测试中的性能,助力Nex-N2模型达到开源先进水平。
UltraX:通过自适应编程编辑大规模精炼预训练数据
机构 * Peking University(北京大学) ; ModelBest Inc.(ModelBest公司) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。
小心你的自动补全内容:后门代码补全的取证溯源
机构 * University of Louisville(路易斯维尔大学) ; University of North Texas(德克萨斯大学)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大型语言模型代码补全易受后门攻击的问题,提出CodeTracer取证框架,它仅靠微调语料库和错误补全事件,提取行为指纹,经推理将不安全逻辑归因于特定后门数据,评估显示其有高准确性、低误识率和强鲁棒性。
Comments To appear in COLM 2026
在大语言模型中的同质化问题:迈向人工智能安全中的有意义多样性
机构 * Independent Researcher(独立研究者)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了大语言模型中同质化问题,提出通过编码价值观系统来促进多样性,通过实验揭示性别偏见并引入xeno-reproduction概念以缓解同质化。
新闻文本中可持续发展目标的极性检测
机构 * LinkaLab
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 介绍可持续发展目标极性检测新任务,提出SDG - POD数据集,评估六种开源大语言模型在零样本和微调设置下的表现,发现微调模型性能更佳,合成训练数据可提升模型鲁棒性和分类性能。
Comments The paper has been updated thanks to the reviewers comments
BEST-RQ-2:先上下文化再预测——自监督音频表示的两步方法
专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出BEST-RQ-2,通过两步式上下文化-预测预训练方案,使用ViT编码器和轻量预测器,在保持推理计算不变下提升跨域迁移性能。
Journal ref Interspeech 2026, Sep 2026, Sydney, Australia
REAR: 通过奖励分解实现测试时偏好重对齐
机构 * Nanyang Technological University(新加坡国立大学) ; Nanjing University(南京大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 提出REAR框架,通过将奖励函数分解为问题相关和偏好相关两部分,推导出可线性组合的对齐奖励,实现无需训练的测试时偏好重对齐,适用于多种任务。
Comments Accepted by ICML 2026
重新审视深度研究中的文本排序
机构 * The University of Edinburgh(爱丁堡大学) ; University of Glasgow(格拉斯哥大学)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文通过复现实验,从检索单元、流水线配置和查询特性三个角度评估文本排序方法在深度研究中的有效性,并提出Q2Q方法缓解查询不匹配问题。
Comments Accepted at the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)
生成式AI的计算安全性:假设检验视角
机构 * IBM Research(IBM研究院)
专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文从假设检验角度形式化生成式AI的计算安全性,提出基于信号处理的方法检测恶意输入和AI生成内容。
Comments Extended version of the paper presented at the ICML 2026 Workshop on Hypothesis Testing
通过基于知识图谱的数据生成实现精确的文本到Cypher转换
机构 * Universitat Politècnica de Catalunya(波兰理工大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出一种自动合成数据生成方法,微调小型LLM以提升Text2Cypher性能,使其在本地部署中与大型专有模型竞争,保障数据主权。
训练过程至关重要:平均预训练参数计数统一了稀疏和密集的扩展规律
机构 * MIT CSAIL(MIT 计算科学与人工智能实验室) ; Rice University(稻大学) ; Google Research(谷歌研究) ; Google DeepMind(谷歌DeepMind) ; Google(谷歌) ; IST Austria(奥地利科学院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 本文通过研究80种不同的剪枝计划,发现预训练过程中在25%和75%的计算量启动和结束剪枝可获得最佳评估损失,提出新的扩展规律统一了稀疏和密集预训练的扩展规律。
Comments 17 pages
Journal ref The Thirteenth International Conference on Learning Representations (ICLR), 2025
Muon 比 Adam 学习更鲁棒和可迁移的特征
机构 * Yale University(耶鲁大学) ; National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文通过鲁棒性和可迁移性视角,证明 Muon 优化器相比 Adam 和 SGD 能学习到更鲁棒、更可迁移的特征,并通过理论分析支持了经验发现。
HKJudge:用于解释法院认定事实、推理过程和裁决结果的法律话语标注语料库
机构 * City University of Hong Kong(香港城市大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出首个句子级专家标注的法律话语数据集HKJudge,包含香港各级法院刑事判决,设计双层话语模式(26种修辞角色和3种判刑要素),并基于BERT和LLM进行基准评估。
迷失在采样中:通过词覆盖率评估大语言模型中的词汇可达性
机构 * Information and Processing Telecommunications Center(信息与处理电信中心) ; Universidad Politécnica de Madrid(马德里理工大学) ; Politecnico di Milano(米兰理工大学) ; Banco de España(西班牙银行)
专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出词覆盖率(WCS)指标,量化标准采样过滤器(如Top-p、Top-k、Min-p)如何抑制低频率高信息词汇的生存率,揭示解码机制对语言多样性的影响。
Comments 15 pages, 6 figures
SeDT: 基于句子变换器的决策变换器条件化用于多轮对话可靠性
机构 * Independent Researcher(独立研究者) ; Drone Lab, IIT Mandi(IIT曼迪无人机实验室) ; UPES, Dehradun(德里敦UPES)
专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在多轮对话中性能下降的问题,提出一种无需训练和额外数据的推理方法SeDT,通过引入离线强化学习中的return-to-go条件化,利用语义、词汇和位置信号计算累积相关性得分并注释对话历史,显著提升模型性能并降低不可靠性。