ChatMusician: Understanding and Generating Music Intrinsically with LLM
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments GitHub: https://shanghaicannon.github.io/ChatMusician/
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments GitHub: https://shanghaicannon.github.io/ChatMusician/
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)
专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 16 pages, 12 figures
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2023
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to "The third Neurips Workshop on Efficient Natural Language and Speech Processing 2023" (ENLSP-III)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments Accepted by IEEE/ACM International Conference on Software Engineering 2024 (ICSE 2024). arXiv admin note: substantial text overlap with arXiv:2305.09434
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2023
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to Findings of ACL 2023
专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2023
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2022
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at NeurIPS 2022. Code, data, and trained models are available at https://github.com/michiyasunaga/dragon
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref EMNLP 2022
对话的几何学:基于图谱的语言模型揭示多智能体协作的协同团队
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种基于交互的自动团队组建框架,通过构建语言模型图谱揭示多智能体协作的协同团队,实验表明其能发现功能一致的团队并优于随机基线。
Comments Accepted at the AAAI-26 Workshop on LLM-based Multi-Agent Systems: Towards Responsible, Reliable, and Scalable Agentic Systems (LaMAS 2026) as an oral presentation
机构 * Soka University of America(索卡大学)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Comments This paper has 14 pages and 8 figures. To be presented at the NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling
机构 * Rensselaer Polytechnic Institute(拉特加大学) ; Shenzhen University(深圳大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; NEC laboratories America(NEC美国实验室) ; California Institute of Technology(加州理工学院)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments website: https://llm-strategist.github.io
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Comments 14 pages, 1 main figure, 3 plots, Published at ICLR 2025 Workshop on Foundation Models in the Wild
混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期
机构 * Startlux(星创公司) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; The University of Hong Kong(香港大学) ; University of Sydney(悉尼大学) ; Columbia University(哥伦比亚大学)
专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL
AI总结 本研究系统揭示混合线性注意力大语言模型中大规模激活的两种形态,证实其在多架构、多配置等场景下的重复性,明确其对输出门控的响应规律及机制,为相关模型优化提供依据。
Comments Under review
超越检测:评估防御型大语言模型(LLM)在实时逐轮交互中对抗AI生成社会工程攻击的能力
专题命中 预训练与数据 :LLM(title_cn,summary_cn);分类 cs.AI
AI总结 本研究构建含300例的在线住房语料库,评估5种防御型LLM在实时逐轮与静态设置下对抗AI社会工程攻击的能力,发现防御效果差异大,需单独测量干预等指标。
基于大语言模型的主观多偏见检测
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
AI总结 本研究针对文本中的主观多偏见问题,采用大语言模型,在WIKIBIAS数据集上检测三类偏见,相关代码已公开。
大语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行
专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL
AI总结 本技术综述梳理了大语言模型混合专家架构的演进,通过五个维度和四个控制平面分析关键技术,揭示其从激活稀疏参数到解耦路由、预算与执行的趋势。
谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。
从大型语言模型谓词到逻辑张量网络:神经符号学在受规制采购中的投标验证
机构 * Harz University of Applied Sciences(哈尔茨应用科学大学) ; Merseburg University of Applied Sciences(梅泽堡应用科学大学) ; University of New South Wales (UNSW)(新南威尔士大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.AI
AI总结 本文提出一种结合符号与子符号人工智能的神经符号方法,用于验证受规制公共机构的投标文件,通过语言模型提取信息并结合逻辑张量网络(LTN)进行可审计决策,提升决策的可解释性和合规性。
Comments 17 pages, 2 figures, 4 tables, extended version, with appendix
Journal ref In Diedrich Wolter and Gesina Schwalbe, editors, KI 2026: Advances in Artificial Intelligence -- 49th German Conference on AI, LNAI 16830, pages 236--243, Bremen, Germany, 2026
用于 API 调用智能体的无环境合成数据生成
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。
迈向可穿戴健康数据的通用智能与接口
机构 * Google Research(谷歌研究) ; Google DeepMind(谷歌DeepMind) ; University of Washington(华盛顿大学) ; University of Oregon(俄勒冈大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 预训练与数据 :LLM(summary_cn,abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI
AI总结 提出一个基于超过一万亿分钟无标签传感器数据预训练的可穿戴健康基础模型,通过联合扩展模型容量和预训练数据量,在35项健康预测任务上实现系统性性能提升,并利用LLM代理自动搜索下游预测头,集成到个人健康代理中以提高相关性和安全性。
Comments Narayanswamy and Xu are co-first authors. McDuff and Liu are co-last authors
选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据
机构 * WSO2
专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)
AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。
Comments 11 Pages, 5 Figures
预测语言模型预训练中归纳头的出现
机构 * Department of Linguistics, Georgetown University(语言学系,乔治城大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL
AI总结 研究训练数据统计特性与归纳头形成关系,通过自然和合成数据设置,发现简单公式可预测归纳头形成点,表面二元重复频率等影响其形成并找到决策边界,局部依赖也影响其形成。
Comments Accepted to ICML 2026
OLaPh: 最优语言音素化器
机构 * Institute for Information Systems at Hof University of Applied Sciences(霍夫应用科学大学信息学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出OLaPh混合框架,结合多语言词典、NLP技术和统计子词分割,在WikiPron基准上显著优于基线,并通过LLM合成语料探索神经泛化能力。
Comments 12 pages, 1 figure, 4 tables
Agentic Clustering: 通过多智能体精炼实现可控文本分类
机构 * Burning Glass Institute(Burning Glass研究院) ; Harvard University(哈佛大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出一种基于多智能体(提议者、合成者、审计者、调查者、批评者)的自适应文本聚类方法,通过编排器LLM动态调整聚类流程,在七个公开基准上实现最先进性能,ARI最高提升32%。