RedWhale: An Adapted Korean LLM Through Efficient Continual Pretraining
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)
Comments ACL 2024 (Main)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments Accepted by ACL 2024 Findings
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments To appear at ICML 2024; Project page: http://sites.research.google/videopoet/
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
Comments 46 pages
专题命中 预训练与数据 :instruction tuning(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 14 pages, 3 figures
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments 9 pages, 3 pages appendices, 1 figure, 4 tables (incl. appendices)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments RecSys 2023 Camera-ready
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments This work has been accepted by ACL 2023 (findings), while we slightly revise the title and the content based on the conference version
专题命中 预训练与数据 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)
Comments 21 pages, 13 figures
用于小样本文本分类的大语言模型生成样本的几何过滤
专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本研究针对LLM生成样本质量异质性问题,提出基于句子嵌入空间欧氏距离的几何过滤框架,结合软加权机制提升小样本文本分类性能,在多任务、多模型及多配置下均表现优异。
Comments 6 pages, 2 figures, to be published in IEEE LACCI 2026
大多数生物医学出版物显示出大语言模型(LLM)辅助写作的迹象
机构 * Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所) ; Ghent University(根特大学) ; VIB(弗拉芒生物技术研究院)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 本研究提出基于词频变化的无偏方法估计文本语料库中LLM使用情况,发现到2025年底89%的生物医学论文存在LLM相关词汇过量,讨论部分LLM使用率是方法部分的两倍,相关估计对制定指南政策至关重要。
超越“AI语言”:论大语言模型输出的个体方言本质
专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出LLM输出具有个体方言本质,通过分析两个LLM生成文本数据集,发现模型间存在独特语言特征,该视角对多领域研究有潜在价值。
Comments 33 pages, 6 figures, 6 tables. Submitted as a chapter to the post-workshop volume "Corpus Linguistics 2040" (Digital Linguistics series)
低资源场景下的语音大语言模型:数据量需求及高资源语言预训练的影响
机构 * Department of Information Engineering(信息工程系) ; Center for Augmented Intelligence(增强智能中心)
专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title);large language model(abstract);language model(abstract)
AI总结 该研究针对低资源ASR任务,基于SLAM-ASR框架探究语音LLM的数据量需求,发现高资源语言预训练的投影器可缓解数据稀缺问题,并结合多语LLM在公开基准上验证性能,为相关研究提供方向。
Comments Accepted at Interspeech 2025. 5 pages, 2 figures, 3 tables
形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。
Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026
AgentRedBench: 针对SaaS集成的LLM代理的动态红队测试与集成感知防御
机构 * StackOne Technologies(StackOne技术公司)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 针对LLM代理在工具使用中面临的间接提示注入威胁,提出动态红队基准AGENTREDBENCH(覆盖24个企业集成、5种攻击类型)和基于集成多样语料训练的防御模型AGENTREDGUARD,将攻击成功率从69.9%降至2.4%,误报率仅0.37%。
语言模型中可靠性和扩展性的信息论极限
机构 * Indian Institute of Management Bangalore(班加罗尔印度管理学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 研究语言模型可靠性和扩展性的信息论极限,通过分析任务输出不确定性等因素得出缩放定律,指出LLM性能受训练数据或模型容量限制,还统一多种实际现象,提供生成语言模型性能极限的统一理论。
Comments 29 pages, 2 figures
注入悖论:通过RAG上下文注入在安全训练的LLM推荐中实现品牌级压制
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 研究发现在基于RAG的LLM推荐中,安全训练会导致注入提示反而压制目标品牌推荐率,揭示了安全机制可能被逆向利用的风险。
Comments 18 pages, 1 figure, 15 tables. Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), a non-archival venue
从数值到标记:一种基于符号离散化的LLM驱动上下文感知时间序列预测框架
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; University of Science and Technology of China(中国科学技术大学) ; College of Intelligence and Computing(智能科学与计算学院) ; iFLYTEK Research(iFLYTEK研究院)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出TokenCast框架,利用大语言模型通过符号离散化将连续时间序列转化为标记,与上下文文本对齐,实现上下文感知的预测,实验证明有效。
基于LLM的文学翻译中的情感特征:机器翻译与译后编辑的系统性转变
机构 * University of Pisa(比萨大学) ; Dublin City University(都柏林城市大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 研究LLM翻译的情感特征及译后编辑如何使其接近人类翻译,通过对比《Oryx and Crake》的LLM翻译、译后编辑版本和人类翻译,发现MT系统引入特定情感指纹,削弱作者声音。
Insights Generator: LLM代理的系统级语料库追踪诊断
机构 * Scale AI, Inc.
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 本文提出Insights Generator,一种多智能体系统,通过在语料库中提出和测试假设来生成基于证据的洞察报告,从而系统性地诊断LLM代理的行为模式。
评估基于LLM的社会智能体的真实性:对西班牙在线新闻反应的案例研究
机构 * Faculty of Computer Science, University of Murcia(计算机科学系,穆尔西亚大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 通过比较真实与LLM生成的西班牙新闻评论,研究LLM在仇恨言论、情感和语义对齐三个维度上的真实性,发现现成模型表现不佳,微调可部分改善。
BioELX: 基于别名的检索与LLM排序的跨语言生物医学实体链接
机构 * University of Stuttgart, Germany(斯图加特大学) ; Technical University of Berlin, Germany(柏林技术大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出BioELX两阶段框架,通过维基数据多语言别名增强SapBERT检索器,并利用预训练LLM排序器进行上下文感知消歧,无需标注数据即在多个基准上取得最佳性能。
Comments 12 pages, 3 figures
光谱检索:基于多尺度sinc卷积的令牌嵌入局部化检索在LLM多智能体系统中的应用
机构 * Cisco(思科)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出光谱检索方法,通过多尺度sinc卷积对令牌嵌入进行重排序,在无需重新训练的情况下显著提升局部化检索性能,并自然适配于LLM多智能体系统。
以行为识别LLM浏览器代理:通过UI轨迹指纹化
机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) ; Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。
基于测试时LLM引导的任务自适应嵌入细化
机构 * IBM Research(IBM研究院)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 本文提出利用LLM反馈优化查询嵌入表示,提升零样本搜索和分类任务的性能,实验表明在多个基准上提升达25%。