arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138790 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2607.03978 2026-07-07 cs.HC cs.AI cs.CV 新提交 81%

Scalable Semantic Steering of Embedding Projections

嵌入投影的可扩展语义引导

Wei Liu, Eric Krokos, Kirsten Whitley, Rebecca Faust, Chris North

机构 * Virginia Tech(弗吉尼亚理工学院) Department of Defense(国防部) Tulane University(路易斯安那州立大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。

Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00016 2026-07-02 cs.IR cs.AI 新提交 81%

Libra: Training the Environment for Agentic Information Retrieval

Libra: 为智能信息检索训练环境

Xuan Zhao, Andy Chiu, Gengyu Wang

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出Libra框架,通过引入可变目录和LLM驱动优化循环,自动改进代码仓库的索引结构,提升代码定位准确率,并实现跨模型和问题的零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00890 2026-07-02 cs.CL 新提交 81%

MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

MultiSynt/MT:跨36种语言翻译的万亿Token多平行预训练数据

Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Ginter, Matthias Lindemann, Tim Isbister, Birger Moell, Jonas Lindh, Jan Hajič, Jenia Jitsev, Andrey Kutuzov, Stephan Oepen, Gema Ramírez-Sánchez

机构 * ellamind Leibniz University Hannover(莱布尼茨汉诺威大学) University of Helsinki(赫尔辛基大学) University of Turku(图尔库大学) ELLIS Institute Tübingen(ELLIS 图宾根研究所) Prior Labs University of Oslo(奥斯陆大学) Prompsit Language Engineering(Prompsit 语言工程公司) AI Sweden Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico(高等技术学院) TransPerfect Charles University(查理大学) Ontocord LAION Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(于利希超级计算中心 (JSC), 于利希研究中心 (FZJ))

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出MultiSynt/MT,一个覆盖36种欧洲语言、约4.8万亿token的合成平行语料库,通过翻译1000亿高质量token生成,使参考LLM在减少72%预训练token下达到原生数据基线性能,并发现标准基准测试的评估盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30175 2026-06-30 cs.CL 81%

CORTEX: High-Quality Cross-Domain Organization of Web-Scale Corpora through Ontological Corpus Graph

CORTEX:通过本体语料图实现网络规模语料库的高质量跨领域组织

Chengtao Gan, Xiaoke Guo, Yushan Zhu, Zhaoyan Gong, Zhiqiang Liu, Songze Li, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) JIUTIAN Research(JIUTIAN研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CORTEX框架,利用本体语料图(OCG)将网络规模语料构建从扁平文档筛选提升为结构化知识组织,实现质量精炼、层次化本体和跨领域对齐,并构建CortexBench基准验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28438 2026-06-30 cs.SE cs.AI 81%

When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs

当AI审查自己的代码:代码大语言模型中的递归自训练崩溃

Xinyuan Song, Zekun Cai, Liang Zhao

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究代码LLM在递归自训练中因缺乏外部质量控制而崩溃的风险,对比无审查、人工门控和AI自门控三种机制,发现AI自门控会退化为无门控自训练,需外源验证。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04693 2026-06-30 cs.CL 81%

Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding

Thunder-KoNUBench: 一个与语料库对齐的韩语否定理解基准

Sungmok Jung, Yeonkyoung So, Joonhak Lee, Sangho Kim, Yelim Ahn, Jaejin Lee

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出Thunder-KoNUBench,通过分析韩语否定现象,评估47个LLM在否定理解上的表现,揭示模型大小和指令微调的影响,并展示微调提升韩语否定理解和上下文理解的效果。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26062 2026-06-25 cs.CL 新提交 81%

When Certainty Is an Artifact: Keyword Lexicon Blindness and the (Mis)Measurement of Rhetorical Stance

当确定性是人为产物:关键词词典盲点与修辞立场的(误)测量

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过对比关键词词典与LLM零样本分类在85篇访谈(2016-2026)中的表现,发现关键词计数产生的显著负情绪-确定性共现模式是测量伪影,而LLM揭示出悲观话语实际吸引的是模糊化而非确定性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25721 2026-06-25 cs.CR cs.CL cs.IR 新提交 81%

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

通过令牌影响归因追踪中毒检索语料库中的目标答案

Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学) IBM Research(IBM研究院) Hon Hai Research Institute(宏海研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出TRACE框架,通过令牌影响归因识别检索增强生成系统中的语料投毒攻击,无需额外分类器或LLM验证,在三个QA基准和六个LLM上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24897 2026-06-25 cs.DL cs.CL cs.IR 新提交 81%

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

对人类不可见,对机器可见:四个生物医学文献API的Unicode保真度预注册审计

Przemysław Czuma

机构 * Przemysław Czuma(普拉姆斯拉夫·茨马)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过预注册审计,评估四个生物医学API(PubMed、Crossref、OpenAlex、Semantic Scholar)返回摘要的Unicode保真度,发现PubMed和OpenAlex存在系统性字符丢失,影响文献计量和语料构建。

Comments 14 pages, 1 figure. Pre-registered on OSF. Data and code available on Zenodo and GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14167 2026-06-24 cs.CL 81%

Synthetic Clarification and Correction Dialogues about Data-Centric Tasks -- A Teacher-Student Approach

数据导向任务的合成澄清与纠正对话——一种教师-学生方法

Christian Poelitz, Nick McKenna

机构 * Microsoft Research(微软研究院) Cambridge UK(剑桥英国)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出一种教师-学生框架,用于合成多轮对话以解决基于表格的问题回答任务,通过强教师模型验证生成对话质量,验证了其在前沿LLM基准中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23395 2026-06-23 cs.SE cs.AI 新提交 81%

Automated Semantic Fault Localization in SysML v2: A Human-in-the-Loop Framework Using Knowledge-Graph Augmented LLMs

SysML v2中的自动化语义故障定位:一种使用知识图谱增强大语言模型的人机协同框架

Haitham Al-Shami, Rohail Malik, Riku Ala-Laurinaho, Jari Vepsäläinen, Raine Viitala

机构 * Aalto University(艾洛大学)

专题命中 预训练与数据 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 提出一种人机协同框架,结合微调小语言模型与领域知识图谱,自动识别并修复SysML v2模型中保持语法有效但违反领域规则的语义错误,在车辆系统领域验证中故障修复率从低于3%提升至91%以上。

Comments 12 pages, 4 figures. Presented at INCOSE International Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18389 2026-06-18 cs.CL 新提交 81%

Want Better Synthetic Data? Steer It: Activation Steering for Low-Resource Language Generation

想要更好的合成数据?引导它:面向低资源语言生成的激活引导

Jan Cegin, Daniil Gurgurov, Yusser Al Ghussin, Simon Ostermann

机构 * Kempelen Institute of Intelligent Technologies(肯佩伦智能技术研究所) German Research Institute for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出激活引导作为低资源语言合成数据生成的替代方法,包括语言引导和质量引导,实验表明早期层引导能提升数据多样性和下游模型性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15984 2026-06-16 cs.CL 新提交 81%

ROMPAR: Morphological Completion and Demographic Unlearning for Romanian-Accented Speech Recognition

ROMPAR:罗马尼亚口音语音识别的形态补全与人口统计去偏

Andrei-Marius Avram, Aureliu-Valentin Antonie, Ştefan-Bogdan Badea, Andrei Florea, Robert-Nicolae Zaharoiu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特理工大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出ROMPAR语料库和多任务对抗训练框架,通过指数衰减机制和LLM引导解码,实现人口统计不变性和形态补全,WER显著降低,形态重建F1达96.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00074 2026-06-16 q-bio.GN cs.AI 版本更新 81%

CRC-Screen: Certified DNA-Synthesis Hazard Screening Under Taxonomic Shift

CRC-Screen:分类偏移下认证的DNA合成危害筛查

Najmul Hasan

机构 * Najmul Hasan(纳杰姆·哈桑)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对DNA合成订单中危害序列因分类偏移导致基线筛查100%误报的问题,提出基于k-mer Jaccard相似度、五LLM评委修剪均值和嵌入聚类质心余弦相似度的融合信号,经单调逻辑聚合器和共形风险控制校准,在保证假阴性率受控的同时实现零漏检和低误报。

Comments Accepted at the 6th Muslims in ML (MusIML) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新 81%

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13808 2026-06-15 cs.CL 新提交 81%

The Culture Funnel: You Can't Align What isn't in the Data

文化漏斗:你无法对齐不在数据中的内容

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 针对当前文化对齐方法依赖推理时干预而忽视训练数据的问题,提出文化数据漏斗概念,通过多维标签框架分析预训练、微调、对齐和推理数据集,发现后训练阶段文化信号急剧下降,多语言性虽增强地理多样性但未能确保平衡,所提标签可提升下游文化基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13668 2026-06-12 cs.CL 新提交 81%

Influcoder: Distilling Decoders' Gradient Influence Rankings into an Encoder for Data Attribution

Influcoder:将解码器的梯度影响排名蒸馏到编码器用于数据归因

Dimitri Kachler, Damien Sileo, Pascal Denis

机构 * Centre Inria de l’Université de Lille, CRIStAL, Université de Lille(里尔大学Inria中心,CRIStAL,里尔大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大型语言模型训练数据归因中影响函数方法计算和存储成本高的问题,提出Influcoder方法,通过将解码器梯度影响排名蒸馏到编码器,实现快速且成本高效的大规模数据归因。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08715 2026-06-09 cs.CL 新提交 81%

Operationalizing Linguistic Methods through Prompt-Engineering Skills: An Automatic Chinese Web Neologism Detection Pipeline

通过提示工程技能操作化语言学方法:一种自动中文网络新词检测流水线

Yufeng Wu, Meichun Liu

机构 * City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出一种自动中文网络新词检测方法,将传统语言学识别原则转化为提示工程技能,通过四阶段流水线从2.67亿文档中检测出4853个新词,并揭示候选覆盖和LLM语义判断为瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02424 2026-06-09 cond-mat.mtrl-sci cs.AI 版本更新 81%

A large-scale nanocrystal database with aligned synthesis and properties enabling generative inverse design

大规模纳米晶体数据库:对齐合成与性质实现生成式逆向设计

Kai Gu, Yingping Liang, Senliang Peng, Aotian Guo, Haizheng Zhong, Ying Fu

机构 * MIIT Key Laboratory for Low-Dimensional Quantum Structure and Devices, School of Materials Sciences & Engineering, Beijing Institute of Technology(信息产业部低维量子结构与器件重点实验室,材料科学与工程学院,北京理工大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 构建大规模对齐的纳米晶体合成-性质数据库,开发基于大语言模型的NanoExtractor提取文献数据,并利用NanoDesigner实现生成式逆向设计,成功设计PbSe和MgF2纳米晶体的合成路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04362 2026-06-04 cs.IR cs.CL 81%

Disentangling Answer Engine Optimization from Platform Growth: A Log-Based Natural Experiment on ChatGPT Referral Traffic

解耦答案引擎优化与平台增长:基于日志的ChatGPT推荐流量自然实验

Keisuke Watanabe, Kazuki Nakayashiki

机构 * Glasp Inc.(Glasp公司)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过自然实验方法,利用同一域内未处理页面作为对照,分离了答案引擎优化(AEO)对推荐流量的因果效应与平台自身增长带来的混淆效应。

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22121 2026-06-04 cs.CV cs.AI 81%

GenSpan: Generation-Calibrated Motion Span Priors for Multi-Verb Video Corpus Moment Retrieval

GenSpan: 用于多动词视频语料库时刻检索的生成校准运动跨度先验

Yunzhuo Sun, Xinyue Liu, Yanyang Li, Nanding Wu, Linlin Zong, Xianchao Zhang, Wenxin Liang

机构 * Dalian University of Technology(大连理工大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出GenSpan框架,利用LLM生成辅助视频作为时间先验,结合令牌选择器和双向状态空间模型,提升多动词查询下的视频语料库时刻检索与定位性能。

Comments Major revision with title change, updated method, and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31136 2026-06-01 cs.CL 81%

Multilingual and Cross-Lingual Citation Needed Detection on Wikipedia for Lower-Resource Languages

低资源语言维基百科的多语言和跨语言引用需求检测

Gerrit Quaremba, Amy Rechkemmer, Elizabeth Black, Denny Vrandečić, Elena Simperl

机构 * King’s College London(伦敦国王学院) Wikimedia Foundation(维基媒体基金会)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);SLM(abstract_cn)

AI总结 针对低资源语言,提出多语言引用需求检测语料库MCN,并证明使用编码器风格目标微调的小型解码器语言模型在跨语言任务中优于大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30582 2026-06-01 cs.CL 81%

AI for Monitoring and Classifying Data Used in Research Literature

AI用于监控和分类研究文献中使用的数据

Rafael Macalaba, Aivin V. Solatorio

机构 * World Bank(世界银行) Office of the World Bank Group(世界银行集团办公室) Development Data Group(发展数据组)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出基于GLiNER的多任务框架,结合合成数据生成和LLM重验证,实现研究文献中数据集提及的提取、关系识别和使用上下文分类,以解决数据集使用监控中的标注稀缺和引用不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29955 2026-05-29 cs.AI 81%

Formalizing Mathematics at Scale

大规模形式化数学

Ahmad Rammal, Niket Patel, Fabian Gloeckle, Amaury Hayat, Julia Kempe, Remi Munos, Charles Arnal, Vivien Cabannes

机构 * FAIR at Meta(Meta的FAIR) New York University(纽约大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出多智能体系统AutoformBot,利用LLM和形式化验证工具,自动将非正式教材翻译为Lean 4可验证代码,构建了包含超过45,000个声明和50万行代码的Atlas形式化库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00688 2026-05-22 cs.LG 81%

Provably Protecting Fine-Tuned LLMs from Training Data Extraction while Preserving Utility

可证明地保护微调的LLM免受训练数据提取攻击同时保持效用

Tom Segal, Asaf Shabtai, Yuval Elovici

机构 * Department of Software and Information Systems Engineering, Ben-Gurion University of the Negev, Beer Sheva, Israel(软件与信息系统工程系,内盖夫本·古里安大学,贝尔谢巴,以色列)

专题命中 预训练与数据 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于近访问自由(NAF)的算法SCP-Δ_r,通过相对概率和基础模型对低影响token进行平滑处理,从而在理论上有更优的界限,并在实践中有效抵御训练数据提取攻击,同时保持性能损失最小。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21623 2026-05-22 cs.AI 81%

The Shape of Testimony: A Scalable Framework for Oral History Archive Comparison

证词的形态:一种可扩展的口述史档案比较框架

Itamar Trainin, Renana Keydar, Amit Pinchevski

机构 * Hebrew University of Jerusalem(海法大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过大规模计算分析超过1600个口述史档案,探讨了犹太人大屠杀研究中两种口述证词风格的区别,并提出一种可扩展的比较语料库分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19134 2026-05-19 cs.CL cs.IR 81%

QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation

QuCo-RAG:从预训练语料库中量化不确定性以实现动态检索增强生成

Dehai Min, Kailin Zhang, Tongtong Wu, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) New York University(纽约大学) Monash University(莫纳什大学)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出QuCo-RAG,通过从预训练语料库中提取客观统计信息来量化不确定性,以解决动态检索增强生成中大语言模型的幻觉问题,实验表明其在多跳问答基准测试中优于现有方法,并在多个模型上实现了显著的提升。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16691 2026-05-19 cs.CL cs.DC cs.MA 81%

Responsible Federated LLMs via Safety Filtering and Constitutional AI

通过安全过滤和宪法AI实现负责任的联邦大语言模型

Eunchung Noh, Jeonghun Baek

机构 * Samsung Electronics(三星电子) The University of Tokyo(东京大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出在联邦大语言模型中引入安全过滤和宪法AI技术,以提升模型安全性,实验显示在AdvBench上安全性能提升超过20%。

Comments Accepted at the 6th Workshop on Trustworthy NLP (TrustNLP), ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12286 2026-05-12 q-bio.GN cs.CL 81%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06426 2026-05-08 cs.CL 81%

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

从1.24亿个词到1021个新词:自动新词检测的大规模流水线

Diego Rossini, Lonneke van der Plas

机构 * Università della Svizzera italiana(瑞士意大利大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出一个可扩展的模块化流水线,结合规则过滤与LLM分类,通过语法和非语法形态学框架提取1021个新词候选,验证其有效性。

Comments 14 pages, 5 tables. Accepted at NeoLLM 2026 Workshop, co-located with LREC-COLING 2026

详情

展开后加载摘要…

URL PDF HTML 收藏