arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 535 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 35 篇

2605.30348 2026-05-29 cs.CL cs.AI cs.LG 93%

LLMSurgeon: Diagnosing Data Mixture of Large Language Models

LLMSurgeon: 诊断大型语言模型的数据混合

Yaxin Luo, Jiacheng Cui, Xiaohan Zhao, Xinyi Shang, Jiacheng Liu, Xinyue Bi, Zhaoyi Li, Zhiqiang Shen

机构 * VILA Lab, MBZUAI(VILA实验室,MBZUAI) UCL

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 提出LLMSurgeon框架,通过逆问题方法从目标LLM生成文本中估计预训练语料的领域分布,实现无需训练数据的后验审计。

Comments ACL 2026 Main. Code at https://github.com/Yaxin9Luo/LLMSurgeon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00357 2026-05-29 cs.DC cs.SY eess.SY 92%

SPARe: Stacked Parallelism with Adaptive Reordering for Fault-Tolerant LLM Pretraining Systems with 100k+ GPUs

SPARe: 面向10万+GPU容错LLM预训练系统的堆叠并行与自适应重排序

Jin Lee, Zhonghao Chen, Xuhang He, Robert Underwood, Bogdan Nicolae, Franck Cappello, Xiaoyi Lu, Sheng Di, Zheng Zhang

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title)

AI总结 针对大规模LLM预训练中故障频繁导致重启开销主导训练时间的问题,提出SPARe框架,通过跨并行组堆叠冗余数据分片并自适应重排序执行顺序,在梯度同步中掩盖节点故障,实现接近传统复制的可用性且计算开销仅2~3倍,在60万GPU规模下训练时间减少40~50%。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08949 2026-05-29 cs.CL 92%

EVADE: LLM-Based Explanation Generation and Validation for Error Detection in NLI

EVADE:基于LLM的解释生成与验证用于NLI错误检测

Longfei Zuo, Barbara Plank, Siyao Peng

机构 * Technical University of Munich(慕尼黑技术大学) MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出EVADE框架,利用大语言模型生成和验证解释以检测NLI数据集中的标注错误,实验表明LLM验证能减少人力并提升微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21725 2026-05-29 cs.CL cs.LG 90%

Procedural Pretraining: Warming Up Language Models with Abstract Data

程序化预训练:用抽象数据预热语言模型

Liangze Jiang, Zachary Shinnick, Anton van den Hengel, Hemanth Saratchandran, Damien Teney

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(伊迪普研究机构) AIML, Adelaide University(人工智能实验室,阿德莱德大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 提出程序化预训练方法,通过在抽象结构化数据(如形式语言生成的程序数据)上预训练语言模型,显著提升其推理能力并加速后续语义知识学习,实验表明仅需0.1-0.3%的程序数据即可超越标准预训练。

Comments ICML 2026. Project page: https://zlshinnick.github.io/procedural-pretraining-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28876 2026-05-29 cs.SE cs.AI 90%

LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis

LogDx-CI:为LLM根因诊断基准测试日志缩减工具

Bowen Qin

机构 * National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出LogDx-CI基准,比较11种日志缩减工具在35个真实CI故障案例上的效果,发现混合grep+tail路由器在成本质量上占优,且智能体循环可缩小质量差距但成本差异持续存在,同时跨家族LLM摘要器优于同家族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30040 2026-05-29 cs.CR cs.AI cs.CL 90%

Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage

Token通胀:不诚实的提供商如何对大型语言模型使用超额收费

Shahinul Hoque, Jinghuai Zhang, Jinyuan Sun, Fnu Suya

机构 * University of Tennessee, Knoxville(田纳西大学,基洛纳分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究揭示了基于每token计费的大型语言模型商业服务中,提供商利用审计信任悖论系统性地虚报token数量,导致用户费用大幅增加的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27379 2026-05-29 cs.AI cs.CL 89%

Soro: A Lightweight Foundation Model and Chatbot for Tajik

Soro: 一种轻量级塔吉克语基础模型与聊天机器人

Stanislav Liashkov, Haitz Sáez de Ocáriz Borde, Azizjon Azimi, Khushbakht Shoymardonov, Shuhratjon Khalilbekov, Bonu Boboeva

专题命中 预训练与数据 :foundation model(title);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对塔吉克斯坦计算和连接受限环境,提出基于Gemma 3的塔吉克语专用对话大语言模型Soro,通过持续预训练和监督微调,在塔吉克语基准测试上显著优于同尺寸基线,并支持量化部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14315 2026-05-29 cs.LG math.OC 89%

Enhancing LLM Training via Spectral Clipping

通过谱裁剪增强大语言模型训练

Xiaowen Jiang, Andrei Semenov, Sebastian U. Stich

机构 * CISPA Helmholtz Center for Information Security(信息安全研究中心) EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出SPECTRA框架,通过对优化器更新进行谱裁剪以约束谱范数、对梯度进行预谱裁剪以抑制噪声尖峰,从而提升多种优化器在大语言模型预训练中的性能。

Comments v2: ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11331 2026-05-29 cs.LG cs.AI 88%

Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover

大型语言模型的越狱缩放定律:多项式-指数交叉

Indranil Halder, Annesya Banerjee, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29278 2026-05-29 cs.CL 87%

Accommodation Goes Both Ways: Studying Linguistic Convergence Between Humans and Language Models

适应是双向的:研究人类与语言模型之间的语言趋同

Terra Blevins

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 通过大规模研究人类与LLM对话中的语言趋同现象,发现LLM在功能词和开放类特征上过度适应人类风格,而人类对LLM的适应程度与人类之间对话的基线一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14279 2026-05-29 cs.CV cs.CL 85%

Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance

超越文本:通过多模态双注意力和软图像引导减少大型视觉语言模型中的语言偏差

Haozhe Zhao, Shuzheng Si, Liang Chen, Yichi Zhang, Maosong Sun, Mingjia Zhang, Baobao Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对大型视觉语言模型因语言偏差导致的幻觉问题,提出LACING框架,采用多模态双注意力机制和软图像引导策略,在不增加训练资源的情况下增强视觉理解并减少幻觉。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29940 2026-05-29 cs.AI 83%

Make LLM Learn to Synthesize from Streaming Experiences through Feedback

使大语言模型通过反馈从流式经验中学习合成

Zhenlin Hu, Yan Wang, Zhen Bi, Zihao Xue, Bingyu Zhu, Longtao Huang, Xiongtao Zhang, Zeyu Yang, Zhixuan Chu, Jungang Lou

机构 * Huzhou Normal University(湖州师范学院) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出StreamSynth设置和SynLearner框架,使模型通过任务流积累经验并利用反馈提升合成数据生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28835 2026-05-29 cs.CL cs.AI 82%

GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling

GenesisFunc: 面向准确且泛化的函数调用的多智能体数据生成

Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling

机构 * Tongyi Fun Team, Alibaba Group(通义功能团队,阿里巴巴集团)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出GenesisFunc多智能体自动生成函数调用训练数据,通过多阶段评估保证质量,微调8B模型在域内和域外均优于同类开源模型,性能接近部分API模型。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29955 2026-05-29 cs.AI 81%

Formalizing Mathematics at Scale

大规模形式化数学

Ahmad Rammal, Niket Patel, Fabian Gloeckle, Amaury Hayat, Julia Kempe, Remi Munos, Charles Arnal, Vivien Cabannes

机构 * FAIR at Meta(Meta的FAIR) New York University(纽约大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出多智能体系统AutoformBot,利用LLM和形式化验证工具,自动将非正式教材翻译为Lean 4可验证代码,构建了包含超过45,000个声明和50万行代码的Atlas形式化库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10960 2026-05-29 cs.CL cs.AI 81%

Steering Language Models Before They Speak: Logit-Level Interventions

在语言模型发言前引导它们:Logit 级别的干预

Hyeseon An, Shinwoo Park, Hyundong Jin, Yo-Sub Han

机构 * Department of Computer Science, Yonsei University, Seoul, South Korea(延世大学计算机科学系,首尔,韩国)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出 SWAI 方法,通过基于语料库的 token 统计在 logit 空间直接引导语言模型,无需训练或访问内部激活,在可读性、礼貌性和毒性控制上优于提示和基线方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29828 2026-05-29 cs.LG 79%

When Do Graph Foundation Models Transfer? A Data-Centric Theory

图基础模型何时迁移?一个以数据为中心的理论

Jiajun Zhu, Ying Chen, Peihao Wang, Yixuan He, Pan Li, Aditya Akella, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Arizona State University(亚利桑那州立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文通过图论连续极限方法,将跨域输出偏移分解为有限样本近似项和结构不匹配的内在域差异,并验证了位置编码稳定性对迁移的影响。

Comments 21 pages, including appendix. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29591 2026-05-29 cs.AI 79%

Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

Mind-Omni:通过离散扩散实现脑-视觉-语言建模的统一多任务框架

Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

机构 * NeuBCI Lab, State Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Future Technology, University of Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China Zhongguancun Academy, Beijing, China Peking University, Beijing, China

专题命中 预训练与数据 :language model(title);foundation model(abstract);分类 cs.AI

AI总结 提出Mind-Omni框架,利用离散扩散范式统一七种编码与解码任务,通过脑分词器将连续脑信号转化为离散令牌,实现多模态交互,并构建脑问答指令调优数据集,在多项任务上达到或超越专用模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29425 2026-05-29 cs.AI 79%

ReasonLight: A Multimodal Foundation Model-Enhanced Reinforcement Learning Framework for Zero-Shot Traffic Signal Control

ReasonLight: 一种多模态基础模型增强的强化学习框架用于零样本交通信号控制

Aoyu Pang, Maonan Wang, Yuejiao Xie, Chung Shue Chen, Zhiwei Yang, Man-On Pun

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学机械与自动化工程系) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) Nokia Bell Labs, Paris-Saclay, France(法国巴黎萨克雷诺基贝尔实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 提出ReasonLight框架,通过多模态基础模型增强强化学习,利用路侧传感器和摄像头数据实现零样本适应罕见交通事件,显著降低紧急车辆等待时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26194 2026-05-29 cs.LG 79%

On the Role of Inductive Bias in Time-Series Pretraining: A Case Study in Learning Generalizable Representations for Clinical Time Series

论归纳偏置在时间序列预训练中的作用:以临床时间序列学习通用表征的案例研究

Sharmita Dey, Diego Paez-Granados

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Paraplegic Research(瑞士脊髓损伤研究所) ETH Zurich, Swiss Paraplegic Research(苏黎世联邦理工学院、瑞士脊髓损伤研究所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 通过PathoFM编码器中心Transformer,结合局部补全、时间连续性和无监督上下文动力学三种互补目标,研究预训练目标中归纳偏置对跨任务类型和受试者迁移的影响,发现动态中心混合目标能产生最平衡的迁移表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23440 2026-05-29 cs.CL cs.AI 73%

SSDAU: Structured Semantic Data Augmentation for Joint Entity and Relation Extraction

SSDAU:面向联合实体关系抽取的结构化语义数据增强

Jiawei He, Mengyu Shi, Jiawei Liu, Dong Sun, Chunrong Fang, Xikai Yang, Zhijie Wang, Lei Ma, Zhenyu Chen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) Amap, Alibaba Group, China(阿里巴巴集团阿地图) University of Alberta, Edmonton, Canada(阿尔伯塔大学) The University of Tokyo, Tokyo, Japan(东京大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出结构化语义数据增强方法SSDAU,通过保留三元组感知语义结构、上下文感知编码和BERTopic过滤,提升联合实体关系抽取的泛化能力,在多个模型和数据集上优于现有方法。

Comments 10 pages, 4 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29387 2026-05-29 cs.LG cs.AI stat.ML 73%

On the Optimizer Dependence of Neural Scaling Laws

神经缩放定律的优化器依赖性

Vansh Ramani, Shourya Vir Jain

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Delhi(计算机科学与工程系,印度理工学院德里)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 通过随机特征回归实验,发现优化器类型系统性地影响神经缩放定律中的缩放指数α,预条件优化器产生更陡峭的缩放,并提供了光谱诊断预测高级优化器的收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29765 2026-05-29 cs.LG 70%

MMTM: Tri-Modal Topic Modeling for Long-Form Video via Similarity-Gated Fusion

MMTM: 基于相似性门控融合的长视频三模态主题建模

Ali Abusaleh, Bhuvanesh Verma, Alexander Mehler

机构 * Text Technology Lab (TTLab), Goethe University Frankfurt(文本技术实验室(TTLab),法兰克福歌德大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出MMTM模块化流水线,通过相似性门控融合集成语音识别、音频和视觉嵌入及BERTopic聚类,在长视频主题发现中显著提升主题质量。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13986 2026-05-29 cs.LG stat.ML 70%

TabPFN-3: Technical Report

TabPFN-3: 技术报告

Léo Grinsztajn, Klemens Flöge, Oscar Key, Felix Birkel, Philipp Jund, Brendan Roof, Mihir Manium, Shi Bin Hoo, Magnus Bühler, Anurag Garg, Dominik Safaric, Jake Robertson, Benjamin Jäger, Simone Alessi, Adrian Hayler, Vladyslav Moroshan, Lennart Purucker, Philipp Singer, Alan Arazi, Julien Siems, Jan Hendrik Metzen, Georg Grab, Nick Erickson, Siyuan Guo, Eliott Kalfon, Simon Bing, David Salinas, Clara Cornu, Lilly Charlotte Wehrhahn, Diana Kriuchkova, Kursat Kaya, Lydia Sidhoum, Marie Salmon, Jerry Chen, Madelon Hulsebos, Yann LeCun, Samuel Müller, Bernhard Schölkopf, Sauraj Gambhir, Noah Hollmann, Frank Hutter

机构 * Prior Labs

专题命中 预训练与数据 :LLM(abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 本文提出TabPFN-3,通过扩展训练数据和优化推理,在表格数据上实现最先进性能,并支持时间序列、关系数据和表格文本数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18395 2026-05-29 cs.CL 70%

Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction

不要贪婪,三思而后行:文档级信息抽取的采样与选择

Mikel Zubillaga, Oscar Sainz, Oier Lopez de Lacalle, Eneko Agirre

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(希茨中心 - Ixa,巴斯克国家大学UPV/EHU)

专题命中 预训练与数据 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 提出ThinkTwice框架,通过采样生成多个候选模板并选择最优,利用无监督一致性和有监督奖励模型,在文档级信息抽取中超越贪婪解码方法。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22255 2026-05-29 cs.CV cs.IR 67%

Direct content-based retrieval from music scores images

基于内容的乐谱图像直接检索

Noelia Luna-Barahona, Antonio Ríos-Vila, Félix Fuentes-Hurtado, David Rizo, Jorge Calvo-Zaragoza

机构 * Pattern Recognition and Artificial Intelligence Group, University of Alicante(阿利坎特大学模式识别与人工智能小组) Instituto Superior de Enseñanzas Artísticas de la Comunidad Valenciana(瓦伦西亚社区艺术教育研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究乐谱图像内容检索方法,比较基于光学音乐识别的转录方法、无转录Transformer模型和文本提示大语言模型在不同数据集上的表现。

Comments 17 pages (14 pages + references), 3 figures (with subfigures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03805 2026-05-29 cs.LG cs.AI cs.DB 62%

Relational In-Context Learning via Synthetic Pre-training with Structural Prior

通过结构先验的合成预训练实现关系上下文学习

Yanbo Wang, Jiaxuan You, Chuan Shi, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学香槟分校) Institute of Computing Technology, Beijing University of Post(北京邮电大学计算机学院) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出RDB-PFN,首个仅通过合成数据训练的关系基础模型,利用结构因果模型生成多样关系数据库,实现对新数据库的即时上下文学习,在19个真实关系预测任务上优于现有表格基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29379 2026-05-29 cs.CL cs.LG 62%

BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base

BrahmicTokenizer-131K:一种可替代o200k_base的印度文字兼容分词器

Rohan Shravan

机构 * The School of AI(人工智能学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 提出BrahmicTokenizer-131K,一种131072词汇量的字节级BPE分词器,通过两阶段改造在保持非印度文字性能的同时,显著提升印度文字的压缩效率。

Comments 24 pages, 15 tables, 3 code listings. Tokenizer artifact, verification scripts, and reproduction code at https://huggingface.co/theschoolofai/BrahmicTokenizer-131K and https://github.com/theschoolofai/BrahmicTokenizer-131K

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29267 2026-05-29 cs.AI cs.LG 62%

When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop

人类策展何时以及如何适得其反:多模型自消费循环下的偏好对齐

Yang Zhang, Xiukun Wei, Xueru Zhang

机构 * Department of Computer Science and Engineering, The Ohio State University, Columbus, Ohio(计算机科学与工程系,俄亥俄州立大学,哥伦布,俄亥俄)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究多模型自消费训练中人类策展对模型对齐的影响,发现跨模型交互可能削弱甚至逆转策展效果,导致长期对齐退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30341 2026-05-29 cs.CV cs.AI 57%

GPIC: A Giant Permissive Image Corpus for Visual Generation

GPIC:用于视觉生成的大型许可图像数据集

Keshigeyan Chandrasegaran, Kyle Sargent, Suchir Agarwal, Michael Jang, Michael Poli, Juan Carlos Niebles, Justin Johnson, Jiajun Wu, Li Fei-Fei

机构 * Stanford University(斯坦福大学) Radical Numerics University of Michigan(密歇根大学) Salesforce Research(Salesforce研究)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 提出GPIC,一个约28万亿像素的大型许可图像数据集,包含1亿训练样本,通过最先进的视觉语言模型标注,用于视觉生成建模研究。

Comments 25 pages; Dataset: https://huggingface.co/datasets/stanford-vision-lab/giant-permissive-image-corpus; Project website: https://gpic.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17945 2026-05-29 cs.CL 57%

ShapleyLaw: A Game-Theoretic Approach to Multilingual Scaling Laws

ShapleyLaw:多语言缩放定律的博弈论方法

Xuyang Cao, Qianying Liu, Chuan Xiao, Yusuke Oda, Jiayi Wang, Pontus Stenetorp, Daisuke Kawahara, Makoto Onizuka, Sadao Kurohashi, Shuyuan Zheng

机构 * NII LLMC Osaka University(大阪大学) Nara Institute of Science and Technology(奈良科学技術大學) University College London(伦敦大学学院) Kyoto University(京都大学) Waseda University(早稻田大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 将多语言预训练视为合作博弈,利用Shapley值量化跨语言迁移效应,提出ShapleyLaw缩放定律以优化语言混合比例。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏