arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 737 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2606.18192 2026-06-18 cs.AI 新提交 87%

The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

斯坦福EDGAR文件数据集:将美国公司及财务披露重建为布局忠实且令牌高效的预训练数据

Nick Bettencourt, Xiaowei Ding, Kay Giesecke

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 为解决长上下文文档稀缺问题,提出SEFD数据集,将SEC文件重建为布局忠实的MultiMarkdown格式,用于金融语言建模与评估,具有令牌高效、与Common Crawl重叠率低于0.1%的特点。

Comments Preprint. Includes appendix, tables, and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13277 2026-08-14 cs.CL cs.AI 新提交 87%

Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

训练混合:将小规模支架式预训练运行重组为更大的语言模型

Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

机构 * Google(谷歌公司) School of Computing, Dublin City University(都柏林城市大学计算机学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 本研究提出训练混合(MoT)框架,将Transformer划分为层块在冻结对齐器内独立训练后重组,在13亿参数Gemma模型上验证其可重组为可用语言模型,可复用对齐器实现计算优势,用于研究可复用训练单元。

Comments Accepted at the Workshop on Methods and Opportunities at Small Scale (MOSS), COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08107 2026-08-11 cs.CL cs.AI 新提交 87%

NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs

NeuPAT:面向语言保留多模态大语言模型的神经元感知可塑性分配调优

Jiayue Jin, Jingwei Zhang, Chen Wang, Jing Liu, Longteng Guo

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 NeuPAT是一种轻量架构无关框架,通过选择性保护语言敏感神经元、促进高可塑性神经元适配多模态,在11个语言基准上恢复了普通调优94.5%的语言能力下降,同时保持相当多模态性能,实现了能力保留型多模态大语言模型扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05872 2026-08-07 cs.CL cs.AI 新提交 87%

MACRO: Markov Chain Routing of Transformer Layers

MACRO:Transformer层的马尔可夫链路由

Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05050 2026-08-06 cs.CY cs.AI cs.CL 新提交 87%

The Effect of Perceived Race and Gender on Police Language Use: Experimental Evidence from VR Simulations

感知到的种族与性别对警察语言使用的影响:来自VR模拟的实验证据

Sandra C. Sandoval, Navita Goyal, Rashawn Ray, Long Doan, Rachel Rudinger, Hal Daumé

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过VR模拟实验发现,警察对黑人男性虚拟角色的说话恭敬程度更低,还探讨了LLM在ATE估计中的应用,推荐混合效应模型结合iptw方法,认为LLM相关技术需进一步完善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02678 2026-08-05 cs.CR cs.AI cs.LG 新提交 87%

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

DenialRAG:通过嵌入参数化弃权的单文档RAG污染攻击

Abay Zhurekbay, Tao Liu, Fan Li

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DenialRAG单文档RAG污染攻击,通过嵌入参数化弃权引导LLM生成错误答案,经多数据集、多模型及防御评估,其在Mistral-7B上攻击效果最优,凸显RAG污染风险的复杂性。

Comments Submit to ACSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-04 cs.CL cs.AI cs.CV 新提交 87%

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00010 2026-07-02 cs.IR cs.AI cs.CL 新提交 87%

Prompt Optimization for User Simulation in Conversational Recommender Systems: A Multi-Objective Framework

对话推荐系统中用户模拟的提示优化:一个多目标框架

Nipun B Nair, Tongtong Wu, Weiqing Wang

机构 * Monash University(莫纳什大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多目标框架自动优化LLM提示,以生成更真实、多样化的用户模拟行为,缓解对话推荐系统中的评估与数据获取难题。

Comments to be published in 2026 IEEE 42nd International Conference on Data Engineering Workshops (ICDEW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20764 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 87%

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Sun Yat-Sen University(中山大学) Technical University of Munich(慕尼黑工业大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Institute(慕尼黑数据研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-07-07 cs.CL cs.AI cs.LG 新提交 87%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, zhangliangxu, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31247 2026-07-01 cs.SD eess.AS 新提交 87%

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

FlexiSLM:一种动态可控帧率的语音语言模型

Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出FlexiSLM,首个支持动态可控帧率的语音语言模型,利用动态帧率表示在高质量点超越固定帧率7B模型,并在6.25 Hz时推理速度减半且保持高质量。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26050 2026-06-25 cs.LG cond-mat.dis-nn cs.AI cs.CL 新提交 87%

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

自然去突现:不对称控制哪些规则在预训练中幸存

Juliana Li, Diya Sreedhar

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 发现语言模型在预训练中学习规则后会自动遗忘,规则存亡由训练数据中支持频率决定,且遗忘不可逆。

Comments Foundations of Deep Generative Models (FoGen) Workshop at ICML 2026. 23 pages (5-page main text plus appendices), 5 figures. Code: https://github.com/lijuliana/Natural-Ungrokking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12149 2026-08-13 cs.CL 新提交 86%

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期

Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo

机构 * Startlux(星创公司) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) University of Sydney(悉尼大学) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL

AI总结 本研究系统揭示混合线性注意力大语言模型中大规模激活的两种形态,证实其在多架构、多配置等场景下的重复性,明确其对输出门控的响应规律及机制,为相关模型优化提供依据。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10239 2026-08-12 cs.AI 新提交 86%

Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction

超越检测:评估防御型大语言模型(LLM)在实时逐轮交互中对抗AI生成社会工程攻击的能力

Yuqiao Xu, Osama Zafar, Alexander Nemecek, Erman Ayday

专题命中 预训练与数据 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究构建含300例的在线住房语料库,评估5种防御型LLM在实时逐轮与静态设置下对抗AI社会工程攻击的能力,发现防御效果差异大,需单独测量干预等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09126 2026-08-11 cs.CL 新提交 86%

Subjective Multi-Bias Detection with Large Language Models

基于大语言模型的主观多偏见检测

Ruiyu Li, Zhiying Zhu

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本研究针对文本中的主观多偏见问题,采用大语言模型,在WIKIBIAS数据集上检测三类偏见,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08650 2026-08-11 cs.CL 新提交 86%

The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism

大语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行

Jiguo Li

专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL

AI总结 本技术综述梳理了大语言模型混合专家架构的演进,通过五个维度和四个控制平面分析关键技术,揭示其从激活稀疏参数到解耦路由、预算与执行的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05178 2026-08-07 cs.CY cs.AI 新提交 86%

Who Gets Access? Global Region and Academic Status Bias in AI-Generated Academic Gatekeeping Scenarios

谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差

Nouar AlDahoul, Hezerul Abdul Karim, Myles Joshua Toledo Tan

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07748 2026-07-10 cs.LG 新提交 86%

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据

Didula Samaraweera, Anjana Supun, Srinath Perera

机构 * WSO2

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。

Comments 11 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13517 2026-08-14 cs.CL cs.AI 新提交 86%

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub

Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16669 2026-07-21 cs.CL cs.LG cs.SE 新提交 86%

OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research

开放语言模型:用于教育和研究的可读且可组合的小语言模型预训练

Tavish Mankash, Vardhaman Kalloli, Keshava Prasad, Deepan Muthirayan

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 OpenLanguageModel是开源PyTorch库,用于构建和预训练小语言模型。其模型代码易读,能连接多种组件。通过追踪GPT - 2展示完整路径,含27个预设和文档。验证有高一致性和效率等成果,采用MIT许可,可多途径获取。

Comments 8 pages, 3 figures, and 1 table. Website: https://openlanguagemodel.github.io/openlanguagemodel/. Code: https://github.com/openlanguagemodel/openlanguagemodel

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11127 2026-06-10 cs.CL cs.AI 新提交 86%

Provenance-Grounded Gating and Adaptive Recovery in Synthetic Post-Training Data Curation

基于来源的门控与自适应恢复在合成后训练数据筛选中的应用

Soham Bhattacharjee, Karun Sharma, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs

专题命中 预训练与数据 :post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究合成后训练数据筛选中的来源证据门控与样本自适应恢复,提出结合故障诊断与定向再生成的自适应恢复流水线,提高产量、恢复率和注入召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11348 2026-08-13 cs.CR 新提交 86%

An Empirical Study of Output-to-Input Loops for Black-Box Backdoor Detection in Fine-Tuned Open-Weight LLMs

针对微调开源权重大语言模型的黑盒后门检测的输出-输入循环的实证研究

Md. Nahid Hasan, Mohammad Arif Hossain

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出self-feeding黑盒测试方法,通过将LLM自身输出反馈为输入检测后门,在6个开源权重LLM上实现高模型级检测精度,仅需文本级查询访问即可作为模型安全的低成本初查手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20346 2026-07-23 cs.CE physics.flu-dyn 新提交 86%

IteraSim RAG: A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM-Based Computational Fluid Dynamics

IteraSim RAG:基于OpenFOAM的计算流体动力学的多阶段检索增强智能后端

Pratyush Kumar

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对OpenFOAM配置CFD案例的难题,提出IteraSim RAG。通过LLM扩展查询、多种融合与重排策略及多智能体分工协作,结合规范知识层。在28个案例基准测试中表现良好,能完成配置、诊断修复问题,还公布相关内容以保障可重复性。

Comments 40 pages, 7 figures, 5 tables. Submitted to Computer Physics Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27559 2026-06-29 cs.IR 新提交 86%

A Sensitivity-Aware Test Collection for Search Among Personal Information

一种面向个人信息搜索的敏感性感知测试集

Jack McKechnie, Graham McDonald, Craig Macdonald

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 为解决个人信息搜索中的敏感信息泄露问题,构建了包含敏感与非敏感标注的Enron邮件子集测试集,通过众包和LLM扩展查询与相关性评估,并提供了基线性能。

Comments SIGIR 2026 Resource Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26127 2026-06-26 cs.SI cs.CR 新提交 86%

Account-History Features for Social Bot Detection in the Era of Large Language Models

大语言模型时代社交机器人检测中的账户历史特征

Gaurang Katyal

专题命中 预训练与数据 :language model(title,abstract);large language model(title)

AI总结 针对大语言模型可生成类人文本导致内容特征失效的问题,提出利用攻击者难以低成本操纵的账户历史特征(如账户年龄、粉丝数等),在随机森林模型上实现ROC-AUC 0.977,显著优于纯内容基线,且对对抗性文本改写具有鲁棒性。

Comments Code and result tables: https://github.com/gaurangkatyal/behavioral-bot-detection (Zenodo DOI: 10.5281/zenodo.20358445)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08885 2026-08-11 physics.soc-ph cs.CL cs.SD 新提交 85%

Towards an LLM-based method for quantifying the sexual content in song lyrics

面向基于大语言模型的歌曲歌词性内容量化方法

Ignacio M. Sticco

专题命中 预训练与数据 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的可复现方法,量化歌曲歌词主题内容(含性内容),并将其应用于12位雷鬼顿艺术家的1259首歌曲,还发布相关代码与语料库供他人复现或扩展。

Comments 17 pages, 10 figures. Code, scoring prompt, and corpus: https://github.com/ignaciosticco/open-lyrics-scorer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05447 2026-08-07 cs.CL 新提交 85%

Example-Guided Prompting for Document-Level Text Simplification

示例引导提示用于文档级文本简化

Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber

机构 * SCE(SCE(以色列SCE学院)) ScaDS.AI, TUD Dresden(ScaDS.AI,德累斯顿工业大学)

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对文档级文本简化中提示指导不足的问题,提出示例引导提示方法,经OneStopEnglish语料库实验,可提升大语言模型的简化质量,性能优于或媲美相关基准系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16072 2026-07-20 cs.CL 新提交 85%

Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D

前沿语言模型在复制方面存在困难:文本可在二维视角下得到更好理解

Haodong Wen, Yiran Zhang, Yingfa Chen, Kaifeng Lyu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 研究发现前沿语言模型复制输入字符串存在困难,归因于Transformer架构位置编码问题。为此引入2D-RoPE,将文本组织成二维网格,使复制任务更易学习。实验表明其在复制任务上优势明显,有助于语言建模,鼓励探索二维位置编码潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04927 2026-07-07 cs.RO cs.AI 新提交 85%

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

DSWAM:用于细粒度机器人操作的双系统世界行动基础模型

Jian Zhu, Jianjun Zhang, Taiyi Su, Tianbin Liu, Zhangyuan Wang, Kai Xie, Zitai Huang, Chong Ma, Youzhang He, Tianjian Wang, Hanyang Wang, Weihao Ding, Yi Xu

机构 * AIRC, Midea Group(美的集团美云智数) Tongji University(同济大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.AI

AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27275 2026-06-26 cs.CL cs.DL 新提交 85%

How Surprising Is Historical Italian to Language Models? Tokenization Tax, Comprehension Tax, and a Simple Mitigation

历史意大利语对语言模型有多令人惊讶?分词税、理解税以及一种简单的缓解方法

Maria Levchenko

机构 * University of Bologna(博洛尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出一个诊断框架,将历史语言难度分解为分词成本、预测不确定性、语义鲁棒性和上下文敏感性四个维度,通过17世纪意大利语等数据集评估,发现历史文本存在分词税但语义表示鲁棒,并证明简单的时间上下文提示可将历史意外性降低约60%。

Comments The 22nd Conference on Information and Research Science Connecting to Digital and Library Science

详情

展开后加载摘要…

URL PDF HTML 收藏