arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-26 至 2026-06-26 共收录 203 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2606.26127 2026-06-26 cs.SI cs.CR 新提交 86%

Account-History Features for Social Bot Detection in the Era of Large Language Models

大语言模型时代社交机器人检测中的账户历史特征

Gaurang Katyal

专题命中 预训练与数据 :language model(title,abstract);large language model(title)

AI总结 针对大语言模型可生成类人文本导致内容特征失效的问题,提出利用攻击者难以低成本操纵的账户历史特征(如账户年龄、粉丝数等),在随机森林模型上实现ROC-AUC 0.977,显著优于纯内容基线,且对对抗性文本改写具有鲁棒性。

Comments Code and result tables: https://github.com/gaurangkatyal/behavioral-bot-detection (Zenodo DOI: 10.5281/zenodo.20358445)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27275 2026-06-26 cs.CL cs.DL 新提交 85%

How Surprising Is Historical Italian to Language Models? Tokenization Tax, Comprehension Tax, and a Simple Mitigation

历史意大利语对语言模型有多令人惊讶?分词税、理解税以及一种简单的缓解方法

Maria Levchenko

机构 * University of Bologna(博洛尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出一个诊断框架,将历史语言难度分解为分词成本、预测不确定性、语义鲁棒性和上下文敏感性四个维度,通过17世纪意大利语等数据集评估,发现历史文本存在分词税但语义表示鲁棒,并证明简单的时间上下文提示可将历史意外性降低约60%。

Comments The 22nd Conference on Information and Research Science Connecting to Digital and Library Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27242 2026-06-26 cs.LG cs.CL stat.ML 新提交 82%

The Geometry of Updates: Fisher Alignment at Vocabulary Scale

更新的几何:词汇规模下的Fisher对齐

John Sweeney

机构 * Sideplane AI

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对共享词汇的LLM家族,提出FisherSketch方法,通过核均值嵌入的余弦相似度估计Fisher对齐,实现词汇规模下的高效源选择,并揭示激活、误差及耦合因素。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306. 64 pages total (main paper plus appendix), 4 figures, 29 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27100 2026-06-26 q-fin.MF 新提交 82%

Pretrained Time-Series Foundation Models for Financial Return Forecasting

用于金融收益预测的预训练时间序列基础模型

Miquel Noguer I Alonso, Rodolfo Pereira Franklin

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文在保守的金融设置下,基准测试预训练时间序列基础模型(TSFMs)与从头训练的神经基线,发现TSFMs在排名上占优,但相对于随机游走基准的预测提升微弱且稀疏,表明TSFMs作为实用先验可降低模型开发成本,但并非统计可靠的alpha生成引擎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26467 2026-06-26 cs.LG 新提交 80%

A Causal Foundation Model for Structure and Outcome Prediction

用于结构与结果预测的因果基础模型

Max Zhu, Martino Mansoldo, Ching-Hao Wang, Stefan Groha

机构 * University of Cambridge, United Kingdom(英国剑桥大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 提出TabPFN-CFM,一种能处理多种因果问题的因果基础模型,从观测数据预测因果结构和结果,支持Pearl因果层次所有三层查询,在合成数据上训练并泛化到真实数据,优于结构和结果预测基线。

Comments 20 pages, 7 figures, 17 tables, 43rd ICML Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27080 2026-06-26 cs.SE 新提交 80%

ATGBuilder: Feature-Assisted Graph Learning for Activity Transition Graph Construction with Seed Supervision

ATGBuilder: 基于特征辅助图学习的活动转换图构建与种子监督

Chenhui Cui, Zixiang Xian, Danyu Li, Tao Li, Rubing Huang, Dave Towey, Shikai Guo, Jiakun Liu

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ATGBuilder,利用大语言模型总结UI布局元数据,并将控件触发信息建模为边属性,通过辅助重构目标进行图学习,在种子监督下构建高质量活动转换图,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14122 2026-06-26 cs.CL 新提交 79%

Beyond Perplexity: UTF-8 Validity in Byte-aware Language Models

超越困惑度:字节感知语言模型中的 UTF-8 有效性

Sangwhan Moon, Daisuke Oba, Youmi Ma, Tatsuya Hiraoka, Naoaki Okazaki

机构 * University of Tokyo(东京大学) National Institute of Information and Communications Technology(信息通信技术国家研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究字节级分词语言模型生成无效UTF-8序列的问题,通过多语言训练实验发现UTF-8有效性收敛比困惑度慢约一倍,且罕见字符结构有效性更高,表明可靠UTF-8生成是需要单独评估的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交 75%

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn)

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27304 2026-06-26 cs.LG 新提交 57%

A Multi-Fidelity Convolutional Autoencoder-Transfer Learning Framework for Guided-Wave-Based Damage Diagnosis Using Large Simulated and Limited Experimental Datasets

基于多保真卷积自编码器-迁移学习框架的导波损伤诊断:利用大规模仿真与有限实验数据

Santosh Kapuria, Abhishek

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出多保真迁移学习框架,结合轻量物理仿真、卷积自编码器深度特征学习和少量实验数据,实现板结构损伤定位与尺寸估计,R²分别超0.93和0.99。

Comments 19 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27014 2026-06-26 cs.LG 新提交 57%

A Generalization Theory for JEPA-Based World Models

基于JEPA的世界模型的泛化理论

Jingyi Cui, Qi Zhang, Hongwei Wen, Yisen Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) University of Sydney(悉尼大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26734 2026-06-26 cs.CV cs.AI 新提交 57%

Robust Onion: Peeling Open Vocab Object Detectors Under Noise

鲁棒洋葱:在噪声下剖析开放词汇目标检测器

Priyank Pathak, Mukilan Karuppasamy, Aaditya Baranwal, Shruti Vyas, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学人工智能研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 通过受控合成视觉退化逐层分析开放词汇目标检测器,发现视觉骨干相似时鲁棒性主要由图像域决定,并提出轻量级方法提升真实场景鲁棒性。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27084 2026-06-26 cs.CV eess.IV 新提交 50%

Pseudo-Text-Conditioned 3D Grounding DINO for Organ Localization in Abdominal CT

伪文本条件3D Grounding DINO用于腹部CT器官定位

Siqi Chen, Han Gong, Keyi Hou, Jingxuan Yang, Sheethal Bhat, Andreas Maier

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出CT-3GDINO,一种轻量级3D检测器,通过冻结伪文本类令牌替代真实文本编码器,实现腹部CT中五个器官的定位,在193个体积上达到0.5830 mAP。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26800 2026-06-26 cs.RO 新提交 50%

SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation

SSI-Policy: 学习用于视觉语言机器人操作的结构化场景接口

Kaijun Wang, Zikai Ouyang, Xuping Wu, Jinyi Hong, Wei Pan, Haibo Lu, Jia Pan, Wei Zhang, Linfang Zheng

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) LimX Dynamics

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出SSI-Policy框架,通过统一的结构化场景接口(SSI)联合编码单目深度、语言锚定的物体布局和指令条件化的2D运动轨迹,实现从少量演示中学习机器人操作,在LIBERO基准上仅用10个演示即提升15%性能。

Comments Accepted by 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 17 篇

2606.26982 2026-06-26 cs.CL cs.AI 新提交 88%

Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions

审计心理健康交互中大语言模型的框架敏感行为不稳定性

Abla Bedoui, Ashley L. Greene, Mohammed Cherkaoui

机构 * a School of computer science, digital engineering and AI, Long Island University, Brooklyn, NY, USA(a 计算科学与数字工程及人工智能学院,罗格斯大学,布鲁克林,纽约,美国) b Department of Psychology, Long Island University, Brooklyn, NY, USA(b 心理学系,罗格斯大学,布鲁克林,纽约,美国)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过控制匹配提示,调查大语言模型在不同上下文框架下的行为变异性,发现框架系统性改变解释响应倾向,且内部表征可解码,激活操控可部分调节行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26350 2026-06-26 cs.AI cs.LG 新提交 88%

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 指令微调 :LLM(summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27210 2026-06-26 cs.CL 新提交 87%

Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes

以真实意图铺路:意图感知训练提升跨训练机制下的LLM安全分类

Jeremias Ferrao, Niclas Müller-Hof, Iustin Sîrbu, Traian Rebedea, Yftah Ziser

机构 * University of Groningen(格罗宁根大学) University Politehnica of Bucharest(布加勒斯特理工大学) NVIDIA(英伟达)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 提出意图感知训练方法,通过显式建模用户意图信号提升安全分类器鲁棒性,在多个训练机制下取得最优平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11502 2026-06-26 cs.CL cs.AI 新提交 87%

When Role-playing, Do Models Believe What They Say?

角色扮演时,模型是否相信它们所说的话?

Benjamin Sturgeon, David Africa, Sid Black

机构 * MATS

专题命中 指令微调 :LLM(summary_cn,abstract_cn);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 通过线性真实探针研究角色扮演对LLM内部表征的影响,发现角色扮演主要改变输出而非内部真实表征,而紧急错位则更显著地改变内部表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26806 2026-06-26 cs.AI cs.LG 新提交 81%

Memory Depth, Not Memory Access: Selective Parametric Consolidation for Long-Running Language Agents

记忆深度,而非记忆访问:面向长时间运行语言代理的选择性参数巩固

Haoliang Han

专题命中 指令微调 :language agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出选择性参数巩固机制EVAF,通过惊奇和效价门控的LoRA写入,在长时间运行中维持目标导向行为,与检索互补,实验显示在目标持久性上优于检索。

Comments Main paper with supplementary material included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26432 2026-06-26 cs.LG econ.EM 新提交 79%

Embedding Foundation Model Predictions in Discrete-Choice Models with Structural Guarantees

具有结构保证的嵌入基础模型预测的离散选择模型

Yingshuo Wang, Xian Sun, Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * University of California, Berkeley(加州大学伯克利分校) Duke University(杜克大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出两阶段适配器,将基础模型的预测嵌入多项Logit效用中,通过符号约束保持边际替代率,在三个数据集上平均提升6.4个百分点准确率,并保证成本单调性和合理时间价值。

Comments Extends arXiv:2605.26559 (ICML 2026 FMSD Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26578 2026-06-26 cs.AI 新提交 77%

EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling

EvoOptiGraph:基于图结构生成的弱点驱动协同进化优化建模

Qingcan Kang, Mingyang Liu, Xiaojin Fu, Shixiong Kai, Tao Zhong, Mingxuan Yuan

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 提出EvoOptiGraph框架,通过图结构表示混合整数线性规划并应用进化算子生成多样实例,结合监督微调和强化学习实现数据与模型的协同进化,显著提升优化建模的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25450 2026-06-26 cs.LG cs.CL 新提交 73%

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

泛化谱:一种评估学习算法的色谱方法

Jinghan Zhang, Zerui Cheng, Shiqi Chen, Ge Zhang, Wenhao Huang, Jiashuo Liu, Junxian He, Tianle Cai

机构 * ByteDance Seed(字节跳动Seed) Hong Kong University of Science and Technology(香港科技大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出泛化谱框架,通过构建从精确回忆到跨语言实现转移等不同转移距离的测试变体,揭示算法从单个样本泛化到其他样本的程度,并应用于竞争编程任务评估不同学习范式。

Comments Accepted at ICML 2026. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21097 2026-06-26 cs.CL cs.LG 新提交 73%

GRAG: Generic Response-Augmented Generation Framework for Personalized Conversational Systems

GRAG:面向个性化对话系统的通用响应增强生成框架

Junfeng Liu, Christopher T. Symons, Ranga Raju Vatsavai

机构 * North Carolina State University(北卡罗来纳州立大学) Lirio, Inc.(Lirio公司)

专题命中 指令微调 :LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GRAG框架,通过离线通用响应解耦内容基础与个性化,使小模型在资源受限环境中专注于个性化注入,性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26942 2026-06-26 cs.CV 新提交 71%

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

TraMP-LLaMA: 基于解耦指令微调的生成式可解释性用于面部表情质量评估

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

机构 * School of Computer Science University of Bristol(布里斯托大学计算机科学学院) Translational Health Sciences University of Bristol(布里斯托大学转化健康科学学院) School of Computing and Communications Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 指令微调 :instruction tuning(title)

AI总结 提出TraMP-LLaMA多模态框架,融合外观和轨迹特征,采用解耦指令微调策略,联合预测严重度并生成结构化文本报告,在PFED5-plus数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26379 2026-06-26 cs.CV 新提交 71%

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

基于可微搜索的视觉基础模型层特定提示融合发现

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

机构 * UAB(阿拉巴马大学伯明翰分校) CMU(卡内基梅隆大学) Tulane(杜兰大学) UMKC(密苏里大学堪萨斯分校) UGA(佐治亚大学) ORNL(橡树岭国家实验室)

专题命中 指令微调 :foundation model(title)

AI总结 研究视觉提示微调中提示与图像令牌的融合方案,提出可微架构搜索方法联合优化可学习提示及其融合方式,在34个数据集上取得一致提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26987 2026-06-26 cs.CL cs.AI 新提交 62%

Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs

模型在哪里找到幸福?开源大语言模型中的情感向量

Sinie van der Ben, Raphaël Baur, Yannick Metz, Mennatallah El-Assady

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在开源模型中复现情感向量,发现效价几何结构在层间分布存在差异,且唤醒度编码受语料影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26620 2026-06-26 cs.LG cs.AI 新提交 62%

Discovering Millions of Interpretable Features with Sparse Autoencoders

利用稀疏自编码器发现数百万可解释特征

XinYang He, Wei Wang, Bing Zhao, Xuan Ren, WenBo Li, WeiXu Qiao, Hu Wei, Lin Qu

机构 * AI DATA, Alibaba Group Holding Limited(阿里巴巴集团控股有限公司 AI DATA) Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Qwen3-Instruct SAE,在Qwen3指令微调模型系列上训练稀疏自编码器,通过激活级和模型级评估揭示稀疏性-保真度权衡,并展示其在拒绝行为引导中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26290 2026-06-26 cs.LG cs.AI 新提交 62%

SSM Adapters via Hankel Reduced-order Modeling: Injection Site Determines Task Suitability in Long-Context Fine-Tuning

通过Hankel降阶建模的SSM适配器:注入位置决定长上下文微调中的任务适用性

Omanshu Thapliyal

机构 * Hitachi America Ltd.(日立美洲有限公司)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Hankel降阶模型(HRM)适配器,一种基于SSM的残差模块,通过平衡截断初始化,在长上下文任务中优于LoRA,并支持FFT并行扫描。

Comments 14 pages, 12 figures, HiLD Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26112 2026-06-26 cs.CL cs.AI 新提交 62%

From Lexicon to AI: A Structured-Data Pipeline for Specialized Conversational Systems in Low-Resource Languages

从词汇到AI:低资源语言中专有对话系统的结构化数据流水线

Siddhant Hitesh Mantri, Dhara Gorasiya, Malhar Kulkarni, Pushpak Bhattacharya

机构 * NMIMS, Mumbai(NMIMS孟买分校) CFILT, IIT Bombay(印度理工学院孟买分校CFILT)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用专家编纂的词汇数据库(如印地语WordNet)生成指令对,微调12B参数语言模型,构建低资源语言专用对话系统,在教育任务中效果优于通用模型。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27091 2026-06-26 cs.CR cs.AI 新提交 57%

Inherited Circuits, Learned Semantics: How Fine-Tuning Creates Evasion Vulnerabilities Invisible to Standard Evaluation

继承的电路,学习的语义:微调如何创建标准评估不可见的规避漏洞

Ryan Fetterman

机构 * Cisco Talos(思科 Talos)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.AI

AI总结 研究微调如何引入安全分类模型的规避漏洞,通过因果干预定位继承电路,提出预部署监测方法,发现微调扩展了规避面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26618 2026-06-26 cs.CL 新提交 57%

Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

缩小低资源文本转语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调

Phannet Pov, Sovandara Chhoun, Hyun Woo Park, Wan-Sup Cho, Saksonita Khoeurn

机构 * Department of Big Data, Chungbuk National University(Chungbuk National University大数据系) Institute of Digital Research and Innovation, Cambodia Academy of Digital Technology(柬埔寨数字技术研究院) Department of Management Information Systems, Chungbuk National University(Chungbuk National University管理信息系) BigData Labs Co., Ltd.(BigData Labs公司)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 针对高棉语和韩语,使用LoRA微调VoxCPM2模型,在仅训练0.19%-3.03%参数的情况下,高棉语MOS从3.85提升至4.23,而韩语无提升,表明适配主要帮助基础模型表现差的语言。

Comments 5 pages, 1 figure, 4 tables. IEEE conference format (IEEEtran)

详情

展开后加载摘要…

URL PDF HTML 收藏