arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 56 篇

2511.21613 2026-04-21 cs.CL cs.AI cs.LG 94%

Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining

超越URLs:元数据多样性与位置对高效LLM预训练的影响

Dongyang Fan, Diba Hashemi, Sai Praneeth Karimireddy, Martin Jaggi

机构 * EPFL(苏黎世联邦理工学院) University of Southern California(南加州大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了元数据类型对LLM预训练的影响,发现细粒度文档质量指标能提升训练效率,并提出元数据追加方法以加速预训练过程。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01801 2026-04-21 cs.CL 93%

Detecting LLM-Generated Spam Reviews by Integrating Language Model Embeddings and Graph Neural Network

通过整合语言模型嵌入和图神经网络检测LLM生成的垃圾评论

Xin Liu, Rongwu Xu, Xinyi Jia, Jason Liao, Jiao Sun, Ling Huang, Wei Xu

机构 * Tsinghua University(清华大学) University of British Columbia(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :LLM(title,title_cn);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出FraudSquad模型,结合预训练语言模型嵌入和门控图变压器,有效检测LLM生成的垃圾评论,实验表明其在精度和召回率上优于现有方法,且模型规模小,训练数据需求低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16380 2026-04-21 cs.CL cs.LG 93%

Data Mixing for Large Language Models Pretraining: A Survey and Outlook

大型语言模型预训练中的数据混合:综述与展望

Zhuo Chen, Yuxuan Miao, Supryadi, Deyi Xiong

机构 * The International Joint Institute of Tianjin University(天津大学国际联合研究院) Tianjin University(天津大学) TJUNLP Lab, School of Computer Science and Technology(天津大学自然语言处理实验室,计算机科学与技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文综述了大型语言模型预训练中的数据混合方法,分析了静态与动态混合的分类及其性能成本权衡,指出领域迁移性、评估标准不统一等挑战,并提出未来研究方向。

Comments 41 pages, 4 figures, 1 table

Journal ref Data Intelligence 8 (2026), Art. No. 2026r01

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07825 2026-04-21 cs.IR cs.AI 92%

Filling the Gaps: Selective Knowledge Augmentation for LLM Recommenders

填补空白:面向LLM推荐系统的选择性知识增强

Jaehyun Lee, Sanghwan Jang, SeongKu Kang, Hwanjo Yu

机构 * Pohang University of Science and Technology(釜山科学技术大学) Korea University(韩国大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出KnowSA_CKP方法,通过选择性注入知识来缓解LLM推荐中的知识差距问题,提升推荐准确性和上下文效率。

Comments Accepted to SIGIR 2026 full papers track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16555 2026-04-21 cs.LG cs.AI cs.CV 92%

LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search

将LLM作为工具而非代理:基于代码挖掘的树变换用于神经架构搜索

Masakazu Yoshimura, Zitang Sun, Yuiko Sakuma, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团公司)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMasTool框架,通过树变换实现稳定且开放的模型进化,避免LLM的固有偏差,提升NAS在CIFAR-10、CIFAR-100和ImageNet16-120上的性能。

Comments 72 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18027 2026-04-21 cs.SE cs.CL 89%

CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora

CodePivot: 通过强化学习无需平行语料库提升LLM的多语言转译

Shangyu Li, Juyong Jiang, Meibo Ren, Sizhe Zhong, Huiri Tan, Yunhao Gou, Xu Han, Chun Yong Chong, Yun Peng, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Monash University(莫纳什大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CodePivot通过Python作为中间表示和Aggressive-Partial-Functional奖励机制,无需平行语料库提升LLM的多语言转译能力,在10种编程语言上实验显示其在通用和低资源语言转译任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07248 2026-04-21 cs.CL 89%

Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models

不要为小型语言模型适应工具;而是将工具模式适应模型

Jonggeun Lee, Woojung Song, Jongwook Han, Haesung Pyun, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出PA-Tool方法,通过调整工具模式以匹配预训练知识,提升小型语言模型在工具使用任务中的准确性,实验显示性能提升达17%。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16423 2026-04-21 cs.LG cs.AI 89%

Shifting the Gradient: Understanding How Defensive Training Methods Protect Language Model Integrity

梯度偏移:理解防御性训练方法如何保护语言模型完整性

Satchel Grant, Victor Gillioz, Jake Ward, Thomas McGrath

机构 * Stanford University(斯坦福大学) MATS

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 本文通过对比PPS和IP两种防御性训练方法,揭示其在保护语言模型完整性上的不同机制,发现PPS通过调整激活梯度抑制特质表达,而IP则通过解释数据中的特质表达来减少预测损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16422 2026-04-21 cs.CL cs.AI cs.LG 89%

Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG

将结构化生物医学知识注入语言模型:持续预训练与GraphRAG

Jaafer Klila, Sondes Bannour Souihi, Rahma Boujelben, Nasredine Semmar, Lamia Hadrich Belguith

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过持续预训练和GraphRAG两种方法将结构化生物医学知识注入语言模型,提升其在生物医学领域的表现,实验显示BERTUMLS在知识密集型问答任务中表现优异,GraphRAG在PubMedQA和BioASQ上提升显著。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18381 2026-04-21 cs.AI cs.LG 88%

Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

在数据较少的情况下:评估RLVR在低数据和计算环境下的有效性

Justin Bauer, Thomas Walshe, Derek Pham, Harit Vishwakarma, Armin Parchami, Frederic Sala, Paroma Varma

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在低数据和计算资源下,RLVR对小型语言模型性能的影响,发现混合复杂度数据集能显著提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02850 2026-04-21 cs.CL cs.CR cs.LG 88%

LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users

LLM催眠:利用用户反馈进行未经授权的知识注入以影响所有用户

Almog Hilel, Riddhi Bhagwat, Idan Shenfeld, Jacob Andreas, Leshem Choshen

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示语言模型通过用户反馈进行知识注入的漏洞,通过反馈信号可操控模型行为,导致事实错误、代码漏洞和虚假新闻。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02370 2026-04-21 cs.CL cs.AI 88%

How Training Data Shapes the Use of Parametric and In-Context Knowledge in Language Models

训练数据如何塑造语言模型中参数知识和上下文知识的使用

Minsung Kim, Dong-Kyum Kim, Jea Kwon, Nakyeong Yang, Kyomin Jung, Meeyoung Cha

机构 * Seoul National University(首尔国立大学) Max Planck Institute for Security and Privacy(安全与隐私研究所)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究通过合成语料库实验,发现语言模型在处理参数知识和上下文知识时,需同时存在文档内重复、适度不一致和知识分布偏斜等特性才能实现稳健平衡的使用。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06056 2026-04-21 cs.CL cs.AI 88%

Data Compressibility Quantifies LLM Memorization

数据压缩性量化大语言模型的记忆性

Yizhan Huang, Zhe Yang, Meifang Chen, Huang Nianchen, Jianping Zhang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Meta

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过数据压缩性量化大语言模型的记忆性,发现集级别指标能揭示熵与记忆性之间的线性关系。

Comments accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20760 2026-04-21 cs.CL cs.AI 88%

Attributing Culture-Conditioned Generations to Pretraining Corpora

将文化条件化生成归因于预训练语料

Huihan Li, Arnav Goel, Keyu He, Xiang Ren

机构 * University of Southern California(南加州大学) IIIT Delhi(德里印度理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析预训练数据模式,探讨预训练如何导致文化条件化生成的偏差,提出MEMOed框架以识别记忆化生成,并发现高频文化生成更多记忆符号,而低频文化则无生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17408 2026-04-21 cs.AI cs.LG 87%

The Impact of Off-Policy Training Data on Probe Generalisation

偏离策略训练数据对探测泛化的影响

Nathalie Kirch, Samuel Dower, Adrians Skapars, Helen Yannakoudakis, Ekdeep Singh Lubana, Dmitrii Krasheninnikov

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) LASR Labs(LASR实验室) University of Manchester(曼彻斯特大学) Goodfire AI University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了偏离策略训练数据对八个不同LLM行为探测泛化的影响,发现训练策略显著影响探测性能,尤其在涉及响应意图的行为上表现更差,并提出预测泛化失败的测试方法。

Comments 10 pages, ACL 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO 87%

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17930 2026-04-21 cs.CL cs.AI cs.LG 87%

Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?

形式语言能力异质性:数据是否是真正的瓶颈?

H S V N S Kowndinya Renduchintala, Sumit Bhatia

机构 * Adobe Inc.(Adobe公司) Media and Data Science Research(媒体与数据科学研究)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨语言模型在形式语言能力上的差异是否源于架构限制或数据稀缺,通过干预性数据增强显著提升了模型在8个最差BLiMP任务上的表现。

Comments ACL'26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17001 2026-04-21 cs.CL 86%

Vocab Diet: Reshaping the Vocabulary of LLMs via Vector Arithmetic

词汇饮食:通过向量运算重塑大语言模型的词汇

Yuval Reif, Guy Kaplan, Roy Schwartz

机构 * The Hebrew University of Jerusalem(海法大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出通过向量运算重塑LLM词汇,利用变换向量替代单一词表,减少词汇槽位占用,提升多语言覆盖和多样性,同时保持下游性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17398 2026-04-21 cs.CL 84%

Contrastive Analysis of Linguistic Representations in Large Language Model Outputs through Structured Synthetic Data Generation and Abstracted N-gram Associations

通过结构化合成数据生成和抽象n-gram关联对大规模语言模型输出中的语言表示进行对比分析

S. A. Desimone, L. Alonso Alemany

机构 * Universidad Nacional de Córdoba(国家科罗纳大学) CONICET

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出一种通过对比合成文本生成和统计分析发现不同社会群体关联语言和论述模式的方法,重点在于识别细微的偏见表达而非预定义词汇列表诊断偏见,利用上下文数据进行分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10370 2026-04-21 cs.CV cs.AI cs.LG 84%

SHRUG-FM: Reliability-Aware Foundation Models for Earth Observation

SHRUG-FM:面向地球观测的可靠性感知基础模型

Maria Gonzalez-Calabuig, Kai-Hendrik Cohrs, Vishal Nedungadi, Zuzanna Osika, Ruben Cartuyvels, Steffen Knoblauch, Joppe Massant, Shruti Nath, Patrick Ebel, Vasileios Sitokonstantinou

机构 * Universitat de València(瓦伦西亚大学) Wageningen University & Research(瓦赫宁根大学与研究所) Delft University of Technology(代尔夫特理工大学) European Space Agency(欧洲航天局) Heidelberg University(海德堡大学) Ghent University(根特大学) University of Oxford(牛津大学) Google Research(谷歌研究)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SHRUG-FM框架,通过整合三种互补信号提升地球观测基础模型的可靠性,实验证明其在高风险任务中有效降低预测风险。

Comments Accepted for proceedings at CVPR EarthVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18611 2026-04-21 cs.LG cs.AI 84%

Flow marching for a generative PDE foundation model

基于生成PDE基础模型的流推进

Zituo Chen, Sili Deng

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Flow Marching算法,结合物理动力学误差分析,构建生成PDE基础模型,通过联合采样噪声和时间步长,学习统一速度场以减少长期漂移并实现不确定性感知的生成。同时引入P2VAE和FMT提升效率,实现大规模预训练。

Comments This work has been substantially expanded and superseded by arXiv:2602.11229

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16570 2026-04-21 cs.LG cs.AI 84%

In Search of Lost DNA Sequence Pretraining

寻找丢失的DNA序列预训练

Zhijiang Tang, Jiaxin Qi, Yan Cui, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示了DNA预训练中三个关键问题:下游数据集不恰当、邻域遮蔽策略缺陷及词汇讨论不足,并提出评估标准、任务设计指导和词汇分析,通过实验验证问题重要性,最终提出标准化测试平台以推动基因组基础模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04804 2026-04-21 cs.CL cs.AI cs.IR cs.LG cs.MA 83%

SkillX: Automatically Constructing Skill Knowledge Bases for Agents

SkillX: 为智能体自动构建技能知识库

Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng

机构 * Zhejiang University(浙江大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SkillX通过多级技能设计、迭代技能精炼和探索性技能扩展,构建可复用的技能知识库,提升智能体在长周期任务中的表现和泛化能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03535 2026-04-21 cs.SE 83%

Across Programming Language Silos: A Study on Cross-Lingual Retrieval-augmented Code Generation

跨越编程语言壁垒:关于跨语言检索增强型代码生成的研讨

Qiming Zhu, Jialun Cao, Xuanang Chen, Weili Zhang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Shing-Chi Cheung

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了跨语言检索增强型代码生成中的知识转移,通过构建13种编程语言的14000个实例数据集,发现跨语言知识转移非 trivial,且依赖语言亲和力和预训练语料多样性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21686 2026-04-21 cs.CL cs.AI cs.LG 83%

Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework

矩阵:基于点对点的多智能体合成数据生成框架

Dong Wang, Yang Li, Ansong Ni, Ching-Feng Yeh, Youssef Emad, Xinjie Lei, Liam Robbins, Karthik Padthe, Hu Xu, Xian Li, Asli Celikyilmaz, Ramya Raghavendra, Lifei Huang, Carole-Jean Wu, Shang-Wen Li

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Matrix框架,通过去中心化设计实现多智能体协同生成高质量、多样化的合成数据,提升数据生成效率2-15倍,适用于多智能体对话、网络推理数据提取等场景。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15353 2026-04-21 cs.CL 83%

Establishing a Scale for Kullback-Leibler Divergence in Language Models Across Various Settings

在不同设置中为语言模型建立KL散度量表

Ryo Kishino, Yusuke Takase, Momose Oyama, Hiroaki Yamagiwa, Hidetoshi Shimodaira

机构 * Kyoto University(京都大学) RIKEN(日本科学技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文通过扩展log-likelihood空间,建立统一的KL散度量表,分析预训练轨迹显示log-likelihood空间变化比权重空间更小,导致学习轨迹亚扩散并早稳定语言模型行为。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23807 2026-04-21 cs.AI cs.CV 83%

Beyond the Failures: Rethinking Foundation Models in Pathology

超越失败:重新思考病理学中的基础模型

Hamid R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence and Informatics, Mayo Clinic, Rochester, MN, USA(Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 病理学中基础模型表现不佳,需设计专门处理生物图像的模型,而非通用自然图像方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11983 2026-04-21 cs.LG math.OC 83%

Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training

大规模矩阵优化中的低秩正交化:应用于基础模型训练

Chuan He, Zhanwang Deng, Zhaosong Lu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出低秩正交化方法,通过利用神经网络训练中的梯度低秩特性,改进矩阵正交化以提升基础模型训练性能,理论分析了低秩MSGD和低秩Muon的迭代复杂度。

Comments 20 pages, add numerical comparison with Galore and SOAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06048 2026-04-21 cs.CL cs.CV 81%

Vision-Braille: A Curriculum Learning Toolkit and Braille-Chinese Corpus for Braille Translation

Vision-Braille: 一种课程学习工具包及用于盲文翻译的盲文-中文语料库

Alan Wu, Ye Yuan, Zhiping Xiao, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(多媒体信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学) College of Agriculture and Life Sciences, Cornell University(农业与生命科学学院,康奈尔大学) Computer Science Department, University of California at Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出Vision-Braille,首个可公开获取的端到端系统,用于将图像中提取的中文盲文翻译成书面中文。该系统解决有限标注资源和声调缺失问题,结合鲁棒的盲文OCR流程与针对序列到序列翻译微调的LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17814 2026-04-21 cs.CR cs.AI 81%

Understanding Secret Leakage Risks in Code LLMs: A Tokenization Perspective

理解代码大语言模型中的秘密泄露风险:从分词角度出发

Meifang Chen, Zhe Yang, Huang Nianchen, Yizhan Huang, Yichen Li, Zihan Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 研究揭示代码大语言模型中因分词方式导致的秘密泄露问题,指出BPE分词引发的'垃圾话偏差'现象,并探讨其成因及缓解策略。

Comments Accepted by ACL 26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏