arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 10821 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2607.26389 2026-07-30 cs.CL cs.AI 新提交 62%

Misalignment Has a Personality: A Big Five Account of Emergent Misalignment

错位具有人格特质:对涌现错位的大五人格解释

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出用大五人格向量解释语言模型微调引发的错位,发现错位语料具特定人格特征,该向量可诊断安全现象且能捕捉单一方向无法识别的谄媚特质。

Comments The paper is currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25169 2026-07-29 cs.LG cs.AI 新提交 62%

CondPSE: A Polynomial-Filtered Structural Encoder with Conditional Modulation for Graphs

CondPSE:一种具有条件调制的多项式滤波结构编码器用于图

Woohyun Lee, Hogun Park

机构 * Sungkyunkwan University(成均馆大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对消息传递图神经网络局限,提出CondPSE编码器,用多项式图滤波器组和条件调制处理节点探针,预训练后冻结用作下游输入编码。在合成基准上提升结构判别准确率,在分子性质预测中与GPSE相当,探讨了其优势及局限性。

Comments Accepted as a poster at the 2nd Frontiers in Graph Machine Learning for the Large Model Era (GMLLM'26), a KDD 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24745 2026-07-29 cs.IR cs.AI cs.CL cs.CV 新提交 62%

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

DocAnnot——利用生成式人工智能驱动的自动注释加速关键信息提取数据集的创建

Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对关键信息提取中训练数据集创建耗时的问题,提出DocAnnot框架,利用大型视觉语言模型、OCR及SICM算法,在基准测试中自动生成注释有一定F1分数,还能用于微调下游模型,大幅节省时间成本,减少人工依赖但未完全消除人工干预。

Comments 15 pages, 2 figures

Journal ref Proc. ICDAR 2025, Lecture Notes in Computer Science, vol 16025, Part III, pp. 563-576

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22615 2026-07-28 q-bio.NC cs.AI cs.LG cs.NE 新提交 62%

Masked Autoencoders Learn Perception-Relevant Representations from Resting State Neural Data

掩码自动编码器从静息态神经数据中学习与感知相关的表示

Aleksandr Kovalev, Antonio Lozano, Fabrizio Grani, Cristina Soto Sanchez, Leili Soo, Rocío López-Peco, Adrian Villamarin-Ortiz, Roberto Morollón Ruiz, María del Mar Ayuso Arroyave, Alfonso Rodil, Eduardo Fernández

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究利用自监督学习,通过在盲人参与者V1区的自发神经活动上预训练掩码自动编码器,测试能否改善感知解码。结果显示该方法有效,表明自发皮层活动有价值,无监督预训练是改善神经解码的好策略。

Comments 6 papers, 4 figures. NeuroAI Workshop, AAAI 2026

Journal ref Proceedings of the First Workshop on NeuroAI Multimodal Intelligence @ AAAI 2026, PMLR 308:93-98, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23319 2026-07-28 cs.CL cs.CY cs.ET cs.LG 新提交 62%

BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis

BHARATI:用于古典印度语言的形态感知分词器及子词丰富度分析

Poornima Kumaresan, Pavithra Muruganantham, Lakshmi Rajendran, Santhosh Sivasubramani

机构 * Centre for Sensors, Instrumentation and Cyber-Physical System Engineering (Centre for SeNSE), Indian Institute of Technology Delhi(印度理工学院德里分校传感器、仪器仪表和网络物理系统工程中心(SeNSE中心)) RSL Quantum, FITT, IIT Delhi(印度理工学院德里分校FITT的RSL量子公司)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对古典印度语言分词低效问题,提出BHARATI,它基于多语言语料库训练出三个版本的分词器,经子词丰富度分析和实验验证,v3表现出色,能减少序列长度,增加下游语言模型有效上下文长度,相关模型、脚本和基准已开源。

Comments 33 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22444 2026-07-27 cs.LG cs.AI 新提交 62%

Hyperball May Not Be a Free Lunch

超球可能并非免费午餐

Yihao Xiao, Jialong Sun, Zitian Gao, Zeming Wei, Chutian Wang, Ran Tao, Jiaye Teng, Bryan Dai

机构 * IQuest Research(IQuest研究公司) Peking University(北京大学) Sun Yat-sen University(中山大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究超球风格优化器优势来源,通过推导角有效学习率等方法分析,发现其优势并非源于更新方向,而是有效步长演变,预训练实验表明学习率衰减策略影响性能,谨慎调度对发挥其潜力至关重要。

Comments 14 pages, 4 figures. Code: https://github.com/mangocrazz/hyperball-may-not-be-a-free-lunch. Equal contribution: Yihao Xiao and Jialong Sun. Corresponding author: Bryan Dai

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20449 2026-07-24 cs.CL cs.AI 新提交 62%

The Storyteller in the Model: Narrative Pattern Inheritance, Escalation Dynamics, and Alignment Governance in LLMs

模型中的讲述者:大语言模型中的叙事模式继承、升级动态和对齐治理

Adam Rigby, Raz Saremi, Azadeh Sohrabinejad, Mehdi Rahimi

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 探讨大语言模型训练中是否吸收人类写作叙事模式并致输出漂移,通过文献综述和跨论文分析发现三个关键模式,包括复制训练数据模式、出现潜在特征及微调带来意外变化,指出叙事漂移是未监测的升级途径,需专门监测工具。

Comments 2 figures, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17843 2026-07-21 cs.LG cs.CL cs.DC 新提交 62%

Mobius Learning: Cyclic Depth Folding in Transformers

莫比乌斯学习:Transformer中的循环深度折叠

Tongtian Zhu

机构 * Zhejiang University(浙江大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究挑战Transformer中块作用与位置绑定的传统观点,提出基于循环深度折叠的莫比乌斯学习,同一组块在不同数据流中有不同应用时机,实现深度角色叠加,实验表明其在分布式训练中有优势,开辟新设计空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15898 2026-07-20 cs.CV cs.AI cs.LG cs.RO 新提交 62%

Orbis 2: A Hierarchical World Model for Driving

Orbis 2:一种用于驾驶的分层世界模型

Sudhanshu Mittal, Arian Mousakhan, Silvio Galesso, Karim Farid, Jonannes Dienert, Rajat Sahay, Thomas Brox

机构 * University of Freiburg(弗莱堡大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对当前世界模型不足提出分层驾驶世界模型,跨两层分解预测,结合扩散强制预训练和教师强制微调,在长距离生成保真度等多方面取得领先成果。

Comments Project page: https://lmb-freiburg.github.io/orbis2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13565 2026-07-16 cs.CR cs.AI cs.CL 新提交 62%

UTS at ELOQUENT 2026 Voight-Kampff: structural shifts in AI writing bypass state-of-the-art detectors

UTS在2026年ELOQUENT Voight-Kampff中的表现:人工智能写作中的结构转变绕过了最先进的检测器

Dima Galat, Marian-Andrei Rizoiu

机构 * University of Technology Sydney, Australia(澳大利亚技术大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型逃避攻击在对抗性微调中的情况,利用检测器漏洞不对称性,引入新攻击家族,其愚弄率更高且能保持自然度,实验表明现有对策无效,揭示检测器在结构分布外转变下有持续漏洞并助力竞赛表现。

Comments CLEF2026, ELOQUENT2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11720 2026-07-14 cs.LG cs.AI 新提交 62%

Active Offline-to-Online Reinforcement Learning

主动离线到在线强化学习

Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai

机构 * Virginia Commonwealth University(弗吉尼亚共同体大学) University of Virginia(弗吉尼亚大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究离线到在线强化学习中有限交互预算下的主动策略选择问题,提出基于未来性能上置信界主动选策略微调的方法,经实验验证其优于现有基线,能更有效利用预算,推动离线强化学习在现实系统的实际部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09751 2026-07-14 cs.AI cs.LG 新提交 62%

Task-Conditioned Synthetic Data Generation for Improving Machine Learning Performance in Agricultural Prediction Tasks

用于提高农业预测任务中机器学习性能的任务条件合成数据生成

Hamid Ebrahimy, Moritz Lucas, Martin Atzmueller

机构 * Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所(ATB)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对农业预测任务中训练数据受限影响机器学习性能的问题,提出任务条件合成数据生成算法TCSDG,结合贝叶斯网络生成器与表格基础模型,经实验验证其能有效提升性能,优于基准算法,提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05691 2026-07-08 cs.CL cs.LG q-bio.BM 新提交 62%

Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES

何处切割,多深切割:化学SMILES上的字节对编码(BPE)与一元语法语言模型(Unigram-LM)

Hunter Heidenreich

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究对比化学SMILES上的BPE和Unigram-LM,在固定化学基础、小词汇量规模及多种语料类型和预分词边界策略下,发现二者不收敛,构建几乎不相交的子词词汇表,Unigram-LM分词更多,表明子词算法是建模决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05155 2026-07-07 cs.CL cs.LG 新提交 62%

EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

EdgeBench:揭示从真实环境中学习的缩放定律

Deyao Zhu, Xin Zhou, Shengling Qin, Xuekai Zhu, Hangliang Ding, Shu Zhong, Zixin Wen, Zhonglin Xie, Chenhui Gou, Linxuan Ren, Yueyang Wang, Junfeng Zhong, Rui Liu, Tian Gao, Yangguang Lin, Jingyuan Zhang, Maojia Song, Xuan Qi, Jinhong Wu, Chenyang Zhang, Yinzhu Piao, Ziru Niu, Hongbin Lin, Lingxiang Meng, Peng Tang, Chengyao Tang, Shanyu Wu, Huanyu Zheng, Yu Liu, Liya Zhu, He Wang, Ming Ding, Ziyu Wan, Hao Liu, Sibo Wang, Haotian Zhu, Xintian Zhang, Nan Chai, Yipeng Liu, Panhao Lai, Sihang Yuan, Zixin Su, Ge Zhang, Wangchunshu Zhou, Yantao Du, Wenhao Huang, Guang Shi

机构 * ByteDance(字节跳动)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出含134项长周期真实任务的EdgeBench平台,通过分析大量智能体交互数据,发现环境学习性能符合对数S型缩放定律,为智能体现实经验学习研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04064 2026-07-07 cs.CL cs.AI cs.SD eess.AS 新提交 62%

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

用于音节切分的说话人解缠块级回归

Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki

机构 * JTEKT Corporation(捷太格特公司) Institute of Science Tokyo(东京理科大学) National Institute of Information and Communications Technology(国立情报通信研究机构)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究无监督音节切分问题,提出说话人解缠音节切分器,通过在固定长度块内将受说话人干扰的学生表示向干净教师目标回归,取得了音节边界检测和音节段聚类的最优性能。

Comments Accepted by IEEE Open Journal of Signal Processing (OJSP), 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03836 2026-07-07 cs.CV cs.AI cs.CL 新提交 62%

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

何时越简单越好:评估中世纪拉丁文手稿的翻译管道

Nguyen Kim Hai Bui, Md. Easin Arafat, Tamás Gábor Orosz, Mufti Mahmud

机构 * Eötvös Loránd University(厄特沃什·罗兰大学) King Fahd University of Petroleum and Minerals(法赫德国王石油与矿产大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对历史手稿翻译难题,提出评估中世纪拉丁文手稿图像到翻译流程的框架。通过CATMuS数据集对比发现领域特定OCR模型优势,引入新数据集IPC,实验揭示简单管道表现更佳,为低资源历史场景翻译系统部署提供基准与指导。

Comments 17 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02633 2026-07-07 cs.LG cs.CL 新提交 62%

GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech

GRAFT:用于零样本文本到语音中细粒度发音的嫁接参考音频

Antonis Asonitis, Francesco Verdini, Aref Farhadipour, Vijeta Avijeet, Pierre-Edouard Honnet, Marzieh Razavi, Juan Pablo Zuluaga Gomez

机构 * AGIGO ETH Zurich(苏黎世联邦理工学院) Sapienza University of Rome(罗马大学) University of Zurich(苏黎世大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对文本到语音神经编解码器语言建模中单词发音问题,提出GRAFT机制,通过短语音样本控制单词发音,经语音转换训练,提升发音效果,在多语言基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31991 2026-07-01 cs.LG cs.AI 新提交 62%

Amplifying Membership Signal Through Chained Regeneration

通过链式再生放大成员信号

Wojciech Łapacz, Stanisław Pawlak

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MADreMIA框架,利用链式再生迭代轨迹增强生成模型的成员推断和数据集推理攻击,在低误报率下提升信号强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23611 2026-06-23 cs.CV cs.AI cs.LG 新提交 62%

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

面向视觉-语言场景的迭代自过滤数据选择

Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学Mila实验室)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种自举式方法,通过迭代训练CLIP模型并自选择改进的数据混合,无需额外数据或预训练模型即可提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22700 2026-06-23 cs.LG cs.AI cs.CR cs.CV 新提交 62%

SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors

SCRUB-FL:通过遗忘后门来净化和清洗表示

Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Khalifa University(哈利法大学)

专题命中 预训练与数据 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出SCRUB-FL,一种两阶段后门移除方法,在训练时通过谱分析和激活聚类检测可疑样本并训练WGAN-GP捕获触发分布,收敛后利用机器遗忘合成近似触发样本并消除触发-目标关联,在CIFAR-10和GTSRB上后门攻击成功率降至3.88%,正常任务准确率超91%。

Comments 14 pages, 3 tables, 1 algorithm, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21139 2026-06-23 cs.RO cs.AI cs.LG 新提交 62%

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning

PoLAR:分解潜在动作中的程度和模式用于机器人策略学习

Youngjoon Jeong, Jihwan Yu, Minsoo Jo, Junha Chun, Taesup Kim

机构 * Seoul National University(首尔国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出PoLAR方法,通过径向方向结构分解潜在动作中的程度和模式,利用时间偏移作为程度代理,在双曲空间中实现,提升下游策略性能。

Comments Project Page: https://joon-stack.github.io/PoLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20696 2026-06-23 cs.CL cs.AI eess.AS 新提交 62%

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida

机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18717 2026-06-18 cs.CL cs.AI 新提交 62%

Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish

Morpheus: 一种面向土耳其语的形态感知神经分词器和词嵌入器

Tolga Şakar

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语粘着特性,提出Morpheus神经词素边界模型,实现无损可逆分词与结构化词嵌入,在可逆分词器中达到最低比特每字符(1.425),词素对齐F1提升至0.61,GPU内存节省约19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17667 2026-06-17 cs.LG cs.AI 新提交 62%

Handling Feature Heterogeneity with Learnable Graph Patches

处理特征异质性:可学习图块方法

Yifei Sun, Yang Yang, Xiao Feng, Zijun Wang, Haoyang Zhong, Chunping Wang, Lei Chen

机构 * Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学) Finvolution Group(信也科技集团)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出可学习图块概念,将图分解为语义单元,通过补丁编码器和聚合器实现跨域图数据的可迁移预训练,提升下游任务性能。

Comments Accepted at KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16019 2026-06-16 cs.CL cs.LG cs.SD 新提交 62%

Scaling Human and G2P Supervision for Robust Phonetic Transcription

扩展人类与G2P监督以实现鲁棒语音转录

Alexander Metzger, Aruna Srivastava, Ruslan Mukhamedvaleev

机构 * Koel Labs LLC

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究自动语音转录中人类标注与G2P监督的扩展规律,发现当人类标注少于20-30小时时G2P有效,超过后无益甚至降低鲁棒性,而ASR预训练可显著提升性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15695 2026-06-16 cs.LG cs.AI 新提交 62%

When Generator Replay Degrades: Projected Rehearsal Orchestration for Heterogeneous Federated Class-Incremental Learning

当生成器回放退化时:面向异构联邦类增量学习的投影排练编排

Thinh T. H. Nguyen, Khoa D. Doan, Binh T. Nguyen, Danh Le-Phuoc, Kok-Seng Wong

机构 * VinUniversity VNU-HCM, University of Science(胡志明市国家大学理科大学) Technische Universität Berlin(柏林工业大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对异构联邦类增量学习中客户端标签子集不同、任务阶段不一致导致的旧知识遗忘问题,提出投影排练编排框架PRO及增强版PRO-MAX,通过服务器端维护紧凑类级投影记忆并实现平衡伪多任务训练,在图像、文本和图基准上提升异构流下的保留与最终效用。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14971 2026-06-16 cs.LG cs.AI 新提交 62%

FastMix: Fast Data Mixture Optimization via Gradient Descent

FastMix: 通过梯度下降实现快速数据混合优化

Haoru Tan, Sitong Wu, Yanfeng Chen, Jun Xia, Ruobing Xie, Bin Xia, Xingwu Sun, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) Tencent(腾讯) Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出FastMix框架,将数据混合选择重新表述为双层优化问题,通过联合优化混合系数和模型参数,实现高效、可扩展的数据混合发现,在预训练和后训练中均优于基线方法且大幅降低搜索成本。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13276 2026-06-12 cs.LG cs.AI 新提交 62%

Different Layers, Different Manifolds: Module-Wise Weight-Space Geometry in Transformer Optimization

不同层,不同流形:Transformer优化中的模块级权重空间几何

Kirato Yoshihara

机构 * School of Engineering Science, The University of Osaka(大阪大学工程科学学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究Transformer不同模块偏好不同流形几何,提出为注意力层和MLP层分别分配Stiefel和DGram约束,在GPT-2预训练中取得最佳性能。

Comments Accepted at WSS @ ICML 2026, code is available at https://github.com/kiratoyoshihara/module-wise-manifold-muon

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10406 2026-06-10 cs.LG cs.AI 新提交 62%

FOGO: Forgetting-aware Orthogonalization Optimizer

FOGO:遗忘感知正交化优化器

Toan Nguyen, Yang Liu, Trung Le, Celso de Melo, Flora D. Salim

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Department of Data Science & AI, Monash University(莫纳什大学数据科学与人工智能系) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出FOGO优化器,通过谱正交化动量更新并利用紧凑码本记忆解决梯度干扰,在类别不平衡、持续学习和大模型微调等场景中提升收敛与知识保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10087 2026-06-10 cs.CL cs.LG 新提交 62%

CodeAlchemy: Synthetic Code Rewriting at Scale

CodeAlchemy:大规模合成代码重写

Ankit Gupta, Aditya Prasad, Rameswar Panda

机构 * MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CodeAlchemy框架,通过5种策略生成超过500B token的合成代码数据,引入DevEval和TraceEval基准,3B模型在多项任务上超越10倍大小的前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏