arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-10 至 2026-07-10 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2607.08221 2026-07-10 cs.CV 新提交 90%

LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression

LUMI:基于语言模型的与分词器无关的无损图像压缩

Chris Xing Tian, Chengkai Wu, Ziyu Wang, Rongqun Lin, Kecheng Chen, Xiandong Meng, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Department of Electrical Engineering, City University of Hong Kong, Hong Kong SAR(香港城市大学电子工程系,香港特别行政区) Department of Computer Science, City University of Hong Kong, Hong Kong SAR(香港城市大学计算机科学系,香港特别行政区) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究基于LLM的无损图像压缩问题,提出LUMI框架,用像素嵌入模块取代像素即文本分词,引入位置编码,仅训练部分参数,LLM主干固定。实验表明其提供统一接口,压缩率有竞争力且跨域鲁棒性强。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08186 2026-07-10 cs.CL 新提交 89%

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

大规模隐藏解码:大语言模型的潜在计算扩展

Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang

机构 * WeChat AI Team(微信人工智能团队)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 研究在Transformer主干固定时,通过为token分配更多计算改进大语言模型,提出隐藏解码方法,将token扩展为n个流并结合流分解注意力,实验验证该方法在前沿规模的有效性及跨扩展因子时收益随n增加。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07748 2026-07-10 cs.LG 新提交 86%

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据

Didula Samaraweera, Anjana Supun, Srinath Perera

机构 * WSO2

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。

Comments 11 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08162 2026-07-10 cs.CV cs.AI cs.LG 新提交 81%

ProsMAE: Multi-Source MAE Pretraining for ISUP Grade Classification

ProsMAE:用于ISUP分级分类的多源MAE预训练

Anna Jung, Kyeonghun Kim, Youngung Han, Eunseob Choi, Jiwon Yang, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) GIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 针对全切片图像模型训练难题,提出多源MAE框架ProsMAE,利用多数据集切片预训练编码器,通过ProsCLS用于ISUP分级分类,在不相交PANDA分割下比普通MAE冻结线性探针基线有更高QWK。

Comments Accepted to APCCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08194 2026-07-10 cs.CV 新提交 80%

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

深入探究低秩视觉-语言对齐中的隐式偏差

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) National University of Singapore(新加坡国立大学) Mininglamp(明略科技)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26428 2026-07-10 cs.RO cs.AI 新提交 79%

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

Play2Perfect:灵巧操作预训练对精密装配的关键因素

Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 提出Play2Perfect框架,通过任务无关的玩耍预训练获取可复用的操作先验,再微调用于精密装配,在稀疏奖励和接触密集任务中实现33倍样本效率提升。

Comments 22 pages, 12 figures, 4 tables. Project page: https://play2perfect.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08646 2026-07-10 cs.CL cs.AI 新提交 79%

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX:通过自适应编程编辑大规模精炼预训练数据

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

机构 * Peking University(北京大学) ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08011 2026-07-10 cs.CR cs.AI cs.IR cs.LG 新提交 79%

Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions

小心你的自动补全内容:后门代码补全的取证溯源

Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(德克萨斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大型语言模型代码补全易受后门攻击的问题,提出CodeTracer取证框架,它仅靠微调语料库和错误补全事件,提取行为指纹,经推理将不安全逻辑归因于特定后门数据,评估显示其有高准确性、低误识率和强鲁棒性。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06116 2026-07-10 cs.AI cs.CL cs.CY 79%

The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety

在大语言模型中的同质化问题:迈向人工智能安全中的有意义多样性

Ian Rios-Sialer

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型中同质化问题,提出通过编码价值观系统来促进多样性,通过实验揭示性别偏见并引入xeno-reproduction概念以缓解同质化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08077 2026-07-10 cs.LG 新提交 74%

Modular Pretraining Enables Access Control

模块化预训练实现访问控制

Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对人工智能两用困境及多模型部署成本高问题,提出梯度路由辅助模块(GRAM)预训练方法,能在推理时消融模块功能。实验显示其可有效禁用目标功能且抗微调恢复,训练成本低,紧密跟踪数据过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15138 2026-07-10 cs.CL cs.AI 版本更新 73%

Less Is More: Reducing Token Counts Without Compromising Performance

少即是多:在不影响性能的情况下减少词元数量

Gyeongje Cho, Yeonkyoung So, Sangmin Lee, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何在不影响大语言模型性能的前提下减少词元数量,提出Thunder-Tok子词元分词器,先构建种子词汇表并过滤不完整候选词元,再用基于似然的词元分数修剪,实验证明该方法能有效降低词元生成率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00970 2026-07-10 cs.CL 新提交 70%

Svarna: An Open Corpus Workbench for Modern Greek

Svarna:现代希腊语开放语料库工作台

Stergios Chatzikyriakidis

机构 * Department of Philosophy, Linguistics and Theory of Science (FLoV), University of Gothenburg(哥德堡大学哲学、语言学与理论科学系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 介绍一个免费开源的现代希腊语网络语料库工作台Svarna,整合五个数据库共5.07亿词,提供索引、频率分析、搭配提取等功能,填补希腊语言技术空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06629 2026-07-10 cs.LG q-bio.NC 新提交 57%

STST-JEPA: Shallow-Target Spatio-Temporal Joint Embedding Prediction Architecture For EEG Self-Supervised Learning

STST-JEPA:用于脑电图自监督学习的浅目标时空联合嵌入预测架构

Roy Segal, Yoni Svechinsky, Tomer Fekete

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 研究针对脑电图脑年龄模型面临的问题,引入STST-JEPA自监督变压器,结合潜在预测目标与辅助信号重建项,经预训练和微调后在多任务中表现出色,且年龄预测残差与认知效率负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10254 2026-07-10 cs.LG 版本更新 57%

Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure

通过整合因果结构改进TabPFN的合成数据生成

Davide Tugnoli, Andrea De Lorenzo, Marco Virgolin, Giovanni Cinà

机构 * Department of Mathematics, Informatics and Geosciences(数学、信息学与地质科学系) University of Trieste(特里este大学) Department of Engineering and Architecture(工程与建筑系) InSilicoTrials Technologies BV(InSilicoTrials技术公司) Amsterdam UMC Institute for Logic, Language and Computation(阿姆斯特丹大学医学中心逻辑、语言与计算研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 通过整合因果结构改进TabPFN的合成数据生成,提升合成数据的质量和稳定性

Comments Camera-ready version, accepted at UAI 2026. 9 pages main text, 44 pages total (including supplementary material), 35 figures. Code: https://github.com/DavideTugnoli/tabpfn-causal-synthetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12999 2026-07-10 cs.CV cs.AI 版本更新 57%

Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs

概念树:一个可控的合成数据框架助力更强的个性化视觉语言模型

Ruichuan An, Kai Zeng, Ming Lu, Sihan Yang, Renrui Zhang, Huitong Ji, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) CUHK MMLab(香港中文大学MMLab) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 研究提升VLM个性化能力问题,提出概念树(CaT)框架,以树结构表示概念生成多样正负样本,经数据过滤策略确保质量,实验证明该框架显著增强VLM在个性化基准测试中的能力,是首个可控合成数据管道。

Comments ECCV26 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏