arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 10821 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2607.04939 2026-07-07 cs.SE 新提交 75%

Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo

教大语言模型一种低资源语言:增强Pharo中的代码补全

Kilian Kier, Alessandro Giagnorio, Omar AbedelKader, Oleksandr Zaitsev, Robert Peharz, Romain Robbes, Gabriele Bavota, Stéphane Ducasse

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究将基于大语言模型的代码补全引入低资源语言Pharo,介绍结合特定数据处理、预训练与微调的端到端流程,引入基准测试,实证表明专用模型性能超越原模型及更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01218 2026-07-02 cs.CL cs.AI cs.LG 新提交 75%

The State-Prediction Separation Hypothesis

状态-预测分离假说

Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi

机构 * Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出状态-预测分离假说,通过双流Transformer解耦状态存储与下一词预测,在预训练中提升数据与计算效率,下游任务平均提升2-3个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交 75%

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn)

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20173 2026-06-19 cs.SE 新提交 75%

Qiskit Code Migration with LLMs

使用大语言模型进行Qiskit代码迁移

Jose Manuel Suarez, Luis Mariano Bibbo, Joaquin Bogado, Alenandro Fernandez

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对量子软件开发套件版本演进导致的代码维护问题,提出结合大语言模型与检索增强生成(RAG)的混合方法,利用自动生成的迁移场景分类体系引导模型,实现Qiskit代码跨版本自动迁移,有效减少幻觉并提升迁移建议质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18237 2026-06-17 cs.CL cs.AI cs.LG 新提交 75%

ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计

Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Datadog

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04213 2026-08-06 cs.LG 新提交 74%

Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining

基于LeJEPA自监督预训练的仅注意力白盒Transformer

Yang Bai, Linyuan Wang, Haoyang Jiang, Nuolin Sun, Libin Hou, Bin Yan

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本研究提出基于LeJEPA自监督预训练的仅注意力白盒Transformer,减少约31%参数,在CIFAR-10、CIFAR-100上实现与原模型相当的准确率,还发现标准ViT中MLP模块存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02084 2026-08-04 cs.SE cs.CR cs.LG 新提交 74%

Pretraining on Call Graphs: When Binary Analysis Tasks Profit From Context

在调用图上进行预训练:当二进制分析任务从上下文获益时

Samuel Valenzuela, Johannes Kinder

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本研究探究调用图对二进制分析任务的影响,发现结合过程间上下文可提升嵌入鲁棒性但未必泛化到下游任务,且对命名空间相关函数更有益。

Comments 12 pages, 5 figures. Accepted at ICPC '26

Journal ref Proceedings of the 34th IEEE/ACM International Conference on Program Comprehension, pp. 14-25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 74%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 预训练与数据 :language model(title);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01153 2026-08-04 cs.CL 新提交 74%

Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models

面向泰米尔语语言模型的形态学感知可逆语义分词与分层词组合

Anand Murugan

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 该研究针对泰米尔语,提出结合ThamizhiMorph的形态系统与分层词组合方法,在固定小模型预算下提升翻译性能,同时大幅降低序列长度与推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18445 2026-07-22 cs.CR cs.AI 新提交 74%

ChainMark: Model-Free LLM Watermarking with Closed-Form Calibration

ChainMark:具有闭式校准的无模型大语言模型水印

Chengheng Li-Chen, Kyuhee Kim

专题命中 预训练与数据 :LLM(title);分类 cs.AI

AI总结 研究针对合成文本标记需求,提出ChainMark无模型大语言模型水印方法,通过特定方式划分词汇表状态并强制马尔可夫转移,检测器无需访问语言模型,推导相关闭式,证明鲁棒性阈值,在多模型和领域中优于其他方法,可恢复目标误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14051 2026-07-16 cs.CL 新提交 74%

Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

回溯:重放预测市场以评估大语言模型预测器

Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 预训练与数据 :LLM(title);分类 cs.CL

AI总结 研究针对大语言模型预测器评估中答案泄露问题,提出Hindcast方法,通过设定特定过去日期评分,重放预测市场与Reddit快照,让模型读取特定时间前帖子并评分,解决泄露问题,且能随模型改进在新市场重新评估,明确检索在不同情况的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08077 2026-07-10 cs.LG 新提交 74%

Modular Pretraining Enables Access Control

模块化预训练实现访问控制

Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对人工智能两用困境及多模型部署成本高问题,提出梯度路由辅助模块(GRAM)预训练方法,能在推理时消融模块功能。实验显示其可有效禁用目标功能且抗微调恢复,训练成本低,紧密跟踪数据过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04941 2026-07-07 cs.CL cs.SD eess.AS 新提交 74%

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

DuplexChat:大规模构建用于口语对话语言建模的分离说话者全双工对话语音

Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学,日本) National Institute of Advanced Industrial Science and Technology, Japan(日本国家先进工业科学与技术研究院)

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 针对现有大规模公共语音语料库不适用于全双工口语对话模型训练的问题,提出DuplexChat及DuplexChat-Pipe,通过特定流程构建分离说话者全双工对话语音,产出多语言语料库。

Comments 4 pages, 1 figures, submitted to SLT demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21271 2026-06-23 cs.LG 新提交 74%

Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

通过占据覆盖最大化进行强化学习的无奖励预训练

Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto

机构 * Computational Statistics and Machine Learning - Istituto Italiano di Tecnologia(计算统计与机器学习 - 意大利技术研究院) AI Centre, Computer Science Department, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 提出一种无奖励预训练方法ROVER,通过最大化状态占据测度的覆盖来学习可迁移探索策略,在稀疏奖励下游任务中快速适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17445 2026-06-17 cs.LG cond-mat.mtrl-sci physics.chem-ph 新提交 74%

Toward Controllable Catalyst Inverse Design via Large-Scale Autoregressive Pretraining

面向可控催化剂逆向设计的大规模自回归预训练

Dong Hyeon Mok, Jonggeol Na, Seoin Back

机构 * Department of Chemical and Biomolecular Engineering, Institute of Emergent Materials, Sogang University(化学与生物分子工程系,新兴材料研究所,首尔大学) Department of Chemical Engineering and Materials Science, Ewha Womans University(化学工程与材料科学系,成实女子大学) Department of Chemical Engineering, Graduate Program in System Health Science and Engineering, Ewha Womans University(化学工程系,系统健康科学与工程研究生院,成实女子大学) Institute for Multiscale Matter and Systems (IMMS), Ewha Womans University(多尺度物质与系统研究所(IMMS),成实女子大学) KU-KIST Graduate School of Converging Science and Technology, Korea University(KU-KIST融合科学与技术研究生院,韩国大学) Department of Integrated Energy Engineering, Korea University(整合能源工程系,韩国大学) Center for Hydrogen and Fuel Cells, Korea Institute of Science and Technology(KIST)(氢气与燃料电池中心,韩国科学技术院(KIST))

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 提出基于生成式预训练Transformer的条件催化剂生成模型,通过大规模预训练和微调实现高结构有效性和条件匹配率,显著提升筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12750 2026-08-14 cs.CL cs.AI cs.HC 新提交 73%

PatientAct: Theory-Grounded Mental Health Client Simulation

PatientAct:基于理论的心理健康来访者模拟

Sahand Sabour, TszYam NG, Yaqian Chen, Guanqun Bi, Jialu Zhao, Minlie Huang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 PatientAct是基于临床理论的来访者模拟框架,通过整合5Ps临床案例 formulation与带信任阈值的动态记忆层,生成高临床合理性的多样化来访者,在40种临床情境中较基线方法显著提升了抗拒质量与行为真实性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10605 2026-08-12 cs.LG cs.AI 新提交 73%

Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts

计算最优并非集群最优:面向稀疏混合专家模型的系统感知缩放

Soumajyoti Sarkar, Yuxin Tang, Sheng Zha

机构 * Amazon AGI Foundations(亚马逊AGI基础研究部门)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发MOSAIC框架,将稀疏MoE模型的架构与系统协同设计建模为优化问题,发现计算最优与集群最优稀疏性存在差异,主张统一架构与系统协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06223 2026-08-07 cs.AI cs.LG 新提交 73%

TS-RAG: Retrieval Augmented Generation for Time Series Forecasting

TS-RAG:面向时间序列预测的检索增强生成

Yixiong Xiao, Congxi Xiao, Jingbo Zhou

机构 * Baidu, Inc.(百度公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列预测模型的局限,提出TS-RAG框架,引入参考token融合输入与检索序列信息,在多个真实预测基准上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05624 2026-08-07 cs.AI cs.CL 新提交 73%

Measuring and Detecting Harmful AI Sycophancy

衡量与检测有害的AI奉承行为

Bohan Jiang, Dawei Li, Yasin Silva, Huan Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对大型语言模型的有害偏好诱导立场反转奉承(PSRS),提出CAP框架收集带标签数据,探究其发生频率、检测可行性及跨模型泛化性,发现能力越强的模型PSRS率越低,并提出应对未见模型检测性能下降的初步方法。

Comments under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05153 2026-08-07 cs.CL cs.AI 新提交 73%

Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability

普遍存在的缺陷与有条件的后果:面向多跳可追溯性的RAG的三重鲁棒性分析

Meftun Akarsu, Burak Ozdemir

机构 * Technische Hochschule Ingolstadt(英戈尔施塔特应用技术大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究通过三重鲁棒性分析,探究了不同嵌入器、语料库、评判器下GraphRAG与向量RAG的多跳可追溯性表现,发现过度引用具架构普遍性,忠实度后果受语料库影响,提出三重鲁棒性为可信RAG架构主张的最低标准。

Comments 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04678 2026-08-06 cs.CL cs.LG 新提交 73%

Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention

Kathleen Writes:无注意力的自回归生成与数据缩放

George Fountzoulas

机构 * Frederick University(弗雷德里克大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出无注意力的混响模型,在字节级语言建模上优于参数匹配的Transformer,引入FORM DISTANCE衡量文本真实性,发现解码策略对生成性能的影响大于架构,且增益依赖训练语料库内的短语。

Comments Paper 3 of the Kathleen series. 11 pages, 3 figures. All experiments reproducible on a free Kaggle T4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02961 2026-08-05 cs.LG cs.AI q-bio.GN 新提交 73%

Scaling an Autoregressive Transformer for Single-Cell Generation

为单细胞生成任务扩展自回归Transformer模型

Aleksandr Sharipov, Yusif Mukhtarov, Igor Molybog

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对单细胞基因表达向量的自监督生成任务,扩展因果Transformer模型,发现单细胞基础模型的双指数缩放定律与计算最优前沿,还探讨其微调用于扰动响应预测的可能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02807 2026-08-05 cs.CL cs.AI 新提交 73%

Learning a Vector-Symbolic Model for Socio-Cultural Tasks

学习面向社会文化任务的向量符号模型

Meera Ray, Swapnika Dulam, Christopher L. Dancy

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对社会文化结构对决策的表征问题,在ACT-R认知架构中提出带向量符号自编码器的陈述性记忆系统,结合HRR编码,通过IAT测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00985 2026-08-04 cs.LG cs.AI q-bio.GN 新提交 73%

Beyond Gene Reconstruction: Learning Cell Representations through Complementary Transcriptomic Views

超越基因重构:通过互补转录组视图学习细胞表示

Jiaqi Xiong, Yuntao hu, Yu Zheng, Yifei Shi, Xinyue Guo, Jiaxin Qi

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对基因重构预训练模型未直接优化全细胞表示的问题,提出含三种适配的互补转录组视图对比预训练框架,在细胞类型注释和基因调控网络推断任务中表现出竞争力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01005 2026-08-04 cs.LG cs.AI cs.IT math.IT 新提交 73%

Hierarchical Solomonoff Induction: An Unbounded Machine Learning Model

分层所罗门诺夫归纳法:一种无界机器学习模型

Nathan Young

机构 * University of Auckland(奥克兰大学) Strong AI Lab(强人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出分层所罗门诺夫归纳法(HSI),将德菲涅蒂定理应用于所罗门诺夫归纳法(SolInd),证明HSI等价于SolInd,其超额误差受生成器复杂度约束,随数据集增长收敛至0,是适用于给定数据集的无界序列预测理想模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27731 2026-07-31 cs.LG cs.AI math.OC 新提交 73%

Towards joint scaling laws with optimal batch size schedules

面向最优批量大小调度的联合缩放律研究

Jiaxiang Li, Zhiqi Bu, Shiyun Xu

机构 * Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究从凸优化视角推导了适用于通用优化器和模型架构的损失联合表征,得到闭式最优批量大小调度与联合缩放律,其性能优于固定批量大小基线,凸显动态批量大小调度在大语言模型训练中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24791 2026-07-29 cs.IR cs.AI cs.CL 新提交 73%

From Naive RAG to Deep Agentic Retrieval: An Evolving Context Engineering Pipeline for Regulatory Compliance

从朴素检索增强生成到深度智能检索:用于合规监管的不断演进的上下文工程管道

Mishca de Costa, Muhammad Saleh Anwar, Dave Mercier, Issam Hammad

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对RAG朴素实现的局限,追溯安大略发电公司检索管道演变,历经多阶段形成PEA-CAE架构,表明上下文工程对监管语料库更具优势,深度智能检索进展反映经典思想,迭代证据获取等渐成企业问答基础。

Comments Accepted at the 2026 IEEE the 14th International Conference on Smart Energy Grid Engineering (SEGE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23242 2026-07-28 cs.CL cs.LG 新提交 73%

IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages

IndicTalk:用于印度语言的大规模基于角色的多语言对话语料库

Sahil Deepak Gawande, Mayank Singh

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对印度语言高质量多语言代码混合对话资源稀缺问题,提出通过全自动管道生成IndicTalk语料库,涵盖多种印度语言变体,经多种评估表现良好,将发布该语料库支持相关人工智能开发评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21716 2026-07-27 cs.LG cs.AI math.OC stat.ML 新提交 73%

A Defense of the Quadratic Model

二次模型的辩护

Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

机构 * Kempner Institute at Harvard University(哈佛大学坎普纳研究所) MIT(麻省理工学院)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究对二次模型进行压力测试,通过泰勒展开预测优化动态,利用兰索斯求积法分析海森矩阵谱和局部稳定性,发现其在语言模型中能准确反映优化情况,或可作为预训练优化动态的理论易处理代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19771 2026-07-23 cs.LG cs.AI 新提交 73%

An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies

用于μ子的各向同性保持谱帽:理论与三个案例研究

Jiachun Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究μ子和相关矩阵符号优化器对权重矩阵的影响,提出基于尺度不变性假设的统一框架及轻量级“谱帽”,通过三个案例研究表明谱帽可增加各向同性并防止失败,验证损失基本不变,结果为初步的。

Comments Preliminary Report; Larger scale experiments ongoing; Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏