arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 14 篇

2607.24769 2026-07-29 cs.AI cs.CL 新提交 88%

LLM Scheming Inversely Scales with Pretraining Language Coverage

大语言模型的策略规划与预训练语言覆盖范围成反比

Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17351 2026-07-29 cs.CL 版本更新 85%

Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers

语言模型的物理:第4.1部分,架构设计与Canon层的魔力

Zeyuan Allen-Zhu

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 本研究提出Canon层,通过轻量级架构组件提升语言模型的推理深度和广度,验证了其在不同架构中的有效性,并展示了其在学术预训练中的潜力。

Comments V1.1 appeared in NeurIPS 2025 main conference; V2 adds GDN experiments, tightens others for a stronger, fairer comparison, and reorganizes sections; V3 adds Result 2.1 and Section 5.2 on how Canon layers improve hierarchical feature learning, from our Jan 2026 talk

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03773 2026-07-29 cs.CL 版本更新 83%

KletterMix: Climbing Toward High-Quality German Pretraining Data - The Full Report

KletterMix: 攀登高质量德语预训练数据

Maurice Kraus, Ruben Härle, Sebastian Sztwiertnia, Abbas Goher Khan, Mehdi Ali, Michael Fromm, Nicolas Flores-Herr, Kristian Kersting

机构 * AI & ML Group, TU Darmstadt(人工智能与机器学习小组,德累斯顿技术大学) Lab1141 Lamarr Institute(拉马尔研究所) Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) hessian.AI(海斯坦.AI) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(认知科学中心,德累斯顿技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 通过翻译高质量英语语料库构建德语预训练语料库KletterMix,并验证其在德语下游任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25135 2026-07-29 cs.AI cs.LG 新提交 82%

ScalableRAG: High-Quality RAG at Zero Ingestion Cost

ScalableRAG:零摄入成本下的高质量检索增强生成

Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

机构 * Cohesity(科赫思)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究提出零摄入成本的ScalableRAG及有限摄入的改进版本,通过维护工作区实现即时聚合推理,在六个语料库测试中表现出色,平均准确率大幅超越基线,还通过固定LLM调用次数等进一步提升大规模时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25271 2026-07-29 cs.LG cs.AI cs.PF 新提交 81%

Bridging Compute- and Data-Optimal Pretraining

弥合计算最优和数据最优预训练之间的差距

Tian Qin, Kimia Hamidieh, David Alvarez-Melis

机构 * Harvard University(哈佛大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对计算增长快于高质量数据可用性的问题,提出计算-数据(CD)缩放定律框架,通过引入令牌有效性函数η拟合数据扩展策略,划分训练操作模式,指出经典计算最优分配在多数实际设置下次优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00883 2026-07-29 cs.LG cs.AI cs.CY stat.AP 79%

Knowledge without Wisdom: Measuring Misalignment between LLMs and Intended Impact

无智慧的知识:衡量大语言模型与预期影响之间的不一致

Michael Hardy, Yunsung Kim

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了大语言模型在基准测试和下游任务中的对齐问题,发现模型行为与专家人类行为存在较大偏差,且常见预训练方法导致了显著的不一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00417 2026-07-29 cs.LG cs.AI cs.CL cs.CV 版本更新 75%

Deep Delta Learning

深度delta学习

Yifan Zhang, Yifeng Liu, Mengdi Wang, Quanquan Gu

机构 * Princeton University(普林斯顿大学) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出深度delta学习,通过选择性重写残差内容提升语言模型性能,改进了Transformer残差流的更新机制。

Comments Project Page: https://github.com/yifanzhang-pro/deep-delta-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24791 2026-07-29 cs.IR cs.AI cs.CL 新提交 73%

From Naive RAG to Deep Agentic Retrieval: An Evolving Context Engineering Pipeline for Regulatory Compliance

从朴素检索增强生成到深度智能检索:用于合规监管的不断演进的上下文工程管道

Mishca de Costa, Muhammad Saleh Anwar, Dave Mercier, Issam Hammad

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对RAG朴素实现的局限,追溯安大略发电公司检索管道演变,历经多阶段形成PEA-CAE架构,表明上下文工程对监管语料库更具优势,深度智能检索进展反映经典思想,迭代证据获取等渐成企业问答基础。

Comments Accepted at the 2026 IEEE the 14th International Conference on Smart Energy Grid Engineering (SEGE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25184 2026-07-29 cs.CL 新提交 70%

A scaling law of contextual persistence in human language

人类语言中上下文持久性的标度律

Elan Barenholtz

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究人类语言中单词顺序排列的规律,用大语言模型测量上下文持久性函数P(d),发现其在多个语料库中按1/d衰减,建立了人类语言中上下文持久性的标度律。

Comments 21 pages, 5 figures (plus 1 supplementary figure); Supplementary Information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25851 2026-07-29 cs.SE 新提交 67%

Rethinking Training Data for Generating Code Review Comments

重新思考用于生成代码审查评论的训练数据

Leonardo Centellas-Claros, Estefania Pakarati-Cofre, Juan Pablo Sandoval Alcocer, Diego Elias Costa

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 研究代码审查评论生成,指出尽管有进展但生成的评论存在问题,通过实证检查识别出不匹配训练对并得出分类法,探讨纳入分类法能否改善问题,发现仍有挑战,认为改进需更多举措而非仅数据集清理。

Comments Paper accepted to ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25169 2026-07-29 cs.LG cs.AI 新提交 62%

CondPSE: A Polynomial-Filtered Structural Encoder with Conditional Modulation for Graphs

CondPSE:一种具有条件调制的多项式滤波结构编码器用于图

Woohyun Lee, Hogun Park

机构 * Sungkyunkwan University(成均馆大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对消息传递图神经网络局限,提出CondPSE编码器,用多项式图滤波器组和条件调制处理节点探针,预训练后冻结用作下游输入编码。在合成基准上提升结构判别准确率,在分子性质预测中与GPSE相当,探讨了其优势及局限性。

Comments Accepted as a poster at the 2nd Frontiers in Graph Machine Learning for the Large Model Era (GMLLM'26), a KDD 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24745 2026-07-29 cs.IR cs.AI cs.CL cs.CV 新提交 62%

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

DocAnnot——利用生成式人工智能驱动的自动注释加速关键信息提取数据集的创建

Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对关键信息提取中训练数据集创建耗时的问题,提出DocAnnot框架,利用大型视觉语言模型、OCR及SICM算法,在基准测试中自动生成注释有一定F1分数,还能用于微调下游模型,大幅节省时间成本,减少人工依赖但未完全消除人工干预。

Comments 15 pages, 2 figures

Journal ref Proc. ICDAR 2025, Lecture Notes in Computer Science, vol 16025, Part III, pp. 563-576

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14366 2026-07-29 cs.AI cs.RO 版本更新 57%

Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds

通过空间基础合成世界实现机器人的具身认知

Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 提出训练视觉语言模型执行视觉视角采择的概念框架,引入合成数据集用于空间推理任务监督学习,专注推断Z轴距离,数据集公开,为具身人工智能系统空间理解奠基。

Comments Accepted to: Intelligent Autonomous Systems (IAS) 2025 as Late Breaking Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25085 2026-07-29 eess.AS 新提交 50%

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

文本提示的CLAP:通过对比学习学习查询条件音频表示

Mohan Li, Rama Doddipatla, Philip C. Woodland

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究旨在解决CLAP独立编码模态限制,提出TP-CLAP,通过引入交叉注意力融合模块,利用音频多项选择题框架训练,在音频问答、检索等任务中表现出色,优于标准CLAP基线。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏