arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 737 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2607.18358 2026-07-22 cs.CL cs.LG 新提交 73%

A Classifier That Teaches Itself: Self-Improving, Frozen-gate Training (SIFT) for Dynamic Document Classification

一种自学分类器:用于动态文档分类的自我改进冻结门训练(SIFT)

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究针对企业文档分类难题,提出SIFT动态分类器服务,通过低成本管道、特定机制及判断反馈实现自我改进,解决标注和安全问题,介绍其架构、机制及部署示例,探讨边际标注成本趋零的经济性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11052 2026-07-14 cs.LG cs.CL 新提交 73%

Domain-Aware Scaling Laws Uncover Data Synergy

领域感知缩放定律揭示数据协同效应

Kimia Hamidieh, Lester Mackey, David Alvarez-Melis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Microsoft Research(微软研究院) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型预训练中的数据协同效应,利用开放权重语言模型的观测变化估计领域间协同效应,其框架提高预测精度,恢复稳定估计,经训练模型验证能正确预测性能排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10911 2026-07-14 cs.CL cs.AI cs.DB 新提交 73%

The Nuts and Bolts of Natural Language to SQL Translation: A Systematic Analysis of Model Pipeline Optimisation Approaches and their Interactions

自然语言到SQL翻译的关键要素:模型管道优化方法及其交互的系统分析

Filip Klubicka, Vasudevan Nedumpozhimana, Sneha Rautmare, Bora Caglayan, Mingxue Wang, John D. Kelleher

机构 * Huawei Ireland Research Centre(华为爱尔兰研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究NL2SQL翻译问题,通过集成NatSQL中间表示、增加预处理和微调步骤、开发重排器模型等方法,并结合SmBoP和RASAT架构进行消融及Shapley分析,揭示组件交互对结果的影响,为轻量级模型开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09754 2026-07-14 cs.CV cs.AI cs.LG q-bio.NC 新提交 73%

Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization

通过图谱对齐的时空令牌化实现宽场钙成像的跨主体建模

Mohammad Hosseini, Eray Erturk, Saba Hashemi, Maryam M. Shanechi

机构 * ShanechiLab(沙内奇实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对宽场钙成像建模受限问题,提出多主体模型WiCAT,利用自监督预训练,引入图谱对齐的时空令牌化方案,能跨主体、任务和数据集迁移,实现零样本行为解码及遗漏脑区重建,优于基线模型。

Comments Published at the 43rd International Conference on Machine Learning (ICML) 2026. Code available at: https://github.com/ShanechiLab/WiCAT

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05456 2026-07-08 cs.AI cs.CL q-bio.QM 新提交 73%

Prompt-to-Paper: Agentic AI System for Bioinformatics

从提示到论文:用于生物信息学的智能AI系统

Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan

机构 * School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST)(跨学科工程与科学学院(SINES),国立科技大学(NUST))

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有AI自动生成稿件系统的缺陷,提出Prompt-to-Paper多智能体框架。通过检索增强生成、自主编码实验及八维质量评分等创新,经质量驱动改进循环,在生物信息学案例中验证,有效提升稿件质量,成本低且获较好外部评价。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21876 2026-07-01 cs.LG cs.AI 新提交 73%

Protein contacts are already in the attention: a single-forward-pass alternative to the Categorical Jacobian

蛋白质接触已经存在于注意力中:分类雅可比矩阵的单次前向替代方案

Rome Thorstenson

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出通过选择少量注意力头(仅需10个标记蛋白质)平均即可在一次前向传播中恢复蛋白质接触,在无泄漏数据上优于分类雅可比矩阵,并发现该信号依赖于双向预训练。

Comments 28 pages, 9 figures. Code and data: https://github.com/Rome-1/plm-contact-fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25935 2026-06-25 cs.CL cs.AI 新提交 73%

Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts

HIPE-2026 概述:从多语言历史文本中提取人物-地点关系

Juri Opitz, Maud Ehrmann, Corina Raclé, Andrianos Michail, Matteo Romanello, Simon Clematide

机构 * University of Zurich(苏黎世大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Swiss Federal Institute of Technology Zurich (ETHZ)(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出HIPE-2026评测任务,针对多语言历史文档中的人物-地点关系(at和isAt)进行提取,采用三方面评估框架,比较了多种方法在准确性、效率和跨域泛化上的表现。

Comments Condensed Overview of CLEF-HIPE-2026 Shared Task Results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25010 2026-06-25 cs.LG cs.CL 新提交 73%

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

涌现能力随机地从学习稀疏注意力模式中产生

Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

机构 * New York University(纽约大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究发现,transformer模型的下游能力(如上下文学习)在训练过程中随机涌现,较大模型平均更早获得,且涌现对应于任务相关注意力模式的突然学习。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25008 2026-06-25 cs.LG cs.CL 新提交 73%

Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients

神经缩放普适性:如果指数固定,是时候理解系数了

Yizhou Liu, Jeff Gore

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文论证神经缩放定律中的幂律指数由通用机制固定,而系数对数据和架构细节敏感,理解系数是近期性能提升的关键。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20936 2026-06-23 cs.CL cs.AI 新提交 73%

Comparing Transformers and Hybrid Models at the Token Level

在词级上比较变换器和混合模型

Yanhong Li, William Merrill

机构 * Allen Institute for AI(艾伦人工智能研究所)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比混合模型与纯变换器在词级上的表现,揭示了混合模型在处理开放类词汇时的优势,以及在语义状态利用和n-gram复制任务中的不同表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19253 2026-06-18 cs.CV cs.AI cs.LG cs.RO 新提交 73%

OneCanvas: 3D Scene Understanding via Panoramic Reprojection

OneCanvas: 通过全景重投影实现3D场景理解

Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学) Huawei(华为)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出OneCanvas方法,将多视图补丁特征聚合到全景画布上,利用深度和相机位姿进行重投影,无需复杂几何编码器或大量训练,在SQA3D等基准上达到最先进精度。

Comments Project page: https://baranowskibrt.github.io/onecanvas/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13629 2026-06-12 stat.ME cs.AI cs.LG stat.ML 新提交 73%

Valid Inference with Synthetic Data via Task Exchangeability

通过任务可交换性实现基于合成数据的有效推断

Lezhi Tan, Tijana Zrnic

机构 * Department of Management Science & Engineering(管理科学与工程系) Department of Statistics(统计学系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出任务可交换性条件,确保在科学研究中使用合成数据进行统计推断的有效性,并给出在民意调查和AI评估中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11688 2026-06-11 cs.CL cs.AI 新提交 73%

Goal-Autopilot: A Verifiable Anti-Fabrication Firewall for Unattended Long-Horizon Agents

Goal-Autopilot: 一种可验证的防伪造防火墙,用于无人值守的长周期智能体

Youwang Deng

机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Autopilot执行模型,通过外部化状态到有限状态机并强制门控验证,使智能体无法虚假声称成功,在3,150个单元测试中伪造率降至0.95%,显著低于基线方法。

Comments Preprint. Code: https://github.com/EpistemicaLab/goal-compiled-autopilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08451 2026-06-09 cs.CL cs.AI 新提交 73%

Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models

谄媚作为多语言对齐失败:安全性能如何随语言、主题和模型退化

Arya Shah, Himanshu Beniwal, Mayank Singh, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校) Asian Institute of Technology(亚洲理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多语言模型中谄媚现象,发现低资源语言中谄媚率激增,且与主题无关,归因于分词器生育率,表明对齐方法在非高资源语言中泛化差。

Comments 19 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03500 2026-08-05 cs.CY 新提交 71%

LLM-Assisted Review Prioritization for German Statutory Health Insurance Websites: A Multi-Stage Corpus Audit

大语言模型辅助的德国法定医疗保险网站审核优先级排序:多阶段语料审计

Martin Möller

专题命中 预训练与数据 :LLM(title)

AI总结 本研究针对德国法定医疗保险网站,提出一种结合多步骤的大语言模型辅助审核优先级排序工作流程,经实验验证可有效分配审核工作量,区分AI来源信号与质量声明。

Comments 31 pages, 5 figures. Also archived at Zenodo: https://doi.org/10.5281/zenodo.21738595

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02707 2026-07-09 cs.CV 新提交 71%

VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

VLRC:视觉语言重投影一致性作为用于更好的前馈3D预训练的可扩展信号

Marwane Hariat, David Filliat, Antoine Manzanera

机构 * U2IS, ENSTA – Institut Polytechnique de Paris(U2IS,法国国立高等先进技术学校 - 巴黎综合理工学院) Pôle Recherche, Agence Ministérielle pour l’IA de Défense(军事人工智能部研究中心)

专题命中 预训练与数据 :pretraining(title)

AI总结 研究提出视觉语言重投影一致性(VLRC),利用冻结的视觉语言表征作为语义多视图监督,无需额外3D标注,能提升3D重建精度等,为前馈3D预训练提供可扩展辅助目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05906 2026-07-08 cs.CV 新提交 71%

GaussFusion: Towards Multimodal 3D Gaussian Pretraining

高斯融合:迈向多模态3D高斯预训练

Zhixuan You, Jihua Zhu, Yiding Sun, Zihao Guo, Haozhe Cheng, Dongxu Zhang, Lin Chen, Hainan Luo

机构 * Wuhu HIT Robot Technology Research Institute Co., Ltd.(芜湖哈工大机器人技术研究院有限公司)

专题命中 预训练与数据 :pretraining(title)

AI总结 研究提出GaussFusion多模态3D高斯预训练框架,通过跨模态语义对齐集成图像和文本监督,还提出高斯显著性引导的多尺度空洞掩码,实验表明该方法提高了高斯表示可迁移性,在ModelNet40和ScanObjectNN上有性能提升。

Comments 32 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25546 2026-06-25 cs.CV 新提交 71%

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

面向3D计算机断层扫描的疾病中心视觉语言预训练与混合视觉编码

Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab, 310023, Hangzhou, China(虎扑实验室,杭州,中国) Shanghai Jiao Tong University, China(上海交通大学,中国) Zhejiang University, China(浙江大学,中国) Fudan University, China(复旦大学,中国)

专题命中 预训练与数据 :pretraining(title)

AI总结 提出一种结合CNN-ViT混合编码器、疾病级对比学习和诊断感知提示的视觉语言预训练框架,在CT-RATE和Rad-ChestCT上取得最优性能,并提升零样本诊断可靠性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13695 2026-08-17 cs.CY cs.LG 新提交 70%

Language-Specific Gaps in AI Safety Training Datasets

AI安全训练数据集中的语言特定缺口

Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12574 2026-08-14 cs.AI cs.FL 新提交 70%

Trie Automata for Constrained Decoding over Large Finite Sets

用于大有限集上约束解码的Trie自动机

Xingzi Xu, Karim Bouyarmane

机构 * Amazon(亚马逊公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大型语言模型有限集约束解码的速度瓶颈,提出Trie自动机机制,通过预计算token掩码实现高效解码,在批量服务中吞吐量较XGrammar提升29倍,且编译与计算效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09526 2026-08-11 cs.CR cs.AI 新提交 70%

RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges

RangeFactory:可扩展多跳网络靶场构建框架

Hanlin Jiang, Puyi Wang, Jiandong Jin, Shaofei Li, Zhan Shen, Pengli Wang, Ziming Wang, Yifeng Cai, Ning Jia, Yuxin Ren, Peng Jiang, Yao Guo, Ding Li

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 RangeFactory是自动化网络靶场编排框架,可规模化构建多跳靶场;其构建的RangeBench含1148个靶场实例,发现智能体存在持续入侵差距,还生成了攻击轨迹语料库。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09049 2026-08-11 cs.CL 新提交 70%

Security and Privacy Taxonomy Generation from Mobile App Reviews

从移动应用评论生成安全与隐私分类体系

Moghis Fereidouni, Vinaik Chhetri, Umar Farooq, A. B. Siddique

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对现有安全隐私分类体系手工构建、无法适配海量应用评论的问题,提出TaxoScale流程,筛选60万条相关评论构建语料库,其在多指标上优于基线且发现新分支。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07540 2026-08-11 cs.AI 新提交 70%

TREAT: Evaluating Access to Formal Knowledge across Equivalent Mathematical Representations

TREAT:评估等价数学表示下的形式知识获取能力

Fateme Mazdarani, Carlos Toxtli

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基准TREAT,测试大型语言模型从保等价数学变换中识别定理身份的能力,发现模型表现不佳且存在多种失败模式,凸显形式知识表示鲁棒性的重要性。

Comments Accepted at 28th International Symposium on Symbolic and Numeric Algorithms for Scientific Computing (SYNASC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06196 2026-08-07 cs.AI 新提交 70%

Comparative Approaches to Agent Retrieval over Large Skill Libraries

基于大型技能库的智能体检索方法的比较研究

Indivara Kolluru, Nathan Sportsman

机构 * Praetorian

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究对比了混合排名器与类型化知识图谱在690个技能库的117个真实查询上的检索效果,发现添加结构无法提升强排名器的检索性能,明确了结构优化的适用条件。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06115 2026-08-07 cs.AI 新提交 70%

Mind the Gaps: Mixture-of-Minds for Human Simulation

关注差距:用于人类模拟的思维混合模型

Pranav Dahiya

机构 * Semilattice(半格)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Anacreon受众模拟模型,基于Gemma 4 12B构建思维混合模型,通过聚类个体、情感链等技术,在个体层面序数对齐达0.775,缩小了群体与个体模拟的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05759 2026-08-07 cs.CL 新提交 70%

How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

如何识别生词:上下文偏置方法与语音大语言模型的对比

Christian Huber, Alexander Waibel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比了基于Whisper的上下文偏置方法与语音LLMs在识别ASR中生词的性能,发现前者可大幅降低偏置词错误率,后者在朗读语音上表现好但泛化性差,最终为方法选择提供了权衡依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05088 2026-08-06 cs.LG 新提交 70%

MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning

MALT:通过对角预条件化实现的轻量曲率感知Muon

Tongle Wu, Huanyu Dong, Ying Sun, Ziye Ma

机构 * School of Electrical Engineering and Computer Science, The Pennsylvania State University(宾夕法尼亚州立大学电气工程与计算机科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对Muon未考虑损失景观曲率几何的问题,提出轻量曲率感知优化方法MALT及MALTER,在GPT-2系列预训练上性能优于Muon且开销相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03585 2026-08-05 cs.AI cs.CY 新提交 70%

From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities

从社交编码到智能体编码:开源社区中的生产力与关系重构

Mengying Zhou, Yongjie Yin, Yang Chen

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00705 2026-08-04 cs.IR cs.CL 新提交 70%

A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability

检索增强生成在多跳需求可追溯性中的三重鲁棒性分析

Meftun Akarsu, Burak Özdemir, Doğancan Büyükçolak, Recep Kaan Karaman

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文针对多跳需求可追溯性,开展三重鲁棒性分析,对比不同RAG架构、嵌入器等的表现,发现现有结论分歧的原因,提出需按该鲁棒性标准验证RAG架构主张。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00452 2026-08-04 cs.IR cs.AI 新提交 70%

CeQe: Grounding Lexical Retrieval in Semantic Evidence

CeQe:在语义证据中实现词汇检索

Adam Kahirov, Umesh Deshpande, Swaminathan Sundararaman

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对BM25的语义词汇鸿沟问题,本文提出CE-QE方法,利用交叉编码器的语义检索结果扩展BM25查询,在多个BEIR数据集上显著提升检索性能且不修改底层索引。

详情

展开后加载摘要…

URL PDF HTML 收藏