arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 10821 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2606.17340 2026-06-17 cs.CV cs.AI 新提交 79%

Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation

几何一致的内窥镜表示用于图像引导导航:基于结构化基础模型适配

Hongchao Shu, Roger D. Soberanis-Mukul, Hao Ding, Morgan Ringel, Mali Shen, Saif Iftekar Sayed, Hedyeh Rafii-Tari, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Semaphor Surgical Johnson & Johnson MedTech(强生医疗科技)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 提出统一框架,结合合成数据管道与层级感知几何语义适配,学习几何一致且领域鲁棒的图像表示,提升单目内窥镜中的位姿估计与深度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12867 2026-06-17 cs.LG 新提交 79%

SMGFM: Spectral Multimodal Graph Pretraining for Multimodal-Attributed Graphs

SMGFM: 面向多模态属性图的谱多模态图预训练

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出SMGFM框架,利用图频谱分解区分结构诱导语义与模态特有语义,通过频带路由实现跨模态融合,在图级和模态级任务上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13370 2026-06-12 cs.AI 新提交 79%

A Quantitative Experimental Repeated Measures Study of Training Dynamics in a Small Llama Style Language Model Under a Compute-Aware Token Budget

在计算感知令牌预算下小型Llama风格语言模型训练动态的定量实验重复测量研究

Joe Dwyer

机构 * Department of Computer Information Science, ECPI University(ECPI大学计算机信息科学系)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 本研究通过重复测量设计,分析在固定计算预算下训练小型Llama模型时,验证损失、困惑度等指标随令牌数变化的动态,发现早期快速改进后出现非单调退化,表明计算感知评估应关注训练轨迹而非终点指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11508 2026-06-11 cs.LG q-bio.QM 新提交 79%

Probabilistic Contrastive Pretraining for Multi-task ADME Property Prediction

概率对比预训练用于多任务ADME性质预测

Yifan Xue, Srimukh Prasad Veccham, Saee Paliwal, Tyler Shimko, Micha Livne

机构 * NVIDIA(英伟达)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出分子图-Transformer预训练框架,结合化学自监督与对比互信息,通过统一概率潜变量目标优化重构、对比和化学任务,在多任务微调中采用任务特定MLP头,在三个数据集上平均提升7.6%-9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07066 2026-06-09 cs.CL 新提交 79%

Modeling semantic association in self-paced reading with language model embeddings

使用语言模型嵌入建模自定步速阅读中的语义关联

Sara Møller Østergaard, Kenneth Enevoldsen, Afra Alishahi, Bruno Nicenboim

机构 * Department of Computational Cognitive Science, Tilburg University(蒂尔堡大学计算认知科学系) Center for Humanities Computing, Aarhus University(奥胡斯大学人文计算中心)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究使用语言模型嵌入的十种实现方式量化语义关联,通过贝叶斯模型分析其对N400和自定步速阅读时间的影响,发现句子嵌入能可靠捕捉超出词可预测性的语义关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06738 2026-06-08 cs.CL 新提交 79%

Modular Monolingual Adaptation using Pretrained Language Models

使用预训练语言模型的模块化单语适应

Nalin Kumar, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics Institute of Formal and Applied Linguistics(查尔斯大学数学与物理系形式与应用语言学研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 提出一种模块化方法,通过替换标记、冻结对应嵌入并调整模型其余部分,在低资源语言上提升NLU任务性能,优于全模型微调。

Comments Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06015 2026-08-07 cs.LG cs.AI 新提交 79%

ProDVI: Programmatic Dynamics Priors for Value Network Initialization

ProDVI:用于价值网络初始化的程序化动态先验

Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 ProDVI是利用大型语言模型生成的Python函数初始化RL智能体的框架,通过预训练价值网络编码器,提升无模型RL算法的样本效率,无需依赖数据集或模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08646 2026-07-10 cs.CL cs.AI 新提交 79%

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX:通过自适应编程编辑大规模精炼预训练数据

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

机构 * Peking University(北京大学) ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08011 2026-07-10 cs.CR cs.AI cs.IR cs.LG 新提交 79%

Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions

小心你的自动补全内容:后门代码补全的取证溯源

Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(德克萨斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大型语言模型代码补全易受后门攻击的问题,提出CodeTracer取证框架,它仅靠微调语料库和错误补全事件,提取行为指纹,经推理将不安全逻辑归因于特定后门数据,评估显示其有高准确性、低误识率和强鲁棒性。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30700 2026-07-01 cs.SD cs.AI cs.LG eess.AS eess.SP 新提交 79%

BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations

BEST-RQ-2:先上下文化再预测——自监督音频表示的两步方法

Ludovic K. Tuncay, Etienne Labbé, Thomas Pellegrini

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出BEST-RQ-2,通过两步式上下文化-预测预训练方案,使用ViT编码器和轻量预测器,在保持推理计算不变下提升跨域迁移性能。

Journal ref Interspeech 2026, Sep 2026, Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14325 2026-06-15 cs.CL cs.AI 新提交 79%

Achieving Precise Text-To-Cypher Via Grounded Knowledge Graph Data Generation

通过基于知识图谱的数据生成实现精确的文本到Cypher转换

Francesco Cazzaro, Jessica Lennon, Ariadna Quattoni

机构 * Universitat Politècnica de Catalunya(波兰理工大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种自动合成数据生成方法,微调小型LLM以提升Text2Cypher性能,使其在本地部署中与大型专有模型竞争,保障数据主权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09658 2026-06-09 cs.LG cs.AI 新提交 79%

Muon Learns More Robust and Transferable Features than Adam

Muon 比 Adam 学习更鲁棒和可迁移的特征

Tianyu Ruan, Fengzhuo Zhang, Shuche Wang, Shihua Zhang

机构 * Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过鲁棒性和可迁移性视角,证明 Muon 优化器相比 Adam 和 SGD 能学习到更鲁棒、更可迁移的特征,并通过理论分析支持了经验发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06679 2026-06-08 cs.CL cs.AI cs.CY 新提交 79%

HKJudge: A Legal Discourse-Annotated Corpus for Interpreting What Courts Find, How They Reason, and What They Rule

HKJudge:用于解释法院认定事实、推理过程和裁决结果的法律话语标注语料库

Xi Xuan, Wenxin Zhang, Yufei Zhou, King-kui Sin, Chunyu Kit

机构 * City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个句子级专家标注的法律话语数据集HKJudge,包含香港各级法院刑事判决,设计双层话语模式(26种修辞角色和3种判刑要素),并基于BERT和LLM进行基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09264 2026-08-11 cs.CV 新提交 78%

Task-Adaptive 3D Cross-Field MRI Translation via Field-Conditioned Content-Style Pretraining

基于场条件内容-风格预训练的任务自适应3D跨场MRI转换

Haowen Pang, Yingqi Hao, Pengli Zhu

机构 * School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院) School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(清华大学医学院生物医学工程学院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 针对跨场MRI转换的域偏移问题,提出基于场条件内容-风格预训练的3D非配对转换框架,适配三项挑战赛任务,可保留三维解剖结构。

Comments MICCAI 2026 Workshop on MRIxFields

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08191 2026-08-11 cs.CV 新提交 78%

BAP-MOS: Bandit-Based Adaptive Prompting for Boundary-Sensitive Multi-Organ Segmentation

BAP-MOS:面向边界敏感型多器官分割的基于多臂老虎机的自适应提示

Satvik Praveen, Shengji Jin, Ahmed Lamidi, Xin Qian, Yi Sheng

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 该研究提出BAP-MOS自适应提示框架,将提示选择转化为多臂老虎机问题,在多器官超声分割基准上显著降低边界误差,泛化能力良好且无需修改模型主干。

Comments 9 pages, 5 figures. Source code available at https://github.com/SatvikPraveen/BAP-MOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07984 2026-08-11 cs.CV 新提交 78%

AgriField-40K: Adapting Vision Models to Agriculture With Efficient Continual Pretraining

AgriField-40K:通过高效持续预训练使视觉模型适配农业场景

Vasileios Tzouras, Paraskevas Pegios, Lazaros Nalpantidis

机构 * Technical University of Denmark (DTU)(丹麦技术大学(DTU)) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 针对农业计算机视觉依赖昂贵标注与模型适配成本高的问题,构建含17种公开资源的AgriField-40K数据集,提出参数高效的AgriMAE方法,可少用9倍可训练参数实现与全微调相当甚至更优的下游性能,为农业视觉持续预训练提供实用资源。

Comments Accepted at the Computer Vision in Plant Phenotyping and Agriculture (CVPPA) Workshop at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01620 2026-08-04 eess.SP 新提交 78%

Smartwatch Photoplethysmography-Derived Heart Age via ECG-Guided Cross-Modal Pretraining as a Digital Biomarker of Vascular Aging

通过心电引导跨模态预训练从智能手表光体积描记术衍生的心龄作为血管衰老的数字生物标志物

Donglin Xie, Xueying Gui, Yutian Zhu, Feng Xu, Guangkun Nie, Chenyang Xu, Jun Li, Shuailong Tang, Xiaoyu Li, Qi Xie, Yelei Li, Shenda Hong

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究开发心电引导跨模态框架,利用智能手表PPG衍生的心龄差作为数字生物标志物,证实其与动脉僵硬度、高血压显著相关,可用于血管衰老评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01535 2026-08-04 cs.CV cs.RO 新提交 78%

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision

STAR-VLM:基于汽车雷达监督的时空视觉语言模型,用于运动与速度估计

Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai, Hemanth Murali, Yi Liu, Rui-Yu Lin, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 该研究提出STAR-VLM框架,利用汽车雷达监督提升时空视觉语言模型的运动推理与度量速度估计能力,在驾驶场景相关任务上实现了优于特定任务方法的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00231 2026-08-04 cs.CV 新提交 78%

Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining

学习多少,而非仅学习是什么:用于CT视觉-语言预训练的跨患者负担顺序

Guoliang You, Haifan Gong, Xiaomeng Chu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究提出Spectrum框架,利用跨患者弱负担顺序补充解剖感知对应关系,无需纵向数据即可学习负担感知CT表示,在CT-RATE和RAD-ChestCT数据集上取得良好性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26346 2026-07-30 math.ST cs.SI stat.ME stat.ML stat.TH 新提交 78%

Toward a Unified Statistical Theory of Unsupervised Pretraining and Supervised Neural Knowledge Graph Learning

迈向无监督预训练与监督神经知识图谱学习的统一统计理论

Jifan Zhang, Miklos Racz, Suqi Liu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究针对知识图谱学习中数据与理论问题,提出含无监督预训练与监督学习的两阶段框架,建立非渐近风险界,经合成与真实实验验证其有效性。

Comments 49 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21953 2026-07-27 cs.CV eess.SP 新提交 78%

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model

通过全景感知和视觉语言模型进行低空信道多径预测

Zihang Zeng, Shu Sun, Meixia Tao, Zhiyong Chen, Jianhua Mo, Xiangwen Gu

专题命中 预训练与数据 :language model(title,abstract)

AI总结 针对无人机通信中传统信道预测方法的局限,提出基于全景感知和视觉语言模型的PanoLAMP框架,利用预训练模型及全景观测捕捉特征预测多径参数,实验显示其在多径参数、统计指标及泛化性上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13892 2026-07-16 cs.CV 新提交 78%

Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding

用于CT理解的基于器官条件模式令牌的细粒度视觉语言预训练

Guoliang You, Xiaomeng Chu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 研究从CT扫描和报告进行视觉语言预训练的难题,提出OCP-CT框架,通过保留全局对比分支、引入器官模式接口等方法,在公开基准上实现零样本异常诊断,相比先前结果有显著AUROC增益。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01594 2026-07-03 eess.AS 新提交 78%

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

面向低资源场景的声学-发音反演的多目标预训练增强方法

Jesuraj Bandekar, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出一种多目标预训练方法,利用音素标签、发音特征标签和关键发音器官标签,在低资源场景下提升声学-发音反演性能,同时降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00038 2026-07-02 cs.SE 新提交 78%

Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting

停止手把手指导你的编码智能体:设计替代逐步提示的循环机制

Sandeco Macedo

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 本文提出循环规范作为替代逐步提示的编码智能体新范式,定义其结构、分类与设计原则,并通过真实语料分析验证其成熟度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30749 2026-07-01 cs.RO 新提交 78%

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation

从抓取到灵巧:大规模抓取预训练用于灵巧操作

Ying Yuan, Xinyu Liu, Sriram Krishna, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。

Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30922 2026-07-01 cond-mat.other 新提交 78%

An Interaction Language Model: Mechanism Discovery from Statistical Patterns of Physical Interactions

交互语言模型:从物理交互的统计模式中发现机制

Triparna Ganguly, Hanqi Jiang, Xinliang Li, Yi Pan, Junhao Chen, Miyuki Karunathilaka, Tianming Liu, Yohannes Abate

专题命中 预训练与数据 :language model(title,abstract)

AI总结 提出交互语言模型(ILM),通过统计学习物理交互的依赖关系,推断交互路径、识别缺失步骤并预测下一步交互,在分子扩散任务中实现可审计的机制发现。

Comments Corresponding authors: Tianming Liu, Yohannes Abate

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27295 2026-06-29 cs.RO 新提交 78%

LA4VLA: Learning to Act without Seeing via Language-Action Pretraining

LA4VLA:通过语言-动作预训练实现无视觉行动学习

Tao Lin, Yuxin Du, Yiran Mao, Zewei Ye, Yilei Zhong, Bing Cheng, Yiming Wang, Jiting Liu, Yang Tian, Junchi Yan, Feiran Wu, Zenan Meng, Hu Wei, Yuqian Fu, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) KAUST(阿卜杜拉国王科技大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出LA4VLA框架,通过语言-动作预训练学习动作先验,减少对视觉线索的依赖,提升VLA策略的鲁棒性,在仿真和真实任务中成功率显著提升。

Comments Github: https://github.com/MINT-SJTU/LA4VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24080 2026-06-24 eess.AS 新提交 78%

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

音频-图像对齐作为持续预训练阶段改善低资源ASR

Sujith Pulikodan, Nihar Desai, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出在预训练和监督微调之间引入音频-图像表示对齐阶段,利用Vaani数据集中的配对数据,无需转录即可提升低资源ASR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24120 2026-06-24 cs.CV eess.IV 新提交 78%

Flood Mapping from RGB imagery using a Vision Foundation Model

使用视觉基础模型从RGB图像进行洪水制图

Vladyslav Polushko, Tilman Bucher, Ronald Rösch, Thomas März, Markus Rauhut, Andreas Weinmann

机构 * ACIDA Lab(ACIDA实验室)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 研究利用卫星预训练的地球观测基础模型Prithvi-2.0-UPN,通过微调适应厘米级RGB洪水制图,在零样本和少量样本迁移中取得优于CNN和小型ViT的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23113 2026-06-23 cs.CV 新提交 78%

Technical Report for the ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Pretraining-Diverse Ensemble of Foundation Vision Encoders for Robust Outdoor Scene Understanding

ICRA 2026 GOOSE 2D细粒度语义分割挑战赛技术报告:面向鲁棒户外场景理解的预训练多样化基础视觉编码器集成

Boyan Wang, Yongxi Huang, Wenjing Li, Tianrui Hui, Shaofei Huang, Nan Pu, Zhun Zhong

机构 * LION Lab, Hefei University of Technology(合肥工业大学 LION 实验室) University of Macau(澳门大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本方案集成DINOv3、SigLIP2和InternImage三种预训练互补的视觉编码器,搭配Mask2Former解码器及长训练、EMA等策略,在GOOSE挑战赛56类细粒度分割中获75.40% mIoU,夺得第二名,并发现编码器预训练策略是精度主导因素。

详情

展开后加载摘要…

URL PDF HTML 收藏