arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-27 至 2026-03-27 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2603.22459 2026-03-27 cs.CL cs.AI 86%

LLM-guided headline rewriting for clickability enhancement without clickbait

基于大语言模型的引导性标题重写以增强点击率而不产生标题党

Yehudit Aperstein, Linoy Halifa, Sagiv Bar, Alexander Apartsin

机构 * Intelligent Systems, Afeka Academic College of Engineering(阿菲卡工程学院智能系统系) School of Computer Science, Faculty of Sciences, HIT-Holon Institute of Technology(霍隆理工学院理学院计算机科学系)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种引导性标题重写框架,通过控制生成过程中的语言属性,在保持语义忠实的前提下提升标题吸引力,避免产生误导性内容。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14861 2026-03-27 q-bio.GN cs.AI q-bio.QM 85%

BMFM-RNA: whole-cell expression decoding improves transcriptomic foundation models

BMFM-RNA:全细胞表达解码改进转录组基础模型

Michael M. Danziger, Bharath Dandala, Viatcheslav Gurev, Matthew Madgwick, Sivan Ravid, Tim Rumbell, Akira Koseki, Tal Kozlovski, Ching-Huei Tsou, Ella Barkan, Tanwi Biswas, Jielin Xu, Yishai Shimoni, Jianying Hu, Michal Rosen-Zvi

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 通过全细胞表达解码方法,改进转录组基础模型,在下游任务中表现优于掩码语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25015 2026-03-27 cs.CL cs.AI cs.SE 85%

Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models

命令干扰:社会语体影响大语言模型中的指令拓扑

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究探讨了社会语体如何影响大语言模型中指令拓扑,通过多语言实验发现指令拓扑反转由社会语体调解,改写指令可减少跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24804 2026-03-27 cs.CV cs.AI cs.LG 84%

GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining

GoldiCLIP:平衡显式监督的Goldilocks方法用于语言-图像预训练

Deen Dayal Mohan, Hossein Souri, Vitali Petsiuk, Juhong Min, Gopal Sharma, Luowei Zhou, Suren Kumar

机构 * AI Center – Mountain View, Samsung Electronics(三星电子山景城AI中心)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GoldiCLIP通过平衡监督信号提出新框架,结合文本条件自蒸馏、编码器解码器与VQA目标及不确定性加权机制,在3000万数据下实现高效预训练,提升多任务检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24826 2026-03-27 cs.CL 83%

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

合成重写作为质量乘数:来自葡萄牙持续预训练的证据

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

机构 * Maritaca AI

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 该研究通过控制实验探讨合成重写在葡萄牙持续预训练中对数据质量的影响,发现高质量数据通过重写可提升模型性能,而低质量数据效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23211 2026-03-27 physics.geo-ph 82%

The NCS-Model: A seismic foundation model trained on the Norwegian repository of public data

NCS模型:基于挪威公共数据仓库的地震基础模型

Alba Ordonez, Theodor Johannes Line Forgaard, David Wade, Aina Juell Bugge, Hakon Nese, Anders Ueland Waldeland

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出NCS模型,通过挪威大陆架的公开DISKOS数据库预训练,开发大规模地震基础模型,提供可扩展的3D训练方法,并量化盆地定向预训练和嵌入维度对下游解释性能的影响。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25537 2026-03-27 cs.CL 79%

Humans vs Vision-Language Models: A Unified Measure of Narrative Coherence

人类与视觉-语言模型:叙事连贯性的一种统一衡量方法

Nikolai Ilinykh, Hyewon Jang, Shalom Lappin, Asad Sayeed, Sharid Loáiciga

机构 * University of Gothenburg(哥德堡大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究通过比较人类写作与视觉语言模型生成的叙事,评估视觉基础故事中的叙事连贯性,发现模型在连贯性方面与人类存在系统性差异。

Comments 9 pages of content, 1 page of appendices, 9 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05696 2026-03-27 cs.LG q-bio.QM 79%

SMILES-Mamba: Chemical Mamba Foundation Models for Drug ADMET Prediction

SMILES-Mamba:用于药物ADMET预测的化学Mamba基础模型

Bohao Xu, Yingzhou Lu, Chenhao Li, Ling Yue, Xiao Wang, Tianfan Fu, Minjie Shen, Lulu Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.LG

AI总结 SMILES-Mamba通过自监督预训练和微调策略,利用未标记和标记数据预测药物ADMET属性,在22个数据集上表现优异,提升分子属性预测准确性并减少对大规模标注数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25186 2026-03-27 cs.LG 77%

Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation

基于知识的检索增强生成用于零样本心理数据:隐私保护的合成数据生成

Adam Jakobsen, Sushant Gautam, Hugo Lewi Hammer, Susanne Olofsdotter, Miriam S Johanson, Pål Halvorsen, Vajira Thambawita

机构 * SimulaMet Oslo Metropolitan University(奥斯陆城市大学) Uppsala University(乌普萨拉大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种零样本知识引导框架,利用检索增强生成技术生成隐私保护的合成心理数据,通过对比CTGAN和TVAE模型,证明临床知识增强LLM在生成高质量、隐私保护的合成数据方面具有优势。

Comments Submitted to CBMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11770 2026-03-27 cs.CL cs.CY cs.SI 77%

The Value of Nothing: Multimodal Extraction of Human Values Expressed by TikTok Influencers

nothing的价值:通过TikTok影响者表达的人类价值观多模态提取

Alina Starovolsky-Shitrit, Alon Neduva, Naama Appel Doron, Itamar Gafni, Ella Daniel, Oren Tsur

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文研究通过TikTok影响者上传的视频提取隐含价值观,采用两阶段方法优于直接提取,使用少量样本的大语言模型在两个阶段表现更优,首次公开TikTok视频价值观标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24676 2026-03-27 cs.AI cond-mat.dis-nn cond-mat.stat-mech physics.bio-ph physics.soc-ph 77%

When Is Collective Intelligence a Lottery? Multi-Agent Scaling Laws for Memetic Drift in LLMs

集体智慧何时是一场彩票?LLM中膜etic漂移的多智能体缩放定律

Hidenori Tanaka

机构 * CBS–NTT Program in Physics of Intelligence(物理智能中心-NTT项目) Center for Brain Science(脑科学中心) Harvard University(哈佛大学) Physics of Artificial Intelligence Group(人工智能物理研究组) NTT Research, Inc.(NTT研究公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过QSG模型揭示LLM多智能体系统中集体共识的形成机制,发现共识可能由膜etic漂移驱动,提出基于群体规模、通信带宽等因素的缩放定律。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10000 2026-03-27 cs.LG cond-mat.other 70%

Neural Scaling Laws for Deep Regression

深度回归的神经扩展定律

Tilen Cadez, Kyoung-Min Kim

机构 * Asia Pacific Center for Theoretical Physics(亚太理论物理中心) Department of Physics(物理系) Pohang University of Science and Technology(坡山科学技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究深度回归模型中神经扩展定律,通过参数估计模型探讨回归性能与训练数据量和模型容量的幂律关系,发现损失与这些因素呈1到2之间的幂律关系。

Comments Supplementary Information will be provided with the published manuscript

Journal ref Machine Learning: Science and Technology, 7 025011 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17490 2026-03-27 cs.LG stat.ML 70%

Revisit, Extend, and Enhance Hessian-Free Influence Functions

重新审视、扩展和增强Hessian-Free影响函数

Ziao Yang, Han Yue, Jian Chen, Hongfu Liu

机构 * Brandeis University(布兰迪大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文重新审视TracIn方法,扩展其应用至公平性和鲁棒性,并通过集成策略增强其性能,通过合成数据和噪声标签检测等实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12118 2026-03-27 cs.SE 67%

Do Code LLMs Do Static Analysis?

代码LLM进行静态分析吗?

Chia-Yi Su, Collin McMillan

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 本文研究代码LLM在代码智能任务中的静态分析能力,发现LLM在静态分析任务中表现不佳,且预训练静态分析任务无法提升代码智能任务性能。

Comments 42 pages, 2 figures, Accepted at Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25687 2026-03-27 cs.LG 61%

On Neural Scaling Laws for Weather Emulation through Continual Training

关于通过持续训练进行天气仿真的神经扩展定律

Shashank Subramanian, Alexander Kiefer, Arnur Nigmetov, Amir Gholami, Dmitriy Morozov, Michael W. Mahoney

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 预训练与数据 :foundation model(abstract,comments);分类 cs.LG

AI总结 本文研究了科学机器学习中神经扩展定律,通过最小化设置的Swin Transformer架构和持续训练策略,展示了模型在预测天气中的性能提升及计算优化。

Comments ICLR Foundation Models for Science Workshop 2026, 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24477 2026-03-27 cs.SE cs.LG 57%

Composer 2 Technical Report

Composer 2 技术报告

Cursor Research, :, Aaron Chan, Ahmed Shalaby, Alexander Wettig, Aman Sanger, Andrew Zhai, Anurag Ajay, Ashvin Nair, Charlie Snell, Chen Lu, Chen Shen, Emily Jia, Federico Cassano, Hanpeng Liu, Haoyu Chen, Henry Wildermuth, Jacob Jackson, Janet Li, Jediah Katz, Jiajun Yao, Joey Hejna, Josh Warner, Julius Vering, Kevin Frans, Lee Danilek, Less Wright, Lujing Cen, Luke Melas-Kyriazi, Michael Truell, Michiel de Jong, Naman Jain, Nate Schmidt, Nathan Wang, Niklas Muennighoff, Oleg Rybkin, Paul Loh, Phillip Kravtsov, Rishabh Yadav, Sahil Shah, Sam Kottler, Alexander M Rush, Shengtong Zhang, Shomil Jain, Sriram Sankar, Stefan Heule, Stuart H. Sul, Sualeh Asif, Victor Rong, Wanqi Zhu, William Lin, Yuchen Wu, Yuri Volkov, Yury Zemlyanskiy, Zack Holbrook, Zhiyuan Zhang

机构 * Cursor Research

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 Composer 2 是一种专为智能软件工程设计的模型,通过两阶段训练提升长期规划和编码能力,其在真实软件问题上的表现优于前代模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04820 2026-03-27 cs.CL cs.CY 57%

Autoscoring Anticlimax: A Meta-analytic Understanding of AI's Short-answer Shortcomings and Wording Weaknesses

自评分的反高潮:对AI在简答短处和用词弱点的元分析理解

Michael Hardy

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文通过元分析研究AI在简答评分中的不足,发现人类评分难度对LLM性能无显著影响,且某些人类易评任务对LLM更难,同时探讨了LLM技术对评分的影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03083 2026-03-27 quant-ph 50%

Dual-VQE: A quantum algorithm to lower bound the ground-state energy

双VQE:一种用于降低基态能量下限的量子算法

Hanna Westerheim, Jingxuan Chen, Zoë Holmes, Ivy Luo, Theshani Nuradha, Dhrumil Patel, Soorya Rethinasamy, Kathie Wang, Mark M. Wilde

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出双VQE算法,通过半正定规划对偶性将基态优化问题转化为受约束最大化问题,并通过变分量子算法求解。该算法能提供基态能量的下限估计,与VQE互补用于验证解的质量。

Comments v3: 15 pages, 8 figures, accepted for publication in Physical Review A

Journal ref Physical Review A, vol. 113, no. 3, page 032443, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25038 2026-03-27 cs.RO 50%

$π$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation

$π$, 但使其飞行:基于物理的VLA模型向空中操作的转移

Johnathan Tucker, Denis Liu, Aiden Swann, Allen Ren, Javier Yu, Jiankai Sun, Brandon Kim, Lachlain McGranahan, Quan Vuong, Mac Schwager

机构 * Stanford University(斯坦福大学) Physical Intelligence

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出AirVLA系统,研究预训练VLA模型在空中抓取任务中的迁移性,通过引入负载感知指导机制和高斯点扩散管道合成数据,提升空中操作性能,实现导航任务100%成功和抓取任务50%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏