arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-22 至 2026-05-22 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 24 篇

2506.16659 2026-05-22 cs.LG cs.AI math.OC 91%

Memory-Efficient LLM Pretraining via Minimalist Optimizer Design

通过最小化优化器设计实现内存高效的LLM预训练

Athanasios Glentis, Jiaxiang Li, Andi Han, Mingyi Hong

机构 * Department of Electrical and Computer Engineering, University of Minnesota, USA(电气与计算机工程系,明尼苏达大学,美国) School of Mathematics and Statistics, University of Sydney, Australia(数学与统计学学院,悉尼大学,澳大利亚)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了如何通过简单的优化器设计改进,使SGD在预训练中达到最先进的性能,提出了SCALE优化器,在内存使用上比Adam更高效,并在多个模型上表现优于现有内存高效的优化器。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21537 2026-05-22 cs.SE 91%

Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization

言辞清晰却错误:基于LLM的代码现代化中的自我审查失败

Gokul Chandra Purnachandra Reddy, Aditya Lolla, Harsha Sanku

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在使用大型语言模型(LLM)将遗留代码迁移到现代栈时,LLM是否能够识别其自身输出是否改变了可观察行为,发现自我审查不可靠,且存在语义保持漂移等问题。

Comments 11 pages, 6 figures, 2 tables. Corpus, oracle, output extractor, prompts, harness, self-review probe, and all 1,980 + 1,979 raw model outputs released as supplementary material at https://zenodo.org/records/20300861

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21845 2026-05-22 cs.CL cs.AI 91%

Comparing LLM and Fine-Tuned Model Performance on NVDRS Circumstance Extraction with Varying Prompt Complexity

对比LLM和微调模型在不同提示复杂度下的NVDRS情境提取性能

Geoffrey Martin, Xuan Zhong Feng, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine(人群健康科学系,威尔·康奈尔医学学院) Systems Engineering, Cornell University(系统工程,康奈尔大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在不同提示复杂度下,LLM与微调模型在NVDRS情境提取任务中的表现差异,提出了一种复杂度评分算法,并展示了一个混合方法,通过不同情境选择提示策略,发现LLM在低 prevalence 情境中表现更优,且框架能跨不同前沿LLM通用。

Comments Accepted at IEEE ICHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12744 2026-05-22 cs.LG 90%

Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity

静息神经元,主动洞察:通过自发性增强LLM中的激活稀疏性

Haotian Xu, Jiannan Yang, Tian Gao, Tsui-Wei Weng, Tengfei Ma

机构 * IBM Thomas J. Watson Research Center, Yorktown Heights, USA(IBM 托马斯·J·沃森研究中心,美国Yorktown Heights) Halıcıoğlu Data Science Institute, UC San Diego, La Jolla, USA(哈利奇欧数据科学研究所,美国UC圣地亚哥La Jolla) Stony Brook University, Stony Brook, USA(史泰文·布鲁克大学,美国Stony Brook)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种通过引入自发神经元(SPON)来增强LLM中激活稀疏性的方法,解决了高稀疏率下模型精度下降的问题,通过分布匹配训练SPON,使模型在稀疏计算中保持稳定和泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22613 2026-05-22 cs.LG 90%

Evolutionary Multi-Task Optimization for LLM-Guided Program Discovery

为LLM引导的程序发现设计的进化多任务优化

Halil Alperen Gozeten, Xuechen Zhang, Emrullah Ildiz, Ege Onur Taga, Tara Javidi, Samet Oymak

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出了一种进化多任务优化(EMO)方法,用于LLM引导的程序发现,通过两个阶段框架EMO-STA(共享后适应)在多个任务家族中提高了程序发现的效率和鲁棒性,同时展示了共享进化在减少过拟合方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08362 2026-05-22 cs.CL cs.AI cs.LG 89%

Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces

迈向真实世界的人类行为模拟:在长时间跨度、跨场景、异质行为轨迹上对大语言模型进行基准测试

Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong Du, Tingting Gao, Yaojie Lu, Yingfei Sun, Xianpei Han, Le Sun, Xiangyu Wu, Hongyu Lin

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OmniBehavior基准测试,通过真实世界数据整合长周期、跨场景和异质行为模式,揭示现有模型在模拟复杂人类行为时的局限性,包括对正向平均人的趋同、人格同质化和乌托邦偏见,为未来高保真模拟研究指明方向。

Comments Project page: https://OmniBehavior.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04768 2026-05-22 cs.LG cs.AI 84%

Billion-Scale Graph Foundation Models

十亿级图基础模型

Maya Bechler-Speicher, Yoel Gottlieb, Andrey Isakov, David Abensur, Ami Tavory, Daniel Haimovich, Ido Guy, Udi Weinsberg

机构 * Meta

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphBFF,一种用于构建大规模异构图的十亿参数图基础模型的端到端方法,通过引入GraphBFF Transformer架构,揭示了异构图的神经缩放定律,并在多个下游任务中展示了其优越的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22403 2026-05-22 cs.CV 83%

Translating Signals to Languages for sEMG-Based Activity Recognition

将信号转换为语言以实现基于sEMG的活动识别

Ming Wang, Haoxuan Qu, Qiuhong Ke, Wei Zhou, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Monash University(墨尔本大学) Cardiff University(卡迪夫大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种基于大语言模型的sEMG活动识别框架,通过将连续sEMG信号转换为语言形式,提升活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21835 2026-05-22 eess.IV cs.AI cs.CV physics.med-ph 83%

An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation

一种开放的多中心全身FDG PET/CT基础模型用于肿瘤分割

Xiaofeng Liu, Qianru Zhang, Thibault Marin, Menghua Xia, Chi Liu, Georges El Fakhri, Jinsong Ouyang

机构 * Department of Radiology and Biomedical Imaging, Yale Biomedical Imaging Institute, Yale University(放射学与生物医学成像系,耶鲁生物医学影像研究所,耶鲁大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种开放的多中心全身FDG PET/CT基础模型,通过整合四个公开数据集中的4997份标准化扫描,利用层次UNet结构和早期通道拼接实现解剖和代谢特征的交互,提高了肿瘤分割的标签效率和跨模态表征学习能力。

Comments Code available at: https://github.com/liu-xiaofeng/Foundation-Model-for-PET-CT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21812 2026-05-22 cs.IR 82%

Bridging the Cold-Start Gap: LLM-Powered Synthetic Data Generation for Natural Language Search at Airbnb

弥合冷启动缺口:利用大语言模型生成合成数据用于Airbnb的自然语言搜索

Wendy Ran Wei, Hao Li, Weiwei Guo, Xiaowei Liu, Xueyin Chen, Dillon Davis, Malay Haldar, Soumyadip Banerjee, Kedar Bellare, Huiji Gao, Stephanie Moyerman, Sanjeev Katariya

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型生成合成查询和标签的方法,解决自然语言搜索系统中冷启动问题,通过生成真实用户数据的过渡来提升模型训练和评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00688 2026-05-22 cs.LG 81%

Provably Protecting Fine-Tuned LLMs from Training Data Extraction while Preserving Utility

可证明地保护微调的LLM免受训练数据提取攻击同时保持效用

Tom Segal, Asaf Shabtai, Yuval Elovici

机构 * Department of Software and Information Systems Engineering, Ben-Gurion University of the Negev, Beer Sheva, Israel(软件与信息系统工程系,内盖夫本·古里安大学,贝尔谢巴,以色列)

专题命中 预训练与数据 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于近访问自由(NAF)的算法SCP-Δ_r,通过相对概率和基础模型对低影响token进行平滑处理,从而在理论上有更优的界限,并在实践中有效抵御训练数据提取攻击,同时保持性能损失最小。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21623 2026-05-22 cs.AI 81%

The Shape of Testimony: A Scalable Framework for Oral History Archive Comparison

证词的形态:一种可扩展的口述史档案比较框架

Itamar Trainin, Renana Keydar, Amit Pinchevski

机构 * Hebrew University of Jerusalem(海法大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过大规模计算分析超过1600个口述史档案,探讨了犹太人大屠杀研究中两种口述证词风格的区别,并提出一种可扩展的比较语料库分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21515 2026-05-22 cs.LG cs.AI 79%

Predicting Performance of Symbolic and Prompt Programs with Examples

通过示例预测符号程序和提示程序的性能

Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

机构 * Nanayang Technological University, Singapore(南洋理工大学,新加坡) Massachusetts Institute of Technology, USA(麻省理工学院,美国) Cornell University, USA(康奈尔大学,美国)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过示例预测程序性能的问题,提出了一种基于简单硬币翻转模型的方法,利用观察到的执行结果和性能先验知识来预测程序性能,并开发了RAP方法来构建代理先验以提高预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22651 2026-05-22 cs.CV 78%

What Does the Caption Really Say? Counterfactual Phrase Intervention for Compositional Data Selection in Vision-Language Pretraining

图中标签真的在说些什么?用于视觉语言预训练中组合数据选择的反事实短语干预

Hyejin Go, Semi Lee, Hyesong Choi

机构 * Soongsil University(顺斯尔大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文研究了在视觉语言预训练中如何通过反事实短语干预来改进组合数据选择,提出了CPI方法以解决现有方法中全局过滤信号失效的问题,从而提升模型在关系识别任务上的表现。

Comments 11 pages, 2 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21540 2026-05-22 cs.SI cs.AI cs.CL cs.CY 73%

Detecting Synthetic Political Narratives in Cross-Platform Social Media Discourse

在跨平台社交媒体讨论中检测合成政治叙述

Despoina Antonakaki, Sotiris Ioannidis

机构 * Institute of Computer Science, Foundation for Research and Technology(计算机科学研究所,希腊研究与技术基金会) Technical University of Crete(希腊克里特技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种跨平台框架,通过四个协调信号(词汇多样性、时间爆发性、修辞重复和语义同质性)组合成合成叙述协调评分SNC(C),以检测合成政治叙述,研究发现IntelSlava在四个事件窗口中排名第一,而Rybar尽管语义同质性高但因语言差异导致表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22538 2026-05-22 cs.CV 67%

Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking

基于运动、几何和语义适应的复杂非线性视觉目标跟踪

Deyi Zhu, Yuji Wang, Yong Liu, Yansong Tang, Bingyao Yu, Jiwen Lu, Jie Zhou

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出SAMOSA框架,通过显式利用运动、几何和语义线索,改进SAM 2在复杂非线性视觉目标跟踪中的表现,实现了更鲁棒和通用的跟踪方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22484 2026-05-22 cs.CV 67%

Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling

监督分类头作为语义原型:通过权重重用解锁视觉-语言对齐

David Méndez, Roberto Confalonieri, Natalia Díaz Rodríguez

机构 * Department of Computer Science and Artificial Intelligence, DaSCI Institute, University of Granada, Granada, Spain(计算机科学与人工智能系,DaSCI研究所,格拉纳达大学,格拉纳达,西班牙) Department of Mathematics ``Tullio Levi-Civita'', University of Padova, Padova, Italy(托里利-西维塔数学系,帕多瓦大学,帕多瓦,意大利)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 本文提出利用预训练视觉模型的分类头作为语义原型,通过权重重用实现视觉-语言对齐,提升跨模态检索、零样本和少样本分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22201 2026-05-22 cs.CV 67%

Zero-Shot Temporal Action Localization Through Textual Guidance

通过文本指导实现零样本时间动作定位

Benedetta Liberatori, Alessandro Conti, Lorenzo Vaquero, Paolo Rota, Yiming Wang, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯瑟勒基金会)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出TEGU方法,通过利用大规模语言模型和结构化文本提取的丰富文本信息,解决零样本时间动作定位中因缺乏训练监督导致的细粒度动作分类困难问题,实验表明该方法在THUMOS14和ActivityNet-v1.3数据集上优于现有方法。

Comments Accepted to FG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22391 2026-05-22 cs.AI cs.CL cs.CY 62%

Epicure: Navigating the Emergent Geometry of Food Ingredient Embeddings

Epicure:探索食品成分嵌入的涌现几何

Jakub Radzikowski, Josef Chen

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Epicure,一种基于三兄弟skip-gram模型重新训练的食品成分嵌入方法,通过多语言食谱语料库构建了包含1790个标准成分的嵌入模型,并通过三种不同的随机游走方案生成了不同侧重的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22221 2026-05-22 cs.LG cs.AI cs.LO 62%

Can Transformers Learn to Verify During Backtracking Search?

Transformer能否在回溯搜索中学习验证?

Yin Jun Phua, Tony Ribeiro, Tuan Nguyen, Katsumi Inoue

机构 * Yin Jun Phua (corresponding author) Institute of Science Tokyo, 2-12-1 Ookayama, Meguro-ku, Tokyo 152-8550, Japan Tony Ribeiro Centrale Nantes, CNRS, Laboratoire des Sciences du Num\'erique de Nantes, LS2N, UMR 6004, F-44000 Nantes, France National Institute of Informatics, 2-1-2 Hitotsubashi, Chiyoda-ku, Tokyo 101-8430, Japan Steelous Protocol, 8-20-32, Ginza, Chuo-ku, Tokyo 104-0061, Japan Tuan Nguyen Hanoi University of Science Technology, No. 1 Dai Co Viet, Hai Ba Trung, Ha Noi, Vietnam Katsumi Inoue National Institute of Informatics, 2-1-2 Hitotsubashi, Chiyoda-ku, Tokyo 101-8430, Japan

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了Transformer在回溯搜索中的验证能力,指出传统方法在处理轨迹数据时存在散列检索和历史纠缠问题,并提出局部化和选择性状态注意力(SSA)来解决这些问题,通过实验验证了SSA在3-SAT、图着色、Blocks World和回溯解析等任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02889 2026-05-22 stat.ML cs.AI cs.LG 62%

Rethinking Forward Processes for Score-Based Nonlinear Data Assimilation in High Dimensions

重新思考高维数据同化中的分数基非线性数据同化前向过程

Eunbi Yoon, Won Chang, Donghan Kim, Dae Wook Kim

机构 * KAIST(韩国科学技术院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种针对数据同化问题的改进前向过程,用于高维非线性系统的状态估计,通过改进的分数基滤波器在测量空间中转换系统状态,提高了同化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22338 2026-05-22 cs.LG 57%

Physics-Informed Generative Solver: Bridging Data-Driven Priors and Conservation Laws for Stable Spatiotemporal Field Reconstruction

物理引导的生成求解器:连接数据驱动先验与守恒定律以稳定时空场重建

Ziyuan Zhu, Keyu Hu, Zhifei Chen, Yuhao Shi, Ming Bao, Jing Zhao, Gang Wang, Haitan Xu, Jiadong Li, Qijun Zhao, Xiaodong Li, Minghui Lu, Yanfeng Chen

机构 * School of Advanced Manufacturing Engineering, Nanjing University(南京大学先进制造工程学院) National Laboratory of Solid State Microstructures, Nanjing University(南京大学固态微结构国家实验室) Suzhou Acoustics Industry Technology Research Institute Co., Ltd.(苏州声学工业技术研究所有限公司) School of Mechanical and Electric Engineering, Soochow University(苏州大学机械与电子工程学院) Shishan Laboratory, Nanjing University(仙山实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种物理引导的生成求解器,通过分离稳定的先验学习与推理时的守恒定律强制执行,解决了从稀疏测量中重建连续物理场的问题,同时在声学和气象学中实现了高效且稳定的场重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20302 2026-05-22 cs.LG cs.CV 57%

Neural Collapse by Design: Learning Class Prototypes on the Hypersphere

按设计实现神经崩溃:在超球面上学习类别原型

Panagiotis Koromilas, Theodoros Giannakopoulos, Mihalis A. Nicolaou, Yannis Panagakis

机构 * The Cyprus Institute(塞浦路斯研究所) University of Athens(雅典大学) Archimedes AI/Athena Research Center(阿基米德AI/阿泰纳研究中心) University of Cyprus(塞浦路斯大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文研究了监督分类的理论最优解神经崩溃(NC),指出交叉熵(CE)和监督对比学习(SCL)两种主流范式在实践中无法达到该最优解。作者提出通过在超球面上对比原型的方法,改进了CE和SCL,从而在多个基准测试中实现了更接近NC的性能。

Comments 43rd International Conference on Machine Learning (ICML 2026); Code: https://github.com/pakoromilas/nc_by_design

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00756 2026-05-22 cs.CR 50%

LeakyCLIP: Extracting Training Data from CLIP

LeakyCLIP: 从CLIP中提取训练数据

Yunhao Chen, Shujie Wang, Xin Wang, Ran He, Xingjun Ma, Yu-Gang Jiang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文研究了CLIP中数据记忆和提取风险,提出LeakyCLIP攻击框架,通过改进的图像重建方法实现了高质量的语义准确重建,并揭示了训练数据泄露的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏