arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

1609.03777 2017-02-03 cs.LG cs.CL cs.NE 81%

Character-Level Language Modeling with Hierarchical Recurrent Neural Networks

Kyuyeon Hwang, Wonyong Sung

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

Comments Submitted to NIPS 2016 on May 20, 2016 (v1), accepted to ICASSP 2017 (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.01192 2016-11-23 cs.CL cs.LG 81%

Personalizing Universal Recurrent Neural Network Language Model with User Characteristic Features by Social Network Crowdsouring

Bo-Hsiang Tseng, Hung-Yi Lee, Lin-Shan Lee

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

Comments IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2015), 13-17 Dec 2015, Scottsdale, Arizona, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
1206.6426 2016-06-07 cs.CL cs.LG 81%

A Fast and Simple Algorithm for Training Neural Probabilistic Language Models

Andriy Mnih, Yee Whye Teh

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

Comments Appears in Proceedings of the 29th International Conference on Machine Learning (ICML 2012)

Journal ref In Proceedings of the 29th International Conference on Machine Learning, pages 1751-1758, 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.01913 2016-04-06 cs.CL cs.LG cs.NE stat.ML 81%

A Latent Variable Recurrent Neural Network for Discourse Relation Language Models

Yangfeng Ji, Gholamreza Haffari, Jacob Eisenstein

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

Comments NAACL 2016 camera ready, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26467 2026-06-26 cs.LG 新提交 80%

A Causal Foundation Model for Structure and Outcome Prediction

用于结构与结果预测的因果基础模型

Max Zhu, Martino Mansoldo, Ching-Hao Wang, Stefan Groha

机构 * University of Cambridge, United Kingdom(英国剑桥大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 提出TabPFN-CFM,一种能处理多种因果问题的因果基础模型,从观测数据预测因果结构和结果,支持Pearl因果层次所有三层查询,在合成数据上训练并泛化到真实数据,优于结构和结果预测基线。

Comments 20 pages, 7 figures, 17 tables, 43rd ICML Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13647 2026-03-17 cs.LG cs.NI 80%

PLUME: Building a Network-Native Foundation Model for Wireless Traces via Protocol-Aware Tokenization

PLUME:通过协议感知的分词构建无线痕迹的网络原生基础模型

Swadhin Pradhan, Shazal Irshad, Jerome Henry

机构 * Cisco Systems(思科系统)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 PLUME通过协议感知分词技术,为无线痕迹构建网络原生基础模型,实现更高效的序列生成与异常检测。

Comments 14-pages, 802.11 foundation model, matches frontier LLMs with 600x fewer params via protocol-aware tokenization, 5 figures, 12 tables, AUROC>=0.99 for zero-shot anomaly detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19386 2025-11-27 cs.CV cs.AI 80%

Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals

力提示:视频生成模型可以学习并泛化基于物理的控制信号

Nate Gillman, Charles Herrmann, Michael Freeman, Daksh Aggarwal, Evan Luo, Deqing Sun, Chen Sun

机构 * Brown University(布朗大学) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :prompting(title,abstract);分类 cs.AI

AI总结 本文提出力提示方法,通过物理力信号生成逼真视频,利用视觉和运动先验实现物理控制信号的泛化,提升世界模型的物理真实性。

Comments Camera ready version (NeurIPS 2025). Code and interactive demos at https://force-prompting.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15127 2025-11-19 cs.LG 80%

PRIMUS: Pretraining IMU Encoders with Multimodal Self-Supervision

Arnav M. Das, Chi Ian Tang, Fahim Kawsar, Mohammad Malekzadeh

机构 * Nokia Bell Labs Cambridge, UK(诺基亚贝尔实验室(剑桥,英国)) University of Washington, USA(华盛顿大学(美国)) University of Glasgow, UK(格拉斯哥大学(英国))

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments Presented at ICASSP 2025. Also presented under the title "PRIMUS: Pretraining IMU Encoders with Multimodal and Self-Supervised Learning" at NeurIPS 2024 TSALM Workshop (Time Series in the Age of Large Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11940 2025-11-18 cs.LG eess.SP 80%

Learning the relative composition of EEG signals using pairwise relative shift pretraining

Christopher Sandino, Sayeri Lala, Geeling Chau, Melika Ayoughi, Behrooz Mahasseni, Ellen Zippi, Ali Moin, Erdrin Azemi, Hanlin Goh

机构 * Apple(苹果公司) Stanford University(斯坦福大学) California Institute of Technology(加州理工学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG;foundation model(comments)

Comments Foundation Models for the Brain and Body NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08592 2025-09-18 cs.LG q-bio.QM 80%

Data-Efficient Sleep Staging with Synthetic Time Series Pretraining

Niklas Grieger, Siamak Mehrkanoon, Stephan Bialonski

机构 * Department of Medical Engineering and Technomathematics, FH Aachen University of Applied Sciences(弗劳恩霍夫亚琛应用科学大学医学工程与技术数学系) Department of Information and Computing Sciences, Utrecht University(乌得勒支大学信息与计算科学系) Institute for Data-Driven Technologies, FH Aachen University of Applied Sciences(弗劳恩霍夫亚琛应用科学大学数据驱动技术研究所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments 15 pages, 4 figures, 1 table

Journal ref Grieger, N., Mehrkanoon, S., Bialonski, S. (2025). Data-Efficient Sleep Staging with Synthetic Time Series Pretraining. Algorithms, 18(9), 580

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18677 2025-06-09 cs.CV cs.LG eess.IV 80%

Enhancing pretraining efficiency for medical image segmentation via transferability metrics

Gábor Hidy, Bence Bakos, András Lukács

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments An error was discovered in the aggregation process of our results, particularly affecting the experiments involving the advanced pretraining method. This impacts the main conclusions of the paper, and we are therefore withdrawing the submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11898 2024-09-30 cs.RO cs.LG 80%

VITaL Pretraining: Visuo-Tactile Pretraining for Tactile and Non-Tactile Manipulation Policies

Abraham George, Selam Gano, Pranav Katragadda, Amir Barati Farimani

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments 7 pages, 6 figures, submitted to ICRA 2025. Prior version named "Visuo-Tactile Pretraining for Cable Plugging"

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13703 2023-08-29 cs.LG 80%

PAITS: Pretraining and Augmentation for Irregularly-Sampled Time Series

Nicasia Beebe-Wang, Sayna Ebrahimi, Jinsung Yoon, Sercan O. Arik, Tomas Pfister

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments Code: \url{https://github.com/google-research/google-research/tree/master/irregular_timeseries_pretraining}

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08082 2022-06-17 cs.CL 80%

Self-Generated In-Context Learning: Leveraging Auto-regressive Language Models as a Demonstration Generator

Hyuhng Joon Kim, Hyunsoo Cho, Junyeob Kim, Taeuk Kim, Kang Min Yoo, Sang-goo Lee

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments NAACL 2022 Workshop on Large-scale Pre-trained Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11229 2021-03-02 cs.CV cs.LG 80%

Pretraining boosts out-of-domain robustness for pose estimation

Alexander Mathis, Thomas Biasi, Steffen Schneider, Mert Yüksekgönül, Byron Rogers, Matthias Bethge, Mackenzie W. Mathis

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments A.M. and T.B. co-first authors. Dataset available at http://horse10. deeplabcut.org . WACV 2021 conference

Journal ref https://openaccess.thecvf.com/content/WACV2021/html/Mathis_Pretraining_Boosts_Out-of-Domain_Robustness_for_Pose_Estimation_WACV_2021_paper.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17187 2026-08-19 stat.ME stat.OT 新提交 80%

Identifying Model Quality Effects on User Engagement: A Within-Version Causal Estimator with Synthetic Data Validation

识别模型质量对用户参与度的影响:一种结合合成数据验证的版本内因果估计器

John Tribbia

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM模型更新与用户参与度的因果识别难题,提出结合合成数据验证的版本内因果估计器,经衰减调整后可准确估计模型质量对参与度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10315 2026-08-13 cs.CY 版本更新 80%

Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web

虚假信息是否更开放?一项关于robots.txt门禁的网络研究

Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 研究发现可信网站比虚假信息网站更频繁地禁止AI爬虫,且这种差异随时间扩大,可能影响LLM训练数据和网络透明度。

Comments 10 pages, 11 figures

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05108 2026-08-06 cs.CR 新提交 80%

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

智能体对抗智能体:一种用于自动提示注入红队测试的智能体系统

Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本研究提出PIMiner智能体系统,用于自动提示注入红队测试,该系统构建可迁移策略库,仅需少量查询即可在IPIArena、AgentDojo基准上对多款LLM实现高攻击成功率,解决现有方法泛化性差的问题。

Comments Our code is available at https://github.com/wang-yanting/PIMiner

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19258 2026-08-04 cs.CL cs.AI cs.CR cs.LG 版本更新 80%

MAPLE: Metadata Augmented Private Language Evolution

MAPLE:元数据增强的隐私语言演化

Eli Chien, Yuzheng Hu, Ryan McKenna, Shanshan Wu, Zheng Xu, Peter Kairouz

机构 * National Taiwan University(国立台湾大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAPLE通过差分隐私元数据提取和上下文学习,解决私有演化中初始化瓶颈问题,实现更优的隐私-效用平衡和更低的API成本。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10161 2026-07-24 q-bio.GN 版本更新 80%

Omics Data Discovery Agents: Agent-Supported Retrieval, Reanalysis, and Synthesis of Published Omics Data

组学数据发现代理

Alexandre Hutton, Jesse G. Meyer

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于代理的框架,通过自动化提取和处理组学数据,实现对生物医学文献的可执行查询和大规模数据重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08194 2026-07-10 cs.CV 新提交 80%

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

深入探究低秩视觉-语言对齐中的隐式偏差

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) National University of Singapore(新加坡国立大学) Mininglamp(明略科技)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27080 2026-06-26 cs.SE 新提交 80%

ATGBuilder: Feature-Assisted Graph Learning for Activity Transition Graph Construction with Seed Supervision

ATGBuilder: 基于特征辅助图学习的活动转换图构建与种子监督

Chenhui Cui, Zixiang Xian, Danyu Li, Tao Li, Rubing Huang, Dave Towey, Shikai Guo, Jiakun Liu

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ATGBuilder,利用大语言模型总结UI布局元数据,并将控件触发信息建模为边属性,通过辅助重构目标进行图学习,在种子监督下构建高质量活动转换图,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14961 2026-06-26 q-bio.NC 版本更新 80%

Power-Law Scaling in the Classification Performance of Small-Scale Spiking Neural Networks

小规模脉冲神经网络分类性能的幂律标度

Zhengdi Zhang, Cong Han, Wenjun Xia

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究基于LIF神经元模型的小规模脉冲神经网络分类性能,发现准确率主要随类别数呈幂律标度,并使用大语言模型辅助发现函数关系。

Comments We need to improve the academic writing and the model in this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21996 2026-06-23 cs.SI cs.CY 新提交 80%

Cultural Targets, Structural Frames, Binding Morals: A Cross-Lingual Audit of Online Hate in Multicultural Singapore

文化目标、结构框架、约束道德:多元文化新加坡中在线仇恨的跨语言审计

Emilio Ferrara

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过分析新加坡多语言社交媒体语料,发现仇恨言论的目标群体因语言而异,但威胁框架和道德基础(圣洁与忠诚)跨语言高度一致,且反移民仇恨被优先放大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01241 2026-06-23 cs.CR cs.SE 80%

MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools

MCP-SandboxScan:基于WASM的MCP工具安全执行与运行时分析

Zhuoran Tan, Run Hao, Jeremy Singer, Yutian Tang, Christos Anagnostopoulos

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出MCP-SandboxScan框架,通过WASM环境执行工具并提取运行时证据,结合语义分析识别MCP工具的风险,验证其在跨语言项目、 evasion基准和100个仓库中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13918 2026-06-15 cs.SE cs.CR 新提交 80%

Bayesian-Calibrated Detection of Hallucinated Package Imports in AI-Assisted Code

AI辅助代码中幻觉包导入的贝叶斯校准检测

Lom M. Hillah, Jean-Marc Richard, Ryan Hasnaoui

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出贝叶斯校准层,基于三元认知分类法输出Beta后验概率,并利用PyPI元数据检测注册但可疑的包,优于二元基线。

Comments 23 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13095 2026-06-12 eess.AS cs.SD 新提交 80%

Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition

在端到端大语言模型中平衡ASR与说话人日志以进行多说话人语音识别

Naijun Zheng, Yuke Lin, Sanli Tian, Mengtian Li, Zhiwei Lin, Longshuai Xiao, Dandan Tu

机构 * Huawei Technologies, China(华为技术有限公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 提出双编码器架构、特征交错格式、长度感知说话人ID损失和自适应阈值ASR损失策略,在有限真实数据下高效训练LLM系统,平衡ASR与说话人日志任务,在AliMeeting和Aishell4语料库上分别实现18%和24%的相对改进。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03001 2026-06-12 cs.DC 版本更新 80%

FOLD: Fuzzy Online Deduplication for Very Large Evolving Datasets via Approximate Nearest Neighbor Search

FOLD: 面向超大规模演化数据集的模糊在线去重方法(基于近似最近邻搜索)

Nelson Bore, Pritish Mishra, Constantin Adam, Eyal de Lara, Oana Balmau

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FOLD系统,利用增量更新的HNSW索引和位图表示改进Jaccard相似度计算,实现高召回率和高吞吐量的在线模糊去重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10481 2026-06-10 cs.LG cs.AI cs.CL cs.CR stat.ML 新提交 80%

Advancing the State-of-the-Art in Empirical Privacy Auditing

推进经验隐私审计的最新水平

Nicole Mitchell, Galen Andrew, Arun Ganesh, Brendan McMahan, Peter Kairouz

机构 * Google Research(谷歌研究院)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出通过高温采样生成合成金丝雀,用于经验隐私审计,并引入基于辅助模型的合成数据审计方法,系统研究模型容量与金丝雀熵对记忆化的交互影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09145 2026-06-09 cs.CR 新提交 80%

PrivCode++: Latent-Conditioned Differentially Private Code Generation for Comprehensive Guarantees

PrivCode++: 潜在条件差分隐私代码生成以实现全面保障

Zheng Liu, Chen Gong, Terry Yue Zhuo, Zhou Yang, Kecen Li, Wenlong Meng, Xinwen Hou, Yu Liu, Xiaochen Li

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对指令-代码对微调的大语言模型可能泄露敏感数据的问题,提出PrivCode-Plus,首个在微调中同时保护提示和代码的差分隐私代码生成方法,通过两阶段DP框架和无隐私潜在条件模块实现高效合成。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏