arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12365 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2603.03298 2026-03-05 cs.CL cs.AI 86%

TATRA: Training-Free Instance-Adaptive Prompting Through Rephrasing and Aggregation

TATRA: 无需训练的实例自适应提示法通过重述与聚合

Bartosz Dziuba, Kacper Kuchta, Paweł Batorski, Przemysław Spurek, Paul Swoboda

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构)

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TATRA通过重述与聚合生成实例特定的少量示例提示,无需训练数据和优化循环,在文本分类和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20666 2026-03-03 cs.CL cs.AI 86%

Cognitive models can reveal interpretable value trade-offs in language models

认知模型可以揭示语言模型中的可解释价值权衡

Sonia K. Murthy, Rosie Zhao, Jennifer Hu, Sham Kakade, Markus Wulfmeier, Peng Qian, Tomer Ullman

机构 * Kempner Institute for Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Google DeepMind(谷歌DeepMind) Department of Psychology, Harvard University(哈佛大学心理学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用认知模型评估语言模型中的价值权衡,揭示其行为特征变化及对社会行为的影响。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05408 2026-03-02 cs.CL cs.LG 86%

Steering Language Models with Weight Arithmetic

通过权重算术引导语言模型

Constanza Fierro, Fabien Roger

机构 * Department of Computer Science University of Copenhagen(计算机科学系 拉丁大学) Anthropic

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 通过权重算术引导方法提升语言模型在分布外行为控制中的性能,同时减少趋炎附势和偏差。

Comments ICLR 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 86%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 86%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14295 2026-02-17 cs.LG cs.AI 86%

Machine Learning as a Tool (MLAT): A Framework for Integrating Statistical ML Models as Callable Tools within LLM Agent Workflows

机器学习作为工具(MLAT):一种将统计机器学习模型作为可调用工具集成到LLM代理工作流中的框架

Edwin Chen, Zulekha Bibi

机构 * Legacy AI LLC

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MLAT框架通过将统计机器学习模型作为可调用工具集成到LLM代理工作流中,实现快速生成专业提案的自动化流程。

Comments Submitted to the Google Gemini 3 Hackathon

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14921 2026-02-13 cs.CL cs.CR cs.LG 86%

The Canary's Echo: Auditing Privacy Risks of LLM-Generated Synthetic Text

知更鸟的回声:审计大语言模型生成合成文本的隐私风险

Matthieu Meeus, Lukas Wutschitz, Santiago Zanella-Béguelin, Shruti Tople, Reza Shokri

机构 * Imperial College London(帝国理工学院伦敦分校) Microsoft(微软公司) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过设计具有分布内前缀和高困惑度后缀的知更鸟,提高基于数据的MIAs的威力,以更准确评估LLM生成合成数据的隐私风险。

Comments 42nd International Conference on Machine Learning (ICML 2025)

Journal ref Proc. Mach. Learn. Res. 267 (2025) 43557-43580

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09067 2026-02-12 q-bio.GN cs.AI cs.CE cs.CL 86%

AntigenLM: Structure-Aware DNA Language Modeling for Influenza

AntigenLM: 用于流感的结构感知DNA语言模型

Yue Pei, Xuebin Chi, Yu Kang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Beijing Institute of Genomics, Chinese Academy of Sciences(中国科学院北京基因组研究所) China National Center for Bioinformation(中国生物信息学国家中心) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 AntigenLM通过结构感知的DNA语言模型预测流感抗原变异,优于传统方法,同时在亚型分类中表现优异。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00884 2026-02-10 cs.LG cs.CL 86%

Towards Active Synthetic Data Generation for Finetuning Language Models

面向微调语言模型的主动合成数据生成

Samuel Kessler, Menglin Xia, Daniel Madrigal Diaz, Dongge Han, Helia Heshemi, Saravan Rajmohan, Victor Ruehle, Jordan T. Ash

机构 * Microsoft(微软)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过主动学习方法生成合成数据以提升语言模型微调效果,验证了简单筛选标准在数学和逻辑推理任务中的有效性。

Comments 14 figures, 37 pages. Website and code: https://iterative-sd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03702 2026-02-04 cs.LG cs.AI math.OC stat.ML 86%

Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging

任意时间预训练:无时间范围的学习率调度与权重平均

Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade

机构 * Harvard University(哈佛大学) Kempner Institute at Harvard University(哈佛大学凯默纳研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种无需时间范围的学习率调度方法,通过权重平均实现与余弦调度相当的预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03690 2026-02-04 cs.LG cs.AI 86%

LLM-Inspired Pretrain-Then-Finetune for Small-Data, Large-Scale Optimization

受大语言模型启发的小数据、大规模优化的预训练-微调方法

Zishi Zhang, Jinhui Han, Ming Hu, Yijie Peng

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种受大语言模型启发的预训练-微调方法,用于解决小数据下的大规模决策优化问题,通过预训练注入领域知识并利用合成数据,微调提升与真实数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15370 2026-01-29 cs.LG cs.AI physics.chem-ph q-bio.BM 86%

Tokenization for Molecular Foundation Models

分子基础模型的标记化

Alexius Wadell, Anoushka Bhutani, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan 48109, United States(机械工程系,密歇根大学,安娜堡,密歇根州48109,美国)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Smirk和Smirk-GPE两种新的分子标记器,以全面覆盖OpenSMILES规范,提升分子属性预测的准确性。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06920 2026-01-27 cs.CR cs.AI cs.CL cs.CY 86%

An Ethically Grounded LLM-Based Approach to Insider Threat Synthesis and Detection

基于伦理的LLM方法用于内部威胁合成与检测

Haywood Gelman, John D. Hastings, David Kenley

机构 * Beacom College of Computer \& Cyber Sciences Dakota State University Madison, SD, USA College of Arts \& Sciences Dakota State University Madison, SD, USA

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于伦理的LLM方法,利用Claude Sonnet 3.7动态生成syslog消息以检测内部威胁,实验显示其在减少误报和提高检测准确性方面优于GPT-4o。

Comments 6 pages, 5 figures, 5 tables

Journal ref 2025 IEEE Cyber Awareness and Research Symposium (CARS'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18164 2026-01-21 cs.LG cs.AI stat.ML 86%

TabDPT: Scaling Tabular Foundation Models on Real Data

TabDPT:在真实数据上扩展表格基础模型

Junwei Ma, Valentin Thomas, Rasa Hosseinzadeh, Alex Labach, Hamidreza Kamkari, Jesse C. Cresswell, Keyvan Golestan, Guangwei Yu, Anthony L. Caterini, Maksims Volkovs

机构 * Layer 6 AI

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 TabDPT通过结合上下文学习与自监督学习,提升表格基础模型在真实数据上的泛化能力,实现模型和数据规模的缩放优化。

Comments Inference repo: github.com/layer6ai-labs/TabDPT-inference; Training repo: github.com/layer6ai-labs/TabDPT-training

Journal ref NeurIPS 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12537 2026-01-19 cs.CL cs.AI eess.AS 86%

What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study

什么使LLM为中心的语音生成中的良好语音分词器?系统研究

Xiaoran Fan, Zhichao Sun, Yangfan Gao, Jingfei Xiong, Hang Yan, Yifei Cao, Jiajun Sun, Shuo Li, Zhihao Zhang, Zhiheng Xi, Yuhao Zhou, Senjie Jin, Changhao Jiang, Junjie Ye, Ming Zhang, Rui Zheng, Zhenhua Han, Yunke Zhang, Demei Yan, Shaokang Dong, Tao Ji, Tao Gui

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM为中心的语音生成中语音分词器设计的影响,通过引入多令牌预测和说话人感知生成,提升了语音生成的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21621 2026-01-16 cs.CL cs.AI 86%

The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs

开放证明语料库:大规模研究LLM生成的数学证明

Jasper Dekoninck, Ivo Petrov, Kristian Minchev, Mislav Balunovic, Martin Vechev, Miroslav Marinov, Maria Drencheva, Lyuba Konova, Milen Shumanov, Kaloyan Tsvetkov, Nikolay Drenchev, Lazar Todorov, Kalina Nikolova, Nikolay Georgiev, Vanesa Kalinkova, Margulan Ismoldayev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里德斯基") Institute of Mathematics and Informatics, Bulgarian Academy of Sciences(保加利亚科学院数学与信息学研究所) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 开放证明语料库通过大规模研究LLM生成的数学证明,探索自动化证明生成中的关键问题,包括自然语言与形式证明的性能差距、最终答案准确性与完整证明有效性之间的差异,以及最佳n选择对证明质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09066 2026-01-15 cs.CL cs.AI 86%

Mi:dm 2.0 Korea-centric Bilingual Language Models

Mi:dm 2.0 韩国中心双语语言模型

Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

机构 * Tech. Innovation Group(技术创新组)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 Mi:dm 2.0是一款专为韩国中心AI设计的双语大语言模型,通过整合韩国社会价值观和常识知识,提升文化适应性和生成能力,支持多任务和多场景应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12611 2026-01-09 cs.AI cs.CL 86%

An LLM + ASP Workflow for Joint Entity-Relation Extraction

基于LLM与ASP的工作流联合实体-关系抽取

Trang Tran, Trung Hoang Le, Huiping Cao, Tran Cao Son

机构 * New Mexico State University(新墨西哥州立大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM与ASP的工作流,利用其优势在有限数据下提升JERE任务性能,尤其在SciERC基准上表现突出。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 63-75

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14368 2025-12-25 cs.CV cs.CL cs.LG 86%

O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model

O3SLM:开放权重、开放数据和开放词汇草图-语言模型

Rishi Gupta, Mukilan Karuppasamy, Shyam Marjit, Aditay Tripathi, Anirban Chakraborty

机构 * IISc(印度理工学院)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 O3SLM通过构建大规模图像-草图-指令三元组数据集和训练模型,实现了对草图理解和推理的突破性进展。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00964 2025-12-19 cs.CL cs.LG 86%

MALTO at SemEval-2024 Task 6: Leveraging Synthetic Data for LLM Hallucination Detection

MALTO在SemEval-2024任务6:利用合成数据进行LLM幻觉检测

Federico Borra, Claudio Savelli, Giacomo Rosso, Alkis Koudounas, Flavio Giobergia

机构 * Politecnico di Torino(托尼诺理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MALTO通过合成数据增强和投票集成方法,提升LLM幻觉检测的准确性与鲁棒性。

Comments Under revision at SemEval 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15081 2025-12-18 cs.CR cs.AI cs.CL 86%

Quantifying Return on Security Controls in LLM Systems

对LLM系统中安全控制的回报进行量化

Richard Helder Moulton, Austin O'Brien, John D. Hastings

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种量化LLM系统安全控制回报的方法,通过模拟攻击和风险评估,比较了ABAC、NER删除和NeMo Guardrails三种安全措施的效果,发现ABAC显著降低风险,RoC达到9.83。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13298 2025-12-16 cs.CL cs.AI 86%

MiniLingua: A Small Open-Source LLM for European Languages

MiniLingua:一种用于欧洲语言的小型开源大语言模型

Anna Aksenova, Boris Zverkov, Nicola Dainese, Alexander Nikitin, Pekka Marttinen

机构 * Aalto University(阿alto大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MiniLingua是一种基于十亿参数的多语言开源大语言模型,针对13种欧洲语言训练,能够在指令遵循任务中超越同类模型,同时保持高效的计算性能。

Comments 9+6 pages, 6 figures and 3 tables in the main text. Code at https://github.com/MiniLingua-ai/training_artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06351 2025-12-09 cs.LG cs.CL 86%

LLM-Upgraded Graph Reinforcement Learning for Carbon-Aware Job Scheduling in Smart Manufacturing

用于智能制造碳感知作业调度的LLM升级图强化学习

Zhiying Yang, Fang Liu, Wei Zhang, Xin Lou, Malcolm Yoke Hean Low, Boon Ping Gan

机构 * Singapore Institute of Technology(新加坡理工学院) Singapore University of Social Sciences(新加坡社会科学研究大学) D-SIMLAB Technologies(D-SIMLAB技术公司)

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 Luca通过结合LLM和图神经网络,实现碳感知作业调度的高效优化,实验显示其在完成时间和排放方面均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05464 2025-12-08 cs.CL cs.AI 86%

Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment

动态对齐与集体代理:迈向一个可扩展的自我改进框架以实现开放式的LLM对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Jad Tarifi, Nima Asgharbeygi

机构 * Integral AI

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态对齐框架,通过集体代理价值实现LLM的自我改进和可扩展对齐。

Comments 8 pages, 4 figures, to appear in AAAI 2026 AIGOV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06540 2025-12-03 cs.LG cs.AI stat.ML 86%

Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families

Sloth: LLM技能的缩放定律用于跨家族预测多基准性能

Felipe Maia Polo, Seamus Somerstep, Leshem Choshen, Yuekai Sun, Mikhail Yurochkin

机构 * Department of Statistics, University of Michigan(密歇根大学统计学系) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI实验室,IBM研究) Computer Science and Artificial Intelligence Laboratory, MIT(MIT计算机科学与人工智能实验室) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Sloth提出一种基于低维潜在技能的LLM缩放定律,通过跨基准相关性提升预测准确性,减少多家族训练需求。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08896 2025-11-26 cs.LG cs.AI 86%

Position: Beyond Euclidean -- Foundation Models Should Embrace Non-Euclidean Geometries

位置:超越欧几里得——基础模型应拥抱非欧几里得几何

Neil He, Jiahong Liu, Buze Zhang, Ngoc Bui, Ali Maatouk, Menglin Yang, Irwin King, Melanie Weber, Rex Ying

机构 * Yale University(耶鲁大学) Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科学大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文主张基础模型应超越欧几里得几何,以更高效地利用非欧几里得结构,提升模型性能与适应性。

Comments 27 pages, 6 figures, LoG Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15375 2025-11-20 cs.LG cs.AI 86%

Parameter Importance-Driven Continual Learning for Foundation Models

Lingxiang Wang, Hainan Zhang, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) School of Artificial Intelligence, Beihang University(人工智能学院,北京航空航天大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13640 2025-11-18 cs.LG cs.AI 86%

Data Value in the Age of Scaling: Understanding LLM Scaling Dynamics Under Real-Synthetic Data Mixtures

Haohui Wang, Jingyuan Qi, Jianpeng Chen, Jun Wu, Lifu Huang, Lecheng Zheng, Kevin Choi, Balaji Veeramani, Edward Bowen, Alison Hu, Tyler Cody, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Michigan State University(密歇根州立大学) University of California, Davis(加州大学戴维斯分校) Deloitte(德勤)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10338 2025-11-18 cs.CL cs.AI 86%

BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages

Guduru Manoj, Neel Prabhanjan Rachamalla, Ashish Kulkarni, Gautam Rajeev, Jay Piplodiya, Arul Menezes, Shaharukh Khan, Souvik Rana, Manya Sah, Chandra Khatri, Shubham Agarwal

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10027 2025-11-14 cs.CL cs.AI 86%

LLMCARE: early detection of cognitive impairment via transformer models enhanced by LLM-generated synthetic data

Ali Zolnour, Hossein Azadmaleki, Yasaman Haghbin, Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sina Rashidi, Masoud Khani, AmirSajjad Taleban, Samin Mahdizadeh Sani, Maryam Dadkhah, James M. Noble, Suzanne Bakken, Yadollah Yaghoobzadeh, Abdol-Hossein Vahabie, Masoud Rouhizadeh, Maryam Zolnoori

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏