arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-09 至 2026-03-09 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2506.14757 2026-03-09 astro-ph.CO astro-ph.IM hep-ph physics.data-an 90%

Large Language Models -- the Future of Fundamental Physics?

大语言模型——基础物理学的未来?

Caroline Heneka, Florian Nieser, Ayodele Ore, Tilman Plehn, Daniel Schiller

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文探讨了大语言模型在基础物理学中的应用,展示了Qwen2.5 LLM结合连接网络在宇宙参数回归和光锥生成中的优越性能。

Comments 35 pages, 10 figures, 6 tables. v2: matched published version

Journal ref SciPost Phys. 20, 070 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10735 2026-03-09 cs.AI cs.CL cs.CY cs.LG 90%

Transforming Agency. On the mode of existence of Large Language Models

代理的转变。大型语言模型的存在模式

Xabier E. Barandiaran, Lola S. Almendros

机构 * IAS-Research Centre for Life, Mind, and Society, Dept. Philosophy UPV/EHU, University of the Basque Country(生命、心灵与社会研究所,哲学系,巴斯克大学) Institute for Science and Technology Studies, University of Salamanca (Spain)(科学与技术研究所,萨拉曼卡大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了大型语言模型作为代理的本体特征,指出其缺乏自主代理的必要条件,但能通过文本和计算躯体影响人类代理形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11089 2026-03-09 cs.CL cs.AI 88%

DataChef: Cooking Up Optimal Data Recipes for LLM Adaptation via Reinforcement Learning

DataChef: 通过强化学习为LLM适应生成最优数据配方

Yicheng Chen, Zerun Ma, Xinchen Xie, Yining Li, Kai Chen

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 DataChef通过强化学习自动生成最优数据配方,使LLM适应性能达到人类专家水平。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06088 2026-03-09 cs.CL cs.AI 84%

Experiences Build Characters: The Linguistic Origins and Functional Impact of LLM Personality

经验塑造性格:大语言模型人格的语言起源与功能影响

Xi Wang, Mengdie Zhuang, Jiqun Liu

机构 * University of Sheffield(谢菲尔德大学) University of Oklahoma(俄克拉荷马大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过持续预训练和大五人格框架,揭示了大语言模型人格的形成机制,发现模型能力在特定性格类型中表现最佳,并揭示了训练数据语言特征对推理性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06565 2026-03-09 cs.AI cs.LG 81%

Boosting deep Reinforcement Learning using pretraining with Logical Options

通过逻辑选项预训练提升深度强化学习

Zihan Ye, Phil Chau, Raban Emunds, Jannis Blüml, Cedric Derstroff, Quentin Delfosse, Oleg Arenz, Kristian Kersting

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 通过逻辑选项预训练提升深度强化学习,实现目标导向行为与长周期决策能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02406 2026-03-09 cs.LG cs.AI 81%

Rigidity-Aware Geometric Pretraining for Protein Design and Conformational Ensembles

面向刚性的几何预训练用于蛋白质设计与构象集合

Zhanghan Ni, Yanjing Li, Zeju Qiu, Bernhard Schölkopf, Hongyu Guo, Weiyang Liu, Shengchao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) MPI for Intelligent Systems, Tübingen(智能系统马克斯·普朗克研究所,图宾根) National Research Council of Canada(加拿大国家研究理事会) University of Ottawa(渥太华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 RigidSSL通过刚性感知的几何预训练,提升蛋白质设计和构象集合的生成能力。

Comments The Fourteenth International Conference on Learning Representations; Code available at: https://github.com/ZhanghanNi/RigidSSL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18300 2026-03-09 cs.CV cs.AI cs.LG cs.RO 81%

FALCON: Future-Aware Learning with Contextual Object-Centric Pretraining for UAV Action Recognition

FALCON:面向未来的学习与基于上下文的对象中心预训练用于无人机动作识别

Ruiqi Xian, Xiyang Wu, Tianrui Guan, Xijun Wang, Boqing Gong, Dinesh Manocha

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 FALCON通过结合对象感知的遮蔽自动编码和对象中心双时间线未来重建,提升无人机动作识别的准确率和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08818 2026-03-09 cs.LG cs.AI 79%

From Tokenizer Bias to Backbone Capability: A Controlled Study of LLMs for Time Series Forecasting

从分词偏差到骨干能力:对用于时间序列预测的LLM进行受控研究

Xinyu Zhang, Shanshan Feng, Xutao Li, Kenghong Lin, Fan Li, Pengfei Jia

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过设计三个具有相同架构但不同预训练策略的模型,研究了LLM在时间序列预测中的性能,发现其表现有限,无法超越专门训练的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06449 2026-03-09 cs.CV 67%

CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization

CaTok:通过Mean流平滑均值流以实现一维因果图像标记化

Yitong Chen, Zuxuan Wu, Xipeng Qiu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究所,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract)

AI总结 CaTok 通过 MeanFlow 解码器实现一维因果图像标记化,提升图像生成与重建性能。

Comments Project website is available in https://sharelab-sii.github.io/catok-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07722 2026-03-09 cs.CL 57%

Critical Confabulation: Can LLMs Hallucinate for Social Good?

关键性虚构:大语言模型是否可以为社会公益而虚构?

Peiqi Sui, Eamon Duede, Hoyt Long, Richard Jean So

机构 * McGill University(麦吉尔大学) Purdue University(普渡大学) University of Chicago(芝加哥大学) Duke University(杜克大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本研究提出关键性虚构,利用大语言模型的虚构能力填补历史档案中的遗漏,通过开放性叙述填空任务验证其在知识生产中的应用价值。

Comments ICLR2026 Camera Ready. 27 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13687 2026-03-09 cs.CV 50%

Towards Scalable Pre-training of Visual Tokenizers for Generation

面向生成任务的视觉分词器可扩展预训练

Jingfeng Yao, Yuda Song, Yucong Zhou, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) MiniMax

专题命中 预训练与数据 :pretraining(abstract)

AI总结 VTP通过联合优化图像-文本对比、自监督和重建损失,提升视觉分词器的生成性能和扩展性。

Comments Our pre-trained models are available at https://github.com/MiniMax-AI/VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06327 2026-03-09 eess.AS 50%

Classification of Autistic and Non-Autistic Children's Speech: A Cross-Linguistic Study in Finnish, French, and Slovak

自闭症与非自闭症儿童语音分类:芬兰、法语和斯洛伐克语的跨语言研究

Sofoklis Kakouros, Ida-Lotta Myllylä

专题命中 预训练与数据 :language model(abstract)

AI总结 研究通过跨语言分析,探讨自闭症儿童语音特征在不同语言中的泛化能力,发现部分语音线索具有跨语言一致性,但需语言感知建模以提升分类性能。

Comments Accepted to Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05757 2026-03-09 cs.RO 50%

EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation

EmboAlign:通过组合约束对齐视频生成以实现零样本操控

Gehao Zhang, Zhenyang Ni, Payal Mohapatra, Han Liu, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏