arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-20 至 2026-04-20 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2604.15416 2026-04-20 cs.LG cs.AI math.OC 92%

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models

StoSignSGD:无偏结构随机性修正SignSGD用于训练大语言模型

Dingzhi Yu, Rui Pan, Yuxing Liu, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出StoSignSGD算法,通过在sign操作中注入结构随机性,解决SignSGD在非光滑目标下的发散问题,理论和实验均证明其在凸和非凸优化中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15461 2026-04-20 cs.LG cs.CL cs.CR 90%

Evaluating LLM Simulators as Differentially Private Data Generators

评估LLM模拟器作为差分隐私数据生成器

Nassima M. Bouzid, Dehao Yuan, Nam H. Nguyen, Mayana Pereira

机构 * Capital One

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究评估LLM模拟器在生成复杂合成数据中的有效性,发现其在欺诈检测中表现良好但存在分布偏移问题,需解决系统性偏差以提升应用潜力。

Comments Submitted to ICLR 2026. 6 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16275 2026-04-20 cs.CL 89%

No Universal Courtesy: A Cross-Linguistic, Multi-Model Study of Politeness Effects on LLMs Using the PLUM Corpus

无普遍礼貌:基于PLUM语料库的跨语言、多模型研究,探讨礼貌对LLM的影响

Hitesh Mehta, Arjit Saxena, Garima Chhikara, Rohit Kumar

机构 * Department of Computer Science Engineering(计算机科学与工程系) Department of Electronics and Communication Engineering(电子与通信工程系)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究不同礼貌程度的用户提示对LLM响应的影响,发现礼貌程度对模型性能有显著影响,但这种影响因语言和模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15706 2026-04-20 cs.CL 85%

Target-Oriented Pretraining Data Selection via Neuron-Activated Graph

基于神经激活图的目标导向预训练数据选择

Zijun Wang, Haoqin Tu, Weidong Zhou, Yiyang Zhou, Xiaohuan Zhou, Bingni Zhang, Weiguo Feng, Taifeng Wang, Cihang Xie, Fengze Liu

机构 * ByteDance(字节跳动) UC Santa Cruz(加州大学圣克鲁兹分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出基于神经激活图的排名方法,通过选取高影响神经元构建NAG,提升目标导向预训练效果,实验显示在六个基准测试中平均提升4.9%,并在多目标设置中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12370 2026-04-20 cs.CV 85%

LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

LLaMo:通过连续自回归令牌扩展预训练语言模型,实现统一的运动理解和生成

Zekun Li, Sizhe An, Chengcheng Tang, Chuan Guo, Ivan Shugurov, Linguang Zhang, Amy Zhao, Srinath Sridhar, Lingling Tao, Abhay Mittal

机构 * Brown University(布朗大学) Meta

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract)

AI总结 LLaMo通过模态特定的Transformer混合架构扩展预训练语言模型,解决运动-语言生成和理解的统一问题,实现高保真文本到运动生成和运动到文本描述。

Comments Project page: https://kunkun0w0.github.io/project/LLaMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15675 2026-04-20 cs.CL 81%

C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment

C-Mining:通过几何偏移无监督发现文化数据合成的种子

Pufan Zeng, Yilun Liu, Mingchen Dai, Mengyao Piao, Chunguang Zhao, Lingqi Miao, Shimin Tao, Weibin Meng, Minggui He, Chenxin Liu, Zhenzhen Qin, Li Zhang, Hongxia Ma, Boxing Chen, Daimeng Wei

机构 * Huawei China(华为中国) Huawei Canada(华为加拿大) University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出C-Mining框架,通过几何偏移发现文化种子,提升文化理解与推理能力,实验显示在CulturalBench-Hard上提升6.03分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15813 2026-04-20 cs.DB 80%

Exploring Agentic Visual Analytics: A Co-Evolutionary Framework of Roles and Workflows

探索代理式可视化分析:角色与工作流的共进化框架

Tianqi Luo, Leixian Shen, Yuyu Luo

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过调研55个代理式可视化分析系统,提出一个共进化框架,分析代理自主性与人类角色转变之间的关系,并提出设计指南和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15350 2026-04-20 cs.LG 77%

The Spectral Geometry of Thought: Phase Transitions, Instruction Reversal, Token-Level Dynamics, and Perfect Correctness Prediction in How Transformers Reason

思维的谱几何:相变、指令反向、令牌级动态以及完美正确性预测在Transformer推理中的表现

Yi Liu

机构 * DeepSeek-R1(深Seek-R1) Qwen(通义千问) Pythia Llama

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.LG

AI总结 研究通过系统谱分析发现,大语言模型在推理与事实回忆时在隐藏激活空间中表现出谱相变现象,揭示了推理的谱压缩、指令调谐的谱反向等七种核心现象,建立了一套关于Transformer推理的谱理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15494 2026-04-20 cs.LG cs.CV 57%

ProtoTTA: Prototype-Guided Test-Time Adaptation

ProtoTTA:基于原型的测试时间适应

Mohammad Mahdi Abootorabi, Parvin Mousavi, Purang Abolmaesumi, Evan Shelhamer

机构 * University of British Columbia(不列颠哥伦比亚大学) Queen’s University(女王大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 ProtoTTA通过利用中间原型信号提升模型在分布偏移下的鲁棒性,同时恢复原型激活的语义聚焦,改进了标准输出熵最小化方法。

Comments ICLR 2026 Test-Time Updates (TTU) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02880 2026-04-20 cs.CV 50%

InstructTable: Improving Table Structure Recognition Through Instructions

InstructTable: 通过指令提升表格结构识别

Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan

机构 * Meituan(美团) Beijing Institute of Technology(北京理工大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出InstructTable框架,通过指令引导多阶段训练提升表格结构识别,结合指令预训练和细调,构建BCDSTab基准,实现在复杂表格识别中的最优性能。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏