arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Michigan(密歇根大学安娜堡分校)

2026-06-10 至 2026-06-10 共收录 3
2606.06888 2026-06-10 cs.LG 版本更新

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

数据受限的语言模型预训练:改进的正则化与缩放定律

Zhiwei Xu, Shihao Wu, Hanseul Cho, Wei Hu, Yixin Wang

机构 * University of Michigan(密歇根大学) KAIST AI(韩国科学技术院人工智能研究所)

AI总结 研究数据受限下语言模型预训练的正则化与缩放,提出掩码输入正则化(MIR)改善验证损失,并设计SoftQ缩放定律更准确拟合重复数据下的模型与数据规模交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20970 2026-06-10 math.OC cs.IT cs.LG math.IT 版本更新

The hyper-scaled NLP bound for maximum-entropy remote sampling

最大熵远程采样的超缩放NLP界

Gabriel Ponte, Marcia Fampa, Jon Lee

机构 * University of Michigan(密歇根大学) Universidade Federal do Rio de Janeiro(里约热内卢联邦大学)

AI总结 针对最大熵远程采样问题,提出基于凸松弛的超缩放NLP界,理论上优于传统互补NLP界,并适用于秩亏协方差矩阵,通过数值实验验证了算法先进性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14717 2026-06-10 cs.CL 版本更新

What Really Matters for Table LLMs? A Meta-Evaluation of Model and Data Effects

表格LLM真正重要的是什么?模型与数据影响的元评估

Naihao Deng, Sheng Zhang, Henghui Zhu, Shuaichen Chang, Jiani Zhang, Alexander Hanbo Li, Chung-Wei Hang, Hideo Kobayashi, Yiqun Hu, Patrick Ng

机构 * University of Michigan(密歇根大学) AWS AI Labs(AWS人工智能实验室) Figma OKX Google(谷歌)

AI总结 通过指令微调12个模型并在16个基准上评估,发现基座模型选择比训练数据对性能影响更大,泛化与推理仍是挑战。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏