arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-14 至 2026-05-14 共收录 354 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 32 篇

2605.13538 2026-05-14 cs.CL cs.AI 93%

Locale-Conditioned Few-Shot Prompting Mitigates Demonstration Regurgitation in On-Device PII Substitution with Small Language Models

基于区域条件的少样本提示缓解设备端PII替换中的演示回吐

Anuj Sadani, Deepak Kumar

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);prompting(title,abstract);SLM(abstract,abstract_cn)

AI总结 本文提出一种在设备端运行的管道,通过使用混合专家分类器和规则生成器,生成一致且类型保持的虚假值,以减少PII替换中的演示回吐问题,并在多语言数据集上验证了其有效性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13329 2026-05-14 cs.CL cs.AI 93%

Tracing Persona Vectors Through LLM Pretraining

通过LLM预训练追溯人格向量

Viktor Moskvoretskii, Dominik Glandorf, Jorge Medina Moreira, Tanja Käser, Robert West

机构 * EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究LLM预训练中人格向量的形成机制,发现其在早期阶段就形成并持续优化,为模型安全性和可控性提供新视角。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13408 2026-05-14 cs.CL 90%

From Rosetta to Match-Up: A Paired Corpus of Linguistic Puzzles with Human and LLM Benchmarks

从罗塞塔到配对:一种带有人类和LLM评估的语料库语言谜题

Neh Majmudar, Anne Huang, Jinfan Frank Hu, Elena Filatova

机构 * City University of New York (CUNY)(纽约城市大学) Davidson Academy(戴维森学院) Phillips Academy(菲利普斯学术院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了高中语言竞赛中使用的语言谜题,重点分析了罗塞塔石和配对两种常见形式,并提出了一种系统方法将现有罗塞塔石谜题转换为对应的配对谜题,通过人类和LLM评估验证了其有效性。

Comments Proceedings of the Fifteenth Language Resources and Evaluation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11405 2026-05-14 cs.LG 87%

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案

DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

机构 * DatologyAI

专题命中 预训练与数据 :language model(title,title_cn);pretraining(abstract);分类 cs.LG

AI总结 本文通过数据整理提升VLMs性能,展示在20个公开基准和DatBench九个能力轴上均取得显著提升,同时提升可靠性、OOD泛化和推理效率。

Comments 33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13436 2026-05-14 cs.CL cs.LG 87%

Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP

通过子词正则化预训练语言模型:BPE Dropout在低资源NLP中的实证研究

Ruan Visser, Trienko Grobler, Marcel Dunaiski

机构 * Department of Computer Science, Stellenbosch University(斯瓦茨堡大学计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG

AI总结 本文研究了在低资源NLP中预训练时应用BPE Dropout对下游性能的影响,发现随机分词在预训练和微调时均优于仅在微调时应用,尤其在数据较少时表现更佳。

Comments Comments: 12 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13725 2026-05-14 cs.AI cs.SI 86%

ScioMind: Cognitively Grounded Multi-Agent Social Simulation with Anchoring-Based Belief Dynamics and Dynamic Profiles

ScioMind:基于认知的多智能体社交模拟与基于锚定的信念动态和动态资料

Yitian Yang, Yiqun Duan, Linghan Huang, Yiqi Zhu, Francesco Bailo, Chunmeizi Su, Huaming Chen

机构 * The University of Sydney(悉尼大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ScioMind结合结构化意见动态与LLM代理推理,通过记忆锚定信念更新规则、分层记忆架构和动态代理资料提升社交模拟的真实性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13846 2026-05-14 cs.CL cs.AI 82%

WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data

WARDEN:利用6小时训练数据进行濒危原住民语言的转录与翻译

Ziheng Zhang, Yunzhong Hou, Naijing Liu, Liang Zheng

机构 * Australian National University(澳大利亚国立大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 WARDEN通过分阶段模型处理濒危语言转录与翻译,利用印尼语初始化加速训练,结合专家词典提升翻译性能,以6小时数据优于统一模型。

Comments https://github.com/Ziheng-Zhang-AUS/WARDEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13059 2026-05-14 cs.CV 82%

BrainAnytime: Anatomy-Aware Cross-Modal Pretraining for Brain Image Analysis with Arbitrary Modality Availability

BrainAnytime: 基于解剖结构的跨模态预训练用于脑图像分析,支持任意模态可用性

Guangqian Yang, Tong Ding, Wenlong Hou, Yue Xun, Ye Du, Qian Niu, Shujun Wang

机构 * Department of Biomedical Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China(生物医学工程系,香港理工大学,香港特别行政区,中国) Department of Technology Management for Innovation, The University of Tokyo, Japan(创新技术管理系,东京大学,日本) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong SAR, China(数据科学与人工智能系,香港理工大学,香港特别行政区,中国)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 BrainAnytime通过跨模态蒸馏和解剖引导课程掩码,在共享的3D掩码自动编码器中学习MRI与PET的结构-分子对应关系,实现对任意模态可用性的统一预训练,提升多任务性能。

Comments Early accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13769 2026-05-14 cs.CL cs.LG 81%

Dense vs Sparse Pretraining at Tiny Scale: Active-Parameter vs Total-Parameter Matching

密集与稀疏预训练在微小规模下的比较:主动参数与总参数匹配

Abdalrahman Wael

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在微小预训练规模下密集和混合专家(MoE)Transformer的表现,通过比较主动参数与总参数匹配策略,发现MoE在主动参数匹配下验证损失更优,但总参数匹配下密集模型仍更优。

Comments 10 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22251 2026-05-14 cs.LG cond-mat.mtrl-sci cs.AI 81%

Zatom-1: Towards a Multimodal Foundation Model for 3D Molecules and Materials

Zatom-1:迈向3D分子和材料的多模态基础模型

Alex Morehead, Miruna Cretu, Antonia Panescu, Rishabh Anand, Maurice Weiler, Tynan Perez, Samuel Blau, Steven Farrell, Wahid Bhimji, Anubhav Jain, Hrushikesh Sahasrabuddhe, Pietro Lio, Tommi Jaakkola, Rafael Gomez-Bombarelli, Rex Ying, N. Benjamin Erichson, Michael W. Mahoney

机构 * LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所) University of Cambridge(剑桥大学) Yale University(耶鲁大学) MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 Zatom-1是一种跨领域、通用的模型架构,统一了3D分子和材料的生成与预测学习,通过多模态流匹配目标实现高效的预训练和稳定采样,提升了生成推理速度和跨领域预测性能。

Comments 38 pages, 10 figures, 15 tables. ICLR 2026 FM4Science. Code, data, and model weights are available at https://github.com/Zatom-AI/zatom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13405 2026-05-14 cs.LG 79%

When is Warmstarting Effective for Scaling Language Models?

何时在扩展语言模型时预热是有效的?

Neeratyoy Mallik, Maciej Janowski, Johannes Hog, Herilalaina Rakotoarison, Josif Grabocka, Frank Hutter, Aaron Klein

机构 * University of Freiburg(弗赖堡大学) Zuse School ELIZA(Zuse学校ELIZA) University of Technology Nuremberg(努尔登堡技术大学) University of Helsinki(赫尔辛基大学) Prior Labs(Prior实验室) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本文研究了预热在扩展语言模型中的有效性,发现简单策略优于复杂预热操作,并确定了增长因子的上限,为模型扩展提供实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12720 2026-05-14 cs.CL 79%

FLEXITOKENS: Flexible Tokenization for Evolving Language Models

FLEXITOKENS: 用于进化语言模型的灵活分词

Abraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文提出FLEXITOKENS,通过可学习的分词器实现灵活的分词,减少文本过碎片化,提升多语言和生成任务性能。

Comments Accepted to ACL (findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08541 2026-05-14 cs.LG 79%

Tokens-per-Parameter Coverage Is Critical for Robust LLM Scaling Law Extrapolation

每参数令牌覆盖量对鲁棒大语言模型扩展定律外推至关重要

Joshua Shay Kricheli, Alexander Lawrence Reid, Soumajyoti Sarkar, Venkata Gandikota, Paulo Shakarian

机构 * Syracuse University(Syracuse大学) Amazon AGI Foundations(Amazon AGI研究院)

专题命中 预训练与数据 :LLM(title);language model(abstract);分类 cs.LG

AI总结 研究揭示了在固定每参数令牌比下训练导致的扩展定律外推问题,通过数学证明和实验验证,提出了一种必要的令牌多样性阈值以确保估计的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12521 2026-05-14 cs.CL cs.AI 79%

ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues

ToolWeave:复杂多轮工具调用对话的结构化合成

Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

机构 * IBM Research(IBM研究院) IIIT Hyderabad(Hyderabad理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 ToolWeave通过构建带有内置依赖关系的工具,生成更真实的多轮工具调用对话,减少参数幻觉,提升LLM在多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20527 2026-05-14 cs.LG 77%

RMNP: Row-Momentum Normalized Preconditioning for Scalable Matrix-Based Optimization

RMNP:基于行动量归一化的可扩展矩阵优化预条件化

Shenyang Deng, Zhuoli Ouyang, Tianyu Pang, Zihang Liu, Ruochen Jin, Shuhua Yu, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) International Computer Science Institute(国际计算机科学研究所) University of California, Berkeley(加州大学伯克利分校) Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 RMNP通过行归一化替代牛顿-施卢茨迭代,提升预条件化效率,保持优化性能,实验显示其在大语言模型预训练中表现优异。

Comments The 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29475 2026-05-14 cs.LG 70%

Survival In-Context: Amortized Bayesian Survival Analysis via Prior-Fitted Networks

生存上下文:通过先验适应网络实现的 amortized 概率生存分析

Dmitrii Seletkov, Paul Hager, Georgios Kaissis, Rickmer Braren, Daniel Rueckert, Raphael Rehms

机构 * Institute of Diagnostic and Interventional Radiology, Technical University of Munich, Germany(慕尼黑技术大学诊断与介入放射学研究所,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich, Germany(慕尼黑技术大学医疗人工智能与医学研究所,德国) Hasso Plattner Institute for Digital Engineering, University of Potsdam, Germany(波茨坦大学数字工程哈索普兰特纳研究所,德国) University Hospital Hamburg-Eppendorf, Germany(汉堡-埃彭多夫大学医院,德国) Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算系,英国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Survival In-Context模型,通过先验适应网络实现生存分析,无需任务特定训练即可进行个性化生存预测,实验证明其在小中等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13262 2026-05-14 cs.LG q-bio.QM 70%

Chem-GMNet: A Sphere-Native Geometric Transformer for Molecular Property Prediction

Chem-GMNet:一种分子性质预测的球形本征几何变换器

Deepak Warrier, Raja Sekhar Pappala

机构 * MSTACK AI

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Chem-GMNet,一种基于球形本征的几何变换器,通过改进的模块设计在分子性质预测任务中取得优异表现,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13055 2026-05-14 cs.CL cs.CY 70%

The Cost of Perfect English: Pragmatic Flattening and the Erasure of Authorial Voice in L2 Writing Supported by GenAI

完美英语的成本:生成AI支持的二语写作中的语用扁平化与作者声音的消失

Ao Liu, Shanhua Zhu

机构 * School of Foreign Languages, Southeast University(东南大学外国语言学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨生成AI对二语写作的影响,发现其导致语用扁平化和作者声音的消失,提出需通过批判性AI素养来保护多元语用多样性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 70%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13149 2026-05-14 cs.CL cs.AI cs.LG 67%

AcquisitionSynthesis: Targeted Data Generation using Acquisition Functions

AcquisitionSynthesis:利用获取函数进行定向数据生成

Ishika Agarwal, Sofia Stoica, Emre Can Acikgoz, Pradeep Natarajan, Mahdi Namazifar, Jiaqi Ma, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AcquisitionSynthesis方法,利用获取函数作为奖励模型训练语言模型生成高质量合成数据,实验表明其在数学、医疗问答和编程任务中提升模型性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13194 2026-05-14 cs.LG cs.AI 62%

ECG-NAT: A Self-supervised Neighborhood Attention Transformer for Multi-lead Electrocardiogram Classification

ECG-NAT:一种用于多导联心电图分类的自监督邻域注意力变换器

Mahsa Gazeran, Sayvan Soleymanbaigi, Fatemeh Daneshfar, Amjad Seyedi, Fardin Akhlaghian Tab

机构 * Department of Computer Engineering, University of Kurdistan(库尔德斯坦大学计算机工程系) Department of Mathematics and Operational Research, University of Mons(蒙斯大学数学与运筹学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ECG-NAT,一种自监督学习方法,通过分阶段预训练和微调,有效提取多尺度特征,实现高效准确的多导联心电图分类,仅用1%标注数据即可达到88.1%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13152 2026-05-14 cs.CV cs.AI cs.LG cs.RO 62%

EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision

EvObj:学习无需场景监督的3D实例分割的演进对象表示

Jiahao Chen, Zihui Zhang, Yafei Yang, Jinxi Li, Shenxing Wei, Zhixuan Sun, Bo Yang

机构 * Shenzhen Research Institute, The Hong Kong Polytechnic University(深圳研究 institute,香港理工大学) vLAR Group, The Hong Kong Polytechnic University(vLAR 团队,香港理工大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 EvObj通过整合对象辨别和完成模块,解决合成数据与真实点云间的几何差距问题,实现无需场景监督的3D实例分割,实验表明其在真实和合成数据上均优于基线方法。

Comments CVPR 2026. Code and data are available at: https://github.com/vLAR-group/EvObj

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07483 2026-05-14 cs.LG cs.AI 62%

Does Your Neural Network Extrapolate? Feature Engineering as Identifiability Bias for OOD Generalization

你的神经网络能外推吗?特征工程作为对ODD泛化性的可识别性偏差

Leonel Aguilar, Jan Nagler, Christoph Hoelscher, Nino Antulov-Fantulin

机构 * Chair of Cognitive Science, ETH Zürich(认知科学教授职位,苏黎世联邦理工学院) Centre for Human and Machine Intelligence, Frankfurt School(人机智能中心,法兰克福学校) Aisot Technologies AG, D-GESS, ETH Zürich(Aisot技术公司,D-GESS,苏黎世联邦理工学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨神经网络在面对分布外数据时的外推能力,指出特征工程对可识别性偏差的影响,通过实例展示正确特征的重要性及模型类表达目标的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07969 2026-05-14 cs.CL 61%

Kathleen: Oscillator-Based Byte-Level Text Classification Without Tokenization or Attention

Kathleen:基于振荡器的字级别文本分类,无需分词或注意力机制

George Fountzoulas

机构 * Department of Computer Engineering & Informatics(计算机工程与信息学系)

专题命中 预训练与数据 :pretraining(abstract,comments);分类 cs.CL

AI总结 Kathleen通过频域处理直接在原始UTF-8字节上进行文本分类,无需分词或注意力机制,参数少于47万,引入了多种创新组件,提升了分类准确率。

Comments 15 pages, 10 tables. v2: Added V9 architecture with Positional Decay Modulation. Pretraining eliminated. SST-2 improved from 83.3% to 85.8%

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13986 2026-05-14 cs.LG 57%

PRiMeFlow: Capturing Complex Expression Heterogeneity in Perturbation Response Modelling

PRiMeFlow: 在扰动响应建模中捕捉复杂的表达异质性

Zichao Yan, Yan Wu, Mica Xu Ji, Chaitra Agrahar, Esther Wershof, Marcel Nassar, Mehrshad Sadria, Ridvan Eksi, Vladimir Trifonov, Ignacio Ibarra, Telmo Felgueira, Błażej Osiński, Rory Stark

机构 * Altos Labs(Altos实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 PRiMeFlow通过端到端的流匹配方法直接建模基因和小分子扰动对基因表达空间的影响,通过在PerturBench中的基准测试验证其在单细胞基因表达分布拟合上的准确性,并在H1人胚胎干细胞数据集上展示出卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20786 2026-05-14 cs.LG 57%

LiLAW: Lightweight Learnable Adaptive Weighting to Learn Sample Difficulty & Improve Noisy Training

LiLAW: 轻量级可学习自适应加权以学习样本难度并提高噪声训练

Abhishek Moturu, Muhammad Muzammil, Anna Goldenberg, Babak Taati

机构 * Department of Computer Science(计算机科学系) University of Toronto(多伦多大学) Department of Mathematics(数学系) The Hospital for Sick Children(圣·玛利亚医院) Department of Statistics(统计学系) UHN KITE Research Institute(UHN KITE研究所) T-CAIREM Vector Institute(向量研究所) Institute of Biomedical Engineering(生物医学工程研究所) Rehabilitation Sciences Institute(康复科学研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 LiLAW通过动态调整样本损失权重,提升噪声训练下的准确性和鲁棒性,适用于多种数据集和架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13225 2026-05-14 cs.LG 57%

Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings

混合,而非调参:双语预训练在数据受限环境下优于超参数搜索

Paul Jeha, Anastasiia Sedova, Louis Béthune, Skyler Seto, Jes Frellsen, Pierre Ablin, Natalie Schluter

机构 * Apple(苹果公司) DTU(丹麦技术大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文比较了双语混合与超参数调参在数据受限下的效果,发现混合在验证损失和下游任务准确率上提升更显著,且模型规模越大优势越明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12736 2026-05-14 cs.LG 57%

ConRetroBert: EMA Stabilized Dual Encoders for Template-Based Single-Step Retrosynthesis

ConRetroBert:基于指数移动平均的双编码器用于基于模板的单步逆合成

Mohammad Jahid Ibna Basher, Ali Khodabandeh Yalabadi, Ivan Garibay, Ozlem Ozmen Garibay

机构 * Department of Industrial Engineering(工业工程系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 ConRetroBert通过将模板逆合成重构为密集产品模板检索和候选集列表排序,提升了模板基于方法的性能,其双编码器框架在USPTO-50k基准上实现了更高的反应准确率。

Comments Submitted to NeurIPS 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13403 2026-05-14 cs.RO cs.CV 50%

RotVLA: Rotational Latent Action for Vision-Language-Action Model

RotVLA: 旋转的潜在动作用于视觉-语言-动作模型

Qiwei Li, Xicheng Gong, Xinghang Li, Peiyan Li, Quanyun Zhou, Hangjun Ye, Jiahuan Zhou, Yadong Mu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Xiaomi Robotics(小米机器人) CASIA

专题命中 预训练与数据 :pretraining(abstract)

AI总结 RotVLA提出基于连续旋转潜在动作表示的VLA框架,通过三元组帧学习和流匹配头实现高效动作建模,实现98.2%的LIBERO和89.6%/88.5%的RoboTwin2.0性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12088 2026-05-14 cs.CV 50%

UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation

UniCustom: 多参考图像生成的统一视觉条件化

Yiyan Xu, Qiulin Wang, Wenjie Wang, Yunyao Mao, Xintao Wang, Pengfei Wan, Kun Gai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 UniCustom通过融合ViT和VAE特征提升多参考图像生成中主体一致性和指令遵循能力,采用两阶段训练策略和槽绑定正则化减少跨参考混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏