arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 849 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 62 篇

2603.05308 2026-06-02 cs.CL cs.AI 93%

Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution

Med-V1:用于零样本和可扩展生物医学证据归因的小型语言模型

Qiao Jin, Yin Fang, Lauren He, Yifan Yang, Guangzhi Xiong, Zhizheng Wang, Nicholas Wan, Joey Chan, Donald C. Comeau, Robert Leaman, Charalampos S. Floudas, Aidong Zhang, Michael F. Chiang, Yifan Peng, Zhiyong Lu

机构 * Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家医学图书馆内部研究部,国立卫生研究院) Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系) Center for Cancer Research, National Cancer Institute, National Institutes of Health(国家癌症研究所癌症研究中心,国立卫生研究院) Department of Population Health Sciences, Weill Cornell Medicine Institute of AI for Digital Health, Weill Cornell Medicine(韦尔·科恩医学中心流行病学与健康科学系,韦尔·科恩医学中心人工智能与数字健康研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 提出仅3B参数的小语言模型Med-V1,通过高质量合成数据训练,在生物医学证据归因任务上性能媲美GPT-5等前沿大模型,并用于量化LLM幻觉和识别临床指南中的证据错误归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00829 2026-06-02 cs.CL cs.AI cs.LG 92%

Constitutional Black-Box Monitoring for Scheming in LLM Agents

LLM Agent 中阴谋行为的宪法黑盒监控

Simon Storf, Rich Barton-Cooper, James Peters-Gill, Marius Hobbhahn

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究使用基于宪法黑盒的监控器,通过仅观察外部输入和输出检测LLM Agent的阴谋行为,并在合成数据上优化后泛化到更真实环境。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24681 2026-06-02 cs.CL cs.AI 91%

Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs

Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译

Bo Li, Tianyu Dong, Shaolin Zhu, Deyi Xiong

机构 * School of Software, Tsinghua University(清华大学软件学院) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 提出Mix-MoE框架,通过将MoE层分为语言模型专家和机器翻译专家,并利用傅里叶变换增强路由机制,解决大语言模型在多语言机器翻译微调中的参数干扰问题。

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01800 2026-06-02 cs.CL cs.AI cs.LG 90%

Multilinguality of Large Language Models From a Structural Perspective

从结构视角看大语言模型的多语言性

Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过表示结构分析探索大语言模型的多语言性,发现低资源语言与英语的结构差异大于高、中资源语言,且语言特定后训练改变结构但保留语言间关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01475 2026-06-02 cs.CY 89%

An LLM-based Chain-of-Response Counter-Scam System

基于LLM的链式响应反诈骗系统

Heedou Kim, Mogan Gim, Donghee Choi, Hoonick Lee, Soonil Bae, Mi-Young Kim, Jaewoo Kang

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 提出Counter Scam框架,利用LLM多智能体协同实现从检测到调查的端到端反诈骗响应,通过CSRA、CSRT和CSRD组件提升效率,实验表明微调sLLM在CSRT任务上超越商业模型10%以上。

Comments This paper has been accepted for publication at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07298 2026-06-02 cs.IR cs.AI 89%

Principled Synthetic Data Enables the First Scaling Laws for LLMs in Recommendation

原则性合成数据使推荐系统中的LLM首次出现缩放定律

Benyu Zhang, Qiang Zhang, Jianpeng Cheng, Hong-You Chen, Qifei Wang, Wei Sun, Shen Li, Jia Li, Jiahao Wu, Qunshu Zhang, Neeraj Bhatia, Xiangjun Fan, Hong Yan

机构 * Meta

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种分层框架生成高质量合成数据,通过避免原始数据噪声,首次在推荐领域实现LLM的稳健幂律缩放,并显著提升下游排序任务性能。

Comments update according to icml reviewers feedback

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01364 2026-06-02 cs.CR cs.AI cs.SE 89%

Needles at Scale: LLM-Assisted Target Selection for Windows Vulnerability Research

大规模针尖:LLM辅助的Windows漏洞研究目标选择

Michael J. Bommarito

机构 * Microsoft(微软) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出Symbolicate-Enrich-Sample流水线,通过符号恢复、结构特征提取和低成本语言模型排序,从Windows系统数千万函数中筛选出约2.2万个候选目标,解决漏洞研究中目标选择瓶颈问题。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12325 2026-06-02 cs.CL 89%

$M^3$ Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models

$M^3$ 缩放定律:优化低资源语言模型的多周期、多语言和多阶段训练

Kosuke Akimoto, Taiki Miyagawa, Masafumi Oyamada

机构 * NEC Corporation(日本电报电话株式会社)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 本文提出 $M^3$ 缩放定律,统一预测模型规模、目标语料周期数、平均目标语言比例和最终阶段目标语言比例对低资源语言模型预训练损失的影响,并推导出最优训练策略的实用指南。

Comments 35 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00655 2026-06-02 cs.MA cs.AI cs.CY 87%

Scaling Behavior of Single LLM-Driven Multi-Agent Systems

单一LLM驱动的多智能体系统的扩展行为

Jialing Li, Zhouhong Gu, Yin Cai, Hongwei Feng

机构 * Fudan University(复旦大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过提出顺序迭代多智能体系统(SIMAS)框架,系统研究了同质多智能体系统性能随智能体数量变化的扩展规律,发现性能并非单调提升,而是受协作协同与协调开销之间的权衡支配,呈现收益递减模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00230 2026-06-02 cs.LG 87%

A Pre-Training Analogue of Grokking in Language Models: Tracing Delayed Grammatical Generalization

语言模型中预训练的Grokking类比:追踪延迟的语法泛化

Sherin Muckatira, Namrata Shivagunde, Vijeta Deshpande, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.LG

AI总结 本文提出一个基于暴露的框架,在LLM预训练中研究类似grokking的延迟泛化现象,通过BLiMP最小对发现语法泛化延迟,并分析泛化前后语法概念向量的变化。

Comments 18 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31401 2026-06-02 cs.CL 87%

"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

Înţelegi Româneşte?'' 罗马尼亚语视觉语言模型的构建配方

Mihai Masala, Marius Leordeanu, Mihai Dascalu, Traian Rebedea

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰技术大学布加勒斯特国家大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本文系统研究了构建罗马尼亚语视觉语言模型(VLM)的完整流程,通过翻译英文语料、消融实验分析视觉骨干、语言骨干和OCR数据的影响,并构建文化本地化评估集HoraVQA,证明罗马尼亚语适配模型在性能上超越同尺寸甚至更大尺寸的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18863 2026-06-02 cs.CV cs.CL 87%

Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction

基于点视觉融合与语言模型重建的音素级视觉语音识别

Matthew Kit Khinn Teng, Haibo Zhang, Takeshi Saitoh

机构 * Kyushu Institute of Technology(九州工业大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 提出一种两阶段音素级视觉语音识别框架,通过融合视觉和面部地标运动特征,并利用LLM模型重建单词,在LRS2和LRS3数据集上分别实现17.4%和21.0%的词错误率。

Comments Accepted at ICASSP 2026. This version corresponds to the camera-ready manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01255 2026-06-02 cs.CL 86%

Agentic Clustering: Controllable Text Taxonomies via Multi-Agent Refinement

Agentic Clustering: 通过多智能体精炼实现可控文本分类

Simon Löwe, Emily Silcock

机构 * Burning Glass Institute(Burning Glass研究院) Harvard University(哈佛大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种基于多智能体(提议者、合成者、审计者、调查者、批评者)的自适应文本聚类方法,通过编排器LLM动态调整聚类流程,在七个公开基准上实现最先进性能,ARI最高提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00284 2026-06-02 cs.CL 85%

Parameter Alignment Mitigates Catastrophic Forgetting in Multilingual Expert Language Models

参数对齐减轻多语言专家语言模型中的灾难性遗忘

Sanchit Ahuja, Terra Blevins

机构 * Northeastern University(东北大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对多语言持续预训练中的灾难性遗忘问题,提出五种层感知参数对齐策略(硬冻结、软正则化、事后权重恢复和模型合并),在32种训练语言和保留语言上评估,证明参数对齐能有效减少遗忘且语言获取成本低。

Comments 25 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01504 2026-06-02 cs.IR cs.LG 84%

Semantic Retrieval for Product Search in E-Commerce

电子商务产品搜索中的语义检索

Nikhil Kothari, Saksham Samdani, Ritam Mallick, Praveen Gupta, Ankit Vijay, Surender Kumar

机构 * Flipkart, India(印度Flipkart)

专题命中 预训练与数据 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.LG

AI总结 针对电商搜索中短、嘈杂、口语化查询和细粒度属性区分问题,提出一种基于Siamese LLM双编码器的两阶段训练方法,通过对比学习和偏好优化实现精确匹配与排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04828 2026-06-02 cs.CL 84%

From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models

从陌生到熟悉:通过梯度偏差检测大型语言模型中的预训练数据

Ruiqi Zhang, Lingxiang Wang, Hainan Zhang, Zhiming Zheng, Yanyan Lan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心,北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 提出GDS方法,通过分析目标样本的梯度偏差分数(包括更新幅度、位置和神经元激活集中度)来区分预训练成员与非成员数据,实现高效且跨数据集迁移的预训练数据检测。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00613 2026-06-02 cs.CL cs.AI 84%

Linguistics-Aware Non-Distortionary LLM Watermarking

语言学感知的无失真LLM水印

Shinwoo Park, Hyejin Park, Hyeseon An, Yo-Sub Han

机构 * Yonsei University(延世大学) Rensselaer Polytechnic Institute(罗切斯特理工学院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出LUNA水印方法,通过语言自适应非失真二元锦标赛采样器,在保持文本质量的同时实现高检测性能,在12种设置中AUROC达0.9959且中位困惑度偏移仅0.045。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13548 2026-06-02 cs.RO cs.AI 83%

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

AttenA+: 纠正机器人基础模型中的动作不平等性

Daojie Peng, Fulong Ma, Jiahang Cao, Qiang Zhang, Xupeng Xie, Jian Guo, Ping Luo, Andrew F. Luo, Boyu Zhou, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) IDEA Research(IDEA研究院) SUSTech(南方科技大学) X-Humaniod

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 针对机器人基础模型忽视动作物理重要性的问题,提出AttenA+框架,通过速度驱动的动作注意力重加权训练目标,提升复杂长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04958 2026-06-02 q-bio.QM cs.AI q-bio.NC 83%

CalM: A Self-Supervised Foundation Model for Population Dynamics in Calcium Imaging Data

CalM:一种用于钙成像数据中群体动力学的自监督基础模型

Xinhong Xu, Yimeng Zhang, Qichen Qian, Yuanlong Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出自监督基础模型CalM,通过双轴自回归Transformer和高效分词器,在钙成像数据上预训练后,可迁移至神经群体动力学预测和行为解码等下游任务,并取得竞争性或更优性能。

Comments ICML accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02470 2026-06-02 cs.AI 83%

Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge

通过身份桥打破自回归语言模型中的逆转诅咒

Xutao Ma, Yixiao Huang, Hanlin Zhu, Somayeh Sojoudi

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出一种名为“身份桥”的简单数据正则化方法(形式为“A→A”),通过理论分析和实验证明该方法能有效缓解自回归语言模型中的逆转诅咒,使模型从事实记忆转向规则学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05970 2026-06-02 cs.LG cs.AI math.DS stat.ML 82%

Inverse Depth Scaling From Most Layers Being Similar

大多数层相似时的逆深度缩放

Yizhou Liu, Sara Kangaslahti, Ziming Liu, Jeff Gore

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过分析大型语言模型和玩具残差网络,发现损失与深度成反比,归因于功能相似的层通过集成平均而非组合学习或平滑动力学离散化来减少误差,表明需要架构创新以鼓励深度组合使用。

Comments Camera-ready version, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07617 2026-06-02 cs.CV 82%

Scaling Pre-training to One Hundred Billion Data for Vision Language Models

将视觉语言模型的预训练扩展到一千亿数据

Xiao Wang, Ibrahim Alabdulmohsin, Daniel Salz, Zhe Li, Keran Rong, Xiaohua Zhai

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 本文通过实验探究将视觉语言模型预训练数据扩展到一千亿规模的效果,发现传统基准性能饱和,但文化多样性任务和低资源语言受益显著,并指出质量过滤可能减少文化多样性。

Comments v2: CVPR Findings'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01470 2026-06-02 physics.flu-dyn cs.AI cs.LG 81%

Emergent Transfer of a Physics Foundation Model from Simulation to Laboratory Turbulence

物理基础模型从模拟到实验室湍流的涌现迁移

Payel Mukhopadhyay, Stefan S. Nixon, Romain Watteaux, Michael McCabe, Alberto Bietti, Kyunghyun Cho, Cristiana Diaconu, Irina Espejo Morales, David Fouhey, Siavash Golkar, Tom Hehir, Shirley Ho, Jake Kovalic, Geraud Krawezik, Francois Lanusse, Tanya Marwah, Rudy Morel, Mariel Pettee, Helen Qu, Jeff Shen, Hadi Sotoudeh, Stuart B. Dalziel, Miles Cranmer

机构 * University of Cambridge(剑桥大学) CEA, DAM/DIF(法国CEA DAM/DIF) Flatiron Institute(Flatiron研究所) New York University(纽约大学) Princeton University(普林斯顿大学) Yale University(耶鲁大学) AIM, Université Paris-Saclay, Université Paris Cité, CEA, CNRS(AIM,巴黎-萨克雷大学,巴黎城市大学,CEA,CNRS) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Polymathic AI(聚合人工智能)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过微调连续介质动力学基础模型Walrus,在仅使用少量模拟数据的情况下,零样本泛化到实验室瑞利-泰勒不稳定性实验,揭示了初始条件在模拟-实验差距中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00241 2026-06-02 cs.LG cs.AI stat.ML 81%

InfoAtlas: A Foundation Model for Zero-Shot Statistical Dependence Estimate

InfoAtlas:用于零样本统计依赖性估计的基础模型

Zhengyang Hu, Yanzhi Chen, Hanxiang Ren, Qunsong Zeng, Youyi Zheng, Adrian Weller, Kaibin Huang, Yanchao Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出InfoAtlas,一种基础模型架构,通过单次前向传播直接推断互信息,实现零样本估计,在保持精度的同时获得100倍加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01671 2026-06-02 cs.CL 79%

When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models

当意义旅行:混合专家模型在语言模型习语理解中的细粒度作用

Sarmistha Das, Vaibhav Vishal, Shreyas Guha, Amaan Ali, Kitsuchart Pasupa, Sriparna Saha

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) School of Information Technology, King Mongkut’s Institute of Technology Ladkrabang, Thailand(泰国拉差班国王理工大学信息科技学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 针对低资源东南亚语言中习语的文化隐喻复杂性,提出Varnika多模态习语语料库和混合专家模型HybridMoE,通过控制混合和掩码多模态嵌入缓解专家稀疏性,实现习语理解性能提升5-6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00955 2026-06-02 cs.LG q-bio.QM 79%

CryoProt: A Protein Pretraining Framework with Cross-Box Interactions on Cryo-EM Density Maps

CryoProt: 一种基于冷冻电镜密度图跨盒交互的蛋白质预训练框架

Dan Luo, Xuan Lin, Peng Zhou, Junwen Zhu, Tengfei Ma, Xiangxiang Zeng, Yiping Liu

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of Computer Science, Xiangtan University(湘潭大学计算机学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出 CryoProt 框架,通过多头潜在注意力机制实现密度图跨盒交互建模,并采用多任务预训练策略,在蛋白质柔性预测等下游任务中取得最高12%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00776 2026-06-02 cs.LG 79%

Latent Diffusion Pretraining for Crystal Property Prediction

晶体性质预测的潜在扩散预训练

Shrimon Mukherjee, Kishalay Das, Partha Basuchowdhuri, Pawan Goyal, Niloy Ganguly

机构 * University of California, Berkeley(加州大学伯克利分校) Indian Institute of Technology, Bombay(印度班加罗尔印度理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出基于潜在扩散的预训练框架CrysLDNet,结合变分自编码器和扩散模型,从无标注晶体结构中学习表示,微调后显著提升性质预测性能。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18838 2026-06-02 cs.LG cs.AI cs.CL 78%

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

说谎只是一个阶段:语言模型扩展中的隐藏对齐转变

Adil Amin

机构 * ZEHEN Labs(ZEHEN实验室)

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分析63个基础模型,发现语言模型在特定规模阈值下,推理能力与真实性从反相关转变为正相关,并揭示了输出投影瓶颈和零竞争注意力头等内部机制。

Comments 15 pages, 8 figures, 2 tables. Companion paper: "The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next." ( https://doi.org/10.48550/arXiv.2605.18840). Code: https://github.com/adilamin89/cape-scaling. Dashboard: https://zehenlabs.com/cape/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01207 2026-06-02 cs.CV cs.LG 77%

Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning

特征对齐决定融合策略:多模态学习中交叉注意力与拼接的比较研究

Zhiqiang Zhou, Xuezhen Xie

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化学工业职业技术学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 通过实验和理论分析,证明特征对齐质量而非数据规模是决定多模态融合策略优劣的关键因素,当特征预对齐时拼接优于交叉注意力。

Comments 8 pages,6 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01062 2026-06-02 cs.AI 77%

DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts

DAG-MoE:从简单混合到专家混合中的结构聚合

Jiarui Feng, Hanqing Zeng, Karish Grover, Ruizhong Qiu, Yinglong Xia, Qiang Zhang, Qifan Wang, Ren Chen, Dongqi Fu, Jiayi Liu, Zhoukai Zhao, Xiangjun Fan, Benyu Zhang, Yixin Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出DAG-MoE框架,通过轻量级模块自动学习选定专家之间的最优聚合结构,以替代标准加权求和聚合,从而在不改变专家或路由器的情况下扩展专家组合空间并实现单层多步推理,在预训练和微调中均优于传统MoE基线。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏