arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2607.01538 2026-07-03 cs.CL 新提交 79%

Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

语言模型真的能进行上下文检索吗?在百万Token规模的文档中淹没

Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文首次系统研究百万Token语料库上的上下文检索,提出0.6B参数的BlockSearch模型,通过注意力稀释分析引入长度感知调整,在MS MARCO和NQ上匹配稠密检索,在LIMIT上得分高出3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00174 2026-07-02 cs.CV cs.LG 新提交 79%

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

窃取补丁大小:对抗性操纵视觉-语言模型

Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 提出一种黑盒模型窃取攻击,通过任务级侧信道推断视觉语言模型的补丁大小和预处理流程,并利用泄露信息实现预处理感知的迁移攻击和模型定向对抗操纵。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30429 2026-07-01 cs.LG 版本更新 79%

Arko-T: A Foundation Model for Text-to-Structured 3D Generation

Arko-T: 面向文本到结构化3D生成的基础模型

Liang Wang, Zhaoyang Xi, Zekai Xiang, Heng Meng, Qishan Zhang, Pingyi Zhou, Jin Liu, Litao Chen

机构 * Spatial Design Intelligence Lab, BitInf Ltd.(BitInf有限公司空间设计智能实验室) School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computer and Information Engineering, Nanjing Tech University(南京工业大学计算机与信息工程学院)

专题命中 预训练与数据 :foundation model(title);LLM(abstract_cn);分类 cs.LG

AI总结 提出4B参数文本到设计模型Arko-T,通过设计状态对齐实现从自然语言到可编辑参数化CAD程序的生成,在12项指标中8项最优,成本仅为前沿模型的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11554 2026-07-01 cs.LG 版本更新 79%

A Controlled Counterexample to Strong Proxy-Based Explanations of OOD Performance: in a Fixed Pretraining-and-Probing Setup

对强代理基于解释的OOD性能的受控反例:在固定预训练和探测设置中

Hongmin Li

机构 * School of Life Science and Technology, Institute of Science Tokyo(生命科学与技术学院,科学东京研究所) Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences(计算生物学与医学科学系,前沿科学研究生院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 研究探讨了代理是否必须与OOD探测准确性排名一致,发现代理可能无法追踪任务相关结构,揭示了强代理解释的边界。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20062 2026-07-01 cs.LG stat.ML 版本更新 79%

A Theory of How Pretraining Shapes Inductive Bias in Fine-Tuning

预训练如何塑造微调中的归纳偏置的理论

Nicolas Anguita, Francesco Locatello, Andrew M. Saxe, Marco Mondelli, Flavia Mancini, Samuel Lippl, Clementine Domine

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 通过分析对角线性网络中的预训练-微调流程,发现不同初始化尺度导致四种微调模式,其中较小的早期层初始化有助于特征重用和精炼,提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14122 2026-06-26 cs.CL 新提交 79%

Beyond Perplexity: UTF-8 Validity in Byte-aware Language Models

超越困惑度:字节感知语言模型中的 UTF-8 有效性

Sangwhan Moon, Daisuke Oba, Youmi Ma, Tatsuya Hiraoka, Naoaki Okazaki

机构 * University of Tokyo(东京大学) National Institute of Information and Communications Technology(信息通信技术国家研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究字节级分词语言模型生成无效UTF-8序列的问题,通过多语言训练实验发现UTF-8有效性收敛比困惑度慢约一倍,且罕见字符结构有效性更高,表明可靠UTF-8生成是需要单独评估的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26021 2026-06-25 cs.CR cs.AI 新提交 79%

Privacy Vulnerabilities of Attention Layers in Tabular Foundation Models and Protection of High-Risk Queries

表格基础模型中注意力层的隐私漏洞及高风险查询的保护

Tânia Carvalho, Maxime Cordy

机构 * SnT, University of Luxembourg(卢森堡大学SnT研究所)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文发现表格基础模型的注意力机制会泄露成员信息,提出无影子模型的AMIA攻击,并基于k-匿名原理设计推理时防御,降低成员泄露风险。

Comments 18 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13432 2026-06-25 cs.CV cs.AI 版本更新 79%

Spatial Transcriptomics as Images for Large-Scale Pretraining

空间转录组学作为图像进行大规模预训练

Yishun Zhu, Jiaxin Qi, Jian Wang, Yuhua Zheng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of the Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 提出将空间转录组学数据视为可裁剪的多通道图像,通过空间分块和基因子集选择来增加训练样本并保留空间上下文,实现大规模预训练,显著提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22478 2026-06-23 cs.CL 新提交 79%

ROMEVA: Geometry-Preserving Vocabulary Expansion for Roman Urdu Language Models

ROMEVA: 罗马乌尔都语语言模型的几何保持词汇扩展

Mahnoor Khan, Afsheen Asif, Milhan Afzal Khan, Seemab Latif, Mehwish Fatima

机构 * Department of Computer Science, University of Agriculture Faisalabad(费萨拉巴德农业大学计算机科学系)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 针对罗马乌尔都语拼写变异导致的子词碎片化问题,提出ROMEVA方法,结合子词平均初始化和PCA引导的锚点损失来稳定词汇扩展中的嵌入,实验发现下游性能与嵌入稳定性存在脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22056 2026-06-23 cs.LG 新提交 79%

Provably Efficient Policy-Reward Co-Pretraining for Adversarial Imitation Learning

对抗模仿学习的可证明高效策略-奖励联合预训练

Tian Xu, Zexuan Chen, Zhilong Zhang, Yi-Chen Li, Chenyang Wang, Lei Yuan, Yang Yu

机构 * National Key Laboratory for Novel Software Technology(计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 针对对抗模仿学习(AIL)需大量在线交互的问题,提出基于奖励塑形分析的理论框架,设计策略-奖励联合预训练方法CoPT-AIL,首次从理论上证明预训练能提升AIL的模仿性能。

Comments Paper accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24037 2026-06-23 cs.LG math.ST stat.TH 版本更新 79%

A Limit Theory of Foundation Models: A Mathematical Approach to Understanding Emergent Intelligence and Scaling Laws

基础模型的极限理论:从极限理论角度理解涌现智能与扩展定律的数学方法

Jun Shu, Junxiong Jia, Deyu Meng, Zongben Xu

机构 * School of Mathematics and Statistics(数学与统计学学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文通过极限理论构建数学框架,量化智能行为,揭示涌现智能源于参数极限架构,并推导基础模型的扩展定律。

Comments There exist some typos and inaccurate expression in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20904 2026-06-23 eess.IV cs.LG 版本更新 79%

ECGFlowCMR: Pretraining with ECG-Generated Cine CMR Helps Cardiac Disease Classification and Phenotype Prediction

ECGFlowCMR: 利用心电图生成电影心脏磁共振的预训练助力心脏病分类和表型预测

Xiaocheng Fang, Zhengyao Ding, Guangkun Nie, Jieyi Cai, Yujie Xiao, Bo Liu, Jiarui Jin, Haoyu Wang, Shun Huang, Ting Chen, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Polytechnic Institute of Zhejiang University, Zhejiang University(浙江大学 polytechnic 院) Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院计算技术研究所) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) Institute of Microelectronics, University of the Chinese Academy of Sciences(中国科学院微电子研究所) Department of Cardiology, Zhejiang University(浙江大学心内科部)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出ECGFlowCMR框架,通过相位感知掩码自编码器和解剖运动解耦流解决ECG与CMR的跨模态时序错配和解剖可观测性差距,生成逼真电影CMR序列,提升下游心脏病分类和表型预测性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18703 2026-06-18 cs.LG q-bio.QM 新提交 79%

Contextualizing Biological Language Models across Modalities via Logit-Space Contrastive Alignment

跨模态生物学语言模型的逻辑空间对比对齐

Yanjun Shao, Yundi Chen, Yashvi Patel, Aurelien Pelissier, María Rodríguez Martínez

机构 * Biomedical Informatics and Data Science, Yale School of Medicine(耶鲁医学院生物医学信息学与数据科学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 提出LOGICA框架,在输出逻辑空间进行对比学习,通过门控跨模态适配器保留预训练似然接口,实现跨不同词汇表模型的上下文条件预测,在蛋白质-配体结合、TCR-肽活性和药物耐药性预测任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17340 2026-06-17 cs.CV cs.AI 新提交 79%

Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation

几何一致的内窥镜表示用于图像引导导航:基于结构化基础模型适配

Hongchao Shu, Roger D. Soberanis-Mukul, Hao Ding, Morgan Ringel, Mali Shen, Saif Iftekar Sayed, Hedyeh Rafii-Tari, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Semaphor Surgical Johnson & Johnson MedTech(强生医疗科技)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 提出统一框架,结合合成数据管道与层级感知几何语义适配,学习几何一致且领域鲁棒的图像表示,提升单目内窥镜中的位姿估计与深度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12867 2026-06-17 cs.LG 新提交 79%

SMGFM: Spectral Multimodal Graph Pretraining for Multimodal-Attributed Graphs

SMGFM: 面向多模态属性图的谱多模态图预训练

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出SMGFM框架,利用图频谱分解区分结构诱导语义与模态特有语义,通过频带路由实现跨模态融合,在图级和模态级任务上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22530 2026-06-16 cs.LG cs.DB 79%

Task-Agnostic Contrastive Pretraining for Relational Deep Learning

关系深度学习中的任务无关对比预训练

Jakub Peleška, Gustav Šír

机构 * Czech Technical University in Prague(捷克技术大学布拉格分校)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出一种任务无关的对比预训练方法,通过三层对比目标提升关系数据的表示学习,实验表明预训练模型在关系数据迁移学习中表现优异。

Comments arXiv admin note: text overlap with arXiv:2506.22199

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26759 2026-06-15 cs.LG 版本更新 79%

Time Series Causal Discovery via Context-Conditioned and Causality-Augmented Pretraining

基于上下文条件与因果增强预训练的时间序列因果发现

Biao Ouyang, Tengxue Zhang, Zhihao Zhuang, Yang Shu, Chenjuan Guo, Bin Yang

机构 * East China Normal University(东华师范大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出PTCD框架,通过上下文条件建模和可迁移因果增强的预训练范式,提升跨任务时间序列因果发现的泛化能力,在多个真实OOD数据集上因果发现和根因识别表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13370 2026-06-12 cs.AI 新提交 79%

A Quantitative Experimental Repeated Measures Study of Training Dynamics in a Small Llama Style Language Model Under a Compute-Aware Token Budget

在计算感知令牌预算下小型Llama风格语言模型训练动态的定量实验重复测量研究

Joe Dwyer

机构 * Department of Computer Information Science, ECPI University(ECPI大学计算机信息科学系)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 本研究通过重复测量设计,分析在固定计算预算下训练小型Llama模型时,验证损失、困惑度等指标随令牌数变化的动态,发现早期快速改进后出现非单调退化,表明计算感知评估应关注训练轨迹而非终点指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11508 2026-06-11 cs.LG q-bio.QM 新提交 79%

Probabilistic Contrastive Pretraining for Multi-task ADME Property Prediction

概率对比预训练用于多任务ADME性质预测

Yifan Xue, Srimukh Prasad Veccham, Saee Paliwal, Tyler Shimko, Micha Livne

机构 * NVIDIA(英伟达)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出分子图-Transformer预训练框架,结合化学自监督与对比互信息,通过统一概率潜变量目标优化重构、对比和化学任务,在多任务微调中采用任务特定MLP头,在三个数据集上平均提升7.6%-9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14427 2026-06-11 cs.RO cs.LG 版本更新 79%

Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning

面向接触丰富机器人强化学习的自监督多感官预训练

Rickmer Krohn, Vignesh Prasad, Gabriele Tiboni, Georgia Chalvatzaki

机构 * Interactive Robot Perception & Learning (PEARL) Lab, TU Darmstadt, Germany(图腾机器人感知与学习实验室,图腾施塔德大学,德国) Hessian.AI(海斯堡人工智能) Robotics Institute Germany (RIG)(德国机器人研究所(RIG))

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出MSDP框架,通过掩码自编码和跨模态预测学习多感官表示,并采用非对称架构(评论家使用交叉注意力提取动态特征,演员使用稳定池化表示)加速策略学习,在模拟和真实机器人任务中展现出鲁棒性和高效性。

Comments 8 pages, 11 figures

Journal ref IEEE Robotics and Automation Letters, 2026, Vol. 11, No. 6, pp. 6799-6806

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07066 2026-06-09 cs.CL 新提交 79%

Modeling semantic association in self-paced reading with language model embeddings

使用语言模型嵌入建模自定步速阅读中的语义关联

Sara Møller Østergaard, Kenneth Enevoldsen, Afra Alishahi, Bruno Nicenboim

机构 * Department of Computational Cognitive Science, Tilburg University(蒂尔堡大学计算认知科学系) Center for Humanities Computing, Aarhus University(奥胡斯大学人文计算中心)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究使用语言模型嵌入的十种实现方式量化语义关联,通过贝叶斯模型分析其对N400和自定步速阅读时间的影响,发现句子嵌入能可靠捕捉超出词可预测性的语义关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06738 2026-06-08 cs.CL 新提交 79%

Modular Monolingual Adaptation using Pretrained Language Models

使用预训练语言模型的模块化单语适应

Nalin Kumar, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics Institute of Formal and Applied Linguistics(查尔斯大学数学与物理系形式与应用语言学研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 提出一种模块化方法,通过替换标记、冻结对应嵌入并调整模型其余部分,在低资源语言上提升NLU任务性能,优于全模型微调。

Comments Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05346 2026-06-05 cs.CL 79%

Trajectory Dynamics in Language Model Hidden States Predict Human Processing Costs Beyond Surprisal

语言模型隐藏状态中的轨迹动力学预测超越惊讶度的人类处理成本

Elan Barenholtz

机构 * Machine Perception & Cognitive Robotics Laboratory(机器感知与认知机器人实验室) Department of Psychology(心理学系) Center for Complex Systems(复杂系统中心) Florida Atlantic University(佛罗里达 Atlantic 大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 通过线性外推语言模型隐藏状态轨迹的偏差,提出轨迹外推误差作为独立于惊讶度的人类处理成本预测因子,并在自然故事语料库中验证其对自定步速阅读时间的预测能力。

Comments 17 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05198 2026-06-05 q-bio.BM cs.LG 79%

An accurate nucleic acid-small molecule docking framework via geometric deep learning with large-scale pretraining

基于几何深度学习与大尺度预训练的核酸-小分子精准对接框架

Shi Li, Xujun Zhang, Mingquan Liu, Hui Zhang, Shuoying Jia, Yu Kang, Tingjun Hou, Peichen Pan

机构 * College of Pharmaceutical Sciences, Zhejiang University(浙江大学药学院) Faculty of Health Sciences, University of Macau(澳门大学健康科学学院) Zhejiang Provincial Key Laboratory for Intelligent Drug Discovery and Development, Jinhua Institute of Zhejiang University(浙江省智能药物发现与开发重点实验室,浙江大学金华研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出NucleoDock框架,通过物理引导的大规模预训练和精细调优,结合序列、结构及原子级特征,利用混合密度网络几何评分头实现核酸-小分子对接,在125个复合物基准上达到56%的top-1成功率(RMSD<2.0Å),优于传统方法。

Comments 34 pages, 4 figures, 4 tabels, Supplementary Materials includes 8 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01349 2026-06-05 cs.LG cs.CE physics.comp-ph 79%

PI-JEPA: Label-Free Surrogate Pretraining for Coupled Multiphysics Simulation via Operator-Split Latent Prediction

PI-JEPA: 一种无需标签的替代预训练方法,用于通过操作符分裂潜在预测的耦合多物理场模拟

Brandon Yee, Pairie Koh

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 该研究提出了一种无需完整PDE求解的替代预训练框架PI-JEPA,通过掩码潜在预测和每子操作符PDE残差正则化,在未标记的参数场上训练,从而减少多物理场替代部署所需的模拟预算。

Comments Substantial Revision Required

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09388 2026-06-04 cs.CL 79%

Effective vocabulary expansion of multilingual language models for extremely low-resource languages

针对极低资源语言的多语言语言模型的有效词汇扩展

Jianyu Zheng

机构 * School of Foreign Languages, University of Electronic Science and Technology of China(电子科技大学外国语言学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 提出通过筛选源语言偏置词汇并利用双语词典初始化扩展词汇表示,对多语言预训练模型进行持续预训练,在词性标注和命名实体识别任务上分别提升0.54%和2.60%。

Comments 12 pages, 5 figures, 7 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01671 2026-06-02 cs.CL 79%

When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models

当意义旅行:混合专家模型在语言模型习语理解中的细粒度作用

Sarmistha Das, Vaibhav Vishal, Shreyas Guha, Amaan Ali, Kitsuchart Pasupa, Sriparna Saha

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) School of Information Technology, King Mongkut’s Institute of Technology Ladkrabang, Thailand(泰国拉差班国王理工大学信息科技学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 针对低资源东南亚语言中习语的文化隐喻复杂性,提出Varnika多模态习语语料库和混合专家模型HybridMoE,通过控制混合和掩码多模态嵌入缓解专家稀疏性,实现习语理解性能提升5-6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00955 2026-06-02 cs.LG q-bio.QM 79%

CryoProt: A Protein Pretraining Framework with Cross-Box Interactions on Cryo-EM Density Maps

CryoProt: 一种基于冷冻电镜密度图跨盒交互的蛋白质预训练框架

Dan Luo, Xuan Lin, Peng Zhou, Junwen Zhu, Tengfei Ma, Xiangxiang Zeng, Yiping Liu

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of Computer Science, Xiangtan University(湘潭大学计算机学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出 CryoProt 框架,通过多头潜在注意力机制实现密度图跨盒交互建模,并采用多任务预训练策略,在蛋白质柔性预测等下游任务中取得最高12%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00776 2026-06-02 cs.LG 79%

Latent Diffusion Pretraining for Crystal Property Prediction

晶体性质预测的潜在扩散预训练

Shrimon Mukherjee, Kishalay Das, Partha Basuchowdhuri, Pawan Goyal, Niloy Ganguly

机构 * University of California, Berkeley(加州大学伯克利分校) Indian Institute of Technology, Bombay(印度班加罗尔印度理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出基于潜在扩散的预训练框架CrysLDNet,结合变分自编码器和扩散模型,从无标注晶体结构中学习表示,微调后显著提升性质预测性能。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29828 2026-05-29 cs.LG 79%

When Do Graph Foundation Models Transfer? A Data-Centric Theory

图基础模型何时迁移?一个以数据为中心的理论

Jiajun Zhu, Ying Chen, Peihao Wang, Yixuan He, Pan Li, Aditya Akella, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Arizona State University(亚利桑那州立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文通过图论连续极限方法,将跨域输出偏移分解为有限样本近似项和结构不匹配的内在域差异,并验证了位置编码稳定性对迁移的影响。

Comments 21 pages, including appendix. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏