arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

2026-05-15 至 2026-05-15 共收录 8
2605.15079 2026-05-15 cs.LG cs.DB cs.DL cs.IR

Croissant Baker: Metadata Generation for Discoverable, Governable, and Reusable ML Datasets

饼干师:用于可发现、可治理和可重用的机器学习数据集元数据生成

Rafi Al Attrach, Rajna Fani, Sebastian Lobentanzer, Joan Giner-Miguelez, Debanshu Das, Varuni H. K., Nobin Sarwar, Rajat Ghosh, Anwai Archit, Surbhi Motghare, Christina Conrad Parry, Luis Oala, Lara Grosso, Joaquin Vanschoren, Steffen Vogler, Sujata Goswami, Eric S. Rosenthal, Marzyeh Ghassemi, Matthew McDermott, Tom Pollard

机构 * Technical University of Munich(慕尼黑技术大学) Massachusetts Institute of Technology(麻省理工学院) Helmholtz Munich(海德堡-慕尼黑研究所以及医学中心) Barcelona Supercomputing Center(巴塞罗那超级计算中心) Google(谷歌) Couchbase(Couchbase公司) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Nutanix(Nutanix公司) Georg-August-University Göttingen(哥廷根大学) Salesforce(Salesforce公司) Sage Bionetworks(Sage Bionetworks公司) Dotphoton(Dotphoton公司) Harvard University(哈佛大学) Eindhoven University of Technology(埃因霍温理工大学) Bayer AG(拜耳公司) Independent Researcher(独立研究者) Massachusetts General Hospital(麻省总医院) Columbia University(哥伦比亚大学)

AI总结 本文提出Croissant Baker,一种本地优先的开源命令行工具,可直接从数据集目录生成验证过的Croissant元数据,通过模块化处理程序注册表,支持大规模数据集,如MIMIC-IV,达到97-100%的准确率。

Comments 23 pages, 5 figures, 11 tables. Project: https://lcp.mit.edu/croissant-baker/ Code: https://github.com/MIT-LCP/croissant-baker

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14980 2026-05-15 cs.CV cs.AI

MicroscopyMatching: Towards a Ready-to-use Framework for Microscopy Image Analysis in Diverse Conditions

MicroscopyMatching:面向多样条件下的显微图像分析即用框架

Xiaofei Hui, Haoxuan Qu, Hossein Rahmani, Shuohong Wang, Jeff W. Lichtman, Jun Liu

机构 * School of Computing and Communications(计算与通信学院) Lancaster University(兰卡斯特大学) Department of Cell Biology(细胞生物学系) Harvard Medical School(哈佛医学院) Department of Molecular and Cellular Biology(分子与细胞生物学系) Harvard University(哈佛大学)

AI总结 本文提出MicroscopyMatching框架,通过统一匹配问题解决显微图像分析中的分割、跟踪和计数任务,克服传统方法在多样条件下的适应性不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14685 2026-05-15 cs.LG cond-mat.stat-mech cs.AI

Spontaneous symmetry breaking and Goldstone modes for deep information propagation

自发对称破缺与深度信息传播中的Goldstone模式

Nabil Iqbal, T. Anderson Keller, Yue Song, Takeru Miyato, Max Welling

机构 * Dept. of Mathematical Sciences, Durham University(杜伦大学数学科学系) Kempner Institute, Harvard University(哈佛大学凯普纳研究所) AMLab, University of Amsterdam(阿姆斯特丹大学AMLab) College of AI, Tsinghua University(清华大学人工智能学院) University of Tübingen, Tübingen(图宾根大学) AI Center(人工智能中心) CuspAI

AI总结 研究深度神经网络中因连续对称自发破缺而产生的Goldstone-like自由度,证明其能实现稳定信息传播,提升训练效率和长期记忆性能。

Comments 28 pages. Code at https://github.com/nabiliqbal/ssb-goldstone-deep-info-prop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14227 2026-05-15 cs.LG cs.CL

DT-Transformer: A Foundation Model for Disease Trajectory Prediction on a Real-world Health System

DT-Transformer:一种用于真实世界健康系统中疾病轨迹预测的基础模型

Yunying Zhu, Andrew R Weckstein, Kueiyu Joshua Lin, Jie Yang

机构 * Division of Pharmacoepidemiology and Pharmacoeconomics, Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(药理流行病学与药效学部,医学部,布里奇沃特医院,哈佛医学院) Harvard T.H. Chan School of Public Health, Harvard University(哈佛大学T.H. 陈公共卫生学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(自然与人工智能研究学院,哈佛大学) Broad Institute of MIT and Harvard, Cambridge, MA, USA(MIT与哈佛大学Broad研究所,剑桥,马萨诸塞州,美国) Harvard Data Science Initiative, Harvard University(哈佛大学数据科学计划)

AI总结 本文提出DT-Transformer模型,基于大规模多医院健康数据预测疾病轨迹,验证了其在不同场景下的预测能力,展示了在896种疾病类别上的高AUC表现。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14851 2026-05-15 cs.CV cs.RO

AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving

AutoMoT:一种基于异步混合变换器的统一视觉-语言-动作模型用于端到端自动驾驶

Wenhui Huang, Songyan Zhang, Qihang Huang, Zhidong Wang, Zhiqi Mao, Collister Chua, Zhan Chen, Long Chen, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Harvard University, US(哈佛大学,美国)

AI总结 本文提出AutoMoT,一种统一视觉-语言-动作模型,通过异步混合变换器架构解决自动驾驶中推理与动作空间分布不一致、推理效率低等问题,实验证明其在多基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11855 2026-05-15 cs.LG cs.AI

Achieving Approximate Symmetry Is Exponentially Easier than Exact Symmetry

实现近似对称性比实现精确对称性要指数级更容易

Behrooz Tahmasebi, Melanie Weber

机构 * Harvard John A. Paulson School of Engineering and Applied Sciences(哈佛大学约翰·A·保罗森工程与应用科学学院) Harvard University(哈佛大学)

AI总结 本文研究了精确对称性和近似对称性在机器学习中的成本差异,提出平均复杂度框架,证明精确对称性需要线性复杂度而近似对称性仅需对数复杂度,首次理论区分了两者。

Comments 33 pages, 2 figures. Published at ICLR 2026

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14090 2026-05-15 cs.CY cs.GR cs.LG

Synthetic Sociality: How Generative Models Privatize the Social Fabric

合成社会性:生成模型如何私有化社会织体

Ana Dodik, Moira Weigel

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Harvard University(哈佛大学)

AI总结 本文提出分析生成模型的理论框架,探讨生成模型自动化生产社会能力,提出'合成社会性'概念,分析其对社会关系的影响及未来设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14041 2026-05-15 stat.ME cs.LG

Wahkon: A Statistically Principled Deep RKHS Superposition Network

Wahkon:一种基于统计原理的深度RKHS叠加网络

Yongkai Chen, Wenxuan Zhong, Ping Ma

机构 * Harvard University(哈佛大学) University of Georgia(佐治亚大学)

AI总结 Wahkon结合Kolmogorov超位置原理与RKHS正则化,提供有限维深度表示定理,实现训练可行性与层间复杂度控制,通过统计保证提升预测准确性与解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏