arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

2026-08-18 至 2026-08-18 共收录 9
2608.16268 2026-08-18 cs.CV cs.LG 新提交

CoM$^3$eT: A foundation model for medical image analysis through federated, multidimensional context integration

CoM³eT:通过联邦多维上下文集成实现医学图像分析的基础模型

J. Raphael Schäfer, Kai Geissler, Till Nicke, Chiara Tappermann, Karoline Heber, Eike Petersen, Habib Mergan, Lars Ole Schwen, Nick Weiss, Annika Gerken, Jan Hendrik Moltz, Tom Bisson, Isil Dogan O, Tim-Rasmus Kiehl, Norman Zerbe, Sefer Elezkurtaj, Robin S. Mayer, Nadine Flinner, Peter Wild, Isabel Dahm, Felix Peisen, Heinrich von Busch, Robert Grimm, Sebastian Arndt, Lisa Siegler, Matthias Stefan May, Antje Prasse, Natalia Artysh, Fabian Kiessling, Johannes Lotz

机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学MEVIS研究所) RWTH Aachen University(亚琛工业大学) Medizinische Hochschule Hannover(汉诺威医学院) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院) Charité – Universitätsmedizin Berlin(柏林夏里特医学院) Freie Universität Berlin(柏林自由大学) Humboldt-Universität zu Berlin(柏林洪堡大学)

AI总结 CoM³eT是统一多专科、多预测类型及多维度输入的医学视觉基础模型,在公开竞赛中表现优于同类模型,仅微调少量参数即可适配多临床任务,联邦学习场景下性能接近聚合数据训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14808 2026-08-18 cs.AI cs.CL cs.LG 新提交

Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking

大型语言模型(LLMs)知道该问什么以及何时提问吗?评估多轮信息获取能力

Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind)

AI总结 该研究构建MT-InfoSeek评估套件,从提问内容、时机及信息影响三方面评估LLMs的多轮信息获取能力,发现其存在低估信息需求等缺陷,且该能力未被现有评估覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14706 2026-08-18 cs.CV cs.AI cs.LG 新提交

Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning

均衡强迫:无需噪声条件的自适应视频生成

Hansen Jin Lillemark, Alex Rojas, Zachary Novack, Runqian Wang, Yilun Du, Yian Ma, Taylor Berg-Kirkpatrick, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校) MIT(麻省理工学院) Harvard University(哈佛大学)

AI总结 该研究提出无需噪声条件的均衡强迫(EqF)框架,解耦去噪场学习与采样,实现自适应闭环推理,提升自回归视频生成的质量与一致性,性能优于传统噪声条件方法。

Comments Project page: this https URL (https://equilibriumforcing.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15632 2026-08-18 cs.LG cond-mat.dis-nn cs.AI stat.ML 新提交

Sparse Prototype Code Underlies Classification and Prediction Across Modalities

跨模态分类与预测的稀疏原型编码

Yehonatan Avidan, Daniel D. Lee, Haim Sompolinsky

机构 * Hebrew University(希伯来大学) The Racah Institute of Physics(拉卡物理研究所) Edmond and Lily Safra Center for Brain Sciences(埃德蒙和莉莉·萨夫拉脑科学中心) Cornell Tech, Cornell University(康奈尔大学科技校区) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

AI总结 该研究揭示跨模态AI模型分类任务存在通用表征几何,推导平均场理论准确预测分类准确率,发现分类由稀疏质心对齐结构支配,关联稀疏特征提取方法。

Comments 33 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L.S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10819 2026-08-18 cs.DS cs.CC cs.LG 版本更新

Differentially Private Verification of Distribution Properties

差分隐私分布属性验证

Elbert Du, Cynthia Dwork, Pranay Tankala, Linjun Zhang

机构 * Harvard University(哈佛大学) Rutgers University(罗格斯大学)

AI总结 本文研究差分隐私分布属性测试,探讨在不可信证明者帮助下验证分布属性的样本和通信复杂性,提出在不同隐私模型下优化协议的方法,并证明产品分布私有测试的样本复杂性最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06697 2026-08-18 cs.CV cs.AI 版本更新

Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs

通过目光思考:将眼动作为视觉推理监督用于医学视觉语言模型

Yiwei Li, Yifan Zhou, Huaqin Zhao, Zihao Wu, Zhengliang Liu, Xiang Li, Quanzheng Li, Tianming Liu, Lin Zhao

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Computer Science and Engineering, University of Texas, Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系)

AI总结 通过引入眼动标记,利用时间有序的注视轨迹引导医学VLM的视觉推理,提升放射学任务的性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21033 2026-08-18 math.OC cs.LG math.DG 版本更新

Iso-Riemannian Optimization on Learned Data Manifolds

学习到的数据流形上的等黎曼优化

Willem Diepeveen, Melanie Weber

机构 * Department of Mathematics University of California, Los Angeles(数学系 加州大学洛杉矶分校) School of Engineering and Applied Sciences Harvard University(工程与应用科学学院 哈佛大学)

AI总结 本文针对学习到的数据流形上的优化问题,提出等黎曼优化理论,构建l2投影梯度等黎曼下降方案,从函数与向量场视角分析其收敛性,为该场景下的优化提供了合适框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03897 2026-08-18 cs.LG stat.ME stat.ML 版本更新

Leveraging Generative Artificial Intelligence for Causal Inference with Unstructured Data

生成式人工智能驱动的推断

Kosuke Imai, Kentaro Nakamura

机构 * Harvard University(哈佛大学) John F. Kennedy School of Government(约翰·F·肯尼迪政府学院)

AI总结 研究人员提出GPI统计框架,利用开源GenAI模型提取非结构化数据的低维表示,无需微调生成模型,通过三个应用验证其可用于因果与预测推断,开源软件包可实现该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏