arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-07-10 至 2026-07-10 共收录 7
2607.08024 2026-07-10 cs.CV cs.AI cs.LG cs.RO 新提交

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

APIVOT:具有交错视觉语言思维的自适应规划

Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu

机构 * Stanford University(斯坦福大学)

AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。

Comments Project Page: https://emilyzjin.github.io/projects/apivot.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07967 2026-07-10 stat.ML cs.LG math.OC 新提交

Expressivity and Statistical Trade-offs in Diffusion Policy Learning

扩散策略学习中的表达能力与统计权衡

Viet Vu, Renyuan Xu, Jiacheng Zhang, Yufei Zhang

机构 * Stanford University(斯坦福大学) Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08041 2026-07-10 cs.LG cond-mat.dis-nn 新提交

An exact information theory of generalization phase transitions in Bayesian diffusion models

贝叶斯扩散模型中泛化相变的精确信息理论

Henry Hunt, Mason Kamb, Surya Ganguli

机构 * Stanford University(斯坦福大学)

AI总结 研究扩散模型如何从有限训练集学习复杂分布,引入BIRD模型,通过贝叶斯后验推断实现时间反转扩散,确定记忆与泛化的信息理论相变边界,实验证实理论预测,揭示信息受限在生成式AI中规避维度灾难的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26428 2026-07-10 cs.RO cs.AI 新提交

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

Play2Perfect:灵巧操作预训练对精密装配的关键因素

Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

AI总结 提出Play2Perfect框架,通过任务无关的玩耍预训练获取可复用的操作先验,再微调用于精密装配,在稀疏奖励和接触密集任务中实现33倍样本效率提升。

Comments 22 pages, 12 figures, 4 tables. Project page: https://play2perfect.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13356 2026-07-10 cs.CL cs.AI cs.GT 版本更新

Peer-Predictive Self-Training for Language Model Reasoning

同伴预测自训练用于语言模型推理

Shi Feng, Hanlin Zhang, Fan Nie, Sham Kakade, Yiling Chen

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 本文提出PST框架,通过多模型协作利用交叉模型聚合响应作为内部训练信号,提升数学推理任务的准确率并减少生成-验证差距。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14584 2026-07-10 cs.CV 版本更新

Anatomically Guided Latent Diffusion for Brain MRI Progression Modeling

用于脑 MRI 进展建模的解剖学引导潜在扩散

Cheng Wan, Bahram Jafrasteh, Ehsan Adeli, Miaomiao Zhang, Qingyu Zhao

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔医学院) Stanford University(斯坦福大学) University of Virginia(弗吉尼亚大学)

AI总结 研究旨在准确建模脑 MRI 进展,提出解剖学引导潜在扩散模型 AG-LDM,通过融合多因素简化训练流程,经实验验证其在图像质量、误差降低及特征捕捉等方面表现优异,是可靠的脑 MRI 进展建模框架。

Comments 24 pages, 7 figures, 7 tables. Code available at https://github.com/JornyWan/AG-LDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21414 2026-07-10 cs.CV cs.LG 版本更新

A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding

用于临床信息丰富且可解释的医学图像理解的工具瓶颈框架

Christina Liu, Alan Q. Wang, Joy Hsu, Jiajun Wu, Ehsan Adeli

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

AI总结 针对医学图像理解中工具组合难的问题,提出工具瓶颈框架(TBF),利用工具瓶颈模型(TBM)组合VLM选择的工具,通过神经网络计算融合工具输出,在组织病理学和皮肤病学任务中表现出色,提升医学图像理解且使预测更具可解释性。

Journal ref Proceedings of the 9th International Conference on Medical Imaging with Deep Learning, Proceedings of Machine Learning Research 315 (2026) 2958-2986

详情

展开后加载摘要…

URL PDF HTML 收藏