arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-03-16 至 2026-03-16 共收录 3
2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12508 2026-03-16 cs.HC cs.AI

ELLA: Generative AI-Powered Social Robots for Early Language Development at Home

ELLA:生成式AI赋能的社交机器人,用于家庭中的早期语言发展

Victor Nikhil Antony, Shiye Cao, Shuning Wang, Chien-Ming Huang

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出ELLA,一种基于生成式AI的社交机器人,通过互动讲故事、家长选择的语言目标和支架对话支持早期语言发展,通过家庭工作坊和实地部署验证其设计有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15369 2026-03-16 eess.IV cs.AI

OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation

OpenVision 3: 一种用于理解和生成的统一视觉编码器家族

Letian Zhang, Sucheng Ren, Yanqing Liu, Xianhang Li, Zeyu Wang, Yuyin Zhou, Huaxiu Yao, Zeyu Zheng, Weili Nie, Guilin Liu, Zhiding Yu, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) JHU(约翰霍普金斯大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏