arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

共收录 1184
2503.10475 2026-03-24 cs.RO cs.SY eess.SY

Stratified Topological Autonomy for Long-Range Coordination (STALC)

分层拓扑自主性用于长距离协调(STALC)

Cora A. Duggan, Adam Goertz, Adam Polevoy, Mark Gonzales, Kevin C. Wolfe, Bradley Woosley, John G. Rogers, Joseph Moore

机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室) Johns Hopkins University(约翰霍普金斯大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

AI总结 本文提出STALC,一种用于现实环境中多机器人协调的分层规划方法,结合拓扑图与混合整数规划生成高效耦合计划,通过仿真和硬件实验验证其在复杂多机器人规划中的有效性。

Comments ©2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20170 2026-03-23 cs.AI

Learning Dynamic Belief Graphs for Theory-of-mind Reasoning

学习动态信念图以进行心灵理论推理

Ruxiao Chen, Xilei Zhao, Thomas J. Cova, Frank A. Drews, Susu Xu

机构 * Department of Civil Systems Engineering, Johns Hopkins University, Baltimore, MD, USA School of the Environment, Society \& Sustainability, University of Utah, Salt Lake City, UT, USA Department of Psychology, University of Utah, Salt Lake City, UT, USA Coastal Engineering, University of Florida, Gainesville, FL, USA

AI总结 本文提出一种动态信念图模型,用于增强大语言模型的心灵理论推理能力,通过联合推断潜在信念、学习时间变化依赖关系,并链接信念演变与信息获取和决策,提升高不确定性环境下的行动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20045 2026-03-23 eess.IV cs.CV

Investigating a Policy-Based Formulation for Endoscopic Camera Pose Recovery

探讨基于政策的内窥镜摄像头姿态恢复方法

Jan Emily Mangulabnan, Akshat Chauhan, Laura Fleig, Lalithkumar Seenivasan, Roger D. Soberanis-Mukul, S. Swaroop Vedula, Russell H. Taylor, Masaru Ishii, Gregory D. Hager, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

AI总结 本文提出基于政策的内窥镜摄像头姿态恢复方法,通过学习运动策略预测短周期相对运动,解决传统几何方法在低纹理和快速光照变化下的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20034 2026-03-23 cs.IR cs.AI

CoverageBench: Evaluating Information Coverage across Tasks and Domains

CoverageBench:跨任务和领域的信息覆盖评估

Saron Samuel, Andrew Yates, Dawn Lawrie, Ian Soboroff, Trevor Adriaanse, Benjamin Van Durme, Eugene Yang

机构 * Johns Hopkins University(约翰霍普金斯大学) National Institute of Standards and Technology(国家标准与技术研究院)

AI总结 本文提出CoverageBench,通过现有数据集构建多任务多领域的统一测试平台,评估信息覆盖能力,释放话题、 nuggets、相关性标签及基线排名至Hugging Face Datasets。

Comments 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20703 2026-03-23 cs.GR cs.CV

Generative Blocks World: Moving Things Around in Pictures

生成块世界:在图像中移动物体

Vaibhav Vavilala, Seemandhar Jain, Rahul Vasanth, D. A. Forsyth, Anand Bhattad

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出生成块世界方法,通过操控简单几何抽象交互生成图像场景,利用不同数量的凸3D基元表示场景,结合流式生成方法生成图像,改进纹理提示提升视觉质量和可编辑性。

Comments ICLR 2026 34 pages, 25 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19302 2026-03-23 cs.LG cs.AI

Parameter-Efficient Token Embedding Editing for Clinical Class-Level Unlearning

参数高效令牌嵌入编辑用于临床类级反学习

Iyad Ait Hou, Shrenik Borad, Harsh Sharma, Pooja Srinivasan, Rebecca Hwa, Aya Zirikly

机构 * Department of Computer Science, The George Washington University(乔治华盛顿大学计算机科学系) Center for Speech and Language Processing, Johns Hopkins University(约翰霍普金斯大学语音与语言处理中心)

AI总结 本文提出STEU方法,通过稀疏嵌入编辑实现高效类级反学习,在不修改深层编码器的情况下,有效抑制目标类并保持任务性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13219 2026-03-23 cs.CV

Prompt-based Adaptation in Large-scale Vision Models: A Survey

基于提示的大规模视觉模型适应:综述

Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

机构 * University of Alabama at Birmingham, USA(美国阿拉巴马大学伯明翰分校) Tulane University, USA(美国路易斯安那大学) Northeastern University, USA(美国东北大学) University of Missouri-Kansas City, USA(美国密苏里大学堪萨斯城分校) Johns Hopkins University, USA(约翰霍普金斯大学) Ohio State University, USA(俄亥俄州立大学) Carnegie Mellon University, USA(卡内基梅隆大学) Oak Ridge National Laboratory, USA(橡树岭国家实验室) Harvard University, USA(哈佛大学) Mohamed bin Zayed University of Artificial Intelligence, UAE(阿联酋Mohamed bin Zayed人工智能大学) Meta AI, USA(Meta AI)

AI总结 本文综述了基于提示的视觉模型适应方法,探讨了VP和VPT的核心机制及在不同领域的应用,揭示了其在测试时适应和可信AI中的作用,并总结了当前基准和未来研究方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19134 2026-03-20 cs.RO cs.HC

Introducing M: A Modular, Modifiable Social Robot

引入M:一个模块化、可修改的社会机器人

Victor Nikhil Antony, Zhili Gong, Yoonjae Kim, Chien-Ming Huang

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Mechanical Engineering, Rice University(里士满大学机械工程系)

AI总结 M平台通过模块化设计和开源特性,降低社会机器人研究的摩擦,提供可重复、可修改的机器人解决方案,支持快速仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17769 2026-03-20 cs.SD cs.CL cs.LG eess.AS

Modeling Overlapped Speech with Shuffles

用洗牌操作建模重叠语音

Matthew Wiesner, Samuele Cornell, Alexander Polok, Lucas Ondel Yang, Lukáš Burget, Sanjeev Khudanpur

机构 * Johns Hopkins University(约翰霍普金斯大学) LISN, CNRS(LISN-CNRS) Carnegie Mellon University(卡内基梅隆大学) Brno University of Technology(布拉格技术大学)

AI总结 本文提出用洗牌操作建模重叠语音,通过洗牌积和偏序有限状态自动机实现对重叠语音的对齐和说话人标注。采用总分值作为损失函数进行训练,并通过偏序FSAs减少图规模。通过直接建模(token, speaker)元组实现说话人标注,Viterbi对齐通过洗牌积FSA实现单次对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24149 2026-03-20 cs.LG q-bio.GN

What You Read is What You Classify: Highlighting Attributions to Text and Text-Like Inputs

你读的是你分类的:突出对文本和文本样输入的归因

Daniel S. Berman, Brian Merritt, Stanley Ta, Dana Udwin, Amanda Ernlund, Jeremy Ratcliff, Vijay Narayan

机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室) Google DeepMind(谷歌DeepMind)

AI总结 本文提出一种针对基于token分类器的可解释AI方法,通过mask机制生成可读解释,适用于文本等离散输入。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00671 2026-03-20 cs.IR cs.CL

Milco: Learned Sparse Retrieval Across Languages via a Multilingual Connector

Milco:通过多语言连接器实现跨语言学习稀疏检索

Thong Nguyen, Yibin Lei, Jia-Huei Ju, Eugene Yang, Andrew Yates

机构 * University of Amsterdam(阿姆斯特丹大学) Johns Hopkins University, HLTCOE(约翰霍普金斯大学,语言学与认知科学系)

AI总结 Milco通过多语言连接器将不同语言的查询和文档映射到共享的英语词汇空间,采用两阶段训练策略提升表示透明性和有效性,实现跨语言稀疏检索的最优性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09749 2026-03-20 cs.CL cs.IR

Enhancing Lexicon-Based Text Embeddings with Large Language Models

通过大语言模型增强基于词典的文本嵌入

Yibin Lei, Tao Shen, Yu Cao, Andrew Yates

机构 * University of Amsterdam(阿姆斯特丹大学) University of Technology Sydney(技术悉尼大学) Tencent IEG(腾讯IEG) Johns Hopkins University, HLTCOE(约翰霍普金斯大学,HLTCOE)

AI总结 本文提出基于词典的嵌入方法LENS,利用大语言模型处理词冗余问题,通过词嵌入聚类和双向注意力机制,在MTEB基准测试中优于密集嵌入,且支持高效维度剪枝。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18225 2026-03-20 stat.ML cs.LG

A Hybrid Conditional Diffusion-DeepONet Framework for High-Fidelity Stress Prediction in Hyperelastic Materials

一种混合的条件扩散-DeepONet框架用于超弹性材料高保真应力预测

Purna Vindhya Kota, Meer Mehran Rashid, Somdatta Goswami, Lori Graham-Brady

机构 * Department of Civil and Systems Engineering, Johns Hopkins University(土木与系统工程系,约翰霍普金斯大学)

AI总结 本文提出混合框架cDDPM-DeepONet,通过分离应力形态与幅度,结合条件扩散模型生成应力场和DeepONet预测全局参数,提升超弹性材料应力预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16952 2026-03-20 cs.RO cs.AI

Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies

边缘端具身基础模型:部署约束及缓解策略综述

Utkarsh Grover, Ravi Ranjan, Mingyang Mao, Trung Tien Dong, Satvik Praveen, Zhenqi Wu, J. Morris Chang, Tinoosh Mohsenin, Yi Sheng, Agoritsa Polyzou, Eiman Kanjo, Xiaomin Lin

机构 * University of South Florida(佛罗里达州立大学) Florida International University(佛罗里达国际大学) Johns Hopkins University(约翰霍普金斯大学) Nottingham Trent University(诺丁汉特伦特大学) Imperial College London(伦敦帝国理工学院)

AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01643 2026-03-20 cs.LG

Support Basis: Fast Attention Beyond Bounded Entries

支持基:超越有限条目的快速注意力

Maryam Aliakbarpour, Vladimir Braverman, Junze Yin, Haochen Zhang

机构 * Rice University(里士满大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出支持基分解技术,无需有限条目假设实现高效注意力推理与训练,理论证明其亚二次运行时间并验证其计算效率与任务性能。

Comments AISTATS 2026 (Spotlight). Our code can be found at: https://github.com/yinj66/support_basis

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19569 2026-03-20 cs.CV

Improved Convex Decomposition with Ensembling and Negative Primitives

改进的凸分解与集成及负原语

Vaibhav Vavilala, Florian Kluger, Seemandhar Jain, Bodo Rosenhahn, Anand Bhattad, David Forsyth

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Leibniz Universität Hannover(汉诺威莱本大学) University of California, San Diego(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出一种结合负原语和集成的方法,提升凸分解的精度与鲁棒性,在NYUv2数据集上验证了其在深度表示和分割上的显著改进。

Comments 3DV 2026 25 pages, 15 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15967 2026-03-19 cs.CV

A Comprehensive Benchmark of Histopathology Foundation Models for Kidney Digital Pathology Images

一种针对肾数字病理图像的病理基础模型综合基准测试

Harishwar Reddy Kasireddy, Patricio S. La Rosa, Akshita Gupta, Anindya S. Paul, Jamie L. Fermin, William L. Clapp, Meryl A. Waldman, Tarek M. El-Ashkar, Sanjay Jain, Luis Rodrigues, Kuang Yu Jen, Avi Z. Rosenberg, Michael T. Eadon, Jeffrey B. Hodgin, Pinaki Sarder

机构 * Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系) Seed Production Innovation, Crop Science Division, Bayer Company(拜耳公司种子生产创新部) Division of Medicine – Quantitative Health, University of Florida(佛罗里达大学医学部-定量健康分部) Department of Health Outcomes and Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Pathology, Immunology and Laboratory Medicine, University of Florida College of Medicine(佛罗里达大学医学院病理学、免疫学与实验室医学系) Kidney Disease Branch, National Institute of Diabetes and Digestive and Kidney Diseases, National Institutes of Health(美国国立卫生研究院糖尿病、消化系统与肾病研究所肾病分支) Indiana University School of Medicine(印第安纳大学医学院) Departments of Medicine, Washington University School of Medicine(华盛顿大学医学院医学部) Universidade de Coimbra(科英布拉大学) Department of Pathology and Laboratory Medicine, University of California at Davis School of Medicine(加州大学戴维斯分校医学院病理学与实验室医学系) Department of Pathology, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院病理学系)

AI总结 本文评估了11种公开的病理基础模型在11个肾脏特定下游任务中的表现,揭示了其在肾病诊断中的适用性及改进方向。

Comments 31 Pages, 14 Tables, 12 figures, Co-correspondence to jhodgin@med.umich.edu and pinaki.sarder@ufl.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22621 2026-03-19 cs.LG cs.AI cs.CL

IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning

IA2: 通过ICL激活实现对监督微调的改进

Aayush Mishra, Daniel Khashabi, Anqi Liu

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

AI总结 本文提出IA2方法,通过利用ICL的激活模式提升监督微调的准确性和校准性,在12个基准和两个模型家族中验证了其有效性。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08460 2026-03-19 cs.LG cs.AI cs.RO

MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning

MOBODY:基于模型的非动态离线强化学习

Yihong Guo, Yu Yang, Pan Xu, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学) Duke University(杜克大学)

AI总结 MOBODY通过学习目标动态过渡探索目标领域,优化策略以避免仅依赖低动态位移过渡,提升在显著动态位移或最优轨迹不在低位移区域的场景中的性能。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17617 2026-03-19 cs.SI cs.CL

Temporal Narrative Monitoring in Dynamic Information Environments

动态信息环境中的时间叙事监控

David Farr, Stephen Prochaska, Jack Moody, Lynnette Hui Xian Ng, Iain Cruickshank, Kate Starbird, Jevin West

机构 * School of Information Science(信息科学学院) University of Washington(华盛顿大学) Whiting School of Engineering(工程学院) Johns Hopkins University(约翰霍普金斯大学) School of Computer Science(计算机科学学院) Carnegie Mellon University(卡内基梅隆大学) Human Centered Design Engineering(以人为核心的设计工程)

AI总结 本文提出了一种系统框架,用于建模动态信息环境中随时间演变的语义结构,通过整合语义嵌入、密度聚类和滚动时间链接,实现对危机事件中叙事的持续适应性表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17231 2026-03-19 cs.CL eess.AS

Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models

语音生成大音频-语言模型中的神经层面情感控制

Xiutian Zhao, Ismail Rasim Ulgen, Philipp Koehn, Björn Schuller, Berrak Sisman

机构 * 1 Center for Language Speech Processing (CLSP), Johns Hopkins University, USA 2 Group on Language, Audio \& Music (GLAM), Imperial College London, UK

AI总结 本文首次在语音生成大音频-语言模型中研究神经层面的情感控制,通过识别紧凑的情感敏感神经元(ESNs)实现无需训练的情感引导,实验表明其在不同模型上均能提升情感表现并支持自动与人工评估。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11298 2026-03-19 cs.CV

InstantHDR: Single-forward Gaussian Splatting for High Dynamic Range 3D Reconstruction

InstantHDR:单次前向高斯散射用于高动态范围3D重建

Dingqiang Ye, Jiacong Xu, Jianglu Ping, Yuxiang Guo, Chao Fan, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Shenzhen University(深圳大学)

AI总结 本文提出InstantHDR,通过单次前向传递从未校准的多曝光LDR图像集重建HDR场景,采用几何引导的外观建模和元网络实现通用的场景特定色调映射,提升重建速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12797 2026-03-19 cs.LG cs.AI q-bio.GN

Genomic Next-Token Predictors are In-Context Learners

基因组下一个标记预测器是上下文学习者

Nathan Breslow, Aayush Mishra, Mahler Revsine, Michael C. Schatz, Anqi Liu, Daniel Khashabi

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

AI总结 研究探讨基因组序列中是否能像语言模型一样通过大规模预测训练自发产生上下文学习能力,发现基因组模型在模式归纳中表现出对数线性增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16041 2026-03-18 stat.ME cs.LG

Power Analysis for Prediction-Powered Inference

预测驱动推断的功率分析

Yiqun T. Chen, Moran Guo, Shengy Li

机构 * Department of Biostatistics, Johns Hopkins University(约翰霍普金斯大学生物统计学系) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

AI总结 本文提出基于预测驱动推断的统计功效计算方法,通过推导闭式公式来确定所需标注样本数量,适用于两样本比较和2x2表格的风险测量等常见场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05469 2026-03-18 cs.AI cs.CV cs.CY cs.HC

From Image Generation to Infrastructure Design: a Multi-agent Pipeline for Street Design Generation

从图像生成到基础设施设计:一种多智能体管道用于街道设计生成

Chenguang Wang, Xiang Yan, Yilong Dai, Ziyi Wang, Susu Xu

机构 * Johns Hopkins University(约翰霍普金斯大学) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) University of Maryland(马里兰大学)

AI总结 本文提出一种多智能体系统,直接在真实街道视图上编辑和重新设计自行车设施,整合车道定位、提示优化、设计生成和自动评估,生成符合情境的街道设计。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05190 2026-03-18 cs.LG

Physics-Informed Time-Integrated DeepONet: Temporal Tangent Space Operator Learning for High-Accuracy Inference

具有物理信息的时间积分深度运算网络:用于高精度推断的时序切线空间运算符学习

Luis Mandl, Dibyajyoti Nayak, Tim Ricken, Somdatta Goswami

机构 * Institute of Structural Mechanics and Dynamics in Aerospace Engineering, University of Stuttgart(航空航天工程力学与动力学研究所,斯图加特大学) Experimental Hepatobiliary Surgery Group, Department of Hepatobiliary Surgery and Visceral Transplantation, University of Leipzig Medical Center(肝胆外科与 visceral 移植部门实验肝胆外科小组,莱比锡大学医学中心) Department of Civil and Systems Engineering, Johns Hopkins University(土木与系统工程系,约翰霍普金斯大学)

AI总结 本文提出PITI-DeepONet,通过物理信息或混合物理-数据驱动目标训练,解决传统方法在长时间预测中的准确性问题,通过学习时间导数运算符提升复杂时变PDE的长期推断可靠性。

Comments 22 pages, 21 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19553 2026-03-18 math.ST cs.LG math.PR stat.ML stat.TH

Convergence Bounds for Sequential Monte Carlo on Multimodal Distributions using Soft Decomposition

基于软分解的多模分布序贯蒙特卡洛算法收敛性界

Holden Lee, Matheau Santana-Gijzen

机构 * Department of Applied Mathematics \& Statistics, Johns Hopkins University e1,e2

AI总结 本文研究了序贯蒙特卡洛算法在多模分布上的收敛性界,通过软分解方法,利用局部马尔可夫链混合动态而非全局混合动态,提出新的收敛性界分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15771 2026-03-18 cs.RO cs.AI

CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving

CorrectionPlanner:基于强化学习的自主驾驶自纠正规划器

Yihong Guo, Dongqiangzi Ye, Sijia Chen, Anqi Liu, Xianming Liu

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA.(约翰霍普金斯大学计算机科学系)

AI总结 本文提出CorrectionPlanner,通过自纠正机制在规划过程中生成安全动作,减少碰撞率,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10492 2026-03-17 eess.IV cs.CV physics.med-ph physics.optics

Multi-contrast laser endoscopy for in vivo gastrointestinal imaging

多对比激光内窥镜用于体内消化道成像

Taylor L. Bobrow, Mayank Golhar, Suchapa Arayakarnkul, Anthony A. Song, Saowanee Ngamruengphong, Nicholas J. Durr

机构 * Department of Biomedical Engineering(生物医学工程系) Johns Hopkins University(约翰霍普金斯大学) Division of Gastroenterology and Hepatology(消化内科与肝病科) Johns Hopkins Hospital(约翰霍普金斯医院)

AI总结 本文提出多对比激光内窥镜,通过多光谱散射反照率、激光散斑对比成像和光度立体成像提升消化道组织对比度和颜色差异,实现体内消化道成像的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏