arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-07-07 至 2026-07-07 共收录 8
2607.05276 2026-07-07 eess.AS cs.AI 新提交

ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions

ProPS:面向自然语言条件化说话人嵌入分布的提示式画像合成

Thomas Thebaud, Junhyeok Lee, Laureano Moro-Velazquez, Jesus Villalba Lopez, Najim Dehak

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

AI总结 针对现有说话人嵌入提取器仅具备描述性不具备生成性的问题,提出ProPS框架,基于自然语言提示生成符合指定属性的说话人嵌入分布,支撑可控语音生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03643 2026-07-07 eess.IV cs.CV 新提交

Model Confidence-Guided Multi-Image Fusion of Fundus Images for Diabetic Retinopathy Diagnosis

模型置信度引导的多图像融合眼底图像糖尿病视网膜病变诊断方法

Ananya Raghu, Anisha Raghu, Alice S. Tang, Yannis M. Paulus, Tyson N. Kim, Tomiko T. Oskotsky

机构 * Massachusetts Institute of Technology(麻省理工学院) Wilmer Eye Institute, Department of Ophthalmology, Johns Hopkins University(约翰霍普金斯大学威尔默眼科研究所) Department of Biomedical Engineering, Johns Hopkins University(约翰霍普金斯大学生物医学工程系) Bakar Computational Health Sciences Institute, University of California San Francisco(加州大学旧金山分校巴卡计算健康科学研究所) Department of Ophthalmology, University of California San Francisco(加州大学旧金山分校眼科系) Division of Clinical Informatics and Digital Transformation, University of California San Francisco(加州大学旧金山分校临床信息学与数字化转型 division)

AI总结 针对资源有限地区糖网病早期筛查需求,提出置信度引导的多图像融合框架,整合多眼底视图提升诊断置信度与准确率,性能优于传统图像质量级联流水线,适配低延迟移动筛查场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05365 2026-07-07 cs.CL cs.AI eess.AS 新提交

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

SPEARBench:面向流式语音转语音语言模型的自然度评估基准

Thomas Thebaud, Yuzhe Wang, Hao Zhang, Sathvik Manikantan Napa Ugandhar, Ashish Hallur, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) Amazon Inc.(亚马逊公司)

AI总结 针对现有基准无法评估流式语音转语音模型对话自然度的问题,构建多维度评估基准SPEARBench,可从多维度评测模型,发现当前模型在多类对话行为维度仍与人类存在差距。

Comments Corresponding Website: https://thomasthebaud.github.io/SPEAR-benchmark-website/#welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05207 2026-07-07 cs.CV cs.LG 新提交

Probing Geospatial SSL Representations with Environmental Signals

利用环境信号探测地理空间自监督学习表示

Rohita Mocharla, Vishal M. Patel

机构 * Johns Hopkins Applied Physics Laboratory(约翰·霍普金斯大学应用物理实验室) Johns Hopkins University(约翰·霍普金斯大学)

AI总结 针对地理空间自监督学习表示内在信息分析不足问题,用匹配的ERA5环境变量探测其对环境信号的编码能力,发现相关指标可区分下游性能相近模型,还开源了配套标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05189 2026-07-07 cs.CR cs.AI 新提交

When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents

当智能体的记忆留存却不外露:持久化个人智能体中的隐秘内存注入攻击

Yechao Zhang, Shiqian Zhao, Jiawen Zhang, Jie Zhang, Gelei Deng, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) CFAR, A*STAR(CFAR,A*STAR) Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对持久化个人智能体的隐秘内存注入威胁,构建多场景基准测试集WhisperBench,提出单次邮件投送的黑盒攻击框架MemGhost,可跨架构、跨防御实现高成功率的长期智能体入侵。

Comments 25 pages, 8 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02692 2026-07-07 cs.CV 新提交

An Automated Multimodal Glaucoma Detection Framework Using ViT and a Stacking-Based Ensemble

使用ViT和基于堆叠的集成方法的自动多模态青光眼检测框架

Ishrat Jahan, Muhammad E. H Chowdhury, Murugappan Murugappan, Kanchon Kanti Podder, Tawsifur Rahman, Shrestha Datta, Md Sakib Abrar Hossain, Md Mosarrof Hossen, Yosra Magdi Salih Mekki, Sanjiban Sekhar Roy

机构 * Department of Computer Science and Engineering, Shahjalal University of Science and Technology(肖哈尔大学科学与技术学院计算机科学与工程系) Department of Electrical Engineering, Qatar University(卡塔尔大学电气工程系) Department of Electronics and Communication Engineering, Kuwait College of Science and Technology(科威特科学与技术学院电子与通信工程系) Department of Interdisciplinary Engineering, Kennesaw State University(肯尼斯州立大学跨学科工程系) Department of Biomedical Engineering, School of Medicine, Johns Hopkins University(约翰霍普金斯大学医学院生物医学工程系) Department of Biomedical Engineering, University of Oxford(牛津大学生物医学工程系) Department of Computer Science and Engineering, Vellore Institute of Technology(维洛雷理工学院计算机科学与工程系)

AI总结 研究在样本级和患者级设置下的青光眼检测,提出整合眼底图像与临床数据的自动多模态框架,用ViT提取特征,经典机器学习模型分类,堆叠集成优化性能,实验验证其高性能并部署为网络平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01698 2026-07-07 cs.CV 新提交

Signal Structure-Aware Gaussian Splatting for Large-Scale Scene Reconstruction

面向大规模场景重建的结构感知高斯泼溅

Weiyi Xue, Fan Lu, Chi Zhang, Tianhang Wang, Sanqing Qu, Zehan Zheng, Boyuan Zheng, Junqiao Zhao, Guang Chen

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Westwell Technology Co., Ltd(上海西井科技股份有限公司) Beijing University of Technology(北京工业大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对大规模场景中稀疏观测区域导致的高斯过度密集和冗余问题,提出SIG调度器,通过信号结构恢复视角同步图像监督与高斯频率,并引入球约束高斯控制优化,显著提升效率与渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01345 2026-07-07 cs.CL cs.AI 新提交

TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue

TurnNat:双人口语对话中轮流自然性的自动评估

Hao Zhang, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学) Amazon Research(亚马逊研究院) Amazon(亚马逊)

AI总结 提出TurnNat框架,通过因果轮流预测模型估计双说话人语音活动状态,利用负对数似然度量时序异常性,实现对话级轮流自然性自动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏