arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

共收录 1184
2601.20499 2026-01-29 cs.CV

Efficient Autoregressive Video Diffusion with Dummy Head

高效的自回归视频扩散模型与Dummy头

Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang, Yawei Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Dummy Forcing方法,通过优化多头自注意力机制的内存分配和上下文管理,提升视频扩散模型的生成速度,同时保持高质量输出。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03982 2026-01-29 eess.IV cs.CV

UNISELF: A Unified Network with Instance Normalization and Self-Ensembled Lesion Fusion for Multiple Sclerosis Lesion Segmentation

UNISELF:一种结合实例归一化和自融合病变融合的统一网络用于多发性硬化病变分割

Jinwei Zhang, Lianrui Zuo, Blake E. Dewey, Samuel W. Remedios, Yihao Liu, Savannah P. Hays, Dzung L. Pham, Ellen M. Mowry, Scott D. Newsome, Peter A. Calabresi, Aaron Carass, Jerry L. Prince

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University, Baltimore, MD 21218, USA(电气与计算机工程系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, Vanderbilt University, Nashville, TN 37215, USA(电气与计算机工程系,范德比尔特大学) Department of Neurology, Johns Hopkins School of Medicine, Baltimore, MD 21287, USA(神经病学系,约翰霍普金斯医学院) Department of Computer Science, Johns Hopkins University, Baltimore, MD 21218, USA(计算机科学系,约翰霍普金斯大学) Department of Radiology, Uniformed Services University of the Health Sciences, Bethesda, MD, 20814, USA(放射学系,统一服务大学健康科学学院)

AI总结 UNISELF通过实例归一化和自融合病变融合技术,在多发性硬化病变分割中实现高精度和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16324 2026-01-29 cs.CV

From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation

从预测到完美:引入精修到自回归图像生成

Cheng Cheng, Lin Song, Di An, Yicheng Xiao, Xuchong Zhang, Hongbin Sun, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

AI总结 TensorAR通过引入张量预测机制,改进自回归图像生成的质量和性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06382 2026-01-29 eess.IV cs.CV

X-LRM: X-ray Large Reconstruction Model for Extremely Sparse-View Computed Tomography Recovery in One Second

X-LRM:用于极稀疏视图计算层析成像恢复的X射线大重建模型(1秒内)

Guofeng Zhang, Ruyi Zha, Hao He, Yixun Liang, Alan Yuille, Hongdong Li, Yuanhao Cai

机构 * Johns Hopkins University(约翰霍普金斯大学) Australian National University(澳大利亚国立大学) HKUST(香港科技大学)

AI总结 X-LRM通过X-former和X-triplane实现极稀疏视图CT重建,1.5 dB优于现有方法并提升27倍速度。

Comments 3DV 2026; A large reconstruction model and the largest dataset (16K samples) for sparse-view CT recovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19702 2026-01-28 eess.AS cs.AI

SAM Audio Judge: A Unified Multimodal Framework for Perceptual Evaluation of Audio Separation

SAM音频裁判:一种用于音频分离感知评估的统一多模态框架

Helin Wang, Bowen Shi, Andros Tjandra, John Hoffman, Yi-Chiao Wu, Apoorv Vyas, Najim Dehak, Ann Lee, Wei-Ning Hsu

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta

AI总结 SAM Audio Judge 提出了一种多模态细粒度参考自由客观指标,用于评估音频分离的感知性能,支持多种音频领域和输入类型,具有高一致性与实际应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18037 2026-01-27 eess.AS cs.AI cs.SD

SpatialEmb: Extract and Encode Spatial Information for 1-Stage Multi-channel Multi-speaker ASR on Arbitrary Microphone Arrays

SpatialEmb: 为任意麦克风阵列的单阶段多通道多说话人ASR提取和编码空间信息

Yiwen Shao, Yong Xu, Sanjeev Khudanpur, Dong Yu

机构 * Center for Language and Speech Processing, Johns Hopkins University(语言与语音处理中心,约翰霍普金斯大学) Tencent AI Lab(腾讯AI实验室)

AI总结 本文提出轻量级模块SpatialEmb,直接为ASR模型提取和编码空间信息,支持任意麦克风拓扑,提升多通道多说话人ASR性能。

Comments SLT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10571 2026-01-27 cs.CL cs.AI

On the Failure of Latent State Persistence in Large Language Models

大型语言模型中潜在状态持续性的失效

Jen-tse Huang, Kaiser Sun, Wenxuan Wang, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学)

AI总结 本文揭示大型语言模型在维持持久潜在状态方面的缺陷,通过三个实验展示其在概率分配、概念漂移和变量绑定上的失败,表明LLMs更倾向于反应性求解而非主动规划。

Comments 8 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17500 2026-01-27 cs.IR cs.CL

To Case or Not to Case: An Empirical Study in Learned Sparse Retrieval

是否使用大小写:对学习稀疏检索的实证研究

Emmanouil Georgios Lionis, Jia-Huei Ju, Angelos Nalmpantis, Casper Thuis, Sean MacAvaney, Andrew Yates

机构 * University of Glasgow, United Kingdom(格拉斯哥大学) University of Amsterdam, The Netherlands(阿姆斯特丹大学) TKH AI, The Netherlands(TKH AI) Johns Hopkins University, United States(约翰霍普金斯大学)

AI总结 本研究探讨了带大小写的骨干模型对学习稀疏检索的影响,发现通过预处理文本转为小写可消除性能差距,从而提升LSR方法的适用性。

Comments This preprint has not undergone peer review (when applicable) or any post-submission improvements or corrections. The Version of Record of this contribution is published in ECIR2026 (Part I) Advances in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10046 2026-01-27 cs.AI

SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration

SimWorld-Robotics: 为多模态机器人导航与协作合成逼真动态城市环境

Yan Zhuang, Jiawei Ren, Xiaokang Ye, Jianzhi Shen, Ruixuan Zhang, Tianai Yue, Muhammad Faayez, Xuhong He, Ziqiao Ma, Lianhui Qin, Zhiting Hu, Tianmin Shu

机构 * University of Virginia(弗吉尼亚大学) UC San Diego(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学)

AI总结 SimWorld-Robotics通过合成逼真动态城市环境,提出两个多模态机器人基准测试,评估机器人在复杂场景中的导航、协作与通信能力。

Comments Conference: NeurIPS 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08660 2026-01-27 cs.CL cs.LG

The Impact of Automatic Speech Transcription on Speaker Attribution

自动语音转录对说话人归因的影响

Cristina Aggazzotti, Matthew Wiesner, Elizabeth Allyn Smith, Nicholas Andrews

机构 * Johns Hopkins University(约翰霍普金斯大学) Université du Québec à Montréal(魁北克大学蒙特利尔分校)

AI总结 本文研究了自动语音转录对说话人归因性能的影响,发现即使在存在转录错误的情况下,归因性能仍保持良好,可能是因为ASR转录错误能揭示说话人身份特征。

Comments latest version added TACL journal DOI to metadata and a missing citation

Journal ref Transactions of the Association for Computational Linguistics (2025) 13: 1578-1596

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08710 2026-01-27 cs.CV

SceneSplat++: A Large Dataset and Comprehensive Benchmark for Language Gaussian Splatting

SceneSplat++: 一个大规模数据集和全面的基准用于语言高斯点云

Mengjiao Ma, Qi Ma, Yue Li, Jiahuan Cheng, Runyi Yang, Bin Ren, Nikola Popovic, Mingqiang Wei, Nicu Sebe, Luc Van Gool, Theo Gevers, Martin R. Oswald, Danda Pani Paudel

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ETH Zürich(苏黎世联邦理工学院) University of Amsterdam(阿姆斯特丹大学) Johns Hopkins University(约翰·霍普金斯大学) University of Pisa(比萨大学) University of Trento(特伦托大学)

AI总结 SceneSplat++提出一个大规模数据集和基准,评估语言高斯点云方法,展示可推广方法在3D理解中的优势。

Comments 15 pages, codes, data and benchmark are released at https://scenesplatpp.gaussianworld.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01078 2026-01-26 cs.AI

SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds

SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器

Jiawei Ren, Yan Zhuang, Xiaokang Ye, Lingjun Mao, Xuhong He, Jianzhi Shen, Mrinaal Dogra, Yiming Liang, Ruixuan Zhang, Tianai Yue, Yiqing Yang, Eric Liu, Ryan Wu, Kevin Benavente, Rajiv Mandya Nagaraju, Muhammad Faayez, Xiyan Zhang, Dhruv Vivek Sharma, Xianrui Zhong, Ziqiao Ma, Tianmin Shu, Zhiting Hu, Lianhui Qin

机构 * UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) JHU(约翰·霍普金斯大学) Purdue(Purdue 大学) PolyU USC(美国南加州大学) UMich(密歇根大学)

AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19058 2026-01-26 cs.RO cs.SY eess.SY

Gravity Compensation of the dVRK-Si Patient Side Manipulator based on Dynamic Model Identification

基于动态模型识别的dVRK-Si患者侧操作臂重力补偿

Haoying Zhou, Hao Yang, Anton Deguet, Loris Fichera, Jie Ying Wu, Peter Kazanzides

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute(机器人工程系,沃斯通理工大学) Laboratory for Computational Sensing and Robotics, JHU(计算感知与机器人实验室,约翰·霍普金斯大学) Department of Computer Science, Vanderbilt University(计算机科学系,范德比尔特大学) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰·霍普金斯大学)

AI总结 本文提出基于动态模型识别的dVRK-Si患者侧操作臂重力补偿方法,解决高重力偏移导致的控制精度和响应时间问题。

Journal ref The 17th Hamlyn Symposium on Medical Robotics (HSMR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23761 2026-01-23 cs.SE cs.AI cs.MA

TDFlow: Agentic Workflows for Test Driven Development

TDFlow: 为测试驱动开发设计的代理工作流

Kevin Han, Siddharth Maddikayala, Tim Knappe, Om Patel, Austen Liao, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学) UC San Diego(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 TDFlow通过测试驱动的工作流实现人类水平的测试解析,提升软件修复性能。

Comments Published in the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026 Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20513 2026-01-23 cs.CL

Self-correction is Not An Innate Capability in Language Models

语言模型中的自我纠正并非一种固有能力

Guangliang Liu, Zimo Qi, Xitong Zhang, Lu Cheng, Kristen Marie Johnson

机构 * Michigan State University(密歇根州立大学) Johns Hopkins University(约翰霍普金斯大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文研究语言模型是否具备固有道德自我纠正能力,通过行为和机制分析发现其缺乏道德敏感性和有效整合外部反馈的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15240 2026-01-22 cs.SD eess.AS

WeDefense: A Toolkit to Defend Against Fake Audio

WeDefense:一种用于对抗假音频的工具包

Lin Zhang, Johan Rohdin, Xin Wang, Junyi Peng, Tianchi Liu, You Zhang, Hieu-Thi Luong, Shuai Wang, Chengdong Liang, Anna Silnova, Nicholas Evans

机构 * Johns Hopkins University(约翰霍普金斯大学) Brno University of Technology(布拉格技术大学) National Institute of Informatics(国家信息研究所) National University of Singapore(新加坡国立大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) WeNet Opensource Community(WeNet开源社区) EURECOM

AI总结 WeDefense是一个开源工具包,旨在提供标准化的假音频检测与定位解决方案,包含灵活的输入增强、校准、分数融合和标准化评估指标等核心功能。

Comments This is an ongoing work. v1 corresponds to the version completed by June 4, 2025 and previously submitted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14705 2026-01-22 cs.NE cs.AI cs.GT cs.LG

Proximal Policy Optimization with Evolutionary Mutations

具有进化突变的近端策略优化

Casimir Czworkowski, Stephen Hornish, Alhassan S. Yasin

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出POEM,通过引入进化突变机制改进PPO,提升探索能力,在多个任务中表现优于传统PPO。

Comments 10 pages, 5 figures, 2 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14678 2026-01-22 cs.CV cs.AI cs.LG cs.NE q-bio.TO

Transfer Learning from One Cancer to Another via Deep Learning Domain Adaptation

通过深度学习领域适应从一种癌症转移到另一种癌症的迁移学习

Justin Cheung, Samuel Savine, Calvin Nguyen, Lin Lu, Alhassan S. Yasin

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本研究通过深度学习领域适应技术,将乳腺和结肠的标注数据训练的DANN应用于肺腺癌的未标注数据,显著提升分类准确率,同时验证了染色标准化对不同领域适应效果的影响。

Comments 8 pages, 6 figures, 3 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14406 2026-01-22 cs.CV eess.IV

Large-Scale Label Quality Assessment for Medical Segmentation via a Vision-Language Judge and Synthetic Data

通过视觉-语言裁判和合成数据进行大规模标签质量评估用于医学分割

Yixiong Chen, Zongwei Zhou, Wenxuan Li, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 SegAE通过视觉-语言模型和合成数据评估医学分割标签质量,提升数据效率和训练性能,减少标注成本和质检时间。

Comments ISBI 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06584 2026-01-22 cs.CV q-bio.TO

Improving Artifact Robustness for CT Deep Learning Models Without Labeled Artifact Images via Domain Adaptation

通过领域自适应改进CT深度学习模型在无标注artifact图像情况下的鲁棒性

Justin Cheung, Samuel Savine, Calvin Nguyen, Lin Lu, Alhassan S. Yasin

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本研究通过领域自适应方法提升CT深度学习模型在无标注artifact数据下的鲁棒性,实验证明该方法在环形artifact识别中准确率达77.4%。

Comments 8 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17825 2026-01-22 cs.AI

FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs

FAIRGAMER:评估基于LLM的视频游戏NPC中的社会偏见

Bingkang Shi, Jen-tse Huang, Long Luo, Tianyu Zong, Hongzhu Yi, Yuanxiang Wang, Songlin Hu, Xiaodan Zhang, Zhongjiang Yao

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Johns Hopkins University(约翰霍普金斯大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

AI总结 FAIRGAMER通过评估三种交互模式中的社会偏见,揭示了基于LLM的视频游戏NPC在决策上的偏见问题,并指出更大模型可能加剧这些偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14030 2026-01-21 cs.CV

Likelihood-Separable Diffusion Inference for Multi-Image MRI Super-Resolution

基于似然分离的扩散推理用于多图像MRI超分辨率

Samuel W. Remedios, Zhangxing Bian, Shuwen Wei, Aaron Carass, Jerry L. Prince, Blake E. Dewey

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出了一种基于扩散模型的多图像MRI超分辨率方法,通过分离似然校正实现高效推理,显著提升了各向异性退化下的超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13304 2026-01-21 cs.CV

CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning

CausalSpatial: 一个用于以对象为中心的因果空间推理的基准

Wenxin Ma, Chenlong Wang, Ruisheng Yuan, Hao Chen, Nanru Dai, S. Kevin Zhou, Yijun Yang, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 CausalSpatial提出一个基准测试,评估模型在因果空间推理中的能力,揭示当前MLLMs在3D场景中处理‘如果’问题的不足,并提出COW模型以改进基于物理现实的推理。

Comments Code is available: https://github.com/CausalSpatial/CausalSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20485 2026-01-21 eess.AS cs.LG cs.SD

Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens

通过条件预测离散令牌对语音合成的语调和可懂性进行客观评估

Ismail Rasim Ulgen, Zongyang Du, Junchen Lu, Philipp Koehn, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(语言与语音处理中心(CLSP),约翰·霍普金斯大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出TTScore,一种基于条件预测离散语音令牌的无参考评估框架,用于更准确地评估语音合成的语调和可懂性。

Comments Accepted in IEEE Open Journal of Signal Processing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12109 2026-01-21 cs.CL cs.AI

Generative Personality Simulation via Theory-Informed Structured Interview

通过理论指导的结构化访谈生成人格模拟

Pengda Wang, Huiqi Zou, Han Jiang, Hanjie Chen, Tianjun Sun, Xiaoyuan Yi, Ziang Xiao, Frederick L. Oswald

机构 * Department of Psychological Sciences & 2 Department of Computer Science, Rice University(1 心理学系 & 2 计算机科学系,莱斯大学) Department of Electrical and Computer Engineering, Northeastern University(3 电气与计算机工程系,东北大学) Department of Computer Science, Johns Hopkins University(4 计算机科学系,约翰霍普金斯大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出通过理论指导的结构化访谈提升LLM生成的人格数据异质性,结合心理测量理论改进模拟保真度,并预测人格相关行为结果。

Comments Accepted at EACL 2026; 87 Pages, 68 Tables, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12233 2026-01-21 cs.CV

DiffusionQC: Artifact Detection in Histopathology via Diffusion Model

DiffusionQC:通过扩散模型在病理学中检测伪影

Zhenzhen Wang, Zhongliang Zhou, Zhuoyu Wen, Jeong Hwan Kook, John B Wojcik, John Kang

机构 * Johns Hopkins University Dept. of Biomedical Engineering(约翰霍普金斯大学生物医学工程系) Merck & Co., Inc. Biometrics Research(默克公司生物度量研究) Merck & Co., Inc. Translational Medicine(默克公司转化医学)

AI总结 DiffusionQC通过扩散模型检测病理学图像中的伪影,无需大量标注数据,实现高效且泛化的伪影识别。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12084 2026-01-21 cs.HC cs.RO

Reframing Conversational Design in HRI: Deliberate Design with AI Scaffolds

重新定义人机交互中的对话设计:借助AI支架的有意设计

Shiye Cao, Jiwon Moon, Yifan Xu, Anqi Liu, Chien-Ming Huang

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Chicago(芝加哥大学)

AI总结 本文提出AI辅助对话引擎ACE,通过AI支架支持人机对话的有意设计,提升对话提示的清晰度和交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11898 2026-01-21 cs.CV

RemoteVAR: Autoregressive Visual Modeling for Remote Sensing Change Detection

RemoteVAR: 远程传感变化检测的自回归视觉建模

Yilmaz Korkmaz, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 RemoteVAR通过自回归模型和交叉注意力机制提升遥感变化检测的性能,实现对双时序特征的高效建模与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10360 2026-01-21 cs.CV

FaceXBench: Evaluating Multimodal LLMs on Face Understanding

FaceXBench: 评估多模态大语言模型在面部理解上的能力

Kartik Narayan, Vibashan VS, Vishal M. Patel

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学)

AI总结 FaceXBench通过5000个多模态问题评估MLLMs在面部理解上的能力,揭示了现有模型在复杂任务中的不足。

Comments Accepted in IEEE T-BIOM. Project Page: https://kartik-3004.github.io/facexbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07704 2026-01-21 eess.AS cs.AI

Super Monotonic Alignment Search

超单调对齐搜索

Junhyeok Lee, Hyeongju Kim

机构 * Center for Language and Speech Processing, Johns Hopkins University, Baltimore, MD, USA(语言与语音处理中心,约翰霍普金斯大学,巴尔的摩,马里兰州,美国) Supertone Inc.(Supertone公司)

AI总结 本文提出在GPU上通过Triton内核和PyTorch JIT脚本加速单调对齐搜索,使其在极端长度情况下速度提升72倍。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏