arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

共收录 79
2602.01391 2026-06-19 cs.CV 版本更新

Relighting as a Probe of Visual Priors via Augmented Latent Intrinsics

通过增强潜在本征属性将重光照作为视觉先验的探针

Xiaoyan Xing, Xiao Zhang, Sezer Karaoglu, Theo Gevers, Anand Bhattad

机构 * UvA-Bosch Delta Lab, University of Amsterdam, Amsterdam, Netherlands(乌得勒支大学阿姆斯特丹分校博世Delta实验室) The University of Chicago, Chicago, USA(芝加哥大学) Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学)

AI总结 提出增强潜在本征属性(ALI)方法,融合密集像素对齐视觉特征到潜在本征重光照模型,平衡语义与光度保真度,提升复杂材质重光照质量。

Comments Camera-ready version for ICML 2026. Project page: https://augmented-latent-intrinsics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21978 2026-06-19 cs.LG cs.AI 版本更新

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

超越推理增益:缓解大型推理模型中的通用能力遗忘

Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

机构 * Meta Superintelligence Labs(Meta超智能实验室) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对强化学习训练导致推理模型遗忘基础能力的问题,提出RECAP重放策略,通过动态目标重加权在线调整训练重点,在保持通用能力的同时提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10827 2026-06-18 cs.SD cs.AI 版本更新

Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation

语音感知大语言模型的说话人验证:评估与增强

Thomas Thebaud, Yuzhe Wang, Laureano Moro-Velazquez, Jesus Villalba-Lopez, Najim Dehak

机构 * Electrical and Computer Engineering Department, Johns Hopkins University, Baltimore, MD, USA(约翰霍普金斯大学电气与计算机工程系) Human Language Technology Center of Excellence, Johns Hopkins University, Baltimore, MD, USA(约翰霍普金斯大学人机语言技术中心卓越中心)

AI总结 提出模型无关的评分协议评估语音感知LLM的说话人区分能力(EER>20%),并通过注入冻结的ECAPA-TDNN说话人嵌入和LoRA微调,实现接近专用系统的性能(EER 1.03%)。

Comments 3 Tables, 1 Figure, Published in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09185 2026-06-18 cs.CV cs.AI 版本更新

Learning Patient-Specific Disease Dynamics with Latent Flow Matching for Longitudinal Imaging Generation

学习患者特异性疾病动态:基于潜在流匹配的纵向影像生成

Hao Chen, Rui Yin, Yifan Chen, Qi Chen, Chao Li

机构 * University of Cambridge(剑桥大学) Nanjing First Hospital(南京第一医院) Nanjing Medical University(南京医科大学) Johns Hopkins University(约翰霍普金斯大学) University of Dundee(邓迪大学)

AI总结 提出Δ-LFM框架,利用流匹配对齐患者潜在轨迹,通过患者特异性潜在对齐实现单调疾病进展建模,在三个纵向MRI基准上验证了可解释性和性能。

Comments ICLR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06007 2026-06-16 cs.LG 版本更新

Diffusion Models for Adaptive Sequential Data Generation

自适应序列数据生成的扩散模型

Haoyang Cao, Minshuo Chen, Yinbin Han, Renyuan Xu

机构 * Department of Applied Mathematics and Statistics, Data Science and AI Institute, and Mathematical Institute for Data Science, Johns Hopkins University(应用数学与统计学系、数据科学与人工智能研究所、数据科学数学研究所,约翰霍普金斯大学) Department of Industrial Engineering and Management Sciences, Northwestern University(工业工程与管理科学系,西北大学) Department Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)

AI总结 提出一种顺序前向后向扩散框架,通过沿序列逐步注入和去除噪声并基于历史生成条件确保自适应性,用于生成自适应时间序列数据,并引入新的分数匹配目标实现高效并行训练,在合成数据和均值-方差最优投资组合构建中验证有效性。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09163 2026-06-16 cs.AI 版本更新

FORTIS: Benchmarking Over-Privilege in Agent Skills

FORTIS:评估代理技能中的过度特权

Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究发现,当前代理技能层普遍存在过度特权问题,模型在选择和执行技能时常超出任务需求,导致性能不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15952 2026-06-16 cs.AI 版本更新

Protein Design with Agent Rosetta: A Case Study for Specialized Scientific Agents

基于Agent Rosetta的蛋白质设计:面向专业科学智能体的案例研究

Jacopo Teneggi, S. M. Bargeen A. Turzo, Tanya Marwah, Alberto Bietti, P. Douglas Renfrew, Vikram Khipple Mulligan, Siavash Golkar

机构 * Polymathic AI(多学科人工智能实验室) Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) Google DeepMind(谷歌DeepMind) Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出Agent Rosetta,将大语言模型与Rosetta软件环境结合,通过迭代优化实现用户定义的蛋白质设计目标,在规范氨基酸设计上匹配专家,在非规范残基设计上超越现有ML方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19643 2026-06-16 cs.LG cs.CE 版本更新

ANCHOR: Error-Controlled Adaptive Numerical Correction for Neural Operator Time Marching

ANCHOR: 神经算子时间推进的误差控制自适应数值校正

Rajyasri Roy, Dibyajyoti Nayak, Somdatta Goswami

机构 * Department of Civil and Systems Engineering, Johns Hopkins University(土木与系统工程系,约翰霍普金斯大学)

AI总结 提出ANCHOR框架,通过基于物理信息的残差估计器自适应耦合预训练神经算子与经典数值求解器,实现非线性时变PDE的稳定长时预测,有效控制误差累积。

Comments 32 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11252 2026-06-16 cs.CL cs.LG 版本更新

HK-LegiCoST: Leveraging Non-Verbatim Transcripts for Speech Translation

HK-LegiCoST: 利用非逐字转录进行语音翻译

Cihan Xiao, Henry Li Xinyuan, Jinyi Yang, Dongji Gao, Matthew Wiesner, Kevin Duh, Sanjeev Khudanpur

机构 * Center for Language and Speech Processing(语言与语音处理中心) Human Language Technology Center of Excellence(人类语言技术卓越中心) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出HK-LegiCoST语料库,包含600+小时粤语-英语三路平行数据,解决非逐字转录的句子级对齐挑战,在粤语语音翻译上取得竞争性基线并跨语料库验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16928 2026-06-12 cs.CL 版本更新

ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models

ChiKhaPo: 一个用于评估大型语言模型词汇理解与生成能力的大规模多语言基准

Emily Chang, Niyati Bafna

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Johns Hopkins University, Center for Language and Speech Processing(约翰霍普金斯大学语言与语音处理中心)

AI总结 针对现有基准语言覆盖不足且侧重高阶任务的问题,提出ChiKhaPo基准,包含8个子任务,覆盖2700+种语言,评估LLM的词汇理解与生成能力,发现6个SOTA模型表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01157 2026-06-11 cs.CL cs.CR cs.SD 版本更新

Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models

后门藏身何处?语音语言模型中后门传播的组件级分析

Alexandrine Fortier, Thomas Thebaud, Jesús Villalba, Najim Dehak, Patrick Cardinal, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) École de technologie supérieure(高等技术学院) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文通过后门攻击视角,对语音语言模型进行组件级分析,揭示后门在不同组件中的传播机制,发现后门持久性高度依赖目标组件,且中毒样本与良性样本在共享嵌入中不可直接分离。

Comments Interspeech 2026 (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09681 2026-06-10 cs.CV 版本更新

GenEyePose: Patient-Free, Knowledge-Based Saccadic Eye Movement Modeling for Digital Neurophysiologic Biomarker Development

GenEyePose:用于数字神经生理学生物标志物开发的无患者、基于知识的扫视眼动建模

Tianyu Lin, Jooyoung Ryu, Puvada Sreevarsha, Rahul Srinivasaragavan, Riya Satavlekar, Susan Kim, Nidhi Soley, Yujie Yan, Ishan Vatsaraj, Carl Harris, Aimon Rahman, Vishal Patel, Joseph Greenstein, Casey Taylor, Kemar E. Green

机构 * Whiting School of Engineering, Johns Hopkins University(约翰霍普金斯大学惠廷工程学院) Department of Neurology, Johns Hopkins Medicine(约翰霍普金斯医学院神经内科)

AI总结 提出首个全合成、无患者的多模态眼动生成流水线,用于泛化扫视分析;基于合成数据训练的深度学习分类器在真实临床数据上区分正常与异常扫视精度,AUROC达0.76。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08977 2026-06-09 eess.AS cs.SD 版本更新

Universal Speech Content Factorization

通用语音内容分解

Henry Li Xinyuan, Zexin Cai, Lin Zhang, Leibny Paola García-Perera, Berrak Sisman, Sanjeev Khudanpur, Nicholas Andrews, Matthew Wiesner

机构 * Center for Language and Speech Processing, Johns Hopkins University, USA(约翰霍普金斯大学语言与语音处理中心) Human Language Technology Center of Excellence (COE), Johns Hopkins University, USA(约翰霍普金斯大学人类语言技术卓越中心(COE))

AI总结 本文提出USCF方法,通过线性可逆方法提取低秩语音表示,抑制说话人音色同时保留语音内容。该方法扩展了语音内容分解,通过最小二乘优化学习通用语音到内容映射,并从少量目标语音中推导出说话人特定转换。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22919 2026-06-09 cs.CV 版本更新

Chain of Flow: ECG-Conditioned 4D Cardiac Cine Generation from Patient-Specific Anatomical Anchor

流动链:基于患者特定解剖锚点的ECG条件4D心脏电影生成

Haofan Wu, Nay Aung, Theodoros N. Arvanitis, Joao A. C. Lima, Steffen E. Petersen, Le Zhang

机构 * School of Engineering, College of Engineering and Physical Sciences, University of Birmingham(英国伯明翰大学工程学院) William Harvey Research Institute, NIHR Barts Biomedical Research Centre, Queen Mary University London(伦敦Queen Mary大学威廉·哈里维研究所) Barts Heart Centre, St Bartholomew’s Hospital, Barts Health NHS Trust(巴特勒医院心脏中心,圣巴塞洛缪医院,巴特勒健康 NHS信托) Division of Cardiology, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院心脏病科)

AI总结 提出Chain of Flow (COF)框架,利用患者特定MRI和当前ECG生成4D心脏电影,在UK Biobank上实现高图像保真度和下游功能性能。

Comments 10 pages, 8 figures. Submitted to IEEE Transactions on Medical Imaging (TMI). Code will be released after review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22736 2026-06-09 cs.LG cs.AI 版本更新

UA-DCM: Uncertainty-aware Causal Decision Making via Effect Bound Decomposition

UA-DCM: 基于效应界分解的不确定性感知因果决策

Md Musfiqur Rahman, Ziwei Jiang, Hilaf Hasson, Murat Kocaoglu

机构 * Electrical and Computer Engineering, Purdue University(帕克大学电气与计算机工程系) Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Cohesity

AI总结 提出一种新框架,通过分解因果效应值的可消除与不可消除部分,区分收集更多样本能否帮助识别最优行动,并利用神经因果模型近似实现该分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08238 2026-06-09 cs.SD eess.AS 版本更新

CodecFake+: Codec-Based Resynthesized Data as a Proxy for Detecting CodecFake Speech

CodecFake+: 基于编解码器的重合成数据作为检测CodecFake语音的代理

Xuanjun Chen, Jiawei Du, Haibin Wu, Lin Zhang, I-Ming Lin, I-Hsiang Chiu, Wenze Ren, Yuan Tseng, Yu Tsao, Jyh-Shing Roger Jang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国家交通大学通信工程研究院) Department of Computer Science and Information Engineering, National Taiwan University(国家交通大学计算机科学与信息工程系) Center for Language and Speech Processing at Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心) Department of Electrical Engineering, National Taiwan University(国家交通大学电子工程系) Research Center for Information Technology Innovation, Academia Sinica(学术院信息技术创新研究中心) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国家交通大学人工智能研究中心)

AI总结 针对新兴的CodecFake深度伪造语音检测挑战,提出大规模数据集CodecFake+,包含31种开源编解码器重合成训练数据和17种先进CoSG模型网络数据,并建立编解码器分类体系,验证了重合成语音作为训练数据的有效性。

Comments Accepted by TASLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06600 2026-06-08 cs.CL 版本更新

Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation

探究多模态大语言模型在中国短视频虚假信息中的认知偏差

Jen-tse Huang, Chang Chen, Shiyang Lai, Wenxuan Wang, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) Renmin University of China(中国人民大学)

AI总结 本文通过200个短视频数据集评估8种多模态大语言模型在健康领域虚假信息中的表现,发现Gemini-2.5-Pro表现最佳(信念分数71.5/100),而模型易受权威频道ID等社会线索影响。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15344 2026-06-08 cs.LG math.DS 版本更新

Conformal Disentanglement and Latent-Space Curation: A Neural Framework for Perspective Synthesis, Differentiation and Targeted Generation

共形解缠与潜在空间策展:面向视角合成、区分和定向生成的神经框架

George A. Kevrekidis, Eleni D. Koronaki, Dimitris G. Giovanis, Yannis G. Kevrekidis

机构 * Department of Applied Mathematics and Statistics, Johns Hopkins University(应用数学与统计学系,约翰霍普金斯大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) Faculty of Science, Technology and Medicine, University of Luxembourg(科学、技术与医学学院,卢森堡大学) Department of Civil and Systems Engineering, Johns Hopkins University(土木与系统工程系,约翰霍普金斯大学) Department of Chemical and Biomolecular Engineering, Johns Hopkins University(化学与生物分子工程系,约翰霍普金斯大学)

AI总结 提出一种神经自编码器框架,通过结构约束和正交正则化从多传感器数据中分离共享与传感器特定潜在变量,并利用解缠潜在子空间实现定向生成和跨传感器推断。

详情

展开后加载摘要…

URL PDF HTML 收藏