arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-07-01 至 2026-07-01 共收录 9
2606.32040 2026-07-01 cs.CV 新提交

FaceMoE: Mixture of Experts for Low-Resolution Face Recognition

FaceMoE:用于低分辨率人脸识别的专家混合模型

Kartik Narayan, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对低分辨率人脸识别中特征提取困难和域差距问题,提出FaceMoE,采用专家混合Transformer架构,通过多个FFN专家和top-k路由器实现分辨率感知特征提取,在十一个数据集上超越现有方法。

Comments ECCV 2026, Project Page: https://kartik-3004.github.io/FaceMoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32020 2026-07-01 cs.CV 新提交

Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers

跨空间蒸馏:用现代扩散教师训练一步学生模型

Anh Nguyen, Ngan Nguyen, Duc Vu, Trung Dao, Viet Nguyen, Quan Dao, Kien Nguyen, Chi Tran, Phong Nguyen, Khoi Nguyen, Cuong Pham, Dimitris Metaxas, Vishal M. Patel, Anh Tran

机构 * Qualcomm AI Research(高通AI研究院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Rutgers University(罗格斯大学)

AI总结 提出跨空间蒸馏框架,通过轻量级潜在接口Bridge解决教师与学生模型潜在空间不匹配问题,实现异构教师蒸馏到紧凑学生模型,显著提升性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31813 2026-07-01 cs.LG cs.AI 新提交

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR

保持几何的正交初始化用于RLVR中的低秩适应

Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta Superintelligence Labs(Meta超级智能实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对RLVR中LoRA初始化问题,提出保持几何的正交初始化方法(RLPO和RLMO),理论证明其最小化与全微调差距,实验表明稳定训练且优于标准LoRA。

Comments 30 pages, accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31741 2026-07-01 cs.CL cs.AI cs.LG 新提交

STEB: Style Text Embedding Benchmark

STEB: 风格文本嵌入基准

Rafael Rivera Soto, Anna Wegmann, Cristina Aggazzotti

机构 * Johns Hopkins University(约翰霍普金斯大学) Utrecht University(乌得勒支大学)

AI总结 提出STEB基准,包含7种语言96个数据集,用于标准化风格嵌入评估,发现语义嵌入在风格任务中表现不佳,且无通用最优风格嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31055 2026-07-01 cs.CL cs.SD eess.AS 新提交

Reference-Based Prosody and Rhythm Evaluation for Spoken Dialogue Systems

基于参考的口语对话系统韵律与节奏评估

Ashish Hallur, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) Amazon Inc.(亚马逊公司)

AI总结 针对语音到语音AI代理缺乏可解释的韵律与节奏评估指标,提出基于匹配参考的百分位评估协议,利用4000+小时对话数据构建参考层,有效减少误报并提高可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31007 2026-07-01 cs.CV 新提交

Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos

手术视频中稀疏功能标志点定位的密集结构先验

Chenyan Jing, Hao Ding, Lalithkumar Seenivasan, Jacob M. Delgado López, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出利用SAM 3作为结构先验,通过零样本点提示掩码和轻量级精炼框架,在无像素级标注下实现手术视频中功能标志点定位,F1达72.4%(尖端)和58.0%(锚点)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30682 2026-07-01 cs.SD cs.AI eess.AS 新提交

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

ALM2Vec: 利用大型音频语言模型学习通用音频检索的音频嵌入

Fengjie Lu, Chenang Jiang, Jiarui Hai, Helin Wang, Aaron Yee

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出ALM2Vec框架,利用预训练大型音频语言模型学习统一嵌入空间,实现跨域、任务感知的音频检索,支持指令感知检索,在标准基准上表现优异。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28322 2026-07-01 cs.CV 新提交

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

PerceptionRubrics:将多模态评估校准至人类感知

Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) StepFun Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。

Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics

详情

展开后加载摘要…

URL PDF HTML 收藏