ELLA: Generative AI-Powered Social Robots for Early Language Development at Home
ELLA:生成式AI赋能的社交机器人,用于家庭中的早期语言发展
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出ELLA,一种基于生成式AI的社交机器人,通过互动讲故事、家长选择的语言目标和支架对话支持早期语言发展,通过家庭工作坊和实地部署验证其设计有效性。
高校专区
ELLA:生成式AI赋能的社交机器人,用于家庭中的早期语言发展
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出ELLA,一种基于生成式AI的社交机器人,通过互动讲故事、家长选择的语言目标和支架对话支持早期语言发展,通过家庭工作坊和实地部署验证其设计有效性。
OpenVision 3: 一种用于理解和生成的统一视觉编码器家族
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; JHU(约翰霍普金斯大学) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达)
AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。
面向dVRK-Si患者侧操作臂的动力学建模与重力补偿
机构 * Department of Robotics Engineering, Worcester Polytechnic Institute(沃斯特理工学院机器人工程系) ; Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室) ; Department of Computer Science, Vanderbilt University(范德比尔特大学计算机科学系) ; Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)
AI总结 本文提出针对dVRK-Si患者侧操作臂的完整动力学建模与重力补偿方法,通过改进的DH模型和欧拉-拉格朗日方法推导动力学,实现实时重力补偿和计算扭矩前馈,显著提升手术机器人控制精度和轨迹跟踪性能。
Comments Submitted to IEEE Transactions on Medical Robotics and Bionics (T-MRB), under review. Open-source GitHub Repo: https://github.com/jhu-dvrk/dvrk_psm_dynamics_identification
基于嵌入的检索的理论限制
机构 * Google DeepMind(谷歌DeepMind) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文揭示了基于嵌入的检索在现实场景中的理论限制,通过理论分析和实验验证,展示了高维嵌入的必要性,并提出了一种名为LIMIT的数据集来测试模型性能,表明现有模型在简单任务上仍存在不足。
Comments Accepted to ICLR'26
序列 vs 序列:一个配对编码器和解码器的开放套件
机构 * Johns Hopkins University(约翰霍普金斯大学) ; LightOn
AI总结 本文提出SOTA开放数据Ettin模型套件,包含不同规模的编码器和解码器模型,通过统一训练方法在分类、检索和生成任务中取得最佳性能。
Comments Accepted to ICLR'26
多任务反因果学习:从居民报告中重建城市事件
机构 * Stony Brook University(石溪大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出MTAC框架,通过利用跨任务不变性,从居民报告中重建城市事件,提升重建准确性,达到34.61%的MAE减少。
消除拒绝触发:理解并缓解安全对齐中的过度拒绝问题
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Michigan State University(密歇根州立大学) ; University of Mississippi(密苏里州立大学)
AI总结 本文研究了安全对齐中过度拒绝问题的成因,提出了一种考虑拒绝触发的缓解策略,通过优化训练过程提高模型对良性查询的响应能力。
SDUM:一种可扩展的深度展开模型用于通用MRI重建
机构 * Johns Hopkins University(约翰霍普金斯大学) ; NVIDIA
AI总结 SDUM是一种结合Restormer、CSME、SWDC和UC的通用MRI重建框架,通过级联扩展训练实现可扩展性,无需微调即可在多个挑战赛道上取得最佳性能。
Comments https://github.com/NVIDIA-Medtech/NV-Raw2insights-MRI
DeepSport: 一种基于代理强化学习的多模态大语言模型,用于通过主动推理实现综合体育视频理解
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Rice University(Rice大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California, Irvine(加州大学 Irvine分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
AI总结 DeepSport通过代理强化学习实现多运动视频理解,首次端到端训练多任务模型,显著提升性能与泛化能力。
GUIDES: 利用教师蒸馏嵌入进行预训练机器人策略增强
机构 * University of California, Riverside(加州大学河滨分校) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 GUIDES通过教师蒸馏嵌入提升预训练机器人策略,实现语义增强与高效升级
Comments IEEE International Conference on Robotics and Automation (ICRA 2026)
参数最优控制问题的零样本可迁移求解方法
机构 * Oden Institute, UT Austin(UT奥斯汀奥登研究所) ; Department of Mathematics, UCLA(加州大学洛杉矶分校数学系) ; Department of Mathematical and Statistical Sciences, Clemson University(克莱姆斯大学数学与统计学系) ; Department of Civil and Systems Engineering, Johns Hopkins University(约翰霍普金斯大学土木与系统工程系)
AI总结 本文提出了一种基于函数编码器的可迁移求解方法,通过离线-在线分解实现对参数最优控制问题的高效零样本适应。
Comments 11 pages, 6 figures, 3 tables
推理是否使搜索更公平?比较推理与非推理重排序器的公平性
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Human Language Technology Center of Excellence(语言技术卓越中心)
AI总结 研究比较了推理与非推理重排序器的公平性,发现推理模型对公平性无显著影响,需进一步优化以提升公平性。
Comments 17 pages
通过对角蒸馏实现流式自回归视频生成
机构 * South China University of Technology(南方科技大学) ; Westlake University(西湖大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California, Merced(加州大学默塞德分校) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。
Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)
MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架
机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) ; Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)
AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。
Meissa:多模态医疗代理智能
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Cornell University(康奈尔大学)
AI总结 Meissa是一种轻量级多模态医疗代理智能模型,通过离线学习策略选择与执行,实现高效医疗决策。
利用扩散变换器的完整性感知实现统一的3D MRI合成
机构 * School of Engineering, University of Birmingham, UK(伯明翰大学工程学院) ; William Harvey Research Institute, Queen Mary University London, UK(女王玛丽大学伦敦威廉·哈里维研究所) ; Barts Heart Centre, St Bartholomew’s Hospital, Barts Health NHS Trust, UK(巴特勒心脏中心,圣巴塞洛缪医院,巴特勒健康 NHS信托) ; Division of Cardiology, Johns Hopkins University School of Medicine, US(约翰霍普金斯大学医学院心脏病科)
AI总结 本文提出CoPeDiT模型,通过完整性感知机制提升3D MRI合成的语义一致性与鲁棒性。
通过每像素频率分析实现事件相机中的实时无人机检测
机构 * Johns Hopkins University APL(约翰霍普金斯大学APL)
AI总结 本文提出DDHF方法,通过每像素频率分析实现事件相机中无人机的实时检测,具有高准确性和低延迟,优于YOLO检测器。
拓展视野:一种多视角优化的设备无关手术工具跟踪框架用于增强现实
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出一种多视角优化的设备无关手术工具跟踪框架,通过融合多种传感模式提升增强现实中的遮挡鲁棒性与可视化一致性。
Comments accepted by IEEE VR 2026
SurgSync: 用于手术机器人的时间同步多模态数据采集框架和数据集
机构 * Department of Robotics Engineering, Worcester Polytechnic Institute(机器人工程系,沃斯特理工学院) ; Laboratory for Computational Sensing and Robotics(计算感知与机器人实验室) ; Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) ; Robotics and Control Laboratory, the University of British Columbia(机器人与控制实验室,不列颠哥伦比亚大学) ; Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院)
AI总结 SurgSync提出了一种时间同步的多模态数据采集框架和数据集,用于手术机器人中的高阶控制与训练,通过多传感器和后处理工具提升数据质量与实用性。
Comments Accepted By International Conference on Robotics and Automation (ICRA), IEEE, 2026. More details can be found at https://surgsync.github.io/
ECLARE:高效的跨平面学习用于各向异性分辨率增强
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; Vanderbilt University Institute of Imaging Science(范德比尔特大学成像科学研究所) ; Uniformed Services University(统一服务大学) ; Johns Hopkins School of Medicine(约翰霍普金斯医学院)
AI总结 ECLARE通过自监督学习解决多切片2D MR图像的超分辨率问题,优于现有方法在信号恢复和下游任务中表现更佳。
重建!不要编码:面向高可懂性和低延迟流式神经音频编解码器的自监督表示重建损失
机构 * Center for Language and Speech Processing, Johns Hopkins University, USA(语言与语音处理中心,约翰霍普金斯大学,美国) ; Signal Analysis and Interpretation Laboratory, University of Southern California, USA(信号分析与解释实验室,南加州大学,美国)
AI总结 本文提出自监督表示重建损失,用于提升流式神经音频编解码器的可懂性和低延迟性能。
Comments Submitted to Interspeech 2026
行为分解线性动力学系统:一种用于神经活动部分受行为约束的分解线性动力学系统模型
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of North Carolina(北卡罗来纳大学) ; Janelia Research Campus(贾维亚研究campus) ; Howard Hughes Medical Institute(霍华德·霍夫曼医学研究所)
AI总结 行为分解线性动力学系统(b-dLDS)通过分解神经活动与行为的关系,有效区分行为生成网络与内部计算,提升大规模神经记录的分析能力。
NeuralRemaster: 保留相位的扩散用于结构对齐生成
机构 * Toyota Research Institute(丰田研究院) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 NeuralRemaster通过保留相位并随机化幅度,实现结构对齐的图像和视频生成,提升模拟到现实的转换性能。
追求空间推理的最小充分性
机构 * Shanghai Jiao Tong University(上海交通大学) ; Beijing Institute of Technology(北京理工大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California Merced(加州大学默塞德分校)
AI总结 本文提出 MSSR 框架,通过构建最小充分集提升视觉-语言模型的空间推理能力,实现充分性与最小性的平衡,取得最佳性能并生成可解释的推理路径。
基于神经Koopman算子的气动软机器人导管建模与控制
机构 * Laboratory for Computational Sensing and Robotics(计算感知与机器人实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Department of Mechanical Engineering(机械工程系) ; University of Maryland(马里兰大学)
AI总结 本文提出基于神经Koopman算子的框架,用于提升软机器人导管的建模与控制精度,实现高精度定位与姿态控制。
Comments 8 pages, 6 figures. Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026
InfinityStory: 无限视频生成与世界一致性及角色感知镜头过渡
机构 * Adobe Research(Adobe研究院) ; KAUST(卡塔尔科技大学) ; University of Oregon(俄勒冈大学) ; University of Memphis(密苏里大学孟菲斯分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Meta AI ; Texas A&M University(德克萨斯农工大学) ; Dolby Labs(杜比实验室) ; Virginia Tech(弗吉尼亚理工大学) ; Cisco(思科) ; University of Maryland, College Park(马里兰大学学院市分校)
AI总结 InfinityStory通过引入背景一致的生成管道和过渡感知的视频合成模块,实现了多主体场景下的长篇视频生成,提升了背景一致性、主体一致性和时间连贯性。
使用因果推理作为测试平台的RLVR泛化
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research Asia(微软亚洲研究院) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
AI总结 本文通过实验证明,RLVR在特定模型规模和训练查询层次下能提升因果推理能力,尤其在复杂查询中表现更优。
BumpNet:一种用于学习PDE解的稀疏MLP框架
机构 * Department of Electrical and Computer Engineering, Texas A\&M University, TX, USA(电气与计算机工程系,德克萨斯A&M大学) ; Department of Chemical and Biomolecular Engineering, The Johns Hopkins University, MD, USA(化学与生物分子工程系,约翰霍普金斯大学)
AI总结 BumpNet是一种基于稀疏MLP的PDE求解框架,结合物理信息神经网络、进化深度神经网络和深度算子网络,实现高效准确的PDE解算。
Crystal-GFN: 生成具有理想性质和约束条件的晶体
机构 * Mila AI4Science ; Université de Montréal(蒙特利尔大学) ; CentraleSupélec, Université Paris-Saclay(中央圣艾修伯里学院,巴黎萨克莱大学) ; Johns Hopkins University(约翰霍普金斯大学) ; UCLouvain(布鲁塞尔自由大学)
AI总结 Crystal-GFN是一种生成具有理想性质和约束条件的晶体结构模型,通过多环境连续-离散GFlowNet高效发现多样且有效的晶体。
Comments This is the version of the manuscript submitted (though not accepted) to ICML 2024 in February 2024
SportR:多模态大语言模型在体育中的推理基准
机构 * Department of Computer Science, Rice University(Rice大学计算机科学系) ; Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) ; Department of Statistics, University of California, Irvine(伊利诺伊大学欧文分校统计系) ; College of Sciences, Georgia Institute of Technology(佐治亚理工学院科学学院) ; Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) ; Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)
AI总结 SportR是一个多体育大规模基准,旨在训练和评估多模态大语言模型在体育推理中的能力,通过精细的视觉感知和规则推理任务提升模型性能。