STEB: Style Text Embedding Benchmark
STEB: 风格文本嵌入基准
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Utrecht University(乌得勒支大学)
AI总结 提出STEB基准,包含7种语言96个数据集,用于标准化风格嵌入评估,发现语义嵌入在风格任务中表现不佳,且无通用最优风格嵌入。
高校专区
STEB: 风格文本嵌入基准
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Utrecht University(乌得勒支大学)
AI总结 提出STEB基准,包含7种语言96个数据集,用于标准化风格嵌入评估,发现语义嵌入在风格任务中表现不佳,且无通用最优风格嵌入。
AC3S: 面向3D感知合成数据生成的自适应条件控制
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学) ; College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)
AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。
Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/
基于参考的口语对话系统韵律与节奏评估
机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) ; Amazon Inc.(亚马逊公司)
AI总结 针对语音到语音AI代理缺乏可解释的韵律与节奏评估指标,提出基于匹配参考的百分位评估协议,利用4000+小时对话数据构建参考层,有效减少误报并提高可解释性。
手术视频中稀疏功能标志点定位的密集结构先验
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 提出利用SAM 3作为结构先验,通过零样本点提示掩码和轻量级精炼框架,在无像素级标注下实现手术视频中功能标志点定位,F1达72.4%(尖端)和58.0%(锚点)。
ALM2Vec: 利用大型音频语言模型学习通用音频检索的音频嵌入
机构 * Zhejiang University(浙江大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 提出ALM2Vec框架,利用预训练大型音频语言模型学习统一嵌入空间,实现跨域、任务感知的音频检索,支持指令感知检索,在标准基准上表现优异。
Comments 7 pages, 3 figures
PerceptionRubrics:将多模态评估校准至人类感知
机构 * Johns Hopkins University(约翰霍普金斯大学) ; StepFun ; Tsinghua University(清华大学) ; Independent Researcher(独立研究者)
AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。
Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics
Match-Any-Events: 零样本跨大基线事件相机运动鲁棒特征匹配
机构 * Johns Hopkins University(约翰霍普金斯大学) ; ShanghaiTech University(上海科技大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Archimedes, Athena RC(Archimedes,Athena RC)
AI总结 本文提出首个零样本事件匹配模型,通过运动鲁棒且高效的注意力骨干网络和稀疏感知事件token选择,实现跨数据集大基线对应。实验显示比现有方法提升37.7%。
Comments Accepted to ECCV 2026
Journal ref Proceedings of the European Conference on Computer Vision (ECCV) 2026
随机对照试验与人类提升研究:前沿AI评估的方法论挑战与实践解决方案
机构 * RAND ; Johns Hopkins University(约翰霍普金斯大学) ; Cornell University(康奈尔大学) ; Harvard University(哈佛大学) ; University of Cambridge(剑桥大学) ; London School of Economics(伦敦经济学院)
AI总结 本文通过访谈16位专家,系统梳理了人类提升研究(测量AI对人类绩效影响)在随机对照试验中面临的方法论挑战,包括内部效度、外部效度和构念效度问题,并提出了相应的解决方案。
开放词汇与指代分割:利用2D检测器实现3D高斯
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 提出GaussDet方法,利用离散的2D开放词汇检测器与指代表达能力,通过视图聚合语义标签分布实现3D场景的开放词汇分割和指代分割,在零样本设置下显著提升指代分割性能。
MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试
机构 * NTU Singapore(南洋理工大学) ; The University of Hong Kong(香港大学) ; Johns Hopkins University(约翰霍普金斯大学) ; AI2(人工智能研究所) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。
Comments Project page: https://musebench.github.io
SFBench:SciFy科学可行性基准
机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室)
AI总结 提出SFBench基准数据集,用于评估系统判断科学声明可行性的能力,包含197条材料科学声明及专家标注的可行性评分与解释,具有任务复杂、声明全新、专家标注和开放式解释等特点。
超级马里奥兄弟中的强化学习:世界1-1的课程、教学法与最优关卡设计
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 通过强化学习算法验证超级马里奥兄弟世界1-1的关卡设计具有教学结构,蒙特卡洛方法表现最佳,且规范顺序学习效率最高。
Comments 13 pages, 7 figures, 5 tables
手语模型的音系感知
机构 * University of California, Berkeley(加州大学伯克利分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Microsoft Research(微软研究院)
AI总结 本研究通过最小对测试和表征对齐评估手语识别模型的音系感知能力,发现模型具有涌现音系敏感性但存在架构权衡:姿态模型对手形敏感,像素模型对位置敏感。
Comments Accepted to CogSci 2026
基于物理的分离流建模用于脑疾病进展轨迹
机构 * Department of Electrical and Computer Engineering, Data Science and AI Institute, Johns Hopkins University(电气与计算机工程系,数据科学与人工智能研究所,约翰霍普金斯大学)
AI总结 提出PDF框架,通过分离形态演变和强度演变的流匹配网络,结合PDE正则化损失,实现脑病变纵向预测,在三个数据集上取得最优性能。
Comments 23 pages, 8 figures
具有连续处理的多重稳健因果中介分析
机构 * Division of Biostatistics, Department of Population Health Sciences, University of Utah(犹他大学人口健康科学系生物统计部) ; Department of Mathematics and Statistics, Boston University(波士顿大学数学与统计系) ; Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)
AI总结 本文提出一种适用于连续处理的中介分析方法,通过核平滑技术实现多重稳健性和渐近正态性,避免强参数假设。
通过预注册下一个LLM来缓解基于LLM的p-hacking
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出一种协议,通过预注册实验和合格模型,并在预注册后发布的第一个合格LLM上运行,以缓解LLM研究中的p-hacking问题。实验表明该协议能有效阻止73.9%和72.7%的p-hack转移。
ESDD2概述:环境感知语音与声音深度伪造检测挑战赛
机构 * Duke Kunshan University(昆山杜克大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; The University of Melbourne(墨尔本大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Fortemedia Singapore(Fortemedia新加坡) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 介绍ESDD2挑战赛,评估语音和环境声音独立或联合操纵的检测系统,最佳系统Macro-F1达0.8775,模块化分解、跨域自监督编码器、数据增强和选择性集成是关键。
Comments Accepted to 2026 ICME workshop. arXiv admin note: text overlap with arXiv:2601.07303
SciFig:面向科学论文的可编辑图形自动生成
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Zhejiang University(浙江大学) ; Independant Researcher(独立研究者) ; Tsinghua University(清华大学) ; University of Central Florida(佛罗里达中央大学) ; City University of Hong Kong(香港城市大学) ; Adobe Research(Adobe研究)
AI总结 提出SciFig多智能体框架,从科学文本自动生成可编辑的高质量方法图,通过分解规划、布局、渲染和迭代优化,在435个基准上优于基线,平均10分钟生成可编辑图形。
句法信念更新作为花园路径句处理难度的驱动因素
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University College London(伦敦大学学院)
AI总结 针对词汇惊异度无法预测花园路径句处理难度的问题,提出基于广义Rényi散度的句法信念更新度量,在关键单词处衡量信念更新幅度,更好地拟合人类阅读时间数据。
MORN: 为资源理性长周期导航的元认知目标-目标调节
机构 * LCSR Lab, Johns Hopkins University(约翰霍普金斯大学LCSR实验室) ; Xi’an Jiaotong University(西安交通大学) ; JD Explore Academy, Beijing, China(京东探索研究院,北京,中国)
AI总结 本文提出MORN,一种基于双过程理论的元认知导航架构,通过引入资源理性机制,解决传统导航系统在长周期任务中因缺乏全局资源意识导致的资源浪费问题,提升了目标完成率和任务效率。
电力情侣?AI增长与可再生能源投资
机构 * Paul Merage School of Business, University of California, Irvine(加州大学厄尔布雷希特商学院) ; Carey Business School, Johns Hopkins University(约翰霍普金斯大学卡里商学院) ; Data Science and AI Institute, Johns Hopkins University(约翰霍普金斯大学数据科学与人工智能研究院)
AI总结 通过博弈模型研究AI增长与可再生能源投资的均衡,发现当市场回报超模且性能提升近似线性时,可再生能源扩张主要缓解算力约束而非替代化石能源,导致“适应陷阱”;当回报递减时,则形成“适应路径”推动脱碳。
Comments 35 pages, 3 figures, 15-page appendix
深度学习增强的机器人视网膜注射与实时视网膜运动补偿
机构 * Laboratory for Computational Sensing and Robotics(计算感知与机器人实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Wilmer Eye Institute(威尔默眼科研究所)
AI总结 本文提出了一种全自动机器人视网膜注射系统,结合术中光学相干断层扫描和深度学习运动预测,实现针头运动与视网膜位移同步,实验验证了其在视网膜微手术中的安全性和准确性。
ForceBand: 利用表面肌电信号学习有力操作
机构 * Amazon FAR(亚马逊 FAR) ; University of Maryland(马里兰大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 提出ForceBand,一种低成本腕戴式sEMG系统,通过预测手指力来增强人类演示数据,用于机器人有力操作策略学习,在多种物体上实现87%的成功率。
AI教练:利用强化学习加速人类技能发展
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出一种基于非合作动态博弈和强化学习的AI教练框架,通过自适应共享控制和因果影响模型加速人类运动技能发展,在无人机竞速用户研究中显著提升学习效果。
物理问题场景图:文本到视频生成中物理合理性的细粒度评估
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; AI2(艾伦人工智能研究所) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。
Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg
MRI2Rep:3D肝脏MRI的自回归结构化报告生成
机构 * Department of Biomedical Engineering(生物医学工程系) ; Department of Radiology & Biomedical Imaging(放射学与生物医学影像系) ; Department of Electrical Engineering(电气工程系) ; Yale University(耶鲁大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Johns Hopkins Medicine(约翰霍普金斯医学)
AI总结 提出MRI2Rep自回归框架,通过报告到标签规范化模块将自由文本转换为结构化诊断序列,实现3D肝脏MRI的端到端结构化报告生成,在真实数据集上优于基线方法。
Comments MICCAI 2026
AgentOdyssey:面向测试时持续学习智能体的开放式长程文本游戏生成
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 提出AgentOdyssey框架,通过程序化生成开放式文本游戏,评估智能体在测试时持续学习的关键能力,包括探索、知识获取、记忆和长程规划。
Comments Project page: https://agentodyssey.github.io/
退化蒸馏器
机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) ; Imperial Centre for Inference and Cosmology (ICIC), Imperial College London(伦敦帝国理工学院帝国推理与宇宙学中心) ; Astrophysics, University of Oxford(牛津大学天体物理学系) ; CNRS & Sorbonne Université, Institut d’Astrophysique de Paris (IAP)(法国国家科学研究中心与索邦大学巴黎天体物理研究所) ; Department of Physics and Astronomy, University College London(伦敦大学学院物理与天文学系) ; Department of Physics & King’s Institute for Artificial Intelligence, King’s College London(伦敦国王学院物理系与国王人工智能研究所) ; Department of Physics and Astronomy, Johns Hopkins University(约翰霍普金斯大学物理与天文学系) ; Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)
AI总结 提出退化蒸馏器方法,通过估计和展平Fisher信息矩阵,自动符号化检测并解决物理模型中的退化参数组合,降低神经后验估计所需的模拟预算。
Comments 30 pages, 10 figures. Supporting code found at https://github.com/tlmakinen/degeneracy_distillery
贝叶斯不确定性感知深度学习:应对EEG癫痫检测中的标注模糊性
机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) ; Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系)
AI总结 本文提出BUNDL算法,通过整合领域知识和贝叶斯框架,设计基于KL散度的损失函数,提升EEG癫痫检测的鲁棒性,验证了其在噪声标签下的有效性及跨机构泛化能力。
BenchX: 基于人口统计和协议偏差的癌症检测与定位AI模型基准测试
机构 * Johns Hopkins University(约翰霍普金斯大学) ; German Cancer Research Center(德国癌症研究中心) ; University Hospital Basel(巴塞尔大学医院) ; University of Zurich(苏黎世大学) ; ETH AI Center(苏黎世联邦理工学院AI中心) ; Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) ; Stanford University(斯坦福大学) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Nanyang Technological University(南洋理工大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, San Francisco(加州大学旧金山分校) ; Johns Hopkins Medicine(约翰霍普金斯医学)
AI总结 提出BenchX基准,通过85,355次CT扫描系统评估12个肿瘤检测AI模型在肿瘤大小、位置、患者亚组和成像协议上的表现,揭示模型在罕见亚组中性能不佳。