VeRVE: Versatile Retrieval for Videos via Unified Embeddings
VeRVE:通过统一嵌入实现视频的多功能检索
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Amazon(亚马逊) ; Keystone AI
AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。
高校专区
VeRVE:通过统一嵌入实现视频的多功能检索
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Amazon(亚马逊) ; Keystone AI
AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。
超越单帧:跨体积MRI的多帧空间接地推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Harvard University(哈佛大学) ; Georgetown University(乔治城大学)
AI总结 本文提出SGMRI-VQA基准,通过多帧空间接地推理提升医学VLMs性能,展示监督微调提升接地能力。
基于因子图的连续机器人形状估计:通过马格努斯展开
机构 * School of Aerospace Engineering(航空航天工程学院) ; Georgia Institute of Technology(佐治亚理工学院) ; School of Electrical and Computer Engineering(电气与计算机工程学院)
AI总结 本文提出一种结合参数方法和Cosserat杆推断的因子图方法,用于估计连续机器人的形状,通过马格努斯展开获得低维几何变量应变参数化,并在仿真中验证了其精度和效率。
COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力
机构 * PortexAI ; University of Milano-Bicocca(米兰-比科卡大学) ; University of Calgary(卡尔加里大学) ; University of Chicago(芝加哥大学) ; Inria(法国国家信息与自动化技术研究院) ; Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) ; University of Cambridge(剑桥大学) ; Independent(独立) ; McGill University(麦吉尔大学) ; Massachusetts Institute of Technology(麻省理工学院) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Queen Mary University of London(伦敦大学玛丽女王学院) ; Dot Ingredients ; National University of Singapore(新加坡国立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Edinburgh(爱丁堡大学) ; Murdoch University(墨尔本大学) ; University of Porto(波尔图大学) ; Stanford University(斯坦福大学) ; Stony Brook University(史泰津布鲁克大学)
AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。
符号密度估计:一种分解方法
机构 * Department of Mathematics, University of Waterloo, Waterloo, Canada(滑铁卢大学数学系) ; Department of Computer Science, Georgia Tech, Atlanta, USA(佐治亚理工学院计算机科学系) ; University of California, Irvine, Irvine, USA(加州大学伊文斯顿分校)
AI总结 本文提出AI-Kolmogorov框架,通过问题分解、非参数密度估计和支持估计,结合符号回归解决符号密度估计问题,并在多个数据集上验证其有效性。
向理解、分析和优化代理AI执行:一种以CPU为中心的视角
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文从CPU角度分析代理AI工作负载的瓶颈,提出两种优化方法,降低CPU-GPU资源分配偏差,提升执行效率。
ReLU神经网络激活模式的拓扑特征
机构 * Applied Math and Computational Sciences University of Pennsylvania(应用数学与计算科学大学公园大学) ; Department of Mathematics Colorado State University(数学系科罗拉多州立大学) ; Departments of Mechanical Engineering & Computational Mathematics, Sciences and Engineering (CMSE) Michigan State University(机械工程与计算数学、科学与工程系密歇根州立大学) ; Department of Mathematics University of Washington(数学系华盛顿大学) ; Georgia Tech Research Institute(佐治亚理工研究学院)
AI总结 研究ReLU神经网络激活模式的拓扑特征,分析特征空间的多面体分解,探讨Fiedler分区与决策边界的关系以及回归任务中同调与训练损失和多面体单元数的行为模式。
Journal ref Proc. 1st Conf. on Topology, Algebra, and Geometry in Data Science (TAG-DS 2025), PMLR 321:287-301, 2026
SignX:在紧凑的姿态丰富潜在空间中实现连续手语识别
机构 * Rutgers University(罗格斯大学) ; Nanyang Technological University(南洋理工大学) ; Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Wisconsin--Madison(威斯康星大学麦迪逊分校) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出SignX框架,通过统一潜在表示和ViT模型实现高效连续手语识别,显著降低计算消耗并在翻译任务中达到SOTA准确率。
Comments 33 pages, CSLR SOTA (2026). More demo at https://signerx.github.io/SignX/