SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
SMART: 基于音频增强多模态大模型的镜头感知视频时刻检索
An Yu, Weiheng Lu, Jian Li, Zhenfei Zhang, Yunhang Shen, Felix X. -F. Ye, Ming-Ching Chang
机构
*
Department of Computer Science, University at Albany - SUNY(University at Albany - SUNY 计算机科学系)
;
School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)
;
Nanjing University(南京大学)
;
Xiamen University(厦门大学)
;
Department of Mathematics and Statistics, University at Albany - SUNY(University at Albany - SUNY 数学与统计学系)
专题命中
效率与部署
:large language model(abstract);language model(abstract);分类 cs.AI
RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation
RECON:基于压缩的推理用于高效检索增强生成
Zhichao Xu, Minheng Wang, Yawei Wang, Wenqian Ye, Yuntao Du, Yunpu Ma, Yijun Tian
机构
*
University of Utah(犹他大学)
;
University of Washington(华盛顿大学)
;
George Washington University(乔治·华盛顿大学)
;
University of Virginia(弗吉尼亚大学)
;
Shandong University(山东大学)
;
Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学)
;
University of Notre Dame(诺特丹大学)
CommentsPortions of this work appeared in CHI '26 Extended Abstracts ("Breaking the Curse of Knowledge: Toward Personalized Jargon Support in Online Meetings") and ACL '26 System Demonstrations ("ParseJargon: Personalized Real-time Jargon Support in Online Meetings")
Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu, Brian R. Bartoldson, Tom Goldstein, Sanae Lotfi, Micah Goldblum, Pavel Izmailov
机构
*
New York University(纽约大学)
;
Modal Labs(Modal实验室)
;
University of Maryland(马里兰大学)
;
Princeton University(普林斯顿大学)
;
Columbia University(哥伦比亚大学)
;
Harvard University(哈佛大学)
;
Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
;
FAIR at Meta(Meta FAIR实验室)
EditSR: Enhancing Neural Symbolic Regression via Edit-based Rectification
EditSR: 通过基于编辑的修正增强神经符号回归
Da Li, Xinxin Li, Xingyu Cui, Jin Xu, Juan Zhang, Junping Yin
机构
*
Northeast Normal University(东北师范大学)
;
East China Normal University(华东师范大学)
;
Shenzhen Institute of Advanced Technology(深圳先进技术研究院)
;
Graduate School of China Academy of Engineering Physics(中国工程物理研究院研究生院)
;
Beihang University(北京航空航天大学)
;
Institute of Applied Physics and Computational Mathematics(北京应用物理与计算数学研究所)
MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios
MemoVAD: 边缘计算场景下基于动态语义记忆的资源高效视频异常检测
Guo Li, Jiandian Zeng, Yang Li, Zihao Peng, Ke Chen, Tian Wang
机构
*
Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院)
;
School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)
;
Engineering Research Center of Cloud-Edge Intelligent Collaboration on Big Data, Ministry of Education, Beijing Normal University(北京师范大学大数据云边智能协同教育部工程研究中心)
MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework
MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索
Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Alibaba Cloud Computing(阿里云计算)
;
Hong Kong University of Science and Technology(香港科技大学)