Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
Omni-MMSI:迈向基于身份的社会互动理解
Xinpeng Li, Bolin Lai, Hardy Chen, Shijian Deng, Cihang Xie, Yuyin Zhou, James Matthew Rehg, Yapeng Tian
机构
*
University of Texas at Dallas(德克萨斯大学达拉斯分校)
;
Georgia Institute of Technology(佐治亚理工学院)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
RANGER: A Monocular Zero-Shot Semantic Navigation Framework through Visual Contextual Adaptation
RANGER:通过视觉上下文适应的单目零样本语义导航框架
Ming-Ming Yu, Yi Chen, Börje F. Karlsson, Wenjun Wu
机构
*
Beihang University(北京航空航天大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中
视频多模态
:multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
Seeing Beyond the Image: ECG and Anatomical Knowledge-Guided Myocardial Scar Segmentation from Late Gadolinium-Enhanced Images
超越图像:结合心电图与解剖知识的晚期钆增强图像心肌瘢痕分割
Farheen Ramzan, Yusuf Kiberu, Nikesh Jathanna, Meryem Jabrane, Vicente Grau, Shahnaz Jamil-Copley, Richard H. Clayton, Chen, Chen
机构
*
School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)
;
Department of Cardiology, Trent Cardiac Centre, Nottingham City Hospital, Nottingham University Hospitals NHS Trust(诺丁汉大学医院NHS信托基金诺丁汉市医院特伦特心脏中心心脏病科)
;
School of Medicine, University of Nottingham(诺丁汉大学医学院)
;
Department of Engineering Science, University of Oxford(牛津大学工程科学系)
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
TTA-Vid: 视频推理的通用测试时间适应
Soumya Shamarao Jahagirdar, Edson Araujo, Anna Kukleva, M. Jehanzeb Mirza, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Rogerio Feris, James R. Glass, Hilde Kuehne
机构
*
University of Tübingen(蒂宾根大学)
;
MIT(麻省理工学院)
;
IBM Research(IBM研究院)
;
MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
;
Tuebingen AI Center(蒂宾根人工智能中心)
;
Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)
EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval
EagleNet:面向文本-视频检索的能耗感知细粒度关系学习网络
Yuhan Chen, Pengwen Dai, Chuan Wang, Dayan Wu, Xiaochun Cao
机构
*
Sun Yat-sen University(中山大学)
;
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
Shenzhen Key Laboratory of Adversarial Artificial Intelligence(深圳市对抗性人工智能重点实验室)
;
Beijing Jiaotong University(北京交通大学)
;
Institute of Information Engineering, CAS(中国科学院信息工程研究所)
BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery
BloClaw:面向下一代科学发现的全能多模态智能工作空间
Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang
机构
*
AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部)
;
Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室)
;
First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)