Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference
关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃
Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu
机构
*
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
Sun Yat-sen University(中山大学)
;
National Supercomputing Center in Shenzhen(国家超级计算深圳中心)
;
Tsinghua University(清华大学)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
Korea University(高丽大学)
;
Upstage AI
;
Kyung Hee University(庆熙大学)
;
KAIST(韩国科学技术院)
;
Hanyang University College of Medicine(汉阳大学医学院)
;
AIGEN Sciences
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理
Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
The University of Hong Kong(香港大学)
;
Tsinghua University(清华大学)
;
University of Sussex(萨塞克斯大学)
Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment
迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架
Siyuan Xu, Yan Wang, Haofei Song, Lili Gao, Jiansheng Wang, Qing Zhang, Dan Huang, Boxiang Yun, Hongkai Xiong, Qingli Li
机构
*
East China Normal University(华东师范大学)
;
Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院)
;
Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司)
;
Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)
Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model
人工智能生成的以人为中心的视频的多维质量评估:数据集与模型
Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai
机构
*
Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所)
;
USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院)
;
Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
Zhejiang University(浙江大学)
;
ETH Zürich(苏黎世联邦理工学院)
;
Nanjing University of Science and Technology(南京理工大学)
;
Nanjing University(南京大学)
;
University of Waterloo(滑铁卢大学)
;
Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow
PathoSage:通过经验感知的代理工作流实现病理学多源证据裁决
Chengyang Zhang, Wenchuan Zhang, Bo Li, Mengran Li, Bob Zhang, Yuhao Yi, Hong Bu, Jiancheng Lv
机构
*
College of Computer Science, Sichuan University(四川大学计算机科学学院)
;
Department of Pathology and Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科/临床病理研究所)
;
Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)
;
School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering
看一次就够了?用于3D问答的在线几何感知令牌剪枝
Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun
机构
*
National Tsing Hua University(国立清华大学)
;
Industrial Technology Research Institute ITRI(工业技术研究院)
;
University of Toronto(多伦多大学)
;
Atmanity Inc(Atmanity公司)