LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理
Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
The University of Hong Kong(香港大学)
;
Tsinghua University(清华大学)
;
University of Sussex(萨塞克斯大学)
Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment
迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架
Siyuan Xu, Yan Wang, Haofei Song, Lili Gao, Jiansheng Wang, Qing Zhang, Dan Huang, Boxiang Yun, Hongkai Xiong, Qingli Li
机构
*
East China Normal University(华东师范大学)
;
Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院)
;
Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司)
;
Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)
Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model
人工智能生成的以人为中心的视频的多维质量评估:数据集与模型
Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai
机构
*
Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所)
;
USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院)
;
Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
Zhejiang University(浙江大学)
;
ETH Zürich(苏黎世联邦理工学院)
;
Nanjing University of Science and Technology(南京理工大学)
;
Nanjing University(南京大学)
;
University of Waterloo(滑铁卢大学)
;
Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving
DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准
Hao Vo, Khoa Vo, Phu Loc Nguyen, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Gladys Gawugah, Sreevenkata Anjani Tishita Godavarthi, Chase Rainwater, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le
机构
*
University of Arkansas, USA(美国阿肯色大学)
;
Google Research, Google(谷歌研究院)
;
University of Liverpool, UK(英国利物浦大学)
;
Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)
PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow
PathoSage:通过经验感知的代理工作流实现病理学多源证据裁决
Chengyang Zhang, Wenchuan Zhang, Bo Li, Mengran Li, Bob Zhang, Yuhao Yi, Hong Bu, Jiancheng Lv
机构
*
College of Computer Science, Sichuan University(四川大学计算机科学学院)
;
Department of Pathology and Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科/临床病理研究所)
;
Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)
;
School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
机构
*
Institute of AI (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)
;
Lumos Robotics(Lumos机器人)
;
University of Science and Technology of China(中国科学技术大学)
;
Northwestern Polytechnical University(西北工业大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
East China University of Science and Technology(东华大学)
;
Harbin Engineering University(哈尔滨工程大学)
;
Fudan University(复旦大学)
Universal Skeleton Understanding via Differentiable Rendering and MLLMs
通过可微渲染和大语言模型实现通用骨架理解
Ziyi Wang, Peiming Li, Xinshun Wang, Yang Tang, Kai-Kuang Ma, Mengyuan Liu
机构
*
State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School, China(人工智能通用基础理论国家重点实验室,北京大学深圳研究生院,中国)
;
Tencent(腾讯)
;
Nanjing University of Aeronautics(南京航空航天大学)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering
迭代多模态检索增强生成用于医疗问答
Xupeng Chen, Binbin Shi, Chenqian Le, Jiaqi Zhang, Kewen Wang, Ran Gong, Jinhan Zhang, Chihang Wang
机构
*
New York University, New York, USA(纽约大学)
;
Tsinghua University, Beijing, China(清华大学)
;
Independent Researcher(独立研究者)
;
Chinese Academy of Sciences, Beijing, China(中国科学院)
机构
*
Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室)
;
Nanjing University(南京大学)
;
Peking University(北京大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)
专题命中
视觉问答
:LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.CV
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
RAVENEA:多模态检索增强视觉文化理解的基准
Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, Paul Pu Liang, Yang Deng, Serge Belongie
机构
*
University of Copenhagen(哥本哈根大学)
;
ETH Zürich(苏黎世联邦理工学院)
;
University of Amsterdam(阿姆斯特丹大学)
;
University of Cambridge(剑桥大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
Singapore Management University(新加坡管理大学)