arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3178
2512.15120 2025-12-18 cs.LG cs.AI

Automatic Reward Shaping from Multi-Objective Human Heuristics

多目标人类启发式自动奖励塑造

Yuqing Xie, Jiayu Chen, Wenhao Tang, Ya Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 MORSE通过双层优化框架自动整合多目标人类启发式奖励,提升机器人任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23049 2025-12-18 cs.LG cs.CL

DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration

DenoiseRotator: 通过重要性集中增强大语言模型的剪枝鲁棒性

Tianteng Gu, Bei Liu, Bo Xiao, Ke Zeng, Jiacheng Liu, Yanmin Qian

机构 * Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Meituan(美团)

AI总结 DenoiseRotator通过重要性集中提升大语言模型剪枝鲁棒性,采用可学习正交变换优化参数重要性分布,有效减少稀疏性约束下的性能下降。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14681 2025-12-17 cs.CL

Fast and Accurate Causal Parallel Decoding using Jacobi Forcing

快速且准确的因果并行解码使用雅可比强迫

Lanxiang Hu, Siqi Kou, Yichao Fu, Samyam Rajbhandari, Tajana Rosing, Yuxiong He, Zhijie Deng, Hao Zhang

机构 * UC San Diego(UC圣迭戈大学) Shanghai Jiao Tong University(上海交通大学) Snowflake(Snowflake公司)

AI总结 本文提出雅可比强迫方法,通过渐进蒸馏将AR模型转化为高效的并行解码器,实现3.8倍的速度提升并保持性能,同时引入多块解码与拒绝回收进一步提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14499 2025-12-17 cs.CV

Native Intelligence Emerges from Large-Scale Clinical Practice: A Retinal Foundation Model with Deployment Efficiency

原生智能源自大规模临床实践:一种具有部署效率的视网膜基础模型

Jia Guo, Jiawei Du, Shengzhu Yang, Shuai Lu, Wenquan Cheng, Kaiwen Zhang, Yihua Sun, Chuhong Yang, Weihang Zhang, Fang Chen, Yilan Wu, Lie Ju, Guochen Ning, Longfei Ma, Huiping Yao, Jinyuan Wang, Peilun Shi, Yukun Zhou, Jie Xu, Pearse A. Keane, Hanruo Liu, Hongen Liao, Ningli Wang, Huiqi Li

机构 * School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(生物医学工程学院,清华大学医学部,清华大学) School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) Beijing Key Laboratory of Intelligent Diagnosis Technology and Equipment for Optic Nerve-Related Eye Diseases(北京智能诊断技术与设备重点实验室) School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学) Beijing Tongren Hospital, Capital Medical University(北京同仁医院,首都医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Beijing Visual Science and Translational Eye Research Institute (BERI), Beijing Tsinghua Changgung Hospital Eye Center, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University Institute of Ophthalmology(北京视觉科学与转化眼研所(BERI),北京清华长庚医院眼科中心,临床医学学院,清华大学医学部,清华大学眼科学院)

AI总结 ReVision通过直接从真实临床数据中学习,实现了在低资源环境下高效部署的视网膜基础模型,无需额外标注即可在多种医学任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14442 2025-12-17 cs.CV cs.RO

A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning

A4-Agent: 一种用于零样本 affordance 推理的代理框架

Zixin Zhang, Kanghao Chen, Hanqing Wang, Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) Knowin

AI总结 A4-Agent 提出一种无需训练的代理框架,通过三个阶段的流水线实现零样本 affordance 推理,优于现有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17123 2025-12-17 cs.AR cs.LG

Layer-wise Weight Selection for Power-Efficient Neural Network Acceleration

分层权重选择用于高效能神经网络加速

Jiaxun Fang, Grace Li Zhang, Shaoyi Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Technical University of Darmstadt(达姆斯塔特技术大学) Stevens Institute of Technology(斯蒂文斯理工学院)

AI总结 本文提出了一种分层权重选择框架,通过优化能耗准确度和分层调度,实现CNN加速器的高效能压缩,实验显示能耗降低达58.6%且准确率仅下降2-3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01170 2025-12-17 cs.AI

DART: Difficulty-Adaptive Reasoning Truncation for Efficient Large Language Models

DART: 为高效大语言模型的难度自适应推理截断

Ruofan Zhang, Bin Xia, Zhen Cheng, Cairen Jian, Minglun Yang, Ngai Wong, Yuan Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) CSE Department, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Research and Development Department, SIMMIR Tech(Simmir科技研发部) School of Information Science and Technology, Xiamen University Tan Kah Kee College(厦门大学信息科学与技术学院) The University of Hong Kong(香港大学)

AI总结 DART通过自适应调整推理长度提升大语言模型效率,实现81.2%的推理截断和5.33倍的计算加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14068 2025-12-17 cs.CV cs.AI

SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding

SDAR-VL: 稳定且高效的块状扩散用于视觉语言理解

Shuang Cheng, Yuhua Jiang, Zineng Zhou, Dawei Liu, Wang Tao, Linfeng Zhang, Biqing Qi, Bowen Zhou

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

AI总结 SDAR-VL通过高效的块状扩散方法,在视觉语言理解中实现了更高的训练效率、收敛稳定性及任务性能,优于传统块扩散并匹敌强AR基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13192 2025-12-17 cs.CV

POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modeling

POLAR:一个面向光照感知面部建模的 Portrait OLAT 数据集和生成框架

Zhuo Chen, Chengqun Yang, Zhuo Su, Zheng Lv, Jingnan Gao, Xiaoyuan Zhang, Xiaokang Yang, Yichao Yan

机构 * Shanghai Jiao Tong University(上海交通大学) PICO

AI总结 POLAR 提出了一种基于大规模 OLAT 数据集和 POLARNet 生成模型的光照感知面部建模框架,实现可扩展和可控的面部重映射。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10333 2025-12-17 cs.LG cs.AI cs.PF

EDGC: Entropy-driven Dynamic Gradient Compression for Efficient LLM Training

EDGC: 基于熵驱动的动态梯度压缩用于高效大语言模型训练

Qingao Yi, Jiaang Duan, Hanwen Hu, Qin Hua, Haiyan Zhao, Shiyou Qian, Dingyu Yang, Jian Cao, Jinghua Tang, Yinghao Yu, Chenzhi Liao, Kangjin Wang, Liping Zhang

机构 * University of Shanghai for Science and Technology(上海科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 EDGC通过动态梯度压缩减少LLM训练的通信延迟和训练时间,提升效率的同时保持模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13668 2025-12-16 cs.LG

A Scientific Reasoning Model for Organic Synthesis Procedure Generation

有机合成过程生成的科学推理模型

Guoqing Liu, Junren Li, Zihan Zhao, Eray Inanc, Krzysztof Maziarz, Jose Garrido Torres, Victor Garcia Satorras, Shoko Ueda, Christopher M. Bishop, Marwin Segler

机构 * Microsoft Research AI for Science(微软研究院人工智能科学部) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 QFANG通过化学引导推理框架生成高质量合成程序,提升计算机辅助合成规划与自动化实验室合成的衔接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13510 2025-12-16 cs.AI

MedCEG: Reinforcing Verifiable Medical Reasoning with Critical Evidence Graph

MedCEG: 通过关键证据图强化可验证的医学推理

Linjie Mu, Yannian Gu, Zhongzhen Huang, Yakun Zhu, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SII

AI总结 MedCEG通过关键证据图强化医学推理,提升临床决策的可靠性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13465 2025-12-16 cs.CV

PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence

PoseAnything: 通用姿态引导视频生成与部分感知时间一致性

Ruiyan Wang, Teng Hu, Kaihui Huang, Zihan Su, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 PoseAnything是一种通用姿态引导视频生成框架,能够处理人类和非人类角色,通过引入部分感知时间一致性模块和解耦CFG策略,提升了视频生成的精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11273 2025-12-16 cs.CE cs.LG

Integrated Prediction and Multi-period Portfolio Optimization

集成预测与多期投资组合优化

Yuxuan Linghu, Zhiyuan Liu, Qi Deng

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Chicago(芝加哥大学)

AI总结 本文提出IPMO模型,通过集成预测与多期投资组合优化,提升风险调整后的绩效并实现更一致的资产分配路径。

Comments 23 pages, 6 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08648 2025-12-16 cs.CV

Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank

Repulsor:利用对比记忆库加速生成建模

Shaofeng Zhang, Xuanqi Chen, Ning Liao, Haoxiang Zhao, Xiaoxing Wang, Haoru Tan, Sitong Wu, Xiaosong Jia, Qi Fan, Junchi Yan

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(人工智能与数据科学学院,中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) HKU(香港大学) CUHK(香港大学) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 Repulsor通过对比记忆库机制,无需外部编码器,实现高效的生成建模,显著提升收敛速度和生成质量。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05115 2025-12-16 cs.CV

Light-X: Generative 4D Video Rendering with Camera and Illumination Control

Light-X:具有摄像机和照明控制的生成式4D视频渲染

Tianqi Liu, Zhaoxi Chen, Zihao Huang, Shaocong Xu, Saining Zhang, Chongjie Ye, Bohan Li, Zhiguo Cao, Wei Li, Hao Zhao, Ziwei Liu

机构 * S-Lab, NTU(NTU的S-Lab) BAAI HUST(华中科技大学) AIR,THU(清华大学人工智能研究院) FNii, CUHKSZ(CUHKSZ的FNii) SJTU(上海交通大学) EIT (Ningbo)(宁波工程学院)

AI总结 Light-X通过联合控制摄像机轨迹和光照,实现高质量4D视频生成,优于现有方法。

Comments Project Page: https://lightx-ai.github.io/ , Code: https://github.com/TQTQliu/Light-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19004 2025-12-16 cs.CV

A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

一种用于真实文本到LiDAR场景生成的自条件表示引导扩散模型

Wentao Qu, Guofeng Mei, Yang Wu, Yongshun Gong, Xiaoshui Huang, Liang Xiao

机构 * NJUST(南京理工大学) FBK(弗拉·恩里科·拉达基金会) SDU(山东大学) SJTU(上海交通大学)

AI总结 本文提出T2LDM模型,通过自条件表示引导技术提升文本到LiDAR场景生成的质量和可控性,构建了T2nuScenes基准并改进了生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16841 2025-12-16 eess.AS cs.SD

SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization

SAC:具有语义-声学双流量化神经语音编解码器

Wenxi Chen, Xinsheng Wang, Ruiqi Yan, Yushen Chen, Zhikang Niu, Ziyang Ma, Xiquan Li, Yuzhe Liang, Hanlin Wen, Shunshun Yin, Ming Tao, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University, China(上海交通大学X-LANCE实验室) Shanghai Innovation Institute, China(上海创新研究院) Soul AI Lab, China(Soul AI实验室)

AI总结 SAC通过语义-声学双流量化提升语音编解码器的重建与语义表示能力,实现更自然的语音生成和更高效的文本到语音转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12793 2025-12-16 cs.CV

ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution

ViCO: 一种面向语义感知动态高分辨率的训练策略

Long Cui, Weiyun Wang, Jie Shao, Zichen Wen, Gen Luo, Linfeng Zhang, Yanting Zhang, Yu Qiao, Wenhai Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ViCO通过动态调整视觉标记数量以适应图像语义复杂度,有效降低推理成本的同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07084 2025-12-16 cs.LG cs.AI

HTMformer: Hybrid Time and Multivariate Transformer for Time Series Forecasting

HTMformer: 混合时间与多变量变换器用于时间序列预测

Tan Wang, Yun Wei Dong, Qi Wang

机构 * Northwestern Polytechnical University(北华理工大学) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能教育部重点实验室,上海交通大学AI研究院) Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

AI总结 HTMformer通过混合时间与多变量嵌入提升时间序列预测的准确性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13080 2025-12-16 cs.CV

Counting Hallucinations in Diffusion Models

扩散模型中hallucination的计数

Shuai Fu, Jian Zhou, Qi Chen, Huang Jing, Huy Anh Nguyen, Xiaohan Liu, Zhixiong Zeng, Lin Ma, Quanshi Zhang, Qi Wu

机构 * University of Adelaide(阿德莱德大学) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种针对扩散模型中计数hallucination的评估方法,通过构建CountHalluSet数据集,系统分析不同采样条件对hallucination的影响,并揭示FID等指标无法捕捉计数hallucination的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11612 2025-12-15 cs.CV eess.IV

Embodied Image Compression

具身图像压缩

Chunyi Li, Rui Qing, Jianbo Zhang, Yuan Tian, Xiangyang Zhu, Zicheng Zhang, Xiaohong Liu, Weisi Lin, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出具身图像压缩问题,建立EmbodiedComp基准测试,证明现有模型在超低比特率下无法完成简单任务,推动具身AI在现实中的应用。

Comments 15 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11611 2025-12-15 cs.CV cs.AR

Using GUI Agent for Electronic Design Automation

利用GUI代理进行电子设计自动化

Chunyi Li, Longfei Li, Zicheng Zhang, Xiaohong Liu, Min Tang, Weisi Lin, Guangtao Zhai

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Center of AI Evaluation, Shanghai AI Laboratory(人工智能评估中心,上海人工智能实验室) School of Integrated Circuit Design, Shanghai Jiao Tong University(集成电路设计学院,上海交通大学) John Hopcroft Center, Shanghai Jiao Tong University(约翰·霍普克罗夫特中心,上海交通大学)

AI总结 本文首次将GUI代理应用于电子设计自动化领域,提出GUI-EDA数据集和EDAagent指标,解决EDA任务中的挑战。

Comments 17 pages, 15 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11301 2025-12-15 cs.CV

MultiEgo: A Multi-View Egocentric Video Dataset for 4D Scene Reconstruction

MultiEgo: 一种多视角第一人称视频数据集用于4D场景重建

Bate Li, Houqiang Zhong, Zhengxue Cheng, Qiang Hu, Qiang Wang, Li Song, Wenjun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) VisionStar Information Technology (Shanghai) Co., Ltd.(VisionStar信息科技(上海)有限公司)

AI总结 MultiEgo是首个多视角第一人称视频数据集,用于4D动态场景重建,包含五个社交互动场景,提供高精度姿态标注和亚毫秒级时间同步,适用于自由视角视频应用。

Comments ACM MM 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10206 2025-12-15 cs.AI

CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment

CP-Env:在可控医院环境中评估大型语言模型在临床路径中的表现

Yakun Zhu, Zhongzhen Huang, Qianhan Feng, Linjie Mu, Yannian Gu, Shaoting Zhang, Qi Dou, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

AI总结 CP-Env通过可控医院环境评估大型语言模型在复杂临床路径中的表现,揭示其在决策和伦理方面的挑战,并推动医疗AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15351 2025-12-15 cs.AI cs.CV

Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration

Octopus: 六种能力协同的代理多模态推理

Yifu Guo, Zishan Xu, Zhiyuan Yao, Yuquan Lu, Jiaye Lin, Sen Hu, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05046 2025-12-15 cs.CV

FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing

FlowDirector: 无需训练的流引导文本到视频编辑

Guangzhao Li, Yanming Yang, Chenxi Song, Chi Zhang

机构 * AGI Lab, Westlake University(西湖大学AGI实验室) Central South University(中南大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 FlowDirector通过直接在数据空间中建模编辑过程,无需训练和倒置步骤,实现了更精确的文本到视频编辑。

Comments Project Page is https://flowdirector-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10712 2025-12-15 cs.LG cs.AI

FuncGenFoil: Airfoil Generation and Editing Model in Function Space

FuncGenFoil:函数空间中的机翼生成与编辑模型

Jinouwen Zhang, Junjie Ren, Qianhong Ma, Jianyu Wu, Aobo Yang, Yan Lu, Lu Chen, Hairun Xie, Jing Wang, Miao Zhang, Wanli Ouyang, Shixiang Tang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shanghai Aircraft Design and Research Institute(上海飞机设计与研究院) Innovation Academy for Microsatellites of CAS(中国科学院微卫星创新院) Shanghai Jiao Tong University(上海交通大学)

AI总结 FuncGenFoil通过函数空间建模实现机翼生成与编辑,提升生成精度与多样性,为高保真空气动力学设计提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06490 2025-12-15 eess.AS cs.AI cs.MM cs.SD eess.SP

Recent Advances in Discrete Speech Tokens: A Review

最近离散语音标记的进展:综述

Yiwei Guo, Zhihan Li, Hankun Wang, Bohan Li, Chongtian Shao, Hanglei Zhang, Chenpeng Du, Xie Chen, Shujie Liu, Kai Yu

机构 * MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing(MoE人工智能关键实验室、江苏语言计算重点实验室;X-LANCE实验室、计算机科学与工程系、上海交通大学) X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University

AI总结 本文综述了离散语音标记的最新进展,分析了声音标记和语义标记的分类、方法及挑战,为未来研究提供方向。

Comments 26 pages, 8 figures, 3 tables. Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏