arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2370
2604.00942 2026-04-02 cs.LG cs.CR math.ST stat.TH

Differentially Private Manifold Denoising

差分隐私的流形去噪

Jiaqi Wu, Yiqing Sun, Zhigang Yao

机构 * Department of Statistics and Data Science, National University of Singapore(新加坡国立大学统计与数据科学系)

AI总结 本文提出一种差分隐私流形去噪框架,利用敏感参考数据修正噪声查询点,同时保证隐私。通过迭代过程估计局部均值和切线几何,并在每次迭代中沿私有估计子空间投影查询点,最终提供形式化的差分隐私保证。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00694 2026-04-02 cs.ET cs.AI

Internal APIs Are All You Need: Shadow APIs, Shared Discovery, and the Case Against Browser-First Agent Architectures

内部API足矣:影子API、共享发现以及对浏览器优先代理架构的反对

Lewis Tham, Nicholas Mac Gregor Garcia, Jungpil Hahn

机构 * Unbrowse AI School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 本文提出Unbrowse系统,通过共享路由图将浏览器路由发现转化为集体维护的可调用第一方接口索引,提升信息检索效率,同时引入三级微支付模型以促进理性采用。

Comments 17 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00682 2026-04-02 cs.CV

MoonAnything: A Vision Benchmark with Large-Scale Lunar Supervised Data

MoonAnything: 一个具有大规模月球监督数据的视觉基准

Clémentine Grethen, Yuang Shi, Simone Gasparini, Géraldine Morin

机构 * IRIT - Université de Toulouse(图卢兹第三大学-计算机科学研究所) National University of Singapore(新加坡国立大学) IPAL, IRL2955

AI总结 本文提出MoonAnything基准,基于真实月球地形和物理渲染,提供首个全面的几何和光度监督。包含LunarGeo和LunarPhoto两个子数据集,共13万+样本,适用于低纹理、高对比条件下的算法测试。

Comments Accepted to ACM MMSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11558 2026-04-02 cs.RO cs.AI

RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks

RoboClaw:一个用于可扩展长周期机器人任务的代理框架

Ruiying Li, Yunlang Zhou, YuYao Zhu, Kylin Chen, Jingyuan Wang, Sukai Wang, Kongtao Hu, Minhui Yu, Bowen Jiang, Zhan Su, Jiayao Ma, Xin He, Yongjian Shen, Yang Yang, Guanghui Ren, Maoqing Yao, Wenhao Wang, Yao Mu

机构 * AgiBot National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) MoE Key Lab of Artificial Intelligence, AI Institute, SJTU(上海交通大学人工智能研究院教育部人工智能重点实验室)

AI总结 RoboClaw通过统一数据收集、策略学习和任务执行,提高长周期机器人任务的稳定性和可扩展性,减少人工干预,提升多策略鲁棒性。

Comments Code available at: https://github.com/RoboClaw-Robotics/RoboClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14570 2026-04-02 cs.LG cs.AI

LPS-GNN : Deploying Graph Neural Networks on Graphs with 100-Billion Edges

LPS-GNN:在拥有1000亿条边的图上部署图神经网络

Xu Cheng, Liang Yao, Feng He, Yukuo Cen, Yufei He, Chenhui Zhang, Wenzheng Feng, Hongyun Cai, Jie Tang

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Tencent Inc(腾讯公司) National University of Singapore(新加坡国立大学)

AI总结 本文提出LPS-GNN框架,通过优化图分区和子图增强策略,在单块GPU10小时内处理1000亿图节点,提升用户获取场景性能13.8%。

Journal ref ACM Transactions on Knowledge Discovery from Data (TKDD) (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29697 2026-04-01 cs.CV

FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing

FED-Bench:一种跨粒度的面部表情编辑评估基准

Fengjian Xue, Xuecheng Wu, Heli Sun, Yunyun Shi, Shi Chen, Liangyu Fu, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi’an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

AI总结 本文提出FED-Bench,通过构建747个三元组基准,引入FED-Score评估协议,评估面部表情编辑的对齐、保真度和相对表达增益,揭示当前方法在高保真与准确表达操控间的困境,并提供20k+真实世界面部训练集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29602 2026-04-01 cs.GR cs.AI cs.CV cs.MA

IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection

IMAGAgent:通过约束感知规划与反思协调多轮图像编辑

Fei Shen, Chengyu Xie, Lihong Wang, Zhanyi Zhang, Xin Jiang, Xiaoyu Du, Jinhui Tang

机构 * National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

AI总结 IMAGAgent通过闭环机制整合指令解析、工具调度与自适应修正,解决多轮图像编辑中的上下文感知与反馈问题,提升编辑精度与整体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01639 2026-04-01 cs.CV

ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化

Tianyu Yang, Chenwei He, Xiangzhao Hao, Tianyue Wang, Jiarui Guo, Haiyun Guo, Leigang Qu, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Southeast University(东南大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)

AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29361 2026-04-01 cs.AI cs.LG cs.LO

Rigorous Explanations for Tree Ensembles

树集成的严谨解释

Yacine Izza, Alexey Ignatiev, Xuanxiang Huang, Peter J. Stuckey, Joao Marques-Silva

机构 * National University of Singapore(新加坡国立大学) Monash University(莫纳什大学) Nanyang Technological University(南洋理工大学)

AI总结 本文研究如何为随机森林和提升树这两种树集成方法计算严谨且逻辑严谨的解释,以增强人类决策者对模型预测的理解与信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29296 2026-04-01 cs.CV

MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splatting

MotionScale:通过可扩展的4D高斯点划法重建动态场景的外观、几何和运动

Haoran Zhou, Gim Hee Lee

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文提出MotionScale框架,通过可扩展的4D高斯点划法实现动态场景的高保真重建,解决复杂环境中3D几何和时间一致运动的恢复问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24176 2026-04-01 cs.CV cs.LG

Guiding a Diffusion Transformer with the Internal Dynamics of Itself

通过自身内部动态引导扩散变换器

Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) North China Institute of Computer Systems Engineering(华北计算机系统工程研究所)

AI总结 本文提出内部引导策略,通过训练过程中中间层的辅助监督和采样时的中间层输出扩展,提升训练效率和生成质量,在ImageNet上取得显著效果。

Comments Accepted to CVPR 2026. Project Page: https://zhouxingyu13.github.io/Internal-Guidance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00818 2026-04-01 cs.AI cs.CV

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28135 2026-03-31 cs.AI

CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning

CoT2-Meta:预算化的元认知控制用于测试时推理

Siyuan Ma, Bo Gao, Zikai Xiao, Hailong Wang, Xinlei Yu, Rui Qian, Jiayu Qian, Luqi Gong, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Sun Yat-Sen University(中山大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Zhejiang Lab(之江实验室)

AI总结 CoT2-Meta通过元认知控制优化测试时推理,提升多个基准测试的性能,包括MATH、GSM8K等,相比基线方法有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27991 2026-03-31 cs.HC cs.AI

ViviDoc: Generating Interactive Documents through Human-Agent Collaboration

ViviDoc:通过人机协作生成交互式文档

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Jiale Lao, Yue Cheng, Wei Chen

机构 * National University of Singapore(新加坡国立大学) University of Virginia(弗吉尼亚大学) Cornell University(康奈尔大学)

AI总结 ViviDoc通过多智能体流程和三级人类控制,系统性解决交互式文档生成问题,构建了ViviBench基准并实现高内容丰富度和交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16771 2026-03-31 cs.CV cs.LG

AutoRegressive Generation with B-rep Holistic Token Sequence Representation

基于B-表示的自回归生成:整体令牌序列表示

Jiahao Li, Yunpeng Bai, Yongkang Dai, Hao Guo, Hongping Gan, Yilei Shi

机构 * Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出BrepARG,首次将B-表示的几何与拓扑转化为整体令牌序列,通过自回归架构实现B-表示生成,实验表明其达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01448 2026-03-31 cs.LG cs.MM

OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models

OpenAVS: 基于基础模型的无训练开放词汇音频视觉分割

Shengkai Chen, Yifang Yin, Jinming Cao, Shili Xiang, Zhenguang Liu, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 OpenAVS通过文本作为代理,首次实现音频与视觉模态对齐,利用基础模型直接推断掩码,提升开放词汇音频视觉分割的泛化能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05675 2026-03-31 cs.AI cs.LG

Synergizing Large Language Models and Task-specific Models for Time Series Anomaly Detection

融合大语言模型与任务特定模型用于时间序列异常检测

Feiyi Chen, Leilei Zhang, Guansong Pang, Roger Zimmermann, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Department of Computer Science and Technology, Singapore Management University(新加坡管理大学计算机科学与技术系) Department of Computer Science and Technology, National University of Singapore(新加坡国立大学计算机科学与技术系)

AI总结 本文提出CoLLaTe框架,通过融合大语言模型与任务特定模型,解决异常检测中的表达域不匹配和预测误差累积问题,提升检测性能。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27666 2026-03-31 cs.CV

Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

门控条件注入无需多模态注意:迈向可控的线性注意变换器

Yuhe Liu, Zhenxiong Tan, Yujia Hu, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出基于线性注意架构的可控扩散模型,解决现有方法在多类型条件输入灵活性和收敛速度上的不足,通过统一门控条件模块实现高效可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27527 2026-03-31 cs.LG

Visualization of Machine Learning Models through Their Spatial and Temporal Listeners

通过空间和时间监听器可视化机器学习模型

Siyu Wu, Lei Shi, Lei Xia, Cenyang Wu, Zipeng Liu, Yingchaojie Feng, Liang Zhou, Wei Chen

机构 * School of Computer Science & Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Medical Technology, Peking University Health Science Center and National Institute of Health Data Science, Peking University(北京大学医学部医学技术研究院与北京大学健康数据科学国家研究所) School of Software, Beihang University(北京航空航天大学软件学院) National University of Singapore(新加坡国立大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出一种以模型为中心的两阶段框架,通过抽象监听器捕捉模型的空间和时间行为,并将其连接到经典信息可视化流程,分析显示可视化模型结果、定量/名义数据类型和统计图表是主要关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27169 2026-03-31 cs.AI

Aligning LLMs with Graph Neural Solvers for Combinatorial Optimization

对齐大语言模型与图神经求解器以解决组合优化问题

Shaodi Feng, Zhuoyi Lin, Yaoxin Wu, Haiyan Yin, Yan Jin, Senthilnath Jayavelu, Xun Xu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Eindhoven University of Technology(埃因霍温理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,新加坡科技研究局) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出AlignOPT方法,通过结合大语言模型与图神经求解器,提升组合优化问题的求解能力,实现语义与结构表示的对齐,实验显示其在多种优化问题中表现优异。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26741 2026-03-31 cs.CV cs.AI cs.RO

Language-Conditioned World Modeling for Visual Navigation

基于语言的视觉导航世界建模

Yifei Dong, Fengyi Wu, Yilong Dai, Lingdong Kong, Guangyu Chen, Xu Zhu, Qiyu Hu, Tianyu Wang, Johnalbert Garnica, Feng Liu, Siyu Huang, Qi Dai, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Clemson University(克莱姆森大学) Drexel University(德雷塞尔大学) Microsoft Research(微软研究院)

AI总结 本文研究了基于语言的视觉导航问题,提出LCVN数据集并开发了两种模型家族,通过语言 grounding、未来状态预测和动作生成实现统一任务学习。

Comments 19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26639 2026-03-30 cs.CV cs.AI

Make Geometry Matter for Spatial Reasoning

让几何在空间推理中发挥作用

Shihua Zhang, Qiuhong Shen, Shizun Wang, Tianbo Pan, Xinchao Wang

机构 * National University of Singapore, Singapore(新加坡国立大学)

AI总结 本文提出GeoSR框架,通过几何解封掩码和几何引导融合,提升视觉语言模型的空间推理能力,实验证明其在静态和动态场景中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26569 2026-03-30 cs.LG

Machine Unlearning under Retain-Forget Entanglement

机器遗忘中的保留-遗忘纠缠

Jingpu Cheng, Ping Liu, Qianxiao Li, Chi Zhang

机构 * National University of Singapore(新加坡国立大学) University of Nevada Reno(内华达大学里诺分校) Institute for Functional Intelligent Materials(功能智能材料研究所)

AI总结 本文提出一种两阶段优化框架,解决保留与遗忘样本间的纠缠问题,通过增强遗忘集损失并保留无关样本准确性,结合梯度投影和Wasserstein-2距离正则化,提升遗忘任务的可靠性与准确性。

Comments ICLR 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26456 2026-03-30 cs.DB cs.LG

Fair Data Pre-Processing with Imperfect Attribute Space

具有不完美属性空间的公平数据预处理

Ying Zheng, Yangfan Jiang, Kian-Lee Tan

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文提出LatentPre框架,通过引入潜在属性增强公平数据处理,在不完美属性空间中实现公平与效用的平衡。

Comments Accepted at SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26328 2026-03-30 cs.CV

Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization

通过边界感知提示优化验证声称的文本到图像模型

Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Nankai University(南开大学) Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出边界感知提示优化方法,通过识别模型特定的边界相邻提示来验证文本到图像模型的真实性,实验显示其验证准确率优越。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26067 2026-03-30 cs.CV cs.AI

R-PGA: Robust Physical Adversarial Camouflage Generation via Relightable 3D Gaussian Splatting

R-PGA:通过可重照明的3D高斯点散布实现鲁棒的物理对抗伪装生成

Tianrui Lou, Siyuan Liang, Jiawei Liang, Yuze Gao, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络空间安全学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligent Systems Engineering, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区智能工程学院)

AI总结 本文提出R-PGA框架,通过可重照明的3D高斯点散布技术,解决自动驾驶系统中对抗性伪装生成的鲁棒性问题,提升复杂动态场景下的泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08316 2026-03-30 cs.SE cs.AI

SWE Context Bench: A Benchmark for Context Learning in Coding

SWE Context Bench: 一个用于编码上下文学习的基准测试

Jared Zhu, Minhao Hu, Junde Wu

机构 * Independent Researcher(独立研究员) University of Oxford(牛津大学) University of Edinburgh(爱丁堡大学) Technical University of Munich(慕尼黑工业大学) MemoraX AI National University of Singapore(新加坡国立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出SWE-ContextBench基准,用于评估编程代理的上下文重用能力,通过1100个基础任务和376个相关任务,从GitHub问题和拉取请求中挖掘真实依赖关系,评估预测准确度、时间效率和成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11647 2026-03-30 cs.CV

IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

IVEBench:现代指令引导视频编辑评估基准套件

Yinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng, Zhucun Xue, Qingdong He, Chengjie Wang, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) University of Auckland(奥克兰大学) National University of Singapore(新加坡国立大学)

AI总结 IVEBench通过引入多样化的视频数据库和多维评估协议,解决现有视频编辑基准在评估指令引导视频编辑方面的不足,提供全面的人类对齐评估结果。

Comments Accepted by ICLR 2026. Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/IVEBench Code: https://github.com/RyanChenYN/IVEBench Dataset: https://huggingface.co/datasets/Coraxor/IVEBench

详情

展开后加载摘要…

URL PDF HTML 收藏