arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Nanyang Technological University(南洋理工大学)

2026-03-31 至 2026-03-31 共收录 17
2603.28547 2026-03-31 cs.CV

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

GEditBench v2:一个对齐人类的通用图像编辑基准

Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang, Yongliang Wu, Wei Cheng, Gang Yu, Xu Yang, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) StepFun Southeast University(东南大学)

AI总结 本文提出GEditBench v2,包含1200个真实用户查询,涵盖23项任务,引入PVC-Judge模型评估视觉一致性,实验表明其在开放源模型中表现优异,揭示当前模型局限性。

Comments 30 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28316 2026-03-31 cs.LG

Taming the Instability: A Robust Second-Order Optimizer for Federated Learning over Non-IID Data

驯服不稳定性:一种适用于非独立同分布数据的鲁棒二阶优化器

Yuanqiao Zhang, Tiantian He, Yuan Gao, Yixin Wang, Yew-Soon Ong, Maoguo Gong, A. K. Qin, Hui Li

机构 * Key Laboratory of Collaborative Intelligence Systems of Ministry of Education, Xidian University(西安电子科技大学教育部协同智能系统重点实验室) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所前沿人工智能研究中心) State Key Laboratory of ISN, School of Cyber Engineering, Xidian University(西安电子科技大学网络与信息安全学院综合业务网理论及关键技术国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computing Technologies, Swinburne University of Technology(斯威本科技大学计算技术系)

AI总结 本文提出FedRCO,一种新型二阶优化框架,旨在提升联邦学习系统在统计异质性下的收敛速度和通信效率。通过高效近似曲率优化器与可证明的稳定性机制,FedRCO有效缓解不稳定性,提升鲁棒性。

Comments 33 pages, preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28135 2026-03-31 cs.AI

CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning

CoT2-Meta:预算化的元认知控制用于测试时推理

Siyuan Ma, Bo Gao, Zikai Xiao, Hailong Wang, Xinlei Yu, Rui Qian, Jiayu Qian, Luqi Gong, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Sun Yat-Sen University(中山大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Zhejiang Lab(之江实验室)

AI总结 CoT2-Meta通过元认知控制优化测试时推理,提升多个基准测试的性能,包括MATH、GSM8K等,相比基线方法有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09104 2026-03-31 cs.CV

Training-free Motion Factorization for Compositional Video Generation

无需训练的运动因子分解用于组合视频生成

Zixuan Wang, Ziqin Zhou, Feng Chen, Duo Peng, Yixin Hu, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出一种无需训练的运动因子分解框架,将复杂运动分解为静止、刚体和非刚体运动三类,通过规划先于生成的范式,提升视频生成中运动多样性的表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00059 2026-03-31 cs.LG cs.AI

TextBFGS: A Case-Based Reasoning Approach to Code Optimization via Error-Operator Retrieval

TextBFGS:通过错误-操作符检索的基于案例的推理代码优化方法

Zizheng Zhang, Yuyang Liao, Chen Chen, Jian He, Dun Wu, Qianjin Yu, Yanqin Gao, Jin Yang, Kailai Zhang, Eng Siong Chng, Xionghu Zhong

机构 * Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司) China Mobile(中国移动) Nanyang Technological University (NTU)(南洋理工大学) Hunan University(湖南大学)

AI总结 TextBFGS采用基于案例的推理方法,通过检索历史错误-操作符修正轨迹来优化代码生成,相比无状态方法更高效,显著提升了代码优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08673 2026-03-31 cs.CV

Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation

通过摄像头思考:一个统一的多模态模型用于以摄像头为中心的理解与生成

Kang Liao, Size Wu, Zhonghua Wu, Linyi Jin, Chao Wang, Yikai Wang, Fei Wang, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) SenseTime Research(商汤科技研究院) University of Michigan(密歇根大学) Max-Planck Institute for Informatics(马克斯·普朗克信息学研究所)

AI总结 本文提出Puffin模型,通过将摄像头视为语言,实现以摄像头为中心的多模态理解与生成,结合语言回归和扩散生成,提升空间感知能力,实验表明其在跨视角任务中表现优异。

Comments Accepted by ICLR2026. Project Page: https://kangliao929.github.io/projects/puffin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08137 2026-03-31 cs.LG cs.CL cs.GR cs.MM

Large Language Models for Computer-Aided Design: A Survey

大型语言模型在计算机辅助设计中的应用:综述

Licheng Zhang, Bach Le, Naveed Akhtar, Siew-Kei Lam, Tuan Ngo

机构 * The University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

AI总结 本文首次系统性地探讨了大型语言模型与计算机辅助设计的结合,分析了其在CAD中的应用领域及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27534 2026-03-31 cs.RO

S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking

S3KF:基于旋转激光雷达和四鱼眼相机的全景三维多目标跟踪框架

Zhongyuan Liu, Shaonan Yu, Jianping Li, Pengfei Wan, Xinhang Xu, Pengfei Wang, Maggie Y. Gao, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ST Engineering(新科工程) School of Civil and Environmental Engineering, Nanyang Technological University(南洋理工大学土木与环境工程学院)

AI总结 本文提出S3KF框架,利用旋转激光雷达和四鱼眼相机实现全景三维多目标跟踪,通过球面状态表示和扩展球面卡尔曼滤波提升跟踪精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18845 2026-03-31 cs.CV

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

所有权的回声:对抗引导的双注入用于MLLMs中的版权保护

Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出一种生成版权触发器的框架,通过双注入方法在MLLMs中嵌入可验证的版权信息,以在微调衍生模型中触发专属文本响应,同时在非衍生模型中保持无活性。

Comments Accepted to CVPR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08503 2026-03-31 cs.CV cs.AI

Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models

破坏层次推理:多模态推理模型中地理隐私的对抗保护

Jiaming Zhang, Che Wang, Yang Cao, Longtao Huang, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Institute of Science Tokyo(东京科学大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出ReasonBreak框架,通过概念感知扰动破坏多模态推理模型中的层次推理,利用GeoPrivacy-6K数据集验证其在提升地理隐私保护效果上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13719 2026-03-31 cs.CV cs.AI cs.LG cs.MM cs.RO

Scaling Spatial Intelligence with Multimodal Foundation Models

通过多模态基础模型提升空间智能

Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun, Tongxi Zhou, Jiaqi Li, Hui En Pang, Oscar Qian, Yukun Wei, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。

Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26794 2026-03-31 cs.CV

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

可泛化动作生成的探索:数据、模型与评估

Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Research(英伟达研究院)

AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。

Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13905 2026-03-31 cs.CL cs.AI

Schema for In-Context Learning

基于模式的上下文学习框架

Pan Chen, Shaohong Chen, Mark Wang, Shi Xuan Leong, Priscilla Fung, Varinia Bernales, Alan Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Nanyang Technological University(南洋理工大学) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院(CIFAR)) NVIDIA(英伟达)

AI总结 本文提出基于认知模式的上下文学习框架,通过提取先验示例中的认知构建块,生成抽象模式以增强模型推理能力,实验证明在化学和物理问题上性能提升达36.19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21356 2026-03-31 cs.CV

ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models

ShotBench:视觉语言模型中的专家级电影叙事理解

Hongbo Liu, Jingwen He, Yi Jin, Dian Zheng, Yuhao Dong, Fan Zhang, Ziqi Huang, Yinan He, Yangguang Li, Weichao Chen, Yu Qiao, Wanli Ouyang, Shengjie Zhao, Ziwei Liu

机构 * Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06197 2026-03-31 cs.CV

Tracking by Detection and Query: An Efficient End-to-End Framework for Multi-Object Tracking

基于检测与查询的跟踪:一种高效的端到端多目标跟踪框架

Shukun Jia, Shiyu Hu, Yichao Cao, Feng Yang, Xin Lu, Xiaobo Lu

机构 * organization= School of Automation , addressline= Southeast University , city= Nanjing , postcode= 210096 , country= China organization= Key Laboratory of Measurement organization= School of Physical \& Mathematical Sciences , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore organization= Big Data Institute , addressline= Central South University , city= Changsha , postcode= 410083 , country= China organization= School of Instrument Science Engineering , addressline= Southeast University , city= Nanjing , postcode= 210096 , country= China

AI总结 本文提出TBDQ-Net框架,结合检测与查询方法,提升多目标跟踪的效率与精度,通过轻量级关联器和双流更新模块解决任务冲突和遮挡问题,在多个基准测试中表现出色。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26687 2026-03-31 cs.RO cs.AI

Learning Energy-Efficient Air--Ground Actuation for Hybrid Robots on Stair-Like Terrain

学习能效空气-地面作动器用于阶梯地形上的混合机器人

Jiaxing Li, Wen Tian, Xinhang Xu, Junbin Yuan, Sebastian Scherer, Muqing Cao

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出一种能量感知强化学习框架,通过协调螺旋桨、轮子和倾斜伺服器实现高效混合作动,降低能耗并提升地形适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏