arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2393
2511.09232 2026-04-01 cs.CL cs.SD

POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation

POTSA:一种用于语音到文本翻译的跨语言语音对齐框架

Xuanchen Li, Chenrui Cui, Tianrui Wang, Meng Ge, Zikang Huang, Yizhou Peng, Jin Li, Yuheng Lu, Yu Jiang, Nyima Tashi, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application, Tianjin University(天津大学认知计算与应用天津市重点实验室) Nanyang Technological University(南洋理工大学) Huiyan Technology Company, Ltd.(慧眼科技有限公司) Chinese Academy of Sciences(中国科学院) Tibet University(西藏大学)

AI总结 本文提出POTSA框架,通过最优传输和跨语言平行语音对缓解多语言语音翻译中的语义偏见问题,实验显示在FLEURS数据集上取得SOTA性能,提升BLEU分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21223 2026-04-01 cs.CV cs.CL

Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding

Sigma:基于骨骼的语义信息预训练用于手语理解

Muxin Pu, Mei Kuan Lim, Chun Yong Chong, Chen Change Loy

机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

AI总结 Sigma提出一种统一的骨骼手语理解框架,通过语义对齐学习和预训练策略提升手语识别与翻译性能,展现语义信息预训练在多语言手语任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21035 2026-04-01 cs.AI cs.CL

CLAUSE: Agentic Neuro-Symbolic Knowledge Graph Reasoning via Dynamic Learnable Context Engineering

CLAUSE: 通过动态可学习上下文工程实现基于代理的神经符号知识图谱推理

Yang Zhao, Chengxiao Dai, Wei Zhuo, Yue Xiu, Dusit Niyato

机构 * Independent Researcher(独立研究员) School of Computer Science, The University of Sydney, Australia(悉尼大学计算机科学学院) College of Computing & Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

AI总结 CLAUSE通过动态可学习上下文工程实现神经符号知识图谱推理,优化多跳问答的准确率、延迟和成本,减少子图增长和端到端延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28547 2026-03-31 cs.CV

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

GEditBench v2:一个对齐人类的通用图像编辑基准

Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang, Yongliang Wu, Wei Cheng, Gang Yu, Xu Yang, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) StepFun Southeast University(东南大学)

AI总结 本文提出GEditBench v2,包含1200个真实用户查询,涵盖23项任务,引入PVC-Judge模型评估视觉一致性,实验表明其在开放源模型中表现优异,揭示当前模型局限性。

Comments 30 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28316 2026-03-31 cs.LG

Taming the Instability: A Robust Second-Order Optimizer for Federated Learning over Non-IID Data

驯服不稳定性:一种适用于非独立同分布数据的鲁棒二阶优化器

Yuanqiao Zhang, Tiantian He, Yuan Gao, Yixin Wang, Yew-Soon Ong, Maoguo Gong, A. K. Qin, Hui Li

机构 * Key Laboratory of Collaborative Intelligence Systems of Ministry of Education, Xidian University(西安电子科技大学教育部协同智能系统重点实验室) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所前沿人工智能研究中心) State Key Laboratory of ISN, School of Cyber Engineering, Xidian University(西安电子科技大学网络与信息安全学院综合业务网理论及关键技术国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computing Technologies, Swinburne University of Technology(斯威本科技大学计算技术系)

AI总结 本文提出FedRCO,一种新型二阶优化框架,旨在提升联邦学习系统在统计异质性下的收敛速度和通信效率。通过高效近似曲率优化器与可证明的稳定性机制,FedRCO有效缓解不稳定性,提升鲁棒性。

Comments 33 pages, preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28135 2026-03-31 cs.AI

CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning

CoT2-Meta:预算化的元认知控制用于测试时推理

Siyuan Ma, Bo Gao, Zikai Xiao, Hailong Wang, Xinlei Yu, Rui Qian, Jiayu Qian, Luqi Gong, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Sun Yat-Sen University(中山大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Zhejiang Lab(之江实验室)

AI总结 CoT2-Meta通过元认知控制优化测试时推理,提升多个基准测试的性能,包括MATH、GSM8K等,相比基线方法有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09104 2026-03-31 cs.CV

Training-free Motion Factorization for Compositional Video Generation

无需训练的运动因子分解用于组合视频生成

Zixuan Wang, Ziqin Zhou, Feng Chen, Duo Peng, Yixin Hu, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出一种无需训练的运动因子分解框架,将复杂运动分解为静止、刚体和非刚体运动三类,通过规划先于生成的范式,提升视频生成中运动多样性的表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00059 2026-03-31 cs.LG cs.AI

TextBFGS: A Case-Based Reasoning Approach to Code Optimization via Error-Operator Retrieval

TextBFGS:通过错误-操作符检索的基于案例的推理代码优化方法

Zizheng Zhang, Yuyang Liao, Chen Chen, Jian He, Dun Wu, Qianjin Yu, Yanqin Gao, Jin Yang, Kailai Zhang, Eng Siong Chng, Xionghu Zhong

机构 * Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司) China Mobile(中国移动) Nanyang Technological University (NTU)(南洋理工大学) Hunan University(湖南大学)

AI总结 TextBFGS采用基于案例的推理方法,通过检索历史错误-操作符修正轨迹来优化代码生成,相比无状态方法更高效,显著提升了代码优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08673 2026-03-31 cs.CV

Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation

通过摄像头思考:一个统一的多模态模型用于以摄像头为中心的理解与生成

Kang Liao, Size Wu, Zhonghua Wu, Linyi Jin, Chao Wang, Yikai Wang, Fei Wang, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) SenseTime Research(商汤科技研究院) University of Michigan(密歇根大学) Max-Planck Institute for Informatics(马克斯·普朗克信息学研究所)

AI总结 本文提出Puffin模型,通过将摄像头视为语言,实现以摄像头为中心的多模态理解与生成,结合语言回归和扩散生成,提升空间感知能力,实验表明其在跨视角任务中表现优异。

Comments Accepted by ICLR2026. Project Page: https://kangliao929.github.io/projects/puffin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08137 2026-03-31 cs.LG cs.CL cs.GR cs.MM

Large Language Models for Computer-Aided Design: A Survey

大型语言模型在计算机辅助设计中的应用:综述

Licheng Zhang, Bach Le, Naveed Akhtar, Siew-Kei Lam, Tuan Ngo

机构 * The University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

AI总结 本文首次系统性地探讨了大型语言模型与计算机辅助设计的结合,分析了其在CAD中的应用领域及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27534 2026-03-31 cs.RO

S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking

S3KF:基于旋转激光雷达和四鱼眼相机的全景三维多目标跟踪框架

Zhongyuan Liu, Shaonan Yu, Jianping Li, Pengfei Wan, Xinhang Xu, Pengfei Wang, Maggie Y. Gao, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ST Engineering(新科工程) School of Civil and Environmental Engineering, Nanyang Technological University(南洋理工大学土木与环境工程学院)

AI总结 本文提出S3KF框架,利用旋转激光雷达和四鱼眼相机实现全景三维多目标跟踪,通过球面状态表示和扩展球面卡尔曼滤波提升跟踪精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18845 2026-03-31 cs.CV

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

所有权的回声:对抗引导的双注入用于MLLMs中的版权保护

Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出一种生成版权触发器的框架,通过双注入方法在MLLMs中嵌入可验证的版权信息,以在微调衍生模型中触发专属文本响应,同时在非衍生模型中保持无活性。

Comments Accepted to CVPR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08503 2026-03-31 cs.CV cs.AI

Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models

破坏层次推理:多模态推理模型中地理隐私的对抗保护

Jiaming Zhang, Che Wang, Yang Cao, Longtao Huang, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Institute of Science Tokyo(东京科学大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出ReasonBreak框架,通过概念感知扰动破坏多模态推理模型中的层次推理,利用GeoPrivacy-6K数据集验证其在提升地理隐私保护效果上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13719 2026-03-31 cs.CV cs.AI cs.LG cs.MM cs.RO

Scaling Spatial Intelligence with Multimodal Foundation Models

通过多模态基础模型提升空间智能

Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun, Tongxi Zhou, Jiaqi Li, Hui En Pang, Oscar Qian, Yukun Wei, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。

Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26794 2026-03-31 cs.CV

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

可泛化动作生成的探索:数据、模型与评估

Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Research(英伟达研究院)

AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。

Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13905 2026-03-31 cs.CL cs.AI

Schema for In-Context Learning

基于模式的上下文学习框架

Pan Chen, Shaohong Chen, Mark Wang, Shi Xuan Leong, Priscilla Fung, Varinia Bernales, Alan Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Nanyang Technological University(南洋理工大学) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院(CIFAR)) NVIDIA(英伟达)

AI总结 本文提出基于认知模式的上下文学习框架,通过提取先验示例中的认知构建块,生成抽象模式以增强模型推理能力,实验证明在化学和物理问题上性能提升达36.19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21356 2026-03-31 cs.CV

ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models

ShotBench:视觉语言模型中的专家级电影叙事理解

Hongbo Liu, Jingwen He, Yi Jin, Dian Zheng, Yuhao Dong, Fan Zhang, Ziqi Huang, Yinan He, Yangguang Li, Weichao Chen, Yu Qiao, Wanli Ouyang, Shengjie Zhao, Ziwei Liu

机构 * Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06197 2026-03-31 cs.CV

Tracking by Detection and Query: An Efficient End-to-End Framework for Multi-Object Tracking

基于检测与查询的跟踪:一种高效的端到端多目标跟踪框架

Shukun Jia, Shiyu Hu, Yichao Cao, Feng Yang, Xin Lu, Xiaobo Lu

机构 * organization= School of Automation , addressline= Southeast University , city= Nanjing , postcode= 210096 , country= China organization= Key Laboratory of Measurement organization= School of Physical \& Mathematical Sciences , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore organization= Big Data Institute , addressline= Central South University , city= Changsha , postcode= 410083 , country= China organization= School of Instrument Science Engineering , addressline= Southeast University , city= Nanjing , postcode= 210096 , country= China

AI总结 本文提出TBDQ-Net框架,结合检测与查询方法,提升多目标跟踪的效率与精度,通过轻量级关联器和双流更新模块解决任务冲突和遮挡问题,在多个基准测试中表现出色。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26687 2026-03-31 cs.RO cs.AI

Learning Energy-Efficient Air--Ground Actuation for Hybrid Robots on Stair-Like Terrain

学习能效空气-地面作动器用于阶梯地形上的混合机器人

Jiaxing Li, Wen Tian, Xinhang Xu, Junbin Yuan, Sebastian Scherer, Muqing Cao

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出一种能量感知强化学习框架,通过协调螺旋桨、轮子和倾斜伺服器实现高效混合作动,降低能耗并提升地形适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26653 2026-03-30 cs.CV cs.AI cs.CL cs.LG

PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning

PerceptionComp:一个复杂感知导向推理的视频基准测试

Shaoxuan Li, Zhixuan Zhao, Hanze Deng, Zirun Ma, Shulin Tian, Zuyan Liu, Yushi Hu, Haoning Wu, Yuhao Dong, Benlin Liu, Ziwei Liu, Ranjay Krishna

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学)

AI总结 PerceptionComp是一个手动标注的复杂长时景视频推理基准测试,要求多时间片段的视觉证据和逻辑约束,涉及多个感知子任务,测试人类和模型在感知推理中的性能瓶颈。

Comments Project Page: https://perceptioncomp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26190 2026-03-30 cs.CV cs.LG

Dual-Stage Invariant Continual Learning under Extreme Visual Sparsity

双阶段不变持续学习在极端视觉稀疏性下的应用

Rangya Zhang, Jiaping Xiao, Lu Bai, Yuhang Zhang, Mir Feroskhan

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)

AI总结 本文提出双阶段不变持续学习框架,通过联合蒸馏保持特征表示稳定性,解决极端稀疏条件下持续学习的挑战,实验表明在空间残留卫星检测中提升mAP 4.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11798 2026-03-30 cs.CV cs.AI cs.GR

Particulate: Feed-Forward 3D Object Articulation

Particulate: 用于前馈的3D物体关节化

Ruining Li, Yuxin Yao, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, Andrea Vedaldi

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

AI总结 Particulate通过前馈模型从3D网格推断关节结构,包括3D部分、运动结构和约束,利用Transformer网络实现高效推理,速度快于传统方法,且适用于AI生成的3D资产。

Comments CVPR 2026. Project page: https://ruiningli.com/particulate

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02425 2026-03-30 cs.CV cs.AI cs.CL cs.IR cs.LG

WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

WorldMM: 动态多模态记忆代理用于长视频推理

Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。

Comments CVPR 2026. Project page : https://worldmm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14950 2026-03-30 quant-ph cs.LG math.ST stat.ML stat.TH

Symmetric observations without symmetric causal explanations

对称观测而不对称因果解释

Christian William, Patrick Remy, Jean-Daniel Bancal, Yu Cai, Nicolas Brunner, Alejandro Pozas-Kerstjens

机构 * Department of Applied Physics, University of Geneva(日内瓦大学应用物理系) School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学物理与数学科学学院)

AI总结 研究探讨了对称观测是否能减少假设空间,通过三元概率分布示例证明对称性无法简化因果模型假设。

Comments 8+3 pages, 4+1 figures, RevTeX 4.2. The computational appendix is available at https://www.github.com/apozas/symmetric-causal. V2: published version

Journal ref Phys. Rev. A 113, 032219 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00181 2026-03-30 cs.CV cs.AI

Uncovering What, Why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly

揭示是什么、为什么和如何:面向视频异常因果理解的全面基准

Hang Du, Sicheng Zhang, Binzhu Xie, Guoshun Nan, Jiayang Zhang, Junrui Xu, Hangyu Liu, Sicong Leng, Jiangming Liu, Hehe Fan, Dajiu Huang, Jing Feng, Linli Chen, Can Zhang, Xuhuan Li, Hao Zhang, Jianhang Chen, Qimei Cui, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Yunnan University(云南大学) Zhejiang University(浙江大学) China Telecom Co., Ltd. Sichuan Branch(中国电信股份有限公司四川分公司)

AI总结 本文提出CUVA基准,通过三种人类标注解决视频异常的'what'、'why'和'how'问题,并引入MMEval评估指标和基于提示的方法,验证其在异常因果理解中的有效性。

Comments Accepted in CVPR2024, Codebase: https://github.com/fesvhtr/CUVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22265 2026-03-30 cs.LG

FedRE: A Representation Entanglement Framework for Model-Heterogeneous Federated Learning

FedRE:一种用于模型异质联邦学习的表示纠缠框架

Yuan Yao, Lixu Wang, Jiaqi Wu, Jin Song, Simin Chen, Zehua Wang, Zijian Tian, Wei Chen, Huixia Li, Xiaoxiao Li

机构 * Teleinfo, CAICT(中国信息通信研究院) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Nanjing University of Posts and Telecommunications(南京邮电大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of British Columbia(不列颠哥伦比亚大学) China University of Mining and Technology-Beijing(中国矿业大学(北京)) China University of Mining and Technology(中国矿业大学) Beijing Jiaotong University(北京交通大学)

AI总结 FedRE提出了一种表示纠缠框架,通过纠缠表示和纠缠标签编码提升模型异质联邦学习的性能,平衡模型效果、隐私保护和通信开销。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25738 2026-03-27 cs.CV

PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow

PSDesigner: 基于人类创意流程的自动化图形设计

Xincheng Shuai, Song Tang, Yutong Huang, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院生成式人工智能实验室)

AI总结 PSDesigner通过模拟人类设计师的创意流程,实现了自动化图形设计,通过设计数据集CreativePSD提升工具使用能力,在多种设计任务中优于现有方法,使非专业人士能轻松创建高质量设计。

Comments CVPR 2026, Project Page: https://henghuiding.com/PSDesigner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25423 2026-03-27 cs.SI cs.AI

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25405 2026-03-27 cs.RO cs.AI

System Design for Maintaining Internal State Consistency in Long-Horizon Robotic Tabletop Games

长周期机器人桌面游戏中维持内部状态一致性的系统设计

Guangyu Zhao, Ceyao Zhang, Chengdong Ma, Tao Wu, Yiyang Song, Haoxuan Ru, Yifan Zhong, Ruilin Yan, Lingfeng Li, Ruochong Li, Yu Li, Xuyuan Han, Yun Ding, Ruizhang Jiang, Xiaochuan Zhang, Yichao Li, Yuanpei Chen, Yaodong Yang, Yitao Liang

机构 * Peking University(北京大学) PKU-PsiBot Joint Lab(北大-PsiBot联合实验室) Nanyang Technological University(南洋理工大学) PsiBot

AI总结 本文通过系统设计而非孤立组件改进,研究如何在回合制多人类机器人桌面游戏中维持内部状态一致性。以Mahjong为例,提出整合架构,明确维护感知、执行和交互状态,分离高层语义推理与时间敏感的感知控制,并结合验证的动作原语和触觉触发恢复机制。

详情

展开后加载摘要…

URL PDF HTML 收藏