VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset
VINS-120K:基于大规模数据集的超高分辨率图像编辑
机构 * Nanjing University(南京大学) ; vivo
AI总结 提出首个大规模指令式超高分辨率图像编辑数据集VINS-120K(120K三元组,每张图像≥4K分辨率),并开发高频感知后适应策略以扩展预训练模型至UHR领域,提升细粒度细节合成与纹理真实感。
高校专区
VINS-120K:基于大规模数据集的超高分辨率图像编辑
机构 * Nanjing University(南京大学) ; vivo
AI总结 提出首个大规模指令式超高分辨率图像编辑数据集VINS-120K(120K三元组,每张图像≥4K分辨率),并开发高频感知后适应策略以扩展预训练模型至UHR领域,提升细粒度细节合成与纹理真实感。
6G通信网络赋能具身智能体:架构与原型
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Institute of Intelligent Networks and Communications (NINE), Nanjing University (Suzhou Campus)(南京大学智能网络与通信研究所(苏州校区))
AI总结 本文提出一种分层通信架构(包括人类意图感知层、基于O-RAN的传输层、智能中间层和具身层),并通过集成触觉设备、工业机械臂、中间平台和5G O-RAN测试床的原型验证了毫秒级延迟和稳定闭环操作。
SimInsert: 通过区域稀疏注意力融合实现无缝视频对象插入
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) ; JIUTIAN Research(JIUTIAN研究机构) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; Zhejiang Sci-Tech University(浙江科技学院) ; The University of British Columbia(不列颠哥伦比亚大学)
AI总结 提出SimInsert,一种无需训练的视频对象插入方法,利用图像到视频扩散模型的先验和区域稀疏注意力融合,实现时空一致和交互真实感,在PSNR、SSIM和LPIPS上分别提升18.8%、20.1%和降低44.1%。
Comments Accepted by ICME2026
ZipMoE:通过无损压缩和缓存亲和调度实现高效的设备端MoE服务
机构 * School of Electronic Science and Engineering, Nanjing University, China.(南京大学电子科学与工程学院) ; National Key Laboratory for Novel Software Technology, Nanjing University, China.(南京大学新型软件技术国家重点实验室)
AI总结 提出ZipMoE系统,通过缓存-调度协同设计利用边缘设备硬件特性和MoE参数统计冗余,实现无损且高效的设备端MoE推理,显著降低延迟并提升吞吐量。
Comments ICML 2026
SkillTree: 面向长时域控制任务的可解释基于技能的深度强化学习
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; National Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Polixir Technologies ; SenseTime Research(商汤科技研究院)
AI总结 提出SkillTree框架,通过可微决策树将连续动作空间离散化为技能空间,实现技能级可解释性,在复杂机器人臂控制任务中达到与基于技能的神经网络相当的性能。