arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2603.26767 2026-03-31 cs.CV

A training-free framework for high-fidelity appearance transfer via diffusion transformers

无需训练的高保真外观迁移框架:通过扩散变换器

Shengrong Gu, Ye Wang, Song Wu, Rui Ma, Qian Wang, Lanjun Wang, Zili Yi

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of New Media and Communication, Tianjin University(天津大学新媒体与传播学院) JIUTIAN Research(九天研究院) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

AI总结 本文提出无需训练的扩散变换器框架,通过解耦结构与外观,利用高保真倒置建立内容先验,结合几何先验实现参考图像的动态融合,从而在结构保持和外观保真度上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15159 2026-03-30 cs.SE cs.AI cs.CL

To See is Not to Master: Teaching LLMs to Use Private Libraries for Code Generation

看清并非掌握:教LLM使用私有库进行代码生成

Yitong Zhang, Chengze Li, Ruize Chen, Guowei Yang, Xiaoran Jia, Yijie Ren, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Proxseer Inc.(Proxseer公司) School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) Software Institute, Nanjing University(南京大学软件学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文提出PriCoder方法,通过自动生成数据教LLM有效调用私有库API,提升私有库代码生成能力,实验显示在多种设置下pass@1指标提升超20%。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25872 2026-03-30 cs.LG

DRiffusion: Draft-and-Refine Process Parallelizes Diffusion Models with Ease

DRiffusion:通过草稿与精修过程轻松并行化扩散模型

Runsheng Bai, Chengyu Zhang, Yangdong Deng

机构 * CSAIL, MIT(麻省理工学院计算机科学与人工智能实验室) Tsinghua University(清华大学) IST, Nanjing University(南京大学智能科学与技术学院) School of Software, Tsinghua University(清华大学软件学院) FuturististAI Lab, Shanghai Tsinghua International Innovation Center(上海清华国际创新中心未来人工智能实验室)

AI总结 DRiffusion通过草稿与精修过程并行化扩散模型,提升采样速度同时保持生成质量,实验显示在多个模型上实现1.4至3.7倍加速,质量指标仅小幅下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25419 2026-03-27 cs.CL

TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning

TAPO:多语言数学推理中的翻译增强策略优化

Xu Huang, Zhejian Lai, Zixian Huang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 TAPO通过引入翻译增强策略优化框架,提升多语言数学推理能力,有效结合语言理解和推理能力,优于基线方法并在未见语言和领域任务中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23997 2026-03-27 cs.CV

HGGT: Robust and Flexible 3D Hand Mesh Reconstruction from Uncalibrated Images

HGGT:从未校准图像中鲁棒且灵活的3D手形重建

Yumeng Liu, Xiao-Xiao Long, Marc Habermann, Xuanze Yang, Cheng Lin, Yuan Liu, Yuexin Ma, Wenping Wang, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Max-Planck-Institut für Informatik(马克斯·普朗克信息学研究所) Macau University of Science and Technology(澳门科技大学) Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出HGGT方法,通过将手形重建视为视觉-几何基础任务,首次联合推断3D手形和相机姿态,实现了从未校准视角的鲁棒性和灵活性,优于现有方法并在真实场景中表现优异。

Comments project page: https://lym29.github.io/HGGT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18822 2026-03-27 cs.CV

DiP: Taming Diffusion Models in Pixel Space

DiP:在像素空间中驯服扩散模型

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

AI总结 DiP提出一种高效的像素空间扩散框架,通过解耦生成过程为全局和局部阶段,结合Diffusion Transformer和轻量级Patch Detailer Head,在不依赖VAE的情况下实现高效生成,推理速度提升10倍,FID分数达1.79。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24430 2026-03-26 cs.SD

Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation

迭代以区分:增强零样本语音合成评估的判别性和可靠性

Shengfan Shen, Di Wu, Xingchen Song, Dinghao Zhou, Liumeng Xue, Meng Meng, Jian Luan, Shuai Wang

机构 * Nanjing University(南京大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出I2D框架,通过递归合成语音提升零样本TTS评估的判别性和可靠性,实验显示其能提高系统级SRCC至0.464。

Comments submitted to Interspeech 2026, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24004 2026-03-26 cs.CL

Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning

基于表格的思考:通过神经符号推理增强多模态表格理解

Kun-Yang Yu, Zhi Zhou, Shi-Yu Tian, Xiao-Wen Yang, Zi-Yi Jia, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国)

AI总结 本文提出TWT框架,通过神经符号推理解决表格数据结构多样性、特征依赖复杂性及任务异质性问题,在八个数据集上验证了其在多模态表格理解任务中的优越性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11306 2026-03-26 cs.RO

Rotor-Failure-Aware Quadrotors Flight in Unknown Environments

具有旋转故障意识的四旋翼在未知环境中的飞行

Xiaobin Zhou, Miao Wang, Chengao Li, Can Cui, Ruibin Zhang, Yongchao Wang, Chao Xu, Fei Gao

机构 * School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制系统研究所) Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(香港理工大学航空工程系) School of Aeronautic Science and Engineering, Beihang University(北航航空科学与工程学院)

AI总结 本文提出一种具有旋转故障意识的四旋翼导航系统,通过复合故障检测与诊断非线性模型预测控制器和LiDAR平台,在未知复杂环境中实现旋转故障的快速检测与飞行稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19672 2026-03-26 cs.RO math.DS

Memory-Augmented Potential Field Theory: A Framework for Adaptive Control in Non-Convex Domains

具有记忆的势场理论:非凸域中自适应控制的框架

Dongzhe Zheng, Wenjie Mei

机构 * Department of Computer Science and Engineering, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(计算机科学与工程系,电子信息与电气工程学院,上海交通大学) School of Robotics and Automation, Suzhou Campus, Nanjing University(机器人与自动化学院,南京大学苏福校区)

AI总结 本文提出一种结合历史经验的随机优化控制框架,通过动态构建记忆势场来识别状态空间的关键拓扑特征,提升非凸环境中控制器的自适应优化能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23355 2026-03-25 cs.LG cs.CL

Off-Policy Value-Based Reinforcement Learning for Large Language Models

为大语言模型设计的非策略价值基于强化学习

Peng-Yuan Wang, Ziniu Li, Tian Xu, Bohan Yang, Tian-Shuo Liu, ChenYang Wang, Xiong-Hui Chen, Yi-Chen Li, Tianyun Yang, Congliang Chen, Yang Yu

机构 * National Key Laboratory for Novel Software Technology & School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室 & 智能科学与技术学院,南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(大数据研究院(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出ReVal方法,通过结合步级信号和轨迹级信号提升大语言模型的训练效率,实验表明其在数学推理任务中优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22892 2026-03-25 cs.LG

VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents

VLGOR:基于视觉-语言知识的离线强化学习用于通用智能体

Pengsen Liu, Maosen Zeng, Nan Tang, Kaiyuan Li, Jing-Cheng Pang, Yunan Liu, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China \& School of Artificial Intelligence, Nanjing University, China Computational Intelligence Center (CIC), School of Computer Artificial Intelligence, Shandong Jianzhu University, Jinan, 250101, China

AI总结 本文提出VLGOR框架,结合视觉和语言知识生成虚拟轨迹,提升智能体在未见任务中的泛化能力,实验显示其性能比基线方法高24%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03405 2026-03-25 cs.CV

ViDiC: Video Difference Captioning

ViDiC:视频差异描述

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手科技Kling团队)

AI总结 本文提出ViDiC任务及ViDiC-1K数据集,旨在评估多模态大语言模型对视频对相似性与差异性的细粒度描述能力,揭示现有模型在比较描述和差异感知上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20565 2026-03-25 cs.CV

DINO-Tok: Adapting DINO for Visual Tokenizers

DINO-Tok:为视觉分词器适应DINO

Mingkai Jia, Mingxiao Li, Zhijian Shu, Anlin Zheng, Liaoyuan Fan, Jiaxin Guo, Tianxing Shi, Dongyue Lu, Zeming Li, Xiaoyang Guo, Xiaojuan Qi, Xiao-Xiao Long, Qian Zhang, Ping Tan, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Horizon Robotics(Horizon机器人) Nanjing University(南京大学) Hong Kong University(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出DINO-Tok,一种基于冻结DINO编码器的视觉分词器,结合连续自编码和离散向量量化方法,提升高维潜在空间中的语义一致性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09537 2026-03-25 cs.SE cs.AI

From Context to Intent: Reasoning-Guided Function-Level Code Completion

从上下文到意图:基于推理的函数级代码补全

Yanzhou Li, Tianlin Li, Yiran Zhang, Shangqing Liu, Aishan Liu, Xianglong Liu, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Nanjing University(南京大学)

AI总结 本文提出一种基于推理的提示框架,通过利用代码上下文中的隐含线索推断开发者意图,提升函数级代码补全的准确性,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22039 2026-03-25 cs.LG cs.AI

UniCA: Unified Covariate Adaptation for Time Series Foundation Model

UniCA: 时空基础模型的统一协变量适应

Lu Han, Yu Liu, Lan Li, Qiwen Deng, Jian Jiang, Yinbo Sun, Zhe Yu, Binfeng Wang, Xingyu Lu, Lintao Ma, Han-Jia Ye, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国)

AI总结 UniCA通过协变量同质化和统一注意力融合机制,提升时空基础模型对异质协变量的适应能力,实验证明其在多模态预测任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22314 2026-03-25 cs.LG cs.AI

Enhancing AI-Based Tropical Cyclone Track and Intensity Forecasting via Systematic Bias Correction

通过系统性偏差校正增强基于AI的热带气旋轨迹和强度预报

Peisong Niu, Haifan Zhang, Yang Zhao, Tian Zhou, Ziqing Ma, Wenqiang Shen, Junping Zhao, Huiling Yuan, Liang Sun

机构 * DAMO Academy, Alibaba Group(阿里集团达摩院) State Key Laboratory of Severe Weather Meteorological Science and Technology, Nanjing University(南京大学 severe weather meteorological science and technology 国家重点实验室)

AI总结 本文提出BaguanCyclone框架,通过概率中心精修模块和区域感知强度预测模块提升热带气旋轨迹和强度预报精度,优于传统数值天气预报模型和多数AI基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22148 2026-03-24 cs.CV

OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation

OpenEarth-Agent:从工具调用到工具创建用于开放环境地球观测

Sijie Zhao, Feng Liu, Xueliang Zhang, Hao Chen, Xinyu Gu, Zhe Jiang, Fenghua Ling, Ben Fei, Wenlong Zhang, Junjue Wang, Weihao Xuan, Pengfeng Xiao, Naoto Yokoya, Lei Bai

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学)

AI总结 本文提出OpenEarth-Agent框架,通过自适应工作流规划与工具创建,解决开放环境地球观测中多源数据和异构任务的挑战,并通过OpenEarth-Bench评估其适应性和工具创建能力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21928 2026-03-24 cs.CV cs.LG

The Golden Subspace: Where Efficiency Meets Generalization in Continual Test-Time Adaptation

黄金子空间:在持续测试时适应中效率与泛化的平衡

Guannan Lai, Da-Wei Zhou, Zhenguo Li, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Hong Kong University of Science and Technology(香港科技大学) Frontier Robotics(前沿机器人)

AI总结 本文提出GOLD方法,通过轻量级适配器将特征投影到黄金子空间,并动态更新子空间以提升效率和稳定性,实验证明其在分类和分割任务中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17779 2026-03-24 cs.CV

CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image

CrowdGaussian:从单张图像重建高保真的人类人群3D高斯

Yizheng Song, Yiyu Zhuang, Qipeng Xu, Haixiang Wang, Jiahe Zhu, Jing Tian, Siyu Zhu, Hao Zhu

机构 * Nanjing University, China(南京大学) Fudan University, China(复旦大学) State Key Laboratory of Novel Software Technology, China(新型软件技术国家重点实验室)

AI总结 本文提出CrowdGaussian框架,通过单张图像直接重建多人3D高斯点云,解决遮挡、低清晰度和多样外观等挑战,实验表明其能生成逼真且几何一致的多人场景重建。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04619 2026-03-24 cs.CV

Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence

去噪以跟踪:利用视频扩散先验进行鲁棒对应

Tianyu Yuan, Yuanbo Yang, Lin-Zhuo Chen, Yao Yao, Zhuzhong Qian

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

AI总结 本文提出HeFT框架,利用预训练视频扩散模型的视觉先验进行零样本点跟踪,通过分析内部表示揭示注意力头在匹配、语义理解和位置编码中的不同专长,并提出基于头和频率的特征选择策略提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13876 2026-03-24 cs.CV

Scene Prior Filtering for Depth Super-Resolution

场景先验过滤用于深度超分辨率

Zhengxue Wang, Zhiqiang Yan, Ming-Hsuan Yang, Jinshan Pan, Guangwei Gao, Ying Tai, Jian Yang

机构 * PCA Lab, Nanjing University of Science and Technology, China(南京理工大学科学与工程学院实验室) National University of Singapore(新加坡国立大学) University of California, USA, and Yonsei University, South Korea(美国加州大学和韩国延世大学) PCA Lab, Nanjing University, China(南京大学实验室)

AI总结 本文提出SPFNet网络,利用大尺度模型的表面法线和语义图作为先验信息,通过多模态先验传播和一对一先验嵌入减少纹理干扰并提升边缘表示,实现在真实和合成数据集上的超分辨率性能。

Comments Accepted to IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21017 2026-03-24 cs.RO

Dreaming the Unseen: World Model-regularized Diffusion Policy for Out-of-Distribution Robustness

梦见未见:用于分布外鲁棒性的世界模型正则化扩散策略

Ziou Hu, Xiangtong Yao, Yuan Meng, Zhenshan Bing, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) the School of Science and Technology, Nanjing University (Suzhou Campus), China(南京大学苏州校区科学技术学院)

AI总结 本文提出Dream Diffusion Policy,通过整合世界模型提升扩散策略在分布外扰动下的鲁棒性,实验显示其在MetaWorld和现实场景中表现优异。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20829 2026-03-24 cs.LG

Beyond the Academic Monoculture: A Unified Framework and Industrial Perspective for Attributed Graph Clustering

超越学术单一文化:面向属性图聚类的统一框架与工业视角

Yunhui Liu, Yue Liu, Yongchao Liu, Tao Zheng, Stan Z. Li, Xinwang Liu, Tieke He

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Ant Group(蚂蚁集团) Westlake University(西湖大学) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

AI总结 本文提出统一框架和工业视角,分析属性图聚类在学术与工业需求间的差距,探讨评价标准、工程策略及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20799 2026-03-24 cs.CL cs.LG

RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution

基于可验证奖励的强化学习训练不会提升大语言模型的通用问答能力:评估方法和一个简单解决方案

Kaiyuan Li, Jing-Cheng Pang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文评估了基于可验证奖励的强化学习是否能提升大语言模型在通用问答任务中的推理能力,发现其效果不如可验证任务,并提出START方法提升问答质量和回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20690 2026-03-24 cs.CV

MFSR: MeanFlow Distillation for One Step Real-World Image Super Resolution

MFSR:用于一步真实世界图像超分辨率的MeanFlow蒸馏

Ruiqing Wang, Kai Zhang, Yuanzhi Zhu, Hanshu Yan, Shilin Lu, Jian Yang

机构 * Nanjing University(南京大学) LIX, École Polytechnique, CNRS, IPP(巴黎高等学院LIX研究所、法国国家科学研究中心、ipp) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

AI总结 MFSR提出一种单步蒸馏框架,通过MeanFlow作为学习目标,实现高效高质量的图像超分辨率,同时保留少量步骤的可选路径以进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20658 2026-03-24 cs.RO

Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation

加速补丁:学习一种插件式策略以加快具身操作

Zhichao Wu, Junyin Ye, Zhilong Zhang, Yihao Sun, Haoxin Lin, Jiaheng Luo, Haoxiang Ren, Lei Yuan, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China School of Artificial Intelligence, Nanjing University, China Mila-Quebec AI Institute \& Université de Montréal, Canada

AI总结 本文提出Speedup Patch,一种轻量且策略无关的框架,通过仅使用离线数据实现插件式加速,通过约束马尔可夫决策过程优化调度器,提升执行效率而不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20607 2026-03-24 cs.RO cs.LG

Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models

面向视觉-语言-动作模型的实用世界模型强化学习

Zhilong Zhang, Haoxiang Ren, Yihao Sun, Yifei Sheng, Haonan Wang, Haoxin Lin, Zhichao Wu, Pierre-Luc Bacon, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) Mila - Quebec AI Institute(魁北克AI研究所)

AI总结 本文提出VLA-MBPO框架,解决视觉-语言-动作模型在强化学习中的世界建模、多视角一致性及稀疏奖励下的误差累积问题,提升策略性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏