arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2605.20147 2026-05-20 cs.CV

PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

PixVerve:通过大规模高质量数据集将原生超高清图像生成推至100MP

Haojun Chen, Haoyang He, Chengming Xu, Qingdong He, Junwei Zhu, Yabiao Wang, Zhucun Xue, Xianfang Zeng, Zhennan Chen, Xiaobin Hu, Hao Zhao, Yong Liu, Jiangning Zhang, Dacheng Tao

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出PixVerve-95K数据集,通过精心设计的数据管道构建,包含95K张高分辨率图像和七维标注,用于推动超高清图像生成技术,通过三种训练方案将T2I基础模型扩展到100MP生成,并建立PixVerve-Bench评估协议。

Comments Project page is available at https://haojunchen663.github.io/projects/PixVerve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16447 2026-05-20 cs.LG cs.AI

Nested Spatio-Temporal Time Series Forecasting

嵌套时空时间序列预测

Yinghao Ai, Yukai Zhou, Ruoxi Jiang, Junyi An, Chao Qu, Zhijian Zhou, Shiyu Wang, Fenglei Cao, Zenglin Xu, Furao Shen, Yuan Qi

机构 * Fudan University, Shanghai(复旦大学) Department of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术系) ByteDance(字节跳动)

AI总结 本文提出了一种嵌套预测框架,通过结合未来宏观区域趋势与微观历史观测,实现了精细化预测,并通过谱聚类方法构建语义连贯的区域,有效过滤系统性噪声并保留关键趋势,实验表明该方法在多个高维数据集上优于现有最先进基线。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19698 2026-05-20 cs.CR cs.LG

Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion Models

唤醒 Hydra:在文本到图像扩散模型中稳定多概念后门注入

Kai Wang, Jiale Zhang, Chengcheng Zhu, Chuang Ma, Songze Li

机构 * Yangzhou University(扬州大学) Nanjing University(南京大学) Chongqing University(重庆大学) Southeast University(东南大学)

AI总结 本文研究了在易受干扰的环境下多概念后门攻击的稳定性问题,提出 Hydra 框架,通过约束触发语义和协调跨任务交互,实现稳健且可控的多概念后门注入,实验表明 Hydra 在保持清洁生成质量的同时,有效激活后门。

Comments Preprint. 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19620 2026-05-20 cs.CV

Bézier Degradation Modeling for LiDAR-based Human Motion Capture

基于LiDAR的人体动作捕捉的贝塞尔退化建模

Xiaoqi An, Lin Zhao, Jun Li, Chen Gong, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院精密仪器实验室,南京理工大学) PCA Lab, School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院精密仪器实验室,南京大学)

AI总结 本文提出BMLiCap框架,通过时间可压缩的贝塞尔曲线建模人体动作,采用轨迹保留策略减少控制点,设计渐进式动作重建模块,利用时间尺度运动变换器和多级动作聚合器有效融合多尺度曲线,以提高复杂场景下的动作重建精度和时间连续性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19340 2026-05-20 cs.CV

Selective, Regularized, and Calibrated: Harnessing Vision Foundation Models for Cross-Domain Few-Shot Semantic Segmentation

选择性、正则化和校准:利用视觉基础模型进行跨域少样本语义分割

Junyuan Ma, Xunzhi Xiang, Wenbin Li, Qi Fan, Yang Gao

机构 * Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出HERA框架,通过选择性、正则化和校准的方法,有效利用视觉基础模型进行跨域少样本语义分割,提升了模型在新领域中的适应能力,并在多个基准上取得了更高的mIoU成绩。

Comments 20 pages, 11 figures, 13 tables. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19120 2026-05-20 cs.RO

CosFly: Plan in the Matrix, Fly in the World

CosFly:矩阵中的计划,世界中的飞行

Hanxuan Chen, Xiangyue Wang, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Binbo Li, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14678 2026-05-20 cs.AI

$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

$π$-Bench:评估长周期工作流中主动型个人助理代理

Haoran Zhang, Luxin Xu, Zhilin Wang, Runquan Gui, Shunkai Zhang, Haodi Lei, Zihao He, Bingsu He, Chicheng Qin, Tong Zhu, Xiaoye Qu, Yang Yang, Yu Cheng, Yafu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Tongji University(同济大学) Soochow University(苏州大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出$π$-Bench基准,用于评估个人助理代理在长周期工作流中的主动协助能力,通过100个多轮任务和5种特定领域用户角色,验证代理在未明确表达意图前识别和执行隐藏意图的能力,揭示主动协助的挑战及前期交互对后续任务的重要性。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04663 2026-05-20 cs.LG cs.AI

Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

重新思考扩散模型强化学习的设计空间:超越损失设计的似然估计的重要性

Jaemoo Choi, Yuchen Zhu, Wei Guo, Petr Molodyk, Bo Yuan, Jinbin Bai, Yi Xin, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Nanjing university(南京大学)

AI总结 本文研究了扩散模型强化学习设计空间中的关键问题,通过分解策略梯度目标、似然估计器和回放采样方案三个因素,发现基于证据下界(ELBO)的模型似然估计器是实现有效、高效和稳定强化学习优化的主要因素,优于特定策略梯度损失函数的影响。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18535 2026-05-19 cs.LG cs.MA

Beyond Scaling: Agents Are Heading to the Edge

超越扩展:智能体正走向边缘

Chunlin Tian, Dongqi Cai, Wanru Zhao, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) University of Macau(澳门大学) Nanjing University(南京大学)

AI总结 本文探讨了智能体技术发展的瓶颈从单一模型压缩世界知识转向协调系统执行,提出个人智能体架构必须转向边缘计算,以适应高保真局部环境的结构耦合和零延迟执行循环需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18332 2026-05-19 cs.SE cs.AI

Same Signal, Different Semantics: A Cross-Framework Behavioral Analysis of Software Engineering Agents

同信号,不同语义:软件工程代理跨框架行为分析

Wei Ma, Zhi Chen, Jingxu Gu, Tianling Li, Shangqing Liu, Lingxiao Jiang

机构 * Singapore Management University(新加坡国立大学) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

AI总结 本文通过大规模实验分析软件工程代理在不同框架下的行为表现,发现相同的行为信号在不同框架下可能具有相反的意义,强调了跨框架验证的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18287 2026-05-19 cs.CV cs.RO

StableVLA: Towards Robust Vision-Language-Action Models without Extra Data

StableVLA: 向无额外数据的鲁棒视觉-语言-动作模型迈进

Yiyang Fu, Chubin Zhang, Shukai Gong, Yufan Deng, Kaiwei Sun, Qiyang Min, Qibin Hou, Yansong Tang, Jianan Wang, Daquan Zhou

机构 * Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Nankai University(南开大学)

AI总结 本文研究了在未见真实世界视觉扰动下视觉-语言-动作(VLA)模型的鲁棒性问题,提出了一种基于信息理论的轻量级适配模块IB-Adapter,有效提升模型性能,同时保持高效和效果。

Comments Accepted by ICML 2026. Code: https://github.com/DAGroup-PKU/HumanNet. Project website: https://dagroup-pku.github.io/StableVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18083 2026-05-19 cs.CL

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$Δ$ Integration into Upcycled MoE

多语言大语言模型的高效路径:通过后训练PARAM$Δ$整合到再利用MoE进行语言扩展

Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学)

AI总结 本文提出了一种高效的方法,通过将密集模型转换为MoE架构,并将不同语言分配给不同专家,从而在不进行复杂对齐阶段的情况下提升多语言大语言模型的性能,同时保留原始能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17743 2026-05-19 cs.CV

MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation

MoASE++: 基于领域自适应在线蒸馏的激活稀疏专家混合模型用于持续测试时间适应

Ronyu Zhang, Aosong Cheng, Gaole Dai, Yulin Luo, Jiaming Liu, Li Du, Huanrui Yang, Dan Wang, Leyuan Fang, Yuan Du, Shanghang Zhang

机构 * Nanjing University and The Hong Kong Polytechnic University(南京大学和香港理工大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机科学学院) University of Arizona(亚利桑那大学) Hong Kong University of Science and Technology(香港科技大学) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Nanjing University(南京大学)

AI总结 本文提出MoASE++,通过结合领域自适应在线蒸馏的激活稀疏专家混合模型,解决持续测试时间适应中领域无关结构与领域特定纹理分离的问题,提升模型在动态视觉环境中的持续适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17571 2026-05-19 cs.CV cs.LG

Stable Routing for Mixture-of-Experts in Class-Incremental Learning

混合专家在类增量学习中的稳定路由

Zirui Guo, Quan Cheng, Da-Wei Zhou, Lijun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 本文研究了在类增量学习中混合专家模型的稳定路由问题,提出了一种稳定路由框架StaR-MoE,通过敏感性感知路由对齐和不对称容量正则化,提高了模型对新类别的适应能力和旧类别的知识保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03352 2026-05-19 cs.CL

PEGRL: Improving Machine Translation by Post-Editing Guided Reinforcement Learning

PEGRL: 通过后编辑引导的强化学习改进机器翻译

Yunzhi Shen, Hao Zhou, Xin Huang, Xue Han, Junlan Feng, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) China Mobile Research Beijing, China(北京中国移动研究院)

AI总结 本文提出PEGRL框架,通过后编辑作为辅助任务稳定训练并引导整体优化,提升机器翻译性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16361 2026-05-19 cs.CV

Multi-Order Matching Network for Alignment-Free Depth Super-Resolution

多阶匹配网络用于无对齐深度超分辨率

Zhengxue Wang, Zhiqiang Yan, Yuan Wu, Guangwei Gao, Xiang Li, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院PCA实验室,南京理工大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computer Science, Nankai University(南开大学计算机学院) PCA Lab, School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院PCA实验室,南京大学)

AI总结 本文提出了一种无对齐框架Multi-Order Matching Network (MOMNet),通过多阶匹配机制和多阶聚合策略,从不对齐的RGB数据中提取并选择最相关的信息,以提高深度超分辨率的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18822 2026-05-19 cs.CV

SAM 2++: Tracking Anything at Any Granularity

SAM 2++: 任意粒度下的任意目标跟踪

Jiaming Zhang, Cheng Liang, Yichun Yang, Chenkai Zeng, Yutao Cui, Xinwen Zhang, Xin Zhou, Kai Ma, Gangshan Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Tencent(腾讯) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出SAM 2++框架,通过统一的提示编码、输出解码和记忆表示设计,实现了对不同粒度的目标状态(如掩码、框和点)的统一跟踪,同时引入Tracking-Any-Granularity数据集以提升统一跟踪模型的训练和评估效果。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19189 2026-05-19 cs.LG

DyDiff: Long-Horizon Rollout via Dynamics Diffusion for Offline Reinforcement Learning

DyDiff: 通过动力学扩散实现离线强化学习中的长周期 rollout

Hanye Zhao, Xiaoshen Han, Zhengbang Zhu, Minghuan Liu, Yong Yu, De-Chuan Zhan, Weinan Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学计算机科学学院) Department of Computer Science, Nanjing University, Nanjing 210093, China(南京大学计算机科学系)

AI总结 本文提出DyDiff,一种通过动力学扩散模型实现离线强化学习中长周期轨迹生成的方法,通过迭代注入学习策略信息,解决行为策略与学习策略不一致的问题,提升长周期rollout的准确性。

Comments 18 pages, 10 figures, 9 tables. The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-52028-5}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17336 2026-05-19 cs.RO cs.CV eess.SP

Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms

基于触觉的多模态融合在具身智能中的应用:视觉、语言和接触驱动范式的综述

Zhixiang Cao, Di Tian, Runwei Guan, Yanzhou Mu, Xiaolou Sun, Shaofeng Liang, Daizong Liu, Tao Huang, Yutao Yue, Henghui Ding, Bin Fang, Alex Zhou, Qing-Long Han, Hui Xiong

机构 * School of Electronic Science and Engineering, Xi’an Jiaotong University, China(西安交通大学电子科学与技术学院) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) Purple Mountain Laboratory, China(紫金山实验室) Institute for Math & AI, Wuhan University, China(武汉大学数学与人工智能学院) Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University, Australia(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Institute of Big Data, Fudan University, China(复旦大学大数据研究院) Linkerbot (Beijing) Technology Co., Ltd, China(北京链动科技有限公司) School of Engineering, Swinburne University of Technology, Melbourne(斯威本技术大学工程学院)

AI总结 本文综述了多模态触觉融合在具身智能中的研究,探讨了如何通过整合视觉、语言和触觉信息来提升物理交互与语义推理的结合,提出了一种分层的分类体系,并总结了当前的研究挑战和未来方向。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17295 2026-05-19 cs.LG cs.CL

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA: 分布匹配强化学习中的离线重要性采样

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。

Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16909 2026-05-19 cs.AI

TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

TOBench:面向真实世界工具使用代理的任务导向多模态基准

Zhiqiang Liu, Wenhui Dong, Yilang Tan, Yuwen Qu, Haochen Yin, Chenyang Si

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) Southwest Jiaotong University(西南交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出TOBench,一个面向真实世界工具使用代理的多模态基准,通过闭环多模态验证设计,评估和推动下一代多模态工具使用代理的发展。

Comments Github: https://github.com/Pi3AI/TOBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16893 2026-05-19 cs.AI

NGM: A Plug-and-Play Training-Free Memory Module for LLMs

NGM: 一种无需训练的插拔式内存模块用于大语言模型

Yuwen Qu, Wenhui Dong, Chenyang Si, Caifeng Shan

机构 * Nanjing University(南京大学)

AI总结 本文提出NGM,一种无需训练的插拔式内存模块,通过因果n-gram编码器和余弦门控内存注入器,实现高效的知识检索,提升大语言模型在代码生成和知识密集型任务中的性能。

Comments Code is available at https://github.com/PioneerQyw/NGM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16842 2026-05-19 cs.AI

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

草图然后绘画:用于扩散多模态大语言模型的分层强化学习

Siqi Luo, Jianghan Shen, Yi Xin, Huayu Zheng, Haoxing Chen, Yan Tai, Yue Li, Junjun He, Yihao Liu, Guangtao Zhai, Yuewen Cao, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

AI总结 本文提出了一种分层强化学习方法HT-GRPO,通过Sketch-Then-Paint训练方案和分层信用分配机制,解决扩散多模态大语言模型在强化学习优化中的关键问题,提升图像质量和审美效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12766 2026-05-19 cs.CL

NaviRAG: Towards Active Knowledge Navigation for Retrieval-Augmented Generation

NaviRAG:迈向检索增强生成的主动知识导航

Jihao Dai, Dingjun Wu, Yuxuan Chen, Zheni Zeng, Yukun Yan, Zhenghao Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Northeastern University(东北大学)

AI总结 NaviRAG通过主动知识导航框架提升检索增强生成的复杂任务处理能力,通过分层知识组织和动态信息检索提高检索准确率和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16423 2026-05-19 cs.CV

Nonlinear Bipolar Compensation: Handling Outliers in Post-Training Quantization

非线性双极补偿:处理训练后量化中的异常值

Peilin Sun, Jianxin Wu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

AI总结 本文提出非线性双极补偿方法,通过引入非线性补偿减少异常值影响,设计双极对数变换压缩异常值,提升训练后量化的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16081 2026-05-18 cs.LG cs.CV

MIND: Decoupling Model-Induced Label Noise via Latent Manifold Disentanglement

MIND: 通过潜在流形解耦模型诱导标签噪声

Dayong Ren

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京210023,中国)

AI总结 MIND通过潜在流形解耦技术解决模型诱导标签噪声问题,通过动态投影样本到潜在结构聚类,提升噪声识别能力,验证了其在复杂基准测试中的优越性。

Comments Accepted, to appear in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15908 2026-05-18 cs.CV cs.AI

RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations

RaPD:通过语义增强的隐式表示实现分辨率无关的像素扩散

Yanhao Ge, Shanyan Guan, Weihao Wang, Ying Tai, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) Nanjing University(南京大学)

AI总结 RaPD通过语义表示引导和坐标查询注意力渲染器,在连续神经图像场的潜在空间中实现分辨率无关的像素扩散,解决了重建与生成之间的差距,提升了生成质量和分辨率扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15855 2026-05-18 cs.CV

Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

少即是多:我们是否需要为扩散模型的强化学习微调进行每一步优化?

Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai

机构 * Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 本文研究了扩散模型强化学习微调中优化步骤的影响,提出AdaScope方法通过动态控制训练时机提升生成质量并降低计算成本。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15533 2026-05-18 cs.CV cs.AI

Tuning-free Instruction-based Video Editing Via Structural Noise Initialization and Guidance

无需调优的指令式视频编辑:通过结构噪声初始化和引导

Song Wu, Xinyu Chen, Qian Wang, Liang Li, Zili Yi, Junlan Feng

机构 * JIUTIAN Research, China Mobile(中国移动极天研究院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

AI总结 本文提出无需调优的指令式视频编辑框架,通过结构噪声初始化策略和噪声引导机制,提升视频编辑的视觉质量和性能。

Comments Accepted by ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15412 2026-05-18 cs.CE cs.AI cs.CL

From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery

从反馈循环到政策更新:基于强化微调的LLM驱动的alpha因子发现

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Zixuan Xie, Chiming Duan, Minghua He, Philip S. Yu, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

AI总结 本文提出QuantEvolver框架,通过强化微调将可执行量化评估转化为策略更新,提升LLM在alpha因子发现中的表现,生成高质量且互补的因子池。

详情

展开后加载摘要…

URL PDF HTML 收藏