arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2604.01590 2026-04-07 eess.AS cs.SD

PhiNet: Speaker Verification with Phonetic Interpretability

PhiNet:具有语音可解释性的说话人验证

Yi Ma, Shuai Wang, Tianchi Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) LIGHTSPEED Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong(香港中文大学(深圳)深圳市大数据研究院)

AI总结 PhiNet通过利用语音证据提升局部和全局可解释性,为说话人验证提供详细的语音级比较,帮助用户手动检查特征并评估验证结果,同时为开发者提供决策理由,简化错误追踪和超参数选择。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing. Codes: https://github.com/mmmmayi/PhiNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22553 2026-04-07 cs.CV

Bringing Your Portrait to 3D Presence

将您的肖像带入3D存在

Jiawei Zhang, Lei Chu, Jiahao Li, Zhenyu Zang, Chong Li, Xiao Li, Xun Cao, Hao Zhu, Yan Lu

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出统一框架,从单张肖像重建可动画的3D人体虚拟角色,解决姿态和构图敏感的特征表示、数据有限性和代理网格估计不可靠的问题。

Comments project page: https://zjwfufu.github.io/HuaPi-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03074 2026-04-06 eess.AS cs.CL cs.SD

Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR

Speaker-Reasoner: 通过扩展交互轮次和推理模式实现时间戳化的说话者归属ASR

Zhennan Lin, Shuai Wang, Zhaokai Sun, Pengyuan Xie, Chuan Xie, Jie Liu, Qiang Zhang, Lei Xie

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Shanghai Lingguang Zhaxian Technology(上海灵光乍现科技)

AI总结 本文提出Speaker-Reasoner,一种端到端的语音大语言模型,通过迭代分析音频结构和自主预测时间边界,提升了多说话人对话的转录和理解能力,尤其在处理重叠语音和复杂轮次转换方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02799 2026-04-06 cs.CV

UNICA: A Unified Neural Framework for Controllable 3D Avatars

UNICA:一种统一的神经框架用于可控的3D人形 avatars

Jiahe Zhu, Xinyao Wang, Yiyu Zhuang, Yanwen Wang, Jing Tian, Yao Yao, Hao Zhu

机构 * Nanjing University(南京大学) State Key Laboratory of Novel Software Technology(计算机软件新技术国家重点实验室)

AI总结 UNICA通过动作条件扩散模型和点转换器生成可控的3D人形,实现无需骨骼的统一生成框架,支持自由视角渲染和动态衣物处理。

Comments Opensource code: https://github.com/zjh21/UNICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02765 2026-04-06 cs.LG

Towards Realistic Class-Incremental Learning with Free-Flow Increments

迈向自由流类增量学习的现实性

Zhiming Xu, Baile Xu, Jian Zhao, Furao Shen, Suorong Yang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Department of Computer Science and Technology, Nanjing University, China(南京大学计算机科学与技术系) School of Electronic Science and Engineering, Nanjing University, China(南京大学电子科学与工程学院)

AI总结 本文提出自由流类增量学习(FFCIL)框架,通过类均值目标和方法调整提升鲁棒性,解决现实场景中类增量学习的挑战。

Comments 15pages, 5figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02734 2026-04-06 cs.AI

Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents

对齐进展与可行性:一种神经符号双记忆框架用于长周期LLM智能体

Bin Wen, Ruoxuan Zhang, Yang Chen, Hongxia Xie, Lan-Zhe Guo

机构 * Nanjing University(南京大学) Jilin University(吉林大学)

AI总结 本文提出神经符号双记忆框架,通过分离语义进展指导与逻辑可行性验证,解决长周期任务中进展漂移与可行性违反问题,实验显示在ALFWorld、WebShop和TextCraft上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19798 2026-04-06 cs.SD cs.CL eess.AS

Borderless Long Speech Synthesis

无边界的长语音合成

Xingchen Song, Di Wu, Dinghao Zhou, Pengyu Cheng, Hongwu Ding, Yunchao He, Jie Wang, Shengfan Shen, Sixiang Lv, Lichun Fan, Hang Su, Yifeng Wang, Shuai Wang, Meng Meng, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., China(小米公司MiLM Plus,中国) Nanjing University, China(南京大学,中国) WeNet Open Source Community(WeNet开源社区)

AI总结 本文提出无边界的长语音合成框架,通过统一能力集实现多说话人合成和长文本生成,采用全局-句子-token注释策略和连续分词器提升指令遵循能力,构建分层控制协议栈实现多模态输入到结构化生成命令的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03127 2026-04-06 cs.CV cs.AI

Unified Thinker: A General Reasoning Modular Core for Image Generation

统一思考者:一种通用图像生成的推理模块核心

Sashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang, Yue Cao, Junpeng Ma, Yinchao Ma, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) Fudan University(复旦大学)

AI总结 本文提出统一思考者,一种通用图像生成的推理模块核心,旨在通过可执行推理解决生成模型中的推理-执行差距,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00290 2026-04-06 cs.AI cs.MA

ClinicalReTrial: Clinical Trial Redesign with Self-Evolving Agents

临床试验重设计:具有自进化代理的临床试验重设计

Sixue Xing, Kerui Wu, Xuanye Xia, Meng Jiang, Jintai Chen, Tianfan Fu

机构 * University of Notre Dame(圣母大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学)

AI总结 本文提出ClinicalReTrial系统,通过自进化代理对临床试验协议进行迭代重设计,提升成功率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03537 2026-04-06 cs.LG stat.ML

Pushing the Limits of Distillation-Based Continual Learning via Classifier-Proximal Lightweight Plugins

通过分类器近邻轻量插件推动基于蒸馏的持续学习的极限

Zhiming Xu, Baile Xu, Jian Zhao, Furao Shen, Suorong Yang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Department of Computer Science and Technology, Nanjing University, China(南京大学计算机科学与技术系) School of Electronic Science and Engineering, Nanjing University, China(南京大学电子科学与工程学院)

AI总结 本文提出DLC插件方法,通过轻量残差插件提升分类准确率,同时减少对特征提取过程的干扰,实现8%的精度提升和4%的参数增加。

Comments 10 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02318 2026-04-03 cs.RO cs.CV

Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning

停止游荡:通过元认知推理实现高效的视觉-语言导航

Xueying Li, Feng Lyu, Hao Wu, Mingliu Liu, Jia-Nan Liu, Guozi Liu

机构 * Central South University(中南大学) Nanjing University(南京大学) State Grid Hubei Electric Power Research Institute(国网湖北省电力有限公司电力科学研究院) Dongguan University of Technology(东莞理工学院)

AI总结 本文提出MetaNav,通过整合空间记忆、历史感知规划和反思修正,提升视觉-语言导航的效率与鲁棒性,实验显示其在多个基准上表现优异,减少了20.7%的VLM查询。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02090 2026-04-03 cs.CV

Center-Aware Detection with Swin-based Co-DETR Framework for Cervical Cytology

基于Swin的Co-DETR框架的宫颈涂片中心感知检测

Yan Kong, Yuan Yin, Hongan Chen, Yuqi Fang, Caifeng Shan

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Biomedical Engineering, ShanghaiTech University(上海科技大学生物医学工程学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

AI总结 本文提出基于Swin的Co-DETR框架,通过中心点预测解决宫颈涂片图像中密集细胞分布问题,提升检测性能。

Comments ISBI 2026 Accepted Paper & Winning Solution for the RIVA Cervical Cytology Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13936 2026-04-03 cs.MA cs.LG

Robust Multi-agent Communication via Multi-view Message Certification

通过多视角信息认证实现鲁棒的多智能体通信

Lei Yuan, Tao Jiang, Lihe Li, Feng Chen, Zongzhang Zhang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

AI总结 本文提出CroMAC方法,通过多视角信息认证学习鲁棒的多智能体通信策略,为受扰消息环境下的最优动作选择提供保证。

Journal ref Science China Information Sciences, Vol. 67, Iss. 4, Article 142102, pp. 1-15, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00442 2026-04-02 cs.AI cs.CL

Execution-Verified Reinforcement Learning for Optimization Modeling

可验证执行的强化学习用于优化建模

Runda Guan, Xiangqing Shen, Jiajun Zhang, Yifan Zhang, Jian Cheng, Rui Xia

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出EVOM框架,通过将数学规划求解器作为确定性验证器,利用强化学习生成并执行求解代码,实现高效的优化建模。实验表明EVOM在多个数据集上表现优异,支持零样本求解器迁移和低成本适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00422 2026-04-02 cs.SE cs.LG

Shapley-Guided Neural Repair Approach via Derivative-Free Optimization

基于Shapley的神经修复方法通过无导数优化

Xinyu Sun, Wanwei Liu, Haoang Chi, Tingyu Chen, Xiaoguang Mao, Shangwen Wang, Lei Bu, Jingyi Wang, Yang Tan, Zhenyi Qi

机构 * National University of Defense Technology(国防科技大学) Nanjing University(南京大学) Zhejiang University(浙江大学)

AI总结 本文提出SHARPEN方法,结合可解释故障定位与无导数优化策略,有效修复深度神经网络的缺陷,提升鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10030 2026-04-02 cs.MA cs.LG

Multi-agent In-context Coordination via Decentralized Memory Retrieval

通过去中心化记忆检索实现多智能体上下文协调

Tao Jiang, Zichuan Lin, Lihe Li, Yi-Chen Li, Cong Guan, Lei Yuan, Zongzhang Zhang, Yang Yu, Deheng Ye

机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Tencent(腾讯)

AI总结 本文提出MAICC方法,通过去中心化记忆检索提升多智能体强化学习中任务协调效率,实验表明其在Level-Based Foraging和SMAC等基准上表现更优。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 40, No. 27, pp. 22363-22371, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00512 2026-04-02 q-bio.MN cs.AI cs.LG

Adaptive Data-Knowledge Alignment in Genetic Perturbation Prediction

适应性数据-知识对齐在基因扰动预测中的应用

Yuanfang Xiang, Lun Ai

机构 * Nanjing University(南京大学) EMBL-EBI(欧洲生物信息学研究所)

AI总结 本文提出ALIGNED框架,通过整合数据驱动学习与现有知识,解决基因扰动预测中数据与知识不一致的问题,提升预测一致性与生物知识重构能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30038 2026-04-01 cs.CV

Benchmarking PhD-Level Coding in 3D Geometric Computer Vision

在3D几何计算机视觉中评估博士级别的编程能力

Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao

机构 * AIR, Tsinghua University(清华大学智能产业研究院) Qiuzhen College, Tsinghua University(清华大学求真书院) BAAI(北京智源人工智能研究院) Peking University(北京大学) Nanjing University(南京大学) University of Toronto(多伦多大学)

AI总结 本文提出GeoCodeBench基准,用于评估3D视觉编程能力。通过精选论文中的任务,生成多样化的测试用例,评估八种模型的性能,揭示当前模型在可靠3D科学编程方面的差距。

Comments Accepted by CVPR 2026; Project page: https://geocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29292 2026-04-01 cs.SE cs.AI cs.PL

Self-Improving Code Generation via Semantic Entropy and Behavioral Consensus

通过语义熵和行为共识的自我改进代码生成

Huan Zhang, Wei Cheng, Wei Hu

机构 * Nanjing University(南京大学)

AI总结 本文提出ConSelf方法,利用语义熵构建课程和共识驱动优化,无需外部监督提升代码生成能力。

Comments Accepted in the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00818 2026-04-01 cs.AI cs.CV

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28740 2026-03-31 cs.RO

FocusVLA: Focused Visual Utilization for Vision-Language-Action Models

FocusVLA: 用于视觉-语言-动作模型的聚焦视觉利用

Yichi Zhang, Weihao Yuan, Yizhuo Zhang, Xidong Zhang, Jia Wan

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) DaiMon Robotics, China(戴蒙机器人公司) Nanjing University, Nanjing, China(南京大学) Renmin University of China, Beijing, China(中国人民大学)

AI总结 本文提出FocusVLA,通过聚焦任务相关视觉区域提升视觉-语言-动作模型的性能,解决视觉信息利用不足的问题。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28581 2026-03-31 cs.RO

A Self-Rotating Tri-Rotor UAV for Field of View Expansion and Autonomous Flight

一种用于视野扩展和自主飞行的自旋转三旋翼无人机

Xiaobin Zhou, Zihao Zheng, Aoxu Jin, Lei Qiang, Bo Zhu

机构 * School of Robotics and Automation, Nanjing University(南京大学机器人学院)

AI总结 本文提出SPINNER无人机,通过持续旋转扩大摄像头和激光雷达的视野,提升环境感知效率,并实现三维定位和姿态控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28088 2026-03-31 cs.CV

GEMS: Agent-Native Multimodal Generation with Memory and Skills

GEMS:基于记忆与技能的代理原生多模态生成

Zefeng He, Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Yu Cheng, Yang Yang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) CUHK(香港中文大学)

AI总结 GEMS通过引入代理循环、记忆和技能组件,提升多模态生成在复杂指令和专业任务中的性能,使轻量级模型在GenEval2中超越现有最佳模型。

Comments Project Page: https://gems-gen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01499 2026-03-31 cs.CR cs.AI

Towards Privacy-Preserving LLM Inference via Covariant Obfuscation (Technical Report)

通过协变混淆实现隐私保护的大语言模型推断(技术报告)

Yu Lin, Qizhi Zhang, Wenqiang Ruan, Daode Zhang, Jue Hong, Ye Wu, Hanning Xia, Yunlong Mao, Sheng Zhong

机构 * ByteDance(字节跳动) Nanjing University(南京大学)

AI总结 本文提出AloePri,首个适用于工业应用的隐私保护大语言模型推断方法,通过协变混淆同时保护输入输出数据,实现高准确性和隐私性,兼容现有基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01342 2026-03-31 cs.CV

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next:无需视频-文本监督的通用视频基础模型

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11524 2026-03-31 cs.AI

Inspire or Predict? Exploring New Paradigms in Assisting Classical Planners with Large Language Models

激励还是预测?探索利用大语言模型辅助经典规划器的新范式

Wenkai Yu, Jianhang Tang, Yang Zhang, Yixiong Feng, Celimuge Wu, Kebing Jin, Hankz Hankui Zhuo

机构 * State Key Laboratory of Public Big Data, Guizhou University(贵州大学公共大数据国家重点实验室) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Mechanical Engineering, Guizhou University(贵州大学机械工程学院) Meta-Networking Research Center, The University of Electro-Communications(电气通信大学元网络研究中心) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 本文提出一种集成问题分解的新型LLM辅助规划器,通过LLM4Inspire和LLM4Predict两种范式,结合通用知识和领域知识,有效解决大规模规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27185 2026-03-31 cs.CV

MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation

MotionRFT: 用于文本到动作生成的统一强化微调

Xiaofeng Tan, Wanjiang Weng, Hongsong Wang, Fang Zhao, Xin Geng, Liang Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) State Key Laboratory for Novel Software Technology, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院计算机软件新技术国家重点实验室) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所多模态人工智能系统国家重点实验室模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出MotionRFT框架,通过多维奖励模型和高效微调方法,解决文本到动作生成中语义一致性、现实感和人类偏好对齐的问题,实验表明其在FID和R-Precision上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05970 2026-03-31 cs.CV

OmniStyle2: Learning to Stylize by Learning to Destylize

OmniStyle2:通过学习去风格化来学习风格化

Ye Wang, Zili Yi, Yibo Zhang, Peng Zheng, Xuping Xie, Jiang Lin, Yijun Li, Yilin Wang, Rui Ma

机构 * Jilin University(吉林大学) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Adobe Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(中国教育部知识驱动人机智能工程研究中心)

AI总结 OmniStyle2通过逆向学习去风格化来提升风格化质量,提出DeStylePipe框架与DestyleCoT-Filter模块,构建DeStyle-350K数据集并设计BCS-Bench基准,验证去风格化作为可靠监督范式。

Comments Our project page: https://wangyephd.github.io/projects/DeStyle/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26866 2026-03-31 cs.CV cs.AI

LACON: Training Text-to-Image Model from Uncurated Data

LACON:从未整理数据中训练文本到图像模型

Zhiyang Liang, Ziyu Wan, Hongyu Liu, Dong Chen, Qiu Shen, Hao Zhu, Dongdong Chen

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) HKUST(香港科技大学)

AI总结 LACON通过利用未整理数据分布,将质量信号作为条件标签,提升生成质量,证明了未整理数据的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏