arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Nanjing University(南京大学)

2026-03-31 至 2026-03-31 共收录 11
2603.28740 2026-03-31 cs.RO

FocusVLA: Focused Visual Utilization for Vision-Language-Action Models

FocusVLA: 用于视觉-语言-动作模型的聚焦视觉利用

Yichi Zhang, Weihao Yuan, Yizhuo Zhang, Xidong Zhang, Jia Wan

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) DaiMon Robotics, China(戴蒙机器人公司) Nanjing University, Nanjing, China(南京大学) Renmin University of China, Beijing, China(中国人民大学)

AI总结 本文提出FocusVLA,通过聚焦任务相关视觉区域提升视觉-语言-动作模型的性能,解决视觉信息利用不足的问题。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28581 2026-03-31 cs.RO

A Self-Rotating Tri-Rotor UAV for Field of View Expansion and Autonomous Flight

一种用于视野扩展和自主飞行的自旋转三旋翼无人机

Xiaobin Zhou, Zihao Zheng, Aoxu Jin, Lei Qiang, Bo Zhu

机构 * School of Robotics and Automation, Nanjing University(南京大学机器人学院)

AI总结 本文提出SPINNER无人机,通过持续旋转扩大摄像头和激光雷达的视野,提升环境感知效率,并实现三维定位和姿态控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28088 2026-03-31 cs.CV

GEMS: Agent-Native Multimodal Generation with Memory and Skills

GEMS:基于记忆与技能的代理原生多模态生成

Zefeng He, Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Yu Cheng, Yang Yang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) CUHK(香港中文大学)

AI总结 GEMS通过引入代理循环、记忆和技能组件,提升多模态生成在复杂指令和专业任务中的性能,使轻量级模型在GenEval2中超越现有最佳模型。

Comments Project Page: https://gems-gen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01499 2026-03-31 cs.CR cs.AI

Towards Privacy-Preserving LLM Inference via Covariant Obfuscation (Technical Report)

通过协变混淆实现隐私保护的大语言模型推断(技术报告)

Yu Lin, Qizhi Zhang, Wenqiang Ruan, Daode Zhang, Jue Hong, Ye Wu, Hanning Xia, Yunlong Mao, Sheng Zhong

机构 * ByteDance(字节跳动) Nanjing University(南京大学)

AI总结 本文提出AloePri,首个适用于工业应用的隐私保护大语言模型推断方法,通过协变混淆同时保护输入输出数据,实现高准确性和隐私性,兼容现有基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01342 2026-03-31 cs.CV

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next:无需视频-文本监督的通用视频基础模型

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11524 2026-03-31 cs.AI

Inspire or Predict? Exploring New Paradigms in Assisting Classical Planners with Large Language Models

激励还是预测?探索利用大语言模型辅助经典规划器的新范式

Wenkai Yu, Jianhang Tang, Yang Zhang, Yixiong Feng, Celimuge Wu, Kebing Jin, Hankz Hankui Zhuo

机构 * State Key Laboratory of Public Big Data, Guizhou University(贵州大学公共大数据国家重点实验室) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Mechanical Engineering, Guizhou University(贵州大学机械工程学院) Meta-Networking Research Center, The University of Electro-Communications(电气通信大学元网络研究中心) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 本文提出一种集成问题分解的新型LLM辅助规划器,通过LLM4Inspire和LLM4Predict两种范式,结合通用知识和领域知识,有效解决大规模规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27185 2026-03-31 cs.CV

MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation

MotionRFT: 用于文本到动作生成的统一强化微调

Xiaofeng Tan, Wanjiang Weng, Hongsong Wang, Fang Zhao, Xin Geng, Liang Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) State Key Laboratory for Novel Software Technology, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院计算机软件新技术国家重点实验室) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所多模态人工智能系统国家重点实验室模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出MotionRFT框架,通过多维奖励模型和高效微调方法,解决文本到动作生成中语义一致性、现实感和人类偏好对齐的问题,实验表明其在FID和R-Precision上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05970 2026-03-31 cs.CV

OmniStyle2: Learning to Stylize by Learning to Destylize

OmniStyle2:通过学习去风格化来学习风格化

Ye Wang, Zili Yi, Yibo Zhang, Peng Zheng, Xuping Xie, Jiang Lin, Yijun Li, Yilin Wang, Rui Ma

机构 * Jilin University(吉林大学) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Adobe Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(中国教育部知识驱动人机智能工程研究中心)

AI总结 OmniStyle2通过逆向学习去风格化来提升风格化质量,提出DeStylePipe框架与DestyleCoT-Filter模块,构建DeStyle-350K数据集并设计BCS-Bench基准,验证去风格化作为可靠监督范式。

Comments Our project page: https://wangyephd.github.io/projects/DeStyle/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26866 2026-03-31 cs.CV cs.AI

LACON: Training Text-to-Image Model from Uncurated Data

LACON:从未整理数据中训练文本到图像模型

Zhiyang Liang, Ziyu Wan, Hongyu Liu, Dong Chen, Qiu Shen, Hao Zhu, Dongdong Chen

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) HKUST(香港科技大学)

AI总结 LACON通过利用未整理数据分布,将质量信号作为条件标签,提升生成质量,证明了未整理数据的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26767 2026-03-31 cs.CV

A training-free framework for high-fidelity appearance transfer via diffusion transformers

无需训练的高保真外观迁移框架:通过扩散变换器

Shengrong Gu, Ye Wang, Song Wu, Rui Ma, Qian Wang, Lanjun Wang, Zili Yi

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of New Media and Communication, Tianjin University(天津大学新媒体与传播学院) JIUTIAN Research(九天研究院) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

AI总结 本文提出无需训练的扩散变换器框架,通过解耦结构与外观,利用高保真倒置建立内容先验,结合几何先验实现参考图像的动态融合,从而在结构保持和外观保真度上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏