arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-06-05 至 2026-06-05 共收录 8
2606.06357 2026-06-05 cs.SD cs.AI eess.AS

F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

F3-Tokenizer: 驯服音频自编码器潜在变量以支持理解与生成

Dinghao Zhou, Xingchen Song, Di Wu, Pengyu Cheng, Shengfan Shen, Sixiang Lv

机构 * Nanjing University, China(南京大学) WeNet Open Source Community(WeNet开源社区)

AI总结 针对连续音频自编码器潜在变量结构弱、自监督编码器不可解码的问题,提出F3-Tokenizer,通过噪声正则化自编码器瓶颈和潜在侧表示编码器,实现统一的理解与生成音频分词器。

Comments Technical report; early work; 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06109 2026-06-05 cs.CL cs.AI

Harnessing Structural Context for Entity Alignment Foundation Models

利用结构上下文进行实体对齐基础模型

Xingyu Chen, Yuanning Cui, Zequn Sun, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) Nanjing University of Information Science and Technology, Nanjing, China(南京信息科学技术大学) National Institute of Healthcare Data Science, Nanjing University, Nanjing, China(南京大学健康数据科学国家研究院)

AI总结 提出ContextEA框架,通过交叉KG交互编码器和结构校准解码器增强结构上下文的构建与利用,在29个数据集上超越强基线,实现更强的跨KG迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06090 2026-06-05 cs.AI

Beyond Semantic Organization: Memory as Execution State Management for Long-Horizon Agents

超越语义组织:记忆作为长时程智能体的执行状态管理

Yaoqi Chen, Haibin Lai, Yuru Feng, Chuyu Han, Qianxi Zhang, Baotong Lu, Menghao Li, Xinjiang Wang, Zhirui Wang, Shusen Xu, Zengzhong Li, Zewen Jin, Hao Wu, Cheng Li, Qi Chen

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft(微软) Nanjing University(南京大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 针对长时程任务中智能体依赖执行状态而非语义相似性的问题,提出MAGE(记忆作为智能体引导的探索),通过层次状态树管理交互,实现状态完整性和错误隔离,在MemoryArena上任务成功率提升7.8-20.4个百分点,token消耗降低55.1%。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05927 2026-06-05 cs.LG

Addressing Imbalance in Multi-Label Data via Label-Specific Distance-based Oversampling

通过标签特定距离的过采样解决多标签数据中的不平衡问题

Bin Liu, Jun Wu, Haoyu Peng, Ao Zhou, Jin Wang, QiaoSong Chen, Grigorios Tsoumakas

机构 * Key Laboratory of Data Engineering and Visual Computing, Chongqing University of Posts and Telecommunications, China(数据工程与视觉计算重点实验室,重庆邮电大学,中国) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, China(计算机科学与技术学院,重庆邮电大学,中国) State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Informatics, Aristotle University of Thessaloniki, Greece(信息学院,希腊阿尔蒂米斯大学)

AI总结 针对多标签分类中的标签不平衡问题,提出基于标签特定距离的过采样方法LSDMLO,通过加权相关特征空间识别标签一致邻居,生成更有效的合成实例,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05769 2026-06-05 cs.CV

Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

在预测之前想象:用于视频事件预测的交错潜在视觉推理

Tianxiang Jiang, Linquan Wu, Sheng Xia, Songze Li, Ziang Yan, Haoyu Yang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) Nanjing University(南京大学) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出Future-L1框架,通过交错潜在视觉推理在自回归解码中交替语言token和连续潜在视觉跨度,结合LA-DAPO强化学习优化,在视频事件预测任务上取得最先进结果。

Comments https://github.com/OpenGVLab/Future-L1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05718 2026-06-05 cs.CV cs.AI cs.LG

ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation

ViCuR: 视觉线索作为多模态在策略蒸馏中的可恢复特权

Kanghui Tian, Siyuan Liu, Ziang Yan, Sheng Xia, Shuai Dong, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 提出ViCuR框架,通过将教师特权从答案侧替换为输入中的视觉线索,并引入轻量级线索恢复模块,解决多模态在策略蒸馏中的训练-测试不匹配问题,在七个基准上显著提升学生模型性能。

Comments 25 pages, 11 figures. Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04733 2026-06-05 cs.AI

Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing

面向沉浸式视频角色扮演的奖励分解强化学习

Miao Wang, Yuling Shi, Yijiang Li, Yeheng Chen, Xiaodong Gu, Bin Li, Bo Gao, Jun Wang, Zengxin Han, Jingtong Wu, Yaduan Ruan

机构 * Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Information Engineering, Beijing Institute of Graphic Communication(北京印刷学院信息工程学院) Ant International, Ant Group(蚂蚁集团国际部) Independent Researcher(独立研究者)

AI总结 提出EBM-RL框架,通过奖励分解的强化学习优化视频角色扮演中的视觉感知、推理与生成过程,提升场景一致性与角色真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20263 2026-06-05 cs.CV

Hierarchical Mask-Enhanced Dual Reconstruction Network for Few-Shot Fine-Grained Image Classification

层次化掩码增强双重建网络用于少样本细粒度图像分类

Ning Luo, Meiyin Hu, Huan Wan, Yanyan Yang, Zhuohang Jiang, Xin Wei

机构 * Nanjing University(南京大学)

AI总结 本文提出层次化掩码增强双重建网络(HMDRN),通过双层特征重建与掩码增强特征处理,解决少样本细粒度图像分类中区分视觉相似子类的问题,实验显示其在三种细粒度数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏