arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-05-14 至 2026-05-14 共收录 9
2605.13835 2026-05-14 cs.CV

Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning

解锁基于CLIP的类增量学习中的补丁级特征

Hao Sun, Zi-Jun Ding, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

AI总结 本文提出SPA方法,通过利用CLIP的补丁级语义信息提升类增量学习性能,通过生成类级语义描述引导补丁特征选择,并利用最优传输对齐语义特征,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13778 2026-05-14 cs.RO cs.CV

Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs

实时-VLA FLASH:基于扩散模型的视觉-语言-动作模型的推测推理框架

Jiahui Niu, Kefan Gu, Yucheng Zhao, Shengwen Liang, Tiancai Wang, Xing Hu, Ying Wang, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学) Dexmal

AI总结 本文提出实时-VLA FLASH框架,通过轻量级草案模型和主模型的Action Expert并行验证,实现低延迟高频率重规划,实验显示在LIBERO上任务性能保持良好,推理延迟降低至19.1ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13457 2026-05-14 cs.CV

OP4KSR: One-Step Patch-Free 4K Super-Resolution with Periodic Artifact Suppression

OP4KSR:一种一步式无补丁4K超分辨率方法,具有周期性伪影抑制

Chengyan Deng, Pengbin Yu, Zhentao Chen, Wei Shen, Kai Zhang, Meng Li, Lunxi Yuan, Xue Zhou, Li Yu

机构 * School of Automation Engineering, University of Electronic Science and Technology of China(电子科技大学自动化工程学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

AI总结 OP4KSR提出一种基于Flux架构的一步式4K超分辨率方法,利用F16 VAE压缩降低内存消耗,同时通过RoPE基频重缩放和周期性损失抑制伪影,实现高效且高质量的4K超分辨率生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13375 2026-05-14 cs.CV cs.AI

GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models

GRIP-VLM:基于组相对重要性的高效视觉-语言模型压缩

Mingzhe Huang, Weijun Wang, Xin Ding, Liang Mi, Hao Wen, Yuanchun Li, Lichen Pang, Shansong Yang, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Juhaokan Technology Co.,Ltd(极皓科技有限公司) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 GRIP-VLM通过强化学习框架解决视觉语言模型中大规模视觉token处理的计算瓶颈,通过组相对重要性策略优化实现高效压缩,达到15%的推理加速。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04804 2026-05-14 cs.CL

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

OmniSIFT: 多模态非对称令牌压缩用于高效的多模态大语言模型

Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xinlong Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, Yuanxing Zhang, Jiaheng Liu, Qiang Liu, Pengfei Wan, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR)、自动化研究所、中国科学院(CASIA)) Nanjing University(南京大学) The Hong Kong University of Science(香港科学大学) Sichuan University(四川大学) Peking University(北京大学)

AI总结 OmniSIFT通过非对称令牌压缩框架提升多模态大语言模型效率,采用时空视频修剪和视觉引导音频选择模块,实现低参数高鲁棒性。

Comments [ICML 2026] Code Link: https://github.com/dingyue772/OmniSIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13229 2026-05-14 cs.AI cs.SE

Improving Code Translation with Syntax-Guided and Semantic-aware Preference Optimization

通过语法引导和语义感知的偏好优化改进代码翻译

Yuhan Wu, Huan Zhang, Wei Cheng, Chen Shen, Jingyue Yang, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University, China(南京大学健康数据科学国家研究院)

AI总结 本文提出CTO方法,通过对比学习训练跨语言语义模型,结合编译器反馈实现代码翻译的语法和语义优化,实验表明其在C++、Java和Python翻译中表现优异。

Comments Accepted in the 35th International Joint Conference on Artificial Intelligence (IJCAI 2016)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12691 2026-05-14 cs.AI

On the Size Complexity and Decidability of First-Order Progression

关于一阶推进的大小复杂性与可判定性

Jens Classen, Daxin Liu

机构 * Department of People and Technology, Roskilde University, Denmark(罗斯基尔德大学人机技术系,丹麦) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)

AI总结 本文研究了一阶推进在局部效应、正常和无环动作类中的大小复杂性,证明其在合理假设下仅呈多项式增长,并展示在可判定片段中推进保持可判定性。

Comments This is an extended version of an identically-titled paper accepted for publication at IJCAI 2026. This version contains an appendix with further proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10819 2026-05-14 cs.RO cs.AI cs.CV

ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models

ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型

Zuojin Tang, Haoyun Liu, Xinyuan Chang, Changjie Wu, Dongjie Huo, Yandan Yang, Bin Liu, Zhejia Cai, Feng Xiong, Mu Xu, jiachen Luo, De Ma, Zhiheng Ma, Gang Pan

机构 * Zhejiang University(浙江大学) Amap, Alibaba Group(阿里集团阿地图) Nanjing University(南京大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Beijing University of Chemical Technology(北京化工大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) Tsinghua University(清华大学) Queen Mary University of London(伦敦大学玛丽女王学院)

AI总结 ALAM通过代数一致的潜在动作模型从无标注视频中提取结构化先验,结合流匹配目标提升VLA学习性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07433 2026-05-14 cs.LG cs.CV

Data Agent: Learning to Select Data via End-to-End Dynamic Optimization

数据代理:通过端到端动态优化学习数据选择

Suorong Yang, Fangjian Su, Hai Gan, Ziqi Ye, Jie Li, Baile Xu, Furao Shen, Soujanya Poria

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出数据代理框架,通过端到端动态优化解决数据选择问题,提升训练效率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏