arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-07-07 至 2026-07-07 共收录 11
2607.04224 2026-07-07 eess.SP cs.LG 新提交

AI-RAN on NPUs: Baseband Processing Without Baseband Chips

基于NPU的AI-RAN:无需基带芯片的基带处理

Shilong Zhang, Luping Xiang, Jienan Chen, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligent Software and Engineering, Nanjing University (Suzhou Campus)(南京大学智能软件与工程学院(苏州校区)) National Key Laboratory of Science and Technology on Communications, University of Electronic Science and Technology of China(中国电子科学技术研究院通信科学技术国家重点实验室)

AI总结 该研究验证面向推理优化的NPU可支持无线基带处理,通过将通信算法重构为AI计算原语,在昇腾310B1 NPU上实现了完整OFDM收发机的空口传输。

Comments 8 pages, 4 figures. Submitted to npj Wireless Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04635 2026-07-07 cs.CV cs.CG 新提交

Aperture-aware Dispersion 5-D Light-field Imaging Spectrometer

孔径感知色散5维光场成像光谱仪

Chenglong Huang, Tao Lv, Jianing Yang, Chongde Zi, Linsen Chen, Xun Cao

机构 * Nanjing University(南京大学) Key Laboratory of Optoelectronic Devices and Systems with Extreme Performances of MOE, Nanjing University(教育部南京大学极端光电子器件与系统重点实验室)

AI总结 研究高维视觉传感中在缩小成像系统时提升感知维度的挑战。提出孔径感知色散光场成像光谱仪,利用双折射材料特性,通过孔径复用调制实现紧凑与高分辨率协同,开发框架并验证其高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03928 2026-07-07 cs.SD cs.AI eess.AS 新提交

TokAN: Accent Normalization Using Self-Supervised Speech Tokens

TokAN:使用自监督语音令牌进行口音归一化

Qibing Bai, Shuai Wang, Yuhan Du, Bohan Li, Yannan Wang, Haizhou Li

机构 * School of Data Science (SDS), The Chinese University of Hong Kong, Shenzhen (CUHKSZ)(香港中文大学(深圳)数据科学学院) Tencent Ethereal Audio Lab, Tencent(腾讯虚幻音频实验室) School of Intelligence Science and Technology, Nanjing University, Suzhou(南京大学苏州校区智能科学与技术学院) Shenzhen Loop Area Institute(深圳河套学院) X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) School of Artificial Intelligence (SAI), CUHKSZ(香港中文大学(深圳)人工智能学院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 研究提出TokAN框架,基于自监督离散语音令牌,用自回归编解码器转换口音,引入强化学习后训练,还用流匹配合成器和持续时间预测器,实验表明其在降低字错误率和提升可懂度上优于基线。

Comments Submitted to IEEE Transactions on Audio, Speech, and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03900 2026-07-07 cs.CV cs.LG 新提交

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning

USE:一种用于测试时提示调整的统一自集成框架

Siru Jiang, Jian Liang, Ran He, Tieniu Tan

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所国家智能机器人实验室及模式识别实验室) Nanjing University(南京大学)

AI总结 重新审视测试时提示调整(TPT),揭示其优化可视为从自生成伪标签隐式学习,在此基础上提出统一自集成框架(USE),优化时引入自集成策略,实验表明USE及其自集成策略表现出色。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03817 2026-07-07 cs.CV 新提交

Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection

全局逻辑与局部搜索:用于可验证工业异常检测的双流多模态上下文学习

Runzhi Deng, Yundi Hu, Yiming Zhong, Zhao Wang, Xixi Liu, Hongsong Wang, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Southeast University(东南大学)

AI总结 针对工业异常检测难题,提出无训练框架GLLS,利用视觉逻辑图谱组织参考和规范,结合全局逻辑流与细粒度动作流,实验表明其优于基线且决策可追溯

Comments Accepted by ECCV 2026. 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03751 2026-07-07 cs.RO 新提交

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

三思而后行:将树搜索提炼为冻结视觉语言动作模型的动作评估

Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nvidia(英伟达)

AI总结 研究发现视觉语言动作(VLA)模型泛化能力差的关键瓶颈在于动作评估。提出SVA框架,通过蒙特卡洛树搜索探索输出分布,将知识提炼到轻量级Q值模型,提升任务成功率,且保持泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03748 2026-07-07 cs.AI 新提交

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

将交错多模态推理作为统一决策过程进行衔接

Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学)

AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03693 2026-07-07 cs.RO 新提交

CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts

CoRE-VLA:通过专家的条件路由实现可扩展且稳健的视觉-语言-动作建模

Haozhe Zhang, Sixian Li, Yifei Zhang, Zezheng Huai, Hao Chen, Chunhua Shen, Jingjing Gong, Xipeng Qiu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学) Jilin University(吉林大学)

AI总结 研究视觉-语言-动作模型在实际部署中的挑战,提出CoRE-VLA框架,通过上下文条件稀疏计算生成动作,利用传感器可用性和任务意图进行专家路由,实验证明其在多任务等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02930 2026-07-07 cs.CV 新提交

CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection

CL-Anomaly:用于异常检测中持续学习的具有多模态大语言模型的层自适应专家混合模型

Wen Dong, Zhao Wang, Shuangqing Zhang, Kai Sun, Ben Li, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Nanjing University of Science and Technology(南京理工大学)

AI总结 针对多模态大语言模型持续学习计算昂贵及现有方法语义纠缠问题,提出CL-Anomaly框架,用隔离共享协作实现参数高效微调,介绍任务私有专家PrivLoRA等,实验表明其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02038 2026-07-07 cs.CV 新提交

Hierarchical Anti-Aesthetics: Protecting Facial Privacy against Customized Diffusion Models

分层反美学:保护面部隐私免受定制扩散模型侵害

Songping Wang, Yueming Lyu, Shiqi Liu, Chen Zhao, Ziyuan Chen, Ning Li, Jing Dong, Caifeng Shan

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) China Mobile Information Technology Co., Ltd.(中国移动信息科技有限公司) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Center for Research on Intelligent Perception and Computing (CRIPAC), Institute of Automation Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室(MAIS)、智能感知与计算研究中心(CRIPAC)、中国科学院自动化研究所(CASIA))

AI总结 提出分层反美学框架,通过全局和局部反美学奖励机制降低定制扩散模型的生成质量,从而保护面部隐私。

Comments arXiv admin note: text overlap with arXiv:2504.12129

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31672 2026-07-07 cs.CV cs.AI 新提交

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

WorldRoamBench:交互式世界模型长时稳定性的开放世界基准

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, Baoquan Chen

机构 * AMAP CV Lab, Alibaba Group(阿里巴巴集团AMAP CV实验室) Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 提出WorldRoamBench基准,从动作、视觉、物理和记忆四维度评估交互式世界模型的长时稳定性,包含600+测试用例,揭示现有模型在所有维度均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏