arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2380
2607.12297 2026-07-15 cs.CV 新提交

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

MobileSAM2:用于空间智能的轻量级图像分割模型

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学) SparcAI Inc.(SparcAI公司)

AI总结 研究旨在使SAM2更适用于移动设备,提出超图知识蒸馏方法HyperKD,由时间和粒度超图知识蒸馏构成,能有效建模转移知识。还推出MobileSAM2家族,经实验验证其在多基准测试及具身AI任务上有良好泛化性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11918 2026-07-15 cs.DL cs.AI cs.CY cs.LG 新提交

AAAI-26 Dual Submissions: Novel Challenges

AAAI-26双重投稿:新挑战

Kiri L. Wagstaff, Joydeep Biswas, Erich Merrill, Bo An, Ida Camacho, David J. Crandall, Matthew E. Taylor

机构 * OSU Libraries(俄勒冈州立大学图书馆) University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) AAAI Washington, DC(AAAI华盛顿特区) Indiana University(印第安纳大学) University of Alberta(阿尔伯塔大学)

AI总结 AAAI-26评审中发现双重投稿问题严重,通过标题+摘要相似性评估等方法处理,导致141篇主赛道投稿被拒稿。提醒注意双重投稿增长,其因生成式AI工具加剧,还给出更新政策、设检查工具等应对建议。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11132 2026-07-15 cs.CV 版本更新

From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Xinying Qian, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27270 2026-07-15 cs.AI stat.ML 版本更新

Quantification of Credal Uncertainty: A Distance-Based Approach

可信不确定性量化:基于距离的方法

Xabier Gonzalez-Garcia, Siu Lun Chau, Julian Rodemann, Michele Caprio, Krikamol Muandet, Humberto Bustince, Sébastien Destercke, Eyke Hüllermeier, Yusuf Sale

机构 * Public University of Navarre(纳瓦拉公立大学) Nanyang Technological University(南洋理工大学) CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) LMU Munich(慕尼黑大学) The University of Manchester(曼彻斯特大学) Université de Technologie de Compiègne(贡比涅技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) German Research Center for Artificial Intelligence (DFKI, DSA)(德国人工智能研究中心)

AI总结 本文提出基于距离的方法量化可信集中的总、随机和epistemic不确定性,通过积分概率度量框架获得可解释且计算高效的多类分类不确定性度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11834 2026-07-15 cs.CV cs.AI cs.RO cs.SY eess.IV eess.SY

Recent Advances in Transformer and Large Language Models for UAV Applications

Transformer及大语言模型在无人机应用中的最新进展

Hamza Kheddar, Yassine Habchi, Mohamed Chahine Ghanem, Mustapha Hemis, Dusit Niyato

机构 * LSEA Laboratory, Department of Electrical Engineering, University of Medea, 26000, Algeria(里塞阿实验室,电气工程系,梅迪亚大学,阿尔及利亚) Institute of Technology, University Centre Salhi Ahmed, Naama, Algeria(技术研究所,萨利哈·阿赫迈德大学中心,纳马,阿尔及利亚) Cybersecurity Institute, Department of Computer Science, University of Liverpool, L69 3BX, Liverpool, UK(网络安全研究所,计算机科学系,利物浦大学,英国) LCPTS Laboratory, University of Sciences(LCPTS实验室,科学大学) College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore.(数据科学,南洋理工大学,新加坡)

AI总结 本文综述了Transformer及大语言模型在无人机应用中的最新进展,包括分类、混合模型、强化学习和大语言模型的应用,以及精准农业和自主导航等新兴应用。

Journal ref ACM Computing Surveys, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11473 2026-07-14 cs.CV cs.LG 新提交

Towards Efficient Convolutional Neural Network for Embedded Hardware via Multi-Dimensional Pruning

通过多维剪枝实现面向嵌入式硬件的高效卷积神经网络

Hao Kong, Di Liu, Xiangzhong Luo, Shuo Huai, Ravi Subramaniam, Christian Makaya, Qian Lin, Weichen Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(惠普-南洋理工大学数字制造联合实验室) Department of Computer Science, Norwegian University of Science and Technology(挪威科技大学计算机科学系)

AI总结 研究针对嵌入式硬件的高效卷积神经网络,提出TECO多维剪枝框架,通过两阶段重要性评估框架全面评估剪枝单元,用启发式算法逐步修剪网络的深度、宽度和分辨率,实验验证其优于现有方法。

Comments Author's accepted version. Published in Proceedings of the 60th ACM/IEEE Design Automation Conference (DAC 2023)

Journal ref Proceedings of the 60th ACM/IEEE Design Automation Conference (DAC), pp. 1-6, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11386 2026-07-14 cs.RO 新提交

From Sketch Prior to Trajectories: A Mission-Oriented Coordinated Navigation Framework for Indoor UAV Swarm

从草图先验到轨迹:一种面向任务的室内无人机群协同导航框架

Xinhang Xu, Ruiyang Liu, Haotian Jin, Yi Wang, Hongming Shen, Jianping Li, Lihua Xie

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 针对室内无人机群任务,提出面向任务的协同导航框架,利用草图先验,经拓扑对齐、融合观测构建可通行性表示,开发分层二维 - 三维框架,经仿真和实验验证其有效性、协同导航能力及对分层结构的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11131 2026-07-14 cs.CL 新提交

TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding

TIGER:用于多模态推测解码的文本条件视觉门控路由与接受对齐

Quynh Vo, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Center of AI Research, VinUniversity(Vin大学人工智能研究中心)

AI总结 针对多模态推测解码中草稿模型视觉关键内容易偏差及现有方法不足的问题,提出TIGER框架,基于文本状态动态选视觉令牌,用接受对齐分组策略训练优化草稿模型,实验证明其在多方面取得良好效果。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10792 2026-07-14 cs.CV 新提交

MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction

MAC-Splat:用于高保真稀疏视图重建的多属性一致性

Jinqian Yang, Yichen Wu, Wanhua Li, Haokun Lin, Renzhen Wang, Xiangchu Feng, Xixi Jia

机构 * Xidian University(西安电子科技大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

AI总结 针对稀疏视图重建中现有方法存在几何伪影的问题,提出MAC-Splat训练框架,利用MASt3R和DINOv3获取2D对应关系并定义MAC损失,联合正则化3D属性,实验证明该方法能有效解决不适定的稀疏视图重建问题,性能优于基线。

Comments Accepted to the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10251 2026-07-14 cs.AI 新提交

Behavioural Signatures of Risk-Sensitive Decision-Making in Large Language Models

大语言模型中风险敏感决策的行为特征

Xuankun Rong, Wenke Huang, Bo Du, Dacheng Tao, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究大语言模型在决策支持中风险敏感决策的行为特征,通过无限制德州扑克的多模型框架量化行为,发现前沿LLMs有稳定风险特征,在不同条件下表现各异,为审计交互式环境中风险敏感决策提供行为基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08164 2026-07-14 cs.CV 版本更新

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11637 2026-07-14 cs.AI 版本更新

TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation

TouchThinker: 通过大规模数据和动作感知表示将触觉常识推理扩展到开放世界

Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Xiamen University(厦门大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 提出TouchThinker框架,通过构建百万级多源触觉数据集TouchThinker-1M和动作感知建模,将触觉常识推理扩展到开放世界,在多个数据集上取得竞争性表现。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06280 2026-07-14 cs.CV 版本更新

Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency

欧拉运动引导:基于双向几何一致性的鲁棒图像动画

Thong Nguyen, Khoi M. Le, Cong-Duy Nguyen, Luu Anh Tuan, See-Kiong Ng, Chunyan Miao

机构 * National University of Singapore(新加坡国立大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心) Nanyang Technological University(南洋理工大学)

AI总结 提出使用相邻帧欧拉运动场引导生成,并通过双向几何一致性机制解决遮挡问题,实现加速训练、保持时间连贯性和减少动态伪影。

Comments Accepted by ACM MM 2026. Code is available at https://github.com/nguyentthong/eulerian_motion_guidance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01581 2026-07-14 cs.CV 版本更新

Satellite-Free Training for Drone-View Geo-Localization

无需卫星的无人机视角地理定位

Tao Liu, Yingzhi Zhang, Kan Ren, Xiaoqi Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) University of Tsukuba(筑波大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出无需卫星数据的训练框架,通过三维场景重建、伪正射影像生成和特征聚合,提升无人机在无GPS环境下的地理定位性能。

Comments Withdrawn by the authors to allow for substantial revision in light of valuable reviewer feedback. A thoroughly revised version may be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06587 2026-07-14 cs.AI q-fin.CP q-fin.RM

Autonomous AI Agents for Option Hedging: Enhancing Financial Stability through Shortfall Aware Reinforcement Learning

自主AI代理用于期权对冲:通过意识短缺的强化学习增强金融稳定性

Minxuan Hu, Ziheng Chen, Jiayu Yi, Wenxi Sun

机构 * Cornell Ann S. Bowers College of Computing and Information Science, Cornell University(康奈尔大学安·索斯·博尔斯计算与信息科学学院) Department of Mathematics, University of Texas at Austin(德克萨斯大学奥斯汀分校数学系) School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院) Krieger School of Arts and Sciences, Johns Hopkins University(约翰霍普金斯大学克里eger艺术与科学学院)

AI总结 本文提出RLOP和QLBS两种强化学习框架,通过意识短缺的方法优化期权对冲,提升金融稳定性并改进风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10504 2026-07-14 cs.CL 版本更新

DR-Arena: an Automated Evaluation Framework for Deep Research Agents

DR-Arena:深度研究智能体的自动化评估框架

Yiwen Gao, Ruochen Zhao, Yang Deng, Wenxuan Zhang

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 针对大语言模型作深度研究智能体时任务性能评估难的问题,提出DR-Arena自动化评估框架,通过动态调查、构建实时信息树、自动考官出题及自适应进化循环提升任务复杂性来评估,实验证明其与人类偏好对齐效果好,可替代人工裁决。

Comments 22 pages, 8 figures. Accepted to ACL 2026 as an oral presentation and selected as an SAC Highlight

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 27130-27152, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16929 2026-07-14 eess.SP cs.AI

Modelling the 5G Energy Consumption using Real-world Data: Energy Fingerprint is All You Need

利用真实数据建模5G能耗:能量指纹是你所需的一切

Tingwei Chen, Yantao Wang, Hanzhi Chen, Zijian Zhao, Xinhao Li, Nicola Piovesan, Guangxu Zhu, Qingjiang Shi

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) Huawei Technologies(华为技术有限公司) School of Software Engineering, Tongji University(同济大学软件工程学院)

AI总结 本文提出基于真实数据集的深度学习模型,通过整合基站标识符和引入掩码训练与注意力机制,有效提升了5G基站能耗估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22036 2026-07-14 cs.LG cs.MM 版本更新

Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全

Ying Zhang, Yu Zhao, Xuhui Sui, Baohang Zhou, Xiangrui Cai, Li Shen, Xiaojie Yuan, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) School of Software, Tiangong University(软件学院、天津工业大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)

AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。

Comments Published in IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09089 2026-07-13 cs.CV 新提交

DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes

DETRAM:人类网格的端到端检测、跟踪与恢复

Chunggi Lee, Seonwook Park, Wanhua Li, Umar Iqbal, Hanspeter Pfister

机构 * Harvard University(哈佛大学) NVIDIA(英伟达) Nanyang Technological University(南洋理工大学)

AI总结 研究针对多人场景下人类网格恢复难题,提出DETRAM统一框架,利用单个变压器解码器及可学习查询嵌入,能自动和依用户提示检测、重建与跟踪人类,在多数据集上取得领先跟踪结果及有竞争力的重建精度,实现端到端可训练的用户导向人体分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09063 2026-07-13 cs.LG 新提交

EvoLP: Self-Evolving Latency Predictor for Model Compression in Real-Time Edge Systems

EvoLP:实时边缘系统中用于模型压缩的自进化延迟预测器

Shuo Huai, Hao Kong, Shiqing Li, Xiangzhong Luo, Ravi Subramaniam, Christian Makaya, Qian Lin, Weichen Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(南洋理工大学惠普-南洋理工数字制造联合实验室) HP Inc.(惠普公司)

AI总结 研究针对边缘设备资源有限及测量延迟难问题,提出EvoLP框架预测模型推理延迟,该预测器可在网络压缩中自进化提升精度,实验表明其优于现有方法,融入模型压缩框架可有效指导压缩并满足延迟约束。

Comments Author's accepted version. Published in IEEE Embedded Systems Letters

Journal ref IEEE Embedded Systems Letters, vol. 16, no. 2, pp. 174-177, June 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09097 2026-07-13 cs.AI 版本更新

Programming over Thinking: Efficient and Robust Multi-Constraint Planning

编程而非思考:高效且稳健的多约束规划

Derrick Goh Xin Deik, Quanyu Long, Zhengyuan Liu, Nancy F. Chen, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(科技研究局)

AI总结 多约束规划面临挑战,现有大语言模型方法有局限。本文提出SCOPE框架,将特定查询推理与通用代码执行分离,产生一致、可重用的求解器函数,降低成本和延迟,性能达最优。

Comments Accepted at ACL 2026 : Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09076 2026-07-13 cs.CV 版本更新

ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

ProSGNeRF:城市场景中基于频率调制基础模型的渐进式动态神经场景图

Tianchen Deng, Yanbo Wang, Yejia Liu, Chenpeng Su, Jingchuan Wang, Danwei Wang, Shao-Yuan Lo, Weidong Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National Taiwan University(国立台湾大学)

AI总结 针对大规模城市场景中快速移动对象建模及相机自我运动处理难题,提出ProSGNeRF,通过渐进式场景图网络架构学习局部场景表示,利用基础模型网络编码潜码并引入频率调制模块,提升视图合成等能力。

Comments Accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08572 2026-07-10 cs.CV 新提交

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner:通过强化学习在多任务混合中学习何时思考

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

机构 * Wuhan University(武汉大学) Xiaomi Inc(小米公司) Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08375 2026-07-10 cs.CV cs.AI 新提交

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

机构 * Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08354 2026-07-10 cs.RO 新提交

SkillPlug: Unsupervised Skill Mining for Few-Shot Adaptation in Robotic Manipulation

SkillPlug:用于机器人操作中少样本适应的无监督技能挖掘

Zi-han Ding, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 针对机器人操作中学习可转移视觉运动模仿策略的挑战,提出SkillPlug框架,通过技能调节模块挖掘共享可转移技能库,经自监督学习形成任务共享先验,微调轻量级组件实现少样本适应,提升多任务和少样本适应性能。

Comments 8 pages, 8 figures, published to RA-L

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 8, pp. 9511-9518, Aug. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏