arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 330
2607.13059 2026-07-16 cs.RO 新提交

GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

GPUSimBench:迈向具身人工智能中可扩展且可靠的GPU加速模拟器

Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan, Li Ma, Hengjie Li, Jingcheng Pang, Dmitry Yudin

机构 * Shanghai AI Laboratory(上海人工智能实验室) MIRAI(未来人工智能研究所) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 研究具身人工智能中GPU加速模拟器问题,通过GPUSimBench工具,建立物理基础评估、基准测试并行可扩展性,揭示并量化GPU批处理执行的不确定性,确定模拟器堆栈随机经验模式,强调无界扩展对可重复性的影响。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12931 2026-07-15 cs.RO 新提交

ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

ExToken:用于高效视觉-语言-动作强化微调的结构化探索

Yilun Kong, Yunpeng Qing, Guozheng Ma, Haoyu Wang, Li Shen, Zhi Hou, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) ACE Robotics(ACE机器人公司) Zhejiang University(浙江大学)

AI总结 研究VLA模型强化学习中探索停滞问题,提出ExToken框架,基于离线演示导出的离散行为先验调整VLA策略进行结构化探索,通过不同令牌鼓励多样行为模式,提升了探索效率与任务性能,在多任务实验中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12823 2026-07-15 cs.AI 新提交

Human-AI Agent Interaction as a Neuroplastic Training Environment

作为神经可塑性训练环境的人类与人工智能代理交互

Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Gihan Siriwardanagea, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Chalani Rajapakse, Sachin Shetty, Christopher K. Rhea, Ng Wee Keong, Kasun De Zoysa, Amin Hass, Shaifali Kaushik, Wathsala Herath, Preston Samuel, Anita H. Clayton, Atmaram Yarlagadd

机构 * Old Dominion University(奥多明尼昂大学) AI Motion Labs(人工智能运动实验室) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学) Accenture Technology Labs(埃森哲技术实验室) GSI Scandinavia AB(GSI斯堪的纳维亚公司) Lithuanian University of Health Sciences(立陶宛健康科学大学) Department of Psychiatry and Neurobehavioral Sciences, University of Virginia School of Medicine(弗吉尼亚大学医学院精神病学和神经行为科学系) Blanchfield Army Community Hospital(布兰奇菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

AI总结 研究人类与AI代理交互这一日常活动,发现其是神经可塑性训练环境。提出利用此环境产生相反效果的框架,通过三层观察和两种应用模式实现,以生成图像提示为例展示该框架能使观察与否行为相同但神经学相反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12372 2026-07-15 cs.CV 新提交

UMSS: Towards Unsupervised Multi-modal Semantic Segmentation

UMSS:迈向无监督多模态语义分割

Haitian Zhang, Thai Duy Nguyen, Xiangyuan Wang, Mohan Liu, Lin Wang

机构 * EmPACT Lab, School of EEE, Nanyang Technological University(电气与电子工程学院电磁脉冲与天线研究室,南洋理工大学) The University of Hong Kong(香港大学)

AI总结 本文针对无监督多模态语义分割问题,提出基于DINOv3的UniM2框架,通过跨模态对应协同学习统一潜在空间提取语义线索,并引入跨模态协调器缓解冲突,实验证明该框架相比现有框架有明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12297 2026-07-15 cs.CV 新提交

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

MobileSAM2:用于空间智能的轻量级图像分割模型

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学) SparcAI Inc.(SparcAI公司)

AI总结 研究旨在使SAM2更适用于移动设备,提出超图知识蒸馏方法HyperKD,由时间和粒度超图知识蒸馏构成,能有效建模转移知识。还推出MobileSAM2家族,经实验验证其在多基准测试及具身AI任务上有良好泛化性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11918 2026-07-15 cs.DL cs.AI cs.CY cs.LG 新提交

AAAI-26 Dual Submissions: Novel Challenges

AAAI-26双重投稿:新挑战

Kiri L. Wagstaff, Joydeep Biswas, Erich Merrill, Bo An, Ida Camacho, David J. Crandall, Matthew E. Taylor

机构 * OSU Libraries(俄勒冈州立大学图书馆) University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) AAAI Washington, DC(AAAI华盛顿特区) Indiana University(印第安纳大学) University of Alberta(阿尔伯塔大学)

AI总结 AAAI-26评审中发现双重投稿问题严重,通过标题+摘要相似性评估等方法处理,导致141篇主赛道投稿被拒稿。提醒注意双重投稿增长,其因生成式AI工具加剧,还给出更新政策、设检查工具等应对建议。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11473 2026-07-14 cs.CV cs.LG 新提交

Towards Efficient Convolutional Neural Network for Embedded Hardware via Multi-Dimensional Pruning

通过多维剪枝实现面向嵌入式硬件的高效卷积神经网络

Hao Kong, Di Liu, Xiangzhong Luo, Shuo Huai, Ravi Subramaniam, Christian Makaya, Qian Lin, Weichen Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(惠普-南洋理工大学数字制造联合实验室) Department of Computer Science, Norwegian University of Science and Technology(挪威科技大学计算机科学系)

AI总结 研究针对嵌入式硬件的高效卷积神经网络,提出TECO多维剪枝框架,通过两阶段重要性评估框架全面评估剪枝单元,用启发式算法逐步修剪网络的深度、宽度和分辨率,实验验证其优于现有方法。

Comments Author's accepted version. Published in Proceedings of the 60th ACM/IEEE Design Automation Conference (DAC 2023)

Journal ref Proceedings of the 60th ACM/IEEE Design Automation Conference (DAC), pp. 1-6, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11386 2026-07-14 cs.RO 新提交

From Sketch Prior to Trajectories: A Mission-Oriented Coordinated Navigation Framework for Indoor UAV Swarm

从草图先验到轨迹:一种面向任务的室内无人机群协同导航框架

Xinhang Xu, Ruiyang Liu, Haotian Jin, Yi Wang, Hongming Shen, Jianping Li, Lihua Xie

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 针对室内无人机群任务,提出面向任务的协同导航框架,利用草图先验,经拓扑对齐、融合观测构建可通行性表示,开发分层二维 - 三维框架,经仿真和实验验证其有效性、协同导航能力及对分层结构的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11131 2026-07-14 cs.CL 新提交

TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding

TIGER:用于多模态推测解码的文本条件视觉门控路由与接受对齐

Quynh Vo, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Center of AI Research, VinUniversity(Vin大学人工智能研究中心)

AI总结 针对多模态推测解码中草稿模型视觉关键内容易偏差及现有方法不足的问题,提出TIGER框架,基于文本状态动态选视觉令牌,用接受对齐分组策略训练优化草稿模型,实验证明其在多方面取得良好效果。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10792 2026-07-14 cs.CV 新提交

MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction

MAC-Splat:用于高保真稀疏视图重建的多属性一致性

Jinqian Yang, Yichen Wu, Wanhua Li, Haokun Lin, Renzhen Wang, Xiangchu Feng, Xixi Jia

机构 * Xidian University(西安电子科技大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

AI总结 针对稀疏视图重建中现有方法存在几何伪影的问题,提出MAC-Splat训练框架,利用MASt3R和DINOv3获取2D对应关系并定义MAC损失,联合正则化3D属性,实验证明该方法能有效解决不适定的稀疏视图重建问题,性能优于基线。

Comments Accepted to the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10251 2026-07-14 cs.AI 新提交

Behavioural Signatures of Risk-Sensitive Decision-Making in Large Language Models

大语言模型中风险敏感决策的行为特征

Xuankun Rong, Wenke Huang, Bo Du, Dacheng Tao, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究大语言模型在决策支持中风险敏感决策的行为特征,通过无限制德州扑克的多模型框架量化行为,发现前沿LLMs有稳定风险特征,在不同条件下表现各异,为审计交互式环境中风险敏感决策提供行为基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09089 2026-07-13 cs.CV 新提交

DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes

DETRAM:人类网格的端到端检测、跟踪与恢复

Chunggi Lee, Seonwook Park, Wanhua Li, Umar Iqbal, Hanspeter Pfister

机构 * Harvard University(哈佛大学) NVIDIA(英伟达) Nanyang Technological University(南洋理工大学)

AI总结 研究针对多人场景下人类网格恢复难题,提出DETRAM统一框架,利用单个变压器解码器及可学习查询嵌入,能自动和依用户提示检测、重建与跟踪人类,在多数据集上取得领先跟踪结果及有竞争力的重建精度,实现端到端可训练的用户导向人体分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09063 2026-07-13 cs.LG 新提交

EvoLP: Self-Evolving Latency Predictor for Model Compression in Real-Time Edge Systems

EvoLP:实时边缘系统中用于模型压缩的自进化延迟预测器

Shuo Huai, Hao Kong, Shiqing Li, Xiangzhong Luo, Ravi Subramaniam, Christian Makaya, Qian Lin, Weichen Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(南洋理工大学惠普-南洋理工数字制造联合实验室) HP Inc.(惠普公司)

AI总结 研究针对边缘设备资源有限及测量延迟难问题,提出EvoLP框架预测模型推理延迟,该预测器可在网络压缩中自进化提升精度,实验表明其优于现有方法,融入模型压缩框架可有效指导压缩并满足延迟约束。

Comments Author's accepted version. Published in IEEE Embedded Systems Letters

Journal ref IEEE Embedded Systems Letters, vol. 16, no. 2, pp. 174-177, June 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08572 2026-07-10 cs.CV 新提交

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner:通过强化学习在多任务混合中学习何时思考

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

机构 * Wuhan University(武汉大学) Xiaomi Inc(小米公司) Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08375 2026-07-10 cs.CV cs.AI 新提交

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

机构 * Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08354 2026-07-10 cs.RO 新提交

SkillPlug: Unsupervised Skill Mining for Few-Shot Adaptation in Robotic Manipulation

SkillPlug:用于机器人操作中少样本适应的无监督技能挖掘

Zi-han Ding, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 针对机器人操作中学习可转移视觉运动模仿策略的挑战,提出SkillPlug框架,通过技能调节模块挖掘共享可转移技能库,经自监督学习形成任务共享先验,微调轻量级组件实现少样本适应,提升多任务和少样本适应性能。

Comments 8 pages, 8 figures, published to RA-L

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 8, pp. 9511-9518, Aug. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08014 2026-07-10 cs.CV cs.LG 新提交

FedTR: Federated Learning Framework with Transfer Learning for Industrial Visual Inspection

FedTR:用于工业视觉检测的带迁移学习的联邦学习框架

Vikash Sathiamoorthy, Shuo Huai, Hao Kong, Di Liu, Wendy Yong Yi Loy, Christian Makaya, Daren Ho, Ravi Subramaniam, Qian Lin, Weichen Liu

机构 * HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(惠普-南洋理工大学数字制造联合实验室,南洋理工大学) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Department of Computer Science, Norwegian University of Science and Technology(挪威科技大学计算机科学系) HP Inc.(惠普公司) HP Singapore(惠普新加坡公司)

AI总结 针对工业视觉检测中数据有限和任务复杂影响模型性能的问题,提出FedTR框架,结合迁移学习,先利用公开数据集训练,再在私有数据上微调,实验证明该方法在标签缺陷识别上有效,准确率高且性能与集中训练相当。

Comments Author's accepted version. Published in Proceedings of the Great Lakes Symposium on VLSI 2024 (GLSVLSI '24)

Journal ref Proceedings of the Great Lakes Symposium on VLSI 2024 (GLSVLSI '24), pp. 310-314, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07830 2026-07-10 cs.RO 新提交

Physics-Guided Biomechanical Gait Adaptation for Humanoid Locomotion on Extreme Sloped Terrains

用于类人机器人在极端倾斜地形上运动的物理引导生物力学步态适应

Xuanyu Chen, Mohan Liu, Dengchen Mei, Zhihao Gu, Haitian Zhang, Kaimin Mao, Haiyue Zhu, Shijun Yan, Lin Wang

机构 * Nanyang Technological University(南洋理工大学) A*STAR(新加坡科技研究局)

AI总结 研究类人机器人在极端倾斜地形的运动控制问题,提出HumoSlope两阶段物理引导框架,第一阶段建立平衡先验,第二阶段引入BSGA调节奖励,实现对不同坡度地形的适应,实验验证了该方法的有效性。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03715 2026-07-10 cs.CV 新提交

Leveraging Pathology Co-occurrence for Test-Time Adaptation in Chest X-Ray Diagnosis

利用病理学共现进行胸部X光诊断的测试时适应

Woojin Jeong, Yujin Choi, Dongbin Kim, Soyeon Park, Jaewook Lee

机构 * Seoul National University(首尔国立大学) Nanyang Technological University(南洋理工大学) UNIST(蔚山科学技术院)

AI总结 研究针对医学影像模型在新临床地点性能下降问题,提出共现加权适应(CoWA)方法,利用疾病共现模式作适应可靠性信号,估计标签共现结构并降低偏离模式样本权重,在胸部X光基准测试中优于基线。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07320 2026-07-09 cs.CV 新提交

SoccerNet 2026 Challenges Results

SoccerNet 2026挑战结果

Anthony Cioppa, Silvio Giancola, Håkan Ardö, Mohamad Dalal, Jan Held, Jérémie Ochin, Jiayuan Rao, Karen Sanchez, Renaud Vandeghen, Artur Xarles, Olivier Barnich, Albert Clapés, Mathieu Delvaux, Sergio Escalera, Bernard Ghanem, Cédric Hons, Antoine Houet, Sotiris Manitsaris, Tom Michel, Pierre Miralles, Thomas B. Moeslund, Mikael Nilsson, Bogdan Stanciulescu, Marc Van Droogenbroeck, Yanfeng Wang, Weidi Xie, Faisal Altawijri, Mohamed Atef, Semen Budennyy, Vasiliy Chelpanov, Puhua Chen, Yixin Chen, Lechao Cheng, Jianling Chu, Ju-Seong Do, Oleg Durygin, Omar Fetouh, Mirco Fuchs, Youssef Ghallab, Falguni Ghosh, Wonjun Heo, Yufeng Hu, Weixuan Huang, Phuong-Linh Huynh-Ha, Matvey Isupov, Yangguang Ji, Siyuan Jiang, Zhenxiang Jiang, Wonyong Jo, Ho-Young Jung, SeongHeon Kang, MinJae Kim, Youngseon Kim, Jakub Komosa, Artem Konshin, Trung-Hoang Le, Jongmin Lee, Lingling Li, Litao Li, Vadim Linkov, Fang Liu, Haoxuan Ma, Shun Makino, Ismail Mathkour, Konstantin Mitin, Mikhail Moiseev, Takumi Nagaya, Yuki Nakamura, Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Trong-Thuan Nguyen, Christian Orduz, Kwanyong Park, Fabian Perez, Parthsarthi Rawat, SuHyun Rim, Hoover Rueda-Chacón, Atom Scott, Minori Sugimura, Yuyang Sun, Shengeng Tang, Minh-Triet Tran, Ikuma Uchida, Juan Vanegas, Thanh-Nhan Vo, Jiangtao Wang, Yaxiong Wang, Xiaogang Wang, Ruifeng Wang, Rio Watanabe, Jiali Wen, Yongliang Wu, Di Yang, Xu Yang, Zhuo Yang, Xinyu Ye, Yibo Yu, Zihan Zhai, Yu Zhang, Zhenyu Zhao, Zhun Zhong, Yixi Zhou, Xingyu Zhu, Wenbo Zhu, Julian Ziegler

机构 * University of Liège(列日大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Spiideo(斯皮迪奥公司) Aalborg University(奥尔堡大学) SpAItial(斯帕蒂亚尔公司) Center for Robotics, Mines Paris, PSL(巴黎矿业学院机器人中心(巴黎文理研究大学)) Footovision(Footovision公司) Shanghai Jiao Tong University(上海交通大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) EVS Broadcast Equipment(EVS广播设备公司) Pioneer Center for Artificial Intelligence(先锋人工智能中心) Lund University(隆德大学) TAHAKOM(TAHAKOM公司) Mohamed Bin Zayed University for Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Sber AI(Sber人工智能公司) Salute For Business(Salute For Business公司) Intelligent Perception and Image Understanding Lab, Xidian University(西安电子科技大学智能感知与图像理解实验室) South China University of Technology(华南理工大学) Hefei University of Technology(合肥工业大学) Kyungpook National University(庆北国立大学) Leipzig University of Applied Sciences(莱比锡应用科学大学) Friedrich-Alexander University Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) University of Seoul(首尔大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Nanjing University(南京大学) University of Science, Ho Chi Minh City(胡志明市科技大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

AI总结 SoccerNet 2026挑战涵盖五项体育视频理解视觉任务,为每项任务提供数据、协议和基线。众多团队参与,本文介绍任务、评估协议,展示排行榜并总结领先提交内容,记录各任务当前状态。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07187 2026-07-09 cs.CV 新提交

EditVerse3D: High-Quality 3D Object Editing with Region-Aware Learning

EditVerse3D:基于区域感知学习的高质量3D对象编辑

Youtan Yin, Yanning Zhou, Jiacheng Wei, Xiaofeng Yang, Jun Zhang, Jiayang Bai, Jingwen Ye, Weidong Zhang, Guosheng Lin

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Tencent AIPD(腾讯人工智能产品部)

AI总结 针对3D对象局部编辑难题,EditVerse3D框架输入3D对象、粗略边界框和参考2D图像,利用区域感知自适应损失及数据增强技术,输出高质量编辑对象,实验证明其性能优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://editverse3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07178 2026-07-09 cs.LG cs.AI 新提交

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

多任务智能强化学习的熵步长策略优化

Zetian Hu, Shunyu Liu, Junjie Zhang, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07101 2026-07-09 cs.RO cs.AI 新提交

GeoProp: Grounding Robot State in Vision for Generalist Manipulation

GeoProp:将机器人状态在视觉中进行定位以实现通用操作

Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 研究针对机器人操作中本体感觉与视觉缺乏有效对齐问题,提出轻量级GeoProp适配器,通过几何定位、特征采样及FiLM调制等使两者对齐,在多任务中提升策略性能,是具身策略的简单高效归纳偏差。

Comments 21 pages, 8 figures, 11 tables. Project page: https://alibaba-damo-academy.github.io/GeoProp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06982 2026-07-09 cs.CV cs.AR cs.LG 新提交

EdgeCompress: Coupling Multidimensional Model Compression and Dynamic Inference for EdgeAI

EdgeCompress:用于边缘人工智能的多维模型压缩与动态推理耦合

Hao Kong, Di Liu, Shuo Huai, Xiangzhong Luo, Ravi Subramaniam, Christian Makaya, Qian Lin, Weichen Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(惠普-南洋理工大学数字制造联合实验室) Department of Computer Science, Norwegian University of Science and Technology(挪威科技大学计算机科学系) HP Inc.(惠普公司)

AI总结 研究针对卷积神经网络在嵌入式设备部署的计算成本问题,提出EdgeCompress框架,通过动态图像裁剪和复合收缩进行多维模型压缩,结合动态推理框架,有效减少计算冗余,提高推理效率,实验证明该框架能显著提升模型性能。

Comments Author's accepted version. Published in IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems (TCAD)

Journal ref IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems, vol. 42, no. 12, pp. 4657-4670, Dec. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06922 2026-07-09 cs.LG cs.CV 新提交

Latency-Constrained DNN Architecture Learning for Edge Systems using Zerorized Batch Normalization

使用零化批归一化的边缘系统延迟受限深度神经网络架构学习

Shuo Huai, Di Liu, Hao Kong, Weichen Liu, Ravi Subramaniam, Christian Makaya, Qian Lin

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) HP-NTU Digital Manufacturing Corporate Lab(HP-NTU数字制造企业实验室) Department of Computer Science(计算机科学系) Norwegian University of Science and Technology(挪威科学技术大学) HP Inc.(惠普公司)

AI总结 针对边缘系统中深度学习应用的延迟问题,提出面向延迟的神经网络学习方法,引入延迟预测器,经实验验证该方法能在满足延迟约束时实现高精度,且在多个数据集和设备上有良好表现,还开源了框架。

Comments 15 pages. Author's accepted manuscript, published in Future Generation Computer Systems

Journal ref Future Generation Computer Systems, Volume 142, Pages 314-327, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏