arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2380
2607.16297 2026-07-21 cs.AR cs.LG 新提交

On Hardware-Aware Design and Optimization of Edge Intelligence

论边缘智能的硬件感知设计与优化

Shuo Huai, Hao Kong, Xiangzhong Luo, Di Liu, Ravi Subramaniam, Christian Makaya, Qian Lin, Weichen Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University, Singapore(南洋理工大学计算机科学与工程学院) HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University, Singapore(南洋理工大学HP-NTU数字制造企业实验室) Department of Computer Science, Norwegian University of Science and Technology, Norway(挪威技术大学计算机科学系) HP Inc., Palo Alto, California, USA(惠普公司)

AI总结 研究边缘智能系统设计难题,通过深入探究模型压缩和神经架构搜索等硬件感知技术来实现高效设计,并探讨了该范式面临的挑战。

Comments Author's accepted version. Published in IEEE Design & Test

Journal ref IEEE Design & Test, vol. 40, no. 6, pp. 149-162, December 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16205 2026-07-21 cs.AI 新提交

It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches

需要8个令牌:通过辅助分支实现从弱到强的离策略强化学习

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

AI总结 研究针对可验证奖励强化学习中目标模型样本语义冗余问题,提出从弱到强学习范式,引入W2SPO方法,通过注入短辅助段指导策略探索,实验表明该方法在数学推理基准测试中性能优异,能提升训练速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04438 2026-07-21 cs.CV cs.AI cs.HC cs.MA cs.MM 版本更新

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

ResearchStudio-Reel:实现从论文到海报、视频和博客的研究最后一公里自动化

Lingao Xiao, Yalun Dai, Yangyu Huang, Qihao Zhao, Wenshan Wu, Hugo He, Ruishuo Chen, Jin Jiang, Qianli Ma, Jiahuan Zhang, Xin Zhang, Ying Xin, Yang Ou, Yan Xia, Scarlett Li, Longbo Huang, Zhipeng Zhang, Yang He, Yap Kim Hui, Yan Lu

机构 * Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Westlake University(西湖大学) CFAR, A*STAR(计算科学与工程研究所,新加坡科技研究局)

AI总结 研究传播自动化困难,以往方法有局限。该研究提出将最后一公里构建为技能组合,实例化ResearchStudio-Reel,包括共享提取器、可编辑生成器和交互式收敛层,能产出多种可编辑工件,效果优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01395 2026-07-21 eess.SY cs.RO cs.SY 版本更新

Quasi-Static Control of Discrete Cosserat Rod

离散Cosserat杆的准静态控制

Srishti Siddharth, Domenico Campolo, Ravi Banavar

机构 * Centre for Systems and Control(系统与控制中心) Indian Institute of Technology Bombay(印度理工学院班加罗尔) Nanyang Technological University(南洋理工大学)

AI总结 针对使用Cosserat杆建模的软体机器人,基于分段常应变空间离散化方法,利用外部力/力矩作为控制输入,设计应变空间和任务空间的状态反馈线性化控制律,实现末端执行器轨迹跟踪和形状控制。

Comments Accepted to 17th APCA International Conference on Automatic Control and Soft Computing (CONTROLO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-07-21 cs.CV cs.LG 版本更新

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20804 2026-07-21 cs.AI 版本更新

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟

Xueyao Wan, Hang Yu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05356 2026-07-20 cs.CV 版本更新

ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction

ReCal3R:面向流式3D重建的可靠性校准学习率

Xinze Li, Yiyuan Wang, Pengxu Chen, Weifeng Su, Weisi Lin, Wentao Cheng

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) Hong Kong Baptist University(香港浸会大学) Jilin University(吉林大学) Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(广东省数据科学交叉研究与应用重点实验室) Nanyang Technological University(南洋理工大学)

AI总结 针对流式3D重建中循环场景状态易被噪声观测破坏的问题,提出可靠性校准学习率方法ReCal3R,在不增加额外开销的前提下大幅提升长序列重建精度。

Comments 23 pages, 7 figures. Project Page: https://powertony102.github.io/recal3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05750 2026-07-20 cs.LG cs.AI 版本更新

Are Heterogeneous Graph Neural Networks Truly Effective for Node Classification? A Causal Perspective

异构图神经网络在节点分类中真的有效吗?因果视角

Xiao Yang, Xuejiao Zhao, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Joint NTU-UBC Research Centre of Excellence in Active Living for the Elderly (LILY), Nanyang Technological University(老年人积极生活卓越研究中心(LILY),南洋理工大学) Alibaba-NTU Singapore Joint Research Institute (ANGEL), Nanyang Technological University(阿里巴巴-南洋理工大学新加坡联合研究机构(ANGEL),南洋理工大学)

AI总结 从模型架构和异构信息角度研究异构图神经网络用于节点分类,通过复现实验和因果中介分析框架,发现模型架构和复杂度对性能无因果效应,异构信息通过增加同质性等产生正向因果效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15272 2026-07-17 cs.CL cs.AI 新提交

SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions

SciDiagramEdit:从论文修订中学习编辑科学图表

Yasheng Sun, Zezi Zeng, Yifan Yang, Chong Luo, Wenyi Wang, Ziwei Liu, Jürgen Schmidhuber

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

AI总结 研究针对科学论文图表编辑自动化的挑战,提出SciDiagramEdit框架,通过从arXiv版本历史挖掘数据,采用技能进化的智能体学习,能从自然论文修订中学习,提升编辑准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-07-17 cs.AI cs.CR 新提交

When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15041 2026-07-17 cs.CV 新提交

Weakly-Supervised RGB-D Salient Object Detection via SAM-driven Pseudo Annotation and State Space Interaction-based Diffusion

通过基于 SAM 的伪标注和基于状态空间交互的扩散进行弱监督 RGB-D 显著目标检测

Wenqi Si, Gongyang Li, Shixiang Shi, Weisi Lin

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)

AI总结 研究弱监督 RGB-D 显著目标检测,提出由 SAM-PAG 和 $S^2$Diff 组成的方法,前者扩展稀疏涂鸦为伪标注,后者在条件信息引导下细化显著图,二者合作使方法性能优异。

Comments 13 pages, 9 figures, accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-07-17 cs.CV 新提交

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14777 2026-07-17 cs.CL 新提交

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

SEED:用于智能体强化学习的自进化在线策略蒸馏

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

AI总结 研究针对基于结果的强化学习中间决策指导有限的问题,提出SEED框架。它将在线策略轨迹转化为训练技能并提炼回策略模型,通过微调策略生成技能,重新评分动作转化蒸馏信号,联合优化提升性能与样本效率及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14614 2026-07-17 cs.LG cs.AI cs.CL 新提交

Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

超越熵:通过对比策略优化实现正确性感知优势塑造

Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) South China University of Technology(华南理工大学) Nanyang Technological University(南洋理工大学)

AI总结 研究提出对比策略优化(CPO),利用参考引导与普通生成分布的令牌级对比分歧实现正确性感知优势塑造,解决零优势问题,在基准实验中显著优于基于熵的方法,平衡探索与利用达最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14609 2026-07-17 cs.RO 新提交

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation

用于接触丰富的机器人操作的表示对齐触觉基础

Ruilin Chen, Jingkai Jia, Tong Yang, Xinyu Zhou, Qiao Sun, Jiangwei Zhong, Shizeng Zhang, Nuo Chen, Bailin He, Wei Li, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Lenovo CTO Organization(联想首席技术官组织) Nanyang Technological University(南洋理工大学) TeleAl, China Telecom(中国电信天翼人工智能公司)

AI总结 研究接触丰富的机器人操作中,针对VLA策略不同表示作用下触觉监督应用位置不明的问题,通过线性探针分析找到可预测未来触觉状态的中间动作专家特征,引入LTP,实验证明表示对齐的触觉基础效果更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14145 2026-07-17 cs.AI cs.CV cs.LG 新提交

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

ToolAnchor:锚定反事实上下文以提升智能体工具使用能力

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) MIT(麻省理工学院)

AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12356 2026-07-17 cs.RO 版本更新

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

VistaVLA:用于机器人操作的几何和语义感知3D高斯基础VLA

Mohan Liu, Zhihao Gu, Xuanyu Chen, Haitian Zhang, Kaimin Mao, Yan Wu, Wei-Yun Yau, Lin Wang

机构 * EmPACT Lab, Nanyang Technological University(南洋理工大学EmPACT实验室) Institute for Infocomm Research (I2R), A*STAR(资讯通信研究院(I2R),新加坡科技研究局)

AI总结 研究针对VLA模型缺乏3D表示的问题,提出VistaVLA框架,通过3D高斯原语构建几何和语义感知的3D认知表示,利用MtQ机制压缩令牌,在模拟和真实环境评估中有效提升VLA性能,尤其在真实场景中显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26261 2026-07-17 cs.LG stat.ML 版本更新

Contrastive Conformal Sets

对比性符合集

Yahya Alkhatib, Wee Peng Tay

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电气与电子工程学院)

AI总结 本文提出一种基于对比学习的符合集方法,通过最小体积覆盖集和可学习多范数约束,实现对正样本的覆盖和负样本的排除,提升了在图像数据集上的包含-排除平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01977 2026-07-17 cs.RO cs.AI cs.CV 版本更新

Seeing Through Uncertainty: Free-Energy-Inspired Real-Time Adaptation for Robust Visual Navigation

在不确定性中看见:一种基于自由能原理的实时感知适应鲁棒视觉导航方法

Maytus Piriyajitakonkij, Rishabh Dev Yadav, Mingfei Sun, Mengmi Zhang, Wei Pan

机构 * Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(信息与通信研究院(I2R)、科技研究局(A*STAR)) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 FEP-Nav通过结合自由能原理与实时感知适应,提升机器人在复杂视觉环境中的导航鲁棒性。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13880 2026-07-16 cs.LG 新提交

Task-Oriented Sensing and Covert Transmissions for Collaborative Multi-AUV Systems

协作多自主水下航行器系统的面向任务感知与隐蔽传输

Xueyao Zhang, Chenyang Yan, Bo Yang, Xuelin Cao, Zhiwen Yu, Bin Guo, George C. Alexandropoulos, Merouane Debbah, Chau Yuen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) School of Cyber Engineering, Xidian University(西安电子科技大学网络空间安全学院) Harbin Engineering University(哈尔滨工程大学) Department of Informatics and Telecommunications, National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学信息与电信系) KU 6G Research Center, Department of Computer and Information Engineering, Khalifa University(哈利法大学KU 6G研究中心计算机与信息工程系) CentraleSupelec, University Paris-Saclay(巴黎萨克雷大学中央理工学院) School of Electrical and Electronics Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 针对水下隐蔽协作任务中AUV信息获取与通信问题,提出SVR-MARL框架,利用实际信息刻画信息效用,在通信和隐蔽约束下学习协作策略,通过案例研究证明其能提高协作效率、降低通信与暴露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13696 2026-07-16 cs.RO 新提交

Anatomy of Uncertainty: Expressive Descriptors of Robotic Manipulator Motion for Non-verbal Communication in Human-Robot Collaboration

不确定性剖析:用于人机协作中非语言交流的机器人操纵器运动的表达性描述符

Ridhima Bector, Souravik Dutta, Poornima Ramachandran, Ree Yan Yeoh, Jui Hien Tan, Domenico Campolo, Bernhard Johannes Schmitt

机构 * School Of Art, Design and Media, Nanyang Technological University(南洋理工大学艺术、设计与传媒学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院)

AI总结 研究人机协作中机器人运动表达不确定性问题,引入数学框架,利用拉班动作分析,通过十一个描述符对五个运动原语参数化,经人体研究验证,为编码机器人运动不确定性及自主轨迹生成奠定基础。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13410 2026-07-16 cs.RO 新提交

Ego-Dynamics-Augmented World Model for Autonomous Driving with Zero-Shot Cross-Chassis Adaptation

用于零样本跨底盘自适应自动驾驶的自我动力学增强世界模型

Zhidong Wang, Jingsong Liang, Zirui Li, Zhan Chen, Han Yu, Chen Lv

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与宇航工程学院) Collaborative Initiative, Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目合作计划) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究针对自动驾驶中基于世界模型的强化学习问题,提出DynaDreamer方法,通过增强自我动力学先验改进世界模型,减少自我运动建模负担,实现零样本跨底盘自适应,实验证明该方法显著提升驾驶任务成功率。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13059 2026-07-16 cs.RO 新提交

GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

GPUSimBench:迈向具身人工智能中可扩展且可靠的GPU加速模拟器

Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan, Li Ma, Hengjie Li, Jingcheng Pang, Dmitry Yudin

机构 * Shanghai AI Laboratory(上海人工智能实验室) MIRAI(未来人工智能研究所) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 研究具身人工智能中GPU加速模拟器问题,通过GPUSimBench工具,建立物理基础评估、基准测试并行可扩展性,揭示并量化GPU批处理执行的不确定性,确定模拟器堆栈随机经验模式,强调无界扩展对可重复性的影响。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10948 2026-07-16 cs.CV 版本更新

ClusIR: Towards Cluster-Guided All-in-One Image Restoration

ClusIR:迈向集群引导的一体化图像恢复

Shengkai Hu, Jiaqi Ma, Xu Zhang, Yongcheng Jing, Lefei Zhang, Jun Wan

机构 * Zhongnan University of Economics and Law(中南财经政法大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Yunnan University(云南大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 研究针对一体化图像恢复中现有方法无法适应复杂退化的问题,提出ClusIR框架,通过可学习聚类建模退化语义,利用概率集群引导路由机制和退化感知频率调制模块,在多场景下取得有竞争力的图像恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22415 2026-07-16 cs.CV cs.AI 版本更新

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化

Jiawei Liang, Jianjie Huang, Ruoyu Chen, Xianghao Jiao, Siyuan Liang, Shiming Liu, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12931 2026-07-15 cs.RO 新提交

ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

ExToken:用于高效视觉-语言-动作强化微调的结构化探索

Yilun Kong, Yunpeng Qing, Guozheng Ma, Haoyu Wang, Li Shen, Zhi Hou, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) ACE Robotics(ACE机器人公司) Zhejiang University(浙江大学)

AI总结 研究VLA模型强化学习中探索停滞问题,提出ExToken框架,基于离线演示导出的离散行为先验调整VLA策略进行结构化探索,通过不同令牌鼓励多样行为模式,提升了探索效率与任务性能,在多任务实验中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12823 2026-07-15 cs.AI 新提交

Human-AI Agent Interaction as a Neuroplastic Training Environment

作为神经可塑性训练环境的人类与人工智能代理交互

Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Gihan Siriwardanagea, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Chalani Rajapakse, Sachin Shetty, Christopher K. Rhea, Ng Wee Keong, Kasun De Zoysa, Amin Hass, Shaifali Kaushik, Wathsala Herath, Preston Samuel, Anita H. Clayton, Atmaram Yarlagadd

机构 * Old Dominion University(奥多明尼昂大学) AI Motion Labs(人工智能运动实验室) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学) Accenture Technology Labs(埃森哲技术实验室) GSI Scandinavia AB(GSI斯堪的纳维亚公司) Lithuanian University of Health Sciences(立陶宛健康科学大学) Department of Psychiatry and Neurobehavioral Sciences, University of Virginia School of Medicine(弗吉尼亚大学医学院精神病学和神经行为科学系) Blanchfield Army Community Hospital(布兰奇菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

AI总结 研究人类与AI代理交互这一日常活动,发现其是神经可塑性训练环境。提出利用此环境产生相反效果的框架,通过三层观察和两种应用模式实现,以生成图像提示为例展示该框架能使观察与否行为相同但神经学相反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12372 2026-07-15 cs.CV 新提交

UMSS: Towards Unsupervised Multi-modal Semantic Segmentation

UMSS:迈向无监督多模态语义分割

Haitian Zhang, Thai Duy Nguyen, Xiangyuan Wang, Mohan Liu, Lin Wang

机构 * EmPACT Lab, School of EEE, Nanyang Technological University(电气与电子工程学院电磁脉冲与天线研究室,南洋理工大学) The University of Hong Kong(香港大学)

AI总结 本文针对无监督多模态语义分割问题,提出基于DINOv3的UniM2框架,通过跨模态对应协同学习统一潜在空间提取语义线索,并引入跨模态协调器缓解冲突,实验证明该框架相比现有框架有明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏