arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-07-10 至 2026-07-10 共收录 14
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08572 2026-07-10 cs.CV 新提交

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner:通过强化学习在多任务混合中学习何时思考

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

机构 * Wuhan University(武汉大学) Xiaomi Inc(小米公司) Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08375 2026-07-10 cs.CV cs.AI 新提交

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

机构 * Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08354 2026-07-10 cs.RO 新提交

SkillPlug: Unsupervised Skill Mining for Few-Shot Adaptation in Robotic Manipulation

SkillPlug:用于机器人操作中少样本适应的无监督技能挖掘

Zi-han Ding, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 针对机器人操作中学习可转移视觉运动模仿策略的挑战,提出SkillPlug框架,通过技能调节模块挖掘共享可转移技能库,经自监督学习形成任务共享先验,微调轻量级组件实现少样本适应,提升多任务和少样本适应性能。

Comments 8 pages, 8 figures, published to RA-L

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 8, pp. 9511-9518, Aug. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08014 2026-07-10 cs.CV cs.LG 新提交

FedTR: Federated Learning Framework with Transfer Learning for Industrial Visual Inspection

FedTR:用于工业视觉检测的带迁移学习的联邦学习框架

Vikash Sathiamoorthy, Shuo Huai, Hao Kong, Di Liu, Wendy Yong Yi Loy, Christian Makaya, Daren Ho, Ravi Subramaniam, Qian Lin, Weichen Liu

机构 * HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(惠普-南洋理工大学数字制造联合实验室,南洋理工大学) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Department of Computer Science, Norwegian University of Science and Technology(挪威科技大学计算机科学系) HP Inc.(惠普公司) HP Singapore(惠普新加坡公司)

AI总结 针对工业视觉检测中数据有限和任务复杂影响模型性能的问题,提出FedTR框架,结合迁移学习,先利用公开数据集训练,再在私有数据上微调,实验证明该方法在标签缺陷识别上有效,准确率高且性能与集中训练相当。

Comments Author's accepted version. Published in Proceedings of the Great Lakes Symposium on VLSI 2024 (GLSVLSI '24)

Journal ref Proceedings of the Great Lakes Symposium on VLSI 2024 (GLSVLSI '24), pp. 310-314, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07830 2026-07-10 cs.RO 新提交

Physics-Guided Biomechanical Gait Adaptation for Humanoid Locomotion on Extreme Sloped Terrains

用于类人机器人在极端倾斜地形上运动的物理引导生物力学步态适应

Xuanyu Chen, Mohan Liu, Dengchen Mei, Zhihao Gu, Haitian Zhang, Kaimin Mao, Haiyue Zhu, Shijun Yan, Lin Wang

机构 * Nanyang Technological University(南洋理工大学) A*STAR(新加坡科技研究局)

AI总结 研究类人机器人在极端倾斜地形的运动控制问题,提出HumoSlope两阶段物理引导框架,第一阶段建立平衡先验,第二阶段引入BSGA调节奖励,实现对不同坡度地形的适应,实验验证了该方法的有效性。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03715 2026-07-10 cs.CV 新提交

Leveraging Pathology Co-occurrence for Test-Time Adaptation in Chest X-Ray Diagnosis

利用病理学共现进行胸部X光诊断的测试时适应

Woojin Jeong, Yujin Choi, Dongbin Kim, Soyeon Park, Jaewook Lee

机构 * Seoul National University(首尔国立大学) Nanyang Technological University(南洋理工大学) UNIST(蔚山科学技术院)

AI总结 研究针对医学影像模型在新临床地点性能下降问题,提出共现加权适应(CoWA)方法,利用疾病共现模式作适应可靠性信号,估计标签共现结构并降低偏离模式样本权重,在胸部X光基准测试中优于基线。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13376 2026-07-10 cs.CV cs.AI cs.CL 版本更新

An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

用于流程图图像到代码生成的在线无参考评估框架

Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO Singapore(AUMOVIO新加坡) VinUniversity(文理大学)

AI总结 针对流程图图像到代码生成在生产中无真实代码难以评估输出质量的问题,提出无参考评估框架,通过RecallOCR和PrecisionVE两个指标及调和均值F1OCR-VE监测生成质量,在FlowVQA数据集验证了其可靠性。

Comments This manuscript was inadvertently made publicly available before all necessary internal review processes had been completed. The authors are withdrawing the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-07-10 cs.CV 版本更新

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08394 2026-07-10 cs.NE cs.LG 版本更新

($θ_l, θ_u$)-Parametric Multi-Task Optimization: Joint Search in Solution and Infinite Task Spaces

($θ_l, θ_u$)-参数化多任务优化:解空间和无限任务空间中的联合搜索

Tingyang Wei, Jiao Liu, Abhishek Gupta, Puay Siew Tan, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Mechanical Sciences, Indian Institute of Technology, Goa(印度理工学院 Goa 学校机械科学系) Singapore Institute of Manufacturing Technology (SIMTech), Agency for Science, Technology and Research(新加坡制造技术研究所(SIMTech),科技研究局) National Research Foundation, Singapore(新加坡国家研究基金会) DSO National Laboratories under the AI Singapore Programme(AI新加坡计划下的DSO国家实验室) Anusandhan National Research Foundation, Government of India(印度政府阿努桑达恩国家研究基金会)

AI总结 研究非固定且可能无限的参数化任务空间中的多任务优化问题,提出($\boldsymbol{\theta}_l$, $\boldsymbol{\theta}_u$)-PMTO算法,通过创建近似模型在解空间和任务空间联合搜索,验证算法在合成测试和实际案例中的有效性及适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15723 2026-07-10 cs.CV 版本更新

GSurf: Learning Signed Distance Fields from Splatting Opaque Gaussians for High-quality 3D Reconstruction

GSurf:通过对不透明高斯点进行体素化学习有符号距离场以实现高质量3D重建

Baixin Xu, Jiangbei Hu, Jiaze Li, Ying He

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Software, Dalian University of Technology(大连理工大学软件学院)

AI总结 本文针对多视图图像高保真表面重建问题,提出将有符号距离场集成到体素化管道的框架,利用SDF连续性规范高斯基元,填补空洞、抑制噪声,借助体素化效率实现快速收敛,能以更少基元生成高质量表面。

Comments see https://github.com/xubaixinxbx/Gsurf

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01560 2026-07-10 cs.CV 版本更新

XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition

XOV-Action:迈向可泛化的开放词汇动作识别

Kun-Yu Lin, Henghui Ding, Jia-Run Du, Jiaming Zhou, Yi-Xing Peng, Yu-Ming Tang, Zhilin Zhao, Chen Change Loy, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏