arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-07-10 至 2026-07-10 共收录 7
2606.30308 2026-07-10 cs.CV 版本更新

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13376 2026-07-10 cs.CV cs.AI cs.CL 版本更新

An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

用于流程图图像到代码生成的在线无参考评估框架

Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO Singapore(AUMOVIO新加坡) VinUniversity(文理大学)

AI总结 针对流程图图像到代码生成在生产中无真实代码难以评估输出质量的问题,提出无参考评估框架,通过RecallOCR和PrecisionVE两个指标及调和均值F1OCR-VE监测生成质量,在FlowVQA数据集验证了其可靠性。

Comments This manuscript was inadvertently made publicly available before all necessary internal review processes had been completed. The authors are withdrawing the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-07-10 cs.CV 版本更新

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08394 2026-07-10 cs.NE cs.LG 版本更新

($θ_l, θ_u$)-Parametric Multi-Task Optimization: Joint Search in Solution and Infinite Task Spaces

($θ_l, θ_u$)-参数化多任务优化:解空间和无限任务空间中的联合搜索

Tingyang Wei, Jiao Liu, Abhishek Gupta, Puay Siew Tan, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Mechanical Sciences, Indian Institute of Technology, Goa(印度理工学院 Goa 学校机械科学系) Singapore Institute of Manufacturing Technology (SIMTech), Agency for Science, Technology and Research(新加坡制造技术研究所(SIMTech),科技研究局) National Research Foundation, Singapore(新加坡国家研究基金会) DSO National Laboratories under the AI Singapore Programme(AI新加坡计划下的DSO国家实验室) Anusandhan National Research Foundation, Government of India(印度政府阿努桑达恩国家研究基金会)

AI总结 研究非固定且可能无限的参数化任务空间中的多任务优化问题,提出($\boldsymbol{\theta}_l$, $\boldsymbol{\theta}_u$)-PMTO算法,通过创建近似模型在解空间和任务空间联合搜索,验证算法在合成测试和实际案例中的有效性及适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15723 2026-07-10 cs.CV 版本更新

GSurf: Learning Signed Distance Fields from Splatting Opaque Gaussians for High-quality 3D Reconstruction

GSurf:通过对不透明高斯点进行体素化学习有符号距离场以实现高质量3D重建

Baixin Xu, Jiangbei Hu, Jiaze Li, Ying He

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Software, Dalian University of Technology(大连理工大学软件学院)

AI总结 本文针对多视图图像高保真表面重建问题,提出将有符号距离场集成到体素化管道的框架,利用SDF连续性规范高斯基元,填补空洞、抑制噪声,借助体素化效率实现快速收敛,能以更少基元生成高质量表面。

Comments see https://github.com/xubaixinxbx/Gsurf

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01560 2026-07-10 cs.CV 版本更新

XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition

XOV-Action:迈向可泛化的开放词汇动作识别

Kun-Yu Lin, Henghui Ding, Jia-Run Du, Jiaming Zhou, Yi-Xing Peng, Yu-Ming Tang, Zhilin Zhao, Chen Change Loy, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏