arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2380
2607.08014 2026-07-10 cs.CV cs.LG 新提交

FedTR: Federated Learning Framework with Transfer Learning for Industrial Visual Inspection

FedTR:用于工业视觉检测的带迁移学习的联邦学习框架

Vikash Sathiamoorthy, Shuo Huai, Hao Kong, Di Liu, Wendy Yong Yi Loy, Christian Makaya, Daren Ho, Ravi Subramaniam, Qian Lin, Weichen Liu

机构 * HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(惠普-南洋理工大学数字制造联合实验室,南洋理工大学) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Department of Computer Science, Norwegian University of Science and Technology(挪威科技大学计算机科学系) HP Inc.(惠普公司) HP Singapore(惠普新加坡公司)

AI总结 针对工业视觉检测中数据有限和任务复杂影响模型性能的问题,提出FedTR框架,结合迁移学习,先利用公开数据集训练,再在私有数据上微调,实验证明该方法在标签缺陷识别上有效,准确率高且性能与集中训练相当。

Comments Author's accepted version. Published in Proceedings of the Great Lakes Symposium on VLSI 2024 (GLSVLSI '24)

Journal ref Proceedings of the Great Lakes Symposium on VLSI 2024 (GLSVLSI '24), pp. 310-314, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07830 2026-07-10 cs.RO 新提交

Physics-Guided Biomechanical Gait Adaptation for Humanoid Locomotion on Extreme Sloped Terrains

用于类人机器人在极端倾斜地形上运动的物理引导生物力学步态适应

Xuanyu Chen, Mohan Liu, Dengchen Mei, Zhihao Gu, Haitian Zhang, Kaimin Mao, Haiyue Zhu, Shijun Yan, Lin Wang

机构 * Nanyang Technological University(南洋理工大学) A*STAR(新加坡科技研究局)

AI总结 研究类人机器人在极端倾斜地形的运动控制问题,提出HumoSlope两阶段物理引导框架,第一阶段建立平衡先验,第二阶段引入BSGA调节奖励,实现对不同坡度地形的适应,实验验证了该方法的有效性。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03715 2026-07-10 cs.CV 新提交

Leveraging Pathology Co-occurrence for Test-Time Adaptation in Chest X-Ray Diagnosis

利用病理学共现进行胸部X光诊断的测试时适应

Woojin Jeong, Yujin Choi, Dongbin Kim, Soyeon Park, Jaewook Lee

机构 * Seoul National University(首尔国立大学) Nanyang Technological University(南洋理工大学) UNIST(蔚山科学技术院)

AI总结 研究针对医学影像模型在新临床地点性能下降问题,提出共现加权适应(CoWA)方法,利用疾病共现模式作适应可靠性信号,估计标签共现结构并降低偏离模式样本权重,在胸部X光基准测试中优于基线。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13376 2026-07-10 cs.CV cs.AI cs.CL 版本更新

An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

用于流程图图像到代码生成的在线无参考评估框架

Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO Singapore(AUMOVIO新加坡) VinUniversity(文理大学)

AI总结 针对流程图图像到代码生成在生产中无真实代码难以评估输出质量的问题,提出无参考评估框架,通过RecallOCR和PrecisionVE两个指标及调和均值F1OCR-VE监测生成质量,在FlowVQA数据集验证了其可靠性。

Comments This manuscript was inadvertently made publicly available before all necessary internal review processes had been completed. The authors are withdrawing the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-07-10 cs.CV 版本更新

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08394 2026-07-10 cs.NE cs.LG 版本更新

($θ_l, θ_u$)-Parametric Multi-Task Optimization: Joint Search in Solution and Infinite Task Spaces

($θ_l, θ_u$)-参数化多任务优化:解空间和无限任务空间中的联合搜索

Tingyang Wei, Jiao Liu, Abhishek Gupta, Puay Siew Tan, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Mechanical Sciences, Indian Institute of Technology, Goa(印度理工学院 Goa 学校机械科学系) Singapore Institute of Manufacturing Technology (SIMTech), Agency for Science, Technology and Research(新加坡制造技术研究所(SIMTech),科技研究局) National Research Foundation, Singapore(新加坡国家研究基金会) DSO National Laboratories under the AI Singapore Programme(AI新加坡计划下的DSO国家实验室) Anusandhan National Research Foundation, Government of India(印度政府阿努桑达恩国家研究基金会)

AI总结 研究非固定且可能无限的参数化任务空间中的多任务优化问题,提出($\boldsymbol{\theta}_l$, $\boldsymbol{\theta}_u$)-PMTO算法,通过创建近似模型在解空间和任务空间联合搜索,验证算法在合成测试和实际案例中的有效性及适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15723 2026-07-10 cs.CV 版本更新

GSurf: Learning Signed Distance Fields from Splatting Opaque Gaussians for High-quality 3D Reconstruction

GSurf:通过对不透明高斯点进行体素化学习有符号距离场以实现高质量3D重建

Baixin Xu, Jiangbei Hu, Jiaze Li, Ying He

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Software, Dalian University of Technology(大连理工大学软件学院)

AI总结 本文针对多视图图像高保真表面重建问题,提出将有符号距离场集成到体素化管道的框架,利用SDF连续性规范高斯基元,填补空洞、抑制噪声,借助体素化效率实现快速收敛,能以更少基元生成高质量表面。

Comments see https://github.com/xubaixinxbx/Gsurf

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01560 2026-07-10 cs.CV 版本更新

XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition

XOV-Action:迈向可泛化的开放词汇动作识别

Kun-Yu Lin, Henghui Ding, Jia-Run Du, Jiaming Zhou, Yi-Xing Peng, Yu-Ming Tang, Zhilin Zhao, Chen Change Loy, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07320 2026-07-09 cs.CV 新提交

SoccerNet 2026 Challenges Results

SoccerNet 2026挑战结果

Anthony Cioppa, Silvio Giancola, Håkan Ardö, Mohamad Dalal, Jan Held, Jérémie Ochin, Jiayuan Rao, Karen Sanchez, Renaud Vandeghen, Artur Xarles, Olivier Barnich, Albert Clapés, Mathieu Delvaux, Sergio Escalera, Bernard Ghanem, Cédric Hons, Antoine Houet, Sotiris Manitsaris, Tom Michel, Pierre Miralles, Thomas B. Moeslund, Mikael Nilsson, Bogdan Stanciulescu, Marc Van Droogenbroeck, Yanfeng Wang, Weidi Xie, Faisal Altawijri, Mohamed Atef, Semen Budennyy, Vasiliy Chelpanov, Puhua Chen, Yixin Chen, Lechao Cheng, Jianling Chu, Ju-Seong Do, Oleg Durygin, Omar Fetouh, Mirco Fuchs, Youssef Ghallab, Falguni Ghosh, Wonjun Heo, Yufeng Hu, Weixuan Huang, Phuong-Linh Huynh-Ha, Matvey Isupov, Yangguang Ji, Siyuan Jiang, Zhenxiang Jiang, Wonyong Jo, Ho-Young Jung, SeongHeon Kang, MinJae Kim, Youngseon Kim, Jakub Komosa, Artem Konshin, Trung-Hoang Le, Jongmin Lee, Lingling Li, Litao Li, Vadim Linkov, Fang Liu, Haoxuan Ma, Shun Makino, Ismail Mathkour, Konstantin Mitin, Mikhail Moiseev, Takumi Nagaya, Yuki Nakamura, Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Trong-Thuan Nguyen, Christian Orduz, Kwanyong Park, Fabian Perez, Parthsarthi Rawat, SuHyun Rim, Hoover Rueda-Chacón, Atom Scott, Minori Sugimura, Yuyang Sun, Shengeng Tang, Minh-Triet Tran, Ikuma Uchida, Juan Vanegas, Thanh-Nhan Vo, Jiangtao Wang, Yaxiong Wang, Xiaogang Wang, Ruifeng Wang, Rio Watanabe, Jiali Wen, Yongliang Wu, Di Yang, Xu Yang, Zhuo Yang, Xinyu Ye, Yibo Yu, Zihan Zhai, Yu Zhang, Zhenyu Zhao, Zhun Zhong, Yixi Zhou, Xingyu Zhu, Wenbo Zhu, Julian Ziegler

机构 * University of Liège(列日大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Spiideo(斯皮迪奥公司) Aalborg University(奥尔堡大学) SpAItial(斯帕蒂亚尔公司) Center for Robotics, Mines Paris, PSL(巴黎矿业学院机器人中心(巴黎文理研究大学)) Footovision(Footovision公司) Shanghai Jiao Tong University(上海交通大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) EVS Broadcast Equipment(EVS广播设备公司) Pioneer Center for Artificial Intelligence(先锋人工智能中心) Lund University(隆德大学) TAHAKOM(TAHAKOM公司) Mohamed Bin Zayed University for Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Sber AI(Sber人工智能公司) Salute For Business(Salute For Business公司) Intelligent Perception and Image Understanding Lab, Xidian University(西安电子科技大学智能感知与图像理解实验室) South China University of Technology(华南理工大学) Hefei University of Technology(合肥工业大学) Kyungpook National University(庆北国立大学) Leipzig University of Applied Sciences(莱比锡应用科学大学) Friedrich-Alexander University Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) University of Seoul(首尔大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Nanjing University(南京大学) University of Science, Ho Chi Minh City(胡志明市科技大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

AI总结 SoccerNet 2026挑战涵盖五项体育视频理解视觉任务,为每项任务提供数据、协议和基线。众多团队参与,本文介绍任务、评估协议,展示排行榜并总结领先提交内容,记录各任务当前状态。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07187 2026-07-09 cs.CV 新提交

EditVerse3D: High-Quality 3D Object Editing with Region-Aware Learning

EditVerse3D:基于区域感知学习的高质量3D对象编辑

Youtan Yin, Yanning Zhou, Jiacheng Wei, Xiaofeng Yang, Jun Zhang, Jiayang Bai, Jingwen Ye, Weidong Zhang, Guosheng Lin

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Tencent AIPD(腾讯人工智能产品部)

AI总结 针对3D对象局部编辑难题,EditVerse3D框架输入3D对象、粗略边界框和参考2D图像,利用区域感知自适应损失及数据增强技术,输出高质量编辑对象,实验证明其性能优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://editverse3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07178 2026-07-09 cs.LG cs.AI 新提交

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

多任务智能强化学习的熵步长策略优化

Zetian Hu, Shunyu Liu, Junjie Zhang, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07101 2026-07-09 cs.RO cs.AI 新提交

GeoProp: Grounding Robot State in Vision for Generalist Manipulation

GeoProp:将机器人状态在视觉中进行定位以实现通用操作

Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 研究针对机器人操作中本体感觉与视觉缺乏有效对齐问题,提出轻量级GeoProp适配器,通过几何定位、特征采样及FiLM调制等使两者对齐,在多任务中提升策略性能,是具身策略的简单高效归纳偏差。

Comments 21 pages, 8 figures, 11 tables. Project page: https://alibaba-damo-academy.github.io/GeoProp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06982 2026-07-09 cs.CV cs.AR cs.LG 新提交

EdgeCompress: Coupling Multidimensional Model Compression and Dynamic Inference for EdgeAI

EdgeCompress:用于边缘人工智能的多维模型压缩与动态推理耦合

Hao Kong, Di Liu, Shuo Huai, Xiangzhong Luo, Ravi Subramaniam, Christian Makaya, Qian Lin, Weichen Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(惠普-南洋理工大学数字制造联合实验室) Department of Computer Science, Norwegian University of Science and Technology(挪威科技大学计算机科学系) HP Inc.(惠普公司)

AI总结 研究针对卷积神经网络在嵌入式设备部署的计算成本问题,提出EdgeCompress框架,通过动态图像裁剪和复合收缩进行多维模型压缩,结合动态推理框架,有效减少计算冗余,提高推理效率,实验证明该框架能显著提升模型性能。

Comments Author's accepted version. Published in IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems (TCAD)

Journal ref IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems, vol. 42, no. 12, pp. 4657-4670, Dec. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06922 2026-07-09 cs.LG cs.CV 新提交

Latency-Constrained DNN Architecture Learning for Edge Systems using Zerorized Batch Normalization

使用零化批归一化的边缘系统延迟受限深度神经网络架构学习

Shuo Huai, Di Liu, Hao Kong, Weichen Liu, Ravi Subramaniam, Christian Makaya, Qian Lin

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) HP-NTU Digital Manufacturing Corporate Lab(HP-NTU数字制造企业实验室) Department of Computer Science(计算机科学系) Norwegian University of Science and Technology(挪威科学技术大学) HP Inc.(惠普公司)

AI总结 针对边缘系统中深度学习应用的延迟问题,提出面向延迟的神经网络学习方法,引入延迟预测器,经实验验证该方法能在满足延迟约束时实现高精度,且在多个数据集和设备上有良好表现,还开源了框架。

Comments 15 pages. Author's accepted manuscript, published in Future Generation Computer Systems

Journal ref Future Generation Computer Systems, Volume 142, Pages 314-327, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06915 2026-07-09 cs.CV cs.AR cs.LG 新提交

Smart Scissor: Coupling Spatial Redundancy Reduction and CNN Compression for Embedded Hardware

智能剪刀:耦合空间冗余减少与CNN压缩用于嵌入式硬件

Hao Kong, Di Liu, Shuo Huai, Xiangzhong Luo, Weichen Liu, Ravi Subramaniam, Christian Makaya, Qian Lin

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University(惠普-南洋理工大学数字制造联合实验室) HP Inc.(惠普公司)

AI总结 研究针对CNN计算开销大问题,提出动态图像裁剪框架减少空间冗余,引入轻量级前景预测器实现精细裁剪,还提出复合收缩策略压缩CNN三维,将两者结合成Smart Scissor框架,有效降低计算开销并保持高精度。

Comments 9 pages, 9 figures. Author's version, accepted by and published in ICCAD 2022. Copyright 2022 ACM

Journal ref Proceedings of the 41st IEEE/ACM International Conference on Computer-Aided Design (ICCAD '22), Article 109, pp. 1-9, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18664 2026-07-09 cs.SD cs.AI 新提交

NeuralMUSIC: A Hybrid Neural-Subspace Framework for Robot Sound Source Localization

NeuralMUSIC: 一种用于机器人声源定位的混合神经-子空间框架

Yizhuo Yang, Junqiao Fan, Shenghai Yuan, Lihua Xie

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 提出NeuralMUSIC混合框架,结合神经网络估计空间协方差矩阵与经典MUSIC子空间方法,通过频率注意力融合和自监督学习提升机器人声源定位的鲁棒性和跨域泛化能力。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14208 2026-07-09 physics.optics cs.LG math.OC physics.comp-ph 版本更新

ML-based approach to classification and generation of structured light propagation in turbulent media

基于机器学习的湍流介质中结构光传播分类与生成方法

Aokun Wang, Anjali Nair, Zhongjian Wang, Guillaume Bal

机构 * Division of Mathematical Sciences, Nanyang Technological University(南洋理工大学数学科学系) Committee on Computational and Applied Mathematics, University of Chicago(芝加哥大学计算与应用数学委员会) Departments of Statistics and Mathematics, University of Chicago(芝加哥大学统计学与数学系)

AI总结 本文提出基于机器学习的结构光在湍流中传播的分类与生成方法,利用随机斑点扰动建模传播过程,并通过生成扩散模型增强数据集。

Journal ref Journal of the Optical Society of America A (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06150 2026-07-09 cs.RO

Delta6: A Low-Cost, 6-DOF Force-Sensing Flexible End-Effector

Delta6: 一种低成本的六自由度力感知柔性末端执行器

Yue Feng, Weicheng Huang, Chen Qiu, Huixu Dong, I-Ming Chen

机构 * Nanyang Technological University(南洋理工大学) WinGs Robotics LLC Zhejiang University(浙江大学) Maider Medical Industry Equipment Company, Ltd.(迈德医疗工业设备有限公司)

AI总结 Delta6是一种低成本六自由度力感知柔性末端执行器,结合拮抗弹簧与磁编码器实现高精度力矩感知,具备简单组装和耐用性,通过参数分析模型可扩展性能,支持多种计算平台,验证其在复杂任务中的鲁棒性。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE/ASME Transactions on Mechatronics, pp. 1-12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02999 2026-07-09 cs.CR cs.AI 版本更新

NonTextual Target Attack

非文本目标攻击

Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone, Binjiang Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区,滨江区块链与数据安全研究院) School of Cyberspace Security, Nanjing University of Science and Technology(网络安全学院,南京理工大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡国立大学) King Abdullah University of Science and Technology (KAUST)(卡布斯科学与技术大学)

AI总结 针对现有大语言模型越狱攻击的局限,提出非文本目标攻击NTA,通过非文本约束目标最大化不安全概率,分解目标便于优化,扩展攻击空间,在AdvBench上对安全对齐的大语言模型仅100次迭代,平均成功率达96.8%,性能远超现有攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06319 2026-07-08 cs.CV 新提交

Synthetic-to-Real Translation for Class-Agnostic Motion Prediction

用于类别无关运动预测的合成到真实翻译

Yizheng Wu, Hongwei Fan, Kewei Wang, Ruibo Li, Xingyi Li, Xiao Song, Zhe Wang, Chenjing Ding, Dongliang Wang, Zhiguo Cao, Guosheng Lin

机构 * Key Laboratory of Image Processing and Intelligent Control, Ministry of Education, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(图像处理与智能控制教育部重点实验室,华中科技大学人工智能与自动化学院) Nanyang Technological University(南洋理工大学) SenseAuto(未知(保留英文))

AI总结 研究针对运动预测中合成到真实翻译的问题,提出将运动知识翻译框架与目标感知运动预测、目标辅助运动增强两个组件集成的方法,还生成了Motion4D数据集,实验证明该方法有效弥合域差距,在真实场景表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06165 2026-07-08 cs.RO 新提交

EAGOR: Embodied Reasoning in Omni-direction

EAGOR:全方位的具身推理

Shriram Damodaran, Soumyaratna Debnath, Yan Wu, Wei-Yun Yau, Addison Lin Wang

机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)

AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。

Comments 12 Pages, 7 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05841 2026-07-08 cs.HC cs.AI 新提交

VisTCP: A Visualization Framework to Construct Knowledge-Graph-Based Representation for Traditional Chinese Painting

VisTCP:一种用于构建基于知识图谱的中国传统绘画表示的可视化框架

Zhiguang Zhou, Fengling Zheng, Miaoxin Hu, Lina You, Jin Wen, Huan Liu, Wei Zhang, Dekun Qian, Yuhua Liu, Wei Chen, Yigang Wang, Yong Wang

机构 * School of Media and Design, Hangzhou Dianzi University(杭州电子科技大学媒体与设计学院) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 针对中国传统绘画语义理解难题,提出VisTCP框架,结合智能模型与专家知识,通过构建语义分类法、训练模型、设计可视化视图,实现人在回路的迭代优化,有效支持TCP的结构化表示和语义理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05780 2026-07-08 cs.RO cs.AI cs.CV 新提交

FORGE: Towards Functional Tool-Use Generalization via Keypoint Trajectory Reasoning

FORGE:通过关键点轨迹推理实现功能工具使用的泛化

Chuhao Zhou, Liquan Wang, Shuxin Cao, Xiangyu Chen, Yuxuan Hu, Boyu Ma, Animesh Garg, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对机器人功能工具使用泛化问题,提出FORGE两阶段策略,通过关键点轨迹推理解耦功能推理与动作执行,在七工具击打基准测试中,对未见工具表现优于现有方法,平均成功率显著提升。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05759 2026-07-08 cs.DS cs.AI cs.DM 新提交

Data-dependent Evaluations for Budgeted Submodular Maximization

带预算约束的次模最大化的数据依赖评估

Lejian Zhang, Xueyan Tang, Jing Tang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou), China(香港理工大学(广州)数据科学与分析方向)

AI总结 针对带背包约束的次模最大化问题,开发新的数据依赖上界,理论证明其优于最优解,通过真实数据集实验验证其在评估解与最优解接近程度上的优势。

Comments Extended version of a paper that will appear in ESA 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03949 2026-07-08 cs.RO 版本更新

Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation

偏好校准的人机协同强化学习用于机器人操作

Zeyi Liu, Guangyao Liu, Yinuo Qu, Yuquan Xue, Bofang Jia, Chunhua Yang, Weihua Gui, Keke Huang, Ziwei Wang

机构 * Central South University(中南大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 提出PACT框架,通过干预隐式偏好信号进行信用重分配和策略对齐,提升人机协同强化学习的样本效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24690 2026-07-08 cs.CV 版本更新

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

UniICL:通过能力导向的分类系统化统一多模态上下文学习

Yicheng Xu, Jiangning Zhang, Zhucun Xue, Teng Hu, Ran Yi, Xiaobin Hu, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出能力导向的分类系统,通过构建UniICL-760K语料库和UniICL-Bench评估体系,提出Context-Adaptive Prototype Modulator模块,提升多模态少样本学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏