arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-07-14 至 2026-07-14 共收录 6
2607.08164 2026-07-14 cs.CV 版本更新

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11637 2026-07-14 cs.AI 版本更新

TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation

TouchThinker: 通过大规模数据和动作感知表示将触觉常识推理扩展到开放世界

Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Xiamen University(厦门大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 提出TouchThinker框架,通过构建百万级多源触觉数据集TouchThinker-1M和动作感知建模,将触觉常识推理扩展到开放世界,在多个数据集上取得竞争性表现。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06280 2026-07-14 cs.CV 版本更新

Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency

欧拉运动引导:基于双向几何一致性的鲁棒图像动画

Thong Nguyen, Khoi M. Le, Cong-Duy Nguyen, Luu Anh Tuan, See-Kiong Ng, Chunyan Miao

机构 * National University of Singapore(新加坡国立大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心) Nanyang Technological University(南洋理工大学)

AI总结 提出使用相邻帧欧拉运动场引导生成,并通过双向几何一致性机制解决遮挡问题,实现加速训练、保持时间连贯性和减少动态伪影。

Comments Accepted by ACM MM 2026. Code is available at https://github.com/nguyentthong/eulerian_motion_guidance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01581 2026-07-14 cs.CV 版本更新

Satellite-Free Training for Drone-View Geo-Localization

无需卫星的无人机视角地理定位

Tao Liu, Yingzhi Zhang, Kan Ren, Xiaoqi Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) University of Tsukuba(筑波大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出无需卫星数据的训练框架,通过三维场景重建、伪正射影像生成和特征聚合,提升无人机在无GPS环境下的地理定位性能。

Comments Withdrawn by the authors to allow for substantial revision in light of valuable reviewer feedback. A thoroughly revised version may be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10504 2026-07-14 cs.CL 版本更新

DR-Arena: an Automated Evaluation Framework for Deep Research Agents

DR-Arena:深度研究智能体的自动化评估框架

Yiwen Gao, Ruochen Zhao, Yang Deng, Wenxuan Zhang

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 针对大语言模型作深度研究智能体时任务性能评估难的问题,提出DR-Arena自动化评估框架,通过动态调查、构建实时信息树、自动考官出题及自适应进化循环提升任务复杂性来评估,实验证明其与人类偏好对齐效果好,可替代人工裁决。

Comments 22 pages, 8 figures. Accepted to ACL 2026 as an oral presentation and selected as an SAC Highlight

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 27130-27152, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22036 2026-07-14 cs.LG cs.MM 版本更新

Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全

Ying Zhang, Yu Zhao, Xuhui Sui, Baohang Zhou, Xiangrui Cai, Li Shen, Xiaojie Yuan, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) School of Software, Tiangong University(软件学院、天津工业大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)

AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。

Comments Published in IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏