arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-04-20 至 2026-04-20 共收录 11
2604.16256 2026-04-20 cs.CV cs.CL

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15823 2026-04-20 cs.CV

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

像人类一样看电影:面向具身陪伴的视角中心情绪理解

Ze Dong, Hao Shi, Zejia Gao, Zhonghua Yi, Kaiwei Wang, Lin Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学, 新加坡) Zhejiang University, China(浙江大学, 中国) Ant Group, China(蚂蚁集团, 中国) MirrorMe, China(MirrorMe, 中国)

AI总结 本文提出EgoScreen-Emotion基准数据集,用于视角中心电影情绪理解,通过多标签标注和长上下文模型提升跨域泛化能力,实验显示基于传统电影数据的模型在真实视角观看场景中性能显著下降。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15741 2026-04-20 cs.CL cs.AI

Learning Uncertainty from Sequential Internal Dispersion in Large Language Models

从大型语言模型中的序列内部分散性中学习不确定性

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心)

AI总结 本文提出SIVR框架,通过利用隐藏状态中的token和层级特征,以更基本的假设来估计不确定性,从而提高hallucination检测的准确性和泛化能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15715 2026-04-20 cs.CL cs.AI

GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

GTA-2: 从原子工具使用到开放性工作流的通用工具代理基准测试

Jize Wang, Xuanxuan Liu, Yining Li, Songyang Zhang, Yijun Wang, Zifei Shan, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

AI总结 本文提出GTA-2基准测试,涵盖原子工具使用和开放性工作流,通过递归检查点机制评估模型能力和执行框架,揭示了前沿模型在复杂任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15707 2026-04-20 cs.CV

LP$^{2}$DH: A Locality-Preserving Pixel-Difference Hashing Framework for Dynamic Texture Recognition

LP$^{2}$DH:一种用于动态纹理识别的局部性保持像素差哈希框架

Ruxin Ding, Jianfeng Ren, Heng Yu, Jiawei Li, Xudong Jiang

机构 * School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

AI总结 本文提出LP$^{2}$DH框架,通过联合编码像素差实现紧凑二进制码,结合局部保持嵌入和曲面搜索策略,提升动态纹理识别性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15609 2026-04-20 cs.LG cs.CV

Adapting in the Dark: Efficient and Stable Test-Time Adaptation for Black-Box Models

在黑暗中适应:为黑盒模型提供高效稳定的测试时适应

Yunbei Zhang, Shuaicheng Niu, Chengyi Cai, Feng Liu, Jihun Hamm

机构 * Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) The University of Melbourne(墨尔本大学)

AI总结 本文提出BETA框架,通过轻量级白盒引导模型和预测和谐化技术,实现高效稳定的黑盒测试时适应,无需额外API调用,且在ImageNet-C和商业API上均取得优异性能。

Comments Third Workshop on Test-Time Updates (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11490 2026-04-20 cs.AI cs.CL cs.CV

Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

人为区域适应于多模态视觉-语言模型

Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan

机构 * Cohere SEACrowd AI Singapore Universiti Teknologi PETRONAS Oracle Carnegie Mellon University(卡内基梅隆大学) Monash University, Indonesia(莫纳什大学(印尼)) King Mongkut’s University of Technology Thonburi(泰国孔敬大学) Nara Institute of Science and Technology(奈良科学技術大學) Stanford University(斯坦福大学) MBZUAI National University of Singapore(新加坡国立大学) Monash University, Australia(莫纳什大学(澳大利亚)) Brown University(布朗大学) University of Bath(巴斯大学) Mila - Quebec AI Institute(蒙特利尔AI研究所) Institut Teknologi Bandung(Bandung 工程技术大学) Ateneo de Manila University(马尼拉亚特内奥大学) Universitas Pelita Harapan(Pelita Harapan 大学) Seoul National University of Science and Technology(首尔科学技术大学) Thammasat University(泰国 Thammasat 大学) Independent(独立) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) MiroMind AI University of Indonesia(印度尼西亚大学) University of New Haven(纽黑文大学) INTI International University and Colleges(INTI 国际大学和学院) Binus University(Binus 大学) National University Philippines(菲律宾国家大学) ThoughtFull

AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09689 2026-04-20 cs.CR cs.AI

When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models

当搜索出错时:针对具有网络搜索功能的大型语言模型的红队测试

Haoran Ou, Kangjie Chen, Xingshuo Han, Gelei Deng, Jie Zhang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Nanjing University of Aeronautics(南京航空航天大学) Tsinghua University, China(清华大学)

AI总结 本文提出CREST-Search框架,针对具有网络搜索功能的LLM的安全性问题,通过三种新型攻击策略和迭代上下文优化机制,揭示网络搜索带来的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16315 2026-04-20 cs.CV cs.CL

SignX: Continuous Sign Recognition in Compact Pose-Rich Latent Space

SignX:在紧凑的姿态丰富潜在空间中实现连续手语识别

Sen Fang, Yalin Feng, Chunyu Sui, Hongbin Zhong, Yanxin Zhang, Hongwei Yi, Hezhen Hu, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Nanyang Technological University(南洋理工大学) Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出SignX框架,通过统一潜在表示和ViT模型实现高效连续手语识别,显著降低计算消耗并在翻译任务中达到SOTA准确率。

Comments 33 pages, CSLR SOTA (2026). More demo at https://signerx.github.io/SignX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05578 2026-04-20 cs.CV cs.RO

Scalable Unseen Objects 6-DoF Absolute Pose Estimation with Robotic Integration

可扩展的未知物体六自由度绝对位姿估计与机器人集成

Jian Liu, Wei Sun, Kai Zeng, Jin Zheng, Hui Yang, Hossein Rahmani, Ajmal Mian, Lin Wang

机构 * National Engineering Research Center for Robot Visual Perception and Control Technology, School of Artificial Intelligence and Robotics, Hunan University(机器人视觉感知与控制技术国家工程研究中心,人工智能与机器人学院,湖南大学) School of Architecture and Art, Central South University(建筑与艺术学院,中南大学) School of Computing and Communications, Lancaster University(计算与通讯学院,兰卡斯特大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学)

AI总结 本文提出SinRef-6D方法,通过单张姿态标注的RGB-D图像实现未知物体六自由度位姿估计,利用状态空间模型解决大位姿差异和单视角信息有限的问题,实验验证其在多个基准和真实场景中的优越可扩展性。

Comments Accepted by TRO 2026, 18 pages, 9 figures

Journal ref IEEE Transactions on Robotics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04300 2026-04-20 cs.CV cs.AI

T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts

T2I-FactualBench:基于知识密集概念的文本到图像模型事实性评估基准

Ziwei Huang, Wanggui He, Quanyu Long, Yandi Wang, Haoyuan Li, Zhelun Yu, Fangxun Shu, Long Chan, Hao Jiang, Fei Wu, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 本文提出T2I-FactualBench,通过知识密集概念评估文本到图像模型的事实性,揭示当前SOTA模型在事实性上的不足。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 27501-27524, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏