arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2393
2604.10741 2026-04-21 cs.CL cs.AI cs.IR

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation

Deep-Reporter:基于多模态长形式生成的深度研究

Fangda Ye, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Jianzhu Bao, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。

Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05073 2026-04-21 cs.AI

Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities

大语言模型代理中的不确定性量化:基础、新兴挑战与机遇

Changdae Oh, Seongheon Park, To Eun Kim, Jiatong Li, Wendi Li, Samuel Yeh, Xuefeng Du, Hamed Hassani, Paul Bogdan, Dawn Song, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文探讨了大语言模型代理中不确定性量化的基础、挑战及未来方向,提出新的框架并分析了现实场景中的技术难题。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08276 2026-04-21 cs.AI

ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent Web

ACE-Router: 从MCP工具到智能体网络的历史感知路由泛化

Zhiyuan Yao, Zishan Xu, Yifu Guo, Zhiguang Han, Cheng Yang, Shuo Zhang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co. Ltd(华为技术有限公司) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 本文提出ACE-Router,通过依赖丰富的候选图合成多轮轨迹,训练出动态上下文理解的路由器,实现在大规模生态系统中的精准导航,实验显示其在MCP-Universe和MCP-Mark基准上表现优异,具备泛化性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06056 2026-04-21 cs.CL cs.AI

Data Compressibility Quantifies LLM Memorization

数据压缩性量化大语言模型的记忆性

Yizhan Huang, Zhe Yang, Meifang Chen, Huang Nianchen, Jianping Zhang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Meta

AI总结 本文通过数据压缩性量化大语言模型的记忆性,发现集级别指标能揭示熵与记忆性之间的线性关系。

Comments accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05920 2026-04-21 cs.CV

High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

通过多轮基于定位的强化学习实现高分辨率视觉推理

Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu

机构 * Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。

Comments Accepted by ACL(Findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11338 2026-04-21 cs.AI cs.LG

Automatic Dataset Construction (ADC): Sample Collection, Data Curation, and Beyond

自动数据集构建(ADC):样本收集、数据整理与更广泛的领域

Minghao Liu, Zonglin Di, Jiaheng Wei, Zhongruo Wang, Hengxiang Zhang, Ruixuan Xiao, Haoyu Wang, Jinlong Pang, Hao Chen, Ankit Shah, Hongxin Wei, Xinlei He, Zhaowei Zhao, Haobo Wang, Lei Feng, Jindong Wang, James Davis, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Amazon(亚马逊) SUSTech(华南理工大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) HKUST (GZ)(香港科技大学) Nanyang Technological University(南洋理工大学) Microsoft(微软)

AI总结 本文提出自动数据集构建方法ADC,通过LLM实现高效数据集生成,减少人工标注成本,构建包含12个主类和12000个细粒度子类的Clothing-ADC数据集,降低标签噪声至10.7%,并设计三个针对标签噪声和类别不平衡的基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02786 2026-04-21 cs.RO cs.SY eess.SY

City-Wide Low-Altitude Urban Air Mobility: A Scalable Global Path Planning Approach via Risk-Aware Multi-Scale Cell Decomposition

城市级低空城市空中交通:一种通过风险感知多尺度单元分解的可扩展全局路径规划方法

Josue N. Rivera, Dengfeng Sun, Chen Lv

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) School of Aeronautics and Astronautics, Purdue University(普渡大学航空航天学院)

AI总结 本文提出一种基于风险感知的多尺度单元分解方法,用于城市级低空城市空中交通的可扩展全局路径规划,通过动态平衡分辨率与计算速度,降低累计风险并减少计算时间。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10747 2026-04-21 cs.SD cs.AI cs.CL cs.LG eess.AS

Multimodal Sentiment Analysis with Missing Modality: A Knowledge-Transfer Approach

多模态情感分析中的缺失模态:一种知识迁移方法

Weide Liu, Huijing Zhan

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Singapore University of Social Sciences, Singapore(新加坡社会科学研究大学)

AI总结 本文提出知识迁移网络以重建缺失音频特征,并开发跨模态注意力机制以提升情感预测,实验表明在三个公开数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17078 2026-04-21 cs.AI

Understanding and Enforcing Weight Disentanglement in Task Arithmetic

理解并强制任务算术中的权重解耦

Shangge Liu, Yuehan Yin, Lei Wang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao, Dacheng Tao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) University of Wollongong, Australia(沃林根大学,澳大利亚) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 本文提出Task-Feature Specialization(TFS)作为权重解耦的根本原理,通过促进权重向量的正交性,提出OrthoReg正则化方法以提升任务算术方法的性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16950 2026-04-21 cs.AI

AutoPKG: An Automated Framework for Dynamic E-commerce Product-Attribute Knowledge Graph Construction

AutoPKG:一种用于动态电子商务产品-属性知识图谱构建的自动化框架

Pollawat Hongwimol, Haoning Shang, Chutong Wang, Zhichao Wan, Yi Gao, Yuanming Li, Lin Gui, Wenhao Sun, Cheng Yu

机构 * Lazada, Alibaba International Digital Commerce Group(Lazada,阿里巴巴国际数字 commerce 集团) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 本文提出AutoPKG框架,通过多智能体大语言模型自动构建产品-属性知识图谱,解决电子商务产品属性提取中本体不一致、不完整和维护成本高的问题,实验证明其在提升GMV和推荐效果上的显著优势。

Comments Accepted as ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16887 2026-04-21 cs.RO

Time-Division Multiplexing Actuation in Tendon-Driven Arms: Lightweight Design and Fault Tolerance

tendon驱动臂的时间分割多路复用驱动:轻量化设计与容错性

Shoujie Li, Changqing Guo, Jianle Xu, Hong Luo, Xueqian Wang, Wenbo Ding, Bin Liang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出了一种时间分割多路复用驱动方法,用于腱驱动机器人,实现轻量化设计和高容错性,通过垂直堆叠的旋转选择结构和双编码系统,使MuxArm在部分伺服故障下仍能保持1%的末端精度。

Comments 11 pages

Journal ref IEEE T-MECH Under review 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16586 2026-04-21 cs.LG cs.AI q-bio.QM

A Systematic Survey and Benchmark of Deep Learning for Molecular Property Prediction in the Foundation Model Era

在基础模型时代对深度学习用于分子性质预测的系统调查和基准测试

Zongru Li, Xingsheng Chen, Honggang Wen, Regina Qianru Zhang, Ming Li, Xiaojin Zhang, Hongzhi Yin, Qiang Yang, Kwok-Yan Lam, Pietro Lio, Siu-Ming Yiu

机构 * The University of Hong Kong, Hong Kong SAR(香港大学) Nanyang Technological University, Singapore(南洋理工大学) University of Cambridge, United Kingdom(剑桥大学) Zhejiang Normal University, China(浙江师范大学) The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学) The University of Queensland(昆士兰大学) The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学)

AI总结 本文系统调查了深度学习在分子性质预测中的应用,探讨了四种互补范式,并提出了未来三个发展方向,包括物理感知学习、可信推理的基础模型和整合计算与实验数据的基准生态系统。

Comments 32 pages. It is just accepted by Journal of Chemical Theory and Computation 2026

Journal ref Journal of Chemical Theory and Computation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16331 2026-04-21 cs.RO cs.AI cs.CV cs.MA

BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning

BrainMem: 为具身智能任务规划设计的脑启发式记忆系统

Xiaoyu Ma, Lianyu Hu, Wenbing Tang, Zixuan Hu, Zeqin Liao, Zhizhen Wu, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tianjin University, Tianjin, China(天津大学,天津,中国)

AI总结 本文提出BrainMem,一种无训练的分层记忆系统,通过构建知识图谱和符号指南,提升具身智能在复杂环境中的任务规划能力,尤其在长周期和空间复杂任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20187 2026-04-21 cs.CV

MuSteerNet: Human Reaction Generation from Videos via Observation-Reaction Mutual Steering

MuSteerNet:通过观察-反应相互引导生成人类反应

Yuan Zhou, Yongzhi Li, Yanqi Dai, Xingyu Zhu, Yi Tan, Qingshan Xu, Beier Zhu, Richang Hong, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出MuSteerNet,通过观察-反应相互引导机制生成3D人类动作,解决视频输入对反应生成的引导不足问题,提升反应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17932 2026-04-21 cs.SE cs.AI

From Charts to Code: A Hierarchical Benchmark for Multimodal Models

从图表到代码:一个多模态模型的分层基准

Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学CSU-JPG) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Chart2Code基准,用于评估大多模态模型的图表理解和代码生成能力,包含三个层级任务,涵盖图表复现、编辑和长表转图表生成,测试了25种最先进的LMMs,结果显示GPT-5在编辑任务中表现不佳,凸显了该基准的挑战性。

Comments This work has been accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13759 2026-04-21 cs.CV

Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark

Uni-MMMU:一个大规模多学科多模态统一基准

Kai Zou, Ziqi Huang, Yuhao Dong, Shulin Tian, Dian Zheng, Hongbo Liu, Jingwen He, Bin Liu, Yu Qiao, Ziwei Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Uni-MMMU通过八个以推理为中心的领域系统展开生成与理解的双向协同,评估模型在视觉理解和生成方面的性能差异及跨模态依赖,为统一模型发展提供可靠基础。

Comments Equal contributions from frst three authors. Project page: https://vchitect.github.io/Uni-MMMU-Project/ Code: https://github.com/vchitect/Uni-MMMU

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13068 2026-04-21 cs.CR cs.AI cs.LG

Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment

揭示LLM安全对齐中的logit抑制漏洞

Yuxi Li, Yi Liu, Yuekang Li, Ling Shi, Gelei Deng, Shengquan Chen, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Nankai University(南开大学)

AI总结 本文提出SSAG方法,通过系统操控输出层logit揭示LLM安全对齐的漏洞,实验显示其在五种主流模型上以95%成功率暴露有害响应,同时减少86%的响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16256 2026-04-20 cs.CV cs.CL

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15823 2026-04-20 cs.CV

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

像人类一样看电影:面向具身陪伴的视角中心情绪理解

Ze Dong, Hao Shi, Zejia Gao, Zhonghua Yi, Kaiwei Wang, Lin Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学, 新加坡) Zhejiang University, China(浙江大学, 中国) Ant Group, China(蚂蚁集团, 中国) MirrorMe, China(MirrorMe, 中国)

AI总结 本文提出EgoScreen-Emotion基准数据集,用于视角中心电影情绪理解,通过多标签标注和长上下文模型提升跨域泛化能力,实验显示基于传统电影数据的模型在真实视角观看场景中性能显著下降。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15741 2026-04-20 cs.CL cs.AI

Learning Uncertainty from Sequential Internal Dispersion in Large Language Models

从大型语言模型中的序列内部分散性中学习不确定性

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心)

AI总结 本文提出SIVR框架,通过利用隐藏状态中的token和层级特征,以更基本的假设来估计不确定性,从而提高hallucination检测的准确性和泛化能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15715 2026-04-20 cs.CL cs.AI

GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

GTA-2: 从原子工具使用到开放性工作流的通用工具代理基准测试

Jize Wang, Xuanxuan Liu, Yining Li, Songyang Zhang, Yijun Wang, Zifei Shan, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

AI总结 本文提出GTA-2基准测试,涵盖原子工具使用和开放性工作流,通过递归检查点机制评估模型能力和执行框架,揭示了前沿模型在复杂任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15707 2026-04-20 cs.CV

LP$^{2}$DH: A Locality-Preserving Pixel-Difference Hashing Framework for Dynamic Texture Recognition

LP$^{2}$DH:一种用于动态纹理识别的局部性保持像素差哈希框架

Ruxin Ding, Jianfeng Ren, Heng Yu, Jiawei Li, Xudong Jiang

机构 * School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

AI总结 本文提出LP$^{2}$DH框架,通过联合编码像素差实现紧凑二进制码,结合局部保持嵌入和曲面搜索策略,提升动态纹理识别性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15609 2026-04-20 cs.LG cs.CV

Adapting in the Dark: Efficient and Stable Test-Time Adaptation for Black-Box Models

在黑暗中适应:为黑盒模型提供高效稳定的测试时适应

Yunbei Zhang, Shuaicheng Niu, Chengyi Cai, Feng Liu, Jihun Hamm

机构 * Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) The University of Melbourne(墨尔本大学)

AI总结 本文提出BETA框架,通过轻量级白盒引导模型和预测和谐化技术,实现高效稳定的黑盒测试时适应,无需额外API调用,且在ImageNet-C和商业API上均取得优异性能。

Comments Third Workshop on Test-Time Updates (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11490 2026-04-20 cs.AI cs.CL cs.CV

Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

人为区域适应于多模态视觉-语言模型

Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan

机构 * Cohere SEACrowd AI Singapore Universiti Teknologi PETRONAS Oracle Carnegie Mellon University(卡内基梅隆大学) Monash University, Indonesia(莫纳什大学(印尼)) King Mongkut’s University of Technology Thonburi(泰国孔敬大学) Nara Institute of Science and Technology(奈良科学技術大學) Stanford University(斯坦福大学) MBZUAI National University of Singapore(新加坡国立大学) Monash University, Australia(莫纳什大学(澳大利亚)) Brown University(布朗大学) University of Bath(巴斯大学) Mila - Quebec AI Institute(蒙特利尔AI研究所) Institut Teknologi Bandung(Bandung 工程技术大学) Ateneo de Manila University(马尼拉亚特内奥大学) Universitas Pelita Harapan(Pelita Harapan 大学) Seoul National University of Science and Technology(首尔科学技术大学) Thammasat University(泰国 Thammasat 大学) Independent(独立) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) MiroMind AI University of Indonesia(印度尼西亚大学) University of New Haven(纽黑文大学) INTI International University and Colleges(INTI 国际大学和学院) Binus University(Binus 大学) National University Philippines(菲律宾国家大学) ThoughtFull

AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09689 2026-04-20 cs.CR cs.AI

When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models

当搜索出错时:针对具有网络搜索功能的大型语言模型的红队测试

Haoran Ou, Kangjie Chen, Xingshuo Han, Gelei Deng, Jie Zhang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Nanjing University of Aeronautics(南京航空航天大学) Tsinghua University, China(清华大学)

AI总结 本文提出CREST-Search框架,针对具有网络搜索功能的LLM的安全性问题,通过三种新型攻击策略和迭代上下文优化机制,揭示网络搜索带来的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16315 2026-04-20 cs.CV cs.CL

SignX: Continuous Sign Recognition in Compact Pose-Rich Latent Space

SignX:在紧凑的姿态丰富潜在空间中实现连续手语识别

Sen Fang, Yalin Feng, Chunyu Sui, Hongbin Zhong, Yanxin Zhang, Hongwei Yi, Hezhen Hu, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Nanyang Technological University(南洋理工大学) Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出SignX框架,通过统一潜在表示和ViT模型实现高效连续手语识别,显著降低计算消耗并在翻译任务中达到SOTA准确率。

Comments 33 pages, CSLR SOTA (2026). More demo at https://signerx.github.io/SignX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05578 2026-04-20 cs.CV cs.RO

Scalable Unseen Objects 6-DoF Absolute Pose Estimation with Robotic Integration

可扩展的未知物体六自由度绝对位姿估计与机器人集成

Jian Liu, Wei Sun, Kai Zeng, Jin Zheng, Hui Yang, Hossein Rahmani, Ajmal Mian, Lin Wang

机构 * National Engineering Research Center for Robot Visual Perception and Control Technology, School of Artificial Intelligence and Robotics, Hunan University(机器人视觉感知与控制技术国家工程研究中心,人工智能与机器人学院,湖南大学) School of Architecture and Art, Central South University(建筑与艺术学院,中南大学) School of Computing and Communications, Lancaster University(计算与通讯学院,兰卡斯特大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学)

AI总结 本文提出SinRef-6D方法,通过单张姿态标注的RGB-D图像实现未知物体六自由度位姿估计,利用状态空间模型解决大位姿差异和单视角信息有限的问题,实验验证其在多个基准和真实场景中的优越可扩展性。

Comments Accepted by TRO 2026, 18 pages, 9 figures

Journal ref IEEE Transactions on Robotics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04300 2026-04-20 cs.CV cs.AI

T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts

T2I-FactualBench:基于知识密集概念的文本到图像模型事实性评估基准

Ziwei Huang, Wanggui He, Quanyu Long, Yandi Wang, Haoyuan Li, Zhelun Yu, Fangxun Shu, Long Chan, Hao Jiang, Fei Wu, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 本文提出T2I-FactualBench,通过知识密集概念评估文本到图像模型的事实性,揭示当前SOTA模型在事实性上的不足。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 27501-27524, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15093 2026-04-17 cs.AI cs.CL cs.CV cs.HC

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile: 通过任务和轨迹合成构建开放移动代理

Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

机构 * Nanjing University(南京大学) SenseTime(秒速) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出OpenMobile框架,通过可扩展的任务合成管道和策略切换策略生成高质量任务指令和轨迹,实现移动代理在AndroidWorld等基准测试中取得显著成绩。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏