arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-05-25 至 2026-05-25 共收录 11
2512.07078 2026-05-25 cs.CV cs.LG

DFIR-DETR: Frequency-Domain Iterative Refinement and Dynamic Feature Aggregation for Small Object Detection

DFIR-DETR:面向小目标检测的频域迭代细化与动态特征聚合

Bo Gao, Jingcheng Tong, Xingsheng Chen, Han Yu, Zichen Li

机构 * School of Information Engineering, Beijing Institute of Graphic Communication(信息工程学院,北京印刷学院) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 针对小目标检测中注意力均匀、上采样特征漂移及高频边缘平滑问题,提出频域迭代细化与动态特征聚合的DFIR-DETR方法,在NEU-DET和VisDrone上以11.7M参数和47.2 GFLOPs实现92.9%和51.6% mAP50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23672 2026-05-25 cs.CV

RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video

RiGS: 从单目视频中的刚性感知4D高斯泼溅

Chenyu Wu, Wanhua Li, Zhu-Tian Chen, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

AI总结 提出RiGS,通过静态、刚性和瞬态三种高斯原语分别建模不同时间尺度的运动,并利用目标动态掩码和场景流引导实现单目视频动态场景重建,在新视角合成任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23555 2026-05-25 cs.CV

Generator-Refiner-Examiner: A Tri-Module Data Augmentation Framework for 3D Human Avatar Learning from Monocular Videos

生成器-精炼器-检验器:一种用于从单目视频学习3D人体虚拟形象的三模块数据增强框架

Gangjian Zhang, Jian Shu, Sicheng Yu, Wenhao Shen, Yu Feng, Hao Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对单目视频中3D人体虚拟形象重建的数据稀缺问题,提出由生成器、精炼器和检验器组成的三模块框架TrioMan,通过姿态和相机扰动生成多样样本、扩散模型精炼质量、注意力机制筛选一致样本,在X-Humans和NeuMan基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23411 2026-05-25 cs.LG cs.CR cs.CV

Sample-wise Targeted Adversarial Attacks on Test-time Adaptation

面向测试时自适应的样本级定向对抗攻击

Phuc Duc Nguyen, Quang Duc Nguyen

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 提出一种基于元学习的样本级定向攻击方法,通过优先感知梯度对齐策略解决攻击成功与分布隐蔽性之间的冲突,实现高成功率且难以检测。

Comments 32 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23384 2026-05-25 cs.CL cs.AI

Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals

元认知作为奖励:通过知识和调节信号强化LLM推理

Sirui Chen, Lei Xu, Yuying Zhao, Yutian Chen, Yu Wang, Beier Zhu, Hanwang Zhang, Shengjie Zhao, Chaochao Lu

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) EPFL(苏黎世联邦理工学院) Wuhan University(武汉大学)

AI总结 提出元认知奖励(MaR)框架,利用元认知知识和调节信号作为过程奖励,提升LLM推理质量,在22个基准上平均提升7.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23287 2026-05-25 cs.CV

LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

LangFlash: 基于前馈的3D语言高斯泼溅从稀疏无位姿图像

Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

AI总结 提出LangFlash,一种前馈框架,从稀疏无位姿多视图图像直接预测3D高斯原语及其语言对齐语义特征,实现低延迟3D重建和语义一致场景理解。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23220 2026-05-25 cs.LG

WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents

WMAttack:世界模型智能体对抗评估的自动化攻击搜索

Zhixiang Guo, Siyuan Liang, Shi Fu, Cheng Guo, Andras Balogh, Mark Jelasity, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) University of Szeged(塞格德大学)

AI总结 提出WMAttack框架,通过自校正攻击搜索和表征引导攻击检索,自动搜索攻击配置以高效评估世界模型智能体的对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23218 2026-05-25 cs.AI

Foundation Protocol: A Coordination Layer for Agentic Society

Foundation Protocol: 智能体社会的协调层

Bang Liu, Yongfeng Gu, Jiayi Zhang, Zhaoyang Yu, Sirui Hong, Maojia Song, Xiaoqiang Wang, Mingyi Deng, Zijie Zhuang, Ronghao Wang, Mingzhe Cao, Yutong Zhu, Xingjian Li, Yifan Wu, Jianhao Ruan, Yiran Peng, Shuangrui Chen, Jinlin Wang, Yizhang Lin, Dongjie Zhang, Dekun Wu, Chen Ma, Lizi Liao, Han Yu, Jian Pei, Heng Ji, Qiang Yang, Yuyu Luo, Chenglin Wu

机构 * Singapore University of Technology and Design(新加坡科技设计大学) City University of Hong Kong(香港城市大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Duke University(杜克大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong Polytechnic University(香港理工大学)

AI总结 提出Foundation Protocol(FP),一种以图为核心的协调层,用于统一异构实体、支持多方组织和基于事件的协作,并提供经济原语和治理机制,以构建开放、多元、可治理的人机社会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10347 2026-05-25 cs.AI cs.CL

How Mobile World Model Guides GUI Agents?

移动世界模型如何指导GUI代理?

Weikai Xu, Kun Huang, Yunren Feng, Jiaxing Li, Yuhan Chen, Yuxuan Liu, Zhizheng Jiang, Heng Qu, Pengzhi Gao, Wei Liu, Jian Luan, Xiaolin Hu, Bo An

机构 * Nanyang Technological University(南洋理工大学) MiLM Plus, Xiaomi Inc.(小米公司) Independent Researchers(独立研究人员) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Wuhan University(武汉大学) Xiamen University(厦门大学)

AI总结 本文通过训练四种模态(增量文本、完整文本、扩散图像、可渲染代码)的世界模型,并评估其在下游任务中的效用,发现可渲染代码重建在分布内保真度高,文本反馈对在线分布外执行更鲁棒,世界模型生成的轨迹可提供迁移经验但无法替代原始分布,且对低熵过度自信的代理,后验自省收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00567 2026-05-25 cs.LG

Forget by Uncertainty: Orthogonal Entropy Unlearning for Quantized Neural Networks

基于不确定性的遗忘:面向量化神经网络的正交熵遗忘

Tian Zhang, Yujia Tong, Junhao Dong, Ke Xu, Yuze Wang, Jingling Yuan

机构 * Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology, China(交通物联网湖北重点实验室,计算机科学与人工智能学院,武汉理工大学,中国) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

AI总结 针对量化模型中的机器遗忘问题,提出正交熵遗忘框架(OEU),通过熵引导无偏遗忘和梯度正交投影消除梯度冲突,兼顾遗忘效果与模型效用。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22907 2026-05-25 cs.CV

VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

VideoOdyssey: 超长上下文与全模态视频理解基准

Haichen He, Jiayi Zhou, Sifeng Shang, Yihan Hu, Yuanhan Zhang, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) S-Lab, Nanyang Technological University(S 实验室,南洋理工大学) GVC Lab, Great Bay University(GVC 实验室,Great Bay 大学)

AI总结 提出VideoOdyssey基准,通过连续证书长度度量认知负荷,评估多模态大模型在超长视频(平均109分钟)上的连续跟踪、信息整合与记忆能力,涵盖视觉与音视频双模态,揭示模型在长上下文推理、细粒度感知和非语言全模态理解上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏