arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2380
2512.12425 2026-05-26 cs.CV

Boosting Monocular Metric Depth Estimation via Bokeh Rendering

通过散景渲染提升单目度量深度估计

Hangwei Zhang, Armando Fortes, Tianyi Wei, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Beihang University(北航大学)

AI总结 提出BokehDepth两阶段框架,利用物理生成模型产生校准散景堆栈作为无监督几何信号,通过散景感知聚合模块提升单目深度估计的度量精度。

Comments Project Page: https://fogradio.github.io/BokehDepth_Project/

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15668 2026-05-26 cs.CV

Adaptive Hierarchical Graph Cut for Multi-granularity Out-of-distribution Detection

自适应层次图割用于多粒度分布外检测

Xiang Fang, Arvind Easwaran, Blaise Genest, Ponnuthurai Nagaratnam Suganthan

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University(新加坡国立大学跨学科研究生项目) College of Computing and Data Science, Nanyang Technological University(新加坡国立大学计算与数据科学学院) KINDI Computing Research Center, College of Engineering, Qatar University(卡塔尔大学工程学院KINDI计算研究中心)

AI总结 提出自适应层次图割网络(AHGC),通过构建层次KNN图并基于图连接和密度信息进行子图划分,以处理不同标签粒度下的分布外检测问题,在CIFAR-10和CIFAR-100上FPR95指标分别降低40.47%和81.24%。

Comments Published in IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09953 2026-05-26 cs.CV

Uncertainty-Guided Appearance-Motion Association Network for Out-of-Distribution Action Detection

不确定性引导的外观-运动关联网络用于分布外动作检测

Xiang Fang, Arvind Easwaran, Blaise Genest

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 针对分布外动作检测任务,提出不确定性引导的外观-运动关联网络(UAAN),通过融合外观与运动特征并推理时空物体交互,显著优于现有方法。

Comments Accepted by MIPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25221 2026-05-26 math.DS cs.LG

Data-Specific Hyper-Parameter Design: A Paradigm Shift in Reservoir Computing

数据特定超参数设计:储层计算中的范式转变

G Manjunath, Juan-Pablo Ortega, Alma van der Merwe

机构 * University of Pretoria. Department of Mathematics and Applied Mathematics(南非大学 Pretoria分校 数学与应用数学系) Nanyang Technological University. Division of Mathematical Sciences. School of Physical and Mathematical Sciences(南洋理工大学 数学科学学院 物理与数学科学学院)

AI总结 本文从几何角度提出数据特定的储层设计原则,通过锥形集中约束储层状态增量,减少岭回归训练误差,并给出回声状态网络的构造方法及谱诊断指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24998 2026-05-26 cs.CL

Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

更好、更快:利用大型推理模型的自我改进

Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Leszek Rutkowski, Dacheng Tao

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Alibaba Group, China(中国阿里巴巴集团) School of Computer Science, Wuhan University, China(武汉大学计算机学院) AGH University of Science and Technology, Poland(波兰AGH科学与技术大学)

AI总结 针对自我改进训练中数据不平衡和过度思考问题,提出HSIR方法,通过验证后退出采样和内在多样性评分提升推理性能与效率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24911 2026-05-26 cs.LG cs.AI

Factorize to Generalize: Retrieval-Guided Invariant-Dynamic Decomposition for Time Series Forecasting

因式分解以泛化:面向时间序列预测的检索引导不变-动态分解

Jinjin Chi, Lei Feng, Lulu Zhang, Yongcheng Jing, Yiming Wang, Ximing Li, Jialie Shen, Leszek Rutkowski, Dacheng Tao

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) City St George’s, University of London(伦敦大学城圣乔治学院) Systems Research Institute, Polish Academy of Sciences(波兰科学院系统研究所)

AI总结 提出检索引导的不变-动态分解框架,通过分离稳定共享结构与实例特定变化,提升时间序列零样本预测在分布偏移下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05759 2026-05-26 cs.LG

Full-Spectrum Graph Neural Networks: Expressive and Scalable

全谱图神经网络:表达力与可扩展性

Xiaohan Wang, Deyu Bo, Longlong Li, Kelin Xia

机构 * Division of Mathematical Sciences, School of Physical and Mathematical Sciences, Nanyang Technological University, Singapore 637371, Singapore(数学科学学院,物理与数学科学学院,南洋理工大学,新加坡637371,新加坡)

AI总结 提出全谱图神经网络(FSpecGNN),通过将信号从节点域提升到节点对域并将单变量谱滤波器扩展为双变量滤波器,实现了对节点对信号的通用逼近,同时保持可扩展性。

Comments 41 pages, 4 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02900 2026-05-26 cs.CR cs.AI cs.CV cs.RO

Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses

具身人工智能的安全性:风险、攻击与防御综述

Xiao Li, Xiang Zheng, Yifeng Gao, Xinyu Xia, Yixu Wang, Xin Wang, Ye Sun, Yunhan Zhao, Ming Wen, Jiayu Li, Zixing Chen, Xun Gong, Yi Liu, Yige Li, Yutao Wu, Cong Wang, Jun Sun, Yixin Cao, Zhineng Chen, Jingjing Chen, Tao Gui, Qi Zhang, Zuxuan Wu, Xipeng Qiu, Xuanjing Huang, Tiehua Zhang, Zhipeng Wei, Kun Wang, Xinfeng Li, Hanxun Huang, Sarah Erfani, James Bailey, Jianping Wang, Chaowei Xiao, Ran He, Bo Li, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学) Jilin University(吉林大学) Singapore Management University(新加坡管理大学) Deakin University(德肯大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院) The University of Melbourne(墨尔本大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文综述了具身AI在感知、认知、规划、行动及交互全流程中的安全风险、攻击与防御方法,提出了多层次分类体系,并指出了多模态感知融合脆弱性、规划不稳定及人机交互可信度等关键挑战。

Comments Survey paper; 75 pages, 4 figures, 18 tables; v2 expands embodied-specific coverage of agentic threats, World Action Model threats, and contextual risk mitigation, with over 100 new references added. Project page: https://x-zheng16.github.io/Awesome-Embodied-AI-Safety/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09431 2026-05-26 cs.CR cs.CV

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models

基于文本驱动的攻击:提升编码器对抗迁移性以攻击大型视觉-语言模型

Xinwei Zhang, Li Bai, Tianwei Zhang, Youqian Zhang, Qingqing Ye, Yingnan Zhao, Ruochen Du, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Harbin Engineering University(哈尔滨工程大学)

AI总结 提出文本驱动攻击(GDA),通过将扰动优化与文本接地证据对齐,并采用接地感知扰动分配和接地中心证据破坏策略,显著提升编码器攻击在黑盒大型视觉-语言模型上的迁移性。

Comments Under review;

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02544 2026-05-26 cs.LG cs.AI

SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models

SPA-Cache: 扩散语言模型中的自适应缓存奇异代理

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Yongcheng Jing, Dacheng Tao

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore, Singapore(数据科学,南洋理工大学,新加坡,新加坡)

AI总结 针对扩散语言模型因非因果特性无法使用标准KV缓存导致计算开销大的问题,提出SPA-Cache方法,通过低维奇异代理识别关键令牌并自适应分配缓存预算,实现高达8倍吞吐量提升和2-4倍加速。

Comments Accepted by ICML 2026.The code repository is available at https://github.com/wenhao728/spa-cache

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02474 2026-05-26 cs.CL cs.AI cs.LG

MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents

MemSkill:面向自进化智能体的可学习与进化记忆技能

Haozhen Zhang, Quanyu Long, Jianzhu Bao, Tao Feng, Weizhi Zhang, Haodong Yue, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Tsinghua University(清华大学)

AI总结 提出MemSkill框架,将记忆操作转化为可学习和可进化的技能,通过控制器选择技能、执行器生成记忆、设计者进化技能集,形成闭环提升LLM智能体任务性能。

Comments Code is available at https://github.com/ViktorAxelsen/MemSkill

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08254 2026-05-26 cs.CV

Real-World Scene Recovery for Scattering-Degraded Images Using Spatial and Frequency Priors

使用空间和频率先验的散射退化图像真实场景恢复

Yun Liu, Tao Li, Guanghui Yue, Wenqi Ren, Cosmin Ancuti, Weisi Lin

机构 * College of Artificial Intelligence, Southwest University(西南大学人工智能学院) School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(深圳大学医学院生物医学工程学院) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) ETcTI, University Politehnica Timisoara(蒂森堡大学ETcTI学院) College of Computing and Data Science, Nanyang Technological University (NTU)(南洋理工大学计算机与数据科学学院)

AI总结 提出空间和频率先验(SFP)方法,通过空间域传输图估计和频率域自适应增强策略,实现散射退化图像的真实场景恢复,在多种真实场景中优于现有方法。

Comments 18 pages, 22 figures, submitted to IEEE T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14958 2026-05-26 cs.CL

MUR: Momentum Uncertainty guided Reasoning for Large Language Models

MUR: 面向大型语言模型的动量不确定性引导推理

Hang Yan, Fangzhi Xu, Rongman Xu, Yifei Li, Jian Zhang, Haoran Luo, Xiaobao Wu, Luu Anh Tuan, Haiteng Zhao, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(Vin大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

AI总结 提出动量不确定性引导推理(MUR)方法,通过追踪和聚合逐步不确定性动态分配推理预算,并引入γ控制机制,在不额外训练的情况下减少冗余计算,在多个基准上平均减少45%以上计算量并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24497 2026-05-26 cs.AI

Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs

推理作为攻击面:针对大语言模型的自适应进化思维链越狱方法

Jianan Li, Simeng Qin, Xiaojun Jia, Lionel Z. Wang, Tianhang Zheng, Xiaoshuang Jia, Yang Liu, Xiaochun Cao

机构 * Nanyang Technological University, Singapore(南洋理工大学) The University of Hong Kong, Hong Kong, China(香港大学) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) Zhejiang University, Zhejiang, China(浙江大学) Renmin University of China, Beijing, China(中国人民大学) Sun Yat-sen University, Guangdong, China(中山大学) Northeastern University(东北大学) Hebei Key Laboratory of Data Science and Knowledge Management(河北省数据科学与知识管理重点实验室)

AI总结 提出自适应进化思维链越狱框架AE-CoT,通过教师角色扮演重写有害目标、分解推理片段、多代进化搜索及自适应变异率控制,有效生成高破坏性越狱提示,在多个模型和数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23975 2026-05-26 cs.CL cs.SD

Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

面向音频大语言模型中英双语码转换语音识别的直接偏好优化

Trung Nguyen Quang, Cheng Yi Lewis Won, Minh Duc Pham, Yingxu He, Shuo Sun, Ai Ti Aw

机构 * Institute for Infocomm Research (I2R), A STAR, Singapore(信息通信研究所(I2R),A STAR,新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 针对音频大语言模型在英中码转换语音转录中的系统失败,提出使用直接偏好优化(DPO)对齐模型,通过构建偏好对(保留混合语言内容 vs 模仿失败模式)训练模型,实现词错误率降低最高89.6%(分布内)和20.0%(分布外)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23966 2026-05-26 cs.CL cs.AI cs.SY eess.SY math.CO

TriVAL: A Tri-Validation Framework for Faithful Automatic Optimization Modeling

TriVAL: 一种用于忠实自动优化建模的三重验证框架

Ziyang Fang, JinXi Wang, Jinghui Zhong, Yew-Soon Ong

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Centre for Frontier AI Research, Agency for Science, Technology and Research(科技研究局前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 提出TriVAL三重验证框架,在语义规范、数学公式和代码生成三个阶段进行显式验证,通过构建-验证-修正循环提高自动优化建模的准确性,并在新基准NL4COP上超越现有方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10543 2026-05-26 cs.CV

TIE: Time Interval Encoding for Video Generation over Events

TIE:面向事件视频生成的时间区间编码

Zhilei Shu, Shangwen Zhu, Zihang Liang, Xiaofan Li, Qianyu Peng, Xinyu Cui, Bo Ye, Yiming Li, Fan Cheng, Jian Zhao, Yang Cao, Zheng-Jun Zha, Ruili Feng

机构 * University of Science and Technology of China(中国科学技术大学) Matrix Team(Matrix团队) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The Pennsylvania State University(宾夕法尼亚州立大学) Zhongguancun Academy(中关村学院) The University of Hong Kong(香港大学)

AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15678 2026-05-26 cs.CV

Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network

多对时序句子定位的多线程知识迁移网络

Xiang Fang, Wanlong Fang, Changshuo Wang, Daizong Liu, Keke Tang, Jianfeng Dong, Pan Zhou, Beibei Li

机构 * Sichuan University(四川大学) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Peking University(北京大学) Guangzhou University(广州大学) Zhejiang Gongshang University(浙江工商大学)

AI总结 提出多对时序句子定位新任务,并设计多线程知识迁移网络,通过跨模态对比、原型对齐和自适应负样本选择实现多对视频-查询对的协同训练。

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06284 2026-05-26 cs.CV

Your Data Is Not Perfect: Towards Cross-Domain Out-of-Distribution Detection in Class-Imbalanced Data

你的数据并不完美:面向类别不平衡数据中的跨域分布外检测

Xiang Fang, Arvind Easwaran, Blaise Genest, Ponnuthurai Nagaratnam Suganthan

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算学院和数据科学学院) KINDI Computing Research Center, College of Engineering, Qatar University, Doha(卡塔尔大学工程学院KINDI计算研究中心,多哈)

AI总结 针对跨域类别不平衡的分布外检测问题,提出基于原型对齐的不确定性感知自适应语义对齐网络(UASA),通过标签驱动原型、自适应阈值和不确定性感知聚类缩小域间隙、语义间隙和类别不平衡间隙。

Comments Accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07078 2026-05-25 cs.CV cs.LG

DFIR-DETR: Frequency-Domain Iterative Refinement and Dynamic Feature Aggregation for Small Object Detection

DFIR-DETR:面向小目标检测的频域迭代细化与动态特征聚合

Bo Gao, Jingcheng Tong, Xingsheng Chen, Han Yu, Zichen Li

机构 * School of Information Engineering, Beijing Institute of Graphic Communication(信息工程学院,北京印刷学院) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 针对小目标检测中注意力均匀、上采样特征漂移及高频边缘平滑问题,提出频域迭代细化与动态特征聚合的DFIR-DETR方法,在NEU-DET和VisDrone上以11.7M参数和47.2 GFLOPs实现92.9%和51.6% mAP50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23672 2026-05-25 cs.CV

RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video

RiGS: 从单目视频中的刚性感知4D高斯泼溅

Chenyu Wu, Wanhua Li, Zhu-Tian Chen, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

AI总结 提出RiGS,通过静态、刚性和瞬态三种高斯原语分别建模不同时间尺度的运动,并利用目标动态掩码和场景流引导实现单目视频动态场景重建,在新视角合成任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23555 2026-05-25 cs.CV

Generator-Refiner-Examiner: A Tri-Module Data Augmentation Framework for 3D Human Avatar Learning from Monocular Videos

生成器-精炼器-检验器:一种用于从单目视频学习3D人体虚拟形象的三模块数据增强框架

Gangjian Zhang, Jian Shu, Sicheng Yu, Wenhao Shen, Yu Feng, Hao Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对单目视频中3D人体虚拟形象重建的数据稀缺问题,提出由生成器、精炼器和检验器组成的三模块框架TrioMan,通过姿态和相机扰动生成多样样本、扩散模型精炼质量、注意力机制筛选一致样本,在X-Humans和NeuMan基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23411 2026-05-25 cs.LG cs.CR cs.CV

Sample-wise Targeted Adversarial Attacks on Test-time Adaptation

面向测试时自适应的样本级定向对抗攻击

Phuc Duc Nguyen, Quang Duc Nguyen

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 提出一种基于元学习的样本级定向攻击方法,通过优先感知梯度对齐策略解决攻击成功与分布隐蔽性之间的冲突,实现高成功率且难以检测。

Comments 32 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23384 2026-05-25 cs.CL cs.AI

Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals

元认知作为奖励:通过知识和调节信号强化LLM推理

Sirui Chen, Lei Xu, Yuying Zhao, Yutian Chen, Yu Wang, Beier Zhu, Hanwang Zhang, Shengjie Zhao, Chaochao Lu

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) EPFL(苏黎世联邦理工学院) Wuhan University(武汉大学)

AI总结 提出元认知奖励(MaR)框架,利用元认知知识和调节信号作为过程奖励,提升LLM推理质量,在22个基准上平均提升7.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23287 2026-05-25 cs.CV

LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

LangFlash: 基于前馈的3D语言高斯泼溅从稀疏无位姿图像

Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

AI总结 提出LangFlash,一种前馈框架,从稀疏无位姿多视图图像直接预测3D高斯原语及其语言对齐语义特征,实现低延迟3D重建和语义一致场景理解。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23220 2026-05-25 cs.LG

WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents

WMAttack:世界模型智能体对抗评估的自动化攻击搜索

Zhixiang Guo, Siyuan Liang, Shi Fu, Cheng Guo, Andras Balogh, Mark Jelasity, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) University of Szeged(塞格德大学)

AI总结 提出WMAttack框架,通过自校正攻击搜索和表征引导攻击检索,自动搜索攻击配置以高效评估世界模型智能体的对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23218 2026-05-25 cs.AI

Foundation Protocol: A Coordination Layer for Agentic Society

Foundation Protocol: 智能体社会的协调层

Bang Liu, Yongfeng Gu, Jiayi Zhang, Zhaoyang Yu, Sirui Hong, Maojia Song, Xiaoqiang Wang, Mingyi Deng, Zijie Zhuang, Ronghao Wang, Mingzhe Cao, Yutong Zhu, Xingjian Li, Yifan Wu, Jianhao Ruan, Yiran Peng, Shuangrui Chen, Jinlin Wang, Yizhang Lin, Dongjie Zhang, Dekun Wu, Chen Ma, Lizi Liao, Han Yu, Jian Pei, Heng Ji, Qiang Yang, Yuyu Luo, Chenglin Wu

机构 * Singapore University of Technology and Design(新加坡科技设计大学) City University of Hong Kong(香港城市大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Duke University(杜克大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong Polytechnic University(香港理工大学)

AI总结 提出Foundation Protocol(FP),一种以图为核心的协调层,用于统一异构实体、支持多方组织和基于事件的协作,并提供经济原语和治理机制,以构建开放、多元、可治理的人机社会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10347 2026-05-25 cs.AI cs.CL

How Mobile World Model Guides GUI Agents?

移动世界模型如何指导GUI代理?

Weikai Xu, Kun Huang, Yunren Feng, Jiaxing Li, Yuhan Chen, Yuxuan Liu, Zhizheng Jiang, Heng Qu, Pengzhi Gao, Wei Liu, Jian Luan, Xiaolin Hu, Bo An

机构 * Nanyang Technological University(南洋理工大学) MiLM Plus, Xiaomi Inc.(小米公司) Independent Researchers(独立研究人员) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Wuhan University(武汉大学) Xiamen University(厦门大学)

AI总结 本文通过训练四种模态(增量文本、完整文本、扩散图像、可渲染代码)的世界模型,并评估其在下游任务中的效用,发现可渲染代码重建在分布内保真度高,文本反馈对在线分布外执行更鲁棒,世界模型生成的轨迹可提供迁移经验但无法替代原始分布,且对低熵过度自信的代理,后验自省收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00567 2026-05-25 cs.LG

Forget by Uncertainty: Orthogonal Entropy Unlearning for Quantized Neural Networks

基于不确定性的遗忘:面向量化神经网络的正交熵遗忘

Tian Zhang, Yujia Tong, Junhao Dong, Ke Xu, Yuze Wang, Jingling Yuan

机构 * Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology, China(交通物联网湖北重点实验室,计算机科学与人工智能学院,武汉理工大学,中国) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

AI总结 针对量化模型中的机器遗忘问题,提出正交熵遗忘框架(OEU),通过熵引导无偏遗忘和梯度正交投影消除梯度冲突,兼顾遗忘效果与模型效用。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22907 2026-05-25 cs.CV

VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

VideoOdyssey: 超长上下文与全模态视频理解基准

Haichen He, Jiayi Zhou, Sifeng Shang, Yihan Hu, Yuanhan Zhang, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) S-Lab, Nanyang Technological University(S 实验室,南洋理工大学) GVC Lab, Great Bay University(GVC 实验室,Great Bay 大学)

AI总结 提出VideoOdyssey基准,通过连续证书长度度量认知负荷,评估多模态大模型在超长视频(平均109分钟)上的连续跟踪、信息整合与记忆能力,涵盖视觉与音视频双模态,揭示模型在长上下文推理、细粒度感知和非语言全模态理解上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏