arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-05-11 至 2026-05-11 共收录 14
2605.08043 2026-05-11 cs.CV cs.AI

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

SCOPE:结构分解与条件技能协调用于复杂图像生成

Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng, Guohui Zhang, Hang Xu, Xiaoxiao Ma, Shiting Huang, Ke Xu, Wenxuan Huang, Lionel Z. Wang, Lin Chen, Zehui Chen, Jie Huang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知 MOE 实验室,中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出SCOPE框架,通过结构化规范和条件技能协调解决复杂图像生成中语义承诺的持续跟踪问题,通过Gen-Arena基准验证其有效性,取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07950 2026-05-11 cs.LG

Slowly Annealed Langevin Dynamics: Theory and Applications to Training-Free Guided Generation

缓慢退火 Langevin 动力学:理论及其在无训练引导生成中的应用

Atsushi Nitanda, Dake Bu, Yueming Lyu, Tanya Veeravalli

机构 * Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学)

AI总结 本文提出缓慢退火 Langevin 动力学(SALD)理论,用于跟踪移动的目标分布路径并通过时间减缓近似终端目标,引入了Velocity-Aware SALD(VA-SALD)以提升无训练引导生成的性能,提供了收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19697 2026-05-11 cs.CV

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12602 2026-05-11 cs.LG

Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics

精确流线性注意力:从连续时间动态中获得精确解

Jingdi Lei, Di Zhang, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学)

AI总结 本文提出EFLA,通过连续时间动态的精确闭式流替代delta规则线性注意力的一阶更新,保持其代数结构和效率,提升稳定性和性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07510 2026-05-11 cs.CV cs.CL cs.IR

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

InterLV-Search:交错多模态代理搜索基准测试

Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Damo Academy, Alibaba Group(阿里达摩院)

AI总结 本文提出InterLV-Search基准测试,用于评估交错语言-视觉代理搜索,包含多层级任务,涵盖主动视觉证据搜索、受控离线交错多模态搜索和开放网页交错多模态搜索,揭示当前系统在视觉证据获取、搜索控制及多模态证据整合方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07481 2026-05-11 cs.CR cs.AI

Vaporizer: Breaking Watermarking Schemes for Large Language Model Outputs

Vaporizer: 拆解大型语言模型输出的水印方案

Jonathan Hong Jin Ng, Anh Tu Ngo, Anupam Chattopadhyay

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 本文研究了最新水印方案的有效性,通过多种攻击策略揭示现有水印系统的优劣,提出改进安全性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07175 2026-05-11 cs.LG cs.AI

Learning Multi-Relational Graph Representations for DNA Methylation-Based Biological Age Estimation

学习多关系图表示以用于基于DNA甲基化的生物年龄估计

Qing Qing, Xikun Zhang, Zhongyuan Zhang, Jiarui Liu, Xingtong Yu, Xiaotao Shen, Ziqi Xu, Qixin Zhang, Zhe Wang, Renqiang Luo

机构 * Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出RelAge-GNN框架,通过构建三种互补图捕捉CpG位点间的共甲基化、基因组共定位和基因级关联,提升DNA甲基化数据的生物年龄预测准确性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06812 2026-05-11 cs.AI

Towards Security-Auditable LLM Agents: A Unified Graph Representation

迈向安全可审计的LLM代理:一种统一的图表示

Chaofan Li, Lyuye Zhang, Jintao Zhai, Siyue Feng, Xichun Yang, Huahao Wang, Shihan Dou, Yu Ji, Yutao Hu, Yueming Wu, Yang Liu, Deqing Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) Donghua University(东华大学)

AI总结 本文提出Agent-BOM统一图表示,用于解决LLM代理系统中执行意图与物理事件间的语义鸿沟问题,通过构建分层属性有向图实现安全审计与风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21824 2026-05-11 cs.CV cs.AI

SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis

SteelDefectX:一种用于钢铁表面缺陷分析的多形式视觉-语言数据集和基准

Shuxian Zhao, Jie Gui, Baosheng Yu, Dacheng Tao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出SteelDefectX数据集,包含7778张图像和25种缺陷类别,提供多形式文本标注,涵盖视觉-语言分类、分割及跨数据集迁移等任务,揭示文本设计对工业视觉-语言学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05359 2026-05-11 cs.CV

Multimodal Latent Reasoning via Hierarchical Visual Cues Injection

多模态潜在推理 via 分层视觉提示注入

Yiming Zhang, Qiangyu Yan, Borui Jiang, Kai Han

机构 * Nanyang Technological University(南洋理工大学) Huawei Noah's Ark Lab(华为诺亚实验室)

AI总结 本文提出HIVE框架,通过分层视觉提示注入实现多模态潜在推理,提升模型在对齐潜在空间中的多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23770 2026-05-11 cs.LG cs.AI

SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints

SB-TRPO:迈向带有硬约束的安全强化学习

Dominik Wagner, Ankit Kanwar, Luke Ong

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算学院和数据科学学院,新加坡) Sony Corporation(索尼公司)

AI总结 SB-TRPO通过动态平衡成本降低与奖励提升,提供硬约束强化学习的原理性算法,确保安全性和奖励的改进,实验显示其在安全约束下平衡性能最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18085 2026-05-11 cs.RO cs.AI

Continually Evolving Skill Knowledge in Vision Language Action Model

视觉语言动作模型中的持续演进技能知识

Yuxuan Wu, Guangming Wang, Zhiheng Yang, Tianchen Deng, Maoqing Yao, Brian Sheil, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Cambridge(剑桥大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) MIT SMART(麻省理工学院SMART实验室) AgiBot

AI总结 本文提出Stellar VLA框架,通过无需增加参数的持续模仿学习方法,实现视觉语言动作模型的持续知识积累,实验表明其在任务专精和知识转移方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09907 2026-05-11 cs.AI cs.CV

Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis

学习提出问题:基于推理和求解器适应的数据合成

Yongxian Wei, Yilin Zhao, Zixuan Hu, Li Shen, Xinrui Chen, Runxi Cheng, Sinan Du, Hao Yu, Chun Yuan, Dian Li

机构 * Tsinghua University(清华大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学)

AI总结 本文提出一种基于推理和求解器适应的数据合成方法,通过生成相关问题对并利用推理模型生成中间步骤,提升问题设计策略,实验表明在多个基准上实现了3.4%的平均提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09598 2026-05-11 cs.LG

Amortized Multi-Objective Optimization Across Tasks with Generative Solution Modeling

跨任务的 amortized 多目标优化与生成解建模

Tingyang Wei, Jiao Liu, Abhishek Gupta, Chin Chun Ooi, Puay Siew Tan, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡) School of Mechanical Sciences, Indian Institute of Technology, Goa, India(印度理工学院Goa分校机械科学学院,印度) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(新加坡科技研究局前沿人工智能研究中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research, Singapore(新加坡制造技术研究所,新加坡科技研究局)

AI总结 本文提出一种新型参数化多目标贝叶斯优化器,通过生成解采样和跨任务协同搜索,实现连续任务偏好空间中的解预测,避免重复昂贵评估。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏