arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-06-04 至 2026-06-04 共收录 10
2606.04968 2026-06-04 cs.RO

Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement

势引导的流匹配用于视觉-语言-动作策略改进

Yunpeng Mei, Jiakai He, Hongjie Cao, Chenyu Wang, Xiaowen Zhu, Yihan Zhou, Jiamin Wang, Chenbo Xin, Peng Cheng, Yuxuan Yang, Yijie Wang, Xinhu Zheng, Gao Huang, Jie Chen, Gang Wang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出ForesightFlow,一种自引导流匹配策略,通过解耦优势加权流匹配和一步边界估计器,无需外部评论家即可改进视觉-语言-动作策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04889 2026-06-04 cs.CL

GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

GRAIL: 基于梯度重加权优势的可验证奖励强化学习

Tej Deep Pala, Vernon Toh, Soujanya Poria

机构 * DeCLaRe Lab, Nanyang Technological University(DeCLaRe实验室,南洋理工大学)

AI总结 针对强化学习中统一优势分配导致梯度信号稀释的问题,提出基于梯度激活显著性的令牌级优势重加权方法GRAIL,无需过程级监督即可提升推理对齐,在多个模型上平均准确率提升3.60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04457 2026-06-04 cs.CV

Imagine Before You Draw: Visual Prompt Engineering for Image Generation

先构思再绘制:面向图像生成的视觉提示工程

Liyu Jia, Fengda Zhang, Jiachun Pan, Kesen Zhao, Saining Zhang, Wang Lin, Weijia Wu, Yue Liao, Aojun Zhou, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出视觉提示工程(VPE),通过在单一模型内先生成视觉语义令牌作为中间计划,再生成完整图像,从而避免信息瓶颈,提升图像生成质量与编辑保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04436 2026-06-04 cs.CV cs.RO

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达梦机器人) Great Bay University(大亚大学)

AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01212 2026-06-04 cs.CL cs.AI cs.CR cs.IR

DiscourseFlip: An Oblique Discourse-Level Opinion Manipulation Attack against Black-box Retrieval-Augmented Generation

DiscourseFlip: 面向黑盒检索增强生成的非直述式语篇级观点操纵攻击

Yuyang Gong, Miaokun Chen, Jiawei Liu, Zhuo Chen, Guoxiu He, Wei Lu, XiaoFeng Wang, Xiaozhong Liu

机构 * Wuhan University(武汉大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) Worcester Polytechnic Institute(沃思堡理工学院)

AI总结 提出一种基于图引导的代理攻击方法DiscourseFlip,通过语义查询网络中的协同影响在有限预算下最大化语篇级观点偏差,实验证明其有效性和隐蔽性,并揭示现有防御的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14099 2026-06-04 cs.CV

ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models

ViewMask-1-to-3: 通过多模态离散扩散模型实现多视图一致图像生成

Ruishu Zhu, Zhihao Huang, Jiacheng Sun, Ping Luo, Hongyuan Zhang, Xuelong Li

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出ViewMask-1-to-3,将多视图生成建模为离散序列预测问题,利用MAGVIT-v2视觉令牌和掩码令牌预测的离散扩散,通过迭代去掩码实现渐进式多视图生成,无需专门架构或3D几何先验,在GSO和3D-FUTURE基准上优于基线方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21469 2026-06-04 eess.IV cs.CV

Embedding Compression Distortion in Video Coding for Machines

面向机器的视频编码中的嵌入压缩失真

Yuxiao Sun, Yao Zhao, Meiqin Liu, Chao Yao, Weisi Lin

机构 * Beijing Jiaotong University, China(北京交通大学) University of Science and Technology Beijing, China(北京科技大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 提出压缩失真表示嵌入(CDRE)框架,通过提取机器感知相关的失真表示并嵌入下游模型,提升压缩视频的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02555 2026-06-04 cs.CV cs.CL

High-Quality Entity Segmentation and Grounding

高质量实体分割与定位

Lu Qi, Yi-Wen Chen, Tao Zhang, Xiangtai Li, Xu Yang, Bo Du, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) Insta360 Research(Insta360研究院) Department of EECS, University of California, Merced(加州大学默塞德分校电子工程与计算机科学系) Nanyang Technological University(南洋理工大学) Institute of Automation of the Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 提出ESG流水线,通过新数据集EntitySeg和两阶段解耦设计(CropFormer高质量分割+GELLA精确名词提取与语义匹配),实现高质量实体分割与定位,在五项任务上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.08759 2026-06-04 eess.SY cs.AI cs.SY

Design of robust H_inf fuzzy output feedback controller for affine nonlinear systems:Fuzzy Lyapunov function approach

面向仿真非线性系统的鲁棒H_∞模糊输出反馈控制器设计:模糊Lyapunov函数方法

Leila Rajabpour, Mokhtar Shasadeghi, Alireza Barzegar

机构 * University of Technology Malaysia(技术大学马来西亚) Shiraz University of Technology(谢尔兹技术大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种基于非二次Lyapunov函数和引入松弛矩阵技术的新系统方法,用于具有扰动的仿真非线性系统。首先,将仿真非线性系统表示为Takagi-Sugeno(T-S)模糊双线性模型。随后,基于并行分布式补偿(PDC)方案设计鲁棒H_∞控制器。通过利用Lyapunov函数推导出稳定性条件,以线性矩阵不等式(LMIs)形式表达。此外,提出一些松弛矩阵以减少LMIs稳定性条件的保守性。最后,通过详细讨论等温连续搅拌釜反应器(CSTR)用于Van de Vusse反应器的应用,来说明所提方法的优点并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.05077 2026-06-04 cs.AI cs.SY eess.SY

Transforming Cooling Optimization for Green Data Center via Deep Reinforcement Learning

通过深度强化学习优化绿色数据中心的冷却系统

Yuanlong Li, Yonggang Wen, Kyle Guan, Dacheng Tao

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Bell Labs, Nokia(诺基亚贝尔实验室)

AI总结 本文提出利用数据中心监控数据优化冷却控制策略,采用深度强化学习框架设计端到端冷却控制算法,实现冷却成本降低11%的模拟平台结果及15%的实时数据节省。

详情

展开后加载摘要…

URL PDF HTML 收藏