arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-06-17 至 2026-06-17 共收录 15
2606.18242 2026-06-17 cs.CV 新提交

EventDrive: Event Cameras for Vision-Language Driving Intelligence

EventDrive: 用于视觉-语言驾驶智能的事件相机

Dongyue Lu, Rong Li, Ao Liang, Lingdong Kong, Wei Yin, Lai Xing Ng, Benoit R. Cottereau, Camille Simon Chane, Wei Tsang Ooi

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) Horizon Robotics(地平线机器人) A*STAR, I2R(新加坡科技研究局,资讯通信研究院) IPAL, CNRS IRL 2955, Singapore(IPAL,法国国家科学研究中心国际联合实验室2955,新加坡) University Toulouse, CNRS, CerCo, Toulouse, France(图卢兹大学,法国国家科学研究中心,CerCo,法国图卢兹) ETIS UMR 8051, CY Cergy Paris University, ENSEA, CNRS, France(ETIS UMR 8051,CY塞尔吉-巴黎大学,ENSEA,法国国家科学研究中心,法国)

AI总结 提出EventDrive基准和模型套件,通过多时域事件金字塔和时域混合专家模块融合事件流与RGB帧,在感知、理解、预测和规划四维度提升驾驶推理性能。

Comments CVPR2026, 34 pages, 15 figures, 15 tables, project page: https://dylanorange.github.io/projects/eventdrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18235 2026-06-17 cs.AI 新提交

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆

Qi Chai, Wenhao Shen, Nanjie Yao, Yue Xia, Kaiyong Zhao, Jie Ma, Guosheng Lin, Hao Wang

机构 * HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学) XGRIDS(深圳格物智联)

AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18071 2026-06-17 cs.LG cs.AI 新提交

Volterra Generative Models

Volterra生成模型

Yusen Jia, Bingyan Han

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出Volterra生成模型,通过分数阶核引入路径依赖噪声,利用马尔可夫提升和残差状态学习,解决非马尔可夫动力学下的扩散生成问题,在MNIST和CIFAR-10上验证有效性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17989 2026-06-17 cs.CV cs.AI 新提交

Recover Semantics First, Generate Better: Improved Latent Modeling for 3D MRI Reconstruction and Cross-Contrast Synthesis

先恢复语义,再生成更好:改进的潜在建模用于3D MRI重建和跨对比合成

Yonghao Chen, Sicheng Yang, Rui Tang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Xi’an Jiaotong University(西安交通大学)

AI总结 提出语义优先的潜在建模框架,通过潜在协调编码器、语义恢复块和解剖感知频率损失,解决3D MRI压缩中长程解剖一致性、语义退化和平滑重建问题,提升重建和跨对比合成质量。

Comments Code: https://github.com/script-Yang/RSF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17982 2026-06-17 cs.RO 新提交

LAGO Policy: Latency-Aware Asynchronous Diffusion Policies with Goal-Directed Collision-Free Planning for Smooth Manipulation

LAGO策略:面向平滑操作的延迟感知异步扩散策略与目标导向无碰撞规划

Guowei Shi, Xupeng Xie, Yiming Luo, Jian Guo, Jun Ma, Boyu Zhou

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) International Digital Economy Academy(国际数字经济学院) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

AI总结 提出LAGO策略,通过延迟感知条件引导和时空轨迹优化,解决异步扩散策略的间断和碰撞问题,实现平滑安全的操作。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17972 2026-06-17 cs.CV cs.AI 新提交

SegDINO: Introducing Multi-Scale Structure into DINO for Efficient Medical Image Segmentation

SegDINO: 将多尺度结构引入DINO以实现高效医学图像分割

Sicheng Yang, Hongqiu Wang, Zhaohu Xing, Sixiang Chen, Qiuxia Yang, Yize Mao, Guang Yang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University Cancer Center(中山大学肿瘤防治中心) Imperial College London(帝国理工学院)

AI总结 提出SegDINO框架,通过令牌金字塔适应和尺度感知解码将多尺度结构引入DINO,在保持高效的同时实现医学图像分割的最优性能。

Comments Code: https://github.com/script-Yang/segdino_v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17833 2026-06-17 cs.RO 新提交

HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning

HumanoidArena: 以自我为中心的层级全身学习基准

Taowen Wang, Zikang Xie, Bin Yang, Yunheng Wang, Zizhao Yuan, Yuetong Fang, Yixiao Feng, Yichi Wang, Xingyu Chen, Haodong Chen, Qiwei Wu, Weisheng Xu, Lihan Chen, Lusong Li, Zecui Zeng, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing University of Technology(北京工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen MSU-BIT University(深圳北理莫斯科大学) JD Explore Academy(京东探索研究院)

AI总结 提出HumanoidArena基准,通过层级控制(高层策略输出全身动作,低层通用运动跟踪器执行)解决人形机器人全身交互学习问题,设计7个腿部关键任务评估策略的泛化与迁移能力。

Comments 29 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17682 2026-06-17 cs.CL 新提交

From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

从受训者到训练者:用于多智能体推理的LLM设计的强化学习训练环境

Chao Chen, Chengzu Li, Zhiwei Li, Yinhong Liu, Zhijiang Guo

机构 * LARK, HKUST (GZ)(香港科技大学(广州)LARK实验室) University of Cambridge(剑桥大学) HKUST(香港科技大学)

AI总结 提出LLM-as-Environment-Engineer框架,让策略模型自动分析失败轨迹并修改训练环境配置,在MAPF-FrozenLake测试平台上用Qwen3-4B实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17534 2026-06-17 cs.RO 新提交

RICH-SLAM: Radar SLAM with Incremental and Continuous Hilbert Mapping

RICH-SLAM:基于增量连续希尔伯特映射的雷达SLAM

Bingbing Zhang, Huan Yin, Yang Xu, Shuo Liu, Shaojie Shen, Fumin Zhang, Wen Xu

机构 * State Key Laboratory of Ocean Sensing, Zhejiang University(浙江大学海洋传感国家重点实验室) Interdisciplinary Student Training Platform for Marine areas, Zhejiang University(浙江大学海洋交叉学科学生培养平台) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) School of AI and Robotics, Hunan University(湖南大学人工智能与机器人学院) Ocean College, Zhejiang University(浙江大学海洋学院) Institute of Deep-Sea Science and Engineering, Chinese Academy of Sciences(中国科学院深海科学与工程研究所)

AI总结 提出RICH-SLAM框架,采用Rao-Blackwellized粒子滤波后端和增量希尔伯特空间降秩高斯过程映射,从稀疏雷达测量中构建连续占用地图,并支持不确定性感知规划。

Comments 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16591 2026-06-17 cs.CL 新提交

SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents

SING: 用于LLM代理中可扩展主动工具发现的合成意图图

Qiao Xiao, Haochen Shi, Yisen Gao, Wenbin Hu, Huihao Jing, Tianshi Zheng, Baixuan Xu, Ziheng Zhang, Weiqi Wang, Haoran Li, Jiaxin Bai, Yangqiu Song

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科技大学) The Ohio State University(俄亥俄州立大学) Hong Kong Baptist University(香港浸会大学)

AI总结 提出SING框架,通过构建意图-工具图并动态检索工具,在长周期任务中提升工具发现准确率,Global Recall@5提高59.8%,下游成功率提高28.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16070 2026-06-17 cs.AI 新提交

Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games

Mind-Studio: 针对部分可观测游戏的可执行世界模型与前向评估

Yifei Dong, Mingen Zheng, Linquan Wu, Jeff Z. Pan, Jiaxin Bai

机构 * Hong Kong University of Science and Technology(香港科技大学) City University of Hong Kong(香港城市大学) University of Edinburgh(爱丁堡大学) Hong Kong Baptist University(香港浸会大学)

AI总结 提出Mind-Studio框架,利用大语言模型从轨迹合成可执行的pygame风格世界模型,通过K步前向保真度协议评估,在Montezuma's Revenge等游戏中显著提升预测准确性和子目标验证。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22748 2026-06-17 cs.AI 版本更新

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

代理世界建模:基础、能力、定律及更远

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学) University of Hong Kong(香港大学) University of Washington(华盛顿大学) University of Tokyo(东京大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院) XGEN Labs(XGEN实验室)

AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18897 2026-06-17 cs.DC cs.AI 版本更新

Parallelizing Tool Execution and LLM Generation for Low-Latency Agent Serving

并行化工具执行与LLM生成以实现低延迟代理服务

Yifan Sui, Han Zhao, Rui Ma, Zhiyuan He, Hao Wang, Jianxun Li, Kaiqiang Xu, Kai Chen, Yuqing Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Stevens Institute of Technology(Stevens 工程学院) Google(谷歌) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 提出PASTE系统,通过预测性执行未来工具调用与LLM生成并行,减少任务完成时间43.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11715 2026-06-17 cs.LG cs.CL 版本更新

DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels

DICE:扩散大语言模型在生成CUDA内核方面表现出色

Haolei Bai, Lingcheng Kong, Xueyi Chen, Jianmian Wang, Zhiqiang Tao, Huan Wang

机构 * Westlake University(西湖大学) Hong Kong University of Science and Technology(香港科技大学) Rochester Institute of Technology(罗切斯特理工学院)

AI总结 提出CuKe数据集和BiC-RL训练框架,构建DICE系列扩散大语言模型(1.7B/4B/8B),在KernelBench上显著优于同类自回归和扩散模型,实现CUDA内核生成新SOTA。

Comments v2: Expanded with dLLM vs. autoregressive LLM comparisons, ablation studies, and qualitative case studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00064 2026-06-17 cs.RO cs.CV 版本更新

OpenTie: Open-vocabulary Sequential Rebar Tying System

OpenTie: 开放词汇的连续钢筋绑扎系统

Sai Fan, Mingze Liu, Haozhen Li, Haobo Liang, Yixing Yuan, Yanke Wang

机构 * Hong Kong Center for Construction Robotics, The Hong Kong University of Science and Technology(香港建设机器人中心,香港科技大学) Division of Business and Hospitality Management (BHM), College of Professional and Continuing Education (CPCE), The Hong Kong Polytechnic University (PolyU)(专业及持续教育学院(CPCE)商务及酒店管理系,香港理工大学)

AI总结 提出OpenTie,一种无需训练的3D钢筋绑扎框架,通过RGB到点云生成和开放词汇检测实现高精度连续绑扎,优于基于YOLO的方法。

Comments This article is accepted by The 2026 IEEE 22nd International Conference on Automation Science and Engineering (CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏