arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-08-18 至 2026-08-18 共收录 12
2608.16721 2026-08-18 cs.CV 新提交

GenRouter: Unified Workflow Routing for Agentic Image Generation

GenRouter:面向智能体图像生成的统一工作流路由

Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SUSTech(南方科技大学) ZODA CUHK(香港中文大学)

AI总结 GenRouter是首个智能体图像生成的统一工作流路由框架,通过需求分析、经验匹配、帕累托过滤实现自适应路由,可大幅降低计算开销与延迟并提升视觉对齐效果。

Comments Code: this https URL (https://github.com/EnVision-Research/GenRouter)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16715 2026-08-18 cs.RO 新提交

MatchingPolicy: Correspondence-Aware Policy Enables Cross-Object In-Context Learning

MatchingPolicy:具备对应感知能力的策略实现跨物体的上下文学习

Qijin She, Hanyang Yu, Zeming Li, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 该研究提出MatchingPolicy框架,通过解耦演示-场景匹配与策略学习,结合视觉基础模型和两阶段匹配算法,在RLBench及真实操作任务上实现了跨物体的少样本泛化性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16712 2026-08-18 cs.RO 新提交

H-PAC Hand: Control-Oriented Modeling and Tendon-Elasticity Compensation for an Underactuated Robotic Hand

H-PAC Hand:面向控制的建模与欠驱动机械手的肌腱弹性补偿

Teng Yan, Jiongxu Chen, Teng Wang, Yue Yu, Qixiang Hua, Zihang Wang, Yongru Chen, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southeast University(东南大学)

AI总结 本文提出模块化欠驱动机械手H-PAC,通过面向控制的建模与肌腱弹性补偿方法,结合分层控制架构,大幅提升关节角度预测精度,实现无传感器下的位姿与抓取控制。

Comments 7 pages, 6 figures. Extended preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16270 2026-08-18 cs.LG 新提交

Efficient Coreset Selection via K-Nearest Neighbor Graphs

基于K近邻图的高效核心集选择

Yingfan Liu, Leiyu Zhang, Jiadong Xie, Mingzhe Wang, Jeffrey Xu Yu, Jiangtao Cui

机构 * Xidian University(西安电子科技大学) Hangzhou Institute, Xidian University(西安电子科技大学杭州研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出基于K近邻图的KNNG-CS核心集选择方法,在保持与梯度近似核心集方法相当精度的同时,大幅降低了选择时间与峰值内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16264 2026-08-18 cs.RO 新提交

Cyclops: LiDAR as a Camera That Dreams in Color

Cyclops:以彩色进行“梦境”的相机式激光雷达

Wei Gao, Jian Shu, Mingle Zhao, Maani Ghaffari, David Kong, Chengzhong Xu, Hui Kong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Michigan(密歇根大学) University of Macau(澳门大学)

AI总结 本文提出Cyclops框架,将稀疏NRS-LiDAR强度转为RGB视频,通过LBM等技术缓解帧间闪烁,合成RGB可使感知模型在多任务上优于LiDAR基线与传统相机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16222 2026-08-18 cs.RO cs.AI 新提交

HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction

HiPHI:面向高精度人体运动与物体交互的大规模基准测试集

Jiahao Ji, Ji Ma, Runhan Zhang, Runyi Yu, Wenjia Wang, Weiheng Chi, Qianqian Peng, Weichao Yan, Yongfei Gu, Ye Tian, Ting Wu, Longwei Li, Chun Yuan, Ruoli Dai, Lei Han

机构 * National University of Singapore(新加坡国立大学) The University of Hong Kong(香港大学) SIGS, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology(香港科技大学) Noitom Robotics(诺亦腾机器人公司)

AI总结 该研究针对现有具身数据集的局限,提出基于FrameNet的600+小时高保真人体运动与物体交互基准HiPHI,配套评估套件,为类人策略学习及计算机图形学运动先验模型提供数据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16082 2026-08-18 cs.LG 新提交

Towards Reasonable Molecular Structure Elucidation from Infrared Spectroscopy with Chemical Feedback

基于化学反馈的红外光谱合理分子结构解析研究

Yusen Tan, Hongyu Zhan, Hai-tao Yu, Changxi Chi, Wenjie Du, Jun Xia

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Westlake University(西湖大学) University of Science and Technology of China(中国科学技术大学)

AI总结 针对现有分子结构解析模型预测结果不合理的问题,提出化学反馈驱动的FIRMPO框架,在三类红外数据集上显著提升了解析准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15766 2026-08-18 cs.RO 新提交

Tac4Loco: Learning Spatiotemporal Plantar Pressure Representations for Humanoid Locomotion

Tac4Loco:学习用于人形机器人运动的时空足底压力表征

Ziyun Liu, Sikai Guo, Zheng Li, Jiahang Cao, Haichao Liu, Pei Qu, Yinghong Zhang, Jinni Zhou, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Tac4Loco框架,通过构建拓扑保持的序数表征提取足底压力时空特征,结合增强本体感知训练非对称演员-评论家策略,提升人形机器人在复杂地形的运动性能并实现零样本部署。

Comments 9 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-18 cs.AI 新提交

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15177 2026-08-18 cs.LG cs.AI 新提交

FinFraudBench: A Heterogeneous Graph Benchmark for Financial Fraud Detection

FinFraudBench:用于金融欺诈检测的异质图基准

Yixuan Chen, Hongyu Zhan, Jie Sheng, Weiyu Han, Shuai Chen, Tianyi Zhang, Xiao Tan, Jun Xia

机构 * HKUST-GZ(香港科技大学(广州)) Jilin University(吉林大学) Ant Group(蚂蚁集团)

AI总结 针对现有金融欺诈检测基准与实际金融系统不匹配的问题,本文提出异质图基准FinFraudBench,构建两个大规模异质金融图数据集并建立标准化评估协议,为相关研究提供支撑。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-18 cs.CV 新提交

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏