arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-05-28 至 2026-05-28 共收录 18
2605.28490 2026-05-28 cs.CV cs.AI

SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

SSR3D-LLM: 通过潜在步骤实现结构化空间推理以实现统一3D-LLM中的细粒度定位

Jiawei Li, Ziyi Liu, Weijie Shi, Long Chen, Jiajie Xu, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Soochow University(苏州大学)

AI总结 针对统一3D-LLM中细粒度查询的脆弱性,提出SSR3D-LLM,通过潜在空间推理步骤和几何感知评分器逐步精炼候选排名,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28398 2026-05-28 cs.AI

HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

HRBench:混合推理大语言模型中思维模式切换策略的基准测试与理解

Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

AI总结 提出HRBench统一评估框架,系统研究混合推理LLM中基于提示、外部路由和推测执行三类切换策略在四种训练机制下的效率-效果权衡,揭示策略选择随模型规模和任务领域的变化规律。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28247 2026-05-28 cs.LG cs.AI

IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

IRDS: 通过验证器耦合的稀疏自编码器覆盖实现可解释的RLVR数据选择

Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六三研究所,南京)

AI总结 提出IRDS方法,基于稀疏自编码器簇和验证器耦合的覆盖目标,选择模型失败但可学习的RLVR训练实例,提升数学推理准确率并降低计算成本。

Comments 24 pages,3 figures,18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28203 2026-05-28 cs.LG

Refining Multidimensional Video Reward Models via Disentangled Influence Functions

通过解耦影响函数优化多维视频奖励模型

Muyao Wang, Zeke Xie, Hideki Nakayama

机构 * The University of Tokyo(东京大学) HKUST (Guangzhou)(香港科技大学(广州))

AI总结 针对文本到视频生成任务中训练样本在不同评估维度上可靠性不一致的问题,提出解耦影响框架以估计维度特定监督风险,并设计维度解耦剪枝与重加权策略,显著提升多维视频奖励模型与真实标注的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28173 2026-05-28 cs.CV

MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation

MangaFlow: 一种用于可控故事到漫画生成的端到端代理框架

Muyao Wang, Zeke Xie, Yanhao Chen, Lixin Xiu, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出MangaFlow代理框架,通过将漫画创作分解为规划、定位、布局构建、参考条件渲染、合成和文字放置等步骤,实现可控的长篇漫画生成,支持布局和视觉参考作为显式中间变量,并引入故事段落记忆以保持跨面板一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28144 2026-05-28 cs.AI

Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning

解构空间复杂性:用于LLM空间推理的层次分解

Yi Wang, Haojie Lu, Zhaofan Zhang, Li Chen, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出一种层次任务分解方法,结合MCTS引导的组相对策略优化(M-GRPO),通过改进中间状态选择和规划能力,显著提升LLM在导航、规划和策略游戏等空间任务中的表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28053 2026-05-28 cs.LG

RW-TTT: Batched Serving for Request-Owned Test-Time Training State

RW-TTT:面向请求自有测试时训练状态的批量服务

Jian Yang, Zhizhuo Kou, Yao Tian, Hao Zhang, Han Chen, Sirui Han, Yike Guo

机构 * HKUST(香港科技大学) CUHK(香港大学) NUS(新加坡国立大学)

AI总结 提出RW-TTT框架,通过标记解码步骤的所有者、版本和读写效果,实现请求自有测试时训练状态下的高效批量LLM服务,在单GPU上达到274.61 tok/s聚合吞吐,较顺序服务提升9.31倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28030 2026-05-28 cs.LG cs.AI cs.CR

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

SPARD: 通过安全投影与相关性-多样性数据选择防御有害微调攻击

Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Platform and Content Group, Tencent(腾讯平台与内容组) Chinese Medicine Guangdong Laboratory(广东中医实验室)

AI总结 提出SPARD框架,结合安全投影交替优化和相关性-多样性数据选择,防御有害微调攻击,在保持任务精度的同时显著降低攻击成功率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27886 2026-05-28 cs.RO

Tabero: Learning Gentle Manipulation with Closed-Loop Force Feedback from Vision, Touch, and Language

Tabero: 通过视觉、触觉和语言闭环力反馈学习轻柔操作

Qiwei Wu, Rui Zhang, Xin Xiang, Tao Li, Weihua Zhang, Junjie Lai, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nvidia, Beijing, China(英伟达(北京,中国))

AI总结 针对现有视觉-语言-动作模型缺乏触觉反馈导致无法实现轻柔操作的问题,提出Tabero基准和模型套件,通过数据高效管道生成视觉-触觉-语言任务,并采用解耦力-位置命令接口的Tabero-VTLA架构,在保持高任务成功率的同时将轻柔指令下的平均夹持力降低70%以上。

Comments Code:https://github.com/NathanWu7/Tabero

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27472 2026-05-28 cs.AR cs.AI

AssertLLM2: A Comprehensive LLM Benchmark for Assertion Generation from Design Specifications

AssertLLM2: 从设计规格生成断言的全面的LLM基准测试

Yuchao Wu, Wenji Fang, Jing Wang, Wenkai Li, Ziyan Guo, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港理工大学)

AI总结 提出AssertLLM2基准,包含83个真实设计,通过结构化规格、黄金RTL和变异RTL支持缺陷预防和缺陷狩猎两种实际场景,采用语法有效性、形式可证明性、覆盖率和基于突变的缺陷检测等严格评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06025 2026-05-28 cs.CL cs.AI cs.LG

Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory

学习面向运行时智能体记忆的查询感知预算层级路由

Haozhen Zhang, Haodong Yue, Tao Feng, Quanyu Long, Jianzhu Bao, Bowen Jin, Weizhi Zhang, Xiao Li, Jiaxuan You, Chengwei Qin, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学香槟分校) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 提出 BudgetMem 框架,通过强化学习训练的轻量级路由器实现查询感知的预算层级路由,以在运行时平衡任务性能与记忆构建成本。

Comments Accepted by ICML 2026. Code is available at https://github.com/ViktorAxelsen/BudgetMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20150 2026-05-28 cs.CV cs.PF

TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization

TideGS: 通过外存优化训练超过十亿个3D高斯溅射基元

Chonghao Zhong, Linfeng Shi, Hua Chen, Tiecheng Sun, Hao Zhao, Binhang Yuan, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对大规模3D高斯溅射训练的内存瓶颈,提出TideGS外存训练框架,通过SSD-CPU-GPU层次化管理和三种协同技术,在单GPU上实现超过十亿高斯基元的训练并达到最优重建质量。

Comments Accepted to ICML 2026 as Spotlight. Website: https://sponge-lab.github.io/TideGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17929 2026-05-28 cs.RO

TacSE3: Equivariant SE(3) Motion Estimation from Low-Texture Visuotactile Images for In-Gripper Tracking and Compensation

TacSE3: 基于低纹理视触觉图像的等变SE(3)运动估计用于夹爪内跟踪与补偿

Zhongyuan Liao, Junzhe Wang, Qingyang Liu, Zhenmin Huang, Jun Ma, Yi Cai, Fei Meng, Haobo Liang, Michael Yu Wang

机构 * Hong Kong Center for Construction Robotics, The Hong Kong University of Science and Technology, Hong Kong, China(香港建设机器人中心,香港科技大学,中国香港) The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国) School of Engineering, Great Bay University, Dongguan, China(工程学院,大湾大学,中国东莞)

AI总结 提出TacSE3,一种将低纹理视触觉观测转化为解耦三维力场并估计SE(3)增量刚体运动的触觉运动估计流程,通过双传感器感知减少平移-旋转歧义,实现夹爪内跟踪与补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26182 2026-05-28 cs.CL

ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory

ClinicalAgents:具有双记忆的临床决策多智能体编排

Zhuohan Ge, Haoyang Li, Yubo Wang, Nicole Hu, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 提出ClinicalAgents多智能体框架,通过蒙特卡洛树搜索动态编排和双记忆架构模拟临床推理,显著提升诊断准确性和可解释性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18481 2026-05-28 q-fin.TR cs.AI

AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models

AlphaForgeBench:用大型语言模型对端到端交易策略设计进行基准测试

Wentao Zhang, Mingxuan Zhao, Jincheng Gao, Jieshun You, Huaiyu Jia, Yilei Zhao, Bo An, Shuo Sun

机构 * Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong Polytechnic University(香港理工大学)

AI总结 提出AlphaForgeBench框架,将LLM从随机交易代理重新定义为量化研究员,通过生成可执行alpha因子和基于因子的交易策略,消除执行不稳定,实现可复现的金融推理评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00814 2026-05-28 cs.CV

IRPO: Boosting Image Restoration via Post-training GRPO

IRPO:通过后训练GRPO提升图像恢复

Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

AI总结 提出IRPO框架,利用GRPO后训练优化确定性恢复模型,通过数据筛选和复合奖励建模,在域内和域外任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22655 2026-05-28 cs.AI cs.CV cs.MM

Text-Only Data Synthesis for Vision Language Model Training

仅文本数据合成用于视觉语言模型训练

Xiaomin Yu, Wenjie Zhang, Ziyue Qiao, Chengwei Qin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Great Bay University(大湾大学)

AI总结 提出一个跨集成的三阶段多模态数据合成框架,仅从文本生成高质量多模态训练数据,用于视觉语言模型的预训练和指令微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.03808 2026-05-28 cs.LG eess.SP stat.ML

ECGadv: Generating Adversarial Electrocardiogram to Misguide Arrhythmia Classification System

ECGadv: 生成对抗性心电图以误导心律失常分类系统

Huangxun Chen, Chenyu Huang, Qianyi Huang, Qian Zhang, Wei Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology, Peng Cheng Laboratory(南方科技大学鹏城实验室) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文针对基于深度神经网络的心电图诊断系统,分析心电图特性并设计两种攻击模型下的对抗攻击方案,揭示系统盲点,呼吁采取对策。

Comments Accepted by AAAI 2020

Journal ref Proceedings of the AAAI conference on artificial intelligence 2020

详情

展开后加载摘要…

URL PDF HTML 收藏