arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-05-01 至 2026-05-01 共收录 12
2604.28138 2026-05-01 cs.OS cs.AI

Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes

Crab:一种语义感知的检查点/恢复运行时用于智能体沙盒

Tianyuan Wu, Chaokun Chang, Lunxi Cao, Wei Gao, Wei Wang

机构 * HKUST(香港科技大学)

AI总结 Crab通过桥接智能体与操作系统间的语义鸿沟,提升检查点恢复的准确性,减少检查点流量,提高执行效率。

Comments 15 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28115 2026-05-01 cs.RO cs.CV

FreeOcc: Training-Free Embodied Open-Vocabulary Occupancy Prediction

FreeOcc: 无需训练的具身开放词汇占用预测

Zeyu Jiang, Changqing Zhou, Xingxing Zuo, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) MBZUAI

AI总结 FreeOcc通过四层流程实现无需3D标注的开放词汇占用预测,相比传统方法在EmbodiedOcc-ScanNet上提升IoU和mIoU超过2倍,并引入ReplicaOcc基准测试新环境性能。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28078 2026-05-01 cs.CV

AesRM: Improving Video Aesthetics with Expert-Level Feedback

AesRM:通过专家级反馈提升视频美学

Yujin Han, Yujie Wei, Yefei He, Xinyu Liu, Tianle Li, Zichao Yu, Andi Han, Shiwei Zhang, Tingyu Weng, Difan Zou

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of Sydney(悉尼大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出AesRM框架,通过分解视频美学为视觉美学、视觉保真度和视觉合理性三个维度,构建了专家标注的AesVideo-Bench基准,并开发了AesRM-Base和AesRM-CoT模型,提升了视频美学评估的准确性和可解释性。

Comments 37 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27955 2026-05-01 cs.AI cs.CV

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27892 2026-05-01 stat.ML cs.LG stat.AP

Prediction-powered Inference by Mixture of Experts

通过专家混合的预测推理

Yanwu Gu, Linglong Kong, Dong Xia

机构 * Department of Mathematics, Hong Kong University of Science and Technology(香港理工大学数学系) Department of Mathematical and Statistical Sciences, University of Alberta(阿尔伯塔大学数学与统计学系)

AI总结 本文提出基于预测的半监督推理框架,利用专家混合方法降低方差,提升预测精度,适用于多种统计估计任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19528 2026-05-01 cs.LG cs.AI cs.DB

Revisiting RaBitQ and TurboQuant: A Symmetric Comparison of Methods, Theory, and Experiments

重新审视RaBitQ和TurboQuant:方法、理论和实验的对称比较

Jianyang Gao, Yutong Gou, Yuexuan Xu, Jifan Shi, Yongyi Yang, Shuolin Li, Raymond Chi-Wing Wong, Cheng Long

机构 * ETH Zurich(苏黎世联邦理工学院) Nanyang Technological University(南洋理工大学) University of Michigan(密歇根大学) Tsinghua University(清华大学) HKUST(香港科技大学)

AI总结 本文对比了RaBitQ和TurboQuant在方法、理论和实验证据上的表现,发现TurboQuant在内积估计、最近邻搜索和KV缓存量化任务中表现不如RaBitQ,并指出TurboQuant论文中的一些运行时间和召回率结果无法复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27616 2026-05-01 cs.CL cs.MA

RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems

RoadMapper: 一个用于解决复杂研究问题的路线图生成的多智能体系统

Jiacheng Liu, Zichen Tang, Zhongjun Yang, Xinyi Hu, Xueyuan Lin, Linwei Jia, Ruofei Bai, Rongjin Li, Shiyao Peng, Haocheng Gao, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) IDEA Research(IDEA研究院) Hithink RoyalFlush Information Network Co., Ltd.(Hithink RoyalFlush信息网络有限公司)

AI总结 本文提出RoadMapper,一个基于LLM的多智能体系统,通过分解任务生成高质量路线图,提升LLM在复杂问题解决中的性能,效率提升84%。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27555 2026-05-01 cs.AI

SpatialGrammar: A Domain-Specific Language for LLM-Based 3D Indoor Scene Generation

SpatialGrammar: 一种面向领域的语言用于基于LLM的3D室内场景生成

Song Tang, Kaiyong Zhao, Yuliang Li, Qingsong Yan, Penglei Sun, Junyi Zou, Qiang Wang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出SpatialGrammar,一种领域特定语言,通过BEV网格放置确定性编译生成有效3D几何,提升空间准确性和物理合理性。SG-Agent通过编译器反馈迭代优化场景,SG-Mini在单次生成场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19606 2026-05-01 cs.AI cs.MA

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

AblateCell: 一个用于虚拟细胞库的可重现后消去代理

Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California San Diego(加州大学圣地亚哥分校) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 AblateCell通过可重现后消去方法解决AI虚拟细胞性能归因问题,实现高准确度的代码库验证与属性归因。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22046 2026-05-01 cs.CV cs.CR

Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models

针对提示驱动视频分割基础模型的后门攻击

Zongmin Zhang, Zhen Sun, Yifan Liao, Wenhan Dong, Xinlei He, Xingshuo Han, Shengmin Xu, Xinyi Huang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Fujian Normal University(福建师范大学) Jinan University(暨南大学)

AI总结 本文研究了针对提示驱动视频分割基础模型的后门攻击,提出BadVSFM框架,通过两阶段策略实现可控的后门效果,实验表明其在多种模型和数据集上具有有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏