arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-08-14 至 2026-08-14 共收录 4
2605.08756 2026-08-14 cs.AI cs.NE 版本更新

AHD Agent: Agentic Reinforcement Learning for Automatic Heuristic Design

AHD代理:用于自动启发式设计的代理强化学习

Haoze Lv, Ning Lu, Ziang Zhou, Yew-Soon Ong, Shengcai Liu

机构 * Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation(广东脑启发智能计算重点实验室) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Zhongguancun Academy(中关村学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出AHD Agent,一种多轮框架,使LLM能主动决定生成启发式或调用工具获取环境证据,通过代理强化学习提升自动启发式设计效率。

Comments 8 pages, 7 figures for main content

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16285 2026-08-14 cs.CV 版本更新

EvoTale: Continual Character Customization for Expanding Story Worlds

持久故事世界模拟与连续角色定制

Jinlu Zhang, Qiyun Wang, Baoxiang Du, Jiayi Ji, Jing He, Rongsheng Zhang, Tangjie Lv, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)

AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22282 2026-08-14 cs.CV cs.AI cs.CL 版本更新

CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning

CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架

Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)

AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。

Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04291 2026-08-14 cs.LG 版本更新

A Lyapunov Drift-Plus-Penalty Method Tailored for Reinforcement Learning with Queue Stability

针对带队列稳定性的强化学习量身定制的李雅普诺夫漂移加惩罚方法

Wenhan Xu, Jiashuo Jiang, Lei Deng, Danny Hin-Kwok Tsang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文针对物联网场景下的优化需求,提出LDPTRLQ算法,将李雅普诺夫漂移加惩罚与强化学习结合,仿真显示其在基线方法和基准中性能更优,兼具理论与实践优势。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏