arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-06-10 至 2026-06-10 共收录 7
2606.11187 2026-06-10 cs.CV 新提交

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Next Forcing: 基于多块预测的因果世界建模

Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, Yinghao Xu

机构 * Robbyant HUST(华中科技大学) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

AI总结 提出Next Forcing框架,通过多块预测训练目标加速视频生成模型收敛、提升精度并实现推理加速,在多个基准上取得最优结果。

Comments Project page: https://gangweix.github.io/next-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11075 2026-06-10 cs.LG 新提交

Exploring the Design Space of Reward Backpropagation for Flow Matching

探索流匹配的奖励反向传播设计空间

Ruoyu Wang, Boye Niu, Xiangxin Zhou, Yushi Huang, Tongliang Liu, Chi Zhang

机构 * Westlake University(西湖大学) Tencent Hunyuan(腾讯混元) University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对文本到图像流匹配模型,提出统一代理轨迹框架FlowBP,通过设计反向轨迹(稀疏重建、桥耦合、拉格朗日积分)解决直接奖励反向传播中的内存和梯度爆炸问题,在多个模型和指标上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11052 2026-06-10 cs.CL 新提交

Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It

混合LLM中的注意力遗忘:当CoT微调破坏长程记忆时,如何修复

Xinyu Zhou, Boyu Zhu, Yi Xu, Zhiwei Li, Yingfa Chen, Huiming Wang, Zhijiang Guo

机构 * LARK, HKUST(GZ)(香港科技大学(广州)LARK实验室) UCL(伦敦大学学院) Mistral AI Tsinghua University(清华大学) SUTD(新加坡科技设计大学) HKUST(香港科技大学)

AI总结 发现CoT监督微调会系统性降低混合线性注意力模型的长上下文召回能力,提出QK-Restore方法通过恢复微调前的查询-键投影矩阵来修复,无需额外训练。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10979 2026-06-10 cs.AI 新提交

Bellman-Taylor Score Decoding for Markov Decision Processes with State-Dependent Feasible Action Sets

具有状态依赖可行动作集的马尔可夫决策过程的贝尔曼-泰勒分数解码

Yi Chen, Rushuai Yang, Qiang Chen, Dongyan, Huo

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对状态依赖可行动作集的MDP,提出贝尔曼-泰勒分数解码框架,将策略学习映射到欧几里得分数空间,通过动作解码器保证可行性,并证明最优性间隙分解为结构近似误差和算法学习误差,在排队网络控制中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10701 2026-06-10 cs.CV 新提交

Vector Map as Language: Toward Unified Remote Sensing Vector Mapping

向量地图即语言:迈向统一的遥感向量制图

Yinglong Yan, Yunkai Yang, Haoyi Wang, Wei Fu, Linshan Wu, Honghu Pan, Shaobo Xia, Shanghang Zhang, Hao Chen, Leyuan Fang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Department of Geomatics Engineering, Changsha University of Science and Technology(长沙理工大学测绘工程系) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

AI总结 提出VecLang范式,将多类向量制图重构为结构化文本生成,通过类GeoJSON语言统一表达不同地理实体,并设计渐进式视觉-语言映射框架和层次化向量语言优化方法,实现跨类别、跨数据集和开放词汇的向量地图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10448 2026-06-10 cs.LG cs.AI 新提交

Mitigating Bias in Low-SNR Financial Reinforcement Learning via Quantum Representations

通过量子表示缓解低信噪比金融强化学习中的偏差

Zeyu Liu, Xuanzhi Feng, Sing Kwong Lai, Yuanchen Gao, Xiaoyi Pang, Hualei Zhang, Jingcai Guo, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对低信噪比金融市场中SAC算法的不稳定性,提出FPQC-SAC变体,在表征层使用参数化量子电路约束特征传播,减少极端波动影响,在真实组合管理任务中累计收益相对提升66.89%。

Comments Preprint. Code available at https://github.com/ZeyuLIU-UST/FPQC-SAC-main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09932 2026-06-10 cs.LG cs.AI 新提交

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff

当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接

Runze Liu, Jiashun Liu, Xu Wan, Yuqian Fu, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)

AI总结 针对SFT过度训练导致RL阶段改进有限的问题,提出Rejuvenation方法,通过基模型锚定融合和神经元重置恢复模型可塑性,在数学推理和智能体任务上提升RL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏