arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-07-17 至 2026-07-17 共收录 8
2607.15278 2026-07-17 cs.CV 新提交

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15053 2026-07-17 cs.NI cs.AI 新提交

ANet Patu-1: The Value of Connection in the Agent Network

ANet Patu-1:智能体网络中连接的价值

Mu Yuan, Jinke Song, Zhaomeng Zhou, Lan Zhang

机构 * Agent Network Research(代理网络研究) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究人工智能智能体网络连接价值,通过建模推导最优协作协议属性,引入ANet Patu-1协议。结果表明,异构便宜模型集体价值能超同构强模型,且异构网络能自收敛重构连接价值规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14706 2026-07-17 cs.LG 新提交

MESHA: Mechanism-Enforced Sequential Halving for Strategic Linear Bandits

MESHA:用于策略性线性博弈的机制强化序贯减半算法

Xin Li, Zixin Zhong

机构 * Data Science and Analytics Thrust, Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析方向,香港科技大学(广州))

AI总结 研究策略性线性博弈中最佳臂识别问题,提出MESHA算法,采用朴素均匀采样规则和逐轮严厉触发条件,证明其在固定预算内失败概率上界,指出基于\(G\)最优设计的算法在此环境会失败,实验表明MESHA优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-07-17 cs.CV 新提交

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14245 2026-07-17 eess.SY cs.RO cs.SY 新提交

Information-Theoretic Adaptive Cooling for Deterministic MPPI via Entropy Feedback

通过熵反馈实现确定性MPPI的信息论自适应冷却

Shuqi Wang, Wenrong Sun, Tao Han, Yue Gao, Xiang Yin

机构 * School of Automation & Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学) Department of Physics, The Hong Kong University of Science and Technology(物理系,香港科技大学)

AI总结 研究基于MPPI的确定性最优控制中冷却策略难题,提出ITAC框架,利用重要性权重香农熵作反馈信号调节温度,证明其渐近收敛,实验显示该框架提升采样效率且收敛更快,不影响MPPI无导数特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12121 2026-07-17 cs.DC cs.LG 版本更新

FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving

FlashDiff:用于扩散模型服务的高效区域执行与调度

Yaqi Qiao, Ping He, Songrun Xie, Ayush Barik, Chensong Zhang, Zhengzhong Tu, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Vanderbilt University(范德比大学) HKUST(香港科技大学) NVIDIA(英伟达) Texas A&M University(德克萨斯农工大学)

AI总结 研究针对扩散模型服务效率低的问题,提出FlashDiff系统,通过自适应区域执行和调度,利用扩散细化特性及三种机制,有效降低端到端服务延迟,提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16864 2026-07-17 cs.CV 版本更新

RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing

RePlan:基于推理的复杂基于指令的图像编辑区域规划

Tianyuan Qu, Lei Ke, Xiaohang Zhan, Longxiang Tang, Yuqi Liu, Bohao Peng, Bei Yu, Dong Yu, Jiaya Jia

机构 * Tencent AI Lab(腾讯人工智能实验室) CUHK(香港中文大学) HKUST(香港科技大学)

AI总结 研究针对复杂指令图像编辑中现有模型在IV-复杂性下的不足,提出RePlan框架,结合视觉语言规划器与扩散编辑器,经强化学习提升性能,还推出IV-Edit基准,该框架在相关设置中优于强大基线,提高了区域精度和整体一致性。

Comments [ECCV2026] Precise multi-region control and planning for instruction-based image editing. Our project page: https://replan-iv-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏