arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-07-22 至 2026-07-22 共收录 8
2607.19115 2026-07-22 cs.CV 新提交

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19111 2026-07-22 cs.CV 新提交

GATE-3D: Geometry-Aware Test-time Adaptive Reranking for Open-Set 3D Shape Retrieval

GATE-3D:用于开放集3D形状检索的几何感知测试时自适应重排

Hao Wu, Heyi Lin, Zilin Wang, Huizai Yao, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究针对开放集3D形状检索中几何与外观特征融合问题,提出GATE-3D轻量级查询自适应重排方法,通过捕捉模态不一致特征预测分数调整排名,实验表明该方法优于外观检索且更稳健,提升了mAP等指标,还发现线性路由在低数据时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18874 2026-07-22 cs.LG cs.CY 新提交

Reinforcement Learning for Delivery Drone-Based Participatory Sensing in Dynamic Environments

动态环境中基于送货无人机的参与式传感的强化学习

Xin Ouyang, Songxin Lei, Xusen Guo, Yutian Jiang, Sijie Ruan, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Institute of Technology(北京理工大学)

AI总结 研究动态环境中基于送货无人机的参与式传感问题,提出双时间尺度强化学习框架TSRL,该框架分宏观和微观两层协作决策,实验表明其显著优于基线,在杭州和上海分别提升系统利润20.1%和46.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18217 2026-07-22 cs.CV 版本更新

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

HOMIE:通过多模态智能增强实现以人为对象的视频个性化

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究以人为对象的视频个性化问题,提出HOMIE框架,统一处理主体间和主体内输入设置。通过更好的MLLM集成策略、自注意力中的全局多模态引导及模态参考嵌入,在多任务中达最优性能。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16577 2026-07-22 cs.CV cs.GR 版本更新

CNS-Edit++: Category-Agnostic 3D Editing with Coupled Neural Shape Representation

CNS-Edit++:基于耦合神经形状表示的类别无关3D编辑

Jingyu Hu, Weilong Yan, Zhengzhe Liu, Haipeng Li, Ka-Hei Hui, Hao Zhang, Chi-Wing Fu

机构 * The Chinese University of Hong Kong(香港中文大学) Lingnan University(岭南大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Autodesk AI Lab(欧特克人工智能实验室) Simon Fraser University(西蒙弗雷泽大学)

AI总结 研究提出基于耦合神经形状表示和神经特征体积优化的潜在空间3D形状编辑框架CNS-Edit++,能在特定类别和类别无关模型上实例化,有多种编辑操作符及区域控制机制,经评估其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15273 2026-07-22 cs.CV cs.LG 版本更新

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

MeanFlowNFT:将前向过程强化学习引入平均速度生成器

Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

机构 * Tencent Hunyuan(腾讯混元) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究将强化学习应用于MeanFlow生成器的问题,核心方法是引入MeanFlowNFT,受MeanFlow恒等式启发构建预测器并应用DiffusionNFT目标,主要贡献是改进基线,在多数指标上超越现有方法,少步采样时能超越多步强化学习调整的扩散模型。

Comments Project Page: https://harahan.github.io/meanflownft-project-page/, GitHub: https://github.com/Harahan/MeanFlowNFT, Hugging Face: https://huggingface.co/Harahan/MeanFlowNFT, Demo: https://huggingface.co/spaces/Harahan/meanflownft-fewstep-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11063 2026-07-22 cs.AI 版本更新

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

AdvNav:视觉语言导航中基于行为引导的黑盒对抗攻击

Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究视觉语言导航系统对抗攻击,提出AdvNav框架,利用双粒度行为反馈构建替代目标,采用混合优化策略。在R2R数据集上评估,对两种模型取得较高攻击成功率,证明其有效性与通用性,揭示感知漏洞并为VLN模型设计提供见解。

Comments ACM International Conference on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04309 2026-07-22 math.NA cs.LG cs.NA 版本更新

DeepPAAC: A New Deep Galerkin Method for Principal-Agent Problems

深度主从问题的新深度伽辽金方法

Michael Ludkovski, Changgen Xie, Zimu Zhu

机构 * Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣巴巴拉分校统计学与应用概率系) Fintech Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)金融科技方向)

AI总结 研究连续时间下主从问题的数值求解,提出深度主从演员评论家算法(DeepPAAC),可处理多维情况及约束,通过五个案例研究神经网络架构等因素对求解器收敛的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏