arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2796
2507.03570 2026-03-19 cs.CY cs.IT cs.LG math.IT

From Street Form to Spatial Justice: Explaining Urban Exercise Inequality via a Triadic SHAP-Informed Framework

从街道形态到空间正义:通过三元SHAP指导框架解释城市运动不平等

Minwei Zhao, Guosheng Yang, Zhuoni Zhang, Filip Biljecki, Hanzhi Zu, Cai Wu

机构 * Thrust of Urban Governance and Design, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)城市治理与设计研究所)

AI总结 本文通过整合空间三元理论与多源数据,构建可解释框架,揭示城市街道运动 deprivation 的影响因素,提出七种 deprivation 类型,为促进空间正义提供理论和实践工具。

Comments 41 pages, 4 tables and 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17665 2026-03-19 physics.comp-ph cond-mat.str-el cs.AI quant-ph

Renormalization-Inspired Effective Field Neural Networks for Scalable Modeling of Classical and Quantum Many-Body Systems

受重整化启发的有效场神经网络用于经典和量子多体系统的可扩展建模

Xi Liu, Yujun Zhao, Chun Yu Wan, Yang Zhang, Junwei Liu

机构 * Department of Physics, Hong Kong University of Science and Technology(香港科技大学物理系) Department of Physics and Astronomy, University of Tennessee, Knoxville, TN 37996, USA(田纳西大学 Knoxville 分校物理与天文学系) Min H. Kao Department of Electrical Engineering and Computer Science, University of Tennessee, Knoxville, Tennessee 37996, USA(田纳西大学 Knoxville 分校 Min H. Kao 电子工程与计算机科学系)

AI总结 本文提出EFNN,一种基于连续函数的新型架构,通过神经网络直接实现重整化中的连续函数,有效建模多体相互作用,在多个系统中优于传统深度网络,展现出良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01525 2026-03-19 eess.IV cs.CV

Towards Clinical Practice in CT-Based Pulmonary Disease Screening: An Efficient and Reliable Framework

迈向基于CT的肺部疾病筛查的临床实践:一种高效且可靠的框架

Qian Shao, Bang Du, Yixuan Wu, Zepeng Li, Qiyuan Chen, Qianqian Tang, Jian Wu, Jintai Chen, Hongxia Xu

机构 * Zhejiang University(浙江大学) Shaoxing Tangtang Technology Co., Ltd.(绍兴唐唐科技有限公司) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出一种高效可靠的框架,通过簇基于采样和模糊性感知不确定性量化方法,在减少计算成本的同时保持诊断性能,实现快速准确的肺部疾病筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15154 2026-03-18 eess.IV cs.CV

Vision-Language Model Based Multi-Expert Fusion for CT Image Classification

基于视觉-语言模型的多专家融合用于CT图像分类

Jianfa Bai, Kejin Lu, Runtian Yuan, Qingqiu Li, Jilan Xu, Junlin Hou, Yuejie Zhang, Rui Feng

机构 * College of Computer Science and Artificial Intelligence, Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学计算机科学与人工智能学院,上海智能信息处理重点实验室) University of Oxford(牛津大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出一种三阶段源感知多专家框架,通过构建肺部感知3D专家、开发MedSigLIP基专家和训练源分类器,提升多源CT图像中新冠检测的鲁棒性,实验结果显示在不同阶段模型在宏F1、ACC和AUC指标上均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16643 2026-03-18 cs.CL

Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy

对讨好型人格的有益论点:推理如何缓解(却掩盖)LLM的讨好行为

Zhaoxin Feng, Zheng Chen, Jianfei Ma, Yip Tin Po, Emmanuele Chersoni, Bo Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 研究探讨了推理在缓解LLM讨好行为中的作用,发现推理虽能减少最终决策的讨好倾向,但可能在部分样本中掩盖讨好行为,且LLM在主观任务和权威偏见下更易表现出讨好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16641 2026-03-18 cs.CV

FlowComposer: Composable Flows for Compositional Zero-Shot Learning

FlowComposer: 用于组合零样本学习的可组合流

Zhenqi He, Lin Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出FlowComposer,通过学习两个基础流将视觉特征传输到属性和对象文本嵌入,并引入可学习的Composer显式融合速度场以生成组合流,有效解决组合零样本学习中的隐式组合构造和特征纠缠问题。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16200 2026-03-18 cs.LG

Online Semi-infinite Linear Programming: Efficient Algorithms via Function Approximation

在线半无限线性规划:通过函数逼近实现高效算法

Yiming Zong, Jiashuo Jiang

机构 * Department of Industrial Engineering & Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

AI总结 本文提出了一种基于函数逼近的在线半无限线性规划算法,通过将约束数量减少到常数q,解决了传统在线LP算法在处理大量约束时性能差的问题,并在不同输入模型下取得了独立于约束数量的 regret bounds。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16188 2026-03-18 cs.CV

ECHO: Edge-Cloud Humanoid Orchestration for Language-to-Motion Control

ECHO:边缘-云计算人形机器人语言到动作控制

Haozhe Jia, Jianfei Song, Yuan Zhang, Honglei Jin, Youcheng Fan, Wenshuo Chen, Wei Zhang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LimX Dynamics Technology Co., Ltd.(LimX动力技术有限公司) Shandong University(山东大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(江苏工业技术研究院深度感知技术研究所)

AI总结 ECHO提出边缘-云计算框架,通过云端扩散模型生成自然语言指令对应动作,边缘设备通过强化学习跟踪执行,采用紧凑的机器人本征动作表示实现高效控制,实现实时动作生成与安全执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16124 2026-03-18 cs.SE cs.AI cs.CL

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

SWE-QA-Pro:一个代表性的基准和可扩展的训练配方用于仓库级代码理解

Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) The Hong Kong University of Science and Technology(香港科学与技术大学) McGill University & MILA(麦吉尔大学及MILA) Verdent AI, Inc.(Verdent AI公司)

AI总结 本文提出SWE-QA-Pro基准,通过多样化的长尾仓库和可执行环境构建,验证了代理工作流在代码理解任务中的优势,并提出可扩展的合成数据管道和两阶段训练方法,使小型模型在复杂行为学习中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15997 2026-03-18 cs.MM cs.CL cs.SC

Visual Set Program Synthesizer

视觉集合程序合成器

Zehua Cheng, Wei Dai, Wenhu Zhang, Thomas Lukasiewicz, Jiahao Sun

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Institute of Logic and Computation, TU Wien(维也纳技术大学逻辑与计算研究所)

AI总结 本文提出通过视觉程序合成解决复杂视觉推理问题,引入Set-VQA基准测试,显著提升回答准确性并提高透明度。

Comments 10 pages, IEEE International Conference on Multimedia and Expo 2026

Journal ref IEEE International Conference on Multimedia and Expo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15143 2026-03-18 eess.IV cs.CV

Clinical Priors Guided Lung Disease Detection in 3D CT Scans

基于临床先验的3D CT扫描肺部疾病检测

Kejin Lu, Jianfa Bai, Qingqiu Li, Runtian Yuan, Jilan Xu, Junlin Hou, Yuejie Zhang, Rui Feng

机构 * College of Computer Science and Artificial Intelligence, Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(计算机科学与人工智能学院,上海智能信息处理重点实验室,复旦大学) University of Oxford(牛津大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出一种考虑性别因素的两阶段肺部疾病分类框架,通过性别分类器和性别特异性疾病分类器提升少数类疾病识别性能,尤其在鳞状细胞癌上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13961 2026-03-18 cs.CV

USIS-PGM: Photometric Gaussian Mixtures for Underwater Salient Instance Segmentation

USIS-PGM:用于水下显著实例分割的光度高斯混合

Lin Hong, Xiangtong Yao, Mürüvvet Bozkurt, Xin Wang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering(电子与计算机工程系) The Hong Kong University of Science and Technology(香港科学与技术大学) School of CIT, Chair i6(CIT学院,Chair i6) Technical University of Munich(慕尼黑技术大学) School of CIT(CIT学院) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出USIS-PGM框架,通过频率感知模块增强边界线索,结合动态加权模块进行内容自适应特征重加权,利用光度高斯混合生成多尺度高斯热图以监督解码器特征,提升水下显著实例分割的定位精度和掩码预测的结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06289 2026-03-18 cs.CV

FlowMotion: Training-Free Flow Guidance for Video Motion Transfer

FlowMotion: 无需训练的视频运动迁移流动引导

Zhen Wang, Youcan Xu, Jun Xiao, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) State key lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出FlowMotion,一种无需训练的视频运动迁移框架,通过直接利用基于流动的T2V模型预测输出,实现高效灵活的运动迁移。通过提取潜在预测的运动表示,对齐源视频与生成视频的运动模式,并引入速度正则化策略以稳定优化。

Comments CVPR 2026, Code: https://github.com/HKUST-LongGroup/FlowMotion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22092 2026-03-18 cs.CV

Overview of the CXR-LT 2026 Challenge: Multi-Center Long-Tailed and Zero Shot Chest X-ray Classification

CXR-LT 2026挑战概述:多中心长尾和零样本胸片分类

Hexin Dong, Yi Lin, Pengyu Zhou, Xuan Zhong Feng, Alan Clint Legasto, Mingquan Lin, Hao Chen, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(韦尔·科恩医学中心) Peking Union Medical College(北京协和医学院) University of Minnesota(明尼苏达大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 该研究提出CXR-LT 2026挑战,通过多中心数据集和两个核心任务,解决胸片分类中的长尾分布和零样本泛化问题,验证大规模视觉-语言预训练对零样本诊断的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10043 2026-03-18 cs.IR cs.AI

Boosting Text-to-Chart Retrieval through Training with Synthesized Semantic Insights

通过合成语义洞察训练提升文本到图表检索

Yifan Wu, Lutao Yan, Yizhang Zhu, Yenchi Tseng, Yinan Mei, Yong Wang, Jiannan Wang, Nan Tang, Yuyu Luo

机构 * HKUST(GZ), China(香港科技大学(广州)) Huawei Cloud BU, China(华为云事业部) Simon Fraser University, Canada(西蒙弗雷泽大学)

AI总结 本文提出CRBench基准,通过合成语义洞察训练提升图表检索性能,开发ChartFinder模型在真实场景中实现精准查询和模糊查询的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09037 2026-03-18 cs.AI cs.CL

A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems

大语言模型推理前沿的综述:推理扩展、学习推理与代理系统

Zixuan Ke, Fangkai Jiao, Yifei Ming, Xuan-Phi Nguyen, Austin Xu, Do Xuan Long, Minzhi Li, Chengwei Qin, Peifeng Wang, Silvio Savarese, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) A*STAR, Singapore(新加坡A*STAR)

AI总结 本文综述了大语言模型推理的前沿方法,从推理阶段和架构两个维度分类,探讨了推理扩展到学习推理及代理系统的发展趋势,涵盖监督微调、强化学习等算法及代理工作流设计。

Comments 72 pages, 6 figures. Accepted to TMLR, with Survey Certification award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15690 2026-03-18 cs.SE cs.AI

Loosely-Structured Software: Engineering Context, Structure, and Evolution Entropy in Runtime-Rewired Multi-Agent Systems

松散结构软件:运行时重 wiring 多智能体系统的工程上下文、结构与进化熵

Weihao Zhang, Yitong Zhou, Huanyu Qu, Hongyi Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) AI Chip Center for Emerging Smart Systems(新兴智能系统人工智能芯片中心) University of Macau(澳门大学) Tsinghua University(清华大学)

AI总结 本文提出松散结构软件,通过运行时熵管理提升多智能体系统的可设计性、可扩展性和可进化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15558 2026-03-17 cs.CV cs.RO

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15527 2026-03-17 cs.AI cs.CY

Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph

对LLM对齐中的困境和冲突是否可解?一种优先图的视角

Zhenheng Tang, Xiang Liu, Qian Wang, Eunsol Choi, Bo Li, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) New York University(纽约大学) National University of Singapore(新加坡国立大学)

AI总结 本文通过优先图模型分析LLM在不同场景中的冲突与困境,揭示了统一稳定对齐的挑战及优先黑客的潜在风险,并提出运行时验证机制以提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15475 2026-03-17 cs.CV cs.LG cs.RO eess.IV

Seeing Beyond: Extrapolative Domain Adaptive Panoramic Segmentation

超越视界:外推式领域自适应全景分割

Yuanfan Zheng, Kunyu Peng, Xu Zheng, Kailun Yang

机构 * Hunan University(湖南大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出EDA-PSeg框架,通过局部视角训练和全360度全景测试,解决跨领域几何视角扭曲和语义不确定性问题,实现先进性能和鲁棒性。

Comments Accepted to CVPR 2026. The code is available at https://github.com/zyfone/EDA-PSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15436 2026-03-17 cs.CV

MV2UV: Generating High-quality UV Texture Maps with Multiview Prompts

MV2UV:基于多视角提示生成高质量UV纹理图

Zheng Zhang, Qinchuan Zhang, Yuteng Ye, Zhi Chen, Penglei Ji, Mengfei Li, Wenxiao Zhang, Yuan Liu

机构 * Hisilicon Linx Lab, Huawei(华为Hisilicon Linx实验室) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出MV2UV方法,结合多视角生成的2D生成先验和UV细化的修复能力,解决多视角不一致和缺失纹理问题,提升纹理生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15433 2026-03-17 cs.CV

Real-Time Human Frontal View Synthesis from a Single Image

从单张图像实时合成人体正面视图

Fangyu Lin, Yingdong Hu, Lunjie Zhu, Zhening Liu, Yushi Huang, Zehong Lin, Jun Zhang

机构 * HKUST(香港科技大学)

AI总结 本文提出PrismMirror框架,通过级联学习策略实现单图像实时正面视图合成,提升视觉真实性和结构准确性,达到24 FPS的实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15265 2026-03-17 cs.RO

MoE-ACT: Scaling Multi-Task Bimanual Manipulation with Sparse Language-Conditioned Mixture-of-Experts Transformers

MoE-ACT:通过稀疏语言条件混合专家变压器扩展多任务双臂操作

Kangjun Guo, Haichao Liu, Yanji Sun, Ruhan Zhao, Jinni Zhou, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出MoE-ACT框架,通过稀疏混合专家模块和FiLM动态调节,提升多任务双臂操作的鲁棒性和泛化能力,实验显示成功率提升33%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13403 2026-03-17 cs.CV

Diabetic Retinopathy Grading with CLIP-based Ranking-Aware Adaptation:A Comparative Study on Fundus Image

基于CLIP的排名感知适应的糖尿病视网膜病变分级:在视网膜图像上的比较研究

Sungjun Cho

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文比较了三种基于CLIP的方法用于五类糖尿病视网膜病变严重程度分级,提出排名感知模型在整体准确率和临床关键严重病例召回率上表现最佳,混合FCN-CLIP模型在检测增生性视网膜病变方面表现突出,均优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09824 2026-03-17 cs.CV cs.AI cs.MM

Composing Concepts from Images and Videos via Concept-prompt Binding

通过概念提示绑定从图像和视频中组合概念

Xianghao Kong, Zeyu Zhang, Yuwei Guo, Zhuoran Zhao, Songchun Zhang, Anyi Rao

机构 * HKUST(香港科技大学) CUHK(香港大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出Bind & Compose方法,通过绑定视觉概念与提示标记实现灵活的视觉概念组合,提升概念一致性和运动质量。

Comments CVPR 2026. Project page: https://refkxh.github.io/BiCo_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13089 2026-03-16 cs.CV

V-Bridge: Bridging Video Generative Priors to Versatile Few-shot Image Restoration

V-Bridge:将视频生成先验与多功能少样本图像恢复相连接

Shenghe Zheng, Junpeng Jiang, Wenbo Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出V-Bridge框架,将视频生成模型的潜在能力应用于多功能少样本图像恢复任务,通过将图像恢复视为渐进生成过程,利用视频模型实现从退化输入到高保真输出的逐步细化,仅用1000个多任务样本即可实现竞争性性能。

Comments Transfer the prior knowledge of video generative models to image restoration tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13172 2026-03-16 cs.CV

LongStream: Long-Sequence Streaming Autoregressive Visual Geometry

LongStream: 长序列流式自回归视觉几何

Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang

机构 * HKUST (GZ)(香港科技大学(广州)) Horizon Robotics ZJU(浙江大学) CSU(中国科学技术大学)

AI总结 LongStream通过抛弃首帧锚点、引入正交尺度学习和缓存一致性训练,解决长序列流式3D重建中的姿态漂移和注意力偏差问题,实现千帧级稳定重建。

Comments CVPR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12759 2026-03-16 cs.CV

SAP: Segment Any 4K Panorama

SAP: 4K全景任意分割

Lutao Jiang, Zidong Cao, Weikai Chen, Xu Zheng, Yuanhuiyi Lyu, Zhenyang Li, Zeyu HU, Yingda Yin, Keyang Luo, Runze Zhang, Kai Yan, Shengju Qian, Haidi Fan, Yifan Peng, Xin Wang, Hui Xiong, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LIGHTSPEED The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

AI总结 本文提出SAP模型,通过将全景分割转化为固定轨迹视角视频分割,实现4K高分辨率全景实例分割,合成183440张4K全景图像并提升零样本mIoU性能。

Comments Project Page: https://lutao2021.github.io/SAP_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏