arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-03-17 至 2026-03-17 共收录 10
2603.15558 2026-03-17 cs.CV cs.RO

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15527 2026-03-17 cs.AI cs.CY

Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph

对LLM对齐中的困境和冲突是否可解?一种优先图的视角

Zhenheng Tang, Xiang Liu, Qian Wang, Eunsol Choi, Bo Li, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) New York University(纽约大学) National University of Singapore(新加坡国立大学)

AI总结 本文通过优先图模型分析LLM在不同场景中的冲突与困境,揭示了统一稳定对齐的挑战及优先黑客的潜在风险,并提出运行时验证机制以提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15475 2026-03-17 cs.CV cs.LG cs.RO eess.IV

Seeing Beyond: Extrapolative Domain Adaptive Panoramic Segmentation

超越视界:外推式领域自适应全景分割

Yuanfan Zheng, Kunyu Peng, Xu Zheng, Kailun Yang

机构 * Hunan University(湖南大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出EDA-PSeg框架,通过局部视角训练和全360度全景测试,解决跨领域几何视角扭曲和语义不确定性问题,实现先进性能和鲁棒性。

Comments Accepted to CVPR 2026. The code is available at https://github.com/zyfone/EDA-PSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15436 2026-03-17 cs.CV

MV2UV: Generating High-quality UV Texture Maps with Multiview Prompts

MV2UV:基于多视角提示生成高质量UV纹理图

Zheng Zhang, Qinchuan Zhang, Yuteng Ye, Zhi Chen, Penglei Ji, Mengfei Li, Wenxiao Zhang, Yuan Liu

机构 * Hisilicon Linx Lab, Huawei(华为Hisilicon Linx实验室) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出MV2UV方法,结合多视角生成的2D生成先验和UV细化的修复能力,解决多视角不一致和缺失纹理问题,提升纹理生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15433 2026-03-17 cs.CV

Real-Time Human Frontal View Synthesis from a Single Image

从单张图像实时合成人体正面视图

Fangyu Lin, Yingdong Hu, Lunjie Zhu, Zhening Liu, Yushi Huang, Zehong Lin, Jun Zhang

机构 * HKUST(香港科技大学)

AI总结 本文提出PrismMirror框架,通过级联学习策略实现单图像实时正面视图合成,提升视觉真实性和结构准确性,达到24 FPS的实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15265 2026-03-17 cs.RO

MoE-ACT: Scaling Multi-Task Bimanual Manipulation with Sparse Language-Conditioned Mixture-of-Experts Transformers

MoE-ACT:通过稀疏语言条件混合专家变压器扩展多任务双臂操作

Kangjun Guo, Haichao Liu, Yanji Sun, Ruhan Zhao, Jinni Zhou, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出MoE-ACT框架,通过稀疏混合专家模块和FiLM动态调节,提升多任务双臂操作的鲁棒性和泛化能力,实验显示成功率提升33%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13403 2026-03-17 cs.CV

Diabetic Retinopathy Grading with CLIP-based Ranking-Aware Adaptation:A Comparative Study on Fundus Image

基于CLIP的排名感知适应的糖尿病视网膜病变分级:在视网膜图像上的比较研究

Sungjun Cho

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文比较了三种基于CLIP的方法用于五类糖尿病视网膜病变严重程度分级,提出排名感知模型在整体准确率和临床关键严重病例召回率上表现最佳,混合FCN-CLIP模型在检测增生性视网膜病变方面表现突出,均优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09824 2026-03-17 cs.CV cs.AI cs.MM

Composing Concepts from Images and Videos via Concept-prompt Binding

通过概念提示绑定从图像和视频中组合概念

Xianghao Kong, Zeyu Zhang, Yuwei Guo, Zhuoran Zhao, Songchun Zhang, Anyi Rao

机构 * HKUST(香港科技大学) CUHK(香港大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出Bind & Compose方法,通过绑定视觉概念与提示标记实现灵活的视觉概念组合,提升概念一致性和运动质量。

Comments CVPR 2026. Project page: https://refkxh.github.io/BiCo_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏