arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-05-25 至 2026-05-25 共收录 10
2605.23889 2026-05-25 cs.CV

HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction

HorizonStream: 用于流式3D重建的长程注意力

Chong Cheng, Peilin Tao, Nanjie Yao, Guanzhi Ding, Xianda Chen, Yuansen Du, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Zhengqing Chen, Hao Wang

机构 * HKUST(GZ)(香港科技大学) Horizon Robotics(Horizon机器人) CASIA(中国科学院自动化研究所) CSU(中国科学技术大学)

AI总结 针对流式3D重建中长序列漂移和崩溃问题,提出HorizonStream模型,通过分解几何传播核为长程时间因子(几何线性注意力)和短程空间因子(几何局部注意力),实现恒定内存和线性时间下的稳定重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03715 2026-05-25 cs.LG cs.AI

R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification

R$^3$L: 反思-重试强化学习与语言引导探索、关键信用和正向放大

Weijie Shi, Yanxi Chen, Zexi Li, Xuchen Pan, Yuchang Sun, Jiajie Xu, Xiaofang Zhou, Yaliang Li

机构 * Tongyi Lab(通义实验室) Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出R$^3$L框架,通过反思-重试机制合成高质量轨迹,结合关键信用分配和正向放大,解决强化学习在LLM推理和智能体任务中的探索与利用难题,在多个任务上取得5%到52%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23271 2026-05-25 cs.CV cs.AI

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent(腾讯) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Film Academy(北京电影学院) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) Singapore Institute of Technology(新加坡理工学院)

AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23191 2026-05-25 cs.LG cs.IR cs.NA math.NA

Expand More, Shrink Less: Shaping Effective-Rank Dynamics for Dense Scaling in Recommendation

扩展更多,收缩更少:塑造有效秩动态以实现推荐中的密集扩展

Guoming Li, Shangyu Zhang, Junwei Pan, Wentao Ning, Jin Chen, Gengsheng Xue, Chao Zhou, Shudong Huang, Haijie Gu, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent Inc.(腾讯公司) Tencent Inc. Shenzhen China(腾讯公司深圳中国)

AI总结 针对推荐模型扩展中的嵌入坍缩问题,提出RankElastor架构,通过参数化全混合和GLU改进的P-FFN模块缓解有效秩的阻尼振荡,提升表示表达能力并实现稳健扩展。

Comments Accepted at the 32st ACM SIGKDD Conference on Knowledge Discovery and Data Mining (Research Track), KDD 2026 February Cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21605 2026-05-25 cs.CV

GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation

GenEvolve: 通过工具编排的视觉经验蒸馏实现自我进化的图像生成智能体

Sixiang Chen, Zhaohu Xing, Tian Ye, Xinyu Geng, Yunlong Lin, Jianyu Lai, Xuanhua He, Fuxiang Zhai, Jialin Gao, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Meituan(美团) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学)

AI总结 提出GenEvolve框架,通过工具编排的视觉经验蒸馏,使图像生成智能体在多样化任务中自我进化,提升工具使用和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15828 2026-05-25 cs.CV

Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer

并非所有任务量化平等:面向视觉几何Transformer的Fisher引导量化

Yipu Zhang, Jintao Cheng, Weilun Feng, Jiehao Luo, Chuanguang Yang, Zhulin An, Yongjun Xu, Wei Zhang

机构 * Department of Electronic and Computer Engineering, HKUST(香港科技大学电子与计算机工程系) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science and Engineering, South China Normal University(华南师范大学数据科学与工程学院)

AI总结 提出Fisher引导量化方法,利用Fisher信息矩阵量化不同任务、块和通道的敏感性,在量化校准中保护关键通道和块,以解决前馈3D重建模型量化时任务间敏感性差异导致的精度损失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14083 2026-05-25 cs.LG cs.AI

GeoMAE: Masking Representation Learning for Spatio-Temporal Graph Forecasting with Missing Values

GeoMAE:面向缺失值的时空图预测的掩码表示学习

Songyu Ke, Chenyu Wu, Yuxuan Liang, Huiling Qin, Junbo Zhang, Yu Zheng

机构 * College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) JD Intelligent Cities Research(京东智能城市研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Normal University(北京师范大学)

AI总结 提出GeoMAE自监督模型,通过输入预处理、注意力时空预测网络和掩码自编码器辅助任务,解决缺失数据下的时空图预测问题,在真实数据集上相对最优基线提升13.20%。

Comments 34 pages for pre-print version. This work has been published in *Neural Networks*. Please check the latest version via the following DOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22345 2026-05-25 cs.RO

A Reconfigured Wheel-Legged Robot for Enhanced Steering and Adaptability

一种增强转向能力和适应性的重构轮腿机器人

Zhicheng Song, Jinglan Xu, Chunxin Zheng, Yulin Li, Zhihai Bi, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科技大学(广州))

AI总结 提出一种名为FLORES的新型轮腿机器人,通过将前腿的髋关节横滚自由度替换为偏航自由度,并设计定制强化学习控制器,实现了高效转向和多地形适应。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7444-7451, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05311 2026-05-25 cs.IR cs.AI

PLACE: Prompt Learning for Attributed Community Search in Large Graphs

PLACE:面向大规模图属性社区搜索的提示学习

Shuheng Fang, Kangfei Zhao, Rener Zhang, Yu Rong, Jeffrey Xu Yu

机构 * Shenzhen Institute of Computing Sciences(深圳计算科学研究院) Beijing Institute of Technology(北京理工大学) Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 提出PLACE框架,利用图提示学习通过结构化和可学习提示令牌增强GNN,以识别与查询相关的结构凝聚性和属性相似性模式,并在9个真实图上平均F1分数提升22%。

Comments 14 pages, 9 figures

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19995 2026-05-25 cs.CV

A Computational Model of Message Sensation Value in Short Video Multimodal Features that Predicts Sensory and Behavioral Engagement

短视频多模态特征中信息感知价值的计算模型预测感官与行为参与

Haoning Xue, Jingwen Zhang, Xiaohui Wang, Diane Dagyong Kim, Yunya Song

机构 * Department of Communication, University of Utah(犹他大学通讯系) Department of Communication, University of California, Davis(加州大学戴维斯分校通讯系) Department of Media and Communication, City University of Hong Kong(香港城市大学媒体与传播系) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科学与技术大学新兴跨学科领域 division)

AI总结 基于信息感知价值理论,通过多模态特征分析和人工评估构建计算模型,预测短视频的感官与行为参与,发现MSV与感官参与正相关,与行为参与呈倒U型关系。

详情

展开后加载摘要…

URL PDF HTML 收藏