arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-04-13 至 2026-04-13 共收录 11
2604.09455 2026-04-13 cs.AI

E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning

E3-TIR: 增强经验利用以实现工具集成推理

Weiyang Guo, Zesheng Shi, Liye Zhao, Jiayuan Ma, Zeen Zhu, Junxian He, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出E3-TIR方法,通过整合专家前缀、专家引导和自探索三种经验类型,提升工具集成推理的效率与性能,实验显示在工具使用任务中性能提升6%,数据成本降低。

Comments 22 pages 10 figures, published in acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07928 2026-04-13 cs.CV cs.LG

Generative 3D Gaussian Splatting for Arbitrary-ResolutionAtmospheric Downscaling and Forecasting

生成式3D高斯散射用于任意分辨率的大气降尺度与预测

Tao Han, Zhibin Wen, Zhenghao Chen, Fenghua Lin, Junyu Gao, Song Guo, Lei Bai

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Computer and Information Sciences, University of Newcastle(纽卡斯尔大学计算机与信息科学学院) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(西北工业大学人工智能、光学与电子学学院(iOPEN))

AI总结 本文提出GSSA-ViT框架,通过生成式3D高斯模型与尺度感知注意力机制,实现高维大气场的任意分辨率预测与降尺度,提升多尺度预测效率与准确性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10632 2026-04-13 cs.CV

CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos

CoMoVi:3D人类动作与真实视频的联合生成

Chengfeng Zhao, Jiazhi Shu, Yubo Zhao, Tianyu Huang, Jiahao Lu, Zekai Gu, Chengwei Ren, Zhiyang Dou, Qing Shuai, Yuan Liu

机构 * HKUST(香港科技大学) SCUT(华南理工大学) HKU(香港大学) MIT(麻省理工学院) ZJU(浙江大学)

AI总结 本文提出CoMoVi框架,通过单个扩散去噪循环同步生成3D人类动作和视频,采用双分支扩散模型实现动作与视频生成的互惠特征交互和3D-2D交叉注意力。

Comments Project Page: https://igl-hkust.github.io/CoMoVi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13792 2026-04-13 cs.CV

VisionLaw: Inferring Interpretable Intrinsic Dynamics from Visual Observations via Bilevel Optimization

VisionLaw: 通过双层优化从视觉观测中推断可解释的内在动力学

Jiajing Lin, Shu Jiang, Qingyuan Zeng, Zhenzhong Wang, Min Jiang

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出VisionLaw框架,通过双层优化从视觉数据中推断可解释的内在动力学,解决了传统方法在可解释性和泛化能力上的不足。

Comments Accepted by ICLR 2026; Project Page: https://github.com/JiajingLin/VisionLaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06869 2026-04-13 cs.CV cs.AI

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20185 2026-04-13 cs.CL

SessionIntentBench: A Multi-task Inter-session Intention-shift Modeling Benchmark for E-commerce Customer Behavior Understanding

SessionIntentBench: 一个用于电子商务客户行为理解的多任务跨会话意图转移建模基准

Yuqi Yang, Weiqi Wang, Baixuan Xu, Wei Fan, Qing Zong, Chunkit Chan, Zheye Deng, Xin Liu, Yifan Gao, Changlong Yu, Chen Luo, Yang Li, Zheng Li, Qingyu Yin, Bing Yin, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) Amazon.com Inc(亚马逊公司)

AI总结 本文提出SessionIntentBench基准,通过意图树概念和数据集构建流程,评估大语言模型在跨会话意图转移中的能力,发现现有模型在复杂会话中难以捕捉意图,注入意图可提升性能。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08939 2026-04-13 cs.LG

Delve into the Applicability of Advanced Optimizers for Multi-Task Learning

深入研究先进优化器在多任务学习中的适用性

Zhipeng Zhou, Linxiao Cao, Pengcheng Wu, Peilin Zhao, Chunyan Miao

机构 * Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文研究了先进优化器在多任务学习中的应用,提出APT框架通过自适应动量机制平衡优化器与多任务学习的强项,并引入轻方向保持方法提升Muon的正交化效果,实验表明APT显著提升了多任务学习性能。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08720 2026-04-13 cs.SE cs.AI

Demystifying the Silence of Correctness Bugs in PyTorch Compiler

解析PyTorch编译器中正确性错误的沉默

Meiziniu Li, Dongze Li, Jianmeng Liu, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Guangzhou HKUST Fok Ying Tung Research Institute(广州香港科技大学霍英东研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究PyTorch编译器中正确性错误的特征,提出AlignGuard技术检测此类错误,已发现23个新错误,其中14个被标记为高优先级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08690 2026-04-13 cs.LG cs.CL

Skip-Connected Policy Optimization for Implicit Advantage

隐式优势下的跳连策略优化

Fengwei Teng, Jinyi Bai, Xinhao Yao, Demi Ruohan Wang, Jiahao Zhao, Zhijiang Guo

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Renmin University of China(中国人民大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出跳连优化方法,通过将推理分解为上游和下游阶段,利用密集奖励和蒙特卡洛采样提升性能,在数学基准和领域外任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08646 2026-04-13 cs.CV

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

InsEdit:通过数据高效的视频扩散模型适应实现基于指令的视觉编辑

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

AI总结 本文提出InsEdit,基于HunyuanVideo-1.5构建指令式编辑模型,结合Mutual Context Attention机制,仅需少量视频编辑数据即可实现高质量视频编辑,并支持图像编辑。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05529 2026-04-13 cs.AI

ActivityEditor: Learning to Synthesize Physically Valid Human Mobility

ActivityEditor: 学习合成物理有效的行人移动

Chenjie Yang, Yutian Jiang, Anqi Liang, Wei Qi, Chenyu Wu, Junbo Zhang

机构 * Southwest Jiaotong University(西南交通大学) HKUST (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) JD Technology(京东科技)

AI总结 本文提出ActivityEditor,一种双LLM代理框架,用于零样本跨区域轨迹生成。通过意图生成代理和编辑代理协同工作,结合强化学习和物理约束,实现高保真轨迹生成。

详情

展开后加载摘要…

URL PDF HTML 收藏