arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-03-31 至 2026-03-31 共收录 24
2510.10063 2026-03-31 cs.CL cs.AI

CLMN: Concept based Language Models via Neural Symbolic Reasoning

基于神经符号推理的概念语言模型:CLMN

Yibo Yang

机构 * College of Science, The Hong Kong University of Science and Technology(香港科技大学理学院)

AI总结 CLMN通过神经符号推理方法,在保持性能的同时提升NLP的可解释性,通过连续嵌入和模糊逻辑推理学习概念交互规则,提升医疗和金融等领域的文本处理效果。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28475 2026-03-31 cs.RO

Tac2Real: Reliable and GPU Visuotactile Simulation for Online Reinforcement Learning and Zero-Shot Real-World Deployment

Tac2Real: 可靠且用于在线强化学习和零样本现实部署的GPU视觉触觉模拟

Ningyu Yan, Shuai Wang, Xing Shen, Hui Wang, Hanqing Wang, Yang Xiang, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Algorithms of Machine Learning and Autonomous Driving Research Lab, HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(机器学习与自动驾驶算法研究实验室,香港科技大学深圳-香港协同创新研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Tac2Real框架,结合PNCG-IPC方法和多GPU并行架构,实现高效的在线强化学习训练,并通过TacAlign方法减少领域间隙,验证了在现实场景中高成功率的零样本迁移。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28010 2026-03-31 cs.AI

HeteroHub: An Applicable Data Management Framework for Heterogeneous Multi-Embodied Agent System

HeteroHub:一种适用于异构多具身代理系统的数据管理框架

Xujia Li, Xin Li, Junquan Huang, Beirong Cui, Zibin Wu, Lei Chen

机构 * HKUST(香港科技大学)

AI总结 本文提出HeteroHub框架,整合静态元数据、任务对齐训练语料和实时数据流,支持任务感知模型训练和闭环控制,实现复杂任务的协调执行。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12057 2026-03-31 cs.CV cs.AI

Coarse-Guided Visual Generation via Weighted h-Transform Sampling

通过加权h变换采样实现粗引导的视觉生成

Yanghao Wang, Ziqi Jiang, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出一种基于h变换的粗引导视觉生成方法,通过调整采样步骤的概率过渡,结合噪声水平感知调度,提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05551 2026-03-31 cs.CV

FastVMT: Eliminating Redundancy in Video Motion Transfer

FastVMT:消除视频运动迁移中的冗余

Yue Ma, Zhikai Wang, Tianhao Ren, Mingzhe Zheng, Hongyu Liu, Jiayi Guo, Kunyu Feng, Yuxuan Xue, Zixiang Zhao, Konrad Schindler, Qifeng Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) HKUST(香港科技大学) THU(清华大学) Meta ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出FastVMT,通过消除DiT架构中的运动和梯度冗余,实现视频运动迁移的加速,提升生成视频的效率而不影响视觉质量和时间一致性。

Comments Accepted by ICLR2026, Project page: fastvmt.gitHub.io, Code: https://github.com/mayuelala/FastVMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20212 2026-03-31 cs.CV

Target-aware Image Editing via Cycle-consistent Constraints

面向目标的图像编辑通过循环一致约束

Yanghao Wang, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出FlowCycle框架,通过循环一致约束生成目标感知的中间状态,提升图像编辑的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10102 2026-03-31 cs.LG

PANTHER: Generative Pretraining Beyond Language for Sequential User Behavior Modeling

PANTHER:超越语言的生成预训练用于序列用户行为建模

Guilin Li, Yun Zhang, Xiuyuan Chen, Chengqi Li, Bo Wang, Linghe Kong, Wenjia Wang, Weiran Huang, Matthias Hwai Yong Tan

机构 * Shanghai Jiao Tong University(上海交通大学) WeChat Pay, Tencent(微信支付,腾讯) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 PANTHER通过生成预训练方法,结合生成与判别模型,实现用户行为序列的高效建模,提升交易预测和欺诈检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01014 2026-03-31 cs.CV

Revisiting Adversarial Training under Hyperspectral Image

重新审视超光谱图像下的对抗训练

Weihua Zhang, Chengze Jiang, Minjing Dong, Jie Gui, Lu Dong, Zhipeng Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Engineering Research Center of Blockchain Application, Supervision and Management, Ministry of Education, Southeast University(东南大学教育部区块链应用监管工程研究中心) Purple Mountain Laboratories(紫金山实验室) Collaborative Innovation Center of Geospatial Technology, Wuhan University(武汉大学地理空间技术协同创新中心) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

AI总结 本文针对超光谱图像分类中对抗攻击的脆弱性问题,提出两种专为超光谱设计的对抗训练方法,以缓解对抗扰动导致的语义信息破坏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05207 2026-03-31 cs.CV

Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning

跟随你的动作:通过高效的时空解耦微调实现视频动作迁移

Yue Ma, Yulong Liu, Qiyuan Zhu, Ayden Yang, Kunyu Feng, Xinhua Zhang, Zexuan Yan, Zhifeng Li, Sirui Han, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) XIntelligence Technology Co., Limited(星云科技股份有限公司) SJTU(上海交通大学)

AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。

Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07297 2026-03-31 cs.LG q-bio.QM

MM-DADM: Multimodal Drug-Aware Diffusion Model for Virtual Clinical Trials

MM-DADM:多模态药物感知扩散模型用于虚拟临床试验

Qian Shao, Bang Du, Zepeng Li, Qiyuan Chen, Jiahe Chen, Hongxia Xu, Jimeng Sun, Jian Wu, Jintai Chen

机构 * Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出MM-DADM,一种多模态药物感知扩散模型,用于生成个性化药物诱导ECG。通过动态交叉注意模块融合外部物理知识,解决形态真实性和病理灵活性的平衡问题,并利用因果特征编码器提取纯药理表示,提升模拟准确性和召回率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27624 2026-03-31 cs.AR cs.AI

Expert Streaming: Accelerating Low-Batch MoE Inference via Multi-chiplet Architecture and Dynamic Expert Trajectory Scheduling

专家流:通过多芯片组架构和动态专家轨迹调度加速低批次MoE推理

Songchen Ma, Hongyi Li, Weihao Zhang, Yonghao Tan, Pingcheng Dong, Yu Liu, Lan Liu, Yuzhong Jiao, Xuejiao Liu, Luhong Liang, Kwang-Ting Cheng

机构 * AI Chip Center for Emerging Smart Systems(新兴智能系统芯片中心) The Hong Kong University of Science and Technology(香港科技大学) Shanghai UniVista Industrial Software Group Co., Ltd.(上海华大九天工业软件集团有限公司)

AI总结 本文提出FSE-DP架构,通过多芯片组上的细粒度专家流调度,解决低批次MoE推理中的内存限制和负载不均问题,实现性能提升和内存节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27553 2026-03-31 cs.CV

Annotation-Free Detection of Drivable Areas and Curbs Leveraging LiDAR Point Cloud Maps

无需标注的 drivable 区域和路障检测:利用 LiDAR 点云地图

Fulong Ma, Daojie Peng, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出 MADL 模块,通过 LiDAR 地图与路障检测结合,自动生成训练数据,提升 drivable 区域和路障检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27375 2026-03-31 cs.CV

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Huawei(华为) HKUST (GZ)(香港科技大学(广州))

AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。

Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27245 2026-03-31 cs.RO

Design of an In-Pipe Robot with Contact-Angle-Guided Kinematic Decoupling for Crosstalk-Suppressed Locomotion

管内机器人接触角引导的运动解耦设计

Min Yang, Yang Tian, Longchuang Li, Jun Ma, Shugen Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统学域) Department of Engineering, Shinshu University(信州大学工学部) College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院)

AI总结 本文提出一种管内机器人,通过接触角引导的运动解耦机制,实现轴向牵引与滚动重新定向的独立驱动,有效抑制噪声干扰,实验验证了其在垂直管道中的稳定性和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08961 2026-03-31 cs.CV cs.AI cs.CG cs.LG

MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAE

MotionCrafter: 通过4D VAE实现密集几何与运动重建

Ruijie Zhu, Jiahao Lu, Wenbo Hu, Xiaoguang Han, Jianfei Cai, Ying Shan, Chuanxia Zheng

机构 * NTU(南洋理工大学) ARC Lab, Tencent PCG(腾讯PCG ARC Lab) HKUST(香港科技大学) CUHK(SZ)(香港中文大学(深圳)) Monash University(莫纳什大学)

AI总结 MotionCrafter通过4D VAE联合重建4D几何和估计密集运动,采用共享坐标系下的点云与场景流联合表示,提升重建质量。

Comments Project page: https://ruijiezhu94.github.io/MotionCrafter_Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18600 2026-03-31 cs.CV

NeAR: Coupled Neural Asset-Renderer Stack

NeAR:耦合神经资产-渲染堆栈

Hong Li, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Ziyang Yan, Lixing Xiao, Zhaoxi Chen, Jianfeng Xiang, Shaocong Xu, Xuhui Liu, Yikai Wang, Baochang Zhang, Xiaoguang Han, Jiaolong Yang, Hao Zhao

机构 * BUAA(北京航空航天大学) BAAI(北京智源人工智能研究院) FNii, CUHKSZ(香港中文大学(深圳)未来网络创新研究院) HKUST(香港科技大学) NJU(南京大学) UniTn(特伦托大学) ZJU(浙江大学) NTU(南洋理工大学) THU(清华大学) BNU(北京师范大学) SSE, CUHKSZ(香港中文大学(深圳)理工学院) AIR, THU(清华大学智能产业研究院)

AI总结 NeAR通过耦合资产表示与渲染器设计,提升生成质量和一致性。引入Lighting-Homogenized SLAT和光照感知解码器,实现实时可重照明的3D高斯溅射生成,优于现有方法。

Comments Accepted by CVPR 2026. The project page: https://near-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07738 2026-03-31 cs.LG cs.CV

From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training

从探索到利用:一种两阶段熵RLVR方法用于噪声容忍的多模态大语言模型训练

Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po

机构 * Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学)

AI总结 本文提出一种两阶段熵优化方法,通过探索阶段提升输出多样性,利用阶段提高预测准确性,增强噪声容忍能力,实验证明在不同模型和任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25327 2026-03-31 cs.CV cs.AI cs.LG

MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding

MMEdge: 通过流水线传感和编码加速设备端多模态推理

Runxi Huang, Mingxuan Yu, Mingyu Tsoi, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 MMEdge提出一种基于流水线传感和编码的设备端多模态推理框架,通过细粒度传感和编码单元实现增量计算,结合轻量级时间聚合模块和自适应配置优化器,降低延迟并保持高精度。

Comments Code available at: https://github.com/HKUST-MINSys-Lab/MMEdge. Accepted by SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15392 2026-03-31 cs.CL

Understanding the Anchoring Effect of LLM with Synthetic Data: Existence, Mechanism, and Potential Mitigations

理解大语言模型中锚定效应的锚定作用:存在性、机制与潜在缓解方法

Yiming Huang, Biquan Bie, Zuqiu Na, Weilin Ruan, Songxin Lei, Yutao Yue, Xinlei He

机构 * The Hong Kong University of Science and Technology, Guangzhou(香港科技大学(广州)) Independent Researcher(独立研究员)

AI总结 本文研究大语言模型是否受锚定效应影响,揭示其机制并提出缓解策略,通过SynAnchors数据集验证了LLM存在锚定偏误,浅层结构难以消除,而推理能部分缓解。

Comments Accepted by the HCAIR workshop of ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21086 2026-03-31 cs.CV cs.AI

Efficient Mixture-of-Expert for Video-based Driver State and Physiological Multi-task Estimation in Conditional Autonomous Driving

高效多专家模型用于基于视频的驾驶员状态和生理多任务估计在条件自动驾驶中

Jiyao Wang, Xiao Yang, Zhenyu Wang, Ximeng Wei, Ange Wang, Dengbo He, Kaishun Wu

机构 * the Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Hong Kong(香港大学)

AI总结 本文提出VDMoE模型,通过RGB视频和远程PPG数据监测驾驶员状态,优化多专家框架以提升多模态输入下的检测效率与准确性,通过新数据集验证其在条件自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26866 2026-03-31 cs.CV cs.AI

LACON: Training Text-to-Image Model from Uncurated Data

LACON:从未整理数据中训练文本到图像模型

Zhiyang Liang, Ziyu Wan, Hongyu Liu, Dong Chen, Qiu Shen, Hao Zhu, Dongdong Chen

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) HKUST(香港科技大学)

AI总结 LACON通过利用未整理数据分布,将质量信号作为条件标签,提升生成质量,证明了未整理数据的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26757 2026-03-31 cs.RO

Beyond Viewpoint Generalization: What Multi-View Demonstrations Offer and How to Synthesize Them for Robot Manipulation?

超越视角泛化:多视角演示提供了什么以及如何为机器人操作合成它们

Boyang Cai, Qiwei Liang, Jiawei Li, Shihang Weng, Zhaoxin Zhang, Tao Lin, Xiangyu Chen, Wenjie Zhang, Jiaqi Mao, Weisheng Xu, Bin Yang, Jiaming Liang, Junhao Cai, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing Jiaotong University(北京交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究通过实验验证多视角演示在机器人操作中的性能提升,揭示了多视角数据在提升泛化能力和突破单视角限制方面的优势,提出RoboNVS框架合成多视角数据以提升下游政策表现。

详情

展开后加载摘要…

URL PDF HTML 收藏