arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-05-11 至 2026-05-11 共收录 17
2605.07825 2026-05-11 cs.MM cs.CV

Anisotropic Modality Align

各向异性模态对齐

Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Stanford(斯坦福大学) PKU(北京大学) THU(清华大学)

AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26509 2026-05-11 cs.RO cs.CV

3D Generation for Embodied AI and Robotic Simulation: A Survey

用于具身AI和机器人模拟的3D生成:综述

Tianwei Ye, Yifan Mao, Minwen Liao, Jian Liu, Chunchao Guo, Dazhao Du, Quanxin Shou, Fangqi Zhu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Wuhan University(武汉大学) Harbin Institute of Technology(哈尔滨工业大学) Xinjiang University(新疆大学) Tencent(腾讯)

AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。

Comments 27 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11758 2026-05-11 cs.RO

HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model

HAIC:通过动态感知世界模型实现人形敏捷物体交互控制

Dongting Li, Xingyu Chen, Qianyang Wu, Bo Chen, Sikai Wu, Hanyu Wu, Guoyao Zhang, Liang Li, Mingliang Zhou, Diyun Xiang, Jianzhu Ma, Qiang Zhang, Renjing Xu

机构 * Tsinghua University(清华大学) HKUST(Guangzhou)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Xiaomi Robotics Lab(小米机器人实验室)

AI总结 本文提出HAIC框架,通过动态预测和空间优先级构建动态占用地图,实现人形机器人在复杂动态环境下与不同物体的稳健交互,提升敏捷任务和多物体长周期任务的完成能力。

Comments RSS 2026. Webpage: https://haic-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19669 2026-05-11 cs.CL

DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference

DiffAdapt:面向令牌高效大语言模型推理的难度自适应推理

Xiang Liu, Xuming Hu, Xiaowen Chu, Eunsol Choi

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) New York University(纽约大学)

AI总结 本文提出DiffAdapt框架,通过分析推理轨迹中的熵分布,根据问题难度选择不同的推理策略,减少令牌使用量,提升推理效率。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11512 2026-05-11 cs.LG cs.AI

From Time Series Analysis to Question Answering: A Survey in the LLM Era

从时间序列分析到问答:在大语言模型时代的一次综述

Wei Li, Zhe Xie, Yuxuan Liang, Xinli Hao, Yunyao Cheng, Dan Pei, Xiaofeng Meng

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Aalborg University(奥胡斯大学)

AI总结 本文综述了大语言模型时代时间序列分析向时间序列问答的转变,探讨了TSQA在灵活性、经济性和通用性方面的选择指导及未来研究方向。

Comments Accepted by IJCAI 2026 Survey Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07356 2026-05-11 cs.CV

UniD-Shift: Towards Unified Semantic Segmentation via Interpretable Share-Private Multimodal Decomposition

UniD-Shift:通过可解释的共享-私有多模态分解实现统一的语义分割

Shuai Zhang, Zhecheng Shi, Zhuxiao Li, Jing Ou, Tengxi Wang, Yuan Liu, Wufan Zhao

机构 * HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出UniD-Shift框架,通过结合视觉和几何编码器提取互补特征,并通过共享-私有子空间分解实现2D-3D语义分割的统一。实验表明在SemanticKITTI和nuScenes数据集上优于基线方法,且具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07354 2026-05-11 eess.SP cs.CV

Task-Oriented Communication for Human Action Understanding via Edge-Cloud Co-Inference

面向任务的边缘-云协同通信用于人类动作理解

Jingyi Liu, Cheng Yuan, Lijun He, Jun Zhang, Jiawei Shao

机构 * Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究所) School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系)

AI总结 本文提出TOAU框架,通过边缘-云协作减少传输负载和延迟,利用单目姿态估计器和VQ-VAE提取动作特征,提升动作理解精度。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07313 2026-05-11 cs.AI

When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory

当存储的证据不再可用:基于规模的代理记忆评估

Jiaqi Shao, Yiyi Lu, Yunzhen Zhang, Bing Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(杜克昆山大学)

AI总结 本文提出了一种基于规模的代理记忆评估方法,用于评估记忆在无关会话积累时的可靠性变化,展示了不同记忆系统在不同规模下的表现差异。

Comments 19 pages, 11 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07275 2026-05-11 cs.RO

Palm-sized Omnidirectional Vision-Based UAV Exploration with Sparse Topological Map Guidance

掌 sized 全向视觉基于的无人机探索与稀疏拓扑图引导

Zirui Wang, Xinjia Luo, Haotian Sun, Jun Ma, Jian Guo, Boyu Zhou

机构 * Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Thrust of Robotics and Autonomous Systems, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统研究所) International Digital Economy Academy, Shenzhen, China(深圳国际数字经济学院)

AI总结 本文提出一种轻量级自主探索系统,利用全向视觉和稀疏拓扑图引导,通过多鱼眼相机实现全向视场和深度估计,采用拓扑节点表示前沿区域,减少内存和计算需求,实现在模拟和实际无人机中高效探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07247 2026-05-11 cs.AI

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

EnvSimBench:一个评估和改进基于LLM的环境模拟的基准

Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Chongqing University(重庆大学)

AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06731 2026-05-11 cs.CR cs.CL cs.LG

When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents

当常规聊天变得有毒:个性化代理中无意的长期状态污染

Xiaoyu Xu, Minxin Du, Qipeng Xie, Haobin Ke, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology, HKUST (Guangzhou)(香港科学与技术大学(广州))

AI总结 研究探讨了个性化代理中因常规交互导致的长期状态污染问题,提出ULSPB基准和Harm Score指标,并通过StateGuard防御机制降低安全风险。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06716 2026-05-11 cs.AI cs.CL

From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms

从存储到经验:LLM代理记忆机制演化的综述

Jinghao Luo, Yuchen Tian, Chuxue Cao, Ziyang Luo, Hongzhan Lin, Kaixin Li, Chuyi Kong, Ruichao Yang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) South China Normal University(南方中国师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Science and Technology Beijing(北京科技大学)

AI总结 本文综述了LLM代理记忆机制的发展,提出三阶段框架,分析长程一致性、动态环境挑战和持续学习目标,探讨前瞻性探索与跨轨迹抽象等前沿机制,为下一代LLM代理设计提供指导。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05866 2026-05-11 cs.AI cond-mat.mtrl-sci cs.LG

XDecomposer: Learning Prior-Free Set Decomposition for Multiphase X-ray Diffraction

XDecomposer:学习无先验的多相X射线衍射集分解

Hanyu Gao, Bin Cao, Yunyue Su, Tong-Yi Zhang, Qiang Liu

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所新型模式识别实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Guangzhou Municipal Key Laboratory of Materials Informatics, The Hong Kong University of Science and Technology (Guangzhou)(广州市材料信息学重点实验室,香港科技大学(广州)) Green Dynamics, Australia(澳大利亚绿动公司)

AI总结 XDecomposer通过无先验假设的方法,实现多相X射线衍射模式的联合分解与识别,无需候选相列表或结构模板,提升重建准确性和相识别能力。

Comments 28pages, 8figures, 6tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00663 2026-05-11 cs.RO cs.CV

Affordance Agent Harness: Verification-Gated Skill Orchestration

可及性代理框架:验证门控技能协调

Haojian Huang, Jiahao Shi, Yinchuan Li, Yingcong Chen

机构 * HKUST(GZ)(香港理工大学(广州)) Knowin AI Harbin Engineering University(哈尔滨工程大学)

AI总结 本文提出一种闭环运行时系统,统一异构技能并利用证据存储和成本控制,通过路由器自适应选择技能,利用验证器通过自一致性、跨尺度稳定性等验证证据充分性,从而提升可及性定位的准确性和效率。

Comments 43 pages, 22 figures, 8 tables. Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15356 2026-05-11 eess.IV cs.AI

Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing

Q-Probe:通过上下文感知代理探测扩展图像质量评估至高分辨率

Xiang Li, Xueheng Li, Yu Wang, Xuanhua He, Zhangchi Hu, Weiwei Yu, Chengjun Xie

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Institute of Intelligent Machines, Chinese Academy of Sciences(中国科学院智能 Machines 研究所)

AI总结 Q-Probe通过上下文感知探测方法解决高分辨率图像质量评估中的局部退化捕捉问题,提出Vista-Bench基准和三阶段训练框架,实现高分辨率下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03454 2026-05-11 cs.CV cs.AI

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) UESTC(电子科技大学) Purdue University(普渡大学) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏