arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-05-13 至 2026-05-13 共收录 20
2605.12496 2026-05-13 cs.CV

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

CausalCine:多镜头视频叙事的实时自回归生成

Yihao Meng, Zichen Liu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yue Yu, Hanlin Wang, Haobo Li, Jiapeng Zhu, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen, Huamin Qu

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) SJTU(上海交通大学)

AI总结 CausalCine通过自回归框架实现多镜头视频生成,通过动态提示和记忆路由保持跨镜头连贯性,优于现有自回归模型,实现实时交互生成。

Comments Project page: https://yihao-meng.github.io/CausalCine/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12384 2026-05-13 cs.CL cs.AI cs.LG

Scalable Token-Level Hallucination Detection in Large Language Models

可扩展的令牌级幻觉检测方法在大语言模型中

Rui Min, Tianyu Pang, Chao Du, Minhao Cheng, Yi R. Fung

机构 * Sea AI Lab(Sea AI实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文提出TokenHD方法,通过可扩展的数据引擎和重要性加权策略,实现令牌级幻觉检测,实验显示小型模型在训练后性能优于大模型,且检测能力随模型规模扩大而提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12357 2026-05-13 cs.AI

$δ$-mem: Efficient Online Memory for Large Language Models

$δ$-mem: 高效的大型语言模型在线内存

Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Mind Lab Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出$δ$-mem机制,通过紧凑的在线状态与注意力计算直接耦合,提升模型在长文本任务中的表现,无需全微调或替换backbone。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12106 2026-05-13 cs.AI

Large Language Models as Amortized Pareto-Front Generators for Constrained Bi-Objective Convex Optimization

大语言模型作为约束双目标凸优化的 amortized 帕累托前沿生成器

Peipei Xu, SiYuan Ma, Yaohua Liu, Yu Wu, Guanliang Liu, Yang Zhang, Yong Liu

机构 * University of Shanghai for Science and Technology(上海科技大学) Nanyang Technological University(南洋理工大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Georgia Institute of Technology(佐治亚理工学院) The University of Michigan(密歇根大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出DIPS框架,利用大语言模型生成约束双目标凸优化的帕累托前沿,通过紧凑离散化方案和三阶段课程优化,实现高效连续优化。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11934 2026-05-13 cs.CV

Interactive State Space Model with Cross-Modal Local Scanning for Depth Super-Resolution

交互式状态空间模型与跨模态局部扫描用于深度超分辨率

Chen Wu, Ling Wang, Zhuoran Zheng, Xiangyu Chen, Jingyuan Xia, Weidong Jiang, Jiantao Zhou

机构 * National University of Defense Technology(国防科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) University of Macau(澳门大学)

AI总结 本文提出交互式状态空间模型,通过跨模态局部扫描实现RGB与深度特征的细粒度语义交互,提升深度超分辨率的效率与语义交互能力。

Comments ISCAS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10235 2026-05-13 cs.CL

Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection

在检索前路由:激活大语言模型的潜在路由能力用于RAG与长上下文选择

Yiwen Chen, Kuan Li, Fuzhen Zhuang, Deqing Wang, Zhao Zhang, Liwen Zhang, Yong Jiang, Shuai Wang, Minhao Cheng

机构 * Beihang University(北航) HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文提出Pre-Route框架,通过结构化推理提前决策,利用轻量级元数据进行任务分析和信息需求预测,实现可解释且高效的路由决策,实验表明其在成本效益上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09271 2026-05-13 cs.AI

Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding

通过语言表示塑造模式作为扩展LLM智能的下一个前沿

Zhiqin Yang, Yuhan Liu, Jingwen Fu, Pei Fu, Bo Han, Masashi Sugiyama, Nanning Zheng

机构 * The Hong Kong University of Science and Technology(香港理工大学) MiLM Plus, Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Hong Kong Baptist University(香港 Baptist大学) The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院高级智能项目中心) Xi’an Jiaotong University(西安交通大学)

AI总结 本文探讨通过高级语言表示塑造模式作为扩展LLM智能的新方向,提出语言表示的结构和符号复杂性对知识激活和组织至关重要,并通过实验证明语言表示设计的有效性。

Comments 41 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05947 2026-05-13 cs.CV

LucidNFT: LR-Anchored Multi-Reward Preference Optimization for Flow-Based Real-World Super-Resolution

LucidNFT: 基于LR锚定的多奖励偏好优化用于基于流的现实世界超分辨率

Song Fei, Tian Ye, Sixiang Chen, Zhaohu Xing, Jianyu Lai, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出LucidNFT框架,通过引入LucidConsistency、解耦奖励归一化策略和LucidLR数据集,解决现实世界超分辨率中LR参考一致性、奖励优化瓶颈和真实退化覆盖不足的问题,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21625 2026-05-13 cs.RO

Tacmap: Bridging the Tactile Sim-to-Real Gap via Geometry-Consistent Penetration Depth Map

Tacmap: 通过几何一致的穿透深度图弥合触觉仿真到现实的差距

Lei Su, Zhijie Peng, Renyuan Ren, Shengping Mao, Juan Du, Kaifeng Zhang, Xuezhou Zhu

机构 * Sharpa HKUST(香港科技大学) NVIDIA(英伟达)

AI总结 Tacmap通过统一的变形地图表示弥合触觉仿真与现实的差距,利用体积穿透深度实现高保真且高效的触觉仿真,验证了在抓取任务中仿真政策的零样本迁移能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22414 2026-05-13 cs.CV

LucidFlux: Caption-Free Photo-Realistic Image Restoration via a Large-Scale Diffusion Transformer

LucidFlux:一种无需图像描述的高质量图像修复方法

Song Fei, Tian Ye, Lujia Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 LucidFlux通过大规模扩散变压器实现无描述图像修复,引入轻量双分支条件器和自适应调制方案,提升几何精度与纹理恢复,优于开源和商业基线。

Comments Project Page: https://w2genai-lab.github.io/LucidFlux

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11756 2026-05-13 cs.CV cs.AI

Focusable Monocular Depth Estimation

可聚焦的单目深度估计

Yuxin Du, Tao Lin, Zile Zhong, Runting Li, Xiyao Chen, Jiting Liu, Chenglin Liu, Ying-Cong Chen, Yuqian Fu, Bo Zhao

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

AI总结 本文提出FDE,一种区域感知的单目深度估计方法,通过FocusDepth框架和MSSA模块,提升目标区域的深度精度和全局几何一致性,基于FDE-Bench验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11750 2026-05-13 cs.RO cs.AI cs.CL cs.CV

DreamAvoid: Critical-Phase Test-Time Dreaming to Avoid Failures in VLA Policies

DreamAvoid:关键阶段测试时 dreaming 以避免 VLA 策略中的失败

Xianzhe Fan, Yuxiang Lu, Shenyuan Gao, Xiaoyang Wu, Ruihua Han, Manling Li, Hengshuang Zhao

机构 * HKU(香港大学) HKUST(香港理工大学) Northwestern University(西北大学)

AI总结 DreamAvoid 通过关键阶段测试时 dreaming 框架,使 VLA 模型能预测并避免失败,提升任务成功率。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11559 2026-05-13 cs.CV cs.AI

When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

当观察不足时:视觉注意结构揭示大语言模型中的幻觉

Fanpu Cao, Xin Zou, Xuming Hu, Hui Xiong

机构 * Thrust of Artificial Intelligence, HKUST (Guangzhou)(人工智能前沿 thrust,香港科技大学(广州)) Department of Computer Science and Engineering, HKUST(计算机科学与工程系,香港科技大学)

AI总结 本文通过分析视觉注意的高频结构揭示大语言模型中的幻觉现象,提出LaSCD解码策略,有效减少幻觉并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09964 2026-05-13 cs.AI q-bio.QM

Learning the Interaction Prior for Protein-Protein Interaction Prediction: A Model-Agnostic Approach

学习蛋白质-蛋白质相互作用的优先级:一种模型无关的方法

Ziqi Gao, Chenyi Zi, Zijing Liu, Ziqiao Meng, Yu Li, Jia Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) IDEA Research(IDEA研究院)

AI总结 本文提出L3-PPI方法,通过生物启发的L3路径正则化图提示学习,提升蛋白质相互作用预测性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09287 2026-05-13 cs.AI

PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

PiCA:基于枢纽的搜索代理强化学习中的信用分配

Dongyi Liu, Yifan Niu, Qinwen Wang, Han Xiao, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 PiCA通过重新定义搜索轨迹为累积搜索进度的序列过程,解决长周期信用分配中的稀疏奖励、孤立信用和分布偏移问题,提升知识密集型问答任务性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22507 2026-05-13 cs.LG cs.CV

Space Syntax-guided Post-training for Residential Floor Plan Generation

基于空间语法的后训练生成住宅平面图

Zhuoyang Jiang, Dongqing Zhang

机构 * College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)信息中心)

AI总结 本文提出SSPT框架,通过空间语法集成 oracle 评估生成平面图的空间配置质量,改进生成器的配置逻辑,SSPT-PPO在非分布环境下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12034 2026-05-13 cs.CV cs.LG cs.MM

Calibrated Multimodal Representation Learning with Missing Modalities

校准的多模态表示学习与缺失模态

Xiaohao Liu, Xiaobo Xia, Jiaheng Wei, Shuo Yang, Xiu Su, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Central South University(中南大学)

AI总结 本文提出CalMRL,通过校准缺失模态导致的不完整对齐问题,从锚点偏移角度提供理论见解,结合先验知识和模态间联系,解决优化难题,验证了方法的有效性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19770 2026-05-13 cs.LG cs.CL

Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO

理解偏好学习中的性能差距:RLHF和DPO的二元性

Ruizhe Shi, Minhak Song, Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Amazon Inc.(亚马逊公司)

AI总结 本文分析RLHF和DPO性能差距的来源,揭示模型规格误差对方法选择的影响,指出在线DPO在特定条件下优于其他方法,揭示两阶段学习的统计优势。

Comments ICML accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01941 2026-05-13 cs.CL cs.AI

Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression

语义完整性至关重要:在KV缓存压缩中基准测试与保持高密度推理

Xiang Liu, Zhenheng Tang, Hong Chen, Peijie Dong, Zeyu Li, Xiuze Zhou, Bo Li, Xuming Hu, Xiaowen Chu

机构 * The Hong Kong University of Science(香港科学与技术大学) Guangzhou HKUST Fok Ying Tung Research Institute(广州HKUST傅种群研究院)

AI总结 本文提出KVFundaBench基准测试,揭示了在高密度推理中压缩导致的严重任务依赖性退化问题,并提出ShotKV方法,通过分离prefill和解码阶段以优先保持语义完整性,提升了长上下文生成任务的准确率并降低了延迟。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏