arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-03-26 至 2026-03-26 共收录 12
2603.24430 2026-03-26 cs.SD

Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation

迭代以区分:增强零样本语音合成评估的判别性和可靠性

Shengfan Shen, Di Wu, Xingchen Song, Dinghao Zhou, Liumeng Xue, Meng Meng, Jian Luan, Shuai Wang

机构 * Nanjing University(南京大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出I2D框架,通过递归合成语音提升零样本TTS评估的判别性和可靠性,实验显示其能提高系统级SRCC至0.464。

Comments submitted to Interspeech 2026, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24393 2026-03-26 cs.RO

3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models

3D-Mix用于VLA:一种用于将基于VGGT的3D信息整合到视觉-语言-动作模型中的即插即用模块

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Haishan Liu, Changti Wu, Hang Yuan, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团自动化研究院) ZGCI(中钢集团信息研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

AI总结 本文提出3D-Mix模块,通过语义条件门控融合机制提升视觉-语言-动作模型的3D感知能力,在标准化基准测试中实现最佳性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22171 2026-03-26 cs.CR cs.AI

Enhancing Jailbreak Attacks on LLMs via Persona Prompts

通过人格提示增强大语言模型的劫持攻击

Zheng Zhang, Peilin Zhao, Deheng Ye, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯)

AI总结 本文通过遗传算法生成人格提示,有效降低大语言模型拒绝率,提升劫持攻击成功率,揭示人格提示对模型安全机制的影响。

Comments Workshop on LLM Persona Modeling at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24045 2026-03-26 cs.CV

LGEST: Dynamic Spatial-Spectral Expert Routing for Hyperspectral Image Classification

LGEST: 动态空间-光谱专家路由用于超分辨率图像分类

Jiawen Wen, Suixuan Qiu, Zihang Luo, Xiaofei Yang, Haotian Shi

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学信息中心(广州)) Faculty of Geographical Science, Beijing Normal University(北京师范大学地理学部) School of Electronic and Communication Engineering, Guangzhou University(广州大学电子与通信工程学院)

AI总结 本文提出LGEST框架,通过DSAE生成判别性嵌入,结合CIEM-FPN动态融合多尺度特征,利用LGES专家系统提升超分辨率图像分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24014 2026-03-26 cs.AI

Language-Grounded Multi-Agent Planning for Personalized and Fair Participatory Urban Sensing

基于语言的多智能体规划用于个性化和公平的参与式城市传感

Xusen Guo, Mingxing Peng, Hongliang Lu, Hai Yang, Jun Ma, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出MAPUS框架,通过语言协商实现个性化和公平的参与式城市传感,提升参与度和可持续性。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23822 2026-03-26 cs.CR cs.CL cs.LG

How Vulnerable Are Edge LLMs?

边缘大语言模型有多脆弱?

Ao Ding, Hongzong Li, Zi Liang, Zhanpeng Shi, Shuxin Zhuang, Shiqin Tang, Rong Feng, Ping Lu

机构 * China University of Geoscience Beijing(中国地质大学(北京)) Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Polytechnic University(香港理工大学) Jilin University(吉林大学) City University of Hong Kong(香港城市大学) Chinese Academy of Sciences(中国科学院) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

AI总结 研究探讨了在边缘设备上部署的量化大语言模型在查询基础上的知识提取风险,提出CLIQ框架提升语义覆盖并减少冗余,实验显示其在BERTScore、BLEU和ROUGE指标上优于原始查询,揭示了量化无法有效防护查询提取的潜在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23507 2026-03-26 cs.CL cs.AI cs.LG

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

机构 * HKUST(香港科技大学) Huawei Foundation Model Dept(华为基础模型部门) CUHK(香港中文大学)

AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21917 2026-03-26 cs.CV

Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration

扫描簇,而非像素:一种以簇为中心的高效超高清图像修复范式

Chen Wu, Ling Wang, Zhuoran Zheng, Yuning Cui, Zhixiong Yang, Xiangyu Chen, Yue Zhang, Weidong Jiang, Jingyuan Xia

机构 * National University of Defense Technology(国防科技大学) HKUST(GZ)(香港理工大学) Qilu University of Technology(青岛科技大学) Technical University of Munich(慕尼黑技术大学) TeleAI, China Telecom(TeleAI,中国电信) Beihang University(北航)

AI总结 本文提出C$^2$SSM,通过簇串行扫描替代像素串行扫描,实现超高清图像修复的高效处理,显著降低计算成本并取得新成果。

Comments Aceepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01540 2026-03-26 cs.CV

FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention

FlashVGGT: 高效且可扩展的视觉几何变换器与压缩描述符注意力

Zipeng Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出FlashVGGT,通过压缩描述符注意力机制解决传统自注意力的可扩展性问题,实现高效多视角图像三维重建,实验表明其在精度和效率上优于VGGT。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01718 2026-03-26 cs.RO cs.CV

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10223 2026-03-26 cs.CL cs.AI cs.LG

You only need 4 extra tokens: Synergistic Test-time Adaptation for LLMs

你只需要4个额外的标记:用于LLM的协同测试时间适应

Yijie Xu, Huizai Yao, Zhiyu Guo, Pengteng Li, Aiwei Liu, Xuming Hu, Weiyu Guo, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 本文提出SyTTA框架,通过输入侧困惑度和输出侧预测熵的协同作用,实现无需标注数据的LLM测试时间适应,显著提升农业问答任务的性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22460 2026-03-26 cs.AI

GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation

GeoSketch: 一种基于神经符号的方法,用于几何多模态推理中的辅助线构造与仿射变换

Shichao Weng, Zhiqiang Wang, Yuhua Zhou, Rui Lu, Ting Liu, Zhiyang Teng, Xiaozhang Liu, Hanmeng Liu

机构 * Fudan University(复旦大学) IFLYTEK CO.LTD(若lytek有限公司) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Defense Technology(国防科技大学) Hainan University(海南大学)

AI总结 GeoSketch通过整合感知、符号推理和绘图动作模块,实现动态几何推理,提升多模态推理的准确性和解决问题的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏