arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

2026-04-28 至 2026-04-28 共收录 7
2604.24391 2026-04-28 cs.RO

FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching

FreqCache: 通过自适应频率引导的标记缓存加速具身VLN模型

Zihao Zheng, Xingyue Zhou, Zhihao Mao, Songyu Sun, Lingyue Zhang, Yulong Ao, Yupu Feng, Qiongqiong Zhang, Yonghua Lin, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence, BAAI(北京人工智能研究院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of EECS, Peking University(北京大学电子信息技术学院)

AI总结 本文提出FreqCache框架,通过频率域方法优化VLN模型中的标记缓存,解决传统视觉方法在视角迁移、边缘信息和场景时变性上的不足,实验显示其在计算效率上有1.59倍的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05970 2026-04-28 cs.CV cs.AI cs.CL

PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling

PDF-WuKong:一种用于高效长PDF阅读的大型多模态模型,采用端到端稀疏采样

Xudong Xie, Hao Yan, Liang Yin, Yang Liu, Jing Ding, Minghui Liao, Yuliang Liu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

AI总结 本文提出PDF-WuKong,一种针对长PDF文档的多模态大语言模型,通过端到端稀疏采样提升多模态问答效率,实验表明其在长文档理解任务中优于其他模型,F1得分平均高出8.6%。

Comments Accepted by International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23717 2026-04-28 cs.SD cs.CL

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

HeadRouter: 任务自适应音频标记压缩中的动态头部权重路由

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) DAIL Tech(DAIL科技) Northeastern University(东北大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 HeadRouter通过动态评估不同音频任务中注意力头的重要性,实现高效的音频标记压缩,实验表明其在多个基准上均取得最佳压缩效果。

Comments Homepage: https://dabdans.github.io/HeadRouter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23148 2026-04-28 cs.AI

PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering Attacks

PhySE: 一种用于实时AR-LLM社会工程攻击的心理学框架

Tianlong Yu, Yang Yang, Ziyi Zhou, Jiaying Xu, Siwei Li, Tong Guan, Kailong Wang, Ting Bi

机构 * Hubei University(湖北大学) Apple Inc(苹果公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 PhySE通过视觉语言模型的社会上下文训练和自适应心理代理,解决AR-LLM社会工程攻击中的冷启动个性化和静态攻击策略问题,提升实时交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23141 2026-04-28 cs.CR cs.AI

UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks

UNSEEN: 一种跨栈LLM去学习防御对抗AR-LLM社会工程攻击

Tianlong Yu, Yang Yang, Xiao Luo, Lihong Liu, Fudu Xing, Zui Tao, Kailong Wang, Gaoyang Liu, Ting Bi

机构 * Hubei University(湖北大学) University of Southern California(南加州大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对AR-LLM社会工程攻击,提出UNSEEN跨栈防御机制,结合AR访问控制层、基于F-RMU的LLM去学习和运行时代理防护,通过用户研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10047 2026-04-28 cs.CV

MuSc-V2: Zero-Shot Multimodal Industrial Anomaly Classification and Segmentation with Mutual Scoring of Unlabeled Samples

MuSc-V2:基于未标记样本互评分的零样本多模态工业异常分类与分割

Xurui Li, Feng Xue, Yu Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) University of Trento(特伦特大学)

AI总结 本文提出MuSc-V2框架,通过改进3D表示、融合多尺度特征及互评分机制,实现零样本多模态工业异常检测,提升MVTec 3D-AD和Eyecandies数据集性能。

Comments TPAMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18836 2026-04-28 eess.IV cs.AI cs.CV

Dual-domain Multi-path Self-supervised Diffusion Model for Accelerated MRI Reconstruction

双域多路径自监督扩散模型用于加速MRI重建

Yuxuan Zhang, Jinkui Hao, Bo Zhou

机构 * Department of Radiology, Northwestern University(放射科,西北大学) Department of Biomedical Engineering, Huazhong University of Science and Technology(生物医学工程系,华中科技大学)

AI总结 本文提出双域多路径自监督扩散模型,通过自监督训练方案、轻量混合注意力网络和多路径推理策略,提升MRI重建的准确性、效率和可解释性,克服传统模型依赖全采样数据的局限。

Comments Accepted at IEEE-TNNLS, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏