arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

2026-07-14 至 2026-07-14 共收录 7
2607.11562 2026-07-14 cs.CV 新提交

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公软件)

AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11347 2026-07-14 cs.AI 新提交

From Neural Network Decisions to Training Cases: An Exact Account via Case-Based Decision Theory

从神经网络决策到训练案例:基于案例决策理论的精确阐述

Manli Yan, Yuebin Lin, Yaowen Yu, Yong Zhao

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 研究神经网络决策,基于案例决策理论,通过OLS行动读出的精确案例分解,能追溯分数到训练案例、衡量行动一致性等,在多任务中恢复案例级偏好结构,实现高一致性且审计简单,探测器保真度由分数重建衡量。

Comments Preprint. 15 pages, 9 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11233 2026-07-14 cs.CV 新提交

Structure-Detail Decoupled Autoregressive Generation for Fast and High-Fidelity Virtual Try-On

用于快速和高保真虚拟试穿的结构-细节解耦自回归生成

Lu Yang, Xiaonan Hu, Yanan Li, Daqi Liu, Xiang Bai, Hao Lu

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan Institute of Technology(武汉工程大学) Xiaomi EV(小米汽车)

AI总结 研究虚拟试穿问题,提出STAR-VTON框架,通过解耦潜在空间结构合成与像素空间细节恢复,结合匹配信息细化器,实现高效高保真虚拟试穿,其中VAR-VTON效率高,像素空间细化器能有效恢复细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11166 2026-07-14 cs.CL 新提交

Query-Focused Event Summarization: A Dataset and Benchmark

查询聚焦事件摘要:一个数据集和基准

Chenyu Hu, Bang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

AI总结 针对现有查询聚焦摘要(QFS)数据集缺乏面向事件的摘要及方法在大规模语料库表现不佳的问题,提出查询聚焦事件摘要(QFES)任务,构建QFESum数据集,引入含RAT和SHC的两阶段框架,实验证明该框架有效。

Comments 22 pages, 9 figures, and 13 tables. Dataset and code are available at https://github.com/sarcasm-hcy02/QFES-QFESum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10625 2026-07-14 cs.RO 新提交

Dual-Process Atomic Skill Learning: Decoupling Semantic Reasoning and Real-Time Control

双过程原子技能学习:解耦语义推理与实时控制

Jun Chen, Erdent Bao, Wenlong Dong, Jierui Liu, Qi Cai, Hao Wan, Shaopeng Li, Weijun Qin, Jing Liang, Huiping Zhuang

机构 * University of Electronic Science and Technology of China(电子科技大学) Huazhong University of Science and Technology(华中科技大学) Southern University of Science and Technology(南方科技大学) South China University of Technology(华南理工大学) EbTech Co. Ltd.(依比特科技有限公司)

AI总结 研究针对语言条件模仿学习推广到多步组合任务的挑战,提出双过程原子技能学习框架DASL,通过解耦语义推理与实时控制,含低频和高频策略,有效减轻技能码本干扰问题,性能显著优于现有基线。

Comments 28 pages,20 figures,21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10395 2026-07-14 cs.CV 新提交

Self-supervised Automatic Matting

自监督自动抠图

Xiaonan Hu, Zhiyuan Lu, Jingdong Zhao, Hao Lu

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Normal University(北京师范大学) Waseda University(早稻田大学)

AI总结 研究能否仅用RGB图像训练自动抠图模型。提出自监督框架SSMatte,将问题分解为语义锚定和细节抠图,通过特定损失生成提示并优化网络。该方法性能优,推动自动抠图进入完全无标注范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10329 2026-07-14 cs.CV 新提交

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏