arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

2026-04-10 至 2026-04-10 共收录 4
2604.08546 2026-04-10 cs.CV

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08545 2026-04-10 cs.CV cs.AI

Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models

明智行动:在代理多模态模型中培养元认知工具使用

Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Accio Team, Alibaba Group(阿里巴巴集团 Accio 团队) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出HDPO框架,通过解耦优化通道提升代理多模态模型的元认知工具使用能力,减少工具调用并提升推理准确性。

Comments Project Page: https://Accio-Lab.github.io/Metis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07759 2026-04-10 cs.CV

WUTDet: A 100K-Scale Ship Detection Dataset and Benchmarks with Dense Small Objects

WUTDet: 一艘船检测数据集和基准测试,包含10万尺度的密集小物体

Junxiong Liang, Mengwei Bao, Tianxiang Wang, Xinggang Wang, An-An Liu, Ryan Wen Liu

机构 * School of Navigation, Wuhan University of Technology(武汉理工大学航运学院) Sanya Science and Education Innovation Park, Wuhan University of Technology(武汉理工大学三亚科教创新园) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

AI总结 本文提出WUTDet数据集,包含10万张图像和38万艘船实例,涵盖港口、锚地等多种场景,评估了20种基线模型,发现Transformer在复杂海上场景中表现更优,CNN在推理效率上更胜一筹,Mamba在准确性和效率之间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07809 2026-04-10 cs.CR cs.AI

Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents

对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击

Renhua Ding, Xiao Yang, Zhengwei Fang, Jun Luo, Kun He, Jun Zhu

机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)

AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏