arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

共收录 702
2512.16041 2025-12-19 cs.CL cs.AI

Are We on the Right Way to Assessing LLM-as-a-Judge?

我们是否在正确地评估LLM作为裁判?

Yuanning Feng, Sinan Wang, Zhengxiang Cheng, Yao Wan, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) University of Maryland(马里兰大学)

AI总结 本文提出Sage评估套件,通过局部和全局一致性指标评估LLM作为裁判的可靠性,发现当前先进模型在复杂情况下存在显著偏好不一致问题,并揭示情境偏好现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14480 2025-12-17 cs.CV

SuperCLIP: CLIP with Simple Classification Supervision

SuperCLIP:带有简单分类监督的CLIP

Weiheng Zhao, Zilong Huang, Jiashi Feng, Xinggang Wang

机构 * School of EIC, Huazhong University of Science and Technology(华中科技大学电子与信息学院) ByteDance(字节跳动)

AI总结 SuperCLIP通过添加轻量级分类监督提升CLIP的细粒度视觉-文本对齐能力,有效提升零样本分类和检索性能。

Comments Accepted by NeurIPS 2025. Code: https://github.com/hustvl/SuperCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07873 2025-12-17 cs.LG cs.CR cs.CV

Why Does Little Robustness Help? A Further Step Towards Understanding Adversarial Transferability

为何小的鲁棒性有助于?:迈向理解对抗转移性的进一步步骤

Yechao Zhang, Shengshan Hu, Leo Yu Zhang, Junyu Shi, Minghui Li, Xiaogeng Liu, Wei Wan, Hai Jin

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(电子科学与工程学院,华中科技大学) School of Software Engineering, Huazhong University of Science and Technology(软件工程学院,华中科技大学) School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学) School of Computer Science and Technology, Huazhong University of Science and Technology(计算机科学与技术学院,华中科技大学)

AI总结 本文探讨了对抗转移性中的模型平滑性和梯度相似性权衡,提出通过优化两者提升转移性,验证了输入梯度正则化与SAM的结合效果。

Comments IEEE Symposium on Security and Privacy (Oakland) 2024; Extended version; Fix an proof error of Theorem 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13149 2025-12-16 cs.LG stat.ML

Enhancing Node-Level Graph Domain Adaptation by Alleviating Local Dependency

通过缓解局部依赖性增强节点级图域适应

Xinwei Tai, Dongmian Zou, Hongfei Wang

机构 * Huazhong University of Science and Technology(华中科技大学) School of Cyber Science and Engineering(网络科学与工程学院) Hubei Key Laboratory of Distributed System Security(湖北省分布式系统安全重点实验室) Hubei Engineering Research Center on Big Data Security(大数据安全工程研究中心) Zhongguancun Academy(中关村学院) Zu Chongzhi Center, Digital Innovation Research Center(祖冲之中心,数字创新研究中心) Duke Kunshan University(杜克大学昆山分校)

AI总结 本文提出通过缓解局部依赖性来改进图域适应,通过去相关GCN和图变换器层提升性能,并提供可视化结果。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12799 2025-12-16 cs.CV

DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning

DrivePI: 基于空间感知的4D MLLM用于统一自动驾驶理解、感知、预测与规划

Zhe Liu, Runhui Huang, Rui Yang, Siming Yan, Zining Wang, Lu Hou, Di Lin, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Yinwang Intelligent Technology Co. Ltd.(英维智能科技有限公司) Tianjin University(天津大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 DrivePI是一种基于空间感知的4D MLLM,用于统一自动驾驶的理解、感知、预测和规划,通过端到端优化实现多任务并行,提升性能并减少碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21307 2025-12-16 cs.CV

Towards Physically Executable 3D Gaussian for Embodied Navigation

迈向可物理执行的3D高斯用于具身导航

Bingchen Miao, Rong Wei, Zhiqi Ge, Xiaoquan sun, Shiqi Gao, Jingzhe Zhu, Renhan Wang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li

机构 * Zhejiang University(浙江大学) Manycore Tech Inc(Manycore科技公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 SAGE-3D通过引入语义和物理对齐的3D高斯环境,提升视觉-语言导航任务的可执行性和泛化能力。

Comments Project Page: https://sage-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09936 2025-12-12 eess.SY cs.LG cs.SY quant-ph

QSTAformer: A Quantum-Enhanced Transformer for Robust Short-Term Voltage Stability Assessment against Adversarial Attacks

QSTAformer: 一种增强型变压器用于对抗攻击下的短期电压稳定性评估

Yang Li, Chong Ma, Yuanzheng Li, Sen Li, Yanbo Chen, Zhaoyang Dong

机构 * School of Electrical Engineering, Northeast Electric Power University(东北电力大学电气工程学院) State Grid Shandong Electric Power Company Jiaozhou Power Supply Company(山东电网济南供电分公司) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系) State Key Laboratory of Alternate Electrical Power System with Renewable Energy Sources, School of Electrical & Electronic Engineering, North China Electric Power University(可再生能源电力系统国家重点实验室,华北电力大学电气与电子工程学院) Department of Electrical Engineering, City University of Hong Kong(香港城市大学电气工程系)

AI总结 QSTAformer通过整合参数化量子电路的增强型变压器架构,提升对抗攻击下的短期电压稳定性评估的鲁棒性和效率。

Comments 15 pages, 12 figures. Accepted by Applied Energy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09283 2025-12-11 cs.RO

UPETrack: Unidirectional Position Estimation for Tracking Occluded Deformable Linear Objects

UPETrack:用于跟踪遮挡变形线性物体的单向位置估计

Fan Wu, Chenguang Yang, Haibin Yang, Shuo Wang, Yanrui Xu, Xing Zhou, Meng Gao, Yaoqi Xian, Zhihong Zhu, Shifeng Huang

机构 * Huazhong University of Science and Technology(华中科技大学) Foshan Institute of Intelligent Equipment Technology(佛山智能装备技术研究所) School of Artificial Intelligence and Robotics(人工智能与机器人学院)

AI总结 UPETrack通过几何驱动的单向位置估计方法,实现了对遮挡变形线性物体的高效跟踪,提升了定位精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07514 2025-12-10 cs.CV

MeshRipple: Structured Autoregressive Generation of Artist-Meshes

MeshRipple: 结构化自回归生成艺术家网格

Junkai Lin, Hang Long, Huipeng Guo, Jielei Zhang, JiaYi Yang, Tianle Guo, Yang Yang, Jianwen Li, Wenxiao Zhang, Matthias Nießner, Wei Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Technical University of Munich(慕尼黑技术大学)

AI总结 MeshRipple通过结构化自回归生成方法,实现高保真度和拓扑完整的艺术家网格生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07666 2025-12-09 cs.CL cs.SE

Bridging Code Graphs and Large Language Models for Better Code Understanding

连接代码图与大型语言模型以实现更好的代码理解

Zeqi Chen, Zhaoyang Chu, Yi Gui, Feng Guo, Yao Wan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 CGBridge通过引入外部Bridge模块,提升LLMs对代码结构语义的理解,显著提高代码生成和翻译任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07113 2025-12-09 cs.LG q-bio.GN

PlantBiMoE: A Bidirectional Foundation Model with SparseMoE for Plant Genomes

PlantBiMoE:一种结合稀疏MoE的双向基础模型用于植物基因组

Kepeng Lin, Qizhe Zhang, Rui Wang, Xuehai Hu, Wei Xu

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(电子信息学院,华中科技大学) Hubei Hongshan Laboratory(湖北洪山实验室)

AI总结 PlantBiMoE通过结合双向Mamba和稀疏MoE框架,实现了轻量且高效的植物基因组建模,提升了对基因组序列的表示能力,为基因组学研究提供有力工具。

Comments 6 pages, 5 figures, accept to BIBM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04581 2025-12-09 cs.CV

Infrared UAV Target Tracking with Dynamic Feature Refinement and Global Contextual Attention Knowledge Distillation

基于动态特征细化和全局上下文注意力的知识蒸馏的红外无人机目标跟踪

Houzhang Fang, Chenxing Wu, Kun Bai, Tianqi Chen, Xiaolin Wang, Xiyang Liu, Yi Chang, Luxin Yan

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Xi’an Modern Control Technology Research Institute(西安现代控制技术研究所) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

AI总结 本文提出SiamDFF网络,通过动态特征细化和全局上下文注意力知识蒸馏提升红外无人机目标跟踪的准确性和实时性。

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04686 2025-12-09 cs.CV

Towards Cross-View Point Correspondence in Vision-Language Models

面向视觉-语言模型的跨视图点对应研究

Yipu Wang, Yuheng Ji, Yuyang Liu, Enshen Zhou, Ziqiang Yang, Yuxuan Tian, Ziheng Qin, Yue Liu, Huajie Tan, Cheng Chi, Zhiyuan Ma, Daniel Dajun Zeng, Xiaolong Zheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beihang University(北航大学) Jilin University(吉林大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Huazhong University of Science And Technology(华中科技大学)

AI总结 本文提出跨视图点对应任务和 CrossPoint-Bench 基准,通过 CroPond 模型在 CrossPoint-Bench 上取得超越 Gemini-2.5-Pro 的准确率,推动跨视图对应研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04982 2025-12-08 cs.RO

GEX: Democratizing Dexterity with Fully-Actuated Dexterous Hand and Exoskeleton Glove

GEX:通过全驱动灵巧手与外骨骼手套实现民主化灵巧操作

Yunlong Dong, Xing Liu, Jun Wan, Zelin Deng

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 GEX通过全驱动灵巧手与外骨骼手套结合,实现低成本高保真灵巧操作,推动具身AI和机器人技能迁移学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05060 2025-12-05 cs.CV

4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer

4DLangVGGT: 4D语言-视觉几何 grounded Transformer

Xianfeng Wu, Yajing Bai, Minghan Li, Xianzu Wu, Xueqi Zhao, Zhongyuan Lai, Wenyu Liu, Xinggang Wang

机构 * State Key Laboratory of Precision Blasting, Jianghan University(江汉大学精密爆破重点实验室) Harvard AI and Robotics Lab, Harvard University(哈佛大学AI与机器人实验室) School of EIC, Huazhong University of Science and Technology(华中科技大学电子信息学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) School of Mathematics and Statistics, Hubei University of Education(湖北省教育学院数学与统计学学院)

AI总结 4DLangVGGT是一种基于Transformer的统一框架,用于4D语言 grounding,通过整合几何感知和语言对齐,提升4D场景理解的泛化能力和部署效率。

Comments Code: https://github.com/hustvl/4DLangVGGT, Webpage: https://hustvl.github.io/4DLangVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04323 2025-12-05 cs.CV cs.AI cs.CE cs.LG

Bayes-DIC Net: Estimating Digital Image Correlation Uncertainty with Bayesian Neural Networks

贝叶斯DIC网络:基于贝叶斯神经网络的数字图像相关不确定性估计

Biao Chen, Zhenhua Lei, Yahui Zhang, Tongzhi Niu

机构 * Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院) Department of Mechanical Engineering, Northwestern University(西北大学机械工程系) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

AI总结 贝叶斯DIC网络通过生成高质量DIC数据集和引入贝叶斯神经网络,提升位移场预测的准确性和可靠性。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20923 2025-12-04 cs.CV

Revisiting Data Challenges of Computational Pathology: A Pack-based Multiple Instance Learning Training Framework

重新审视计算病理学的数据挑战:一种基于包的多实例学习训练框架

Wenhao Tang, Heng Fang, Ge Wu, Xiang Li, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Huazhong University of Science and Technology(华中科技大学) Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田))

AI总结 本文提出一种基于包的多实例学习框架,通过打包变长特征序列和引入残差分支,提升计算病理学中WSI处理的效率和准确性。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19094 2025-12-04 cs.CV cs.AI

SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring

SATORI-R1: 通过显式视觉锚定激励多模态推理

Chuming Shen, Wei Wei, Xiaoye Qu, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 SATORI-R1通过显式视觉锚定提升多模态推理,采用三个可验证阶段和VQA-Verify数据集,在VQA任务中实现15.7%的准确率提升。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00352 2025-12-02 cs.LG stat.ML

Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning

样本高效的目标导向自博弈用于离线鲁棒强化学习

Na Li, Zewu Zheng, Wei Ni, Hangguan Shan, Wenjie Zhang, Xinyu Li

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Edith Cowan University(埃迪斯·科温大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23469 2025-12-01 cs.CV

Visual Generation Tuning

视觉生成微调

Jiahao Guo, Sinan Du, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23386 2025-12-01 cs.CV

VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction

VQRAE:用于多模态理解、生成和重建的表示量化自编码器

Sinan Du, Jiahao Guo, Bo Li, Shuhao Cui, Zhengzhuo Xu, Yifu Luo, Yongxian Wei, Kun Gai, Xinggang Wang, Kai Wu, Chun Yuan

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

AI总结 VQRAE通过统一的分词器生成连续语义特征和离散标记,提升多模态理解、生成和重建的性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11164 2025-12-01 cs.CV

Reverberation: Learning the Latencies Before Forecasting Trajectories

回声:在预测轨迹之前学习延迟

Conghao Wong, Ziqian Zou, Beihao Xia, Xinge You

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 Rev模型通过回声变换学习延迟偏好,实现可控的轨迹预测,提升预测准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01528 2025-12-01 cs.CL cs.AI q-bio.BM

Leveraging Biomolecule and Natural Language through Multi-Modal Learning: A Survey

利用生物分子和自然语言通过多模态学习:一篇综述

Qizhi Pei, Zhimeng Zhou, Kaiyuan Gao, Jinhua Zhu, Yue Wang, Zun Wang, Tao Qin, Lijun Wu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 本文综述了生物分子与自然语言多模态学习的最新进展,探讨了技术表示、多模态整合方法、应用实例及未来研究方向。

Comments 2025.11.28 Updated Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22595 2025-12-01 cs.CV

AnoRefiner: Anomaly-Aware Group-Wise Refinement for Zero-Shot Industrial Anomaly Detection

AnoRefiner: 一种面向零样本工业异常检测的异常感知分组细化方法

Dayou Huang, Feng Xue, Xurui Li, Yu Zhou

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Hubei Key Laboratory of Smart Internet Technology, Huazhong University of Science and Technology(华中科技大学智能互联网技术重点实验室) Artificial Intelligence Research Institute, Wuhan JingCe Electronic Group Co., LTD(武汉景创电子集团有限公司人工智能研究所) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)

AI总结 AnoRefiner通过异常感知细化器提升零样本工业异常检测的像素级精度,采用异常分数地图和渐进式分组测试时训练策略改进模型性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07769 2025-12-01 cs.CV

Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation

Dream4D: 通过可控视频生成与神经4D重建提升I2V向时空一致4D生成

Xiaoyan Liu, Kangrui Li, Yuehao Song, Jiaxin Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学) The University of New South Wales(新南威尔士大学)

AI总结 Dream4D通过可控视频生成与神经4D重建的协同,实现高质量的时空一致4D内容生成。

Comments Project Page: https://wanderer7-sk.github.io/Dream4D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21663 2025-11-27 cs.CV cs.AI

Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models

基于注意力的视觉-语言-动作模型中逐块稀疏对抗攻击

Naifu Zhang, Wei Tao, Xi Xiao, Qianpu Sun, Yuxin Zheng, Wentao Mo, Peiqiang Wang, Nan Zhang

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Huazhong University of Science and Technology, Wuhan, China(华中科技大学) Ping An Technology, Shenzhen, China(平安科技)

AI总结 ADVLA通过注意力引导实现低振幅、稀疏的对抗攻击,有效削弱VLA模型的下游动作预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21475 2025-11-27 cs.CV

MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices

MobileI2V: 一种适用于移动设备的快速高分辨率图像到视频生成方法

Shuai Zhang, Bao Tang, Siyuan Yu, Yueting Zhu, Jingfeng Yao, Ya Zou, Shanglin Yuan, Li Yu, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 MobileI2V通过轻量级扩散模型和优化策略,在移动设备上实现快速高分辨率图像到视频生成,生成速度提升10倍,质量与现有模型相当。

Comments Our Demo and code:https://github.com/hustvl/MobileI2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19278 2025-11-27 cs.CV

ReMatch: Boosting Representation through Matching for Multimodal Retrieval

ReMatch: 通过匹配提升表示以实现多模态检索

Qianying Liu, Xiao Liang, Zhiqiang Zhang, Zhongfei Qing, Fengfan Zhou, Yibo Chen, Xu Tang, Yao Hu, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学) Xiaohongshu Inc.(小红书公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 ReMatch通过生成匹配阶段提升多模态检索的表示能力,利用端到端训练和细粒度嵌入生成,在MMEB基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20549 2025-11-26 cs.CV cs.AI

Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning

Flash-DMD: 向高保真少步图像生成迈进:高效蒸馏与联合强化学习

Guanjie Chen, Shirui Huang, Kai Liu, Jianchen Zhu, Xiaoye Qu, Peng Chen, Yu Cheng, Yifu Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Flash-DMD通过高效蒸馏和联合强化学习实现快速收敛,提升少步图像生成的保真度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏