Are We on the Right Way to Assessing LLM-as-a-Judge?
我们是否在正确地评估LLM作为裁判?
机构 * Huazhong University of Science and Technology(华中科技大学) ; University of Maryland(马里兰大学)
AI总结 本文提出Sage评估套件,通过局部和全局一致性指标评估LLM作为裁判的可靠性,发现当前先进模型在复杂情况下存在显著偏好不一致问题,并揭示情境偏好现象。
高校专区
我们是否在正确地评估LLM作为裁判?
机构 * Huazhong University of Science and Technology(华中科技大学) ; University of Maryland(马里兰大学)
AI总结 本文提出Sage评估套件,通过局部和全局一致性指标评估LLM作为裁判的可靠性,发现当前先进模型在复杂情况下存在显著偏好不一致问题,并揭示情境偏好现象。
SuperCLIP:带有简单分类监督的CLIP
机构 * School of EIC, Huazhong University of Science and Technology(华中科技大学电子与信息学院) ; ByteDance(字节跳动)
AI总结 SuperCLIP通过添加轻量级分类监督提升CLIP的细粒度视觉-文本对齐能力,有效提升零样本分类和检索性能。
Comments Accepted by NeurIPS 2025. Code: https://github.com/hustvl/SuperCLIP
为何小的鲁棒性有助于?:迈向理解对抗转移性的进一步步骤
机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(电子科学与工程学院,华中科技大学) ; School of Software Engineering, Huazhong University of Science and Technology(软件工程学院,华中科技大学) ; School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学) ; School of Computer Science and Technology, Huazhong University of Science and Technology(计算机科学与技术学院,华中科技大学)
AI总结 本文探讨了对抗转移性中的模型平滑性和梯度相似性权衡,提出通过优化两者提升转移性,验证了输入梯度正则化与SAM的结合效果。
Comments IEEE Symposium on Security and Privacy (Oakland) 2024; Extended version; Fix an proof error of Theorem 1
通过缓解局部依赖性增强节点级图域适应
机构 * Huazhong University of Science and Technology(华中科技大学) ; School of Cyber Science and Engineering(网络科学与工程学院) ; Hubei Key Laboratory of Distributed System Security(湖北省分布式系统安全重点实验室) ; Hubei Engineering Research Center on Big Data Security(大数据安全工程研究中心) ; Zhongguancun Academy(中关村学院) ; Zu Chongzhi Center, Digital Innovation Research Center(祖冲之中心,数字创新研究中心) ; Duke Kunshan University(杜克大学昆山分校)
AI总结 本文提出通过缓解局部依赖性来改进图域适应,通过去相关GCN和图变换器层提升性能,并提供可视化结果。
Comments Accepted to KDD 2026
DrivePI: 基于空间感知的4D MLLM用于统一自动驾驶理解、感知、预测与规划
机构 * The University of Hong Kong(香港大学) ; Yinwang Intelligent Technology Co. Ltd.(英维智能科技有限公司) ; Tianjin University(天津大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 DrivePI是一种基于空间感知的4D MLLM,用于统一自动驾驶的理解、感知、预测和规划,通过端到端优化实现多任务并行,提升性能并减少碰撞率。
GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成
机构 * The University of Hong Kong(香港大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。
Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/
迈向可物理执行的3D高斯用于具身导航
机构 * Zhejiang University(浙江大学) ; Manycore Tech Inc(Manycore科技公司) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 SAGE-3D通过引入语义和物理对齐的3D高斯环境,提升视觉-语言导航任务的可执行性和泛化能力。
Comments Project Page: https://sage-3d.github.io/
QSTAformer: 一种增强型变压器用于对抗攻击下的短期电压稳定性评估
机构 * School of Electrical Engineering, Northeast Electric Power University(东北电力大学电气工程学院) ; State Grid Shandong Electric Power Company Jiaozhou Power Supply Company(山东电网济南供电分公司) ; School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系) ; State Key Laboratory of Alternate Electrical Power System with Renewable Energy Sources, School of Electrical & Electronic Engineering, North China Electric Power University(可再生能源电力系统国家重点实验室,华北电力大学电气与电子工程学院) ; Department of Electrical Engineering, City University of Hong Kong(香港城市大学电气工程系)
AI总结 QSTAformer通过整合参数化量子电路的增强型变压器架构,提升对抗攻击下的短期电压稳定性评估的鲁棒性和效率。
Comments 15 pages, 12 figures. Accepted by Applied Energy
UPETrack:用于跟踪遮挡变形线性物体的单向位置估计
机构 * Huazhong University of Science and Technology(华中科技大学) ; Foshan Institute of Intelligent Equipment Technology(佛山智能装备技术研究所) ; School of Artificial Intelligence and Robotics(人工智能与机器人学院)
AI总结 UPETrack通过几何驱动的单向位置估计方法,实现了对遮挡变形线性物体的高效跟踪,提升了定位精度和计算效率。
MeshRipple: 结构化自回归生成艺术家网格
机构 * Huazhong University of Science and Technology(华中科技大学) ; Technical University of Munich(慕尼黑技术大学)
AI总结 MeshRipple通过结构化自回归生成方法,实现高保真度和拓扑完整的艺术家网格生成。
连接代码图与大型语言模型以实现更好的代码理解
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 CGBridge通过引入外部Bridge模块,提升LLMs对代码结构语义的理解,显著提高代码生成和翻译任务的性能。
PlantBiMoE:一种结合稀疏MoE的双向基础模型用于植物基因组
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(电子信息学院,华中科技大学) ; Hubei Hongshan Laboratory(湖北洪山实验室)
AI总结 PlantBiMoE通过结合双向Mamba和稀疏MoE框架,实现了轻量且高效的植物基因组建模,提升了对基因组序列的表示能力,为基因组学研究提供有力工具。
Comments 6 pages, 5 figures, accept to BIBM
基于动态特征细化和全局上下文注意力的知识蒸馏的红外无人机目标跟踪
机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; Xi’an Modern Control Technology Research Institute(西安现代控制技术研究所) ; School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
AI总结 本文提出SiamDFF网络,通过动态特征细化和全局上下文注意力知识蒸馏提升红外无人机目标跟踪的准确性和实时性。
Comments Accepted by IEEE TMM
面向视觉-语言模型的跨视图点对应研究
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Beihang University(北航大学) ; Jilin University(吉林大学) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Huazhong University of Science And Technology(华中科技大学)
AI总结 本文提出跨视图点对应任务和 CrossPoint-Bench 基准,通过 CroPond 模型在 CrossPoint-Bench 上取得超越 Gemini-2.5-Pro 的准确率,推动跨视图对应研究发展。
GEX:通过全驱动灵巧手与外骨骼手套实现民主化灵巧操作
机构 * Huazhong University of Science and Technology(华中科技大学)
AI总结 GEX通过全驱动灵巧手与外骨骼手套结合,实现低成本高保真灵巧操作,推动具身AI和机器人技能迁移学习。
4DLangVGGT: 4D语言-视觉几何 grounded Transformer
机构 * State Key Laboratory of Precision Blasting, Jianghan University(江汉大学精密爆破重点实验室) ; Harvard AI and Robotics Lab, Harvard University(哈佛大学AI与机器人实验室) ; School of EIC, Huazhong University of Science and Technology(华中科技大学电子信息学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; School of Mathematics and Statistics, Hubei University of Education(湖北省教育学院数学与统计学学院)
AI总结 4DLangVGGT是一种基于Transformer的统一框架,用于4D语言 grounding,通过整合几何感知和语言对齐,提升4D场景理解的泛化能力和部署效率。
Comments Code: https://github.com/hustvl/4DLangVGGT, Webpage: https://hustvl.github.io/4DLangVGGT
贝叶斯DIC网络:基于贝叶斯神经网络的数字图像相关不确定性估计
机构 * Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系) ; School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院) ; Department of Mechanical Engineering, Northwestern University(西北大学机械工程系) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
AI总结 贝叶斯DIC网络通过生成高质量DIC数据集和引入贝叶斯神经网络,提升位移场预测的准确性和可靠性。
Comments 17 pages, 8 figures
重新审视计算病理学的数据挑战:一种基于包的多实例学习训练框架
机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ; Huazhong University of Science and Technology(华中科技大学) ; Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田))
AI总结 本文提出一种基于包的多实例学习框架,通过打包变长特征序列和引入残差分支,提升计算病理学中WSI处理的效率和准确性。
Comments 24 pages, 6 figures
SATORI-R1: 通过显式视觉锚定激励多模态推理
机构 * Huazhong University of Science and Technology(华中科技大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 SATORI-R1通过显式视觉锚定提升多模态推理,采用三个可验证阶段和VQA-Verify数据集,在VQA任务中实现15.7%的准确率提升。
Comments 21 pages, 8 figures
样本高效的目标导向自博弈用于离线鲁棒强化学习
机构 * Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Edith Cowan University(埃迪斯·科温大学) ; University of New South Wales(新南威尔士大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。
Comments NeurIPS 2025
视觉生成微调
机构 * Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学) ; School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) ; Kolors Team, Kuaishou Technology(快手科技Kolors团队)
AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。
VQRAE:用于多模态理解、生成和重建的表示量化自编码器
机构 * Tsinghua University(清华大学) ; Huazhong University of Science and Technology(华中科技大学) ; Kolors Team, Kuaishou Technology(快手科技Kolors团队)
AI总结 VQRAE通过统一的分词器生成连续语义特征和离散标记,提升多模态理解、生成和重建的性能。
Comments 19 pages, 10 figures
回声:在预测轨迹之前学习延迟
机构 * Huazhong University of Science and Technology(华中科技大学)
AI总结 Rev模型通过回声变换学习延迟偏好,实现可控的轨迹预测,提升预测准确性和可解释性。
利用生物分子和自然语言通过多模态学习:一篇综述
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
AI总结 本文综述了生物分子与自然语言多模态学习的最新进展,探讨了技术表示、多模态整合方法、应用实例及未来研究方向。
Comments 2025.11.28 Updated Version
AnoRefiner: 一种面向零样本工业异常检测的异常感知分组细化方法
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) ; Hubei Key Laboratory of Smart Internet Technology, Huazhong University of Science and Technology(华中科技大学智能互联网技术重点实验室) ; Artificial Intelligence Research Institute, Wuhan JingCe Electronic Group Co., LTD(武汉景创电子集团有限公司人工智能研究所) ; Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)
AI总结 AnoRefiner通过异常感知细化器提升零样本工业异常检测的像素级精度,采用异常分数地图和渐进式分组测试时训练策略改进模型性能。
Comments 17 pages, 10 figures
Dream4D: 通过可控视频生成与神经4D重建提升I2V向时空一致4D生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Huazhong University of Science and Technology(华中科技大学) ; The University of New South Wales(新南威尔士大学)
AI总结 Dream4D通过可控视频生成与神经4D重建的协同,实现高质量的时空一致4D内容生成。
Comments Project Page: https://wanderer7-sk.github.io/Dream4D.github.io/
基于注意力的视觉-语言-动作模型中逐块稀疏对抗攻击
机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) ; Huazhong University of Science and Technology, Wuhan, China(华中科技大学) ; Ping An Technology, Shenzhen, China(平安科技)
AI总结 ADVLA通过注意力引导实现低振幅、稀疏的对抗攻击,有效削弱VLA模型的下游动作预测。
MobileI2V: 一种适用于移动设备的快速高分辨率图像到视频生成方法
机构 * Huazhong University of Science and Technology(华中科技大学)
AI总结 MobileI2V通过轻量级扩散模型和优化策略,在移动设备上实现快速高分辨率图像到视频生成,生成速度提升10倍,质量与现有模型相当。
Comments Our Demo and code:https://github.com/hustvl/MobileI2V
ReMatch: 通过匹配提升表示以实现多模态检索
机构 * University of Glasgow(格拉斯哥大学) ; Xiaohongshu Inc.(小红书公司) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 ReMatch通过生成匹配阶段提升多模态检索的表示能力,利用端到端训练和细粒度嵌入生成,在MMEB基准上取得新突破。
Flash-DMD: 向高保真少步图像生成迈进:高效蒸馏与联合强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯) ; Huazhong University of Science and Technology(华中科技大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 Flash-DMD通过高效蒸馏和联合强化学习实现快速收敛,提升少步图像生成的保真度和稳定性。