arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

共收录 702
2604.10056 2026-04-14 cs.CV

U$^{2}$Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation

U²Flow:基于不确定性的无监督光流估计

Xunpei Sun, Wenwei Lin, Yi Chang, Gang Chen

机构 * Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 U²Flow是首个联合估计光流和像素不确定性的无监督框架,通过解耦学习策略从增强一致性中获取不确定性监督,提升训练稳定性。引入不确定性引导的双向流融合机制,实验表明其在KITTI和Sintel上达到无监督方法最优,生成可靠不确定性图。

Comments Accepted as an oral presentation at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10031 2026-04-14 cs.CL cs.AI

CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models

CoSToM: 为大语言模型内在理论思维对齐的因果导向引导

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * National Engineering Research Center for Big Data Technology and System, Services Computing Technology and System Lab, Cluster and Grid Computing Lab, Huazhong University of Science and Technology(华中科技大学国家大数据技术与系统工程技术研究中心、服务计算技术与系统实验室、集群与网格计算实验室) Singapore Management University(新加坡管理大学)

AI总结 本文提出CoSToM框架,通过因果追踪和激活引导提升大语言模型的社会推理能力与对话质量。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11390 2026-04-14 cs.HC cs.LG eess.SP

PAT: Privacy-Preserving Adversarial Transfer for Accurate, Robust and Privacy-Preserving EEG Decoding

PAT: 用于准确、鲁棒且隐私保护的对抗性迁移

Xiaoqing Chen, Tianwang Jia, Yunlu Tu, Dongrui Wu

机构 * Hubei Key Laboratory of Brain-inspired Intelligent Systems, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院脑启发智能系统湖北省重点实验室) Shenzhen Huazhong University of Science and Technology Research Institute(深圳华中科技大学研究院) Zhongguancun Academy(中关村学院)

AI总结 本文提出PAT框架,结合数据对齐、对抗训练和隐私保护迁移,提升EEG解码的准确性、鲁棒性和隐私保护,实验表明其在多个数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09378 2026-04-13 cs.CR cs.AI

BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning

BadSkill: 通过模型-技能污染对代理技能进行后门攻击

Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(里海大学)

AI总结 研究针对代理技能中嵌入的模型提出后门攻击,通过污染技能中的模型实现隐蔽攻击,验证了在不同模型规模和扰动类型下的有效性,并指出模型承载技能作为代理生态系统中的新型供应链风险。

Comments 4 pages, 4 fIGURES

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09253 2026-04-13 cs.CV cs.AI

Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization

Mosaic: 通过多视图集成优化实现对闭源视觉语言模型的多模态劫持

Yuqin Lan, Gen Li, Yuanze Hu, Weihao Shen, Zhaoxin Fan, Faguo Wu, Xiao Zhang, Laurence T. Yang, Zhiming Zheng

机构 * Beihang University(北京航空航天大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出Mosaic框架,通过多视图集成优化减少对单一代理模型的依赖,提升对闭源VLMs的多模态劫持效果,实验显示其在安全基准上的攻击成功率和毒性均达到最优。

Comments 14pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03107 2026-04-13 cs.CL

The Mask of Civility: Benchmarking Chinese Mock Politeness Comprehension in Large Language Models

礼貌的面具:在大型语言模型中基准测试中文虚伪礼貌理解

Yitong Zhang, Yuhan Xiang, Mingxuan Liu

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文从语用学角度评估大型语言模型在识别中文礼貌、不礼貌和虚伪礼貌现象中的表现差异,构建了结合真实和模拟中文话语的三类数据集,并通过六种代表性模型在四种提示条件下进行测试。

Comments Preprint

Journal ref International Conference in Applied Language Sciences (ALS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00491 2026-04-13 cs.RO cs.AI

Traj2Action: A Co-Denoising Framework for Trajectory-Guided Human-to-Robot Skill Transfer

Traj2Action: 一种用于轨迹引导的人机技能转移协同去噪框架

Han Zhou, Jinjin Cao, Liyuan Ma, Xueji Fang, Guo-jun Qi

机构 * MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖大学先进技术研究所)

AI总结 本文提出Traj2Action框架,通过3D操作端点轨迹作为统一中间表示,解决人机技能转移中的形态差距问题,提升机器人动作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08546 2026-04-10 cs.CV

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08545 2026-04-10 cs.CV cs.AI

Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models

明智行动:在代理多模态模型中培养元认知工具使用

Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Accio Team, Alibaba Group(阿里巴巴集团 Accio 团队) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出HDPO框架,通过解耦优化通道提升代理多模态模型的元认知工具使用能力,减少工具调用并提升推理准确性。

Comments Project Page: https://Accio-Lab.github.io/Metis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07759 2026-04-10 cs.CV

WUTDet: A 100K-Scale Ship Detection Dataset and Benchmarks with Dense Small Objects

WUTDet: 一艘船检测数据集和基准测试,包含10万尺度的密集小物体

Junxiong Liang, Mengwei Bao, Tianxiang Wang, Xinggang Wang, An-An Liu, Ryan Wen Liu

机构 * School of Navigation, Wuhan University of Technology(武汉理工大学航运学院) Sanya Science and Education Innovation Park, Wuhan University of Technology(武汉理工大学三亚科教创新园) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

AI总结 本文提出WUTDet数据集,包含10万张图像和38万艘船实例,涵盖港口、锚地等多种场景,评估了20种基线模型,发现Transformer在复杂海上场景中表现更优,CNN在推理效率上更胜一筹,Mamba在准确性和效率之间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07809 2026-04-10 cs.CR cs.AI

Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents

对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击

Renhua Ding, Xiao Yang, Zhengwei Fang, Jun Luo, Kun He, Jun Zhu

机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)

AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05583 2026-04-08 cs.CV

WRF4CIR: Weight-Regularized Fine-Tuning Network for Composed Image Retrieval

WRF4CIR:用于复合图像检索的加权正则化微调网络

Yizhuo Xu, Chaojian Yu, Yuanjie Shao, Tongliang Liu, Qinmu Peng, Xinge You

机构 * Huazhong University of Science and Technology(华中科技大学) University of Sydney(悉尼大学)

AI总结 本文提出WRF4CIR网络,通过对抗扰动正则化缓解有限三元组数据下的过拟合问题,提升复合图像检索的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05387 2026-04-08 cs.IR cs.CL

Data-Driven Function Calling Improvements in Large Language Model for Online Financial QA

大型语言模型在在线金融问答中的数据驱动函数调用改进

Xing Tang, Hao Chen, Shiwei Li, Fuyuan Lyu, Weijie Shi, Lingjie Li, Dugang Liu, Weihong Luo, Xiku Du, Xiuqiang He

机构 * Shenzhen Technology University(深圳技术大学) FiT, Tencent(腾讯FiT) Huazhong University of Science and Technology(华中科技大学) McGill University(麦吉尔大学) The Hong Kong University of Science and Technology(香港科技大学) Shenzhen University(深圳大学)

AI总结 本文提出数据驱动管道提升LLM在金融场景中的函数调用能力,通过构建数据集、数据增强和模型训练,解决通用LLM在金融领域适应性差的问题。

Comments Accepted to Webconf 2026 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03741 2026-04-08 cs.CV

I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing

I2E: 从图像像素到可操作的交互环境:用于文本引导的图像编辑

Jinghan Yu, Junhao Xiao, Chenyu Zhu, Jiaming Li, Jia Li, HanMing Deng, Xirui Wang, Guoli Jia, Jianjun Li, Xiang Bai, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Central China Normal University(华中师范大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 I2E提出一种'分解-然后-行动'范式,通过分解器将无结构图像转换为可操作的对象层,并利用物理感知的视觉-语言-行动代理进行复杂指令解析,同时构建I2E-Bench基准测试集,实验表明其在处理复杂组合指令和保持物理合理性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15115 2026-04-08 cs.LG

Towards Reliable Forgetting: A Survey on Machine Unlearning Verification

迈向可靠的遗忘:机器遗忘验证的综述

Lulu Xue, Shengshan Hu, Wei Lu, Yan Shen, Dongxu Li, Peijin Guo, Ziqi Zhou, Minghui Li, Yanjun Zhang, Leo Yu Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) University of Technology Sydney(悉尼科技大学) Griffith University(格里菲斯大学)

AI总结 本文综述了机器遗忘验证方法,提出行为验证与参数验证两类分类,分析现有方法的假设、优缺点及实际部署中的漏洞,指出当前验证研究的开放问题。

Comments Accepted by ACM Computing Surveys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04933 2026-04-07 cs.CV

PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding

PointTPA:用于3D场景理解的动态网络参数适应

Siyuan Liu, Chaoqun Zheng, Xin Zhou, Tianrui Feng, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 PointTPA通过动态网络参数适应提升3D场景理解,采用SNG和DPP方法生成输入感知参数,实现参数高效且在ScanNet上取得78.4% mIoU。

Comments Accepted by CVPR 2026. The code is available at https://github.com/H-EmbodVis/PointTPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04875 2026-04-07 cs.CV cs.AI cs.MM

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04658 2026-04-07 cs.CV

Synthesis4AD: Synthetic Anomalies are All You Need for 3D Anomaly Detection

Synthesis4AD:合成异常就是3D异常检测所需

Yihan Sun, Yuqi Cheng, Junjie Zu, Yuxiang Tan, Guoyang Xie, Yucheng Wang, Yunkang Cao, Weiming Shen

机构 * National Center of Technology Innovation for Intelligent Design and Numerical Control, Huazhong University of Science and Technology(华中科技大学国家智能设计与数控技术创新中心) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Department of Intelligent Manufacturing, Contemporary Amperex Technology Ltd.(宁德时代新能源科技股份有限公司智能制造部) Institute for Infocomm Research, A*STAR(新加坡科技研究局资讯通信研究院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 本文提出Synthesis4AD方法,通过大规模高保真合成异常数据提升3D异常检测性能,利用3D-DefectStudio平台生成精确点云异常掩码,并结合多模态大语言模型实现知识驱动的数据生成,实验表明在多个数据集上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09299 2026-04-07 cs.CV cs.SD

VABench: A Comprehensive Benchmark for Audio-Video Generation

VABench:音频视频生成的综合性基准

Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence (Peking University)(北京市数据智能重点实验室(北京大学)) Ant Group(蚂蚁集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出VABench,一个用于评估同步音频视频生成能力的综合性基准,涵盖三种任务类型和15个评估维度,旨在建立新的评估标准以推动视频生成领域的发展。

Comments 24 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03572 2026-04-07 cs.CV physics.optics

Physics-Informed Untrained Learning for RGB-Guided Superresolution Single-Pixel Hyperspectral Imaging

基于物理的无训练学习用于RGB引导的超分辨率单像素超光谱成像

Hao Zhang, Bilige Xu, Lichen Wei, Xu Ma, Wenyi Ren

机构 * College of Science, Northwest Agriculture & Forestry University(西北农林科技大学理学院) Key Laboratory of Photoelectronic Imaging Technology and System, School of Optics and Photonics, Beijing Institute of Technology(北京理工大学光电学院光电成像技术与系统教育部重点实验室) State Key Laboratory of Digital Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学数字制造装备与技术国家重点实验室)

AI总结 本文提出一种基于物理的无训练框架,利用未训练的神经网络和RGB引导,实现超分辨率和超光谱重建,无需外部训练数据,实验表明其在重建精度和光谱保真度上优于现有方法。

Comments 9 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02190 2026-04-03 cs.CV cs.RO

UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

UniDriveVLA: 联合理解、感知与行动规划以实现自动驾驶

Yongkang Li, Lijun Zhou, Sixu Yan, Bencheng Liao, Tianyi Yan, Kaixin Xiong, Long Chen, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) SKL-IOTSC, University of Macau(澳门大学智慧城市物联网国家重点实验室)

AI总结 UniDriveVLA通过专家解耦和三阶段训练策略,解决自动驾驶中感知与推理的冲突,实现空间感知与语义推理的统一,取得nuScenes和Bench2Drive的优异性能。

Comments code has been released at https://github.com/xiaomi-research/unidrivevla

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02019 2026-04-03 cs.LG

Feature Weighting Improves Pool-Based Sequential Active Learning for Regression

特征加权提升回归问题的基于池的顺序主动学习

Dongrui Wu

机构 * Ministry of Education Key Laboratory of Image Processing and Intelligent Control(教育部图像处理与智能控制重点实验室) Hubei Key Laboratory of Brain-inspired Intelligent Systems(湖北省脑启发智能系统重点实验室) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

AI总结 本文提出基于池的顺序主动学习方法,通过特征加权优化样本选择,提升回归模型的准确性,实验表明该方法在单任务和多任务回归中均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01756 2026-04-03 cs.RO

Realistic Lip Motion Generation Based on 3D Dynamic Viseme and Coarticulation Modeling for Human-Robot Interaction

基于3D动态viseme和协articulation建模的人机交互中逼真唇部运动生成

Sheng Li, Jingcheng Huang, Min Li

机构 * The State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室)

AI总结 本文提出基于3D动态viseme和协articulation建模的唇部运动生成框架,通过构建基于ARKit标准的3D动态viseme库并结合初始-最终解耦和能量调制机制,解决连续语音流中的运动冲突,实验验证了该架构的效率和准确性。

Comments 8 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11683 2026-04-03 cs.RO cs.AI

Robot Collapse: Supply Chain Backdoor Attacks Against VLM-based Robotic Manipulation

机器人崩溃:针对基于VLM的机器人操控的供应链后门攻击

Xianlong Wang, Hewen Pan, Hangtao Zhang, Minghui Li, Shengshan Hu, Ziqi Zhou, Lulu Xue, Peijin Guo, Aishan Liu, Leo Yu Zhang, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学) Griffith University(格里菲斯大学)

AI总结 本文提出TrojanRobot框架,通过在模块化机器人策略中嵌入恶意模块,操控LLM到VLM路径,验证了在18个真实任务和4个VLM上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18739 2026-04-02 cs.CV

Moving Light Adaptive Colonoscopy Reconstruction via Illumination-Attenuation-Aware 3D Gaussian Splatting

通过光照衰减感知的3D高斯点云进行动态光源适应性结肠镜重建

Hao Wang, Ying Zhou, Haoyu Zhao, Rui Wang, Qiang Hu, Xing Zhang, Qiang Li, Zhiwei Wang

机构 * Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(武汉光电国家研究中心,华中科技大学) School of Computer Science, Wuhan University(武汉大学计算机学院) Wuhan United Imaging Healthcare Surgical Technology Co., Ltd(武汉联影医疗手术技术有限公司)

AI总结 本文提出ColIAGS框架,通过引入光照衰减模型和改进的几何与外观建模,提升结肠镜中动态光源下的视图合成与几何重建精度。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29902 2026-04-01 cs.AI

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08829 2026-04-01 cs.CV cs.AI

InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models

InfiniteVL: 融合线性与稀疏注意力以实现高效率、无限输入的视觉-语言模型

Hongyuan Tao, Bencheng Liao, Shaoyu Chen, Haoran Yin, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Horizon Robotics(地平线机器人)

AI总结 InfiniteVL通过融合线性与稀疏注意力机制,实现高效率和无限输入的视觉-语言模型,提升解码速度和长上下文处理能力。

Comments 20 pages, 8 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28455 2026-03-31 cs.LG cs.AI cs.CV cs.DC stat.ML

FeDMRA: Federated Incremental Learning with Dynamic Memory Replay Allocation

FeDMRA: 联邦增量学习中的动态记忆回放分配

Tiantian Wang, Xiang Xiang, Simon S. Du

机构 * Huazhong University of Science and Technology(华中科技大学) University of Washington(华盛顿大学)

AI总结 本文提出动态内存分配策略,以应对联邦医疗系统中非独立同分布数据带来的挑战,通过合理分配存储资源提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏