arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 1439
2508.02129 2026-05-11 cs.CV

VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling

VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模

Yuru Xiao, Zihan Lin, Chao Lu, Deming Zhai, Kui Jiang, Wenbo Zhao, Wei Zhang, Junjun Jiang, Huanran Wang, Xianming Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07381 2026-05-11 cs.RO cs.AI

Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation

通过锚点中心适应摆脱机器人操作中的多样性陷阱

Yanzhe Chen, Kevin Yuchen Ma, Qi Lv, Yiqi Lin, Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Institude for Information Research, A STAR(A*STAR信息研究所)

AI总结 本文提出锚点中心适应方法,通过稳定策略骨架和选择性扩展覆盖范围,解决多样性陷阱问题,提升任务可靠性和成功率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07334 2026-05-11 cs.CV

RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation

RCoT-Seg:强化链式推理用于视频推理与分割

Junwei Wen, Deshui Miao, Guangming Lu, Xin Li, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07316 2026-05-11 cs.AI

Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)

Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07178 2026-05-11 cs.CV

Masks Can Talk: Extracting Structured Text Information from Single-Modal Images for Remote Sensing Change Detection

掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测

Kai Zheng, Hang-Cheng Dong, Jiatong Pan, Zhenkai Wu, Fupeng Wei, Wei Zhang

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) North China University of Water Resources and Electric Power(华北水利水电大学) University of Auckland(奥克兰大学)

AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07164 2026-05-11 cs.CL

Rethinking Experience Utilization in Self-Evolving Language Model Agents

重新思考自演化语言模型代理中的经验利用

Weixiang Zhao, Yingshuo Wang, Yichen Zhang, Yanyan Zhao, Yu Zhang, Yang Wu, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。

Comments 30 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07146 2026-05-11 cs.CV

UniV2D: Bridging Visual Restoration and Semantic Perception for Underwater Salient Object Detection

UniV2D:连接视觉修复与语义感知以实现水下显著目标检测

Laibin Chang, Shaodong Wang, Yunke Wang, Xu Zhang, Kui Jiang, Chang Xu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, The University of Sydney(悉尼大学计算机学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

AI总结 本文提出UniV2D,通过联合优化视觉修复与显著目标检测,解决水下视觉退化问题,提升语义一致性与检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06623 2026-05-11 cs.AI cs.CL cs.LG cs.MA

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO:基于大语言模型的多智能体系统的联合提示优化

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)

AI总结 本文提出MASPO框架,通过联合评估机制和数据驱动的进化束搜索,优化多智能体系统中的提示,提升整体性能,实验显示在6个任务中平均准确率提升2.9。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01586 2026-05-11 cs.CV

InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning

InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理

Yecong Wan, Fan Li, Chunwei Wang, Hao Wu, Mingwen Shao, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18700 2026-05-11 cs.AI

TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent

TEA-Bench: 一种工具增强情感支持对话代理的系统性基准测试

Xingyu Sui, Yanyan Zhao, Yulin Hu, Jiahe Guo, Weixiang Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出TEA-Bench,首个评估工具增强情感支持对话代理的交互式基准,通过真实情感场景和工具环境评估情感支持质量和事实性。实验表明工具增强提升情感支持质量并减少幻觉,但效果依赖模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06196 2026-05-08 cs.AI cs.CL

The Granularity Axis: A Micro-to-Macro Latent Direction for Social Roles in Language Models

粒度轴:语言模型中社会角色的微到宏观潜在方向

Chonghan Qin, Xiachong Feng, Ziyun Song, Xiaocheng Feng, Jing Xiong, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 研究揭示语言模型中社会角色粒度的潜在方向,通过定义粒度轴,发现其主导了角色表示空间的几何结构,并通过实验验证其在不同层级和模型间的稳定性与因果相关性。

Comments 28 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06185 2026-05-08 cs.AI cs.CV

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06111 2026-05-08 cs.SE cs.AI

Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

调度与校准:面向代码LLM的实用导向多任务强化学习

Yujia Chen, Yang Ye, Xiao Chu, Yuchi Ma, Cuiyun Gao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)

AI总结 本文提出ASTOR框架,通过任务实用性驱动的协调机制,提升多任务强化学习在代码LLM中的效果,实验显示其在多个编码任务中优于专用专家和基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06083 2026-05-08 cs.CV cs.IR cs.LG cs.MM

Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

重新审视不确定性:关于部分相关视频检索的证据学习

Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

AI总结 本文提出Holmes框架,通过多粒度跨模态证据聚合量化和建模不确定性,解决视频检索中因查询简短与视频内容丰富带来的语义模糊问题。

Comments Accepted by ICML 2026. 16 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05977 2026-05-08 cs.AI

BehaviorGuard: Online Backdoor Defense for Deep Reinforcement Learning

BehaviorGuard: 面向深度强化学习的在线后门防御

Yinbo Yu, Xueyu Yin, Jiadai Wang, Chunwei Tian, Sai Xu, Qi Zhu, Daoqiang Zhang

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络安全学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Electronic and Electrical Engineering, University College London(伦敦大学学院电子与电气工程系)

AI总结 本文提出BehaviorGuard,一种基于行为的在线后门检测与缓解框架,通过分析动作分布变化识别并抑制后门行为,在单 agent 和多 agent DRL 中均有效。

Comments 11 pages

Journal ref IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06313 2026-05-08 cs.IR cs.AI cs.CL

Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering

超越分块:面向长文档问答的篇章意识层次检索

Huiyao Chen, Yi Yang, Yinghui Li, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能研究院,哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳环形区研究院(SLAI))

AI总结 本文提出一种篇章意识层次检索框架,利用修辞结构理论处理长文档问答,通过 discourse parsing 和 LLM 增强实现结构与语义信息的融合,实验表明在多种语言和文档类型上均取得显著提升。

Comments 21 pages, 9 figures. Accepted at ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05212 2026-05-08 eess.SP cs.HC cs.LG

MPNet: A Robust and Efficient Manifold Pooling Network for Multi-Rhythm EEG Signal Decoding

MPNet: 一种鲁棒且高效的流形池化网络用于多节奏EEG信号解码

Guoqing Cai, Kai Zeng, Shoulin Huang, Ting Ma

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Guangxi Normal University(广西师范大学)

AI总结 MPNet通过流形池化层有效降低计算成本,实现多节奏EEG信号的高效解码,在两个公开数据集上达到最佳性能,运行速度比传统模型快10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04066 2026-05-08 cs.CL cs.ET cs.LG

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04065 2026-05-08 cs.CL cs.ET cs.LG

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

基于自发自由能的强化学习与自适应优势塑造的无监督推理在大语言模型中的应用

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出FREIA算法,通过自发自由能奖励和自适应优势塑造提升大语言模型的无监督推理能力,在三个任务中表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01203 2026-05-08 cs.AI cs.CL

GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models

GR-Ben:一种通用推理基准,用于评估过程奖励模型

Zhouhao Sun, Xuan Zhang, Xiao Ding, Bibo Cai, Li Du, Kai Xiong, Xinran Dai, Fei Zhang, weidi tang, Zhiyuan Kan, Yang Zhao, Bing Qin, Ting Liu

机构 * Research Center for Social Computing(社会计算研究中心) Interactive Robotics, Harbin Institute of Technology, China(交互机器人学,哈尔滨工业大学,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

AI总结 GR-Ben旨在评估过程奖励模型在科学和逻辑两大领域及九个子领域的误差检测能力,揭示现有模型在非数学领域和计算错误检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26799 2026-05-08 cs.CV cs.GR cs.MM

MesonGS++: Post-training Compression of 3D Gaussian Splatting with Hyperparameter Searching

MesonGS++: 3D高斯散射的后训练压缩与超参数搜索

Shuzhao Xie, Junchen Ge, Weixiang Zhang, Jiahang Liu, Chen Tang, Yunpeng Bai, Shijia Ge, Jingyan Jiang, Yuzhi Huang, Fengnian Yang, Cong Zhang, Xiaoyi Fan, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong(香港中文大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shenzhen Technology University(深圳技术大学) Xiamen University(厦门大学) Simon Fraser University(西蒙弗雷泽大学) Jiangxing Intelligence Inc.(江兴智能有限公司)

AI总结 MesonGS++提出了一种基于超参数搜索的3D高斯散射后训练压缩方法,通过联合重要性剪枝、八叉树几何编码等技术,实现34倍压缩并保持渲染质量,优于现有方法并精准满足目标存储预算。

Comments https://github.com/mmlab-sigs/mesongs_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13670 2026-05-08 cs.LG

Advancing Analytic Class-Incremental Learning through Vision-Language Calibration

通过视觉-语言校准推进分析类增量学习

Binyu Zhao, Wei Zhang, Xingrui Yu, Zhaonian Zou, Ivor Tsang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)的CFAR和IHPC) College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院)

AI总结 本文提出VILA框架,通过双级视觉语言校准策略解决预训练模型分析类增量学习中的表示刚性问题,提升学习效率与稳定性,在多个基准测试中表现优异。

Comments 20 pages, 11 figures, 9 tables. Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21187 2026-05-08 cs.CV cs.LG

FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models

FRISM:通过子空间级模型融合实现细粒度推理注入用于视觉-语言模型

Chenyu Huang, Peng Ye, Xudong Tan, Jinhan Mu, Shenghe Zheng, Li Shen, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院,中国) Shanghai Innovation Institute, China(上海创新研究院,中国) The Chinese University of Hong Kong, China(香港中文大学,中国) Harbin Institute of Technology, China(哈尔滨工业大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) Sun Yat-Sen University, Shenzhen, China(暨南大学深圳校区,中国)

AI总结 FRISM通过子空间级模型融合实现细粒度推理注入,有效提升视觉-语言模型的推理能力并保持视觉能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01371 2026-05-05 cs.RO

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

ESARBench: 一种用于代理无人机体感知搜索与救援的基准

Daoxuan Zhang, Ping Chen, Jianyi Zhou, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04106 2026-05-05 cs.AI

InsTraj: Instructing Diffusion Models with Travel Intentions to Generate Real-world Trajectories

InsTraj: 通过旅行意图指导扩散模型生成真实世界轨迹

Yuanshao Zhu, Yuxuan Liang, Xiangyu Zhao, Liang Han, Xinwei Fang, Xun Zhou, Xuetao Wei, James Jianqiao Yu

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of York(约克大学)

AI总结 InsTraj通过自然语言描述指导扩散模型生成真实、多样且符合指令的轨迹,解决传统方法在理解和生成复杂用户意图及约束条件上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26848 2026-05-04 cs.RO

STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation

STARRY:面向机器人操作的时空动作中心世界建模

Yuxuan Tian, Yurun Jin, Bin Yu, Yukun Shi, Hao Wu, Chi Harold Liu, Kai Chen, Cong Huang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) East China Normal University(华东师范大学) DeepCybo

AI总结 STARRY通过统一扩散过程联合去噪未来时空潜在表示和动作,提升机器人操作中时空协调的精度与成功率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28109 2026-05-01 cs.LG

Auto-FlexSwitch: Efficient Dynamic Model Merging via Learnable Task Vector Compression

Auto-FlexSwitch: 通过可学习的任务向量压缩实现高效的动态模型合并

Junqi Gao, Dazhi Zhang, Zhichang Guo, Biqing Qi, Yi Ran, Wangmeng Zuo

机构 * School of Mathematics, Harbin Institute of Technology, Harbin, P. R. China(哈尔滨工业大学数学学院,哈尔滨,中华人民共和国) Shanghai Artificial Intelligence Laboratory, Shanghai, P. R. China(上海人工智能实验室,上海,中华人民共和国)

AI总结 本文提出Auto-FlexSwitch,通过可学习的任务向量压缩实现高效动态模型合并,解决传统方法存储开销大的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27875 2026-05-01 cs.CV

Frequency-Aware Semantic Fusion with Gated Injection for AI-generated Image Detection

具有门控注入的频率感知语义融合用于AI生成图像检测

Shuchang Zhou, Shangkun Wu, Jiwei Wei, Ke Liu, Ran Ran, Caiyan Qin, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出FGINet,通过BMFE和LGFI机制提升AI生成图像检测的泛化能力,采用HCL框架学习紧凑且分离的表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27844 2026-05-01 cs.DC cs.CL

ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training

ZipCCL: 通信集体的高效无损数据压缩以加速大语言模型训练

Wenxiang Lin, Xinglin Pan, Ruibo Fan, Shaohuai Shi, Xiaowen Chu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science(香港科学大学)

AI总结 本文提出ZipCCL,通过理论编码、GPU优化内核和自适应策略,实现通信数据的无损压缩,减少通信时间并提升训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏