arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 175
2606.13723 2026-07-03 cs.CV cs.AI 新提交

Morphology-Aware Sample Assignment: Overcoming IoU Insensitivity for Surface Defect Detection

形态感知样本分配:克服IoU不敏感性用于表面缺陷检测

Pengfei Liu, Yuhan Guo

机构 * School of Management, Harbin Institute of Technology(管理学院,哈尔滨工业大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 针对IoU在缺陷检测中不敏感的问题,提出基于面积、形状和长宽比的形态相似性度量来优化正样本分配,理论分析表明该方法能重塑匹配函数响应分布,在NEUDET和GC10-DET数据集上基于YOLOv9框架取得一致性能提升,且零额外推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00006 2026-07-02 cs.CL cs.AI 新提交

Persona Without Substrate: Regime-Dependence and the LLM Individuation Problem

无基座的人格:体制依赖性与LLM个体化问题

Shuaizhi Cheng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 通过实验揭示LLM个体化问题中跨体制共指假设的漏洞,提出体制索引个体化框架,将表征内容的身份单位视为(载体,体制)对。

Comments 30 pages, 2 figures, 1 table. Replies to Beckmann & Butlin (arXiv:2604.17031)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31349 2026-07-01 eess.SP cs.AI 新提交

PGUDA: Pressure-Guided Unsupervised Domain Adaptation with Cross-Modal Knowledge Distillation for sEMG-Based Gesture Recognition

PGUDA: 基于压力引导的无监督域适应与跨模态知识蒸馏用于sEMG手势识别

Yurui Liu, Xiao-Cong Zhong, Qisong Wang, Xuefu Wang, Dan Liu, Jinwei Sun

机构 * School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)

AI总结 提出PGUDA框架,利用压力信号的鲁棒性通过跨模态知识蒸馏引导sEMG特征对齐,在跨主体和跨会话任务中平均准确率58.08%,仅需5%标注数据即可达到全监督性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32009 2026-07-01 cs.RO 新提交

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

人类作为人形机器人:通过人类对齐的具身从自我-外部人类视频实现零样本人形机器人学习

Xiaopeng Lin, Ruoqi Yang, Shijie Lian, Zhaolong Shen, Bin Yu, Changti Wu, Haibao Liu, Yuxiang Zhang, Hong Li, Qiyuan Su, Haochen Liu, Xuguo He, Yukun Shi, Cong Huang, Zhirui Zhang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepCybo ZGCA ZGCI Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学)

AI总结 提出Human-as-Humanoid框架,通过对齐机器人本体、感知设置和动作标签接口,将大规模人类演示视频转化为可执行的动作监督,实现高自由度人形机器人的零样本学习。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31924 2026-07-01 cs.CV 新提交

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31800 2026-07-01 cs.AI 新提交

Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

Evo-PI:通过演化原则引导的对齐医学推理

Xianda Zheng, Huan Gao, Meng-Fen Chiang, Michael Witbrock, Kaiqi Zhao, Shangyang Li

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) National Yang Ming Chiao Tung University(国立阳明交通大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 提出Evo-PI框架,将推理原则作为可演化的语言监督信号,通过协同进化循环动态调整模型推理,在医学视觉问答中提升准确率最高达24.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31723 2026-07-01 cs.RO 新提交

UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models

UniTacVLA:视觉语言动作模型中的统一触觉理解与预测

Xidong Zhang, Yichi Zhang, Jiaxin Shi, Fucai Zhu, Siyu Zhu, Michael Yu Wang, Xiaojun Wu, Weihao Yuan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大湾区大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics

AI总结 提出统一触觉学习框架,通过触觉链式推理和由粗到细的未来触觉预测构建状态与动力学感知先验,并设计触觉-动作混合控制器,在接触丰富操作任务中提升成功率、精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31645 2026-07-01 cs.CV 新提交

Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning

RoboSpatial Challenge at CVPR 2026技术报告:选择性推理激活与参考框架消歧用于具身空间推理

Yuxiang Xie, Qi Lv, Jianming Xing, Zijian Hong, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Ruoyu Technology(若愚科技)

AI总结 提出RoboSpatialBrain,通过强制<think>前缀激活和参考框架重定向两种无训练推理机制,解决具身空间推理中的歧义问题,在RoboSpatial-Home上达到80.9%成功率,获得挑战赛第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31232 2026-07-01 cs.AI 新提交

Delta-JEPA: Learning Action-Sensitive World Models via Latent Difference Decoding

Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型

Zhenghao Zhang, Yuanxiang Wang, Zhenyu Guan, Yujia Yang, Bingkang Shi, Tianyu Zong, Hongzhu Yi, Guoqing Chao, Xingchen Chen, Tiankun Yang, Chenxi Bao, Tao Yu, Jingjing Zhou, Jungang Xu

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Computer Science and Technology, Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Faculty of Computing, Harbin Institute of Technology, Harbin(哈尔滨工业大学计算学部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 提出Delta-JEPA,一种无重建的世界模型,通过潜在差异动作解码器(LDAD)从连续观测的潜在位移中重建动作,防止表示坍塌,提升基于规划的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27935 2026-07-01 cs.CV 新提交

Controllable Histopathology Image Synthesis with Training-free Structural Initialization and Textural Modulation

可控的组织病理学图像合成:无需训练的结构初始化和纹理调制

Yuheng Qiu, Jingyi Luo, Chenfei Ye, Ting Ma, Jianfeng Cao

机构 * School of Biomedical Engineering, Harbin Institute of Technology (Shenzhen), Shenzhen, China(哈尔滨工业大学(深圳)生物医学工程学院,深圳,中国)

AI总结 提出CHIS框架,通过频率域结构初始化和小波域纹理调制,使无标签预训练扩散模型生成与先验结构掩码对齐且保持参考组织风格的图像,提升下游分割任务性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28321 2026-06-29 cs.CV 新提交

StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views

StructSplat: 从无标定稀疏视图进行可泛化的3D高斯泼溅

Jia-Chen Zhao, Beiqi Chen, Xinyang Chen, Guangcong Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Guangzhou CloudButterfly Technology Co., Ltd.(广州云蝴蝶科技有限公司)

AI总结 提出StructSplat,一种前馈式可泛化3D高斯重建框架,无需相机参数,通过结构化表示分离几何、语义和纹理线索,在多个基准上显著超越现有方法。

Comments Project page: https://structsplat.github.io Code: https://github.com/J-C-Zhao/StructSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28266 2026-06-29 cs.CV 新提交

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

RSICCLLM:用于遥感图像变化描述的多模态大语言模型

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) Great Bay University, Dongguan, China(东莞Great Bay大学,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)

AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26872 2026-06-29 cs.CV 新提交

SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

SpatialFlow-GRPO:空间信用驱动图像编辑

Yankai Yang, Yancheng Long, Wei Chen, Xingyu Lu, Hongyang Wei, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

AI总结 提出SpatialFlow-GRPO框架,通过引入空间细粒度奖励反馈,将区域感知奖励转化为语义区域级优化信号,解决图像编辑中空间均匀性假设问题,显著提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26981 2026-06-26 cs.RO cs.AI 新提交

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

上下文模型预测生成:从语言模型到物理的开放词汇运动合成

Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)

AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26947 2026-06-26 cs.CV cs.AI 新提交

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

缩放多参考图像生成与动态奖励优化

Wenwang Huang, Yusen Fu, Junjie Wang, Mengfei Huang, Yulin Li, Gan Liu, Jing Cai, Yancheng He, Zhuotao Tian

机构 * Harbin Institute of Technology(哈尔滨工业大学) Independent Researcher(独立研究者) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出OmniRef-Bench基准和DyRef两阶段训练框架,通过动态奖励优化解决多参考图像生成中参考图像类型和数量增加导致的性能下降问题。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26654 2026-06-26 cs.CL cs.HC cs.IR 新提交

SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context

SocialPersona: 基于多模态社交媒体上下文的个性化画像与回复基准测试

Qinkai Zhang, Yanyan Zhao, Xin Lu, Yulin Hu, Pengtao Han, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 提出SocialPersona基准,评估多模态大语言模型从社交媒体时间线推断用户偏好并用于对话的能力,实验表明模型在细粒度与近期偏好上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26631 2026-06-26 cs.CV 新提交

Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

位置重绑定缓存复用:交错多模态推理中无重放的视觉重访

Mengzhao Wang, Yanli Ji, Wangmeng Zuo, Peng Ye, Chongjun Tu

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Harbin Institute of Technology (HIT)(哈尔滨工业大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出位置重绑定缓存复用(PRCR)框架,通过重绑历史视觉KV缓存的位置坐标,实现无重放的高效视觉重访,在多个多模态推理基准上平均准确率提升5%,计算量减少数万倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26549 2026-06-26 cs.AI cs.LG 新提交

PMDformer: Patch-Mean Decoupling Information Transformer for Long-term Forecasting

PMDformer: 用于长期预测的补丁均值解耦信息Transformer

Ao Hu, Liangjian Wen, Jiang Duan, Yong Dai, He Yan, Dongkai Wang, Jun Wang, Yukun Zhang, Ruoxi Jiang, Zenglin Xu

机构 * Southwestern University of Finance and Economics(西南财经大学) Shanghai Academy of AI for Science(上海人工智能研究院) Fudan University(复旦大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) X-Humanoid Research Institute(X-Humanoid 研究院) Chengdu Everimaging Science and Technology Co., Ltd.(成都永新科技有限公司) Artificial Intelligence and Digital Finance Key Laboratory of Sichuan Province(四川省人工智能与数字金融重点实验室)

AI总结 提出补丁均值解耦方法分离趋势与残差形状,结合趋势恢复注意力和邻近变量注意力,提升长期时间序列预测的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26455 2026-06-26 cs.CV cs.AI cs.LG 新提交

Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking

主动对抗扰动驱动的关联记忆检索用于RGB-事件视觉目标跟踪

Xiao Wang, Xufeng Lou, Zikang Yan, Lan Chen, Sibao Chen, Yaowei Wang, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Electronic and Information Engineering, Anhui University(安徽大学电子信息工程学院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Computer Science, Peking University(北京大学计算机学院) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

AI总结 提出APRTrack框架,通过分层对抗扰动模拟模态退化与局部缺失,并设计足迹引导的通道校准Hopfield检索实现鲁棒的历史信息补偿,在多个数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26120 2026-06-26 cs.CL cs.LG 新提交

Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM

Dynamic-dLLM: 动态缓存预算与自适应并行解码实现扩散大语言模型的无训练加速

Tianyi Wu, Xiaoxi Sun, Yanhua Jiao, Yulin Li, Yixin Chen, YunHao Cao, YiQi Hu, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对扩散大语言模型计算复杂度随序列长度立方增长的问题,提出Dynamic-dLLM框架,通过动态缓存更新和自适应并行解码,在不训练的情况下实现3倍以上加速并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25732 2026-06-25 cs.CV 新提交

Efficient Real-World Dehazing via Physics-Inspired Global-Local Decoupling

高效真实世界去雾:物理启发的全局-局部解耦

Yifei Qu, Ru Li, Junjie Chen, Jinyuan Wu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部)

AI总结 提出PGL-Net,通过物理启发的算子级模拟实现全局分布校正与局部细节恢复,在多个真实基准上以显著降低的复杂度达到SOTA去雾质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24954 2026-06-25 cs.LG cs.CL 新提交

Digital Twin-Driven Adaptive Sim-to-Real Alignment via Reinforcement Learning for Vibration-Based Bearing Health Monitoring Under Data Scarcity

基于强化学习的数字孪生驱动自适应模拟到真实对齐用于数据稀缺下振动轴承健康监测

Jinghan Wang, Yanjun Chen, Wei Zhang, Wentao Wu, Tianchen Liu, Gaoliang Peng

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Eastern Institute of Technology, China(东方技术研究院,中国)

AI总结 针对数据稀缺下振动监测的故障诊断问题,提出基于强化学习的数字孪生自适应对齐方法,通过策略网络为不同故障类型生成特定仿射变换,平衡特征间隙与类间可分性,在三个数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24369 2026-06-25 cs.AI cs.DC cs.NI cs.PF 新提交

Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

加速面向视觉生成式大语言模型的解耦强化学习:基于扩散并行与训练器辅助生成

Sijie Wang, Zhengyu Qing, Zhiqiang Tan, Yiming Yin, Yeqing Zhang, Yaoyuan Wang, Qiang Wang, Xiaowen Chu, Shaohuai Shi

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析学域) Huawei Technologies Ltd.(华为技术有限公司)

AI总结 提出解耦强化学习框架DigenRL,通过生成轴流水线、时间步并行和弹性训练器辅助生成,解决扩散生成式大语言模型中执行气泡问题,实现1.56-2.10倍吞吐提升。

Comments Withdrawn by the authors pending resolution of intellectual property and institutional disclosure requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24196 2026-06-25 cs.AI 新提交

Navigating User Behavior toward Personalized Multimodal Generation

导航用户行为以实现个性化多模态生成

Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 提出NaviGen,通过双标识符编码用户行为并采用两阶段SFT+RL训练,将交互历史转化为可执行指令,提升个性化图像和视频生成质量。

Comments 16 pages, 15 figures, 5 tables. Code is available at https://github.com/iLearn-Lab/NaviGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24726 2026-06-24 cs.CV 新提交

SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

SER: 用语义证据奖励学习视频推理定位

Sheng Xia, Zhengqin Lai, Tianxiang Jiang, Kanghui Tian, Shoujun Zhou, Bin Li, Yi Wang

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

AI总结 提出语义证据奖励(SER),通过将时空证据定位重构为约束验证任务,利用裁判VLM评估证据的相关性和定位质量,在V-STAR基准上提升3.0点mLGM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24292 2026-06-24 cs.CV 新提交

ActiveScope: Actively Seeking and Correcting Perception for MLLMs

ActiveScope: 主动寻求和纠正MLLMs的感知

Yajing Wang, Chao Bi, Junshu Sun, Shufan Shen, Zhaobo Qi, Shuhui Wang, Qingming Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

AI总结 提出ActiveScope框架,通过语义锚点定位和干扰抑制细化模块,解决MLLMs在高分辨率图像中的细粒度感知问题,在V* Bench上达到96.34%准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24153 2026-06-24 cs.CV 新提交

Differential Unfolding: Efficient Unfolding Reconstruction for Video Snapshot Compressive Imaging

微分展开:视频快照压缩成像的高效展开重建

Muyuan Zhang, Jiancheng Zhang, Haijin Zeng, Yin-ping Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 提出微分展开(DU)框架,通过异质结构替代均匀重复,利用微分进化机制在降低计算开销的同时提升视频SCI重建精度,达到新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23643 2026-06-23 cs.AI 新提交

TailorMind: Towards Preference-Aligned Multimodal Content Generation

TailorMind: 面向偏好对齐的多模态内容生成

Hengji Zhou, Ye Liu, Yufeng Liu, Si Wu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 提出TailorMind框架,通过超图协同过滤和文本梯度下降建模用户偏好,结合检索增强风格控制和跨模态一致性反射,实现无候选池的个性化多模态内容生成,在TailorBench上优于基线。

Comments 18 pages, 13 figures, 6 tables. Code available at https://github.com/iLearn-Lab/TailorMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22801 2026-06-23 cs.CV 新提交

Learning Adaptive Dynamical Features via Multi-$τ$ Liquid-Mamba for All-in-one Image Restoration

学习自适应动态特征:用于全能图像恢复的多τ液态Mamba

Hu Gao, Changshuo Wang, Yulong Chen, Lizhuang Ma

机构 * Department of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术系) Department of Architecture and Design, Harbin Institute of Technology(哈尔滨工业大学建筑与设计系)

AI总结 提出Multi-τ Liquid-Mamba模块,通过输入条件多时间尺度液态离散化改进选择性状态空间建模,实现自适应动态特征学习,在全能图像恢复中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22402 2026-06-23 cs.SE cs.AI cs.CL cs.LG 新提交

Reinforcement learning to improve large language model-based automated code compliance systems

强化学习改进基于大语言模型的自动化代码合规系统

Jack Wei Lun Shi, Minghao Dang, Wawan Solihin, Leong Hien Poh, Justin K. W. Yeoh

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology(哈尔滨工业大学) NovaCITYNETS

AI总结 提出P4IR两阶段框架,先通过监督微调注入领域知识,再用GRPO优化高层代码骨架的准确性,在零样本设置下优于多个领先大语言模型。

Comments 22 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏