Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation
代理流引导与并行展开搜索用于空间感知的文本到图像生成
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出AFS-Search框架,通过闭合环路机制和空间感知引导提升文本到图像生成的精度与效率,实现性能和速度的双重优化。
高校专区
代理流引导与并行展开搜索用于空间感知的文本到图像生成
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出AFS-Search框架,通过闭合环路机制和空间感知引导提升文本到图像生成的精度与效率,实现性能和速度的双重优化。
CoPRS:从链式思维中学习位置先验以进行推理分割
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Peng Cheng Laboratory(鹏城实验室) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Meituan, Beijing(北京美团) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。
Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables
通过大规模数据集进行逆椭圆度测量问题的建模:流匹配
机构 * Chongqing Research Institute of Harbin Institute of Technology(哈尔滨工业大学重庆研究院) ; The Hong Kong Polytechnic University(香港理工大学) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Tianjin University(天津大学) ; Tsinghua University(清华大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
AI总结 本文提出EllipBench数据集和Decoupled Conditional Flow Matching框架,解决逆椭圆度测量问题中光常数和膜厚重建的物理不确定性。
TINA:无文本逆向攻击用于未学习的文本到图像扩散模型
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; City University of Hong Kong(香港城市大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Peng Cheng Laboratory(鹏城实验室) ; Shandong University(山东大学)
AI总结 TINA通过无文本逆向攻击揭示未学习模型中残留的视觉知识,挑战现有去概念化方法的局限性。
Comments 16 pages, accepted by CVPR 2026
M2P:通过Mask-to-Point弱监督学习改进视觉基础模型以实现密集点跟踪
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) ; Meituan, Shenzhen, China(美团(深圳,中国)) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)
AI总结 本文提出M2P学习方法,利用视频对象分割掩码注解改进视觉基础模型,通过局部结构一致性损失、掩码标签一致性损失和掩码边界约束,提升密集点跟踪性能,实验表明其在TAP-Vid-DAVIS基准上优于DINOv2和DINOv3。
TechImage-Bench: 基于评分标准的技术图像生成评估
机构 * Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Microsoft Project Website(微软项目网站)
AI总结 本文提出TechImage-Bench,通过评分标准评估技术图像生成,发现现有模型在科学准确性上存在显著差距,并展示评分标准对改进图像生成的监督作用。
VeriAgent:一种集成工具的多智能体系统,具有进化记忆,用于PPA感知的RTL代码生成
机构 * Xiamen University(厦门大学) ; Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出一种集成EDA工具的多智能体框架,用于高质量Verilog代码生成,通过进化记忆机制实现功能正确性和PPA指标的联合优化。
KA2L:一种面向大语言模型的基于知识的主动学习框架
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; Institute for Advanced Algorithms Research(先进算法研究所) ; National Key Laboratory of Smart Farm Technologies(智能农业技术与系统国家重点实验室)
AI总结 本文提出KA2L框架,通过分析潜在空间评估LLM对特定知识的掌握程度,生成未知问题以提升模型能力,实验表明该方法能有效降低标注和计算成本,并在多个数据集上取得更好性能。
Comments 15 pages, 3 figures
UAV-CB: 一种复杂背景RGB-T数据集和局部频率桥梁网络用于UAV检测
机构 * Pengcheng Laboratory(鹏城实验室) ; South China University of Technology(南方科技大学) ; Peking University(北京大学) ; Xinjiang University(新疆大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出UAV-CB数据集和LFBNet网络,针对低空环境中的UAV检测复杂背景和伪装问题,通过局部频率空间建模提升RGB-T融合性能,实验证明其在伪装和杂乱背景下的鲁棒性。
TRiMS:通过强化学习实现高效的实时最小充分长度推理跟踪
机构 * Baidu Inc.(百度公司) ; Shenzhen University(深圳大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出TRiMS,通过强化学习和最小充分长度指标,实现高效推理压缩,减少80%以上的推理token数量并提升准确性。
Comments 8 pages (main), 21 pages total including appendix, 18 figures.Code will be released
TimeAPN: 用于时间序列预测的自适应幅度-相位非平稳归一化
机构 * School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
AI总结 本文提出TimeAPN框架,通过时间与频率域联合建模和预测非平稳因素,结合自适应归一化机制提升长周期时间序列预测精度。
ZipServ: 一种快速且内存高效的LLM推理方法,结合硬件感知的无损压缩
机构 * The Hong Kong University of Science(香港科学与技术大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
AI总结 ZipServ通过硬件感知的无损压缩技术,提升LLM推理效率,减少内存占用,实现比cuBLAS快2.21倍的内核速度和1.22倍的端到端推理加速。
Comments ASPLOS'26 Accepted Paper
EEG-SeeGraph: 通过稀疏解释性动态EEG图学习解读痴呆症的功能连接紊乱
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Institute of Neurological Diseases, Shenzhen Bay Laboratory, Shenzhen, China(深圳湾实验室神经疾病研究院)
AI总结 本文提出EEG-SeeGraph,通过稀疏解释性动态EEG图学习方法,解析痴呆症中功能连接紊乱,具备噪声鲁棒性和可解释性。
NutVLM: 一种针对自动驾驶中视觉语言模型全维度攻击的自适应防御框架
机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
AI总结 本文提出NutVLM框架,通过NutNet++ sentinel检测并净化良性样本、局部修补和全局扰动,结合高效灰度遮蔽和专家引导的对抗提示调优,提升自动驾驶中视觉语言模型的鲁棒性与性能。
Comments 12 pages, 6 figures
TALO:推动3D视觉基础模型向全球一致的在线重建迈进
机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出基于薄板样条的高自由度长期对齐框架,通过全局传播控制点纠正空间变化不一致,并采用点无关子图注册设计提升鲁棒性,实验表明其在多数据集和相机配置下均能获得更一致的几何和更低的轨迹误差。
Comments CVPR 2026
通过高斯点撒技术参数化数据集
机构 * The School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区计算机科学与技术学院) ; Institute of Perceptual Intelligence, Pengcheng Laboratory(感知智能研究院,鹏城实验室)
AI总结 本文提出GSDD,一种基于高斯点撒的数据集参数化技术,通过高效存储结构提升数据集压缩效率,增强多样性并提升蒸馏性能。
Comments 19 pages; Code is available on https://github.com/j-cyoung/GSDatasetDistillation
测试时3D占用预测
机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) ; Harbin Institute of Technology(哈尔滨工程大学)
AI总结 本文提出TT-Occ框架,通过实时集成视觉基础模型,实现灵活的3D高斯表示和占用预测,适用于不同体素分辨率和新类别识别。
Comments CVPR 2026
$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology(哈尔滨工业大学) ; The University of Hong Kong(香港大学)
AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。
Comments This version is the camera-ready version accepted at CVPR 2026
基于排斥性的掩码学习的半监督人群实例分割与计数
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; City University of Hong Kong(香港城市大学)
AI总结 本文提出Exclusivity-Guided Mask Learning方法,通过判别性掩码目标实现空间分离,结合高斯平滑和可微中心采样策略提升特征连续性和训练稳定性,从而在统一框架下实现人群实例分割与计数的半监督学习。
GATS: 基于高斯意识的时间缩放变换器的不变四维时空点云表示
机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; Xi’an Jiaotong University(西安交通大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室)
AI总结 本文提出GATS框架,通过不确定性引导的高斯卷积和时间缩放注意力模块,解决四维点云视频中时间尺度偏差和分布不确定性问题,提升鲁棒性和精度。
USIS-PGM:用于水下显著实例分割的光度高斯混合
机构 * Department of Electronic and Computer Engineering(电子与计算机工程系) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; School of CIT, Chair i6(CIT学院,Chair i6) ; Technical University of Munich(慕尼黑技术大学) ; School of CIT(CIT学院) ; School of Robotics and Advanced Manufacture(机器人与先进制造学院) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
AI总结 本文提出USIS-PGM框架,通过频率感知模块增强边界线索,结合动态加权模块进行内容自适应特征重加权,利用光度高斯混合生成多尺度高斯热图以监督解码器特征,提升水下显著实例分割的定位精度和掩码预测的结构一致性。
双代理强化学习用于自适应和成本感知的视觉惯性里程计
机构 * Southeast University(东南大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出双代理强化学习框架,通过智能选择代理和融合代理优化视觉惯性里程计的运行时机和信任度,提升精度与效率的平衡。
Comments Accepted to the CVPR 2026 Main Track
ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Eastern Institute of Technology, Ningbo(宁波东部技术研究院) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Zhongguancun Academy(中关村学院)
AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。
Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/
PhysGM:用于前馈4D合成的大型物理高斯模型
机构 * Beijing Institute of Technology(北京理工大学) ; Li Auto(利汽车) ; Harbin Institute of Technology(哈尔滨工业大学) ; Sichuan University(四川大学) ; Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究院)
AI总结 PhysGM通过单图像联合预测3D高斯表示和物理属性,实现高效4D渲染。该方法采用物理感知重建模型和直接偏好优化,提升模拟精度并降低计算成本。
Comments CVPR 2026
从单视角点云通过多物体场景数据集实现端到端的灵巧抓取学习
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出DGS-Net,通过多物体场景的单视角点云学习密集抓取配置,改进了现有抓取数据集的局限性,实验显示其在仿真和真实机器人平台上的抓取成功率较高,且具有较低的穿透深度。
Comments 10 pages, 6 figures. Submitted to IEEE Transactions on Automation Science and Engineering (T-ASE)
TextOVSR: 基于文本引导的现实世界歌剧视频超分辨率
机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) ; Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) ; Harbin Institute of Technology Zhengzhou Research Institute(哈尔滨工业大学郑州研究所) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Huawei Technologies Ltd(华为技术有限公司)
AI总结 针对歌剧视频因早期拍摄设备限制和长期存储退化导致的视觉质量差问题,本文提出TextOVSR网络,通过引入两种文本提示引导超分辨率过程,结合文本增强判别器和降质鲁棒特征融合模块,提升纹理重建质量。
基于强化学习的语言引导标记压缩在大视觉-语言模型中
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; University of Electronic Science and Technology of China(电子科学与技术大学) ; School of Robotics and Advanced Manufacture(机器人与先进制造学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; College of Information and Control Engineering(信息与控制工程学院)
AI总结 本文提出TPRL框架,通过语言引导的序列优化实现视觉标记压缩,减少推理成本并提升效率,实验显示可减少66.7%的视觉标记和54.2%的FLOPs,精度损失仅0.7%。
AutoTool: 通过解耦熵约束实现强化学习中工具使用能力的自动扩展
机构 * Harbin Institute of Technology, SCIR Lib(哈尔滨工业大学,SCIR实验室) ; Peking University(北京大学) ; Huawei Technologies Ltd(华为技术有限公司)
AI总结 本文提出AutoTool方法,通过解耦熵约束实现强化学习中工具使用能力的自动扩展,提升模型在复杂问题上的表现,同时减少计算开销。
Comments ICLR 2026 poster
EgoGrasp:从第一人称视频中估计世界空间手-物体交互
机构 * Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学) ; Imperial College London(伦敦帝国学院) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 EgoGrasp提出了一种从动态第一人称视频中重建世界空间手-物体交互的方法,支持开放词汇物体,通过多阶段框架实现鲁棒的3D重建与姿态估计。
V-Bridge:将视频生成先验与多功能少样本图像恢复相连接
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出V-Bridge框架,将视频生成模型的潜在能力应用于多功能少样本图像恢复任务,通过将图像恢复视为渐进生成过程,利用视频模型实现从退化输入到高保真输出的逐步细化,仅用1000个多任务样本即可实现竞争性性能。
Comments Transfer the prior knowledge of video generative models to image restoration tasks