arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-05-15 至 2026-05-15 共收录 7
2605.14923 2026-05-15 cs.CV

SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding

SceneParser: 用于视觉语义理解的分层场景解析

Pengxin Xu, Xincheng Lin, Luping Xiao, Qing Jiang, Meishan Zhang, Hao Fei, Shanghang Zhang, Xingyu Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) South China University of Technology(华南理工大学) University of Oxford(牛津大学) Peking University(北京大学)

AI总结 本文提出SceneParser,通过分层解析任务构建场景-对象-部件-功能的层次结构,利用结构完成伪标签和课程学习提升结构感知能力,实验表明其在复杂场景理解中表现更优。

Comments Preprint. Code, models, and dataset are provided in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14601 2026-05-15 cs.CV

Towards Accurate Single Panoramic 3D Detection: A Semantic Gaussian Centric Approach

迈向精确的单视角全景3D检测:一种语义高斯中心化方法

Kanglin Ning, Yiran Zhao, Wenrui Li, Shaoru Sun, Xingtao Wang, Xiaopeng Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Suzhou Research Institute of HIT(哈尔滨工业大学苏州研究院) The PengChengLab(鹏城实验室)

AI总结 本文提出PanoGSDet框架,通过连续语义3D高斯表示实现精准单视角全景3D检测,结合全景深度估计与语义高斯组件,提升3D目标检测性能。

Comments Current has been accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14232 2026-05-15 cs.RO

Reactive Planning based Control for Mobile Robots in Obstacle-Cluttered Environments

基于反应规划的移动机器人在障碍物密集环境中的控制

Li Tan, Junlin Xiong, Yan Wang, Wei Ren

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen(智能科学与工程学院,哈尔滨工业大学深圳) School of Control Science and Engineering, Dalian University of Technology(控制科学与工程学院,大连理工大学)

AI总结 本文提出基于反应规划的控制策略,用于移动机器人在障碍物密集环境中避障和导航,通过局部修改参考轨迹实现安全运动。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04885 2026-05-15 cs.AI

Proactive Memory for Ad-Hoc Recall over Streaming Dialogues

面向流式对话的主动记忆

Bingbing Wang, Jing Li, Ruifeng Xu

机构 * Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学) The School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出ProStream框架,通过分层结构和多粒度蒸馏实现流式对话中的主动记忆召回,解决记忆 fidelity 与效率的矛盾,提升推理精度并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13859 2026-05-15 cs.NE cs.AI cs.LG

BiSpikCLM: A Spiking Language Model integrating Softmax-Free Spiking Attention and Spike-Aware Alignment Distillation

BiSpikCLM: 一种整合无Softmax脉冲注意力和脉冲感知对齐蒸馏的脉冲语言模型

Sihang Guo, Chenlin Zhou, Jiaqi Wang, Kehai Chen, Qingyan Meng, Zhengyu Ma

机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University, Shenzhen, China(电子工程学院,深圳研究生院,北京大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国)

AI总结 BiSpikCLM是首个完全二进制脉冲MatMul-free因果语言模型,通过无Softmax脉冲注意力和脉冲感知对齐蒸馏实现高效训练,显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07931 2026-05-15 cs.CV cs.AI

One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy

每帧一个令牌:重新考虑世界模型中的视觉带宽

Zuojin Tang, Shengchao Yuan, Xiaoxin Bai, Zhiyuan Jing, De Ma, Gang Pan, Bin Liu

机构 * Zhejiang University(浙江大学) Central South University(中南大学) Harbin Institute of Technology(哈尔滨工业大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)

AI总结 本文提出OneWM-VLA,通过自适应注意力池化将每帧视图压缩为一个语义令牌,以单一流匹配目标生成潜在流和动作轨迹,从而减少每帧视觉带宽而不影响长视界性能。

详情

展开后加载摘要…

URL PDF HTML 收藏