arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-06-08 至 2026-06-08 共收录 10
2606.07402 2026-06-08 cs.CL 新提交

M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

M$^3$Exam: 面向真实用户-智能体交互的多模态记忆基准

Zhengjun Huang, Wenxuan Liu, Zhoujin Tian, Wei Chen, Junle Chen, Yuqian Wu, Fangyuan Zhang, Qintian Guo, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Chemical Technology(北京化工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Institute of Technology (Zhuhai)(北京理工大学(珠海)) Tencent Hy(腾讯(深圳)) Peng Cheng Laboratory(鹏城实验室)

AI总结 提出M$^3$Exam基准,用于评估多模态大语言模型在真实用户-智能体交互中的跨模态推理和隐式信息推断能力,并设计M$^3$Proctor方法通过按需处理视觉源提升准确率13%,同时降低索引构建时间和检索token超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07244 2026-06-08 cs.RO cs.AI cs.CV 新提交

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation

超越航点:面向视觉语言导航的轨迹中心航点范式

Haoxiang Shi, Xiang Deng, Haoyu Zhang, Qiaohui Chu, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

AI总结 提出轨迹航点范式,通过TSDF引导的扩散策略预测可执行轨迹,解决VLN-CE中航点不可达与规划控制不一致问题,在基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07033 2026-06-08 cs.AI cs.CV 新提交

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

层次化语义约束异构图用于音视频事件定位

Zhe Yang, Ruyi Zhang, Hongtao Chen, Wenrui Li, Hengyu Man, Wangmeng Zuo, Xiaopeng Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

AI总结 提出层次化语义约束异构图框架,通过构建异构图、双向语义约束和双曲空间层次正则化,解决开放词汇音视频事件定位中跨尺度一致性和层次语义一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06944 2026-06-08 cs.RO 新提交

T-GMP: Terrain-conditioned Generative Motion Priors for Versatile and Natural Humanoid Locomotion

T-GMP: 基于地形条件的生成式运动先验用于多功能且自然的人形机器人 locomotion

Junhong Guo, Hao Hu, Chen Chen, Haoxuan Han, Linao Gong, Xin Yang, Zhicheng He, Yao Su, Fenghua He

机构 * Harbin Institute of Technology(哈尔滨工程大学) Leju Robotics(莱居机器人)

AI总结 提出 T-GMP 模块,利用条件变分自编码器从少量专家演示中学习地形条件潜在运动流形,结合对抗学习与立足点惩罚,实现统一策略下适应地形变化的多功能自然运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06903 2026-06-08 cs.CV cs.AI 新提交

Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy

超越骨架:使用Same2X训练策略直接从驱动视频学习动画

Yuan Zeng, Yujia Shi, Yuhao Yang, Dongxia Liu, Zongqing Lu, Wenming Yang, Qingmin Liao

机构 * Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

AI总结 提出DirectAnimator框架,通过驱动线索三元组和Same2X训练策略,绕过姿态提取直接从原始视频学习动画,实现鲁棒且高质量的人体图像动画生成。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-06-08 cs.AI 新提交

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05761 2026-06-08 cs.AI cs.CL 版本更新

SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

SubtleMemory: 面向长时程AI智能体的细粒度关系记忆辨别基准

Wenxuan Wang, Haoyu Sun, Fukuan Hou, Mingyang Song, Weinan Zhang, Yu Cheng, Yang Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Xiamen University(厦门大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出SubtleMemory基准,通过构建关系控制的潜在语义伪影并嵌入用户-智能体交互历史,评估长时程AI智能体在后续查询中恢复分布式关系结构的能力。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04874 2026-06-08 cs.CL 版本更新

Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents

Agent规划基准:LLM Agent规划能力的诊断框架

Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Skywork AI University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出Agent规划基准(APB),通过4209个多模态案例和五个设置,诊断LLM Agent在长程规划、工具噪声鲁棒性、校准拒绝和推理时改进方面的系统弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25413 2026-06-08 cs.LG cs.AI cs.NA math.NA 版本更新

Autoregression-Free Neural Operators for Time-Dependent PDEs

无自回归的神经算子用于时间相关偏微分方程

Jiaquan Zhang, Caiyan Qin, Haoyu Bian, Libin Cai, Yi Lu, Chaoning Zhang, Wei Dong, Yuanfang Guo, Yang Yang, Heng Tao Shen

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(哈尔滨工业大学机器人与先进制造学院) School of Mathematical Sciences, Capital Normal University(首都师范大学数学学院) College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院) Laboratory of Intelligent Recognition and Image Processing, School of Computer Science and Engineering, Beihang University(北京航空航天大学智能识别与图像处理实验室) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

AI总结 提出AFNO,通过将PDE时间演化映射到潜空间并利用流匹配学习连续时间向量场,避免自回归展开,实现长期稳定预测。

Comments 23 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20950 2026-06-08 cs.CV cs.AI 版本更新

Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models

聚焦-然后-上下文:面向视觉-语言模型的主体导向渐进视觉标记缩减

Yulin Zhao, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) ShenZhen Loop Area Institute(深圳河套学院)

AI总结 本文提出了一种主体导向的渐进视觉标记缩减方法SPpruner,通过模拟人类视觉感知系统的'聚焦-然后-上下文'机制,有效减少视觉标记数量,提升视觉-语言模型的推理效率,实验表明其在速度和资源消耗上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏