arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-04-22 至 2026-04-22 共收录 9
2604.19548 2026-04-22 cs.CL cs.AI cs.CY

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

通过辩证对齐平息代理中的行动者-观察者不对称性

Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(国立新加坡大学) Sichuan University(四川大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) University of Oxford(牛津大学)

AI总结 本文提出ReTAS模型,通过辩证对齐方法减少代理中的行动者-观察者不对称性,提升故障解决能力。

Comments ACL 2026 Main Conference. Project page: https://unikcc.github.io/ReTAS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19536 2026-04-22 cs.RO

LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation

LiveVLN: 突破视觉语言导航中的停止与前进循环

Xiangchen Wang, Weiye Zhu, Teng Wang, TianTian Geng, Zekai Zhang, Zhiyuan Qi, Jinyu Yang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Spatialtemporal AI(时空AI)

AI总结 LiveVLN通过增强预训练视觉语言导航器,实现更连续的具身导航,减少等待时间并提升动作可用性,实验证明在真实部署中显著提升执行效率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19488 2026-04-22 cs.AI

CoDA: Towards Effective Cross-domain Knowledge Transfer via CoT-guided Domain Adaptation

CoDA:通过引导式推理的领域适应实现有效的跨领域知识迁移

Jianzhi Yan, Le Liu, Buzhou Tang, Yang Xiang, Dongning Sun, Zhiming Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

AI总结 针对跨领域知识迁移中领域分布偏移问题,CoDA通过轻量适配器和基于特征的知识蒸馏结合MMD分布匹配,有效对齐源域与目标域的潜在推理表示,提升逻辑推理任务性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19406 2026-04-22 cs.CV cs.AI

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

HP-Edit:一种用于图像编辑的人类偏好后训练框架

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Harbin Institute of Technology(哈尔滨工业大学) Nankai University(南开大学)

AI总结 本文提出HP-Edit框架和RealPref-50K数据集,通过少量人类偏好评分数据和预训练视觉大语言模型开发自动评估器,提升图像编辑模型对人类偏好的契合度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19262 2026-04-22 cs.CL cs.AI

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

CulturALL:基于 grounded 任务的 LLM 多语言和多文化能力基准测试

Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

机构 * Alibaba Group(阿里巴巴集团) Beijing Language and Culture University(北京语言大学) LMU Munich(慕尼黑大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) IBM Research AI, UAE(阿联酋IBM人工智能研究) MBZUAI Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出 CulturALL 基准测试,评估 LLM 在 grounded 任务中的多语言和多文化能力,包含 14 种语言 51 个地区 16 个主题的 2610 个样本,实验显示最佳 LLM 准确率仅 44.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18982 2026-04-22 cs.AI

SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

SAVOIR:通过基于Shapley的奖励归因学习社交能力

Xiachong Feng, Yi Jiang, Xiaocheng Feng, Deyi Yin, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Yuxuan Gu, Chonghan Qin, Bing Qin, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 本文提出SAVOIR框架,基于合作博弈理论解决语言代理训练中的信用分配问题,通过预期效用转移和Shapley值实现公平奖励分配,实验显示其在SOTOPIA基准上达到新状态-of-the-art性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18665 2026-04-22 cs.SD

APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track

APRVOS:第五届PVUW MeViS-Audio赛道第一名获奖作品

Deshui Miao, Yameng Gu, Chao Yang, Xin Li, Haijun Zhang, Ming-Hsuan Yang

机构 * Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) University of California at Merced(加州大学默塞德分校)

AI总结 本文提出针对MeViS_Audio任务的音频感知视频目标分割框架,通过语音转录和视觉存在验证提升分割精度,结合Sa2VA和SAM3实现粗分割与精修,分阶段处理音频到视频分割问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14726 2026-04-22 cs.LG cs.AI

Catching Every Ripple: Enhanced Anomaly Awareness via Dynamic Concept Adaptation

捕捉每一个涟漪:通过动态概念适应提升异常意识

Jiaqi Zhu, Shaofeng Cai, Jie Chen, Fang Deng, Beng Chin Ooi, Wenqiao Zhang

机构 * School of Automation and the National Key Laboratory of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(自动化学院和自主智能无人系统国家重点实验室,北京理工大学) School of Computing, National University of Singapore(computing 学院,新加坡国立大学) Harbin Institute of Technology(哈尔滨工业大学) Digital Media Computing & Design Lab, Zhejiang University(数字媒体计算与设计实验室,浙江大学)

AI总结 本文提出DyMETER框架,通过动态概念适应机制提升在线异常检测的适应性与效率,采用超网络生成实例感知参数位移,并引入轻量级进化控制器和动态阈值优化模块以实现鲁棒和可解释的适应。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏