arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-04-23 至 2026-04-23 共收录 12
2604.20473 2026-04-23 cs.CV

Video-ToC: Video Tree-of-Cue Reasoning

Video-ToC: 视频树状提示推理

Qizhong Tan, Zhuotao Tian, Guangming Lu, Jun Yu, Wenjie Pei

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 Video-ToC通过树状提示推理框架提升视频理解,引入三创新:树引导视觉提示定位、需求驱动奖励机制和自动化标注流程,验证其在视频理解与幻觉检测中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20444 2026-04-23 cs.RO cs.AI cs.DB cs.LG

VTouch++: A Multimodal Dataset with Vision-Based Tactile Enhancement for Bimanual Manipulation

VTouch++:一个用于双臂操作的多模态数据集,具有基于视觉的触觉增强

Qianxi Hua, Xinyue Li, Zheng Yan, Yang Li, Chi Zhang, Yongyao Li, Yufei Liu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) School of Astronautics, Harbin Institute of Technology(航天学院,哈尔滨工程大学)

AI总结 本文提出VTouch++数据集,通过视觉触觉传感提供高保真的物理交互信号,采用矩阵式任务设计实现系统学习,并利用自动化数据采集管道确保可扩展性,通过跨模态检索和真实机器人评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20358 2026-04-23 cs.CV

ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval

ConeSep: 基于锥的鲁棒噪声-反学习组合网络用于组合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Mingyu Zhang, Zhiheng Fu, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文针对组合图像检索中噪声三元组对应问题,提出ConeSep网络,解决模态抑制、负锚缺乏和反学习反作用三大挑战,通过几何保真量化、负边界学习和边界基于的目标反学习方法,提升检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20313 2026-04-23 cs.LG cs.AI

Formalising the Logit Shift Induced by LoRA: A Technical Note

对LoRA引起的对数几率偏移进行形式化:技术说明

Xiang Shi, Shuaizhi Cheng, Mingwei Li

机构 * Imperial College London(帝国学院伦敦) Harbin Institute of Technology(哈尔滨工业大学) KigLand Machine Learning Lab(KigLand机器学习实验室)

AI总结 本文首次形式化LoRA引起的对数几率偏移及事实边际变化,通过一阶Fréchet近似证明多层LoRA效应可分解为层间贡献的线性求和及高阶余项。

Comments 7 pages, technical note

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20090 2026-04-23 cs.CL

Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework

少语言,少令牌:一种高效的统一逻辑跨语言推理框架

Chenyuan Zhang, Qiguang Chen, Xie Chen, Zhuotao Tian, Bowen Xing, Meishan Zhang, Libo Qin, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Central South University(中南大学) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University(贵州省教育厅Text Computing and Cognitive Intelligence工程研究中心,贵州大学) University of Science and Technology Beijing(北京科技大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出UL-XCoT框架,通过减少语言和令牌数量提升跨语言推理效率,实验证明在多语言任务中准确率高且令牌成本降低超50%。

Comments Accepted by ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19773 2026-04-23 cs.CL cs.AI

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models

PR-CAD:基于大语言模型的统一可控且忠实的文本到CAD生成的渐进式细化

Jiyuan An, Jiachen Zhao, Fan Chen, Liner Yang, Zhenghao Liu, Hongyan Wang, Weihua An, Meishan Zhang, Erhong Yang

机构 * School of Information Science, Beijing Language and Culture University, China(北京语言大学信息学院) School of Computer Science and Technology, Beijing Jiaotong University, China(北京交通大学计算机科学与技术学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), China(哈尔滨工业大学(深圳)计算机科学与技术学院)

AI总结 PR-CAD通过统一生成与编辑任务,提升文本到CAD生成的可控性和忠实性,采用高保真交互数据集和强化学习框架,实现设计创建与细化的一体化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19769 2026-04-23 cs.CL cs.AI cs.LG

TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference

TTKV:面向长上下文LLM推理的时序分层KV缓存

Gradwell Dzikanyanga, Weihao Yang, Hao Huang, Donglei Wu, Shihao Wang, Wen Xia, Sanjeeb K C

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Guangzhou University(广州大学)

AI总结 TTKV通过时序分层缓存框架优化KV存储,利用HBM和DRAM解耦快慢存储,根据时间接近性分配KV状态,减少跨层通信开销,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19749 2026-04-23 cs.AI cs.SE

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

工具过度使用错觉:为什么大语言模型更倾向于使用外部工具而非内部知识?

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology, SCIR(哈尔滨理工大学SCIR研究所) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 本文揭示大语言模型在推理中普遍存在工具过度使用现象,通过分析内部知识可用性区域,提出知识感知边界对齐策略,减少工具使用82.8%,并发现仅以结果奖励会鼓励工具过度使用,通过平衡奖励信号可减少66.7%的无用工具调用。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03323 2026-04-23 cs.CL

Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision

通过合成的分步监督增强代理文本图检索

Ge Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li, Yunxin Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Peking University(北京大学) School of Information, Renmin University of China(中国人民大学信息学院) Harbin Institute of Technology(哈尔滨工业大学) North China Electric Power University(华北电力大学) GDS Holdings Limited(GDS控股有限公司)

AI总结 本文提出一种基于LLM的文本图检索框架,通过合成分步监督优化检索过程,提升复杂图基问答任务的准确性和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20208 2026-04-23 cs.LG cs.AI

Unlock the Potential of Large Language Models for Predictive Tabular Tasks in Data Science with Table-Specific Pretraining

解锁大型语言模型在数据科学中预测表格任务的潜力:通过表格特定预训练

Yazheng Yang, Yuqi Wang, Yaxuan Li, Sankalok Sen, Lei Li, Lin Qiu, Qi Liu

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Information Systems and Management Engineering, Southern University of Science and Technology(南方科技大学信息 systems 和管理工程系)

AI总结 本文通过表格特定预训练方法提升LLM在表格预测任务中的表现,验证了定制化训练对提升表格智能的有效性。

Comments 10 pages; Accepted by TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20806 2026-04-23 cs.CV cs.AI cs.CL

OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试

Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) Guizhou University(贵州大学)

AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20748 2026-04-23 cs.CV

Amodal SAM: A Unified Amodal Segmentation Framework with Generalization

多模态SAM:一种统一的多模态分割框架与泛化能力

Bo Zhang, Zhuotao Tian, Xin Tao, Songlin Tang, Jun Yu, Wenjie Pei

机构 * Department of Computer Science, Harbin Institute of Technology at Shenzhen(哈尔滨工业大学(深圳)计算机科学部) Kuaishou Technology(快手科技)

AI总结 本文提出Amodal SAM,一种结合SAM模型的多模态分割框架,通过轻量级空间完成适配器、目标感知遮挡合成和新学习目标,实现多模态分割的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏