Video-ToC: Video Tree-of-Cue Reasoning
Video-ToC: 视频树状提示推理
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 Video-ToC通过树状提示推理框架提升视频理解,引入三创新:树引导视觉提示定位、需求驱动奖励机制和自动化标注流程,验证其在视频理解与幻觉检测中的优越性。
高校专区
Video-ToC: 视频树状提示推理
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 Video-ToC通过树状提示推理框架提升视频理解,引入三创新:树引导视觉提示定位、需求驱动奖励机制和自动化标注流程,验证其在视频理解与幻觉检测中的优越性。
VTouch++:一个用于双臂操作的多模态数据集,具有基于视觉的触觉增强
机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) ; Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) ; School of Astronautics, Harbin Institute of Technology(航天学院,哈尔滨工程大学)
AI总结 本文提出VTouch++数据集,通过视觉触觉传感提供高保真的物理交互信号,采用矩阵式任务设计实现系统学习,并利用自动化数据采集管道确保可扩展性,通过跨模态检索和真实机器人评估验证其有效性。
ConeSep: 基于锥的鲁棒噪声-反学习组合网络用于组合图像检索
机构 * Shandong University(山东大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
AI总结 本文针对组合图像检索中噪声三元组对应问题,提出ConeSep网络,解决模态抑制、负锚缺乏和反学习反作用三大挑战,通过几何保真量化、负边界学习和边界基于的目标反学习方法,提升检索性能。
Comments Accepted by CVPR 2026
对LoRA引起的对数几率偏移进行形式化:技术说明
机构 * Imperial College London(帝国学院伦敦) ; Harbin Institute of Technology(哈尔滨工业大学) ; KigLand Machine Learning Lab(KigLand机器学习实验室)
AI总结 本文首次形式化LoRA引起的对数几率偏移及事实边际变化,通过一阶Fréchet近似证明多层LoRA效应可分解为层间贡献的线性求和及高阶余项。
Comments 7 pages, technical note
少语言,少令牌:一种高效的统一逻辑跨语言推理框架
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Central South University(中南大学) ; Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University(贵州省教育厅Text Computing and Cognitive Intelligence工程研究中心,贵州大学) ; University of Science and Technology Beijing(北京科技大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出UL-XCoT框架,通过减少语言和令牌数量提升跨语言推理效率,实验证明在多语言任务中准确率高且令牌成本降低超50%。
Comments Accepted by ACL2026 Main
PR-CAD:基于大语言模型的统一可控且忠实的文本到CAD生成的渐进式细化
机构 * School of Information Science, Beijing Language and Culture University, China(北京语言大学信息学院) ; School of Computer Science and Technology, Beijing Jiaotong University, China(北京交通大学计算机科学与技术学院) ; School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) ; School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), China(哈尔滨工业大学(深圳)计算机科学与技术学院)
AI总结 PR-CAD通过统一生成与编辑任务,提升文本到CAD生成的可控性和忠实性,采用高保真交互数据集和强化学习框架,实现设计创建与细化的一体化解决方案。
TTKV:面向长上下文LLM推理的时序分层KV缓存
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Guangzhou University(广州大学)
AI总结 TTKV通过时序分层缓存框架优化KV存储,利用HBM和DRAM解耦快慢存储,根据时间接近性分配KV状态,减少跨层通信开销,提升推理效率。
工具过度使用错觉:为什么大语言模型更倾向于使用外部工具而非内部知识?
机构 * Harbin Institute of Technology, SCIR(哈尔滨理工大学SCIR研究所) ; Peking University(北京大学) ; Huawei Technologies Co., Ltd(华为技术有限公司)
AI总结 本文揭示大语言模型在推理中普遍存在工具过度使用现象,通过分析内部知识可用性区域,提出知识感知边界对齐策略,减少工具使用82.8%,并发现仅以结果奖励会鼓励工具过度使用,通过平衡奖励信号可减少66.7%的无用工具调用。
Comments 17 pages, 9 figures
通过合成的分步监督增强代理文本图检索
机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) ; Peking University(北京大学) ; School of Information, Renmin University of China(中国人民大学信息学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; North China Electric Power University(华北电力大学) ; GDS Holdings Limited(GDS控股有限公司)
AI总结 本文提出一种基于LLM的文本图检索框架,通过合成分步监督优化检索过程,提升复杂图基问答任务的准确性和F1分数。
解锁大型语言模型在数据科学中预测表格任务的潜力:通过表格特定预训练
机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; Department of Information Systems and Management Engineering, Southern University of Science and Technology(南方科技大学信息 systems 和管理工程系)
AI总结 本文通过表格特定预训练方法提升LLM在表格预测任务中的表现,验证了定制化训练对提升表格智能的有效性。
Comments 10 pages; Accepted by TKDE
OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试
机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Central South University(中南大学) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) ; Guizhou University(贵州大学)
AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。
Comments ACL 2026 Camera Ready
多模态SAM:一种统一的多模态分割框架与泛化能力
机构 * Department of Computer Science, Harbin Institute of Technology at Shenzhen(哈尔滨工业大学(深圳)计算机科学部) ; Kuaishou Technology(快手科技)
AI总结 本文提出Amodal SAM,一种结合SAM模型的多模态分割框架,通过轻量级空间完成适配器、目标感知遮挡合成和新学习目标,实现多模态分割的泛化能力。