arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 1439
2602.08024 2026-02-10 cs.CV cs.AI cs.CL cs.LG

FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging

FlashVID: 通过无训练树状时空标记合并实现高效的视频大语言模型

Ziyang Fan, Keyu Chen, Ruilong Xing, Yulin Li, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 FlashVID通过无训练的树状时空标记合并技术,在保留99.1%性能的情况下将视频帧输入提升10倍,实现高效视频大语言模型加速。

Comments Accepted by ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08005 2026-02-10 cs.CL cs.AI

DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity

DeltaKV: 基于残差的KV缓存压缩 via 长距离相似性

Jitai Hao, Qiang Huang, Yaowei Wang, Min Zhang, Jun Yu

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 DeltaKV通过残差编码减少KV缓存内存,提升长上下文LLM的部署效率。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07848 2026-02-10 cs.LG

MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation

MARTI-MARS$^2$:通过强化学习实现多智能体自搜索的扩展用于代码生成

Shijie Wang, Pengfei Li, Yikun Fu, Kaifeng Liu, Fangyuan Li, Yang Liu, Xiaowei Sun, Zonglin Li, Siyao Zhao, Jian Zhao, Kai Tian, Dong Li, Junqi Gao, Yutong Zhang, Yiqun Chen, Yuqiang Li, Zoe Li, Weinan Zhang, Peng Ye, Shuyue Hu, Lei Bai, Bowen Zhou, Kaiyan Zhang, Biqing Qi

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Institute of Automation(自动化研究所) Fudan University(复旦大学) High School Affiliated to Fudan University(复旦大学附属高中) Renmin University of China(中国人民大学) University of Washington(华盛顿大学)

AI总结 MARTI-MARS2通过多智能体强化学习实现代码生成的扩展,突破单智能体限制,提升性能和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08390 2026-02-10 cs.AI

On Reasoning Strength Planning in Large Reasoning Models

在大推理模型中关于推理强度规划的研究

Leheng Sheng, An Zhang, Zijian Wu, Weixiang Zhao, Changshuo Shen, Yi Zhang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本研究揭示了大推理模型通过预先分配方向向量来规划推理强度,为控制其推理行为提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07022 2026-02-10 cs.LG cs.AI cs.CR

AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint

AlphaSteer: 通过原理性零空间约束学习拒绝引导

Leheng Sheng, Changshuo Shen, Weixiang Zhao, Junfeng Fang, Xiaohao Liu, Zhenkai Liang, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 AlphaSteer 通过原理性零空间约束学习拒绝引导,提升大语言模型的安全性与效用平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06994 2026-02-10 q-bio.NC cs.AI cs.CV

SurfAge-Net: A Hierarchical Surface-Based Network for Interpretable Fine-Grained Brain Age Prediction

SurfAge-Net:一种基于层次表面的网络用于可解释的细粒度脑年龄预测

Rongzhao He, Dalin Zhu, Ying Wang, Songhong Yue, Leilei Zhao, Yu Fu, Dan Wu, Bin Hu, Weihao Zheng

机构 * Gansu Provincial Key Laboratory of Wearable Computing, School of Information Science and Engineering, Lanzhou University(甘肃省可穿戴计算重点实验室,信息科学与工程学院,兰州大学) Department of Medical Imaging Center, Gansu Provincial Maternity and Child-Care Hospital(医学影像中心,甘肃省妇幼保健院) Department of Magnetic Resonance, Lanzhou University Second Hospital(磁共振科,兰州大学第二医院) Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术系,哈尔滨工业大学(深圳)) Key Laboratory for Biomedical Engineering of Ministry of Education, Department of Biomedical Engineering, College of Biomedical Engineering & Instrument Science, Zhejiang University(教育部生物医学工程重点实验室,生物医学工程学院,浙江大学)

AI总结 SurfAge-Net通过结合皮层组织的连接组原理,提出了一种基于层次表面的网络,用于可解释的细粒度脑年龄预测,有效识别异常发育人群中的异质延迟和区域特定异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06820 2026-02-09 cs.AI

ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training

ScaleEnv: 从零开始构建通用交互工具使用智能体训练的环境合成

Dunwei Tu, Hongyan Hao, Hansi Yang, Yihao Chen, Yi-Kai Zhang, Zhikang Xia, Yu Yang, Yueqing Sun, Xingchen Liu, Furao Shen, Qi Gu, Hui Su, Xunliang Cai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,中国南京) Institute of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), Shenzhen, China(计算机科学与技术学院,哈尔滨工业大学(深圳),中国深圳) School of Statistics, East China Normal University, Shanghai, China(统计学学院,华东师范大学,中国上海)

AI总结 ScaleEnv通过从零构建交互式环境和可验证任务,提升通用智能体在多领域工具使用任务中的泛化能力与学习鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06445 2026-02-09 cs.RO

ECO: Energy-Constrained Optimization with Reinforcement Learning for Humanoid Walking

ECO:基于强化学习的人形机器人能量受限优化

Weidong Huang, Jingwen Zhang, Jiongye Li, Shibowen Zhang, Jiayang Wu, Jiayi Wang, Hangxin Liu, Yaodong Yang, Yao Su

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院(BIGAI)) Department of Automation, Tsinghua University(自动化系,清华大学) Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) Department of Computer Science, Harbin Institute of Technology(计算机科学系,哈尔滨工业大学) Institute for Artificial Intelligence and School of Artificial Intelligence, Peking University(人工智能研究院和人工智能学院,北京大学)

AI总结 ECO通过将能量指标作为约束而非奖励,提升人形机器人行走的能效与稳定性。

Comments IEEE TRANSACTIONS ON AUTOMATION SCIENCE AND ENGINEERING. PREPRINT VERSION. ACCEPTED FEB, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06373 2026-02-09 cs.CL

ReBeCA: Unveiling Interpretable Behavior Hierarchy behind the Iterative Self-Reflection of Language Models with Causal Analysis

ReBeCA: 通过因果分析揭示语言模型迭代自我反思背后的可解释行为层级

Tianqiang Yan, Sihan Shang, Yuheng Li, Song Qiu, Hao Peng, Wenjian Luo, Jue Xie, Lizhen Qu, Yuan Gao

机构 * Monash University(莫纳什大学) Harbin Institute of Technology(哈尔滨工业大学) Hainan University(海南大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ReBeCA通过因果分析揭示语言模型自我反思中的可解释行为层级,识别因果关系以提升自我反思效果。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18226 2026-02-09 cs.AI

Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks

yunjue代理技术报告:一种完全可重现、零起点现场自我进化代理系统用于开放性任务

Haotian Li, Shijun Yang, Weizhen Qi, Silei Zhao, Rui Hua, Mingzhu Song, Xiaojian Yang, Chao Peng

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

AI总结 Yunjue代理系统通过现场自我进化范式实现零起点环境下开放性任务的可重现、自适应能力扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00734 2026-02-09 eess.SP cs.AI cs.LG

EEG-MACS: Manifold Attention and Confidence Stratification for EEG-based Cross-Center Brain Disease Diagnosis under Unreliable Annotations

EEG-MACS: 用于基于EEG的跨中心脑部疾病诊断的流形注意力与置信度分层

Zhenxi Song, Ruihan Qin, Huixia Ren, Zhen Liang, Yi Guo, Min Zhang, Zhiguo Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen People's Hospital(深圳人民医院) Shenzhen University(深圳大学) Shenzhen Bay Laboratory(深圳湾实验室)

AI总结 EEG-MACS通过流形注意力与置信度分层技术,提升跨中心脑部疾病诊断的准确性与鲁棒性。

Comments 15 pages, 9 figures. Oral presentation at ACM MM 2024

Journal ref In Proceedings of the 32nd ACM International Conference on Multimedia (ACM MM '24), pp. 340-349, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05577 2026-02-06 cs.CV

LocateEdit-Bench: A Benchmark for Instruction-Based Editing Localization

LocateEdit-Bench:基于指令的编辑本地化基准测试

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) School of EEECS, Queen's University Belfast, Northern Ireland, UK(女王大学 Belfast 电子工程与计算机科学学院) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peking University, Beijing, China(北京大学)

AI总结 LocateEdit-Bench是一个针对基于指令的编辑本地化问题设计的大规模数据集,整合了四种先进编辑模型,用于评估和推动伪造本地化方法的发展。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01999 2026-02-06 cs.CL

From Latent Signals to Reflection Behavior: Tracing Meta-Cognitive Activation Trajectory in R1-Style LLMs

从潜在信号到反射行为:在R1风格大语言模型中追踪元认知激活轨迹

Yanrui Du, Yibo Gao, Sendong Zhao, Jiayun Li, Haochun Wang, Qika Lin, Kai He, Bing Qin, Mengling Feng

机构 * SCIR Lab, Harbin Institute of Technology(哈尔滨工业大学SCIR实验室) National University of Singapore(新加坡国立大学)

AI总结 研究通过分析R1风格大语言模型中反思行为的激活轨迹,揭示了元认知过程从潜在监控到话语调节再到自我反思的阶段性特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02579 2026-02-06 cs.OS cs.AI

ProphetKV: User-Query-Driven Selective Recomputation for Efficient KV Cache Reuse in Retrieval-Augmented Generation

ProphetKV: 基于用户查询的 selective recompute 方法用于高效 KV 缓存重用

Shihao Wang, Jiahao Chen, Yanqi Pan, Hao Huang, Yichen Hao, Xiangyu Zou, Wen Xia, Wentao Zhang, Chongyang Qiu, Pengfei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Beijing Yanrong Technology Co., Ltd.(北京燕龙科技有限公司)

AI总结 ProphetKV通过用户查询驱动的KV缓存重用方法,高效恢复交叉注意力,提升检索增强生成的推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04541 2026-02-05 cs.CL cs.AI

LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding

LycheeDecode: 通过混合头稀疏解码加速长上下文LLM推理

Gang Lin, Dongfang Li, Zhuoen Chen, Yukun Shi, Xuhui Chen, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

AI总结 LycheeDecode通过混合头稀疏解码方法,实现长上下文LLM推理的高效与高质量

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04486 2026-02-05 cs.CL

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03305 2026-02-05 cs.LG

medR: Reward Engineering for Clinical Offline Reinforcement Learning via Tri-Drive Potential Functions

medR:通过三驱动势函数实现临床离线强化学习中的奖励工程

Qianyi Xu, Gousia Habib, Feng Wu, Yanrui Du, Zhihui Chen, Swapnil Mishra, Dilruk Perera, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) University of Helsinki(赫尔辛基大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 medR通过三驱动势函数实现临床离线强化学习中的自动化奖励设计,提升策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16793 2026-02-05 cs.RO

PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence

PhysBrain: 人眼视角数据作为视觉语言模型到物理智能的桥梁

Xiaopeng Lin, Shijie Lian, Bin Yu, Ruoqi Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Yurun Jin, Yukun Shi, Jiyan He, Cong Huang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 PhysBrain通过将人类眼动视频转化为多级具身监督,提升机器人在眼动感知和长期规划中的能力,实现从人类视角到机器人控制的有效迁移。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04725 2026-02-05 cs.CV

Consistent Supervised-Unsupervised Alignment for Generalized Category Discovery

一致的监督-无监督对齐用于通用类别发现

Jizhou Han, Shaokun Wang, Yuhang He, Chenhao Ding, Qiang Wang, Xinyuan Gao, SongLin Dong, Yihong Gong

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究院、西安交通大学) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(计算机科学与技术学院、哈尔滨工业大学深圳校区) School of Software Engineering, Xi’an Jiaotong University(软件工程学院、西安交通大学) Kuaishou Technology(快手科技) Faculty of Microelectronics, Shenzhen University of Advanced Technology(微电子学院、深圳先进技术大学)

AI总结 本文提出NC-GCD框架,通过预分配ETF原型和引入一致ETF对齐损失,提升通用类别发现任务中新类别识别的性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04346 2026-02-05 cs.LG

MirrorLA: Reflecting Feature Map for Vision Linear Attention

MirrorLA: 用于视觉线性注意力的特征图反射

Weikang Meng, Liangyu Huo, Yadan Luo, Yaowei Wang, Yingjian Li, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院) Pengcheng Laboratory(鹏城实验室) UQMM Lab, University of Queensland(UQMM实验室,昆士兰大学)

AI总结 MirrorLA通过几何框架和可学习反射实现线性注意力的非负特征图重定向,提升性能并保持表示忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04256 2026-02-05 cs.RO cs.AI

AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models

AppleVLM: 端到端自主驾驶与高级感知和规划增强的视觉语言模型

Yuxuan Han, Kunyuan Wu, Qianyi Shao, Renxiang Xiao, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu, Yunjiang Lou

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制系统与现代自动化装备重点实验室) Guangdong Provincial Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与适应机器人省重点实验室) School of Intelligence Science and Engineering(智能科学与工程学院) Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室) Autonomous Driving Center(自动驾驶中心) Shanghai Utopilot Technology Co.Ltd.(上海驭目科技有限公司)

AI总结 AppleVLM通过引入先进的视觉和规划编码器,提升端到端自动驾驶的感知和决策能力,实现复杂环境下的稳健驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20977 2026-02-05 cs.CL

Evaluating and Steering Modality Preferences in Multimodal Large Language Model

评估和引导多模态大语言模型中的模态偏好

Yu Zhang, Jinlong Ma, Yongshuai Hou, Xuefeng Bai, Kehai Chen, Yang Xiang, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。

Comments Modality Preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03815 2026-02-04 cs.CV cs.LG

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

通过视觉标记修剪实现多模态大语言模型的快慢高效训练

Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

AI总结 DualSpeed通过快慢双模式实现多模态大语言模型的高效训练,提升训练速度并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23440 2026-02-04 cs.AI

Self-Foveate: Enhancing Diversity and Difficulty of Synthesized Instructions from Unsupervised Text via Multi-Level Foveation

自聚焦:通过多级聚焦从无监督文本中增强合成指令的多样性和难度

Mingzhe Li, Xin Lu, Yanyan Zhao

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 Self-Foveate通过多级聚焦方法提升无监督文本合成指令的多样性和难度,采用细粒度到整体模式的提取策略,并结合重合成模块提高指令质量。

Comments Accepted to ACL 2025 (Findings). 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03156 2026-02-04 cs.CV cs.LG

Fully Kolmogorov-Arnold Deep Model in Medical Image Segmentation

全 Kolmogorov-Arnold 深度模型在医学图像分割中的应用

Xingyu Qiu, Xinghua Ma, Dong Liang, Gongning Luo, Wei Wang, Kuanquan Wang, Shuo Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Case Western Reserve University(凯斯西储大学)

AI总结 本文提出全 Kolmogorov-Arnold 深度模型,通过改进 KAN 层和减少内存消耗,实现医学图像分割的高精度与高效性。

Comments 11 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02453 2026-02-04 cs.AI

Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling

用漫画思考:通过结构化视觉叙事增强多模态推理

Andong Chen, Wenxin Zhu, Qiuyu Ding, Yuchen Song, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出用漫画作为中间视觉表示,通过结构化视觉叙事提升多模态推理效率和性能。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01709 2026-02-04 cs.CL

ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation

ARTIS: 通过迭代模拟实现代理风险感知的测试时间扩展

Xingshan Zeng, Lingzhi Wang, Weiwen Liu, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

AI总结 ARTIS通过迭代模拟提升代理在高风险环境中的可靠性和鲁棒性,采用风险感知的模拟器改进决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21984 2026-02-04 cs.CV cs.CL

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

超越视觉编码器:识别和缓解大视觉-语言模型中的空间偏差

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

AI总结 本文提出AGCI机制,通过动态注入全局视觉上下文缓解大视觉-语言模型中的空间偏差问题,提升模型的空间鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02195 2026-02-03 cs.LG cs.AI

State Rank Dynamics in Linear Attention LLMs

线性注意力大语言模型中的状态排名动态

Ao Sun, Hongtao Zhang, Heng Zhou, Yixuan Ma, Yiran Qin, Tongrui Su, Yan Liu, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Chinese Academy of Sciences(中国科学院大学) CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) University of Oxford(牛津大学) Tsinghua University(清华大学)

AI总结 本研究揭示了线性注意力模型中状态排名分层现象,提出联合秩-范数剪枝策略,有效降低KV缓存开销并维持模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏