arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-04-21 至 2026-04-21 共收录 33
2503.14324 2026-04-21 cs.CV cs.CL

DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

DualToken: 向通过双视觉词汇统一视觉理解和生成迈进

Wei Song, Yuran Wang, Zijia Song, Yadong Li, Zenan Zhou, Long Chen, Jianhua Xu, Jiaqi Wang, Kaicheng Yu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Baichuan Inc.(北川科技) Peking University(北京大学) Xiaomi EV(小米电动车)

AI总结 DualToken通过双视觉词汇统一视觉理解和生成,解决了视觉理解和生成所需不同表示空间的挑战,提升了ImageNet上的重建质量和零样本准确率,并在下游任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18313 2026-04-21 cs.CV

Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection

去噪与对齐:基于扩散的前景知识提示用于开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Jinchao Zhang, Cong Wang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Beijing China Institute of Information Engineering, Chinese Academy of Sciences Beijing China Hangzhou Dianzi University Hangzhou China Institute of Information Engineering, Chinese Academy of Sciences\ Key Laboratory of Cyberspace Security Defense Beijing China Engineering, Zhejiang University Hangzhou China Institute of Information Engineering, Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Beijing China Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Institute of Information Engineering, Chinese Academy of Sciences Hangzhou Dianzi University Institute of Information Engineering, Chinese Academy of Sciences\ Key Laboratory of Cyberspace Security Defense Engineering, Zhejiang University Institute of Information Engineering, Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense

AI总结 本文提出DFAlign框架,通过扩散去噪生成前景知识,解决开放词汇时序动作检测中语义不平衡问题,提升动作相关片段的判别性。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11789 2026-04-21 cs.CV

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

LMMs 与以物体为中心的视觉:理解、分割、编辑和生成

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 本文探讨了LMMs与以物体为中心的视觉结合,总结了在理解、分割、编辑和生成方面的新进展,提出了开放挑战和未来方向。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11698 2026-04-21 cs.LG

SpiralFormer: Looped Transformers Can Learn Hierarchical Dependencies via Multi-Resolution Recursion

SpiralFormer:通过多分辨率递归学习层次依赖的循环Transformer

Chengting Yu, Xiaobo Shu, Yadao Wang, Yizhen Zhang, Haoyi Wu, You Wu, Rujiao Long, Ziheng Chen, Yuchi Xu, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) ShanghaiTech University(上海科技大学)

AI总结 SpiralFormer通过多分辨率递归机制提升循环Transformer的参数和计算效率,实验证明其在不同模型规模下均优于传统递归和非递归基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04740 2026-04-21 cs.CL cs.AI

StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation

StealthGraph:通过知识图谱引导的有害提示生成暴露领域特定风险

Huawei Zheng, Xinqi Jiang, Sen Yang, Shouling Ji, Yingcai Wu, Dazhen Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

AI总结 本文提出StealthGraph框架,通过知识图谱生成领域相关的隐式有害提示,解决领域知识转化为约束和提升提示隐式的挑战,推动LLM安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14582 2026-04-21 cs.CV

OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

OmniZip:面向快速多模态大语言模型的音频引导动态令牌压缩

Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出OmniZip,一种无需训练的音频引导多模态令牌压缩框架,通过动态压缩音频视频令牌提升推理速度和内存效率,保持模型性能。

Comments [CVPR 2026] Code Link: https://github.com/KD-TAO/OmniZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07739 2026-04-21 cs.LG cs.AI

MeSH: Memory-as-State-Highways for Recursive Transformers

MeSH: 递归变换器的记忆作为状态高速公路

Chengting Yu, Xiaobo Shu, Yadao Wang, Yizhen Zhang, Haoyi Wu, Jiaang Li, Rujiao Long, Ziheng Chen, Yuchi Xu, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出MeSH方案,通过外部化状态管理与轻量级路由解决递归变换器中的计算同质化和信息过载问题,提升模型性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07160 2026-04-21 cs.CL

GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization

GeometryZero:通过群体对比策略优化推进几何求解

Yikun Wang, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出GeometryZero,通过群体对比策略优化训练小型模型,实现高效的几何推理,实验表明其在Geometry3K和MathVista上优于RL基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17753 2026-04-21 cs.AI cs.CL cs.CV

Evolutionary Negative Module Pruning for Better LoRA Merging

进化式负模块剪枝以提升LoRA融合

Anda Cao, Zhuo Gou, Yi Wang, Kaixuan Chen, Yu Wang, Can Wang, Mingli Song, Jie Song

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文提出ENMP方法,通过进化搜索策略识别并排除LoRA融合中的负模块,提升多任务部署效率。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17543 2026-04-21 cs.CL

PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs

PoliLegalLM:政治与法律领域大型语言模型的技术报告

Yuting Huang, Yinghao Hu, Qian Xiao, Wenlin Zhong, Yiquan Wu, Taishi Zhou, Moke Chen, Changlong Sun, Kun Kuang, Fei Wu

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Zhengfa Xinxi Guanli Zhongxin(浙江正法信息警务中心)

AI总结 本文提出PoliLegalLM,通过统一训练框架提升法律知识和推理能力,针对法律领域挑战实现高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17503 2026-04-21 cs.AI cs.MA

SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology

SkillGraph: 基于多模态图拓扑的自进化多智能体协作

Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore, Singapore(新加坡国立大学) Technical University of Munich, Munich, Germany(慕尼黑技术大学) Zhejiang University, China(浙江大学)

AI总结 SkillGraph通过联合进化智能体能力与通信拓扑,解决视觉多智能体系统中固定拓扑和静态推理能力的问题,提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17477 2026-04-21 cs.CV cs.LG

Unveiling Deepfakes: A Frequency-Aware Triple Branch Network for Deepfake Detection

揭开深度伪造:一种频率感知的三分支网络用于深度伪造检测

Qihao Shen, Jiaxing Xuan, Zhenguang Liu, Sifan Wu, Yutong Xie, Zhaoyan Ming, Yingying Jiao, kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) State Grid Blockchain Technology (Beijing) Co., Ltd.(国家电网区块链技术(北京)有限公司) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Hangzhou City University(杭州城市学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

AI总结 本文提出一种三分支网络,通过学习原始图像和不同频率通道重建图像的特征,结合频率特征分析,提升深度伪造检测的鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04804 2026-04-21 cs.CL cs.AI cs.IR cs.LG cs.MA

SkillX: Automatically Constructing Skill Knowledge Bases for Agents

SkillX: 为智能体自动构建技能知识库

Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng

机构 * Zhejiang University(浙江大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

AI总结 SkillX通过多级技能设计、迭代技能精炼和探索性技能扩展,构建可复用的技能知识库,提升智能体在长周期任务中的表现和泛化能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15724 2026-04-21 cs.CV cs.AI

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning

VideoThinker:构建具有LLM引导工具推理的智能视频大语言模型

Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

AI总结 VideoThinker通过合成工具交互轨迹构建大规模视频与工具推理数据集,提升长视频理解能力,优于传统语言模型和视频模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08276 2026-04-21 cs.AI

ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent Web

ACE-Router: 从MCP工具到智能体网络的历史感知路由泛化

Zhiyuan Yao, Zishan Xu, Yifu Guo, Zhiguang Han, Cheng Yang, Shuo Zhang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co. Ltd(华为技术有限公司) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 本文提出ACE-Router,通过依赖丰富的候选图合成多轮轨迹,训练出动态上下文理解的路由器,实现在大规模生态系统中的精准导航,实验显示其在MCP-Universe和MCP-Mark基准上表现优异,具备泛化性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03632 2026-04-21 eess.AS cs.AI cs.SD

ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis

ReStyle-TTS:零样本语音合成中的相对和连续风格控制

Haitao Li, Chunxiang Jin, Chenglin Li, Wenhao Guan, Zhengxing Huang, Xie Chen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 ReStyle-TTS通过Decoupled Classifier-Free Guidance和LoRAs实现连续且参考相关的风格控制,提升零样本语音合成的风格适应性与鲁棒性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17795 2026-04-21 cs.CL cs.AI cs.LG cs.MA cs.SE

What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations

什么使AI研究可重复?可执行知识图谱作为科学知识表示

Yujie Luo, Zhuoyun Yu, Xuehai Wang, Yuqi Zhu, Ningyu Zhang, Lanning Wei, Lun Du, Da Zheng, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

AI总结 本文提出可执行知识图谱(xKG),通过整合文献中的代码片段和技术洞察,提升AI研究的可重复性,实验显示其在PaperBench上性能提升显著。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11612 2026-04-21 cs.LG

Topology Structure Optimization of Reservoirs Using GLMY Homology

使用GLMY同调的 reservoirs 拓扑结构优化

Yu Chen, Shengwei Wang, Hongwei Lin

机构 * School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院) Polytechnic Institute of Zhejiang University(浙江大学 polytechnic 院)

AI总结 本文利用持久GLMY同调理论研究reservoirs拓扑结构,提出优化方法以提升性能,发现一维GLMY同调群与性能密切相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11184 2026-04-21 cs.CL

Tailoring Diagnostic Modeling to Individual Learners: Personalized Distractor Generation via MCTS-Guided Reasoning Reconstruction

为个体学习者定制诊断建模:通过MCTS引导的推理重构实现个性化干扰项生成

Tao Wu, Jingyuan Chen, Wang Lin, Jian Zhan, Mengze Li, Fangzhou Jin, Min Zhang, Kun Kuang, Fei Wu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

AI总结 本文提出基于MCTS引导的推理重构方法,通过学生历史答题错误生成个性化干扰项,提升诊断效果,实验表明其在生成合理干扰项和适应群体设置方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01330 2026-04-21 cs.AI

NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks

NaturalGAIA:一个可验证的基准和分层框架用于长周期GUI任务

Zihan Zheng, Tianle Cui, Taoran Wang, Fengtao Wang, Jiahui Pan, Lewei He, Qianglong Chen

机构 * South China Normal University(华南师范大学) Zhejiang University(浙江大学)

AI总结 本文提出NaturalGAIA,通过真实人类GUI交互意图构建可验证评估数据集,结合LightManus-Jarvis框架,实现复杂自然任务的宏规划与微执行,实验显示其在路径成功率、token消耗和执行时间上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11338 2026-04-21 cs.AI cs.LG

Automatic Dataset Construction (ADC): Sample Collection, Data Curation, and Beyond

自动数据集构建(ADC):样本收集、数据整理与更广泛的领域

Minghao Liu, Zonglin Di, Jiaheng Wei, Zhongruo Wang, Hengxiang Zhang, Ruixuan Xiao, Haoyu Wang, Jinlong Pang, Hao Chen, Ankit Shah, Hongxin Wei, Xinlei He, Zhaowei Zhao, Haobo Wang, Lei Feng, Jindong Wang, James Davis, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Amazon(亚马逊) SUSTech(华南理工大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) HKUST (GZ)(香港科技大学) Nanyang Technological University(南洋理工大学) Microsoft(微软)

AI总结 本文提出自动数据集构建方法ADC,通过LLM实现高效数据集生成,减少人工标注成本,构建包含12个主类和12000个细粒度子类的Clothing-ADC数据集,降低标签噪声至10.7%,并设计三个针对标签噪声和类别不平衡的基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13004 2026-04-21 cs.CE cs.AI

A Unified Framework for Modeling Heterogeneous Financial Data via Dual-Granularity Prompting

通过双粒度提示构建异质金融数据建模的统一框架

Yu Lei, Zixuan Wang, Yiqing Feng, Junru Zhang, Yahui Li, Chu Liu, Tongyao Wang, Dongyang Li

机构 * DiDi International Business Group(滴滴国际商务集团) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

AI总结 本文提出FinLangNet框架,通过双模块架构结合表格特征提取与时间序列建模,解决工业信用评分中异质金融数据复杂性和信用worthiness演变的挑战,实验证明其在KS指标和坏账率上有显著提升。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17082 2026-04-21 cs.CV

D-Prism: Differentiable Primitives for Structured Dynamic Modeling

D-Prism:用于结构动态建模的可微原始体

Xingyuan Yu, Yijin Li, Chong Zeng, Yuhang Ming, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Stanford University(斯坦福大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 本文提出D-Prism框架,通过扩展可微原始体到动态领域,实现高保真的结构动态建模,结合3DGS和原始体的优势,引入变形网络和自适应控制策略,提升结构动态建模的精度和效率。

Comments Accepted to CVPR 2026. Project page: https://zju3dv.github.io/d-prism/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16972 2026-04-21 cs.AI

MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models

MCPO:面向大推理模型的 mastery-consolidated 策略优化

Zhaokang Liao, Yingguo Gao, Yi Yang, Yongheng Hu, Jingting Ding

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 本文提出 MCPO 算法,通过引入 hinge-KL 正则化和优先机制,解决高准确度提示下的策略漂移和巩固问题,提升大模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16959 2026-04-21 cs.LG cs.CV

Hyperbolic Enhanced Representation Learning for Incomplete Multi-view Clustering

双曲增强表示学习用于不完整多视图聚类

Tianyi Chen, Haobo Wang, Kai Tang, Gengyu Lyu, Tianlei Hu, Gang Chen, Hong Ma, Meixiang Xiang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Beijing Key Laboratory of Traffic Data Analysis and Mining, Beijing Jiaotong University(北京交通大学交通数据挖掘与分析重点实验室) School of Medicine, Zhejiang University(浙江大学医学院)

AI总结 本文提出HERL框架,通过双曲空间中的结构感知潜在空间,解决不完整多视图聚类中表示学习的语义模糊问题,通过角度和距离损失提升聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16493 2026-04-21 cs.DB cs.AI cs.CL cs.LG

NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions

NL2SQLBench: 一个模块化评估和基准测试框架,用于LLM驱动的NL2SQL解决方案

Shizheng Hou, Wenqi Pei, Nuo Chen, Quang-Trung Ta, Peng Lu, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 本文提出NL2SQLBench框架,用于评估LLM驱动的NL2SQL方法,通过三个核心模块分析现有策略并提出新指标,评估十种开源方法,揭示现有方法的准确性和效率问题,为未来创新提供指导。

Comments The paper is accepted by VLDB 2026

Journal ref PVLDB, 19(5): 1001 - 1015, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19857 2026-04-21 cs.SD cs.CV

FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts

FoleyDirector: 通过结构化脚本实现视频到音频生成的细粒度时间控制

You Li, Dewei Zhou, Fan Ma, Fu Li, Dongliang He, Yi Yang

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能State Key Lab) ReLER, CCAl, Zhejiang University(浙江大学ReLER, CCAl) Intelligent Creation, ByteDance, China(字节跳动智能创作)

AI总结 本文提出FoleyDirector框架,通过结构化时间脚本提升视频到音频生成的细粒度时间控制能力,同时保持音频质量并支持无缝切换生成与受控合成。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13684 2026-04-21 cs.CL cs.AI

HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference

HeteroCache:一种用于长上下文LLM推理的异构KV缓存压缩动态检索方法

Zhiyuan Shi, Qibo Qiu, Feng Xue, Zhonglin Jiang, Li Yu, Jian Jiang, Xiaofei He, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Geely Automobile Research Institute (Ningbo) Co., Ltd.(吉利汽车研究院(宁波)有限公司) FABU Inc.(FABU公司)

AI总结 本文提出HeteroCache,通过动态检索方法解决KV缓存压缩问题,利用头部异质性和空间冗余性,实现高效缓存分配和存储机制,提升长上下文推理性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14410 2026-04-21 cs.AI

ORThought: Benchmarking and Automating Logistics Optimization Modeling

ORThought: 物流优化建模的基准测试与自动化

Beinuo Yang, Qishen Zhou, Junyi Li, Chenxing Su, Panagiotis Angeloudis, Simon Hu

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学浙大-伊利诺伊大学联合学院) School of Transportation, Jilin University(吉林大学交通运输学院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究所) Department of Civil and Environmental Engineering, Imperial College London(伦敦帝国理工学院土木与环境工程系)

AI总结 本文提出ORThought框架,通过引入专家级建模原理,解决物流优化建模中的基准不足、多智能体框架不稳定及评估深度不足等问题,实验证明其在复杂约束下表现优异。

Comments The paper has been accepted by Artificial Intelligence for Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16549 2026-04-21 cs.CV

MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems

MathFlow: 提升多模态大语言模型在视觉数学问题中的感知流

Shuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng, Jun Cen, Zeying Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Tsinghua University(清华大学)

AI总结 本文提出MathFlow框架,通过分离感知与推理阶段,提升多模态大语言模型在视觉数学问题中的表现,实验表明其在不同推理模型中均有效。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏