arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1960
2509.21719 2026-02-17 cs.CV

DeLiVR: Differential Spatiotemporal Lie Bias for Efficient Video Deraining

DeLiVR:差分时空李群偏置用于高效视频去雨

Shuning Sun, Jialang Lu, Xiang Chen, Jichao Wang, Dianjie Lu, Guijuan Zhang, Guangwei Gao, Zhuoran Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Qilu University of Technology(齐鲁工业大学) Hubei University(湖北大学) Nanjing University of Science and Technology(南京理工大学) Shandong Normal University(山东师范大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

AI总结 DeLiVR通过引入时空李群微分偏置,提高视频去雨的效率和鲁棒性,有效解决雨痕和时间伪影问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13685 2026-02-17 cs.SD cs.AI

AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning

AuTAgent: 一个用于工具增强音频推理的强化学习框架

Siqian Tong, Xuan Li, Yiwei Wang, Baolong Bi, Yujun Cai, Shenghua Liu, Yuchen He, Chengpeng Hao

机构 * Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) The University of Queensland(昆士兰大学) University of Chinese Academy of Sciences(中国科学院大学) University of California, Merced(加州大学默塞德分校)

AI总结 AuTAgent通过强化学习框架学习何时及使用哪些工具,提升音频模型的推理能力,实验显示在多个基准上显著提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10098 2026-02-17 cs.RO cs.CV

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23232 2026-02-17 cs.CV cs.AI

ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search

ShotFinder: 通过网络搜索驱动的开放域视频镜头检索

Tao Yu, Haopeng Jin, Hao Wang, Shenghua Chai, Yujia Yang, Junhao Gong, Jiaming Guo, Minghui Zhang, Xinlong Chen, Zhenghao Zhang, Yuxuan Zhou, Yufei Xiong, Shanbin Zhang, Jiabing Yang, Hongzhu Yi, Xinming Wang, Cheng Zhong, Xiao Ma, Zhang Zhang, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) Lenovo(联想集团) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 ShotFinder通过网络搜索驱动开放域视频镜头检索,提出三阶段检索流程并揭示多模态大模型在开放域视频检索中的性能差距。

Comments 28 pages, 7 figures, Project website: https://github.com/yutao1024/ShotFinder

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16308 2026-02-16 cs.LG

Beyond All-to-All: Causal-Aligned Transformer with Dynamic Structure Learning for Multivariate Time Series Forecasting

超越全对全:基于动态结构学习的因果对齐变换器用于多变量时间序列预测

Xingyu Zhang, Hanyun Du, Zeen Song, Siyu Zhao, Changwen Zheng, Wenwen Qiang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences, China(中国科学院软件研究所)

AI总结 本文提出因果对齐变换器,通过动态结构学习实现多变量时间序列预测中的因果区分,提升预测鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12636 2026-02-16 cs.LG cs.RO

Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL

双粒度对比奖励 via 生成 episodic 引导 为高效 embodied RL

Xin Liu, Yixuan Li, Yuhui Chen, Yuxing Qin, Haoran Li, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

AI总结 本文提出DEG方法,通过生成episodic引导实现高效具身RL,无需人工标注,提升样本效率和任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12525 2026-02-16 cs.CV

Geometric Stratification for Singular Configurations of the P3P Problem via Local Dual Space

基于局部对偶空间的P3P问题奇异配置的几何分层

Xueying Sun, Zijia Li, Nan Li

机构 * School of Mathematical Sciences, Shenzhen University(深圳大学数学科学学院) State Key Laboratory of Mathematical Sciences(数学科学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室)

AI总结 本文通过局部对偶空间方法,对P3P问题中相机中心的奇异配置进行几何分层分析,揭示了不同乘重下O的位置特征及其对应的解结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12401 2026-02-16 cs.CV

ZeroDiff++: Substantial Unseen Visual-semantic Correlation in Zero-shot Learning

ZeroDiff++: 零样本学习中显著的未见视觉-语义相关性

Zihan Ye, Shreyank N Gowda, Kaile Du, Weijian Luo, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) School of Computer Science, the University of Nottingham(诺丁汉大学计算机学院) Southeast University(东南大学) hi-lab of Xiaohongshu Inc(小红书公司hi实验室)

AI总结 ZeroDiff++通过扩散生成框架提升零样本学习中视觉-语义相关性,解决虚假相关性和数据稀缺问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11073 2026-02-13 cs.CV cs.AI cs.CL

Chatting with Images for Introspective Visual Thinking

与图像对话以进行反思性视觉思维

Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学)

AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11693 2026-02-13 cs.GR cs.AI cs.CV

OMEGA-Avatar: One-shot Modeling of 360° Gaussian Avatars

OMEGA-Avatar: 从单张图像进行360°高斯avator的一键建模

Zehao Xia, Yiqun Wang, Zhengda Lu, Kai Liu, Jun Xiao, Peter Wonka

机构 * Chongqing University(重庆大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 OMEGA-Avatar通过两个创新模块实现了从单张图像生成360°完整且可动画的3D高斯头,提升了全头avator的建模精度和动画能力。

Comments Project page: https://omega-avatar.github.io/OMEGA-Avatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11536 2026-02-13 cs.CV

Vascular anatomy-aware self-supervised pre-training for X-ray angiogram analysis

基于血管解剖的自监督预训练方法用于X射线造影分析

De-Xing Huang, Chaohui Yu, Xiao-Hu Zhou, Tian-Yu Xiang, Qin-Yi Zhang, Mei-Jiang Gui, Rui-Ze Ma, Chen-Yu Wang, Nu-Fang Xiao, Fan Wang, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology(智能科学与技术联合实验室,系统工程研究所,澳门科学大学) DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

AI总结 本文提出VasoMIM框架,结合解剖引导掩码策略和一致性损失,用于X射线造影分析,通过XA-170K数据集实现高效预训练并取得最佳性能。

Comments 10 pages, 10 figures, 10 tables. Journal version of VasoMIM (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11494 2026-02-13 cs.CV

Arbitrary Ratio Feature Compression via Next Token Prediction

通过下一个标记预测实现任意比例特征压缩

Yufan Liu, Daoyuan Ren, Zhipeng Zhang, Wenyang Luo, Bing Li, Weiming Hu, Stephen Maybank

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) People AI, Inc.(People AI公司) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Computer Science and Mathematics, Birkbeck College, University of London(伦敦大学伯克贝克学院计算机科学与数学学院)

AI总结 本文提出了一种通过下一个标记预测实现任意比例特征压缩的框架,解决了传统方法在灵活性和通用性上的不足,通过引入混合解决方案和实体关系图约束模块,提升了压缩特征的质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11241 2026-02-13 cs.CV cs.LG

Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration

主动零:通过主动环境探索实现自我进化的视觉-语言模型

Jinghan He, Junfeng Fang, Feng Xiong, Zijun Yao, Fei Shen, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究所) Tsinghua University(清华大学)

AI总结 Active-Zero通过主动环境探索实现视觉-语言模型的自我进化,提升推理和理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05014 2026-02-13 cs.AI cs.CL cs.IR

DeepRead: Document Structure-Aware Reasoning to Enhance Agentic Search

DeepRead: 一种基于文档结构的推理以增强代理搜索

Zhanli Li, Huiwen Tian, Lvzhou Luo, Yixuan Cao, Ping Luo

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, CAS(中国科学院大学) Wenlan School of Business, Zhongnan University of Economics(中南财经政法大学文澜商学院)

AI总结 DeepRead通过结构感知的文档推理增强代理搜索,有效提升文档理解精度。

Comments This version has significantly enhanced the clarity of our research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11016 2026-02-12 cs.AR cs.AI

From Buffers to Registers: Unlocking Fine-Grained FlashAttention with Hybrid-Bonded 3D NPU Co-Design

从缓冲区到寄存器:通过混合键合3D NPU协同设计解锁细粒度FlashAttention

Jinxin Yu, Yudong Pan, Mengdi Wang, Huawei Li, Yinhe Han, Xiaowei Li, Ying Wang

机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(科学技术信息研究所、中国科学院、北京) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学、北京)

AI总结 本文提出3D-Flow架构和3D-FlashAttention方法,通过混合键合3D堆叠空间加速器实现细粒度FlashAttention,降低能耗并提升速度。

Comments Accepted to DATE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03866 2026-02-12 cs.DL cs.AI

PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG

PaperX: 一种多模态学术演示生成的统一框架与学者DAG

Tao Yu, Minghui Zhang, Zhiqing Cui, Hao Wang, Zhongtian Luo, Shenghua Chai, Junhao Gong, Yuzhao Peng, Yuxuan Zhou, Yujia Yang, Zhenghao Zhang, Haopeng Jin, Xinming Wang, Yufei Xiong, Jiabing Yang, Jiahao Yuan, Hanqing Wang, Hongzhu Yi, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(乌尔姆大学) Peking University(北京大学) Tsinghua University(清华大学) HKUST(GZ)(香港科技大学(广州))

AI总结 PaperX通过Scholar DAG实现多模态学术演示生成的统一框架,提升内容质量和效率。

Comments 29 pages, 9 figures, Project website: https://github.com/yutao1024/PaperX

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05188 2026-02-12 cs.CL cs.AI

Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling

修复破碎的指南针:诊断并改进推理时间奖励建模

Jiachun Li, Pengfei Cao, Zhuoran Jin, Yubo Chen, Jiexin Xu, Huaijun Li, Xiaojian Jiang, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) China Merchants Bank(中国 Merchants 银行)

AI总结 本文提出CRISP算法,通过聚类和逐步前缀优化,提升LLM在推理任务中的性能,实现5%的准确率提升。

Comments 38 pages, 30 figures, Accpeted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10494 2026-02-12 cs.CL

Canvas-of-Thought: Grounding Reasoning via Mutable Structured States

Canvas-of-Thought:通过可变的结构化状态进行推理

Lingzhuang Sun, Yuxia Zhu, Ruitong Liu, Hao Liang, Zheng Sun, Caijun Jia, Honghao He, Yuchen Wu, Siyuan Li, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) New York University(纽约大学) Westlake University(西湖大学)

AI总结 Canvas-CoT通过引入HTML Canvas实现可变结构化状态,提升多模态推理效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10377 2026-02-12 cs.LG cs.CL

Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs

通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律

Luoyang Sun, Jiwen Jiang, Yifeng Ding, Fengfa Li, Yan Song, Haifeng Zhang, Jian Ying, Lei Ren, Kun Zhan, Wei Chen, Yan Xie, Cheng Deng

机构 * AI Lab, The Yangtze River Delta Institution of Automation, Chinese Academy of Sciences(人工智能实验室,长江三角洲自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University College London(伦敦大学学院) Institution of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) The University of Edinburgh(爱丁堡大学)

AI总结 本文提出通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律,通过训练170个模型建立架构与训练损失的缩放关系,实现准确度与延迟的直接对应,降低架构选择时间并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10159 2026-02-12 cs.CV cs.LG

Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization

超越封闭池视频检索:面向真实世界视频搜索和时刻定位的基准与代理框架

Tao Yu, Yujia Yang, Haopeng Jin, Junhao Gong, Xinlong Chen, Yuxuan Zhou, Shanbin Zhang, Jiabing Yang, Xinming Wang, Hongzhu Yi, Ping Nie, Kai Zou, Zhang Zhang, Yan Huang, Liang Wang, Yeshani, Ruiwen Tao, Jin Ma, Haijin Liang, Jinwen Luo

机构 * CASIA UCAS Tencent(腾讯) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出RVMS-Bench和RACLO框架,用于评估现实世界中基于模糊记忆的视频检索和时刻定位,揭示现有模型在该任务上的不足。

Comments 49 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10148 2026-02-12 cs.CR cs.AI

Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks

多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型

Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

AI总结 本文提出CrossTALK方法,通过跨模态纠缠攻击提升对视觉-语言模型的劫持效果,实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09067 2026-02-12 q-bio.GN cs.AI cs.CE cs.CL

AntigenLM: Structure-Aware DNA Language Modeling for Influenza

AntigenLM: 用于流感的结构感知DNA语言模型

Yue Pei, Xuebin Chi, Yu Kang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Beijing Institute of Genomics, Chinese Academy of Sciences(中国科学院北京基因组研究所) China National Center for Bioinformation(中国生物信息学国家中心) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 AntigenLM通过结构感知的DNA语言模型预测流感抗原变异,优于传统方法,同时在亚型分类中表现优异。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00038 2026-02-12 cs.CL cs.AI cs.CR

from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors

从无害到有害:通过对抗隐喻 jailbreak 语言模型

Yu Yan, Sheng Sun, Zenghao Duan, Teli Liu, Min Liu, Zhiyi Yin, Jingyu Lei, Qi Li

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学) Tsinghua University(清华大学)

AI总结 通过对抗隐喻诱导语言模型生成有害内容,提出AVATAR框架以提升jailbreak攻击效果。

Comments arXiv admin note: substantial text overlap with arXiv:2412.12145

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19844 2026-02-12 cs.CV

ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

ProAPO:逐步自动提示优化用于视觉分类

Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) University of Science and Technology Beijing(北京科技大学)

AI总结 ProAPO通过逐步自动优化提示,提升视觉分类性能,优于现有方法并在多个数据集上取得显著改进。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01280 2026-02-11 cs.CL cs.AI

Does Memory Need Graphs? A Unified Framework and Empirical Analysis for Long-Term Dialog Memory

记忆是否需要图?一种统一框架和长期对话记忆的实证分析

Sen Hu, Yuxiang Wei, Jiaxin Ran, Zhiyuan Yao, Xueran Han, Huacan Wang, Ronghao Chen, Lei Zou

机构 * Peking University(北京大学) Georgia Tech(佐治亚理工学院) ZJU(浙江大学) MBZUAI(马克斯·普朗克智能系统研究所) UCAS(中国科学院大学)

AI总结 本文提出一种统一框架,分析长期对话记忆系统,发现性能差异主要由基础设置驱动,而非特定架构创新,并提供了稳定基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09718 2026-02-11 quant-ph cs.LG

SAQNN: Spectral Adaptive Quantum Neural Network as a Universal Approximator

SAQNN:谱适应量子神经网络作为通用逼近器

Jialiang Tang, Jialin Zhang, Xiaoming Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 本文提出了一种谱适应量子神经网络模型,证明其具备通用逼近能力,并在电路规模和参数复杂度方面优于经典神经网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09494 2026-02-11 cs.CV

OSI: One-step Inversion Excels in Extracting Diffusion Watermarks

OSI: 一步反向在提取扩散水印中表现优异

Yuwei Chen, Zhenliang He, Jia Tang, Meina Kan, Shiguang Shan

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (CAS), China(中国科学院大学) School of Information Science and Technology, ShanghaiTech University, China(信息科学与技术学院,上海科技大学)

AI总结 OSI通过一步反向高效提取高斯阴影水印,速度快20倍,精度更高,承载能力翻倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09483 2026-02-11 cs.CV

Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions

超越单个词对齐:通过令牌交互蒸馏多模态大语言模型

Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所信息与智能系统研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhejiang University(浙江大学)

AI总结 Align-TI通过令牌交互改进知识蒸馏,实现多模态大语言模型的高效压缩与性能提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08224 2026-02-11 cs.CV

Efficient-SAM2: Accelerating SAM2 with Object-Aware Visual Encoding and Memory Retrieval

Efficient-SAM2: 通过对象感知视觉编码和内存检索加速SAM2

Jing Zhang, Zhikai Li, Xuewen Liu, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 Efficient-SAM2通过对象感知的视觉编码和内存检索技术,显著提升SAM2的推理效率,实现1.68倍加速且仅损失1.0%的准确性。

Comments ICLR 2026,Code is available at: https://github.com/jingjing0419/Efficient-SAM2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01879 2026-02-11 cs.CL cs.AI

REPAIR: Robust Editing via Progressive Adaptive Intervention and Reintegration

通过渐进自适应干预与再整合实现鲁棒编辑

Yisu Wang, Ming Wang, Haoyuan Song, Wenjie Huang, Chaozheng Wang, Yi Xie, Xuming Ran

机构 * Engineering Center for Space Utilization of Chinese Academy of Sciences(中国科学院空间利用工程技术中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science and Engineering(计算机科学与工程学院) Northeastern University(东北大学) New York University(纽约大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑技术大学)

AI总结 REPAIR通过闭环反馈和动态内存管理实现鲁棒编辑,提升编辑准确性并减少知识遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏