arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-07-29 至 2026-07-29 共收录 11
2607.25818 2026-07-29 cs.CV 新提交

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune:一种基于分隔符的高效多模态大语言模型剪枝框架

Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies(长鑫存储技术有限公司)

AI总结 针对多模态大语言模型视觉令牌计算成本高的问题,提出SepPrune剪枝方法,以模态分隔符令牌为统一查询来排序和选择视觉令牌,复用内置投影参数,无需架构更改,在Qwen2.5-VL-7B上实验取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25669 2026-07-29 cs.AI 新提交

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

OmniDelta:用于OmniLLMs中令牌压缩的技能驱动预算分配

Haoyang Huang, Wenjie Huang, Tianqi Xu, Hongyaoxing Gu, Kang Tan, Yikai Fu, Yuhao Shen, Tianyu Liu, Baolin Zhang, Jun Zhang, Xinyi Hu, Jun Dai, Shuang Ge, Lei Chen, Yue Li, Mingchen Wang, Meng Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Alibaba(阿里巴巴)

AI总结 研究针对OmniLLMs长音频-视频令牌序列成本高的问题,提出技能驱动的OmniDelta框架,通过构建技能池、结合意图与内容感知分配预算,能与现有策略结合,实验证明其在多个基准上建立新的准确性-效率前沿,减少内存并加速推理。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25407 2026-07-29 cs.CV 新提交

ANFI: Rethinking Neighbor Feature Interaction in Person Re-ID

ANFI:重新思考行人重识别中的邻居特征交互

Xulin Li, Yan Lu, Bin Liu, Jiaze Li, Qinhong Yang, Tao Gong, Qi Chu, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 该研究针对行人重识别中基于邻居方法仅依赖亲和关系、受噪声邻居影响的问题,提出ANFI方法,不仅建模亲和关系与差异关系,还用自适应加权,通过新邻域相似度导出差异关系,经噪声关系监督训练,实验证明其在多种设置下的优越性。

Comments accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25308 2026-07-29 cs.CL cs.AI 新提交

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

CAST:将游戏求解器作为大语言模型智能体的回合级教师

Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Wuhan University(武汉大学) Meituan(美团)

AI总结 研究如何训练大语言模型在长期游戏中决策,提出CAST方法,利用游戏求解器状态值变化转化为求解器优势并注入RLVR,在多个游戏中优于基线,实现高平均零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24885 2026-07-29 cs.LG cs.AI 新提交

Eliminating Propagation Delay: Attention-Based Spatial-Temporal Fusion Graph Convolution Network for Traffic Flow Prediction

消除传播延迟:基于注意力的时空融合图卷积网络用于交通流预测

Jinpeng Chen, Ziyu Yu, Tao Wang, Jun Ma, Hongbo Gao, Senzhang Wang, Zufeng Zhang, Kaimin Wei

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机学院(国家示范性软件学院)) Department of Automation, School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院自动化系) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Automation, Tsinghua University(清华大学自动化系) College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院)

AI总结 针对交通流预测,提出基于注意力的时空融合图卷积网络(A-STFGCN),设计时空融合块,通过掩码矩阵多头自注意力机制提取特征相关性,去除传播延迟误差,实验表明该方法相比基线方法性能最佳,效率良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24794 2026-07-29 cs.AI cs.CV 新提交

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Jilin University(吉林大学)

AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24016 2026-07-29 cs.CV 版本更新

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

机构 * People’s Daily Online(人民网) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。

Comments Some errors must be corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01862 2026-07-29 cs.MA cs.AI cs.NI 版本更新

RadioMaster: Multi-Agent System for Autonomous Radio Signal Generation

RadioMaster: 自主无线电信号生成的多智能体系统

Jiazhen Lei, Yuxin Sha, Tianze Cao, Sihan Wang, Bingbing Wang, Zeming Yang, Fengyuan Zhu, Xiaohua Tian

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出RadioMaster,一个全自主的多智能体框架,通过RadioWiki、RadioAgent和RadioEmulator三大支柱,将用户意图转化为真实无线信号,解决现有模型因领域知识和硬件约束敏感性不足而无法生成无线电信号的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06757 2026-07-29 cs.CV 版本更新

FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching

FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配

Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su, Zhengyuan Yang, Lijuan Wang, Xiaofeng Zhu, Alex Jinpeng Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Central South University(中南大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软)

AI总结 本文提出FlowInOne框架,将多模态生成统一为纯视觉流匹配,通过视觉提示消除跨模态对齐瓶颈,实现文本到图像生成、布局引导编辑和视觉指令遵循的统一。

Comments Accepted by ECCV 2026. 38 Pages, 21 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03595 2026-07-29 cs.AI cs.CL 版本更新

Controllable LLM Reasoning via Sparse Autoencoder-Based Steering

通过稀疏自编码器基于的转向实现可控的大语言模型推理

Yi Fang, Wenjie Wang, Mingfeng Xue, Boyi Deng, Fengli Xu, Dayiheng Liu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

AI总结 本文提出SAE-Steering方法,通过稀疏自编码器分解隐藏状态,实现对大语言模型推理策略的高效控制,提升推理准确率和灵活性。

Comments Accepted to the ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07884 2026-07-29 cs.CL cs.AI 版本更新

Contrastive Weak-to-strong Generalization

对比性弱到强泛化

Houcheng Jiang, Junfeng Fang, Jiaxin Wu, Tianyu Zhang, Chen Gao, Xiang Wang, Xiangnan He, Yang Deng

机构 * ustc(中国科学技术大学) nus(新加坡国立大学) zgc(中关村学院) smu(新加坡管理学院)

AI总结 研究针对弱到强泛化中弱模型输出噪声和偏差问题,利用隐式奖励与对比解码的联系,提出ConG框架,通过对比解码生成高质量样本,实现可靠能力转移等,经实证验证其有效性和通用性,推动了弱到强泛化及通向通用人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏