Beyond Scaling: Agents Are Heading to the Edge
超越扩展:智能体正走向边缘
机构 * University of Cambridge(剑桥大学) ; University of Macau(澳门大学) ; Nanjing University(南京大学)
AI总结 本文探讨了智能体技术发展的瓶颈从单一模型压缩世界知识转向协调系统执行,提出个人智能体架构必须转向边缘计算,以适应高保真局部环境的结构耦合和零延迟执行循环需求。
高校专区
超越扩展:智能体正走向边缘
机构 * University of Cambridge(剑桥大学) ; University of Macau(澳门大学) ; Nanjing University(南京大学)
AI总结 本文探讨了智能体技术发展的瓶颈从单一模型压缩世界知识转向协调系统执行,提出个人智能体架构必须转向边缘计算,以适应高保真局部环境的结构耦合和零延迟执行循环需求。
同信号,不同语义:软件工程代理跨框架行为分析
机构 * Singapore Management University(新加坡国立大学) ; Nanjing University(南京大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文通过大规模实验分析软件工程代理在不同框架下的行为表现,发现相同的行为信号在不同框架下可能具有相反的意义,强调了跨框架验证的重要性。
StableVLA: 向无额外数据的鲁棒视觉-语言-动作模型迈进
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Nankai University(南开大学)
AI总结 本文研究了在未见真实世界视觉扰动下视觉-语言-动作(VLA)模型的鲁棒性问题,提出了一种基于信息理论的轻量级适配模块IB-Adapter,有效提升模型性能,同时保持高效和效果。
Comments Accepted by ICML 2026. Code: https://github.com/DAGroup-PKU/HumanNet. Project website: https://dagroup-pku.github.io/StableVLA/
多语言大语言模型的高效路径:通过后训练PARAM$Δ$整合到再利用MoE进行语言扩展
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; Zhejiang University(浙江大学)
AI总结 本文提出了一种高效的方法,通过将密集模型转换为MoE架构,并将不同语言分配给不同专家,从而在不进行复杂对齐阶段的情况下提升多语言大语言模型的性能,同时保留原始能力。
MoASE++: 基于领域自适应在线蒸馏的激活稀疏专家混合模型用于持续测试时间适应
机构 * Nanjing University and The Hong Kong Polytechnic University(南京大学和香港理工大学) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机科学学院) ; University of Arizona(亚利桑那大学) ; Hong Kong University of Science and Technology(香港科技大学) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; Nanjing University(南京大学)
AI总结 本文提出MoASE++,通过结合领域自适应在线蒸馏的激活稀疏专家混合模型,解决持续测试时间适应中领域无关结构与领域特定纹理分离的问题,提升模型在动态视觉环境中的持续适应能力。
混合专家在类增量学习中的稳定路由
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
AI总结 本文研究了在类增量学习中混合专家模型的稳定路由问题,提出了一种稳定路由框架StaR-MoE,通过敏感性感知路由对齐和不对称容量正则化,提高了模型对新类别的适应能力和旧类别的知识保留能力。
PEGRL: 通过后编辑引导的强化学习改进机器翻译
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; China Mobile Research Beijing, China(北京中国移动研究院)
AI总结 本文提出PEGRL框架,通过后编辑作为辅助任务稳定训练并引导整体优化,提升机器翻译性能。
多阶匹配网络用于无对齐深度超分辨率
机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院PCA实验室,南京理工大学) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; School of Computer Science, Nankai University(南开大学计算机学院) ; PCA Lab, School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院PCA实验室,南京大学)
AI总结 本文提出了一种无对齐框架Multi-Order Matching Network (MOMNet),通过多阶匹配机制和多阶聚合策略,从不对齐的RGB数据中提取并选择最相关的信息,以提高深度超分辨率的性能和泛化能力。
SAM 2++: 任意粒度下的任意目标跟踪
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Tencent(腾讯) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 本文提出SAM 2++框架,通过统一的提示编码、输出解码和记忆表示设计,实现了对不同粒度的目标状态(如掩码、框和点)的统一跟踪,同时引入Tracking-Any-Granularity数据集以提升统一跟踪模型的训练和评估效果。
Comments 14 pages
DyDiff: 通过动力学扩散实现离线强化学习中的长周期 rollout
机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学计算机科学学院) ; Department of Computer Science, Nanjing University, Nanjing 210093, China(南京大学计算机科学系)
AI总结 本文提出DyDiff,一种通过动力学扩散模型实现离线强化学习中长周期轨迹生成的方法,通过迭代注入学习策略信息,解决行为策略与学习策略不一致的问题,提升长周期rollout的准确性。
Comments 18 pages, 10 figures, 9 tables. The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-52028-5}
基于触觉的多模态融合在具身智能中的应用:视觉、语言和接触驱动范式的综述
机构 * School of Electronic Science and Engineering, Xi’an Jiaotong University, China(西安交通大学电子科学与技术学院) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; Purple Mountain Laboratory, China(紫金山实验室) ; Institute for Math & AI, Wuhan University, China(武汉大学数学与人工智能学院) ; Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University, Australia(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) ; Institute of Big Data, Fudan University, China(复旦大学大数据研究院) ; Linkerbot (Beijing) Technology Co., Ltd, China(北京链动科技有限公司) ; School of Engineering, Swinburne University of Technology, Melbourne(斯威本技术大学工程学院)
AI总结 本文综述了多模态触觉融合在具身智能中的研究,探讨了如何通过整合视觉、语言和触觉信息来提升物理交互与语义推理的结合,提出了一种分层的分类体系,并总结了当前的研究挑战和未来方向。
Comments 20 pages, 8 figures
DISA: 分布匹配强化学习中的离线重要性采样
机构 * Shanghai Jiao Tong University(上海交通大学) ; Qwen Team, Alibaba Group(阿里集团Qwen团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学) ; The University of Hong Kong(香港大学)
AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。
Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract
TOBench:面向真实世界工具使用代理的任务导向多模态基准
机构 * Nanjing University(南京大学) ; Huazhong University of Science and Technology(华中科技大学) ; Southwest Jiaotong University(西南交通大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出TOBench,一个面向真实世界工具使用代理的多模态基准,通过闭环多模态验证设计,评估和推动下一代多模态工具使用代理的发展。
Comments Github: https://github.com/Pi3AI/TOBench
NGM: 一种无需训练的插拔式内存模块用于大语言模型
机构 * Nanjing University(南京大学)
AI总结 本文提出NGM,一种无需训练的插拔式内存模块,通过因果n-gram编码器和余弦门控内存注入器,实现高效的知识检索,提升大语言模型在代码生成和知识密集型任务中的性能。
Comments Code is available at https://github.com/PioneerQyw/NGM
草图然后绘画:用于扩散多模态大语言模型的分层强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Peking University(北京大学)
AI总结 本文提出了一种分层强化学习方法HT-GRPO,通过Sketch-Then-Paint训练方案和分层信用分配机制,解决扩散多模态大语言模型在强化学习优化中的关键问题,提升图像质量和审美效果。
NaviRAG:迈向检索增强生成的主动知识导航
机构 * Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Northeastern University(东北大学)
AI总结 NaviRAG通过主动知识导航框架提升检索增强生成的复杂任务处理能力,通过分层知识组织和动态信息检索提高检索准确率和生成性能。
非线性双极补偿:处理训练后量化中的异常值
机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)
AI总结 本文提出非线性双极补偿方法,通过引入非线性补偿减少异常值影响,设计双极对数变换压缩异常值,提升训练后量化的效率与鲁棒性。