arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2605.16350 2026-05-19 cs.LG cs.AI

Federated Nested Learning: Collaborative Training of Self-Referential Memories for Test-Time Adaptation

联邦嵌套学习:为测试时间适应性协作训练自参考记忆

Hong Chen, Pengcheng Wu, Yuanguo Lin, Peilin Zhao, Xiuze Zhou, Fan Lin, Han Yu

机构 * Nanyang Technological University(南洋理工大学) Jimei University(集美大学) Shanghai Jiao Tong University(上海交通大学) Xiamen University(厦门大学)

AI总结 本文提出FedNL框架,通过嵌套优化系统实现协作学习优化规则,提升非独立同分布数据下的推理与检索性能,保持恒定推理内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16257 2026-05-18 cs.RO

DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo

DexJoCo:用于MuJoCo上的任务导向灵巧操作的基准和工具包

Hanwen Wang, Weizhi Zhao, Xiangyu Wang, Siyuan Huang, He Lin, Boyuan Zheng, Rongtao Xu, Gang Wang, Yao Mu, He Wang, Lue Fan, Hongsheng Li, Zhaoxiang Zhang, Tieniu Tan

机构 * NLPR & MAIS, CASIA(中国科学院南京自动化研究所与模式识别与人工智能实验室) SJTU(上海交通大学) MBZUAI(马克斯·普朗克研究所) Beijing Institute of Basic Medical Sciences(北京基础医学研究所) PKU & Galbot(北京大学与Galbot) CUHK(香港大学)

AI总结 本文提出DexJoCo基准和工具包,包含11个功能任务评估灵巧手的工具使用、双臂协调、长周期执行和推理能力,通过低成本数据收集系统和领域随机化评估鲁棒性,揭示当前策略的局限性。

Comments 8 pages, 6 figures, project page is available at: https://dexjoco.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15843 2026-05-18 cs.CV

WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes

WorldAct:将单体3D世界激活为可交互的以对象为中心的场景

Jichen Hu, Jiawei Guo, Jiazhong Cen, Chen Yang, Sikuang Li, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc(华为公司)

AI总结 WorldAct通过多模态代理将静态生成的3D世界分解为可编辑的交互场景,支持对象级编辑和任务执行,保留全局一致性。

Comments Project page: https://sjtu-deepvisionlab.github.io/WorldAct

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12309 2026-05-18 cs.CV

G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models

G$^2$TR: 基于生成的视觉标记减少方法用于分离编码统一多模态模型

Junxian Li, Kai Liu, Zizhong Ding, Zhixin Wang, Zhikai Chen, Renjing Pei, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

AI总结 本文提出G$^2$TR方法,通过生成分支信号减少多模态模型的视觉标记,提升效率并保持性能,实验显示在图像理解和编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14200 2026-05-18 cs.CL cs.AI cs.LG

A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement

可扩展的多语言模型协作系统:基于检索的选择与探索-利用驱动增强

Shengji Tang, Jianjian Cao, Weihao Lin, Jiale Hong, Bo Zhang, Shuyue Hu, Lei Bai, Tao Chen, Wanli Ouyang, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SMCS系统,通过检索优先选择模块和探索-利用驱动后验增强模块,有效协调多个开源语言模型,实验显示其在多个任务中优于闭源模型,且在不同数据集上超越开源模型的平均最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18361 2026-05-18 cs.CV cs.AI

COCO-Inpaint: A Benchmark for Detecting and Localizing Inpainting-Based Image Manipulations

COCO-Inpaint:用于检测和定位基于修补的图像篡改的基准

Haozhen Yan, Yan Hong, Jiahui Zhan, Suning Lang, Yikun Ji, Huijia Zhu, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 本文提出COCO-Inpaint基准,用于检测和定位基于修补的图像篡改,通过高质样本、多样场景和大规模覆盖,揭示修补与真实区域的内在不一致。

Comments 6 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15710 2026-05-18 cs.CL

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

SMMBench:一种用于源分布多模态智能体记忆的基准测试

Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University, China(上海交通大学,中国) OPPO, China(OPPO,中国)

AI总结 SMMBench旨在评估智能体在多源分布证据下进行多模态推理、冲突解决和行动预测的能力,揭示当前系统在处理碎片化异构数据时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15617 2026-05-18 cs.DC cs.AI

A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM

几块GPU,大量规模:PrismLLM实现忠实的LLM训练仿真

Shaoke Xi, ChonLam Lao, Boyi Jia, Jiaqi Gao, Zhipeng Zhang, Jiamin Cao, Brian Sutioso, Erci Xu, Minlan Yu, Kui Ren, Yong Li, Zhengping Qian, Ennan Zhai, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团) Harvard University(哈佛大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 PrismLLM通过切片方法构建高保真执行图,使工程师能用少量GPU模拟大规模训练行为,准确复现性能和内存表现,节省集群访问成本。

Comments 13 pages body, 21 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15334 2026-05-18 cs.LG cs.AI cs.CL cs.SE

From I/O to Code with Discovery Agent

从输入输出到代码:发现代理

Yihong Dong, Jiaru Qian, Haoran Zhang, Peixu Wang, Binhua Li, Zhi Jin, Yongbin Li, Ge Li, Xiaokang Yang, Xue Jiang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Wuhan University(武汉大学) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出DIO-Agent,通过将IO2Code视为离散程序空间的进化搜索,利用LLM作为突变算子,结合执行误差信号指导突变,解决从输入输出行为合成代码的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14311 2026-05-18 cs.LG cs.AI cs.HC

Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment

超越二元:将GUI批评重新框架化为连续语义对齐

Yuchen Sun, Pei Fu, Shaojie Zhang, Anan Du, Xiuwen Xi, Ruoceng Zhang, Zhenbo Luo, Jian Luan, Chongyang Zhang

机构 * Xiaomi Inc.(小米公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出BBCritic和BBBench,通过两阶段对比学习在共享语义空间中对齐指令与动作,解决GUI批评中二元分类的局限性,实验证明其在跨平台任务中的优越性。

Comments 28 pages including appendix. Code and BBBench benchmark to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15221 2026-05-18 cs.RO cs.CV

Vision-Based Safe Human-Robot Collaboration with Uncertainty Guarantees

基于视觉的具有不确定性保证的人机协作

Jakob Thumm, Marian Frei, Tianle Ni, Matthias Althoff, Marco Pavone

机构 * Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天系) Chair of Imaging and Computer Vision, RWTH Aachen University(亚琛工业大学影像与计算机视觉教授职位) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Computer Engineering, Technical University of Munich(慕尼黑技术大学计算机工程系)

AI总结 本文提出一种基于视觉的人体姿态估计与运动预测框架,通过置信度保证实现安全的人机协作。结合aleatoric不确定性估计与OOD检测,提供高概率置信度的置信区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13864 2026-05-18 cs.CR cs.CV

Inevitable Encounters: Backdoor Attacks Involving Lossy Compression

不可避免的遭遇:涉及损失压缩的后门攻击

Qian Li, Yunuo Chen, Yuntian Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(技术东院)

AI总结 本文研究了在大数据时代,损失压缩对隐形后门攻击的影响,提出两种针对损失压缩的攻击策略,以确保恶意触发信息在压缩后仍能被恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18511 2026-05-18 cs.LG math.AP physics.comp-ph

SPDEBench: An Extensive Benchmark for Learning Stochastic PDEs

SPDEBench:学习随机偏微分方程的广泛基准

Yuantu Zhu, Zheyan Li, Dai Shi, Luke Thompson, Oliver Nash, Jose Miguel Lara Rangel, Siran Li, Bingguang Chen, Rongchan Zhu, Qi Meng, Hao Ni

机构 * Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学) University of Cambridge(剑桥大学) University of Sydney(悉尼大学) Imperial College London(伦敦帝国理工学院) University College London(伦敦大学学院) Fujian Normal University(福建师范大学) Beijing Institute of Technology(北京理工大学) Chinese Academy of Sciences(中国科学院)

AI总结 本文提出SPDEBench,首个统一的ML学习随机偏微分方程基准,提供物理和数学重要的1-3维领域数据集,涵盖正则和奇异SPDE,并包含7种评估指标,验证模型精度、鲁棒性和分布外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13805 2026-05-18 cs.CV cs.AI cs.LG

RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition

RAR:用于视觉识别的检索与排序增强多模态大语言模型

Ziyu Liu, Zeyi Sun, Yuhang Zang, Wei Li, Pan Zhang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) MThreads, Inc.(MThreads公司) Nanyang Technological University(南洋理工大学)

AI总结 RAR结合CLIP的检索与MLLM的排序,提升细粒度识别精度,增强少样本和零样本任务表现。

Comments Project: https://github.com/Liuziyu77/RAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15182 2026-05-15 cs.CV

Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video

Warp-as-History:从单个训练视频生成可泛化的相机控制视频

Yifan Wang, Tong He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出Warp-as-History方法,通过将相机诱导的变形转化为相机变形的伪历史,实现无需训练的零样本相机轨迹生成,提升视频生成的相机顺应性和视觉质量。

Comments Project page: https://yyfz.github.io/warp-as-history/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15081 2026-05-15 cs.CL cs.AI

ML-Embed: Inclusive and Efficient Embeddings for a Multilingual World

ML-Embed:面向多语言世界的包容性与高效嵌入

Ziyin Zhang, Zihan Liao, Hang Yu, Peng Di, Rui Wang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院)

AI总结 本文提出ML-Embed,通过3D-ML框架解决高质文本嵌入的计算、语言覆盖和透明性问题,构建了从140M到8B参数的多语言模型,实现了在9个MTEB基准上的新纪录,尤其在低资源语言表现突出。

Comments Accepted by ICML 2026. The data has been released earlier in the preprint arXiv:2603.19223

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14950 2026-05-15 cs.CV cs.RO

Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型

Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学) Nanyang Technological University(南洋理工大学) SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)

AI总结 本文提出Evo-Depth模型,通过轻量隐式深度编码模块和空间增强模块提升视觉-语言-动作任务中的空间感知能力,实现高效部署与高精度操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14948 2026-05-15 cs.CV

ACE-LoRA: Adaptive Orthogonal Decoupling for Continual Image Editing

ACE-LoRA:适应性正交解耦用于持续图像编辑

Yuehao Liu, Weijia Zhang, Xuanming Shang, Zhizhou Chen, Yanhao Ge, Shanyan Guan, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) VIVO

AI总结 ACE-LoRA通过动态正则化框架解决持续图像编辑中的灾难性遗忘问题,采用适应性正交解耦和历史信息压缩策略,提出首个全面的CIE-Bench基准,验证方法在指令忠实度、视觉真实性和抗遗忘性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14938 2026-05-15 cs.LG cs.CV

Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习

Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14874 2026-05-15 cs.CV

LPH-VTON: Resolving the Structure-Texture Dilemma of Virtual Try-On via Latent Process Handover

LPH-VTON:通过潜在过程交接解决虚拟试衣的结构-纹理困境

Yixin Liu, Baihong Qian, Jinglin Jiang, Jeffery Wu, Yan Chen, Wei Wang, Yida Wang, Lanqing Yang, Guangtao Xue

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出LPH-VTON框架,通过单个连续去噪过程解决虚拟试衣中结构与纹理的平衡问题,实现高质量的视觉真实性和精确的结构对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14857 2026-05-15 cs.AI cs.IR

A Deterministic Agentic Workflow for HS Tariff Classification: Multi-Dimensional Rule Reasoning with Interpretable Decisions

一种确定性代理工作流用于HS税则分类:多维规则推理与可解释决策

Yu Zhang, Dongjiang Zhuang, Qu Zhou, Zheng Huang, Junhe Wu, Jing Cao, Kai Chen

机构 * School of Information and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(信息与电子工程学院,上海交通大学,上海,中国) Nanjing Jiyun Information Technology Co., Ltd., Nanjing, China(南京吉云信息技术有限公司,南京,中国) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(计算机科学学院,上海交通大学,上海,中国)

AI总结 本文提出确定性代理工作流,通过多维规则推理实现HS税则分类,通过结构化输出和引用注释提升可解释性,实验显示在六位和四位税则层面均取得较高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14801 2026-05-15 cs.RO

Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN

探索VLM-LLM导航中的瓶颈:3D场景理解能力如何影响零样本VLN

Ziyi Xia, Chaoran Xiong, Litao Wei, Xinhao Hu, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学)

AI总结 本文研究了零样本视觉-语言导航中3D场景理解能力对性能的影响,提出了统计成功率上限,揭示了感知饱和现象,建议转向导航相关的核心词汇和准确的边界框比例。

Comments Accepted by ICRA Workshop MM-Spatial AI, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14497 2026-05-15 cs.LG cs.AI

ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization

ROAD: 通过双层优化实现的自适应数据混合用于离线到在线强化学习

Letian Yang, Xu Liu, Yiqiang Lu, Jian Liu, Weiqiang Wang, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 本文提出ROAD框架,通过双层优化解决离线数据与在线策略间分布偏移问题,提升稳定性和性能。

Comments 20 pages, 9 figures, 7 tables. Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14449 2026-05-15 cs.LG cs.AI cs.CL

When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition

当答案偏离问题:通过问题-答案正交分解进行幻觉检测

Siyang Yao, Erhu Feng, Yubin Xia

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出QAOD框架,通过正交分解回答表示以抑制领域变化,结合双策略实现领域内检测与跨领域泛化,提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14391 2026-05-15 cs.CV

Dual-Latent Collaborative Decoding for Fidelity-Perception Balanced Image Compression

双潜变量协作解码用于保真度-感知平衡的图像压缩

Qi Mao, Zijian Wang, Zhengxue Cheng, Lingyu Zhu, Siwei Ma

机构 * School of Information and Communication Engineering and the State Key Laboratory of Media Convergence and Communication, Communication University of China(信息与通信工程学院和媒体融合与通信国家重点实验室,中国通信大学) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(信息科学与电子工程学院,上海交通大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学) State Key Laboratory of Multimedia information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)

AI总结 本文提出MoDE框架,通过双潜变量协作解码平衡保真度与感知质量,实验表明在宽比特率范围内优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14366 2026-05-15 cs.CL cs.LG

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

基于语义奖励的强化学习实现低资源语言扩展而不产生对齐税

Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

机构 * Minzu University of China(中国民族大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hainan International College, Minzu University of China(中国民族大学海南国际学院)

AI总结 本文提出基于语义空间对齐的GRPO方法,通过嵌入层语义奖励优化,减少对预训练知识的破坏性干扰,提升低资源语言扩展效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11775 2026-05-15 cs.LG cs.CL

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control

强化微调中的熵极性:方向、不对称性与控制

Jiazheng Zhang, Ziche Fu, Junrui Shen, Yunbin Zhao, Yunke Zhang, Zhiheng Xi, Long Ma, Chenxin An, Zhihao Zhang, Shichun Liu, Dingwei Zhu, Shihan Dou, Shaofan Liu, Han Li, Wiggin Zhou, Aiden Adams, Tao Gui, Fei Huang, Qi Zhang, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学自然语言处理组) Honor Device Co Ltd(荣誉设备有限公司) University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文心)

AI总结 本文提出熵极性理论框架,揭示熵变化的token级机制,开发PAPO算法通过优势重加权实现熵控制,实验显示其在数学推理和代理基准中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11410 2026-05-15 cs.AI

What Do EEG Foundation Models Capture from Human Brain Signals?

EEG基础模型从人类大脑信号中捕捉了什么?

Ling Tang, Qian Chen, Jilin Mei, Houshi Xu, Quanshi Zhang, Jing Shao, Na Zou, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tongji University(同济大学) University of Houston(休斯顿大学)

AI总结 研究探讨EEG基础模型如何从原始信号中学习,并通过实验验证其表示与特征工程基线的对齐情况,揭示了模型学习、使用及解释性方面的关键发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06132 2026-05-15 cs.CL

MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval

MemReranker:面向智能体记忆检索的推理增强重排序

Chunyu Li, Mengyuan Zhang, Jingyi Kang, Ding Chen, Jiajun Shen, Bo Tang, Xuanhe Zhou, Feiyu Xiong, Zhiyu Li

机构 * China Telecom Research Institute(中国电信研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 MemReranker通过多阶段LLM知识蒸馏构建,解决记忆检索中语义相关但缺乏关键信息的问题,提升重排序模型的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏