arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-08 至 2026-05-08 共收录 18
2605.06481 2026-05-08 cs.RO

OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation

OA-WAM:面向鲁棒机器人操作的对象可寻址世界动作模型

Yushan Liu, Peibo Sun, Shoujie Li, Yifan Xie, Lingfeng Zhang, Xintao Chao, Shiyuan Dong, Fang Chen, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 OA-WAM通过分解帧为N+1槽状态,结合文本、图像和动作历史,提升机器人操作的鲁棒性,其可寻址对象状态在场景扰动下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06472 2026-05-08 cs.LG

Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management

基于预测的动态代理工作流高效服务系统

Haoyu Zheng, Fangcheng Fu, Jia Wu, Binhang Yuan, Yongqiang Zhang, Hao Wang, Yuanyuan Zhu, Xiao Yan, Jiawei Jiang

机构 * Wuhan University(武汉大学) Dameng Database(达梦数据库) Shanghai Jiao Tong University(上海交通大学) Macquarie University(麦考瑞大学) HKUST(香港科技大学)

AI总结 本文提出PBKV系统,通过预测未来代理调用并管理KV缓存,提升动态工作流的效率,实验显示在动态工作流中比LRU快1.85倍,在静态工作流中比KVFlow快1.26倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06407 2026-05-08 eess.AS cs.AI cs.CL

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

WavCube:通过语义-声音联合建模统一语音表示以实现理解和生成

Guanrou Yang, Tian Tan, Qian Chen, Zhikang Niu, Yakun Song, Ziyang Ma, Yushen Chen, Zeyu Xie, Tianrui Wang, Yifan Yang, Wenxi Chen, Qi Chen, Wenrui Liu, Shan Yang, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Tencent(腾讯) Independent Researcher(独立研究员) Peking University(北京大学) Tianjin University(天津大学) Zhejiang University(浙江大学)

AI总结 WavCube通过语义-声音联合建模统一语音表示,解决语音理解和生成的表示兼容问题,实现压缩后的高性能语音任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06347 2026-05-08 cs.HC cs.AI

Human-AI Co-Evolution and Epistemic Collapse: A Dynamical Systems Perspective

人类与人工智能的共演与知识崩溃:一种动态系统视角

Xuening Wu, Yanlan Kang, Qianya Xu, Kexuan Xie, Jiaqi Mi, Honggang Wang, Yubin Liu, Zeping Chen

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of California San Diego(加州大学圣地亚哥分校) Nanjing University of Posts and Telecommunications(南京邮电大学)

AI总结 本文从动态系统视角探讨人类与语言模型的共演及知识崩溃问题,提出人类与模型形成反馈闭环的耦合系统,通过三变量模型揭示共进化增强、脆弱均衡和退化收敛三种动态模式。

Comments 5 pages, 3 figures, ICML EIML Workshop submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06326 2026-05-08 cs.CL

Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning

教授思考模型进行工具推理:一种完整的全管道配方用于工具集成推理

Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng, Yun Luo, Ganqu Cui

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种全管道配方,通过注入自然工具使用行为提升强思考模型的工具集成推理能力,同时保持文本推理能力,展示在Qwen3模型上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05950 2026-05-08 cs.CL

Lightweight Stylistic Consistency Profiling: Robust Detection of LLM-Generated Textual Content for Multimedia Moderation

轻量级风格一致性剖析:面向多媒体审核的LLM生成文本稳健检测

Siyuan Li, Aodu Wulianghai, Xi Lin, Xibin Yuan, Qinghua Mao, Guangyan Li, Xiang Chen, Jun Wu, Jianhua Li

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出LiSCP方法,通过结合离散风格特征与连续语义信号,提升对抗环境下的LLM生成文本检测鲁棒性,实现在多领域中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18738 2026-05-08 cs.CL

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Large Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11016 2026-05-08 cs.CV cs.AI

SoccerMaster: A Vision Foundation Model for Soccer Understanding

SoccerMaster: 一种用于足球理解的视觉基础模型

Haolin Yang, Jiayuan Rao, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出SoccerMaster,一种统一的足球视觉理解模型,通过多任务预训练统一处理从细粒度感知到高层语义推理的多种任务,实验表明其在多种下游任务中表现优异。

Comments Accepted by CVPR 2026 (Oral); Project Page: https://haolinyang-hlyang.github.io/SoccerMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08416 2026-05-08 eess.SP cs.IT cs.LG cs.MM math.IT

Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications

生成AI遇见6G与未来:扩散模型在语义通信中的应用

Hai-Long Qin, Jincheng Dai, Guo Lu, Shuo Shao, Sixian Wang, Tongda Xu, Wenjun Zhang, Ping Zhang, Khaled B. Letaief

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文探讨生成AI与6G通信的结合,介绍扩散模型在语义通信中的应用,分析其在可控生成、高效推理和跨域适应中的核心方法及贡献。

Comments Accepted by IEEE COMST, GitHub repository: https://github.com/qin-jingyun/Awesome-DiffComm, project page: https://qin-jingyun.github.io/Awesome-DiffComm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05899 2026-05-08 cs.LG

VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading

VisMMOE:利用视觉专家亲和力实现高效的视觉语言MoE卸载

Cheng Xu, Xiaofeng Hou, Jiacheng Liu, Chao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 VisMMOE通过剪枝冗余视觉token提升视觉语言MoE模型的卸载效率,通过视觉专家亲和力机制优化专家访问集中度与稳定性,从而提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05897 2026-05-08 cs.RO

Generating Roadside LiDAR Datasets from Vehicle-Side Datasets via Novel View Synthesis

通过新颖视角合成从车辆侧数据生成道路侧LiDAR数据集

Yuhan Xia, Runxin Zhao, Hanyang Zhuang, Chunxiang Wang, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai 200240, China(自动化与智能感知学院,上海交通大学,上海200240,中国) Key Laboratory of System Control and Information Processing, Ministry of Education of China, Shanghai 200240, China(系统控制与信息处理重点实验室,中华人民共和国教育部,上海200240,中国) Global College, Shanghai Jiao Tong University, Shanghai 200240, China(全球学院,上海交通大学,上海200240,中国)

AI总结 本文提出VRS框架,通过LiDAR新颖视角合成从车辆侧数据生成标注道路侧LiDAR数据集,缓解车辆到道路域差距,提升道路侧感知模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05738 2026-05-08 cs.LG cs.AI

CoMemNet: Contrastive Sampling with Memory Replay Network for Continual Traffic Prediction

CoMemNet:基于记忆回放网络的对比采样用于持续交通预测

Mei Wu, Wenchao Weng, Wenxin Su, Wenjie Tang, Wei Zhou

机构 * College of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) School of Automation, Nanjing University of Science and Technology(南京理工大学自动化学院)

AI总结 CoMemNet提出一种双分支持续学习框架,通过动态对比采样和轻量级记忆缓冲器解决持续交通预测中的灾难性遗忘问题,实验证明其在三大真实世界数据集上达到SOTA性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05710 2026-05-08 cs.LG

On the Blessing of Pre-training in Weak-to-Strong Generalization

在弱到强泛化中预训练的恩赐

Wei Yao, Wang Zhaoyang, Gengze Xu, Chen Qian, Dongrui Liu, Ziqiao Wang, Yong Liu, Yunbei Xu

机构 * Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学)

AI总结 本文研究了弱到强泛化现象,发现预训练是其必要前提,理论和实验均证明预训练通过提供几何热启动使模型进入有效区域,从而实现泛化。

Comments 40 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05593 2026-05-08 cs.AI

Causal Probing for Internal Visual Representations in Multimodal Large Language Models

多模态大语言模型内部视觉表征的因果探测

Zehao Deng, Tianjie Ju, Zheng Wu, Liangbo He, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ant Group(蚂蚁集团)

AI总结 研究通过激活引导框架系统干预四个视觉概念类别,揭示实体记忆局部化与抽象概念全局分布的差异,发现模型深度对复杂抽象概念编码至关重要,且反向引导揭示感知与生成之间的补偿机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05262 2026-05-08 stat.ML cs.AI cs.LG

Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning

在固定预算下最大化 rollout 信息量:一种用于工具使用代理强化学习的子模性视角的树搜索

Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Maritime University(上海 Maritime 大学)

AI总结 本文提出在固定预算下最大化 rollout 信息量的问题,通过将中间状态选择转化为单调子模最大化问题,提出 InfoTree 框架,结合 UUCB 和 ABA,提升性能。

Comments Preprint, 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05227 2026-05-08 cs.LG cs.AI

Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods

重新思考大语言模型训练中的数据整理:在线重加权优于离线方法

Wanru Zhao, Yihong Chen, Yuzhi Tang, Wentao Ma, Shengchao Hu, Shell Xu Hu, Alex Iacob, Abhinav Mehrotra, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) OATML, University of Oxford(牛津大学OATML实验室) University of Toronto(多伦多大学) Shanghai Jiao Tong University(上海交通大学) Samsung AI Center(三星人工智能中心)

AI总结 本文提出ADAPT框架,通过动态在线重加权提升模型泛化能力,实验显示其在指令微调和大规模预训练中优于传统离线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00117 2026-05-08 cs.RO cs.AI

PEPA: a Persistently Autonomous Embodied Agent with Personalities

PEPA:具有个性的持续自主体

Kaige Liu, Yang Li, Lijun Zhu, Weinan Zhang

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室)

AI总结 本文提出PEPA框架,通过三层认知架构实现持续自主,利用个性特质自主生成目标并维持行为演化,实验证明其在动态环境中稳定运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07906 2026-05-08 cs.LG cs.AI

AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering

AceGRPO:自适应课程增强的群体相对策略优化用于自主机器学习工程

Yuzhu Cai, Zexi Liu, Xinyu Zhu, Cheng Wang, Yanfeng Wang, Siheng Chen

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出AceGRPO,通过动态数据缓冲和可学习潜力函数提升自主机器学习工程的持续迭代优化能力,实验证明其在MLE-Bench-Lite上达到100%有效提交率。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏