arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-06-23 至 2026-06-23 共收录 42
2606.21854 2026-06-23 eess.AS cs.SD 新提交

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

ESPnet3:基础模型时代可扩展语音与音频研究的基础设施

Masao Someki, Alexander Polok, Carlos Carvalho, Chyi-Jiunn Lin, Da-Hee Yang, Jiatong Shi, Jinchuan Tian, Nelson Enrique Yalta Soplin, Samuele Cornell, Siddhant Arora, Francisco Teixeira, Wei Wang, William Chen, Alberto Abad, Chenda Li, Shinji Watanabe, Wangyou Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Brno University of Technology(布拉格技术大学) Instituto Superior Técnico(技术高等研究院) Hanyang University(翰阳大学) Hitachi Astemo(日立阿美士多) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ESPnet3框架,通过模块化系统架构、配置驱动的数据集组合和统一Python工作流,实现大规模语音音频研究的高效训练与扩展,显著降低工程开销。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23623 2026-06-23 cs.RO 新提交

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23589 2026-06-23 cs.RO 新提交

KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies

KEMO: 面向长程机器人操作的VLA策略事件驱动关键帧记忆

Yihan Zeng, Minghao Ye, Yiyuan Chen, Yide Shentu, Philipp Wu, Zike Yan, Zhongyu Li

机构 * Hong Kong Embodied AI Lab(香港具身智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出KEMO,一种轻量级插件式记忆框架,通过事件驱动选择关键帧并编码为紧凑记忆令牌,结合交叉注意力和门控残差融合,提升VLA策略在长程操作中的任务成功率23.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23539 2026-06-23 cs.CV 新提交

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

LightSTAR: 通过视觉自适应精炼的轻量级选择实现高效视觉文档检索

Tongkun Guan, Haocheng Wang, Wei Shen, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院教育部人工智能重点实验室)

AI总结 提出LightSTAR框架,通过免LLM的视觉选择快速筛选候选页,再经视觉自适应语义精炼进行细粒度匹配,在保持高检索精度的同时大幅降低延迟。

Comments Accpeted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23494 2026-06-23 cs.CV 新提交

Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies

Brain-Adapter: 一种用于急性颅内病理综合3D CT诊断的双流视觉-语言MIL框架

Zhenyu Yi, Zhiyun Song, Yusong Sun, Zelin Liu, Manman Fei, Zhenhao Li, Jiaxuan Zhao, Xu Han, Lichi Zhang

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

AI总结 提出Brain-Adapter双流多实例学习框架,利用预训练2D生物医学视觉-语言模型和原始诊断报告,通过文本条件注意力和不确定性感知融合实现3D CT扫描的多标签分类,无需密集标注。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23473 2026-06-23 cs.CV 新提交

C^2GR: Coupled Comprehensive Generative Replay for a Continually Learnable Universal Segmentation Model

C^2GR: 用于持续学习通用分割模型的耦合综合生成回放

Wei Li, Jingyang Zhang, Guoan Wang, Junzhi Ning, Yang Chen, Guang Yang, Lixu Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Imperial College London(伦敦帝国学院)

AI总结 针对通用分割模型在任务增量学习中因图像外观和分割目标同时变化导致的遗忘问题,提出C^2GR框架,通过贝叶斯联合扩散和关系感知统一提示同步,合成历史任务图像-掩码对,缓解遗忘,性能仅下降2.44%。

Comments This paper has been submitted to a relevant journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23293 2026-06-23 cs.CV cs.RO 新提交

Flow6D: Discrete-to-Continuous Flow Matching for Efficient and Accurate Category-Level 6D Pose Estimation

Flow6D: 离散到连续的流匹配用于高效且准确的类别级6D姿态估计

Mingyu Mei, Li Zhang, Zibo Dai, Han Sun, Xinyue Zhao, Huiliang Shen, Zaixing He

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Flow6D分层流匹配框架,通过两阶段离散潜空间定位-连续姿态回归策略,先离散化姿态参数并用离散流匹配缩小搜索空间,再连续流匹配预测局部残差优化姿态,在合成和真实数据集上以70 FPS实现实时推理,性能优于现有方法。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23153 2026-06-23 cs.RO 新提交

Asymmetric physics enables efficient learning in quadrupedal robot swarms

非对称物理使四足机器人群体高效学习成为可能

Yuang Zhang, Yunlong Song, Zhihao He, Zelin Ni, Kangyu Wang, Tianchi Liu, Yu Hu, Feng Yu, Danping Zou, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Independent Researcher(独立研究者)

AI总结 通过非对称物理方法,将高保真非可微模拟器与可微代理模型结合,实现多达512个四足机器人在障碍环境中高效学习视觉去中心化协调策略,并零样本迁移到真实机器人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23079 2026-06-23 cs.RO cs.AI 新提交

AdaReP:Adaptive Re-Planning under Model Mismatch for Neural World-Model Predictive Control

AdaReP:模型失配下的自适应重规划用于神经世界模型预测控制

Yutian Cheng, Xiaojian Ma, Xianhao Wang, Min Yang, Rongpeng Su, Hangxin Liu, Xi Chen, Shuai Li, Qing Li

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) University of Science and Technology of China(中国科学技术大学)

AI总结 针对神经世界模型预测控制中重规划计算开销大的问题,提出AdaReP方法,通过在线自适应调整重规划容忍度,在保持任务性能的同时大幅减少规划器计算量。

Comments Accepted at ICANN 2026. This arXiv version contains supplementary materials and appendices that are omitted from the conference version due to space limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23028 2026-06-23 cs.CV cs.AI 新提交

Physics-Guided Spatiotemporal State Space Modeling for Lookahead Molten Pool Segmentation in Laser Wire-Feed Welding

物理引导的时空状态空间建模用于激光送丝焊接中的前瞻熔池分割

Sen Li, Haichao Cui, Changhao Yin, Chendong Shao, Yaqi Wang, Xinhua Tang, Fenggui Lu

机构 * Shanghai Key Laboratory of Materials Laser Processing and Modification, School of Materials Science and Engineering, Shanghai Jiao Tong University(上海交通大学材料科学与工程学院上海市激光制造与材料改性重点实验室)

AI总结 提出物理引导的时空状态空间网络WeldMamba,利用历史图像、工艺参数和电信号预测未来熔池语义区域,在500ms前瞻下达到74.63% mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22999 2026-06-23 cs.CV 新提交

Black-Box Continual Learning for Vision-Language Models

视觉语言模型的黑盒持续学习

Yuting Li, Weihang Fang, Haoyuan Gao, Linghe Kong, Yexin Li, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 提出黑盒持续学习基准Black-CL,仅通过输出嵌入或logits进行学习,并设计BETA方法,通过优化文本原型实现与白盒方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22876 2026-06-23 cs.CV 新提交

Full-Body Golf Swing Kinematic Reconstruction From a Smartwatch IMU

基于智能手表IMU的全身高尔夫挥杆运动学重建

Yuanshuo Tan, Kezhe Zhu, Xiujie Sun, Chunping Liang, Shuoyang Zhu, Chenquan Xu, Licheng Zhong, Huiming Pan, Yinri Jin, Chang Liu, Bo Xiao, Shenglong Le, Bryndan W. Lindsey, Peter B. Shull

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械与动力工程学院机械系统与振动国家重点实验室) Key Laboratory for Power Machinery and Engineering of the Ministry of Education, Shanghai Jiao Tong University(上海交通大学动力机械与工程教育部重点实验室) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) School of Physical Education, Shanghai University of Sport(上海体育大学体育教育学院) Department of Physical Education, Shanghai Jiao Tong University(上海交通大学体育系) Department of Physical Therapy(物理治疗系)

AI总结 提出一种单手腕IMU方法(WIT-KinNet),通过时间运动编码学习手腕到全身关节角度映射,实现高尔夫挥杆全身运动学估计,平均绝对误差8.11°。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22823 2026-06-23 cs.LG q-bio.QM 新提交

Retrieval-Augmented Multimodal Learning for Enzyme-Substrate Interaction Prediction Under Low-Homology Shift

检索增强的多模态学习用于低同源性偏移下的酶-底物相互作用预测

Chen Liu, Bingxin Zhou, Xinyuan Wang, Ming Li, Guisheng Fan, Liang Hong

机构 * School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院) Institute of Natural Sciences and Zhangjiang Institute for Advanced Study, Shanghai Jiao Tong University(上海交通大学自然科学研究院和张江高等研究院) School of Life Sciences and Biotechnology, Shanghai Jiao Tong University(上海交通大学生命科学技术学院)

AI总结 提出RAMMESI框架,通过跨模态交互建模、自适应融合和检索增强,解决酶-底物相互作用预测中稀疏正监督和低同源性分布偏移问题,在低序列一致性场景下表现优异。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22806 2026-06-23 cs.CV 新提交

Policy-as-Data: Learning Generalizable HOI Diffusion Models from Simulated Physics

策略即数据:从模拟物理学中学习可泛化的人-物交互扩散模型

Shujia Li, Jianshu Hu, Haiyu Zhang, Yunpeng Jiang, Haoyuan Jin, Xinyuan Chen, Yaohui Wang, Yutong Ban

机构 * Global College, Shanghai Jiao Tong University(上海交通大学致远学院) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

AI总结 提出利用物理模拟器中的强化学习策略生成任务导向数据,结合粗到细重定向流程弥合表示差距,训练扩散模型实现可泛化的人-物交互生成,在未见物体和长时域生成上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22801 2026-06-23 cs.CV 新提交

Learning Adaptive Dynamical Features via Multi-$τ$ Liquid-Mamba for All-in-one Image Restoration

学习自适应动态特征:用于全能图像恢复的多τ液态Mamba

Hu Gao, Changshuo Wang, Yulong Chen, Lizhuang Ma

机构 * Department of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术系) Department of Architecture and Design, Harbin Institute of Technology(哈尔滨工业大学建筑与设计系)

AI总结 提出Multi-τ Liquid-Mamba模块,通过输入条件多时间尺度液态离散化改进选择性状态空间建模,实现自适应动态特征学习,在全能图像恢复中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22631 2026-06-23 cs.CV 新提交

4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking

4DVLT:以世界线为中心的视觉-语言跟踪动态场景理解

Chaoyue Li, Boxue Yang, Shengyao Zhou, Haoyang Wu, Rui Qian, Linfeng Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出世界线为中心的4D动态场景理解任务4DVLT及基准Instruct-4D,通过图条件世界线推理方法4DTrack实现指令跟踪,在指标上超越基线19.62点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22557 2026-06-23 cs.AI cs.CL cs.HC 新提交

MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

MacAgentBench: 在真实macOS桌面上基准测试AI代理

Yikun Fu, Bowen Fu, Zhenyu Wu, Shuang Cheng, Xiaowei Sun, Bowen Yang, Zehao Li, Yibo Zhao, Zichen Ding, Zhoumianze Liu, Shijie Wang, Biqing Qi, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Tsinghua University(清华大学)

AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22460 2026-06-23 cs.IR cs.LG 新提交

Music Playlist Captioning at Scale with Large Language Models

基于大语言模型的音乐播放列表标题生成规模化方法

Mathieu Delcluze, Léa Briand, Benjamin Chapus, Deniz Mekik, Guillaume Salha-Galvan

机构 * Deezer Research SJTU Paris Elite Institute of Technology(Deezer研究 SJTU巴黎精英技术研究所)

AI总结 提出利用大语言模型从多源数据生成播放列表描述,部署于Deezer的Daily Mix功能,显著提升用户参与度。

Comments ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22353 2026-06-23 cs.CV 新提交

Interest Entanglement: The Hidden Barrier to Blind Super-Resolution Optimization

兴趣纠缠:盲超分辨率优化的隐藏障碍

Junxiong Lin, Xinji Mai, Qianyu Guo, Haoran Wang, Zeng Tao, Xuan Tong, Ivy Pan, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The University of Hong Kong(香港大学) Shanghai Institute of Virology, Shanghai Jiao Tong University School of Medicine(上海病毒研究所,同济大学医学院)

AI总结 针对图像超分辨率中保真度与感知质量冲突的问题,提出基于共享特征表示的超分辨率框架(SFR),通过解耦不同优化目标的学习过程并引入InfoSqueeze模块,实现两者有效平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22116 2026-06-23 cs.RO 新提交

DeformX: A Versatile Co-Simulation Framework for Deformable Linear Objects

DeformX: 一种用于可变形线性物体的多功能协同仿真框架

Yi Yang, Xiang Fei, Lehong Wang, Chenhao Li, Zilin Dai, Henry Kou, Lu Li, Howie Choset

机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) School of Ocean and Civil Engineering, Shanghai Jiao Tong University(上海交通大学海洋与土木工程学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院)

AI总结 提出DeformX框架,集成Cosserat杆物理引擎与NVIDIA Isaac Sim,实现可变形线性物体的物理精确与视觉真实仿真,支持机器人学习,在真实线缆分割和绳索摆动任务中验证了仿真到现实的迁移能力。

Comments 11 pages, 11 figures, 5 tables, IROS 2026. Website: https://deformx.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21527 2026-06-23 cs.RO cs.CV 新提交

LOGOS: LiDAR-Only Gaussian Elevation Splatting for Unified Tiny Obstacle Segmentation

LOGOS: 仅基于激光雷达的高斯高程喷溅用于统一微小障碍物分割

Nan Ming, Yeqiang Qian, Chunxiang Wang, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 提出LOGOS系统,通过将路面建模为2D高斯原语的连续混合,利用无反向传播的激光雷达方法估计高程,实现微小障碍物分割,在道路和越野场景中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21509 2026-06-23 cs.RO 新提交

A Stitch in Time Saves Nine: Preserving Policy Compatibility Under Perception Updates in End-to-End Autonomous Driving

小洞不补,大洞吃苦:端到端自动驾驶中感知更新下的策略兼容性保持

Yueyuan Li, Yifei Xiao, Mingyang Jiang, Xiang Zuo, Songan Zhang, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(教育部系统控制与信息处理重点实验室) School of Aeronautics and Astronautics, Shanghai Jiao Tong University(上海交通大学航空航天学院) Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学全球未来技术学院)

AI总结 本文提出通过轻量级潜在空间对齐(模型拼接)来保持端到端自动驾驶系统中更新感知模块与固定策略模块的兼容性,避免重训练或架构解耦的高成本,实验证明在多种更新场景下有效。

Comments 12 pages, 9 tables, 5 figures; T-ITS under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21501 2026-06-23 cs.RO 新提交

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Xiaomi EV(小米汽车)

AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21240 2026-06-23 cs.CR cs.CV 新提交

DIPBox: A Multi-scale Testing Framework for Tracking Dataset Regeneration

DIPBox:用于追踪数据集再生的多尺度测试框架

Tian Dong, Yan Meng, Shaofeng Li, Guoxing Chen, Yuling Chen, Zhen Liu, Haojin Zhu, Hao Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Guizhou University(贵州大学) The University of Hong Kong(香港大学)

AI总结 针对数据集再生威胁,提出多尺度特征相似度指标和DIPBox框架,通过样本级、集合级和分布级特征测试追踪再生数据集,实验验证其有效性。

Comments Accepted by ACM CCS 2026. Please cite this paper as "Tian Dong, Yan Meng, Shaofeng Li, Guoxing Chen, Yuling Chen, Zhen Liu, Haojin Zhu, Hao Chen. DIPBox: A Multi-scale Testing Framework for Tracking Dataset Regeneration. In the Proceedings of ACM Conference on Computer and Communications Security (CCS 2026)."

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21227 2026-06-23 cs.SD 新提交

Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

Bagpiper-Edit: 基于丰富描述的零样本开放式音频编辑

Xun Gong, Jinchuan Tian, Haoran Wang, William Chen, Shinji Watanabe, Yanmin Qian

机构 * Auditory Cognition and Computational Acoustics Lab, Shanghai Jiao Tong University(上海交通大学听觉认知与计算声学实验室) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 提出Bagpiper-Edit,通过将音频编辑转化为丰富描述重写任务,实现零样本、自由形式的开放式音频编辑,无需配对训练数据,在语音、音乐和声音上均表现良好。

Comments Accepted by InterSpeech 2026, For the original codes, see https://github.com/HsunGong/espnet/blob/master/egs2/opuslm_v2/speechlm1, we are submitting a PR to espnet master branch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21223 2026-06-23 cs.RO 新提交

Ultra-Fusion: A Resilient Tightly-Coupled Multi-Sensor Fusion SLAM Framework under Sensor Degradation and Spatiotemporal Perturbation for Intelligent Transportation Systems

Ultra-Fusion:面向传感器退化与时空扰动下智能交通系统的鲁棒紧耦合多传感器融合SLAM框架

Yihong Tian, Junjie Zhang, Liuyang Li, Deteng Zhang, Yunfei Zuo, Jie Yin

机构 * Beijing Institute of Technology(北京理工大学) Chongqing University(重庆大学) Sichuan University(四川大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Ultra-Fusion紧耦合多传感器融合SLAM框架,通过可观测性感知初始化、因子级可靠性调度和在线LiDAR-IMU时空标定,在传感器退化与时空扰动下实现鲁棒定位,在多种平台和基准上验证了高精度与可用性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21172 2026-06-23 cs.CV 新提交

BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving

BadDreamer: 针对自动驾驶视频世界模型的可迁移后门攻击

Zhe Shuai, Xiaopeng Xie, Yikun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出BadDreamer,一种针对自动驾驶视频世界模型的可迁移时空后门攻击,通过污染未来帧中的触发-擦除序列,使模型在物理触发出现时幻觉化障碍物消失,进而误导下游动作预测。

Comments 19 pages, 8 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21144 2026-06-23 cs.CL cs.AI 新提交

AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents

AdaMem: 学习为个性化长时程LLM代理记住什么

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 针对长时程LLM代理中记忆膨胀导致QA准确率下降的问题,提出AdaMem方法,通过角色特定的记忆策略和基于反馈的轻量级自反思步骤,学习为每个用户记住重要信息,在减少9%记忆量的同时提升QA准确率最高9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21013 2026-06-23 cs.AI cs.LG 新提交

Agentic Time Machine as an Infrastructure for Future-Event Forecasting

Agentic Time Machine:未来事件预测的基础设施

Jingyi Chai, Bingyang Zheng, Xiangrui Liu, Hao Lu, Zihang Zhou, Tianchen Wang, Kemeng Zhang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Agentic Time Machine(TM)基础设施,通过过滤截止后内容重建历史网络状态,并基于此设计规划-求解-聚合多智能体框架,实现高效且可靠的事件预测,在FutureX排行榜上取得最佳平均排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20591 2026-06-23 cs.NI cs.AI 新提交

Delay-Adaptive Speculation Control for Low-Latency Edge-Cloud LLM Inference

面向低延迟边缘-云LLM推理的延迟自适应推测控制

Kangkang Sun, Jianhua Li, Xiuzhen Chen, Junyi He, Minyi Guo

机构 * Shanghai Key Laboratory of Integrated Administration Technologies for Information Security, School of Computer Science, Shanghai Jiao Tong University(上海信息安全集成管理技术重点实验室,上海交通大学计算机科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(深圳大学理学院,香港中文大学(深圳))

AI总结 针对分布式边缘-云推理中推测解码的草稿长度在线控制问题,提出延迟单调阈值最优策略,并设计在线算法UCB-SpecStop,在真实测试台上验证了相变预测,延迟降低达22.4%。

Comments 16 pages, 9 figures, submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏