arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-05 至 2026-05-05 共收录 11
2605.01498 2026-05-05 cs.CV

Towards Visual Query Localization in the 3D World

面向3D世界的视觉查询定位

Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang

机构 * Wuhan University(武汉大学) AutoLab, SAI, Shanghai Jiao Tong University(AutoLab、SAI、上海交通大学) Anyverse Dynamics University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文首次提出3D多模态视觉查询定位基准3DVQL,包含2002个序列和17万帧数据,通过点云、RGB图像和深度图像多模态数据提升研究灵活性,并提出LaF算法提升性能。

Comments Accepted to CVPR 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01352 2026-05-05 cs.OS cs.AI cs.DC

VUDA: Breaking CUDA-Vulkan Isolation for Spatial Sharing of Compute and Graphics on the Same GPU

VUDA: 打破CUDA-Vulkan隔离以实现同一GPU上的计算与图形空间共享

Bin Xu, Pengfei Hu, Wenxin Zheng, Jinyu Gu, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 VUDA通过打破CUDA与Vulkan的执行隔离,实现计算与图形任务的空间并行,提升GPU利用率并减少端到端延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01222 2026-05-05 cs.AI

Zero-Shot Signal Temporal Logic Planning with Disjunctive Branch Selection in Dynamic Semantic Maps

动态语义地图中基于零样本信号时间逻辑的规划与离散分支选择

Bowen Ye, Ancheng Hou, Junyue Huang, Ruijia Liu, Xiang Yin

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, the Ministry of Education of China(中国教育部系统控制与信息处理重点实验室)

AI总结 本文提出一种零样本STL规划求解器,通过映射条件Transformer与轻量启发式结合,有效处理复杂离散子公式,利用传递强化学习确保时间一致性和逻辑连贯性,实验证明其在动态语义地图中具有优越的零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01208 2026-05-05 cs.AI

Faithful Mobile GUI Agents with Guided Advantage Estimator

忠实的移动GUI代理与引导优势估计器

Haowen Hu, Pengzhou Cheng, Zheng Wu, Lingzhong Dong, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Faithful-Agent框架,通过两阶段流程提升GUI交互的证据基础性和一致性,引入引导优势估计器GuAE,有效提升任务成功率并保持指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01199 2026-05-05 cs.LG

Focus and Dilution: The Multi-stage Learning Process of Attention

聚焦与稀释:注意力的多阶段学习过程

Zheng-An Chen, Pengxiao Lin, Zhi-Qin John Xu, Tao Luo

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University.(上海交通大学数学科学学院) Institute of Natural Sciences, Shanghai Jiao Tong University.(上海交通大学自然科学研究院) MOE-LSC, Shanghai Jiao Tong University.(教育部-上海交大语言研究所) CMA-Shanghai, Shanghai Jiao Tong University(上海交大CMA中心) Shanghai Seres Information Technology Co., Ltd, Shanghai 200040, China.(上海塞瑞斯信息技术有限公司)

AI总结 本文研究了Transformer模型注意力机制的多阶段学习过程,揭示了聚焦与稀释的循环机制,并通过实验验证了其动态特性。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00955 2026-05-05 cs.CR cs.AI

E-MIA: Exam-Style Black-Box Membership Inference Attacks against RAG Systems

E-MIA:针对RAG系统的考试风格黑盒成员推断攻击

Zelin Guan, Shengda Zhuo, Zeyan Li, Jinchun He, Wangjie Qiu, Zhiming Zheng, Shuqiang Huang

机构 * College of Cyber Security, Jinan University(济南大学网络安全学院) School of Computer Science, Shanghai Jiaotong University(上海交通大学计算机科学学院) Institute of Artificial Intelligence, Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京航空航天大学人工智能研究院) Zhongguancun Laboratory, Beijing(中关村实验室)

AI总结 本文提出E-MIA,通过将目标文档中的可验证硬证据转化为包含四种客观评分题型的考试,利用多证据目标问题的综合考试分数作为成员信号,提升在严格设置下的成员/非成员分离能力,同时保持自然隐蔽的查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15037 2026-05-05 cs.AI cs.CL cs.SD

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

从被动到主动:通过ProVoice-Bench评估语音代理的主动性

Ke Xu, Yuhao Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ProVoice-Bench评估框架,通过四个新任务评估语音代理的主动性,揭示当前模型在过度触发和推理能力上的不足,为开发更自然的主动代理提供方向。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02856 2026-05-05 cs.RO

Rhythm: Learning Interactive Whole-Body Control for Dual Humanoids

Rhythm: 为双人形机器人学习交互式全身控制

Hongjin Chen, Wei Zhang, Pengfei Li, Shihao Ma, Ke Ma, Yujie Jin, Zijun Xu, Xiaohui Wang, Yupeng Zheng, Zining Wang, Jieru Zhao, Yilun Chen, Wenchao Ding

机构 * Fudan University(复旦大学) TARS Robotics(TARS机器人) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出Rhythm框架,通过整合交互感知动作重定向、交互引导强化学习和现实部署系统,实现双人形机器人在复杂物理交互中的鲁棒控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08245 2026-05-05 cs.RO cs.AI

STEP: Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction

STEP: 带时空一致性的预热视觉运动策略

Jinhao Li, Yuxuan Cong, Yingqiao Wang, Hao Xia, Shan Huang, Yijia Zhang, Ningyi Xu, Guohao Dai

机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学,上海,中国。) Shanghai Innovation Institute, Shanghai, China.(上海创新研究院,上海,中国。)

AI总结 本文提出STEP策略,通过轻量级时空一致性预测机制生成高质量预热动作,同时保持生成能力。引入速度感知扰动注入机制,防止执行停滞,提升实时任务性能。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10554 2026-05-05 cs.CV

Grounding Everything in Tokens for Multimodal Large Language Models

基于令牌的多模态大语言模型的 grounding

Xiangxuan Ren, Zhongdao Wang, Liping Hou, Pin Tang, Guoqing Wang, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家模型关键实验室) AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

AI总结 本文提出GETok方法,通过整合可学习的令牌词汇提升多模态大语言模型在2D空间中的物体定位能力,实验显示其在多种指引用例任务中表现更优。

Comments 19 pages, 16 figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12778 2026-05-05 cs.CL

HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks

HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架

Zhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏