arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-07-28 至 2026-07-28 共收录 14
2607.24493 2026-07-28 cs.RO 新提交

KAI: A Kinematic-Aware Interface for Data-Efficient Articulated Object Manipulation

KAI:用于数据高效关节物体操纵的运动感知接口

Yaping Li, Zhaxizhuoma, Qiaojun Yu, Jia Zeng, Dahua Lin, Jiangmiao Pang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究关节物体操纵中运动结构难学问题,提出运动感知关节接口KAI,通过嵌入先验提高样本效率,在多模拟任务中表现良好,能推广到复杂场景,视频共训练增强真实世界鲁棒性。

Comments Project page: https://li-yaping.github.io/KAI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24403 2026-07-28 cs.CV 新提交

GenSplatCodec: Feed-Forward Gaussian Splatting Compression via One-Step Diffusion

GenSplatCodec:通过一步扩散实现前馈高斯点云压缩

Qiang Hu, Zhenlong Wu, Lei Huang, Zihan Zheng, Xiaoyun Zhang, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体网络创新中心)

AI总结 研究针对前馈3D高斯点云压缩难题,提出GenSplatCodec统一编解码器,采用双流编码与几何引导生成解码,经三阶段优化策略,在多数据集实验中展现出优于现有方法的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24218 2026-07-28 cs.LG cs.AI 新提交

Every Client Is an Environment: Federated De-confounding for Spatio-Temporal Forecasting

每个客户端都是一个环境:用于时空预测的联邦去混淆

Qingxiang Liu, Anqi Liang, Heng Wang, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Harbin Engineering University(哈尔滨工程大学)

AI总结 针对时空预测,提出联邦去混淆框架\method,将客户端视为不同因果环境,利用客户端异质性作为分布式环境证据,学习全局原型码本捕获共享环境模式,推导理论边界,实验证明其优于联邦基线,提供可转移等环境表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24148 2026-07-28 cs.AI 新提交

A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

一种用于高效视觉-语言-动作推理的具有质心重用的运动感知向量量化框架

Zhuoran Song, Haozhe Jiang, Chunyu Qi, Minnan Pei, Gang Li, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对VLA模型推理延迟高问题,提出VQVLA算法-硬件协同设计框架,利用MotionVQ动态调整量化精度,采用合并质心向量量化通用矩阵乘法范式,设计加速器,实验表明其相比多种方法有显著加速且精度损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24082 2026-07-28 cs.AI 新提交

Towards High-Level Semantic Intelligence

迈向高级语义智能

Xiujie Song, Gefei Yang, Yining You, Jiahui Gan, Qi Jia, Shota Watanabe, Tianxi Wan, Mengyue Wu, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 综述从语义复杂性角度审视人工智能语义智能发展,系统调研高级语义任务研究,总结理解和生成的相关方法及策略,旨在推动人工智能向高级语义智能持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23615 2026-07-28 cs.LG 新提交

Restoration Flow Matching-Based Channel Refinement and Equalization Correction for MIMO Semantic Communications

基于恢复流匹配的MIMO语义通信信道细化与均衡校正

Wenkai Liu, Nan Ma, Jianqiao Chen, Xiaodong Xu, Meixia Tao, Ping Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ZGC Institute of Ubiquitous-X Innovation and Applications(中关村泛在X创新与应用研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对MIMO语义通信中信道和均衡问题,提出基于恢复流匹配的框架,含CRFM和SRFM模块,通过双锚点扰动训练策略增强鲁棒性,经ODE求解器推理,实验证明提高了相关指标且采样步骤少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23607 2026-07-28 cs.LG cs.CL 新提交

MS-GPT: Rethinking MS/MS De Novo Structure Elucidation as Spectrum-Induced Posterior Querying of a Molecule-Language Model

MS-GPT:将串联质谱的从头结构解析重新思考为分子语言模型的谱诱导后验查询

Xin Zhao, Yumin Liu, Zhuo Li, Weichu Zheng, Feng Zhu, Xiaokang Yang, Yaohui Jin, Yanyan Xu

机构 * ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对MS/MS分子结构解析问题,提出MS-GPT方法,将指纹介导的从头解析重铸为谱诱导后验查询分子语言模型,经校准、排序等操作,在NPLIB1和MassSpecGym上达新最优水平,提升召回率且增加少量推理成本。

Comments 18 pages, 14 figures, and 9 tables, including appendices. Source code and model checkpoints are available at https://github.com/VIKI623/MS-GPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22770 2026-07-28 cs.LG cs.CV 新提交

Dementia Etiology Diagnosis via Collaborative Meta Knowledge Enhancement

通过协作元知识增强进行痴呆病因诊断

Siyuan Du, Mengxi Chen, Xinyang Jiang, Zilong Wang, Jiangchao Yao, Dongsheng Li, Ya Zhang, Lili Qiu, Yanfeng Wang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体网络创新中心) Microsoft Research Asia(微软亚洲研究院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 针对痴呆病因诊断中因数据异质性导致的挑战,提出协作元知识增强(COME)框架,将多中心采集语义等作为异质性感知嵌入注入Transformer架构,并设计优化方案。该方法在多队列中性能达最优,有良好泛化能力,还能与生物标志物及临床严重程度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22653 2026-07-28 cs.AI 新提交

Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation

语言模型会收敛到自身吗?递归自精炼作为文本松弛

Xuening Wu, Qianya Xu, Yanlan Kang, Zeping Chen, Yubin Liu, Shenqin Yin

机构 * Pfizer(辉瑞公司) University of California San Diego(加利福尼亚大学圣地亚哥分校) Institute for Medical Philosophy and Future Artificial Intelligence(医学哲学与未来人工智能研究所) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)

AI总结 研究大语言模型递归自精炼工作流程的长期动态。通过生成精炼轨迹并分析多种指标,发现轨迹迅速饱和,编辑多在前几次迭代,确定性解码表现更好,平均编辑幅度呈指数松弛,收敛摘要有多种优势,支持动态系统观点并推动停止标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21075 2026-07-28 cs.SD cs.CL eess.AS 版本更新

VibeVoice-ASR-BitNet Technical Report

VibeVoice-ASR-BitNet技术报告

Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

机构 * Microsoft Research(微软研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 介绍VibeVoice-ASR-BitNet,针对边缘CPU实时推理优化。采用异构量化及渐进式量化感知训练,在ggml框架实现自定义内核和运算符,可比模型大小下速度快1.6 - 2.3倍,准确性略降。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10577 2026-07-28 cs.RO 版本更新

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav:零样本视觉与语言导航作为工具调用框架

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11912 2026-07-28 cs.LG cs.AI 版本更新

How Transformers Learn to Plan via Multi-Token Prediction

Transformer 如何通过多令牌预测学习规划

Jianhao Huang, Zhanpeng Zhou, Renqiu Xia, Baharan Mirzasoleiman, Weijie Su, Wei Huang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所)

AI总结 本文研究多令牌预测如何促进推理,特别是规划,通过实验和理论分析展示其优于单令牌预测的性能及背后的机制。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏