arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-27 至 2026-05-27 共收录 24
2605.26601 2026-05-27 cs.CV

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

FTibSuite:面向藏语视觉语言建模的综合资源套件

Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han

机构 * Hainan International College, Minzu University of China(民族大学海南国际学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对藏语视觉语言建模缺乏可复现训练和评估基础设施的问题,提出FTibSuite资源套件,包含数据集FTibData、基准FTibBench和基线模型FTibVLM,在多项任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27194 2026-05-27 cs.CL cs.CV cs.LG

Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

并非所有标记都同等重要:基于关键标记监督的动态上下文向量蒸馏用于长医学报告生成

Ning Wu, Rui Liu, Xinkun Lin, Weixing Chen, Jinxi Xiang, Tao Wei, Lina Yao, Mingjie Li

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Technology Sydney(技术大学悉尼分校) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出DIVE框架,通过关键标记监督和状态条件动态引导,解决长文本生成中标记级蒸馏忽略关键标记的问题,在医学报告生成任务上取得最佳性能。

Comments Preprint. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26778 2026-05-27 cs.AI

The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context

归因盲点:检测语言模型何时依赖记忆而非检索到的上下文

Zhe Yu, Wenpeng Xing, Yunzhao Wei, Bo Yang, Chen Ye, Gaolei Li, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) National Fintech Evaluation Center(国家金融科技评估中心) Hangzhou Dianzi University(杭州电子科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出计算现实监控(CRM)方法,通过比较有无上下文时的内部表征差异,检测语言模型是否依赖预训练记忆而非检索到的上下文进行生成,解决了输出级监控无法识别的归因盲点问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26754 2026-05-27 cs.CR cs.AI

Cordon-MAS: Defending RAG against Knowledge Poisoning via Information-Flow Control

Cordon-MAS:通过信息流控制防御 RAG 的知识投毒

Zhe Yu, Wenpeng Xing, Gaolei Li, Shuguang Xiong, Hongzhi Wang, Xuyang Teng, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Shanghai Jiao Tong University(上海交通大学) Zhejiang Lab(浙江实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 针对检索增强生成(RAG)中的 Confundo 式投毒攻击,提出 Cordon-MAS 框架,通过分离证据提取、跨源审计和答案合成到具有非对称内存权限的智能体中,将攻击成功率相对降低 92.4%,将投毒问题从检测重新定义为信息流控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26640 2026-05-27 eess.SY cs.LG cs.SY math.OC stat.ML

Sample Complexity of Policy Gradient for Log-Growth Control

对数增长控制的策略梯度样本复杂度

Qiuhua Pan, Yukai Shen, Liwei Zhang, Cailian Chen, Xinping Guan

机构 * State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(submarine 地球科学国家重点实验室,自动化与智能感知学院,上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理国家重点实验室,中华人民共和国教育部) Shanghai Key Laboratory of Perception and Control in Industrial Network Systems(上海工业网络系统感知与控制重点实验室) Paris Elite Institute of Technology, Shanghai Jiao Tong University(巴黎精英理工学院,上海交通大学)

AI总结 针对乘性噪声驱动标量线性系统的对数增长控制问题,利用奇点对称性消除梯度估计发散,证明了策略梯度的样本复杂度。

Comments 43 pages, 4 figures, 2 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26638 2026-05-27 cs.RO

HyperSim: A Holistic Sim-To-Real Framework For Robust Robotic Manipulation

HyperSim: 一种面向鲁棒机器人操作的整体仿真到现实框架

Junyi Dong, Haotian Luo, Ziwei Xu, Shengwei Bian, Heng Zhang, Sitong Mao, Jingyi Guo, Yang Xu, Wenhao Chen, Qiuyu Feng, Yao Mu, Ping Luo, Shunbo Zhou, Xiaodong Wu

机构 * CloudRobo Lab, Huawei Cloud Computing Technologies Co.,Ltd.(华为云计算技术有限公司云机器人实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

AI总结 本文提出HyperSim框架,通过高保真环境合成、对抗轨迹生成和仿真-现实联合训练三大支柱,系统性地缩小仿真到现实的域差距,在400次真实世界任务执行中实现了ACT和π0分别达到80%和95%的仿真到现实成功率。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26579 2026-05-27 cs.LG

Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards

Focal Reward: 基于评分标准的强化学习中的平衡奖励

Yu Huang, Zihua Zhao, Zhaoxin Huan, Wanli Gu, Feng Hong, Xinmu Ge, Lin Yuan, Weichang Wu, Qiang Hu, Xiaolu Zhang, Jun Zhou, Jiangchao Yao

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 针对大语言模型在基于多维评分标准的强化学习中奖励失衡的问题,提出Focal Reward方法,通过逆奖励投影机制估计各维度饱和程度并自动重加权,实现细粒度平衡,在18个模型-基准对比中均优于最强静态聚合基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26546 2026-05-27 cs.AI

MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration

MobileExplorer: 通过在线探索加速移动GUI代理的端侧推理

Runxi Huang, Liyu Zhang, Shengzhong Liu, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出MobileExplorer框架,通过在线探索并行探测UI元素并记录为结构化记忆,结合两级回滚机制,减少推理步骤和延迟,提升移动GUI代理的端侧部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26520 2026-05-27 cs.CV cs.AI

InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

InterSketch: 一种具有自校正视觉草图和逐步奖励的交错推理模型

Zhiwei Ning, Wenwen Tong, Xiangli Kong, Shengnan Ma, Ziyi Shang, Jingcheng Ni, Tao Hu, Yong Xien Chng, Jixuan Ying, Zehuan Wu, Hanming Deng, Jie Yang, Yuanjie Zheng, Wei Liu, Lewei Lu

机构 * Shanghai Jiao Tong University(上海交通大学) SenseTime Research(商汤科技研究院) Shandong Normal University(山东师范大学)

AI总结 针对视觉-语言模型在长程视觉推理中文本中心范式局限性的问题,提出InterSketch模型,通过自校正和逐步奖励机制增强交错视觉-文本思维链能力,在视觉推理基准上超越Gemini-3-Pro等专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26485 2026-05-27 cs.CV cs.CL

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

OmniInteract:面向实时全模态助手的流式交互基准测试

Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SJTU(上海交通大学) NTU(国立新加坡大学) McMaster(麦马斯特大学) CityUHK(香港城市大学) JUFE(吉林大学)

AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26478 2026-05-27 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY

Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient

基于随机解耦策略梯度的高效在策略视觉强化学习

Haoxiang You, Yilang Liu, Davis Zong, Qian Wang, Teeratham Vitchutripop, Qi Wang, Daniel Rakita, Ian Abraham

机构 * Yale University(耶鲁大学) Shanghai Jiao Tong University(上海交通大学) University of Sydney(悉尼大学)

AI总结 提出随机解耦策略梯度(SDPG)方法,通过轨迹滚动的随机扰动估计策略梯度,在单GPU上数小时内端到端训练多样化的视觉运动控制策略,显著降低计算和内存开销,并在视觉MuJoCo基准测试中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26244 2026-05-27 cs.CV cs.MM cs.SD

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估

Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Haotian Wang, Yuanxing Zhang, Pengfei Wan, Leye Wang

机构 * Peking University(北京大学) Kling Team(Kling团队) Nanjing University(南京大学) SJTU(上海交通大学) HKUST(GZ)(香港科技大学(广州)) Shanghai AI Lab(上海人工智能实验室) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化所) Tsinghua University(清华大学)

AI总结 针对现有评估协议局限于短片段的问题,提出LongAV-Compass基准,通过284个测试用例和统一评估框架,系统评估分钟级音视频生成在文本、图像、视频条件下的质量、一致性和对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26184 2026-05-27 cs.LG cs.AI

GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training

GAC: 面向混合SFT-RL后训练的噪声感知自适应混合

Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Maritime University(上海海洋大学)

AI总结 提出噪声感知控制器GAC,通过在线估计梯度方差和两个训练信号之间的不一致性,自适应调整混合权重,以改进混合后训练性能。

Comments 15 pages, 3 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25971 2026-05-27 cs.CL cs.IR cs.MA

Anticipate and Learn: Unleashing Idle-Time Compute in Proactive Agents

预见与学习:在主动智能体中释放空闲时间计算

Haoyi Hu, Qirong Lyu, Xianghan Kong, Weiwen Liu, Jianghao Lin, Zixuan Guo, Yan Xu, Yasheng Wang, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 提出ProAct主动智能体架构,利用空闲时间计算预测并满足用户未来需求,通过ProActEval基准测试验证其在任务加速、减少用户努力和降低幻觉率方面的显著优势。

Comments 26 pages, 4 figures; code available at https://github.com/AgentACE-AI/ProAct

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25029 2026-05-27 cs.RO

ParkingWorld: End-to-End Autonomous Parking Reinforcement Learning from Corrective Experience in 3DGS Simulation

ParkingWorld: 基于3DGS仿真中纠正性经验的端到端自主泊车强化学习

Zhengcheng Yu, Changze Li, Haoran Liu, Tong Qin

机构 * Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出一种基于纠正性经验的样本高效强化学习框架(CIL-SERL),在逼真的3D高斯溅射(3DGS)仿真器中训练端到端自主泊车策略,通过多级回放缓冲区机制提高成功率、效率和安全性。

Comments 9 pages(including 1 page of Appendix), 6 figures. Will be submitted to RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18468 2026-05-27 stat.ML cs.LG

Shallow ReLU$^s$ Networks in $L^p$-Type and Sobolev Spaces: Approximation and Path-Norm Controlled Generalization

浅层ReLU$^s$网络在$L^p$型空间和Sobolev空间中的逼近与路径范数控制的泛化

Weizhao Li, Fanghui Liu, Lei Shi

机构 * School of Mathematical Sciences Fudan University(复旦大学数学学院) School of Mathematical Sciences Institute of Natural Sciences and MOE-LSC Shanghai Jiao Tong University(上海交通大学数学学院、自然科学研究院和教育部低维量子体系科学重点实验室) School of Mathematical Sciences Shanghai Key Laboratory for Contemporary Applied Mathematics Fudan University(复旦大学上海当代应用数学重点实验室数学学院)

AI总结 本文研究浅层ReLU$^s$网络在$L^p$型空间和Sobolev空间中的逼近能力,并通过$\ell_1$路径范数控制实现非参数回归的极小化最优泛化误差。

Comments 42 pages, 1 figure. Update theorem 2and fix some typos. Authors are listed in alphabetical order and contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18866 2026-05-27 cs.LG cs.AI

FLUIDSPLAT: Reconstructing Physical Fields from Sparse Sensors via Gaussian Primitives

FLUIDSPLAT: 通过高斯原语从稀疏传感器重建物理场

Huaxi Huang, Meng Li, Zhengqing Gao, Xi Zhou, Xiaoshui Huang, Xiao Sun

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出FLUIDSPLAT模型,利用高斯原语作为空间显式中间表示,从稀疏传感器数据重建流场,理论分析了表示能力与观测数的关系,并在多个基准上实现误差降低11-28%。

Comments 24 pages, 5 figures,preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18103 2026-05-27 cs.AI

Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

稳定性意味着冗余:Delta注意力选择性停止用于高效长上下文预填充

Yujie Chen, Tailai Chen, Yifeng Gao, Zoe Wanying He, Yijue Xu, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对长上下文场景中预填充计算成本高的问题,提出一种无需训练的Delta注意力选择性停止策略(DASH),通过监控自注意力层更新动态来停止稳定令牌的处理,从而在不牺牲模型准确性和硬件效率的前提下实现预填充加速。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06133 2026-05-27 cs.CL cs.AI

CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit

CreditDecoding: 利用轨迹信用加速扩散大语言模型中的并行解码

Kangyu Wang, Zhiyun Jiang, Haibo Feng, Weijia Zhao, Lin Liu, Jianguo Li, Zhenzhong Lan, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Westlake University(西湖大学)

AI总结 针对扩散大语言模型并行解码中正确令牌被反复重掩导致冗余迭代的问题,提出基于轨迹信用的无训练并行解码方法CreditDecoding,融合历史证据与当前logits提升低置信度正确令牌的置信度,实现高达5.48倍加速并提升准确性。

Comments 19 pages, 13 figures, 9 tables, Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10095 2026-05-27 cs.CV

Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models

挖掘属性子空间以实现3D基础模型的高效微调

Yu Jiang, Hanwen Jiang, Ahmed Abdelkader, Wen-Sheng Chu, Brandon Y. Feng, Zhangyang Wang, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Adobe Research(Adobe研究) Google Research(谷歌研究)

AI总结 本文通过生成合成数据并提取与纹理、几何、相机运动和光照变化相关的LoRA子空间,发现这些子空间近似解耦,集成后形成降维子空间,从而提高下游任务微调的效率和预测精度。

Comments 10 pages, 8 figures. Code here: https://github.com/jpppppppppppppppppppppppp/Subspaces-Mining-for-VGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16449 2026-05-27 cs.CV cs.AI

Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference

弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理

Ziyan Liu, Yeqiu Chen, Hongyi Cai, Tao Lin, Shuo Yang, Zheng Liu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) BAAI(北京人工智能研究院)

AI总结 提出VLA-Pruner方法,通过结合语义预填充和时序平滑的动作相关性估计视觉令牌重要性,并采用Combine-then-Filter策略,在保持操作质量的同时实现高达1.99倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22476 2026-05-27 cs.AR cs.AI

RulePlanner: All-in-One Reinforcement Learner for Unifying Design Rules in 3D Floorplanning

RulePlanner: 用于统一3D布局规划中设计规则的全能强化学习器

Ruizhe Zhong, Xingbo Du, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出一种基于深度强化学习的统一框架,通过新颖的矩阵表示、动作空间约束和奖励信号定量分析,处理多种硬件设计规则,实现3D布局规划中的规则遵守。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13762 2026-05-27 cs.LG q-bio.BM

MolPIF: A Parameter Interpolation Flow Model for Molecule Generation

MolPIF: 一种用于分子生成的参数插值流模型

Yaowei Jin, Junjie Wang, Yufan Tang, Wenkai Xiang, Duanhua Cao, Dan Teng, Zhehuan Fan, Jiacheng Xiong, Xia Sheng, Chuanlong Zeng, Duo An, Mingyue Zheng, Shuangjia Zheng, Qian Shi

机构 * Lingang Laboratory(灵冈实验室) School of Information Science and Technology(信息科学与技术学院) ShanghaiTech University(上海科技大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research(药物发现与设计中心、国家药物研究重点实验室) Shanghai Institute of Materia Medica, Chinese Academy of Sciences(中国科学院上海 medicinal materials 研究院) Global Institute of Future Technology(未来技术全球研究院) Shanghai Jiao Tong University(上海交通大学) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

AI总结 提出参数插值流模型MolPIF,通过参数空间分布插值统一连续坐标与离散原子类型的生成,在CrossDocked2020数据集上优于基线方法。

Comments Accepted to Bioinformatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16417 2026-05-27 cs.CV

CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD Detection

CRoFT: 面向OOD泛化和开放集OOD检测的并发优化鲁棒微调

Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 针对视觉语言预训练模型微调时分布偏移问题,提出一种基于能量分数梯度最小化的统一微调框架,同时提升闭集OOD泛化能力和开放集OOD检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏