arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3140
2606.22999 2026-06-23 cs.CV 新提交

Black-Box Continual Learning for Vision-Language Models

视觉语言模型的黑盒持续学习

Yuting Li, Weihang Fang, Haoyuan Gao, Linghe Kong, Yexin Li, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 提出黑盒持续学习基准Black-CL,仅通过输出嵌入或logits进行学习,并设计BETA方法,通过优化文本原型实现与白盒方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22876 2026-06-23 cs.CV 新提交

Full-Body Golf Swing Kinematic Reconstruction From a Smartwatch IMU

基于智能手表IMU的全身高尔夫挥杆运动学重建

Yuanshuo Tan, Kezhe Zhu, Xiujie Sun, Chunping Liang, Shuoyang Zhu, Chenquan Xu, Licheng Zhong, Huiming Pan, Yinri Jin, Chang Liu, Bo Xiao, Shenglong Le, Bryndan W. Lindsey, Peter B. Shull

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械与动力工程学院机械系统与振动国家重点实验室) Key Laboratory for Power Machinery and Engineering of the Ministry of Education, Shanghai Jiao Tong University(上海交通大学动力机械与工程教育部重点实验室) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) School of Physical Education, Shanghai University of Sport(上海体育大学体育教育学院) Department of Physical Education, Shanghai Jiao Tong University(上海交通大学体育系) Department of Physical Therapy(物理治疗系)

AI总结 提出一种单手腕IMU方法(WIT-KinNet),通过时间运动编码学习手腕到全身关节角度映射,实现高尔夫挥杆全身运动学估计,平均绝对误差8.11°。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22823 2026-06-23 cs.LG q-bio.QM 新提交

Retrieval-Augmented Multimodal Learning for Enzyme-Substrate Interaction Prediction Under Low-Homology Shift

检索增强的多模态学习用于低同源性偏移下的酶-底物相互作用预测

Chen Liu, Bingxin Zhou, Xinyuan Wang, Ming Li, Guisheng Fan, Liang Hong

机构 * School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院) Institute of Natural Sciences and Zhangjiang Institute for Advanced Study, Shanghai Jiao Tong University(上海交通大学自然科学研究院和张江高等研究院) School of Life Sciences and Biotechnology, Shanghai Jiao Tong University(上海交通大学生命科学技术学院)

AI总结 提出RAMMESI框架,通过跨模态交互建模、自适应融合和检索增强,解决酶-底物相互作用预测中稀疏正监督和低同源性分布偏移问题,在低序列一致性场景下表现优异。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22806 2026-06-23 cs.CV 新提交

Policy-as-Data: Learning Generalizable HOI Diffusion Models from Simulated Physics

策略即数据:从模拟物理学中学习可泛化的人-物交互扩散模型

Shujia Li, Jianshu Hu, Haiyu Zhang, Yunpeng Jiang, Haoyuan Jin, Xinyuan Chen, Yaohui Wang, Yutong Ban

机构 * Global College, Shanghai Jiao Tong University(上海交通大学致远学院) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

AI总结 提出利用物理模拟器中的强化学习策略生成任务导向数据,结合粗到细重定向流程弥合表示差距,训练扩散模型实现可泛化的人-物交互生成,在未见物体和长时域生成上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22801 2026-06-23 cs.CV 新提交

Learning Adaptive Dynamical Features via Multi-$τ$ Liquid-Mamba for All-in-one Image Restoration

学习自适应动态特征:用于全能图像恢复的多τ液态Mamba

Hu Gao, Changshuo Wang, Yulong Chen, Lizhuang Ma

机构 * Department of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术系) Department of Architecture and Design, Harbin Institute of Technology(哈尔滨工业大学建筑与设计系)

AI总结 提出Multi-τ Liquid-Mamba模块,通过输入条件多时间尺度液态离散化改进选择性状态空间建模,实现自适应动态特征学习,在全能图像恢复中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22631 2026-06-23 cs.CV 新提交

4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking

4DVLT:以世界线为中心的视觉-语言跟踪动态场景理解

Chaoyue Li, Boxue Yang, Shengyao Zhou, Haoyang Wu, Rui Qian, Linfeng Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出世界线为中心的4D动态场景理解任务4DVLT及基准Instruct-4D,通过图条件世界线推理方法4DTrack实现指令跟踪,在指标上超越基线19.62点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22557 2026-06-23 cs.AI cs.CL cs.HC 新提交

MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

MacAgentBench: 在真实macOS桌面上基准测试AI代理

Yikun Fu, Bowen Fu, Zhenyu Wu, Shuang Cheng, Xiaowei Sun, Bowen Yang, Zehao Li, Yibo Zhao, Zichen Ding, Zhoumianze Liu, Shijie Wang, Biqing Qi, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Tsinghua University(清华大学)

AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22460 2026-06-23 cs.IR cs.LG 新提交

Music Playlist Captioning at Scale with Large Language Models

基于大语言模型的音乐播放列表标题生成规模化方法

Mathieu Delcluze, Léa Briand, Benjamin Chapus, Deniz Mekik, Guillaume Salha-Galvan

机构 * Deezer Research SJTU Paris Elite Institute of Technology(Deezer研究 SJTU巴黎精英技术研究所)

AI总结 提出利用大语言模型从多源数据生成播放列表描述,部署于Deezer的Daily Mix功能,显著提升用户参与度。

Comments ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22353 2026-06-23 cs.CV 新提交

Interest Entanglement: The Hidden Barrier to Blind Super-Resolution Optimization

兴趣纠缠:盲超分辨率优化的隐藏障碍

Junxiong Lin, Xinji Mai, Qianyu Guo, Haoran Wang, Zeng Tao, Xuan Tong, Ivy Pan, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The University of Hong Kong(香港大学) Shanghai Institute of Virology, Shanghai Jiao Tong University School of Medicine(上海病毒研究所,同济大学医学院)

AI总结 针对图像超分辨率中保真度与感知质量冲突的问题,提出基于共享特征表示的超分辨率框架(SFR),通过解耦不同优化目标的学习过程并引入InfoSqueeze模块,实现两者有效平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22116 2026-06-23 cs.RO 新提交

DeformX: A Versatile Co-Simulation Framework for Deformable Linear Objects

DeformX: 一种用于可变形线性物体的多功能协同仿真框架

Yi Yang, Xiang Fei, Lehong Wang, Chenhao Li, Zilin Dai, Henry Kou, Lu Li, Howie Choset

机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) School of Ocean and Civil Engineering, Shanghai Jiao Tong University(上海交通大学海洋与土木工程学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院)

AI总结 提出DeformX框架,集成Cosserat杆物理引擎与NVIDIA Isaac Sim,实现可变形线性物体的物理精确与视觉真实仿真,支持机器人学习,在真实线缆分割和绳索摆动任务中验证了仿真到现实的迁移能力。

Comments 11 pages, 11 figures, 5 tables, IROS 2026. Website: https://deformx.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21527 2026-06-23 cs.RO cs.CV 新提交

LOGOS: LiDAR-Only Gaussian Elevation Splatting for Unified Tiny Obstacle Segmentation

LOGOS: 仅基于激光雷达的高斯高程喷溅用于统一微小障碍物分割

Nan Ming, Yeqiang Qian, Chunxiang Wang, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 提出LOGOS系统,通过将路面建模为2D高斯原语的连续混合,利用无反向传播的激光雷达方法估计高程,实现微小障碍物分割,在道路和越野场景中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21509 2026-06-23 cs.RO 新提交

A Stitch in Time Saves Nine: Preserving Policy Compatibility Under Perception Updates in End-to-End Autonomous Driving

小洞不补,大洞吃苦:端到端自动驾驶中感知更新下的策略兼容性保持

Yueyuan Li, Yifei Xiao, Mingyang Jiang, Xiang Zuo, Songan Zhang, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(教育部系统控制与信息处理重点实验室) School of Aeronautics and Astronautics, Shanghai Jiao Tong University(上海交通大学航空航天学院) Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学全球未来技术学院)

AI总结 本文提出通过轻量级潜在空间对齐(模型拼接)来保持端到端自动驾驶系统中更新感知模块与固定策略模块的兼容性,避免重训练或架构解耦的高成本,实验证明在多种更新场景下有效。

Comments 12 pages, 9 tables, 5 figures; T-ITS under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21501 2026-06-23 cs.RO 新提交

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Xiaomi EV(小米汽车)

AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21240 2026-06-23 cs.CR cs.CV 新提交

DIPBox: A Multi-scale Testing Framework for Tracking Dataset Regeneration

DIPBox:用于追踪数据集再生的多尺度测试框架

Tian Dong, Yan Meng, Shaofeng Li, Guoxing Chen, Yuling Chen, Zhen Liu, Haojin Zhu, Hao Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Guizhou University(贵州大学) The University of Hong Kong(香港大学)

AI总结 针对数据集再生威胁,提出多尺度特征相似度指标和DIPBox框架,通过样本级、集合级和分布级特征测试追踪再生数据集,实验验证其有效性。

Comments Accepted by ACM CCS 2026. Please cite this paper as "Tian Dong, Yan Meng, Shaofeng Li, Guoxing Chen, Yuling Chen, Zhen Liu, Haojin Zhu, Hao Chen. DIPBox: A Multi-scale Testing Framework for Tracking Dataset Regeneration. In the Proceedings of ACM Conference on Computer and Communications Security (CCS 2026)."

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21227 2026-06-23 cs.SD 新提交

Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

Bagpiper-Edit: 基于丰富描述的零样本开放式音频编辑

Xun Gong, Jinchuan Tian, Haoran Wang, William Chen, Shinji Watanabe, Yanmin Qian

机构 * Auditory Cognition and Computational Acoustics Lab, Shanghai Jiao Tong University(上海交通大学听觉认知与计算声学实验室) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 提出Bagpiper-Edit,通过将音频编辑转化为丰富描述重写任务,实现零样本、自由形式的开放式音频编辑,无需配对训练数据,在语音、音乐和声音上均表现良好。

Comments Accepted by InterSpeech 2026, For the original codes, see https://github.com/HsunGong/espnet/blob/master/egs2/opuslm_v2/speechlm1, we are submitting a PR to espnet master branch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21223 2026-06-23 cs.RO 新提交

Ultra-Fusion: A Resilient Tightly-Coupled Multi-Sensor Fusion SLAM Framework under Sensor Degradation and Spatiotemporal Perturbation for Intelligent Transportation Systems

Ultra-Fusion:面向传感器退化与时空扰动下智能交通系统的鲁棒紧耦合多传感器融合SLAM框架

Yihong Tian, Junjie Zhang, Liuyang Li, Deteng Zhang, Yunfei Zuo, Jie Yin

机构 * Beijing Institute of Technology(北京理工大学) Chongqing University(重庆大学) Sichuan University(四川大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Ultra-Fusion紧耦合多传感器融合SLAM框架,通过可观测性感知初始化、因子级可靠性调度和在线LiDAR-IMU时空标定,在传感器退化与时空扰动下实现鲁棒定位,在多种平台和基准上验证了高精度与可用性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21172 2026-06-23 cs.CV 新提交

BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving

BadDreamer: 针对自动驾驶视频世界模型的可迁移后门攻击

Zhe Shuai, Xiaopeng Xie, Yikun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出BadDreamer,一种针对自动驾驶视频世界模型的可迁移时空后门攻击,通过污染未来帧中的触发-擦除序列,使模型在物理触发出现时幻觉化障碍物消失,进而误导下游动作预测。

Comments 19 pages, 8 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21144 2026-06-23 cs.CL cs.AI 新提交

AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents

AdaMem: 学习为个性化长时程LLM代理记住什么

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 针对长时程LLM代理中记忆膨胀导致QA准确率下降的问题,提出AdaMem方法,通过角色特定的记忆策略和基于反馈的轻量级自反思步骤,学习为每个用户记住重要信息,在减少9%记忆量的同时提升QA准确率最高9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21013 2026-06-23 cs.AI cs.LG 新提交

Agentic Time Machine as an Infrastructure for Future-Event Forecasting

Agentic Time Machine:未来事件预测的基础设施

Jingyi Chai, Bingyang Zheng, Xiangrui Liu, Hao Lu, Zihang Zhou, Tianchen Wang, Kemeng Zhang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Agentic Time Machine(TM)基础设施,通过过滤截止后内容重建历史网络状态,并基于此设计规划-求解-聚合多智能体框架,实现高效且可靠的事件预测,在FutureX排行榜上取得最佳平均排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20591 2026-06-23 cs.NI cs.AI 新提交

Delay-Adaptive Speculation Control for Low-Latency Edge-Cloud LLM Inference

面向低延迟边缘-云LLM推理的延迟自适应推测控制

Kangkang Sun, Jianhua Li, Xiuzhen Chen, Junyi He, Minyi Guo

机构 * Shanghai Key Laboratory of Integrated Administration Technologies for Information Security, School of Computer Science, Shanghai Jiao Tong University(上海信息安全集成管理技术重点实验室,上海交通大学计算机科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(深圳大学理学院,香港中文大学(深圳))

AI总结 针对分布式边缘-云推理中推测解码的草稿长度在线控制问题,提出延迟单调阈值最优策略,并设计在线算法UCB-SpecStop,在真实测试台上验证了相变预测,延迟降低达22.4%。

Comments 16 pages, 9 figures, submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19996 2026-06-23 cs.SD cs.CL 新提交

Segment-Level Mandarin Chinese Speech-Based Cognitive Impairment Detection via an Autoencoder with Contrastive Learning

基于自编码器与对比学习的段级普通话语音认知障碍检测

Yongqi Shao, Hong Huo, Flavio Bertini, Danilo Montesi, Tao Fang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(教育部系统控制与信息处理重点实验室) Shanghai Key Laboratory of Perception and Control in Industrial Network Systems(上海市工业网络系统感知与控制重点实验室) Department of Computer Science and Engineering, University of Bologna(博洛尼亚大学计算机科学与工程系) Department of Mathematical, Physical and Computer Sciences, University of Parma(帕尔马大学数学、物理与计算机科学系)

AI总结 提出段级表示学习框架,结合自编码器和对比学习,在四个普通话数据集上实现稳定的二分类和三分类认知障碍检测,尤其改善了临床困难的三分类性能。

Comments This manuscript was uploaded prematurely. The authors have identified substantial revisions that are required in the methodology, experimental design, and interpretation of results. To avoid potential confusion and citation of an incomplete version, the authors have decided to withdraw this version and prepare a substantially revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18239 2026-06-23 cs.RO 新提交

EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies

EBench: 通用移动操作策略的要素诊断

Ning Gao, Jinliang Zheng, Xing Gao, Haoxiang Ma, Hanqing Wang, Yukai Wang, Jiantong Chen, Zanxin Chen, Shujie Zhang, Mingda Jia, Xuekun Jiang, Zihou Zhu, Xinyu Li, Shuai Wang, Hao Li, Wenzhe Cai, Yuqiang Yang, Xudong Xu, Zhaoyang Lyu, Yao Mu, Tai Wang, Jiangmiao Pang, Jia Zeng, Weinan Zhang, Chunhua Shen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出EBench基准,从5个能力和4个泛化维度诊断通用移动操作模型,揭示不同模型在成功率相近时能力差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16532 2026-06-23 cs.SD cs.AI 新提交

Dual-Granularity Orthogonal Disentanglement for Generalizable Audio Deepfake Detection

双粒度正交解耦用于可泛化的音频深度伪造检测

Zhuodong Liu, Hugen Lv, Xiangyu Li, Chunhong Yuan

机构 * Beijing Jiaotong University(北京交通大学) Shanghai Jiao Tong University(上海交通大学) ITMO University(ITMO大学)

AI总结 针对音频深度伪造检测中隐式身份泄漏问题,提出双粒度正交解耦框架,通过样本级余弦正交性和批次级交叉协方差正则化强制特征独立,无需辅助网络或对抗训练,在多个数据集上取得更优等错误率。

Comments Accepted at Interspeech 2026, 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15893 2026-06-23 cs.CL 新提交

BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation

BALTO: 用于幻觉缓解的平衡令牌级策略优化

Ning Li, Zixuan Guo, Yan Xu, Wenbo Fei, Yifan Niu, Chang Luo, Yasheng Wang, Weiwen Liu, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对大语言模型幻觉问题,提出BALTO框架,通过提取可验证事实声明并投影为令牌级标签,引入平衡信用分配机制,在六个模型-基准设置中实现最高忠实度,优于现有后训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13102 2026-06-23 cs.RO 新提交

FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation

FTP-1:一种跨触觉传感器的通用基础触觉策略,用于密集接触操作

Chengbo Yuan, Zicheng Zhang, Mingjie Zhou, Wendi Chen, Yi Wang, Zhuoyang Liu, Dantong Niu, Shuo Wang, Hui Zhang, Wenkang Zhang, Yingdong Hu, Yuanqing Gong, Wanli Xing, Chuan Wen, Cewu Lu, Kaifeng Zhang, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Sharpa Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出FTP-1,首个通用基础触觉策略,通过异构编码器和共享Transformer专家,跨21种传感器和3000小时数据预训练,实现触觉操作技能的跨传感器迁移,在未见传感器上成功率提升31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04579 2026-06-23 cs.AI 版本更新

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

SCI-PRM:用于科学推理验证的工具感知过程奖励模型

Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang, Wanghan Xu, Yuhao Zhou, Qinglong Cao, Zhiwang Zhou, Lei Bai, Wenlong Zhang, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Tongji University(同济大学)

AI总结 针对科学推理中工具使用和事实一致性问题,提出Sci-PRM模型,通过构建包含工具链轨迹的数据集SCIPRM70K并训练过程奖励模型,在测试时扩展和强化学习中提供细粒度监督,提升基础模型性能。

Comments Accepted by KDD 2026 AI4Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10757 2026-06-23 cs.CV 版本更新

CodePercept: Code-Grounded Visual STEM Perception for MLLMs

CodePercept: 基于代码的MLLM视觉STEM感知

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian Hu, Ruilin Luo, Ruize Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) Qwen Team(通义实验室) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18313 2026-06-23 cs.CV 版本更新

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM:全知驾驶导航世界模型

Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) PhiGent National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Wuhan University(武汉大学)

AI总结 提出OmniNWM全知全景导航世界模型,在统一概率框架下处理状态、动作和奖励三个维度,实现多模态全景视频生成、零样本轨迹控制及内在奖励机制,在生成保真度和控制精度上达到SOTA。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07938 2026-06-23 cs.LG cs.SY eess.SY 版本更新

Decision-Focused Continual Learning for Seaport Power-Logistics Scheduling: Generalization across Varying Tasks

面向海港电力物流调度的决策聚焦持续学习:跨不同任务的泛化

Chuanqing Pu, Feilong Fan, Nengling Tai, Yan Xu, Wentao Huang, Honglin Wen

机构 * College of Smart Energy, Shanghai Jiao Tong University(上海交通大学智能能源学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) School of Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电气工程学院) Dyson School of Design Engineering, Imperial College London(伦敦帝国理工学院戴森设计工程学院)

AI总结 针对预测-优化框架在任务变化时泛化差的问题,提出基于Fisher信息正则化的决策聚焦持续学习框架,通过可微凸代理稳定梯度,实现跨任务决策对齐的在线学习,在裕廊港实验中提升决策性能并降低计算成本。

Comments Preprint to IEEE Transactions on Smart Grid

详情

展开后加载摘要…

URL PDF HTML 收藏