arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-07-16 至 2026-07-16 共收录 13
2607.14049 2026-07-16 cs.AI 新提交

Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models

深度交互:一种用于大型推理模型的高效人机交互方法

Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对大语言模型推理出错时现有交互方法的问题,提出深度交互机制,可直接编辑原始响应并提炼精炼提示引导模型,在STEM任务推理中纠正成功率大幅提升,令牌使用量显著减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13770 2026-07-16 cs.AR cs.AI 新提交

Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations

Kaleido:通过利用潜在空间相关性对视频扩散变压器进行算法-硬件协同设计

Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Jiao Tong University, Shanghai Qi Zhi Institute(上海交通大学、上海颀智研究所) Huawei Technologies(华为技术有限公司) ICT, Chinese Academy of Sciences(信息科技研究所、中国科学院)

AI总结 针对视频扩散变压器计算成本高的问题,提出Kaleido算法-硬件协同设计,利用潜在空间通道级时空相关性加速操作,有轻量级重用算法,设计了加速器,实验表明其相比现有加速器有显著加速和节能效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13573 2026-07-16 cs.RO cs.AI 新提交

IMMNet: Hybrid Fusion of Model-based and Data-driven Approaches for Maneuvering Target Tracking

IMMNet:基于模型与数据驱动方法的混合融合用于机动目标跟踪

Yixuan Zhao, Chaoqun Yang, Lin Gao, Yongxiao Tian, Ting Yuan

机构 * School of Automation, Southeast University(东南大学自动化学院) School of ICE, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Faculty of Artificial Intelligence, Shanghai University of Electric Power(上海电力大学人工智能学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 针对三维空间机动目标跟踪难题,提出IMMNet算法,融合IMM算法可解释结构与神经组件,能保留贝叶斯推理机制并从数据学习,实验证明该算法在多场景下优于现有算法,是机动目标跟踪的有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13465 2026-07-16 cs.CL cs.AI cs.HC cs.MA cs.SE 新提交

DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments

DevicesWorld:异构环境中跨设备智能体的基准测试

Huatao Li, Xinwei Geng, Yuheng Wang, Yutong Li, Runde Yang, Hantao Chen, Shu Yao, Jingru Fan, Xuhui Ren, Yuanyuan Zhao, Fei Huang, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Honor Device Co., Ltd(荣耀终端有限公司)

AI总结 研究针对智能体跨设备协同操作难评估的问题,引入DevicesWorld基准测试,整合多类设备环境及众多任务,通过固定评估集评估五个前沿智能体系统,发现成功率低,为可靠跨设备智能体研究提供了可执行、可重现及有诊断作用的评估。

Comments https://github.com/AgenticOrgLab/DevicesWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13241 2026-07-16 cs.LG cs.AI 新提交

EMAGN: Efficient Multi-Attention Graph Network via Learned Clustering for Scalable Traffic Forecasting

EMAGN:基于学习聚类的高效多注意力图网络用于可扩展交通流量预测

Mingxing Xu, Rakesh Chowdary Machineni, Ke Liu, Xi Cheng, Chengqi Lu, Xin Hu, Lyuhao Chen, Xiangyu Li, Junwei You, Oliver Gao

机构 * Shanghai Jiao Tong University(上海交通大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of California, Berkeley(加利福尼亚大学伯克利分校) Cornell University(康奈尔大学) Technische Universität Dresden(德累斯顿工业大学) Carnegie Mellon University(卡内基梅隆大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 针对交通流量预测中自注意力机制扩展性有限的问题,提出EMAGN,通过学习聚类矩阵将空间注意力机制线性化,降低复杂度,实验表明其在准确性和效率上优于其他模型,扩展了可行模型配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13099 2026-07-16 cs.CR cs.AI 新提交

WaterMoE: Expert-Routing-based Watermarking for High Fidelity and Efficiency

WaterMoE:基于专家路由的高保真高效水印技术

Z Sun, Q Jiang, S Sheng, L Xiang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Tianjin University(天津大学)

AI总结 针对大型语言模型水印技术实践中模型性能下降和推理开销大的问题,提出WaterMoE方案,通过在专家选择中嵌入水印信号,在推理循环中实现水印嵌入,实验证明其保真性能好、优于现有方法且开销小,可用于实际任务。

Comments 21 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12785 2026-07-16 cs.CV 版本更新

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting

ExtraGS:通过扩散引导的3D高斯点渲染增强内窥镜视图外推

Cheng-Tai Hsieh, Jiwei Shan, Han Fang, Jianshu Hu, Tao Ni, Lijun Han, Yutong Ban, Shing Shin Cheng, Hesheng Wang

机构 * The School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, and the Shanghai Key Laboratory of Navigation and Location-Based Services(上海交通大学自动化与智能感知学院以及上海市导航与位置服务重点实验室) Global College, Shanghai Jiao Tong University(上海交通大学密西根学院) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

AI总结 研究针对传统内窥镜视野局限及神经渲染外推有伪影问题,提出ExtraGS框架,通过不确定性引导虚拟相机采样、扩散模型细化视图及置信加权微调策略,增强内窥镜视图外推,在新视图合成中达先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12252 2026-07-16 cs.CL 版本更新

FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality

金融研究基准II:一个具有共识衍生黄金标准的深度研究基准,用于区分财务报告质量

Beidi Luan, Rui Sun, Sinuo Wang, Yan Gu, Chao Li, Zhenliang Xiong, Jing Li, Zuo Bai

机构 * StepFun(步趣) FinStep(鳍步) University of Adelaide(阿德莱德大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对深度研究代理生成财务报告的大规模评估瓶颈,提出可扩展管道生成高质量标准。通过构建基准、合成候选标准、比较大语言模型与人类评估,经两个过滤器得出黄金标准集,用于评估10个深度研究系统,实现可扩展的基准评估等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14721 2026-07-16 cs.CL cs.LG q-bio.QM

MolReFlect: Towards In-Context Fine-grained Alignments between Molecules and Texts

MolReFlect:迈向分子与文本之间细粒度对齐的研究

Jiatong Li, Yunqing Liu, Wei Liu, Jingdi Le, Di Zhang, Wenqi Fan, Dongzhan Zhou, Yuqiang Li, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出MolReFlect框架,通过教师-学生机制实现分子与文本的细粒度对齐,提升LLM对分子的理解与可解释性,实验显示其在分子-文本翻译任务中达到最优性能。

Comments Accepted by TKDE, To appear. Codes are available at: https://github.com/phenixace/MolReFlect

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21952 2026-07-16 cs.LG physics.app-ph physics.optics

Physics-informed network paradigm with data generation and background noise removal for diverse distributed acoustic sensing applications

具有数据生成和背景噪声去除的物理信息网络范式用于多样化的分布式声学传感应用

Yangyang Wan, Haotian Wang, Xuhui Yu, Jiageng Chen, Xinyu Fan, Zuyuan He

机构 * State Key Laboratory of Advanced Optical Communication Systems and Networks, Department of Electronic Engineering, Shanghai Jiao Tong University(先进光通信系统与网络国家重点实验室,电子工程学院,上海交通大学)

AI总结 本文提出了一种无需真实世界数据的物理信息DAS神经网络范式,通过生成数据和背景噪声去除技术提升DAS应用的性能和泛化能力。

Journal ref Light Sci Appl 15, 281 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10581 2026-07-16 cs.CV 版本更新

Multi-view Hand Reconstruction with a Point-Embedded Transformer

基于点嵌入变换器的多视图手部重建

Lixin Yang, Licheng Zhong, Pengxiang Zhu, Xinyu Zhan, Junxiao Kong, Jian Xu, Cewu Lu

机构 * School of Artificial Intelligence (SAI), Shanghai Jiao Tong University(人工智能学院(SAI),上海交通大学) School of Mechanical Engineering, Shanghai Jiao Tong University(机械工程学院,上海交通大学) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(电子信息与电气工程学院,上海交通大学) Institute of Automation Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所(CASIA))

AI总结 研究提出POEM模型用于多视图手部重建,通过在多视图立体空间嵌入基点表示手部网格,并结合多数据集及相机参数随机化训练,实现了通用、实用且经济高效的双手运动捕捉。

Comments TPAMI 2025, Extension of CVPR 2023, correction on Table 4: HO3D results

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04197 2026-07-16 cs.CL cs.AI

Large Language Models are In-Context Molecule Learners

大语言模型是上下文分子学习者

Jiatong Li, Wei Liu, Zhihao Ding, Wenqi Fan, Yuqiang Li, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机系,香港理工大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 ICMA通过上下文分子微调使LLMs无需额外训练即可实现分子-文本对齐,证明LLMs具备上下文分子学习能力。

Comments Accepted by IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏