arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3172
2602.13279 2026-03-24 cs.SI cs.AI

LLM-Enhanced Rumor Detection via Virtual Node Induced Edge Prediction

通过虚拟节点诱导边预测增强的谣言检测

Jiran Tao, Cheng Wang, Binyan Jiang

机构 * Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Hong Kong Polytechnic University(香港理工大学) School of Mathematical Sciences(数学科学学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种整合大语言模型的谣言检测框架,通过引入虚拟节点捕捉文本连贯性,改进传统方法对文本连贯性与传播动态的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08771 2026-03-24 cs.CV

LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution

LinearSR: 解锁线性注意力以实现稳定且高效的图像超分辨率

Xiaohui Li, Shaobin Zhuang, Shuo Cao, Yang Yang, Yuandong Pu, Qi Qin, Siqi Luo, Bin Fu, Yihao Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) The Australian National University(澳大利亚国立大学)

AI总结 本文提出LinearSR框架,首次系统解决线性注意力在图像超分辨率中的关键挑战,通过改进的早停指导微调策略、SNR基专家混合架构和TAG指导范式,实现高质量与高效兼顾的超分辨率生成。

Comments Camera Ready of ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01641 2026-03-24 cs.CV

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

FideDiff:高效的高保真图像运动去模糊扩散模型

Xiaoyang Liu, Zhengyan Zhou, Zihang Xu, Jiezhang Cao, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Harvard University(哈佛大学)

AI总结 本文提出FideDiff,一种高效的单步扩散模型,用于高保真图像运动去模糊。通过将运动去模糊转化为扩散过程,结合Kernel ControlNet和自适应时间步预测,提升了去模糊性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/xyLiu339/FideDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12224 2026-03-24 cs.RO cs.AI

RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction

RoboFAC:机器人故障分析与纠正的综合框架

Zewei Ye, Weifeng Lu, Minghao Ye, Tao Lin, Shuo Yang, Junchi Yan, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 RoboFAC通过构建大规模故障中心数据集,开发轻量级多模态模型,提升机器人故障诊断与纠正能力,实验显示其故障分析准确率比GPT-4o高34.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20351 2026-03-24 cs.CR cs.AI

MANA: Towards Efficient Mobile Ad Detection via Multimodal Agentic UI Navigation

MANA:通过多模态代理UI导航实现高效的移动广告检测

Yizhe Zhao, Yongjian Fu, Zihao Feng, Hao Pan, Yongheng Deng, Yaoxue Zhang, Ju Ren

机构 * Department of Computer Science and Technology(计算机科学与技术系) University of Southern California(南加州大学) Shanghai Jiao Tong University(上海交通大学) State Key Laboratory of Internet Architecture(互联网架构国家重点实验室)

AI总结 本文提出MANA框架,通过整合多种信号实现高效移动广告检测,提升准确率和效率,有效识别隐蔽恶意广告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20086 2026-03-23 cs.CV

Preference-Guided Debiasing for No-Reference Enhancement Image Quality Assessment

基于偏好引导的无参考增强图像质量评估去偏方法

Shiqi Gao, Kang Fu, Zitong Xu, Huiyu Duan, Xiongkuo Min, Jia Wang, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

AI总结 本文提出一种基于偏好引导的无参考增强图像质量评估方法,通过学习连续增强偏好嵌入空间并去除增强诱导的干扰成分,提升模型对算法不变感知质量的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19974 2026-03-23 cs.CR cs.AI

Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance

Trojan's Whisper:通过注入的Bootstrap引导 stealthily操纵OpenClaw

Fazhong Liu, Zhuoyan Chen, Tu Lan, Haozhen Tan, Zhenyu Xu, Xiang Li, Guoxing Chen, Yan Meng, Haojin Zhu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了通过注入引导文件进行的隐蔽攻击,揭示了自主代理生态系统设计中的根本矛盾,强调了基于能力隔离、运行时策略执行和透明引导溯源的防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19795 2026-03-23 cs.CV

Controllable Text-to-Motion Generation via Modular Body-Part Phase Control

通过模块化身体部位相控实现可控的文本到运动生成

Minyue Dai, Ke Fan, Anyi Rao, Jingbo Wang, Bo Dai

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

AI总结 本文提出模块化身体部位相控方法,通过紧凑的标量相界面实现局部化编辑,保留运动整体一致性,提供可控的文本到运动生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19695 2026-03-23 cs.CV

Demographic-Aware Self-Supervised Anomaly Detection Pretraining for Equitable Rare Cardiac Diagnosis

具有人口统计学意识的自监督异常检测预训练用于公平的罕见心脏诊断

Chaoqin Huang, Zi Zeng, Aofan Jiang, Yuchen Xu, Qing Cao, Kang Chen, Chenfei Chi, Yanfeng Wang, Ya Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Defense Technology(国防科技大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(瑞金医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院)

AI总结 本文提出一种两阶段ECG框架,结合自监督异常检测与人口统计学意识表征学习,提升罕见心脏异常检测的灵敏度并确保公平性,实验显示在超过一百万临床ECG数据上,方法在罕见异常检测中达到94.7%的AUROC,并缩小了常见-罕见性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19602 2026-03-23 cs.RO

CeRLP: A Cross-embodiment Robot Local Planning Framework for Visual Navigation

CeRLP:一种面向视觉导航的跨体素机器人局部规划框架

Haoyu Xi, Mingao Tan, Xinming Zhang, Siwei Cheng, Shanze Wang, Yin Gu, Xiaoyu Shen, Wei Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, P. R. China(上海交通大学计算机科学学院,上海,中华人民共和国) College of Information Science and Technology, Eastern Institute of Technology, Ningbo, P. R. China(信息科学与技术学院,东部技术研究所,宁波,中华人民共和国)

AI总结 本文提出CeRLP框架,通过统一几何表征和异构机器人适应,解决跨体素机器人视觉导航中的尺度模糊和异构问题,实验证明其在障碍物避障和导航任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10685 2026-03-23 cs.CV

A$^2$-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks

A²-Edit:基于精确参考的任意物体和模糊掩码图像编辑

Huayu Zheng, Guangzhao Li, Baixuan Zhao, Siqi Luo, Hantao Jiang, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出A²-Edit框架,通过大规模多类别数据集UniEdit-500K解决现有数据集的同质化和类别覆盖不足问题,引入Transformer混合模块和Mask Annealing训练策略,实现高效任意物体编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19274 2026-03-23 cs.CL cs.AI

CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation

CURE:临床理解和检索评估的多模态基准

Yannian Gu, Zhongzhen Huang, Linjie Mu, Xizhuo Zhang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, China(商汤研究院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

AI总结 CURE基准通过控制证据环境评估多模态模型的推理与检索能力,揭示模型在依赖权威文献时性能显著下降,强调整合临床证据与精确检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02393 2026-03-23 cs.RO cs.CV

EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation

EgoSpot:面向无手移动操作的视角多模态控制

Ganlin Zhang, Deheng Zhang, Longteng Duan, Guo Han, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Eric Vollenweider

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院) SJTU(上海交通大学) Microsoft(微软公司)

AI总结 本文提出一种基于微软HoloLens 2混合现实头显的无手控制框架,通过眼动、头部动作和语音指令融合实现机器人移动和机械臂操作的实时控制,提升无障碍交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19223 2026-03-20 cs.CL cs.AI

F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World

F2LLM-v2:面向多语言世界的包容性、高性能和高效嵌入模型

Ziyin Zhang, Zihan Liao, Hang Yu, Peng Di, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 F2LLM-v2通过两阶段LLM嵌入训练流程、matryoshka学习等技术,实现了更高效的多语言嵌入模型,在11个MTEB基准测试中表现优异,同时为资源受限应用提供了新状态的前沿成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19217 2026-03-20 cs.CV

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of California Merced(加州大学默塞德分校)

AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。

Comments Project page: https://kd-tao.github.io/LVOmniBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19145 2026-03-20 cs.LG

Enhancing Pretrained Model-based Continual Representation Learning via Guided Random Projection

通过引导随机投影增强基于预训练模型的持续表示学习

Ruilin Li, Heming Zou, Xiufeng Yan, Zheming Liang, Jie Yang, Chenliang Li, Xue Yang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) China University of Mining and Technology(中国矿业大学)

AI总结 本文提出SCL-MGSM方法,通过数据引导机制构建投影层,提升预训练模型在持续学习中的表现和数值稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18742 2026-03-20 cs.CV

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

6Bit-Diffusion:视频扩散模型推理时的混合精度量化

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18669 2026-03-20 cs.RO

CSSDF-Net: Safe Motion Planning Based on Neural Implicit Representations of Configuration Space Distance Field

CSSDF-Net:基于配置空间距离场的神经隐式表示的安全运动规划

Haohua Chen, Yixuan Zhou, Yifan Zhou, Hesheng Wang

机构 * IRMV Lab, Department of Automation, Shanghai Jiao Tong University(IRMV实验室,自动化系,上海交通大学)

AI总结 本文提出CSSDF-Net,通过学习配置空间中的连续签名距离场,实现统一的安全性几何概念,结合安全约束轨迹优化和递推预测控制,支持零样本泛化和高效避障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18626 2026-03-20 cs.CV

GEAR: Geography-knowledge Enhanced Analog Recognition Framework in Extreme Environments

GEAR:极端环境中的地理知识增强类比识别框架

Zelin Liu, Bocheng Li, Yuling Zhou, Xuanting Li, Yixuan Yang, Jing Wang, Weishu Zhao, Xiaofeng Gao

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出GEAR框架,通过三阶段流程高效检索青藏高原250万平方公里的类比地形,结合地理知识和物理特征过滤,提升跨域地形相似性检索效果,MSG-Net在F1分数上超越现有最佳模型1.38个百分点,并发现其与生物数据的显著相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17944 2026-03-20 cs.CV

TransText: Alpha-as-RGB Representation for Transparent Text Animation

TransText: Alpha-as-RGB表示法用于透明文本动画

Fei Zhang, Zijian Zhou, Bohao Tang, Sen He, Hang Li, Zhe Wang, Soubhik Sanyal, Pengfei Liu, Viktar Atliha, Tao Xiang, Frost Xu, Semih Gunel

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute (SII)(上海创新研究院) Meta AI

AI总结 TransText通过Alpha-as-RGB方法联合建模外观与透明度,避免修改预训练生成流形,生成高质量透明动画。

Comments 19 pages, publication review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19980 2026-03-20 cs.SE cs.AI

Neuron-Guided Interpretation of Code LLMs: Where, Why, and How?

指导神经元的代码LLM解释:在哪里、为什么和如何?

Zhe Yin, Xiaodong Gu, Beijun Shen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究通过分析代码LLM的神经元层面,发现语言特定神经元和概念层在多语言生成中的作用,提出基于神经元的微调、克隆检测和跨语言总结方法。

Comments Accepted by FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17238 2026-03-20 cs.CL

StreamingThinker: Large Language Models Can Think While Reading

StreamingThinker: 大语言模型在阅读时可以思考

Junlong Tong, Yingqi Fan, Anhao Zhao, Yunpu Ma, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin(宁波空间智能与数字衍生关键实验室,数字孪生研究院) Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,莱茵-慕尼黑大学)

AI总结 本文提出StreamingThinker框架,使大语言模型在阅读过程中实现流式思考,通过流式CoT生成、流式约束训练和并行推理提升效率,减少延迟并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11839 2026-03-20 cs.RO cs.CV

TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning

TrajBooster:通过轨迹中心学习提升双足人形机器人的整体操作

Jiacheng Liu, Pengxiang Ding, Qihang Zhou, Yuxuan Wu, Da Huang, Zimian Peng, Wei Xiao, Weinan Zhang, Lixin Yang, Cewu Lu, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 TrajBooster通过利用轮式人形数据提升双足VLA性能,采用末端执行器轨迹作为通用接口,通过仿真重定向和预训练实现高效任务执行,减少对同构数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18544 2026-03-20 eess.IV cs.AI cs.CV

SCISSR: Scribble-Conditioned Interactive Surgical Segmentation and Refinement

SCISSR:基于涂鸦的交互式手术分割与细化

Haonan Ping, Jian Jiang, Cheng Yuan, Qizhen Sun, Lv Wu, Yutong Ban

机构 * Global College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学全球学院,上海,中国)

AI总结 SCISSR通过轻量级涂鸦编码器将自由手绘涂鸦转换为密集提示嵌入,实现手术场景分割的交互式迭代细化,优于点提示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18501 2026-03-20 cs.CV cs.AI

Efficient Video Diffusion with Sparse Information Transmission for Video Compression

高效视频扩散与稀疏信息传输用于视频压缩

Mingde Zhou, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Diff-SIT方法,通过稀疏时序编码模块和单步视频扩散模型提升视频压缩的感知质量和时间一致性,尤其在超低比特率下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18432 2026-03-20 cs.LG

MLOW: Interpretable Low-Rank Frequency Magnitude Decomposition of Multiple Effects for Time Series Forecasting

MLOW:多效应时间序列预测的可解释低秩频率幅度分解

Runze Yang, Longbing Cao, Xiaoming Wu, Xin You, Kun Fang, Jianxun Li, Jie Yang

机构 * Macquarie University(麦考瑞大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 MLOW通过低秩频率幅度分解方法,实现时间序列中多效应的可解释分解,解决了传统模型在可解释性、效率和泛化性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00960 2026-03-20 cs.CV

Efficient and Scalable Monocular Human-Object Interaction Motion Reconstruction

高效且可扩展的单目人类-物体交互运动重建

Boran Wen, Ye Lu, Sirui Wang, Keyan Wan, Jiahong Zhou, Junxuan Liang, Xinpeng Liu, Bang Xiao, Ruiyang Liu, Yong-Lu Li

机构 * SJTU(上海交通大学) SII(上海信息院) FDU(福建大学) BJTU(北京理工大学) ZJU(浙江大学)

AI总结 本文提出一种高效的稀疏接触标注方法和InterPoint多模态预测器,结合4DHOISolver框架,构建了大规模4D HOI数据集,并通过强化学习验证了运动重建的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08316 2026-03-20 cs.CV

Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

通过2D语义知识解锁3D affordance分割

Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)

AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02437 2026-03-20 cs.RO

U-ARM : Ultra low-cost general teleoperation interface for robot manipulation

U-ARM:超低成本通用机器人操控接口

Yanwen Zou, Zhaoye Zhou, Chenyang Shi, Zewei Ye, Junda Huang, Yan Ding, Bo Zhao

机构 * School of AI, SJTU(1 人工智能学院,上海交通大学) EvoMind Tech(2 EvoMind科技) IAAR-Shanghai(3 上海IAAR)

AI总结 U-ARM提出一种低成本且快速适应的遥控框架,通过三种结构不同的3D打印领导者臂实现与多数商用机械臂的兼容,成本仅为50.5美元和56.8美元,提升了操控效率和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏