arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3172
2602.14224 2026-02-17 cs.SD cs.CL cs.MM

The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents

Interspeech 2026音频推理挑战:评估音频推理模型和代理的推理过程质量

Ziyang Ma, Ruiyang Xu, Yinghao Ma, Chao-Han Huck Yang, Bohan Li, Jaeyeon Kim, Jin Xu, Jinyu Li, Carlos Busso, Kai Yu, Eng Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Queen Mary University of London(伦敦大学Queen Mary) NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Microsoft Corporation(微软公司)

AI总结 Interspeech 2026音频推理挑战通过评估推理过程质量,探讨了音频推理模型和代理在事实性和逻辑性方面的表现及改进方向。

Comments The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14083 2026-02-17 cs.AI

Plan-MCTS: Plan Exploration for Action Exploitation in Web Navigation

Plan-MCTS:网页导航中的计划探索用于动作利用

Weiming Zhang, Jihong Wang, Jiamu Zhou, Qingyao Li, Xinbei Ma, Congmin Zheng, Xingyu Lou, Weiwen Liu, Zhuosheng Zhang, Jun Wang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

AI总结 Plan-MCTS通过将网页导航探索转移到语义计划空间,提升动作利用效率,实现更高效的导航任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14054 2026-02-17 cs.CL

LogitsCoder: Towards Efficient Chain-of-Thought Path Search via Logits Preference Decoding for Code Generation

LogitsCoder:通过logits偏好解码实现高效的思维链搜索以提升代码生成

Jizheng Chen, Weiming Zhang, Xinyi Dai, Weiwen Liu, Kounianhua Du, Yasheng Wang, Ruiming Tang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab Shanghai(华为诺亚实验室)

AI总结 LogitsCoder通过logit级控制机制提升代码生成的推理效率和质量,实现高效且有效的思维链搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13778 2026-02-17 cs.CV

Skeleton2Stage: Reward-Guided Fine-Tuning for Physically Plausible Dance Generation

Skeleton2Stage: 基于奖励的微调以生成物理合理的舞蹈生成

Jidong Jia, Youjian Zhang, Huan Fu, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Bosch(博世) Youku, Alibaba(优酷、阿里巴巴) Nanyang Technological University(南洋理工大学)

AI总结 Skeleton2Stage通过物理奖励引导微调,提升舞蹈生成的物理合理性与真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20538 2026-02-17 cs.MA cs.AI

Interpreting Emergent Extreme Events in Multi-Agent Systems

多智能体系统中涌现极端事件的解释

Ling Tang, Jilin Mei, Dongrui Liu, Chen Qian, Dawei Cheng, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fu Dan University(福鼎大学) Tongji University(同济大学) Renmin University of China(中国人民大学)

AI总结 本文提出首个多智能体系统中解释涌现极端事件的框架,通过归因分析确定事件起源、驱动者及行为贡献,验证了框架在经济、金融和社会场景中的有效性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11608 2026-02-17 cs.AI

ParaCook: On Time-Efficient Planning for Multi-Agent Systems

ParaCook: 多智能体系统中高效时间规划的研究

Shiqi Zhang, Xinbei Ma, Yunqing Xu, Zouying Cao, Pengrui Lu, Haobo Yuan, Tiancheng Shen, Zhuosheng Zhang, Hai Zhao, Ming-Hsuan Yang

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Merced(加州大学梅尔德分校)

AI总结 ParaCook通过简化动作空间和烹饪任务实例化,为多智能体系统高效时间规划提供基准测试框架,评估LLMs在并行协调和高层次优化中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06738 2026-02-17 cs.CL

AWM: Accurate Weight-Matrix Fingerprint for Large Language Models

AWM: 用于大型语言模型的准确权重矩阵指纹

Boyi Zeng, Lin Chen, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

AI总结 AWM通过基于权重矩阵的无训练指纹方法,利用线性分配问题和无偏中心核对齐相似性,实现对大型语言模型训练来源的可靠识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23522 2026-02-17 cs.CV cs.LG

OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data

OmniEarth-Bench: 向全面评估地球六大球体及跨球体交互的多模态观测地球数据迈进

Fengxiang Wang, Mingshuo Chen, Xuming He, Yi-Fan Zhang, Yueying Li, Feng Liu, Zijie Guo, Zhenghao Hu, Jiong Wang, Jingyi Xu, Zhangrui Li, Junchao Gong, Di Wang, Fenghua Ling, Ben Fei, Weijia Li, Long Lan, Wenjing Yang

机构 * National University of Defense Technology, China(国防科技大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Beijing University of Posts and Telecommunications, China(北京邮电大学) Zhejiang University, China(浙江大学) Shanghai Jiao Tong University, China(上海交通大学) Fudan University, China(复旦大学) Sun Yat-sen University, China(中山大学) Nanjing University, China(南京大学) University of Science and Technology of China(中国科学技术大学) Wuhan University, China(武汉大学)

AI总结 OmniEarth-Bench是首个全面评估地球六大球体及跨球体交互的多模态基准测试,通过29,855个标准化注释揭示了地球系统认知能力的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13407 2026-02-17 cs.AI

On-Policy Supervised Fine-Tuning for Efficient Reasoning

在线监督微调用于高效推理

Anhao Zhao, Ziyang Chen, Junlong Tong, Yingqi Fan, Fanghua Ye, Shuhao Li, Yunpu Ma, Wenjie Li, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Eastern Institute of Technology, Ningbo(宁波工程技术学院) Shanghai Jiao Tong University(上海交通大学) Ludwig Maximilian University of Munich(慕尼黑大学) Tencent Hunyuan / AI Lab(腾讯混元/AI实验室)

AI总结 本文提出在线监督微调方法,通过简化奖励机制提升推理效率和准确性,减少计算成本并优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13332 2026-02-17 cs.CV cs.AI

MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling

MedScope:通过粗到细的工具调用激励“通过视频思考”以进行临床推理

Wenjie Li, Yujie Zhang, Haoran Sun, Xingqi He, Hongcheng Gao, Chenglong Ma, Ming Hu, Guankun Wang, Shiyi Yao, Renhao Yang, Hongliang Ren, Lei Wang, Junjun He, Yankai Jiang

机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院) Fudan University, Shanghai, China(复旦大学) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Tsinghua University, Beijing, China(清华大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)

AI总结 MedScope通过粗到细的工具调用机制,提升临床视频推理的准确性与可信度,实现基于时间局部化视觉证据的医疗AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10098 2026-02-17 cs.RO cs.CV

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02634 2026-02-17 cs.DC cs.AI

KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider

KVCache缓存在实际应用中:对KV缓存进行表征与优化,以大型云提供商为背景

Jiahao Wang, Jinbo Han, Xingda Wei, Sijie Shen, Dingyan Zhang, Chenguang Fang, Rong Chen, Wenyuan Yu, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究院,上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 本文通过表征LLM服务提供商的KV缓存工作负载模式,提出了一种面向工作负载的缓存淘汰策略,以优化实际应用中的缓存性能。

Comments Accepted by USENIX ATC'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07667 2026-02-17 cs.CV

S2R-HDR: A Large-Scale Rendered Dataset for HDR Fusion

S2R-HDR:一个大规模渲染数据集用于HDR融合

Yujin Wang, Jiarui Wu, Yichen Bian, Fan Zhang, Tianfan Xue

机构 * Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) CPII under InnoHK(创新工场下的CPII) Shanghai Jiao Tong University(上海交通大学)

AI总结 S2R-HDR通过构建大规模合成HDR数据集和S2R-Adapter领域适应方法,提升了HDR融合的泛化能力和实验性能。

Comments Accepted by ICLR 2026. Project Page:https://openimaginglab.github.io/S2R-HDR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12922 2026-02-16 cs.CV

Beyond Benchmarks of IUGC: Rethinking Requirements of Deep Learning Methods for Intrapartum Ultrasound Biometry from Fetal Ultrasound Videos

超越IUGC基准:重新思考深度学习方法在胎儿超声视频中的产程超声生物测量需求

Jieyun Bai, Zihao Zhou, Yitong Tang, Jie Gan, Zhuonan Liang, Jianan Fan, Lisa B. Mcguire, Jillian L. Clarke, Weidong Cai, Jacaueline Spurway, Yubo Tang, Shiye Wang, Wenda Shen, Wangwang Yu, Yihao Li, Philippe Zhang, Weili Jiang, Yongjie Li, Salem Muhsin Ali Binqahal Al Nasim, Arsen Abzhanov, Numan Saeed, Mohammad Yaqub, Zunhui Xian, Hongxing Lin, Libin Lan, Jayroop Ramesh, Valentin Bacher, Mark Eid, Hoda Kalabizadeh, Christian Rupprecht, Ana I. L. Namburete, Pak-Hei Yeung, Madeleine K. Wyburd, Nicola K. Dinsdale, Assanali Serikbey, Jiankai Li, Sung-Liang Chen, Zicheng Hu, Nana Liu, Yian Deng, Wei Hu, Cong Tan, Wenfeng Zhang, Mai Tuyet Nhi, Gregor Koehler, Rapheal Stock, Klaus Maier-Hein, Marawan Elbatel, Xiaomeng Li, Saad Slimani, Victor M. Campello, Benard Ohene-Botwe, Isaac Khobo, Yuxin Huang, Zhenyan Han, Hongying Hou, Di Qiu, Zheng Zheng, Gongning Luo, Dong Ni, Yaosheng Lu, Karim Lekadir, Shuo Li

机构 * Department of Cardiovascular Surgery, The First Affiliated Hospital of Jinan University, Jinan University, Guangzhou, China Auckland Bioengineering Institute, The University of Auckland, Auckland, New Zealand School of Computer Science, University of Sydney, Sydney, Australia Neonatology, Sydney Medical School Nepean, University of Sydney Nepean Hospital, Penrith, New South Wales, Australia Discipline of Medical Imaging, Faculty of Medicine Health, Susan Wakil Health Building, University of Sydney, Camperdown, New South Wales, Australia Medical Imaging, Orange Health Service, Orange, New South Wales, Australia University of Electronic Science Henan Kaifeng College of Science Technology Changchun University of Science University of Western Brittany, Brest, France Sichuan University, Chengdu, China Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, Masdar, Abu Dhabi College of Computer Science Engineering, Chongqing University of Technology, Chongqing, China Oxford Machine Learning in NeuroImaging Lab, Department of Computer Science, University of Oxford, Oxford, United Kingdom Visual Geometry Group, University of Oxford, Oxford, United Kingdom School of Computer Science Engineering, Nanyang Technological University, Singapore The University of Michigan-Shanghai Jiao Tong University Joint Institute, Shanghai Jiao Tong University, Shanghai, China College of Computer Information Science, Chongqing Normal University, Chongqing, China The University of Manchester, Manchester, United Kingdom Southwest University, Chongqing, China Division of Medical Image Computing, German Cancer Research Center (DKFZ), Heidelberg, Germany Department of Electronic Computer Engineering, The Hong Kong University of Science Chief Medical Officer Deepecho Ibn Rochd CHU, Hassan II University, Casablanca, Morocco Department of Radiography, School of Biomedical Allied Health Sciences, College of Health Sciences, University of Ghana, Accra Department of Human Biology, Biomedical Engineering Research Center, University of Cape Town, Cape Town, South Africa Gynecology Center, Zhujiang Hospital, Southern Medical University, Guangzhou, China Department of Obstetrics Gynecology, Third Affiliated Hospital of Sun Yat-sen University, Guangzhou, China Gynecology, The First Affiliated Hospital of Jinan University, Guangzhou, China Children's Medical Center, Guangdong Provincial Clinical Research Center for Child Health, Guangzhou, China Engineering Division, King Abdullah University of Science Shenzhen University, Shenzhen, China Artificial Intelligence in Medicine Lab (BCN-AIM), Barcelona, Spain School of Biomedical Engineering, Case Western Reserve University, Cleveland, OH, USA

AI总结 本研究提出了一种多任务自动测量框架,用于产程超声生物测量,旨在解决资源有限环境下超声技师短缺的问题,并通过公开数据集和基准结果促进该领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12892 2026-02-16 cs.CV cs.AI cs.CL

RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training

RADAR: 揭示多模态大语言模型预训练中能力的非对称发展

Yunshuang Nie, Bingqian Lin, Minzhe Niu, Kun Xiang, Jianhua Han, Guowei Huang, Xingyue Quan, Hang Xu, Bokui Chen, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) Tsinghua Shenzhen International Graduate School(清华大学深圳国际 Graduate School) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司) Huawei’s 2012 Lab(华为2012实验室)

AI总结 RADAR提出了一种高效的以能力为中心的评估框架,用于揭示多模态大语言模型预训练中感知和推理能力的非对称发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12889 2026-02-16 cs.CL

BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models

BaziQA-Benchmark:评估大语言模型中的符号性和时间组合推理

Jiangxi Chen, Qian Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 BaziQA-Benchmark通过结构化推理协议评估大语言模型在符号性和时间组合推理中的表现,揭示其在时间难度和推理顺序上的敏感性及系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12205 2026-02-16 cs.CV cs.AI

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12182 2026-02-16 cs.AI cs.LG

TA-KAND: Two-stage Attention Triple Enhancement and U-KAN based Diffusion For Few-shot Knowledge Graph Completion

TA-KAND: 两阶段注意力三重增强与U-KAN基于扩散的少样本知识图谱补全

Xinyu Gao

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 TA-KAND通过两阶段注意力三重增强和U-KAN扩散模型,解决少样本知识图谱补全问题,实验表明其在两个公开数据集上表现优异。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12685 2026-02-16 cs.CL cs.AI cs.LG

ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction

ToolACE-MT:非自回归生成用于代理多轮交互

Xingshan Zeng, Weiwen Liu, Lingzhi Wang, Liangyou Li, Fei Mi, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 ToolACE-MT通过非自回归生成方法高效构建高质量多轮代理对话,解决传统自回归方法效率低下的问题。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19558 2026-02-16 cs.CY cs.LG

PoliCon: Evaluating LLMs on Achieving Diverse Political Consensus Objectives

PoliCon:评估LLMs在实现多样化政治共识目标上的能力

Zhaowei Zhang, Xiaobo Wang, Minghua Yi, Mengmeng Wang, Fengshuo Bai, Zilong Zheng, Yipeng Kang, Yaodong Yang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) USTC(中国科学技术大学) WHU(武汉大学) SJTU(上海交通大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Zhongguancun Academy(中关村学院)

AI总结 PoliCon通过构建基于欧洲议会辩论记录的基准,评估LLMs在不同政治环境下生成共识决议的能力,揭示其在复杂任务中的不足及党派偏见。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00741 2026-02-16 eess.IV cs.CV

LesionDiffusion: Towards Text-controlled General Lesion Synthesis

LesionDiffusion:面向文本控制的通用病变合成

Wenhui Lei, Henrui Tian, Linrui Dai, Hanyu Chen, Xiaofan Zhang

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The First Hospital of China Medical University(中国医科大学第一医院)

AI总结 LesionDiffusion通过文本控制生成3D CT影像中的病变及掩码,提升病变分割性能,支持多种病变类型和器官,优于现有方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00736 2026-02-16 cs.CV

Unifying Multiple Foundation Models for Advanced Computational Pathology

统一多种基础模型以推进高级计算病理学

Wenhui Lei, Yusheng Tan, Anqi Li, Hanyu Chen, Hengrui Tian, Ruiying Li, Zhengqun Jiang, Fang Yan, Xiaofan Zhang, Shaoting Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Washington University in St. Louis(华盛顿大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Surgical Oncology and General Surgery, Key Laboratory of Precision Diagnosis and Treatment of Gastrointestinal Tumours, Ministry of Education, The First Hospital of China Medical University(外科肿瘤科和普通外科,国家教育委员会胃肠道肿瘤精准诊断与治疗重点实验室,中国医科大学第一医院) Shanghai Innovation Institute(上海创新研究院) Sensetime Research(商汤科技研究院)

AI总结 Shazam通过在线整合多个预训练病理基础模型,实现高效且可扩展的计算病理学应用,优于单个模型性能。

Comments 50 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14058 2026-02-16 cs.RO cs.CV

What Matters in Building Vision-Language-Action Models for Generalist Robots

在通用机器人中构建视觉-语言-动作模型所关注的关键因素

Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ByteDance Research(字节跳动研究院) CASIA MAIS-NLPR Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本研究揭示了构建通用机器人视觉-语言-动作模型的关键因素,开发了无需大量手动设计的RoboVLMs,实现了模拟和现实任务中的新状态-of-the-art性能。

Comments Project page: robovlms.github.io. Added limitations and future works. Fix categorization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12172 2026-02-13 cs.AI cs.CL

Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation

教学启发式数据合成用于语言模型知识蒸馏

Bowei He, Yankai Chen, Xiaokun Zhang, Linghe Kong, Philip S. Yu, Xue Liu, Chen Ma

机构 * MBZUAI McGill(麦吉尔大学) CityUHK(城市大学香港分校) SJTU(上海交通大学) UIC(美国国际大学)

AI总结 本文提出基于教学原理的知识蒸馏框架,通过三阶段流程提升学生模型性能,在复杂推理任务中取得显著改进。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12143 2026-02-13 cs.AI cs.LG

STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction

STAR:连接统计推理与代理推理以提升大模型性能预测

Xiaoxiao Wang, Chunxiao Li, Junying Wang, Yijin Guo, Zijian Chen, Chunyi Li, Xiaohong Liu, Zicheng Zhang, Guangtao Zhai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 STAR框架通过结合统计推理与代理推理,有效提升大模型性能预测的准确性与可靠性,尤其在数据稀疏情况下表现突出。

Comments 10 pages, 8 figures, 17 tables. Code available at https://github.com/xiaoxiaostudy/star

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06643 2026-02-13 cs.RO cs.AI cs.LG

Humanoid Manipulation Interface: Humanoid Whole-Body Manipulation from Robot-Free Demonstrations

人形机器人操控接口:无需机器人演示的全身体验操控

Ruiqian Nai, Boyuan Zheng, Junming Zhao, Haodong Zhu, Sicong Dai, Zunhao Chen, Yihang Hu, Yingdong Hu, Tong Zhang, Chuan Wen, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 HuMI通过便携硬件实现无需机器人演示的全身体验操控,提升数据收集效率并提高未见环境中的任务成功率。

Comments Website: https://humanoid-manipulation-interface.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19269 2026-02-13 cs.RO cs.LG

Translating Flow to Policy via Hindsight Online Imitation

通过回顾在线模仿将流翻译为政策

Yitian Zheng, Zhangchen Ye, Weijun Dong, Shengjie Wang, Yuyang Liu, Chongjie Zhang, Chuan Wen, Yang Gao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) University of California San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Qi Zhi Institute(上海启智研究所)

AI总结 通过回顾在线模仿将流翻译为政策,利用2D点流作为高层规划器,在模拟和现实任务中实现超过2倍的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13101 2026-02-13 cs.CV cs.AI cs.LG

Harmonizing Generalization and Specialization: Uncertainty-Informed Collaborative Learning for Semi-supervised Medical Image Segmentation

协调泛化与专门化:基于不确定性的协作学习用于半监督医学图像分割

Wenjing Lu, Yi Hong, Yang Yang

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学)

AI总结 本文提出UnCoL框架,通过双教师机制协调半监督医学图像分割中的泛化与专门化,利用不确定性指导伪标签学习以提升分割性能。

Comments Accepted for publication in IEEE Transactions on Medical Imaging (TMI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00540 2026-02-13 cs.CV

Real-IAD Variety: Pushing Industrial Anomaly Detection Dataset to a Modern Era

现实工业异常检测数据集:推动工业异常检测数据集进入现代时代

Wenbing Zhu, Chengjie Wang, Bin-Bin Gao, Jiangning Zhang, Guannan Jiang, Jie Hu, Zhenye Gan, Lidong Wang, Ziqing Zhou, Jianghui Zhang, Linjie Cheng, Yurui Pan, Bo Peng, Mingmin Chi, Lizhuang Ma

机构 * Fudan University(复旦大学) Youtu Lab, Tencent(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) Rongcheer Co., Ltd(融雪科技有限公司) City University of Hong Kong(香港城市大学) National University of Singapore(新加坡国立大学) Shanghai Ocean University(上海海洋大学)

AI总结 Real-IAD Variety 是一个大规模、高多样性的工业异常检测数据集,用于评估和训练下一代基础IAD模型,揭示了现有方法在类别扩展时的性能下降问题。

Comments 17 pages, 8 figures and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22488 2026-02-13 eess.SP cs.LG

EEG-to-Gait Decoding via Phase-Aware Representation Learning

通过相意识表示学习实现EEG到步态解码

Xi Fu, Weibang Jiang, Rui Liu, Gernot R. Müller-Putz, Cuntai Guan

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院,南洋理工大学,新加坡) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(计算机科学与工程系,上海交通大学,上海) Institute of Neural Engineering, Graz University of Technology, Graz, Austria(神经工程研究所,格拉茨技术大学,奥地利) Centre of AI in Medicine (C-AIM), Nanyang Technological University, Singapore(医学人工智能中心(C-AIM),南洋理工大学,新加坡)

AI总结 NeuroDyGait通过相意识表示学习实现EEG到步态解码,提升跨受试者性能并满足实时BCI需求。

详情

展开后加载摘要…

URL PDF HTML 收藏