arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2401.02458 2026-04-30 cs.LG cs.AI

Data-Centric Foundation Models in Computational Healthcare: A Survey

计算医学中的数据驱动基础模型:一项综述

Yunkun Zhang, Jin Gao, Zheling Tan, Lingfeng Zhou, Kexin Ding, Mu Zhou, Shaoting Zhang, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Rutgers University(罗切斯特大学) Shanghai Jiao Tong University, China(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文综述了计算医学中数据驱动基础模型的发展,探讨了从预训练到推理的数据中心化方法,旨在提升医疗工作流程,并讨论了AI安全、评估及与人类价值观的对齐问题。

Comments Published in ACM Computing Surveys

Journal ref ACM Comput. Surv. 58, 11, Article 287 (August 2026), 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11100 2026-04-29 cs.AI

ReCreate: Reasoning and Creating Domain Agents Driven by Experience

ReCreate:基于经验的推理与创造领域代理框架

Zhezheng Hao, Hong Wang, Jian Luo, Jianqing Zhang, Yuyan Zhou, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文提出ReCreate框架,通过利用代理交互历史,自动创建和适应领域代理,优于人类设计和现有自动化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05110 2026-04-29 cs.AI

GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts

GlimpRouter: 通过窥视一个思考标记实现高效的协作推理

Wenhao Zeng, Xuteng Zhang, Yuling Shi, Chao Hu, Yuting Chen, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出GlimpRouter框架,通过分析推理步骤首个标记的熵值来决定是否调用大模型,从而减少推理延迟并保持精度。

Comments Accepted to ACL 2026 Findings. Code available at https://github.com/Zengwh02/GlimpRouter

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11349 2026-04-29 cs.CV cs.AI cs.GR

Representation Paradigms in AI-based 3D Radiological Image Reconstruction: A Systematic Review

基于人工智能的3D放射学图像重建的表示范式:系统综述

Yuezhe Yang, Lei Bi, Boyu Yang, Yaqian Wang, Yang He, Yige Peng, Zhe Jin, Xingbo Dong, Jinman Kim

机构 * Biomedical Data Analysis and Visualisation (BDAV) Lab, School of Computer Science(生物医学数据与可视化实验室,计算机科学学院) Anhui Provincial International Joint Research Center for Advanced Technology in Medical Imaging, School of Artificial Intelligence(安徽省国际联合先进医学影像技术研究中心,人工智能学院) Institute of Translational Medicine, Shanghai Jiao Tong University(转化医学研究院,上海交通大学)

AI总结 本文综述了基于人工智能的3D放射学图像重建算法,按重建目标参数化方式分为四类表示方法,并讨论了当前发展、挑战及未来方向。

Comments 58 pages, Under Reivew

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25128 2026-04-29 cs.CV

ResetEdit: Precise Text-guided Editing of Generated Image via Resettable Starting Latent

ResetEdit: 通过可重置的起始潜在实现生成图像的精确文本引导编辑

Hanyi Wang, Han Fang, Zheng Wang, Shilin Wang, Ee-Chien Chang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(科学技术大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出ResetEdit框架,通过在生成过程中嵌入可恢复的潜在信息,实现高精度文本引导编辑,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10813 2026-04-29 cs.CV cs.RO

InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic Layouts

InternScenes: 一个大规模可模拟室内场景数据集,具有逼真布局

Weipeng Zhong, Peizhou Cao, Yichen Jin, Li Luo, Wenzhe Cai, Jingli Lin, Hanqing Wang, Zhaoyang Lyu, Tai Wang, Bo Dai, Xudong Xu, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) The University of Hong Kong(香港大学)

AI总结 本文提出InternScenes数据集,包含4万多个多样化场景,涵盖15种常见场景类型和288个物体类别,通过整合现实扫描、程序生成和设计师创作的场景,保留大量小物品以实现逼真布局,用于场景布局生成和点-目标导航任务。

Comments Accepted by NeurIPS 2025; Project page: https://marjordcpz.github.io/InternScenes.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09981 2026-04-29 cs.CV cs.RO

ReSim: Reliable World Simulation for Autonomous Driving

ReSim:面向自动驾驶的可靠世界模拟

Jiazhi Yang, Kashyap Chitta, Shenyuan Gao, Long Chen, Yuqian Shao, Xiaosong Jia, Hongyang Li, Andreas Geiger, Xiangyu Yue, Li Chen

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) OpenDriveLab at Shanghai AI Lab(上海人工智能实验室OpenDrive实验室) NVIDIA Research(NVIDIA研究) Xiaomi EV(小米电动车) Shanghai Jiao Tong University(上海交通大学) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) HKUST(香港科技大学)

AI总结 本文提出ReSim模型,通过整合真实数据与模拟数据提升自动驾驶场景模拟的可靠性与可控性,提升规划和策略选择性能。

Comments NeurIPS 2025 Spotlight. Project page: https://opendrivelab.com/ReSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24447 2026-04-28 cs.RO cs.AI

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

跨XPUs的视觉-语言-动作模型特性分析:约束与加速以实现机器人部署

Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文研究了视觉-语言-动作模型在机器人上的部署问题,通过模型与硬件的协同分析,揭示了边缘加速器在成本、能耗和时间上的优化潜力,并提出DP-Cache和V-AEFusion方法提升性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24348 2026-04-28 cs.CL

OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents

OS-SPEAR:一个用于操作系统代理安全、性能、效率和鲁棒性分析的工具包

Zheng Wu, Yi Hua, Zhaoyuan Huang, Chenhao Xue, Yijie Lu, Pengzhou Cheng, Zongru Wu, Lingzhong Dong, Gongshen Liu, Xinghao Jiang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 OS-SPEAR通过四个维度系统分析操作系统代理,解决现有评估方法在安全、效率和多模态鲁棒性方面的不足,揭示代理在效率与安全之间的权衡及不同模态的鲁棒性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06542 2026-04-28 cs.LG cs.DC cs.MA stat.ML

On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning

在去中心化学习中单一全局融合的惊人效果

Tongtian Zhu, Tianyu Zhang, Mingze Wang, Zhanpeng Zhou, Can Wang

机构 * Zhejiang University(浙江大学) Mila, Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了去中心化学习中通信调度策略,发现集中通信预算在后期阶段可显著提升测试性能,通过单一全局融合实现完全连接,有效提升高数据异质性下的学习性能。

Comments We discover and theoretically explain why and when a single global parameter merging in decentralized learning can recover the performance of federated learning, even in highly heterogeneous and communication-constrained environments

Journal ref ICLR 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24053 2026-04-28 cs.CV

Light 'em Up: Enabling Few-Shot Low-Light 3D Gaussian Splatting with Multi-Scale Explicit Retinex Illumination Decoupling

点亮它们:通过多尺度显式Retinex照明解耦实现少样本低光3D高斯点溅射

YuHao Yin, Zongji Wang, Yuanben Zhang, Biqing Li, Jiesong Bai, Junyi Liu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出MERID-GS框架,通过多尺度显式Retinex照明解耦和3D高斯点溅射,实现低光环境下少样本高质量360度视图合成,同时提升跨场景泛化能力与视图一致性。

Comments 19 pages, 5 figures. Code available at https://github.com/YhuoyuH/MERID-GS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24001 2026-04-28 cs.AI

CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation

CT-FineBench:用于CT报告生成细粒度评估的诊断可信度基准

Ruifeng Yuan, Wanxing Chang, Weiwei Cao, Bowen Shi, Zhongyu Wei, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(沪幻实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 CT-FineBench通过基于问题回答的流程构建,评估CT报告的细粒度事实一致性,优于传统指标,能更敏感地捕捉临床细节错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23717 2026-04-28 cs.SD cs.CL

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

HeadRouter: 任务自适应音频标记压缩中的动态头部权重路由

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) DAIL Tech(DAIL科技) Northeastern University(东北大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 HeadRouter通过动态评估不同音频任务中注意力头的重要性,实现高效的音频标记压缩,实验表明其在多个基准上均取得最佳压缩效果。

Comments Homepage: https://dabdans.github.io/HeadRouter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23678 2026-04-28 cs.AI

Transferable Human Mobility Network Reconstruction with neuroGravity

基于neuroGravity的人类移动网络重构

Jinming Yang, Shaoyu Huang, Zongyuan Huang, Yaohui Jin, Xiaokang Yang, Marta C. Gonzalez, Yanyan Xu

机构 * MoE Key Laboratory of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, Shanghai 200240, China(人工智能编译实验室,人工智能研究院,上海交通大学,上海 200240,中国) Data-Driven Management Decision Making Lab, Shanghai Jiao Tong University, Shanghai 200240, China(数据驱动管理决策实验室,上海交通大学,上海 200240,中国) Department of City and Regional Planning, University of California, Berkeley, CA 94720, USA(城市与区域规划系,加州大学伯克利分校,CA 94720,美国) Energy Technologies Area, Lawrence Berkeley National Laboratory, Berkeley, CA 94720, USA(能源技术领域,劳伦斯伯克利国家实验室,伯克利,CA 94720,美国) Department of Civil and Environmental Engineering, University of California, Berkeley, CA 94720, USA(土木与环境工程系,加州大学伯克利分校,CA 94720,美国)

AI总结 本文提出neuroGravity模型,通过城市设施和人口分布数据重构移动网络,揭示空间收入 segregation 对模型迁移的重要性,为资源有限地区提供低成本的移动流量代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23641 2026-04-28 cs.CV

VDLF-Net: Variational Feature Fusion for Adaptive and Few-Shot Visual Learning

VDLF-Net:变分特征融合用于自适应和少样本视觉学习

Jiawei Yan

机构 * Department of Statistics, Shanghai Jiao Tong University(上海交通大学统计系)

AI总结 VDLF-Net通过在多尺度CNN主干上添加紧凑的变分自编码器,结合潜在向量和softmax门控实现自适应和少样本视觉学习,实验显示其在CIFAR-100和Mini-ImageNet上优于多种基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19234 2026-04-28 cs.CV

Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation

学习正确的步骤:面向视觉生成的客观感知过程优化

Rui Li, Ke Hao, Yuanzhi Liang, Haibin Huang, Chi Zhang, Yun Gu, XueLong Li

机构 * University of Science and Technology of China(科学技术大学) Shanghai Jiao Tong University(交通大学)

AI总结 本文提出OTCA框架,通过细粒度奖励分配提升视觉生成质量,解决传统GRPO在奖励分配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11831 2026-04-28 cs.CV

Towards High-Fidelity CAD Generation via LLM-Driven Program Generation and Text-Based B-Rep Primitive Grounding

通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成

Jiahao Li, Qingwang Zhang, Qiuyu Chen, Guozhan Qiu, Yunzhong Lou, Xiangdong Zhou

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19906 2026-04-28 cs.AR cs.AI cs.LG

GTAC: A Generative Transformer for Approximate Circuits

GTAC:一种用于近似电路的生成式变压器

Jingxin Wang, Shitong Guo, Wenhui Liang, Ruicheng Dai, Ruogu Ding, Xin Ning, Weikang Qian

机构 * Global College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学全球学院)

AI总结 本文提出GTAC,一种端到端的生成式近似逻辑综合框架,通过生成核心和不可约编码提升电路设计效率,实现延迟和门数的显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21107 2026-04-28 cs.LG q-bio.MN

Doloris: Dual Conditional Diffusion Implicit Bridges with Sparsity Masking Strategy for Unpaired Single-Cell Perturbation Estimation

Doloris:双条件扩散隐式桥梁与稀疏掩码策略用于无配对单细胞扰动估计

Changxi Chi, Jun Xia, Yufei Huang, Zhuoli Ouyang, Cheng Tan, Yunfan Liu, Jingbo Zhou, Chang Yu, Liangyu Yuan, Siyuan Li, Zelin Zang, Stan Z. Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Centre for Artificial Intelligence and Robotics Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(人工智能与机器人中心 香港创新研究院 中国科学院) Southern University of Science and Technology(南方科技大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Doloris模型,通过双条件扩散模型和稀疏掩码策略解决无配对单细胞扰动数据建模问题,有效捕捉单细胞扰动多样性并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23392 2026-04-28 cs.AI

SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

SoccerRef-Agents: 多智能体系统用于自动足球裁判

Zi Meng, Wanli Song, Yi Hu, Jiayuan Rao, Gang Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。

Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23249 2026-04-28 cs.RO

BridgeACT: Bridging Human Demonstrations to Robot Actions via Unified Tool-Target Affordances

BridgeACT: 通过统一的工具-目标可及性桥接人类示范与机器人动作

Yifan Han, Jianxiang Liu, Haoyu Zhang, Yuqi Gu, Yunhan Guo, Wenzhao Lian

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 BridgeACT通过统一的工具-目标可及性表示,直接从人类视频学习机器人操作,无需机器人示范数据,有效提升真实世界执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23231 2026-04-28 cs.CR cs.AI

Toward Polymorphic Backdoor against Semantic Communication via Intensity-Based Poisoning

面向语义通信的多态后门攻击:基于强度的污染

Xiao Yang, Yuni Lai, Gaolei Li, Jun Wu, Kai Zhou, Jianhua Li, Mingzhe Chen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Key Laboratory of Integrated Administration Technologies for Information Security(上海信息安全集成管理技术重点实验室) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系) Department of Electrical and Computer Engineering and Frost Institute for Data Science and Computing, University of Miami(迈阿密大学电子与计算机工程系及弗罗斯特数据科学与计算研究所)

AI总结 本文提出SemBugger,一种多态语义通信后门,通过动态调整触发强度实现对系统知识的精细控制,以生成多样化的恶意结果。同时提出可证明鲁棒性的防御机制,有效抵御同类攻击。

Comments This paper has been accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22905 2026-04-28 eess.IV cs.AI cs.CV

CT-Guided Spatially-varying Regularization for Voxel-Wise Deformable Whole-Body PET Registration

基于CT的局部变化正则化用于全身体积PET变形注册

Xiangcen Wu, Ruohua Chen, Sichun Li, Qianye Yang, Sheng Liu, Jianjun Liu, Zhaoheng Xie

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Ren Ji Hospital, Shanghai Jiao Tong University(上海交通大学仁济医院) University of Oxford(牛津大学)

AI总结 本文提出基于CT的局部变化正则化方法,用于全身体积PET变形注册,通过CT体积构建voxel级正则化图,提高全身体积注册精度和器官对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22885 2026-04-28 cs.CV cs.AI

Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

联邦跨模态检索与缺失模态的语义路由和适配器个性化

Hefeng Zhou, Xuan Liu, Sicheng Chen, Wutong Zhang, Wu Yan, Jiong Lou, Chentao Wu, Guangtao Xue, Wei Zhao, Jie Li

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-鲁克桑克鲁特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) Shaanghai Jiao Tong University(上海交通大学)

AI总结 本文提出RCSR框架,通过语义路由和适配器个性化解决联邦跨模态检索中异构数据和缺失模态的问题,提升全局检索准确性和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07990 2026-04-28 cs.CV

SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations

SceneScribe-1M:一个具有全面几何和语义标注的大规模视频数据集

Yunnan Wang, Kecheng Zheng, Jianyuan Wang, Minghao Chen, David Novotny, Christian Rupprecht, Yinghao Xu, Xing Zhu, Wenjun Zeng, Xin Jin, Yujun Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东部技术研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江工业智能与数字孪生重点实验室)

AI总结 SceneScribe-1M通过提供一个包含一百万真实视频的数据集,支持3D几何感知与视频合成的统一资源,推动了单目深度估计、场景重建等下游任务及文本到视频合成等生成任务的发展。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04204 2026-04-28 cs.CY cs.AI cs.CL cs.HC cs.MA

TeachMaster: Generative Teaching via Code

TeachMaster: 通过代码生成教学内容

Yuheng Wang, Runde Yang, Lin Wu, Jie Zhang, Jingru Fan, Tianle Zhou, Ruoyu Fu, Huatao Li, Ruijie Shi, Siheng Chen, Weinan E, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出Generative Teaching paradigm,通过多智能体框架TeachMaster实现教学内容的自动化生成,提升生产效率并降低教育视频制作成本。

Comments Accepted to ACL 2026; https://www.teachmaster.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏