arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3172
2512.14187 2026-03-26 cs.GR cs.CV

Establishing Stochastic Object Models from Noisy Data via Ambient Measurement-Integrated Diffusion

通过环境测量整合扩散建立随机物体模型

Xiaoning Lei, Jianwei Sun, Wenhao Cai, Xichen Xu, Yanshu Wang, Hu Gao

机构 * Contemporary Amperex Technology Co.Limited(当代爱普科技术有限公司) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

AI总结 本文提出AMID方法,通过整合环境测量噪声与扩散轨迹,建立清洁的随机物体模型,提升医学影像生成质量和任务基于的图像质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11715 2026-03-26 cs.CV cs.MM eess.IV

EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing

EditMGT: 解锁屏蔽生成变压器在图像编辑中的潜力

Wei Chow, Linfeng Li, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li, Junting Pan, Shaoteng Liu, Ran Zhou, Tianshu Yang, Songhua Liu

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出EditMGT框架,利用Masked Generative Transformers实现局部化编辑,通过多层注意力整合和区域保持采样提升编辑精度与效率,实验表明其在编辑质量和速度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06767 2026-03-26 cs.LG cs.AI

QUARK: Quantization-Enabled Circuit Sharing for Transformer Acceleration by Exploiting Common Patterns in Nonlinear Operations

QUARK:通过利用非线性操作中的共同模式实现变压器加速的量化启用电路共享

Zhixiong Zhao, Haomin Li, Fangxin Liu, Yuncheng Lu, Zongwu Wang, Tao Yang, Li Jiang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Qi Zhi Institute(上海启智研究院) Nanyang Technological University(南洋理工大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 QUARK通过利用非线性操作中的共同模式,实现高效电路共享,减少硬件资源需求,提升Transformer模型的推理速度和精度。

Comments Accepted by ICCAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19672 2026-03-26 cs.RO math.DS

Memory-Augmented Potential Field Theory: A Framework for Adaptive Control in Non-Convex Domains

具有记忆的势场理论:非凸域中自适应控制的框架

Dongzhe Zheng, Wenjie Mei

机构 * Department of Computer Science and Engineering, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(计算机科学与工程系,电子信息与电气工程学院,上海交通大学) School of Robotics and Automation, Suzhou Campus, Nanjing University(机器人与自动化学院,南京大学苏福校区)

AI总结 本文提出一种结合历史经验的随机优化控制框架,通过动态构建记忆势场来识别状态空间的关键拓扑特征,提升非凸环境中控制器的自适应优化能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03938 2026-03-26 cs.CV

TopoSculpt: Betti-Steered Topological Sculpting of 3D Fine-grained Tubular Shapes

TopoSculpt: 3D细粒度管状形状的贝蒂引导拓扑雕刻

Minghui Zhang, Yaoyu Liu, Junyang Wu, Xin You, Hanxiao Zhang, Junjun He, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Shanghai AI Lab(上海人工智能实验室) Medical Image Insights(医学影像洞察)

AI总结 本文提出TopoSculpt框架,通过整体区域建模策略和拓扑完整性贝蒂约束,改进3D细粒度管状结构的拓扑重构,实验显示在肺部气道和Willis环数据集上显著提升几何与拓扑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14951 2026-03-26 cs.CV

Morph: A Motion-free Physics Optimization Framework for Human Motion Generation

Morph:一种无需运动的物理优化框架用于人类运动生成

Zhuo Li, Mingshuang Luo, Ruibing Hou, Xin Zhao, Hao Liu, Hong Chang, Zimo Liu, Chen Li

机构 * WeChat, Tencent Inc(微信,腾讯公司) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(CAS),计算技术研究所,CAS,中国) Peng Cheng Laboratory, China(鹏城实验室,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) MoE Key Laboratory of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能MoE重点实验室,人工智能研究院,上海交通大学)

AI总结 本文提出Morph框架,通过运动生成器和运动物理细化模块提升运动的物理合理性,无需昂贵真实运动数据,实验显示其在文本到运动和音乐到舞蹈生成任务中达到最先进的运动质量。

Comments Accepted by ICCV 2025, 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23345 2026-03-25 cs.CV

FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Captures

FHAvatar: 从少量随意捕获快速高效重建面部和头发可组合的3D头身虚拟角色

Yujie Sun, Zhuoqiang Cai, Chaoyue Niu, Jianchuan Chen, Zhiwen Chen, Chengfei Lv, Fan Wu

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 FHAvatar提出一种新型框架,通过分离面部和头发表示,实现从任意数量视角高效重建3D高斯虚拟角色,支持实时动画和风格化编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23326 2026-03-25 cs.CV

ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images

ViBe:源自纯图像的超高清视频合成

Yunfeng Wu, Hongying Cheng, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Jilin University(吉林大学)

AI总结 本文提出纯图像适应框架,通过两阶段LoRA策略提升视频扩散模型生成超高清视频的能力,无需视频训练数据,在VBench基准上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22704 2026-03-25 cs.CL

Synthetic or Authentic? Building Mental Patient Simulators from Longitudinal Evidence

合成还是真实?从纵向证据构建心理健康患者模拟器

Baihan Li, Bingrui Jin, Kunyao Lan, Ming Wang, Mengyue Wu

机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

AI总结 本文提出DEPROFILE框架,通过整合多源数据构建统一患者档案,提升对话真实性和行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20644 2026-03-25 cs.CV

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化

Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Xiamen University(厦门大学)

AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07533 2026-03-25 cs.RO cs.CV

ACCURATE: Arbitrary-shaped Continuum Reconstruction Under Robust Adaptive Two-view Estimation

ACCURATE:任意形状连续体的鲁棒自适应双视角估计下的精确重建

Yaozhi Zhang, Shun Yu, Yugang Zhang, Yang Liu

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(未来技术全球研究院,上海交通大学)

AI总结 本文提出ACCURATE框架,结合图像分割神经网络与几何约束拓扑遍历算法,实现对任意形状连续体的高精度重建,实验表明在模拟和真实数据集上均达到亚毫米精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18933 2026-03-25 cs.CV cs.RO

Point What You Mean: Visually Grounded Instruction Policy

指出你的意图:基于视觉的指令策略

Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li, Cheng Ma, Di Zhang, Yingdong Hu, Guang Chen, Junyuan Xie, Junliang Guo, Junqiao Zhao, Yang Gao

机构 * Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Spirit AI Tsinghua University(清华大学)

AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15620 2026-03-25 cs.LG

On-device Semantic Selection Made Low Latency and Memory Efficient with Monolithic Forwarding

在设备上实现语义选择:通过单体转发实现低延迟和内存高效

Jiahao Zhou, Chengliang Lin, Dingji Li, Mingkai Dong, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

AI总结 本文提出PRISM系统,通过单体转发实现低延迟和内存高效的语义top-K选择,减少延迟和内存使用,提升设备AI应用的效率和部署性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00415 2026-03-25 cs.AI

Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm

迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹

Dadi Guo, Tianyi Zhou, Dongrui Liu, Chen Qian, Qihan Ren, Shuai Shao, Zhiyuan Fan, Yi R. Fung, Kun Wang, Linfeng Zhang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科技大学) University of Michigan(密歇根大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出TRACE框架,通过测试时间探索使代理在原有任务基础上自演化更复杂的任务,提升基准的动态性和可靠性,适应并改进了AIME-2024等推理数据集。

Comments This is a work in progress due to methodology refinement and further evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09424 2026-03-25 cs.RO

Exploring Pose-Guided Imitation Learning for Robotic Precise Insertion

探索基于姿态引导的模仿学习用于机器人精确插入

Han Sun, Sheng Liu, Yizhao Wang, Zhenning Zhou, Shuai Wang, Haibo Yang, Jingyuan Sun, Qixin Cao

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院) Karlsruhe Institute of Technology(卡尔斯鲁厄大学) Shanghai Huawei Technologies Co., Ltd.(上海华为技术有限公司)

AI总结 本文提出基于姿态引导的模仿学习方法,通过紧凑的对象中心观测实现精确插入任务,提升数据效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16125 2026-03-25 cs.DC cs.LG

Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design

Arena:通过动态调度和自适应并行性协同设计高效训练大模型

Chunyu Xue, Weihao Cui, Quan Chen, Chen Chen, Han Zhao, Shulai Zhang, Linmei Wang, Yan Li, Limin Xiao, Weifeng Zhang, Jing Yang, Bingsheng He, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Lenovo Research(联想研究院) Microsoft(微软公司) Guizhou University(贵州大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出Arena系统,通过动态调度与自适应并行性协同设计,提升GPU集群效率,减少作业完成时间达49.3%,集群吞吐量提升1.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22304 2026-03-25 cs.LG

Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization

通过渐进量化缓解早期内离散化以实现鲁棒的向量标记化

Wenhao Zhao, Qiran Zou, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

AI总结 本文提出渐进量化方法,通过引入量化难度动态作为VQ训练的关键维度,有效引导代码本向扩展良好的流形发展,提升了多模态模型的生成性能和生物序列建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22148 2026-03-24 cs.CV

OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation

OpenEarth-Agent:从工具调用到工具创建用于开放环境地球观测

Sijie Zhao, Feng Liu, Xueliang Zhang, Hao Chen, Xinyu Gu, Zhe Jiang, Fenghua Ling, Ben Fei, Wenlong Zhang, Junjue Wang, Weihao Xuan, Pengfeng Xiao, Naoto Yokoya, Lei Bai

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学)

AI总结 本文提出OpenEarth-Agent框架,通过自适应工作流规划与工具创建,解决开放环境地球观测中多源数据和异构任务的挑战,并通过OpenEarth-Bench评估其适应性和工具创建能力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21957 2026-03-24 cs.CV

Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

面向超低保留率的视频大语言模型统一时空令牌压缩

Junhao Du, Jialong Xue, Anqi Li, Jincheng Dai, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出统一的时空令牌压缩方法,通过全局令牌保留池整合注意力权重和语义相似性,实现高效令牌选择与合并,保留90.1%性能并降低计算量至2.6%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21808 2026-03-24 cs.CV

Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment

无需级联的 Mandarin 视觉语音识别 via 语义引导的跨表征对齐

Lei Yang, Yi He, Fei Wu, Shilin Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种无需级联的多任务学习架构,通过整合音素和viseme等中间表示,利用语义引导的局部对比损失对齐特征,提升识别性能并减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21700 2026-03-24 cs.CV

PPGL-Swarm: Integrated Multimodal Risk Stratification and Hereditary Syndrome Detection in Pheochromocytoma and Paraganglioma

PPGL-Swarm:集成多模态风险分层与遗传综合征检测的pheochromocytoma和paraganglioma诊断系统

Zelin Liu, Xiangfu Yu, Jie Huang, Ge Wang, Yizhe Yuan, Zhenyu Yi, Jing Xie, Haotian Jiang, Lichi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Ruijin Hospital(瑞金医院) ShanghaiTech University(上海科技大学)

AI总结 本文提出PPGL-Swarm系统,通过多模态证据整合实现全面诊断报告,包括自动化GAPP评分、基因风险警报及可追溯的推理路径,解决传统诊断方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21508 2026-03-24 cs.LG cs.AI cs.HC

Optimizing Feature Extraction for On-device Model Inference with User Behavior Sequences

在用户行为序列上优化特征提取以实现设备端模型推理

Chen Gong, Zhenzhe Zheng, Yiliu Chen, Sheng Wang, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AutoFeature系统,通过图抽象、图优化和高效缓存减少设备端特征提取延迟,提升模型推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11549 2026-03-24 cs.LG cs.AI

Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

原生推理模型:训练语言模型在不可验证数据上进行推理

Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出NRT框架,通过让模型自行生成推理轨迹,无需专家示范,提升推理能力,实验证明其在复杂推理任务中表现优异,具有鲁棒性和可扩展性。

Comments Accepted at ICLR 2026. Code available at https://github.com/sharkwyf/native-reasoning-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24358 2026-03-24 cs.SE cs.CL

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

通过代理驱动的标注和评估自动评估代码代理

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。

Comments Accepted by AAMAS 2026

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24302 2026-03-24 cs.LG

LEAF: Language-EEG Aligned Foundation Model for Brain-Computer Interfaces

LEAF:语言-脑电对齐的基础模型用于脑机接口

Muyun Jiang, Shuailei Zhang, Zhenjie Yang, Mengjun Wu, Weibang Jiang, Zhiwei Guo, Wei Zhang, Rui Liu, Shangen Zhang, Yong Li, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国) University of Science and Technology Beijing, China(北京科技大学,中国) Southeast University, China(东南大学,中国)

AI总结 LEAF通过整合语义指导生成结构化的脑电嵌入,提升解码鲁棒性和迁移性,实现语言与脑电信号的对齐,取得12个数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14145 2026-03-24 cs.DC cs.AI

DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline

DIP: 一种高效的大规模多模态模型训练方法,采用动态交错流水线

Zhenliang Xue, Hanpeng Hu, Xing Chen, Yimin Jiang, Yixin Song, Zeyu Mi, Yibo Zhu, Daxin Jiang, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出DIP框架,通过分离不同模态计算和动态分割输入数据,提升大规模多模态模型训练效率,实验显示吞吐量提升达97.3%。

Comments To be published in ASPLOS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21295 2026-03-24 cs.CV

Text-Image Conditioned 3D Generation

文本-图像条件的3D生成

Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室、人工智能学院、计算机科学学院、上海交通大学) Huawei Inc.(华为公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出结合文本和图像条件的3D生成方法,通过跨模态互补性提升生成质量,引入TIGON模型实现高效融合。

Comments CVPR 2026. Project page: https://jumpat.github.io/tigon-page Code: https://github.com/Jumpat/tigon

详情

展开后加载摘要…

URL PDF HTML 收藏