arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3172
2504.19596 2026-03-18 eess.SP cs.LG

Towards Robust Multimodal Physiological Foundation Models: Handling Arbitrary Missing Modalities

迈向稳健的多模态生理基础模型:处理任意缺失模态

Wei-Bang Jiang, Xi Fu, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出PhysioOmni模型,通过解耦多模态信号提取通用表示,解决现有方法在跨数据集泛化和缺失模态处理上的不足,实验显示其在情绪识别等任务中表现优异。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18373 2026-03-18 cs.RO cs.HC

UGotMe: An Embodied System for Affective Human-Robot Interaction

UGotMe: 一种用于情感人机交互的具身系统

Peizhen Li, Longbing Cao, Xiao-Ming Wu, Xiaohan Yu, Runze Yang

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化学院)

AI总结 本文提出UGotMe系统,解决多对话场景中视觉噪声和实时响应问题,通过去噪策略和高效数据传输提升情感识别能力。

Comments Accepted to the 2025 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15594 2026-03-17 cs.AI cs.CL

OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data

OpenSeeker:通过完全开源训练数据民主化前沿搜索代理

Yuwen Du, Rui Ye, Shuo Tang, Xinyu Zhu, Yijun Lu, Yuzhu Cai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 OpenSeeker通过两项技术创新实现前沿性能,利用开源数据提升搜索代理能力,实验表明其在多个基准测试中表现优异,超越现有开源和工业竞争对手。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15558 2026-03-17 cs.CV cs.RO

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15478 2026-03-17 cs.CV

ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer

ViFeEdit:一种无需视频的视频扩散变换器调谐器

Ruonan Yu, Zhenxiong Tan, Zigeng Chen, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ViFeEdit框架,通过2D图像实现视频生成与编辑,无需视频训练数据,采用架构重参数化解耦空间独立性与全3D注意力,实现高质量视频编辑与生成。

Comments Working in progress, code is at https://github.com/Lexie-YU/ViFeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15280 2026-03-17 cs.AI

Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory

通过长期神经符号记忆推进多模态代理推理

Rongjie Jiang, Jianwei Wang, Gengda Zhao, Chengyang Luo, Kai Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出NS-Mem框架,结合神经记忆与符号结构,提升多模态代理的推理能力,实验证明其在推理准确率上优于纯神经记忆系统。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15084 2026-03-17 cs.RO

HALO:Closing Sim-to-Real Gap for Heavy-loaded Humanoid Agile Motion Skills via Differentiable Simulation

HALO:通过可微模拟缩小重载人形机器人敏捷运动技能的仿真到现实差距

Xingyi Wang, Chenyun Zhang, Weiji Xie, Chao Yu, Wei Song, Chenjia Bai, Shiqiang Zhu

机构 * Zhejiang University(浙江大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI)) Shanghai Jiao Tong University(上海交通大学) Lumos Robotics(Lumos机器人)

AI总结 本文提出一种两阶段梯度基于系统辨识框架,通过可微模拟器MuJoCo XLA减少仿真到现实的不匹配,提升重载条件下人形机器人的运动跟踪精度和敏捷性。

Comments 9 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14909 2026-03-17 cs.CV

TopoVST: Toward Topology-fidelitous Vessel Skeleton Tracking

TopoVST:迈向拓扑忠实的血管骨架跟踪

Yaoyu Liu, Minghui Zhang, Junjun He, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出TopoVST,通过多尺度球图和图神经网络实现血管骨架跟踪,结合门控特征融合和几何感知加权方案,有效解决拓扑忠实性和类别不平衡问题,实验表明其在重叠和拓扑指标上表现优异。

Comments 10 pages, 9 figures. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14860 2026-03-17 cs.CR cs.AI

Architecture-Agnostic Feature Synergy for Universal Defense Against Heterogeneous Generative Threats

面向异质生成威胁的通用特征协同架构

Bingxue Zhang, Yang Gao, Feida Zhu, Yanyan Shen, Yang Shi

机构 * University of Shanghai for Science and Technology(上海理工大学) Singapore Management University(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ATFS框架,通过目标引导图像实现多模型防御的统一特征空间对齐,有效解决异质生成威胁下的防御问题,实验显示其在扩散模型+GAN场景中达到SOTA性能。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14822 2026-03-17 cs.CV

RadarXFormer: Robust Object Detection via Cross-Dimension Fusion of 4D Radar Spectra and Images for Autonomous Driving

RadarXFormer: 通过4D雷达光谱与图像的跨维度融合实现稳健的目标检测用于自动驾驶

Yue Sun, Yeqiang Qian, Zhe Wang, Tianhui Li, Chunxiang Wang, Ming Yang

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(中国教育部系统控制与信息处理重点实验室) SAIC GM Wuling Automobile Company Co., Ltd.(上汽通用五菱汽车有限公司) Guangxi Laboratory of New Energy Automobile(广西新能源汽车实验室)

AI总结 本文提出RadarXFormer框架,通过融合4D雷达光谱与RGB图像的跨维度信息,提升自动驾驶中的目标检测鲁棒性和准确性,同时保持实时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14818 2026-03-17 cs.SE cs.AI cs.LG

SimCert: Probabilistic Certification for Behavioral Similarity in Deep Neural Network Compression

SimCert: 深度神经网络压缩中的行为相似性概率认证

Jingyang Li, Fu Song, Guoqiang Li

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文提出SimCert框架,通过双网络符号传播方法和方差感知边界技术,实现压缩神经网络的行为相似性验证,提供可调节置信水平的安全保证,实验表明其优于现有方法。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13414 2026-03-17 cs.SE cs.AI

Neuro-Symbolic Generation and Validation of Memory-Aware Formal Function Specifications

神经符号生成与验证内存感知的形式函数规范

Liao Zhang, Tong Chen, Xiwei Wu, Qi Liu, Xiyu Zhai, Xinqi Wang, Qinxiang Cao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程学院)

AI总结 本文提出神经符号框架,通过自然语言描述和函数签名生成内存感知的形式函数规范,结合符号证明器和验证工具链迭代优化,提升形式规范的正确性与语法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13399 2026-03-17 cs.CV

FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving

FlowAD: 无人驾驶中的自体场景交互建模

Mingzhe Guo, Yixiang Yang, Chuanrong Han, Rufeng Zhang, Shirui Li, Ji Wan, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Baidu Inc(百度公司)

AI总结 本文提出FlowAD框架,通过自体场景交互建模提升自动驾驶性能,利用场景流建模动态变化,结合新颖的FCP指标评估场景理解能力,实验表明其在碰撞率和驾驶评分上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13364 2026-03-17 cs.CV cs.AI

FineRMoE: Dimension Expansion for Finer-Grained Expert with Its Upcycling Approach

FineRMoE:细粒度专家的维度扩展及其再利用方法

Ning Liao, Xiaoxing Wang, Xiaohan Qin, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 FineRMoE通过扩展中间和输出维度提升专家专业化,引入双层稀疏计算和专用路由机制,并采用再利用方法降低训练成本,实验证明其在多个基准上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01050 2026-03-17 cs.CV cs.AI cs.GR

EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos

EgoGrasp:从第一人称视频中估计世界空间手-物体交互

Hongming Fu, Wenjia Wang, Xiaozhen Qiao, Rolandos Alexandros Potamias, Taku Komura, Shuo Yang, Zheng Liu, Bo Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 EgoGrasp提出了一种从动态第一人称视频中重建世界空间手-物体交互的方法,支持开放词汇物体,通过多阶段框架实现鲁棒的3D重建与姿态估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16234 2026-03-17 cs.CV

ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation

ARMFlow:用于在线3D人体反应生成的自回归MeanFlow

Zichen Geng, Zeeshan Hayder, Wei Liu, Hesheng Wang, Ajmal Mian

机构 * The University of Western Australia(西澳大学) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(澳大利亚联邦科学与工业研究组织) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ARMFlow框架,通过自回归方法解决在线3D人体反应生成中的高运动保真度、实时推理和自回归适应性问题,引入BSCE减少误差积累,实现高效准确的生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13098 2026-03-16 cs.RO cs.CV

SldprtNet: A Large-Scale Multimodal Dataset for CAD Generation in Language-Driven 3D Design

SldprtNet:一个大规模多模态数据集,用于语言驱动的3D设计CAD生成

Ruogu Li, Sikai Li, Yao Mu, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SldprtNet数据集,用于语义驱动的CAD建模、几何深度学习和多模态模型训练,包含242,000个工业零件,提供多种3D模型格式,并结合图像与文本生成自然语言描述。

Comments Accept by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12657 2026-03-16 cs.CV

VFM-Recon: Unlocking Cross-Domain Scene-Level Neural Reconstruction with Scale-Aligned Foundation Priors

VFM-Recon:通过尺度对齐基础先验解锁跨域场景级神经重建

Yuhang Ming, Tingkang Xi, Xingrui Yang, Lixin Yang, Yong Peng, Cewu Lu, Wanzeng Kong

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) CARDC(中国电子科技研究院)

AI总结 本文提出VFM-Recon,通过引入轻量级尺度对齐阶段和任务特定适配器,解决跨域场景级神经重建中的尺度一致性问题,实现跨域鲁棒性与重建性能的提升。

Comments 19 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12648 2026-03-16 cs.CV

From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space

从稀疏到密集:通过增强条件空间的多视图GRPO用于流模型

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(Adobe研究实验室) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) CPII under InnoHK Project(InnoHK项目下的CPII)

AI总结 本文提出多视图GRPO,通过增强条件空间探索样本间关系,提升文本到图像流模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12304 2026-03-16 cs.LG cs.AI

A Geometrically-Grounded Drive for MDL-Based Optimization in Deep Learning

基于几何的MDL优化在深度学习中的驱动机制

Ming Lei, Shufan Wu, Christophe Baehr

机构 * School of Aeronautics and Astronautics, Shanghai JiaoTong University, Shanghai China(上海交通大学航空航天学院) M´ et´ eo-France/CNRS CNRM/GAMEUMR 3589 and the Mathematical Institute of Toulouse, France(法国Météo-France/CNRS CNRM/GAMEUMR 3589和图卢兹数学研究所)

AI总结 本文提出一种将MDL原理整合到深度学习训练动态中的新框架,通过几何认知流形和MDL驱动项实现数据保真与模型简化之间的平衡,理论证明了描述长度单调减少和拓扑相变等性质,实验验证了算法的有效性。

Comments 8 pages, 9 figures, submitted to a journal and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09217 2026-03-16 cs.CV

TubeMLLM: A Foundation Model for Topology Knowledge Exploration in Vessel-like Anatomy

TubeMLLM:一种用于血管状解剖拓扑知识探索的基础模型

Yaoyu Liu, Minghui Zhang, Xin You, Hanxiao Zhang, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海交通大学医学机器人研究所) Department of Automation, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化系)

AI总结 本文提出TubeMLLM,结合结构理解与可控生成,提升医学血管状解剖的拓扑感知能力,并通过TubeMData基准和自适应损失策略实现跨模态迁移。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20673 2026-03-16 cs.CV

GA-Drive: Geometry-Appearance Decoupled Modeling for Free-viewpoint Driving Scene Generation

GA-Drive:用于自由视角驾驶场景生成的几何-外观解耦建模

Hao Zhang, Lue Fan, Qitai Wang, Wenbo Li, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(CUHK的MMLab) CASIA Shanghai Jiaotong University(上海交通大学) SenseTime Research(商汤科技研究院)

AI总结 GA-Drive通过几何-外观解耦和扩散生成技术,生成可编辑的高保真驾驶场景,提升自动驾驶训练和评估的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01212 2026-03-16 cs.CV cs.LG

Understanding Dataset Distillation via Spectral Filtering

通过频谱过滤理解数据集蒸馏

Deyu Bo, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出UniDD框架,通过频谱过滤统一不同数据集蒸馏目标,提出Curriculum Frequency Matching方法提升性能,验证了UniDD的实用性。

Comments Accepted by ICLR 2026. Code is available at https://github.com/bdy9527/UniDD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12265 2026-03-13 cs.CV

OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams

OmniStream:在连续流中掌握感知、重建与行动

Yibin Yan, Jilan Xu, Shangzhe Di, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, SJTU(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) VGG, Oxford(牛津大学视觉几何组)

AI总结 OmniStream通过统一的流视觉骨干网络,实现对视频流中感知、重建和行动的高效处理,展示了在多种任务上的通用性与竞争力。

Comments Technical Report. Project Page: https://go2heart.github.io/omnistream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12247 2026-03-13 cs.CV

Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation

相信你的批评者:用于忠实图像编辑和生成的鲁棒奖励建模与强化学习

Xiangyu Zhao, Peiyuan Zhang, Junming Lin, Tianhao Liang, Yuchen Duan, Shengyuan Ding, Changyao Tian, Yuhang Zang, Junchi Yan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) BUPT(北京邮电大学) CUHK(香港中文大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出FIRM框架,通过定制数据集和鲁棒奖励模型,提升图像编辑和生成的忠实性与指令遵循,采用'基础与奖励'策略平衡一致性与质量,实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12217 2026-03-13 cs.CV

Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

现实世界点跟踪中的验证者引导伪标签方法

Görkay Aydemir, Fatma Güney, Weidi Xie

机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) KUIS AI Center(KUIS人工智能中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12155 2026-03-13 cs.CV cs.AI

GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows

GlyphBanana: 通过代理工作流推进精确文本渲染

Zexuan Yan, Jiarui Jin, Yue Ma, Shijian Wang, Jiahui Hu, Wenxiang Jiao, Yuan Lu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) South China University of Technology(华南理工大学)

AI总结 GlyphBanana通过代理工作流整合辅助工具,提升复杂文本和公式渲染的精度,适用于多种文本到图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏