arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3140
2601.08187 2026-07-01 cs.AI 版本更新

Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression

利用同质性感知的结构和语义文本属性图压缩提升LLM推理能力

Zijun Di, Bin Lu, Huquan Kang, Luoyi Fu, Jiaxin Ding, Xiaoying Gan, Lei Zhou, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出HS2C框架,通过结构熵最小化进行全局层次划分以识别同质社区,并利用检测到的结构同质性指导LLM进行差异化语义聚合,在10个节点级和7个图级基准上同时提升压缩率和推理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24561 2026-07-01 cs.CV 版本更新

RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios

RGBT-GroundBench: 超越RGB的复杂真实世界场景中的视觉定位

Tianyi Zhao, Jiawen Xi, Linhui Xiao, Junnan Li, Xue Yang, Maoxun Yuan, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学人工智能研究院、虚拟现实技术与系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出首个大规模RGB-热红外视觉定位基准RGBT-GroundBench,包含4万+图像和3级细粒度标注,统一评估协议支持RGB/热红外/融合输入,揭示低照度下性能显著下降,并引入参考基线RGBT-VGNet。

Comments 40pages, 9figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02187 2026-07-01 cs.RO cs.CV 版本更新

Registering the 4D Millimeter Wave Radar Point Clouds Via Generalized Method of Moments

通过广义矩方法配准4D毫米波雷达点云

Xingyi Li, Han Zhang, Ziliang Wang, Yukai Yang, Weidong Chen

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医疗机器人研究院) Department of Statistics, Uppsala University(乌普萨拉大学统计系)

AI总结 针对4D雷达点云稀疏噪声导致配准困难的问题,提出基于广义矩方法的配准框架,无需显式点对应,在合成与真实数据集上精度和鲁棒性优于基准方法,甚至接近激光雷达方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19600 2026-07-01 cs.SE cs.AI cs.CL 版本更新

Human-Agent Collaborative Paper-to-Page Crafting

人机协作的论文到网页制作

Qianli Ma, Siyu Wang, Yilin Chen, Yinhao Tang, Yixiang Yang, Chang Guo, Bingjie Gao, Zhening Xing, Yanan Sun, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出AutoPage多智能体系统,通过粗到细的流水线将论文转化为交互式网页,并引入Checker智能体验证和人工检查点,在15分钟内以低于0.1美元的成本生成高质量网页。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12878 2026-07-01 cs.CV 版本更新

Few to Big: Prototype Expansion Network via Diffusion Learner for Point Cloud Few-shot Semantic Segmentation

从少到多:基于扩散学习器的原型扩展网络用于点云小样本语义分割

Qianguang Zhao, Dongli Wang, Yan Zhou, Jianxun Li, Richard Irampa

机构 * School of Mathematics and Computational Science, Xiangtan University(湘潭大学数学与计算科学学院) School of Automation and Electronics Information, Xiangtan University(湘潭大学自动化与电子信息学院) School of Automation, Shanghai Jiao Tong University(上海交通大学自动化学院)

AI总结 针对小样本点云语义分割中原型容量小且与查询空间不对齐的问题,提出原型扩展网络(PENet),利用扩散模型的预训练条件编码器扩展原型,并通过推-拉机制对齐,在S3DIS和ScanNet数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30246 2026-06-30 cs.AI cs.CY cs.MA

Clarus: Coordinating Autonomous Research Agents toward Web-Scale Scientific Collaboration

Clarus: 协调自主研究代理实现网络规模的科学协作

Zihan Guo, Zeyi Chen, Zhiyu Chen, Zicai Cui, Shuai Shao, Bo Huang, Zhi Han, Yuanyi Song, Yuan Yuan, Chenxi Zeng, Xiaohang Nie, Zhengxi Yu, Hanwen Zhu, Junwei Liao, Ming Zhou, Yang Li, Yuanjian Zhou, Weinan Zhang

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Jilin University(吉林大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 提出Clarus基础设施,通过定义项目-代理-资源对象模型和四层协作架构,协调AI与人类研究者在开放、可审计、可归属的资源感知多阶段流程中实现网络规模科学协作。

Comments 28 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30113 2026-06-30 cs.RO cs.AI

SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance

SA-VLA: 状态感知分词器提升视觉-语言-动作模型性能

Tengyue Jiang, Chunpu Xu, Jiayue Kang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Hong Kong Polytechnic University(香港理工大学) Xi’an University of Electronic Science and Technology(西安电子科技大学)

AI总结 提出状态感知动作分词器SA-VLA,通过状态条件动作解码减少离散化压缩损失,在12个操作任务上将成功率从0.29提升至0.56。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29774 2026-06-30 cs.RO

Analytic Concept-Centric Memory for Agentic Embodied Manipulation

分析性概念中心记忆用于具身操作代理

Mingyang Sun, Xiujian Liang, Jiude Wei, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出分析性概念中心记忆框架,通过结构化概念(语义部件、参数模板等)组织经验,支持粗到细检索,提升长时程具身操作中的物体重识别、状态推理和技能复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29752 2026-06-30 cs.CV cs.MM

LEIQ-Assessor: Multi-dimensional Quality Assessment of Low-light Enhanced Images via Multi-task Learning

LEIQ-Assessor:基于多任务学习的低光照增强图像多维度质量评估

Wei Sun, Yanwei Jiang, Dandan Zhu, Jinqiu Sang, Jikai Xu, Weixia Zhang, Guangtao Zhai

机构 * East China Normal University(东华师范大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出LEIQ-Assessor模型,利用多任务学习同时预测整体MOS和六个感知子属性,在MLE基准上显著优于现有无参考IQA方法,获QoMEX 2026挑战赛第二名。

Comments The paper achieved second place in the QoMEX 2026 Grand Challenge on Low-light Enhanced Image Quality Assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29746 2026-06-30 cs.AI cs.HC

DEEPMED Search: An Open-Source Agentic Platform for Medical Deep Research with Introspective Verification

DEEPMED Search: 一个具有内省验证功能的开源医学深度研究智能体平台

Maolin Liu, Fanyu Xu, Ruoqing Xu, Jiahang Zhang, Hao Wang, Rui Wang

机构 * School of Computer Science and Software Engineering, Shanghai University(上海大学计算机科学与软件工程学院) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系)

AI总结 提出一个开源智能体平台DEEPMED Search,通过源自适应路由和内省验证模块,自动分解复杂医学查询并生成结构化报告,解决异构医疗数据检索中的推理漂移问题。

Comments 5 pages, 2 figures, 2 tables. Accepted to IJCAI-ECAI 2026 Demo Track. Project website: https://www.deepmedsearch.cloud. Demo video: https://youtu.be/4U4aok8yLpk

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29727 2026-06-30 cs.AI cs.HC

DeepTrans Studio: Turning Expert Interventions into Shared Team Knowledge in Agentic Translation Workflows

DeepTrans Studio:将专家干预转化为智能翻译工作流中的团队共享知识

Ziyang Lian, Qingya Zhang, Hao Wang, Huiwen Xiong, Qi Yang, Lingyi Meng, Xiaoyi Gu, Rui Wang

机构 * School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院) School of Foreign Languages, East China Normal University(华东师范大学外国语言学系) School of Foreign Studies, Shanghai University(上海大学外国语言学院) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

AI总结 提出DeepTrans Studio协作翻译平台,通过让专家在智能工作流中干预并保存决策到共享记忆,将一次性修正转化为可复用的团队知识,解决翻译协作中知识孤岛问题。

Comments 4 pages, 2 figures. Accepted to CSCW 2026 Demo. Code and demo video: https://github.com/hint-lab/deeptrans-studio, https://youtu.be/cNpafhHAEjg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29712 2026-06-30 cs.CL

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理

Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29531 2026-06-30 cs.CV cs.AI

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos

MotionAtlas: 面向运动中心视频的详细区域描述

Weisong Liu, Haochen Wang, Kuan Gao, Yuhao Wang, Yikang Zhou, Zhongwei Ren, Jacky Mai, Anna Wang, Yanwei Li, Jason Li, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Wuhan University(武汉大学) Beijing Jiaotong University(北京交通大学)

AI总结 提出MotionAtlas系统,通过区域感知运动描述、自举精炼数据管道和定制训练策略,在运动中心视频描述中显著提升细粒度理解,超越现有模型。

Comments Accepted to ECCV 2026. Project page: https://kagura-0001.github.io/projects/MotionAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29501 2026-06-30 cs.RO

Learning Transferable Dynamics Priors from Action to World Modeling

从动作到世界建模的可迁移动力学先验学习

Ze Huang, Jiahui Zhang, Hairuo Liu, Chenxi Zhang, Ran Cheng, Li Zhang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) McGill University, Montreal, QC, Canada(麦吉尔大学,蒙特利尔,魁北克,加拿大)

AI总结 提出A2World模型,通过大规模机器人操作数据预训练动作条件世界模型,学习可迁移的交互动力学先验,支持模拟器评估和策略学习。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29308 2026-06-30 cs.CV

MirrorPPR: Exemplar-Based Portrait Photo Retouching

MirrorPPR:基于示例的人像照片修图

Zhihong Liu, Zheng Li, Jiachun Jin, Siqi Kou, Yitao Jian, Fengpei Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Triverse AI

AI总结 提出MirrorPPR框架,通过修图操作提取器和LoRA模块将示例对中的细微结构修图操作迁移到新图像,并构建大规模数据集MirrorPPR47M实现渐进式学习,显著提升修图质量和身份保持。

Comments Accepted by ECCV 2026. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28785 2026-06-30 cs.CV

Stochastic Optimal Control Sampling for Diffusion Inverse Problems

扩散逆问题的随机最优控制采样

Jie Zhang, Youmei Qiu, Hanling Tian, Jingyuan Zhang, Xiang Yin, Xiaolin Huang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化与智能感知学院,上海,中国) Shanghai Key Laboratory of Flexible Medical Robotics, Tongren Hospital, Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海柔性医疗机器人重点实验室,同仁医院,医学机器人研究所,上海交通大学,上海,中国)

AI总结 提出随机最优控制采样(SOCS),通过闭式控制更新在每一步将测量一致的干净预测拉回去噪流,以高效解决扩散逆问题,提升视觉保真度和定量性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28604 2026-06-30 cs.CV

IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion

IMU-HOI:通过接触感知惯性融合实现连贯的人-物交互与运动捕捉的共生框架

Lizhou Lin, Songpengcheng Xia, Zengyuan Lai, Lan Sun, Jiarui Yang, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出IMU-HOI框架,利用稀疏IMU同时恢复全身人体姿态和物体6-DoF轨迹,通过推断手-物接触并融合运动学与惯性推理,实现无漂移的人-物交互运动捕捉。

Comments 10 pages, 5 figures. Accepted by CVPR 2026

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2026, pp. 42901-42910

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28453 2026-06-30 eess.IV cs.CV

DeVAR: Low-Dose CT Denoising via Visual Autoregressive Modeling

DeVAR:通过视觉自回归建模实现低剂量CT去噪

Xizhuo Zhang, Yannian Gu, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SenseTime Research(商汤科技研究院) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出DeVAR框架,首次将视觉自回归建模(VAR)应用于低剂量CT去噪,通过下一尺度预测生成离散令牌图,并引入残差精炼器捕获细微结构,结合双表示混合训练策略,在公开数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28446 2026-06-30 astro-ph.IM astro-ph.SR cs.AI

Domain-Informed Multi-View Self-Distillation for Astronomical Light-Curve Representation Learning with JEPA

领域信息引导的多视角自蒸馏用于基于JEPA的天文光变曲线表示学习

Yicheng Rui

机构 * Tsung-Dao Lee Institute, Shanghai Jiao Tong University, Shanghai 201210, China(李宗道研究所,上海交通大学,上海201210,中国)

AI总结 针对天文光变曲线不规则采样、复杂噪声和多物理时间尺度问题,提出结合语义保持视图、不确定性感知分词和多视角自蒸馏的JEPA框架,在StarEmbed分类基准上16个指标中15个超越手工特征,并在跨域适应中表现优异。

Comments 32 pages, 11 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28434 2026-06-30 cs.SE cs.AI

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

SWE-MeM:面向长周期编码代理的自适应内存管理学习

Shuzheng Gao, Wenhao Zeng, Zhaojian Yu, Jianqiao Wangni, Chaozheng Wang, Kai Cai, Shilin He, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Shanghai Jiao Tong University, China(上海交通大学) Tsinghua University, China(清华大学) ByteDance, China(字节跳动)

AI总结 提出SWE-MeM训练框架,通过灵活的内存工具和Memory-aware GRPO优化,让代理在有限上下文预算下自主决定压缩时机、内容和方式,在SWE-Bench Verified上以4B和30B模型分别达到43.4%和60.2%的解决率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12155 2026-06-30 cs.CV

FAIL: Flow Matching Adversarial Imitation Learning for Image Generation

FAIL: 流匹配对抗模仿学习用于图像生成

Yeyao Ma, Chen Li, Xiaosong Zhang, Han Hu, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

AI总结 本文提出FAIL方法,通过对抗训练最小化策略-专家差异,无需显式奖励或配对比较,在图像生成中实现高效训练与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21078 2026-06-30 cs.CV

UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer

UniPR-3D:迈向基于视觉几何基础的通用视觉位置识别

Tianchen Deng, Xun Chen, Ziming Li, Hongming Shen, Shuhao Zhai, Danwei Wang, Javier Civera, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Zaragoza(萨拉戈萨大学) University of Macau(澳门大学)

AI总结 本文提出UniPR-3D,首个融合多视角信息的视觉位置识别架构,通过3D tokens与2D tokens联合描述,提升跨视角推理与泛化能力,实验表明其优于单多视角基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21256 2026-06-30 cs.CV

LaGen: Towards Autoregressive LiDAR Scene Generation

LaGen:迈向自主驾驶的自回归激光雷达场景生成

Sizhuo Zhou, Xiaosong Jia, Fanrui Zhang, Junjie Li, Juyong Zhang, Yukang Feng, Jianwen Sun, Songbur Wong, Junqi You, Junchi Yan

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出LaGen,首个支持长时交互生成的自回归框架,能基于单帧输入生成高保真4D激光雷达场景,并通过场景解耦和噪声调节模块提升生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03142 2026-06-30 cs.RO cs.CV

MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning

MM-Nav:基于多专家学习的多视角VLA模型用于鲁棒视觉导航

Tianyu Xu, Jiawei Chen, Jiazhao Zhang, Wenyao Zhang, Zekun Qi, Minghan Li, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出MM-Nav模型,通过多专家学习从合成数据中学习多样化的导航能力,展示模型在合成环境中的强泛化能力,并在现实世界实验中验证其有效性。

Comments Project page: https://pku-epic.github.io/MM-Nav-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18295 2026-06-30 cs.LG cs.AI

GeNeRT: A Physics-Informed Approach to Intelligent Wireless Channel Modeling via Generalizable Neural Ray Tracing

GeNeRT:一种通过通用神经射线追踪进行智能无线信道建模的物理引导方法

Kejia Bian, Meixia Tao, Shu Sun, Tongjia Zhang, Jun Yu

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 GeNeRT通过相对几何特征、散射体语义和受激励的极化驱动架构,提升神经射线追踪在无线信道建模中的泛化能力和准确性,通过三阶段训练策略实现跨场景的零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14851 2026-06-30 cs.DC cs.AI cs.LG

Efficient Serving of LLM Applications with Probabilistic Demand Modeling

通过概率需求建模实现LLM应用的高效服务

Yifei Liu, Zuo Gan, Zhenghao Gan, Weiye Wang, Chen Chen, Yizhou Shan, Xusheng Chen, Zhenhua Han, Yifei Zhu, Shixuan Sun, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Cloud(华为云) Unaffiliated(无隶属机构)

AI总结 本文提出Hermes系统,利用概率需求图建模LLM应用资源需求,采用Gittins策略优化调度顺序,预热冷后台,提升服务效率,减少平均完成时间70%以上,P95完成时间80%以上。

Journal ref ACM Transactions on Architecture and Code Optimization 23, 2, Article (June 2026), 1-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07069 2026-06-30 cs.GR cs.AR cs.CV cs.LG

Efficient 3D Gaussian Splatting with Axis-Shared Rasterization and Order-independent Transmittance

高效3D高斯散射与轴共享光栅化及顺序无关透射率

Zhican Wang, Guanghui He, Lingjun Gao, Dantong Liu, Shell Xu Hu, Chen Zhang, Zhuoran Song, Nicholas Lane, Hongxiang Fan

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院) Samsung AI(三星人工智能)

AI总结 本文提出轴共享光栅化和顺序无关透射率方法,提升3D高斯散射在资源受限平台的实时性能,实现1.33至1.88倍的加速。

Comments ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17421 2026-06-30 cs.LG cs.AI

Towards Harnessing the Collaborative Power of Large and Small Models for Domain Tasks

向利用大模型和小模型的协作力量进行领域任务

Yang Liu, Kejia Zhang, Bingjie Yan, Tianyuan Zou, Jianqing Zhang, Zixuan Gu, Xiangsen Chen, Jianbing Ding, Xidong Wang, Jingyi Li, Xiaozhou Ye, Ye Ouyang, Qiang Yang, Ya-Qin Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Institute for AI Industry Research, Tsinghua University(清华大学智能产业研究院) Shanghai Jiao Tong University(上海交通大学) School of Software, Tsinghua University(清华大学软件学院) AsiaInfo Technologies(亚信科技)

AI总结 本文探讨了大模型与小模型协作在领域适应中的应用,分析了跨边界环境中的数据隐私、模型安全和效率挑战,并提出多目标优化问题以指导实际部署。

Comments For ongoing updates and a curated list of recent advances in this area, we maintain a public repository: https://github.com/KejiaZhang-Robust/Awesome-LM-SM-Domain-Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏