arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2410.19733 2026-03-30 cs.AI

ReMe: Scaffolding Personalized Cognitive Training via Controllable LLM-Mediated Conversations

ReMe:通过可控的LLM中介对话实现个性化认知训练

Zilong Wang, Nan Chen, Luna K. Qiu, Ling Yue, Geli Guo, Yang Ou, Shiqi Jiang, Yuqing Yang, Lili Qiu

机构 * Microsoft Research(微软研究院) Department of Geriatric Psychiatry, Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属上海市精神卫生中心老年精神科)

AI总结 ReMe通过可控的LLM对话实现个性化认知训练,解决传统认知训练内容僵化和对话可控性不足的问题,支持基于用户生活的记忆练习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12944 2026-03-30 cs.CV

AMFD: Distillation via Adaptive Multimodal Fusion for Multispectral Pedestrian Detection

AMFD:基于自适应多模态融合的多光谱行人检测知识蒸馏

Zizhao Chen, Yeqiang Qian, Xiaoxiao Yang, Chunxiang Wang, Ming Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理教育部重点实验室)

AI总结 本文提出AMFD框架,通过自适应多模态融合模块有效利用教师网络的原始模态特征,提升学生网络性能,实验表明其在减少漏检率和提升平均精度方面优于现有方法。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25791 2026-03-30 cs.CV

ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

ArtHOI:通过基础模型驯化实现单目4D手-物体交互重建

Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ArtHOI框架,通过整合多基础模型先验知识,解决单目视频中手-物体交互的4D重建问题,引入自适应采样细化和多模态大语言模型引导对齐方法,构建两个新数据集并验证方法有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25732 2026-03-27 cs.CV

BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation

BizGenEval:一个系统化的商业视觉内容生成基准测试

Yan Li, Zezi Zeng, Ziwei Zhou, Xin Gao, Muzhao Tian, Yifan Yang, Mingxi Cheng, Qi Dai, Yuqing Yang, Lili Qiu, Zhendong Wang, Zhengyuan Yang, Xue Yang, Lijuan Wang, Ji Li, Chong Luo

机构 * Microsoft Corporation(微软公司) Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学)

AI总结 本文提出BizGenEval基准测试,系统评估商业视觉内容生成模型在文档类型和多约束下的能力,包含20个任务和8000个检查问题,揭示现有模型与专业需求间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25463 2026-03-27 cs.CV

CIAR: Interval-based Collaborative Decoding for Image Generation Acceleration

基于区间的方法:用于图像生成加速的协作解码

Keming Ye, Zhou Zhao, Fan Wu, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出CIAR框架,通过设备端自验证处理图像生成中的大词汇量和空间冗余问题,采用连续概率区间加速处理并保持图像质量,实验显示在速度和云请求减少方面优于现有方法。

Comments 23 pages, 10 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25316 2026-03-27 cs.CV

Adaptive Learned Image Compression with Graph Neural Networks

基于图神经网络的自适应学习图像压缩

Yunuo Chen, Bing He, Zezheng Lyu, Hongwei Hu, Qunshan Gu, Yuan Tian, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出基于图神经网络的自适应学习图像压缩框架,通过构建双尺度图结构和动态连接性,实现灵活的数据驱动感受野,从而更高效地建模图像中的多样性冗余,提升压缩性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22883 2026-03-27 cs.CV

Group Editing: Edit Multiple Images in One Go

组级编辑:一次操作编辑多张图像

Yue Ma, Xinyu Wang, Qianli Ma, Qinghe Wang, Mingzhe Zheng, Xiangpeng Yang, Hao Li, Chongbo Zhao, Jixuan Ying, Harry Yang, Hongyu Liu, Qifeng Chen

机构 * HKUST(香港科技大学) THU(清华大学) SJTU(上海交通大学) University of Technology Sydney(悉尼科技大学)

AI总结 本文提出组级编辑框架,通过显式和隐式关系建立实现多图像一致修改,引入融合机制和新数据集提升编辑质量与一致性。

Comments Accepted by CVPR 2026, Project page: https://group-editing.github.io/, Github: https://github.com/mayuelala/GroupEditing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19516 2026-03-27 cs.CV cs.AI

Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis

Gastric-X:一种多模态多阶段基准数据集,用于推进胃癌分析中的视觉-语言模型

Sheng Lu, Hao Chen, Rui Yin, Juyan Ba, Yu Zhang, Yuanzhe Li

机构 * Ruijin Hospital(瑞金医院) University of Cambridge(剑桥大学) Nanjing First Hospital(南京市第一医院) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 Gastric-X通过1700例胃癌病例数据,评估视觉-语言模型在胃癌诊断中的多阶段任务能力,推动医疗领域VLM发展。

Comments Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02787 2026-03-27 cs.RO cs.CV

Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols

通过视觉符号诊断、纠正并学习操纵失败

Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li

机构 * Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ViFailback框架,通过视觉符号提升标注效率,并释放大规模数据集和基准测试,验证了框架在故障诊断和纠正中的有效性。

Comments Accepted by CVPR 2026. Project Website: https://x1nyuzhou.github.io/vifailback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23906 2026-03-27 cs.CV

GenMask: Adapting DiT for Segmentation via Direct Mask Generation

GenMask:通过直接掩码生成适应DiT进行分割

Yuhuan Yang, Xianwei Zhuang, Yuxuan Cai, Chaofan Ma, Shuai Bai, Jiangchao Yao, Ya Zhang, Junyang Lin, Yanfeng Wang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协作中位网创新中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出GenMask,通过直接生成二进制掩码实现分割任务,避免传统间接特征提取流程,提升分割性能。

Comments Accepted by cvpr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21152 2026-03-27 physics.geo-ph cs.AI

TRACE: A Multi-Agent System for Autonomous Physical Reasoning for Seismology

TRACE:一种用于地震学自主物理推理的多智能体系统

Feng Liu, Jian Xu, Xin Cui, Xinghao Wang, Zijie Guo, Jiong Wang, S. Mostafa Mousavi, Xinyu Gu, Hao Chen, Ben Fei, Lihua Fang, Fenghua Ling, Zefeng Li, Lei Bai

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Earth and Space Sciences, University of Science and Technology of China(中国科学技术大学地球和空间科学学院) Department of Earth and Planetary Sciences, Harvard University(哈佛大学地球与行星科学系) Institute of Earthquake Forecasting, China Earthquake Administration(中国地震局地震预报研究所)

AI总结 TRACE通过结合大语言模型规划与正式地震学约束,从原始观测中推导出可审计的物理机制,解决了地震序列物理机制推断的挑战,推动了地球科学从专家依赖分析向知识引导的自主发现发展。

Comments 25 pages for main text and 164 pages for appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18866 2026-03-27 cs.AI

Conflict-Based Search for Multi Agent Path Finding with Asynchronous Actions

基于冲突的多智能体路径寻找与异步动作

Xuemian Wu, Shizhe Zhao, Zhongqiang Ren

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种基于冲突的异步动作搜索方法,解决连续时间冲突基于搜索在异步动作多智能体路径寻找中的不完整性问题,并提高算法的可扩展性。

Comments 9 pages, 10 figures. Accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10700 2026-03-27 cs.CL cs.AI

LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts

大语言模型知其弱点:通过自然分布偏移揭示安全漏洞

Qibing Ren, Hao Li, Dongrui Liu, Zhanxu Xie, Xiaoya Lu, Yu Qiao, Lei Sha, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学) Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文研究大语言模型对自然分布偏移的脆弱性,提出ActorBreaker攻击方法,通过识别有毒提示相关角色构建多轮提示,揭示模型安全漏洞,并构建安全数据集提升鲁棒性。

Comments ACL 2025 main conference. Code is available at https://github.com/AI45Lab/ActorAttack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24296 2026-03-26 cs.CV

AMIF: Authorizable Medical Image Fusion Model with Built-in Authentication

AMIF:具有内置认证的可授权医学图像融合模型

Jie Song, Jun Jia, Wei Sun, Wangqiu Zhou, Tao Tan, Guangtao Zhai

机构 * Macao Polytechnic University(澳门理工学院) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出AMIF,首个具有内置认证的医学图像融合模型,通过授权访问控制保护知识产权,防止推理泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24260 2026-03-26 cs.CV cs.AI

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

通过异构缓存加速基于扩散的视频编辑:超越采样去噪时间步的全计算

Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出HetCache框架,通过利用扩散基于掩码视频到视频生成中的异构性,减少冗余注意力运算,提升视频编辑效率与质量。

Comments 10 pages, 6 figures, accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04607 2026-03-26 cs.OS cs.AI cs.LG

From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents

从命令式到声明式:面向提升计算机使用代理的LLM友好操作系统接口

Yuan Wang, Mingyu Li, Haibo Chen

机构 * Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出Declarative Model Interface (DMI),通过将传统GUI转化为三种声明式原语,提升LLM驱动的计算机使用代理的任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23961 2026-03-26 cs.LG cs.CV

GRMLR: Knowledge-Enhanced Small-Data Learning for Deep-Sea Cold Seep Stage Inference

GRMLR:基于知识的小数据学习用于深海冷渗阶段推断

Chenxu Zhou, Zelin Liu, Rui Cai, Houlin Gong, Yikang Yu, Jia Zeng, Yanru Pei, Liang Zhang, Weishu Zhao, Xiaofeng Gao

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出GRMLR框架,利用生态知识图谱作为先验结构,融合宏生物与微生物耦合关系,通过流形惩罚约束特征空间,提升深海冷渗阶段推断的鲁棒性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23925 2026-03-26 cs.CV

DP^2-VL: Private Photo Dataset Protection by Data Poisoning for Vision-Language Models

DP^2-VL: 通过数据污染保护隐私照片的视觉语言模型隐私威胁模型

Hongyi Miao, Jun Jia, Xincheng Wang, Qianli Ma, Wei Sun, Wangqiu Zhou, Dandan Zhu, Yewen Cao, Zhi Liu, Guangtao Zhai

机构 * Shandong University(山东大学) Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学) Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出DP2-VL框架,通过数据污染保护隐私照片,分析视觉语言模型在身份关联泄露中的脆弱性,并展示其在不同保护比例下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23864 2026-03-26 cs.CV

See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning

看见、记忆、探索:面向流式空间推理的基准与基线

Yuxi Wei, Wei Huang, Qirui Chen, Lu Hou, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出S3-Bench基准,通过流式空间问答与主动探索解决传统方法在长时序推理和主动感知方面的不足,并提出AMF-VLM模型在压缩内存与主动探索方面实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19775 2026-03-26 cs.CV

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14187 2026-03-26 cs.GR cs.CV

Establishing Stochastic Object Models from Noisy Data via Ambient Measurement-Integrated Diffusion

通过环境测量整合扩散建立随机物体模型

Xiaoning Lei, Jianwei Sun, Wenhao Cai, Xichen Xu, Yanshu Wang, Hu Gao

机构 * Contemporary Amperex Technology Co.Limited(当代爱普科技术有限公司) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

AI总结 本文提出AMID方法,通过整合环境测量噪声与扩散轨迹,建立清洁的随机物体模型,提升医学影像生成质量和任务基于的图像质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11715 2026-03-26 cs.CV cs.MM eess.IV

EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing

EditMGT: 解锁屏蔽生成变压器在图像编辑中的潜力

Wei Chow, Linfeng Li, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li, Junting Pan, Shaoteng Liu, Ran Zhou, Tianshu Yang, Songhua Liu

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出EditMGT框架,利用Masked Generative Transformers实现局部化编辑,通过多层注意力整合和区域保持采样提升编辑精度与效率,实验表明其在编辑质量和速度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06767 2026-03-26 cs.LG cs.AI

QUARK: Quantization-Enabled Circuit Sharing for Transformer Acceleration by Exploiting Common Patterns in Nonlinear Operations

QUARK:通过利用非线性操作中的共同模式实现变压器加速的量化启用电路共享

Zhixiong Zhao, Haomin Li, Fangxin Liu, Yuncheng Lu, Zongwu Wang, Tao Yang, Li Jiang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Qi Zhi Institute(上海启智研究院) Nanyang Technological University(南洋理工大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 QUARK通过利用非线性操作中的共同模式,实现高效电路共享,减少硬件资源需求,提升Transformer模型的推理速度和精度。

Comments Accepted by ICCAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19672 2026-03-26 cs.RO math.DS

Memory-Augmented Potential Field Theory: A Framework for Adaptive Control in Non-Convex Domains

具有记忆的势场理论:非凸域中自适应控制的框架

Dongzhe Zheng, Wenjie Mei

机构 * Department of Computer Science and Engineering, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(计算机科学与工程系,电子信息与电气工程学院,上海交通大学) School of Robotics and Automation, Suzhou Campus, Nanjing University(机器人与自动化学院,南京大学苏福校区)

AI总结 本文提出一种结合历史经验的随机优化控制框架,通过动态构建记忆势场来识别状态空间的关键拓扑特征,提升非凸环境中控制器的自适应优化能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03938 2026-03-26 cs.CV

TopoSculpt: Betti-Steered Topological Sculpting of 3D Fine-grained Tubular Shapes

TopoSculpt: 3D细粒度管状形状的贝蒂引导拓扑雕刻

Minghui Zhang, Yaoyu Liu, Junyang Wu, Xin You, Hanxiao Zhang, Junjun He, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Shanghai AI Lab(上海人工智能实验室) Medical Image Insights(医学影像洞察)

AI总结 本文提出TopoSculpt框架,通过整体区域建模策略和拓扑完整性贝蒂约束,改进3D细粒度管状结构的拓扑重构,实验显示在肺部气道和Willis环数据集上显著提升几何与拓扑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14951 2026-03-26 cs.CV

Morph: A Motion-free Physics Optimization Framework for Human Motion Generation

Morph:一种无需运动的物理优化框架用于人类运动生成

Zhuo Li, Mingshuang Luo, Ruibing Hou, Xin Zhao, Hao Liu, Hong Chang, Zimo Liu, Chen Li

机构 * WeChat, Tencent Inc(微信,腾讯公司) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(CAS),计算技术研究所,CAS,中国) Peng Cheng Laboratory, China(鹏城实验室,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) MoE Key Laboratory of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能MoE重点实验室,人工智能研究院,上海交通大学)

AI总结 本文提出Morph框架,通过运动生成器和运动物理细化模块提升运动的物理合理性,无需昂贵真实运动数据,实验显示其在文本到运动和音乐到舞蹈生成任务中达到最先进的运动质量。

Comments Accepted by ICCV 2025, 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏