arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-06-24 至 2026-06-24 共收录 13
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24775 2026-06-24 cs.CL cs.DB cs.IR 新提交

Are We Ready For An Agent-Native Memory System?

我们准备好构建原生智能体记忆系统了吗?

Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MemTensor (Shanghai) Technology Co., Ltd(MemTensor(上海)科技有限公司)

AI总结 从数据管理视角系统研究智能体记忆,提出四模块分析框架,评估12种记忆系统,发现无单一架构占优,并揭示成本-性能权衡。

Comments Paper list available at: https://github.com/OpenDataBox/awesome-agent-memory. Source code available at: https://github.com/OpenDataBox/MemoryData

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24740 2026-06-24 cs.CV 新提交

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

BioMedVR: 面向生物医学视觉重编程的混淆感知提示专家混合模型

Jiaxiang Liu, Tianxiang Hu, Juwei Guan, Yujie Wu, Yusong Wang, Yao Mu, Zuozhu Liu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科技研究院) Zhejiang University(浙江大学) Southeast University(东南大学) The Hong Kong Polytechnic University(香港理工大学) Institute of Science Tokyo(东京科学大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出BioMedVR框架,通过可学习的VR模块实现预训练VLM在生物医学图像上的少样本适应,利用混淆最小化机制和提示专家混合模型解决细粒度分类中的类间混淆问题,在18个数据集上验证了优越性能。

Comments Accepted at ECCV 2026. 19 pages, 6 figures. Project page: https://jxliu-ai.github.io/biomedvr-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24602 2026-06-24 cs.CV 新提交

ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

ViTexQA: 面向视频文本问答的多帧时序感知数据集

Zhentao Guo, Chen Duan, Tongkun Guan, Zining Wang, Kai Zhou, Pengfei Yan

机构 * Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ViTexQA数据集和FrameThinker方法,通过跨帧文本融合的问答对和两阶段训练(CoT微调+时序强化学习),解决多帧时序文本感知难题,ROUGE-L提升6.3%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24552 2026-06-24 cs.RO 新提交

Enabling Robust Cloth Manipulation via Inference-Time Simulator-in-the-Loop Refinement

通过推理时仿真器在环优化实现鲁棒的布料操作

Xin Liu, Yulin Li, Ziming Li, Pengyu Jing, Zhenhao Huang, Bingyang Zhou, Ziqiu Zeng, Siyuan Luo, Chenkun Qi, Fan Shi

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出基于仿真器在环优化的布料操作框架,通过合成数据训练的真实到仿真模块和稀疏网格滚动结合先验引导MPPI,从单RGB输入实现鲁棒操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24428 2026-06-24 cs.CL 新提交

Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning

逃离自我确认陷阱:一种用于智能体经验学习的执行-蒸馏-验证范式

Shiding Zhu, Yudi Qi, Yajie Wang, Jiaze Li, Chao Song, Yaorui Shi, Yibo Miao, Hanqi Gao, Kai Zhang

机构 * Zhejiang University(浙江大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出EDV框架,通过多智能体并行执行、第三方蒸馏和共识验证,解决单智能体经验学习中的自我确认陷阱问题,在三个长时任务基准上取得一致提升。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24301 2026-06-24 cs.CV 新提交

MM-TRELLIS: Point-Cloud Guided Multi-Modal 3D Vehicle Generation in Autonomous Driving

MM-TRELLIS: 自动驾驶中基于点云引导的多模态3D车辆生成

Hongli Xiao, Youjian Zhang, Yucai Bai, Chaoyue Wang, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Academy of Military Science(军事科学院) Bosch innovation software development (Wuxi) Co., Ltd.(博世创新软件开发(无锡)有限公司) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Shopee Pte. Ltd.(Shopee私人有限公司)

AI总结 提出MM-TRELLIS,融合多视图图像与LiDAR点云,通过点云引导和体素过滤策略,实现高质量3D车辆生成,在Waymo数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24257 2026-06-24 cs.CV 新提交

3DCarGen: Scalable 3D Car Generation via 3D-consistent Multi-view Synthesis

3DCarGen: 通过3D一致的多视图合成实现可扩展的3D汽车生成

Hongli Xiao, Youjian Zhang, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

机构 * Shanghai Jiao Tong University(上海交通大学) Academy of Military Science(军事科学院) The University of Sydney(悉尼大学) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

AI总结 提出3DCarGen框架,利用多视图扩散模型和3D高斯泼溅,从单张真实图像生成任意数量3D一致的多视图,并通过颜色-法线联合优化重建高质量3D汽车模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23848 2026-06-24 cs.RO 新提交

Enforcing Human-like Kinematics in Dexterous Piano Playing via Adversarial Posture Regularization

通过对抗姿态正则化在灵巧钢琴演奏中强制执行类人运动学

Bin Qiu, Yanming Shao, Guanyu Cai, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出对抗姿态正则化(APR)方法,利用少量非对齐的人类演奏数据,通过对抗目标匹配策略姿态分布与人类先验,使高自由度灵巧手在物理仿真中弹钢琴时呈现更自然的姿势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24696 2026-06-24 physics.flu-dyn cs.LG 新提交

A Physics-Informed Fourier-Wavelet Transformer for Multiscale Computational Fluid Dynamics Surrogate Modeling

物理信息傅里叶-小波变换器用于多尺度计算流体动力学代理建模

Somyajit Chakraborty, Ming Pan, Xizhong Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出一种物理信息傅里叶-小波变换器,结合混合频谱编码与基于PDE残差的物理偏置自注意力,通过自监督预训练,在圆柱尾流和流固耦合基准上实现多尺度流场重建,精度优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24130 2026-06-24 physics.flu-dyn cs.RO 新提交

Efficient Time-Domain Simulation of USV Motions in Short-Crested Irregular Waves Using an IRF-Based Framework

基于IRF框架的短峰不规则波中USV运动高效时域仿真

Fei Duan, Zihao Wang, Yaohua Zhou, Qing Xiao

机构 * State Key Laboratory of Ocean Engineering, Shanghai Jiao Tong University(上海交通大学海洋工程国家重点实验室) Department of Naval Architecture, Ocean and Marine Engineering, University of Strathclyde(斯特拉斯克莱德大学海军建筑、海洋与海洋工程系) Institute of Artificial Intelligence, Shanghai University(上海大学人工智能研究院) Rules & Technology Center of China Classification Society, Shanghai(中国船舶分类学会规则与技术中心)

AI总结 提出基于脉冲响应函数(IRF)的时域框架,通过频域-时域转换和卷积力重构,高效预测短峰不规则波中无人水面艇(USV)运动,经实验验证精度良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22136 2026-06-24 cs.RO 新提交

Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data

Wh0: 生成式世界模型作为自我中心人类手部操作数据的可扩展来源

Yangtao Chen, Zixuan Chen, Peiyang Wang, Yong-Lu Li, Jing Huo, Jieqi Shi, Yang Gao

机构 * Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出Wh0框架,利用生成式视频世界模型产生自我中心人-物交互数据集WM-H,通过手部运动重建和视觉编辑转化为机器人可训练监督,提升预训练灵巧VLA模型在真实任务上的零样本成功率。

Comments Under review. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18627 2026-06-24 cs.LG 新提交

PACT: Preserving Anchored Cores in Task-vectors for Model Merging

PACT: 在任务向量中保留锚定核心用于模型合并

Ningyuan Shi, Zhipeng Zhou, Hao Wang, Chunyan Miao, Peilin Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出PACT方法,通过识别并保留预训练权重中的承重墙维度,在任务向量中锚定任务特定核心,解决任务向量范式下任务冲突和性能下降问题,提升模型合并效果。

Comments 33 pages,14 figures; Code is available

详情

展开后加载摘要…

URL PDF HTML 收藏