arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-04 至 2026-08-04 共收录 12
2608.02428 2026-08-04 cs.CV 新提交

DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation

DF³:自主导航中基于无解码器特征预测的世界建模

Jiaming Chen, Guoan Xu, Aoshen Huang, Haozhuo Zhang, Yang Li, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) University of Technology Sydney(悉尼科技大学) Shandong University(山东大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究提出DF³框架,通过冻结视觉基础模型、MACF机制及专用任务查询,在潜在空间直接预测特征并生成任务输出,在性能与效率上实现平衡,适用于自主导航的世界建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02276 2026-08-04 cs.AI 新提交

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1:从智能体失败轨迹中学习编辑可执行运行时管控程序

Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

AI总结 Harness-R1是首个基于智能体失败轨迹学习编辑可执行运行时管控程序的方法,经WebShop等基准测试,可提升Qwen3.5-9B智能体成功率,为管控程序与智能体协同进化提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02252 2026-08-04 cs.CV cs.AI 新提交

HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

HarMoE:基于数据集解耦专家的多源胸部X射线预训练

Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究提出HarMoE框架,通过解耦数据集专家从异构胸部X射线数据集学习,提升了放射学视觉-语言模型的零样本分类、分布外迁移等性能,相关代码与87.3万份数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01977 2026-08-04 cs.CV 新提交

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)

AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01944 2026-08-04 cs.CV 新提交

UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation

UniMoCa:将运动与相机控制统一为忠实人类视频生成的视觉代理

Liming Tan, Ye Chen, Hao Zhang, Lirong Qian, Feifei Li, Bingbing Ni

机构 * SJTU(上海交通大学)

AI总结 UniMoCa是统一运动与相机控制的视觉代理框架,提出MCVP表征并构建MCVP-Video数据集,在Wan2.2 I2V上实现视频生成多方面性能提升且复杂度低

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01794 2026-08-04 cs.CV cs.AI cs.CL 新提交

Illuminating Visual Identity in Universal Multimodal Embeddings

揭示通用多模态嵌入中的视觉身份

Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01017 2026-08-04 cs.CL cs.AI 新提交

Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

大模型为何妥协:医学谄媚背后的对话因素与推理

Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho

机构 * Virginia Tech(弗吉尼亚理工大学) Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) Emory University(埃默里大学)

AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01007 2026-08-04 cs.LG 新提交

Fused Bayesian Flow Networks for Dual-Target Molecular Design

用于双靶点分子设计的融合贝叶斯流网络

Jingyuan Zhou, Shikui Tu, Lei Xu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

AI总结 针对现有双靶点分子生成方法难以充分整合双靶标特征的问题,提出融合贝叶斯流网络FusedBFN,通过分布融合与乘积专家公式实现双靶点分子设计,实验证实其生成的分子兼具强结合亲和力与良好性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00635 2026-08-04 cs.RO 新提交

FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation

FlowPilot:面向敏捷无人机导航的实时世界-动作建模

Runqing Wang, Ding Yu, Pengyuan Min, Xinhong Zhang, Wei Xiao, Yu Hu, Jie Chen, Fu Zhang, Gang Wang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

AI总结 FlowPilot是一种基于流匹配的紧凑世界-动作模型,采用双流混合Transformer,在三级深度金字塔数据上训练,可实现敏捷无人机实时导航,性能优于基线,能在杂乱环境中以5.5m/s速度运行。

Comments 8 pages, 9 figures, 2 tables, submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00625 2026-08-04 cs.RO cs.AI 新提交

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms

动态环境下基于学习的运动规划:从基础算法到新兴范式

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Rui Cheng, Yaming Ou, Zhongqiang Ren, Yikui Zhai, C. L. Philip Chen

机构 * College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院) University of Connecticut(康涅狄格大学) Guangzhou Maritime University(广州海事大学) University of Chinese Academy of Sciences(中国科学院大学) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Wuyi University(五邑大学) South China University of Technology(华南理工大学)

AI总结 本综述回顾2015至2025年动态环境下基于学习的运动规划代表性研究,提出学习作用分类法,分析相关影响因素,探讨安全可验证规划等开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏