arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-07-02 至 2026-07-02 共收录 7
2607.00850 2026-07-02 cs.CV cs.LG 新提交

Mirror-Fusion Attention for Reflection-Aware Self-Supervised Representation Learning

镜像融合注意力用于反射感知的自监督表示学习

Ruixin Li, Jin Liu, Yuling Shi, Stefano Lodi

机构 * University of Bologna(博洛尼亚大学) Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出MFASSL框架,通过镜像融合注意力模块在自监督学习中注入软反射先验,提升医学图像和人脸等近似对称数据的下游性能与鲁棒性。

Comments Accepted at ECML PKDD 2026. The final authenticated version will be available in the Springer LNCS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00760 2026-07-02 cs.LG cs.DC 新提交

MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression

MosaicKV: 通过动态二维KV缓存压缩服务长上下文LLM

Sheng Qiang, Ruiwei Chen, Yinpeng Wu, Jinyu Gu, Zhichao Hua, Yubin Xia, Binyu Zang, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所)

AI总结 提出MosaicKV系统,利用动态二维KV缓存压缩解决长上下文服务中的内存瓶颈,通过细粒度稀疏性和压缩管理实现高吞吐和低延迟,在H800 GPU上取得最高16倍注意力加速和3倍内存节省。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00498 2026-07-02 cs.CV 新提交

Robust 3D Alignment of Generative Reconstructions via Partial Monocular Observations

基于部分单目观测的生成式重建鲁棒3D对齐

Yuchen Zhang, Luanyuan Dai, Yiwei Wang, Xiwei Xu, Jianing Zhang, Johnny. r. zhang, Xianhui Meng, Yanbiao Ma, Jiayi Ma, Xiaoshuai Hao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院) School of Tech Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) Independent Researcher(独立研究员) School of Electronic Engineering and Information Science, University of Science and Technology of China(中国科学技术大学电子工程与信息科学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Robotics, Wuhan University(武汉大学机器人学院) Xiaomi EV(小米汽车)

AI总结 针对生成式3D重建与部分单目观测对齐的挑战,提出无训练可解释几何对齐框架,通过Sim(3)变换恢复度量尺度与位姿,引入幻觉滤波抑制异常,在基准测试中显著优于传统和学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00461 2026-07-02 cs.CV 新提交

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

非对称互变分学习实现多模态连续推理

Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 针对多模态大语言模型离散推理丢失感知细节及训练-推理不匹配问题,提出非对称互变分学习框架,通过双向KL散度校准先验与后验,缓解答案泄露,提升连续潜在推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00416 2026-07-02 cs.CV 新提交

DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble

DroneIQA-VLE:基于视觉-语言集成的多任务无人机图像质量评估

Wei Sun, Weixia Zhang, Hongjian Zhan, Mingkai Lu, Yixuan Gao, Guangtao Zhai

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出DroneIQA-VLE框架,通过集成SigLIP2视觉编码器与多任务回归头以及LoRA微调的Qwen3.5-9B多模态大模型,联合预测全局、目标和背景质量分数,在ICME 2026无人机图像质量评估挑战赛中获得第二名。

Comments The model achieves 2nd place in ICME 2026 Drone-IQA Grand Challenge on Target-aware Image Quality Assessment for Low-altitude UAV Images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27660 2026-07-02 cs.CV 新提交

MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

MVPruner: 用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝

Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao

机构 * School of Information Engineering, Chang’an University, China(长安大学信息工程学院) School of Artificial Intelligence, Shanghai Jiaotong University, China(上海交通大学人工智能学院)

AI总结 提出MVPruner,一种两阶段自适应令牌剪枝方法,通过动态分配剪枝预算和基于指令的令牌选择,在保持精度的同时大幅降低计算量,实现多视图视觉语言模型的高效推理。

Comments accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24548 2026-07-02 cs.CV 新提交

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Hongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。

Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏