arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-07-08 至 2026-07-08 共收录 14
2607.06560 2026-07-08 cs.CV 新提交

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06552 2026-07-08 cs.CV 新提交

MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation

MonoIR-RS:基于CLIP和VLM适配的红外遥感视觉语言学习

Jiaju Han, Ma Yaqi, Yahui Chai, Xuemeng Sun, Xin Li, Qike Zhang, Yingying Zhao, Xiang Chen, Luwei Yang, Chengyin Hu, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Guizhou University(贵州大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对红外视觉语言理解未充分探索的问题,提出MonoIR-RS数据集及基准,结合多种方法构建并微调模型,提升红外遥感视觉语言学习性能,为红外与语言对齐提供可控测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06516 2026-07-08 cs.CV 新提交

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

点作为骨架:累积点云增强自回归生成用于闭环自动驾驶模拟

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对自动驾驶模拟难题,提出“点作为骨架”框架,通过自回归生成器结合多种条件合成视频,引入Reset-and-Roll支持闭环,用点云骨架稳定误差,实现基于nuPlan的闭环生成接口,实验证明其提升了闭环自回归生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06507 2026-07-08 cs.CL cs.IR 新提交

DynaKRAG: A Unified Framework for Learnable Evidence Control in Multi-Hop Retrieval-Augmented Generation

DynaKRAG:多跳检索增强生成中可学习证据控制的统一框架

Yaqi Wu, Xiaolei Guo, Chenyu Zhou, Jiaqi Huang, Xianfa Zhang, Junxu Zhang, Zhuo Yu, Zhubo Shi, Jianghao Lin, Dongdong Ge

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Aircraft Manufacturing Co., Ltd.(上海飞机制造有限公司) Tongji University(同济大学)

AI总结 研究多跳检索增强生成中证据控制问题,提出DynaKRAG框架,将证据获取表述为状态条件控制,通过有效性层和控制器选择操作,实验表明该框架在多个基准测试中表现出色,证明协调检索等操作的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06485 2026-07-08 cs.CV cs.AI 新提交

AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models

AirflowAttack:针对红外遥感视觉语言模型的热气流对抗扰动

Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对红外遥感视觉语言模型的对抗攻击,提出AirflowAttack方法,用热气流湍流作扰动先验,由轻量级生成器合成扰动。该方法在多个CLIP主干上攻击成功率高,能降低模型场景分类准确率,还揭示了红外VLM生态系统的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06223 2026-07-08 cs.AI 新提交

Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents

基于信息增益的展开策略优化:一种用于多轮语言模型智能体的自适应树结构展开方法

Yijun Zhang, Fan Xu, Jiaxin Ding, Yule Xie, Shiqing Gao, Xin Ding, Haoxiang Zhang, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对LLM智能体长期搜索任务中展开预算分配不合理问题,提出基于信息增益的展开策略优化(IGRPO),通过按节点信息性分配预算进行树结构展开,并利用诱导教师分布指导策略优化,实验验证该方法在相同预算下优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06097 2026-07-08 cs.CV cs.AI 新提交

PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

PVCap:通过伪字幕和体素字幕网络实现精确的3D密集字幕

Xiaopei Wu, Chenshu Hou, Liang Peng, Dan Xu, Binbin Lin, Xiaoshui Huang, Yuenan Hou, Yu Li, Wenxiao Wang, Haifeng Liu, Deng Cai, Wanli Ouyang

机构 * SH AI Lab(上海人工智能实验室) ZJU(浙江大学) HKUST(香港科技大学) SJTU(上海交通大学)

AI总结 研究针对3D密集字幕任务,提出PVCap方法,由PseudoCap和VoxelCapNet组成。PseudoCap通过随机混合技术增加训练样本,VoxelCapNet利用体素特征改进网络架构。实验表明该方法在两个基准上超越现有技术,提升了3D密集字幕的准确性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06019 2026-07-08 cs.CV 新提交

KOAL: Knowledge-Driven Prostate Cancer Grading with Ordinal-Aware Learning

KOAL:基于序数感知学习的知识驱动前列腺癌分级

Zheng Guo, Jiaqi Cui, Haocheng Xiong, Jize Han, Bo Liu, Qianwen Zhang, Rui Chen, Yan Wang

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) China Mobile (Suzhou) Software Technology Company Limited(中国移动(苏州)软件技术有限公司) Shanghai Changhai Hospital, Naval Medical University(上海长海医院,海军医学大学) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院)

AI总结 研究利用mpMRI无创预测前列腺癌GGG的问题,提出KOAL框架,含临床上下文调制、知识引导原型对齐和分层序数感知约束三个模块,实验证明该框架优于现有方法,提升了前列腺癌GGG预测准确性。

Comments 10 pages, 2 figures, 2 tables. Accepted at MICCAI 2026. This is the submitted version prior to peer review. The final authenticated version will be available on SpringerLink

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05708 2026-07-08 cs.AI 新提交

Akashic: A Low-Overhead LLM Inference Service with MemAttention

Akashic:一种基于内存注意力机制的低开销大语言模型推理服务

Yang Liu, Zhaokai Luo, Huayi Jin, Ruozhou He, Chenchen Hong, Zhiyong Wang, Yifei Liu, Yunfei Gu, Chentao Wu, Junhao Hu

机构 * Xiaohongshu Inc.(小红书公司) ShangHai JiaoTong University(上海交通大学) Peking University(北京大学)

AI总结 针对大语言模型推理中重放完整历史记录不切实际的问题,提出基于内存注意力机制的低开销内存系统Akashic,通过组织上下文成有界块、建模块间语义关系及应用软硬件协同设计内存放置,提升了任务准确率、吞吐量和可持续请求率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05543 2026-07-08 cs.RO cs.CV 新提交

GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory

GEM-Occ:从视觉几何证据到具身语义占用记忆

Hu Zhu, Bohan Li, Xianda Guo, Hongsi Liu, Baorui Peng, Mingqi Yuan, Xin Jin, Wenjun Zeng, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东部理工学院) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) The University of Hong Kong(香港大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对现有室内占用基准和方法对长距离语义映射探索不足的问题,提出GEM-Occ框架,将局部视觉几何预测转化为语义高斯占用证据等并融合到持久分层记忆中,实验证明该框架在多方面优于现有基线。

Comments 19 pages, 6 figures. Project page: https://zhuhu00.top/GEM-Occ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06532 2026-07-08 cs.LG math.OC 新提交

GraphBU: MILP Instance Generation with Graph-Native Block Units

GraphBU:使用图原生块单元生成混合整数线性规划实例

Xiaolei Guo, Chenyu Zhou, Jianghao Lin, Dongdong Ge

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究在模型来自特定管道时MILP实例难获取的问题,提出图原生生成器GraphBU,其基本单元是局部子问题及其接口,通过促进节点耦合等操作生成实例,能保持图统计、可行性并提升下游训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06026 2026-07-08 cs.LG cs.NA math.NA 新提交

SplineNet: An Isogeometric Deep Learning Method for Complex Shells

样条网络:一种用于复杂壳体的等几何深度学习方法

Shizhou Luo, Xiaodong Wei

机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院)

AI总结 本文提出样条网络这一等几何深度学习方法,用于复杂壳体结构设计分析。基于封闭样条表示构建,能无数据或数据驱动应用。无数据时可结合CAE需求,数据驱动时可作主干网提供可解释性,经数值示例验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03261 2026-07-08 cs.CV 新提交

OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout

OmniLayout:用于印刷电路板布局中约束感知几何推理的原理图耦合多模态基准测试

Taiting Lu, Kaiyuan Lin, Mingjia Wang, Haolin Ye, Runze Liu, Yuxin Tian, Vahe Melkonyan, Haoyu Wang, Muchuan Wang, Chufan Hong, Yifan Yang, Sung-Liang Chen, Yi-Chao Chen, Yicheng Jin, Mahanth Gowda

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Binghamton University(宾汉姆顿大学)

AI总结 介绍OmniLayout基准测试,用于评估大语言模型在印刷电路板布局放置推理。含1681个工业级原理图耦合PCB布局及四项任务,揭示当前大语言模型在PCB布局放置上有诸多局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24234 2026-07-08 cs.CV cs.RO 新提交

From Open Waters to Enclosed Cabins: ProteusVPR for Cross-Scene Visual Place Recognition in Maritime Perception and Cabin Inspection

从开阔水域到封闭舱室:ProteusVPR用于海洋感知与舱室检查中的跨场景视觉位置识别

Zexi Chen, Zitai Huang, Qiwen Gu, Zhiqi Li, Shengli Dong, Chenlei Wang, Junqiao Zhao, Hongdong Wang, Bing Han

机构 * Shanghai Jiaotong University(上海交通大学) COSCO SHIPPING Advanced Technology Institute(中远海运先进技术研究院) Shanghai Ship and Shipping Research Institute Co.LTD(上海船舶运输科学研究所) Tongji University(同济大学) Dalian Maritime University(大连海事大学)

AI总结 提出ProteusVPR两阶段检索-细化框架,通过几何-视觉估计网络融合时序帧与几何描述符,在跨场景海洋环境下将平均定位误差降低60%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏