arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3140
2604.10095 2026-05-27 cs.CV

Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models

挖掘属性子空间以实现3D基础模型的高效微调

Yu Jiang, Hanwen Jiang, Ahmed Abdelkader, Wen-Sheng Chu, Brandon Y. Feng, Zhangyang Wang, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Adobe Research(Adobe研究) Google Research(谷歌研究)

AI总结 本文通过生成合成数据并提取与纹理、几何、相机运动和光照变化相关的LoRA子空间,发现这些子空间近似解耦,集成后形成降维子空间,从而提高下游任务微调的效率和预测精度。

Comments 10 pages, 8 figures. Code here: https://github.com/jpppppppppppppppppppppppp/Subspaces-Mining-for-VGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16449 2026-05-27 cs.CV cs.AI

Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference

弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理

Ziyan Liu, Yeqiu Chen, Hongyi Cai, Tao Lin, Shuo Yang, Zheng Liu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) BAAI(北京人工智能研究院)

AI总结 提出VLA-Pruner方法,通过结合语义预填充和时序平滑的动作相关性估计视觉令牌重要性,并采用Combine-then-Filter策略,在保持操作质量的同时实现高达1.99倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22476 2026-05-27 cs.AR cs.AI

RulePlanner: All-in-One Reinforcement Learner for Unifying Design Rules in 3D Floorplanning

RulePlanner: 用于统一3D布局规划中设计规则的全能强化学习器

Ruizhe Zhong, Xingbo Du, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出一种基于深度强化学习的统一框架,通过新颖的矩阵表示、动作空间约束和奖励信号定量分析,处理多种硬件设计规则,实现3D布局规划中的规则遵守。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13762 2026-05-27 cs.LG q-bio.BM

MolPIF: A Parameter Interpolation Flow Model for Molecule Generation

MolPIF: 一种用于分子生成的参数插值流模型

Yaowei Jin, Junjie Wang, Yufan Tang, Wenkai Xiang, Duanhua Cao, Dan Teng, Zhehuan Fan, Jiacheng Xiong, Xia Sheng, Chuanlong Zeng, Duo An, Mingyue Zheng, Shuangjia Zheng, Qian Shi

机构 * Lingang Laboratory(灵冈实验室) School of Information Science and Technology(信息科学与技术学院) ShanghaiTech University(上海科技大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research(药物发现与设计中心、国家药物研究重点实验室) Shanghai Institute of Materia Medica, Chinese Academy of Sciences(中国科学院上海 medicinal materials 研究院) Global Institute of Future Technology(未来技术全球研究院) Shanghai Jiao Tong University(上海交通大学) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

AI总结 提出参数插值流模型MolPIF,通过参数空间分布插值统一连续坐标与离散原子类型的生成,在CrossDocked2020数据集上优于基线方法。

Comments Accepted to Bioinformatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16417 2026-05-27 cs.CV

CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD Detection

CRoFT: 面向OOD泛化和开放集OOD检测的并发优化鲁棒微调

Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 针对视觉语言预训练模型微调时分布偏移问题,提出一种基于能量分数梯度最小化的统一微调框架,同时提升闭集OOD泛化能力和开放集OOD检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26038 2026-05-26 cs.CV cs.AI

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models

DRScaffold:提升轻量级视觉语言模型在密集场景推理中的能力

Xinrui Shi, Kai Liu, Ziqing Zhang, Jianze Li, Anqi Li, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对轻量级视觉语言模型在密集场景推理中缺乏显式视觉锚定导致推理链不可靠的问题,提出DRScaffold监督微调框架,通过将监督目标分解为四个因果有序阶段,在不修改架构的情况下强制进行有根据的推理,显著提升密集场景推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23904 2026-05-26 cs.AI cs.CL

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

SkillOpt: 自我进化智能体技能的执行策略

Yifan Yang, Ziyang Gong, Weiquan Huang, Qihao Yang, Ziwei Zhou, Zisu Huang, Yan Li, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Yuqing Yang, Dongdong Chen, Xue Yang, Chong Luo

机构 * Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

AI总结 提出SkillOpt,一种系统性的可控文本空间优化器,通过分离的优化器模型对技能文档进行有界编辑,并仅在严格改善验证分数时接受编辑,从而稳定训练技能,在六个基准测试中全面优于现有方法。

Comments 27 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25876 2026-05-26 cs.CV

DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

DyCoRM: 面向文本到图像生成的动态准则感知奖励建模

Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对用户对文本到图像生成中动态、细粒度评价准则的需求,提出DyCoRM动态准则感知奖励模型,并构建数据集DyCoDataset-20K和基准DyCoBench-1K,通过准则感知偏好比较和DyCoPick选择方法,实现首个动态细粒度奖励建模框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25595 2026-05-26 cs.CV

How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark

AI在肝纤维化分期中取得了多大进展?大规模真实世界数据集与基准

Yuanye Liu, Nannan Shi, Zhejia Zhang, Hanxiao Zhang, Boya Wang, Derong Yu, Nao Wang, Yuxin Jin, Yang Zhou, Kunhao Yuan, Siqi Wang, Lida Yang, Xu Qiao, Wentao Liu, Xuelei He, Xin Hong, Guoyan Zheng, Xin Chen, Guang-Zhong Yang, Le Zhang, Lei Li, Yuxin Shi, Xiahai Zhuang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院) Department of Radiology, Shanghai Public Health Clinical Center, Fudan University, Shanghai, China(复旦大学上海公共卫生临床中心放射科) Department of Electrical and Computer Engineering, Northwestern University, Evanston, USA(西北大学电气与计算机工程系) Shanghai Key Laboratory of Flexible Medical Robotics, Tongren Hospital, Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海柔性医疗机器人重点实验室) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学生物医学工程学院) School of Computer Science, University of Nottingham, Nottingham, UK(诺丁汉大学计算机科学学院) Institute of Medical Robotics, School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学生物医学工程学院医疗机器人研究所) College of Computer Science and Technology, Huaqiao University, Xiamen, China(华侨大学计算机科学与技术学院) School of Electronic Information (School of Artificial Intelligence), Northwest University, Xi'an, China(西北大学电子信息学院(人工智能学院)) Department of Mechanical Engineering, University College London, London, UK(伦敦大学学院机械工程系) Institute of Neuroscience and Cardiovascular Research, University of Edinburgh, Edinburgh, UK(爱丁堡大学神经科学与心血管研究学院) CAS Center for Excellence in Nanoscience, National Center for Nanoscience and Technology, Beijing, China(中国科学院纳米科学卓越中心) School of Control Science and Engineering, Shandong University, Jinan, China(山东大学控制科学与工程学院) School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(伯明翰大学工程学院)

AI总结 基于多中心、多序列MRI的大规模真实世界数据集LiFS,系统评估了9种AI方法在肝纤维化分期中的表现,发现最佳AI与资深放射科医生相当,但跨中心异质性和标签不平衡仍是主要挑战。

Comments Submitted to Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25500 2026-05-26 cs.CV

Full-4D: Generating Full-Scope 4D Scenes from a Single-View Video

Full-4D:从单视角视频生成全范围4D场景

Tingxi Chen, Ke Hao, Yabo Chen, Zhengxue Cheng, Rong Xie, Li Song, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

AI总结 提出一种将单视角视频转换为全范围4D场景的框架,通过多视角视频合成和基于优化的4D重建,引入大规模数据集Real-MV-4D、融合时间-视图注意力的扩散模型和流匹配蒸馏损失,实现高保真度和几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25443 2026-05-26 cs.CL

Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models

多样性中的和谐:面向大型推理模型的多域对比策略优化

Zongji Yu, Wenshui Luo, Yiliu Sun, Hao Fang, Runmin Cong, Chaochao Lu, Chen Gong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shandong University(山东大学)

AI总结 提出多域对比策略优化(MCPO),通过对比学习促进跨域知识迁移并减少干扰,提升大型推理模型在多域场景下的推理能力。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25404 2026-05-26 cs.CL eess.AS

Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

主动应对不确定性:面向口语对话系统的因果感知错误诊断与交互式澄清

Yizhou Peng, Ziyang Ma, Changsong Liu, Yi-Wen Chao, Xie Chen, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国)

AI总结 本文提出一种因果感知的错误恢复范式,通过细粒度检测器解耦ASR中的感知、理解和删除错误,使LLM能够执行多轮针对性澄清策略,从而显著降低词错误率并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25388 2026-05-26 cs.LG q-bio.QM

ViroBench: Benchmarking Nucleotide Foundation Models on Viral Genomics Tasks

ViroBench:病毒基因组学任务中的核苷酸基础模型基准测试

Dongxin Ye, Fang Hu, Han Hu, Shu Hu, Yang Tan, Wanli Ouyang, Stan Z. Li, Jie Cui, Nanqing Dong

机构 * Shanghai Innovation Institute Shanghai China(深圳河套学院) University of Electronic Science Fudan University Shanghai China Shanghai Artificial Intelligence Laboratory Shanghai China Institute of Infection Health Fudan University Shanghai China Shanghai Sci-Tech Inno Center for Infection \& Immunity Shanghai China Shanghai Jiao Tong University Shanghai China Shenzhen Loop Area Institute Shenzhen China Chinese University of Hong Kong Hong Kong China Westlake University Hangzhou China Shanghai Innovation Institute Fudan University Shanghai Artificial Intelligence Laboratory Shanghai Sci-Tech Inno Center for Infection \& Immunity Shanghai Jiao Tong University Shenzhen Loop Area Institute Chinese University of Hong Kong Westlake University

AI总结 提出首个针对病毒基因组学的综合基准ViroBench,评估66个核苷酸基础模型在生物学理解和潜在生物安全风险上的表现,发现模型在系统发育和时间偏移下性能下降,生成任务中统计似然与生物功能有效性脱钩,且预训练数据的分类多样性比参数规模更重要。

Comments 42 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25334 2026-05-26 cs.CV

Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

双路径几何感知多模态大语言模型用于空间智能

Yufei Zheng, Xuhan Zhu, Zide Liu, Chunpeng Zhou, Chenfeng Wang, Yongchao Xu, Yunnan Wang, Jiawei Liu, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利汽车公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出GAMSI,一种仅以RGB图像为输入、通过双路径查询和专家引导视觉对齐实现3D结构与度量尺度联合感知的多模态大语言模型,在七个空间智能基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18172 2026-05-26 cs.AI

Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs

可视化不可见:生成式视觉定位赋能多模态大语言模型的通用脑电图理解

Jun-Yu Pan, Yansen Wang, Enze Zhang, Bao-Liang Lu, Wei-Long Zheng, Dongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 提出生成式视觉定位(GVG)框架,通过脑电图到图像的生成模型作为视觉翻译器,为多模态大语言模型提供结构化视觉上下文,以增强非视觉脑电图的理解和临床状态解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04700 2026-05-26 cs.CR cs.AI cs.CL cs.LG cs.SD

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

稀疏令牌足矣:通过令牌感知梯度优化越狱音频语言模型

Zheng Fang, Xiaosen Wang, Shenyi Zhang, Shaokang Wang, Zhijin Ge

机构 * Wuhan University Institute for Math \& AI, Wuhan University Huazhong University of Science Shanghai Jiao Tong University Xidian University

AI总结 本文提出令牌感知梯度优化(TAGO)方法,通过仅保留高梯度能量的音频令牌对应的波形梯度,实现稀疏越狱攻击,在保持高成功率的同时大幅减少优化量。

Comments To appear in the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18396 2026-05-26 cs.CL

River-LLM: Large Language Model Seamless Exit Based on KV Share

River-LLM:基于KV共享的大型语言模型无缝退出

Yingtao Shen, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对解码器-only架构中早期退出因KV缓存缺失导致的延迟和精度问题,提出无需训练的River-LLM框架,通过轻量级KV共享退出流实现令牌级无缝退出,并利用状态转移相似性预测KV误差指导退出决策,在数学推理和代码生成任务上获得1.53-2.16倍实际加速且保持高质量。

Comments Accepted to ACL 2026, 13pages, with appendix. Corrected some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12383 2026-05-26 cs.SD

On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation

面向统一重建、理解和生成的语音VAE蒸馏损失函数研究

Changhao Cheng, Wei Wang, Wangyou Zhang, Dongya Jia, Jian Wu, Zhuo Chen, Yanmin Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Auditory Cognition and Computational Acoustics Lab(听觉认知与计算声学实验室) MoE Key Lab of Artificial Intelligence, AI Institute(人工智能MoE重点实验室,AI研究院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) ByteDance Seed, China(字节跳动种子,中国)

AI总结 本文系统探索了语音VAE中不同对齐方法对重建、理解和生成任务性能的影响,并提出联合边缘对齐与自适应加权策略以实现最优整体性能。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04707 2026-05-26 cs.CV

OpenWorldLib: A Unified Codebase and Definition of Advanced World Models

OpenWorldLib: 高级世界模型的统一代码库与定义

DataFlow Team, Bohan Zeng, Daili Hua, Kaixin Zhu, Yifan Dai, Bozhou Li, Yuran Wang, Chengzhuo Tong, Yifan Yang, Mingkun Chang, Jianbin Zhao, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Junbo Niu, Zimo Meng, Tianyi Bai, Meiyi Qiang, Huanyao Zhang, Zhiyou Xiao, Tianyu Guo, Qinhan Yu, Runhao Zhao, Zhengpin Li, Xinyi Huang, Yisheng Pan, Yiwen Tang, Juanxi Tian, Yang Shi, Yue Ding, Xinlong Chen, Hongcheng Gao, Minglei Shi, Jialong Wu, Zekun Wang, Yuanxing Zhang, Xintao Wang, Pengfei Wan, Yiren Song, Mike Zheng Shou, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出OpenWorldLib框架,基于对世界模型演化的分析给出清晰定义,并系统分类其核心能力,实现多任务模型的统一集成与高效推理。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00499 2026-05-26 cs.LG

Scheduling LLM Inference with Uncertainty-Aware Output Length Predictions

具有不确定性感知输出长度预测的LLM推理调度

Haoyu Zheng, Yongqiang Zhang, Fangcheng Fu, Xiaokai Zhou, Hao Luo, Hongchao Zhu, Yuanyuan Zhu, Hao Wang, Xiao Yan, Jiawei Jiang

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机学院) Dameng Database Co., Ltd., Wuhan, China(达梦数据库有限公司) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Institute for Math and AI, Wuhan University, Wuhan, China(武汉大学数学与人工智能研究院)

AI总结 针对LLM推理调度,提出基于对数t分布的输出长度分布模型,并设计Tail Inflated Expectation (TIE)指标替代点估计,以降低在线推理延迟并提高离线吞吐量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09581 2026-05-26 cs.LG

Towards Understanding Adam Convergence on Highly Degenerate Polynomials

理解Adam在高度退化多项式上的收敛性

Zhiwei Bai, Jiajie Zhao, Zhangchen Zhou, Zhi-Qin John Xu, Yaoyu Zhang

机构 * Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学理论科学研究院) School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Shanghai Seres Information Technology Co., Ltd, Shanghai 200040, China(上海塞瑞斯信息技术有限公司)

AI总结 本文研究Adam优化器在高度退化多项式上的自动收敛性质,推导局部渐近稳定性条件,证明其线性收敛速度优于梯度下降和动量法,并刻画超参数相图。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11534 2026-05-26 cs.LG cs.AI

Krause Synchronization Transformers

Krause同步变换器

Jingkun Liu, Yisong Yue, Max Welling, Yue Song

机构 * Shanghai Qi Zhi Institute(上海启智研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Jiao Tong University(上海交通大学) California Institute of Technology(加州理工学院) University of Amsterdam(阿姆斯特丹大学)

AI总结 提出基于有界置信共识动力学的Krause注意力机制,通过局部化稀疏交互替代全局softmax归一化,缓解表示坍缩和注意力汇聚现象,实现线性复杂度并提升性能。

Comments ICML 2026, Project page: https://jingkun-liu.github.io/krause-sync-transformers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02979 2026-05-26 cs.CL cs.LG

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning

CPMobius: 无数据强化学习的迭代式教练-玩家推理

Ran Li, Zeyuan Liu, Yinghao Chen, Bingxiang He, Jiarui Yuan, Zixuan Fu, Weize Chen, Jinyi Hu, Chen Qian, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出CPMobius协作式教练-玩家范式,通过无外部数据的合作优化循环提升数学推理能力,在Qwen2.5-Math-7B-Instruct上总体准确率提升4.9%,OOD准确率提升5.4%。

Comments Accepted to the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21406 2026-05-26 cs.CV cs.LG

Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation

通过多表示生成增强统一多模态模型的理解能力

Zihan Su, Hongyang Wei, Kangrui Cen, Yong Wang, Guanhua Chen, Chun Yuan, Xiangxiang Chu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Southern University of Science and Technology(南方科技大学)

AI总结 提出UniMRG方法,通过辅助生成像素、深度和分割等多重表示,增强统一多模态模型的理解能力,减少幻觉并提升空间理解。

Comments Code: https://github.com/Sugewud/UniMRG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11296 2026-05-26 cs.CV cs.LG

$Δ\mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

$Δ\mathrm{Energy}$: 优化视觉-语言对齐过程中的能量变化提升OOD检测与OOD泛化

Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出ΔEnergy分数,通过重新对齐视觉-语言模态时的能量变化来同时提升分布外检测和分布外泛化性能,并基于此开发了统一微调框架EBM。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24621 2026-05-26 cs.CV

FreeRet: MLLMs as Training-Free Retrievers

FreeRet: 无需训练的多模态大语言模型检索器

Yuhan Zhu, Xiangyu Zeng, Chenting Wang, Xinhao Li, Chunxu Liu, Yicheng Xu, Ziang Yan, Yi Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Institute of Science Tokyo(东京科学研究院) Zhejiang University(浙江大学)

AI总结 提出FreeRet框架,将现成的多模态大语言模型转化为无需额外训练的两阶段检索器,通过语义嵌入和重排序提升检索性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16931 2026-05-26 cs.IR cs.AI cs.LG

Equip Pre-ranking with Target Attention by Residual Quantization

通过残差量化为预排序阶段配备目标注意力机制

Yutong Li, Yu Zhu, Yichen Qiao, Ziyu Guan, Lv Shao, Tong Liu, Bo Zheng

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Shanghai Jiao Tong University Shanghai China Xidian University Xi'an China Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba Shanghai Jiao Tong University Xidian University

AI总结 提出TARQ框架,利用残差量化在预排序阶段近似目标注意力架构,首次在延迟关键阶段引入TA建模能力,实现精度与效率的新最优平衡。

Comments 5 pages, 2 figures, accepted by SIGIR 2026 Short Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04805 2026-05-26 cs.LG

Adaptive Preconditioners Trigger Loss Spikes in Adam

Adam中的自适应预处理器引发损失尖峰

Zhiwei Bai, Zhangchen Zhou, Jiajie Zhao, Xiaolong Li, Zhiyu Li, Feiyu Xiong, Hongkang Yang, Yaoyu Zhang, Zhi-Qin John Xu

机构 * Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学理论科学研究院) School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究院) Shanghai Seres Information Technology Co., Ltd, Shanghai 200040, China(上海塞瑞斯信息技术有限公司,上海200040,中国)

AI总结 通过分析Adam二阶矩估计器的内部动力学,发现自适应预处理器与瞬时平方梯度之间的解耦机制导致损失尖峰,并基于二次近似分析提出尖峰预测方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24931 2026-05-26 cs.RO

Learning High-Frequency Continuous Action Chunks in Latent Space

在潜在空间中学习高频连续动作块

Kunyun Wang, Yuhang Zheng, Yupeng Zheng, Jieru Zhao, Wenchao Ding

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) National University of Singapore, Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Fudan University, Shanghai, China(复旦大学)

AI总结 本文提出通过变分自编码器将高频动作学习从动作空间转移到潜在空间,并引入Reuse-then-Refine块级精炼策略,以提升高频控制的时间与空间一致性,实现复杂接触任务的平滑执行。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24860 2026-05-26 eess.SY cs.AI cs.ET cs.LG cs.RO cs.SY

DBPnet: Damper Characteristics-Based Bayesian Physics-Informed Neural Network for Wheel Load Estimation

DBPnet:基于阻尼特性的贝叶斯物理信息神经网络用于车轮载荷估计

Tianyi Wang, Tianyi Zeng, Zimo Zeng, Feiyang Zhang, Yujin Wang, Xiangyu Li, Yiming Xu, Sikai Chen, Junfeng Jiao, Christian Claudel, Xinbo Chen

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) College of Electrical Engineering, Zhejiang University(浙江大学电气工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系)

AI总结 提出DBPnet,一种结合阻尼特性嵌入模块的贝叶斯物理信息神经网络,通过悬架连杆级建模和物理信息损失函数,实现鲁棒的车轮载荷估计。

Comments 14 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏