arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3140
2605.31377 2026-06-01 cs.IR cs.AI

DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News Retrieval

DynaTree: 面向时效性新闻检索的动态智能检索树

Siyuan Qi, Xinyuan Wang, Yingxuan Yang, Haochuan Guo, Jianghao Lin, Weiwen Liu, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出DynaTree两阶段框架,通过离线构建可复用检索树和在线轻量子树选择,实现高效、自适应的时效性新闻检索,在Syft新闻基准和BEIR数据集上优于标准RAG和现有智能体方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31314 2026-06-01 cs.RO

AR Forcing: Towards Long-Horizon Robot Navigation World Model

AR Forcing: 迈向长时域机器人导航世界模型

Yifei Yang, Zehua Fan, Huan Li, Aoqi Wang, Lida Huang, Haibao Yu, Haiyan Liu, Xuanyao Mao, Jason Bao, Liang Xu, Bingchuan Sun, Yan Wang

机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Shanghai Jiao Tong University(上海交通大学) School of Safety Science, Tsinghua University(清华大学安全科学学院) The University of Hong Kong(香港大学) Lenovo, Beijing, China(北京联想公司)

AI总结 提出AR Forcing自回归训练策略,通过将扩散损失集成到自回归训练循环中,解决训练与推理分布偏移问题,提升长时域导航中图像一致性和轨迹预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30969 2026-06-01 cs.CV

Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learning

全监督运动编辑:通过正负学习平衡变化与不变性

Zhenwu Shi, Jingyu Gong, Peiwei Wang, Xingzan Wang, Tianwen Qian, Wenxi Li, Yuan Fang, Jiao Xie, Lizhuang Ma, Shaohui Lin

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China(上海人工智能教育研究院,华东师范大学,中国) School of Computer Science and Technology, East China Normal University, China(华东师范大学计算机科学与技术学院,中国) School of Statistics, East China Normal University, China(华东师范大学统计学院,中国) The 27th Research Institute of CETC, Zhengzhou, China(中国电子科技集团第27研究所,郑州,中国) Key Laboratory of Advanced Theory and Application in Statistics and Data Science, MOE, China(教育部统计与数据科学先进理论与应用重点实验室,中国) Shanghai Key Laboratory of Computer Software Evaluating and Testing, China(上海计算机软件评测测试重点实验室,中国) School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院,中国)

AI总结 提出OmniME框架,通过正负学习结合回顾特征监督、运动保持机制和三元组语义对齐,平衡运动编辑中的变化与不变性,在MotionFix和STANCE Adjustment数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30912 2026-06-01 cs.CV cs.CL

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

关注证据:面向多模态RLVR的证据锚定空间注意力监督

Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Nankai University(南开大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30899 2026-06-01 eess.AS cs.AI cs.SD

A Unified and Reproducible Experimentation Framework for Speech Understanding

语音理解的统一可复现实验框架

Jing Peng, Junhao Du, Chenghao Wang, Hanqi Li, Yi Yang, Yixuan Wang, Xiaoyu Gu, Guanyu Chen, Yucheng Wang, Jiang Li, Zhangjie Zhao, Haoran Wang, Wenming Tu, Haoyu Li, Duo Ma, Lirong Qian, Yu Xi, Wen Wen, Jiaqi Guo, Hui Zhang, Shuai Fan, Wenbin Jiang, Shuai Wang, Kai Yu

机构 * X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系X-LANCE实验室) MoE Key Lab of Artificial Intelligence(人工智能MOE重点实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) AISpeech Ltd(AISpeech有限公司) ETH Zürich(苏黎世联邦理工学院) Nanjing University(南京大学) Hangzhou Dianzi University(杭州电子科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出SURE框架,通过标准化预测格式、归一化和评分,以及代理辅助的训练转换流程,提高语音理解模型在部署场景下的可比性和可复现性。

Comments This paper is submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30859 2026-06-01 cs.LG cs.AI

DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning

DARTS: 分布感知的主动展开轨迹塑造以加速LLM强化学习

Yujie Wang, Siwei Chen, Longzan Luo, Xinyi Liu, Xupeng Miao, Fangcheng Fu, Bin Cui

机构 * School of Computer Science \& Beijing Key Laboratory of Software Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China Institute of Computational Social Science, Peking University (Qingdao), Qingdao, China

AI总结 针对强化学习中长尾响应分布导致的效率瓶颈,提出分布感知的主动轨迹塑造方法,通过细粒度识别提示内长尾并削减无效冗余,实现高达1.77倍的加速而不损失模型性能。

Comments 16 pages, 14 figures, 5 tables. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30818 2026-06-01 cs.ET cs.AI cs.SD

GaMi: Geometry-Agnostic Material Identification via Cross-Modal Subtractive Disentanglement

GaMi: 通过跨模态减法解缠实现几何无关的材料识别

Zhiwei Chen, Yijie Li, Yimo Zhang, Shiyun Shao, Yichao Chen, Dian Ding, Liang Wang, Haiwei Wu, Liwei Guo, Jie Yang, Xiaosong Zhang, Yongzhao Zhang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Northwestern Polytechnical University(西北工业大学)

AI总结 提出GaMi系统,利用毫米波和声学传感的跨模态减法解缠框架,在不受约束的几何条件下实现高精度材料识别。

Comments 17 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30792 2026-06-01 eess.AS cs.AI

OpenSTBench: Beyond Semantic Evaluation for Speech Translation

OpenSTBench:超越语义评估的语音翻译

Yanjie An, Yuxiang Zhao, Yichi Zhang, Qixi Zheng, Yujie Tu, Keqi Deng, Kai Yu, Xie Chen

机构 * MoE Key Lab of Artificial Intelligence(摩埃人工智能关键实验室) Jiangsu Key Lab of Language Computing(江苏语言计算重点实验室) X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Microsoft(微软) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 提出OpenSTBench统一多维评估框架,联合评估语音翻译系统的翻译质量、语音质量、时间一致性等,揭示系统间跨维度差异。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30713 2026-06-01 cs.LG cs.CV cs.MM

Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

多样性至关重要:重新审视视觉-语言模型中的测试时计算

Yijie Tong, Yifan Hou, Shaobo Cui, Antoine Bosselut, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) Shanghai Jiao Tong University(上海交通大学) EPFL(苏黎世联邦理工学院)

AI总结 针对视觉-语言模型(VLM)中测试时计算(TTC)策略应用不足的问题,提出基于预测熵的ETTC方法,通过利用模型间的置信度差异提升集成性能,理论证明并实验验证其优于多数投票和最佳单模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30698 2026-06-01 cs.CV cs.AI cs.MA

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

先见后议:用视觉证据对齐多智能体共识

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Shandong University(山东大学)

AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30488 2026-06-01 cs.RO

CoMo3R-SLAM: Collaborative Monocular Dense SLAM with Learned 3D Reconstruction Priors for Outdoor Multi-Agent Systems

CoMo3R-SLAM: 面向室外多智能体系统的协作式单目稠密SLAM与学习型3D重建先验

Zhihao Cao, Qi Shao, Shuhao Zhai, Feng Tian, Anh Nguyen, Hesheng Wang, Baoru Huang

机构 * ETH Zurich(苏黎世联邦理工学院) University of Liverpool(利物浦大学) Harbin Engineering University(哈尔滨工程大学) University of Ottawa(Ottawa大学) Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院)

AI总结 提出首个协作式单目稠密RGB SLAM系统CoMo3R-SLAM,利用学习的前馈3D重建先验实现室外多智能体地图构建,无需深度传感器即可生成全局一致的度量地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30484 2026-06-01 cs.RO

ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation

ELAN4D:以具身为中心的4D监督用于视觉-语言-动作模型的即插即用适配

Zeyuan He, Bowen Yang, Zhirui Fang, Keru Zhou, Lei Jiang, Jingjing Qian, Fan Mo, Junchi Yan, Philip Torr, Xiu Li, Li Jiang, Jialin Yu

机构 * Torr Vision Group, University of Oxford(托尔视觉组,牛津大学) The Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) University of Cambridge(剑桥大学)

AI总结 提出ELAN4D框架,通过未来机器人关键点轨迹作为预测性时空监督,以即插即用方式增强VLA策略的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30376 2026-06-01 cs.LG cs.AI

Unicorn: Scaling High-Dimensional Time Series Forecasting via Universal Correlation Modeling

Unicorn: 通过通用相关性建模实现高维时间序列的规模化预测

Haochen Yuan, Yichen Song, Yunbo Wang, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence(人工智能大规模并行计算实验室) AI Institute(人工智能研究院) School of Computer Science(计算机科学学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Unicorn框架,通过潜在原型码本解耦相关性建模与特定通道身份,实现跨异构数据集的可扩展多数据集预训练,在少样本迁移场景中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30288 2026-06-01 cs.AI

MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

MIRA: 基于自锚定评分标准的中期训练源感知数据选择

Haowen Wang, Yaxin Du, Jian Yang, Jiajun Wu, Shukai Liu, Yuxuan Zhang, Pingjie Wang, Siheng Chen, Tuney Zheng, Ming Zhou, Xianglong Liu, Bryan Dai

机构 * Beihang University(北洋大学) IQuest Research(IQuest研究院) Shanghai Jiao Tong University(上海交通大学) University of British Columbia(不列颠哥伦比亚大学) Langboat Multilingual-Multimodal-NLP/mira(Langboat多语言-多模态-NLP/mira)

AI总结 针对中期训练中异构数据源的选择问题,提出MIRA框架,通过自锚定评分标准发现和可扩展的学生评分器,在代码中期训练中仅用一半token即可匹配全语料性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29833 2026-06-01 cs.AI

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Southeast University(东南大学) Nanjing University(南京大学) Suzhou Laboratory(苏州实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29343 2026-06-01 cs.CL

Draft-OPD: On-Policy Distillation for Speculative Draft Models

Draft-OPD:用于推测草稿模型的在线策略蒸馏

Haodi Lei, Yafu Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 针对推测解码中草稿模型因离线训练与在线推理不匹配导致性能瓶颈的问题,提出Draft-OPD方法,通过目标辅助展开和重放验证暴露的错误位置实现在线策略蒸馏,在多种任务上实现超过5倍的无损加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01581 2026-06-01 cs.RO

Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control

Hyper-DP3: 面向视觉运动控制的3D扩散策略的频率感知规模调整

Jinhao Zhang, Zhexuan Zhou, Huizhe Li, Yichen Lai, Wenlong Xia, Haoming Song, Youmin Gong, Jie Mei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对机器人操作中扩散策略的高计算成本问题,从频域角度分析动作轨迹的平滑性,提出轻量级3D扩散策略Hyper-DP3,使用扩散混合器解码器和两步DDIM推理,以极低参数和延迟实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23160 2026-06-01 cs.CL

UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities

UniDial-EvalKit:多面对话能力评估的统一工具包

Qi Jia, Haodong Zhao, Dun Pei, Xiujie Song, Ye Shen, Shibo Wang, Zijian Chen, Zicheng Zhang, Xiangyang Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出UniDial-EvalKit统一评估工具包,通过标准化数据格式、模块化流水线和层次化评分聚合,解决多轮交互场景下评估协议异构问题,并基于大规模实验揭示当前系统无一致最优、记忆智能体常不及全上下文基线的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10468 2026-06-01 eess.AS cs.AI cs.HC cs.MM cs.SD

G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition

G-STAR: 端到端全局说话人跟踪属性识别

Jing Peng, Ziyi Chen, Haoyu Li, Yucheng Wang, Duo Ma, Mengtian Li, Yunfan Du, Dezhu Xu, Kai Yu, Shuai Wang

机构 * Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院) ETH Zürich(苏黎世联邦理工学院)

AI总结 提出G-STAR框架,通过缓存条件说话人跟踪模块与Speech-LLM转录骨干耦合,实现长时重叠多说话人语音的端到端说话人属性识别,支持组件优化和联合训练,在局部和全局评估中均表现优异。

Comments submitted to Emnlp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15710 2026-06-01 cs.CV

UniMedVL: Unifying Medical Multimodal Understanding and Generation through Observation-Knowledge-Analysis

UniMedVL: 通过观察-知识-分析统一医学多模态理解与生成

Junzhi Ning, Wei Li, Cheng Tang, Jiashi Lin, Chenglong Ma, Chaoyang Zhang, Jiyao Liu, Ying Chen, Shujian Gao, Yuandong Pu, Huihui Xu, Chenhui Gou, Ziyan Huang, Yi Xin, Qi Qin, Diping Song, Bin Fu, Guang Yang, Yuanfeng Ji, Tianbin Li, Yanzhou Su, Jin Ye, Shixiang Tang, Zhongying Deng, Lihao Liu, Ming Hu, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory Shanghai Innovation Institute Shanghai Jiao Tong University Shanghai Institute of Optics Fudan University University of Cambridge Monash University DAMO Academy, Alibaba Group Imperial College London The University of Hong Kong The Hong Kong University of Science Hupan Lab The Chinese University of Hong Kong

AI总结 提出首个统一医学模型UniMedVL,通过渐进式训练流水线融合多模态理解与生成能力,并在8种影像模态的5.6M实例数据集上验证其性能。

Comments This submission has been converted to the ICML template

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20853 2026-06-01 eess.AS cs.CL cs.SD

Beyond Hearing: Learning Task-Agnostic ExG Representations from Earphones via Physiology-Informed Tokenization

超越听觉:通过生理学启发的标记化从耳机学习任务无关的ExG表示

Hyungjun Yoon, Seungjoo Lee, Yu Yvonne Wu, Xiaomeng Chen, Taiting Lu, Freddy Yifei Liu, Taeckyung Lee, Hyeongheon Cha, Haochen Zhao, Gaoteng Zhao, Dongyao Chen, Cecilia Mascolo, Sung-Ju Lee, Lili Qiu

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) UCLA(加州大学洛杉矶分校) Northwest University(北华大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

AI总结 提出一种基于耳机的生理学启发的多频带标记化方法(PiMT),通过无干扰的日常ExG数据采集和重建任务学习鲁棒表示,实现跨多种任务(包括五种人类感官)的通用ExG监测。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30352 2026-05-29 cs.CV

GMOS: Grounding Moving Object Segmentation in 3D Space and Time

GMOS: 在3D空间和时间中定位运动物体分割

Junyu Xie, Tengda Han, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, Department of Engineering Science, University of Oxford, UK(牛津大学工程科学系视觉几何组) SAI, Shanghai Jiao Tong University, China(上海交通大学SAI)

AI总结 提出GMOS框架,直接在RGB视频上实现3D感知、时间细粒度的多运动物体分割,并构建GMOS-2K数据集和MOS-I评估协议,在多个基准上取得最先进结果。

Comments Project Page: https://www.robots.ox.ac.uk/vgg/research/gmos/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30265 2026-05-29 cs.CV cs.CL

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

LoMo: 局部模态替换以实现更深的视觉-语言融合

Feng Han, Zhixiong Zhang, Zheming Liang, Yibin Wang, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 针对视觉-语言模型在模态替换时性能下降的“载体敏感性”问题,提出局部模态替换(LoMo)数据策展范式,通过将文本片段动态渲染为图像来训练跨模态表示不变性,显著提升多模态推理与融合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30058 2026-05-29 cs.CL

HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?

HEART-Bench: 大语言模型智能体是否表现出类似人类的心理学?

Weihan Peng, Chenxu Zhang, Qianao Wang, Yuling Shi, Heng Lian, Qihong Mao, Jiahao Pang, Chunliang Feng, Bowen Li, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院) Quwan Group(启元集团) University of Washington(华盛顿大学) South China Normal University(华南师范大学)

AI总结 提出HEART-Bench基准,通过构建基于大五人格和自传体记忆的虚拟角色,在DIAMONDS情境框架下评估LLM智能体能否展现一致的人类心理特征。

Comments GitHub: https://github.com/peng-weihan/HEART-BENCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30015 2026-05-29 cs.LG cs.AI

Test Time Training for Supervised Causal Learning

测试时训练用于监督因果学习

Zizhen Deng, Jiaru Zhang, Rui Ding, Huang Bojun, Jinzhuo Wang, Qiang Fu, Shi Han, Dongmei Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Microsoft(微软) Sony Research(索尼研究)

AI总结 针对监督因果学习在分布外泛化中的不足,提出测试时训练框架TTT-SCL,通过动态生成与测试实例对齐的训练集,显著提升因果发现性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29812 2026-05-29 cs.CV

Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language

并非所有输入都有效:面向开放集视频时刻检索的语言方法

Xiang Fang, Wanlong Fang, Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Renfu Li, Zichuan Xu, Lixing Chen, Panpan Zheng, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Zhejiang Gongshang University(浙江工商大学) Dalian University of Technology(大连理工大学) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对开放集场景下视频时刻检索任务中无关查询导致错误检索的问题,提出基于归一化流的开放集视频时刻检索模型OpenVMR,实现分布内查询的精确检索与分布外查询的拒绝。

Comments Published in ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29707 2026-05-29 cs.CL

Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

Domino: 在推测解码中将因果建模与自回归草稿解耦

Jianuo Huang, Yaojie Zhang, Qituan Zhang, Hao Lin, Hanlin Xu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) School of Software Engineering, HUST(华中科技大学软件学院) UESTC Fudan University(复旦大学) Huawei(华为公司)

AI总结 提出Domino框架,通过并行草稿骨干和轻量级Domino头解耦因果依赖建模与自回归草稿执行,结合基础锚定训练课程,在Qwen3模型上实现高达5.49倍端到端加速和5.8倍吞吐量加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02288 2026-05-29 cs.CV

LabBuilder: Protocol-Grounded 3D Layout Generation for Interactable and Safe Laboratory

LabBuilder: 基于协议的可交互且安全的3D实验室布局生成

Jianbao Cao, Zhangrui Zhao, Bohan Feng, Zixuan Hu, Rui Li, Haiyuan Wan, Chenxi Li, Jingyuan Li, Wenzhe Cai, Lei Bai, Wanli Ouyang, Lingyu Duan, Di Huang, Minting Pan, Sha Zhang, Xinzhu Ma, Shixiang Tang, Dongzhan Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Wuhan University(武汉大学) Beihang University(北航) Peking University(北京大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出LabBuilder系统,通过协议引导和约束感知优化,从文本描述生成安全且可执行的3D实验室布局,显著优于现有方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19316 2026-05-29 cs.CV cs.AI

Evaluating Dataset Watermarking for Fine-tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach

评估数据集水印用于定制扩散模型微调可追溯性:一个综合基准与移除方法

Xincheng Wang, Hanchi Sun, Wenjun Sun, Kejun Xue, Wangqiu Zhou, Jianbo Zhang, Wei Sun, Dandan Zhu, Xiongkuo Min, Jun Jia, Zhijun Fang

机构 * Donghua University(东华大学) Shanghai Jiao Tong University(上海交通大学) Xidian University(西安电子科技大学) Hefei University of Technology(合肥工业大学) East China Normal University(华东师范大学)

AI总结 针对扩散模型微调中的版权与安全风险,本文建立统一威胁模型并提出包含普适性、可传递性和鲁棒性的评估框架,揭示现有数据集水印方法的脆弱性,并进一步提出一种实用的水印移除方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10330 2026-05-29 cs.LG

Diffusion-based learning framework for Constrained Nonconvex Optimization with Weighted Bootstrapped Refinement

基于扩散的约束非凸优化学习框架与加权自举细化

Shutong Ding, Yimiao Zhou, Ke Hu, Xi Yao, Junchi Yan, Xiaoying Tang, Ye Shi

机构 * ShanghaiTech University(上海科技大学) MoE Key Laboratory of Intelligent Perception(智能感知MoE重点实验室) Human Machine Collaboration(人机协同) Shanghai Jiao Tong University(上海交通大学) China Mobile Communications Company Limited Research Institute(中国移动通信公司有限研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出DiOpt框架,通过监督预热和自举训练两阶段学习噪声到约束区域的映射,解决扩散模型在约束非凸优化中的分布错位问题,实现高约束满足和最优性。

Comments accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏