DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News Retrieval
DynaTree: 面向时效性新闻检索的动态智能检索树
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 提出DynaTree两阶段框架,通过离线构建可复用检索树和在线轻量子树选择,实现高效、自适应的时效性新闻检索,在Syft新闻基准和BEIR数据集上优于标准RAG和现有智能体方法。
高校专区
DynaTree: 面向时效性新闻检索的动态智能检索树
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 提出DynaTree两阶段框架,通过离线构建可复用检索树和在线轻量子树选择,实现高效、自适应的时效性新闻检索,在Syft新闻基准和BEIR数据集上优于标准RAG和现有智能体方法。
AR Forcing: 迈向长时域机器人导航世界模型
机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; Shanghai Jiao Tong University(上海交通大学) ; School of Safety Science, Tsinghua University(清华大学安全科学学院) ; The University of Hong Kong(香港大学) ; Lenovo, Beijing, China(北京联想公司)
AI总结 提出AR Forcing自回归训练策略,通过将扩散损失集成到自回归训练循环中,解决训练与推理分布偏移问题,提升长时域导航中图像一致性和轨迹预测精度。
全监督运动编辑:通过正负学习平衡变化与不变性
机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China(上海人工智能教育研究院,华东师范大学,中国) ; School of Computer Science and Technology, East China Normal University, China(华东师范大学计算机科学与技术学院,中国) ; School of Statistics, East China Normal University, China(华东师范大学统计学院,中国) ; The 27th Research Institute of CETC, Zhengzhou, China(中国电子科技集团第27研究所,郑州,中国) ; Key Laboratory of Advanced Theory and Application in Statistics and Data Science, MOE, China(教育部统计与数据科学先进理论与应用重点实验室,中国) ; Shanghai Key Laboratory of Computer Software Evaluating and Testing, China(上海计算机软件评测测试重点实验室,中国) ; School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院,中国)
AI总结 提出OmniME框架,通过正负学习结合回顾特征监督、运动保持机制和三元组语义对齐,平衡运动编辑中的变化与不变性,在MotionFix和STANCE Adjustment数据集上达到最优性能。
关注证据:面向多模态RLVR的证据锚定空间注意力监督
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Nankai University(南开大学) ; Shanghai Jiaotong University(上海交通大学) ; Zhejiang University(浙江大学)
AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。
语音理解的统一可复现实验框架
机构 * X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系X-LANCE实验室) ; MoE Key Lab of Artificial Intelligence(人工智能MOE重点实验室) ; Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) ; AISpeech Ltd(AISpeech有限公司) ; ETH Zürich(苏黎世联邦理工学院) ; Nanjing University(南京大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 提出SURE框架,通过标准化预测格式、归一化和评分,以及代理辅助的训练转换流程,提高语音理解模型在部署场景下的可比性和可复现性。
Comments This paper is submitted to INTERSPEECH 2026
DARTS: 分布感知的主动展开轨迹塑造以加速LLM强化学习
机构 * School of Computer Science \& Beijing Key Laboratory of Software ; Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China ; School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China ; Institute of Computational Social Science, Peking University (Qingdao), Qingdao, China
AI总结 针对强化学习中长尾响应分布导致的效率瓶颈,提出分布感知的主动轨迹塑造方法,通过细粒度识别提示内长尾并削减无效冗余,实现高达1.77倍的加速而不损失模型性能。
Comments 16 pages, 14 figures, 5 tables. Accepted to ICML 2026
GaMi: 通过跨模态减法解缠实现几何无关的材料识别
机构 * National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Northwestern Polytechnical University(西北工业大学)
AI总结 提出GaMi系统,利用毫米波和声学传感的跨模态减法解缠框架,在不受约束的几何条件下实现高精度材料识别。
Comments 17 pages, 18 figures
OpenSTBench:超越语义评估的语音翻译
机构 * MoE Key Lab of Artificial Intelligence(摩埃人工智能关键实验室) ; Jiangsu Key Lab of Language Computing(江苏语言计算重点实验室) ; X-LANCE Lab(X-LANCE实验室) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Microsoft(微软) ; University of the Chinese Academy of Sciences(中国科学院大学)
AI总结 提出OpenSTBench统一多维评估框架,联合评估语音翻译系统的翻译质量、语音质量、时间一致性等,揭示系统间跨维度差异。
Comments Submitted to EMNLP 2026
多样性至关重要:重新审视视觉-语言模型中的测试时计算
机构 * ETH Zürich(苏黎世联邦理工学院) ; Shanghai Jiao Tong University(上海交通大学) ; EPFL(苏黎世联邦理工学院)
AI总结 针对视觉-语言模型(VLM)中测试时计算(TTC)策略应用不足的问题,提出基于预测熵的ETTC方法,通过利用模型间的置信度差异提升集成性能,理论证明并实验验证其优于多数投票和最佳单模型。
Comments ICML 2026
先见后议:用视觉证据对齐多智能体共识
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Shandong University(山东大学)
AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。
CoMo3R-SLAM: 面向室外多智能体系统的协作式单目稠密SLAM与学习型3D重建先验
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Liverpool(利物浦大学) ; Harbin Engineering University(哈尔滨工程大学) ; University of Ottawa(Ottawa大学) ; Shanghai Jiao Tong University(上海交通大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 提出首个协作式单目稠密RGB SLAM系统CoMo3R-SLAM,利用学习的前馈3D重建先验实现室外多智能体地图构建,无需深度传感器即可生成全局一致的度量地图。
ELAN4D:以具身为中心的4D监督用于视觉-语言-动作模型的即插即用适配
机构 * Torr Vision Group, University of Oxford(托尔视觉组,牛津大学) ; The Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; University College London(伦敦大学学院) ; University of Cambridge(剑桥大学)
AI总结 提出ELAN4D框架,通过未来机器人关键点轨迹作为预测性时空监督,以即插即用方式增强VLA策略的鲁棒性和泛化能力。
Unicorn: 通过通用相关性建模实现高维时间序列的规模化预测
机构 * MoE Key Lab of Artificial Intelligence(人工智能大规模并行计算实验室) ; AI Institute(人工智能研究院) ; School of Computer Science(计算机科学学院) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出Unicorn框架,通过潜在原型码本解耦相关性建模与特定通道身份,实现跨异构数据集的可扩展多数据集预训练,在少样本迁移场景中显著优于现有模型。
MIRA: 基于自锚定评分标准的中期训练源感知数据选择
机构 * Beihang University(北洋大学) ; IQuest Research(IQuest研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Langboat Multilingual-Multimodal-NLP/mira(Langboat多语言-多模态-NLP/mira)
AI总结 针对中期训练中异构数据源的选择问题,提出MIRA框架,通过自锚定评分标准发现和可扩展的学生评分器,在代码中期训练中仅用一半token即可匹配全语料性能。
OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Southeast University(东南大学) ; Nanjing University(南京大学) ; Suzhou Laboratory(苏州实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。
Comments 22 Pages
Draft-OPD:用于推测草稿模型的在线策略蒸馏
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Zhejiang University(浙江大学)
AI总结 针对推测解码中草稿模型因离线训练与在线推理不匹配导致性能瓶颈的问题,提出Draft-OPD方法,通过目标辅助展开和重放验证暴露的错误位置实现在线策略蒸馏,在多种任务上实现超过5倍的无损加速。
Hyper-DP3: 面向视觉运动控制的3D扩散策略的频率感知规模调整
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 针对机器人操作中扩散策略的高计算成本问题,从频域角度分析动作轨迹的平滑性,提出轻量级3D扩散策略Hyper-DP3,使用扩散混合器解码器和两步DDIM推理,以极低参数和延迟实现最先进性能。
UniDial-EvalKit:多面对话能力评估的统一工具包
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出UniDial-EvalKit统一评估工具包,通过标准化数据格式、模块化流水线和层次化评分聚合,解决多轮交互场景下评估协议异构问题,并基于大规模实验揭示当前系统无一致最优、记忆智能体常不及全上下文基线的现象。
G-STAR: 端到端全局说话人跟踪属性识别
机构 * Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究院) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 提出G-STAR框架,通过缓存条件说话人跟踪模块与Speech-LLM转录骨干耦合,实现长时重叠多说话人语音的端到端说话人属性识别,支持组件优化和联合训练,在局部和全局评估中均表现优异。
Comments submitted to Emnlp 2026
UniMedVL: 通过观察-知识-分析统一医学多模态理解与生成
机构 * Shanghai Artificial Intelligence Laboratory ; Shanghai Innovation Institute ; Shanghai Jiao Tong University ; Shanghai Institute of Optics ; Fudan University ; University of Cambridge ; Monash University ; DAMO Academy, Alibaba Group ; Imperial College London ; The University of Hong Kong ; The Hong Kong University of Science ; Hupan Lab ; The Chinese University of Hong Kong
AI总结 提出首个统一医学模型UniMedVL,通过渐进式训练流水线融合多模态理解与生成能力,并在8种影像模态的5.6M实例数据集上验证其性能。
Comments This submission has been converted to the ICML template
超越听觉:通过生理学启发的标记化从耳机学习任务无关的ExG表示
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Cambridge(剑桥大学) ; Shanghai Jiao Tong University(上海交通大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; UCLA(加州大学洛杉矶分校) ; Northwest University(北华大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
AI总结 提出一种基于耳机的生理学启发的多频带标记化方法(PiMT),通过无干扰的日常ExG数据采集和重建任务学习鲁棒表示,实现跨多种任务(包括五种人类感官)的通用ExG监测。
Comments Accepted to ICLR 2026