DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News Retrieval
DynaTree: 面向时效性新闻检索的动态智能检索树
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 提出DynaTree两阶段框架,通过离线构建可复用检索树和在线轻量子树选择,实现高效、自适应的时效性新闻检索,在Syft新闻基准和BEIR数据集上优于标准RAG和现有智能体方法。
高校专区
DynaTree: 面向时效性新闻检索的动态智能检索树
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 提出DynaTree两阶段框架,通过离线构建可复用检索树和在线轻量子树选择,实现高效、自适应的时效性新闻检索,在Syft新闻基准和BEIR数据集上优于标准RAG和现有智能体方法。
AR Forcing: 迈向长时域机器人导航世界模型
机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; Shanghai Jiao Tong University(上海交通大学) ; School of Safety Science, Tsinghua University(清华大学安全科学学院) ; The University of Hong Kong(香港大学) ; Lenovo, Beijing, China(北京联想公司)
AI总结 提出AR Forcing自回归训练策略,通过将扩散损失集成到自回归训练循环中,解决训练与推理分布偏移问题,提升长时域导航中图像一致性和轨迹预测精度。
全监督运动编辑:通过正负学习平衡变化与不变性
机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China(上海人工智能教育研究院,华东师范大学,中国) ; School of Computer Science and Technology, East China Normal University, China(华东师范大学计算机科学与技术学院,中国) ; School of Statistics, East China Normal University, China(华东师范大学统计学院,中国) ; The 27th Research Institute of CETC, Zhengzhou, China(中国电子科技集团第27研究所,郑州,中国) ; Key Laboratory of Advanced Theory and Application in Statistics and Data Science, MOE, China(教育部统计与数据科学先进理论与应用重点实验室,中国) ; Shanghai Key Laboratory of Computer Software Evaluating and Testing, China(上海计算机软件评测测试重点实验室,中国) ; School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院,中国)
AI总结 提出OmniME框架,通过正负学习结合回顾特征监督、运动保持机制和三元组语义对齐,平衡运动编辑中的变化与不变性,在MotionFix和STANCE Adjustment数据集上达到最优性能。
关注证据:面向多模态RLVR的证据锚定空间注意力监督
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Nankai University(南开大学) ; Shanghai Jiaotong University(上海交通大学) ; Zhejiang University(浙江大学)
AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。
语音理解的统一可复现实验框架
机构 * X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系X-LANCE实验室) ; MoE Key Lab of Artificial Intelligence(人工智能MOE重点实验室) ; Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) ; AISpeech Ltd(AISpeech有限公司) ; ETH Zürich(苏黎世联邦理工学院) ; Nanjing University(南京大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 提出SURE框架,通过标准化预测格式、归一化和评分,以及代理辅助的训练转换流程,提高语音理解模型在部署场景下的可比性和可复现性。
Comments This paper is submitted to INTERSPEECH 2026
DARTS: 分布感知的主动展开轨迹塑造以加速LLM强化学习
机构 * School of Computer Science \& Beijing Key Laboratory of Software ; Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China ; School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China ; Institute of Computational Social Science, Peking University (Qingdao), Qingdao, China
AI总结 针对强化学习中长尾响应分布导致的效率瓶颈,提出分布感知的主动轨迹塑造方法,通过细粒度识别提示内长尾并削减无效冗余,实现高达1.77倍的加速而不损失模型性能。
Comments 16 pages, 14 figures, 5 tables. Accepted to ICML 2026
GaMi: 通过跨模态减法解缠实现几何无关的材料识别
机构 * National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Northwestern Polytechnical University(西北工业大学)
AI总结 提出GaMi系统,利用毫米波和声学传感的跨模态减法解缠框架,在不受约束的几何条件下实现高精度材料识别。
Comments 17 pages, 18 figures
OpenSTBench:超越语义评估的语音翻译
机构 * MoE Key Lab of Artificial Intelligence(摩埃人工智能关键实验室) ; Jiangsu Key Lab of Language Computing(江苏语言计算重点实验室) ; X-LANCE Lab(X-LANCE实验室) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Microsoft(微软) ; University of the Chinese Academy of Sciences(中国科学院大学)
AI总结 提出OpenSTBench统一多维评估框架,联合评估语音翻译系统的翻译质量、语音质量、时间一致性等,揭示系统间跨维度差异。
Comments Submitted to EMNLP 2026
多样性至关重要:重新审视视觉-语言模型中的测试时计算
机构 * ETH Zürich(苏黎世联邦理工学院) ; Shanghai Jiao Tong University(上海交通大学) ; EPFL(苏黎世联邦理工学院)
AI总结 针对视觉-语言模型(VLM)中测试时计算(TTC)策略应用不足的问题,提出基于预测熵的ETTC方法,通过利用模型间的置信度差异提升集成性能,理论证明并实验验证其优于多数投票和最佳单模型。
Comments ICML 2026
先见后议:用视觉证据对齐多智能体共识
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Shandong University(山东大学)
AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。
CoMo3R-SLAM: 面向室外多智能体系统的协作式单目稠密SLAM与学习型3D重建先验
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Liverpool(利物浦大学) ; Harbin Engineering University(哈尔滨工程大学) ; University of Ottawa(Ottawa大学) ; Shanghai Jiao Tong University(上海交通大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 提出首个协作式单目稠密RGB SLAM系统CoMo3R-SLAM,利用学习的前馈3D重建先验实现室外多智能体地图构建,无需深度传感器即可生成全局一致的度量地图。
ELAN4D:以具身为中心的4D监督用于视觉-语言-动作模型的即插即用适配
机构 * Torr Vision Group, University of Oxford(托尔视觉组,牛津大学) ; The Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; University College London(伦敦大学学院) ; University of Cambridge(剑桥大学)
AI总结 提出ELAN4D框架,通过未来机器人关键点轨迹作为预测性时空监督,以即插即用方式增强VLA策略的鲁棒性和泛化能力。
Unicorn: 通过通用相关性建模实现高维时间序列的规模化预测
机构 * MoE Key Lab of Artificial Intelligence(人工智能大规模并行计算实验室) ; AI Institute(人工智能研究院) ; School of Computer Science(计算机科学学院) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出Unicorn框架,通过潜在原型码本解耦相关性建模与特定通道身份,实现跨异构数据集的可扩展多数据集预训练,在少样本迁移场景中显著优于现有模型。
MIRA: 基于自锚定评分标准的中期训练源感知数据选择
机构 * Beihang University(北洋大学) ; IQuest Research(IQuest研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Langboat Multilingual-Multimodal-NLP/mira(Langboat多语言-多模态-NLP/mira)
AI总结 针对中期训练中异构数据源的选择问题,提出MIRA框架,通过自锚定评分标准发现和可扩展的学生评分器,在代码中期训练中仅用一半token即可匹配全语料性能。
OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Southeast University(东南大学) ; Nanjing University(南京大学) ; Suzhou Laboratory(苏州实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。
Comments 22 Pages
Draft-OPD:用于推测草稿模型的在线策略蒸馏
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Zhejiang University(浙江大学)
AI总结 针对推测解码中草稿模型因离线训练与在线推理不匹配导致性能瓶颈的问题,提出Draft-OPD方法,通过目标辅助展开和重放验证暴露的错误位置实现在线策略蒸馏,在多种任务上实现超过5倍的无损加速。
Hyper-DP3: 面向视觉运动控制的3D扩散策略的频率感知规模调整
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 针对机器人操作中扩散策略的高计算成本问题,从频域角度分析动作轨迹的平滑性,提出轻量级3D扩散策略Hyper-DP3,使用扩散混合器解码器和两步DDIM推理,以极低参数和延迟实现最先进性能。
UniDial-EvalKit:多面对话能力评估的统一工具包
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出UniDial-EvalKit统一评估工具包,通过标准化数据格式、模块化流水线和层次化评分聚合,解决多轮交互场景下评估协议异构问题,并基于大规模实验揭示当前系统无一致最优、记忆智能体常不及全上下文基线的现象。
G-STAR: 端到端全局说话人跟踪属性识别
机构 * Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究院) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 提出G-STAR框架,通过缓存条件说话人跟踪模块与Speech-LLM转录骨干耦合,实现长时重叠多说话人语音的端到端说话人属性识别,支持组件优化和联合训练,在局部和全局评估中均表现优异。
Comments submitted to Emnlp 2026
UniMedVL: 通过观察-知识-分析统一医学多模态理解与生成
机构 * Shanghai Artificial Intelligence Laboratory ; Shanghai Innovation Institute ; Shanghai Jiao Tong University ; Shanghai Institute of Optics ; Fudan University ; University of Cambridge ; Monash University ; DAMO Academy, Alibaba Group ; Imperial College London ; The University of Hong Kong ; The Hong Kong University of Science ; Hupan Lab ; The Chinese University of Hong Kong
AI总结 提出首个统一医学模型UniMedVL,通过渐进式训练流水线融合多模态理解与生成能力,并在8种影像模态的5.6M实例数据集上验证其性能。
Comments This submission has been converted to the ICML template
超越听觉:通过生理学启发的标记化从耳机学习任务无关的ExG表示
机构 * KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Cambridge(剑桥大学) ; Shanghai Jiao Tong University(上海交通大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; UCLA(加州大学洛杉矶分校) ; Northwest University(北华大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
AI总结 提出一种基于耳机的生理学启发的多频带标记化方法(PiMT),通过无干扰的日常ExG数据采集和重建任务学习鲁棒表示,实现跨多种任务(包括五种人类感官)的通用ExG监测。
Comments Accepted to ICLR 2026
GMOS: 在3D空间和时间中定位运动物体分割
机构 * Visual Geometry Group, Department of Engineering Science, University of Oxford, UK(牛津大学工程科学系视觉几何组) ; SAI, Shanghai Jiao Tong University, China(上海交通大学SAI)
AI总结 提出GMOS框架,直接在RGB视频上实现3D感知、时间细粒度的多运动物体分割,并构建GMOS-2K数据集和MOS-I评估协议,在多个基准上取得最先进结果。
Comments Project Page: https://www.robots.ox.ac.uk/vgg/research/gmos/
LoMo: 局部模态替换以实现更深的视觉-语言融合
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 针对视觉-语言模型在模态替换时性能下降的“载体敏感性”问题,提出局部模态替换(LoMo)数据策展范式,通过将文本片段动态渲染为图像来训练跨模态表示不变性,显著提升多模态推理与融合效果。
HEART-Bench: 大语言模型智能体是否表现出类似人类的心理学?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Imperial College London(伦敦帝国理工学院) ; Quwan Group(启元集团) ; University of Washington(华盛顿大学) ; South China Normal University(华南师范大学)
AI总结 提出HEART-Bench基准,通过构建基于大五人格和自传体记忆的虚拟角色,在DIAMONDS情境框架下评估LLM智能体能否展现一致的人类心理特征。
Comments GitHub: https://github.com/peng-weihan/HEART-BENCH
测试时训练用于监督因果学习
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Microsoft(微软) ; Sony Research(索尼研究)
AI总结 针对监督因果学习在分布外泛化中的不足,提出测试时训练框架TTT-SCL,通过动态生成与测试实例对齐的训练集,显著提升因果发现性能。
并非所有输入都有效:面向开放集视频时刻检索的语言方法
机构 * Huazhong University of Science and Technology(华中科技大学) ; Peking University(北京大学) ; Zhejiang Gongshang University(浙江工商大学) ; Dalian University of Technology(大连理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Xinjiang University(新疆大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 针对开放集场景下视频时刻检索任务中无关查询导致错误检索的问题,提出基于归一化流的开放集视频时刻检索模型OpenVMR,实现分布内查询的精确检索与分布外查询的拒绝。
Comments Published in ACM MM 2024
Domino: 在推测解码中将因果建模与自回归草稿解耦
机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; School of Software Engineering, HUST(华中科技大学软件学院) ; UESTC ; Fudan University(复旦大学) ; Huawei(华为公司)
AI总结 提出Domino框架,通过并行草稿骨干和轻量级Domino头解耦因果依赖建模与自回归草稿执行,结合基础锚定训练课程,在Qwen3模型上实现高达5.49倍端到端加速和5.8倍吞吐量加速。
LabBuilder: 基于协议的可交互且安全的3D实验室布局生成
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Wuhan University(武汉大学) ; Beihang University(北航) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Shanghai Jiaotong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出LabBuilder系统,通过协议引导和约束感知优化,从文本描述生成安全且可执行的3D实验室布局,显著优于现有方法。
Comments Accepted to ICML 2026
评估数据集水印用于定制扩散模型微调可追溯性:一个综合基准与移除方法
机构 * Donghua University(东华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Xidian University(西安电子科技大学) ; Hefei University of Technology(合肥工业大学) ; East China Normal University(华东师范大学)
AI总结 针对扩散模型微调中的版权与安全风险,本文建立统一威胁模型并提出包含普适性、可传递性和鲁棒性的评估框架,揭示现有数据集水印方法的脆弱性,并进一步提出一种实用的水印移除方法。
基于扩散的约束非凸优化学习框架与加权自举细化
机构 * ShanghaiTech University(上海科技大学) ; MoE Key Laboratory of Intelligent Perception(智能感知MoE重点实验室) ; Human Machine Collaboration(人机协同) ; Shanghai Jiao Tong University(上海交通大学) ; China Mobile Communications Company Limited Research Institute(中国移动通信公司有限研究院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 提出DiOpt框架,通过监督预热和自举训练两阶段学习噪声到约束区域的映射,解决扩散模型在约束非凸优化中的分布错位问题,实现高约束满足和最优性。
Comments accepted by ICML2026