GenTS: A Comprehensive Benchmark Library for Generative Time Series Models
GenTS:生成时间序列模型的综合基准库
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学)
AI总结 本文提出GenTS,一个用于系统评估生成时间序列模型的综合且可扩展的基准库,通过统一的数据预处理流程、多样化的模型集合和全景评估指标,为生成模型提供了更灵活的评估框架。
高校专区
GenTS:生成时间序列模型的综合基准库
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学)
AI总结 本文提出GenTS,一个用于系统评估生成时间序列模型的综合且可扩展的基准库,通过统一的数据预处理流程、多样化的模型集合和全景评估指标,为生成模型提供了更灵活的评估框架。
RoadmapBench: 评估跨版本升级的长期代理软件开发
机构 * UniPat AI ; Peking University(北京大学) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; G Labs(0G实验室) ; Pipeline Lab(Pipeline实验室)
AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。
Comments 30 pages, 15 figures
$π$-Bench:评估长周期工作流中主动型个人助理代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Nanjing University(南京大学) ; Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Soochow University(苏州大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出$π$-Bench基准,用于评估个人助理代理在长周期工作流中的主动协助能力,通过100个多轮任务和5种特定领域用户角色,验证代理在未明确表达意图前识别和执行隐藏意图的能力,揭示主动协助的挑战及前期交互对后续任务的重要性。
Comments 44 pages
DLEBench: 评估基于指令的图像编辑模型在小规模物体编辑能力
机构 * College of Computer Science(计算机科学学院) ; Artificial Intelligence(人工智能) ; Fudan University(复旦大学)
AI总结 本文提出DLEBench,首个专门评估基于指令的图像编辑模型在小规模物体编辑能力的基准,通过1889个样本覆盖复杂场景,揭示了现有模型在小物体编辑上的性能差距,强调了专用基准的重要性。
Fast-BEV++: 通过算法加速,通过设计部署
机构 * iMotion Automotive Technology (Suzhou) Co., Ltd(iMotion汽车技术(苏州)有限公司) ; School of Data Science, Fudan University(复旦大学数据科学学院)
AI总结 本文提出Fast-BEV++,通过算法加速和设计部署两个原则,解决自动驾驶中低成本鸟眼视图感知在精度与部署效率之间的矛盾,实现了3倍速度提升并在nuScenes基准上取得0.488 NDS的新状态-of-the-art结果,同时在134 FPS以上实现实时推理。
Comments most up-to-date version
DarkLLM: 利用大语言模型学习语言驱动的对抗攻击
机构 * Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学) ; Tongji University(同济大学)
AI总结 本文提出DarkLLM,一种基于大语言模型的对抗攻击框架,通过将自然语言攻击指令转换为潜在攻击向量,生成有效的对抗扰动,统一了多种攻击类型并实现了灵活可控的对抗生成。
Comments 23 pages, 13 figures
代理 harness 工程:基于可观测性的自动进化编码代理 harness
机构 * Fudan University(复旦大学) ; Peking University(北京大学) ; Shanghai Qiji Zhifeng Co., Ltd(上海启智锋科技有限公司)
AI总结 本文提出了一种基于可观测性的代理 harness 工程方法,通过三个支柱解决 harness 工程中的挑战,使 harness 进化过程自动且可控,实验表明其在多个基准测试中表现优异。
PersonaDual: 通过自适应推理平衡个性化与客观性
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; OPPO
AI总结 本文提出PersonaDual框架,通过自适应切换模式,在单一模型中实现通用客观推理与个性化推理的平衡,减少干扰并提升客观问题解决能力。
SIPO: 用于对齐扩散模型的人类偏好优化的稳定与改进方法
机构 * Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所) ; Fudan University, Shanghai, China(复旦大学) ; Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
AI总结 本研究提出SIPO框架,通过时间步感知的重要性重新加权和梯度稳定技术,解决扩散模型对齐中训练不稳定和策略偏差问题,提升了对齐效果和稳定性。
Comments This version supplements with more detailed content on reasoning and proof, additional experimental results, and ablation studies
DriveMoE:面向端到端自动驾驶的视觉-语言-动作混合专家模型
机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机科学学院与人工智能学院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) ; AnyScale AI Project(AnyScale AI项目)
AI总结 本文提出DriveMoE,一种基于混合专家架构的端到端自动驾驶框架,通过场景专用的视觉混合专家和技能专用的动作混合专家,实现了对复杂驾驶场景的有效处理,展示了在自动驾驶任务中结合视觉和动作混合专家的有效性。
Comments Accepted by CVPR 2026, Project Page: https://thinklab-sjtu.github.io/DriveMoE/
TaskGround:全场景家庭推理的结构化可执行任务推断
机构 * Tsinghua University(清华大学) ; Microsoft Research Asia(微软亚洲研究院) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学)
AI总结 本文提出TaskGround框架,通过结构化任务推断提升全场景家庭推理能力,其核心贡献是引入FullHome评估套件,验证了在家庭场景中执行任务结构推断的重要性,并展示了紧凑本地模型在实际家庭部署中的有效性。
Comments Project page: https://aaronfengzy.github.io/TaskGround/
FLAG: 通过图结构的潜在扩散对齐实现基础模型表示以空间基因表达预测
机构 * Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院) ; School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China.(上海交通大学生物医学工程学院) ; Incubation Institute, Fudan University, Shanghai, China.(复旦大学孵化院)
AI总结 本文提出FLAG框架,通过图结构的潜在扩散对齐方法,解决空间基因表达预测中的基因协调和空间分布关系问题,并引入基因维度诅咒的概念,通过空间图编码器和基因基础模型对齐来提升模型的结构一致性与基因间保真度。
Comments 9 pages for main text, 3 pages for references, 19 pages for appendix. accepted by ICML 2026
通过路径测度的序列蒙特卡洛实现扩散模型的简单近似与无导数推理时间缩放
机构 * School of Mathematical Sciences, Peking University, Beijing, China ; School of Mathematical Sciences, Fudan University, Shanghai, China ; Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States ; Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States ; Management Science \& Engineering, Stanford University, Stanford, CA, United States
AI总结 本文提出URGE算法,一种无需梯度的推理时间缩放方法,通过路径重要性重加权提升扩散模型样本质量,同时在合成测试和扩散模型基准中表现出色,且实现简单且无梯度依赖。
Comments accepted by ICML 2026
从分布视角看视觉机制可解释性:KL最小软约束原理
机构 * School of Mathematics and Statistics(数学与统计学学院) ; Ministry of Education Key Lab of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
AI总结 本文提出了一种基于分布的视觉机制可解释性方法,通过KL最小化优化问题来平衡可解释性和模型忠实性,利用能量引导的扩散后验采样实现,并在DINOv3模型上验证了其有效性。
LLM代理市场中的战略利用:电子商务信任的模拟框架
机构 * Northwestern Polytechnical University(西北工业大学) ; Boston University(波士顿大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学) ; Chinese Academy of Sciences(中国科学院) ; University of Oxford(牛津大学)
AI总结 本文提出TruthMarketTwin模拟框架,用于研究LLM代理在电子商务市场中的行为,发现LLM代理在传统市场中会利用声誉治理的弱点,而强制执行可减少欺骗并重塑战略推理。
MorphSeek: 用于可变形图像配准的细粒度潜在表示级策略优化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Sun Yat-sen University(中山大学) ; Fudan University(复旦大学) ; Hebei Medical University(河北医科大学)
AI总结 本文提出MorphSeek,一种在潜在特征空间中进行细粒度策略优化的方法,用于解决可变形图像配准中的高维变形空间和体素级监督稀缺问题,通过引入随机高斯策略头和组相对策略优化,实现了高效探索和粗到细的优化,提升了配准的Dice系数和标签效率。
Comments 20 pages
代码的缩放规律:一个更数据渴求的阶段
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Chinese Academy of Sciences(中国科学院) ; Fudan University(复旦大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 本文研究了代码的缩放规律,通过大规模实验发现Farseer定律在准确性上更优,代码模型在模型大小上表现良好,但需要更高的数据与参数比,且在代码-自然语言混合数据中,自然语言在资源受限场景下有益,但在更高计算预算下成为负担。
Comments Accepted by ACL2026
GraphMAR: 一种基于几何的图学习框架用于空间自适应的CT金属伪影减少
机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) ; Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(脑启发式智能科学技术研究院,复旦大学) ; College of Computer Science and Technology, Qingdao University(计算机科学与技术学院,青岛大学) ; Department of Oral Maxillofacial Head and Neck Oncology, Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(口腔颌面头颈肿瘤科,上海第九人民医院,上海交通大学医学院) ; School of Cyber Science and Engineering, Sichuan University(网络科学与工程学院,四川大学)
AI总结 本文提出GraphMAR,一种基于几何的图学习框架,用于在图像域中实现空间自适应的CT金属伪影减少,通过引入图基的几何建模来显式识别伪影并提高恢复质量和可解释性。
基于触觉的多模态融合在具身智能中的应用:视觉、语言和接触驱动范式的综述
机构 * School of Electronic Science and Engineering, Xi’an Jiaotong University, China(西安交通大学电子科学与技术学院) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; Purple Mountain Laboratory, China(紫金山实验室) ; Institute for Math & AI, Wuhan University, China(武汉大学数学与人工智能学院) ; Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University, Australia(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) ; Institute of Big Data, Fudan University, China(复旦大学大数据研究院) ; Linkerbot (Beijing) Technology Co., Ltd, China(北京链动科技有限公司) ; School of Engineering, Swinburne University of Technology, Melbourne(斯威本技术大学工程学院)
AI总结 本文综述了多模态触觉融合在具身智能中的研究,探讨了如何通过整合视觉、语言和触觉信息来提升物理交互与语义推理的结合,提出了一种分层的分类体系,并总结了当前的研究挑战和未来方向。
Comments 20 pages, 8 figures
CAM-Bench: 一个用于Lean中的计算与应用数学的基准测试
机构 * Fudan University(复旦大学) ; Qingdao University(青岛大学) ; Peking University(北京大学) ; Huawei Technologies Ltd.(华为技术有限公司)
AI总结 本文提出CAM-Bench,一个包含1000个Lean证明目标的基准测试,涵盖优化、数值线性代数和数值分析等领域,旨在补充现有形式化数学基准测试,通过针对依赖教科书概念和基本定理的应用数学问题进行评估。
Comments Preprint. 44 pages, 7 figures
基于位置感知的多项逻辑带宽学习:从乘法位置效应到一般位置效应
机构 * Leonard N. Stern School of Business, New York University(纽约大学勒纳商学院) ; Qiuzhen College, Tsinghua University(清华大学齐臻学院) ; Department of Management Science, School of Management, Fudan University(复旦大学管理学院管理科学系) ; Yau Mathematical Sciences Center & Department of Mathematical Sciences, Tsinghua University(清华大学尤数学科学中心及数学科学系)
AI总结 本文研究了动态联合品类选择与排列问题,其中每个产品的吸引力取决于其内在吸引力和显示位置,在多项逻辑(MNL)选择框架下。研究从乘法位置效应模型扩展到一般位置效应模型,为两种模型设计了基于轮次的学习算法,并建立了首个最优后悔分析。此外,这些基于轮次的算法为现代平台提供了必要的实时操作。对于乘法模型,开发了具有截断机制的交叉位置成对最大似然估计器,并证明算法P2MLE-UCB达到$ ilde{O}(\sqrt{NT})$的后悔,匹配下限并弥补了先前基于周期的分析留下的$\sqrt{K}$差距。对于一般模型,建立了最小最大下界并提出了GP2-UCB算法,具有匹配的上界。此外,设计了基于Dinkelbach方法和最大权二分图匹配的高效子程序,用于每轮联合品类和排列优化。在合成数据和Expedia数据集上的数值实验表明,我们的算法在性能上始终优于最先进的基准。
ChemVA:推动大型语言模型在化学反应图示理解上的进步
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科学与技术创新中心) ; Department of Chemistry, Fudan University(复旦大学化学系)
AI总结 本文针对现有系统在理解化学反应图示时存在的视觉缺陷和语义断开问题,提出ChemVA框架,通过视觉锚机制和语义对齐方法提升大型语言模型在化学推理中的性能。
EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准
机构 * X-Humanoid ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Manchester(曼彻斯特大学) ; Monash University(墨尔本大学) ; Celonis AI ; University of New South Wales(新南威尔士大学)
AI总结 本文提出 EPIC-Bench,一种以感知为中心的细粒度具身视觉 grounding 基准,旨在系统评估 VLMs 在现实世界具身环境中的视觉感知能力。该基准包含 6.6k 个精心标注的元组(图像,文本,掩码),涵盖 23 个细粒度任务,涉及具身交互管道的三个核心阶段:目标定位、导航和操作。评估结果显示,尽管先进推理模型表现出潜力,但当前 VLMs 在复杂视觉-文本对齐方面普遍存在困难,特别是在多目标计数、部分-整体关系理解和 affordance 区域检测方面存在瓶颈。
阿尔法幻觉:LLM交易代理报告的阿尔法不应被视为部署证据
机构 * Fudan University(复旦大学) ; Shanghai University of Finance and Economics(上海财经大学) ; Southwest University of Finance and Economics(西南财经大学) ; Northeastern University(东北大学) ; Imperial College London(伦敦帝国理工学院) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 本文指出,LLM交易代理报告的阿尔法不应被当作部署的证据,因为这些阿尔法需要通过结构有效性测试来验证其时间完整性、现实摩擦、反事实稳健性、预测校准、数值执行和多代理分解等关键指标,当前的公开证据无法区分稳健的预测能力与时间污染、未建模的摩擦、短窗口夏普不确定性、叙事拟合和参数先验等因素。
前缀自适应块扩散用于高效的文档识别
机构 * Computation and Artificial Intelligence Innovative College, Fudan University, Shanghai, China(复旦大学计算与人工智能创新学院,上海,中国) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ; ByteDance, Shanghai, China(字节跳动,上海,中国)
AI总结 本文提出前缀自适应块扩散模型(PA-BDM),通过改进块内去噪和缓存机制,提升文档识别的效率和准确性。
Comments 17pages,6 figures
DARC:通过风险约束解码实现的分歧意识对齐
机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) ; Independent Researcher(独立研究者) ; Meta AI ; Incubation Institute, Fudan University, Shanghai, China(创新与孵化院,复旦大学,上海,中国)
AI总结 DARC通过风险约束解码方法,在不重新训练的情况下,通过最大化KL-鲁棒满意度目标来缓解分歧和尾部风险,保持高质量输出。
EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Fudan University(复旦大学) ; Central South University(中南大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。
Comments Accepted by ICML 2026
专家混合模型可在严格相等资源下超越密集语言模型
机构 * Fudan University(复旦大学) ; StepFun ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学)
AI总结 本文研究在资源相等条件下MoE模型是否能超越密集模型,提出优化框架并验证了在最优激活率下MoE模型性能更优,且该区域在不同模型规模下一致,通过数据重用解决数据量增加的权衡问题。
Comments Published as a conference paper at ICLR 2026
医疗领域鲁棒多模态表征学习
机构 * University of California, Davis(加州大学戴维斯分校) ; HKUST (GZ)(香港科技大学) ; University of Rochester(罗切斯特大学) ; Tongji University(同济大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Fudan University(复旦大学) ; The University of British Columbia(不列颠哥伦比亚大学)
AI总结 本文提出双流特征去相关框架,通过结构因果分析处理医疗多模态数据中的系统性偏差,提升模型泛化能力,实验验证在MIMIC-IV、eICU和ADNI数据集上的性能提升。
链式窥视:面向视频理解的搜索引导渐进性对象基础推理
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China.(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) ; Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China.(大数据研究院,复旦大学计算机科学与人工智能学院,中国) ; ARC Lab, Tencent PCG, Shenzhen, China.(腾讯PCG深圳实验室,深圳,中国) ; School of Artificial Intelligence, Beijing University of Technology, Beijing, China.(北京理工大学人工智能学院,北京,中国)
AI总结 本文提出Chain-of-Glimpse框架,通过搜索引导的渐进推理解决视频中对象变化问题,提升多步骤决策的准确性和可解释性。