GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling
GroundShot: 通过实体锚定镜头调度实现视觉一致的多镜头长视频生成
机构 * Fudan University(复旦大学) ; Baidu(百度)
AI总结 提出GroundShot框架,通过在线构建实体级视觉记忆并调度镜头生成顺序,无需训练即可提升多镜头视频中实体的一致性。
高校专区
GroundShot: 通过实体锚定镜头调度实现视觉一致的多镜头长视频生成
机构 * Fudan University(复旦大学) ; Baidu(百度)
AI总结 提出GroundShot框架,通过在线构建实体级视觉记忆并调度镜头生成顺序,无需训练即可提升多镜头视频中实体的一致性。
超越表面判断:LLM生成虚假信息的人类基础风险评估
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) ; City University of Hong Kong(香港城市大学) ; Deakin University(迪肯大学)
AI总结 本文研究LLM生成虚假信息的风险评估,发现LLM法官在整体评分、项目排序和信号依赖上与人类存在显著差异,且法官间一致性高于人类读者,表明内部一致性不能作为读者反应代理的有效证据。
Comments 9 pages, 1 figure. Substantially revised and reorganized version of arXiv:2604.06820 based on the same study and data; adds stricter participant filtering, held-out prediction analyses, and additional robustness checks
SoMA:一种用于机器人软体操作的实-仿真神经模拟器
机构 * Fudan University, China(复旦大学) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) ; Shanghai Jiao Tong University, China(上海交通大学) ; The Chinese University of Hong Kong, China(香港中文大学) ; The University of Hong Kong, China(香港大学)
AI总结 SoMA是一种用于机器人软体操作的实-仿真神经模拟器,通过统一的潜在神经空间实现可控、稳定的长周期操作和泛化能力。
Comments Project page: https://city-super.github.io/SoMA/
DSBench:用于评估外部和车内风险的综合基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Xiaomi EV(小米电动车) ; Fudan University(复旦大学) ; Xidian University(西安电子科技大学) ; South China University of Technology(华南理工大学) ; The University of Hong Kong(香港大学)
AI总结 针对视觉语言模型在安全关键场景适用性未充分探索的问题,引入DSBench综合基准测试,涵盖外部与车内风险,分多类别。评估发现模型在复杂情况下降,构建数据集微调可提升性能,推动自动驾驶技术发展,相关资源将公开。
通过多模态持续预训练增强视觉基础模型
机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Baosight Software Co., Ltd.(上海博视软件有限公司)
AI总结 研究通过多模态持续预训练增强视觉基础模型,提出M-CPT框架,用持续位置嵌入处理不同分辨率视觉输入,通过特征对齐目标提升视觉与文本表示一致性,实验证明该框架能提升多模态理解性能并保持标准视觉任务表现。
Comments Code is available in https://github.com/ShareLab-SII/CoMP-MM
BrainPilot:通过智能研究实现大脑发现自动化
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Shanghai Qizhi Institute(上海期智研究院) ; Business School, Renmin University of China(中国人民大学商学院) ; School of Physics, Beihang University(北京航空航天大学物理学院) ; School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) ; Behavioral and Cognitive Neuroscience Center, Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院行为与认知神经科学中心) ; College of Engineering, Georgia Institute of Technology(佐治亚理工学院工程学院) ; School of Life Sciences & IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学生命科学学院&清华-IDG/麦戈文脑科学研究院) ; School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) ; Weixian College, Tsinghua University(清华大学未央学院) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)
AI总结 研究针对脑科学研究整合证据难、人工智能代理有缺陷的问题,提出完全开源的多智能体系统BrainPilot,它有可追溯日志和验证结果,含知识库与技能库,经实验评估,其开源模型以低成本达先进框架性能。
因子化神经算子分解动态与持久响应
机构 * School of Medicine, University of Dundee(邓迪大学医学院) ; School of Data Science, Fudan University(复旦大学数据科学学院) ; School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) ; Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) ; School of Science and Engineering, University of Dundee(邓迪大学科学与工程学院) ; Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系)
AI总结 提出因子化神经算子(FaNO),通过分解谱表示为等变动态响应和不变持久响应,提升多尺度物理系统的预测精度、参数效率和跨尺度泛化能力。
MR-GVNO:一种面向不规则域上Mindlin-Reissner板的几何感知变分物理信息神经算子
机构 * Institute of Computational Mechanics × AI & College of Intelligent Robotics and Advanced Manufacturing, Fudan University(计算力学与人工智能学院及智能机器人与先进制造学院,复旦大学) ; School of Aerospace Engineering, Xiamen University(航空航天工程学院,厦门大学) ; Department of Engineering Mechanics, Tsinghua University(工程力学系,清华大学) ; Institute of Photonics, Department of Mathematics and Physics, Leibniz University(光子研究所,数学与物理系,莱比锡大学) ; Institute of Structural Mechanics, Bauhaus-Universität Weimar(结构力学研究所,魏玛 Bauhaus-Universität)
AI总结 提出MR-GVNO,一种几何感知变分神经算子,通过边界点云表示不规则几何,利用交叉注意力机制融合多物理场输入,基于离散总势能的变分物理信息损失无监督训练,实现对Mindlin-Reissner板问题的快速准确预测。
Towards Consistent Video Geometry Estimation
机构 * Zhejiang University(浙江大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
AI总结 提出ViGeo,一种基于纯Transformer架构的前馈基础模型,通过动态分块注意力机制和基于补全的数据精炼框架,实现视频序列中空间密集且时间一致的几何(深度、法线、点图)估计,在在线、离线及长视频任务中达到最先进性能。
Comments Project webpage: https://pkqbajng.github.io/ViGeo/
DINO-SLAM:用于神经隐式和显式表示的基于DINO的RGB-D SLAM
机构 * University of Bologna, Italy(博洛尼亚大学) ; Faculty of Dentistry, The University of Hong Kong, China(香港大学牙科学院) ; Rawmantic AI, China(Rawmantic AI) ; Fudan University, Shanghai, China(复旦大学)
AI总结 研究提出DINO-SLAM,通过DINO增强SLAM系统隐式与显式表示。利用场景几何编码器将DINO特征变为几何感知特征,在此基础上为NeRF和GS SLAM系统提出两种范式,相比现有方法在多个数据集上性能更优。
可解释且可验证的硬件生成:基于LLM驱动的逐步细化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Fudan University(复旦大学) ; USA(美国)
AI总结 提出结合LLM创造力与形式化方法可解释性的硬件生成框架,通过迭代应用变换规则将设计规范转换为正确性有保证的RTL程序。
SANTS:面向世界动作模型的状态自适应调度器
机构 * Fudan University(复旦大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)
AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。
Comments 17 pages, 5 figures, 8 tables. Project page: https://advanced-robotics-lab.github.io/SANTS/
通过厄米特块克里洛夫子空间实现有向图的规范不变可学习谱位置编码
机构 * Fudan University(复旦大学)
AI总结 研究有向图谱位置编码面临的障碍,提出可学习谱PEs形式\(h_\theta(A_q)\,R\),通过厄米特块克里洛夫子空间计算,证明其规范不变性及相关性质,在有向SBM等实验中展现优势,优于无PE和多项式基线。
Comments 8 pages main, theorem and type fixed
场景图思维:增强多模态大语言模型的结构化视觉推理
机构 * Fudan University(复旦大学)
AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。
Comments ICML 2026
FARS:一个大规模部署的全自动研究系统
机构 * Analemma ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; University College Dublin(都柏林大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; ByteDance(字节跳动) ; ShanghaiTech University(上海科技大学) ; University of Warwick(华威大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; Tencent(腾讯) ; The University of Hong Kong(香港大学) ; Shanghai Innovation Institute(上海创新研究院) ; Nex-AGI Team(Nex-AGI团队)
AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。
让它简单:视觉-语言-动作模型的单步动作生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。
Comments 13 pages, 10 figures
BARD:通过高效渐进性块合并和分阶段蒸馏桥接自回归与扩散视觉-语言模型
机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Nanjing University(南京大学)
AI总结 BARD通过高效渐进块合并与分阶段蒸馏将预训练自回归视觉-语言模型转换为解码高效的扩散视觉-语言模型,实现在大块规模下性能恢复与解码效率提升。
UniRec-0.1B:具有1亿参数的统一文本和公式识别
机构 * Fudan University(复旦大学)
AI总结 研究旨在实现文本和公式的统一识别,提出含1亿参数的UniRec-0.1B模型。通过构建大规模数据集,应对层次结构变异性和语义纠缠等挑战,引入分层监督训练和语义解耦分词器。实验证明该模型优于同类,且速度大幅提升,有效且高效。
Comments Accepted by ECCV 2026
测量诱导纠缠的数据驱动可学习性转变
机构 * State Key Laboratory of Surface Physics(表面物理国家重点实验室) ; Department of Physics, Fudan University, Shanghai 200433, China(复旦大学物理系) ; Shanghai Research Center for Quantum Sciences, Shanghai 201315, China(上海量子科学研究中心) ; Institute for Nanoelectronic Devices(纳米电子器件研究所) ; Quantum Computing, Fudan University, Shanghai 200433, China(量子计算,复旦大学) ; Hefei National Laboratory, Hefei 230088, China(合肥国家实验室)
AI总结 研究测量诱导纠缠(MIE)的可学习性,将其检测重构为数据驱动学习问题,用测量记录自监督训练神经网络预测MIE不确定性度量,发现随机电路中随深度增加的可学习性转变及与经典模拟崩溃的关系,划定经典可学习性限制。
Comments 7+13 pages, 4+12 figures
利用大语言模型预测金属有机框架合成的可扩展性
机构 * Department of Chemistry, Washington University(华盛顿大学化学系) ; Fudan University(复旦大学) ; Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) ; College of Chemistry and Materials Science, Fujian Normal University(福建师范大学化学与材料科学学院) ; Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程学院)
AI总结 本文提出ESU-MOF数据集和正例未标记学习策略,通过大语言模型预测MOF合成的可扩展性,准确率达91.4%,助力工业级MOF发现。
XOV-Action:迈向可泛化的开放词汇动作识别
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Institute of Big Data, Fudan University(复旦大学大数据研究院) ; AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。
Comments Accepted by TPAMI
HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型
机构 * Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Xi’an Jiaotong University(西安交通大学) ; Tsinghua University(清华大学)
AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。
基于轨迹评分器的零人类示范端到端自动驾驶
机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) ; Fudan University(复旦大学) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) ; NVIDIA ; University of Michigan(密歇根大学) ; East China Normal University(华东师范大学)
AI总结 研究提出ZTRS,一种基于强化学习的端到端自动驾驶规划范式,仅依靠真实世界图像和规则奖励训练,无需人类示范。通过详尽策略优化,能更好推广到长尾驾驶场景,在相关数据集上展现出优于模仿学习方法的性能。
面向通用视觉-语言-动作策略的通用姿态预训练
机构 * Tencent Robotics X(腾讯机器人X) ; Futian Laboratory(福田实验室) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。
Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA
Journal ref Robotics: Science and Systems, 2026
对百万智能体系统涌现的归因
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Tongji University(同济大学)
AI总结 本文提出一种归因方法,用于在百万级智能体系统中归因宏观现象,该方法在速度和理论基础上均优于现有方法,并证明了全规模归因对非线性宏观指标的必要性。
$M^2$-VLA:通过层混合与元技能提升视觉语言模型的通用操控能力
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(智能机器人与先进制造学院,复旦大学,上海,中国) ; Synapath
AI总结 本文提出$M^2$-VLA,通过层混合和元技能模块提升视觉语言模型在机器人操控中的泛化能力,实验验证了其在模拟和现实环境中的有效性。
Web-CogReasoner:迈向用于网络智能体的多模态知识诱导认知推理
机构 * Southwestern University of Finance and Economics(西南财经大学) ; Shanghai Jiao Tong University(上海交通大学) ; Central South University(中南大学) ; Hithink Research(Hithink研究) ; Westlake University(西湖大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; University of Manchester(曼彻斯特大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Adelaide(阿德莱德大学) ; Fudan University(复旦大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Chengdu Everimaging Science and Technology Co., Ltd(成都亿联科技有限公司)
AI总结 研究将网络智能体能力分解为知识内容学习和认知过程两阶段,提出框架分类知识,构建数据集,基于此用新推理框架开发训练智能体,实验显示其优势,还引入评估套件。
Comments Accepted to ICLR 2026. Our code and data is released at https://github.com/Gnonymous/Web-CogReasoner
TaoSR-AGRL:用于电子商务搜索相关性的自适应引导强化学习框架
机构 * Tsinghua University(清华大学) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Fudan University(复旦大学)
AI总结 电商搜索中查询-产品相关性预测很关键,现有方法有局限。提出TaoSR-AGRL框架,通过规则感知奖励塑造和自适应引导重放两大创新,提升模型推理能力,在实验中表现优于基线,已成功部署。
Comments Accepted to The Web Conference (WWW) 2026, Industry Track, Oral
Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), 2026, pp. 7955-7966
迈向高效智能体:记忆、工具学习与规划
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiaotong University(上海交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Hong Kong Polytechnic University(香港理工大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
AI总结 研究将大语言模型扩展到智能体系统中的效率问题,从记忆、工具学习和规划三个核心组件考虑成本,回顾多种方法并详细讨论,以两种方式刻画效率,还探讨关键挑战与未来方向。
Comments 63 pages, 244 references
TexTailor:用于多模态扩散变压器的推理时文本引导剪裁
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Academy of AI for Science(上海人工智能科学研究院)
AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。
Comments To appear in ECCV 2026