Morphing into Hybrid Attention Models
变形为混合注意力模型
机构 * Fudan University(复旦大学) ; ByteDance Seed(字节跳动种子) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出FlashMorph方法,将层选择建模为预算约束子集优化问题,通过可变形模型和门控学习高效选择全注意力层,实现Transformer到混合注意力的转换,在保持性能的同时降低选择成本。
高校专区
变形为混合注意力模型
机构 * Fudan University(复旦大学) ; ByteDance Seed(字节跳动种子) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出FlashMorph方法,将层选择建模为预算约束子集优化问题,通过可变形模型和门控学习高效选择全注意力层,实现Transformer到混合注意力的转换,在保持性能的同时降低选择成本。
揭示消费者信心中的显著性驱动动态:基于生成式社会模拟
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出ConsumerSim框架,通过微观数据校准的合成人口、宏观经济信号和调查响应生成,重建消费者信心指数,在美欧日数据上优于基线模型,并揭示信心变化集中于显著性事件,且不同群体敏感性各异。
BayesEvolve:自主科学发现的显式信念状态
机构 * Pfizer(辉瑞公司) ; Independent Researcher(独立研究员) ; University of California San Diego(加州大学圣地亚哥分校) ; Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究院)
AI总结 提出BayesEvolve框架,通过显式不确定性感知信念状态指导实验,在BBOB黑箱优化任务上比记忆引导基线更高效。
Comments 7 pages, 2 diagrams
ActiveVital:面向家庭医疗保健机器人的几何感知体感生命体征监测
机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡) ; Fudan University, Shanghai, China(复旦大学,上海,中国)
AI总结 提出ActiveVital框架,通过视觉引导机器人主动调整毫米波雷达与胸腔的几何对齐,将生命体征监测从被动信号恢复转为主动几何调控,显著降低呼吸和心率误差。
潜在噪声掩码:减少多模态大语言模型中的视觉冗余
机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI)) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学)
AI总结 提出Lens框架,通过轻量级LET令牌为视觉令牌评分,并注入自适应噪声抑制低相关令牌,在不改变模型结构的情况下提升多模态推理性能。
Comments 21 pages, 7 figures;
参数化技能
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; KTH Royal Institute of Technology(皇家理工学院) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出ParametricSkills框架,将文本技能在测试时转换为LoRA参数,解决长上下文下技能指令难以遵循的问题,在软件工程任务中平均提升6.44分。
Comments Preprint, Under Review
分析性概念中心记忆用于具身操作代理
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Westlake University(西湖大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出分析性概念中心记忆框架,通过结构化概念(语义部件、参数模板等)组织经验,支持粗到细检索,提升长时程具身操作中的物体重识别、状态推理和技能复用。
GLIP:面向图级任务的图与大型语言模型联合预训练
机构 * Fudan University(复旦大学) ; ByteDance(字节跳动)
AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。
从动作到世界建模的可迁移动力学先验学习
机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ; Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) ; McGill University, Montreal, QC, Canada(麦吉尔大学,蒙特利尔,魁北克,加拿大)
AI总结 提出A2World模型,通过大规模机器人操作数据预训练动作条件世界模型,学习可迁移的交互动力学先验,支持模拟器评估和策略学习。
Comments ECCV 2026 Accepted
PCGD:面向TCAD器件仿真的物理引导条件图扩散
机构 * College of Integrated Circuits & Micro-Nano Electronics, Fudan University(集成电路与微纳电子学院,复旦大学) ; Shanghai Integrated Circuit Manufacturing Innovation Center(上海集成电路制造创新中心)
AI总结 提出PCGD框架,在非结构化TCAD网格上通过条件图扩散预测耦合静电场和载流子密度,结合物理引导混合目标迭代施加约束,实现亚百分误差并大幅降低PDE残差。
随机梯度广义非可逆朗之万蒙特卡洛算法的方差缩减
机构 * FinTech Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)金融科技方向) ; School of Mathematical Science, Fudan University(复旦大学数学学院) ; Department of Mathematics, Florida State University(佛罗里达州立大学数学系)
AI总结 研究随机梯度欧拉-丸山估计器在广义非可逆朗之万动力学中的前导阶波动,证明在消失步长下中心极限定理,并给出非对称扰动严格降低波动常数的充分条件。
Comments 49 pages, 12 figures
SemFlowRAG:从抽象到证据的有向语义流用于复杂推理
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学)
AI总结 提出SemFlowRAG框架,通过构建语料自适应的语义梯度图,将平面检索空间重构为层次结构,并设计抽象度引导的有向PageRank算法,使检索轨迹遵循“高到低语义抽象度”梯度,从而缓解“概率黑洞”问题,提升复杂多跳推理性能。
Lumos-Nexus: 面向视频统一模型的高效频率桥接与同质潜在空间
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(虎扑实验室) ; National University of Singapore(新加坡国立大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 提出Lumos-Nexus框架,通过两阶段训练和渐进频率桥接,在保持推理能力的同时显著提升视频生成保真度。
Comments ECCV 2026 Camera-Ready Version. Project page (https://jiazheng-xing.github.io/nexus-lumos-home/) and Code (https://github.com/alibaba-damo-academy/Lumos-Custom/) are available
VIGIL:基于部分的结构化推理用于通用深度伪造检测
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)
AI总结 VIGIL通过计划-检验流程,结合部分级证据和结构化推理,提升深度伪造检测的可解释性和泛化能力。
Comments Project Page: https://vigil.best
从工具调用角度审视代码代理的红队测试:一项经验性安全评估
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学)
AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。
LaGen:迈向自主驾驶的自回归激光雷达场景生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
AI总结 本文提出LaGen,首个支持长时交互生成的自回归框架,能基于单帧输入生成高保真4D激光雷达场景,并通过场景解耦和噪声调节模块提升生成质量。
Comments Accepted to ECCV 2026
用十亿个智能体建模地球尺度的人类社会
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Shenzhen University(深圳大学) ; Shanghai University of Finance and Economics(上海财经大学) ; Tsinghua University(清华大学) ; Fudan University(复旦大学)
AI总结 本文提出Light Society框架,通过结合大语言模型与优化算法,实现高效模拟十亿级智能体的社会现象,验证了其在信任游戏和意见扩散中的高保真度与效率。
Comments Work in progress
领导者奖励用于基于POMO的神经组合优化
机构 * Fudan University(复旦大学)
AI总结 本文提出领导者奖励方法,通过在POMO模型的两个训练阶段应用,提升模型生成最优解的能力,尤其在TSP100上显著缩小了与最优解的差距。