P-Flow: Proxy-gradient Flows for Linear Inverse Problems
P-Flow:用于线性逆问题的代理梯度流
机构 * Zhejiang University(浙江大学) ; University of Notre Dame(诺丁汉大学)
AI总结 P-Flow通过代理梯度更新源点,稳定逆问题重建过程,避免长链微分的数值不稳定性与计算开销,结合高维空间测度集中现象,提供理论分析和实验验证。
高校专区
P-Flow:用于线性逆问题的代理梯度流
机构 * Zhejiang University(浙江大学) ; University of Notre Dame(诺丁汉大学)
AI总结 P-Flow通过代理梯度更新源点,稳定逆问题重建过程,避免长链微分的数值不稳定性与计算开销,结合高维空间测度集中现象,提供理论分析和实验验证。
实时动态化身:具有无限长度的音频驱动化身生成流式传输
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Group(阿里巴巴集团) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhejiang University(浙江大学) ; Monash University(墨尔本大学)
AI总结 本文提出Live Avatar框架,通过算法和系统协同设计,解决14B扩散模型在实时流式传输中无限长度生成的挑战,实现稳定生成超过10000秒,并引入GenBench基准测试。
TRACE:通过可触觉重建和几何对齐的上下文视频遮罩实现高保真的3D场景编辑
机构 * ReLER Lab, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学全国重点实验室(CCAI)ReLER实验室) ; DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系(DBMI))
AI总结 TRACE通过可触觉重建和几何对齐的上下文视频遮罩,实现高保真的3D场景编辑,解决了现有方法在局部姿态调整和组件替换时结构完整性不足的问题。
Comments 9 pages, 9 figures
生成AI在行动:来自阿里巴巴客户服务中心的实地实验证据
机构 * Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Dartmouth College(达特茅斯学院) ; Alibaba Group Inc.(阿里巴巴集团)
AI总结 本研究通过大规模实地实验评估生成AI助手对电商售后客服人员绩效的影响,发现AI显著提升服务速度和服务质量,但对顶级员工产生负面影响,提示需定制化部署策略。
So-Fake:社交媒体图像伪造检测的基准构建与可解释性研究
机构 * University of Liverpool, UK(利物浦大学) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Sheffield(谢菲尔德大学)
AI总结 该研究针对社交媒体图像伪造检测的数据集与基准缺口,构建了So-Fake-Set数据集与So-Fake-OOD分布外基准,提出采用强化学习的So-Fake-R1框架,其检测准确率与定位IoU均优于现有方法,为相关研究提供了新基础。
VAD:为多模态在线策略蒸馏中的目标重建归因视觉证据
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xiaohongshu Inc.(小红书公司) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Southeast University(东南大学)
AI总结 该研究提出视觉归因蒸馏(VAD)算法,通过反事实目标重建分离教师校正中的视觉证据分量,在6个4B/9B规模的细粒度视觉基准上,性能优于现有蒸馏方法。
Comments The project is accessible at https://github.com/DeepExperience/VAD_Multimodal_OPD
ROAD:用于3D形状生成的判别式语义的互目标对齐
机构 * Huazhong University of Science and Technology(华中科技大学) ; Megvii(旷视科技) ; Zhejiang University(浙江大学)
AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。
MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合
机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) ; Zhejiang University(浙江大学) ; Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) ; Hangzhou Dianzi University(杭州电子科技大学)
AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。
Comments 14pages, 14 figures, accepted by ACM MM2026
基于28万份常规报告的肠镜报告驱动的视觉-语言基础模型
机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) ; Shanghai Collaborative Innovation Center of Endoscopy(上海内镜诊疗协同创新中心) ; Zhejiang University(浙江大学) ; Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) ; Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院) ; Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学研究所) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 该研究开发了肠镜视觉-语言基础模型EndoCLIP,利用28万份常规肠镜记录恢复的图像-文本对训练,在多项任务中优于通用模型,良恶性分类性能接近专家,可实现临床目标的语言指定。
当派生测量值产生误导时:利用特权模态可靠性证据量化并缓解大语言模型的过度信任问题
机构 * Politecnico di Milano(米兰理工大学) ; Zhejiang University(浙江大学) ; China-Japan Friendship Hospital(中日友好医院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Emory University(埃默里大学)
AI总结 该研究定义了派生特征过度信任(DFOT)问题,构建了量化该问题的估计量框架,在PPG-ECG数据集上验证了基于特权蒸馏的基线方法可缓解DFOT,为相关研究提供通用评估目标。
Comments 25 pages, including references and supplementary material; 3 figures and 19 tables. Code: https://github.com/Zongheng-Guo/When-Derived-Measurements-Mislead
HSS-Synth:面向大语言模型的人文社科数据合成
机构 * Zhejiang University(浙江大学) ; Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) ; Peking University(北京大学) ; Qwen Team, Alibaba Group(阿里巴巴集团通义千问团队)
AI总结 本文针对LLM的HSS数据稀缺问题,提出以学科为中心的HSS-Synth流水线,生成23.7万指令微调样本,使Qwen3-8B-Base达SOTA并提升相关能力。
Comments ACL Findings 2026 Paper
文本模板令牌是扩散Transformer中的隐式语义寄存器
机构 * Nanjing University(南京大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学)
AI总结 研究文本到图像扩散Transformer中内部计算,引入因果可解释性框架,发现结构模板令牌充当隐式语义寄存器,据此设计剪枝规则,还揭示其生成计算组织方式,提供了DiTs内部机制的因果视图。
从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验
机构 * Jinling Institute of Technology(金陵科技学院) ; College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) ; Zhejiang University(浙江大学)
AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。
Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation
PartDiffuser:通过离散扩散实现部件级3D网格生成
机构 * Beihang University(北航) ; Communication University of China(中国通信大学) ; Zhejiang University(浙江大学)
AI总结 PartDiffuser提出一种半自回归扩散框架,通过部件级方法生成高保真3D网格,有效平衡全局结构与局部细节。
通过协调智能体流关联异构数据以开展社交媒体分析
机构 * Zhejiang University(浙江大学) ; Department of Communication, Michigan State University(密歇根州立大学通讯系)
AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。
基于CLIP的后门防御:通过基于熵的中毒数据集分离
机构 * The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Sun Yat-sen University(中山大学)
AI总结 该研究提出CLIP引导后门防御(CGD),用CLIP分离干净与中毒输入,重训练模型中和后门,在4个数据集11种攻击上ASR降至1%以下,CA降幅仅0.3%,适配性与鲁棒性优异。
Comments 15 pages, 9 figures, 15 tables. To appear in the Proceedings of the 32nd ACM International Conference on Multimedia (MM '25)
AgentMap:用于本体匹配的联合等价与包含关系发现
机构 * The University of Manchester(曼彻斯特大学) ; Zhejiang University(浙江大学)
AI总结 本文提出统一等价与包含发现的混合本体匹配任务,构建基于LLM的多智能体框架AgentMap,在三类设置下的本体匹配任务中均取得优异性能。
Comments 21 pages, 5 figures
SkillRise:面向跨任务技能演化的智能体强化学习
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Meituan(美团)
AI总结 SkillRise是跨任务学习技能的统一强化学习框架,解耦信用分配机制实现任务求解与技能整理,在多基准上Pass@1性能优于基线,还降低了运行开销。
重新审视推测解码中的有损验证:机制、权衡与失效模式
机构 * Independent Researcher(独立研究者) ; Baidu Inc.(百度公司) ; Zhejiang University(浙江大学)
AI总结 本研究分析有损推测解码的机制与失效模式,将其分为两类并构建评估框架,发现基于截断的有损方法会因分布失真致性能下降,协作类需控制概率超调以保障生成质量。
面向视觉-语言-动作模型的来自解析概念的显式运动学引导
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Westlake University(西湖大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。
提示框架扭曲了基于计数的LLM错误检测评估:来自数字锚定的证据
机构 * Zhejiang University(浙江大学)
AI总结 本文发现基于计数的F1分数可能因提示中的数字锚定而虚高,与跨度定位能力脱节,提出ErrorBench压力测试协议,并建议评估时应避免预置错误计数并报告跨度感知指标。
Comments 15 pages, 6 figures, 12 tables. Preprint under review
AdaMARP: 一种自适应多智能体交互框架用于通用沉浸式角色扮演
机构 * Zhejiang University(浙江大学) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 AdaMARP提出了一种自适应多智能体交互框架,通过沉浸式信息格式和显式场景管理器提升角色扮演的沉浸感和适应性,实验表明其在角色一致性、环境基础性和场景转换等方面优于现有系统。
Comments ACL2026 Findings
一种统一的命名实体识别框架
机构 * Department of Computer Science and Technology, Zhejiang University(浙江大学计算机科学技术学院)
AI总结 本文提出一种统一的命名实体识别框架,通过将NER任务转化为机器阅读理解任务,有效解决嵌套NER中的实体重叠问题,并在多个数据集上取得显著性能提升。
Comments ACL 2020
ChineseBERT:通过字形和拼音信息增强的中文预训练模型
机构 * Zhejiang University(浙江大学) ; Key Lab of Intelligent Information Processing of Chinese Academy of Sciences(中国科学院智能信息处理重点实验室)
AI总结 研究针对中文预训练模型忽略字形和拼音信息的问题,提出ChineseBERT,将二者纳入预训练,在大规模语料库上训练后,在多种中文NLP任务中性能显著提升,取得新SOTA,代码和模型已公开。
Comments To appear at ACL2021
数据不平衡自然语言处理任务的骰子损失
机构 * Department of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术系)
AI总结 针对数据不平衡的自然语言处理任务,提出用基于索伦森 - 戴斯系数或特沃斯基指数的骰子损失取代交叉熵目标,并给训练示例关联动态权重,在多种任务上显著提升性能。
传递接力棒:轨迹中继的在线策略蒸馏
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 研究针对在线策略蒸馏的前缀失败问题,利用师生延续不对称性提出Relay-OPD方法,通过教师在触发点接管生成轨迹段,让学生在其上优化,在数学推理基准测试中取得优异成绩,提升效果并减少训练轨迹长度。
Comments Project Page: https://zju-real.github.io/Relay-OPD Code: https://github.com/zju-real/Relay-OPD
INTACT:用于无搜索世界模型的同构意图到动作学习
机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; InSpatio
AI总结 研究针对前向潜在世界模型恢复动作需昂贵搜索的问题,提出INTACT方法,通过特定架构和技术实现意图到动作学习,在多任务上取得高成功率,减少采样并提升性能,还具有快速推理能力。
Comments 28 pages, 11 figures, including appendices
OmniDelta:用于OmniLLMs中令牌压缩的技能驱动预算分配
机构 * Zhejiang University(浙江大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology of China(中国科学技术大学) ; Alibaba(阿里巴巴)
AI总结 研究针对OmniLLMs长音频-视频令牌序列成本高的问题,提出技能驱动的OmniDelta框架,通过构建技能池、结合意图与内容感知分配预算,能与现有策略结合,实验证明其在多个基准上建立新的准确性-效率前沿,减少内存并加速推理。
Comments 24 pages, 8 figures
OmniPhys:文本到图像生成中物理常识的知识图谱驱动基准测试与集体优化
机构 * Zhejiang University(浙江大学) ; The University of Manchester(曼彻斯特大学) ; The University of Edinburgh(爱丁堡大学) ; Ant Group(蚂蚁集团)
AI总结 针对文本到图像模型常违反物理常识及现有基准测试不足等问题,引入基于物理知识图谱的OmniPhys基准测试,提出OmniPrompt迭代框架,经对12个模型评估,显著提升了物理一致性。
Comments accepted by KDD 2026 DB track
SGTP:基于采样的博弈论实时多车辆自主赛车规划
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Technical University of Munich(慕尼黑工业大学)
AI总结 针对自主多车辆赛车中平衡战略多样性与计算效率的难题,提出基于采样的博弈论规划(SGTP)框架,结合博弈论推理与GPU加速采样,经可行性选择确保安全过渡,模拟显示其在多智能体场景表现良好,还开源代码及基准促进研究。