Training-Free Semantic Correction for Autoregressive Visual Models
自回归视觉模型的免训练语义校正
机构 * Zhejiang University(浙江大学) ; Shandong University(山东大学)
AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。
高校专区
自回归视觉模型的免训练语义校正
机构 * Zhejiang University(浙江大学) ; Shandong University(山东大学)
AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。
SCOPE:面向开放环境规划的演化符号世界
机构 * Zhejiang University(浙江大学) ; Chalmers University of Technology(查尔姆斯理工大学) ; Lanzhou University(兰州大学)
AI总结 提出SCOPE框架,通过符号执行模拟器和自适应符号记忆模块,在开放环境中演化符号世界表示,提升规划完整性和鲁棒性。
Comments Accepted to ICML 2026
迈向无错误的长视频生成
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出一种基于扩散模型的长视频生成框架,通过因果注意力、KV缓存和截断修正流技术解决误差累积和属性漂移问题,实现高质量、身份一致的单镜头长视频合成。
课程强化学习可以激励LLMs超越基础模型的推理能力
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学)
AI总结 提出边界感知课程强化学习方法,通过定位推理能力边界、针对性教师引导和强化学习巩固,在Qwen、Llama和DeepSeek上同时提升pass@1和pass@256,平均pass@256比基础模型提升9.8个百分点。
BioMatrix:迈向覆盖序列、结构和语言模态矩阵的综合性生物基础模型
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; OpenDataLab, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室 OpenDataLab) ; Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; East China Normal University(华东师范大学) ; Zhongguancun Academy(中关村学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
AI总结 提出首个原生多模态生物基础模型BioMatrix,通过统一分词方案将分子序列、结构、蛋白质序列、结构和自然语言映射到共享离散标记空间,在单一解码器架构下实现所有模态的统一生成,在80项任务中77项达到最优或竞争力水平。
从识别到理解:利用LLM解锁认知时间序列推理
机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) ; Zhejiang University(浙江大学) ; Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)
AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。
形态感知的多模态表示学习用于昆虫系统发育重建
机构 * Rural Development Academy, Zhejiang University(浙江大学农村发展学院)
AI总结 提出形态感知多模态对齐框架,结合标本图像与形态描述,通过视觉Transformer微调和对比学习对齐图像-文本,学习连续性状用于贝叶斯系统发育重建,在Rove-Tree-11数据集上提升拓扑一致性。
Comments 7 pages, 5 figures, and 2 tables
规模化的陷阱:揭示并缓解基于Transformer的推荐系统中的流行度偏差放大
机构 * Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 发现扩大Transformer推荐模型规模会放大流行度偏差,通过理论和实证分析揭示注意力聚合和前馈投影导致谱坍缩是根本原因,提出SPRINT正则化方法缓解该问题,在0.05M至0.34B参数规模上实现更优的扩展行为。
Comments Accepted by KDD 2026
从不确定性到稳定性和保真度:利用Fisher信息引导稀疏视角3D高斯溅射
机构 * Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; Xpeng Motors(小鹏汽车)
AI总结 针对稀疏视角下3D高斯溅射过拟合问题,提出基于Fisher信息指导几何先验使用和正则化的方法,通过主动选择信息量大的支撑视图和自适应调整高斯移除概率,提升渲染稳定性和保真度。
REKEY: 基于元数据的视觉键再生方法用于抗污染的VQA评估
机构 * Zhejiang University(浙江大学) ; ETH Zürich(苏黎世联邦理工学院) ; Nanjing University of Science and Technology(南京理工大学) ; Nanjing University(南京大学) ; University of Waterloo(滑铁卢大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
AI总结 提出ReKey协议,通过随机再生图像中的视觉键来防止VQA基准测试泄露,实验显示原始项目得分比再生变体高9.5-18.8个百分点。
学习并行字符串求解器的分裂启发式
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室)
AI总结 提出数据驱动方法自动生成分裂启发式,将分裂原子选择建模为学习任务,在Z3seq和Z3str4上实现,在求解数量和平均时间上优于手工设计。
开放问题:AdamW 在重尾噪声下是否有效?
机构 * Nanjing University(南京大学) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学)
AI总结 本文提出开放问题:AdamW 在重尾噪声下能否收敛?通过加权度量基准和走廊下界机制,揭示分母记忆可能隐藏大梯度。
SPOT-E:基于视觉聚光灯的冻结VLM测试时熵整形
机构 * National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; Technical University of Munich(慕尼黑工业大学) ; Sagenic Tech ; Zhejiang University(浙江大学) ; vivo ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 提出SPOT-E方法,通过测试时熵整形和视觉聚光灯,解决VLM在证据密集型任务中因忽视局部关键证据而表现不佳的问题,无需重新训练即可提升定位与鲁棒性。
EBench: 通用移动操作策略的要素诊断
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
AI总结 提出EBench基准,从5个能力和4个泛化维度诊断通用移动操作模型,揭示不同模型在成功率相近时能力差异显著。
G2G:利用组内几何进行组间姿态估计
机构 * State Key Laboratory of Industrial Control and Technology, Zhejiang University(浙江大学工业控制技术国家重点实验室) ; Zhejiang Humanoid Robot Innovation Center Co., Ltd.(浙江人形机器人创新中心有限公司) ; School of Information Science and Engineering, Hangzhou Normal University(杭州师范大学信息科学与工程学院)
AI总结 提出G2G方法,通过冻结多视图基础模型并添加三个轻量可训练模块(感知器重采样器、跨组桥接模块和多帧姿态头),仅利用相对姿态监督实现组间6-DoF姿态估计,在四个数据集上达到SOTA。
MemoryWAM:具有持久记忆的高效世界动作建模
机构 * The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
AI总结 提出MemoryWAM,通过混合记忆设计和定制注意力机制,在长时域机器人操作任务中实现高效记忆依赖决策,优于现有VLA和WAM基线。
慢速大脑,快速规划器:延迟鲁棒的VLM增强城市导航
机构 * Amazon FAR(亚马逊 FAR) ; UCLA(加州大学洛杉矶分校) ; Independent(独立) ; Zhejiang University(浙江大学)
AI总结 针对移动机器人在人行道导航中轨迹评分差距问题,提出一种无需训练的延迟鲁棒轨迹级融合层,利用VLM选择候选轨迹并与规划器输出融合,在挑战场景下降低ADE 30%。
基于图深度学习的制图综合:来自建筑足迹简化和聚合的见解
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhejiang University(浙江大学) ; Mainz University of Applied Sciences(美因茨应用科学大学)
AI总结 本研究首次探索将图深度学习应用于建筑足迹简化(节点移动预测)和聚合(链接预测),评估了GCN、GAT和GraphSAGE等架构,发现GraphSAGE在链接预测上表现较好,但节点移动预测仍具挑战,且聚合比简化更复杂。
Comments 15 pages, 20 figures, 10 tables
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)
AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。
Comments Accepted by MICCAI 2025
SWAP: 用于敏捷机器人跑酷的对称等变世界模型
机构 * Center for X-Mechanics, Zhejiang University(浙江大学交叉力学中心) ; ZJU-Hangzhou Global Scientific and Technology Innovation Center(浙江大学杭州国际科创中心) ; Mirrorme Technology Co., Ltd.(魔镜科技有限公司)
AI总结 提出SWAP框架,将对称等变性嵌入世界模型和演员-评论家网络,实现四足机器人跑酷记录突破(跨越2.13米间隙、攀爬1.63米平台),并展现出对未见镜像地形的几何泛化与零样本迁移能力。
不确定性感知的奖励建模用于稳定的RLHF
机构 * Zhejiang University(浙江大学) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
AI总结 提出不确定性感知奖励建模(UARM),通过分位数保形预测校准不确定性并利用异方差方差分解重加权GRPO优势,以缓解奖励黑客问题,提升对齐质量。
SafeSpec: 通过动态反射采样实现快速且安全的LLM
机构 * Zhejiang University, Hangzhou, China(浙江大学) ; Huawei(华为) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))
AI总结 提出SafeSpec框架,将轻量安全头集成到推测解码的验证过程中,通过风险估计和反射采样恢复安全生成,在保持加速的同时显著降低攻击成功率。
联邦双层执行预测
机构 * Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; Washington State University(华盛顿州立大学)
AI总结 研究联邦学习中客户端数据分布受决策影响的双层优化问题,提出联邦双层执行稳定点概念及两种求解方法,实验验证了稳定性阈值和元泛化提升。
Comments Accepted by ICML 2026
超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。
NeuMesh++:基于解耦神经网格隐式场的多功能高效体积编辑
机构 * State Key Lab of CAD&CG, College of Computer Science, Zhejiang University(浙江大学计算机科学学院CAD&CG国家重点实验室) ; Ant Research(蚂蚁研究院) ; Google(谷歌) ; ByteDance(字节跳动)
AI总结 提出一种基于网格顶点的解耦神经辐射场表示,实现几何、纹理和语义引导的高效体积编辑,包括网格引导几何编辑、纹理交换填充绘制及语义编辑。
Comments TPAMI 2025; Project Page: https://zju3dv.github.io/neumeshplusplus/
机制引导的选择性遗忘:针对RLVR诱导的推理
机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学研究院工程学院) ; College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) ; Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电子与计算机工程系)
AI总结 提出MAST方法,通过机制引导选择性更新参数,在遗忘RLVR诱导的推理行为时,显著降低对保留性能的附带损害。
Comments 15 pages, 4 figures, 7 tables
基于混合2D-3D学习的人行道机器人单目3D占用感知
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Zhejiang University(浙江大学) ; Coco Robotics(Coco机器人) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出WalkOCC框架,通过混合射线行进单目3D占用感知,结合LiDAR-RGB配对数据与大规模无配对单目图像学习,提升人行道机器人导航的预测精度和泛化能力。
RODS: 面向多轮工具使用智能体的奖励驱动在线数据合成
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学)
AI总结 针对多轮工具使用强化学习中静态数据集信息样本快速耗尽的问题,提出RODS方法,利用进度奖励方差作为零成本边界检测器,在线合成与智能体能力边界匹配的样本,以约800样本达到17K样本离线管道的性能。
稀疏性诅咒:从模型合并理解RLVR模型参数空间
机构 * Zhejiang University(浙江大学) ; Simon Fraser University(西蒙菲莎大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang Key Lab of Accessible Perception and Intelligent Systems(浙江省可感知智能系统重点实验室)
AI总结 本文发现RLVR模型的稀疏更新在参数空间中分散更远,形成近正交捷径导致合并脆弱,并提出SAR-Merging方法解决该问题。
Comments Accepted by KDD 2026
OmniPlan:一种用于及时且近乎最优的网络规划优化的自适应框架
机构 * Zhejiang University(浙江大学) ; Fuzhou University(福州市大学) ; Yangzhou University(扬州大学) ; The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; College of Computer Science and Technology(计算机科学与技术学院)
AI总结 提出OmniPlan自适应框架,利用大语言模型解析用户意图,通过混合专家架构动态选择MIP求解器、启发式算法或深度强化学习模型,实现网络规划优化的及时性与近乎最优性,在分布式机器学习推理卸载任务中延迟降低97.8%,资源消耗降低11.5%。
Comments Accepted by ACM KDD 2026