Thinking with Programming Vision: Towards a Unified View for Thinking with Images
通过编程视觉思考:迈向图像思考的统一视角
机构 * Zhejiang University(浙江大学) ; ByteDance BandAI(字节跳动BandAI)
AI总结 CodeVision提出一种灵活的代码作为工具框架,通过两阶段训练提升模型对图像变化和多工具推理的鲁棒性,实验显示显著提升性能并促进新兴能力。
高校专区
通过编程视觉思考:迈向图像思考的统一视角
机构 * Zhejiang University(浙江大学) ; ByteDance BandAI(字节跳动BandAI)
AI总结 CodeVision提出一种灵活的代码作为工具框架,通过两阶段训练提升模型对图像变化和多工具推理的鲁棒性,实验显示显著提升性能并促进新兴能力。
上下文感知的分层学习:一种更安全LLM的两阶段范式
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Harbin Institute of Technology(哈尔滨工业大学) ; Great Bay University(大贝大学) ; Zhejiang University(浙江大学)
AI总结 本文提出上下文感知分层学习(CAHL)以提升LLM对工具完成攻击的鲁棒性,通过动态平衡语义理解和指令约束,有效增强模型安全性。
当有害内容被伪装时:通过CamHarmTI揭示LVLMs的感知失败
机构 * Zhejiang University(浙江大学)
AI总结 本文提出CamHarmTI基准,揭示LVLMs在识别伪装有害内容时的感知不足,并通过微调提升模型性能。
MagicView: 通过先验引导的上下文学习实现多视角一致的身份定制
机构 * Zhejiang University(浙江大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Qualcomm Inc.(高通公司)
AI总结 MagicView 通过先验引导的上下文学习实现多视角一致的身份定制,有效提升多视角一致性与文本对齐能力。
MemOS:人工智能系统中的内存操作系统
机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) ; Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) ; Research Institute of China Telecom(中国电信研究院) ; Tongji University(同济大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Beihang University(北航) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 MemOS是一种面向人工智能系统的内存操作系统,通过统一管理不同类型的内存资源,提升长上下文推理和持续个性化的能力。
Comments 36 pages, 10 figures, 5 tables
MERIT: 多语言语义检索与交错多条件查询
机构 * Zhejiang University(浙江大学)
AI总结 MERIT提出首个多语言交错多条件语义检索数据集,通过Coral框架提升检索性能45.9%,并验证了其在多个基准上的泛化能力。
Comments NeurIPS 2025; Project Page, Code, and Dataset at: https://merit-2025.github.io/
推荐去学习的综述:基本原理、分类、评估和开放问题
机构 * School of Communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Hong Kong Polytechnic University, Academy for AI(香港理工大学人工智能学院)
AI总结 本文综述了推荐去学习的基本原理、分类、评估方法及开放问题,旨在推动更高效、可扩展的去学习技术发展。
Comments Accepted by TKDE
ViSAudio:端到端视频驱动的双耳空间音频生成
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Stanford University(斯坦福大学) ; Beihang University(北航) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 ViSAudio通过端到端双耳空间音频生成框架,从静音视频直接生成高质量空间音频,提升空间沉浸感和适应性。
UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准
机构 * Zhejiang University(浙江大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉团队) ; Shanghai Jiao Tong University(上海交通大学) ; Xinjiang University(新疆大学)
AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。
Comments 31 pages, 15 figures, 12 tables
3DIS: 基于深度的解耦实例合成用于文本到图像生成
机构 * CCAI, Zhejiang University(中国浙江大学计算机辅助智能学院)
AI总结 3DIS提出了一种基于深度的解耦实例合成方法,通过分阶段生成场景深度图和渲染细粒度属性,提升文本到图像生成中多实例的布局精度和属性渲染效果。
Comments 10 pages
WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁
机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ; ZheJiang University(浙江大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。
Ada-MoGE:一种自适应高斯专家混合模型用于时间序列预测
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; Zhejiang University(浙江大学)
AI总结 Ada-MoGE通过自适应确定专家数量和高斯带通滤波优化,提升时间序列预测的精度与效率。
基于特征的语义感知调度用于能量收集联邦学习
机构 * Department of Computer and Information Science(计算机与信息科学系) ; Linköping University(林奈技术大学) ; Department of Information Engineering(信息工程系) ; University of Brescia(布雷西亚大学) ; ZJU-UIUC Institute(浙大-伊利诺伊大学联合研究所) ; Zhejiang University(浙江大学)
AI总结 本文提出了一种基于特征的语义感知调度框架,通过引入版本年龄信息度量标准,有效降低计算复杂性,提升能量收集联邦学习的效率和性能。
Comments This paper is currently under review for presentation at a peer-reviewed conference
关于AI代理框架中代理开发者实践的实证研究
机构 * Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; The University of Melbourne(墨尔本大学) ; Technical University of Munich(慕尼黑技术大学)
AI总结 本文通过实证研究分析了基于LLM的代理框架在开发效率、功能抽象、学习成本、性能优化和可维护性方面的差异,揭示了开发者在选择和使用框架时的挑战与需求。
解构生成多样性:基于信息瓶颈理论的离散潜在生成模型分析
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出基于信息瓶颈理论的框架,分析离散潜在生成模型中生成多样性的来源,并揭示了三种不同的策略:多样性优先、压缩优先和解耦。
超越架设:一种统一的时空梯度跟踪方法
机构 * Division of Decision and Control Systems, School of EECS, KTH Royal Institute of Technology(决策与控制系统系,皇家理工学院) ; College of Control Science and Engineering, Zhejiang University(控制科学与工程学院,浙江大学)
AI总结 ST-GT通过统一时空梯度跟踪方法,有效缓解数据异质性和局部梯度噪声,实现强凸问题的线性收敛和非凸问题的次线性收敛,提升通信效率。
Comments 13 pages
EGG-Fusion: 基于几何感知高斯surfel的高效实时3D重建
机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) ; SenseTime Research(商汤科技研究院)
AI总结 EGG-Fusion提出一种基于几何感知高斯surfel的实时3D重建系统,通过信息滤波融合方法提升精度和实时性,实现20%以上的精度提升。
Comments SIGGRAPH ASIA 2025
大语言模型无法可靠地检测JavaScript中的漏洞:首个系统性基准和评估
机构 * Lanzhou University(兰州大学) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Technology Support Center of the Cyberspace Administration of China(国家互联网信息办公室技术支撑中心) ; Fudan University(复旦大学) ; Beijing University of Posts(北京邮电大学)
AI总结 本文首次提出FORGEJS框架,构建首个系统性JavaScript漏洞检测基准ARENAJS,并揭示LLM在漏洞检测中的局限性。
COMET:一种双摆臂自主 coaxial 双旋翼 AAV,具有高机动性和长续航能力
机构 * the School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) ; Research Institute of Multiple Agents and Embodied Intelligence, Peng Cheng Laboratory(多智能体与具身智能研究院,鹏城实验室) ; State Key Laboratory of Industrial Control Technology, Zhejiang University(工业控制技术国家重点实验室,浙江大学) ; Differential Robotics Technology Co., Ltd.(差分机器人技术有限公司)
AI总结 COMET 是一种具有双摆臂机制的 coaxial 双旋翼 AAV,通过优化效率和机动性,实现了高续航能力与稳定飞行性能。
Comments 8 pages, 8 figures, accepted at IEEE RA-L
多评分者医学图像分割的概率建模用于多样性和个性化
机构 * Zhejiang University(浙江大学) ; University of Cambridge(剑桥大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 ProSeg通过概率建模实现医学图像分割的多样化和个性化,结合专家偏好和边界模糊性,提升分割结果的多样性和个性化水平。
通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了
机构 * Zhejiang University(浙江大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感
多智能体条件扩散模型与均场通信作为无线资源分配规划器
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; Zhejiang University-University of Illinois Urbana-Champaign (ZJU-UIUC) Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) ; Department of Engineering, King’s College London(伦敦国王学院工程系)
AI总结 多智能体条件扩散模型与均场通信用于无线资源分配规划,通过扩散模型和逆动态模型提升样本效率与策略可扩展性,理论保证收敛稳定性,实验显示在无线网络优化中表现优异。
TRiCo:三元博弈协同训练用于鲁棒半监督学习
机构 * University of Warwick(沃里克大学) ; Emory University(埃默里大学) ; University of Minnesota – Twin Cities(明尼苏达大学双城分校) ; ANU(澳大利亚国立大学) ; Brown University(布朗大学) ; Columbia University(哥伦比亚大学) ; UCSD(加州大学圣地亚哥分校) ; Zhejiang University(浙江大学)
AI总结 TRiCo通过三元博弈协同训练框架提升半监督学习的鲁棒性和性能,实现更稳健的伪标签选择和决策边界优化。
Comments Accepted by NeurIPS 2025
通过隐式触觉校准确保视觉引导的机器人操作中的力安全
机构 * Sun Yat-sen University(中山大学) ; UC San Diego(加州大学圣地亚哥分校) ; Zhejiang University(浙江大学)
AI总结 本文提出SafeDiff框架,通过隐式触觉校准提升机器人操作中的力安全,结合视觉和触觉数据优化状态规划,减少有害力风险。
Comments Website URL: see https://i-am-future.github.io/safediff/
样本高效的目标导向自博弈用于离线鲁棒强化学习
机构 * Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Edith Cowan University(埃迪斯·科温大学) ; University of New South Wales(新南威尔士大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。
Comments NeurIPS 2025
可证明的内存高效自博弈算法用于无模型强化学习
机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院) ; Zhejiang University(浙江大学) ; School of Information and Electronics(信息与电子学院) ; Beijing Institute of Technology(北京理工大学) ; Institute of Acoustics(声学研究所) ; Chinese Academy of Sciences(中国科学院)
AI总结 本文提出了一种内存高效的自博弈算法,用于解决多智能体强化学习中的内存效率、样本复杂度和预热成本问题。
Comments ICLR 2024. arXiv admin note: substantial text overlap with arXiv:2110.04645 by other authors
Arcadia:迈向一个完整的生命周期框架用于具身终身学习
机构 * Zhejiang University(浙江大学) ; Unitree Tech(单位树科技) ; Peking University(北京大学) ; Nanjing University(南京大学) ; Manycore Tech(Manycore科技) ; Bytedance Seed(字节跳动种子) ; University of Adelaide(阿德莱德大学)
AI总结 Arcadia提出了一种闭环框架,通过紧密耦合四个阶段实现具身终身学习,支持持续改进和端到端泛化。
AnyTalker: 通过交互细化扩展多人物谈话视频生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Video Rebirth(视频重生) ; Zhejiang University(浙江大学) ; Beijing Jiaotong University(北京交通大学)
AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。
Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage
InstanceV: 实例级视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。
从幻觉到意图:用于视觉-语言推理的视觉理由学习
机构 * Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; Meituan(美团)
AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。
Comments 19 pages, 15 figures