CircleFlow: Flow-Guided Camera Blur Estimation using a Circle Grid Target
CircleFlow: 通过圆格目标实现的流引导相机模糊估计
机构 * Zhejiang University(浙江大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 CircleFlow通过圆格目标和流引导边缘定位,实现高保真的PSF估计,提升相机模糊校准的准确性和鲁棒性。
高校专区
CircleFlow: 通过圆格目标实现的流引导相机模糊估计
机构 * Zhejiang University(浙江大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 CircleFlow通过圆格目标和流引导边缘定位,实现高保真的PSF估计,提升相机模糊校准的准确性和鲁棒性。
面向通过纠缠引导与代理约束缓解大语言模型卸载过度遗忘的方案
机构 * Zhejiang University(浙江大学) ; Sun Yat-sen University(中山大学) ; Amazon(亚马逊)
AI总结 EGUP通过纠缠引导与代理约束缓解大语言模型卸载过度遗忘问题,提升卸载-效用权衡性能。
机器的实用性思维:追踪大型语言模型中实用性能力的出现
机构 * Northwestern University(西北大学) ; The University of Tokyo(东京大学) ; RIKEN AIP(理化学研究所AIP) ; Zhejiang University(浙江大学) ; University of California, Davis(加州大学戴维斯分校)
AI总结 本文提出ALTPRAG数据集,通过对比推理评估不同训练阶段LLMs的实用性能力发展,发现模型规模和数据规模的增加提升其对实用性提示的敏感性,SFT和RLHF进一步增强其在认知-实用性场景中的表现。
通过delta思考:通过微分视觉推理策略激励强化学习
机构 * Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Wuhan University(武汉大学)
AI总结 通过微分视觉推理策略增强强化学习的视觉理解能力,提升多模态任务性能。
Comments 24 pages, 10 tables, 4 figures
MLB:面向临床应用的大型语言模型评估场景驱动基准
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Health Information Center of Zhejiang Province(浙江省健康信息中心) ; Peking University(北京大学)
AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。
Comments 11 pages, 4 figures, 5 tables
Orient Anything V2:统一物体3D方向和旋转理解
机构 * Zhejiang University(浙江大学) ; Shanghai AI Lab(上海人工智能实验室) ; Sea AI Lab(海思人工智能实验室) ; The University of Hong Kong(香港大学)
AI总结 Orient Anything V2通过四个创新提升,实现了对物体3D方向和旋转的统一理解,显著提升了零样本性能和泛化能力。
Comments NeurIPS 2025 Spotlight, Repo: https://github.com/SpatialVision/Orient-Anything-V2
CoV:基于视角链的立体推理
机构 * ZIP Lab, Zhejiang University(浙江大学ZIP实验室) ; Monash University(墨尔本大学) ; AIML, Adelaide University(阿德莱德大学AIML)
AI总结 CoV通过链式视角提示方法提升3D具身问答中的空间推理能力,无需额外训练。
Comments Code link https://github.com/ziplab/CoV
SpiLiFormer:通过横向抑制增强脉冲变换器
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Nanjing University(南京大学) ; Donghua University(东华大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Peking University(北京大学)
AI总结 SpiLiFormer通过引入横向抑制机制,提升脉冲变换器对相关上下文的注意力,从而在多个数据集上取得更优性能。
Comments Accepted by ICCV 2025. The first two authors contributed equally
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 24539-24548
像素级视觉几何估计
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Xiaomi EV(小米电动车)
AI总结 本文提出像素级视觉几何模型,通过生成建模技术实现高质量无飞像素点云,提升单目和视频深度估计的性能和准确性。
Comments Code: https://github.com/gangweix/pixel-perfect-depth
MisSpans: 跨领域虚假新闻中细粒度虚假片段识别
机构 * The University of Manchester(曼彻斯特大学) ; Zhejiang University(浙江大学) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; Center for Language and Information Research, Wuhan University(武汉大学语言与信息研究中心) ; ELLIS Manchester(曼彻斯特ELLIS)
AI总结 MisSpans提出首个多领域人工标注基准,用于细粒度虚假信息检测与分析,通过三项任务实现精准定位、细致分类和可解释性。
Comments Work in progress
CALM: 一种基于CKA的自适应层级模块化框架用于LLM量化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 CALM提出一种基于CKA的自适应层级模块化框架,通过独立评估各层最佳量化策略,提升LLM量化效果。
NC2C: 通用非凸优化问题的自动凸化
机构 * Southeast University(东南大学) ; Zhejiang University(浙江大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 NC2C通过大语言模型实现通用非凸优化问题的自动凸化,提升求解效率并减少专家依赖。
Comments First version of NC2C
ToolGate: 以合同为基础并经过验证的工具执行用于LLMs
机构 * Zhejiang University(浙江大学) ; Southeast University(东南大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。
Comments First version of ToolGate
超越二元偏好:通过解耦属性对齐扩散模型以实现细粒度标准
机构 * Zhejiang University(浙江大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Peking University(北京大学) ; University of Nottingham Ningbo China(诺丁汉大学宁波分校)
AI总结 本文提出CPO方法,通过解耦属性实现扩散模型对细粒度标准的对齐,提升生成质量与专业对齐能力。
通过领域适应利用未标记数据实现真实世界的镜头主动对齐
机构 * organization= State Key Laboratory of Extreme Photonics ; Instrumentation, College of Optical Science ; Engineering , addressline= Zhejiang University , city= Hangzhou , postcode= 310027 , country= China ; organization= National Research Center for Optical Instrumentation , addressline= Zhejiang University , city= Hangzhou , postcode= 310027 , country= China ; organization= School of Artificial Intelligence ; Robotics , addressline= Hunan University , city= Changsha , postcode= 410012 , country= China ; organization= National Engineering Research Center of Robot Visual Perception ; Control Technology , addressline= Hunan University , city= Changsha , postcode= 410082 , country= China ; organization= Intelligent Optics \& Photonics Research Center, Jiaxing Research Institute , addressline= Zhejiang University , city= Jiaxing , postcode= 314031 , country= China ; organization= Dongguan Yutong Optical Technology Co., Ltd. , city= Dongguan , postcode= 523863 , country= China ; organization= Sunny Optical (Zhejiang) Research Institute Co., Ltd. , city= Hangzhou , postcode= 311215 , country= China
AI总结 本文提出DA3方法,通过领域适应利用未标记数据提升真实世界镜头主动对齐的精度和效率
锻造空间智能:面向自主系统多模态数据预训练的路线图
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Alibaba Group(阿里巴巴集团) ; Singapore Management University(新加坡管理学院)
AI总结 本文提出多模态数据预训练框架,旨在通过整合多传感器数据提升自主系统空间智能,解决单模态模型整合难题,并提出统一的预训练范式分类及未来发展方向。
Comments Survey; 40 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-spatial-intelligence
GAPO:面向现实世界代码LLM的鲁棒优势估计
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯) ; Zhejiang University(浙江大学) ; Shenzhen University(深圳大学) ; Peking University(北京大学)
AI总结 GAPO通过自适应Q机制提升代码编辑LLM的鲁棒性,实现领域内和领域外精确匹配的显著提升。
MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全
机构 * Zhejiang University(浙江大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Shandong University(山东大学)
AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。
HGMF:一种用于模型上下文协议中可扩展工具调用的分层高斯混合框架
机构 * Zhejiang University Binjiang Institute of Zhejiang University(浙江大学) ; Jimei University(集美大学) ; Zhejiang University GenTel.io(浙江大学)
AI总结 HGMF通过分层高斯混合框架提升大规模工具库中的工具调用准确率与效率。
SpatialTree: MLLMs中空间能力如何分支扩展
机构 * Zhejiang University(浙江大学) ; Beijing Jiaotong University(北京交通大学)
AI总结 SpatialTree提出了一种受认知科学启发的分层结构,用于评估和提升多模态大语言模型中的空间能力。
Comments webpage: https://spatialtree.github.io/
通过高效非凸优化实现因果不变性学习
机构 * Department of Statistics, Rutgers University(罗格斯大学统计系) ; Seminar for Statistics, ETH Zürich(苏黎世联邦理工学院统计研究所) ; Center for Data Science, Zhejiang University(浙江大学数据科学中心)
AI总结 本文提出NegDRO框架,通过高效非凸优化实现因果不变性学习,解决了因果结果模型的识别与估计问题。
MARVEL:基于大语言模型的多智能体研究验证器与促进器
机构 * MIT Kavli Institute for Astrophysics and Space Research and LIGO Laboratory(麻省理工学院凯斯利天文与空间研究所及LIGO实验室) ; Massachusetts Institute of Technology(麻省理工学院) ; State Key Laboratory of Ocean Sensing & Ocean College(海洋传感国家重点实验室) ; Zhejiang University(浙江大学) ; NSF AI Institute for Artificial Intelligence and Fundamental Interactions (IAIFI)(国家科学基金会人工智能与基本相互作用研究所) ; Cambridge, MA, USA(美国马萨诸塞州剑桥市)
AI总结 MARVEL通过结合快速查询路径和深度搜索模式,为科学领域提供可部署的验证器,其在探测器操作内容上显著优于GPT-4o基线。
Comments 18 pages, 7 figures
表格作为大语言模型的一种模态
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; University of Michigan(密歇根大学)
AI总结 TAMO通过将表格视为独立模态,结合文本令牌,提升大语言模型对表格数据的推理能力。
Comments Accepted to NeurIPS 2025
强化学习用于工具集成的交叉领域泛化思考
机构 * Meituan(美团) ; Zhejiang University(浙江大学) ; Allen Institute for Artificial Intelligence(人工智能算法研究所) ; City University of Hong Kong(香港城市大学)
AI总结 本文提出RITE方法,通过强化学习和交叉领域工具执行,提升LLM在跨领域推理中的泛化能力。
针对基于大语言模型的多智能体系统 的网络欺诈攻击
机构 * Zhejiang University(浙江大学) ; Changsha University of Science and Technology(长沙理工大学) ; Purdue University(普渡大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Zhejiang Gongshang University(浙江工商大学)
AI总结 本文提出了一种针对基于大语言模型的多智能体系统的新攻击类型,通过网络链接的独特结构欺骗系统,展示了其在不同架构中的破坏潜力及逃避优势。
在一般维度下对分段线性近似混合整数线性公式的紧缩
机构 * Argonne National Laboratory(阿贡国家实验室) ; Zhejiang University(浙江大学)
AI总结 本文提出六种方法紧缩一般维度下分段线性近似混合整数线性规划公式,以提高求解效率。
Comments Added Acknowledgements and U.S. Government license disclaimer
Journal ref Tightening the Difference-of-Convex Formulation for the Piecewise Linear Approximation in General Dimensions. INFORMS Journal on Optimization. 10.1287/ijoo.2025.0074
InfiniDepth:基于神经隐式场的任意分辨率和细粒度深度估计
机构 * Zhejiang University(浙江大学) ; Li Auto(利汽车) ; Shenzhen University(深圳大学)
AI总结 InfiniDepth通过神经隐式场实现任意分辨率和细粒度深度估计,提升深度估计性能和新视角合成质量。
Comments 19 pages, 13 figures
EComStage:面向电商大语言模型的分阶段和方向特定基准测试
机构 * The University of Tokyo(东京大学) ; Zhejiang University(浙江大学) ; Xiaohongshu Inc.(小红书公司)
AI总结 EComStage提出一个分阶段和方向特定的电商大语言模型基准测试,评估LLM在感知、规划和行动阶段的表现,揭示不同规模和类型的模型在电商场景中的优势与不足。
Comments preprint
拓宽视野并深入思考:协作式跨模态链式推理用于复杂视觉推理
机构 * Fujian Normal University(福建师范大学) ; Zhejiang University(浙江大学) ; Zhejiang Normal University(浙江师范大学)
AI总结 CoCoT通过动态多区域定位和关系感知推理,提升复杂视觉推理性能,在多个基准测试中实现显著准确率提升。
OThink-R1: 内在快速/缓慢思考模式切换以抑制过度推理
机构 * Zhejiang University(浙江大学) ; OPPO Research Institute(OPPO研究院)
AI总结 OThink-R1通过整合快速和缓慢思考模式,实现自动模式切换,从而在减少token使用的同时保持高准确性。
Comments Under review