SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments
SpatialEvo: 通过确定性几何环境实现自演化空间智能
机构 * Zhejiang University(浙江大学)
AI总结 本文提出SpatialEvo框架,利用确定性几何环境解决3D空间推理问题,通过物理反馈替代模型共识,提升空间推理能力。
高校专区
SpatialEvo: 通过确定性几何环境实现自演化空间智能
机构 * Zhejiang University(浙江大学)
AI总结 本文提出SpatialEvo框架,利用确定性几何环境解决3D空间推理问题,通过物理反馈替代模型共识,提升空间推理能力。
UI-Zoomer: 基于不确定性的自适应缩放以实现GUI定位
机构 * Zhejiang University(浙江大学)
AI总结 本文提出UI-Zoomer框架,通过将缩放触发和尺度作为不确定性量化问题,改进GUI定位中的小图标和密集布局识别。实验表明,该方法在多个模型架构上均优于现有基线,提升幅度达13.4%至4.2%。
Comments Project Page: https://zju-real.github.io/UI-Zoomer Code: https://github.com/ZJU-REAL/UI-Zoomer
前馈3D场景建模:以问题为导向的视角
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Monash University(墨尔本大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Tübingen(图宾根大学)
AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。
Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication
UI-Copilot: 通过工具集成策略优化推进长周期GUI自动化
机构 * Zhejiang University(浙江大学) ; Apple(苹果公司) ; Tencent(腾讯)
AI总结 本文提出UI-Copilot框架,通过分离持久观察与临时执行上下文实现内存解耦,结合工具集成策略优化提升长周期GUI任务性能,实验显示其在MemGUI-Bench和AndroidWorld上均优于现有模型。
角色超越言语:通过强化学习利用角色扮演评估音频大语言模型
机构 * Zhejiang University(浙江大学)
AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。
PBE-UNet:一种轻量级的渐进边界增强U-Net,具有尺度感知聚合,用于超声图像分割
机构 * Department of Computer Science, Shaoxing University(绍兴大学计算机科学系) ; National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Northeastern University(工业智能化与系统优化国家级前沿科学中心,东北大学) ; College of Computer Science, Chongqing University(重庆大学计算机学院) ; School of Computer and Computing Science, Hangzhou City University(杭州市大学计算机与计算科学学院) ; ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) ; Information Technology R&D Innovation Center of Peking University(北京大学信息技术研发创新中心)
AI总结 本文提出PBE-UNet,通过引入尺度感知聚合模块和边界引导特征增强模块,解决超声图像分割中边界模糊和尺度变化的问题,实验表明其在四个数据集上优于现有方法。
Comments 14 pages, 14 figures
GraphScout: 通过内在探索能力增强大语言模型以实现代理图推理
机构 * Zhejiang University(浙江大学) ; Hangzhou City University(杭州市大学) ; Nanyang Technological University(南洋理工大学)
AI总结 GraphScout通过灵活的图探索工具,使模型自主生成结构化训练数据,从而在无需人工标注的情况下提升大语言模型的图推理能力,实验显示其在多个领域表现优异。
Memp:探索代理程序记忆
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; State Key Lab. for Novel Software Technology(新型软件技术国家重点实验室) ; Nanjing University(南京大学)
AI总结 本文提出Memp,一种可学习、可更新且终身的程序记忆系统,通过提炼历史轨迹生成细粒度指令和高层脚本抽象,提升代理在TravelPlanner和ALFWorld任务中的成功率和效率。
Comments ACL 2026 Findings
MedRCube:面向医学影像中多模态大语言模型细粒度与深入评估的多维框架
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) ; School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)
AI总结 本文提出MedRCube框架,通过两阶段构建流程对33个MLLM进行细粒度评估,揭示先前方法无法获取的洞察,并引入可信度评估子集,发现快捷行为与诊断性能的显著正相关,引发临床部署的担忧。
普通最小二乘是变换器的特殊情况
机构 * Center for Peak Performance, Department of Psychology and Behavioral Sciences, Zhejiang University(高峰表现中心,心理学与行为科学系,浙江大学) ; Hangzhou Higgs Asset Management Co., Ltd.(杭州恒辉资产管理有限公司) ; College of Control Science and Engineering, Zhejiang University(控制科学与工程学院,浙江大学)
AI总结 本文通过代数证明,揭示变换器的本质是普通最小二乘的特例,展示了注意力机制与最小二乘法的等价性,并提出变换器中的分离记忆机制。
通过证据感知奖励和自校正偏好学习增强放射科报告生成
机构 * Department of Computer Science and Engineering, ECUST(电子科技大学计算机科学与工程系) ; Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, P. R. China(教育部能源化工过程智能制造重点实验室) ; Zhejiang University(浙江大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
AI总结 本文提出ESC-RL方法,结合证据感知对齐奖励和自校正偏好学习,提升放射科报告生成的临床准确性与持续改进能力,实验表明其在胸部X光数据集上表现优异。
Comments 13 pages,4 figures, ACL2026-main
YOCO++:通过KV残差连接增强YOCO以实现高效的LLM推理
机构 * Alibaba Group(阿里巴巴集团) ; ShanghaiTech University(上海科技大学) ; Zhejiang University(浙江大学)
AI总结 本文提出YOCO++,通过在底层层与底层之间加入加权残差连接,提升YOCO的性能,实现50%的KV缓存压缩率下的最佳表现。
统一多模态模型的免费午餐:通过内在理解的反思校正增强生成
机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; College of Computer Science(计算机科学学院)
AI总结 本文提出UniRect-CoT框架,通过反思校正提升统一多模态模型的生成能力,利用内部知识校正中间结果,增强生成质量。
通过多角色编排实现可扩展的轻量级GUI代理
机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可及感知与智能系统重点实验室,浙江大学) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; AntGroup(蚂蚁集团)
AI总结 本文提出LAMO框架,通过多角色编排提升轻量级GUI代理的任务扩展性,开发出支持单体执行和多代理系统编排的LAMO-3B代理,结合先进规划器实现持续性能提升。
Comments Findings of ACL 2026
PianoFlow:基于音乐的流式钢琴动作生成与双手协调
机构 * Zhejiang University(浙江大学) ; Renmin University of China(中国人民大学) ; Beijing Forestry University(北京林业大学)
AI总结 本文提出PianoFlow框架,通过MIDI信息生成精确的双手钢琴动作,利用角色门控交互模块捕捉动态协调,提升生成效率和质量。
连续学习的更快路径
机构 * College of Computer Science, Sichuan University, China(四川大学计算机学院) ; College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) ; Photogrammetry and Remote Sensing Lab, ETH Zürich, Switzerland(苏黎世联邦理工学院摄影测量与遥感实验室) ; School of Computer Science, Nanjing University, China(南京大学计算机科学系) ; College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) ; Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系)
AI总结 本文提出C-Flat Turbo,通过优化梯度计算减少连续学习的训练成本,提升效率并保持性能。
Comments Update Author Affiliations
多维知识谱系:基于大规模文献数据库与分层检索
机构 * Zhejiang University(浙江大学) ; APRIL Lab(APRIL实验室) ; Shanghai Jiao Tong University(上海交通大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。
LEO-RobotAgent: 一种通用的基于语言的机器人代理框架
机构 * Zhejiang University, Hangzhou 310000, P. R. China(浙江大学,杭州310000,中华人民共和国)
AI总结 本文提出LEO-RobotAgent框架,旨在通过语言驱动实现机器人在复杂场景中完成多样化任务,具备强泛化能力、鲁棒性和高效性,降低人机交互门槛。
MAS-Bench:一种统一的快捷键增强混合移动GUI代理基准测试
机构 * Zhejiang University(浙江大学) ; vivo AI Lab(vivo AI实验室) ; Peking University(北京大学)
AI总结 本文提出MAS-Bench,用于评估结合GUI和快捷键的混合移动自动化代理,包含139个任务和9个评估指标,实验显示混合代理在效率上优于纯GUI代理。