ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
ClawGUI:一个用于训练、评估和部署GUI代理的统一框架
机构 * Zhejiang University(浙江大学)
AI总结 ClawGUI通过统一框架解决GUI代理训练、评估和部署中的三大缺口,提供标准化评估流程和跨平台部署能力,实现移动端GUI任务的成功率提升。
高校专区
ClawGUI:一个用于训练、评估和部署GUI代理的统一框架
机构 * Zhejiang University(浙江大学)
AI总结 ClawGUI通过统一框架解决GUI代理训练、评估和部署中的三大缺口,提供标准化评估流程和跨平台部署能力,实现移动端GUI任务的成功率提升。
动态摘要生成用于可解释的多模态抑郁症检测
机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Faculty of Engineering, University of the Ryukyus(琉球大学工学部)
AI总结 本文提出一种粗到细的多阶段框架,利用大语言模型实现准确且可解释的多模态抑郁症检测,通过生成临床摘要指导多模态融合模块,提升诊断准确性和可解释性。
任何3D场景都值得1000个标记:面向大规模场景生成的3D grounded表示
机构 * Westlake University(西湖大学) ; Afari Intelligent Drive(阿法里智能驾驶) ; Zhejiang University(浙江大学)
AI总结 本文提出在隐式3D潜在空间中直接生成3D场景,解决传统2D方法在3D空间扩展中的不足,通过3DRAE和3DDiT实现高效且一致的3D生成。
Comments Under Review. Project Page: https://wswdx.github.io/3DRAE
弥合RGB-红外差距:面向文本引导多光谱检测的共识与差异建模
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) ; Tsinghua University(清华大学)
AI总结 本文提出一种语义桥融合框架,通过双支持建模解决文本引导多光谱检测中的共识与差异问题,提升跨模态交互的鲁棒性。
Comments 17 pages ,Under review
FashionStylist: 一个增强专家知识的多模态数据集用于时尚理解
机构 * Yanshan University(燕山大学) ; Central South University(中南大学) ; Zhejiang University(浙江大学) ; Southwest University(西南大学) ; Singapore Management University(新加坡管理大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
AI总结 本文提出FashionStylist,一个专家标注的多任务时尚理解基准,支持服装到物品定位、服装补全和评估任务,提升多模态时尚系统的语义理解能力。
二进制流匹配:用于鲁棒学习的预测-损失空间对齐
机构 * Zhejiang University(浙江大学) ; Huawei Technologies Co., Ltd(华为技术有限公司)
AI总结 本文研究了二进制流匹配在离散数据生成建模中的应用,提出通过信号空间对齐消除奇异加权,从而实现鲁棒训练。
Comments 15 pages, 3 tables, 11 figures
子论点论证框架:区分直接冲突与结构依赖
机构 * Zhejiang University(浙江大学)
AI总结 本文提出子论点论证框架(SAFs),通过将直接冲突与结构依赖分离,提升论证表示的表达能力,同时保持与Dung理论的语义兼容性。
Comments The original title, "Abstract Argumentation with Subargument Relations," has been replaced by "Subargument Argumentation Frameworks: Separating Direct Conflict from Structural Dependency"
用于MIMO检测的软图变换器
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) ; Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co., Ltd.(华为技术有限公司2012实验室中央研究院理论实验室)
AI总结 本文提出软图变换器(SGT),结合自注意力和图感知交叉注意力,解决MIMO检测中传统方法复杂度高和信息利用不足的问题,实现近似最大似然性能。
Comments 5 pages with 3 figures and 2 tables, Accepted by IEEE ICASSP 2026
Ψ-Map:全景表面集成映射实现真实到仿真转移
机构 * Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)
AI总结 Ψ-Map通过整合几何强化、端到端学习和高效渲染,实现大规模场景中高精度全景重建,兼顾几何精度与实时推理,满足机器人仿真需求。
ScoRe-Flow:通过基于分数的强化学习实现完整分布控制的流匹配
机构 * Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出ScoRe-Flow方法,通过基于分数的强化学习微调,实现对流匹配中均值和方差的解耦控制,提升了训练效率和任务成功率。
Comments 20 pages, 19 figures
Fast-SegSim: 仿真中机器人快速开放词汇分割
机构 * Zhejiang University(浙江大学)
AI总结 本文提出Fast-SegSim,基于2D高斯散射构建端到端框架,实现高保真且3D一致的开放词汇分割重建。通过优化渲染管线和Top-K硬选择策略,提升渲染速度至40FPS以上,用于仿真平台传感器输入和下游感知任务的多视图地面真实标签生成。
ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。
Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/
从未标注的多视角图像中学习3D表示以提升空间智能
机构 * Nanjing University of Science and Technology(南京理工大学) ; Zhejiang University(浙江大学) ; Communication University of China(中国传媒大学)
AI总结 本文提出UniSplat框架,通过双掩码策略、高斯溅射策略和姿态条件重校准机制,解决未标注多视角图像中3D表示学习的几何诱导弱、外观细节不足和几何语义不一致问题,实现鲁棒且通用的3D表示。
Comments CVPR 2026
从感知到规划:通过课程学习进化自主任务导向的空间时间推理
机构 * Zhejiang University(浙江大学) ; Tianjin University(天津大学) ; Qingdao University(青岛大学) ; Shanghai Jiao Tong University(上海交通大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出EgoTSR框架,通过课程学习提升任务导向的空间时间推理能力,解决静态感知和动态环境中的时空幻觉问题,实验显示其在长周期推理任务中准确率达92.4%。
一种用于对抗具身推理中时空幻觉的渐进训练策略
机构 * Zhejiang University(浙江大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Qingdao University(青岛大学) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of YYY(YYY大学) ; Institute of WWW(WWW研究所)
AI总结 本文提出一种渐进训练框架,通过构建CoT数据集和弱标签数据提升视觉语言模型的时空推理能力,有效缩小了正反向性能差距。
大型语言模型有多可控?跨行为细粒度的统一评估
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出SteerEval基准,从语言特征、情感和个性三个领域评估LLM可控性,揭示细粒度控制效果下降问题,提供安全可控的LLM行为框架。
Comments ACL 2026
推理作为梯度:超越树搜索的MLE代理扩展
机构 * Nanjing University(南京大学) ; Microsoft Research Asia(微软亚洲研究院) ; Peking University(北京大学) ; Zhejiang University(浙江大学) ; Wuhan University(武汉大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出Gome,一种基于梯度优化的MLE代理,通过将结构化诊断推理映射到梯度计算,实现更高效的优化。实验显示,随着模型能力增强,梯度优化在前沿模型中表现更优,且在受限预算下达到35.1%的任何奖牌率。
Comments 36 pages, 6 figures, 17 tables
为何转向有效:语言模型参数动态的统一视角
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出统一视角分析语言模型控制方法,通过偏好-效用分析揭示控制效果的权衡关系,并引入SPLIT方法提升偏好与效用。
Comments ACL 2026
StaMo:从紧凑状态表示中无监督学习通用机器人运动
机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Nanjing University(南京大学) ; HKUST(香港科技大学) ; Ant Group(蚂蚁集团)
AI总结 本文提出StaMo方法,通过轻量编码器和预训练扩散变换器解码器学习高效紧凑状态表示,提升机器人运动性能,并发现通过潜在插值获得的token差异可作为有效潜动作,增强策略协同训练。
PosterGen:基于多智能体LLM的美观化论文到海报生成
机构 * Stony Brook University(石溪大学) ; New York University(纽约大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Zhejiang University(浙江大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 PosterGen通过多智能体LLM实现论文到海报的美观化生成,包含四个协作专业代理,提升设计质量和视觉吸引力。
Comments Project Website: https://Y-Research-SBU.github.io/PosterGen
一种多语言数据集和信息提取中相互强化效应的实证验证
机构 * Yokohama National University(横滨国立大学) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Zhejiang University(浙江大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) ; Southeast University(东南大学) ; University of Tsukuba(筑波大学) ; Pusan National University(釜山大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
AI总结 本文提出多语言MRE混合数据集,通过LLM辅助框架减少标注工作,验证了多语言环境下信息提取中相互强化效应的普遍性。
Comments Accepted by ACL 2026 Findings
基于模板的对话句嵌入对比学习
机构 * Stanford University(斯坦福大学) ; Zhejiang University(浙江大学) ; Alibaba Qwen Pilot(阿里巴巴Qwen Pilot)
AI总结 本文提出TaDSE方法,利用模板信息通过自监督对比学习学习对话句嵌入,通过合成数据集增强效果,并在五个对话基准数据集上验证了其有效性。
Comments Accepted to ACL 2026
SMFormer:通过基础模型和数据增强赋能自监督立体匹配
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Hong Kong Generative AI Research and Development Center, The Hong Kong University of Science and Technology(香港科技大学香港生成式人工智能研发中心) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Electronics and Communication Engineering, the Shenzhen Campus of Sun Yat-sen University, Sun Yat-sen University(中山大学深圳校区电子与通信工程学院)
AI总结 本文提出SMFormer框架,结合基础模型和数据增强提升自监督立体匹配的鲁棒性与准确性,在多个基准测试中达到SOTA水平,甚至超越部分监督方法。
Journal ref IEEE Transactions on Image Processing 2026
语义操控定位
机构 * Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证教育部工程研究中心) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; KOKONI3D, Moxin (Hangzhou) Technology Company Ltd.(KOKONI3D,魔芯(杭州)科技有限公司)
AI总结 本文提出语义操控定位任务,通过TRACE框架实现对图像中微妙语义编辑的定位,优于传统IML方法,提供更完整的定位结果。
FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击
机构 * Zhejiang University(浙江大学) ; Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) ; Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)
AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。
Comments Accepted at CVPR 2026
DeepReviewer 2.0:一个可追溯的代理系统用于可审计的科学同行评审
机构 * Engineering School, Westlake University(西湖大学工学院) ; Zhejiang University(浙江大学) ; Soochow University(苏州大学)
AI总结 DeepReviewer 2.0通过可追溯的审查包和可执行的后续行动,提升同行评审的可审计性,其在134个提交中优于人类评审和现有自动系统。
SRBench: 一个面向大型语言模型的序列推荐综合基准
机构 * Zhejiang University(浙江大学)
AI总结 SRBench通过多维框架、统一输入范式和新型提取机制,解决序列推荐模型评估中的公平性、稳定性与效率问题,揭示LLM-SR模型过度关注流行度而缺乏深度理解的不足。
超越瓷砖匹配:连接不一致的航空和卫星视图以实现仅视觉UAV导航
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)
AI总结 本文提出Bearing-UAV方法,通过联合预测UAV绝对位置和航向实现跨视图导航,提升在复杂环境下的定位精度和鲁棒性。
Comments Accepted as a conference paper by CVPR2026
EvoESAP: 非均匀专家修剪用于稀疏MoE
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出EvoESAP,通过非均匀层间稀疏分配提升稀疏MoE模型的生成能力,同时保持多选准确率。
比特的重量:嵌入式深度学习模型的EMFI敏感性分析
机构 * TTControl GmbH(TTControl公司) ; Faculty of Informatics and Information Technologies, Slovak University of Technology(斯洛伐克理工大学信息学与信息技术学院) ; State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)
AI总结 本文研究四种数表示对EMFI攻击成功的影响,发现整数表示比浮点表示更抗攻击,尤其8位整数在较大网络中保持较高精度。