arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2601.05844 2026-02-13 cs.GR cs.AI cs.RO

DexterCap: An Affordable and Automated System for Capturing Dexterous Hand-Object Manipulation

DexterCap: 一种经济实惠且自动化的手部物体操作捕捉系统

Yutong Liang, Shiyi Xu, Yulong Zhang, Bowen Zhan, He Zhang, Libin Liu

机构 * Peking University(北京大学) School of Computer Science, Peking University(北京大学计算机学院) Tencent Robotics X(腾讯机器人实验室)

AI总结 DexterCap是一种低成本的自动化手部物体操作捕捉系统,通过字符编码标记和自动重建流程,实现稳健的跟踪和细粒度手部-物体交互数据集DexterHand的构建。

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13811 2026-02-13 cs.CR cs.LG

Can LLMs Handle WebShell Detection? Overcoming Detection Challenges with Behavioral Function-Aware Framework

LLMs能否处理WebShell检测?通过行为功能感知框架克服检测挑战

Feijiang Han, Jiaming Zhang, Chuyi Deng, Jianheng Tang, Yunhuai Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) Central South University(中南大学) Peking University(北京大学)

AI总结 基于行为功能感知框架,研究评估了七种LLM在WebShell检测中的表现,发现大模型精度高但召回率低,提出BFAD框架提升检测性能,F1值平均提升13.82%。

Comments Published as a conference paper at COLM 2025 (The new version has been polished and expanded with more detailed future work ideas)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03866 2026-02-12 cs.DL cs.AI

PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG

PaperX: 一种多模态学术演示生成的统一框架与学者DAG

Tao Yu, Minghui Zhang, Zhiqing Cui, Hao Wang, Zhongtian Luo, Shenghua Chai, Junhao Gong, Yuzhao Peng, Yuxuan Zhou, Yujia Yang, Zhenghao Zhang, Haopeng Jin, Xinming Wang, Yufei Xiong, Jiabing Yang, Jiahao Yuan, Hanqing Wang, Hongzhu Yi, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(乌尔姆大学) Peking University(北京大学) Tsinghua University(清华大学) HKUST(GZ)(香港科技大学(广州))

AI总结 PaperX通过Scholar DAG实现多模态学术演示生成的统一框架,提升内容质量和效率。

Comments 29 pages, 9 figures, Project website: https://github.com/yutao1024/PaperX

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21124 2026-02-12 cs.AI cs.CL

Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns

通过学习多样的思维链模式扩展基础模型的推理潜力

Xuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng, Shuo Wang, Hongfei Yan, Jingang Wang, Xunliang Cai

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Meituan(美团) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 本文提出通过学习富含高价值推理模式的多样化数据,扩展基础模型的推理潜力,显著提升模型在数学推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10607 2026-02-12 cs.LG cs.AI

Hierarchical Zero-Order Optimization for Deep Neural Networks

层次化零阶优化用于深度神经网络

Sansheng Cao, Zhengyu Ma, Yonghong Tian

机构 * College of Physics, Peking University(北京大学物理学院) Pengcheng Laboratory(鹏城实验室) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出层次化零阶优化方法,通过分解网络深度维度,将查询复杂度降低至O(ML log L),在CIFAR-10和ImageNet上实现了与反向传播相当的准确性。

Comments Corresponding author: Zhengyu Ma (mazhy@pcl.ac.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10506 2026-02-12 cs.LG cs.AI

Learning Structure-Semantic Evolution Trajectories for Graph Domain Adaptation

学习结构-语义演进轨迹用于图域适应

Wei Chen, Xingyu Guo, Shuang Li, Yan Zhong, Zhao Zhang, Fuzhen Zhuang, Hongrui Liu, Libang Zhang, Guo Ye, Huimei He

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) Zhongguancun Laboratory, Beijng, China(中关村实验室) Independent Researcher, Beijing, China(独立研究者)

AI总结 DiffGDA通过建模连续时间生成过程,以结构和语义转换的联合建模方式解决图域适应中的连续非线性演进问题,实验表明其在多个数据集上优于现有方法。

Comments accepted by ICLR 2026, 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10494 2026-02-12 cs.CL

Canvas-of-Thought: Grounding Reasoning via Mutable Structured States

Canvas-of-Thought:通过可变的结构化状态进行推理

Lingzhuang Sun, Yuxia Zhu, Ruitong Liu, Hao Liang, Zheng Sun, Caijun Jia, Honghao He, Yuchen Wu, Siyuan Li, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) New York University(纽约大学) Westlake University(西湖大学)

AI总结 Canvas-CoT通过引入HTML Canvas实现可变结构化状态,提升多模态推理效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10278 2026-02-12 cs.CV cs.AI

ERGO: Excess-Risk-Guided Optimization for High-Fidelity Monocular 3D Gaussian Splatting

ERGO:基于超额风险的高保真单目3D高斯点云优化

Zehua Ma, Hanhui Li, Zhenyu Xie, Xiaonan Luo, Michael Kampffmeyer, Feng Gao, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Guilin University of Electronic Technology(桂林电子科技大学) UiT The Arctic University of Norway(UiT北欧大学)

AI总结 ERGO通过基于超额风险分解的自适应优化框架,提升单目3D高斯点云重建的几何和纹理保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10159 2026-02-12 cs.CV cs.LG

Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization

超越封闭池视频检索:面向真实世界视频搜索和时刻定位的基准与代理框架

Tao Yu, Yujia Yang, Haopeng Jin, Junhao Gong, Xinlong Chen, Yuxuan Zhou, Shanbin Zhang, Jiabing Yang, Xinming Wang, Hongzhu Yi, Ping Nie, Kai Zou, Zhang Zhang, Yan Huang, Liang Wang, Yeshani, Ruiwen Tao, Jin Ma, Haijin Liang, Jinwen Luo

机构 * CASIA UCAS Tencent(腾讯) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出RVMS-Bench和RACLO框架,用于评估现实世界中基于模糊记忆的视频检索和时刻定位,揭示现有模型在该任务上的不足。

Comments 49 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10157 2026-02-12 cs.CR cs.AI cs.NI

MalMoE: Mixture-of-Experts Enhanced Encrypted Malicious Traffic Detection Under Graph Drift

MalMoE: 基于专家混合的加密恶意流量检测在图漂移下的应用

Yunpeng Tan, Qingyang Li, Mingxin Yang, Yannan Hu, Lei Zhang, Xinggong Zhang

机构 * Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

AI总结 MalMoE通过混合专家模型和图辅助技术,实现加密恶意流量检测在图漂移下的高效准确识别。

Comments 10 pages, 9 figures, accepted by IEEE INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09653 2026-02-12 cs.AI

ClinAlign: Scaling Healthcare Alignment from Clinician Preference

ClinAlign: 从医生偏好扩展医疗对齐

Shiwei Lyu, Xidong Wang, Lei Liu, Hao Zhu, Chaohe Zhang, Jian Wang, Jinjie Gu, Benyou Wang, Yue Shen

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

AI总结 ClinAlign通过HealthRubrics和HealthPrinciples实现医疗输出与医生偏好的高效对齐,验证了资源高效的临床对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09555 2026-02-12 cs.CL

Advancing Block Diffusion Language Models for Test-Time Scaling

推进块扩散语言模型用于测试时间扩展

Yi Lu, Deyang Kong, Jianing Wang, Linsen Guo, Xue Wang, Qi Guo, Tao Gui, Xuanjing Huang, Wei Ye, Shikun Zhang, Wei Wang

机构 * Fudan University(复旦大学) Peking University(北京大学)

AI总结 本文提出BACD和TCCF方法,提升块扩散语言模型在测试时间扩展中的推理效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08971 2026-02-12 cs.CV cs.RO

WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models

WorldArena: 一个用于评估具身世界模型感知与功能效用的统一基准

Yu Shang, Zhuohang Li, Yiding Ma, Weikang Su, Xin Jin, Ziyou Wang, Lei Jin, Xin Zhang, Yinzhou Tang, Haisheng Su, Chen Gao, Wei Wu, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Yong Li

机构 * Tsinghua University, Beijing, China(清华大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Hong Kong, Hong Kong SAR, China(香港大学) Princeton University, Princeton, NJ, USA(普林斯顿大学) Chinese Academy of Sciences, Beijing, China(中国科学院) University of Science(科学技术大学) Peking University, Beijing, China(北京大学) National University of Singapore, Singapore(新加坡国立大学)

AI总结 WorldArena是一个统一的基准,用于评估具身世界模型的感知和功能效用,揭示高视觉质量与强具身任务能力之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16471 2026-02-12 cs.CV

Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos

秩序从混沌:从 glitchy 游戏视频中理解物理世界

Meng Cao, Haoran Tang, Haoze Zhao, Mingfei Han, Ruyang Liu, Qiang Sun, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Toronto(多伦多大学) Sun Yat-sen University(孙中山大学)

AI总结 本文提出 PhysGame 数据集和 GameBench 基准,通过利用游戏视频中的 glitch 异常,提升物理推理能力,实验显示在多个基准上取得显著提升。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18868 2026-02-12 cs.LG cs.AI

KernelBand: Steering LLM-based Kernel Optimization via Hardware-Aware Multi-Armed Bandits

KernelBand: 通过硬件感知的多臂老虎机实现基于LLM的核优化

Dezhi Ran, Shuxiao Xie, Mingfang Ji, Anmin Liu, Mengzhou Wu, Yuan Cao, Yuzhe Guo, Hao Yu, Linyi Li, Yitao Hu, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(北京大学)) SCS, Peking University, Beijing, China(SCS,北京大学,北京,中国) Hong Kong University of Science(香港科学大学) East China Normal University, Shanghai, China(华东师范大学,上海,中国) Department of Computer Science, Tianjin University, Tianjin, China(天津大学计算机科学系,天津,中国) School of Computing Science, Simon Fraser University, Burnaby, BC, Canada(Simon Fraser大学计算机科学学院,Burnaby,BC,加拿大) University of Texas at Dallas, USA(德克萨斯大学达拉斯分校,美国) Beijing Tongming Lake Information Technology Application Innovation Center, China(北京同铭湖信息技术应用创新中心,中国) Fudan University Institute of Systems for Advanced Computing, China(复旦大学高级计算系统研究所,中国) Shanghai Institute of Systems for Open Computing, China(上海开放计算系统研究所,中国)

AI总结 KernelBand通过硬件感知的多臂老虎机框架,实现基于LLM的核优化,显著提升性能。

Comments 19 pages (9 pages main text), 4 figures. v2: Full revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04821 2026-02-12 cs.CL

AFD-SLU: Adaptive Feature Distillation for Spoken Language Understanding

AFD-SLU: 适应性特征蒸馏用于语音语言理解

Yan Xie, Yibo Cui, Liang Xie, Erwei Yin

机构 * School of Advanced Manufacturing and Robotics(先进制造与机器人学院) Peking University(北京大学) National Institute of Defense Technology Innovation(国防科技创新国家研究院) Academy of Military Sciences(军事科学院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心)

AI总结 AFD-SLU通过自适应特征蒸馏框架,将教师模型的语义表示转移到轻量级学生模型,提升语音语言理解的准确率与效率。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11214 2026-02-12 math.OC cs.AI cs.CC cs.LG stat.ML

Complexity of normalized stochastic first-order methods with momentum under heavy-tailed noise

具有动量的规范化随机一阶方法的复杂性 在重尾噪声下

Chuan He, Zhaosong Lu, Defeng Sun, Zhanwang Deng

机构 * Department of Mathematics, Linköping University(利乌普斯大学数学系) Department of Industrial and Systems Engineering, University of Minnesota(明尼苏达大学工业与系统工程系) Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学先进跨学科研究学院)

AI总结 本文提出了一种在重尾噪声下具有动量的规范化随机一阶方法,通过动态参数更新和弱平均光滑性条件,改进了寻找近似随机 stationary 点的复杂性界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11739 2026-02-12 cs.CL cs.AI

ZeroTuning: Unlocking the Initial Token's Power to Enhance Large Language Models Without Training

ZeroTuning: 解锁初始标记的潜力以无需训练的方式提升大语言模型

Feijiang Han, Xiaodong Yu, Jianheng Tang, Delip Rao, Weihua Du, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学) AMD(AMD公司) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 ZeroTuning通过仅调整初始标记的注意力实现无需训练的大语言模型性能提升,适用于多种任务和场景。

Comments ICLR 2026 Accepted Version: proofread, introduction rewritten, additional experiments and appendix material added

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10006 2026-02-11 cs.LG

Answer First, Reason Later: Aligning Search Relevance via Mode-Balanced Reinforcement Learning

先回答,后推理:通过模式平衡强化学习对齐搜索相关性

Shijie Zhang, Xiang Guo, Rujun Guo, Shaoyu Liu, Xiaozhao Wang, Guanjun Jiang, Kevin Zhang

机构 * Qwen Applications Business Group, Alibaba Group(阿里集团文应用业务组) Peking University(北京大学)

AI总结 本研究提出AFRL范式,通过模式平衡优化策略结合SFT与RL,实现低延迟高精度的搜索相关性模型,并有效知识蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09972 2026-02-11 cs.RO

Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning

Hydra-Nav: 通过自适应双过程推理实现物体导航

Zixuan Wang, Huang Fang, Shaoan Wang, Yuanfei Luo, Heng Dong, Wei Li, Yiming Gan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 Hydra-Nav通过自适应双过程推理提升物体导航效率,实现高效探索与决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01280 2026-02-11 cs.CL cs.AI

Does Memory Need Graphs? A Unified Framework and Empirical Analysis for Long-Term Dialog Memory

记忆是否需要图?一种统一框架和长期对话记忆的实证分析

Sen Hu, Yuxiang Wei, Jiaxin Ran, Zhiyuan Yao, Xueran Han, Huacan Wang, Ronghao Chen, Lei Zou

机构 * Peking University(北京大学) Georgia Tech(佐治亚理工学院) ZJU(浙江大学) MBZUAI(马克斯·普朗克智能系统研究所) UCAS(中国科学院大学)

AI总结 本文提出一种统一框架,分析长期对话记忆系统,发现性能差异主要由基础设置驱动,而非特定架构创新,并提供了稳定基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09722 2026-02-11 cs.RO

Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization

重新思考视觉-语言-动作模型的扩展:对齐、混合与正则化

Ye Wang, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Haoqi Yuan, Chaoyi Xu, Haiweng Xu, Yicheng Feng, Mingyang Yu, Zhiyu Kang, Zongqing Lu, Qin Jin

机构 * Renmin University of China(中国人民大学) BeingBeyond Peking University(北京大学)

AI总结 本研究重新审视视觉-语言-动作模型的扩展问题,探讨了对齐、混合与正则化在机器人控制中的关键作用,挑战了传统假设并提供实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09617 2026-02-11 cs.RO cs.AI cs.CV

AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception

AnyTouch 2: 通用光学触觉表征学习用于动态触觉感知

Ruoxuan Feng, Yuxuan Zhou, Siyu Mei, Dongzhan Zhou, Pengwei Wang, Shaowei Cui, Bin Fang, Guocai Yao, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学光明学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Jiaotong University(北京交通大学) Shanghai AI Laboratory(上海人工智能实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing University of Posts(北京邮电大学) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 AnyTouch 2 是一种通用光学触觉表征学习框架,通过大规模层次化触觉数据集提升动态触觉感知能力,实现物体层面与细粒度力感知的统一学习。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09455 2026-02-11 cs.GT cs.LG

Enhancing Affine Maximizer Auctions with Correlation-Aware Payment

通过相关性感知支付增强仿射最大化拍卖

Haoran Sun, Xuanzhi Xia, Xu Chu, Xiaotie Deng

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

AI总结 本文提出CA-AMA框架,通过相关性感知支付增强AMAs,解决估值相关分布下的收益优化问题。

Comments 22 pages. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09432 2026-02-11 cs.CV

SceneReVis: A Self-Reflective Vision-Grounded Framework for 3D Indoor Scene Synthesis via Multi-turn RL

SceneReVis: 一种基于多轮强化学习的视觉 grounding 框架,用于通过多轮强化学习进行 3D 室内场景合成

Yang Zhao, Shizhao Sun, Meisheng Zhang, Yingdong Shi, Xubo Yang, Jiang Bian

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Peking University, Beijing, China(北京大学) ShanghaiTech University, Shanghai, China(上海科技大学)

AI总结 SceneReVis 通过多轮强化学习和多模态反馈,实现高保真 3D 室内场景合成,提升空间规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09252 2026-02-11 cs.CV cs.AI cs.MA

VLM-Guided Iterative Refinement for Surgical Image Segmentation with Foundation Models

基于基础模型的手术图像分割迭代细化方法

Ange Lou, Yamin Li, Qi Chang, Nan Xi, Luyuan Xie, Zichao Li, Tianyu Luan

机构 * School of Automation Science and Engineering, South China University of Technology, Guangzhou, China(自动化科学与工程学院,华南理工大学,广州,中国) Vanderbilt University, Nashville, TN, USA(范德比尔特大学,纳什维尔,田纳西州,美国) The Pennsylvania State University, University Park, PA , USA(宾夕法尼亚州立大学,大学园,宾夕法尼亚州,美国) Peking University, Beijing , China(北京大学,北京,中国) Virginia Commonwealth University, Richmond, VA, USA(弗吉尼亚共同wealth大学,里士满,弗吉尼亚州,美国) University of California San Diego, San Diego, CA, USA(加州大学圣地亚哥分校,圣地亚哥,加利福尼亚州,美国)

AI总结 本文提出IR-SIS,一种基于自然语言描述的手术图像分割迭代细化系统,结合视觉-语言模型和自适应工作流,实现高精度分割与临床交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09080 2026-02-11 cs.LG cs.AI

Looping Back to Move Forward: Recursive Transformers for Efficient and Flexible Large Multimodal Models

循环回溯以前进:递归变换器用于高效灵活的大型多模态模型

Ruihan Xu, Yuting Gao, Lan Wang, Jianing Li, Weihao Chen, Qingpei Guo, Ming Yang, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) AntGroup(蚂蚁集团)

AI总结 RecursiveVLM通过递归细化机制提升多模态模型效率,实现参数复用和性能提升。

Comments This is a primary contribution in the Recursive Vision-Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09007 2026-02-11 cs.AI cs.CV

GEBench: Benchmarking Image Generation Models as GUI Environments

GEBench: 图形用户界面生成模型的基准测试

Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun South China University of Technology(南方科技大学) Peking University(北京大学) Tsinghua University(清华大学) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) The University of Chicago(芝加哥大学) Nanyang Technological University(南洋理工大学)

AI总结 GEBench提出一个评估GUI生成模型动态交互和时间一致性的基准测试,通过五维指标揭示模型在多步交互中的瓶颈问题。

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05787 2026-02-11 cs.AI

From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation

从离线到在线:通过双层专家到策略融合提升GUI代理

Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu

机构 * Nanjing University(南京大学) Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 BEPA通过双层专家到策略融合方法,提升GUI代理在OSWorld-Verified等基准测试中的性能。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏