arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2605.08794 2026-05-19 cs.LG cs.AI

Deterministic Decomposition of Stochastic Generative Dynamics

确定性分解随机生成动力学

Xingyu Song, Yuan Mei, Naoya Takeishi

机构 * The University of Tokyo(东京大学) Zhejiang University(浙江大学)

AI总结 本文提出Bridge Matching框架,通过分解生成动力学中的确定性与随机效应,实现可控的生成模型。

Comments 10 pages main text, 6 figures; appendix included. Code available at: https://github.com/xingyu-song/bridge_matching

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14223 2026-05-19 cs.CV

StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model

StreamingTalker: 基于音频的3D面部动画与自回归扩散模型

Yifan Yang, Zhi Cen, Sida Peng, Xiangwei Chen, Yifu Deng, Xinyu Zhu, Fan Jia, Xiaowei Zhou, Hujun Bao

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) College of Computer Science, Zhejiang University(浙江大学计算机学院)

AI总结 本文提出基于自回归扩散模型的StreamingTalker,解决音频驱动3D面部动画中长音频处理延迟和超训练范围的问题,通过动态条件生成高质量实时面部动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16079 2026-05-19 cs.CL cs.AI

EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle

EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理

Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学) Central South University(中南大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12119 2026-05-19 cs.CL cs.AI

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

专家混合模型可在严格相等资源下超越密集语言模型

Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

机构 * Fudan University(复旦大学) StepFun University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

AI总结 本文研究在资源相等条件下MoE模型是否能超越密集模型,提出优化框架并验证了在最优激活率下MoE模型性能更优,且该区域在不同模型规模下一致,通过数据重用解决数据量增加的权衡问题。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16363 2026-05-19 cs.LG cs.CY

ORACLE: Anticipating Scams from Partial Trajectories in Streaming App Usage

ORACLE:从流式应用使用轨迹中预见诈骗

Wenbo Gao, Songbai Tan, Zhongan Wang, Fei Shen, Gang Xu, Huiping Zhuang, Yunyun Yang, Ming Li, Xiaofeng Zhu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University(深圳大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Guangming Laboratory(光明实验室) South China University of Technology(华南理工大学) Hainan University(海南大学)

AI总结 本文提出ORACLE框架,通过流式应用使用轨迹预测诈骗,利用自适应上下文管理器和自蒸馏方案提升早期欺诈检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13161 2026-05-19 cs.CV cs.LG

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning

A₃B₂:一种自适应非对称适配器,用于缓解视觉-语言图像分类中的分支偏差

Yiyun Zhou, Zhonghua Jiang, Wenkang Han, Kunxi Li, Mingjing Xu, Chang Yao, Jingyuan Chen

机构 * Zhejiang University(浙江大学) Swansea University(斯旺西大学)

AI总结 本文提出A₃B₂适配器,通过引入不确定性感知适配器阻尼机制,缓解少样本学习中的分支偏差问题,实验表明其在多个数据集上优于现有基线方法。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15942 2026-05-18 cs.CV cs.AI

Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation

分解式视觉-语言对齐用于细粒度开放词汇分割

Chenhao Wang, Yingrui Ji, Yu Meng, Yao Zhu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

AI总结 本文提出分解式视觉-语言对齐框架,通过将文本提示分解为概念令牌和多个属性令牌,实现细粒度开放词汇分割中对未见属性-类别组合的泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15815 2026-05-18 cs.SE cs.CL cs.MA

BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge

BootstrapAgent: 将仓库设置提炼为可重用的代理知识

Sihan Fu, Oucheng Liu, Shiyuan Wang, Jin Shi, Chengkun Wei

机构 * Zhejiang University(浙江大学) The Australian National University(澳大利亚国立大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 BootstrapAgent通过提炼仓库初始化过程中的启发式知识,生成可验证的代理合同,提升代码代理在 unfamiliar repositories 的任务成功率和效率。

Comments 19 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10813 2026-05-18 cs.AI

NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation

NanoResearch: 为个性化研究自动化共进化技能、记忆与政策

Jinhang Xu, Qiyuan Zhu, Yujun Wu, Zirui Wang, Dongxu Zhang, Marcia Tian, Yiling Duan, Siyuan Li, Jingxuan Wei, Sirui Han, Yike Guo, Odin Zhang, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Zhejiang University(浙江大学) Xi'an Jiaotong University(西安交通大学) East China University of Science and Technology(东华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出NanoResearch框架,通过三重共进化解决研究自动化中的个性化需求,提升研究效率与用户体验。

Comments 40 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21798 2026-05-18 cs.CV

CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models

CG-MLLM:通过多模态大语言模型实现图像描述与3D内容生成

Junming Huang, Chi Wang, Letian Li, Guangkai Xu, Donglin Huang, Hao Chen, Qiang Dai, Weiwei Xu

机构 * Zhejiang University, China(浙江大学)

AI总结 本文提出CG-MLLM,一种能实现3D描述和高分辨率3D生成的多模态大语言模型,通过混合Transformer架构分离不同建模需求,结合预训练视觉语言模型与专用3D VAE潜在空间,提升3D生成质量与感知能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15617 2026-05-18 cs.DC cs.AI

A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM

几块GPU,大量规模:PrismLLM实现忠实的LLM训练仿真

Shaoke Xi, ChonLam Lao, Boyi Jia, Jiaqi Gao, Zhipeng Zhang, Jiamin Cao, Brian Sutioso, Erci Xu, Minlan Yu, Kui Ren, Yong Li, Zhengping Qian, Ennan Zhai, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团) Harvard University(哈佛大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 PrismLLM通过切片方法构建高保真执行图,使工程师能用少量GPU模拟大规模训练行为,准确复现性能和内存表现,节省集群访问成本。

Comments 13 pages body, 21 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15597 2026-05-18 cs.CV cs.GR cs.LG cs.RO

CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage

CM-EVS:稀疏全景RGB-D-姿态数据用于完整场景覆盖

Jiale Liu, Jungang Li, Jieming Yu, Xinglin Yu, Zihao Dongfang, Zongjian Ding, Kaifeng Ding, Yi Yang, Lidong Chen, Yang Zou, Shunwen Bai, Jiahuan Zhang, Haoran Huang, Shan Huang, Yudong Gao, Mingjun Cheng

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Vorynel(沃伊内尔) Xinjiang University(新疆大学) Wuhan Polytechnic University(武汉职业技术学院) Tianjin University(天津大学)

AI总结 本文提出CM-EVS,通过COVER算法生成稀疏全景RGB-D-姿态数据,实现低冗余且可追溯的完整场景覆盖,提升3D学习的几何一致性。

Comments 35 pages including appendix. Code and dataset: https://github.com/Strange-animalss/CM-EVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02268 2026-05-18 cs.LG

SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization

SKILL0:基于上下文的代理强化学习用于技能内化

Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Meituan(美团) Tsinghua University(清华大学)

AI总结 SKILL0通过在训练时逐步减少技能上下文,使模型在无任务检索情况下实现自主行为,实验显示在多个任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09544 2026-05-18 cs.LG cs.CE cs.CV

Integrating chemical structures as treatments improves representations of microscopy images for morphological profiling

将化学结构作为治疗手段提高显微镜图像的表示以进行形态学分析

Yemin Yu, Emre Hayir, Neil Tenenholtz, Lester Mackey, Ying Wei, David Alvarez-Melis, Ava P. Amini, Alex X. Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Microsoft Research(微软研究院) Department of Computer Science, Zhejiang University(浙江大学计算机科学系)

AI总结 本文提出MICON框架,通过整合化学结构信息提升显微镜图像的表示能力,改进了形态学分析中的特征学习。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08300 2026-05-18 cs.CL cs.AI

Large Language Models Could Be Rote Learners

大语言模型可能只是机械学习者

Yuyang Xu, Renjun Hu, Haochao Ying, Jian Wu, Xing Shi, Wei Lin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices and TIDRI(血管植入设备国家重点实验室和TIDRI) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) School of Data Science of Engineering, East China Normal University(华东师范大学工程数据科学学院) Second Affiliated Hospital and Liangzhu Laboratory, Zhejiang University School of Medicine(浙江大学医学院第二附属医院和良渚实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文研究大语言模型在基准测试中的可靠性问题,提出TrinEval框架以区分真实能力学习与机械记忆,发现主流模型在知识点上依赖机械记忆的比例高达19.6%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11022 2026-05-18 cs.CL cs.AI

DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition

DynamicNER: 一种动态、多语言和细粒度的用于基于大语言模型的命名实体识别的数据集

Hanjun Luo, Yingbin Jin, Xinfeng Li, Xuecheng Liu, Ruizhe Chen, Tong Shang, Kun Wang, Qingsong Wen, Zuozhu Liu

机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technology University(南阳技术大学) University of Electronic Science and Technology of China(电子科技大学) Texas A&M University(德克萨斯大学) Squirrel AI

AI总结 本文提出DynamicNER数据集,用于改进基于大语言模型的命名实体识别方法,通过动态实体分类和多语言支持,提升模型泛化能力与细粒度任务的准确率。

Comments This paper is accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15155 2026-05-15 cs.LG cs.AI cs.CL

Self-Distilled Agentic Reinforcement Learning

自蒸馏代理强化学习

Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Meituan(美团) Tsinghua University(清华大学)

AI总结 本文提出SDAR方法,通过将OPSD作为辅助目标并保持RL为主优化,解决多轮代理中的稳定性问题,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14984 2026-05-15 cs.CV cs.AI

Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

Sat3DGen:从单张卫星图像生成全面的街景3D场景

Ming Qian, Zimin Xia, Changkun Liu, Shuailei Ma, Wen Wang, Zeran Ke, Bin Tan, Hang Zhang, Gui-Song Xia

机构 * LIESMARS & School of Artificial Intelligence, Wuhan University(珞珈实验室与武汉大学人工智能学院) EPFL(苏黎世联邦理工学院) HKUST(香港科技大学) Northeastern University(东北大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Amap, Alibaba Group(高德地图,阿里巴巴集团)

AI总结 本文提出Sat3DGen,通过几何优先方法提升从单张卫星图像生成高精度3D场景的性能,改进几何精度和真实感,并在新基准上验证其效果。

Comments ICLR 2026; code: https://github.com/qianmingduowan/Sat3DGen demo: https://huggingface.co/spaces/qian43/Sat3DGen project page: https://qianmingduowan.github.io/Sat3DGen_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13338 2026-05-15 cs.CR cs.AI

Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models

诱导过度思考:基于分层遗传算法的黑盒大语言推理模型DoS攻击

Shuqiang Wang, Wei Cao, Jiaqi Weng, Jialing Tao, Licheng Pan, Hui Xue, Zhixuan Chu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出一种基于分层遗传算法的黑盒攻击方法,通过系统扰动输入问题的逻辑结构,诱导大语言模型产生过度思考,从而引发资源耗尽攻击。

Comments Accepted at ICML 2026. Code available at: https://github.com/EndlessCao/Overthink-HGA

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05762 2026-05-15 cs.LG

BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning

BiTrajDiff: 用于离线强化学习的双向轨迹生成扩散模型

Yunpeng Qing, Yixiao Chi, Shuo Chen, Shunyu Liu, Kexuan Zhou, Sixu Lin, Litao Liu, Changqing Zou

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江省实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学) Rutgers University(罗格斯大学)

AI总结 本文提出BiTrajDiff,通过双向扩散模型生成轨迹,解决离线强化学习中数据分布偏差问题,提升数据集多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14587 2026-05-15 cs.LG cs.AI cs.CR

Angel or Demon: Investigating the Plasticity Interventions' Impact on Backdoor Threats in Deep Reinforcement Learning

天使或恶魔:探讨塑性干预对深度强化学习中后门威胁的影响

Oubo Ma, Ruixiao Lin, Yang Dai, Jiahao Chen, Chunyi Zhou, Linkang Du, Shouling Ji

机构 * Zhejiang University(浙江大学) National University of Defense Technology(国防科技大学) Xi'an Jiaotong University(西安交通大学)

AI总结 研究通过分析14664个案例,发现仅有一种干预(SAM)加剧了后门威胁,其他干预则缓解了威胁,提出新的稳健后门注入框架和异常损失景观尖锐度作为检测指标。

Comments To appear in the Forty-Third International Conference on Machine Learning (ICML 2026), July 6-11, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14546 2026-05-15 cs.LG

Discovering Physical Directions in Weight Space: Composing Neural PDE Experts

在权重空间中发现物理方向:组合神经PDE专家

Pengkai Wang, Pengwei Liu, Yuanyi Wang, Guanyu Chen, Xingyu Ren, Xiaolong Li, Zhongkai Hao, Yuting Kong, Qixin Zhang, Dong Ni

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 本文研究了神经PDE专家在连续物理家族中多模式微调后的权重空间更新性质,提出CCM方法通过物理方向整合专家模型,提升跨物理域的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09304 2026-05-15 cs.CV

GeRM: A Generative Rendering Model From Physically Realistic to Photorealistic

GeRM:从物理真实到照片级的生成渲染模型

Jiayuan Lu, Rengan Xie, Xuancheng Jin, Zhizhen Wu, Qi Ye, Tian Xie, Hujun Bao, Rui Wang. Yuchi Huo

机构 * State Key Lab of CAD\&CG, Zhejiang University Zhejiang Lab China State Key Laboratory of Industrial Control Technology, Zhejiang University China Zhejiang University China Zhejiang Lab State Key Laboratory of Industrial Control Technology, Zhejiang University Zhejiang University

AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00574 2026-05-15 cs.CV cs.AI

Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation

解耦稳定性与可塑性以实现多模态测试时适应

Yongbo He, Zirun Guo, Tao Jin

机构 * Zhejiang University(浙江大学)

AI总结 本文提出DASP框架,通过解耦多模态测试时适应中的稳定性与可塑性,解决现有方法在无偏模态中的负迁移和有偏模态中的灾难性遗忘问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01172 2026-05-15 cs.CL

Energy-Regularized Sequential Model Editing on Hyperspheres

超球面能量正则化的序列模型编辑

Qingyuan Liu, Jia-Chen Gu, Yunzhi Yao, Hong Wang, Nanyun Peng

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出SPHERE方法,通过超球面能量正则化提升模型在序列编辑中的稳定性与知识保留能力,实验表明其在编辑性能上优于基线方法16.41%。

Comments Accepted by ICLR 2026. The code is available at https://github.com/PlusLabNLP/SPHERE. Project page: https://www.qingyuanliu.net/sphere_projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14089 2026-05-15 cs.AI

SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

SkillFlow: 以流程驱动的递归技能进化用于代理编排

Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 SkillFlow通过流程驱动的递归技能进化解决代理编排中的策略崩溃、梯度方差高和无指导技能进化问题,实现高效任务编排。

Comments 49 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13932 2026-05-15 cs.LG

Rethinking Molecular OOD Generalization via Target-Aware Source Selection

重新思考分子OOD泛化 via 目标感知源选择

Zhuohao Lin, Kun Li, Jiameng Chen, Jiajun Yu, Duanhua Cao, Yizhen Zheng, Wenbin Hu

机构 * Department of Data Science and Artificial Intelligence, Monash University(墨尔本大学数据科学与人工智能系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Life Sciences and Technology, Tongji University(同济大学生命科学与技术学院)

AI总结 本文提出SCOPE-BENCH和POMA框架,通过集群级分区和多源适应策略提升分子在极端OOD场景下的预测鲁棒性,实验显示SOTA模型误差显著增加,而POMA在不同架构上实现平均6.2%的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13855 2026-05-15 cs.GR cs.AI cs.CV

SparseOIT: Improving Order-Independent Transparency 3DGS via Active Set Method

SparseOIT:通过主动集方法改进Order-Independent Transparency 3DGS

Wentao Yang, Fanzhen Kong, Zejian Kang, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

AI总结 本文提出SparseOIT,通过主动集方法利用3DGS渲染方程中稀疏变量依赖性,提升Order-Independent Transparency效果,优于现有方法并达到体积渲染方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07931 2026-05-15 cs.CV cs.AI

One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy

每帧一个令牌:重新考虑世界模型中的视觉带宽

Zuojin Tang, Shengchao Yuan, Xiaoxin Bai, Zhiyuan Jing, De Ma, Gang Pan, Bin Liu

机构 * Zhejiang University(浙江大学) Central South University(中南大学) Harbin Institute of Technology(哈尔滨工业大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)

AI总结 本文提出OneWM-VLA,通过自适应注意力池化将每帧视图压缩为一个语义令牌,以单一流匹配目标生成潜在流和动作轨迹,从而减少每帧视觉带宽而不影响长视界性能。

详情

展开后加载摘要…

URL PDF HTML 收藏