arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2602.04672 2026-06-02 cs.CV cs.GR cs.RO

AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation

AGILE: 通过代理生成从视频重建手-物体交互

Jin-Chuan Shi, Binhong Ye, Tao Liu, Junzhe He, Yangjinhui Xu, Xiaoyang Liu, Zeju Li, Hao Chen, Chunhua Shen

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学)

AI总结 提出AGILE框架,利用视觉语言模型引导生成完整物体网格,结合锚定-跟踪策略和接触感知优化,从单目视频鲁棒重建手-物体交互,生成可直接用于仿真的资产。

Comments 16 pages, SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23593 2026-06-02 cs.AI

When AI reviews science: Can we trust the referee?

当AI评审科学:我们能信任审稿人吗?

Jialiang Wang, Yuchen Liu, Hang Xu, Kaichun Hu, Shimin Di, Wangze Ni, Linan Yue, Min-Ling Zhang, Kui Ren, Lei Chen

机构 * School of Electronic Engineering, Southeast University(东南大学电子工程学院) Zhejiang University(浙江大学)

AI总结 针对AI审稿的安全性和可靠性问题,本文通过分类攻击类型并实验验证声望框架、断言强度、反驳谄媚和上下文投毒对评分的影响,为评估AI同行评审的可靠性提供基线。

Journal ref The Innovation Informatics 2:100030 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07967 2026-06-02 cs.CL cs.AI

AtomEval: Validity-Aware Atomic Evaluation of Adversarial Claim Rewriting in Fact Verification

AtomEval: 事实核查中对抗性声明重写的有效性感知原子评估

Hongyi Cen, Mingxin Wang, Yule Liu, Jingyi Zheng, Hanze Jia, Tan Tang

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出AtomEval协议,通过原子分解和保留门控,区分有效规避验证与改变命题的重写,并引入VASR指标,解决传统ASR膨胀问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11424 2026-06-02 cs.CL

Bridging What the Model Thinks and How It Speaks: Expressive Speech Generation via Self-Aware Intent-Realization Alignment

弥合模型所想与所言之间的鸿沟:通过自我意识意图-实现对齐的富有表现力的语音生成

Kuang Wang, Lai Wei, Ping Lin, Qibing Bai, Wenkai Fang, Li Zhou, Feng Jiang, Zhongjie Jiang, Jun Huang, Yannan Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tencent Ethereal Audio Lab(腾讯虚实音频实验室) Southeast University(东南大学) Zhejiang University(浙江大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 提出SASLM框架,通过自蒸馏意图和自奖励优化,无需外部标注即可弥合语义理解与声学实现之间的差距,实现富有表现力的语音生成。

Comments Submitted to EMNLP 2026. Project page: https://wangkevin02.github.io/SASLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06995 2026-06-02 cs.AI

What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning

屏幕到动作中缺失了什么?面向多模态GUI推理的UI-in-the-Loop范式

Songze Li, Xiaoke Guo, Tianqi Liu, Biao Yi, Zhaoyan Gong, Zhiqiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室)

AI总结 提出UI-in-the-Loop (UILoop) 范式,通过循环的屏幕-UI元素-动作过程,让多模态大模型显式学习UI元素的定位、语义和用法,实现可解释推理,并在UI理解任务上达到最优。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14771 2026-06-02 cs.AI

OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligence

OpenHospital: 一个用于进化和基准测试基于LLM的集体智能的物自体竞技场

Peigen Liu, Rui Ding, Yuren Mao, Ziyan Jiang, Yuxiang Ye, Yunjun Gao, Ying Zhang, Renjie Sun, Longbin Lai, Zhengping Qian

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, Zhejiang Gongshang University(浙江工商大学共同富裕统计监测与智能治理实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Alibaba Cloud(阿里云)

AI总结 提出OpenHospital交互式竞技场,通过医生代理与患者代理的互动进化集体智能,采用数据在代理自身范式快速提升能力并提供医学熟练度和系统效率的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00171 2026-06-02 cs.CV cs.AI

LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models

LookWise: 知道何时何地关注多模态大语言模型中的细粒度视觉推理

Yuxiang Shen, Hailong Huang, Zhenkun Gao, Xueheng Li, Man Zhou, Chengjun Xie, Haoxuan Che, Xuanhua He, Jie Zhang

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出LookWise框架,通过置信度模块和语义引导定位模块实现自适应视觉推理,无需额外训练即可提升细粒度推理精度并加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03202 2026-06-02 cs.CL

Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?

Code2Math:你的代码智能体能否通过探索有效演化数学问题?

Dadi Guo, Yuejin Xie, Qingyu Liu, Weixian Huang, Jiayu Liu, Zhiyuan Fan, Qihan Ren, Shuai Shao, Tianyi Zhou, Jianjie Feng, Wenze Su, Yujiu Yang, Dongrui Liu, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Nanjing Tech University(南京工业大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学) Independent Researcher(独立研究者)

AI总结 本文提出一个多智能体框架,利用代码智能体通过探索将现有数学问题自主演化为更复杂、更困难的变体,并验证其可解性和难度提升。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17706 2026-06-02 cs.LG

Parallel Complex Diffusion for Scalable Time Series Generation

并行复数扩散用于可扩展时间序列生成

Rongyao Cai, Yuxi Wan, Kexin Zhang, Ming Jin, Zhiqiang Ge, Qingsong Wen, Yong Liu

机构 * Institute of Cyber-Systems and Control(网络系统与控制研究所) Zhejiang University(浙江大学) Griffith University(格里菲斯大学) School of Mathematics(数学学院) Southeast University(东南大学) Squirrel Ai Learning

AI总结 提出PaCoDi(并行复数扩散)框架,通过离散傅里叶变换将时间序列分解到谱域,利用并行实值估计器替代复数估计器,解决时间序列生成中的纠缠问题,理论证明谱高斯噪声的正交性,并引入平均场理论近似处理边缘耦合,在无条件和条件生成任务中优于5个基线。

Comments Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26). Extended Version with Full Proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10623 2026-06-02 cs.LG cs.AI

Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

通过贝叶斯非负奖励建模缓解RLHF中的奖励黑客

Zhibin Duan, Guowei Rong, Zhuo Li, Bo Chen, Mingyuan Zhou, Dandan Guo

机构 * Zhejiang University(浙江大学)

AI总结 提出贝叶斯非负奖励模型(BNRM),通过非负因子分析和变分推断,在Bradley-Terry偏好模型中实现解耦与去偏,有效缓解奖励过度优化,提升鲁棒性和可解释性。

Comments Accepted as an Oral presentation at ICML 2026. The code is available at https://github.com/GuoweiRong/Bayesian-Non-negative-Reward-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00753 2026-06-02 math.OC cs.LG

Mirror Descent Under Generalized Smoothness

广义光滑性下的镜像下降

Dingzhi Yu, Wei Jiang, Hongyi Tao, Yuanyu Wan, Lijun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文提出一种新的 $\ell_*$-光滑性概念,将经典光滑性推广到一般范数空间,并证明镜像下降类算法在此条件下收敛率与经典光滑性一致。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08948 2026-06-02 cs.IR cs.AI

SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management

SHERLOCK:面向LLM增强电商风险管理的动态知识适应

Nan Lu, Yurong Hu, Jiaquan Fang, Yan Liu, Rui Dong, Yiming Wang, Rui Lin, Shaoyi Xu

机构 * Beijing Jiaotong University(北京交通大学) JD.com(京东公司) Southeast University(东南大学) Zhejiang University(浙江大学)

AI总结 提出Sherlock框架,通过构建领域知识库、两阶段检索增强生成和自演化数据飞轮,将结构化知识与LLM推理结合,提升电商风险案例调查的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06448 2026-06-02 cs.LG cs.AI

Principle-Evolvable Scientific Discovery via Uncertainty Minimization

通过不确定性最小化实现原理可演化的科学发现

Yingming Pu, Tao Lin, Hongyu Chen

机构 * Westlake University(西lake大学) Zhejiang University(浙江大学)

AI总结 提出PiEvo框架,将科学发现视为原理空间上的贝叶斯优化,通过信息导向假设选择与异常驱动增强机制,使智能体自主演化理论世界观,在四个基准上平均解质量达90.81%~93.15%,收敛速度提升83.3%。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)

Journal ref Proc. 43rd Intl. Conf. on Machine Learning (ICML 2026), PMLR 306

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03203 2026-06-02 cs.CL cs.LG

ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution

ForesightKV: 通过学习长期贡献优化推理模型的KV缓存驱逐

Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao

机构 * Zhejiang University(浙江大学)

AI总结 提出ForesightKV框架,通过监督学习和强化学习预测KV对在长文本生成中的重要性,在仅用一半缓存预算下优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22965 2026-06-02 cs.RO

Self-Imitated Diffusion Policy for Efficient and Robust Visual Navigation

自模仿扩散策略用于高效鲁棒的视觉导航

Runhua Zhang, Junyi Hou, Changxu Cheng, Qiyi Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi Technology Co., Ltd.(Uni-Ubi技术有限公司) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

AI总结 提出自模仿扩散策略(SIDP),通过奖励引导的自模仿机制和课程学习范式,减少对大量采样和后过滤的依赖,实现高效鲁棒的视觉导航。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17502 2026-06-02 cs.RO

RynnVLA-002: A Unified Vision-Language-Action and World Model

RynnVLA-002: 统一的视觉-语言-动作与世界模型

Jun Cen, Siteng Huang, Yuqian Yuan, Kehan Li, Hangjie Yuan, Chaohui Yu, Bohan Hou, Yuming Jiang, Jiayan Guo, Xin Li, Hao Luo, Fan Wang, Deli Zhao, Hao Chen

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学)

AI总结 提出统一视觉-语言-动作(VLA)与世界模型的框架RynnVLA-002,通过联合学习环境动态和动作规划,在仿真和真实机器人任务中显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07910 2026-06-02 cs.CL

Last Layer Logits to Logic: Empowering LLMs with Logic-Consistent Structured Knowledge Reasoning

最后一层逻辑到逻辑:赋予LLM逻辑一致的结构化知识推理能力

Songze Li, Zhiqiang Liu, Zhaoyan Gong, Xiaoke Guo, Zhongpu Bo, Zhengke Gui, Lei Liang, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 针对LLM在结构化知识推理中的逻辑漂移问题,提出Logits-to-Logic框架,通过logits增强和过滤模块修正输出逻辑缺陷,在多个KGQA基准上取得最佳性能。

Comments EMNLP 2026 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17320 2026-06-02 cs.LG

AdaptiveK: Complexity-Driven Sparse Autoencoders for Interpretable Language Model Representations

AdaptiveK:基于复杂度的稀疏自编码器用于可解释的语言模型表示

Yifei Yao, Hanrong Zhang, Mengnan Du

机构 * Zhejiang University(浙江大学) University of Illinois Chicago(伊利诺伊大学香槟分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出 AdaptiveK SAE,根据输入语义复杂度动态调整稀疏度,利用线性探针引导特征分配,在重构保真度、解释方差、余弦相似度和可解释性指标上优于固定稀疏度方法。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15234 2026-06-02 cs.CV

Exploring the Capabilities of Large Language Model Encoders for Image-Text Retrieval in Chest X-rays

探索大语言模型编码器在胸部X光片图像-文本检索中的能力

Hanbin Ko, Gihun Cho, Inhyeok Baek, Donguk Kim, Joonbeom Koo, Changi Kim, Dongheon Lee, Chang Min Park

机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(生物工程跨学科项目,首尔国立大学研究生院) Integrated Major in Innovative Medical Science, Seoul National University Graduate School(创新医学科学整合专业,首尔国立大学研究生院) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第一附属医院放射科) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院放射科,首尔国立大学医院) Institute of Medical and Biological Engineering, Seoul National University Medical Research Center(医学与生物工程研究所,首尔国立大学医学研究所以及) Institute of Radiation Medicine, Seoul National University Medical Research Center(放射医学研究所,首尔国立大学医学研究所以及)

AI总结 提出一种领域自适应的双向大语言模型文本编码器,通过掩码标记预测和监督对比学习训练,结合参数高效的双塔对比视觉语言框架,提升胸部X光片图像与文本的对齐和检索性能。

Comments 12 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19191 2026-06-02 cs.RO

RCM-ACT: Imitation Learning with Dynamic RCM Calibration for Autonomous Intraocular Foreign Body Removal

RCM-ACT: 基于动态RCM校准的模仿学习用于自主眼内异物取出

Yue Wang, Wenjie Deng, Haotian Xue, Di Cui, Yiqi Chen, Mingchuan Zhou, Haochao Ying, Jian Wu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第二附属医院血管植入设备国家重点实验室) Dessight Biomedical(Dessight生物医学公司) Center for Rehabilitation Medicine, Department of Ophthalmology, Zhejiang Provincial People’s Hospital(浙江省人民医院康复医学中心、眼科部门) School of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) School of Public Health and Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院公共卫生学院及第二附属医院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital and School of Public Health, Zhejiang University School of Medicine(浙江大学医学院第二附属医院及公共卫生学院血管植入设备国家重点实验室) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

AI总结 提出RCM-ACT模仿学习框架,通过动态RCM校准和动作分块变换器解决眼内手术中的运动学不确定性,实现自主环抓取与定位,平均3D抓取偏差0.686 mm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02511 2026-06-02 cs.AI cs.MA

Stop Wandering, Find the Keys: LLMs Discriminate Key States for Efficient Multi-Agent Exploration

停止徘徊,找到关键:LLMs 辨别关键状态以实现高效多智能体探索

Yun Qu, Boyuan Wang, Yuhang Jiang, Jianzhun Shao, Yixiu Mao, Heming Zou, Chang Liu, Cheems Wang, Meiqin Liu, Xiangyang Ji

机构 * Department of Automation, Tsinghua University, Beijing 100084, China(清华大学自动化系) College of Electrical Engineering, Zhejiang University, Hangzhou 310027, China(浙江大学电气工程学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学人机混合增强智能国家级重点实验室)

AI总结 提出 LEMAE 方法,利用大语言模型辨别关键状态并设计子空间内在奖励和关键状态记忆树,引导多智能体高效探索,在 SMAC 和 MPE 基准上显著超越现有方法,实现 10 倍加速。

Journal ref SCIENCE CHINA Information Sciences 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31365 2026-06-01 cs.AI

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

学习适应:通过认知感知探索实现自我改进的网络智能体

Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang

机构 * Zhejiang University(浙江大学)

AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31073 2026-06-01 cs.CL

ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails

ConsisGuard:在LLM护栏中对齐安全审议与策略执行

Yan Wang, Zhixuan Chu, Zihao Xue, Zhen Bi, Bingyu Zhu, YueFeng Chen, Zeyu Yang, Jungang Lou, Longtao Huang, Ningyu Zhang, Kui Ren, Hui Xue

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Huzhou Normal University(湖州师范学院) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)

AI总结 提出ConsisGuard框架,通过策略到决策轨迹蒸馏和功能耦合对齐,解决基于推理的LLM护栏中审议与执行之间的不一致问题,提升安全检测性能并减少策略执行失败。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30940 2026-06-01 eess.AS cs.MM cs.SD

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

面向流式同步空间音频生成的自回归扩散Transformer

Ke Lei, Yu Zhang, Changhao Pan, Xueyi Pu, Wenxiang Guo, Ruiqi Li, Zhou Zhao

机构 * Zhejiang University, China(浙江大学)

AI总结 提出SwanSphere统一流式框架,通过因果自回归扩散Transformer、空间视频-音频对比学习及多目标在线直接偏好优化,实现从全景视频和文本提示生成高保真空间音频,并开发自动化标注管道缓解数据稀缺。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30912 2026-06-01 cs.CV cs.CL

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

关注证据:面向多模态RLVR的证据锚定空间注意力监督

Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Nankai University(南开大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30904 2026-06-01 cs.CV

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

MergeTok: 通过令牌合并实现统一连续和离散视觉令牌化

Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) OPPO Shanghai AI Lab(上海人工智能实验室)

AI总结 提出MergeTok统一令牌化器,通过令牌合并技术联合优化连续VAE和离散VQ令牌化器,实现高保真重建与语义可控离散表示的兼顾。

Comments 11 pages (main text), 7 figures. Preprint. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30898 2026-06-01 cs.AI cs.CL

UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling

UniScale: 通过模型路由和测试时扩展的在线联合优化实现自适应统一推理扩展

Kaiyu Huang, Xingyu Wang, Mingze Kong, Zhubo Shi, Yuqian Hou, Hong Xu, Zhongxiang Dai, Minchen Yu, Qingjiang Shi

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)大数据研究院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Department of Computer Science and Engineering, Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 提出UniScale框架,将模型路由和测试时扩展统一为上下文多臂老虎机问题,通过LinUCB在线学习推理策略,实现细粒度且更优的质量-成本权衡。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30770 2026-06-01 cs.RO

SSR: Scaling Surefooted and Symmetric Humanoid Traversal to the Open World

SSR:将稳健且对称的人形穿越扩展到开放世界

Ruiqi Yu, Yiwen Wang, Yuan Hao, Jun WU, Qiuguo Zhu

机构 * Zhejiang University(浙江大学)

AI总结 提出SSR框架,通过引入想象落脚点引导、等变潜在空间对称增强和地形特定多判别器运动先验,实现基于视觉的人形机器人在开放世界中的安全稳定穿越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30434 2026-06-01 cs.LG cs.AI cs.CL cs.MA

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis

LongDS-Bench:关于长周期智能数据分析的失败

Kewei Xu, Xiaoben Lu, Shuofei Qiao, Zihan Ding, Haoming Xu, Lei Liang, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

AI总结 提出LongDS基准,用于评估长周期多轮数据分析中智能体维护和更新分析状态的能力,发现最佳模型平均准确率仅48.45%,且长周期错误占失败原因的52%-69%。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏