arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 410
2608.04333 2026-08-06 cs.LG 新提交

Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation

成本感知多目标老虎机:理论及在预算约束下的大语言模型配置评估中的应用

Bo Xue, Zhi Hong, Jiayi Li, Yuanyu Wan, Ji Cheng, Shuang Qiu

机构 * City University of Hong Kong(香港城市大学) South China University of Technology(华南理工大学) Zhejiang University(浙江大学)

AI总结 本文将LLM配置评估建模为成本感知多目标老虎机问题,提出基于超体积的UCB算法与成本感知经验差距消除算法,在有限预算下实现高效在线决策和准确的帕累托识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04156 2026-08-06 cs.AI cs.LG 新提交

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

BrainBench:面向全面脑电理解的大语言模型基准测试

Yangxuan Zhou, Sha Zhao, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan

机构 * Zhejiang University(浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。

Comments 42pages,22pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02502 2026-08-04 cs.AI 新提交

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

CMuon:通过分块动量正交化加速并稳定扩散Transformer的训练

Chuyan Chen, Peng Sun, Kun Yuan

机构 * Peking University(北京大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

AI总结 针对扩散Transformer训练计算成本高、普通Muon优化器存在后期收敛问题的瓶颈,提出CMuon策略,通过分块权重实现训练加速与收敛优化,在ImageNet 256上200个epoch达FID1.18,训练速度超AdamW2倍

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02129 2026-08-04 cs.CV 新提交

PromptPath: Prompt-Adaptive Computational Pathways for In-Context Learning

PromptPath:用于上下文学习的提示自适应计算路径

Hangrui Zhang, Feifei Shao, Yawei Luo, Ping Liu, Jiaxiang Liu, Zuoqi Tang, Zhao Wang, Hongwei Wang, Jun Xiao

机构 * Zhejiang University(浙江大学) University of Nevada, Reno(内华达大学雷诺分校) Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院)

AI总结 该研究针对现有ICL方法的浅层任务适配问题,提出PromptPath框架,通过提示驱动的路由机制动态重构模型计算,在视觉识别基准上性能优于现有ICL基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02109 2026-08-04 cs.CV 新提交

Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

相同语义,不同路径:面向视觉-文本压缩的自改进对齐

Tianyu Liang, Xiangxi Zheng, Yilin Wang, Dongxing Mao

机构 * Southeast University(东南大学) Nanjing University(南京大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对视觉-文本压缩中渲染图像与原生文本表示的跨路径不一致瓶颈,提出自监督对齐框架SPIRAL,通过令牌级OPD与序列级DPO提升模型性能,在VTCBench上显著改善Qwen3-VL-8B的表现并实现域外泛化。

Comments Accepted to ACM Multimedia 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02032 2026-08-04 cs.LG 新提交

DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling

DART:用于高效长上下文序列建模的循环状态解码注意力

Yixiao Qian, Song Chen, Pengkai Wang, Jiaxu Liu, Shengze Cai, Chao Xu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) School of Science, Huzhou Normal University(湖州师范学院理学院)

AI总结 DART基于Mamba-2的状态空间对偶性,通过保留分块状态记忆并解码键值执行状态-记忆注意力,减少长上下文推理缓存,同时提升关联召回与检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01767 2026-08-04 cs.AI 新提交

Leveraging AI for fine-grained food safety risk forecasting in sparse data conditions

利用人工智能在稀疏数据条件下进行细粒度食品安全风险预测

Dongqi Wang, Weiwei Chen, Han Zhou, Weihua Zhou

机构 * Zhejiang University(浙江大学) Rutgers University(罗格斯大学)

AI总结 该研究提出基于Transformer的框架,整合多类数据与Wilson区间预训练,在稀疏数据下细粒度预测城市食品安全风险,实验及浙江实地测试显示其性能优于基线,可提升检测率与检查资源分配效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01636 2026-08-04 cs.RO 新提交

A Forward-Inverse Dynamic Game Framework for Enhanced Multi-Agent Trajectory Planning

用于增强多智能体轨迹规划的前向-逆向动态博弈框架

Tianle Liu, Youcheng Niu, Jing Zeng, Shuo Li, Jinming Xu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

AI总结 针对多智能体轨迹规划的动态博弈方法局限,本文提出带状态依赖权重的KL正则化动态博弈及上下文感知逆向博弈模块,经模拟与多机器人实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01314 2026-08-04 cs.CV 新提交

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1:通过强化学习缓解长上下文视觉遗忘

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01053 2026-08-04 cs.CV 新提交

Struct-GStream: Towards Efficient Free-Viewpoint Video Streaming at Low-Bitrates with Structured 3D Gaussians

Struct-GStream:基于结构化3D高斯的低码率高效自由视点视频流技术

Han Jiao, Jiakai Sun, Lei Zhao, Wei Xing, Huaizhong Lin, Zhanjie Zhang, Ao Ma

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Chinese Academy of Sciences(中国科学院) University of Science and Technology Beijing(北京科技大学)

AI总结 本文针对现有自由视点视频在线训练方法存储与训练时间不足的问题,提出Struct-GStream,通过结构化3D高斯等技术实现低码率下的高效视频流,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00663 2026-08-04 cs.CV 新提交

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成

Chenggong Hu, Shaoyin Ma, Yi Wang, Li Sun, Mingli Song, Jie Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00622 2026-08-04 cs.CL 新提交

A Heuristic Perspective on Debiasing Language Models

语言模型去偏的启发式视角

Tian Lan, Yemin Wang, Chuancheng Shi, Xiangyu Wu, Zesheng Shi, Yuan Wang, Jiang Li, Guanglai Gao, Xiangdong Su

机构 * Inner Mongolia University(内蒙古大学) Xiamen University(厦门大学) University of Sydney(悉尼大学) Nanjing University of Science and Technology(南京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Zhejiang University(浙江大学)

AI总结 该研究针对现有语言模型去偏方法的局限,提出HEIMAT启发式自动去偏框架,经实验验证其可在保留NLU性能的同时有效缓解不同文化下的模型偏见。

Comments 13 pages in total, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00502 2026-08-04 cs.CV 新提交

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29531 2026-08-03 cs.CV q-bio.NC 新提交

Multi-Source Multi-View Graph Domain Adaptation with Hyperbolic Residual Encoding for Cross-Site MDD Identification from rs-fMRI

基于双曲残差编码的多源多视图图域适应用于跨站点静息态fMRI的重度抑郁症识别

Zhanpeng Zheng, Xiran Chen, Haiteng Jiang, Renjie Tian, Qinyu Cai, Jiexi Liu, Xiaofeng Chen, Weikai Li, Yansu Wang

机构 * School of Computer and Artificial Intelligence, Shandong Jianzhu University(山东建筑大学计算机与人工智能学院) Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China(电子科技大学基础与前沿研究院) School of Mathematics and Statistics, Chongqing Jiaotong University(重庆交通大学数学与统计学院) State Key Laboratory of Brain-machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) Institute of Computer Vision and Traffic Image Understanding, School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院计算机视觉与交通图像理解研究所) School of Life Sciences, Westlake University(西湖大学生命科学学院) School of Computer and Artificial Intelligence, Nanjing University of Finance and Economics(南京财经大学计算机与人工智能学院)

AI总结 该研究针对跨站点rs-fMRI的MDD识别难题,提出结合双曲残差编码、双流自适应融合及类别级对齐的多源多视图图域适应框架,在七个目标域取得73.60%平均准确率,实现有效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28678 2026-08-03 cs.AI cs.CV 新提交

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE:为长视频理解构建自修正记忆

Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

机构 * Zhejiang University(浙江大学) Xidian University(西安电子科技大学)

AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。

Comments Accept by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28590 2026-07-31 cs.CV cs.CL 新提交

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

VAD:为多模态在线策略蒸馏中的目标重建归因视觉证据

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Southeast University(东南大学)

AI总结 该研究提出视觉归因蒸馏(VAD)算法,通过反事实目标重建分离教师校正中的视觉证据分量,在6个4B/9B规模的细粒度视觉基准上,性能优于现有蒸馏方法。

Comments The project is accessible at https://github.com/DeepExperience/VAD_Multimodal_OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28565 2026-07-31 cs.CV 新提交

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28466 2026-07-31 cs.AI 新提交

A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports

基于28万份常规报告的肠镜报告驱动的视觉-语言基础模型

Jia Yu, Yan Zhu, Yili He, Zilong Wang, Xinyang Jiang, Peiyao Fu, Ruijie Yang, Tianyi Chen, Siyuan Li, Zhihua Wang, Fei Wu, Quanlin Li, Xian Yang, Pinghong Zhou, Shuo Wang

机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Shanghai Collaborative Innovation Center of Endoscopy(上海内镜诊疗协同创新中心) Zhejiang University(浙江大学) Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院) Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学研究所) Microsoft Research Asia(微软亚洲研究院)

AI总结 该研究开发了肠镜视觉-语言基础模型EndoCLIP,利用28万份常规肠镜记录恢复的图像-文本对训练,在多项任务中优于通用模型,良恶性分类性能接近专家,可实现临床目标的语言指定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28421 2026-07-31 cs.AI 新提交

When Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability Evidence

当派生测量值产生误导时:利用特权模态可靠性证据量化并缓解大语言模型的过度信任问题

Zongheng Guo, Tao Chen, Tianli Li, Mingzhe Cui, Yang Jiao, Lei Xie, Yi Pan, Xiao Hu, Manuela Ferrario

机构 * Politecnico di Milano(米兰理工大学) Zhejiang University(浙江大学) China-Japan Friendship Hospital(中日友好医院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Emory University(埃默里大学)

AI总结 该研究定义了派生特征过度信任(DFOT)问题,构建了量化该问题的估计量框架,在PPG-ECG数据集上验证了基于特权蒸馏的基线方法可缓解DFOT,为相关研究提供通用评估目标。

Comments 25 pages, including references and supplementary material; 3 figures and 19 tables. Code: https://github.com/Zongheng-Guo/When-Derived-Measurements-Mislead

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27379 2026-07-31 cs.CL 新提交

HSS-Synth: Humanities and Social Sciences Data Synthesis for LLMs

HSS-Synth:面向大语言模型的人文社科数据合成

Ru Peng, Tianyu Zhao, Xijun Gu, Zhiting Fan, Haokai Xu, Jinyang Zhang, Yawen Zeng, Yihong Zhuang, Kexin Yang, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Zhejiang University(浙江大学) Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) Peking University(北京大学) Qwen Team, Alibaba Group(阿里巴巴集团通义千问团队)

AI总结 本文针对LLM的HSS数据稀缺问题,提出以学科为中心的HSS-Synth流水线,生成23.7万指令微调样本,使Qwen3-8B-Base达SOTA并提升相关能力。

Comments ACL Findings 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27130 2026-07-30 cs.AI 新提交

AgentMap: Joint Equivalence and Subsumption Discovery for Ontology Matching

AgentMap:用于本体匹配的联合等价与包含关系发现

Yiping Song, Jiaoyan Chen, Renate Schmidt, Hui Yang, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

AI总结 本文提出统一等价与包含发现的混合本体匹配任务,构建基于LLM的多智能体框架AgentMap,在三类设置下的本体匹配任务中均取得优异性能。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26784 2026-07-30 cs.LG cs.AI 新提交

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise:面向跨任务技能演化的智能体强化学习

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

AI总结 SkillRise是跨任务学习技能的统一强化学习框架,解耦信用分配机制实现任务求解与技能整理,在多基准上Pass@1性能优于基线,还降低了运行开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26627 2026-07-30 cs.CL 新提交

Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes

重新审视推测解码中的有损验证:机制、权衡与失效模式

Tianyu Wang, Yuxuan Zhou, Wenbin Wang, Heng Li, Zikai Xiao, Junyuan Shang

机构 * Independent Researcher(独立研究者) Baidu Inc.(百度公司) Zhejiang University(浙江大学)

AI总结 本研究分析有损推测解码的机制与失效模式,将其分为两类并构建评估框架,发现基于截断的有损方法会因分布失真致性能下降,协作类需控制概率超调以保障生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26057 2026-07-29 cs.CL cs.AI 新提交

Pass the Baton: Trajectory-Relayed On-Policy Distillation

传递接力棒:轨迹中继的在线策略蒸馏

Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 研究针对在线策略蒸馏的前缀失败问题,利用师生延续不对称性提出Relay-OPD方法,通过教师在触发点接管生成轨迹段,让学生在其上优化,在数学推理基准测试中取得优异成绩,提升效果并减少训练轨迹长度。

Comments Project Page: https://zju-real.github.io/Relay-OPD Code: https://github.com/zju-real/Relay-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26056 2026-07-29 cs.RO 新提交

INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models

INTACT:用于无搜索世界模型的同构意图到动作学习

Junhan Sun, Hao Zhao, Guofeng Zhang

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) InSpatio

AI总结 研究针对前向潜在世界模型恢复动作需昂贵搜索的问题,提出INTACT方法,通过特定架构和技术实现意图到动作学习,在多任务上取得高成功率,减少采样并提升性能,还具有快速推理能力。

Comments 28 pages, 11 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25669 2026-07-29 cs.AI 新提交

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

OmniDelta:用于OmniLLMs中令牌压缩的技能驱动预算分配

Haoyang Huang, Wenjie Huang, Tianqi Xu, Hongyaoxing Gu, Kang Tan, Yikai Fu, Yuhao Shen, Tianyu Liu, Baolin Zhang, Jun Zhang, Xinyi Hu, Jun Dai, Shuang Ge, Lei Chen, Yue Li, Mingchen Wang, Meng Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Alibaba(阿里巴巴)

AI总结 研究针对OmniLLMs长音频-视频令牌序列成本高的问题,提出技能驱动的OmniDelta框架,通过构建技能池、结合意图与内容感知分配预算,能与现有策略结合,实验证明其在多个基准上建立新的准确性-效率前沿,减少内存并加速推理。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏